Aller au contenu principal

Dossier Figure — page 5

646 articles · page 5 sur 13

Figure, le constructeur de robots humanoïdes le plus capitalisé : Figure 02 et 03, modèle Helix VLA, déploiements BMW, partenariats avec OpenAI puis indépendance.

LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)
201Pandaily IA physiqueActu

LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)

Ant Group, via sa division robotique LingBot, a dévoilé LingBot-Depth 2.0, un modèle de perception spatiale construit sur un nouveau modèle de vision baptisé LingBot-Vision, présenté comme le premier modèle de fondation vision nativement conçu pour la perception spatiale en IA incarnée. L'entreprise revendique douze résultats inédits sur des benchmarks publics et privés, une affirmation à prendre avec précaution puisqu'elle émane de son propre communiqué. Avec environ 1,1 milliard de paramètres, soit environ un septième des 7 milliards de DINOv3 de Meta, et moins d'un tiers de son volume d'entraînement, LingBot-Vision affirme surpasser DINOv3 sur le benchmark d'estimation de profondeur NYUv2. Le modèle cible trois défauts classiques de l'estimation de profondeur: le flou des contours, la détection des petits objets et le bruit sur les longues distances. LingBot-Depth 2.0 revendique une clarté de contours suffisante pour de la planification de trajectoire de bras robotique au millimètre près, une meilleure détection des câbles et fils fins, un filtrage du bruit pour les obstacles distants, et des cartes de profondeur stables face aux surfaces réfléchissantes, objets transparents, obscurité et environnements encombrés. Le modèle et son code sont disponibles en open source sur Hugging Face, ModelScope et GitHub, avec un rapport technique publié sur arXiv. Ant Group a aussi noué un partenariat avec ORBBEC, fabricant chinois de capteurs 3D, dont le laboratoire Depth Vision Lab a validé le modèle; la collaboration produit un nouveau dispositif de collecte EGO-RGBD, une intégration SDK pour le matériel ORBBEC, et une future caméra intégrée sans réglage algorithmique complexe. La sortie illustre un pari de plus en plus partagé en IA incarnée: les modèles de vision entraînés sur des images web généralistes, comme DINOv3, reconnaissent des objets mais ignorent leur géométrie précise, ce qui limite leur usage pour des robots devant saisir, éviter ou manipuler des objets réels. En intégrant la compréhension spatiale dès l'entraînement, LingBot-Vision s'attaque à l'écart entre perception "de spectateur" et perception "d'acteur", un enjeu central pour les modèles vision-langage-action qui pilotent bras robotiques et humanoïdes. Le passage du papier de recherche à un partenariat matériel concret avec ORBBEC, plutôt qu'une simple démonstration, est le signal le plus tangible pour les intégrateurs: un début de commercialisation réelle plutôt qu'un prototype isolé. Gérer nativement les cas difficiles, surfaces réfléchissantes, câblage fin, objets transparents, est précisément ce qui bloque aujourd'hui le déploiement en environnement réel non contrôlé. Ant Group, mieux connu pour Alipay, a multiplié ces derniers mois les investissements en robotique et IA incarnée via LingBot, dans un contexte de compétition intense entre laboratoires chinois et américains sur les modèles de fondation pour robots. La comparaison affichée avec DINOv3, modèle phare de Meta, positionne explicitement l'entreprise face aux géants américains sur la perception, pendant que d'autres acteurs, Figure AI avec Figure 03, Tesla avec Optimus, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Google DeepMind avec Helix, se concentrent davantage sur les modèles d'action et le contrôle moteur. LingBot-Vision se positionne ainsi comme une brique de perception complémentaire, potentiellement intégrable en amont de ces systèmes. Le partenariat avec ORBBEC laisse présager un déploiement progressif dans les prochains mois, avec l'arrivée annoncée d'une caméra grand public intégrant directement le traitement 3D, un jalon qui déterminera si les gains annoncés sur benchmarks se traduisent en performance réelle chez les intégrateurs industriels.

1 source
Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production
202Interesting Engineering 

Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production

UBTech, fabricant robotique basé à Shenzhen, a présenté le Cruzr Y1, un humanoïde industriel à roues, lors d'une exposition technologique en Chine, où le robot a effectué en démonstration live du déstackage de caisses et de la palettisation de manière autonome. L'engin embarque des puces domestiques chinoises Digua S100P et S600, la plateforme logicielle propriétaire ROSA, et un modèle VLA (Vision-Language-Action) couplant perception, prise de décision et contrôle moteur. Sa mobilité repose sur des roues omnidirectionnelles à 360 degrés combinées à un mécanisme d'élévation verticale, permettant une circulation dans des allées de fabrication étroites. Les bras doubles utilisent des joints harmoniques avec capteurs de couple, tandis qu'un système multi-capteurs composé de lidar et de caméras de profondeur, disposés sur la tête, les poignets et le châssis, assure une couverture situationnelle à 360 degrés. L'autonomie dépasse quatre heures en charge maximale, avec recharge automatique et swap rapide de batterie pour un fonctionnement continu. En parallèle, UBTech a lancé la série U1 sous sa nouvelle marque grand public UWORLD, affiché à environ 30 000 dollars: plus de 2 100 précommandes en une semaine sur JD.com, livraisons annoncées pour mi-septembre, 88 degrés de liberté, revêtement en silicone réaliste, 183 cm pour la version masculine et 168 cm pour la féminine. L'intégration d'un modèle VLA dans un robot logistique à déploiement industriel est techniquement notable: elle substitue la programmation par trajectoire fixe par une perception adaptative, ce qui réduit théoriquement le temps de reconfiguration pour les intégrateurs. La plateforme Cruzr Y1 n'est ni un AMR classique ni un bras industriel fixe, mais une unité hybride combinant mobilité, manipulation bilatérale et levage vertical en un seul système. Pour un COO logistique, cela représente une alternative potentielle aux architectures AMR plus bras dédiés. Cela dit, UBTech n'a publié aucune métrique de cadence de cycle, taux d'erreur ou volume déployé en conditions réelles: la démonstration reste un proof-of-concept en environnement contrôlé, ce qui rend toute comparaison avec des systèmes en production comme ceux d'Exotec (Skypod) ou de Berkshire Grey prématurée. Fondée en 2012, UBTech compte parmi ses clients industriels Airbus, Texas Instruments, NIO, ZEEKR, Dongfeng Liuzhou Motor et FAW-Volkswagen. Le Cruzr Y1 s'inscrit dans une stratégie de diversification face à la concurrence humanoïde croissante, avec Figure AI et son Figure 03, Tesla et l'Optimus Gen 3, Physical Intelligence avec Pi-0, et NVIDIA avec GR00T N2. Le lancement simultané de la gamme U1 grand public signale une bifurcation stratégique: UBTech vise à la fois le B2B industriel et un marché B2C émergent en Chine, où la demande pour des robots compagnons commence à se structurer. Les prochaines étapes clés seront les retours terrain des pilotes industriels du Cruzr Y1 et les premiers usages réels de la U1 après les livraisons de mi-septembre.

Chine/AsieActu
1 source
Pilotage du comportement robotique à l'inférence par reconfiguration physiquement informée de la structure de tâche
203arXiv cs.RO 

Pilotage du comportement robotique à l'inférence par reconfiguration physiquement informée de la structure de tâche

Une équipe de recherche a publié sur arXiv (ref. 2606.26588) un système baptisé ReStruct, conçu pour modifier le comportement d'un robot en cours de déploiement sans nécessiter de réentraînement. Le problème visé est ce que les chercheurs appellent le "steering à l'inférence" : forcer une politique robotique apprise à respecter une préférence utilisateur imprévue lors de l'entraînement, au moment du test uniquement. ReStruct repose sur une architecture en deux niveaux : un squelette de haut niveau modélisé comme une machine à états finis (automate neural), qui encode la structure de la tâche, et un contrôleur bas niveau sous forme de politique résiduelle, qui reste entièrement gelé. Lors de la modification d'une préférence, c'est uniquement l'automate qui est reconfiguré via un produit synchrone, mettant à jour les prior d'action transmis au contrôleur. Sur banc de test en simulation et en environnement réel, ReStruct dépasse les modèles VLA (Vision-Language-Action) existants de jusqu'à 25 % en taux de réussite de tâche et en respect des préférences, pour des spécifications allant de contraintes sur des objets spécifiques jusqu'à des contraintes de logique temporelle. L'enjeu industriel est significatif : le réentraînement d'une politique robotique pour chaque nouvelle variante de tâche ou préférence opérateur représente aujourd'hui un verrou majeur à la scalabilité des déploiements. Les approches bout-en-bout (fine-tuning, guidance experte) sont trop coûteuses en pratique, tandis que les méthodes neuro-symboliques classiques génèrent des plans logiquement cohérents mais physiquement irréalisables, ce que ReStruct corrige en intégrant la faisabilité physique directement dans la reconfiguration de la structure de tâche. Le fait que la méthode surpasse les modèles VLA sur ces métriques est notable : les VLA représentent actuellement le paradigme dominant en robotique manipulatrice apprise, et cette architecture hybride formelle-neuronale suggère une voie complémentaire plutôt que concurrente. Ce travail s'inscrit dans un débat de fond entre approches purement end-to-end et méthodes symboliques pour la robotique généraliste. Les modèles VLA comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) misent sur des fondations neuronales massives adaptées par fine-tuning, ce qui les rend rigides face aux variations de préférences non anticipées. ReStruct propose une alternative légère, fondée sur la théorie des automates, qui n'impose pas de réentraîner le contrôleur. Il s'agit d'un preprint académique sans affiliation industrielle annoncée ni déploiement terrain mentionné, mais la démonstration en conditions réelles renforce la crédibilité de l'approche. Les prochaines étapes naturelles seraient l'intégration dans des pipelines de déploiement existants et l'évaluation sur des manipulateurs commerciaux multi-tâches.

RechercheOpinion
1 source
RouterVLA : des tests de fumée transformés en supervision pour la sélection de modèles VLA hétérogènes
204arXiv cs.RO 

RouterVLA : des tests de fumée transformés en supervision pour la sélection de modèles VLA hétérogènes

RouterVLA, présenté dans un preprint arXiv déposé en juin 2026 (identifiant 2606.27355), s'attaque à un problème concret souvent ignoré dans le déploiement robotique : comment choisir, parmi plusieurs politiques vision-language-action (VLA) candidates, celle que l'on installe réellement sur le robot. Les équipes robotiques effectuent systématiquement des "smoke tests" - des séries d'essais courts avant déploiement - pour comparer les candidats, puis retiennent un seul vainqueur global. RouterVLA propose de capitaliser sur ces essais déjà réalisés via une technique dite de "cross-fitting à résultats disjoints" : les essais enregistrés construisent un profil de performance pour chaque politique expert gelée, tandis qu'un essai distinct, non inclus dans ce profil, sert à noter l'expert retenu. Évalué sur 34 752 enregistrements de rollouts issus du benchmark LIBERO-Plus, une règle transparente basée sur le taux de succès des probes fait passer le taux de succès hors-échantillon de 0,4686 à 0,6149, soit un gain de 14,64 points de pourcentage. Le résultat le plus saillant n'est pas le gain lui-même, mais ce qui le produit. Sous les profils scalaires étudiés, les scoreurs appris sont statistiquement indiscernables de la simple règle de succès-probe, ce qui implique que la valeur de routage vient du processus de commissionnement - les smoke tests eux-mêmes - et non d'une capacité ML supplémentaire. Ajouter des couches d'apprentissage pour scorer les politiques ne crée donc pas de valeur additionnelle si les profils restent scalaires. Tout aussi important pour l'intégrité des benchmarks : réutiliser le même essai pour sélectionner et évaluer l'expert gonfle artificiellement le gain mesuré par un facteur de 1,87. Ce résultat constitue un avertissement méthodologique direct pour la communauté, car de nombreux papiers comparatifs en robotique pourraient souffrir de ce biais de contamination si la séparation des outcomes n'est pas garantie. LIBERO-Plus est un environnement de simulation pour la manipulation robotique de table, largement utilisé pour évaluer des politiques de généralisation. RouterVLA s'inscrit dans le champ croissant de la sélection hétérogène de politiques VLA, un problème qui devient critique à mesure que les fondations VLA se multiplient : Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), Helix (Figure AI), ou les politiques maison des labs comme Google DeepMind. La question de savoir quel modèle router selon la tâche est un vrai enjeu d'industrialisation, distinct de celui d'entraîner de meilleurs modèles individuels. Ce preprint ne mentionne ni déploiement réel ni partenaire industriel : il s'agit d'une contribution méthodologique évaluée en simulation. Les suites naturelles seraient d'étendre l'analyse à des profils non-scalaires (embeddings, séquences temporelles) et de valider la séparation des outcomes en manipulation physique réelle.

RechercheOpinion
1 source
ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action
205arXiv cs.RO 

ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action

Une équipe de chercheurs publie fin juin 2026 ROAD-VLA (arXiv:2606.25800), un cadre d'adaptation en ligne des modèles VLA (Vision-Language-Action) par auto-distillation guidée par avantage. Les VLA, à l'image de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou RT-2 (Google DeepMind), traduisent directement une entrée visuelle et une instruction en langage naturel en séquences d'actions robotiques. Le problème : affiner un tel modèle pré-entraîné sur de nouvelles tâches via apprentissage par renforcement (RL) génère des récompenses trop éparses pour superviser des politiques autoregressives de haute dimension. ROAD-VLA y répond en construisant un "enseignant proximal" dans l'espace des actions, perturbant les logits des tokens d'action avec des estimations d'avantage calibrées pour convertir des récompenses rares en supervision dense token par token. Évalué sur sept environnements de manipulation robotique, en distribution et hors distribution, le framework surpasse PPO (Proximal Policy Optimization, référence RL standard) dans la quasi-totalité des configurations. La découverte la plus saillante est l'existence d'un "modality gap" : les enseignants textuels conditionnés sur des démonstrations, des expériences récupérées ou des plans de haut niveau s'avèrent systématiquement inefficaces pour adapter les politiques d'action VLA. C'est une contradiction directe avec une hypothèse répandue selon laquelle le guidage symbolique ou langagier peut servir de supervision fiable lors du fine-tuning RL. ROAD-VLA démontre que la supervision doit opérer dans l'espace des actions, pas dans l'espace du langage. Pour un intégrateur déployant des bras manipulateurs basés sur VLA, cela ouvre une voie d'adaptation au domaine sans collecter de nouvelles démonstrations massives : le modèle se corrige via son propre comportement et les signaux de récompense de l'environnement réel. Le paradigme VLA a pris son essor avec RT-2 (Google DeepMind, 2023), puis s'est accéléré via Pi-0 (Physical Intelligence, 2024), GR00T N2 (NVIDIA, 2025) et Helix (Figure AI), accompagnés d'une vague de publications académiques. L'adaptation post-déploiement, soit ajuster un modèle généraliste à une géométrie de préhension spécifique ou à un flux industriel précis sans tout ré-entraîner, est désormais identifiée comme le verrou opérationnel suivant par les équipes terrain. Ce travail reste une annonce académique (arXiv, juin 2026), pas un produit livré ni un déploiement industriel réel, et la validation sur robots physiques en conditions industrielles reste à conduire. Aucun acteur français ou européen n'est impliqué dans cette recherche.

RechercheOpinion
1 source
InSight : acquisition autonome de compétences via des VLA pilotables
206arXiv cs.RO 

InSight : acquisition autonome de compétences via des VLA pilotables

Une équipe de chercheurs présente InSight (arXiv:2606.24884, juin 2026), un cadre d'acquisition autonome de compétences pour les modèles vision-language-action (VLA). L'architecture comporte deux étapes : d'abord un pipeline de segmentation automatique qui décompose des démonstrations existantes en primitives étiquetées ("déplacer la pince vers le bol", "soulever vers le haut", "verser la bouteille") via un VLM de décomposition de plans couplé aux poses de l'effecteur terminal ; ensuite un flywheel de données guidé par VLM qui identifie les primitives manquantes pour accomplir une nouvelle tâche, tente des démonstrations autonomes via un contrôle bas niveau proposé par le VLM, et intègre automatiquement les succès dans l'ensemble d'entraînement. Le système a été validé sur cinq tâches de manipulation : retournement de blocs, fermeture de tiroir, balayage, vissage et versement, en simulation et en conditions réelles, sans aucune démonstration humaine des compétences cibles. L'enjeu central : les VLA actuels sont structurellement limités par leur corpus d'entraînement initial, et toute extension vers de nouvelles tâches impose aujourd'hui un coût élevé en téléopération humaine. InSight propose une boucle d'auto-amélioration fermée où les primitives apprises peuvent être composées pour exécuter des tâches à horizon long sans intervention humaine supplémentaire. Pour un intégrateur ou un COO industriel, cela représente une réduction potentielle du coût d'onboarding robotique. Les démonstrations publiées restent cependant relativement simples, et les auteurs ne fournissent pas de métriques de cycle time ni de taux de succès pour des scénarios de production complexes, ce qui invite à la prudence avant toute extrapolation opérationnelle. Les modèles VLA sont un terrain de compétition intense entre Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Google DeepMind (RT-2) et Figure AI (Helix pour la manipulation humanoïde). Tous partagent le même verrou : un plafond de capacités figé à l'entraînement. InSight s'inscrit dans une tendance émergente de systèmes capables de s'auto-étendre, proche des travaux sur les agents génératifs de données. Cette publication demeure un preprint académique sans déploiement annoncé ; les auteurs prévoient de rendre le code public via insight-vla.github.io. Les prochaines étapes concernent la robustesse du flywheel sur des primitives moins déterministes et la validation en environnement industriel réel sur des bras à plus de six degrés de liberté.

IA physiqueOpinion
1 source
Kunlun Xing, startup d'IA incarnée, lève plusieurs milliards de yuans et devient licorne en 90 jours
20736Kr 

Kunlun Xing, startup d'IA incarnée, lève plusieurs milliards de yuans et devient licorne en 90 jours

Moins de quatre-vingt-dix jours après son enregistrement officiel, la startup de robotique humanoïde chinoise Kunlun Xing (昆仑行) a bouclé trois tours de financement successifs pour un total de plusieurs milliards de yuans, franchissant le seuil du milliard de dollars de valorisation avant même d'avoir sorti un produit. C'est le 36Kr qui révèle ces informations en exclusivité. La société est fondée par Ren Geng, ancien vice-président du groupe Alibaba et ex-président d'Alibaba Cloud Chine, accompagné de Lang Xianpeng, premier ingénieur ADAS de Li Auto, l'équivalent chinois de Mobileye au sein du constructeur. Les investisseurs présents dès le premier tour, dont Hillhouse Capital, Gaorong Ventures, CASSTAR et Huaye Capital, ont participé aux trois rounds consécutifs, un signal fort de conviction. Le tour de table réunit également Zhongding Capital, Innovation Works (le fonds de Kai-Fu Lee), Xin Capital, et le bras industriel du conglomérat Jianfa Group. La stratégie affichée par Kunlun Xing est le développement en intégration totale (full-stack) d'un robot humanoïde généraliste, explicitement positionné comme concurrent de l'Optimus de Tesla, avec une architecture duale baptisée Kunlun World Model (KWM) censée améliorer la généralisation et réduire l'opacité décisionnelle des modèles de type VLA. Ce financement record illustre la tension qui structure le marché chinois de la robotique humanoïde en 2026 : les capitaux sont abondants, mais les cibles crédibles rares. Plusieurs fonds de premier rang interrogés par 36Kr reconnaissent se retrouver en position de "demandeurs" face aux meilleurs dossiers, non l'inverse. Ce qui différencie Kunlun Xing aux yeux des investisseurs, c'est la combinaison inhabituelle de compétences de go-to-market à grande échelle (Ren Geng a piloté Alibaba Cloud à 42,1 % de part de marché public cloud en 2020) et de capacités de livraison hardware à volume (Lang Xianpeng a délivré l'ADAS Li Auto sur 1,5 million de véhicules avec un budget annuel de recherche de 10 millions de yuans). Dans un secteur où la plupart des acteurs sont soit purement techniques, soit purement commerciaux, cette dualité est jugée décisive. La stratégie "corps + cerveau" en développement propriétaire vise à éviter le découplage logiciel-matériel qui pénalise nombre de concurrents. Le contexte sectoriel qui nourrit cette levée tient à plusieurs catalyseurs simultanés : l'annonce par Tesla d'une production en petite série de l'Optimus Gen3 à l'usine de Fremont entre juillet et août 2026, l'introduction en bourse accélérée de Unitree Robotics, et les prévisions de Morgan Stanley évaluant le marché mondial des robots humanoïdes à 5 000 milliards de dollars d'ici 2050. Kunlun Xing n'est toutefois pas seul sur ce segment : Figure AI, 1X, Agility Robotics et Fourier Intelligence occupent le terrain international, tandis que Unitree, Agibot (智元) et Zhiyuan Robot (智元) disputent le marché domestique. Les défis techniques restent concrets : la durée de vie des mains dextres dépasse rarement deux mois, et la supply chain composants n'est pas encore industrialisée. Kunlun Xing n'a pour l'heure annoncé ni prototype public, ni calendrier de livraison client, ni déploiement pilote, sa valorisation repose intégralement sur la crédibilité de l'équipe fondatrice, pas sur des métriques produit vérifiables.

Chine/AsieActu
1 source
One-to-Two Acting : un cadre pour étendre les actions d'un agent mono-bras à deux bras
208arXiv cs.RO 

One-to-Two Acting : un cadre pour étendre les actions d'un agent mono-bras à deux bras

Des chercheurs ont publié le 24 juin 2026 sur arXiv (2606.19897) ExS2D, un framework hiérarchique permettant à un robot bras unique d'exécuter des tâches bimanuelle sans aucune démonstration en configuration deux bras. Le système décompose d'abord des instructions textuelles en sous-tâches structurées, en capturant explicitement les dépendances temporelles entre elles. Un module de grounding traduit ensuite chaque sous-tâche en actions exécutables via une cartographie guidée par l'observation. Enfin, un coordinateur basé sur un grand modèle de langage multimodal (MLLM) orchestre l'allocation des actions entre les deux bras et planifie les trajectoires sans collision. En simulation, ExS2D réduit le nombre moyen d'étapes d'exécution de 54,4 % tout en maintenant un taux de succès comparable au baseline mono-bras. Des expériences sur robot réel portant sur quatre tâches distinctes confirment la fiabilité du système, entraîné uniquement sur quelques échantillons mono-bras en régime few-shot. L'enjeu principal ici est le coût de collecte des données bimanuelles, qui constitue l'un des principaux freins à la manipulation duale en robotique industrielle et service. Les systèmes comme ALOHA ou les plateformes de télé-opération bimanuelle nécessitent des configurations spécialisées et des opérateurs formés, rendant le passage à l'échelle difficile. ExS2D contourne ce goulot d'étranglement en réutilisant des démonstrations mono-bras existantes, potentiellement déjà disponibles dans les parcs robotiques en production. La réduction de 54,4 % des étapes d'exécution représente un gain de débit concret pour des lignes d'assemblage ou de tri, bien que les conditions expérimentales exactes (vitesse, complexité des objets, variabilité de la scène) ne soient pas détaillées dans l'abstract, ce qui invite à nuancer cette métrique avant toute extrapolation industrielle. La manipulation bimanuelle attire des investissements croissants de la part d'acteurs comme Figure AI (Figure 03), Physical Intelligence (pi0) ou Apptronik, tous confrontés au même problème de données. La tendance actuelle est d'utiliser des VLA (Vision-Language-Action models) entraînés sur de vastes corpus de démonstrations humaines, mais la collecte bimanuelle reste coûteuse même pour ces acteurs. ExS2D s'inscrit dans une direction complémentaire, celle du transfer learning structural depuis des données mono-bras, une approche qui pourrait intéresser les intégrateurs travaillant sur des cellules robotiques existantes en mono-bras. Il s'agit pour l'instant d'un travail académique sans déploiement commercial annoncé ; la prochaine étape logique serait une validation sur des tâches industrielles plus complexes et avec une plus grande variabilité d'objets.

RecherchePaper
1 source
Apprentissage de la navigation au dernier mètre par catégorie à partir de démonstrations RGB d'une instance unique
209arXiv cs.RO 

Apprentissage de la navigation au dernier mètre par catégorie à partir de démonstrations RGB d'une instance unique

Des chercheurs du RPM Lab de l'Université du Minnesota présentent dans un preprint arXiv (2512.11173v3) un framework d'imitation learning pour la navigation au "dernier mètre" d'un robot manipulateur mobile quadrupède. L'enjeu : positionner la base du robot à quelques centimètres de l'objet cible avant toute action de manipulation, une phase où les systèmes RGB existants échouent, ne garantissant qu'une précision métrique insuffisante. Le système n'utilise que des caméras RGB embarquées et fonctionne avec trois entrées : des images objectif, des observations RGB multi-vues, et un prompt texte nommant l'objet cible. Un module de segmentation guidé par le langage et un décodeur de matrice de score spatial gèrent l'ancrage de l'objet et le raisonnement en pose relative. Entraîné sur une seule instance physique par catégorie, le système atteint 74,58 % de succès en edge-alignment (évaluation sur l'orientation réelle) et 89,42 % en object-alignment sur des instances et environnements inédits, y compris avec des conditions d'éclairage et de fond difficiles. Ce résultat comble un angle mort structurel de la manipulation mobile : les politiques de manipulation sont entraînées sur des configurations précises, et un positionnement approximatif suffit à les faire sortir de leur distribution d'entraînement, causant des échecs en chaîne à l'exécution. Supprimer LiDAR, capteurs de profondeur et cartes préalables tout en conservant une précision centimétrique rend le pipeline nettement plus déployable sur des plateformes sans capteurs premium. La généralisation catégorielle (une seule démonstration réelle, des dizaines d'instances inconnues) réduit massivement le coût de collecte de données, un verrou majeur pour la manipulation hors environnement contrôlé. Ce travail s'inscrit dans la dynamique des VLA (Vision-Language-Action) qui cherchent à unifier perception, langage et action dans des politiques généralisables. Les acteurs dominants sur la manipulation mobile incluent Physical Intelligence (Pi-0), Figure AI et les équipes académiques de Stanford et CMU, qui investissent massivement dans la collecte de données téléopérées à grande échelle. L'approche ici contraste délibérément : une seule démonstration par catégorie plutôt que des milliers d'épisodes. Ce résultat reste un démonstrateur académique sans déploiement industriel annoncé ni partenaire B2B identifié, mais une page projet avec des démonstrations visuelles est disponible en ligne.

IA physiqueActu
1 source
Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences
210arXiv cs.RO 

Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences

Une équipe de recherche propose FAFM (Frequency-Aware Flow Matching), une méthode de génération d'actions robotiques présentée en préprint arXiv (2606.20135, juin 2026), qui reformule le problème du flow matching pour la manipulation robotique dans le domaine fréquentiel. Le principe : plutôt que de prédire directement des séquences d'actions discrètes (des "chunks"), FAFM applique une transformée en cosinus discrète (DCT) sur ces séquences pour les convertir en coefficients fréquentiels, effectue le flow matching sur ces coefficients, puis reconstruit des actions continues via expansion en base cosinus. Pour garantir la cohérence temporelle, la méthode ajoute une contrainte de type Sobolev sur la dérivée temporelle du premier ordre, ce qui pénalise les changements brusques et atténue les erreurs hautes fréquences. L'approche s'applique sans paramètres réseau supplémentaires, aussi bien aux politiques de flow matching autonomes qu'aux modèles vision-langage-action (VLA). Les résultats sont validés sur les benchmarks LapGym, LIBERO et évitement d'obstacles, ainsi qu'en déploiement réel sur un bras Franka. L'intérêt industriel est direct : la fragmentation des fréquences de contrôle est un problème concret lors de l'agrégation de données de démonstration provenant de robots différents (certains à 10 Hz, d'autres à 50 Hz), et les méthodes actuelles de diffusion policy ou de flow matching standard y sont explicitement vulnérables. Les actions temporellement incohérentes qui en résultent dégradent la stabilité du contrôle en boucle fermée, un facteur bloquant pour le déploiement en production. Le fait que FAFM améliore simultanément le taux de succès, la fluidité du mouvement, la robustesse aux biais mécaniques et la vitesse de convergence sans modifier l'architecture existante est une proposition de valeur claire pour les intégrateurs : pas de refonte du pipeline, pas de surcoût computationnel. La compatibilité avec les VLA est également notable, car ces modèles dominent les annonces récentes (pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) et souffrent précisément de ce type d'artefacts temporels à l'inférence. Le flow matching s'est imposé ces dix-huit derniers mois comme alternative crédible à la diffusion policy (Chi et al., 2023, Columbia), avec des temps d'inférence plus courts et une meilleure expressivité multimodale. Les travaux récents de Physical Intelligence (pi-0, pi-0.5) et de Figure AI ont largement adopté ce paradigme pour leurs politiques générales. FAFM s'inscrit dans une tendance de raffinement de ces fondations plutôt que de rupture : on optimise la stabilité et la généralisation inter-fréquences, deux verrous identifiés lors des premiers déploiements industriels à grande échelle. La validation sur Franka reste modeste en termes de diversité de tâches, et le code est disponible sous revue anonyme, ce qui signifie que la méthode n'est pas encore auditée par la communauté. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes multi-articulées et sur des datasets hétérogènes à grande échelle, là où la question des fréquences mixtes est la plus aiguë.

RecherchePaper
1 source
Autonomique déploie des robots semi-humanoïdes et de l'IA chez un équipementier automobile canadien de rang 1
211Robotics Business Review 

Autonomique déploie des robots semi-humanoïdes et de l'IA chez un équipementier automobile canadien de rang 1

Autonomique Inc., startup californienne fondée en 2024 et issue des laboratoires de SRI International (Menlo Park), annonce le passage en déploiement industriel de sa plateforme d'IA physique chez F&P Manufacturing, équipementier automobile Tier 1 canadien basé à Tottenham, Ontario, spécialisé dans les systèmes de chassis et de suspension. La société ne commercialise pas de robot propre mais une couche logicielle hardware-agnostique conçue pour ajouter dextérité et raisonnement à des bras industriels existants, issus notamment de Denso, Staubli et RealMan Robotics. Son PDG, Vikrant Tomar, docteur en IA et ancien fondateur de Fluent.ai, insiste sur la distinction entre démonstration et production : les métriques annoncées (temps de cycle, précision, réduction de rebuts) restent à ce stade déclaratifs, sans données publiques indépendantes pour les valider. Le déploiement chez F&P est présenté comme un pilote progressant vers une industrialisation, non comme un rollout à l'échelle déjà opérationnel. L'intérêt technique réside dans l'architecture dite "généraliste-spécialiste" : plutôt qu'un unique modèle vision-langage-action (VLA) monolithique, la plateforme orchestre dynamiquement des compétences déterministes (apprentissage par renforcement en ligne pour les insertions de précision, par exemple) et des modèles VLA plus flexibles pour gérer les anomalies ou les tâches non prévues. Cette approche répond à une critique structurelle du secteur : les VLA génériques peinent à tenir les cadences et la répétabilité exigées en production réelle. Si Autonomique tient ses promesses chez F&P, ce serait un signal concret que le sim-to-real gap peut être comblé sur des workflows multi-étapes en environnement industriel contraint, sans recours à des end-effectors coûteux comme les mains robotiques polyarticulées. Autonomique s'appuie sur des licences de technologies SRI, dont le système de télé-opération déjà utilisé par l'armée américaine pour le déminage et par des laboratoires pharmaceutiques en salles blanches, ce qui donne à sa base de données d'entraînement une provenance inhabituelle pour une startup robotique. Ses concurrents directs dans le segment "software layer for industrial arms" incluent Covariant (racheté par Amazon), Machina Labs ou Physical Intelligence (Pi-0), tandis que des acteurs comme 1X Technologies ou Figure AI ciblent l'humanoïde complet, segment qu'Autonomique juge prématuré pour la production. Les prochaines étapes annoncées : extensions de partenariats avec Holiday Robotics et Rainbow Robotics, discussions en cours avec des développeurs d'humanoïdes, et réplication du blueprint F&P sur d'autres lignes et sites. Aucun acteur européen ou français n'est impliqué à ce stade.

💬 La couche logicielle sur bras existants, c'est le seul modèle qui colle vraiment avec la réalité des usines : pas besoin de remplacer le hardware. L'architecture généraliste-spécialiste d'Autonomique (déterminisme pour les tâches de précision, VLA pour gérer les exceptions) s'attaque enfin au problème que personne n'avait résolu proprement en prod réelle. Reste à valider les chiffres sur la durée, parce que pour l'instant c'est Autonomique qui parle d'Autonomique.

IA physiqueOpinion
1 source
LaST₀ : raisonnement spatio-temporel latent en chaîne pour les modèles VLA robotiques
212arXiv cs.RO 

LaST₀ : raisonnement spatio-temporel latent en chaîne pour les modèles VLA robotiques

Des chercheurs ont proposé LaST₀ (Latent Spatio-Temporal Chain-of-Thought), un framework pour modèles Vision-Langage-Action (VLA) appliqués à la manipulation robotique, publié en janvier 2026 sur arXiv (2601.05248, v4). Évalué sur 10 tâches réelles couvrant la manipulation sur table, la manipulation sur base mobile et la manipulation dextre, le système améliore le taux de succès moyen de respectivement 13 %, 14 % et 14 % par rapport aux meilleures méthodes VLA actuelles. L'architecture repose sur un design Mixture-of-Transformers dual : un "expert raisonnement" opérant à basse fréquence pour l'inférence latente, et un "expert action" générant des commandes motrices à haute fréquence, les deux modules fonctionnant à des cadences hétérogènes pour permettre un basculement adaptatif. Le raisonnement intermédiaire s'effectue dans un espace latent compact encodant la dynamique visuelle future, la structure 3D de la scène et les états proprioceptifs du robot, sans passer par du texte en langage naturel. L'enjeu central est le compromis latence/raisonnement qui freine le déploiement industriel des VLA. Les approches qui génèrent des traces de raisonnement en langage naturel avant d'agir, comme certaines variantes de Pi-0 (Physical Intelligence) ou OpenVLA, introduisent une latence d'inférence incompatible avec les cycles rapides de la manipulation robotique. LaST₀ court-circuite ce goulot en déplaçant le raisonnement dans un espace latent plus dense informationnellement, plus rapide à générer, et capable de capturer des attributs physiques difficiles à verbaliser comme la friction ou la compliance des objets. Les gains mesurés sur des environnements réels, et non en simulation, constituent un signal notable : le sim-to-real gap n'est pas le seul obstacle, et la représentation interne du raisonnement importe autant que la qualité des données d'entraînement. Les VLA ont émergé comme architecture dominante pour la généralisation en robotique depuis les travaux de Google sur RT-2 (2023), puis se sont accélérés avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI en 2025. Le débat structurant du secteur oppose raisonnement explicite de type LLM et politiques réactives de type diffusion. LaST₀ propose une troisième voie, un système dual à fréquences hétérogènes combinant les deux sans les latences du premier ni les limites de généralisation du second. La publication reste pour l'instant purement académique, sans pilote industriel annoncé, mais l'architecture est directement transposable aux manipulateurs commerciaux et aux plateformes humanoïdes existantes.

IA physiqueOpinion
1 source
Capteurs tactiles dynamiques et évolutifs grâce à des guides d'ondes acoustiques passifs et flexibles
213arXiv cs.RO 

Capteurs tactiles dynamiques et évolutifs grâce à des guides d'ondes acoustiques passifs et flexibles

Des chercheurs ont publié en juin 2026 (arXiv:2606.13746) un système de peau tactile dynamique basé sur des guides d'ondes acoustiques passifs et flexibles. L'architecture repose sur des résonateurs de Helmholtz à membranes élastiques interconnectés par des microtubes renforcés par ressorts, formant un réseau fermé dont la transmission acoustique reste stable sous flexion macroscopique, sans électronique distribuée dans la structure. Quatre microphones suffisent à couvrir 64 noeuds de détection avec une résolution spatiale de 4 mm et une précision de localisation supérieure à 99 %. L'inférence, fondée sur une transformée en ondelettes continue rapide (Fast CWT) couplée à un réseau de neurones léger, s'exécute en 5,5 ms. Les prototypes démontrés (réseau d'extrémité de doigt, gant tactile, peaux de grande surface) détectent des stimuli allant du contact d'un seul cheveu à un impact de particule de 5 mg, ainsi que des ondes de pouls artériel et des effleurements de plume, sur des signaux inférieurs à 100 Hz. La contribution clé n'est pas la sensibilité brute mais le découplage entre performance et flexibilité structurelle : contrairement aux capteurs piézorésistifs ou capacitifs qui se dégradent sur des substrats courbés, la transmission acoustique passive reste invariante. Ramener à quatre microphones la couverture de 64 points de mesure réduit câblage, coût et modes de défaillance, trois leviers critiques pour une mise en série industrielle. La précision annoncée de 99 % reste à confirmer hors conditions de laboratoire contrôlé et sur des cycles de manipulation réels. Ces travaux s'inscrivent dans une compétition dense autour de la peau tactile robotique, face aux capteurs optiques (famille GelSight du MIT), aux matrices piézorésistives (BeBop Sensors, SynTouch) et aux peaux capacitives développées en Europe et en Asie. Aucune approche n'a encore atteint la trifecta scalabilité-robustesse-coût sur un corps humanoïde complet. Ce paradigme passif pourrait intéresser des plateformes comme Agility Robotics, Figure AI ou Apptronik, qui cherchent à intégrer du retour tactile sans multiplier la complexité d'assemblage. La validation mécanique sur cycles répétés et la soumission à une revue à comité de lecture constituent les prochaines étapes critiques.

RecherchePaper
1 source
X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques
214arXiv cs.RO 

X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques

Publié sur arXiv (2603.03733) en 2025, X-Loco est un framework d'entraînement d'une politique de locomotion généraliste basée sur la vision pour robots humanoïdes. L'approche repose sur une distillation synergétique : plusieurs politiques expertes sont entraînées séparément pour des compétences distinctes - locomotion bipède stable, récupération après chute, coordination corps entier, franchissement de terrains variés - puis une politique unique guidée par entrée visuelle est distillée à partir de ces experts via un mécanisme de sélection adaptative au cas par cas. X-Loco opère uniquement sur des commandes de vitesse, sans recours à des mouvements de référence issus de captures de mouvement. Les auteurs revendiquent une première dans l'intégration simultanée de toutes ces compétences dans une seule politique vision - affirmation à prendre avec les précautions d'usage pour un preprint non encore évalué par les pairs. Ce travail s'attaque à un verrou technique central : entraîner une politique unique qui maîtrise des comportements aux dynamiques radicalement différentes et aux objectifs de contrôle parfois contradictoires. Une telle politique simplifie le déploiement opérationnel en éliminant les modules de commutation entre comportements. L'absence de dépendance aux données de mocap rend également le pipeline d'entraînement plus scalable, puisqu'il ne requiert pas de bibliothèques de mouvements spécifiques à chaque compétence cible. Les études d'ablation incluses renforcent la crédibilité des choix architecturaux, mais les résultats restent cantonnés à la simulation et au laboratoire, sans validation sur hardware réel à grande échelle. X-Loco s'inscrit dans une dynamique de recherche intense sur la locomotion humanoïde, portée par des équipes comme Berkeley Humanoid, CMU et les labos gravitant autour d'Unitree. La distillation enseignant-étudiant est un paradigme établi en apprentissage par renforcement, mais son application à un spectre aussi large de compétences reste un défi ouvert. Côté commercialisation, Tesla (Optimus Gen 2), Figure AI, Boston Dynamics (Atlas) et 1X Technologies travaillent sur des problèmes similaires avec des ressources bien supérieures. La suite logique pour X-Loco serait une validation sim-to-real convaincante sur hardware physique, étape non encore franchie selon le papier.

RecherchePaper
1 source
IA incarnée : la correspondance proprioceptive-visuelle permet aux robots humanoïdes de se distinguer d'autrui
215arXiv cs.RO 

IA incarnée : la correspondance proprioceptive-visuelle permet aux robots humanoïdes de se distinguer d'autrui

Des chercheurs ont publié en juin 2026 un préprint sur arXiv (2606.13222) décrivant un système permettant à un robot humanoïde d'apprendre à se distinguer des autres agents présents dans son environnement, sans recourir à des étiquettes d'identité ni à des modèles cinématiques prédéfinis. Le mécanisme repose sur la correspondance proprioceptive-visuelle : le robot corrèle ses propres états articulaires avec ce qu'il perçoit visuellement, ce qui lui permet d'identifier ses propres membres parmi d'autres corps en mouvement. À partir de cette capacité, le système construit automatiquement un modèle prédictif de soi qui associe les configurations articulaires à une représentation d'occupation corporelle en trois dimensions. Le système a été validé dans des scènes multi-agents impliquant soit des humains, soit des robots morphologiquement identiques, et supporte des tâches aval concrètes : atteinte de cibles, planification de mouvement avec évitement de collision, et retargeting de mouvement humain-robot. L'enjeu pratique est significatif pour les intégrateurs déployant des humanoïdes en environnements partagés. Jusqu'ici, la distinction soi/autrui dans les robots était traitée soit par des marqueurs extérieurs, soit par des modèles cinématiques codés en dur, deux approches qui échouent dès que le robot opère aux côtés d'agents inconnus ou de copies identiques de lui-même. Que cette capacité puisse émerger d'un signal d'apprentissage auto-supervisé, sans annotation, contredit l'hypothèse selon laquelle la conscience corporelle nécessite une ingénierie explicite. La robustesse face à des robots morphologiquement identiques est particulièrement notable : c'est précisément le scénario qui se généralise dans les lignes d'assemblage où plusieurs unités du même modèle cohabitent. Le problème de la représentation de soi chez les robots est un sujet actif depuis les travaux fondateurs sur le « miroir robotique », mais les approches précédentes restaient limitées à des configurations contrôlées. Côté concurrent, des équipes chez Figure AI, Boston Dynamics et Sanctuary AI travaillent sur des architectures d'apprentissage incarné, mais peu publient sur la distinction soi/autrui en contexte multi-agent. Ce travail reste à ce stade un preprint non évalué par les pairs ; aucun déploiement industriel ni partenariat n'est annoncé. Les auteurs publient une page projet avec démonstrations vidéo, ce qui permettra d'évaluer la robustesse hors conditions de laboratoire.

IA physiquePaper
1 source
Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique
216arXiv cs.RO 

Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique

Des chercheurs ont publié EmboCoach-Bench, un benchmark évaluant la capacité d'agents LLM à automatiser l'ingénierie de politiques pour systèmes robotiques incarnés. Présenté sur arXiv (arXiv:2501.21570), le cadre couvre 32 tâches conçues par des experts en apprentissage par renforcement (RL) et apprentissage par imitation (IL), avec le code exécutable comme interface universelle entre l'agent et l'environnement de simulation. Plutôt que de générer des solutions statiques, les agents opèrent en boucle fermée: ils proposent du code, l'exécutent dans le simulateur, analysent le retour d'environnement, puis itèrent pour corriger et optimiser. Les tâches couvrent des aspects allant de la conception de fonctions de récompense informées par la physique aux architectures de politiques avancées, notamment les diffusion policies. Les résultats quantitatifs méritent attention: les agents autonomes ont surpassé les baselines conçues manuellement par des humains de 26,5% en taux de succès moyen, contestant l'hypothèse selon laquelle l'expertise humaine en reward shaping serait difficilement substituable pour les politiques incarnées. Deuxième enseignement: le workflow agentique avec retour d'environnement réduit substantiellement l'écart de performance entre modèles open-source et propriétaires, ce qui suggère que la boucle de feedback itératif est plus déterminante que le modèle sous-jacent. Enfin, les agents démontrent une capacité de self-correction sur des cas pathologiques d'ingénierie, récupérant des tâches en quasi-échec total via un débogage itératif en simulation. Pour les équipes robotiques, cela représente une voie potentielle pour réduire le temps ingénieur consacré au tuning manuel des hyperparamètres et à la conception artisanale de fonctions de récompense. Ce travail s'inscrit dans une tendance plus large: l'application des workflows agentiques LLM, prouvés dans l'automatisation logicielle et la découverte scientifique, au domaine de l'IA incarnée. Le goulot d'étranglement identifié, à savoir la supervision manuelle intensive pour le réglage des simulations, est un problème structurel bien connu des équipes travaillant sur Optimus (Tesla), GR00T N2 (NVIDIA) ou les systèmes de Figure AI. La contribution différenciante d'EmboCoach-Bench est de proposer un cadre d'évaluation standardisé pour mesurer ce que les agents LLM peuvent réellement automatiser, plutôt que des démos ciblées. Les extensions naturelles incluent l'intégration à des backends hétérogènes (Isaac Lab, MuJoCo, Genesis) et la validation sim-to-real pour confirmer si ces gains en simulation se transfèrent aux systèmes physiques, ce qui reste le test décisif pour une adoption industrielle.

RecherchePaper
1 source
GenHOI : interaction humanoïde-objet sensible aux contacts par imitation de vidéos générées, sans entraînement spécifique
217arXiv cs.RO 

GenHOI : interaction humanoïde-objet sensible aux contacts par imitation de vidéos générées, sans entraînement spécifique

Une équipe de chercheurs propose GenHOI (arXiv:2606.12995, juin 2026), un cadre logiciel permettant à des robots humanoïdes d'interagir avec des objets variés en mode zéro-shot, sans entraînement spécifique à la tâche ni données de démonstration physique. Le système prend en entrée une commande en langage naturel et une image du premier plan de la scène robot-objet reconstruite en simulation, à partir desquels un modèle génératif produit une vidéo d'interaction synthétique orientée tâche. Cette vidéo est analysée pour identifier les événements de contact pertinents et estimer les régions de contact main-objet, encodés sous forme de contraintes géométriques centrées sur l'objet. Ces contraintes servent de priors d'optimisation pour raffiner la trajectoire de référence extraite de la vidéo 2D, résolvant l'ambiguïté d'échelle inhérente à la génération vidéo, et adaptent une trajectoire unique à des poses relatives robot-objet non vues à l'entraînement. Un contrôleur de suivi en boucle fermée assure l'exécution finale. Les tâches validées en simulation et en réel incluent la saisie de boîtes, le transport bimanuel asymétrique d'une chaise, le soulèvement d'une table par en-dessous et l'enveloppement d'objets cylindriques. Il s'agit d'un preprint académique, pas d'un produit déployé. L'enjeu central est la rupture avec le paradigme d'entraînement par tâche, principal goulot d'étranglement du déploiement industriel des humanoïdes. Les approches existantes exigent soit des centaines d'heures de collecte de démonstrations physiques par tâche, soit rejouent des trajectoires rigides incapables de s'adapter à des variations de pose ou d'objet. GenHOI contourne ces deux limites en substituant la génération vidéo à la démonstration réelle, tout en maintenant une conscience physique du contact via des contraintes géométriques explicites. La capacité d'adaptation à des configurations inédites robot-objet sans réentraînement est particulièrement significative pour les intégrateurs industriels devant déployer rapidement un humanoïde sur de nouvelles références produit. La problématique de l'interaction humanoïde-objet est activement travaillée par plusieurs acteurs concurrents : Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, et les équipes de Figure AI ou Boston Dynamics opèrent dans un espace voisin, mais s'appuient majoritairement sur du fine-tuning tâche par tâche ou du reinforcement learning avec simulateurs massivement parallèles. GenHOI se positionne comme une approche complémentaire, plus légère en données, exploitant la capacité des générateurs vidéo récents à produire des séquences physiquement plausibles. La principale limite non adressée est la robustesse à l'échelle sur des centaines de tâches distinctes et la gestion des objets déformables. Les prochaines étapes naturelles seraient une évaluation sur des plateformes commerciales comme l'Unitree G1 ou l'Agility Digit, et une intégration avec des policies de bas niveau plus génériques.

IA physiqueOpinion
1 source
SCALE : observation et exécution adaptatives guidées par l'auto-incertitude dans les modèles VLA
218arXiv cs.RO 

SCALE : observation et exécution adaptatives guidées par l'auto-incertitude dans les modèles VLA

Une équipe de chercheurs propose SCALE (Self-uncertainty Conditioned Adaptive Looking and Execution), une méthode d'inférence adaptative pour les modèles Vision-Language-Action (VLA) publiée sur arXiv (2602.04208v2). Contrairement aux approches de test-time scaling (TTS) existantes, SCALE ne nécessite ni entraînement supplémentaire, ni vérificateur externe, ni passes multiples : un seul passage forward suffit. Le système repose sur un mécanisme de self-uncertainty (auto-incertitude) qui module simultanément deux dimensions : la représentation visuelle, c'est-à-dire comment le modèle perçoit la scène, et l'action produite. Inspiré de la théorie de l'inférence active (Active Inference), SCALE élargit son exploration perceptuelle et motrice en situation d'incertitude élevée, et se concentre sur l'exploitation lorsque la confiance est forte. Les auteurs valident l'approche sur des benchmarks simulés et réels, avec des gains mesurés sur plusieurs VLA de l'état de l'art. L'intérêt industriel est direct. Les méthodes TTS existantes pour robots empruntent leur logique aux succès des LLM comme o1, mais exigent des ressources difficilement compatibles avec la production : vérificateurs externes, passes multiples, parfois fine-tuning ciblé. SCALE lève ce verrou en maintenant l'efficacité d'un passage unique, compatible avec des contraintes de temps réel sur systèmes embarqués. Plus structurellement, la méthode adresse un angle souvent ignoré par les approches concurrentes : l'ambiguïté perceptuelle. En conditions réelles, un robot confronté à une scène mal éclairée ou partiellement occultée a autant besoin de reconsidérer sa perception que son action. SCALE couple ces deux dimensions, là où les TTS classiques n'interviennent qu'au niveau du décodage d'action -- une distinction qui compte dès que l'on sort des environnements contrôlés de laboratoire. Le test-time scaling appliqué à la robotique reste un champ en construction. Des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA visent à généraliser le contrôle robotique via des architectures VLA, mais leur robustesse hors distribution est un problème ouvert. La plupart des améliorations passent encore par du fine-tuning ; SCALE propose une voie alternative en améliorant le comportement à l'inférence sans toucher aux poids du modèle. L'article ne documente pas encore de déploiements industriels à grande échelle, et les benchmarks utilisés restent des environnements relativement balisés. Si la robustesse se confirme dans des configurations non contrôlées, la méthode pourrait s'intégrer comme composant standard dans les pipelines VLA déployés par des acteurs comme Figure AI, Agility Robotics ou 1X Technologies.

IA physiqueOpinion
1 source
LUCID : modèles d'intention agnostiques au morphotype, acquisition dextérique à l'échelle depuis des vidéos humaines
219arXiv cs.RO 

LUCID : modèles d'intention agnostiques au morphotype, acquisition dextérique à l'échelle depuis des vidéos humaines

Des chercheurs ont publié LUCID (arXiv:2606.11628, juin 2026), un framework en deux étapes qui apprend des compétences de manipulation dextère à partir de vidéos humaines non étiquetées issues d'internet, sans démonstrations robotiques coûteuses. LUCID découple l'apprentissage en un modèle d'intention, qui prédit à court horizon ce qui doit se passer ensuite dans la scène en boucle fermée, et une politique sensorimorale spécifique à chaque effecteur, chargée de convertir cette intention en actions concrètes. Ce découplage permet au même modèle d'intention d'opérer sur des effecteurs différents, de la main dextère multi-doigts au préhenseur parallèle à deux mâchoires, sans réentraînement. Le système a été validé sur cinq tâches réelles : mélange, essuyage et tri en bac, supervisés par des vidéos internet uniquement avec transfert zéro-shot vers de nouveaux objets et scènes, et push-T et routage de câbles, supervisés chacun par une heure de vidéo smartphone collectée par les auteurs. Ce résultat s'attaque au principal goulot d'étranglement du robot learning industriel : la dépendance à des démonstrations coûteuses et liées à un embodiment précis. Les pipelines actuels, qu'ils reposent sur la télé-opération (Figure AI, 1X), l'imitation structurée (ACT, Diffusion Policy) ou les VLA end-to-end, exigent tous des données robotiques spécifiques à l'effecteur. LUCID substitue à cela des vidéos humaines à l'échelle web pour la compréhension de tâche, et de la simulation massivement parallèle pour le contrôle moteur. Si le paradigme passe à l'échelle, il réduit significativement les coûts d'intégration pour chaque nouvel effecteur, argument directement adressé aux intégrateurs industriels qui gèrent des parcs de bras multi-marques. LUCID se positionne face à pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui privilégient des architectures end-to-end. La principale différenciation est l'interface d'intention agnostique à l'embodiment, apprise depuis des données internet non étiquetées, ce qui constitue une direction distincte de la course à la collecte massive de démonstrations robotiques. Le preprint ne mentionne ni partenaire industriel ni feuille de route commerciale ; les résultats restent en environnement laboratoire sur des tâches de complexité modérée, et le passage à des contextes industriels non contraints reste à démontrer.

IA physiqueOpinion
1 source
SARM2 : modélisation de récompense multi-tâches par étape pour la manipulation robotique auto-améliorante
220arXiv cs.RO 

SARM2 : modélisation de récompense multi-tâches par étape pour la manipulation robotique auto-améliorante

Des chercheurs publient sur arXiv (2606.10305) SARM2, un modèle de récompense dense multi-tâches pour l'affinement de politiques vision-langage-action (VLA) en manipulation robotique, accompagné du framework SPIRAL (Self-Policy Improvement via Reward-Aligned Learning). L'approche combine un estimateur de stade fondé sur des primitives d'action et une tête de valeur Mixture-of-Experts multi-portes (MMoE) pour produire des récompenses denses à chaque étape sur dix tâches de manipulation distinctes. Sur ce benchmark, SARM2 réduit l'erreur quadratique moyenne d'estimation de valeur de 80 % par rapport aux meilleures méthodes existantes. Via SPIRAL, qui génère des rollouts autonomes et les recycle sans démonstrations humaines supplémentaires, le taux de succès progresse de 58 % à 100 % sur "Folding Shorts" et de 50 % à 90 % sur "Cleaning Whiteboard". Ces résultats pointent un levier concret pour réduire la dépendance au clonage comportemental (behavior cloning), approche encore dominante mais coûteuse : elle exige des démonstrations de haute qualité et bloque les politiques près de la distribution d'entraînement. Un reward model suffisamment dense et précis permet d'alimenter un data flywheel autonome, de réduire les cycles de supervision humaine, et d'adapter les politiques à de nouvelles tâches sans re-collecte de données. Le papier adresse aussi un écueil bien connu du secteur : les reward models VLM généralistes sont trop grossiers pour les tâches longue-horizon, tandis que les modèles spécialisés nécessitent des annotations par tâche. L'architecture MMoE multi-tâches vise précisément cet entre-deux, ce qui intéresse directement les intégrateurs devant déployer un même robot sur des variantes de tâches. Ce travail s'inscrit dans la course intense autour des politiques VLA -- Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), Helix (Figure AI), OpenVLA (UC Berkeley) -- où la phase de fine-tuning et d'amélioration continue reste un goulot d'étranglement non résolu. SARM2 et SPIRAL se positionnent en briques complémentaires au pré-entraînement, ciblant l'adaptation terrain. À ce stade, il s'agit d'un préprint académique sans déploiement industriel annoncé ni code public disponible, et les benchmarks sélectionnés (pliage de vêtements, nettoyage de tableau blanc) restent des tâches de laboratoire contrôlées. La combinaison reward model dense et self-improvement loop sans démonstrations humaines est néanmoins exactement le type de composant que les acteurs commerciaux comme Agility Robotics, Figure AI ou 1X Technologies cherchent à consolider pour abaisser les coûts d'adaptation en production.

IA physiqueOpinion
1 source
Mind Your Steps : un cadre d'apprentissage général pour le suivi précis des appuis de pas chez les robots humanoïdes
221arXiv cs.RO 

Mind Your Steps : un cadre d'apprentissage général pour le suivi précis des appuis de pas chez les robots humanoïdes

Des chercheurs ont déposé le 9 juin 2026 sur arXiv (réf. 2606.08253) un framework léger pour entraîner des politiques de locomotion humanoïde capables de suivre précisément des appuis en 3D. Les approches dominantes basées sur l'apprentissage par renforcement avec commande de vitesse produisent des humanoïdes robustes, mais sans contrôle explicite du placement des pas : le robot peut marcher sur un pied humain ou rater un appui précis, compromettant les tâches de manipulation en aval. La méthode proposée introduit un "goal sampler" dynamique qui génère des séquences d'appuis variées pendant l'entraînement, rendant la politique agnostique au terrain. Une nouvelle représentation des cibles de pas compense les imprécisions du monde réel (estimation de pose bruitée, détection de contact peu fiable). La politique fonctionne comme un contrôleur bas niveau autonome, couplable à n'importe quel planificateur haut niveau, qu'il soit basé sur des cartes 2.5D, la vision ou un agent VLA. L'intérêt pour les intégrateurs industriels est concret : la précision du placement des appuis conditionne l'ensemble des tâches loco-manipulation, soit la prochaine étape critique avant le déploiement d'humanoïdes dans les entrepôts et lignes de montage. En découplant le contrôleur bas niveau du planificateur, cette architecture permet de substituer l'algorithme de planification sans réentraîner la locomotion, un argument de modularité fort pour des déploiements multi-environnements. Les expériences en simulation et en transfert sim-to-real sur terrains complexes sont présentées comme concluantes, mais ce preprint non encore évalué par les pairs ne fournit pas de benchmark comparatif public ni de métriques de précision standardisées. Ce framework s'inscrit dans la continuité des travaux sur la locomotion bipède précise issus d'ETH Zurich, du MIT et de CMU, que les équipes commerciales (Boston Dynamics Atlas, Agility Robotics Digit, Unitree H1, Figure AI) cherchent à industrialiser. L'abstract ne précise pas la plateforme matérielle utilisée lors des tests réels, ce qui limite la reproductibilité des résultats. La prochaine étape logique serait une évaluation ouverte sur des robots nommément identifiés, assortie de métriques comparables aux approches concurrentes en planification de pas développées à l'EPFL ou à Carnegie Mellon.

UEL'EPFL est citée comme référence concurrente pour la planification de pas, ce qui signale la compétitivité des labos européens dans ce domaine, mais sans impact direct sur des acteurs ou institutions français.

HumanoïdesPaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
222arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
Deux ponts, une voie : des VLMs aux VLAs généralisables avec des données de trajectoires couplées à l'IA incarnée
223arXiv cs.RO 

Deux ponts, une voie : des VLMs aux VLAs généralisables avec des données de trajectoires couplées à l'IA incarnée

Un article soumis en juin 2026 sur arXiv (2606.08520) propose une méthode graduée pour convertir des modèles de vision-langage généralistes (VLMs) en politiques de contrôle robotique (VLAs). Les auteurs identifient un double fossé qui explique les échecs du fine-tuning direct : un fossé visuel (les VLMs sont entraînés sur des images internet, pas sur des scènes de manipulation robot) et un fossé d'objectif (passer de la compréhension de texte à la prédiction de commandes motrices). Pour combler ces deux ruptures progressivement, ils introduisent les "embodied trajectory-coupled data" (ETC), des paires vision-langage extraites des mêmes trajectoires et environnements visuels que ceux utilisés pour l'entraînement à l'action, mais conservant un objectif de supervision en langage naturel. La recette d'entraînement se déroule en trois étapes séquentielles : Distribution Bridging (adaptation sémantique au domaine incarné), Objective Bridging (transition progressive vers la prédiction d'action), puis Retentive Adaptation (spécialisation au domaine de déploiement cible). Les expériences sont validées en simulation et sur robot réel, sans que l'abstract ne précise le matériel ni les benchmarks utilisés. La contribution centrale n'est pas un nouveau modèle mais une stratégie de curriculum d'entraînement qui conteste une hypothèse répandue dans la communauté : que le fine-tuning direct sur données d'action suffit, comme cela fonctionne pour d'autres domaines (vision médicale, OCR). Le papier montre expérimentalement que ce raccourci provoque une dégradation des généralisations acquises en préentraînement, phénomène particulièrement prononcé dans les architectures multimodales. Pour les intégrateurs, l'enjeu est concret : les ETC data peuvent être générées depuis des trajectoires déjà enregistrées sans coût de collecte supplémentaire, et les mélanger avec une faible quantité de données d'action permettrait de généraliser à de nouvelles conditions visuelles et linguistiques sans démonstrations supplémentaires, ce qui adresse directement le problème du long-tail en déploiement industriel. Ce travail s'inscrit dans la dynamique ouverte par RT-2 (Google DeepMind, 2023) qui a lancé la course aux VLAs, avec des modèles comme pi-zéro (Physical Intelligence), OpenVLA, ou RoboFlamingo comme repères concurrents. Le coût des données d'action robotique reste le noeud central pour des acteurs comme Figure AI, 1X Technologies ou Agility Robotics, qui financent massivement la collecte en déploiement réel. L'approche ETC propose une voie complémentaire en valorisant les trajectoires déjà existantes, sans nécessairement passer par de nouvelles sessions de télé-opération. Au stade de la soumission, les auteurs n'ont annoncé ni code public ni implémentation open-source.

IA physiqueOpinion
1 source
Évolution des récompenses par graphe de pensées : un cadre bilingue à deux niveaux pour l'apprentissage par renforcement
224arXiv cs.RO 

Évolution des récompenses par graphe de pensées : un cadre bilingue à deux niveaux pour l'apprentissage par renforcement

Une équipe de chercheurs a publié RE-GoT (Reward Evolution with Graph-of-Thoughts), un cadre de conception automatique de fonctions de récompense pour l'apprentissage par renforcement (RL). La méthode, présentée dans l'article arXiv:2509.16136 (version 5), associe des grands modèles de langage (LLM) à des modèles visuels (VLM) via un raisonnement structuré en graphe. RE-GoT décompose d'abord la tâche cible en un graphe d'attributs textuels, génère une fonction de récompense correspondante, puis la raffine itérativement en exploitant les retours visuels fournis par un VLM, sans intervention humaine. Évalué sur 10 tâches RoboGen et 4 tâches ManiSkill2, le système améliore le taux de succès moyen de 32,25 % sur RoboGen par rapport aux baselines LLM existantes, et atteint 93,73 % de taux de succès sur les quatre tâches de manipulation de ManiSkill2, dépassant même les récompenses conçues manuellement par des experts. L'enjeu est significatif : la conception des fonctions de récompense représente l'un des principaux goulots d'étranglement du RL appliqué à la robotique, et elle exige aujourd'hui une expertise humaine considérable ainsi que de nombreuses itérations manuelles. RE-GoT adresse deux faiblesses chroniques des approches LLM existantes : les hallucinations, que la structure en graphe réduit en contraignant le raisonnement, et l'incapacité à traiter des tâches multi-étapes complexes. Le fait que RE-GoT surpasse les récompenses expertes sur ManiSkill2 est notable, bien qu'il convienne de nuancer : les expériences restent dans des environnements simulés, et la question du sim-to-real gap, cruciale pour les industriels souhaitant déployer ces méthodes sur des robots physiques, n'est pas traitée dans ce travail. Ce travail s'inscrit dans une dynamique de recherche active depuis 2023, notamment portée par Eureka (NVIDIA, octobre 2023), qui utilisait GPT-4 pour générer des fonctions de récompense sur IsaacGym, ou par FunsSearch (DeepMind). RE-GoT se distingue en introduisant le paradigme Graph-of-Thoughts, une extension du Chain-of-Thought qui organise le raisonnement en graphe plutôt qu'en chaîne linéaire, permettant une analyse plus exhaustive des dépendances entre sous-tâches. Les prochaines étapes naturelles concernent la validation sur robots physiques et l'intégration à des pipelines sim-to-real comme ceux utilisés par Figure AI, Agility Robotics ou Boston Dynamics dans leurs boucles d'entraînement.

RecherchePaper
1 source
ActiveMimic : pré-entraînement sur vidéo égocentrique avec perception active
225arXiv cs.RO 

ActiveMimic : pré-entraînement sur vidéo égocentrique avec perception active

Des chercheurs ont publié ActiveMimic (arXiv:2606.06194, juin 2026), un framework de pré-entraînement robotique qui exploite des vidéos égocentrées humaines captées par une simple caméra RGB portée sur le corps. La contribution technique centrale : plutôt que de traiter les mouvements de caméra comme du bruit, comme le font les pipelines standards, ActiveMimic récupère des trajectoires synchronisées de la caméra et du poignet depuis ce seul flux vidéo, puis modélise le déplacement de la caméra comme une "action de point de vue" à part entière. Le framework apprend ainsi simultanément la perception active et la manipulation à partir de vidéos humaines capturées en conditions réelles, avant d'être adapté à un robot cible via fine-tuning. Sur plusieurs tâches de manipulation impliquant des degrés variés de perception active, les expériences en conditions réelles montrent qu'ActiveMimic surpasse les baselines pré-entraînées sur vidéo humaine classique et atteint les performances des modèles pré-entraînés sur données robotiques. Ce résultat est notable car la vidéo égocentrée humaine est disponible à grande échelle sans nécessiter de robot, mais les modèles qui en étaient issus sous-performaient systématiquement face à ceux entraînés sur données robotiques. ActiveMimic identifie le signal manquant : la perception active, soit le comportement naturel par lequel un humain repositionne continuellement son point de vue pendant une manipulation. Ce mécanisme, invisible pour les pipelines qui traitent la motion de caméra comme artefact, s'avère être le facteur clé pour extraire la valeur de ces vidéos. Les expériences indiquent en outre que la capacité de perception active émerge du pré-entraînement sur vidéo humaine et non du fine-tuning robot-spécifique, ce qui suggère une transférabilité potentielle à d'autres architectures et morphologies. Ce travail s'inscrit dans une compétition dense autour des modèles vision-action (VLA) pour la manipulation robotique généraliste. Physical Intelligence avec Pi-0, Google DeepMind avec RT-2, et les équipes de Figure AI exploitent des architectures VLA pré-entraînées, mais s'appuient majoritairement sur des données de téléopération robotique, coûteuses et lentes à collecter. Si l'approche d'ActiveMimic se confirme sur des benchmarks indépendants et des environnements non contrôlés, elle pourrait réduire significativement ce goulot d'étranglement en substituant une partie des données robotiques par de la vidéo humaine abondante. Les prochaines étapes naturelles incluent la validation industrielle, l'extension à des morphologies variées, et l'évaluation de la scalabilité avec des volumes de vidéo égocentrée plus importants.

RechercheOpinion
1 source
HERO : saisie visuelle d'objets à vocabulaire ouvert par contrôle corps entier d'un humanoïde
226arXiv cs.RO 

HERO : saisie visuelle d'objets à vocabulaire ouvert par contrôle corps entier d'un humanoïde

Des chercheurs ont publié sur arXiv (référence 2602.16705, version 3) un système de manipulation locomotrice pour humanoïdes baptisé HERO (Humanoid End-Effector Residual cOntrol), conçu pour saisir des objets du quotidien sans liste prédéfinie de cibles. Le système fonctionne en open-vocabulary : il identifie visuellement les objets via des images RGB-D et des grands modèles de vision, puis planifie et exécute la saisie en temps réel. L'innovation centrale est une politique de suivi de l'effecteur terminal (EE) dite "résidual-aware", qui combine trois composants : une cinématique inverse pour convertir les cibles résiduelles de l'EE en trajectoires de référence, un modèle neuronal de cinématique directe entraîné en simulation, et un mécanisme de ré-planification dynamique. Ce pipeline réduit l'erreur de suivi de l'effecteur à 2,44 cm, soit une amélioration annoncée de 5,5x par rapport à la meilleure méthode antérieure. Les tests en environnements réels, bureaux, cafés, démontrent la saisie de mugs, pommes et jouets sur des surfaces allant de 43 à 92 cm de hauteur. L'approche modulaire de HERO rompt avec la tendance dominante des méthodes end-to-end monolithiques (apprentissage par imitation, sim-to-real intégral) qui peinent à généraliser sans retraining massif. En séparant la compréhension de scène, déléguée aux fondations vision, du contrôle moteur précis, entraîné entièrement en simulation, les auteurs obtiennent une généralisation out-of-distribution plus robuste sur de nouveaux environnements. Pour un intégrateur, cela signifie potentiellement moins de données de démonstration à collecter par site de déploiement. Les 2,44 cm d'erreur restent trop élevés pour des tâches d'assemblage de précision, mais suffisants pour le pick-and-place d'objets courants. La métrique "5,5x meilleure" mérite réserve : les conditions exactes du benchmark ne sont pas détaillées dans l'abstract. Ce travail s'inscrit dans une course dense sur le contrôle loco-manipulation des humanoïdes. Physical Intelligence avec Pi-0, Figure AI avec Figure 03, Agility Robotics avec Digit, et Unitree explorent tous des pipelines combinant grands modèles de vision-langage-action (VLA) et contrôle fin de l'effecteur. La question du sim-to-real gap reste le principal verrou non résolu dans le secteur pour les tâches de manipulation dextre, et HERO propose une réponse architecturale partielle en hybridant cinématique classique et apprentissage neuronal, une direction explorée également par des équipes européennes comme Wandercraft sur leurs plateformes bipèdes. Aucun partenariat industriel ni timeline de déploiement n'est mentionné : il s'agit pour l'instant d'un résultat de recherche, pas d'un produit commercialisé.

UEDes équipes européennes comme Wandercraft explorent des architectures similaires sur le contrôle bipède ; l'approche hybride de HERO (cinématique classique + apprentissage neuronal) peut informer leurs pipelines de R&D, mais l'impact reste indirect, sans déploiement ni partenariat industriel européen associé.

IA physiquePaper
1 source
EgoHumanoid : la manipulation locomotrice en environnement réel grâce aux démonstrations égocentriques sans robot
227arXiv cs.RO 

EgoHumanoid : la manipulation locomotrice en environnement réel grâce aux démonstrations égocentriques sans robot

EgoHumanoid, publié sur arXiv (identifiant 2602.10106), propose un framework pour entraîner des robots humanoïdes à la loco-manipulation, c'est-à-dire la coordination simultanée de la locomotion et de la manipulation d'objets, en exploitant des démonstrations humaines égocentrées plutôt que de la télé-opération robotique classique. L'architecture co-entraîne une politique VLA (vision-language-action) sur un corpus mixte composé de larges volumes de vidéos humaines en vue à la première personne, complétés par un volume limité de données robot. Pour réduire le fossé morphologique entre humains et robots, les auteurs ont développé un système portable de collecte de données et deux modules d'alignement : un alignement de vue corrigeant les différences de hauteur et de perspective entre caméra humaine et capteur robot, et un alignement d'action transposant les mouvements humains vers un espace cinématiquement réalisable par le robot. Les expériences en environnements réels montrent que l'ajout des données égocentrées humaines dépasse les baselines entraînées sur données robot seules de 51 %, avec un gain particulièrement marqué sur des environnements non vus lors de l'entraînement. La loco-manipulation humanoïde est l'un des problèmes les plus gourmands en données de la robotique moderne : le robot doit simultanément planifier ses déplacements et interagir avec des objets dans des espaces non structurés. EgoHumanoid valide l'hypothèse que la diversité des démonstrations humaines compense la différence morphologique, à condition de résoudre correctement les alignements de vue et d'action. Pour les intégrateurs et décideurs industriels, cela signale une voie de scaling de la donnée nettement moins chère que la télé-opération spécialisée, sans dépendre de simulateurs dont le transfert sim-to-real reste incertain. La démonstration humaine pour les robots manipulateurs d'établis est une pratique établie, mais son extension aux humanoïdes en loco-manipulation restait peu explorée. EgoHumanoid se positionne directement face aux pipelines de collecte adoptés par les grands acteurs, notamment Figure AI avec Helix, Physical Intelligence avec Pi-0 et NVIDIA avec GR00T N2, qui s'appuient tous sur des approches intensives en télé-opération ou en simulation. Il s'agit d'une publication académique, sans annonce de produit ni déploiement commercial associé. Les suites logiques seraient une validation à plus grande échelle du protocole de collecte humaine et une intégration dans des frameworks VLA existants pour tester la montée en charge sur des tâches industrielles réelles.

RechercheOpinion
1 source
Unitree Robotics fixe son introduction en bourse au 1er juin, visant à devenir le premier fabricant de robots humanoïdes coté en Chine
228Pandaily 

Unitree Robotics fixe son introduction en bourse au 1er juin, visant à devenir le premier fabricant de robots humanoïdes coté en Chine

Unitree Robotics, fabricant chinois de robots humanoïdes et quadrupèdes, est convoqué le 1er juin 2026 devant le comité d'examen de la STAR Market de la Bourse de Shanghai pour son audition pré-introduction en bourse. La date a été confirmée dans un document officiel publié le 25 mai : il s'agit de la 31e séance d'examen de l'année. Le dossier d'admission avait été accepté il y a un peu plus de deux mois, soit fin mars 2026, un délai d'instruction court qui signale une priorité réglementaire affirmée. Si le comité valide le dossier, Unitree deviendrait la première entreprise de robots humanoïdes cotée en Chine. Le périmètre d'activité déclaré couvre les robots humanoïdes polyvalents, les robots quadrupèdes, les composants robotiques et la R&D en modèles d'IA incarnée. L'entreprise s'est imposée à l'international avec le Unitree Go2, robot quadrupède vendu à un tarif nettement inférieur aux offres concurrentes, ce qui lui a permis d'atteindre une large base de développeurs et de chercheurs. Plus récemment, elle a accéléré son programme humanoïde pour concurrencer directement Tesla Optimus, Fourier Intelligence et Figure AI. L'enjeu de cette cotation dépasse le seul cas Unitree : le marché attend une valorisation de référence pour un secteur où les coûts de R&D, de fabrication et de test en conditions réelles restent très élevés. Accéder aux marchés de capitaux via la STAR Market ouvrirait un canal de financement structurant pour les entreprises chinoises de robotique humanoïde, dans un contexte où la course à la production à grande échelle exige des investissements massifs. Pour les intégrateurs industriels et les décideurs B2B qui suivent le secteur, une première cotation réussie signalerait que le marché valorise la robotique humanoïde comme une infrastructure industrielle à part entière et non plus comme un horizon de recherche. Cela pourrait accélérer les décisions d'achat et les partenariats, les clients institutionnels étant souvent plus enclins à travailler avec des fournisseurs dotés d'une transparence financière publique. Fondée à Hangzhou, Unitree a construit sa réputation sur la démocratisation du prix des robots à pattes, là où Boston Dynamics positionnait ses produits exclusivement sur le segment premium. La STAR Market, créée en 2019 sur le modèle du Nasdaq américain pour accueillir des entreprises technologiques à forte intensité capitalistique, est le terrain d'introduction naturel pour ce type de dossier. Sur le plan concurrentiel, Unitree fait face en Chine à Fourier Intelligence et à Agility Robotics dans une moindre mesure, ainsi qu'aux ambitions croissantes de UBTECH Robotics, déjà cotée à Hong Kong depuis 2023. À l'international, Tesla et Figure AI fixent le rythme médiatique, mais sans cotation comparable. L'audition du 1er juin ne garantit pas l'approbation finale ; une décision favorable ouvrirait la voie à une introduction effective dans les semaines suivantes, dont le calendrier précis n'a pas été communiqué.

UEUne introduction en bourse réussie d'Unitree renforcerait massivement sa capacité d'investissement en R&D et fabrication, intensifiant la pression concurrentielle sur les fabricants et intégrateurs robotiques européens.

Chine/AsieOpinion
1 source
Robot humanoïde chinois épate en dansant le ballet aux côtés de danseurs humains
229Interesting Engineering 

Robot humanoïde chinois épate en dansant le ballet aux côtés de danseurs humains

UBTECH, entreprise chinoise de robotique fondée à Shenzhen, a présenté son nouveau robot humanoïde Walker C1 lors d'une performance live de ballet et de valse tirée du Lac des Cygnes, aux côtés de danseurs humains. La démonstration, organisée dans le cadre de la China International Supply Chain Expo (Chain Expo) 2026, dont UBTECH vient d'être désigné partenaire humanoïde officiel exclusif, visait à illustrer les capacités de contrôle de mouvement, d'équilibre dynamique et de coordination du robot. Le Walker C1 est un humanoïde électrique pleine taille conçu pour les environnements de service public, accueil d'hôtels, aéroports, centres d'exposition et centres commerciaux. Il intègre un module de navigation autonome U-SLAM, un contrôle de mouvement corps entier, et une vitesse de marche de 6 km/h. Il supporte l'interaction multilingue et est alimenté par un grand modèle d'interaction incarnée développé en interne. UBTECH n'a pas publié de fiche technique complète du C1 au moment de l'annonce. Une unité est déjà déployée à l'Expo 2025 d'Osaka, où elle opère comme guide intelligent dans le pavillon chinois. La démonstration chorégraphique est avant tout un exercice de communication, pas une validation de performance industrielle. Aucune métrique précise sur les degrés de liberté, le couple articulaire ou la précision de répétabilité du C1 n'a été communiquée, ce qui limite l'interprétation technique. En revanche, les données commerciales d'UBTECH méritent davantage d'attention : l'entreprise a enregistré environ 800 millions de yuans (113 millions de dollars) de commandes en 2025, dont un contrat de 250 millions de yuans (35 M$) signé en septembre avec une grande entreprise chinoise non nommée, ainsi que des engagements de 159 millions de yuans en Sichuan et 126 millions de yuans au Guangxi. Ces chiffres signalent un passage concret du stade prototype à la production commerciale à grande échelle. Le secteur automobile se révèle le principal moteur de la demande, avec BYD, Geely, FAW-Volkswagen, Dongfeng Liuzhou Motor et Foxconn comme clients actifs pour des applications de manufacturing et de logistique. UBTECH a franchi en 2025 le cap des 1 000 unités Walker S2 produites dans son usine de Liuzhou, avec plus de 500 robots déjà déployés en opération réelle. L'entreprise cible une capacité de production de 10 000 unités par an d'ici fin 2026. Dans ce contexte, la Chine consolide une course humanoïde qui implique aussi LimX Dynamics, dont le robot Oli avait réalisé une performance de ballet similaire l'an dernier, ainsi que Unitree et Fourier Intelligence. À l'international, les concurrents directs incluent Figure AI, Agility Robotics (Amazon) et Boston Dynamics sur le segment industriel, et Apptronik sur le service. La stratégie d'UBTECH combine une vitrine médiatique grand public via la danse, et un ancrage commercial fort sur les sites industriels et d'exposition, une dualité qui reflète l'ambition de transformer le robot humanoïde en produit de série avant ses rivaux occidentaux.

UELa montée en puissance commerciale d'UBTECH en Chine (10 000 unités/an visées fin 2026, 800 M¥ de commandes en 2025) intensifie la pression concurrentielle sur les acteurs européens positionnés sur les humanoïdes de service et industriels.

Chine/AsieOpinion
1 source
Pourquoi Tesla mise des milliards sur Optimus
230Robot Magazine FR 

Pourquoi Tesla mise des milliards sur Optimus

Tesla a engagé un pivot stratégique majeur vers la robotique humanoïde avec son robot Optimus, présenté pour la première fois en 2021 et progressivement monté en priorité interne. Selon des déclarations publiques répétées d'Elon Musk courant 2024-2025, le groupe recrute massivement des ingénieurs en vision par ordinateur, robotique et IA, sans que des chiffres précis d'investissement ou de volumes de production n'aient été officiellement communiqués. Musk a qualifié Optimus de "produit le plus important de Tesla", positionnant le robot comme une plateforme capable d'intervenir dans les usines, entrepôts, logistique et services grand public. À date, Tesla a publié des démonstrations vidéo d'Optimus réalisant des tâches manuelles en environnement contrôlé. Il n'existe pas encore de déploiement industriel à l'échelle documenté ni de prix catalogue annoncé pour des tiers. L'intérêt stratégique d'Optimus repose sur une hypothèse structurelle : le marché des robots humanoïdes polyvalents pourrait dépasser celui de l'automobile à long terme. Pour les décideurs industriels, la promesse est réelle, les humanoïdes pourraient théoriquement remplacer des postes de travail répétitifs sans reconfigurer entièrement les lignes de production, contrairement aux bras industriels fixes. Mais l'écart entre démonstration et déploiement opérationnel reste considérable. Le "demo-to-reality gap" n'est pas comblé : aucun constructeur, ni Tesla, ni Figure AI, ni Boston Dynamics, n'a prouvé une fiabilité suffisante en conditions réelles non supervisées à grande échelle. Ce que le pivot Tesla prouve, c'est que la narration "constructeur automobile" ne suffit plus à soutenir une valorisation boursière qui restait, début 2025, un multiple très élevé par rapport aux revenus automobiles nets. Tesla arrive sur un marché humanoïde déjà encombré. Figure AI (Figure 03, en partenariat avec BMW) a annoncé des déploiements en usine. Agility Robotics (Digit) est en production chez Amazon. Physical Intelligence (pi-0) et 1X Technologies progressent sur les modèles fondationnels robotiques. Boston Dynamics positionne Atlas sur les environnements industriels difficiles. NVIDIA soutient l'écosystème via GR00T et la plateforme Isaac. La Chine industrialise rapidement avec Unitree et Fourier Intelligence. Tesla dispose d'un avantage potentiel : l'accès à d'immenses volumes de données réelles via ses véhicules et ses usines, et une chaîne de fabrication à bas coût. Mais la pression concurrentielle sur l'automobile, notamment de BYD, Xiaomi et Xpeng, comprime les marges et renforce l'urgence de diversifier les revenus. Une éventuelle IPO de SpaceX constitue un risque de dilution d'attention capitalistique supplémentaire pour Tesla. Les prochaines étapes à surveiller : un déploiement interne dans les Gigafactories, et une éventuelle communication sur les métriques de fiabilité opérationnelle.

HumanoïdesOpinion
1 source
La Chine mise sur l'IA et la fabrication avancée pour contrer les vents économiques contraires
231SCMP Tech 

La Chine mise sur l'IA et la fabrication avancée pour contrer les vents économiques contraires

Le Premier ministre chinois Li Qiang a effectué lundi une visite symbolique à Pékin, passant par l'usine de véhicules électriques de Xiaomi puis par le Humanoid Robot Innovation Centre, un hub qui regroupe plus d'une douzaine de start-ups spécialisées en IA incarnée (embodied AI), des partenaires industriels et des institutions de recherche. Lors de cette tournée, Li a appelé à une intégration accélérée entre les acteurs de l'IA et le secteur de la fabrication avancée, positionnant cette convergence comme levier de croissance prioritaire face au ralentissement de la demande intérieure et aux pressions commerciales extérieures, notamment les tensions tarifaires avec les États-Unis. Le signal politique est clair : Pékin veut transformer ses capacités en robotique humanoïde et en IA générative en avantages compétitifs industriels concrets, pas seulement en vitrines technologiques. Pour les intégrateurs et décideurs B2B, cela signifie une accélération probable des déploiements pilotes en usine, avec un soutien étatique direct aux start-ups locales. La visite du Humanoid Robot Innovation Centre illustre aussi la stratégie de clustering : concentrer capital, talents et clients industriels pour réduire le fossé entre démo lab et déploiement réel. Ce mouvement s'inscrit dans une trajectoire déjà engagée : la Chine a multiplié les programmes de soutien à la robotique humanoïde depuis 2023, avec des acteurs comme Unitree, Fourier Intelligence ou Agibot qui affichent des cadences de production croissantes. Face à eux, les acteurs américains (Figure AI, Physical Intelligence, Tesla Optimus) et européens avancent sur des segments différents. La prochaine étape à surveiller sera la concrétisation de ces orientations politiques en contrats industriels mesurables.

UEL'accélération du soutien étatique chinois à la robotique humanoïde intensifie la pression concurrentielle sur les acteurs européens, qui devront consolider des niches différenciées face à des cadences de production chinoises croissantes.

Chine/AsieOpinion
1 source
Vendredi vidéo : des engins de chantier lourds fonctionnent de façon autonome
232IEEE Spectrum Robotics 

Vendredi vidéo : des engins de chantier lourds fonctionnent de façon autonome

Cette semaine dans le panorama robotique publié par IEEE Spectrum, la démonstration la plus concrète provient d'ETH Zurich, qui présente la première solution d'autonomisation complète déployée sur un engin de manutention de matériaux industriels de 40 tonnes en conditions réelles, un manipulateur hydraulique équipé d'une pince libre sous-actionnée traditionnellement opéré par un conducteur humain dans les secteurs des déchets, de la construction et de la démolition. La Norwegian University of Science and Technology (NTNU) a publié en open-source son Unified Autonomy Stack, une architecture de navigation combinant LiDAR, radar, vision et centrale inertielle pour robots aériens et terrestres à pattes, validée en environnements GNSS-dégradés ; le système intègre raisonnement visio-langagier, planification multi-comportements et couches de sécurité par fonctions de barrière de contrôle. En parallèle, Figure AI a diffusé une vidéo de rangement de chambre sans préciser le modèle de robot utilisé ni les conditions de tournage. Unitree a présenté un véhicule civil habité transformable pesant environ 500 kg avec conducteur à bord. La startup Lumos a annoncé NIX, un robot humanoïde orienté danse urbaine et IA incarnée, disponible gratuitement pour des partenaires sélectionnés parmi des universités, laboratoires de robotique et technologues créatifs. L'autonomisation d'engins lourds présente un ratio effort/impact plus favorable à court terme que le déploiement humanoïde grand public : les machines de 40 tonnes opèrent sur des cycles répétitifs en environnements semi-structurés, rendant la tâche plus tractable pour les systèmes actuels. L'intégration réalisée par ETH Zurich est notable parce qu'elle s'appuie sur un engin existant, sans reconstruire une nouvelle plateforme dédiée. L'open-sourcing du stack NTNU répond à un verrou réel : la navigation robuste sans GPS reste un frein majeur pour les déploiements en intérieur industriel ou en zones isolées. Sur les humanoïdes, l'éditorial d'IEEE Spectrum formule explicitement une mise en garde contre les revendications de "niveau humain" sur des tâches de manipulation : les humains sont structurellement très performants dans ce type de travail, et les évaluer correctement exige des benchmarks rigoureux, un rappel pertinent pour les décideurs B2B qui instruisent des pilotes. Rodney Brooks, cofondateur et CTO de Robust.AI, classé 44e au Forbes 250 America's Greatest Innovators, s'est exprimé sur les défis structurels de l'innovation robotique et la signification de la vague IA actuelle pour le secteur, soulignant que la difficulté fondamentale reste l'intégration fiable en monde ouvert. Agility Robotics, dont le bipède Cassie est évoqué comme référence historique de la recherche en locomotion, poursuit sa trajectoire vers son humanoïde Digit. Du côté de la recherche fondamentale, la méthode EFGCL (reinforcement learning guidé par forces assistives) démontre des mouvements dynamiques, sauts, backflips et vrilles latérales, sur robots à pattes, une direction qui alimente les futures plateformes de loco-manipulation. L'University of Southern California explore pour sa part l'utilisation de robots à pattes pour la récolte légumière en contexte agricole réel, un cas d'usage concret dont les performances à l'échelle restent à documenter.

UEETH Zurich (Suisse) démontre l'autonomisation complète d'un engin de manutention de 40 tonnes sur équipement existant sans nouvelle plateforme dédiée, et NTNU publie en open-source un stack de navigation robuste sans GPS, deux contributions de la recherche européenne directement applicables à l'automatisation industrielle et logistique sur le marché EU.

IndustrielActu
1 source
La Chine attribue des numéros d'identification officiels aux robots humanoïdes pour suivre leur cycle de vie complet
233Interesting Engineering 

La Chine attribue des numéros d'identification officiels aux robots humanoïdes pour suivre leur cycle de vie complet

La province du Hubei, en Chine, lance un système d'identification officielle pour les robots humanoïdes : chaque machine recevra désormais un code unique de 29 caractères, comparable au numéro de carte d'identité nationale, avec 11 caractères supplémentaires propres au secteur robotique. Ce code embarque l'origine du fabricant, le modèle produit, le numéro de série, les spécifications matérielles, le niveau d'intelligence et les données de sortie d'usine. L'initiative est pilotée par le Hubei Humanoid Robot Innovation Center, basé à Wuhan, qui a déjà finalisé les dossiers de demande et les tests de codage pour une première vague d'entreprises soumises au ministère de l'Industrie et des Technologies de l'Information (MIIT). Les sociétés participant à ce premier lot incluent Optics Valley Dongzhi, Glroad, Hubei Qirobotics, Jingchu Humanoid Robot, HandX, Guanggu Haribit et Maxnova, dont plusieurs robots ont déjà été enregistrés. Ces systèmes sont actuellement déployés dans la fabrication industrielle, les services commerciaux et les démonstrations de formation. L'émission officielle des numéros débutera une fois les normes nationales correspondantes adoptées par le MIIT. Au-delà du registre de base, la plateforme numérique associée centralise le suivi opérationnel tout au long du cycle de vie de chaque robot : historique de maintenance, scénarios d'utilisation, usure des articulations, état des batteries et précision des mouvements sont accessibles en temps réel via l'identifiant unique. Pour les intégrateurs et les équipes de maintenance, cela signifie une identification rapide des pannes par consultation des journaux de service, sans multiplier les inspections à chaque redéploiement. Le système vise également à clarifier les responsabilités en cas de dysfonctionnement ou d'incident de données, et à fluidifier un marché secondaire naissant : un futur acquéreur pourra accéder directement à l'historique complet d'un robot via son profil ID. C'est un changement structurant pour un secteur jusqu'ici fragmenté, où l'absence de cadre unifié pour la traçabilité, la supervision de sécurité et l'échange de données freinait la montée en échelle industrielle. Ce déploiement s'inscrit dans un marché en croissance rapide mais encore morcelé. En 2025, les expéditions mondiales de robots humanoïdes ont atteint environ 17 000 unités, pour un marché évalué à 2,88 milliards de yuans. La Chine y occupe une position dominante : plus de 140 fabricants actifs, environ 14 400 unités expédiées, soit 84,7 % de la production mondiale, et un marché domestique estimé à 1,55 milliard de yuans représentant 53,8 % du total global. Face à des acteurs occidentaux comme Boston Dynamics, Figure AI, Agility Robotics ou 1X Technologies, la stratégie chinoise mise sur la standardisation de l'écosystème plutôt que sur les seules prouesses techniques. Le système d'identification du Hubei est présenté comme un pilote national destiné à s'étendre une fois les standards MIIT finalisés, avec pour ambition explicite de soutenir un développement industriel à grande échelle.

UELa standardisation chinoise du cycle de vie des robots humanoïdes risque d'accélérer la montée en échelle industrielle de la Chine et de creuser l'écart compétitif avec les fabricants et intégrateurs européens, qui ne disposent pas encore d'un cadre équivalent de traçabilité et de supervision.

Chine/AsieActu
1 source
RoboLab : benchmark de simulation haute fidélité pour l'analyse des politiques généralistes multi-tâches
234arXiv cs.RO 

RoboLab : benchmark de simulation haute fidélité pour l'analyse des politiques généralistes multi-tâches

Des chercheurs du Spatial Reasoning Lab de NVIDIA ont publié sur arXiv (papier 2604.09860, version 3, mai 2026) RoboLab, un framework de benchmarking en simulation conçu pour évaluer les politiques robotiques généralistes. Le coeur du système est le benchmark RoboLab-120, qui regroupe 120 tâches réparties selon trois axes de compétences, visuel, procédural, relationnel, et trois niveaux de difficulté. Ce qui distingue RoboLab des benchmarks existants est la capacité à générer des scènes et des tâches de manière programmatique, aussi bien par authoring humain que via un LLM, dans un environnement de simulation haute fidélité conçu pour être agnostique au robot et à la politique évaluée. Le framework tente de répondre à deux questions précises : dans quelle mesure le comportement en simulation prédit-il les performances réelles, et quels facteurs influencent le plus le comportement d'une politique ? L'enjeu est directement lié à un problème structurel du domaine : la saturation rapide des benchmarks actuels. La plupart des évaluations existantes présentent un chevauchement significatif entre les données d'entraînement et les données d'évaluation, ce qui gonfle artificiellement les taux de succès et masque les vraies faiblesses en généralisation. RoboLab introduit des perturbations contrôlées pour mesurer la sensibilité des politiques et expose, selon les auteurs, un écart de performance notable chez les modèles état de l'art actuels. Pour un intégrateur ou un COO industriel, c'est une mise en garde : les chiffres de benchmark publiés par les fondeurs de modèles VLA (Vision-Language-Action) ne reflètent pas nécessairement la robustesse en conditions réelles. Ce travail s'inscrit dans la course aux politiques généralistes qui mobilise toute l'industrie : Physical Intelligence avec pi0, Boston Dynamics et sa roadmap manipulation, Figure AI avec Figure 03, et NVIDIA lui-même avec GR00T N2 comme modèle de référence. Le SRL (Spatial Reasoning Lab) de NVIDIA se positionne ici en fournisseur d'infrastructure d'évaluation plutôt qu'en compétiteur direct sur les politiques, un rôle analogue à celui que joue MLCommons pour l'inférence LLM. Le projet dispose d'un site dédié (research.nvidia.com/labs/srl/projects/robolab/), mais reste pour l'instant un preprint non peer-reviewed : aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RechercheOpinion
1 source
DSSP : une politique d'état de diffusion avec encodage de l'historique complet
235arXiv cs.RO 

DSSP : une politique d'état de diffusion avec encodage de l'historique complet

Une équipe de recherche a publié en mai 2026 un préprint sur arXiv (2605.14598) présentant DSSP, Diffusion State Space Policy, une nouvelle architecture de politique robotique pour la manipulation. Le principe central : conditionner la génération d'actions non plus sur une fenêtre courte d'observations récentes, comme le font la majorité des politiques diffusion existantes, mais sur l'intégralité de l'historique d'observations depuis le début de la tâche. L'encodeur d'historique repose sur des State Space Models (SSMs), qui compriment le flux complet d'observations en une représentation contextuelle compacte. Un objectif d'entraînement auxiliaire dit "dynamics-aware" optimise cet encodeur pour préserver les informations pertinentes à l'évolution future de l'état. Ce contexte de haut niveau est ensuite fusionné avec les observations récentes dans un mécanisme de conditionnement hiérarchique, et le backbone diffusion lui-même est également instancié via un SSM pour limiter la mémoire GPU. Les expériences couvrent des benchmarks en simulation et des tâches de manipulation réelles. Le problème que DSSP cherche à résoudre est structurel dans les approches actuelles : les tâches longue durée génèrent des ambiguïtés que seule la mémoire étendue permet de lever. Une pince qui répète la même séquence de sous-tâches ou qui doit adapter son comportement en fonction d'un état vu dix secondes plus tôt ne peut pas le faire si le modèle n'a accès qu'à la dernière frame ou à une fenêtre de deux secondes. Les auteurs rapportent des performances état-de-l'art avec une taille de modèle significativement inférieure aux concurrents, ce qui est un argument industriel non trivial : des modèles plus légers facilitent le déploiement sur du compute embarqué et réduisent les coûts d'inférence. L'utilisation des SSMs plutôt que des Transformers pour l'encodage de séquences longues est cohérente avec des travaux récents (Mamba, Mamba-2) montrant que cette famille d'architectures offre une complexité linéaire en longueur de séquence, là où l'attention quadratique pénalise fortement les historiques longs. Ce travail s'inscrit dans un courant actif depuis la publication de Diffusion Policy (Chi et al., Columbia/MIT, 2023), qui a établi la diffusion comme paradigme dominant pour l'imitation learning en manipulation. Des acteurs comme Physical Intelligence avec pi-0, NVIDIA avec GR00T N2, ou Figure AI avec ses architectures propriétaires ont chacun proposé leurs variantes de politiques diffusion ou VLA (Vision-Language-Action). La question de la mémoire temporelle longue reste ouverte dans l'ensemble de ces systèmes. DSSP est à ce stade un résultat de recherche académique, pas un produit déployé : les expériences réelles décrites sont des validations en laboratoire, non des pilotes industriels. La prochaine étape naturelle serait une intégration dans des frameworks open-source comme Lerobot (HuggingFace) ou une collaboration avec des fabricants pour valider le passage à l'échelle sur des tâches d'assemblage à horizons multiples.

UEImpact indirect potentiel si DSSP est intégré dans Lerobot (HuggingFace, entreprise française basée à Paris), ce qui faciliterait l'adoption par les équipes européennes de recherche en manipulation robotique longue durée.

RechercheOpinion
1 source
Modèles d'action du monde : la prochaine frontière de l'IA incarnée
236arXiv cs.RO 

Modèles d'action du monde : la prochaine frontière de l'IA incarnée

Une équipe de chercheurs a publié le 16 mai 2026 sur arXiv (réf. 2605.12090) la première revue systématique d'un paradigme émergent qu'ils formalisent sous le nom de World Action Models (WAMs). Là où les modèles Vision-Language-Action (VLA) actuels, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA, apprennent des mappings réactifs observation-vers-action, les WAMs modélisent explicitement la dynamique physique de l'environnement. Concrètement, un WAM génère une distribution jointe sur les états futurs et les actions, plutôt que sur les actions seules. Les auteurs proposent une taxonomie structurée en deux grandes familles : les WAMs en cascade (Cascaded WAMs), où un modèle prédictif alimente un planificateur d'action en pipeline, et les WAMs joints (Joint WAMs), où prédiction d'état et génération d'action sont coappris dans une architecture unifiée, avec des subdivisions selon la modalité de génération, le mécanisme de conditionnement et la stratégie de décodage d'action. L'enjeu industriel est significatif. Les VLA purs souffrent d'un déficit fondamental : ils réagissent aux observations sans anticiper les conséquences physiques de leurs actions, ce qui limite leur robustesse hors distribution et leur capacité à planifier sur des horizons longs. L'intégration d'un world model permet en théorie de simuler mentalement les effets d'une action avant de l'exécuter, un prérequis pour la manipulation dextère complexe, la navigation en environnement non structuré, ou la récupération après erreur. C'est précisément le gap sim-to-real et le reality gap des démos en laboratoire que ce paradigme cherche à combler à l'échelle. Pour un intégrateur ou un COO industriel, cela signifie potentiellement des robots plus fiables sur des tâches non scriptées, sans retraining complet à chaque variation de contexte. Ce travail s'inscrit dans une compétition intense entre Physical Intelligence (Pi-0, financement de 400 M$), NVIDIA (GR00T N2, Isaac Lab), Boston Dynamics, Figure AI et des acteurs académiques comme Berkeley et Stanford. Côté données, les auteurs identifient quatre sources majeures : la télé-opération robot, les démonstrations humaines portables (caméras égo-centriques), la simulation et les vidéos internet à grande échelle, chacune avec ses biais propres. La revue pointe aussi l'absence de benchmarks standardisés pour évaluer la plausibilité physique et le bon sens commonsense des WAMs, un frein à la comparaison rigoureuse. Les prochaines étapes identifiées incluent des protocoles d'évaluation unifiés et l'extension vers des tâches de manipulation longue durée en conditions réelles.

IA physiqueOpinion
1 source
Lumos Robotics lève près d'1 milliard de yuans en séries A1 et A2, Mitsubishi Electric en tête
237Pandaily 

Lumos Robotics lève près d'1 milliard de yuans en séries A1 et A2, Mitsubishi Electric en tête

Lumos Robotics (鹿明机器人), startup d'IA incarnée fondée par des chercheurs de l'université Tsinghua, a bouclé deux tours de financement successifs (A1 et A2) pour un total d'environ 1 milliard de RMB (soit ~140 millions de dollars), avec la filiale chinoise de Mitsubishi Electric comme chef de file sur les deux opérations. Le tour A1 a été co-mené par la filiale spécialisée en manufacturing intelligent de Mitsubishi Electric, ainsi que par les investisseurs historiques Puhua Capital et Wuzhong Jinkong ; le tour A2 a réuni en sus Hengsheng Electronics, Haigao Group et Kunshi Investments. La société, dirigée par le CEO Yu Chao, commercialise deux plateformes distinctes : le robot humanoïde pleine taille LUS et le robot MOS, un bras manipulateur monté sur base roulante lourde. Des laboratoires communs avec Mitsubishi Electric ont été établis à Suzhou et Shanghai, où le MOS est déjà opérationnel pour l'inspection visuelle par IA sur des lignes de production d'automates programmables (PLC). La participation répétée de Mitsubishi Electric, acteur industriel de premier rang et non un fonds de capital-risque généraliste, aux deux tours signale un intérêt stratégique concret. Pour les intégrateurs B2B, cela valide l'architecture technique de Lumos : le moteur propriétaire Nexcore combine des modèles du monde (world models) avec un entraînement conjoint VLA (Vision-Language-Action), une optimisation de l'attention visuelle dédiée à l'industrie, et un réseau d'experts de type MoE pour le contrôle de mouvement haute précision. Le déploiement annoncé du MOS sur des lignes PLC réelles constitue un signal de robustesse terrain, même si aucun volume de déploiement, taux de défaut ni temps de cycle n'est communiqué, ce qui rend toute évaluation objective des performances impossible à ce stade. Lumos Robotics s'inscrit dans une vague de startups chinoises d'IA incarnée issues des grandes universités, en concurrence directe avec Unitree, Fourier Intelligence et LimX Dynamics sur le marché domestique, et avec Figure AI, 1X Technologies ou Agility Robotics à l'international. Sa singularité réside dans un positionnement dual humanoïde/bras mobile combiné à un partenariat industriel ancré chez un équipementier japonais établi. Les prochaines étapes restent floues : ni timeline de série B, ni objectifs de production en volume, ni métriques de performance terrain n'ont été publiés. Le déploiement en inspection PLC à Suzhou et Shanghai représente pour l'instant un pilote industriel validé plutôt qu'un passage à l'échelle commerciale.

Chine/AsieOpinion
1 source
HAIC : contrôle agile d'interaction humanoïde avec les objets via un modèle du monde intégrant la dynamique
238arXiv cs.RO 

HAIC : contrôle agile d'interaction humanoïde avec les objets via un modèle du monde intégrant la dynamique

Des chercheurs ont publié sur arXiv (référence 2602.11758v2) un framework baptisé HAIC, Humanoid Agile Object Interaction Control, destiné à doter les robots humanoïdes d'une capacité de manipulation d'objets à dynamique indépendante, sans recours à des capteurs externes d'état. Le système repose sur un prédicteur de dynamique qui estime la vitesse et l'accélération d'un objet en contact uniquement à partir de l'historique proprioceptif du robot, c'est-à-dire ses propres données articulaires, sans caméra ni lidar dédié à l'objet. Ces estimations sont projetées sur des priors géométriques statiques pour générer une carte d'occupation dynamique spatialement ancrée, permettant au contrôleur d'inférer les limites de collision et les affordances de contact même dans les zones de l'espace occultées. Les tâches validées expérimentalement sur robot humanoïde incluent le skateboard, la poussée et traction de chariot sous charges variables, et le transport d'un carton sur terrain irrégulier avec plusieurs objets en interaction simultanée. L'apport industriel de HAIC est de combler un angle mort structurel de la robotique humanoïde actuelle : la quasi-totalité des méthodes d'interaction humain-objet (HOI) supposent que l'objet est rigidement couplé au robot et entièrement actionné. Cette hypothèse exclut les objets sous-actionnés à dynamique propre, roues, chariots, caisses sur sol glissant, qui sont précisément les objets courants en entrepôt logistique ou en atelier industriel. En gérant les forces de couplage et les perturbations inertielles de façon proactive, HAIC réduit la dépendance aux capteurs périphériques coûteux et améliore la robustesse aux variations de charge. Le mécanisme d'apprentissage asymétrique (asymmetric fine-tuning), où le world model s'adapte en continu à la politique apprise, adresse directement le problème de distribution shift, un point de fragilité classique des pipelines sim-to-real. La publication s'inscrit dans une course ouverte autour du contrôle whole-body pour humanoïdes, dominée par des approches VLA (Vision-Language-Action) comme pi0 de Physical Intelligence, GR00T N2 de NVIDIA, ou les travaux internes de Figure AI et Agility Robotics. HAIC se distingue en privilégiant une architecture model-based compacte plutôt qu'un grand modèle fondation, un choix de conception qui favorise la latence basse et l'embarquabilité. Le papier ne mentionne pas de partenaire industriel ni de timeline de déploiement ; il reste à ce stade une démonstration en laboratoire sur humanoïde non nommé, sans benchmark standardisé externe, ce qui rend la comparaison directe avec d'autres systèmes difficile à établir.

RechercheActu
1 source
Xiaoyubot lève un nouveau tour de table, soutenu par Xiaomi, Didi et BAIC
239Pandaily 

Xiaoyubot lève un nouveau tour de table, soutenu par Xiaomi, Didi et BAIC

Xiaoyubot, startup chinoise spécialisée dans l'IA embodied industrielle, a bouclé un tour de financement de série B+ de plusieurs centaines de millions de yuans (montant exact non précisé), selon le média financier IPOZaozhidao. Ce tour est co-mené par cinq investisseurs industriels : Xiaomi, Didi, BAIC Investment (bras financier du constructeur automobile BAIC), Fosun Venture et la China Construction Bank Development (CCDC). Lei Wanqiang, co-fondateur de Xiaomi, y participe pour la quatrième fois consécutive, signe d'une conviction institutionnelle durable. Les fonds levés seront affectés à l'accélération du déploiement de Xiaoyubot sur l'ensemble des scénarios industriels couverts par l'IA embodied, terme désignant les systèmes d'IA capables d'agir physiquement dans un environnement réel via un corps robotique. L'ambition déclarée de Xiaoyubot est d'atteindre un rythme de livraison de 100 000 unités par an, seuil qu'elle présente elle-même comme le ticket d'entrée pour la phase finale de la course aux robots incarnés. La société développe une architecture baptisée "un cerveau, plusieurs formes" (one brain, multiple forms), conçue pour piloter différentes morphologies robotiques depuis un même système cognitif général, avec l'objectif de mutualiser les coûts de développement logiciel tout en couvrant un spectre large de cas d'usage industriels. La composition du tour est elle-même un signal stratégique : réunir des acteurs de l'internet (Xiaomi, Didi), de l'automobile (BAIC), de la finance privée (Fosun) et de la finance d'État (CCB) sous un même cap est rare et suggère un positionnement de plateforme nationale plutôt qu'une verticale sectorielle étroite. Fondée avec pour mission de déployer des robots IA dans des scénarios industriels variés, Xiaoyubot s'inscrit dans un écosystème chinois de la robotique en pleine effervescence, aux côtés de Unitree Robotics, Fourier Intelligence ou encore UBTECH. Ce tour intervient alors que plusieurs acteurs chinois cherchent à atteindre une échelle de production industrielle avant leurs concurrents occidentaux tels que Boston Dynamics, Figure AI ou 1X Technologies. L'objectif des 100 000 unités annuelles reste une cible annoncée, sans calendrier précis ni preuve de commandes fermes publiés à ce stade.

UELa constitution d'un consortium industrie-finance-État autour de Xiaoyubot accélère la course chinoise aux 100 000 unités annuelles et intensifie la pression concurrentielle sur les acteurs européens de la robotique industrielle, sans impact direct immédiat sur la France ou l'UE.

Chine/AsieActu
1 source
Xiaoyu Robotics lève un nouveau tour de table, soutenu par Xiaomi, Didi et BAIC
240Pandaily 

Xiaoyu Robotics lève un nouveau tour de table, soutenu par Xiaomi, Didi et BAIC

Xiaoyu Robotics, startup chinoise spécialisée dans l'IA incarnée industrielle (embodied AI), a bouclé un tour de table Series B+ de plusieurs centaines de millions de yuans, selon le média spécialisé IPO Early. Le tour est co-piloté par cinq investisseurs industriels : Xiaomi, Didi, BAIC Investment (bras financier du constructeur automobile BAIC), Fosun Venture et CCDC (filiale de China Construction Bank). Le co-fondateur de Xiaomi, Lei Wanqiang, y participe pour la quatrième fois consécutive, signal fort de confiance institutionnelle dans la trajectoire de la société. Les fonds sont destinés à accélérer le déploiement de la startup dans l'ensemble des scénarios industriels et à financer son architecture robotique dite "un cerveau, plusieurs formes" : un seul cerveau général capable de piloter différents types de robots physiques, avec un objectif affiché de 100 000 unités livrées par an. Ce chiffre de 100 000 unités est présenté par la société comme le seuil d'entrée dans la phase décisive de la course à l'embodied AI industrielle. Il s'agit d'une ambition déclarée, sans contrats ni calendrier précis communiqués publiquement. Ce qui est plus structurellement significatif est la composition du tour : réunir simultanément un géant tech grand public (Xiaomi), un opérateur de mobilité (Didi), un OEM automobile (BAIC), un conglomérat industrialo-financier (Fosun) et une banque d'État (CCB) est rare dans l'écosystème robotique. Cela positionne Xiaoyu Robotics moins comme un fournisseur sectoriel que comme une plateforme transversale, ce qui est une proposition structurellement différente pour les intégrateurs et les décideurs B2B : l'ambition n'est pas un robot, c'est un OS robotique industriel. Fondée pour opérer dans des environnements industriels variés, Xiaoyu Robotics s'inscrit dans une vague de levées massives sur le segment embodied AI en Chine en 2024-2025, aux côtés d'Unitree, Agibot (ex-Zhiyuan) et Fourier Intelligence. Face à eux, les acteurs occidentaux comme Figure AI avec son Figure 03, Physical Intelligence et son modèle pi-0, ou Agility Robotics déployé chez Amazon, avancent également sur la commercialisation industrielle. L'architecture "un cerveau, plusieurs formes" vise à différencier la startup par la généralité du modèle plutôt que par un form factor unique, une approche proche des VLA (Vision-Language-Action models) appliqués à l'échelle. Les prochaines étapes, notamment les pilotes industriels et la feuille de route vers les 100 000 unités, n'ont pas encore été détaillées publiquement.

Chine/AsieActu
1 source
CKT-WAM : transfert de connaissances contextuelles efficient entre modèles d'action du monde
241arXiv cs.RO 

CKT-WAM : transfert de connaissances contextuelles efficient entre modèles d'action du monde

Des chercheurs ont déposé le 8 mai 2026 sur arXiv (2605.06247) CKT-WAM, un cadre de transfert de connaissances paramètre-efficient entre modèles d'action du monde (WAMs, World Action Models). L'approche résout un verrou persistant : faire bénéficier un WAM étudiant des représentations apprises par un WAM enseignant plus capable, sans réentraîner l'ensemble du réseau. Techniquement, CKT-WAM extrait des états cachés intermédiaires de l'enseignant, les compresse via une attention croisée à requêtes apprenables (LQCA), les transforme à travers un adaptateur généralisé toujours actif et des adaptateurs spécialisés à activation parcimonieuse, puis injecte ce contexte compact dans les embeddings textuels de conditionnement de l'étudiant. Sur le benchmark LIBERO-Plus, le système atteint 86,1 % de taux de réussite global en n'entraînant que 1,17 % des paramètres du modèle étudiant, approchant les performances du fine-tuning complet. En conditions réelles, quatre tâches de manipulation longue portée ont été évaluées avec 83,3 % de réussite moyenne, résultat présenté comme meilleur de la catégorie par les auteurs. Le code est disponible sur GitHub (YuhuaJiang2002/CKT-WAM). L'enjeu industriel est direct : affiner un WAM ou un VLA (Vision-Language-Action model) de taille fondationnelle exige des ressources GPU considérables ; descendre à 1,17 % de paramètres entraînables tout en conservant des performances comparables ouvre une voie concrète pour les équipes R&D à ressources limitées. La démonstration d'une généralisation zero-shot suggère que le contexte transféré encode des capacités motrices transposables au-delà des tâches d'entraînement, ce qui valide partiellement l'hypothèse d'une composabilité des modèles robotiques génératifs. Deux réserves s'imposent toutefois : les quatre scénarios réels évalués restent trop peu nombreux pour conclure à une robustesse hors laboratoire, et les conditions d'évaluation (définition du succès, variabilité environnementale, sélection des vidéos) ne sont pas détaillées dans le preprint, ce qui limite la portée des chiffres annoncés. CKT-WAM s'inscrit dans la vague actuelle des modèles robotiques fondationnels interopérables, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI). L'idée de capitaliser sur des modèles enseignants hétérogènes plutôt que de réentraîner from scratch rejoint les travaux de distillation de connaissances explorés en académique comme en industrie, dans un contexte où la course aux WAMs s'accélère significativement depuis 2025. En Europe, Enchanted Tools et Wandercraft développent des architectures de contrôle avancées, bien que moins orientées WAMs dans leurs publications récentes. La suite logique serait une validation sur des benchmarks plus larges comme DROID ou Open-X Embodiment, et des expérimentations terrain pour confirmer la robustesse réelle du transfert en dehors des environnements contrôlés.

UELes équipes R&D européennes travaillant sur des VLAs à ressources GPU limitées (dont Enchanted Tools et Wandercraft) pourraient exploiter ce framework pour réduire drastiquement le coût d'affinage de modèles fondationnels robotiques, dès validation sur des benchmarks plus larges.

💬 1,17 % des paramètres entraînés pour des perfs comparables au fine-tuning complet, c'est le genre de chiffre qui change les plans de roadmap. Les équipes qui rêvaient de WAMs génératifs mais bloquaient sur le budget GPU vont regarder ça de près. Bon, quatre tâches réelles c'est maigre pour crier victoire, mais l'axe est le bon.

IA physiqueOpinion
1 source
Le robot humanoïde Unitree G1 provoque un premier retard de vol à cause de ses batteries
242Interesting Engineering 

Le robot humanoïde Unitree G1 provoque un premier retard de vol à cause de ses batteries

Un robot humanoïde Unitree G1 a provoqué un retard de plus d'une heure à l'aéroport international d'Oakland, en Californie, après que le personnel de la compagnie aérienne a soulevé des questions sur la capacité de sa batterie embarquée. Le pack d'accumulateurs du robot dépassait les seuils en watt-heure fixés par la Federal Aviation Administration (FAA) pour les cellules lithium-ion transportées en cabine et en soute : au-delà de 100 Wh, une batterie de rechange nécessite l'accord explicite de la compagnie ; au-delà de 160 Wh, elle est simplement interdite en cabine. Or, les robots humanoïdes modernes embarquent des packs d'une capacité comprise entre 1 kWh et plus de 2 kWh, soit jusqu'à douze fois la limite autorisée pour un ordinateur portable. Les agents au sol ont dû traverser une cascade de questions sur la chimie des cellules, la configuration du pack, sa démontabilité et sa classification matières dangereuses, avant que l'appareil puisse être autorisé au départ, sous les regards impatients des autres passagers. Ce retard illustre une lacune structurelle dont les conséquences dépassent un simple incident opérationnel. La réglementation FAA sur les matières dangereuses a été conçue pour les appareils électroniques grand public et les véhicules électriques transportés en fret, non pour un robot bipède occupant un siège passager. Un pack de 2 kWh représente une énergie thermique potentielle comparable à douze batteries de laptop combinées, avec un risque d'emballement thermique non négligeable dans un fuselage pressurisé où les possibilités d'intervention sont limitées. Pour les intégrateurs et les entreprises qui déploient des humanoïdes hors des environnements contrôlés, l'incident d'Oakland signale que chaque nouveau contexte (usine, hôpital, entrepôt, aéroport) est susceptible de rencontrer un cadre réglementaire écrit sans eux, générant des blocages opérationnels imprévisibles et potentiellement coûteux. L'humanoïde impliqué est le G1 de Unitree Robotics, constructeur chinois qui a misé sur l'accessibilité tarifaire de ses plateformes pour accélérer la diffusion grand public de la robotique humanoïde. Commercialisé autour de 16 000 dollars, le G1 est l'un des humanoïdes les plus abordables du marché, loin devant les propositions de Figure AI, Boston Dynamics ou 1X Technologies. L'incident survient dans un contexte où la FAA fait déjà face à une pression soutenue pour réviser ses règles sur les batteries lithium, à la suite d'incidents d'incendie en fret aérien. Sans directive explicite pour cette nouvelle catégorie d'appareils, les agents au sol continueront d'improviser au cas par cas et les passagers d'attendre. Une clarification réglementaire s'impose à mesure que les robots humanoïdes quittent les laboratoires pour intégrer des espaces publics et des flux logistiques réels.

UELes opérateurs européens de robots humanoïdes sont exposés aux mêmes restrictions EASA sur les batteries lithium, et cet incident révèle un vide réglementaire qui pourrait bloquer le transport aérien de ces appareils en Europe sans cadre spécifique.

RegulationReglementation
1 source
Revue des grands modèles de langage pour les systèmes multi-robots
243arXiv cs.RO 

Revue des grands modèles de langage pour les systèmes multi-robots

Une équipe de chercheurs a publié sur arXiv (référence 2502.03814, version 5) la première revue systématique dédiée à l'intégration des grands modèles de langage (LLM) dans les systèmes multi-robots (MRS). Le survey catégorise les usages en trois niveaux d'abstraction : allocation de tâches de haut niveau (décomposition d'objectifs, planification globale), planification de trajectoire au niveau intermédiaire, et génération d'actions bas niveau, auxquels s'ajoute une quatrième dimension couvrant l'intervention humaine et la collaboration homme-robot. Les domaines d'application recensés incluent la robotique domestique, la construction, le contrôle de formation, le suivi de cibles mobiles et les jeux multi-agents robotiques. Les auteurs maintiennent un dépôt GitHub open source mis à jour en continu pour suivre l'évolution rapide des publications. Le principal apport de ce travail est de combler un angle mort : la littérature sur les LLM en robotique se concentrait jusqu'ici sur les systèmes mono-robot, ignorant les défis propres à la coordination distribuée. Passer à plusieurs robots soulève des problèmes structurels distincts : scalabilité des communications, cohérence des plans entre agents, gestion des conflits de ressources. Les auteurs documentent des gains réels en compréhension du langage naturel et en décomposition de tâches complexes, mais identifient trois obstacles majeurs à l'adoption industrielle : les lacunes en raisonnement mathématique (planification géométrique, optimisation multi-agents), les hallucinations pouvant propager des erreurs à l'échelle d'une flotte entière, et la latence d'inférence, incompatible avec les boucles de contrôle temps réel des systèmes industriels. Ce survey arrive dans un contexte où plusieurs acteurs tentent d'industrialiser la coordination robotique fondée sur les LLM : Google DeepMind avec RT-2 et SayCan, Physical Intelligence avec Pi-0, et Figure AI ont chacun démontré des capacités de planification langage-vers-action sur des robots individuels ou en nombre limité. L'extension à des flottes hétérogènes reste un problème ouvert, en particulier sur le sim-to-real : les benchmarks actuels, souvent conduits en simulation, ne reflètent pas fidèlement les contraintes de déploiement réel. Les auteurs identifient le fine-tuning sur des données multi-robots spécifiques, le développement de modèles de raisonnement dédiés aux tâches, et la création de benchmarks standardisés comme priorités de recherche à venir. Aucun calendrier de déploiement commercial n'est évoqué dans le document.

RecherchePaper
1 source
Les robots chinois s'imposent dans la vie réelle, du nettoyage à la régulation du trafic
244SCMP Tech 

Les robots chinois s'imposent dans la vie réelle, du nettoyage à la régulation du trafic

En Chine, les robots humanoïdes et de service quittent les laboratoires pour s'intégrer dans des environnements opérationnels réels, un virage visible depuis le début de 2025. En mars, une offre de nettoyage a été lancée sur 58.com, plateforme chinoise d'annonces équivalente à LeBonCoin, associant un robot à un technicien humain pour des interventions à domicile. Au-delà du ménage, des robots sont désormais déployés pour réguler la circulation routière et intervenir dans des ateliers industriels à risque, là où l'exposition humaine est problématique, soudure, manipulation de produits chimiques, environnements haute température. Ce glissement du POC vers le déploiement opérationnel est structurellement significatif pour le secteur. Il signale que l'écart "demo-to-reality" commence à se résorber dans des cas d'usage à périmètre contrôlé : tâches répétitives, environnements semi-structurés, supervision humaine maintenue. Pour les intégrateurs B2B, cela ouvre une fenêtre concrète sur des ROI calculables, à condition que les cycles de maintenance et les taux d'erreur en conditions réelles soient publiés, ce que les annonces chinoises ne détaillent pas encore systématiquement. La Chine a inscrit la robotique incarnée comme priorité nationale dans son plan industriel 2025, avec des financements étatiques directs vers des acteurs comme Unitree, UBTECH et Fourier Intelligence. Face à Figure AI (Figure 02), Boston Dynamics (Atlas) et Tesla (Optimus Gen 2) côté américain, Pékin mise sur le déploiement massif et rapide plutôt que sur la performance en vitrine. Les prochaines étapes probables : extension des services 58.com à d'autres villes, et multiplication des pilotes industriels dans la logistique et la maintenance lourde.

UELa montée en puissance du déploiement opérationnel des robots chinois (Unitree, UBTECH, Fourier) accentue la pression concurrentielle indirecte sur les fabricants et intégrateurs européens, sans impact direct immédiat sur la France ou l'UE.

Chine/AsieOpinion
1 source
Des téléphones aux robots humanoïdes : la chaîne d'approvisionnement chinoise vise sa prochaine courbe de croissance
245SCMP Tech 

Des téléphones aux robots humanoïdes : la chaîne d'approvisionnement chinoise vise sa prochaine courbe de croissance

Le fabricant de smartphones Honor a créé la surprise en remportant le semi-marathon robotique de Pékin avec son humanoïde D1, devançant des acteurs établis comme Unitree, une première qui illustre un basculement structurel dans l'industrie : la chaîne d'approvisionnement chinoise des smartphones et de l'électronique grand public se reconvertit activement vers la robotique humanoïde. Des fournisseurs de composants jusqu'ici positionnés sur les marchés mobiles cherchent de nouveaux relais de croissance alors que la demande en téléphonie stagne, et transfèrent leur expertise en actionneurs, capteurs, batteries haute densité et électronique embarquée vers ce nouveau segment. L'enjeu est considérable pour l'industrie robotique mondiale. La Chine dispose d'un avantage structurel rare : une chaîne d'approvisionnement intégrée, des volumes de production éprouvés, et des coûts unitaires optimisés par des années de compétition féroce sur le marché mobile. Si ces capacités se déploient à grande échelle dans le secteur humanoïde, elles pourraient accélérer drastiquement le passage du prototype au produit commercialisable, un goulot d'étranglement qui freine encore la plupart des acteurs occidentaux. La victoire du D1 reste néanmoins une démonstration en conditions contrôlées, et les performances en environnement industriel réel constituent un autre niveau d'exigence. Ce pivot intervient alors que Pékin soutient activement l'humanoïde via des subventions et des appels d'offres publics. Unitree (G1, H1), UBTECH et le consortium Fourier Intelligence figurent parmi les acteurs domestiques établis que Honor et d'autres entrants issus du hardware grand public viennent désormais challenger. À l'international, Boston Dynamics, Figure AI et 1X restent les références, mais leur chaîne d'approvisionnement reste plus fragmentée. Les prochaines étapes pour Honor et les reconvertis du mobile seront de démontrer une fiabilité opérationnelle hors contexte de compétition.

UELe pivot de la chaîne d'approvisionnement chinoise vers l'humanoïde pourrait à terme intensifier la pression concurrentielle sur les fabricants européens de robots en comprimant les coûts unitaires de composants clés (actionneurs, batteries, électronique embarquée).

Chine/AsieOpinion
1 source
StableIDM : stabilisation du modèle de dynamique inverse face à la troncature du manipulateur par raffinement spatio-temporel
246arXiv cs.RO 

StableIDM : stabilisation du modèle de dynamique inverse face à la troncature du manipulateur par raffinement spatio-temporel

Des chercheurs ont publié le 24 avril 2026 StableIDM, un framework spatio-temporel conçu pour stabiliser les modèles de dynamique inverse (IDM) en robotique manipulatrice. Les IDM sont des composants clés de l'IA incarnée : ils traduisent des observations visuelles brutes en commandes d'action bas-niveau, et servent à la fois pour l'annotation automatique de données d'entraînement et pour l'exécution de politiques. Le problème ciblé est la troncature du manipulateur, c'est-à-dire les situations où le bras robotique sort partiellement ou totalement du champ de la caméra, rendant la reconstruction d'état mathématiquement sous-déterminée. StableIDM intègre trois modules complémentaires : un masquage centré sur le robot pour éliminer le bruit de fond, une agrégation directionnelle de features (DFA) qui extrait des caractéristiques anisotropes le long des directions inférées depuis la partie visible du bras, et un raffinement temporel de la dynamique (TDR) qui lisse les prédictions via la continuité du mouvement. Sur le benchmark AgiBot, le système améliore la précision d'action stricte de 12,1 % sous troncature sévère, augmente le taux de succès moyen en rejeu réel de 9,7 %, améliore le succès de saisie de 11,5 % lors du décodage de plans issus de vidéos générées, et booste de 17,6 % les performances en conditions réelles quand StableIDM joue le rôle d'annotateur automatique pour un modèle VLA aval. Ces résultats sont significatifs pour quiconque déploie des bras manipulateurs en environnement non contrôlé. La troncature visuelle est une failure mode banale en production : un carton qui passe, un opérateur qui traverse, une caméra mal positionnée. Jusqu'ici, les IDM existants s'effondraient dans ces conditions, forçant les intégrateurs à multiplier les caméras ou à contraindre fortement la scène. StableIDM suggère qu'un traitement spatio-temporel ciblé peut absorber cette incertitude sans revoir l'infrastructure capteur. Par ailleurs, le gain de 17,6 % sur les VLA aval confirme une hypothèse montante dans le secteur : la qualité des annotations automatiques est un levier critique pour l'apprentissage à grande échelle, au moins autant que l'architecture du modèle de politique lui-même. Les IDM ont émergé comme alternative légère aux modèles de politique bout-en-bout dans le sillage des travaux sur l'imitation learning visuel (Gato, RT-2, OpenVLA). Le benchmark AgiBot, développé par la startup chinoise AgiBot, est devenu une référence de facto pour évaluer la manipulation dextre en conditions réelles. Sur le terrain concurrentiel, Physical Intelligence (pi) avec Pi-0, Figure AI avec son pipeline de données, et 1X Technologies travaillent tous sur des variantes d'IDM ou de VLA pour réduire la dépendance aux capteurs proprioceptifs. StableIDM se positionne comme un backbone généraliste compatible avec ces architectures, potentiellement intégrable comme préprocesseur dans des pipelines existants. Les auteurs n'annoncent pas de code public ni de partenariat industriel à ce stade : c'est une contribution de recherche, pas un produit shipped.

IA physiqueActu
1 source
Les géants technologiques chinois accélèrent dans la robotique, un secteur en pleine expansion
247SCMP Tech 

Les géants technologiques chinois accélèrent dans la robotique, un secteur en pleine expansion

Honor, filiale autonome de Huawei depuis 2020 et jusqu'ici positionnée sur les smartphones et wearables, a décroché la médaille d'or au deuxième semi-marathon humanoides de Pékin avec son robot baptisé Lightning, devançant des acteurs spécialisés comme Unitree et X-Humanoid. L'événement, organisé dimanche dernier, réunissait les principaux constructeurs de robots humanoïdes chinois dans une course d'endurance conçue pour évaluer locomotion et robustesse en conditions réelles. Alibaba figure également parmi les grands groupes technologiques qui accélèrent leurs investissements dans le secteur, dans un contexte où Pékin pousse activement à la montée en puissance de la robotique nationale. La victoire d'Honor est significative car elle illustre un phénomène nouveau: les Big Tech généralistes chinois rattrapent en moins de deux ans des spécialistes de la robotique humanoïde qui disposent de plusieurs années d'avance en R&D. Cela suggère que les barrières à l'entrée s'abaissent rapidement, portées par la disponibilité de fondations logicielles communes et d'une chaîne d'approvisionnement matérielle dense en Chine. Pour les intégrateurs industriels, cela annonce une intensification de la concurrence et potentiellement une compression des prix sur les plateformes humanoïdes dans les 18 à 24 prochains mois. Honor n'a lancé sa division robotique qu'en 2025, ce qui rend sa performance d'autant plus notable. La Chine compte désormais plusieurs dizaines de startups humanoïdes, dont Unitree et Fourier Intelligence, mais l'entrée des grandes plateformes tech recompose le paysage compétitif. Côté occidental, Boston Dynamics, Figure AI et Agility Robotics suivront de près cette évolution, notamment pour évaluer si les performances en course se traduisent en fiabilité opérationnelle industrielle.

Chine/AsieOpinion
1 source
Le robot humanoïde Digit démontre sa force et son équilibre avec un soulevé de terre de 30 kg
248Interesting Engineering 

Le robot humanoïde Digit démontre sa force et son équilibre avec un soulevé de terre de 30 kg

Le robot humanoïde Digit, développé par Agility Robotics (Oregon, États-Unis), vient de réaliser un soulevé de terre de 29 kilogrammes (65 livres) dans un environnement de laboratoire contrôlé. La démonstration met en évidence une coordination corpo-entière, bras, jambes et torse s'ajustent dynamiquement en temps réel pour maintenir l'équilibre sous charge. Selon l'entreprise, l'exercice a été conçu pour tester les limites des actionneurs, la durabilité des articulations et les systèmes de contrôle en temps réel. La politique de contrôle a été entraînée en simulation : un objet virtuel est introduit dans un environnement numérique, permettant au modèle d'apprendre la distribution de charge, les forces de préhension et les déplacements du centre de masse. Des milliers d'essais simulés affinent ensuite la stabilité de prise et le contrôle postural avant transfert sur le robot physique. La version actuelle de Digit embarque également une autonomie batterie de quatre heures, un système d'auto-recharge par docking autonome, des membres renforcés, des effecteurs terminaux avancés, et des protocoles de sécurité industrielle incluant un arrêt de catégorie 1, des PLCs de sécurité et le protocole FailSafe over EtherCAT. Ce que révèle cette démonstration va au-delà du simple exercice de force : elle illustre le passage des trajectoires articulaires programmées manuellement vers des politiques adaptatives apprises, un changement de paradigme significatif pour les intégrateurs industriels. Le sim-to-real, longtemps considéré comme un verrou majeur de la robotique humanoïde, semble ici suffisamment mature pour gérer des tâches de manipulation lourde avec consistance et sans réinitialisation. Pour un COO industriel, la promesse concrète est un robot capable d'empiler des bacs, charger des chariots et manutentionner des matériaux variés de façon autonome et répétable, en complément de robots mobiles autonomes (AMR) qui assurent le transport. La durabilité sous charge soutenue reste toutefois à valider en conditions réelles de production : la vidéo présentée est un test laboratoire, pas un déploiement opérationnel. Agility Robotics a été fondée en 2015 à partir des travaux de l'Oregon State University sur la locomotion bipède. L'entreprise a signé un partenariat stratégique avec Amazon, qui a piloté Digit dans ses entrepôts en 2023-2024. Elle se positionne directement face à Figure AI (Figure 02, partenariat BMW), Boston Dynamics (Atlas), Tesla (Optimus) et 1X Technologies sur le segment de l'humanoïde industriel. Contrairement à Figure ou Tesla qui communiquent davantage sur des capacités de manipulation généraliste, Agility mise sur une intégration logistique ciblée, en couplant Digit aux flottes AMR existantes. Les prochaines étapes annoncées incluent une accélération de la cadence de production et un déploiement élargi dans des environnements entrepôt multi-unités, sans date précise communiquée à ce stade.

HumanoïdesActu
1 source
La startup d'IA incarnée X Square Robot lève près de 276 millions de dollars en série B, menée par Xiaomi et Sequoia China
249Pandaily 

La startup d'IA incarnée X Square Robot lève près de 276 millions de dollars en série B, menée par Xiaomi et Sequoia China

X Square Robot, startup chinoise spécialisée dans l'IA incarnée fondée en décembre 2023, a bouclé un tour de série B de près de 2 milliards de yuans (environ 276 millions de dollars) entre fin mars et début avril 2026, co-mené par le bras d'investissement stratégique de Xiaomi et Sequoia China. Cette levée intervient à peine trois mois après un tour A++ d'un milliard de yuans (138 millions de dollars) annoncé le 12 janvier, dans lequel ByteDance, Sequoia China, le Beijing Information Industry Development Fund et le Shenzhen Capital Group figuraient déjà comme investisseurs principaux. Meituan et Alibaba ont également rejoint le cap table, ce qui fait de X Square Robot la seule entreprise d'IA incarnée en Chine à avoir attiré les trois géants de l'internet chinois simultanément. La société a déjà commercialisé deux plateformes robotiques propriétaires : Quantum-1 et Quantum-2, ce dernier étant un humanoïde à roues à usage général. En moins de six mois d'existence publique, X Square Robot cumule plus de 400 millions de dollars levés, un rythme qui place la startup dans la même trajectoire de capitalisation accélérée que Figure AI ou Physical Intelligence aux États-Unis. La présence conjointe de Xiaomi, acteur hardware avec une chaîne d'approvisionnement robuste, et de ByteDance, maître de la donnée comportementale à grande échelle, suggère une stratégie d'intégration verticale : modèles de fondation incarnés alimentés par des volumes de données massifs, déployés sur du matériel maîtrisé. Le fait que le fonds IA dédié de Shenzhen Capital ait effectué ici son premier investissement signale également un intérêt institutionnel croissant pour la robotique généraliste en Chine. X Square Robot émerge dans un contexte de compétition intense entre Beijing et la Silicon Valley sur les modèles de fondation robotiques : Unitree, Agibot et Galbot d'un côté, Figure, 1X Technologies et Physical Intelligence de l'autre. La différenciation affichée de X Square repose sur des "modèles de fondation d'intelligence incarnée générale" développés en interne, une approche similaire à celle de Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les détails techniques des modèles, leurs benchmarks réels et les déploiements clients concrets restent à ce stade non divulgués, les annonces demeurant au stade du positionnement stratégique plutôt que du produit validé en conditions industrielles.

UELa capitalisation accélérée de X Square Robot par Xiaomi, ByteDance et Alibaba simultanément accentue la pression concurrentielle mondiale sur les projets européens de robots humanoïdes et de modèles de fondation incarnés, sans impact direct immédiat sur la France ou l'UE.

Chine/AsieOpinion
1 source
Les atouts de la chaîne d'approvisionnement asiatique pourraient donner à l'Asie un avantage sur les États-Unis dans la course à l'IA, selon Foo de Granite Asia
250SCMP Tech 

Les atouts de la chaîne d'approvisionnement asiatique pourraient donner à l'Asie un avantage sur les États-Unis dans la course à l'IA, selon Foo de Granite Asia

Jixun Foo, associé gérant de Granite Asia et vétéran du capital-risque technologique asiatique, estime qu'Asia dispose d'un avantage structurel sur les États-Unis dans la prochaine phase de la course à l'IA. Selon lui, le développement de l'IA a franchi un cap décisif : après deux ans de percées sur les modèles de fondation (LLMs, VLMs), le secteur entre dans une phase d'applications physiques, robotique, automatisation industrielle, systèmes embarqués, où la capacité à produire du matériel à grande échelle devient aussi déterminante que la recherche algorithmique. Ce changement de paradigme est stratégiquement important pour les intégrateurs et décideurs industriels : il déplace le centre de gravité compétitif des data centers vers les chaînes d'approvisionnement. La Chine, le Japon, la Corée du Sud et Taiwan concentrent une part dominante de la fabrication mondiale de composants électroniques, de moteurs, d'actionneurs et de capteurs, précisément les éléments critiques pour déployer des robots physiques à l'échelle industrielle. Un avantage logistique et manufacturier peut compenser, au moins partiellement, un retard sur les modèles de base. Granite Asia, fonds hongkongais actif dans les technologies deeptech et la mobilité, s'inscrit dans un mouvement plus large de repositionnement des investisseurs asiatiques sur l'IA physique. Les concurrents américains, Figure AI, Agility Robotics, Boston Dynamics, misent sur l'excellence des modèles (VLA, GR00T N2, pi0), mais dépendent largement de composants fabriqués en Asie. La thèse de Foo rejoint celle de plusieurs analystes : la prochaine bataille ne se gagnera pas uniquement dans les laboratoires, mais sur les lignes de production.

UEL'avantage manufacturier asiatique sur les composants robotiques (actionneurs, capteurs, moteurs) renforce la dépendance structurelle des intégrateurs européens vis-à-vis des chaînes d'approvisionnement asiatiques, un enjeu de souveraineté industrielle pour la filière robotique EU.

Chine/AsieOpinion
1 source