Aller au contenu principal

Actualités robotique — page 37

4 691 articles au fil, du plus récent au plus ancien.

CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables
1801arXiv cs.RO 

CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables

Des chercheurs présentent CoReLIN, un système de navigation robotique capable de déplacer des objets pour se frayer un chemin lorsque l'environnement est trop encombré pour laisser un passage libre. La plupart des planificateurs de navigation actuels supposent qu'un chemin sans obstacle existe toujours entre le point de départ et l'objectif, une hypothèse qui ne tient pas dans des environnements réels chargés de mobilier ou d'objets épars. Les auteurs formalisent une nouvelle tâche baptisée Lifelong Interactive Navigation, où un robot mobile doté de capacités de manipulation doit réorganiser la scène pour accomplir des séquences de tâches de placement d'objets, sachant que chaque modification de l'environnement a des répercussions durables sur la navigabilité future. CoReLIN s'appuie sur un modèle de langage qui raisonne sur un graphe de scène structuré pour décider quels objets déplacer, où les repositionner et quelles zones explorer ensuite, tandis qu'un planificateur de mouvement classique exécute les primitives de navigation et de manipulation. Sur le simulateur ProcTHOR-10k, le système dépasse la meilleure référence de 16% selon les métriques standards, et se transfère avec succès sur du matériel réel. L'enjeu dépasse la simple prouesse académique: la plupart des robots de service et de logistique évoluent aujourd'hui dans des environnements dynamiques et encombrés, entrepôts, domiciles, hôpitaux, où l'absence de chemin dégagé est la norme plutôt que l'exception. En couplant raisonnement sémantique par LLM et perception active, CoReLIN illustre une tendance de fond du secteur: remplacer la planification purement géométrique par un raisonnement de plus haut niveau capable de décider quand agir sur l'environnement plutôt que de le contourner. Pour évaluer ce comportement à long terme, les auteurs introduisent deux métriques inédites, le Long-term Efficiency Score et le Price of Clutter, qui capturent le taux de réussite, l'efficacité d'exécution et le coût d'optimalité de l'environnement laissé par le robot. Cette approche s'inscrit dans la lignée des travaux récents combinant graphes de scène et modèles de langage pour la planification robotique zero-shot, et ouvre la voie à des tests sur des tâches plus longues et des scènes réelles plus variées.

RecherchePaper
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
1802arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
LaMP : apprentissage d'une politique vision-langage-action avec flux de scène 3D comme a priori de mouvement latent
1803arXiv cs.RO 

LaMP : apprentissage d'une politique vision-langage-action avec flux de scène 3D comme a priori de mouvement latent

Des chercheurs présentent LaMP, un framework de manipulation robotique combinant deux modules experts. Le premier, le "Motion Expert", génère en une seule étape un flux de scene 3D partiellement debruite via une méthode de flow-matching; ses états caches conditionnent ensuite un second module, l'"Action Expert", charge de prédire les actions du robot, via une attention croisée filtrée. Contrairement aux VLA classiques qui déduisent les actions directement de features visuelles 2D, LaMP intègre ainsi un a priori de mouvement 3D explicite sans reconstruction complète multi-étapes. Le système a été évalué sur les bancs d'essai de simulation LIBERO, LIBERO-Plus et SimplerEnv-WidowX, ainsi que sur des expériences réelles. Selon les auteurs, LaMP dépasse systématiquement les références VLA testées, avec les meilleurs taux de réussite moyens a budget d'entrainement égal, et un gain moyen de 9,7% de robustesse sur les perturbations hors distribution de LIBERO-Plus par rapport a la meilleure référence existante. Ce travail cible un point faible connu des politiques VLA: leur difficulté a généraliser a des dynamiques spatiales non vues pendant l'entrainement, un écart souvent qualifie de "sim-to-real" ou de "demo vs reality gap". En forçant les modèles a apprendre implicitement la physique 3D a partir de simples features 2D, les architectures actuelles, dans la lignée de RT-2, Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, restent fragiles des que l'environnement s'écarté du jeu d'entrainement. Pour les intégrateurs et décideurs B2B, la robustesse hors distribution sépare une démonstration convaincante d'un déploiement industriel fiable: c'est souvent le vrai goulot d'étranglement, plus que la réussite brute sur des taches déjà vues. Le papier, publie sur arXiv en version 2, s'inscrit dans un débat plus large sur la meilleure façon d'injecter des priors physiques 3D dans des backbones visuels pré-entraines en 2D, face a des alternatives comme les nuages de points ou les politiques de diffusion conditionnées par la profondeur. Il s'agit d'une contribution académique, sans affiliation industrielle affichée ni indication de déploiement au-delà des benchmarks; les prochaines étapes attendues concernent le passage a l'échelle en conditions réelles et une comparaison directe avec des politiques VLA déjà commercialisées comme Pi-0 ou GR00T N2.

RechercheActu
1 source
MVP-Nav : navigateur planificateur avec carte de valeur multicouche
1804arXiv cs.RO 

MVP-Nav : navigateur planificateur avec carte de valeur multicouche

Une équipe de recherche présente MVP-Nav, un système de navigation qui permet à un robot de trouver un objet cible dans un environnement inconnu en utilisant uniquement une caméra RGB, sans capteur de profondeur dédié (lidar ou caméra stéréo). Le problème visé est le "Zero-shot Object Goal Navigation" : un agent doit localiser un objet qu'il n'a jamais rencontré, dans un lieu qu'il découvre en temps réel. Sans mesure directe de la profondeur, les méthodes existantes souffrent soit d'un raisonnement sémantique de haut niveau déconnecté de la géométrie réelle, soit de politiques de bout en bout sans contrainte physique explicite, ce qui produit des trajectoires plausibles sur le papier mais dangereuses en pratique (collisions, chemins irréalisables). MVP-Nav répond à ce problème en reconstruisant une occupation physique explicite à partir d'images monoculaires : des modèles de fondation 3D projettent les instances sémantiques détectées en 2D vers des boîtes englobantes orientées en 3D, formant une carte spatiale globale. Une "Multi-layer Value Map" combine ensuite ces priorités sémantiques avec la géométrie reconstruite dans un espace de coût unique, permettant une planification à la fois sémantiquement pertinente et physiquement viable. L'intérêt pour le secteur de la robotique mobile et des agents embarqués (embodied AI) est direct : la dépendance à des capteurs de profondeur coûteux (lidar, stéréo, temps de vol) reste un frein majeur au déploiement à grande échelle de robots autonomes, notamment mobiles ou humanoïdes évoluant dans des environnements non cartographiés. Un système capable d'atteindre l'état de l'art sur les benchmarks de navigation zero-shot avec une simple caméra RGB représenterait une réduction significative du coût matériel et de la complexité d'intégration, tout en comblant l'écart classique entre "démo qui a l'air de marcher" et comportement réellement sûr sur le terrain, un problème récurrent dans les approches purement sémantiques ou apprises de bout en bout. Ces travaux s'inscrivent dans la lignée des approches combinant modèles de fondation visuels et planification robotique, où l'essor des modèles 3D pré-entraînés (reconstruction monoculaire, détection d'objets orientés) ouvre la voie à des architectures hybrides entre perception sémantique et contraintes physiques classiques. Il est important de noter que ce travail, publié sur arXiv, reste à ce stade une contribution de recherche validée sur des benchmarks de simulation standards pour la navigation d'objectif, sans mention de déploiement sur robot physique réel ni de partenaire industriel. Les prochaines étapes attendues pour ce type d'approche seraient sa validation en conditions réelles, hors simulateur, et son intégration éventuelle dans des piles de navigation de robots mobiles commerciaux.

RecherchePaper
1 source
Motion planning dans des espaces de représentation compressée
1805arXiv cs.RO 

Motion planning dans des espaces de représentation compressée

Ce n'est pas de la démonstration produit ni de déploiement industriel, mais un article de recherche qui touche directement au coeur du "VLA qui marche à l'échelle" : je rédige l'article en respectant le format demandé. Des chercheurs proposent une nouvelle méthode de planification de mouvement combinant apprentissage profond et recherche algorithmique classique, dans un article publié sur arXiv le 30 juin 2026 (arXiv:2606.30940). Le principe repose sur un autoencodeur entraîné à fort taux de compression, dont l'espace latent est organisé en tokens discrets hiérarchisés, du grossier au fin. Plutôt que de générer des trajectoires directement, le système effectue une recherche dans cet espace latent compressé pour construire des plans de mouvement, en optimisant des fonctions objectif définies au moment du test, sans entraînement spécifique à la tâche. La méthode a été évaluée sur deux jeux de données de référence en conduite autonome, nuPlan et le Waymo Open Motion Dataset, sur des tâches de planification de mouvement en boucle fermée et de synthèse de scénarios multi-agents guidés. L'enjeu pour l'industrie robotique et la conduite autonome est de taille : les approches par apprentissage profond capturent bien la complexité des comportements réels mais restent rigides une fois entraînées sur un objectif fixe, tandis que les méthodes de recherche et d'optimisation classiques offrent flexibilité et contrôle explicite au prix d'un manque de réalisme. En permettant de rechercher directement dans un espace latent compressé et hiérarchisé, les auteurs affirment obtenir le meilleur des deux mondes, un espace de solutions réduit et structuré qui garde le réalisme générique de l'autoencodeur, tout en acceptant n'importe quel objectif spécifié à la volée. Si les résultats se confirment à plus grande échelle, cela ouvrirait la voie à des planificateurs capables de s'adapter à de nouvelles contraintes (sécurité, confort, interaction multi-agents) sans réentraînement coûteux, un point critique pour les intégrateurs qui doivent déployer des systèmes de navigation sur des flottes hétérogènes de véhicules ou de robots mobiles. Ce travail s'inscrit dans une lignée de recherches cherchant à réconcilier planification model-based et modèles génératifs appris, un débat qui traverse aussi bien la conduite autonome que la robotique manipulatrice, où des architectures VLA comme Pi-0 ou GR00T N2 tentent une intégration différente entre perception, langage et action. La méthode se distingue en misant sur la compression et la structure discrète hiérarchique de l'espace latent plutôt que sur des politiques bout-en-bout continues. Les auteurs ne mentionnent pas de partenariat industriel ni de déploiement au-delà des benchmarks nuPlan et Waymo ; l'article reste donc à ce stade une contribution de recherche, sans calendrier de transfert vers un produit commercial ou un pilote terrain.

RecherchePaper
1 source
Modélisation structurelle-hydrodynamique unifiée des mécanismes sous-actionnés sous-marins et des robots souples
1806arXiv cs.RO 

Modélisation structurelle-hydrodynamique unifiée des mécanismes sous-actionnés sous-marins et des robots souples

Sous-marins et souples, des robots sans actionneurs excédentaires posent un problème classique en robotique : comment modéliser précisément un système dont on ne connaît ni les paramètres structurels (raideur, amortissement) ni les forces hydrodynamiques qui s'exercent dessus. Une équipe de recherche propose une réponse dans un article mis à jour sur arXiv (2603.07939v2) : un cadre d'optimisation globale piloté par trajectoire, inspiré de la stratégie d'évolution CMA-ES (Covariance Matrix Adaptation Evolution Strategy), capable d'identifier simultanément les paramètres élastiques, d'amortissement et hydrodynamiques distribués d'un système multi-corps sous-marin. La méthode fonctionne en comparant, trajectoire par trajectoire, un mouvement simulé à un mouvement observé expérimentalement, et ne nécessite qu'un simple enregistrement vidéo pour calibrer le modèle. Sur un mécanisme sous-actionné articulé testé en configuration active-passive et passive pure, l'erreur de position normalisée de l'effecteur reste sous les 5 % quelles que soient la trajectoire et les conditions initiales. La méthode a ensuite été validée sur un bras souple asymétrique inspiré de la pieuvre, puis sur un système complet de huit bras assemblés en un robot pieuvre nageur, où le même jeu de paramètres reproduit un comportement corporel réaliste sans recalibrage supplémentaire. L'enjeu dépasse la simple prouesse académique : les mécanismes sous-actionnés et les robots souples sont privilégiés en environnement sous-marin car réduire le nombre d'actionneurs limite les risques de fuite au niveau des moteurs, tout en offrant une compliance mécanique utile pour manipuler des objets fragiles ou s'adapter aux courants. Le principal frein à leur adoption reste la difficulté de modéliser des systèmes à la fois élastiques et soumis à une hydrodynamique complexe, ce qui limite le contrôle précis et le transfert simulation-vers-réel. Un cadre unifié qui identifie structure et hydrodynamique conjointement, et qui se généralise d'un bras isolé à un assemblage complet sans retuning, réduirait significativement le travail d'ingénierie nécessaire avant tout déploiement en exploration océanique ou manipulation sous-marine. Ce travail s'inscrit dans une lignée de recherches sur l'identification de paramètres pour robots souples et sous-actionnés, où les approches précédentes traitaient généralement séparément la caractérisation structurelle et l'estimation hydrodynamique, ou nécessitaient des bancs d'essai instrumentés lourds. En s'appuyant sur une simple vidéo et une optimisation de type CMA-ES, les auteurs visent une méthode moins coûteuse à mettre en œuvre. Les prochaines étapes annoncées concernent l'extension à des géométries plus complexes et des essais en conditions océaniques réelles, au-delà des validations en bassin présentées ici.

RecherchePaper
1 source
Robotique physique et navigation sémantique par graphe de scène 3D hiérarchique et planification bayésienne
1807arXiv cs.RO 

Robotique physique et navigation sémantique par graphe de scène 3D hiérarchique et planification bayésienne

Une équipe de recherche propose un nouveau système de navigation sémantique en zero-shot pour agents robotiques évoluant dans des environnements inconnus, capable de combiner compréhension du langage naturel et planification à long terme. Le cœur de la méthode est un graphe de scène 3D hiérarchique (Hierarchical 3D Scene Graph, HSG), construit et mis à jour en continu pendant l'exploration, qui organise l'environnement en plusieurs niveaux de granularité : objets, zones et régions. Ce graphe sert de représentation compacte de l'état global, sur laquelle s'appuie un module de planification fondé sur des croyances (belief-based planning) qui combine les a priori sémantiques issus de modèles de fondation avec les preuves accumulées lors de l'exploration. Le système effectue des simulations à horizon fini directement sur le HSG pour estimer le gain attendu de chaque macro-action candidate avant de décider où aller. Testée sur plusieurs tâches et jeux de données en simulation haute fidélité, l'approche améliore en moyenne le taux de réussite (SR) de 9,4% et le score SPL (réussite pondérée par la longueur du chemin) de 5,0% par rapport aux meilleures méthodes existantes, avec des gains plus marqués sur les trajectoires longue distance. L'intérêt de ce travail est de s'attaquer à un défaut connu des agents de navigation actuels : lorsqu'ils reposent uniquement sur des modèles de fondation sans mémoire structurée du monde, ils ont tendance à adopter des stratégies gloutonnes fondées sur l'observation locale, ce qui produit une exploration inefficace et des comportements myopes, en particulier sur de longues distances. En donnant à l'agent une carte sémantique persistante et hiérarchisée plutôt qu'un simple flux d'observations, la méthode réduit les retours en arrière redondants et permet des décisions cohérentes à l'échelle globale. C'est un signal utile pour la robotique mobile autonome (entrepôts, robots de service) où la navigation longue portée dans des lieux jamais vus reste un point faible des architectures purement réactives. Ce travail s'inscrit dans la lignée des recherches récentes qui exploitent les modèles de fondation pour doter les robots de connaissances sémantiques riches, mais cherche à corriger leur principale limite, l'absence de représentation globale structurée. Contrairement aux approches concurrentes qui traitent la scène comme une simple carte topologique plate, le HSG introduite ici multiplie les niveaux d'abstraction. Les résultats, uniquement obtenus en simulation, ouvrent la voie à des tests en conditions réelles, où le passage du simulateur au monde physique reste l'obstacle habituel de ce type de recherche.

RecherchePaper
1 source
Apprentissage de la préhension dextérique à partir d'une taxonomie clairsemée
1808arXiv cs.RO 

Apprentissage de la préhension dextérique à partir d'une taxonomie clairsemée

Une équipe de recherche a présenté GRIT, un système de manipulation dextre en deux étapes conçu pour piloter des mains robotiques multi-doigts sans exiger de plan de préhension dense pour chaque objet et chaque tâche. Concrètement, GRIT prédit d'abord une spécification de prise à partir d'une taxonomie de préhension (un ensemble limité de catégories de prises, comme on en trouve en robotique manipulatoire depuis des taxonomies classiques à une vingtaine d'entrées), en s'appuyant sur la scène observée et le contexte de la tâche. Une politique de contrôle continue génère ensuite les mouvements des doigts nécessaires pour exécuter la tâche tout en respectant la structure de prise choisie. Selon les auteurs, cette approche atteint un taux de réussite global de 87,9 % et généralise mieux à des objets jamais vus que les méthodes de référence, avec des expérimentations validées en conditions réelles (real-world experiments) et non uniquement en simulation. Le papier, republié sur arXiv en tant que version corrigée (v2), ne précise pas la plateforme matérielle exacte ni le nombre de degrés de liberté de la main utilisée dans le résumé disponible. L'intérêt de ce travail dépasse la simple métrique de succès : il s'attaque à un vrai dilemme d'ingénierie pour les intégrateurs de mains robotiques dextres. D'un côté, spécifier des cibles de contact ou de pose détaillées pour chaque objet est impraticable à l'échelle industrielle. De l'autre, l'apprentissage par renforcement de bout en bout, guidé uniquement par une récompense de tâche, produit des comportements peu contrôlables, difficiles à corriger quand un échec survient sur une chaîne de production ou en logistique. En montrant qu'une guidance taxonomique éparse suffit à préserver à la fois généralisation et contrôlabilité, GRIT offre une piste concrète pour des systèmes où un opérateur pourrait ajuster la stratégie de prise via une sélection de haut niveau, plutôt que de reprogrammer une trajectoire complète. Cette recherche s'inscrit dans un courant plus large de travaux sur la manipulation dextre qui cherchent un compromis entre commande explicite et apprentissage bout-en-bout, un axe également exploré par des laboratoires travaillant sur les architectures VLA (vision-language-action) pour la robotique généraliste. Le texte ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial : il s'agit à ce stade d'un résultat académique, dont la prochaine étape logique serait un portage sur des plateformes de préhension dextre plus largement utilisées en laboratoire ou en intégration industrielle.

RecherchePaper
1 source
UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action
1809arXiv cs.RO 

UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action

UniTacVLA, un modèle vision-langage-action (VLA) tactile, vise à résoudre un point faible connu des VLA classiques : la manipulation dextre en contact riche, comme l'insertion, l'essuyage, l'assemblage ou l'ajustement de précision. Contrairement aux approches vision-tactile-langage-action (VTLA) existantes qui traitent le signal tactile comme une simple entrée auxiliaire passive, l'équipe de recherche propose un espace latent tactile unifié qui modélise conjointement l'état tactile courant et les changements de contact futurs, via un raisonnement en chaîne de pensée tactile et une prédiction tactile progressive (coarse-to-fine). Ce prior tactile alimente ensuite un contrôleur mixte tactile-action combinant retour tactile en temps réel et retour prédit, pour corriger à haute fréquence des chunks d'action calculés à basse fréquence. Les expériences ont été menées en conditions réelles sur quatre catégories de tâches à fort contact (ajustement, insertion, essuyage, assemblage), testées à la fois en environnement propre et sous perturbations externes. L'enjeu dépasse la simple amélioration de benchmark. La manipulation en contact riche reste l'un des goulots d'étranglement majeurs empêchant les bras robotiques et humanoïdes de passer de la démonstration en laboratoire au déploiement industriel réel, notamment pour des tâches d'assemblage fin où la seule vision ne suffit pas à garantir la précision ou la robustesse face aux perturbations. En traitant le tactile comme un signal dynamique et prédictif plutôt que comme un simple capteur passif, UniTacVLA s'attaque directement à l'écart persistant entre les VLA génériques, entraînés majoritairement sur des données visuelles, et les exigences physiques réelles de l'assemblage industriel ou de la manipulation fine en conditions non contrôlées. Les auteurs revendiquent des gains sur le taux de succès, la précision de manipulation et la robustesse au contact par rapport aux méthodes existantes, ce qui, si confirmé à plus grande échelle, renforcerait l'argument selon lequel l'intégration tactile profonde est nécessaire pour les tâches dextres, et pas seulement un ajout marginal. Ce travail s'inscrit dans une vague plus large de recherche visant à doter les modèles VLA de capacités multimodales au-delà de la vision et du langage, à mesure que des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T) poussent leurs propres modèles génération vers la production industrielle. Les architectures VTLA précédentes, limitées par un traitement passif du tactile, constituent la ligne de base que ce papier cherche à dépasser. La publication, un prépublication arXiv, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; les prochaines étapes attendues porteraient sur l'extension à davantage de types de capteurs tactiles et de tâches, ainsi que sur une validation à plus grande échelle en dehors du cadre contrôlé des expériences décrites.

IA physiqueActu
1 source
Apprentissage de la locomotion sur terrain discret via une détection minimale de proximité
1810arXiv cs.RO 

Apprentissage de la locomotion sur terrain discret via une détection minimale de proximité

Une équipe de recherche propose d'intégrer des capteurs de proximité infrarouges directement dans les pattes d'un robot quadrupède, pour lui donner une perception "pré-contact" du terrain avant même que le pied ne touche le sol. Contrairement aux caméras de profondeur ou aux LiDAR, ces capteurs sont peu coûteux, fonctionnent à haute fréquence et restent insensibles aux auto-occlusions propres à la locomotion dynamique. Les signaux qu'ils produisent sont intégrés dans un pipeline d'apprentissage par renforcement, entraîné en simulation puis transféré sur le robot réel avec, selon les auteurs, une bonne fidélité. Les tests ont porté sur des terrains discontinus, trous et pierres de gué, des configurations réputées difficiles pour les systèmes de perception globale classiques, sujets aux occlusions et à la dérive d'estimation d'état. Le site du projet (sites.google.com/view/foot-tof) présente les démonstrations associées, qu'il convient toutefois de considérer comme des résultats de laboratoire plutôt que comme une validation en conditions réelles à grande échelle. L'intérêt de l'approche tient à la position qu'elle occupe entre deux extrêmes du secteur : les suites de perception globale (LiDAR, caméras de profondeur), puissantes mais lourdes en calcul et sensibles aux latences et aux occlusions, et la proprioception pure, qui ne réagit qu'après l'impact. En ajoutant une couche de perception locale et quasi instantanée, ce travail illustre une tendance de fond dans la robotique locomotrice : réduire la dépendance à des pipelines de vision denses et coûteux au profit de capteurs simples exploités intelligemment par du RL. Pour les intégrateurs de robots quadrupèdes destinés à des environnements non structurés, chantiers, sites industriels, terrains extérieurs, cela ouvre la voie à des architectures moins gourmandes en puissance de calcul embarquée. Ce travail s'inscrit dans la lignée des recherches récentes en apprentissage par renforcement pour la locomotion dynamique, qui ont déjà permis à des robots quadrupèdes de franchir des obstacles complexes en s'appuyant sur des perceptions visuelles riches. En proposant une alternative ou un complément low-cost et low-latency à ces stacks visuels, l'étude ouvre des pistes pour des déploiements ultérieurs combinant capteurs de contact et perception globale, sans toutefois préciser à ce stade de calendrier d'industrialisation.

RecherchePaper
1 source
IA à base d'agents, pilotée par LLM : synthèse d'actions robotiques à partir de la parole, des gestes et de la musique
1811arXiv cs.RO 

IA à base d'agents, pilotée par LLM : synthèse d'actions robotiques à partir de la parole, des gestes et de la musique

Des chercheurs publient sur arXiv (arXiv:2606.31158, soumission nouvelle non encore validée par les pairs) un framework qui utilise un grand modèle de langage (LLM) pour générer des actions robotiques à partir d'entrées humaines multimodales combinant parole naturelle, gestes de la main et musique ou rythme sonore. L'architecture assemble trois briques : un module de transcription vocale, un module de reconnaissance de gestes, et un pipeline de traitement du signal dédié à la détection de battements musicaux. Ces flux sont contextualisés via des templates de prompts, puis transmis à un LLM qui, informé d'un espace d'actions robotiques prédéfini, raisonne sur l'ensemble pour produire une séquence d'actions cohérente. Cette séquence alimente une file d'exécution pilotée via ROS (Robot Operating System) sur un robot quadrupède. L'abstract ne précise ni le modèle de LLM utilisé, ni de métriques de performance chiffrées, ni le nom commercial du robot testé : à ce stade, il s'agit d'une preuve de concept méthodologique documentée dans un preprint, pas d'un produit ou d'un déploiement. L'intérêt tient à la fusion de trois canaux hétérogènes dans un seul raisonnement : commandes sémantiques issues de la parole, information déictique (pointage, direction) issue des gestes, et cues rythmiques issues de la musique. Cela dépasse les systèmes de commande rigides et pré-programmés qui dominent encore l'interaction homme-robot (HRI), et s'inscrit dans la tendance plus large consistant à confier aux LLM le rôle de "cerveau de raisonnement" pour des comportements robotiques créatifs et contextuels, plutôt que pour la seule manipulation d'objets. Ce type d'approche vise davantage les robots d'accueil, de divertissement ou compagnons sociaux que l'industrie lourde, le quadrupède servant ici de plateforme de démonstration générique. Le travail s'inscrit dans la vague récente de recherches associant LLM et VLA (vision-language-action) à la robotique, aux côtés d'efforts comme GR00T N2 ou Pi-0 orientés manipulation. Ce papier se distingue en ciblant spécifiquement l'interaction créative multimodale plutôt que la tâche industrielle. L'abstract ne mentionne ni affiliation ni auteurs identifiables, ni calendrier de suite ; les prochaines étapes attendues pour ce type de travail restent une évaluation utilisateur et l'extension à d'autres morphologies de robots.

RecherchePaper
1 source
L'expansion des recrutements de NVIDIA en robotique en Chine, avec des postes à Pékin, Shanghai et Shenzhen
1812TechNode 

L'expansion des recrutements de NVIDIA en robotique en Chine, avec des postes à Pékin, Shanghai et Shenzhen

NVIDIA a lancé une campagne de recrutement d'ampleur pour son équipe robotique, avec des postes ouverts à Pékin, Shanghai et Shenzhen dans quatre domaines clés : IA incarnée (embodied AI), simulation, déploiement et architecture de solutions. L'équipe IA incarnée se concentrera sur la manipulation dextre, la modélisation du corps humain via capteurs portables, la manipulation mobile du corps entier et le contrôle corporel global, avec pour objectif le développement de robots généralistes de nouvelle génération. L'équipe simulation bâtira l'infrastructure de simulation et d'entraînement permettant aux robots d'apprendre efficacement en environnement virtuel avant de transférer ces capacités vers le monde réel de façon plus rapide et fiable. L'équipe déploiement optimisera les algorithmes pour robots humanoïdes et systèmes d'IA incarnée en vue d'accélérer leur mise en service concrète, tandis que l'équipe architecture de solutions adaptera les technologies NVIDIA à des secteurs comme l'industrie manufacturière et les services. Cette offensive de recrutement confirme la stratégie de NVIDIA : s'imposer comme fournisseur d'infrastructure (puces, simulation, frameworks type Isaac ou GR00T) plutôt que comme constructeur de robots, y compris sur le marché chinois malgré les restrictions américaines à l'export de puces IA vers la Chine. Le choix de Pékin, Shanghai et Shenzhen, hubs historiques de l'électronique et de la robotique chinoise, place l'entreprise en position de collaborer étroitement avec des acteurs locaux comme Unitree, AgiBot, Fourier Intelligence ou UBTech, tous engagés dans la course aux humanoïdes généralistes. Pour les intégrateurs et décideurs industriels, ce mouvement souligne l'importance croissante du transfert sim-to-real et des architectures VLA (vision-langage-action) comme verrou technologique central du secteur. Cette expansion s'inscrit dans la continuité des investissements de NVIDIA en robotique depuis 2024, autour de plateformes comme Isaac Sim, Jetson Thor et les modèles GR00T. En renforçant sa présence locale en Chine plutôt qu'en se limitant à l'export de matériel, l'entreprise cherche à ancrer sa pile logicielle dans un écosystème manufacturier en pleine effervescence, où plusieurs constructeurs déploient déjà des humanoïdes en usine.

Chine/AsieOpinion
1 source
Sous-traitée de la robotique en peau électronique fondée par un professeur de l'université de Soochow lève des fonds en amorçage
1813Pandaily 

Sous-traitée de la robotique en peau électronique fondée par un professeur de l'université de Soochow lève des fonds en amorçage

Perception Era Technology, startup chinoise fondée par un professeur de l'Université de Soochow, a bouclé un tour de financement d'amorçage de plusieurs dizaines de millions de yuans, mené par Songhe Capital. La société, créée en décembre 2025, se positionne comme fournisseur d'infrastructure tactile pour robots, combinant peau électronique multimodale propriétaire, capteurs matériels et algorithmes d'IA pour livrer des systèmes tactiles complets. Son produit phare est une peau électronique bionique multimodale et élastique qui, contrairement aux capteurs rigides classiques, épouse les surfaces courbes des bras, doigts et articulations robotiques, une seule feuille pouvant couvrir l'intégralité d'un corps de robot. Le matériau biomimétique revendique plus de 400 % d'élasticité et a passé plus d'un million de cycles de test de fiabilité, des chiffres qui visent à démontrer sa robustesse pour un usage industriel réel plutôt qu'une simple démonstration en laboratoire. Le montant exact de la levée reste flou, une imprécision fréquente dans les annonces d'amorçage chinoises. Ce pari illustre un déplacement d'attention dans la robotique humanoïde : après des années centrées sur la vision par ordinateur et les modèles vision-langage-action type Pi-0 ou GR00T N2, le secteur identifie désormais le toucher comme le prochain verrou technique pour atteindre une dextérité proche de l'humain. Sans perception tactile fine (pression, texture, température, glissement), les robots peinent à manipuler des objets non structurés en usine, en entrepôt ou en environnement médical, ce qui limite leur déploiement au-delà de tâches répétitives préprogrammées. La capacité de transfert d'apprentissage intégrée par la startup, permettant au robot de généraliser sa reconnaissance tactile à des objets inconnus mais physiquement proches d'objets déjà appris, s'inscrit dans cette logique : faire passer les systèmes tactiles d'une collecte de données passive à une prise de décision active. Pour les intégrateurs et décideurs industriels, ce type de brique technologique conditionne la viabilité économique des robots généralistes promis par les grands acteurs du secteur. Cette levée s'inscrit dans une vague plus large d'investissements chinois dans la détection tactile robotique, un segment longtemps resté en retrait par rapport à la vision par ordinateur mais désormais jugé stratégique face à la course mondiale aux robots humanoïdes, portée notamment par Figure (Figure 03), Tesla (Optimus Gen 3) ou Physical Intelligence. Perception Era ne détaille pour l'instant aucun partenariat industriel concret ni calendrier de déploiement commercial, la société n'ayant que sept mois d'existence. Reste à voir si l'entreprise parviendra à transformer ses performances de laboratoire, l'élasticité et le nombre de cycles de test annoncés, en déploiements réels chez des fabricants de robots ou des intégrateurs, une étape où beaucoup de startups de capteurs tactiles ont historiquement buté sur les coûts de production à l'échelle et l'intégration logicielle avec les piles de contrôle existantes.

Chine/AsieActu
1 source
IA sensibles et attachants d'UBTech, conçus pour la compagnie, arrivent bientôt dans les foyers chinois
1814SCMP Tech 

IA sensibles et attachants d'UBTech, conçus pour la compagnie, arrivent bientôt dans les foyers chinois

Le fabricant chinois UBTech Robotics, première entreprise de robots humanoïdes cotée en bourse au monde, a dévoilé mardi à Shenzhen son robot U1, un humanoïde de compagnie destiné aux particuliers. Doté d'une peau en silicone imitant l'apparence humaine et d'une IA émotionnelle, l'U1 est proposé en deux versions, masculine (183 cm) et féminine (168 cm), déclinées en trois gammes Lite, Pro et Ultra selon le niveau d'équipement et de prix. UBTech positionne ainsi ce lancement comme une extension de son catalogue au-delà des robots industriels, vers un usage domestique centré sur la compagnie et l'interaction sociale plutôt que sur des tâches physiques comme la manipulation d'objets ou les travaux ménagers. Cette annonce illustre un mouvement plus large des industriels chinois de la robotique, qui cherchent à sortir les humanoïdes de l'usine pour les installer dans les foyers, un marché potentiellement bien plus vaste mais aussi plus incertain que l'automatisation industrielle. Pour les acteurs du secteur, ce pivot pose la question de la viabilité commerciale réelle de ces produits : contrairement aux robots industriels évalués sur des critères objectifs (charge utile, cadence, fiabilité), un robot de compagnie doit convaincre sur des critères subjectifs comme le réalisme émotionnel et l'acceptabilité sociale, des domaines où le fossé entre démonstration et usage quotidien reste généralement important. Le succès ou l'échec commercial de l'U1 servira de test grandeur nature pour la stratégie de diversification vers le grand public que plusieurs fabricants chinois envisagent. UBTech s'est fait connaître par ses robots industriels et de service déployés dans des usines, notamment via des partenariats avec des constructeurs automobiles chinois, avant de miser sur la cotation boursière pour financer son expansion. Le lancement de l'U1 s'inscrit dans une compétition intense entre acteurs chinois du secteur, dans un contexte où le gouvernement chinois soutient activement le développement de la robotique humanoïde comme filière stratégique. Les détails sur les prix précis, les capacités techniques complètes et le calendrier de disponibilité commerciale hors de Chine restent pour l'instant limités, UBTech n'ayant communiqué que les grandes lignes lors du dévoilement à Shenzhen.

Chine/AsieActu
1 source
Robot compagnon U1 d'UBTECH : plus de 10 000 commandes malgré un positionnement premium
1815Pandaily 

Robot compagnon U1 d'UBTECH : plus de 10 000 commandes malgré un positionnement premium

UBTECH a présenté sa série U1, une gamme de robots humanoïdes de compagnie, lors de sa conférence mondiale 2026, avec plus de 10 000 commandes enregistrées dès le premier jour de lancement. La gamme cible le marché premium du robot de compagnie grand public avec quatre déclinaisons : la version Lite à 119 800 yuans (environ 15 300 euros), la version Pro à 169 800 yuans (environ 21 700 euros), et les versions Ultra à 990 000 yuans pour le modèle masculin et 880 000 yuans pour le modèle féminin (soit environ 127 000 et 113 000 euros). Les robots intègrent des expressions faciales avancées - clignements des yeux, mouvements de tête - et un système de conversation en langage naturel reposant sur un modèle d'IA dédié à la compagnie émotionnelle, avec un stockage local chiffré pour la mémoire des interactions. La version Ultra masculine mesure 183 cm pour 42 kg, la version féminine 168 cm pour 35,2 kg, toutes deux équipées de 88 articulations à haut degré de liberté. La version Pro se limite à la marche bipède, tandis que les versions Ultra disposent d'une locomotion complète. La tête à elle seule embarque 19 servomoteurs capables de produire plus de 30 micro-expressions, bien que sourcils et cils restent implantés manuellement faute d'automatisation. UBTECH vise une capacité de production à l'échelle de 50 000 unités en 2026, et les produits sont réservés à l'achat et à l'usage par des adultes, une restriction affichée sur les plateformes de e-commerce chinoises. Le PDG Zhou Jian a lui-même reconnu les difficultés de fabrication, qualifiant la production de robots bioniques de phase exploratoire à forte difficulté technique, une franchise inhabituelle pour un lancement commercial. Sur le plan tarifaire, il affirme qu'il existe déjà une marge bénéficiaire, appelée à s'améliorer avec la montée en échelle de la production couvrant différents segments de marché. Ce lancement marque une bascule significative pour l'industrie de la robotique humanoïde, qui passe de la démonstration technologique au produit de consommation vendu en volume. Les analystes soulignent que l'intérêt du U1 ne réside pas dans ses caractéristiques techniques, somme toute comparables à d'autres humanoïdes du marché, mais dans le fait qu'il s'agit du premier robot humanoïde packagé comme un produit de consommation émotionnel complet : une proposition de style de vie plutôt qu'une pièce de démonstration technologique. Pour les intégrateurs et décideurs du secteur, ce positionnement teste directement la capacité du marché grand public chinois à absorber des humanoïdes à prix élevé, jusqu'à environ 127 000 euros, et pourrait ouvrir une voie de monétisation alternative à l'industriel et à la logistique, jusqu'ici axes principaux du secteur. UBTECH, coté à la Bourse de Hong Kong, s'était jusqu'à présent surtout fait connaître pour ses humanoïdes industriels comme le Walker S, déployés en pilotes chez des constructeurs automobiles chinois. Le U1 marque une diversification vers le grand public et le marché de la compagnie émotionnelle, un segment encore peu disputé face aux humanoïdes généralistes de Figure, Tesla avec Optimus, ou Unitree, davantage orientés vers l'industrie et la recherche. Aucun autre acteur majeur n'a pour l'instant lancé un humanoïde de compagnie à une échelle commerciale comparable, même si des entreprises comme Realbotix ou plusieurs studios japonais explorent des approches similaires avec des robots moins mobiles. La suite dépendra de la capacité d'UBTECH à tenir ses objectifs de production sans sacrifier la fiabilité, et à naviguer les questions éthiques soulevées par la dépendance affective à une IA, un sujet que la restriction réservée aux adultes laisse pressentir sans le nommer explicitement. La gestion de la chaîne d'approvisionnement et le naturel des algorithmes émotionnels restent les deux inconnues techniques les plus citées par les observateurs du secteur.

Chine/AsieOpinion
1 source
X Square Robot porte sa valorisation à 2,8 milliards de dollars après quatre levées de fonds consécutives
1816The Robot Report 

X Square Robot porte sa valorisation à 2,8 milliards de dollars après quatre levées de fonds consécutives

X Square Robot, société chinoise spécialisée en IA incarnée basée à Shenzhen, a bouclé quatre tours de financement consécutifs s'achevant par une série C, portant sa valorisation à plus de 2,8 milliards de dollars. Fondée en 2023 par Wang Qian, l'entreprise a vu IDG participer à ce dernier tour, tandis que HongShan et Xiaomi l'ont soutenue à plusieurs reprises lors des levées précédentes. Les fonds serviront à renforcer la recherche fondamentale et les technologies cœur, dans l'optique de progresser vers une IA incarnée généraliste. En avril 2026, la société a dévoilé WALL-B, un modèle de fondation construit sur une architecture baptisée World Unified Model : contrairement aux approches VLA (vision-langage-action) modulaires classiques, ce système entraîne perception, langage, action et prédiction physique au sein d'un réseau unique, censé renforcer la compréhension multimodale et le raisonnement spatial. X Square a aussi ouvert en open source WALL-OSS-0.5 et WALL-WM, ce dernier modèle traitant les données par « événements » pour améliorer l'apprentissage croisé entre modalités. Sur 17 tâches robotiques réelles testées sans post-entraînement, WALL-OSS-0.5 afficherait un taux de réussite autonome supérieur à 80% sur quatre d'entre elles seulement, un chiffre à nuancer puisqu'il ne concerne qu'une minorité des tâches évaluées. Cette levée intervient alors que la robotique incarnée chinoise multiplie les annonces de financement spectaculaires, dans un contexte où le marché reste partagé entre démonstrations soignées et déploiements réels limités. Le pari de X Square consiste à tester son système directement dans des foyers, via un partenariat avec la plateforme 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, et via le programme « X Family Member », lancé en mai 2026, où des robots vivent jusqu'à un mois chez des familles volontaires pour effectuer des tâches domestiques variées. Si l'entreprise présente cela comme une sortie du cadre des démonstrations scénarisées, l'exercice reste à des échelles encore restreintes et la robustesse réelle hors environnement contrôlé demande à être confirmée sur la durée. X Square s'inscrit dans une compétition mondiale où s'affrontent les modèles fondation pour la robotique, qu'il s'agisse de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, ainsi que des rivaux chinois comme Unitree, AgiBot ou UBTech, tous engagés dans une course au déploiement domestique et industriel. La stratégie d'intégration verticale de X Square, mêlant modèles propriétaires, pipeline de données automatisé et déploiements terrain, vise à accélérer l'itération produit. Les prochaines étapes attendues concernent l'extension du programme familial et l'élargissement des partenariats industriels et logistiques, domaines où la société dit également opérer en parallèle du marché domestique.

Chine/AsieActu
1 source
Vidéo : un nouveau modèle d'IA permet aux robots humanoïdes de réussir 90 % des missions complexes
1817Interesting Engineering 

Vidéo : un nouveau modèle d'IA permet aux robots humanoïdes de réussir 90 % des missions complexes

Flexion Robotics a dévoilé Reflect v1.0, une plateforme d'intelligence robotique destinée aux humanoïdes, capable d'exécuter des missions longues et multi-étapes sans intervention humaine pendant l'exécution. Pour illustrer les capacités du système, la société a présenté une démonstration en environnement de bureau : un robot humanoïde reçoit une instruction en langage naturel, récupère un colis de snacks livré au bâtiment, emprunte escaliers et ascenseur, déballe le carton à l'aide d'outils, puis range les articles dans un tiroir désigné. Selon Flexion, l'intégration du reinforcement learning sur plusieurs couches du système a fait passer le taux de complétion end-to-end d'une mission interne à 16 étapes de 38 % à 90 %, contre un modèle supervisé seul. La plateforme gère des charges comprises entre 100 grammes et 3,5 kilogrammes, et le robot est capable de repositionner un colis via des mouvements coordonnés du corps entier, d'opérer un ascenseur, de traverser des escaliers répétés et de contourner des obstacles dynamiques tout en portant des objets. Ce résultat est significatif parce qu'il s'attaque directement au problème de l'autonomie longue durée, considéré comme l'un des verrous majeurs de la robotique humanoïde commerciale. Dans une séquence de tâches, l'accumulation d'erreurs de navigation, de manipulation ou de perception finit statistiquement par faire échouer le système : c'est le "long-horizon failure mode" que les industriels connaissent bien. Reflect v1.0 le traite via un modèle vision-langage (VLM) personnalisé qui fait office de contrôleur de mission, surveille en continu l'avancement, raisonne sur l'environnement et re-planifie à la demande. La couche de mouvement combine des vision-language-action models (VLA) entraînés sur données réelles et des primitives issues du reinforcement learning, tandis qu'un contrôleur corps-entier temps réel assure équilibre et précision des gestes. Pour un COO industriel ou un intégrateur, le signal concret est le suivant : on passe de 38 % à 90 % de succès sur une mission à 16 étapes grâce au RL seul, ce qui suggère que le sim-to-real gap et la fiabilité multi-tâche sont partiellement solubles sans refonte matérielle. Flexion Robotics est une startup relativement récente dans l'écosystème humanoïde, qui se positionne comme fournisseur de couche logicielle agnostique au hardware, à l'image de ce que Apptronik ou 1X cherchent à faire sur leurs propres plateformes. L'article mentionne également ShengShu Technology et son modèle Motubrain, un "cerveau général" combinant perception, raisonnement et action, qui vise le même marché. La concurrence directe inclut Figure (Helix), Physical Intelligence (pi0), Boston Dynamics (Atlas Gen 2) et Tesla (Optimus Gen 3), tous engagés dans une course à l'autonomie longue horizon. Flexion reconnaît que Reflect v1.0 reste limité à des environnements définis, ce qui tempère le chiffre de 90 % : il s'agit d'une évaluation interne sur mission contrôlée, pas d'un déploiement industriel validé en conditions réelles. Les prochaines étapes annoncées concernent l'extension à des environnements moins structurés et la capacité à recevoir des instructions modifiées en cours de mission, deux marqueurs qui, s'ils sont confirmés en production, rapprocheraient Reflect d'une utilisabilité opérationnelle sérieuse.

IA physiqueOpinion
1 source
Jaiveer Singh aide les robots et les développeurs à progresser plus rapidement
1818NVIDIA Blog Robotics 

Jaiveer Singh aide les robots et les développeurs à progresser plus rapidement

Jaiveer Singh, ingénieur logiciel chez NVIDIA, dirige l'équipe responsable d'Isaac ROS (Robot Operating System), une pile logicielle open source construite sur le framework ROS 2 et accélérée par les bibliothèques CUDA de NVIDIA. Isaac ROS fournit aux développeurs un ensemble de modules pour la perception, la détection d'objets, la cartographie (SLAM), la détection de collision et la planification de mouvements. La plateforme est compatible avec les robots mobiles autonomes (AMR), les systèmes de manipulation et les humanoïdes, et peut s'exécuter sur des postes de travail, sur le DGX Spark (le supercalculateur IA personnel de NVIDIA) ainsi que sur les systèmes embarqués Jetson. Le projet a débuté comme un projet de stage de Singh, alors étudiant en génie électrique, informatique et gestion à l'Université de Californie Berkeley, avec une question simple : publier des bibliothèques GPU open source pour la robotique aurait-il de la valeur ? La réponse s'est avérée positive, et Isaac ROS est depuis devenu un composant central de l'écosystème robotique NVIDIA. L'importance d'Isaac ROS pour l'industrie tient à sa modularité et à son positionnement comme couche d'intégration entre l'IA générative et le déploiement physique. Contrairement à l'ancien Isaac SDK, la version ROS se présente, selon Singh lui-même, comme "un ensemble de briques LEGO" : les développeurs assemblent les modules selon leurs besoins et les combinent avec du code ROS communautaire existant. Pour un intégrateur ou un OEM qui cherche à passer de la démonstration au déploiement série, cette approche réduit la friction d'adoption. Elle répond aussi à une préoccupation structurelle du secteur : la pérennité de la pile logicielle. Un startup qui construit sur un système fermé doit faire confiance au fait que ce système correspondra toujours à ses besoins dans deux ou trois ans, une promesse difficile à tenir dans un marché qui se recompose chaque trimestre. L'open source apporte ici une garantie d'auditabilité et de continuité que les systèmes propriétaires peinent à offrir. NVIDIA s'est positionné sur la robotique bien avant que le secteur devienne un sujet grand public, et Isaac ROS s'inscrit dans cette continuité stratégique. La plateforme évolue aujourd'hui pour répondre aux exigences des humanoïdes, qui requièrent une stack logicielle de bout en bout capable de gérer des agents IA, de la simulation (Isaac Sim) au déploiement edge sur Jetson. Les concurrents directs sur la couche middleware incluent ROS 2 non-accéléré utilisé seul, mais aussi les environnements propriétaires de Boston Dynamics, Agility Robotics ou Figure AI, qui développent leurs propres stacks internes. NVIDIA joue ici un rôle transversal d'infrastructure partagée, moins visible qu'un robot humanoïde en vidéo, mais potentiellement plus déterminant pour la cadence industrielle du secteur. Les prochaines étapes annoncées portent sur le renforcement du support aux agents IA et aux systèmes humanoïdes, deux segments en forte croissance depuis 2024.

InfrastructureOpinion
1 source
Nvidia renforce son équipe robotique en Chine face à l'essor de l'IA physique
1819SCMP Tech 

Nvidia renforce son équipe robotique en Chine face à l'essor de l'IA physique

Nvidia intensifie ses recrutements en Chine pour renforcer son équipe dédiée à la robotique physique, avec plus d'une douzaine de postes ouverts simultanément à Beijing, Shanghai et Shenzhen. L'annonce, publiée lundi sur le compte WeChat officiel de la firme, couvre quatre domaines stratégiques : l'intelligence incarnée (embodied intelligence), la simulation, l'implémentation et les solutions. L'objectif affiché est de construire une plateforme robotique de premier plan dans un marché où les constructeurs chinois représentent la majorité des expéditions mondiales de robots industriels et humanoïdes. Ce mouvement de recrutement signale une montée en puissance de Nvidia sur le segment de la robotique physique en Chine, marché dominant à l'échelle mondiale en volume de déploiement. La stratégie de la firme repose sur son écosystème logiciel Isaac (simulation, entraînement) et sur GR00T N2, son modèle fondationnel pour robots humanoïdes présenté en mars 2025. En s'ancrant localement, Nvidia cherche à s'imposer comme couche d'infrastructure incontournable pour les intégrateurs et constructeurs chinois, dont plusieurs développent déjà des humanoïdes sur des puces concurrentes. La présence terrain est aussi un signal de conformité réglementaire dans un contexte de restrictions à l'export sur les puces avancées. Nvidia a accéléré son pivot vers la robotique depuis 2024, en positionnant la "physical AI" comme troisième vague après le calcul général et les LLMs. Les acteurs chinois comme Unitree, UBTECH et Fourier Intelligence figurent parmi les clients potentiels de cet écosystème. Les concurrents directs sur la couche plateforme incluent des startups comme Physical Intelligence (Pi-0) côté modèles, et des industriels comme Siemens ou ABB sur la simulation. Cette expansion en Chine intervient malgré les tensions commerciales persistantes autour des puces H-series, ce qui soulève des questions sur les configurations matérielles qui seront effectivement utilisées localement.

Chine/AsieOpinion
1 source
Un robot humanoïde actif 24h/24 permet à quiconque de lui parler en ligne
1820Interesting Engineering 

Un robot humanoïde actif 24h/24 permet à quiconque de lui parler en ligne

Richtech Robotics, société basée au Nevada, a lancé un dispositif de livestream interactif fonctionnant 24h/24 et 7j/7 autour de son robot humanoïde ADAM, permettant à tout utilisateur connecté dans le monde de lui adresser des questions en temps réel et d'observer ses réponses. Développé sur la plateforme NVIDIA Isaac et équipé du module de calcul embarqué NVIDIA Jetson Thor, ADAM exécute localement les tâches de perception, de raisonnement et de planification sans dépendre d'une infrastructure cloud externe. La même semaine, Richtech confirmait l'acquisition fin mai d'un entrepôt de 79 325 m² à Las Vegas pour environ 21,2 millions de dollars, destiné à héberger des serveurs GPU, à collecter des données issues de ses déploiements commerciaux et à entraîner son modèle propriétaire baptisé World Action Model. Le démarrage des premières opérations de data center est prévu pour l'automne 2026. Ce double mouvement, diffusion publique et infrastructure d'entraînement, illustre une logique de flywheel de données que plusieurs acteurs du secteur humanoïde cherchent à mettre en place : chaque interaction utilisateur alimente directement les futurs cycles d'entraînement du modèle, réduisant la dépendance aux données simulées. Pour les intégrateurs et décideurs industriels, c'est un signal que la frontière entre démo marketing et collecte de données opérationnelles s'efface progressivement. Cela dit, le format "robot influencer" revendiqué par Richtech reste une annonce positionnelle : aucune métrique sur la qualité des échanges, le taux d'engagement ou la robustesse conversationnelle n'a été publiée, et le livestream lui-même est davantage un outil de visibilité qu'une validation de performance industrielle. Richtech Robotics a construit sa réputation sur des robots de service commerciaux, notamment des systèmes capables de préparer cocktails et boissons, de livrer des repas ou de nettoyer des espaces hôteliers, secteurs où ADAM a déjà été déployé en conditions réelles. La société élargit désormais son positionnement avec Dex, un humanoïde industriel mobile également construit sur l'écosystème NVIDIA. Dans une course aux humanoïdes dominée par Figure (Figure 03 en déploiement chez BMW), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Apptronik ou Agility Robotics (Digit chez Amazon), Richtech occupe un segment intermédiaire, entre robot de service éprouvé et plateforme d'IA incarnée en construction. La prochaine étape crédible sera de montrer si l'infrastructure de Las Vegas produit effectivement des améliorations mesurables sur les modèles déployés, et non simplement une présence médiatique accrue.

HumanoïdesOpinion
1 source
Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production
1821Interesting Engineering 

Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production

UBTech, fabricant robotique basé à Shenzhen, a présenté le Cruzr Y1, un humanoïde industriel à roues, lors d'une exposition technologique en Chine, où le robot a effectué en démonstration live du déstackage de caisses et de la palettisation de manière autonome. L'engin embarque des puces domestiques chinoises Digua S100P et S600, la plateforme logicielle propriétaire ROSA, et un modèle VLA (Vision-Language-Action) couplant perception, prise de décision et contrôle moteur. Sa mobilité repose sur des roues omnidirectionnelles à 360 degrés combinées à un mécanisme d'élévation verticale, permettant une circulation dans des allées de fabrication étroites. Les bras doubles utilisent des joints harmoniques avec capteurs de couple, tandis qu'un système multi-capteurs composé de lidar et de caméras de profondeur, disposés sur la tête, les poignets et le châssis, assure une couverture situationnelle à 360 degrés. L'autonomie dépasse quatre heures en charge maximale, avec recharge automatique et swap rapide de batterie pour un fonctionnement continu. En parallèle, UBTech a lancé la série U1 sous sa nouvelle marque grand public UWORLD, affiché à environ 30 000 dollars: plus de 2 100 précommandes en une semaine sur JD.com, livraisons annoncées pour mi-septembre, 88 degrés de liberté, revêtement en silicone réaliste, 183 cm pour la version masculine et 168 cm pour la féminine. L'intégration d'un modèle VLA dans un robot logistique à déploiement industriel est techniquement notable: elle substitue la programmation par trajectoire fixe par une perception adaptative, ce qui réduit théoriquement le temps de reconfiguration pour les intégrateurs. La plateforme Cruzr Y1 n'est ni un AMR classique ni un bras industriel fixe, mais une unité hybride combinant mobilité, manipulation bilatérale et levage vertical en un seul système. Pour un COO logistique, cela représente une alternative potentielle aux architectures AMR plus bras dédiés. Cela dit, UBTech n'a publié aucune métrique de cadence de cycle, taux d'erreur ou volume déployé en conditions réelles: la démonstration reste un proof-of-concept en environnement contrôlé, ce qui rend toute comparaison avec des systèmes en production comme ceux d'Exotec (Skypod) ou de Berkshire Grey prématurée. Fondée en 2012, UBTech compte parmi ses clients industriels Airbus, Texas Instruments, NIO, ZEEKR, Dongfeng Liuzhou Motor et FAW-Volkswagen. Le Cruzr Y1 s'inscrit dans une stratégie de diversification face à la concurrence humanoïde croissante, avec Figure AI et son Figure 03, Tesla et l'Optimus Gen 3, Physical Intelligence avec Pi-0, et NVIDIA avec GR00T N2. Le lancement simultané de la gamme U1 grand public signale une bifurcation stratégique: UBTech vise à la fois le B2B industriel et un marché B2C émergent en Chine, où la demande pour des robots compagnons commence à se structurer. Les prochaines étapes clés seront les retours terrain des pilotes industriels du Cruzr Y1 et les premiers usages réels de la U1 après les livraisons de mi-septembre.

Chine/AsieActu
1 source
Cellules robotiques souples de Morph : l'IA physique intégrée directement dans le matériel
1822Robotics Business Review 

Cellules robotiques souples de Morph : l'IA physique intégrée directement dans le matériel

La startup londonienne morph développe des cellules robotiques souples dans lesquelles l'intelligence artificielle est intégrée directement dans le matériau, et non ajoutée par couche logicielle distincte. Fondée par le Dr Jean Nehme, ancien chirurgien reconstructeur et créateur de Digital Surgery, une société d'IA chirurgicale qu'il a ensuite cédée, morph conçoit des cellules déformables capables de modifier en temps réel leur morphologie, leur rigidité et leur comportement mécanique en réponse à des données sensorielles. Ces cellules embarquent des modèles d'IA physique (physical AI) qui reçoivent des informations de capteurs, les interprètent, puis génèrent des changements de forme, de mouvement ou de résistance pour s'adapter à leur environnement ou à leur tâche. L'entreprise s'appuie sur l'apprentissage par renforcement couplé à une simulation physique haute-fidélité pour accélérer le passage du prototype au produit, et prévoit de déployer ces cellules dans de multiples facteurs de forme robotiques. Le positionnement de morph conteste un axiome bien ancré dans l'industrie : celui qui traite le hardware comme une plateforme passive sur laquelle vient s'asseoir le logiciel intelligent. Nehme soutient qu'un robot dont le substrat physique est fixe atteindra toujours ses limites dans des environnements non structurés, notamment hors des entrepôts industriels où évoluent la plupart des humanoïdes actuels (Figure, Tesla Optimus, Boston Dynamics). Les matériaux souples permettent des interactions plus sûres avec les humains, réduisent les risques de blessure au contact, et offrent des coûts de fabrication potentiellement inférieurs à ceux des systèmes rigides articulés. La boucle d'apprentissage continu intégrée dans les modèles déployés est également notable : une fois les cellules en production, elles continueraient à affiner leur comportement à partir de données réelles, réduisant ainsi le gap simulation-réalité (sim-to-real gap) qui plombe encore de nombreux systèmes robotiques. Reste à nuancer : l'article ne fournit ni métriques de performance (payload, temps de cycle, répétabilité), ni dates de déploiement commercial, ni clients identifiés, ce qui maintient morph au stade de l'annonce technologique plutôt que du produit shipé. La robotique souple est un champ de recherche actif depuis une décennie, porté notamment par des laboratoires comme le Soft Robotics Toolkit de Harvard ou l'EPFL, mais sa commercialisation reste marginale comparée aux systèmes rigides. morph entre sur ce marché avec un angle "physical AI embarqué", là où des acteurs comme Soft Robotics Inc. (racheté par ABB en 2023) misaient plutôt sur les effecteurs pneumatiques pour la préhension industrielle. L'inspiration revendiquée par Nehme est biologique : le poulpe, capable de reconfigurer sa forme sans squelette rigide. En Europe, des startups comme Enchanted Tools (France) ou Wandercraft explorent également des voies alternatives à la robotique rigide, mais sur des architectures différentes. Les prochaines étapes de morph ne sont pas précisées dans cette publication, et l'entreprise n'a pas encore communiqué sur ses levées de fonds ni sur des pilotes industriels en cours.

IA physiquePaper
1 source
Hirebotics lance un cobot résistant aux explosions sans programmation pour la peinture industrielle
1823Robotics & Automation News 

Hirebotics lance un cobot résistant aux explosions sans programmation pour la peinture industrielle

Hirebotics, spécialiste américain des solutions de robots collaboratifs pour la fabrication métallique, a annoncé la disponibilité immédiate du Cobot Painter, présenté comme la première solution cobot antidéflagrante (explosion-proof) reposant sur une plateforme sans code. Le produit combine le logiciel Beacon, développé en interne par Hirebotics, avec le bras Fanuc CRX-10iA/L Paint, une variante du CRX-10iA certifiée pour les environnements pulvérulents et inflammables. La cible déclarée est la production haute variété, faibles volumes (high-mix, low-volume) dans les ateliers de peinture industrielle sur métal, un segment traditionnellement laissé entre la peinture manuelle et les lignes automatisées complexes. Aucun chiffre de payload ou de temps de cycle n'a été communiqué dans l'annonce. L'intérêt pour les intégrateurs et les décideurs industriels réside dans la combinaison de deux contraintes rarement résolues simultanément : la certification antidéflagrante, obligatoire dans les cabines de peinture selon les normes ATEX/NEC, et l'absence de programmation traditionnelle. Le no-code Beacon réduit le temps de mise en service et permet aux opérateurs sans expertise robotique de reprogrammer les trajectoires entre deux séries, ce qui est le noeud dur du high-mix. Si la promesse tient à l'usage réel, cela élargit l'accès aux cobots de peinture aux PME industrielles qui ne peuvent pas se permettre un intégrateur dédié. Hirebotics, basé au Tennessee, a construit son modèle commercial autour du robot-as-a-service (RaaS) pour la soudure cobot avant de s'étendre à la peinture. Sur ce segment, les alternatives incluent les solutions de Doosan Robotics, Universal Robots via des intégrateurs tiers, et des systèmes dédiés d'ABB et Graco, tous nécessitant généralement une expertise de programmation ou une intégration sur mesure. Hirebotics se positionne donc sur le prix d'entrée et la simplicité de déploiement plutôt que sur les performances brutes. L'annonce n'indique pas de pilotes clients nommés ni de volumes de déploiement prévus.

IndustrielActu
1 source
RIPA : attaques par injection de prompt via vecteur sensoriel sur robots ROS 2 pilotés par LLM
1824arXiv cs.RO 

RIPA : attaques par injection de prompt via vecteur sensoriel sur robots ROS 2 pilotés par LLM

Des chercheurs ont publié en juin 2026 RIPA, première étude empirique systématique des attaques par injection de prompt délivrées via le pipeline sensoriel de robots pilotés par LLM sous ROS 2. Le protocole couvre 100 exécutions indépendantes par variante sur cinq modèles appartenant à quatre familles : DeepSeek-V4-Flash, Llama-3-8B-Instruct-Lite, Llama-3.3-70B-Instruct-Turbo, Qwen 2.5-7B-Instruct-Turbo et Gemma-3n-E4B, couvrant une plage de 4 à 284 milliards de paramètres. Trois canaux d'injection sensorielle ont été testés : vision par OCR, audio via Whisper STT, et empoisonnement de contexte LiDAR injecté directement au niveau du system prompt du LLM. Ce troisième canal, qui fabrique des données d'obstacles fictifs dans la représentation d'état de l'environnement, atteint un taux de succès d'attaque (ASR) de 100 % sur DeepSeek-V4-Flash. Le résultat le plus contre-intuitif concerne la hiérarchie des modèles : Llama-3.3-70B affiche 100 % d'ASR toutes variantes confondues, tandis que Llama-3-8B et Qwen 2.5-7B résistent aux injections directes (0 % d'ASR), et que Gemma-3n-E4B à seulement 4 milliards de paramètres présente le même profil de vulnérabilité que le modèle 70B. Pour les intégrateurs et décideurs qui déploient des robots autonomes sous LLM, ce travail invalide un présupposé structurant : la taille du modèle n'est pas un indicateur fiable de robustesse face aux attaques adversariales. Un 70B peut être plus exposé qu'un 7B. Plus préoccupant pour les systèmes industriels à navigation LiDAR ou les robots mobiles autonomes (AMR), le canal 3 démontre qu'un attaquant peut détourner le comportement du robot en corrompant uniquement les données capteurs, sans jamais toucher aux entrées textuelles directes. La surface d'attaque réelle dépasse donc largement ce qu'anticipent les architectures de sécurité actuellement déployées en production. Les auteurs proposent un pare-feu sémantique hybride ramenant l'ASR à 0 % contre les patterns d'injection connus, sans faux positif sur un ensemble bénin préliminaire de 20 commandes, mais qui cède à un taux de contournement de 10,2 % face aux attaques obfusquées (58 essais sur 570, sur 19 payloads répartis en 5 catégories), révélant un écart critique entre défenses basées sur des règles et couche sémantique. ROS 2 est le middleware de référence des robots industriels et de service, et la montée en puissance des architectures VLA (Vision-Language-Action) pour piloter manipulateurs et AMR rend ces vecteurs directement opérationnels à court terme. Le code, les données et les résultats sont disponibles publiquement, abaissant mécaniquement le seuil d'exploitation. Les prochaines étapes logiques portent sur des contre-mesures au niveau middleware ROS 2 et des évaluations sur des VLA déployés en conditions réelles.

Societe/EthiqueActu
1 source
Audit des robots sociaux pilotés par des LLM selon des gradients moraux culturels
1825arXiv cs.RO 

Audit des robots sociaux pilotés par des LLM selon des gradients moraux culturels

Des chercheurs ont publié sur arXiv (réf. 2606.28345) un cadre d'audit en gradient pour évaluer le comportement moral des LLMs embarqués dans des robots sociaux selon les cultures. L'étude porte sur quatre modèles de langage testés dans quatre paires pays-langue, sous quatre régimes de prompting différents, soit 57 600 décisions analysées. Les scénarios, dérivés de neuf revues de littérature en robotique sociale couvrant plus de 8 000 articles, transposent la logique du Moral Machine Experiment, originellement centré sur "qui épargner", vers des dilemmes d'assistance prioritaire : qui aider en premier, entre un groupe nombreux et un petit, entre une personne âgée et une jeune, entre statut élevé et statut bas. Ces scénarios couvrent les domaines des soins, de l'éducation et des services, avec des identités contrôlées pour isoler l'effet culturel. Les résultats révèlent des biais systématiques et asymétriques : la calibration des modèles est presque deux fois plus précise pour les décisions en langues occidentales que pour le chinois ou le japonais. Les LLMs tendent vers un déterminisme élevé sur les dilemmes "majorité d'abord", effaçant de fait les nuances culturelles transversales. La sensibilité partielle aux normes d'âge et de statut risque concrètement d'exclure des minorités de l'accès à l'assistance robotique. Ce n'est pas un problème de prompting : seuls les prompts avec exemples contrastifs améliorent consistamment le suivi des gradients culturels, tandis que les prompts "raisonnement seul" peuvent aggraver les écarts. Les auteurs concluent que les facteurs architecturaux du modèle constituent un levier plus robuste que l'ingénierie de prompt pour corriger ces dérives. L'enjeu est de taille alors que les robots sociaux pilotés par LLM entrent en déploiement dans des contextes de soins aux personnes âgées, d'accueil hospitalier ou d'éducation, en Asie comme en Europe. Cette recherche s'inscrit dans la continuité du Moral Machine Experiment du MIT, dont elle étend la méthodologie aux contextes incarnés et multilingues, territoire largement inexploré par les audits existants, quasi exclusivement anglophones. Les auteurs plaident pour que ces audits plurilingues et pluralistes deviennent une étape obligatoire avant tout déploiement de robot LLM-gouverné, au même titre que les tests de sécurité physique.

RechercheActu
1 source
Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose
1826arXiv cs.RO 

Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose

Une équipe de chercheurs publie sur arXiv (référence 2506.05808v2) une étude expérimentale portant sur le comportement oculaire des opérateurs humains lors de sessions de téleopération robotique, dans le cadre spécifique de tâches de saisie et de dépose (pick-and-place). Le protocole expérimental compare plusieurs dispositifs de démonstration, des interfaces qui émulent l'incarnation et les conditions visuelles d'un robot, et mesure précisément où le regard humain se fixe pendant l'exécution. Les résultats montrent que certaines propriétés des dispositifs provoquent un déplacement systématique de l'attention visuelle : l'opérateur cesse de regarder les indices liés à l'objectif de la tâche (les objets à manipuler) pour se concentrer sur les indices de supervision du contrôle (l'effecteur terminal, c'est-à-dire la pince ou le bras du robot). Ce n'est pas un effet marginal, il est suffisamment prononcé pour mesurer son impact en aval sur les modèles d'apprentissage. L'enjeu pour les équipes qui construisent des pipelines d'imitation learning est direct. L'apprentissage par imitation, qui fonde une part croissante des architectures VLA (Vision-Language-Action) comme Pi-0, GR00T N2 ou OpenVLA, repose sur des volumes massifs de données de démonstration humaine, dont le coût de collecte est élevé. Une hypothèse structurante du domaine est que le regard humain encode des informations cognitives de haut niveau, priorité aux objets, anticipation de la trajectoire, que les modèles peuvent exploiter pour généraliser. Or cette étude montre que, selon le dispositif utilisé, ce signal se dégrade au point de faire chuter les performances des modèles gaze-based en dessous des baselines sans information oculaire. En d'autres termes, le choix du matériel de collecte de données n'est pas neutre : il peut silencieusement empoisonner le signal superviseur. Ce travail s'inscrit dans un débat actif autour de la qualité versus la quantité des données de démonstration, dans un secteur où Physical Intelligence, Hugging Face (LeRobot) et des laboratoires comme Stanford (ALOHA) ou Berkeley (DROID) investissent massivement dans des infrastructures de collecte standardisées. La question de quel dispositif utiliser, manette, bras maître, interface VR, exosquelette, n'avait jusqu'ici été abordée que sous l'angle ergonomique ou de la fidélité de contrôle. Cette étude introduit une nouvelle dimension : l'effet du dispositif sur la qualité du signal cognitif implicite, avec des implications directes pour la conception des futures campagnes de collecte de données à grande échelle.

RechercheOpinion
1 source
Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques
1827arXiv cs.RO 

Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques

Une équipe du CIIRC (Czech Institute of Informatics, Robotics and Cybernetics, Prague) publie sur arXiv un framework appelé See & Switch, qui étend la programmation par démonstration (PbD) aux tâches robotiques conditionnelles basées sur la vision. Le système représente une tâche comme un graphe de segments de compétence reliés par des états de décision : lors de l'exécution, un module appelé Switcher analyse les images d'une caméra embarquée dans la main (eye-in-hand) pour sélectionner la branche à suivre ou signaler une situation inconnue nécessitant une nouvelle démonstration. En cas d'erreur ou de cas imprévu, l'opérateur peut intervenir via enseignement kinesthésique, joystick ou gestes manuels. Le système a été évalué sur trois tâches de manipulation dextère impliquant 8 utilisateurs novices, pour un total d'environ 900 séquences d'exécution sur robot réel. Les résultats mesurés sur des fenêtres temporelles définies par l'utilisateur atteignent 90,6 % de précision dans la sélection de branche, et une détection d'anomalies supérieure à 90 % dans 47 des 79 états de décision testés. Ces résultats sont pertinents pour les intégrateurs industriels qui cherchent à déployer la PbD dans des environnements variables sans passer par la programmation explicite de chaque variante. Le principal verrou du secteur est que les systèmes PbD classiques supposent un environnement fixe : un changement de disposition, d'orientation de pièce ou de contexte casse le programme. See & Switch traite ce problème au niveau du graphe de tâche plutôt qu'au niveau du modèle de perception, ce qui le rend modulaire et extensible sans réentraîner un réseau complet. La nuance importante : les performances de branchement sont évaluées en mode offline sur des fenêtres déjà identifiées, ce qui isole le classificateur visuel des erreurs de timing réelles, les chiffres de 90 % ne reflètent donc pas directement la robustesse end-to-end en déploiement non supervisé. La PbD a connu un regain d'intérêt fort depuis 2022 avec les approches VLA (Vision-Language-Action) portées par des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou ACT (Action Chunking with Transformers). See & Switch se positionne différemment : il n'utilise pas de grand modèle pré-entraîné mais une architecture légère et interprétable, orientée vers l'enseignement interactif sur site par du personnel non expert. Les travaux proviennent du groupe ImitRob au CIIRC, qui publie régulièrement sur la PbD depuis plusieurs années. Le code et les données sont disponibles publiquement. La prochaine étape logique serait de coupler ce graphe de décision avec un backbone de perception plus robuste, ou de tester la scalabilité sur des cellules industrielles multi-postes.

FR/EU ecosystemePaper
1 source
Chronos : cadre à historique complet guidé par la physique pour la manipulation non markovienne à long horizon
1828arXiv cs.RO 

Chronos : cadre à historique complet guidé par la physique pour la manipulation non markovienne à long horizon

Une équipe de recherche a publié fin juin 2026 sur arXiv (2606.30318) un framework appelé Chronos pour résoudre un problème fondamental des politiques de manipulation robotique : leur incapacité à mémoriser l'historique d'exécution d'une tâche. Chronos traite chaque observation passée, capteur proprioceptif et image, comme un token temporel aligné sur le pas de contrôle physique, et propage cet historique complet via un modèle d'espace d'états sélectif (SSM). Ce contexte causal conditionne un prior d'action multimodal appris par IMLE (implicit maximum likelihood estimation), raffiné par un pont de Schrödinger du second ordre qui prédit des champs d'accélération pour des trajectoires plus lisses. Sur RMBench, benchmark qui exige la mémorisation de la phase courante de la tâche, Chronos atteint 73,6 % de succès moyen contre 11,2 % pour pi0.5 de Physical Intelligence, soit +62,4 points et un facteur 6,6x, avec dix fois moins de paramètres. Il dépasse également le VLA à mémoire explicite Mem-0 de 22,8 points en utilisant 30x moins de paramètres. En conditions réelles, sur quatre tâches bras-droit/bras-gauche avec une unique caméra RGB, Chronos obtient 78 % de succès global et 72 % sur les sous-tâches mémoire-dépendantes, là où pi0.5 plafonne à 7 % global et 0 % sur ce sous-ensemble. Ces résultats remettent en cause une hypothèse courante dans les politiques d'imitation généralisées : que l'observation courante, complétée d'une courte fenêtre temporelle, suffit à conditionner l'action correcte. Pour des tâches à horizon long avec dépendance d'état, comme l'assemblage séquentiel ou le pick-and-place conditionnel, cette approximation markovienne génère des ambiguïtés résolues à tort. Chronos montre qu'élever l'historique complet au rang d'état latent de la politique améliore substantiellement la robustesse sim-to-real. La compacité du modèle est également un avantage concret pour les équipes qui déploient des politiques embarquées sur calculateurs edge. Ce travail s'inscrit dans une vague remettant en question l'architecture VLA post-RT-2, face à des modèles comme pi0.5 de Physical Intelligence et GR00T N2 de NVIDIA, qui dominent les benchmarks de manipulation générale avec des fenêtres d'attention bornées sans mémoire d'état explicite. L'approche SSM de Chronos se rapproche des architectures récurrentes linéaires de type Mamba appliquées au contrôle robotique. Les auteurs évaluent sur 16 tâches simulées et 4 tâches réelles, mais ne précisent ni plateforme matérielle cible ni calendrier de déploiement industriel, ce qui classe ce travail dans la catégorie recherche publiée et non produit disponible.

IA physiqueOpinion
1 source
Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle
1829arXiv cs.RO 

Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle

Des chercheurs ont publié sur arXiv (preprint 2606.30456) une évaluation du transfert de modèles VLA (Vision-Language-Action) vers un bras manipulateur UR5e d'Universal Robots en conditions réelles. Deux modèles ont été mis à l'épreuve : OpenVLA et sa variante OpenVLA-OFT, fine-tunés sur des données collectées directement sur le robot physique et converties au format RLDS (Robot Learning Dataset Specification), un standard de facto dans la communauté robotique. L'équipe a construit une chaîne complète comprenant l'acquisition de données sur robot réel, un workflow de conversion de dataset compatible RLDS, une infrastructure de fine-tuning et d'inférence, ainsi qu'un protocole de validation systématique des représentations d'actions et des interfaces de contrôle. Le résultat central contredit une hypothèse répandue dans la recherche VLA : des métriques offline prometteuses ne se traduisent pas nécessairement en comportement stable en boucle fermée sur le système physique. Cet écart entre indicateurs de validation et exécution réelle n'est pas principalement imputable à la capacité intrinsèque des modèles. Il est fortement conditionné par la sémantique des actions (comment sont encodées les commandes moteur), les conventions de référentiels de coordonnées, l'alignement temporel entre la vision et les sorties de contrôle, la cohérence du prétraitement d'image, et la couverture du dataset d'entraînement. La conclusion opérationnelle est directe : pour des intégrateurs industriels, augmenter la taille du modèle VLA n'est pas le levier prioritaire ; c'est la maîtrise du pipeline données-modèle-contrôle dans son ensemble qui détermine la fiabilité du déploiement, un déplacement de paradigme du problème de modèle vers un problème de système. Ce travail s'inscrit dans un contexte d'accélération marquée autour des VLA, portée par des modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) ou encore ACT et Diffusion Policy, qui promettent une généralisation des politiques de manipulation via des architectures multimodales entraînées à large échelle. La plupart des démonstrations publiées restent toutefois en environnement contrôlé, et les conditions précises du passage au déploiement réel sont rarement documentées avec rigueur. En s'appuyant sur une plateforme reproductible et des formats ouverts (UR5e, RLDS), cette étude fournit un cadre méthodologique directement transférable, utile pour les équipes cherchant à qualifier leurs pipelines VLA avant mise en production, y compris côté européen où des acteurs comme Enchanted Tools travaillent sur des approches similaires de généralisation de politiques de manipulation.

IA physiqueOpinion
1 source
Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels
1830arXiv cs.RO 

Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels

Des chercheurs ont publié sur arXiv (2508.12435) une étude démontrant qu'un robot industriel peut reconnaître des gestes tactiles humains en exploitant uniquement ses capteurs articulaires intégrés, sans aucun capteur externe. Implémentée sur un bras Franka Emika Research (7 DOF), l'approche s'appuie sur des architectures CNN évaluées sur un dataset collecté spécifiquement pour l'expérience. Deux méthodes ont atteint plus de 95 % de précision en détection de contact et classification de gestes : STFT2DCNN, qui applique une transformée de Fourier à court terme pour générer des spectrogrammes 2D, et STT3DCNN, qui exploite des représentations temps-fréquence tridimensionnelles. La variable déterminante n'est pas le choix d'architecture CNN mais la représentation des données : passer des séries temporelles brutes aux spectrogrammes fait bondir les performances de façon significative. L'implication industrielle est directe. Équiper un robot d'une peau tactile ou de caméras supplémentaires pour détecter l'intention humaine coûte cher, complexifie l'intégration et fragilise la maintenance. Prouver que les couples et positions articulaires déjà remontés par le contrôleur suffisent à atteindre 95 % de précision ouvre une voie de déploiement à coût quasi nul pour la collaboration homme-robot dans les cellules existantes. Les modèles spectraux montrent également une meilleure généralisation à de nouvelles configurations articulaires, ce qui est un signal positif pour des applications où le robot change fréquemment de posture de travail. Cela dit, les performances sont mesurées en laboratoire sur un seul modèle de robot et un dataset maison dont la taille et la diversité ne sont pas précisées dans l'abstract, ce qui invite à la prudence avant de conclure à une généralisation industrielle immédiate. La reconnaissance tactile sans peau robotique est un chantier actif depuis plusieurs années, notamment dans les labos qui travaillent sur la conformance mécanique (robots cobots comme le Franka, UR, ou le Kinova). Des approches concurrentes s'appuient sur des capteurs de force-couple au poignet (ATI, Robotiq FT300), des peaux à électrodes capacitives, ou la vision RGB-D pour inférer l'intention de contact, chacune avec un surcoût matériel substantiel. Ce travail positionne les signaux proprioceptifs comme une alternative viable et souligne que le verrou n'est pas hardware mais algorithmique. Les prochaines étapes probables : validation sur d'autres plateformes (UR10, KUKA iiwa), extension à des gestes plus complexes, et tests en conditions industrielles réelles avec bruit vibratoire ambiant.

RecherchePaper
1 source
Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées
1831arXiv cs.RO 

Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées

Des chercheurs ont déposé fin juin 2026 sur arXiv (réf. 2606.28529) une étude qui remet en question une hypothèse centrale de l'optimisation des modèles robotiques de fondation : supposer qu'une latence d'inférence réduite par pas d'action améliore mécaniquement les performances à l'échelle de la tâche. Le papier introduit TISED (Task-level Inference Speedup Effect Decomposition), un cadre analytique unifiant les techniques "avec perte" couramment appliquées aux modèles embarqués, notamment la quantization, l'élagage (pruning) et l'inférence asynchrone. L'étude documente trois paradoxes sur deux familles de tâches : sur les tâches statiques, l'optimisation peut allonger le temps d'exécution total même quand la latence par action diminue ; sur les tâches dynamiques, une compression modérée peut faire monter le taux de succès au-dessus de la ligne de base non-optimisée ; et l'emplacement du point d'équilibre optimal dépend de la configuration matérielle du robot. Ce résultat interroge directement les équipes déployant des VLA (Vision-Language-Action) en production, qu'il s'agisse de bras manipulateurs en usine ou de robots humanoïdes en entrepôt. L'industrie a massivement adopté la quantization et le pruning en supposant un arbitrage simple : un peu de qualité d'action contre une réduction de latence et de coût de calcul. TISED montre que ce compromis est trompeur. Sur les tâches statiques à longues séquences, la dégradation par pas s'accumule et peut effacer le gain de vitesse global. Sur les tâches dynamiques, la boucle fermée propre à l'exécution robotique crée des dynamiques que les benchmarks statiques ne capturent pas, ce qui explique pourquoi un modèle légèrement compressé peut paradoxalement mieux performer en répondant plus fréquemment à l'environnement. Ce travail s'inscrit dans la course à l'inférence rapide portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous contraints à tourner sur du matériel embarqué limité. L'enjeu est particulièrement critique pour les acteurs qui visent un déploiement à grande échelle, comme Figure AI dans ses usines BMW, ou les plateformes AMR européennes comme Exotec. TISED reste à ce stade un preprint non évalué par les pairs, sans validation publiée sur du matériel physique ; les prochaines étapes naturelles seraient une confrontation avec des benchmarks standard comme RoboMimic ou Calvin, et des tests sur des plateformes réelles comme Unitree ou Franka.

RechercheOpinion
1 source
AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires
1832arXiv cs.RO 

AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires

Des chercheurs ont publié le 30 juin 2026 AnyBody (arXiv:2606.29209), un contrôleur unitaire pour humanoïdes capables de piloter l'ensemble du corps à partir d'un sous-ensemble arbitraire de keypoints (points de repère anatomiques) défini au moment du déploiement. La méthode articule trois briques : un tracker "enseignant" entraîné sur un large corpus de mouvements humains non structurés, distillé vers un student encodeur-décodeur déterministe dont l'espace latent est une sphère unitaire, puis un encodeur transformer par keypoints exploitant le masked self-attention pour accepter n'importe quelle combinaison de marqueurs corporels. Un correcteur résiduel léger dans l'espace latent permet ensuite d'adapter le décodeur figé à des tâches aval spécifiques. Les expériences couvrent le suivi de mouvements humains à grande échelle depuis des keypoints partiels, la télé-opération flexible, la locomotion, l'écriture dans les airs et l'atteinte d'obstacles. Ce travail s'attaque à deux verrous majeurs du contrôle physique des humanoïdes. Les pipelines classiques de retargeting depuis la capture plein corps (full-body mocap) sont coûteux et sujets aux erreurs, ce qui freine la collecte de données à l'échelle nécessaire à l'apprentissage par renforcement. Les architectures hiérarchiques qui dissocient contrôle du haut et du bas du corps sacrifient quant à elles la coordination globale indispensable à la loco-manipulation, c'est-à-dire la capacité à marcher et manipuler simultanément. AnyBody résout les deux en apprenant une représentation latente unique interrogeable par n'importe quel sous-ensemble de keypoints, sans retraining. Pour les intégrateurs, cela ouvre la voie à une télé-opération allégée (quelques marqueurs suffisent) et à des interfaces variées : vision monoculaire, IMU ou exosquelette partiel. Le contrôle physique des humanoïdes se partage aujourd'hui entre approches simulation-retargeting (PHC, OmniH2O, HOVER) et modèles vision-langage-action (VLA). AnyBody s'inscrit dans la première famille mais supprime la contrainte du mocap complet, convergeant vers des travaux comme HumanVid qui exploitent des supervisions partielles. Cette publication académique n'implique pas directement d'acteur commercial, mais ses enjeux concernent Figure AI (Figure 03), Agility Robotics (Digit), Boston Dynamics (Atlas), Apptronik (Apollo), et côté français Wandercraft, dont le contrôle de marche assistée repose précisément sur ce type de coordination corps entier. La validation sur hardware réel à grande échelle reste la prochaine étape critique avant tout transfert industriel.

IA physiquePaper
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
1833arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique
1834arXiv cs.RO 

Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique

Une équipe de chercheurs présente RoboTracer, un modèle de vision-langage (VLM) 3D permettant aux robots de tracer des trajectoires dans l'espace physique en raisonnant sur des mesures métriques concrètes. Publié en version 3 sur arXiv (2512.13660, décembre 2025), le système combine référencement spatial 3D et mesure de distance via un encodeur universel et un décodeur à supervision par régression, affiné d'abord en apprentissage supervisé (SFT) puis par renforcement (RFT) avec des récompenses intermédiaires sensibles aux métriques. Le dataset d'entraînement TraceSpatial regroupe 30 millions de paires question-réponse sur scènes intérieures, extérieures et de manipulation, avec des chaînes de raisonnement atteignant 9 étapes. Sur le benchmark TraceSpatial-Bench introduit par les auteurs, RoboTracer atteint 79,1 % de taux de succès moyen et dépasse Gemini-2.5-Pro de 36 points de précision. Le système a été validé sur bras UR5 (Universal Robots) et humanoïde G1 (Unitree) dans des scènes réelles encombrées. La contribution principale tient dans le raisonnement métrique, une capacité absente des VLM classiques : décrire une scène en langage naturel ne suffit pas pour estimer qu'un obstacle se trouve à 0,47 m à gauche, information nécessaire à toute trajectoire exécutable. L'approche RFT avec récompenses de processus supervise les étapes perceptuelles intermédiaires et non uniquement le résultat final, ce qui réduit concrètement l'écart entre compréhension sémantique et exécution physique (le demo-to-reality gap). Pour un intégrateur ou un COO industriel, cela signifie un robot capable d'opérer dans des espaces non cartographiés à l'avance. L'avance de 36 % sur Gemini-2.5-Pro est notable, même si ce modèle n'est pas conçu pour la robotique embarquée. RoboTracer s'inscrit dans la compétition autour des modèles VLA (Vision-Language-Action), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA, qui cherchent tous à unifier perception, raisonnement et action dans un modèle unique. Sa spécificité est l'accent sur la conscience métrique plutôt que sur le contrôle moteur fin, niche où Pi-0 reste dominant. Le choix des plateformes UR5 (bras industriel 6 axes, référence en intégration industrielle) et G1 (humanoïde Unitree, 43 degrés de liberté, environ 35 000 $) renforce la crédibilité de la généralisation multi-robots. À ce stade, il s'agit d'un résultat de recherche sans déploiement commercial annoncé ; la publication du dataset TraceSpatial et du benchmark ouvert constitue en revanche une infrastructure réutilisable directement par la communauté robotique.

IA physiqueOpinion
1 source
Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste
1835arXiv cs.RO 

Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste

Des chercheurs ont publié sur arXiv (référence 2606.29384) Event-VLA, un framework combinant des caméras événementielles avec des modèles Vision-Language-Action (VLA) pour rendre la manipulation robotique robuste dans des conditions d'éclairage dégradées. L'approche repose sur l'intégration de flux d'événements, une modalité de capteur neuromorphique qui encode les variations de luminosité pixel par pixel avec une résolution temporelle de l'ordre de la microseconde, contrairement aux caméras RGB classiques qui acquièrent des images complètes à fréquence fixe. L'architecture introduit un mécanisme de routage par requêtes d'action : des requêtes apprenantes extraient la sémantique pertinente à la tâche depuis le raisonnement VLA, puis agrègent sélectivement les tokens événementiels via une cross-attention à portes (gated cross-attention), produisant des représentations d'action sensibles aux conditions lumineuses. Les expériences couvrent des scénarios de simulation et de déploiement réel en faible luminosité, voire en quasi-obscurité. Ce travail s'attaque à une faille structurelle des VLA actuels, Pi-0, OpenVLA, GR00T N2 ou Helix inclus, qui sont entraînés et évalués quasi-exclusivement dans des environnements d'intérieur bien éclairés et stables. Le sim-to-real gap se double ici d'un lighting-to-real gap rarement quantifié dans les benchmarks publiés. Event-VLA démontre qu'on peut greffer une modalité événementielle sans détruire les priors sémantiques RGB-langage préentraînés, ce qui est non trivial : la plupart des fusions multimodales naïves dégradent la performance en conditions normales pour gagner en robustesse marginale. Le fait que le gain soit mesuré sans régression sur éclairage standard constitue le résultat le plus solide à retenir pour les intégrateurs industriels envisageant des déploiements en entrepôt, en extérieur ou en environnement à éclairage variable. Les caméras événementielles (Prophesee, inivation, Sony IMX636) restent onéreuses et peu présentes dans les pipelines robotiques commerciaux, ce qui limite la portée immédiate du framework. Le travail s'inscrit dans un mouvement plus large d'hybridation sensorielle pour les VLA, en parallèle d'approches tactiles (GelSight) ou proprioceptives. Côté concurrent, Boston Dynamics, Figure et Agility travaillent sur la robustesse des politiques en conditions réelles mais publient peu sur la gestion de l'éclairage. Aucun acteur européen n'est mentionné dans ce papier. Les auteurs ne précisent pas de pipeline de déploiement à l'échelle ni de timeline industrielle : il s'agit d'un résultat de recherche, pas d'un produit shipé.

IA physiqueActu
1 source
SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon
1836arXiv cs.RO 

SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon

Une équipe de chercheurs a publié SWITCH (arXiv:2511.17649), un benchmark conçu pour évaluer la capacité des agents IA à interagir avec ce que les auteurs appellent des interfaces de contrôle tangibles (TCIs) : panneaux d'appareils électroménagers, télécommandes, ascenseurs, interfaces graphiques embarquées. Le jeu de données comprend 1 170 vidéos temporellement interactives, annotées de manière structurée avec instructions, actions, transitions d'état, résultats et comportements de récupération en cas d'erreur. La spécificité de SWITCH est d'évaluer le raisonnement en boucle fermée : l'agent doit percevoir, agir, vérifier le résultat, et corriger si nécessaire, dans une séquence continue. Le benchmark inclut également une évaluation des modèles de génération vidéo sur des tâches centrées sur l'interaction, combinant jugement automatique par LLM et évaluation humaine. L'intérêt de SWITCH réside dans ce qu'il révèle : les modèles multimodaux de frontier, propriétaires comme open source, présentent des faiblesses persistantes en perception visuo-temporelle fine, en vérification des résultats et en récupération d'erreur. La plupart des benchmarks existants se limitent à la perception en boucle ouverte ou à l'exécution d'une seule action, ce qui masque précisément les défaillances qui apparaissent dans des scénarios d'horizon long, là où l'agent doit maintenir un état interne et détecter un échec non anticipé. Pour les équipes travaillant sur des robots de service ou des agents embarqués destinés à des environnements industriels ou domestiques, ce constat est directement opérationnel : les modèles actuels ne sont pas encore fiables dès qu'une interaction nécessite un retour d'état et une correction. SWITCH s'inscrit dans un effort plus large de la communauté embodied AI pour combler le fossé entre les capacités de perception statique et l'agentivité réelle en environnement physique. Les benchmarks précédents comme SQA3D, EmbodiedScan ou OpenEQA avaient posé des jalons en compréhension 3D et en questions-réponses situées, mais sans capturer la dimension corrective de l'interaction. SWITCH adresse explicitement ce manque via des scénarios égocentrés. L'étude ne mentionne pas de partenariat industriel ni de déploiement applicatif immédiat : il s'agit d'un outil académique, non d'un produit. Les suites probables concernent l'intégration du benchmark dans les pipelines d'entraînement de VLA (Vision-Language-Action models) et l'extension à des environnements 3D interactifs.

RecherchePaper
1 source
Entraîner des modèles vision-langage-action (VLA) avec une supervision dense par chaîne de pensée incarnée
1837arXiv cs.RO 

Entraîner des modèles vision-langage-action (VLA) avec une supervision dense par chaîne de pensée incarnée

Une équipe du laboratoire RUCKBReasoning (Université Renmin de Chine) a publié le 30 juin 2026 ZR-0, un modèle VLA (vision-language-action) de 2,6 milliards de paramètres entraîné avec une supervision dense par chaîne de raisonnement incarnée, ou ECoT (Embodied Chain-of-Thought). Le modèle repose sur une architecture dual-stream : un VLM pré-entraîné (baptisé System 2) génère des annotations de raisonnement structuré pendant l'entraînement, tandis qu'un expert d'action basé sur un Diffusion Transformer (System 1) produit des séquences d'actions continues par flow matching. Les deux composants sont couplés via cross-attention, avec un masque d'attention qui permet de court-circuiter entièrement la génération ECoT à l'inférence sans perte de performance mesurée. Le modèle a été pré-entraîné sur ProcCorpus-60M, un corpus de 60 millions de frames (environ 1 000 heures) issus de plus de 400 000 trajectoires, avec des annotations ECoT couvrant 96,8 % des frames. Les évaluations couvrent trois benchmarks de simulation, LIBERO (bras unique), RoboTwin 2.0 (bras bimanuels) et RoboCasa GR-1 Tabletop (humanoïde), ainsi que des expériences réelles sur plateforme xArm. L'enjeu central est le transfert cross-embodiment : les espaces d'états et d'actions diffèrent fondamentalement d'un robot à l'autre, ce qui rend la généralisation difficile pour les modèles end-to-end. L'hypothèse de ZR-0 est que les processus cognitifs de haut niveau, perception de scène, identification d'objets, planification, décomposition de sous-tâches, sont partagés entre embodiments, même si les commandes moteur ne le sont pas. En ancrant l'alignement des représentations dans ce niveau d'abstraction, les auteurs contournent la nécessité d'adapter le modèle à chaque cinématique robot. Pour les intégrateurs industriels, le gain potentiel est concret : un seul modèle entraînable sur données hétérogènes, déployable sur plusieurs plateformes sans fine-tuning spécifique à chaque bras. Cette approche s'inscrit dans une vague de modèles VLA généralistes qui cherchent à résoudre le sim-to-real gap par des architectures raisonnantes. Les concurrents directs incluent Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et OpenVLA, qui explorent des stratégies similaires de pré-entraînement multi-robot. ZR-0 se distingue par son dispositif ECoT dédié à l'entraînement et neutralisable à l'inférence, ce qui préserve la vitesse d'exécution. Le code et les checkpoints sont publiés en open source sur GitHub. Aucun déploiement industriel ni partenaire B2B n'est annoncé à ce stade, il s'agit d'une contribution de recherche académique, pas d'un produit shipé.

IA physiqueActu
1 source
Contrôle robotique sans démonstration via des agents LLM
1838arXiv cs.RO 

Contrôle robotique sans démonstration via des agents LLM

Des chercheurs ont publié FAEA (Frontier Agent as Embodied Agent), un framework qui applique directement aux manipulateurs robotiques les architectures d'agents LLM conçues pour le génie logiciel, sans démonstrations spécifiques à la tâche ni fine-tuning. Évalué sur trois benchmarks de référence en simulation avec accès privilégié à l'état de l'environnement (positions des objets fournies directement, sans perception visuelle brute), FAEA atteint des taux de succès de 84,9 % sur LIBERO, 85,7 % sur ManiSkill3, et 96 % sur MetaWorld, en utilisant le Claude Agent SDK d'Anthropic comme modèle frontier non modifié. Une itération optionnelle de feedback humain porte le score LIBERO à 88,2 %. Ces résultats se rapprochent des performances des modèles VLA (Vision-Language-Action) entraînés sur moins de 100 démonstrations par tâche, seuil qui représente aujourd'hui le plancher de coût pour la collecte de données en robotique incarnée. L'implication centrale est notable : pour les tâches de manipulation dominées par la planification délibérative à haut niveau, un agent généraliste non spécialisé peut suffire, sans pipeline de données propriétaire. FAEA peut en outre explorer de façon autonome des scénarios inédits en simulation et générer des trajectoires réussies pour augmenter les datasets d'entraînement, court-circuitant ainsi le goulot de la collecte humaine. Nuance critique : tous les tests restent en simulation avec état privilégié ; aucun transfert sim-to-real n'est validé dans ce travail, ce qui limite la portée des conclusions pour un déploiement industriel réel. Les modèles VLA entraînés bout-en-bout, pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA, dominent la recherche en manipulation depuis 2023 mais restent contraints par des pipelines de collecte de données coûteux et spécifiques à chaque domaine. FAEA s'inscrit dans un courant alternatif qui cherche à exploiter l'infrastructure d'agents software directement en robotique : la même boucle plan-act-observe-debug qui pilote les agents de coding est ici transférée sans modification au contrôle de manipulateurs. Ce positionnement implique un bénéfice passif : toute amélioration des modèles frontier se répercute directement sur les capacités robotiques sans retraining. Le préprint est disponible sur arXiv (2601.20334v2) et le code sur GitHub ; aucun déploiement industriel n'est annoncé à ce stade.

IA physiquePaper
1 source
TacGen : le toucher comme dimension essentielle de la représentation physique, avec alignement vision-tactile et génération de données
1839arXiv cs.RO 

TacGen : le toucher comme dimension essentielle de la représentation physique, avec alignement vision-tactile et génération de données

Des chercheurs ont publié sur arXiv (arXiv:2606.29173, juin 2026) TacGen, un système de représentation multimodale vision-toucher conçu pour pallier la rareté des données tactiles dans l'apprentissage automatique appliqué à la robotique. Le système combine un alignement contrastif vision+toucher (V+T) avec un générateur résiduel MLP en espace latent qui synthétise des représentations tactiles directement depuis des images RGB. Entraîné sur le backbone DINOv2, TacGen surpasse les approches vision seule sur l'estimation de masse (ΔR²=+0,570), de densité (Δacc=+0,067), de dureté (+0,117) et d'étiquettes de force (ΔR²=+0,281). Sur la tâche de manipulation TACTO, les performances passent de 0,246 à 0,979 ; le scaling du modèle vision seul n'explique que 4,5 % de cet écart, le canal tactile en représentant 95,5 %. Ce résultat remet en cause une hypothèse dominante du domaine : que la vision, suffisamment mise à l'échelle, peut approximer les propriétés physiques de contact. TacGen montre que la compliance, la texture et la masse nécessitent un canal sensoriel dédié, que les auteurs qualifient de dimension "nécessaire" de la représentation du monde physique. Pour les équipes déployant des manipulateurs industriels, cela justifie l'investissement dans les capteurs tactiles (peaux électroniques, capteurs force/couple en bout de bras) plutôt qu'une dépendance exclusive à la vision embarquée. Le générateur de latents tactiles atteint un score cross-seed de +0,589, les données synthétiques étant statistiquement équivalentes aux données réelles sur l'entraînement aval. La rareté des données tactiles est structurelle : collecter des images RGB est trivial, instrumenter un objet pour mesurer forces et déformations reste coûteux et peu scalable. TacGen s'inscrit dans une lignée de travaux qui comprend DIGIT (Meta AI Research), GelSight (MIT) et les recherches de Lerrel Pinto (NYU) sur l'apprentissage visuotactile. La validation repose sur cinq seeds reproductibles (benchmarks SSVTP/TVL), un transfert YCB-Sight, trois vérifications de backbone et des contrôles de permutation, ce qui constitue une rigueur expérimentale supérieure à la moyenne des prépublications arXiv dans ce domaine. Le travail reste cantonné à la simulation TACTO ; sa généralisation à des robots réels en environnement non contrôlé constitue l'étape critique non encore franchie.

IA physiquePaper
1 source
Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence
1840arXiv cs.RO 

Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence

Des chercheurs ont publié fin juin 2026 sur arXiv une méthode appelée MoRE (Mode Redirection) pour corriger un défaut structurel de l'apprentissage par imitation robotique (behavior cloning) : les politiques entraînées sur des jeux de démonstrations hétérogènes capturent simultanément des comportements désirés et indésirables, y compris dangereux. L'exemple retenu par les auteurs est parlant : un robot entraîné à des transferts d'objets peut apprendre à passer un couteau lame en premier. MoRE introduit une courte étape d'«uncloning» qui distille un signal de redirection, généré par un classificateur de modes temporaire, directement dans les poids de la politique. Une loss de rétention préserve la compétence sur les modes corrects. Sur huit tâches simulées et réelles, MoRE améliore le taux de succès moyen de 44 points de pourcentage par rapport à la politique multi-modes initiale, et approche les performances du réentraînement sur données filtrées, considéré comme la référence. La méthode est compatible avec Diffusion Policy et Pi0.5, le modèle VLA (Vision-Language-Action) de Physical Intelligence. L'intérêt industriel de MoRE tient à deux absences : pas d'accès requis aux démonstrations originales, et aucun surcoût à l'inférence. Les solutions existantes butaient sur l'une ou l'autre contrainte : la curation de données impose un réentraînement complet depuis les données sources ; le steering à l'inférence (guidage externe durant l'exécution) ajoute une latence incompatible avec les cycles robotiques en temps réel. MoRE contourne les deux en modifiant les poids une seule fois, en aval de l'entraînement initial. Pour un intégrateur ou un COO industriel, c'est une piste crédible pour corriger une politique déjà déployée sans repartir de zéro. La compatibilité confirmée avec Pi0.5 est un signal fort : si la méthode tient sur un VLA large-scale, elle couvre un spectre large de déploiements réels. L'apprentissage par imitation reste l'une des méthodes d'entraînement les plus accessibles, mais sa sensibilité aux données hétérogènes est un problème structurel documenté depuis des années. Les VLA récents comme Pi0 et Pi0.5 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA) ont étendu les capacités générales des politiques sans régler ce problème de modes indésirables. MoRE s'inscrit dans un courant émergent de post-training alignment appliqué à la robotique, analogue aux techniques DPO/RLHF utilisées pour aligner les LLM après préentraînement. Les approches concurrentes incluent le filtrage par classificateur externe et la curation de données assistée par modèle. Ce travail est à ce stade un preprint de recherche, sans partenariat industriel annoncé ni timeline de commercialisation ; aucun acteur européen n'est impliqué parmi les auteurs identifiés.

IA physiqueOpinion
1 source
Ancrage de la généralisation simulation-réel en manipulation robotique : étude empirique avec des modèles VLA
1841arXiv cs.RO 

Ancrage de la généralisation simulation-réel en manipulation robotique : étude empirique avec des modèles VLA

Une équipe de chercheurs a publié sur arXiv (référence 2603.22876, version 2 en juin 2026) une étude empirique de grande ampleur sur le transfert simulation-vers-réel dans le domaine de la manipulation robotique, en ciblant spécifiquement les modèles Vision-Language-Action (VLA). L'étude porte sur plus de 10 000 essais réels et analyse quatre variables clés : la randomisation de domaine multi-niveaux, le rendu photoréaliste, la modélisation physique réaliste, et les mises à jour par apprentissage par renforcement (RL). Pour mesurer les performances, les auteurs ont conçu un protocole d'évaluation couvrant les variations de fond, d'éclairage, de distracteurs visuels, de types d'objets et de configurations spatiales. Les données simulées, les plateformes robotiques utilisées et l'intégralité du protocole sont mis à disposition en accès libre pour permettre la reproductibilité indépendante. Ce travail répond à un angle mort persistant dans la recherche robotique : les algorithmes de réduction du Sim-to-Real gap abondent dans la littérature, mais peu ont été validés de façon systématique sur des politiques généralistes comme les VLA, qui apprennent à partir de vastes corpus de données mixtes texte-image-action. En isolant empiriquement les quatre déterminants de la généralisation, l'étude permet aux intégrateurs et aux équipes R&D de prioriser leurs investissements en infrastructure de simulation plutôt que d'empiler des heuristiques non testées. La mise à disposition d'un benchmark standardisé constitue une rupture : le secteur manquait d'une référence commune pour comparer les approches sim-to-real sur des tâches de manipulation représentatives, un vide que cette publication comble directement. Le Sim-to-Real gap est l'un des obstacles structurels au déploiement des robots en environnement non contrôlé, et la montée en puissance des VLA (Pi-0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind, GR00T N2 de NVIDIA) rend la question encore plus urgente : ces modèles sont entraînés massivement sur des données synthétiques, et leur robustesse réelle reste souvent opaque. Plusieurs laboratoires, dont ceux liés à Figure AI, Agility Robotics ou 1X Technologies, investissent dans des moteurs de simulation propriétaires précisément pour réduire ce coût. En publiant protocole et plateformes, les auteurs offrent un socle de comparaison neutre qui devrait accélérer la convergence des pratiques, à condition que des équipes tierces reproduisent et étendent les résultats sur d'autres morphologies robotiques.

IA physiqueOpinion
1 source
Politique de guidage comportemental : des démonstrations comme invites pour la manipulation
1842arXiv cs.RO 

Politique de guidage comportemental : des démonstrations comme invites pour la manipulation

Une équipe de chercheurs publie sur arXiv (preprint 2606.30457, juin 2026) une architecture baptisée Behavior Prompting Policy (BPP), conçue pour permettre à un robot de réaliser une tâche de manipulation inédite à partir d'une seule démonstration humaine, sans aucun fine-tuning. Le principe, qu'ils nomment "behavior prompting", s'inspire directement de l'apprentissage en contexte (in-context learning) des grands modèles de langage : la démonstration joue le rôle de "prompt" et le modèle visuomoteur génère les actions correspondantes à partir de l'observation courante. En parallèle, les auteurs introduisent iPhUMI, une interface de manipulation tenue à la main qui permet de collecter des données d'entraînement diversifiées à moindre coût, ainsi que deux benchmarks d'évaluation inédits : DrawAnything (tâches de dessin sur robot) et LIBERO-Gen (manipulation de surface avec généralisation zero-shot). Le résultat le plus structurant de cette recherche est l'identification de la diversité des tâches d'entraînement comme facteur déterminant de la capacité de prompting, davantage que le volume de données ou la taille du modèle. Cela change le calcul pour les intégrateurs et les équipes robotique : plutôt que d'accumuler des milliers de démonstrations par tâche pour fine-tuner, une politique généraliste entraînée sur un corpus très varié suffit, et l'opérateur la re-configure via une unique démonstration manuelle. Sur le plan industriel, c'est une piste sérieuse pour réduire le coût de déploiement de robots de manipulation dans des environnements à SKUs variables, problème central en logistique et en assemblage flexible. Cette approche s'inscrit dans une famille de travaux sur les Visual Language Action models (VLA) et les politiques généralisées, dont les représentants les plus connus sont π₀ (Physical Intelligence), OpenVLA (UC Berkeley) et RT-2 (Google DeepMind). iPhUMI se positionne comme une alternative légère aux exosquelettes ou gants haptiques pour la collecte de données. Il s'agit pour l'instant d'un preprint non peer-reviewed, et les expériences restent limitées à des environnements de laboratoire ; la question du sim-to-real et de la robustesse à la variabilité de l'éclairage ou de l'objet n'est pas traitée. Un site projet est disponible, mais aucun code ni dataset n'est encore publié.

IA physiqueOpinion
1 source
SA-VLA : un tokeniseur conscient de l'état pour améliorer les performances des modèles VLA
1843arXiv cs.RO 

SA-VLA : un tokeniseur conscient de l'état pour améliorer les performances des modèles VLA

Des chercheurs ont publié le 30 juin 2026 sur arXiv (arXiv:2606.30113) une méthode baptisée SA-VLA, pour State-Aware Vision-Language-Action model, qui s'attaque à un défaut fondamental des politiques de contrôle robotique basées sur les grands modèles de langage. Dans les architectures VLA actuelles, les actions continues du robot sont compressées en codes discrets via une quantification vectorielle (VQ) : chaque token d'action est ensuite décodé vers un prototype continu fixe, indépendamment de la configuration articulaire réelle du robot, de la pose des objets ou des conditions de contact. SA-VLA introduit un tokenizer conditionné sur l'état proprioceptif courant, via deux mécanismes testés en parallèle : une attention croisée entre les features d'état et les features d'action, et un adaptateur léger qui prédit des facteurs de modulation par action pour reconstruire des commandes continues adaptées à l'état. Sur 12 tâches de manipulation du benchmark RoboTwin, le taux de succès moyen passe de 0,29 à 0,56 par rapport au meilleur tokenizer de référence. En transfert sim-to-real zéro-shot sur trois tâches réelles, il grimpe de 0,15 à 0,33, soit un doublement dans les deux cas. Ce résultat est notable parce qu'il cible le "compression gap", c'est-à-dire la perte de précision introduite par la discrétisation des actions continues, un problème longtemps identifié comme le talon d'Achille des VLA autorégessifs. Que le même token discret corresponde à des commandes articulaires radicalement différentes selon la posture du bras est trivial en robotique, mais les architectures de tokenization l'ignoraient jusqu'ici. L'approche par adaptateur est particulièrement intéressante pour les intégrateurs : elle étend la capacité expressive d'un codebook de taille fixe sans en changer la structure, et reste compatible avec le décodage autorégressif comme parallèle, ce qui préserve la compatibilité avec les pipelines LLM existants. Le doublement du taux de succès en transfert zéro-shot sim-to-real est le signal le plus fort : il suggère que le gap de généralisation observé dans de nombreux déploiements VLA n'est pas entièrement dû aux domaines visuels, mais aussi à ce mismatch entre token discret et commande continue. Les VLA sont devenus le paradigme dominant dans la robotique de manipulation depuis les travaux de Physical Intelligence (Pi-0, pi0.5), d'Embodied Intelligence (OpenVLA) et de Google DeepMind (RT-2, puis les variantes Gemini Robotics). Le benchmark RoboTwin, utilisé ici comme référence, est un environnement de simulation standardisé pour la manipulation bi-manuelle apparu fin 2024. SA-VLA s'insère dans l'écosystème des VLA à décodage discret, en compétition directe avec des tokenizers comme FSQ ou les approches diffusion-based qui contournent le problème autrement. L'absence d'affiliation institutionnelle clairement identifiable dans le titre limite la lisibilité du positionnement concurrentiel, mais la méthode est décrite comme intégrable à tout backbone LLM-VLA standard. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges (LIBERO, BridgeData v2) et une intégration dans des pipelines de déploiement industriel, où la robustesse aux variations de configuration est précisément le facteur limitant.

IA physiqueOpinion
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
1844arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

RecherchePaper
1 source
CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle
1845arXiv cs.RO 

CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle

Une équipe de chercheurs a publié sur arXiv (réf. 2606.29222) un planificateur de navigation autonome baptisé CORE (Contextual-memory Oriented Reinforcement-learning), conçu pour guider un robot dans des environnements inconnus sans carte préalable. L'architecture combine un graphe de visibilité sparse pour la représentation structurée de l'espace, un réseau Transformer pour la compréhension globale de l'environnement, et un mécanisme de mémoire contextuelle pour éviter les optima locaux dans les grandes scènes. Testé face au planificateur traditionnel FAR Planner et à plusieurs baselines d'apprentissage par renforcement, CORE réduit la distance de déplacement de 13 % par rapport à FAR Planner et jusqu'à 48 % face aux meilleures méthodes d'apprentissage, avec des gains qui s'accentuent dans les environnements complexes. Fait notable : le modèle réalise un transfert sim-to-real en zéro-shot, sans fine-tuning sur données réelles, après entraînement exclusif sur des environnements simulés basés sur l'image. Le code est disponible en accès libre sur GitHub. Ce résultat s'attaque à un verrou persistant de la navigation mobile : la dégradation des performances lors du passage du simulateur au monde réel. La plupart des méthodes d'apprentissage par renforcement nécessitent soit une domain randomization poussée, soit un fine-tuning coûteux sur données terrain. Ici, le zéro-shot sim-to-real est démontré en environnement physique sans intervention humaine, résultat significatif si les conditions expérimentales sont généralisables. Pour les intégrateurs et équipes R&D, l'enjeu concret est double : réduction de la distance parcourue (efficacité énergétique, temps de cycle) et capacité à opérer dans des espaces non cartographiés, scénario courant en logistique, BTP ou exploration. La navigation en environnements inconnus s'appuie historiquement sur le SLAM, avec des contributions majeures d'ETH Zurich, Carnegie Mellon ou l'INRIA côté européen. FAR Planner (CMU), utilisé ici comme référence de comparaison, reste une baseline solide mais à règles fixes. Sur le plan industriel, Boston Dynamics, ANYbotics ou Exotec intègrent des planificateurs propriétaires dans leurs flottes de robots mobiles. CORE se positionne comme une alternative légère, entraînable sur image seule, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La robustesse face aux obstacles dynamiques, non testée dans cette version, constituera l'étape critique pour une éventuelle industrialisation.

RecherchePaper
1 source
Human2Any : transfert humain-robot via planification compositionnelle avec contraintes
1846arXiv cs.RO 

Human2Any : transfert humain-robot via planification compositionnelle avec contraintes

Une équipe de chercheurs a publié en juin 2026 Human2Any, un framework d'apprentissage conçu pour transférer des démonstrations humaines vers des robots sans nécessiter de données d'entraînement collectées directement sur le robot cible. Le principe central repose sur l'extraction de priors d'interaction centrés sur les objets à partir de vidéos de mains humaines, en représentant la manipulation non pas par les mouvements du bras, mais par la relation cinématique entre objets, ce qui change dans la scène, indépendamment de qui ou quoi produit ce changement. Ces priors sont ensuite composés avec un module de raisonnement de faisabilité côté robot et un planificateur de mouvement, permettant l'adaptation à différentes morphologies robotiques, géométries de scène et configurations de tâches. Les expériences réelles ont été menées sur deux plateformes distinctes : un bras Franka Emika en configuration tabletop, et un robot humanoïde mobile RBY-1, tous deux opérant sur des tâches de manipulation sans avoir reçu d'exemples robot dans le contexte cible. Ce résultat est significatif parce qu'il attaque directement le goulot d'étranglement le plus coûteux du pipeline robotique actuel : la collecte de données de démonstration sur le robot réel. Les approches VLA (Vision-Language-Action) dominantes, comme celles de Physical Intelligence (pi0) ou de Google DeepMind, s'appuient sur des téléopérations massives ou des simulations intensives pour construire des datasets robot-specific. Human2Any propose une voie alternative : lever l'hypothèse que les priors doivent être ancrés dans l'embodiment. La capacité démontrée à transférer vers un humanoïde mobile comme le RBY-1, dont la cinématique et les degrés de liberté diffèrent radicalement d'un bras fixe, suggère une généralisation inter-embodiment qui, si elle se confirme à plus grande échelle, réduirait les barrières à l'entrée pour les intégrateurs sans accès à des flottes de robots pour la collecte. Sur le plan académique, Human2Any s'inscrit dans un courant de recherche en plein essor autour du retargeting humain-robot, aux côtés de travaux comme UMI (Universal Manipulation Interface) de Stanford ou OKAMI et HumanPlus de Berkeley, qui exploitent tous la vidéo humaine comme signal de supervision bon marché. La distinction revendiquée ici est l'abstraction complète de l'embodiment via la représentation objet-objet, plutôt qu'un retargeting cinématique direct. Le projet est disponible sur human2any.github.io. La prochaine étape logique sera de mesurer si ces priors tiennent face à une plus grande diversité d'objets, de saisies, et de configurations de scène non vues à l'entraînement.

RecherchePaper
1 source
Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique
1847arXiv cs.RO 

Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique

Une équipe de chercheurs publie sur arXiv (réf. 2606.29898) une métrique d'évaluation hors ligne baptisée Critical Interval MSE (CI-MSE), conçue pour combler un angle mort majeur dans le développement des politiques de manipulation robotique. Le problème de départ est bien connu : l'évaluation en conditions réelles reste la seule mesure fiable de la performance d'un modèle, mais elle est coûteuse, difficile à reproduire et trop lente pour comparer itérativement des variantes proches. Le proxy historique, la perte de validation MSE sur des démonstrations d'experts, présente une corrélation trop faible avec les performances en déploiement réel pour être utile en pratique. CI-MSE propose une approche différente : restreindre le calcul d'erreur aux segments temporels jugés critiques pour la tâche, et l'associer à des procédures d'alignement d'actions qui reproduisent mieux le comportement au moment du rollout. Les auteurs mesurent une corrélation de rang de Spearman de -0,87 entre leur métrique et les performances réelles, contre -0,61 pour la MSE brute, sur un large panel de checkpoints de politiques, validés en simulation et en environnement physique. L'enjeu industriel est direct : le goulot d'étranglement de l'itération sur les politiques robotiques n'est pas le calcul, c'est le temps de test physique. Si une métrique hors ligne prédit fiablement laquelle de deux variantes d'un modèle est meilleure, les équipes peuvent filtrer les mauvais candidats avant même de mobiliser un robot. Pour les intégrateurs et les labs qui travaillent sur des politiques de type VLA (Vision-Language-Action), ce gain de cycle de R&D peut se traduire en semaines économisées par itération. Le résultat de -0,87 est notable, mais à nuancer : les auteurs délimitent eux-mêmes des conditions limites d'utilisation, notamment en cas de shifts de distribution à l'évaluation. CI-MSE s'inscrit dans un effort plus large de la communauté pour résoudre le "sim-to-real gap" par des proxies d'évaluation plus fidèles, sans nécessiter de rollouts physiques systématiques. Les travaux sur les métriques comportementales (action chunking, diffusion policies) ont mis en évidence que la MSE brute ne capturait pas les moments décisifs d'une tâche de manipulation. Ce papier formalise cette intuition avec une analyse de sensibilité qui montre la robustesse de CI-MSE sur un large spectre d'hyperparamètres. Le code et les détails sont accessibles sur le site du projet (ci-mse.github.io). Prochaine étape attendue : validation à plus grande échelle sur des benchmarks multi-tâches et des architectures de politiques hétérogènes.

RechercheOpinion
1 source
Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel
1848arXiv cs.RO 

Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel

Des chercheurs ont soumis sur arXiv (arXiv:2606.28805, juin 2026) un ensemble de modèles physiques haute-fidélité destinés à améliorer le sim-to-real transfer en robotique, appliqués au tennis de table de niveau professionnel. À des vitesses et effets compétitifs, une balle de ping-pong suit des trajectoires complexes et contre-intuitives que le robot doit anticiper en une fraction de seconde. Les modèles proposés couvrent trois domaines : la dynamique aérodynamique du vol de balle, avec les coefficients de traînée et de force de Magnus modélisés en fonction du nombre de Reynolds et du rapport de rotation ; le contact balle-table, intégrant les effets de déformation (buckling) de la balle sur le coefficient de restitution ainsi que des termes résiduels ; et le contact balle-raquette, via un réseau de neurones résiduel combiné à des coefficients de restitution normale et tangentielle et un amortissement torsionnel. Ces modèles ont servi à entraîner des politiques par apprentissage par renforcement (RL), aboutissant à ce que les auteurs décrivent comme le premier agent robotique capable d'affronter des joueurs professionnels en conditions réelles. L'intérêt technique dépasse le cadre sportif. La nature adversariale du tennis de table impose une contrainte rarement aussi explicite ailleurs : toute zone où la simulation diverge de la réalité devient exploitable par l'adversaire, forçant une précision de modélisation sans concession. Les travaux antérieurs en robotique ping-pong se cantonnaient à des plages étroites de vitesses et d'effets, insuffisantes pour reproduire les comportements balistiques du jeu professionnel. Que ce pipeline simulation-vers-réalité soit suffisamment fidèle pour approcher ce niveau valide l'approche pour des tâches de manipulation rapide en milieu industriel, où les essais réels restent coûteux ou dangereux, et renforce l'hypothèse que le sim-to-real gap est soluble par la précision physique plutôt que par l'accumulation de données réelles. Ce travail s'inscrit dans la continuité directe des recherches publiées par Google DeepMind en 2024, qui avaient démontré qu'un robot pouvait battre des joueurs amateurs confirmés en conditions réelles. Ce nouveau papier documente les fondations physiques qui rendent possible le saut qualitatif vers le niveau professionnel. Plusieurs équipes concurrentes utilisent le ping-pong comme benchmark de robotique agile, mais peu ont publié des modèles de contact aussi détaillés pour les phases raquette-balle et balle-table. La revendication de compétitivité face à des professionnels reste à confirmer par des évaluations indépendantes, le papier étant une prépublication non encore évaluée par les pairs. Les suites logiques incluent la généralisation de ces modèles de contact résiduels à d'autres objets déformables et leur transposition à des tâches industrielles de manipulation précise à haute cadence.

RecherchePaper
1 source
VLK : apprentissage de la loco-manipulation humanoïde à partir d'interactions synthétiques dans des scènes reconstruites
1849arXiv cs.RO 

VLK : apprentissage de la loco-manipulation humanoïde à partir d'interactions synthétiques dans des scènes reconstruites

Des chercheurs ont publié fin juin 2026, via arXiv (2606.30645), une méthode baptisée VLK (Vision-Language-Kinematics) permettant à un humanoïde d'apprendre à se déplacer et à manipuler des objets à partir d'observations égocentriques, sans aucune annotation humaine. Le pipeline génère automatiquement 48 000 trajectoires supervisées en reconstruisant des environnements intérieurs en 3D grâce à la technique de 3D Gaussian Splatting, puis en synthétisant des trajectoires de navigation et d'interaction avec des objets en exploitant les données de scène privilégiées, et enfin en rendant les images égocentriques correspondantes après coup. Une politique VLK est ensuite entraînée à prédire des trajectoires cinématiques corps entier à court horizon, converties en commandes physiques par un tracker corps entier. Les expériences physiques ont été réalisées sur le robot humanoïde Unitree G1, sur des tâches de navigation et de transport d'un objet unique dans des scènes reconstruites. L'intérêt technique de cette approche est de répondre à un verrou de données structurel : aucune source existante ne fournit à grande échelle le triplet complet (images égocentriques synchronisées, instructions en langage naturel, trajectoires cinématiques compatibles avec un humanoïde). VLK résout ce problème par génération synthétique totale, sans capture de mouvement, sans télé-opération, sans annotation. Cela positionne la méthode comme un levier de scalabilité réel pour les politiques VLA (Vision-Language-Action) appliquées aux humanoïdes, à condition que le rendu synthétique soit suffisamment fidèle pour passer le sim-to-real, ce que les auteurs revendiquent mais sur un périmètre de tâches encore limité (transport mono-objet, scènes intérieures). Le contexte situe ce travail dans la vague des politiques génératives pour humanoïdes, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (Nvidia) ou des approches diffusion-based de Figure. Le Unitree G1, plateforme abordable à environ 16 000 dollars, est devenu un banc de test standard dans la communauté académique, ce qui facilite la reproductibilité. La reconstruction par Gaussian Splatting, popularisée depuis 2023, permet ici de créer des environnements d'entraînement photoréalistes à partir de scans de quelques minutes. Les prochaines étapes naturelles seront d'étendre la méthode à la manipulation bi-manuelle, à des scènes plus dynamiques et à des horizons de prédiction plus longs, où la dérive cinématique reste un problème ouvert.

IA physiqueActu
1 source
TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)
1850arXiv cs.RO 

TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2606.29089) une méthode appelée TAP-VLA (Tactile Annotation Prompting for Vision-Language-Action models) visant à doter les modèles vision-langage-action du sens du toucher sans modifier leur architecture. Sur quatre tâches de manipulation à contacts complexes (vissage, insertion, assemblage de précision), TAP-VLA atteint un taux de succès de 78 %, contre moins de 50 % pour un fine-tuning purement visuel et pour les approches alternatives de fusion tactile, certaines de ces baselines ne faisant pas mieux qu'un résultat aléatoire. Le principe repose sur des capteurs visuo-tactiles capables de mesurer les champs de cisaillement (shear fields) à la surface de contact ; ces champs sont ensuite superposés sous forme de vecteurs spatialement alignés directement sur les images RGB multi-vues que le modèle consomme déjà, sans ajouter de modalité d'entrée distincte. L'enjeu est réel : les VLAs de génération actuelle, comme π0 de Physical Intelligence, OpenVLA ou RT-2 de Google DeepMind, offrent un raisonnement robuste sur les variations visuelles, sémantiques et spatiales grâce à leur pré-entraînement à grande échelle, mais restent aveugles aux forces de contact, pourtant centrales dans toute manipulation industrielle sérieuse (emboîtement de précision, vissage, gestion d'objets déformables). Intégrer le toucher comme nouvelle modalité d'entrée détériore précisément ce pré-entraînement, car les données tactiles sont absentes des corpus à grande échelle sur lesquels ces modèles sont construits, un problème de distribution shift bien documenté dans la littérature. TAP-VLA contourne l'obstacle en restant dans l'espace d'observation natif du modèle : pas de modification architecturale, pas de pré-entraînement tactile spécifique, surcoût computationnel négligeable. Ce travail s'inscrit dans une course active autour de l'embodied AI pour la manipulation de précision, où Physical Intelligence (π0, π0-FAST), Figure AI ou Apptronik cherchent à étendre les capacités de leurs humanoïdes et bras industriels au-delà du pick-and-place visuel. La question du sim-to-real pour les contacts reste l'un des derniers verrous majeurs avant un déploiement industriel à l'échelle. En évitant la refonte architecturale, TAP-VLA propose une voie d'intégration compatible avec les VLAs existants, ce qui simplifie son adoption par des équipes qui travaillent à partir de modèles déjà entraînés. La publication sur arXiv sans conférence associée indique que ce travail est encore en cours d'évaluation par les pairs ; aucun déploiement réel ou pilote industriel n'est annoncé à ce stade.

IA physiqueOpinion
1 source