Aller au contenu principal
IA physiquearXiv cs.RO 

MIRA : interaction humain-robot en duplex intégral et temps réel pour compagnons incarnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent MIRA, un système d'interaction homme-robot en temps réel destiné aux robots compagnons, décrit dans un article publié sur arXiv (identifiant 2609.24547). Face à un flux de parole continu, l'historique du dialogue et l'affect vocal de l'utilisateur, MIRA prédit simultanément le texte de la réponse et un signal d'incarnation physique qui pilote le geste du robot. Les comportements sociaux discrets, comme écouter ou saluer, sont associés à des trajectoires robotiques préétablies et validées, tandis que la parole ouverte est accompagnée d'un mouvement généré en flux continu, contraint par une fenêtre glissante qui anticipe la trajectoire sur un horizon court sans figer d'engagement physique irréversible, afin de rester annulable en cas d'interruption. Le cœur du système, baptisé CORTEX, est une politique de décision à deux échelles temporelles qui gère à la fois les réactions à faible latence et les décisions de tour de parole plus délibérées, avec une couche d'exécution côté robot qui applique les contraintes de sécurité physique au rythme du contrôle moteur. L'équipe a déployé MIRA sur un robot humanoïde Astribot S1 et rapporte des évaluations quantitatives d'alignement audio-mouvement jugées compétitives face à des méthodes de référence de génération de mouvement, ainsi que des mesures de réactivité et de gestion des interruptions en conditions réelles, sans toutefois détailler de chiffres précis de latence ou de taux de réussite dans le résumé disponible.

L'intérêt de ce travail réside dans la fusion, au sein d'une architecture unique, de deux fonctions habituellement traitées séparément par les robots conversationnels : l'orchestration du dialogue et la synthèse de gestes, cette dernière étant généralement calculée hors ligne à partir d'un audio complet. En traitant la parole de façon incrémentale et en gérant l'incertitude sur les frontières de tour de parole, MIRA s'attaque directement à un problème concret pour les intégrateurs de robots sociaux et compagnons: la capacité à interrompre un mouvement en cours sans compromettre la sécurité physique, un point souvent négligé dans les démonstrations scénarisées de robots humanoïdes conversationnels.

Ce travail s'inscrit dans la vague plus large des architectures vision-langage-action et des robots compagnons cherchant à dépasser le stade de la démonstration commandée par script pour atteindre une interaction fluide et bidirectionnelle en continu. Le choix de l'Astribot S1, humanoïde chinois déjà utilisé dans plusieurs démonstrations de manipulation, comme plateforme de validation ancre la recherche dans un cas d'usage réel plutôt que purement simulé. Les auteurs comparent leurs résultats à des méthodes de génération de mouvement de référence sans préciser dans le résumé de calendrier de déploiement commercial, ce qui situe MIRA au stade de la démonstration de recherche plutôt que du produit prêt à l'emploi.

À lire aussi

DexWild : des interactions humaines dextériques pour des politiques robotiques en conditions réelles
1arXiv cs.RO 

DexWild : des interactions humaines dextériques pour des politiques robotiques en conditions réelles

DexWild est un framework de collecte de données et d'apprentissage pour la manipulation robotique dextère, publié en mai 2025 sur arXiv (2505.07813). L'idée centrale consiste à remplacer la téléopération coûteuse par la capture directe de gestes humains dans des environnements du quotidien. Une équipe diverse de collecteurs utilise le DexWild-System, un dispositif portable et peu onéreux, pour enregistrer des heures d'interactions avec des objets variés dans de multiples contextes réels. Le framework co-entraîne ensuite un modèle sur ces démonstrations humaines combinées à un volume minimal de données robot spécifiques. Les résultats mesurés atteignent 68,5 % de taux de succès dans des environnements non vus à l'entraînement, soit près de quatre fois mieux qu'une politique entraînée sur données robot seules, et une généralisation cross-embodiment (transfert vers d'autres morphologies robotiques) améliorée d'un facteur 5,8. Le goulot d'étranglement des données est un problème structurel pour la manipulation dextère. La téléopération reste la méthode dominante pour produire des datasets de haute qualité, notamment chez Physical Intelligence avec pi-0 ou chez Figure pour ses robots humanoïdes, mais son coût freine la diversité de distribution couverte. DexWild propose un paradigme alternatif : laisser des humains collecter nativement des données gestuelles en vie réelle, puis transférer ces politiques vers des robots via co-training. Si ces performances se confirment hors laboratoire, cette approche pourrait réduire significativement le coût d'acquisition de données pour les intégrateurs industriels, en particulier sur des tâches de pick-and-place complexes. Il convient de noter que le papier est un preprint non encore peer-reviewed et que les vidéos de démonstration sont sélectionnées, deux points qui invitent à la prudence sur la reproductibilité réelle. Ce travail s'inscrit dans la tendance du scaling de datasets robotiques, aux côtés d'Open-X Embodiment et DROID. Sur la problématique du transfert human-to-robot, les approches concurrentes directes incluent UMI (Universal Manipulation Interface, Stanford/Columbia), qui utilise une gripper portable pour capturer des démonstrations dans des environnements non structurés, et les travaux de l'équipe de Sergey Levine à UC Berkeley sur l'apprentissage depuis des vidéos humaines. DexWild se distingue par la diversité explicite de ses collecteurs et la structure de co-training formalisée. Le code et les datasets sont accessibles sur dexwild.github.io ; aucun déploiement industriel ni timeline commerciale n'est annoncé à ce stade.

IA physiqueOpinion
1 source
ExpressMM : des comportements de manipulation mobile expressifs dans les interactions humain-robot
2arXiv cs.RO 

ExpressMM : des comportements de manipulation mobile expressifs dans les interactions humain-robot

Des chercheurs ont présenté ExpressMM, un framework destiné aux manipulateurs mobiles déployés en environnements humains, capable de générer des comportements expressifs en temps réel pendant l'exécution de tâches collaboratives. Publié sur arXiv (2604.05320v3), le système repose sur une architecture à deux niveaux : un planificateur de haut niveau fondé sur un modèle vision-langage (VLM) prend en charge la perception et le raisonnement conversationnel, tandis qu'une politique vision-langage-action (VLA) de bas niveau produit les mouvements expressifs du robot. Élément distinctif : ExpressMM supporte les interactions interruptibles, c'est-à-dire que l'utilisateur peut modifier ou rediriger les instructions du robot en cours d'exécution. L'évaluation a été conduite sur un manipulateur mobile réel lors d'un scénario d'assemblage collaboratif, avec des démonstrations en direct devant un public et des questionnaires post-session. La majorité des travaux antérieurs sur les comportements expressifs des robots s'appuyaient sur des mouvements préprogrammés ou appris par démonstration, et n'anticipaient pas les interruptions en cours de tâche, un cas pourtant courant dès qu'un humain travaille aux côtés d'un robot. ExpressMM traite cette lacune en couplant une VLA capable de s'adapter dynamiquement aux nouvelles instructions avec un raisonnement langage-vision pour maintenir la cohérence sociale de l'interaction. Les résultats des questionnaires indiquent que les observateurs ont trouvé les actions du robot clairement interprétables, les interactions socialement appropriées, et le comportement prévisible et sûr. Pour les intégrateurs industriels et les équipes opérations, c'est un signal fort : les robots collaboratifs ne peuvent plus se contenter d'accomplir une tâche ; ils doivent être lisibles par les humains qui partagent l'espace de travail. Le sujet de l'expressivité robotique est activement exploré depuis plusieurs années dans la communauté HRI, mais les approches précédentes peinaient à généraliser au-delà de comportements scénarisés ou de démos contrôlées. L'utilisation conjointe d'un VLM et d'une VLA dans un seul pipeline interruptible représente une progression architecturale significative. Sur le plan concurrentiel, des acteurs comme Boston Dynamics (avec Spot) ou des startups HRI telles que Enchanted Tools en France (robot Miroki) travaillent également sur la dimension sociale des robots collaboratifs, mais peu publient des évaluations HRI aussi structurées en conditions réelles. Les prochaines étapes logiques pour ExpressMM seraient des déploiements en environnements industriels ou de service à plus grande échelle, où la variété des interactions humaines dépasse largement les scénarios d'assemblage contrôlés.

UELa recherche est directement pertinente pour Enchanted Tools (France, robot Miroki), qui travaille sur des problématiques similaires d'expressivité sociale et d'interaction humain-robot collaboratif.

IA physiqueOpinion
1 source
GigaBrain-WBC-0.5 : un modèle du monde comportemental pour un contrôle corporel robuste avec interaction environnementale
3arXiv cs.RO 

GigaBrain-WBC-0.5 : un modèle du monde comportemental pour un contrôle corporel robuste avec interaction environnementale

Des chercheurs ont publié le 20 août 2026 (arXiv:2608.18234v1) GigaBrain-WBC-0.5, présenté comme le premier "Behavior World Model" (BWM) pour le contrôle corps entier de robots humanoïdes. Contrairement aux trackers de mouvement classiques, entraînés sur sol plat et incapables d'apprendre comment le contact avec le terrain ou des objets modifie leur dynamique, ce système repose sur un Transformer causal qui prédit simultanément sa prochaine action, son prochain état et la distribution de ses prochaines commandes comportementales latentes. Un pipeline d'annotation automatique reconstruit la géométrie de contact 3D à partir de mouvements retargetés, permettant d'annoter des jeux de données de mouvement à grande échelle sans travail manuel. Cette distribution prédite sert aussi en déploiement à détecter les commandes jugées implausibles et à les ramener vers des comportements appris, pour une exécution en mode "best effort". Face à trois trackers de référence à grande échelle, GigaBrain-WBC-0.5 obtient les meilleurs taux de réussite sur les quatre régimes testés: 81,3% en interaction avec le terrain (4,3 fois le meilleur concurrent), 83,1% sous commandes implausibles et 99,3% en récupération après chute (16,8 fois le meilleur concurrent). Des essais matériels montrent une robustesse face aux appuis manquants et aux perturbations; le modèle entraîné sur le Unitree G1 se transfère au robot Maker L01 avec un simple fine-tuning. Pour l'industrie robotique, ce travail s'attaque à un angle mort récurrent: la plupart des trackers actuels fonctionnent bien en démo sur sol lisse mais s'effondrent dès que le terrain devient irrégulier ou que des objets entrent en jeu, un écart entre démonstration et déploiement réel que le secteur peine encore à combler. En modélisant explicitement comment l'environnement contraint les comportements possibles, plutôt qu'en empilant des corpus de mouvements toujours plus vastes, l'approche ouvre une piste pour rendre les humanoïdes plus fiables hors des environnements contrôlés, entrepôts encombrés ou chantiers compris. Le taux de récupération après chute à 99,3% pèse particulièrement pour les intégrateurs, chaque chute non gérée interrompant généralement une tâche. La portabilité démontrée entre le Unitree G1 et le Maker L01 suggère par ailleurs une indépendance vis-à-vis du matériel, un enjeu commercial pour les fournisseurs de "cerveaux" robotiques. Ce travail s'inscrit dans la lignée des modèles vision-langage-action et des "world models" appliqués à la robotique, aux côtés d'approches comme GR00T N2 de NVIDIA, Helix de Figure AI ou Pi-0 de Physical Intelligence, qui visent toutes une couche de contrôle plus généraliste que les trackers traditionnels. GigaBrain-WBC-0.5 cible spécifiquement le contrôle bas niveau corps entier, un maillon souvent traité comme un simple suivi de trajectoire dans les piles logicielles concurrentes. Les trois trackers de référence comparés ne sont pas nommés dans le résumé, ce qui limite la comparaison directe avec des systèmes commerciaux connus. Aucun calendrier de déploiement industriel n'est mentionné: il s'agit d'une publication de recherche accompagnée d'essais matériels limités, pas d'un produit commercialisé.

IA physiquePaper
1 source
GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots
4arXiv cs.RO 

GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots

Des chercheurs ont publié sur arXiv, sous la référence 2609.05927 (version 2, qui remplace une publication antérieure), un système baptisé GIF, conçu pour générer automatiquement des scènes d'objets fonctionnels et interactifs destinées à l'entraînement et à l'évaluation de modèles de manipulation robotique en simulation. Le pipeline découpe le problème en deux étapes distinctes : un module nommé CoGen reconstruit des maillages 3D séparés par instance avec des poses initiales grossières, en combinant les forces des modèles génératifs 2D et 3D existants, puis un second module, GPRM, affine la pose relative entre les objets sous une double contrainte géométrique et physique. Un vérificateur basé sur un modèle vision-langage (VLM) sélectionne ensuite, parmi les candidats produits, celui qui correspond le mieux à la spécification structurée demandée. Les auteurs ont construit un benchmark couvrant huit classes représentatives de géométries de contact et ont comparé GIF à des générateurs de scènes considérés comme état de l'art. Résultat : le système améliore à la fois la qualité des objets générés et la justesse des relations spatiales entre eux, tout en faisant chuter le taux de collision sous la barre de 1%. Les données produites ont ensuite servi à entraîner des politiques de manipulation, avec une progression des performances observée à mesure que la diversité des scènes augmente, aussi bien en simulation qu'en déploiement réel. Cette contribution vise un maillon précis, et souvent négligé, de la chaîne d'entraînement des modèles de manipulation de type VLA : la génération de scènes. Les méthodes existantes se limitaient surtout à des agencements grossiers d'objets, sans modéliser la façon dont ils s'emboîtent ou interagissent physiquement, ce qui limite leur utilité pour des tâches fines comme ouvrir un couvercle ou insérer une pièce. En automatisant la production de compositions à faible taux de collision, GIF s'attaque directement au goulot d'étranglement des données d'entraînement pour la manipulation robotique, un enjeu central pour les équipes qui cherchent à réduire l'écart entre démonstrations en simulation et comportements robustes en conditions réelles. L'observation d'une montée en performance liée à la diversité des scènes, confirmée à la fois en simulation et sur robot réel, constitue l'élément le plus significatif pour les intégrateurs, car elle appuie l'hypothèse selon laquelle davantage de données synthétiques bien construites profite au transfert vers le monde réel. Ce travail s'inscrit dans la lignée des recherches sur la génération automatique de scènes de simulation pour la robotique, un domaine qui a jusqu'ici privilégié le placement grossier d'objets plutôt que la composition fine de leurs relations fonctionnelles et de contact. Les auteurs positionnent explicitement GIF face aux générateurs de scènes existants sans toutefois nommer d'acteur commercial concurrent, l'article restant à ce stade une contribution de recherche publiée sur arXiv plutôt qu'un produit déployé. La suite annoncée par les auteurs porte sur l'extension de cette génération de données synthétiques à plus grande échelle pour l'entraînement de politiques de manipulation, avec des premiers résultats de transfert vers le monde réel déjà rapportés, mais sans calendrier ni partenaire industriel précisé.

IA physiquePaper
1 source