Aller au contenu principal
VOMMI : collecte et exploitation de démonstrations portables pour la manipulation mobile
RecherchearXiv cs.RO 

VOMMI : collecte et exploitation de démonstrations portables pour la manipulation mobile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VOMMI (Visual-Odometry-Conditioned Mobile Manipulation Interface), un cadre de collecte de démonstrations portables et d'apprentissage pour la manipulation mobile, publié sur arXiv. Le système synchronise une vue « corps » et une vue « main » en RGB pour capturer à la fois le contexte de navigation et les interactions locales avec les objets, sans calibration de correspondance cinématique entre humain et robot. Deux briques techniques le composent. R2-VO affine hors ligne les trajectoires de démonstration à partir d'ancres géométriques parcimonieuses, puis produit des tokens de mouvement local causaux sur plusieurs horizons de prédiction. Un adaptateur résiduel par groupes d'actions injecte ces tokens uniquement dans la branche de base mobile du modèle vision-langage-action (VLA). Les expériences reposent sur 500 trajectoires portables par tâche, dont 75 réservées à l'évaluation RGB-VO, et sur 200 démonstrations robot servant de référence. La politique post-entraînée uniquement sur données portables affiche une erreur de vitesse de base inférieure de 18,2 % à celle d'une politique entraînée sur démonstrations robot, avec une précision de translation de l'effecteur comparable. La reconstruction hors ligne réduit l'erreur de trajectoire absolue de 24,6 % en moyenne pour les flux corps et main, par rapport au meilleur point de comparaison évalué pour chaque flux. Sur trois tâches réelles, le système complet gagne 8,3 points de succès moyen face à OpenPI 0.5.

Pour les intégrateurs et les équipes data, l'enjeu est le coût de collecte. La téléopération et les dispositifs spécialisés bardés de capteurs restent le goulot d'étranglement des politiques de manipulation mobile, et une capture portable, sans robot et avec une simple caméra RGB, élargirait fortement le volume de démonstrations accessible. Le résultat le plus parlant est l'erreur de vitesse de base : la navigation est précisément la dimension où l'odométrie visuelle brute dérive et où l'on pouvait craindre que des données humaines transfèrent mal. Ici, elles font mieux que les données robot sur cette métrique, ce qui suggère que le conditionnement par mouvement visuel compense le défaut de supervision. Il faut toutefois rester prudent : le gain de 8,3 points sur OpenPI 0.5 est modeste, mesuré sur seulement trois tâches, et les travaux ne précisent pas la nature des tâches ni les intervalles de confiance dans ce résumé. Il s'agit d'un résultat de laboratoire, sans déploiement industriel.

Le contexte est celui de la pénurie de données pour l'intelligence incarnée. Des interfaces portables comme UMI ont montré qu'on pouvait collecter des démonstrations de manipulation sans robot, mais elles se limitent surtout à la manipulation de table, sans la composante de déplacement de la base. VOMMI étend cette logique à la manipulation mobile, en s'appuyant sur la famille de politiques OpenPI (basée sur Pi-0) comme référence. Les acteurs concurrents du côté des VLA, dont Physical Intelligence, Figure avec Helix ou Nvidia avec GR00T, misent eux aussi sur des corpus massifs mêlant vidéo humaine et données robot. Les suites logiques seraient une validation sur davantage de tâches et de morphologies de robots, ainsi qu'une mesure du compromis entre volume de données portables et qualité de reconstruction hors ligne.

À lire aussi

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines
1arXiv cs.RO 

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines

Une équipe de chercheurs a publié sur arXiv (arXiv:2603.03243v2) HoMMI, pour Whole-Body Mobile Manipulation Interface, un framework d'apprentissage par imitation permettant à un robot mobile de maîtriser la manipulation bimanuelle et la navigation à partir de démonstrations humaines réalisées sans robot. Le principe : un opérateur humain porte une interface portative héritée du projet UMI (Universal Manipulation Interface), enrichie d'une caméra égocentrique capturant le contexte global de la scène (position dans l'espace, état de l'environnement). Ces données brutes alimentent une politique apprise, transférée ensuite sur un robot à corps entier (bras, torse, base mobile) sans que celui-ci n'ait été présent lors de la collecte. La difficulté centrale que HoMMI cherche à résoudre est l'"embodiment gap" : la différence morphologique et sensorielle entre humain et robot rend le transfert de politique difficile, particulièrement en perception égocentrique où les champs de vue et hauteurs d'oeil divergent fortement. Les auteurs proposent trois briques techniques pour combler cet écart : une représentation visuelle agnostique à l'embodiment, une représentation d'action "head relaxed" qui neutralise les variations de mouvement de tête, et un contrôleur corps entier réalisant les trajectoires main-oeil sous contraintes physiques du robot. Ces choix permettent des tâches longue-séquence mobilisant navigation, perception active et coordination bimanuelle, le type de scénario que les architectures Vision-Language-Action (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA visent également à résoudre. Les résultats, présentés sous forme de vidéos sur hommi-robot.github.io, restent à valider en conditions non contrôlées et sur des benchmarks standardisés. HoMMI s'inscrit dans la continuité directe du projet UMI (Columbia/Stanford, 2024), qui avait popularisé la collecte portable de démonstrations pour la manipulation fixe sur table. L'extension au robot mobile ajoute la dimension navigation, saut de complexité majeur pour le sim-to-real et la généralisation hors laboratoire. Les approches concurrentes incluent Mobile ALOHA (Stanford), les pipelines de distillation de données de Physical Intelligence, et les travaux de manipulation bimanuelle ALOHA/ACT de Berkeley. HoMMI reste à ce stade un preprint arXiv sans déploiement industriel annoncé ni métriques de taux de succès publiées, une limite habituelle des publications en robotique d'apprentissage avant revue par les pairs.

RecherchePaper
1 source
CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique
2arXiv cs.RO 

CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique

Des chercheurs ont publié fin juin 2026 CORE (Common Outcome Regularities from Action-Free Visual Demonstrations), un cadre d'apprentissage de politique robotique conçu pour exploiter des vidéos humaines sans annotations de mouvements, afin d'entraîner des robots manipulateurs. La méthode s'appuie sur une observation clé : bien que les trajectoires menant à une même tâche varient, leurs états terminaux partagent des configurations d'objets stables, des relations spatiales et des contraintes de contact reproductibles. CORE entraîne d'abord un encodeur d'état terminal par apprentissage contrastif et objectifs temporels auxiliaires, agrège ensuite les embeddings terminaux réussis en prototypes visuels de but (visual goal prototypes), puis injecte ces prototypes comme conditions globales dans la politique de contrôle du robot. Les gains de taux de succès mesurés sur les benchmarks de référence sont de +3,9 points de pourcentage sur Meta-World, +11,1 pp sur RoboTwin 2.0, et jusqu'à +17,0 pp en manipulation réelle. L'enjeu est direct pour les intégrateurs : collecter des démonstrations robotiques est coûteux en équipement, en opérateurs et en temps de setup, tandis que des millions d'heures de vidéos humaines d'assemblage, de logistique ou de cuisine existent déjà. L'écart morphologique entre la main humaine et un préhenseur robotique a jusqu'ici rendu ces vidéos inutilisables pour l'apprentissage par imitation direct. CORE contourne le problème en ne cherchant pas à transférer les actions elles-mêmes, mais uniquement les régularités des états finaux. Le gain de +17 pp en conditions réelles est particulièrement notable car il indique une réduction du fossé sim-to-real sans contrainte sur la morphologie du robot. En surpassant les variantes conditionnées par texte (architecture VLA classique), CORE suggère que les prototypes visuels de but apportent des contraintes géométriques et physiques plus exploitables que les instructions en langage naturel, une nuance importante pour la calibration de politiques multi-tâches. L'apprentissage par imitation depuis des vidéos humaines est un axe de recherche actif, porté notamment par Google DeepMind avec RT-2, Physical Intelligence avec pi-0, et Meta FAIR. Des méthodes comme R3M ou VIP apprennent des représentations visuelles transférables depuis des vidéos humaines, mais CORE cible spécifiquement les états terminaux plutôt que les représentations d'observation générales, ce qui constitue sa distinction architecturale principale. Les benchmarks retenus, Meta-World et RoboTwin 2.0, sont reconnus sans être universellement adoptés, ce qui limite les comparaisons directes avec les résultats concurrents. Aucun partenariat industriel ni déploiement commercial n'est mentionné : il s'agit d'un preprint arXiv, dont les suites dépendront de réplications indépendantes et d'extensions vers des tâches plus complexes, notamment la manipulation en chaîne longue ou en environnements non structurés.

RechercheOpinion
1 source
Explorateurs, communicatifs et déployables : des agents incarnés guidés par la vision pour la manipulation mobile en monde ouvert
3arXiv cs.RO 

Explorateurs, communicatifs et déployables : des agents incarnés guidés par la vision pour la manipulation mobile en monde ouvert

Des chercheurs du laboratoire InternRobotics ont publié REAL, un framework agentique pour la manipulation mobile en environnement ouvert, accompagné du benchmark REAL-Bench couvrant 241 tâches réparties entre exploration active, distraction visuelle, manipulation d'objets articulés et désambiguïsation interactive de l'intention utilisateur. Le système combine des API d'environnement cohérentes entre simulation et réel, sans recourir à une perception oracle, et un simulateur d'utilisateur permettant une boucle homme-machine pour clarifier des instructions incomplètes. L'agent, entraîné via un pipeline hiérarchique associant apprentissage supervisé et renforcement en ligne, atteint un taux de réussite de 56,9% sur les tâches interactives, devançant des VLM commerciaux à code fermé sur ce même exercice. Déployé sur un robot mobile à double bras physique, il obtient 78,3% de réussite de bout en bout sur 60 épisodes réels, avec un transfert zero-shot vers des scénarios domestiques inédits. Le code est disponible sur github.com/InternRobotics/REAL. Ce résultat s'attaque directement à l'un des points faibles reconnus des agents robotiques actuels: la plupart des démonstrations s'appuient sur des instructions complètes fournies à l'avance ou sur des états privilégiés du simulateur, ce qui masque les difficultés réelles du déploiement, comme comprendre une consigne ambiguë ou explorer un environnement inconnu pour localiser un objet. En surpassant des modèles vision-langage-action commerciaux sur les tâches interactives, REAL apporte une preuve empirique que l'écart entre simulation et réalité peut être réduit sans capteurs ou informations privilégiées, un enjeu central pour les intégrateurs qui cherchent à déployer des robots domestiques ou logistiques capables de gérer des instructions humaines imparfaites plutôt que des scripts rigides. Le projet s'inscrit dans la lignée des travaux sur les agents vision-langage-action (VLA) tels que Pi-0 ou GR00T N2, mais se distingue en intégrant explicitement la dimension conversationnelle et exploratoire plutôt que la seule exécution de tâches préformulées. Les auteurs positionnent leur contribution face aux VLM propriétaires fermés, sans toutefois nommer précisément les modèles concurrents testés. Les prochaines étapes évoquées portent sur l'extension du benchmark et l'amélioration du raisonnement à vocabulaire ouvert sur des horizons d'exploration encore plus longs, avant d'envisager des déploiements pilotes à plus grande échelle.

RechercheActu
1 source
Au-delà de la généralisation du point de vue : ce qu'apportent les démonstrations multi-vues et comment les synthétiser pour la manipulation robotique
4arXiv cs.RO 

Au-delà de la généralisation du point de vue : ce qu'apportent les démonstrations multi-vues et comment les synthétiser pour la manipulation robotique

Une étude publiée sur arXiv (2603.26757v2, version révisée) montre par l'expérimentation que les démonstrations multi-vues améliorent réellement les politiques de manipulation robotique, et pas seulement leur robustesse aux changements de caméra. Des essais contrôlés, à arrière-plan fixe puis aléatoire, montrent un gain constant du taux de succès et de la généralisation, mais qui varie de façon non monotone selon le nombre de points de vue : plus de caméras n'est pas toujours mieux. Les données multi-vues repoussent en revanche la limite de mise à l'échelle des jeux mono-vue, en continuant d'élever le plafond de performance après sa saturation, car elles améliorent les représentations visuelles apprises, l'alignement de la tête d'action et réduisent le surapprentissage. Pour pallier leur rareté, les auteurs proposent RoboNVS, un cadre auto-supervisé qui synthétise des vidéos sous de nouveaux angles à partir d'une seule caméra. Ces résultats concernent directement les équipes qui entraînent des politiques de manipulation de type vision-langage-action (VLA), où la collecte de démonstrations reste le principal goulot d'étranglement en coût et en temps d'ingénieur. L'étude suggère qu'ajouter des caméras au-delà d'un certain point n'est pas rentable, et que des vidéos de synthèse générées par un modèle de génération de vues peuvent remplacer une partie de la collecte physique, y compris en environnement réel et pas seulement en simulation. Cela nuance l'idée reçue selon laquelle il suffirait d'accumuler des heures de téléopération pour progresser : la diversité des points de vue, bien dosée, compte davantage que le seul volume de données. Ce travail s'inscrit dans une recherche plus large sur les lois d'échelle des données en apprentissage robotique, où plusieurs axes sont explorés en parallèle : volume de démonstrations, diversité des tâches et des morphologies robotiques, et donc des points de vue caméra, un facteur resté jusqu'ici peu quantifié. En documentant à la fois le phénomène et un outil pour le corriger, la publication ouvre la voie à une intégration de la génération de vues synthétiques dans les pipelines de curation de données à grande échelle, avec des validations montrées en simulation et en environnement réel, mais sans calendrier de déploiement industriel ni partenaire robotique précisé à ce stade.

RecherchePaper
1 source