
VOMMI : collecte et exploitation de démonstrations portables pour la manipulation mobile
Des chercheurs présentent VOMMI (Visual-Odometry-Conditioned Mobile Manipulation Interface), un cadre de collecte de démonstrations portables et d'apprentissage pour la manipulation mobile, publié sur arXiv. Le système synchronise une vue « corps » et une vue « main » en RGB pour capturer à la fois le contexte de navigation et les interactions locales avec les objets, sans calibration de correspondance cinématique entre humain et robot. Deux briques techniques le composent. R2-VO affine hors ligne les trajectoires de démonstration à partir d'ancres géométriques parcimonieuses, puis produit des tokens de mouvement local causaux sur plusieurs horizons de prédiction. Un adaptateur résiduel par groupes d'actions injecte ces tokens uniquement dans la branche de base mobile du modèle vision-langage-action (VLA). Les expériences reposent sur 500 trajectoires portables par tâche, dont 75 réservées à l'évaluation RGB-VO, et sur 200 démonstrations robot servant de référence. La politique post-entraînée uniquement sur données portables affiche une erreur de vitesse de base inférieure de 18,2 % à celle d'une politique entraînée sur démonstrations robot, avec une précision de translation de l'effecteur comparable. La reconstruction hors ligne réduit l'erreur de trajectoire absolue de 24,6 % en moyenne pour les flux corps et main, par rapport au meilleur point de comparaison évalué pour chaque flux. Sur trois tâches réelles, le système complet gagne 8,3 points de succès moyen face à OpenPI 0.5.
Pour les intégrateurs et les équipes data, l'enjeu est le coût de collecte. La téléopération et les dispositifs spécialisés bardés de capteurs restent le goulot d'étranglement des politiques de manipulation mobile, et une capture portable, sans robot et avec une simple caméra RGB, élargirait fortement le volume de démonstrations accessible. Le résultat le plus parlant est l'erreur de vitesse de base : la navigation est précisément la dimension où l'odométrie visuelle brute dérive et où l'on pouvait craindre que des données humaines transfèrent mal. Ici, elles font mieux que les données robot sur cette métrique, ce qui suggère que le conditionnement par mouvement visuel compense le défaut de supervision. Il faut toutefois rester prudent : le gain de 8,3 points sur OpenPI 0.5 est modeste, mesuré sur seulement trois tâches, et les travaux ne précisent pas la nature des tâches ni les intervalles de confiance dans ce résumé. Il s'agit d'un résultat de laboratoire, sans déploiement industriel.
Le contexte est celui de la pénurie de données pour l'intelligence incarnée. Des interfaces portables comme UMI ont montré qu'on pouvait collecter des démonstrations de manipulation sans robot, mais elles se limitent surtout à la manipulation de table, sans la composante de déplacement de la base. VOMMI étend cette logique à la manipulation mobile, en s'appuyant sur la famille de politiques OpenPI (basée sur Pi-0) comme référence. Les acteurs concurrents du côté des VLA, dont Physical Intelligence, Figure avec Helix ou Nvidia avec GR00T, misent eux aussi sur des corpus massifs mêlant vidéo humaine et données robot. Les suites logiques seraient une validation sur davantage de tâches et de morphologies de robots, ainsi qu'une mesure du compromis entre volume de données portables et qualité de reconstruction hors ligne.
Dans nos dossiers




