Aller au contenu principal
RecherchearXiv cs.RO 

Learning in ImaginationLand : des politiques omnidirectionnelles via des modèles génératifs 3D (OP-Gen)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un préprint publié sur arXiv (2509.06191v2, version révisée) présente OP-Gen, une méthode qui exploite les modèles génératifs 3D récents, capables de reconstruire la forme complète d'un objet à partir de quelques images seulement, pour démultiplier artificiellement un jeu de données construit à partir d'une seule démonstration réelle. Une politique de contrôle dite omnidirectionnelle est ensuite entraînée entièrement dans cet environnement synthétique, sans données supplémentaires collectées sur le robot physique. Les auteurs valident l'approche sur plusieurs tâches de manipulation réelles: saisir des objets, ouvrir un tiroir et déposer un déchet dans une poubelle. Résultat central: le robot parvient à exécuter la tâche même en démarrant depuis des positions très éloignées de celles vues pendant la démonstration initiale, y compris depuis le côté opposé de l'objet. Comparé à des méthodes de référence utilisant d'autres techniques d'augmentation de données, OP-Gen affiche de meilleures performances sur ces tâches.

L'intérêt pratique tient au goulot d'étranglement que représente la collecte de démonstrations pour l'apprentissage par imitation et les politiques de type VLA: chaque tâche exige aujourd'hui des dizaines voire des centaines de démonstrations téléopérées pour couvrir des conditions de départ variées. En réduisant ce besoin à une seule démonstration réelle complétée par des variantes générées en 3D, OP-Gen s'attaque directement au problème de généralisation qui limite le déploiement de robots manipulateurs hors des conditions strictement observées à l'entraînement. Pour les intégrateurs industriels, cela ouvre la perspective de déployer des politiques robustes à moindre coût de collecte, sans dépendre systématiquement de pipelines de simulation complets ou de flottes de téléopération.

Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à remplacer la collecte physique de données par la synthèse générative, qu'il s'agisse de vidéo ou, ici, de reconstruction 3D d'objets, une piste explorée en parallèle par des systèmes de politiques génératives comme Pi-0 ou GR00T N2 pour la généralisation multi-tâches. La mention "replace" sur arXiv indique qu'il s'agit d'une version corrigée d'une soumission antérieure, signe d'un travail encore en évolution plutôt que d'un système finalisé ou commercialisé. Aucun partenariat industriel ni déploiement en production n'est mentionné à ce stade: il s'agit d'une avancée de recherche académique, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et l'intégration à des architectures de politique plus larges.

Dans nos dossiers

À lire aussi

Transformer des modèles vidéo en politiques robotiques généralistes
1arXiv cs.RO 

Transformer des modèles vidéo en politiques robotiques généralistes

Des chercheurs du MIT CSAIL ont publié fin mai 2026 un preprint (arXiv:2605.27817) présentant VERA, pour Video-to-Embodied Robot Action Model, une architecture qui transforme des modèles vidéo génératifs en politiques robotiques généralisables. L'idée centrale est de découpler deux composants qui, dans les approches récentes, sont souvent entraînés conjointement : un planificateur vidéo, qui prédit des séquences d'images représentant la complétion d'une tâche, et un modèle de dynamique inverse (IDM, Inverse Dynamics Model) spécifique à l'effecteur, qui traduit ces images en commandes motrices concrètes. L'IDM est conçu à partir du Jacobien cinématique du robot, ce qui le rend à la fois efficient en données et extensible aux espaces d'action de haute dimension. L'équipe démontre VERA sur deux configurations : manipulation zero-shot d'un bras Panda 7-DOF et réorientation de cube en dextérité avec une main Allegro à 16 degrés de liberté, sur des benchmarks simulés et réels. Ce découplage constitue une alternative architecturale directe aux fondations robotiques qui co-entraînent prédiction d'observations et prédiction d'actions sur des données étiquetées (action-labeled), comme le proposent Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. L'avantage opérationnel est concret : le planificateur vidéo reste agnostique à l'effecteur et peut être partagé entre plusieurs robots en changeant uniquement l'IDM associé, sans réentraîner le backbone vidéo. L'IDM peut lui-même être entraîné sur des données de self-play facilement disponibles, ce qui réduit la dépendance aux démonstrations humaines coûteuses. Les résultats zero-shot sur des tâches de manipulation réelle renforcent la thèse que le gap sim-to-real peut être atténué par une modélisation géométrique rigoureuse de l'effecteur. La course aux VLA (Vision-Language-Action models) et aux politiques cross-embodiment est aujourd'hui dominée par des laboratoires bien capitalisés : Physical Intelligence avec Pi-0 et Pi-0.5, NVIDIA avec GR00T N2, Figure AI avec Helix, et 1X Technologies. VERA positionne le MIT CSAIL dans ce paysage avec une approche plus modulaire que les architectures monolithiques en vogue. Il s'agit pour l'instant d'un preprint de recherche, sans déploiement industriel annoncé ni partenariat hardware mentionné. Les résultats sont disponibles sur vera.csail.mit.edu, et la prochaine étape naturelle serait une évaluation sur des effecteurs plus variés ou des environnements non structurés pour valider la généralisation à plus grande échelle.

RechercheOpinion
1 source
Main dans la boucle : améliorer les modèles VLA dextériques via correction interventionnelle transparente
2arXiv cs.RO 

Main dans la boucle : améliorer les modèles VLA dextériques via correction interventionnelle transparente

Une équipe de chercheurs a publié sur arXiv (réf. 2605.15157) une méthode baptisée Hand-in-the-Loop (HandITL), conçue pour corriger en temps réel les dérives des modèles Vision-Language-Action (VLA) lors de manipulation dextère bimanuelle à haute dimension. Le problème est structurel : dans des espaces d'action à grand nombre de degrés de liberté (DOF), les petites déviations de politique s'amplifient sur des horizons longs jusqu'à provoquer des défaillances en cascade. L'apprentissage par imitation interactive (IIL) permettait déjà d'affiner les politiques via des prises de contrôle humaines, mais son application aux mains robotiques multi-DOF se heurtait à un écart de commande critique : au moment où l'opérateur reprend la main, la configuration courante de la politique et celle de la téléopération divergent, générant des sauts de geste ("gesture jumps") brusques et déstabilisants. HandITL résout ce problème en interpolant de façon fluide l'intention corrective de l'opérateur avec l'exécution autonome en cours. Les chiffres publiés sont nets : réduction de 99,8 % du jitter lors des interventions, 87,5 % de défaillances de préhension en moins, temps moyen de complétion réduit de 19,1 %, et politiques affinées avec les données HandITL surpassant celles issues de la télé-opération standard de 19 % en moyenne sur trois tâches longues horizon. L'enjeu pour les équipes R&D et les intégrateurs est direct. Les VLA représentent aujourd'hui une piste sérieuse pour la généralisation des manipulateurs, mais leur déploiement opérationnel bute précisément sur l'accumulation d'erreurs dans les tâches contact-rich et multi-étapes, phénomène souvent désigné comme le "demo-to-reality gap". En rendant les interventions humaines non perturbantes, HandITL permet de collecter des données correctives de qualité pour le fine-tuning sans interrompre ni dégrader la trajectoire en cours. Cela modifie concrètement le rapport coût-utilité du human-in-the-loop pour des tâches de coordination bimanuelle ou d'utilisation d'outils nécessitant une précision millimétrique. La manipulation dextère à haute DOF reste l'un des défis les plus ouverts de la robotique généraliste. Des systèmes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ont démontré la viabilité des VLA sur des préhenseurs standards, mais les benchmarks sur mains à multiples doigts restent rares. HandITL s'inscrit dans un courant qui vise à étendre ces résultats aux architectures de mains complexes, où les DOF supplémentaires multiplient les capacités mais aussi les modes d'échec. Des approches comme HITL-TAMP ou les travaux sur residual policy correction ont exploré un terrain proche, sans toutefois cibler la manipulation bimanuelle dextère dans sa dimension la plus contrainte. L'article ne mentionne aucun partenaire industriel ni déploiement terrain, ce qui maintient ce travail dans le registre de la preuve de concept académique. Les suites naturelles seraient une validation sur des plateformes commerciales comme l'Allegro Hand ou la LEAP Hand, ainsi qu'une intégration dans des boucles d'entraînement continu pour des tâches d'assemblage de précision.

RechercheOpinion
1 source
ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?
3arXiv cs.RO 

ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?

Une équipe de chercheurs publie ImageWAM sur arXiv le 19 juin 2026 (arXiv:2606.19531), un cadre WAM (World Action Model) qui substitue la génération vidéo par l'édition d'images pour prédire les actions robotiques. L'argument central : les WAMs vidéo génèrent des tokens denses sur plusieurs trames futures, consomment de la capacité sur des détails sans rapport avec l'action, et propagent des erreurs lors des prédictions à longue portée. ImageWAM réoriente des modèles d'édition d'image préentraînés pour modéliser uniquement la transformation visuelle entre état courant et état cible. À l'inférence, le système ne décode pas la frame cible : il conditionne un expert d'action par flow-matching sur les caches KV produits pendant le débruitage de l'image éditée. Résultats mesurés : FLOPs réduits à 1/6 et latence à 1/4 par rapport aux WAMs vidéo, avec des performances supérieures aux baselines VLA standard et aux WAMs concurrents, sur simulateur comme en conditions réelles, sans préentraînement additionnel de la politique. Pour la communauté robotique, le résultat questionne une hypothèse fondamentale : la génération vidéo serait indispensable pour que le modèle "comprenne" le monde et déduise des actions pertinentes. ImageWAM montre que l'édition d'image constitue un prior mieux calibré, car elle cible les différences visuelles liées à l'action plutôt que la reconstruction temporelle complète d'une séquence. Les analyses d'attention confirment que les caches se focalisent sur les régions de changement pertinentes pour la tâche, pas sur le fond statique. Pour un intégrateur industriel, l'implication est directe : cycles d'inférence plus rapides et potentiellement matériel embarqué moins coûteux, sans sacrifice de performance selon les expériences rapportées. Les WAMs s'inscrivent dans la continuité des VLAs (Visual Language Action models), qui combinent perception visuelle, langage naturel et contrôle moteur dans un pipeline unifié. Des modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent sur des représentations visuelles denses pour généraliser les comportements robotiques entre tâches. ImageWAM se positionne comme une alternative frugale, réutilisant des capacités d'édition d'image préentraînées sans nécessiter de préentraînement vidéo de grande échelle. Le papier reste pour l'instant dans le domaine expérimental : aucun déploiement industriel ni partenaire terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes ou de manipulation industrielle, précisément les environnements où la latence d'inférence constitue un critère de qualification déterminant.

RechercheOpinion
1 source
Q-Learning par transport optimal pour le pilotage et l'accélération de politiques de flux
4arXiv cs.RO 

Q-Learning par transport optimal pour le pilotage et l'accélération de politiques de flux

Des chercheurs proposent une nouvelle méthode baptisée Optimal Transport Q-Learning (OTQL), destinée à affiner et accélérer les politiques robotiques basées sur des modèles de diffusion et de flow matching, très utilisées dans les modèles vision-langage-action (VLA). Publiée le 8 juillet sur arXiv, l'étude combine apprentissage par renforcement (RL) post-entraînement et transport optimal conditionné par l'avantage, pour corriger les comportements sous-optimaux de ces politiques sans recourir à la distillation, coûteuse en calcul. Avec un budget d'interaction limité à seulement 50 à 60 épisodes, la méthode fait grimper le taux de succès moyen de politiques mono-tâche de 36 % à 86 %, et celui d'un modèle VLA pré-entraîné de 38 % à 76 %, tout en réduisant de 70 % le nombre d'étapes d'inférence nécessaires pour générer une action. Les tests ont été menés à la fois en simulation et sur des tâches robotiques réelles. Ces résultats s'attaquent à deux limites bien connues des politiques de diffusion et de flow matching pour la robotique: leur dépendance à des démonstrations de haute qualité, souvent rares ou coûteuses à collecter, et leur lenteur d'inférence, qui freine leur déploiement temps réel sur des robots physiques. En démontrant qu'un nombre restreint d'épisodes d'expérience réelle suffit à corriger significativement les échecs sous décalage de distribution, OTQL apporte un début de réponse à l'écart persistant entre démonstrations en laboratoire et performance en conditions réelles, un problème central pour les intégrateurs qui cherchent à fiabiliser des modèles VLA du type de ceux utilisés dans les bras manipulateurs ou les humanoïdes actuels. La réduction de 70 % des étapes d'inférence est également notable pour les décideurs B2B, car elle touche directement au coût de calcul embarqué et à la latence, deux freins concrets à la commercialisation à grande échelle de politiques génératives sur robot. Les politiques de diffusion et de flow matching se sont imposées ces dernières années comme l'approche dominante pour capturer des distributions de trajectoires multimodales dans les tâches de manipulation robotique, notamment dans les architectures VLA. Mais leur adoption industrielle butait jusqu'ici sur deux verrous: l'accélération de l'inférence, généralement traitée par des méthodes de distillation gourmandes en ressources de simulation, et l'amélioration post-déploiement, qui nécessite habituellement de nouvelles données de démonstration coûteuses à produire. OTQL s'inscrit dans une lignée de travaux cherchant à exploiter le RL pour du post-entraînement léger plutôt que du réentraînement complet. Les auteurs ne précisent pas encore de calendrier de transfert vers des plateformes commerciales, mais la méthode ouvre une piste pour que les opérateurs de flottes robotiques affinent leurs politiques directement à partir de l'expérience de terrain, sans dépendre de nouveaux cycles de collecte de données coûteux.

RechercheActu
1 source