Aller au contenu principal
Distiller un traqueur 3D centré sur le monde en politiques vision-langage-action
RecherchearXiv cs.RO 

Distiller un traqueur 3D centré sur le monde en politiques vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient Track4Action, une méthode d'entraînement pour les politiques vision-langage-action (VLA) qui pilotent des robots, mise en ligne sur arXiv le 5 août 2026. Le problème visé : les labels d'action indiquent quelles commandes imiter, mais pas comment elles transforment la scène en 3D. Un module nommé Track4World distille cette information manquante depuis un tracker 3D figé, en encodant géométrie, mouvement et visibilité captés durant la démonstration ; des "track queries" apprenables retrouvent cette signature dans les états cachés du modèle VLA courant et conditionnent une tête d'action par flow-matching, sans utiliser le clip ni le tracker au moment du déploiement. Résultat : 82,3% de réussite en zero-shot sur LIBERO-Plus (+7,6 points face à une variante sans alignement, +3,0 face à LaMP), 80,44% et 81,48% sur RoboTwin 2.0 selon la configuration, et 67,5% de réussite moyenne sur quatre tâches physiques bimanuelles réelles, soit 25 points de mieux que la variante sans alignement.

Ce travail touche un point sensible de la robotique IA actuelle : transférer la richesse d'une démonstration vidéo (mouvement, occlusions, changements de caméra) vers une politique qui, en conditions réelles, ne verra jamais cette vidéo. La plupart des VLA s'entraînent seulement sur des paires observation-action, en ignorant la dynamique 3D implicite des trajectoires démontrées. Le gain de 25 points sur les tâches bimanuelles physiques, bien supérieur à ceux mesurés en simulation, suggère que cette supervision privilégiée devient d'autant plus utile que la manipulation se complexifie, notamment pour les tâches à deux bras qui exigent une meilleure compréhension géométrique de la scène.

Track4Action se compare à deux références directes : une variante "alignment-free" du même pipeline, privée de la distillation du tracker, et LaMP, une méthode antérieure de conditionnement par représentations de mouvement. Le travail s'inscrit dans la lignée des architectures VLA à flow-matching, popularisées par des modèles comme Pi-0 ou GR00T N2, en y ajoutant une brique de supervision par tracker 3D. Les auteurs valident leur approche en simulation, sur LIBERO-Plus et RoboTwin 2.0, et sur banc physique avec des manipulations bimanuelles réelles, une combinaison encore rare dans la littérature VLA. Une page projet est en ligne, mais aucun code ni poids de modèle n'est mentionné comme publié à ce stade, ce qui limite pour l'instant la reproductibilité par des tiers.

À lire aussi

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
1arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde
2arXiv cs.RO 

DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde

Une équipe de recherche publie DIDO (arXiv 2609.15570, septembre 2026), une méthode de distillation pour les World Action Models (WAM), ces systèmes qui utilisent des modèles de génération vidéo pour prédire la dynamique visuelle future et piloter la manipulation robotique. Le problème de départ est la latence : le débruitage itératif de ces modèles vidéo est incompatible avec un contrôle en boucle fermée. Les auteurs montrent empiriquement que le contenu visuel converge à des vitesses différentes durant le débruitage : le fond statique de la scène se forme dès les premières étapes, tandis que la pince du robot et l'objet manipulé restent flous, leur dynamique d'interaction n'émergeant que lors des étapes suivantes. Tronquer naïvement un modèle multi-étapes à une seule étape préserve donc la structure de la scène mais perd l'information d'interaction, la plus critique pour la manipulation. DIDO combine une distillation par appariement de distribution avec un guidage centré sur l'interaction : des tokens de raisonnement visuel supervisés par boîtes englobantes modélisent la pince, l'objet et leur interaction, et les représentations de l'objet cible sont alignées, sur plusieurs couches, avec les caractéristiques d'un encodeur DINOv3 préentraîné. Résultat : 99,0% de réussite sur LIBERO, 76,6% sur LIBERO-Plus et 92,0% sur RoboTwin, en une seule étape de débruitage. Pour les intégrateurs et chercheurs en robotique, l'enjeu est concret : les modèles vidéo-génératifs produisent des prédictions visuelles de qualité, mais leur coût de calcul itératif les rend souvent inadaptés au temps réel. En ramenant le débruitage à une seule étape sans sacrifier la dynamique gripper-objet, DIDO s'attaque à un des obstacles qui séparent les démonstrations de manipulation en simulation d'un déploiement réactif. Le travail met aussi en garde contre la distillation naïve des WAM : réduire le nombre d'étapes sans traitement spécifique dégrade précisément l'information la plus utile à la tâche. DIDO s'inscrit dans la lignée des World Action Models, qui détournent des générateurs vidéo pour servir de moteur de prédiction à des politiques de manipulation, en s'appuyant sur des encodeurs visuels auto-supervisés comme DINOv3 de Meta, utilisé ici comme signal d'enseignement. Les résultats restent validés sur des benchmarks de simulation standards du secteur (LIBERO, LIBERO-Plus, RoboTwin), complétés par des essais réels sur des tâches longues et des scénarios de généralisation. Aucun partenariat industriel ni date de disponibilité n'est mentionné : il s'agit à ce stade d'une publication de recherche, pas d'un produit livré.

RecherchePaper
1 source
Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action
3arXiv cs.RO 

Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action

Publié le 25 août 2026 sur arXiv (référence 2608.23478), un article de recherche présente INDI (Intention Distillation), une méthode d'entraînement pour les décodeurs d'action des modèles Vision-Language-Action (VLA) en robotique, dominés aujourd'hui par le clonage de comportement, qui indique la commande démontrée sans expliciter l'objectif poursuivi. Pendant l'entraînement, un VLM enseignant figé interprète chaque segment démontré à partir de l'observation, de l'instruction, d'un résumé d'action et de la vidéo d'exécution ; le VLA déployé récupère cette représentation d'intention à une couche intermédiaire du décodeur. Sur le benchmark SimplerEnv-Bridge, le modèle GR00T-N1.7 passe de 64,3 % à 84,7 % de réussite ; sur RoboCasa Kitchen, sa baseline progresse de 64,1 % à 70,3 %, avec des gains similaires relevés sur Pi-0.5. En conditions réelles, le taux de réussite moyen grimpe de 62,0 % à 68,7 %, avec un bond de jusqu'à 12 points de pourcentage sur les tâches à horizon long. Ces résultats visent une limite structurelle connue du clonage de comportement, qui capture le geste démontré mais pas la raison d'être du comportement, ce qui dégrade la généralisation sur les tâches longues ou multi-étapes. Le fait que les gains les plus marqués apparaissent justement sur ces tâches à horizon long est significatif pour les intégrateurs, car c'est là que les pipelines VLA actuels échouent le plus souvent hors démonstration scénarisée. La méthode ne requiert ni capteur ni collecte de données additionnelle : elle exploite des signaux déjà disponibles via un VLM enseignant utilisé seulement à l'entraînement, sans surcoût d'inférence au déploiement, et reste transposable à d'autres architectures VLA. Le travail prolonge des approches qui enrichissaient le clonage de comportement avec des frames futures, des observations latentes ou des trajectoires, jugées insuffisantes car elles captent une réalisation du futur, non l'objectif sémantique partagé du comportement. INDI est testé sur des modèles VLA de référence déjà largement utilisés, GR00T-N1.7 et Pi-0.5, ce qui en fait une couche d'entraînement complémentaire plutôt qu'un modèle concurrent. La publication reste à ce stade un article arXiv sans revue par les pairs formelle ni annonce de déploiement industriel ; la communauté robotique attend désormais une reproduction indépendante des résultats et une extension à d'autres familles de VLA.

RechercheActu
1 source
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
4arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source