
TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles
Des chercheurs présentent TrAct, un framework de décision robotique fonde sur un modèle du monde et structure autour de trois composants, dans un article publie sur arXiv (2608.24101). VLAT (Vision-Language-Action-and-Track) prédit conjointement des actions candidates et les trajectoires visuelles associées a partir d'une observation et d'une instruction en langage naturel. TWM (track-conditioned world model) projette ensuite les conséquences visuelles futures de ces trajectoires. VLAC (vision-language reward model) note les résultats prédits pour sélectionner la meilleure paire action-trajectoire, qui est alors exécutée par le robot. Sur un nouveau benchmark de simulation baptise LIBERO-INTEGRAL et sur un bras Franka en conditions réelles, TrAct fait passer le taux de réussite de 27% a 55% en simulation et de 49% a 76% en réel, compare a la référence Pi-0.5. Le module TWM améliore par ailleurs la qualité de prédiction vidéo par rapport a un modèle du monde conditionne uniquement par l'action (AWM).
L'enjeu tient au problème cible: les actions robotiques sont spécifiques a chaque plateforme mécanique et ne correspondent que faiblement aux changements visuels dans l'image, ce qui limite leur usage comme signal de conditionnement pour les modèles du monde. Les tracks visuels, indépendants de l'embodiment, offrent un guide dense et spatialement précis pour anticiper l'action correcte, en s'insérant comme représentation intermédiaire entre perception, prédiction et contrôle. TrAct s'attaque ainsi a l'écart persistant entre performances en simulation et généralisation en conditions réelles, un point faible récurrent des architectures VLA. Les gains face a Pi-0.5, référence crédible du secteur, sont notables, mais le benchmark LIBERO-INTEGRAL est propose par les auteurs eux-mêmes et l'article n'a pas encore été relu par les pairs, ce qui appelle une reproduction indépendante avant toute conclusion définitive pour l'industrie.
Ces travaux s'inscrivent dans la vague de recherche sur les modèles Vision-Language-Action, aux cotes de Pi-0 et Pi-0.5 chez Physical Intelligence, GR00T N2 chez Nvidia ou Helix chez Figure AI. L'usage d'un bras Franka Emika comme plateforme d'évaluation reste un standard académique, loin des déploiements en usine revendiques par des acteurs comme Figure (Figure 03) ou Tesla (Optimus). Aucun acteur français ou européen, tel Wandercraft, Pollen Robotics ou Enchanted Tools, n'apparait dans cette étude, qui demeure a ce stade une contribution de recherche en preprint, sans partenariat industriel ni calendrier de déploiement annonce.
Dans nos dossiers




