Aller au contenu principal
TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles
RecherchearXiv cs.RO 

TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent TrAct, un framework de décision robotique fonde sur un modèle du monde et structure autour de trois composants, dans un article publie sur arXiv (2608.24101). VLAT (Vision-Language-Action-and-Track) prédit conjointement des actions candidates et les trajectoires visuelles associées a partir d'une observation et d'une instruction en langage naturel. TWM (track-conditioned world model) projette ensuite les conséquences visuelles futures de ces trajectoires. VLAC (vision-language reward model) note les résultats prédits pour sélectionner la meilleure paire action-trajectoire, qui est alors exécutée par le robot. Sur un nouveau benchmark de simulation baptise LIBERO-INTEGRAL et sur un bras Franka en conditions réelles, TrAct fait passer le taux de réussite de 27% a 55% en simulation et de 49% a 76% en réel, compare a la référence Pi-0.5. Le module TWM améliore par ailleurs la qualité de prédiction vidéo par rapport a un modèle du monde conditionne uniquement par l'action (AWM).

L'enjeu tient au problème cible: les actions robotiques sont spécifiques a chaque plateforme mécanique et ne correspondent que faiblement aux changements visuels dans l'image, ce qui limite leur usage comme signal de conditionnement pour les modèles du monde. Les tracks visuels, indépendants de l'embodiment, offrent un guide dense et spatialement précis pour anticiper l'action correcte, en s'insérant comme représentation intermédiaire entre perception, prédiction et contrôle. TrAct s'attaque ainsi a l'écart persistant entre performances en simulation et généralisation en conditions réelles, un point faible récurrent des architectures VLA. Les gains face a Pi-0.5, référence crédible du secteur, sont notables, mais le benchmark LIBERO-INTEGRAL est propose par les auteurs eux-mêmes et l'article n'a pas encore été relu par les pairs, ce qui appelle une reproduction indépendante avant toute conclusion définitive pour l'industrie.

Ces travaux s'inscrivent dans la vague de recherche sur les modèles Vision-Language-Action, aux cotes de Pi-0 et Pi-0.5 chez Physical Intelligence, GR00T N2 chez Nvidia ou Helix chez Figure AI. L'usage d'un bras Franka Emika comme plateforme d'évaluation reste un standard académique, loin des déploiements en usine revendiques par des acteurs comme Figure (Figure 03) ou Tesla (Optimus). Aucun acteur français ou européen, tel Wandercraft, Pollen Robotics ou Enchanted Tools, n'apparait dans cette étude, qui demeure a ce stade une contribution de recherche en preprint, sans partenariat industriel ni calendrier de déploiement annonce.

À lire aussi

Discussion sur la prédiction de trajectoires conditionnelles
1arXiv cs.RO 

Discussion sur la prédiction de trajectoires conditionnelles

Des chercheurs ont déposé en avril 2026 sur arXiv (référence 2604.18126) une nouvelle méthode de prédiction de trajectoire conditionnelle baptisée CiT, pour Cross-time-domain intention-interactive method for conditional Trajectory prediction. L'objectif est de permettre à un robot évoluant parmi des humains ou d'autres agents mobiles de prédire précisément leurs trajectoires futures, en tenant compte non seulement de leurs interactions sociales mutuelles, mais aussi du mouvement propre du robot lui-même. Le système génère un ensemble de trajectoires candidates pour chaque agent environnant, en fonction des intentions de déplacement possibles de l'ego agent. Testé sur plusieurs benchmarks standards du domaine, CiT dépasse selon ses auteurs les méthodes de l'état de l'art existantes. La distinction centrale de CiT par rapport aux approches concurrentes réside dans l'intégration explicite du mouvement de l'ego agent dans la boucle de prédiction. La quasi-totalité des méthodes existantes modélisent les interactions sociales à partir d'informations statiques, ignorant le fait que le robot lui-même modifie le comportement des agents qui l'entourent. CiT s'inspire du concept de "théorie de l'esprit" en robotique sociale : chaque agent anticipe les intentions des autres pour ajuster les siennes. Techniquement, la méthode opère une analyse conjointe des intentions comportementales sur plusieurs domaines temporels, permettant aux informations d'interaction d'un domaine de corriger et affiner les estimations d'intention de l'autre. Cette complémentarité temporelle est présentée comme le levier principal du gain de performance. Pour des intégrateurs de systèmes de navigation autonome ou de robots collaboratifs (cobots), cette capacité à modéliser la réciprocité comportementale est directement exploitable dans des modules de planification de chemin et de contrôle. La prédiction de trajectoire conditionelle est un champ de recherche en pleine activité, alimenté par les besoins des véhicules autonomes et de la robotique de service. Des équipes comme Waymo, NVIDIA (avec son framework Isaac Perceptor) ou des laboratoires académiques comme Stanford et ETH Zurich ont posé les bases de la modélisation sociale de trajectoires. CiT s'inscrit dans cette lignée en ciblant explicitement les systèmes d'interaction humain-robot, un segment distinct des systèmes véhiculaires. L'article reste à ce stade un preprint non évalué par les pairs, sans données de déploiement réel ni validation hors benchmarks publics, ce qui limite l'interprétation des résultats annoncés. Les prochaines étapes naturelles seraient une validation en conditions réelles et une intégration dans des architectures ROS2 ou similaires.

RecherchePaper
1 source
3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D
2arXiv cs.RO 

3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D

Papier académique en robotique (VLA hiérarchique), pas de named companies commerciales ni d'acteur FR/EU à mettre en avant ici. Je rédige directement l'article. Des chercheurs du laboratoire DAVIAN Robotics présentent 3D HAMSTER, un nouveau framework pour les modèles Vision-Langage-Action (VLA) hiérarchiques utilisés en manipulation robotique, détaillé dans un preprint arXiv (2606.31329v1). Ces architectures séparent la planification de haut niveau, confiée à un modèle vision-langage (VLM), du contrôle bas niveau exécuté par une politique dédiée. Les approches récentes font produire au VLM des trajectoires 2D de l'effecteur terminal pour guider cette politique, mais les politiques de pointe travaillent en réalité dans un espace métrique 3D à partir de nuages de points. Faute de profondeur, chaque point de la trajectoire 2D doit hériter de la profondeur de la surface visible sous lui dans la scène, ce qui déforme géométriquement le chemin prédit. 3D HAMSTER corrige ce défaut en dotant le VLM d'un encodeur de profondeur dédié et d'un objectif de reconstruction dense de la profondeur, afin qu'il prédise directement des séquences de points de passage en 3D, ensuite injectées dans une politique bas niveau opérant sur nuages de points. Cette correction cible un goulot d'étranglement précis de la génération actuelle de VLA hiérarchiques: la conversion 2D vers 3D introduisait un bruit géométrique qui limitait la fiabilité des gestes de manipulation, en particulier lors de changements d'apparence de la scène ou de conditions inédites (langage, position spatiale, visuel). Sur les trois bancs d'essai testés (prédiction de trajectoire 3D, simulation, manipulation réelle), 3D HAMSTER dépasse à la fois des VLM propriétaires état de l'art et les méthodes concurrentes guidées en 2D, avec les écarts les plus marqués justement sur ces conditions de généralisation difficile. Ce résultat va dans le sens d'une hypothèse clé du secteur: une bonne partie de l'écart entre démonstrations en laboratoire et déploiement réel des robots manipulateurs tient moins à la politique de contrôle elle-même qu'à la qualité du signal de planification qui la guide. Le travail s'inscrit dans la lignée des architectures VLA hiérarchiques qui ont émergé ces deux dernières années pour améliorer la généralisation des robots manipulateurs, en s'appuyant sur des politiques bas niveau désormais matures en perception 3D par nuages de points. En comparant directement sa méthode à des VLM propriétaires non nommés publiquement dans le résumé, l'équipe positionne 3D HAMSTER comme une alternative open, avec une page projet dédiée (davian-robotics.github.io/3D_HAMSTER) où code et données devraient être publiés pour permettre une reproduction indépendante des résultats.

RechercheActu
1 source
AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM
3arXiv cs.RO 

AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM

AntiGrounding, un framework de sélection visuelle d'actions pour la manipulation robotique guidée par des modèles vision-langage, est détaille dans une version mise a jour d'un article arXiv (2506.12374v3). Chaque trajectoire courte retenue après filtrage de faisabilité sert a la fois de plan de mouvement exécutable et de prompt visuel rendu, évalué par un question-réponse visuel multi-vues qui note sécurité, alignement avec la tache, efficacité et plausibilité physique. Ces scores, agrégés par fusion pondérée des vues, guident les propositions de trajectoire suivantes; des contrôles séparés gèrent orientation et pince, et un jumeau numérique valide les segments choisis avant exécution par le robot réel. Sur huit taches de manipulation en conditions réelles, AntiGrounding associe a un seul évaluateur, désigne GPT-6 Astra, atteint 71,25% de réussite, contre 50,00% pour le modèle pi0.5 et 47,50% pour une base de référence de type PIVOT évaluée avec le même VLM. L'intérêt pour le secteur tient a l'alternative proposee aux modèles VLA généralistes entraines de bout en bout, comme pi0.5, GR00T N2 ou Helix, qui associent directement instruction et action: ici le VLM sert d'évaluateur dans une boucle de recherche et de notation de trajectoires géométriques, approche plus auditable pour la sécurité avant un déploiement industriel. L'écart avec pi0.5 (50,00%) sur les mêmes huit taches rappelle que les politiques VLA généralistes restent en dessous des attentes en conditions réelles, nuançant l'idée d'un sim-to-real déjà résolu a grande échelle. Les auteurs précisent toutefois que la performance reste bornée par la fidélité du jumeau numérique et par les aléa de l'interaction physique: il s'agit d'un travail de recherche publie sur arXiv, non d'un produit commercialise ni déployé en usine. Le travail s'inscrit dans la lignée des recherches combinant grands modèles vision-langage et planification robotique, aux cotes de politiques VLA comme pi0 et pi0.5 de Physical Intelligence ou GR00T N2 de NVIDIA, et se distingue de la méthode concurrente PIVOT en confiant au VLM un rôle de juge plutôt que de générateur direct d'action. Aucun acteur français ou européen, tel Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools, n'apparait dans ces travaux, qui restent pour l'instant un résultat de laboratoire sur huit taches, sans calendrier de pilote industriel annonce.

RechercheActu
1 source
Contrôle sécurisé par prédiction intégrale de trajectoire (MPPI) avec logique temporelle de signaux
4arXiv cs.RO 

Contrôle sécurisé par prédiction intégrale de trajectoire (MPPI) avec logique temporelle de signaux

La méthode s'appelle safety-aware-stl-mppi et vient d'être décrite dans une prépublication arXiv référencée 2608.23972v1, mise en ligne en août 2026. Elle s'attaque à la planification de trajectoire sous contrainte de sécurité pour des missions robotiques critiques en temps et régies par des spécifications complexes, formulées en logique temporelle de signaux (Signal Temporal Logic, STL). Le principe consiste à traduire des formules STL en temps discret sous forme de fonctions barrières de contrôle (control barrier functions, CBF) variables dans le temps, intégrées ensuite dans un contrôleur MPPI (model predictive path integral), un algorithme de planification par échantillonnage massivement parallélisable et peu coûteux en calcul. Les auteurs valident l'approche sur quatre scénarios artificiels de planification pour un rover martien, avec des environnements et des fonctions de coût variés, puis sur une expérience de pilotage de quadricoptère simulée dans NVIDIA Isaac Lab. Comparée à plusieurs variantes de MPPI utilisées comme référence, la méthode affiche selon les auteurs une sécurité et une efficacité systématiquement supérieures, sans que l'article ne fournisse de chiffres précis de temps de cycle ou de taux de réussite, ce qui en limite pour l'instant la portée à une démonstration de faisabilité académique plutôt qu'à un résultat chiffré comparable en production. L'enjeu pour les intégrateurs robotiques est de concilier deux mondes qui cohabitent mal aujourd'hui : les méthodes formelles issues de la logique temporelle, rigoureuses mais généralement trop lourdes en calcul (programmation en nombres entiers mixtes) pour tourner en temps réel, et les contrôleurs par échantillonnage comme MPPI, rapides et déjà utilisés dans les véhicules autonomes ou les robots à pattes, mais peu adaptés à exprimer des règles de mission complexes (ordre de passage entre zones, délais, exclusions conditionnelles). En logeant les contraintes STL directement dans la boucle d'échantillonnage via des CBF, l'approche promet de rapprocher les garanties de sécurité formelles du temps réel embarqué, un enjeu pertinent pour les robots spatiaux, drones et véhicules autonomes soumis à des cahiers des charges de mission séquentiels. Le MPPI trouve son origine dans le contrôle optimal stochastique appliqué à la robotique mobile et aux véhicules autonomes, et NVIDIA l'exploite déjà via sa plateforme de simulation Isaac Lab, utilisée ici pour le test du quadricoptère. La logique temporelle de signaux, elle, provient de la vérification formelle des systèmes cyber-physiques, tandis que les fonctions barrières de contrôle sont un outil classique de garantie de sécurité pour systèmes non linéaires. Ce travail se positionne donc comme un pont entre ces trois traditions, comparé uniquement à d'autres variantes de MPPI. Il reste au stade de prépublication et d'expérimentation en simulation, sans acteur industriel ni calendrier de déploiement matériel annoncé.

RecherchePaper
1 source