Aller au contenu principal
MIRTH : raisonnement par information mutuelle avec pôles temporels pour agents vision-langage-action
RecherchearXiv cs.RO 

MIRTH : raisonnement par information mutuelle avec pôles temporels pour agents vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente MIRTH (Mutual-Information Reasoning with Temporal Hubs), un framework qui vient se greffer sur un modèle VLA (vision-language-action) préentraîné pour améliorer le contrôle robotique. Le système ajoute trois briques techniques : des "hubs" de mémoire temporelle à double échelle qui compressent l'historique long terme de la scène et les tendances de mouvement court terme en embeddings compacts, des tokens de raisonnement latent optimisés via un objectif d'information mutuelle pour aligner le contexte multimodal avec les trajectoires d'action, et un schéma de décodage d'action parallèle qui remplace la génération autorégressive classique par une prédiction vectorielle simultanée pour accélérer le débit de contrôle. Les auteurs annoncent des résultats state-of-the-art sur le benchmark de simulation LIBERO ainsi que sur une plateforme réelle LeRobot, avec des capacités émergentes de récupération d'erreur. Code et jeux de données sont publiés sur GitHub (kiva12138/mirth).

L'enjeu ciblé est bien identifié dans la littérature robotique actuelle : les architectures VLA à trame unique souffrent d'une myopie temporelle qui ignore la dynamique passée de la scène, d'un fossé de raisonnement entre instructions de haut niveau et commandes moteur de bas niveau, et d'une latence d'inférence due au décodage scalaire autorégressif. Ces limites freinent le déploiement de modèles VLA génériques face aux systèmes spécialisés dans l'industrie. À noter toutefois : la validation "monde réel" repose sur LeRobot, une plateforme robotique low-cost destinée à la recherche, loin des contraintes d'un bras industriel ou d'un humanoïde en usine ; les gains restent donc à confirmer à plus grande échelle avant toute traduction en déploiement B2B.

MIRTH s'inscrit dans la lignée des travaux type RT-2, Pi-0 ou GR00T N2, qui cherchent à transférer les connaissances sémantiques du web vers le contrôle physique. La contribution ici est ciblée sur la mémoire temporelle et l'efficacité du décodage plutôt que sur l'échelle des données d'entraînement, une direction complémentaire aux approches des grands laboratoires. La publication du code sur GitHub ouvre la voie à des réplications indépendantes, étape nécessaire pour évaluer la robustesse réelle de ces gains annoncés.

À lire aussi

Raisonnement continu pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Raisonnement continu pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (2606.00229) une architecture appelée Continuous Reasoning for VLA, qui remplace le langage naturel comme médium de raisonnement pour les politiques robotiques par un espace latent gaussien continu. Le problème est fondamental : le texte opère à la granularité d'une tâche entière, tandis qu'une politique VLA (Vision-Language-Action) doit sélectionner des actions à une échelle temporelle bien plus fine. Le modèle génère d'abord un ensemble structuré de "pensées continues" sous forme de vecteurs gaussiens, puis les réutilise comme contexte partagé pour la génération d'actions par chunks. L'entraînement repose sur un objectif de vérification croisée : un teacher EMA (exponential moving average) doit consommer le raisonnement du modèle étudiant pour prédire les actions cibles, forçant le latent à rester transférable et vérifiable entre instances. Sur robots réels, l'architecture améliore le taux de succès moyen par sous-tâche de 40,4 % sur TX-G2 (variante compatible AgiBot G2) et de 26,3 % sur HSR (Human Support Robot de Toyota), comparé à π0.5 de Physical Intelligence. Ces résultats contredisent une hypothèse répandue : ajouter des tokens de raisonnement textuel via chain-of-thought ou sous-objectifs explicites améliore le contrôle robotique. Les auteurs montrent que ce raisonnement textuel devient facilement un raccourci interne au modèle, efficace sur les comportements vus en entraînement mais peu généralisable. Un médium de raisonnement utile doit être partageable entre instances de modèle et vérifiable via l'amélioration du contrôle aval, deux propriétés que le texte satisfait mal à l'échelle de l'action. La comparaison directe avec π0.5 positionne ce travail en réponse à Physical Intelligence, acteur de référence dans l'espace VLA. Les plateformes testées (AgiBot G2 et HSR) couvrent la robotique de service et industrielle légère, pas uniquement les humanoïdes à fort investissement comme Figure 03 ou Optimus Gen 3. D'autres architectures concurrentes, dont GR00T N2 de NVIDIA et Helix de Figure AI, misent sur des représentations latentes pour améliorer le transfert sim-to-real, mais restent davantage orientées production que recherche fondamentale. Il s'agit pour l'instant d'un résultat académique, sans annonce de pilote commercial ni de déploiement industriel.

RechercheOpinion
1 source
Forçage temporel : alignement de représentation 4D pour les modèles vision-langage-action
2arXiv cs.RO 

Forçage temporel : alignement de représentation 4D pour les modèles vision-langage-action

Des chercheurs présentent Temporal Forcing, une méthode d'alignement de représentation 4D pour les modèles vision-langage-action (VLA), détaillée dans un article publié sur arXiv (2608.30643v1) le 30 août 2026 ou aux alentours. Le système ajoute une voie dédiée à l'historique des observations, permettant à un modèle VLA standard de condenser cet historique en représentations latentes tenant compte du temps. Ces représentations sont ensuite alignées avec les caractéristiques géométriques extraites par un modèle de fondation 4D préentraîné, capable de capturer l'évolution d'une scène 3D dans le temps de façon géométriquement cohérente. Sur le benchmark LIBERO, Temporal Forcing atteint un taux de réussite de 98,8%, soit 2,2 points de plus que son modèle de base. Sur une tâche physique de placement d'objet caché ("hidden-placement"), le taux de réussite complet de la tâche passe de 20,0% à 43,3%. Le code source doit être rendu public, sans date de disponibilité précisée dans l'article. Cette avancée cible un problème connu des VLA actuels: la confusion entre états visuellement similaires (observation aliasing) et la difficulté à gérer des manipulations longues, deux limites qui découlent du fait que les représentations 3D classiques ne capturent qu'un instant figé de la scène, sans mémoire de son évolution. En démontrant qu'ajouter une dimension temporelle à l'alignement géométrique améliore concrètement le taux de succès sur une tâche physique réelle, et pas seulement en simulation, ces résultats nuancent l'idée que l'alignement 3D seul suffirait à rapprocher les VLA d'une robustesse proche de l'humain. Pour les intégrateurs et équipes de recherche en robotique manipulatrice, cela suggère qu'exploiter des modèles de fondation 4D préentraînés peut devenir un ingrédient standard pour améliorer la mémoire de contexte des politiques d'action, sans changer l'architecture de base du modèle VLA. Ce travail s'inscrit dans la lignée des méthodes récentes de VLA qui alignent leurs représentations internes sur la géométrie de scène 3D pour améliorer la manipulation, une approche qui a gagné du terrain mais bute sur les tâches à long horizon. Temporal Forcing se positionne comme une extension de ces approches géométriques plutôt qu'une rupture architecturale, en s'appuyant sur un modèle de fondation 4D externe déjà entraîné. Les auteurs annoncent la publication future du code, ce qui permettra à la communauté de valider les résultats sur d'autres benchmarks que LIBERO et la tâche physique testée, mais aucun calendrier de déploiement industriel ni de partenariat n'est mentionné à ce stade.

RechercheActu
1 source
Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action
3arXiv cs.RO 

Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action

Publié le 25 août 2026 sur arXiv (référence 2608.23478), un article de recherche présente INDI (Intention Distillation), une méthode d'entraînement pour les décodeurs d'action des modèles Vision-Language-Action (VLA) en robotique, dominés aujourd'hui par le clonage de comportement, qui indique la commande démontrée sans expliciter l'objectif poursuivi. Pendant l'entraînement, un VLM enseignant figé interprète chaque segment démontré à partir de l'observation, de l'instruction, d'un résumé d'action et de la vidéo d'exécution ; le VLA déployé récupère cette représentation d'intention à une couche intermédiaire du décodeur. Sur le benchmark SimplerEnv-Bridge, le modèle GR00T-N1.7 passe de 64,3 % à 84,7 % de réussite ; sur RoboCasa Kitchen, sa baseline progresse de 64,1 % à 70,3 %, avec des gains similaires relevés sur Pi-0.5. En conditions réelles, le taux de réussite moyen grimpe de 62,0 % à 68,7 %, avec un bond de jusqu'à 12 points de pourcentage sur les tâches à horizon long. Ces résultats visent une limite structurelle connue du clonage de comportement, qui capture le geste démontré mais pas la raison d'être du comportement, ce qui dégrade la généralisation sur les tâches longues ou multi-étapes. Le fait que les gains les plus marqués apparaissent justement sur ces tâches à horizon long est significatif pour les intégrateurs, car c'est là que les pipelines VLA actuels échouent le plus souvent hors démonstration scénarisée. La méthode ne requiert ni capteur ni collecte de données additionnelle : elle exploite des signaux déjà disponibles via un VLM enseignant utilisé seulement à l'entraînement, sans surcoût d'inférence au déploiement, et reste transposable à d'autres architectures VLA. Le travail prolonge des approches qui enrichissaient le clonage de comportement avec des frames futures, des observations latentes ou des trajectoires, jugées insuffisantes car elles captent une réalisation du futur, non l'objectif sémantique partagé du comportement. INDI est testé sur des modèles VLA de référence déjà largement utilisés, GR00T-N1.7 et Pi-0.5, ce qui en fait une couche d'entraînement complémentaire plutôt qu'un modèle concurrent. La publication reste à ce stade un article arXiv sans revue par les pairs formelle ni annonce de déploiement industriel ; la communauté robotique attend désormais une reproduction indépendante des résultats et une extension à d'autres familles de VLA.

RechercheActu
1 source
PHR-VLA : raisonnement à horizon de planification pour les modèles vision-langage-action
4arXiv cs.RO 

PHR-VLA : raisonnement à horizon de planification pour les modèles vision-langage-action

Des chercheurs présentent PHR-VLA (Planning Horizon Reasoning for Vision-Language-Action Models), décrit dans un preprint arXiv publié fin août 2026 (arXiv:2608.27609). Le système ajoute aux modèles vision-langage-action une tête auxiliaire légère, activée uniquement à l'entraînement, qui aligne les représentations internes du modèle avec la dynamique future de la tâche extraite d'observations à venir. Une supervision locale et centrée sur le contact, au niveau des patchs d'image issus de la caméra de poignet, fait passer le taux de réussite sur le benchmark simulé LIBERO de 84,1% à 88,4%, et sur des tâches réelles de désassemblage de 63,3% à 82,5%. Une supervision équivalente via une caméra à la troisième personne améliore aussi légèrement les résultats sur Meta-World, de 56,70% à 57,8%. Le travail cible une limite connue des VLA actuels, qui conditionnent généralement l'action sur la seule observation présente sans anticiper l'évolution de la tâche, un manque pénalisant pour les manipulations fines et riches en contacts comme l'assemblage ou le désassemblage. Le gain le plus net apparaît justement sur une tâche réelle de désassemblage, plus proche des besoins industriels que les benchmarks simulés, ce qui limite le risque d'un résultat purement académique. L'écart entre le fort gain obtenu via la caméra de poignet et le gain marginal via la troisième personne (+1,1 point sur Meta-World) suggère que la dynamique locale près du point de contact compte plus que le contexte global de la scène. Pour un intégrateur, l'argument clé est que cette tête auxiliaire n'intervient qu'à l'entraînement et n'alourdit donc pas le temps d'inférence en production. PHR-VLA s'inscrit dans la lignée des modèles VLA généralistes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui transforment instruction en langage naturel et flux vidéo en actions robotiques. À la différence d'approches fondées sur des modèles du monde générant explicitement des vidéos futures, coûteuses en calcul, la méthode se limite à un alignement de représentations latentes, plus économe. Il s'agit pour l'instant d'un travail de recherche en preprint, sans déploiement industriel annoncé ni implication d'acteur français ou européen du secteur, la suite logique étant une éventuelle intégration de cette technique d'entraînement dans des piles VLA commerciales existantes.

RechercheOpinion
1 source