Aller au contenu principal
Politique de non-fabrication : je ne dois pas inventer de traduction pour un titre d'article sans contexte vérifiable au-delà de ce qui est donné, mais ici la tâche est simplement de traduire le titre fourni, donc je peux procéder
RecherchearXiv cs.RO 

Politique de non-fabrication : je ne dois pas inventer de traduction pour un titre d'article sans contexte vérifiable au-delà de ce qui est donné, mais ici la tâche est simplement de traduire le titre fourni, donc je peux procéder

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2607.08283) une nouvelle architecture baptisée TFP (Temporally Conditioned Memory-Fusion Policies), conçue pour améliorer les politiques vision-langage-action (VLA) comme π0.5 ou OpenVLA, aujourd'hui limitées par leur caractère réactif : l'action suivante est prédite uniquement à partir de l'observation courante, sans mémoire de la progression de la tâche. TFP ajoute une croyance locale à l'épisode, mise à jour via une dynamique de type Liquid Time-Constant, injectée directement dans le décodeur d'action par flow-matching. Avec un modèle de 3,3 milliards de paramètres, le taux de succès moyen passe de 96,9% à 98,75% sur le benchmark LIBERO et de 91,4% à 93,77% sur LIBERO-plus. Sur le diagnostic MIKASA ShellGameTouch, spécifiquement conçu pour tester la mémoire, TFP atteint jusqu'à 75% de réussite. Les auteurs montrent aussi que les variations du gain d'écriture de la mémoire sont environ six fois plus fortes près des événements de manipulation (contact, relâchement, sous-objectif) que dans les phases stables.

Pour l'industrie robotique, ce travail cible un angle mort connu des VLA actuels : la gestion des tâches à étapes, où deux états visuellement identiques nécessitent des actions différentes selon l'historique des interactions, par exemple lors d'occlusions temporaires ou de sous-tâches séquentielles. Un module de mémoire événementielle, plutôt qu'un simple historique passif, pourrait réduire les échecs sur des manipulations complexes en usine ou en logistique, sans nécessiter de refonte complète des backbones VLA existants.

Le papier s'inscrit dans la lignée des travaux sur les politiques génératives par flow-matching, après RT-2, OpenVLA et la famille π0 de Physical Intelligence, ainsi que GR00T N2 de NVIDIA. Il s'agit ici d'une contribution de recherche académique évaluée sur des benchmarks de simulation (LIBERO, MIKASA), sans déploiement réel ni intégration annoncée sur un robot commercial. Les auteurs présentent TFP comme un module greffable sur des backbones VLA existants, une piste à confirmer sur des tâches physiques réelles plutôt qu'en simulation.

À lire aussi

Au-delà de la reconstruction : qu'est-ce qui compte dans la tokenisation d'actions pour les politiques robotiques ?
1arXiv cs.RO 

Au-delà de la reconstruction : qu'est-ce qui compte dans la tokenisation d'actions pour les politiques robotiques ?

Les politiques robotiques autorégressives, dont les modèles vision-langage-action (VLA), convertissent des séquences de tokens discrets en commandes continues grâce à un « tokenizer » d'actions. Une équipe de chercheurs publie sur arXiv (2610.09170) ProAct, pour Predictable and Robust Action Tokenization, une méthode d'entraînement de ces tokenizers. Elle ne dépend d'aucune politique particulière et n'utilise que des jeux de données d'actions. Testée sur les benchmarks Robomimic, LIBERO et RoboTwin, avec plusieurs architectures de tokenizers, elle améliore le taux de réussite en rollout de 11,3 points de pourcentage en moyenne. Le gain atteint 21,8 points sur des VLA et 36,7 points en manipulation robotique réelle. Les résumés de ce type ne précisent pas toujours les tâches, les robots ou le nombre d'essais physiques. Il faudra donc lire l'article complet pour juger de la robustesse de ces chiffres. La plupart des tokenizers apprennent la correspondance entre tokens et actions par un objectif de reconstruction. Les auteurs montrent qu'une reconstruction suffisamment fidèle ne garantit pas une bonne politique. Deux autres propriétés comptent. La politique doit prédire les bons tokens face à des observations nouvelles. Et les tokens qu'elle prédit sans les avoir vus à l'entraînement doivent quand même se décoder en actions plausibles. Ni l'une ni l'autre n'est favorisée par la seule reconstruction. ProAct complète donc celle-ci pour améliorer la prévisibilité et la robustesse. Pour les équipes qui construisent des VLA, le message est concret : le tokenizer n'est pas un simple module de compression. C'est une interface de conception à part entière, qui doit équilibrer fidélité, prévisibilité et robustesse. Le gain le plus marqué en conditions réelles suggère aussi qu'une partie de l'écart entre démonstration et déploiement pourrait venir de ce maillon, et pas seulement de la taille des modèles ou du volume de données. Ce travail s'inscrit dans le courant des politiques qui discrétisent les actions pour réutiliser les architectures de modèles de langage, comme l'approche de tokenisation par compression popularisée avec les modèles de type Pi-0-FAST. Il rejoint les critiques sur les méthodes qui jugent un tokenizer à sa seule erreur de reconstruction. Le fait que ProAct soit indépendant de la politique et n'utilise que des données d'actions facilite son intégration dans des pipelines existants, sans réentraîner l'ensemble de la pile. Les concurrents sont les approches continues, notamment par diffusion ou flow matching, qui évitent la tokenisation. Aucun pilote industriel ni calendrier de publication de code n'est mentionné dans le résumé. Il s'agit pour l'instant d'une preuve de concept académique, dont l'adoption dépendra de la reproductibilité des résultats par d'autres laboratoires.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?
2arXiv cs.RO 

SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?

Des chercheurs publient SimpleTouch, une extension du modèle vision-langage-action (VLA) π0.5 qui lui ajoute un « expert tactile ». Cet expert exploite tous les tokens d'un encodeur tactile préentraîné et gelé. Il apprend à partir de la supervision des actions et de la prédiction à plusieurs horizons de représentations latentes tactiles futures. L'entraînement tient en une seule étape et n'utilise que les démonstrations de la tâche, sans préentraînement tactile de la politique ni alignement visuotactile séparé. Avec 50 démonstrations par tâche, SimpleTouch obtient le meilleur taux de succès parmi les méthodes évaluées sur les six tâches du benchmark UniVTAC, avec une moyenne de 77,5 %. FTP-π0.5 atteint 45,2 % et FTP-1 66,7 %, soit des écarts de 32,3 et 10,8 points de pourcentage. Sur quatre tâches réelles, la moyenne est de 71,3 %, soit 8,8 points au-dessus de FTP-1. Le papier, disponible sur arXiv avec une page projet, ne précise pas dans cet extrait le capteur tactile utilisé, le robot ni le nombre d'essais par tâche. L'enjeu est la chaîne d'entraînement de la manipulation riche en contacts. Beaucoup d'équipes partent du principe que greffer le toucher sur un VLA préentraîné uniquement sur la vision et le langage, au moment du réglage fin, creuse un écart intermodal et donne peu de gains, voire dégrade les résultats. Elles ajoutent donc des corpus tactiles à grande échelle ou une étape d'alignement dédiée, ce qui alourdit la collecte de données et le pipeline. SimpleTouch suggère que, si l'on dispose déjà d'un VLA et d'un encodeur tactile solides, ces étapes ne sont pas indispensables pour ces tâches. Pour un intégrateur, cela abaisse le coût d'entrée : une cinquantaine de démonstrations par tâche suffiraient pour doter une politique existante de sensibilité tactile. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par les pairs, d'un nombre limité de tâches (six en simulation, quatre en réel), et la comparaison porte sur des références choisies par les auteurs. Rien n'indique une généralisation à d'autres capteurs, morphologies ou tâches. Ce travail s'inscrit dans la montée des VLA fondés sur la famille π de Physical Intelligence, qui servent de base à de nombreuses extensions de recherche. La question de la modalité tactile y reste ouverte : les approches concurrentes, comme FTP-1, misent sur un préentraînement tactile de la politique, tandis que SimpleTouch teste l'hypothèse inverse, celle de la simplicité. Le benchmark UniVTAC fournit un terrain commun de comparaison, mais les résultats en conditions industrielles, avec cadences, variabilité des pièces et usure des capteurs, restent à démontrer. Les prochaines étapes probables sont des réplications par d'autres laboratoires, des tests sur davantage de tâches et de capteurs, et une confrontation directe avec des modèles préentraînés sur de grands volumes de données tactiles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Traduction du langage temporel linéaire par raisonnement auto-contraint inspiré de l'humain pour la spécification de tâches robotiques
3arXiv cs.RO 

Traduction du langage temporel linéaire par raisonnement auto-contraint inspiré de l'humain pour la spécification de tâches robotiques

Une équipe de recherche présente Self-Constrained Reasoning (SCR), un framework destiné à traduire des instructions en langage naturel vers la Logique Temporelle Linéaire (LTL), le formalisme utilisé pour spécifier de manière vérifiable les sous-objectifs, contraintes et séquencements temporels des tâches robotiques. L'article, publié sur arXiv sous la référence 2608.28435v1, décrit une architecture qui combine une représentation structurelle des contraintes avec une formulation de décision hiérarchique, permettant au modèle d'intégrer les règles du domaine directement dans son processus de raisonnement plutôt que de les appliquer après coup comme un filtre externe. Les auteurs rapportent, via des expériences, une amélioration simultanée du respect des contraintes du domaine et de la capacité de généralisation à des instructions inédites, sans préciser dans le résumé les jeux de données, les taux de réussite chiffrés ni les architectures de modèles de langage utilisées comme base. Pour les intégrateurs et concepteurs de systèmes robotiques, ce travail cible un problème concret : les opérateurs humains formulent des tâches en langage ambigu et sous-spécifié, alors que l'exécution sûre et vérifiable exige des spécifications formelles précises. Les traducteurs existants basés sur des grands modèles de langage souffrent d'un compromis connu, un raisonnement ouvert peut enfreindre les contraintes du domaine, tandis qu'un filtrage strict après génération peut casser la capacité du modèle à traiter des instructions nouvelles. SCR se positionne comme une réponse à ce dilemme précis, ce qui, si les résultats se confirment à plus grande échelle, intéresserait directement les architectes de piles logicielles robotiques cherchant à garantir formellement le comportement d'un robot tout en conservant la flexibilité du langage naturel en entrée. Ce travail s'inscrit dans un courant de recherche plus large sur l'usage des LLM comme interface entre commande humaine et exécution robotique vérifiable, un axe distinct des approches VLA (Vision-Language-Action) de bout en bout comme Pi-0 ou GR00T N2, puisqu'il vise la génération de spécifications formelles plutôt que le contrôle moteur direct. L'abstract ne mentionne ni laboratoire, ni affiliation institutionnelle, ni plateforme robotique de validation, ni calendrier de publication du code ou de suites expérimentales, ce qui limite à ce stade la portée de l'annonce à une contribution méthodologique publiée en prépublication, sans déploiement ni pilote industriel associé.

RecherchePaper
1 source
Réfléchir uniquement quand c'est nécessaire : contrôle par autorité de prompt pour une intervention sélective en mode lent dans la manipulation VLA
4arXiv cs.RO 

Réfléchir uniquement quand c'est nécessaire : contrôle par autorité de prompt pour une intervention sélective en mode lent dans la manipulation VLA

Un article publié sur arXiv (référence 2608.23224v1) documente un phénomène baptisé effondrement de forme du prompt dans le pilotage de robots par des modèles vision-langage-action (VLA). Ajouter du texte récupéré au prompt d'une politique VLA gelée, sans réentraînement, fait chuter le taux de réussite moyen de 92,47 % à 3,00 % sur 500 états testés, un ajout dénué de sens mais de longueur équivalente échouant tout aussi complètement. Les auteurs introduisent TOWN-VLA, une interface qui sépare la génération de texte candidat de l'autorisation de modifier l'entrée de la politique : une règle fixe n'autorise qu'une instruction compacte canonique, sinon le prompt original est restauré à l'identique, un contrat respecté sur les 900 routes auditées (525 restaurations vérifiées par empreinte, 375 prompts autorisés préservant la tâche). Sur l'évaluation LIBERO-Plus (grille 4x7, 10 030 épisodes par méthode), le taux de réussite passe de 69,5 % à 73,1 %, avec des gains sur les six axes de perturbation et les quatre suites testées. Sur un bras physique PiPER piloté par un checkpoint gelé du modèle π0.5, il grimpe de 52,7 % à 78,7 % sur 150 essais par méthode (p=3,16x10^-6). Ce résultat vise une pratique répandue : l'augmentation par récupération de contexte sur un modèle gelé, sans réentraînement coûteux, est perçue comme un moyen sûr d'enrichir une politique VLA en production. Or un texte sémantiquement vide provoque le même échec total qu'un texte informatif, preuve que c'est la forme de l'instruction, et non son contenu, qui domine l'exécution, un angle mort pour les intégrateurs qui supposent qu'ajouter du contexte ne peut que rester neutre ou aider. Pour les décideurs évaluant des piles VLA prêtes à l'emploi, ce travail plaide pour une couche de contrôle d'autorité sur les prompts, séparée du modèle de génération, avant tout déploiement réel. Le travail s'appuie sur un modèle gelé de la famille pi-zero (π0.5), développée par Physical Intelligence, ce qui positionne TOWN-VLA comme une couche de contrôle générique plutôt qu'un modèle concurrent d'architectures comme GR00T N2 de NVIDIA ou Helix de Figure AI. Les auteurs indiquent que la prochaine étape est une calibration d'admission sans oracle, signe que le système reste, à ce stade, un résultat de recherche audité en simulation et sur un bras robotique isolé, sans déploiement industriel ni pilote commercial annoncé.

RecherchePaper
1 source