Aller au contenu principal
RecherchearXiv cs.RO 

SafeLoop : retour arrière tenant compte du risque pour la manipulation vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SafeLoop, un mécanisme de sécurité externe destiné aux modèles vision-langage-action (VLA) utilisés en manipulation robotique, détaillé dans un article arXiv (2609.26313v1) publié fin septembre 2026. Le système fonctionne comme une surcouche non invasive: il ne modifie pas les paramètres du modèle VLA de base, mais entraîne un prédicteur de risque distinct, alimenté par la vision et la proprioception du robot, qui calcule quatre valeurs en continu, la probabilité et le délai avant un risque de collision du corps du robot, ainsi que la probabilité et le délai avant un échec de manipulation d'objet. Un contrôleur léger déclenche ensuite l'une de trois actions selon ce risque prédit: poursuivre l'exécution normalement, enregistrer un point de contrôle de sécurité, ou reculer dans l'espace articulaire jusqu'à ce point avant d'interroger à nouveau la politique de base pour tenter une autre trajectoire. Testé sur 24 tâches du benchmark simulé LIBERO (16 essais aléatoires chacune) et sur trois tâches réelles avec un robot physique (25 essais chacune), SafeLoop réduit les cas dangereux d'environ 70% tout en préservant le taux de réussite des tâches et le rythme de contrôle de la politique de base. Le code du projet est disponible sur GitHub.

Ce travail s'attaque directement à une faiblesse reconnue des modèles VLA généralistes: leur fragilité sur des horizons d'exécution longs, où de petites erreurs d'estimation d'état ou de contrôle peuvent provoquer des échecs irréversibles comme des collisions ou des chutes d'objets. Pour les intégrateurs et décideurs industriels qui évaluent le déploiement de politiques VLA en environnement réel, l'enjeu est central: ces modèles impressionnent en démonstration mais restent risqués en production sans garde-fous. En proposant une couche de sécurité détachable du modèle de base, capable de s'ajouter à n'importe quelle politique VLA existante sans réentraînement complet, SafeLoop répond à un besoin pratique d'ingénierie de sécurité modulaire plutôt qu'à une promesse de performance brute, une approche qui contraste avec la tendance du secteur à surtout communiquer sur les capacités des modèles plutôt que sur leur fiabilité opérationnelle.

Le projet s'inscrit dans la lignée des benchmarks de manipulation robotique comme LIBERO, largement utilisés pour évaluer les politiques VLA génériques telles que Pi-0 ou GR00T, et répond à une limite documentée de ces architectures en environnement réel. L'approche par rollback, retour à un point de sécurité récent suivi d'une nouvelle tentative via la politique existante, se distingue des méthodes alternatives évaluées dans l'étude par un meilleur compromis entre sécurité et taux de réussite. Le code est publié en accès ouvert sur GitHub, ce qui permettra à d'autres équipes de recherche de reproduire et d'étendre les tests au-delà des 24 tâches simulées et des trois tâches réelles couvertes par l'article, sans qu'aucun calendrier de déploiement industriel ne soit pour l'instant annoncé.

À lire aussi

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
1arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
CoFreeVLA : manipulation à deux bras sans collision par modèle vision-langage-action et estimation du risque
2arXiv cs.RO 

CoFreeVLA : manipulation à deux bras sans collision par modèle vision-langage-action et estimation du risque

Des chercheurs ont publié une nouvelle version (v3) de CoFreeVLA, un framework qui ajoute aux modèles Vision-Language-Action (VLA) un estimateur léger de risque de collision pour bras robotiques doubles, décrit dans le papier arXiv 2601.21712. Le module prédit la probabilité de collision entre les deux bras ou avec l'objet saisi à partir de l'état proprioceptif, des embeddings visuels et des actions candidates, puis bloque les commandes risquées, génère une trajectoire de repli sûre et réoriente l'entraînement de la politique. L'entraînement combine un pré-entraînement sur des collisions synthétiques et un post-entraînement sur des trajectoires réelles. Sur cinq tâches bimanuelles, six backbones VLA et 30 essais par variante, le taux de collision moyen tombe de 0,54 à 0,23 et le taux de réussite grimpe de 0,45 à 0,61. L'enjeu dépasse la simple démonstration : la plupart des politiques VLA bout-en-bout ont été validées sur bras unique, où l'auto-collision n'existe pas, alors qu'elle devient un frein direct dès que deux bras coordonnés manipulent une charge commune. Pour les intégrateurs, la preuve qu'un tel garde-fou de sécurité se greffe sur six architectures existantes sans réentraînement complet abaisse le coût d'adoption d'une couche de sécurité indépendante du backbone. L'échantillon reste toutefois modeste, 30 essais par variante sur cinq tâches, ce qui invite à la prudence avant d'extrapoler ces gains de taux de collision à des lignes de production réelles. CoFreeVLA s'inscrit dans la généralisation des modèles VLA, dans la lignée de Pi-0, RT-2, OpenVLA ou GR00T N2, comme couche de contrôle générique pour la manipulation instruite, un paradigme éprouvé jusqu'ici surtout sur des bras uniques. La multiplication des humanoïdes et des cellules industrielles à deux bras rend ce manque de modélisation des auto-collisions de plus en plus pressant à mesure que ces systèmes quittent le laboratoire. Le travail reste pour l'instant une contribution académique publiée sur arXiv, sans partenaire industriel ni déploiement annoncé, dont la portée devra être confirmée sur davantage de plateformes et de tâches.

RecherchePaper
1 source
Modèles vision-langage-action tenant compte du système de préhension
3arXiv cs.RO 

Modèles vision-langage-action tenant compte du système de préhension

Une équipe de recherche publie sur arXiv, sous la référence 2608.24603, une étude introduisant MiGA, un jeu de données pour la manipulation robotique par modèles vision-langage-action (VLA), et GVLA, le modèle associé. MiGA couvre cinq types de pinces distincts répartis sur plusieurs robots, pour un total de 103 000 démonstrations capturant la divergence des stratégies de préhension selon l'effecteur pour un même objectif. GVLA combine un tokenizer multi-gripper et un routage de politique par adaptateurs, avec des représentations internes conditionnées par le type de pince. En simulation comme sur robots réels, GVLA surpasse les modèles de référence, avec une meilleure généralisation à des objets et tâches inédits et une adaptation plus rapide entre pinces. L'apport tient surtout au diagnostic : la plupart des VLA actuels supposent implicitement une invariance au type de pince, alors que la stratégie de préhension dépend de l'effecteur terminal, une pince parallèle et une ventouse exigeant des interactions distinctes pour saisir un même objet. Or les jeux de données d'entraînement existants reposent presque exclusivement sur des pinces parallèles, limitant la généralisation vers les ventouses ou pinces adaptatives utilisées en logistique et en manipulation industrielle. Pour les intégrateurs exploitant des flottes hétérogènes d'effecteurs, un modèle entraîné sur pince parallèle ne transfère pas trivialement à un bras équipé de ventouse. L'étude montre ainsi que le passage à l'échelle des VLA doit intégrer l'hétérogénéité matérielle des effecteurs, pas seulement celle des tâches ou des objets. Cette publication s'inscrit dans la vague de recherche sur les modèles vision-langage-action, qui ont démontré ces dernières années leur capacité à traduire des instructions en langage naturel en séquences d'actions robotiques, en se concentrant surtout sur la diversité des tâches et des scènes plutôt que sur celle des effecteurs. Il s'agit ici d'une contribution de recherche déposée sur arXiv, sans annonce de déploiement industriel : MiGA et GVLA sont pour l'instant validés en simulation et sur essais robots en laboratoire, sans précision sur une mise à disposition publique du code ou du dataset. La suite attendue est leur publication effective et une éventuelle reprise par des laboratoires confrontés, sur le terrain, à la diversité réelle des effecteurs de préhension.

RechercheActu
1 source
Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue
4arXiv cs.RO 

Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue

Une équipe de chercheurs publie sur arXiv (référence 2508.13073, troisième version) une revue systématique consacrée aux modèles Vision-Language-Action (VLA) construits sur de grands modèles vision-langage (VLM) pour la manipulation robotique. Le travail propose une taxonomie en deux familles d'architectures : les modèles monolithiques, déclinés en conception à système unique ou à double système selon le degré d'intégration entre perception et action, et les modèles hiérarchiques, qui séparent explicitement la planification de l'exécution via des représentations intermédiaires interprétables. La revue couvre l'articulation de ces modèles avec l'apprentissage par renforcement, l'optimisation sans réentraînement, l'apprentissage à partir de vidéos humaines et les modèles du monde, et recense les jeux de données et benchmarks du domaine. Les auteurs publient une page de projet mise à jour en continu sur GitHub, sous le compte JiuTian-VL. Contrairement aux annonces produits qui rythment l'actualité de la robotique humanoïde, ce travail ne présente ni déploiement ni chiffre de performance vérifié : c'est un effort de mise en ordre académique, justifié par la fragmentation et les incohérences de taxonomie qui caractérisent aujourd'hui le champ des VLA. Pour les intégrateurs et décideurs B2B, l'intérêt est méthodologique plutôt qu'opérationnel : la distinction entre architectures monolithiques et hiérarchiques donne une grille pour décrypter des offres commerciales qui se réclament du "VLA" sans détailler leur conception interne. La revue rappelle aussi que plusieurs briques restent des chantiers ouverts, mémoire, perception 4D, adaptation efficace, coopération multi-agents, ce qui tempère l'idée qu'un modèle vision-langage-action généraliste serait déjà un problème résolu à l'échelle industrielle. Les VLA se sont imposés ces dernières années comme alternative aux méthodes robotiques à base de règles, jugées incapables de généraliser à des environnements non structurés, en s'appuyant sur des VLM pré-entraînés sur de vastes corpus image-texte. Cette revue s'inscrit dans une production académique croissante qui tente de cartographier un champ où de nombreux laboratoires publient des architectures concurrentes sans convention de classification commune, d'où l'objectif affiché de résoudre les incohérences des taxonomies existantes. Le document ne cite aucun système commercial ni partenaire industriel précis ; il est pensé comme une ressource vivante, régulièrement actualisée, utile pour situer les futures annonces de VLA propriétaires, qu'elles viennent de laboratoires de recherche ou de fabricants de robots humanoïdes, par rapport à l'état de l'art académique.

RecherchePaper
1 source