Aller au contenu principal
HABILIS Brain 0 : supervision par changement de géométrie pour modèles vision-langage-action et récupération de flux résiduel
RecherchearXiv cs.RO 

HABILIS Brain 0 : supervision par changement de géométrie pour modèles vision-langage-action et récupération de flux résiduel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié le 23 septembre 2026 sur arXiv (référence 2609.25558) une architecture nommée HABILIS Brain 0, construite autour d'un modèle appelé GC-VLA (Geometry-Change Vision-Language-Action). Plutôt que de s'appuyer sur la géométrie de la scène à l'instant présent, comme le font la plupart des politiques vision-langage-action, ce modèle apprend à prédire des tokens de changement géométrique multi-vues sur un horizon de 0,5 seconde, calculés hors ligne à partir de paires d'images avant/après. L'entraînement se fait en quatre étapes: un modèle vision-langage dédié au changement géométrique (GC-VLM), un module d'action continu (ActionExpert) aligné sur les commandes robotiques sans rétropropager de gradients vers le VLM, une phase où cette rétropropagation est activée pour mettre à jour les deux ensembles conjointement, puis, une fois GC-VLA gelé, l'ajout d'un correctif résiduel nommé Geometry-Conditioned Residual Flow (GCRF), piloté par un routeur d'intervention binaire et une politique de vélocité bornée apprise en boucle fermée. Sur le benchmark de simulation LIBERO, GC-VLA seul atteint 95,20% de réussite, et la version complète avec GCRF grimpe à 99,55%.

Ces chiffres proviennent uniquement d'un environnement simulé académique, pas d'un déploiement industriel, une nuance qui compte dans un secteur où l'écart entre performances démontrées et robustesse en conditions réelles reste une source récurrente de scepticisme. L'intérêt de GC-VLA tient surtout à sa promesse d'un préentraînement indépendant de l'embodiment, exploitable sur des vidéos robotiques et égocentriques génériques avant l'alignement spécifique à un bras ou un humanoïde donné, une piste qui parle directement aux intégrateurs cherchant à mutualiser des modèles de perception entre plateformes matérielles différentes plutôt que de réentraîner un modèle par robot. Le score de 99,55% sur LIBERO, bien qu'élevé, reste un résultat de benchmark standard en simulation et ne présume pas d'une performance équivalente hors laboratoire.

Ce travail s'inscrit dans la lignée des politiques vision-langage-action récentes telles que Pi-0, GR00T N2 ou Helix, qui combinent perception, langage et contrôle moteur dans un même réseau, mais s'en distingue par une supervision explicite du changement géométrique plutôt que par une géométrie statique de la scène. La construction en couches successives, VLM figé puis dégelé puis correction résiduelle apprise en boucle fermée, dessine une feuille de route où chaque étape peut être publiée et évaluée séparément avant un éventuel transfert vers du matériel physique, une étape que cette publication n'aborde pas encore.

À lire aussi

Géométrie de l'effecteur final conditionnée par le résultat dans les modèles vision-langage-action
1arXiv cs.RO 

Géométrie de l'effecteur final conditionnée par le résultat dans les modèles vision-langage-action

Une étude analyse 15 000 déploiements en boucle fermée de quatre politiques vision-langage-action (VLA) sur le benchmark de manipulation LIBERO, en comparant la géométrie des trajectoires du bras terminal plutôt que les seuls taux de réussite. Sur 3 600 paires de politiques appariées par configuration, la distance médiane normalisée de dynamic time warping est de 0,0120 mètre quand les deux politiques réussissent la tâche, contre 0,0380 mètre quand une seule y parvient. Cette hiérarchie se confirme pour chaque tâche, chaque paire de politiques et neuf représentations testées, même si son ampleur varie fortement selon la représentation choisie. Les paires en double échec, plus séparées encore, reposent sur un échantillon jugé trop restreint pour être concluant. Le résultat répond empiriquement à une question clé pour la manipulation robotique: savoir si des politiques VLA différentes qui réussissent la même tâche empruntent des trajectoires réellement comparables ou seulement des résultats similaires par des chemins distincts. La proximité géométrique observée en cas de succès partagé va dans le sens d'un lien entre contrainte de tâche et trajectoire, sans trancher entre chevauchement des données d'entraînement et contraintes physiques propres à la tâche. Mais l'étude prévient qu'une faible distance entre politiques ne vaut pas interchangeabilité, des différences résiduelles mesurables subsistant même face à une base de référence appariée, ce qui doit inciter intégrateurs et décideurs à ne pas juger l'équivalence de deux modèles sur le seul taux de succès. Le travail s'inscrit dans un contexte où l'évaluation des politiques VLA repose presque exclusivement sur le taux de réussite, sans examen de la manière dont chacune atteint ce résultat, alors que le secteur multiplie les architectures et interfaces d'action concurrentes pour la manipulation robotique. En s'appuyant sur LIBERO, benchmark de référence en simulation, et sur quatre politiques non nommées individuellement, les auteurs proposent une méthode reproductible fondée sur le dynamic time warping pour comparer les trajectoires plutôt que les seuls scores binaires. Ils relèvent enfin que sous stress visuel composite, classement des politiques et composition des paires évoluent ensemble, un point qui appelle des travaux futurs sur la robustesse comparative des VLA en conditions visuelles dégradées, enjeu direct pour leur fiabilité en déploiement industriel.

RecherchePaper
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
2arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source
GaussVLA : un raisonnement spatial géométrique pour les modèles vision-langage-action
3arXiv cs.RO 

GaussVLA : un raisonnement spatial géométrique pour les modèles vision-langage-action

Un preprint arXiv (2608.24959v1) présente GaussVLA, un modèle Vision-Language-Action fondé sur une architecture Mamba, doté de deux modules : le Gaussian Spatial Tokenizer (GST), qui convertit des caractéristiques sémantiques et de profondeur figées en tokens 3D gaussiens compacts en agrégeant les zones géométriquement saillantes via des requêtes apprises, et le Depth-Aware Chain-of-Thought (DA-CoT), un raisonnement géométrique structuré et non autorégressif conditionné par le langage. Testé en simulation sur le benchmark LIBERO et en conditions réelles, il atteint 93,5 % de réussite moyenne et 100,0 % sur la suite Spatial avec seulement 200 millions de paramètres, soit 19,7 % de mieux que SpatialVLA, sa référence de comparaison directe, tout en restant nettement plus économique en paramètres. Le problème visé est connu : les observations visuelles des modèles VLA sont d'ordinaire encodées en tokens 2D plats sans structure géométrique, et une carte de profondeur monoculaire n'ajoute que des valeurs scalaires par pixel, sans orientation de surface ni confiance géométrique. En dotant le modèle d'une représentation 3D explicite, GaussVLA améliore le raisonnement spatial requis pour la manipulation fine, un des écarts récurrents entre démonstrations de laboratoire et déploiement réel. Pour les intégrateurs, le signal le plus utile reste l'efficacité paramétrique : un modèle de 200 millions de paramètres qui surpasse une référence plus lourde suggère que la qualité du raisonnement spatial tient davantage à la structure de la représentation qu'à la taille du modèle, contredisant l'hypothèse du "plus gros VLA égale meilleure généralisation" et laissant entrevoir des coûts d'inférence embarquée réduits pour des politiques déployées directement sur des contrôleurs de robots. GaussVLA se positionne explicitement comme une amélioration de SpatialVLA, dans une course d'architectures VLA qui cherche depuis plusieurs générations à résoudre le raisonnement spatial en manipulation robotique. Le travail reste un preprint non encore revu par les pairs, validé sur LIBERO, un benchmark de simulation standard, complété par des essais réels dont l'ampleur n'est pas précisée dans le résumé. Aucun partenaire industriel, calendrier de déploiement ou prix n'est mentionné : il s'agit d'une contribution de recherche sur l'architecture des tokenizers spatiaux, et non d'un produit ou d'un pilote commercial, dont les suites attendues seraient des tests sur des tâches de manipulation plus longues et des plateformes robotiques variées.

RechercheOpinion
1 source
Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action
4arXiv cs.RO 

Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action

Des chercheurs présentent Hierarchical Skill Retrieval (HSR), un framework de récupération de démonstrations pour adapter plus efficacement les modèles Vision-Language-Action (VLA) à de nouvelles tâches de manipulation robotique avec peu de données spécifiques. Plutôt que de chercher des correspondances de tâches complètes, rares dans les jeux de données existants, HSR décompose une tâche cible en séquences de compétences candidates, évalue chaque plan selon sa plausibilité sémantique et la fiabilité des compétences estimée à partir du jeu de données préalable, puis combine récupération de langage au niveau sous-tâche et reclassement par caractéristiques comportementales pour sélectionner des démonstrations pertinentes et compatibles. La politique est ensuite adaptée via un pipeline en deux étapes séparant acquisition générale de compétences et finetuning spécifique à la tâche. Sur le benchmark LIBERO et sur plusieurs tâches de manipulation en conditions réelles, HSR améliore le taux de succès moyen de 10,3% et 21,3% respectivement par rapport à la meilleure méthode de référence. Vidéos et code sont disponibles sur le site du projet. Ce travail s'attaque à un problème très concret pour l'industrie robotique : les modèles VLA préentraînés sur de vastes jeux de données de démonstrations perdent en performance dès qu'on les confronte à des tâches nouvelles avec peu d'exemples, un frein majeur au déploiement rapide chez les intégrateurs. En structurant la récupération autour de compétences réutilisables plutôt que de tâches entières, HSR propose une piste pour réduire le coût de collecte de données lors du transfert vers de nouveaux environnements ou de nouvelles chaînes de production, un enjeu central pour quiconque cherche à industrialiser des bras robotiques ou des humanoïdes au-delà des démonstrations en laboratoire. Le gain plus marqué en conditions réelles (21,3%) qu'en simulation (10,3%) suggère que l'approche hiérarchique compense particulièrement bien le bruit et la variabilité du monde physique, un point souvent négligé par les méthodes de récupération fondées sur la seule similarité visuelle ou l'appariement de langage au niveau tâche. HSR s'inscrit dans la lignée des travaux récents sur l'adaptation efficace des modèles VLA de type Pi-0 ou GR00T, où la question centrale reste de savoir comment tirer parti de grands jeux de données hétérogènes sans réentraînement coûteux pour chaque nouvelle tâche. Les auteurs positionnent leur méthode par rapport aux approches de récupération existantes basées sur la similarité visuelle, les représentations état-action ou l'appariement de langage au niveau tâche, qu'ils jugent insuffisantes face à la structure hiérarchique des tâches de manipulation à long horizon. Le code et les vidéos de démonstration étant publiés en accès libre, la validation par la communauté sur d'autres benchmarks et plateformes robotiques déterminera si ces gains se généralisent au-delà de LIBERO et des tâches réelles testées par les auteurs.

RechercheOpinion
1 source