Aller au contenu principal
Transférer l'intelligence des VLM au contrôle robotique
IA physiquearXiv cs.RO 

Transférer l'intelligence des VLM au contrôle robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un papier de recherche publié sur arXiv (2609.22966v1) présente RoboDawn, une interface qui permet à un modèle vision-langage (VLM) généraliste de piloter un robot sans entraînement spécifique à la tâche, via un jeu restreint de commandes discrètes de translation, rotation et pince, exécutées en boucle fermée d'observation, de raisonnement et d'action. Un mécanisme d'apprentissage en contexte fournit au modèle quelques démonstrations pour lui apprendre l'usage de l'interface et la stratégie de la tâche. Sur le banc d'essai RoboTwin 2.0 C2R, le taux de réussite passe de 53,2% en zero-shot à 73,6% avec une seule démonstration, dépassant la référence pi-0.5 (46,0%) ; sur RoboDojo, il grimpe de 35,67% à 47,17%. Le système est aussi testé sur un bras Franka réel, pour des tâches de rangement et d'empilement de cubes.

Le résultat questionne l'hypothèse dominante selon laquelle un contrôle robotique fiable exige d'entraîner ou d'affiner un modèle vision-langage-action sur de vastes jeux de démonstrations robotiques collectées tâche par tâche, comme le font pi-0, GR00T N2 ou Helix. RoboDawn suggère qu'un VLM généraliste, jamais entraîné sur des données robot, peut être compétitif via une simple interface d'action et quelques exemples en contexte, ce qui réduirait le coût de collecte de données pour les intégrateurs. Pour les décideurs évaluant leur pile de contrôle robotique, c'est un argument pour des architectures VLM plus interface plutôt qu'un fine-tuning coûteux par tâche. Le bémol : les gains les plus marquants restent mesurés en simulation, et la validation réelle se limite à deux tâches simples sur un seul bras, avec des taux de réussite qui restent sous 75%.

RoboDawn s'inscrit dans le débat sur les modèles vision-langage-action porté par Physical Intelligence (pi-0, pi-0.5), NVIDIA (GR00T N2) ou Figure (Helix), qui misent sur un entraînement spécifique sur des données robotiques. L'approche inverse consiste à garder le VLM tel quel et à n'ajouter qu'une couche d'interface et un protocole de prompting en contexte, sans réentraînement. Classé comme nouvelle soumission sur arXiv, le papier n'a pas encore été publié en conférence et ne correspond à aucun produit commercial ; la suite logique serait d'étendre la validation réelle au-delà du bras Franka et des deux tâches testées.

À lire aussi

Contrôle robotique sans démonstration via des agents LLM
1arXiv cs.RO 

Contrôle robotique sans démonstration via des agents LLM

Des chercheurs ont publié FAEA (Frontier Agent as Embodied Agent), un framework qui applique directement aux manipulateurs robotiques les architectures d'agents LLM conçues pour le génie logiciel, sans démonstrations spécifiques à la tâche ni fine-tuning. Évalué sur trois benchmarks de référence en simulation avec accès privilégié à l'état de l'environnement (positions des objets fournies directement, sans perception visuelle brute), FAEA atteint des taux de succès de 84,9 % sur LIBERO, 85,7 % sur ManiSkill3, et 96 % sur MetaWorld, en utilisant le Claude Agent SDK d'Anthropic comme modèle frontier non modifié. Une itération optionnelle de feedback humain porte le score LIBERO à 88,2 %. Ces résultats se rapprochent des performances des modèles VLA (Vision-Language-Action) entraînés sur moins de 100 démonstrations par tâche, seuil qui représente aujourd'hui le plancher de coût pour la collecte de données en robotique incarnée. L'implication centrale est notable : pour les tâches de manipulation dominées par la planification délibérative à haut niveau, un agent généraliste non spécialisé peut suffire, sans pipeline de données propriétaire. FAEA peut en outre explorer de façon autonome des scénarios inédits en simulation et générer des trajectoires réussies pour augmenter les datasets d'entraînement, court-circuitant ainsi le goulot de la collecte humaine. Nuance critique : tous les tests restent en simulation avec état privilégié ; aucun transfert sim-to-real n'est validé dans ce travail, ce qui limite la portée des conclusions pour un déploiement industriel réel. Les modèles VLA entraînés bout-en-bout, pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA, dominent la recherche en manipulation depuis 2023 mais restent contraints par des pipelines de collecte de données coûteux et spécifiques à chaque domaine. FAEA s'inscrit dans un courant alternatif qui cherche à exploiter l'infrastructure d'agents software directement en robotique : la même boucle plan-act-observe-debug qui pilote les agents de coding est ici transférée sans modification au contrôle de manipulateurs. Ce positionnement implique un bénéfice passif : toute amélioration des modèles frontier se répercute directement sur les capacités robotiques sans retraining. Le préprint est disponible sur arXiv (2601.20334v2) et le code sur GitHub ; aucun déploiement industriel n'est annoncé à ce stade.

IA physiquePaper
1 source
Une entreprise chinoise accélère l'intelligence des robots humanoïdes avec un contrôle à 300 FPS
2Interesting Engineering 

Une entreprise chinoise accélère l'intelligence des robots humanoïdes avec un contrôle à 300 FPS

Horizon Robotics, entreprise chinoise connue jusqu'ici pour ses SoC dédiés à l'IA embarquée dans l'automobile, a publié en open source HoloMotion-1, un modèle de contrôle moteur corps entier pour robots humanoïdes. Fort de 4 milliards de paramètres, ce modèle dépasse d'un à deux ordres de grandeur les architectures cérébelleuses habituellement déployées, qui plafonnent à quelques millions de paramètres. En inférence, HoloMotion-1 atteint 200 à 300 cycles par seconde sur calculateur embarqué, le module moteur physique tournant en parallèle à 50 Hz pour lisser les trajectoires. La démonstration a été conduite sur un robot Unitree G1, en zero-shot complet : aucun fine-tuning sur données réelles, toute l'inférence exécutée en local. Le robot a reproduit des comportements absents de son entraînement physique, notamment la danse, le rampé, la position assise et des frappes de type arts martiaux. Des tests de téléopération en temps réel via combinaison de capture de mouvement et contrôleurs VR ont également montré un suivi stable des gestes humains. Le point critique n'est pas la vitesse brute mais la robustesse du sim-to-real gap sans adaptation. Réussir un transfert zero-shot sur un humanoïde commercial reste un obstacle mal résolu par la majorité des systèmes actuels, qui exigent des phases de fine-tuning coûteuses. HoloMotion-1 contourne partiellement ce problème en constituant un corpus de données radicalement plus large : données MoCap sélectionnées, données internes, et mouvements reconstruits depuis des vidéos du monde réel, augmentant la couverture des situations imprévues. L'architecture MoE (Mixture-of-Experts) Transformer active sélectivement des sous-réseaux spécialisés à chaque pas de temps, réduisant le coût computationnel sans régresser sur la capacité expressive. Le KV-cache accélère l'inférence séquentielle en réutilisant les calculs passés. L'entraînement repose sur une méthode PPO (Proximal Policy Optimization) appliquée à des séquences de mouvement complètes plutôt qu'à des pas de temps isolés, ce qui améliore la stabilité sur corpus hétérogène. Pour un intégrateur ou un OEM robotique, la conséquence concrète est qu'un modèle généraliste à 4 milliards de paramètres devient déployable sur edge hardware sans infrastructure cloud. Il convient toutefois de souligner que les démonstrations publiées restent des séquences sélectionnées, sans métriques indépendantes sur la robustesse en conditions industrielles. Horizon Robotics est historiquement positionnée sur la couche silicium, avec ses puces Journey pour l'ADAS, et HoloMotion-1 marque un pivot vers la couche logicielle en robotique humanoïde. Le choix de l'open source suit la stratégie d'influence sur l'écosystème pratiquée par Meta avec LLaMA dans les LLM : imposer un standard de fait avant que les concurrents ne verrouillent leur stack propriétaire. Le paysage concurrentiel est dense : Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Agility Robotics et Figure AI côté occidental, Unitree, Fourier Intelligence et Zhiyuan Robotics côté chinois. La publication décrit un plan en quatre phases pour le contrôle humanoïde ("Imitate Any Pose, Follow Any Command" en constituent les deux premières), mais les phases suivantes n'ont pas été détaillées publiquement. Aucun déploiement industriel ni partenariat de production n'est annoncé à ce stade.

UELa publication open-source de HoloMotion-1 met à disposition des équipes R&D européennes un modèle de contrôle moteur corps entier déployable sur edge hardware, mais aucun acteur, labo ou déploiement européen n'est impliqué.

IA physiqueOpinion
1 source
Modélisation du monde en contexte pour le contrôle robotique
3arXiv cs.RO 

Modélisation du monde en contexte pour le contrôle robotique

Des chercheurs ont publié le 25 juin 2026 un preprint arXiv (2606.26025) présentant ICWM (In-Context World Modeling), un cadre d'adaptation pour les modèles Vision-Language-Action (VLA) appliqués à la robotique. Les VLA actuels échouent dès que le contexte d'exécution change - angle de caméra différent, morphologie de robot modifiée - parce qu'ils supposent un contexte fixe, celui rencontré pendant l'entraînement, et nécessitent un fine-tuning intensif en données pour toute nouvelle configuration. ICWM traite l'identification du système comme un problème d'adaptation en contexte : avant d'exécuter une tâche, le robot génère de courtes interactions autonomes agnostiques à la tâche, dont l'historique est injecté dans la fenêtre de contexte du modèle. Celui-ci infère ainsi implicitement la dynamique du système courant - position de caméra, configuration mécanique - sans mise à jour de poids. Les expériences menées en simulation et sur plateformes réelles montrent que ICWM surpasse significativement les baselines VLA standards sur des configurations de caméra inédites. La généralisation des VLA est le verrou principal qui freine le déploiement industriel de la robotique généraliste. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et les modèles Google nécessitent tous du fine-tuning dès qu'on change la disposition d'une caméra ou la morphologie d'un robot, ce qui rend les pilotes industriels coûteux et longs à mettre en place. ICWM attaque ce problème sans modifier les poids du modèle : l'adaptation passe uniquement par le contexte, à l'image de ce que l'In-Context Learning a apporté aux LLMs. Pour un intégrateur ou un COO industriel, cela signifie potentiellement déployer un même modèle sur plusieurs lignes avec des géométries de capteurs différentes, sans pipeline de re-entraînement. La contribution est conceptuellement distincte : là où l'ICL classique spécifie quelle tâche effectuer, ICWM apprend comment le système fonctionne - une couche d'adaptation complémentaire aux approches existantes. Les modèles VLA ont connu une explosion depuis 2024 : RT-2 (Google DeepMind), Pi-0 de Physical Intelligence, GR00T N2 d'NVIDIA présenté à GTC 2025, et plus récemment Helix (Figure AI) illustrent la convergence entre fondations LLM et contrôle moteur. La fragilité aux variations contextuelles - ce qu'on appelle le "demo-to-deployment gap" - reste une critique récurrente formulée notamment par des acteurs européens comme Enchanted Tools ou Wandercraft, qui misent sur des architectures plus déterministes pour des environnements industriels contraints. ICWM s'inscrit dans une tendance plus large : importer les paradigmes d'adaptation du machine learning directement dans la boucle de contrôle robotique, sans passer par un cycle de collecte de données et de re-entraînement. Le preprint ne mentionne ni partenariat industriel, ni code open-source, ni dataset public : il s'agit d'une contribution de recherche pure, sans déploiement commercial annoncé à ce stade.

UESi ICWM tient ses promesses, les intégrateurs européens pourraient déployer un même modèle VLA sur plusieurs lignes à géométries de capteurs différentes sans pipeline de ré-entraînement, réduisant directement le coût des pilotes industriels, mais aucun déploiement ni partenariat européen n'est annoncé à ce stade.

💬 Le vrai frein au déploiement robotique industriel, ce n'est pas la performance brute des VLA, c'est que la moindre caméra déplacée oblige à relancer un fine-tuning complet. ICWM importe dans la boucle de contrôle la même logique qui a rendu les LLMs flexibles, et si ça tient, c'est un changement de calcul économique pour les intégrateurs européens qui tentent des pilotes. Bon, pour l'instant c'est un preprint sans code ni partenaire industriel, donc on verra.

IA physiqueOpinion
1 source
LightNav-0 : révéler l'intelligence spatiale des VLM pour la navigation incarnée généraliste
4arXiv cs.RO 

LightNav-0 : révéler l'intelligence spatiale des VLM pour la navigation incarnée généraliste

Publié sur arXiv le 30 août 2026 (référence 2608.30935), LightNav-0 est un modèle compact et généraliste de navigation robotique qui exploite directement les capacités spatiales des modèles vision-langage pré-entraînés, sans tête de prédiction propre à chaque tâche. Il unifie suivi d'instructions, navigation vers un objet en vocabulaire ouvert et suivi visuel via un pointage spatial à double canal, converti en trajectoires par un tokenizer d'action à quantification vectorielle résiduelle propre à chaque robot. Entraîné sur plus de 2 000 scènes et 4 000 heures de données, via un pré-entraînement au raisonnement embarqué (checkpoint LightNav-ER), un fine-tuning supervisé puis du renforcement, il revendique la meilleure moyenne sur 8 benchmarks de raisonnement embarqué et des scores état de l'art en monoculaire sur les 10 environnements de simulation testés, avec généralisation zero-shot en conditions réelles sur plusieurs robots. Cette approche compte car elle traite la navigation comme une capacité transférable plutôt qu'un empilement de modules dédiés par tâche et par robot, une fragmentation qui limite aujourd'hui la portabilité entre plateformes. En s'appuyant sur un VLM générique, LightNav-0 rejoint la tendance des modèles vision-langage-action comme Pi-0 ou GR00T N2, qui visent à unifier perception, raisonnement et contrôle moteur. Pour les intégrateurs, l'intérêt tient à la promesse d'un backbone unique redéployable sur des robots variés sans réentraînement complet. Il s'agit toutefois à ce stade d'un résultat de recherche en preprint, mesuré sur benchmarks et en simulation, non d'un produit commercialisé. LightNav-0 s'inscrit dans la course aux modèles de fondation généralistes pour la robotique, aux côtés de systèmes VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), tous conçus pour transférer une même intelligence spatiale à plusieurs tâches et plateformes. L'article ne mentionne aucune affiliation industrielle, aucun partenaire de déploiement ni acteur français ou européen. Les auteurs présentent leurs résultats comme une preuve que des VLM compacts peuvent servir de socle transférable pour la navigation embarquée généraliste, sans annoncer de calendrier de déploiement commercial au-delà des essais réels décrits dans l'étude.

IA physiqueActu
1 source