Aller au contenu principal
Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026
RecherchePandaily 

Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche du LionRock AI Lab, rattaché à l'Institut de recherche en technologies avancées de China Merchants Group, publie à IROS 2026 une étude qui documente une fragilité critique des modèles Vision-Language-Action (VLA) : un déplacement de caméra de quelques millimètres seulement peut faire chuter de moitié le taux de réussite d'une tâche. Les chercheurs identifient trois formes d'apprentissage par raccourci. Le "Camera-Base Coupling" survient quand le modèle mémorise la position des objets par rapport à des coordonnées de caméra fixes plutôt que d'apprendre de vraies relations spatiales ; un changement de position de caméra fait chuter le taux de succès de 85% à 43% dans leurs tests. Le "Camera-Object Coupling" désigne une dépendance à des angles de vue spécifiques, le modèle traitant un même objet vu sous un angle différent comme une entité distincte. Le "Object-Position Coupling", le plus insidieux, apparaît même avec des données multi-vues si les relations entre objets restent fixes pendant la collecte : sur une tâche "saisir un stylo et le placer dans son support", le modèle atteint 95% de réussite tant que le support reste à sa position d'entraînement, mais chute à 72% dès que celui-ci est déplacé d'un seul diamètre, preuve que le modèle avait appris une coordonnée précise plutôt que le concept de "placer dans le support". Leur réponse, baptisée Hybrid Dynamic Data Collection (HDDC), introduit une variation contrôlée pendant la collecte de données en déplaçant dynamiquement caméra et objets, pour forcer l'apprentissage de relations spatiales réelles.

Cette découverte pointe un obstacle central au déploiement de l'IA incarnée en conditions réelles : les benchmarks VLA actuels affichent des taux de succès supérieurs à 90% en conditions fixes, un chiffre qui ne dit rien de la robustesse face aux variations de position de caméra, d'éclairage ou d'agencement d'objets rencontrées hors laboratoire. En rendant explicite ce fossé entre démonstration et réalité opérationnelle, l'étude invite les intégrateurs et décideurs B2B à relativiser les métriques de succès communiquées par les fournisseurs de robots humanoïdes et de bras manipulateurs, et à exiger des tests en conditions variables avant tout déploiement industriel. L'atout de HDDC est d'être agnostique au modèle : la méthode a été validée sur plusieurs architectures VLA majeures avec une efficacité constante, ce qui en fait un correctif potentiellement générique plutôt qu'un patch propre à un seul système.

Le diagnostic du LionRock AI Lab rejoint des constats similaires obtenus par des équipes de recherche conjointes Stanford-Google et Tongji-Fudan, ce qui suggère qu'il s'agit d'un problème systémique affectant l'ensemble du champ des modèles VLA, et non d'une faiblesse isolée à une architecture ou un laboratoire donné. L'article, intitulé "Hybrid Dynamic Data Collection: Breaking VLA Shortcut Learning for Spatial Generalization", ainsi que le code et les ressources associées, sont publiés en accès libre sur arXiv et GitHub, permettant à la communauté robotique de reproduire les tests de fragilité spatiale et d'évaluer HDDC sur leurs propres modèles avant l'intégration en environnement industriel.

À lire aussi

VABench : mesurer l'intelligence spatiale incarnée par démonstrations visuelles, perception active et contrôle métrique
1arXiv cs.RO 

VABench : mesurer l'intelligence spatiale incarnée par démonstrations visuelles, perception active et contrôle métrique

VA-Bench évalue la boucle observer-raisonner-agir-réviser de modèles multimodaux généralistes (MLLM) appliqués à des tâches de manipulation robotique, sans pose d'objet oracle, trajectoire pré-calculée ni tête d'action apprise : les modèles apprennent le contexte procédural depuis des démonstrations en RGB seul, choisissent activement leurs points de vue caméra, émettent des commandes cartésiennes métriques et les corrigent selon le retour d'exécution, un contrôleur fixe et agnostique au modèle n'exécutant que les cibles qu'ils spécifient. Le benchmark couvre 14 familles de tâches de base (11 à bras unique, 3 à double bras), sept variantes de géométrie et de disposition inédites, et une piste longue durée combinant cinq objets ; 12 configurations de modèles ont été testées sur trois runs indépendants avec les mêmes 20 graines physiquement vérifiées par tâche. Le meilleur modèle atteint 100% de réussite en localisation de cible et 78,9% en relations spatiales sur le run annoté, mais son taux de réussite moyen sur trois runs tombe à seulement 53,93 ± 3,17%. Le contrôle actif de la caméra fait passer la réussite de 27,86% à 57,50% dans une comparaison appariée, le transfert vers des géométries inédites la fait chuter de plus de 30 points, et aucun modèle ne termine un épisode long horizon strict malgré une progression partielle substantielle. Ce résultat pèse directement sur le débat autour des modèles vision-langage-action (VLA) : l'écart entre 100% de précision en localisation pure et 54% de réussite de tâche complète confirme que les MLLM généralistes décrivent une scène nettement mieux qu'ils n'agissent dessus de façon fiable, même sans tête d'action spécialisée à apprendre. Le quasi-doublement du taux de réussite obtenu par le seul contrôle actif de la caméra suggère que la perception passive multi-vue, souvent utilisée par défaut dans les pipelines actuels, sous-exploite la capacité des modèles à combler eux-mêmes leurs angles morts. La chute de plus de 30 points sur des géométries jamais vues expose une fragilité de généralisation qui contredit les annonces de robustesse "sim-to-real" avancées par plusieurs acteurs du secteur, un signal utile pour les intégrateurs et décideurs B2B évaluant des solutions robotiques pilotées par des VLA, puisque le protocole fournit une méthode reproductible pour distinguer une démonstration convaincante d'une compétence réellement transférable. VA-Bench s'inscrit dans une vague récente de benchmarks cherchant à mesurer rigoureusement les capacités des modèles fondation appliqués à la manipulation robotique, alors que plusieurs laboratoires publient des systèmes VLA comme Pi-0, GR00T N2 ou Helix revendiquant des capacités de généralisation en zero-shot ou few-shot. En imposant un contrôleur agnostique au modèle et en interdisant tout raccourci tel que les poses oracle ou les têtes d'action pré-entraînées, les auteurs cherchent à isoler la contribution réelle du raisonnement spatial du modèle plutôt que celle de l'ingénierie du pipeline robotique qui l'entoure. L'article, référencé arXiv:2609.19554, décrit une évaluation en environnement contrôlé, sans partenariat industriel, déploiement matériel réel ni acteur français ou européen mentionné dans le texte. Les auteurs soulignent que la piste longue durée à cinq objets reste un échec total pour tous les modèles testés, ce qui ouvre la voie à des travaux futurs sur la composition de sous-tâches et la robustesse géométrique avant d'envisager un déploiement fiable de bras robotiques pilotés par des MLLM généralistes en environnement non contrôlé.

RecherchePaper
1 source
Embodied3DBench : évaluation de l'intelligence spatiale incarnée à bas niveau des modèles vision-langage
2arXiv cs.RO 

Embodied3DBench : évaluation de l'intelligence spatiale incarnée à bas niveau des modèles vision-langage

Une équipe de chercheurs a publié le 29 mai 2026 Embodied3DBench, un benchmark conçu pour évaluer les capacités de perception spatiale bas niveau des modèles de vision-langage (VLMs) dans des environnements 3D incarnés. Le benchmark couvre 6 catégories de tâches réparties en deux groupes : la compréhension structurelle spatiale (ancrage d'objets, prédiction de relations spatiales, correspondance multi-vues) et la perception orientée interaction (prédiction d'affordances, prédiction de points de saisie, prédiction de trajectoires). Il totalise 12 sous-catégories et plus de 21 000 paires questions-réponses annotées. Treize modèles de pointe ont été évalués sur ce corpus. En parallèle, les auteurs ont synthétisé un dataset d'entraînement à grande échelle de 1,3 million de paires QA pour tenter de combler les lacunes identifiées. Les résultats révèlent une dissociation nette dans les capacités des VLMs actuels : ces modèles affichent des performances raisonnables sur le raisonnement spatial de haut niveau, notamment les relations de position entre objets, mais restent très fragiles dès qu'il s'agit de perception orientée interaction, c'est-à-dire prédire où saisir un objet, anticiper une trajectoire de manipulation, ou estimer l'affordance d'une surface. Pour les équipes qui développent des modèles vision-langage-action (VLA) destinés à la manipulation robotique, ce résultat est structurant : il indique que les fondations perceptuelles nécessaires au déploiement réel restent insuffisantes dans les architectures actuelles, y compris les plus récentes. Le fine-tuning sur le dataset de 1,3M paires améliore significativement les scores bas niveau, ce qui suggère que le problème est en partie un déficit de données d'entraînement ciblées plutôt qu'une limite architecturale fondamentale. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour doter les VLMs de capacités d'interaction physique, au-delà de la simple description de scènes. Des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) reposent sur ces mêmes briques perceptuelles pour passer de la compréhension sémantique à l'action motrice. Jusqu'ici, l'évaluation de ces capacités bas niveau manquait d'un cadre standardisé : la plupart des benchmarks existants (ScanQA, EmbodiedScan) ciblent la compréhension de scènes plutôt que la manipulation. Embodied3DBench comble ce vide méthodologique en proposant à la fois un protocole d'évaluation reproductible et un levier de progression via son dataset synthétique. L'article est disponible en preprint (arXiv:2605.29074) et le code devrait être rendu public prochainement.

RechercheActu
1 source
La solution d'OpenSpace Lab pour le concours d'exploration en intérieur IROS 2026
3arXiv cs.RO 

La solution d'OpenSpace Lab pour le concours d'exploration en intérieur IROS 2026

L'équipe OpenSpace Lab a publié sur arXiv (2610.01505) le rapport technique de sa participation au concours Intelligent Information Gathering for Single and Multi-Robot Systems, organisé dans le cadre de l'IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems). Elle termine 1re de la piste publique mono-robot et 3e des pistes privées mono-robot et multi-robots. Les taux de couverture atteignent 61,04 % sur la piste publique mono-robot, 39,53 % sur la piste privée mono-robot et 39,91 % sur la piste privée multi-robots. Côté architecture, le système mono-robot s'appuie sur des prédictions de complétion de carte issues d'un modèle pré-entraîné pour guider la planification globale vers les zones non explorées. Une stratégie fondée sur le temps restant intègre une contrainte de retour au point de départ (« homing ») dans la décision, afin de concilier couverture et durée d'opération limitée. En multi-robots, la sélection des cibles est pilotée par une fonction d'utilité qui arbitre entre gain d'observation, coût de déplacement et budget, avec partage de la carte et des intentions entre robots pour éviter les recherches redondantes. Il s'agit d'un rapport succinct : un article complet est en préparation et le code, annoncé sur GitHub (OpenSpace-Lab/Indoor-Exploration-IROS2026), ne sera publié qu'après acceptation de ce manuscrit. L'intérêt tient surtout à ce que ces chiffres disent de l'état de l'exploration autonome en intérieur. Une couverture de 61 % en piste publique, qui tombe à environ 40 % sur les pistes privées, montre un écart net de généralisation entre scènes connues et scènes inédites. Elle rappelle que les benchmarks ouverts surestiment la performance réelle, un point à garder en tête pour les intégrateurs qui évaluent des solutions d'inspection, de cartographie ou de patrouille en environnement non structuré. Autre signal : le gain du multi-robots reste minime en piste privée (39,91 % contre 39,53 % en mono-robot, avec des rangs identiques), ce qui suggère que la coordination ne se traduit pas encore par un avantage mesurable sur ce jeu de test. Les résultats concernent par ailleurs un concours, avec des contraintes de temps propres, et non un déploiement industriel. Aucun détail n'est fourni sur la taille des scènes, le nombre de robots ni la comparaison avec les autres équipes. Ces travaux s'inscrivent dans la lignée de l'exploration par frontières, où le robot se dirige vers la limite entre espace connu et inconnu, que les approches récentes enrichissent par de la prédiction de carte apprise pour anticiper la structure des pièces non vues. Les concurrents du concours restent non précisés dans le résumé. Les suites sont connues : un article étendu à soumettre et une publication du code conditionnée à son acceptation, ce qui laisse la reproductibilité en suspens pour l'instant. Pour les acteurs industriels de l'AMR et de l'inspection, la valeur à surveiller sera la robustesse de la complétion de carte hors distribution, et la possibilité de la reproduire.

RecherchePaper
1 source
Anticipation-VLA : résolution de tâches incarnées à long horizon par génération de sous-objectifs
4arXiv cs.RO 

Anticipation-VLA : résolution de tâches incarnées à long horizon par génération de sous-objectifs

Une équipe de chercheurs a publié le 5 mai 2026 sur arXiv (référence 2605.01772) un modèle de contrôle robotique baptisé Anticipation-VLA, conçu pour résoudre les tâches à long horizon en robotique incarnée. Le système repose sur un composant appelé Anticipation Model, qui génère de manière adaptive et récursive des sous-objectifs intermédiaires au fil de l'exécution d'une tâche. L'architecture est hiérarchique : un Unified Multimodal Model (UMM) affiné gère la planification de haut niveau en produisant ces sous-objectifs, tandis qu'une politique VLA (Vision-Language-Action) conditionnée sur ces cibles pilote l'exécution motrice à bas niveau. Les expériences couvrent des environnements simulés et des tâches robotiques réelles. Les auteurs affirment des gains de robustesse significatifs par rapport aux approches antérieures, sans toutefois publier de métriques quantitatives précises dans l'abstract, ce qui limite la comparaison directe avec l'état de l'art. Le problème adressé est central dans la robotique d'apprentissage : les modèles VLA accumulent des erreurs sur les tâches longues, chaque décision imparfaite amplifiant les erreurs suivantes. Les approches existantes décomposent les tâches en sous-tâches de granularité fixe, ce qui les rend rigides face aux variations de complexité des états d'exécution. La contribution clé d'Anticipation-VLA est d'ajuster dynamiquement les sous-objectifs en fonction de l'évolution réelle de la situation, une avancée dans le contrôle hiérarchique adaptatif. Pour les intégrateurs et décideurs B2B, ce type de système ouvre la voie à des robots capables d'exécuter des séquences complexes en environnement industriel sans supervision constante, un verrou majeur dans le déploiement à grande échelle des bras manipulateurs. Le domaine des VLA est en pleine effervescence depuis la publication de RT-2 (Google DeepMind, 2023), puis d'OpenVLA, Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). La recherche sur la planification hiérarchique se heurte systématiquement au "demo-reality gap" : les résultats en simulation ne se transfèrent pas toujours au monde réel. Anticipation-VLA revendique une validation sur tâches réelles, signal positif, bien que l'absence de benchmarks standardisés tels que RLBench ou LIBERO dans la publication rende difficile le positionnement précis face à la concurrence. Les prochaines étapes probables incluent des évaluations comparatives sur ces benchmarks et une extension vers des plateformes mobiles manipulatrices, segment où des acteurs comme Physical Intelligence et Boston Dynamics intensifient leurs travaux.

RechercheOpinion
1 source