Aller au contenu principal
RecherchearXiv cs.RO 

Sortir et revenir : ancrage du monde et du comportement dans le co-entraînement Real2Sim2Real

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2610.00821) une étude sur l'usage de la simulation pour enrichir des démonstrations réelles rares dans le co-entraînement de politiques robotiques. Les auteurs distinguent deux axes qu'ils font varier indépendamment dans un pipeline « real2sim2real ». Le premier, le « world grounding », aligne la simulation sur le système réel. Le second, le « behavior grounding », aligne les trajectoires simulées sur le mouvement humain. Le test porte sur une tâche dynamique de tri et de saisie dextre. Avec un co-entraînement entièrement ancré sur les deux axes, le taux de réussite passe de 52 % à 86 %. En moyenne sur toutes les configurations, le world grounding apporte 18 points de pourcentage et le behavior grounding 10 points. Les politiques déployées se comportent comme un mélange de deux politiques : l'une dérivée du réel, l'autre dérivée de la simulation. Elles imitent les démonstrations réelles dans les états couverts par celles-ci et s'appuient sur le comportement simulé ailleurs, ce que les auteurs examinent par une analyse de l'espace latent.

Pour les équipes qui doivent arbitrer leur budget de données, le résultat est utile parce qu'il chiffre des effets que le secteur traite souvent de façon intuitive. Le world grounding apparaît comme l'investissement prioritaire : il permet à la politique d'exploiter l'expérience simulée au-delà de la zone couverte par les données réelles, donc d'étendre la robustesse sans multiplier les téléopérations coûteuses. Le behavior grounding compte surtout lorsque l'alignement du monde est imparfait, ce qui est le cas de la plupart des simulateurs de contact et de dextérité. L'étude nuance l'idée d'un sim-to-real « résolu » : un gain de 34 points reste conditionné à un travail de calibration explicite. Les auteurs indiquent aussi que la simulation ancrée reste bénéfique lors du co-entraînement de modèles de fondation. Les résultats se limitent toutefois à une tâche unique, et l'abstract ne précise ni le robot, ni le nombre de démonstrations, ni le nombre d'essais. La marge statistique de ces pourcentages n'est donc pas évaluable à ce stade.

Ces travaux s'inscrivent dans le débat sur la manière de combler la pénurie de données robotiques. Les approches se partagent entre téléopération à grande échelle, vidéos humaines et génération synthétique en simulation, chacune avec ses limites de coût et d'écart de réalité. Des acteurs comme Nvidia, avec son écosystème Isaac et GR00T, Physical Intelligence avec Pi-0, ou Figure avec Helix, misent sur des mélanges de ces sources. Cet article, une prépublication non encore relue par des pairs, apporte une grille de lecture expérimentale sur ce que la simulation doit reproduire pour être utile. Reste à voir si ces proportions se confirment sur d'autres tâches, d'autres plateformes et à plus grande échelle.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Vers VLA-Dreamer : affiner le comportement des modèles VLA grâce aux modèles du monde
1arXiv cs.RO 

Vers VLA-Dreamer : affiner le comportement des modèles VLA grâce aux modèles du monde

Un article publié sur arXiv fin septembre 2026 sous la référence 2609.31313, intitulé "Towards VLA-Dreamer: Refining VLA Behavior Using World Models", propose une nouvelle architecture pour les modèles vision-langage-action (VLA) utilisés en contrôle robotique. Les auteurs suggèrent d'entraîner un modèle du monde prédictif directement sur l'espace d'embedding de l'encodeur visuel du VLA, plutôt que sur l'espace des pixels comme le font les modèles du monde classiques. L'hypothèse centrale est que ces embeddings, déjà utilisés pour décider des actions du robot, contiennent aussi l'information nécessaire pour anticiper l'évolution future de la scène. La perte d'apprentissage est calculée dans cet espace de représentation, une approche proche des architectures JEPA (joint embedding prédictive architecture). Le modèle du monde ainsi obtenu pourrait ensuite servir à de la planification à court terme, en générant des actions candidates à partir d'une image représentant l'objectif à atteindre. L'enjeu dépasse la simple curiosité académique. Les VLA actuels, tels que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, exigent des volumes massifs de données de démonstration par apprentissage par imitation, ce qui reste le principal frein économique à leur déploiement à grande échelle chez les intégrateurs industriels. L'absence de modèle du monde explicite dans ces architectures alimente aussi un doute persistant sur leur capacité réelle à comprendre la dynamique physique plutôt qu'à reproduire des trajectoires mémorisées. Si les embeddings visuels s'avèrent effectivement prédictifs, cela apporterait un argument empirique en faveur de la piste "réduction des données" tant recherchée par le secteur ; dans le cas contraire, cela confirmerait une limite structurelle largement soupçonnée des VLA. Il s'agit à ce stade d'un "concept paper", c'est-à-dire d'une proposition architecturale sans résultats expérimentaux chiffrés rapportés dans le résumé, à ne pas confondre avec un système validé ou déployé. Elle s'inscrit dans la lignée des travaux JEPA popularisés par Meta AI et Yann LeCun, et vise, selon les auteurs, à mesurer la richesse prédictive des embeddings VLA et à réduire leurs besoins en données via ce module de planification additionnel.

RechercheOpinion
1 source
Restauration de l'ancrage linguistique dans les modèles VLA par recalibrage de l'attention sans entraînement
2arXiv cs.RO 

Restauration de l'ancrage linguistique dans les modèles VLA par recalibrage de l'attention sans entraînement

Une équipe de recherche a mis en évidence une faille critique dans les modèles Vision-Language-Action (VLA), ces systèmes qui permettent à des robots d'exécuter des tâches de manipulation à partir d'instructions en langage naturel. Le problème, baptisé "cécité linguistique", survient lorsque le robot continue d'exécuter une action visuellement plausible même quand l'instruction textuelle contredit explicitement la scène observée : le modèle privilégie alors ce qu'il voit au détriment de ce qu'on lui dit. Pour quantifier ce phénomène, les chercheurs ont créé ICBench, un benchmark diagnostique dérivé du jeu de données LIBERO, qui injecte des contradictions contrôlées entre instruction et environnement visuel. Testés sur trois architectures VLA de référence, Pi-0, Pi-0.5 et OpenVLA OFT, les modèles réussissent fréquemment leur tâche malgré des instructions logiquement impossibles, preuve d'un biais visuel marqué dans la génération d'action. Face à ce constat, l'équipe propose IGAR (Instruction-Guided Attention Recalibration), un mécanisme appliqué au moment de l'inférence, sans réentraînement ni modification architecturale, qui rééquilibre l'attention du modèle pour restaurer le poids de l'instruction linguistique. Cette découverte fragilise un postulat central du secteur robotique actuel : que les modèles VLA génèrent des actions réellement pilotées par le langage, condition indispensable pour des robots généralistes capables de suivre des consignes fiables en environnement industriel ou domestique. Un robot qui ignore silencieusement une instruction contradictoire, sans signaler d'erreur, représente un risque direct pour les intégrateurs et les décideurs B2B qui envisagent de déployer ces modèles sur des lignes de production ou en logistique, où une mauvaise interprétation peut coûter cher en sécurité ou en qualité. IGAR intéresse particulièrement car il s'agit d'un correctif applicable sans réentraînement aux modèles existants. Sur 30 tâches issues de LIBERO, IGAR réduit sensiblement les exécutions erronées face à des instructions contradictoires hors distribution, tout en préservant les performances de base sur les tâches normales. Les chercheurs ont aussi validé l'approche sur un bras robotique Franka réel, où IGAR a effectivement empêché des manipulations déclenchées par des instructions incohérentes, un test important puisqu'il dépasse la simple simulation. Ce travail s'inscrit dans une tendance plus large d'audit critique des modèles VLA, où la question du "sim-to-real" et de la robustesse aux cas limites reste largement sous-explorée face à l'engouement commercial entourant Pi-0, GR00T N2 ou Helix.

RecherchePaper
1 source
Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose
3arXiv cs.RO 

Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose

Une équipe de chercheurs publie sur arXiv (référence 2506.05808v2) une étude expérimentale portant sur le comportement oculaire des opérateurs humains lors de sessions de téleopération robotique, dans le cadre spécifique de tâches de saisie et de dépose (pick-and-place). Le protocole expérimental compare plusieurs dispositifs de démonstration, des interfaces qui émulent l'incarnation et les conditions visuelles d'un robot, et mesure précisément où le regard humain se fixe pendant l'exécution. Les résultats montrent que certaines propriétés des dispositifs provoquent un déplacement systématique de l'attention visuelle : l'opérateur cesse de regarder les indices liés à l'objectif de la tâche (les objets à manipuler) pour se concentrer sur les indices de supervision du contrôle (l'effecteur terminal, c'est-à-dire la pince ou le bras du robot). Ce n'est pas un effet marginal, il est suffisamment prononcé pour mesurer son impact en aval sur les modèles d'apprentissage. L'enjeu pour les équipes qui construisent des pipelines d'imitation learning est direct. L'apprentissage par imitation, qui fonde une part croissante des architectures VLA (Vision-Language-Action) comme Pi-0, GR00T N2 ou OpenVLA, repose sur des volumes massifs de données de démonstration humaine, dont le coût de collecte est élevé. Une hypothèse structurante du domaine est que le regard humain encode des informations cognitives de haut niveau, priorité aux objets, anticipation de la trajectoire, que les modèles peuvent exploiter pour généraliser. Or cette étude montre que, selon le dispositif utilisé, ce signal se dégrade au point de faire chuter les performances des modèles gaze-based en dessous des baselines sans information oculaire. En d'autres termes, le choix du matériel de collecte de données n'est pas neutre : il peut silencieusement empoisonner le signal superviseur. Ce travail s'inscrit dans un débat actif autour de la qualité versus la quantité des données de démonstration, dans un secteur où Physical Intelligence, Hugging Face (LeRobot) et des laboratoires comme Stanford (ALOHA) ou Berkeley (DROID) investissent massivement dans des infrastructures de collecte standardisées. La question de quel dispositif utiliser, manette, bras maître, interface VR, exosquelette, n'avait jusqu'ici été abordée que sous l'angle ergonomique ou de la fidélité de contrôle. Cette étude introduit une nouvelle dimension : l'effet du dispositif sur la qualité du signal cognitif implicite, avec des implications directes pour la conception des futures campagnes de collecte de données à grande échelle.

UEHuggingFace (entreprise française, co-fondatrice de LeRobot) est explicitement citée parmi les organisations dont les infrastructures standardisées de collecte de démonstrations sont directement concernées par ces résultats sur la dégradation du signal gaze selon le dispositif utilisé.

RechercheOpinion
1 source
LLMs pour le comportement de recherche dans les essaims de robots décentralisés
4arXiv cs.RO 

LLMs pour le comportement de recherche dans les essaims de robots décentralisés

Une équipe de chercheurs a publié en mai 2026 sur arXiv (identifiant 2605.01461) LLM-Foraging, un contrôleur décentralisé pour essaims de robots conçu pour la collecte de ressources. L'approche intègre un large modèle de langage (LLM) comme décideur tactique dans la machine d'états du CPFA (central-place foraging algorithm), à trois points précis : après un dépôt de ressource, à l'arrivée en zone centrale, et lors d'un blocage de recherche (search starvation). Chaque robot embarque son propre client LLM et l'interroge sur la base de ses seules observations locales, sans communication centralisée. Les tests ont été conduits dans le simulateur Gazebo avec des robots TurtleBot3 virtuels, sur 36 configurations couvrant des équipes de 4 à 10 robots, des arènes de 6x6 à 10x10 mètres et trois distributions de ressources (groupée, loi de puissance, aléatoire). LLM-Foraging surpasse la baseline CPFA optimisée par algorithme génétique sur l'ensemble des configurations testées, avec une consistance que les auteurs jugent supérieure. L'enjeu principal est l'absence de phase d'entraînement au déploiement. Un CPFA calibré par algorithme génétique produit des politiques figées sur une configuration donnée : tout changement de taille d'équipe, d'arène ou de distribution de ressources impose un recalcul coûteux. En substituant un LLM comme politique générale de décision, l'architecture se transfère à de nouvelles conditions sans ré-optimisation. Pour les intégrateurs de systèmes robotiques distribués, c'est une promesse de reconfigurabilité opérationnelle notable. Limite importante à retenir : l'évaluation reste entièrement en simulation, et le sim-to-real gap pour des décisions LLM dans des essaims physiques reste entièrement à démontrer. Le CPFA est un algorithme de référence en robotique d'essaim depuis les années 2010, inspiré des stratégies de fourragement des insectes sociaux. LLM-Foraging s'inscrit dans la tendance d'intégration des modèles fondationnels en robotique, aux côtés d'architectures vision-langage-action (VLA) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, mais appliquée pour la première fois aux essaims décentralisés, un domaine où les approches évolutionnaires et par apprentissage par renforcement dominaient sans alternative crédible. Aucun acteur européen n'est impliqué dans ces travaux académiques. Les prochaines étapes naturelles incluent la validation sur robots physiques, le passage à des essaims dépassant la dizaine d'unités, et l'évaluation dans des environnements dynamiques où les ressources se déplacent ou disparaissent.

RechercheActu
1 source