Aller au contenu principal
Les LLM aident les robots à comprendre les instructions vagues et à se concentrer sur les détails clés
IA physiqueMIT News Robotics 

Les LLM aident les robots à comprendre les instructions vagues et à se concentrer sur les détails clés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UEPourquoi ça compte

Des chercheurs du MIT Computer Science and Artificial Intelligence Laboratory (CSAIL) ont publié un système appelé "Masked Inverse Reinforcement Learning" (Masked IRL) qui permet à un robot d'interpréter des instructions vagues et de sélectionner automatiquement les informations pertinentes dans son environnement. Le système repose sur deux grands modèles de langage (LLM) en cascade et nécessite jusqu'à cinq fois moins de données de démonstration que les approches conventionnelles. L'apprentissage passe par des démonstrations kinesthésiques : un opérateur humain guide physiquement le bras du robot pour lui montrer comment saisir, déplacer et poser des objets. Un premier LLM compare la trajectoire effectuée au chemin le plus court et reformule automatiquement les consignes ambiguës : une instruction comme "reste proche" devient "reste proche de la surface de la table". Un second LLM évalue ensuite chaque élément de l'environnement capté par les capteurs du robot et lui attribue un score binaire, 1 (pertinent) ou 0 (ignoré), avant qu'un algorithme de planification de mouvement ne génère le plan d'action final à partir des seuls éléments notés 1.

L'intérêt industriel de cette approche réside dans sa capacité à réduire le fardeau de l'annotation et de la démonstration, deux des principaux goulets d'étranglement du déploiement robotique en environnement non structuré. En entreprise, la plupart des opérateurs ne formalisent pas les contraintes implicites d'une tâche : ne pas s'approcher d'un écran pendant une visioconférence, contourner une étagère dans un entrepôt, ne pas heurter un ordinateur portable posé sur un bureau. Masked IRL automatise la découverte de ces contraintes à partir d'une poignée de démonstrations, sans qu'il soit nécessaire de les spécifier dans le code. Pour les intégrateurs robotiques, cela réduit potentiellement le coût de configuration d'un nouveau poste de travail et rend les systèmes plus adaptables à des layouts changeants.

Le travail s'inscrit dans la tendance plus large des Vision-Language-Action models (VLA) qui cherchent à ancrer le raisonnement des LLM dans des contraintes physiques réelles. Des équipes comme Physical Intelligence (pi.ai, avec Pi-0) ou les laboratoires de Boston Dynamics, Figure et 1X explorent des directions similaires pour réduire le "sim-to-real gap" et rendre les politiques de manipulation robustes hors laboratoire. L'approche du MIT se distingue par son mécanisme de masquage explicite qui rend l'attribution de pertinence interprétable, contrairement à la plupart des architectures end-to-end où la sélection des features reste opaque. Minyoung Hwang, doctorant au CSAIL et auteur principal de l'article, indique que le système a été validé sur des tâches de manipulation en environnement 3D simulé et en conditions réelles. Aucune date de transfert industriel ni partenariat de déploiement n'a été annoncé à ce stade : il s'agit d'un résultat de recherche académique, pas d'un produit commercialisé.

💬 Le point de vue du dev

Ce qui change ici, c'est pas l'IA sur un robot, c'est le masquage : on sait enfin quels éléments le robot a choisi d'ignorer dans son environnement, et pourquoi. Cinq fois moins de données de démo pour apprendre une contrainte implicite (genre "ne pas percuter l'ordi posé sur le bureau"), c'est le genre de chiffre qui parle aux intégrateurs qui passent des semaines à configurer chaque poste. Reste à voir si ça tient hors labo, mais la piste est sérieuse.

À lire aussi

GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots
1arXiv cs.RO 

GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots

Des chercheurs ont publié sur arXiv, sous la référence 2609.05927 (version 2, qui remplace une publication antérieure), un système baptisé GIF, conçu pour générer automatiquement des scènes d'objets fonctionnels et interactifs destinées à l'entraînement et à l'évaluation de modèles de manipulation robotique en simulation. Le pipeline découpe le problème en deux étapes distinctes : un module nommé CoGen reconstruit des maillages 3D séparés par instance avec des poses initiales grossières, en combinant les forces des modèles génératifs 2D et 3D existants, puis un second module, GPRM, affine la pose relative entre les objets sous une double contrainte géométrique et physique. Un vérificateur basé sur un modèle vision-langage (VLM) sélectionne ensuite, parmi les candidats produits, celui qui correspond le mieux à la spécification structurée demandée. Les auteurs ont construit un benchmark couvrant huit classes représentatives de géométries de contact et ont comparé GIF à des générateurs de scènes considérés comme état de l'art. Résultat : le système améliore à la fois la qualité des objets générés et la justesse des relations spatiales entre eux, tout en faisant chuter le taux de collision sous la barre de 1%. Les données produites ont ensuite servi à entraîner des politiques de manipulation, avec une progression des performances observée à mesure que la diversité des scènes augmente, aussi bien en simulation qu'en déploiement réel. Cette contribution vise un maillon précis, et souvent négligé, de la chaîne d'entraînement des modèles de manipulation de type VLA : la génération de scènes. Les méthodes existantes se limitaient surtout à des agencements grossiers d'objets, sans modéliser la façon dont ils s'emboîtent ou interagissent physiquement, ce qui limite leur utilité pour des tâches fines comme ouvrir un couvercle ou insérer une pièce. En automatisant la production de compositions à faible taux de collision, GIF s'attaque directement au goulot d'étranglement des données d'entraînement pour la manipulation robotique, un enjeu central pour les équipes qui cherchent à réduire l'écart entre démonstrations en simulation et comportements robustes en conditions réelles. L'observation d'une montée en performance liée à la diversité des scènes, confirmée à la fois en simulation et sur robot réel, constitue l'élément le plus significatif pour les intégrateurs, car elle appuie l'hypothèse selon laquelle davantage de données synthétiques bien construites profite au transfert vers le monde réel. Ce travail s'inscrit dans la lignée des recherches sur la génération automatique de scènes de simulation pour la robotique, un domaine qui a jusqu'ici privilégié le placement grossier d'objets plutôt que la composition fine de leurs relations fonctionnelles et de contact. Les auteurs positionnent explicitement GIF face aux générateurs de scènes existants sans toutefois nommer d'acteur commercial concurrent, l'article restant à ce stade une contribution de recherche publiée sur arXiv plutôt qu'un produit déployé. La suite annoncée par les auteurs porte sur l'extension de cette génération de données synthétiques à plus grande échelle pour l'entraînement de politiques de manipulation, avec des premiers résultats de transfert vers le monde réel déjà rapportés, mais sans calendrier ni partenaire industriel précisé.

IA physiquePaper
1 source
OLogic explique comment les robots peuvent apprendre par démonstration humaine à RoboBusiness
2Robotics Business Review 

OLogic explique comment les robots peuvent apprendre par démonstration humaine à RoboBusiness

OLogic, société californienne de recherche et développement en systèmes embarqués, annonce que son cofondateur et PDG Ted Larson animera une session intitulée « Egocentric Robot Learning: Teaching Robots Through Human Experience » lors de RoboBusiness 2026, qui se tiendra les 20 et 21 octobre à Santa Clara, en Californie. L'intervention est programmée le deuxième jour du salon, à 10h45. Larson y présentera les fondements de l'apprentissage égocentrique, une méthode consistant à entraîner des robots à partir de démonstrations humaines filmées à la première personne, captées via caméras portables, systèmes de téléopération ou plateformes d'IA incarnée. OLogic met en avant les plus de 25 ans d'expérience de Larson en robotique et électronique grand public, et a par le passé contribué à des robots commerciaux tels que l'AMR de Bear Robotics, l'AMR de Locus Robotics, le robot social KiKi de Zoetic, le robot d'inventaire Tally de Simbe Robotics et le robot personnel de Misty Robotics. Diplômé de Cal Poly en informatique, Larson a aussi travaillé avec Google, Hasbro, Savioke et Panasonic, et intervient régulièrement à RoboBusiness depuis plusieurs éditions. L'enjeu dépasse le simple créneau de conférence : l'apprentissage par imitation à partir de données égocentriques s'impose comme une réponse à la pénurie de main-d'œuvre, à la demande croissante de personnalisation et à la complexité opérationnelle qui freinent l'automatisation dans la fabrication, la logistique, la santé et la robotique de service. Elle promet, en théorie, de réduire le temps, le coût et l'expertise nécessaires pour déployer un robot, en le faisant apprendre du comportement humain plutôt que par programmation manuelle. Pour les intégrateurs et décideurs B2B, cette session confirme que la bascule vers des modèles de fondation appliqués à la robotique, portée par des acteurs comme NVIDIA, Google DeepMind et Meta, continue de structurer les feuilles de route au-delà des seuls laboratoires de recherche. Il faut toutefois noter que l'article ne fournit aucun résultat chiffré, ni taux de réussite, ni volume de déploiement : il s'agit d'une annonce de conférence promouvant une intervention à venir, pas d'un lancement produit ni d'un déploiement documenté. Ce mouvement s'inscrit dans une dynamique où l'apprentissage égocentrique gagne du terrain depuis les travaux publiés par de grands laboratoires sur la collecte de données multimodales et les modèles de fondation pour la robotique, entraînant dans leur sillage un écosystème croissant de startups spécialisées en imitation learning et en intelligence incarnée. OLogic se positionne comme prestataire de R&D embarquée plutôt que fabricant de robots propriétaire, bâtissant sa légitimité sur des collaborations répétées avec des acteurs variés du secteur, de Bear Robotics à Misty Robotics en passant par Simbe Robotics et Zoetic. RoboBusiness reste l'un des rendez-vous de référence pour les développeurs de robotique commerciale, avec keynotes, sessions techniques et espaces de réseautage ; les inscriptions sont ouvertes, avec des tarifs réduits pour le monde académique, les associations et les groupes d'entreprises. Aucun pilote client ni calendrier de déploiement lié spécifiquement à cette présentation n'est annoncé pour l'instant, au-delà de l'intervention elle-même.

IA physiqueActu
1 source
Contrôle robotique sans démonstration via des agents LLM
3arXiv cs.RO 

Contrôle robotique sans démonstration via des agents LLM

Des chercheurs ont publié FAEA (Frontier Agent as Embodied Agent), un framework qui applique directement aux manipulateurs robotiques les architectures d'agents LLM conçues pour le génie logiciel, sans démonstrations spécifiques à la tâche ni fine-tuning. Évalué sur trois benchmarks de référence en simulation avec accès privilégié à l'état de l'environnement (positions des objets fournies directement, sans perception visuelle brute), FAEA atteint des taux de succès de 84,9 % sur LIBERO, 85,7 % sur ManiSkill3, et 96 % sur MetaWorld, en utilisant le Claude Agent SDK d'Anthropic comme modèle frontier non modifié. Une itération optionnelle de feedback humain porte le score LIBERO à 88,2 %. Ces résultats se rapprochent des performances des modèles VLA (Vision-Language-Action) entraînés sur moins de 100 démonstrations par tâche, seuil qui représente aujourd'hui le plancher de coût pour la collecte de données en robotique incarnée. L'implication centrale est notable : pour les tâches de manipulation dominées par la planification délibérative à haut niveau, un agent généraliste non spécialisé peut suffire, sans pipeline de données propriétaire. FAEA peut en outre explorer de façon autonome des scénarios inédits en simulation et générer des trajectoires réussies pour augmenter les datasets d'entraînement, court-circuitant ainsi le goulot de la collecte humaine. Nuance critique : tous les tests restent en simulation avec état privilégié ; aucun transfert sim-to-real n'est validé dans ce travail, ce qui limite la portée des conclusions pour un déploiement industriel réel. Les modèles VLA entraînés bout-en-bout, pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA, dominent la recherche en manipulation depuis 2023 mais restent contraints par des pipelines de collecte de données coûteux et spécifiques à chaque domaine. FAEA s'inscrit dans un courant alternatif qui cherche à exploiter l'infrastructure d'agents software directement en robotique : la même boucle plan-act-observe-debug qui pilote les agents de coding est ici transférée sans modification au contrôle de manipulateurs. Ce positionnement implique un bénéfice passif : toute amélioration des modèles frontier se répercute directement sur les capacités robotiques sans retraining. Le préprint est disponible sur arXiv (2601.20334v2) et le code sur GitHub ; aucun déploiement industriel n'est annoncé à ce stade.

IA physiquePaper
1 source
Structure-Aware Robust Fine-Tuning : défendre les robots vision-langage-action contre le détournement de l'attention physique
4arXiv cs.RO 

Structure-Aware Robust Fine-Tuning : défendre les robots vision-langage-action contre le détournement de l'attention physique

Des chercheurs publient sur arXiv (2608.03231v1) une attaque baptisée AGSD (Attention-Guided Semantic Disruption) : un patch adversarial imprimable, optimisé par Expectation-over-Transformation pour rester efficace sous différents angles et éclairages, qui détourne vers lui-même l'attention conditionnée par l'action des politiques Vision-Language-Action (VLA), au détriment des régions pertinentes pour la tâche. Sur le benchmark de manipulation LIBERO, ce patch fait grimper le taux d'échec du modèle OpenVLA à 100%. Face à cette menace, les auteurs proposent SARF (Structure-Aware Robust Fine-Tuning), une défense qui ne réentraîne que l'encodeur visuel via trois mécanismes (ancrage de features, correction de l'attention critique pour la politique, cohérence géométrique guidée par le langage), sans aucun surcoût en inférence. SARF ramène le taux d'échec sous attaque entre 14,2% et 56,8% selon les suites de tâches (28,6% en moyenne), tout en préservant les performances en conditions normales. Sur un bras manipulateur réel PiPER, le taux de succès sous attaque passe de 23,0% à 65,0% grâce à cette défense. Cette étude révèle une faille de sécurité physique largement absente des benchmarks habituels des modèles VLA, ces politiques génériques censées piloter bras industriels, AMR et humanoïdes à partir d'instructions en langage naturel. Qu'un simple autocollant imprimé fasse chuter le taux de réussite à zéro, et que l'attaque transfère entre tâches et architectures différentes, suggère une vulnérabilité structurelle plutôt qu'un défaut isolé d'OpenVLA. Pour les intégrateurs et décideurs B2B qui envisagent des déploiements sur ligne de production ou en environnement partagé avec des humains, l'évaluation de la robustesse adversariale physique devient aussi nécessaire que les tests classiques de précision ou de temps de cycle. L'absence de surcoût en inférence fait de SARF une piste de mitigation réaliste pour des systèmes déjà contraints en latence. OpenVLA, cible principale de l'étude, compte parmi les politiques vision-language-action open source les plus utilisées depuis 2024, aux côtés de modèles comme Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure. LIBERO sert de référence standard pour évaluer la généralisation des politiques de manipulation en simulation, et ce travail prolonge une littérature déjà ancienne sur les patchs adversariaux physiques en vision par ordinateur, longtemps étudiés contre les systèmes de conduite autonome, désormais transposée aux politiques robotiques génériques. Les auteurs ne mentionnent aucun partenariat industriel ni calendrier de déploiement : il s'agit d'une contribution de recherche en sécurité, publiée en amont de toute adoption commerciale à grande échelle des VLA sur des lignes de production.

UEAucune entreprise ou institution française/européenne n'est citée, mais tout intégrateur européen envisageant un déploiement de politiques VLA en environnement industriel ou partagé avec des humains devrait intégrer ce type de test de robustesse adversariale physique.

IA physiqueActu
1 source