Aller au contenu principal
RecherchearXiv cs.RO 

LEMCA : synthèse d'architectures de contrôle à commutation de modes efficaces guidée par LLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs a l'origine du preprint publie le 21 septembre 2026 sur arXiv (2609.21319) proposent LEMCA (LLM-Guided synthesis of Efficient Mode-Switching Control Architectures), une méthode pour concevoir automatiquement des contrôleurs robotiques capables de basculer entre plusieurs modes mobilisant des ressources de calcul et de perception différentes selon la difficulté de la tache. Chaque architecture est représentée comme un programme interprétable, améliore par une boucle évolutionnaire: a chaque itération, un grand modèle de langage édité le code du contrôleur, la liste de ses modes, l'allocation capteurs-calcul de chacun et les règles de transition, tandis que la qualité des variantes est évaluée via des extensions compatibles MSC de méthodes de synthèse automatique de contrôleurs, dont l'apprentissage par renforcement en simulation. Sur plusieurs bancs d'essai de contrôle, LEMCA dépasse systématiquement la frontière de Pareto performance/ressources des architectures monolithiques classiques, en récupérant les ressources gaspillées pendant les phases faciles d'une tache. Ces résultats restent valides en simulation, sur des benchmarks de recherche, sans déploiement rapporte sur robot physique.

L'enjeu concerne directement l'industrie robotique: la plupart des architectures actuelles allouent en permanence le budget de calcul et de capteurs le plus élevé, celui de la phase la plus exigeante, même durant des sous-taches triviales, ce qui gaspille énergie et puissance embarquée et limite l'autonomie. Automatiser la conception de contrôleurs a commutation de mode via un LLM, plutôt que de la confier a des ingénieurs pendant des semaines, ouvre la voie a des systèmes embarques moins couteux en calcul, un enjeu concret pour les intégrateurs qui font tourner perception et planification sur du matériel contraint. Le travail illustre aussi une tendance plus large: l'usage des LLM non plus comme contrôleurs eux-mêmes, a la manière des modèles VLA tels que GR00T N2, Pi-0 ou Helix, mais comme outils de méta-conception générant et optimisant le code d'autres systèmes de contrôle.

LEMCA s'inscrit dans la lignée des travaux sur la synthèse automatique de contrôleurs et la programmation évolutive guidée par LLM, qui visent a remplacer le réglage manuel d'architectures robotiques par des boucles d'optimisation combinant recherche de programmes et apprentissage par renforcement. Le choix historique entre concevoir des contrôleurs a commutation de mode au prix d'un lourd travail d'ingénierie tache par tache, ou se rabattre sur des architectures monolithiques uniformément couteuses, restait sans solution générique. Le preprint ne mentionne ni calendrier de suite ni partenaire industriel; les auteurs présentent LEMCA comme une première démonstration sur des benchmarks varies, dont la confirmation au-delà de la simulation, notamment sur des taches de manipulation ou de navigation, reste a établir.

Dans nos dossiers

À lire aussi

LENS : simplification d'environnement guidée par LLM pour la planification et le contrôle en milieu encombré
1arXiv cs.RO 

LENS : simplification d'environnement guidée par LLM pour la planification et le contrôle en milieu encombré

Une équipe de recherche publie LENS (LLM-guided Environment Simplification), une méthode qui utilise un grand modèle de langage pour simplifier automatiquement la représentation d'une scène encombrée avant de la transmettre aux modules de planification et de contrôle d'un robot manipulateur. Le système fusionne les objets empilés ou proches et élimine les éléments jugés non pertinents pour la tâche en cours, en boucle fermée et en fonction de la progression réelle de l'exécution. Contrairement aux abstractions de scène classiques, construites manuellement pour chaque tâche par des ingénieurs, LENS génère ces simplifications de façon automatique, spécifique à la scène et à la tâche, et les met à jour en continu. Les auteurs le présentent comme un module ajoutable directement sur des piles de planification et de contrôle existantes, sans réingénierie. Les tests couvrent trois familles d'approches distinctes: la planification classique, le contrôle basé modèle, et un modèle vision-langage-action (VLA), sur un ensemble varié de scènes de manipulation fortement encombrées. Le site du projet est accessible à lens-2026.github.io. L'intérêt de LENS tient au goulot d'étranglement qu'il cible: le passage à l'échelle des abstractions de scène, aujourd'hui produites à la main et donc coûteuses à créer, difficiles à ajuster et non réutilisables d'une tâche à l'autre. Pour les intégrateurs et décideurs en robotique industrielle, c'est précisément ce type de travail d'ingénierie manuelle qui freine le déploiement de robots manipulateurs en environnement réel, où le désordre, les objets distracteurs et l'ambiguïté des tâches multiplient les cas particuliers. En montrant des gains de performance simultanés sur trois paradigmes de contrôle différents, dont un modèle VLA, l'étude appuie l'idée qu'une couche d'abstraction pilotée par LLM peut se greffer en amont de stacks hétérogènes plutôt que d'exiger une solution de bout en bout propre à chaque architecture, ce qui va dans le sens d'une meilleure généralisation en environnement encombré, un point faible reconnu des approches actuelles de manipulation généraliste. Le travail s'inscrit dans la tendance récente consistant à exploiter les LLM comme couche de raisonnement de haut niveau au-dessus de piles robotiques existantes, plutôt que de tout réentraîner de bout en bout, une direction également explorée par des modèles comme GR00T N2 ou Helix pour la manipulation généraliste. La publication, un article arXiv daté du 24 juillet 2026, reste à ce stade une contribution de recherche évaluée en simulation ou en laboratoire selon un protocole expérimental propre aux auteurs, sans indication de partenariat industriel ni de déploiement chez un intégrateur. Les prochaines étapes attendues porteraient sur une validation à plus grande échelle et sur l'intégration effective avec des piles de production, notamment des modèles VLA déployés commercialement.

RecherchePaper
1 source
Passage à l'échelle de la manipulation d'appareils guidée par manuel, avec synthèse de données et planification unifiée
2arXiv cs.RO 

Passage à l'échelle de la manipulation d'appareils guidée par manuel, avec synthèse de données et planification unifiée

Des chercheurs ont publié le 18 août 2026 sur arXiv (référence 2608.15863v1) une étude intitulée "Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning", présentant MAGE, un pipeline de synthèse de données conçu pour entraîner des robots à manipuler des appareils électroménagers en suivant leurs manuels d'utilisation. MAGE s'appuie sur une architecture inédite baptisée Hierarchical Appliance Graph (HAG), qui génère automatiquement des annotations de pièces, des plans d'action à long horizon et des données de correction en boucle fermée directement à partir des manuels d'appareils. Les auteurs en ont tiré UseAppliance, présenté comme le premier jeu de données à grande échelle pour la planification de manipulation d'électroménager ancrée dans la documentation constructeur : 22 catégories d'appareils, plus de 89 000 annotations de pièces, plus de 53 000 tâches de manipulation et plus de 33 000 étapes d'ajustement en boucle fermée. Sur cette base, l'équipe a développé AppliancePlan, un modèle de bout en bout de seulement 7 milliards de paramètres, testé sur le benchmark RealAppliance-Bench où il dépasserait de plus de dix fois la meilleure référence existante en planification en boucle ouverte, avec des expériences robotiques réelles menées sur six appareils domestiques. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : l'absence de jeux de données suffisamment diversifiés et orientés tâche pour entraîner des modèles capables de planification robuste face aux imprévus, un problème qui freine le déploiement de robots polyvalents dans des environnements domestiques réels. La confirmation d'un transfert sim-to-real effectif, même à petite échelle (six appareils), constitue un signal utile pour les intégrateurs qui cherchent à évaluer si les architectures type VLA passent réellement du laboratoire au terrain, plutôt qu'un pur exercice de simulation. Ce projet s'inscrit dans une dynamique de recherche plus large sur la planification à long horizon pour la robotique domestique généraliste, où le manque de données annotées reste un frein structurel identifié par plusieurs laboratoires académiques. Les auteurs présentent leurs résultats comme une étape vers une robotique domestique généraliste, sans toutefois annoncer de calendrier de commercialisation ni de partenariat industriel à ce stade.

RecherchePaper
1 source
Guide robotique : contrôle multi-agents et génération automatique de scénarios par LLM
3arXiv cs.RO 

Guide robotique : contrôle multi-agents et génération automatique de scénarios par LLM

Un article de recherche décrit une nouvelle architecture de contrôle hybride pour robots sociaux, combinant un système de gestion de ressources multi-agents avec une génération automatique de scénarios comportementaux basée sur des grands modèles de langage (LLM). L'objectif est de dépasser les approches traditionnelles, où des scripts manuels synchronisent tant bien que mal les actions du robot et le texte prononcé, et où les méthodes existantes se limitent à des réponses dialoguées courtes. Le système automatise à la fois la préparation des textes et des commandes de comportement non-verbal pour des récits longs, tout en résolvant les conflits de ressources entre les différents mécanismes d'exécution du robot. Il a été testé sur MENTOR-1, un robot guide de visite (tour guide robot), pour lequel il a généré automatiquement des scénarios complets et démontré un comportement jugé plus naturel et plus riche que les approches existantes. L'article, publié sur arXiv (version révisée), ne précise pas de chiffres de déploiement commercial, de prix ni de dates de mise en production sur site. Pour l'industrie robotique, ce travail illustre une tendance de fond : le passage de scripts comportementaux figés à une orchestration pilotée par LLM capable de générer, en amont, des scénarios longs cohérents entre parole et gestuelle, plutôt que de simplement générer des réponses conversationnelles ponctuelles. La gestion multi-agents des ressources d'exécution répond à un problème concret pour les intégrateurs de robots sociaux : éviter que plusieurs modules (voix, gestes, déplacement, expressions) ne se marchent dessus lors d'une interaction prolongée. Si les résultats sont confirmés à plus grande échelle, cela pourrait réduire le travail manuel de script pour les déploiements de robots d'accueil ou de guidage, un segment où la narration longue reste un point faible des architectures actuelles. Il s'agit toutefois d'une preuve de concept académique sur une plateforme unique, pas d'un produit commercial validé en conditions réelles. Ce travail s'inscrit dans la lignée des recherches sur les architectures VLA (vision-langage-action) et la génération de comportements par LLM pour la robotique sociale, un domaine où des acteurs comme Figure ou Google DeepMind (avec des modèles comme Pi-0 ou GR00T) explorent des approches similaires pour des tâches de manipulation, tandis que MENTOR-1 se positionne spécifiquement sur l'interaction sociale et la narration guidée. Aucun acteur français ou européen n'est mentionné dans cette publication. Les prochaines étapes évoquées par les auteurs concernent l'extension du système à d'autres scénarios narratifs et plateformes robotiques, sans calendrier ni partenariat industriel annoncé à ce stade.

RecherchePaper
1 source
De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas
4arXiv cs.RO 

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas

Une équipe de recherche présente dans un article publie en preprint sur arXiv (2609.15382) le World-Action Model (WAM), un système de décision pour l'excavation autonome par chargeuse sur pneus. Comme chaque scoop modifie le relief disponible pour l'action suivante, WAM génère plusieurs trajectoires de godet candidates, éliminé celles géométriquement impossibles, prédit conjointement pour chacune le changement de terrain et le volume charge, puis exécuté celle au chargement prédit le plus élevé avant de replanifier depuis le nouveau relief observe. Sur 32 épisodes de test MinSlope a géométries distinctes, ce classement par modèle du monde applique a des propositions générées par diffusion fait chuter le nombre moyen de passes de godet de 651,8 a 540,6 (-17,1%), préservé un taux de réussite de 32/32 et améliore chaque épisode teste individuellement. En comparaison système complet, WAM termine ses 32 épisodes contre 29 sur 32 pour une politique "soft actor-critic" entraînée séparément. L'équipe a aussi valide l'interface sur des données de chargeuse grandeur réelle et déployé la boucle complète perception-proposition-prédiction-sélection-exécution en conditions physiques, via une implémentation ROS2/TensorRT traitant cinq candidats en 72,4 millisecondes sur un module Jetson AGX Orin. Le résultat vise un problème central du terrassement autonome: chaque action transforme l'environnement de la décision suivante, ce qui rend l'anticipation des conséquences plus déterminante que la seule qualité du mouvement exécuté. En montrant qu'une couche de décision fondée sur un modèle du monde améliore a la fois l'efficacité, moins de passes pour un même résultat, et la fiabilité, taux de complétion supérieur a une politique de renforcement entraînée de bout en bout, l'étude indique que le gain vient du choix explicite entre plusieurs actions possibles plutôt que de la seule politique de mouvement. Pour les intégrateurs et fabricants d'équipements de chantier et de mines, une baisse de 17% du nombre de passes se traduit directement en gains de temps de cycle a l'échelle d'une flotte, même si ces chiffres restent issus de la simulation, l'expérience physique ne démontrant pour l'instant que la faisabilité de la boucle fermée en conditions réelles. Le travail s'inscrit dans l'automatisation des engins de terrassement, ou les approches existantes reposent soit sur des politiques de mouvement générées par diffusion sans raisonnement explicite sur les conséquences terrain, soit sur de l'apprentissage par renforcement comme le soft actor-critic utilise ici en comparaison. Les auteurs testent également plusieurs représentations d'entrée, étendues spatiales et cinq architectures de réseau afin d'identifier un prédicteur "structure par la physique" a la fois précis et rapide, une contribution méthodologique distincte du résultat applicatif. A ce stade, il s'agit d'un article de recherche en preprint, valide sur chargeuse grandeur réelle en boucle expérimentale mais sans déploiement en flotte ni acteur industriel nomme, ce qui le situe cote recherche amont dans un domaine ou l'automatisation des chargeuses et pelles intéressé autant les laboratoires que les fabricants d'équipements de chantier et de mines.

RecherchePaper
1 source