Aller au contenu principal
Génération de code adaptative pour le contrôle de robots
RecherchearXiv cs.RO 

Génération de code adaptative pour le contrôle de robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans un preprint arXiv (2610.09588v1), une architecture de contrôle robotique à double IA pour piloter des robots dans des environnements inconnus et dynamiques à partir d'intentions formulées en langage naturel. Un grand modèle de langage (LLM) traduit des objectifs de haut niveau en code exécutable. Ce code est limité à une bibliothèque robotique formelle et contraint par une syntaxe vérifiable. Un modèle vision-langage (VLM) assure l'ancrage sémantique, c'est-à-dire le lien entre les mots et ce que le robot perçoit, grâce à un processus de distillation. Le système ajoute des déclencheurs de replanification pilotés par l'environnement, fondés sur des seuils géométriques et sémantiques. Il intègre aussi une surveillance continue à l'exécution et une boucle de planification adaptative. Les auteurs l'ont évalué sur plusieurs modèles de pointe. Le résumé ne donne ni DOF, ni temps de cycle, ni taux de réussite chiffré, ni plateforme robotique, ni site de déploiement. Il s'agit d'une contribution de recherche, sans produit ni déploiement.

L'enjeu porte sur la façon d'utiliser les LLM en robotique. L'approche n'est pas celle des modèles vision-langage-action (VLA) de bout en bout, qui produisent directement des actions. Elle génère du code contraint à une bibliothèque de primitives, donc auditable, vérifiable avant exécution et borné par ce que le robot sait faire. Pour un intégrateur ou un responsable industriel, cette propriété compte dans les contextes où la traçabilité et la sécurité priment. Le travail cible trois verrous : l'écart de formalisation entre une intention floue et une action exécutable, l'écart de taxonomie quand l'environnement présente des objets ou situations imprévus, et le suivi de l'état et de la progression dans le temps. Il soutient que ancrer l'IA générative dans une boucle réactive et contrainte permet de remplir des intentions complexes malgré l'incertitude. La prudence s'impose pourtant. Le résumé ne chiffre rien, et un benchmark sur modèles de pointe ne dit pas comment le système tient face aux latences, aux erreurs de perception ou aux pannes matérielles d'un site réel.

Cette publication prolonge la ligne de travaux qui font écrire du code aux LLM pour commander des robots, popularisée par des approches comme Code as Policies, et qui s'oppose aux politiques apprises de bout en bout de type Pi-0, Helix ou GR00T. Les auteurs inscrivent leur démarche dans la vision de robots comme systèmes adaptatifs complexes, passant de bibliothèques de commandes rigides à une autonomie fondée sur l'intention. Le texte ne cite pas de partenaire industriel, de calendrier ni d'étape suivante. Les prochains jalons à surveiller sont la publication des résultats détaillés, d'éventuels essais sur robot physique et la comparaison directe avec les VLA sur des tâches longues en environnement ouvert.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Au-delà de la prédiction du futur : le débruitage comme adaptation générative pour le contrôle des robots
1arXiv cs.RO 

Au-delà de la prédiction du futur : le débruitage comme adaptation générative pour le contrôle des robots

Des chercheurs publient sur arXiv (arXiv:2609.28339v1) une méthode baptisée NowWAM pour entraîner des politiques de contrôle robotique à partir de Diffusion Transformers (DiT) pré-entraînés sur de la génération d'images et de vidéos. Plutôt que de prédire des images futures pour transférer ce prior génératif vers le contrôle, comme le font la plupart des approches existantes, NowWAM débruite l'observation courante et prédit les actions du robot à partir du même flux visuel, sans cible visuelle future séparée. Sur le benchmark de simulation LIBERO-Plus, avec un backbone FLUX2-Klein, la méthode atteint 87,7 % de réussite, soit 6,1 points de plus qu'une base entraînée avec prédiction du futur, tout en divisant par deux le nombre de tokens visuels d'entraînement (784 à 392) et en réduisant le temps par étape de 2,85 à 1,63 seconde, un gain de vitesse de 1,8x. Avec un backbone texte-vers-image pur, Z-Image, sans capacité de génération vidéo ni d'édition d'image, NowWAM atteint 87,8 %. Le résultat central du papier est que restreindre l'entraînement au seul point d'arrivée débruité dégrade nettement la robustesse, alors que remplacer la cible future par la cible présente ne change quasiment rien aux performances. Cela suggère que ce n'est pas la prédiction du futur en tant que telle qui rend utile le prior génératif des DiT pour le contrôle, mais la trajectoire de débruitage elle-même, utilisée comme interface d'apprentissage. Pour le secteur des politiques robotiques de type VLA (vision-language-action), bâties sur des bases génératives comparables à celles derrière Pi-0 ou GR00T N2, ce travail remet en cause l'hypothèse répandue selon laquelle un module de prédiction vidéo du futur serait nécessaire pour exploiter un prior génératif. Il ouvre aussi une piste d'efficacité concrète: moitié moins de tokens visuels et un temps de calcul par étape quasi divisé par deux, un enjeu direct pour le contrôle temps réel embarqué. Ce travail s'inscrit dans la tendance à construire des politiques de contrôle sur des DiT pré-entraînés à grande échelle, une lignée qui inclut des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, généralement adaptés via prédiction visuelle du futur. NowWAM se positionne comme une alternative de co-entraînement plus économe, comparée sous conditions contrôlées à une base "future prédiction" sur LIBERO-Plus, un environnement de simulation standard pour la manipulation, et non un déploiement sur robot réel. Les auteurs montrent que l'adaptation au contrôle ne dépend pas d'un backbone spécialisé en vidéo ou en édition d'image, élargissant les bases génératives exploitables en robotique. Publié en preprint, l'article ne mentionne aucun déploiement industriel ni partenariat commercial; ses conclusions restent à confirmer au-delà du benchmark simulé.

RechercheActu
1 source
Génération itérative et compositionnelle de données pour le contrôle de robots
2arXiv cs.RO 

Génération itérative et compositionnelle de données pour le contrôle de robots

Une équipe de chercheurs propose, dans un article arXiv (2512.10891, cinquième révision), un modèle génératif appelé "semantic compositional diffusion transformer" pour produire des données d'entraînement en manipulation robotique. Le principe central consiste à décomposer chaque transition dans l'espace d'état en quatre composantes distinctes, propres au robot, aux objets manipulés, aux obstacles, et à l'objectif de la tâche, dont les interactions sont apprises via des mécanismes d'attention. Entraîné sur un sous-ensemble limité de combinaisons de tâches, le modèle génère en inférence zéro-shot des transitions synthétiques de haute qualité pour des configurations jamais vues : nouveaux objets, nouveaux environnements, nouvelles associations robot-tâche. Un processus d'auto-amélioration itératif complète l'approche : les données synthétiques générées sont validées par apprentissage par renforcement hors-ligne (offline RL), puis réintégrées dans les rounds d'entraînement suivants. Au terme de ce cycle, le système résout la quasi-totalité des tâches de test non vues lors de l'entraînement. L'enjeu industriel est direct : collecter des démonstrations robotiques réelles pour couvrir l'espace combinatoire de toutes les tâches possibles en environnement multi-objets, multi-robots, multi-sites est économiquement prohibitif. Ce travail démontre qu'une structure compositionnelle apprise permet de briser cette malédiction combinatoire, sans démonstrations exhaustives. La boucle génération-validation-réentraînement est particulièrement notable : elle réduit le risque classique de drift sim-to-real en filtrant les transitions synthétiques non viables avant qu'elles ne contaminent le pipeline de policy learning. Les résultats surpassent significativement les baselines monolithiques et les approches compositionnelles à règles fixes (hard-coded), ce qui suggère que la structure compositionnelle émergente est réellement capturée par les représentations apprises, et non artificiellement injectée. Ce travail s'inscrit dans une dynamique de recherche qui cherche à contourner le goulot d'étranglement des données en robotique, aux côtés d'approches comme Diffusion Policy (Chi et al., CMU) ou les Visual Language Action models (VLA) tels que Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). Là où ces derniers misent sur des fondations visuolinguistiques massives, cette contribution cible la généralisation compositionnelle avec des données d'entraînement réduites. La première soumission datant de décembre 2025 et le papier en étant à sa cinquième révision, les auteurs ont visiblement consolidé leurs expériences au fil des retours communautaires. Les prochaines étapes naturelles seraient une validation sur hardware réel et une extension aux chaînes de manipulation longue-horizon, domaine où l'absence de compositionnalité reste le principal point de rupture des approches actuelles.

RecherchePaper
1 source
OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel
3arXiv cs.RO 

OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel

Des chercheurs publient OGPO (One-Step Generative Policy Optimization), un cadre d'apprentissage pour le contrôle robotique en temps réel, dont la version 2 vient d'être diffusée sur arXiv (2601.20701). Il vise un problème précis : les politiques de contrôle fondées sur la diffusion ou le flow matching génèrent les actions en plusieurs étapes d'échantillonnage, ce qui limite leur usage dès que la latence compte. Réduire ce nombre d'étapes à un seul dégrade d'ordinaire la qualité de représentation et la performance sur la tâche. Les auteurs décrivent un compromis à trois pôles entre vitesse, fidélité et performance. OGPO associe une architecture légère au principe d'« interval velocity » pour une inférence en une étape sans distillation, tandis qu'une technique de « représentation spreading » évite la dégradation des représentations. Une phase d'apprentissage par renforcement (RL) on-policy affine ensuite cette politique rapide et stable. Sur les benchmarks RoboMimic et OpenAI Gym, la méthode égale ou dépasse des références multi-étapes, avec une inférence 5 à 20 fois plus rapide et une fréquence de contrôle supérieure à 120 Hz. Un déploiement physique sur un bras Franka Emika Panda est présenté comme validation. L'intérêt tient à la place des politiques génératives dans la robotique actuelle. Diffusion et flow matching sont devenus des choix courants pour représenter des comportements multimodaux, y compris dans plusieurs architectures VLA (vision-langage-action). Leur coût d'inférence impose pourtant des compromis : fréquences de contrôle basses, découpage des actions en blocs (chunking), ou matériel de calcul embarqué plus lourd. Une politique à plus de 120 Hz sans distillation, si les résultats tiennent, rapprocherait ces méthodes des boucles de contrôle réactives, utiles pour la manipulation fine ou le contact. L'ajout du RL on-policy répond à une limite connue de l'apprentissage par imitation, dont la performance reste bornée par la qualité des démonstrations. Les réserves sont claires : RoboMimic et Gym sont des benchmarks académiques, la validation réelle se limite à un seul bras et le résumé ne détaille ni les tâches physiques, ni le taux de réussite, ni le matériel de calcul. Le gain de 5 à 20 fois dépend des références choisies. Ce travail s'inscrit dans une course à l'accélération des politiques génératives. Diffusion Policy a imposé le paradigme, les approches de flow matching comme Pi-0 l'ont repris à plus grande échelle, et plusieurs équipes explorent la distillation en peu d'étapes ou le fine-tuning par RL de ces politiques. OGPO prend une voie sans distillation, en combinant vitesse et amélioration par renforcement. Il s'agit ici d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra des preuves sur des tâches plus variées, sur des robots différents et, surtout, de son intégration dans de grands modèles VLA. Une page de projet accompagne l'article.

RecherchePaper
1 source
Emcar : contrôleur incarné pour l'animation de robots
4arXiv cs.RO 

Emcar : contrôleur incarné pour l'animation de robots

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2506.26008) la description d'EMCAR, un outil logiciel de programmation de mouvements robotiques basé sur des métaphores artistiques comme la marionnette et le dessin. La plateforme, présentée dans le cadre de la recherche en interaction humain-robot (HRI), adopte une approche no-code : aucune ligne de code n'est requise pour concevoir, tester et déployer des comportements sur des robots collaboratifs. L'article ne précise pas de plateformes matérielles cibles ni de métriques de performance (temps de programmation, taux d'erreur), ce qui limite l'évaluation des gains réels. L'enjeu central est celui de l'accessibilité : la programmation de cobots reste aujourd'hui l'apanage d'ingénieurs formés en robotique ou en ROS, ce qui freine le déploiement dans des environnements non-industriels (médiation culturelle, thérapie, spectacle vivant). En ouvrant l'outil à des artistes et à des profils sans bagage technique, EMCAR vise à élargir le spectre des cas d'usage HRI et à alimenter la recherche participative. Si la démonstration tient à l'échelle, cela confirmerait que l'abstraction par le geste et le mouvement peut substituer efficacement les interfaces de programmation classiques pour des tâches expressives. Ce type d'approche s'inscrit dans un courant établi : Choreograph de SoftBank Robotics pour Pepper et NAO, les interfaces de programmation par démonstration de Universal Robots, ou encore les environnements visuels Scratch-for-robots développés en milieu académique. Des acteurs français comme Enchanted Tools (Miroki) explorent également des paradigmes d'interaction expressifs pour les cobots. La suite dépendra de l'ouverture du code et des validations expérimentales avec des utilisateurs non-techniques, non encore publiées.

UESi EMCAR publie son code en open-source avec validation expérimentale, des acteurs français comme Enchanted Tools (Miroki) pourraient accélérer leurs interfaces de programmation expressive pour cobots dans des secteurs non-industriels (médiation culturelle, thérapie).

RecherchePaper
1 source