
Généraliser les compétences de manipulation avec un agent de codage local
Des chercheurs ont testé un système où un modèle de langage-vision open-weight, exécuté localement, pilote un bras robotique UR3e en écrivant et exécutant lui-même son propre code, sans programmation ni entraînement spécifique pour chaque nouvelle tâche. Le modèle utilisé, Qwen3.8-27B, agit comme un agent de codage placé au-dessus d'un service qui fournit la cinématique, les limites de sécurité et des techniques classiques de vision par ordinateur. Les auteurs ont évalué le système sur neuf tâches construites à partir de jouets pour enfants, conçues pour tester la généralisation selon la couleur, la taille, la forme et les variations de la tâche elle-même. Sur 45 essais au total (cinq par tâche), le robot a réussi à généraliser dans 30 cas, avec des temps d'exécution allant de 3,4 à 67,5 minutes selon la complexité de la tâche. Lorsqu'on demandait à l'agent de refaire une tâche déjà réussie, la durée chutait de 50%, signe d'une forme d'auto-amélioration au fil des répétitions. L'étude, publiée en préprint sur arXiv, reste une démonstration de laboratoire sur un bras fixe, sans déploiement industriel ni produit commercialisé.
L'intérêt de ce travail est de tester une alternative aux approches dominantes de la robotique pilotée par le langage, qui reposent soit sur une interface d'action figée, soit sur une politique entraînée de type VLA (vision-language-action), à l'image de Pi-0, GR00T N2 ou Helix. Ces méthodes généralisent mal à de nouvelles tâches sans collecte de données supplémentaire ni réentraînement, ce qui freine leur adoption chez les intégrateurs. En laissant un modèle local générer et exécuter du code plutôt que produire directement des actions, les auteurs cherchent à contourner ce goulot d'étranglement : un taux de réussite de deux tiers et une division par deux du temps d'exécution après une première réussite suggèrent qu'un agent de codage local peut s'adapter à la volée à des variations d'objets sans nouvelle donnée d'entraînement. Le résultat reste à nuancer : des temps de cycle dépassant l'heure pour les tâches complexes restent très éloignés des standards industriels, et neuf tâches construites à partir de jouets ne reflètent pas la diversité d'un environnement de production réel.
Ce travail s'inscrit dans la dynamique des modèles de langage open-weight capables d'écrire, exécuter et déboguer du code de façon autonome sur une seule station de travail, capacité que les auteurs transposent ici du logiciel pur à la commande physique d'un robot. Il se positionne en contrepoint des grands modèles VLA propriétaires ou semi-ouverts développés par des laboratoires de robotique manipulatrice et humanoïde comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), qui misent sur des politiques massivement entraînées plutôt que sur du code généré à la volée. Les auteurs présentent leur approche comme préliminaire, reconnaissent des limites qu'ils ne détaillent pas dans le résumé, et annoncent vouloir approfondir le mécanisme d'auto-amélioration observé pour ouvrir la voie à un déploiement réel de ce type d'agent local en robotique. Aucun calendrier ni partenariat industriel n'est mentionné à ce stade.
Le bras robotique testé est un UR3e du fabricant danois Universal Robots, ce qui concerne indirectement l'écosystème robotique industriel européen, mais aucune entreprise ou institution européenne n'est impliquée dans l'étude elle-même.
Dans nos dossiers




