Aller au contenu principal
Généraliser les compétences de manipulation avec un agent de codage local
RecherchearXiv cs.RO 

Généraliser les compétences de manipulation avec un agent de codage local

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont testé un système où un modèle de langage-vision open-weight, exécuté localement, pilote un bras robotique UR3e en écrivant et exécutant lui-même son propre code, sans programmation ni entraînement spécifique pour chaque nouvelle tâche. Le modèle utilisé, Qwen3.8-27B, agit comme un agent de codage placé au-dessus d'un service qui fournit la cinématique, les limites de sécurité et des techniques classiques de vision par ordinateur. Les auteurs ont évalué le système sur neuf tâches construites à partir de jouets pour enfants, conçues pour tester la généralisation selon la couleur, la taille, la forme et les variations de la tâche elle-même. Sur 45 essais au total (cinq par tâche), le robot a réussi à généraliser dans 30 cas, avec des temps d'exécution allant de 3,4 à 67,5 minutes selon la complexité de la tâche. Lorsqu'on demandait à l'agent de refaire une tâche déjà réussie, la durée chutait de 50%, signe d'une forme d'auto-amélioration au fil des répétitions. L'étude, publiée en préprint sur arXiv, reste une démonstration de laboratoire sur un bras fixe, sans déploiement industriel ni produit commercialisé.

L'intérêt de ce travail est de tester une alternative aux approches dominantes de la robotique pilotée par le langage, qui reposent soit sur une interface d'action figée, soit sur une politique entraînée de type VLA (vision-language-action), à l'image de Pi-0, GR00T N2 ou Helix. Ces méthodes généralisent mal à de nouvelles tâches sans collecte de données supplémentaire ni réentraînement, ce qui freine leur adoption chez les intégrateurs. En laissant un modèle local générer et exécuter du code plutôt que produire directement des actions, les auteurs cherchent à contourner ce goulot d'étranglement : un taux de réussite de deux tiers et une division par deux du temps d'exécution après une première réussite suggèrent qu'un agent de codage local peut s'adapter à la volée à des variations d'objets sans nouvelle donnée d'entraînement. Le résultat reste à nuancer : des temps de cycle dépassant l'heure pour les tâches complexes restent très éloignés des standards industriels, et neuf tâches construites à partir de jouets ne reflètent pas la diversité d'un environnement de production réel.

Ce travail s'inscrit dans la dynamique des modèles de langage open-weight capables d'écrire, exécuter et déboguer du code de façon autonome sur une seule station de travail, capacité que les auteurs transposent ici du logiciel pur à la commande physique d'un robot. Il se positionne en contrepoint des grands modèles VLA propriétaires ou semi-ouverts développés par des laboratoires de robotique manipulatrice et humanoïde comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), qui misent sur des politiques massivement entraînées plutôt que sur du code généré à la volée. Les auteurs présentent leur approche comme préliminaire, reconnaissent des limites qu'ils ne détaillent pas dans le résumé, et annoncent vouloir approfondir le mécanisme d'auto-amélioration observé pour ouvrir la voie à un déploiement réel de ce type d'agent local en robotique. Aucun calendrier ni partenariat industriel n'est mentionné à ce stade.

Impact France/UE

Le bras robotique testé est un UR3e du fabricant danois Universal Robots, ce qui concerne indirectement l'écosystème robotique industriel européen, mais aucune entreprise ou institution européenne n'est impliquée dans l'étude elle-même.

À lire aussi

RoboSynChallenge : maîtriser la dextérité réelle par généralisation de compétences de manipulation synthétisées
1arXiv cs.RO 

RoboSynChallenge : maîtriser la dextérité réelle par généralisation de compétences de manipulation synthétisées

Publiée sur arXiv en août 2026 (arXiv:2608.12416), la compétition RoboSynChallenge propose un benchmark unifié pour évaluer la généralisation des politiques de manipulation robotique sur des tâches, environnements et niveaux de difficulté variés. Le format combine génération de données synthétiques à grande échelle, utilisables par les participants pour entraîner leurs modèles à partir de trajectoires état-action simulées, et une évaluation finale menée exclusivement sur des environnements réels inédits, jamais rencontrés à l'entraînement. Les organisateurs fournissent des implémentations de référence pour quatre familles d'architectures, Transformer, diffusion, Vision-Language-Action (VLA) et World-Action-Model, afin de garantir reproductibilité et comparabilité entre équipes. L'article, de nature méthodologique, ne communique ni nombre de participants, ni calendrier, ni métriques chiffrées: il s'agit d'une annonce de benchmark, pas d'un résultat de compétition ni d'un produit commercial. L'initiative vise un goulot d'étranglement identifié de longue date dans la robotique manipulative: la rareté et le manque de diversité des données réelles limitent l'entraînement de politiques généralistes, alors que les architectures de modèles progressent plus vite que les données disponibles. En imposant une évaluation strictement sur du réel non vu, RoboSynChallenge teste directement l'hypothèse dominante du secteur depuis deux ans, celle d'un écart sim-to-real comblable par la donnée synthétique à grande échelle, condition jugée nécessaire pour que les politiques VLA généralisent au-delà d'un site de démonstration. Pour les intégrateurs et décideurs industriels, un tel benchmark standardisé offre un point de comparaison plus rigoureux que les vidéos promotionnelles des fournisseurs de robots humanoïdes ou de bras manipulateurs, en isolant la vraie capacité de généralisation des effets de mémorisation propres à un environnement donné. Le défi s'inscrit dans la multiplication, depuis 2024-2025, de benchmarks académiques structurant la recherche en intelligence incarnée, à mesure que les laboratoires publient des politiques génériques entraînées sur des corpus multi-tâches et multi-robots. En diffusant des baselines ouvertes plutôt qu'un classement fermé, les organisateurs cherchent à fédérer une communauté de recherche autour d'une méthodologie de test commune. L'article ne cite aucune entreprise ni partenaire industriel, et ne précise ni calendrier d'inscription ni date de clôture des soumissions, ces éléments restant à communiquer.

RecherchePaper
1 source
ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation
2arXiv cs.RO 

ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation

Une équipe de chercheurs a publié ATOM-Bench, un benchmark de terrain conçu pour évaluer les politiques de manipulation robotique sur deux dimensions distinctes : l'acquisition de compétences atomiques et la généralisation compositionnelle. Le dispositif décompose la manipulation sur table en "atomes moteurs" (précision de préhension, trajectoire du poignet, force de contact) et en "atomes d'instruction" (comptage, filtrage logique, ancrage sémantique). Il comprend 30 tâches atomiques et 24 tâches compositionnelles inédites, testées sur des configurations bras unique et bras double. Les auteurs ont collecté 3 000 démonstrations humaines pour le fine-tuning et effectué 2 700 rollouts physiques sur cinq politiques de manipulation représentatives. Les métriques introduites, l'Atomic Score (AS) et le Compositional Failure Share (CFS), permettent d'isoler la source d'un échec : exécution moteur défaillante, mauvais ancrage instruction, ou incapacité à recombiner des compétences acquises. Les résultats remettent en cause un postulat courant dans le secteur : que des politiques performantes sur des tâches atomiques généralisent naturellement à des tâches compositionnelles. Ce n'est pas le cas. Malgré des scores atomiques corrects sur l'ancrage d'instructions simples, les modèles testés échouent systématiquement sur le comptage, le filtrage logique et les atomes moteurs fins. Plus significatif encore, une bonne performance atomique ne prédit pas fiablement la réussite sur les tâches compositionnelles hors distribution. Pour un intégrateur ou un décideur industriel, cela signifie que les benchmarks classiques sur tâches démontrées surestiment largement la robustesse opérationnelle des politiques dites "généralistes". ATOM-Bench s'inscrit dans un contexte où les politiques VLA (Vision-Language-Action) comme pi0 (Physical Intelligence), Octo, ou OpenVLA sont présentées comme des fondations universelles pour le contrôle robotique. Ce cadre d'évaluation comble l'absence de protocole standardisé pour tester la composabilité des compétences, un angle mort identifié depuis les travaux sur l'abstraction hiérarchique en RL. Les données de démonstration et les rollouts d'évaluation sont publiés en open access pour permettre une comparaison reproductible entre équipes. La prochaine étape logique serait d'intégrer ATOM-Bench comme protocole de validation dans les pipelines de fine-tuning des acteurs du secteur, notamment pour qualifier des déploiements réels en environnement industriel non contrôlé.

UELes laboratoires et intégrateurs européens travaillant sur des politiques de manipulation robotique peuvent adopter ATOM-Bench comme protocole de validation open-access pour qualifier la robustesse réelle de leurs systèmes avant déploiement industriel.

RecherchePaper
1 source
OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
3arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source
Whole-Body UMI : transfère les compétences de manipulation aux humanoïdes par génération de mouvement en temps réel
4arXiv cs.RO 

Whole-Body UMI : transfère les compétences de manipulation aux humanoïdes par génération de mouvement en temps réel

Un article publié le 22 septembre 2026 sur arXiv (2609.22829) présente Whole-Body UMI (WB-UMI), une méthode qui étend l'Universal Manipulation Interface (UMI), protocole de collecte de démonstrations par préhenseur portatif qui évite la téléopération, au contrôle corps entier des robots humanoïdes. Le système ajoute un générateur de mouvement temps réel conditionné par la position de l'effecteur, entraîné séparément sur des données de capture de mouvement retargetées, sans capteurs corporels ni démonstrations appariées. En déploiement, une architecture asynchrone combine une politique de diffusion apprise sur les démonstrations UMI natives, ce générateur de mouvement et un contrôleur corps entier avec compensation de latence. Testée sur le robot G1 d'Unitree, l'approche atteint 90% de réussite pour fermer un tiroir, 80% pour un pick-and-place sur étagère, 40% pour une tâche combinant déplacement et prise (Loco-PnP), et 30% pour un lancer de balle. Cet écart de performance, de 90% à 30% selon les tâches, montre que le transfert de compétences captées à la main vers un contrôle corps entier reste partiel, les mouvements dynamiques comme le lancer restant nettement plus difficiles que des gestes quasi-statiques. Pour l'industrie humanoïde, l'enjeu dépasse la démonstration technique : la téléopération demeure le principal goulot d'étranglement pour entraîner des politiques vision-language-action sur des robots à jambes, et découpler l'apprentissage de la coordination corps entier de celui de la sémantique de tâche réduirait la dépendance à des données coûteuses capturées directement sur le robot. Le travail teste ainsi, en boucle fermée sur robot réel, l'hypothèse qu'une interface de collecte générique comme UMI peut s'étendre aux humanoïdes sans instrumentation corporelle supplémentaire. UMI avait été conçu comme un outil de collecte à bas coût pour l'apprentissage de politiques de manipulation, via un préhenseur instrumenté plutôt qu'un robot téléopéré. WB-UMI s'inscrit dans une compétition plus large de modèles vision-language-action et d'architectures de contrôle humanoïde, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent toutes à réduire le coût de la collecte de données réelles. Contrairement à ces initiatives industrielles, WB-UMI reste une contribution académique en preprint, validée sur quatre tâches avec un seul robot, le G1 d'Unitree, sans partenaire annoncé ni calendrier de déploiement.

RecherchePaper
1 source