Aller au contenu principal
RecherchearXiv cs.RO 

RoboPilot : manipulation robotique dynamique généralisable grâce à un double mode de raisonnement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient RoboPilot, un cadre agentique en boucle fermée pour la manipulation robotique, présenté dans la version 2 d'un article déposé sur arXiv (2510.00154). Le système s'appuie sur des actions primitives, c'est-à-dire des briques de mouvement prédéfinies, pour structurer la planification des tâches et générer des actions de manière flexible. Il intègre un retour d'information qui permet de replanifier lorsque l'environnement change ou qu'une erreur d'exécution survient. Un raisonnement par chaîne de pensée (Chain-of-Thought) guide à la fois la planification de haut niveau et la génération d'actions de bas niveau. Le système bascule dynamiquement entre une pensée rapide, plus économe, et une pensée lente, plus précise. Les auteurs introduisent aussi RoboPilot-Bench, un banc d'essai de 21 tâches réparties en 10 catégories, qui inclut la reconnaissance de tâches infaisables et la récupération dynamique après incident. Selon eux, RoboPilot dépasse les meilleures méthodes de référence de 11 % en taux de réussite, et un déploiement réel sur un robot industriel confirme sa robustesse.

L'intérêt tient au problème visé. Les tâches longues ou complexes restent un point faible de la manipulation robotique, car la plupart des approches fonctionnent en boucle ouverte, avec peu de raisonnement et aucun retour. Une erreur s'accumule alors d'étape en étape et la moindre perturbation de l'environnement fait échouer la séquence. Pour un intégrateur ou un responsable d'atelier, la capacité à détecter qu'une tâche est infaisable, plutôt que de s'y acharner, et à se rattraper après un incident compte autant que le taux de réussite nominal. Le mécanisme de bascule entre modes rapide et lent répond aussi à une contrainte pratique, car un raisonnement approfondi à chaque pas coûterait trop en latence pour une cellule de production. Des réserves s'imposent toutefois : le gain de 11 % est mesuré sur un banc d'essai conçu par les mêmes auteurs, le résumé ne précise ni les baselines ni le robot industriel utilisé, et ne donne ni temps de cycle ni volume d'essais réels. Il s'agit d'un travail de recherche, sans produit ni déploiement commercial annoncé.

Ce travail s'inscrit dans le mouvement des architectures agentiques qui placent un modèle de langage ou de vision-langage en orchestrateur au-dessus de primitives de contrôle. Il se pose en alternative aux modèles vision-langage-action (VLA) de bout en bout, qui produisent directement des actions mais offrent moins de structure et de contrôle sur la replanification. Cette approche modulaire et interprétable séduit les environnements industriels, où la traçabilité des décisions pèse lourd. Le dépôt d'une version révisée suggère un travail encore en cours de consolidation, sans calendrier de pilote ni de transfert vers l'industrie. La suite dépendra de la publication du code et du benchmark, qui permettrait à d'autres équipes de reproduire les résultats et de comparer RoboPilot aux approches concurrentes sur les mêmes tâches.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Insertion robotique généralisable grâce aux modèles du monde
1arXiv cs.RO 

Insertion robotique généralisable grâce aux modèles du monde

Une équipe de recherche décrit, dans un article publié sur arXiv en septembre 2026 sous le titre "Generalizable Robotic Insertion with World Models" (identifiant 2609.28258v1), un système d'insertion robotique généraliste construit autour d'un modèle du monde (world model) entraîné sur un seul réseau couvrant jusqu'à 90 tâches d'insertion différentes, portant sur des pièces aux géométries variées. Le modèle combine les données proprioceptives du bras robotique avec les images brutes issues d'une caméra montée sur le poignet. Sur des objets totalement inédits, dont la géométrie n'a jamais été vue pendant l'entraînement, le système atteint un taux de réussite de 56% en zero-shot, contre seulement 7% pour une base de référence model-free entraînée dans les mêmes conditions. Les chercheurs montrent aussi que la performance progresse à mesure que le nombre d'objets inclus dans le jeu d'entraînement augmente, signe d'une bonne scalabilité. Un fine-tuning du modèle généraliste sur des objets exclus de l'entraînement initial améliore par ailleurs nettement l'efficacité en données par rapport à un entraînement from scratch, et dépasse parfois ses performances asymptotiques. Ce résultat s'attaque à un goulot d'étranglement connu de l'assemblage robotique en forte mixité de références: les approches actuelles, même très performantes, reposent sur des politiques spécialisées entraînées pièce par pièce, ce qui rend le déploiement sur une nouvelle référence lent et coûteux en ingénierie. Un système capable de généraliser à des pièces jamais vues changerait potentiellement l'équation pour les intégrateurs et les lignes à forte variabilité, en réduisant le travail de reprogrammation à chaque changement de produit. Les auteurs présentent leur travail comme le premier système capable d'assembler des objets inédits de façon entièrement pilotée par les données, sans modélisation géométrique explicite préalable, ce qui alimente le débat sur la capacité réelle des architectures génériques à tenir la charge en manipulation fine, un terrain où l'écart entre démonstration et fiabilité industrielle reste habituellement large. Ce travail s'inscrit dans la tendance de fond de la robotique de manipulation, où la recherche cherche à remplacer les politiques spécialisées task-specific par des modèles généralistes transférables d'un objet ou d'une tâche à l'autre, dans la lignée des efforts en cours autour des architectures vision-langage-action. Il reste à ce stade un résultat de recherche publié en preprint, sans partenaire industriel cité, ni site de déploiement, ni calendrier de commercialisation: les auteurs parlent d'une étape significative vers des systèmes d'assemblage généralisables et scalables, formulation à lire comme un jalon scientifique plutôt qu'une annonce produit. Les suites attendues pour ce type d'approche sont l'extension à davantage de tâches et de géométries, ainsi qu'une validation en conditions de production réelles, où robustesse et temps de cycle devront être mesurés au-delà des benchmarks de laboratoire.

RecherchePaper
1 source
IA incarnée et chaîne de pensée : vers une manipulation robotique généralisable
2arXiv cs.RO 

IA incarnée et chaîne de pensée : vers une manipulation robotique généralisable

Une équipe de chercheurs publie en juin 2026 (arXiv:2606.03784) une réévaluation du chain-of-thought incarné (CoT) appliqué aux modèles vision-langage-action (VLA) pour la manipulation robotique généraliste. Pour mener cette étude à grande échelle, les auteurs ont constitué le plus grand corpus de ce type jamais assemblé : 978 743 trajectoires, 226,3 millions d'échantillons et 2 592,5 heures de données robot. Leur modèle ERVLA atteint 86,9 % de succès sur LIBERO-Plus et 53,2 % sur VLABench, surpassant les baselines de référence, notamment sur les tâches de désambiguïsation sémantique et d'exécution à longue portée en environnement réel. Le code, les données et les checkpoints seront prochainement disponibles en accès ouvert. Le principal apport théorique porte sur la manière d'intégrer le raisonnement linguistique dans une politique robotique. Les auteurs établissent que le CoT explicite, utilisé comme préfixe autorégressif avant chaque action, accumule des erreurs au fil des étapes et génère un couplage instable entre raisonnement et commande motrice. De même, le raisonnement de haut niveau seul, sans ancrage dans des descriptions concrètes comme les trajectoires d'effecteur terminal ou les positions dans l'espace image, n'apporte que des gains marginaux. ERVLA résout cette tension via une stratégie de "reasoning-dropout" : le modèle assimile des traces de raisonnement riches pendant l'entraînement, mais prédit les actions directement à l'inférence, sans décodage CoT. Ce découplage améliore la montée en échelle avec le volume de préentraînement et stabilise l'exécution. C'est un signal clair pour les équipes travaillant sur des politiques généralisables : la valeur du langage réside dans ce qu'il apprend au modèle, pas dans ce qu'il verbalise au moment du déploiement. Ces travaux s'inscrivent dans une compétition intense autour des fondations VLA capables de généraliser hors de leur distribution d'entraînement, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. La mise à disposition de 2 592 heures de données robotiques en accès ouvert constitue en elle-même une contribution notable dans un secteur où la pénurie de données reste un verrou majeur. Aucun déploiement industriel n'est mentionné : ERVLA est à ce stade un résultat de recherche académique, avec des validations sur robot réel mais sans pipeline de production annoncé.

UELa publication en accès ouvert de 2 592 heures de données robotiques et des checkpoints ERVLA offre une ressource directement exploitable par les équipes de recherche françaises et européennes travaillant sur les politiques VLA généralisables.

RechercheOpinion
1 source
Sumo : la loco-manipulation dynamique et généralisable du corps entier
3arXiv cs.RO 

Sumo : la loco-manipulation dynamique et généralisable du corps entier

Un institut de recherche a publié via arXiv (article 2604.08508, troisième révision) un travail intitulé "Sumo: Dynamic and Generalizable Whole-Body Loco-Manipulation", mené sur les serveurs du RAI Institute (ex-Boston Dynamics AI Institute, hébergé sur rai-inst.com). La méthode combine sim-to-real et pilotage en temps réel: une politique de contrôle corps entier pré-entraînée est guidée au moment de l'exécution par un planificateur basé sur l'échantillonnage, sans réentraînement supplémentaire. Les chercheurs ont testé l'approche sur un robot quadrupède Spot (Boston Dynamics) dans le monde réel, avec deux tâches marquantes: redresser un pneu plus lourd que la capacité de levage nominale du robot, et traîner une barrière anti-émeute plus grande et plus haute que l'engin lui-même. Le système s'est aussi montré capable de généraliser à une variété d'objets et de tâches sans réglage additionnel, la fonction de coût pouvant être ajustée à la volée. En simulation uniquement, les auteurs étendent la méthode à un humanoïde pour ouvrir une porte et pousser une table. Code et vidéos sont publiés sur sumo.rai-inst.com. L'intérêt principal tient à la généralisation obtenue sans réentraînement par objet: une seule politique, pilotée différemment selon le contexte, remplace la logique habituelle d'entraînement dédié à chaque tâche de manipulation. Pour les intégrateurs et les équipes de R&D en robotique mobile, cela suggère une voie pour dépasser les limites de charge utile nominale annoncées par les constructeurs, un enjeu concret en logistique, chantier ou intervention d'urgence où les objets à déplacer dépassent souvent les specs du robot. Il faut toutefois noter que les résultats humanoïdes ne sont validés qu'en simulation, sans transfert réel démontré, et qu'aucun chiffre précis de masse, de temps de cycle ou de taux de réussite n'est communiqué dans le résumé, ce qui invite à la prudence avant de parler de percée généralisée. Le RAI Institute a été fondé par Marc Raibert, également fondateur de Boston Dynamics, comme structure de recherche indépendante à but non lucratif détachée de la feuille de route produit de Boston Dynamics. Spot reste la plateforme quadrupède commerciale de Boston Dynamics, ici réutilisée comme banc d'essai académique plutôt que comme produit vendu. Ce travail se distingue des approches dominantes du moment fondées sur des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, en misant sur la planification par échantillonnage plutôt que sur un grand modèle appris de bout en bout. Les prochaines étapes attendues concernent la validation réelle du volet humanoïde, actuellement cantonné à la simulation.

RecherchePaper
1 source
ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement
4arXiv cs.RO 

ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement

Le laboratoire à l'origine de ce papier arXiv (identifiant 2603.28545, version 2, soumission de type remplacement) présente ManipArena, un cadre d'évaluation standardisé pour la manipulation robotique en conditions réelles. Le benchmark couvre 20 tâches distinctes, s'appuie sur 10 812 trajectoires expertes et 13,5 millions d'images, pour un total d'environ 188 heures de fonctionnement robotique cumulées sur des scénarios de manipulation de table et de manipulation mobile. Le protocole combine variation de tâches définie par schéma, essais stratifiés en distribution, en décalage visuel et hors distribution sémantique, notation par crédit partiel au niveau des sous-tâches, annotations linguistiques à trois niveaux de granularité, signaux moteurs bas niveau, et environnements simulés jumeaux reconstruits à partir de scènes physiques réelles. Les chercheurs ont utilisé ce dispositif pour évaluer sept configurations de manipulation de table, couvrant à la fois des modèles vision-langage-action (VLA) et des modèles dits world-action. L'enjeu dépasse la simple création d'un nouveau jeu de tests. Les benchmarks en simulateur, bien que reproductibles et faciles à mettre à l'échelle, ne capturent pas fidèlement l'écart entre simulation et réel, ce dernier étant causé par le bruit de perception, la dynamique de contact, la latence et les erreurs de calibration. À l'inverse, les évaluations sur robots physiques existantes sont dispersées entre plateformes, scènes et règles de notation différentes, ce qui rend toute comparaison rigoureuse quasi impossible. Résultat clé de l'étude: les performances mesurées sur robot réel ne dépendent pas seulement de l'architecture du modèle, mais aussi de sa provenance, du régime de fine-tuning, de l'échantillonnage des données d'entraînement et de la granularité des annotations. Pour les intégrateurs et décideurs industriels, ce constat invite à relativiser fortement les annonces de performance basées uniquement sur des démonstrations vidéo ou des scores en simulation. Ce travail s'inscrit dans la course actuelle autour des modèles généralistes de contrôle robotique (VLA et world-action), un domaine où les affirmations de généralisation restent difficiles à vérifier faute de méthodologie commune. En proposant un référentiel reproductible avec attribution fine des échecs, ManipArena vise à devenir un outil diagnostique de référence pour mesurer les véritables limites de capacité de ces modèles, plutôt qu'un simple classement de plus.

RecherchePaper
1 source