Aller au contenu principal
RecherchearXiv cs.RO 

RobotUse : allouer le calcul, le contexte et les décisions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RobotUse est un « harnais » d'agent robotique présenté dans un preprint arXiv (2610.04929, version 2) par une équipe qui publie une page projet à l'adresse robotuse-team.github.io. Le système organise le calcul, le contexte et les décisions autour d'une tâche précise : spécifier puis réviser des actions physiques. L'agent, un modèle de langage, choisit visuellement les cibles et les poses. Le backend prend en charge la géométrie, la planification de mouvement et le contrôle. Des sous-agents conservent le détail des interactions propres à chaque sous-objectif et ne remontent que l'information utile à la décision suivante. Un mécanisme de « harnachement continu » met à jour un playbook persistant à partir de l'exécution. Sur le benchmark RoboLab, RobotUse atteint 45 % de réussite, soit 6,7 points de pourcentage de plus que CaP-X, avec des contextes de décision plus compacts et moins d'abstractions d'action prédéfinies. Les auteurs affirment aussi que le système apprend de l'exécution réelle malgré un retour d'information imparfait, et transfère ce savoir à des tâches ultérieures.

L'enjeu touche à la manière de découper les responsabilités entre un agent LLM et la pile robotique classique. Beaucoup d'interfaces enferment les choix dans des outils figés, ou obligent l'agent à manipuler du code d'exécution détaillé dont l'historique gonfle à chaque essai. RobotUse propose une répartition différente : l'agent décide en perception et en intention, le backend garde la géométrie et la commande. Les sous-agents servent aussi à contenir la croissance du contexte, un point de blocage fréquent pour les agents qui répètent leurs tentatives. Il faut toutefois relativiser les chiffres. Un taux de succès de 45 % signifie que plus de la moitié des tâches échouent, loin d'un niveau exploitable en production. L'écart avec CaP-X, de 6,7 points, est modeste, et le résumé ne donne ni nombre de tâches, ni variance, ni détail des essais réels. L'apprentissage « malgré un retour imparfait » reste une affirmation à vérifier dans le papier complet.

Ce travail s'inscrit dans la lignée des approches où un LLM génère du code ou appelle des outils pour piloter un robot, dont CaP-X est ici la référence de comparaison. Il se distingue des modèles vision-langage-action (VLA) de bout en bout, comme Pi-0 ou GR00T, qui apprennent directement la commande à partir de démonstrations. RobotUse mise à l'inverse sur un agent orchestrateur au-dessus d'un backend de planification classique. Aucune annonce de déploiement, de pilote industriel ou de calendrier n'accompagne ce preprint, qui reste un résultat de recherche. La suite probable passera par des évaluations sur davantage de tâches et de plateformes, ainsi que par une comparaison directe avec les VLA sur les mêmes benchmarks.

À lire aussi

L'apprentissage en contexte pour les robots : méthodes et applications
1arXiv cs.RO 

L'apprentissage en contexte pour les robots : méthodes et applications

Une nouvelle revue de littérature déposée sur arXiv (2609.36012v1) propose une taxonomie de l'apprentissage en contexte (in-context learning, ICL) appliqué à la robotique. Le principe : un robot généraliste déduit ce qu'exige une tâche inédite à partir de démonstrations et d'interactions, puis le traduit en actions physiques, sans aucune mise à jour de ses paramètres neuronaux pendant le déploiement. Les auteurs structurent le domaine autour des interfaces qui relient les preuves contextuelles à l'exécution et distinguent quatre familles : les politiques conditionnées par le contexte, le transfert géométrique de démonstrations, le contrôle fondé sur des modèles du monde, et l'exécution par compétences ou par agents. Le texte couvre la manipulation et la navigation. Il s'agit d'un travail de synthèse : le résumé ne mentionne ni nouveau modèle, ni jeu de données, ni chiffre de performance. L'intérêt pratique tient à la grille de lecture. Comparer ces familles d'interfaces met en évidence leurs hypothèses de transfert, ainsi que le rôle de l'entraînement, de la mise en correspondance (entre la démonstration et l'embodiment du robot) et de la mémoire. Les auteurs examinent aussi comment chaque mécanisme préserve les exigences enseignées quand les objets, l'environnement ou les conditions d'exécution changent. Ils relient ensuite la conception des méthodes aux pratiques d'évaluation, en séparant trois choses trop souvent confondues : la réactivité à l'enseignement, le transfert physique réel et le bénéfice tiré de l'expérience conservée. Pour un intégrateur ou un responsable R&D, c'est un critère de lecture utile face aux démonstrations de « robot qui apprend en quelques exemples ». Un système qui réagit à une démonstration ne prouve pas qu'il en reproduit fidèlement l'intention dans des conditions différentes. Le contexte est celui de la montée des modèles généralistes vision-langage-action (VLA) et des modèles du monde, dont les capacités d'adaptation sans réentraînement restent difficiles à comparer d'un laboratoire à l'autre. Les auteurs en tirent un agenda de recherche qui associe l'acquisition compositionnelle de tâches et le transfert fidèle à ce qu'ils nomment l'auto-amélioration récursive physique : l'expérience accumulée améliore la capacité à apprendre les tâches suivantes. Il s'agit d'une direction proposée, pas d'un résultat démontré. Le texte est une préversion (v1) non évaluée par les pairs. Le résumé ne cite aucun acteur industriel, européen ou autre, et aucun calendrier de déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Apprentissage par imitation ancré vision-langage et conscient du contexte pour le désassemblage robotique
2arXiv cs.RO 

Apprentissage par imitation ancré vision-langage et conscient du contexte pour le désassemblage robotique

Le 17 septembre 2026, une équipe de recherche a publié sur arXiv (référence 2609.17714) une nouvelle méthode d'apprentissage par imitation destinée au désassemblage robotique de pièces mécaniques et de connecteurs. Le problème visé est celui de l'exécution à long horizon : un bras robotique doit enchaîner plusieurs tâches de manipulation ordonnées sur une même scène contenant de multiples pièces, sans que les politiques d'imitation classiques parviennent à déduire, à partir des seules images brutes, quel geste effectuer quand plusieurs objectifs sont valides simultanément. La solution proposée combine une sélection hiérarchique des tâches avec un mécanisme dit "task-context-aware", qui ancre des instructions en langage naturel dans la représentation visuelle spatiale de la scène pour associer chaque consigne à sa cible de manipulation. Le système généralise à des géométries de connecteurs et des configurations d'assemblage variées sans nécessiter d'annotations explicites des objets. Les auteurs rapportent un gain de 35 points de pourcentage de taux de réussite de bout en bout par rapport à une politique de diffusion (diffusion policy) de référence, et de 75 points par rapport à la précédente méthode "task-context-aware" existante. Pour l'industrie du désassemblage, du recyclage et du reconditionnement (électronique, batteries, électroménager), ce travail s'attaque à un vrai verrou : la diversité combinatoire des configurations réelles rend impossible l'entraînement exhaustif d'un robot sur chaque variante de pièce. En s'appuyant sur le langage plutôt que sur des étiquettes d'objets prédéfinies, la méthode illustre une tendance plus large du secteur consistant à faire porter la généralisation par le contexte linguistique, une logique proche de celle des modèles vision-langage-action (VLA) déjà déployés par ailleurs. Un tel gain de robustesse, si confirmé hors laboratoire, intéresserait directement les intégrateurs qui cherchent à réduire le travail d'annotation et de reprogrammation entre lignes de désassemblage différentes. Ce travail s'inscrit dans la vague plus large des modèles vision-langage-action qui cherchent à dépasser les démonstrations à tâche unique, à l'image d'approches comme Pi-0, GR00T ou Helix dans le domaine plus large de la manipulation robotique généraliste. Il reste toutefois à ce stade une publication de recherche non validée par des pairs, sans partenaire industriel ni site de déploiement annoncé : la prochaine étape attendue serait une validation sur robot réel à plus grande échelle plutôt qu'en environnement contrôlé.

UEAucune entreprise ou institution européenne n'est impliquée, mais la méthode intéressé potentiellement les filières européennes de recyclage et reconditionnement (électronique, batteries) soumises a des exigences croissantes de désassemblage.

RecherchePaper
1 source
Repenser le modèle monde-action pour la manipulation robotique compositionnelle et en contexte
3arXiv cs.RO 

Repenser le modèle monde-action pour la manipulation robotique compositionnelle et en contexte

Des chercheurs proposent ViGAR (Visual Goal-conditioned Action Reasoning), un cadre hiérarchique pour la manipulation robotique compositionnelle à long horizon, détaillé dans un preprint arXiv (2610.02368). Il sépare la tâche en deux modules. Un planificateur de sous-buts visuels prédit, à partir de l'observation courante et de l'instruction globale, une image du sous-but de la prochaine sous-tâche. Un exécuteur de sous-buts génère ensuite conjointement les trajectoires visuelles futures et les actions, conditionnées par ce sous-but. Les deux composants partagent la même représentation de world model pré-entraîné. Sur le benchmark simulé RoboTwin Clean2Random, ViGAR atteint 82,00 % de réussite en configuration Clean et 67,02 % en configuration Random. Cela représente 12,86 points de pourcentage de mieux que la meilleure référence, en moyenne. Les auteurs ajoutent des essais sur robot réel : cinq tâches compositionnelles et deux tâches d'apprentissage en contexte. Le résumé ne précise ni la plateforme matérielle, ni le nombre d'essais, ni les modèles de référence. Ce travail s'attaque à une limite connue des world-action models (WAM), qui prédisent à la fois de courts futurs visuels et des actions, mais sans raisonnement explicite au niveau des sous-tâches. Pour un intégrateur, la plupart des tâches utiles, comme l'assemblage, le tri ou le conditionnement, enchaînent plusieurs gestes coordonnés, et c'est sur cet enchaînement que les politiques de bout en bout échouent le plus souvent. Introduire un sous-but visuel explicite rend le plan lisible et inspectable, ce qui compte pour le diagnostic en production. L'apprentissage en contexte va dans le même sens. Une image du but global fournie comme contexte suffit à induire des décompositions et des comportements différents, sans mise à jour des paramètres. Cela réduirait le coût de reconfiguration d'une cellule robotisée. Les résultats restent à relativiser : le score Random de 67 % montre qu'une perte de performance subsiste face à la variabilité de l'environnement, et les tests réels sont peu nombreux. Ce travail s'inscrit dans la montée des politiques vision-langage-action (VLA) et des world models comme base de la manipulation généraliste. Il se place face à des approches qui produisent des actions seules, comme Pi-0, ou des modèles qui prédisent des futurs vidéo sans hiérarchie. Le benchmark RoboTwin, de manipulation bimanuelle avec randomisation de l'environnement, sert de plus en plus de test de robustesse. C'est un résultat académique, sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont la validation sur des horizons plus longs et des plateformes variées, la publication du code et des poids, et le coût de calcul d'une prédiction visuelle à chaque sous-tâche, que le résumé ne chiffre pas.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
PEBRE : une extension matérielle ouverte de calcul et perception pour le robot Pepper
4arXiv cs.RO 

PEBRE : une extension matérielle ouverte de calcul et perception pour le robot Pepper

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.12112v1) les spécifications de PEBRE, un module matériel et logiciel open-source conçu pour augmenter les capacités du robot Pepper. Le module intègre une carte Jetson Orin Nano de NVIDIA pour le calcul embarqué, une caméra RGB Logitech BRIO 4K, une caméra de profondeur Intel RealSense D435i pour la perception 3D, un microphone USB Samson UB1 et un micro directionnel RØDE VideoMicro II pour la capture audio. L'ensemble forme un add-on modulaire, conçu pour s'intégrer physiquement sur Pepper sans modifier son architecture d'origine. Les auteurs rapportent des améliorations mesurables en capacités de perception et en puissance de calcul, sans toutefois publier de benchmarks chiffrés comparatifs dans le résumé disponible. L'intérêt concret de PEBRE pour la communauté académique et les intégrateurs tient à une problématique bien réelle : Pepper approche ou dépasse sa durée de vie commerciale prévue, et SoftBank Robotics a progressivement réduit son support. Des dizaines de labos de recherche mondiaux disposent de plateformes Pepper dont la chaîne logicielle devient obsolète et dont le matériel interne (processeur Intel Atom, caméras grand-angle basiques) ne permet plus d'exécuter des modèles modernes de vision ou de traitement du langage en local. En proposant une solution open-hardware, les auteurs cherchent à mutualiser l'effort de mise à niveau, évitant à chaque labo de réinventer sa propre solution de retrofitting. C'est une approche pragmatique face à l'abandon progressif d'une plateforme encore présente dans de nombreux établissements. Pepper a été conçu à l'origine par Aldebaran Robotics, entreprise française rachetée par SoftBank en 2012, puis commercialisé à partir de 2014 comme robot d'accueil et d'interaction sociale. Malgré l'arrêt de sa production pour le marché grand public annoncé en 2021, Pepper reste présent dans plusieurs centaines de laboratoires et sites industriels en Europe et en Asie. Côté concurrence sur le segment des plateformes académiques humanoïdes légères, Pepper fait face à des alternatives comme le NAO (lui aussi Aldebaran/SoftBank), le Furhat ou des plateformes bras-et-torse comme Hello Robot Stretch. PEBRE ne repositionne pas Pepper dans la course aux humanoïdes mobiles de nouvelle génération, mais tente de lui donner une seconde vie utile dans des contextes de recherche appliquée en HRI (Human-Robot Interaction), là où le coût d'acquisition d'une nouvelle plateforme reste prohibitif.

UELes laboratoires européens équipés de robots Pepper, nombreux en France et en Europe, héritiers du rachat d'Aldebaran Robotics, peuvent bénéficier directement de ce module open-source pour prolonger la durée de vie de leurs plateformes et exécuter des modèles modernes de perception et de traitement du langage sans investissement dans une nouvelle plateforme.

RecherchePaper
1 source