Aller au contenu principal
RecherchearXiv cs.RO 

RoboQuest : des agents physiques généralistes qui cherchent, inspectent et testent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RoboQuest, un nouveau benchmark publié sur arXiv (2610.10388), mesure la capacité d'agents physiques généralistes à explorer activement leur environnement avant d'agir. Il regroupe dix tâches de manipulation mobile construites autour de trois formes d'incertitude: la recherche d'un objet absent des observations, l'inspection par manipulation d'une propriété non visible, et le test interactif de l'effet d'un outil inconnu. L'agent doit acquérir l'information par interaction physique, adapter ses actions en conséquence et décider seul du moment où il considère la tâche terminée. Les auteurs ont évalué cinq agents multimodaux de pointe via une interface visuomotrice commune, ainsi qu'une politique π0.5 affinée sur les démonstrations d'épisodes complets qu'ils publient avec le benchmark. Le meilleur agent ne réussit que 23 % des épisodes, et la politique affinée ne réussit presque jamais.

Ce résultat nuance l'idée selon laquelle les modèles de fondation multimodaux seraient déjà des agents physiques généralistes fiables. Des tests isolés, où l'information cachée est fournie à l'agent, montrent qu'il exécute correctement la plupart des gestes requis, et l'analyse des échecs n'attribue qu'une minorité d'entre eux à l'exécution. Le verrou se déplace donc de la dextérité vers la décision: les agents s'arrêtent trop tôt, avant d'avoir observé la preuve nécessaire pour conclure. Ils corrigent ou préviennent en outre rarement les perturbations causées par leur propre exploration, par exemple un objet déplacé ou un tiroir laissé ouvert. L'apprentissage par essais et erreurs reste difficile pour la plupart des modèles. Pour les intégrateurs et décideurs industriels, cela signifie que des démonstrations réussies en environnement connu ne garantissent rien dans un site non cartographié, où l'information utile manque souvent au départ. Le fait que la politique π0.5 échoue presque systématiquement suggère aussi que l'imitation sur des démonstrations seules ne suffit pas pour ce type de comportement.

Le travail s'inscrit dans la course aux modèles vision-langage-action et aux agents généralistes, où les benchmarks existants testent surtout l'exécution de consignes avec des informations visibles, plutôt que la collecte active d'indices. RoboQuest comble en partie cet écart et fournit des données d'épisodes complets pour entraîner et comparer de futures approches. Les auteurs ne détaillent pas dans le résumé quels modèles de pointe ont été testés, ce qui limite la comparaison fine. Les suites probables sont des méthodes de raisonnement et de mémoire explicites sur l'incertitude, ainsi que des entraînements par renforcement ou par essais et erreurs. Il s'agit ici d'un travail de recherche et d'un jeu d'évaluation, sans produit ni déploiement associé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique
1arXiv cs.RO 

Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique

Un article de recherche publié sur arXiv (2607.21725v1) présente Pigey, un orchestrateur d'agence physique conçu pour piloter des robots généralistes sans données supplémentaires ni post-entraînement. Plutôt que d'entasser perception, planification, détection de succès, récupération d'erreurs et contrôle bas niveau dans une seule politique apprise par pré-entraînement massif, comme le font les modèles vision-langage-action (VLA) actuels, les auteurs séparent le problème en deux couches : un agent de contrôle langage-conditionné classique, et un gestionnaire de haut niveau qui décompose les objectifs en sous-tâches, envoie des commandes moteur, vérifie les résultats à partir des observations bas niveau et déclenche des routines de récupération en cas d'échec. Pigey peut commander aussi bien des politiques VLA existantes que des compétences paramétrées préexistantes. Sur le benchmark de simulation LIBERO-PRO, le taux de réussite passe de 12,8% à 53,3%, soit plus du quadruple, sans aucun réglage spécifique à la tâche. Sur un robot réel, les tâches nécessitant du raisonnement voient leur taux de succès grimper de quasi zéro à plus de 90% une fois la politique figée intégrée dans la boucle agentique de Pigey. Ce résultat vient alimenter un débat déjà vif dans la robotique humanoïde et manipulatrice : les modèles VLA de bout en bout, aussi impressionnants soient-ils en démonstration, échouent souvent dès que la tâche exige un raisonnement séquentiel ou une récupération après erreur, un écart que les auteurs baptisent "orchestration gap". En montrant qu'une simple couche d'orchestration explicite, sans ré-entraînement, suffit à multiplier par quatre les performances, l'étude suggère que l'échelle des données de pré-entraînement n'est pas le seul levier disponible pour combler ce fossé entre démonstration et fiabilité réelle, un enjeu direct pour les intégrateurs qui doivent déployer ces systèmes en environnement industriel non contrôlé. Cette approche s'inscrit dans une tendance plus large de la recherche en robotique généraliste, où des laboratoires développent des modèles comme Pi-0, GR00T N2 ou Helix pour unifier perception et action. Pigey se positionne comme une alternative complémentaire plutôt qu'un concurrent direct : il ne remplace pas ces politiques mais les pilote depuis l'extérieur, ce qui laisse ouverte la question de son adoption par les fournisseurs de VLA propriétaires et de son passage à l'échelle sur des tâches de manipulation encore plus complexes.

RecherchePaper
1 source
Une mémoire simple à base d'agents pour les politiques robotiques généralistes
2arXiv cs.RO 

Une mémoire simple à base d'agents pour les politiques robotiques généralistes

Des chercheurs proposent SimpleARM (Simple Agentic Robot Memory), une couche de mémoire sans entraînement pour politiques robotiques généralistes gelées, décrite dans un preprint arXiv (v1). Le système fonctionne en quatre temps : à partir de l'instruction de la tâche, il détermine ce qu'il faut surveiller ; des outils perceptifs gelés maintiennent en ligne un état compact et typé ; un accès structuré ne récupère cet état que lorsqu'un sous-objectif proposé dépend de l'historique ; enfin, un ancrage dans la vue courante résout les entités rappelées avant l'exécution. L'évaluation porte sur RoboMME, un benchmark de 16 tâches de manipulation dont la réussite exige des informations qui ne sont plus visibles dans l'observation actuelle. Sur les 16 tâches et trois graines de politique, SimpleARM atteint 67,17 % de réussite moyenne, contre 44,51 % pour la meilleure base de comparaison non oracle. Des ablations appariées montrent que retirer l'état de relation, de référence, de progression ou d'itinéraire provoque de fortes chutes là où cet état est mobilisé, et épargne largement les autres tâches. L'enjeu dépasse le gain chiffré, soit environ 22,7 points. Les systèmes de mémoire visuelle actuels conservent ou compressent des observations passées, en supposant que l'historique utile se retrouve dans les images. Or le contrôle robotique dépend aussi d'un état issu de l'interaction, qu'aucune image ne représente explicitement : quel objet est lequel après avoir été déplacé, où en est la tâche, dans quel ordre exécuter une procédure. Les résultats plaident pour une mémoire conçue comme un état compact et pertinent pour la tâche, plutôt que comme un historique visuel étendu. Pour les intégrateurs et les équipes qui déploient des politiques VLA gelées, l'intérêt pratique est réel : la couche s'ajoute sans réentraînement, donc sans coût de collecte de données ni de fine-tuning. La spécificité des ablations renforce la crédibilité du mécanisme. Des réserves s'imposent toutefois : les résultats proviennent d'un benchmark, avec des tâches vraisemblablement simulées, sans preuve de déploiement réel, et l'écart avec les approches plus complexes reste à vérifier hors de RoboMME. Ce travail s'inscrit dans la montée des modèles généralistes gelés, de type VLA, qui excellent en réactivité mais restent faibles sur les tâches à longue portée dépendant du passé. Les approches concurrentes se répartissent entre conservation brute de trames, compression de contexte visuel et mémoires apprises de bout en bout, toutes exposées au même défaut : ne pas capter l'état implicite. SimpleARM adopte une orientation « agentique », où des outils spécialisés remplissent l'état plutôt que la politique elle-même. Les suites logiques seraient des tests sur robot physique, d'autres benchmarks de mémoire et une comparaison avec des politiques entraînées avec mémoire native. Le preprint n'annonce ni code, ni pilote, ni calendrier, et n'a pas encore été évalué par des pairs.

RecherchePaper
1 source
SPACE : apprentissage inter-robots vers des politiques généralistes
3arXiv cs.RO 

SPACE : apprentissage inter-robots vers des politiques généralistes

Une équipe de chercheurs a publié le 24 juin 2026 sur arXiv (arXiv:2606.24049) un article introduisant SPACE (State Prediction and Adaptive Command Execution), un cadre d'apprentissage conçu pour entraîner des politiques robotiques généralisables à partir de données hétérogènes collectées sur différents robots. Le problème central est le suivant : en behavior cloning, les actions enregistrées lors de démonstrations sont couplées à la dynamique du robot utilisé, ce qui empêche leur réutilisation directe sur d'autres plateformes. SPACE résout cela en adoptant le delta d'état cartésien comme représentation d'action universelle, indépendante du matériel. Le framework repose sur deux composants : une politique prédisant le déplacement géométrique de l'effecteur terminal (end-effector), et un Action Adapter qui convertit ces prédictions en commandes spécifiques à chaque robot. Les expériences démontrent que SPACE surpasse significativement les politiques entraînées à prédire directement des commandes de contrôle, que ce soit entre morphologies différentes ou entre unités matérielles d'une même plateforme. La robustesse est également validée face aux variations dynamiques en déploiement : changements de fréquence de contrôle, de masse des objets manipulés ou de gains de contrôleur. L'enjeu est structurant pour la robotique industrielle à grande échelle. Agréger des démonstrations issues de parcs hétérogènes sans dégradation de performance est un verrou majeur pour constituer les grands jeux de données dont la robotique généraliste a besoin, à l'image d'ImageNet pour la vision par ordinateur. SPACE découple la représentation de l'action de son exécution matérielle, ouvrant la voie à des politiques capables de fonctionner sur des flottes diversifiées sans ré-entraînement complet. Pour un intégrateur ou un COO industriel opérant des robots de plusieurs générations, la robustesse aux shifts dynamiques en production est un argument concret, pas seulement académique. Ce travail s'inscrit dans le courant dominant du robot learning, qui cherche à reproduire pour la robotique le scaling des grands modèles de langage. Des travaux comme RT-2, Octo ou pi-0 (Physical Intelligence) ont déjà exploré l'apprentissage multi-robot, mais l'alignement des espaces d'action reste un problème ouvert. SPACE apporte une réponse modulaire, sans imposer de modifications architecturales majeures à la politique principale, ce qui facilite l'intégration avec des architectures VLA existantes. Le code et la page projet sont disponibles publiquement. Il s'agit pour l'instant d'un preprint non encore soumis à peer review, et les prochaines étapes naturelles incluront des validations à plus grande échelle et sur des scènes de manipulation plus complexes.

RechercheOpinion
1 source
Les agents VLM de pointe sont-ils prêts à devenir des robots généralistes ? Une étude empirique avec Embodied Agent Arena
4arXiv cs.RO 

Les agents VLM de pointe sont-ils prêts à devenir des robots généralistes ? Une étude empirique avec Embodied Agent Arena

Une équipe de chercheurs publie sur arXiv (2610.00854) l'Embodied Agent Arena, un banc d'essai conçu pour mesurer si les modèles vision-langage (VLM) de pointe peuvent servir de généralistes en robotique. L'arène regroupe 1 000 cas tirés de 32 sources existantes, répartis en cinq familles de compétences : géométrie, raisonnement spatial, affordance (repérer où et comment saisir ou actionner un objet), planification de tâches et manipulation. Elle intègre aussi GeoProbe, un nouveau benchmark d'estimation géométrique sur rendus Blender et images de scènes réelles. Un harnais minimal conserve les observations et opérations d'origine, et sépare trois mesures : la précision métrique, l'ancrage fonctionnel et l'accomplissement de l'objectif natif de la tâche. Sept VLM sont évalués. Les auteurs analysent en détail les avantages de l'un d'eux, Astra, et comparent des protocoles d'exécution à observations enrichies ainsi qu'une revue en plusieurs tours. Le résultat central est une dissociation entre compétence locale et réussite de bout en bout. L'avantage d'Astra est le plus net sur l'estimation précise et la localisation de zones de contact exploitables. En revanche, enchaîner des actions coordonnées et orientées vers un but reste le principal verrou vers un généralisme robotique. Pour les intégrateurs et les décideurs B2B, cela rejoint un écart connu entre les démonstrations et le terrain. Un modèle qui perçoit et localise bien ne suffit pas à fermer la boucle perception-action. Cela relativise aussi les scores obtenus sur des benchmarks isolés, car ils surestiment la préparation à l'exécution de tâches complètes. Le choix de séparer précision métrique, ancrage et complétion donne enfin une grille de lecture plus utile qu'un score agrégé pour décider où un VLM généraliste peut remplacer des briques spécialisées de perception, et où une couche de contrôle dédiée reste nécessaire. Ce travail s'inscrit dans la montée des agents incarnés pilotés par des modèles de fondation, où les VLM sont de plus en plus proposés comme cerveau haut niveau, seuls ou combinés à des politiques vision-langage-action (VLA). Les évaluations existantes tendent à tester chaque compétence séparément, ce qui masque les points de rupture dans une chaîne complète. L'arène répond à ce manque en réutilisant des sources établies plutôt qu'en repartant de zéro, ce qui facilite la comparaison avec les résultats antérieurs. L'étude ne précise pas, dans son résumé, l'identité des six autres modèles, les taux de réussite chiffrés ni la part de tests en conditions physiques réelles. Ces éléments devront être vérifiés dans le texte complet. La suite logique est l'usage de cette arène pour comparer les prochaines générations de VLM et de VLA sur la complétion de tâches coordonnées, là où l'écart se situe aujourd'hui.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source