RoboQuest : des agents physiques généralistes qui cherchent, inspectent et testent
RoboQuest, un nouveau benchmark publié sur arXiv (2610.10388), mesure la capacité d'agents physiques généralistes à explorer activement leur environnement avant d'agir. Il regroupe dix tâches de manipulation mobile construites autour de trois formes d'incertitude: la recherche d'un objet absent des observations, l'inspection par manipulation d'une propriété non visible, et le test interactif de l'effet d'un outil inconnu. L'agent doit acquérir l'information par interaction physique, adapter ses actions en conséquence et décider seul du moment où il considère la tâche terminée. Les auteurs ont évalué cinq agents multimodaux de pointe via une interface visuomotrice commune, ainsi qu'une politique π0.5 affinée sur les démonstrations d'épisodes complets qu'ils publient avec le benchmark. Le meilleur agent ne réussit que 23 % des épisodes, et la politique affinée ne réussit presque jamais.
Ce résultat nuance l'idée selon laquelle les modèles de fondation multimodaux seraient déjà des agents physiques généralistes fiables. Des tests isolés, où l'information cachée est fournie à l'agent, montrent qu'il exécute correctement la plupart des gestes requis, et l'analyse des échecs n'attribue qu'une minorité d'entre eux à l'exécution. Le verrou se déplace donc de la dextérité vers la décision: les agents s'arrêtent trop tôt, avant d'avoir observé la preuve nécessaire pour conclure. Ils corrigent ou préviennent en outre rarement les perturbations causées par leur propre exploration, par exemple un objet déplacé ou un tiroir laissé ouvert. L'apprentissage par essais et erreurs reste difficile pour la plupart des modèles. Pour les intégrateurs et décideurs industriels, cela signifie que des démonstrations réussies en environnement connu ne garantissent rien dans un site non cartographié, où l'information utile manque souvent au départ. Le fait que la politique π0.5 échoue presque systématiquement suggère aussi que l'imitation sur des démonstrations seules ne suffit pas pour ce type de comportement.
Le travail s'inscrit dans la course aux modèles vision-langage-action et aux agents généralistes, où les benchmarks existants testent surtout l'exécution de consignes avec des informations visibles, plutôt que la collecte active d'indices. RoboQuest comble en partie cet écart et fournit des données d'épisodes complets pour entraîner et comparer de futures approches. Les auteurs ne détaillent pas dans le résumé quels modèles de pointe ont été testés, ce qui limite la comparaison fine. Les suites probables sont des méthodes de raisonnement et de mémoire explicites sur l'incertitude, ainsi que des entraînements par renforcement ou par essais et erreurs. Il s'agit ici d'un travail de recherche et d'un jeu d'évaluation, sans produit ni déploiement associé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




