
Robotique par imitation autorégressive : un VLM incarné unifié pour l'action robotique
Des chercheurs présentent GenieReasoner, un modèle Vision-Langage-Action (VLA) conçu pour combler l'écart entre raisonnement sémantique et précision d'exécution motrice chez les robots généralistes. L'équipe introduit d'abord ERIQ (Embodied Reasoning Intelligence Quotient), un benchmark de plus de 6 000 paires question-réponse couvrant quatre dimensions du raisonnement incarné, qui permet d'évaluer séparément la capacité de raisonnement d'un modèle et sa capacité à agir. Cette évaluation découplée révèle une corrélation forte entre le score de raisonnement d'un modèle et sa capacité de généralisation en tâche réelle. Pour traduire ce raisonnement en gestes précis, les auteurs développent FACT, un tokenizer d'actions basé sur le flow matching, qui convertit des trajectoires de contrôle continues en séquences discrètes tout en préservant une reconstruction fidèle du mouvement. GenieReasoner, le modèle final, optimise conjointement raisonnement et action dans un espace unifié et surpasse, selon les auteurs, les approches à action continue comme les approches à action discrète existantes sur des tâches de manipulation en conditions réelles.
L'enjeu dépasse la simple performance sur un jeu de tests: c'est le compromis raisonnement-précision, souvent cité comme le principal frein à la généralisation des VLA hors laboratoire, que ce travail cherche à quantifier puis à résoudre. Pour les intégrateurs et équipes R&D en robotique, disposer d'un benchmark comme ERIQ offre un outil de diagnostic pour repérer si un modèle échoue par manque de compréhension sémantique de la scène ou par imprécision motrice, deux problèmes qui appellent des solutions très différentes. Les résultats annoncés restent toutefois issus des auteurs eux-mêmes, sans validation tierce indépendante à ce stade.
Ce travail s'inscrit dans la lignée des modèles VLA à grande échelle type Pi-0 ou GR00T N2, qui cherchent tous à unifier compréhension du langage, de la vision et génération d'actions robotiques dans une seule architecture. La tokenisation discrète des actions, plutôt que leur régression continue, est une piste explorée par plusieurs laboratoires pour rapprocher l'entraînement des VLA de celui des grands modèles de langage. Le code et les détails du projet sont disponibles sur la page dédiée des auteurs; les prochaines étapes attendues portent sur l'extension du benchmark ERIQ et des tests sur une plus grande diversité de plateformes robotiques.
Dans nos dossiers




