SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon
Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever.
Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production.
SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.
Dans nos dossiers




