Aller au contenu principal
RecherchearXiv cs.RO 

SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever.

Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production.

SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.

À lire aussi

Raisonner en texte et en images : traces de raisonnement vision-langage entrelacées pour la manipulation robotique à long horizon
1arXiv cs.RO 

Raisonner en texte et en images : traces de raisonnement vision-langage entrelacées pour la manipulation robotique à long horizon

Des chercheurs ont publié sur arXiv (arXiv:2605.00438) un cadre de politique robotique appelé IVLR (Interleaved Vision-Language Reasoning), conçu pour la manipulation à horizon long. Le coeur du système est une représentation intermédiaire explicite, la "trace", qui alterne des sous-objectifs textuels avec des images-clés visuelles sur l'ensemble de la séquence de tâche. À l'inférence, un transformateur multimodal natif génère cette trace globale à partir de l'observation initiale et de l'instruction, la met en cache, puis conditionne un décodeur d'actions en boucle fermée. Sur le benchmark simulé LIBERO, IVLR atteint 95,5 % de taux de succès moyen, dont 92,4 % sur LIBERO-Long, et 59,4 % sur SimplerEnv-WidowX. L'absence de telles traces dans les jeux de données robotiques existants est contournée par une pseudo-supervision construite en segmentant temporellement des démonstrations et en les annotant automatiquement via un modèle vision-langage. Les ablations quantifient clairement la valeur de chaque modalité : sans trace, LIBERO-Long chute à 37,7 % ; une trace texte seule atteint 62,0 %, une trace visuelle seule 68,4 %, tandis que la trace entrelacée texte-image monte à 92,4 %. L'écart de 30 points entre la combinaison et les modalités isolées démontre que le raisonnement causal (texte) et les contraintes géométriques (image) sont complémentaires, pas substituables. C'est une contribution directe au débat sur la planification explicite versus latente dans les politiques VLA (Vision-Language-Action) : masquer la planification dans des états latents, comme le font la majorité des architectures actuelles, laisse une performance substantielle sur la table. IVLR s'inscrit dans un courant de politiques VLA à planification explicite, en concurrence avec des approches comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui intègrent également des capacités de raisonnement multimodal. La méthode de pseudo-supervision est potentiellement impactante pour les équipes académiques : elle permet de réutiliser des datasets existants sans annotations humaines supplémentaires, abaissant le coût d'entrée à la recherche sur les longues séquences. Les tests de robustesse indiquent une dégradation modérée face aux perturbations d'exécution et aux traces partiellement masquées, mais les auteurs reconnaissent une limite claire : lorsque le plan global est incorrect ou obsolète, le système reste fragile. La prochaine étape logique est la mise à jour dynamique de la trace en cours d'exécution, et la validation sur robots physiques hors simulation.

UELes laboratoires académiques européens (INRIA, CEA-List) travaillant sur les politiques VLA pourraient directement réutiliser la méthode de pseudo-supervision pour annoter leurs datasets existants sans coût humain supplémentaire.

RechercheOpinion
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
2arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source
Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action
3arXiv cs.RO 

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action

Le laboratoire de recherche en robotique derrière l'étude "Foresight Residual RL" a publié le 24 juillet 2026 sur arXiv (2607.16506v1) une méthode visant à corriger un défaut connu des politiques Vision-Language-Action (VLA) sur les tâches d'assemblage complexes. Le problème identifié est concret : sur une tâche en trois phases (saisie, déplacement-insertion, rotation) simulant le serrage d'un écrou avec une clé dans l'environnement Isaac Gym, les méthodes classiques de reinforcement learning résiduel appliquées à une politique VLA gelée échouent à enchaîner les sous-tâches correctement, même quand chaque sous-tâche individuelle réussit. La solution proposée, baptisée Foresight Residual RL, entraîne un prédicteur visuel qui estime, à partir d'une image de l'état terminal d'une sous-tâche, la probabilité de succès des sous-tâches suivantes, et utilise cette estimation comme multiplicateur de récompense pour orienter l'apprentissage. Sur la tâche testée, la méthode atteint 85,6% de réussite sur l'ensemble de la séquence, contre 54,5% pour le RL résiduel standard et des résultats inférieurs pour les politiques VLA de base seules. Ce résultat pointe un angle mort largement sous-estimé dans le déploiement industriel des politiques génératives pour la manipulation robotique : optimiser chaque geste isolément ne garantit pas un enchaînement fiable des tâches. Pour les intégrateurs qui envisagent des lignes d'assemblage à tolérances serrées, contact-riche, type ligne électronique ou mécanique de précision, la démonstration confirme un écart persistant entre la performance en démonstration isolée et la performance en séquence réelle, un des points de vigilance recurrents pointés par les acteurs du secteur, sceptiques face aux vidéos promotionnelles de robots humanoïdes. Le fait que le succès par sous-tâche reste inchangé alors que le succès global bondit change la manière de penser l'entraînement : il ne s'agit plus seulement de maximiser un taux de réussite par étape, mais de façonner l'état terminal produit à chaque étape pour qu'il reste exploitable par l'étape suivante, une nuance directement pertinente pour les équipes qui construisent des pipelines d'apprentissage par renforcement sur des bases VLA préentraînées comme Pi-0 ou GR00T. Cette approche s'inscrit dans la lignée des travaux récents combinant politiques VLA préentraînées et affinage par RL résiduel, une stratégie de plus en plus utilisée pour adapter des modèles de manipulation généralistes à des tâches industrielles spécifiques sans réentraîner l'ensemble du modèle. La méthode a été validée uniquement en simulation, sur une tâche mécanique unique et relativement contrainte ; aucune date de transfert vers un robot physique ni de partenariat industriel n'est mentionnée dans l'article. Les auteurs positionnent leurs travaux comme une réponse méthodologique générale au problème d'attribution de crédit sur des horizons longs, un défi que partagent les principaux laboratoires travaillant sur les politiques génératives pour bras robotiques et humanoïdes, de Physical Intelligence à NVIDIA, sans qu'aucun acteur français ou européen ne soit cité dans cette publication.

RecherchePaper
1 source
TemporalFlow-VLA : un historique d'exécution physiquement ancré pour la manipulation robotique à long horizon
4arXiv cs.RO 

TemporalFlow-VLA : un historique d'exécution physiquement ancré pour la manipulation robotique à long horizon

Des chercheurs ont publié en août 2026 sur arXiv (référence 2608.26821) un article présentant TemporalFlow-VLA, un modèle vision-langage-action (VLA) conçu pour la manipulation robotique multi-étapes de longue durée. Le système construit un flux temporel robot-surface à partir des états enregistrés du robot, de sa géométrie et de caméras calibrées, utilisé uniquement comme signal d'entraînement pour superviser deux requêtes temporelles alignées sur l'exécution qui fournissent un historique structuré à l'expert d'action du modèle. Sur le benchmark LIBERO, le système atteint un taux de réussite moyen de 97,63% (+/- 0,26 point), dont 96,60% (+/- 0,87) sur le sous-ensemble LIBERO Long dédié aux tâches longues. Sur RoboTwin, qui regroupe 12 tâches de manipulation, il obtient 85,5% de réussite en conditions propres et 84,2% en conditions randomisées. La voie de supervision géométrique n'intervient qu'à l'entraînement et n'est pas évaluée au déploiement, ce qui, combiné à une mise en cache asynchrone des caractéristiques, permet de conserver une latence d'inférence côté serveur équivalente à celle d'un traitement image par image, sans surcoût lié à l'encodage de l'historique. L'enjeu pointé par les auteurs est concret pour l'industrie: empiler simplement des images historiques dans un modèle VLA ne suffit pas à capter un changement physique récent, en particulier quand deux états visuellement quasi identiques appellent des actions différentes selon ce qui a été exécuté juste avant, un piège classique dans les tâches à plusieurs étapes comme l'empilement ou l'assemblage séquentiel. Des interventions contrôlées sur l'historique fourni au modèle montrent que la prédiction d'action dépend à la fois du contenu de cet historique et de son ordre temporel, confirmant que le raisonnement temporel agit comme un facteur causal de performance et non comme un simple bonus. Pour les intégrateurs et décideurs qui évaluent des piles VLA face à des offres comme Pi-0, GR00T N2 ou Helix, ce travail suggère qu'une part significative de l'écart de performance sur les tâches longues tient moins à la taille du modèle qu'à la façon dont l'historique d'exécution est structuré et injecté, sans alourdir la latence en production. Le papier s'inscrit dans une vague de recherches cherchant à combler l'écart entre démonstrations en laboratoire et généralisation réelle des VLA sur les tâches longues, un problème récurrent du secteur. Il se positionne explicitement en alternative aux approches qui nécessitent une estimation de mouvement ou un traitement géométrique explicite au moment de l'inférence, coûteux en calcul et en latence pour un déploiement en production. Aucun acteur industriel ni site de déploiement commercial n'est mentionné: il s'agit à ce stade d'un travail de recherche évalué uniquement sur les bancs d'essai en simulation LIBERO et RoboTwin, sans validation annoncée sur robot physique ni calendrier de mise en production. Reste à voir si cette approche de supervision temporelle sera reprise par des laboratoires ou fournisseurs de piles VLA commerciales pour la manipulation industrielle de longue durée.

RechercheOpinion
1 source