Aller au contenu principal
Robo-Dopamine 2.0 : récompense de processus conditionnée par l'historique et sensible aux données hors distribution pour la manipulation robotique
RecherchearXiv cs.RO 

Robo-Dopamine 2.0 : récompense de processus conditionnée par l'historique et sensible aux données hors distribution pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié le 18 août 2026 sur arXiv, un article présente Robo-Dopamine 2.0, un modèle de récompense de processus destiné à affiner par apprentissage par renforcement des politiques de manipulation robotique de type vision-langage-action (VLA). Le système combine des récompenses par paires conditionnées par l'historique, qui s'appuient sur des panels de référence pour les requêtes hors distribution (OOD) synthétiques et sur l'historique observé pour les requêtes en ligne, et un espace de progression signée distinguant progression valide, robustesse, échec et récupération. L'ensemble est entraîné via un curriculum baptisé "Signed-Hop", à rejeu conscient des transitions, qui apprend d'abord l'ordre grossier d'exécution avant le calibrage fin. Les auteurs publient aussi un jeu de trajectoires hors distribution et un banc d'essai en cinq familles de tâches. Les panels de référence font passer la cohérence d'ordre visuel (VOC) moyenne de 0,967 à 0,986, et la VOC robuste en OOD de 0,906 à 0,958. À budget égal de 400 000 paires de récompenses, l'entraînement Signed-Hop avec 25% de rejeu atteint 0,9872 de VOC contre 0,9858 pour un contrôle mélangé équivalent, et le modèle complet obtient 86,8% de réussite moyenne sur le benchmark RoboTwin, ainsi que 71 insertions réussies sur 80 en conditions réelles.

Ce travail s'attaque à un problème central des politiques VLA en production: les signaux de succès rares freinent l'exploration en apprentissage par renforcement, tandis que concevoir des récompenses denses à la main coûte cher et reste spécifique à chaque tâche. Les modèles de récompense visuelle existants, fondés sur de simples paires avant/après, souffrent d'ambiguïté temporelle et distinguent mal une variation qui préserve la robustesse d'un échec réellement invalidant lorsque le robot s'écarte de sa trajectoire nominale. En rendant le signal sensible à l'historique et conscient des états hors distribution, Robo-Dopamine 2.0 cherche à réduire l'écart entre démonstrations contrôlées et comportement réel face à des scènes modifiées. Le chiffre de 71 insertions sur 80 reste toutefois un résultat de recherche sur des tâches de préhension fine, pas une preuve de fiabilité en environnement industriel à grande échelle.

Le nom du système indique une filiation avec une première version, Robo-Dopamine, dont l'article ne détaille pas les résultats mais dont il corrige explicitement les limites: ambiguïté temporelle des récompenses statiques et faible discrimination des cas hors distribution. La démarche s'inscrit dans le courant du post-entraînement par renforcement de politiques VLA déjà pré-entraînées, de plus en plus utilisé pour affiner des modèles génériques de manipulation sans récompenses spécifiques à chaque tâche. Les auteurs présentent leur contribution comme une brique méthodologique, avec la publication conjointe du jeu de trajectoires OOD et du benchmark en cinq familles de tâches, pensés comme références de comparaison pour d'autres équipes. L'article ne mentionne ni partenariat industriel ni déploiement commercial: il s'agit d'une contribution de recherche en prépublication, sans calendrier annoncé vers un produit ou un intégrateur robotique.

À lire aussi

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains
1arXiv cs.RO 

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains

Des chercheurs publient HABIT (Human-Aware Behavior and Interaction Training), un jeu de données de démonstration pour l'apprentissage de politiques de manipulation robotique en présence humaine, décrit dans un article déposé sur arXiv (identifiant 2606.31682, juin 2026). Le corpus rassemble plus de 10 000 épisodes et 160 heures d'enregistrements couvrant 60 tâches, organisées selon trois rôles d'interaction homme-robot : « Collaborateur », où humain et robot accomplissent une tâche ensemble, « Collègue », où ils opèrent des tâches séparées dans un espace partagé, et « Superviseur », où l'humain dirige le robot par instructions. Contrairement aux jeux de données existants pour les politiques robotiques généralistes, collectés sans présence humaine dans la scène, HABIT introduit explicitement des humains dans les démonstrations. L'enjeu est la capacité des robots à adopter des comportements conscients de la présence humaine, un angle mort des grands corpus qui alimentent aujourd'hui les politiques VLA (vision-langage-action). Les expériences montrent que l'entraînement sur données incluant des humains fait émerger des comportements que les données robot seul ne produisent pas : synchronisation spatio-temporelle dans les tâches de collaboration, cession de passage dans les tâches de coexistence, et ancrage gestuel pour interpréter les instructions du superviseur. Les auteurs indiquent aussi que l'entraînement sur HABIT accélère l'adaptation à de nouvelles tâches d'interaction homme-robot. Pour les intégrateurs qui déploient des robots en usine ou en entrepôt aux côtés d'opérateurs, c'est un signal que la cohabitation sûre et fluide dépend moins du matériel que de la composition des données d'entraînement, un manque que la course aux modèles fondation robotiques a largement laissé de côté. HABIT s'inscrit dans la lignée des grands corpus type Open X-Embodiment ou DROID, qui ont permis l'essor des politiques généralistes telles que Pi-0 ou GR00T N2 mais restent tournés vers des scènes sans humains, un manque que plusieurs équipes académiques cherchent désormais à combler à mesure que les humanoïdes et bras collaboratifs sortent des lignes de démonstration pour entrer dans des ateliers occupés. À ce stade, HABIT reste une publication de recherche accompagnée d'un jeu de données, sans annonce de produit ni de partenariat industriel ; sa portée dépendra de son adoption par d'autres laboratoires pour entraîner et comparer leurs politiques sur des tâches de collaboration homme-robot.

RecherchePaper
1 source
Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone
2arXiv cs.RO 

Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone

Un modèle de recherche baptisé Streaming-WAM (World-Action Model), décrit dans un article publié sur arXiv le 25 septembre 2026 (arXiv:2609.28927v1), s'attaque au coût de calcul des modèles qui prédisent l'image future pour piloter un bras robotique. Ces modèles, dits world-action models, génèrent habituellement une prédiction visuelle avant de produire l'action suivante, ce qui immobilise le robot pendant l'inférence. Streaming-WAM fonctionne en mode asynchrone : à chaque mise à jour, il conditionne sa prédiction visuelle non seulement sur la dernière observation caméra, mais aussi sur les actions déjà engagées, c'est-à-dire le segment fixe du prochain lot de mouvements en cours d'exécution par le robot. Les caractéristiques visuelles ainsi anticipées servent ensuite à générer, dans la même passe, les actions restantes du lot. Sur le benchmark de simulation LIBERO, le système atteint un taux de succès moyen de 98,35 % tout en divisant par 2,93 le temps moyen par épisode par rapport à une variante appelée Fast-WAM. Sur une tâche en conditions réelles consistant à tamponner une feuille de papier, le temps d'épisode passe de 90 secondes avec un modèle synchrone classique (Joint-WAM) à 38 secondes avec Streaming-WAM. L'enjeu dépasse la simple accélération : les world-action models sont perçus comme un moyen de rendre la manipulation robotique plus robuste en anticipant les conséquences visuelles d'une action avant de l'exécuter, mais leur latence de génération les rendait jusqu'ici difficiles à déployer en temps réel. En montrant qu'il est possible de conserver un taux de succès élevé tout en réduisant fortement le temps de cycle grâce à l'asynchronie, ce travail répond directement à l'un des reproches récurrents faits aux architectures de prédiction du monde en robotique : leur écart entre performance en simulation et viabilité pratique. Pour les intégrateurs et laboratoires qui évaluent ces approches face aux politiques vision-langage-action plus légères, ce type de résultat suggère qu'il n'est plus nécessaire de sacrifier la vitesse pour garder les bénéfices de la prédiction visuelle. Le travail se positionne comme une amélioration incrémentale par rapport à deux approches de référence citées dans l'article, Fast-WAM et Joint-WAM, qui servent de points de comparaison directs plutôt que de produits commerciaux. Il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé sur un seul benchmark simulé et une unique tâche physique réalisée en laboratoire, sans indication de partenariat industriel, de déploiement en usine ni de calendrier de commercialisation. La prochaine étape logique, non détaillée dans l'article, consisterait à étendre l'évaluation à un éventail plus large de tâches manuelles réelles et à des plateformes robotiques variées.

RecherchePaper
1 source
Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)
3arXiv cs.RO 

Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)

Une équipe de recherche a publié le 22 septembre 2026 sur arXiv, sous la référence 2609.22332, AffordanceWAM, un nouveau modèle conjoint de monde et d'action pour la manipulation robotique généraliste. Bâti sur un Transformer de diffusion vidéo pré-entraîné, il associe un module « World Expert » et un module « Action Expert » reliés par une attention conjointe masquée, pour prédire simultanément les images RGB futures de la scène, un champ d'affordance scalaire, une carte de chaleur des zones manipulables et la trajectoire d'action continue du robot, sous un objectif d'entraînement unique de type flow-matching. Les vidéos humaines filmées à la première personne supervisent ces trois flux visuels, tandis que les démonstrations robotiques ajoutent la supervision d'action, sans retargeting ni étiquetage manuel des gestes humains, avant validation sur les bancs d'essai RoboCasa et CALVIN (protocole ABC vers D) et sur des tâches de manipulation réelles. Le problème visé est la pénurie de données d'entraînement pour les politiques vision-langage-action : les vidéos robot avec actions étiquetées restent coûteuses et peu diversifiées, tandis que les vidéos humaines égocentriques, abondantes, manquent d'actions robotiques exploitables et diffèrent en morphologie. AffordanceWAM affiche des gains constants face à des références limitées au RGB seul ou aux seules données robot, et surtout une amélioration monotone sur RoboCasa à mesure que le volume de vidéos humaines annotées en affordance augmente, à supervision robot constante. Pour les équipes entraînant des modèles VLA à grande échelle, ce résultat trace une voie pour réduire la dépendance à la téléopération coûteuse en exploitant des corpus vidéo humains déjà disponibles en masse. Le travail s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où prédiction vidéo et génération d'action sont fusionnées dans une architecture unique plutôt que traitées séparément, une direction également suivie par plusieurs laboratoires industriels développant des modèles vision-langage-action. Il s'agit à ce stade d'une prépublication non encore validée par relecture par les pairs, testée sur des bancs d'essai académiques et un nombre restreint de scénarios réels, et non d'un produit ou d'un déploiement commercial. Le papier ne précise ni la taille exacte des corpus vidéo humains, ni de calendrier de publication du code ou des poids du modèle, laissant la reproductibilité comme prochaine étape à vérifier.

RechercheActu
1 source
DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique
4arXiv cs.RO 

DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique

DreamX-Phi 1.0, un modèle de monde vidéo conditionné par l'action pour la manipulation robotique, est présenté dans un article déposé sur arXiv (2608.13489v1). À partir d'une image observée, d'une instruction en langage naturel et d'une séquence d'actions prescrite, poses de l'effecteur terminal et états du gripper, le système prédit les observations vidéo futures correspondantes. Pour éviter qu'une vidéo réaliste en apparence déplace le mauvais bras ou fasse disparaître l'objet manipulé, les auteurs injectent des transformations géométriques SE(3) propres à chaque bras dans les couches d'attention via un encodage de type PRoPE, complété par une branche de profondeur pour la géométrie de la scène et des masques SAM3 associés à un modèle enseignant V-JEPA figé pour maintenir la cohérence des objets durant la saisie. Le générateur multi-étapes est ensuite distillé en un modèle étudiant à peu d'étapes pour accélérer le déploiement. Le modèle revendique la première place sur la Track 1 et la deuxième sur la Track 2 du WorldArena 2.0 Challenge, avec publication annoncée du modèle et du code. Cette approche s'attaque à un problème central des modèles de monde appliqués à la robotique: une vidéo générée peut paraître photoréaliste tout en étant physiquement incohérente avec les commandes envoyées au robot, ce qui invalide son usage pour l'entraînement de politiques ou la planification. En ancrant la génération vidéo sur la géométrie rigide réelle de chaque bras et en préservant l'identité des objets manipulés, DreamX-Phi cherche à combler l'écart entre démonstration visuelle convaincante et fidélité exploitable pour le contrôle. La distillation en modèle étudiant à peu d'étapes répond à une contrainte pratique bien connue des intégrateurs: les modèles de monde vidéo multi-étapes sont souvent trop lents pour une boucle de contrôle temps réel, ce qui limite sinon leur usage à la simulation ou à l'évaluation hors ligne. Le classement sur WorldArena 2.0 reste toutefois un résultat de benchmark académique et non une validation en conditions réelles sur un robot physique. DreamX-Phi s'inscrit dans une vague plus large de modèles de monde vidéo pour la robotique, qui cherchent à compléter ou remplacer les architectures vision-langage-action comme Pi-0 ou GR00T N2 par une simulation générative directe des conséquences d'une action. Le recours à SAM3 pour la segmentation et à V-JEPA comme enseignant figé situe le projet dans la lignée des modèles de représentation vidéo auto-supervisés récents plutôt que dans une pile propriétaire fermée. À ce stade, aucune information ne mentionne de déploiement sur un robot physique ni de partenariat industriel: il s'agit d'un article de recherche accompagné d'un résultat de compétition, le modèle et le code étant seulement annoncés comme à venir. La suite logique, si cette promesse de publication est tenue, sera l'adoption du modèle comme brique de simulation ou d'évaluation par d'autres équipes travaillant sur la manipulation robotique.

RecherchePaper
1 source