Aller au contenu principal
Robometer : mise à l'échelle des modèles de récompense robotique généralistes par comparaison de trajectoires
RecherchearXiv cs.RO 

Robometer : mise à l'échelle des modèles de récompense robotique généralistes par comparaison de trajectoires

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié Robometer, un cadre de modélisation de récompense (reward model) généraliste pour robots, conçu pour s'entraîner sur de grands datasets incluant des trajectoires échouées et sous-optimales. Le système repose sur un double objectif d'apprentissage : une perte de progression par frame ancrée sur des données expertes, et une perte de comparaison de préférences entre trajectoires imposant des contraintes d'ordonnancement global entre différentes exécutions d'une même tâche. Pour soutenir cette approche à grande échelle, les auteurs ont constitué RBM-1M, un dataset dédié à l'apprentissage de récompenses comprenant plus d'un million de trajectoires couvrant des robots de morphologies et de tâches variées, avec une fraction substantielle de données sous-optimales et d'échecs avérés. Le code, les poids du modèle et des vidéos sont accessibles sur robometer.github.io.

L'enjeu est de surmonter la limitation fondamentale des reward models actuels, entraînés à prédire la progression absolue d'une tâche uniquement depuis des démonstrations expertes, ce qui confère une supervision purement locale et se révèle peu scalable face aux vastes datasets robotiques peuplés de trajectoires ratées ou imparfaites. Robometer exploite les comparaisons inter-trajectoires comme signal de supervision global, permettant d'extraire de l'information utile même des séquences d'échec et de lever l'ambiguïté de l'assignation de labels de progression denses. Ce changement de paradigme est significatif pour les praticiens : si les gains annoncés sur benchmarks et évaluations en conditions réelles se confirment indépendamment, les coûts de curation de données pour l'entraînement de politiques robotiques pourraient être substantiellement réduits.

La modélisation de récompenses à grande échelle est un problème ouvert depuis plusieurs années dans la communauté robotique, avec des approches comme EUREKA d'NVIDIA ou les variantes robotiques du RLHF (Reinforcement Learning from Human Feedback) qui cherchent toutes à réduire la dépendance à l'annotation humaine dense. Robometer se positionne comme une alternative généraliste et multi-embodiment, sans être lié à une architecture ou un robot spécifique. Les suites naturelles incluent l'intégration dans des pipelines VLA (Vision-Language-Action), où la qualité du signal de récompense conditionne directement la généralisabilité des politiques apprises à l'échelle ; l'ouverture du code et des poids rend désormais possible des validations indépendantes, condition nécessaire pour confirmer les bénéfices au-delà du cadre expérimental des auteurs.

À lire aussi

Transformer des modèles vidéo en politiques robotiques généralistes
1arXiv cs.RO 

Transformer des modèles vidéo en politiques robotiques généralistes

Des chercheurs du MIT CSAIL ont publié fin mai 2026 un preprint (arXiv:2605.27817) présentant VERA, pour Video-to-Embodied Robot Action Model, une architecture qui transforme des modèles vidéo génératifs en politiques robotiques généralisables. L'idée centrale est de découpler deux composants qui, dans les approches récentes, sont souvent entraînés conjointement : un planificateur vidéo, qui prédit des séquences d'images représentant la complétion d'une tâche, et un modèle de dynamique inverse (IDM, Inverse Dynamics Model) spécifique à l'effecteur, qui traduit ces images en commandes motrices concrètes. L'IDM est conçu à partir du Jacobien cinématique du robot, ce qui le rend à la fois efficient en données et extensible aux espaces d'action de haute dimension. L'équipe démontre VERA sur deux configurations : manipulation zero-shot d'un bras Panda 7-DOF et réorientation de cube en dextérité avec une main Allegro à 16 degrés de liberté, sur des benchmarks simulés et réels. Ce découplage constitue une alternative architecturale directe aux fondations robotiques qui co-entraînent prédiction d'observations et prédiction d'actions sur des données étiquetées (action-labeled), comme le proposent Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. L'avantage opérationnel est concret : le planificateur vidéo reste agnostique à l'effecteur et peut être partagé entre plusieurs robots en changeant uniquement l'IDM associé, sans réentraîner le backbone vidéo. L'IDM peut lui-même être entraîné sur des données de self-play facilement disponibles, ce qui réduit la dépendance aux démonstrations humaines coûteuses. Les résultats zero-shot sur des tâches de manipulation réelle renforcent la thèse que le gap sim-to-real peut être atténué par une modélisation géométrique rigoureuse de l'effecteur. La course aux VLA (Vision-Language-Action models) et aux politiques cross-embodiment est aujourd'hui dominée par des laboratoires bien capitalisés : Physical Intelligence avec Pi-0 et Pi-0.5, NVIDIA avec GR00T N2, Figure AI avec Helix, et 1X Technologies. VERA positionne le MIT CSAIL dans ce paysage avec une approche plus modulaire que les architectures monolithiques en vogue. Il s'agit pour l'instant d'un preprint de recherche, sans déploiement industriel annoncé ni partenariat hardware mentionné. Les résultats sont disponibles sur vera.csail.mit.edu, et la prochaine étape naturelle serait une évaluation sur des effecteurs plus variés ou des environnements non structurés pour valider la généralisation à plus grande échelle.

RechercheOpinion
1 source
FORGE : généraliser l'utilisation fonctionnelle d'outils par raisonnement sur trajectoires de points clés
2arXiv cs.RO 

FORGE : généraliser l'utilisation fonctionnelle d'outils par raisonnement sur trajectoires de points clés

Une équipe de recherche publie sur arXiv (arXiv:2607.05780) un système baptisé FORGE, conçu pour résoudre un problème concret de la robotique manipulatrice : un robot entraîné à utiliser un outil précis échoue généralement à transférer cette compétence à un objet différent partageant pourtant la même fonction, par exemple utiliser une pierre ou une chaussure pour planter un clou comme le ferait un humain. Les chercheurs ont testé plusieurs représentations intermédiaires (images d'affordance, vidéos de démonstration humaine, trajectoires de points-clés en 2D) et retiennent les trajectoires de points-clés comme le meilleur compromis entre expressivité fonctionnelle et capacité à être traduites en actions robotiques. FORGE fonctionne en deux étapes distinctes : d'abord prédire des trajectoires de points-clés génériques à partir de données sans action associée, puis les ancrer en commandes motrices concrètes grâce à un nombre limité de démonstrations. Sur un banc d'essai de sept outils dédié à une tâche de type "frapper pour enfoncer", la méthode dépasse les approches de référence sur des outils jamais vus, en simulation comme en conditions réelles, avec plus du double du taux de réussite moyen. Cette avancée cible un verrou connu des politiques d'apprentissage par imitation et des modèles vision-langage-action (VLA) : la plupart généralisent mal dès qu'un outil change de forme, même si sa fonction reste identique. Pour les intégrateurs qui envisagent des robots humanoïdes ou des bras manipulateurs en environnement non structuré, où l'outil disponible n'est pas toujours celui prévu, cette capacité d'improvisation fonctionnelle est un prérequis pour sortir de la démonstration contrôlée et aller vers un déploiement réel. FORGE s'inscrit dans une tendance de recherche plus large visant à découpler le raisonnement de haut niveau de l'exécution motrice, une logique que l'on retrouve dans des systèmes comme GR00T N2, Pi-0 ou Helix, qui cherchent tous à réduire la dépendance à des démonstrations robotiques coûteuses en s'appuyant sur des données vidéo ou des données sans action. Il s'agit ici d'un travail académique publié en préprint, sans partenaire industriel identifié ni déploiement annoncé : la prochaine étape logique serait d'étendre la validation au-delà de ce banc d'essai de sept outils vers des tâches de manipulation plus variées.

RecherchePaper
1 source
RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle
3arXiv cs.RO 

RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle

RynnValue s'attaque au goulot d'étranglement des modèles de récompense pour l'apprentissage robotique en remplaçant les ancrages classiques (préférences, progression normalisée) par la distance temporelle : le coût-à-parcourir dirigé entre une observation et un objectif spécifié en langage naturel. Comme ces étiquettes se déduisent directement des horodatages, le modèle open source s'entraîne sur plus de 7 000 heures et environ 3 millions de clips conditionnés par instruction, sans annotation de préférence ni de progression. Trois techniques stabilisent l'apprentissage à cette échelle : échantillonnage temporel aléatoire, mélange de l'ordre temporel et attention à isolation de valeur, qui empêchent le modèle de trouver des raccourcis insensibles aux échecs et régressions. Résultat : un Kendall's tau_a moyen de 0,675 sur le benchmark RBM-EVAL-OOD, devant l'état de l'art entièrement supervisé par préférences (0,655) et plus du double d'un équivalent entraîné uniquement sur la progression (0,292), avec généralisation zero-shot à des tâches, embodiments et points de vue inédits. Converti en récompense dense via un potential-based shaping, il fait grimper le taux de succès de politiques robotiques réelles de 52,5% à 72,5% en ligne, et de 63,8% à 82,5% hors ligne. Pour les intégrateurs et décideurs robotique, ce résultat pèse dans le débat sur le passage à l'échelle des modèles VLA : il suggère qu'un signal de supervision dérivé automatiquement des timestamps peut remplacer l'annotation manuelle coûteuse (préférences, jugements de progression) tout en généralisant mieux à des robots et environnements jamais vus à l'entraînement. C'est une preuve concrète que le goulot d'étranglement des reward models, souvent cité comme frein au reinforcement learning robotique à grande échelle, peut être contourné par un signal purement temporel plutôt que par plus d'annotation humaine. L'amélioration mesurée du taux de succès en conditions réelles, et pas seulement sur benchmark hors ligne, distingue ce travail d'une simple démonstration académique et le rend directement pertinent pour qui cherche à industrialiser des politiques génératives de contrôle robotique. RynnValue s'inscrit dans la lignée des modèles de fondation pour la robotique de type VLA (vision-langage-action), aux côtés d'approches comme Pi-0 ou GR00T N2, qui cherchent toutes à exploiter des corpus hétérogènes multi-embodiments pour généraliser au-delà d'un seul robot ou d'une seule tâche. Contrairement aux méthodes appuyées sur des préférences annotées ou une progression normalisée par tâche, difficilement transférables entre plateformes et sources de données, RynnValue mise sur un signal universel et bon marché à produire. Le fait que le modèle et vraisemblablement son code soient publiés en open source (arXiv, août 2026) facilite sa reproduction et son intégration par des laboratoires tiers pour du reward shaping en apprentissage par renforcement. Les prochaines étapes attendues concernent l'extension à davantage d'embodiments et de tâches en conditions réelles, ainsi que la comparaison avec d'autres modèles de récompense émergents dans un secteur où la fiabilité du reward model conditionne directement la vitesse d'entraînement des politiques.

RecherchePaper
1 source
RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes
4arXiv cs.RO 

RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes

Une équipe de chercheurs a publié RoboMME (Robotic Multi-Memory Evaluation), un benchmark standardisé à grande échelle destiné à évaluer les modèles VLA (vision-language-action) sur des tâches de manipulation robotique nécessitant de la mémoire à long horizon. Le benchmark comprend 16 tâches construites selon une taxonomie en quatre catégories : mémoire temporelle, spatiale, des objets et procédurale, couvrant des scénarios comme le comptage d'actions répétées ou la manipulation d'objets temporairement occultés. Les auteurs ont également développé 14 variantes de VLA augmentées de mémoire, toutes bâties sur le backbone pi0.5 de Physical Intelligence, et les ont évaluées selon différentes stratégies d'intégration mémorielle. L'absence d'un cadre d'évaluation standardisé était jusqu'ici un frein majeur pour la recherche sur la mémoire dans les VLA généralistes : chaque équipe testait ses mécanismes dans des conditions ad hoc, rendant toute comparaison rigoureuse impossible. RoboMME comble ce vide en permettant, pour la première fois, de mesurer systématiquement comment différentes représentations mémorielles (états cachés récurrents, mémoire externe, fenêtre de contexte longue) se comportent sur un spectre de tâches hétérogènes. La conclusion principale est nuancée : l'efficacité d'une architecture mémoire est fortement dépendante de la tâche, chaque approche présentant des avantages distincts selon la catégorie, ce qui remet en cause l'idée qu'une solution universelle serait à portée à court terme. Pour les intégrateurs et les décideurs B2B, cela signifie concrètement que le choix du mécanisme mémoriel devra rester spécifique au cas d'usage, sans recette générique applicable. Ce benchmark s'inscrit dans la montée en puissance des VLA généralistes, portés par des modèles comme pi0 et pi0.5 de Physical Intelligence (levée de 400 millions de dollars en 2024), OpenVLA, Octo ou RoboVLMs, qui cherchent tous à transférer les capacités des grands modèles de langage à la manipulation physique. D'autres benchmarks comme LIBERO, RoboSuite ou MetaWorld couvrent déjà l'évaluation générale des VLA, mais RoboMME se distingue par son focus explicite sur la mémoire à long horizon, un aspect jusqu'ici systématiquement sous-évalué dans ces environnements. Les prochaines étapes probables incluent l'adoption de RoboMME comme référence communautaire dans les pipelines d'évaluation des grands labs robotiques, et le développement d'architectures mémoire capables de généraliser entre catégories de tâches sans sacrifier les performances spécialisées.

RechercheActu
1 source