Aller au contenu principal
RecherchearXiv cs.RO 

RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RynnValue s'attaque au goulot d'étranglement des modèles de récompense pour l'apprentissage robotique en remplaçant les ancrages classiques (préférences, progression normalisée) par la distance temporelle : le coût-à-parcourir dirigé entre une observation et un objectif spécifié en langage naturel. Comme ces étiquettes se déduisent directement des horodatages, le modèle open source s'entraîne sur plus de 7 000 heures et environ 3 millions de clips conditionnés par instruction, sans annotation de préférence ni de progression. Trois techniques stabilisent l'apprentissage à cette échelle : échantillonnage temporel aléatoire, mélange de l'ordre temporel et attention à isolation de valeur, qui empêchent le modèle de trouver des raccourcis insensibles aux échecs et régressions. Résultat : un Kendall's tau_a moyen de 0,675 sur le benchmark RBM-EVAL-OOD, devant l'état de l'art entièrement supervisé par préférences (0,655) et plus du double d'un équivalent entraîné uniquement sur la progression (0,292), avec généralisation zero-shot à des tâches, embodiments et points de vue inédits. Converti en récompense dense via un potential-based shaping, il fait grimper le taux de succès de politiques robotiques réelles de 52,5% à 72,5% en ligne, et de 63,8% à 82,5% hors ligne.

Pour les intégrateurs et décideurs robotique, ce résultat pèse dans le débat sur le passage à l'échelle des modèles VLA : il suggère qu'un signal de supervision dérivé automatiquement des timestamps peut remplacer l'annotation manuelle coûteuse (préférences, jugements de progression) tout en généralisant mieux à des robots et environnements jamais vus à l'entraînement. C'est une preuve concrète que le goulot d'étranglement des reward models, souvent cité comme frein au reinforcement learning robotique à grande échelle, peut être contourné par un signal purement temporel plutôt que par plus d'annotation humaine. L'amélioration mesurée du taux de succès en conditions réelles, et pas seulement sur benchmark hors ligne, distingue ce travail d'une simple démonstration académique et le rend directement pertinent pour qui cherche à industrialiser des politiques génératives de contrôle robotique.

RynnValue s'inscrit dans la lignée des modèles de fondation pour la robotique de type VLA (vision-langage-action), aux côtés d'approches comme Pi-0 ou GR00T N2, qui cherchent toutes à exploiter des corpus hétérogènes multi-embodiments pour généraliser au-delà d'un seul robot ou d'une seule tâche. Contrairement aux méthodes appuyées sur des préférences annotées ou une progression normalisée par tâche, difficilement transférables entre plateformes et sources de données, RynnValue mise sur un signal universel et bon marché à produire. Le fait que le modèle et vraisemblablement son code soient publiés en open source (arXiv, août 2026) facilite sa reproduction et son intégration par des laboratoires tiers pour du reward shaping en apprentissage par renforcement. Les prochaines étapes attendues concernent l'extension à davantage d'embodiments et de tâches en conditions réelles, ainsi que la comparaison avec d'autres modèles de récompense émergents dans un secteur où la fiabilité du reward model conditionne directement la vitesse d'entraînement des politiques.

À lire aussi

Modèle fondation à l'échelle pour robots humanoïdes
1arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation
2arXiv cs.RO 

RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation

Des chercheurs ont publié le 26 mai 2026 sur arXiv (2605.25495) RepSAM, un cadre d'adaptation à l'efficacité paramétrique (PEFT) conçu pour transférer les capacités de SAM (Segment Anything Model) vers la perception robotique en environnements non structurés. Le diagnostic de départ est précis : les couches superficielles du transformeur subissent un écart de représentation important entre données génériques et données robotiques (CKA inférieur à 0,7), tandis que les couches profondes restent stables (CKA supérieur à 0,7). RepSAM exploite cette asymétrie via une allocation de rang guidée par la CKA (Centered Kernel Alignment) pour concentrer les paramètres entraînables là où le décalage est effectivement significatif. Le résultat : 89,0 % de mIoU contre 90,9 % pour le fine-tuning complet, soit 97,9 % des performances, avec seulement 4,0 millions de paramètres entraînables sur 632 millions totaux, une réduction de 158 fois. L'entraînement tient en 4 heures sur un seul GPU A100, contre 384 heures-GPU pour le fine-tuning intégral, et surpasse DoRA de 7,9 points de mIoU sur six benchmarks. En manipulation robotique, le gain atteint 12 points absolus de taux de succès par rapport à la baseline LoRA RGB, avec une significativité statistique p inférieur à 0,01. L'enjeu industriel est direct : le gouffre entre les modèles de vision généralistes et les conditions réelles de la robotique (objets transparents, scènes encombrées, éclairage variable) reste l'un des principaux blocages pour les intégrateurs. RepSAM démontre qu'un adapter bien ciblé, informé par la structure interne du réseau plutôt qu'appliqué uniformément, peut quasiment égaler un fine-tuning complet à une fraction du coût de calcul. Pour un responsable technique déployant des bras manipulateurs ou des systèmes de picking, cela signifie qu'il devient réaliste d'adapter un modèle de fondation sur du matériel standard, sans infrastructure de calcul dédiée ni données massives. SAM, développé par Meta AI et publié en 2023, s'est imposé comme référence pour la segmentation zero-shot, mais ses performances se dégradent hors distribution, notamment en robotique industrielle. Les méthodes PEFT comme LoRA et DoRA avaient déjà tenté ce pont, avec des gains limités faute d'adaptation différenciée par couche. RepSAM s'inscrit dans la continuité de travaux sur l'analyse de représentation pour guider le fine-tuning (CKA comme outil de diagnostic, popularisé depuis 2019). La prochaine étape logique est la validation sur des robots réels en conditions industrielles ; l'article se limite pour l'instant à des benchmarks simulés et des tâches de manipulation contrôlées, ce qui laisse ouvert le sim-to-real gap à grande échelle.

UELes intégrateurs européens de bras manipulateurs et systèmes de picking pourraient adapter des modèles de vision fondation sur du matériel GPU standard, réduisant la barrière à l'IA perceptive sans infrastructure de calcul dédiée.

RechercheOpinion
1 source
ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts
3arXiv cs.RO 

ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts

Des chercheurs présentent ViTacWorld, un modèle de monde visuo-tactile conditionné par l'action, conçu pour la manipulation robotique riche en contacts, décrit dans une prépublication arXiv (2607.22530v1). Le système s'appuie sur des jeux de données tactiles réels publics combinés à un environnement de simulation construit spécifiquement pour l'occasion, afin de générer à grande échelle des trajectoires visuo-tactiles-actions. Le modèle est d'abord préentraîné sur de larges volumes de trajectoires réelles et simulées, puis affiné avec des rollouts de politiques collectés en conditions réelles pour mieux coller aux comportements de manipulation visés. À partir d'une séquence d'actions du robot, ViTacWorld prédit conjointement les observations visuelles et le retour tactile correspondants, permettant de générer des rollouts visuo-tactiles-actions complets. Les auteurs présentent cela comme le premier cadre exploitant un modèle de monde pour la génération de trajectoires visuo-tactiles-actions et l'évaluation de politiques robotiques. L'enjeu central est le coût et la rareté des données tactiles réelles, qui freinent l'apprentissage robotique basé sur le toucher : matériel spécifique, collecte coûteuse, diversité de tâches et de scènes limitée. En misant sur le fait que le signal tactile, directement ancré dans le contact physique, souffre d'un écart simulation-vers-réel plus faible que la seule vision, ViTacWorld propose une voie pour combler ce manque de données sans multiplier les campagnes de collecte sur robot réel. Pour les équipes de recherche en manipulation fine (assemblage, insertion, préhension d'objets déformables), cela ouvre deux usages concrets : générer des données synthétiques pour améliorer des politiques tactiles en aval, et évaluer des politiques existantes en prédisant leurs résultats visuo-tactiles sous des séquences d'actions contrôlées, sans passer systématiquement par des essais physiques. C'est un signal de plus que les modèles de monde, déjà répandus en vision, commencent à s'étendre à d'autres modalités sensorielles pour la robotique de contact. Ce travail s'inscrit dans la lignée des modèles de monde appliqués à la robotique, jusqu'ici centrés presque exclusivement sur la modalité visuelle, et dans la continuité des efforts pour réduire la dépendance de l'apprentissage tactile aux capteurs propriétaires et aux collectes sur site. Les expériences menées par les auteurs sur des tâches de manipulation riches en contacts montrent que ViTacWorld génère des rollouts physiquement cohérents, améliore les performances de politiques via une augmentation de données scalable, et permet une évaluation de politiques conditionnée par l'action. Le projet est documenté sur vitacworld.github.io. L'article ne mentionne aucun partenariat industriel ni déploiement commercial à ce stade : il s'agit d'une contribution de recherche dont la portée réelle dépendra de sa reproduction sur des plateformes robotiques variées et de son adoption par des équipes travaillant sur l'assemblage ou la manipulation fine en environnement industriel.

RecherchePaper
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
4arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source