Aller au contenu principal
RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle
RecherchearXiv cs.RO 

RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RynnValue s'attaque au goulot d'étranglement des modèles de récompense pour l'apprentissage robotique en remplaçant les ancrages classiques (préférences, progression normalisée) par la distance temporelle : le coût-à-parcourir dirigé entre une observation et un objectif spécifié en langage naturel. Comme ces étiquettes se déduisent directement des horodatages, le modèle open source s'entraîne sur plus de 7 000 heures et environ 3 millions de clips conditionnés par instruction, sans annotation de préférence ni de progression. Trois techniques stabilisent l'apprentissage à cette échelle : échantillonnage temporel aléatoire, mélange de l'ordre temporel et attention à isolation de valeur, qui empêchent le modèle de trouver des raccourcis insensibles aux échecs et régressions. Résultat : un Kendall's tau_a moyen de 0,675 sur le benchmark RBM-EVAL-OOD, devant l'état de l'art entièrement supervisé par préférences (0,655) et plus du double d'un équivalent entraîné uniquement sur la progression (0,292), avec généralisation zero-shot à des tâches, embodiments et points de vue inédits. Converti en récompense dense via un potential-based shaping, il fait grimper le taux de succès de politiques robotiques réelles de 52,5% à 72,5% en ligne, et de 63,8% à 82,5% hors ligne.

Pour les intégrateurs et décideurs robotique, ce résultat pèse dans le débat sur le passage à l'échelle des modèles VLA : il suggère qu'un signal de supervision dérivé automatiquement des timestamps peut remplacer l'annotation manuelle coûteuse (préférences, jugements de progression) tout en généralisant mieux à des robots et environnements jamais vus à l'entraînement. C'est une preuve concrète que le goulot d'étranglement des reward models, souvent cité comme frein au reinforcement learning robotique à grande échelle, peut être contourné par un signal purement temporel plutôt que par plus d'annotation humaine. L'amélioration mesurée du taux de succès en conditions réelles, et pas seulement sur benchmark hors ligne, distingue ce travail d'une simple démonstration académique et le rend directement pertinent pour qui cherche à industrialiser des politiques génératives de contrôle robotique.

RynnValue s'inscrit dans la lignée des modèles de fondation pour la robotique de type VLA (vision-langage-action), aux côtés d'approches comme Pi-0 ou GR00T N2, qui cherchent toutes à exploiter des corpus hétérogènes multi-embodiments pour généraliser au-delà d'un seul robot ou d'une seule tâche. Contrairement aux méthodes appuyées sur des préférences annotées ou une progression normalisée par tâche, difficilement transférables entre plateformes et sources de données, RynnValue mise sur un signal universel et bon marché à produire. Le fait que le modèle et vraisemblablement son code soient publiés en open source (arXiv, août 2026) facilite sa reproduction et son intégration par des laboratoires tiers pour du reward shaping en apprentissage par renforcement. Les prochaines étapes attendues concernent l'extension à davantage d'embodiments et de tâches en conditions réelles, ainsi que la comparaison avec d'autres modèles de récompense émergents dans un secteur où la fiabilité du reward model conditionne directement la vitesse d'entraînement des politiques.

À lire aussi

Modèle fondation à l'échelle pour robots humanoïdes
1arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation
2arXiv cs.RO 

RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation

Des chercheurs ont publié le 26 mai 2026 sur arXiv (2605.25495) RepSAM, un cadre d'adaptation à l'efficacité paramétrique (PEFT) conçu pour transférer les capacités de SAM (Segment Anything Model) vers la perception robotique en environnements non structurés. Le diagnostic de départ est précis : les couches superficielles du transformeur subissent un écart de représentation important entre données génériques et données robotiques (CKA inférieur à 0,7), tandis que les couches profondes restent stables (CKA supérieur à 0,7). RepSAM exploite cette asymétrie via une allocation de rang guidée par la CKA (Centered Kernel Alignment) pour concentrer les paramètres entraînables là où le décalage est effectivement significatif. Le résultat : 89,0 % de mIoU contre 90,9 % pour le fine-tuning complet, soit 97,9 % des performances, avec seulement 4,0 millions de paramètres entraînables sur 632 millions totaux, une réduction de 158 fois. L'entraînement tient en 4 heures sur un seul GPU A100, contre 384 heures-GPU pour le fine-tuning intégral, et surpasse DoRA de 7,9 points de mIoU sur six benchmarks. En manipulation robotique, le gain atteint 12 points absolus de taux de succès par rapport à la baseline LoRA RGB, avec une significativité statistique p inférieur à 0,01. L'enjeu industriel est direct : le gouffre entre les modèles de vision généralistes et les conditions réelles de la robotique (objets transparents, scènes encombrées, éclairage variable) reste l'un des principaux blocages pour les intégrateurs. RepSAM démontre qu'un adapter bien ciblé, informé par la structure interne du réseau plutôt qu'appliqué uniformément, peut quasiment égaler un fine-tuning complet à une fraction du coût de calcul. Pour un responsable technique déployant des bras manipulateurs ou des systèmes de picking, cela signifie qu'il devient réaliste d'adapter un modèle de fondation sur du matériel standard, sans infrastructure de calcul dédiée ni données massives. SAM, développé par Meta AI et publié en 2023, s'est imposé comme référence pour la segmentation zero-shot, mais ses performances se dégradent hors distribution, notamment en robotique industrielle. Les méthodes PEFT comme LoRA et DoRA avaient déjà tenté ce pont, avec des gains limités faute d'adaptation différenciée par couche. RepSAM s'inscrit dans la continuité de travaux sur l'analyse de représentation pour guider le fine-tuning (CKA comme outil de diagnostic, popularisé depuis 2019). La prochaine étape logique est la validation sur des robots réels en conditions industrielles ; l'article se limite pour l'instant à des benchmarks simulés et des tâches de manipulation contrôlées, ce qui laisse ouvert le sim-to-real gap à grande échelle.

UELes intégrateurs européens de bras manipulateurs et systèmes de picking pourraient adapter des modèles de vision fondation sur du matériel GPU standard, réduisant la barrière à l'IA perceptive sans infrastructure de calcul dédiée.

RechercheOpinion
1 source
LIBERO-VPro : évaluer la robustesse visuelle en boucle fermée des modèles fondation pour la robotique
3arXiv cs.RO 

LIBERO-VPro : évaluer la robustesse visuelle en boucle fermée des modèles fondation pour la robotique

Des chercheurs publient LIBERO-VPro (arXiv:2609.24350), un benchmark conçu pour évaluer la robustesse visuelle en boucle fermée des modèles fondation destinés à la manipulation robotique, alors que les évaluations standards supposent des observations visuelles propres et synchrones du début à la fin de la tâche. Le benchmark perturbe délibérément le flux visuel disponible pendant l'exécution, selon quatre axes complémentaires : dégradation de l'évidence visuelle, obsolescence de la caméra, cohérence de la source visuelle, et variation de scène pertinente pour la tâche, répartis en 12 catégories de défis, 96 configurations expérimentales et 3296 cas tâche-condition. L'équipe évalue trois modèles vision-langage-action (VLA) et trois modèles world-action (WAM) sur environ 196 000 épisodes simulés, complétés par 200 essais réels sur un bras Franka Research 3. Le résultat central : une performance nominale élevée sur les benchmarks classiques masque des faiblesses substantielles d'ancrage visuel et d'adaptation. Les modèles testés tolèrent bien une occlusion sévère des objets, mais se dégradent brutalement dès que les indices d'interaction locale sont perturbés ou que des a priori spatiaux familiers sont violés ; ils se montrent aussi très sensibles à des observations périmées ou manquantes, et peinent à adapter leur comportement quand les préconditions de la tâche changent. Point notable pour les intégrateurs et les équipes de recherche : VLA et WAM affichent des profils de robustesse distincts, ce qui confirme que la robustesse visuelle est multidimensionnelle et dépend de l'architecture, plutôt que d'être une propriété acquise mécaniquement via le préentraînement à grande échelle. Pour une industrie qui pousse ces modèles vers des déploiements réels, l'étude rappelle qu'un bon score sur un benchmark statique ne garantit rien face à une caméra dégradée, une latence ou une scène qui change, un écart largement soupçonné mais rarement quantifié de façon aussi systématique. LIBERO-VPro s'appuie sur la suite LIBERO, déjà utilisée comme référence pour l'apprentissage continu en manipulation robotique, en y ajoutant une couche de perturbation visuelle absente des évaluations existantes. Le papier ne nomme pas publiquement les modèles VLA et WAM testés, mais s'inscrit dans un paysage où des familles comme Pi-0, GR00T N2 ou Helix cherchent justement à prouver leur fiabilité au-delà de démonstrations scriptées. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste un travail de recherche académique et non une annonce produit ni un déploiement commercial. Les auteurs présentent LIBERO-VPro comme un cadre de diagnostic destiné à guider le développement de futurs modèles capables de mieux ancrer et adapter leurs actions en conditions visuelles dégradées, sans calendrier de suite ni partenariat industriel annoncé.

RechercheActu
1 source
ActiveScale : passer à l'échelle la perception active des robots (modèle, données, matériel)
4arXiv cs.RO 

ActiveScale : passer à l'échelle la perception active des robots (modèle, données, matériel)

Un article de recherche publié sur arXiv sous la référence 2609.18514v1 présente ActiveScale, un framework conçu pour améliorer la perception active dans la manipulation robotique, c'est-à-dire la capacité d'un robot à changer de point de vue pour observer des informations autrement occultées par une caméra fixe. Le système combine un modèle vision-langage-action (VLA) enrichi d'observations vidéo historiques et d'une supervision explicite de la pose de caméra, via des jetons de pose associés à chaque image et une tête de prédiction légère qui relie les observations entre différents points de vue. Pour entraîner ce modèle à exploiter les mouvements de caméra naturels présents dans l'activité humaine, les auteurs introduisent une méthode de pré-entraînement intermédiaire combinant 1000 heures de données égocentriques (captées du point de vue humain) et de données robotiques. Ils présentent également une plateforme matérielle dédiée, baptisée AMP (Active-perception Mobile-manipulation Platform), pilotable par un seul opérateur en téléopération, qui permet de collecter à grande échelle des démonstrations coordonnant changement de point de vue et manipulation. Cette approche s'attaque à une limite bien connue des modèles VLA actuels : un point de vue fixe laisse fréquemment des zones de la scène occultées, ce qui dégrade les performances de manipulation en conditions réelles. En s'appuyant sur des données égocentriques humaines, moins coûteuses à produire que la téléopération robotique classique, les auteurs proposent une piste concrète pour atténuer le goulot d'étranglement des données de démonstration, un frein central au passage à l'échelle des VLA. Les expériences rapportent une amélioration des taux de succès sur des tâches de perception active, sans toutefois fournir de pourcentages précis dans le résumé, ce qui invite à la prudence quant à l'ampleur réelle du gain avant lecture du papier complet. Il s'agit d'une contribution académique, et non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun site de déploiement ni aucun partenaire n'est cité. Le travail s'inscrit dans la lignée des recherches visant à doter les modèles VLA d'un raisonnement spatial et temporel plus riche pour la manipulation robotique. Les auteurs présentent leur combinaison de modèle, de données et de plateforme matérielle comme une base destinée à la communauté de recherche pour poursuivre l'étude de la perception active, sans annoncer de calendrier de commercialisation ni de partenariat industriel.

RechercheActu
1 source