Aller au contenu principal
RecherchearXiv cs.RO 

Passage à l'échelle de l'apprentissage de récompense vision-langage pour la manipulation robotique en simulation parallèle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient RAPID (Reward learning with Adaptive Parallel Image Diversity) sur arXiv (2609.21767, fin septembre 2026), un système qui accélère l'apprentissage de récompense par préférences où des modèles vision-langage remplacent les annotateurs humains. Il combine rollouts parallélisés sur GPU, mises à jour de politique adaptatives, étiquetage de préférences en une seule requête API, stabilisation automatique de la récompense et échantillonnage d'images représentatives. Testé sur cinq tâches de manipulation avec un bras Franka Panda dans le simulateur IsaacLab, il réduit d'abord le temps d'entraînement moyen de 9,18 à 3,13 heures via la seule parallélisation. Tous composants activés, l'entraînement complet tombe à 1,15 heure, avec 896 appels API au lieu de 19 840 par run (-95,5%), et le taux de réussite agrégé grimpe de 86,3% à 98,7%, pour un gain global de 8 fois. Une évaluation hors ligne avec Gemma 3 12B et GPT-4.1 mini confirme les gains de latence et de coût. Le code est publié sur GitHub (rapid-vlm/rapid-vlm-rl).

Ce travail cible un goulot d'étranglement identifié dans le secteur: utiliser un VLM comme juge de préférences pour entraîner des politiques de manipulation multiplie les appels API et le temps de simulation, rendant cet apprentissage par renforcement trop coûteux pour un usage industriel à grande échelle. En montrant qu'une refonte architecturale (parallélisation, réduction des requêtes, sélection d'images pertinentes) divise le coût en API par vingt et le temps d'entraînement par huit tout en améliorant le taux de succès, RAPID ouvre une voie vers un entraînement guidé par VLM viable hors des laboratoires aux budgets de calcul massifs, un enjeu pour les intégrateurs cherchant à adapter rapidement des politiques à de nouvelles tâches.

L'apprentissage par préférences existe depuis plusieurs années en robotique, mais reposait historiquement sur des annotateurs humains, lents et coûteux à mobiliser. Le recours à des VLM comme GPT-4.1 mini ou Gemma 3 12B pour juger des paires de trajectoires s'inscrit dans la tendance du "LLM-as-judge" appliquée à la robotique. RAPID se positionne comme une optimisation système plutôt qu'un nouvel algorithme de récompense, en s'attaquant à la latence des requêtes séquentielles et à la collecte de données limitée à un seul environnement, deux freins pratiques à l'adoption. Le code publié par les auteurs permettra à d'autres équipes de reproduire les résultats sur IsaacLab et d'étendre l'évaluation au-delà du bras Franka Panda utilisé ici.

À lire aussi

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
1arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action
2arXiv cs.RO 

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action

Le laboratoire de recherche en robotique derrière l'étude "Foresight Residual RL" a publié le 24 juillet 2026 sur arXiv (2607.16506v1) une méthode visant à corriger un défaut connu des politiques Vision-Language-Action (VLA) sur les tâches d'assemblage complexes. Le problème identifié est concret : sur une tâche en trois phases (saisie, déplacement-insertion, rotation) simulant le serrage d'un écrou avec une clé dans l'environnement Isaac Gym, les méthodes classiques de reinforcement learning résiduel appliquées à une politique VLA gelée échouent à enchaîner les sous-tâches correctement, même quand chaque sous-tâche individuelle réussit. La solution proposée, baptisée Foresight Residual RL, entraîne un prédicteur visuel qui estime, à partir d'une image de l'état terminal d'une sous-tâche, la probabilité de succès des sous-tâches suivantes, et utilise cette estimation comme multiplicateur de récompense pour orienter l'apprentissage. Sur la tâche testée, la méthode atteint 85,6% de réussite sur l'ensemble de la séquence, contre 54,5% pour le RL résiduel standard et des résultats inférieurs pour les politiques VLA de base seules. Ce résultat pointe un angle mort largement sous-estimé dans le déploiement industriel des politiques génératives pour la manipulation robotique : optimiser chaque geste isolément ne garantit pas un enchaînement fiable des tâches. Pour les intégrateurs qui envisagent des lignes d'assemblage à tolérances serrées, contact-riche, type ligne électronique ou mécanique de précision, la démonstration confirme un écart persistant entre la performance en démonstration isolée et la performance en séquence réelle, un des points de vigilance recurrents pointés par les acteurs du secteur, sceptiques face aux vidéos promotionnelles de robots humanoïdes. Le fait que le succès par sous-tâche reste inchangé alors que le succès global bondit change la manière de penser l'entraînement : il ne s'agit plus seulement de maximiser un taux de réussite par étape, mais de façonner l'état terminal produit à chaque étape pour qu'il reste exploitable par l'étape suivante, une nuance directement pertinente pour les équipes qui construisent des pipelines d'apprentissage par renforcement sur des bases VLA préentraînées comme Pi-0 ou GR00T. Cette approche s'inscrit dans la lignée des travaux récents combinant politiques VLA préentraînées et affinage par RL résiduel, une stratégie de plus en plus utilisée pour adapter des modèles de manipulation généralistes à des tâches industrielles spécifiques sans réentraîner l'ensemble du modèle. La méthode a été validée uniquement en simulation, sur une tâche mécanique unique et relativement contrainte ; aucune date de transfert vers un robot physique ni de partenariat industriel n'est mentionnée dans l'article. Les auteurs positionnent leurs travaux comme une réponse méthodologique générale au problème d'attribution de crédit sur des horizons longs, un défi que partagent les principaux laboratoires travaillant sur les politiques génératives pour bras robotiques et humanoïdes, de Physical Intelligence à NVIDIA, sans qu'aucun acteur français ou européen ne soit cité dans cette publication.

RecherchePaper
1 source
Réduction de récompense dense pour la manipulation robotique via synthèse d'échecs
3arXiv cs.RO 

Réduction de récompense dense pour la manipulation robotique via synthèse d'échecs

Des chercheurs présentent DenseReward, un modèle de récompense visio-linguistique conçu pour l'apprentissage par renforcement (RL) appliqué à la manipulation robotique, détaillé dans un article publié sur arXiv (2607.13033v1). Le système répond à deux limites connues des modèles de récompense existants : la difficulté de collecter des trajectoires d'échec à grande échelle et l'absence de signaux fins au-delà d'un simple label de succès ou d'échec en fin de trajectoire. Pour cela, les auteurs ont développé un pipeline automatisé qui synthétise en simulation des trajectoires d'échec physiquement réalistes, sans intervention humaine, couvrant des modes de défaillance variés : collisions, préhensions manquées, chutes d'objets et comportements de récupération. À partir de ces données, DenseReward prédit des scores de récompense image par image, à partir d'observations visuelles et d'instructions en langage naturel, permettant d'estimer la progression d'une tâche tout au long d'un épisode plutôt qu'un simple verdict final. Les expériences montrent que ce modèle surpasse à la fois des VLM généralistes et les modèles de récompense robotiques existants sur la prédiction de récompense dense, en simulation comme en conditions réelles. Cette avancée cible un goulot d'étranglement central du RL en robotique : sans retour dense et fiable, l'optimisation de politiques reste inefficace et dépendante de démonstrations imitées, ce qui limite la capacité des robots à dépasser les performances de leurs données d'entraînement. En automatisant la génération de données d'échec, DenseReward réduit un coût d'annotation humaine qui freinait jusqu'ici le déploiement du RL à grande échelle sur des tâches de manipulation, un enjeu direct pour l'entraînement de politiques VLA robustes destinées à l'industrie. Le travail s'inscrit dans la lignée des efforts récents visant à doter les robots de modèles de récompense appris plutôt que conçus manuellement, un axe où les VLM généralistes servaient jusqu'ici de solution par défaut faute de mieux. Les auteurs annoncent la publication en accès libre du jeu de données, des modèles de récompense entraînés et d'une suite d'évaluation, avec pour objectif de faciliter l'intégration de DenseReward dans des boucles de contrôle prédictif par modèle (MPC) et de RL en aval, ouvrant la voie à des travaux communautaires sur la récompense dense sensible aux échecs.

RecherchePaper
1 source
JoyAI-RA 0.5 : passage à l'échelle de l'apprentissage de la manipulation robotique via un double alignement d'action
4arXiv cs.RO 

JoyAI-RA 0.5 : passage à l'échelle de l'apprentissage de la manipulation robotique via un double alignement d'action

JoyAI-RA 0.5 est un framework généraliste de type VLWA (Vision-Language-World-Action) pour l'apprentissage de la manipulation robotique, présenté dans un preprint arXiv (2608.05674). Le problème de départ : les données robotiques réelles sont rares, donc les politiques généralistes doivent apprendre à partir de sources hétérogènes, vidéo égocentrique humaine, simulation, robots réels, dont l'embodiment et le type de supervision diffèrent, avec des labels d'action souvent manquants ou incompatibles entre eux. Mélanger naïvement ces sources provoque un transfert négatif plutôt qu'un partage de connaissances utile. JoyAI-RA propose un « alignement d'action double » : un alignement implicite infère des actions latentes à partir des transitions visuelles, ce qui permet aux données sans label d'action (humaines, simulées, robotiques) d'entraîner un modèle du monde conditionné par ces actions latentes ; un alignement explicite ancre les trajectoires humaines et robotiques fiables dans un espace d'action physique commun, via une représentation canonique et des actions d'effecteur relatives au cadre caméra. Une phase de renforcement en double boucle combine ensuite adaptation rapide à une tâche et amélioration de la politique de base. Sur le benchmark réel AgiBot, JoyAI-RA obtient de bons résultats aussi bien sur des tâches déjà vues que sur des variations inédites. Le résultat clé concerne le passage à l'échelle : le score de tâche s'améliore de façon constante à mesure que le volume de données de pretraining vidéo humaine augmente, sans signe de plateau même au plus grand volume testé. Pour l'industrie robotique, c'est un signal important : la vidéo humaine, abondante mais faiblement labellisée, ne serait plus un simple signal auxiliaire mais pourrait devenir un axe primaire pour faire monter en compétence les politiques de manipulation. Si ce résultat se confirme à plus grande échelle, il pourrait atténuer le goulot d'étranglement des données qui freine les politiques généralistes de type VLA, puisque collecter des démonstrations sur robot réel reste lent et coûteux alors que la vidéo humaine est quasi illimitée. Cela apporte aussi un élément de réponse au débat récurrent du secteur sur la possibilité de fusionner des données d'embodiments incompatibles sans dégrader la performance, un problème jusqu'ici traité comme une source de transfert négatif plutôt que d'opportunité. Ce travail s'inscrit dans la course aux politiques généralistes de manipulation (VLA) capables de transférer leurs compétences entre plateformes et sources de données, aux côtés d'efforts comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure). La validation s'appuie sur le benchmark AgiBot, lié à l'initiative chinoise du même nom dans l'humanoïde. L'abstract ne précise pas l'organisation exacte derrière JoyAI-RA ; il s'agit pour l'instant d'un résultat de recherche en preprint, non revu par les pairs, et non d'un produit commercialisé ou d'un déploiement en usine. À surveiller : la confirmation de cette tendance sur des volumes de vidéo humaine encore plus grands, et la généralisation de la méthode au-delà du benchmark AgiBot.

RechercheActu
1 source