Aller au contenu principal
RecherchearXiv cs.RO 

Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent les Large Reward Models (LRM), un cadre qui transforme des modèles vision-langage (VLM) de base en générateurs de récompense image par image, destinés à affiner des politiques de manipulation robotique. Le VLM de pointe retenu est spécialisé sur un jeu de données multi-sources : trajectoires de robots réels, interactions humain-objet et environnements de manipulation simulés. Contrairement aux approches qui évaluent les trajectoires a posteriori, les LRM exposent trois interfaces de récompense à partir des seules observations visuelles : estimation de progression, détection d'achèvement de la tâche et comparaison contrastive temporelle. Partant d'une politique apprise par imitation (IL), les auteurs utilisent ces signaux pour guider un affinage par PPO sur des tâches de manipulation à long horizon non vues pendant l'entraînement. La récompense de progression s'impose comme le meilleur signal en ligne sans information privilégiée : elle améliore la politique IL de référence et réduit l'écart avec les récompenses « privilégiées » issues de l'état interne de l'environnement. Côté matériel réel, elle sert à pondérer un clonage comportemental (behavioral cloning) selon la progression, sur quatre tâches de manipulation et deux plateformes robotiques, avec un gain sur le fine-tuning supervisé (SFT) classique dans les quatre cas. Le résumé ne donne ni modèle de VLM, ni taux de réussite chiffrés, ni noms de robots.

L'enjeu est celui d'un goulot d'étranglement bien connu : l'apprentissage par renforcement (RL) peut améliorer les politiques de manipulation, mais écrire une fonction de récompense à la fois sémantiquement pertinente et réutilisable d'une tâche à l'autre reste coûteux, et se fait aujourd'hui surtout à la main, tâche par tâche. Si ces résultats se confirment, un VLM spécialisé pourrait servir de récompense générique, ce qui réduirait l'ingénierie de récompense pour les intégrateurs et ouvrirait la voie à une auto-amélioration des robots en déploiement, sans instrumentation de la scène. Des réserves s'imposent : l'écart avec les récompenses privilégiées est réduit, pas comblé ; la validation réelle ne porte que sur quatre tâches, et sur du clonage comportemental pondéré plutôt que sur du RL en ligne sur robot physique. Le travail relève de la recherche (preprint arXiv, version 3), sans produit ni déploiement industriel.

Ces travaux s'inscrivent dans la montée des modèles de fondation pour la robotique, des VLA (vision-langage-action) comme Pi-0 ou GR00T aux VLM utilisés comme juges ou générateurs de récompense. Les approches précédentes de récompense par modèle de langage ou de vision restaient souvent limitées à une évaluation après coup, ce que les LRM cherchent à dépasser avec un signal exploitable en ligne. La suite logique serait de tester ces récompenses en RL directement sur robot réel, sur un plus grand nombre de tâches, et de mesurer leur robustesse face aux erreurs d'estimation de progression, qui peuvent être exploitées par la politique. Le résumé ne cite aucun acteur européen ni partenaire industriel.

À lire aussi

Insertion robotique généralisable grâce aux modèles du monde
1arXiv cs.RO 

Insertion robotique généralisable grâce aux modèles du monde

Une équipe de recherche décrit, dans un article publié sur arXiv en septembre 2026 sous le titre "Generalizable Robotic Insertion with World Models" (identifiant 2609.28258v1), un système d'insertion robotique généraliste construit autour d'un modèle du monde (world model) entraîné sur un seul réseau couvrant jusqu'à 90 tâches d'insertion différentes, portant sur des pièces aux géométries variées. Le modèle combine les données proprioceptives du bras robotique avec les images brutes issues d'une caméra montée sur le poignet. Sur des objets totalement inédits, dont la géométrie n'a jamais été vue pendant l'entraînement, le système atteint un taux de réussite de 56% en zero-shot, contre seulement 7% pour une base de référence model-free entraînée dans les mêmes conditions. Les chercheurs montrent aussi que la performance progresse à mesure que le nombre d'objets inclus dans le jeu d'entraînement augmente, signe d'une bonne scalabilité. Un fine-tuning du modèle généraliste sur des objets exclus de l'entraînement initial améliore par ailleurs nettement l'efficacité en données par rapport à un entraînement from scratch, et dépasse parfois ses performances asymptotiques. Ce résultat s'attaque à un goulot d'étranglement connu de l'assemblage robotique en forte mixité de références: les approches actuelles, même très performantes, reposent sur des politiques spécialisées entraînées pièce par pièce, ce qui rend le déploiement sur une nouvelle référence lent et coûteux en ingénierie. Un système capable de généraliser à des pièces jamais vues changerait potentiellement l'équation pour les intégrateurs et les lignes à forte variabilité, en réduisant le travail de reprogrammation à chaque changement de produit. Les auteurs présentent leur travail comme le premier système capable d'assembler des objets inédits de façon entièrement pilotée par les données, sans modélisation géométrique explicite préalable, ce qui alimente le débat sur la capacité réelle des architectures génériques à tenir la charge en manipulation fine, un terrain où l'écart entre démonstration et fiabilité industrielle reste habituellement large. Ce travail s'inscrit dans la tendance de fond de la robotique de manipulation, où la recherche cherche à remplacer les politiques spécialisées task-specific par des modèles généralistes transférables d'un objet ou d'une tâche à l'autre, dans la lignée des efforts en cours autour des architectures vision-langage-action. Il reste à ce stade un résultat de recherche publié en preprint, sans partenaire industriel cité, ni site de déploiement, ni calendrier de commercialisation: les auteurs parlent d'une étape significative vers des systèmes d'assemblage généralisables et scalables, formulation à lire comme un jalon scientifique plutôt qu'une annonce produit. Les suites attendues pour ce type d'approche sont l'extension à davantage de tâches et de géométries, ainsi qu'une validation en conditions de production réelles, où robustesse et temps de cycle devront être mesurés au-delà des benchmarks de laboratoire.

RecherchePaper
1 source
LLM-Flax : planification robotique généralisable par approches neuro-symboliques et grands modèles de langage
2arXiv cs.RO 

LLM-Flax : planification robotique généralisable par approches neuro-symboliques et grands modèles de langage

Des chercheurs ont publié LLM-Flax (arXiv 2604.26569v1), un framework en trois étapes conçu pour automatiser le déploiement de planificateurs de tâches neuro-symboliques sans expertise manuelle ni données d'entraînement. Le système prend en entrée uniquement un LLM hébergé localement et un fichier PDDL décrivant le domaine : l'étape 1 génère les règles de relaxation par prompting structuré avec auto-correction, l'étape 2 pilote la récupération sur échec via une politique de budget de latence, et l'étape 3 remplace entièrement le réseau GNN par un scoring d'objets zero-shot. Évalué sur le benchmark MazeNamo en grilles 10x10, 12x12 et 15x15 (8 benchmarks au total), LLM-Flax atteint un taux de succès moyen de 0,945 contre 0,828 pour la baseline manuelle, soit un gain de +0,117. Sur la configuration 12x12 Expert, où le planificateur manuel échoue complètement (SR 0,000), LLM-Flax atteint SR 0,733 ; sur 15x15 Hard, il obtient SR 1,000 contre 0,900 pour l'approche de référence. Le principal verrou adressé est le coût de transfert de domaine : adapter un planificateur symbolique à une nouvelle cellule robotique mobilise aujourd'hui des centaines de problèmes d'entraînement et l'intervention d'un expert métier, ce qui rend le déploiement à l'échelle industrielle prohibitif. La politique de budget de latence de l'étape 2, qui réserve explicitement une enveloppe d'appels LLM avant chaque séquence de récupération sur échec, adresse un problème pratique rarement traité dans la littérature : les boucles de fallback infinies qui paralysent les systèmes en production. L'étape 3 démontre la faisabilité du zero-shot avec SR 0,720 sur 12x12 Hard sans aucune donnée d'entraînement, mais bute sur la fenêtre de contexte à grande échelle, que les auteurs identifient eux-mêmes comme le principal défi ouvert. LLM-Flax s'inscrit dans la lignée des travaux combinant PDDL et LLMs pour la robotique, après SayCan (Google, 2022), Code as Policies (Google DeepMind) et ProgPrompt. Cette approche neuro-symbolique reste distinctement différente des architectures VLA end-to-end comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) : elle préserve un module de raisonnement explicite et auditable, ce qui peut constituer un avantage dans les environnements industriels certifiables. Le benchmark MazeNamo demeure un environnement de navigation 2D simplifié, éloigné des scénarios de manipulation réels ; aucun déploiement terrain n'est annoncé à ce stade, et les auteurs indiquent l'extension à des environnements multi-objets complexes comme prochaine étape.

RecherchePaper
1 source
VGGT-DP : contrôle robotique généralisable via des modèles de vision fondation
3arXiv cs.RO 

VGGT-DP : contrôle robotique généralisable via des modèles de vision fondation

Les chercheurs à l'origine de VGGT-DP ont publié une version révisée de leur article sur arXiv (arXiv:2509.18778v2) présentant un nouveau cadre d'apprentissage par imitation visuelle pour le contrôle de robots manipulateurs. Le système utilise comme encodeur visuel le Visual Geometry Grounded Transformer (VGGT), un modèle de perception 3D pré-entraîné, combiné à un retour proprioceptif pour aligner la perception visuelle avec l'état interne du robot. Pour limiter la latence d'inférence, les auteurs introduisent un mécanisme de réutilisation de jetons image par image (frame-wise token reuse, FTR), qui met en cache les jetons de l'agrégateur VGGT issus des images qui se chevauchent et ne recalcule les caractéristiques que pour la dernière image reçue. Un élagage aléatoire de jetons est aussi appliqué pour réduire le surapprentissage. Sur les tâches de manipulation du banc d'essai simulé MetaWorld, VGGT-DP dépasse les références Diffusion Policy (DP) et DP3, en particulier sur les scénarios exigeant de la précision et sur les tâches à long horizon temporel. L'apport principal tient au fait que la majorité des travaux en apprentissage par imitation se concentrent sur l'architecture de la politique de contrôle, souvent des modèles de diffusion, en négligeant la qualité de l'encodeur visuel et sa capacité de compréhension spatiale. En ancrant la perception dans des a priori géométriques 3D et en la couplant à la proprioception, VGGT-DP cherche à réduire l'écart entre ce que le robot perçoit et ce qu'il ressent physiquement, un facteur d'échec fréquent des politiques visuomotrices en boucle fermée. La réduction de la latence via la réutilisation de jetons est pertinente pour un déploiement temps réel sur du matériel embarqué à ressources de calcul limitées. Toutefois, les résultats reposent uniquement sur MetaWorld, un environnement simulé, sans validation sur robot réel ni chiffres de transfert sim-to-real. Ce travail s'inscrit dans la course plus large aux modèles fondation pour la robotique, aux côtés d'approches vision-langage-action comme Pi-0, GR00T N2 ou Helix, mais s'en distingue en misant sur la fusion vision 3D-proprioception plutôt que sur le conditionnement par le langage. Le statut "replace" sur arXiv indique une révision d'une soumission antérieure. Aucune information n'est donnée sur une publication du code, un partenaire industriel ou un déploiement sur robot physique: le travail reste à un stade académique, la prochaine étape logique étant une validation en conditions réelles et une éventuelle intégration avec des modèles VLA conditionnés par le langage.

RecherchePaper
1 source
Préhension vision-langage adaptative via des a priori de modèles fondation combinables et une synthèse de préhension généralisable
4arXiv cs.RO 

Préhension vision-langage adaptative via des a priori de modèles fondation combinables et une synthèse de préhension généralisable

Un article publié le 4 septembre 2026 sur arXiv (arXiv:2609.04096) présente AdaRoboVLG, un framework de préhension vision-langage (Vision-Language-Grasp, VLG) capable de généraliser la synthèse de prises entre différentes mains robotiques sans réentraînement. Contrairement aux méthodes VLG existantes, qui couplent étroitement modèles de fondation et politique de préhension entraînée de bout en bout, AdaRoboVLG sépare les deux couches : une politique de base génère et évalue des prises physiquement réalisables via mappage cinématique et estimation de stabilité par fermeture de force, tandis que des modules de fondation spécialisés injectent des a priori spatiaux, cognitifs et temporels selon la tâche. En simulation comme sur robot réel, les auteurs rapportent une généralisation efficace entre mains et une robustesse maintenue sur trois défis de préhension représentatifs en environnements encombrés et dynamiques, sans préciser de plateforme commerciale ni de chiffres de charge utile, de degrés de liberté (DOF) ou de temps de cycle. Des vidéos supplémentaires sont disponibles sur adarobovlg.github.io. L'intérêt pour les intégrateurs tient au découplage proposé : faire évoluer les modules de compréhension sémantique sans réentraîner toute la politique de préhension à chaque nouvelle tâche, la couche physique restant stable et déjà validée. C'est une réponse à deux limites récurrentes des approches Vision-Language-Action actuelles, le coût du réentraînement complet et l'écart persistant entre démonstrations simulées et robustesse en conditions réelles encombrées. Si ces résultats se confirment sur du matériel tiers, cette séparation entre raisonnement sémantique et physique de la préhension pourrait devenir une alternative aux modèles monolithiques entraînés de bout en bout. Ce travail s'inscrit dans la lignée des recherches VLG combinant perception, langage et contrôle moteur pour la préhension, un courant jugé par les auteurs trop dépendant de politiques entraînées de bout en bout et coûteuses à porter d'une main robotique à une autre. AdaRoboVLG se positionne explicitement contre cette tendance avec une architecture modulaire censée rester compatible avec les futures générations de modèles de fondation, sans redesign de la couche de préhension. Classé comme nouvelle soumission arXiv non encore évaluée par les pairs, l'article n'annonce ni partenariat industriel ni calendrier de déploiement, sa portée pratique restant à valider sur des plateformes commerciales.

RechercheActu
1 source