Aller au contenu principal
RecherchearXiv cs.RO 

Ancrer la généralisation robotique dans les données d'entraînement via des VLM à récupération augmentée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent RADAR, un framework qui compare directement les taches d'évaluation utilisées pour tester des politiques de manipulation robotique aux données d'entrainement de ces mêmes politiques, décrit dans un article arXiv (2603.11426, version 3, mise a jour d'une publication antérieure). Le système fonctionne en deux étapes : une phase de récupération (retrieval) s'appuie sur des embeddings de politiques généralistes pour identifier, parmi les données d'entrainement, les exemples les plus pertinents pour une tache d'évaluation donnée ; puis des modèles vision-langage (VLM) comparent cette tache aux exemples retrouves selon plusieurs axes, produisant une analyse interprétable et une classification du type de généralisation requis, de la simple variation proche de la distribution d'entrainement jusqu'au scenario réellement inédit. Des expériences contrôlées montrent que les VLM identifient correctement ce type de généralisation et que l'étape de récupération isole efficacement les exemples pertinents. Les auteurs appliquent ensuite RADAR a des jeux de données a grande échelle, ou les classifications produites concordent avec des catégories de benchmarks définies manuellement par des travaux antérieurs. Une démonstration est disponible sur radar-analysis.github.io.

L'enjeu dépasse la pure méthodologie de recherche. Dans un secteur domine par des annonces de "généralisation" autour de modèles vision-langage-action (VLA) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, il est aujourd'hui quasi impossible pour un intégrateur ou un décideur B2B de vérifier si une tache de démonstration constitue réellement un test hors distribution, ou si elle ressemble fortement a des exemples déjà vus a l'entrainement. RADAR propose un outil d'audit systématique de cet écart entre discours marketing et réalité technique, en remplaçant l'évaluation subjective par une comparaison quantifiable aux données réelles. Pour l'industrie, cela ouvre la voie a des benchmarks plus rigoureux, capables de distinguer une véritable avancée en généralisation d'un recyclage de scenarios familiers présentes comme des démonstrations impressionnantes.

Ce travail s'inscrit dans un mouvement plus large visant a mieux caractériser les limites réelles des politiques généralistes, alors que la course aux robots humanoïdes et aux modèles fondation pour la manipulation s'appuie largement sur des vidéos de démonstration difficiles a vérifier indépendamment. La troisième version de l'article, publiée comme mise a jour sur arXiv, suggère une itération après retours de la communauté scientifique. Aucun acteur français ou européen n'est mentionne dans cette publication, qui reste pour l'instant un outil de recherche académique plutôt qu'un produit commercial : la suite logique serait son adoption par des laboratoires tiers ou des organismes de benchmark pour auditer les claims de généralisation des grands modèles VLA du marche.

Impact France/UE

Aucun acteur francais ou europeen n'est mentionne, mais cet outil d'audit pourrait aider les integrateurs europeens a verifier les claims de generalisation avant d'adopter un modele VLA.

À lire aussi

Entraînement de robots par LLM : génération automatisée de données via l'augmentation de démonstrations
1arXiv cs.RO 

Entraînement de robots par LLM : génération automatisée de données via l'augmentation de démonstrations

Des chercheurs de Carnegie Mellon University ont publié LLM Trainer (arXiv:2509.20070v2), un pipeline entièrement automatisé capable de transformer une poignée de démonstrations humaines, aussi peu qu'une seule, en un large jeu de données pour l'apprentissage par imitation robotique. Le système décompose la génération de nouvelles démonstrations en deux étapes : une annotation hors-ligne qui extrait des keyframes, des objets saillants et des relations pose-objet à partir des trajectoires originales, puis un retargeting de keyposes en ligne qui adapte ces keyframes à un nouvel environnement à partir d'une simple observation initiale. Le pipeline déforme ensuite géométriquement la trajectoire originale pour en produire une nouvelle, l'exécute sur le robot, et ne conserve les données que si l'exécution est concluante. Pour optimiser la qualité des annotations, réutilisables d'une scène à l'autre, l'équipe intègre un mécanisme de Thompson sampling qui améliore significativement le taux de succès. Les validations ont été conduites sur un bras Franka Emika Panda. L'enjeu est structurant pour l'imitation learning en robotique industrielle : le goulot d'étranglement reste la collecte coûteuse de démonstrations humaines. LLM Trainer propose de contourner ce problème en mobilisant la connaissance du monde embarquée dans les LLMs pour générer des variantes de scènes plausibles sans intervention humaine supplémentaire. Les résultats montrent que la méthode d'annotation LLM surpasse systématiquement des baselines conçues par des experts humains. L'approche d'ensemble, combinant un plan feed-forward LLM optimisé et un contrôleur par imitation en feedback, ouvre une piste vers des politiques plus robustes à la variabilité des environnements réels, ce qui intéresse directement les intégrateurs confrontés à des lignes de production hétérogènes. Ce travail s'inscrit dans une tendance forte en manipulation robotique : réduire la dépendance aux données humaines via l'augmentation synthétique, après des approches comme RoboAgent, DemoAugment ou les pipelines sim-to-real de Google DeepMind. Carnegie Mellon reste un acteur central de cet espace, aux côtés de Stanford (Mobile ALOHA), Berkeley (RoboVerse) et du MIT. Pour l'heure, LLM Trainer est uniquement validé sur un seul modèle de bras dans des conditions de laboratoire, ce qui laisse ouverte la question du passage à l'échelle vers des robots humanoïdes ou des environnements moins structurés. La version v2 publiée sur arXiv suggère des révisions post-soumission, probablement en vue d'une conférence comme CoRL 2025 ou ICRA 2026.

RecherchePaper
1 source
Une théorie généralisée de la répartition de charge dans les systèmes robotiques à actionnement redondant
2arXiv cs.RO 

Une théorie généralisée de la répartition de charge dans les systèmes robotiques à actionnement redondant

Un article publié sur arXiv (référence 2603.11431v2, version corrigée d'une soumission antérieure) présente une théorie généralisée de la distribution des charges dans les corps rigides manipulés par des systèmes robotiques à actionnement redondant, composés de plusieurs chaînes cinématiques fermées indépendantes, comme une main multidoigts, des robots à pattes ou des bras coopérants tenant un même objet. Les auteurs caractérisent l'ensemble complet des distributions de torseurs (forces et moments) compatibles avec un torseur résultant donné appliqué au corps rigide, et dérivent des solutions explicites aux problèmes de synthèse et d'analyse de torseurs, calculables directement sans méthode numérique itérative ni inversion de grandes matrices, avec un coût de calcul croissant linéairement selon le nombre de torseurs appliqués. Ils relèvent aussi des lacunes dans les approches actuelles de l'état de l'art et proposent des corrections, appuyées par des exemples illustratifs et une simulation. Cette théorie concerne directement le contrôle de force des mains robotiques multidoigts, des robots à pattes, des robots coopérants manipulant une charge commune, et plus largement tout mécanisme surcontraint où le nombre de points de contact ou d'actionneurs dépasse ce qui est strictement nécessaire, rendant la répartition des efforts mathématiquement indéterminée sans hypothèses supplémentaires, un problème classique et non trivial en robotique. Une solution explicite et peu coûteuse en calcul ouvre la voie à un contrôle en temps réel plus robuste pour la préhension complexe, la locomotion des robots à pattes et la manipulation coopérative entre bras, des briques utiles pour les intégrateurs déployant des systèmes de préhension ou des flottes collaboratives. Le constat des auteurs, selon lequel des méthodes de référence actuelles comportent des erreurs, suggère que certaines stratégies de contrôle de force déjà en usage dans l'industrie reposent sur des hypothèses de répartition de charge incorrectes. Il s'agit d'une publication académique sur arXiv, sans entreprise, produit ni déploiement associé, ce qui la distingue nettement des annonces commerciales du secteur robotique. La répartition des efforts dans les systèmes surcontraints est étudiée depuis des décennies en robotique, notamment pour la préhension multidoigt et les robots parallèles, mais généralement traitée au cas par cas selon le type de mécanisme. Les auteurs positionnent leur travail comme une généralisation unifiée couvrant à la fois les mains robotiques, les robots à pattes et les systèmes multi-robots coopérants, plutôt qu'une solution propre à une seule catégorie. Cette version 2 de l'article suggère une itération après retours de la communauté scientifique, mais aucune validation expérimentale sur robot physique au-delà de la simulation n'est mentionnée à ce stade.

RecherchePaper
1 source
UniDomain : préentraînement d'un domaine PDDL unifié à partir de démonstrations réelles pour la planification robotique généralisable
3arXiv cs.RO 

UniDomain : préentraînement d'un domaine PDDL unifié à partir de démonstrations réelles pour la planification robotique généralisable

Une équipe de chercheurs a publié UniDomain, un cadre de pré-entraînement qui construit automatiquement un domaine PDDL (Planning Domain Definition Language) unifié à partir de démonstrations robotiques réelles, pour être ensuite appliqué à la planification de tâches en ligne. Le système ingère 12 393 vidéos de manipulation robotique, en extrait des domaines atomiques, et les fusionne en un domaine unifié comprenant 3 137 opérateurs, 2 875 prédicats et 16 481 arêtes causales. Face à une nouvelle classe de tâches, UniDomain récupère les atomes pertinents et les assemble dynamiquement en méta-domaines adaptés. Les expériences sur des tâches réelles inédites montrent des gains allant jusqu'à 58 % sur le taux de succès et 160 % sur l'optimalité des plans, comparé aux meilleures bases LLM seuls et LLM couplés à PDDL manuel, le tout en mode zéro-shot. Ce résultat s'attaque à l'un des verrous centraux de la robotique manipulatrice : la capacité à raisonner sur des séquences longues d'actions avec des contraintes implicites issues du langage et de la vision. Les LLM et VLM actuels fournissent de bons priors sémantiques, mais peinent à maintenir une cohérence causale sur des horizons temporels étendus et à ancrer les symboles dans le réel. UniDomain propose une voie médiane : extraire la structure symbolique directement depuis des démonstrations, évitant ainsi la fragilité des domaines PDDL codés à la main, souvent trop étroits pour généraliser. La généralisation compositionnelle zéro-shot, validée sur des tâches jamais vues, est ici une affirmation forte, bien que la sélection des vidéos sources et des scénarios de test mériterait une vérification indépendante pour écarter un biais de distribution. La planification symbolique robotique via PDDL est un paradigme ancien, remontant aux travaux STRIPS des années 1970, mais qui a souffert du coût élevé de l'ingénierie des domaines. Des approches récentes comme SayCan (Google), Code-as-Policies (Google Brain) ou les travaux de planification LLM de MetaAI ont tenté de contourner ce problème par la génération de code ou de plans en langage naturel, avec des résultats limités en environnements ouverts. UniDomain repositionne PDDL non plus comme une contrainte d'ingénierie mais comme un artefact appris, ce qui le rapproche conceptuellement des travaux sur l'apprentissage de modèles du monde. Les prochaines étapes naturelles incluent l'extension à la manipulation déformable, l'intégration avec des architectures VLA comme pi-0 ou GR00T N2, et une validation en environnement industriel réel, aujourd'hui absente de l'article.

RecherchePaper
1 source
APT : le pré-entraînement par expertise d'action améliore la généralisation des politiques VLA aux nouvelles instructions
4arXiv cs.RO 

APT : le pré-entraînement par expertise d'action améliore la généralisation des politiques VLA aux nouvelles instructions

Une équipe de chercheurs a publié le 11 juin 2026 sur arXiv (identifiant 2606.12366) APT (Action expert PreTraining), une méthode d'entraînement en deux étapes conçue pour améliorer la généralisation des politiques robotiques Vision-Langage-Action (VLA) face à des instructions en langage naturel hors distribution. Le problème ciblé : les modèles VLA actuels, qui couplent un grand modèle de vision-langage (VLM) préentraîné à un expert d'action continu, peinent à exécuter des consignes qu'ils n'ont pas vues pendant l'entraînement. La méthode s'applique aux architectures mainstream du domaine, notamment les architectures de style pi (Physical Intelligence) et GR00T (NVIDIA), et démontre des gains cohérents sur des instructions inédites et des tâches compositionnelles selon les expériences rapportées dans l'article. Le problème fondamental identifié par les auteurs est un déséquilibre structurel dans les données VLA : la diversité linguistique y est bien plus faible que la diversité visuelle ou motrice, ce qui pousse les politiques à s'appuyer sur des raccourcis visuels plutôt que sur les instructions textuelles. Les méthodes à actions discrètes, comme OpenVLA, atténuent ce biais via un co-entraînement vision-langage, mais les experts d'action continus, initialisés aléatoirement, génèrent des gradients bruités qui corrompent le VLM et n'exploitent pas sa capacité de compréhension linguistique. APT résout cela par une factorisation bayésienne : l'expert d'action est d'abord préentraîné comme un prior vision-action sans supervision linguistique, sur un VLM gelé (étape 1), puis les tokens de langage sont injectés via un mécanisme de fusion à porte (gated fusion) qui intègre les représentations du VLM tout en préservant le prior visuomoteur appris (étape 2). Cette séparation empêche l'imbalance linguistique de polluer l'apprentissage moteur initial. Le domaine des VLA robotiques connaît depuis 2024 une accélération notable avec pi0 de Physical Intelligence, GR00T N2 de NVIDIA, et Helix de Figure AI, tous construits autour du paradigme VLM couplé à un expert d'action continu. La généralisation aux instructions non vues reste l'un des défis non résolus du secteur : les démos en laboratoire reposent souvent sur des jeux de consignes étroits, loin de la variabilité d'un déploiement industriel réel, ce qui constitue un frein concret à la commercialisation. APT propose une réponse méthodologique à ce gap sans modifier les architectures cibles, en réordonnant uniquement leur processus d'entraînement. Les prochaines étapes naturelles incluront des validations indépendantes sur des benchmarks standardisés comme LIBERO ou RoboSuite, ainsi que des tests à l'échelle sur robots physiques en environnement non structuré.

RechercheActu
1 source