Aller au contenu principal
RecherchearXiv cs.RO 

RLHND : des modèles fondation vidéo comme suiveurs de mains ancrés dans la physique pour l'apprentissage des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent RLHND, un modèle de suivi de la main (hand tracking) qui estime conjointement la pose de la main et des informations tactiles réalistes à partir de vidéos égocentriques monoculaires, c'est-à-dire filmées du point de vue de l'opérateur avec une seule caméra. Le système réutilise le backbone de diffusion vidéo pré-entraîné Cosmos 3 comme extracteur de caractéristiques déterministe au niveau du clip, grâce à un conditionnement par « latent propre » (clean-latent conditioning). Pour la pose, il prédit des angles articulaires anatomiquement plausibles et accepte en option un paramètre de forme, ce qui maintient une morphologie de main cohérente dans une même vidéo, voire entre plusieurs vidéos du même acteur. Pour le tactile, un flux « expert » distinct, entraîné pendant que le flux de pose est gelé, prédit les contacts et les forces denses sur la surface de la main. Une propagation de caractéristiques fondée sur le LBS (linear blend skinning) permet d'extraire des attributs par sommet sans attention coûteuse sur chacun d'eux. Les auteurs revendiquent l'état de l'art sur plusieurs benchmarks de pose, ainsi que sur l'estimation du contact et de la force, et fournissent des résultats de retargeting et des expériences sur robot réel. Le code doit être publié.

L'enjeu touche directement l'entraînement de politiques robotiques à partir de vidéos humaines, une approche qui se généralise. Le maillon faible y est la qualité des données : les trackers classiques régressent la pose à partir d'images recadrées, avec peu d'a priori sur la dynamique de la main et l'interaction avec les objets. Ils produisent des estimations imprécises et physiquement incohérentes, qui se propagent ensuite dans les actions retargetées vers une main robotique. Ajouter contact et force comble un manque majeur, car la manipulation fine dépend de ces signaux que la vidéo seule n'expose pas. Si les gains se confirment, des vidéos égocentriques ordinaires, bien moins coûteuses que la téléopération ou les gants instrumentés, deviendraient une source de supervision plus exploitable. Le travail suggère aussi que les modèles de fondation vidéo, souvent présentés comme des modèles du monde, peuvent servir de perception physiquement informée, au-delà de la génération. Quelques réserves : il s'agit d'une prépublication arXiv non évaluée par les pairs, les chiffres précis ne figurent pas dans le résumé, l'ampleur des essais robotiques n'est pas détaillée, et la vérité terrain de force reste difficile à obtenir hors laboratoire, ce qui pose la question de la généralisation.

Ce travail s'inscrit dans la montée des méthodes qui apprennent des mains humaines filmées pour alimenter des modèles vision-langage-action (VLA) et des mains dextres. Il prolonge la lignée des estimateurs de pose de main à partir d'images isolées, et reprend l'idée de détourner les modèles vidéo génératifs de la famille Cosmos, développée par NVIDIA, vers des tâches de perception. Les acteurs de la robotique humanoïde cherchent à passer à l'échelle leurs données de manipulation sans multiplier les opérateurs en téléopération, et un suivi de main fiable avec signaux tactiles répond à ce besoin. La suite dépendra de la publication du code annoncée sur la page du projet, de reproductions indépendantes et de démonstrations sur des tâches de manipulation plus longues et plus variées.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modèle d'action ancré : l'ancrage 3D comme fondation pour la robotique
1arXiv cs.RO 

Modèle d'action ancré : l'ancrage 3D comme fondation pour la robotique

Une équipe a publié le 22 septembre 2026 sur arXiv (2609.23863) les Grounded Action Models (GAM), une famille de modèles de fondation robotique ancrant explicitement en 3D la perception des objets à manipuler, là où les modèles vision-langage-action (VLA) et monde-action (WAM) actuels s'appuient sur le langage ou la génération vidéo sans lien direct avec la géométrie de la scène. GAM convertit des instructions en langage, points ou boîtes englobantes en une représentation centrée objet, dont la géométrie et l'historique d'état du robot sont fusionnés par un transformeur multi-flux pour prédire des séquences d'actions. Sur RoboTwin 2.0 (50 tâches), il atteint 55,3% de réussite contre 52,0% pour Spatial Forcing, et 47,6% sous randomisation de scène contre 30,4% pour Abot-M0. Sur LIBERO-PRO, il obtient 61% contre 53% pour π0.5 de Physical Intelligence. Sur un bras bimanuel YAM réel, il conserve 17 réussites sur 20 sous décalage visuel contre 4/20 pour π0.5, et couplé à un planificateur Molmo2 sur un bras Franka, il atteint 64,7% de complétion en distribution et 49,8% hors distribution sur des tâches longues. Ce travail cible un angle mort des VLA actuels, qui apprennent implicitement, à partir de démonstrations, quels objets compter et où ils se trouvent, sans contrainte géométrique explicite, ce qui les fragilise dès qu'un objet est déplacé ou que la scène change. En forçant cet ancrage 3D en amont de la politique d'action, GAM réduit l'écart entre démonstrations contrôlées et déploiement réel, un enjeu central pour les intégrateurs qui veulent sortir les bras manipulateurs des bancs de test. Sa capacité à servir de contrôleur bas niveau sous un planificateur haut niveau ouvre la voie à des tâches longues et dépendantes du contexte, un registre encore peu couvert aujourd'hui. GAM s'inscrit dans une lignée de travaux visant à corriger les VLA de type π0/π0.5 de Physical Intelligence, critiqués pour leur apprentissage implicite de la géométrie de scène, et se positionne explicitement face à Spatial Forcing, Abot-M0 et π_0.5 comme lignes de base directes. Aucun acteur industriel, date de déploiement commercial ni partenaire français ou européen n'est mentionné: il s'agit d'une publication arXiv non encore revue par les pairs, testée en simulation et sur deux plateformes robotiques de laboratoire. Les suites logiques, non détaillées dans le résumé, seraient l'extension à d'autres plateformes matérielles et une validation indépendante des chiffres avancés.

RecherchePaper
1 source
Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
2arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Revue complète des modèles du monde pour l'apprentissage robotique
3arXiv cs.RO 

Revue complète des modèles du monde pour l'apprentissage robotique

Un groupe de chercheurs a publié début mai 2026 une revue systématique sur les modèles de monde appliqués à l'apprentissage robotique (arXiv:2605.00080). Ces modèles sont des représentations prédictives qui modélisent l'évolution d'un environnement en réponse aux actions d'un agent. Utilisés dans six fonctions distinctes, policy learning, planification, simulation, évaluation, génération de données et entraînement à l'échelle fondation, ils sont devenus un composant central des architectures robotiques modernes. Le survey couvre les grandes familles d'architectures, leurs rôles fonctionnels et leurs applications dans l'embodied AI, en s'étendant à la navigation mobile et à la conduite autonome. Les auteurs inventorient également les benchmarks et protocoles d'évaluation disponibles dans le domaine, et maintiennent un dépôt GitHub mis à jour en continu pour intégrer les travaux émergents. L'intérêt de cette synthèse réside dans la fragmentation actuelle du domaine : les architectures de modèles de monde se développent en silos, reinforcement learning, génération vidéo, VLA (Vision-Language-Action models), avec peu de recoupement méthodologique. Le survey clarifie comment ces modèles s'articulent avec les politiques robotiques, comment ils servent de simulateurs appris pour le RL, et comment les modèles de monde vidéo ont évolué de la génération par imagination vers des formulations contrôlables à l'échelle fondation. Pour les équipes R&D et les intégrateurs industriels, cette cartographie facilite le choix architectural et réduit le risque de duplication des efforts. L'accélération récente du domaine est en partie portée par la montée en puissance des foundation models et de la génération vidéo large-scale depuis 2023. Les modèles de monde en robotique s'enracinent dans les travaux de Schmidhuber dans les années 1990 et ont connu un regain majeur avec DreamerV3 (Google DeepMind, 2023), UniSim, et les VLA récents intégrant une prédiction d'état futur comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les acteurs dominants restent américains et chinois, DeepMind, NVIDIA, Physical Intelligence, Figure AI, avec des contributions académiques majeures de Stanford, MIT et Berkeley. En Europe, les contributions restent moins visibles à l'échelle internationale, bien que des acteurs comme Pollen Robotics (France) et l'INRIA travaillent sur des approches connexes. Le principal défi identifié est de combler le sim-to-real gap via des modèles suffisamment fidèles pour substituer partiellement les environnements physiques dans la boucle d'entraînement.

UEPollen Robotics et l'INRIA sont mentionnés comme acteurs connexes mais restent en retrait international ; cette cartographie peut aider les équipes européennes à identifier les lacunes à combler face à la domination américaine et chinoise.

RecherchePaper
1 source
IronMan : apprentissage vidéo-action sous contrainte d'information pour la manipulation robotique
4arXiv cs.RO 

IronMan : apprentissage vidéo-action sous contrainte d'information pour la manipulation robotique

Des chercheurs publient sur arXiv (2610.07961) IronMan, un cadre d'apprentissage vidéo-action pour la manipulation robotique, dont le nom signifie Information-constRained videO-actioN learning for robot MANipulation. Il s'inscrit dans la famille des Video Action Models (VAM), qui associent la modélisation de la dynamique visuelle à la génération d'actions. IronMan s'appuie sur le principe du goulot d'information (information bottleneck). Un module sensible à la dynamique condense des caractéristiques vidéo bruitées et enchevêtrées, calculées à un seul pas de diffusion, en représentations compactes du monde. Ces représentations suppriment l'information visuelle non pertinente et conservent les indices de dynamique utiles à l'action. Les auteurs annoncent 99,0 % de réussite sur LIBERO et 79,4 % sur RoboTwin en configuration clean2clean, au-dessus de toutes les références évaluées. Hors distribution, sur LIBERO-Plus, le taux atteint 79,1 %, soit 10,4 points de pourcentage de plus que la meilleure référence. Des expériences en conditions réelles et une inférence présentée comme efficace complètent le tableau. Il s'agit d'un travail de recherche, sans produit ni déploiement industriel. L'enjeu tient à un point faible connu des VAM : une représentation vidéo n'est pas naturellement adaptée à la génération d'actions. Exposer la politique à trop de détails visuels (textures, arrière-plans, éclairage) dégrade sa généralisation. IronMan défend l'idée inverse de la tendance à enrichir toujours davantage les représentations : contraindre l'information serait plus rentable que l'étendre. Le résultat le plus parlant est la robustesse hors distribution. C'est là que se joue l'écart entre démonstration et réalité, car un robot en atelier rencontre des changements de scène, de caméra ou de luminosité que les benchmarks propres ne couvrent pas. Pour les intégrateurs, un tel levier pourrait réduire le coût de réadaptation d'une politique à chaque nouveau site. Deux réserves s'imposent. Un score de 99 % sur LIBERO indique surtout que ce benchmark est quasi saturé. Les 79,4 % sur RoboTwin laissent une marge d'échec importante. Les résultats en conditions réelles sont résumés sans détail dans le résumé de l'article (tâches, nombre d'essais, robots), ce qui limite leur portée. Ce travail prolonge deux courants. Les politiques vision-langage-action (VLA) de type Pi-0 ou GR00T reposent sur des modèles vision-langage pré-entraînés. Les modèles vidéo génératifs servent désormais de prior de dynamique pour l'action. Les premiers manquent de compréhension physique explicite. Les seconds, coûteux en calcul et sensibles aux détails superflus, se heurtent au problème que IronMan cherche à corriger. Le recours à des caractéristiques à un seul pas vise à préserver la vitesse d'inférence, critère décisif pour un contrôle en boucle fermée. La suite dépendra de la reproduction des résultats par d'autres équipes, de l'ouverture du code et des tests sur des plateformes variées, y compris dans des environnements industriels réels. Aucune échéance de déploiement n'est annoncée.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source