Aller au contenu principal
Apprendre la navigation sociale à partir de vidéos Internet dans l'espace d'états de la politique
RecherchearXiv cs.RO 

Apprendre la navigation sociale à partir de vidéos Internet dans l'espace d'états de la politique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans un preprint arXiv (v1), un pipeline qui transforme de simples vidéos monoculaires de personnes en train de marcher en environnements d'entraînement en boucle fermée pour la navigation sociale de robots. Le système ne reconstruit ni ne rend d'observations photoréalistes. Il représente la scène statique par une carte de traversabilité métrique, qui subit une transformation rigide lorsque le robot se déplace de façon contrefactuelle. Les trajectoires des piétons extraites de la vidéo sont rejouées telles quelles dans le temps. La dynamique directe est donc définie dans l'espace d'état de la politique elle-même. La politique entraînée atteint 81,2 % de réussite sur le benchmark indépendant Arena, contre 75,0 % pour la meilleure base de comparaison, et réussit 19 essais réels sur 20 sans fine-tuning. Le résumé ne précise ni la plateforme robotique, ni les sites d'essai, ni le nombre de vidéos utilisées.

L'intérêt tient au coût des données. Entraîner une politique robuste de navigation sociale exige des simulateurs variés, avec des agencements de scènes, des terrains et des mouvements humains divers. Construire ces mondes et scripter le comportement des piétons reste long et cher. En s'appuyant sur des vidéos disponibles sur Internet, cette approche déplace le goulot d'étranglement de la modélisation manuelle vers la collecte de vidéos. Elle contourne aussi une partie du problème sim-to-real : comme la politique n'apprend pas sur des images synthétiques, l'écart visuel entre simulation et réel se réduit. L'hypothèse défendue est que la navigation locale dépend surtout de deux informations, la zone traversable et le mouvement des piétons proches. Le résultat de 19/20 la soutient, mais avec des réserves. Le gain de 6,2 points sur Arena est réel sans être spectaculaire. Vingt essais réels donnent un intervalle de confiance large. Le rejeu de trajectoires enregistrées suppose aussi que les piétons ne réagissent pas au robot, ce qui limite la fidélité des interactions.

Le travail s'inscrit dans une lignée de recherches sur la navigation sociale : simulateurs à foules scriptées, apprentissage par renforcement dans des scènes synthétiques, puis apprentissage à partir de vidéos humaines. Il rejoint la tendance plus large qui consiste à exploiter des données vidéo à grande échelle pour l'entraînement de politiques robotiques. Les prochaines étapes probables sont des tests sur plusieurs morphologies (quadrupèdes, humanoïdes), dans des foules plus denses et avec des piétons réactifs. La question de la transposition aux plateformes commerciales, notamment aux robots mobiles opérant dans des espaces partagés, restera ouverte tant que le code, les données et les conditions d'essai ne seront pas publiés et reproduits indépendamment.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

IntentNav : apprendre la navigation spatiale vers des objets à partir de démonstrations humaines
1arXiv cs.RO 

IntentNav : apprendre la navigation spatiale vers des objets à partir de démonstrations humaines

Une équipe de recherche anonyme a soumis le 9 juin 2026 un préprint arXiv (2606.08029) présentant IntentNav, un framework d'imitation spatiale et visuelle pour la navigation autonome par objets (ObjectNav). La tâche consiste à envoyer un robot chercher un objet non observé dans un environnement inconnu, sans carte préalable, en décidant en temps réel où explorer sous observabilité partielle. L'architecture repose sur deux briques complémentaires : une mémoire BEV (Bird's Eye View) qui encode les régions explorées, les frontières inexplorées et l'historique de trajectoire, et une mémoire visuelle égocentrique qui associe des indices sémantiques à chaque frontière candidate. Un modèle de langage et de vision (VLM) est entraîné sur des démonstrations humaines pour sélectionner la prochaine frontière à explorer, guidé par un "Frontier-based Human-Intent Labeling" qui inspecte en avant les trajectoires humaines pour identifier quelle frontière explique le mieux la direction de recherche du démonstrateur. Les auteurs annoncent des performances état de l'art sur les benchmarks MP3D, HM3D-v1 et HM3D-v2. Le point le plus saillant pour les intégrateurs est le transfert zéro-shot : la même politique VLM, sans fine-tuning supplémentaire, est transférée à trois morphologies distinctes, robot à roues, quadrupède et humanoïde. Cela suppose que l'interface candidate-level fonctionne comme une couche d'abstraction suffisamment générique pour s'affranchir des particularités cinématiques propres à chaque plateforme. Pour un COO industriel, cela ouvre la perspective d'un seul modèle de navigation entraîné sur des démonstrations humaines capable de piloter des flottes hétérogènes sans retraining par morphologie. Réserve importante : la démonstration sim-to-real reste confinée aux benchmarks de simulation Matterport3D et HM3D ; aucun résultat sur hardware physique réel n'est rapporté dans le préprint, ce qui laisse entier le gap entre benchmark et déploiement terrain. IntentNav s'inscrit dans un champ actif où des approches concurrentes comme SemExp (Chaplot et al., 2020), ZSON (Majumdar et al., 2022) ou les méthodes VLM zéro-shot telles qu'EmbodiedGPT et OpenFMNav se disputent la tête des benchmarks HM3D. La contribution distinctive est l'extraction d'intention de haut niveau à partir d'actions humaines de bas niveau via le labeling de frontières, une alternative à l'apprentissage par renforcement pur qui souffre de la rareté des récompenses dans les grands espaces d'exploration. La soumission étant anonyme, affiliations et financements ne sont pas divulgués ; une page projet est référencée sans contenu pleinement accessible à ce stade.

RechercheOpinion
1 source
WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action
2arXiv cs.RO 

WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action

Des chercheurs présentent WALA (arXiv:2607.11397), un framework qui apprend des actions latentes exécutables à partir de deux types de données distincts : des démonstrations robotiques annotées d'actions et de simples vidéos sans annotation d'action. Le problème visé est bien connu du secteur : les démonstrations robotiques étiquetées coûtent cher à collecter et passent mal à l'échelle, alors que les vidéos humaines et robotiques disponibles en masse restent inexploitables faute d'étiquettes d'action exécutables. WALA fonctionne en deux temps. D'abord, un pré-entraînement d'un modèle d'action latente sémantique-géométrique sur des vidéos, en modélisant l'évolution entre l'observation courante et des observations futures échantillonnées de façon éparse. Plutôt que de reconstruire les pixels bruts, le système prédit les deltas futurs dans l'espace de features DINOv3 et dans l'espace de profondeur dense, ce qui conserve la structure sémantique et géométrique utile à la tâche tout en réduisant la sensibilité aux détails d'apparence. Lors de l'entraînement de la politique, l'encodeur pré-entraîné fournit des cibles d'action latente stables, et le décodeur sert de modèle du monde latent entraînable, avec une supervision conjointe par prédiction d'action robotique, correspondance de cible d'action latente et prédiction de dynamique future. Résultat annoncé : un nouveau record sur RoboCasa avec 75,2% de taux de réussite moyen, ainsi que de bonnes performances sur RoboTwin et en manipulation réelle. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la promesse de découplage entre données d'entraînement et coût d'annotation. Si une politique VLA peut effectivement tirer une supervision de dynamique utile de vidéos non annotées, cela ouvre la voie à des jeux de données d'entraînement bien plus vastes sans multiplier les campagnes de téléopération robotique, un goulot d'étranglement connu pour tout intégrateur ou labo qui cherche à généraliser au-delà d'un jeu de tâches restreint. Cela dit, il s'agit d'un résultat de recherche publié sur arXiv, pas d'un produit déployé : les métriques de succès sur RoboCasa et RoboTwin sont des benchmarks de simulation ou semi-contrôlés, et la mention de "manipulation réelle" reste peu détaillée dans l'abstract, sans précision sur le nombre de tâches, le taux de réussite exact en conditions réelles ni le hardware utilisé. Le travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui cherchent à unifier perception, langage et contrôle moteur dans un même backbone, et dans la tendance plus large des "world models" latents pour la robotique, où l'usage de features pré-entraînées (ici DINOv3) remplace la reconstruction pixel pour la supervision. Aucun acteur français ou européen n'est mentionné dans cet abstract. Les suites logiques incluraient une publication complète avec code et poids, ainsi que des tests de généralisation croisée entre familles de robots, un point sur lequel l'abstract reste volontairement vague.

RechercheActu
1 source
UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines
3arXiv cs.RO 

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines

UniDex-ViTac, décrit dans un article arXiv de septembre 2026 (2609.16504), convertit des vidéos de démonstrations humaines en trajectoires robotiques simulées associées à des observations de contact au bout des doigts, via des spécialistes de renforcement résiduel qui adaptent, objet par objet, chaque interaction main-objet filmée à un bras-main robotique. À partir de 50 démonstrations humaines sur dix objets, les auteurs génèrent 10 000 trajectoires simulées pour entraîner une politique généraliste unique basée sur l'architecture Action Chunking with Transformers (ACT), combinant nuages de points, proprioception et quatre signaux de contact binaires par doigt, sans référence humaine ni pose d'objet connue au déploiement. En simulation, la version avec contact atteint 68,3% de réussite contre 55,5% pour une base vision seule ; sur robot réel, sans démonstration réelle ni réglage fin, elle réussit 73 essais sur 110 (66,4%) sur six objets vus et cinq inédits, contre 60 sur 110 (54,5%) pour la base de comparaison, un gain de 11,8 points. Le résultat vise un goulot d'étranglement connu de la manipulation dextre : le coût et la rareté des démonstrations robotiques réelles nécessaires à des politiques robustes. Qu'une politique entraînée uniquement en simulation, sans donnée robot réelle ni fine-tuning, réussisse plus de deux essais sur trois en conditions physiques alimente le débat sur la faisabilité du sim-to-real pour la manipulation fine avec retour tactile. L'ajout de simples signaux tactiles binaires, plutôt que des capteurs continus coûteux, améliore surtout la généralisation à des objets inédits, même si l'échantillon de 110 essais reste modeste pour en tirer des conclusions industrielles. Le travail s'inscrit dans une recherche plus large qui exploite les vidéos humaines non annotées pour contourner la téléopération, principal goulot d'étranglement de l'apprentissage par imitation en manipulation dextre. Sa contribution propre tient à la génération, par simulation physique, d'observations de contact absentes des vidéos humaines brutes, la comparaison avec une base vision seule isolant l'apport du signal tactile plutôt que celui de l'architecture ACT. L'article, accompagné d'une page projet (unidex-vitac.github.io), ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une preuve de faisabilité académique dont les suites attendues portent sur davantage d'objets, de tâches et une validation à plus grande échelle en conditions réelles.

RecherchePaper
1 source
BoxTwin : apprendre la dynamique d'objets articulés élastoplastiques à partir de vidéos
4arXiv cs.RO 

BoxTwin : apprendre la dynamique d'objets articulés élastoplastiques à partir de vidéos

BoxTwin est un framework de jumeau numérique interactif conçu pour apprendre, à partir de simples vidéos, la dynamique complète des objets articulés élastoplastiques (EAO) : des objets comme des boîtes en carton ou des structures pliables qui combinent élasticité non linéaire, déformation plastique irréversible et accumulation de dommages au fil des manipulations. Le pipeline reconstruit d'abord la scène filmée, puis identifie pour chaque objet un modèle constitutif informé par la physique, c'est-à-dire une représentation mathématique de son comportement mécanique réel plutôt qu'une approximation générique. Les auteurs ont testé leur méthode sur deux scénarios : le pliage manuel d'objets et leur manipulation par un bras robotique double (dual-arm). Résultat annoncé : le système suit précisément les trajectoires articulaires et reproduit le comportement plastique post-contact sur de longs horizons temporels, y compris après plusieurs cycles de déformation. Le travail est publié en préprint sur arXiv sous la référence 2607.17132v1. L'enjeu concret touche la logistique et la manipulation industrielle, deux domaines où le carton, les boîtes pliables et autres contenants déformables sont omniprésents mais mal pris en charge par les simulateurs actuels, la plupart supposant des objets rigides ou purement élastiques sans mémoire de déformation. Cette limite alimente l'écart classique entre simulation et réel (sim-to-real gap) : un robot entraîné sur un jumeau numérique qui ignore l'usure et le fluage plastique d'un carton risque d'échouer en conditions réelles après quelques manipulations répétées. En captant ce comportement directement depuis la vidéo plutôt que via un modelage manuel coûteux, BoxTwin ouvre une piste pour entraîner des politiques de manipulation plus robustes sur des entrepôts ou lignes d'emballage, notamment pour les systèmes de préparation de commandes ou de tri assistés par bras robotiques. Le sujet s'inscrit dans un champ de recherche encore restreint, à la croisée de la reconstruction 3D par vidéo, de la simulation physique différentiable et de la manipulation robotique de matériaux déformables (tissus, cartons, structures pliables), un terrain nettement moins mature que celui des jumeaux numériques pour robots rigides ou humanoïdes. S'agissant d'un préprint tout juste publié, aucun partenaire industriel, aucune intégration produit ni calendrier de déploiement n'est mentionné à ce stade : il s'agit d'une contribution académique, dont la suite logique serait une intégration dans des boucles de contrôle robotique pour une manipulation adaptative d'objets déformables en environnement non structuré, sans qu'un pilote concret soit annoncé pour l'instant.

RecherchePaper
1 source