Aller au contenu principal
RecherchearXiv cs.RO 

VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

VidAct est un framework « vidéo vers robot » décrit dans un préprint arXiv (2609.36870v1) qui apprend des politiques de manipulation à partir d'une seule vidéo monoculaire par tâche, puis les déploie sur un robot réel en zero-shot. Le système repose sur trois briques. La première reconstruit le maillage des objets et leur mouvement à partir de vidéos quelconques, puis exprime ce mouvement dans le repère statique de l'objet. Cela évite tout retargeting spécifique à l'embodiment (le passage d'une main humaine à une pince) et accepte des points de vue de caméra variés. La deuxième brique, un transfert de trajectoire résiduel, adapte le mouvement reconstruit à de nouvelles configurations d'objets en conservant la forme de la trajectoire. La troisième, au cœur de l'apprentissage, demande à la politique de prédire à chaque image le nuage de points complet de l'objet, fourni en privilège par la simulation, comme tâche auxiliaire. Le déploiement reste en RGB seul. Les expériences couvrent des vidéos humaines, robotiques, générées et issues d'internet. Le résumé ne donne aucun chiffre de taux de réussite, de nombre de tâches ni de plateforme robotique.

Pour les intégrateurs et les équipes R&D, l'intérêt tient à la réduction du coût de la donnée. La téléopération reste l'étalon de la collecte de démonstrations, mais elle est chère et peu extensible. Apprendre à partir d'une vidéo par tâche, y compris générée, déplace le goulot d'étranglement de la collecte vers la reconstruction 3D. L'approche traite aussi deux limites connues des méthodes de reconstruction : la dépendance à des caméras contraintes et la déformation des trajectoires face à un nouvel agencement d'objets. La supervision par nuage de points complet par image suggère que la conscience de la géométrie 3D des objets, souvent absente des politiques RGB, améliore la généralisation et le transfert simulation-réel. Ces conclusions restent à confirmer : les auteurs affirment des gains, mais l'abstract ne les quantifie pas. Les résultats viennent de tâches de laboratoire, sans indication de robustesse en environnement industriel ni de comparaison publiée avec des VLA généralistes.

Ce travail s'inscrit dans une lignée qui cherche à remplacer la démonstration robotique par de la vidéo, en concurrence avec la collecte téléopérée à grande échelle et les modèles fondation type VLA, qui misent sur le volume de données plutôt que sur la reconstruction explicite. Il s'agit d'un préprint en première version, sans code, produit ni déploiement annoncé à ce stade. Les prochaines étapes à surveiller sont la publication des taux de réussite détaillés, la diffusion du code et, surtout, une validation sur des tâches longues, contraintes ou déformables, où la reconstruction monoculaire est la plus fragile.

Dans nos dossiers

À lire aussi

Apprendre la manipulation robotique à partir de vidéos humaines : un état de l'art sur l'apprentissage VLA à grande échelle avec données centrées sur l'humain
1arXiv cs.RO 

Apprendre la manipulation robotique à partir de vidéos humaines : un état de l'art sur l'apprentissage VLA à grande échelle avec données centrées sur l'humain

Une équipe de chercheurs a publié en juin 2026 sur arXiv (identifiant 2606.00054) un état de l'art sur l'utilisation de vidéos humaines pour entraîner des modèles Vision-Langage-Action (VLA) appliqués à la manipulation robotique. Le papier recense et structure les travaux existants en quatre familles d'approches selon le type d'information extraite : les représentations d'action latentes (encodage des changements entre frames successives), les modèles du monde prédictifs (prévision des frames futures), la supervision 2D explicite (extraction de cues dans le plan image) et la reconstruction 3D explicite (récupération de géométrie ou de mouvement). Les auteurs identifient en parallèle trois verrous ouverts : la structuration de vidéos non annotées en épisodes d'entraînement exploitables, l'ancrage des supervisions vidéo en actions exécutables malgré l'hétérogénéité des embodiments et des points de vue, et la conception de protocoles d'évaluation prédictifs des performances de déploiement réel. L'enjeu derrière cette consolidation est direct : collecter des démonstrations robotiques à grande échelle coûte cher, prend du temps et reste intimement lié à un hardware spécifique. Les vidéos humaines, elles, sont disponibles en quantité quasi illimitée sur internet et capturent une richesse d'interactions physiques et sémantiques inaccessible autrement. Si les méthodes recensées parviennent à combler l'écart d'embodiment, elles pourraient réduire drastiquement le coût de généralisation des VLA, aujourd'hui l'un des principaux freins à leur déploiement industriel. Ce survey arrive à un moment où le gap entre démo de laboratoire et transfert réel reste le problème n°1 du secteur : aucune approche n'y répond complètement, mais la taxonomie proposée clarifie où en est la recherche. Le contexte est celui d'une accélération des VLA generalistes depuis 2024, portée par des modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) ou Octo. Ces architectures ont montré une capacité de généralisation prometteuse mais toutes dépendent encore massivement de données de téléopération humaine, coûteuses à acquérir. Ce survey s'inscrit dans un effort collectif pour identifier des alternatives scalables, et les ressources compilées sont accessibles publiquement sur GitHub. Les prochaines étapes naturelles incluent des benchmarks standardisés croisant vidéos humaines et transfert zero-shot vers des robots industriels, un angle encore peu exploré par les acteurs européens comme Enchanted Tools ou Wandercraft, qui pourraient y trouver un levier de différenciation.

UELes acteurs français comme Enchanted Tools et Wandercraft pourraient exploiter la taxonomie proposée pour réduire leur coût d'acquisition de données VLA, mais aucun impact opérationnel direct n'est documenté à ce stade.

RechercheOpinion
1 source
EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet
2arXiv cs.RO 

EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet

Des chercheurs ont publié en juin 2026 sur arXiv un framework baptisé EgoAERO, capable d'apprendre la manipulation dextre à partir d'une unique démonstration vidéo RGB-D égocentrique humaine, sans recourir à aucun asset 3D de l'objet manipulé. Le pipeline enchaîne trois modules : un tracking et une reconstruction de l'objet sans asset préalable, une compensation du mouvement égocentrique de la caméra, et une optimisation adaptative des contacts main-objet. Les trajectoires cohérentes obtenues sont ensuite converties en politiques robotiques via un apprentissage résiduel en deux étapes. Les auteurs introduisent également un mécanisme d'évaluation de qualité en ligne et publient EgoDex-R, un dataset de 4,3 millions de frames RGB-D pour l'entraînement de politiques dextres. En simulation comme en conditions réelles, EgoAERO atteint des performances proches des reconstructions assistées par modèles CAD sur le benchmark HOI4D, référence standard pour l'interaction main-objet. Le verrou technique levé ici est structurant pour la robotique dextre : jusqu'ici, les méthodes d'imitation à partir de vidéo humaine exigeaient soit des scans 3D préalables des objets, soit plusieurs démonstrations, soit des marqueurs visuels. Or, scanner chaque objet d'un environnement industriel ou domestique est un frein majeur à la scalabilité des systèmes. EgoAERO suggère qu'une caméra RGB-D standard (de type Intel RealSense ou intégrée à des lunettes connectées) et une seule prise vidéo suffisent pour bootstrapper une politique robotique fonctionnelle. C'est un signal fort en faveur d'une démocratisation de la collecte de données dextres, potentiellement réalisable par des opérateurs non spécialisés plutôt que par des sessions de télé-opération coûteuses. Ce travail s'inscrit dans une vague de recherche visant à exploiter les corpus vidéo égocentrique à grande échelle (Ego4D, HOI4D, EPIC-Kitchens), jusqu'ici sous-utilisés pour le robot learning faute de géométrie objet exploitable. Les approches concurrentes en manipulation dextre reposent encore largement sur la télé-opération avec gants haptiques (Physical Intelligence avec pi0, Dexterous Manipulation Lab de CMU) ou sur des assets CAD (DITTO, DexMV). EgoAERO n'est à ce stade qu'un preprint, sans déploiement industriel annoncé ni validation sur une large variété d'objets du monde réel : les expériences rapportées restent sur des scènes contrôlées du benchmark HOI4D, et la robustesse à des objets déformables ou transparents reste à démontrer.

RecherchePaper
1 source
Les VLM décrivent mais ne mesurent pas : comprendre les scènes centrées sur les objets pour la manipulation robotique
3arXiv cs.RO 

Les VLM décrivent mais ne mesurent pas : comprendre les scènes centrées sur les objets pour la manipulation robotique

Une équipe de recherche publie un article arXiv (2609.28184v1) proposant un système de perception modulaire piloté par un modèle vision-langage (VLM) pour la manipulation robotique en environnement inconnu. Partant d'une seule observation RGB-D, le pipeline segmente la scène en régions au niveau objet, les fait annoter sémantiquement par un VLM, puis ancre ces annotations avec les données de profondeur pour construire une représentation centrée sur les objets, indépendante de la tâche à accomplir. Les auteurs ont testé leur approche sur 151 scènes de table (tabletop scènes) et montrent que cette décomposition conserve la qualité sémantique d'un VLM classique tout en améliorant nettement la localisation et l'estimation de profondeur par rapport à une inférence géométrique directe par le VLM seul. La représentation obtenue a ensuite été intégrée à un module de planification de tâches pour piloter l'exécution robotique, en s'appuyant sur des briques logicielles existantes plutôt que sur un modèle entraîné de bout en bout. Le constat de fond, résumé par le titre même de l'article, cible une faiblesse connue mais rarement quantifiée des VLM appliqués à la robotique: ils décrivent bien une scène mais mesurent mal les distances, positions et profondeurs nécessaires à une prise fiable. Pour les intégrateurs qui misent sur des architectures vision-langage-action pour de la manipulation générique, ce travail confirme qu'il est risqué de confier au VLM la géométrie brute et suggère plutôt une architecture hybride où le modèle gère la sémantique tandis que des capteurs et des méthodes de segmentation classiques gèrent la métrique. C'est un signal utile face à l'engouement actuel pour les modèles VLA supposés tout résoudre en bout en bout: la précision spatiale reste un maillon faible qui nécessite un ancrage explicite plutôt qu'une confiance aveugle dans les sorties du modèle. Cette publication s'inscrit dans le débat plus large sur l'écart entre les capacités sémantiques impressionnantes des VLM récents et leur fiabilité métrique, un sujet qui traverse actuellement la recherche en robotique de manipulation autant que le développement de robots humanoïdes généralistes. L'article ne présente ni produit commercial ni déploiement industriel: il s'agit d'une contribution méthodologique construite à partir d'approches existantes ("off-the-shelf"), dont la suite logique serait une validation au-delà des scènes de table, sur des environnements moins contraints et des tâches de manipulation plus complexes.

RecherchePaper
1 source
UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines
4arXiv cs.RO 

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines

UniDex-ViTac, décrit dans un article arXiv de septembre 2026 (2609.16504), convertit des vidéos de démonstrations humaines en trajectoires robotiques simulées associées à des observations de contact au bout des doigts, via des spécialistes de renforcement résiduel qui adaptent, objet par objet, chaque interaction main-objet filmée à un bras-main robotique. À partir de 50 démonstrations humaines sur dix objets, les auteurs génèrent 10 000 trajectoires simulées pour entraîner une politique généraliste unique basée sur l'architecture Action Chunking with Transformers (ACT), combinant nuages de points, proprioception et quatre signaux de contact binaires par doigt, sans référence humaine ni pose d'objet connue au déploiement. En simulation, la version avec contact atteint 68,3% de réussite contre 55,5% pour une base vision seule ; sur robot réel, sans démonstration réelle ni réglage fin, elle réussit 73 essais sur 110 (66,4%) sur six objets vus et cinq inédits, contre 60 sur 110 (54,5%) pour la base de comparaison, un gain de 11,8 points. Le résultat vise un goulot d'étranglement connu de la manipulation dextre : le coût et la rareté des démonstrations robotiques réelles nécessaires à des politiques robustes. Qu'une politique entraînée uniquement en simulation, sans donnée robot réelle ni fine-tuning, réussisse plus de deux essais sur trois en conditions physiques alimente le débat sur la faisabilité du sim-to-real pour la manipulation fine avec retour tactile. L'ajout de simples signaux tactiles binaires, plutôt que des capteurs continus coûteux, améliore surtout la généralisation à des objets inédits, même si l'échantillon de 110 essais reste modeste pour en tirer des conclusions industrielles. Le travail s'inscrit dans une recherche plus large qui exploite les vidéos humaines non annotées pour contourner la téléopération, principal goulot d'étranglement de l'apprentissage par imitation en manipulation dextre. Sa contribution propre tient à la génération, par simulation physique, d'observations de contact absentes des vidéos humaines brutes, la comparaison avec une base vision seule isolant l'apport du signal tactile plutôt que celui de l'architecture ACT. L'article, accompagné d'une page projet (unidex-vitac.github.io), ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une preuve de faisabilité académique dont les suites attendues portent sur davantage d'objets, de tâches et une validation à plus grande échelle en conditions réelles.

RecherchePaper
1 source