VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action
Une publication arXiv soumise en août 2026 présente VLAff, un modèle vision-langage-affordance conçu pour apprendre aux robots à manipuler des objets à partir de vidéos humaines filmées à la première personne. Le verrou visé est connu du secteur : la morphologie d'un bras robotique diffère de celle d'une main humaine, ce qui complique le transfert direct des gestes observés. Les auteurs contournent l'obstacle en extrayant des affordances centrées sur l'objet, indépendantes de la morphologie du robot, qui précisent où interagir, comment saisir et comment déplacer. La méthode combine reconstruction 3D par Structure-from-Motion et reconstruction de maillage de la main sur des vidéos égocentriques, appliquée à un nouveau jeu de données, EgoAffordance, comptant 204 000 épisodes, 5,6 millions d'affordances visuelles et 11,6 millions d'affordances de préhension et de trajectoire. Entraîné sur cette base, VLAff génère, à partir d'une observation et d'une instruction, des cartes de chaleur d'affordance, des poses de préhension et des trajectoires, converties en actions exécutables via les informations de scène 3D.
Ce travail s'inscrit dans une tendance de fond de la robotique manipulative : exploiter la masse de vidéos humaines disponibles en ligne pour pallier la rareté et le coût des données de téléopération robotique. Si l'état de l'art revendiqué en prédiction d'affordance visuelle se confirme au-delà des bancs d'essai internes des auteurs, la méthode ouvrirait une source de données bon marché pour les modèles vision-langage-action que développent des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure AI (Helix), tous engagés dans la course aux modèles fondation génériques pour la manipulation. Un bémol s'impose toutefois : les résultats sont pour l'instant mesurés en interne, sans comparaison indépendante publiée, et les démonstrations de manipulation zero-shot sur robot réel restent, d'après le résumé, cantonnées à des scénarios de laboratoire plutôt qu'à un déploiement industriel.
La recherche sur les affordances actionnables, où et comment interagir avec un objet, est un axe actif de la robotique et de la vision par ordinateur depuis plusieurs années, mais les travaux antérieurs se limitaient souvent à une seule modalité ou à des jeux de données restreints tournés en environnement contrôlé. L'apport revendiqué par VLAff est d'unifier trois modalités, visuelle, préhension et trajectoire, dans un seul modèle fondation entraîné sur des vidéos égocentriques du quotidien plutôt que sur des démonstrations robotiques dédiées et coûteuses. Le papier ne précise ni affiliation institutionnelle ni calendrier de publication du code ou du jeu de données : il s'agit à ce stade d'une contribution académique, non d'un produit ou d'un pilote industriel annoncé, dont la suite logique serait la publication du code pour permettre à la communauté de reproduire les résultats.
Dans nos dossiers




