
EgoLAP : apprendre à partir de données humaines égocentriques grâce au raisonnement langage-action
EgoLAP, un cadre de pré-entraînement pour modèles VLA (vision-langage-action) décrit dans une prépublication arXiv (2610.08726), vise à exploiter des données égocentriques humaines, c'est-à-dire filmées du point de vue d'une personne qui accomplit une tâche, pour entraîner des robots. Le système apprend conjointement à partir de trajectoires humaines et robotiques via une chaîne de raisonnement par le langage partagée. L'intention de mouvement y est exprimée sous forme d'« actions langagières » structurées et abstraites dans le temps. Chacune est associée à un raisonnement au niveau du mouvement, fondé sur la géométrie de la scène, la physique et les affordances des objets. Les auteurs annoncent 80,1 % de progression moyenne des tâches en conditions réelles, soit un gain de 2,3 fois par rapport aux autres représentations d'action testées. Les expériences couvrent des tâches réelles et simulées. Le résumé ne précise ni la plateforme robotique, ni le nombre de tâches, ni le volume de données humaines utilisé.
L'enjeu est celui du coût des démonstrations robotiques. La téléopération reste lente, chère et difficile à passer à l'échelle, alors que les vidéos égocentriques humaines peuvent être collectées en grande quantité. Le verrou est l'écart d'embodiment : les actions bas niveau d'un humain (articulations d'une main, trajectoires du poignet) ne se transposent pas telles quelles à un bras ou une pince. L'idée centrale est de n'utiliser comme cible de supervision que l'intention de mouvement, jugée transférable entre humains et robots. Si ce résultat se confirme, il renforcerait la thèse d'un passage à l'échelle des VLA par les données humaines plutôt que par les seules démonstrations robot. Les auteurs affirment aussi que le raisonnement au niveau du mouvement fait mieux qu'un format composite combinant sous-tâches, boîtes d'objets et traces visuelles, ce qui interroge les choix de raisonnement intermédiaire adoptés par plusieurs modèles actuels.
Il faut toutefois rester prudent. Le chiffre de 80,1 % mesure une progression de tâche, pas un taux de réussite complet. Le gain de 2,3 fois dépend du choix des représentations comparées, et ces résultats n'ont pas encore été relus par des pairs. L'approche s'inscrit dans un courant plus large : des modèles comme Pi-0, GR00T ou Helix cherchent aussi à combiner vidéo humaine, simulation et données robot, et plusieurs équipes explorent les représentations d'action partagées entre morphologies. EgoLAP se distingue en choisissant le langage comme pivot. Reste à voir si le code, les poids et les jeux de données seront publiés, et si la méthode tient sur des tâches de longue durée, des mains dextres ou des environnements industriels, seuls cas qui intéresseraient vraiment les intégrateurs.
Dans nos dossiers




