Aller au contenu principal
IA incarnée : LIME apprend à percevoir les mouvements de caméra intentionnels à partir de vidéos égocentriques
RecherchearXiv cs.RO 

IA incarnée : LIME apprend à percevoir les mouvements de caméra intentionnels à partir de vidéos égocentriques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche publié sur arXiv (2607.02417) présente LIME, un système qui apprend à un robot autonome où déplacer sa caméra à partir de simples instructions en langage naturel. Le problème posé est précis : à partir d'une image RGB de la scène et d'une intention exprimée en texte libre ("regarde derrière la boîte", "inspecte l'objet"), le modèle doit prédire la pose cible relative de la caméra en SE(3) pour la prochaine observation. Les chercheurs ont construit leur jeu d'entraînement en minant des vidéos égocentriques humaines, associant intentions plausibles et descriptions du gain d'observation à des poses de caméra relatives. L'architecture combine deux briques : une sortie auto-régressive qui décrit ce que la prochaine vue doit révéler, et une tête de pose entraînée par flow-matching continu, capable de représenter plusieurs hypothèses de cible.

Ce travail s'attaque à un angle mort du secteur : la navigation vision-langage traduit des instructions en déplacements de base, et les politiques vision-langage-action (VLA) les traduisent en gestes de manipulation, mais le contrôle du regard lui-même, c'est-à-dire où pointer la caméra avant d'agir, reste peu formalisé comme action à part entière. Pour un intégrateur ou un roboticien, cela touche un besoin concret : un robot qui doit inspecter une pièce industrielle, vérifier une zone occluse, ou s'orienter selon une consigne orale a besoin d'une perception active pilotée par le langage, et non d'une caméra fixe ou d'un balayage aveugle. Si les résultats se confirment à plus grande échelle, cela ouvrirait une voie pour entraîner ce type de comportement sans capture de données robotiques coûteuse, en réutilisant de la vidéo humaine ordinaire.

Il s'agit à ce stade d'un article de recherche avec expériences et tâches robotiques en aval, pas d'un produit déployé ni d'un système embarqué chez un intégrateur. Le papier se positionne dans la lignée des travaux récents sur les politiques VLA à grande échelle (Pi-0, GR00T N2, Helix) mais en creusant une brique en amont, la perception active intentionnelle, plutôt que la génération d'actions de manipulation elle-même. Les auteurs annoncent des résultats sur des tâches robotiques en aval, mais sans préciser à ce stade de partenaire industriel ni de calendrier de transfert vers un système commercial.

À lire aussi

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
1arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
Révéler les cas limites de la navigation urbaine incarnée via un apprentissage évolutif à partir de vidéos réelles
2arXiv cs.RO 

Révéler les cas limites de la navigation urbaine incarnée via un apprentissage évolutif à partir de vidéos réelles

Un article de recherche publié sur arXiv (2608.16476v1) présente un framework destiné à entraîner des politiques de navigation urbaine "point-goal" (rejoindre un point cible donné) à partir de vidéos égocentriques web-scale non curées, c'est-à-dire des séquences filmées en conditions réelles et disponibles en grande quantité sur le web. Le système annote automatiquement ces vidéos avec des trajectoires métriques et une sémantique de navigation structurée, puis exploite ces annotations pour entraîner une politique vision-langage-action (VLA) capable de produire des plans de navigation interprétables plutôt que des sorties de type boîte noire. Les auteurs caractérisent ensuite la "long tail", c'est-à-dire la distribution des cas rares, en croisant la performance du modèle avec les patterns de perception-mouvement observés, et s'appuient sur une analyse par réflexion pour diagnostiquer les modes d'échec récurrents. Le dispositif est validé à la fois sur des données vidéo web et sur des tâches de navigation urbaine réelles. L'enjeu pour l'industrie de la robotique mobile tient à un frein bien identifié : la collecte de données spécifiques à la navigation coûte cher, et les scénarios rares mais critiques pour la sécurité, piétons imprévisibles, intersections complexes, obstacles inhabituels, restent sous-représentés dans les jeux de données robotiques classiques constitués par téléopération ou simulation. En montrant un transfert de connaissances efficace depuis des vidéos web non contraintes vers une politique de navigation opérationnelle, l'étude nourrit l'hypothèse selon laquelle les modèles VLA peuvent s'appuyer sur des sources massives et bon marché plutôt que sur des flottes dédiées à la collecte. Pour les intégrateurs d'AMR et les concepteurs de plateformes mobiles ou humanoïdes déployées en environnement urbain, la couverture des cas limites demeure le principal verrou avant une mise en production fiable, ce qui rend cette piste méthodologique directement pertinente. Ce travail s'inscrit dans la dynamique plus large des politiques VLA combinant perception visuelle, compréhension du langage et génération d'actions, déjà explorée pour la manipulation comme pour la navigation robotique. Il s'agit ici d'une contribution de recherche méthodologique et non d'une annonce produit : l'article, classé "new" sur arXiv, ne mentionne ni entreprise, ni partenaire industriel, ni calendrier de déploiement commercial. Sa valeur ajoutée revendiquée dépasse la performance agrégée classique en mettant en évidence une structure cohérente dans les échecs de type long tail, un axe d'évaluation encore peu formalisé dans la littérature sur la navigation incarnée. Les suites naturelles concerneraient l'extension du pipeline d'annotation à davantage de vidéos in-the-wild et une validation sur des flottes robotiques réelles, mais aucune date ni terrain de déploiement précis n'est fourni dans l'article.

RecherchePaper
1 source
VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets
3arXiv cs.RO 

VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets

VidAct est un framework « vidéo vers robot » décrit dans un préprint arXiv (2609.36870v1) qui apprend des politiques de manipulation à partir d'une seule vidéo monoculaire par tâche, puis les déploie sur un robot réel en zero-shot. Le système repose sur trois briques. La première reconstruit le maillage des objets et leur mouvement à partir de vidéos quelconques, puis exprime ce mouvement dans le repère statique de l'objet. Cela évite tout retargeting spécifique à l'embodiment (le passage d'une main humaine à une pince) et accepte des points de vue de caméra variés. La deuxième brique, un transfert de trajectoire résiduel, adapte le mouvement reconstruit à de nouvelles configurations d'objets en conservant la forme de la trajectoire. La troisième, au cœur de l'apprentissage, demande à la politique de prédire à chaque image le nuage de points complet de l'objet, fourni en privilège par la simulation, comme tâche auxiliaire. Le déploiement reste en RGB seul. Les expériences couvrent des vidéos humaines, robotiques, générées et issues d'internet. Le résumé ne donne aucun chiffre de taux de réussite, de nombre de tâches ni de plateforme robotique. Pour les intégrateurs et les équipes R&D, l'intérêt tient à la réduction du coût de la donnée. La téléopération reste l'étalon de la collecte de démonstrations, mais elle est chère et peu extensible. Apprendre à partir d'une vidéo par tâche, y compris générée, déplace le goulot d'étranglement de la collecte vers la reconstruction 3D. L'approche traite aussi deux limites connues des méthodes de reconstruction : la dépendance à des caméras contraintes et la déformation des trajectoires face à un nouvel agencement d'objets. La supervision par nuage de points complet par image suggère que la conscience de la géométrie 3D des objets, souvent absente des politiques RGB, améliore la généralisation et le transfert simulation-réel. Ces conclusions restent à confirmer : les auteurs affirment des gains, mais l'abstract ne les quantifie pas. Les résultats viennent de tâches de laboratoire, sans indication de robustesse en environnement industriel ni de comparaison publiée avec des VLA généralistes. Ce travail s'inscrit dans une lignée qui cherche à remplacer la démonstration robotique par de la vidéo, en concurrence avec la collecte téléopérée à grande échelle et les modèles fondation type VLA, qui misent sur le volume de données plutôt que sur la reconstruction explicite. Il s'agit d'un préprint en première version, sans code, produit ni déploiement annoncé à ce stade. Les prochaines étapes à surveiller sont la publication des taux de réussite détaillés, la diffusion du code et, surtout, une validation sur des tâches longues, contraintes ou déformables, où la reconstruction monoculaire est la plus fragile.

RecherchePaper
1 source
AtomEgo : intégration de la vision égocentrique dans le pré-entraînement des modèles fondation pour l'IA incarnée
4arXiv cs.RO 

AtomEgo : intégration de la vision égocentrique dans le pré-entraînement des modèles fondation pour l'IA incarnée

Une équipe de recherche présente AtomEgo, une étude systématique sur l'entraînement conjoint de modèles fondation robotiques à partir de vidéo égocentrique humaine et de démonstrations robotiques, déposée sur arXiv sous la référence 2609.21461. Le corpus assemblé représente environ 2 659 heures de vidéo égocentrique, traitées via un pipeline de données conçu pour passer à l'échelle. Les auteurs testent trois paradigmes sur des architectures vision-langage-action (VLA) et des modèles monde-action : co-entraînement conjoint avec des têtes d'action spécifiques par domaine, transfert progressif ego-vers-robot par alignement d'embodiment, et modélisation conjointe vidéo-action. Ces approches sont évaluées par des expériences multi-tâches sur robots réels et par une analyse de représentation cross-embodiment conditionnée par le langage. Le résultat central tient en une formule simple : le gain de capacité résulte de l'échelle des données multipliée par la qualité de leur alignement. Les données humaines égocentriques améliorent la généralisation des robots, mais seulement si leur intégration est alignée avec l'espace d'action robotique, pas par simple accumulation de volume. Ce constat tempère une hypothèse répandue dans le secteur, celle qui veut que les modèles VLA, à l'image de Pi-0, GR00T N2 ou Helix, comblent le manque de démonstrations robotiques réelles en aspirant des volumes massifs de vidéo humaine issue d'internet. Pour les intégrateurs et laboratoires qui bâtissent des pipelines de pretraining, le message est opérationnel : la méthode d'alignement compte davantage que le volume brut de vidéo, ce qui questionne le narratif du scaling pur comme solution suffisante au problème des données. Ce travail s'inscrit dans la course des laboratoires et industriels de la robotique humanoïde et manipulatrice à exploiter des sources de données alternatives face à la rareté des démonstrations robotiques réelles, coûteuses et lentes à collecter comparées aux corpus vidéo humains disponibles à grande échelle. AtomEgo reste à ce stade une publication de recherche non encore revue par les pairs, et non un produit ou pipeline commercial déployé, ce qui la distingue des annonces d'entreprises comme celles associées à Figure 03, Optimus ou aux modèles GR00T N2 de Nvidia. Les auteurs présentent leur pipeline et leurs trois paradigmes comme un cadre reproductible destiné à guider les prochains efforts de pretraining ego-robot à grande échelle, sans annoncer de calendrier de déploiement industriel ni de partenariat avec un fabricant de robots.

RecherchePaper
1 source