Aller au contenu principal
I-Perceive : un modèle fondation pour la perception active guidée par instructions en langage naturel
RecherchearXiv cs.RO 

I-Perceive : un modèle fondation pour la perception active guidée par instructions en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente I-Perceive, un modèle de fondation pour la perception active conditionnée par le langage, dans une version révisée (v2) d'un article déposé sur arXiv sous la référence 2603.00600. À partir d'une image requête, d'images de contexte et d'une instruction en langage naturel, le système prédit une pose de caméra à 6 degrés de liberté satisfaisant l'intention de perception exprimée, dans de grands environnements intérieurs. L'architecture associe une voie vision-langage pour l'ancrage sémantique des instructions et une voie de raisonnement géométrique pour la compréhension 3D multi-vues, reliées par une fusion sémantique multi-couches. L'entraînement s'appuie sur un jeu de données de paires langage-point de vue à grande échelle, construit via un pipeline automatisé combinant scans de scènes réelles et environnements simulés.

Les systèmes de perception active existants restent généralement limités à des objectifs fixes ou à des contextes restreints ; I-Perceive vise au contraire une généralisation à des intentions ouvertes, formulées librement en langage naturel, un point faible connu de la robotique mobile actuelle. Pour les intégrateurs travaillant sur des AMR, des bras manipulateurs ou des plateformes humanoïdes, l'enjeu est concret : la plupart des modèles vision-langage-action (VLA) décident quoi faire à partir d'un flux caméra fixe, sans jamais décider où regarder. Les auteurs revendiquent une généralisation zéro-shot à des scènes et instructions inédites, ainsi qu'un mode boucle fermée affinant le point de vue au fil d'interactions successives, ce qui, si cela se confirme hors du cadre des auteurs, rapprocherait les robots d'une exploration active plutôt que d'une perception passive.

Ce travail s'inscrit dans la vague des modèles de fondation pour la robotique, aux côtés d'architectures vision-langage-action comme Pi-0, GR00T N2 ou Helix, centrées sur la génération d'actions à partir d'une perception supposée acquise ; I-Perceive se place en amont, sur la question négligée de savoir où regarder pour obtenir l'information utile à la tâche. Il se distingue aussi des approches classiques de perception active de type next-best-view, limitées à des objectifs géométriques sans compréhension du langage. Publié comme remplacement d'une soumission arXiv antérieure, l'article reste une contribution évaluée sur des données et environnements construits par les auteurs, sans code ouvert ni déploiement sur robot physique mentionné ; l'intégration sur des plateformes commerciales demeure une suite logique mais non confirmée.

À lire aussi

Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action
1arXiv cs.RO 

Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action

Publiée le 4 août 2026 sur arXiv (2608.04633), une méthode baptisée Mind-VLA corrige un défaut des modèles vision-langage-action (VLA) en robotique: les approches existantes alignent leur représentation avec la géométrie 3D de toute la scène de façon uniforme, sans isoler l'objet désigné par l'instruction, d'où des échecs en manipulation fine ou en cas d'occlusion. Mind-VLA identifie d'abord cet objet cible, en génère une vue à trois angles, en extrait des caractéristiques VAE et VGGT, puis aligne la représentation latente du modèle dessus. Avec un backbone compact de 345 millions de paramètres, le système atteint 93,9% de réussite sur LIBERO, 4,47 sur CALVIN, et 54% de succès moyen sur robot réel en situation d'occlusion, soit 32 points de plus que la meilleure méthode instruction-agnostique comparée. Le code sera publié en open source. Le résultat vise un problème concret pour les intégrateurs déployant bras manipulateurs ou humanoïdes: les démonstrations de laboratoire s'effondrent souvent dès que l'objet à saisir est partiellement caché par un carton, une pièce voisine ou l'angle de la caméra. En conditionnant la représentation 3D sur l'objet réellement visé plutôt que sur la scène entière, Mind-VLA cible directement l'écart entre démo et réalité industrielle. Le gain de 32 points obtenu sur robot réel, pas seulement en simulation, compte dans un domaine où les progrès annoncés reposent souvent sur des vidéos sélectionnées ou des métriques peu transposables. Mind-VLA s'inscrit dans la lignée des travaux sur l'alignement géométrique des VLA, qui injectent une compréhension 3D explicite dans des modèles entraînés sur images et texte, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, sans qu'aucun ne cible spécifiquement l'objet d'intérêt. Le résumé ne nomme pas la méthode instruction-agnostique servant de référence, ce qui invite à la prudence tant que l'article complet et le code promis ne sont pas vérifiables. La piste, aligner la représentation sur l'objet désigné plutôt que sur toute la scène, devrait néanmoins intéresser d'autres laboratoires travaillant sur la manipulation fine.

RechercheOpinion
1 source
Modèle du monde ancré : planification latente guidée par des objectifs en langage naturel
2arXiv cs.RO 

Modèle du monde ancré : planification latente guidée par des objectifs en langage naturel

Des chercheurs proposent le Grounded World Model (GWM), un modèle du monde latent qui permet de planifier en zero-shot, dans le monde réel, à partir d'une simple instruction en langage naturel. Les modèles précédents, comme DINO-WM et LeWM, exigent une image du but, difficile à obtenir à l'avance pour une tâche inédite. GWM, lui, prédit l'avenir dans l'espace visuel d'un modèle d'embedding vidéo-langage pré-entraîné, à partir d'une séquence d'actions candidate et de l'observation courante. La lecture figée de cet embedding projette le futur imaginé et la description de la tâche dans le même espace, et l'opposé de leur similarité cosinus sert de coût de planification. L'entraînement n'utilise que des paires vidéo-action hors ligne, sans lien avec une tâche précise, et aucune annotation linguistique. Sur le benchmark simulé WISER, la planification avec GWM résout 87 % de 288 tâches aux instructions et signaux visuels inédits, contre 22 % en moyenne pour dix VLA affinés. Avec des données de robots réels, sous IsaacSim, GWM réussit les 70 essais répartis sur 14 tâches de désignation par expressions référentielles, comme un planificateur modulaire guidé par un VLM de pointe, alors que pi0.5 en réussit 37 sur 70. Sur un bras Franka réel, le système complète 55 sous-tâches de pick-and-place sur 60, contre 52 sur 60 pour le planificateur modulaire. Ces résultats déplacent le débat sur l'architecture des robots pilotés par le langage. Les VLA affinés dominent aujourd'hui les démonstrations, mais le contraste est net dès qu'on change les instructions ou les signaux visuels : 22 % contre 87 % suggère que la généralisation de ces politiques reste fragile hors distribution. À l'inverse, planifier en simulant des futurs et en les évaluant par similarité sémantique évite de réentraîner un modèle pour chaque tâche et ne demande aucune donnée annotée en langage, ce qui réduit un goulot d'étranglement de collecte. Pour un intégrateur, l'argument pratique est que l'ensemble tourne en local sur un seul GPU grand public, sans appel à un VLM propriétaire distant. Il faut toutefois rester prudent : les 60 essais réels portent sur des tâches de pick-and-place sur un seul type de bras, la différence avec le planificateur modulaire (55 contre 52) n'est pas significative statistiquement, et WISER est un benchmark conçu par les auteurs. Le temps de calcul par décision n'est pas détaillé dans le résumé. Ce travail prolonge la lignée des modèles du monde latents pour la manipulation, portée par DINO-WM puis LeWM, en levant la contrainte du but visuel. Il se positionne face aux VLA généralistes comme pi0.5, et face aux architectures modulaires où un VLM de pointe décompose la tâche et un module de bas niveau l'exécute. La version 2 de l'article sur arXiv (2604.11751) et un site de projet sont disponibles, mais aucun déploiement industriel ni calendrier de transfert n'est annoncé. Les prochaines étapes probables sont des tests sur des tâches plus longues, des manipulations plus dextres et d'autres plateformes que le Franka, avant de savoir si cette approche tient hors du laboratoire.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)

Des chercheurs proposent V-VLAPS (Value-Guided Vision-Language-Action Planning and Search), une méthode qui augmente les modèles VLA (Vision-Language-Action) d'un signal de valeur appris pour améliorer la planification en manipulation robotique. Les VLA encodent perception visuelle, langage et commande motrice pour générer des actions, mais leur comportement purement réactif se dégrade hors distribution d'entraînement ou sur des tâches à horizon long. V-VLAPS ajoute une tête de valeur légère (value head), entraînée sur des trajectoires hors-ligne (offline rollouts), qui prédit les retours Monte Carlo et guide un MCTS (Monte Carlo Tree Search) vers les branches de plus haute valeur. Sur les cinq suites du benchmark LIBERO, V-VLAPS égale la baseline sans valeur au budget de recherche standard ; avec un budget élargi, il la dépasse dans toutes les suites, avec +6 points de pourcentage sur LIBERO-Object et +4 points sur LIBERO-10. L'apport central est de démontrer que les représentations internes des VLA encodent non seulement des informations sur l'échec d'une trajectoire (déjà documenté dans la littérature), mais peuvent aussi estimer la valeur pendant la planification. Cela ouvre une voie pragmatique pour les intégrateurs : renforcer des politiques VLA existantes sans réentraînement complet, par simple ajout d'une tête de valeur et d'un budget de recherche accru. L'analyse révèle toutefois une limite claire : la majorité des échecs durs sont des timeouts au niveau racine, là où les valeurs prédites restent peu différenciées, ce qui plafonne le gain observé et indique que le signal de valeur est encore insuffisamment discriminant en début de trajectoire. Ce travail (préprint arXiv, janvier 2026) s'inscrit dans une série de méthodes cherchant à coupler la puissance générative des VLA modernes (RT-2, OpenVLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) avec des mécanismes de planification structurée, face aux approches concurrentes par world models et diffusion planifiante. Les résultats sont obtenus uniquement en simulation sur LIBERO et ne sont pas encore validés sur robot réel, limite classique de ce type de contribution arxiv. La prochaine étape naturelle est une évaluation sim-to-real pour vérifier si le signal de valeur appris se transfère hors simulation, notamment sur des tâches à contacts complexes ou en environnement non structuré.

RechercheOpinion
1 source
ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage
4arXiv cs.RO 

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage

Des chercheurs présentent ViTL (Vision-Language Temporal Logic), un système de navigation robotique capable d'exécuter des commandes en langage naturel impliquant plusieurs cibles et des contraintes temporelles, sans entraînement spécifique à l'environnement testé. Publié sur arXiv le 30 juin 2026, le framework s'attaque à un cas concret : une instruction comme "Nettoie la chaise ou le canapé, puis allume la télé" implique un ordre logique et un choix entre deux objets, ce qu'aucun système zero-shot existant ne gérait jusqu'ici. ViTL agit à deux niveaux. Au niveau tâche, un grand modèle de langage traduit la commande en formule de logique temporelle linéaire (LTL), convertie ensuite en automate fini déterministe (DFA) qui coordonne des cartes de valeur multi-canaux et déclenche une replanification dynamique dès qu'un nouvel objet pertinent est détecté. Au niveau navigation, les auteurs introduisent un "score directionnel" : plutôt qu'une valeur unique et indifférenciée sur tout le champ de vision, chaque direction de frontière est étiquetée sur l'image d'observation et notée séparément par le modèle vision-langage. Les tests ont été menés sur le simulateur Habitat-Matterport 3D (HM3D). L'enjeu dépasse la démonstration académique. Les méthodes actuelles de navigation zero-shot vers un objet, qui s'appuient sur des VLM pour guider une exploration par frontières dans un environnement inconnu, restent cantonnées à une seule cible à la fois. En prouvant qu'un pipeline LLM-vers-logique-vers-automate peut orchestrer plusieurs sous-tâches ordonnées sans réentraînement, ViTL déplace la limite de ce qu'un robot peut comprendre d'une instruction humaine complexe, un enjeu direct pour les intégrateurs qui déploient des robots domestiques ou logistiques devant suivre des consignes composites. Le score directionnel améliore aussi, selon les auteurs, la précision et l'efficacité sur les tâches à cible unique par rapport à leur référence de base, signe que le gain ne se limite pas aux scénarios multi-cibles. Ce travail s'inscrit dans la lignée des approches récentes combinant VLM et exploration frontalière pour la navigation sémantique zero-shot, une piste active depuis l'essor des modèles vision-langage capables de raisonner sur des scènes inconnues sans carte préexistante. La contribution spécifique de ViTL, la formalisation en logique temporelle plutôt qu'en heuristique ad hoc, ouvre la voie à des commandes encore plus complexes (conditions, boucles, contraintes de sécurité) dans de futurs travaux, même si le passage du simulateur HM3D à un robot réel reste l'étape non résolue par cette publication.

RecherchePaper
1 source