Aller au contenu principal
RecherchearXiv cs.RO 

MotorMind : structurer des modèles vision-langage généralistes pour la manipulation robotique sans apprentissage préalable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent MotorMind, un « harness » de manipulation robotique (arXiv 2609.38078, première version) qui permet à un modèle vision-langage (VLM) généraliste de piloter directement un bras, sans entraînement spécifique à la tâche. Le système ne recourt ni à un expert d'actions appris, ni à un agent de codage, ni à un outil de grounding comme SAM3. Le VLM propose des actions de niveau intermédiaire, exécutées par un contrôle robotique déterministe qui renvoie un retour d'exécution. Un suivi asynchrone et des mises à jour de mémoire en arrière-plan complètent l'ensemble. Sur la suite LIBERO-PRO de base, MotorMind atteint 66,7 % de réussite, et 53,8 % sous perturbations. Les méthodes zéro-shot antérieures évaluées plafonnent à 13,3 % et 19,2 %. Sur un robot xArm6 réel, la même interface affiche 95 % de réussite moyenne, en manipulation directe comme en présence de perturbations humaines. Les auteurs n'indiquent ici ni le VLM utilisé, ni le nombre de tâches, ni le nombre d'essais réels. Il s'agit d'un résultat de laboratoire, sans déploiement industriel.

L'intérêt tient à la voie proposée. Les modèles VLA (vision-langage-action) généralisent encore mal, hors distribution, à de nouvelles tâches et de nouveaux environnements. Leur entraînement spécialisé les coupe aussi des progrès rapides des VLM généralistes. MotorMind suggère qu'une bonne représentation d'actions intermédiaires, associée à une exécution asynchrone, permet d'exploiter ces VLM tels quels, comme un téléopérateur humain qui regarde, agit et corrige. Les auteurs constatent que remplacer le VLM par un modèle plus puissant améliore les scores. Les échecs restants viennent surtout du grounding visuel, du raisonnement incarné et de la connaissance des actions, et ils diminuent avec la capacité du modèle. Pour les intégrateurs, cela laisse entrevoir des robots qui bénéficient mécaniquement des mises à jour des modèles de fondation, sans réentraînement. La prudence reste de mise : LIBERO-PRO est un benchmark en simulation, l'écart avec les baselines est calculé sur des méthodes zéro-shot choisies par les auteurs, et rien n'est dit sur le temps de cycle, la latence ni le coût d'inférence, décisifs en production.

Ce travail s'inscrit dans deux courants. Les VLA généralistes de type Pi-0 ou GR00T comptent sur de vastes données robotiques. Les systèmes « agentiques » utilisent des VLM pour le raisonnement de haut niveau, ou des agents de codage pour générer le contrôle, au prix d'une chaîne d'outils lourde et coûteuse. MotorMind cherche un compromis plus simple, avec un seul modèle. La suite dépendra de sa reproductibilité sur d'autres bras, de sa robustesse sur des tâches longues et de sa comparaison avec des VLA entraînés. Aucun pilote ni calendrier n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action
1arXiv cs.RO 

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action

Le laboratoire de recherche en robotique derrière l'étude "Foresight Residual RL" a publié le 24 juillet 2026 sur arXiv (2607.16506v1) une méthode visant à corriger un défaut connu des politiques Vision-Language-Action (VLA) sur les tâches d'assemblage complexes. Le problème identifié est concret : sur une tâche en trois phases (saisie, déplacement-insertion, rotation) simulant le serrage d'un écrou avec une clé dans l'environnement Isaac Gym, les méthodes classiques de reinforcement learning résiduel appliquées à une politique VLA gelée échouent à enchaîner les sous-tâches correctement, même quand chaque sous-tâche individuelle réussit. La solution proposée, baptisée Foresight Residual RL, entraîne un prédicteur visuel qui estime, à partir d'une image de l'état terminal d'une sous-tâche, la probabilité de succès des sous-tâches suivantes, et utilise cette estimation comme multiplicateur de récompense pour orienter l'apprentissage. Sur la tâche testée, la méthode atteint 85,6% de réussite sur l'ensemble de la séquence, contre 54,5% pour le RL résiduel standard et des résultats inférieurs pour les politiques VLA de base seules. Ce résultat pointe un angle mort largement sous-estimé dans le déploiement industriel des politiques génératives pour la manipulation robotique : optimiser chaque geste isolément ne garantit pas un enchaînement fiable des tâches. Pour les intégrateurs qui envisagent des lignes d'assemblage à tolérances serrées, contact-riche, type ligne électronique ou mécanique de précision, la démonstration confirme un écart persistant entre la performance en démonstration isolée et la performance en séquence réelle, un des points de vigilance recurrents pointés par les acteurs du secteur, sceptiques face aux vidéos promotionnelles de robots humanoïdes. Le fait que le succès par sous-tâche reste inchangé alors que le succès global bondit change la manière de penser l'entraînement : il ne s'agit plus seulement de maximiser un taux de réussite par étape, mais de façonner l'état terminal produit à chaque étape pour qu'il reste exploitable par l'étape suivante, une nuance directement pertinente pour les équipes qui construisent des pipelines d'apprentissage par renforcement sur des bases VLA préentraînées comme Pi-0 ou GR00T. Cette approche s'inscrit dans la lignée des travaux récents combinant politiques VLA préentraînées et affinage par RL résiduel, une stratégie de plus en plus utilisée pour adapter des modèles de manipulation généralistes à des tâches industrielles spécifiques sans réentraîner l'ensemble du modèle. La méthode a été validée uniquement en simulation, sur une tâche mécanique unique et relativement contrainte ; aucune date de transfert vers un robot physique ni de partenariat industriel n'est mentionnée dans l'article. Les auteurs positionnent leurs travaux comme une réponse méthodologique générale au problème d'attribution de crédit sur des horizons longs, un défi que partagent les principaux laboratoires travaillant sur les politiques génératives pour bras robotiques et humanoïdes, de Physical Intelligence à NVIDIA, sans qu'aucun acteur français ou européen ne soit cité dans cette publication.

RecherchePaper
1 source
STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action
2arXiv cs.RO 

STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action

Des chercheurs ont publié le 12 septembre 2026 sur arXiv (2609.12549) STAR, un système d'apprentissage pour modèles vision-tactile-langage-action destinés à la manipulation dextre bimanuelle. L'équipe a construit une plateforme robotique et un dispositif de téléopération pour collecter 200 heures de données, soit 10 576 trajectoires réparties sur 65 tâches, dont 69,5 % impliquent une manipulation multi-doigts fine, chaque séquence étant annotée simultanément en vision, tactile et langage. STAR combine trois mécanismes pour compenser la rareté spatiale, temporelle et informationnelle des signaux tactiles : un pré-entraînement conjoint visuel-tactile, une représentation par jetons tactiles globaux épars, et une prédiction tactile future éparse. Après entraînement sur ce corpus, puis un post-entraînement léger de seulement 100 trajectoires par tâche, le modèle atteint un taux de réussite moyen de 61 % sur quatre tâches réelles. Ce résultat s'attaque à un goulot d'étranglement connu des modèles vision-langage-action (VLA) : le signal tactile, clairsemé par nature, est souvent négligé au profit de la seule combinaison vision-langage, ce qui limite la finesse de manipulation. Démontrer qu'un post-entraînement de 100 démonstrations par tâche suffit à dépasser 60 % de réussite renforce l'idée qu'une intégration tactile native, plutôt qu'ajoutée après coup, améliore la généralisation des politiques robotiques. Pour les intégrateurs en robotique humanoïde et en préhension industrielle, cela ouvre une piste concrète pour réduire le coût de collecte de données réelles, souvent le vrai frein au passage du laboratoire au terrain. Le chiffre de 61 % reste toutefois à confirmer sur des objets et environnements non vus, les quatre tâches testées ayant été sélectionnées par les auteurs eux-mêmes. STAR s'inscrit dans une recherche croissante visant à doter les modèles VLA d'un véritable retour tactile, alors que des systèmes de référence du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, reposent surtout sur la coordination vision-langage sans exploiter systématiquement le toucher. La rareté des jeux de données vision-tactile-langage synchronisés à grande échelle explique en partie pourquoi peu d'acteurs disposent d'un corpus comparable aux 10 576 trajectoires réunies ici. Publié comme préprint sans affiliation industrielle revendiquée ni calendrier de déploiement, STAR reste à ce stade une contribution de recherche. La communauté attendra probablement la publication du code et du jeu de données, ainsi que des comparaisons directes avec d'autres architectures tactiles en cours de développement.

RechercheActu
1 source
Apprentissage de points latents structurels pour des représentations visuelles efficaces en manipulation robotique
3arXiv cs.RO 

Apprentissage de points latents structurels pour des représentations visuelles efficaces en manipulation robotique

Une équipe de recherche propose, dans un prépublication arXiv (identifiant 2605.21258, mai 2026), un nouveau cadre de pré-entraînement pour la perception 3D appliquée à la manipulation robotique. L'idée centrale est une représentation hybride baptisée "structural latent points" : les auteurs insèrent un variational autoencoder (VAE) point-à-point dans l'espace latent d'un autoencoder de nuages de points (point cloud), en régularisant simultanément les coordonnées et les features vers une distribution gaussienne. Le résultat est une représentation compacte qui capture des tendances structurelles globales, une forme approximative et une information sémantique, sans encoder une géométrie précise. Le pipeline de rendu repose sur la 3D Gaussian Splatting (3DGS), délibérément allégée pour laisser la capacité représentationnelle au module latent frontal. Les évaluations sont menées sur RLBench, ManiSkill2, et une plateforme robot réelle, avec des ablations confirmant la contribution de chaque composant. L'intérêt de cette approche tient à un problème connu des intégrateurs et des équipes de recherche en manipulation : les représentations implicites (champs neuronaux, NeRF) sont expressives mais manquent de repères structurels exploitables, tandis que les représentations explicites (primitives géométriques, meshes) préservent la géométrie au prix d'une résolution limitée et d'une faible généralisation hors distribution. L'architecture proposée tente de cumuler les avantages des deux familles. Les auteurs revendiquent des gains en taux de succès de tâche, en efficacité d'échantillonnage et en robustesse aux variations de point de vue, trois métriques directement pertinentes pour le déploiement industriel. Nuance à noter : l'abstract ne fournit aucun chiffre absolu, ce qui rend la comparaison indépendante impossible sans lire les tableaux complets du papier. Cette publication s'inscrit dans une vague dense de travaux sur le pré-entraînement 3D pour la manipulation incarnée, domaine en ébullition depuis l'émergence des VLA (Vision-Language-Action models) et des politiques diffusion comme pi0 ou ACT. Les benchmarks choisis, RLBench (simulation tabletop, DeepMind) et ManiSkill2 (simulation GPU-parallèle, UCSD), sont des standards de facto du domaine. L'absence de mention d'affiliation institutionnelle ou industrielle dans l'abstract empêche tout positionnement concurrentiel précis, mais la direction prise converge avec les efforts de groupes comme Physical Intelligence, Google DeepMind ou CMU sur la représentation perceptuelle robuste comme socle pour la généralisation des politiques de manipulation.

RecherchePaper
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
4arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source