Aller au contenu principal
RecherchearXiv cs.RO 

SpatialHarness : échafaudage spatial au moment du test pour la manipulation robotique fine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent SpatialHarness, un cadre appliqué au moment du test qui améliore la manipulation fine d'un robot sans réentraîner la politique de contrôle et sans toucher aux caméras. Le travail, publié sur arXiv (2610.12457), part d'un constat : les modèles de fondation multimodaux de pointe, ici GPT-6 Astra, se montrent prometteurs pour piloter directement un robot mais restent limités dès que la tâche exige de la précision. SpatialHarness maintient une scène simulée en ligne, synchronisée avec l'exécution réelle. Il identifie les relations spatiales critiques pour la tâche, puis génère des vues virtuelles complémentaires qu'il présente à la politique, qui reste gelée. Un module de synchronisation sensible à l'interaction distingue trois modes (objet statique, objet tenu, transition) pour garder la simulation alignée. Quatre tâches réelles ont été testées : alignement géométrique précis, placement relatif à un objet et interaction avec un objet articulé. Avec la même politique GPT-6 Astra, le succès passe de 26,7 % à 66,7 % sur l'insertion de prise, et de 0 % à 100 % sur la Tour de Hanoï.

Ces résultats avancent une thèse précise : une partie de l'échec en manipulation fine vient d'un déficit d'observabilité spatiale plutôt que d'un manque de capacité de la politique. Si elle se confirme, l'effet sur les intégrateurs est concret. Au lieu de multiplier les caméras, de réentraîner un modèle ou de collecter des démonstrations, on pourrait compenser en logiciel les angles morts d'un poste existant, ce qui réduit le coût de mise en service. Le résultat contredit aussi l'idée qu'un VLA ou un modèle multimodal généraliste plafonne par manque de données de manipulation, et il suggère que les capacités latentes de ces modèles sont sous-exploitées. Il faut toutefois tempérer. L'étude ne porte que sur quatre tâches, avec peu d'essais apparemment, comme le suggèrent des taux de 26,7 % et 66,7 %. Le passage de 0 % à 100 % sur la Tour de Hanoï est spectaculaire mais concerne une tâche structurée. L'étude ne donne ni temps de cycle, ni latence ajoutée par la simulation, ni robustesse en environnement industriel. Même sur l'insertion de prise, un tiers des essais échoue encore, un niveau loin des exigences d'une ligne de production.

Cette approche s'inscrit dans la tendance du « harness » ou échafaudage au moment du test, déjà courante pour les agents logiciels et désormais transposée au monde physique. Elle se démarque des stratégies concurrentes qui misent sur le réentraînement à grande échelle, comme Pi-0 de Physical Intelligence, GR00T de Nvidia ou Helix de Figure, et sur l'ajout de capteurs. Elle rejoint aussi les travaux de jumeaux numériques et de real-to-sim, mais sans modifier la politique. La dépendance à un modèle propriétaire fermé et la nécessité d'un modèle de scène fiable restent des limites à lever. Les prochaines étapes probables sont des essais sur davantage de tâches, des comparaisons avec des politiques entraînées spécifiquement et des mesures de latence. Le site du projet est annoncé, mais aucun déploiement industriel ni calendrier de pilote n'est mentionné à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modèles du monde pour la manipulation robotique
1arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
T$^2$Mem : apprendre une mémoire au moment du test pour la robotique
2arXiv cs.RO 

T$^2$Mem : apprendre une mémoire au moment du test pour la robotique

Des chercheurs présentent sur arXiv T²Mem, un cadre qui donne une mémoire à une politique vision-langage-action (VLA) pré-entraînée qui n'en avait pas. La méthode repose sur l'entraînement au moment du test (test-time training). Le système ne retraite pas tout l'historique à chaque décision. Il encode les observations passées dans des « poids rapides » compacts, mis à jour en ligne par apprentissage auto-supervisé. Une interface ancrée dans les observations extrait l'information vision-langage qui alimente la mémoire, puis renvoie le contexte récupéré à l'action expert de la politique. L'entraînement alterne entre mémoire et politique, chacune restant figée pendant l'optimisation de l'autre. Sur les 16 tâches du benchmark RoboMME, le taux de succès moyen passe de 17,93 % à 56,83 % par rapport à la politique de base. T²Mem dépasse aussi les méthodes à mémoire récurrente rapportées dans ce benchmark. Les auteurs annoncent une inférence au moins trois fois plus rapide que les méthodes explicites, mesurée par profilage contrôlé. Ce travail s'attaque à une faiblesse structurelle des VLA. Ils décident surtout à partir de l'observation courante, alors que de nombreuses tâches de manipulation dépendent d'informations qui ne sont plus visibles, comme un objet masqué ou une étape déjà exécutée. Point notable : la mémoire est apprise à partir des seules démonstrations d'actions, sans modèle de raisonnement externe ni annotations dédiées. Cela réduit le coût de données et la complexité d'intégration. Le gain de latence compte pour les boucles de contrôle temps réel. Plusieurs réserves s'imposent. Il s'agit d'un préprint évalué sur benchmark, et le résumé ne mentionne ni validation sur robot physique ni déploiement. L'accélération est mesurée par les auteurs eux-mêmes. Enfin, 56,83 % de réussite moyenne reste loin d'une fiabilité industrielle. Le contexte est celui de politiques généralistes qui ont progressé en dextérité mais restent largement sans état. Les approches de mémoire existantes reposent sur des historiques explicites, des modules de raisonnement externes ou des mémoires récurrentes, d'où la comparaison menée ici avec ces dernières. Le résumé ne nomme pas la politique de base utilisée, ce qui limite pour l'instant la lecture de la portée du gain. Un site projet est annoncé. Les prochaines étapes à surveiller sont la reproduction sur d'autres politiques de base, les essais sur robots réels et une éventuelle reprise du principe dans les modèles de fondation robotiques commerciaux.

RecherchePaper
1 source
Recova : récupération sur échec guidée par des agents pour la manipulation robotique autonome
3arXiv cs.RO 

Recova : récupération sur échec guidée par des agents pour la manipulation robotique autonome

Des chercheurs présentent sur arXiv Recova, un cadre logiciel piloté par un agent qui traite les échecs de manipulation robotique, ces situations où la scène se retrouve dans un état dont la politique de tâche ne peut plus sortir. Le système développe conjointement l'exécution de la tâche et la récupération dans un jumeau numérique reconstruit de la scène. L'agent y diagnostique les pannes, teste des programmes correctifs et collecte des trajectoires réussies, pour la tâche comme pour la récupération, destinées à entraîner deux politiques distinctes. En déploiement, il surveille la progression, déclenche une récupération apprise ou programmée, vérifie que la scène est restaurée, puis reprend la tâche. Si aucune récupération adaptée n'existe, une démonstration humaine règle le cas et alimente la boucle d'apprentissage. Les essais réels et les démonstrations sont routés vers la politique concernée pour un entraînement DAgger. Sur six configurations LIBERO-Pro et quatre catégories MolmoSpaces, Recova atteint 78,8 % et 64,9 % de succès moyen, contre 71,7 % et 38,0 % pour les meilleures méthodes de référence. Sur quatre postes robotisés réels collectant en parallèle, le fine-tuning DAgger fait passer le succès moyen de 23,8 % à 77,5 %, et les compétences de récupération le portent à 87,5 %. Sur une tâche donnée, l'intervention humaine observée tombe de 87,5 % à 0 % en quatre cycles de collecte. L'enjeu dépasse la robustesse brute. La plupart des politiques VLA et des pipelines d'imitation sont évalués sur des trajectoires nominales, alors que le coût opérationnel d'un robot en production tient largement à ce qui se passe après l'échec : objet tombé, scène désordonnée, nécessité d'un opérateur. Recova propose de transformer chaque panne en capacité réutilisable et de réduire progressivement la supervision humaine, ce qui répond directement à la question du coût de téléopération et d'assistance à distance pour les intégrateurs et les exploitants. Le résultat le plus parlant est l'écart sur MolmoSpaces (64,9 % contre 38,0 %), plus marqué que sur LIBERO-Pro. Des réserves s'imposent toutefois : l'évaluation réelle repose sur peu de postes et de tâches, la baisse de l'intervention à 0 % ne concerne qu'une seule tâche, et rien n'est dit sur les temps de cycle, les coûts de reconstruction du jumeau numérique ou la généralisation à des scènes très différentes. Il s'agit d'un travail de recherche, sans produit livré ni déploiement industriel. Le travail s'inscrit dans la convergence entre agents LLM de planification, jumeaux numériques pour la génération de données et apprentissage par correction de type DAgger, une voie explorée pour limiter la dépendance à la collecte massive de démonstrations. Il se positionne face aux approches de fine-tuning de VLA et de simulation à grande échelle que poursuivent des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix), qui misent surtout sur davantage de données plutôt que sur une récupération explicite des échecs. LIBERO-Pro et MolmoSpaces servent ici de bancs d'essai standardisés. La suite logique serait de valider l'approche sur davantage de tâches, de postes et de durées d'exploitation, et de mesurer ses gains en conditions de production, ce que la page projet de l'équipe, liuisabella.com/Recova, ne détaille pas à ce stade.

RecherchePaper
1 source
DSWAM : un modèle fondation à double système pour la manipulation robotique fine
4arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source