Aller au contenu principal
RecherchearXiv cs.RO 

Replanification ancrée dans le corps pour une manipulation physiquement adaptative

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv le 25 septembre 2026 sous la référence 2609.30024, un article présente le « body-grounded replanning », une méthode qui permet à un bras manipulateur d'ajuster sa stratégie d'exécution selon son propre état physique interne, et non plus seulement selon la géométrie de l'environnement. Le système surveille l'état articulaire du robot, charge sur les joints et mobilité disponible, et déclenche une replanification dès qu'un événement corporel survient, comme une surcharge ou une contrainte de mobilité asymétrique. Un grand modèle de langage interprète alors cet état, les statistiques d'exécution récentes et l'historique des actions pour choisir une stratégie alternative, sans toucher à l'objectif de la tâche ni au contrôleur bas niveau. L'approche est validée sur une tâche d'atteinte sous charge contrôlée et contraintes de mobilité asymétriques, en simulation puis sur un robot réel, avant d'être étendue à des manipulations avec contacts.

Cette approche cible un angle mort des architectures de manipulation actuelles : une stratégie peut rester géométriquement valide tout en devenant physiquement inadaptée, par exemple quand un bras accumule de la fatigue articulaire ou perd en amplitude de mouvement, un signal qui ne remonte d'ordinaire jamais au-delà du contrôle bas niveau. En faisant remonter l'état corporel jusqu'à la couche de décision de haut niveau, généralement réservée à la perception externe, les auteurs montrent qu'un robot peut réduire son effort physique et gagner en efficacité d'adaptation tout en gardant un taux de réussite élevé. Pour les intégrateurs qui déploient des modèles vision-langage-action sur des plateformes réelles, ce travail ouvre une piste pour limiter l'usure mécanique et les échecs liés à des contraintes physiques imprévues, sans réentraîner la politique de contrôle bas niveau.

Cette proposition s'inscrit dans la tendance consistant à confier à un LLM le rôle d'orchestrateur au-dessus de politiques de contrôle bas niveau spécialisées, une architecture déjà explorée par plusieurs travaux de planification robotique assistée par langage. Sa spécificité tient à l'usage de signaux purement internes au robot, joints, charge, mobilité, plutôt que des seules entrées visuelles habituellement utilisées pour décider d'un changement de stratégie. Classé comme nouvelle soumission sur arXiv, l'article ne mentionne aucun partenariat industriel ni déploiement hors laboratoire : les essais se limitent à une tâche de reaching et à des manipulations avec contacts, en simulation et sur un seul robot réel, sans calendrier de transfert vers un produit commercial.

À lire aussi

PhysVLA : vers un modèle VLA physiquement ancré pour la manipulation robotique
1arXiv cs.RO 

PhysVLA : vers un modèle VLA physiquement ancré pour la manipulation robotique

Des chercheurs ont publié sur arXiv (arXiv:2606.13886, juin 2026) PhysVLA, un module d'inférence plug-and-play conçu pour corriger en temps réel les actions générées par n'importe quel modèle VLA (Vision-Language-Action) existant, sans rétro-entraînement ni accès aux poids. Le système intercepte les commandes produites par le backbone VLA et applique deux couches de correction successives : une machine à états finis sensible à la phase de la tâche (approche, saisie, transport, dépôt), puis un filtre sélectif basé sur les équations d'Euler-Lagrange qui ne s'active que lorsqu'un oracle de dynamique détecte une incohérence cinodynamique. Le surcoût de calcul est inférieur à 1 ms par pas de contrôle. Évalué sur quatre architectures distinctes (OpenVLA, OpenVLA-OFT, Force-VLA, Generalist-VLA) sur le benchmark LIBERO-Spatial avec un bras Franka Panda 7-DOF, PhysVLA améliore le taux de succès absolu jusqu'à 17 points, la stabilité jusqu'à 19 points, et l'efficacité de trajectoire jusqu'à 15 %, sans régression sur aucune tâche. Sur un sweep cross-simulateur (Robosuite Lift), la robustesse au jerk de trajectoire progresse d'un facteur 10. La validation sur un bras physique Agilex Piper (tâche pick-and-place réelle) confirme le transfert sim-to-real sans rétro-entraînement, avec une amélioration du taux de succès allant jusqu'à 50 %. L'intérêt industriel de cette approche tient à son caractère composable et backbone-agnostique. Les VLA actuels apprennent à imiter des démonstrations comportementales sans contraindre explicitement la physique des corps rigides ni les contacts, ce que les chercheurs nomment un "physics gap". Les correcteurs temporels classiques (temporal smoothing) masquent le problème sans le résoudre, et introduisent leurs propres échecs. PhysVLA propose une solution d'intégration légère pour les équipes qui déploient des VLA existants en production : pas de réentraînement, pas d'accès aux poids, un wrapper autour du modèle gelé. Pour un intégrateur ou un OEM, cela signifie potentiellement améliorer des systèmes déjà en ligne sans toucher aux pipelines de formation, ce qui réduit le risque et le coût de mise à niveau. PhysVLA s'inscrit dans la montée en puissance des approches de contrôle physique fondé pour les VLA généralistes, une problématique que des laboratoires comme Physical Intelligence (avec π0), Stanford (OpenVLA) ou Google DeepMind travaillent activement. Le papier positionne explicitement son framework comme complémentaire à ces backbones plutôt que concurrent. Il reste à ce stade un prototype de recherche validé en laboratoire sur deux plateformes matérielles (Franka Panda et Agilex Piper) ; aucun déploiement industriel ni partenariat commercial n'est annoncé. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges (RoboMimic, DROID) et sur des robots à plus haute cinématique, notamment des humanoïdes où la gestion des contacts et de la dynamique des corps rigides est critique.

UELes équipes R&D et intégrateurs européens déployant des VLA en production peuvent directement tester ce wrapper plug-and-play sans rétro-entraînement, mais aucun acteur ou déploiement européen n'est impliqué dans ce travail de recherche.

RechercheOpinion
1 source
LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique
2arXiv cs.RO 

LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique

Un article de recherche publié sur arXiv (arXiv:2609.19796v1) présente LIFD (Look, Imagine, Focus, and Do), un système de mémoire de scène tridimensionnelle persistante destiné à la manipulation robotique en conditions d'observabilité partielle, c'est-à-dire lorsque des zones vues par le robot sortent du champ de la caméra à mesure qu'il ou la scène se déplace. Le système apprend une représentation en tokens de scène à partir d'un accord multi-vues, puis la complète en déploiement à partir d'une seule image RGB et d'une mémoire récurrente, grâce à un modèle de rectified-flow combiné à un mécanisme d'attention croisée guidée par des ancrages géométriques. Sur les bancs d'essai de simulation LIBERO et MetaWorld, la version dite "Staged" de LIFD atteint respectivement 91,6% et 79,8% de taux de réussite moyen, avec un gain de 3,1 points de pourcentage sur LIBERO par rapport à un entraînement joint classique. Sur un bras robotique réel UR5e, testé sur quatre familles de tâches avec seulement dix démonstrations par famille, LIFD obtient 56,0% de réussite moyenne contre 40,5% pour OpenVLA-7B, un modèle vision-langage-action de référence dans le secteur. Ce résultat s'attaque à une limite connue des politiques de manipulation actuelles: la plupart des architectures VLA raisonnent sur la vue courante et perdent la trace des objets ou surfaces qui sortent du cadre, ce qui fragilise les tâches nécessitant de se souvenir d'un état antérieur de la scène. En montrant qu'une mémoire de scène compacte peut être inférée à partir d'une unique caméra RGB et de la proprioception au moment du déploiement, sans capteurs multi-vues ni LIDAR embarqués, LIFD répond à une contrainte très concrète pour les intégrateurs: le coût et la complexité du capteur. L'écart de performance avec OpenVLA-7B en régime few-shot (dix démonstrations) est aussi un signal pour les décideurs B2B, car il suggère qu'une mémoire spatiale explicite peut compenser en partie le besoin de données massives, un frein habituel à l'adoption des VLA en environnement industriel réel. Sur le plan méthodologique, LIFD s'appuie sur un entraînement en deux temps: une phase de représentation supervisée par des signaux multi-vues et géométriques, suivie d'une politique de manipulation reliée à cette représentation via des "slot features" compactes. Les auteurs comparent explicitement deux régimes d'entraînement, "Staged" et "Joint", le premier se révélant supérieur, et positionnent leur approche face à OpenVLA-7B comme référence VLA open-source établie. Il s'agit à ce stade d'un travail de recherche publié en preprint, validé sur des simulateurs standards du domaine (LIBERO, MetaWorld) et un unique bras collaboratif UR5e en laboratoire, sans annonce de pilote industriel ni de calendrier de déploiement à plus grande échelle.

RecherchePaper
1 source
IMPLY : cohérence physiquement ancrée pour les simulations par modèle du monde
3arXiv cs.RO 

IMPLY : cohérence physiquement ancrée pour les simulations par modèle du monde

Un article déposé sur arXiv (2609.12441v1, mi-septembre 2026) présente IMPLY, une méthode pour vérifier si les modèles du monde robotiques comprennent réellement la physique des objets, plutôt que de simplement produire des prédictions cohérentes entre elles. Les contrôles actuels d'auto-cohérence vérifient seulement que les trajectoires prédites pour un objet poussé à plusieurs vitesses s'accordent entre elles, sans les confronter à la physique réelle. IMPLY inverse un simulateur pour extraire la masse et le frottement impliqués par chaque trajectoire, ancrés sur deux poussées de calibration déjà vues par le modèle. En test contrôlé, l'auto-cohérence donne un score parfait à un modèle qui ignore l'objet et prédit toujours une poussée "typique" (AUROC de seulement 0,70 pour repérer la triche), là où IMPLY le démasque parfaitement (AUROC de 1,00). Sur V-JEPA 2-AC, le modèle de Meta adapté à la scène testée, le système suit l'objet avec ses propres calibrations (corrélation de 0,91 avec la vérité terrain) mais tombe à 0,05 avec celles d'un autre objet; l'auto-cohérence ne distingue pas les deux cas (52% de bonnes préférences, niveau du hasard) quand IMPLY y parvient dans 73% des cas, à 0,003 près d'un oracle omniscient. Le résultat pointe un angle mort dans l'évaluation des modèles du monde et des architectures vision-langage-action (VLA) qui pilotent robots manipulateurs et humanoïdes: un modèle peut paraître fiable et cohérent avec lui-même sans avoir internalisé la moindre notion de masse ou de frottement, et dérailler face à un objet inconnu. Pour les intégrateurs qui évaluent des piles comme GR00T N2, Pi-0 ou Helix avant déploiement, les métriques de cohérence interne mises en avant dans les communiqués ne garantissent donc aucune compréhension physique transférable. Les modèles du monde conditionnés par l'action, tel V-JEPA 2-AC de Meta AI (FAIR), prédisent à partir de vidéo l'effet des actions d'un robot sans simulateur physique explicite, et servent de brique à plusieurs architectures VLA récentes de manipulation. Faute de vérité terrain disponible à l'inférence, la communauté s'appuyait jusqu'ici sur l'auto-cohérence entre trajectoires, une pratique qu'IMPLY montre insuffisante puisqu'elle peut être dupée par un modèle ignorant l'identité de l'objet manipulé. Il s'agit à ce stade d'une contribution de recherche testée en environnement contrôlé, sans calendrier de déploiement industriel annoncé.

RecherchePaper
1 source
MOSAIC : planification de manipulation centrée sur les compétences par simulation physique
4arXiv cs.RO 

MOSAIC : planification de manipulation centrée sur les compétences par simulation physique

Le fossé entre le nombre potentiellement infini de compétences robotiques disponibles et l'incapacité des robots à les enchaîner de façon fiable sur des tâches longues reste un problème central en robotique. Une équipe de chercheurs présente MOSAIC, une méthode de planification centrée sur les compétences qui s'appuie sur la simulation physique pour estimer, avant exécution, la probabilité de succès de chaque compétence dans un contexte donné. Plutôt que d'explorer pas à pas un espace de séquences quasi infini, comme le font les méthodes incrémentales classiques, ou de raisonner sur des représentations symboliques simplifiées mais fragiles et coûteuses à construire à la main, MOSAIC combine deux familles complémentaires de compétences: les Générateurs, qui identifient des « îlots de compétence », c'est-à-dire des zones où une action donnée réussit de façon démontrable, et les Connecteurs, qui relient ces trajectoires entre elles en résolvant des problèmes aux limites. L'équipe a testé l'approche sur des tâches de manipulation longues et complexes, en simulation comme sur un robot réel, en mobilisant un ensemble hétérogène d'outils: modèles de diffusion génératifs, algorithmes classiques de planification de mouvement et modèles spécialisés en manipulation. Le papier, une version révisée publiée sur arXiv, est accompagné d'un site de démonstrations (skill-mosaic.github.io). L'enjeu dépasse la seule performance algorithmique. Le planning long-horizon par composition de compétences est considéré depuis des années comme un verrou pour des robots véritablement généralistes, capables d'assembler des briques génériques pour résoudre des tâches nouvelles sans reprogrammation dédiée. En concentrant l'effort de recherche sur les régions où chaque compétence est réellement fiable, plutôt que de faire confiance à une couverture uniforme de l'espace des possibles, MOSAIC apporte une réponse concrète à la fragilité chronique des approches symboliques et à l'explosion combinatoire des méthodes purement incrémentales, un sujet sensible à l'heure où l'industrie mise massivement sur les modèles vision-langage-action pour la généralisation. Cette contribution s'inscrit dans la lignée des travaux de planification tâche-et-mouvement (TAMP), où la tension entre robustesse symbolique et flexibilité des méthodes apprises est documentée de longue date. L'essor récent des politiques de diffusion et des modèles génératifs comme briques de bas niveau change la donne: MOSAIC propose justement un cadre capable d'orchestrer ce type d'outils hétérogènes sans passer par une couche symbolique rigide. La publication d'une troisième version sur arXiv suggère un travail encore en cours de révision, avec des démonstrations concrètes disponibles pour les équipes de recherche souhaitant évaluer la méthode sur leurs propres bancs d'essai.

RecherchePaper
1 source