Aller au contenu principal
Quand l'état absolu échoue : évaluation des encodages proprioceptifs pour une manipulation robuste
RecherchearXiv cs.RO 

Quand l'état absolu échoue : évaluation des encodages proprioceptifs pour une manipulation robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (référence 2605.13067) une étude systématique sur l'encodage de l'état proprioceptif des robots pour améliorer la robustesse des politiques de manipulation de bout en bout. Le constat de départ est précis : les politiques entraînées avec des données en conditions contrôlées échouent fréquemment lors du déploiement réel, notamment lorsque le référentiel du robot change entre l'entraînement et l'inférence. Les auteurs évaluent plusieurs stratégies d'encodage des positions et angles articulaires, depuis les représentations absolues classiques jusqu'à des formulations relatives, et identifient qu'un référentiel relatif défini à l'épisode, c'est-à-dire ancré sur l'état initial des articulations au début de chaque séquence de tâche, offre le meilleur compromis entre performance nominale et généralisation hors distribution. Ces résultats sont validés sur un banc d'essai physique en conditions réalistes, avec des expériences multi-configurations sur robot réel.

L'enjeu industriel est concret : les robots à cadre de référence mobile (bras montés sur AMR, robots repositionnables sur ligne, cobots déplacés entre postes) représentent une part croissante des déploiements, mais les politiques end-to-end existantes, y compris les VLA (Vision-Language-Action models) récents comme pi-0 ou GR00T N2, sont généralement entraînées avec des hypothèses de cadre fixe. Cette étude fournit une piste d'implémentation directement exploitable sans modifier l'architecture du modèle ni relancer de collecte de données massive : changer simplement la convention d'encodage proprioceptif suffit à améliorer la robustesse out-of-distribution. C'est un résultat rare dans la littérature VLA, qui tend à préconiser le scaling de données comme seule réponse à la distribution shift.

Ce travail s'inscrit dans une tendance de fond : après l'emballement autour des politiques diffusion et des modèles fondation pour la robotique en 2023-2024, la communauté revient sur des questions d'ingénierie bas-niveau souvent négligées. La proprioception, longtemps traitée comme un signal trivial, redevient un sujet de recherche actif face aux exigences du déploiement réel. Aucun partenaire industriel n'est mentionné dans l'abstract, ce qui en fait une contribution académique ouverte, sans timeline de productisation annoncée. Les prochaines étapes logiques seraient des tests avec des architectures VLA complètes et des configurations de bases mobiles plus variées.

Dans nos dossiers

À lire aussi

RoboMP-DINOv2 : des prompts, pas des filtres, pour une manipulation robotique robuste
1arXiv cs.RO 

RoboMP-DINOv2 : des prompts, pas des filtres, pour une manipulation robotique robuste

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25506) « RoboMP-DINOv2 : Prompts, Not Filters for Robust Robot Manipulation », une méthode d'encodage visuel pour les politiques de manipulation robotique. RoboMP-DINOv2 traite les masques de segmentation comme des prompts spatiaux injectés dans le traitement, plutôt que comme des filtres supprimant l'arrière-plan : le modèle extrait des features denses via DINOv2 sur l'observation complète, ajoute des embeddings spécifiques à la région aux emplacements masqués, puis contextualise conjointement tokens promptes et non promptes pour prédire l'action. Une variante, RoboMP-DINOv2-MCR, ajoute une randomisation de couleur des régions masquées pour renforcer la robustesse à l'apparence. Sur sept environnements de manipulation simulés, le modèle atteint 60,7% de réussite sous décalages spatiaux et 59,7% sous encombrement de scène, contre 50,7% et 41,0% pour une Diffusion Policy basée sur DINOv2. Face à des couleurs d'objets inédites, la variante MCR atteint 72,5% de réussite contre 35,1% pour le meilleur concurrent entraîné avec randomisation de couleur. Le code est publié en open source sur GitHub. Ces résultats répondent à un problème concret pour qui déploie des politiques de manipulation hors laboratoire : les encodeurs de vision généralistes ne sont pas conçus pour le contrôle visuomoteur, tandis que les approches object-centric classiques, qui masquent tout sauf l'objet cible, suppriment le contexte de scène parfois nécessaire à l'action. En montrant qu'un encodeur full-scene guidé par prompts spatiaux surpasse à la fois un backbone générique et les filtres par segmentation sur position, encombrement et couleur, l'étude nuance l'idée reçue selon laquelle la robustesse visuelle passe par l'exclusion d'information. Pour les intégrateurs qui construisent des piles de perception au-dessus de politiques VLA, c'est un signal que le choix de l'encodeur visuel pèse autant que l'architecture de la politique elle-même. Ces gains restent toutefois mesurés uniquement en simulation, sans validation sur robot physique ni comparaison directe à des VLA à grande échelle comme GR00T N2 ou Pi-0. Le travail s'inscrit dans la lignée des politiques de manipulation par imitation construites sur des backbones de vision pré-entraînés, DINOv2 de Meta étant devenu un choix courant en recherche robotique, et prend la Diffusion Policy comme référence de comparaison directe. Il se positionne entre deux familles d'approches existantes, les encodeurs génériques non spécialisés pour le contrôle et les méthodes object-centric à filtrage dur par masque de segmentation. Le code est disponible sur le dépôt GitHub han20192019/RoboMP_DINOv2, ouvrant la voie à des tests sur robot réel et à une intégration dans des piles de politiques plus larges, sans calendrier ni partenaire industriel annoncés pour cette suite.

RecherchePaper
1 source
CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
2arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source
Apprentissage d'une manipulation dextérique robuste en main à partir de capteurs articulaires avec un transformeur proprioceptif
3arXiv cs.RO 

Apprentissage d'une manipulation dextérique robuste en main à partir de capteurs articulaires avec un transformeur proprioceptif

Des chercheurs publient sur arXiv (2605.21330, mai 2026) le Proprioceptive Transformer (PT), une architecture de contrôle pour la manipulation dextre en main fondée exclusivement sur les capteurs articulaires, sans vision ni retour tactile. Testée sur la main ténosynoviale ORCA, l'approche réalise une rotation continue de cube à une vitesse 3,1 fois supérieure aux méthodes de référence, et estime la position de l'objet avec une erreur quadratique moyenne (RMSE) inférieure de 23,4 % à celle d'un perceptron multicouche (MLP). La politique de contrôle est obtenue par distillation enseignant-élève : une politique enseignante est d'abord entraînée par apprentissage par renforcement avec accès privilégié à l'état de l'objet, puis ses connaissances sont distillées vers le PT, qui opère uniquement sur l'historique de positions et de vitesses articulaires. Ce résultat questionne une hypothèse largement répandue dans le domaine : la nécessité d'une perception externe pour fermer la boucle d'estimation d'état lors de manipulations en main. Les encodeurs articulaires sont présents sur toutes les mains robotiques, y compris les architectures ténosynoviales où la transmission élastique complique l'estimation de la posture réelle des doigts. Que le Transformer extraie implicitement des informations extrinsèques à partir de patterns temporels proprioceptifs constitue une validation partielle du sim-to-real appliqué à la manipulation dextre, un problème longtemps considéré non résolu à l'échelle réelle. La robustesse sur des objets de géométrie variable ou sous charge perturbée reste à démontrer : le preprint ne rapporte de résultats que sur le cube, et les métriques de vitesse de rotation manquent de contexte sur les conditions expérimentales exactes. La manipulation dextre en main est un problème ouvert depuis les années 1990, relancé par OpenAI Dactyl (2019) qui combinait vision externe et simulation massivement distribuée. Les approches concurrentes recourent aujourd'hui à des capteurs tactiles haute résolution (Shadow Hand avec BioTac, Leap Hand, GelSight sur Allegro) ou à des pipelines vision-langage-action de type Pi-0 ou GR00T N2. L'ORCA hand, plateforme académique à actionnement par tendons, reste moins présente dans les benchmarks publiés que l'Allegro ou la Shadow Hand, ce qui limite la comparaison directe avec l'état de l'art. Le preprint ne mentionne ni partenaires industriels ni calendrier de transfert : il s'agit d'une contribution de recherche fondamentale, sans déploiement annoncé.

RecherchePaper
1 source
ProTracer : diagnostic des échecs de manipulation robotique guidé par la proprioception
4arXiv cs.RO 

ProTracer : diagnostic des échecs de manipulation robotique guidé par la proprioception

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.21369) ProTracer, un framework de diagnostic des échecs d'exécution chez les robots manipulateurs. Le système couvre quatre tâches : détection binaire d'échec, catégorisation du type d'échec, génération d'explications en langage naturel, et une capacité inédite de localisation du point de bascule, c'est-à-dire l'instant précis où la trajectoire du robot dévie d'une exécution correcte avant d'échouer. Qualifié de « training-free », ProTracer combine des modèles vision-langage (VLM) existants, non réentraînés, avec des signaux proprioceptifs (positions articulaires, forces) traduits en descriptions textuelles structurées et analysés conjointement avec les images. Les auteurs publient également FailTime, un benchmark synchronisant observations visuelles et proprioceptives pour évaluer ces tâches, y compris la nouvelle localisation d'échec. Pour les intégrateurs, l'enjeu dépasse l'exercice académique : la fiabilité des robots manipulateurs pilotés par des modèles vision-langage-action (VLA) reste un frein au déploiement industriel, et savoir pourquoi et à quel instant un bras échoue conditionne le débogage, l'audit et la certification avant mise en production. En réutilisant des VLM existants plutôt qu'un modèle dédié, ProTracer vise une adoption à moindre coût, sans collecte de données spécifique. L'ajout de la proprioception comble une limite des approches purement visuelles, qui manquent de précision temporelle pour repérer l'instant exact où une tâche dérape, un point clé pour l'amélioration continue des politiques d'apprentissage par imitation ou par renforcement. Ce travail s'inscrit dans l'essor des modèles vision-langage-action comme Pi-0, GR00T N2 ou OpenVLA, dont la fiabilité en conditions réelles reste difficile à évaluer au-delà de vidéos de démonstration sélectionnées. Il prolonge des travaux antérieurs de détection d'anomalies robotiques limités à une classification binaire ou à une analyse purement visuelle, sans granularité temporelle. Publié en préimpression sur arXiv, sans mention de revue par les pairs ni de partenariat industriel, ProTracer reste à ce stade une contribution méthodologique : les auteurs rapportent de bonnes performances sur les tâches classiques de diagnostic et sur la localisation d'échec, sans calendrier annoncé pour la publication du code ou du benchmark FailTime.

RecherchePaper
1 source