Aller au contenu principal
Observabilité du toucher physique par le poignet lors d'une tâche de prise granulaire
RecherchearXiv cs.RO 

Observabilité du toucher physique par le poignet lors d'une tâche de prise granulaire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2609.22852v1) une étude testant si le capteur de force/couple à six axes situé au poignet d'un godet robotique peut prédire le volume final de matériau collecté lors d'une opération de pelletage granulaire. Baptisée "physical-touch observability", cette capacité a été évaluée sur 6 700 essais réels de pelletage effectués par un robot sur 67 terrains différents. Les chercheurs ont comparé le signal de force/couple correctement associé au terrain en cours d'interaction ("current-scoop F/T") à deux références: une prédiction basée uniquement sur l'action pré-contact, et des contrôles où le signal de force/couple est volontairement désaligné avec le terrain réel. Avec une méthode de test excluant certains terrains de l'entraînement, le signal de force/couple correctement associé réduit l'erreur absolue moyenne de 14,2% par rapport à une prédiction fondée sur l'action seule, et de 21,9% par rapport à un signal de force/couple mal apparié à un autre terrain, mesuré à 60% de la séquence de pelletage. Ce gain se reproduit avec des résumés de signaux conçus manuellement (engineered summaries), quelle que soit l'architecture de modèle utilisée.

Ce résultat cible un angle mort connu de la robotique minière et du terrassement: si le transport et la conduite autonomes ont nettement progressé, le chargement et le pelletage restent largement confiés à des opérateurs humains qualifiés, exposant personnel et machines à des risques. Les capteurs RGB-D pré-contact, standards dans ce secteur, révèlent la géométrie de surface mais pas la résistance du matériau, sa compaction, l'engagement réel de l'outil ni le transfert de charge, autant de variables qui n'émergent qu'au moment du contact. En démontrant que le wrench au poignet porte une information exploitable sur l'issue de la tâche, et non un simple retour bas niveau pour la commande, l'étude ouvre une piste pour une autonomie dite "response-aware", capable d'ajuster son geste en fonction d'états physiques cachés pendant des tâches à fort contact, un enjeu qui dépasse le seul minage.

Il s'agit d'un travail de recherche empirique publié en preprint, sans annonce de produit ni de déploiement industriel associé. L'étude s'inscrit dans un effort plus large de la communauté robotique visant à exploiter la perception tactile et proprioceptive pour combler l'écart entre perception visuelle pré-contact et réalité physique de l'interaction, un axe déjà exploré par d'autres travaux sur la manipulation riche en contact, sans qu'aucun calendrier de transfert vers des sites miniers réels ne soit précisé dans le papier.

Dans nos dossiers

À lire aussi

World-to-Wrist : modélisation prédictive du poignet conditionnée par la tâche pour une manipulation robotique fine
1arXiv cs.RO 

World-to-Wrist : modélisation prédictive du poignet conditionnée par la tâche pour une manipulation robotique fine

Un modèle de recherche (arXiv), pas d'annonce produit, j'adapte la structure aux codes d'un papier académique plutôt qu'à un communiqué d'entreprise. Une équipe de recherche présente W2-VLA (World-to-Wrist VLA), un modèle vision-langage-action conçu pour la manipulation robotique fine, décrit dans un article publié sur arXiv (2608.05369v1). Le constat de départ : les modèles VLA actuels traitent généralement la vue principale de la scène et la vue de la caméra au poignet comme deux flux visuels parallèles et équivalents, sans exploiter leur rôle distinct dans une tâche de manipulation. W2-VLA introduit à la place une modélisation prédictive conditionnée par la tâche : à partir des observations multi-vues et de l'instruction donnée, le modèle génère des tokens latents qui servent d'interface compacte entre le modèle vision-langage et un prédicteur dédié au poignet. Ce prédicteur anticipe l'évolution future des représentations latentes de la vue poignet, transformées ensuite en contexte pour la prédiction d'action. Les chercheurs ajoutent W2-CoT, un pipeline de synthèse qui génère des annotations structurées décrivant la progression de la tâche, les transitions physiques et les indices visuels locaux au poignet, utilisées comme supervision auxiliaire. Testé sur les benchmarks LIBERO et RoboTwin 2.0 ainsi que sur des tâches réelles, W2-VLA améliore la manipulation fine et sensible au contact, en configuration bras unique comme bimanuelle, tout en maintenant une fréquence de génération d'actions supérieure à 80 Hz. L'enjeu dépasse le simple gain de précision. La caméra de poignet est déjà largement utilisée dans les VLA récents, à la manière de Pi-0 ou GR00T N2, pour compenser les angles morts de la vue globale lors de tâches de contact fin comme l'insertion ou la manipulation d'objets déformables. Mais peu de travaux exploitaient son potentiel prédictif plutôt que descriptif. En anticipant explicitement ce que la scène au poignet devrait montrer si la tâche progresse correctement, W2-VLA se rapproche d'une forme de modèle du monde localisé plutôt que d'un simple encodeur d'image supplémentaire. Pour les intégrateurs qui évaluent des architectures VLA pour des applications industrielles exigeantes en précision, assemblage ou insertion de connecteurs, le signal est clair : ajouter une caméra de poignet ne suffit pas, c'est la structuration temporelle et prédictive de cette information qui compte. Ces résultats restent toutefois ceux rapportés par les auteurs sur leurs propres benchmarks, sans validation indépendante ni déploiement en production. Ce travail s'inscrit dans la course actuelle à des VLA capables de manipulation fine et de haute fréquence, un axe où des systèmes comme Helix chez Figure ou GR00T N2 chez NVIDIA misent déjà sur la vitesse d'inférence et le multi-vues. La contribution de W2-VLA, le couplage entre tokens latents conditionnés par la tâche et prédiction du futur local au poignet, vise à réduire l'écart entre démonstrations vidéo impressionnantes et robustesse réelle sur des tâches de contact fin, un problème récurrent du secteur. L'article ne mentionne aucun calendrier de déploiement ni partenariat industriel : il s'agit d'une contribution de recherche destinée à être reprise et comparée par d'autres équipes, avec LIBERO et RoboTwin 2.0 comme terrains d'évaluation communs pour de futurs travaux.

RechercheOpinion
1 source
Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle
2arXiv cs.RO 

Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle

Un cycle de planification robotique conçu pour décider quand observer et quand agir vient d'être détaillé dans un article arXiv publié le 18 septembre 2026 (arXiv:2609.20396v1), intitulé Imagine-TAMP: Imagination-Guided Task and Motion Planning in Partial Observability. Le système cible un problème concret des robots manipulateurs en environnement encombré : quand la position d'un objet cible est partiellement cachée, faut-il chercher un nouvel angle d'observation ou déplacer d'abord l'objet qui obstrue la vue. Imagine-TAMP combine deux mécanismes d'"imagination" : un modèle vision-langage qui met à jour une croyance probabiliste (particle belief) sur la position de la cible en s'appuyant sur des relations de bon sens avec les objets visibles, et un modèle génératif de scène qui estime la géométrie plausible des zones non observées. À partir de ces hypothèses, le système génère plusieurs squelettes de plan symboliques, leur attribue des coûts non uniformes reflétant à la fois l'effort de manipulation et la probabilité de révéler la cible, puis affine le squelette retenu en plan moteur exécuté, avec replanification si de nouvelles observations contredisent la croyance initiale. Dans des scènes d'étagère à points de vue contraints, l'évaluation géométrique non uniforme fait passer le taux de succès de 46,0% à 84,0% par rapport à une approche de référence, et l'ajout du modèle sémantique réduit encore les manipulations et replanifications inutiles. Sur un robot réel, le système complet réduit le temps de planification de 32% comparé à une version n'utilisant que la géométrie. L'enjeu dépasse la démonstration académique : la décision observer-versus-manipuler est un goulot d'étranglement classique pour les robots de logistique et de préparation de commandes travaillant dans des bacs ou étagères encombrés, où les approches TAMP classiques s'appuient sur des coûts symboliques grossiers ou une planification géométrique coûteuse, sans jamais estimer la probabilité qu'une observation révèle réellement la cible. En montrant qu'un modèle vision-langage peut injecter du bon sens dans cette décision avant d'engager un calcul moteur coûteux, les auteurs illustrent une tendance plus large où les VLM servent de couche de raisonnement pour la planification plutôt que de générateur direct d'actions, à la différence des approches VLA comme Pi-0 ou GR00T N2. Le travail s'inscrit dans la lignée du TAMP, qui combine planification symbolique et planification de mouvement continue, en cherchant à corriger sa faiblesse historique face à l'observabilité partielle. Il s'agit d'un preprint, sans validation par les pairs ni partenaire industriel identifié dans le résumé ; les auteurs ne précisent pas de calendrier de suite ni d'extension à d'autres classes de tâches.

RecherchePaper
1 source
Assistance humaine à la demande pour poursuivre une tâche après un échec d'action physique dans la planification par LLM
3arXiv cs.RO 

Assistance humaine à la demande pour poursuivre une tâche après un échec d'action physique dans la planification par LLM

Une équipe de recherche présente REPAIR, un système de planification robotique combinant des modèles de langage (LLM) avec une intervention humaine à distance pour surmonter les échecs d'action physique, selon un article publié sur arXiv (2603.28156). Le problème visé est concret : lorsqu'un robot piloté par LLM échoue à saisir un objet, il peut continuer indéfiniment à tenter de le détecter sans réaliser, par exemple, que l'objet est tombé de la table, bloquant ainsi la tâche. Le système proposé fonctionne ainsi : quand le LLM détecte un échec d'action, le robot sollicite une assistance à distance, un opérateur humain résout le problème par téléopération puis décrit le résultat en langage naturel, information qui est réinjectée dans le LLM pour mettre à jour son plan et permettre la poursuite de la tâche. Les chercheurs ont testé leur approche sur une tâche réelle de collecte de déchets, en la comparant à une méthode entièrement autonome et à une téléopération intégrale de référence. Le système hybride améliore la progression de la tâche par rapport à la méthode purement autonome. Cette approche s'attaque à un angle mort connu du secteur : la plupart des systèmes de planification par LLM échouent silencieusement quand une erreur physique dépasse leur capacité de replanification en boucle fermée, tandis que les solutions purement téléopérées ne remontent jamais l'information vers le planificateur pour éviter de répéter l'erreur. En couplant intervention humaine ponctuelle et mise à jour du plan par retour en langage naturel, les auteurs montrent une voie intermédiaire entre autonomie totale et téléopération permanente, un compromis pertinent pour les intégrateurs qui déploient des robots en environnement non structuré sans vouloir monopoliser un opérateur à plein temps. Les résultats restent toutefois nuancés et méritent d'être lus avec prudence : pour les déchets faciles à récupérer, l'écart avec la référence téléopérée est faible, mais il se creuse nettement pour les cas plus difficiles, signe que le gain apporté par le LLM diminue quand la difficulté de manipulation augmente. Le travail s'inscrit dans la lignée des recherches sur la robustesse des systèmes de planification LLM appliqués à la robotique, un domaine où le fossé entre démonstrations en laboratoire et déploiement réel reste un sujet récurrent. Le site du projet est hébergé par l'équipe Emergent Systems Lab. L'étude se limite à un cas d'usage unique, la collecte de déchets, et les auteurs ne détaillent pas de calendrier de déploiement industriel ni de partenariat commercial à ce stade ; il s'agit d'un travail de recherche exploratoire plutôt que d'un produit prêt à l'emploi.

RecherchePaper
1 source
NDPP-Grasp : préhension dextérique orientée tâche guidée par contraintes de plausibilité physique non-différentiables
4arXiv cs.RO 

NDPP-Grasp : préhension dextérique orientée tâche guidée par contraintes de plausibilité physique non-différentiables

Des chercheurs ont publié le 2 juin 2026 sur arXiv un cadre baptisé NDPP-Grasp pour améliorer la génération de préhensions dextres orientées tâche. Le défi est double : une préhension dextre doit être physiquement plausible (pas de collision de doigts, forces équilibrées) et fonctionnellement adaptée à la manipulation spécifiée (saisir un couteau par le manche, pas par la lame). Les méthodes actuelles basées sur la diffusion traitent ces deux exigences de façon séquentielle : un modèle de diffusion est d'abord entraîné pour l'alignement tâche, puis un raffinement post-génération corrige la plausibilité physique. NDPP-Grasp change cette logique en injectant les contraintes de plausibilité physique directement dans le processus de débruitage (denoising), y compris lorsque ces contraintes sont non-différentiables, c'est-à-dire qu'elles ne peuvent pas être intégrées via une simple rétropropagation du gradient. L'impact technique est concret. Appliquer des corrections physiques après génération laisse la trajectoire de débruitage aveugle aux contraintes, produisant des préhensions sous-optimales que le raffinement corrige imparfaitement. En guidant le processus génératif lui-même, NDPP-Grasp améliore la qualité des préhensions sans sacrifier l'alignement tâche. C'est particulièrement pertinent pour les mains robotiques multi-DOF à haute dextérité (Shadow Hand, Allegro Hand notamment), où l'espace des configurations valides est étroit et où une mauvaise initialisation génère directement des échecs de saisie en conditions réelles. La méthode adresse aussi un verrou technique : intégrer dans un pipeline de diffusion des métriques physiques issues de simulateurs ou de vérificateurs de contact qui ne fournissent pas de gradient analytique. La génération de préhensions dextres mobilise la communauté depuis des décennies, mais l'essor des modèles de diffusion depuis 2022-2023 a renouvelé les approches avec des travaux comme UniDexGrasp ou GraspDiffusion. NDPP-Grasp s'inscrit dans ce courant, concurrent aux méthodes de guidance par classificateur (classifier guidance) appliquées à la manipulation. Le résumé arXiv ne précise pas l'affiliation institutionnelle ni les benchmarks utilisés ; les expériences sont décrites comme "extensives" sans détail sur les architectures de mains testées ni les jeux de données d'évaluation. La validation sur hardware réel, et le transfert sim-to-real associé, restera l'épreuve déterminante pour mesurer l'utilité pratique de ce cadre.

RecherchePaper
1 source