Aller au contenu principal
RecherchearXiv cs.RO 

DA-GRD : désambiguïsation tactile décisionnelle pour la récupération face aux erreurs perception-exécution

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

DA-GRD (Decision-Aware Grasp-Relevant Disambiguation), publiée sur arXiv le 25 septembre 2026 (arXiv:2609.29065v1), permet à un bras robotique de retrouver une prise valide quand l'objet a bougé après la perception visuelle, sans nouvelle image, via de simples contacts tactiles. La méthode maintient une carte de probabilités 2D sur les positions possibles de l'objet, choisit chaque sondage tactile pour éliminer un maximum d'hypothèses, et s'arrête dès qu'une prise commune devient exécutable, sans relocaliser entièrement l'objet. En simulation MuJoCo, sur dix objets rigides déplacés jusqu'à 5 cm et tournés jusqu'à 45 degrés, elle atteint 84,7% de réussite de saisie, contre 9,1% pour une prise AnyGrasp périmée, 21,2% pour un balayage tactile fixe et 63,7% pour ce balayage avec croyance SE(2) ; le taux de réussite conditionné à la tâche atteint 57,3%, avec 4,13 sondages en moyenne, soit 72,5% de moins que la base à 15 sondages. En conditions réelles, sur six objets, elle obtient 71,7% de réussite de saisie et 38,3% de réussite conditionnée à la tâche, pour 4,20 sondages en moyenne.

Le problème ciblé est concret pour l'industrie : le décalage entre ce que perçoit la vision et l'état réel de la scène au moment de la saisie, fréquent en logistique quand un objet glisse ou est déplacé avant l'exécution. Plutôt que de reprendre une image ou de relocaliser complètement l'objet, ce qui allonge le temps de cycle, DA-GRD montre qu'un petit nombre de contacts tactiles ciblés suffit à restaurer une prise exploitable, un intérêt direct pour le bin picking et la manipulation en environnement encombré. Cela nuance l'idée que les pipelines purement visuels ou les modèles VLA suffisent à garantir la robustesse en conditions réelles : l'écart entre perception et exécution reste un point de fragilité que le tactile peut combler à faible coût de calcul.

Le travail s'inscrit dans la recherche sur la manipulation tactile, complémentaire aux pipelines de saisie basés sur la vision comme AnyGrasp, utilisé ici comme référence de prise périmée, et se positionne face aux méthodes de balayage tactile à nombre fixe de sondages ainsi qu'aux approches de relocalisation complète, plus coûteuses en temps. Les tests restent limités, dix objets rigides en simulation et six en conditions réelles, sans objets déformables ni scènes à plusieurs objets. Aucune intégration industrielle n'est annoncée : il s'agit pour l'instant de recherche académique publiée sur arXiv, la suite logique étant l'extension à des objets plus divers et à d'autres bras robotiques.

Dans nos dossiers

À lire aussi

Perception active pour la désambiguïsation incarnée
1arXiv cs.RO 

Perception active pour la désambiguïsation incarnée

Un article de recherche intitulé "Active Perception for Embodied Disambiguation" (arXiv:2608.13605v1) propose un nouveau cadre pour lever l'ambiguïté des instructions données en langage naturel aux robots. Le constat de départ est que lorsqu'un robot reçoit une consigne, l'incertitude sur la cible visée ne provient pas uniquement d'une formulation imprécise de l'utilisateur, mais aussi d'un manque de preuves visuelles dans l'observation courante : objet occulté, point de vue restreint, texte illisible ou cible simplement hors champ. Les méthodes existantes de désambiguïsation interactive se contentent généralement de poser des questions supplémentaires à l'utilisateur. Le système proposé s'appuie à la place sur l'observation active comme mécanisme principal d'acquisition d'information, pilotée par un modèle vision-langage (VLM) qui décide, à partir des indices visuels déjà accumulés et des échanges passés, s'il faut poursuivre l'observation, demander une clarification, ou valider directement la sélection de la cible. Des expériences menées sur robot réel montrent que ce cadre combine effectivement acquisition physique d'information et clarification d'intention au sein d'un seul processus de désambiguïsation incarnée. L'intérêt pour l'industrie robotique tient au fait que la plupart des systèmes de commande en langage naturel traitent l'ambiguïté comme un problème purement conversationnel, en multipliant les questions à l'utilisateur, sans jamais remettre en cause la qualité de l'observation elle-même. Or dans un entrepôt, un domicile ou un site industriel, les occlusions, les angles de vue limités et les étiquettes illisibles sont la norme plutôt que l'exception. Montrer qu'un robot peut résoudre une partie de ces ambiguïtés en changeant activement de point de vue, plutôt qu'en interrompant systématiquement la tâche pour interroger l'opérateur, va dans le sens d'une autonomie plus robuste pour les architectures de type VLA déployées sur bras manipulateurs ou robots mobiles. Cela répond aussi, de façon ciblée, à l'écart souvent observé entre démonstrations en environnement contrôlé et comportement en conditions réelles bruitées. Ce travail s'inscrit dans la lignée des recherches sur la désambiguïsation interactive et sur les modèles vision-langage-action qui infusent la compréhension du langage dans la boucle de perception et d'action des robots, un axe où plusieurs laboratoires publient régulièrement de nouvelles architectures. Il s'agit ici d'une publication de recherche en préimpression sur arXiv, sans produit commercial ni déploiement industriel associé à ce stade : la contribution reste méthodologique et validée par des essais limités sur robot réel, pas encore par des pilotes à grande échelle ni des chiffres de performance chiffrés publiquement communiqués.

RecherchePaper
1 source
TacForcing : génération d'actions en flux continu avec retour tactile à l'exécution
2arXiv cs.RO 

TacForcing : génération d'actions en flux continu avec retour tactile à l'exécution

Une équipe de recherche présente TacForcing, un framework de génération d'actions en flux continu pour la manipulation robotique riche en contacts, publié sur arXiv (arXiv:2608.25798v1). Il remplace l'expert d'action standard des modèles vision-langage-action (VLA) par un « streaming action expert » qui génère les actions en se conditionnant sur des retours tactiles captés pendant l'exécution, et non plus sur des observations figées antérieures au mouvement. Un mécanisme associé, Execution-Aware Tactile Attention (EATA), restreint ce conditionnement tactile aux actions proches de leur exécution réelle, réduisant le décalage entre capture tactile et mouvement. Sur six tâches simulées du benchmark UniVTAC et trois tâches réelles de manipulation riche en contacts, TacForcing atteint des taux de réussite moyens de 65% et 69% respectivement, devant les références existantes. Le problème visé est connu des intégrateurs en préhension fine et assemblage: les VLA à base de blocs d'actions (« chunks ») prédisent un mouvement complet à partir d'observations pré-exécution, rendant le conditionnement tactile obsolète dès que l'état de contact change (glissement, résistance, déformation). Les approches tactiles réactives existantes compensent avec un contrôleur haute fréquence séparé, ce qui alourdit l'architecture et l'entraînement. En intégrant le retour tactile directement dans le flux de génération, sans contrôleur additionnel, TacForcing simplifie cette chaîne et illustre qu'un VLA peut devenir réactif au contact sans architecture parallèle, un enjeu concret pour les tâches d'assemblage, d'insertion ou de manipulation d'objets déformables en environnement industriel. Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui a suivi des systèmes comme Pi-0, GR00T N2 ou Helix, où l'ajout de modalités sensorielles au-delà de la vision vise à combler l'écart entre démonstrations et robustesse réelle. Il s'agit d'une publication académique, sans acteur industriel ni déploiement commercial associé, évaluée sur le benchmark UniVTAC et seulement trois tâches réelles, ce qui invite à la prudence sur la généralisation des taux annoncés avant validation indépendante à plus grande échelle.

RechercheActu
1 source
Intelligence tactile par vision pour la robotique : perception, apprentissage et manipulation incarnée
3arXiv cs.RO 

Intelligence tactile par vision pour la robotique : perception, apprentissage et manipulation incarnée

Une équipe de chercheurs publie sur arXiv (arXiv:2608.15490v1, en ligne le 18 août 2026) une revue de synthèse consacrée aux capteurs tactiles à base de vision, ou VBTS (vision-based tactile sensors), pour la robotique. Le papier ne présente ni produit ni robot spécifique, mais dresse un panorama complet de la chaîne technologique : le matériel (design de l'élastomère déformable, taille et forme du capteur, système optique), les méthodes d'apprentissage (du traitement bas niveau du signal jusqu'aux politiques de tâche et aux modèles de fondation), les plateformes de simulation et les jeux de données tactiles, ainsi que les techniques de transfert simulation vers réel et d'adaptation inter-capteurs. Les auteurs proposent une taxonomie matérielle destinée à guider la conception future de capteurs, et une vue hiérarchique de l'intelligence tactile fondée sur l'apprentissage automatique. Le sujet touche un point aveugle connu de la robotique de manipulation : contrairement à la vision, la plupart des capteurs tactiles actuels ne renvoient que des signaux épars et de faible dimension, insuffisants pour des tâches de contact complexes comme la saisie fine, l'insertion ou la manipulation dextre. En convertissant la déformation d'une interface souple en image, les VBTS offrent une observation tactile haute résolution, exploitable par les mêmes architectures que la vision, ce qui ouvre la voie à des politiques de manipulation plus robustes pour bras industriels, mains robotiques et humanoïdes. Pour les intégrateurs et équipes de recherche, l'intérêt du travail tient moins à une avancée ponctuelle qu'à une mise en ordre du champ : en traitant capteur, apprentissage, simulation et données comme un système intégré plutôt que des briques isolées, la revue pointe le manque d'outils de simulation et de jeux de données standardisés qui freine le passage à l'échelle du tactile par rapport à la vision pure. Cette synthèse s'inscrit dans un effort plus large visant à combler le retard du tactile sur la vision et le langage, alors que les modèles vision-langage-action intègrent de plus en plus de modalités sensorielles au-delà de la caméra. Les VBTS, dérivées de capteurs à gel ou membrane filmés par une caméra interne, forment une famille technologique explorée par plusieurs laboratoires depuis plus d'une décennie, mais dont le développement restait fragmenté entre approches matérielles et pipelines logiciels disparates. En cartographiant les défis ouverts (généralisation entre capteurs, réalisme de la simulation, disponibilité des données d'entraînement), les auteurs visent une feuille de route pour la prochaine génération de mains et préhenseurs dotés du sens du toucher. Aucun déploiement industriel ni partenariat commercial n'est mentionné : il s'agit d'un travail académique destiné à orienter la recherche future, pas d'une annonce produit.

RecherchePaper
1 source
AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal
4arXiv cs.RO 

AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal

Des chercheurs présentent AdaReP, une méthode qui modifie la façon dont les systèmes de controle predictif (MPC) bases sur des modèles du monde neuronaux décident de recalculer leur plan d'action. Habituellement, ces systèmes replanifient a chaque pas de temps pour limiter l'accumulation d'erreurs de prédiction, ce qui génère une charge de calcul importante. AdaReP est présente comme un wrapper "sans entrainement" (training-free) qui s'ajoute au-dessus d'un modèle du monde et d'un planificateur déjà appris, sans les modifier. Le système ajuste en continu la tolérance de replanification en fonction de l'écart mesure entre la trajectoire actuelle et le plan mis en cache, et d'une estimation locale de la sensibilité de la dynamique. Les auteurs valident l'approche sur trois types de taches : planification dans l'espace image, contrôle dans l'espace latent, et manipulation robotique réelle. Sur une étude physique de 50 essais avec un bras manipulateur, AdaReP réduit de plus de 80% le nombre de requêtes au planificateur tout en maintenant des performances comparables a une replanification systématique. Le papier, référence arXiv:2606.23079v2, est une version mise a jour d'une publication antérieure. Cette réduction cible un goulot d'étranglement connu des architectures MPC couplées a des modèles du monde neuronaux : chaque appel au planificateur, souvent un réseau lourd, coute cher en temps et en énergie, ce qui limite le déploiement embarque en temps réel sur des robots ou systèmes autonomes. En montrant qu'un plan mis en cache peut être réutilisé la plupart du temps sans dégrader la performance, AdaReP fournit un argument concret contre l'hypothèse selon laquelle replanifier a chaque pas serait nécessaire pour rester robuste aux erreurs de prédiction. Pour les intégrateurs et équipes de recherche, l'intérêt pratique tient au fait que la méthode ne nécessite ni reentrainement du modèle du monde ni modification du planificateur existant, ce qui facilite son adoption sur des piles déjà en production. Le gain mesure sur un robot physique et non uniquement en simulation répond a une critique fréquente du secteur : l'écart entre démonstrations simulées et comportement réel. Le problème s'inscrit dans la lignée des travaux sur le controle predictif base sur l'apprentissage, ou l'essor des modèles du monde neuronaux pour la robotique rend la replanification systématique de plus en plus couteuse a mesure que ces modèles gagnent en taille. Les auteurs formalisent le compromis entre réutilisation de plan et dérivé de prédiction via un cadre de regret dynamique base sur la perturbation, montrant que la pénalité d'un plan périmé dépend de trois facteurs : la tolérance de réutilisation choisie, l'écart de prédiction accumule depuis la dernière replanification, et la sensibilité locale de la dynamique. Le papier ne cite ni implémentation industrielle ni partenaire commercial, et aucun acteur français ou européen n'est mentionne dans cette publication de recherche méthodologique. Les suites évoquées concernent l'extension a d'autres familles de planificateurs et de modèles du monde, la validation restant pour l'instant limitee aux trois bancs d'essai décrits.

RecherchePaper
1 source