Aller au contenu principal
RecherchearXiv cs.RO 

Preuves d'interaction ancrées sur l'instance : ancrer les plans du robot dans les gestes de désignation et de manipulation humains

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent l'« instance-anchored interaction évidence » (IAE), une méthode qui permet à un robot d'agir sur ce qu'une personne a montré plutôt que dit : quel carton, parmi plusieurs identiques, a été désigné du doigt, ou quelle boîte a été manipulée. Le défaut à corriger est que le plan s'exécute à partir de la scène finale, alors que l'indice survient plus tôt, parfois sur des objets qui ont bougé depuis. L'IAE associe chaque objet de la scène finale à un identifiant public, conserve son identité tout au long de la vidéo par propagation arrière de masques, puis décrit chaque image par la géométrie entre mains, avant-bras et instances. Un réseau d'évidence, entraîné uniquement à partir des résultats des tâches, note les instances. Pour le pointage, un programme dynamique contraint par une grammaire, entraîné avec une perte structurée, décode des programmes objet-destination. Des programmes symboliques, sans apprentissage, traitent la désambiguïsation des références et les tâches épisodiques. Sur 1 255 requêtes du benchmark WatchAct, évaluées par exécution symbolique, l'IAE atteint 64,2 % de succès de plan sur les tâches à intention implicite, contre 27,5 % pour un modèle vision-langage de 32 milliards de paramètres (succès strict : 49,7 % contre 15,4 %). Sur la restauration, l'inversion et l'imitation, sans entraînement spécifique, elle obtient 46,4 % contre 27,0 %.

Ces chiffres montrent que l'écart ne vient pas d'une meilleure perception brute, mais de la manière dont l'information est structurée. Les auteurs ont testé des contrôles avec les mêmes surcouches de perception, les mêmes 32 images, un suivi vers l'avant, ou un modèle de relations entraîné sur les mêmes étiquettes. Aucun n'explique le gain. Lorsque le même modèle de langage reçoit l'évidence de l'IAE sous forme de texte, avec sa signification expliquée, il monte à 57,4 %. L'essentiel du bénéfice vient donc de l'ancrage des preuves sur les instances, et les programmes explicites ajoutent 6,8 points à un coût bien moindre. Pour les intégrateurs et les équipes qui déploient des robots d'assistance en logistique ou en collaboration homme-robot, c'est un argument en faveur d'architectures hybrides (perception structurée plus exécution symbolique) plutôt que d'un grand modèle généraliste alimenté par des images brutes. Le pointage reste toutefois le cas le plus difficile, avec seulement 16,9 % de succès strict, ce qui rend la méthode inadaptée à un déploiement sans supervision pour ce type d'interaction. Il s'agit en outre d'un résultat de benchmark en laboratoire, et non d'un déploiement réel.

Ce travail s'inscrit dans l'effort de rendre les modèles vision-langage-action et les planificateurs fondés sur des VLM capables de comprendre l'intention humaine dans des scènes encombrées, où l'identité des objets se perd quand ils sont déplacés. Les modèles généralistes de 32 milliards de paramètres restent la référence comparée ici, et leur faiblesse sur les objets identiques est mise en évidence. La publication est un preprint arXiv (v1), non évalué par des pairs, et le code est disponible sur GitHub (WeiZhou96/iae-watchact). Aucun calendrier de pilote industriel n'est annoncé. Les prochaines étapes probables concernent l'amélioration du pointage et la validation sur des robots réels, au-delà de l'évaluation par exécution symbolique.

À lire aussi

UMI-Bridge : alignement latent ancré sur l'action entre données humaines et robotiques de manipulation
1arXiv cs.RO 

UMI-Bridge : alignement latent ancré sur l'action entre données humaines et robotiques de manipulation

Une équipe de recherche publie sur arXiv (2609.18232, septembre 2026) UMI-Bridge, une méthode pour aligner les représentations apprises à partir de données de manipulation humaine, notamment des vidéos égocentriques et des démonstrations captées avec l'interface UMI (Universal Manipulation Interface, un dispositif de préhension portatif), avec celles issues de véritables robots. Le système utilise UMI comme domaine intermédiaire pour faire correspondre les représentations selon l'équivalence du mouvement d'action plutôt que la simple similarité visuelle, en s'appuyant sur la supervision d'action de UMI pour ancrer la représentation latente au mouvement de l'effecteur terminal et au comportement de la pince. Un modèle d'action latente à double vue (LAM) est d'abord entraîné sur des données humaines sans aucune démonstration robotique, puis son module poignet et son modèle de dynamique sont gelés pour régulariser le post-entraînement d'un modèle vision-langage-action (VLA) sur des données mixtes UMI et robot. Sur trois tâches réelles, UMI-Bridge atteint un taux de réussite moyen de 91,7%, contre 73,3% pour une méthode de co-entraînement naïf utilisant les mêmes données. Sur deux tâches testant l'efficacité en données, la méthode dépasse une base de référence entraînée uniquement sur robot avec l'intégralité des données, tout en n'utilisant que 25% des démonstrations robotiques complétées par des données UMI. Elle atteint aussi 85% et 90% de réussite sur deux tâches apprises uniquement à partir de démonstrations UMI, sans aucune démonstration robotique spécifique à la tâche. Ce travail s'inscrit dans un enjeu central de l'apprentissage robotique actuel: la rareté et le coût des démonstrations réelles collectées directement sur robot. En démontrant qu'un transfert efficace est possible depuis des données humaines bon marché à collecter vers des politiques robotiques opérationnelles, UMI-Bridge apporte un argument concret en faveur de l'hypothèse selon laquelle l'apprentissage par action plutôt que par apparence visuelle permet de réduire la dépendance aux données robot, un point de friction connu des approches VLA à grande échelle comme Pi-0 ou GR00T N2. Le papier s'appuie sur UMI, un outil de collecte de démonstrations déjà largement adopté dans la recherche en manipulation robotique pour sa facilité de déploiement sans robot physique. La contribution reste à ce stade un résultat de recherche évalué sur un nombre restreint de tâches réelles, sans indication d'intégration dans un produit commercial ni de calendrier de déploiement industriel annoncé.

RechercheActu
1 source
PhyVisGen : génération de données de manipulation robotique fidèles sur les plans physique et visuel
2arXiv cs.RO 

PhyVisGen : génération de données de manipulation robotique fidèles sur les plans physique et visuel

Des chercheurs présentent PhyVisGen, un framework de génération de données synthétiques pour l'apprentissage de politiques de manipulation robotique, décrit dans un article publié sur arXiv (référence 2609.25653v1). L'objectif est de produire à grande échelle des démonstrations de manipulation en simulation, pour éviter la collecte coûteuse et difficile à industrialiser de données sur robot réel. Sur le plan physique, PhyVisGen introduit une méthode de couplage bras-gripper fondée sur l'Incremental Potential Contact (IPC), un algorithme de simulation de contact qui modélise fidèlement les interactions souples tout au long d'une trajectoire complète, un point faible classique des simulateurs rigides pour les préhenseurs souples. Sur le plan visuel, le système combine reconstruction de scènes réelles et path tracing en temps réel pour produire des observations photoréalistes conservant l'apparence exacte de l'environnement capturé. Résultat mis en avant: des politiques entraînées exclusivement sur ces données synthétiques atteignent entre 65% et 95% de réussite sur cinq tâches de manipulation exécutées par un robot réel, sans aucune démonstration réelle ni réglage fin de la politique. Le fossé entre simulation et réalité reste l'un des principaux freins à l'entraînement de politiques visuomotrices à grande échelle, notamment pour les architectures de type VLA qui exigent des volumes massifs de démonstrations. En traitant simultanément la fidélité physique du contact souple et le réalisme visuel du rendu, PhyVisGen s'attaque à deux sources d'écart simulation-réel habituellement gérées séparément dans la littérature. Pour des laboratoires ou des équipes produit cherchant à réduire leur dépendance à la téléopération humaine pour collecter des données, ce résultat suggère qu'une simulation suffisamment fidèle pourrait remplacer une partie de la collecte réelle, au moins pour des tâches de préhension avec grippers souples. La fourchette de succès annoncée reste toutefois large et repose sur seulement cinq tâches: sans détails sur les conditions d'essai ni sur la généralisation à des objets ou environnements non vus, ce chiffre doit être lu comme une démonstration de faisabilité en laboratoire plutôt qu'une preuve de robustesse à l'échelle industrielle. Cette approche s'inscrit dans une lignée de travaux cherchant à combler l'écart sim-to-real par la fidélité de simulation plutôt que par la seule randomisation de domaine, technique plus ancienne mais moins précise. Les moteurs physiques classiques peinent en général à représenter les contacts souples et les déformations continues, ce qui limite leur usage pour les grippers non rigides de plus en plus répandus en manipulation fine. Côté rendu, le recours au path tracing temps réel rejoint une tendance plus large des méthodes de reconstruction photoréaliste, comparables aux techniques de type NeRF ou Gaussian splatting, désormais utilisées pour générer des données d'entraînement visuellement crédibles. L'article ne précise ni affiliation institutionnelle, ni disponibilité du code, ni calendrier de déploiement industriel: il s'agit à ce stade d'une contribution de recherche méthodologique, sans partenaire robotique ni produit annoncé, dont la portée dépendra de sa reproduction sur d'autres plateformes, grippers et tâches.

RecherchePaper
1 source
Manipulation robotique guidée par correspondance : interactions rigide-déformable clairsemées et denses
3arXiv cs.RO 

Manipulation robotique guidée par correspondance : interactions rigide-déformable clairsemées et denses

Des chercheurs publient sur arXiv (référence 2608.01083v1, soumission nouvelle) une méthode de représentation pour la manipulation robotique dans les interactions entre objets rigides et déformables, comme accrocher un vêtement sur un cintre ou habiller une personne. L'équipe propose une représentation hybride qui combine des points clés épars et des correspondances denses. Les points clés sont générés à partir de la structure globale des objets rigides et déformables en jeu, puis filtrés selon leurs points de contact locaux au moment de l'interaction. Comme ces points épars restent difficiles à suivre pendant le geste, en raison de la dynamique en haute dimension des objets déformables, les auteurs ajoutent des correspondances denses calculées sur la surface de l'objet déformable, ce qui permet un suivi précis tout au long de la manipulation. Le papier annonce des expériences poussées validant l'efficacité et la généralité de la méthode, sans fournir à ce stade de métriques chiffrées publiques (taux de réussite, temps d'exécution) ni préciser la plateforme robotique testée. L'enjeu dépasse le cas du linge : la manipulation combinant rigide et déformable est un point de blocage classique pour la robotique domestique et assistive, car les représentations habituelles comme les poses 6D ou des points structurels génériques ne capturent pas assez d'information spécifique à la tâche pour gérer les contacts multiples et les déformations complexes. En combinant information riche et localisée avec un suivi robuste aux changements de forme, l'approche vise le transfert en un coup, c'est-à-dire l'apprentissage de nouvelles tâches à partir d'un nombre minimal de démonstrations, un critère central pour rendre les robots d'assistance déployables sans réentraînement massif à chaque nouvel objet ou scénario. Ce travail s'inscrit dans un courant de recherche actif autour des représentations par correspondance et par points clés en apprentissage robotique, où plusieurs équipes cherchent à dépasser les limites des approches orientées objet pour les tâches impliquant du textile ou du contact humain-robot, comme l'habillage assisté. L'abstract ne mentionne ni acteur industriel ni calendrier de déploiement : il s'agit d'une contribution méthodologique en amont, dont la portée pratique dépendra des benchmarks détaillés et d'une éventuelle reproduction sur plateforme physique dans les versions complètes de l'article.

RecherchePaper
1 source
Manipulation robotique dextérique à partir de démonstrations humaines : retargeting ancré sur les contacts et apprentissage de politique résiduelle
4arXiv cs.RO 

Manipulation robotique dextérique à partir de démonstrations humaines : retargeting ancré sur les contacts et apprentissage de politique résiduelle

Un pipeline en trois étapes permet désormais d'entraîner des politiques de manipulation dextre pour robots à partir de simples enregistrements de capture de mouvement humain, sans aucune donnée d'entraînement collectée sur un robot réel, selon un article publié sur arXiv (2609.24093v1). La méthode combine un raffinement physique via une main MANO simulée pour reconstruire les contacts et les forces absents des captures humaines classiques, un retargeting ancré sur la structure de contact plutôt que sur le mouvement articulaire, et une politique résiduelle d'apprentissage par renforcement entraînée une seule fois pour corriger la faisabilité dynamique. Les résultats chiffrés sont substantiels : sur 25 454 trajectoires à une main, le taux de succès passe de 7,3% à 59,3% après application du pipeline ; sur 25 tâches bimanuelles, il grimpe de 16,0% à 62,4%. Le même jeu de données humain, transféré vers quatre mains robotiques de morphologies différentes, gagne 62,4 points de succès en moyenne. Quatre tâches bimanuelles impliquant des contacts complexes ont aussi été exécutées sur du matériel physique réel, toujours sans entraînement préalable sur robot. Pour l'industrie robotique, ce travail s'attaque frontalement au goulot d'étranglement le plus coûteux de la manipulation dextre : les données de téléopération réelle, jugées indispensables mais lentes et chères à collecter à l'échelle. En montrant qu'une seule politique résiduelle générique suffit à rendre exploitables des captures de mouvement humain bon marché et déjà disponibles en masse, l'étude suggère que le sim-to-real pour les mains multi-doigts pourrait devenir moins dépendant de pipelines spécifiques à chaque tâche, une promesse jusqu'ici tenue surtout par les modèles VLA génériques (GR00T, Pi-0, Helix) sur des tâches de préhension plus grossières. Le transfert réussi vers quatre morphologies de main différentes renforce l'idée que la structure de contact, plutôt que la cinématique brute, est la représentation qui généralise. Le constat de départ est que les sources de démonstrations humaines scalables, vidéos ou gants de capture de mouvement, ne capturent jamais les forces de contact qui déterminent la réussite d'une prise. Les approches concurrentes reposaient jusqu'ici sur du retargeting cinématique direct ou de l'apprentissage par renforcement spécifique à chaque tâche en simulation. Le papier reste à ce stade un preprint de recherche, sans partenaire industriel ni déploiement commercial annoncé ; les suites attendues concernent l'extension à davantage de morphologies de mains et de tâches réelles.

RecherchePaper
1 source