Aller au contenu principal
IA physiquearXiv cs.RO 

HapticWAM : distiller le toucher imaginé dans un modèle monde-action sans détection tactile à l'inférence

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article déposé sur arXiv (référence 2609.23888v1) présente HapticWAM, un modèle combinant perception et action (« world-action model ») pour la manipulation robotique, testé sur trois tâches réelles de prise et dépose impliquant des contacts physiques délicats. Sa version « élève » atteint un taux de réussite moyen de 77% par tâche, soit 41 essais réussis sur 50 (82% en cumulé sur l'ensemble des tâches), avec un pic à 95% sur la tâche la plus favorable, devançant à la fois le modèle « enseignant » dont elle dérive et les configurations de référence testées. Sa particularité : elle agit sans aucun capteur tactile physique au moment de l'exécution, alors que son apprentissage s'appuie sur des données tactiles riches (images de gel déformable, déformation, cisaillement, forces distribuées, couple résultant) issues de capteurs optiques de contact.

Ces capteurs tactiles optiques, coûteux et fragiles, restent difficiles à généraliser sur des pinces industrielles ou des mains humanoïdes déployées en volume, ce qui forçait jusqu'ici un choix entre finesse du toucher et robustesse mécanique. HapticWAM contourne ce compromis par une distillation enseignant-élève : le modèle apprend à anticiper les futurs événements de contact (géométrie, glissement, effort) plutôt qu'à seulement reproduire des pixels tactiles, et conserve cette capacité de prédiction pour guider ses actions même sans capteur au déploiement. Pour les intégrateurs et décideurs de la robotique industrielle, cela suggère qu'un savoir-faire tactile appris en laboratoire peut se transférer vers du matériel moins instrumenté, donc moins coûteux, sans perdre la capacité à manipuler des objets fragiles ou glissants, un point de friction connu entre démonstrations et déploiements réels.

Le travail reste un article de recherche publié sur arXiv, et non un produit commercial : les résultats se limitent à trois tâches et 50 essais par tâche en environnement contrôlé, sans partenaire industriel annoncé ni calendrier de transfert vers un système de production. Il s'inscrit dans la lignée des capteurs tactiles optiques désormais associés aux modèles de manipulation fine, mais s'en distingue en structurant explicitement la prédiction du contact au sein du même modèle génératif que la politique d'action, plutôt qu'en la traitant comme un simple signal auxiliaire. La contribution reste pour l'instant une preuve de concept technique destinée à la communauté de recherche en apprentissage robotique.

À lire aussi

HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans détection tactile à l'inférence
1arXiv cs.RO 

HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans détection tactile à l'inférence

HapticVLA, décrit dans un article arXiv (2603.15257v2, republié) sans affiliation académique précisée, propose une architecture vision-langage-action capable de manipulation en contact riche sans capteur tactile embarqué au moment de l'inférence. La méthode se déroule en deux étapes couplées. D'abord, un module baptisé SA-RWFM (Safety-Aware Reward-Weighted Flow Matching) entraîne un expert d'action par flow matching à partir de récompenses tactiles précalculées, qui pénalisent une force de préhension excessive et des trajectoires de saisie sous-optimales. Ensuite, la Distillation Tactile (TD) transfère cette capacité vers un VLA classique : un token tactile compact, issu du modèle SA-RWFM, sert de cible d'apprentissage à un VLA étudiant qui doit le prédire uniquement à partir de la vision et de l'état du robot. Résultat annoncé sur des expériences réelles : un taux de réussite moyen de 86,7 %, supérieur à celui de VLA de référence, y compris des versions disposant d'un vrai retour tactile pendant l'inférence. L'intérêt pratique tient au coût et à la reproductibilité. Les capteurs tactiles dédiés renchérissent le matériel et compliquent le transfert d'un comportement appris d'une plateforme robotique à une autre. Si l'approche tient sur d'autres tâches et d'autres bras, elle affaiblirait une hypothèse répandue dans le secteur, celle qu'un retour haptique direct est indispensable pour un contrôle fin de la force de préhension sur des objets fragiles ou déformables. Pour les intégrateurs industriels, cela ouvrirait la voie à des lignes de préhension contact-riche moins instrumentées, donc moins chères à déployer et à maintenir. Il s'agit toutefois d'un résultat de recherche publié sur arXiv, pas d'un produit commercialisé ni d'un déploiement industriel annoncé. Le papier s'inscrit dans la vague actuelle des modèles VLA généralistes pour la manipulation, aux côtés de GR00T N2 de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure, qui cherchent tous à réduire la dépendance à des capteurs spécialisés tout en préservant une manipulation fine. Aucune date de disponibilité ni partenariat industriel n'est mentionné dans l'abstract, la validation reste donc circonscrite au cadre expérimental décrit.

IA physiqueActu
1 source
Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence
2arXiv cs.RO 

Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence

Des chercheurs ont publié fin juin 2026 sur arXiv une méthode appelée MoRE (Mode Redirection) pour corriger un défaut structurel de l'apprentissage par imitation robotique (behavior cloning) : les politiques entraînées sur des jeux de démonstrations hétérogènes capturent simultanément des comportements désirés et indésirables, y compris dangereux. L'exemple retenu par les auteurs est parlant : un robot entraîné à des transferts d'objets peut apprendre à passer un couteau lame en premier. MoRE introduit une courte étape d'«uncloning» qui distille un signal de redirection, généré par un classificateur de modes temporaire, directement dans les poids de la politique. Une loss de rétention préserve la compétence sur les modes corrects. Sur huit tâches simulées et réelles, MoRE améliore le taux de succès moyen de 44 points de pourcentage par rapport à la politique multi-modes initiale, et approche les performances du réentraînement sur données filtrées, considéré comme la référence. La méthode est compatible avec Diffusion Policy et Pi0.5, le modèle VLA (Vision-Language-Action) de Physical Intelligence. L'intérêt industriel de MoRE tient à deux absences : pas d'accès requis aux démonstrations originales, et aucun surcoût à l'inférence. Les solutions existantes butaient sur l'une ou l'autre contrainte : la curation de données impose un réentraînement complet depuis les données sources ; le steering à l'inférence (guidage externe durant l'exécution) ajoute une latence incompatible avec les cycles robotiques en temps réel. MoRE contourne les deux en modifiant les poids une seule fois, en aval de l'entraînement initial. Pour un intégrateur ou un COO industriel, c'est une piste crédible pour corriger une politique déjà déployée sans repartir de zéro. La compatibilité confirmée avec Pi0.5 est un signal fort : si la méthode tient sur un VLA large-scale, elle couvre un spectre large de déploiements réels. L'apprentissage par imitation reste l'une des méthodes d'entraînement les plus accessibles, mais sa sensibilité aux données hétérogènes est un problème structurel documenté depuis des années. Les VLA récents comme Pi0 et Pi0.5 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA) ont étendu les capacités générales des politiques sans régler ce problème de modes indésirables. MoRE s'inscrit dans un courant émergent de post-training alignment appliqué à la robotique, analogue aux techniques DPO/RLHF utilisées pour aligner les LLM après préentraînement. Les approches concurrentes incluent le filtrage par classificateur externe et la curation de données assistée par modèle. Ce travail est à ce stade un preprint de recherche, sans partenariat industriel annoncé ni timeline de commercialisation ; aucun acteur européen n'est impliqué parmi les auteurs identifiés.

💬 Le robot qui apprend à passer un couteau lame en premier, c'est pas un bug de code, c'est un bug de données, et les meilleures politiques multi-modes n'y échappent pas. MoRE fait pour la robotique ce que DPO a fait pour les LLM : corriger les modes indésirables directement dans les poids, après coup, sans données sources et sans latence ajoutée. Bon, c'est un preprint pour l'instant, mais la compatibilité confirmée avec Pi0.5 dit quelque chose de sérieux sur la portée de la méthode.

IA physiqueOpinion
1 source
Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche
3arXiv cs.RO 

Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche

Des chercheurs ont présenté Agile-WAM, un "world action model" (WAM) tactile pour le contrôle robotique en manipulation à contact riche, détaillé dans un preprint arXiv (2609.20761) et sur une page de projet dédiée portant le nom de code TARO. Le modèle encode vision et tactile dans un espace latent partagé, exploité par un processus de flow-matching direct vision-tactile-vers-action qui génère à la fois des séquences d'actions et les latents visuels/tactiles futurs. Sa particularité est une prédiction multimodale à horizons multiples : supervision visuelle à décalage temporel large, les images voisines étant peu différentes, mais prédiction tactile image par image pour capter les changements brusques au moment du contact. Testé sur neuf tâches simulées et cinq tâches réelles de manipulation, Agile-WAM obtient un gain relatif de 29,4% en taux de succès sur les cinq essais réels, pour une latence d'inférence de 11,9 millisecondes. Ce résultat répond à une limite concrète des WAM tactiles existants, qui s'appuient souvent sur de lourds backbones génératifs pré-entraînés au détriment de la latence et du déploiement temps réel. En affichant une inférence à un chiffre de millisecondes tout en dépassant sa meilleure baseline, Agile-WAM suggère qu'un contrôle précis et à haute fréquence, nécessaire dès que le contact évolue plus vite que l'image, ne requiert pas forcément les architectures massives des VLA généralistes type Pi-0 ou GR00T N2. Pour les équipes de recherche et les intégrateurs travaillant sur l'insertion de pièces, l'assemblage ou la préhension fine, l'apport principal est méthodologique : traiter vision et tactile à des échelles temporelles distinctes améliore à la fois précision et efficacité, plutôt qu'une simple fusion multimodale. Le travail s'inscrit dans la lignée des world models robotiques, qui étendent les politiques visuomotrices classiques en apprenant conjointement la dynamique du monde et l'action à produire, une piste déjà suivie par des VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), rarement avec un signal tactile aussi fin. Les auteurs positionnent Agile-WAM contre des WAM tactiles antérieurs jugés trop coûteux en calcul, sans les nommer précisément dans le résumé. Il s'agit à ce stade d'un preprint de recherche non encore revu par les pairs, appuyé par des démonstrations en simulation et cinq essais réels, sans partenaire industriel ni calendrier de déploiement annoncé.

IA physiqueOpinion
1 source
C³ache : accélérer les modèles monde-action par cache de blocs inter-inférences
4arXiv cs.RO 

C³ache : accélérer les modèles monde-action par cache de blocs inter-inférences

Des chercheurs ont publié sur arXiv en juin 2026 (référence 2606.08962) une méthode d'accélération appelée C³ache (Cross Inference Chunk Cache), ciblant les World Action Models (WAM), une classe de modèles robotiques qui génèrent des politiques d'action en modélisant la vidéo plutôt qu'en s'appuyant uniquement sur des démonstrations étiquetées. Contrairement aux politiques VLA (Vision-Language-Action) classiques, les WAM s'entraînent sur de la vidéo non labellisée abondante, ce qui améliore leur généralisation à de nouveaux mouvements et environnements, mais au prix d'un coût d'inférence élevé. Pour exécuter une tâche, un WAM enchaîne plusieurs blocs d'inférence successifs (chunks), chacun nécessitant un processus de débruitage coûteux. Les méthodes existantes réduisent ce coût en mettant en cache les calculs au sein d'un même chunk, mais ignorent une source de redondance plus large : la forte corrélation entre les résidus calculés à un même step de débruitage, d'un chunk au suivant, lorsque le robot exécute un comportement fluide. C³ache exploite cette corrélation en réutilisant ces résidus entre chunks consécutifs, sans aucun réentraînement du modèle. Les expériences sur benchmarks avec un backbone Fast-WAM montrent un gain allant jusqu'à 2,5× sur le temps d'inférence total mesuré en wall-clock, avec une dégradation négligeable du taux de succès aux tâches. Ce résultat a une portée concrète pour les équipes cherchant à déployer des robots autonomes à coût raisonnable. Le principal frein à l'adoption industrielle des WAM n'est pas la qualité des politiques générées, mais leur latence d'inférence : réduire ce coût par 2,5× sans modifier les poids du modèle constitue un levier de déploiement immédiat, sans pipeline de réentraînement ni risque de régression. La méthode valide aussi une hypothèse structurelle utile : les trajectoires robotiques lisses produisent des représentations internes stables d'un pas à l'autre, ce qui ouvre la voie à des stratégies de cache plus agressives au niveau système. Pour les intégrateurs et les équipes MLOps, C³ache se présente comme un composant directement intégrable à tout modèle WAM existant. Les WAM s'inscrivent dans une tendance initiée par des modèles comme pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui exploitent tous deux un objectif de génération vidéo pour apprendre à partir de données non étiquetées. La course à la réduction des coûts d'inférence pour ces architectures est intense : Google, Physical Intelligence et plusieurs laboratoires académiques explorent en parallèle la distillation, la quantification et le cache intra-chunk. C³ache se positionne comme une solution orthogonale et combinable avec ces approches. Les auteurs soulignent toutefois une limite importante : la corrélation inter-chunks supposée ne tient que pour des comportements robotiques fluides, et des mouvements brusques ou des transitions rapides pourraient dégrader les performances. Il s'agit pour l'instant d'un preprint non relu par les pairs, et les évaluations restent confinées à des benchmarks simulés ; les prochaines étapes naturelles incluent la validation sur robots physiques et l'intégration dans des pipelines embarqués à contraintes de latence strictes.

IA physiqueActu
1 source