Aller au contenu principal
Modèle de diffusion sensible aux correspondances pour la manipulation robotique en contact étroit (Robot-DIFT)
IA physiquearXiv cs.RO 

Modèle de diffusion sensible aux correspondances pour la manipulation robotique en contact étroit (Robot-DIFT)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La manipulation robotique échoue souvent dans les derniers millimètres : un bras peut identifier le bon objet mais rater l'alignement de pose ou le contact précis nécessaire à l'action. Robot-DIFT (arXiv:2602.11934) est une architecture d'encodeur visuel présentée dans un preprint académique pour combler ce manque, en exposant aux politiques de contrôle des features de correspondance sensibles aux variations fines de pose et de géométrie de contact. L'approche repose sur la distillation de variété (Manifold Distillation) : un modèle de diffusion bruit-conditionné sert de Teacher et transfère sa structure de représentation à un Student déterministe à passe unique, compatible avec le contrôle temps réel. Un réseau pyramidal spatial-sémantique (S2-FPN) fusionne ensuite les features multirésolution pour exposer à la politique à la fois contexte global et détail de contact fin. Évalué sur RoboCasa, LIBERO-10 et sur robots physiques, Robot-DIFT dépasse les encodeurs VLA, auto-supervisés, géométriques et diffusion directe sur les tâches sensibles au contact.

L'enjeu est structurant pour la robotique de précision et les intégrateurs industriels. Les encodeurs sémantiques qui équipent les VLA modernes, comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, reconnaissent les objets à l'échelle scène mais écrasent les indices de correspondance fine dont le contrôle en boucle fermée a besoin : c'est ce qui bloque l'assemblage de précision, l'insertion et la manipulation en milieu non structuré. Les modèles de diffusion encodent naturellement ces correspondances denses, mais leur stochasticité et leur latence élevée les rendaient inutilisables directement. Robot-DIFT propose une alternative : distiller ces features en un backbone déterministe temps réel sans perdre leur avantage de correspondance.

Les travaux sur les features de diffusion en vision 2D (DIFT, Diffusion Hyperfeatures) avaient posé les bases théoriques sans transposition robotique praticable. Robot-DIFT se positionne face aux encodeurs auto-supervisés établis comme R3M, MVP et VC-1, et aux représentations issues des VLA. Aucun acteur européen n'est cité dans ce travail, mais des entreprises comme Enchanted Tools ou Wandercraft, dont les cas d'usage requièrent une précision millimétrique, sont dans le périmètre d'application direct. Les prochaines étapes logiques incluent l'intégration dans des politiques diffusion (Diffusion Policy, ACT) et des évaluations sur benchmarks industriels plus représentatifs que les suites académiques actuelles.

Impact France/UE

Des entreprises françaises comme Enchanted Tools et Wandercraft, dont les cas d'usage requièrent une précision millimétrique, pourraient bénéficier de cette architecture si elle est intégrée dans des politiques de contrôle open-source diffusion ou ACT.

À lire aussi

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique
1arXiv cs.RO 

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique

Un article publié le 16 septembre 2026 sur arXiv (2609.16641) présente SAVLA (Symmetry-Aware Vision-Language-Action), un modèle de manipulation robotique conditionnée par le langage. Contrairement aux modèles vision-langage-action classiques, qui n'apprennent leur compétence spatiale qu'à partir des démonstrations et échouent hors de la plage de poses couverte par celles-ci, SAVLA gèle un backbone vision-langage pré-entraîné et y ajoute une tête d'action équivariante par flow-matching ainsi qu'un module de canonicalisation qui ramène les vues obliques dans un repère de référence tout en faisant tourner les conditions géométriques en conséquence. Testé sur le benchmark simulé LIBERO face au modèle GR00T N1.5 de NVIDIA, SAVLA améliore de 5,1 points le taux de réussite moyen sur les quatre suites du benchmark, et fait passer le taux de réussite sous rotation sur LIBERO-Goal de 41,5% à 90,4%. Le résultat s'attaque à une faiblesse connue des VLA : leur généralisation géométrique limitée, qui oblige aujourd'hui les intégrateurs à multiplier les démonstrations pour couvrir chaque orientation possible d'objet ou de caméra sur une ligne de production. En codant la symétrie directement dans l'architecture plutôt qu'en la laissant émerger des données, SAVLA vise une robustesse aux changements de pose avec moins d'exemples, un argument pertinent pour réduire le coût de collecte de données avant tout déploiement industriel de bras ou d'humanoïdes pilotés par VLA. Le gain reste toutefois mesuré en simulation sur un benchmark académique, pas sur un robot physique en usine, ce qui en fait une preuve de concept méthodologique plutôt qu'une solution prête à l'emploi. SAVLA s'inscrit dans la vague des modèles VLA devenus le paradigme dominant du contrôle robotique par langage naturel, aux côtés de familles comme GR00T de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure. Le choix de GR00T N1.5 comme référence positionne directement SAVLA face à l'un des modèles de fondation les plus utilisés du secteur. La méthode puise dans des travaux antérieurs sur l'apprentissage équivariant, une approche distincte du tout-données qui domine l'entraînement actuel des VLA. L'article ne mentionne ni partenariat industriel ni test sur robot physique, la validation en conditions réelles restant l'étape suivante logique pour ce type de travail académique.

IA physiqueActu
1 source
Facet-0 : un modèle fondation robotique pour la manipulation précise en contact riche
2arXiv cs.RO 

Facet-0 : un modèle fondation robotique pour la manipulation précise en contact riche

Un preprint publié sur arXiv (2609.01596) présente Facet-0, un modèle de fondation robotique pour l'assemblage de précision à tolérance sous-millimétrique, capable de prédire et d'évaluer les conséquences de contact de ses actions. Par flow matching, il génère chaque segment de mouvement avec le profil de force au poignet attendu, aligné sur l'historique des forces, la sémantique vision-langage et l'état cinématique, puis affine sa politique grâce à un critique distributionnel entraîné sur les déploiements réels et des récompenses ciblant les interactions de contact décisives. Entraîné sur ManuFacet-1K, un corpus de 1 000 heures synchronisées avec des données de force sur trois embodiments et plusieurs cellules de fabrication, le système atteint 82% de réussite moyenne sur cinq tâches d'assemblage informatique sous-millimétrique, contre 15% pour la meilleure référence, avec 0,5 mm de précision de placement et 50 ms de latence de commande. Ce résultat cible un angle mort des modèles vision-langage-action actuels, à l'aise pour saisir et déplacer des objets mais peu fiables dès qu'une tâche exige un contact fin, comme l'insertion de connecteurs ou le vissage. En traitant le retour de force comme signal d'apprentissage plutôt que garde-fou de sécurité, Facet-0 s'attaque à l'écart entre démonstrations impressionnantes et fiabilité réelle en ligne d'assemblage électronique, un enjeu concret pour les intégrateurs qui évaluent des bras génériques au-delà du tri ou de la manutention. Si l'écart revendiqué entre 82% et 15% se confirme dans des évaluations indépendantes, la modélisation explicite du contact pourrait devenir un prérequis pour les modèles de fondation visant l'industrie manufacturière exigeante. Facet-0 s'inscrit dans la vague des modèles de fondation robotique généralistes lancée par des systèmes comme Pi-0, GR00T N2 ou Helix, qui unifient perception, langage et contrôle moteur mais brillent surtout sur des tâches de manipulation grossière. En couplant une tête de prédiction de force à un critique dédié aux conséquences du contact, ses auteurs cherchent à combler ce manque sans abandonner l'architecture VLA générale. Le travail reste à ce stade une publication de recherche, sans annonce de déploiement industriel ni de mise à disposition du code ou du jeu de données ManuFacet-1K, les prochaines étapes attendues étant la revue par les pairs et des comparaisons indépendantes.

IA physiqueActu
1 source
FAWAM : modèles d'action du monde sensibles aux forces pour la manipulation en boucle fermée à contacts multiples
3arXiv cs.RO 

FAWAM : modèles d'action du monde sensibles aux forces pour la manipulation en boucle fermée à contacts multiples

Une équipe de chercheurs a publié sur arXiv (référence 2606.08555) FAWAM, un modèle d'action robotique intégrant les signaux de force à trois niveaux distincts du pipeline de manipulation : la perception, la prédiction et l'exécution en boucle fermée. Concrètement, le système encode des signaux force/couple sur six axes (6-DoF wrench) pour moduler la génération d'actions, prédit conjointement les actions futures et les efforts en bout d'effecteur afin de modéliser explicitement l'évolution du contact, puis utilise cette trajectoire de wrench prédite comme référence d'exécution pour corriger les actions en temps réel via un module de correction résiduelle. Sur plusieurs tâches de manipulation nécessitant des contacts riches -- vissage, insertion, assemblage par contrainte -- FAWAM affiche un taux de succès moyen supérieur de 36,25 % aux baselines purement visuelles et de 21,25 % aux baselines force-aware existantes. Il s'agit d'un preprint, sans déploiement industriel annoncé à ce stade. L'apport technique est notable pour les intégrateurs et les équipes R&D en manipulation apprise : la plupart des politiques modernes type Diffusion Policy, ACT ou des VLA (Vision-Language-Action models) traitent la force comme une modalité d'observation annexe, sans lui donner de rôle prédictif dans la dynamique future du contact. FAWAM repositionne le signal force comme variable de première classe dans l'architecture du modèle, ce qui permet une correction online des actions sans nécessiter de replanification complète. C'est précisément ce découplage entre prédiction de wrench et correction résiduelle qui explique le gain de performance : le robot anticipe l'effort attendu avant de l'observer, et ajuste en conséquence dès qu'un écart apparaît. Pour un COO ou un directeur technique envisageant des cellules d'assemblage automatisées, cela représente une réduction significative du gap simulation-réalité sur les tâches à contact fort. La manipulation en contact riche reste l'un des derniers verrous majeurs de la robotique industrielle polyvalente, là où les approches vision-seule échouent dès que les tolérances sont serrées ou les surfaces glissantes. Des travaux récents comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les politiques de manipulation de Google DeepMind intègrent parfois la proprioception mais rarement le couple d'axe complet en boucle de prédiction. FAWAM s'inscrit dans un courant émergent de world action models orientés contact, aux côtés de travaux comme RoboDex ou des approches de manipulation tactile de Berkeley et Carnegie Mellon. La prochaine étape logique serait une validation sur robot humanoïde ou sur bras industriel en environnement semi-structuré, ce que le preprint ne couvre pas encore.

IA physiqueOpinion
1 source
ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche
4arXiv cs.RO 

ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche

Publié en septembre 2026 sur arXiv sous la référence 2609.20980, ForeTac-VLA est un modèle vision-langage-action (VLA) qui ajoute une couche tactile prédictive pour la manipulation robotique en environnement riche en contacts physiques. Le système encode les observations tactiles récentes en représentations temporelles, les fusionne avec les caractéristiques vision-langage par attention croisée bidirectionnelle, puis un module de prévision fondé sur un transformeur anticipe l'état tactile sur plusieurs pas de temps futurs avant d'injecter ces prédictions dans le backbone VLA qui génère l'action. Un curriculum passant progressivement des données tactiles réelles aux données prédites stabilise l'entraînement lorsque les premières prévisions sont peu fiables. Sur quatre tâches de manipulation réelles à fort contact physique, ForeTac-VLA atteint un taux de réussite moyen de 95%, avec un gain de 36,25 points de pourcentage sur un VLA simplement affiné et de plus de 22 points sur les meilleures méthodes tactiles-VLA existantes, tout en maintenant ses performances en faible luminosité et en environnement visuellement encombré. Ce travail cible une faiblesse connue des modèles VLA, très dépendants de la vision, alors que des états physiques critiques comme le glissement d'un objet ou l'alignement lors d'une insertion ne sont pas observables visuellement. Les approches tactiles existantes se contentaient de réagir au contact déjà survenu; ForeTac-VLA propose de l'anticiper, ce qui change la nature du signal exploité par le modèle d'action. Pour les intégrateurs industriels, l'intérêt pratique tient à la robustesse démontrée en conditions dégradées, faible éclairage ou encombrement visuel, des situations fréquentes en usine ou en entrepôt où la vision seule échoue souvent. Si ces écarts se confirment au-delà des quatre tâches testées, cela conforterait l'idée qu'une fusion tactile prédictive, plutôt que purement réactive, est une piste sérieuse pour fiabiliser la manipulation en contact riche, un point faible récurrent des démonstrations VLA actuelles. ForeTac-VLA s'inscrit dans la lignée des modèles VLA génériques qui unifient perception, langage et contrôle moteur, et dans la sous-famille plus récente des VLA tactiles qui ajoutent un capteur de contact au pipeline vision-langage. Il se positionne explicitement contre ces baselines tactiles-VLA de l'état de l'art, qu'il dépasse de plus de 22 points, ainsi que contre un VLA classique simplement affiné sur les mêmes tâches. La publication reste un preprint arXiv, sans nom d'entreprise ni calendrier de déploiement industriel associé: il s'agit d'un résultat de recherche évalué sur quatre tâches choisies par les auteurs et illustré par des vidéos sélectionnées sur le site du projet, pas d'un produit commercialisé. Les suites attendues sont l'élargissement à davantage de tâches et de plateformes robotiques, ainsi qu'une évaluation indépendante confirmant que l'écart de performance tient face à des scénarios plus variés que le banc d'essai initial.

IA physiqueOpinion
1 source