Aller au contenu principal
AmpAttention, une attention inspirée des amplificateurs différentiels pour la manipulation robotique multi-vue
RecherchearXiv cs.RO 

AmpAttention, une attention inspirée des amplificateurs différentiels pour la manipulation robotique multi-vue

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs anonymes, dans une soumission actuellement en évaluation par les pairs sur arXiv (2607.02845), propose AmpAttention, un mécanisme d'attention pour la manipulation robotique multi-vues inspiré des amplificateurs différentiels utilisés en électronique analogique. Intégré dans un modèle baptisé RVAF, ce mécanisme combine attention intra-vue et inter-vue guidée par la tâche pour filtrer le bruit visuel issu des occlusions, de la redondance entre caméras et de la dépendance au point de vue. Sur le benchmark de simulation RLBench, qui couvre 18 tâches et 249 variations, RVAF affiche le meilleur taux de réussite moyen parmi les méthodes comparées, tout en réduisant le temps d'entraînement de 33,3%. En conditions réelles, le système a démontré une précision suffisante pour saisir une fléchette et l'insérer au centre d'une cible de dart, une tâche qui exige un alignement fin entre perception et contrôle moteur. Une variante étendue, RVAF++, intègre l'encodeur d'images SAM2, développé par Meta, et atteint un taux de réussite de 91% sur la tâche d'insertion de goupille, l'une des plus exigeantes en précision du benchmark.

L'enjeu dépasse la simple performance sur un benchmark académique. Les approches de manipulation multi-vues par attention souffrent d'un problème connu de dérive attentionnelle: le modèle se laisse distraire par des signaux visuels redondants ou occultés selon l'angle de caméra, ce qui dégrade la fiabilité en conditions réelles, précisément là où les démonstrations en laboratoire échouent souvent à se traduire en performance industrielle. En empruntant le principe du rejet de bruit en mode commun des amplificateurs différentiels, plutôt qu'en ajoutant des couches d'attention supplémentaires, AmpAttention propose une piste architecturale peu coûteuse en calcul pour améliorer le rapport signal/bruit perceptif, un facteur clé pour les intégrateurs qui cherchent à fiabiliser des tâches de précision comme l'insertion ou l'assemblage sans multiplier les capteurs ou le temps d'entraînement.

RVAF s'inscrit dans la lignée des modèles vision-langage-action et des architectures de manipulation basées sur l'attention qui ont rapidement progressé ces deux dernières années, aux côtés de travaux comme GR00T N2 ou Helix. La comparaison directe avec SAM2, encodeur d'images publié par Meta et intégré dans RVAF++, illustre comment les briques de vision généraliste des grands laboratoires irriguent désormais la recherche en robotique spécialisée. Publié anonymement dans le cadre d'une évaluation par les pairs, avec du matériel qualitatif complémentaire disponible sur un site de projet temporaire, l'article ne précise ni application industrielle concrète ni calendrier de transfert vers des plateformes commerciales. Il s'ajoute néanmoins à une liste croissante de travaux qui cherchent à résoudre le problème du transfert simulation-vers-réel sur des tâches de haute précision.

À lire aussi

Apprentissage d'une variété d'actions par priors latents multi-vues pour la manipulation robotique
1arXiv cs.RO 

Apprentissage d'une variété d'actions par priors latents multi-vues pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (preprint 2605.11832, mai 2026) une méthode adressant deux limites structurelles des modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique : l'ambiguïté de profondeur issue des capteurs monoculaires, et l'inefficacité de l'apprentissage d'actions par régression classique. La première contribution, le G3T (Geometry-Guided Gated Transformer), exploite un modèle de diffusion multi-vues pré-entraîné pour synthétiser des représentations latentes de nouvelles perspectives, alignées sous contrainte géométrique 3D, avec filtrage adaptatif du bruit d'occlusion. La seconde, l'Action Manifold Learning (AML), remplace la régression sur des cibles non structurées, bruit ou champ de vitesse, approches dominantes depuis Diffusion Policy (2023), par une prédiction directe sur la variété des actions valides. Testée sur les benchmarks LIBERO et RoboTwin 2.0, ainsi que sur des tâches en robot réel, la méthode affiche des taux de succès supérieurs aux baselines état de l'art actuelles. L'enjeu est précis : la quasi-totalité des déploiements industriels de manipulateurs n'embarquent qu'une caméra RGB, sans LiDAR ni stéréovision. Sans profondeur fiable, les VLA peinent à estimer distances et tailles relatives, ce qui dégrade directement la précision de préhension en conditions réelles. Le G3T propose de contourner ce manque sans ajout matériel, maintenant les contraintes hardware à un niveau réaliste pour l'intégration. L'AML, de son côté, questionne un paradigme issu des travaux sur la diffusion en robotique : prédire directement sur la variété d'actions valides pourrait réduire la variance d'entraînement et accélérer la convergence. Les résultats semblent valider l'hypothèse, bien qu'un preprint reste à soumettre à peer-review pour être pleinement crédité, les métriques annoncées sont issues des propres expériences des auteurs, sans reproductions indépendantes publiées à ce stade. Ce travail s'inscrit dans la course aux VLA généralistes ouverte par RT-2 (Google DeepMind, 2023), avec pour concurrents directs OpenVLA (UC Berkeley), π0 de Physical Intelligence et GR00T N2 de NVIDIA. RoboTwin 2.0, l'un des benchmarks retenus, cible spécifiquement la manipulation bi-manuelle de précision, parmi les scénarios les plus exigeants du domaine. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; l'impact concret dépendra des reproductions indépendantes et d'une éventuelle intégration dans des frameworks ouverts comme LeRobot (Hugging Face). Le code et la page projet sont annoncés disponibles publiquement.

RechercheOpinion
1 source
DUET-DINO : modélisation simultanée du monde multi-vue pour la planification latente en manipulation robotique
2arXiv cs.RO 

DUET-DINO : modélisation simultanée du monde multi-vue pour la planification latente en manipulation robotique

Des chercheurs affiliés au laboratoire UTN-AIR publient DUET-DINO, un modèle de monde latent conditionné par l'action, décrit dans une prépublication arXiv du 10 septembre 2026 (arXiv:2609.10506). Le système apprend simultanément à partir de deux flux vidéo, une caméra statique de scène et une caméra montée sur le poignet du bras robotique, en les faisant se conditionner mutuellement, pour prédire les conséquences visuelles d'une action sur l'ensemble des 7 degrés de liberté (DOF) d'un effecteur terminal. Entraîné à partir de zéro sur les jeux de données DROID et RoboArena, il atteint 92% de réussite sur des tâches d'atteinte spatiale (reach), 72,5% sur des tâches d'atteinte avec orientation fine (angled-reach) et 60,0% sur des tâches de préhension et levage d'objet (grasp-and-lift), surpassant des versions à vue unique ou à double vue non couplée. Les auteurs comparent aussi deux briques de vision : les prédictions du modèle V-JEPA 2 sur la vue poignet sous-estiment la dynamique visuelle induite par des actions fines, tandis que DINOv3 capture mieux ces changements et améliore la planification en aval. Le code et les poids seront publiés en open source, mais ne le sont pas encore à ce stade. L'enjeu technique visé est concret : les modèles de monde latents existants échouent souvent sur les actions spatiales et rotationnelles fines, ce qui limite leur usage pour un contrôle précis en 7 DOF, indispensable à des tâches d'insertion, de saisie orientée ou de manipulation fine en usine. En couplant vue globale de scène et vue centrée sur la pince, DUET-DINO cherche à combler cet écart pour permettre une planification zero-shot conditionnée par objectif, sans réentraînement spécifique à chaque tâche. Pour les intégrateurs et décideurs robotique, le résultat le plus utile n'est pas tant les scores de réussite, encore modestes sur des tâches de préhension complexes, que l'indication empirique que le choix du backbone visuel (DINOv3 plutôt que V-JEPA 2) conditionne directement la qualité de la planification en aval, un signal utile pour quiconque construit des architectures VLA ou de modèles de monde. Ce travail s'inscrit dans la lignée des modèles de monde auto-supervisés type V-JEPA de Meta et des familles DINOv2/DINOv3, plutôt que dans celle des politiques VLA de bout en bout comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent directement une politique d'action plutôt qu'un modèle prédictif séparé. DUET-DINO reste à ce stade une publication de recherche évaluée sur des bancs d'essai contrôlés, sans déploiement industriel annoncé ; les auteurs promettent la publication du code et des checkpoints ainsi qu'une page projet dédiée, mais aucun calendrier de mise à disposition n'est précisé.

RecherchePaper
1 source
LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique
3arXiv cs.RO 

LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique

Un article de recherche publié sur arXiv (arXiv:2609.19796v1) présente LIFD (Look, Imagine, Focus, and Do), un système de mémoire de scène tridimensionnelle persistante destiné à la manipulation robotique en conditions d'observabilité partielle, c'est-à-dire lorsque des zones vues par le robot sortent du champ de la caméra à mesure qu'il ou la scène se déplace. Le système apprend une représentation en tokens de scène à partir d'un accord multi-vues, puis la complète en déploiement à partir d'une seule image RGB et d'une mémoire récurrente, grâce à un modèle de rectified-flow combiné à un mécanisme d'attention croisée guidée par des ancrages géométriques. Sur les bancs d'essai de simulation LIBERO et MetaWorld, la version dite "Staged" de LIFD atteint respectivement 91,6% et 79,8% de taux de réussite moyen, avec un gain de 3,1 points de pourcentage sur LIBERO par rapport à un entraînement joint classique. Sur un bras robotique réel UR5e, testé sur quatre familles de tâches avec seulement dix démonstrations par famille, LIFD obtient 56,0% de réussite moyenne contre 40,5% pour OpenVLA-7B, un modèle vision-langage-action de référence dans le secteur. Ce résultat s'attaque à une limite connue des politiques de manipulation actuelles: la plupart des architectures VLA raisonnent sur la vue courante et perdent la trace des objets ou surfaces qui sortent du cadre, ce qui fragilise les tâches nécessitant de se souvenir d'un état antérieur de la scène. En montrant qu'une mémoire de scène compacte peut être inférée à partir d'une unique caméra RGB et de la proprioception au moment du déploiement, sans capteurs multi-vues ni LIDAR embarqués, LIFD répond à une contrainte très concrète pour les intégrateurs: le coût et la complexité du capteur. L'écart de performance avec OpenVLA-7B en régime few-shot (dix démonstrations) est aussi un signal pour les décideurs B2B, car il suggère qu'une mémoire spatiale explicite peut compenser en partie le besoin de données massives, un frein habituel à l'adoption des VLA en environnement industriel réel. Sur le plan méthodologique, LIFD s'appuie sur un entraînement en deux temps: une phase de représentation supervisée par des signaux multi-vues et géométriques, suivie d'une politique de manipulation reliée à cette représentation via des "slot features" compactes. Les auteurs comparent explicitement deux régimes d'entraînement, "Staged" et "Joint", le premier se révélant supérieur, et positionnent leur approche face à OpenVLA-7B comme référence VLA open-source établie. Il s'agit à ce stade d'un travail de recherche publié en preprint, validé sur des simulateurs standards du domaine (LIBERO, MetaWorld) et un unique bras collaboratif UR5e en laboratoire, sans annonce de pilote industriel ni de calendrier de déploiement à plus grande échelle.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
4arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source