Aller au contenu principal
RecherchearXiv cs.RO 

JAMB : la diffusion conjointe action-mouvement pour la manipulation bimanuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

JAMB (Joint Action-Motion Diffusion for Bimanual Manipulation) est une nouvelle politique de diffusion pour la manipulation robotique à deux bras, décrite dans un article publié le 23 septembre 2026 sur arXiv (2609.25322v1). Sa particularité est de débruiter simultanément, au sein d'un même Transformer partagé, les actions bimanuelles et les trajectoires 3D futures de points de la scène, les deux hypothèses s'informant mutuellement tout au long du processus de débruitage grâce à un système de coordonnées spatiotemporelles commun. L'équipe a testé JAMB sur 16 tâches de manipulation bimanuelle dans le simulateur RoboTwin 2.0 ainsi que sur un robot réel pour 3 tâches. En simulation, JAMB atteint un taux de succès moyen de 83,4 %, soit 23,9 points de pourcentage de plus que la meilleure référence testée. En conditions réelles, il dépasse les politiques n'utilisant que l'action de 50,0 points et les méthodes de prédiction géométrique auxiliaire de 21,2 points. Le site du projet est accessible à jam-bimanual.github.io.

L'enjeu identifié par les auteurs est spécifique à la bimanualité : le mouvement d'un bras modifie la scène 3D partagée et affecte donc l'autre bras, un couplage que la plupart des politiques de diffusion ignorent, se contentant de générer des actions sans modéliser leurs conséquences géométriques futures. Les approches prédictives existantes, elles, traitent l'état futur comme une simple supervision auxiliaire ou un conditionnement figé plutôt que comme un élément coévoluant avec l'action. En montrant qu'un couplage bidirectionnel actions/trajectoires améliore nettement la performance et surtout la généralisation à des scènes encombrées et des arrière-plans inédits, ce travail apporte un argument concret en faveur d'une modélisation géométrique explicite pour les politiques de type VLA appliquées à la manipulation à deux bras, un axe suivi de près par les équipes travaillant sur la robotique de manipulation fine.

Le papier positionne JAMB face à des politiques action-only et à d'autres approches de prédiction géométrique auxiliaire reposant sur des représentations d'état et des objectifs d'apprentissage différents, en s'appuyant sur RoboTwin 2.0 comme benchmark de référence pour la manipulation bimanuelle simulée. Il s'agit à ce stade d'une contribution de recherche académique, validée en simulation et sur un nombre limité de tâches réelles, sans indication de déploiement industriel ni de partenaire commercial associé.

À lire aussi

Static In, Dynamic Out : augmentation contrefactuelle des actions pour la manipulation d'objets en mouvement
1arXiv cs.RO 

Static In, Dynamic Out : augmentation contrefactuelle des actions pour la manipulation d'objets en mouvement

Des chercheurs ont publié un nouvel article scientifique (arXiv:2607.27890) présentant SIDO, pour "Static In, Dynamic Out", une méthode d'augmentation contrefactuelle d'actions destinée aux politiques de manipulation robotique visuomotrices. Le problème visé est concret : la plupart des politiques actuelles sont entraînées et validées sur des objets statiques, alors que dans les déploiements réels les pièces glissent sur un convoyeur ou les fruits oscillent sous le vent. SIDO décompose le problème en deux sous-tâches, prédire où l'objet se trouvera puis atteindre cette pose future, et transforme les démonstrations statiques en associant à chaque déplacement contrefactuel de l'objet une action ajustée qui conserve la relation relative entre la main du robot et l'objet. Au moment du déploiement, un prédicteur de pose fournit la position future estimée. Les auteurs ont testé cette approche sur trois tâches simulées (Mug, Square, Stack) soumises à cinq schémas de mouvement différents, ainsi que sur deux tâches réelles baptisées Gantry et Peachtree. Résultat annoncé : la méthode améliore le taux de réussite sur objets en mouvement par rapport aux références, sans dégrader les performances sur objets statiques. Pour l'industrie robotique, ce travail s'attaque directement à l'un des écarts les plus cités entre démonstration et réalité : les politiques d'apprentissage par imitation, notamment les architectures VLA, échouent souvent dès qu'un objet bouge, ce qui limite leur usage en logistique, en tri agroalimentaire ou sur ligne d'assemblage où rien n'est jamais parfaitement immobile. Si la généralisation tient au-delà des bancs d'essai publiés, cela ouvrirait la voie à des politiques entraînées uniquement sur données statiques, moins coûteuses à collecter, tout en couvrant des scénarios dynamiques sans réentraînement dédié. Reste que les résultats proviennent pour l'instant d'un seul article, sur un nombre limité de tâches, sans comparaison avec des solutions industrielles déjà déployées en usine. Cette publication s'inscrit dans un courant de recherche actif sur les politiques visuomotrices et les architectures vision-langage-action, où des équipes travaillant sur des modèles comme Pi-0 ou GR00T explorent déjà la généralisation à des environnements moins contrôlés. SIDO se distingue par une approche légère, une simple augmentation de données combinée à un module de prédiction de pose, plutôt qu'une réarchitecture complète du modèle. Les auteurs mettent à disposition un site de projet dédié pour la documentation et le code, mais aucun calendrier de transfert vers un produit commercial ou un partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
Mag-VLA : modèle vision-langage-action pour la manipulation bimanuelle de microrobots à actionnement magnétique
2arXiv cs.RO 

Mag-VLA : modèle vision-langage-action pour la manipulation bimanuelle de microrobots à actionnement magnétique

Des chercheurs proposent Mag-VLA, un modèle vision-langage-action (VLA) conçu pour piloter des microrobots à actionnement magnétique via deux bras robotiques équipés d'aimants permanents. Le système adapte le backbone Qwen2.5-VL-7B par fine-tuning LoRA pour traiter des observations visuelles et des instructions en langage naturel, puis générer des trajectoires coordonnées pour les deux bras simultanément dans un espace de travail partagé. Pour structurer le contrôle multi-étapes, l'architecture intègre un classificateur de phase sensible au mouvement et un décodeur ACT (Action Chunking Transformer) conditionné par cette phase. L'équipe a constitué un jeu de données de manipulation téléopérée couvrant trois configurations de difficulté croissante. En expérimentation réelle, Mag-VLA atteint 90 % de taux de succès à l'approche toutes tâches confondues, et des taux de transport de 80 %, 70 % et 50 % selon la complexité de la tâche. Ce résultat compte parce que les microrobots magnétiques sont des candidats sérieux pour la chirurgie mini-invasive, délivrance ciblée de médicaments, navigation vasculaire, ophtalmologie, mais leur pilotage reste difficile en raison de l'actionnement indirect, des capteurs limités et des interactions magnétiques non linéaires. Mag-VLA montre que le paradigme VLA, jusqu'ici évalué principalement sur des bras industriels ou des humanoïdes à l'échelle centimétrique, peut s'étendre au microscale. La coordination bimanuelle permet notamment la réorientation du microrobot, une opération difficilement réalisable avec un seul actionneur magnétique. Les études d'ablation du papier confirment que le décodeur ACT surpasse significativement les têtes d'action génératives alternatives, ce qui valide les choix architecturaux. Le contrôle de microrobots magnétiques est un axe de recherche actif depuis une quinzaine d'années, porté notamment par des groupes à l'ETH Zurich et au Max Planck Institute for Intelligent Systems, via des contrôleurs classiques ou de l'apprentissage par renforcement spécialisé, sans généralisation par langage naturel. L'essor des VLA macroscopiques comme pi0 de Physical Intelligence ou OpenVLA ouvre une voie transférable que Mag-VLA tente de valider à l'échelle micrométrique. Il s'agit pour l'instant d'un preprint académique (arXiv 2605.28486), sans partenaire industriel ni horizon de déploiement clinique annoncé. Les prochaines étapes logiques incluent des tests en milieu fluidique in vitro, la réduction de la latence du décodeur pour un contrôle temps réel, et la généralisation à un éventail plus large de géométries de microrobots.

UELe Max Planck Institute für Intelligente Systeme (Allemagne) est un acteur historique du contrôle de microrobots magnétiques ; une validation clinique de Mag-VLA renforcerait à terme la compétitivité européenne en chirurgie robotique mini-invasive, mais aucun déploiement ni partenaire industriel EU n'est annoncé à ce stade.

RechercheOpinion
1 source
Étiquetage automatique pour la manipulation mobile bimanuelle
3arXiv cs.RO 

Étiquetage automatique pour la manipulation mobile bimanuelle

Un pipeline d'étiquetage automatique pour l'entraînement de politiques robotiques à long horizon a été publié le 22 septembre 2026 sous forme de preprint arXiv (2609.24059), sous le titre "Automatic Labelling for Bimanual Mobile Manipulation". La méthode combine deux approches: une analyse déterministe de la trajectoire pour localiser dans le temps les phases d'une tâche, et un raisonnement vision-langage (VL) pour décrire sémantiquement le contenu de chaque phase, séparément pour la base mobile, le bras gauche et le bras droit. Les auteurs l'ont évaluée sur 29 tâches réelles de manipulation mobile bimanuelle exécutées avec des robots Galaxea. En répétant trois fois le raisonnement VL sur les tâches sélectionnées, la sortie reste identique dans 87,4% des cas. Une revue humaine menée par neuf participants sur l'ensemble des 29 tâches montre un taux d'acceptation de 90,5% pour les découpages temporels, 90,7% pour les labels de la base, et 78,7% pour les labels des bras. L'enjeu dépasse la simple curiosité académique: l'entraînement de politiques vision-langage-action (VLA) à long horizon repose sur des annotations de sous-tâches fiables, un travail manuel coûteux qui freine le passage à l'échelle des jeux de données de démonstrations robotiques. En automatisant la localisation temporelle tout en gardant un raisonnement sémantique piloté par un modèle vision-langage, ce pipeline propose une voie pour produire des annotations structurées à moindre coût humain, un prérequis que partagent les efforts actuels autour de modèles comme Pi-0 ou GR00T N2. Le taux d'acceptation plus faible sur les labels des bras (78,7% contre plus de 90% ailleurs) mérite d'être noté par les intégrateurs: décrire correctement un comportement bimanuel asynchrone reste plus difficile qu'annoter les déplacements de la base, une limite que l'article assume sans la minimiser. Le travail s'inscrit dans la course plus large à la constitution de données d'entraînement pour les modèles génériques de manipulation, où le choix de la plateforme Galaxea, fournisseur chinois de robots bimanuels mobiles, illustre sa place croissante comme banc d'essai académique. Publié en preprint sans revue par les pairs, sans code ni jeu de données mentionnés dans le résumé, le document se présente comme une base pour une identification plus fine des sous-tâches et une vérification par états, sans calendrier de suite annoncé.

RecherchePaper
1 source
Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)
4arXiv cs.RO 

Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)

Une équipe de recherche a publié le 22 septembre 2026 sur arXiv, sous la référence 2609.22332, AffordanceWAM, un nouveau modèle conjoint de monde et d'action pour la manipulation robotique généraliste. Bâti sur un Transformer de diffusion vidéo pré-entraîné, il associe un module « World Expert » et un module « Action Expert » reliés par une attention conjointe masquée, pour prédire simultanément les images RGB futures de la scène, un champ d'affordance scalaire, une carte de chaleur des zones manipulables et la trajectoire d'action continue du robot, sous un objectif d'entraînement unique de type flow-matching. Les vidéos humaines filmées à la première personne supervisent ces trois flux visuels, tandis que les démonstrations robotiques ajoutent la supervision d'action, sans retargeting ni étiquetage manuel des gestes humains, avant validation sur les bancs d'essai RoboCasa et CALVIN (protocole ABC vers D) et sur des tâches de manipulation réelles. Le problème visé est la pénurie de données d'entraînement pour les politiques vision-langage-action : les vidéos robot avec actions étiquetées restent coûteuses et peu diversifiées, tandis que les vidéos humaines égocentriques, abondantes, manquent d'actions robotiques exploitables et diffèrent en morphologie. AffordanceWAM affiche des gains constants face à des références limitées au RGB seul ou aux seules données robot, et surtout une amélioration monotone sur RoboCasa à mesure que le volume de vidéos humaines annotées en affordance augmente, à supervision robot constante. Pour les équipes entraînant des modèles VLA à grande échelle, ce résultat trace une voie pour réduire la dépendance à la téléopération coûteuse en exploitant des corpus vidéo humains déjà disponibles en masse. Le travail s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où prédiction vidéo et génération d'action sont fusionnées dans une architecture unique plutôt que traitées séparément, une direction également suivie par plusieurs laboratoires industriels développant des modèles vision-langage-action. Il s'agit à ce stade d'une prépublication non encore validée par relecture par les pairs, testée sur des bancs d'essai académiques et un nombre restreint de scénarios réels, et non d'un produit ou d'un déploiement commercial. Le papier ne précise ni la taille exacte des corpus vidéo humains, ni de calendrier de publication du code ou des poids du modèle, laissant la reproductibilité comme prochaine étape à vérifier.

RechercheActu
1 source