Aller au contenu principal
RecherchearXiv cs.RO 

Étiquetage automatique pour la manipulation mobile bimanuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un pipeline d'étiquetage automatique pour l'entraînement de politiques robotiques à long horizon a été publié le 22 septembre 2026 sous forme de preprint arXiv (2609.24059), sous le titre "Automatic Labelling for Bimanual Mobile Manipulation". La méthode combine deux approches: une analyse déterministe de la trajectoire pour localiser dans le temps les phases d'une tâche, et un raisonnement vision-langage (VL) pour décrire sémantiquement le contenu de chaque phase, séparément pour la base mobile, le bras gauche et le bras droit. Les auteurs l'ont évaluée sur 29 tâches réelles de manipulation mobile bimanuelle exécutées avec des robots Galaxea. En répétant trois fois le raisonnement VL sur les tâches sélectionnées, la sortie reste identique dans 87,4% des cas. Une revue humaine menée par neuf participants sur l'ensemble des 29 tâches montre un taux d'acceptation de 90,5% pour les découpages temporels, 90,7% pour les labels de la base, et 78,7% pour les labels des bras.

L'enjeu dépasse la simple curiosité académique: l'entraînement de politiques vision-langage-action (VLA) à long horizon repose sur des annotations de sous-tâches fiables, un travail manuel coûteux qui freine le passage à l'échelle des jeux de données de démonstrations robotiques. En automatisant la localisation temporelle tout en gardant un raisonnement sémantique piloté par un modèle vision-langage, ce pipeline propose une voie pour produire des annotations structurées à moindre coût humain, un prérequis que partagent les efforts actuels autour de modèles comme Pi-0 ou GR00T N2. Le taux d'acceptation plus faible sur les labels des bras (78,7% contre plus de 90% ailleurs) mérite d'être noté par les intégrateurs: décrire correctement un comportement bimanuel asynchrone reste plus difficile qu'annoter les déplacements de la base, une limite que l'article assume sans la minimiser.

Le travail s'inscrit dans la course plus large à la constitution de données d'entraînement pour les modèles génériques de manipulation, où le choix de la plateforme Galaxea, fournisseur chinois de robots bimanuels mobiles, illustre sa place croissante comme banc d'essai académique. Publié en preprint sans revue par les pairs, sans code ni jeu de données mentionnés dans le résumé, le document se présente comme une base pour une identification plus fine des sous-tâches et une vérification par états, sans calendrier de suite annoncé.

À lire aussi

Mag-VLA : modèle vision-langage-action pour la manipulation bimanuelle de microrobots à actionnement magnétique
1arXiv cs.RO 

Mag-VLA : modèle vision-langage-action pour la manipulation bimanuelle de microrobots à actionnement magnétique

Des chercheurs proposent Mag-VLA, un modèle vision-langage-action (VLA) conçu pour piloter des microrobots à actionnement magnétique via deux bras robotiques équipés d'aimants permanents. Le système adapte le backbone Qwen2.5-VL-7B par fine-tuning LoRA pour traiter des observations visuelles et des instructions en langage naturel, puis générer des trajectoires coordonnées pour les deux bras simultanément dans un espace de travail partagé. Pour structurer le contrôle multi-étapes, l'architecture intègre un classificateur de phase sensible au mouvement et un décodeur ACT (Action Chunking Transformer) conditionné par cette phase. L'équipe a constitué un jeu de données de manipulation téléopérée couvrant trois configurations de difficulté croissante. En expérimentation réelle, Mag-VLA atteint 90 % de taux de succès à l'approche toutes tâches confondues, et des taux de transport de 80 %, 70 % et 50 % selon la complexité de la tâche. Ce résultat compte parce que les microrobots magnétiques sont des candidats sérieux pour la chirurgie mini-invasive, délivrance ciblée de médicaments, navigation vasculaire, ophtalmologie, mais leur pilotage reste difficile en raison de l'actionnement indirect, des capteurs limités et des interactions magnétiques non linéaires. Mag-VLA montre que le paradigme VLA, jusqu'ici évalué principalement sur des bras industriels ou des humanoïdes à l'échelle centimétrique, peut s'étendre au microscale. La coordination bimanuelle permet notamment la réorientation du microrobot, une opération difficilement réalisable avec un seul actionneur magnétique. Les études d'ablation du papier confirment que le décodeur ACT surpasse significativement les têtes d'action génératives alternatives, ce qui valide les choix architecturaux. Le contrôle de microrobots magnétiques est un axe de recherche actif depuis une quinzaine d'années, porté notamment par des groupes à l'ETH Zurich et au Max Planck Institute for Intelligent Systems, via des contrôleurs classiques ou de l'apprentissage par renforcement spécialisé, sans généralisation par langage naturel. L'essor des VLA macroscopiques comme pi0 de Physical Intelligence ou OpenVLA ouvre une voie transférable que Mag-VLA tente de valider à l'échelle micrométrique. Il s'agit pour l'instant d'un preprint académique (arXiv 2605.28486), sans partenaire industriel ni horizon de déploiement clinique annoncé. Les prochaines étapes logiques incluent des tests en milieu fluidique in vitro, la réduction de la latence du décodeur pour un contrôle temps réel, et la généralisation à un éventail plus large de géométries de microrobots.

UELe Max Planck Institute für Intelligente Systeme (Allemagne) est un acteur historique du contrôle de microrobots magnétiques ; une validation clinique de Mag-VLA renforcerait à terme la compétitivité européenne en chirurgie robotique mini-invasive, mais aucun déploiement ni partenaire industriel EU n'est annoncé à ce stade.

RechercheOpinion
1 source
Mixture of Frames Policy : débruitage d'actions multi-images pour la manipulation mobile bimanuelle
2arXiv cs.RO 

Mixture of Frames Policy : débruitage d'actions multi-images pour la manipulation mobile bimanuelle

Traduction/résumé de l'article demandé, en respectant le format et la posture éditoriale définis : Des chercheurs présentent Mixture of Frames Policy (MoF), une nouvelle architecture de politique de diffusion pour la manipulation robotique bimanuelle, détaillée dans un papier arXiv (2607.11884v1). Le problème visé : les politiques visuomotrices actuelles basées sur la diffusion imposent un référentiel d'action unique et prédéfini, obligeant un seul débruiteur ("denoiser") à modéliser des distributions d'actions parfois inutilement complexes dans ce référentiel figé. MoF fonctionne différemment : elle maintient un état de diffusion canonique unique, le réexprime dans plusieurs référentiels pertinents pour la tâche (repère de l'effecteur, repère aligné sur la base du robot, etc.), applique des débruiteurs spécialisés par référentiel, puis fusionne leurs prédictions de bruit dans le référentiel canonique. Pour rendre cette synchronisation possible sur des états de diffusion intermédiaires bruités, les auteurs introduisent une représentation de rotation 6D en colonnes au sein d'une paramétrisation d'action SE(3), qui permet des transformations de référentiel exactes et différentiables sans exiger que les rotations bruitées respectent la variété SO(3). Sur neuf tâches simulées de manipulation bimanuelle, MoF surpasse à la fois une sélection oracle du meilleur référentiel et les baselines standards de type Mixture-of-Experts (MoE), tout en confirmant que le référentiel optimal varie selon la tâche, un signal utile pour quiconque conçoit des politiques VLA ou de diffusion pour des bras bimanuels ou des plateformes mobiles à manipulation intégrée. Pour les intégrateurs et équipes robotique, cela reformule un choix d'ingénierie souvent traité de façon ad hoc (quel repère utiliser pour quelle sous-tâche) en un problème que le modèle peut apprendre à résoudre lui-même. La validation réelle reste toutefois limitée : seulement deux tâches de manipulation mobile bimanuelle en conditions réelles, où MoF bat l'ensemble de ses variantes mono-référentiel constituantes, sans comparaison directe à des systèmes concurrents publiés (type Pi-0, GR00T N2 ou Helix) sur ce même protocole. Le travail s'inscrit dans la lignée des politiques de diffusion visuomotrices, en ciblant spécifiquement leur angle mort connu sur le transport d'objets et la coordination corps entier. Page projet : mofpo.github.io.

RechercheActu
1 source
MessyMem : une mémoire acquise par la pratique pour la manipulation mobile
3arXiv cs.RO 

MessyMem : une mémoire acquise par la pratique pour la manipulation mobile

Un système baptisé MessyMem, décrit dans un article publié sur arXiv (identifiant 2609.15976v1, version initiale de septembre 2026), s'attaque à un problème concret de la manipulation mobile : les robots qui interviennent dans plusieurs pièces et à plusieurs reprises n'accumulent aujourd'hui aucune connaissance persistante d'une visite à l'autre, par exemple qu'un placard est verrouillé ou qu'un objet se trouve dans un tiroir précis. MessyMem construit et maintient un graphe de scène 3D spatialement ancré, listant objets et emplacements, qu'il enrichit avec des propriétés et des résultats appris par interaction, et qu'il relie à des observations visuelles pour permettre un rappel précis. Les auteurs l'ont testé en simulation, sur une séquence continue de 25 tâches s'étalant sur plus de 3 heures, où le système atteint 80,0 % de progression des tâches, soit 14,8 points de pourcentage de mieux que la meilleure variante ablationnée du système et 28,9 points de mieux que la meilleure méthode externe comparée. Le système parvient à retrouver des preuves pertinentes parmi des milliers d'images clés stockées, remontant à plus d'une heure dans le passé. Un test complémentaire a également été mené sur un manipulateur mobile réel, sans que l'abstract ne détaille de métriques chiffrées équivalentes pour cette partie. Ce travail répond directement à une limite connue des architectures actuelles : les représentations de scène compactes utilisées par les planificateurs pilotés par modèles vision-langage omettent les connaissances tirées de l'interaction, les historiques vidéo bruts sont difficiles à interroger, et les modèles raisonnent au moment de l'inférence sans jamais mettre à jour durablement ce que le robot sait. Pour les intégrateurs et décideurs qui envisagent des flottes de robots opérant en continu sur de longues périodes, dans des environnements domestiques, commerciaux ou industriels, ce type de mémoire structurée laisse espérer une réduction du temps perdu à ré-explorer ou refaire des erreurs déjà rencontrées. Il faut toutefois noter que les chiffres les plus spectaculaires proviennent d'un banc d'essai simulé construit par les auteurs eux-mêmes, ce qui limite pour l'instant leur portée face à une validation à grande échelle sur robot physique. L'approche s'inscrit dans un effort de recherche plus large visant à doter les manipulateurs mobiles d'une mémoire à long terme complémentaire des modèles de planification génératifs, plutôt qu'un simple contexte réinitialisé à chaque tâche. S'agissant d'une publication de recherche fraîche et non d'un produit commercialisé, les suites logiques attendues sont l'extension à un plus grand nombre de tâches et d'environnements, ainsi qu'une validation renforcée sur robots physiques déployés en conditions réelles.

RecherchePaper
1 source
AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele
4arXiv cs.RO 

AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele

Une équipe de chercheurs a publié sur arXiv (référence 2507.12768) AnyPos, un pipeline d'apprentissage automatisé conçu pour la manipulation bimane généraliste. Le système repose sur un principe de modélisation dite "task-agnostic" : au lieu d'entraîner le robot sur des trajectoires liées à des tâches précises, AnyPos génère à grande échelle des paires image-action indépendantes couvrant l'ensemble de l'espace de travail atteignable. Ces données alimentent un apprentissage par dynamique inverse, combinant un décodeur directionnel et une séparation explicite entre les mouvements du bras et de l'effecteur terminal, pour stabiliser les prédictions en dehors de la distribution d'entraînement. Testée sur cinq tâches domestiques (actionner un micro-ondes, griller du pain, plier des vêtements, arroser des plantes, frotter des assiettes), l'approche améliore les taux de réussite de 30 à 40% par rapport aux baselines de référence, avec un gain de 51% en précision sur les évaluations test. Ce résultat pointe un problème structurel du secteur : la rareté des données de manipulation robotique et leur entanglement avec une plateforme ou une tâche spécifique. La plupart des politiques visuomotrices actuelles, qu'il s'agisse de VLA (vision-language-action models) ou de diffusion policies, nécessitent des données séquentielles coûteuses à collecter et quasiment non transférables entre robots. En découplant la modélisation de l'embodiment de l'apprentissage de politique de haut niveau, AnyPos propose une réutilisation des données d'action cross-tâches et cross-plateformes, sans modèle physique explicite ni simulation intensive. L'argument est directement dirigé contre le "sim-to-real gap" : les représentations sont ici apprises depuis des données réelles générées automatiquement à grande échelle, contournant les biais de simulation. L'approche rejoint une tendance récente consistant à séparer embodiment modeling et politique de haut niveau, visible chez Physical Intelligence (modèle pi0), Figure AI ou 1X Technologies. Elle se distingue par son refus de la télé-opération intensive ou de la simulation massive, préférant une exploration automatisée du workspace réel. Le pipeline est conçu pour se coupler à des modèles de politique existants, le positionnant potentiellement comme une couche de préentraînement réutilisable et échangeable. L'article ne mentionne ni déploiement industriel, ni partenariat commercial : AnyPos reste à ce stade une contribution de recherche académique, sans timeline de mise en production annoncée.

RechercheOpinion
1 source