Aller au contenu principal
AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele
RecherchearXiv cs.RO 

AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié sur arXiv (référence 2507.12768) AnyPos, un pipeline d'apprentissage automatisé conçu pour la manipulation bimane généraliste. Le système repose sur un principe de modélisation dite "task-agnostic" : au lieu d'entraîner le robot sur des trajectoires liées à des tâches précises, AnyPos génère à grande échelle des paires image-action indépendantes couvrant l'ensemble de l'espace de travail atteignable. Ces données alimentent un apprentissage par dynamique inverse, combinant un décodeur directionnel et une séparation explicite entre les mouvements du bras et de l'effecteur terminal, pour stabiliser les prédictions en dehors de la distribution d'entraînement. Testée sur cinq tâches domestiques (actionner un micro-ondes, griller du pain, plier des vêtements, arroser des plantes, frotter des assiettes), l'approche améliore les taux de réussite de 30 à 40% par rapport aux baselines de référence, avec un gain de 51% en précision sur les évaluations test.

Ce résultat pointe un problème structurel du secteur : la rareté des données de manipulation robotique et leur entanglement avec une plateforme ou une tâche spécifique. La plupart des politiques visuomotrices actuelles, qu'il s'agisse de VLA (vision-language-action models) ou de diffusion policies, nécessitent des données séquentielles coûteuses à collecter et quasiment non transférables entre robots. En découplant la modélisation de l'embodiment de l'apprentissage de politique de haut niveau, AnyPos propose une réutilisation des données d'action cross-tâches et cross-plateformes, sans modèle physique explicite ni simulation intensive. L'argument est directement dirigé contre le "sim-to-real gap" : les représentations sont ici apprises depuis des données réelles générées automatiquement à grande échelle, contournant les biais de simulation.

L'approche rejoint une tendance récente consistant à séparer embodiment modeling et politique de haut niveau, visible chez Physical Intelligence (modèle pi0), Figure AI ou 1X Technologies. Elle se distingue par son refus de la télé-opération intensive ou de la simulation massive, préférant une exploration automatisée du workspace réel. Le pipeline est conçu pour se coupler à des modèles de politique existants, le positionnant potentiellement comme une couche de préentraînement réutilisable et échangeable. L'article ne mentionne ni déploiement industriel, ni partenariat commercial : AnyPos reste à ce stade une contribution de recherche académique, sans timeline de mise en production annoncée.

À lire aussi

Étiquetage automatique pour la manipulation mobile bimanuelle
1arXiv cs.RO 

Étiquetage automatique pour la manipulation mobile bimanuelle

Un pipeline d'étiquetage automatique pour l'entraînement de politiques robotiques à long horizon a été publié le 22 septembre 2026 sous forme de preprint arXiv (2609.24059), sous le titre "Automatic Labelling for Bimanual Mobile Manipulation". La méthode combine deux approches: une analyse déterministe de la trajectoire pour localiser dans le temps les phases d'une tâche, et un raisonnement vision-langage (VL) pour décrire sémantiquement le contenu de chaque phase, séparément pour la base mobile, le bras gauche et le bras droit. Les auteurs l'ont évaluée sur 29 tâches réelles de manipulation mobile bimanuelle exécutées avec des robots Galaxea. En répétant trois fois le raisonnement VL sur les tâches sélectionnées, la sortie reste identique dans 87,4% des cas. Une revue humaine menée par neuf participants sur l'ensemble des 29 tâches montre un taux d'acceptation de 90,5% pour les découpages temporels, 90,7% pour les labels de la base, et 78,7% pour les labels des bras. L'enjeu dépasse la simple curiosité académique: l'entraînement de politiques vision-langage-action (VLA) à long horizon repose sur des annotations de sous-tâches fiables, un travail manuel coûteux qui freine le passage à l'échelle des jeux de données de démonstrations robotiques. En automatisant la localisation temporelle tout en gardant un raisonnement sémantique piloté par un modèle vision-langage, ce pipeline propose une voie pour produire des annotations structurées à moindre coût humain, un prérequis que partagent les efforts actuels autour de modèles comme Pi-0 ou GR00T N2. Le taux d'acceptation plus faible sur les labels des bras (78,7% contre plus de 90% ailleurs) mérite d'être noté par les intégrateurs: décrire correctement un comportement bimanuel asynchrone reste plus difficile qu'annoter les déplacements de la base, une limite que l'article assume sans la minimiser. Le travail s'inscrit dans la course plus large à la constitution de données d'entraînement pour les modèles génériques de manipulation, où le choix de la plateforme Galaxea, fournisseur chinois de robots bimanuels mobiles, illustre sa place croissante comme banc d'essai académique. Publié en preprint sans revue par les pairs, sans code ni jeu de données mentionnés dans le résumé, le document se présente comme une base pour une identification plus fine des sous-tâches et une vérification par états, sans calendrier de suite annoncé.

RecherchePaper
1 source
Apprentissage unifié de la structure temporelle des tâches et du timing des actions pour la manipulation bimanuelle en robotique
2arXiv cs.RO 

Apprentissage unifié de la structure temporelle des tâches et du timing des actions pour la manipulation bimanuelle en robotique

Une publication mise à jour sur arXiv (2603.06538, version 2) présente une méthode pour la manipulation bimanuelle robotique qui unifie deux niveaux de raisonnement temporel jusqu'ici traités séparément : la structure symbolique d'une tâche (quelles actions précèdent, suivent ou chevauchent les autres) et le calage concret de chaque main (instant de déclenchement, durée). Le système apprend ces contraintes à partir de démonstrations humaines et en dérive des plans d'exécution paramétrés dans le temps pour un robot à deux bras. Il combine trois briques : une représentation en trois dimensions des délais fondée sur des modèles de mélange gaussien multivariés pour le niveau subsymbolique, un algorithme dérivé de Davis-Putnam-Logemann-Loveland qui classe tous les assignements sans contradiction des relations d'Allen, correspondant aux différents modes d'exécution possibles d'une tâche, et un planificateur par optimisation qui fusionne ces contraintes symboliques et subsymboliques. Les auteurs montrent quantitativement que les contraintes symboliques inférées sont plus précises que celles d'approches heuristiques antérieures, et que les plans générés se rapprochent davantage des démonstrations humaines que la démonstration la plus caractéristique prise comme référence, avec des essais qualitatifs menés en simulation et sur robots réels dont le nombre et les spécifications ne sont pas détaillés. Coordonner deux bras exige de savoir non seulement quel geste doit en précéder un autre, mais exactement quand le déclencher et combien de temps lui accorder, faute de quoi les mouvements se désynchronisent ou entrent en collision, un problème central pour tout intégrateur déployant des cellules bimanuelles en assemblage ou en logistique. La plupart des pipelines existants séparaient la planification symbolique de haut niveau du calage bas niveau des trajectoires, créant une rupture entre la tâche planifiée et son exécution physique ; en réunissant les deux couches dans un cadre appris par démonstration, ce travail cible un angle mort fréquent de l'apprentissage par imitation, qui reproduit souvent des gestes isolés sans capturer la logique de coordination entre bras. Si les résultats se confirment hors laboratoire, cela réduirait le travail manuel de programmation des séquences et des temporisations, un poste coûteux dans le déploiement de robots à deux bras, et fournirait un argument concret face au scepticisme ambiant sur l'écart entre démonstrations soignées et robustesse en conditions réelles. La méthode s'inscrit dans la lignée des travaux de planification robotique s'appuyant sur l'algèbre des intervalles d'Allen, un formalisme classique pour raisonner sur des relations temporelles qualitatives, combiné ici à des modèles de mélange gaussien déjà employés en apprentissage par démonstration pour encoder la variabilité des trajectoires humaines. Les auteurs situent leur contribution par rapport à des approches heuristiques antérieures pour l'extraction de contraintes symboliques, sans nommer de système concurrent précis ni d'institution, le résumé publié restant volontairement générique sur les auteurs et le matériel robotique utilisé. À ce stade, il s'agit d'une contribution de recherche en prépublication, validée en simulation et sur banc réel, sans indication de transfert vers un produit commercial ou un pilote industriel identifié, ni de calendrier de suite annoncé.

RecherchePaper
1 source
EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique
3arXiv cs.RO 

EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique

EDAR (Environment-Dependent Action Representation) est une nouvelle méthode d'apprentissage de représentations d'actions pour la manipulation robotique, présentée dans un article publié sur arXiv (référence 2607.11427v1). Le problème que les auteurs cherchent à résoudre est que les trajectoires de contrôle brutes utilisées pour entraîner des politiques robotiques sont bruitées, redondantes et difficiles à modéliser telles quelles. Les approches existantes se contentent généralement d'encoder la structure du flux d'actions lui-même, sans tenir compte explicitement de l'environnement dans lequel ces actions sont exécutées. EDAR propose au contraire de coupler les commandes moteur avec leurs effets visuels attendus, conditionnés par le contexte de la scène, afin que la représentation apprise capture la sémantique de l'interaction plutôt que de simples motifs au niveau des commandes. Les auteurs ont testé leur méthode sur des bancs d'essai de manipulation à la fois simulés et sur robot réel. Cette approche s'attaque à un angle mort connu des architectures VLA (vision-language-action) actuelles: le même segment d'action peut produire des résultats radicalement différents selon la disposition des objets, les propriétés physiques de la scène ou l'état initial de l'environnement. En ancrant les tokens d'action dans les conséquences visuelles attendues plutôt que dans la seule structure de commande, EDAR vise à améliorer la généralisation des politiques apprises, en particulier sur des tâches de manipulation à long horizon, où les erreurs de représentation s'accumulent au fil des étapes. Pour les équipes qui développent des politiques de manipulation généralistes, ce type de travail illustre une tendance de fond: le passage d'une modélisation purement centrée sur le contrôle vers des représentations conjointes action-perception, jugées nécessaires pour que les modèles de fondation robotiques (dans la lignée de GR00T N2, Pi-0 ou Helix) tiennent leurs promesses au-delà des démonstrations en environnement contrôlé. Le papier s'inscrit dans un courant de recherche plus large sur les représentations d'actions pour la robotique, où plusieurs travaux récents ont exploré la tokenisation d'actions, l'apprentissage par imitation conditionné par la vision, ou les modèles du monde pour anticiper les conséquences des actions. EDAR se positionne comme une contribution méthodologique plutôt qu'un produit ou un système déployé: il n'y a pas d'annonce de déploiement industriel ni de partenariat commercial associé à ce travail, qui reste à ce stade une publication de recherche évaluée sur des bancs d'essai académiques. Les prochaines étapes attendues pour ce type de travaux sont généralement l'intégration dans des pipelines VLA plus larges et des tests de transfert sur des plateformes robotiques commerciales, mais aucune feuille de route de ce type n'est mentionnée dans l'abstract.

RecherchePaper
1 source
JAMB : la diffusion conjointe action-mouvement pour la manipulation bimanuelle
4arXiv cs.RO 

JAMB : la diffusion conjointe action-mouvement pour la manipulation bimanuelle

JAMB (Joint Action-Motion Diffusion for Bimanual Manipulation) est une nouvelle politique de diffusion pour la manipulation robotique à deux bras, décrite dans un article publié le 23 septembre 2026 sur arXiv (2609.25322v1). Sa particularité est de débruiter simultanément, au sein d'un même Transformer partagé, les actions bimanuelles et les trajectoires 3D futures de points de la scène, les deux hypothèses s'informant mutuellement tout au long du processus de débruitage grâce à un système de coordonnées spatiotemporelles commun. L'équipe a testé JAMB sur 16 tâches de manipulation bimanuelle dans le simulateur RoboTwin 2.0 ainsi que sur un robot réel pour 3 tâches. En simulation, JAMB atteint un taux de succès moyen de 83,4 %, soit 23,9 points de pourcentage de plus que la meilleure référence testée. En conditions réelles, il dépasse les politiques n'utilisant que l'action de 50,0 points et les méthodes de prédiction géométrique auxiliaire de 21,2 points. Le site du projet est accessible à jam-bimanual.github.io. L'enjeu identifié par les auteurs est spécifique à la bimanualité : le mouvement d'un bras modifie la scène 3D partagée et affecte donc l'autre bras, un couplage que la plupart des politiques de diffusion ignorent, se contentant de générer des actions sans modéliser leurs conséquences géométriques futures. Les approches prédictives existantes, elles, traitent l'état futur comme une simple supervision auxiliaire ou un conditionnement figé plutôt que comme un élément coévoluant avec l'action. En montrant qu'un couplage bidirectionnel actions/trajectoires améliore nettement la performance et surtout la généralisation à des scènes encombrées et des arrière-plans inédits, ce travail apporte un argument concret en faveur d'une modélisation géométrique explicite pour les politiques de type VLA appliquées à la manipulation à deux bras, un axe suivi de près par les équipes travaillant sur la robotique de manipulation fine. Le papier positionne JAMB face à des politiques action-only et à d'autres approches de prédiction géométrique auxiliaire reposant sur des représentations d'état et des objectifs d'apprentissage différents, en s'appuyant sur RoboTwin 2.0 comme benchmark de référence pour la manipulation bimanuelle simulée. Il s'agit à ce stade d'une contribution de recherche académique, validée en simulation et sur un nombre limité de tâches réelles, sans indication de déploiement industriel ni de partenaire commercial associé.

RecherchePaper
1 source