Aller au contenu principal
PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste
IA physiquearXiv cs.RO 

PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 29 juin 2026 sur arXiv (arXiv:2606.28192) PA-BiCoop, un framework de manipulation bimanualle à modèle unique reposant sur une différenciation dynamique des rôles "primaire-auxiliaire". L'architecture déploie un encodeur de caractéristiques global partagé alimentant deux décodeurs spécialisés : le décodeur primaire génère la pose du bras principal en coordonnées absolues ainsi que des heatmaps d'affordance pour la tâche centrale, tandis que le décodeur auxiliaire produit la pose relative du bras de support dans le repère du bras primaire. Un module d'assignation dynamique des rôles détermine automatiquement quel bras (gauche ou droit) prend la position primaire ou auxiliaire à chaque étape de la tâche, sans pré-définition manuelle. Les benchmarks rapportés indiquent une progression de 48 % en moyenne sur les tâches de simulation RLBench2 par rapport aux meilleures baselines existantes, et de plus de 50 % sur des tâches en environnement réel.

Ces résultats, s'ils se confirment à l'échelle, adressent un verrou bien identifié dans la manipulation bimanualle : la quasi-totalité des approches actuelles traitent les deux bras comme des agents symétriques et interchangeables, ce qui force des synchronisations coûteuses et empêche l'émergence d'une division du travail naturelle. L'asymétrie primaire-auxiliaire est au contraire la norme dans la manipulation humaine, que ce soit pour visser un couvercle, positionner une pièce ou assembler un connecteur. Un gain de 50 % sur des tâches réelles est une affirmation forte : les benchmarks RLBench2 sont réputés pour permettre des optimisations d'artefacts de simulation, et les auteurs ne précisent pas le nombre de tâches réelles testées ni les conditions d'évaluation, deux points qui mériteront une vérification indépendante avant toute intégration industrielle.

La manipulation bimanualle mobilise actuellement plusieurs équipes de premier plan : Physical Intelligence (pi) avec Pi-0, Figure AI avec le modèle embarqué sur Figure 02 et 03, et les équipes de recherche de Boston Dynamics, Toyota Research Institute et NVIDIA (GR00T N2) travaillent toutes sur des politiques bimanuelles généralisables. PA-BiCoop se distingue par son approche à modèle unique, là où des concurrents recourent à des architectures hiérarchiques séparées ou à du reinforcement learning multi-agent. Il s'agit pour l'instant d'une publication de recherche sans déploiement annoncé, ni code public ni partenaire industriel identifié ; la prochaine étape logique serait une validation sur des manipulateurs commerciaux type Franka, UR ou Kinova dans un contexte de production réelle.

À lire aussi

Motus2 : un modèle du monde général auto-évolutif pour la manipulation dextérique
1arXiv cs.RO 

Motus2 : un modèle du monde général auto-évolutif pour la manipulation dextérique

Un article déposé sur arXiv fin août 2026 (arXiv:2608.30237) présente Motus2, un modèle du monde pour la manipulation dextre. Plutôt que d'ajouter une simple tête d'action à un simulateur, il repose sur un seul réseau à poids partagés exposant trois interfaces : une politique qui propose des séquences d'actions, un simulateur qui en prédit les conséquences visuelles, et un évaluateur qui juge ces prédictions, le tout formant une boucle fermée de décision et d'apprentissage. L'entraînement combine démonstrations expertes triées et interactions ratées, réutilisées comme signal pour la dynamique et la valeur. Les données montent en échelle, de vidéos égocentriques monoculaires vers des données stéréo puis des trajectoires robotiques réelles, avec retour tactile et instanciation sur une plateforme biomimétique à deux bras et deux mains dextres. Aucun chiffre de charge utile, de temps de cycle ou de taux de réussite n'est fourni. L'enjeu est de dépasser un défaut classique des modèles du monde robotiques, la déconnexion entre prédiction et apprentissage utile. En unifiant politique, simulateur et évaluateur, Motus2 vise une boucle d'auto-amélioration où le robot apprend aussi de ses échecs, non plus seulement de démonstrations humaines coûteuses à collecter à grande échelle, un frein connu pour les modèles vision-langage-action comme Pi-0 ou GR00T N2. Si l'approche se confirme au-delà du papier, elle réduirait la dépendance à la téléopération massive. L'absence de métriques chiffrées dans le résumé invite toutefois à la prudence, il s'agit d'une proposition architecturale, non d'un résultat comparé publiquement à l'état de l'art. Ce travail s'inscrit dans la vague des modèles du monde appliqués à la robotique généraliste, où les laboratoires opposent depuis 2025 approches génératives pures et architectures hybrides combinant simulation et politique. Motus2 se distingue par le partage total des poids entre ses trois fonctions et l'usage explicite des échecs comme signal d'apprentissage. Le choix d'une plateforme bimanuelle à mains dextres et retour tactile vise la manipulation fine plutôt que la seule locomotion humanoïde. L'article ne précise ni laboratoire d'origine ni calendrier de déploiement pilote, à ce stade Motus2 reste un jalon de recherche en préprint, dont la validation empirique reste à documenter.

IA physiquePaper
1 source
HarmoWAM : la manipulation robotique généraliste
2arXiv cs.RO 

HarmoWAM : la manipulation robotique généraliste

Une équipe de chercheurs a soumis HarmoWAM (arXiv:2605.10942) en mai 2026, un nouveau modèle d'action mondial (WAM) end-to-end pour le contrôle de robots manipulateurs. L'architecture unifie deux paradigmes antagonistes dans la littérature : l'"Imagine-then-Execute" (prédiction vidéo puis dynamique inverse), généralisable mais imprécis, et le "Joint Modeling" (actions et représentations visuelles comodélisées), précis mais limité à sa distribution d'entraînement. HarmoWAM combine un world model fournissant des priors physiques spatio-temporels, deux experts d'action complémentaires (un expert prédictif exploitant les dynamiques latentes, un expert réactif inférant les actions depuis l'évolution visuelle prédite), et un Process-Adaptive Gating Mechanism qui sélectionne automatiquement lequel activer selon la phase de la tâche. Sur six tâches réelles évaluées dans trois environnements jamais vus à l'entraînement, le système surpasse les meilleurs VLAs de 33 % et les WAMs concurrents de 29 % en généralisation zéro-shot. Le résultat stratégique n'est pas la performance brute, mais la capacité à généraliser sans réentraînement sur des configurations inédites -- le blocage central identifié par les intégrateurs industriels. Un robot précis en lab s'effondre dès qu'un fond, une position ou un objet change. En découplant transit généraliste et interaction précise, avec un mécanisme automatique pour basculer entre les deux selon la phase, HarmoWAM attaque directement le sim-to-real gap et la fragilité distributionnelle des VLAs actuels. Si ces gains se confirment sur des configurations plus variées, cela contredit l'hypothèse souvent défendue que précision et généralisation restent fondamentalement incompatibles à court terme. Les WAMs émergent comme alternative aux VLAs classiques, dont Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), en intégrant explicitement un modèle prédictif du monde physique dans la boucle de contrôle. HarmoWAM cherche à réconcilier deux branches qui s'étaient développées séparément au sein de cette famille. L'article reste un preprint arXiv non encore évalué par les pairs, sans partenaire industriel cité ni calendrier de déploiement annoncé -- il s'agit donc d'une annonce de recherche, pas d'un produit shipé. Aucune entreprise française ou européenne n'est mentionnée dans les travaux. La prochaine étape naturelle serait une évaluation sur des benchmarks standardisés comme LIBERO ou RLBench, ainsi que des tâches longue durée multi-étapes, domaines où les WAMs montrent encore des limites reconnues.

IA physiqueOpinion
1 source
ModPack : une interface de téléopération extensible pour la manipulation mobile bimanuelle
3arXiv cs.RO 

ModPack : une interface de téléopération extensible pour la manipulation mobile bimanuelle

Une équipe de recherche a présenté ModPack, un système de téléopération modulaire conçu pour piloter des robots à manipulation bimanuelle mobile, indépendamment de leur plateforme matérielle. Le cœur du dispositif est un "sac à dos" portable autonome intégrant calcul embarqué, alimentation, communication et stockage de données. Autour de cette interface commune, le système propose des modules interchangeables en plug-and-play : téléopération articulation par articulation avec retour haptique, manipulation mobile, et perception active. Les chercheurs ont testé ModPack sur deux plateformes robotiques distinctes lors de tâches réelles de manipulation mobile, démontrant sa capacité à servir de socle réutilisable pour la collecte de données et l'apprentissage de politiques de contrôle. L'ensemble du design matériel et de la pile logicielle est publié en open source, accompagné d'un site de projet dédié. Cette approche répond à une limite structurelle bien identifiée dans la robotique humanoïde et la manipulation mobile : la plupart des systèmes de téléopération actuels sont conçus sur mesure pour un robot et une tâche donnés, ce qui oblige les laboratoires et les entreprises à reconstruire leurs outils de collecte de données à chaque nouveau matériel. Pour les acteurs qui développent des modèles vision-langage-action (VLA) comme Pi-0, GR00T N2 ou Helix, la disponibilité de données de démonstration humaine de qualité, capturées efficacement sur des embodiments variés, est un goulot d'étranglement central pour l'apprentissage par imitation. Un outil modulaire et open source comme ModPack pourrait réduire le coût d'ingénierie nécessaire pour générer ces jeux de données, un enjeu direct pour les intégrateurs et les équipes de recherche qui cherchent à faire monter en échelle leurs pipelines de collecte plutôt qu'à réinventer le matériel de téléopération à chaque projet. Le développement de ModPack s'inscrit dans la tendance plus large de la robotique d'apprentissage, où la qualité et le volume des données de téléopération conditionnent directement les performances des politiques apprises, à l'image des efforts menés autour de plateformes comme Figure 03 ou Optimus Gen 3. En ouvrant l'intégralité du design matériel et du code, les auteurs positionnent ModPack comme une infrastructure communautaire plutôt qu'un produit commercial fermé, une démarche qui rappelle d'autres initiatives open source du secteur visant à standardiser les outils de collecte pour accélérer la recherche académique. L'article, publié sur arXiv, ne précise pas encore de feuille de route pour une adoption industrielle à plus grande échelle ni de partenariats annoncés, ce qui en fait pour l'instant une contribution de recherche plutôt qu'un déploiement commercial.

IA physiqueActu
1 source
GeoProp : ancrer l'état du robot dans la vision pour une manipulation généraliste
4arXiv cs.RO 

GeoProp : ancrer l'état du robot dans la vision pour une manipulation généraliste

La proprioception, c'est-à-dire la connaissance par le robot de la position et de la vitesse de ses propres articulations, est généralement injectée dans les politiques de manipulation comme un simple vecteur numérique, sans lien explicite avec les images captées par les caméras. Des chercheurs de l'Alibaba DAMO Academy proposent GeoProp, un module léger et greffable qui corrige ce défaut en projetant géométriquement l'état du robot sur le plan image pour échantillonner les caractéristiques visuelles locales correspondantes, créant un "jeton d'état ancré" dans la scène. Le système injecte ensuite ces informations spatiales dans les caractéristiques visuelles via une modulation FiLM, et anticipe le mouvement en échantillonnant également les caractéristiques à une position future prédite à court terme à partir de la cinématique récente. Testé sur 67 tâches, GeoProp améliore Diffusion Policy de 8,7% sur 63 tâches en simulation, la politique pi0 de 4,0% sur un sous-ensemble RoboTwin, et apporte un gain moyen de 10,6% en conditions réelles sur les deux familles de politiques, pour un coût de seulement 2 à 3% de paramètres supplémentaires. Ce résultat cible un problème connu mais peu résolu du secteur des politiques génératives pour la manipulation robotique: sans ancrage explicite entre kinématique 3D et cartes de caractéristiques 2D, les modèles peinent à situer le bras ou la pince du robot dans la scène, au point de parfois moins bien performer que des politiques n'utilisant que la vision. Pour les intégrateurs qui déploient des politiques de type Vision-Language-Action (VLA) sur des tâches de préhension ou d'assemblage, ce type d'adaptateur plug-and-play est significatif car il s'insère dans des architectures existantes sans réentraînement complet ni changement de backbone, avec un surcoût de calcul marginal. Le problème de fusion proprioception-vision remonte aux premières politiques de manipulation par apprentissage par imitation, où l'état articulaire était généralement simplement concaténé aux caractéristiques visuelles en fin de réseau. L'essor récent des politiques génératives comme Diffusion Policy et des modèles VLA généralistes tels que pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA) a remis cette question au centre des préoccupations, chaque laboratoire cherchant sa propre méthode d'alignement multimodal. Les auteurs positionnent GeoProp comme une brique générique compatible avec plusieurs familles de politiques plutôt qu'une architecture concurrente, et mettent à disposition une page projet dédiée, laissant présager une publication de code pour validation par la communauté.

IA physiqueOpinion
1 source