Aller au contenu principal
RecherchearXiv cs.RO 

CoRE : apprendre des experts par rôle de collaboration pour la manipulation collaborative décentralisée avec une seule politique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent CoRE (Collaboration-Role Experts), une méthode de manipulation collaborative décentralisée où une seule politique, partagée par tous les robots, pilote chaque machine. Chaque robot s'appuie uniquement sur ses observations visuelles et sa proprioception, sans instruction de tâche, sans étiquette d'identité et sans message échangé entre robots. Le système apprend à partir de démonstrations regroupées, multi-tâches et multi-robots. Il fusionne apparence et géométrie pour extraire des indices locaux d'interaction. Des experts à attention croisée conditionnée par requête offrent plusieurs chemins de prédiction. Un routeur local les combine à chaque position du segment d'actions (action chunk). À l'entraînement, une perte d'alignement action-expert supervise le choix des experts à partir des erreurs de prédiction relatives obtenues en forçant chaque route sur des entrées fixes, sans étiquette de rôle. Les auteurs annoncent les meilleures performances moyennes parmi les méthodes décentralisées évaluées sur plusieurs benchmarks en simulation. Des expériences physiques couvrent plusieurs tâches de manipulation et testent la robustesse face aux retards et aux ralentissements du partenaire. Le résumé ne chiffre ni les scores, ni le nombre de robots, ni les plateformes utilisées.

L'enjeu est d'abord architectural. Dans la manipulation à plusieurs robots, on choisit souvent entre un contrôleur centralisé, qui ne passe pas à l'échelle et dépend d'une communication fiable, et des politiques distinctes par rôle, qui exigent d'affecter les rôles à l'avance. CoRE vise une troisième voie : un seul jeu de poids, où chaque robot déduit son rôle (tenir, pousser, soutenir) de ce qu'il perçoit localement. Pour un intégrateur, cela réduirait la maintenance, puisqu'il n'y aurait qu'une politique à déployer, et supprimerait la dépendance à un lien réseau entre robots. La robustesse aux partenaires lents est pertinente en atelier, où les temps de cycle varient. Il faut toutefois rester prudent : les gains sont relatifs à d'autres méthodes décentralisées, pas à un contrôle centralisé. Sans chiffres publiés dans le résumé, l'écart entre simulation et réel, ainsi que la généralité des tâches testées, restent à vérifier dans l'article complet.

Ce travail s'inscrit dans l'essor des politiques vision-langage-action (VLA) et des politiques à chunks d'actions (type ACT ou diffusion), qui ont surtout été développées pour un robot unique. Les extensions multi-robots restent peu nombreuses et reposent souvent sur la communication explicite ou sur des identifiants de rôle. L'approche par mélange d'experts, déjà courante dans les grands modèles, est ici transposée à la coordination implicite. La page du projet est hébergée sur le domaine aus.bot. Aucune annonce de pilote industriel ni de calendrier de déploiement n'accompagne cette publication, qui relève de la recherche académique en préversion arXiv, sans produit associé. Les prochaines étapes à surveiller sont la montée en nombre de robots, le passage à des équipes hétérogènes (bras différents, humanoïdes) et la comparaison directe avec des baselines centralisées.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

D'une seule démonstration à une politique générale pour la manipulation avec contact
1arXiv cs.RO 

D'une seule démonstration à une politique générale pour la manipulation avec contact

Une équipe de recherche publie sur arXiv (réf. 2605.17601, mai 2026) un framework d'apprentissage par démonstration capable de généraliser à partir d'un seul exemple sur des tâches de manipulation impliquant des contacts répétés avec l'environnement. Le système repose sur un pipeline en quatre étapes : abstraction de la démonstration en primitives de contraintes environnementales, exploration autonome pour lever les ambiguïtés, correction ciblée par un opérateur humain pour couvrir les variantes hors-distribution, et enfin récupération en ligne des détails géométriques via interaction compliante. Validé sur sept tâches réelles multi-étapes à contact riche, le framework atteint un taux de succès supérieur à 90 %. Aucune entreprise spécifique ni plateforme robotique n'est mentionnée dans le préprint, qui reste une contribution académique sans déploiement industriel annoncé. Le point central de l'approche est de représenter une tâche non pas comme une trajectoire à imiter, mais comme une séquence de contraintes environnementales à exploiter. Ce changement de paradigme permet au robot de distinguer la structure générale d'une tâche (types de contraintes, transitions entre elles) des détails spécifiques à une instance donnée (poses exactes, géométrie locale). Pour un intégrateur ou un décideur industriel, cela signifie qu'une seule démonstration suffit potentiellement là où les méthodes de behavior cloning classiques en réclament des centaines. Le résultat de 90 %+ sur des tâches à contact riche est notable car ce domaine concentre la majorité des échecs en manipulation robotique réelle, notamment à cause de la sensibilité aux variations de pose et aux dynamiques de contact non modélisées. L'apprentissage par démonstration est un champ très actif depuis une décennie, concurrencé récemment par les politiques de diffusion (Diffusion Policy, Pi-0 de Physical Intelligence), les architectures VLA (RT-2, GR00T N2 de NVIDIA) et les méthodes ACT (Action Chunking with Transformers). L'originalité revendiquée ici est de traiter les contraintes environnementales comme biais inductif plutôt que d'augmenter massivement les données d'entraînement ou la puissance du modèle. La limite principale reste l'absence d'évaluation sur des plateformes humanoïdes ou collaboratives standard, ce qui rend difficile la comparaison directe avec les benchmarks du secteur. Les suites naturelles seraient un passage à des environnements ouverts et une validation sur des robots commerciaux comme le Franka Research 3 ou les bras UR.

RecherchePaper
1 source
Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée
2arXiv cs.RO 

Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée

Un article mis à jour sur arXiv (version 2, référence 2606.22982) présente CLS-DP, un cadre décentralisé pour la manipulation multi-bras par des agents robotiques. Le système répond à un problème concret : les approches centralisées de coordination multi-agents passent mal à l'échelle quand le nombre de bras augmente, car elles exigent une vue globale partagée et des échanges d'état constants. CLS-DP suit le paradigme CTDE (entraînement centralisé, exécution décentralisée) : pendant l'entraînement, il distille dans un espace latent les dynamiques privilégiées de coordination multi-agents ; au déploiement, chaque bras infère ce "latent collaboratif" à partir de sa seule observation RGB locale et d'une instruction de tâche partagée, puis conditionne dessus son processus de débruitage par diffusion, sans communication inter-agents ni état global explicite. Sur six tâches du benchmark RoboFactory impliquant de deux à quatre agents, CLS-DP atteint un taux de réussite moyen de 38%, contre 20% pour la meilleure référence centralisée testée et seulement 9% pour une version décentralisée privée du latent collaboratif. Ce résultat contredit une hypothèse répandue en robotique multi-bras : qu'une coordination fine nécessite forcément une communication explicite ou une vue centralisée de la scène. En montrant qu'un latent appris peut encoder implicitement les dynamiques collaboratives à partir d'une simple image locale, CLS-DP ouvre la voie à des cellules multi-robots qui passent à l'échelle sans coût de communication croissant, un enjeu direct pour les intégrateurs qui déploient des postes de manipulation coopérative en usine. Les cartes d'attribution des auteurs montrent que chaque agent, conditionné sur ce latent, porte une attention élevée non seulement sur ses propres articulations et sa pince, mais aussi sur celles de ses coéquipiers pendant toute l'exécution, preuve que l'information de coordination circule réellement dans la représentation apprise. Pour qui évalue des architectures VLA (vision-language-action) en environnement multi-agent, le travail suggère qu'on peut réduire le coût de calcul par agent tout en égalant, voire en dépassant, des références centralisées plus lourdes. Ce travail s'inscrit dans la lignée des politiques de manipulation par diffusion, devenues une alternative courante au clonage comportemental classique, et s'appuie sur RoboFactory comme benchmark commun pour l'évaluation multi-agents. Le choix du paradigme CTDE rapproche aussi cette recherche des méthodes d'apprentissage par renforcement multi-agents, où entraînement centralisé et exécution décentralisée sont devenus un standard pour équilibrer performance et scalabilité. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de bras robotiques : il s'agit pour l'instant d'un résultat validé en simulation, sans calendrier annoncé de transfert vers du matériel réel. L'étape logique suivante serait une validation sim-to-réel sur des cellules physiques à deux ou trois bras, véritable épreuve pour une méthode qui promet de faire tenir la coordination fine dans une seule caméra RGB par agent.

RecherchePaper
1 source
HACo : apprendre la compliance haptique active pour une manipulation dextérique sensible aux forces
3arXiv cs.RO 

HACo : apprendre la compliance haptique active pour une manipulation dextérique sensible aux forces

Des chercheurs présentent HACo (Haptic Active Compliance), une politique de manipulation dextre qui apprend à réguler les forces de contact directement à partir de retours haptiques. Le système combine deux sources de signal habituellement traitées séparément : les réponses tactiles locales des bouts de doigts et les couples articulaires, qui renseignent sur la transmission des charges à travers toute la main articulée, y compris pour les contacts hors de la zone couverte par les capteurs tactiles. Côté données, une téléopération à conformité régulée convertit les commandes de l'opérateur en actions compliantes exécutables par le contrôleur, qui conservent l'intention de mouvement tout en limitant les efforts. HACo apprend ces actions directement, en utilisant l'écart entre commande et état comme supervision auxiliaire de l'intention compliante. Un module de « Compliance Grounding » s'appuie sur une attention croisée haptique à portes (gated cross-attention) pour ancrer la génération d'actions dans l'état haptique courant, sans modélisation explicite du contact en ligne. Le banc d'essai réel couvre la friction multi-contact, l'interaction tangentielle, le contact fragile sur surface courbe, le couple de rotation et les objets déformables. Sur 20 essais par tâche, HACo atteint 83 % de réussite moyenne, contre 35 % pour la meilleure base de comparaison évaluée. L'écart est net, mais il porte sur un protocole de 20 essais par tâche, soit une marge d'incertitude non négligeable sur chaque score individuel. Le résultat reste significatif pour l'industrie : les politiques visuo-motrices actuelles, y compris les VLA, échouent souvent dès que la tâche exige de doser l'effort plutôt que de simplement atteindre une pose. Les cibles d'action habituelles posent deux problèmes. Soit elles encodent des charges excessives, soit elles omettent le mouvement contraint par l'objet. HACo suggère que la conformité peut être apprise de bout en bout plutôt que déléguée à un contrôleur d'impédance réglé à la main. Pour les intégrateurs travaillant sur l'assemblage, la manipulation d'objets fragiles ou déformables, c'est un axe de recherche à suivre. Le papier ne précise toutefois pas ici la main utilisée, le coût des capteurs, ni la généralisation à des objets ou des scènes non vus, et il ne s'agit pas d'un produit. Ce travail s'inscrit dans la montée de la manipulation dextre guidée par le toucher, après une période dominée par la vision et le langage, où les jeux de données de téléopération ne contiennent que des positions cibles. Il s'agit d'une prépublication arXiv (v1) : elle n'a pas été évaluée par des pairs, et aucun déploiement industriel ni calendrier de transfert n'est annoncé. Les acteurs de l'humanoïde, dont Figure, Tesla ou Sanctuary, ont besoin de mains dotées de retour tactile, mais publient peu de détails sur la régulation de force. La suite logique sera la comparaison avec d'autres politiques tactiles sur des plateformes différentes, et la vérification que le gain de 83 % contre 35 % se maintient hors du benchmark des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes
4arXiv cs.RO 

ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes

Des chercheurs publient sur arXiv ReCo (Response-Consistent Locomotion), un cadre logiciel pour la manipulation continue sur robots à pattes, c'est-à-dire la tâche qui consiste à suivre précisément une trajectoire avec l'effecteur d'un bras pendant que la base continue de marcher. L'approche combine apprentissage par renforcement (RL) et commande prédictive (MPC). La politique apprise assure une locomotion robuste, tandis que le MPC coordonne la base et le bras pour compenser les erreurs de suivi. La contribution tient en deux briques. Un « response shaping » entraîne la politique à répondre aux commandes de façon cohérente et répétable malgré des dynamiques randomisées. Un modèle de réponse en boucle fermée, identifié ensuite, permet au MPC de planifier conjointement les commandes de locomotion et le mouvement du bras. Sur un benchmark en simulation, ReCo réduit l'erreur quadratique moyenne (RMSE) de position de 28,7 % et celle d'orientation de 27,4 % par rapport au meilleur point de comparaison pour chaque métrique. Des essais sur robot réel démontrent une manipulation continue embarquée, base et bras coordonnés. Le résumé ne précise ni la plateforme, ni la charge utile, ni les temps de cycle. L'enjeu est un problème que connaissent bien les intégrateurs de robots mobiles manipulateurs. Le MPC ne peut compenser que le mouvement de base qu'il sait prédire. Or la réponse d'une politique RL à une commande de vitesse varie avec la phase de marche, les contacts et la charge portée. Cette variabilité rend la compensation imprécise précisément quand le robot transporte quelque chose ou marche sur un sol irrégulier. Rendre la réponse de la politique prévisible plutôt que la corriger après coup est une voie pragmatique pour rapprocher les politiques apprises des contrôleurs à modèle, sans renoncer à la robustesse du RL. Pour un décideur industriel, cela concerne la précision en conditions réelles, souvent le point faible des démonstrations de manipulation sur quadrupèdes. Les gains annoncés restent toutefois mesurés en simulation, face à des références choisies par les auteurs, et la validation matérielle semble qualitative. Il s'agit d'un résultat de recherche, sans produit ni déploiement associé. Ces travaux s'inscrivent dans la lignée de la manipulation « loco-manipulation » sur quadrupèdes équipés d'un bras, où deux écoles s'opposent. L'une repose sur des politiques RL de bout en bout pour l'ensemble du corps. L'autre est hybride, avec un RL pour la marche et une optimisation pour le bras. ReCo se range dans la seconde. Elle vise à combler l'écart entre une politique de marche opaque et un planificateur qui a besoin d'un modèle fiable. La suite logique serait des essais sur d'autres plateformes, avec des charges variées et des tâches plus longues, ainsi qu'une comparaison avec des politiques de corps entier entraînées de bout en bout. Le texte n'annonce aucun calendrier de ce type.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source