Aller au contenu principal
Duet : une compréhension entre deux robots grâce à un enseignement efficace
RecherchearXiv cs.RO 

Duet : une compréhension entre deux robots grâce à un enseignement efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié DUET, un framework d'apprentissage pour la coordination de deux robots dans des tâches de manipulation mobile collaborative, comme le transport conjoint d'objets ou les passations coordonnées entre bras. Le système repose sur une plateforme de téléopération synchronisée en réalité virtuelle capable de piloter deux embodiments hétérogènes simultanément pour collecter des données in-domain, complétée par un pipeline de tracking qui enregistre des démonstrations de coordination humain-humain et des priors de manipulation collaborative. L'architecture d'apprentissage s'appuie sur un Action Chunking Transformer, d'abord pré-entraîné sur ces démonstrations humaines puis affiné sur un nombre restreint de trajectoires réelles collectées par téléopération robot. Les auteurs évaluent l'approche sur un benchmark de quatre tâches collaboratives, avec un humanoïde Unitree G1 associé à un manipulateur mobile Dexmate Vega1. Résultat chiffré principal : la collecte de données via démonstrations humaines est 5,4 fois plus rapide en moyenne que la téléopération robot directe, tout en produisant des politiques plus performantes que celles entraînées uniquement sur données robot. Le papier, référencé arXiv 2606.20990, en est à sa deuxième version.

L'intérêt principal tient au goulot d'étranglement qu'il attaque : la collecte de données reste le facteur limitant pour entraîner des systèmes multi-robots, un problème encore plus aigu que pour un robot unique puisqu'il faut synchroniser deux embodiments et deux comportements coordonnés. En démontrant qu'un pré-entraînement sur des démonstrations humain-humain se transfère efficacement vers des politiques robot-robot, DUET propose une piste concrète pour réduire le coût de téléopération réelle, un enjeu direct pour les laboratoires et intégrateurs qui cherchent à faire monter en échelle l'apprentissage de comportements coopératifs sans multiplier les heures de pilotage sur du matériel physique coûteux.

Ce travail s'inscrit dans le mouvement plus large de l'apprentissage par imitation appliqué aux politiques génériques (VLA), où des systèmes comme GR00T N2, Pi-0 ou Helix explorent des architectures comparables mais restent centrés sur un seul robot ou un humanoïde generalist isolé. DUET se distingue en ciblant spécifiquement la coordination inter-robots. Il s'agit à ce stade d'un résultat de recherche publié en preprint, avec page projet dédiée, sans indication de déploiement industriel ni de partenariat commercial annoncé.

À lire aussi

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine
1arXiv cs.RO 

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine

Des chercheurs ont présenté HOST (Human-to-robot One-Shot Skill AcquisiTion), un framework permettant à un robot d'acquérir une nouvelle compétence de manipulation à partir d'une seule vidéo humaine, en 29 secondes en moyenne au moment de l'inférence. Le système fonctionne par une cascade de prédictions auto-référencées : il estime d'abord la progression du robot dans la tâche démontrée, traduit cette progression en observations futures propres à l'embodiment du robot, puis en déduit les actions à exécuter. L'entraînement de cette cascade s'appuie sur une correspondance entre la trajectoire du robot et la vidéo de démonstration, projetées sur une même variété de progression de tâche, ce qui permet d'aligner les cibles d'apprentissage sur le déroulé futur de la vidéo. Sur les tâches testées, HOST atteint un taux de réussite moyen de 62%, soit 45 points de plus qu'une baseline zero-shot, tout en conservant les compétences déjà maîtrisées par le robot. Ce résultat s'attaque directement à un goulot d'étranglement connu du secteur de la robotique manipulatrice : les méthodes actuelles d'apprentissage de compétences reposent sur des boucles d'entraînement lourdes et coûteuses, qui en plus dégradent souvent les compétences précédemment acquises à chaque nouvel apprentissage (le problème dit du "catastrophic forgetting"). En affichant des performances supérieures à une baseline fine-tunée sur 50 démonstrations robot par tâche, tout en n'utilisant qu'une seule vidéo humaine et 507 fois moins de temps d'acquisition, HOST illustre une piste concrète pour réduire drastiquement le coût de déploiement des VLA (vision-language-action models) en environnement industriel réel, un enjeu central pour les intégrateurs qui doivent reconfigurer rapidement des cellules robotiques sur de nouvelles références produit sans campagne de collecte de données coûteuse. Cette approche s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation cross-embodiment, où des modèles comme GR00T N2 ou Pi-0 cherchent également à exploiter des données humaines ou hétérogènes pour accélérer l'apprentissage robotique. La contribution spécifique de HOST réside dans sa capacité à opérer en one-shot, à l'inférence, sans réentraînement du modèle sous-jacent, et sans effacer les compétences déjà en mémoire du robot. Les auteurs renvoient vers un site du projet pour des démonstrations complémentaires ; il s'agit à ce stade de résultats de recherche publiés sur arXiv, non d'un produit ou d'un déploiement industriel.

RecherchePaper
1 source
Comment enseigner la même compétence à différents robots
2Robohub 

Comment enseigner la même compétence à différents robots

Des chercheurs de l'EPFL ont publié en 2026 dans la revue Science Robotics un nouveau cadre de contrôle robotique baptisé "Kinematic Intelligence", développé au sein du laboratoire LASA (Learning Algorithms and Systems Laboratory) sous la direction d'Aude Billard. Le principe repose sur trois étapes : une tâche démontrée une seule fois par un opérateur humain est capturée via motion-capture, convertie mathématiquement en une stratégie de mouvement générique, puis automatiquement adaptée aux contraintes cinématiques de chaque robot cible (amplitudes articulaires, positions d'équilibre, limites mécaniques). Dans une expérience conduite sur une ligne d'assemblage, un humain démontre trois actions successives - pousser un bloc de bois d'un convoyeur vers un établi, le déposer sur une table, puis le lancer dans un panier - et trois robots commerciaux de morphologies différentes reproduisent fidèlement cette séquence, y compris lorsque la répartition des étapes entre machines est modifiée en cours d'exécution. L'enjeu industriel est direct : reprogrammer une flotte de robots lors d'un changement de génération matérielle représente aujourd'hui un coût significatif en temps et en expertise, même quand les nouvelles machines remplissent des fonctions identiques. Kinematic Intelligence propose une alternative concrète : démontrer une fois, déployer sur plusieurs plateformes sans réécriture. Pour les intégrateurs et les décideurs industriels, cela ouvre la voie à une réduction du temps de mise en service et à une meilleure résilience face à l'évolution rapide du hardware robotique. La publication valide également une hypothèse structurante : un transfert de compétences cross-robot peut garantir formellement un comportement sûr et prédictible, sans recourir à de l'apprentissage par renforcement spécifique à chaque plateforme. Sthithpragya Gupta (doctorant LASA, co-premier auteur) et Durgesh Haribhau Salunkhe (chercheur LASA, co-premier auteur) soulignent que "chaque robot interprète la même compétence à sa façon, mais toujours dans des limites sûres et faisables". À noter : aucune métrique de taux de succès agrégé ni de temps de cycle n'est communiquée publiquement, ce qui limite l'évaluation quantitative de la robustesse à grande échelle. Le LASA est un laboratoire de référence en apprentissage par démonstration (Learning from Demonstration), avec une trajectoire longue sur l'imitation du mouvement humain. La recherche s'inscrit dans un paysage concurrentiel dense : les approches VLA (Vision-Language-Action) de Google DeepMind, pi-0 de Physical Intelligence ou les frameworks sim-to-real de Figure AI et Boston Dynamics visent eux aussi à réduire le coût de déploiement cross-plateforme, mais s'appuient sur de grands volumes de données et du fine-tuning. Kinematic Intelligence se distingue par son approche analytique et sa garantie formelle de sécurité, deux propriétés potentiellement attractives dans des environnements réglementés comme l'industrie pharmaceutique, automobile ou agroalimentaire. Les prochaines étapes annoncées incluent la collaboration humain-robot et l'interaction en langage naturel, avec l'ambition de rendre le système opérable sans expertise en programmation robotique.

UELa recherche de l'EPFL-LASA ouvre une piste concrète pour les intégrateurs industriels européens souhaitant réduire les coûts de reprogrammation lors des renouvellements de flottes robotiques, notamment dans les secteurs pharmaceutique, automobile et agroalimentaire.

RecherchePaper
1 source
OSDAG : planification en ligne pour une collaboration multi-robots efficace
3arXiv cs.RO 

OSDAG : planification en ligne pour une collaboration multi-robots efficace

Des chercheurs ont publié le 18 juin 2026 sur arXiv (réf. 2606.15255) un framework appelé OSDAG, conçu pour coordonner des flottes de robots hétérogènes sur des tâches longues et complexes en combinant raisonnement par grand modèle de langage (LLM) et ordonnancement en ligne par graphe orienté acyclique (DAG). Le principe central : le LLM n'est invoqué qu'une seule fois, à la réception d'une instruction en langage naturel, pour décomposer la tâche en un graphe annoté de dépendances. Un ordonnanceur léger prend ensuite le relais en temps réel pour affecter à chaque robot disponible les sous-tâches dont les prérequis sont satisfaits. Les expériences portent sur cinq scénarios de référence, incluant des validations en simulation et sur des systèmes réels de manipulation à deux bras. Les résultats annoncés sont un gain de raisonnement de 5 à 15 fois par rapport aux approches conversationnelles, et une réduction du makespan (temps total d'exécution de la flotte) allant jusqu'à 38 % face aux baselines séquentielles, avec des taux de succès restant comparables. L'intérêt architectural est réel pour les intégrateurs de systèmes multi-robots : l'approche résout deux goulots d'étranglement identifiés dans les méthodes LLM existantes. Le premier est la latence cumulée des appels LLM répétés à chaque étape d'exécution, qui empire linéairement avec le nombre d'agents. Le second est l'ordonnancement pré-engagé hors ligne, qui force les robots à attendre leurs prédécesseurs même quand des tâches indépendantes sont disponibles. En encodant à la fois les contraintes de précédence et les contraintes de ressources dans le DAG, OSDAG expose tout le parallélisme exploitable sans sacrifier la correction du plan. Sur des lignes d'assemblage ou des entrepôts logistiques, cette distinction entre "planifier une fois" et "ordonnancer en continu" peut transformer la densité d'utilisation d'une flotte. OSDAG s'inscrit dans une vague de travaux cherchant à rendre les LLM opérationnels pour la robotique collaborative, aux côtés de frameworks comme SayPlan, RoCo ou les approches VLA (Vision-Language-Action). Ces méthodes souffrent généralement du dialogue-loop problem : chaque décision remonte au modèle, ce qui devient prohibitif à l'échelle. OSDAG adopte une architecture de séparation stricte planification/exécution, plus proche des moteurs de workflow industriels (type BPMN) que des agents conversationnels. Les auteurs valident sur des bras manipulateurs duaux, un environnement contrôlé, mais l'extension à des flottes AMR en entrepôt ou à des cellules de production réelles reste à démontrer. Le code et les ressources sont accessibles sur le site du projet (thanhnguyencanh.github.io/LLM_DAG4MultiRobot). Aucun partenariat industriel ni timeline de déploiement n'est mentionné : il s'agit d'une contribution de recherche, pas d'un produit.

UELes intégrateurs européens de flottes multi-robots (logistique, assemblage automatisé) pourraient bénéficier de ce framework open-source, mais aucun acteur ou déploiement européen n'est impliqué à ce stade.

RecherchePaper
1 source
Communication efficace du mouvement du cou d'un robot : axe unique vs multi-axes
4arXiv cs.RO 

Communication efficace du mouvement du cou d'un robot : axe unique vs multi-axes

Un consortium de chercheurs en robotique publie sur arXiv (arXiv:2607.07390v1) un cadre théorique inédit pour mesurer l'efficacité communicative des mouvements de cou robotiques. L'équipe a utilisé une plateforme de cou robotique dotée de trois degrés de liberté (DoF) en rotation et a enregistré 84 stimuli vidéo en faisant varier l'amplitude, l'accélération et la fréquence des mouvements sur un, deux ou trois axes simultanément. Pour chaque configuration, les chercheurs ont calculé l'entropie de Shannon des signaux de changement de pixels, une mesure de l'information transmise visuellement, tout en mesurant la consommation énergétique associée. Une étude perceptive complémentaire a permis de valider comment des observateurs humains interprètent ces gestes. Résultat central: l'information communicative culmine à deux DoF actifs puis chute au troisième, alors même que la dépense énergétique continue d'augmenter, un phénomène que les auteurs baptisent le goulot d'étranglement informationnel morphologique. Cette découverte contredit une hypothèse répandue dans la conception des robots humanoïdes, selon laquelle multiplier les degrés de liberté du cou améliorerait automatiquement l'expressivité. Pour les ingénieurs et intégrateurs qui conçoivent des interfaces homme-robot, cela signifie qu'ajouter un troisième axe de rotation n'apporte aucun bénéfice communicatif, gaspille de l'énergie et, pire, brouille la lisibilité du geste selon les données perceptives collectées auprès des participants humains. Les auteurs proposent un nouvel outil, le Motor Information Space, qui met en regard entropie et énergie pour comparer différentes morphologies de cou robotique. Dans ce cadre, la configuration optimale identifiée atteint 5,26 bits d'information pour un coût énergétique jugé compétitif. Ce travail s'inscrit dans un champ de recherche plus large sur la communication non verbale des robots sociaux, où le mouvement de tête et de cou joue un rôle clé dans la signalisation d'intentions ou d'émotions chez l'humain. En établissant une base quantitative pour arbitrer entre complexité mécanique et clarté du signal, l'étude fournit aux concepteurs de robots humanoïdes un critère chiffré pour orienter le choix du nombre d'axes motorisés au niveau du cou, plutôt que de calquer par défaut l'anatomie humaine ou de multiplier les DoF par souci de réalisme.

RecherchePaper
1 source