Aller au contenu principal
RecherchearXiv cs.RO 

Observer, déduire, se coordonner : inférer les contraintes d'un robot partenaire pour une coordination sans entraînement préalable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (identifiant 2610.02170) un travail intitulé « Watch, Infer, Coordinate », qui porte sur une situation encore peu étudiée en robotique collaborative : un robot doit deviner les limites physiques d'un partenaire sans qu'on les lui ait indiquées. Ces limites peuvent venir d'une dégradation matérielle ou d'une panne d'actionneur, qui restreignent les actions que le partenaire peut exécuter de façon fiable. Le robot « assistant » observe d'abord le partenaire en train de coordonner avec un autre robot, déduit sa capacité réelle, puis s'en sert pour coopérer avec lui sur une tâche nouvelle, sans entraînement supplémentaire (zero-shot). Les auteurs proposent un benchmark couvrant trois configurations de manipulation à couplage physique, par exemple le transport d'un objet trop grand ou trop lourd pour un seul robot. Leur méthode note des contraintes candidates à partir du comportement conjoint observé. Dans les trois configurations, elle améliore nettement l'inférence des contraintes et la coordination, et se rapproche d'un oracle qui connaîtrait les vraies contraintes. Le résumé ne donne ni chiffres précis ni détail sur les plateformes testées.

L'enjeu tient à une asymétrie d'information. Une démonstration montre ce que le robot contraint a fait, pas ce qu'il aurait pu faire. Dans une tâche à couplage physique, son partenaire compense en outre ses faiblesses, ce qui masque la limite au lieu de la révéler. L'idée centrale des auteurs est de lire le comportement de l'équipe entière, car les deux robots portent une information sur la capacité du partenaire contraint. Pour un intégrateur, c'est une piste vers des flottes hétérogènes et vieillissantes où des machines usées, ou tombées en panne partielle, continuent de travailler ensemble sans recalibration manuelle ni échange explicite de leurs spécifications. Les limites sont à garder en tête : il s'agit d'un benchmark académique, probablement en simulation, et rien n'indique un test sur matériel réel. L'écart entre démonstration et déploiement reste donc entier.

Ce travail s'inscrit dans la recherche sur la coordination sans entraînement conjoint (zero-shot coordination) et sur l'inférence des intentions ou des capacités d'un partenaire, domaines plutôt issus de l'apprentissage multi-agent et des jeux coopératifs. Il en déplace le terrain vers la manipulation à contacts. Le papier est une prépublication, sans évaluation par les pairs ni calendrier de pilote. Les suites logiques seraient une validation sur robots physiques et une extension à des contraintes plus variées, ou évoluant dans le temps. Les acteurs industriels du multi-robot, des AMR en logistique aux humanoïdes de manutention, n'y sont pas cités. On ignore pour l'instant si ces idées seront reprises dans des produits.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables
1arXiv cs.RO 

CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables

Des chercheurs présentent CoReLIN, un système de navigation robotique capable de déplacer des objets pour se frayer un chemin lorsque l'environnement est trop encombré pour laisser un passage libre. La plupart des planificateurs de navigation actuels supposent qu'un chemin sans obstacle existe toujours entre le point de départ et l'objectif, une hypothèse qui ne tient pas dans des environnements réels chargés de mobilier ou d'objets épars. Les auteurs formalisent une nouvelle tâche baptisée Lifelong Interactive Navigation, où un robot mobile doté de capacités de manipulation doit réorganiser la scène pour accomplir des séquences de tâches de placement d'objets, sachant que chaque modification de l'environnement a des répercussions durables sur la navigabilité future. CoReLIN s'appuie sur un modèle de langage qui raisonne sur un graphe de scène structuré pour décider quels objets déplacer, où les repositionner et quelles zones explorer ensuite, tandis qu'un planificateur de mouvement classique exécute les primitives de navigation et de manipulation. Sur le simulateur ProcTHOR-10k, le système dépasse la meilleure référence de 16% selon les métriques standards, et se transfère avec succès sur du matériel réel. L'enjeu dépasse la simple prouesse académique: la plupart des robots de service et de logistique évoluent aujourd'hui dans des environnements dynamiques et encombrés, entrepôts, domiciles, hôpitaux, où l'absence de chemin dégagé est la norme plutôt que l'exception. En couplant raisonnement sémantique par LLM et perception active, CoReLIN illustre une tendance de fond du secteur: remplacer la planification purement géométrique par un raisonnement de plus haut niveau capable de décider quand agir sur l'environnement plutôt que de le contourner. Pour évaluer ce comportement à long terme, les auteurs introduisent deux métriques inédites, le Long-term Efficiency Score et le Price of Clutter, qui capturent le taux de réussite, l'efficacité d'exécution et le coût d'optimalité de l'environnement laissé par le robot. Cette approche s'inscrit dans la lignée des travaux récents combinant graphes de scène et modèles de langage pour la planification robotique zero-shot, et ouvre la voie à des tests sur des tâches plus longues et des scènes réelles plus variées.

RecherchePaper
1 source
Personnalisation sans entraînement des gestes de co-parole du robot
2arXiv cs.RO 

Personnalisation sans entraînement des gestes de co-parole du robot

Des chercheurs ont publié le 15 septembre 2026 sur arXiv (2609.13876) une méthode de personnalisation sans réentraînement pour les gestes co-verbaux des robots sociaux, c'est-à-dire les mouvements du corps qui accompagnent la parole. Le système combine un modèle de diffusion audio-conditionné figé avec un encodeur de style et de légers adaptateurs de conditionnement : l'encodeur, d'abord entraîné à distinguer les identités des locuteurs, est ensuite affiné conjointement avec les adaptateurs via l'objectif de diffusion. Résultat concret, une empreinte de style réutilisable s'extrait en une seule passe à partir d'environ 10 secondes de mouvement d'enrôlement. Les auteurs publient aussi une application de capture sur casque Meta Quest 3 et un jeu de données de gestes co-verbaux spontanés recueillis auprès de dix participants. Sur des locuteurs jamais vus à l'entraînement, la précision de reconnaissance de style (SRA) passe de 27,6 % avec le modèle figé de base à 69,5 % avec la méthode proposée, tandis que la qualité du mouvement reste stable (distance de Fréchet des gestes, FGD, de 34,2 contre 34,8). Remplacer l'empreinte d'enrôlement par celle d'une autre personne fait chuter la SRA à 11,4 %, confirmant que le gain provient bien d'une capture réelle du style individuel. Les gestes générés ont ensuite été retransférés sur un robot NAO physique et testés avec cinq voix de synthèse vocale différentes, conservant 67,3 % de SRA en conditions de déploiement. L'enjeu pour l'industrie des robots sociaux est le coût de la personnalisation à l'échelle : jusqu'ici, adapter le style gestuel d'un robot à chaque nouvel utilisateur supposait généralement un réentraînement dédié, impraticable pour un déploiement en retail, accueil ou domicile où les interlocuteurs changent en permanence. Une personnalisation opérationnelle en 10 secondes et sans mise à jour de poids change cette équation économique et rend plus réaliste à court terme l'idée d'un robot qui adapte son style gestuel à chaque utilisateur. Le contrôle par empreinte substituée est méthodologiquement important : il écarte l'hypothèse que l'amélioration ne soit qu'un artefact de bruit du modèle plutôt qu'une vraie capture d'identité. La démonstration sur un robot NAO réel, et pas seulement en simulation ou en rendu d'avatar virtuel, réduit l'écart habituel entre démonstration académique et faisabilité physique, même si le NAO reste une plateforme modeste, peu représentative des humanoïdes bipèdes plus ambitieux du marché. Les auteurs restent transparents sur l'échelle limitée de leur validation, dix participants et un jeu de données propriétaire, ce qui appelle confirmation sur des cohortes plus larges. Ce travail s'inscrit dans la lignée des modèles de diffusion conditionnés par l'audio pour la génération de gestes, une piste déjà explorée pour l'animation d'avatars virtuels et de robots sociaux, où la personnalisation par locuteur restait jusqu'ici coûteuse en calcul et en données. L'approche par adaptateurs légers greffés sur un prior gelé rappelle les techniques d'adaptation paramétrique légère utilisées en génération d'image et de texte, transposées ici au mouvement robotique. Aucune entreprise commerciale n'est associée à cette publication, purement académique, mais les auteurs facilitent la reproductibilité en diffusant leur application de capture Quest 3 et leur jeu de données. Les suites évoquées sont l'extension à un plus grand nombre de locuteurs et à d'autres plateformes robotiques, avec un potentiel d'intégration dans des robots sociaux commerciaux comme Pepper ou Furhat, où la personnalisation de l'interaction constitue un argument de différenciation face à des offres encore largement scriptées.

RecherchePaper
1 source
« Coordination homme-robot sans apprentissage préalable grâce au raisonnement structuré des LLM face à des objectifs cachés »
3arXiv cs.RO 

« Coordination homme-robot sans apprentissage préalable grâce au raisonnement structuré des LLM face à des objectifs cachés »

Des chercheurs présentent une architecture structurée à base de grands modèles de langage (LLM) pour la coordination homme-robot en zero-shot, c'est-à-dire sans apprentissage préalable spécifique à la tâche, quand chaque partenaire ne dispose que d'une vue privée de l'objectif commun. Formalisée comme un Dec-POMDP (processus de décision markovien partiellement observable et décentralisé), l'architecture décompose la prise de décision en cinq étapes : inférence de théorie de l'esprit conditionnée à l'action, planification hiérarchique, interprétation de la conversation, vérification des actions, et replanification à partir des retours. Testée sur une tâche de construction coopérative où robot et humain ne voient chacun qu'une partie de l'objectif final, la méthode est comparée à deux références : une version sans le module de théorie de l'esprit, et une politique d'apprentissage par renforcement multi-agent entraînée hors ligne sur de nombreuses paires d'objectifs. Lors d'expériences avec des participants humains, la méthode complète a nécessité moins d'étapes d'interaction et obtenu de meilleures notes de confiance post-interaction que les deux références. Ces résultats intéressent directement la recherche en interaction homme-robot : ils suggèrent qu'un LLM peut servir de substitut praticable à des calculs d'inférence et de planification autrement intraitables, tout en conservant une couche de vérification classique pour garantir la faisabilité physique des actions. Le gain ne vient pas d'un modèle bout-en-bout mais d'une décomposition explicite du problème de décision d'équipe, où le LLM traite seulement les sous-tâches de raisonnement social et de langage. Pour les équipes travaillant sur des robots collaboratifs ou des tâches à information partagée incomplète, cela plaide pour des architectures modulaires plutôt que des politiques entraînées de bout en bout, coûteuses à généraliser à de nouveaux objectifs. Le travail s'inscrit dans la recherche sur la théorie de l'esprit computationnelle et la coordination multi-agents, un champ où les politiques de renforcement multi-agent peinent traditionnellement à généraliser en zero-shot à des objectifs ou partenaires inédits. En ancrant leur architecture dans le cadre théorique du Dec-POMDP, les auteurs la rattachent à des décennies de recherche en planification sous incertitude partagée. L'article ne mentionne aucun calendrier de déploiement industriel : il s'agit d'une preuve de concept en laboratoire, qui ouvre la voie à des tests sur des tâches physiques plus complexes et des équipes homme-robot élargies.

RecherchePaper
1 source
Coordination multi-robots adaptative et ouverte à travers des environnements, partenaires et échelles inédits
4arXiv cs.RO 

Coordination multi-robots adaptative et ouverte à travers des environnements, partenaires et échelles inédits

Une équipe de recherche publie sur arXiv (2607.04972v1) un nouveau cadre nommé HOLA, pour Hypergraphic Open-ended Learning Algorithm, destiné à coordonner des équipes de robots capables de s'adapter simultanément à des environnements inconnus, des partenaires inconnus et des tailles d'équipe variables. Contrairement aux approches classiques qui supposent une composition d'équipe fixe (le "closed-world assumption"), les chercheurs modélisent la coopération via un jeu sous forme hypergraphique, une construction théorique des jeux qui capture les relations coopératives à l'échelle de l'équipe entière plutôt que seulement des interactions par paires, à la différence des architectures de réseaux de neurones sur graphes. L'algorithme HOLA entraîne les agents en élargissant progressivement la diversité des partenaires et des environnements plutôt qu'en optimisant pour une configuration figée. Testé sur des tâches de poursuite coopérative, le système a été validé sur des essaims multi-drones et multi-quadrupèdes, avec des déploiements réels sur les plateformes Crazyflie (drones du fabricant suédois Bitcraze) et Zsibot L1 (quadrupèdes), sans réglage fin supplémentaire lors du transfert du simulateur au matériel physique. Ce résultat compte pour l'industrie de la robotique en essaim et multi-agents parce qu'il attaque de front un angle mort connu du secteur: la plupart des systèmes multi-robots démontrés en recherche restent calibrés pour une équipe et un environnement fixés à l'avance, ce qui limite leur usage en conditions réelles où les partenaires, leur nombre et le terrain changent en permanence. Un transfert sim-to-réel direct et sans fine-tuning, s'il se confirme à plus grande échelle, réduit un coût d'ingénierie important pour les intégrateurs qui déploient des flottes hétérogènes de drones ou de robots à pattes. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement multi-agents et des méthodes d'apprentissage "open-ended" par diversification progressive des adversaires et partenaires, popularisées notamment dans les jeux de population type league training. Les auteurs annoncent avoir surpassé toutes les méthodes de référence sur les trois axes d'adaptabilité testés (environnement, partenaires, échelle), ouvrant la voie à des essais sur des flottes plus larges et des plateformes robotiques supplémentaires.

UELe système est validé sur les drones Crazyflie du fabricant suédois Bitcraze, une plateforme robotique européenne utilisée pour ces travaux de recherche avancée en coordination multi-agents.

RecherchePaper
1 source