Aller au contenu principal
RecherchearXiv cs.RO 

Arbitrage tenant compte des capacités pour le contrôle partagé basé sur l'intention sémantique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article déposé sur arXiv (2609.25369v1) présente un cadre de contrôle partagé homme-robot conscient des capacités. Un modèle vision-langage (VLM) infère l'intention humaine et produit une confiance sémantique, tandis qu'une politique vision-langage-action (VLA) génère les actions autonomes du robot ; la fiabilité de cette dernière est estimée en ligne à partir de la dispersion et de l'instabilité locale des trajectoires stochastiques qu'elle produit. Un arbitrage non linéaire combine ces deux signaux, filtrés par une approche bayésienne, via une fonction sigmoïde, pour ajuster dynamiquement le niveau d'autorité laissé au robot. Le système a été testé auprès de 12 participants sur des tâches de préhension-dépôt et d'empilement bidirectionnel, en conditions connues et en conditions inédites (hors distribution d'entraînement). La méthode proposée atteint un taux de réussite de 92%, contre 83% en téléopération manuelle pure, 44% pour un arbitrage basé sur la seule intention, et seulement 10% pour un mélange à poids fixes et égaux entre humain et robot.

Ce travail cible un défaut connu des systèmes de contrôle partagé actuels : allouer l'autorité au robot sur la seule confiance dans l'intention détectée suppose implicitement que l'exécution autonome sera fiable, ce qui pousse le système à trop aider quand ce n'est pas le cas. En ajoutant une estimation indépendante et continue de la fiabilité réelle de la politique VLA, l'étude s'attaque à un problème central du déploiement de ces modèles en conditions réelles : une confiance élevée affichée par un modèle n'implique pas une exécution correcte, en particulier hors distribution. Pour les intégrateurs qui déploient des architectures VLA en téléopération assistée ou en cobotique industrielle, cette approche fournit une piste concrète pour réduire les échecs silencieux, sans dépendre uniquement de la compréhension du langage par le robot.

Cette publication s'inscrit dans la lignée des recherches récentes sur le contrôle partagé appuyé sur des politiques VLA génériques, dans l'esprit de Pi-0, GR00T N2 ou Helix, déployées en téléopération comme en autonomie complète. Contrairement à ces architectures orientées produit, il s'agit ici d'une contribution académique déposée sur arXiv, sans fabricant de robots, partenaire industriel ni acteur français ou européen cité dans le texte, et reposant sur un échantillon modeste de 12 participants, typique de ce stade de recherche en robotique interactive. L'article ne mentionne ni robot cible ni calendrier de transfert vers un produit commercial ; les suites logiques attendues seraient une validation à plus grande échelle et des tests sur des tâches de manipulation plus complexes ou des plateformes robotiques réelles.

À lire aussi

Avant que le corps ne bouge : apprentissage de l'intention articulaire anticipatoire pour le contrôle d'humanoïdes guidé par le langage
1arXiv cs.RO 

Avant que le corps ne bouge : apprentissage de l'intention articulaire anticipatoire pour le contrôle d'humanoïdes guidé par le langage

Une équipe de chercheurs a déposé le 14 mai 2026 sur arXiv (arXiv:2605.14417) un framework hiérarchique nommé DAJI (Dynamics-Aligned Joint Intent), destiné au contrôle en continu du corps entier d'humanoïdes via des instructions en langage naturel. L'architecture repose sur deux modules distincts : DAJI-Act, une politique d'action par diffusion déployable, entraînée en distillant un modèle "teacher" conscient du futur via des rollouts guidés par un modèle étudiant ; et DAJI-Flow, qui génère de façon autorégressive des blocs d'"intentions articulaires" futures à partir d'une instruction linguistique et de l'historique d'intentions. Sur le benchmark HumanML3D, DAJI atteint 94,42 % de taux de succès en génération de séquences. Sur BABEL, le framework obtient un FID de sous-séquence de 0,152, une métrique de fidélité cinématique. Le problème que DAJI cherche à résoudre est central dans la commande des humanoïdes : les approches existantes génèrent des références cinématiques que le contrôleur bas niveau doit corriger de manière réactive, ce qui introduit des délais et des instabilités lors des transitions de support (transferts d'appui, changements de contact). DAJI propose à la place une interface d'"intention articulaire anticipatoire" qui encode explicitement les futures transitions de contact, les transferts de poids et les préparations à l'équilibre avant que le corps ne les exécute. Pour les intégrateurs de robots humanoïdes, c'est une piste sérieuse pour réduire le reality gap simulation-déploiement, puisque le pipeline diffusion + anticipation est conçu pour être réellement embarqué, pas seulement simulé. Cela valide aussi l'hypothèse qu'une représentation explicite et interprétable de l'intention mécanique future peut coexister avec un pilotage par langage naturel en streaming. Ce travail s'inscrit dans une compétition académique et industrielle dense sur le contrôle des humanoïdes conditionné par le langage. Des approches comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les politiques VLA de Figure explorent des territoires proches, mais privilégient souvent des représentations latentes dont les sorties n'encodent pas explicitement l'état mécanique futur. DAJI se distingue en faisant de l'"intent" une variable interprétable et structurée. Il faut néanmoins noter que les résultats sont obtenus exclusivement sur des benchmarks de génération de mouvements (HumanML3D, BABEL) et non sur robot physique : il s'agit d'une preuve de concept académique, pas d'un système déployé. La validation sur plateforme réelle, sur un Unitree G1, un Agility Digit ou équivalent, reste la prochaine étape non annoncée.

RechercheOpinion
1 source
Robot humanoïde : apprendre des interventions de sécurité personnalisées pour le contrôle partagé haptique humain-robot
2arXiv cs.RO 

Robot humanoïde : apprendre des interventions de sécurité personnalisées pour le contrôle partagé haptique humain-robot

Traduction de l'article demandée. Un système de retour haptique personnalisé permet désormais aux robots partagés en téléopération d'apprendre les préférences de sécurité individuelles d'un utilisateur à partir de démonstrations limitées, plutôt que d'imposer des réglages génériques prédéfinis. L'approche, baptisée Learning from Haptics (LfH), s'appuie sur une couche d'optimisation différentiable fondée sur des fonctions de barrière de contrôle (Control Barrier Function, CBF), un outil mathématique classique pour garantir qu'un système reste dans une zone d'état sûre. Concrètement, l'opérateur n'a plus besoin de régler manuellement les paramètres du contrôleur par essais-erreurs: il montre au système comment il souhaite que celui-ci intervienne pendant la téléopération, et l'algorithme ajuste automatiquement les paramètres de sécurité sous-jacents pour reproduire ce comportement démontré. Les auteurs ont validé le cadre à la fois en simulation et sur un banc matériel réel, montrant que le système apprend des interventions personnalisées à partir de peu de données utilisateur et réduit l'écart entre le retour haptique généré et les préférences réellement démontrées. Cette avancée s'attaque à une limite connue des systèmes de guidage haptique en contrôle partagé humain-robot: les stratégies d'intervention prédéfinies ne s'adaptent ni aux préférences individuelles des opérateurs, ni aux spécificités de chaque scénario applicatif (chirurgie assistée, téléopération industrielle, exosquelettes, manipulation à distance). Pour les intégrateurs et concepteurs de systèmes à contrôle partagé, cela signifie potentiellement moins de temps de calibration terrain et une meilleure acceptabilité utilisateur, un facteur souvent négligé mais déterminant dans l'adoption réelle de ces interfaces. Le résultat conforte aussi une tendance plus large en robotique interactive: remplacer le réglage manuel de paramètres de contrôle par de l'apprentissage à partir de démonstrations éparses, une approche qui gagne du terrain face aux méthodes classiques de tuning expert. Le travail s'inscrit dans la lignée des recherches sur le contrôle partagé haptique et les CBF, deux domaines matures séparément mais rarement combinés de façon apprenante. Les CBF sont largement utilisés en robotique de sécurité (véhicules autonomes, manipulateurs collaboratifs) pour garantir formellement l'évitement de zones dangereuses, mais leurs paramètres restent généralement fixés à la main par des experts. En les rendant différentiables et ajustables par apprentissage, les auteurs ouvrent la voie à des systèmes de téléopération qui s'adaptent utilisateur par utilisateur. L'article, publié sur arXiv fin juillet 2026, ne précise pas de partenaire industriel ni de calendrier de déploiement au-delà des expériences en laboratoire, ce qui en fait pour l'instant un travail de recherche fondamentale plutôt qu'une solution prête à l'intégration.

RecherchePaper
1 source
BEACON : contrôle adaptatif basé sur la croyance pour l'apprentissage par imitation en contexte incertain
3arXiv cs.RO 

BEACON : contrôle adaptatif basé sur la croyance pour l'apprentissage par imitation en contexte incertain

Une équipe de recherche présente BEACON (Belief-Enabled Adaptive CONtrol), une méthode d'apprentissage par imitation pour la manipulation robotique en environnement partiellement observable, décrite dans un article publié sur arXiv le 22 septembre 2026 (arXiv:2609.22730v1). Le problème ciblé : quand une tâche de manipulation dépend d'un état caché qui ne peut être observé directement mais doit être inféré via des interactions physiques successives, conditionner une politique uniquement sur l'historique brut d'observations récentes produit de mauvaises performances, un phénomène appelé aliasing d'état, où des observations identiques correspondent à des états cachés différents et génèrent des étiquettes d'action contradictoires pour une même entrée. BEACON conditionne à la place une politique de diffusion sur une représentation structurée de croyance bayésienne, qui expose à la fois l'estimation la plus probable de l'état courant et l'incertitude résiduelle. La méthode est testée sur deux tâches aux représentations de croyance qualitativement différentes : une croyance continue pour l'alignement d'une pince sur une tige de maïs via détection tactile, et une distribution catégorielle discrète pour l'ouverture d'une porte verrouillée. Sur les deux tâches, la politique conditionnée par la croyance surpasse nettement la référence fondée uniquement sur l'observation et s'approche de la performance obtenue avec un accès privilégié à la vérité terrain sur l'état caché. Des ablations montrent que la politique module implicitement son comportement entre exploration et exploitation selon le niveau d'incertitude au moment de l'inférence, sans bascule de mode explicite ni ingénierie de récompense. Ce résultat cible une limite connue des politiques d'apprentissage par imitation conditionnées sur historique brut, y compris dans des architectures type vision-langage-action : leur difficulté à distinguer des états physiquement différents mais similaires en apparence ou au toucher, un problème fréquent en manipulation fine où le contact porte l'essentiel de l'information utile. Pour des intégrateurs travaillant sur la préhension délicate ou la manipulation d'objets à contrainte mécanique cachée (loquets, verrous, alignement d'outils agricoles), l'approche esquisse une voie pour réduire l'écart entre démonstrations contrôlées et robustesse en conditions réelles, sans dépendre uniquement de volumes massifs de données. BEACON s'inscrit dans la lignée des politiques de diffusion pour l'apprentissage par imitation, devenues une approche de référence en manipulation robotique ces dernières années, et s'attaque spécifiquement à leur angle mort en environnement partiellement observable. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche évalué en laboratoire sur des tâches ciblées, sans mise à l'échelle annoncée ni calendrier de transfert vers des plateformes commerciales.

RecherchePaper
1 source
Combler l'écart d'exécution : des contraintes sémantiques de mouvement au contrôle cinématique
4arXiv cs.RO 

Combler l'écart d'exécution : des contraintes sémantiques de mouvement au contrôle cinématique

Une équipe de chercheurs publie sur arXiv (réf. 2605.12053, mai 2026) un framework open source baptisé Giskard, conçu pour combler ce que les auteurs nomment le "Motion Execution Gap" : l'écart entre les descriptions symboliques de tâches robotiques, exprimées sous forme de contraintes sémantiques de haut niveau, et les commandes cinématiques réellement exécutables par un robot. La pièce centrale est le concept de Motion Statecharts, une représentation symbolique exécutable permettant d'organiser des contraintes de mouvement, des moniteurs d'état et des statecharts imbriqués en parallèle ou en séquence. L'exécution repose sur une implémentation par MPC linéaire (lMPC) de l'approche task-function, avec des bornes sur le jerk pour assurer des transitions fluides lors des changements de tâche. La généralisation entre morphologies est rendue possible par un modèle cinématique du monde différentiable et unifié, couvrant simultanément le robot et son environnement. La méthode a été déployée et validée sur huit plateformes robotiques distinctes opérant dans des environnements variés. Ce travail s'attaque à un goulot d'étranglement structurel bien identifié dans la communauté : les planificateurs symboliques issus de l'IA cognitive ou de la planification classique décrivent ce qu'il faut faire, mais la translation vers des trajectoires cinématiques sûres et fluides reste un défi persistant. La démonstration sur huit plateformes différentes constitue un signal fort de transferabilité inter-plateformes, là où la majorité des solutions de génération de mouvement restent étroitement liées à une architecture matérielle spécifique. Pour un intégrateur ou un COO industriel, la spécification "world-centric" proposée promet de réduire concrètement le coût de réadaptation lors d'un changement de cellule robotique ou de morphologie. Giskard est issu du groupe CRAM (Cognitive Robot Abstract Machine) de l'Université de Brême, acteur européen de référence en robotique cognitive. L'approche task-function sur laquelle s'appuie le framework est une méthode de contrôle éprouvée, mais son intégration avec une représentation symbolique exécutable et multi-niveaux via statecharts est moins courante. Les solutions concurrentes dans l'écosystème production incluent MoveIt (ROS, très répandu mais limité sur les transitions de tâches complexes) et les planificateurs réactifs à base d'arbres de comportement. Ce document est un preprint arXiv, non encore évalué par les pairs : les résultats sur les huit plateformes restent à confirmer par une reproduction indépendante. La publication du code source sur GitHub (github.com/cram2/cognitive\robot\abstract\_machine) offre toutefois une base tangible pour que la communauté robotique puisse en évaluer la portée réelle.

UEGiskard est développé par le groupe CRAM de l'Université de Brême, acteur européen de référence en robotique cognitive ; sa publication open source bénéficie directement aux intégrateurs et laboratoires européens cherchant à réduire les coûts de portage lors de changements de plateformes robotiques.

RecherchePaper
1 source