Aller au contenu principal
GUIDER : évaluation de l'inférence d'intention humaine sans objectif pour la téléopération sur données réelles de robots
RecherchearXiv cs.RO 

GUIDER : évaluation de l'inférence d'intention humaine sans objectif pour la téléopération sur données réelles de robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent une évaluation du cadre GUIDER, pour Global User Intent Dual-phase Estimation for Robots, un système probabiliste dit "goal-free" conçu pour inférer l'intention humaine pendant une manipulation robotique téléopérée, c'est-à-dire sans connaître à l'avance l'objet cible visé par l'opérateur. Le système a été testé sur des données réelles enregistrées par un bras robotique, dans trois scénarios d'assistance: préparer du thé et aller chercher un médicament. Pour rendre l'estimation exploitable en conditions réelles, les auteurs ont ajouté une mise à jour probabiliste en ligne, des limites d'espace de travail, un filtrage par plan de support et un mode de préhension qui priorise les zones de prise physiquement faisables. Sur 20 étapes de manipulation réparties dans les trois scénarios, GUIDER a identifié l'intention correcte parmi l'ensemble des candidats de préhension dans 100% des cas, avec un temps moyen de 3,7 secondes avant d'atteindre une prédiction fiable, alors qu'il restait en moyenne 49,6 secondes avant la première prise effective. La stabilité des prédictions atteint 96,4%, pour un temps de calcul de 4,857 secondes (moyenne) et 4,474 secondes (médiane) par phase perceptuelle.

Pour les concepteurs de robots collaboratifs et de systèmes d'assistance, notamment dans le soin à la personne ou la téléopération partagée, ce travail répond à une limite connue des interfaces d'intention: la plupart exigent un objectif prédéfini, ce qui les rend rigides face à des environnements domestiques non structurés. Un système fonctionnant sans objectif fixé à l'avance, avec une marge de près de 46 secondes entre la prédiction fiable et l'action physique, laisse en théorie le temps à un opérateur humain d'intervenir ou de corriger. Il faut toutefois noter que les temps de calcul par phase, proches de 4,5 à 4,9 secondes, restent loin du temps réel et que les tests ont été menés hors ligne sur des données déjà enregistrées, en reproduisant leurs conditions temporelles d'origine, et non lors d'un déploiement en direct avec un utilisateur dans la boucle.

Ce travail s'inscrit dans le champ de la téléopération à autonomie partagée, où l'estimation d'intention sert à assister ou corriger les gestes d'un opérateur distant. En évaluant GUIDER sur des données de bras robotique réel plutôt qu'en simulation, les auteurs cherchent à valider la robustesse du cadre face à des scènes concrètes de manipulation domestique. Les suites naturelles évoquées par ce type d'évaluation sont un déploiement en boucle fermée avec un opérateur humain réel et une extension à d'autres plateformes robotiques et scénarios d'assistance.

Dans nos dossiers

À lire aussi

Évaluation de l'état de préhension centrée sur l'humain : transférer l'évaluation subjective aux robots
1arXiv cs.RO 

Évaluation de l'état de préhension centrée sur l'humain : transférer l'évaluation subjective aux robots

Des chercheurs détaillent dans une prépublication arXiv (2609.17540, mise en ligne mi-septembre 2026) un framework qui transféré a un robot le jugement subjectif qu'un humain porte sur la qualité d'une prise appliquée a un objet déformable. Le système associe un modèle vision-langage (VLM), charge de générer semi-automatiquement des labels de supervision, a un prédicteur léger d'état de prise : a partir d'un très petit nombre d'essais annotes manuellement par des humains, utilises comme ancres contextuelles, le VLM propage ce jugement a de larges volumes de données non annotées. Une fois entraine, le prédicteur estime en continu, a partir de mesures tactiles et de force de préhension en série temporelle, si la prise est trop laxiste ou trop serrée, et permet un ajustement rapide de la force en ligne. La méthode a été validée sur trois objets déformables représentatifs, avec une étude d'évaluation humaine réunissant 25 participants charges de juger l'adéquation entre les ajustements du robot et leur propre perception d'une prise appropriée. L'enjeu vise un angle mort connu de la manipulation robotique : saisir un objet déformable (tissu, sac souple, aliment, composant fragile) reste bien plus difficile a automatiser que saisir un objet rigide, car le critère de réussite n'est pas géométrique mais dépend d'un jugement humain qualitatif difficile a formaliser. Les approches de deep learning classiques butent sur ce problème car elles exigent un volume prohibitif d'annotations manuelles pour chaque nouvel objet, ce qui freine leur déploiement dans des environnements industriels varies comme la logistique ou l'agroalimentaire. En réduisant ce besoin d'annotation grâce a un VLM utilise comme générateur de supervision plutôt que comme pilote direct du robot, ce travail illustre une piste distincte de l'approche "VLA de bout en bout" popularisée par des systèmes comme Pi-0, GR00T N2 ou Helix. Ce travail relève de la recherche académique plutôt que d'un produit commercial : il s'agit d'une simple prépublication arXiv, sans partenaire industriel ni déploiement annonce, et les auteurs limitent eux-mêmes leurs conclusions a un cadre expérimental restreint a trois objets. La contribution se positionne comme une brique complémentaire aux modèles de manipulation généralistes actuellement pousses par les laboratoires de robotique humanoïde et industrielle, en ciblant un problème souvent absent des démonstrations grand public : l'ajustement fin de la force de préhension sur des matières molles. Les étapes suivantes attendues pour ce type d'approche consisteraient a étendre la validation a davantage d'objets et de morphologies de robots avant d'envisager un transfert vers des applications industrielles réelles.

RecherchePaper
1 source
Interface de navigation universelle : données sans robot pour la navigation des robots à roues
2arXiv cs.RO 

Interface de navigation universelle : données sans robot pour la navigation des robots à roues

Un article arXiv (2609.20114v1) présente Universal Navigation Interface (UNI), une méthode de collecte de données de navigation pour robots à roues sans robot cible ni téléopération. Le dispositif est un déambulateur à quatre roues (rollator) équipé d'un smartphone, poussé par un opérateur humain ; incapable de monter des escaliers, de franchir des bordures non abaissées ou de passer par des espaces étroits, il biaise naturellement les trajectoires vers des itinéraires praticables en roues. Les auteurs ont collecté 37,2 km de données réelles, converties en trajectoires métriques pour entraîner des modèles de navigation conditionnés par objectif. Le fine-tuning sur ces données réduit l'erreur de prédiction de trajectoire de 17,4 à 24,8 % sur le jeu de test UNI, avec des gains plus inégaux sur d'autres datasets, et un transfert en boucle fermée vers un fauteuil roulant motorisé a été validé sur des scénarios de bordures et d'escaliers. Cette approche s'attaque à un goulot d'étranglement connu de la robotique mobile : la collecte de données de navigation exige d'ordinaire une téléopération spécifique à chaque plateforme, coûteuse et difficile à faire passer à l'échelle. En montrant qu'un objet du quotidien, sans robot cible ni capteurs sophistiqués, peut produire des trajectoires exploitables pour l'entraînement, UNI ouvre une piste de réduction de coûts pour les intégrateurs de robots à roues, qu'il s'agisse d'AMR industriels, de robots de livraison ou d'aides à la mobilité comme les fauteuils roulants. Le résultat appuie l'idée que des proxys physiques bon marché peuvent fournir une supervision réelle sans simulation ni robot final, même si les gains ne se généralisent pas uniformément aux jeux de données externes testés, un rappel que la méthode reste sensible au domaine d'entraînement. UNI prolonge une lignée d'outils de collecte "robot-free" popularisée en manipulation par des dispositifs comme Universal Manipulation Interface, qui enregistrait des démonstrations via une pince portative sans bras robotique ; UNI transpose cette logique à la navigation à roues en exploitant les contraintes physiques d'un objet grand public, un déambulateur pour personnes à mobilité réduite. Il s'agit d'un travail de recherche publié en preprint sur arXiv, sans lien annoncé avec un produit commercial ou un déploiement industriel. Les prochaines étapes évoquées par les auteurs portent sur l'élargissement des tests à d'autres jeux de données et plateformes robotiques, au-delà du fauteuil roulant motorisé utilisé pour la validation en boucle fermée.

RecherchePaper
1 source
Stratégies de téléopération corporelle pour robots : objectifs et contraintes variés
3arXiv cs.RO 

Stratégies de téléopération corporelle pour robots : objectifs et contraintes variés

Des chercheurs ont publié en septembre 2026 sur arXiv (référence 2609.12384) une étude sur la téléopération corps entier de robots mobiles manipulateurs, testée sur TIAGo, la plateforme du fabricant espagnol PAL Robotics. L'équipe a conçu un cadre de contrôle hybride combinant commande libre et commande contrainte, permettant de coordonner simultanément perception active, manipulation bimanuelle et navigation lors du pilotage à distance du robot. Une étude utilisateur a ensuite été menée pour observer comment des opérateurs adaptent leurs stratégies de contrôle selon des contraintes de tâche variables, comme un temps d'exécution limité ou une faible tolérance aux erreurs. Les résultats montrent qu'un contrôle coordonné améliore l'efficacité d'exécution des tâches et réduit le risque d'atteindre les butées articulaires individuelles, par rapport à une commande purement libre. Pour les intégrateurs et chercheurs en robotique, ces résultats éclairent un enjeu souvent minimisé dans la course actuelle à la téléopération, utilisée aussi bien pour le pilotage direct que pour la collecte de démonstrations destinées à l'entraînement de modèles vision-langage-action, à l'image de ceux qui animent des systèmes comme Figure 03, Optimus ou GR00T N2. L'étude suggère que la qualité de l'interface de contrôle, et pas seulement le volume de données collectées, conditionne l'efficacité et la sécurité des gestes capturés: un opérateur mal assisté multiplie les mouvements proches des limites mécaniques, ce qui dégrade potentiellement la qualité des trajectoires enregistrées. Le travail rappelle que la téléopération corps entier reste un problème d'interface homme-machine non résolu, loin des démonstrations parfois idéalisées des fabricants. TIAGo, plateforme roulante à un ou deux bras développée par PAL Robotics, est couramment utilisée en recherche académique de robotique de service, à la différence des humanoïdes bipèdes comme Optimus de Tesla ou Figure 03, dont la téléopération sert surtout à collecter des données pour des modèles de fondation robotique. Publiée comme prépublication arXiv, sans validation par les pairs à ce stade, l'étude ne décrit ni déploiement industriel ni produit commercialisé: elle ouvre la voie à des travaux futurs sur la conception d'interfaces de téléopération corps entier, potentiellement transposables à d'autres plateformes mobiles ou humanoïdes.

UEL'étude repose sur TIAGo, plateforme du fabricant espagnol PAL Robotics, référence académique en robotique de service en Europe.

RecherchePaper
1 source
HATS : système de téléopération humain-agent pour la collecte de données multi-bras
4arXiv cs.RO 

HATS : système de téléopération humain-agent pour la collecte de données multi-bras

Des chercheurs ont publié sur arXiv (référence 2606.16491) un système de télé-opération baptisé HATS (Human-Agent Teleoperation System), conçu pour collecter des données d'entraînement dans des configurations à quatre bras robotiques. Le principe repose sur un découplage du contrôle : un seul opérateur humain télé-opère deux bras principaux directement, tandis qu'un agent basé sur un MLLM (modèle de langage multimodal à grande échelle, non spécifié dans le papier) gère deux bras assistants de façon autonome, sans phase d'entraînement préalable. L'opérateur peut en temps réel corriger le comportement des bras assistants et prévenir des collisions via commandes vocales. Selon les auteurs, l'efficacité de collecte et les taux de réussite obtenus avec HATS sont comparables à ceux d'équipes de deux opérateurs experts humains. Le problème que HATS tente de résoudre est structurant pour le secteur : les scénarios de manipulation industrielle complexes nécessitent souvent plus de deux bras, mais les systèmes de télé-opération existants imposent un arbitrage difficile entre charge cognitive (un seul opérateur gérant tout) et coût de coordination (plusieurs opérateurs synchronisés). En déléguant les sous-tâches à un agent MLLM, HATS réduit la charge sur l'humain sans multiplier les intervenants. Les évaluations en aval (downstream policy evaluations) suggèrent que les données collectées produisent des politiques de manipulation efficaces, mais ces résultats restent auto-rapportés et n'ont pas encore été validés de façon indépendante. La robustesse sur des tâches longues ou à haute précision, là où des corrections vocales pourraient s'avérer insuffisantes, n'est pas encore documentée. La collecte de démonstrations téléopérées est aujourd'hui le principal goulot d'étranglement pour entraîner des politiques de manipulation polyvalentes, notamment dans les approches VLA (Vision-Language-Action, architectures combinant perception visuelle, compréhension du langage et génération d'actions). Des systèmes comme ALOHA de Stanford ou les configurations bimanuelless d'Agility Robotics reposent sur des datasets construits par télé-opération humaine à deux bras. HATS étend cette approche à quatre bras en s'appuyant sur les capacités de raisonnement spatial des MLLM récents pour automatiser les bras secondaires. Cette direction est à suivre de près : si elle se généralisait, elle réduirait significativement le coût humain de construction des datasets d'imitation, un verrou majeur pour le passage à l'échelle des robots manipulateurs.

RecherchePaper
1 source