Aller au contenu principal
HITL-D : contrôle partagé assisté par diffusion avec humain dans la boucle
RecherchearXiv cs.RO 

HITL-D : contrôle partagé assisté par diffusion avec humain dans la boucle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

HITL-D (Human-In-The-Loop Diffusion) est un framework de contrôle partagé pour la téléopération robotique, présenté dans un preprint arXiv (2605.21460) non encore évalué par des pairs. Le système combine une politique de diffusion apprise avec le contrôle humain classique : l'opérateur pilote le robot via joystick pour les déplacements en position cartésienne, tandis que le système prend en charge automatiquement l'orientation de l'effecteur terminal. Cette orientation autonome est conditionnée en temps réel par un nuage de points 3D de la scène et la position courante de l'effecteur. Résultat : le nombre d'axes de contrôle que l'opérateur doit gérer simultanément diminue, réduisant mécaniquement la charge cognitive. Une étude utilisateur menée sur 12 participants dans des tâches multi-étapes, d'insertion et de manipulation fine démontre une réduction de 40 % du temps d'exécution des tâches, une baisse de 37 % de la charge mentale perçue, et des scores Likert supérieurs pour l'indépendance, l'intuitivité et la confiance, comparés à une téléopération classique sans assistance.

Ces résultats adressent un problème central du déploiement industriel : la pleine autonomie robotique reste fragile sur les tâches d'assemblage précis (insertion, ajustement fin), tandis que la téléopération pure est coûteuse en ressources humaines et génère de la fatigue opérateur. HITL-D occupe ce no man's land en déléguant sélectivement les degrés de liberté les moins intuitifs à la politique apprise. L'approche par diffusion conditionnée sur nuage de points est techniquement notable : contrairement à un lissage de trajectoire, elle intègre une représentation géométrique de l'environnement pour générer une assistance contextuelle. Il faut toutefois relativiser : 12 participants constituent un échantillon limité, et l'abstract ne précise ni la complexité exacte des scènes testées, ni si les expériences ont été conduites sur robot réel ou en simulation.

Le travail s'inscrit dans la continuité directe des Diffusion Policies (Chi et al., Columbia, 2023), devenues un paradigme dominant en manipulation robotique apprise. Le contrôle partagé et la "sliding autonomy" sont des concepts étudiés depuis les années 2000 (notamment en robotique médicale et spatiale), mais leur combinaison avec des politiques génératives modernes reste peu explorée. Face aux approches VLA full-autonomy comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les modèles dérivés de RT-2, HITL-D ne cherche pas à remplacer l'humain mais à l'augmenter, ce qui le positionne sur un marché différent : téléopération industrielle assistée, chirurgie robotique, déminage. Aucun partenaire industriel ni calendrier de commercialisation n'est mentionné dans le preprint ; l'étape suivante naturelle serait une validation sur tâches réelles à plus grande échelle et avec des opérateurs non experts.

À lire aussi

HumanFlow : navigation de drone MAV parmi les humains par diffusion, avec suivi, prévision et contrôle du mouvement
1arXiv cs.RO 

HumanFlow : navigation de drone MAV parmi les humains par diffusion, avec suivi, prévision et contrôle du mouvement

Des chercheurs ont publié en mai 2026 un préprint arXiv (arXiv:2605.25685) présentant HumanFlow, un modèle de diffusion latente conçu pour la navigation de drones autonomes (MAVs, Micro Aerial Vehicles) dans des espaces peuplés. L'architecture unifie deux tâches habituellement traitées séparément : le suivi de la position 3D des personnes en temps réel (tracking) et la prédiction de leurs trajectoires futures (forecasting), le tout conditionné sur le contexte 3D de la scène environnante. La politique de contrôle associée repose sur un MPC (Model Predictive Control) approché par correspondance de flux (flow-matching), couplé directement à l'espace latent du modèle de perception. Les validations ont été conduites en simulation, en rejouant des trajectoires humaines réelles. Les auteurs annoncent de meilleures performances de tracking que les méthodes de référence, avec une efficacité computationnelle supérieure, et une navigation sans collision maintenue même en cas de visibilité partielle ou d'occultations sévères. L'apport central de HumanFlow est ce couplage serré (tight coupling) entre la perception humaine et la commande du robot, une intégration rarement réalisée dans la littérature de navigation sociale. Les systèmes existants échouent fréquemment lorsque des personnes sont partiellement masquées, produisant des estimations incohérentes avec la scène qui dégradent la sécurité et l'efficacité opérationnelle. En générant des prédictions de mouvement lisses et physiquement plausibles y compris sous occultation forte, le modèle réduit ce point de défaillance critique. Pour les intégrateurs de drones en environnement industriel, logistique ou public, c'est l'une des principales barrières à la certification : garantir la détection fiable des humains dans les angles morts. La démonstration que l'espace latent d'un modèle de diffusion peut directement piloter un contrôleur MPC ouvre une voie architecturale potentiellement transposable à des robots au sol ou des bras manipulateurs évoluant aux côtés d'opérateurs. HumanFlow s'inscrit dans un courant de recherche actif sur la navigation sociale robotique, dominé jusque-là par des approches basées sur des estimateurs déterministes ou des réseaux de prédiction de trajectoires tels que les architectures LSTM et Transformer. L'utilisation de modèles de diffusion pour la prédiction de mouvements humains est récente, apparue au milieu des années 2020, et HumanFlow en est l'une des premières applications directement couplées au contrôle. Ses concurrents directs incluent des pipelines séparant explicitement perception, prédiction et planification. Il faut noter que les validations restent entièrement en simulation : aucun déploiement physique sur drone réel n'est rapporté dans ce préprint, ce qui laisse ouverte la question du sim-to-real gap pour cette classe de modèles génératifs. Les prochaines étapes logiques seraient des essais sur MAV réel en environnement semi-contrôlé.

RecherchePaper
1 source
Optimisation simultanée directe et inverse avec humain dans la boucle
2arXiv cs.RO 

Optimisation simultanée directe et inverse avec humain dans la boucle

Une équipe de recherche présente sur arXiv (arXiv:2609.22630) une méthode baptisée SFIHILO, pour Simultaneous Forward and Inverse Human-In-the-Loop Optimization, conçue pour déduire les préférences individuelles d'un utilisateur face à un robot et calculer ensuite la politique de contrôle qui maximise ces préférences. Le système commence par construire un modèle direct qui prédit les résultats perçus par l'utilisateur à partir d'une politique de contrôle donnée, puis utilise ce modèle pour choisir activement les questions à poser à l'utilisateur, ce qui accélère l'apprentissage inverse de la fonction de récompense. Une fois cette fonction estimée, la politique finale est optimisée sans nécessiter de nouveaux essais avec l'utilisateur. Les candidats de politique sont classés selon la réduction d'incertitude qu'ils apportent simultanément aux deux modèles, direct et inverse, en ciblant une frontière de préférence régionale. Les tests ont été menés uniquement en simulation, sur des scénarios variant l'hétérogénéité des profils d'utilisateurs, le nombre de dimensions des résultats mesurés, les exigences de précision, les niveaux de bruit et la non-stationnarité des préférences dans le temps. L'enjeu pratique concerne la robotique d'assistance, exosquelettes, prothèses ou dispositifs de rééducation, où chaque essai de politique de contrôle coûte cher: il faut exécuter la commande, mesurer des résultats biomécaniques ou physiologiques, puis recueillir un retour subjectif, ce qui limite drastiquement le nombre de requêtes possibles avant qu'un système ne s'adapte à un individu. En comparaison avec des stratégies d'apprentissage actif basées sur l'information mutuelle, les auteurs rapportent une meilleure efficacité d'échantillonnage pour l'apprentissage inverse de la récompense, sans dégrader la précision du modèle direct. Si ces résultats se confirment au-delà de la simulation, cela ouvrirait la voie à des robots d'assistance capables de personnaliser leur comportement à un utilisateur donné avec un nombre d'itérations réduit, un facteur limitant connu des approches d'apprentissage par renforcement inverse classiques. Le travail s'inscrit dans la lignée des méthodes d'inverse reinforcement learning et d'optimisation avec humain dans la boucle, en réponse au coût expérimental élevé des interactions homme-robot réelles. Il reste à ce stade une validation en simulation uniquement, sans expérimentation sur sujets humains ni déploiement matériel: aucune date de test clinique, aucun partenaire industriel ni produit associé n'est mentionné dans les travaux publiés.

RecherchePaper
1 source
Contrôle partagé adaptatif par estimation en ligne du comportement humain à rationalité limitée
3arXiv cs.RO 

Contrôle partagé adaptatif par estimation en ligne du comportement humain à rationalité limitée

Publié le 10 septembre 2026 sur arXiv (2609.10215), un article de recherche présente une méthode de contrôle partagé homme-robot pour systèmes non linéaires. Elle remplace l'hypothèse d'un opérateur parfaitement rationnel par un modèle de rationalité limitée de niveau k, issu de la théorie des jeux. Les auteurs construisent une banque finie de politiques humaines et robotiques candidates par calculs itératifs de meilleure réponse et programmation dynamique adaptative. Pendant l'interaction, l'écart entre l'état mesuré et les trajectoires prédites par chaque politique candidate est accumulé pour estimer la distribution de probabilité du comportement humain, à partir de laquelle le robot calcule analytiquement sa meilleure réponse coopérative. Testée en simulation sur une tâche de stabilisation académique et un bras manipulateur planaire, la méthode réduit l'écart d'estimation et abaisse le coût cumulé du robot face aux méthodes classiques de sélection du candidat le plus probable ou de moyenne pondérée. Ce travail cible un angle mort courant du contrôle partagé : la plupart des systèmes supposent un opérateur rationnel et constant, ou appliquent une assistance figée, au risque de perdre en efficacité dès que l'humain varie en compétence, en attention ou en fatigue. Ce cas est fréquent en cobotique industrielle, en exosquelettes ou en télémanipulation. En conservant toute la distribution des profils humains plausibles plutôt qu'un seul candidat, et grâce à une solution analytique peu coûteuse, l'approche promet une assistance plus stable face à l'incertitude sur l'opérateur. Les résultats restent toutefois limités à des simulations numériques, sans sujets humains réels ni validation matérielle. Cette approche prolonge des travaux mêlant théorie des jeux comportementale et programmation dynamique pour l'autonomie partagée, un champ qui a déjà exploré les jeux de Stackelberg ou les modèles probabilistes d'intention humaine pour la conduite assistée et le pilotage de bras robotiques. Le raisonnement de niveau k, né en économie comportementale, cherche ainsi à rapprocher le contrôle partagé du comportement humain réel plutôt que d'une rationalité parfaite supposée. Publié comme nouvelle soumission arXiv non encore relue par les pairs, sans implémentation matérielle annoncée, l'article ouvre la voie à une validation avec de véritables opérateurs sur des plateformes physiques, là où l'écart entre simulation et déploiement réel reste la principale inconnue.

RecherchePaper
1 source
Diffusion pour la planification de trajectoires multi-robots à long horizon dans des environnements partagés avec des humains
4arXiv cs.RO 

Diffusion pour la planification de trajectoires multi-robots à long horizon dans des environnements partagés avec des humains

Des chercheurs publient sur arXiv (référence 2607.09911, soumis le 14 juillet 2026) un nouveau framework baptisé Multi-Robot Rolling Diffusion (MRRD), conçu pour la planification de trajectoires de flottes de robots évoluant dans des environnements partagés avec des humains, comme des foules denses. Le système combine trois mécanismes : un schéma à horizon glissant qui s'adapte à la fenêtre de prédiction limitée du mouvement humain, une inférence par diffusion parallélisée capable de générer des trajectoires réalistes à grande échelle, et une recherche basée sur la résolution de conflits pour éviter les collisions entre robots. MRRD intègre aussi un conditionnement temporel dit "d'urgence", permettant de produire des trajectoires à vitesse variable, ainsi que des termes de guidage différenciés pour équilibrer prudence sociale autour des humains et coordination efficace entre robots. Dans les tests menés en environnement encombré, le framework passe à l'échelle jusqu'à 15 robots en temps réel, avec des taux de sécurité et de réussite de mission supérieurs aux méthodes de référence existantes. L'enjeu dépasse la simple prouesse technique : les modèles de diffusion produisent des trajectoires réputées pour leur fluidité et leur ressemblance au comportement humain, mais souffraient jusqu'ici d'une limite structurelle, une durée de trajectoire fixe et une latence de calcul trop élevée pour un déploiement temps réel. En résolvant ce compromis, MRRD s'attaque directement à l'un des points de friction qui freinaient l'adoption de la génération par diffusion dans la robotique de flotte, un domaine où AMR (robots mobiles autonomes) et humains doivent cohabiter en entrepôt, en usine ou en espace public. Pour les intégrateurs qui déploient des flottes en environnement partagé, ce type d'avancée conditionne directement la capacité à faire cohabiter davantage de robots sans dégrader la sécurité perçue par les opérateurs humains. Le travail s'inscrit dans une lignée de recherche active sur la planification de trajectoires multi-robots, où les approches classiques (basées sur l'optimisation ou le graphe) peinent à modéliser des comportements socialement acceptables face à des humains imprévisibles. Les auteurs ne précisent pas d'affiliation industrielle ni de partenaire de déploiement dans le résumé ; il s'agit à ce stade d'un résultat de recherche évalué en simulation, dont la prochaine étape logique serait une validation sur robots physiques en conditions réelles.

RecherchePaper
1 source