Aller au contenu principal
RecherchearXiv cs.RO 

Allocation de tâches adaptative en temps réel pour la supervision de plusieurs robots par plusieurs humains

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans une prépublication arXiv (2610.00897v1), une méthode d'allocation en temps réel des tâches de supervision de robots à plusieurs opérateurs humains, qui tient compte de leur état cognitif. Le scénario visé est celui où plusieurs opérateurs télé-opèrent ponctuellement plusieurs robots pour les aider à surmonter une difficulté. L'algorithme est glouton : il cherche à minimiser la charge de travail estimée de chaque opérateur, avec une priorisation des tâches. Les robots sont affectés en fonction de la capacité de supervision courante de chaque opérateur, l'effort requis variant selon le type de tâche. Une étude utilisateur compare la méthode à une référence qui ignore les facteurs humains. Sur des intervalles de temps prédéfinis, l'approche obtient de meilleures performances et moins de signes comportementaux de fatigue. Le résumé ne fournit ni nombre de participants, ni taille des flottes, ni ampleur des gains, ni type de robots.

L'enjeu concerne directement les opérations où l'autonomie reste incomplète. Beaucoup de déploiements de robots mobiles, de manipulateurs ou d'humanoïdes reposent sur un modèle « un humain pour N robots », où l'opérateur intervient quand le robot bloque. Les méthodes d'allocation existantes supposent une capacité de supervision fixe par opérateur et ignorent les variations de charge mentale et de fatigue. Le résultat est une charge déséquilibrée : certains opérateurs saturent pendant que d'autres sont sous-employés. Les auteurs présentent l'ajustement adaptatif de la capacité comme un mécanisme préventif pour les longues durées et les environnements exigeants. Pour un intégrateur ou un COO, cela déplace la question du ratio opérateurs/robots vers la qualité de l'orchestration humaine. Ce ratio conditionne le coût d'exploitation réel d'une flotte, notamment quand les VLA (modèles vision-langage-action) laissent encore une part d'interventions humaines. Les limites sont à garder en tête : l'évaluation est une étude utilisateur, sans mention de terrain industriel, et le gain est mesuré face à une référence simple.

Ce travail s'inscrit dans la littérature sur la supervision multi-robot et la télé-opération partagée. Cette littérature a longtemps traité l'opérateur comme une ressource de capacité constante, alors que l'industrialisation de la logistique, de la livraison et des humanoïdes de première génération rend les pics d'exceptions et la fatigue sur de longues vacations plus gênants. Plusieurs acteurs commerciaux misent déjà sur des centres de téléassistance pour couvrir les cas limites, sans qu'on sache s'ils modulent la charge de leurs opérateurs de cette façon. Aucun déploiement, pilote ou calendrier n'est annoncé, et aucun acteur français ou européen n'est cité. Les prochaines étapes naturelles seraient une validation sur des flottes réelles, avec des mesures physiologiques ou comportementales de la fatigue en conditions de production, ainsi qu'une intégration dans les logiciels d'orchestration de flottes.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SocioGesture : perception adaptative en temps réel des gestes sociaux pour l'interaction homme-robot
1arXiv cs.RO 

SocioGesture : perception adaptative en temps réel des gestes sociaux pour l'interaction homme-robot

Des chercheurs présentent SocioGesture, un système de perception gestuelle sociale conçu pour l'interaction humain-robot en temps réel, décrit dans un article publié sur arXiv le 4 septembre 2026 (arXiv:2609.04545v1). L'objectif est de faire reconnaître à un robot non seulement des commandes explicites, mais aussi des signaux sociaux comme une invitation, un refus ou un signe d'indisponibilité, à partir de capteurs embarqués imparfaits, sujets aux occlusions partielles et aux changements de point de vue. Le système repose sur une représentation compacte du squelette corps-mains avec score de confiance, couplée à un modèle léger à deux flux qui fusionne le mouvement du corps et l'articulation des mains pour une reconnaissance à faible latence directement sur le robot. Pour renforcer la robustesse, les chercheurs entraînent le modèle avec une méthode de corruption volontaire du squelette simulant des mains manquantes, des bras occultés ou des points-clés instables dans le temps, sans alourdir le coût de calcul à l'inférence. Testé sur un jeu de données de gestes sociaux collecté en environnements mixtes intérieur-extérieur, SocioGesture atteint une bonne reconnaissance sur des sujets non vus à l'entraînement, améliore nettement la robustesse face aux occlusions structurées, et tourne en temps réel sur un dispositif de calcul embarqué (edge). Cette avancée cible un angle mort concret de la robotique de service et industrielle: la plupart des systèmes actuels traitent les gestes comme des commandes isolées, mais ignorent les signaux sociaux implicites qui régulent une interaction naturelle en environnement partagé avec des humains, ce qui limite l'acceptabilité et la fluidité des robots déployés en espace public ou en usine. En prouvant qu'un modèle léger peut tourner en embarqué avec robustesse face à l'occlusion, un problème récurrent en conditions réelles, sans démonstration vidéo sélective ni matériel de calcul déporté, l'étude apporte un signal utile aux intégrateurs qui cherchent à dépasser le stade de la démo contrôlée en laboratoire. Le mécanisme d'apprentissage continu, qui met de côté les séquences ambiguës pour un étiquetage différé et permet d'étendre le vocabulaire gestuel sans dégrader les classes déjà apprises, répond aussi à un frein classique au déploiement long terme des robots sociaux. Le travail s'inscrit dans la lignée des recherches en HRI (human-robot interaction) cherchant à rapprocher la perception gestuelle des conditions réelles de terrain, plutôt que des jeux de données propres en studio, une problématique partagée par les laboratoires travaillant sur les modèles vision-langage-action (VLA) et la navigation sociale de robots mobiles ou d'AMR. L'article ne mentionne ni partenariat industriel, ni date de déploiement pilote, ni comparaison chiffrée directe avec des systèmes concurrents commerciaux: il s'agit à ce stade d'une contribution de recherche publiée en preprint, dont la prochaine étape logique serait une validation sur des plateformes robotiques commerciales et des comparaisons benchmark publiques.

RecherchePaper
1 source
Apprentissage par imitation sélective Max-Q pour l'entraînement en ligne de robots avec supervision humaine
2arXiv cs.RO 

Apprentissage par imitation sélective Max-Q pour l'entraînement en ligne de robots avec supervision humaine

Des chercheurs publient sur arXiv (2608.15088) une méthode d'apprentissage par renforcement en ligne avec intervention humaine (human-in-the-loop, HIL) pour robots réels, baptisée Max-Q Selective Imitation. Elle combine un critique "MC Q-chunk", qui évalué les actions par segments a partir des retours Monte Carlo du buffer de replay plutôt que par retropropagation temporelle classique, et une règle "max-Q" qui fait imiter a l'acteur, a chaque état, soit l'action de la politique courante soit un échantillon du buffer, selon lequel des deux obtient le Q le plus élevé. Sur une tache réelle d'insertion de connecteur USB avec seulement 20 démonstrations, la variante ACT QChunk-MCBC atteint 99% de réussite en 30 minutes d'entrainement HIL, contre environ 5 heures pour la méthode de référence HIL-SERL. En simulation, sur les taches Peg Insertion et Square, les variantes ACT et Flow Q-chunk dépassent 96% de réussite en une demi-heure environ, devant HIL-SERL, EXPO et E2HiL. Ce gain de vitesse s'attaque a un goulot d'étranglement connu de l'apprentissage robotique en ligne : la convergence après correction humaine se compte souvent en heures, ce qui freine son usage industriel la ou chaque minute d'arrêt machine coute cher. Diviser ce temps par dix sur une tache de précision comme l'insertion de connecteurs suggère que les méthodes HIL pourraient sortir du laboratoire pour des lignes d'assemblage réelles, notamment quand peu de démonstrations sont disponibles. Pour les équipes de recherche en robotique, l'article illustre aussi une tendance a remplacer les mises a jour par différence temporelle, lentes et sensibles au bruit, par des cibles Monte Carlo combinées a une règle de sélection simple, sans seuils ni lissage ajoutes. La méthode se positionne explicitement face a HIL-SERL, référence du domaine, ainsi qu'a EXPO et E2HiL, évaluées sur les mêmes benchmarks de manipulation fine, et s'inscrit dans la lignée des politiques d'action par segments popularisées par ACT, avec une variante testée sur un modèle de flux. Publie comme un article de recherche tout juste mis en ligne sur arXiv, ce travail ne correspond ni a un produit commercial ni a un déploiement industriel annonce : les résultats reposent sur un seul banc réel et deux taches simulées, sans indication sur la généralisation a d'autres robots. Les auteurs ne mentionnent aucune suite en termes de partenariat industriel ou d'intégration logicielle ; la contribution reste, pour l'instant, une brique algorithmique destinée a la communauté recherche en apprentissage robotique.

RecherchePaper
1 source
Adaptation aux défauts articulaires en temps réel pour la manipulation dextérique en main
3arXiv cs.RO 

Adaptation aux défauts articulaires en temps réel pour la manipulation dextérique en main

Des chercheurs présentent Residual Fault Adaptation (RFA), un framework d'apprentissage par renforcement destiné à la manipulation dextre en main robotique lorsqu'une panne survient sur un canal de commande d'articulation en cours de fonctionnement. L'architecture repose sur un « teacher » sain figé qui fournit le comportement nominal, couplé à une politique résiduelle récurrente entraînée à déduire des actions correctives à partir de l'historique proprioceptif et de la réponse aux commandes. L'entraînement utilise une randomisation de domaine par injection de fautes (FIDR), qui fait varier le mode de panne, l'articulation touchée, la sévérité et l'instant de déclenchement, avec un échantillonnage adaptatif qui privilégie les modes de panne les moins bien gérés récemment. Une politique Direct FIDR figée sert uniquement de référence distributionnelle pendant l'entraînement sur les échantillons avec panne active, et n'intervient plus au déploiement. Le contrôleur final ne reçoit ni étiquette de panne ni signal de basculement de contrôleur. Les auteurs rapportent des gains de performance en simulation sur une main dextre selon un protocole de pannes mixtes fixe, ainsi qu'un déploiement zero-shot réussi sur robot réel avec pannes injectées par logiciel. Pour l'industrie robotique, ce travail s'attaque à un angle mort réel de la manipulation dextre : la tolérance aux pannes matérielles en conditions d'usage, plutôt que la seule performance en environnement contrôlé. Une articulation qui se bloque ou répond mal en cours de tâche est un scénario courant en usine ou en logistique, et la capacité d'une politique à s'adapter sans détection explicite de panne ni bascule de contrôleur simplifierait l'intégration pour les fabricants de mains robotiques. Cela dit, la portée reste limitée : les résultats réels s'appuient sur des pannes injectées par logiciel, pas des défaillances matérielles spontanées, et l'essentiel de la validation demeure en simulation, ce qui appelle la prudence sur la généralisation à des pannes non vues à l'entraînement. Ce travail s'inscrit dans la lignée des architectures teacher-student utilisées pour le sim-to-real en robotique, où une politique privilégiée entraînée avec des informations complètes guide une politique déployable plus contrainte. Il rejoint aussi les efforts récents sur la robustesse des politiques de manipulation dextre face aux aléas physiques, distincts des approches VLA généralistes comme Pi-0 ou GR00T N2 qui visent la généralisation sémantique plutôt que la tolérance aux pannes matérielles. L'article, publié sur arXiv, ne mentionne pas de partenaire industriel ni de calendrier de transfert vers un produit commercial ; les prochaines étapes attendues porteraient sur des pannes matérielles réelles non simulées et une validation sur d'autres plateformes de mains robotiques.

RecherchePaper
1 source
PACE : allocation adaptative de budget pour une planification incarnée efficace en temps
4arXiv cs.RO 

PACE : allocation adaptative de budget pour une planification incarnée efficace en temps

Des chercheurs présentent PACE (Planning with Adaptive Cognitive Effort), un nouveau framework destiné à accélérer la planification des systèmes robotiques pilotés par des grands modèles de langage à raisonnement renforcé. Publié le 5 août 2026 sur arXiv (identifiant 2608.03034v1), le papier s'attaque au principal frein empêchant ces modèles d'équiper des systèmes embarqués: des délais d'inférence qui dépassent parfois la minute par instance de planification, le modèle devant achever tout son raisonnement avant d'exécuter la moindre action. PACE repose sur deux mécanismes. Une architecture "Interleaved Think-Act" entrelace le raisonnement cognitif et l'exécution des actions au lieu de les séquencer strictement. Un "Dynamic Budget Allocator" ajuste ensuite le budget de tokens de raisonnement à la fenêtre de temps d'exécution réellement disponible. Testé sur le benchmark Robotouille avec le modèle Qwen3-8B-AWQ, PACE atteint un taux de réussite de 10%, soit une amélioration relative de 67% par rapport à la référence ReAct+Think, tout en accélérant le temps de réflexion d'un facteur 6,9 comparé à un raisonnement non contraint. Le framework parvient à masquer 66,8% du temps de réflexion dans les fenêtres d'exécution. Cette approche répond à un goulot d'étranglement bien identifié: les modèles de raisonnement type "thinking" améliorent la qualité des plans générés mais restent inutilisables en temps réel, un robot ne pouvant rester immobile plusieurs dizaines de secondes entre chaque décision. En interrompant le raisonnement pour agir puis en le reprenant pendant l'exécution, PACE ouvre une piste concrète pour rendre les architectures LLM-planificateur compatibles avec des domaines sensibles à la latence, du pick-and-place industriel à la navigation d'AMR. Il faut toutefois relativiser l'ampleur du résultat: un taux de réussite absolu de 10% reste faible en tant que tel, même si le gain relatif et l'accélération démontrent la validité du principe. Il s'agit d'une preuve de concept en simulation, pas d'un système prêt pour un déploiement industriel. Classé "Announce Type: new" sur arXiv, ce travail s'inscrit dans la vague de recherches qui tentent d'adapter les modèles de raisonnement récents, conçus pour du texte, à des contextes physiques et temporisés. La comparaison retenue par les auteurs, ReAct+Think, reflète l'approche dominante actuelle où planification et action restent strictement séquentielles. Robotouille, le benchmark utilisé, simule des tâches de cuisine multi-étapes nécessitant coordination et replanification, un terrain de test courant pour évaluer les agents LLM en environnement embarqué. Les auteurs ne donnent ni calendrier de suite ni validation sur robot physique; l'extension à d'autres benchmarks et, à terme, des tests sur plateformes réelles constituent les prochaines étapes attendues pour ce type de travaux académiques.

RecherchePaper
1 source