Aller au contenu principal
STEP : estimation et planification des tâches sensibles à l'état avec des LLM multimodaux pour la collaboration homme-robot
RecherchearXiv cs.RO 

STEP : estimation et planification des tâches sensibles à l'état avec des LLM multimodaux pour la collaboration homme-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent STEP (State-aware Task Estimator and Planner), un système publié le 27 août 2026 sur arXiv (arXiv:2608.27225v1) qui vise à améliorer la planification de tâches par des robots collaboratifs en environnement industriel. Le constat de départ est que les modèles de langage multimodaux (MM-LLM) récemment utilisés pour interpréter les actions humaines et générer des plans d'action en langage naturel, via apprentissage en contexte dans des scénarios pauvres en données, souffrent de deux défauts majeurs : ils ne suivent pas l'état réel du système ni ses transitions, ce qui produit des actions hallucinées s'écartant de l'objectif visé, et leurs plans restent formulés à un niveau trop abstrait, créant de l'ambiguïté au moment de l'exécution. STEP corrige cela en forçant le MM-LLM à estimer explicitement l'état du système et à prédire les transitions d'état résultant de chaque action exécutée, en plus de générer les actions elles-mêmes. Cette prédiction conjointe état/action garantit une planification convergente vers l'objectif et fournit les paramètres d'assistance nécessaires à l'exécution. Testé sur une tâche d'assemblage robotique en environnement simulé, STEP dépasse l'état de l'art de 32,8% en taux d'exécutabilité des actions et de 14,8% en réduction de l'erreur d'état final.

Pour les intégrateurs et concepteurs de systèmes de cobotique industrielle, ce travail s'attaque directement à un point de friction connu des architectures de planification fondées sur les LLM : le décalage entre un plan verbalisé de façon plausible et un plan réellement exécutable par un robot, faute d'ancrage dans l'état physique du système. En rendant le suivi d'état explicite plutôt qu'implicite, STEP réduit le risque d'hallucination d'actions, un problème récurrent quand un LLM générique est plaqué sur une tâche de manipulation sans supervision d'état. Les gains rapportés, mesurés sur l'exécutabilité et l'erreur d'état final plutôt que sur des métriques cosmétiques, ciblent précisément la fiabilité opérationnelle recherchée en assemblage collaboratif homme-robot, un segment où la marge d'erreur tolérée reste faible.

Ces résultats s'inscrivent dans la lignée des travaux récents exploitant les MM-LLM pour la planification de tâches en contexte de données rares, où l'apprentissage en contexte permet de s'affranchir d'un réentraînement lourd. Il faut toutefois noter que la validation se limite à un environnement simulé et à une seule tâche d'assemblage, sans démonstration sur robot physique ni déploiement industriel réel. STEP reste donc à ce stade une contribution de recherche méthodologique, dont la prochaine étape logique serait une validation sur du matériel réel et sur une variété de tâches plus large avant toute application en production.

Dans nos dossiers

À lire aussi

Planification de trajectoire STL et analyse des risques pour la collaboration humain-robot avec un drone multi-rotors
1arXiv cs.RO 

Planification de trajectoire STL et analyse des risques pour la collaboration humain-robot avec un drone multi-rotors

Des chercheurs ont publié sur arXiv (référence 2509.10692, troisième révision en avril 2026) un framework de planification de mouvement et d'analyse de risque pour la collaboration humain-robot avec un véhicule aérien multirotor. Le coeur du système repose sur la Signal Temporal Logic (STL), un formalisme mathématique permettant d'encoder des objectifs de mission structurés : contraintes de sécurité, exigences temporelles, et préférences humaines incluant l'ergonomie et le confort de l'opérateur. Un planificateur par optimisation génère des trajectoires dynamiquement faisables en tenant compte des dynamiques non-linéaires du drone et de ses contraintes d'actuation. Pour résoudre le problème d'optimisation non-convexe et non-lisse qui en résulte, le framework adopte des approximations de robustesse différentiables combinées à des méthodes de gradient. Le système inclut également un mécanisme de replanification en ligne déclenché par événements, activé lorsque des perturbations menacent les marges de sécurité. La validation s'appuie exclusivement sur des simulations MATLAB et Gazebo, sur une tâche de remise d'objet inspirée de la maintenance de lignes électriques. Ce travail adresse un verrou réel dans le déploiement de drones en environnement industriel partagé : la cohabitation sûre avec des techniciens humains dont la posture est incertaine et dynamique. L'analyse de risque probabiliste quantifie la vraisemblance de violations de spécifications sous incertitude de pose humaine, ce qui représente une avancée par rapport aux approches conservatrices à marge fixe. La replanification événementielle permet une récupération en ligne sans interrompre la mission, un critère déterminant pour les applications en conditions réelles. Cela dit, l'absence de validation physique sur hardware réel constitue une limite importante : le gap sim-to-real pour les drones en proximité humaine reste un problème ouvert, et les résultats en simulation Gazebo ne peuvent pas être directement extrapolés à un déploiement terrain. Le contexte de ce travail s'inscrit dans un effort plus large de la communauté robotique aérienne pour rendre les drones industriels opérables à proximité immédiate des travailleurs, notamment dans les secteurs de l'énergie et de la maintenance d'infrastructures. Côté concurrence, des acteurs comme Skydio (USA) ou Flyability (Suisse) avancent sur des drones robustes en environnement contraint, mais sans formalisme STL ni modèle explicite d'interaction humain-robot. En Europe, des projets académiques financés par l'ANR et H2020 explorent des pistes similaires. La prochaine étape naturelle pour ce framework serait une validation sur banc physique avec un multirotor réel et des opérateurs humains instrumentés, condition sine qua non avant toute intégration industrielle.

UEDes projets ANR et H2020 explorent des approches similaires ; ce framework STL pourrait alimenter la recherche européenne sur les drones industriels en proximité humaine, notamment pour la maintenance d'infrastructures énergétiques.

RecherchePaper
1 source
Un cadre de fusion multimodale sensible à la confiance pour la collaboration humain-robot industrielle
2arXiv cs.RO 

Un cadre de fusion multimodale sensible à la confiance pour la collaboration humain-robot industrielle

Une équipe de recherche présente CAMF (Confidence-Aware Multimodal Fusion), un système de fusion multimodale conçu pour prédire l'intention humaine dans la collaboration homme-robot industrielle, décrit dans un article publié le 10 septembre 2026 sur arXiv (2609.10339v1). Le framework combine quatre types de signaux hétérogènes: la pose 6D des objets manipulés, le regard de l'opérateur, le mouvement squelettique et le mouvement de la main mesuré par capteur IMU. Un mécanisme de fusion dynamique piloté par la tendance de confiance est intégré à un réseau BiLSTM pour pondérer en temps réel la fiabilité de chaque modalité, complété par une stratégie d'apprentissage équilibré et un mécanisme de gel de confiance qui limite le bruit des capteurs de mauvaise qualité. Les auteurs ont validé l'approche sur une plateforme physique construite autour du bras collaboratif UR3 d'Universal Robots (Danemark), obtenant un taux de reconnaissance d'intention de 91,86%, supérieur selon eux aux approches de fusion multimodale existantes en précision comme en stabilité, y compris en conditions de faible luminosité ou d'occlusion partielle. Pour l'industrie de la cobotique, ce travail illustre une tendance de fond: la fiabilité de la perception d'intention, plus que la robotique elle-même, conditionne l'adoption des cellules homme-robot collaboratives en assemblage. La capacité à pondérer dynamiquement des capteurs peu coûteux (caméra, IMU) plutôt que de dépendre d'un seul flux répond directement au problème classique de dégradation en environnement réel, un des points faibles régulièrement pointés dans les démonstrations de cobotique. Le chiffre de 91,86% reste toutefois une mesure obtenue sur un banc d'essai contrôlé, sans détail public sur la taille du jeu de test ni sur les tâches couvertes au-delà de l'assemblage, ce qui appelle prudence avant extrapolation à des lignes de production réelles. Ce travail s'inscrit dans la lignée des recherches académiques sur la fusion de capteurs pour la cobotique, un domaine où les architectures purement visuelles ou purement inertielles montrent des limites en environnement industriel bruité. Aucune date de transfert industriel ni partenariat constructeur n'est annoncée à ce stade; il s'agit d'une publication de recherche, non d'un produit commercialisé.

UELe système CAMF est valide sur un bras collaboratif UR3 du fabricant danois Universal Robots, mais reste un travail de recherche académique sans déploiement industriel ni partenariat constructeur annonce en France ou en UE.

RecherchePaper
1 source
Sensibilité adaptative aux collisions pour une collaboration homme-robot efficace et sûre
3arXiv cs.RO 

Sensibilité adaptative aux collisions pour une collaboration homme-robot efficace et sûre

Des chercheurs présentent un nouveau cadre logiciel permettant à un bras robotique collaboratif de moduler dynamiquement sa sensibilité aux collisions selon la partie du corps impliquée, plutôt que d'appliquer un seuil de force fixe uniforme sur toute sa surface comme l'exigent aujourd'hui les normes de collaboration homme-robot (HRC), telles que la norme ISO 10218-2:2025 régissant le régime PFL (Power and Force Limiting). Le système calcule en temps réel la force de collision estimée pour chaque segment du robot à partir de sa Masse Effective (Effective Mass, EM), une grandeur qui varie selon la configuration du bras et le point de contact. Les tests ont été menés sur un bras UR10e réel équipé d'une peau sensible AIRSKIN pour la détection et la localisation des impacts, ainsi qu'en simulation sur un bras KUKA LBR iiwa, dont la détection de collision repose cette fois sur les capteurs de couple articulaire. Dans un scénario de type prise-et-dépose (pick-and-place) combinant collisions transitoires et quasi-statiques, les auteurs rapportent un gain de productivité supérieur à 45% par rapport à l'approche standard à seuil fixe. Pour les intégrateurs et décideurs industriels, l'enjeu dépasse la simple optimisation de cycle: la méthode s'attaque directement au compromis sécurité-productivité qui freine l'adoption des cobots en environnement partagé avec des opérateurs humains. Aujourd'hui, un seuil de force unique impose un arrêt du robot dès qu'un contact dépasse la limite la plus stricte, même lorsque la zone touchée (proche d'une articulation à faible inertie, par exemple) serait en réalité sans danger. En rendant la limite de force dépendante du contexte cinématique et compatible avec deux architectures de détection différentes (peau tactile et couple articulaire), les auteurs démontrent une généralisation au-delà d'un capteur ou d'un modèle de bras propriétaire, ce qui est notable pour un secteur où beaucoup de démonstrations restent liées à un matériel unique. Ce travail s'inscrit dans la continuité des efforts pour affiner l'application pratique des normes PFL, jugées trop conservatrices par une partie de la communauté robotique depuis leur conception initiale. Le choix de tester à la fois sur UR10e (Universal Robots) avec AIRSKIN (Fraunhofer) et sur KUKA LBR iiwa positionne la méthode comme agnostique au fournisseur, avec une portée annoncée comme applicable à tout robot dont l'EM peut être calculée. Il s'agit ici d'un résultat de recherche publié sur arXiv (version révisée, replace v3), non d'un produit commercial ni d'un déploiement industriel: les validations quasi-statiques et transitoires restent limitées à un scénario de laboratoire, et le chiffre de 45% de gain de productivité mériterait d'être confirmé sur des cas d'usage industriels réels avant généralisation.

UELe framework s'appuie sur des acteurs européens (KUKA, capteur AIRSKIN issu de recherches Fraunhofer) et vise a assouplir l'application des normes de sécurité collaborative homme-robot (ISO 10218-2:2025) utilisées dans l'industrie européenne.

RecherchePaper
1 source
LAMP : planification adaptative de manipulation à long horizon pour la collaboration multi-robots en espace encombré
4arXiv cs.RO 

LAMP : planification adaptative de manipulation à long horizon pour la collaboration multi-robots en espace encombré

Une équipe de chercheurs a publié sur arXiv (référence 2606.29358v1) un nouveau cadre de planification intitulé LAMP, pour Long-horizon Adaptive Manipulation Planning, conçu pour coordonner plusieurs robots manipulateurs dans des environnements très encombrés. Le système repose sur deux planificateurs complémentaires : LAMPA*, qui effectue une recherche systématique dans l'espace couplé objets-robots, et LAMP-Lazy, un planificateur dit "paresseux" qui diffère certaines évaluations pour permettre une replanification en temps réel. Les expériences ont été menées dans des environnements simulés à haute densité d'obstacles, où les méthodes existantes échouent à trouver des solutions. Aucun déploiement physique ni timeline de commercialisation n'est annoncé. Le verrou technique que LAMP cherche à lever est fondamental pour l'industrie : coordonner plusieurs bras robotiques sur des tâches longues dans des espaces confinés implique de raisonner simultanément sur les contacts physiques, les dynamiques couplées entre robots, et l'évitement de collision. Les deux approches dominantes aujourd'hui se heurtent à des murs de scalabilité distincts. L'apprentissage par renforcement end-to-end peine à généraliser dès que l'horizon de tâche s'allonge ou que le nombre de robots augmente. Les méthodes hybrides, qui planifient les trajectoires d'objets et apprennent des primitives de contact à courte portée, ne tiennent pas dans des scènes très denses. LAMP propose de rendre ce problème tractable via un modèle génératif appris, combiné à une stratégie de recherche adaptative, ce qui constitue une approche architecturalement différente des VLA (Vision-Language-Action models) qui dominent l'espace humanoïde. La planification multi-robot en environnement encombré est un problème central pour l'automatisation logistique et industrielle, où des acteurs comme Exotec (France) déploient des flottes de robots AMR dans des entrepôts à haute densité. La recherche en robotique académique a longtemps traité la manipulation et la coordination de flotte séparément ; des travaux comme LAMP signalent une convergence vers des systèmes unifiés capables de gérer les deux dimensions. Cependant, l'absence totale de validation sur hardware réel est une limite importante : le sim-to-real gap reste le principal obstacle entre des résultats de simulation convaincants et une industrialisation effective. Les prochaines étapes naturelles seraient des tests sur bancs physiques multi-bras, dans des configurations représentatives de cellules de picking ou d'assemblage.

RecherchePaper
1 source