Aller au contenu principal
mmHRI : vers une interaction humain-robot préservant la vie privée grâce au radar à ondes millimétriques
RecherchearXiv cs.RO 

mmHRI : vers une interaction humain-robot préservant la vie privée grâce au radar à ondes millimétriques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent mmHRI, un cadre de manipulation robotique multimodal qui utilise un radar à ondes millimétriques (mmWave) pour guider l'interaction humain-robot sans caméra RGB. Le travail, publié sur arXiv (v2), repose sur deux choix d'architecture. Le premier est un traitement en double flux, qui apprend à la fois à partir des tenseurs radar bruts non filtrés et des nuages de points radar pour estimer les actions et les poses 3D de la personne. Le second est un modèle d'espace d'états à mémoire (MSSM), qui conserve les caractéristiques radar passées pour limiter les variations brusques de pose et d'action. Les états humains estimés sont ensuite convertis en instructions textuelles structurées, qui pilotent une politique vision-langage-action (VLA) chargée de la manipulation en boucle fermée et des réactions adaptées à la présence humaine. Dans un scénario de confidentialité où un rideau masque la personne, le système atteint 85,09 % de précision en reconnaissance d'actions, devant les approches radar existantes. Les essais robotiques portent sur la livraison et la récupération d'objets sous occlusion visuelle, avec des performances décrites comme stables sur des sujets, des encombrements et des environnements non vus à l'entraînement.

L'intérêt tient au verrou qu'il cible. La plupart des systèmes d'interaction humain-robot dépendent de caméras RGB qui observent en continu, ce qui les rend difficiles à déployer dans les lieux où l'imagerie identifiable est restreinte, comme les chambres d'hôpital ou certains restaurants. Le radar mmWave détecte le mouvement à travers des barrières sans produire d'image reconnaissable, ce qui ouvre une voie pour les robots d'assistance, de livraison ou de logistique hospitalière. Le travail montre aussi qu'une politique VLA peut être pilotée par un état humain textuel issu d'un capteur non visuel, plutôt que par des images. Les limites sont à garder en tête : 85 % de précision signifie encore environ une action sur sept mal interprétée. Il s'agit d'un résultat de laboratoire, avec peu d'informations publiques sur le nombre d'essais, le vocabulaire de gestes et les temps de cycle, et sans déploiement en conditions cliniques réelles.

Ce résultat s'inscrit dans deux évolutions. D'un côté, la manipulation guidée par VLA progresse, avec des modèles comme Pi-0, GR00T ou Helix, qui restent presque tous centrés sur la vision. De l'autre, la recherche sur le radar mmWave pour la reconnaissance d'actions et l'estimation de pose humaine avance depuis plusieurs années, mais elle était rarement couplée à la manipulation en boucle fermée. Les auteurs présentent mmHRI comme le premier cadre multimodal de manipulation robotique guidé par radar et respectueux de la vie privée, une revendication d'antériorité qu'il faudra vérifier. Aucun pilote industriel, calendrier ni partenaire n'est annoncé. Les prochaines étapes naturelles sont la validation sur davantage de gestes et de matériaux de barrière, puis des tests en milieu hospitalier ou en restauration.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Retargeting de mouvement du haut du corps, de l'humain au robot, préservant la géométrie à partir d'une vidéo monoculaire
1arXiv cs.RO 

Retargeting de mouvement du haut du corps, de l'humain au robot, préservant la géométrie à partir d'une vidéo monoculaire

Des chercheurs proposent un cadre de retargeting de mouvement qui convertit une simple vidéo RVB monoculaire en mouvements coordonnés du haut du corps pour un robot dual-bras à main dextre. Le système repose sur une reconstruction unifiée corps-mains : les estimations image par image du corps, les observations à l'échelle de la vidéo et les détails des mains contraignent ensemble un unique état du Momentum Human Rig (MHR), un modèle corporel différentiable. Les artefacts transitoires sur les mains sont corrigés directement dans l'espace des paramètres. Le mouvement est ensuite décrit par des grandeurs géométriques (directions des segments du bras, configuration du coude, orientation relative des paumes, relations bilatérales des poignets), puis exécuté par une cinématique inverse en plusieurs étapes et une adaptation propre à la main du robot. Au sein d'un système plus large, Across-VAM gère la génération vidéo et Across-WAM la mise en correspondance humain-robot. L'évaluation porte sur 16 vidéos (1 769 images source), dont 10 séquences de langue des signes et 6 de saisie. L'erreur moyenne de reprojection des mains passe de 22,36 à 7,21 pixels par rapport à SAM 3D Body. Les 16 trajectoires ont été rejouées en simulation cinématique, et deux mouvements représentatifs (signes, saisie) ont été démontrés sur un robot réel. Pour l'industrie, l'intérêt tient à la source de données. La vidéo monoculaire est la matière première la moins chère pour l'apprentissage par démonstration, bien moins coûteuse que la téléopération ou les gants de capture. Mais le transfert vers un robot bute sur un problème concret : corps et mains sont reconstruits à des échelles différentes, les cinématiques divergent et les mouvements distaux fins se perdent. Une réduction de l'erreur de reprojection de plus des deux tiers sur les mains est significative pour la dextérité, là où les pipelines existants dégradent le plus. Des réserves s'imposent toutefois. L'échantillon est très réduit (16 vidéos), le succès en simulation ne mesure que la faisabilité cinématique, sans dynamique ni contact, et la validation physique se limite à deux démonstrations qualitatives, sans taux de réussite chiffré. Le gain est mesuré contre un seul point de comparaison, et le cas de la langue des signes, bien que parlant, reste éloigné de la manipulation industrielle. Ce travail s'inscrit dans la course à la donnée pour les modèles de politique robotique. Les acteurs comme Figure, Tesla (Optimus) ou Physical Intelligence cherchent à exploiter des vidéos humaines à grande échelle pour nourrir leurs VLA, et la qualité du retargeting devient un goulot d'étranglement. La séparation entre génération vidéo (Across-VAM) et mapping humain-robot (Across-WAM) suggère une architecture modulaire pensée pour relier des modèles génératifs à l'exécution. Les prochaines étapes à surveiller sont une évaluation sur davantage de séquences, des taux de succès en manipulation réelle avec contacts, et une intégration avec des politiques apprises. Le papier est un preprint sur arXiv, non évalué par les pairs, et aucun calendrier de déploiement n'est annoncé.

RecherchePaper
1 source
Vers des robots ubiquitaires auto-réparables grâce à une IA à base d'agents orientée objectifs dans l'interaction homme-robot
2arXiv cs.RO 

Vers des robots ubiquitaires auto-réparables grâce à une IA à base d'agents orientée objectifs dans l'interaction homme-robot

Un article publié sur arXiv (2609.26155v1) décrit une architecture d'intelligence artificielle agentique orientée objectifs, conçue pour permettre à des utilisateurs non experts de réparer des robots ubiquitaires par simple dialogue en langage naturel, sans interface visuelle. Le système sépare quatre fonctions : décomposition des objectifs avant l'interaction, suivi persistant de l'état de la tâche, gestion stratégique des objectifs et exécution conversationnelle en temps réel. Testé sur une tâche de réparation matérielle physique auprès de vingt participants, il affiche un taux de réussite de 95%, dix-neuf réparations ayant été menées à terme. Les utilisateurs l'ont jugé utile et compétent, et l'agent est resté robuste face aux digressions, questions hors sujet ou changements de langue en cours d'échange. Comparé à une version en ligne antérieure, le passage à l'interaction physique a fait chuter significativement la présence sociale perçue (p=.0005) ainsi que la confiance et la compétence perçues (p=.037), l'utilité restant stable. L'enjeu concerne directement les intégrateurs et les équipes de maintenance industrielle : de nombreux robots déployés sur le terrain, bras, AMR, systèmes embarqués, n'ont ni écran ni interface graphique, ce qui complique toute réparation par un technicien non spécialiste. Un agent capable de guider une intervention par la voix, de suivre l'état d'une tâche et de résister aux digressions, laisse entrevoir une maintenance assistée sans mobiliser un expert sur site. Le résultat le plus significatif reste toutefois contre-intuitif : l'interaction physique réelle dégrade la confiance et la perception de compétence par rapport à un simple chatbot en ligne, alors que l'utilité perçue ne varie pas. Ce constat, obtenu sur un échantillon restreint, vient nuancer l'idée reçue selon laquelle l'incarnation physique d'un agent conversationnel renforce automatiquement la confiance des utilisateurs. L'étude s'inscrit dans un mouvement de recherche visant à doter les robots déployés hors des lignes de production contrôlées de capacités d'auto-réparation assistée, alors que les architectures agentiques fondées sur de grands modèles de langage s'étendent des chatbots vers le pilotage de tâches physiques structurées. Aucun acteur commercial ni plateforme robotique n'est nommé dans les travaux : il s'agit d'une contribution académique validée en laboratoire sur un panel restreint de vingt participants, sans calendrier de déploiement industriel annoncé. Les auteurs suggèrent implicitement d'élargir l'évaluation à des tâches de réparation plus variées et à des échantillons plus larges, afin de confirmer si l'écart de confiance observé entre interaction en ligne et interaction physique se reproduit à plus grande échelle.

RecherchePaper
1 source
Vers une intelligence physique semblable à l'humain : apprentissage vision-langage-action continu pour la manipulation robotique
3arXiv cs.RO 

Vers une intelligence physique semblable à l'humain : apprentissage vision-langage-action continu pour la manipulation robotique

Des chercheurs proposent LifelongVLA, un nouveau framework d'apprentissage continu pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique, décrit dans un article publié sur arXiv (2607.14852). Le système s'attaque à un problème classique de l'apprentissage séquentiel chez les robots : le compromis plasticité-stabilité, c'est-à-dire la capacité d'apprendre une nouvelle tâche sans effacer les compétences acquises précédemment. Concrètement, LifelongVLA introduit un module de gating LoRA à double échelle temporelle, séparant l'adaptation en deux voies légères : un adaptateur court terme pour la plasticité (apprentissage rapide de nouvelles tâches) et un adaptateur long terme pour la consolidation stable des compétences déjà maîtrisées. Une passerelle "task-aware" arbitre entre les deux. Le framework ajoute aussi une stratégie de rejeu ("replay") stochastique et économe en mémoire cache, qui préserve des signaux de rétention équilibrés sans avoir à stocker les trajectoires complètes des tâches passées. Les auteurs rapportent des résultats supérieurs aux méthodes existantes sur un bras robotique xArm en conditions réelles, avec une expansion efficace des compétences et une meilleure rétention des comportements de manipulation déjà appris. Cette avancée cible un angle mort réel des modèles VLA actuels (type Pi-0, GR00T N2 ou Helix) : la plupart sont entraînés une fois puis figés, ou doivent être ré-entraînés intégralement pour intégrer une nouvelle tâche, ce qui est coûteux et impraticable pour un déploiement industriel évolutif. Si un robot déployé en usine ou en entrepôt doit apprendre continuellement de nouvelles manipulations sans tout ré-apprendre à chaque fois ni oublier les précédentes, une méthode d'adaptation légère et peu gourmande en mémoire comme celle-ci intéresse directement les intégrateurs et décideurs qui cherchent à réduire les coûts de ré-entraînement et les temps d'arrêt liés à la mise à jour des compétences robotiques. C'est un pas vers des flottes de robots capables de monter en compétences sur site plutôt que de dépendre d'un redéploiement complet du modèle depuis un data center. Le travail s'inscrit dans la lignée de la recherche en "continual learning" appliquée à la robotique, un domaine longtemps dominé par les architectures de vision classique avant l'essor des VLA génératifs à grande échelle. Contrairement aux approches de fine-tuning complet ou à certaines méthodes de rejeu qui nécessitent de stocker l'intégralité des trajectoires passées (coûteux en stockage et en calcul), LifelongVLA mise sur des adaptateurs LoRA légers, une technique déjà largement utilisée pour le fine-tuning efficace des grands modèles de langage, ici transposée au contrôle robotique. L'article ne mentionne pas de partenaire industriel ni de déploiement commercial ; il s'agit d'un travail de recherche académique testé sur un seul bras xArm, avec des perspectives de validation à plus grande échelle et sur des plateformes robotiques plus variées à confirmer.

RechercheActu
1 source
Vers une cognition incarnée chez les robots grâce à des mondes synthétiques ancrés dans l'espace
4arXiv cs.RO 

Vers une cognition incarnée chez les robots grâce à des mondes synthétiques ancrés dans l'espace

Résumé traduit en français, à publier : Une équipe de recherche présente un cadre conceptuel destiné à entraîner des modèles vision-langage (VLM) à réaliser de la prise de perspective visuelle, une capacité jugée essentielle à la cognition incarnée dans l'interaction homme-robot. Pour amorcer ce travail, les auteurs publient un jeu de données synthétique généré dans NVIDIA Omniverse, conçu pour l'apprentissage supervisé de tâches de raisonnement spatial. Chaque exemple associe une image RGB, une description en langage naturel et une matrice de transformation 4x4 servant de vérité terrain pour la pose d'un objet. La première étape se limite à l'inférence de la distance sur l'axe Z ; les auteurs annoncent vouloir étendre l'approche à un raisonnement complet sur les 6 degrés de liberté (DOF) dans de futurs travaux. Le jeu de données est mis à disposition publiquement pour la communauté de recherche. La prise de perspective visuelle est une brique jugée fondamentale pour qu'un robot comprenne non pas seulement ce que voit sa propre caméra, mais ce qu'un humain perçoit depuis son propre point de vue, une condition posée comme nécessaire à une interaction homme-robot naturelle. Le choix de générer les données dans un simulateur plutôt que de les collecter en conditions réelles répond à un problème classique du secteur : produire des annotations 3D précises (pose exacte d'un objet) est coûteux et peu fiable dans le monde réel, alors qu'un environnement synthétique comme Omniverse fournit une vérité terrain exacte par construction. Ce travail illustre aussi une limite persistante des VLM génériques actuels, plutôt performants en reconnaissance sémantique 2D mais fragiles dès qu'il s'agit de raisonnement spatial 3D précis, une distinction que les auteurs eux-mêmes reconnaissent en limitant leur preuve de concept au seul axe Z plutôt qu'aux 6 DOF complets. Il s'agit donc d'un jalon de recherche exploratoire, pas d'un système prêt à être intégré par des équipes robotique en production. Ce travail s'inscrit dans une tendance de fond où les plateformes de simulation comme NVIDIA Omniverse et Isaac Sim deviennent des outils centraux de génération de données pour la robotique incarnée, dans un paysage où d'autres laboratoires (Physical Intelligence avec Pi-0, NVIDIA avec GR00T, Figure avec Helix) développent en parallèle des modèles vision-langage-action visant à doter les robots humanoïdes d'un raisonnement spatial et manipulatoire directement exploitable. La suite annoncée par les auteurs consiste à faire passer leur approche de l'estimation d'une simple distance à un raisonnement complet sur les 6 degrés de liberté d'une pose d'objet, une extension nécessaire avant d'envisager une application concrète en interaction homme-robot.

RecherchePaper
1 source