Aller au contenu principal
RecherchearXiv cs.RO 

Raisonnement cognitif pour l'action de robots proactifs à partir d'observations multimodales centrées sur l'humain

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (référence 2609.23486, avec pour type d'annonce "new", donc une première soumission datée de septembre 2026) un article qui formule ProRobo (Proactive Robot Action Reasoning), un nouveau problème de raisonnement cognitif pour robots d'assistance : déterminer quelle action entreprendre à partir d'indices humains et environnementaux multimodaux, sans instruction explicite. Pour l'étudier, l'équipe construit ProAction, un jeu de données réel de 10 000 échantillons combinant observations visuelles, signaux audio et texte, couvrant 12 scénarios de vie quotidienne répartis dans cinq scènes courantes. Les annotations d'action de haut niveau proviennent d'un pipeline en deux étapes associant humains et modèles : une génération de candidats guidée par une théorie de l'évaluation cognitive (appraisal), puis un raffinement humain informé par une théorie de l'esprit affective, qui intègre explicitement l'état de la personne, l'urgence, la faisabilité et le risque potentiel dans chaque annotation. Sur cette base, les auteurs évaluent plusieurs grands modèles de langage multimodaux (MLLM) généralistes et présentent MMC2Act, un modèle de référence entraîné à faire correspondre observations multimodales et actions cognitives de haut niveau, testé sur différents réglages de modalités, une généralisation à des sujets non vus à l'entraînement, un transfert inter-jeux de données et une évaluation humaine.

Le résultat central est que les MLLM généralistes peinent à raisonner de façon proactive à partir d'indices multimodaux, tandis qu'un entraînement sur ProAction améliore nettement les performances. Pour l'industrie robotique, ce travail cible un maillon encore peu documenté : la couche de décision en amont de l'action, celle qui doit repérer qu'une personne a besoin d'aide avant même qu'elle ne formule une demande, une capacité clé pour les robots d'assistance domestique ou de service vendus comme "autonomes". L'article souligne aussi l'écart entre les modèles de fondation génériques, entraînés sur des corpus web, et les exigences d'un contexte social et physique réel : sans données annotées selon un cadre affectif et contextuel explicite, ces modèles restent de mauvais juges de l'urgence ou du risque. Pour les intégrateurs et décideurs B2B évaluant des plateformes d'assistance, le papier rappelle que la promesse d'autonomie proactive dépend moins de la puissance brute d'un MLLM que de la qualité et de la structure des données liées au contexte humain, un point souvent minimisé dans les discours commerciaux.

Ce travail s'inscrit dans la lignée des efforts récents sur l'assistance robotique proactive, un axe encore marginal comparé aux grands jeux de données orientés instructions explicites ou contrôle bas niveau qui dominent l'apprentissage robotique actuel. Les auteurs positionnent ProAction comme comblant un manque : les ressources existantes couvrent soit d'autres contextes, soit d'autres niveaux d'action, sans traiter la prise de décision multimodale humaine en conditions réelles. Il s'agit à ce stade d'une contribution de recherche en prépublication sur arXiv, sans lien mentionné avec un déploiement robotique physique, un partenaire industriel ou un calendrier de commercialisation : le jeu de données et MMC2Act sont évalués sur des benchmarks de raisonnement, pas sur un robot exécutant physiquement ces actions. La suite logique, non détaillée dans l'article, serait d'intégrer ce raisonnement cognitif en amont dans une pile robotique complète couplée à des modules d'exécution physique, à l'image des approches VLA comme Pi-0 ou GR00T N2 qui traitent la partie aval du problème.

Dans nos dossiers

À lire aussi

D'observateur passif à critique actif : l'apprentissage par renforcement révèle un raisonnement de processus pour la manipulation robotique
1arXiv cs.RO 

D'observateur passif à critique actif : l'apprentissage par renforcement révèle un raisonnement de processus pour la manipulation robotique

Une équipe de recherche propose PRIMO R1 (Process Reasoning Induced Monitoring), un framework de 7 milliards de paramètres qui transforme les modèles vidéo multimodaux (MLLM) en "critiques" actifs capables d'évaluer la progression d'une tâche de manipulation robotique, plutôt qu'en simples "observateurs" qui se contentent de reconnaître les actions en cours. La méthode s'appuie sur de l'apprentissage par renforcement basé sur le résultat final pour inciter le modèle à générer un raisonnement explicite en chaîne de pensée (chain-of-thought) lors de l'estimation de la progression. L'architecture ancre la séquence vidéo entre une image de l'état initial et une image de l'état courant, une construction temporelle structurée soutenue par un nouveau jeu de données et benchmark, le PRIMO Dataset. Les résultats annoncés sont significatifs : une réduction de 50% de l'erreur absolue moyenne par rapport aux meilleures références spécialisées, des gains face à des MLLM généralistes de 72 milliards de paramètres malgré une taille dix fois inférieure, et 67,0% de précision sur le benchmark RoboFail, dépassant le modèle o1 d'OpenAI de 6 points. Cette avancée cible un vrai point de friction du secteur : pour les tâches de manipulation longues, les robots doivent non seulement reconnaître ce qu'ils font, mais estimer où ils en sont par rapport à l'objectif final, une capacité clé pour la détection autonome d'échecs sans supervision humaine. Qu'un modèle de 7B batte des systèmes bien plus lourds, y compris o1, sur ce type de raisonnement suggère que le renforcement orienté résultat peut compenser la taille, un argument important pour un déploiement embarqué sur des robots humanoïdes où latence et coût de calcul comptent. Le travail s'inscrit dans la vague de modèles de raisonnement entraînés par RL appliquée spécifiquement à la robotique, avec des tests validés aussi bien en environnements simulés qu'en scénarios réels sur humanoïdes. Il s'agit à ce stade d'une publication de recherche (preprint arXiv, version révisée) accompagnée d'un dataset et d'un benchmark ouverts, pas d'un produit déployé, mais elle pose une référence explicite face aux modèles généralistes et aux systèmes propriétaires comme o1 sur la détection d'échec robotique.

RecherchePaper
1 source
OA-NBV : planification de vues sensible aux occlusions pour la perception active centrée sur l'humain de robots mobiles
2arXiv cs.RO 

OA-NBV : planification de vues sensible aux occlusions pour la perception active centrée sur l'humain de robots mobiles

Des chercheurs présentent OA-NBV (Occlusion-Aware Next-Best-View Planning), un pipeline de planification de point de vue pour robots mobiles confrontés à une personne partiellement masquée par des obstacles, publié sur arXiv sous la référence 2603.11072, en version 2 remplaçant une publication antérieure. Le système évalue les points de vue candidats accessibles au robot à l'aide d'un modèle de visibilité centré sur la cible, qui intègre l'occlusion, l'échelle de la personne dans le champ visuel et la complétude de l'observation. Les auteurs rapportent un taux de réussite supérieur à 90% en simulation comme en essais réels, alors que les méthodes NBV de référence se dégradent nettement dès qu'une occlusion survient. Comparé au meilleur de ces baselines, OA-NBV augmente la surface normalisée occupée par la cible d'au moins 81% et la visibilité des points clés du corps, utilisés pour l'estimation de posture, d'au moins 58%, selon les configurations testées. L'enjeu dépasse la démonstration en laboratoire: recherche et sauvetage, triage d'urgence et intervention post-catastrophe se déroulent justement dans des environnements encombrés où la visibilité partielle dégrade la détection de personnes ou l'estimation de pose en aval. Or la plupart des méthodes NBV existantes optimisent une exploration générique ou une couverture à long horizon, sans viser l'objectif immédiat d'obtenir une seule vue exploitable d'une personne cachée sous des contraintes de mouvement réelles. En ciblant ce cas d'usage plus étroit, OA-NBV se présente comme un module de sélection de point de vue intégrable à diverses tâches de perception centrées sur l'humain sans refonte de la chaîne d'autonomie, un argument qui parle directement aux intégrateurs confrontés au même écart entre couverture générique et besoin réel de perception. Le travail s'inscrit dans la lignée des recherches sur le Next-Best-View, historiquement tournées vers l'exploration ou la reconstruction 3D générique, dont OA-NBV se démarque en ciblant la perception active centrée sur l'humain. Ses méthodes de référence sont explicitement présentées comme des approches NBV standards qui échouent dès que l'occlusion s'installe, l'écart précis que la contribution cherche à combler. Il s'agit pour l'instant d'une publication de recherche, un preprint arXiv en version 2, sans plateforme, entreprise ni calendrier de déploiement mentionnés dans le texte, son adoption dépendant d'une intégration dans des piles logicielles existantes et de validations sur d'autres morphologies de robots et des occlusions plus denses que celles testées.

RecherchePaper
1 source
MUSON : jeu de données multimodal orienté raisonnement pour la navigation socialement conforme en milieu urbain
3arXiv cs.RO 

MUSON : jeu de données multimodal orienté raisonnement pour la navigation socialement conforme en milieu urbain

Une équipe de recherche publie MUSON, un nouveau jeu de données multimodal destiné à entraîner les robots et systèmes de navigation autonome à respecter les normes sociales dans les espaces partagés avec des humains. Le corpus comprend 10 110 échantillons égocentriques (captés à la première personne, comme le ferait un robot ou un piéton) collectés dans des scènes intérieures et extérieures variées. Chaque échantillon est annoté selon un cadre structuré en cinq étapes de raisonnement en chaîne : perception, prédiction, raisonnement, action et explication, avec un espace de décision standardisé à six actions possibles et une modélisation explicite des contraintes physiques statiques (obstacles fixes, rétrécissements de passage, etc.). Les chercheurs ont évalué dix modèles vision-langage (VLM) de taille petite à moyenne sur ce benchmark. Qwen3-VL-8B, développé par Alibaba, arrive en tête avec une précision d'action de 0,7765, un score Macro-F1 de 0,7490 et le taux de collision le plus bas parmi les modèles testés, à 0,0609. Le dataset est publié en accès libre sur GitHub sous la version 1.0. Cette publication répond à un manque identifié dans la recherche en navigation sociale : jusqu'ici, aucun jeu de données à grande échelle ne combinait annotations égocentriques et raisonnement structuré pour ce cas d'usage précis. Les modèles vision-langage génériques, même performants sur des tâches visuelles classiques, peinent à interpréter finement les normes sociales implicites (céder le passage, anticiper une trajectoire piétonne, respecter une distance de confort) sans fine-tuning spécifique. En fournissant un benchmark reproductible avec des métriques comparables, MUSON offre aux équipes de recherche en robotique mobile et en véhicules autonomes de proximité un outil pour évaluer objectivement leurs modèles, plutôt que de se fier à des démonstrations ponctuelles souvent peu représentatives des conditions réelles. Le projet s'inscrit dans la lignée des travaux récents cherchant à exploiter les VLM comme couche de raisonnement de haut niveau pour la navigation robotique, en complément des piles de perception et de contrôle bas niveau classiques. Contrairement à une annonce produit, il s'agit ici d'une contribution académique dont la valeur dépendra de son adoption par la communauté comme référence d'évaluation, à l'image d'autres benchmarks ayant structuré des sous-domaines de la robotique ces dernières années. Le code et les données étant publics, les prochaines étapes attendues sont des extensions du dataset et des comparaisons avec des modèles plus volumineux ou spécialisés.

RecherchePaper
1 source
L'AquaJEPA, des représentations prédictives multimodales conditionnées par action pour la dynamique des robots sous-marins
4arXiv cs.RO 

L'AquaJEPA, des représentations prédictives multimodales conditionnées par action pour la dynamique des robots sous-marins

AquaJEPA est un nouveau modèle prédictif conditionné par l'action, conçu pour la navigation de robots sous-marins en conditions dégradées. Le système fusionne trois sources de données, une caméra RGB, un sonar frontal et la proprioception, avec un indicateur explicite de validité de chaque capteur, puis prédit une représentation latente future à partir des commandes envoyées aux huit propulseurs du véhicule. Ces prédictions de vitesse et de profil sonar alimentent ensuite un planificateur à horizon glissant partagé. L'équipe a testé la méthode dans le simulateur Stonefish, face à cinq approches concurrentes (contrôle réactif, modèle état seul, multimodal ordinaire, dynamique supervisée, modèle du monde récurrent), avec une réplication préenregistrée sur 120 environnements croisant trois cartes d'obstacles inédites, quatre niveaux de turbidité de l'eau et des dynamiques nominales ou décalées, incluant des pertes intermittentes du DVL (loch Doppler). Résultat: sur 120 environnements inédits avec perte programmée du DVL, AquaJEPA atteint son objectif dans 74 cas, contre 68 pour le modèle état seul et pour le modèle du monde récurrent, avec l'erreur finale moyenne la plus faible (0,906 m). Les réductions d'erreur par rapport au multimodal ordinaire, à la dynamique supervisée et au modèle récurrent sont respectivement de 0,273 m, 0,364 m et 0,106 m, toutes statistiquement significatives; l'avantage sur le modèle état seul reste en revanche non tranché statistiquement. L'enjeu dépasse la simple performance en simulation: les robots sous-marins autonomes opèrent dans des conditions où la fiabilité des capteurs varie brutalement selon la turbidité, l'angle de vue ou les mouvements du véhicule, un problème classique de navigation dégradée que peu de modèles de monde traitent explicitement avec fusion multimodale conditionnée par capteur valide. Ce travail apporte une preuve empirique, avec intervalles de confiance et ablations sur la cible EMA, la marge d'action et le dropout de modalité, que l'architecture JEPA (joint-embedding prédictive architecture) tient face à des baselines établies en robotique sous-marine, un terrain où la littérature reste plus rare que pour les manipulateurs terrestres. AquaJEPA s'inscrit dans la lignée des architectures JEPA popularisées par les travaux de Yann LeCun sur l'apprentissage de représentations prédictives sans reconstruction pixel par pixel, ici adaptées à un cas d'usage robotique concret et multimodal. L'étude reste cantonnée à la simulation Stonefish; la validation en conditions réelles, en mer ou en bassin, constitue l'étape suivante logique pour confirmer que les gains observés résistent au bruit et aux dérives physiques d'un déploiement effectif.

RecherchePaper
1 source