Aller au contenu principal
PRISM : planification et raisonnement intentionnel dans des environnements simulés à IA incarnée
RecherchearXiv cs.RO 

PRISM : planification et raisonnement intentionnel dans des environnements simulés à IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié PRISM (Planning and Reasoning with Intent in Simulated Embodied Environments) sur arXiv en mai 2026, un benchmark de diagnostic pour agents incarnés basés sur des LLM. Là où les benchmarks actuels se limitent à un taux de succès global, PRISM identifie quel module cognitif est responsable d'un échec. Le dispositif repose sur cinq appartements multi-pièces photoréalistes (4 à 8 pièces chacun) et 300 tâches validées par des humains, organisées en trois niveaux de capacité : Basic Ability (ancrage perception-action), Reasoning Ability (résolution d'intentions implicites) et Long-horizon Ability (coordination multi-étapes soutenue). L'API d'évaluation est agnostique au type d'agent, couvrant LLM, VLM, planificateurs symboliques, politiques RL et systèmes hybrides dans le même protocole. Des expériences sur sept LLM contemporains montrent que les modèles légers s'effondrent à 20 % de succès sur les tâches long-horizon tout en consommant davantage de tokens que les modèles frontier, un phénomène que les auteurs nomment sur-raisonnement compensatoire.

Ce résultat contredit une hypothèse dominante dans l'IA incarnée : en conditions de perception oracle (sans erreur de détection), l'ancrage spatial n'est pas le principal facteur limitant. C'est la résolution d'intentions implicites qui constitue le goulot d'étranglement commun à toutes les familles de modèles testées, y compris les plus puissantes. Pour les intégrateurs et décideurs B2B, la découverte du sur-raisonnement compensatoire est un signal d'alerte concret : un modèle léger déployé en edge peut afficher une activité de raisonnement apparente (volume de tokens élevé) tout en échouant massivement sur des tâches complexes. PRISM offre ainsi un protocole de qualification plus fin que le simple taux de complétion, permettant de cibler les investissements entre perception, mémoire et planification.

PRISM s'inscrit dans un mouvement de benchmarking plus rigoureux des agents incarnés, aux côtés de référentiels comme ALFRED ou ScienceWorld qui agrègent les résultats sans en décomposer les causes. La publication intervient alors que DeepMind, Google, Meta et des startups comme Physical Intelligence (auteure de pi0) investissent massivement dans les architectures VLA (Vision-Language-Action) pour la robotique domestique et industrielle. L'API publique et agnostique à l'agent est conçue pour une adoption communautaire large. Il s'agit cependant d'un preprint académique : aucun pilote industriel ni timeline de déploiement ne sont annoncés à ce stade.

À lire aussi

Planification du réarrangement de scènes pour l'IA incarnée
1arXiv cs.RO 

Planification du réarrangement de scènes pour l'IA incarnée

Une équipe de recherche présente Embodied Scene Rearrangement Planning (ESRP), une nouvelle tâche qui demande à un agent incarné de réorganiser des meubles dans une scène 3D pour atteindre une configuration cible, en ne disposant que d'observations égocentriques et d'un plan cible vu du dessus. Pour évaluer cette tâche, les auteurs publient ESRP-Bench, un benchmark construit sur le simulateur OmniGibson qui comprend plus de 5 400 paires de scènes et 8 200 objets, accompagné de trois métriques à plusieurs niveaux pour juger la qualité de la réorganisation. Quatre méthodes de référence sont testées: une approche hiérarchique de planification tâche-et-mouvement (TAMP), une méthode basée sur un modèle vision-langage (VLM), et deux approches par apprentissage, l'une par imitation (IL) et l'autre par renforcement (RL). Le papier est publié sur arXiv sous la référence 2608.27371, avec une page projet disponible sur pie-lab.cn/ESRP. L'intérêt de ce travail tient à sa contrainte centrale: contrairement aux tâches de réarrangement étudiées jusqu'ici, ESRP interdit tout accès à un état global de la scène et introduit des occlusions mutuelles entre objets, ce qui oblige l'agent à recouper des vues partielles avec un objectif global, un problème représentatif des limites réelles du déploiement robotique. Les résultats expérimentaux montrent que les quatre approches testées, y compris celles fondées sur des modèles vision-langage, peinent à accomplir la tâche efficacement sur un horizon long. Ce constat va à l'encontre de l'idée reçue selon laquelle les architectures VLA ou VLM se généralisent facilement à des tâches de planification complexe: ici, ni la planification symbolique classique ni l'apprentissage ne suffisent seuls face à la perception partielle et aux occlusions. ESRP s'inscrit dans la lignée des benchmarks de réarrangement de scènes utilisés pour évaluer la compréhension spatiale et la planification à long horizon chez les agents incarnés, mais se distingue en supprimant l'hypothèse commode d'un accès à l'état complet de l'environnement. Aucun calendrier de déploiement industriel n'est annoncé: il s'agit d'un jalon de recherche ouvert, destiné à servir de terrain d'essai standardisé pour la communauté avant tout transfert vers des scénarios robotiques réels.

RecherchePaper
1 source
MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
2arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
Raisonnement inverse rationnel : imitation en quelques exemples par inférence d'intention via la planification
3arXiv cs.RO 

Raisonnement inverse rationnel : imitation en quelques exemples par inférence d'intention via la planification

Une équipe de recherche en robotique présente Rational Inverse Reasoning (RIR), une méthode d'apprentissage par imitation capable d'acquérir une nouvelle tâche de manipulation à partir d'une seule démonstration, contre des centaines voire des milliers habituellement nécessaires aux approches actuelles. Le système combine un modèle vision-langage (VLM), qui propose des programmes candidats décrivant l'intention du démonstrateur, et un planificateur hiérarchique de type task-and-motion-planning (TAMP) qui évalue la plausibilité de ces programmes selon un principe de rationalité bornée. Par itérations successives, RIR affine cet ensemble de candidats pour converger vers une explication compacte et exécutable de la tâche, sous forme de buts, sous-buts et contraintes. La méthode a été testée sur un benchmark de raisonnement en 2D ainsi que sur un bras robotique réel Franka FR3. En configuration à un ou trois exemples de démonstration, RIR améliore le taux de réussite de 34 et 28 points de pourcentage par rapport aux approches de référence combinant VLM et planification, mais dépourvues d'inférence explicite de la rationalité. L'enjeu dépassé ici est celui de la généralisation, le talon d'Achille de l'imitation learning en robotique. Un humain apprend un geste et sait l'adapter à une nouvelle pièce, de nouveaux objets ou de nouvelles contraintes ; les politiques apprises par imitation, elles, s'effondrent souvent au moindre changement de disposition ou de géométrie. RIR répond à ce problème non pas en accumulant davantage de données, mais en changeant de niveau d'abstraction: au lieu de reproduire des trajectoires de mouvement, le système infère le pourquoi du comportement démontré. Pour les intégrateurs et laboratoires travaillant sur des politiques de manipulation generalistes, ce résultat suggère qu'un raisonnement structuré ancré dans la planification symbolique peut réduire drastiquement le besoin de données, un argument qui pèse face aux approches VLA pures gourmandes en démonstrations. Ce travail s'inscrit dans une lignée de recherches cherchant à combiner modèles de fondation et planification classique plutôt que de tout déléguer à l'apprentissage de bout en bout. La publication, mise à jour sur arXiv en tant que "replace" d'une version antérieure, ouvre la voie à des extensions vers des tâches multi-étapes plus complexes et des environnements moins contrôlés que le laboratoire.

RecherchePaper
1 source
HINT-Plan : planification de tâches robotiques tenant compte de l'intention humaine dans des environnements riches en contexte, via des modèles vision-langage
4arXiv cs.RO 

HINT-Plan : planification de tâches robotiques tenant compte de l'intention humaine dans des environnements riches en contexte, via des modèles vision-langage

Des chercheurs ont présenté HINT-Plan, un système de planification de tâches robotiques qui intègre la prédiction des intentions humaines dans la prise de décision, selon un article publié sur arXiv (référence 2609.17771v1, catégorie "new") en septembre 2026. Le système utilise des modèles vision-langage (VLM) pour anticiper les intentions humaines de haut niveau à partir d'observations d'images à la troisième personne, puis convertit ces intentions en états-objectifs exploitables pour résoudre des problèmes de planification conjointe homme-robot. Pour représenter l'environnement, HINT-Plan s'appuie sur des graphes de scène hiérarchiques (Scene Graphs) qui traduisent la topologie des lieux et les connaissances actionnables en un langage de planification formel garantissant des plans exécutables. Évalué dans un environnement de simulation photoréaliste, le système atteint un taux de réussite global de 69,71 % en planification conjointe homme-robot, dépassant les méthodes de référence de jusqu'à 35,29 points, tout en réduisant les conflits fonctionnels entre agents humain et robotique. Ce travail s'attaque à un angle mort documenté du secteur de la robotique mobile: la quasi-totalité des approches dites "conscientes de l'humain" se limitent aujourd'hui à l'évitement de collision au niveau de la planification de mouvement bas niveau, sans anticiper le comportement humain à un niveau décisionnel supérieur. En démontrant qu'un VLM peut inférer des intentions humaines exploitables pour une planification multi-agents formelle, l'étude apporte un argument empirique en faveur des architectures VLA appliquées non plus seulement au contrôle moteur, mais à la coordination stratégique entre humains et robots dans des espaces partagés, un enjeu direct pour les AMR et robots collaboratifs en entrepôt ou en environnement domestique. Il s'agit toutefois d'une validation en simulation uniquement, sans déploiement matériel ni test en conditions réelles, ce qui limite la portée immédiate des résultats. Le papier s'inscrit dans la lignée des travaux combinant graphes de scène et planification symbolique, en réponse aux limites des baselines existantes qui ignorent l'anticipation comportementale. Les auteurs ne précisent pas de calendrier de transfert vers le réel ni de partenariat industriel; la validation sur robot physique reste l'étape logique suivante pour confirmer la robustesse de l'approche hors simulation.

RecherchePaper
1 source