Planification du réarrangement de scènes pour l'IA incarnée
Une équipe de recherche présente Embodied Scene Rearrangement Planning (ESRP), une nouvelle tâche qui demande à un agent incarné de réorganiser des meubles dans une scène 3D pour atteindre une configuration cible, en ne disposant que d'observations égocentriques et d'un plan cible vu du dessus. Pour évaluer cette tâche, les auteurs publient ESRP-Bench, un benchmark construit sur le simulateur OmniGibson qui comprend plus de 5 400 paires de scènes et 8 200 objets, accompagné de trois métriques à plusieurs niveaux pour juger la qualité de la réorganisation. Quatre méthodes de référence sont testées: une approche hiérarchique de planification tâche-et-mouvement (TAMP), une méthode basée sur un modèle vision-langage (VLM), et deux approches par apprentissage, l'une par imitation (IL) et l'autre par renforcement (RL). Le papier est publié sur arXiv sous la référence 2608.27371, avec une page projet disponible sur pie-lab.cn/ESRP.
L'intérêt de ce travail tient à sa contrainte centrale: contrairement aux tâches de réarrangement étudiées jusqu'ici, ESRP interdit tout accès à un état global de la scène et introduit des occlusions mutuelles entre objets, ce qui oblige l'agent à recouper des vues partielles avec un objectif global, un problème représentatif des limites réelles du déploiement robotique. Les résultats expérimentaux montrent que les quatre approches testées, y compris celles fondées sur des modèles vision-langage, peinent à accomplir la tâche efficacement sur un horizon long. Ce constat va à l'encontre de l'idée reçue selon laquelle les architectures VLA ou VLM se généralisent facilement à des tâches de planification complexe: ici, ni la planification symbolique classique ni l'apprentissage ne suffisent seuls face à la perception partielle et aux occlusions.
ESRP s'inscrit dans la lignée des benchmarks de réarrangement de scènes utilisés pour évaluer la compréhension spatiale et la planification à long horizon chez les agents incarnés, mais se distingue en supprimant l'hypothèse commode d'un accès à l'état complet de l'environnement. Aucun calendrier de déploiement industriel n'est annoncé: il s'agit d'un jalon de recherche ouvert, destiné à servir de terrain d'essai standardisé pour la communauté avant tout transfert vers des scénarios robotiques réels.
Dans nos dossiers




