Aller au contenu principal
Planification de trajet fondée sur le bon sens à partir d'instructions abstraites
RecherchearXiv cs.RO 

Planification de trajet fondée sur le bon sens à partir d'instructions abstraites

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CoRS (commonsense ranked search), décrit dans un article arXiv du 22 septembre 2026 (arXiv:2609.22813v1), est un planificateur de chemin qui traduit une instruction abstraite comme "déplace-toi prudemment" en itinéraire respectant des considérations de bon sens jamais formulées explicitement, à l'image d'un sol mouillé qu'un ouvrier contourne sans consigne écrite. Le système combine grands modèles de langage (LLM) et modèles vision-langage (VLM) : pour chaque région observée, il déduit une considération locale ("sol glissant, détour justifié"), compare ces considérations entre elles ("la foule pèse plus que le sol mouillé"), puis convertit ce classement en coûts pour un algorithme de recherche classique garantissant toujours un chemin valide. Les auteurs publient un benchmark dédié : trois environnements, 1350 problèmes, cinq instructions réparties sur trois niveaux d'abstraction.

Les résultats montrent que CoRS repère les considérations implicites, contourne celles qui méritent un détour et traverse normalement les autres zones, un comportement que les planificateurs récents fondés sur des LLM ne reproduisent pas. Pour les intégrateurs de robots mobiles autonomes appelés à opérer parmi des humains (entrepôts, hôpitaux, bureaux), cela pointe un écart persistant entre le raisonnement affiché par les LLM en démonstration et leur capacité réelle à transformer un ordre flou en trajectoire sûre. L'étude suggère que le bon sens doit être ancré région par région dans la perception visuelle puis structuré en classement comparatif, plutôt qu'ajouté comme simple contrainte textuelle dans un prompt.

Publié comme preprint "new" sur arXiv, sans évaluation par les pairs à ce stade, CoRS s'inscrit dans les efforts visant à combler l'écart entre planification symbolique classique, robuste mais rigide face à l'implicite, et approches tout-LLM, flexibles mais incapables de garantir un chemin valide. L'article ne cite ni fabricant, ni site de déploiement, ni calendrier commercial : son apport tient au benchmark public et à la méthode de classement comparatif plutôt qu'à un produit prêt à intégrer. Les suites logiques évoquées restent une validation sur robot physique en conditions réelles et une comparaison directe avec les planificateurs LLM concurrents cités dans l'étude.

Dans nos dossiers

À lire aussi

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée
1arXiv cs.RO 

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée

Une équipe de recherche a publié fin mai 2026 un preprint arXiv (2605.25851) présentant RePlan-Bot, un agent conçu pour l'exécution d'instructions en langage naturel dans des environnements 3D interactifs, un champ désigné sous le terme Embodied Instruction Following (EIF). Le système repose sur trois couches complémentaires : un auditeur de haut niveau basé sur un LLM, qui ajuste dynamiquement les sous-objectifs en fonction des retours de l'environnement ; un mécanisme de recherche guidé par le sens commun, s'appuyant sur une carte d'instances multi-couches pour localiser précisément les objets ; et un correcteur léger basé sur un Vision Transformer (ViT), chargé de détecter et corriger les actions bas niveau à risque avant qu'elles ne causent des erreurs irréversibles. Évalué sur le benchmark ALFRED (Action Learning From Realistic Environments and Directives), RePlan-Bot revendique des performances à l'état de l'art dans les environnements vus et non vus, bien que l'abstract ne fournisse aucun chiffre précis de taux de succès ni comparaisons numériques explicites. L'intérêt de cette architecture pour les équipes d'IA embarquée réside dans sa gestion du replanning continu face aux changements d'état irréversibles, un point de défaillance classique des systèmes de planification hiérarchique. En robotique de service ou en manipulation d'objets, une action mal exécutée (déplacer un objet au mauvais endroit, ouvrir un conteneur prématurément) peut invalider l'ensemble du plan en cours. RePlan-Bot adresse ce problème via un audit permanent pendant l'exécution, ce qui le distingue des approches plan-then-execute qui supposent un environnement statique. La combinaison LLM haute-décision et ViT basse-exécution reflète une tendance structurante dans les architectures VLA (Vision-Language-Action) actuelles : déléguer la supervision sémantique à un modèle de langage, et la correction réactive à un modèle vision plus léger et plus rapide. Le benchmark ALFRED, publié par l'Allen Institute for AI en 2020, reste la référence dominante pour l'EIF en simulation (environnement iTHOR), mais son écart avec les conditions réelles (manipulation physique, bruit sensoriel, variabilité des objets) est bien documenté dans la littérature. RePlan-Bot s'inscrit dans un champ de recherche concurrentiel qui inclut des travaux comme FILM et HLSM, ainsi que des approches VLA plus récentes comme OpenVLA ou Pi-0 de Physical Intelligence. Aucun déploiement matériel ni partenariat industriel n'est mentionné dans le preprint : il s'agit d'une contribution académique en environnement simulé, et la question du transfert sim-to-real, centrale pour tout intégrateur, reste entière.

RechercheOpinion
1 source
Planification de fabrication additive robotisée par IA à base d'agents fondée sur la cinématique
2arXiv cs.RO 

Planification de fabrication additive robotisée par IA à base d'agents fondée sur la cinématique

Une équipe de recherche présente dans un preprint publié sur arXiv (2609.19347v1) un système baptisé A-RAM, pour "agentic robotic additive manufacturing", conçu pour planifier automatiquement les processus de fabrication additive exécutés par un bras robotique plutôt que par une imprimante 3D classique à portique cartésien. Le système combine un grand modèle de langage, chargé d'interpréter les objectifs et contraintes de fabrication exprimés par l'utilisateur et de les traduire dans un schéma structuré, avec un agent de planification déterministe qui construit le plan de recherche correspondant, et des outils spécialisés qui calculent des preuves quantitatives sur le découpage (slicing), le placement de la pièce, la cinématique inverse, le minutage de la trajectoire, le jerk de l'axe 6 et l'extrusion. Le framework a été testé sur une cellule robotisée équipée d'un bras six axes, à travers quatre scénarios : planification spécifiée par un expert, planification à partir du seul objectif, criblage du remplissage (infill) selon l'objectif visé, et sélection de l'orientation et du placement selon la géométrie de la pièce. Les plans retenus par le système réduisent jusqu'à 53,5% le jerk maximal sur l'axe 6 et jusqu'à 48,3% le jerk moyen absolu par rapport aux candidats valides les moins favorables, tandis que le criblage d'infill orienté objectif raccourcit les temps de complétion du plan de mouvement jusqu'à 40,1% et les trajectoires d'extrusion jusqu'à 12,7%. L'enjeu pointé par les auteurs est concret pour les intégrateurs industriels : un plan de découpage jugé bon dans le référentiel de la pièce peut devenir irréalisable ou mécaniquement défavorable une fois transposé sur un manipulateur robotique, car l'orientation de la pièce et son placement dans l'espace de travail influencent directement la faisabilité cinématique. Les outils existants, qu'il s'agisse des slicers classiques, des systèmes d'aide à la décision basés sur des LLM ou des jumeaux numériques, n'évaluent pas ces décisions couplées avant l'exécution. A-RAM illustre une tendance plus large où le LLM sert de couche de raisonnement et de traduction d'intention plutôt que de générateur direct de trajectoires, la validation restant confiée à des outils déterministes. Il s'agit d'un travail de recherche académique évalué en laboratoire sur une cellule unique, sans annonce de déploiement industriel, de partenariat commercial ni de calendrier de mise sur le marché. Le papier se positionne explicitement face à trois catégories d'outils jugées insuffisantes : les chaînes de slicing traditionnelles, les assistants de décision fondés sur des LLM, et les systèmes de jumeau numérique, aucun ne proposant selon les auteurs une évaluation pré-exécution intégrée des décisions de découpage, de placement et de cinématique.

RecherchePaper
1 source
MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
3arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
Découpler planification et contrôle pour des agents instructibles
4arXiv cs.RO 

Découpler planification et contrôle pour des agents instructibles

Une équipe de recherche publie sur arXiv (2608.26788v1) l'article « Decoupling Planning and Control for Instructable Agents », qui présente le système Instruct-to-Act. L'architecture associe un modèle vision-langage (VLM) pré-entraîné, chargé de traduire instructions et observations en plans de haut niveau peu fréquents, à un contrôleur de type « world model » entraîné pour agir en autonomie à haute fréquence à partir de ces instructions. Pour le rendre instructable, les chercheurs relabellisent des trajectoires du contrôleur avec des instructions synthétiques et optimisent conjointement clonage de comportement, récompense et modélisation du monde. Le système est testé sur sept environnements simulés, dont trois multi-agents où des planificateurs VLM coordonnent par le langage pendant que les contrôleurs entraînés agissent comme actionneurs. Ce travail répond à une limite bien identifiée dans le secteur : les VLM planifient bien à partir d'instructions et d'observations, mais peinent à transformer ces plans en actions fiables et rapides en environnement inconnu, tandis que les contrôleurs « world model » contrôlent vite mais manquent de guidage sur la tâche à accomplir. À espaces d'observation et d'action équivalents, l'approche découplée surpasse de façon constante les variantes contrôleur seul et génération d'action directe par le VLM, tout en gardant un contrôle rapide et en permettant de changer de planificateur VLM sans réentraîner le contrôleur, un atout pour des intégrateurs voulant faire évoluer le « cerveau » sans retoucher les « réflexes » du robot. Elle reste toutefois seulement compétitive, et non systématiquement supérieure, face à des références vision-langage-action (VLA) et RL multi-agent solides, sur six tâches sur sept. Il s'agit d'un article de recherche, non d'une annonce produit : le résumé ne cite aucune entreprise ni robot commercial, et les sept environnements testés sont simulés, sans déploiement sur matériel réel évoqué. La démarche rejoint une tendance de l'apprentissage robotique consistant à séparer un raisonnement lent de haut niveau d'un contrôle réactif rapide, déjà explorée par des systèmes industriels comme Helix chez Figure ou GR00T N2 chez Nvidia. Aucun pilote ni calendrier vers des robots physiques n'est mentionné : la contribution porte sur la méthodologie et sa capacité à généraliser entre plusieurs bancs d'essai simulés.

RechercheActu
1 source