Aller au contenu principal
RecherchearXiv cs.RO 

OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient OntoPlan, un cadre de planification de tâches robotiques fondé sur une représentation ontologique de la scène, accompagné d'un code ouvert sur GitHub (dépôt namhyeongwoo/OntoPlan). Le système cible un défaut connu de la planification par grands modèles de langage (LLM) : sur les tâches à long horizon dans de vastes environnements, la performance se dégrade. Quand la géométrie de la scène est transmise sous forme de texte, le modèle saisit mal le contexte spatial, et le coût en tokens croît avec la taille de l'environnement. OntoPlan aligne objets, espaces, relations et états dans un vocabulaire symbolique commun. Un cadre agentique interprète l'instruction, récupère de façon sélective les informations utiles, formalise buts et contraintes, puis produit un plan exécutable. Sur 150 tâches générales réparties dans cinq environnements intérieurs et trois échelles de scène, il atteint un taux de réussite moyen de 0,89, contre 0,27 pour la meilleure méthode de référence. Il consomme en moyenne 18,1 k tokens par tâche, soit environ 5,6 fois moins que la référence la plus économe.

L'enjeu est double pour les intégrateurs et les équipes qui déploient des robots pilotés par LLM. D'abord, l'écart de 0,89 contre 0,27 suggère que le goulot d'étranglement tient moins à la capacité de raisonnement du modèle qu'à la manière de lui présenter le monde : un LLM qui génère directement des séquences d'actions peine à respecter l'état courant et les préconditions, alors qu'une formalisation symbolique les rend vérifiables. Ensuite, le coût en tokens, rarement discuté dans les démonstrations, détermine la viabilité économique et la latence en exploitation. Les auteurs indiquent que l'avantage persiste quand l'échelle de la scène augmente, alors que les méthodes concurrentes perdent davantage en réussite et restent beaucoup plus coûteuses. Le système demande aussi des précisions face à une instruction ambiguë, ou signale un manque d'information face à une instruction infaisable, au lieu de s'engager dans un plan invalide. C'est un comportement de sécurité utile pour tout déploiement industriel.

Plusieurs réserves s'imposent. Il s'agit d'un préprint arXiv (v1), non évalué par les pairs. Les résultats viennent d'un banc d'essai de 150 tâches, sans précision dans le résumé sur la nature des environnements (simulés ou réels) ni sur les méthodes de référence. Les chiffres ne disent donc rien de la robustesse en conditions réelles, où perception bruitée et échecs d'exécution compliquent la construction de l'ontologie. Ce travail s'inscrit dans le courant de la planification neuro-symbolique, qui combine LLM et planificateurs formels (type PDDL) pour pallier les limites des approches où le modèle génère directement les actions. Il se distingue des modèles vision-langage-action de bout en bout, qui traitent le bas niveau. La publication du code permettra une reproduction indépendante, étape décisive pour juger si l'écart de performance tient hors du banc d'essai des auteurs.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Scale-Plan : planification de tâches par le langage pour équipes multi-robots hétérogènes, à grande échelle
1arXiv cs.RO 

Scale-Plan : planification de tâches par le langage pour équipes multi-robots hétérogènes, à grande échelle

Le Honda Research Institute a publié sur arXiv une version révisée (v2, arXiv:2603.08814) de Scale-Plan, un système de planification de tâches à long horizon pour des équipes de robots hétérogènes. Face aux planificateurs symboliques classiques, qui exigent des spécifications construites à la main, et aux approches par grands modèles de langage, sujettes aux hallucinations et à un mauvais ancrage dans des environnements riches en objets, la méthode filtre l'information perceptuelle avant de planifier. À partir d'une spécification de domaine au format PDDL, Scale-Plan construit un graphe d'actions représentant la structure du domaine, puis utilise un raisonnement LLM volontairement superficiel pour guider une recherche structurée qui isole le sous-ensemble minimal d'actions et d'objets pertinents pour l'instruction donnée en langage naturel. Les auteurs introduisent aussi MAT2-THOR, un benchmark nettoyé bâti sur le simulateur AI2-THOR, destiné à évaluer de façon fiable les systèmes de planification multi-robot. L'enjeu est concret pour les intégrateurs de flottes hétérogènes : plus le nombre d'objets et d'agents croît, plus les planificateurs symboliques deviennent lourds à construire manuellement, tandis que les approches purement LLM perdent en fiabilité en inventant des actions ou des objets absents de l'environnement réel. En réduisant le problème à un sous-graphe minimal avant la décomposition des tâches, l'allocation entre robots et la génération de plans longs, Scale-Plan vise à combiner la robustesse du raisonnement symbolique et la flexibilité du langage naturel. Sur des tâches multi-agents complexes, la méthode dépasse les bases purement LLM et les approches hybrides LLM-PDDL sur l'ensemble des métriques rapportées, ce qui suggère que le goulot d'étranglement des architectures associant LLM et robotique tient moins à la puissance du modèle de langage qu'au volume de contexte non pertinent qu'on lui soumet. Il s'agit à ce stade d'une publication de recherche et non d'un produit déployé : aucun robot physique, aucune charge utile, degré de liberté ou temps de cycle n'est mentionné, le travail portant sur la couche de planification de tâches plutôt que sur le contrôle bas niveau, à la différence de politiques de manipulation comme Pi-0 ou GR00T N2. Le code est publié sur le dépôt GitHub honda-research-institute/Scale_Plan, permettant une reproduction indépendante des résultats. L'article ne précise ni partenaire industriel ni calendrier de déploiement ; les auteurs indiquent vouloir étendre le benchmark MAT2-THOR et valider l'approche sur des tâches multi-robots encore plus complexes.

RecherchePaper
1 source
Planification de fabrication additive robotisée par IA à base d'agents fondée sur la cinématique
2arXiv cs.RO 

Planification de fabrication additive robotisée par IA à base d'agents fondée sur la cinématique

Une équipe de recherche présente dans un preprint publié sur arXiv (2609.19347v1) un système baptisé A-RAM, pour "agentic robotic additive manufacturing", conçu pour planifier automatiquement les processus de fabrication additive exécutés par un bras robotique plutôt que par une imprimante 3D classique à portique cartésien. Le système combine un grand modèle de langage, chargé d'interpréter les objectifs et contraintes de fabrication exprimés par l'utilisateur et de les traduire dans un schéma structuré, avec un agent de planification déterministe qui construit le plan de recherche correspondant, et des outils spécialisés qui calculent des preuves quantitatives sur le découpage (slicing), le placement de la pièce, la cinématique inverse, le minutage de la trajectoire, le jerk de l'axe 6 et l'extrusion. Le framework a été testé sur une cellule robotisée équipée d'un bras six axes, à travers quatre scénarios : planification spécifiée par un expert, planification à partir du seul objectif, criblage du remplissage (infill) selon l'objectif visé, et sélection de l'orientation et du placement selon la géométrie de la pièce. Les plans retenus par le système réduisent jusqu'à 53,5% le jerk maximal sur l'axe 6 et jusqu'à 48,3% le jerk moyen absolu par rapport aux candidats valides les moins favorables, tandis que le criblage d'infill orienté objectif raccourcit les temps de complétion du plan de mouvement jusqu'à 40,1% et les trajectoires d'extrusion jusqu'à 12,7%. L'enjeu pointé par les auteurs est concret pour les intégrateurs industriels : un plan de découpage jugé bon dans le référentiel de la pièce peut devenir irréalisable ou mécaniquement défavorable une fois transposé sur un manipulateur robotique, car l'orientation de la pièce et son placement dans l'espace de travail influencent directement la faisabilité cinématique. Les outils existants, qu'il s'agisse des slicers classiques, des systèmes d'aide à la décision basés sur des LLM ou des jumeaux numériques, n'évaluent pas ces décisions couplées avant l'exécution. A-RAM illustre une tendance plus large où le LLM sert de couche de raisonnement et de traduction d'intention plutôt que de générateur direct de trajectoires, la validation restant confiée à des outils déterministes. Il s'agit d'un travail de recherche académique évalué en laboratoire sur une cellule unique, sans annonce de déploiement industriel, de partenariat commercial ni de calendrier de mise sur le marché. Le papier se positionne explicitement face à trois catégories d'outils jugées insuffisantes : les chaînes de slicing traditionnelles, les assistants de décision fondés sur des LLM, et les systèmes de jumeau numérique, aucun ne proposant selon les auteurs une évaluation pré-exécution intégrée des décisions de découpage, de placement et de cinématique.

RecherchePaper
1 source
Une perspective par l'espace d'information sur la suffisance des graphes de scène pour la planification de tâches robotiques
3arXiv cs.RO 

Une perspective par l'espace d'information sur la suffisance des graphes de scène pour la planification de tâches robotiques

Un article publié le 15 septembre 2026 sur arXiv (référence 2609.15587v1) propose un cadre théorique pour déterminer quand un graphe de scène est "suffisant" pour la planification de tâches robotiques. Ces graphes, qui encodent objets, relations et affordances d'un environnement, sont largement utilisés en planification mais deviennent trop volumineux pour rester exploitables dans les grands environnements. Les auteurs formalisent le problème via un cadre d'espaces d'information: ils définissent des systèmes de transition sur graphes de scène ainsi que la sémantique des actions de navigation et de manipulation. Ils introduisent ensuite des graphes de scène dérivés, obtenus par des mappings d'information qui fusionnent et élaguent des nœuds, générant des systèmes de transition quotients enrichis de primitives de mouvement pour représenter des actions de plus haut niveau. Deux conditions caractérisent la suffisance d'un graphe réduit: le mapping doit produire un quotient déterministe, et la tâche doit rester bien posée sur les traces dérivées, garantissant qu'un plan trouvé sur le modèle réduit reste faisable sur le système complet. Le cadre est illustré sur une tâche dans un environnement exemple, avec des cas de graphes réduits suffisants et insuffisants. Cette contribution vise un point de friction concret pour les intégrateurs robotiques: à mesure que les représentations sémantiques d'environnement s'enrichissent, généralement construites à partir de perception 3D et de modèles de vision langage, leur taille freine la planification en temps réel, en particulier pour des robots mobiles manipulateurs opérant dans de grands bâtiments ou entrepôts. Jusqu'ici, la réduction de ces graphes reposait sur des heuristiques empiriques, l'élagage orienté tâche ou des abstractions hiérarchiques, sans garantie formelle que le plan calculé sur le graphe réduit reste valide sur l'environnement réel. En posant des conditions mathématiques précises, ce travail offre un critère vérifiable pour juger si une simplification de graphe de scène est sûre, ce qui pourrait fonder de futurs pipelines capables de compresser automatiquement leur représentation du monde sans perdre en fiabilité, un enjeu pour les architectures de type VLA qui combinent bout-en-bout et représentations structurées de la scène. Le papier s'inscrit dans la lignée des travaux sur les graphes de scène 3D en robotique, notamment utilisés dans des architectures de navigation sémantique et de planification hiérarchique, domaine où plusieurs équipes académiques ont déjà proposé des méthodes d'élagage orienté tâche ou d'abstraction hiérarchique sans offrir de définition générale de la suffisance, lacune que ce travail dit combler. Il s'agit d'un article de recherche théorique, sans lien annoncé avec un produit commercial, un déploiement industriel ni un acteur du secteur humanoïde ou logistique; sa validation se limite à un exemple illustratif unique plutôt qu'à des essais à grande échelle ou du matériel réel. Les auteurs ne précisent ni suite de publication, ni code ouvert, ni intégration prévue dans un système existant, ce qui en fait pour l'instant une contribution formelle destinée à orienter de futures implémentations plutôt qu'un outil prêt à l'emploi.

RecherchePaper
1 source
De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique
4arXiv cs.RO 

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique

Une équipe de recherche a publié en mai 2025 sur arXiv (identifiant 2605.11951) AgentChord, un système multi-agents qui anticipe les pannes de manipulation robotique avant l'exécution plutôt qu'en les traitant de manière réactive. L'architecture repose sur un graphe de tâches dirigé enrichi, en amont de toute exécution, de branches de récupération pré-compilées et contextualisées selon chaque étape critique. Trois agents spécialisés structurent ce pipeline : un "composer" modélise la tâche nominale, un "arranger" greffe les branches de récupération anticipées, et un "conductor" orchestre les transitions via des moniteurs à faible latence. Les expériences portent sur des tâches de manipulation bimanuelle à horizon long ; les auteurs rapportent une amélioration "substantielle" des taux de succès sans publier de métriques chiffrées précises dans l'abstract disponible. Le principal apport est d'éliminer la latence inhérente au pipeline classique "détecter-raisonner-récupérer", dans lequel chaque échec déclenche un nouvel appel à un LLM ou à un planificateur symbolique. En pré-compilant les correctifs avant le début de la tâche, AgentChord permet une réponse immédiate sans re-planification dès qu'un moniteur détecte une déviation. Pour les intégrateurs industriels qui automatisent des opérations en cellule non structurée, cette architecture de graphe anticipatif pourrait réduire les arrêts imprévus liés aux échecs de manipulation. L'approche présente néanmoins une limite structurelle : les branches pré-compilées ne couvrent que les pannes anticipées, non les défaillances inédites ou hors-modèle. La robustesse de la manipulation en conditions réelles reste l'un des goulots d'étranglement centraux de la robotique commerciale, que ce soit pour les bras industriels ou les humanoïdes en phase de déploiement comme Optimus de Tesla ou les robots de Figure AI. AgentChord s'inscrit dans un courant qui exploite les LLMs comme orchestrateurs de logique de haut niveau, en complément de politiques d'action de bas niveau. Des approches concurrentes comme les VLA Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA intègrent la récupération de manière implicite dans le réseau de politique, là où AgentChord opte pour une représentation explicite en graphe, plus transparente mais potentiellement moins générique face à la variabilité du monde réel. La page projet est accessible sur shengxu.net/AgentChord ; la validation hors banc de test académique reste la prochaine frontière.

RecherchePaper
1 source