Aller au contenu principal
TaskGround : inférence de tâches exécutables structurées pour le raisonnement domestique global
RecherchearXiv cs.RO 

TaskGround : inférence de tâches exécutables structurées pour le raisonnement domestique global

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie TaskGround, un cadre de planification de tâches ménagères pour agents robotiques, dans un preprint arXiv daté de mai 2026 (arXiv:2605.18109). Le problème visé : dans un déploiement domestique réel, un agent reçoit une requête contextuelle ("prépare le petit-déjeuner") face à une scène complète comprenant des centaines d'objets non pertinents à la tâche. TaskGround adopte une architecture "Ground-Infer-Execute" en trois étapes, filtrage de la scène vers une tranche compacte d'entités pertinentes, inférence de la structure de tâche exécutable, puis compilation en séquence d'actions au niveau compétence. Le cadre est sans entraînement (training-free) et agnostique au modèle de langage sous-jacent. Pour l'évaluation, les auteurs introduisent FullHome, une suite de 400 tâches ménagères validées humainement, couvrant des environnements domestiques variés et deux types de contraintes : orientées objectif et orientées processus.

Les résultats montrent que TaskGround améliore substantiellement les taux de succès sur FullHome, aussi bien pour les modèles propriétaires qu'open-weight. Le point saillant : le modèle Qwen3.5-9B couplé à TaskGround devient compétitif avec GPT-5 en prompting direct complet, tout en réduisant le coût total en tokens d'entrée jusqu'à 18 fois. Pour les intégrateurs et équipes robotiques opérant sous contraintes de calcul local ou de confidentialité des données, c'est un signal concret : la sophistication du raisonnement n'exige pas nécessairement des modèles propriétaires massifs. Les auteurs identifient l'inférence de structure de tâche exécutable comme le goulot d'étranglement central du raisonnement en scène complète, davantage que la qualité intrinsèque du modèle de base.

Ce travail s'inscrit dans un axe de recherche actif autour des agents de planification pour la robotique domestique, qui cherche à combler l'écart entre démonstration en laboratoire et déploiement réel. Les approches concurrentes incluent les VLA (Vision-Language-Action models) de Physical Intelligence (pi0), les pipelines de planification hiérarchique utilisés par Figure ou 1X, ainsi que les travaux SayCan de Google DeepMind. TaskGround se distingue en n'exigeant aucun fine-tuning supplémentaire, ce qui facilite l'intégration à des stacks existantes. Le preprint reste pour l'instant confiné à l'évaluation sur benchmarks textuels et simulation ; une validation sur plateformes hardware réelles constituerait la prochaine étape naturelle, non encore annoncée.

À lire aussi

Raisonnement sans coût d'inférence : échafaudage sémantique latent pour les politiques VLA de robots
1arXiv cs.RO 

Raisonnement sans coût d'inférence : échafaudage sémantique latent pour les politiques VLA de robots

Une équipe de recherche a publié sur arXiv (arXiv:2609.04893v1, soumis début septembre 2026) une méthode nommée Latent Semantic Scaffolding (LSS), conçue pour les modèles vision-langage-action (VLA) qui pilotent des robots manipulateurs. Le constat de départ : les VLA actuels apprennent par imitation à partir de démonstrations humaines et retiennent quelle action exécuter, mais pas pourquoi ; ajouter un raisonnement causal améliore la manipulation, mais les méthodes existantes le paient cher à l'inférence, en générant des tokens de raisonnement ou en simulant des états futurs à chaque pas de contrôle, un surcoût qui s'accumule sur les séquences longues. LSS introduit à la place une perte auxiliaire appliquée uniquement pendant le pré-entraînement sur démonstrations humaines : une petite tête de projection aligne les représentations des tokens d'action du VLA avec des embeddings textuels de justifications physiques du geste. Cette tête est ensuite supprimée à l'inférence, laissant la politique de base intacte et donc sans coût additionnel au déploiement. La découverte centrale concerne la granularité de cet alignement : une version « Dense », qui relie chaque token d'action au raisonnement propre à sa phase de manipulation, transfère nettement mieux vers des tâches inédites qu'une version « Pooled » fondée sur un embedding unique pour tout l'épisode, laquelle se sur-spécialise à la tâche d'entraînement. Une sonde représentationnelle montre que Dense LSS induit environ deux fois plus de séparabilité par phase dans le réseau de base. Le résultat intéresse directement les concepteurs de politiques VLA de type Pi-0, GR00T N2 ou Helix, confrontés à un arbitrage classique entre qualité du raisonnement et fréquence de contrôle en temps réel. En déplaçant le bénéfice du raisonnement causal vers la phase d'entraînement, LSS suggère qu'il est possible d'obtenir un gain de généralisation sans dégrader le temps de cycle ni la charge de calcul embarquée, un point critique pour les intégrateurs qui évaluent le ROI de bras manipulateurs ou d'humanoïdes en production. Il faut toutefois noter qu'il s'agit d'un article de recherche non encore relu par les pairs, avec des résultats obtenus sur un jeu de tâches et d'architectures limité, pas d'une validation à grande échelle industrielle. Ces travaux s'inscrivent dans la lignée des VLA de type fondation qui dominent la robotique de manipulation depuis l'essor de modèles comme RT-2, Pi-0 ou GR00T N2, et dans le prolongement d'une autre famille de méthodes qui injectent du raisonnement explicite via chaînes de pensée ou modèles du monde, au prix d'un calcul supplémentaire à chaque étape. LSS se positionne comme une alternative à ce compromis en traitant l'alignement sémantique comme un mécanisme d'entraînement jetable plutôt que comme un module permanent. L'abstract ne mentionne ni laboratoire ni entreprise nommément, ni acteur français ou européen ; les auteurs annoncent vouloir approfondir l'effet de la granularité de l'alignement sur d'autres tâches et vérifier si Dense LSS se généralise à des architectures VLA de plus grande échelle.

RechercheActu
1 source
GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues
2arXiv cs.RO 

GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues

Des chercheurs présentent GraphThink, un nouveau framework de planification pour agents robotiques pilotés par des grands modèles de langage (LLM), détaillé dans un article publié le 7 août 2026 sur arXiv (2608.07905v1). Le système combine deux structures de données : un graphe de tâches (task graph), qui guide le raisonnement du LLM via un prompting contextuel et un raffinement itératif pour limiter les hallucinations de planification, et un graphe de scène (scene graph), qui sert de mémoire environnementale pour déclencher une replanification en boucle fermée dès qu'un événement imprévu survient. L'entraînement du planificateur s'appuie sur GRPO (Group Relative Policy Optimization), avec une conception de récompense calquée sur le graphe de tâches. Sur le benchmark ALFRED, référence standard pour l'exécution de tâches ménagères instruites en langage naturel par un agent virtuel, GraphThink atteint l'état de l'art : son module de haut niveau dépasse les LLM propriétaires accessibles par API, aussi bien sur l'ensemble de validation que sur des tâches longues inédites (held-out long-horizon tasks), avec une bonne généralisation zero-shot et few-shot à des environnements et tâches jamais vus. Ce résultat cible un problème central pour l'industrie de la robotique humanoïde et des agents incarnés : les planificateurs fondés sur des LLM génériques hallucinent souvent des actions physiquement impossibles et perdent en cohérence sur des séquences de tâches longues, un écart classique entre démonstration et usage réel. En ancrant le raisonnement dans une représentation structurée de l'environnement plutôt que dans le seul texte, GraphThink illustre une piste concrète pour fiabiliser les architectures de type VLA (vision-language-action) utilisées par des systèmes comme GR00T N2 ou Helix, sans dépendre uniquement de modèles propriétaires massifs. Il s'agit toutefois d'un résultat de recherche évalué en simulation sur ALFRED, non d'un déploiement sur robot physique. Le champ des planificateurs LLM pour la robotique s'est développé depuis des approches comme SayCan ou Code as Policies, et la comparaison de GraphThink aux LLM API démontre surtout un gain méthodologique en environnement contrôlé ; sa validation sur du matériel réel reste l'étape suivante attendue.

RecherchePaper
1 source
Raisonnement structuré sur l'état du monde pour la recherche robotique à base d'agents
3arXiv cs.RO 

Raisonnement structuré sur l'état du monde pour la recherche robotique à base d'agents

Des chercheurs proposent WORLDS (World-state Observation and Reasoning for Language-guided Discovery and Search), un cadre pour la recherche robotique guidée par le langage naturel sur de longs horizons, détaillé dans un preprint publié sur arXiv (arXiv:2609.23841). Le système construit un graphe persistant initialisé à partir de priors géospatiaux, mis à jour par la perception, dans lequel des "Reasoners" parallèles maintiennent plusieurs interprétations candidates concurrentes et déclenchent la collecte d'observations pour les départager, avant qu'un "Examiner" multimodal traite ces observations et qu'un "Judge" choisisse une cible ou redemande une passe supplémentaire. Sur le benchmark CityNav, WORLDS atteint 51,8% de succès de navigation sur l'ensemble des 5 311 épisodes de test, le meilleur taux publié à ce jour, soit 15,7 points de plus que la référence précédente, sous un protocole limité aux données OpenStreetMap et à l'imagerie orthographique haute résolution. Sur un sous-ensemble comparatif de 1 000 épisodes, à modèle, prior, chaîne de perception et budget de déplacement identiques, WORLDS obtient 50,0% contre 27,9% pour la meilleure base adaptée. La vérification par observations de l'Examiner apporte à elle seule 5,9 points, et même avec un effort de raisonnement réduit, WORLDS dépasse encore la référence GeoNav adaptée de 18,8 points tout en générant moins de tokens. Pour les intégrateurs de robotique autonome et les équipes travaillant sur la navigation par instructions en langage naturel, ce résultat suggère que l'écart provient bien de l'architecture de raisonnement, avec maintien d'hypothèses concurrentes et vérification active par perception, plutôt que d'un simple gain de puissance de calcul, puisque la comparaison se fait à modèle et budget identiques. Le fait que la performance se maintienne, voire s'améliore relativement, à effort de raisonnement réduit et avec moins de tokens générés est un signal concret pour des applications embarquées où la latence et la puissance de calcul sont contraintes, comme les drones. Le cadre a aussi été testé sur un quadrirotor, qui exécute les points de passage de détection générés par le système et identifie trois cibles langagières à partir de son imagerie embarquée, dont un véhicule absent de la carte initiale. Il s'agit toutefois d'un preprint de recherche non encore évalué par les pairs, sans nom d'entreprise ni date de déploiement commercial associée: la démonstration drone reste un test de validation en conditions contrôlées, pas un produit déployé sur le terrain.

RecherchePaper
1 source
Pilotage du comportement robotique à l'inférence par reconfiguration physiquement informée de la structure de tâche
4arXiv cs.RO 

Pilotage du comportement robotique à l'inférence par reconfiguration physiquement informée de la structure de tâche

Une équipe de recherche a publié sur arXiv (ref. 2606.26588) un système baptisé ReStruct, conçu pour modifier le comportement d'un robot en cours de déploiement sans nécessiter de réentraînement. Le problème visé est ce que les chercheurs appellent le "steering à l'inférence" : forcer une politique robotique apprise à respecter une préférence utilisateur imprévue lors de l'entraînement, au moment du test uniquement. ReStruct repose sur une architecture en deux niveaux : un squelette de haut niveau modélisé comme une machine à états finis (automate neural), qui encode la structure de la tâche, et un contrôleur bas niveau sous forme de politique résiduelle, qui reste entièrement gelé. Lors de la modification d'une préférence, c'est uniquement l'automate qui est reconfiguré via un produit synchrone, mettant à jour les prior d'action transmis au contrôleur. Sur banc de test en simulation et en environnement réel, ReStruct dépasse les modèles VLA (Vision-Language-Action) existants de jusqu'à 25 % en taux de réussite de tâche et en respect des préférences, pour des spécifications allant de contraintes sur des objets spécifiques jusqu'à des contraintes de logique temporelle. L'enjeu industriel est significatif : le réentraînement d'une politique robotique pour chaque nouvelle variante de tâche ou préférence opérateur représente aujourd'hui un verrou majeur à la scalabilité des déploiements. Les approches bout-en-bout (fine-tuning, guidance experte) sont trop coûteuses en pratique, tandis que les méthodes neuro-symboliques classiques génèrent des plans logiquement cohérents mais physiquement irréalisables, ce que ReStruct corrige en intégrant la faisabilité physique directement dans la reconfiguration de la structure de tâche. Le fait que la méthode surpasse les modèles VLA sur ces métriques est notable : les VLA représentent actuellement le paradigme dominant en robotique manipulatrice apprise, et cette architecture hybride formelle-neuronale suggère une voie complémentaire plutôt que concurrente. Ce travail s'inscrit dans un débat de fond entre approches purement end-to-end et méthodes symboliques pour la robotique généraliste. Les modèles VLA comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) misent sur des fondations neuronales massives adaptées par fine-tuning, ce qui les rend rigides face aux variations de préférences non anticipées. ReStruct propose une alternative légère, fondée sur la théorie des automates, qui n'impose pas de réentraîner le contrôleur. Il s'agit d'un preprint académique sans affiliation industrielle annoncée ni déploiement terrain mentionné, mais la démonstration en conditions réelles renforce la crédibilité de l'approche. Les prochaines étapes naturelles seraient l'intégration dans des pipelines de déploiement existants et l'évaluation sur des manipulateurs commerciaux multi-tâches.

RechercheOpinion
1 source