Aller au contenu principal
Exploiter les affordances entre objets pour une planification efficace des tâches à contact riche
RecherchearXiv cs.RO 

Exploiter les affordances entre objets pour une planification efficace des tâches à contact riche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une nouvelle méthode de planification robotique baptisée U-TAMP (Unified Task-and-Motion Planning), détaillée dans un preprint publié le 27 août 2026 sur arXiv (référence 2608.25641v1). Le travail s'attaque à une limite connue des approches classiques de planification tâche-mouvement (TAMP), qui modélisent les objets de façon simplifiée et ignorent des propriétés physiques essentielles (matière, forme, prise possible) pour réussir des tâches impliquant des contacts complexes, comme empoigner ou poser un objet sur un autre. Les auteurs utilisent un modèle vision-langage (VLM) pour générer automatiquement des abstractions des affordances entre objets, c'est-à-dire des contraintes de préhension et de support qui décrivent comment deux objets peuvent interagir physiquement. Ces contraintes enrichissent le domaine de planification pour gérer des objets aux propriétés variables. La méthode a été testée dans des scénarios simulés de rangement de table de cuisine, et comparée à la version originale de U-TAMP ainsi qu'à un planificateur VLM de référence s'appuyant sur le sens commun pour déduire les affordances. Résultat annoncé : un taux de réussite de planification nettement supérieur et des temps de calcul réduits d'un à deux ordres de grandeur par rapport aux méthodes concurrentes.

Pour les équipes de recherche en robotique manipulatrice, ce travail illustre une piste alternative à l'apprentissage de bout en bout défendu par les modèles vision-langage-action comme Pi-0 ou GR00T N2 : plutôt que de tout confier à un réseau appris sur des données, il s'agit d'injecter du sens commun physique, via un VLM, dans un moteur de planification symbolique classique, pour gagner en vitesse et en fiabilité sans sacrifier l'interprétabilité. La réduction du temps de planification est particulièrement pertinente pour les tâches longues et séquentielles typiques de l'industrie et du service à la personne. Il faut toutefois noter que ces résultats restent cantonnés à la simulation, sur un seul type de scénario domestique, sans validation sur robot réel ni indication de déploiement industriel.

Le TAMP est un champ de recherche établi qui combine raisonnement symbolique et planification de mouvement continue ; ce papier s'inscrit dans la lignée d'un système U-TAMP préexistant, qu'il étend avec la brique VLM pour l'affordance. Les prochaines étapes attendues, non précisées dans l'article, seraient une validation sur plateforme physique et une extension à des tâches de manipulation plus variées que le simple rangement de table.

À lire aussi

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement
1arXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé. L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon. Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

RecherchePaper
1 source
GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon
2arXiv cs.RO 

GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon

Des chercheurs présentent GAVEL (Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning), décrit dans un preprint arXiv publié en septembre 2026 (arXiv:2609.19315v1). Le système ajoute une couche de vérification aux plans générés par un LLM pour des robots : un graphe modélisant les relations entre objets, les préconditions et effets des actions, et des croyances probabilistes sur la position d'objets non observés, simule chaque action avant exécution et répare directement les violations, sans repasser par le LLM sauf en cas d'erreur sémantique. Sur le benchmark de simulation BEHAVIOR-1K, avec le modèle Qwen3-8B, GAVEL fait passer le taux de réussite de 41,2% à 91,8% sur 100 tâches longues isolées et de 19,9% à 92,6% sur 500 instructions multi-tâches, tout en réduisant d'environ 5,4% la distance de déplacement grâce au raisonnement probabiliste sur la localisation des objets. Le résultat pointe un écart connu de la robotique embarquée : un LLM seul reste fragile dès qu'il doit exécuter un plan long dans un monde partiellement observable, ce qui nourrit le fossé entre démonstrations et déploiements fiables. En déportant la vérification vers un modèle symbolique explicite plutôt que vers des appels répétés au LLM, GAVEL réduit le coût et la latence du replanning, un enjeu concret pour les intégrateurs qui déploient des agents robotiques à grande échelle. L'approche suggère aussi que la seule montée en échelle des LLM ou des architectures vision-langage-action ne suffira pas à garantir la fiabilité du raisonnement long-horizon, et plaide pour des architectures hybrides combinant raisonnement symbolique vérifiable et modèles généralistes. GAVEL s'inscrit dans la lignée des travaux utilisant les LLM comme planificateurs de haut niveau, une approche distincte des modèles vision-langage-action bout-en-bout comme Pi-0, GR00T N2 ou Helix, qui apprennent une politique directe sans couche symbolique séparée. Il reprend des principes de planification classique, préconditions et effets à la manière de PDDL, combinés à la flexibilité d'instruction en langage naturel des LLM modernes. Le travail reste, à ce stade, un résultat validé uniquement en simulation sur BEHAVIOR-1K, sans déploiement sur robot physique ni pilote industriel annoncé ; les auteurs indiquent que la méthode fonctionne aussi bien avec des modèles compacts qu'avec des LLM hébergés de pointe, ouvrant la voie à des tests sur des tâches et plateformes plus variées.

RecherchePaper
1 source
Planification rapide pour le lancer d'objets multiples vers des cibles multiples
3arXiv cs.RO 

Planification rapide pour le lancer d'objets multiples vers des cibles multiples

Des chercheurs proposent un cadre de planification pour le lancer simultané de plusieurs objets vers plusieurs cibles (MOMT, pour multi-object multi-target throwing), publié sur arXiv sous la référence 2610.09224. Le système a été validé sur un manipulateur à 7 degrés de liberté équipé d'une main multi-doigts anthropomorphe. La méthode fonctionne en deux temps. Hors ligne, les auteurs construisent un modèle de l'ensemble des lancers réalisables, en combinant la dynamique de vol inversée de l'objet avec la cinématique et la dynamique du robot. En ligne, le système met en correspondance des solutions rapides et filtre les états de détachement valides de l'objet et les états faisables du robot, ce qui permet de composer des séquences de lancers en moins de 5 ms. En simulation, le lancer coordonné de deux objets réduit le temps d'exécution jusqu'à 46 % par rapport à une planification indépendante objet par objet, et ce gain se maintient avec trois objets. En conditions réelles, avec deux objets, la réduction mesurée est de 29 %. Si les cibles changent aléatoirement en cours d'exécution, le système replanifie et atteint les nouvelles positions avec une latence inférieure à 100 ms, sans arrêter le robot. L'intérêt pour la logistique tient au débit. Le lancer élargit déjà l'espace de travail utile d'un bras, puisque le robot n'a plus à se déplacer vers chaque point de dépose. Ici, le travail s'attaque à un autre goulot : le nombre d'objets traités par geste. Le gain mesuré en réel (29 %) reste nettement sous le plafond théorique de 50 % pour deux objets, et les auteurs l'attribuent au surcoût de transition entre les lancers. C'est un chiffre honnête, mais qui montre que le gain simulé de 46 % ne se transpose pas intégralement au matériel. La planification en moins de 5 ms et la replanification sous 100 ms sont les résultats les plus exploitables : ils suggèrent qu'un tel système pourrait absorber des changements de cible, par exemple une réaffectation de bac sur un convoyeur de tri. À l'inverse, la validation reste limitée : trois objets uniquement en simulation, deux en réel, sans précision sur la nature des objets, leur variabilité ou le taux de réussite des lancers. Aucun test en environnement d'entrepôt n'est rapporté. Ce travail s'inscrit dans la montée du lancer robotique en automatisation d'entrepôt, un domaine où la recherche académique cherche à dépasser le cycle classique de saisie puis de dépose. Les auteurs revendiquent le premier cadre de planification unifié pour le MOMT, une affirmation de priorité à nuancer tant qu'elle n'a pas été confrontée à une évaluation par les pairs, l'article étant un preprint. L'approche dépend de mains multi-doigts, matériel plus complexe, plus coûteux et moins robuste que les préhenseurs à ventouses dominants en logistique, ce qui pèsera sur toute industrialisation. Les prochaines étapes naturelles seraient le passage à trois objets ou plus sur matériel réel, la réduction du surcoût de transition entre lancers et des essais sur des objets hétérogènes. Une vidéo de démonstration est publiée par les auteurs, mais elle reste, comme toute vidéo de laboratoire, une sélection d'essais réussis.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
TANDEM : planification tâches et mouvements avec démonstrations à la demande pour affiner efficacement les modèles VLA
4arXiv cs.RO 

TANDEM : planification tâches et mouvements avec démonstrations à la demande pour affiner efficacement les modèles VLA

Un système baptisé TANDEM (Tamp with As-Needed Demonstrations for Efficient Model fine-tuning), décrit dans un article déposé sur arXiv le 24 septembre 2026 (arXiv:2609.28314v1), combine planification tâche-et-mouvement (TAMP) et téléopération humaine sélective pour collecter des démonstrations robotiques. Le système utilise des modèles vision-langage préentraînés pour étendre à la volée le domaine de planification lorsque celui-ci manque de prédicats ou de compétences, en insérant des "opérateurs magiques" exécutés par un humain via téléopération. Après chaque étape humaine, TANDEM reperçoit la scène pour vérifier que l'effet attendu s'est bien produit avant de reprendre la planification autonome. Sur cinq tâches de manipulation longue durée dépassant les capacités du planificateur TAMP de base, TANDEM collecte 2,9 fois plus de démonstrations qu'une téléopération complète de la tâche, pour un temps d'intervention humaine identique. En affinant un modèle vision-langage-action préentraîné π0.5-DROID avec seulement 20 démonstrations TANDEM par tâche, le taux de succès moyen passe de 0% à 60% sur les cinq tâches testées. L'intérêt de ces résultats tient au goulot d'étranglement bien identifié dans l'entraînement des modèles fondation robotiques (VLA) : la téléopération humaine, coûteuse et lente, sert aujourd'hui à démontrer des gestes que des planificateurs classiques savent déjà exécuter seuls. En réservant l'intervention humaine aux seules étapes hors de portée du planificateur, TANDEM optimise le ratio données utiles par heure d'opérateur, un paramètre critique pour les laboratoires qui cherchent à faire passer les VLA de la démonstration en conditions contrôlées à des taux de succès exploitables en usine. Le saut de 0% à 60% souligne surtout combien les VLA préentraînés restent dépendants d'un fine-tuning ciblé plutôt que d'un volume brut de données. Le TAMP est une approche de planification robotique classique, limitée de longue date par des domaines d'action prédéfinis et rigides. TANDEM s'inscrit dans l'écosystème des modèles π0/π0.5 (Physical Intelligence) et du jeu de données DROID, aux côtés d'autres VLA comme GR00T N2 (NVIDIA) ou Helix (Figure), tous confrontés au même défi de mise à l'échelle des données d'entraînement. L'article, tout juste publié, ne précise pas de calendrier de déploiement industriel ni de partenaire pilote.

RechercheOpinion
1 source