Aller au contenu principal
Planifier en cours de route : planification événementielle par modèle fondation pour l'exécution TAMP en manipulation partiellement observable
RecherchearXiv cs.RO 

Planifier en cours de route : planification événementielle par modèle fondation pour l'exécution TAMP en manipulation partiellement observable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2608.28075v1, 28 août 2026) ROBUST TAMP, un framework modulaire de planification tâche-et-mouvement (TAMP) piloté par des modèles de fondation, LLM et VLM, pour la manipulation robotique en environnement partiellement observable. Le système restreint le planificateur à l'état relationnel de la scène actuellement visible, valide chaque action générée contre une interface d'exécution stricte, puis achemine les actions acceptées vers des adaptateurs d'exécution propres à chaque scène. La découverte d'un objet imprévu, cible ou non, déclenche un événement de replanification distinct : après un horizon d'exécution stable, le système reconstruit l'état visible de la scène et replanifie à partir de l'historique des actions déjà complétées et du contexte structuré de l'événement. Les évaluations portent sur six variantes de cuisine et de grill sous simulateur RLBench/CoppeliaSim, incluant objets cachés, découverte d'objets non ciblés, interaction avec des contenants articulés et procédures de manipulation temporelles, en comparant des planificateurs LLM texte-seul et VLM de tailles différentes sous un pipeline identique de validation, exécution, surveillance et replanification.

Le travail cible un angle mort des architectures TAMP guidées par foundation models, qui supposent le plus souvent un état de scène entièrement connu à l'avance ou déclenchent une replanification complète du modèle dès qu'un sous-objectif échoue. En environnement réel, un robot découvre en cours d'exécution des objets non anticipés, ce qui invalide un plan pourtant correct au départ ; traiter cette découverte comme un événement à part entière plutôt qu'un échec générique limite les appels coûteux au modèle de fondation, un point sensible pour les intégrateurs qui budgétisent le coût d'inférence à l'échelle d'une flotte. La comparaison entre planificateurs texte-seul et VLM de tailles variées fournit des données concrètes sur l'arbitrage précision/coût, utiles aux décideurs qui cherchent à dimensionner le bon niveau de modèle plutôt que de supposer qu'un VLA volumineux règle par défaut l'observabilité partielle.

Ce travail s'inscrit dans la lignée des systèmes de TAMP guidés par LLM/VLM apparus ces dernières années pour générer décompositions de tâches, sous-objectifs et contraintes symboliques, mais que les auteurs jugent encore trop dépendants d'une scène pleinement spécifiée. Les six bancs d'essai restent entièrement simulés, sous RLBench/CoppeliaSim, sans mention de robot physique, d'affiliation industrielle ni de calendrier de transfert vers le réel : il s'agit d'une publication de recherche évaluant une architecture logicielle, non d'un produit commercialisé. La suite logique, non annoncée dans le résumé, serait une validation sur manipulateur réel et une extension au-delà des scènes de cuisine et de grill testées.

À lire aussi

μVLA : mémoire récurrente pour la manipulation partiellement observable dans les modèles VLA
1arXiv cs.RO 

μVLA : mémoire récurrente pour la manipulation partiellement observable dans les modèles VLA

Des chercheurs ont publié sur arXiv (arXiv:2606.12497) une étude d'isolation contrôlée baptisée muVLA, une famille de variantes du modèle OpenVLA-OFT augmentées de récurrence minimale. Le principe : injecter un petit ensemble de tokens mémoire apprenables dans le transformer, transportés d'un pas de temps au suivant et mis à jour par auto-attention, sans loss auxiliaire ni modification architecturale. L'entraînement se fait de bout en bout avec rétropropagation tronquée dans le temps (TBPTT), paramétrée par la largeur mémoire m et la longueur de troncature K, avec deux règles de mise à jour comparées -- gradients inter-pas ou EMA détachée. Sur le benchmark MIKASA-Robo, muVLA porte le taux de succès moyen sur cinq tâches d'entraînement de 0,42 à 0,84 dans la configuration la plus forte, et atteint 0,23 sur des tâches hors distribution contre 0,07 pour la baseline sans mémoire. Sur LIBERO, environnement à observabilité complète, la variante récurrente la plus forte atteint 96,2 % de succès moyen -- sans régression par rapport au modèle de base. Ce travail apporte une contribution méthodologique précise à un champ encombré d'ablations mal contrôlées. La quasi-totalité des VLA à mémoire existants couplent récurrence, retrieval, compression et objectifs hiérarchiques dans un seul système, rendant impossible d'attribuer les gains à un mécanisme isolé. muVLA démontre que la récurrence seule -- sans aucune machinerie additionnelle -- suffit à doubler le taux de succès sur des tâches à observabilité partielle, c'est-à-dire les situations où une partie de l'état pertinent a disparu du champ de vision. Pour les intégrateurs robotiques travaillant sur des cellules avec occlusions ou des séquences d'assemblage multi-étapes, c'est un signal clair : le goulot n'est pas la puissance brute du modèle de base, mais la capacité à maintenir un état latent persistant. Le résultat sur LIBERO indique également que l'ajout de mémoire ne dégrade pas les performances en pleine observabilité, ce qui lève un frein souvent cité à l'adoption de ces architectures en production. OpenVLA est un modèle open-source lancé fin 2024 par une collaboration Stanford/Berkeley/Toyota Research Institute, positionné comme alternative ouverte aux VLA propriétaires comme RT-2 (Google DeepMind) ou pi0 (Physical Intelligence). OpenVLA-OFT en est une variante fine-tunée pour l'exécution rapide. La question de la mémoire dans les VLA est activement travaillée par plusieurs équipes -- RoboVLMs, SpatialVLA, Helix (Figure AI) -- mais avec des architectures nettement plus lourdes. muVLA se distingue par sa minimalité revendiquée et son protocole d'isolation rigoureux, ce qui en fait un outil de calibration plus qu'un système prêt au déploiement. Les auteurs délimitent explicitement le "régime de suffisance" de la récurrence minimale : elle fonctionne pour les tâches où la structure mémoire requise est homogène entre entraînement et évaluation, et atteint ses limites dès que les tâches hors distribution exigent une structure mémorielle différente. Les prochaines étapes naturelles -- combinaison avec des mécanismes de retrieval ou de compression -- sont implicitement balisées par ces résultats.

RechercheOpinion
1 source
Planification des tâches pour la manipulation mobile en magasin grâce à des modèles fondation avec replanification itérative
2arXiv cs.RO 

Planification des tâches pour la manipulation mobile en magasin grâce à des modèles fondation avec replanification itérative

Il s'agit d'un article de recherche arXiv (2607.09962v1), pas d'une annonce produit, je rédige le résumé en conséquence, en marquant clairement qu'il s'agit d'un travail encore au stade simulation. Des chercheurs présentent une méthode de planification de tâches pour la robotique mobile de manipulation appliquée au réassort en magasin, combinant grands modèles de langage (LLM) et modèles vision-langage (VLM). Le système reçoit des instructions formulées par un utilisateur, construit un plan d'action pour une plateforme de manipulation mobile omnidirectionnelle personnalisée, puis corrige ses erreurs grâce à une boucle de re-planification itérative fondée sur un retour visuel. Point important à souligner : l'ensemble du pipeline n'a été validé qu'en environnement de simulation PyBullet, sur des tâches de prise et dépose (pick-and-place), et non sur un robot physique en conditions réelles de magasin. L'abstract ne fournit ni chiffres de charge utile, ni degrés de liberté, ni temps de cycle, ni date de déploiement, ce qui limite la portée immédiatement opérationnelle de l'annonce. L'intérêt de ces travaux tient moins à la performance affichée qu'au périmètre visé : jusqu'ici, l'automatisation en logistique et distribution s'est concentrée sur des opérations d'arrière-boutique (tri, emballage) dans des environnements structurés et prévisibles. Étendre cette automatisation aux rayons de supermarché suppose de gérer un environnement bien plus variable et centré sur l'humain, avec des obstacles mobiles, des produits mal rangés et des interactions client. L'usage de LLM/VLM pour la planification de haut niveau, couplé à une re-planification réactive en cas d'échec, illustre une tendance plus large du secteur : tester si les modèles fondation permettent de généraliser au-delà des scénarios d'entrepôt scriptés. Mais tant que la preuve ne dépasse pas la simulation, l'écart classique entre démonstration et déploiement réel reste entier, et les intégrateurs B2B devront attendre une validation sur plateforme physique avant d'y voir un signal de maturité commerciale. Ce travail s'inscrit dans la vague plus large de recherche sur la manipulation mobile pilotée par foundation models, qui a vu émerger des architectures VLA comme Pi-0 ou GR00T N2 chez des acteurs orientés produit, mais qui reste ici traitée sous un angle académique, avec une plateforme de manipulation "custom" non identifiée commercialement. Le choix du cas d'usage réassort en supermarché reflète l'intérêt croissant du secteur retail pour l'automatisation de tâches jusqu'ici jugées trop non structurées pour la robotique, un terrain où des acteurs comme Simbe Robotics ou Bossa Nova ont déjà exploré l'inventaire par robot mobile, sans toutefois intégrer la manipulation physique des produits. La suite logique de ces travaux serait un transfert sim-to-real sur robot physique, étape non abordée dans cette publication, ce qui invite à considérer ce résultat comme une preuve de concept méthodologique plutôt qu'un jalon de déploiement.

RecherchePaper
1 source
Manipulation d'objets déformables en observabilité partielle grâce à l'estimation de forme complète en temps réel
3arXiv cs.RO 

Manipulation d'objets déformables en observabilité partielle grâce à l'estimation de forme complète en temps réel

Une équipe de recherche présente cRVAE (conditional récurrent variational autoencoder), un modèle léger capable d'estimer l'état complet d'un objet déformable comme une corde ou un tissu à partir de simples observations partielles de ses coins, sans nécessiter de paramètres physiques en entrée ni d'identification de paramètres en ligne. Décrit dans l'article arXiv:2609.10308v1, ce réseau sert de modèle prédictif dans un cadre de contrôle optimal à horizon glissant pour la manipulation collaborative d'objets déformables en présence d'obstacles. En simulation sur des scénarios de corde et de tissu, cRVAE atteint une précision comparable à celle d'un modèle physique XPBD (Extended Position Based Dynamics) pourtant calibré avec des paramètres identifiés au préalable, tout en étant environ 350 fois plus rapide sur la corde et plus de 1500 fois plus rapide sur le tissu à chaque passe de calcul. Cette vitesse permet de rester sous le budget de contrôle de 100 millisecondes nécessaire à une planification en boucle fermée, un seuil que le modèle XPBD dépasse déjà sur des horizons courts. Les chercheurs ont démontré le système sur un robot quadrupède Unitree Go2. Ce résultat s'attaque à un angle mort persistant de la robotique industrielle : si la manipulation d'objets rigides est largement résolue par des méthodes basées modèle, les objets déformables (câbles, textiles, corde, emballages souples) restent un défi ouvert à cause de leur espace d'état de très haute dimension, de leur dynamique sous-actionnée et de l'observabilité partielle inhérente aux capteurs disponibles. Les simulateurs physiques comme XPBD, très utilisés pour le rendu de tissus et de cordes, exigent une calibration coûteuse par objet et deviennent trop lents pour du contrôle temps réel dès que l'horizon de planification s'allonge. En démontrant qu'un modèle appris peut remplacer cette simulation physique sans perte de précision et sans calibration objet par objet, l'étude lève un obstacle concret au déploiement de manipulateurs sur des tâches comme le routage de câbles, la manutention textile ou l'emballage souple en logistique, où le recalibrage manuel par pièce est impraticable à l'échelle. Le choix d'un robot quadrupède plutôt qu'un bras manipulateur classique suggère aussi une applicabilité à des contextes de manipulation mobile plus larges. La validation reste toutefois circonscrite à la simulation pour la comparaison de précision, et la démonstration matérielle sur Go2 n'est pas détaillée en termes de tâche ni de robustesse. Ce travail s'inscrit dans la lignée des architectures d'autoencodeurs variationnels, ici adaptées en version récurrente et conditionnelle pour l'estimation d'état temporel, et vise spécifiquement à remplacer les moteurs physiques comme XPBD (utilisé notamment dans des environnements de simulation robotique et de jeu) comme modèle prédictif embarqué dans une boucle de contrôle. Il s'agit d'une publication de recherche académique et non d'une annonce produit ou d'un pilote industriel : aucun acteur commercial concurrent n'est cité, et aucun calendrier de déploiement n'est communiqué. Les prochaines étapes logiques, non annoncées dans l'article, porteraient vraisemblablement sur l'extension à d'autres matériaux déformables, à des configurations bimanuelles, et sur des essais matériels plus poussés au-delà de la démonstration initiale sur le Go2.

RecherchePaper
1 source
Flow Motion Policy : planification de mouvement pour bras manipulateur par modèles de flow matching
4arXiv cs.RO 

Flow Motion Policy : planification de mouvement pour bras manipulateur par modèles de flow matching

Des chercheurs ont mis en ligne sur arXiv (arXiv:2604.07084v2, version révisée d'une soumission antérieure) une étude présentant Flow Motion Policy, un planificateur de mouvement neuronal en boucle ouverte destiné aux bras manipulateurs robotiques. Contrairement aux planificateurs neuronaux existants, qui produisent un unique chemin déterministe à partir des observations capteurs, Flow Motion Policy s'appuie sur le flow matching pour apprendre une distribution de plans de mouvement conditionnée par l'observation de la scène. Au moment de l'inférence, le système échantillonne un lot de plans candidats et sélectionne le meilleur parmi N propositions (stratégie dite "best-of-N"), sans recourir à une vérification itérative de collisions ni à un vérificateur de collision privilégié pendant la planification. Les auteurs comparent leur méthode à des approches représentatives par échantillonnage, par optimisation et par apprentissage neuronal, et rapportent une amélioration du taux de succès et de l'efficacité de la planification. Le site du projet met à disposition davantage de matériel. Cette contribution s'inscrit dans un enjeu concret pour l'industrie robotique: les méthodes classiques de planification de trajectoire (échantillonnage type RRT, optimisation de trajectoire) exigent une connaissance complète et coûteuse de la géométrie de la scène, un luxe rarement disponible en conditions réelles à partir de simples capteurs. Les planificateurs neuronaux de bout en bout promettaient de s'affranchir de cette contrainte, mais leur nature déterministe à sortie unique limitait leur robustesse face à des environnements variables, un frein pour les intégrateurs déployant des bras de pick-and-place en usine. En générant plusieurs hypothèses de trajectoire exploitables sans vérification coûteuse, ce travail illustre l'intérêt croissant des politiques génératives stochastiques pour la robotique manipulative. Il faut toutefois noter que l'abstract ne fournit aucun chiffre précis de gain (taux de succès, temps de cycle), ce qui limite l'évaluation de l'ampleur réelle de l'amélioration annoncée. Le papier se positionne dans la lignée des travaux récents combinant modèles génératifs de type diffusion ou flow matching et apprentissage de politiques robotiques, une famille de techniques déjà mobilisée dans des politiques d'imitation pour la manipulation. Aucun nom d'entreprise ni de calendrier de déploiement industriel n'est mentionné: il s'agit d'une contribution de recherche académique, dont le code et les démonstrations sont accessibles via le site du projet.

RecherchePaper
1 source