Aller au contenu principal
RecherchearXiv cs.RO 

Les futurs prédits ne suffisent pas : apprendre des objectifs exécutables pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode baptisée Entity-Level Goal Readout, décrite dans un preprint arXiv (2610.09309), qui fait de l'objectif terminal exécutable une sortie explicite d'un modèle du monde fondé sur des traces 3D. Le système combine une prédiction de pose centrée sur les objets avec une translation ancrée dans la profondeur observée, ce qui produit un but compact dans SE(3), c'est-à-dire une position et une orientation 3D. Un exécuteur commun, le Pose-Native Executor, consomme ce but fixe avec un retour de pose d'objet en ligne pour piloter le robot en boucle fermée, sans relancer le modèle du monde. Sur cinq tâches de manipulation, le pipeline atteint un taux de succès moyen de 79,69 %. En déploiement zero-shot sur un bras Franka, il obtient 73,33 % de réussite sur StackCube nominal, 66,67 % avec des objets distracteurs et 75,00 % sur PickPlate, avec une cible absente de l'entraînement de la politique. Les auteurs ajoutent des diagnostics qui mesurent directement la précision du but terminal, ainsi que des perturbations contrôlées de translation qui caractérisent la dégradation de l'exécution quand le but est erroné.

L'enjeu tient à une hypothèse implicite de nombreux travaux sur les modèles du monde génératifs : si le modèle prédit un futur plausible, le contrôle saura l'exploiter. Or ces futurs, souvent des images ou des traces, n'exposent pas directement les variables compactes dont un contrôleur a besoin. Lorsque l'entraînement supervise uniquement la prédiction du futur, la précision du but final n'est pas un objectif d'apprentissage, même quand une reconstruction géométrique reste possible. Les auteurs soutiennent donc que l'interface entre prédiction et exécution doit être un composant appris à part entière, et non un post-traitement accessoire. Pour un intégrateur ou un ingénieur, l'intérêt pratique est double : un but figé et mesurable permet de diagnostiquer séparément l'erreur de planification et l'erreur d'exécution, et l'absence de nouvelle inférence du modèle du monde à chaque pas allège le calcul embarqué. Il faut toutefois rester prudent : les chiffres portent sur des tâches de laboratoire simples (empilement de cubes, dépose d'une assiette), avec des taux autour de 67 à 80 %, loin des seuils de fiabilité exigés en production, et le document ne détaille pas le nombre d'essais réels.

Ce travail s'inscrit dans la montée des approches « world model + planification » face aux politiques VLA de bout en bout, qui prédisent directement des actions. Il s'appuie sur des représentations de trajectoires 3D et sur le retour de pose d'objet, un choix qui suppose une estimation de pose fiable en cours de tâche, ce qui reste une limite en environnement encombré ou avec des objets inconnus. Le résultat sur une cible non vue à l'entraînement suggère une certaine généralisation, sans pour autant la démontrer à grande échelle. Il s'agit d'une publication de recherche, sans produit, client ni calendrier de déploiement annoncé. Une page de projet est disponible, et les prochaines étapes naturelles seraient des tests sur des tâches plus longues, des scènes plus variées et des comparaisons directes avec des politiques VLA de référence.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Des futurs imaginés aux actions exécutables : mélange d'actions latentes pour la manipulation robotique
1arXiv cs.RO 

Des futurs imaginés aux actions exécutables : mélange d'actions latentes pour la manipulation robotique

Des chercheurs ont publié sur arXiv (référence 2605.12167, mai 2026) une méthode baptisée MoLA, pour Mixture of Latent Actions, destinée à améliorer la manipulation robotique en exploitant les modèles génératifs de vidéo comme mécanisme d'anticipation. L'idée centrale : un robot peut "imaginer" la trajectoire visuelle future d'une tâche avant de l'exécuter, mais transformer ces séquences générées en commandes moteur concrètes reste un problème ouvert. MoLA introduit une interface dite orientée contrôle qui, au lieu de passer directement les images prédites à la politique de contrôle, mobilise un ensemble de modèles inverses de dynamique (IDM) pré-entraînés pour en extraire des actions latentes. Ces IDM sont multimodaux : ils capturent des indices sémantiques, de profondeur et de flux optique, fournissant une représentation structurée et physiquement ancrée des transitions d'état. L'approche a été évaluée sur les benchmarks simulés LIBERO, CALVIN et LIBERO-Plus, ainsi que sur des tâches de manipulation en conditions réelles, avec des gains annoncés en taux de succès, en cohérence temporelle et en généralisation. Le problème que MoLA tente de résoudre est structurel dans le domaine des VLA (Vision-Language-Action models) : les modèles de génération vidéo optimisent la fidélité perceptuelle, pas la pertinence pour le contrôle. Lorsqu'une politique est conditionnée sur des frames prédites, elle hérite de cette inadéquation, produisant un contrôle indirect et instable. En substituant aux frames brutes des représentations latentes inférées par des IDM complémentaires, MoLA réduit ce fossé structurel. Pour les intégrateurs et les équipes de recherche appliquée, c'est un signal important : l'imagination visuelle peut effectivement améliorer les politiques robotiques, à condition de disposer d'une couche de traduction adaptée plutôt que d'un couplage direct image-action. Ce travail s'inscrit dans un courant actif autour des world models appliqués à la robotique, où des approches comme DreamerV3 (DeepMind) ou SuSIE ont exploré des pistes similaires pour le reinforcement learning et la manipulation. Côté manipulation guidée par vidéo, UniSim et les travaux autour de Pi-0 de Physical Intelligence ont popularisé l'utilisation de prédictions futures pour structurer le comportement. MoLA se distingue par son architecture modulaire à IDM mixtes plutôt qu'un seul encodeur unifié. Aucune affiliation industrielle ni timeline de déploiement n'est mentionnée dans la publication, ce qui en fait pour l'instant une contribution de recherche fondamentale, dont la valeur pratique dépendra de la reproductibilité des gains annoncés en dehors des benchmarks de référence.

RechercheOpinion
1 source
Les VLM décrivent mais ne mesurent pas : comprendre les scènes centrées sur les objets pour la manipulation robotique
2arXiv cs.RO 

Les VLM décrivent mais ne mesurent pas : comprendre les scènes centrées sur les objets pour la manipulation robotique

Une équipe de recherche publie un article arXiv (2609.28184v1) proposant un système de perception modulaire piloté par un modèle vision-langage (VLM) pour la manipulation robotique en environnement inconnu. Partant d'une seule observation RGB-D, le pipeline segmente la scène en régions au niveau objet, les fait annoter sémantiquement par un VLM, puis ancre ces annotations avec les données de profondeur pour construire une représentation centrée sur les objets, indépendante de la tâche à accomplir. Les auteurs ont testé leur approche sur 151 scènes de table (tabletop scènes) et montrent que cette décomposition conserve la qualité sémantique d'un VLM classique tout en améliorant nettement la localisation et l'estimation de profondeur par rapport à une inférence géométrique directe par le VLM seul. La représentation obtenue a ensuite été intégrée à un module de planification de tâches pour piloter l'exécution robotique, en s'appuyant sur des briques logicielles existantes plutôt que sur un modèle entraîné de bout en bout. Le constat de fond, résumé par le titre même de l'article, cible une faiblesse connue mais rarement quantifiée des VLM appliqués à la robotique: ils décrivent bien une scène mais mesurent mal les distances, positions et profondeurs nécessaires à une prise fiable. Pour les intégrateurs qui misent sur des architectures vision-langage-action pour de la manipulation générique, ce travail confirme qu'il est risqué de confier au VLM la géométrie brute et suggère plutôt une architecture hybride où le modèle gère la sémantique tandis que des capteurs et des méthodes de segmentation classiques gèrent la métrique. C'est un signal utile face à l'engouement actuel pour les modèles VLA supposés tout résoudre en bout en bout: la précision spatiale reste un maillon faible qui nécessite un ancrage explicite plutôt qu'une confiance aveugle dans les sorties du modèle. Cette publication s'inscrit dans le débat plus large sur l'écart entre les capacités sémantiques impressionnantes des VLM récents et leur fiabilité métrique, un sujet qui traverse actuellement la recherche en robotique de manipulation autant que le développement de robots humanoïdes généralistes. L'article ne présente ni produit commercial ni déploiement industriel: il s'agit d'une contribution méthodologique construite à partir d'approches existantes ("off-the-shelf"), dont la suite logique serait une validation au-delà des scènes de table, sur des environnements moins contraints et des tâches de manipulation plus complexes.

RecherchePaper
1 source
Génération et intégration guidées par représentation de programmes exécutables pour la manipulation robotique
3arXiv cs.RO 

Génération et intégration guidées par représentation de programmes exécutables pour la manipulation robotique

Des chercheurs présentent RIVET (Representation-guided Integration of VLM-generated Executable Task programs), un framework qui utilise un modèle vision-langage pour générer automatiquement l'ensemble d'un système de manipulation robotique, perception, rendu, inférence de relations et planification, autour d'une représentation partagée combinant des poses 6D par objet et un graphe de relations entre objets. Décrit dans un papier arXiv (2609.31337v1), le système a été testé sur trois tâches, l'empilement de cubes, le réarrangement de tangram et l'assemblage tridimensionnel, à la fois en simulation et sur un robot physique réel. Les programmes générés une seule fois pour un domaine de manipulation donné sont ensuite réutilisés tels quels sur des configurations de départ et d'objectif jamais vues, sans nouvelle génération de code. En conditions réelles, les auteurs rapportent un taux de réussite global de 83 % en réutilisant des systèmes générés hors ligne. L'intérêt pour l'industrie robotique tient au problème que RIVET cible directement : quand un VLM génère séparément les modules de perception, de planification et de contrôle, ceux-ci opèrent souvent sur des représentations géométriques incompatibles, ce qui casse le pipeline complet. En imposant une représentation commune à tous les modules générés, l'approche évite cette fragmentation typique des pipelines "code généré par IA" en robotique. Pour les intégrateurs, l'argument clé est économique autant que technique : le code n'est produit qu'une fois par domaine puis réemployé sans réinvoquer le VLM à chaque nouvelle configuration, ce qui limite le coût d'inférence en déploiement. Un taux de succès réel de 83 % reste notable dans un domaine où l'écart entre simulation et monde réel demeure un obstacle documenté, même s'il s'agit ici de résultats de laboratoire sur un nombre restreint de tâches, à ne pas confondre avec une validation à l'échelle industrielle. RIVET s'inscrit dans un courant de recherche qui explore la génération de code exécutable par VLM comme alternative aux politiques vision-langage-action entraînées de bout en bout, du type de celles popularisées par des modèles comme Pi-0 ou GR00T N2, qui apprennent une correspondance directe perception-action sans passer par du code interprétable. Ce travail reste à ce stade un résultat académique, validé en simulation et sur un seul bras robotique en conditions de laboratoire, sans partenaire industriel ni calendrier de déploiement annoncé, une nuance qui le distingue nettement d'une annonce produit.

RecherchePaper
1 source
Sparse2Act : apprendre des représentations 3D éparses alignées sur l'action pour la manipulation robotique multi-domaines
4arXiv cs.RO 

Sparse2Act : apprendre des représentations 3D éparses alignées sur l'action pour la manipulation robotique multi-domaines

Des chercheurs ont déposé le 12 juin 2026 sur arXiv (référence 2606.12759) Sparse2Act, un cadre de pré-entraînement pour encodeurs de nuages de points 3D épars appliqués à la manipulation robotique. La méthode exploite les actions de l'effecteur terminal en espace tâche comme supervision géométrique : des tokens 3D masqués sont entraînés à organiser les features de scène autour du mouvement de l'espace de travail associé à l'observation. Sur le benchmark LIBERO-10, le système atteint 86,9 % de taux de succès moyen après seulement 500 étapes de fine-tuning. Le même encodeur pré-entraîné permet un transfert inter-domaines de LIBERO vers Meta-World, avec 73,4 % de succès moyen sur le benchmark Meta-World-5. En condition réelle, après pré-entraînement en simulation suivi d'un fine-tuning limité sur données réelles, le système obtient 72,5 % de succès sur quatre tâches de manipulation distinctes. Ce que démontre Sparse2Act, c'est qu'un encodeur 3D peut être pré-entraîné de façon générique et réutilisé tel quel par des politiques aux architectures et espaces d'action différents, y compris des commandes en espace articulaire. C'est un changement de paradigme par rapport aux représentations 3D apprises via des objectifs de tâche spécifiques, qui restent liées à une distribution de données particulière et ne se transfèrent pas. Le sim-to-real à 72,5 % avec fine-tuning limité est un résultat concret que les pipelines VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou OpenVLA peinent à reproduire proprement sur des tâches de manipulation fine. Les ablations publiées dans le papier confirment que le gain provient du signal d'alignement action-masque, et non de la capacité du décodeur, ce qui oriente les futures architectures vers une supervision géométrique légère. L'intérêt pour les représentations 3D explicites en manipulation robotique s'est accentué depuis 2023, en réponse aux limites des politiques purement pixel-based sur les saisies occludées ou en précision sub-centimétrique. Sparse2Act s'inscrit dans le courant du pré-entraînement de représentations robotiques génériques, aux côtés de R3M, MVP ou SPA, mais se distingue par l'usage des actions comme signal de supervision géométrique plutôt que du contrastif visuel ou de la reconstruction d'image. Les concurrents directs incluent les fondations visuelles fine-tunées (DINO, SAM) adaptées à la manipulation et les politiques diffusion-based comme Pi-0.2 ou RDT-1B. La prochaine étape naturelle pour ce travail est l'extension à des morphologies variées (bras bimanuel, robot mobile) et à des scènes hors environnements tabletop standardisés comme LIBERO et Meta-World.

RecherchePaper
1 source