Aller au contenu principal
PhasePlan : planification ordonnée des phases futures pour les modèles de cerveau de robot
RecherchearXiv cs.RO 

PhasePlan : planification ordonnée des phases futures pour les modèles de cerveau de robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs propose PhasePlan, une méthode de planification ordonnée des phases futures pour les « robot brain models », ces modèles qui fusionnent vision, langage et état du robot pour générer des actions de manipulation. Le constat de départ est que la plupart de ces modèles prédisent des « action chunks » de longueur fixe, qui peuvent chevaucher plusieurs phases d'une tâche. À partir des observations multimodales courantes, PhasePlan prédit la phase de tâche associée à chaque position d'action future. Les représentations de planification obtenues conditionnent ensuite les actions correspondantes. L'entraînement se fait en deux temps : le planificateur est d'abord appris, puis gelé pendant l'adaptation du modèle d'action, afin de garder des représentations de phase stables. La méthode est instanciée sur le modèle π0.5 pré-entraîné et sur AcrossWAM1.0. L'évaluation quantitative détaillée porte uniquement sur π0.5. Sur une tâche de manipulation sur tapis roulant, l'erreur d'action articulaire hors ligne baisse d'environ 22,5 % par rapport au π0.5 d'origine. Les auteurs rapportent aussi une meilleure modélisation des transitions de phase et de la prédiction d'actions à cheval sur plusieurs phases.

L'intérêt tient au défaut visé. Un chunk de longueur fixe mélange des phases hétérogènes (approche, saisie, transport, dépose), ce qui brouille les transitions et pousse le modèle vers les schémas d'action les plus fréquents. En environnement dynamique comme un convoyeur, où le timing du geste compte autant que sa trajectoire, ce biais dégrade la qualité d'exécution. Pour les intégrateurs, la piste est intéressante : elle améliore un VLA existant sans changer d'architecture, par un module de planification gelé. Les résultats appellent toutefois de la prudence. La métrique est une erreur hors ligne sur trajectoires articulaires, pas un taux de réussite en boucle fermée sur robot réel. Une seule tâche est chiffrée, et la seconde instanciation n'est pas quantifiée en détail. Le gain de 22,5 % ne dit donc pas encore s'il se traduit en cadence ou en fiabilité de production.

Ce travail s'inscrit dans la lignée des modèles π0 et π0.5 de Physical Intelligence, devenus une base courante pour l'adaptation de politiques VLA, et dans les recherches sur la structure temporelle de la génération d'actions : chunking, hiérarchie de sous-tâches, raisonnement intermédiaire. Il rejoint des approches comme Helix de Figure ou GR00T de NVIDIA, qui séparent planification de haut niveau et contrôle bas niveau, avec ici une planification alignée position par position sur l'horizon d'action. Il s'agit d'un preprint arXiv (2609.39970v1), sans relecture par les pairs, sans déploiement industriel annoncé ni code ou calendrier mentionné dans le résumé. La suite logique serait une validation en boucle fermée sur robot réel, des comparaisons avec d'autres méthodes de chunking adaptatif, et une évaluation chiffrée sur AcrossWAM1.0 et sur des tâches plus variées.

À lire aussi

Vers des modèles du monde JEPA ancrés dans la réalité physique pour la planification robotique conditionnée par objectif
1arXiv cs.RO 

Vers des modèles du monde JEPA ancrés dans la réalité physique pour la planification robotique conditionnée par objectif

Des chercheurs publient sur arXiv (arXiv:2609.03565, soumis début septembre 2026) un modèle du monde de type JEPA (Joint Embedding Predictive Architecture) conçu pour la planification robotique conditionnée par des objectifs visuels. L'approche standard JEPA prédit les représentations latentes futures sans reconstruire les pixels, mais rien ne garantit que ces représentations conservent l'information utile au contrôle moteur. Les auteurs ajoutent deux mécanismes entraînés de bout en bout : une dynamique inverse (IDM), qui empêche l'effondrement des représentations latentes en les forçant à rester informatives sur les actions qui les ont produites, et un alignement d'état (state alignment, SA), qui ancre les représentations successives dans la configuration physique et le mouvement réels du robot. Testé sur quatre bancs d'essai de planification, le modèle atteint 100% de réussite sur TwoRoom, 98% sur PushT et 87% sur OGBench-Cube, avec des résultats comparables à la référence LeWorldModel sur la tâche Reacher. Une étude d'ablation montre que l'ajout du state alignment améliore systématiquement le taux de réussite par rapport à l'IDM seul, sur les quatre tâches. Ce travail s'inscrit dans un débat central pour l'industrie robotique actuelle : les modèles du monde appris en espace latent permettent-ils une planification fiable, ou souffrent-ils d'un écart entre performance en simulation et robustesse réelle ? En montrant que l'ancrage physique explicite des représentations améliore la planification sans reconstruction pixel par pixel, les auteurs apportent un argument technique en faveur d'architectures latentes plus légères que les approches génératives complètes, un enjeu direct pour les intégrateurs qui cherchent des modèles de contrôle moins gourmands en calcul que les VLA (vision-language-action) de type Pi-0, GR00T N2 ou Helix. L'analyse par sous-espace de transition est particulièrement notable : bien que LeWorldModel affiche une meilleure "rectitude" moyenne des trajectoires sur OGBench-Cube, ses transitions se concentrent dans un sous-espace de dimension effective plus faible, ce qui suggère une représentation moins riche malgré des métriques agrégées favorables, un rappel que les chiffres moyens seuls peuvent masquer des limites structurelles. Ce papier prolonge la lignée des travaux sur les architectures JEPA popularisées en vision par Meta AI, désormais transposées à la robotique pour contourner les coûts de la prédiction pixel par pixel propre aux modèles du monde génératifs. Il se positionne comme une contribution de recherche académique, évaluée sur des bancs d'essai simulés standardisés (TwoRoom, PushT, Reacher, OGBench-Cube), sans annonce de déploiement matériel ni de partenariat industriel. Les prochaines étapes naturelles, non abordées dans l'abstract, seraient une validation sur robot physique et une comparaison directe avec les architectures VLA à grande échelle qui dominent actuellement les annonces commerciales du secteur.

RecherchePaper
1 source
Identification de modèles de robots indépendante des coordonnées
2arXiv cs.RO 

Identification de modèles de robots indépendante des coordonnées

Une méthode d'identification des modèles dynamiques de robots, décrite dans un article déposé sur arXiv (référence 2603.14656, version révisée), corrige un biais méthodologique connu de la régression aux moindres carrés appliquée à la dynamique inverse. Les formulations classiques mesurent l'écart entre couples prédits et mesurés directement dans l'espace des forces en coordonnées, ce qui rend le résultat dépendant du paramétrage choisi, des unités et de l'échelle de chaque degré de liberté. Les auteurs pondèrent ces résidus par la métrique duale induite par la métrique riemannienne du système, en s'appuyant sur la dualité vecteur-covecteur entre force et vitesse pour ramener l'erreur dans l'espace mécanique physique plutôt que dans un repère arbitraire, via une reformulation en métrique affine et complément de Schur qui préserve la convexité du problème. Testée sur un système inertiel Crazyflie-pendule et sur le robot LandSalp, dominé par la traînée, la méthode gagne en précision d'identification, surtout sur les coordonnées de forme. Un biais lié au seul choix de coordonnées peut fausser silencieusement les couples, frictions ou termes de Coriolis estimés, avec des conséquences directes sur la fidélité d'un jumeau numérique ou la robustesse d'un contrôleur. Rendre l'estimation indépendante du paramétrage promet des modèles reproductibles quel que soit le repère cinématique retenu, un point utile pour les équipes qui ré-identifient des robots après un changement de représentation ou qui combinent des sous-systèmes hétérogènes, drones, robots à jambes ou structures souples. Cela rappelle aussi que l'écart entre simulation et réalité ne tient pas qu'au bruit de mesure ou à la friction non modélisée: une part peut venir d'un artefact purement mathématique introduit par la formulation même de l'identification. L'identification par moindres carrés sur la dynamique inverse reste la méthode de référence en robotique pour calibrer masses, inerties et frictions, mais sa dépendance aux coordonnées est un défaut connu que peu de travaux avaient corrigé sans sacrifier la convexité, condition nécessaire à une résolution rapide et fiable. En mobilisant la géométrie riemannienne plutôt que des normalisations ad hoc, cette contribution justifie physiquement la pondération des résidus, et le choix de deux robots aux régimes opposés, l'un dominé par l'inertie et l'autre par la traînée, vise à démontrer sa généralité au-delà d'un seul type de mécanisme. Publié comme version révisée sur arXiv, l'article ne mentionne aucun déploiement industriel ni intégration dans un outil de calibration commercial: il s'agit pour l'instant d'une contribution méthodologique destinée à la communauté recherche en dynamique des robots.

RecherchePaper
1 source
Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques
3arXiv cs.RO 

Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques

Une équipe de recherche propose un nouveau modèle baptisé Vision-Language-Policy, ou VLP, destiné à la planification dynamique de tâches robotiques à partir de commandes en langage naturel. Décrit dans un article déposé sur arXiv (2512.19178, version révisée), le système s'appuie sur un modèle vision-langage affiné sur des données réelles, capable d'interpréter des instructions sémantiques et de raisonner sur la scène de travail observée pour générer directement des politiques de comportement pilotant le robot. Les auteurs ont testé leur approche sur plusieurs robots différents et sur une variété de tâches en conditions réelles, démontrant que le modèle peut ajuster sa stratégie en cours d'exécution lorsque les instructions changent, sans nécessiter de replanification complète. Des vidéos de démonstration sont disponibles sur robovlp.github.io. L'article ne précise pas de métriques chiffrées de type charge utile, degrés de liberté ou temps de cycle, ni de nom de robot commercial identifiable, ce qui limite l'évaluation de la performance réelle du système face aux standards du secteur. L'intérêt de ce travail réside dans la promesse de généralisation inter-incarnations, c'est-à-dire la capacité d'un même modèle à fonctionner sur des morphologies de robots différentes sans réentraînement spécifique à chaque plateforme. C'est l'un des points durs actuels de l'IA robotique, où les modèles VLA (vision-language-action) peinent souvent à transférer d'un bras ou d'un humanoïde à un autre. Si l'adaptabilité dynamique aux changements de consigne se confirme à plus grande échelle, cela répondrait à une limite classique des architectures de planification traditionnelles, qui séparent rigidement le raisonnement de haut niveau de l'exécution bas niveau et s'adaptent mal aux imprévus. Ce travail s'inscrit dans la lignée des modèles VLA récents comme Pi-0 ou GR00T N2, qui cherchent tous à unifier perception, langage et action dans un même modèle entraîné de bout en bout. Il s'agit ici d'une contribution académique, sans annonce de partenaire industriel ni de déploiement commercial, et la prudence reste de mise tant qu'une validation indépendante sur des benchmarks standardisés n'a pas été publiée.

RechercheActu
1 source
Les limites de planification des modèles du monde latents
4arXiv cs.RO 

Les limites de planification des modèles du monde latents

Une étude publiée sur arXiv (2609.39235) cartographie les limites de planification des modèles du monde latents, ces prédicteurs censés permettre à un robot d'« imaginer » l'évolution de son environnement avant d'agir. Les auteurs construisent des prédicteurs conditionnés par l'action sur cinq encodeurs visuels auto-supervisés gelés : V-JEPA 2, V-JEPA 2.1, VideoMAEv2, VideoPrism et DINOv2. Ils les évaluent sur diverses tâches de manipulation Meta-World et sur des interactions réelles tirées de BridgeData V2. Avec des rollouts de cinq pas, longueur d'entraînement du prédicteur, le modèle ne classe correctement les actions que pour des cibles situées 5 à 10 pas de contrôle plus loin, alors que les objectifs des tâches se trouvent à 16 à 53 pas. Un prédicteur 81 fois plus grand ou un entraînement sur des rollouts plus longs n'étendent pas cette portée. L'encodeur, lui, influence la portée et le succès en boucle fermée, V-JEPA 2.1 se montrant le plus régulier. Le point le plus significatif est que cette limite ne vient pas d'une prédiction imparfaite. Avec le vrai simulateur, donc une prédiction parfaite, le succès tombe de 92 % à 41 % lorsque la cible passe de 5 à 20 pas au-delà d'un rollout de cinq pas. Le goulet d'étranglement est donc la structure de la planification, pas seulement la qualité du modèle. Pour des objectifs lointains, l'imagination pure réussit dans 23 % des épisodes, la planification avec retour d'information (MPC) monte à 30 %, un rollout aussi long que la distance à l'objectif atteint 47 %, et des sous-objectifs experts proches atteignent 76 %. Pour les intégrateurs et les équipes R&D, cela tempère l'idée qu'il suffit de grossir le modèle ou les données : il faut des horizons imaginés plus longs ou une décomposition hiérarchique en sous-objectifs. Cela invite aussi à lire avec prudence les démonstrations qui montrent ce que ces modèles réussissent sans préciser à quelle distance se trouvait le but. L'étude arrive alors que les modèles du monde de la famille JEPA, portés par Meta, sont présentés comme une voie vers des robots généralistes, en concurrence avec les approches VLA (vision-langage-action) qui prédisent directement les actions. Les auteurs montrent une complémentarité : dans sa plage de planification, un modèle du monde peut filtrer huit actions proposées par une politique VLA et faire passer son succès de 65 % à 77 % sur 16 tâches. Il s'agit de résultats académiques, en simulation et sur données robotiques existantes, sans déploiement industriel ni produit annoncé. Les suites probables portent sur des rollouts plus longs, des sous-objectifs générés automatiquement et l'intégration à des VLA, sans calendrier précisé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source