Esquisses proprioceptives comme intention à long terme pour des politiques d'action génératives
Des chercheurs proposent les Proprioceptive Action Models (PAM), une architecture de politique générative qui produit, dans un même transformer de débruitage (diffusion), deux sorties jointes : un « croquis » compact du chemin articulaire restant à parcourir, et un chunk d'actions dense directement exécutable. Le croquis est paramétré par l'abscisse curviligne (arc length) plutôt que par le temps, ce qui encode une intention géométrique indépendante du rythme d'exécution. Une attention block-causal et un calendrier de débruitage décalé (staggered) imposent une dépendance orientée du croquis vers les actions : les tokens d'action sont conditionnés sur un croquis de plus en plus propre au fil de l'échantillonnage. En simulation, PAM améliore ses équivalents « actions seules » sur Push-T et LIBERO-Long. Sur quatre tâches bimanuelles réelles, le taux de réussite passe de 47,5 % à 75,0 %. L'étude, publiée sur arXiv (2610.02759), est accompagnée d'une page projet. Aucun matériel commercial ni déploiement n'est annoncé : il s'agit d'un résultat de recherche.
Le problème visé est bien connu des équipes qui déploient des politiques de type VLA ou diffusion : ces modèles prédisent des chunks d'actions courts et n'ont pas de représentation explicite de l'intention à long horizon, d'où des dérives ou des hésitations sur les tâches longues. Les solutions existantes (plans en langage, images de sous-buts, prévisions vidéo) sont coûteuses à générer et doivent encore être converties en mouvement robot. Prédire directement des trajectoires futures évite cette traduction, mais une trajectoire dense indexée sur le temps exige beaucoup de paramètres pour couvrir toute la tâche restante, et sur un horizon court elle répète le chunk d'actions. Le croquis en espace articulaire, léger et sans temps, offre un compromis : un signal de guidage long horizon qui reste dans l'espace propre du robot. Un bémol : un gain de 47,5 % à 75,0 % sur quatre tâches réelles est encourageant, mais le résumé ne donne ni le nombre d'essais, ni les plateformes, ni la variance, et la comparaison se fait uniquement avec la version sans croquis du même modèle, pas avec des baselines externes comme Pi-0 ou des modèles à plans en langage.
Ce travail s'inscrit dans la course pour doter les politiques génératives (Diffusion Policy, ACT, puis les VLA de type Pi-0, GR00T ou Helix) d'une planification plus longue sans alourdir l'inférence. Il se positionne contre les approches qui passent par la vidéo ou le langage, plus lourdes à calculer. Les prochaines étapes à surveiller sont une validation sur des modèles de fondation à grande échelle, des tâches de manipulation plus variées et des comparaisons directes avec les VLA actuels, avant que l'idée ne passe en intégration industrielle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




