Apprentissage de l'anticipation sans trajectoires explicites pour les politiques de diffusion 3D
Un preprint publié sur arXiv en septembre 2026 (2609.20669) présente Movement Trend Guidance (MTG), une méthode qui améliore les politiques de diffusion 3D en manipulation robotique. Construite au-dessus du modèle de référence DP3 (3D Diffusion Policy), elle n'ajoute que 3,52% de paramètres supplémentaires. À partir d'un court historique d'observations, le système apprend une représentation latente compacte de l'évolution de l'interaction, supervisée à l'entraînement par des états futurs épars du gripper; à l'inférence, seul ce latent sert de signal de conditionnement, injecté via une branche FiLM ajoutée au goulot d'étranglement du réseau UNet. Les gains face à DP3 sont nets sur trois bancs d'essai: 62,8% contre 56,1% en entraînement mixte sur 50 tâches de RoboTwin2.0, 71,93% contre 37,08% sur LIBERO-40, et 72,0% contre 49,0% sur cinq tâches évaluées en conditions réelles, sur le benchmark DexArt.
L'enjeu dépasse le score brut. Les politiques de diffusion génèrent des mouvements géométriquement plausibles à partir de l'observation présente, mais laissaient jusqu'ici l'anticipation de la suite de l'interaction émerger implicitement de l'apprentissage de l'action seule. MTG rend cette anticipation explicite sans imposer de trajectoire planifiée, une alternative légère aux modèles du monde ou à la prédiction de trajectoire explicite, plus coûteux en calcul. Pour les intégrateurs et les équipes de recherche, le signal clé est que ce gain de robustesse, dont un quasi-doublement du taux de réussite sur LIBERO-40, s'obtient pour un surcoût d'architecture marginal, ce qui facilite une adoption dans des piles déjà basées sur DP3. Le travail reste toutefois un résultat de preprint non relu par les pairs, évalué selon le protocole propre des auteurs; l'écart entre benchmark et déploiement industriel réel reste à confirmer à plus grande échelle.
DP3 combine diffusion générative et observations en nuages de points 3D pour l'apprentissage par imitation de tâches de manipulation. RoboTwin2.0, LIBERO-40 et DexArt sont des bancs d'essai standards du secteur pour comparer les politiques de manipulation, en simulation et, pour partie, en conditions réelles. MTG s'inscrit dans une recherche plus large, menée en parallèle des grands modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, qui cherchent tous à doter les politiques robotiques d'une meilleure anticipation à long horizon sans planification de trajectoire coûteuse. Aucun acteur commercial français ou européen n'est associé à ces travaux, qui restent une contribution académique; ni date de publication du code ni pilote industriel ne sont mentionnés, la suite logique étant une revue par les pairs puis une éventuelle intégration dans des piles VLA commerciales existantes.
Dans nos dossiers




