La modélisation résiduelle comble l'écart entre politiques de régression et génératives en apprentissage robotique
Des chercheurs proposent une alternative à la diffusion et au flow matching pour entraîner des politiques robotiques à partir de démonstrations (arXiv:2610.12231). Baptisée HT-Policies (heteroscedastic Student-t action régression), la méthode reste une régression directe : elle prédit un « chunk » d'actions en une seule passe avant, sans les étapes itératives de débruitage des modèles génératifs. Les auteurs l'ont évaluée sur quatre benchmarks de simulation et lors de tests sur robot réel. Elle atteint des taux de réussite comparables aux politiques génératives (Flow-Policies), aussi bien entraînée de zéro qu'à partir de modèles vision-langage-action (VLA) et de world-action models préentraînés. L'entraînement et l'inférence sont plus rapides, et le réseau de neurones d'une politique flow matching préentraînée peut être réutilisé comme backbone. Les auteurs ne donnent pas, dans le résumé, de chiffres de vitesse ni de taux de succès précis, ce qui oblige à attendre le papier complet pour juger de l'ampleur réelle du gain.
Le travail s'attaque à une explication largement admise : si les politiques de diffusion ou de flow matching surpassent la régression directe par erreur quadratique moyenne (MSE-Policies), ce serait parce que les démonstrations humaines sont multimodales, c'est-à-dire que plusieurs actions valides existent pour une même observation. L'analyse de données de démonstration réelles suggère une autre cause. Les résidus de prédiction d'action ont une échelle qui varie fortement selon l'état, et des queues plus lourdes qu'une gaussienne. Or la MSE alloue davantage de magnitude de gradient aux observations dont les résidus sont les plus grands, ce qui dégrade l'optimisation. Les politiques génératives ne seraient donc pas avantagées surtout par leur capacité à représenter plusieurs modes, mais par un comportement de gradient plus favorable. Si le résultat se confirme à grande échelle, il compte pour les intégrateurs et les équipes de déploiement : une politique mono-passe réduit la latence de contrôle et le coût de calcul embarqué, deux contraintes concrètes sur des robots à haute fréquence ou à ressources limitées.
L'article s'inscrit dans le débat sur l'apprentissage par imitation, dominé depuis plusieurs années par Diffusion Policy et les approches flow matching, qui équipent désormais de nombreux VLA de fondation, tels que Pi-0. L'idée proposée reste simple : une loi de Student-t avec échelle prédite en fonction de l'entrée, qui limite l'influence des valeurs extrêmes. Plusieurs réserves s'imposent. Il s'agit d'un préprint non évalué par des pairs, les benchmarks précis ne sont pas détaillés dans le résumé, et « compétitif » ne signifie pas supérieur. Une vérification sur des tâches fortement multimodales ou à long horizon reste nécessaire. Les prochaines étapes dépendront de la reproduction des résultats par d'autres laboratoires et de l'éventuelle adoption de cet objectif dans des VLA de grande taille. Une page de projet est annoncée pour le code et les démonstrations.
Dans nos dossiers



