
DLAM : actions latentes distribuées avec contraintes temporelles
Les vision-language-action models, ou VLA, souffrent d'un problème structurel : les données robotiques annotées en actions restent rares, alors que les vidéos sans étiquette d'action, elles, abondent pour observer le changement physique. Une nouvelle méthode nommée DLAM (Distributional Latent Actions with Temporal Constraints), présentée dans un article publié fin juillet 2026 sur arXiv, s'attaque à ce goulot d'étranglement. Contrairement aux modèles d'actions latentes classiques, qui apprennent par reconstruction sans structure temporelle garantie, DLAM représente chaque transition entre deux images comme une gaussienne diagonale. La moyenne est ancrée dans le changement visuel observé via une reconstruction conditionnée sur l'image de référence, tandis qu'une composition normalisée et une opération de réversion, appliquées sur des triplets à intervalles égaux, contraignent à la fois la moyenne et la variance dimension par dimension. Un coefficient de corrélation partagé, léger en calcul, gère la dépendance entre transitions adjacentes qui partagent une image intermédiaire. Pour l'apprentissage de politiques en aval, l'encodeur est gelé et une politique par flow-matching est entraînée à générer conjointement les séquences de transitions moyennes et les actions du robot.
L'enjeu dépasse la seule prouesse technique : il s'agit de savoir si l'on peut extraire des priors d'action fiables depuis de la vidéo brute pour compenser la pénurie de données robotiques étiquetées, un problème central pour quiconque veut entraîner des politiques de manipulation à grande échelle sans multiplier les téléopérations coûteuses. Les méthodes structurées existantes ajoutaient déjà des contraintes temporelles, mais avec des points de transition déterministes, ce qui laissait les erreurs résiduelles se propager et s'amplifier lors de compositions récursives. En modélisant l'incertitude explicitement plutôt qu'en la masquant, DLAM démontre une dynamique latente plus cohérente dans le temps sur des transitions non vues, avec une meilleure reconstruction directe et cumulative. Transféré selon le même protocole contrôlé que le modèle π0 de Physical Intelligence, il améliore aussi les performances de politique sur les bancs d'essai MetaWorld MT50, LIBERO et sur des tâches de manipulation en conditions réelles.
Les ablations menées par les auteurs précisent la hiérarchie des gains : les contraintes normalisées sur la moyenne expliquent l'essentiel de l'amélioration en reconstruction, tandis que la variance apprise et la composition tenant compte des corrélations apportent des gains complémentaires, plus marginaux. Ce travail s'inscrit dans la lignée des recherches sur les modèles d'actions latentes visant à combler l'écart entre l'abondance de vidéos d'action non étiquetées et la rareté des données robotiques annotées, un axe désormais central pour l'entraînement des politiques VLA à l'échelle.
Dans nos dossiers




