
Dynin-Robotics : un modèle unifié de diffusion omnimodal vision-langage-action
Une équipe de recherche présente Dynin-Robotics, un modèle vision-langage-action fondé sur Dynin-Omni, un backbone de diffusion masquée "omnimodal" qui code langage, observations, objectifs et actions en tokens discrets dans un seul modèle de trajectoire. En variant le conditionnement, ce réseau apprend à prédire l'action, l'observation suivante induite par l'action, l'état final visé et l'instruction correspondant à une trajectoire. Pré-entraîné sur environ 1,33 million de trajectoires issues de 48 jeux de données Open X-Embodiment puis adapté à des tâches spécifiques, il obtient des résultats compétitifs sur LIBERO, sa variante zero-shot LIBERO-Plus et deux tâches VLABench, atteint 78,4% de réussite moyenne sur quatre tâches de manipulation avec un bras Franka Research 3 réel, et bénéficie d'un décodage optimisé jusqu'à 29,2 fois plus rapide que la version de base.
L'intérêt tient surtout à la preuve qu'un seul backbone de diffusion peut apprendre plusieurs objectifs complémentaires (objectif, dynamique, action) et les combiner au moment de l'inférence plutôt que d'empiler des modèles séparés. Associer guidage par objectif et débruitage conjoint de l'action et de l'état suivant améliore la réussite sur des instructions inédites par rapport à un décodage fondé sur l'action seule, un point où les VLA généralistes peinent souvent à généraliser. C'est un signal utile pour les intégrateurs qui cherchent des politiques plus robustes au changement de consigne sans multiplier les réseaux, et le gain de vitesse annoncé, s'il se confirme hors du protocole de profilage rapporté dans l'article, intéresserait le temps réel embarqué.
Le travail s'appuie sur Open X-Embodiment, le corpus ouvert mutualisé entre laboratoires qui alimente déjà la plupart des VLA généralistes récents, ce qui situe Dynin-Robotics du côté de la recherche académique plutôt que du déploiement industriel. Il se positionne face à des familles de modèles comme Pi-0, GR00T N2 ou Helix, toutes engagées dans la même course à la généralisation; aucun acteur français ou européen n'apparaît dans l'étude. Il s'agit pour l'instant d'un preprint arXiv fraîchement publié, validé en conditions réelles sur un seul bras Franka Research 3, les auteurs présentant leur modélisation de trajectoire partagée comme une interface commune destinée à être étendue à d'autres tâches et robots.
Dans nos dossiers




