
EmboAlign : aligner la génération vidéo avec des contraintes de composition pour la manipulation en zero-shot
EmboAlign, décrit dans une version révisée d'un article arXiv (2603.05757v2), est un framework de manipulation robotique zero-shot qui combine modèles génératifs vidéo (VGM) et modèles vision-langage (VLM) pour convertir une instruction textuelle en trajectoire robot exécutable, sans donnée d'entraînement spécifique à la tâche. À l'inférence, un VLM extrait des contraintes compositionnelles à partir de l'instruction ; elles servent d'abord à filtrer un lot de vidéos générées par le VGM pour ne garder que le rollout le plus physiquement plausible, puis à optimiser la trajectoire robot correspondante afin de corriger les erreurs de retargeting géométrique. Sur six tâches de manipulation exécutées sur robot réel exigeant une précision fine, les auteurs rapportent un gain de 43,3 points de pourcentage de taux de succès par rapport à la meilleure baseline testée, sans aucune donnée d'entraînement propre à la tâche.
Ce résultat cible un problème connu du secteur : les modèles vidéo pré-entraînés sur des corpus internet produisent des séquences visuellement cohérentes mais souvent physiquement invraisemblables, et leur conversion en commandes robot par estimation de profondeur et suivi de points clés accumule des erreurs à chaque étape. En traitant le VLM comme un module de raisonnement spatial complémentaire, plutôt que comme un générateur d'actions entraîné de bout en bout, EmboAlign teste l'idée que des modèles génériques, jamais affinés sur des démonstrations robotiques, peuvent piloter une manipulation fine sans la collecte massive de données de téléopération qui alimente la plupart des piles VLA commerciales actuelles. Ce gain reste toutefois à relativiser tant que le niveau absolu de performance de la baseline et la diversité réelle du panel de tâches ne sont pas détaillés au-delà du résumé.
Ce travail prolonge une ligne de recherche qui utilise la génération vidéo comme modèle du monde pour la planification robotique, longtemps freinée par l'écart entre vidéos plausibles et actions exécutables en toute sécurité. Il se positionne à contre-courant de la stratégie dominante de l'industrie, portée par des modèles vision-langage-action entraînés de bout en bout sur de vastes jeux de démonstrations téléopérées ou simulées, à l'image de Pi-0 de Physical Intelligence, de la série GR00T de NVIDIA ou de Helix de Figure AI, qui misent sur le volume de données plutôt que sur des contraintes ajoutées à l'inférence. L'article ne précise ni l'affiliation des auteurs ni de calendrier de déploiement industriel ; il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé en laboratoire sur un nombre restreint de tâches, sans pilote ni produit commercial annoncé.
Dans nos dossiers




