CometVLA : co-entraînement sur une pyramide de données incarnées pour la compréhension physique
Un article publié sur arXiv (2608.30289v1) fin août 2026 présente CometVLA, un nouveau modèle vision-langage-action (VLA) pour la manipulation robotique. Le constat de départ : les jeux de données de question-réponse visuelle (VQA) physique sont désincarnés, mal alignés avec les données d'action réelles des robots, et les vidéos égocentriques ne servent qu'à un pré-entraînement auxiliaire, sans preuve claire que la compréhension physique du VLM améliore la génération d'actions en aval. Les auteurs construisent donc CometData et CometBench, un corpus et un benchmark de VQA physique alignés sur l'embodiment et les données d'action du robot, puis introduisent les "Global Action Prior" (GAP), des tokens formant un goulot d'étranglement appris qui isole les régularités de mouvement indépendantes de la tâche pour nourrir la tête d'action sans corrompre le backbone VLM pré-entraîné. Co-entraîné sur une "pyramide de données incarnées" (téléopération, simulation, trajectoires égocentriques, VQA), CometVLA surpasse de façon constante des baselines VLA solides sur des tâches de manipulation réelle et sur le simulateur RoboTwin.
Le résultat clé est une corrélation directe entre les scores sur CometBench et le taux de succès en manipulation réelle : la compréhension physique du VLM se traduit en de meilleures actions, et non en un simple gain cosmétique sur des benchmarks de langage déconnectés du terrain. Pour les laboratoires et intégrateurs qui bâtissent des modèles fondation pour la manipulation, ce travail suggère que l'alignement strict entre données perception-langage et données d'action pèse plus lourd que le volume de VQA générique ajouté au pré-entraînement, une piste transposable à des architectures comme Pi-0, GR00T ou Helix.
Ce travail prolonge la lignée des VLA qui, depuis RT-2 et OpenVLA, cherchent à fusionner compréhension visuelle et génération de mouvements, avec pour écueil récurrent la désynchronisation entre corpus de pré-entraînement et données de téléopération réelles. En s'appuyant sur RoboTwin, benchmark de simulation déjà établi pour la manipulation bimanuelle, et en publiant CometData et CometBench comme ressources réutilisables, les auteurs présentent CometVLA comme une contribution de recherche méthodologique, sans déploiement industriel, partenaire intégrateur ni date de mise sur le marché annoncés. La suite logique serait une extension à d'autres embodiments et une validation indépendante avant toute adoption commerciale.
Dans nos dossiers




