
Le modèle d'action du monde VPP2 de Robotera domine RoboDojo et atteint 58,5 % en zéro-shot sur de vrais bras ALOHA
Robotera, la société robotique issue de Tsinghua, affirme que son modèle VPP2, un world action model (modèle qui prédit l'évolution visuelle de la scène avant d'en déduire les actions), occupe la première place de RoboDojo. Ce benchmark de simulation est piloté par le MMLab de l'Université de Hong Kong avec près de 20 institutions académiques. Selon QbitAI, VPP2 obtient un taux de succès moyen de 32,26 % et un score moyen de 39,26 sur les 42 tâches bimanuelles du test, qui couvre la généralisation, la manipulation de précision, les tâches longues, la mémoire et les instructions en vocabulaire ouvert. Il arrive aussi premier dans les catégories généralisation, précision et mémoire. Robotera précise que ces résultats viennent du seul jeu de données standard, sans données supplémentaires ni ajouts comme l'auto-amélioration récursive par agents. La meilleure référence citée dans son article, GPT-6-Astra en évaluation post-entraînement, atteint 22,48 % et 28,97. Sur un vrai robot bimanuel ALOHA, VPP2 totalise 58,5 % de réussite en zéro-shot sur 10 types de tâches (prise, dépose, empilement, pliage, versement), contre 40 % pour le pi0.5 de Physical Intelligence, et fait mieux sur neuf d'entre elles. Il obtient 45,0 % sur LIBERO-Pro et 63,9 % sur LIBERO-OOD. Associé à un modèle vision-langage comme planificateur de haut niveau, il fait passer certaines tâches longues de RoboDojo de 27,6 % à 57,6 %.
L'intérêt tient à la manière dont le modèle traite la faiblesse connue des world action models : quand la prédiction vidéo est fausse, l'action la suit. Robotera entraîne en trois étapes. Un pré-entraînement vidéo au niveau de l'événement, bâti sur le Wan2.1-I2V-14B open source d'Alibaba, apprend à prédire une manipulation entière à partir de clips légendés de robots, d'humains et de vidéo générale. La prédiction est ensuite limitée à des clips fixes de huit secondes et distillée en une seule étape d'environ 0,12 seconde. Enfin, un Action DiT de 0,9 milliard de paramètres convertit les prédictions en mouvements, tandis que le modèle vidéo reste gelé et ne s'adapte que par LoRA. La latence totale d'un chunk d'actions est d'environ 0,22 seconde, compatible avec un contrôle réactif. Pour les ingénieurs et intégrateurs, le résultat suggère qu'une approche fondée sur la prédiction vidéo peut dépasser des VLA de référence en zéro-shot sur matériel réel. Des réserves s'imposent toutefois : la comparaison réelle ne porte que sur dix familles de tâches et un seul concurrent, et le classement repose sur les chiffres de l'article des auteurs eux-mêmes, non sur une validation indépendante.
Le contexte est celui d'une course où chacun revendique la tête du même benchmark : Simate a annoncé le mois dernier la première place de RoboDojo pour son système Simate-beta, et les deux revendications coexistent sans arbitrage public. Côté industriel, Robotera exploite déjà des robots dans plus de dix centres logistiques répartis dans cinq provinces et municipalités chinoises, avec des partenaires dont China Post et SF Express. Cela ne signifie pas que VPP2 est déployé à grande échelle : il s'agit pour l'instant d'un résultat de recherche. Le code est publié en open source sur GitHub, ce qui permettra une reproduction externe, étape décisive pour confirmer les performances. D'autres acteurs avancent dans la même direction, comme Xiaomi avec son modèle de monde incarné Robotics-U0, également en open source, et Physical Intelligence avec la famille pi0.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




