IMPLY : cohérence physiquement ancrée pour les simulations par modèle du monde
Un article déposé sur arXiv (2609.12441v1, mi-septembre 2026) présente IMPLY, une méthode pour vérifier si les modèles du monde robotiques comprennent réellement la physique des objets, plutôt que de simplement produire des prédictions cohérentes entre elles. Les contrôles actuels d'auto-cohérence vérifient seulement que les trajectoires prédites pour un objet poussé à plusieurs vitesses s'accordent entre elles, sans les confronter à la physique réelle. IMPLY inverse un simulateur pour extraire la masse et le frottement impliqués par chaque trajectoire, ancrés sur deux poussées de calibration déjà vues par le modèle. En test contrôlé, l'auto-cohérence donne un score parfait à un modèle qui ignore l'objet et prédit toujours une poussée "typique" (AUROC de seulement 0,70 pour repérer la triche), là où IMPLY le démasque parfaitement (AUROC de 1,00). Sur V-JEPA 2-AC, le modèle de Meta adapté à la scène testée, le système suit l'objet avec ses propres calibrations (corrélation de 0,91 avec la vérité terrain) mais tombe à 0,05 avec celles d'un autre objet; l'auto-cohérence ne distingue pas les deux cas (52% de bonnes préférences, niveau du hasard) quand IMPLY y parvient dans 73% des cas, à 0,003 près d'un oracle omniscient.
Le résultat pointe un angle mort dans l'évaluation des modèles du monde et des architectures vision-langage-action (VLA) qui pilotent robots manipulateurs et humanoïdes: un modèle peut paraître fiable et cohérent avec lui-même sans avoir internalisé la moindre notion de masse ou de frottement, et dérailler face à un objet inconnu. Pour les intégrateurs qui évaluent des piles comme GR00T N2, Pi-0 ou Helix avant déploiement, les métriques de cohérence interne mises en avant dans les communiqués ne garantissent donc aucune compréhension physique transférable.
Les modèles du monde conditionnés par l'action, tel V-JEPA 2-AC de Meta AI (FAIR), prédisent à partir de vidéo l'effet des actions d'un robot sans simulateur physique explicite, et servent de brique à plusieurs architectures VLA récentes de manipulation. Faute de vérité terrain disponible à l'inférence, la communauté s'appuyait jusqu'ici sur l'auto-cohérence entre trajectoires, une pratique qu'IMPLY montre insuffisante puisqu'elle peut être dupée par un modèle ignorant l'identité de l'objet manipulé. Il s'agit à ce stade d'une contribution de recherche testée en environnement contrôlé, sans calendrier de déploiement industriel annoncé.
Dans nos dossiers




