GroundingPI : un modèle fondation d'ancrage pour l'intelligence physique, fondé sur des primitives visuelles
GroundingPI est un modèle de fondation de 4 milliards de paramètres dédié au « grounding » visuel, c'est-à-dire la capacité de désigner précisément l'objet visé et de le localiser, y compris dans un environnement encombré ou pour de très petits objets. Il génère des points et des boîtes englobantes sous forme de coordonnées quantifiées, intégrées à un vocabulaire partagé avec le texte. L'entraînement combine préentraînement multimodal et spatial, fine-tuning supervisé, puis apprentissage par renforcement avec GRPO, à partir de jeux de données publics et de « data engines » dédiés. Sur 34 benchmarks couvrant 11 capacités perceptives, face à 44 modèles de référence, il atteint 73,68 % en moyenne, contre 71,54 % pour GPT-6 Astra, pourtant plus gros. En aval, utilisé comme backbone visuel, il bat tous les backbones courants testés sur RoboTwin 2.0 dans les quatre scénarios hors distribution, jusqu'à 24,8 % en relatif face au meilleur d'entre eux. Sur RoboCasa-GR1, il entraîné avec 50 % des démonstrations dépasse les références entraînées avec 75 %. Sur nuScenes, il obtient une erreur L2 moyenne en boucle ouverte de 0,296 m.
Pour les équipes qui développent des politiques VLA (vision-langage-action) ou des modèles monde-action, le résultat s'attaque à un point faible peu discuté : la perception de ces systèmes provient de backbones généralistes de vision-langage ou de génération vidéo, qui échouent justement sur les objets minuscules, les scènes denses et les contraintes de latence du contrôle en boucle fermée. Le gain de 25 % de données de démonstration sur RoboCasa-GR1 est le chiffre le plus parlant pour un intégrateur, car la collecte de démonstrations reste le principal poste de coût de l'apprentissage par imitation. L'étude suggère aussi que la perception gagne à être préentraînée séparément, avec des effets d'échelle observés à la fois en manipulation et en conduite autonome. Elle relève enfin l'intérêt du grounding dense et le rôle de l'OCR comme catalyseur de l'apprentissage perceptif. Les réserves habituelles s'appliquent : il s'agit de benchmarks de simulation (RoboTwin, RoboCasa) et d'une évaluation de conduite en boucle ouverte, qui prédit mal le comportement en boucle fermée. Aucune démonstration sur robot réel ni mesure de latence n'est rapportée dans le résumé.
Ces travaux s'inscrivent dans la tendance qui consiste à greffer sur des VLA, comme Pi-0 ou GR00T, des encodeurs issus de modèles de vision-langage généralistes, dont les limites spatiales sont connues. Le choix d'un modèle de 4 milliards de paramètres répond à la contrainte d'embarquement et de vitesse. L'étude reste un preprint arXiv, sans mention de calendrier de publication des poids ni de déploiement industriel. La suite logique serait de confirmer ces gains sur matériel réel et de voir si les développeurs de VLA adoptent un backbone de perception dédié plutôt que des modèles généralistes.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



