Aller au contenu principal
RecherchearXiv cs.RO 

GroundingPI : un modèle fondation d'ancrage pour l'intelligence physique, fondé sur des primitives visuelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

GroundingPI est un modèle de fondation de 4 milliards de paramètres dédié au « grounding » visuel, c'est-à-dire la capacité de désigner précisément l'objet visé et de le localiser, y compris dans un environnement encombré ou pour de très petits objets. Il génère des points et des boîtes englobantes sous forme de coordonnées quantifiées, intégrées à un vocabulaire partagé avec le texte. L'entraînement combine préentraînement multimodal et spatial, fine-tuning supervisé, puis apprentissage par renforcement avec GRPO, à partir de jeux de données publics et de « data engines » dédiés. Sur 34 benchmarks couvrant 11 capacités perceptives, face à 44 modèles de référence, il atteint 73,68 % en moyenne, contre 71,54 % pour GPT-6 Astra, pourtant plus gros. En aval, utilisé comme backbone visuel, il bat tous les backbones courants testés sur RoboTwin 2.0 dans les quatre scénarios hors distribution, jusqu'à 24,8 % en relatif face au meilleur d'entre eux. Sur RoboCasa-GR1, il entraîné avec 50 % des démonstrations dépasse les références entraînées avec 75 %. Sur nuScenes, il obtient une erreur L2 moyenne en boucle ouverte de 0,296 m.

Pour les équipes qui développent des politiques VLA (vision-langage-action) ou des modèles monde-action, le résultat s'attaque à un point faible peu discuté : la perception de ces systèmes provient de backbones généralistes de vision-langage ou de génération vidéo, qui échouent justement sur les objets minuscules, les scènes denses et les contraintes de latence du contrôle en boucle fermée. Le gain de 25 % de données de démonstration sur RoboCasa-GR1 est le chiffre le plus parlant pour un intégrateur, car la collecte de démonstrations reste le principal poste de coût de l'apprentissage par imitation. L'étude suggère aussi que la perception gagne à être préentraînée séparément, avec des effets d'échelle observés à la fois en manipulation et en conduite autonome. Elle relève enfin l'intérêt du grounding dense et le rôle de l'OCR comme catalyseur de l'apprentissage perceptif. Les réserves habituelles s'appliquent : il s'agit de benchmarks de simulation (RoboTwin, RoboCasa) et d'une évaluation de conduite en boucle ouverte, qui prédit mal le comportement en boucle fermée. Aucune démonstration sur robot réel ni mesure de latence n'est rapportée dans le résumé.

Ces travaux s'inscrivent dans la tendance qui consiste à greffer sur des VLA, comme Pi-0 ou GR00T, des encodeurs issus de modèles de vision-langage généralistes, dont les limites spatiales sont connues. Le choix d'un modèle de 4 milliards de paramètres répond à la contrainte d'embarquement et de vitesse. L'étude reste un preprint arXiv, sans mention de calendrier de publication des poids ni de déploiement industriel. La suite logique serait de confirmer ces gains sur matériel réel et de voir si les développeurs de VLA adoptent un backbone de perception dédié plutôt que des modèles généralistes.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

Magic-W0 : un modèle fondation monde-action structuré pour l'intelligence physique

Magic-W0, un modèle de fondation « monde-action » (WAM, world-action model), est présenté dans un preprint arXiv (2609.39870v1) dont les auteurs ne sont pas précisés dans le résumé. Le modèle code chaque interaction comme une « Structured World Transition » en trois blocs. L'état courant associe le contexte vision-langage à une géométrie 3D de la scène. La transition est décrite par un mouvement 3D qui capture les changements tridimensionnels induits par l'action. L'état futur est exprimé sous forme de sémantique décrivant le résultat attendu de la tâche. L'architecture aligne couche par couche la prédiction du monde et la génération d'actions continues : les hypothèses d'action en cours conditionnent la prédiction de transition, et les représentations prédites alimentent en retour la génération d'actions. Le pré-entraînement combine manipulation humaine égocentrique, données UMI (interface de collecte par préhenseur portable), données de robots réels et simulation. La supervision porte sur des représentations latentes (géométrie, mouvement 3D, sémantique future) issues de modèles visuels préentraînés. Sur le benchmark RoboDojo-Sim, Magic-W0 obtient un score moyen de 27,10, le plus élevé parmi les WAM comparés. Les auteurs annoncent aussi de bonnes performances sur plusieurs tâches sur robot réel après un fine-tuning avec peu de données. L'intérêt tient à la critique que formule le papier : la plupart des WAM prédisent des images futures ou des latents génériques, peu exploitables pour le contrôle, et pas forcément liés à l'action. Magic-W0 propose une représentation explicitement géométrique et orientée contrôle. Des tests d'intervention à l'inférence montrent que ces représentations réagissent de façon systématique aux changements d'action candidate, et que l'information d'action circule via les représentations 3D jusqu'aux prédictions sémantiques. C'est un argument de causalité plus solide que la simple qualité visuelle. Pour un intégrateur, la promesse est une adaptation rapide à de nouvelles tâches avec peu de données, point critique du coût de déploiement. Il faut toutefois relativiser. Le score de 27,10 n'a de sens que par rapport aux WAM comparés, sans valeur absolue ni écart précisé dans le résumé. Les tâches réelles ne sont pas détaillées : ni taux de réussite, ni volume de données de fine-tuning, ni plateforme robotique. On reste donc au stade du résultat de recherche, sans produit livré ni déploiement. Ce travail s'inscrit dans la montée des modèles VLA (vision-langage-action) et de leurs extensions « monde », qui cherchent à doter les politiques d'une dynamique de l'environnement conditionnée par l'action, au-delà de la simple imitation. Le recours massif aux vidéos humaines égocentriques et aux données UMI reflète la tendance à contourner le coût de la téléopération robot. Magic-W0 se positionne face aux autres WAM et aux politiques fondées sur la reconstruction vidéo, dont le résumé ne cite pas les noms. Les prochaines étapes à surveiller sont la publication du code et des poids, une évaluation indépendante de RoboDojo-Sim, et surtout des résultats détaillés sur robot réel, seuls capables de dire si la structure 3D apporte un gain tangible face aux approches VLA génériques.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Vers les limites cognitivo-physiques de l'intelligence incarnée : un agent de course autonome centré sur un modèle du monde
2arXiv cs.RO 

Vers les limites cognitivo-physiques de l'intelligence incarnée : un agent de course autonome centré sur un modèle du monde

Une équipe de recherche publie sur arXiv (article 2608.10618v1) un système baptisé agent de course autonome centré sur un modèle du monde, conçu pour sonder les limites conjointes cognitives et physiques de l'intelligence incarnée. Les données d'entraînement proviennent d'essais réels sur véhicule, où le système embarqué a maintenu une localisation et une perception robustes jusqu'à 256,3 km/h, avec une accélération latérale de pointe de 26,8 m/s². Le framework construit un état du monde, raisonne de manière anticipative sur les événements futurs, et pilote le véhicule près de ses limites physiques dans une boucle de raffinement fermée, en apprenant à la fois des réussites et des échecs proches de la limite. En simulation complète de course, l'agent entraîné atteint un taux de réussite d'interaction de 88,3% sur un ensemble de scénarios de course simulés jugés difficiles. L'enjeu dépasse la course automobile : la plupart des systèmes d'IA incarnée sont aujourd'hui évalués avec des marges de sécurité conservatrices, ce qui laisse mal comprises leurs limites réelles de capacité en conditions extrêmes. La course autonome sert ici de banc d'essai exigeant, combinant perception haute fréquence, interactions adversariales et dynamique du véhicule quasi saturée, un cadre plus contraignant que les tests habituels en robotique ou en conduite autonome. Le résultat suggère qu'un modèle du monde peut aider un agent à représenter et affiner en continu ses frontières de capacité plutôt que de se contenter de les éviter par prudence, une piste potentiellement transférable à d'autres systèmes robotiques ou véhicules autonomes où la marge entre performance et sécurité reste mal quantifiée. Le travail se positionne face aux systèmes de course autonome existants, qui repoussent les performances à haute vitesse sans modéliser conjointement les limites cognitives et physiques ni les affiner de manière couplée. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans précision sur un véhicule commercial, un partenaire industriel ou un calendrier de déploiement : aucune indication n'est donnée sur une application produit ou un pilote à venir. Les auteurs présentent le raffinement en boucle fermée du modèle du monde et de la politique de contrôle comme une piste pour améliorer la récupération après échec et la généralisation à des circuits inédits, posant les bases d'une méthodologie consciente des limites pour un déploiement plus sûr des agents incarnés dans le monde réel.

RecherchePaper
1 source
ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents
3arXiv cs.RO 

ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents

Une équipe de recherche présente ACE-Brain-0.5, un modèle de fondation embarqué unifié pour l'IA physique agentique, dans un article publié sur arXiv début juillet 2026. Le système s'appuie sur un backbone unique de 8 milliards de paramètres qui assure quatre fonctions simultanées : ancrage des objets et des affordances dans la scène, raisonnement spatial en 3D et en vue égocentrique, décomposition d'instructions en sous-objectifs, génération d'actions de navigation et de manipulation, et estimation de la progression pour vérifier ou corriger l'exécution. Une cinquième fonction, l'auto-amélioration, repose sur un cadre externe qui met à jour les schémas de tâches, la mémoire spatiale et les cas de récupération d'échec à partir des données de déploiement. Le modèle s'appuie sur un prédécesseur, ACE-Brain-0, et introduit une méthode nommée SSR+ (Scaffold-Specialize-Reconcile avec une étape de Réactivation après fusion des vecteurs de tâches) pour combiner ces capacités sans qu'elles n'interfèrent entre elles. Sur quinze bancs d'essai, ACE-Brain-0.5 surpasse son prédécesseur sur 14 des 18 tests de perception spatiale et d'ancrage, tout en restant compétitif en navigation et manipulation. Cette approche illustre une tendance de fond dans la robotique humanoïde et les agents physiques : le passage de politiques bout-en-bout, souvent dépourvues de raisonnement spatial explicite, vers des architectures qui unifient perception, planification, action et auto-évaluation dans une représentation partagée. C'est un pari différent de celui des modèles VLA généralistes type Pi-0 ou GR00T N2, qui privilégient l'apprentissage direct d'une politique d'action : ici, l'accent est mis sur la boucle fermée complète, avec vérification et récupération d'erreur intégrées, un point souvent négligé dans les démonstrations spectaculaires mais peu robustes du secteur. Le papier ne précise pas de partenariat industriel ni de déploiement sur plateforme commerciale à ce stade : il s'agit d'un travail de recherche fondamentale, positionné comme une étape vers une IA physique agentique plus générale, sans calendrier de mise en production annoncé.

RechercheOpinion
1 source
Modèle d'action ancré : l'ancrage 3D comme fondation pour la robotique
4arXiv cs.RO 

Modèle d'action ancré : l'ancrage 3D comme fondation pour la robotique

Une équipe a publié le 22 septembre 2026 sur arXiv (2609.23863) les Grounded Action Models (GAM), une famille de modèles de fondation robotique ancrant explicitement en 3D la perception des objets à manipuler, là où les modèles vision-langage-action (VLA) et monde-action (WAM) actuels s'appuient sur le langage ou la génération vidéo sans lien direct avec la géométrie de la scène. GAM convertit des instructions en langage, points ou boîtes englobantes en une représentation centrée objet, dont la géométrie et l'historique d'état du robot sont fusionnés par un transformeur multi-flux pour prédire des séquences d'actions. Sur RoboTwin 2.0 (50 tâches), il atteint 55,3% de réussite contre 52,0% pour Spatial Forcing, et 47,6% sous randomisation de scène contre 30,4% pour Abot-M0. Sur LIBERO-PRO, il obtient 61% contre 53% pour π0.5 de Physical Intelligence. Sur un bras bimanuel YAM réel, il conserve 17 réussites sur 20 sous décalage visuel contre 4/20 pour π0.5, et couplé à un planificateur Molmo2 sur un bras Franka, il atteint 64,7% de complétion en distribution et 49,8% hors distribution sur des tâches longues. Ce travail cible un angle mort des VLA actuels, qui apprennent implicitement, à partir de démonstrations, quels objets compter et où ils se trouvent, sans contrainte géométrique explicite, ce qui les fragilise dès qu'un objet est déplacé ou que la scène change. En forçant cet ancrage 3D en amont de la politique d'action, GAM réduit l'écart entre démonstrations contrôlées et déploiement réel, un enjeu central pour les intégrateurs qui veulent sortir les bras manipulateurs des bancs de test. Sa capacité à servir de contrôleur bas niveau sous un planificateur haut niveau ouvre la voie à des tâches longues et dépendantes du contexte, un registre encore peu couvert aujourd'hui. GAM s'inscrit dans une lignée de travaux visant à corriger les VLA de type π0/π0.5 de Physical Intelligence, critiqués pour leur apprentissage implicite de la géométrie de scène, et se positionne explicitement face à Spatial Forcing, Abot-M0 et π_0.5 comme lignes de base directes. Aucun acteur industriel, date de déploiement commercial ni partenaire français ou européen n'est mentionné: il s'agit d'une publication arXiv non encore revue par les pairs, testée en simulation et sur deux plateformes robotiques de laboratoire. Les suites logiques, non détaillées dans le résumé, seraient l'extension à d'autres plateformes matérielles et une validation indépendante des chiffres avancés.

RecherchePaper
1 source