Aller au contenu principal
ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents
RecherchearXiv cs.RO 

ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente ACE-Brain-0.5, un modèle de fondation embarqué unifié pour l'IA physique agentique, dans un article publié sur arXiv début juillet 2026. Le système s'appuie sur un backbone unique de 8 milliards de paramètres qui assure quatre fonctions simultanées : ancrage des objets et des affordances dans la scène, raisonnement spatial en 3D et en vue égocentrique, décomposition d'instructions en sous-objectifs, génération d'actions de navigation et de manipulation, et estimation de la progression pour vérifier ou corriger l'exécution. Une cinquième fonction, l'auto-amélioration, repose sur un cadre externe qui met à jour les schémas de tâches, la mémoire spatiale et les cas de récupération d'échec à partir des données de déploiement. Le modèle s'appuie sur un prédécesseur, ACE-Brain-0, et introduit une méthode nommée SSR+ (Scaffold-Specialize-Reconcile avec une étape de Réactivation après fusion des vecteurs de tâches) pour combiner ces capacités sans qu'elles n'interfèrent entre elles. Sur quinze bancs d'essai, ACE-Brain-0.5 surpasse son prédécesseur sur 14 des 18 tests de perception spatiale et d'ancrage, tout en restant compétitif en navigation et manipulation.

Cette approche illustre une tendance de fond dans la robotique humanoïde et les agents physiques : le passage de politiques bout-en-bout, souvent dépourvues de raisonnement spatial explicite, vers des architectures qui unifient perception, planification, action et auto-évaluation dans une représentation partagée. C'est un pari différent de celui des modèles VLA généralistes type Pi-0 ou GR00T N2, qui privilégient l'apprentissage direct d'une politique d'action : ici, l'accent est mis sur la boucle fermée complète, avec vérification et récupération d'erreur intégrées, un point souvent négligé dans les démonstrations spectaculaires mais peu robustes du secteur.

Le papier ne précise pas de partenariat industriel ni de déploiement sur plateforme commerciale à ce stade : il s'agit d'un travail de recherche fondamentale, positionné comme une étape vers une IA physique agentique plus générale, sans calendrier de mise en production annoncé.

À lire aussi

Magic-W0 : un modèle fondation monde-action structuré pour l'intelligence physique
1arXiv cs.RO 

Magic-W0 : un modèle fondation monde-action structuré pour l'intelligence physique

Magic-W0, un modèle de fondation « monde-action » (WAM, world-action model), est présenté dans un preprint arXiv (2609.39870v1) dont les auteurs ne sont pas précisés dans le résumé. Le modèle code chaque interaction comme une « Structured World Transition » en trois blocs. L'état courant associe le contexte vision-langage à une géométrie 3D de la scène. La transition est décrite par un mouvement 3D qui capture les changements tridimensionnels induits par l'action. L'état futur est exprimé sous forme de sémantique décrivant le résultat attendu de la tâche. L'architecture aligne couche par couche la prédiction du monde et la génération d'actions continues : les hypothèses d'action en cours conditionnent la prédiction de transition, et les représentations prédites alimentent en retour la génération d'actions. Le pré-entraînement combine manipulation humaine égocentrique, données UMI (interface de collecte par préhenseur portable), données de robots réels et simulation. La supervision porte sur des représentations latentes (géométrie, mouvement 3D, sémantique future) issues de modèles visuels préentraînés. Sur le benchmark RoboDojo-Sim, Magic-W0 obtient un score moyen de 27,10, le plus élevé parmi les WAM comparés. Les auteurs annoncent aussi de bonnes performances sur plusieurs tâches sur robot réel après un fine-tuning avec peu de données. L'intérêt tient à la critique que formule le papier : la plupart des WAM prédisent des images futures ou des latents génériques, peu exploitables pour le contrôle, et pas forcément liés à l'action. Magic-W0 propose une représentation explicitement géométrique et orientée contrôle. Des tests d'intervention à l'inférence montrent que ces représentations réagissent de façon systématique aux changements d'action candidate, et que l'information d'action circule via les représentations 3D jusqu'aux prédictions sémantiques. C'est un argument de causalité plus solide que la simple qualité visuelle. Pour un intégrateur, la promesse est une adaptation rapide à de nouvelles tâches avec peu de données, point critique du coût de déploiement. Il faut toutefois relativiser. Le score de 27,10 n'a de sens que par rapport aux WAM comparés, sans valeur absolue ni écart précisé dans le résumé. Les tâches réelles ne sont pas détaillées : ni taux de réussite, ni volume de données de fine-tuning, ni plateforme robotique. On reste donc au stade du résultat de recherche, sans produit livré ni déploiement. Ce travail s'inscrit dans la montée des modèles VLA (vision-langage-action) et de leurs extensions « monde », qui cherchent à doter les politiques d'une dynamique de l'environnement conditionnée par l'action, au-delà de la simple imitation. Le recours massif aux vidéos humaines égocentriques et aux données UMI reflète la tendance à contourner le coût de la téléopération robot. Magic-W0 se positionne face aux autres WAM et aux politiques fondées sur la reconstruction vidéo, dont le résumé ne cite pas les noms. Les prochaines étapes à surveiller sont la publication du code et des poids, une évaluation indépendante de RoboDojo-Sim, et surtout des résultats détaillés sur robot réel, seuls capables de dire si la structure 3D apporte un gain tangible face aux approches VLA génériques.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée
2arXiv cs.RO 

EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée

Une équipe de recherche a publié EmbodiedGen V2 sur arXiv (2607.07459v1), un moteur génératif de mondes 3D destiné à produire des environnements de simulation directement exploitables pour l'entraînement de robots. Le problème visé est concret : générer des assets 3D "sim-ready" est devenu rapide, mais les assembler en environnements de tâches réellement utilisables pour l'apprentissage reste largement manuel, ce qui limite le passage à l'échelle de l'apprentissage en boucle fermée. EmbodiedGen V2 propose une représentation unifiée qui relie assets compatibles multi-simulateurs, affordances d'interaction, mondes orientés tâches, scènes multi-pièces à grande échelle, et un système de "Vibe Coding" avec état, le tout dans un pipeline génératif, éditable et réutilisable. Les environnements produits couvrent la manipulation, la navigation, la manipulation mobile, le déploiement cross-simulateur et l'entraînement de politiques robotiques. Sur le plan chiffré, le pipeline de génération d'assets atteint 96,5% d'acceptation humaine et 98,6% de réussite de détection de collisions, et 83,3% des mondes orientés tâches sont directement utilisables en simulation sans retouche manuelle. L'intérêt principal tient aux résultats de transfert obtenus grâce à ces environnements générés. Un entraînement par renforcement en ligne fait passer le taux de succès en simulation de 9,7% à 79,8%, et ces gains se transfèrent à des robots réels avec un taux de succès en tâche réelle passant de 21,7% à 75,0%. Pour un secteur où l'écart entre démonstration simulée et comportement réel reste un obstacle majeur à la commercialisation de robots humanoïdes ou mobiles pilotés par des politiques apprises, ce type de résultat constitue un argument concret en faveur de la génération procédurale de mondes comme infrastructure d'entraînement, plutôt qu'une simple preuve de concept de génération d'assets visuels. Le travail s'inscrit dans la lignée des efforts récents de génération de scènes 3D et d'assets simulables pour l'IA incarnée, où la difficulté ne portait plus tant sur la qualité visuelle des objets générés que sur leur intégration fonctionnelle dans des tâches robotiques complètes et transférables entre simulateurs. Le papier ne mentionne pas de partenariat industriel ni de déploiement sur robot commercial identifié, et se positionne comme une contribution d'infrastructure de recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration par d'autres laboratoires travaillant sur l'apprentissage par renforcement pour la robotique.

RechercheActu
1 source
Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique
3arXiv cs.RO 

Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique

Un article de recherche publié sur arXiv (2607.21725v1) présente Pigey, un orchestrateur d'agence physique conçu pour piloter des robots généralistes sans données supplémentaires ni post-entraînement. Plutôt que d'entasser perception, planification, détection de succès, récupération d'erreurs et contrôle bas niveau dans une seule politique apprise par pré-entraînement massif, comme le font les modèles vision-langage-action (VLA) actuels, les auteurs séparent le problème en deux couches : un agent de contrôle langage-conditionné classique, et un gestionnaire de haut niveau qui décompose les objectifs en sous-tâches, envoie des commandes moteur, vérifie les résultats à partir des observations bas niveau et déclenche des routines de récupération en cas d'échec. Pigey peut commander aussi bien des politiques VLA existantes que des compétences paramétrées préexistantes. Sur le benchmark de simulation LIBERO-PRO, le taux de réussite passe de 12,8% à 53,3%, soit plus du quadruple, sans aucun réglage spécifique à la tâche. Sur un robot réel, les tâches nécessitant du raisonnement voient leur taux de succès grimper de quasi zéro à plus de 90% une fois la politique figée intégrée dans la boucle agentique de Pigey. Ce résultat vient alimenter un débat déjà vif dans la robotique humanoïde et manipulatrice : les modèles VLA de bout en bout, aussi impressionnants soient-ils en démonstration, échouent souvent dès que la tâche exige un raisonnement séquentiel ou une récupération après erreur, un écart que les auteurs baptisent "orchestration gap". En montrant qu'une simple couche d'orchestration explicite, sans ré-entraînement, suffit à multiplier par quatre les performances, l'étude suggère que l'échelle des données de pré-entraînement n'est pas le seul levier disponible pour combler ce fossé entre démonstration et fiabilité réelle, un enjeu direct pour les intégrateurs qui doivent déployer ces systèmes en environnement industriel non contrôlé. Cette approche s'inscrit dans une tendance plus large de la recherche en robotique généraliste, où des laboratoires développent des modèles comme Pi-0, GR00T N2 ou Helix pour unifier perception et action. Pigey se positionne comme une alternative complémentaire plutôt qu'un concurrent direct : il ne remplace pas ces politiques mais les pilote depuis l'extérieur, ce qui laisse ouverte la question de son adoption par les fournisseurs de VLA propriétaires et de son passage à l'échelle sur des tâches de manipulation encore plus complexes.

RecherchePaper
1 source
AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins
4arXiv cs.RO 

AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins

Des chercheurs publient sur arXiv (v2, référence 2609.33299) AquaWAM, présenté comme le premier World Action Model (WAM) conçu pour des agents sous-marins. Un WAM permet à un robot d'anticiper les conséquences d'une action candidate avant de l'exécuter. Les WAM existants prédisent surtout des observations visuelles conditionnées par l'action. AquaWAM prédit à la place des états de navigation compacts. Il modélise la dynamique commandée et la dynamique passive: zone morte des propulseurs, glissement inertiel qui dépasse chaque commande, courants ambiants. Il perçoit via un DVL (capteur de vitesse Doppler), une centrale inertielle (IMU), un capteur de pression et des encodeurs d'articulations. Les caméras ne servent qu'à fournir la sémantique, c'est-à-dire les objectifs et la pose de la cible. Sur le benchmark USIM (20 tâches sous-marines), le modèle atteint 72,6 % de succès. Il décide 2,7 fois plus vite que U0 sur un NVIDIA Jetson AGX Orin. Sans les mesures de vitesse du DVL, il conserve 61,6 % de succès, contre 39,4 % pour U0. Ces résultats visent une hypothèse répandue dans les modèles du monde, selon laquelle prédire des pixels serait la voie générique vers le contrôle. Sous l'eau, l'inertie, la flottabilité, la traînée et la dérive continuent d'agir après la commande. Modéliser directement ces effets, plutôt que la scène, réduit la taille du modèle et le coût de calcul. La vitesse d'inférence sur Jetson AGX Orin, un module embarqué courant, compte pour les intégrateurs d'ROV et d'AUV, dont le calcul et l'énergie sont limités. La robustesse à la perte de capteurs répond à un problème opérationnel: un DVL perd son verrouillage sur le fond, et les eaux turbides dégradent la vision. L'écart entre 61,6 % et 39,4 % suggère une meilleure tolérance à la dégradation, à confirmer hors simulation. Il faut toutefois lire ces chiffres avec prudence. Les résultats proviennent d'un benchmark en simulation, USIM. L'abstract ne mentionne ni essai en bassin ni essai en mer. Il ne dit pas non plus si le comparatif avec U0 est réalisé à budget équivalent. Le résumé ne précise pas non plus l'écart de réalité entre simulation et milieu réel pour des courants variables. Le travail s'inscrit dans l'extension des WAM et des modèles vision-langage-action (VLA) au-delà des manipulateurs terrestres et des humanoïdes, vers des véhicules à dynamique passive marquée. U0 sert ici de référence pour l'embarqué sous-marin. Aucun acteur français ou européen n'est cité dans l'abstract. Les suites probables sont des validations en conditions réelles, l'ouverture éventuelle du code et des tests sur des véhicules physiques. Ce travail reste pour l'instant une publication de recherche, sans produit ni déploiement annoncé.

RecherchePaper
1 source