Aller au contenu principal
EmbodiedSmith : passer à l'échelle les données d'IA incarnée grâce à un cycle d'auto-amélioration récursive en simulation
IA physiquearXiv cs.RO 

EmbodiedSmith : passer à l'échelle les données d'IA incarnée grâce à un cycle d'auto-amélioration récursive en simulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.07969) EmbodiedSmith, un cadre de génération de données d'entraînement robotiques en simulation, fondé sur une boucle de « récursive self-improvement » (RSI). Le système unifie trois étapes habituellement séparées : la création d'assets 3D, la génération de scènes et la génération de tâches. Il fonctionne de façon autonome ou sur instructions en langage naturel. Au centre du dispositif, une boucle de raffinement pilotée par des agents : la génération de scène anticipe les besoins des tâches à venir, et la génération de tâche déclenche en retour des modifications ciblées de la scène. Le cadre prend en charge des manipulateurs mobiles, des humanoïdes et des mains dextres, ainsi que des interactions avec des objets déformables et des fluides. Les auteurs affirment que ce raffinement conjoint améliore le taux de réussite de la génération de tâches, y compris pour les tâches longues, et que des politiques entraînées sur des données plus diversifiées généralisent mieux. Le résumé ne donne ni chiffres, ni noms de robots, ni noms de modèles de politique testés.

L'intérêt tient à deux verrous connus des modèles de fondation robotiques : le manque de données variées et le manque d'environnements d'évaluation fiables. Les pipelines de simulation actuels dépendent de bibliothèques d'assets et de compétences prédéfinies, et traitent la scène et la tâche comme deux problèmes disjoints, ce qui produit des tâches irréalisables ou répétitives. Si la boucle scène-tâche tient ses promesses, elle réduirait le travail manuel de conception d'environnements, poste coûteux pour les équipes qui entraînent des VLA (vision-language-action). L'extension aux mains dextres, aux fluides et aux objets déformables vise des cas où la simulation reste la plus fragile. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, et le résumé ne dit rien de l'écart sim-to-real. Un gain de généralisation mesuré en simulation ne prouve pas un transfert sur robot physique, qui est le test décisif pour les décideurs industriels.

Le travail s'inscrit dans la course à la donnée synthétique pour la robotique, où coexistent les générateurs de scènes pilotés par LLM, les environnements procéduraux et les plateformes de simulation des grands acteurs, comme Isaac Sim chez NVIDIA, qui alimente la famille GR00T. Face à la téléopération, coûteuse et lente à passer à l'échelle, la simulation générative promet de produire des volumes bien supérieurs à moindre coût. Les prochaines étapes à surveiller sont la publication du code et des benchmarks, des validations sur robots réels et une comparaison directe avec les pipelines existants. Aucun acteur européen ni calendrier de déploiement n'est mentionné dans l'annonce.

À lire aussi

IA incarnée en évolution : Embodied-R1.5 améliore l'intelligence physique grâce aux modèles fondation
1arXiv cs.RO 

IA incarnée en évolution : Embodied-R1.5 améliore l'intelligence physique grâce aux modèles fondation

Une équipe de chercheurs a publié sur arXiv Embodied-R1.5, un modèle de fondation incarné (EFM pour Embodied Foundation Model) de 8 milliards de paramètres intégrant cognition incarnée, planification, auto-correction et pointage d'affordances dans une architecture unifiée, entraîné sur un corpus dépassant 15 milliards de tokens construit via trois pipelines automatisés. Le cadre Planner-Grounder-Corrector (PGC) en boucle fermée permet l'exécution autonome et l'auto-correction sur des tâches longues, soutenu par une recette d'apprentissage par renforcement multi-tâches équilibré pour atténuer les conflits entre sous-domaines hétérogènes. Sur les benchmarks standardisés, Embodied-R1.5 atteint l'état de l'art sur 16 des 24 benchmarks de VLM incarnés, devançant Gemini-Robotics-ER-1.5 de Google DeepMind et GPT-5.4 d'OpenAI. Adapté en VLA (Vision-Language-Action) avec peu de données de fine-tuning, il surpasse pi-0.5 de Physical Intelligence sur quatre suites de benchmarks de manipulation. Des tests zero-shot sur robot réel valident les performances en suivi d'instructions, ancrage d'affordances, manipulation d'objets articulés et tâches longues, les poids, le code d'entraînement et EmbodiedEvalKit, un framework d'évaluation dédié, étant publiés en open source. Qu'un modèle de 8 milliards de paramètres surpasse des systèmes adossés aux ressources de Google et d'OpenAI est un signal notable pour les intégrateurs industriels, car la compacité ouvre la voie à un déploiement embarqué sur plateformes contraintes. L'auto-correction en boucle fermée du PGC répond directement au demo-to-reality gap qui freine la commercialisation des robots polyvalents, tandis que la capacité à fine-tuner en VLA avec peu de données cible le goulot d'étranglement central de la collecte de données de manipulation étiquetées. L'open source complet facilite la comparaison reproductible et devrait accélérer les itérations communautaires, à condition que les performances zero-shot annoncées soient confirmées dans des configurations adversariales que le papier ne documente pas. Embodied-R1.5 s'inscrit dans la vague des modèles de fondation robotiques généraux densifiée depuis RT-2 de Google et OpenVLA, avec pour concurrents directs Physical Intelligence (pi-0, pi-0.5) et Google DeepMind (Gemini Robotics). L'absence d'acteurs européens parmi les concurrents benchmarkés reflète le retard du continent, où des acteurs comme Wandercraft ou Enchanted Tools restent cantonnés à des niches spécialisées. L'approche open source total distingue ce travail des modèles propriétaires de Figure AI (Figure 03) ou de 1X Technologies, positionnant potentiellement Embodied-R1.5 comme base de référence pour les laboratoires et industriels souhaitant spécialiser un EFM sur leurs propres flux de manipulation.

UELes poids et le code d'Embodied-R1.5 publiés en open source constituent une base de référence accessible pour les laboratoires européens (CEA-List, INRIA) souhaitant spécialiser un EFM sur leurs propres flux de manipulation sans dépendre des modèles propriétaires de Google ou OpenAI.

💬 8 milliards de paramètres qui coiffent Gemini Robotics et GPT-5.4 sur leurs propres benchmarks, en open source total, c'est inattendu. L'auto-correction en boucle fermée s'attaque directement au fossé entre la démo en labo et le robot qui tient la route en prod, ce qui est le vrai mur depuis RT-2. Bon, le papier esquive les configurations difficiles, donc on verra ce que ça donne quand la communauté s'en empare.

IA physiqueOpinion
1 source
GigaBrain-0.7 : faire passer à l'échelle les modèles fondation incarnés grâce à une architecture à trois systèmes
2arXiv cs.RO 

GigaBrain-0.7 : faire passer à l'échelle les modèles fondation incarnés grâce à une architecture à trois systèmes

Publié en août 2026 sur arXiv sous la référence 2608.15875, l'article présente GigaBrain-0.7, un modèle de fondation vision-langage-action (VLA) pour robots généralistes. Son architecture à trois systèmes unifie compréhension, prédiction et génération d'action dans un seul réseau. Le préentraînement s'appuie sur plus de 37 000 heures de données robotiques hétérogènes, complété par un entraînement d'alignement en une seule étape qui optimise conjointement la compréhension vision-langage et la génération d'actions multi-embodiment. Le modèle a été évalué sur la plateforme maison Maker H01 et sur des embodiments robotiques courants, en environnements domestiques et industriels, avec des gains revendiqués face à la série précédente GigaBrain-0 et au modèle π0.5 de Physical Intelligence, en généralisation zero-shot, suivi d'instructions et taux de réussite après post-entraînement. Le code et les poids préentraînés seront publiés en open source, sans date précisée. Cette publication illustre la course à l'échelle des données dans les modèles de fondation robotiques, où le volume d'heures d'entraînement devient un argument compétitif au même titre que l'architecture. Le choix d'une architecture à trois systèmes, couplant prédiction du monde et génération d'action plutôt qu'un VLA purement réactif, reflète une tendance de fond du secteur. Pour les intégrateurs, la généralisation multi-embodiment revendiquée promet de réduire le réentraînement spécifique à chaque plateforme. La comparaison directe avec π0.5 positionne GigaBrain comme concurrent frontal des laboratoires de référence en VLA généralistes, même si les chiffres avancés restent auto-rapportés, sans benchmark indépendant ni valeurs absolues détaillées. GigaBrain-0.7 prolonge directement la série GigaBrain-0, avec un accent renouvelé sur l'hétérogénéité des données d'entraînement et l'alignement conjoint vision-langage-action. Le positionnement face à π0.5 s'inscrit dans une compétition plus large entre laboratoires développant des modèles de fondation pour robots généralistes, où l'échelle des données et la diversité des embodiments testés servent de critères de différenciation. À ce stade, il s'agit d'une publication de recherche assortie d'une promesse de publication du code et des poids, non d'un produit commercialisé ni d'un déploiement en conditions réelles : la validation indépendante des performances annoncées dépendra de leur disponibilité effective.

IA physiqueOpinion
1 source
DataLadder : une chaîne d'outils d'interconversion par simulation pour la pyramide de données de l'IA incarnée
3arXiv cs.RO 

DataLadder : une chaîne d'outils d'interconversion par simulation pour la pyramide de données de l'IA incarnée

Une équipe associée à JD Cloud publie DataLadder (arXiv:2606.16776, juin 2026), un pipeline de conversion bidirectionnel entre robots réels, simulation et démonstrations humaines, conçu pour scaler la génération de données d'entraînement et l'évaluation de politiques robotiques généralistes. L'outil repose sur deux flux complémentaires via le simulateur JoySim. Le premier, Robot vers Simulation vers Human, reconstruit des tâches réelles de rangement sur table en jumeaux numériques calibrés, puis mobilise des retours humains pour affiner la naturalité des trajectoires simulées, permettant une évaluation reproductible sans mobiliser de robot physique en continu. Le second, Human vers Simulation vers Robot, projette des démonstrations humaines filmées en vue égocentrique dans JoySim, les confronte aux contraintes physiques du robot cible, et en extrait trajectoires, annotations et observations visuelles directement utilisables en entraînement. Les modules de reconstruction, rendu et augmentation de réalisme sont exposés en services cloud sur JD Cloud. Ce travail adresse une asymétrie bien documentée : les données issues de robots réels restent la source la plus fiable, mais leur collecte est lente et coûteuse, tandis que la simulation seule souffre du sim-to-real gap. DataLadder introduit un filtre de cohérence physique dans la boucle de conversion human-to-robot, ce qui dépasse les approches de retargeting naïves. Pour les équipes développant des architectures VLA (vision-language-action), cette infrastructure pourrait réduire significativement la dépendance aux démos téléopérées, dont le coût est souvent estimé à plusieurs milliers de dollars par heure de collecte. L'accessibilité via API cloud simplifie également le déploiement pour des équipes sans cluster de simulation dédié. DataLadder s'inscrit dans la course au "data flywheel" pour robots généralistes, lancée par RT-2 (Google DeepMind, 2023) et accélérée par des politiques comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). JD.com, conglomérat e-commerce chinois opérant une large flotte logistique autonome, a un intérêt direct à industrialiser cette chaîne pour ses propres lignes de tri et de picking. Aucun benchmark comparatif avec les simulateurs concurrents Isaac Lab (NVIDIA) ou MuJoCo Playground (DeepMind) n'est fourni dans ce preprint, ce qui rend les affirmations de performance difficiles à évaluer pour l'instant. La prochaine étape attendue serait une validation quantitative sur des benchmarks standardisés de manipulation comme LIBERO ou MetaWorld.

IA physiqueOpinion
1 source
Dexmal lance MaaS incarné et DexOS, résolvant le passage à l'échelle des modèles en conditions réelles
4Pandaily 

Dexmal lance MaaS incarné et DexOS, résolvant le passage à l'échelle des modèles en conditions réelles

Dexmal, anciennement connue sous le nom de Yuanli Lingji, a dévoilé lors de sa première conférence développeurs Action une suite complète de produits d'IA incarnée destinée à répondre au problème structurel de la mise à l'échelle des modèles fondationnels sur du matériel robotique hétérogène. Au centre de l'annonce, le modèle DM0.5 voit ses paramètres doubler pour atteindre 4 milliards, entraîné sur 150 000 heures de données dont 50 000 heures issues de robots réels avec annotation 3D au millimètre près des points clés de la main, complétées par 100 000 heures d'enregistrements d'opérations humaines à la première personne. Trois choix d'architecture distinguent ce modèle : une mémoire native supportant jusqu'à 60 secondes de contexte via une couche d'abstraction intégrée au pré-entraînement, un système de raisonnement à deux niveaux qui sépare la planification des tâches de la génération de mouvement avec un entraînement contrefactuel censé garantir une réelle compréhension des instructions, et un alignement des actions par programmation dynamique contrainte pour normaliser des trajectoires exécutées à des vitesses différentes. Autour de ce modèle, Dexmal lance DexOS, présenté comme l'équivalent d'un système d'exploitation standardisé pour la robotique avec un protocole ouvert baptisé ECP, permettant aux développeurs d'intégrer leur modèle une seule fois puis de le déployer sur plusieurs plateformes matérielles. La plateforme DexDev regroupe DFOL 2.0, un système d'apprentissage par renforcement basé sur un modèle du monde (DW0.5) qui réduirait de 60% le volume de données d'entraînement robotique réel nécessaire et de 40% les coûts associés, ainsi qu'un service MaaS d'inférence facturé à l'usage. Dexmal revendique une latence d'inférence de 50 millisecondes et la possibilité d'effectuer du post-entraînement sur une simple carte grand public RTX 4090. Deux nouvelles plateformes matérielles, Apex pour l'industrie et Ferrata pour la logistique, viennent s'ajouter au bras double existant Mint. L'enjeu réel derrière cette annonce est le problème dit du N fois M : sans couche de standardisation, chaque modèle doit être réadapté à chaque configuration matérielle, ce qui freine toute diffusion à l'échelle. En misant sur un écosystème ouvert de développeurs plutôt que sur une intégration verticale fermée à la manière de Tesla ou Figure, Dexmal cherche à devenir la couche logicielle commune du secteur plutôt qu'un fournisseur de robots parmi d'autres. Le fondateur Tang Wenbin a d'ailleurs posé le vrai critère de réussite : que les développeurs choisissent DM0.5 plutôt que les alternatives open source, un test que les modèles précédents de l'entreprise n'avaient pas franchi selon lui. La promesse de réduction des données réelles nécessaires grâce à la simulation dans un modèle du monde touche directement au fossé sim-to-real qui limite encore le déploiement des VLA en conditions réelles, mais ces gains restent pour l'instant des chiffres communiqués par l'entreprise, sans validation indépendante. Le rebranding depuis Yuanli Lingji s'inscrit dans la vague d'entreprises chinoises d'IA incarnée cherchant à se positionner face aux acteurs américains comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), ainsi qu'aux humanoïdes concurrents tels qu'Optimus. Aucun acteur français ou européen n'apparaît dans cette annonce. La suite dépendra de l'adoption réelle du protocole ECP par des développeurs tiers et de déploiements pilotes concrets sur les nouvelles plateformes Apex et Ferrata, dont aucun calendrier précis n'a été communiqué.

IA physiqueActu
1 source