Aller au contenu principal
Xiaomi rend open source son modèle fondation pour l'IA incarnée, Xiaomi-Robotics-1
IA physiqueTechNode 

Xiaomi rend open source son modèle fondation pour l'IA incarnée, Xiaomi-Robotics-1

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Xiaomi a annoncé le 5 août l'ouverture en open source de son modèle fondateur d'IA incarnée Xiaomi-Robotics-1, dévoilé en juillet comme solution « prête à l'emploi », en publiant le pipeline complet, du post-entraînement sur robot réel jusqu'au déploiement, avec le code des évaluations de référence. Le modèle a été pré-entraîné sur plus de 100 000 heures de données UMI puis post-entraîné sur plus de 10 000 heures de données cross-embodiment, collectées sur différentes plateformes robotiques. La publication comprend les liens vers le projet, le dépôt GitHub et la page Hugging Face.

Cette ouverture s'inscrit dans la course aux modèles fondateurs pour la robotique, censés généraliser des compétences de manipulation sur plusieurs types de robots plutôt que nécessiter un modèle par plateforme, et elle abaisse la barrière d'entrée pour les laboratoires et intégrateurs qui veulent tester des politiques cross-embodiment sans constituer eux-mêmes des jeux de données à cette échelle. Ce choix de l'open source, plutôt qu'une simple démonstration produit, met à l'épreuve une promesse encore débattue dans le secteur : que les modèles génériques de manipulation passent réellement à l'échelle, au-delà des démonstrations sélectionnées.

Le groupe chinois, connu pour son électronique grand public et ses véhicules électriques, avait déjà affiché ses ambitions robotiques avec l'humanoïde CyberOne dévoilé en 2022, et rejoint désormais la course aux modèles fondateurs, aux côtés d'autres laboratoires chinois et internationaux qui multiplient ce type d'annonces depuis un an. Il s'agit ici d'une brique logicielle mise à disposition de la communauté, sans calendrier de déploiement industriel précisé : la suite dépendra de l'adoption du modèle par des équipes tierces sur leurs propres robots, seul vrai test de sa capacité de généralisation au-delà des données d'entraînement de Xiaomi.

Impact France/UE

Les laboratoires et intégrateurs européens peuvent librement tester ce modèle open source pour leurs propres robots, mais aucun déploiement ni partenariat français ou européen n'est mentionné.

Dans nos dossiers

À lire aussi

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde
1arXiv cs.RO 

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde

Xiaomi Robotics a publié U0, un modèle multimodal autorégressif de 38 milliards de paramètres conçu pour unifier plusieurs tâches de génération liées à la robotique au sein d'un seul système. Décrit dans un article déposé sur arXiv, U0 traite la synthèse de contenus "incarnés" comme une extension directe des modèles de génération d'images et de vidéos fondationnels, en optimisant conjointement le texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée. Selon les auteurs, il s'agit du premier modèle capable de générer des scènes cohérentes en multi-vues pour plusieurs types de robots différents, et il introduit un mécanisme de transfert structuré et contrôlable permettant une édition fine tout en préservant la cohérence géométrique et la dynamique d'interaction. Les résultats rapportés indiquent que U0 dépasse GPT-Image-2.0 lors d'évaluations humaines sur la génération et le transfert de scènes incarnées, se classe premier sur le classement World Arena pour la génération vidéo incarnée, et fait passer le taux de succès hors distribution du modèle de manipulation pi0.5 de 36,9% à 63,2% sur des tâches de manipulation réelle jugées difficiles. Le code et les checkpoints sont mis à disposition sur le site de Xiaomi Robotics. L'enjeu principal ne se situe pas dans la démonstration visuelle mais dans l'usage de U0 comme moteur de données synthétiques pour l'entraînement de politiques robotiques. Le gain mesuré sur pi0.5, un modèle vision-langage-action tiers développé par Physical Intelligence, est le point le plus significatif: il suggère qu'un monde fondationnel bien conçu peut générer des données d'entraînement suffisamment réalistes pour améliorer la généralisation d'un VLA existant sur des tâches de manipulation réelles, et pas seulement sur des métriques internes. C'est une piste concrète pour réduire l'écart simulation-vers-réel qui freine encore le déploiement à grande échelle des robots humanoïdes et bras manipulateurs, en offrant une alternative à la collecte coûteuse de données physiques. Le travail part d'un constat classique dans le secteur: adapter un modèle fondationnel pré-entraîné avec des données robotiques limitées tend à dégrader les connaissances visuelles acquises lors du pré-entraînement à grande échelle. U0 cherche à préserver cette généralisation tout en l'adaptant aux contraintes des embodiments robotiques. Il se positionne face à des approches comme GR00T N2 de NVIDIA ou les modèles Pi de Physical Intelligence, dans une course où Xiaomi investit désormais explicitement la recherche en IA incarnée. Pour l'instant, la publication reste au stade recherche: code et poids sont ouverts, mais aucun déploiement produit ni pilote industriel n'est annoncé.

IA physiqueOpinion
1 source
Xiaomi ouvre en open source son modèle du monde incarné Robotics-U0 et sa suite d'entraînement
2Pandaily 

Xiaomi ouvre en open source son modèle du monde incarné Robotics-U0 et sa suite d'entraînement

Xiaomi a publié en open source Xiaomi-Robotics-U0, un modèle de monde incarné autorégressif qui traite la génération de contenu robotique comme une extension des modèles fondation image et vidéo, plutôt que comme un simple générateur de trajectoires. La version principale compte environ 38 milliards de paramètres, entraînée en continu pour l'intelligence incarnée ; une variante Xiaomi-Robotics-U0-4B et des déclinaisons FlashAR sont aussi publiées sur Hugging Face et ModelScope, avec code d'inférence, démos Gradio et scripts d'entraînement FSDP mis en ligne début septembre. Dans un seul cadre de prédiction de token, le modèle unifie génération texte-vers-image, édition d'image, synthèse de scènes multi-vues, transfert incarné contrôlable et déroulement de vidéo, en s'appuyant sur une tokenisation IBQ et des briques issues de Qwen3-32B et de la lignée EMU3.5. Le module d'inférence FlashAR+ remplace le décodage séquentiel token par token par une génération parallèle, couplée au batching vLLM, avec un gain revendiqué de 82,9 fois à près de 83 fois en génération 1024x1024, faisant chuter la latence d'un exemple type de 450,8 à 5,44 secondes, et un score EWMScore_P de 73,64 plaçant UNIS en tête du classement WorldArena. Pour l'industrie robotique, cette ouverture d'un modèle de monde de cette taille change la donne pour les intégrateurs qui cherchent à générer des données synthétiques d'entraînement sans multiplier les collectes réelles : Xiaomi affiche une progression du taux de réussite sur des tâches d'interférence de 36,9% à 63,2% sous fonds et éclairages inédits, en mélangeant données de transfert de style et démonstrations réelles pour le post-entraînement de politiques de contrôle. Cela nourrit le débat sur la résolution du fossé simulation-réel et la viabilité des modèles vision-langage-action (VLA) à grande échelle. Les comparaisons revendiquées face à GPT-Image-2 reposent toutefois sur des jeux de test internes non vérifiés de façon indépendante, et les checkpoints vidéo restent en retard sur les versions image et transfert, ce qui invite à la prudence avant de considérer ces poids ouverts comme une usine à données prête à l'emploi pour des robots en production. Cette publication s'inscrit dans la montée en puissance de Xiaomi sur la robotique incarnée, aux côtés d'acteurs comme Nvidia et son GR00T N2, Physical Intelligence et Pi-0, ou Figure et Helix, qui développent tous des modèles de fondation pour l'action robotique. En misant sur un modèle de monde génératif plutôt que sur une politique d'action directe, Xiaomi se positionne sur la brique amont de génération de données et de simulation, complémentaire des VLA de contrôle. Xiaomi invite lui-même les équipes à vérifier les termes de licence, le choix du moteur FlashAR et la reproductibilité des scores WorldArena par des tiers avant tout déploiement en production, signe que cette publication reste à ce stade un jeu d'outils de recherche plutôt qu'un produit clé en main pour l'industrie.

IA physiqueOpinion
1 source
Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée
3TechNode 

Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée

Alibaba a publié mardi une suite robotique composée de trois modèles fondamentaux : Qwen-RobotNav, Qwen-RobotManip et Qwen-RobotWorld. Qwen-RobotNav étend les capacités vision-langage à la robotique mobile en unifiant quatre tâches au sein d'un même framework : suivi d'instructions, navigation orientée objectif, tracking de cible et conduite autonome. Qwen-RobotManip standardise l'espace état-action et représente le mouvement de l'effecteur terminal sous forme de poses incrémentielles dans le référentiel caméra, une approche conçue pour faciliter la généralisation multi-plateforme. Ce modèle a été entraîné sur plus de 38 100 heures de données entièrement open source. Qwen-RobotWorld, le troisième composant, fonctionne comme un world model généraliste : il prédit des états futurs physiquement cohérents via une interface en langage naturel, couvrant simultanément la navigation, la conduite et la manipulation depuis un seul modèle. L'approche modulaire mais unifiée est la proposition de valeur centrale de cette suite. Un world model unique opérant sur trois domaines d'action représente une architecture qui, si elle tient ses promesses en conditions réelles, réduirait significativement les coûts d'intégration pour les équipes robotiques industrielles. L'utilisation de données entièrement open source pour Qwen-RobotManip est un signal notable dans un secteur où les datasets propriétaires constituent souvent un avantage concurrentiel défensif : Alibaba positionne ainsi Qwen-Robot davantage comme une infrastructure partagée que comme un produit fermé. Réserve importante cependant : l'annonce ne s'accompagne d'aucun benchmark public (RLBench, LIBERO, CARLA) ni de déploiement physique documenté. Il s'agit d'une publication de modèles, pas d'un produit shipé. L'équipe Qwen d'Alibaba est reconnue pour ses modèles multimodaux (Qwen2.5-VL, QwQ), mais ce lancement marque son entrée explicite dans l'embodied AI. Le terrain est disputé : Google DeepMind pousse ses dérivés de RT-2, Physical Intelligence a publié Pi-0 et Pi-0.5, Hugging Face soutient l'initiative LeRobot, et NVIDIA propose GR00T N2 comme backbone pour les robots humanoïdes partenaires. Côté chinois, Unitree, Agibot et Zhiyuan Robot accélèrent eux aussi leurs pipelines VLA (vision-language-action). La prochaine étape pour Alibaba sera de démontrer des résultats sur des plateformes matérielles réelles ; faute de quoi, Qwen-Robot restera un framework académique parmi d'autres dans une course déjà très chargée.

UEImpact indirect sur l'écosystème européen : la suite open-source d'Alibaba accentue la pression concurrentielle sur les initiatives VLA portées par des acteurs à ancrage européen comme Hugging Face (LeRobot), sans déploiement physique documenté en Europe à ce stade.

IA physiqueOpinion
1 source
Skild AI dévoile S1, son modèle fondation phare pour la robotique
4Robotics Business Review 

Skild AI dévoile S1, son modèle fondation phare pour la robotique

Skild AI a dévoilé S1, son modèle de fondation robotique phare, conçu pour l'apprentissage en contexte : une vidéo d'un humain réalisant une tâche, ajoutée au prompt, suffit au robot pour la reproduire sans réentraînement, explique le cofondateur et PDG Deepak Pathak. Fondée en 2023, la start-up a levé près de 1,7 milliard de dollars pour bâtir ce "cerveau" robotique généraliste. S1 cible des tâches longues, jusqu'à dix minutes, comme rempoter une plante, préparer un café ou cuisiner des pancakes, plutôt que les gestes de quelques secondes habituellement démontrés. Il combine quatre sources de données d'entraînement, téléopération, vidéos humaines, simulation et gants de capture de mouvement, chacune compensant les limites des autres. Pathak affirme que le robot a improvisé le retournement d'une crêpe à la spatule sans aucun exemple de ce geste dans ses millions d'heures de données d'entraînement, en généralisant à partir de la seule vidéo du prompt. Le modèle est dit "omni-corps", fonctionnant sur bras fixes, quadrupèdes et humanoïdes. Cette annonce s'inscrit dans le débat sur un éventuel "moment ChatGPT" de la robotique, où un modèle de fondation unique remplacerait le post-entraînement tâche par tâche qui freine aujourd'hui le passage à l'échelle des déploiements. Si ces résultats se confirment sur des tâches longues et non scriptées, ils contrediraient l'idée que l'apprentissage en contexte ne fonctionne que sur des gestes courts déjà vus en simulation. Pour les intégrateurs, un modèle apprenant par une seule vidéo démonstrative réduirait le coût de reconfiguration des robots face à de nouvelles lignes ou de nouvelles références produits. Skild AI n'a toutefois publié ni protocole de test indépendant, ni taux de réussite chiffré, ni durée de cycle précise : ces démonstrations restent une vitrine contrôlée plutôt qu'un produit validé en conditions industrielles. L'entreprise reconnaît elle-même que ses résultats sur humanoïdes, capables de continuer une tâche après la perte d'un membre, proviennent d'une version antérieure du modèle, pas encore mise à l'échelle. Skild AI a été cofondée en 2023 par Deepak Pathak et Abhinav Gupta, chercheurs issus de Carnegie Mellon, avec l'ambition de vendre un modèle de fondation indépendant du matériel plutôt que de construire son propre robot. Ses près de 1,7 milliard de dollars levés en font l'un des acteurs les mieux capitalisés du secteur, aux côtés de rivaux développant leurs propres modèles vision-langage-action, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, tandis que des humanoïdes comme Optimus ou Figure 03 restent pilotés par des piles logicielles propriétaires intégrées verticalement. Contrairement à ces approches liées à un matériel spécifique, Skild positionne S1 comme une couche logicielle tierce, applicable à des plateformes existantes. L'entreprise dit vouloir concentrer ses prochains efforts sur l'amélioration de S1 sur humanoïdes, sans donner de calendrier de déploiement pilote ni de client industriel nommé à ce stade.

IA physiqueActu
1 source