Aller au contenu principal
Un robot qui apprend à partir de vidéos courtes en 29 secondes : HOST, la nouvelle recette d'IA incarnée de X Square Robot
IA physiquePandaily 

Un robot qui apprend à partir de vidéos courtes en 29 secondes : HOST, la nouvelle recette d'IA incarnée de X Square Robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le robot humanoïde chinois X Square Robot a mis en open source HOST, un framework d'apprentissage par vidéo qui permet à un robot de reproduire une tâche dès sa première tentative, après avoir simplement regardé un clip de démonstration de 29 secondes. Sur ce test, HOST atteint un taux de réussite de 62%, contre 38% pour la méthode standard actuelle qui nécessite environ 50 démonstrations expertes et quatre heures de fine-tuning. Le système repose sur deux modules: un module de vision qui reconstruit la scène observée du point de vue du robot, et un module d'action qui calcule la trajectoire articulaire correspondante, le tout aligné par un mécanisme de dynamic time warping qui réduit l'erreur d'alignement d'un facteur dix environ. Fondée fin 2023 à Pékin, X Square Robot a levé plus d'un milliard de yuans sur huit tours de table, avec Meituan Strategic Investment, Alibaba Cloud, Lenovo Capital et Delian Capital parmi ses investisseurs.

L'enjeu dépasse la simple prouesse technique: la collecte de données par téléopération, aujourd'hui dominante dans le secteur, repose sur des ingénieurs équipés de casques VR qui pilotent un bras robotique geste par geste, des dizaines de fois, pour chaque tâche. Un robot de collecte coûte plusieurs centaines de milliers de dollars et chaque démonstration peut dépasser cent dollars en coût marginal, un modèle que même les "fabriques de données" en Inde ou les travailleurs à temps partiel des zones rurales chinoises ne parviennent pas à rendre réellement scalable. En inversant la logique, c'est à dire en apprenant à l'inférence plutôt qu'en réentraînant hors ligne sur des données massives, HOST attaque directement ce goulot d'étranglement économique. Si l'approche tient à l'échelle au-delà du benchmark de recherche, elle rebattrait les cartes pour les intégrateurs et décideurs industriels en réduisant drastiquement le coût d'acquisition de nouvelles compétences robotiques, un argument central dans la course actuelle entre laboratoires embodied-AI.

Il faut toutefois noter que le chiffre de 62% reste une mesure de recherche sur benchmark, pas une performance de déploiement en conditions réelles, et l'article ne précise pas la diversité des tâches testées ni les conditions d'évaluation. L'approche s'inspire de la théorie cognitive de la simulation, selon laquelle l'humain répète mentalement le résultat visé avant d'agir, une logique que l'équipe chinoise transpose à l'apprentissage robotique en remplaçant l'imitation articulation par articulation par une reconstruction de la scène finale suivie d'un calcul de trajectoire. Le choix de l'open source vise explicitement à capter l'attention des développeurs comme tremplin vers des pilotes en entreprise, une stratégie de positionnement qui s'inscrit dans la compétition plus large entre approches VLA telles que Pi-0, GR00T N2 ou Helix, où la question du passage à l'échelle depuis la démonstration jusqu'au déploiement industriel reste largement ouverte.

À lire aussi

Skild AI utilise l'IA physique de NVIDIA pour apprendre de nouvelles tâches aux robots à partir d'une seule vidéo
1NVIDIA Blog Robotics 

Skild AI utilise l'IA physique de NVIDIA pour apprendre de nouvelles tâches aux robots à partir d'une seule vidéo

Skild AI a lancé la semaine dernière S1, un modèle de fondation robotique capable d'apprendre une tâche inédite à partir d'une seule vidéo de démonstration, sans réentraînement ni mise à jour de ses poids, une méthode dite d'apprentissage "en contexte". Entraîné sur l'infrastructure NVIDIA (simulation Isaac Lab, modèles de monde Cosmos), S1 interprète l'intention, les objets et la séquence montrés, puis les transpose en actions pour le robot présent, même hors de ses données d'entraînement. Il exécute des tâches de jusqu'à dix minutes, rempotage de plantes, préparation de pancakes, café filtre, assemblage de kits, en enchaînant des dizaines d'étapes de manipulation. Lors d'un test de rempotage, onze minutes ont suffi entre l'enregistrement de la démonstration et l'exécution autonome sur le robot. Skild annonce 66% de réussite par étape sur des tâches multi-étapes nouvelles, contre 9% pour un système comparable non identifié, soit un facteur sept, et estime qu'une seule vidéo équivaut à environ 380 exemples d'entraînement manuels, soit 50 à 100 heures de collecte. Cofondée par Deepak Pathak, la startup revendique un taux de revenu annualisé de 100 millions de dollars dix mois après son premier déploiement commercial, avec plus de 60 partenariats en logistique, inspection, sécurité, restauration et industrie manufacturière. L'enjeu pour l'industrie est de sortir de la reprogrammation systématique: chaque changement de produit, de process ou de disposition de ligne impose d'ordinaire une nouvelle collecte de données et un nouvel entraînement, un frein connu à l'adoption des robots sur des sites qui évoluent en permanence. Si ces résultats se confirment hors des tests internes de Skild, cela rapprocherait les modèles vision-langage-action d'un usage industriel réel plutôt que d'une démonstration de laboratoire, avec un argument concret face à des modèles concurrents comme Pi-0 de Physical Intelligence, GR00T N2 ou Helix. Les chiffres avancés (66% contre 9%, équivalence à 380 exemples) restent toutefois des mesures internes, sans protocole indépendant ni identification du système comparé, à lire comme une tendance plutôt qu'une preuve définitive. Le déploiement le plus tangible reste celui mené avec Foxconn: Skild et NVIDIA font tourner le "Skild Brain" sur des bras manipulateurs bimanuels pour l'assemblage de précision de systèmes NVIDIA Blackwell, un robot posant une busbar et un bloc de fin de course puis vissant 16 vis tout en s'adaptant aux aléas. S1 s'inscrit dans une collaboration plus large entre Skild et NVIDIA, couvrant génération de données synthétiques, entraînement, simulation et déploiement en conditions réelles, illustrant la stratégie de NVIDIA consistant à fournir l'infrastructure de toute la chaîne robotique plutôt qu'à concurrencer directement les fabricants de robots. Skild revendique plus de 60 partenariats noués en dix mois, signe d'une commercialisation rapide dans un secteur où beaucoup d'acteurs en sont encore au stade du pilote. Ni le calendrier d'extension du déploiement chez Foxconn ni l'ouverture de S1 à d'autres intégrateurs ne sont précisés, et les vidéos diffusées sur le blog de NVIDIA relèvent de la démonstration commerciale plutôt que d'un rapport technique indépendant, dans une tendance de fond où les modèles de fondation robotiques, entraînés sur des données vidéo et simulées à grande échelle, cherchent à remplacer la programmation tâche par tâche qui limite depuis des décennies la flexibilité des robots industriels.

IA physiqueActu
1 source
Un nouveau modèle robotique apprend des compétences physiques à partir d'une seule démonstration de 3 à 12 secondes
2Interesting Engineering 

Un nouveau modèle robotique apprend des compétences physiques à partir d'une seule démonstration de 3 à 12 secondes

Generalist AI a présenté GEN-1.5, un modèle de fondation pour robots capable d'apprendre une tâche physique à partir d'une seule démonstration de 3 à 12 secondes, sans mise à jour de gradient ni fine-tuning préalable. Testé sur dix tâches de manipulation courtes et simples (dévisser le couvercle d'un bocal en verre, récupérer de l'argent dans un sac à main, empiler des gobelets, balayer des déchets, ouvrir un livre, dézipper une trousse à crayons, retirer un embout d'aspirateur), le modèle atteint un taux de réussite moyen de 59% avec une seule démonstration. Ce taux monte à 83% avec cinq minutes de données spécifiques à la tâche et dix étapes de gradient, soit l'équivalent de 10 à 50 démonstrations. GEN-1.5 est un modèle multimodal traitant vidéo, données de capteurs, langage et proprioception, qui conserve 30 secondes de contexte et génère des trajectoires d'action à 100 Hz. La démonstration, capturée via des pinces tenues à la main ou exécutée par le robot lui-même, sert de "prompt physique" placé dans la fenêtre de contexte du modèle. Cette approche s'oppose à l'entraînement robotique classique, où chaque nouvelle tâche exige habituellement des données spécifiques abondantes et des cycles d'optimisation répétés. Generalist AI affirme ne pas avoir spécifiquement entraîné GEN-1.5 à l'apprentissage en contexte, ni ajouté de boucles de méta-apprentissage ou de modifications architecturales dédiées, ce qui rend le résultat notable dans le champ des modèles vision-langage-action (VLA). Pour les intégrateurs industriels, la promesse est une baisse du coût de déploiement: montrer un geste une fois plutôt que réentraîner un robot pour chaque nouvelle référence. Le modèle a aussi enchaîné deux prompts physiques distincts, dézipper une trousse puis en extraire de l'argent, en générant lui-même les mouvements de transition absents des démonstrations, et a transféré un geste appris en simulation vers un robot réel sans données simulées dans son pré-entraînement, ce qui va dans le sens d'un fossé sim-to-real partiellement comblé. Les taux annoncés (59% à 83%) restent toutefois loin des standards de fiabilité industrielle, et l'évaluation, menée en interne sur des tâches volontairement simples, n'a pas été validée de façon indépendante. Generalist AI s'inscrit dans la vague de laboratoires développant des modèles de fondation généralistes pour la robotique, aux côtés d'acteurs comme Physical Intelligence ou NVIDIA, qui poursuivent des objectifs similaires de réduction de l'entraînement tâche par tâche. Le modèle a montré des comportements improvisés: après avoir appris à balayer un bloc vers un bol avec une brosse, il a utilisé une banane en substitut, puis développé une stratégie différente (soulever et verser) avec une pelle à poussière. Un test a montré le robot reproduire, avec ses propres mains, un geste démontré par un humain visible via ses caméras. Ces résultats relèvent pour l'instant de la démonstration de recherche, sans date de disponibilité, pilote industriel ni déploiement en usine annoncé. L'entreprise les présente comme une étape vers une reprogrammation des robots par simple démonstration plutôt que par instructions codées, un pari qui reste à confirmer hors des tests contrôlés en laboratoire.

IA physiqueActu
1 source
Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine
3arXiv cs.RO 

Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine

Des chercheurs présentent dans un preprint arXiv (2505.20795, soumis en mai 2025) un framework en deux étapes permettant à un robot d'apprendre une nouvelle tâche de manipulation en regardant simplement une vidéo de démonstration humaine, sans collecter de données de téléopération ni effectuer de fine-tuning du modèle. Le système repose d'abord sur un modèle de génération vidéo entraîné par cross-prediction sur un dataset mixte humain-robot, pour construire une représentation latente commune aux deux modalités. Ensuite, une perte contrastive prototypique ("prototypical contrastive loss") aligne cet espace de représentation avec un espace d'action partagé entre humain et robot. À l'inférence, une vidéo de démonstration humaine sert directement de prompt : le robot exécute la tâche correspondante sans aucune adaptation. Les validations portent sur des tâches de manipulation dextre en environnement réel. L'enjeu industriel est direct : la collecte de données de téléopération reste le goulot d'étranglement majeur du robot learning, coûteuse, lente, dépendante d'opérateurs qualifiés. Si l'approche tient à l'échelle, elle réduirait drastiquement le coût d'onboarding d'une nouvelle tâche, passant de plusieurs heures de collecte à quelques secondes de vidéo. C'est précisément le type de capacité qui intéresse les intégrateurs industriels et les startups d'AMR cherchant à déployer des politiques généralisables sans retraining continu. Cela dit, le papier reste un preprint académique : les résultats portent sur un nombre limité de tâches de manipulation, et l'absence de métriques comparatives détaillées (nombre de démonstrations, taux de succès absolu, diversité des saisies) rend l'évaluation de la robustesse difficile à ce stade. La question du "demonstration gap" humain-robot est travaillée depuis plusieurs années, notamment via les travaux sur les video-language-action models (VLA) et des approches comme ACT ou Diffusion Policy chez des labos comme Stanford, CMU, ou encore Physical Intelligence (Pi-0). L'originalité ici réside dans le découplage explicite entre représentation et action via la cross-prediction, plutôt que l'alignement direct de trajectoires. Des acteurs comme 1X, Sanctuary AI ou Figure (avec son modèle Helix) explorent des pistes similaires côté industriel. La prochaine étape logique pour cette ligne de recherche est la généralisation à des objets non vus et à des scènes plus encombrées, deux conditions qui font souvent échouer les approches zero-shot en déploiement réel.

IA physiqueOpinion
1 source
Vidéo : un robot humanoïde apprend à combattre et à s'entraîner de façon autonome, sans contrôle humain
4Interesting Engineering 

Vidéo : un robot humanoïde apprend à combattre et à s'entraîner de façon autonome, sans contrôle humain

Unitree Robotics a publié une vidéo montrant son robot humanoïde G1 combattre en sparring, sans télécommande, face à un partenaire humain. Le système repose sur un nouveau modèle d'IA baptisé UnifoLM-X2-1.0, qui remplace le pilotage classique via casque VR ou manette par une architecture de perception-action prédictive : elle traite en continu l'environnement, anticipe l'évolution probable de la scène et du geste de l'adversaire, puis planifie les mouvements du robot avant leur exécution. Dans la vidéo, le G1 ajuste sa garde et son jeu de jambes, esquive des coups entrants et enchaîne poings et pieds en temps réel. Des visualisations superposées montrent les prédictions de trajectoires futures intégrées au planning moteur. Unitree présente UnifoLM-X2-1.0 comme un modèle "monde-action" conçu pour réduire le délai entre perception, décision et action physique lors d'interactions très dynamiques. Un détail technique tempère toutefois l'annonce : les journaux de la console affichent des commandes comme OBS/replan et env.step, ce qui suggère que les données des capteurs sont envoyées à un ordinateur externe exécutant le modèle, qui renvoie ensuite les instructions de mouvement au robot. Le calcul embarqué complet n'est donc pas encore acquis. Cette démonstration marque une étape dans le passage des humanoïdes du télépilotage vers une autonomie de décision réelle, un enjeu suivi de près par les intégrateurs et décideurs industriels qui veulent des robots capables de réagir à des environnements physiques changeants sans opérateur. Le combat sert ici de banc d'essai extrême pour l'IA physique : si un robot peut prédire les mouvements d'un adversaire, garder son équilibre et répondre à des contacts imprévus en une fraction de seconde, la même architecture pourrait, selon Unitree, sécuriser des tâches en environnement industriel complexe où collisions et imprévus sont fréquents. Mais la dépendance apparente à un calcul déporté relativise la promesse d'autonomie totale et rappelle l'écart persistant entre démonstration filmée et déploiement en conditions réelles, un travers récurrent du secteur humanoïde. UnifoLM-X2-1.0 s'inscrit dans la famille de modèles fondation qu'Unitree développe depuis ses premiers systèmes dédiés à la manipulation en usine, désormais élargis vers des architectures multimodales combinant perception, prédiction du monde et action. La démonstration positionne Unitree face aux autres approches VLA du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, toutes engagées dans la course à des modèles généralistes capables de contrôler un corps humanoïde sans scripts figés. Aucune date de déploiement commercial ni de pilote industriel n'a été communiquée à ce stade ; la vidéo reste une démonstration de capacité technologique, destinée à illustrer la trajectoire de recherche d'Unitree plutôt qu'un produit prêt à l'emploi.

IA physiqueActu
1 source