Aller au contenu principal
Un nouveau modèle robotique apprend des compétences physiques à partir d'une seule démonstration de 3 à 12 secondes
IA physiqueInteresting Engineering 

Un nouveau modèle robotique apprend des compétences physiques à partir d'une seule démonstration de 3 à 12 secondes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Un nouveau modèle robotique apprend des compétences physiques à partir d'une seule démonstration de 3 à 12 secondes
▶ Voir sur YouTube

Generalist AI a présenté GEN-1.5, un modèle de fondation pour robots capable d'apprendre une tâche physique à partir d'une seule démonstration de 3 à 12 secondes, sans mise à jour de gradient ni fine-tuning préalable. Testé sur dix tâches de manipulation courtes et simples (dévisser le couvercle d'un bocal en verre, récupérer de l'argent dans un sac à main, empiler des gobelets, balayer des déchets, ouvrir un livre, dézipper une trousse à crayons, retirer un embout d'aspirateur), le modèle atteint un taux de réussite moyen de 59% avec une seule démonstration. Ce taux monte à 83% avec cinq minutes de données spécifiques à la tâche et dix étapes de gradient, soit l'équivalent de 10 à 50 démonstrations. GEN-1.5 est un modèle multimodal traitant vidéo, données de capteurs, langage et proprioception, qui conserve 30 secondes de contexte et génère des trajectoires d'action à 100 Hz. La démonstration, capturée via des pinces tenues à la main ou exécutée par le robot lui-même, sert de "prompt physique" placé dans la fenêtre de contexte du modèle.

Cette approche s'oppose à l'entraînement robotique classique, où chaque nouvelle tâche exige habituellement des données spécifiques abondantes et des cycles d'optimisation répétés. Generalist AI affirme ne pas avoir spécifiquement entraîné GEN-1.5 à l'apprentissage en contexte, ni ajouté de boucles de méta-apprentissage ou de modifications architecturales dédiées, ce qui rend le résultat notable dans le champ des modèles vision-langage-action (VLA). Pour les intégrateurs industriels, la promesse est une baisse du coût de déploiement: montrer un geste une fois plutôt que réentraîner un robot pour chaque nouvelle référence. Le modèle a aussi enchaîné deux prompts physiques distincts, dézipper une trousse puis en extraire de l'argent, en générant lui-même les mouvements de transition absents des démonstrations, et a transféré un geste appris en simulation vers un robot réel sans données simulées dans son pré-entraînement, ce qui va dans le sens d'un fossé sim-to-real partiellement comblé. Les taux annoncés (59% à 83%) restent toutefois loin des standards de fiabilité industrielle, et l'évaluation, menée en interne sur des tâches volontairement simples, n'a pas été validée de façon indépendante.

Generalist AI s'inscrit dans la vague de laboratoires développant des modèles de fondation généralistes pour la robotique, aux côtés d'acteurs comme Physical Intelligence ou NVIDIA, qui poursuivent des objectifs similaires de réduction de l'entraînement tâche par tâche. Le modèle a montré des comportements improvisés: après avoir appris à balayer un bloc vers un bol avec une brosse, il a utilisé une banane en substitut, puis développé une stratégie différente (soulever et verser) avec une pelle à poussière. Un test a montré le robot reproduire, avec ses propres mains, un geste démontré par un humain visible via ses caméras. Ces résultats relèvent pour l'instant de la démonstration de recherche, sans date de disponibilité, pilote industriel ni déploiement en usine annoncé. L'entreprise les présente comme une étape vers une reprogrammation des robots par simple démonstration plutôt que par instructions codées, un pari qui reste à confirmer hors des tests contrôlés en laboratoire.

À lire aussi

Skild AI utilise l'IA physique de NVIDIA pour apprendre de nouvelles tâches aux robots à partir d'une seule vidéo
1NVIDIA Blog Robotics 

Skild AI utilise l'IA physique de NVIDIA pour apprendre de nouvelles tâches aux robots à partir d'une seule vidéo

Skild AI a lancé la semaine dernière S1, un modèle de fondation robotique capable d'apprendre une tâche inédite à partir d'une seule vidéo de démonstration, sans réentraînement ni mise à jour de ses poids, une méthode dite d'apprentissage "en contexte". Entraîné sur l'infrastructure NVIDIA (simulation Isaac Lab, modèles de monde Cosmos), S1 interprète l'intention, les objets et la séquence montrés, puis les transpose en actions pour le robot présent, même hors de ses données d'entraînement. Il exécute des tâches de jusqu'à dix minutes, rempotage de plantes, préparation de pancakes, café filtre, assemblage de kits, en enchaînant des dizaines d'étapes de manipulation. Lors d'un test de rempotage, onze minutes ont suffi entre l'enregistrement de la démonstration et l'exécution autonome sur le robot. Skild annonce 66% de réussite par étape sur des tâches multi-étapes nouvelles, contre 9% pour un système comparable non identifié, soit un facteur sept, et estime qu'une seule vidéo équivaut à environ 380 exemples d'entraînement manuels, soit 50 à 100 heures de collecte. Cofondée par Deepak Pathak, la startup revendique un taux de revenu annualisé de 100 millions de dollars dix mois après son premier déploiement commercial, avec plus de 60 partenariats en logistique, inspection, sécurité, restauration et industrie manufacturière. L'enjeu pour l'industrie est de sortir de la reprogrammation systématique: chaque changement de produit, de process ou de disposition de ligne impose d'ordinaire une nouvelle collecte de données et un nouvel entraînement, un frein connu à l'adoption des robots sur des sites qui évoluent en permanence. Si ces résultats se confirment hors des tests internes de Skild, cela rapprocherait les modèles vision-langage-action d'un usage industriel réel plutôt que d'une démonstration de laboratoire, avec un argument concret face à des modèles concurrents comme Pi-0 de Physical Intelligence, GR00T N2 ou Helix. Les chiffres avancés (66% contre 9%, équivalence à 380 exemples) restent toutefois des mesures internes, sans protocole indépendant ni identification du système comparé, à lire comme une tendance plutôt qu'une preuve définitive. Le déploiement le plus tangible reste celui mené avec Foxconn: Skild et NVIDIA font tourner le "Skild Brain" sur des bras manipulateurs bimanuels pour l'assemblage de précision de systèmes NVIDIA Blackwell, un robot posant une busbar et un bloc de fin de course puis vissant 16 vis tout en s'adaptant aux aléas. S1 s'inscrit dans une collaboration plus large entre Skild et NVIDIA, couvrant génération de données synthétiques, entraînement, simulation et déploiement en conditions réelles, illustrant la stratégie de NVIDIA consistant à fournir l'infrastructure de toute la chaîne robotique plutôt qu'à concurrencer directement les fabricants de robots. Skild revendique plus de 60 partenariats noués en dix mois, signe d'une commercialisation rapide dans un secteur où beaucoup d'acteurs en sont encore au stade du pilote. Ni le calendrier d'extension du déploiement chez Foxconn ni l'ouverture de S1 à d'autres intégrateurs ne sont précisés, et les vidéos diffusées sur le blog de NVIDIA relèvent de la démonstration commerciale plutôt que d'un rapport technique indépendant, dans une tendance de fond où les modèles de fondation robotiques, entraînés sur des données vidéo et simulées à grande échelle, cherchent à remplacer la programmation tâche par tâche qui limite depuis des décennies la flexibilité des robots industriels.

IA physiqueActu
1 source
PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration
2arXiv cs.RO 

PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration

Une équipe de chercheurs présente PGDG (Physically Grounded Data Generation), un cadre qui permet d'entraîner une politique de manipulation bimanuelles robuste à partir d'une seule démonstration humaine. Déposé sur arXiv en mai 2026 (réf. 2605.21710), le système attaque un problème structurant du behavior cloning : tout écart par rapport à la trajectoire apprise plonge le robot dans des états hors distribution, sans signal de récupération disponible dans les données d'entraînement. PGDG génère automatiquement, sans annotation humaine supplémentaire, un ensemble compact de trajectoires physiquement plausibles couvrant ces comportements de récupération manquants. Il alterne entre un échantillonneur ancré en physique et un curateur de données qui oriente progressivement l'exploration vers les modes sous-représentés, complété par un reétiquetage d'actions correctives sur les états risqués. Sur la tâche RotateBox-Pitch, manipulation bimanuelles par contact, le taux de succès passe de 38 % à 93 % en simulation et de 35 % à 82 % en transfert zéro-shot vers le robot réel. Appliqué au fine-tuning de GR00T, le modèle de fondation vision-langage-action de NVIDIA, la méthode améliore le taux de succès de 46 % à 77 %. Le résultat le plus notable pour les intégrateurs est le transfert zéro-shot : la politique entraînée exclusivement sur données synthétiques fonctionne directement sur le robot physique, sans adaptation terrain. Ce résultat valide empiriquement que la génération ancrée en physique peut combler le sim-to-real gap pour les tâches en contact, historiquement le talon d'Achille de la manipulation dextère. La compatibilité avec GR00T (un VLA) ouvre également une voie pour enrichir les modèles de fondation à faible coût de collecte : une démonstration unique remplace les centaines typiquement requises en téléopération, ce qui modifie le calcul économique pour tout projet de déploiement à grande variété de configurations. Ce travail s'inscrit dans la course à l'efficacité des données en robotique manipulatrice. L'augmentation spatiale classique, premier concurrent direct, est systématiquement surpassée sur les quatre tâches testées. Les approches alternatives misent soit sur la collecte massive comme ACT/ALOHA (des milliers de démonstrations), soit sur le pré-entraînement multi-tâche à grande échelle comme pi-0 de Physical Intelligence. PGDG se distingue par son paradigme "une démonstration suffit", potentiellement attractif dès que la diversité des pièces ou des configurations rend la collecte par tâche prohibitive. La validation reste pour l'instant en environnement laboratoire ; une évaluation sur des tâches industrielles réelles constituerait la prochaine étape logique.

💬 Une démo au lieu de mille, et le robot fonctionne directement sur le physique sans adaptation terrain. Le sim-to-real sur de la manipulation par contact, c'était le blocage structurel depuis des années, et là ils sortent 82% en zéro-shot sur le robot réel, c'est pas un résultat qu'on voit souvent. Reste à tenir hors labo.

IA physiqueOpinion
1 source
Apprendre la physique à partir de modèles vidéo préentraînés : modèles du monde continus et séquentiels pour la manipulation robotique
3arXiv cs.RO 

Apprendre la physique à partir de modèles vidéo préentraînés : modèles du monde continus et séquentiels pour la manipulation robotique

Une équipe de chercheurs propose PhysGen, un cadre d'apprentissage publié en prépublication sur arXiv (réf. 2603.00110v2), qui exploite des modèles de génération vidéo pré-entraînés comme substituts de simulateurs physiques pour la manipulation robotique. L'idée centrale est de traiter la vidéo générée de manière autorégressive comme un proxy du monde physique, et d'y greffer des actions robotiques continues via une représentation unifiée baptisée "physical tokens", des jetons partagés qui fusionnent la modalité vidéo et les commandes motrices. Pour assurer la convergence, PhysGen intègre du masquage causal, de la cinématique inverse, une prédiction multi-tokens anticipative (L-MTP) et du cache clé-valeur (KV caching). Sur les benchmarks Libero et ManiSkill, le système surpasse OpenVLA de 13,8 points et WorldVLA de 8,8 points. Plus frappant : en conditions réelles, PhysGen atteint les performances de π₀ (Physical Intelligence) sur des tâches physiquement exigeantes, notamment la saisie d'objets transparents, sans avoir bénéficié d'un pré-entraînement spécifique aux données d'action. L'enjeu pour l'industrie est direct : la pénurie de données robotiques à grande échelle reste le principal frein à la généralisation des politiques de manipulation. PhysGen contourne ce goulot en recyclant des modèles vidéo entraînés sur des corpus massifs d'internet pour en extraire une intuition physique implicite, permanence des objets, dynamique de contact, sans collecter de trajectoires robot. Le fait de rivaliser avec π₀ sans son pré-entraînement propriétaire sur des données d'action est une validation partielle de l'hypothèse que le "sim-to-real gap" peut être réduit par la connaissance du monde visuel plutôt que par des démonstrations téléopérées. Cela dit, les résultats restent issus d'un papier de recherche avec des benchmarks sélectifs ; la robustesse sur des scènes industrielles non structurées reste à démontrer. PhysGen s'inscrit dans un courant actif qui voit les laboratoires de robotique piller les architectures de génération multimodale pour nourrir leurs politiques de contrôle : UniSim, Genie, et surtout WorldVLA avaient déjà exploré cette piste. Physical Intelligence (π₀) représente aujourd'hui la référence en termes de performances sur tâches réelles grâce à son pré-entraînement massif sur données d'action hétérogènes, ce qui rend la comparaison de PhysGen d'autant plus significative. OpenVLA (Berkeley) constitue le concurrent open-source direct. La prochaine étape logique pour les auteurs serait une évaluation sur des manipulateurs industriels multi-DOF en environnement non contrôlé, et une intégration avec des pipelines de données synthétiques pour réduire encore la dépendance aux démonstrations humaines.

IA physiqueOpinion
1 source
Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine
4arXiv cs.RO 

Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine

Des chercheurs présentent dans un preprint arXiv (2505.20795, soumis en mai 2025) un framework en deux étapes permettant à un robot d'apprendre une nouvelle tâche de manipulation en regardant simplement une vidéo de démonstration humaine, sans collecter de données de téléopération ni effectuer de fine-tuning du modèle. Le système repose d'abord sur un modèle de génération vidéo entraîné par cross-prediction sur un dataset mixte humain-robot, pour construire une représentation latente commune aux deux modalités. Ensuite, une perte contrastive prototypique ("prototypical contrastive loss") aligne cet espace de représentation avec un espace d'action partagé entre humain et robot. À l'inférence, une vidéo de démonstration humaine sert directement de prompt : le robot exécute la tâche correspondante sans aucune adaptation. Les validations portent sur des tâches de manipulation dextre en environnement réel. L'enjeu industriel est direct : la collecte de données de téléopération reste le goulot d'étranglement majeur du robot learning, coûteuse, lente, dépendante d'opérateurs qualifiés. Si l'approche tient à l'échelle, elle réduirait drastiquement le coût d'onboarding d'une nouvelle tâche, passant de plusieurs heures de collecte à quelques secondes de vidéo. C'est précisément le type de capacité qui intéresse les intégrateurs industriels et les startups d'AMR cherchant à déployer des politiques généralisables sans retraining continu. Cela dit, le papier reste un preprint académique : les résultats portent sur un nombre limité de tâches de manipulation, et l'absence de métriques comparatives détaillées (nombre de démonstrations, taux de succès absolu, diversité des saisies) rend l'évaluation de la robustesse difficile à ce stade. La question du "demonstration gap" humain-robot est travaillée depuis plusieurs années, notamment via les travaux sur les video-language-action models (VLA) et des approches comme ACT ou Diffusion Policy chez des labos comme Stanford, CMU, ou encore Physical Intelligence (Pi-0). L'originalité ici réside dans le découplage explicite entre représentation et action via la cross-prediction, plutôt que l'alignement direct de trajectoires. Des acteurs comme 1X, Sanctuary AI ou Figure (avec son modèle Helix) explorent des pistes similaires côté industriel. La prochaine étape logique pour cette ligne de recherche est la généralisation à des objets non vus et à des scènes plus encombrées, deux conditions qui font souvent échouer les approches zero-shot en déploiement réel.

IA physiqueOpinion
1 source