Aller au contenu principal
IA physiquePandaily 

Knowin détaille GLOW, un cadre d'apprentissage incarné pour enseigner une tâche à un robot en une seule démonstration

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Knowin, entreprise d'IA embodied fondée en août 2025, a publié le 24 septembre un rapport technique sur GLOW (Generative Learning of World). Ce cadre vise à permettre à un robot domestique d'apprendre une tâche à partir d'une seule démonstration humaine complète, puis de réutiliser la compétence sur d'autres objets, environnements et tâches, sans réentraînement ni mise à jour des paramètres. GLOW compte quatre briques. KnowinGLOW est un modèle autorégressif multimodal unifié (vision, raisonnement spatial, planification, génération d'actions) qui sort directement des poses d'effecteur et des commandes de pince. KnowinDream produit de l'expérience domestique simulée en transformant des routines familiales en scènes 3D, avec variation de l'éclairage, des matériaux, des objets et des points de vue. KnowinWorld simule les résultats d'actions candidates et les classe selon l'avancement de la tâche, la cohérence physique, l'atteignabilité et le risque. KnowinAgent (« Harness ») est le runtime qui gère mémoire, appels d'outils, requêtes spatiales, retours d'exécution et replanification. Un encodeur compresse la vidéo de démonstration en contexte de compétence, exploité par apprentissage en contexte avec des poids figés. Knowin montre le rangement de boîtes, l'arrosage d'une plante, l'essuyage d'une table et la préparation de boissons. Dans une tâche de tiroir, le robot a demandé un déplacement de 24,3 mm mais n'en a obtenu que 1,6 mm, a détecté l'obstruction et a changé d'approche.

Sur 18 tâches simulées RoboDojo, GLOW affiche 62,2 % de réussite moyenne et un score de 71,1, contre 22,2 % et 29,8 pour une base de comparaison fondée sur GPT-6. Sur six conditions de perturbation LIBERO-Pro, il atteint 86,7 % en politique unique, le meilleur score parmi les modèles à politique unique du tableau comparatif, tandis que certains systèmes d'agents multi-politiques font mieux. Son modèle KnowinBrain-1.5 se classe premier sur 20 au classement de questions-réponses embodied 2D d'Embodied Arena, avec 65,62 points sur neuf benchmarks. Tous ces chiffres proviennent des protocoles d'évaluation de l'entreprise elle-même et n'ont pas de validation indépendante. Le rapport reconnaît des limites : certains critères de succès se déclenchaient alors que l'objet était encore dans la pince, et le nombre d'étapes ne permet pas de comparer strictement les vitesses.

L'enjeu est double. D'abord, l'apprentissage par une seule démonstration, sans mise à jour des poids, s'attaque à un point de blocage du robot domestique : le coût de collecte de données et de réglage par tâche. Si l'approche tient hors des démos, elle réduirait fortement l'effort de déploiement. Ensuite, la boucle de retour d'exécution (l'exemple du tiroir) montre que la robustesse vient autant de la couche agent et de la vérification que du modèle de base. Il faut toutefois rester prudent : les résultats sont surtout simulés, la comparaison à un agent GPT-6 dépend de la configuration choisie, et les démos réelles sont sélectionnées, sans taux de réussite ni temps de cycle publiés. L'écart entre démonstration et fiabilité en foyer reste donc entier.

Knowin s'inscrit dans la vague des modèles fondation pour la robotique domestique, face aux approches VLA (vision-langage-action) d'acteurs comme Physical Intelligence (Pi-0), Figure (Helix) ou NVIDIA (GR00T). Sa singularité tient à l'association d'un modèle du monde, d'un moteur de génération de données et d'un runtime agentique. L'entreprise revendique plus de 200 chercheurs un peu plus d'un an après sa création. Son premier produit, Knowin-X1, est en validation avant production de masse, sans date, prix ni volume annoncés. La suite dépendra de ces éléments : des évaluations tierces sur robot réel, des pilotes en foyer et un calendrier de commercialisation crédible.

À lire aussi

PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration
1arXiv cs.RO 

PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration

Une équipe de chercheurs présente PGDG (Physically Grounded Data Generation), un cadre qui permet d'entraîner une politique de manipulation bimanuelles robuste à partir d'une seule démonstration humaine. Déposé sur arXiv en mai 2026 (réf. 2605.21710), le système attaque un problème structurant du behavior cloning : tout écart par rapport à la trajectoire apprise plonge le robot dans des états hors distribution, sans signal de récupération disponible dans les données d'entraînement. PGDG génère automatiquement, sans annotation humaine supplémentaire, un ensemble compact de trajectoires physiquement plausibles couvrant ces comportements de récupération manquants. Il alterne entre un échantillonneur ancré en physique et un curateur de données qui oriente progressivement l'exploration vers les modes sous-représentés, complété par un reétiquetage d'actions correctives sur les états risqués. Sur la tâche RotateBox-Pitch, manipulation bimanuelles par contact, le taux de succès passe de 38 % à 93 % en simulation et de 35 % à 82 % en transfert zéro-shot vers le robot réel. Appliqué au fine-tuning de GR00T, le modèle de fondation vision-langage-action de NVIDIA, la méthode améliore le taux de succès de 46 % à 77 %. Le résultat le plus notable pour les intégrateurs est le transfert zéro-shot : la politique entraînée exclusivement sur données synthétiques fonctionne directement sur le robot physique, sans adaptation terrain. Ce résultat valide empiriquement que la génération ancrée en physique peut combler le sim-to-real gap pour les tâches en contact, historiquement le talon d'Achille de la manipulation dextère. La compatibilité avec GR00T (un VLA) ouvre également une voie pour enrichir les modèles de fondation à faible coût de collecte : une démonstration unique remplace les centaines typiquement requises en téléopération, ce qui modifie le calcul économique pour tout projet de déploiement à grande variété de configurations. Ce travail s'inscrit dans la course à l'efficacité des données en robotique manipulatrice. L'augmentation spatiale classique, premier concurrent direct, est systématiquement surpassée sur les quatre tâches testées. Les approches alternatives misent soit sur la collecte massive comme ACT/ALOHA (des milliers de démonstrations), soit sur le pré-entraînement multi-tâche à grande échelle comme pi-0 de Physical Intelligence. PGDG se distingue par son paradigme "une démonstration suffit", potentiellement attractif dès que la diversité des pièces ou des configurations rend la collecte par tâche prohibitive. La validation reste pour l'instant en environnement laboratoire ; une évaluation sur des tâches industrielles réelles constituerait la prochaine étape logique.

💬 Une démo au lieu de mille, et le robot fonctionne directement sur le physique sans adaptation terrain. Le sim-to-real sur de la manipulation par contact, c'était le blocage structurel depuis des années, et là ils sortent 82% en zéro-shot sur le robot réel, c'est pas un résultat qu'on voit souvent. Reste à tenir hors labo.

IA physiqueOpinion
1 source
Comment Generalist utilise des données de démonstration humaine pour l'apprentissage robotique
2The Robot Report 

Comment Generalist utilise des données de démonstration humaine pour l'apprentissage robotique

Generalist, startup robotique valorisée à 2 milliards de dollars, construit ses modèles sur les travaux de recherche "Universal Manipulation Interface" (UMI), publiés par le Toyota Research Institute (TRI), l'université Columbia et l'université Stanford. Cette plateforme de collecte de données s'appuie sur des effecteurs terminaux de type marionnette, maniés par des opérateurs humains et filmés par des caméras GoPro, pour capturer des tâches réelles comme la vaisselle ou la préhension d'objets ; ces démonstrations deviennent ensuite des données d'entraînement pour des modèles fondation destinés aux cobots. En juin 2026, lors du salon Automate au McCormick Center de Chicago, Generalist a montré en direct des bras Universal Robots (UR) pliant et assemblant des boîtes en carton, ainsi que des bras Flexiv réparant des aspirateurs robots. Environ un mois plus tard, l'entreprise publiait un billet de blog intitulé "Towards Machines with a Thousand Hands", détaillant l'usage d'une variété de pinces et d'outils, dont des spatules, sur différents systèmes robotiques. Samantha Castellanos, ingénieure mécanique fondatrice de Generalist, précise que le préhenseur maison ne compte qu'un seul degré de liberté (1 DoF), un choix assumé de simplicité mécanique plutôt que de complexité articulaire. Cette approche interroge l'hypothèse dominante du secteur selon laquelle la performance des modèles VLA (vision-language-action) dépend avant tout de la sophistication du hardware. En misant sur une pince minimaliste et sur le volume de données plutôt que sur la complexité mécanique, Generalist parie que le modèle, plus que la main, constitue l'avantage concurrentiel durable : selon Castellanos, le modèle est "le moat qui va nous différencier des autres." Pour les intégrateurs, la démonstration d'Automate montre qu'un même modèle peut piloter des bras de fournisseurs différents (UR, Flexiv) sur des tâches distinctes, assemblage de cartons d'un côté, réparation d'aspirateurs de l'autre, ce qui suggère une portabilité inter-marques rare en automatisation classique. Ces démonstrations restent toutefois des vitrines de salon en conditions contrôlées, non des déploiements en production : la capacité de récupération en temps réel vantée sur les réseaux sociaux n'a pas été vérifiée indépendamment, et aucun chiffre de temps de cycle, taux de réussite ou volume déployé n'a été communiqué. L'étude UMI, cosignée par des chercheurs de TRI, Columbia et Stanford, avait montré qu'il était possible d'entraîner des cobots à l'autonomie à partir de démonstrations humaines captées hors laboratoire, sans robot physique présent lors de la collecte ; cette recherche académique a rapidement servi de socle à la création de Generalist. L'entreprise évolue dans un secteur de l'IA robotique déjà très capitalisé, plus de 4 milliards de dollars levés cumulativement par ses concurrents : Skild AI (2 milliards), Physical Intelligence (1 milliard), Field AI (300 millions) et RLWRLD (41 millions). Face à cette concurrence, Generalist mise sur la diversité des effecteurs plutôt que sur un bras ou une pince unique, stratégie résumée dans son billet de blog par la formule "des machines aux mille mains." L'entreprise n'a communiqué ni calendrier de déploiement commercial ni client pilote nommé : à ce stade, les démonstrations de juin et juillet 2026 relèvent de la vitrine technologique plutôt que d'un produit livré en série.

IA physiqueOpinion
1 source
Scalabot HERON-CRA ajoute une mémoire contextuelle et un moteur d'apprentissage par renforcement pour le contrôle incarné
3Pandaily 

Scalabot HERON-CRA ajoute une mémoire contextuelle et un moteur d'apprentissage par renforcement pour le contrôle incarné

Songyan Dynamics, via sa marque d'intelligence incarnée Scalabot, a publié HERON-CRA (Context Reinforcement Action Model), second modèle de sa pile HERON après le HERON-World Model dévoilé une semaine plus tôt. Trois briques composent le système : un Context Expert qui encode l'historique multimodal en tokens spatio-temporels 4D pour conditionner la politique sur plus d'une minute de contexte passé, au-delà de la seule image courante ; un RL Engine, acteur-critique résiduel léger qui réutilise les clés et valeurs figées du Context Expert pour corriger les dérives de l'imitation pure ; et un pré-entraînement cross-embodiment mélangeant téléopération, simulation, données de type UMI et vidéos humaines à la première personne, sur des bras, des plateformes à roues, des pinces et des mains dextres. Sur une tâche de pliage de chaussette, Scalabot rapporte un taux de réussite passant de 38,5% avec une base purement imitative à 97,8% une fois le RL Engine activé. D'autres vidéos montrent une séquence longue de préparation de café (mouture, versement de lait) bouclée en moins de 30 secondes, un transfert de compétences entre un bras ARX et l'humanoïde à roues Noetix M1, ainsi qu'une reprise après déplacement d'une tasse en cours de préhension et la poursuite de certains mouvements lors d'occlusions visuelles brèves. Pour les intégrateurs et décideurs B2B de la robotique, l'annonce cible le point faible récurrent des modèles vision-langage-action : la manipulation à horizon long, où le clonage de comportement dérive dès que la tâche s'étire dans le temps ou que l'environnement varie légèrement. En combinant mémoire contextuelle et RL résiduel plutôt qu'imitation pure, Scalabot cherche à combler l'écart entre démonstration et déploiement réel, un écart que le secteur a souvent minimisé dans ses communications. Le saut de 38,5% à 97,8% de réussite, s'il se vérifie hors laboratoire, validerait cette hypothèse ; le transfert de compétences entre un bras fixe et un humanoïde à roues constitue par ailleurs un signal concret sur la portabilité inter-corps, enjeu clé pour amortir les coûts d'entraînement sur plusieurs plateformes matérielles. Ces chiffres restent néanmoins issus de communications de l'entreprise, appuyés sur des vidéos vraisemblablement sélectionnées et sans protocole indépendant publié ; des équipes tierces devront reproduire les résultats du pliage de chaussette et de la séquence café sur leur propre matériel avant de les tenir pour acquis. HERON-CRA s'inscrit dans une pile modulaire amorcée avec HERON-World Model, utilisé ici pour simuler des trajectoires imaginées sans risque matériel supplémentaire ; Context Expert et Action Expert sont entraînés comme un mélange de transformers, complété d'un modèle de valeur à contraintes de différence temporelle. Ce chantier place Scalabot, marque de Songyan Dynamics, dans la compétition mondiale des modèles fondation pour la robotique incarnée, aux côtés de Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure AI (Helix) et des programmes humanoïdes type Optimus. Aucun acteur français ou européen n'apparaît dans cette annonce. La suite dépendra de la capacité de Scalabot à faire valider ces résultats par des tiers et à préciser un calendrier de déploiement pilote : l'entreprise n'a pour l'instant communiqué que des démonstrations vidéo et des chiffres internes, sans date de disponibilité commerciale ni partenaire industriel nommé.

IA physiqueActu
1 source
Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne
4arXiv cs.RO 

Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne

Une équipe de chercheurs publie sur arXiv (réf. 2604.03540, version 3) un cadre en deux étapes baptisé Drift-Based Policy Optimization (DBPO), conçu pour ramener les politiques génératives de manipulation robotique à une seule passe de réseau au moment de l'inférence. La première brique, la Drift-Based Policy (DBP), exploite des objectifs de "fixed-point drifting" pour internaliser le raffinement itératif directement dans les paramètres du modèle pendant l'entraînement, supprimant ainsi le besoin de débruitage multi-étapes à l'exécution. La seconde brique, DBPO, greffe sur ce backbone une interface stochastique compatible avec le renforcement en ligne, autorisant des mises à jour on-policy stables sans sacrifier la propriété de déploiement en une étape. Sur un robot bi-bras réel, le système atteint 105,2 Hz en boucle fermée, soit une fréquence comparable aux contrôleurs industriels classiques. Sur les benchmarks de manipulation, DBP égale ou dépasse les politiques de diffusion multi-étapes tout en réduisant le coût d'inférence jusqu'à un facteur 100 en nombre d'évaluations réseau (NFEs). Ce résultat touche directement l'un des verrous les plus concrets du déploiement de politiques diffusion en robotique : le coût computationnel à l'inférence. Les politiques de diffusion actuelles (Diffusion Policy, Chi et al., 2023) nécessitent typiquement 10 à 100 NFEs par action, ce qui les rend incompatibles avec du contrôle haute fréquence sans accélérateur dédié. Transférer ce coût vers l'entraînement plutôt que l'inférence change le profil économique du déploiement : un robot en production n'a plus besoin de GPU haut de gamme pour tourner en temps réel. Par ailleurs, coupler une politique one-step avec du renforcement en ligne ouvre la voie à une adaptation continue post-déploiement, hypothèse clé pour les environnements industriels non-structurés. Les politiques de diffusion pour la manipulation ont émergé comme référence de facto depuis 2022-2023, portées par des travaux comme Diffusion Policy ou les architectures VLA de Physical Intelligence (pi0) et d'autres. La course à réduire leur latence a produit plusieurs approches concurrentes : distillation de consistance (Consistency Policy), flow matching en une étape (comme dans certaines variantes de pi0-fast), ou encore les politiques à action chunking. DBPO s'inscrit dans cette compétition avec une approche qui revendique de préserver la modélisation multimodale tout en atteignant la vitesse des méthodes one-shot. Les prochaines étapes naturelles seraient un test à plus grande échelle de tâches et de morphologies robotiques, ainsi qu'une validation sur des plateformes humanoïdes telles que celles de Figure AI ou 1X Technologies, pour lesquelles la fréquence de contrôle est un critère de sécurité, pas seulement de performance.

UELes équipes de recherche et industriels européens en robotique manipulatrice pourraient réduire leurs besoins en accélérateurs GPU à l'inférence en adoptant cette approche, mais aucun acteur français ou européen n'est directement impliqué.

IA physiquePaper
1 source