Knowin détaille GLOW, un cadre d'apprentissage incarné pour enseigner une tâche à un robot en une seule démonstration
Knowin, entreprise d'IA embodied fondée en août 2025, a publié le 24 septembre un rapport technique sur GLOW (Generative Learning of World). Ce cadre vise à permettre à un robot domestique d'apprendre une tâche à partir d'une seule démonstration humaine complète, puis de réutiliser la compétence sur d'autres objets, environnements et tâches, sans réentraînement ni mise à jour des paramètres. GLOW compte quatre briques. KnowinGLOW est un modèle autorégressif multimodal unifié (vision, raisonnement spatial, planification, génération d'actions) qui sort directement des poses d'effecteur et des commandes de pince. KnowinDream produit de l'expérience domestique simulée en transformant des routines familiales en scènes 3D, avec variation de l'éclairage, des matériaux, des objets et des points de vue. KnowinWorld simule les résultats d'actions candidates et les classe selon l'avancement de la tâche, la cohérence physique, l'atteignabilité et le risque. KnowinAgent (« Harness ») est le runtime qui gère mémoire, appels d'outils, requêtes spatiales, retours d'exécution et replanification. Un encodeur compresse la vidéo de démonstration en contexte de compétence, exploité par apprentissage en contexte avec des poids figés. Knowin montre le rangement de boîtes, l'arrosage d'une plante, l'essuyage d'une table et la préparation de boissons. Dans une tâche de tiroir, le robot a demandé un déplacement de 24,3 mm mais n'en a obtenu que 1,6 mm, a détecté l'obstruction et a changé d'approche.
Sur 18 tâches simulées RoboDojo, GLOW affiche 62,2 % de réussite moyenne et un score de 71,1, contre 22,2 % et 29,8 pour une base de comparaison fondée sur GPT-6. Sur six conditions de perturbation LIBERO-Pro, il atteint 86,7 % en politique unique, le meilleur score parmi les modèles à politique unique du tableau comparatif, tandis que certains systèmes d'agents multi-politiques font mieux. Son modèle KnowinBrain-1.5 se classe premier sur 20 au classement de questions-réponses embodied 2D d'Embodied Arena, avec 65,62 points sur neuf benchmarks. Tous ces chiffres proviennent des protocoles d'évaluation de l'entreprise elle-même et n'ont pas de validation indépendante. Le rapport reconnaît des limites : certains critères de succès se déclenchaient alors que l'objet était encore dans la pince, et le nombre d'étapes ne permet pas de comparer strictement les vitesses.
L'enjeu est double. D'abord, l'apprentissage par une seule démonstration, sans mise à jour des poids, s'attaque à un point de blocage du robot domestique : le coût de collecte de données et de réglage par tâche. Si l'approche tient hors des démos, elle réduirait fortement l'effort de déploiement. Ensuite, la boucle de retour d'exécution (l'exemple du tiroir) montre que la robustesse vient autant de la couche agent et de la vérification que du modèle de base. Il faut toutefois rester prudent : les résultats sont surtout simulés, la comparaison à un agent GPT-6 dépend de la configuration choisie, et les démos réelles sont sélectionnées, sans taux de réussite ni temps de cycle publiés. L'écart entre démonstration et fiabilité en foyer reste donc entier.
Knowin s'inscrit dans la vague des modèles fondation pour la robotique domestique, face aux approches VLA (vision-langage-action) d'acteurs comme Physical Intelligence (Pi-0), Figure (Helix) ou NVIDIA (GR00T). Sa singularité tient à l'association d'un modèle du monde, d'un moteur de génération de données et d'un runtime agentique. L'entreprise revendique plus de 200 chercheurs un peu plus d'un an après sa création. Son premier produit, Knowin-X1, est en validation avant production de masse, sans date, prix ni volume annoncés. La suite dépendra de ces éléments : des évaluations tierces sur robot réel, des pilotes en foyer et un calendrier de commercialisation crédible.
Dans nos dossiers




