Ludi₀.₁ : un système à base d'agents pour des robots socialement intelligents
Des chercheurs ont publié le 25 août 2026 sur arXiv (identifiant 2608.22035v1) un article décrivant Ludi 0.1, un système agentique visant à doter les robots d'une intelligence sociale, au-delà de la simple exécution de commandes isolées. Le système combine parole interactive, raisonnement multimodal, mémoire, navigation et manipulation apprise dans une architecture unique. Son cœur décisionnel est un modèle vision-langage affiné sur des traces d'interaction multi-tours : requêtes ambiguës, demandes de clarification, corrections, interruptions, dialogue mêlant social et tâches à plusieurs étapes. Un harnais logiciel dédié orchestre la boucle d'interaction entre ce modèle et ses outils, pendant que des politiques spécialisées de navigation et de manipulation exécutent les compétences physiques sur le robot.
Pour les intégrateurs et décideurs de la robotique humanoïde, ce travail marque un déplacement de priorité : après des années focalisées sur les benchmarks de perception et de contrôle bas niveau (préhension, locomotion, déplacement d'objets), l'enjeu se porte désormais sur la robustesse conversationnelle et la capacité à réviser un comportement en cours quand l'intention de l'utilisateur change. L'hypothèse testée est qu'affiner un modèle vision-langage-action sur des traces d'interaction réelles, plutôt que sur des démonstrations de tâches isolées, peut réduire l'écart souvent constaté entre démonstrations impressionnantes et fiabilité en usage réel. Les auteurs présentent Ludi 0.1 comme une étape intermédiaire, non comme un modèle fondation abouti : le système sert avant tout à générer les traces multimodales nécessaires pour entraîner un futur modèle plus intégré.
Cette publication s'inscrit dans le sillage des modèles vision-langage-action déjà démontrés pour la manipulation, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, et des plateformes humanoïdes commerciales telles qu'Optimus Gen 3 de Tesla ou Figure 03, dont les démonstrations restent centrées sur l'exécution de tâches plutôt que sur l'interaction sociale prolongée. Ludi 0.1 se distingue en ciblant explicitement la collaboration homme-robot en dialogue continu, un axe encore peu couvert par les annonces commerciales du secteur. L'article ne mentionne aucun déploiement industriel, ni volume de production, ni prix : il s'agit d'une contribution de recherche publiée sur arXiv, dont la suite annoncée est d'exploiter les traces collectées pour entraîner un futur modèle fondation combinant plus étroitement raisonnement social et compétences physiques.
Dans nos dossiers




