
Apprentissage par imitation hétéroscédastique non paramétrique et rapide, avec a priori géométriques
Des chercheurs proposent, dans un preprint arXiv (2610.08650v1), une méthode d'apprentissage par imitation non paramétrique capable de modéliser des politiques probabilistes à partir de peu de démonstrations humaines, tout en tenant compte de la géométrie des variétés propres à la robotique (positions et orientations). Le papier décrit une formulation optimisée où la mise à jour d'une trajectoire complète, position et orientation incluses, demande moins de 3 ms. La méthode traite des entrées comme des sorties vivant sur des variétés, y compris pour de grands changements d'orientation. Elle repose sur des noyaux diagonaux non séparables, qui capturent les relations d'incertitude entre degrés de liberté lorsque entrée et sortie ont la même dimension. Les politiques peuvent être indexées sur le temps ou sur l'état du robot, et la paramétrisation de tâche permet de les adapter à différentes poses d'objets. L'évaluation porte sur des exemples jouets et sur des tâches réelles de manipulation, en exécution autonome et en contrôle partagé. Le résumé ne donne ni robot, ni nombre de démonstrations, ni taux de réussite.
L'intérêt tient à un compromis que les approches existantes résolvent mal. Les méthodes à noyaux, appréciées pour leur adaptation intuitive et fiable, se divisent en deux familles. Les unes ignorent la géométrie des variétés, ce qui pénalise l'efficacité en données, notamment pour les orientations. Les autres respectent cette géométrie, mais fournissent des incertitudes peu fiables ou exigent un réentraînement pour s'adapter. Une mise à jour en quelques millisecondes, sans réentraînement, rend envisageable une adaptation en ligne pendant l'exécution. Pour un intégrateur, cela concerne les postes où les pièces bougent d'une fois sur l'autre et où le programmeur ne dispose que de quelques démonstrations. L'incertitude hétéroscédastique, c'est-à-dire variable selon la phase de la tâche, sert à moduler la précision ou la compliance, et elle est utile en contrôle partagé avec un opérateur humain. Il faut toutefois relativiser. Il s'agit d'un preprint sans validation par les pairs. Le chiffre de 3 ms est donné pour une seule trajectoire, sans précision sur le matériel ni sur le nombre de points. Les tâches réelles ne sont pas décrites dans le résumé.
Ces travaux s'inscrivent dans la lignée des primitives de mouvement probabilistes et de l'apprentissage par imitation sur variétés riemanniennes. Ils se positionnent en alternative légère aux politiques par réseaux de neurones, aux modèles de diffusion et aux modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2. Ceux-ci demandent beaucoup de données et de calcul, mais généralisent à des instructions ouvertes, ce que cette approche ne revendique pas. Elle vise plutôt des tâches structurées, avec peu de données et des garanties d'incertitude. La suite logique serait un code ouvert, des comparaisons chiffrées avec des méthodes de référence et des essais sur des cellules industrielles. Rien de tel n'est annoncé à ce stade.
Dans nos dossiers




