SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée.
L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier.
SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




