Aller au contenu principal
Automatisation sans code : un seul guide vidéo pour piloter trois robots complètement différents
RechercheInteresting Engineering 

Automatisation sans code : un seul guide vidéo pour piloter trois robots complètement différents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du Laboratoire d'algorithmes d'apprentissage et de systèmes (LASA) à l'École Polytechnique Fédérale de Lausanne (EPFL) ont présenté un framework de contrôle robotique baptisé Kinematic Intelligence, capable de transférer une compétence apprise à partir d'une seule démonstration humaine vers des robots de morphologies entièrement différentes, sans réécrire une ligne de code. Dans une expérience sur ligne d'assemblage, une personne a démontré une séquence en trois étapes : pousser un bloc en bois d'un tapis roulant vers un établi, le placer sur une table, puis le jeter dans un panier. Trois robots commerciaux distincts ont ensuite reproduit cette séquence de manière fiable, chacun prenant en charge des étapes différentes. Le système a fonctionné même lorsque la répartition des tâches entre les robots a été modifiée en cours d'expérience, comme l'a précisé Sthithpragya Gupta, doctorant et co-premier auteur : "Chaque robot interprète la même compétence à sa façon, mais toujours dans des limites sûres et faisables."

L'enjeu industriel est direct. Aujourd'hui, intégrer un nouveau modèle de robot dans une ligne de production existante implique souvent une reprogrammation complète des tâches, même si le robot entrant est fonctionnellement similaire au précédent. Chaque configuration articulaire différente, chaque amplitude de mouvement propre à un constructeur, exige un travail d'adaptation coûteux en temps et en expertise. Kinematic Intelligence adresse ce goulet d'étranglement en abstrayant la tâche démontrée non pas dans les coordonnées articulaires d'un robot spécifique, mais dans une représentation géométrique universelle ancrée sur la position et la trajectoire de l'effecteur terminal dans l'espace. Cette représentation est ensuite réexprimée dans les termes cinématiques du robot cible, avec une vérification explicite que chaque instruction traduite reste dans l'enveloppe physiquement et sûrement exécutable par la machine. Ce n'est donc pas une simple transposition de mouvements : c'est une garantie de faisabilité avant exécution, ce qui distingue le système d'approches par imitation directe souvent fragiles hors contexte de démonstration.

Le LASA, dirigé par la professeure Aude Billard, travaille depuis plusieurs années sur l'apprentissage par démonstration et les systèmes dynamiques pour la robotique. Le framework s'inscrit dans un contexte de marché humanoïde en pleine accélération, où Figure, Agility Robotics, 1X ou Apptronik itèrent leurs plateformes matérielles tous les six à dix-huit mois, rendant la portabilité des compétences entre générations de hardware critique pour la viabilité économique des déploiements. Les chercheurs annoncent vouloir étendre Kinematic Intelligence à la collaboration homme-robot et à l'interaction en langage naturel, permettant à terme à un utilisateur non-technicien d'instruire un robot par commandes simples. Le papier complet n'était pas encore publié au moment de l'annonce : les résultats restent pour l'instant à valider par la communauté en dehors du cadre contrôlé de la démonstration EPFL.

Impact France/UE

Le LASA de l'EPFL, institution de recherche européenne de premier rang, produit un framework directement applicable aux intégrateurs robotiques européens confrontés au coût de reprogrammation lors du remplacement de robots en ligne de production.

À lire aussi

Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff
1arXiv cs.RO 

Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff

Une équipe de recherche publie SoGuDiff (Socially Guided Diffusion), un cadre de navigation robotique fondé sur un modèle de diffusion, dans une prépublication arXiv (2609.30560v1, catégorie "new"). Le système permet de régler à l'exécution le style social d'un robot mobile : distance de passage, côté privilégié pour contourner un obstacle, degré de déférence envers un groupe de personnes. Contrairement aux politiques classiques, entraînées par apprentissage par renforcement sur une récompense fixe ou par imitation de démonstrations humaines, qui figent un comportement unique sans réglage possible, SoGuDiff définit des axes de style continus, utilisables seuls ou combinés, plutôt qu'un catalogue de comportements discrets prédéfinis. Une couche de projection de faisabilité sépare ce comportement social appris des contraintes cinématiques et de l'évitement de collision. Les auteurs montrent qu'un balayage sur un seul axe de style produit une courbe de compromis qui domine strictement les configurations de référence à comportement fixe testées, et que les différences de style se retrouvent dans des démonstrations réelles ; aucune plateforme commerciale, entreprise ni volume de déploiement n'est cité, il s'agit d'une contribution méthodologique et non d'un produit livré. Pour les intégrateurs de robots mobiles autonomes et de service évoluant en environnements partagés avec des humains, l'absence d'interface de réglage du comportement social est une limite connue : chaque site, culture ou réglementation impose ses propres conventions de distance et de priorité de passage, qu'une politique figée gère mal. Pouvoir ajuster ce comportement via des paramètres continus au déploiement, sans ré-entraînement ni choix parmi des comportements discrets prédéfinis, simplifierait l'adaptation d'une même flotte à plusieurs sites. La validation reste toutefois limitée à un seul axe de style balayé et à des références "comportement fixe" définies par les auteurs eux-mêmes, sans comparaison à un système commercial existant ni test à grande échelle : le résultat démontré est une courbe de compromis en banc d'essai, pas un déploiement en flotte. Le travail prolonge des recherches antérieures sur les modèles de diffusion appliqués à la planification de trajectoire, une approche qui a gagné du terrain depuis 2023 pour sa capacité à représenter des comportements multimodaux, à la différence des politiques par renforcement ou par imitation classiques qui convergent vers un comportement moyen unique. L'abstract ne cite aucun concurrent ni acteur industriel, américain ou européen, ni aucun des acteurs FR/EU du secteur AMR comme Wandercraft ou Exotec, le travail relevant de la recherche académique plutôt que d'un produit commercial. Aucun calendrier de pilote ni prochaine étape n'est annoncé : il s'agit pour l'instant d'une simple prépublication, dont la portée pratique dépendra de validations futures sur du matériel varié et à plus grande échelle.

UEAucune entreprise ni institution européenne n'est impliquée, mais la méthode pourrait intéresser les intégrateurs européens de robots mobiles de service confrontes a des normes sociales variables selon les pays.

RecherchePaper
1 source
Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine
2arXiv cs.RO 

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine

Des chercheurs ont présenté HOST (Human-to-robot One-Shot Skill AcquisiTion), un framework permettant à un robot d'acquérir une nouvelle compétence de manipulation à partir d'une seule vidéo humaine, en 29 secondes en moyenne au moment de l'inférence. Le système fonctionne par une cascade de prédictions auto-référencées : il estime d'abord la progression du robot dans la tâche démontrée, traduit cette progression en observations futures propres à l'embodiment du robot, puis en déduit les actions à exécuter. L'entraînement de cette cascade s'appuie sur une correspondance entre la trajectoire du robot et la vidéo de démonstration, projetées sur une même variété de progression de tâche, ce qui permet d'aligner les cibles d'apprentissage sur le déroulé futur de la vidéo. Sur les tâches testées, HOST atteint un taux de réussite moyen de 62%, soit 45 points de plus qu'une baseline zero-shot, tout en conservant les compétences déjà maîtrisées par le robot. Ce résultat s'attaque directement à un goulot d'étranglement connu du secteur de la robotique manipulatrice : les méthodes actuelles d'apprentissage de compétences reposent sur des boucles d'entraînement lourdes et coûteuses, qui en plus dégradent souvent les compétences précédemment acquises à chaque nouvel apprentissage (le problème dit du "catastrophic forgetting"). En affichant des performances supérieures à une baseline fine-tunée sur 50 démonstrations robot par tâche, tout en n'utilisant qu'une seule vidéo humaine et 507 fois moins de temps d'acquisition, HOST illustre une piste concrète pour réduire drastiquement le coût de déploiement des VLA (vision-language-action models) en environnement industriel réel, un enjeu central pour les intégrateurs qui doivent reconfigurer rapidement des cellules robotiques sur de nouvelles références produit sans campagne de collecte de données coûteuse. Cette approche s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation cross-embodiment, où des modèles comme GR00T N2 ou Pi-0 cherchent également à exploiter des données humaines ou hétérogènes pour accélérer l'apprentissage robotique. La contribution spécifique de HOST réside dans sa capacité à opérer en one-shot, à l'inférence, sans réentraînement du modèle sous-jacent, et sans effacer les compétences déjà en mémoire du robot. Les auteurs renvoient vers un site du projet pour des démonstrations complémentaires ; il s'agit à ce stade de résultats de recherche publiés sur arXiv, non d'un produit ou d'un déploiement industriel.

RecherchePaper
1 source
Optimisation de trajectoire dynamiquement cohérente pour robots à pattes via décomposition des points de contact
3arXiv cs.RO 

Optimisation de trajectoire dynamiquement cohérente pour robots à pattes via décomposition des points de contact

Une équipe de recherche publie sur arXiv (référence 2510.24069, version 2, qui remplace une soumission antérieure) un article intitulé "Dynamically-Consistent Trajectory Optimization for Legged Robots via Contact Point Decomposition". La méthode proposée est une optimisation de trajectoire par phases qui garantit, sur l'ensemble du mouvement, la faisabilité de la dynamique de translation ainsi que le respect des contraintes de cône de friction. Elle exploite les propriétés de superposition des équations différentielles linéaires pour découpler la dynamique de translation de chaque point de contact, chacun suivant sa propre séquence de phases d'appui et de vol. Les auteurs utilisent ensuite la matrice de différentiation des polynômes de Bézier pour établir une relation analytique directe entre position du robot et forces appliquées, puis la propriété d'enveloppe convexe de ces mêmes polynômes pour contraindre le frottement tout au long de la trajectoire. Le framework est validé sur un modèle de robot quadrupède, avec code source et matériel complémentaire publiés sur une page de projet dédiée. Pour la robotique à pattes, ce travail s'attaque à un goulot d'étranglement connu : calculer simultanément la séquence de contacts et une trajectoire dynamiquement valide est coûteux en calcul, et de nombreux optimiseurs existants ne vérifient la dynamique qu'en des instants discrets, laissant passer des violations entre ces points. En assurant une satisfaction continue et analytique des contraintes plutôt qu'une approximation par échantillonnage, l'approche vise des trajectoires plus fiables sur des allures variées (marche, trot, saut) sans recalcul correctif coûteux après coup. Pour des intégrateurs travaillant sur des plateformes quadrupèdes du type Spot, Unitree ou ANYmal, ce genre de méthode pourrait alimenter des planificateurs embarqués plus robustes. Il s'agit toutefois d'un résultat académique validé en simulation sur un seul modèle de robot, pas d'un produit commercial ni d'un déploiement de terrain. Cette contribution s'inscrit dans la lignée des recherches sur l'optimisation de trajectoire à contacts implicites et le contrôle prédictif corps entier pour robots légers, un domaine où dominent depuis plusieurs années des méthodes fondées sur la programmation quadratique séquentielle ou l'intégration numérique directe, qui peinent à garantir la cohérence dynamique entre les points d'échantillonnage. La publication d'une version 2 sur arXiv signale une révision après une première soumission, probablement liée à un processus d'évaluation par les pairs. Aucun partenariat industriel, calendrier de pilote ou passage au matériel réel n'est mentionné à ce stade : les auteurs renvoient uniquement vers leur page de projet et le code source pour toute reproduction ou prolongement des résultats.

RecherchePaper
1 source
Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques
4arXiv cs.RO 

Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques

Une équipe de recherche propose une nouvelle méthode de tokenisation d'action baptisée BAAT, pour Behavior-Aligned Action Tokenization, décrite dans un preprint publié sur arXiv fin septembre 2026 (identifiant 2609.27513v1). Le travail cible un maillon technique précis des politiques robotiques autorégressives, ces systèmes qui apprennent le contrôle continu en prédisant des tokens d'action discrets à partir des observations visuelles: les tokenizers existants n'imposent aucune supervision explicite de la correspondance comportementale entre démonstrations, si bien que des mouvements similaires exécutés à des rythmes différents finissent par occuper des représentations distinctes. BAAT résout ce problème en utilisant le soft dynamic time warping, ou Soft-DTW, pour identifier des segments d'action correspondants entre tâches et aligner leurs coordonnées quantifiées conjointement avec l'objectif de reconstruction. Un décodeur par diffusion conditionné par l'historique reconstruit ensuite des séquences d'action continues à partir de ces tokens, sur lesquelles une politique autorégressive est entraînée en aval. Évaluée sur des tâches sélectionnées issues de trois benchmarks de simulation et sur deux tâches en robot réel, la méthode atteint un taux de succès moyen d'environ 45,2% en simulation, soit 7,2 points de pourcentage au-dessus de la référence OAT. Dans une ablation contrôlée sur le benchmark LIBERO-All, le taux de succès de la politique passe de 70,2% à 79,0% lorsque l'alignement comportemental est activé, au prix d'une légère baisse du succès de rejeu de trajectoire. Pour les équipes qui conçoivent des politiques de manipulation robotique, ce résultat s'attaque à un goulot d'étranglement souvent sous-estimé des architectures vision-langage-action: la qualité de la tokenisation en amont conditionne directement ce qu'une politique autorégressive peut apprendre en aval, indépendamment de la taille du modèle ou du volume de données. En montrant qu'une supervision explicite de la correspondance entre mouvements améliore le transfert entre tâches sans sacrifier la précision d'exécution, les auteurs apportent un argument empirique en faveur d'une meilleure structuration de l'espace de représentation des actions, plutôt que du seul passage à l'échelle des données ou des paramètres. Le gain de neuf points de succès en ablation contrôlée reste toutefois mesuré sur un seul benchmark, et l'écart de 7,2 points face à OAT en simulation, bien réel, ne dit rien de la généralisation à des environnements physiques variés ni à des embarquements industriels. Le point de comparaison retenu, OAT, sert de référence pour situer BAAT dans la lignée des travaux récents sur les tokenizers d'action pour politiques robotiques, un axe de recherche actif depuis l'essor des modèles VLA de type Pi-0 ou GR00T N2, qui reposent tous sur une étape de discrétisation des actions continues. Le papier reste à ce stade un résultat académique en préimpression, validé sur des sous-ensembles de tâches de trois benchmarks de simulation plus deux essais sur robot réel, sans indication de déploiement industriel, de partenariat ou de mise à disposition de code. Les auteurs présentent leurs résultats comme un argument en faveur de la correspondance comportementale comme signal de supervision pour organiser la structure de mouvement partagée dans les tokenizers d'action, une piste que d'autres laboratoires pourraient chercher à répliquer sur des benchmarks plus larges avant toute validation en conditions réelles.

RecherchePaper
1 source