Aller au contenu principal
MoMo : composer le mode de mouvement en manipulation robotique via une tokenisation spatio-temporelle de l'action
RecherchearXiv cs.RO 

MoMo : composer le mode de mouvement en manipulation robotique via une tokenisation spatio-temporelle de l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente MoMo, un framework d'apprentissage par imitation en deux étapes qui permet de faire varier non plus seulement la précision d'un geste robotique, mais sa manière d'être exécuté. Le système combine un tokeniseur d'actions spatio-temporel et un transformeur de clonage comportemental, qui reçoit en entrée à la fois la tâche à accomplir et une condition continue de « mode de mouvement ». Testé sur six tâches de manipulation avec un robot réel, ce paramètre permet de produire des comportements qualifiés de posés, dynamiques ou intermédiaires, que des évaluateurs humains parviennent à distinguer de façon fiable. Les différences se mesurent concrètement dans la vitesse et l'accélération des articulations, ainsi que dans l'angle d'approche de l'effecteur terminal. Fait notable, lorsqu'une tâche n'a été démontrée que dans un seul mode d'exécution, MoMo parvient à transférer un mode demandé mais jamais vu pour cette tâche précise, tout en conservant l'essentiel du taux de réussite. Le papier est publié sur arXiv (2607.26315v1).

Cette capacité de généralisation compositionnelle, à savoir combiner une tâche connue avec un style d'exécution inédit, touche un point sensible du déploiement industriel des robots manipulateurs: jusqu'ici, les modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix se concentrent surtout sur le « quoi faire », rarement sur le « comment le faire ». Or pour un intégrateur, la manière d'exécuter un geste compte autant que sa réussite: un préhenseur qui va vite sur une pièce robuste mais qui doit ralentir sur un composant fragile, ou une cadence différente selon la proximité d'un opérateur humain. Que ce réglage de style soit réutilisable d'une tâche à l'autre, sans réentraîner un modèle dédié par comportement, laisse entrevoir une réduction du coût de personnalisation des compétences robotiques en usine.

Ce travail s'inscrit dans la lignée des recherches en clonage comportemental et en apprentissage par imitation, qui cherchent depuis plusieurs années à dépasser la simple reproduction de trajectoires démontrées pour capturer des facteurs de comportement transférables. Il reste, à ce stade, une preuve de concept académique limitée à six tâches et un seul bras robotique en laboratoire, sans indication de partenariat industriel ni de calendrier de déploiement. La suite logique serait une validation sur davantage de plateformes et de familles de tâches, pour vérifier si ce contrôle du style de mouvement tient à l'échelle des modèles VLA généralistes actuellement commercialisés.

À lire aussi

Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique
1arXiv cs.RO 

Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique

Des chercheurs ont publié sur arXiv (référence 2604.15215v2) un travail portant sur HiST-AT, un tokeniseur d'actions hiérarchique et spatiotemporel conçu pour l'apprentissage par imitation en contexte. Le principe central repose sur deux niveaux successifs de quantification vectorielle : le premier niveau affecte chaque action à des sous-clusters fins, tandis que le second regroupe ces sous-clusters en clusters plus larges. L'extension spatiotemporelle va plus loin en récupérant simultanément les actions et leurs horodatages associés, permettant au modèle d'exploiter à la fois la géométrie des mouvements et leur séquençage temporel. Les évaluations ont été conduites sur plusieurs benchmarks de manipulation robotique en simulation et en conditions réelles, et les auteurs revendiquent un nouveau niveau de performance de référence sur les tâches d'apprentissage par imitation en contexte. Ce résultat intéresse directement les équipes qui travaillent sur le déploiement rapide de robots dans de nouvelles tâches industrielles sans collecter des milliers de démonstrations. L'apprentissage par imitation en contexte, calqué sur le few-shot prompting des grands modèles de langage, vise à permettre à un robot d'exécuter une nouvelle tâche à partir de quelques exemples fournis dynamiquement, sans réentraînement. La qualité du tokeniseur d'actions est ici le maillon critique : une discrétisation trop grossière des trajectoires efface l'information fine de manipulation ; trop granulaire, elle rend l'espace de tokens ingérable. Le fait que l'approche hiérarchique améliore les résultats par rapport à une quantification à un seul niveau, et que l'ajout de l'information temporelle amplifie encore ce gain, suggère que la structure latente des tâches de manipulation est intrinsèquement multiscale. L'apprentissage par imitation en contexte pour la robotique s'est fortement développé depuis 2023, porté par des modèles comme ACT, Diffusion Policy, et plus récemment les architectures de type VLA (Vision-Language-Action) telles que OpenVLA, pi-zero de Physical Intelligence ou GR00T N2 de NVIDIA. La tokenisation des actions est un point de friction commun à toutes ces approches : comment convertir des trajectoires continues en séquences discrètes manipulables par un transformer. HiST-AT apporte une réponse structurée à ce problème, mais il s'agit à ce stade d'un résultat de recherche publié en preprint, sans validation industrielle ni déploiement annoncé. Les prochaines étapes naturelles seront d'évaluer la robustesse en dehors des benchmarks académiques, notamment sur des tâches de manipulation à haute fréquence ou en environnement non contrôlé.

RechercheOpinion
1 source
WatchAct : un benchmark de manipulation robotique fondée sur le comportement
2arXiv cs.RO 

WatchAct : un benchmark de manipulation robotique fondée sur le comportement

Une équipe de chercheurs a publié WatchAct (arXiv:2606.26443), un nouveau benchmark pour la manipulation robotique fondé sur l'observation du comportement humain. Contrairement aux évaluations existantes, qui associent une instruction textuelle à une image statique, WatchAct impose aux systèmes robotiques de raisonner à partir d'une vidéo montrant un humain accomplir une tâche, puis d'en déduire un plan d'action exécutable. Le benchmark comprend 3 000 instances réparties sur 14 tâches dans quatre domaines cognitifs : compréhension des événements (Event Grounding), récupération de la structure procédurale (Procedural Reasoning), inférence d'intentions implicites (Implicit Intent Inference) et suivi des modifications de scène (Episodic Reasoning). Chaque instance couple une vidéo réelle, une instruction en langue naturelle, une scène simulée dans le framework LIBERO et une tâche exécutable sur un robot Franka Research 3. Le meilleur pipeline testé, associant Gemini-3.1-Pro et le modèle π₀.₅ de Physical Intelligence, atteint seulement 16,3 % de taux de réussite en simulation et 14,0 % sur robot réel. Ces chiffres révèlent un fossé considérable entre capacités humaines et systèmes actuels. Sur la seule composante de planification vidéo-vers-plan, Gemini-3.1-Pro obtient 36,8 % de Plan SR, contre 97,1 % pour les humains, soit un écart de plus de 60 points de pourcentage. Même avec un plan oracle fourni directement, sans recours à un VLM, π₀.₅ ne dépasse pas 21,5 % de Task SR, et chute à 10,6 % sur des scénarios hors domaine. Le protocole d'évaluation décomposé de WatchAct, qui mesure séparément le raisonnement VLM, l'exécution de la politique robotique et la performance bout-en-bout, est méthodologiquement précieux : il permet d'identifier précisément où chaque composant échoue, plutôt que d'observer un taux global difficile à interpréter. Pour les intégrateurs et les équipes R&D industrielles, ce résultat indique que ni les grands modèles vision-langage actuels ni les politiques de manipulation ne sont prêts pour des scénarios de collaboration humain-robot en environnement non structuré. WatchAct s'inscrit dans une tendance de fond visant à dépasser les benchmarks « instruction + image unique » qui ne capturent pas la complexité temporelle du travail réel en atelier ou en logistique. Les évaluations existantes comme LIBERO (utilisé ici comme substrat de simulation), RoboSuite ou BridgeData évaluent principalement l'exécution sous contraintes statiques. WatchAct introduit une dimension de video-grounding qui rapproche l'évaluation des conditions réelles, où un robot doit comprendre ce qu'un collègue humain vient de faire pour enchaîner correctement. Le modèle π₀.₅ est développé par Physical Intelligence, l'une des startups VLA les plus suivies du secteur aux côtés de Figure AI, Agility Robotics et 1X Technologies. Aucun acteur européen n'est impliqué dans ce benchmark. Le dataset et le code sont disponibles publiquement ; les prochaines étapes naturelles incluent l'intégration de modèles de raisonnement vidéo plus récents et l'extension à des scénarios multi-agents.

RechercheOpinion
1 source
Politique CoLA-Flow : apprentissage par imitation temporellement cohérent via le flux d'actions latentes continues pour la manipulation robotique
3arXiv cs.RO 

Politique CoLA-Flow : apprentissage par imitation temporellement cohérent via le flux d'actions latentes continues pour la manipulation robotique

Une équipe de chercheurs a publié sur arXiv (2501.23087, version 3 en mai 2026) CoLA-Flow Policy, un framework d'apprentissage par imitation conçu pour la manipulation robotique sur des horizons d'action longs. L'approche combine le flow matching, une technique générative plus rapide que la diffusion, avec un espace d'action latent continu dans lequel les trajectoires sont encodées avant l'apprentissage du flux. Sur bancs de simulation et sur robots réels, les expériences affichent une amélioration de la régularité des trajectoires allant jusqu'à 93,7 % et un gain de taux de succès allant jusqu'à 25 points de pourcentage par rapport aux baselines de flow matching opérant directement dans l'espace d'action brut. L'inférence s'effectue en quasi-un seul pas, soit une vitesse nettement supérieure aux politiques basées sur la diffusion, qui nécessitent plusieurs étapes de débruitage. Le principal apport de CoLA-Flow est de découpler la structure globale du mouvement du bruit de contrôle bas niveau : en encodant les séquences d'actions en trajectoires latentes temporellement cohérentes, le modèle évite les oscillations et incohérences qui affectent les politiques de flow matching en espace brut. Pour un intégrateur ou un décideur industriel, cela signifie qu'une même architecture peut traiter des tâches de manipulation complexes sans latence rédhibitoire ni comportement erratique entre les étapes. Le conditionnement par nuages de points (point cloud) et la modulation multimodale à l'exécution via des indices visuels renforcent la robustesse dans des environnements réels non contrôlés, deux exigences critiques pour tout déploiement hors laboratoire. Ce travail s'inscrit dans une compétition intense entre architectures génératives pour les politiques robotiques. Diffusion Policy (Chi et al., 2023) a établi la référence en termes d'expressivité comportementale, mais son coût computationnel freine l'usage temps réel. Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA ont validé le flow matching comme alternative viable, au prix d'une instabilité accrue sur les horizons longs, précisément le problème que CoLA-Flow tente de résoudre via l'espace latent. Le framework s'apparente conceptuellement aux approches d'action chunking (ACT), mais opère au niveau du flux plutôt que de la prédiction directe. La troisième version de l'article suggère des révisions itératives significatives depuis janvier 2026 ; aucun déploiement industriel ni partenariat commercial n'est mentionné à ce stade, et les benchmarks présentés restent limités à des environnements de manipulation contrôlés.

RechercheOpinion
1 source
Robotique semi-corporelle : liaison sémantique-actionnement d'un mouvement de trompe souple inspiré de l'éléphant via flow matching léger
4arXiv cs.RO 

Robotique semi-corporelle : liaison sémantique-actionnement d'un mouvement de trompe souple inspiré de l'éléphant via flow matching léger

Voici l'article en français, sans titres ni traduction mentionnée: Des chercheurs proposent un système permettant à un robot doté d'une trompe souple inspirée de celle des éléphants de traduire des réponses générées par un grand modèle de langage multimodal en mouvements corporels complets, cohérents avec sa morphologie. Le pipeline convertit d'abord les réponses du modèle en tuples bornés d'intention et d'intensité alignés sur la structure du robot, puis paramétrise les trajectoires d'actionnement par câbles tendons à l'aide de splines de Catmull-Rom compactes, avant qu'un générateur de flux rectifié (rectified-flow) échantillonne des mouvements corporels faisables. Les résultats montrent un bond de la justesse de l'ancrage sémantique, de 25,0% avec une base de référence en régression dense brute à 77,2% avec le nouveau cadre. Face à une base de référence par diffusion débruitante, la méthode améliore encore la justesse de 71,9% à 77,2%, tout en réduisant le temps d'inférence de 7,86 ms à 4,87 ms et en conservant la diversité des mouvements générés. Une étude d'interaction physique menée auprès de 100 participants montre par ailleurs que l'ajout de ce canal de mouvement de trompe fait grimper le taux de satisfaction globale positive de 46% à 82% par rapport à une interaction purement audiovisuelle. Ce travail s'attaque à un problème central pour l'interaction homme-robot en contact rapproché: comment faire correspondre un langage naturel ouvert à un actionnement physique riche, sans se limiter au seul contrôle de l'effecteur terminal ni tomber dans la complexité ingérable d'un contrôle corporel complet à haute dimension. Pour les concepteurs de robots à manipulateurs continus (trompes, tentacules, bras souples), la démonstration qu'un modèle génératif léger de type flow matching peut produire des mouvements à la fois rapides à calculer, physiquement faisables et perçus positivement par des humains constitue un argument fort en faveur de cette approche face aux méthodes par diffusion, plus lourdes en temps d'inférence. L'amélioration marquée de la satisfaction utilisateur suggère aussi que le canal moteur expressif compte autant que la qualité du contenu conversationnel dans l'acceptabilité perçue d'un robot social. Publié sur arXiv (arXiv:2607.11018v1), ce travail s'inscrit dans la lignée des recherches sur l'ancrage sémantique-vers-actionnement (semantic-to-actuation grounding) pour les manipulateurs continus, un champ où les approches par régression dense et par diffusion débruitante servaient jusqu'ici de références. Les auteurs positionnent explicitement leur méthode comme une alternative plus légère à la diffusion, un choix qui fait écho aux efforts plus larges du secteur robotique pour réduire la latence des modèles génératifs embarqués sur du matériel contraint. L'étude reste à ce stade un prototype de recherche validé en laboratoire; aucune indication n'est donnée sur un déploiement commercial ou une intégration dans une plateforme robotique existante.

RecherchePaper
1 source