Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage accéléré de politiques visuomotrices sur variétés d'action via Riemannian MeanFlow

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2609.30127v1) une méthode baptisée Riemannian MeanFlow Policy (RMFP), destinée a accélérer l'apprentissage des politiques visuomotrices en robotique de manipulation. Ces politiques associent des observations sensorielles brutes a des séquences d'actions robotiques ; les approches actuelles par diffusion ou flow matching capturent bien la diversité des trajectoires possibles, mais exigent une intégration numérique en plusieurs étapes, couteuse en temps et incompatible avec les cadences de contrôle rapides. RMFP apprend directement la carte de flot de la trajectoire de probabilité sur la variété géométrique de l'espace d'actions, ancrée par une méthode de Riemannian Conditional Flow Matching, ce qui ramené la génération a une seule évaluation du réseau. La méthode est testée sur LASA sphérique, Push-T, les taches Tool Hang et Transport de Robomimic, Franka Kitchen, puis sur une manipulation réelle avec capteurs imparfaits.

Cette capacité a générer une action valide en une seule passe réseau, plutôt qu'en dizaines d'étapes d'intégration, s'attaque directement au goulot d'étranglement qui empêche les politiques de type diffusion ou flow matching de tourner aux fréquences de contrôle exigées par la manipulation fine en temps réel. Pour les intégrateurs et les équipes de recherche en robotique, ce résultat suggère qu'il est possible de conserver l'expressivité des modèles génératifs multimodaux, utiles pour représenter plusieurs stratégies de saisie ou de manipulation possibles, sans sacrifier la latence d'inférence. Le test en conditions réelles avec des mesures sensorielles bruitées répond en partie a la critique fréquente adressée a ce type de travaux, a savoir un écart entre résultats en simulation et robustesse effective sur robot physique, même si la portée de ce test unique reste limitée.

RMFP s'inscrit dans la lignée des politiques de diffusion popularisées en robotique depuis 2023 et de leurs variantes en flow matching, dont s'inspirent aussi certains modèles vision-langage-action commerciaux qui génèrent des séquences d'actions continues, a l'image de Pi-0 de Physical Intelligence ou des architectures d'action de la famille GR00T de NVIDIA. La technique MeanFlow, empruntée a la génération d'images en une étape, est ici adaptée pour la première fois aux variétés géométriques propres aux espaces d'actions robotiques. Il s'agit d'une contribution académique publiée en preprint, sans acteur industriel associe ni déploiement annonce ; les auteurs évoquent comme suite logique l'extension a des architectures VLA de plus grande échelle et a davantage de plateformes robotiques réelles.

À lire aussi

Ordered Action Tokens pour l'apprentissage de politiques visuomotrices
1arXiv cs.RO 

Ordered Action Tokens pour l'apprentissage de politiques visuomotrices

Des chercheurs publient sur arXiv (arXiv:2607.21670v1) une nouvelle méthode de tokenisation d'actions pour les politiques visuomotrices de robots, baptisée OAT (Ordered Action Tokenization). Le problème visé est concret : pour piloter un bras ou un robot humanoïde via un modèle vision-langage-action (VLA), il faut convertir des séquences d'actions continues en tokens discrets, une étape clé de l'architecture. Les méthodes existantes échouent sur deux fronts, soit elles produisent des séquences de tokens beaucoup trop longues, soit elles génèrent des tokens latents appris mais sans structure interne, ce qui les rend peu compatibles avec les politiques de contrôle en aval. OAT combine un transformer à registres, une quantification scalaire finie et des mécanismes d'entraînement qui imposent un ordre aux tokens produits. Concrètement, chaque préfixe de la séquence de tokens est entraîné à pouvoir, à lui seul, se décoder en une action valide, les premiers tokens portant l'information de contrôle grossière et les suivants affinant les détails résiduels. Les auteurs ont testé la méthode sur trois architectures de politiques différentes et plus de 60 tâches, couvrant cinq bancs d'essai en simulation ainsi que des scénarios réels. Cette structure ordonnée change la donne opérationnelle : elle permet un compromis "anytime" entre coût de calcul à l'inférence et précision du geste, un point critique pour le déploiement embarqué où la latence contraint directement la cadence de contrôle. Pour les intégrateurs travaillant avec des politiques autorégressives ou des architectures hybrides combinant tokens et experts de type flow, cela ouvre la possibilité d'ajuster dynamiquement le compromis vitesse-précision sans changer de modèle, un besoin réel face aux VLA actuels souvent jugés trop lents pour du contrôle temps réel industriel. Le travail s'inscrit dans la lignée des tokenizers d'actions développés pour les politiques VLA type Pi-0 ou GR00T N2, où l'encodage des actions reste un goulot d'étranglement identifié par la recherche depuis l'essor de ces modèles. En comparant explicitement autorégression pure et co-entraînement par tokens dans un cadre flow-based, les auteurs positionnent OAT comme une brique d'interface générique, potentiellement réutilisable au-delà des architectures testées dans l'étude.

RechercheActu
1 source
ChronoFlow-Policy : unifier le flux d'interaction passé-présent-futur dans l'apprentissage de politiques visuomotrices
2arXiv cs.RO 

ChronoFlow-Policy : unifier le flux d'interaction passé-présent-futur dans l'apprentissage de politiques visuomotrices

Une équipe de recherche présente ChronoFlow-Policy, une nouvelle politique visuomotrice pour la manipulation robotique, décrite dans un article publié sur arXiv (2606.31493). Le système repose sur une représentation baptisée ChronoFlow, qui capture simultanément les dynamiques d'interaction passées, présentes et futures entre un objet et la pince du robot, sous forme de points-clés 3D épars. Contrairement aux approches existantes qui modélisent séparément soit le contexte historique, soit les prédictions futures, ChronoFlow unifie ces deux dimensions temporelles dans une seule représentation. Cette dernière est apprise conjointement avec les séquences d'actions via une politique basée sur la diffusion, entraînée selon un objectif de co-apprentissage. Les auteurs ont testé leur méthode sur 14 tâches simulées et 5 tâches de manipulation en conditions réelles, montrant des performances systématiquement supérieures à celles de politiques de diffusion de référence considérées comme robustes dans le domaine. L'intérêt de ce travail pour l'industrie de la robotique tient à un problème récurrent dans l'apprentissage par imitation appliqué à la manipulation : les politiques actuelles peinent souvent sur les tâches à long horizon ou non-markoviennes, c'est-à-dire celles où l'action optimale dépend d'un historique d'interactions et pas seulement de l'état instantané. En améliorant la robustesse sur ce type de scénarios, ChronoFlow-Policy s'attaque directement à l'un des points faibles des architectures de type VLA (vision-langage-action) et des politiques de diffusion utilisées pour le contrôle de bras manipulateurs et de mains robotiques. Pour les intégrateurs, cela pourrait se traduire par des politiques moins fragiles face aux séquences d'actions complexes, un enjeu central pour le déploiement en usine ou en logistique. Ce travail s'inscrit dans la lignée des politiques de diffusion pour la manipulation robotique, un courant de recherche actif depuis plusieurs années et largement adopté par les laboratoires travaillant sur les VLA génériques. L'article ne précise pas d'affiliation industrielle ni de partenaire de déploiement identifié ; il s'agit à ce stade d'une contribution académique, validée en simulation et sur un nombre limité de tâches réelles, sans indication de mise à l'échelle industrielle ou de licence commerciale annoncée.

RecherchePaper
1 source
Robots à trois bras : apprentissage par imitation visuomotrice de politiques robotiques
3arXiv cs.RO 

Robots à trois bras : apprentissage par imitation visuomotrice de politiques robotiques

Voici l'article traduit et résumé. Une équipe de recherche présente TriManPolicy, un système d'apprentissage par imitation conçu pour piloter des robots à trois bras simultanément. Le problème de départ est concret : la téléopération bi-manuelle classique fonctionne bien quand le nombre de canaux de contrôle correspond entre l'opérateur humain et le robot, mais elle échoue dès qu'un robot dispose d'un troisième bras, puisqu'un seul opérateur ne peut piloter en continu que deux membres à la fois. Basculer entre paires de bras force alors à enregistrer des mouvements indépendants de façon séquentielle, ce qui pousse l'apprentissage par clonage comportemental à reproduire des délais imposés par l'interface de contrôle plutôt que par la tâche elle-même. Le composant central de TriManPolicy est le Dependency-Aware Tri-Arm Scheduling (DATS), un algorithme qui retraite les démonstrations hors ligne : il conserve les segments sensorimoteurs locaux tels que démontrés mais les repositionne dans le temps selon des contraintes d'ordre des tâches et d'usage des bras, validées par un humain. Le résultat entraîne une politique unique et synchrone pour les trois bras, sans nécessiter le graphe de dépendances ni le planificateur au moment du déploiement. Sur six tâches réelles complexes, les politiques entraînées sur données retimées par DATS montrent une coordination plus efficace, avec un taux de succès comparable aux méthodes classiques. Cette avancée s'attaque à un goulot d'étranglement peu discuté de la robotique humanoïde et multi-bras : la collecte de données de démonstration reste le facteur limitant pour entraîner des politiques visuomotrices de type VLA, et les systèmes à trois bras ou plus (bras additionnels, mains bimanuelles montées sur base mobile) sont de plus en plus courants dans les plateformes industrielles. En prouvant qu'il est possible de découpler la structure temporelle de la démonstration humaine de celle exigée par la tâche, TriManPolicy ouvre la voie à une collecte de données plus rapide et moins coûteuse pour des architectures robotiques complexes, un enjeu direct pour les intégrateurs qui cherchent à réduire le coût par démonstration sans sacrifier la qualité de coordination entre membres. Ce travail s'inscrit dans la lignée plus large des recherches sur l'apprentissage par imitation visuomoteur, où la majorité des systèmes existants (type ALOHA, Mobile ALOHA ou les plateformes bimanuelles standard) suppose une correspondance stricte entre canaux de téléopération humains et effecteurs robotiques. En proposant une méthode de retiming offline validée par supervision humaine plutôt qu'un simple filtrage des temps morts, les auteurs montrent que DATS modifie réellement la structure de supervision entre bras. Les six tâches testées en conditions réelles suggèrent une piste concrète pour les futurs travaux sur les architectures à quatre bras ou plus, notamment pour les robots humanoïdes à deux bras plus une base mobile ou un troisième effecteur dédié à une tâche auxiliaire.

RecherchePaper
1 source
ReShoot : randomisation visuelle générative du domaine pour l'apprentissage de politiques visuomotrices
4arXiv cs.RO 

ReShoot : randomisation visuelle générative du domaine pour l'apprentissage de politiques visuomotrices

Un article publié sur arXiv sous la référence 2609.19661 présente ReShoot, une méthode qui produit de la diversité visuelle en re-rendant des démonstrations robotiques déjà enregistrées, plutôt que d'en recollecter de nouvelles pour chaque changement d'apparence. Un modèle vision-langage décrit la scène et modifie un attribut ciblé, comme le fond, la couleur d'un objet ou un matériau, puis un générateur vidéo conditionné par les contours re-rend les deux vues caméra en conséquence ; l'instruction textuelle associée est mise à jour, mais la séquence d'actions et la trajectoire proprioceptive sont conservées à l'identique, sans réétiquetage. Sur le benchmark LIBERO, une politique entraînée à parts égales sur données réelles et re-générées obtient un taux de réussite quasi identique à un entraînement uniquement sur données réelles (96,5% contre 96,9%) et améliore la robustesse aux perturbations de scène sur LIBERO-Plus (85,5% contre 82,3%). Sur deux plateformes robotiques physiques, avec seulement 43 et 100 démonstrations pré-collectées, le taux de réussite sur des objets recolorés passe de 0% à respectivement 42,9% et 47,5%, sans dégradation des performances sur l'apparence d'origine. Ce résultat vise un point faible connu des politiques visuomotrices apprises par imitation : elles restent souvent collées aux conditions visuelles précises de leurs démonstrations d'entraînement, si bien qu'un simple changement de couleur ou de décor fait chuter drastiquement leurs performances. La parade habituelle, recollecter des démonstrations pour chaque nouveau contexte visuel, mobilise à chaque fois un robot, un environnement contrôlé et un opérateur humain, ce qui freine le déploiement à grande échelle en usine ou en entrepôt. En déplaçant l'effort de la collecte vers la génération, ReShoot suggère qu'une part significative de la robustesse visuelle recherchée par les intégrateurs peut s'obtenir sans temps robot supplémentaire ni simulation photoréaliste coûteuse à construire. Cette approche s'inscrit dans la lignée des travaux sur la randomisation de domaine et l'augmentation de données par génération, qui cherchent depuis plusieurs années à combler l'écart entre les démonstrations limitées disponibles et la diversité des conditions réelles d'exploitation. Sa particularité est de conserver intégralement les labels d'action et de proprioception du geste original, évitant le risque de réétiquetage erroné propre à d'autres pipelines génératifs. Le résumé ne précise ni les plateformes robotiques utilisées ni un calendrier de publication du code, ce qui place pour l'instant ReShoot au stade de publication de recherche plutôt que d'outil disponible pour les intégrateurs.

RecherchePaper
1 source