Aller au contenu principal
Multi-apprentissage continu : adapter des politiques visuomotrices préentraînées à la force
RecherchearXiv cs.RO 

Multi-apprentissage continu : adapter des politiques visuomotrices préentraînées à la force

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté MuSe (Multisensory Continual Learning), une méthode permettant d'adapter une politique de manipulation robotique pré-entraînée sur la seule vision à de nouvelles modalités sensorielles, sans dégrader ses performances initiales. Publiée sur arXiv (2606.30988v1) le 30 juin 2026, l'étude part d'un constat pratique : les capteurs de force, de toucher ou audio sont souvent spécifiques à un matériel ou une tâche donnée, et les jeux de données robotiques multisensoriels à grande échelle restent rares. Il est donc impossible de pré-entraîner une politique avec tous les capteurs qu'elle pourrait rencontrer en production. MuSe résout ce problème via trois mécanismes combinés : une fusion multi-étages des signaux, une prédiction future multisensorielle, et un rejeu d'expérience (expérience replay) sur les données de pré-entraînement d'origine. Les chercheurs ont testé l'approche en ajoutant un capteur de force-couple à une politique vision-seule existante, sur des tâches de manipulation réelles impliquant du contact physique.

Cette méthode répond à un problème central pour l'industrie des politiques vision-langage-action (VLA) de type Pi-0, GR00T N2 ou RT-2/OpenVLA : ces modèles, entraînés quasi exclusivement sur des flux vidéo, échouent souvent sur les tâches à contact riche (insertion de pièces, assemblage, préhension d'objets déformables) où la seule vision ne suffit pas à détecter un glissement ou une collision. Pour les intégrateurs industriels, l'enjeu est d'ajouter un capteur de force sans devoir ré-entraîner un modèle depuis zéro ni perdre les compétences déjà acquises, un phénomène classique d'oubli catastrophique. Les résultats montrent que MuSe améliore les performances sur les tâches de contact tout en préservant, voire en améliorant légèrement, les performances sur les tâches de pré-entraînement d'origine, ce qui suggère qu'un jeu de données multisensoriel modeste suffit à étendre les capacités générales d'un robot au-delà de sa distribution initiale d'entraînement.

Le travail s'inscrit dans la tendance actuelle du secteur à généraliser des politiques robotiques pré-entraînées à grande échelle (à l'image des fondations VLA déployées par les principaux laboratoires de robotique humanoïde), plutôt qu'à ré-entraîner des modèles spécialisés par tâche. La rareté des données tactiles et de force reste un frein reconnu du secteur, contrairement à l'abondance de données vidéo. Le site du projet (jadenvc.github.io/multisensory-continual-learning) propose des démonstrations complémentaires ; les prochaines étapes annoncées concernent l'extension à d'autres modalités, comme le tactile ou l'audio, selon la même approche de fusion incrémentale.

À lire aussi

Attention à l'écart : repenser la conception des entrées-sorties pour l'apprentissage de politiques visuomotrices riches en contact
1arXiv cs.RO 

Attention à l'écart : repenser la conception des entrées-sorties pour l'apprentissage de politiques visuomotrices riches en contact

Une équipe de recherche a mis en ligne une nouvelle version (v2) de l'article arXiv "Mind the Gap: Rethinking I/O Design for Contact-Rich Visuomotor Policy Learning" (arXiv:2602.08776), consacré à un choix d'architecture resté largement implicite dans l'apprentissage de politiques robotiques par imitation à partir de données de téléopération. Lorsqu'un opérateur télécommande un bras via un dispositif maître, chaque démonstration contient deux signaux distincts : l'état d'exécution réel du robot (E) et la commande envoyée par l'opérateur (C). Une politique entraînée en E2E (exécution vers exécution) perd les écarts de commande qui génèrent justement le contact physique, tandis qu'une politique E2C (exécution vers commande) conserve ces écarts mais ignore la réponse réelle du robot. Les auteurs proposent EC2C (Dual-State Conditioning) : le modèle est conditionné simultanément sur E et C, et prédit l'évolution future de C, ce qui transforme l'écart commande-exécution en signal exploitable de contact, de latence, de charge transportée et de compensation gestuelle, souvent corrélé à la force appliquée en régime quasi statique. Testée sur un montage bas coût, sans capteur de force, sans peau tactile ni retour de courant moteur, EC2C surpasse E2E et une référence E2C renforcée sur plusieurs tâches réelles combinant contact, sensibilité aux forces et dynamique rapide. L'intérêt pratique vise directement les intégrateurs : obtenir un signal proxy de force sans capteur dédié réduit le coût et la complexité du matériel, un enjeu central pour les bras et mains robotiques manipulant des objets fragiles ou en contact prolongé. Le résultat interroge aussi une pratique répandue dans les pipelines d'entraînement de politiques vision-langage-action (VLA), où le choix d'enregistrer l'exécution, la commande, ou les deux, est rarement documenté ni justifié, alors qu'il conditionne directement la capacité du modèle à généraliser des comportements de contact fin. Les auteurs restent prudents sur la portée de leurs résultats : les gains sont démontrés sur un nombre limité de tâches et un seul montage matériel, non encore validés à l'échelle de déploiements industriels ni comparés sur des plateformes commerciales. Ce travail s'inscrit dans un courant de recherche qui cherche à combler l'écart entre démonstrations de téléopération et politiques robustes en conditions réelles, particulièrement pour les tâches à contact riche où le clonage comportemental classique échoue souvent faute de signal de force exploitable. Au-delà du réglage E/C, les auteurs formulent une extension nommée latency-adaptive inpainting, pensée pour les politiques à prédiction d'actions par blocs (action chunking), et discutent des conditions dans lesquelles un historique temporel long aide l'inférence de comportements dynamiques ou, au contraire, introduit une confusion causale qui dégrade l'apprentissage. Aucun partenaire industriel, aucune plateforme commerciale ni aucun calendrier de déploiement ne sont mentionnés à ce stade : il s'agit d'une contribution méthodologique destinée à orienter la conception des futurs pipelines de collecte de données de téléopération, pas d'un produit ou d'un pilote annoncé.

RecherchePaper
1 source
Ordered Action Tokens pour l'apprentissage de politiques visuomotrices
2arXiv cs.RO 

Ordered Action Tokens pour l'apprentissage de politiques visuomotrices

Des chercheurs publient sur arXiv (arXiv:2607.21670v1) une nouvelle méthode de tokenisation d'actions pour les politiques visuomotrices de robots, baptisée OAT (Ordered Action Tokenization). Le problème visé est concret : pour piloter un bras ou un robot humanoïde via un modèle vision-langage-action (VLA), il faut convertir des séquences d'actions continues en tokens discrets, une étape clé de l'architecture. Les méthodes existantes échouent sur deux fronts, soit elles produisent des séquences de tokens beaucoup trop longues, soit elles génèrent des tokens latents appris mais sans structure interne, ce qui les rend peu compatibles avec les politiques de contrôle en aval. OAT combine un transformer à registres, une quantification scalaire finie et des mécanismes d'entraînement qui imposent un ordre aux tokens produits. Concrètement, chaque préfixe de la séquence de tokens est entraîné à pouvoir, à lui seul, se décoder en une action valide, les premiers tokens portant l'information de contrôle grossière et les suivants affinant les détails résiduels. Les auteurs ont testé la méthode sur trois architectures de politiques différentes et plus de 60 tâches, couvrant cinq bancs d'essai en simulation ainsi que des scénarios réels. Cette structure ordonnée change la donne opérationnelle : elle permet un compromis "anytime" entre coût de calcul à l'inférence et précision du geste, un point critique pour le déploiement embarqué où la latence contraint directement la cadence de contrôle. Pour les intégrateurs travaillant avec des politiques autorégressives ou des architectures hybrides combinant tokens et experts de type flow, cela ouvre la possibilité d'ajuster dynamiquement le compromis vitesse-précision sans changer de modèle, un besoin réel face aux VLA actuels souvent jugés trop lents pour du contrôle temps réel industriel. Le travail s'inscrit dans la lignée des tokenizers d'actions développés pour les politiques VLA type Pi-0 ou GR00T N2, où l'encodage des actions reste un goulot d'étranglement identifié par la recherche depuis l'essor de ces modèles. En comparant explicitement autorégression pure et co-entraînement par tokens dans un cadre flow-based, les auteurs positionnent OAT comme une brique d'interface générique, potentiellement réutilisable au-delà des architectures testées dans l'étude.

RechercheActu
1 source
Apprentissage de politiques visuomotrices robustes par correspondance de flux à trajectoires cohérentes
3arXiv cs.RO 

Apprentissage de politiques visuomotrices robustes par correspondance de flux à trajectoires cohérentes

Une équipe de recherche publie sur arXiv (arXiv:2605.08511, mai 2026) une méthode pour corriger un défaut structurel des politiques de type flow matching appliquées à la manipulation robotique. Ces architectures apprennent des champs de vitesse continus pour convertir du bruit en séquences d'actions, permettant une inférence déterministe rapide. Le problème identifié est un écart fondamental entre entraînement et inférence : l'objectif d'entraînement optimise une vitesse ponctuelle, tandis que l'inférence requiert l'intégration numérique de ce champ sur une trajectoire complète. Les erreurs s'accumulent et dégradent les performances. La méthode proposée, baptisée TC-Flow, associe quatre correctifs complémentaires : une régression de vitesse par rectified flow auxiliaire pour une supervision uniforme sur l'intervalle temporel, un entraînement par cohérence de trajectoire multi-étapes qui supervise directement le déplacement intégré, une régularisation du champ de vitesse pour forcer la continuité temporelle, et un intégrateur de Runge-Kutta d'ordre 4 (RK4) à l'inférence pour réduire l'erreur de discrétisation. Un encodeur de nuage de points 3D à double vue, basé sur deux PointNet indépendants, complète l'architecture. Validée sur un bras Franka et un robot quadrupède Boston Dynamics Spot, la méthode atteint 70 % et 60 % de succès sur deux tâches longue-horizon multi-phases où les deux baselines de référence stagnent à 0 %, et 100 % sur une tâche de placement d'outil de précision. Trois tâches de simulation MetaWorld confirment les gains. Ce résultat est significatif pour les équipes qui développent des VLAs (vision-language-action) basées sur le flow matching : il démontre que le sim-to-real gap et l'échec sur les tâches longue-horizon ne viennent pas nécessairement de la représentation sensorielle ou de la politique en elle-même, mais du désalignement train-inférence. Le passage de 0 % à 60-70 % sur les mêmes tâches en corrigeant uniquement cet écart est un signal fort. L'ablation confirme que les quatre composants sont nécessaires en synergie : RK4 seul sans champ lisse échoue, et la régularisation sans supervision trajectoire dérive quand même. Dans le contexte du marché, le flow matching pour la robotique a été popularisé par Physical Intelligence avec pi-0, qui domine aujourd'hui les benchmarks de manipulation généraliste, et par des travaux comme ACT ou Diffusion Policy. TC-Flow se positionne comme une correction algorithmique orthogonale, applicable à toute architecture flow matching existante. Il s'agit d'un preprint arXiv sans code public annoncé à ce stade, ni déploiement industriel. Les prochaines étapes naturelles seraient une validation sur des tâches bi-manuelles ou sur des plateformes humanoïdes, terrain où les erreurs cumulées de trajectoire sont particulièrement pénalisantes.

RechercheOpinion
1 source
Robots à trois bras : apprentissage par imitation visuomotrice de politiques robotiques
4arXiv cs.RO 

Robots à trois bras : apprentissage par imitation visuomotrice de politiques robotiques

Voici l'article traduit et résumé. Une équipe de recherche présente TriManPolicy, un système d'apprentissage par imitation conçu pour piloter des robots à trois bras simultanément. Le problème de départ est concret : la téléopération bi-manuelle classique fonctionne bien quand le nombre de canaux de contrôle correspond entre l'opérateur humain et le robot, mais elle échoue dès qu'un robot dispose d'un troisième bras, puisqu'un seul opérateur ne peut piloter en continu que deux membres à la fois. Basculer entre paires de bras force alors à enregistrer des mouvements indépendants de façon séquentielle, ce qui pousse l'apprentissage par clonage comportemental à reproduire des délais imposés par l'interface de contrôle plutôt que par la tâche elle-même. Le composant central de TriManPolicy est le Dependency-Aware Tri-Arm Scheduling (DATS), un algorithme qui retraite les démonstrations hors ligne : il conserve les segments sensorimoteurs locaux tels que démontrés mais les repositionne dans le temps selon des contraintes d'ordre des tâches et d'usage des bras, validées par un humain. Le résultat entraîne une politique unique et synchrone pour les trois bras, sans nécessiter le graphe de dépendances ni le planificateur au moment du déploiement. Sur six tâches réelles complexes, les politiques entraînées sur données retimées par DATS montrent une coordination plus efficace, avec un taux de succès comparable aux méthodes classiques. Cette avancée s'attaque à un goulot d'étranglement peu discuté de la robotique humanoïde et multi-bras : la collecte de données de démonstration reste le facteur limitant pour entraîner des politiques visuomotrices de type VLA, et les systèmes à trois bras ou plus (bras additionnels, mains bimanuelles montées sur base mobile) sont de plus en plus courants dans les plateformes industrielles. En prouvant qu'il est possible de découpler la structure temporelle de la démonstration humaine de celle exigée par la tâche, TriManPolicy ouvre la voie à une collecte de données plus rapide et moins coûteuse pour des architectures robotiques complexes, un enjeu direct pour les intégrateurs qui cherchent à réduire le coût par démonstration sans sacrifier la qualité de coordination entre membres. Ce travail s'inscrit dans la lignée plus large des recherches sur l'apprentissage par imitation visuomoteur, où la majorité des systèmes existants (type ALOHA, Mobile ALOHA ou les plateformes bimanuelles standard) suppose une correspondance stricte entre canaux de téléopération humains et effecteurs robotiques. En proposant une méthode de retiming offline validée par supervision humaine plutôt qu'un simple filtrage des temps morts, les auteurs montrent que DATS modifie réellement la structure de supervision entre bras. Les six tâches testées en conditions réelles suggèrent une piste concrète pour les futurs travaux sur les architectures à quatre bras ou plus, notamment pour les robots humanoïdes à deux bras plus une base mobile ou un troisième effecteur dédié à une tâche auxiliaire.

RecherchePaper
1 source