Aller au contenu principal
RecherchearXiv cs.RO 

FEWT : transformeur en ondelettes à fréquence améliorée pour la manipulation bimanuelle sur roues multimodale

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente FEWT (Frequency-Enhanced Wavelet-based Transformer), un framework léger d'apprentissage par imitation destiné à la manipulation bimanuelle robotisée. Les données de démonstration sont collectées via une plateforme mobile à roues équipée de deux bras et pilotée par téléopération de type exosquelette, une méthode qui permet un contrôle intuitif et une capture fidèle de gestes anthropomorphes. FEWT combine deux modules, l'attention multi-échelle FE-EMA (Frequency-Enhanced Efficient Multi-Scale Attention) et la transformée en ondelettes discrète temporelle TS-DWT, pour aligner la sémantique visuelle spatiale avec la dynamique physique locale à haute fréquence. Pour les déploiements réels, les auteurs y ajoutent un tissu tactile intelligent maison, le Smart Tactile Fabric (STF), intégré aux effecteurs terminaux, qui capte la contrainte de contact locale en complément des signaux proprioceptifs et de mouvement du châssis.

Sur des tâches d'insertion bimanuelle simulées, l'architecture FEWT améliore significativement le taux de réussite par rapport à la référence courante Action Chunking with Transformers (ACT), notamment dans les phases les plus délicates, là où se concentrent la plupart des échecs. En conditions réelles, sur des tâches de manipulation mobile et de bureau, le système complet intégrant le capteur STF s'adapte à des perturbations dynamiques microscopiques et améliore nettement les performances. Le résultat illustre un enjeu clé pour l'apprentissage par imitation en robotique : la vision seule peine à capturer les micro-ajustements de force nécessaires aux tâches de contact fin, ce qu'une modalité tactile locale permet de corriger.

FEWT s'inscrit dans une tendance de fond en robotique de manipulation, celle d'utiliser la téléopération par exosquelette pour collecter à moindre coût des démonstrations humaines de qualité et entraîner des politiques d'apprentissage par imitation sur des plateformes bimanuelles. Les auteurs se comparent explicitement à ACT, devenue une référence de facto dans ce domaine. Publiée sur arXiv (référence 2509.11109, quatrième version), l'étude reste à ce stade une contribution académique : aucune indication de déploiement industriel, de partenariat commercial ni de calendrier de commercialisation n'est fournie pour la plateforme robotique ou le capteur STF développés en interne par les auteurs.

Dans nos dossiers

À lire aussi

Démarrage à chaud par transformeur pour l'approche terminale optimale d'objets en rotation par bras manipulateur spatial
1arXiv cs.RO 

Démarrage à chaud par transformeur pour l'approche terminale optimale d'objets en rotation par bras manipulateur spatial

Une équipe de chercheurs a publié sur arXiv (réf. 2606.17317) un cadre d'apprentissage pour accélérer la génération de trajectoires en temps réel pour les bras manipulateurs spatiaux approchant des objets en rotation libre, situation typique d'un rendezvous avec des débris orbitaux ou un satellite hors service. Le système décompose le problème en deux étapes : une phase de planification translationnelle du centre de masse du système, puis une phase couplée d'allocation de couple entre l'attitude du satellite-porteur et les joints du manipulateur. C'est sur cette seconde étape, le vrai goulot d'étranglement computationnel, qu'est appliqué un "warm-start" par transformateur causal : une initialisation prédite par réseau de neurones qui donne à l'optimiseur de programmation convexe séquentielle (SCP) un point de départ déjà proche de la solution. Deux décodeurs d'action ont été comparés (linéaire et flow matching), avec différentes fenêtres d'action chunking. Sur 300 scénarios de test, l'approche réduit de 28 % le nombre d'itérations SCP et de 23 % le temps de calcul, tout en préservant la distribution du coût de contrôle final. L'impact dépasse la simple accélération : en mode projection de faisabilité non-convexe, le warm-start appris réduit le temps de calcul de près de 50 % par rapport au SCP optimal en coût, et élimine le "tail catastrophique", ces cas où une initialisation heuristique fait diverger l'optimiseur vers des trajectoires à coût prohibitif. Pour des opérations de maintenance orbitale commerciale où une trajectoire infaisable peut signifier la perte de la mission, cette robustesse compte autant que la vitesse brute. Le résultat valide l'idée que les modèles de séquences peuvent servir d'a priori appris pour des optimiseurs embarqués, sans sacrifier les garanties de faisabilité du SCP. L'on-orbit servicing est un secteur en structuration rapide : Northrop Grumman opère son MEV (Mission Extension Vehicle) depuis 2020, le japonais Astroscale conduit des démonstrations de capture (ADRAS-J, 2024), et le suisse ClearSpace a décroché un contrat ESA pour retirer le débris Vespa d'ici 2026. Ce cadre technique emprunte à l'action chunking et au flow matching issus de la robotique terrestre (Diffusion Policy, ACT), appliqués ici à la dynamique orbitale. La prochaine étape logique est la validation hardware-in-the-loop dans une chaîne GNC complète ; la publication n'annonce ni partenaire industriel ni calendrier de test.

UEClearSpace (Suisse) opère sous contrat ESA pour le retrait du débris Vespa d'ici 2026, cette technique de warm-start par transformateur pour bras spatiaux pourrait directement bénéficier aux acteurs européens structurant le secteur On-Orbit Servicing.

RecherchePaper
1 source
Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel
2arXiv cs.RO 

Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel

Une équipe de recherche a soumis sur arXiv (identifiant 2507.09180, actuellement à la version 4) une architecture de fusion multimodale pour améliorer le transfert sim-to-real en apprentissage par renforcement visuel appliqué à la manipulation robotique. L'approche combine deux flux d'entrée, RGB et profondeur (depth), traités en parallèle par des réseaux convolutifs séparés (CNN stems), dont les représentations fusionnées sont transmises à un vision transformer (ViT) scalable. L'information de profondeur, naturellement robuste aux variations d'apparence de scène, fournit des détails spatiaux 3D absents des images RGB seules. Le pipeline intègre un schéma d'apprentissage contrastif à tokens masqués et non masqués pour améliorer l'efficacité d'échantillonnage, combiné à une randomisation de domaine progressive (curriculum-based domain randomization) pour stabiliser l'entraînement. En simulation, la méthode surpasse les baselines comparées. La validation clé se fait en transfert zéro-shot : sans ré-entraînement sur données réelles, le modèle réalise des tâches de manipulation physique. Le sim-to-real gap reste l'obstacle central en robotique d'apprentissage : les politiques entraînées en simulation échouent fréquemment face à la variabilité visuelle du monde réel. La fusion RGB + depth attaque directement ce problème en réduisant la dépendance aux indices visuels fragiles comme l'éclairage ou les textures. L'apprentissage contrastif à tokens partiels suggère une meilleure invariance aux perturbations apparentes sans nécessiter de volumes massifs de données réelles. Pour les intégrateurs industriels et les équipes de développement en manipulation, le transfert zéro-shot validé expérimentalement est un signal concret : la politique capture des abstractions géométriques suffisamment générales pour opérer hors simulation, ce qui est précisément la promesse que le secteur cherche à tenir depuis des années. Ce travail s'inscrit dans une compétition de représentations visuelles pour la robotique qui inclut la randomisation de domaine agressive popularisée par OpenAI dès 2017, les encodeurs préentraînés par masquage (MAE, R3M, DINOv2), et les politiques vision-langage-action (VLA) comme pi0 de Physical Intelligence ou OpenVLA. L'originalité revendiquée est la fusion RGB + depth au niveau du transformer plutôt qu'en aval, couplée au curriculum adaptatif. Le passage à la version 4 sur arXiv signale un travail en révision active, probablement vers une conférence type ICRA ou IROS. Les prochaines étapes attendues incluent une validation sur benchmarks standardisés (RLBench, MetaWorld) et des tests sur plateformes physiques plus complexes.

RecherchePaper
1 source
Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
3arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
Apprentissage de politiques de trajectoire multi-modales pour la manipulation robotique efficace en données
4arXiv cs.RO 

Apprentissage de politiques de trajectoire multi-modales pour la manipulation robotique efficace en données

Des chercheurs ont publié le 1er juin 2026 sur arXiv (2606.01047) MATE (Multi-Modal Trajectory Policies), un cadre de prédiction de trajectoires pour la manipulation robotique construit sur une architecture Mixture-of-Experts (MoE). MATE traite simultanément des entrées hétérogènes, observations visuelles, instructions en langage naturel et représentations de trajectoires, en introduisant un routeur cosinus cross-modal qui garantit une affectation stable entre experts spécialisés, indépendamment de l'échelle des représentations. Un mécanisme de routage à température contrôlée avec injection de bruit stochastique prévient l'effondrement prématuré des experts (expert collapse). Sur le benchmark LIBERO, MATE améliore le taux de succès moyen de 4,75% par rapport aux politiques guidées par trajectoires existantes, particulièrement dans des scénarios à faible volume de données d'entraînement. Des tests en conditions réelles sur un robot jouant au ping-pong complètent la validation expérimentale. Le problème ciblé est la "modality interference" : quand une politique transformer unique traite dans le même espace de paramètres des signaux aussi disparates que des images RGB, du texte et des coordonnées de trajectoire, les représentations se perturbent mutuellement et les performances chutent. C'est un goulot d'étranglement bien documenté dans le développement des VLAs (Vision-Language-Action models) : les données de démonstration de qualité coûtent cher à collecter en environnement industriel. En proposant un découplage fin au niveau sub-token par spécialisation d'experts, MATE réduit cette interférence sans nécessiter de données supplémentaires. Pour les équipes robotique opérant avec des budgets de téléopération limités, c'est un signal positif, bien que les gains absolus (+4,75%) restent modestes et mesurés sur un benchmark académique contrôlé. La manipulation robotique généraliste est sous forte compétition depuis l'émergence des architectures transformer dédiées à la robotique vers 2022-2023. Des travaux comme ACT, Diffusion Policy, puis les VLAs OpenVLA (Berkeley/Stanford), pi0 de Physical Intelligence et GR00T N2 de NVIDIA ont progressivement unifié vision, langage et action. L'approche MoE reste moins explorée en robotique qu'en LLMs (GPT-4, Mixtral, DeepSeek-MoE), et MATE tente d'en résoudre les instabilités de routage propres aux modalités hétérogènes. Le benchmark LIBERO, développé par des institutions académiques américaines, est devenu une référence standard pour évaluer la généralisation en manipulation. À ce stade, il n'y a pas de déploiement industriel ni de partenariat annoncé : MATE est une preuve de concept académique, avec validation réelle limitée à un robot de ping-pong.

RechercheOpinion
1 source