Aller au contenu principal
FEWT : transformeur en ondelettes à fréquence améliorée pour la manipulation bimanuelle sur roues multimodale
RecherchearXiv cs.RO 

FEWT : transformeur en ondelettes à fréquence améliorée pour la manipulation bimanuelle sur roues multimodale

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente FEWT (Frequency-Enhanced Wavelet-based Transformer), un framework léger d'apprentissage par imitation destiné à la manipulation bimanuelle robotisée. Les données de démonstration sont collectées via une plateforme mobile à roues équipée de deux bras et pilotée par téléopération de type exosquelette, une méthode qui permet un contrôle intuitif et une capture fidèle de gestes anthropomorphes. FEWT combine deux modules, l'attention multi-échelle FE-EMA (Frequency-Enhanced Efficient Multi-Scale Attention) et la transformée en ondelettes discrète temporelle TS-DWT, pour aligner la sémantique visuelle spatiale avec la dynamique physique locale à haute fréquence. Pour les déploiements réels, les auteurs y ajoutent un tissu tactile intelligent maison, le Smart Tactile Fabric (STF), intégré aux effecteurs terminaux, qui capte la contrainte de contact locale en complément des signaux proprioceptifs et de mouvement du châssis.

Sur des tâches d'insertion bimanuelle simulées, l'architecture FEWT améliore significativement le taux de réussite par rapport à la référence courante Action Chunking with Transformers (ACT), notamment dans les phases les plus délicates, là où se concentrent la plupart des échecs. En conditions réelles, sur des tâches de manipulation mobile et de bureau, le système complet intégrant le capteur STF s'adapte à des perturbations dynamiques microscopiques et améliore nettement les performances. Le résultat illustre un enjeu clé pour l'apprentissage par imitation en robotique : la vision seule peine à capturer les micro-ajustements de force nécessaires aux tâches de contact fin, ce qu'une modalité tactile locale permet de corriger.

FEWT s'inscrit dans une tendance de fond en robotique de manipulation, celle d'utiliser la téléopération par exosquelette pour collecter à moindre coût des démonstrations humaines de qualité et entraîner des politiques d'apprentissage par imitation sur des plateformes bimanuelles. Les auteurs se comparent explicitement à ACT, devenue une référence de facto dans ce domaine. Publiée sur arXiv (référence 2509.11109, quatrième version), l'étude reste à ce stade une contribution académique : aucune indication de déploiement industriel, de partenariat commercial ni de calendrier de commercialisation n'est fournie pour la plateforme robotique ou le capteur STF développés en interne par les auteurs.

Dans nos dossiers

À lire aussi

MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche
1arXiv cs.RO 

MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche

Des chercheurs ont publié sur arXiv (2603.15265, version 2) l'article décrivant MoE-ACT, un framework de manipulation bimanuelle combinant mixture-of-experts et action chunking transformer. Le système insère des couches MoE éparses dans l'encodeur d'ACT, qui redirigent dynamiquement les tokens image vers des experts sélectionnés selon le contexte de la tâche, les observations visuelles et l'état proprioceptif des bras. Le décodeur d'action ajoute une modulation FiLM conditionnée à la tâche et une attention croisée multi-échelle pour ancrer précisément chaque geste dans l'espace. Sur le benchmark de simulation RoboTwin 2.0, couvrant 16 tâches bimanuelles complexes, MoE-ACT atteint un taux de réussite moyen de 62,0%, soit 17,4 points de plus que la version standard d'ACT. Avec seulement 195 millions de paramètres activés, le modèle dépasse de 5,1 points le modèle fondation Pi-0, qui compte 3,24 milliards de paramètres, seize fois plus. Des expériences complémentaires sur un robot réel à deux bras confirment ces résultats en conditions physiques, même si l'essentiel des chiffres cités provient du benchmark simulé. Code et documentation sont publiés en open source. Le résultat intéresse d'abord les intégrateurs cherchant à déployer des politiques multi-tâches sans la facture de calcul des grands modèles fondation. La manipulation bimanuelle multi-tâche bute régulièrement sur l'interférence entre tâches: une politique unique entraînée sur plusieurs tâches dégrade ses performances par rapport à des politiques spécialisées, phénomène connu comme le négative transfer. En routant dynamiquement le traitement visuel vers des experts spécialisés, MoE-ACT attaque ce problème sans multiplier les paramètres actifs à l'inférence, un argument pour l'embarque sur du matériel contraint en calcul et en énergie. Battre Pi-0, seize fois plus gros, alimente le débat sur la pertinence de la course à l'échelle en robotique généraliste: la spécialisation architecturale via MoE pourrait offrir un meilleur compromis performance/coût que le simple gonflement des foundation models, du moins sur des tâches bimanuelles bien délimitées. MoE-ACT prolonge ACT (Action Chunking Transformer), architecture d'imitation learning devenue référence pour le contrôle de bras robotiques, en y greffant le principe du mixture-of-experts déjà popularisé dans les grands modèles de langage. Il se positionne face aux modèles fondation vision-language-action comme Pi-0 (Physical Intelligence), dans un paysage où GR00T N2 (NVIDIA) ou Helix (Figure AI) visent aussi la manipulation généraliste. Marqué comme une version de remplacement sur arXiv, le travail reste un résultat de recherche validé sur benchmark simulé et un banc bimanuel réel, sans annonce de déploiement industriel ni partenariat commercial à ce stade.

RecherchePaper
1 source
PEAfowl : action vision-langage multi-vue à perception renforcée pour manipulation bimanuelle
2arXiv cs.RO 

PEAfowl : action vision-langage multi-vue à perception renforcée pour manipulation bimanuelle

Une équipe de recherche a publié sur arXiv, en version 2, un article décrivant PEAfowl, une architecture vision-langage-action (VLA) pour la manipulation bimanuelle en environnement encombré. Le modèle prédit des distributions de profondeur par token, effectue un relèvement 3D différentiable et fusionne les vues caméra par agrégation locale de voisins, au lieu de la simple concaténation de tokens des approches existantes. Pour l'ancrage des instructions, il remplace le conditionnement global du langage par une lecture de type Perceiver appliquée aux features CLIP gelées, avec accumulation itérative des indices visuels pertinents. Une distillation de profondeur, réalisée uniquement à l'entraînement via un modèle enseignant préexistant, affine les priors géométriques sans coût supplémentaire à l'inférence, ce qui compense le bruit et les trous typiques des capteurs RGB-D grand public. Sur le benchmark RoboTwin 2.0, en configuration à randomisation de domaine, PEAfowl améliore le taux de réussite de 23 points de pourcentage par rapport à la meilleure référence testée, un gain que les auteurs disent confirmé par des essais complémentaires sur robot physique. Ce travail cible deux limites connues des modèles VLA actuels: une fusion multi-vue trop grossière, qui fragilise la perception sous occlusion ou changement de point de vue, et un ancrage du langage jugé imprécis quand l'instruction sert de simple conditionnement global. Pour les intégrateurs qui évaluent des politiques VLA face à des références comme Pi-0, GR00T N2 ou Helix, ce résultat montre que la robustesse spatiale et la précision de l'ancrage linguistique restent des axes actifs de progrès plutôt que des problèmes déjà résolus. Il faut toutefois noter que le gain de 23 points est mesuré en simulation randomisée; les résultats sur robot réel, évoqués sans détail chiffré précis, relèvent à ce stade d'une validation qualitative plutôt que d'une preuve de déploiement à l'échelle. PEAfowl s'inscrit dans les travaux cherchant à réduire l'écart entre démonstrations en simulation et exécution fiable en conditions réelles pour la manipulation bimanuelle, un axe également exploré par des laboratoires industriels avec des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. L'article, classé en catégorie "replace-cross" sur arXiv, ne précise ni affiliation institutionnelle ni partenaire industriel. Un site dédié au projet est en ligne, mais aucun calendrier de publication de code ni de pilote industriel n'est annoncé pour l'instant.

RechercheActu
1 source
Démarrage à chaud par transformeur pour l'approche terminale optimale d'objets en rotation par bras manipulateur spatial
3arXiv cs.RO 

Démarrage à chaud par transformeur pour l'approche terminale optimale d'objets en rotation par bras manipulateur spatial

Une équipe de chercheurs a publié sur arXiv (réf. 2606.17317) un cadre d'apprentissage pour accélérer la génération de trajectoires en temps réel pour les bras manipulateurs spatiaux approchant des objets en rotation libre, situation typique d'un rendezvous avec des débris orbitaux ou un satellite hors service. Le système décompose le problème en deux étapes : une phase de planification translationnelle du centre de masse du système, puis une phase couplée d'allocation de couple entre l'attitude du satellite-porteur et les joints du manipulateur. C'est sur cette seconde étape, le vrai goulot d'étranglement computationnel, qu'est appliqué un "warm-start" par transformateur causal : une initialisation prédite par réseau de neurones qui donne à l'optimiseur de programmation convexe séquentielle (SCP) un point de départ déjà proche de la solution. Deux décodeurs d'action ont été comparés (linéaire et flow matching), avec différentes fenêtres d'action chunking. Sur 300 scénarios de test, l'approche réduit de 28 % le nombre d'itérations SCP et de 23 % le temps de calcul, tout en préservant la distribution du coût de contrôle final. L'impact dépasse la simple accélération : en mode projection de faisabilité non-convexe, le warm-start appris réduit le temps de calcul de près de 50 % par rapport au SCP optimal en coût, et élimine le "tail catastrophique", ces cas où une initialisation heuristique fait diverger l'optimiseur vers des trajectoires à coût prohibitif. Pour des opérations de maintenance orbitale commerciale où une trajectoire infaisable peut signifier la perte de la mission, cette robustesse compte autant que la vitesse brute. Le résultat valide l'idée que les modèles de séquences peuvent servir d'a priori appris pour des optimiseurs embarqués, sans sacrifier les garanties de faisabilité du SCP. L'on-orbit servicing est un secteur en structuration rapide : Northrop Grumman opère son MEV (Mission Extension Vehicle) depuis 2020, le japonais Astroscale conduit des démonstrations de capture (ADRAS-J, 2024), et le suisse ClearSpace a décroché un contrat ESA pour retirer le débris Vespa d'ici 2026. Ce cadre technique emprunte à l'action chunking et au flow matching issus de la robotique terrestre (Diffusion Policy, ACT), appliqués ici à la dynamique orbitale. La prochaine étape logique est la validation hardware-in-the-loop dans une chaîne GNC complète ; la publication n'annonce ni partenaire industriel ni calendrier de test.

UEClearSpace (Suisse) opère sous contrat ESA pour le retrait du débris Vespa d'ici 2026, cette technique de warm-start par transformateur pour bras spatiaux pourrait directement bénéficier aux acteurs européens structurant le secteur On-Orbit Servicing.

RecherchePaper
1 source
Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel
4arXiv cs.RO 

Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel

Une équipe de recherche a soumis sur arXiv (identifiant 2507.09180, actuellement à la version 4) une architecture de fusion multimodale pour améliorer le transfert sim-to-real en apprentissage par renforcement visuel appliqué à la manipulation robotique. L'approche combine deux flux d'entrée, RGB et profondeur (depth), traités en parallèle par des réseaux convolutifs séparés (CNN stems), dont les représentations fusionnées sont transmises à un vision transformer (ViT) scalable. L'information de profondeur, naturellement robuste aux variations d'apparence de scène, fournit des détails spatiaux 3D absents des images RGB seules. Le pipeline intègre un schéma d'apprentissage contrastif à tokens masqués et non masqués pour améliorer l'efficacité d'échantillonnage, combiné à une randomisation de domaine progressive (curriculum-based domain randomization) pour stabiliser l'entraînement. En simulation, la méthode surpasse les baselines comparées. La validation clé se fait en transfert zéro-shot : sans ré-entraînement sur données réelles, le modèle réalise des tâches de manipulation physique. Le sim-to-real gap reste l'obstacle central en robotique d'apprentissage : les politiques entraînées en simulation échouent fréquemment face à la variabilité visuelle du monde réel. La fusion RGB + depth attaque directement ce problème en réduisant la dépendance aux indices visuels fragiles comme l'éclairage ou les textures. L'apprentissage contrastif à tokens partiels suggère une meilleure invariance aux perturbations apparentes sans nécessiter de volumes massifs de données réelles. Pour les intégrateurs industriels et les équipes de développement en manipulation, le transfert zéro-shot validé expérimentalement est un signal concret : la politique capture des abstractions géométriques suffisamment générales pour opérer hors simulation, ce qui est précisément la promesse que le secteur cherche à tenir depuis des années. Ce travail s'inscrit dans une compétition de représentations visuelles pour la robotique qui inclut la randomisation de domaine agressive popularisée par OpenAI dès 2017, les encodeurs préentraînés par masquage (MAE, R3M, DINOv2), et les politiques vision-langage-action (VLA) comme pi0 de Physical Intelligence ou OpenVLA. L'originalité revendiquée est la fusion RGB + depth au niveau du transformer plutôt qu'en aval, couplée au curriculum adaptatif. Le passage à la version 4 sur arXiv signale un travail en révision active, probablement vers une conférence type ICRA ou IROS. Les prochaines étapes attendues incluent une validation sur benchmarks standardisés (RLBench, MetaWorld) et des tests sur plateformes physiques plus complexes.

RecherchePaper
1 source