Aller au contenu principal
RecherchearXiv cs.RO 

Retissage de la sémantique, de la dynamique et du contrôle : un transformeur à trois flux centré sur l'action, simple mais efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2610.11416v1) ACT³, pour Action-Centric Tri-Stream Transformer, une architecture de politique robotique qui combine trois flux de calcul. Un modèle vision-langage (VLM) apporte la compréhension sémantique. Un modèle du monde (WM) génératif de vidéo apporte la prédiction de dynamique. Un « expert d'action » produit les commandes. Cet expert accède aux représentations des deux backbones par attention couche par couche, et chaque backbone n'attend qu'à l'intérieur de son propre flux. Les flux se propagent donc indépendamment, mais les deux backbones restent mis à jour par la supervision de contrôle. Les auteurs affirment des résultats supérieurs aux approches comparables sur des benchmarks de manipulation en simulation et en conditions réelles. Le résumé ne donne ni taux de réussite, ni noms de benchmarks, ni plateforme matérielle, ni coût de calcul : il s'agit d'un preprint de recherche, sans produit ni déploiement.

L'intérêt tient au problème que cible ce travail. Les VLA (Vision-Language-Action) héritent de VLM pré-entraînés riches en sémantique mais pauvres en connaissances de physique, ce qui limite la généralisation des politiques. Greffer un modèle du monde corrige ce manque, mais la manière de fusionner sémantique et dynamique reste ouverte. ACT³ défend une solution volontairement simple, sans mélange des représentations, qui préserve les rôles distincts de chaque source. Si le gain se confirme, c'est un schéma réutilisable pour les équipes qui assemblent des politiques à partir de briques pré-entraînées. Deux réserves s'imposent. Faire tourner un générateur de vidéo à l'inférence pèse sur la latence et le budget GPU, et rien n'est chiffré ici. Les résultats annoncés sans valeurs ne permettent pas non plus d'évaluer l'écart entre démonstration et fiabilité industrielle.

Ce travail s'inscrit dans la lignée des VLA bâtis sur des VLM, comme Pi-0 de Physical Intelligence ou GR00T de NVIDIA, dont l'expert d'action dédié est le modèle évident. Il suit aussi la vague récente de politiques qui injectent des modèles du monde vidéo pour anticiper les conséquences physiques des actions. La suite dépendra d'éléments que le résumé ne fournit pas : publication du code et des poids, comparaisons indépendantes avec des baselines établies, et mesures de fréquence de contrôle sur robot réel.

À lire aussi

Apprentissage de la prise et du transport multi-humanoïdes via un contrôle décentralisé centré sur l'objet
1arXiv cs.RO 

Apprentissage de la prise et du transport multi-humanoïdes via un contrôle décentralisé centré sur l'objet

Une équipe de recherche publie sur arXiv (référence 2609.17824, soumission de septembre 2026) une étude consacrée à la manipulation coopérative multi-humanoïdes : plusieurs robots bipèdes soulèvent et transportent ensemble un même objet dont la taille, le poids et la géométrie varient, avec une taille d'équipe qui s'adapte à la tâche. La méthode, baptisée contrôle décentralisé centré sur l'objet, attribue à chaque humanoïde une zone d'attache locale sur l'objet partagé ; chaque robot apprend à réaliser la prise et le transport par un pincement bimanuel sans pince dédiée (gripperless bimanual pinching), c'est-à-dire en utilisant directement ses deux mains articulées. Cette interface d'attache sert d'abstraction de contrôle commune, valable aussi bien pour la prise par un seul robot que pour le transport à plusieurs ou le passage de main à main (handover) entre robots, sans qu'il faille reconcevoir l'algorithme pour chaque cas de figure. Les auteurs valident l'approche en simulation sur des tailles d'équipe et des géométries d'objets variées, puis démontrent un transfert sim-to-real sur du matériel réel, où les contrôleurs appris permettent à de vrais robots humanoïdes d'exécuter des tâches de manipulation coopérative. Le résultat le plus significatif pour le secteur est que des politiques entraînées uniquement sur la prise par un robot seul se transfèrent déjà de façon non triviale à des scénarios coopératifs à plusieurs robots, ce qui suggère que l'abstraction par zone d'attache capture une grande partie de la structure nécessaire à la coordination. Un entraînement multi-robot explicite améliore néanmoins encore les performances, preuve que le couplage via l'objet partagé introduit une dynamique de coordination qu'il vaut la peine d'apprendre directement plutôt que de la déduire. Pour les intégrateurs et les décideurs industriels qui envisagent des flottes d'humanoïdes en logistique ou en usine, ce travail attaque un vrai goulot d'étranglement : la manutention d'objets encombrants ou lourds nécessitant plusieurs robots reste peu résolue, et une abstraction unique évitant de reprogrammer chaque configuration d'équipe réduirait fortement le coût d'ingénierie du déploiement. Ce travail s'inscrit dans la vague plus large des politiques apprises pour la manipulation robotique, où la question du passage du simple robot isolé à la coordination multi-agents reste un axe de recherche actif à mesure que les humanoïdes commerciaux se multiplient. L'abstract ne précise ni les auteurs, ni le laboratoire, ni la plateforme humanoïde utilisée pour les essais matériels, ce qui est courant pour une prépublication arXiv en cours d'évaluation. Il s'agit d'un travail de recherche à ce stade, validé en simulation et sur du matériel réel en conditions contrôlées, sans annonce de produit, de pilote industriel ni de calendrier de déploiement commercial.

RecherchePaper
1 source
Look, Focus, Act : apprentissage robotique efficace et robuste grâce au regard humain et aux transformeurs à vision fovéale
2arXiv cs.RO 

Look, Focus, Act : apprentissage robotique efficace et robuste grâce au regard humain et aux transformeurs à vision fovéale

Des chercheurs du Soltani Lara Lab publient GIAVA (Gaze Integrated Active-Vision ALOHA), un système de vision robotique qui reproduit les mouvements de tête et de cou humains ainsi que l'ajustement du regard pour un traitement visuel "fovéalisé", c'est-à-dire concentré sur les zones pertinentes de la scène plutôt que sur l'image entière. Le système étend la plateforme robotique AV-ALOHA et s'appuie sur un nouveau cadre de collecte de données permettant d'enregistrer simultanément le suivi oculaire, le contrôle de la perspective et les démonstrations de manipulation d'un opérateur humain. L'équipe publie en open source un benchmark de simulation et un jeu de données associé. Techniquement, l'innovation centrale consiste à intégrer l'information de regard dans les Vision Transformers (ViT), très utilisés en apprentissage robotique, via un schéma de tokenisation par patchs fovéalisée : au lieu de découper l'image en patchs uniformes, le système alloue davantage de "tokens" aux zones fixées par le regard et moins au reste, réduisant fortement leur nombre total et donc le coût de calcul. Cette approche s'attaque à un angle mort classique de la vision robotique actuelle, qui traite généralement l'image caméra de façon passive et uniforme, contrairement à la vision humaine, structurée par l'attention active. Pour les équipes qui entraînent des politiques robotiques par imitation ou VLA (Vision-Language-Action), le résultat est double : une baisse significative de la charge de calcul, un enjeu concret pour l'embarqué et le temps réel, et une robustesse accrue face aux distracteurs visuels en arrière-plan, un problème récurrent dans le passage simulation-réel. Les auteurs rapportent même des gains de taux de réussite sur certaines tâches de haute précision, suggérant que la fovéalisation n'est pas qu'une optimisation de coût mais peut aussi améliorer la performance brute. Ce travail s'inscrit dans la lignée des recherches sur la segmentation d'image fovéalisée et prolonge la plateforme AV-ALOHA, déjà utilisée pour la téléopération à vision active. En ouvrant le code, le simulateur et le jeu de données, les auteurs positionnent le regard humain comme un biais inductif encore sous-exploité pour les futures architectures de perception robotique, avec des développements attendus sur des tâches de manipulation plus complexes et des déploiements matériels réels.

RecherchePaper
1 source
Apprentissage de la manipulation robotique à force régulée avec une pince tactile à contrôle de force à faible coût
3arXiv cs.RO 

Apprentissage de la manipulation robotique à force régulée avec une pince tactile à contrôle de force à faible coût

Des chercheurs présentent TF-Gripper, une pince parallèle à force contrôlée dont le coût avoisine 150 dollars. Elle intègre un retour tactile et couvre une plage de force effective de 0,45 à 45 N. Elle se monte sur différents bras robotiques. Les auteurs l'associent à un dispositif de téléopération qui enregistre les forces de préhension appliquées par un opérateur humain. Ils proposent aussi RETAF (REactive Tactile Adaptation of Force), un cadre logiciel qui sépare le contrôle de la force de serrage de la prédiction de pose de l'effecteur. RETAF régule la force à haute fréquence à partir d'images de poignet et du retour tactile. Une politique de base prédit, elle, la pose de l'effecteur et l'ordre d'ouverture ou de fermeture. Les expériences portent sur six tâches réelles. Le contrôle direct de la force y améliore la stabilité de la prise et la performance globale par rapport au contrôle en position. Selon les auteurs, RETAF surpasse systématiquement les références testées et s'intègre à plusieurs politiques de base. Le travail est publié sur arXiv (version 2), avec une page de projet associée. Il s'agit d'un résultat de laboratoire, sans déploiement industriel ni produit commercialisé. L'enjeu tient à un angle mort de l'apprentissage par imitation et des modèles vision-langage-action (VLA). La plupart des pinces du marché sont soit chères, soit limitées par une force minimale trop élevée. Elles sont donc inadaptées aux objets fragiles du quotidien, comme les chips, qui se brisent si la force n'est pas modulée. Une pince à 150 dollars capable de descendre sous 0,5 N abaisse nettement le coût d'entrée pour les laboratoires qui étudient la manipulation sensible à la force. Pour les intégrateurs, le résultat suggère que le contrôle en force doit tourner sur une boucle rapide et dédiée. Les politiques génériques à basse fréquence peuvent être entraînées sur des données de force, mais les auteurs reconnaissent que leur fiabilité reste difficile à obtenir, car la tâche est réactive et dépend du contact. Il faut toutefois rester prudent. Six tâches en laboratoire ne disent rien de la durabilité de la pince, de la dérive des capteurs tactiles ni de la répétabilité en cadence industrielle. Le résumé ne donne pas non plus les taux de réussite chiffrés. Ce travail s'inscrit dans le déplacement de la recherche en manipulation, de la seule géométrie vers le contact. Les pinces tactiles et les mains dextres sont aujourd'hui souvent coûteuses ou propriétaires. Les politiques de type Pi-0 ou les VLA actuels se concentrent surtout sur la pose de l'effecteur et sur un état binaire de la pince. La séparation entre politique de base et régulation de force de RETAF est modulaire, ce qui la rend compatible avec ces architectures. Les auteurs affichent l'ambition de faire passer à l'échelle l'apprentissage de politiques à force contrôlée. Pour cela, il faudrait des jeux de données de force plus larges, collectés avec leur dispositif de téléopération, et des validations sur des objets plus variés. Aucun calendrier de commercialisation n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Apprentissage du contrôle de mouvement basse fréquence pour une locomotion robotique robuste et dynamique
4arXiv cs.RO 

Apprentissage du contrôle de mouvement basse fréquence pour une locomotion robotique robuste et dynamique

Des chercheurs du groupe Dynamic Robot Systems de l'université d'Oxford démontrent qu'un contrôleur de locomotion appris peut fonctionner à seulement 8 Hz sur un quadrupède ANYmal C réel, là où la pratique courante pousse la fréquence de commande très haut pour gagner en réactivité. Le robot atteint de façon répétable une vitesse de 1,5 m/s, franchit des terrains irréguliers et résiste à des perturbations externes imprévues. Les auteurs comparent aussi des politiques d'apprentissage par renforcement profond (deep RL) entraînées et exécutées de 5 Hz à 200 Hz. Résultat central : les politiques basses fréquences se montrent moins sensibles aux latences d'actionnement et aux variations de la dynamique du système. Au point qu'un transfert simulation-réel réussit sans randomisation de la dynamique ni modélisation des actionneurs. Le code d'entraînement et de déploiement est publié, avec une analyse étendue, pour permettre la reproduction. Il s'agit d'une version révisée (v3) d'un article déposé en 2022 sur arXiv, et non d'une nouveauté. L'enjeu est d'abord économique et d'ingénierie. Réduire la fréquence de commande allège la charge de calcul embarquée, ce qui ouvre la voie à des processeurs plus modestes, moins énergivores et moins coûteux. Cela compte pour les intégrateurs et les fabricants de robots à pattes, dont les budgets de masse et de batterie sont serrés. Surtout, le résultat s'attaque à l'une des principales difficultés du sim-to-real : la fabrication de simulateurs et de modèles d'actionneurs très fidèles, ainsi que l'ajustement fin de la randomisation de domaine. Si un simple abaissement de la fréquence suffit à absorber une partie de l'écart de réalité, le pipeline de déploiement se simplifie. Il faut toutefois nuancer. La démonstration porte sur un seul robot, l'ANYmal C, et sur une tâche de locomotion aveugle ou proche de celle-ci. Les 1,5 m/s restent modestes face aux records de vitesse des quadrupèdes. Rien ne prouve que la conclusion s'étende à des humanoïdes, plus instables, ni à la manipulation, où des boucles rapides restent souvent nécessaires. Ces travaux contredisent l'idée répandue selon laquelle plus de fréquence signifie plus de robustesse, et ils s'inscrivent dans la recherche sur la locomotion par RL née des travaux d'ETH Zurich et d'ANYbotics, constructeur de l'ANYmal. Aujourd'hui, les politiques de locomotion des quadrupèdes comme des humanoïdes tournent typiquement autour de 50 Hz, avec des contrôleurs bas niveau à plusieurs kHz. Les modèles VLA (vision-langage-action) actuels, eux, produisent des actions à basse fréquence et s'appuient sur des contrôleurs rapides en dessous, ce qui rend cette étude pertinente pour l'architecture hiérarchique de ces systèmes. La suite logique serait de tester l'approche sur d'autres morphologies, notamment bipèdes, et de l'intégrer à des pipelines de déploiement à grande échelle.

RecherchePaper
1 source