
Wrench-ACT : améliorer les politiques robotiques pour les tâches riches en contacts grâce au contrôle direct des torseurs d'effort
Des chercheurs proposent Wrench-ACT, une politique d'apprentissage par imitation qui prédit des « wrenches » (torseurs effort/couple, soit force et moment) comme unique sortie d'action, transmises directement à un contrôleur de force pur. L'architecture de base est ACT (Action Chunking with Transformers). Les modèles sont entraînés tâche par tâche sur des démonstrations bilatérales de wrenches, puis évalués sur cinq tâches de manipulation riche en contacts. Selon les auteurs, la politique égale ou dépasse les références fondées sur la position sur les cinq tâches, avec des gains variables selon le degré de régulation délibérée de la force que chaque tâche exige. Des ablations croisées indiquent que l'interface de collecte bilatérale et l'espace d'action en wrenches contribuent chacun de façon indépendante à la performance. Plus de 1000 démonstrations en wrenches seront publiées sur un site compagnon à la parution. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Le résumé ne donne ni taux de réussite chiffrés, ni robot utilisé, ni description précise des tâches.
L'enjeu est de sortir du paradigme dominant, où les politiques apprises (ACT, Diffusion Policy, et la plupart des VLA) prédisent des positions ou des poses cibles. Même quand la force est mesurée, elle sert souvent d'observation seule, ou bien elle est prédite puis exécutée par un contrôleur hybride force/position. Ici, la politique pilote directement l'interaction physique. Le résultat le plus utile pour un intégrateur porte sur les données. La qualité de la démonstration dépend de la téléopération à retour d'effort, qui capte la régulation volontaire de la force par l'opérateur. Une téléopération purement cinématique ne la capte pas. Cela pèse sur les cas d'usage industriels comme l'assemblage, l'insertion, le ponçage ou le polissage, où la position seule est fragile. Cela suggère aussi que le goulot d'étranglement se déplace vers l'instrumentation de la collecte, avec des maîtres à retour de force plus coûteux et plus complexes que les manettes ou les exosquelettes courants. Un bémol s'impose : les gains restent modestes sur les tâches qui demandent peu de contrôle de force, et on ne sait pas si l'approche se généralise au-delà de modèles mono-tâche.
Ce travail s'inscrit dans le prolongement d'ACT, popularisé par les plateformes ALOHA, et des efforts pour ajouter le toucher et la force aux politiques visuo-motrices. Il se place face aux approches hybrides et aux VLA généralistes, qui restent surtout centrés sur la position. La diffusion du jeu de données pourra servir de référence commune si sa qualité se confirme. Les prochaines étapes à surveiller sont les tests multi-tâches, l'intégration dans des modèles de fondation et des essais sur des lignes industrielles réelles.
Dans nos dossiers



