Attention à vis : l'algèbre des corps rigides au cœur d'un Transformer
Des chercheurs publient sur arXiv (2610.00904) « Screw Attention », une couche de transformer qui intègre l'algèbre de la mécanique des corps rigides dans le mécanisme d'attention. Chaque token représente un corps doté d'une pose. Chaque paire de tokens porte la pose relative et, pour les articulations du robot, le « screw » (vissage) de la liaison, c'est-à-dire son torseur cinématique. La relation entre deux corps n'est donc plus une arête de graphe mais une transformation spatiale. Les messages sont transportés le long de cette relation jusque dans le repère du récepteur, tandis que les scores d'attention ne voient que des quantités invariantes au changement de repère. Les messages sont ainsi équivariants à un changement de repère indépendant à chaque token, et une seule couche peut exprimer la récurrence de vitesses de la mécanique des corps rigides. Sur LIBERO-Spatial, en simulation et à partir des poses d'objets seules (sans images ni langage), une version de 16 162 paramètres atteint 97,3 % de succès, au-dessus d'un réseau plat comptant 27 fois plus de paramètres. Si l'on change la convention de repère par maillon, son taux de succès ne bouge pas, alors que tous les autres réseaux appris tombent sous 3 %. Posée en résidu à porte sur un contrôleur analytique, la couche ajoute 17,3 points de succès en insertion. Elle reste insensible à un bruit de pose jusqu'à 10 mm et à des décalages articulaires restant dans la calibration d'usine d'un bras Franka. Le code et les politiques entraînées doivent être publiés, mais ne le sont pas encore.
L'enjeu est celui de l'efficacité en données et de la robustesse. Les politiques de manipulation apprises, y compris les VLA (vision-langage-action) actuels, réapprennent à partir de données massives des relations spatiales que la mécanique fournit en forme close, ce qui coûte cher en démonstrations et les rend fragiles face à un changement de géométrie de la scène. Le résultat sur les conventions de repère est le plus parlant pour un intégrateur : une politique qui s'effondre quand on redéfinit les axes d'un maillon est peu transférable d'un robot ou d'un outil à l'autre. La tolérance au décalage de calibration d'un Franka répond à une préoccupation concrète de déploiement. Les auteurs en tirent un critère : la géométrie est décisive lorsque la tâche exige des relations entre repères qu'aucune autre partie du système ne fournit. Cela suggère que l'échelle n'est pas la seule voie, et que des biais inductifs bien choisis peuvent remplacer des paramètres.
Il faut toutefois relativiser. Les résultats sont uniquement simulés, sur des benchmarks où l'état est donné sous forme de poses d'objets. Les 97,3 % ne disent donc rien de la perception, du langage ni du contact réel, et la comparaison porte sur des réseaux de même taille ou plus gros, non sur des VLA de pointe comme Pi-0 ou GR00T. Ce travail prolonge les architectures équivariantes (SE(3)-transformers, réseaux de graphes pour la manipulation) et la mécanique spatiale à la Featherstone, qu'il loge dans l'attention. Ce n'est pour l'instant qu'un préprint, sans pilote ni calendrier. La suite dépendra de la publication du code et d'un test sur robot physique, avec perception intégrée.
Dans nos dossiers




