Aller au contenu principal
RecherchearXiv cs.RO 

Attention à vis : l'algèbre des corps rigides au cœur d'un Transformer

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.00904) « Screw Attention », une couche de transformer qui intègre l'algèbre de la mécanique des corps rigides dans le mécanisme d'attention. Chaque token représente un corps doté d'une pose. Chaque paire de tokens porte la pose relative et, pour les articulations du robot, le « screw » (vissage) de la liaison, c'est-à-dire son torseur cinématique. La relation entre deux corps n'est donc plus une arête de graphe mais une transformation spatiale. Les messages sont transportés le long de cette relation jusque dans le repère du récepteur, tandis que les scores d'attention ne voient que des quantités invariantes au changement de repère. Les messages sont ainsi équivariants à un changement de repère indépendant à chaque token, et une seule couche peut exprimer la récurrence de vitesses de la mécanique des corps rigides. Sur LIBERO-Spatial, en simulation et à partir des poses d'objets seules (sans images ni langage), une version de 16 162 paramètres atteint 97,3 % de succès, au-dessus d'un réseau plat comptant 27 fois plus de paramètres. Si l'on change la convention de repère par maillon, son taux de succès ne bouge pas, alors que tous les autres réseaux appris tombent sous 3 %. Posée en résidu à porte sur un contrôleur analytique, la couche ajoute 17,3 points de succès en insertion. Elle reste insensible à un bruit de pose jusqu'à 10 mm et à des décalages articulaires restant dans la calibration d'usine d'un bras Franka. Le code et les politiques entraînées doivent être publiés, mais ne le sont pas encore.

L'enjeu est celui de l'efficacité en données et de la robustesse. Les politiques de manipulation apprises, y compris les VLA (vision-langage-action) actuels, réapprennent à partir de données massives des relations spatiales que la mécanique fournit en forme close, ce qui coûte cher en démonstrations et les rend fragiles face à un changement de géométrie de la scène. Le résultat sur les conventions de repère est le plus parlant pour un intégrateur : une politique qui s'effondre quand on redéfinit les axes d'un maillon est peu transférable d'un robot ou d'un outil à l'autre. La tolérance au décalage de calibration d'un Franka répond à une préoccupation concrète de déploiement. Les auteurs en tirent un critère : la géométrie est décisive lorsque la tâche exige des relations entre repères qu'aucune autre partie du système ne fournit. Cela suggère que l'échelle n'est pas la seule voie, et que des biais inductifs bien choisis peuvent remplacer des paramètres.

Il faut toutefois relativiser. Les résultats sont uniquement simulés, sur des benchmarks où l'état est donné sous forme de poses d'objets. Les 97,3 % ne disent donc rien de la perception, du langage ni du contact réel, et la comparaison porte sur des réseaux de même taille ou plus gros, non sur des VLA de pointe comme Pi-0 ou GR00T. Ce travail prolonge les architectures équivariantes (SE(3)-transformers, réseaux de graphes pour la manipulation) et la mécanique spatiale à la Featherstone, qu'il loge dans l'attention. Ce n'est pour l'instant qu'un préprint, sans pilote ni calendrier. La suite dépendra de la publication du code et d'un test sur robot physique, avec perception intégrée.

À lire aussi

Transformeur de navigation visuelle à attention de pose
1arXiv cs.RO 

Transformeur de navigation visuelle à attention de pose

Une équipe de recherche a publié le 21 septembre 2026 sur arXiv, sous la référence 2609.21212, VNT-PA (Visual Navigation Transformer with Pose Attention), un planificateur de navigation robotique dont le contexte visuel, un ensemble d'images de profondeur, est indexé par la pose de la caméra plutôt que par l'ordre temporel des observations: l'attention du transformeur dépend ainsi des écarts de position entre les prises de vue, pas de leur chronologie. Entraîné par imitation d'un planificateur de plus court chemin calculé sur le maillage exact de la scène, il prédit ses actions à partir de sa seule pose courante et de la position de l'objectif. Sur la navigation vers un point cible dans les scènes de validation du jeu de données HM3D, VNT-PA atteint 93,3% de réussite et un score SPL, la réussite pondérée par la longueur du trajet, de 90,4%, devançant les modèles qui codent le même contexte en séquence temporelle ou traitent la pose comme une simple donnée d'entrée, aussi bien en performance qu'en efficacité d'entraînement. Cette méthode répond à une limite connue des politiques de navigation apprises: leur difficulté à réutiliser l'expérience de traversées antérieures d'un même lieu sans construire une carte ou un graphe topologique explicite, coûteux à maintenir et sensible au bruit. En indexant le contexte par pose plutôt que par le temps, VNT-PA permet de fusionner au moment du test des images issues de trajectoires différentes, et se dégrade plus progressivement qu'un planificateur appuyé sur une carte explicite lorsque la localisation devient bruitée, un point sensible pour tout déploiement réel où l'odométrie n'est jamais parfaite. Pour les concepteurs de robots mobiles et d'AMR, le résultat suggère qu'un historique d'observations horodaté par la pose peut servir directement de représentation d'environnement, sans module de cartographie dédié, tout en accélérant l'entraînement sur des horizons de navigation longs. Ces travaux prolongent deux familles de méthodes de navigation visuelle par apprentissage: les transformeurs à encodage temporel, peu aptes à réutiliser l'expérience passée, et les systèmes à carte ou graphe topologique explicite, plus robustes à la réutilisation mais coûteux à construire. VNT-PA se compare directement aux deux approches sur le même protocole HM3D, y compris à une variante où la pose est simplement ajoutée comme caractéristique d'entrée plutôt qu'utilisée comme encodage positionnel de l'attention, ce qui isole précisément l'apport de la méthode. Publié comme préprint sur arXiv, le travail reste à ce stade une contribution validée en simulation, sans portage annoncé vers un robot physique ni partenariat industriel.

RecherchePaper
1 source
EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain
2arXiv cs.RO 

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain

Des chercheurs publient EgoHumanoid-V2 (arXiv 2609.37181), un cadre de transfert de compétences d'un humain vers un robot humanoïde à partir de vidéos égocentriques, c'est-à-dire filmées depuis le point de vue de l'opérateur. Il vise la loco-manipulation coordonnée du corps entier, où la marche et l'usage des bras sont planifiés ensemble. Son cœur est un alignement d'actions « du grossier au fin ». Une première étape corrige la référence cinématique. Une seconde affine le résultat en tenant compte de la dynamique, ce qui améliore la précision de pose de l'effecteur final tout en préservant la coordination corps entier. Pour réduire l'écart visuel entre l'humain et le robot, l'équipe ajoute un rendu du bras robotique dans les images humaines, ainsi qu'une augmentation d'images à l'entraînement pour gagner en robustesse au changement de point de vue. Sur quatre tâches réelles, des politiques VLA (vision-langage-action) entraînées sur ces données humaines alignées réalisent un transfert « zéro-shot », sans aucune démonstration robot sur la tâche cible. Les scores sont annoncés comme comparables à ceux de politiques entraînées par téléopération, pour un coût de collecte plus faible. Le résumé ne donne ni le robot utilisé, ni le nombre de démonstrations, ni le coût chiffré. L'enjeu est d'abord économique. La téléopération reste le principal goulot d'étranglement des politiques humanoïdes : elle exige des robots, des opérateurs formés et du temps machine, et ses volumes plafonnent bien en dessous de ce que réclame un modèle généraliste. Filmer des humains est bien moins cher et couvre une diversité de scènes que aucun parc de robots ne peut reproduire. Si le résultat se confirme, il indique que la donnée humaine peut servir de supervision directe de compétences, et non plus seulement de préentraînement de la perception. Pour un intégrateur, cela ouvrirait la voie à des compétences apprises sur site sans mobiliser de robot. Il faut toutefois rester prudent : quatre tâches, une comparaison « comparable » sans écart chiffré dans le résumé, et un article en version préliminaire (v1) qui n'a pas passé de relecture par les pairs. Rien ne dit non plus que ces scores tiennent hors du laboratoire, sur des cadences industrielles. Ce travail prolonge une première génération de méthodes égocentriques qui misait surtout sur la généralisation de scènes, avec un contrôle découplé entre locomotion et manipulation, ce qui laissait de côté les compétences corps entier coordonnées. Il s'inscrit dans une course plus large à la donnée humaine : les grands acteurs des modèles fondation humanoïdes, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0, cherchent tous à réduire leur dépendance à la téléopération, par la simulation, la vidéo humaine ou les deux. Aucun déploiement ni calendrier commercial n'est annoncé ici, il s'agit d'une contribution de recherche. La suite logique serait un test sur davantage de tâches et de morphologies, avec des comparaisons chiffrées de coût et de performance face à la téléopération.

RecherchePaper
1 source
ValueFormer : une fonction de valeur transformer causale à étiquettes conscientes de l'étape pour les politiques vision-langage-action semi-autonomes
3arXiv cs.RO 

ValueFormer : une fonction de valeur transformer causale à étiquettes conscientes de l'étape pour les politiques vision-langage-action semi-autonomes

Des chercheurs présentent ValueFormer (arXiv:2608.02958), un transformer causal compact adossé à un backbone DINOv3 gelé qui produit, à chaque frame, deux signaux : une valeur Monte Carlo lisse (V_mc) pour l'estimation d'avantage, et une valeur binaire nette pour détecter les erreurs en direct. Les épisodes échoués reçoivent un retour succès puis décroissance, la détection s'appuyant sur des intervalles d'erreur plutôt qu'un instant unique. Sur une tâche réelle d'assemblage bimanuel de sandwichs (1427 épisodes), ce poids de critique par frame fait passer le taux de réussite de 70% à 85% (n=20, dans la marge de bruit), et un encodeur bf16 par lots divise le coût de service par 3 à 5, permettant au critique de tourner à 2 Hz avec la politique sur un seul GPU. L'enjeu souligné par les auteurs est méthodologique : une politique Vision-Language-Action entraînée par clonage comportemental échoue silencieusement, un rollout qui s'effondre ressemblant, vu des seules actions, à un rollout qui progresse normalement. Le renforcement apporterait ce signal de progrès, mais reste impraticable : l'expérience réelle sur robot coûte cher et les aliments déformables comme les ingrédients d'un sandwich résistent mal à la simulation. Un simple bit de succès ou d'échec en fin d'épisode est trop rare pour indiquer quand une trajectoire a dérapé. Le point dur, selon les auteurs, n'est pas l'architecture mais l'étiquette par frame, qui doit être dense, continue et bien structurée. Pour l'industrie, cela offre un moyen peu coûteux d'instrumenter des politiques VLA en production et de détecter les erreurs en direct sur des tâches impliquant des objets déformables, mal gérés par la simulation classique. ValueFormer s'inscrit dans la famille des politiques Vision-Language-Action, aux côtés de modèles comme Pi-0, GR00T N2 ou Helix, qui visent à généraliser le contrôle robotique à partir de démonstrations plutôt que de règles codées à la main. Le choix d'un backbone DINOv3 gelé et d'une architecture indépendante de la politique rend le critique réutilisable d'un système à l'autre, une approche modulaire plutôt qu'intégrée de bout en bout. Le papier reste un travail de recherche testé en laboratoire sur une seule tâche, avec un gain de performance mesuré sur seulement 20 essais, un résultat à confirmer avant toute généralisation.

RechercheActu
1 source
Un parmi l'infini : transformer les futurs d'un modèle du monde préentraîné en actions de robot
4arXiv cs.RO 

Un parmi l'infini : transformer les futurs d'un modèle du monde préentraîné en actions de robot

Des chercheurs proposent RoboActualizer, une architecture qui transforme un modèle de monde vidéo préentraîné en politique robotique exécutable sans ré-entraîner son lourd backbone. Le principe, baptisé « actualisation », consiste à geler l'encodeur du modèle de monde et à n'entraîner par-dessus qu'un module léger, chargé de sélectionner, parmi les futurs plausibles qu'encode le modèle, celui qui correspond à la tâche demandée, puis d'en extraire les actions. L'actualiseur repose sur deux experts DiT (diffusion transformers) légers qui prédisent conjointement les latents futurs et les actions par flow matching. Il compte à partir de 60 millions de paramètres, s'entraîne sur un seul GPU avec 32 Go de mémoire au pic, et affiche une latence de 39 ms, compatible avec le contrôle temps réel. Les auteurs revendiquent jusqu'à 100 fois moins de paramètres entraînables que les modèles monde-action (WAM) et les VLA existants. Les résultats portent sur les benchmarks de simulation LIBERO, LIBERO-Plus et RoboTwin 2.0, ainsi que sur cinq tâches réelles menées sur deux plateformes. L'abstract ne chiffre pas les taux de réussite et ne nomme ni les plateformes ni les modèles comparés. L'enjeu est d'abord économique. Les approches actuelles adaptent le backbone entier d'un modèle de monde avec de grands jeux de données robotiques et de gros budgets de calcul, ce qui réserve ce type de recherche aux laboratoires les mieux dotés. Si l'hypothèse des auteurs tient, à savoir que le coût principal a déjà été payé lors du préentraînement vidéo, un intégrateur ou une équipe universitaire pourrait spécialiser une politique sur une seule carte graphique, sans infrastructure de cluster. Ce serait un argument sérieux pour les VLA à backbone gelé et pour la réutilisation de modèles de monde comme socle commun. Il faut toutefois rester prudent : l'évaluation réelle se limite à cinq tâches, LIBERO est un benchmark proche de la saturation, et l'expression « gréât performance » ne dit rien de l'écart avec les meilleurs modèles entièrement affinés. La robustesse hors distribution et la généralisation à des tâches longues restent à démontrer. Ce travail s'inscrit dans la convergence entre modèles de monde vidéo et politiques robotiques, où des approches WAM et des VLA comme Pi-0 ou GR00T ont montré que le préentraînement sur vidéo transfère des connaissances physiques utiles. Ces méthodes ont cependant tendance à croître en taille, ce qui pose des problèmes de latence et de coût de déploiement. RoboActualizer prend le contre-pied en visant l'efficacité, un critère central pour le contrôle embarqué. Il s'agit ici d'un préprint (arXiv, version 1) non évalué par les pairs, sans produit ni déploiement industriel annoncés. Les prochaines étapes à surveiller sont la publication du code et des poids, des comparaisons directes avec des VLA de référence à budget de calcul égal, et des tests sur des plateformes et des tâches plus variées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source