
FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage
Une équipe de recherche présente FRAM (Future Representation Action Model), un modèle vision-langage-action compact pour la manipulation robotique, dans une prépublication arXiv (2609.30965, fin septembre 2026). FRAM relie la trajectoire future de l'effecteur terminal à l'image courante : les coordonnées prédites servent de pointeurs spatiaux pour extraire les caractéristiques visuelles locales liées au mouvement. Les étiquettes de trajectoire sont générées automatiquement à partir des démonstrations et de la géométrie caméra, sans annotation manuelle. Avec 138,7 millions de paramètres, encodeur de langage figé compris, FRAM atteint 92,2 % de réussite moyenne sur les quatre suites LIBERO, contre 94,2 % pour Pi-0 de Physical Intelligence (3,3 milliards de paramètres, soit 24 fois plus), et 67,3 % sur LIBERO-Plus sans entraînement additionnel. Sur un robot réel à deux bras UR5e, il empile des gobelets avec les seules caméras de poignet, en choisissant et en changeant de bras selon les besoins.
Ce résultat contredit l'idée reçue que la performance des modèles vision-langage-action dépend d'abord de leur taille : FRAM approche les scores de Pi-0 avec une fraction de ses paramètres, ce qui allège le calcul embarqué et facilite un déploiement sur du matériel moins coûteux, un point clé pour les intégrateurs cherchant à s'affranchir du cloud. L'étiquetage automatique des trajectoires supprime aussi une annotation manuelle coûteuse, frein habituel au passage à l'échelle des données de démonstration. Les scores sur LIBERO-Plus et la démonstration sur robot réel apportent un élément de réponse, mesuré toutefois sur un nombre restreint de tâches, à la question récurrente de l'écart entre démonstrations en laboratoire et robustesse réelle.
FRAM s'inscrit dans un champ dominé par la course à l'échelle, incarnée par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, et par des humanoïdes comme Optimus de Tesla ou Figure 03, qui misent sur des milliards de paramètres pour généraliser. Cette prépublication, dont le statut de relecture par les pairs n'est pas précisé, défend la direction inverse de politiques compactes et spécialisées. Aucun partenaire industriel ni plan de déploiement commercial n'est mentionné : les résultats restent limités à des benchmarks simulés et à un seul bras collaboratif en laboratoire. L'étape suivante logique consisterait à étendre l'approche à davantage de tâches, de robots et de configurations de caméras avant d'envisager une intégration en production.
Dans nos dossiers




