Aller au contenu principal
FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage
RecherchearXiv cs.RO 

FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente FRAM (Future Representation Action Model), un modèle vision-langage-action compact pour la manipulation robotique, dans une prépublication arXiv (2609.30965, fin septembre 2026). FRAM relie la trajectoire future de l'effecteur terminal à l'image courante : les coordonnées prédites servent de pointeurs spatiaux pour extraire les caractéristiques visuelles locales liées au mouvement. Les étiquettes de trajectoire sont générées automatiquement à partir des démonstrations et de la géométrie caméra, sans annotation manuelle. Avec 138,7 millions de paramètres, encodeur de langage figé compris, FRAM atteint 92,2 % de réussite moyenne sur les quatre suites LIBERO, contre 94,2 % pour Pi-0 de Physical Intelligence (3,3 milliards de paramètres, soit 24 fois plus), et 67,3 % sur LIBERO-Plus sans entraînement additionnel. Sur un robot réel à deux bras UR5e, il empile des gobelets avec les seules caméras de poignet, en choisissant et en changeant de bras selon les besoins.

Ce résultat contredit l'idée reçue que la performance des modèles vision-langage-action dépend d'abord de leur taille : FRAM approche les scores de Pi-0 avec une fraction de ses paramètres, ce qui allège le calcul embarqué et facilite un déploiement sur du matériel moins coûteux, un point clé pour les intégrateurs cherchant à s'affranchir du cloud. L'étiquetage automatique des trajectoires supprime aussi une annotation manuelle coûteuse, frein habituel au passage à l'échelle des données de démonstration. Les scores sur LIBERO-Plus et la démonstration sur robot réel apportent un élément de réponse, mesuré toutefois sur un nombre restreint de tâches, à la question récurrente de l'écart entre démonstrations en laboratoire et robustesse réelle.

FRAM s'inscrit dans un champ dominé par la course à l'échelle, incarnée par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, et par des humanoïdes comme Optimus de Tesla ou Figure 03, qui misent sur des milliards de paramètres pour généraliser. Cette prépublication, dont le statut de relecture par les pairs n'est pas précisé, défend la direction inverse de politiques compactes et spécialisées. Aucun partenaire industriel ni plan de déploiement commercial n'est mentionné : les résultats restent limités à des benchmarks simulés et à un seul bras collaboratif en laboratoire. L'étape suivante logique consisterait à étendre l'approche à davantage de tâches, de robots et de configurations de caméras avant d'envisager une intégration en production.

À lire aussi

AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM
1arXiv cs.RO 

AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM

AntiGrounding, un framework de sélection visuelle d'actions pour la manipulation robotique guidée par des modèles vision-langage, est détaille dans une version mise a jour d'un article arXiv (2506.12374v3). Chaque trajectoire courte retenue après filtrage de faisabilité sert a la fois de plan de mouvement exécutable et de prompt visuel rendu, évalué par un question-réponse visuel multi-vues qui note sécurité, alignement avec la tache, efficacité et plausibilité physique. Ces scores, agrégés par fusion pondérée des vues, guident les propositions de trajectoire suivantes; des contrôles séparés gèrent orientation et pince, et un jumeau numérique valide les segments choisis avant exécution par le robot réel. Sur huit taches de manipulation en conditions réelles, AntiGrounding associe a un seul évaluateur, désigne GPT-6 Astra, atteint 71,25% de réussite, contre 50,00% pour le modèle pi0.5 et 47,50% pour une base de référence de type PIVOT évaluée avec le même VLM. L'intérêt pour le secteur tient a l'alternative proposee aux modèles VLA généralistes entraines de bout en bout, comme pi0.5, GR00T N2 ou Helix, qui associent directement instruction et action: ici le VLM sert d'évaluateur dans une boucle de recherche et de notation de trajectoires géométriques, approche plus auditable pour la sécurité avant un déploiement industriel. L'écart avec pi0.5 (50,00%) sur les mêmes huit taches rappelle que les politiques VLA généralistes restent en dessous des attentes en conditions réelles, nuançant l'idée d'un sim-to-real déjà résolu a grande échelle. Les auteurs précisent toutefois que la performance reste bornée par la fidélité du jumeau numérique et par les aléa de l'interaction physique: il s'agit d'un travail de recherche publie sur arXiv, non d'un produit commercialise ni déployé en usine. Le travail s'inscrit dans la lignée des recherches combinant grands modèles vision-langage et planification robotique, aux cotes de politiques VLA comme pi0 et pi0.5 de Physical Intelligence ou GR00T N2 de NVIDIA, et se distingue de la méthode concurrente PIVOT en confiant au VLM un rôle de juge plutôt que de générateur direct d'action. Aucun acteur français ou européen, tel Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools, n'apparait dans ces travaux, qui restent pour l'instant un résultat de laboratoire sur huit taches, sans calendrier de pilote industriel annonce.

RechercheActu
1 source
DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique
2arXiv cs.RO 

DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique

DreamX-Phi 1.0, un modèle de monde vidéo conditionné par l'action pour la manipulation robotique, est présenté dans un article déposé sur arXiv (2608.13489v1). À partir d'une image observée, d'une instruction en langage naturel et d'une séquence d'actions prescrite, poses de l'effecteur terminal et états du gripper, le système prédit les observations vidéo futures correspondantes. Pour éviter qu'une vidéo réaliste en apparence déplace le mauvais bras ou fasse disparaître l'objet manipulé, les auteurs injectent des transformations géométriques SE(3) propres à chaque bras dans les couches d'attention via un encodage de type PRoPE, complété par une branche de profondeur pour la géométrie de la scène et des masques SAM3 associés à un modèle enseignant V-JEPA figé pour maintenir la cohérence des objets durant la saisie. Le générateur multi-étapes est ensuite distillé en un modèle étudiant à peu d'étapes pour accélérer le déploiement. Le modèle revendique la première place sur la Track 1 et la deuxième sur la Track 2 du WorldArena 2.0 Challenge, avec publication annoncée du modèle et du code. Cette approche s'attaque à un problème central des modèles de monde appliqués à la robotique: une vidéo générée peut paraître photoréaliste tout en étant physiquement incohérente avec les commandes envoyées au robot, ce qui invalide son usage pour l'entraînement de politiques ou la planification. En ancrant la génération vidéo sur la géométrie rigide réelle de chaque bras et en préservant l'identité des objets manipulés, DreamX-Phi cherche à combler l'écart entre démonstration visuelle convaincante et fidélité exploitable pour le contrôle. La distillation en modèle étudiant à peu d'étapes répond à une contrainte pratique bien connue des intégrateurs: les modèles de monde vidéo multi-étapes sont souvent trop lents pour une boucle de contrôle temps réel, ce qui limite sinon leur usage à la simulation ou à l'évaluation hors ligne. Le classement sur WorldArena 2.0 reste toutefois un résultat de benchmark académique et non une validation en conditions réelles sur un robot physique. DreamX-Phi s'inscrit dans une vague plus large de modèles de monde vidéo pour la robotique, qui cherchent à compléter ou remplacer les architectures vision-langage-action comme Pi-0 ou GR00T N2 par une simulation générative directe des conséquences d'une action. Le recours à SAM3 pour la segmentation et à V-JEPA comme enseignant figé situe le projet dans la lignée des modèles de représentation vidéo auto-supervisés récents plutôt que dans une pile propriétaire fermée. À ce stade, aucune information ne mentionne de déploiement sur un robot physique ni de partenariat industriel: il s'agit d'un article de recherche accompagné d'un résultat de compétition, le modèle et le code étant seulement annoncés comme à venir. La suite logique, si cette promesse de publication est tenue, sera l'adoption du modèle comme brique de simulation ou d'évaluation par d'autres équipes travaillant sur la manipulation robotique.

RecherchePaper
1 source
LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique
3arXiv cs.RO 

LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique

Des chercheurs présentent LaGEA (Language Guided Embodied Agents), une architecture combinant un modèle vision-langage (VLM) et l'apprentissage par renforcement (RL) pour la manipulation robotique, décrite dans une version mise a jour (v3) d'un article arXiv (2509.23155). Apres chaque tentative, le système résume l'épisode en langage naturel, localise les instants décisifs de la trajectoire, aligne ce retour avec l'état visuel dans une représentation partagée, puis transforme la progression vers l'objectif en récompenses bornées appliquées pas a pas. Un coefficient adaptatif, sensible aux échecs, rend ce signal dense en début d'exploration puis l'atténué avec la montée en compétence de l'agent. Sur les bancs d'essai simules Meta-World MT10 (dix taches de manipulation) et Robotic Fetch, LaGEA améliore le taux de réussite moyen de 9,0% sur des objectifs aléatoires, 5,3% sur des objectifs fixes et 17% sur les taches Fetch par rapport aux méthodes de référence, avec une convergence plus rapide. Le travail s'attaque a un problème classique du RL, la conception manuelle des fonctions de récompense, souvent couteuse et peu généralisable a de nouvelles taches. En montrant qu'un retour en langage naturel, structure et ancre temporellement, peut remplacer une partie de cette ingénierie, LaGEA nuance le narratif dominant autour des modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix, conçus pour piloter directement une politique de bout en bout : ici, le langage sert de superviseur d'apprentissage plutôt que de commande directe. Les gains rapportes restent obtenus en simulation, non sur du matériel réel, et demandent une confirmation sur des taches de manipulation physique. LaGEA prolonge les travaux exploitant les grands modèles vision-langage comme source de récompense ou de critique pour le RL, un axe de recherche actif depuis l'essor des modèles de fondation capables de décrire des objectifs et d'évaluer des trajectoires. Meta-World MT10 et Robotic Fetch sont des bancs d'essai standards de la communauté robotique, ce qui permet une comparaison directe avec l'état de l'art. S'agissant d'une version corrigée d'un article déjà publie, la contribution reste académique : aucun partenaire industriel, date de déploiement ou intégration produit n'est annonce a ce stade, la prochaine étape logique étant une validation sim-to-real sur robot physique.

RecherchePaper
1 source
GraphPoint : graphes d'entités sémantiques et trajectoires de points pour la manipulation robotique compositionnelle
4arXiv cs.RO 

GraphPoint : graphes d'entités sémantiques et trajectoires de points pour la manipulation robotique compositionnelle

Un article déposé sur arXiv (référence 2609.18358) début septembre 2026 présente GraphPoint, une méthode de manipulation robotique associée à un nouveau benchmark baptisé CoMani. Le travail part d'un constat répandu en robotique : les politiques de manipulation entraînées par apprentissage peinent à généraliser au-delà de leurs démonstrations, même quand une nouvelle instruction combine des objets et des comportements déjà vus séparément. Les auteurs expliquent que lorsque langage et scène visuelle sont trop fortement corrélés pendant l'entraînement, la politique finit par mémoriser un mapping visuo-moteur fixe au lieu de réellement suivre l'instruction donnée. CoMani propose des scènes initiales appariées et des variations contrôlées portant sur un seul facteur sémantique à la fois, afin de forcer les modèles évalués à s'appuyer sur le langage plutôt que sur des raccourcis visuels. Deux niveaux de généralisation compositionnelle sont testés : à l'intérieur d'une sous-tâche, en recombinant entités, types d'action et modificateurs déjà connus, et entre sous-tâches, en réutilisant des comportements appris dans des tâches longues et inédites. GraphPoint, la méthode proposée, relie des graphes d'entités sémantiques à un contrôle géométrique en prédisant la trajectoire future du point de préhension du gripper, convertie ensuite en commandes moteur via la géométrie du robot ; le gripper et les objets sont organisés par rôles sémantiques et leurs interactions conditionnées par le type et le modificateur d'action demandés, tandis qu'une estimation de progression guide les transitions entre étapes. L'enjeu dépasse la seule démonstration technique : il touche directement le problème de l'écart entre performance affichée sur des tâches déjà vues et robustesse réelle en usage, un point sensible pour tout intégrateur évaluant une politique vision-langage-action avant déploiement industriel. En isolant précisément si un modèle suit l'instruction ou reconnaît simplement une scène mémorisée, CoMani offre aux équipes de recherche un outil de diagnostic plus rigoureux que les démonstrations vidéo sélectionnées qui dominent souvent la communication du secteur autour des capacités de généralisation. Le papier s'inscrit dans la vague récente de benchmarks cherchant à mesurer la généralisation compositionnelle des politiques de manipulation plutôt que leur seule réussite sur des tâches figées. Les auteurs indiquent que le code sera publié en accès libre sous le nom GraphPoint, sans préciser de calendrier ni d'institution porteuse. Aucun partenariat industriel, déploiement réel ou chiffre de performance chiffré au-delà des résultats d'ablation sur CoMani n'est mentionné à ce stade, ce qui situe cette publication au stade de la recherche amont plutôt que du produit commercialisable.

RecherchePaper
1 source