Aller au contenu principal
RecherchearXiv cs.RO 

CF-JEPA : renforcer la robustesse des modèles du monde JEPA grâce à la factorisation de la contrôlabilité

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent CF-JEPA (Controllability Factorized JEPA), un modèle du monde latent de type JEPA publié en preprint sur arXiv (2610.00727v1). Son principe est de scinder l'espace latent en deux sous-espaces: l'un contrôlable, l'autre non contrôlable. Les informations parasites, comme un arrière-plan changeant ou des éléments visuels sans lien avec la tâche, sont censées se loger dans la partie non contrôlable. La politique de commande n'exploite que la partie contrôlable. Les auteurs annoncent des performances comparables aux méthodes existantes sur des tâches de contrôle 2D et 3D en conditions nominales, et supérieures en présence de distracteurs. CF-JEPA serait le seul modèle testé à ne pas subir d'effondrement latent (latent collapse) dans ce cas. Une validation est aussi présentée sur une tâche de robot simulé. Le résumé ne donne aucun chiffre, ni taux de réussite, ni benchmark nommé, ni comparaison chiffrée avec des modèles concurrents.

L'enjeu est la robustesse de la perception pour le contrôle visuel, un point faible connu des modèles du monde. Les architectures JEPA évitent la reconstruction au niveau du pixel, ce qui devrait les protéger du bruit visuel. Les auteurs montrent que ce n'est pas suffisant: ces modèles restent sensibles aux distracteurs et peuvent s'effondrer, c'est-à-dire produire des représentations dégénérées. Pour un intégrateur, c'est un écart familier entre démonstration en laboratoire et atelier réel, où l'éclairage varie, où des opérateurs passent en arrière-plan et où la scène change. Une séparation explicite entre ce que l'agent peut influencer et ce qu'il ne peut pas influencer est une piste crédible. Les réserves sont claires: les expériences sont en simulation, et rien n'indique encore que l'approche tienne sur du matériel physique ou à l'échelle des politiques VLA actuelles.

Ce travail s'inscrit dans la montée des modèles du monde latents, popularisés par la famille JEPA défendue par Yann LeCun, qui s'oppose aux approches génératives reconstruisant les images. Il concurrence indirectement les modèles du monde génératifs et les méthodes de représentation robustes aux distracteurs, sans que le résumé les nomme. Aucune suite n'est annoncée. Les prochaines étapes logiques sont des benchmarks chiffrés publiés, une validation sur robot réel et des tests face à des distracteurs plus réalistes. Il s'agit d'une contribution de recherche, pas d'un produit ni d'un déploiement.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

FP2 : doter les modèles fondation robotiques d'un contrôle de force
1arXiv cs.RO 

FP2 : doter les modèles fondation robotiques d'un contrôle de force

Des chercheurs publient sur arXiv (2609.37433) FP2, une interface logicielle légère qui ajoute un contrôle de force explicite aux modèles de fondation robotiques (RFM) déjà adaptés à une tâche. L'architecture sépare l'action de la régulation. Le RFM adapté joue le rôle de politique de fondation et génère les actions au niveau de la tâche. Une seconde politique, à haute fréquence, s'occupe uniquement de réguler l'interaction. Pour savoir quoi réguler, FP2 compresse les représentations contextuelles de la politique de fondation, les combine avec les historiques de torseur (wrench, force et couple) et de proprioception, puis prédit des paramètres de contrôle de force structurés. L'évaluation porte sur quatre backbones de RFM et quatre tâches de manipulation réelles riches en contacts. Selon les auteurs, FP2 améliore de façon constante la performance de tâche et la qualité de régulation de force par rapport aux politiques de fondation seules, et se compare favorablement à des méthodes de référence sensibles à la force ou fondées sur le contrôle de force. Le résumé ne donne ni taux de réussite, ni fréquences de boucle, ni noms de backbones ou de tâches. L'intérêt tient à un point faible connu des VLA et autres modèles généralistes : ils produisent des trajectoires plausibles, mais l'interaction physique fiable (insertion, essuyage, assemblage, contact avec des objets déformables) exige une régulation de force que ces modèles, cadencés bien en dessous du kHz, n'assurent pas nativement. FP2 propose une voie pragmatique : ne pas réentraîner le modèle de fondation, mais lui greffer une couche de bas niveau. Les ablations indiquent que le contexte de la politique de fondation et le retour physique sont complémentaires, et que conserver la génération d'actions du RFM améliore l'efficacité comme la généralisation à des objets nouveaux. Pour un intégrateur, cela plaide pour une architecture en couches plutôt que pour des modèles de bout en bout dotés de capteurs de force. Réserve : il s'agit d'un préprint non évalué par les pairs, et le nombre limité de tâches ne dit rien de la robustesse en production, du coût du capteur de torseur ni de la latence ajoutée. Ces travaux s'inscrivent dans un mouvement plus large. Les modèles de fondation robotiques comme Pi-0, GR00T ou Helix ont surtout été validés sur des tâches où la vision et la position dominent. Les approches « force-aware » existantes injectent la force comme simple entrée du modèle, tandis que le contrôle d'impédance ou d'admittance classique reste réglé à la main. FP2 se place entre les deux en apprenant les paramètres du contrôleur à partir du contexte. La suite dépendra de la publication du code et des résultats détaillés sur le site du projet (force-policy.github.io/fp2), ainsi que d'une validation sur d'autres plateformes et tâches industrielles. Aucun pilote ni calendrier de déploiement n'est annoncé, et aucun acteur français ou européen n'est cité dans le résumé.

RecherchePaper
1 source
EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action
2arXiv cs.RO 

EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action

Des chercheurs proposent EVO-WAM, un cadre d'adaptation de « world action models » (WAM) à des tâches inédites, sans nouvelle démonstration d'expert et sans exécuter les actions candidates dans un environnement externe. Un WAM exploite des priors vidéo à grande échelle pour prédire conjointement les vidéos futures et les actions. Le système repose sur trois briques. D'abord, l'entraînement du WAM est enrichi d'une prédiction d'état et d'un contexte multi-images ancré, ce qui permet des déroulés autorégressifs complets sans retour d'exécution. Ensuite, un modèle vision-langage sélectionne les préfixes de trajectoires où la tâche est accomplie, puis un modèle de dynamique inverse vérifie la cohérence entre vidéo et actions. Enfin, le WAM est réentraîné de façon itérative sur ces préfixes vérifiés, et de nouveaux déroulés sont générés avec le modèle mis à jour. Sur sept tâches inédites de RoboTwin 2.0, le taux de succès moyen de Cosmos3 passe de 26,9 % à 68,0 % (environ 2,5 fois), et celui de DreamZero de 28,5 % à 46,4 % (environ 1,6 fois). Sur trois tâches composites à long horizon en conditions réelles, Cosmos3 passe de 20,0 % à 76,7 %, soit un gain de 56,7 points. L'enjeu porte sur le goulot d'étranglement des démonstrations. Collecter des données d'experts par téléopération reste la principale dépense pour déployer une politique sur une nouvelle tâche. Ici, le modèle génère lui-même sa supervision, filtrée par deux vérificateurs indépendants. Le filtre par dynamique inverse cible un mode d'échec connu des WAM : une vidéo qui semble réussie peut être associée à des actions incompatibles avec elle, ce qui produit un échec à l'exécution. Le résultat suggère que l'auto-amélioration sans interaction avec l'environnement devient praticable pour ces modèles, ce qui réduirait le coût d'adaptation par tâche pour les intégrateurs. Il faut toutefois nuancer. Les gains simulés sont mesurés sur sept tâches. Le test réel ne compte que trois tâches, et le papier ne détaille pas ici le nombre d'essais, ce qui rend l'écart de 56,7 points sensible au bruit statistique. Le point de départ de 20 % en réel est aussi bas. Le papier est un preprint arXiv, non évalué par les pairs, sans déploiement industriel. Ce travail s'inscrit dans la montée des modèles monde et des politiques vision-langage-action (VLA). Ces derniers prédisent des actions directement, tandis que les WAM ajoutent une prédiction vidéo issue de modèles génératifs pré-entraînés. Cosmos3 et DreamZero servent ici de bases, et la méthode s'applique donc à plusieurs architectures. Les approches concurrentes d'amélioration sans démonstration reposent surtout sur l'apprentissage par renforcement en environnement réel ou simulé, plus coûteux en temps robot ou en fidélité de simulation. Le benchmark RoboTwin 2.0, en simulation bimanuelle, sert de référence commune. Les prochaines étapes probables sont des tests sur davantage de tâches réelles, des embodiments variés et des vérificateurs plus fiables, car la qualité du modèle vision-langage et du modèle de dynamique inverse borne ce que la boucle peut apprendre. Une page projet est disponible, mais aucun calendrier de produit n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique
3arXiv cs.RO 

Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique

Un article de recherche publié sur arXiv (2607.21725v1) présente Pigey, un orchestrateur d'agence physique conçu pour piloter des robots généralistes sans données supplémentaires ni post-entraînement. Plutôt que d'entasser perception, planification, détection de succès, récupération d'erreurs et contrôle bas niveau dans une seule politique apprise par pré-entraînement massif, comme le font les modèles vision-langage-action (VLA) actuels, les auteurs séparent le problème en deux couches : un agent de contrôle langage-conditionné classique, et un gestionnaire de haut niveau qui décompose les objectifs en sous-tâches, envoie des commandes moteur, vérifie les résultats à partir des observations bas niveau et déclenche des routines de récupération en cas d'échec. Pigey peut commander aussi bien des politiques VLA existantes que des compétences paramétrées préexistantes. Sur le benchmark de simulation LIBERO-PRO, le taux de réussite passe de 12,8% à 53,3%, soit plus du quadruple, sans aucun réglage spécifique à la tâche. Sur un robot réel, les tâches nécessitant du raisonnement voient leur taux de succès grimper de quasi zéro à plus de 90% une fois la politique figée intégrée dans la boucle agentique de Pigey. Ce résultat vient alimenter un débat déjà vif dans la robotique humanoïde et manipulatrice : les modèles VLA de bout en bout, aussi impressionnants soient-ils en démonstration, échouent souvent dès que la tâche exige un raisonnement séquentiel ou une récupération après erreur, un écart que les auteurs baptisent "orchestration gap". En montrant qu'une simple couche d'orchestration explicite, sans ré-entraînement, suffit à multiplier par quatre les performances, l'étude suggère que l'échelle des données de pré-entraînement n'est pas le seul levier disponible pour combler ce fossé entre démonstration et fiabilité réelle, un enjeu direct pour les intégrateurs qui doivent déployer ces systèmes en environnement industriel non contrôlé. Cette approche s'inscrit dans une tendance plus large de la recherche en robotique généraliste, où des laboratoires développent des modèles comme Pi-0, GR00T N2 ou Helix pour unifier perception et action. Pigey se positionne comme une alternative complémentaire plutôt qu'un concurrent direct : il ne remplace pas ces politiques mais les pilote depuis l'extérieur, ce qui laisse ouverte la question de son adoption par les fournisseurs de VLA propriétaires et de son passage à l'échelle sur des tâches de manipulation encore plus complexes.

RecherchePaper
1 source
Any3D-VLA : améliorer la robustesse des modèles VLA grâce à des nuages de points diversifiés
4arXiv cs.RO 

Any3D-VLA : améliorer la robustesse des modèles VLA grâce à des nuages de points diversifiés

Les modèles VLA (Vision-Language-Action) qui pilotent aujourd'hui les robots manipulateurs reposent quasi-exclusivement sur des images 2D comme entrée visuelle. Une équipe de chercheurs publie sur arXiv (arXiv:2506.00807v2) Any3D-VLA, une architecture d'entraînement qui intègre explicitement des nuages de points 3D pour améliorer la robustesse spatiale de ces modèles. L'approche fusionne trois sources de nuages de points hétérogènes, données de simulation, capteurs de profondeur réels (LiDAR, RGB-D), et estimation par modèle monoculaire, avec les représentations 2D existantes, dans un pipeline d'entraînement unifié. Les expériences couvrent à la fois des environnements simulés et des déploiements réels, et montrent des gains de performance mesurables sur des tâches de manipulation. L'intérêt technique est double. D'abord, le papier démontre empiriquement que "lever" l'entrée visuelle en nuage de points produit des représentations complémentaires aux features 2D, plutôt que redondantes, ce qui valide une hypothèse souvent discutée dans la communauté VLA. Ensuite, Any3D-VLA s'attaque directement aux deux verrous pratiques qui ont jusqu'ici freiné l'adoption du 3D dans ce domaine : la rareté des données 3D annotées et le domain gap lié aux différences de calibration entre environnements et aux biais d'échelle de profondeur. En traitant ces deux obstacles dans un seul framework, le travail suggère une voie vers des VLA plus robustes au sim-to-real transfer, un problème central pour le déploiement en conditions industrielles réelles. Les VLA sont au cœur d'une course intense depuis la publication de RT-2 (Google DeepMind, 2023) et l'essor de modèles comme Pi-0 (Physical Intelligence), OpenVLA, ou RoboVLMs. La plupart restent limités par leur dépendance aux caméras RGB standard, ce qui crée des angles morts en cas d'occlusion ou de scènes encombrées. Any3D-VLA ne propose pas encore un produit déployé : il s'agit d'une contribution de recherche avec code et page projet publics. La prochaine étape logique serait une intégration dans des pipelines de fine-tuning utilisés par des acteurs comme Physical Intelligence ou les équipes robotique de Figure AI, qui cherchent précisément à réduire le nombre de démonstrations réelles nécessaires grâce à un meilleur transfert depuis la simulation.

RechercheOpinion
1 source