Aller au contenu principal
RecherchearXiv cs.RO 

FP2 : doter les modèles fondation robotiques d'un contrôle de force

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.37433) FP2, une interface logicielle légère qui ajoute un contrôle de force explicite aux modèles de fondation robotiques (RFM) déjà adaptés à une tâche. L'architecture sépare l'action de la régulation. Le RFM adapté joue le rôle de politique de fondation et génère les actions au niveau de la tâche. Une seconde politique, à haute fréquence, s'occupe uniquement de réguler l'interaction. Pour savoir quoi réguler, FP2 compresse les représentations contextuelles de la politique de fondation, les combine avec les historiques de torseur (wrench, force et couple) et de proprioception, puis prédit des paramètres de contrôle de force structurés. L'évaluation porte sur quatre backbones de RFM et quatre tâches de manipulation réelles riches en contacts. Selon les auteurs, FP2 améliore de façon constante la performance de tâche et la qualité de régulation de force par rapport aux politiques de fondation seules, et se compare favorablement à des méthodes de référence sensibles à la force ou fondées sur le contrôle de force. Le résumé ne donne ni taux de réussite, ni fréquences de boucle, ni noms de backbones ou de tâches.

L'intérêt tient à un point faible connu des VLA et autres modèles généralistes : ils produisent des trajectoires plausibles, mais l'interaction physique fiable (insertion, essuyage, assemblage, contact avec des objets déformables) exige une régulation de force que ces modèles, cadencés bien en dessous du kHz, n'assurent pas nativement. FP2 propose une voie pragmatique : ne pas réentraîner le modèle de fondation, mais lui greffer une couche de bas niveau. Les ablations indiquent que le contexte de la politique de fondation et le retour physique sont complémentaires, et que conserver la génération d'actions du RFM améliore l'efficacité comme la généralisation à des objets nouveaux. Pour un intégrateur, cela plaide pour une architecture en couches plutôt que pour des modèles de bout en bout dotés de capteurs de force. Réserve : il s'agit d'un préprint non évalué par les pairs, et le nombre limité de tâches ne dit rien de la robustesse en production, du coût du capteur de torseur ni de la latence ajoutée.

Ces travaux s'inscrivent dans un mouvement plus large. Les modèles de fondation robotiques comme Pi-0, GR00T ou Helix ont surtout été validés sur des tâches où la vision et la position dominent. Les approches « force-aware » existantes injectent la force comme simple entrée du modèle, tandis que le contrôle d'impédance ou d'admittance classique reste réglé à la main. FP2 se place entre les deux en apprenant les paramètres du contrôleur à partir du contexte. La suite dépendra de la publication du code et des résultats détaillés sur le site du projet (force-policy.github.io/fp2), ainsi que d'une validation sur d'autres plateformes et tâches industrielles. Aucun pilote ni calendrier de déploiement n'est annoncé, et aucun acteur français ou européen n'est cité dans le résumé.

Dans nos dossiers

À lire aussi

VGGT-DP : contrôle robotique généralisable via des modèles de vision fondation
1arXiv cs.RO 

VGGT-DP : contrôle robotique généralisable via des modèles de vision fondation

Les chercheurs à l'origine de VGGT-DP ont publié une version révisée de leur article sur arXiv (arXiv:2509.18778v2) présentant un nouveau cadre d'apprentissage par imitation visuelle pour le contrôle de robots manipulateurs. Le système utilise comme encodeur visuel le Visual Geometry Grounded Transformer (VGGT), un modèle de perception 3D pré-entraîné, combiné à un retour proprioceptif pour aligner la perception visuelle avec l'état interne du robot. Pour limiter la latence d'inférence, les auteurs introduisent un mécanisme de réutilisation de jetons image par image (frame-wise token reuse, FTR), qui met en cache les jetons de l'agrégateur VGGT issus des images qui se chevauchent et ne recalcule les caractéristiques que pour la dernière image reçue. Un élagage aléatoire de jetons est aussi appliqué pour réduire le surapprentissage. Sur les tâches de manipulation du banc d'essai simulé MetaWorld, VGGT-DP dépasse les références Diffusion Policy (DP) et DP3, en particulier sur les scénarios exigeant de la précision et sur les tâches à long horizon temporel. L'apport principal tient au fait que la majorité des travaux en apprentissage par imitation se concentrent sur l'architecture de la politique de contrôle, souvent des modèles de diffusion, en négligeant la qualité de l'encodeur visuel et sa capacité de compréhension spatiale. En ancrant la perception dans des a priori géométriques 3D et en la couplant à la proprioception, VGGT-DP cherche à réduire l'écart entre ce que le robot perçoit et ce qu'il ressent physiquement, un facteur d'échec fréquent des politiques visuomotrices en boucle fermée. La réduction de la latence via la réutilisation de jetons est pertinente pour un déploiement temps réel sur du matériel embarqué à ressources de calcul limitées. Toutefois, les résultats reposent uniquement sur MetaWorld, un environnement simulé, sans validation sur robot réel ni chiffres de transfert sim-to-real. Ce travail s'inscrit dans la course plus large aux modèles fondation pour la robotique, aux côtés d'approches vision-langage-action comme Pi-0, GR00T N2 ou Helix, mais s'en distingue en misant sur la fusion vision 3D-proprioception plutôt que sur le conditionnement par le langage. Le statut "replace" sur arXiv indique une révision d'une soumission antérieure. Aucune information n'est donnée sur une publication du code, un partenaire industriel ou un déploiement sur robot physique: le travail reste à un stade académique, la prochaine étape logique étant une validation en conditions réelles et une éventuelle intégration avec des modèles VLA conditionnés par le langage.

RecherchePaper
1 source
JailWAM : pirater les modèles d'action du monde dans le contrôle robotique
2arXiv cs.RO 

JailWAM : pirater les modèles d'action du monde dans le contrôle robotique

Des chercheurs ont publié JailWAM, premier framework d'évaluation de jailbreak conçu spécifiquement pour les World Action Models (WAM), ces modèles qui pilotent directement des robots manipulateurs à partir d'instructions en langage naturel. Décrit dans un article déposé sur arXiv (identifiant 2604.05498, version 2), le système repose sur trois composants. Le premier, Visual-Trajectory Mapping, convertit les sorties d'action hétérogènes de différentes architectures de WAM en une représentation de trajectoire visuelle commune, ce qui permet de comparer des modèles différents sur une même base. Le deuxième, un Risk Discriminator, classe les résultats selon trois niveaux de gravité physique croissante : conformité de sécurité, échec de mouvement, et risque catastrophique. Le troisième, une Dual-Path Verification Strategy, combine un tri rapide des candidats d'attaque avec une simulation physique en boucle fermée réservée aux cas jugés dangereux, afin de réduire le coût de calcul. Testé dans l'environnement de simulation RoboTwin, JailWAM atteint un taux de réussite d'attaque de 84,2 % contre le modèle LingBot-VA. Ce résultat illustre concrètement que les WAM, censés traduire fidèlement des consignes en gestes physiques sûrs, restent vulnérables à des instructions adversariales capables de provoquer des comportements dangereux du bras ou du robot. Pour les intégrateurs industriels et les décideurs qui envisagent de déployer ces modèles vision-langage-action en usine ou en entrepôt, l'étude rappelle qu'aucun garde-fou standardisé n'existe encore contre ce type d'attaque, contrairement au red-teaming déjà bien établi pour les grands modèles de langage textuels. Le chiffre de 84,2 % a toutefois été obtenu en simulation, pas sur du matériel physique réel, ce qui laisse ouverte la question d'un éventuel écart sim-to-real ; la tendance qu'il révèle sur la fragilité de l'alignement sécuritaire des WAM reste néanmoins significative. Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui équipent la nouvelle génération de robots humanoïdes et de bras manipulateurs, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix. JailWAM transpose au monde physique des méthodologies de jailbreak déjà développées pour les modèles de langage textuels. Les auteurs appellent explicitement à davantage de recherche sur l'évaluation de sécurité et l'alignement des systèmes robotiques embarqués, signe d'un besoin encore naissant de standards de certification avant tout déploiement industriel à grande échelle. Aucun acteur français ou européen du secteur n'apparaît dans cette étude.

RechercheActu
1 source
MotuBrain : un modèle du monde avancé pour le contrôle robotique
3arXiv cs.RO 

MotuBrain : un modèle du monde avancé pour le contrôle robotique

MotuBrain est un modèle génératif multimodal unifié pour le contrôle robotique, présenté dans un preprint arXiv (identifiant 2604.27792) publié en avril 2026. Le modèle adopte une formulation UniDiffuser couplée à une architecture Mixture-of-Transformers à trois flux, lui permettant de modéliser conjointement les séquences vidéo et les actions motrices au sein d'un même réseau. Un seul modèle supporte cinq modes d'inférence distincts : apprentissage de politique, modélisation du monde, génération vidéo, dynamique inverse, et prédiction conjointe vidéo-action. Il est conçu pour s'adapter à des données hétérogènes, incluant des vidéos sans annotations d'action et des données issues de plateformes robotiques différentes (cross-embodiment). Sur le plan de l'inférence, les auteurs annoncent un gain de vitesse supérieur à 50x par rapport à des architectures comparables, ouvrant la voie à un déploiement temps réel. L'approche s'attaque à une limitation structurelle bien documentée des VLA purs comme RT-2 ou OpenVLA : leur forte généralisation sémantique masque souvent une modélisation insuffisante des dynamiques physiques fines, ce qui génère des erreurs sur des tâches de manipulation précises. En intégrant la génération vidéo comme supervision implicite des dynamiques du monde, MotuBrain s'inscrit dans la tendance des World Action Models (WAMs), dont l'hypothèse centrale est que prédire ce qui va se passer visuellement améliore la qualité des actions produites. Le support cross-embodiment est particulièrement structurant pour les intégrateurs industriels, car il réduit le coût de réentraînement lors d'un changement de plateforme matérielle. Le speedup annoncé de 50x reste à confirmer sur des benchmarks publics, le preprint ne précisant pas les configurations matérielles de référence utilisées pour cette mesure. Ce travail s'inscrit dans une compétition dense autour des modèles fondationnels pour la robotique généraliste. Physical Intelligence a mis en production Pi-0 début 2025, NVIDIA a présenté GR00T N2 avec support multi-embodiment, et Google DeepMind avance sur ses modèles RT-X et GROOT. L'affiliation institutionnelle des auteurs de MotuBrain n'est pas précisée dans l'abstract du preprint. Comme pour tout travail soumis à arXiv sans revue par les pairs, l'absence d'expériences robotiques réelles documentées en détail invite à la prudence avant d'extrapoler les performances annoncées à un contexte de déploiement industriel.

RechercheOpinion
1 source
Le potentiel des modèles fondation haptiques
4arXiv cs.RO 

Le potentiel des modèles fondation haptiques

Un article publié sur arXiv sous la référence 2608.28664v1, intitulé « The Potential of Haptic Foundation Models », propose un cadre pour des modèles de fondation dédiés au toucher, baptisés Haptic Foundation Models (HFM). Les auteurs détaillent quatre axes de transition nécessaires pour passer de modèles passifs, de type LLM et VLM, à des HFM actifs : le couplage à l'action, l'espace de représentation de la dynamique physique, la granularité des séries temporelles continues, et la prédiction d'état futur conditionnée par l'action. L'article synthétise les jeux de données tactiles à grande échelle existants et compare quatre modèles haptiques, UniTouch, AnyTouch, T3 et Sparsh, sur un banc d'essai nommé TacBench, portant sur trois tâches : l'estimation de force, la détection de glissement et l'estimation de pose relative. Il s'agit d'un article de synthèse et de positionnement académique, accompagné d'une évaluation comparative, et non d'un produit commercial ni d'un déploiement industriel. L'enjeu identifié touche directement à un angle mort connu du secteur robotique : si les modèles de fondation ont transformé le traitement du langage et de la vision, leur extension à l'IA incarnée reste bridée par l'absence de capteurs tactiles génériques et de modèles capables de généraliser le toucher. Les modèles haptiques actuels restent figés sur des tâches spécifiques, freinés par l'hétérogénéité du matériel d'un dispositif à l'autre et par la nécessité de collecter des données par interaction physique active, contrairement au texte ou à l'image disponibles passivement en ligne. Cette limite concerne directement l'électronique grand public (smartphones, wearables, contrôleurs VR) ainsi que les robots domestiques et les dispositifs de suivi de santé, où une interaction physique sûre et adaptative est requise. L'article suggère ainsi que le sens du toucher constitue un chantier distinct de la vision et du langage dans la course aux modèles fondation pour la robotique. Le travail s'inscrit dans la dynamique plus large d'extension des modèles de fondation au-delà du texte et de l'image vers l'action physique, en s'appuyant sur des jeux de données tactiles et des modèles haptiques déjà publiés qu'il cherche à faire dialoguer via un référentiel commun d'évaluation, plutôt qu'à annoncer un nouveau système déployé.

RecherchePaper
1 source