Aller au contenu principal
ForeTime-VLA : distillation causale de jetons futurs à partir d'un modèle d'action du monde pour la manipulation sur convoyeur
RecherchearXiv cs.RO 

ForeTime-VLA : distillation causale de jetons futurs à partir d'un modèle d'action du monde pour la manipulation sur convoyeur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié le 24 août 2026 sur arXiv (2608.20735) décrit ForeTime-VLA, une politique de manipulation robotique bâtie sur pi0.5 et conçue pour la saisie d'objets sur tapis roulant. Hors ligne, le système distille d'un modèle enseignant figé issu d'un world action model nommé Fast-WAM une cible compressée en 64 dimensions représentant les trames vidéo futures ; à l'inférence, un encodeur de huit trames d'historique prédit seul cette cible, la phase de manipulation et le temps avant transition, sans faire tourner le modèle enseignant. Sur 768 fenêtres de test issues d'un jeu de données de tapis roulant dédupliqué, l'erreur absolue moyenne recule de 0,134119 à 0,130593 (2,63%, IC95% 0,82-4,48%) et l'erreur L2 de 3,02%, pour un surcoût de latence de 2,46 à 2,93%. En essais réels sur robot, le système obtient 81,1% de réussite de saisie sur objets immobiles et 58,9% sur objets lents (+12,2 et +22,2 points face à la meilleure référence), et réussit 44 saisies sur 90 contre 23 pour pi0.5 de base, dont 11 sur 30 contre 2 sur 30 à vitesse rapide.

L'enjeu dépasse le simple gain de précision : les politiques VLA classiques, entraînées sur la seule observation courante, peinent à anticiper le contact avec un objet en mouvement, un frein direct pour le tri et la logistique automatisés où les convoyeurs restent la norme. Les modèles de monde apprennent cette dynamique prédictive mais restent trop coûteux à exécuter en temps réel ; ce travail montre qu'une distillation causale de tokens futurs, réalisée hors ligne puis intégrée à un encodeur léger, peut en capter le bénéfice sans en payer le coût d'inférence. La corrélation entre les gains hors ligne sur l'orientation et la baisse réelle des échecs de pose de contact reste l'argument le plus solide avancé par les auteurs, dans un champ où l'écart entre métriques d'entraînement et performance réelle est une critique récurrente adressée aux VLA.

Le travail prend pi0.5, la politique de Physical Intelligence largement utilisée comme référence en recherche robotique, comme base directe de comparaison. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier commercial : il s'agit d'une contribution de recherche postée en cross-listing sur arXiv et testée sur un banc propriétaire de tapis roulant, pas d'un produit annoncé par une entreprise, et aucun acteur français ou européen n'y figure. Elle s'inscrit néanmoins dans la compétition plus large autour des world models appliqués à la robotique, aux côtés d'approches comme GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent la même anticipation temporelle des politiques VLA. Les auteurs ne mentionnent aucune suite prévue au-delà de ces résultats, laissant ouverte une validation sur des tâches de manipulation plus variées que la seule saisie sur convoyeur.

À lire aussi

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense
1arXiv cs.RO 

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense

Des chercheurs ont publié sur arXiv (référence 2606.11184) TacForeSight, un framework léger d'anticipation tactile guidée par la force pour la manipulation en contact riche. Le système repose sur deux composants : TacForceWM, un modèle du monde tactile qui prédit les dynamiques latentes tactiles à court horizon à partir de capteurs bi-doigts conditionnés par les signaux de force et de couple au poignet à haute fréquence, et une politique conditionnée par l'anticipation tactile (Predictive Tactile-Conditioned Policy) qui exploite ces prédictions comme priors de contact, modélise l'évolution tactile courante-vers-future via cross-attention, et fusionne les features visuo-tactiles via un module de gating adaptatif. Les expériences portent sur cinq tâches représentatives de manipulation sur robot réel et trois scénarios de perturbation en cours de manipulation, avec des résultats supérieurs aux baselines existantes dans tous les cas, notamment sous perturbations de contact dynamiques. Le code et les datasets seront mis à disposition publiquement sur tacforesight.github.io. L'apport technique central est de modéliser explicitement les rôles asymétriques de la force globale au poignet (basse résolution spatiale, haute fréquence) et du toucher local bi-doigts (haute résolution spatiale, dynamique plus lente), distinction que la plupart des méthodes d'imitation learning actuelles ignorent. En opérant entièrement dans un espace latent compact, le framework permet un raisonnement de contact proactif compatible avec le contrôle haute fréquence, là où les approches réactives échouent sous perturbations imprévues. Pour les intégrateurs industriels et les équipes travaillant sur l'assemblage ou le conditionnement robotisé, c'est une démonstration concrète que la fusion force+tactile dans un world model améliore la robustesse réelle sans alourdir l'inférence en temps réel. Ce travail s'inscrit dans une vague de recherche combinant world models et retour tactile pour la manipulation dextre, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur GR00T N2 de NVIDIA qui intègrent également des politiques tactile-aware. Aucun concurrent français ou européen direct n'est identifié sur ce créneau précis, bien que des acteurs comme Pollen Robotics ou Enchanted Tools s'appuient aussi sur la manipulation fine. Il s'agit ici d'un preprint non encore évalué par les pairs, sans déploiement industriel ni partenaire annoncé : les résultats, bien que prometteurs sur cinq tâches de laboratoire, devront être reproduits sur des géométries et conditions de contact plus variées avant de valider la généralisation à l'échelle industrielle.

UEImpact indirect : le code open-source prévu sur tacforesight.github.io pourrait être exploité par des équipes européennes travaillant sur la manipulation fine, comme Pollen Robotics ou les labos CEA-List, mais aucun acteur FR/EU n'est impliqué dans ce travail.

RecherchePaper
1 source
VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches
2arXiv cs.RO 

VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches

Des chercheurs présentent VT-WAM, un modèle de manipulation robotique combinant vision et toucher, décrit dans un article déposé sur arXiv (2607.02503v1) et accompagné d'un site dédié (vt-wam.github.io). Le système, un "Visual-Tactile World Action Model", apprend simultanément trois choses dans un même cadre de flow matching : prédire les images visuelles futures, prédire la déformation tactile future, et prédire l'action à exécuter. Deux mécanismes techniques soutiennent cette approche : une attention "Asymmetric Mixture-of-Transformers" (MoT) qui relie une première image de référence à la dynamique tactile dans le temps, et un module nommé AVTAG (Action-Visual-Tactile Attention Guidance) qui force le modèle à s'appuyer davantage sur le signal tactile pendant les phases de contact. Sur six tâches de manipulation en conditions réelles impliquant un contact physique important, VT-WAM atteint un taux de réussite moyen de 71,67%, contre des scores inférieurs de 26,67 points pour Fast-WAM et de 35,84 points pour OmniVTLA, deux modèles de référence utilisés en comparaison. L'enjeu dépasse la simple performance chiffrée : les politiques visuo-tactiles existantes se contentent généralement d'injecter le signal tactile brut dans la prédiction d'action, sans modéliser comment cette déformation évolue dans le temps. Or c'est précisément sur les tâches à fort contact (insertion, préhension d'objets déformables, gestion du glissement) que les modèles purement visuels ou de type VLA (vision-language-action) échouent le plus souvent, malgré des démonstrations impressionnantes en environnement contrôlé. Pour les intégrateurs industriels qui cherchent à automatiser des opérations d'assemblage fin, ce travail illustre une piste concrète pour combler l'écart entre démonstration et fiabilité réelle. Le papier s'inscrit dans la lignée des "world models" appliqués à la robotique, dont Fast-WAM constitue un prédécesseur direct servant de base de comparaison, aux côtés de familles de modèles VLA comme OmniVTLA. Il s'agit toutefois d'une publication académique, sans acteur industriel identifié ni date de déploiement annoncée : les résultats restent circonscrits à six tâches de laboratoire, et les auteurs eux-mêmes soulignent via leurs ablations que la modélisation de la dynamique tactile reste un problème ouvert plutôt qu'une solution définitivement close.

RecherchePaper
1 source
ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche
3arXiv cs.RO 

ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche

Des chercheurs publient sur arXiv (2609.18242v1) ForceDelta-VLA, une méthode destinée à améliorer les politiques Vision-Language-Action (VLA) sensibles à la force pour la manipulation robotique en contact riche, comme l'insertion ou l'assemblage de pièces. Le problème de départ: les VLA actuels fusionnent mouvement de tâche et ajustement de contact en une seule prédiction, sans distinguer une action de référence réutilisable d'une correction. ForceDelta-VLA construit cette correction à partir des prédictions d'un modèle enseignant gelé, comparées en mode conditionné par la force et en mode agnostique, complétées par une correction de délai gérant le décalage de l'action de référence. La politique légère qui en résulte ajuste les actions via l'historique de force récent, sans régénérer de séquences complètes à chaque contact. Sur neuf tâches en bras unique et bimanuelles, le taux de réussite moyen atteint 82,2%, contre 54,4% pour la référence ForceVLA; le "Stage-1 Temporal Teacher" seul atteint 70,6%, et le système complet réduit la force de contact de crête d'environ 26% sur les deux plateformes testées. Ce résultat vise d'abord les chercheurs et intégrateurs travaillant sur la manipulation fine (insertion de connecteurs, assemblage, montage électronique), un point faible connu des VLA généralistes, plus à l'aise sur la préhension grossière que sur les tâches exigeant un retour de force précis. En découplant mouvement macro et correction de contact, ForceDelta-VLA évite de régénérer un chunk d'action complet à chaque micro-ajustement, ce qui allège le calcul et améliore la réactivité pour un déploiement industriel manipulant des pièces fragiles ou mal positionnées. La baisse de 26% du pic de force est aussi pertinente pour la sécurité du matériel et la durée de vie des effecteurs. Ces gains restent toutefois mesurés sur seulement neuf tâches en environnement de recherche, sans indication de déploiement industriel ni de plateforme commerciale nommée. ForceDelta-VLA se positionne comme une amélioration du système ForceVLA, pris comme référence de comparaison tout au long de l'article, et s'inscrit dans la lignée des modèles Vision-Language-Action, à l'image de Pi-0, GR00T N2 ou Helix, qui cherchent à généraliser la manipulation robotique à partir de démonstrations, la manipulation à contact riche restant un angle mort persistant de ces architectures. Publié sans affiliation industrielle citée, le travail ne mentionne ni entreprise ni date de déploiement: c'est une contribution méthodologique pour la communauté robotique, dont l'extension à davantage de tâches et de plateformes physiques serait la suite logique.

RechercheActu
1 source
DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
4arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source