ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche
Des chercheurs publient sur arXiv (2609.18242v1) ForceDelta-VLA, une méthode destinée à améliorer les politiques Vision-Language-Action (VLA) sensibles à la force pour la manipulation robotique en contact riche, comme l'insertion ou l'assemblage de pièces. Le problème de départ: les VLA actuels fusionnent mouvement de tâche et ajustement de contact en une seule prédiction, sans distinguer une action de référence réutilisable d'une correction. ForceDelta-VLA construit cette correction à partir des prédictions d'un modèle enseignant gelé, comparées en mode conditionné par la force et en mode agnostique, complétées par une correction de délai gérant le décalage de l'action de référence. La politique légère qui en résulte ajuste les actions via l'historique de force récent, sans régénérer de séquences complètes à chaque contact. Sur neuf tâches en bras unique et bimanuelles, le taux de réussite moyen atteint 82,2%, contre 54,4% pour la référence ForceVLA; le "Stage-1 Temporal Teacher" seul atteint 70,6%, et le système complet réduit la force de contact de crête d'environ 26% sur les deux plateformes testées.
Ce résultat vise d'abord les chercheurs et intégrateurs travaillant sur la manipulation fine (insertion de connecteurs, assemblage, montage électronique), un point faible connu des VLA généralistes, plus à l'aise sur la préhension grossière que sur les tâches exigeant un retour de force précis. En découplant mouvement macro et correction de contact, ForceDelta-VLA évite de régénérer un chunk d'action complet à chaque micro-ajustement, ce qui allège le calcul et améliore la réactivité pour un déploiement industriel manipulant des pièces fragiles ou mal positionnées. La baisse de 26% du pic de force est aussi pertinente pour la sécurité du matériel et la durée de vie des effecteurs. Ces gains restent toutefois mesurés sur seulement neuf tâches en environnement de recherche, sans indication de déploiement industriel ni de plateforme commerciale nommée.
ForceDelta-VLA se positionne comme une amélioration du système ForceVLA, pris comme référence de comparaison tout au long de l'article, et s'inscrit dans la lignée des modèles Vision-Language-Action, à l'image de Pi-0, GR00T N2 ou Helix, qui cherchent à généraliser la manipulation robotique à partir de démonstrations, la manipulation à contact riche restant un angle mort persistant de ces architectures. Publié sans affiliation industrielle citée, le travail ne mentionne ni entreprise ni date de déploiement: c'est une contribution méthodologique pour la communauté robotique, dont l'extension à davantage de tâches et de plateformes physiques serait la suite logique.
Dans nos dossiers



