TAO-Force : unifier perception sensible à la force et contrôle rapide-lent pour la manipulation à contacts riches
TAO-Force, présenté dans un papier de recherche publié sur arXiv en septembre 2026 (arXiv:2609.18497v1), s'attaque aux limites des modèles Vision-Language-Action (VLA) pour la manipulation robotique riche en contact, comme l'insertion de pièces ou l'assemblage fin. Le système ajoute une perception sensible à la force via F-FiLM (Force-conditioned Feature-wise Linear Modulation), un module qui injecte un retour de force encodé dans les représentations d'un backbone vision-langage pré-entraîné et gelé, sans altérer ses connaissances sémantiques. Côté contrôle, une architecture "fast-slow" déclenchée par la détection de contact fait alterner une branche lente en position, qui suit la trajectoire nominale hors contact, et une branche rapide en admittance, qui régule l'interaction physique dès le contact. L'approche est validée par une tâche dédiée de perception de force et par des essais réels sur quatre tâches de manipulation riches en contact ; l'abstract ne précise ni taux de réussite chiffrés, ni plateforme robotique, ni affiliation des auteurs.
Le travail cible un angle mort documenté des VLA génériques actuels, de Pi-0 à Helix : leur perception, essentiellement visuelle, détecte mal l'amorce et l'intensité d'un contact, et leur exécution en boucle de position ne s'adapte pas en temps réel aux dynamiques de contact qui évoluent vite, ce qui cantonne ces modèles à la préhension grossière plutôt qu'aux gestes fins comme l'insertion de connecteurs. Pour les intégrateurs et les équipes robotique industrielles, l'intérêt tient à la méthode : injecter un retour de force dans un backbone VLA gelé, sans réentraîner tout le modèle, offre une adaptation moins coûteuse, dans un secteur où l'écart entre démonstrations léchées et fiabilité en usine reste le principal frein à l'adoption de politiques génériques de manipulation.
TAO-Force s'inscrit dans une tendance de recherche plus large consistant à ajouter des capteurs de force et de couple aux politiques de manipulation. Ces politiques, entraînées surtout sur des flux caméra, sont ici adaptées via un backbone gelé plutôt que par un réentraînement complet. Publié sur arXiv sans revue par les pairs et sans partenaire industriel ni calendrier de déploiement annoncés, le travail devra être reproduit par d'autres laboratoires avant toute intégration dans des piles logicielles pour bras industriels ou mains de robots humanoïdes.
Dans nos dossiers




