Voir à travers le cadre décalé : distillation de bruit privilégié pour l'assemblage de précision vision-force
Des chercheurs publient sur arXiv (2610.07745) une méthode d'assemblage de précision par vision et force, centrée sur un problème précis : l'erreur de pose ne fausse pas seulement ce que le robot observe, elle déplace aussi le repère dans lequel il agit. Sur le benchmark FORGE, la politique officielle fondée sur l'état réussit 97 à 99 % des épisodes avec la pose exacte. Elle tombe à 32-60 % avec le bruit de pose du benchmark (σ = 5 mm). La même pose estimée alimente l'observation et ancre le repère d'action. Avant le contact, le décalage est donc impossible à identifier à partir de la seule proprioception. Les auteurs injectent cette information manquante pendant l'entraînement, de deux façons. Un professeur privilégié voit le décalage en simulation. Sinon, des démonstrations propres sont réétiquetées dans le repère déplacé, en forme fermée. L'élève, entraîné par clonage comportemental puis un tour de DAgger, ne reçoit au test que l'état bruité, une fenêtre brute de couple-force et deux caméras RGB.
Les résultats sont nets, mais ils restent ceux d'un papier académique. Sur les tâches FORGE non modifiées, l'élève issu du professeur garde 92 à 99 % de réussite pour σ de 0 à 5 mm. Six références sans information privilégiée chutent à 2-80 %. Une expérience contrôlée isole la cause, avec la même architecture, le même budget de données et la même procédure. Les démonstrations générées sans accès au décalage donnent 31,5 % à σ = 5 mm. Les démonstrations privilégiées atteignent 88,7 % et les démonstrations réétiquetées 95,8 %. En déploiement zéro-shot sur un Franka, l'élève obtient 83,3 % de réussite agrégée à 5 mm, contre 34,4 % pour la meilleure politique fondée sur l'état. Le test réel ne porte que sur un seul bras, et le papier ne détaille pas le nombre d'essais dans l'extrait disponible.
Pour les intégrateurs, le message est que de meilleurs capteurs ne suffisent pas. Ajouter vision et force à une politique ne règle pas le problème si la supervision n'encode pas la compensation du décalage latent. Cela touche directement les cellules d'insertion, de connecteurs ou de vissage, où l'incertitude de calibration et de perception est la norme. Le résultat suggère aussi que la distillation de bruit privilégié, ou le réétiquetage en forme fermée quand c'est possible, peut réduire l'écart simulation-réel. Il reste à voir si cela tient sur des pièces et des tolérances industrielles variées.
Le travail s'appuie sur FORGE, un benchmark d'assemblage de précision en simulation, et sur la tradition du professeur privilégié suivi d'un élève déployable, déjà courante en locomotion et en manipulation. Il se distingue des grands modèles vision-langage-action généralistes (Pi-0, GR00T), qui visent la généralité plutôt que la précision sub-millimétrique. Une page projet est disponible, mais aucun déploiement commercial n'est annoncé. Les prochaines étapes probables sont des tests sur d'autres bras et d'autres tâches, puis une intégration dans des politiques plus générales.
Dans nos dossiers




