Abandon ciblé de modalités pour une manipulation robotique réelle robuste aux pertes intermittentes de vision
Des chercheurs proposent le Targeted Modality Dropout (TMD), une méthode d'entraînement pour politiques d'apprentissage par imitation multimodales (vision et autres capteurs). Elle cible un défaut connu: pendant l'entraînement, la politique s'appuie de façon excessive sur la modalité dominante, généralement la vision, et son exécution se dégrade quand cette modalité disparaît à l'inférence. Le TMD estime la dépendance à chaque modalité grâce aux poids d'attention, puis supprime sélectivement la plus dominante. Ce mécanisme est associé à une régularisation par entropie sur la distribution de dépendance, qui empêche la politique de reporter toute sa confiance sur une seule source. Les tests ont été menés sur un robot réel, un manipulateur bimanuel. Lors d'une perte de vision, le taux de réussite de la politique de référence chute nettement, tandis que la politique entraînée avec TMD continue d'exécuter les tâches. Le résumé de l'article ne fournit ni taux de réussite chiffrés, ni nombre de tâches, ni précision sur les modalités testées, ni identité du robot.
Pour les intégrateurs et les responsables d'exploitation, l'enjeu est la robustesse en conditions réelles. Les caméras s'occultent, s'éblouissent, se salissent ou se déconnectent, notamment quand un bras ou un objet bloque le champ de vision en pleine manipulation. Une politique qui n'a appris qu'à "regarder" échoue alors précisément quand la tâche exige de la précision, alors qu'une politique capable de se rabattre sur d'autres signaux, comme la proprioception ou le tactile, tolère mieux ces pannes intermittentes. Le résultat sur le dropout conventionnel est aussi instructif. Un dropout tiré au hasard, sans régularisation par entropie, échoue sur de nombreuses tâches même sans perte de vision. La robustesse n'est donc pas gratuite: un masquage mal conçu dégrade la performance nominale. Il faut toutefois rester prudent, car il s'agit d'un préprint (arXiv, v1) sans relecture par les pairs, avec une évaluation qui semble limitée à une plateforme et dont l'ampleur reste à vérifier dans le texte complet.
Ce travail s'inscrit dans la montée des politiques multimodales entraînées par imitation, qu'il s'agisse de modèles vision-langage-action (VLA) ou de politiques de diffusion enrichies de signaux de force et de toucher. Ces approches se heurtent au même problème de modalité dominante, déjà traité par des techniques de dropout de modalités, de masquage aléatoire ou d'équilibrage des gradients. La nouveauté revendiquée ici est de remplacer le tirage aléatoire par un ciblage guidé par l'attention de la modalité sur laquelle la politique s'appuie le plus. Les prochaines étapes à surveiller sont la comparaison sur des politiques généralistes à grande échelle, la validation sur plusieurs robots, et la publication du code et des chiffres détaillés. Aucun déploiement industriel ni calendrier de commercialisation n'est annoncé: il s'agit d'une contribution de recherche.
Dans nos dossiers




