FOCUS : des états privilégiés au RGB-D grâce à un changement de modalité contrôlé et à l'alignement des représentations
Des chercheurs proposent FOCUS, un cadre d'apprentissage par renforcement en une seule étape, fondé sur PPO, qui vise à réduire l'écart entre l'entraînement en simulation avec états privilégiés et le déploiement avec des observations RGB-D. Le critique (la fonction de valeur) est entraîné sur l'état privilégié disponible en simulation: positions d'objets, poses, etc. L'acteur, lui, collecte ses trajectoires soit depuis des latents issus de caméras RGB-D, soit depuis des latents issus de l'état privilégié. Le choix entre les deux est régulé automatiquement par la divergence de Kullback-Leibler entre les distributions d'actions produites par chaque modalité. Un terme d'alignement de représentation pousse en parallèle l'acteur à choisir des actions cohérentes dans les deux cas. Sur cinq tâches de manipulation, le succès moyen au test passe de 0,71 à 0,93 par rapport au meilleur baseline RGB-D au test de chaque tâche. L'AUC de succès à l'entraînement, normalisée par budget et calculée sur l'ensemble du pipeline de chaque méthode, passe de 0,47 à 0,65. Sur Pick-and-Place, le succès au test grimpe de 0,47 à 0,86 et l'AUC de 0,12 à 0,61, soit un gain de 5,0 fois en efficacité d'apprentissage pour un budget d'interactions fixe.
Ce travail s'attaque à un point de friction très concret pour les équipes qui entraînent des politiques visuelles de manipulation. L'apprentissage direct sur pixels est coûteux en échantillons, tandis que la distillation d'un « enseignant » à états privilégiés vers un « élève » visuel impose généralement plusieurs étapes et laisse un écart de modalité au moment du test. FOCUS propose de conserver un seul étage d'entraînement et de faire croître progressivement l'exposition au RGB-D, uniquement quand les deux modalités s'accordent sur l'action à effectuer. Si les gains se confirment, cela réduirait le coût de calcul et la complexité d'ingénierie des pipelines sim-to-real, notamment pour les intégrateurs qui entraînent des politiques de préhension et de dépose sur des scènes variées. Les réserves sont toutefois nettes. Les résultats sont annoncés sur cinq tâches, apparemment en simulation. L'article ne mentionne ni transfert sur robot réel, ni comparaison avec des modèles fondation de type VLA, ni nombre de graines. Le chiffre de 0,71 à 0,93 compare en outre FOCUS au meilleur baseline sélectionné tâche par tâche, ce qui rend la comparaison conservatrice mais dépendante du choix des baselines.
Le contexte est celui d'une littérature déjà riche sur l'asymétrie acteur-critique et la distillation d'états privilégiés vers des observations visuelles, où les méthodes en deux phases dominent. L'enjeu reste la robustesse du RGB-D bruité, par exemple face aux reflets, aux occultations ou aux capteurs bon marché. Il s'agit d'une prépublication arXiv (2610.11119v1), non encore évaluée par les pairs, sans code ni calendrier de validation annoncés dans le résumé. La suite logique serait un test sur matériel réel et une confrontation avec les politiques généralistes actuelles, afin de savoir si ce gain d'efficacité tient hors des benchmarks simulés.
Dans nos dossiers


