AnyviewMeter : adapter les modèles de récompense robotiques via la géométrie caméra et l'attention multi-vue
Des chercheurs présentent AnyviewMeter, un framework d'adaptation pour les modèles de récompense robotiques utilisés pour évaluer visuellement la progression d'une tâche. Le problème identifié : ces modèles, une fois entraînés, voient leurs prédictions varier selon le point de vue de la caméra ou les occlusions, même quand l'état réel de la tâche n'a pas changé. AnyviewMeter combine un fine-tuning à faible rang avec des rayons de Plücker alignés sur les tokens, qui encodent la géométrie de la caméra directement dans les caractéristiques visuelles et dans les mécanismes d'attention, ainsi qu'une attention par blocs synchronisée qui fusionne plusieurs vues à l'intérieur du décodeur préentraîné. Le système s'appuie sur le modèle Robometer et fonctionne en configuration mono-vue comme en évaluation conjointe multi-vues. Sur la tâche simulée PickCube, l'adaptation mono-vue améliore la prédiction de progression pour chaque groupe de caméras et réduit l'erreur absolue moyenne d'environ 21% par rapport à un simple fine-tuning RGB lorsque le champ de vision change. Sur un ensemble plus large de tâches de manipulation simulées, la prédiction conjointe multi-vues réduit l'erreur de progression de 41 à 69% par rapport à une moyenne de prédictions mono-vues RGB, et améliore l'ordonnancement temporel dans environ 88% des combinaisons tâche-caméra. Sur des tâches réelles utilisant des caméras fixes et montées sur poignet, l'erreur absolue moyenne baisse d'environ 21%.
Ces résultats visent un angle mort concret de la robotique par apprentissage : les modèles de récompense entraînés en simulation ou sur un jeu de caméras donné généralisent mal dès que la configuration physique change, un frein direct au déploiement chez des intégrateurs qui n'utilisent jamais exactement le même rig caméra que le laboratoire d'origine. En conditionnant explicitement le modèle sur la géométrie de la caméra plutôt qu'en espérant une généralisation implicite, AnyviewMeter propose une voie d'adaptation paramétrique légère, sans réentraînement complet, ce qui compte pour des équipes cherchant à réutiliser des modèles de récompense préentraînés sur des cellules robotiques hétérogènes. Cela nuance aussi l'idée que les VLA et modèles de supervision associés soient déjà robustes au changement de viewpoint dès la sortie du laboratoire.
Le travail s'inscrit dans la lignée des modèles de récompense visuels type Robometer, dont il constitue une extension géométrique plutôt qu'une refonte, et se positionne dans le champ plus large des méthodes de supervision pour l'apprentissage par renforcement en robotique, aux côtés des approches VLA génériques (Pi-0, GR00T N2). Les auteurs ne mentionnent pas de déploiement industriel ni de partenaire commercial: il s'agit d'un résultat de recherche évalué en simulation et sur un nombre limité de tâches réelles, sans indication de calendrier vers une intégration produit.
Dans nos dossiers




