ActiveScale : passer à l'échelle la perception active des robots (modèle, données, matériel)
Un article de recherche publié sur arXiv sous la référence 2609.18514v1 présente ActiveScale, un framework conçu pour améliorer la perception active dans la manipulation robotique, c'est-à-dire la capacité d'un robot à changer de point de vue pour observer des informations autrement occultées par une caméra fixe. Le système combine un modèle vision-langage-action (VLA) enrichi d'observations vidéo historiques et d'une supervision explicite de la pose de caméra, via des jetons de pose associés à chaque image et une tête de prédiction légère qui relie les observations entre différents points de vue. Pour entraîner ce modèle à exploiter les mouvements de caméra naturels présents dans l'activité humaine, les auteurs introduisent une méthode de pré-entraînement intermédiaire combinant 1000 heures de données égocentriques (captées du point de vue humain) et de données robotiques. Ils présentent également une plateforme matérielle dédiée, baptisée AMP (Active-perception Mobile-manipulation Platform), pilotable par un seul opérateur en téléopération, qui permet de collecter à grande échelle des démonstrations coordonnant changement de point de vue et manipulation.
Cette approche s'attaque à une limite bien connue des modèles VLA actuels : un point de vue fixe laisse fréquemment des zones de la scène occultées, ce qui dégrade les performances de manipulation en conditions réelles. En s'appuyant sur des données égocentriques humaines, moins coûteuses à produire que la téléopération robotique classique, les auteurs proposent une piste concrète pour atténuer le goulot d'étranglement des données de démonstration, un frein central au passage à l'échelle des VLA. Les expériences rapportent une amélioration des taux de succès sur des tâches de perception active, sans toutefois fournir de pourcentages précis dans le résumé, ce qui invite à la prudence quant à l'ampleur réelle du gain avant lecture du papier complet.
Il s'agit d'une contribution académique, et non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun site de déploiement ni aucun partenaire n'est cité. Le travail s'inscrit dans la lignée des recherches visant à doter les modèles VLA d'un raisonnement spatial et temporel plus riche pour la manipulation robotique. Les auteurs présentent leur combinaison de modèle, de données et de plateforme matérielle comme une base destinée à la communauté de recherche pour poursuivre l'étude de la perception active, sans annoncer de calendrier de commercialisation ni de partenariat industriel.
Dans nos dossiers




