Résidus de pose à référence fixe pour mesurer le transfert d'indices entre jeux de données dans l'anticipation de l'interaction homme-robot
Des chercheurs proposent un modèle baptisé FRPR (fixed-référence pose residual) pour mesurer quels indices permettent à un robot social ou de service, évoluant dans un espace public, d'anticiper qu'une personne proche va s'approcher et le toucher. Le principe : un prédicteur géométrique, construit à partir de la boîte englobante et du masque de la personne, est entraîné puis gelé. Un réseau temporel apprend ensuite, à partir de la pose corporelle, une correction additive du logit, de sorte que chaque prédiction se décompose exactement en un terme géométrique et un terme de pose. L'évaluation porte sur deux jeux de données égocentriques publics enregistrés par des robots différents, HUI360 et SSUP-A, tous les choix étant faits sur les données source. De SSUP-A vers HUI360, la correction de pose fait passer la précision moyenne (AP) de 0,277 à 0,321. Dans le sens inverse, le gain n'est pas mesurable. L'asymétrie persiste face à une référence géométrique plus solide, sélectionnée sur la source. Le code et les données traitées sont publiés sur GitHub (WeiZhou96/FRPR-interaction-anticipation).
Le point à retenir pour les intégrateurs et les décideurs tient surtout aux limites que les auteurs reconnaissent eux-mêmes. Geler la référence géométrique n'apporte aucun avantage d'AP par rapport à un entraînement conjoint, et de simples bases géométriques ou des ensembles d'arbres restent compétitifs, voire meilleurs. La construction sert donc à mesurer, pas à prédire plus précisément. Surtout, avec des seuils fixés sur la source, les modèles neuronaux exploitant la géométrie ne détectent au mieux que 17 % des interactions cibles. Un modèle d'anticipation entraîné sur un robot et déployé sur un autre, dans un autre site, reste donc loin d'être exploitable en l'état. Cela rappelle que le transfert entre plateformes demeure un problème ouvert pour la robotique sociale, bien plus que ne le laissent croire les résultats obtenus sur un seul jeu de données.
Sur le plan des indices, les résultats sont instructifs mais restent à confirmer. Un résidu d'orientation de la tête apporte de petits gains dans les deux sens. Dans une analyse a posteriori, le fait qu'une personne fasse face à la caméra conserve la même direction discriminante d'un jeu de données à l'autre, alors que l'inclinaison de la tête (pitch) s'inverse. Ce dernier point suggère que certains signaux de pose dépendent de la hauteur de la caméra ou du comportement du public sur chaque site, et ne se généralisent pas. Ces conclusions viennent d'une étude académique sur deux jeux de données seulement, sans produit ni déploiement commercial associé. Elles servent surtout aux équipes qui conçoivent des robots d'accueil ou de service : le contact visuel et l'orientation du corps semblent plus fiables que des indices fins de posture, et toute validation devrait se faire sur le site cible plutôt que par transfert direct.
Pas d\'impact direct sur la France/UE



