
PEAfowl : action vision-langage multi-vue à perception renforcée pour manipulation bimanuelle
Une équipe de recherche a publié sur arXiv, en version 2, un article décrivant PEAfowl, une architecture vision-langage-action (VLA) pour la manipulation bimanuelle en environnement encombré. Le modèle prédit des distributions de profondeur par token, effectue un relèvement 3D différentiable et fusionne les vues caméra par agrégation locale de voisins, au lieu de la simple concaténation de tokens des approches existantes. Pour l'ancrage des instructions, il remplace le conditionnement global du langage par une lecture de type Perceiver appliquée aux features CLIP gelées, avec accumulation itérative des indices visuels pertinents. Une distillation de profondeur, réalisée uniquement à l'entraînement via un modèle enseignant préexistant, affine les priors géométriques sans coût supplémentaire à l'inférence, ce qui compense le bruit et les trous typiques des capteurs RGB-D grand public. Sur le benchmark RoboTwin 2.0, en configuration à randomisation de domaine, PEAfowl améliore le taux de réussite de 23 points de pourcentage par rapport à la meilleure référence testée, un gain que les auteurs disent confirmé par des essais complémentaires sur robot physique.
Ce travail cible deux limites connues des modèles VLA actuels: une fusion multi-vue trop grossière, qui fragilise la perception sous occlusion ou changement de point de vue, et un ancrage du langage jugé imprécis quand l'instruction sert de simple conditionnement global. Pour les intégrateurs qui évaluent des politiques VLA face à des références comme Pi-0, GR00T N2 ou Helix, ce résultat montre que la robustesse spatiale et la précision de l'ancrage linguistique restent des axes actifs de progrès plutôt que des problèmes déjà résolus. Il faut toutefois noter que le gain de 23 points est mesuré en simulation randomisée; les résultats sur robot réel, évoqués sans détail chiffré précis, relèvent à ce stade d'une validation qualitative plutôt que d'une preuve de déploiement à l'échelle.
PEAfowl s'inscrit dans les travaux cherchant à réduire l'écart entre démonstrations en simulation et exécution fiable en conditions réelles pour la manipulation bimanuelle, un axe également exploré par des laboratoires industriels avec des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. L'article, classé en catégorie "replace-cross" sur arXiv, ne précise ni affiliation institutionnelle ni partenaire industriel. Un site dédié au projet est en ligne, mais aucun calendrier de publication de code ni de pilote industriel n'est annoncé pour l'instant.
Dans nos dossiers




