
CoFreeVLA : manipulation à deux bras sans collision par modèle vision-langage-action et estimation du risque
Des chercheurs ont publié une nouvelle version (v3) de CoFreeVLA, un framework qui ajoute aux modèles Vision-Language-Action (VLA) un estimateur léger de risque de collision pour bras robotiques doubles, décrit dans le papier arXiv 2601.21712. Le module prédit la probabilité de collision entre les deux bras ou avec l'objet saisi à partir de l'état proprioceptif, des embeddings visuels et des actions candidates, puis bloque les commandes risquées, génère une trajectoire de repli sûre et réoriente l'entraînement de la politique. L'entraînement combine un pré-entraînement sur des collisions synthétiques et un post-entraînement sur des trajectoires réelles. Sur cinq tâches bimanuelles, six backbones VLA et 30 essais par variante, le taux de collision moyen tombe de 0,54 à 0,23 et le taux de réussite grimpe de 0,45 à 0,61.
L'enjeu dépasse la simple démonstration : la plupart des politiques VLA bout-en-bout ont été validées sur bras unique, où l'auto-collision n'existe pas, alors qu'elle devient un frein direct dès que deux bras coordonnés manipulent une charge commune. Pour les intégrateurs, la preuve qu'un tel garde-fou de sécurité se greffe sur six architectures existantes sans réentraînement complet abaisse le coût d'adoption d'une couche de sécurité indépendante du backbone. L'échantillon reste toutefois modeste, 30 essais par variante sur cinq tâches, ce qui invite à la prudence avant d'extrapoler ces gains de taux de collision à des lignes de production réelles.
CoFreeVLA s'inscrit dans la généralisation des modèles VLA, dans la lignée de Pi-0, RT-2, OpenVLA ou GR00T N2, comme couche de contrôle générique pour la manipulation instruite, un paradigme éprouvé jusqu'ici surtout sur des bras uniques. La multiplication des humanoïdes et des cellules industrielles à deux bras rend ce manque de modélisation des auto-collisions de plus en plus pressant à mesure que ces systèmes quittent le laboratoire. Le travail reste pour l'instant une contribution académique publiée sur arXiv, sans partenaire industriel ni déploiement annoncé, dont la portée devra être confirmée sur davantage de plateformes et de tâches.
Dans nos dossiers




