Pegasus 1.6 apporte la compréhension vidéo à l'IA physique, selon TwelveLabs
TwelveLabs, société de vidéo intelligence fondée en 2021 et basée à Séoul, a publié Pegasus 1.6, la nouvelle version de son modèle vidéo qui marque son entrée dans l'IA physique. C'est son premier modèle conçu pour la vidéo égocentrique, c'est-à-dire filmée du point de vue de la personne qui travaille : cuisiner, assembler des pièces sur une ligne d'usine ou téléopérer un robot. Pegasus 1.6 n'exige ni caméra spécifique ni matériel propriétaire. Il traite aussi les images fixes et peut s'appliquer à des archives vidéo existantes. Il prend en charge cinq workflows, dont la segmentation et l'étiquetage d'actions, qui produit des labels horodatés (tâches, étapes, objets, interactions main-objet) alignés sur la taxonomie du client, et le sous-titrage dense. Les trois autres ne sont pas détaillés dans le matériel disponible. Le PDG Jae Lee a confirmé à The Robot Report que l'entreprise se concentre sur la couche de compréhension vidéo et non sur l'entraînement des modèles robotiques.
L'enjeu est le goulot d'étranglement des données. Les équipes robotiques accumulent des millions d'heures de vidéo, mais ces images brutes ne sont pas exploitables telles quelles : il faut savoir quelle action se déroule, à quel instant, avec quel objet, et quand un tiers entre dans le champ. Lee souligne que la vidéo égocentrique se collecte et se met à l'échelle bien plus facilement que les données de téléopération, aujourd'hui coûteuses et lentes à produire. Si l'annotation automatique tient ses promesses, elle pourrait réduire le coût de préparation des jeux de données pour les intégrateurs et les équipes qui entraînent des modèles vision-langage-action (VLA). La prudence s'impose toutefois : l'annonce ne fournit ni benchmark public, ni taux de précision d'annotation, ni client nommé, ni tarif. Les formules du type « comme jamais auparavant » relèvent du discours commercial, et la vidéo égocentrique, filmée par des caméras portées sur la tête, est connue pour dérouter les modèles entraînés sur des contenus diffusés, pédagogiques ou cinématographiques.
TwelveLabs s'est fait connaître avec Marengo et Pegasus, présentés comme une plateforme « full-stack » de recherche et d'analyse vidéo. Le pivot vers la robotique s'inscrit dans une tendance du secteur : face à la pénurie de données d'entraînement, les acteurs des humanoïdes et des VLA multiplient les sources, entre téléopération, simulation et vidéo humaine. TwelveLabs se positionne en fournisseur d'infrastructure plutôt qu'en concurrent des constructeurs, mais il devra convaincre face aux prestataires d'annotation et aux équipes qui développent leurs outils en interne. Les prochaines étapes à surveiller sont la publication de mesures de qualité sur des jeux de données robotiques, l'annonce de premiers partenaires industriels et la preuve que des modèles entraînés sur ces labels s'améliorent réellement sur des tâches physiques.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




