Aller au contenu principal
IA physiqueRobotics Business Review 

Pegasus 1.6 apporte la compréhension vidéo à l'IA physique, selon TwelveLabs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

TwelveLabs, société de vidéo intelligence fondée en 2021 et basée à Séoul, a publié Pegasus 1.6, la nouvelle version de son modèle vidéo qui marque son entrée dans l'IA physique. C'est son premier modèle conçu pour la vidéo égocentrique, c'est-à-dire filmée du point de vue de la personne qui travaille : cuisiner, assembler des pièces sur une ligne d'usine ou téléopérer un robot. Pegasus 1.6 n'exige ni caméra spécifique ni matériel propriétaire. Il traite aussi les images fixes et peut s'appliquer à des archives vidéo existantes. Il prend en charge cinq workflows, dont la segmentation et l'étiquetage d'actions, qui produit des labels horodatés (tâches, étapes, objets, interactions main-objet) alignés sur la taxonomie du client, et le sous-titrage dense. Les trois autres ne sont pas détaillés dans le matériel disponible. Le PDG Jae Lee a confirmé à The Robot Report que l'entreprise se concentre sur la couche de compréhension vidéo et non sur l'entraînement des modèles robotiques.

L'enjeu est le goulot d'étranglement des données. Les équipes robotiques accumulent des millions d'heures de vidéo, mais ces images brutes ne sont pas exploitables telles quelles : il faut savoir quelle action se déroule, à quel instant, avec quel objet, et quand un tiers entre dans le champ. Lee souligne que la vidéo égocentrique se collecte et se met à l'échelle bien plus facilement que les données de téléopération, aujourd'hui coûteuses et lentes à produire. Si l'annotation automatique tient ses promesses, elle pourrait réduire le coût de préparation des jeux de données pour les intégrateurs et les équipes qui entraînent des modèles vision-langage-action (VLA). La prudence s'impose toutefois : l'annonce ne fournit ni benchmark public, ni taux de précision d'annotation, ni client nommé, ni tarif. Les formules du type « comme jamais auparavant » relèvent du discours commercial, et la vidéo égocentrique, filmée par des caméras portées sur la tête, est connue pour dérouter les modèles entraînés sur des contenus diffusés, pédagogiques ou cinématographiques.

TwelveLabs s'est fait connaître avec Marengo et Pegasus, présentés comme une plateforme « full-stack » de recherche et d'analyse vidéo. Le pivot vers la robotique s'inscrit dans une tendance du secteur : face à la pénurie de données d'entraînement, les acteurs des humanoïdes et des VLA multiplient les sources, entre téléopération, simulation et vidéo humaine. TwelveLabs se positionne en fournisseur d'infrastructure plutôt qu'en concurrent des constructeurs, mais il devra convaincre face aux prestataires d'annotation et aux équipes qui développent leurs outils en interne. Les prochaines étapes à surveiller sont la publication de mesures de qualité sur des jeux de données robotiques, l'annonce de premiers partenaires industriels et la preuve que des modèles entraînés sur ces labels s'améliorent réellement sur des tâches physiques.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

CometVLA : co-entraînement sur une pyramide de données incarnées pour la compréhension physique
1arXiv cs.RO 

CometVLA : co-entraînement sur une pyramide de données incarnées pour la compréhension physique

Un article publié sur arXiv (2608.30289v1) fin août 2026 présente CometVLA, un nouveau modèle vision-langage-action (VLA) pour la manipulation robotique. Le constat de départ : les jeux de données de question-réponse visuelle (VQA) physique sont désincarnés, mal alignés avec les données d'action réelles des robots, et les vidéos égocentriques ne servent qu'à un pré-entraînement auxiliaire, sans preuve claire que la compréhension physique du VLM améliore la génération d'actions en aval. Les auteurs construisent donc CometData et CometBench, un corpus et un benchmark de VQA physique alignés sur l'embodiment et les données d'action du robot, puis introduisent les "Global Action Prior" (GAP), des tokens formant un goulot d'étranglement appris qui isole les régularités de mouvement indépendantes de la tâche pour nourrir la tête d'action sans corrompre le backbone VLM pré-entraîné. Co-entraîné sur une "pyramide de données incarnées" (téléopération, simulation, trajectoires égocentriques, VQA), CometVLA surpasse de façon constante des baselines VLA solides sur des tâches de manipulation réelle et sur le simulateur RoboTwin. Le résultat clé est une corrélation directe entre les scores sur CometBench et le taux de succès en manipulation réelle : la compréhension physique du VLM se traduit en de meilleures actions, et non en un simple gain cosmétique sur des benchmarks de langage déconnectés du terrain. Pour les laboratoires et intégrateurs qui bâtissent des modèles fondation pour la manipulation, ce travail suggère que l'alignement strict entre données perception-langage et données d'action pèse plus lourd que le volume de VQA générique ajouté au pré-entraînement, une piste transposable à des architectures comme Pi-0, GR00T ou Helix. Ce travail prolonge la lignée des VLA qui, depuis RT-2 et OpenVLA, cherchent à fusionner compréhension visuelle et génération de mouvements, avec pour écueil récurrent la désynchronisation entre corpus de pré-entraînement et données de téléopération réelles. En s'appuyant sur RoboTwin, benchmark de simulation déjà établi pour la manipulation bimanuelle, et en publiant CometData et CometBench comme ressources réutilisables, les auteurs présentent CometVLA comme une contribution de recherche méthodologique, sans déploiement industriel, partenaire intégrateur ni date de mise sur le marché annoncés. La suite logique serait une extension à d'autres embodiments et une validation indépendante avant toute adoption commerciale.

IA physiqueActu
1 source
IA sans pilotage : DeVA, un modèle vidéo-action découplé guidé par la physique
2arXiv cs.RO 

IA sans pilotage : DeVA, un modèle vidéo-action découplé guidé par la physique

Des chercheurs présentent DeVA (Decoupled Video-Action model), une nouvelle architecture pour l'apprentissage de politiques robotiques combinant génération vidéo et prédiction d'actions, détaillée dans un article publié sur arXiv le 28 juillet 2026. Contrairement aux modèles Vision-Language-Action (VLA) classiques, qui reposent sur un pré-entraînement essentiellement statique offrant peu de supervision sur la dynamique physique et la causalité temporelle, DeVA s'appuie sur des modèles génératifs vidéo capables d'anticiper l'évolution d'une scène pendant l'exécution d'une instruction en langage naturel. L'architecture sépare un expert vidéo et un expert action, reliés par un transfert de caractéristiques multi-niveaux, et ajoute une supervision par guidage physique explicite fondé sur l'affordance et la profondeur. Les auteurs rapportent des résultats sur des benchmarks de simulation et lors de déploiements réels, avec de bonnes performances malgré peu de données d'entraînement. L'enjeu principal est l'efficacité des données et la vitesse de convergence: les modèles Video-Action existants couplent souvent vidéo et action dans un même réseau, ce qui rend l'adaptation de la politique difficile à optimiser, ou n'exploitent que partiellement l'information vidéo pour guider l'action. En découplant les deux experts tout en maintenant un transfert d'information riche, DeVA affiche une convergence plus rapide qu'une architecture unifiée équivalente, selon les auteurs. Pour les équipes qui développent des politiques de manipulation robotique généralisables, l'apport potentiel est de réduire le volume de démonstrations réelles nécessaires, un goulot d'étranglement connu du secteur, tout en améliorant la robustesse face aux variations de scène. Le travail s'inscrit dans la lignée des VLA de nouvelle génération qui cherchent à exploiter les a priori spatio-temporels des modèles génératifs vidéo plutôt que le seul pré-entraînement image-texte statique. Il se positionne comme une alternative aux architectures où vidéo et action partagent un même tronc, jugées plus difficiles à entraîner de bout en bout pour la tâche de contrôle. Les auteurs soulignent en particulier le gain apporté par le guidage physique salient sur les couches intermédiaires, un signal distinct des simples pertes de reconstruction vidéo. Il s'agit à ce stade d'un travail de recherche publié en preprint, sans indication de déploiement industriel ou de partenariat avec un fabricant de robots.

IA physiqueActu
1 source
PhysBrain 1.5 : des modèles vision-langage aux modèles fondation pour l'IA physique
3arXiv cs.RO 

PhysBrain 1.5 : des modèles vision-langage aux modèles fondation pour l'IA physique

PhysBrain 1.5, décrit dans une publication arXiv (2609.14973v1, soumission croisée), est un modèle unifié qui fusionne compréhension de scène, génération d'actions et prédiction d'états futurs dans un seul cadre d'apprentissage. Bâti sur un modèle vision-langage généraliste, il encode réponses textuelles, mouvements de l'effecteur terminal et cibles visuelles denses en séquences discrètes, optimisées conjointement par prédiction autorégressive du token suivant. Le pré-entraînement s'appuie entièrement sur des vidéos d'interaction humaine, sans donnée robot, via des épisodes centrés sur des tâches associant contexte sémantique et spatial au mouvement reconstruit et aux observations suivantes. L'ajustement supervisé combine ensuite démonstrations humaines, trajectoires robotiques et expérience simulée. Sur 28 benchmarks de compréhension incarnée, le modèle de 8 milliards de paramètres obtient un score moyen de 72,5, nouveau record open source, à la hauteur de modèles propriétaires comme GPT-6-Astra et Gemini 3.6 Flash, et meilleur résultat open source sur 14 des 28 benchmarks. L'enjeu pour l'industrie robotique tient à la source de supervision : pré-entraîner un modèle d'action à partir de vidéos humaines ordinaires, plutôt que de coûteuses données de téléopération robotique, attaquerait le principal goulot d'étranglement des modèles vision-langage-action (VLA) pour bras et humanoïdes. Qu'un modèle ouvert de 8B rivalise avec des systèmes propriétaires sur la compréhension intéresse les intégrateurs cherchant un déploiement local sans dépendre d'une API fermée. Réserve importante toutefois : la génération de trajectoires et la prédiction de scènes futures (RGB, profondeur, masques robot) ne reposent que sur des exemples qualitatifs, sans taux de réussite ni temps de cycle chiffrés, un écart classique entre démonstration et fiabilité de terrain. Ce travail s'inscrit dans la vague des modèles vision-langage-action qui unifient perception, langage et contrôle moteur dans un même transformeur autorégressif, aux côtés d'approches comme Pi-0, GR00T N2 ou Helix, et se positionne explicitement face aux modèles multimodaux propriétaires des grands laboratoires. Il s'agit d'une publication de recherche arXiv, pas d'un produit livré ni d'un déploiement commercial : aucune entreprise, plateforme robotique ni calendrier de disponibilité n'est précisé. La suite logique serait une évaluation quantitative des capacités d'action sur robot réel, afin de vérifier si les démonstrations qualitatives se traduisent en performances reproductibles hors laboratoire.

IA physiqueOpinion
1 source
Skild AI utilise l'IA physique de NVIDIA pour apprendre de nouvelles tâches aux robots à partir d'une seule vidéo
4NVIDIA Blog Robotics 

Skild AI utilise l'IA physique de NVIDIA pour apprendre de nouvelles tâches aux robots à partir d'une seule vidéo

Skild AI a lancé la semaine dernière S1, un modèle de fondation robotique capable d'apprendre une tâche inédite à partir d'une seule vidéo de démonstration, sans réentraînement ni mise à jour de ses poids, une méthode dite d'apprentissage "en contexte". Entraîné sur l'infrastructure NVIDIA (simulation Isaac Lab, modèles de monde Cosmos), S1 interprète l'intention, les objets et la séquence montrés, puis les transpose en actions pour le robot présent, même hors de ses données d'entraînement. Il exécute des tâches de jusqu'à dix minutes, rempotage de plantes, préparation de pancakes, café filtre, assemblage de kits, en enchaînant des dizaines d'étapes de manipulation. Lors d'un test de rempotage, onze minutes ont suffi entre l'enregistrement de la démonstration et l'exécution autonome sur le robot. Skild annonce 66% de réussite par étape sur des tâches multi-étapes nouvelles, contre 9% pour un système comparable non identifié, soit un facteur sept, et estime qu'une seule vidéo équivaut à environ 380 exemples d'entraînement manuels, soit 50 à 100 heures de collecte. Cofondée par Deepak Pathak, la startup revendique un taux de revenu annualisé de 100 millions de dollars dix mois après son premier déploiement commercial, avec plus de 60 partenariats en logistique, inspection, sécurité, restauration et industrie manufacturière. L'enjeu pour l'industrie est de sortir de la reprogrammation systématique: chaque changement de produit, de process ou de disposition de ligne impose d'ordinaire une nouvelle collecte de données et un nouvel entraînement, un frein connu à l'adoption des robots sur des sites qui évoluent en permanence. Si ces résultats se confirment hors des tests internes de Skild, cela rapprocherait les modèles vision-langage-action d'un usage industriel réel plutôt que d'une démonstration de laboratoire, avec un argument concret face à des modèles concurrents comme Pi-0 de Physical Intelligence, GR00T N2 ou Helix. Les chiffres avancés (66% contre 9%, équivalence à 380 exemples) restent toutefois des mesures internes, sans protocole indépendant ni identification du système comparé, à lire comme une tendance plutôt qu'une preuve définitive. Le déploiement le plus tangible reste celui mené avec Foxconn: Skild et NVIDIA font tourner le "Skild Brain" sur des bras manipulateurs bimanuels pour l'assemblage de précision de systèmes NVIDIA Blackwell, un robot posant une busbar et un bloc de fin de course puis vissant 16 vis tout en s'adaptant aux aléas. S1 s'inscrit dans une collaboration plus large entre Skild et NVIDIA, couvrant génération de données synthétiques, entraînement, simulation et déploiement en conditions réelles, illustrant la stratégie de NVIDIA consistant à fournir l'infrastructure de toute la chaîne robotique plutôt qu'à concurrencer directement les fabricants de robots. Skild revendique plus de 60 partenariats noués en dix mois, signe d'une commercialisation rapide dans un secteur où beaucoup d'acteurs en sont encore au stade du pilote. Ni le calendrier d'extension du déploiement chez Foxconn ni l'ouverture de S1 à d'autres intégrateurs ne sont précisés, et les vidéos diffusées sur le blog de NVIDIA relèvent de la démonstration commerciale plutôt que d'un rapport technique indépendant, dans une tendance de fond où les modèles de fondation robotiques, entraînés sur des données vidéo et simulées à grande échelle, cherchent à remplacer la programmation tâche par tâche qui limite depuis des décennies la flexibilité des robots industriels.

IA physiqueActu
1 source