Aller au contenu principal
General Intuition lève 320 millions de dollars pour entraîner des robots avec des données de jeux vidéo
IA physiqueRobotics Business Review 

General Intuition lève 320 millions de dollars pour entraîner des robots avec des données de jeux vidéo

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

General Intuition US Inc. a annoncé cette semaine une levée de fonds de 320 millions de dollars en Série A, portant sa valorisation à 2,3 milliards de dollars et son financement total à 454 millions, après un premier tour de 134 millions en octobre 2025. Le round est mené par General Catalyst et inclut Jeff Bezos, fondateur d'Amazon, et Eric Schmidt, ex-PDG de Google. L'entreprise new-yorkaise, fondée en 2015 par Pim de Witte, développe deux familles de modèles : des action models, qui décident quelle action entreprendre, et des world models, qui prédisent les conséquences de ces actions dans des environnements virtuels ou physiques. La particularité de son approche est la source des données d'entraînement : non pas des vidéos de manipulation robotique ou des simulations synthétiques, mais des milliards de clips de gameplay issus de Medal, une plateforme de partage de moments gaming que de Witte a également cofondée. Ces vidéos sont accompagnées de labels d'action embarqués, qui enregistrent précisément quelle touche le joueur appuie et à quel instant, offrant une supervision dense sur la relation perception-décision-action.

L'intérêt de cette approche pour l'IA physique tient à une hypothèse centrale : les modèles entraînés sur du texte décrivent la réalité, ils ne la modélisent pas. Le jeu vidéo, lui, capture un humain qui perçoit un environnement tridimensionnel, anticipe des dynamiques et agit en conséquence, dans des milliers de configurations différentes. Si l'hypothèse tient à l'échelle, cela représenterait un raccourci significatif pour le sim-to-real gap qui plombe la généralisation des politiques robotiques : plutôt que de collecter des téléopérations coûteuses ou de concevoir des environnements simulés ad hoc, General Intuition récupère de la diversité environnementale pour presque rien. La question non résolue reste la transférabilité effective de ces représentations vers des corps physiques avec des dynamiques mécaniques réelles, un point que la société n'a pas encore documenté publiquement avec des benchmarks tiers.

General Intuition évolue dans un espace de plus en plus encombré. Des acteurs comme DeepMind avec RT-2 et ses successeurs, Physical Intelligence (pi) avec Pi-0, ou encore Covariant avec RFM-1 misent également sur des fondations visuelles générales pour l'apprentissage de politiques robotiques. La différence revendiquée est l'échelle et la labellisation des données gaming, un corpus que la concurrence ne possède pas. L'entreprise prévoit de rendre son API accessible publiquement à l'été 2026 et d'utiliser le financement pour augmenter sa capacité de calcul et entraîner la prochaine version de son modèle de préentraînement. Aucune annonce de partenariat industriel ou de déploiement sur plateforme robotique physique n'a été communiquée à ce stade : il s'agit d'une phase de précommercialisation axée infrastructure et modèle.

À lire aussi

Ropedia lève 22 millions de dollars pour développer la collecte de données servant à l'entraînement des robots
1Robotics Business Review 

Ropedia lève 22 millions de dollars pour développer la collecte de données servant à l'entraînement des robots

Ropedia, jeune pousse basée à Singapour et Mountain View (Californie) et fondée en 2025, a levé 22 millions de dollars en pre-Série A, portant son financement total à 30 millions avec son tour de seed. L'argent doit servir à industrialiser HOMIE, un dispositif porté sur la tête équipé de quatre caméras offrant une vision à 360 degrés, d'un capteur audio capable de reconstruire la source et la direction des sons, et d'une unité de mouvement qui suit les déplacements du porteur ; la batterie est interchangeable. Ce casque capture le mouvement humain à la première personne, l'interaction avec les objets et le contexte spatial, données ensuite traitées et annotées par les modèles internes de Ropedia. Selon Zhaoxi Chen, cofondateur et PDG, les fonds financeront le recrutement dans le hardware, le software, l'infrastructure de données et le développement de modèles, ainsi que l'expansion commerciale vers l'Amérique du Nord, où se trouve déjà la majorité des clients de l'entreprise. Ropedia prévoit aussi d'étoffer sa plateforme avec des outils d'annotation, de l'analyse qualité et une infrastructure de conformité. Ce tour de table illustre un pari plus large sur l'IA physique : plutôt que de dépendre de la téléopération de robots réels, limitée à des morphologies spécifiques et coûteuse en matériel, Ropedia mise sur des données égocentriques humaines pour entraîner des modèles capables de généraliser des compétences physiques. L'entreprise revendique une réduction des coûts de collecte de données allant jusqu'à 50 fois par rapport aux méthodes traditionnelles, un chiffre à prendre avec prudence puisqu'il n'est pas détaillé ni vérifié indépendamment. L'argument central de Chen, qui consiste à dire que l'intelligence robotique de niveau humain passe par l'imitation de l'apprentissage humain en vision première personne, rejoint une thèse de plus en plus répandue dans le secteur des modèles vision-langage-action (VLA), où la rareté des données d'entraînement reste un goulot d'étranglement majeur pour les acteurs comme Figure, Physical Intelligence ou NVIDIA. Ropedia se distingue des prestataires classiques d'annotation, qui travaillent sur des données déjà possédées par leurs clients, en générant et structurant lui-même ses données de bout en bout, de la capture jusqu'au fine-tuning aligné sur les modèles. Le hardware de HOMIE est en grande partie développé en interne, à l'exception des composants de base comme les capteurs CMOS, ce qui inclut la carte électronique et la synchronisation des différents capteurs. Pour l'instant, la collecte se limite à des environnements informels, l'entreprise affirmant vouloir élargir progressivement l'éventail de tâches capturées. Aucun partenaire industriel ni volume de données précis n'a été communiqué à ce stade.

IA physiqueActu
1 source
Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes
2The Robot Report 

Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes

Generalist AI Inc. a annoncé une levée de fonds de 400 millions de dollars, portant son financement total à plus de 500 millions depuis sa création en 2024. Le tour a été mené par Radical Ventures, avec de nouveaux entrants incluant 8VC, Union Square Ventures, Hanabi Capital et Norwest, auxquels s'ajoutent les investisseurs historiques NVentures (NVIDIA), Boldstart Ventures, Spark Capital et Bezos Expeditions. Parmi les investisseurs individuels figurent Fei-Fei Li, Eric Yuan (PDG de Zoom), Bin Lin et Naval Ravikant. Basée à San Mateo, en Californie, la startup développe des modèles fondamentaux destinés à des robots généralistes, capables d'opérer sur différentes architectures matérielles. En novembre 2025, elle avait lancé GEN-0, présenté comme le premier modèle à appliquer les lois de mise à l'échelle (scaling laws) à la robotique physique. En avril 2026, elle a publié GEN-1, avec des métriques communiquées par la société elle-même: taux de succès moyen de 99 % sur des tâches où les modèles précédents atteignaient 64 %, vitesse d'exécution environ trois fois supérieure sur des manipulations dextères, et seulement une heure de données robotiques nécessaires par compétence apprise. Ces chiffres, s'ils se confirment en conditions industrielles réelles, représenteraient un changement structurel pour la commercialisation de la robotique généraliste. Le principal verrou du secteur reste logiciel: la plupart des intégrateurs investissent encore des semaines de collecte de données pour chaque nouvelle tâche. Un modèle nécessitant une heure de données par compétence transformerait radicalement l'économie du déploiement. Cela dit, les métriques publiées proviennent exclusivement des communications internes de Generalist AI, sans validation indépendante ni précision sur les conditions de benchmark ou la nature des tâches testées. Le concept de "data flywheel", selon lequel les déploiements chez des clients industriels génèrent les données qui alimentent le modèle suivant, est éprouvé dans le logiciel; sa transposition à la robotique physique, avec ses contraintes de sécurité et de variabilité du monde réel, reste à démontrer à l'échelle. Generalist AI a été fondée en 2024 par Pete Florence (CEO), Andy Zeng (Chief Scientist) et Andrew Barry (CTO), trois chercheurs issus des milieux académiques et industriels de la robotique. La startup s'inscrit dans un marché en forte compétition: Physical Intelligence avec son modèle Pi-0, Figure AI avec le Figure 03, Boston Dynamics, Apptronik et 1X Technologies ciblent tous le même segment des modèles d'IA généralistes pour robots physiques. En Europe, Enchanted Tools et Wandercraft progressent sur des verticales plus ciblées. Avec cette levée, Generalist AI prévoit d'accélérer le développement de modèles de nouvelle génération, d'étendre son infrastructure d'entraînement et de renforcer son moteur de collecte de données physiques. La prochaine étape observable sera la documentation de déploiements industriels concrets chez des clients identifiés, seul critère qui permettra de distinguer les performances en laboratoire de la viabilité commerciale annoncée.

UELa montée en puissance de Generalist AI accentue la pression concurrentielle sur les acteurs européens comme Enchanted Tools et Wandercraft, dont les verticales ciblées et les capacités de financement ne sont pas comparables aux 500 M$ levés par cette startup américaine en moins de deux ans.

💬 500 millions en deux ans, c'est du sérieux. Ce qui m'intéresse vraiment, c'est pas le chèque, c'est cette histoire d'une heure de données par compétence apprise (contre des semaines pour les intégrateurs actuels). Si ça tient en conditions industrielles, tu changes complètement l'économie du déploiement robotique, mais tous les chiffres sortent de chez eux sans validation externe, donc faut voir les premiers clients réels avant de s'emballer.

IA physiqueOpinion
1 source
USIM et U0 : un jeu de données et un modèle vision-langage-action pour robots sous-marins polyvalents
3arXiv cs.RO 

USIM et U0 : un jeu de données et un modèle vision-langage-action pour robots sous-marins polyvalents

Une équipe de chercheurs a publié USIM et U0, un dataset de simulation et un modèle vision-langage-action (VLA) conçus pour doter les robots sous-marins d'une intelligence généraliste multi-tâches. Le dataset USIM regroupe plus de 905 000 images issues de 2 275 trajectoires simulées, soit environ 25 heures d'interactions enregistrées sur le robot BlueROV2, un ROV à six degrés de liberté largement utilisé en recherche. Le modèle U0, entraîné sur ces données, est capable d'exécuter des tâches allant de la navigation par évitement d'obstacles à la manipulation mobile en trois dimensions, le tout piloté par des instructions en langage naturel. En évaluation, U0 atteint un taux de succès global de 43,1 % sur des tâches en ligne, soit une amélioration de 5,5 points de pourcentage par rapport aux meilleures baselines existantes (plafonnées à 37,6 %), avec des performances particulièrement élevées en navigation pure, où le taux monte à 87,5 %. L'erreur moyenne de prédiction d'action hors ligne est réduite à 0,0359. Ces résultats ont une portée directe pour les intégrateurs et opérateurs de systèmes sous-marins autonomes : ils démontrent qu'un modèle généraliste entraîné sur données synthétiques peut effectivement franchir le sim-to-real gap dans un environnement aussi contraignant que le milieu aquatique, où la visibilité est réduite, les courants perturbent la stabilité et les repères visuels sont ambigus. Pour le secteur, c'est une validation de l'approche VLA à l'échelle sous-marine, un domaine où la quasi-totalité des travaux antérieurs s'était cantonnée à des méthodes spécialisées tâche par tâche. L'intégration d'un module de perception convolution-attention (CAP) avec estimation de pose cible comme tâche auxiliaire renforce explicitement la conscience spatiale du modèle, ce qui est critique pour la manipulation en 3D dans des scènes non structurées. Jusqu'ici, la robotique sous-marine autonome reposait majoritairement sur des systèmes de contrôle classiques ou des réseaux de neurones entraînés sur des jeux de données tâche-spécifiques, souvent collectés en conditions réelles à coût élevé. L'approche USIM mise sur la synthèse de données simulées à grande échelle pour contourner ce goulot d'étranglement, une stratégie déjà validée en robotique terrestre par des frameworks comme IsaacGym ou Genesis. Du côté des concurrents directs, les travaux sur les robots sous-marins généralistes restent rares : les projets OpenDive ou les plateformes de Woods Hole Oceanographic Institution n'ont pas encore publié d'équivalent VLA. Aucun acteur européen n'est cité dans cet article, bien que des entreprises comme ECA Group (France) ou Saab Seaeye (Suède) opèrent sur le marché ROV industriel. Le papier, disponible sur arXiv (2510.07869v4), pose un cadre d'évaluation standardisé incluant métriques hors ligne et exécution en ligne, ce qui facilitera les comparaisons futures. Les prochaines étapes annoncées concernent le transfert vers des plateformes physiques et l'extension du dataset à des scénarios plus complexes.

UEImpact indirect potentiel pour des acteurs européens du ROV industriel comme ECA Group (France) ou Saab Seaeye (Suède), mais aucun partenariat ni déploiement européen n'est annoncé dans ce travail de recherche.

💬 43 % de succès global, bon, c'est le début. Mais 87 % en navigation pure et zéro données réelles collectées en mer, c'est la preuve que la stratégie simulation-à-grande-échelle fonctionne sous l'eau exactement comme en terrestre : plus besoin d'envoyer un ROV filmer des épaves pendant des mois pour constituer un dataset. ECA Group a un truc sérieux à surveiller.

IA physiqueOpinion
1 source
Robots humanoïdes entraînés sur 1 million d'heures de vidéos humaines : jusqu'à 90 % de réussite
4Interesting Engineering 

Robots humanoïdes entraînés sur 1 million d'heures de vidéos humaines : jusqu'à 90 % de réussite

Dyna Robotics, entreprise basée à Redwood City en Californie, a dévoilé DYNA-2, un nouveau modèle de fondation robotique de type « world-action » entraîné sur plus d'un million d'heures de vidéos humaines filmées à la première personne, soit l'équivalent d'environ 170 ans d'expérience continue à l'éveil. Contrairement à l'approche classique reposant sur des données de téléopération collectées manuellement, ce modèle n'a vu aucune donnée robotique pendant sa phase de pré-entraînement. Selon l'entreprise, la seule augmentation de l'échelle de pré-entraînement a permis de faire passer le taux de réussite sur des tâches de fabrication de haute précision de 20 % à 80-90 %. Le modèle s'est aussi montré transférable à des bras robotiques fixes, des prototypes humanoïdes et des mains robotiques dextres : dans un test, 13 minutes de données locales ont suffi pour qu'une paire de mains à cinq doigts apprenne à dévisser le bouchon d'une bouteille. Sur 15 tâches de référence internes, les versions entraînées avec davantage de vidéo humaine ont systématiquement mieux performé, et comparé à DYNA-1, le précédent modèle vision-langage-action de la société, DYNA-2 a atteint 87 % de réussite lors d'un déploiement client sans réglage préalable, contre 46 % pour son prédécesseur. Cette annonce s'attaque frontalement au principal goulot d'étranglement de la robotique généraliste, à savoir la rareté des données d'action collectées par téléopération, jugées non scalables pour viser une intelligence physique générale. En misant sur la vidéo humaine, disponible en quantités quasi illimitées, Dyna affirme qu'un robot peut acquérir une forme d'intuition physique sans dépendre d'un volume massif de données spécifiques à chaque plateforme matérielle, une adaptation à un nouveau robot ou une nouvelle tâche ne nécessitant alors que quelques heures de fine-tuning local. Ces chiffres restent toutefois issus de bancs d'essai internes à l'entreprise, sans validation indépendante ni comparaison publique standardisée avec d'autres modèles généralistes comme Pi-0 ou GR00T N2, ce qui invite à les considérer avec prudence tant qu'un tiers ne les a pas reproduits. Si l'approche se confirme à plus grande échelle, elle déplacerait néanmoins une partie de la course humanoïde du terrain de la collecte téléopérée vers celui du pré-entraînement vidéo massif. Dyna Robotics a été fondée par Lindon Gao, York Yang et Jason Ma, ancien chercheur chez DeepMind, avec le soutien d'investisseurs dont CRV et First Round. L'entreprise exploite déjà commercialement des robots propulsés par DYNA-1 dans des hôtels, des restaurants et des laveries automatiques, ce qui distingue cette annonce d'un simple teaser de laboratoire puisque DYNA-2 vise à succéder à un système déjà en production. Jason Ma justifie cette orientation en rappelant que les données d'action robotique restent rares alors que la vidéo est omniprésente. L'entreprise met aussi en avant une meilleure résilience aux perturbations physiques lors de tâches comme la découpe d'aliments ou le rangement d'un espace de travail, DYNA-2 récupérant seul là où DYNA-1 nécessitait une intervention humaine, avec un gain de 133 % sur les tâches de suivi d'instructions grâce au co-entraînement vidéo. Aucun calendrier de déploiement élargi ni de nouveaux sites pilotes n'a pour l'instant été communiqué.

IA physiqueActu
1 source