Aller au contenu principal
Pourquoi l'IA physique 2.0 a besoin d'un retour à la réalité
IA physiqueRobotics Business Review 

Pourquoi l'IA physique 2.0 a besoin d'un retour à la réalité

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

L'intelligence artificielle physique amorce une transition conceptuelle que le secteur commence à nommer "Physical AI 2.0". La première génération, aujourd'hui dominante, repose sur une logique de volume : des milliards de séquences vidéo et textuelles, complétées par des simulateurs hyperréalistes comme la plateforme Cosmos de NVIDIA, permettent d'entraîner des systèmes robotiques avant tout déploiement réel. Ce paradigme, qualifié de "vision-first", postule qu'avec suffisamment de caméras et de puissance de calcul, un robot peut modéliser et anticiper son environnement. Mais cette hypothèse se révèle fragile dès que les capteurs sont éblouis, que des objets sont occultés ou que les données sont bruitées et contradictoires. La "Physical AI 2.0" propose d'introduire une couche supplémentaire dans la pile logicielle : la récupération d'état physique (physical state recovery), qui reconstruit l'état réel du monde à partir de données incomplètes ou dégradées, avant même que le raisonnement de haut niveau n'entre en jeu. L'architecture cible comprend quatre briques en boucle fermée : des modèles du monde nourris par la simulation et l'expérience passée ; la récupération d'état physique ; un module de raisonnement qui sélectionne une intention ; et l'action, exécutée dans des contraintes de sécurité strictes. Le raisonnement n'actionne pas directement les effecteurs : il propose une intention, que la logique de planification et de sécurité traduit ensuite en mouvement borné.

L'enjeu industriel est concret. Un robot qui mal-estime l'état de son environnement ne peut pas raisonner correctement, même si son modèle sous-jacent est de haute qualité : une mauvaise observation produit une erreur de raisonnement confiante, pas simplement une incertitude. La distinction clé est entre "cas difficile" et "cas mal observé". Un benchmark peut identifier qu'un système échoue dans des scénarios d'occlusion ou de comportements atypiques d'usagers de la route, sans pour autant corriger l'observation elle-même. Traiter la récupération d'état comme un module dédié, potentiellement alimenté par des capteurs spécialisés comme le radar ou des capteurs tactiles, évite à chaque nouveau robot de réapprendre les lois élémentaires de la physique depuis zéro. Pour les intégrateurs et décideurs B2B, la conséquence pratique est que l'unité de compétition dans l'IA physique n'est plus le modèle seul, mais l'ensemble de la chaîne : captation, simulation, entraînement de politique, orchestration, sécurité embarquée et boucle de retour terrain.

Ce cadrage s'inscrit dans un débat plus large sur les limites des approches end-to-end dans la robotique et l'autonome. NVIDIA a investi massivement dans Cosmos pour normaliser la simulation physique, et plusieurs laboratoires explorent des architectures de type VLA (Vision-Language-Action) qui intègrent partiellement ces problématiques. L'argument central du texte est qu'agrandir indéfiniment des modèles bout-en-bout n'est pas la seule voie : une couche dédiée à la récupération d'état physique serait à la fois plus efficiente et plus robuste. À noter que ce texte est publié en amont de la conférence RoboBusiness 2026 et constitue essentiellement un cadrage conceptuel d'un positionnement produit, sans annonce ni déploiement commercial à la clé. Aucune métrique de performance concrète n'est avancée pour étayer la thèse, ce qui limite l'évaluation indépendante des affirmations.

Dans nos dossiers

À lire aussi

Riemann-1.0 : un modèle d'action du monde incarné pour l'IA physique
1arXiv cs.RO 

Riemann-1.0 : un modèle d'action du monde incarné pour l'IA physique

Un preprint publie sur arXiv (2608.27033) présente Riemann-1.0, un "World Action Model" causal et autoregressif qui unifie, dans une seule séquence, observations visuelles multi-vues, états du robot et actions spécifiques a chaque embodiment. Le modèle est pré-entraine sur plus de 200 000 heures de données hétérogènes: vidéos humaines a la première personne, démonstrations avec pinces portables et trajectoires de robots varies. Il atteint 94,3% de réussite sur RoboTwin2.0, 99,0% sur LIBERO et 62,6% sur le benchmark compositionnel long-horizon RoboCasa-365, soit 8,4 points de plus que la meilleure méthode antérieure. Sur des taches réelles de manipulation longue durée, il obtient 85,0% de réussite (SR) et 94,4% de progression (PSR), soit 15 points de plus que le meilleur système open source de référence. Le résultat notable n'est pas seulement le score, mais l'architecture: un seul modèle fait a la fois office de politique de contrôle exécutable et de simulateur du monde conditionne par l'action, la ou la plupart des approches séparent prédiction vidéo et génération d'actions. Cela alimente le débat sur le passage a l'échelle des modèles vision-langage-action, en suggérant que des sources bon marche comme la vidéo humaine peuvent compléter des données robotiques rares pour améliorer la généralisation. Pour les intégrateurs, la prudence reste de mise: ces résultats proviennent d'un preprint non relu par les pairs, obtenus sur des benchmarks contrôles et des taches réelles décrites de façon générique, sans précision sur le site de test ni sur un déploiement en production. Riemann-1.0 se positionne contre trois familles de "world models" robotiques existantes, génération conjointe d'actions et d'images, prédiction vidéo suivie d'une politique séparée, ou architectures découplées, jugées limitantes par ses auteurs face a la fragmentation entre simulation du monde et contrôle du robot. L'article ne mentionne ni organisation commerciale a l'origine du projet, ni plateforme robotique associée, ni date de pilote ou de déploiement: il se presente comme un jalon de recherche plutôt que comme un produit livre. Les suites logiques, non confirmées dans le texte, porteraient sur l'extension a davantage d'embodiments et sur des essais en conditions réelles hors laboratoire, dans la lignée des travaux parallèles menés par d'autres laboratoires sur les modèles fondation pour la manipulation robotique.

IA physiqueActu
1 source
Vention lance un laboratoire d'IA physique pour l'industrie manufacturière à Montréal
2Robotics Business Review 

Vention lance un laboratoire d'IA physique pour l'industrie manufacturière à Montréal

Vention Inc., société montréalaise spécialisée dans l'automatisation industrielle, a annoncé l'ouverture de son Physical AI Lab, un laboratoire dédié à la manipulation robotique en environnement manufacturier. Selon Etienne Lacroix, fondateur et PDG de l'entreprise, Vention déploie chaque année plusieurs centaines de cellules robotiques qui collectent en continu des données de manipulation industrielle, un gisement selon lui resté sous-exploité jusqu'ici. La plateforme de Vention revendique plus de 28 000 machines installées dans le monde, une communauté de plus de 6 000 usines clientes, et une présence chez 90 entreprises du classement Fortune 500. Le laboratoire est dirigé par Jimmy Li, chercheur en robotique et apprentissage automatique formé à l'Université McGill, qui pilote depuis deux ans la stratégie physical AI de Vention ainsi que sa collaboration avec NVIDIA. Ses travaux couvrent la collecte de données industrielles, le contrôle robotique, la planification de trajectoires, la vision par ordinateur classique et par modèles de fondation, l'apprentissage par démonstration et l'apprentissage par renforcement, avec un focus sur les tâches manufacturières complexes et non structurées. Vention affirme que son chiffre d'affaires lié à la physical AI a progressé de 400% sur l'année écoulée, un chiffre communiqué par l'entreprise sans base de comparaison précisée. L'initiative traduit un déplacement du centre de gravité dans l'IA physique : la démonstration en laboratoire d'un robot capable d'exécuter une tâche n'est plus l'enjeu principal, la difficulté consiste désormais à rendre ces capacités fiables, rentables et déployables sur des milliers de lignes de production. Plutôt que de développer son propre modèle de fondation, Vention se positionne comme fournisseur de données et d'infrastructure de post-entraînement pour des modèles tiers, citant explicitement Skild, Generalist et Physical Intelligence comme acteurs du secteur. Pour les intégrateurs et les décideurs industriels, ce positionnement illustre une tendance de fond : la valeur se déplace du modèle générique vers la donnée industrielle réelle et vers la capacité à valider ces modèles dans des conditions de production, avec leurs contraintes de variabilité et de coût, plutôt que dans des environnements contrôlés de recherche. Vention a construit sa croissance sur une plateforme d'automatisation clé en main, permettant à des fabricants de concevoir, programmer et déployer des cellules robotiques en quelques jours plutôt qu'en plusieurs mois. Le nouveau laboratoire s'appuie sur cette base installée pour boucler un cycle que l'entreprise présente comme sa différenciation : les problèmes de production remontent directement à la recherche, et les résultats de recherche redescendent vers les usines clientes, qui participent aux essais avant même la finalisation des produits. Cette annonce intervient alors que la physical AI doit figurer parmi les thématiques de la conférence RoboBusiness 2026, prévue les 20 et 21 octobre à Santa Clara, en Californie. Aucun calendrier de déploiement pilote ni détail chiffré supplémentaire sur les résultats concrets du laboratoire n'a été communiqué à ce stade.

IA physiqueActu
1 source
Pourquoi l'alimentation est le défi le plus difficile de l'IA physique, selon RoboBusiness
3Robotics Business Review 

Pourquoi l'alimentation est le défi le plus difficile de l'IA physique, selon RoboBusiness

Chef Robotics, entreprise de robotique alimentaire basée à San Francisco, annonce que son fondateur et CEO Rajat Bhageria interviendra à RoboBusiness 2026, qui se tiendra les 20 et 21 octobre à Santa Clara, en Californie. Sa conférence, intitulée "Why Food is Physical AI's Hardest Problem and Most Promising Catalyst", portera sur l'automatisation de la préparation alimentaire à grande échelle. L'entreprise affirme avoir réalisé plus de 118 millions de portions en conditions de production réparties sur plus d'une douzaine d'usines agroalimentaires en Amérique du Nord et en Europe. Ces données constitueraient, selon Chef Robotics, le plus grand jeu de données réel de manipulation de matériaux déformables jamais constitué, et alimentent son modèle propriétaire, le Food Foundation Model (FFM), censé permettre à ses robots de généraliser à de nouveaux ingrédients avec un minimum de réentraînement. La session doit détailler les défis de fusion de capteurs pour saisir des objets mous et imprévisibles, ainsi que le contrôle de force nécessaire pour distinguer matériaux fragiles et denses. L'argument de fond dépasse la seule restauration collective. La plupart des modèles fondation en robotique physique sont aujourd'hui entraînés sur des objets rigides, plus faciles à modéliser et à simuler; la nourriture, déformable, variable en poids, en texture et en sensibilité thermique, constitue un test autrement plus exigeant. Si les techniques développées par Chef Robotics (préhension adaptative, retour tactile, entraînement sur distributions à forte variance) se transfèrent effectivement aux dispositifs médicaux, à l'emballage souple ou à l'agriculture, cela renforcerait l'idée que la donnée réelle à l'échelle, plutôt que la simulation ou les démonstrations en laboratoire, reste le facteur limitant des systèmes physiques déployables. Ces chiffres proviennent toutefois exclusivement de l'entreprise, sans audit indépendant, et le terme de "plus grand jeu de données" reste invérifiable de l'extérieur; il s'agit d'une présentation de conférence destinée à valoriser une thèse commerciale, pas d'une publication scientifique évaluée par des pairs. Chef Robotics n'est pas un nouvel entrant: avant de fonder l'entreprise, Bhageria avait dirigé Prototype Capital, un fonds de capital-risque en amorçage investissant dans des fondateurs appliquant des technologies nouvelles à des secteurs anciens, après avoir créé ThirdEye, une technologie d'assistance pour malvoyants, finalement rachetée. Il est titulaire d'un master en robotique et apprentissage automatique et d'une licence d'économie de l'université de Pennsylvanie. La démonstration s'inscrit dans une course plus large de l'IA physique où la plupart des acteurs valorisent la polyvalence de modèles vision-langage-action génériques; Chef Robotics défend au contraire une spécialisation verticale sur un problème de manipulation jugé particulièrement dur. Aucune nouvelle étape produit n'est annoncée au-delà de cette intervention: il s'agit d'une session de conférence, pas d'un lancement, dans le cadre de RoboBusiness 2026, événement organisé par The Robot Report à destination des développeurs de robotique commerciale.

UEChef Robotics affirme déjà opérer des robots dans plusieurs usines agroalimentaires en Europe, mais sans qu'aucune entreprise, pays ou régulation européenne ne soit nommé précisément.

IA physiqueActu
1 source
Shanghai AI Lab lance Intern W0, un modèle du monde physique pour la robotique à retour de force et tactile
4Pandaily 

Shanghai AI Lab lance Intern W0, un modèle du monde physique pour la robotique à retour de force et tactile

Le Shanghai Artificial Intelligence Laboratory a présenté W0, un modèle de fondation robotique baptisé Intern physical world model, conçu pour combiner vision, force et toucher dans des tâches physiques à contact riche, avec perception, prédiction, action et correction s'exécutant en parallèle plutôt qu'en chaîne rigide. Deux piliers le définissent : une perception force-tactile native, où la vision fixe cibles et trajectoires d'approche, le retour de contact ajuste qualité de préhension et détection de glissement, et l'état corporel suit pose et mouvement ; et une architecture « duplex » asynchrone à fréquences multiples, planification longue en arrière-plan et commandes moteur à haute fréquence, pour raccourcir le délai entre un changement d'environnement et la correction du geste. W0 diffère du projet NCP-ArchPreview, mené avec le LUMIA Lab de l'université Jiao Tong de Shanghai sur la prédiction du concept suivant en espace latent. Connecté à la plateforme Intern InkStone et au modèle scientifique Intern S2, W0 a fait tourner des boucles fermées en laboratoire humide et sec : évolution dirigée de protéines d'édition génique, synthèse organique de mépivacaïne, préparation de nanoparticules lipidiques avec ajustements dynamiques de paramètres en cours de run. Pour les intégrateurs et décideurs de la robotique industrielle, ce choix diffère du pari humanoïde grand public : plutôt que la démonstration spectaculaire, le laboratoire vise l'automatisation d'expériences scientifiques, où la fiabilité du contact (préhension, glissement, micro-ajustement) prime sur la marche ou la manipulation domestique. Si le couplage force-tactile-vision en duplex tient au-delà des cas montrés, il fournirait un argument concret dans le débat sur le passage à l'échelle des modèles vision-langage-action au-delà de vidéos de démonstration triées, un reproche récurrent fait au secteur. Les résultats de laboratoire humide cités restent toutefois issus en partie de couverture secondaire relayée par le laboratoire lui-même comme preuve précoce, non d'une validation indépendante ni d'un déploiement à grande échelle : une preuve de faisabilité sur un nombre limité de protocoles, pas un produit fini. W0 s'inscrit dans l'effort plus large du Shanghai AI Lab pour bâtir une pile de modèles d'IA physique, distincte de sa branche NCP-ArchPreview menée avec l'université Jiao Tong de Shanghai. Contrairement aux humanoïdes commerciaux orientés logistique ou assemblage industriel, le laboratoire cible en priorité les instruments de paillasse et les protocoles de chimie, biologie et science des matériaux, présentés comme une brique sous les flux Intern InkStone plutôt que comme un robot grand public. La suite dépendra de la capacité du contrôle force-tactile duplex à généraliser au-delà des trois cas démontrés, protéines d'édition génique, synthèse de mépivacaïne, nanoparticules lipidiques ; le laboratoire présente ces résultats comme l'ouverture d'un chemin allant de la déduction de schémas à l'expérience instrumentée, sans calendrier de déploiement ni partenaires pilotes annoncés à ce stade.

IA physiqueOpinion
1 source