Aller au contenu principal
HarnessPAI : un harnais évolutif pour l'IA physique
IA physiquearXiv cs.RO 

HarnessPAI : un harnais évolutif pour l'IA physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe liée au projet Darwin Agent a publié le 25 septembre 2026 sur arXiv (2609.29166) HarnessPAI, un framework agnostique au modèle et à la morphologie qui pilote les modèles d'action physique via du code exécutable. Le système sépare deux échelles : pendant un rollout, un programme fixe vérifie l'exécution en boucle ouverte ; entre les rollouts, il évolue en boucle fermée et transforme les échecs en compétences réutilisables grâce au retour d'exécution. Testé sur des bras de bureau, des robots domestiques, un aspirateur robot et un agent marcheur à pattes, HarnessPAI améliore les modèles d'action purs et les baselines "code-as-policy" sans réentraînement : +61,6 points sur Pi-0.5 sur LIBERO-PRO, +27,2 points sur WorldDreamer sur les tâches atomiques de RoboCasa. Une fois le programme convergé, aucune délibération LLM en ligne n'est nécessaire ; il sert aussi de collecteur de données expertes bon marché, et réentraîner Pi-0.5 sur ces données relève son taux de réussite de 38,8 points sur LIBERO-PRO.

Ces résultats contredisent l'hypothèse dominante selon laquelle la performance en robotique physique dépend avant tout de modèles d'action plus puissants : l'entraînement standard de ces modèles peut au contraire éroder les capacités de perception et de raisonnement nécessaires à un comportement robuste, rendant même des modèles forts vulnérables aux perturbations de scène et aux tâches longues. Pour les intégrateurs et chercheurs, cela suggère qu'un harnais exécutable et piloté par le retour d'expérience peut être aussi déterminant que le modèle lui-même, et qu'il offre une voie moins coûteuse pour collecter des données d'entraînement sans téléopération massive.

HarnessPAI s'inscrit dans les efforts visant à combler l'écart entre démonstrations et déploiement réel des modèles vision-langage-action, dans un paysage dominé par Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI ; l'étude compare directement son approche à Pi-0.5 et à WorldDreamer, la positionnant comme complémentaire plutôt que concurrente. Il s'agit pour l'instant d'une publication de recherche, sans annonce de déploiement industriel ni de partenaire commercial identifié : les auteurs présentent ces résultats comme une preuve de concept sur plusieurs plateformes robotiques, ouvrant la voie à des systèmes intégrant perception, raisonnement et action de manière vérifiable.

À lire aussi

L'échographie ouvre une voie évolutive vers l'intelligence tactile pour l'IA physique
1Robotics Business Review 

L'échographie ouvre une voie évolutive vers l'intelligence tactile pour l'IA physique

UltraSense publie un argumentaire technique lié à RoboBusiness 2026, conférence qui se tiendra les 20 et 21 octobre à Santa Clara, en Californie, pour sa 20e édition, avec le « physical AI » comme l'un des thèmes de session. L'entreprise défend une architecture de détection tactile à ultrasons positionnée sous la surface des doigts et pinces robotiques, plutôt que les « peaux électroniques » actuelles intégrées près du point de contact, à base de capteurs capacitifs, piézorésistifs, piézoélectriques, triboélectriques ou à impédance, montés dans des élastomères ou des films multicouches. Selon UltraSense, ce positionnement en surface expose ces capteurs à l'environnement mécanique le plus sévère du robot : compression, abrasion, contamination, humidité, variations de température et vieillissement des matériaux, ce qui provoque sur des millions de cycles de contact de l'usure, une dérive de calibration, de la délamination et du fluage. La publication ne cite aucun produit commercial chiffré, aucun client ni donnée de déploiement : il s'agit d'un positionnement conceptuel, pas d'une annonce de produit. Pour les fabricants de mains humanoïdes, de pinces dextres et de robots de logistique ou de service, l'argument touche un point sensible : la fiabilité du toucher dans la durée, plutôt que sa performance en démonstration, conditionne la viabilité commerciale à grande échelle. Un capteur qui fonctionne au premier jour en laboratoire n'a pas de valeur industrielle s'il dérive après quelques mois d'usage intensif. Le texte souligne aussi que le secteur ne peut plus se contenter d'un contact binaire ou d'une seule valeur de force, et doit capter force, cisaillement, glissement et nature du matériau, ce qui complique encore la question de la durabilité des capteurs existants. UltraSense ne fournit toutefois aucune donnée de test comparatif ni mesure de durée de vie chiffrée : l'argument reste une prise de position face aux fournisseurs établis de peaux électroniques, sans preuve vérifiable indépendante à l'appui. Cette publication s'inscrit dans une tendance où le physical AI quitte le raisonnement purement numérique pour affronter l'interaction physique réelle : la vision, la navigation et la planification des robots ont déjà beaucoup progressé, mais la manipulation fine reste freinée par la fiabilité du toucher, ce qui ouvre un espace à des spécialistes comme UltraSense face aux fournisseurs établis de capteurs capacitifs, piézorésistifs ou piézoélectriques intégrés en surface. Aucun partenaire, robot ou calendrier de déploiement n'est cité dans le texte, qui sert surtout à préparer le terrain avant RoboBusiness 2026, où UltraSense et d'autres acteurs du secteur devraient détailler leurs approches de la détection tactile dans le cadre du parcours consacré au physical AI. La prochaine étape attendue reste une démonstration concrète de cette architecture sous-surface sur des mains ou pinces réelles soumises à un usage prolongé, seul test capable de confirmer l'avantage de durée de vie annoncé.

IA physiquePaper
1 source
Pourquoi l'IA physique 2.0 a besoin d'un retour à la réalité
2Robotics Business Review 

Pourquoi l'IA physique 2.0 a besoin d'un retour à la réalité

L'intelligence artificielle physique amorce une transition conceptuelle que le secteur commence à nommer "Physical AI 2.0". La première génération, aujourd'hui dominante, repose sur une logique de volume : des milliards de séquences vidéo et textuelles, complétées par des simulateurs hyperréalistes comme la plateforme Cosmos de NVIDIA, permettent d'entraîner des systèmes robotiques avant tout déploiement réel. Ce paradigme, qualifié de "vision-first", postule qu'avec suffisamment de caméras et de puissance de calcul, un robot peut modéliser et anticiper son environnement. Mais cette hypothèse se révèle fragile dès que les capteurs sont éblouis, que des objets sont occultés ou que les données sont bruitées et contradictoires. La "Physical AI 2.0" propose d'introduire une couche supplémentaire dans la pile logicielle : la récupération d'état physique (physical state recovery), qui reconstruit l'état réel du monde à partir de données incomplètes ou dégradées, avant même que le raisonnement de haut niveau n'entre en jeu. L'architecture cible comprend quatre briques en boucle fermée : des modèles du monde nourris par la simulation et l'expérience passée ; la récupération d'état physique ; un module de raisonnement qui sélectionne une intention ; et l'action, exécutée dans des contraintes de sécurité strictes. Le raisonnement n'actionne pas directement les effecteurs : il propose une intention, que la logique de planification et de sécurité traduit ensuite en mouvement borné. L'enjeu industriel est concret. Un robot qui mal-estime l'état de son environnement ne peut pas raisonner correctement, même si son modèle sous-jacent est de haute qualité : une mauvaise observation produit une erreur de raisonnement confiante, pas simplement une incertitude. La distinction clé est entre "cas difficile" et "cas mal observé". Un benchmark peut identifier qu'un système échoue dans des scénarios d'occlusion ou de comportements atypiques d'usagers de la route, sans pour autant corriger l'observation elle-même. Traiter la récupération d'état comme un module dédié, potentiellement alimenté par des capteurs spécialisés comme le radar ou des capteurs tactiles, évite à chaque nouveau robot de réapprendre les lois élémentaires de la physique depuis zéro. Pour les intégrateurs et décideurs B2B, la conséquence pratique est que l'unité de compétition dans l'IA physique n'est plus le modèle seul, mais l'ensemble de la chaîne : captation, simulation, entraînement de politique, orchestration, sécurité embarquée et boucle de retour terrain. Ce cadrage s'inscrit dans un débat plus large sur les limites des approches end-to-end dans la robotique et l'autonome. NVIDIA a investi massivement dans Cosmos pour normaliser la simulation physique, et plusieurs laboratoires explorent des architectures de type VLA (Vision-Language-Action) qui intègrent partiellement ces problématiques. L'argument central du texte est qu'agrandir indéfiniment des modèles bout-en-bout n'est pas la seule voie : une couche dédiée à la récupération d'état physique serait à la fois plus efficiente et plus robuste. À noter que ce texte est publié en amont de la conférence RoboBusiness 2026 et constitue essentiellement un cadrage conceptuel d'un positionnement produit, sans annonce ni déploiement commercial à la clé. Aucune métrique de performance concrète n'est avancée pour étayer la thèse, ce qui limite l'évaluation indépendante des affirmations.

IA physiqueOpinion
1 source
Riemann-1.0 : un modèle d'action du monde incarné pour l'IA physique
3arXiv cs.RO 

Riemann-1.0 : un modèle d'action du monde incarné pour l'IA physique

Un preprint publie sur arXiv (2608.27033) présente Riemann-1.0, un "World Action Model" causal et autoregressif qui unifie, dans une seule séquence, observations visuelles multi-vues, états du robot et actions spécifiques a chaque embodiment. Le modèle est pré-entraine sur plus de 200 000 heures de données hétérogènes: vidéos humaines a la première personne, démonstrations avec pinces portables et trajectoires de robots varies. Il atteint 94,3% de réussite sur RoboTwin2.0, 99,0% sur LIBERO et 62,6% sur le benchmark compositionnel long-horizon RoboCasa-365, soit 8,4 points de plus que la meilleure méthode antérieure. Sur des taches réelles de manipulation longue durée, il obtient 85,0% de réussite (SR) et 94,4% de progression (PSR), soit 15 points de plus que le meilleur système open source de référence. Le résultat notable n'est pas seulement le score, mais l'architecture: un seul modèle fait a la fois office de politique de contrôle exécutable et de simulateur du monde conditionne par l'action, la ou la plupart des approches séparent prédiction vidéo et génération d'actions. Cela alimente le débat sur le passage a l'échelle des modèles vision-langage-action, en suggérant que des sources bon marche comme la vidéo humaine peuvent compléter des données robotiques rares pour améliorer la généralisation. Pour les intégrateurs, la prudence reste de mise: ces résultats proviennent d'un preprint non relu par les pairs, obtenus sur des benchmarks contrôles et des taches réelles décrites de façon générique, sans précision sur le site de test ni sur un déploiement en production. Riemann-1.0 se positionne contre trois familles de "world models" robotiques existantes, génération conjointe d'actions et d'images, prédiction vidéo suivie d'une politique séparée, ou architectures découplées, jugées limitantes par ses auteurs face a la fragmentation entre simulation du monde et contrôle du robot. L'article ne mentionne ni organisation commerciale a l'origine du projet, ni plateforme robotique associée, ni date de pilote ou de déploiement: il se presente comme un jalon de recherche plutôt que comme un produit livre. Les suites logiques, non confirmées dans le texte, porteraient sur l'extension a davantage d'embodiments et sur des essais en conditions réelles hors laboratoire, dans la lignée des travaux parallèles menés par d'autres laboratoires sur les modèles fondation pour la manipulation robotique.

IA physiqueActu
1 source
Cosmos 3 : des modèles du monde omnimodaux pour l'IA physique
4arXiv cs.RO 

Cosmos 3 : des modèles du monde omnimodaux pour l'IA physique

NVIDIA a publié Cosmos 3, une famille de modèles du monde omnimodaux capables de traiter et générer conjointement du texte, des images, de la vidéo, de l'audio et des séquences d'actions au sein d'une architecture unifiée de type mixture-of-transformers. Présenté dans un preprint arXiv (2606.02800) le 3 juin 2026, Cosmos 3 fusionne en un seul framework quatre catégories de modèles jusqu'ici distinctes : modèles vision-langage (VLM), générateurs vidéo, simulateurs de monde et modèles action-monde. Les variantes post-entraînées ont été classées meilleures modèles open-source texte-vers-image et image-vers-vidéo par Artificial Analysis, et meilleur modèle de politique robotique par RoboArena. Code, checkpoints, datasets synthétiques et benchmarks d'évaluation sont publiés sous la licence OpenMDW-1.1 de la Linux Foundation, sur GitHub et HuggingFace. L'intégration de ces modalités dans un backbone scalable unique représente un changement architectural structurant pour l'IA physique. Pour un intégrateur robotique ou un décideur industriel, Cosmos 3 signifie qu'un seul modèle peut simultanément percevoir une scène, simuler des séquences vidéo plausibles, produire des instructions en langage naturel et prédire des séquences d'actions, sans recourir à plusieurs stacks spécialisés. La performance sur RoboArena, benchmark indépendant d'évaluation des politiques de contrôle robot, suggère que l'approche omnimodale ne sacrifie pas la précision des politiques à la généralité, une hypothèse régulièrement contestée dans le secteur. La mise à disposition des benchmarks sous licence ouverte offre en outre la possibilité d'un audit externe des performances, ce que les publications classiques de laboratoire ne permettent pas toujours. Cosmos 3 prolonge la trajectoire de NVIDIA en Physical AI amorcée avec Cosmos 1.x, présenté début 2025 comme plateforme de simulation pour l'entraînement robotique. L'architecture mixture-of-transformers rappelle des choix similaires chez Google DeepMind (Gemini) et Meta (Chameleon), mais avec un focus explicite sur l'embodiment et le contrôle moteur. Les concurrents directs sur le segment world-model pour robots incluent Physical Intelligence avec Pi-0, Google DeepMind avec ses successeurs de RT-2, et Skild AI. L'ouverture complète du code et des poids sous licence permissive est un signal stratégique clair : NVIDIA mise sur l'adoption par l'écosystème pour faire de Cosmos l'infrastructure de référence de l'IA physique, répliquant la dynamique qui a fait de CUDA le standard incontournable du calcul GPU.

UELes laboratoires et intégrateurs robotiques européens peuvent immédiatement adopter Cosmos 3 comme infrastructure open-source (licence permissive OpenMDW-1.1) pour leurs développements en IA physique, sans frais de licence et avec des benchmarks auditables.

💬 La comparaison avec CUDA n'est pas anodine. NVIDIA ne publie pas Cosmos 3 par générosité open-source, ils font exactement ce qu'ils ont fait en 2007 : poser le layer d'infrastructure que tout le monde finira par utiliser, et vendre les GPU par-dessus. Vu les benchmarks sur RoboArena, les labos robotiques ont peu de raisons de résister.

IA physiqueOpinion
1 source