Aller au contenu principal
RecherchearXiv cs.RO 

Revue complète de l'intelligence artificielle physique générative

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une revue de littérature mise en ligne sur arXiv (référence 2609.18111v1) dresse un panorama de ce que ses auteurs appellent l'intelligence artificielle physique générative, des systèmes qui associent modèles de fondation et corps physiques pour percevoir, raisonner et agir de façon autonome. Ils distinguent cinq familles : les Robot Foundation Models, pour transférer des compétences entre plateformes robotiques différentes ; les modèles Vision Language Action, pour la perception multimodale et la commande de bout en bout ; les Large Behavior Models, pour générer des mouvements proches du geste humain ; les Diffusion Policy Models, fondés sur la diffusion, pour produire des séquences d'actions cohérentes dans le temps ; et les World Foundation Models, qui simulent la physique pour générer des données d'entraînement. Les exemples cités couvrent les véhicules autonomes, l'automatisation industrielle, la robotique médicale et les systèmes humanoïdes.

Pour les intégrateurs et décideurs du secteur, l'apport tient à la mise en ordre d'un paysage saturé de revendications concurrentes, en montrant que ces cinq approches se complètent plutôt qu'elles ne s'opposent : un World Foundation Model peut fournir les données synthétiques qui entraînent un VLA ou un modèle de diffusion, un Robot Foundation Model porte une politique apprise d'une plateforme vers une autre, un Large Behavior Model apporte les a priori de mouvement qui rendent un geste crédible. Cette lecture tempère le discours souvent binaire sur la résolution du sim-to-real ou la capacité des VLA à généraliser seuls, en rappelant que les gains de performance observés restent portés par la combinaison de plusieurs briques technologiques plutôt que par une architecture unique.

Il s'agit d'un travail de synthèse académique et non de l'annonce d'un produit ou d'un déploiement : aucune entreprise, aucun robot ni aucun chiffre de série n'est associé à cette publication, à la différence des communiqués habituels du secteur. Les auteurs inscrivent leur cadre dans la continuité des recherches sur l'IA incarnée et l'apprentissage de politiques robotiques, en le prolongeant vers des environnements connectés à l'internet des objets où des agents doivent coopérer avec des capteurs et des actionneurs en périphérie de réseau. Ils pointent plusieurs axes de recherche encore ouverts : apprentissage économe en données, transfert simulateur-réel, architectures compatibles avec le calcul embarqué, et cadres de sécurité, sans annoncer de calendrier ni de prototype précis pour ces prochaines étapes.

À lire aussi

Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique
1arXiv cs.RO 

Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique

Des chercheurs ont publié EmboCoach-Bench, un benchmark évaluant la capacité d'agents LLM à automatiser l'ingénierie de politiques pour systèmes robotiques incarnés. Présenté sur arXiv (arXiv:2501.21570), le cadre couvre 32 tâches conçues par des experts en apprentissage par renforcement (RL) et apprentissage par imitation (IL), avec le code exécutable comme interface universelle entre l'agent et l'environnement de simulation. Plutôt que de générer des solutions statiques, les agents opèrent en boucle fermée: ils proposent du code, l'exécutent dans le simulateur, analysent le retour d'environnement, puis itèrent pour corriger et optimiser. Les tâches couvrent des aspects allant de la conception de fonctions de récompense informées par la physique aux architectures de politiques avancées, notamment les diffusion policies. Les résultats quantitatifs méritent attention: les agents autonomes ont surpassé les baselines conçues manuellement par des humains de 26,5% en taux de succès moyen, contestant l'hypothèse selon laquelle l'expertise humaine en reward shaping serait difficilement substituable pour les politiques incarnées. Deuxième enseignement: le workflow agentique avec retour d'environnement réduit substantiellement l'écart de performance entre modèles open-source et propriétaires, ce qui suggère que la boucle de feedback itératif est plus déterminante que le modèle sous-jacent. Enfin, les agents démontrent une capacité de self-correction sur des cas pathologiques d'ingénierie, récupérant des tâches en quasi-échec total via un débogage itératif en simulation. Pour les équipes robotiques, cela représente une voie potentielle pour réduire le temps ingénieur consacré au tuning manuel des hyperparamètres et à la conception artisanale de fonctions de récompense. Ce travail s'inscrit dans une tendance plus large: l'application des workflows agentiques LLM, prouvés dans l'automatisation logicielle et la découverte scientifique, au domaine de l'IA incarnée. Le goulot d'étranglement identifié, à savoir la supervision manuelle intensive pour le réglage des simulations, est un problème structurel bien connu des équipes travaillant sur Optimus (Tesla), GR00T N2 (NVIDIA) ou les systèmes de Figure AI. La contribution différenciante d'EmboCoach-Bench est de proposer un cadre d'évaluation standardisé pour mesurer ce que les agents LLM peuvent réellement automatiser, plutôt que des démos ciblées. Les extensions naturelles incluent l'intégration à des backends hétérogènes (Isaac Lab, MuJoCo, Genesis) et la validation sim-to-real pour confirmer si ces gains en simulation se transfèrent aux systèmes physiques, ce qui reste le test décisif pour une adoption industrielle.

RecherchePaper
1 source
De l'IA du monde à l'IA incarnée : une feuille de route pour l'intelligence physique en monde ouvert
2arXiv cs.RO 

De l'IA du monde à l'IA incarnée : une feuille de route pour l'intelligence physique en monde ouvert

Publié sur arXiv le 14 juillet 2026 (arXiv:2607.11689), cet article de synthèse dresse un état des lieux des modèles d'action pour la robotique et propose une feuille de route vers ce que les auteurs nomment le « cerveau incarné » (embodied brain). Le texte retrace l'évolution des politiques vision-langage-action (VLA) vers les World Action Models (WAM), des systèmes qui relient une intervention candidate à ses conséquences prédites avant exécution. Trois failles couplées freinent le secteur selon les auteurs: des espaces d'action et cibles de prédiction incompatibles d'un modèle à l'autre, une absence de standardisation des jeux de données et des protocoles d'évaluation, et des interfaces d'exécution trop fermées pour permettre la réutilisation entre systèmes. Plutôt qu'un nouveau modèle entraîné, le papier propose une architecture cible: le cerveau incarné intégrerait un contexte multimodal, comparerait plusieurs interventions candidates, puis émettrait des requêtes de transition d'état ou de capacité plutôt que des commandes moteur directes, les WAM servant de prototypes pour ces fonctions prédictives. Pour les intégrateurs et décideurs en robotique, ce travail nomme un problème concret: chaque laboratoire, qu'il s'agisse de Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure avec Helix, construit son propre espace d'action et son propre format de données, rendant quasi impossible la comparaison directe des performances ou la réutilisation d'un modèle entre un bras robotique et un humanoïde. En proposant des contrats partagés entre modèles, données, tâches et morphologies, et un post-entraînement en boucle fermée transformant les interactions vérifiées en expérience réutilisable, la feuille de route vise à sortir la robotique généraliste du stade de la démonstration isolée. C'est une contribution méthodologique plus qu'un résultat expérimental: elle ne prouve pas qu'un tel système fonctionne à l'échelle, mais formalise ce qui manque pour y parvenir, un constat qui recoupe les critiques récurrentes sur l'écart entre vidéos de démonstration sélectionnées et déploiements robustes en conditions réelles. Le papier s'inscrit dans la continuité des travaux sur les modèles d'action et les world models, qui ont convergé avec l'essor des VLA avant que des approches hybrides, combinant prédiction du monde et politique d'action, ne donnent naissance aux WAM. Les auteurs ne mentionnent aucun déploiement propre mais positionnent leur cadre face aux systèmes existants de Physical Intelligence, NVIDIA et Figure, sans citer d'acteur français ou européen dans cette revue. La suite annoncée est l'adoption progressive de ces contrats partagés par la communauté de recherche, préalable jugé nécessaire à l'émergence d'agents physiques réellement adaptatifs et auto-améliorants hors laboratoire.

RecherchePaper
1 source
Un aperçu de la coexistence physique à long terme avec des robots intelligents
3arXiv cs.RO 

Un aperçu de la coexistence physique à long terme avec des robots intelligents

PHILIA est un système agent multi-robots présenté dans un article publié sur arXiv (2607.11377, soumission nouvelle) et conçu pour la coexistence physique de longue durée entre humains et robots au domicile. Son architecture repose sur une abstraction appelée « robot gateway », qui expose de façon unifiée les runtimes locaux de chaque robot, la perception embarquée, la navigation, la synthèse vocale et les politiques de contrôle, tout en conservant l'écosystème d'interaction et d'outils d'OpenClaw, un framework agent existant dont PHILIA hérite les capacités conversationnelles. Le système a été validé sur des robots Astribot S1, plateforme de manipulation humanoïde développée par la startup chinoise Astribot, et le contrat de la gateway a été pensé pour accueillir à terme d'autres plateformes robotiques hétérogènes via une interface commune couvrant observation, exécution de tâches, navigation, lecture vocale, supervision d'état et annulation de tâche. Les auteurs présentent des scénarios domestiques allant du simple rangement d'objets à des tâches longues et dextres comme remplir un sac à dos ou soulever un sac poubelle. L'intérêt de cette architecture tient à sa séparation explicite entre le raisonnement agent, peu fréquent et fortement sémantique, et l'exécution robotique bas niveau, à haute fréquence. Cette séparation rend l'expérience utilisateur compositionnelle: une amélioration de l'interface, de l'embodiment robotique, de la politique de contrôle ou de l'algorithme de navigation peut profiter au système sans le redessiner entièrement. C'est une réponse directe à un problème récurrent du secteur des robots humanoïdes domestiques, où les démonstrations spectaculaires reposent souvent sur des pipelines figés et peu réutilisables. En intégrant une mémoire longue durée des préférences utilisateur et une confirmation humaine en boucle pendant l'exécution, PHILIA cible aussi l'écart de confiance entre politiques de contrôle performantes en laboratoire et fiabilité réelle attendue en environnement domestique. Le travail s'inscrit dans la vague de recherche sur les agents robotiques généralistes combinant modèles de langage et politiques vision-langage-action, aux côtés d'efforts comme Gemini Robotics ou Helix. Il reste à ce stade une contribution de recherche à l'état d'article, testée sur une seule plateforme matérielle, sans annonce de déploiement commercial ni de partenaire industriel identifié.

RecherchePaper
1 source
RobotEQ : de l'intelligence passive à l'intelligence active dans l'IA incarnée
4arXiv cs.RO 

RobotEQ : de l'intelligence passive à l'intelligence active dans l'IA incarnée

Une équipe de chercheurs a publié en mai 2025 RobotEQ (arXiv:2605.06234), un benchmark conçu pour évaluer ce qu'ils appellent l'intelligence active dans les systèmes d'IA incarnée. Contrairement aux approches actuelles, où un robot exécute des tâches sur instruction explicite de l'utilisateur (intelligence passive), l'intelligence active désigne la capacité d'un système à identifier de manière autonome quelles actions sont socialement acceptables ou interdites, sans consigne préalable. Pour mesurer cette aptitude, les auteurs ont constitué RobotEQ-Data : un jeu de données de 1 900 images en vue égocentrique, couvrant 10 catégories scénario typiques de l'IA incarnée et 56 sous-catégories. Via annotation manuelle intensive, ils ont produit 5 353 questions de jugement d'action et 1 286 questions d'ancrage spatial, formant ensemble le socle du benchmark RobotEQ-Bench. Les résultats d'évaluation sur les modèles de pointe actuels sont sans ambiguïté : aucun ne satisfait de manière fiable aux exigences de l'intelligence active, avec des lacunes particulièrement marquées sur l'ancrage spatial, c'est-à-dire la capacité à localiser précisément les objets ou zones pertinents dans une scène pour motiver un comportement conforme aux normes sociales. L'étude montre cependant qu'intégrer des bases de connaissances externes via des techniques de RAG (Retrieval-Augmented Generation) améliore significativement les performances, ce qui suggère une piste concrète pour les développeurs de systèmes robotiques sociaux. Pour les industriels et intégrateurs, ce résultat pointe une limite critique avant tout déploiement en environnement humain non contrôlé : les robots actuels ne sont pas équipés pour naviguer les conventions implicites du quotidien. RobotEQ s'inscrit dans un effort académique plus large visant à combler le fossé entre capacités de manipulation assistée et autonomie sociale réelle, un sujet de plus en plus pressant à mesure que les robots humanoïdes entrent dans des espaces partagés avec des humains. Les grandes plateformes évaluées ne sont pas nommées explicitement dans l'abstract, mais le benchmark cible les VLMs (Vision-Language Models) utilisés dans les architectures d'IA incarnée actuelles, comme ceux sous-tendant des systèmes tels que Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Aucun partenaire industriel ni calendrier de déploiement n'est annoncé, ce papier restant à ce stade une contribution de recherche fondamentale avec dataset et benchmark disponibles pour la communauté.

RecherchePaper
1 source