Aller au contenu principal

Dossier Physical Intelligence — π0 — page 17

1342 articles · page 17 sur 27

Physical Intelligence et la famille π0 : modèles fondation cross-embodiment, transfert de compétences entre robots, levées Lux Capital et OpenAI Startup Fund.

Simplexity Robotics : une start-up d'IA incarnée de 11 mois déploie 100 robots sur des lignes de production
801Pandaily Chine/AsieOpinion

Simplexity Robotics : une start-up d'IA incarnée de 11 mois déploie 100 robots sur des lignes de production

Simplexity Robotics, startup chinoise spécialisée en IA incarnée fondée il y a moins d'un an, a annoncé la livraison d'un premier lot de 100 unités de son robot polyvalent i7 Pro, ainsi que la mise en service d'une ligne de production robotisée dédiée à l'usinage CNC. Ces 100 robots n'ont pas été livrés à un seul client mais répartis sur plusieurs scénarios réels, selon Jia Peng, PDG et directeur technique de la startup, ancien cadre de Li Auto avec une solide expérience en fabrication automobile intelligente. Le plus gros déploiement concerne des clients industriels fabriquant des composants robotiques, tandis que des livraisons significatives ont aussi été effectuées vers des lignes de production de modules optiques et de circuits imprimés flexibles, des installations liées aux infrastructures IA, ainsi qu'auprès d'instituts de recherche, de partenaires d'écosystème et de développeurs. Dans les ateliers CNC, les i7 Pro assurent le chargement et déchargement continu de pièces sur plusieurs machines-outils, des tâches qui exigent précision de mouvement, manipulation fine et fonctionnement stable prolongé sous des contraintes de sécurité strictes. Chez le fabricant Leaderdrive, plusieurs unités naviguent entre différentes machines pour réaliser des opérations de chargement, positionnement et insertion. Au-delà des usines, les robots sont aussi testés en logistique, où ils localisent et prélèvent des articles commandés sur des rayonnages pour les livrer, et en tri de colis, où deux unités collaborent pour déplacer et retourner des paquets. Cette annonce illustre un changement de phase pour le secteur des robots polyvalents : le passage de la démonstration en laboratoire au déploiement réel à l'échelle industrielle, un cap que peu d'acteurs ont franchi concrètement malgré une abondance de communiqués promettant des ruptures. Le fait que Simplexity répartisse ses 100 unités sur des scénarios variés, usinage, logistique, tri de colis, plutôt que de les concentrer chez un seul client, est présenté comme une preuve de généralisation, un argument central dans le débat sur la capacité réelle des modèles VLA (vision-langage-action) à s'adapter au-delà de tâches démontrées en conditions contrôlées. Pour les intégrateurs et décideurs industriels, l'enjeu n'est pas la performance brute mais le coût d'intégration : Simplexity revendique un déploiement opérationnel en une heure, ce qui, si vérifié en conditions réelles et non lors de démonstrations sélectionnées, romprait avec les cycles d'ingénierie et de débogage habituellement longs pour ce type d'équipement. Simplexity mise sur une intégration verticale complète, de son modèle fondation LaST0, à compréhension et génération multimodale native, à LaST-R1, qui intègre de l'apprentissage par renforcement dans le raisonnement en espace latent et revendique 99,9% de réussite sur le benchmark LIBERO, une métrique à interpréter avec prudence tant les protocoles d'évaluation varient d'un laboratoire à l'autre. Son modèle LaST-HD vise à transférer les données de manipulation humaine vers les robots de manière industrialisable. Le robot i7 Pro suit une philosophie où le modèle définit le matériel, conçue selon des standards d'ingénierie inspirés de l'automobile, intégrant mobilité, manipulation, perception à 360 degrés et calcul dans une architecture modulaire, livrée avec une plateforme de développement complète. Sur un marché dominé par les annonces de Figure, Tesla Optimus, Agility Robotics ou Physical Intelligence, Jia Peng défend une vision différente de la compétition à venir : non une rupture technologique unique, mais la capacité à entrer rapidement dans de nouveaux scénarios et générer de la valeur, l'adaptation cross-scénario primant sur la polyvalence universelle.

1 source
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
802arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source
Démonstrations structurées du simple au complexe pour l'apprentissage vision-langage-action
803arXiv cs.RO 

Démonstrations structurées du simple au complexe pour l'apprentissage vision-langage-action

Les chercheurs proposent une nouvelle méthode de collecte de démonstrations pour l'entraînement de modèles Vision-Language-Action (VLA), publiée sur arXiv le 4 juillet 2026 (arXiv:2607.04591v1). Plutôt que de se concentrer sur l'architecture des modèles ou la taille des jeux de données, comme le fait la majorité des travaux récents, l'équipe s'attaque à un maillon jusqu'ici négligé de l'apprentissage par imitation : la manière dont les démonstrations elles-mêmes sont organisées. Leur approche, testée sur une plateforme robotique à double bras, repose sur trois principes: décomposer les tâches de manipulation complexes en sous-compétences apprises progressivement, standardiser l'environnement d'interaction pour limiter la variabilité inutile, et ordonner les démonstrations par complexité croissante plutôt que de les collecter en bloc. Deux tâches servent de banc d'essai: le tri et la préhension de blocs, et le pliage de serviettes. Les auteurs rapportent une amélioration du taux de réussite et une meilleure stabilité d'entraînement par rapport à la méthode de référence, qui consiste à enregistrer directement des trajectoires complètes de bout en bout, sans toutefois détailler de métriques chiffrées précises dans le résumé. Pour l'industrie robotique, ce travail pointe un angle mort du secteur VLA: la course actuelle privilégie l'échelle des modèles et des jeux de données, sur le modèle de Pi-0, GR00T N2 ou Helix, mais néglige souvent la qualité et la structure des données d'apprentissage. Si l'organisation curriculaire des démonstrations s'avère aussi déterminante que le suggèrent ces résultats, cela remettrait en question l'hypothèse dominante selon laquelle il suffit d'accumuler des heures de téléopération pour obtenir des politiques robustes et généralisables sur des tâches longues et séquentielles. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par curriculum, déjà éprouvé en apprentissage par renforcement, mais peu exploré pour l'imitation robotique à l'ère des VLA. Alors que les grands acteurs du secteur, qu'il s'agisse de Figure, Tesla avec Optimus ou Physical Intelligence, communiquent surtout sur les capacités finales de leurs robots humanoïdes, cette étude reste à un stade de recherche académique, sans annonce de déploiement industriel. Ses auteurs présentent ces résultats comme une preuve de concept ouvrant la voie à une collecte de données plus efficace et plus scalable pour la manipulation robotique à long horizon.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
804arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux
805arXiv cs.RO 

Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux

Des chercheurs publient le 2 juillet 2026 (arXiv:2607.02092) Guided Action Flow, une méthode d'inférence qui améliore les politiques robotiques vision-langage-action (VLA) à flow matching sans réentraîner le modèle de base. La politique préentraînée SmolVLA reste gelée : un critique appris sur des trajectoires réelles de succès et d'échec guide l'échantillonnage en temps inverse via des gradients d'action, avec un conditionnement possible sur la description de tâche issue du canal langage de SmolVLA. Sur le benchmark de manipulation LIBERO, un critique spécifique à une tâche fait passer le taux de succès de 68,0% à 82,0% sur une fenêtre de seed, puis de 82,0% à 86,0% sur une autre. Un critique multi-famille, entraîné sur plusieurs types de tâches, améliore le succès en validation de 46,0% à 56,0%, mais le gain sur le jeu de test verrouillé reste plus modeste, de 65,0% à 67,5%. Pour les intégrateurs qui déploient des politiques VLA figées en production, l'approche offre un gain de performance à l'inférence sans le coût d'un réentraînement complet, en transposant aux politiques d'action robotiques un guidage par critique déjà courant en génération d'image et en apprentissage par renforcement. L'écart entre le gain en validation (+10 points) et celui observé sur données verrouillées (+2,5 points) est le résultat le plus significatif de l'étude : il révèle une généralisation limitée du critique au-delà de sa distribution d'entraînement. La méthode est donc prometteuse pour affiner des politiques déjà déployées, mais son bénéfice réel sur des tâches totalement inédites reste contraint tant que la généralisation du critique et un guidage sensible à l'incertitude ne sont pas résolus, ce que les auteurs identifient eux-mêmes comme le verrou central de l'approche. SmolVLA, la politique de base utilisée, est un modèle VLA compact pensé pour du matériel limité, positionné face à des politiques plus lourdes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. LIBERO, le benchmark d'évaluation, est une suite standard de tâches de manipulation conçue pour tester l'apprentissage continu en robotique, et le choix du flow matching comme mécanisme de génération d'action reflète une bascule plus large du secteur vers des schémas de transport plus rapides à échantillonner que la diffusion classique. Guided Action Flow se positionne comme une brique complémentaire aux efforts de réentraînement à grande échelle, offrant un moyen peu coûteux d'améliorer des politiques déjà déployées plutôt que de concurrencer les gros modèles généralistes. Les auteurs annoncent vouloir approfondir la généralisation du critique et intégrer une notion d'incertitude dans le guidage, sans donner de calendrier précis pour ces prochaines étapes.

RechercheActu
1 source
« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »
806arXiv cs.RO 

« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »

Voici l'article traduit et résumé selon les consignes éditoriales : Une équipe de chercheurs en robot learning publie RoboTacDex, un jeu de données de manipulation dextre construit sur le robot humanoïde Unitree G1, accessible publiquement. L'ensemble comprend 6 000 trajectoires couvrant 19 tâches, 23 compétences distinctes et des interactions avec 22 objets différents. Chaque trajectoire embarque des flux RGB et de profondeur multi-vues, un retour tactile et des annotations sémantiques détaillées. Pour garantir la qualité de la collecte, les auteurs ont développé un système de synchronisation multi-caméras capable d'aligner les différentes modalités à la milliseconde près. Le jeu de données cible volontairement des tâches complexes, réalisables uniquement avec deux bras et des mains dextres, pour se rapprocher de la logique opérationnelle humaine. Trois modèles d'apprentissage par imitation ont été testés dessus, avec des résultats jugés positifs et une capacité de généralisation modérée sur l'ensemble des tâches. Le dataset sera open-source prochainement. L'enjeu dépasse la simple publication académique : l'apprentissage par imitation pour la manipulation bimanuelle dextre souffre d'un manque chronique de démonstrations diversifiées et multimodales, la plupart des jeux de données existants se limitant à la vision RGB seule. L'ajout systématique du tactile et d'une synchronisation précise entre capteurs comble un vide identifié par plusieurs laboratoires travaillant sur des modèles vision-langage-action (VLA). Pour les équipes qui entraînent ce type de modèles, disposer de données ouvertes et denses sur une plateforme humanoïde standardisée réduit la dépendance aux jeux de données propriétaires des grands acteurs américains. Le choix du Unitree G1, plateforme humanoïde relativement abordable et largement diffusée dans les laboratoires de recherche, s'inscrit dans une dynamique d'ouverture des données robotiques comparable à des initiatives comme Open X-Embodiment. Ce positionnement contraste avec les approches propriétaires de Physical Intelligence (Pi-0) ou NVIDIA (GR00T), qui restreignent l'accès à leurs corpus d'entraînement. La mise en open source, annoncée mais pas encore effective à la date de publication du prépublication arXiv, déterminera l'impact réel de RoboTacDex sur la communauté.

RecherchePaper
1 source
Vidéo : un nouveau modèle d'IA permet aux robots humanoïdes de réussir 90 % des missions complexes
807Interesting Engineering 

Vidéo : un nouveau modèle d'IA permet aux robots humanoïdes de réussir 90 % des missions complexes

Flexion Robotics a dévoilé Reflect v1.0, une plateforme d'intelligence robotique destinée aux humanoïdes, capable d'exécuter des missions longues et multi-étapes sans intervention humaine pendant l'exécution. Pour illustrer les capacités du système, la société a présenté une démonstration en environnement de bureau : un robot humanoïde reçoit une instruction en langage naturel, récupère un colis de snacks livré au bâtiment, emprunte escaliers et ascenseur, déballe le carton à l'aide d'outils, puis range les articles dans un tiroir désigné. Selon Flexion, l'intégration du reinforcement learning sur plusieurs couches du système a fait passer le taux de complétion end-to-end d'une mission interne à 16 étapes de 38 % à 90 %, contre un modèle supervisé seul. La plateforme gère des charges comprises entre 100 grammes et 3,5 kilogrammes, et le robot est capable de repositionner un colis via des mouvements coordonnés du corps entier, d'opérer un ascenseur, de traverser des escaliers répétés et de contourner des obstacles dynamiques tout en portant des objets. Ce résultat est significatif parce qu'il s'attaque directement au problème de l'autonomie longue durée, considéré comme l'un des verrous majeurs de la robotique humanoïde commerciale. Dans une séquence de tâches, l'accumulation d'erreurs de navigation, de manipulation ou de perception finit statistiquement par faire échouer le système : c'est le "long-horizon failure mode" que les industriels connaissent bien. Reflect v1.0 le traite via un modèle vision-langage (VLM) personnalisé qui fait office de contrôleur de mission, surveille en continu l'avancement, raisonne sur l'environnement et re-planifie à la demande. La couche de mouvement combine des vision-language-action models (VLA) entraînés sur données réelles et des primitives issues du reinforcement learning, tandis qu'un contrôleur corps-entier temps réel assure équilibre et précision des gestes. Pour un COO industriel ou un intégrateur, le signal concret est le suivant : on passe de 38 % à 90 % de succès sur une mission à 16 étapes grâce au RL seul, ce qui suggère que le sim-to-real gap et la fiabilité multi-tâche sont partiellement solubles sans refonte matérielle. Flexion Robotics est une startup relativement récente dans l'écosystème humanoïde, qui se positionne comme fournisseur de couche logicielle agnostique au hardware, à l'image de ce que Apptronik ou 1X cherchent à faire sur leurs propres plateformes. L'article mentionne également ShengShu Technology et son modèle Motubrain, un "cerveau général" combinant perception, raisonnement et action, qui vise le même marché. La concurrence directe inclut Figure (Helix), Physical Intelligence (pi0), Boston Dynamics (Atlas Gen 2) et Tesla (Optimus Gen 3), tous engagés dans une course à l'autonomie longue horizon. Flexion reconnaît que Reflect v1.0 reste limité à des environnements définis, ce qui tempère le chiffre de 90 % : il s'agit d'une évaluation interne sur mission contrôlée, pas d'un déploiement industriel validé en conditions réelles. Les prochaines étapes annoncées concernent l'extension à des environnements moins structurés et la capacité à recevoir des instructions modifiées en cours de mission, deux marqueurs qui, s'ils sont confirmés en production, rapprocheraient Reflect d'une utilisabilité opérationnelle sérieuse.

IA physiqueOpinion
1 source
ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme
808arXiv cs.RO 

ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme

Des chercheurs ont publié le 30 juin 2026 un article de préprint (arXiv:2606.28804) présentant ViPSim, un framework de simulation destiné à entraîner et évaluer des systèmes Vision-Langage-Action (VLA) sans risque pour le matériel réel. Le problème central qu'adresse ViPSim est le "representation gap" : les modèles de monde incarné (Embodied World Models, EWMs) doivent traduire des actions en basse dimension (positions articulaires, vitesses) en vidéos haute résolution cohérentes sur de longues séquences. Sans correctif, cette asymétrie produit une dérive de trajectoire cumulée et des interactions robot-objet incohérentes dès qu'on dépasse quelques pas de simulation. Pour y remédier, ViPSim combine deux espaces complémentaires : un Visual Space qui fournit des ancrages géométriques explicites (projections pixel-alignées de la pose de l'effecteur, perspectives caméra, géométrie de scène assistée par la profondeur, masques morphologiques du robot) et un Parameter Space qui injecte les séquences d'action brutes et les matrices caméra pour guider précisément le mouvement. Les expériences rapportées montrent que l'approche est backbone-agnostic, c'est-à-dire indépendante de l'architecture de génération vidéo sous-jacente. L'enjeu industriel est direct : le principal frein à l'utilisation des EWMs comme bancs de test pour les VLA est précisément leur manque de fidélité géométrique sur des horizons longs, ce qui rend leurs évaluations peu fiables pour des tâches de manipulation complexe. ViPSim prétend résoudre ce verrou, et les résultats préliminaires indiquent une capacité émergente sur des objets déformables, notamment le pliage de tissu, un cas d'usage notoire pour mettre en échec les simulateurs rigides classiques. Le framework conserverait également des performances robustes dans des scénarios hors-distribution et en cross-embodiment, c'est-à-dire appliqué à des morphologies robotiques non vues à l'entraînement. Pour un intégrateur ou un équipementier cherchant à réduire les coûts de collecte de données réelles, un simulateur de ce type permettrait d'accélérer le cycle de validation des politiques VLA avant déploiement terrain. Il convient toutefois de nuancer : il s'agit d'un preprint académique sans validation industrielle publiée, et les vidéos de démonstration sélectionnées ne constituent pas une preuve de performance en production. Le contexte est celui d'une course effrénée à la simulation haute-fidélité pour robots incarnés, portée par la montée en puissance des architectures VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Ces modèles nécessitent des volumes massifs de données de démonstration, et la génération synthétique en est le principal levier de scalabilité. Des frameworks concurrents comme UniSim, IRASim ou Genesis s'attaquent au même problème avec des approches différentes, certains privilégiant la physique explicite, d'autres la génération neuronale pure. ViPSim se positionne sur la cohérence géométrique longue durée plutôt que sur le réalisme visuel brut, une niche encore peu couverte. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication actuelle : il s'agit pour l'instant d'une contribution de recherche ouverte, sans implémentation publique annoncée.

RechercheOpinion
1 source
Apprentissage de dynamiques transférables : des modèles d'action aux modèles du monde
809arXiv cs.RO 

Apprentissage de dynamiques transférables : des modèles d'action aux modèles du monde

Des chercheurs ont publié en juin 2026 un préprint arXiv (2606.29501) décrivant A2World, un modèle de monde diffusion multi-vues conditionné par les actions, pré-entraîné sur de larges volumes de données de manipulation robotique avec annotations d'actions réelles. L'idée centrale est que prédire comment une action modifie visuellement une scène, plutôt que simplement générer des vidéos plausibles, force le modèle à capturer des dynamiques d'interaction réutilisables. Ce pré-entraînement produit ce que les auteurs appellent des "priors de dynamiques transférables". À partir des mêmes poids pré-entraînés, deux variantes sont dérivées : A2World-sim, adapté en simulateur spécialisé par tâche ou environnement, et A2World-policy, un modèle de prédiction jointe vidéo-action conditionné par des instructions visuelles. Les expériences sont validées sur des benchmarks de simulation et en conditions réelles, sans que les auteurs ne publient de métriques quantitatives précises dans le résumé. L'enjeu concret pour les équipes de robotique industrielle est le coût des données de rollout réel : A2World-sim vise à remplacer les passages physiques sur robot par des déroulements dans le modèle de monde, permettant une évaluation de politique à grande échelle et des analyses contrefactuelles ("que se passerait-il si...") sans mobiliser de hardware. C'est le noeud dur du problème sim-to-real : les simulateurs classiques (Isaac Sim, MuJoCo) échouent sur la fidélité visuelle et de contact, tandis qu'un modèle de monde appris sur des données réelles devrait, en théorie, hériter de la physique implicite du monde réel. A2World-policy s'inscrit dans la lignée des VLA (Vision-Language-Action models) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, en conditionnant la prédiction d'action sur le flux visuel et des instructions en langage naturel. Il s'agit toutefois d'un préprint non revu par les pairs, et les métriques présentées (benchmarks de simulation) restent à confirmer sur des déploiements réels à l'échelle. Ce travail s'inscrit dans une dynamique de recherche active sur les modèles de monde pour la robotique, portée depuis 2023-2024 par des approches comme UniSim (Google), RoboDreamer, ou Genie, qui toutes cherchent à découpler l'apprentissage de politique du coût de la collecte de données physiques. Physical Intelligence (pi-0, pi-0.5), Figure AI (Figure 02/03) et 1X Technologies misent sur des architectures VLA similaires pour la généralisation multi-tâches. La contribution spécifique d'A2World est de partager les poids pré-entraînés entre le simulateur et le modèle de politique, plutôt que de les traiter comme deux systèmes distincts. Les prochaines étapes attendues dans ce type de travaux sont la publication de benchmarks ouverts, une comparaison directe contre des rollouts réels, et, pour les acteurs industriels, la question de savoir si ces approches tiennent sur des environnements non structurés hors laboratoire.

IA physiqueOpinion
1 source
Zhipingfang valorisé à 2,8 milliards : première licorne d'IA incarnée de la Greater Bay Area
810Pandaily 

Zhipingfang valorisé à 2,8 milliards : première licorne d'IA incarnée de la Greater Bay Area

Zhipingfang, startup d'IA incarnée basée à Shenzhen, a bouclé une levée de fonds d'environ 5 milliards de yuans (700 millions de dollars), portant sa valorisation à plus de 20 milliards de yuans (2,8 milliards de dollars). L'opération en fait le premier licorne de l'IA incarnée de la Greater Bay Area à franchir ce seuil. Le tour réunit un spectre inhabituellement large d'investisseurs : fonds publics nationaux (National SME Development Fund, China Cultural Industry System Fund), fonds provinciaux dédiés à l'IA, compagnies d'assurance et maisons de titres, et investisseurs industriels dont CP Group (China Biologic Products), Pharmaron, Moutai Group et China Merchants Capital. La société commercialise une architecture baptisée NeuroVLA, présentée par son fondateur et CEO, Guo Yandong, au Summer Davos Forum de juin 2026, où le Premier ministre Li Qiang a expressément cité le Shenzhen Robot Valley comme vitrine de l'écosystème d'innovation chinois. NeuroVLA organise le traitement en trois couches hiérarchiques calquées sur le système nerveux humain : un module cortical pour le raisonnement sémantique de haut niveau, un module cérébelleux pour le contrôle moteur coordonné, et un module spinal pulsé pour les boucles de rétroaction à ultra-faible latence. L'intérêt industriel de cette architecture réside dans l'efficacité computationnelle, problème structurel des systèmes robotiques actuels. Les architectures VLA (Vision-Language-Action) conventionnelles mobilisent l'intégralité de la puissance de calcul quelle que soit la complexité de la tâche, ce qui se traduit par des coûts d'inférence prohibitifs et des latences incompatibles avec le contrôle temps réel. NeuroVLA prétend résoudre cela par un routage événementiel : les boucles rapides (réflexes, stabilisation) sont traitées en couches basses, libérant le "cortex" pour le raisonnement symbolique. Le modèle biologique invoqué est le cerveau humain, 86 milliards de neurones fonctionnant à environ 20 watts, soit une densité de calcul que les GPU actuels n'approchent pas à consommation équivalente. Il faut cependant noter que les performances opérationnelles de NeuroVLA en conditions industrielles réelles ne sont pas documentées publiquement au-delà des communications de la société, et que l'affirmation de "première mondiale" reste invérifiable en l'absence de benchmark comparatif indépendant. La trajectoire financière de Zhipingfang est en elle-même un signal de marché : 12 tours de financement bouclés en un an, et une valorisation doublée de 10 à 20 milliards de yuans en quatre mois seulement, ce qui en fait, selon ses propres déclarations, la startup d'IA incarnée la plus rapide à lever à ce rythme et à cette échelle. L'entreprise est implantée au Shenzhen Robot Valley, pôle qui concentre également des acteurs comme Unitree, et s'inscrit dans une dynamique nationale où Pékin oriente massivement les fonds souverains vers l'IA incarnée pour concurrencer Figure AI (valorisé à 2,6 milliards de dollars fin 2024), Physical Intelligence et 1X côté américain, et Agility Robotics côté déploiements industriels. Aucune timeline de déploiement commercial ni volume de commandes n'ont été communiqués ; la levée reste pour l'instant une étape de financement de R&D et d'industrialisation, pas une annonce de mise en production à grande échelle.

UELa levée de 700 M$ consolide la position de la Chine dans la course à l'IA incarnée, renforçant la pression concurrentielle indirecte sur les acteurs français et européens sans impact direct sur le marché UE à ce stade.

Chine/AsieOpinion
1 source
Li Hongyang (HKU) lance une startup d'IA incarnée corps entier et lève des centaines de millions en seed
81136Kr 

Li Hongyang (HKU) lance une startup d'IA incarnée corps entier et lève des centaines de millions en seed

Archon Robotics (源策未来, "Yuance Weilai"), startup fondée en avril 2026 et basée dans la zone de développement de Caohejing à Shanghai, vient de boucler un tour de table seed de plusieurs centaines de millions de yuans. La levée réunit des fonds de premier plan dont Zhenge Fund, Gaorong Capital, IDG Capital et Wuyuan Capital, auxquels s'ajoutent le fonds conjoint Gobi Ventures / Université de Hong Kong, Miracle Plus et le Shanghai AI Innovation Institute. Light Source Capital agissait comme conseiller financier exclusif. Les fonds serviront à accélérer le développement d'un modèle fondateur humanoïde "whole-body", à constituer des jeux de données multimodaux de mouvements plein corps, et à ouvrir plusieurs centres de R&D. L'entreprise vise la publication d'un modèle open-source avant fin 2026. La société est dirigée par Li Hongyang, actuellement assistant professor et vice-doyen à l'Université de Hong Kong, dont le projet de conduite autonome end-to-end UniAD a remporté le Best Paper au CVPR 2023, seul travail d'une institution académique continentale à décrocher ce prix depuis dix ans. Il a également reçu en 2026 le RSS Early Career Award, première distinction de ce type décernée à un chercheur chinois en vingt ans d'existence du prix. Le CEO Li Tianyu, docteur de Fudan University, a co-développé le moteur "World Engine" de la solution de conduite autonome ADS 4.0 de Huawei. Le co-fondateur Chen Li, premier auteur d'UniAD, est issu du programme d'excellence Zhiyuan de l'Université Jiao Tong de Shanghai. Le pari technique d'Archon Robotics répond à une limite structurelle largement ignorée : les datasets actuels en robotique incarnée reposent quasi exclusivement sur des vidéos en vue première personne du poste de travail, enregistrant uniquement des trajectoires de bras ou de préhenseurs. Ces données ne capturent ni les déplacements du centre de gravité, ni la coordination tronc-membres, ni le transfert de force des membres inférieurs vers les membres supérieurs, c'est-à-dire précisément ce qui permet à un humain d'ouvrir une porte lourde en inclinant le corps plutôt qu'en tirant simplement le bras. La conséquence directe est que la quasi-totalité des robots actuels reste cantonnée à des préhensions sur surface plane à position fixe, incapable d'adaptation en environnement domestique non préétabli. Li Tianyu résume : "une donnée plein corps intégrant le déplacement du centre de gravité et l'angle du tronc a une densité d'information bien supérieure à cent enregistrements de trajectoire de main." La société construit donc une architecture tri-couche propriétaire : un "grand cerveau" pour la planification longue portée, un "mésencéphale" apprenant des représentations de mouvement plein corps transferrables d'un châssis à l'autre, et un "cervelet" assurant le suivi de pose et l'équilibre en temps réel. L'output n'est pas une liste d'angles articulaires spécifiques à un modèle de robot, mais une trajectoire de mouvement plein corps compatible avec plusieurs morphologies. Le contexte sectoriel est porteur mais saturé : au premier semestre 2026, le secteur de la robotique incarnée en Chine a enregistré 288 opérations de financement pour un total déclaré de plus de 46 milliards de yuans, proche du niveau annuel 2025 (55,4 milliards). Archon se positionne sur un créneau encore peu occupé en ciblant directement le modèle fondateur humanoïde généraliste plutôt que les solutions hybrides à châssis roulant avec bras manipulateurs, qui dominent actuellement le marché faute de savoir-faire en locomotion bipède. Li Hongyang compare l'état actuel de l'industrie à un niveau "L1,5" par analogie avec les grades de conduite autonome : les démos publiques relèvent encore majoritairement du contrôle à distance ou de scénarios entièrement scriptés, sans capacité autonome réelle sur des tâches multi-étapes en environnement ouvert. Les concurrents directs sur la brique modèle fondateur incluent Physical Intelligence (Pi-0), NVIDIA (GR00T N2), et Figure AI côté occidental, ainsi que plusieurs équipes chinoises moins bien documentées. Archon se différencie en ciblant explicitement les données "human-centric" incluant posture complète et marqueurs de force, avec une collecte mixte alliant données humaines dans des scènes réelles et données de téléopération sur robots physiques, dans une boucle ferme collecte-entraînement-retour d'erreur destinée à constituer une barrière concurrentielle durable.

Chine/AsieOpinion
1 source
TaskNPoint : apprendre à un humanoïde à frapper un revers en quelques minutes
812arXiv cs.RO 

TaskNPoint : apprendre à un humanoïde à frapper un revers en quelques minutes

Des chercheurs publient sur arXiv (juin 2026) TaskNPoint, un protocole d'entraînement qui enseigne des compétences dynamiques à un humanoïde à partir d'une seule démonstration humaine par compétence, avec moins d'une heure de calcul sur un seul GPU standard. Le système repose sur quatre entrées fournies par un coach humain : un ensemble discret de compétences à acquérir, une démonstration vidéo par compétence, l'identification d'une "fenêtre d'interaction" critique (les ~20 cm de déplacement de raquette autour du contact balle-raquette, par exemple) et l'objectif cible. L'apprentissage par renforcement en simulation physique prend le relais pour générer les trajectoires complètes et, via un échantillonnage aléatoire des positions cibles pendant l'entraînement, assure une généralisation zero-shot à des objectifs inédits. L'approche est validée sur un humanoïde Unitree G1 : coups droits et revers face à des balles lancées par un humain, tirs de football et pick-and-place de cartons depuis des positions arbitraires, sans ajustement manuel de fonction de récompense. L'enjeu est la scalabilité de l'apprentissage sur des compétences dynamiques, où les méthodes actuelles butent soit sur le volume de démonstrations requis, soit sur le coût du reward engineering. TaskNPoint réduit les deux à presque rien : une seule démo par compétence suffit, sans réglage de récompense par tâche. L'argument structurel est que le résultat d'un mouvement dynamique est déterminé par un court segment de la trajectoire, la fenêtre d'interaction critique, et non par sa totalité ; calibrer ce segment en coordination avec la physique du robot et son architecture mécanique permet de généraliser le reste automatiquement. C'est un argument direct contre la thèse selon laquelle les humanoïdes nécessitent des milliers d'heures de données pour performer sur des gestes non triviaux. Il s'agit toutefois d'un preprint arXiv, testé en conditions contrôlées ; la robustesse en milieu industriel non scénarisé reste à établir. Le Unitree G1, humanoïde chinois vendu autour de 16 000 dollars, s'est imposé depuis 2024 comme la plateforme de recherche ouverte de référence, alternative accessible aux Boston Dynamics Atlas et Agility Digit. TaskNPoint s'inscrit dans un courant cherchant à réconcilier imitation et renforcement simulé, face aux diffusion policies de Physical Intelligence (Pi-0) ou aux politiques visuomotrices universelles de type VLA. Son positionnement distinctif est la parcimonie en données d'entrée, une démo par compétence là où d'autres méthodes en exigent des centaines, avec un coût de calcul suffisamment bas pour être accessible à des équipes sans infrastructure GPU lourde. Aucun pilote industriel ni partenariat de déploiement n'est annoncé avec cette publication.

IA physiqueOpinion
1 source
Agents omnimodaux incarnés : des compétences isolées à l'autonomie physique du quotidien
813arXiv cs.RO 

Agents omnimodaux incarnés : des compétences isolées à l'autonomie physique du quotidien

OmniAct est un framework de recherche publié le 26 juin 2026 sur arXiv (2606.27251) qui propose une architecture pour agents robotiques capables d'opérer de façon persistante sur des tâches longues dans des environnements non structurés. Le système repose sur trois couches hiérarchiques asynchrones : un planificateur sémantique multimodal qui route les actions entre domaines cyber (APIs, IoT) et physiques (manipulation, navigation), un module de mémoire adaptatif à compression événementielle garantissant une croissance sous-linéaire du contexte, et un moteur de préemption visuelle asynchrone qui referme la boucle sémantique pendant l'exécution physique. Évalué sur 40 tâches réelles à long horizon sur deux plateformes robotiques coordonnant quatre dispositifs IoT, OmniAct maintient une consommation de tokens quasi-stable en deçà de 100 000 tokens accumulés et élève des modèles open-weight à un niveau de performance comparable aux modèles propriétaires. Ce résultat adresse trois défaillances structurelles bien connues dans le domaine : les planificateurs VLM (Vision-Language Model) manquent d'un espace d'action cyber-physique unifié, les frameworks d'agents existants accumulent du contexte de façon non bornée jusqu'à dégrader la cohérence temporelle sur les longues sessions, et les politiques VLA (Vision-Language-Action) s'exécutent classiquement en boucle ouverte sans détecter leurs propres défaillances. La préemption visuelle asynchrone est l'apport le plus différenciant : le robot peut interrompre et reconfigurer une séquence en cours sans attendre sa terminaison, ce qui est précisément le comportement requis dans un déploiement industriel réel. Pour un intégrateur ou un COO industriel, la démonstration qu'une architecture bien conçue suffit à hisser des modèles open-weight au niveau propriétaire modifie le calcul économique du déploiement : moins de dépendance aux fondations coûteuses de GPT-4o ou Gemini. Ce travail s'inscrit dans une compétition dense autour des architectures pour agents embodied à long horizon. Des frameworks concurrents comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) ciblent également la généralisation physique, mais restent principalement centrés sur la manipulation. OmniAct se distingue en intégrant explicitement le domaine cyber dans la boucle d'action, rapprochant l'architecture des besoins industriels où un robot interagit aussi avec des systèmes d'information et des capteurs IoT. Nuance importante : il s'agit d'un preprint arXiv, non encore évalué par les pairs, sans déploiement commercial annoncé ni divulgation des deux plateformes robotiques utilisées, ce qui limite la reproductibilité des résultats à ce stade.

UELes intégrateurs robotiques européens pourraient réduire leur dépendance aux fondations propriétaires américaines (GPT-4o, Gemini) si l'architecture OmniAct se confirme après révision par les pairs.

IA physiqueOpinion
1 source
IA incarnée généraliste : RoboScience dévoile Visics
814Pandaily 

IA incarnée généraliste : RoboScience dévoile Visics

La société pékinoise RoboScience a officiellement présenté le 24 juin 2026 Visics, son modèle d'IA embarquée à usage général, accompagné d'une divulgation technique complète de l'architecture VLOA (Vision-Language-Object-Action). L'annonce s'appuie sur des démonstrations réelles couvrant l'assemblage de meubles, la préhension dextre et des opérations sur lignes d'assemblage dynamiques. L'architecture repose sur une représentation intermédiaire unifiée baptisée Object Trajectory, soit une trajectoire de nuage de points 3D centrée sur l'objet manipulé plutôt que sur les trajectoires articulaires propres à un robot donné. Deux moteurs fonctionnent en tandem : un Embodied World Model, entraîné sur de vastes volumes de vidéos Internet pour apprendre la physique des objets et les dynamiques de force, et un General Operation Model qui traduit ces trajectoires en commandes hardware-agnostiques. La simulation propriétaire RoboMirage, couplée à des pipelines d'annotation vidéo automatisés, permettrait de générer des données d'entraînement à un coût représentant 1/20 à 1/200 des approches conventionnelles, avec un objectif de plus d'un téraoctet de données de trajectoires de manipulation d'ici fin 2026. Le tour de table inclut JD.com, SenseTime, Fortune Capital, CMB Capital et Sinovation Ventures ; les centres de R&D et de production sont répartis entre Pékin, Shenzhen, Suzhou et Hangzhou. L'approche VLOA tente de résoudre un problème structurel du secteur : les modèles de contrôle robotique sont aujourd'hui massivement liés à la cinématique d'un hardware précis, ce qui rend toute généralisation coûteuse et fragile. En découplant la couche cognitive (comprendre la tâche et l'objet) de la couche d'exécution (générer les commandes moteur), RoboScience affirme pouvoir déployer Visics sur des plateformes hétérogènes sans réentraînement complet. Si cela se confirme à l'échelle, l'impact pour les intégrateurs industriels serait significatif : fini le verrouillage sur un fournisseur de robot unique pour une cellule donnée. Les métriques de coût de données (1/200e du coût traditionnel) restent toutefois à vérifier indépendamment ; les vidéos de démonstration présentées sont sélectionnées et ne constituent pas un benchmark contradictoirement validé, un écart classique entre communication marketing et performance opérationnelle réelle. RoboScience s'inscrit dans une vague dense de startups chinoises d'IA embarquée qui cherchent à contester le leadership américain dans l'humanoïde et la manipulation généraliste. Face à Physical Intelligence (Pi-0), à NVIDIA (GR00T N2), ou encore à Agibot et Unitree sur le segment domestic/industrial, la stratégie de RoboScience mise sur l'abstraction hardware plutôt que sur la verticalisation matériel-logiciel adoptée par Figure ou 1X Technologies. Les pilotes annoncés portent sur le commerce de détail, la logistique et l'aide aux personnes âgées, trois segments où la variabilité des tâches et des objets est élevée, ce qui constituerait un test pertinent de la généralisation revendiquée. Le lancement d'une production en série standardisée pour des applications industrielles et commerciales est prévu pour le second semestre 2026, sans calendrier précis communiqué à ce stade.

💬 Découpler la compréhension de la tâche du contrôle moteur, c'est le saint Graal de la robotique industrielle depuis des années, et RoboScience dit l'avoir fait avec une couche d'abstraction hardware-agnostique. Si ça tient à l'échelle, ça met fin au verrou fournisseur qui force aujourd'hui les intégrateurs à recoder intégralement pour chaque plateforme robot. Les démos sont sélectionnées, les chiffres de coût data invérifiables pour l'instant, et le H2 2026 sans date précise, ça ressemble encore à du "bientôt".

IA physiqueOpinion
1 source
RoboScience lance Visics, un modèle fondation incarné universel, multi-morphologies, multi-objets et multi-tâches
81536Kr 

RoboScience lance Visics, un modèle fondation incarné universel, multi-morphologies, multi-objets et multi-tâches

Le 24 juin 2026, la startup chinoise RoboScience a dévoilé Visics, son modèle fondamental d'IA incarnée, en révélant pour la première fois l'architecture complète de son système VLOA (Vision-Language-Object-Action). Les démonstrations présentées couvrent des scénarios réels: assemblage de meubles, préhension dextre et lignes de production dynamiques. Le coeur technique est l'Object Trajectory, une représentation intermédiaire unifiée sous forme de trajectoires 3D en nuage de points, qui sert d'interface entre deux moteurs entraînés séparément: un modèle monde incarné, alimenté par des vidéos internet massives pour modéliser états d'objets, forces de contact et causalité physique; et un modèle d'opération universel, générant des commandes de contrôle multi-plateforme via le moteur de simulation propriétaire RoboMirage. Ce second module supporte corps rigides, pièces articulées et matériaux déformables, avec entrées vision, tactile et force. Le pipeline de données réduirait le coût unitaire à 1/20 à 1/200 des méthodes classiques selon l'entreprise, à raison de centaines de milliers d'heures par semaine; un dataset supérieur à 1 To de trajectoires manipulation est annoncé pour fin 2026. L'enjeu est structurel: contrairement aux LLM qui ont convergé sur le token texte, ou à l'autonomie automobile sur le nuage de points, la robotique généraliste ne dispose pas encore de représentation de base partagée, ce qui lie chaque modèle à un hardware, un objet et une tâche spécifiques. L'Object Trajectory tente de casser cette dépendance en permettant un déploiement cross-embodiment, sur objets variés et tâches non vues à l'entraînement, sans re-fine-tuning par configuration hardware. Pour un intégrateur ou un COO industriel, la promesse est un seul pipeline modèle couvrant un parc de robots hétérogènes, ce que les architectures actuelles liées aux trajectoires articulaires ne permettent pas. RoboScience, fondée par Tian Ye (CEO) et Wang Tao (co-fondateur), est soutenue par JD.com, SenseTime, Dachen Caizhao, China Merchants Capital, Zero One Ventures et PuHua Capital, avec des centres de R&D à Pékin, Shenzhen, Suzhou et Hangzhou. Elle se positionne dans le même espace que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures génériques de Figure, mais avec une approche délibérément centrée sur l'objet plutôt que sur la trajectoire articulaire. La société évite la confrontation directe avec l'automatisation industrielle lourde et cible en priorité la grande distribution et la logistique e-commerce, où la diversité massive de SKU constitue un banc d'essai naturel pour la généralisation multi-objet. Des pilotes sont en cours dans le retail, la logistique et les services à la personne; une production en série de robots standard pour usages industriels et commerciaux est annoncée pour 2026, sans prix ni volumes publics.

UEL'avancée chinoise en modèles fondation cross-embodiment renforce la pression concurrentielle sur les acteurs européens de la robotique généraliste, sans impact opérationnel direct identifiable à court terme.

💬 L'Object Trajectory, c'est ce que le token texte a fait pour les LLM: une représentation partagée qui coupe enfin la dépendance hardware-modèle-tâche, là où le secteur patine depuis dix ans. Si les démos tiennent en prod (assemblage de meubles, lignes dynamiques, c'est pas rien), RoboScience pourrait bien avoir écrit la grammaire commune que Pi-0 ou GR00T n'ont pas encore. Le ciblage logistique e-commerce, c'est malin aussi: des millions de SKU différents, généralisation multi-objet forcée dès le départ.

IA physiqueOpinion
1 source
DADP : politique de diffusion adaptative au domaine
816arXiv cs.RO 

DADP : politique de diffusion adaptative au domaine

Des chercheurs ont publié le 19 juin 2026 la troisième version de DADP (Domain Adaptive Diffusion Policy), un framework de contrôle robotique conçu pour généraliser à des dynamiques physiques inconnues sans nécessiter de réentraînement. Le problème central adressé est la capacité d'une politique apprise en simulation ou dans un environnement donné à fonctionner dans un autre contexte aux propriétés mécaniques différentes, friction, masse, compliance des articulations, ce que l'on appelle l'adaptation zéro-shot. Les auteurs identifient un défaut structurel dans les approches existantes de domain representation learning : lorsqu'un modèle extrait sa représentation du domaine à partir d'un contexte temporel adjacent à l'étape courante, il mélange involontairement des informations statiques (les constantes du domaine physique) avec des propriétés dynamiques transitoires (la vitesse ou la posture instantanée). DADP répond par deux contributions techniques : d'abord le Lagged Context Dynamical Prediction, qui conditionne l'estimation d'état futur sur un contexte historique décalé dans le temps, augmenter ce délai force le modèle à filtrer les propriétés transitoires et à extraire uniquement les invariants du domaine, sans supervision explicite. Ensuite, les représentations de domaine ainsi disentangled sont injectées directement dans le processus génératif du diffusion model, en biaisant la distribution a priori et en reformulant la cible de diffusion. Les résultats sur des benchmarks de locomotion et de manipulation dépassent les méthodes antérieures sur ces axes combinés. L'intérêt pour les intégrateurs robotiques et les équipes R&D est double. Premièrement, DADP aborde directement le sim-to-real gap en proposant une séparation non supervisée entre ce qui appartient à la physique du robot (masse, friction) et ce qui relève de la trajectoire en cours, une distinction que les approches précédentes laissaient au réseau à résoudre implicitement, avec des résultats fragiles. Deuxièmement, l'injection de la représentation domaine dans le processus de diffusion plutôt qu'en simple conditionnement de politique représente un changement architectural notable : cela signifie que la politique génère des actions dont la distribution est intrinsèquement calibrée sur le domaine courant, et non pas simplement corrigée a posteriori. Pour les équipes travaillant sur des déploiements multi-sites ou sur des flottes hétérogènes de manipulateurs industriels, cela ouvre une voie pour réduire le coût de calibration par site. Il convient de nuancer : les benchmarks présentés restent des environnements simulés standardisés (MuJoCo-type), et aucune validation hardware sur un robot physique n'est revendiquée dans l'abstract, un gap classique entre publication académique et déploiement terrain. DADP s'inscrit dans un courant de recherche actif qui cherche à combiner les diffusion policies, popularisées par les travaux de Chi et al. (2023) sur le Diffusion Policy et désormais intégrées dans des systèmes comme pi-zéro de Physical Intelligence ou les pipelines GR00T de NVIDIA, avec des mécanismes d'adaptation contextuelle au domaine physique. Les approches concurrentes incluent les méthodes de domain randomization (entraînement sur une large distribution de dynamiques) et les architectures méta-RL comme PEARL ou MAML, qui supposent un accès à quelques épisodes d'adaptation. DADP se positionne en zéro-shot sans rollouts d'adaptation, ce qui est une contrainte opérationnelle réaliste pour des déploiements industriels où le temps de mise en service est limité. La présence d'un site de visualisation dédié (outsider86.github.io/DomainAdaptiveDiffusionPolicy) et l'itération en version 3 suggèrent une réponse active à la communauté ; une validation expérimentale sur hardware physique constituerait la prochaine étape logique pour ancrer ces résultats dans la réalité industrielle.

RecherchePaper
1 source
MemoryWAM : modélisation monde-action efficace avec mémoire persistante
817arXiv cs.RO 

MemoryWAM : modélisation monde-action efficace avec mémoire persistante

La manipulation robotique longue durée exige une mémoire procédurale que la majorité des modèles actuels ne possèdent pas. MemoryWAM, un modèle monde-action (WAM, world action model) présenté en préprint arXiv (réf. 2506.20562, juin 2026), propose une architecture de mémoire hybride pour combler ce manque. Le système repose sur trois niveaux : des trames récentes pour le contexte immédiat, des trames ancres positionnées aux frontières d'événements clés de la séquence, et des gist tokens, des représentations compressées résumant l'historique long terme. Un mécanisme d'attention sur mesure permet d'interroger simultanément ces trois niveaux, conjuguant précision à court terme et cohérence à long terme. Les auteurs reportent des performances supérieures aux baselines VLA (vision-language-action) et WAM sur des tâches de manipulation à long horizon, en simulation et en environnement réel, avec une latence d'inférence et une consommation mémoire GPU réduites. Le verrou adressé est structurel : les WAM actuels choisissent entre fenêtre d'observation bornée, efficace mais aveugle au passé, et historique complet, précis mais dont le coût en temps et en VRAM croit avec la longueur de la séquence. Dans les environnements non-markoviens, c'est-à-dire lorsque la décision optimale dépend d'événements situés hors de la fenêtre courante, situation fréquente dans les tâches d'assemblage ou de pick-and-place multi-étapes, ce compromis devient rédhibitoire. La stratégie des gist tokens propose une alternative : comprimer sélectivement plutôt que stocker exhaustivement, ce qui maintient des performances d'inférence compatibles avec un déploiement embarqué. Pour les intégrateurs robotiques et les équipes R&D industrielles, l'enjeu est double : des robots capables de réagir à un historique long sans multiplier les ressources GPU, et une voie vers des VLA plus robustes hors des conditions de laboratoire. Les modèles monde-action s'inscrivent dans une lignée qui cherche à dépasser les VLA purs en ajoutant une modélisation dynamique visuelle, la prédiction de frames futures servant de signal de supervision auxiliaire. Des travaux comme UniSim ou DreamerV3 ont exploré cette direction en contexte général ; MemoryWAM l'applique spécifiquement à la manipulation longue durée. Ses concurrents directs incluent des VLA à contexte court tels que Pi-0 de Physical Intelligence, OpenVLA ou RoboFlamingo, qui peinent sur les séquences avec dépendances temporelles distantes. Le papier reste un preprint sans code ni poids publiés, et ses benchmarks proviennent de protocoles internes, ce qui limite la portée immédiate pour les praticiens. Une comparaison sur des jeux de données standardisés comme LIBERO ou RLBench sera nécessaire pour évaluer la généralisation réelle de l'approche. Ni partenariat industriel ni calendrier de déploiement ne sont mentionnés.

IA physiqueOpinion
1 source
RealSense dévoile la caméra de profondeur D585 Pro, conçue nativement pour l'IA et la robotique
818Robotics Business Review 

RealSense dévoile la caméra de profondeur D585 Pro, conçue nativement pour l'IA et la robotique

RealSense a présenté le D585 Pro à l'Automate 2026 (stand 12036), une caméra de profondeur à traitement IA embarqué destinée aux robots humanoïdes, aux AMR (robots mobiles autonomes), aux bras cobots et aux systèmes d'inspection industrielle. La commercialisation est prévue pour le premier trimestre 2027. Le capteur est construit autour d'un SoC propriétaire de cinquième génération intégrant un moteur de profondeur, un processeur ISP, un DSP, des accélérateurs IA dédiés et un ARM quadricœur. Les spécifications annoncées : champ de vision de 120x100°, 60 images par seconde à 1280x960, portée minimale inférieure à 15 cm en pleine résolution, portée maximale supérieure à 10 mètres, indice IP65 en standard sur chaque unité, connectivité GMSL2 et USB-C avec synchronisation matérielle. RealSense revendique une qualité de profondeur deux fois supérieure à sa génération précédente et une réduction du bruit doublée. À la livraison, le traitement de profondeur amélioré et la détection de personnes fonctionneront en bêta directement sur le SoC, sans charge CPU hôte. Des capacités supplémentaires, dont l'odométrie visuo-inertielle (VIO), la génération de grille d'occupation, la calibration automatique et la détection de visages, seront ajoutées via mises à jour SDK après disponibilité générale. Le D585 Pro cible deux limitations structurelles des caméras de profondeur actuelles en robotique : la plage proche et la dépendance au calcul hôte. En descendant à moins de 15 cm en pleine résolution, RealSense revendique un avantage de 2,5x sur le concurrent le plus proche, sans le nommer, ce qui ouvre des cas d'usage jusqu'ici difficiles à couvrir avec un seul capteur : picking en bac, inspection à courte portée, scan de rayonnages denses. Le flux RGB dual synchronisé, deux flux 30 FPS couleur et profondeur fusionnés sur caméra sans overhead CPU, est directement pertinent pour les pipelines VLA dont dépendent des systèmes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui requièrent une perception couleur-profondeur synchronisée. Le modèle logiciel évolutif, où de nouvelles capacités arrivent par SDK sans remplacement matériel, est un changement de paradigme commercial notable dans un secteur où les cycles de qualification hardware sont longs et coûteux pour les intégrateurs. RealSense est une marque historiquement liée à Intel, qui avait progressivement retiré ses investissements dans la perception 3D avant de céder l'activité. La société s'est repositionnée sous direction indépendante, avec Nadav Orbach comme CEO. Elle évolue dans un marché sous forte pression concurrentielle : Luxonis (OAK-D), Orbbec, Stereolabs (ZED X), et des acteurs industriels comme Photoneo ou SICK occupent des segments adjacents. La promesse d'un capteur unique couvrant 15 cm à 10 m, utilisable en intérieur comme en extérieur à 60 FPS avec IA embarquée, est techniquement ambitieuse. Aucun partenaire de déploiement n'a été nommé publiquement à ce stade, et les performances annoncées reposent sur des données fabricant non validées par des tiers indépendants. La livraison effective au premier trimestre 2027 constituera le vrai test de maturité de la plateforme.

InfrastructureOpinion
1 source
Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision
819arXiv cs.RO 

Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision

Des chercheurs ont publié le 23 juin 2026 une étude comparative systématique (arXiv:2606.18594) évaluant quatre types d'espaces d'action en apprentissage par renforcement (RL) pour la manipulation robotique visuelle : l'incrément de pose, la vitesse de pose, l'incrément de position articulaire, et la vitesse articulaire. Les politiques ont été entraînées en simulation puis déployées sur robot réel via transfert sim-to-réel, sur deux tâches benchmark : la saisie d'objet et la poussée d'objet. Résultat principal : l'espace d'action en vitesse articulaire (joint velocity) surpasse les trois autres alternatives, aussi bien en fluidité de mouvement qu'en performance finale sur les deux tâches testées. Ce résultat a une portée pratique directe pour les ingénieurs qui conçoivent des systèmes de manipulation autonome. Le choix de l'espace d'action est une décision d'architecture souvent sous-documentée dans la littérature RL appliquée, et les praticiens se retrouvent fréquemment à tâtonner empiriquement. En démontrant que la vitesse articulaire favorise à la fois la sécurité (mouvements plus lisses, moins de à-coups) et la performance sur des tâches visuelles, l'étude fournit une recommandation actionnable. Elle confirme aussi que le gap sim-to-réel dépend non seulement de la politique apprise, mais de la représentation même des actions, un levier souvent négligé dans les pipelines de transfert. Pour les intégrateurs travaillant avec des bras industriels ou des cobots, cette granularité de contrôle peut directement influer sur la durée de vie mécanique et la robustesse opérationnelle. L'étude s'inscrit dans un courant de recherche croissant sur la robustesse du transfert sim-to-réel pour la manipulation visuelle, aux côtés de travaux sur les politiques visuomotrices à base de transformeurs (VLA) comme pi-0 de Physical Intelligence ou les approches diffusion-policy popularisées par Columbia et Toyota Research Institute. Contrairement à ces méthodes qui s'intéressent à l'architecture du modèle, ce papier intervient en amont, au niveau du signal de commande lui-même. Les auteurs annoncent des recommandations pratiques pour le choix d'espace d'action selon le contexte (simulation seule ou déploiement réel), ce qui en fait une référence méthodologique utile pour les équipes démarrant un projet RL sur hardware.

RecherchePaper
1 source
Adaptateur de réseau de neurones inversible pour la correspondance de flux en une étape dans la manipulation robotique
820arXiv cs.RO 

Adaptateur de réseau de neurones inversible pour la correspondance de flux en une étape dans la manipulation robotique

Des chercheurs ont soumis fin juin 2026 sur arXiv (2606.19194) un adaptateur neuronal invertible pour la manipulation robotique dextère. La méthode repose sur un flow matching contraint dans un espace latent invertible, ce qui ramène la génération d'actions à une seule passe d'inférence, contre de multiples étapes pour les politiques de flow matching itératif classiques. Conditionné sur des entrées visuelles, linguistiques et proprioceptives, l'adaptateur réduit la latence moyenne des modèles VLA de 110 ms à 61 ms, soit un gain de 44 %, sans dégradation mesurée de la précision sur les benchmarks de manipulation testés. Cette réduction n'est pas marginale : à 110 ms par cycle, un VLA plafonne à moins de 10 Hz, fréquence insuffisante pour les tâches de manipulation en boucle fermée nécessitant une haute réactivité. Descendre à 61 ms rapproche ces modèles de conditions d'utilisation industrielle réelle, notamment pour des effecteurs devant s'adapter à une variabilité de pièces ou de positions. Point distinctif de l'approche : elle préserve la stabilité de la prédiction d'actions là où les méthodes de distillation one-step existantes, comme les consistency models ou certaines variantes DDIM, introduisent généralement une dégradation de précision. Les résultats sur benchmarks de simulation se situent à parité ou au-dessus de l'état de l'art sur un large éventail de tâches. Le flow matching s'est imposé en robotique embarquée via des modèles comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui ont démontré que la latence itérative restait un goulot d'étranglement à l'inférence. Le problème du passage à une seule étape est documenté depuis les travaux sur Consistency Policy ; l'approche proposée ici le contourne par l'invertibilité de l'espace latent plutôt que par distillation directe. Il convient de noter que l'article est un preprint non relu par les pairs et que les conditions des expériences réelles (type de robot, nature des tâches, variabilité de scènes) ne figurent pas dans l'abstract disponible, ce qui limite la portée des conclusions. Une validation sur des architectures VLA open-source telles qu'OpenVLA ou Octo constituerait la suite logique pour la communauté.

RechercheOpinion
1 source
MagicSim : une infrastructure unifiée pour l'interaction incarnée et exécutable
821arXiv cs.RO 

MagicSim : une infrastructure unifiée pour l'interaction incarnée et exécutable

Des chercheurs ont déposé en juin 2026 sur arXiv (2606.17511) MagicSim, une infrastructure de simulation conçue pour unifier dans un seul runtime déterministe les couches de contrôle, de compétences et de planification jusqu'ici traitées séparément. L'architecture repose sur un processus de décision de Markov (MDP) partagé et des spécifications YAML qui découplent le contenu des scènes, le comportement des objets et l'exposition aux agents. À partir de ces définitions, le système génère automatiquement des environnements variés couvrant différentes familles de tâches, régimes de physique, capteurs et morphologies robotiques, tous exécutables dans une même boucle reset-step. Le pipeline central suit la chaîne Commande-Compétence-Planificateur-Robot-Enregistrement : les commandes haut niveau sont instanciées comme des actions robotiques réelles, non comme des éditions directes d'état côté simulateur. Une seule définition de tâche supporte trois usages simultanés : évaluation benchmark et apprentissage par renforcement (RL), collecte automatique de trajectoires via une interface autocollect, et interaction directe avec des agents ou des VLM (Vision-Language Models). L'enjeu central que MagicSim cherche à résoudre est désigné dans la littérature sous le terme "magic actions" : dans la plupart des pipelines existants, les simulateurs trichent en éditant directement l'état du monde plutôt qu'en exécutant des mouvements robotiques réels. Cette pratique, commode pour générer des données d'entraînement, brise le transfert sim-to-real car les trajectoires produites ne correspondent pas à ce qu'un robot physique peut accomplir. En ancrant chaque commande haut niveau dans une pile d'exécution complète, MagicSim génère des trajectoires multimodales structurées qui alignent supervision linguistique, représentations d'action, représentations visuelles et géométriques, et statut de la tâche sur l'épisode réellement exécuté. Pour les équipes développant des VLA à grande échelle (pi0 de Physical Intelligence, GR00T N2 de NVIDIA), la capacité à produire automatiquement des données cohérentes entre simulation et exécution représente un levier direct sur la scalabilité des pipelines de données. Ce travail s'inscrit dans une tentative de consolidation d'un paysage de simulation fragmenté. Les infrastructures concurrentes incluent Isaac Lab de NVIDIA, Genesis, SAPIEN et RoboSuite, chacune optimisée pour un sous-ensemble du workflow : physique haute fidélité, benchmark standardisé, ou collecte de données. MagicSim se positionne comme une alternative unifiée, avec comme argument différenciant l'interface agent/VLM intégrée dès la spécification de tâche. La publication ne mentionne ni déploiement open-source immédiat ni partenariat industriel annoncé, et les résultats restent à ce stade des démonstrations sur environnements internes. La validation sur des benchmarks sectoriels établis comme LIBERO, MetaWorld ou RLBench sera le prochain critère de maturité.

RechercheOpinion
1 source
Vérification visuelle : pilotage à l'inférence et amélioration autonome des politiques
822arXiv cs.RO 

Vérification visuelle : pilotage à l'inférence et amélioration autonome des politiques

Des chercheurs ont publié le 17 juin 2026 un preprint arXiv (2606.18247) présentant VERITAS, un cadre de type générateur-vérificateur destiné aux politiques robots généralistes. Le principe : une politique robot pré-entraînée joue le rôle de "générateur" et est couplée à un "vérificateur visuel" sans gradient qui évalue les actions produites au moment de l'inférence, c'est-à-dire pendant le déploiement réel. Les résultats rapportés indiquent que ce steering à l'inférence surpasse systématiquement la politique généraliste de base sans nécessiter de données de démonstration supplémentaires. Plus significatif encore, les trajectoires auto-générées et validées par le vérificateur servent ensuite de supervision pour un fine-tuning offline : selon les auteurs, ce post-training atteint une efficacité comparable à celle obtenue avec des démonstrations d'experts humains, et ce sans aucune intervention humaine dans la boucle. L'enjeu industriel est direct : l'un des freins majeurs au déploiement à grande échelle de robots généralistes est le coût d'annotation humaine pour maintenir ou améliorer les performances après mise en service. VERITAS propose un mécanisme d'auto-amélioration autonome où le robot apprend de sa propre pratique, ce qui, si les résultats se confirment sur du matériel physique à l'échelle, réduirait structurellement le coût d'intégration pour les opérateurs industriels et les intégrateurs. La distinction entre "steering à l'inférence" (amélioration immédiate sans retraining) et "amélioration offline" (fine-tuning asynchrone sur rollouts vérifiés) est pertinente pour les décideurs B2B qui doivent planifier des cycles de mise à jour. Il faut cependant noter que le papier ne documente pas de métriques de déploiement sur des sites de production réels, ce qui tempère les conclusions. Cette approche s'inscrit dans une tendance forte issue des LLMs : transposer le "test-time compute scaling" au domaine robotique. Des politiques généralistes comme pi-0 (Physical Intelligence), OpenVLA ou RT-2 (Google DeepMind) ont démontré la faisabilité du transfert multi-tâches, mais butent sur la dégradation en conditions réelles non vues à l'entraînement. VERITAS tente de combler ce fossé sans recourir à des méthodes coûteuses comme DAgger ou RLHF classique. Aucun partenaire industriel ni calendrier de validation sur plateforme physique n'est mentionné dans le preprint ; les prochaines étapes attendues sont une évaluation sur robots physiques (humanoïdes ou manipulateurs) dans des environnements non contrôlés.

RechercheOpinion
1 source
RLRC : l'apprentissage par renforcement au service de la récupération des modèles vision-langage-action compressés
823arXiv cs.RO 

RLRC : l'apprentissage par renforcement au service de la récupération des modèles vision-langage-action compressés

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2506.17639) RLRC, un pipeline de compression en trois étapes pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique complexe. Face au constat que ces architectures multimodales dépassent généralement plusieurs milliards de paramètres et génèrent des latences d'inférence incompatibles avec un déploiement embarqué, la méthode combine élagage structurel (structured pruning), récupération des performances par fine-tuning supervisé (SFT) et apprentissage par renforcement (RL), puis quantification. L'étape RL intègre un warm-up du critique et une régularisation par perte de clonage comportemental (BC loss) pour stabiliser l'entraînement et préserver le comportement de la politique. Les mesures sur plusieurs architectures VLA indiquent une réduction mémoire jusqu'à 8x, un gain d'inférence de 2,3x et un taux de succès aux tâches maintenu au niveau du modèle non compressé. Les auteurs rapportent que RLRC surpasse les baselines de compression existantes, bien que ces résultats restent à ce stade auto-déclarés dans un preprint. L'enjeu est concret pour les intégrateurs robotiques : les VLA de nouvelle génération comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les dérivés d'OpenVLA requièrent aujourd'hui un GPU serveur pour l'inférence temps réel, ce qui complique leur embarquement sur un robot mobile ou un manipulateur autonome. RLRC propose une voie pour franchir ce seuil matériel sans dégrader les capacités de manipulation. L'apport différenciant est l'utilisation du RL en phase de récupération post-élagage : contrairement à un SFT seul, il corrige les dégradations comportementales induites par la compression, notamment sur des tâches à longue séquence ou à faible marge d'erreur. Le message implicite est que le goulot d'étranglement du déploiement VLA n'est plus uniquement le sim-to-real, mais aussi le compute-to-edge. Les VLA se sont imposés comme standard de facto pour la manipulation généraliste depuis RT-2 de Google DeepMind en 2023, et leur adoption s'est accélérée avec Pi-0 de Physical Intelligence en 2024. La compression de ces modèles reste un angle peu exploré : la littérature sur le pruning et la quantification cible majoritairement les LLM conversationnels comme LLaMA ou Mistral, pas les architectures action-conditionnées. RLRC vise explicitement les plateformes embarquées (NPU, SoC robotique) pour affranchir le déploiement d'une dépendance cloud. Un site projet est disponible à rlrc-vla.github.io, mais aucun partenariat industriel ni calendrier de commercialisation n'est annoncé à ce stade : il s'agit d'un résultat de recherche académique, pas d'un produit expédié.

UELes laboratoires européens (INRIA, CEA-List) et équipes R&D travaillant sur le déploiement embarqué de VLA pourraient appliquer ces techniques de compression, mais aucun acteur français ni réglementation européenne n'est directement impliqué.

IA physiqueOpinion
1 source
Eno, le robot humanoïde qui vise à devenir la machine polyvalente de chaque entreprise
824Interesting Engineering 

Eno, le robot humanoïde qui vise à devenir la machine polyvalente de chaque entreprise

Genesis AI a présenté Eno, son premier robot à usage général, en juin 2026. La machine abandonne la forme humanoïde bipède au profit d'une base à roues surmontée d'une colonne télescopique ajustable en hauteur, capable de se replier en configuration compacte lors des phases d'inactivité. Ses mains robotiques reproduisent la morphologie et la fonction de mains humaines, afin de permettre l'utilisation d'outils standards dans des espaces déjà conçus pour des opérateurs humains. Son système de contrôle est GENE, le modèle de fondation robotique développé en interne, présenté comme capable de gérer la planification de tâches longues, l'adaptation au contexte et la mémorisation entre opérations. Un écran embarqué optionnel affiche en temps réel le raisonnement et les intentions du robot. Les premiers déploiements clients sont annoncés avant fin 2026, en fabrication, logistique et laboratoires, avec une extension ultérieure à l'hôtellerie, à la santé puis au grand public. Genesis AI a levé 105 millions de dollars en financement de démarrage, avec Eric Schmidt, ancien PDG de Google, parmi ses investisseurs déclarés. Le choix d'une base roulante plutôt que bipède représente un compromis délibéré : on sacrifie la polyvalence locomotrice pour la fiabilité mécanique dans des environnements industriels à sols plats et structurés, là où l'essentiel des déploiements initiaux est ciblé. Les mains humanoïdes répondent à un problème de compatibilité concret, puisque les postes de travail et les outils industriels sont dimensionnés pour des mains humaines. Sur le plan logiciel, GENE s'inscrit dans la catégorie des VLA (Vision-Language-Action models) avec l'ambition de piloter des tâches longues en autonomie, ce que le secteur cherche précisément à démontrer à grande échelle depuis deux ans avec des résultats encore inégaux. L'affichage du raisonnement en temps réel est une réponse directe aux exigences d'acceptabilité et de sécurité en environnement mixte humain-robot. Il faut cependant souligner qu'aucun chiffre de performance validé indépendamment n'accompagne l'annonce : payload, temps de cycle et taux de fiabilité sur lignes réelles restent inconnus. Eno est à ce stade une annonce, pas un produit en production. Genesis AI entre dans une course déjà bien engagée. Figure AI déploie ses robots Figure 02 sur les lignes de montage de BMW en Caroline du Nord ; Tesla vise la production de masse d'Optimus pour 2026 ; Agility Robotics teste Digit dans les entrepôts d'Amazon ; Physical Intelligence développe Pi-0 comme modèle de fondation généraliste ; NVIDIA fournit GR00T N2 et l'infrastructure de simulation Isaac Lab à l'ensemble de l'écosystème. Genesis AI se positionne avec une approche de co-conception : hardware, software et IA développés ensemble depuis l'origine plutôt qu'intégrés séquentiellement, argument central du discours de Zhou Xian, co-fondateur et PDG. Avec 105 millions de dollars de seed et un investisseur aussi visible qu'Eric Schmidt, la société dispose des ressources pour tenir ses délais. Les déploiements pilotes annoncés avant fin 2026 constitueront le premier test réel de cette promesse d'intégration systémique.

HumanoïdesOpinion
1 source
Genesis AI lance Eno, son robot polyvalent
825Robotics Business Review 

Genesis AI lance Eno, son robot polyvalent

Genesis AI a dévoilé le 16 juin 2026 Eno, son robot à usage général, accompagné de GENE, le modèle de fondation développé en interne pour piloter le système. Contrairement aux approches humanoïdes bipedaleset bipèdes dominantes dans le secteur, Eno repose sur une base roulante surmontée d'une colonne articulée dont la hauteur est ajustable en temps réel, permettant au robot de se replier pour le stockage ou d'étendre sa portée selon la tâche. Ses bras sont équipés de mains propriétaires à cinq doigts conçues pour manipuler des outils et objets calibrés pour des utilisateurs humains. Le robot intègre en option un écran affichant en temps réel l'état cognitif du système, c'est-à-dire les intentions et raisonnements en cours, un choix de design rare dans l'industrie. La société, basée à San Carlos en Californie et financée à hauteur de 105 millions de dollars en seed en 2025, prévoit de lancer la production et les premiers déploiements clients d'ici fin 2026, en ciblant en priorité les secteurs industriels (manufacturing, logistique, laboratoires), avant d'adresser l'hôtellerie, les hôpitaux, puis le grand public. L'annonce est notable non pas tant pour les performances revendiquées que pour le positionnement architectural choisi. En optant pour une base mobile sur roues plutôt que la locomotion bipedaleet bipède, Genesis AI fait le pari de la fiabilité opérationnelle sur des sols industriels plats plutôt que de la polyvalence locomotrice, ce qui réduit la complexité mécanique et le risque de chute tout en simplifiant l'intégration en entrepôt et en laboratoire. La transparence cognitive via l'écran intégré est un signal adressé aux opérateurs et intégrateurs, chez qui la confiance dans les décisions autonomes du robot reste un frein réel au déploiement. GENE est présenté comme un système capable de gérer des tâches longues et séquentielles en raisonnant sur le contexte, sans se limiter à des commandes isolées, ce qui correspond à la catégorie des VLA (Vision-Language-Action models) appliqués à la manipulation. Les affirmations de "précision au millimètre" et de "manipulation au niveau humain" restent à valider indépendamment : aucune métrique de benchmark externe n'est citée dans l'annonce. Genesis AI arrive sur un marché déjà très occupé. Figure AI (Figure 03), Physical Intelligence (Pi-0), Boston Dynamics (Atlas), Agility Robotics (Digit) et Tesla (Optimus Gen 3) sont déjà en phase de déploiement pilote ou de production limitée. Nvidia pousse GR00T N2 comme socle commun pour les VLA humanoïdes. Dans ce contexte, Eno se distingue par son format non humanoïde et son interface de transparence, deux paris qui tranchent avec la convergence du secteur vers le robot bipède anthropomorphe. La co-conception corps-cerveau revendiquée par Genesis, où le hardware et le modèle GENE auraient été développés conjointement dès l'origine, reste une tendance lourde que l'on retrouve chez 1X Technologies ou Apptronik. Les prochaines étapes annoncées restent vagues : "déploiements ciblés" fin 2026 sans noms de clients ni volumes. L'annonce est pour l'instant une présentation publique de concept, pas un produit en livraison.

IA physiqueOpinion
1 source
Modélisation unifiée mouvement-action pour l'apprentissage sur robots hétérogènes
826arXiv cs.RO 

Modélisation unifiée mouvement-action pour l'apprentissage sur robots hétérogènes

Des chercheurs ont déposé sur arXiv (arXiv:2606.16917, juin 2026) le modèle UMA (Unified Motion-Action), une architecture d'apprentissage robotique qui place les trajectoires 3D de mouvement d'objets comme interface commune entre contrôle visuomoteur et modélisation de dynamiques. Plutôt que de traiter séparément les actions du robot et l'évolution de l'environnement, UMA les co-modélise sous un objectif génératif masqué, inspiré des architectures MAE (Masked Autoencoders): le motif de masquage détermine à la fois le régime de supervision pendant le pré-entraînement et le mode d'inférence au déploiement. Le modèle est pré-entraîné sur un mélange de démonstrations robotiques, de vidéos humaines et de données simulées, sans annotations manuelles d'instructions de tâches. Un objectif contrastif dissocie l'intention de tâche de la géométrie de scène. Au déploiement, les mêmes paramètres pré-entraînés supportent trois modes distincts: contrôle visuomoteur conditionné par le mouvement, modélisation dynamique, et adaptation few-shot à de nouvelles tâches. Les auteurs rapportent des performances supérieures aux baselines spécialisées sur chacun de ces modes. L'apport principal est de résoudre le problème structurel de l'hétérogénéité des données robotiques. Combiner démonstrations d'un bras industriel, vidéos de mains humaines et scènes simulées dans un entraînement multi-tâche exige habituellement des annotations coûteuses ou des têtes de sortie spécialisées par domaine. UMA contourne cela: les trajectoires 3D d'objets fonctionnent comme un "lingua franca" représentationnel, indépendant de la morphologie du robot ou de la source des données. La technique de "hindsight relabeling" permet d'annoter rétrospectivement des contextes de mouvement depuis les données brutes, sans intervention humaine. Pour un intégrateur ou un COO industriel, c'est concret: adapter un modèle généraliste à une nouvelle ligne en quelques démonstrations réduit sensiblement les coûts de déploiement. Nuance à souligner: il s'agit d'un preprint sans revue par les pairs, et les benchmarks présentés mériteraient une validation indépendante sur plateformes physiques réelles. Cette publication s'inscrit dans la compétition autour des modèles Vision-Langage-Action (VLA) généralisables. Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Figure AI (Helix, déployé sur le Figure 03) cherchent tous à entraîner des politiques robotiques sur des données hétérogènes à grande échelle, avec le même défi partagé: comment exploiter des vidéos humaines non labellisées ou des données simulées sans annotation prohibitive. UMA propose une réponse architecturale via le mouvement 3D d'objets comme superviseur implicite universel, un angle distinct des approches VLA qui s'appuient sur le langage comme pivot sémantique. La validation sur benchmarks ouverts tels que LIBERO ou Open-X Embodiment, absente du preprint, sera déterminante pour évaluer la généralisation réelle de l'approche.

RechercheOpinion
1 source
CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines
827arXiv cs.RO 

CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines

Des chercheurs ont soumis sur arXiv (2601.04061v2, janvier 2026) un framework appelé CLAP, pour Contrastive Latent Action Pretraining, conçu pour entraîner des modèles Vision-Language-Action (VLA) généralistes à partir de vidéos humaines non étiquetées. Le pipeline repose sur deux étapes: un module Act-VAE construit d'abord un vocabulaire d'actions exécutables à partir de trajectoires robotiques existantes, puis un apprentissage contrastif aligne les transitions visuelles extraites de vidéos humaines sur ce vocabulaire latent, pseudo-étiquetant ainsi ces vidéos sans collecte téléopérée supplémentaire. Sur cette base, CLAP-NTP est entraîné comme VLA autorégressif combinant démonstrations robotiques réelles et vidéos humaines étiquetées. Pour le déploiement, CLAP-RF ajoute une tête à flux rectifié (Rectified Flow) permettant la prédiction de chunks d'actions continus à faible latence, couplée à une régularisation dite Knowledge Matching qui préserve les connaissances sémantiques préentraînées lors du fine-tuning sur domaine cible. L'obstacle central des VLA généralistes reste la rareté des données robotiques étiquetées face à l'abondance de vidéos humaines disponibles en ligne. Les approches antérieures de type Latent Action Models tentaient d'exploiter ces vidéos mais encodaient du bruit visuel plutôt que des compétences de manipulation réelles, un problème qualifié d'enchevêtrement visuel (visual entanglement). CLAP contourne cette limitation en ancrant l'espace latent sur des trajectoires physiquement fondées via l'apprentissage contrastif, sans reconstruire l'apparence. Pour les intégrateurs industriels, la promesse concrète est de réduire le coût de collecte téléopérée, estimé à plusieurs milliers de dollars par heure, tout en améliorant la généralisation à de nouveaux objets sans démonstrations robotiques exhaustives. Les résultats expérimentaux rapportés montrent de bonnes performances face aux baselines comparatives, mais la validation externe reste à confirmer. Le domaine des VLA est en pleine effervescence depuis l'émergence de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et Helix (Figure AI), tous confrontés à la même pénurie de données étiquetées exploitables. Google DeepMind a exploré des voies similaires avec des travaux comme UniSim. CLAP se distingue en proposant une approche plus physiquement ancrée que les méthodes purement génératives ou reconstructrices. Ce preprint n'a pas encore été évalué par les pairs et n'annonce aucun déploiement en production. Les prochaines étapes naturelles seraient une validation sur un éventail plus large de plateformes robotiques ainsi qu'une comparaison systématique avec les Diffusion Policies, méthodes actuellement dominantes sur les benchmarks Open X-Embodiment.

IA physiqueActu
1 source
Politique de diffusion spatialement conditionnée : manipulation précise et robuste avec une seule caméra RGB
828arXiv cs.RO 

Politique de diffusion spatialement conditionnée : manipulation précise et robuste avec une seule caméra RGB

Des chercheurs ont publié le 14 juin 2026 sur arXiv (arXiv:2606.14535) une méthode d'apprentissage par imitation appelée SCDP (Spatially Conditioned Diffusion Policy), conçue pour permettre à un bras manipulateur d'exécuter des tâches de précision à partir d'une seule caméra RGB fixe, sans caméra embarquée sur le poignet. L'architecture repose sur deux composants : un encodeur visuel multi-échelle qui extrait à la fois le contexte global de la scène et les détails fins, et un module de conditionnement spatial qui, à chaque étape de la boucle de diffusion, vient échantillonner des features ponctuelles le long des trajectoires intermédiaires prédites pour l'effecteur. L'idée centrale est d'utiliser ces trajectoires d'effecteur comme ancres d'attention visuelle, orientant automatiquement le réseau vers les zones de la scène pertinentes pour la tâche en cours. En simulation, SCDP surpasse les baselines monoculaires de référence et atteint des performances comparables aux configurations multi-caméras. En conditions réelles, le système démontre à la fois une manipulation précise et une robustesse aux distracteurs visuels. L'enjeu industriel est concret : la caméra de poignet est aujourd'hui le standard de facto dans les systèmes d'imitation learning déployés (ACT, Diffusion Policy, Pi-0 de Physical Intelligence), précisément parce qu'elle fournit la vue locale nécessaire à la manipulation fine. Supprimer cette contrainte réduit le coût matériel, simplifie la calibration et facilite le retrofit sur des cellules industrielles existantes. Si les performances annoncées se confirment hors laboratoire, cela lève un frein concret à la commercialisation de bras manipulateurs en environnement non contrôlé. Il convient toutefois de noter que les expériences réelles restent qualitatives dans le papier : pas de métriques de taux de succès sur un benchmark standardisé, ni de volume de déploiement cité. SCDP s'inscrit dans la vague des politiques de diffusion visuomotrices initiée par Diffusion Policy (Chi et al., 2023) et prolongée par des travaux comme 3D Diffusion Policy ou Pi-0. La question de la vue unique est un problème ouvert : d'autres approches comme UniMa ou SpatialVLA tentent de compenser l'absence de vue locale par des représentations 3D implicites ou des modèles vision-langage-action (VLA). Face à Physical Intelligence (Pi-0, financement de 400 M$), Figure AI ou 1X Technologies qui misent sur des stacks multi-capteurs, l'angle "single camera" de SCDP pourrait séduire les intégrateurs contraints en budget ou en volume de données. La prochaine étape logique serait une évaluation sur des benchmarks partagés comme RoboMimic ou LIBERO pour permettre une comparaison directe.

IA physiqueActu
1 source
TRACE : mémoire causale guidée par trajectoire pour l'imitation visuomotrice à indices différés
829arXiv cs.RO 

TRACE : mémoire causale guidée par trajectoire pour l'imitation visuomotrice à indices différés

TRACE (TRAjectory-routed Causal Evidence) est un framework mémoire pour les politiques visuomotrices d'imitation, présenté dans un preprint arXiv publié en juin 2026 (arXiv:2606.14551) par une équipe de l'Université Zhejiang. Le problème central : lorsqu'un robot opère en autonomie sur une séquence longue, certains indices visuels critiques (couleur d'un objet, panneau de direction, marquage au sol) disparaissent du champ de vision avant que la décision correspondante doive être prise. Ces situations dites de "preuve différée" (delayed-evidence) créent une ambiguïté directe : deux observations visuellement identiques peuvent exiger des actions opposées selon ce que le robot a perçu plus tôt. TRACE y répond en maintenant une mémoire latente de taille fixe, indexée non par le temps brut ni par des étiquettes de tâche fournies manuellement, mais par des "signatures de trajectoire" (path signatures), des descripteurs compacts et ordonnés de la trajectoire d'état cinématique du robot. Ces signatures servent de clés pour écrire et récupérer les preuves visuelles stockées au moment où l'indice était encore visible. Le système s'intègre via des adaptateurs légers sans modifier le backbone, la tête d'action ni l'objectif d'imitation. L'enjeu pratique est réel pour les systèmes de manipulation longue durée. La quasi-totalité des politiques visuomotrices actuelles, qu'elles soient basées sur des Diffusion Policies, des transformers ou des modèles VLA (Vision-Language-Action), supposent implicitement que l'observation courante constitue un état suffisant pour le contrôle. TRACE démontre expérimentalement, sur des tâches réelles de manipulation avec des points de branchement visuellement ambigus, que cette hypothèse échoue dès qu'une décision dépend d'un indice passé. Les résultats surpassent les baselines concurrentes, dont les politiques à historique court et les mémoires récurrentes classiques (LSTM, GRU), sur deux métriques : sélection correcte de branche et taux de succès global. La mémoire à taille bornée évite par ailleurs l'accumulation qui pénalise les architectures à attention sur contexte long lors d'épisodes étendus. Ce travail s'inscrit dans un débat actif sur la mémoire épisodique pour robots manipulateurs. Les approches existantes incluent les RNN embarquées dans la politique, les mécanismes d'attention sur l'historique visuel exploités dans RT-2 et pi-0 (Physical Intelligence), et les Memory-Augmented Neural Networks. TRACE se distingue par son découplage entre l'indice visuel (stocké comme vecteur latent) et la clé de récupération (signature cinématique pure), ce qui le rend robuste aux variations d'apparence tout en restant sensible au chemin parcouru. Il s'agit d'une contribution de recherche fondamentale sans déploiement industriel annoncé ; les suites naturelles incluent l'intégration à des politiques de référence comme ACT ou Diffusion Policy, et la validation sur des horizons plus longs en environnement non structuré.

RechercheOpinion
1 source
L'équipe Tsinghua-Harvard développe Acorn, un robot « zéro-données » qui apprend par instinct, sans entraînement
830Pandaily 

L'équipe Tsinghua-Harvard développe Acorn, un robot « zéro-données » qui apprend par instinct, sans entraînement

La startup Acorn Robot, cofondée par le Dr. Jiang Yao (doctorat en génie mécanique à Tsinghua, postdoctorat en neurosciences à Harvard), a présenté un robot de manipulation capable d'apprendre des tâches physiques sans aucune donnée d'entraînement préalable, sans trajectoires de démonstration et sans modèle visuel. Le système repose sur un modèle de décision embarqué baptisé "Natus" (pour "instinct-driven behavioral emergence"), qui fonctionne par essais et erreurs en temps réel sur le matériel physique. Le hardware est délibérément minimaliste : une pince industrielle parallèle à 1 degré de liberté, équipée de capteurs tactiles sur ses deux mâchoires en V, sans caméra externe ni connexion cloud. La démonstration présentée montre le robot parvenir à saisir une carte bancaire posée à plat sur une table, un défi reconnu pour les préhenseurs industriels conventionnels, en utilisant une mâchoire comme levier contre le bord de la carte et la surface de la table comme point d'appui. Le système requiert typiquement huit à neuf tentatives pour converger vers cette stratégie. Selon la société, une preuve de concept a été validée chez l'un des principaux fabricants de cosmétiques en Chine, avec un déploiement à l'échelle annoncé. La cible commerciale visée est la fabrication flexible B2B, où l'adaptabilité prime sur le volume de données. L'approche représente une rupture philosophique avec le paradigme dominant de la robotique contemporaine, qui s'appuie massivement sur des données de démonstration, des modèles vision-langage-action (VLA) et de l'apprentissage par simulation. Le Dr. Jiang soutient que les forces de contact imprévisibles et les variations mécaniques entre robots individuels rendent les approches data-driven structurellement fragiles, décrivant la dépendance aux données comme un "puits sans fond impossible à combler" et affirmant qu'il n'existe pas de modèle universel, seulement un modèle optimal pour un robot donné. Pour les intégrateurs industriels et les décideurs en fabrication flexible, le claim est potentiellement significatif : un système capable de s'adapter à une nouvelle tâche physique sans pipeline de collecte de données ni infrastructure cloud réduit le coût de déploiement et le délai de mise en service. Il convient toutefois de nuancer : les huit à neuf tentatives annoncées proviennent d'une vidéo de démonstration sélectionnée, les conditions exactes du déploiement cosmétique ne sont pas détaillées, et la distinction entre preuve de concept validée et déploiement industriel à grande échelle reste à préciser. Acorn Robot s'inscrit dans un paysage robotique mondial où l'essentiel des investissements se concentre sur les humanoïdes dotés de VLA à grande échelle : Figure 03 de Figure AI, Optimus Gen 3 de Tesla, pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. L'approche d'Acorn, centrée sur un préhenseur industriel à faible complexité matérielle plutôt que sur une plateforme humanoïde généraliste, repositionne la question de la généralisation robotique au niveau du comportement émergent plutôt que de la capacité de représentation. La startup appartient à une génération de chercheurs sino-américains explorant des alternatives à l'apprentissage supervisé massif, un espace également investigué par des équipes européennes en robotique cognitive, notamment en France et en Suisse. Les prochaines étapes annoncées portent sur l'extension à d'autres scénarios de fabrication flexible, sans calendrier précis communiqué à ce stade.

Chine/AsiePaper
1 source
UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI
831arXiv cs.RO 

UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI

Une équipe de recherche a déposé le 10 juin 2026 le preprint arXiv 2606.10382 décrivant UMI-Bench 1.0, présenté comme le premier benchmark entièrement dédié à l'évaluation en conditions réelles de politiques de manipulation robotique entraînées via l'Universal Manipulation Interface (UMI). Le benchmark cible la manipulation d'objets sur table (tabletop manipulation) et couvre l'intégralité de la chaîne de validation : collecte de données, réinitialisation de scène entre essais, exécution de politique, journalisation des résultats et analyse par facteurs de tâche. Il opère en mode "local-first", c'est-à-dire que les évaluations tournent directement sur robot réel, sans couche de simulation intermédiaire. L'UMI couple observations depuis une caméra montée au poignet, représentation des actions, collecte de démonstrations humaines et déploiement physique, une architecture dont les performances dépendent de la cohérence de chaque maillon. Ce benchmark répond à un problème structurel de l'apprentissage par imitation : l'absence de protocole standardisé conduit chaque équipe à évaluer ses politiques dans des conditions non comparables, ce qui rend la littérature difficile à arbitrer pour un intégrateur ou un décideur industriel. En rendant le processus reproductible et auditable, UMI-Bench permet de mesurer concrètement dans quelle mesure une politique entraînée sur des démonstrations généralise à des configurations physiques inédites, ce que les chercheurs appellent la sim-to-real (ici demo-to-real) generalization. C'est un enjeu central pour les politiques de diffusion (Diffusion Policy) et les VLA (Vision-Language-Action models), dont les performances en démonstration sélectionnée restent difficiles à quantifier sans infrastructure de test commune. L'UMI a été introduit en 2023-2024 par Cheng Chi et al. (Columbia University) comme interface portable de collecte de démonstrations : un opérateur guide un gripper équipé d'une caméra et d'un module de localisation, et les trajectoires servent directement à entraîner des politiques. Le paysage concurrent des benchmarks comprend LIBERO, DROID et le framework LeRobot de Hugging Face, qui proposent leurs propres protocoles mais sans calibration spécifique pour le pipeline UMI. L'étape logique suivante serait l'intégration de modèles fondationnels comme pi-0 (Physical Intelligence) ou OpenVLA dans ce protocole de référence, et l'extension à des tâches multi-étapes.

RecherchePaper
1 source
OMG : génération de mouvements omnimodaux pour le contrôle généraliste des humanoïdes
832arXiv cs.RO 

OMG : génération de mouvements omnimodaux pour le contrôle généraliste des humanoïdes

Une équipe de chercheurs a déposé le 10 juin 2026 sur arXiv (ref. 2606.10340) un système baptisé OMG, Omni-Modal Motion Generation, conçu pour le contrôle whole-body généraliste des robots humanoïdes. L'architecture adopte une structure hiérarchique inspirée du système moteur biologique : un module supérieur de génération de mouvement basé sur la diffusion joue le rôle de "cerveau" planificateur, tandis qu'un contrôleur de suivi réactif bas niveau fait office de "cervelet". Ce cerveau est conditionnable simultanément sur du langage naturel, des signaux audio et des mouvements de référence humains. Le système s'appuie sur un pipeline de curation, filtrage et labellisation de données conçu pour couvrir un large spectre de comportements whole-body. Les auteurs revendiquent des performances state-of-the-art sur les benchmarks de contrôle humanoïde généraliste, ainsi qu'un comportement de scaling en fonction de la taille du modèle, deux propriétés clés pour qui veut construire un foundation model robotique. L'intérêt de OMG tient à son traitement simultané de deux limitations structurelles du domaine : d'un côté, les politiques spécialisées actuelles exigent un reward engineering intensif et ne généralisent pas au-delà de quelques skills ; de l'autre, les motion trackers existants peinent à intégrer de nouvelles modalités d'entrée sans refonte architecturale. En conditionnant un unique modèle sur des entrées multimodales extensibles, le papier prolonge la logique des VLA (Vision-Language-Action models) vers la génération de mouvement full-body. Si les résultats survivent à l'évaluation externe, cela plaiderait pour qu'un seul modèle généraliste remplace plusieurs politiques spécialisées par déploiement, un argument commercial direct pour les intégrateurs. Point de vigilance : il s'agit d'un preprint non évalué par les pairs, sans données de déploiement physique publiées à ce stade. Le papier s'inscrit dans une course active autour du contrôle humanoïde généraliste. Physical Intelligence a publié Pi-0 et Pi-0.5 autour d'architectures diffusion-based, NVIDIA a présenté GR00T N2 comme backbone transformer pour whole-body control, et Figure déploie Helix sur ses plateformes H1/H2 dans des environnements d'entrepôt. L'abstract ne mentionne ni institution d'origine ni robot physique cible, ce qui rend la comparaison directe avec ces systèmes impossible à ce stade. Les prochaines étapes naturelles seraient une soumission à CoRL ou RSS 2026 et une validation sur hardware réel, deux éléments absents de la publication actuelle.

IA physiqueOpinion
1 source
HandCept : un cadre de fusion visuo-inertielle pour la proprioception précise des mains dextériques
833arXiv cs.RO 

HandCept : un cadre de fusion visuo-inertielle pour la proprioception précise des mains dextériques

Une équipe de chercheurs a publié sur arXiv en mai 2025 (référence 2505.08213) HandCept, un framework de proprioception visuo-inertielle pour mains dextres robotiques. Le système combine une caméra RGB-D montée au poignet et des IMU à 9 axes (accéléromètre, gyroscope, magnétomètre) pour estimer les angles articulaires en temps réel, via un filtre de Kalman étendu (EKF) sans latence ajoutée. Les erreurs d'estimation se situent entre 2° et 4° sur les angles articulaires, sans dérive observable sur la durée, surpassant selon les auteurs les approches purement visuelles ou purement inertielles. L'approche repose sur un apprentissage zero-shot, sans données réelles annotées, rendu possible par un pipeline de rendu photoréaliste haute fidélité sous Blender, publié en open-source sur GitHub. La proprioception, c'est-à-dire la capacité d'une main robotique à connaître précisément la position de ses propres doigts, reste l'un des verrous techniques de la manipulation dextre généraliste. Les encodeurs magnétiques et capteurs de force embarqués dans des mains multi-DOF imposent des contraintes de volume, de câblage et de calibration souvent incompatibles avec un déploiement à l'échelle. HandCept contourne ces limites en s'appuyant sur des capteurs déjà présents dans de nombreuses plateformes humanoïdes ou cobots, et la fusion EKF temps réel réduit le fossé sim-to-real, point critique pour accélérer le déploiement de politiques d'imitation learning ou de VLA (Vision-Language-Action) apprises en simulation. La précision annoncée de 2 à 4° reste toutefois à contextualiser: les résultats sont issus de conditions de laboratoire contrôlées et le papier n'a pas encore été évalué par les pairs. La course à la manipulation dextre s'est intensifiée en 2024-2025 avec des mains à haute densité d'actionneurs chez Figure (Figure 03), Sanctuary AI, Physical Intelligence (pi0), ou encore LEAP Hand côté recherche ouverte. La précision proprioceptive conditionne directement les performances de ces architectures. HandCept reste à ce stade un résultat de laboratoire: les auteurs n'annoncent ni partenaire industriel, ni timeline de commercialisation, ni intégration sur une plateforme humanoïde spécifique. Le pipeline Blender open-sourcé constitue néanmoins une contribution tangible pour la communauté, en facilitant la génération de données synthétiques pour d'autres équipes travaillant sur des architectures similaires sans accès à un système de capture de mouvement coûteux.

RecherchePaper
1 source
Revue des approches de navigation et manipulation robotique avec simulateurs physiques à l'ère de l'IA incarnée
834arXiv cs.RO 

Revue des approches de navigation et manipulation robotique avec simulateurs physiques à l'ère de l'IA incarnée

Un groupe de chercheurs a publié sur arXiv (réf. 2505.01458, version 2, mai 2025) un état de l'art sur l'utilisation des simulateurs physiques pour entraîner des robots à la navigation et à la manipulation dans le cadre de l'IA incarnée (Embodied AI). L'étude analyse comment les moteurs de simulation réduisent le "sim-to-real gap", c'est-à-dire l'écart de performance constaté quand un agent entraîné en simulation est déployé dans le monde réel. Le survey passe en revue les caractéristiques des principaux simulateurs, leurs contraintes matérielles, et propose un inventaire structuré de datasets de référence, métriques d'évaluation et méthodes existantes. Aucun code ou outil nouveau n'est publié: il s'agit d'une contribution bibliographique et méthodologique. Cette revue intervient alors que le sim-to-real gap demeure l'obstacle principal au déploiement industriel de robots humanoïdes et de bras manipulateurs. Entraîner directement sur du matériel réel est coûteux, lent et risqué, ce qui place la simulation au cœur des pipelines de développement des VLA (Vision-Language-Action models) et des systèmes de navigation autonome. En consolidant des propriétés peu documentées des simulateurs, le survey aide ingénieurs et chercheurs à sélectionner l'outil adapté à leurs contraintes hardware sans avoir à faire une veille exhaustive de la littérature. Les simulateurs en compétition dans cet espace incluent Isaac Sim (NVIDIA), MuJoCo (DeepMind/Google), PyBullet, Webots et Genesis, un moteur GPU-natif récent. L'intérêt pour ce type de synthèse est alimenté par l'accélération du secteur: Figure AI, Physical Intelligence (pi zero), Boston Dynamics, Unitree et Agility Robotics multiplient les annonces de déploiements en environnements industriels réels. Ce survey constitue un point d'entrée structuré pour les équipes qui montent leur pipeline sim-to-real en 2025, à condition de ne pas attendre de benchmarks neutres et indépendants: l'évaluation des simulateurs reste largement conduite par leurs propres éditeurs.

RecherchePaper
1 source
VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles
835arXiv cs.RO 

VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles

Des chercheurs ont publié VistaBot, un framework de manipulation robotique ciblant un angle mort des politiques end-to-end actuelles : leur fragilité face aux changements de point de vue de caméra entre entraînement et déploiement. La préprint arXiv 2604.21914, déposée en avril 2026, décrit une architecture en trois modules : estimation de géométrie 4D, synthèse de vue par diffusion vidéo, et planification d'actions en espace latent, sans recalibration de caméra requise au moment du déploiement. Intégré dans deux politiques de référence du domaine, ACT (Action Chunking Transformer) et π₀ (la politique diffusion-based de Physical Intelligence), VistaBot améliore la métrique VGS (View Generalization Score, introduite par les auteurs) de 2,79x par rapport à ACT et de 2,63x par rapport à π₀, en simulation et en environnement réel. Le code et les modèles seront publiés en open source. La dépendance à un point de vue fixe constitue un frein structurel au déploiement des bras manipulateurs en conditions industrielles : une caméra repositionnée ou partiellement obstruée peut invalider un modèle entier sans mécanisme de compensation. VistaBot répond en synthétisant dynamiquement des vues alternatives via un modèle de diffusion vidéo, puis en planifiant les actions dans l'espace latent de ces vues synthétisées, sans recollecte de données depuis le nouvel angle. Pour un intégrateur ou un COO industriel, cela réduit directement le coût de reconfiguration sur ligne. L'introduction du VGS comble également un vide méthodologique : le domaine ne disposait pas de benchmark standardisé pour comparer la robustesse cross-view entre politiques, rendant les comparaisons entre travaux difficiles. Le problème de robustesse aux points de vue est documenté en imitation learning depuis plusieurs années, mais les solutions disponibles exigeaient soit une augmentation intensive des données, soit une calibration caméra explicite à chaque reconfiguration. Physical Intelligence, fondée en 2023, a développé π₀ comme politique généraliste de manipulation. D'autres acteurs comme Google DeepMind (RT-2 et ses successeurs), Figure AI (Figure 03) ou 1X Technologies ciblent des architectures VLA à plus large spectre sans traiter spécifiquement cet axe de robustesse aux vues. VistaBot reste une contribution académique préliminaire : la préprint n'est pas encore revue par les pairs, les tâches réelles évaluées ne sont pas décrites en détail, et les gains annoncés devront être confirmés par des reproductions indépendantes une fois le code disponible.

IA physiquePaper
1 source
ExpertGen : apprentissage de politiques expertes par transfert simulation-réel à partir de comportements imparfaits
836arXiv cs.RO 

ExpertGen : apprentissage de politiques expertes par transfert simulation-réel à partir de comportements imparfaits

ExpertGen est un framework de recherche publié sur arXiv (2603.15956) qui automatise l'apprentissage de politiques de manipulation robotique en simulation pour en faciliter le transfert vers du matériel réel. Le système initialise une politique de diffusion à partir de démonstrations imparfaites, générées par un grand modèle de langage ou fournies manuellement, puis applique du renforcement pour l'affiner sans jamais modifier les poids du modèle préentraîné. L'optimisation porte uniquement sur le bruit initial de la diffusion, ce qui maintient l'exploration dans des trajectoires cohérentes avec le comportement humain, même avec des récompenses binaires éparses. Sur les benchmarks publiés, ExpertGen atteint 90,5 % de succès sur des tâches d'assemblage industriel et 85 % sur des tâches de manipulation à long horizon, surpassant toutes les méthodes de référence testées. Le transfert sim-to-réel est validé par distillation DAgger : les politiques d'état apprises en simulation sont converties en politiques visuomotrices et déployées sur du matériel robotique physique. Ce résultat s'attaque directement au principal goulot d'étranglement du robot learning industriel : la collecte de données de qualité. La téléopération à grande échelle est coûteuse, lente et ne se généralise pas. ExpertGen propose une alternative crédible en utilisant des démonstrations imparfaites, y compris synthétiques, comme amorce, puis en laissant le renforcement corriger l'écart de qualité en simulation. Le fait de geler la politique de diffusion est une décision architecturale clé : elle évite le mode collapse typique du fine-tuning RL sur des politiques expressives, tout en permettant la convergence sans reward engineering manuel. Pour les intégrateurs industriels, c'est un signal concret que le sim-to-real gap sur des tâches d'assemblage n'est pas insurmontable, à condition de disposer d'un simulateur suffisamment fidèle. Ce travail s'inscrit dans la vague des politiques de diffusion pour la robotique, initiée par Diffusion Policy (Chi et al., 2023, Columbia University) et prolongée par des systèmes comme pi-zero de Physical Intelligence ou les politiques dextères développées chez Google DeepMind et NVIDIA avec GR00T N2. ExpertGen reste pour l'instant un résultat académique : les métriques de succès sont issues de benchmarks de simulation contrôlés, et le déploiement réel mentionné dans le papier est préliminaire. Aucune timeline commerciale ni partenaire industriel ne sont annoncés. Les prochaines étapes logiques incluent des tests de robustesse à des variations de capteurs et d'environnement plus sévères, ainsi qu'une intégration éventuelle avec des politiques de fondation multimodales pour généraliser au-delà des tâches d'assemblage structurées.

RechercheOpinion
1 source
Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne
837arXiv cs.RO 

Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne

Une équipe de chercheurs publie sur arXiv (réf. 2604.03540, version 3) un cadre en deux étapes baptisé Drift-Based Policy Optimization (DBPO), conçu pour ramener les politiques génératives de manipulation robotique à une seule passe de réseau au moment de l'inférence. La première brique, la Drift-Based Policy (DBP), exploite des objectifs de "fixed-point drifting" pour internaliser le raffinement itératif directement dans les paramètres du modèle pendant l'entraînement, supprimant ainsi le besoin de débruitage multi-étapes à l'exécution. La seconde brique, DBPO, greffe sur ce backbone une interface stochastique compatible avec le renforcement en ligne, autorisant des mises à jour on-policy stables sans sacrifier la propriété de déploiement en une étape. Sur un robot bi-bras réel, le système atteint 105,2 Hz en boucle fermée, soit une fréquence comparable aux contrôleurs industriels classiques. Sur les benchmarks de manipulation, DBP égale ou dépasse les politiques de diffusion multi-étapes tout en réduisant le coût d'inférence jusqu'à un facteur 100 en nombre d'évaluations réseau (NFEs). Ce résultat touche directement l'un des verrous les plus concrets du déploiement de politiques diffusion en robotique : le coût computationnel à l'inférence. Les politiques de diffusion actuelles (Diffusion Policy, Chi et al., 2023) nécessitent typiquement 10 à 100 NFEs par action, ce qui les rend incompatibles avec du contrôle haute fréquence sans accélérateur dédié. Transférer ce coût vers l'entraînement plutôt que l'inférence change le profil économique du déploiement : un robot en production n'a plus besoin de GPU haut de gamme pour tourner en temps réel. Par ailleurs, coupler une politique one-step avec du renforcement en ligne ouvre la voie à une adaptation continue post-déploiement, hypothèse clé pour les environnements industriels non-structurés. Les politiques de diffusion pour la manipulation ont émergé comme référence de facto depuis 2022-2023, portées par des travaux comme Diffusion Policy ou les architectures VLA de Physical Intelligence (pi0) et d'autres. La course à réduire leur latence a produit plusieurs approches concurrentes : distillation de consistance (Consistency Policy), flow matching en une étape (comme dans certaines variantes de pi0-fast), ou encore les politiques à action chunking. DBPO s'inscrit dans cette compétition avec une approche qui revendique de préserver la modélisation multimodale tout en atteignant la vitesse des méthodes one-shot. Les prochaines étapes naturelles seraient un test à plus grande échelle de tâches et de morphologies robotiques, ainsi qu'une validation sur des plateformes humanoïdes telles que celles de Figure AI ou 1X Technologies, pour lesquelles la fréquence de contrôle est un critère de sécurité, pas seulement de performance.

UELes équipes de recherche et industriels européens en robotique manipulatrice pourraient réduire leurs besoins en accélérateurs GPU à l'inférence en adoptant cette approche, mais aucun acteur français ou européen n'est directement impliqué.

IA physiquePaper
1 source
Mask World Model : prédire l'essentiel pour un apprentissage robuste des politiques robotiques
838arXiv cs.RO 

Mask World Model : prédire l'essentiel pour un apprentissage robuste des politiques robotiques

Des chercheurs ont publié sur arXiv (réf. 2604.19683) le Mask World Model (MWM), une architecture de world model pour l'apprentissage de politiques robotiques robustes. Contrairement aux approches dominantes qui entraînent des modèles génératifs sur de la vidéo RGB, MWM prédit l'évolution de masques sémantiques, des représentations géométriques des objets en scène, à l'aide d'une architecture de diffusion vidéo. Une tête de politique basée sur la diffusion est intégrée en aval pour un contrôle bout-en-bout. Évalué sur les benchmarks de simulation LIBERO et RLBench, MWM surpasse significativement les world models RGB de l'état de l'art. Un protocole de robustesse par élagage aléatoire de tokens et des expériences en conditions réelles confirment la résilience du modèle face à la perte partielle d'information visuelle. Le problème ciblé est structurel : les world models entraînés à prédire des pixels RGB mémorisent des corrélations parasites liées aux arrière-plans dynamiques, aux variations d'éclairage ou aux textures changeantes. Ces distracteurs produisent des politiques fragiles qui échouent hors distribution, phénomène central du "demo-to-real gap" qui freine le déploiement industriel des robots apprenants. En contraignant le modèle à opérer sur des masques géométriques plutôt que sur des pixels bruts, MWM impose un goulot d'information qui force la représentation interne à capturer ce qui importe réellement pour la manipulation : dynamiques physiques, relations de contact, géométrie des objets. C'est une contribution méthodologique notable dans le débat sur ce que les world models doivent apprendre pour être fiables à l'échelle opérationnelle. Les world models pour la robotique ont émergé comme paradigme dominant ces deux dernières années, portés par des architectures comme UniSim, Dreamer, ou les VLA récents de Physical Intelligence (pi-0), Google DeepMind (GR00T N2) et Figure Robotics, qui misent presque tous sur la fidélité de reconstruction RGB. MWM propose une alternative centrée sur l'abstraction géométrique, un positionnement distinct dans cet écosystème en pleine consolidation. Il convient de noter qu'il s'agit d'une prépublication non encore relue par des pairs, et que les expériences en conditions réelles restent limitées en échelle et en diversité de tâches. Les suites naturelles incluent une validation sur des manipulateurs industriels en environnement non contrôlé, étape que les auteurs n'ont pas encore franchie.

RechercheOpinion
1 source
PhysMem : mise à l'échelle de la mémoire physique pour la manipulation robotique
839arXiv cs.RO 

PhysMem : mise à l'échelle de la mémoire physique pour la manipulation robotique

PhysMem, un cadre mémoire présenté sur arXiv (identifiant 2502.20323, version 5 actualisée au printemps 2026), propose une approche permettant aux planificateurs robotiques basés sur des modèles vision-langage (VLM) d'acquérir des connaissances physiques au moment de l'exécution, sans modifier les paramètres du modèle. Le système enregistre les interactions, génère des hypothèses sur les propriétés physiques observées, les soumet à vérification par des gestes ciblés, puis n'intègre que les hypothèses validées pour guider les décisions futures. Évalué sur trois tâches de manipulation réelle et des benchmarks de simulation avec quatre architectures VLM distinctes, PhysMem atteint 76 % de succès sur une tâche contrôlée d'insertion de brique, contre 23 % pour une récupération directe d'expérience. Sur des sessions de déploiement de 30 minutes, les performances progressent de façon consistante au fil du temps. L'apport central de PhysMem réside dans la séparation entre récupération et vérification. Les approches classiques de mémoire épisodique supposent que les expériences passées s'appliquent directement à la situation courante, ce qui produit des échecs dès que les conditions physiques changent, même marginalement. PhysMem brise ce cycle en testant activement chaque hypothèse avant de l'exploiter, une propriété critique pour les environnements industriels où surfaces, matériaux et tolérances varient d'un poste à l'autre. Pour les intégrateurs et les décideurs B2B, cela ouvre la voie à des robots capables de s'adapter à de nouveaux objets ou environnements sans cycle de réentraînement coûteux. L'écart de 53 points de pourcentage entre les deux modes illustre que le problème n'est pas la mémoire en soi, mais la rigidité de son application directe. Les VLM comme planificateurs robotiques ont été popularisés par des travaux comme SayCan (Google DeepMind), Code as Policies, ou plus récemment pi0 de Physical Intelligence, qui ont démontré une capacité de raisonnement abstrait sur les tâches. Leur limite persistante reste l'incapacité à modéliser les propriétés physiques spécifiques d'objets particuliers, un obstacle majeur à la généralisation hors laboratoire. PhysMem s'inscrit dans un mouvement plus large vers le test-time adaptation en robotique, distinct du fine-tuning classique et complémentaire des approches VLA (Vision-Language-Action). À noter: les résultats publiés portent sur des tâches de laboratoire contrôlées, et aucun déploiement industriel n'est annoncé à ce stade. Les suites logiques incluent des tests sur des horizons de déploiement plus longs et des tâches impliquant des objets déformables ou des matériaux à comportement incertain, là où les hypothèses physiques sont les plus difficiles à abstraire.

IA physiquePaper
1 source
AnchorRefine : manipulation synergique par ancrage de trajectoire et raffinement résiduel pour les modèles VLA
840arXiv cs.RO 

AnchorRefine : manipulation synergique par ancrage de trajectoire et raffinement résiduel pour les modèles VLA

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.17787) AnchorRefine, un framework hiérarchique conçu pour améliorer les modèles vision-langage-action (VLA) dans les tâches de manipulation robotique de précision. Le principe central repose sur une décomposition en deux niveaux : un planificateur d'ancres de trajectoire (anchor planner) qui génère un squelette de mouvement grossier, et un module de raffinement résiduel qui corrige les déviations en phase d'exécution pour améliorer la précision géométrique et de contact. Le système intègre également un mécanisme de raffinement de pince sensible aux transitions discrètes (decision-aware gripper refinement), conçu pour mieux capturer le caractère binaire et critique aux frontières du contrôle de préhension. Évalué sur les benchmarks LIBERO et CALVIN, ainsi que sur des tâches en robot réel, AnchorRefine affiche des gains allant jusqu'à 7,8 points de pourcentage en taux de succès en simulation et 18 points en conditions réelles, sur des backbones VLA à base de régression comme de diffusion. Le problème que cette architecture cherche à résoudre est structurel dans la conception actuelle des politiques VLA : lorsqu'une politique génère toutes les actions dans un espace unifié, les grands mouvements de transport dominent l'optimisation et noient les signaux correctifs de faible amplitude, pourtant critiques pour les tâches de précision comme l'assemblage, l'insertion ou la manipulation d'objets fragiles. En séparant explicitement la planification macroscopique de l'ajustement microscopique, AnchorRefine reproduit une structure proche de la motricité humaine, où la trajectoire globale et la correction locale sont des processus distincts. Le gain de 18 % en conditions réelles est significatif car il suggère une réduction effective du sim-to-real gap sur les tâches de contact, un verrou majeur pour la commercialisation des manipulateurs polyvalents. Ce travail s'inscrit dans une tendance de fond en robotique académique : l'hybridation entre planification à haut niveau (souvent guidée par le langage ou la vision) et contrôle fin en boucle fermée. Des approches comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA) intègrent déjà des mécanismes proches, tandis que des labos comme celui de Chelsea Finn (Stanford) ou Sergey Levine (Berkeley) explorent la hiérarchie action depuis plusieurs années. AnchorRefine se distingue en proposant une solution modulaire compatible avec des backbones existants sans réentraîner l'ensemble du modèle, ce qui facilite potentiellement son intégration dans des pipelines VLA déjà déployés. Les auteurs ne mentionnent pas de partenariat industriel ni de timeline de déploiement, et les évaluations restent cantonnées à des benchmarks académiques, ce qui tempère les conclusions sur la robustesse en environnement non contrôlé.

RechercheOpinion
1 source
Locomotion corps entier des humanoïdes : apprentissage par génération et suivi de mouvement
841arXiv cs.RO 

Locomotion corps entier des humanoïdes : apprentissage par génération et suivi de mouvement

Des chercheurs proposent un cadre de locomotion humanoid corps-entier combinant un modèle de diffusion entraîné sur des mouvements humains retargetés avec un tracker de mouvements par apprentissage par renforcement (RL), le tout déployé sur le robot Unitree G1. Le système génère en temps réel des trajectoires de référence adaptées au terrain, puis un module de suivi les exécute sur le robot complet, en s'appuyant uniquement sur la perception embarquée. Lors des tests matériels, le G1 a franchi avec succès des boîtes, des haies, des escaliers et des combinaisons de terrains mixtes, sans recourir à des capteurs externes ni à un calcul déporté. L'enjeu technique central que ce travail adresse est connu dans le secteur sous le nom de "lower-body dominance" : les approches RL classiques avec reward shaping tendent à produire une locomotion efficace mais raide, concentrée sur les jambes, au détriment de la coordination du buste et des bras. À l'inverse, l'imitation pure de mouvements de référence limite la capacité d'adaptation en ligne aux obstacles imprévus. Le couplage proposé -- générer à la volée la référence adaptée au terrain puis la tracker en boucle fermée -- représente une architecture crédible pour combler ce gap, même si les vidéos de démonstration présentées restent sélectionnées et ne constituent pas encore une validation sur terrain non contrôlé à large échelle. Le Unitree G1, commercialisé depuis 2024 à environ 16 000 dollars, est devenu un banc de test standard pour les laboratoires académiques en locomotion humanoid, au même titre que l'Atlas de Boston Dynamics pour les groupes industriels. Ce travail s'inscrit dans une vague de publications exploitant les modèles de diffusion pour la génération de mouvements robotiques, une tendance initiée notamment par les travaux sur pi0 (Physical Intelligence) et GR00T N2 (NVIDIA). Les auteurs annoncent des résultats quantitatifs montrant que la fine-tuning en boucle fermée améliore la généralisation ; la prochaine étape logique serait une validation sur des terrains non vus pendant l'entraînement et un déploiement en conditions industrielles réelles.

HumanoïdesPaper
1 source
2D ou 3D : qui gouverne la saillance dans les modèles VLA ? Un cadre d'élagage de tokens en trois étapes avec conscience de la saillance modale
842arXiv cs.RO 

2D ou 3D : qui gouverne la saillance dans les modèles VLA ? Un cadre d'élagage de tokens en trois étapes avec conscience de la saillance modale

Des chercheurs ont publié sur arXiv (référence 2604.09244, version 2, avril 2026) un article proposant un cadre d'élagage de tokens en trois étapes pour accélérer les modèles VLA (Vision-Language-Action) multi-modaux. Le constat de départ : les VLA de dernière génération ne se contentent plus d'entrées 2D classiques (images RGB) mais intègrent également des données 3D (nuages de points, profondeur), formant ce que les auteurs appellent des modèles MVLA (Multi-Visual-Modal VLA). Cette expansion modale améliore la perception spatiale des robots, mais elle multiplie le nombre de tokens traités à l'inférence, créant un goulot d'étranglement computationnel significatif. Le framework proposé introduit une analyse en trois phases qui capture les différences de saillance entre tokens 2D et 3D à chaque étape du traitement, puis applique un élagage ciblé selon ces différences. Les expériences rapportent un gain d'accélération allant jusqu'à 2,55x à l'inférence, avec une perte de précision minimale et un surcoût de traitement limité à 5,8%. Ce résultat est pertinent pour les équipes qui cherchent à déployer des VLA sur du matériel embarqué ou des robots opérant en temps réel. L'un des freins majeurs à la commercialisation des robots manipulateurs pilotés par VLA est précisément le coût computationnel de l'inférence : un gain de 2,55x sans dégradation significative des performances ouvre la voie à des cycles de décision plus courts sans nécessiter de GPU de datacenter. Il met aussi en lumière un angle mort des approches d'optimisation existantes : les méthodes d'élagage de tokens conçues pour des VLA 2D ne tiennent pas compte du fait que les tokens 3D et 2D n'ont pas la même importance selon le contexte et l'étape de traitement. Ignorer cette hétérogénéité conduit à des élagages sous-optimaux. Les modèles VLA sont devenus le paradigme dominant en robotique incarnée depuis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui ont tous deux popularisé l'architecture action-transformer multi-modal. La tendance à intégrer la modalité 3D s'est accélérée avec l'essor des capteurs LiDAR et RGB-D dans les environnements industriels. Ce travail s'inscrit dans une série d'efforts d'optimisation de l'inférence VLA, aux côtés de travaux comme FastV ou des approches de distillation, mais avec la spécificité de traiter explicitement la multi-modalité visuelle. Le code source n'est pas encore publié, ce qui limite pour l'instant la reproductibilité et l'adoption pratique ; les prochaines étapes annoncées concernent sa mise à disposition publique.

RechercheOpinion
1 source
Rewind-IL : détection des échecs en temps réel et réinitialisation d'état pour l'apprentissage par imitation
843arXiv cs.RO 

Rewind-IL : détection des échecs en temps réel et réinitialisation d'état pour l'apprentissage par imitation

Une équipe de chercheurs a publié Rewind-IL, un framework de surveillance en ligne conçu pour détecter les échecs d'exécution dans les politiques d'imitation learning à découpage d'actions (action-chunked policies) et y remédier sans nécessiter de données d'échec préalables. Le système repose sur deux mécanismes complémentaires : un détecteur d'anomalies baptisé TIDE (Temporal Inter-chunk Discrepancy Estimate), qui mesure l'incohérence temporelle entre segments d'actions successifs, et un mécanisme de "respawning" qui ramène le robot à un état intermédiaire sûr vérifié sémantiquement. En amont du déploiement, un modèle vision-langage (VLM) identifie des points de reprise dans les démonstrations d'entraînement, et l'encodeur de la politique gelée génère une base de données compacte d'empreintes de ces checkpoints. En ligne, Rewind-IL surveille la cohérence interne des chunks d'actions superposés et, dès détection d'une dérive, revient au dernier état validé avant de relancer l'inférence depuis un état propre. Les expériences couvrent des tâches de manipulation longue portée en environnement réel et simulé, avec transfert vers des politiques basées sur le flow matching. L'intérêt principal de Rewind-IL est qu'il est training-free : aucune donnée d'échec n'est nécessaire pour entraîner le détecteur, ce qui le distingue des moniteurs existants qui requièrent soit des exemples négatifs étiquetés, soit tolèrent mal les dérives bénignes de features. Le problème qu'il adresse est structurel dans les politiques action-chunked : une fois que l'exécution sort du manifold de démonstration, la politique continue de générer des actions localement plausibles mais globalement incohérentes, sans jamais récupérer. Rewind-IL casse ce cycle en combinant détection statistique (calibration par split conformal prediction pour contrôler le taux de fausses alarmes) et récupération sémantiquement ancrée plutôt que géométrique. C'est une approche pragmatique pour améliorer la fiabilité des robots en déploiement industriel, sans retraining ni ingénierie de données d'échec. L'imitation learning a connu un regain d'intérêt majeur avec l'émergence des politiques visuomotrices génératives, notamment ACT et Diffusion Policy, largement adoptées dans les labos académiques et par des acteurs comme Physical Intelligence (pi0) ou Figure AI. Ces politiques se heurtent toutefois à un "deployment gap" : les performances en démo ne se transposent pas toujours en conditions réelles sur des tâches longues. Rewind-IL s'inscrit dans une tendance croissante de travaux sur la robustesse runtime (aux côtés de méthodes comme DART ou les moniteurs basés sur l'incertitude), mais se distingue par son absence totale de supervision sur les échecs. Les auteurs indiquent que le code et les matériaux supplémentaires sont disponibles en ligne, mais aucun partenariat industriel ni déploiement terrain n'est annoncé à ce stade : il s'agit d'une contribution de recherche académique, pas d'un produit shipé.

RechercheOpinion
1 source
ReFineVLA : des politiques robotiques généralistes renforcées par raisonnement multimodal via fine-tuning guidé
844arXiv cs.RO 

ReFineVLA : des politiques robotiques généralistes renforcées par raisonnement multimodal via fine-tuning guidé

Des chercheurs ont publié le 22 avril 2026 sur arXiv un article présentant ReFineVLA, un cadre d'apprentissage conçu pour améliorer les capacités de raisonnement des modèles Vision-Language-Action (VLA) en robotique. L'approche repose sur deux étapes : un modèle enseignant expert génère d'abord des rationales de raisonnement pour enrichir les jeux de données robotiques existants, puis ces données augmentées servent à affiner des VLA pré-entraînés. Les auteurs évaluent leur méthode sur SimplerEnv, un environnement de simulation de manipulation, en testant deux plateformes robotiques distinctes : le bras WidowX et le Google Robot. ReFineVLA affiche un taux de succès supérieur à la deuxième meilleure méthode sur les deux benchmarks, selon les résultats rapportés. Aucun chiffre précis de marge de progression n'est fourni dans l'abstract. L'enjeu soulevé par ce travail est le fossé entre performance brute et raisonnement explicite dans les VLA actuels. Les modèles existants apprennent des mappings entrée-action fonctionnels mais omettent les étapes logiques intermédiaires, ce qui fragilise leur interprétabilité et leur généralisation sur des tâches longues et complexes. Pour les intégrateurs industriels, cette lacune est critique : un robot qui réussit une tâche sans pouvoir expliquer sa décision est difficile à valider, à certifier, ou à déboguer. ReFineVLA propose d'injecter du raisonnement structuré au moment du fine-tuning plutôt qu'en repensant l'architecture, ce qui est une approche pragmatique pour améliorer des modèles existants comme OpenVLA ou pi0 sans réentraînement complet. Ce travail s'inscrit dans une tendance récente visant à combler le gap entre LLMs raisonnants et politiques robotiques. Des approches comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA ont montré que les VLA pré-entraînés sur de larges corpus peuvent être adaptés à des domaines spécifiques. ReFineVLA pousse cette logique en ciblant explicitement le raisonnement comme vecteur de généralisation. Les évaluations restent cantonnées à la simulation, et la question du transfert sim-to-real n'est pas traitée dans cette version. Les prochaines étapes naturelles seraient une validation sur robot réel et une mesure de l'impact sur des tâches de manipulation longue séquence hors distribution.

IA physiqueOpinion
1 source
OFlow : flux temporel centré sur les objets pour une manipulation robotique robuste
845arXiv cs.RO 

OFlow : flux temporel centré sur les objets pour une manipulation robotique robuste

Des chercheurs ont publié le 24 avril 2026 OFlow, un framework destiné à améliorer la robustesse des modèles Vision-Language-Action (VLA) dans les tâches de manipulation robotique. L'approche, présentée dans un preprint arXiv (2604.17876), repose sur deux mécanismes combinés : un module de prédiction temporelle par flow matching, qui anticipe l'évolution de la scène avant d'agir, et une représentation centrée sur les objets pertinents pour la tâche, qui filtre les variations visuelles sans intérêt. Ces deux composants partagent un même espace latent sémantique, à partir duquel la génération des actions continues est conditionnée. Les évaluations couvrent quatre environnements de référence, LIBERO, LIBERO-Plus, MetaWorld et SimplerEnv, ainsi que des expériences en conditions réelles, et montrent des gains de robustesse et de taux de succès par rapport aux baselines VLA standards. Le verrou que tente de lever OFlow est bien identifié dans la communauté : les VLAs actuels raisonnent image par image, sans modèle explicite de ce qui va se passer ni de quels objets comptent vraiment. En séparant les cues visuels liés à la tâche des variations de fond (éclairage, texture, pose de la caméra), OFlow produit des représentations plus stables sous distribution shift, c'est-à-dire lorsque les conditions réelles diffèrent du training data. Pour les intégrateurs et les équipes de déploiement industriel, c'est un point critique : la fragilité des VLAs face aux écarts de conditions est l'un des principaux obstacles à leur passage en production. Les résultats sur SimplerEnv et les tâches réelles sont particulièrement scrutés, car ce benchmark est conçu pour tester explicitement ce gap sim-to-real. OFlow s'inscrit dans une vague de travaux cherchant à doter les VLAs d'une forme de planification implicite, après des modèles comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA) qui misent sur des architectures diffusion ou flux pour la génération d'actions. L'originalité revendiquée ici est l'unification dans un espace latent commun, plutôt que d'ajouter des modules séparés. Il s'agit pour l'instant d'un preprint non relu par des pairs, et les benchmarks utilisés, LIBERO notamment, sont bien maîtrisés par la communauté mais n'impliquent pas de robots déployés en production. Les prochaines étapes naturelles seront la validation sur des plateformes hardware variées et une comparaison directe avec les approches concurrentes sur des scénarios industriels réels.

IA physiqueOpinion
1 source
XEmbodied : un modèle fondation aux indices géométriques et physiques renforcés pour les environnements incarnés à grande échelle
846arXiv cs.RO 

XEmbodied : un modèle fondation aux indices géométriques et physiques renforcés pour les environnements incarnés à grande échelle

Une équipe de chercheurs a publié fin avril 2026 sur arXiv (référence 2604.18484) les travaux sur XEmbodied, un modèle fondateur côté cloud conçu pour améliorer l'annotation et l'entraînement des modèles Vision-Langage-Action (VLA) dans des environnements complexes à grande échelle. L'approche repose sur deux composants techniques distincts : un adaptateur 3D structuré qui intègre une représentation géométrique native (grilles d'occupation, boîtes englobantes 3D) dans un modèle de langage visuel (VLM) existant, et un adaptateur image-embodied efficace qui distille des signaux physiques en tokens contextuels. L'entraînement combine un curriculum progressif par domaine et un post-entraînement par apprentissage par renforcement. Les résultats sont évalués sur 18 benchmarks publics couvrant le raisonnement spatial, la sémantique trafic, l'affordance embodied et la généralisation hors distribution. Ce travail cible un goulot d'étranglement concret dans la chaîne de développement des systèmes autonomes incarnés : les pipelines d'annotation actuels s'appuient sur des VLM génériques pré-entraînés uniquement sur des paires image-texte 2D, sans compréhension intrinsèque de la géométrie 3D ni des contraintes physiques. Pour un intégrateur ou un décideur industriel qui cherche à construire des datasets de qualité pour robots mobiles ou bras manipulateurs, XEmbodied positionne la compréhension géométrique non comme une entrée auxiliaire optionnelle, mais comme une capacité fondamentale du modèle. Cela représente un changement d'approche notable dans la manière de produire des annotations scalables pour l'embodied AI, un segment où la qualité des données d'entraînement reste le principal facteur limitant avant même l'architecture du VLA lui-même. XEmbodied s'inscrit dans une vague de travaux visant à combler le fossé entre les VLM généralistes (GPT-4V, LLaVA, Qwen-VL) et les exigences de l'embodied AI, où les modèles comme π0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA nécessitent des données d'entraînement spatialement cohérentes et physiquement plausibles. La contribution ici n'est pas un VLA en soi, mais une couche d'infrastructure cloud pour en produire de meilleurs. Aucun déploiement industriel ni partenariat commercial n'est mentionné dans l'article : il s'agit d'un travail académique, dont la valeur pratique dépendra de l'adoption par les équipes qui construisent ces pipelines d'annotation à l'échelle.

RechercheOpinion
1 source
Mémoire à long terme pour agents VLA dans l'exécution de tâches en environnement ouvert
847arXiv cs.RO 

Mémoire à long terme pour agents VLA dans l'exécution de tâches en environnement ouvert

Une équipe de chercheurs a publié le 22 avril 2026 sur arXiv (ref. 2504.15671) les résultats de ChemBot, un système robotique conçu pour automatiser des protocoles d'expérimentation chimique complexes en laboratoire. ChemBot repose sur une architecture à deux couches couplant un agent IA planificateur à un modèle Vision-Language-Action (VLA) baptisé Skill-VLA, capable de décomposer hiérarchiquement des tâches longues, typiquement des protocoles multi-étapes, puis de les exécuter sur des robots collaboratifs. Le système intègre une mémoire persistante à double niveau qui archive les trajectoires réussies sous forme d'assets réutilisables, et s'appuie sur un serveur Model Context Protocol (MCP) pour orchestrer les sous-agents et les outils. Un mécanisme d'inférence asynchrone basé sur la prédiction d'états futurs est également implémenté pour réduire les discontinuités de trajectoire, un défaut récurrent des VLA standards. Les expériences rapportées montrent des taux de succès et une précision opérationnelle supérieurs aux baselines VLA existantes sur des scénarios longs et multi-étapes. Ce travail adresse une limite structurelle bien documentée des modèles VLA : leur incapacité à capitaliser sur les expériences passées, ce qui force le système à recommencer par tâtonnements à chaque nouvelle session. En intégrant une mémoire persistante récupérable, ChemBot réduit concrètement le "trial-and-error gap" dans des environnements à longue horizon de planification, un problème critique pour l'automatisation de laboratoire où une erreur en milieu de protocole peut invalider toute une expérience. C'est également une démonstration applicative du sim-to-real dans un domaine non industriel, le laboratoire chimique, traditionnellement peu couvert par les benchmarks robotiques. Pour les intégrateurs B2B dans le pharma ou la recherche chimique, cela constitue un signal concret vers des robots de laboratoire autonomes capables de gérer des workflows non déterministes. Les modèles VLA ont connu une montée en puissance rapide depuis 2023 avec des travaux comme RT-2 (Google DeepMind), OpenVLA et Pi-0 (Physical Intelligence), mais la majorité des déploiements restent limités à des tâches courtes et répétitives. ChemBot se positionne dans le segment émergent des "long-horizon VLA", aux côtés de travaux comme SayCan ou des architectures hiérarchiques de Carnegie Mellon. Aucun déploiement industriel n'est annoncé à ce stade, il s'agit d'une publication académique avec validation sur robots collaboratifs en environnement contrôlé. Les prochaines étapes logiques incluent des tests sur des plateformes comme les robots Universal Robots ou Franka, et une intégration potentielle avec des systèmes LIMS existants dans les laboratoires pharmaceutiques.

RechercheOpinion
1 source
De la perception à la simulation : génération haute-fidélité avec cousins numériques pour l'apprentissage et l'évaluation de robots généralisables
848arXiv cs.RO 

De la perception à la simulation : génération haute-fidélité avec cousins numériques pour l'apprentissage et l'évaluation de robots généralisables

Une équipe de chercheurs a publié en avril 2026 sur arXiv (arXiv:2604.15805) un framework génératif baptisé "Digital Cousins", conçu pour transformer automatiquement des panoramas de scènes réelles en environnements de simulation haute fidélité, puis en générer des variantes sémantiques et géométriques diversifiées. Le système prend en entrée une image panoramique d'une pièce réelle, reconstruit une scène simulée cohérente, et applique des modifications contrôlées, repositionnement d'objets, changement de géométrie, substitution de matériaux, pour produire des "scènes cousines" statistiquement variées. Un module de raccordement multi-pièces permet de construire des environnements à grande échelle pour des tâches de navigation longue portée dans des layouts complexes. Les expériences montrent que scaler massivement la génération de données améliore significativement la généralisation à des scènes et objets non vus en entraînement. Ce travail s'attaque directement à l'un des goulots d'étranglement majeurs du robot learning : collecter des données réelles diversifiées est coûteux en temps, en assets physiques et en reconfiguration manuelle d'environnements. L'approche real-to-sim-to-real proposée ici offre aux intégrateurs et équipes R&D une voie pour démultiplier leur corpus d'entraînement sans mobiliser de ressources physiques supplémentaires. La corrélation sim-to-real mesurée dans les expériences valide la fidélité de la plateforme, un point crucial, car beaucoup de frameworks de simulation peinent à transférer en conditions réelles. Pour les décideurs B2B, cela signifie des cycles de développement potentiellement plus courts et une meilleure robustesse des politiques déployées face à la variabilité des environnements industriels. À noter que les métriques de généralisation sont présentées sur des benchmarks de manipulation et de navigation en intérieur ; leur tenue dans des contextes industriels contraints (entrepôts, lignes de production) reste à démontrer hors laboratoire. Le concept de "Digital Cousins" s'inscrit dans une vague de travaux visant à combler le sim-to-real gap, aux côtés d'approches comme Isaac Sim (NVIDIA), Habitat (Meta) ou Genesis (labo Carnegie Mellon). Ce qui différencie cette contribution est la chaîne génératrice bout-en-bout à partir de panoramas, une méthode plus accessible que la modélisation 3D manuelle traditionnelle. Les auteurs ne rattachent pas explicitement le framework à un robot ou un produit commercial, ce qui en fait pour l'instant un outil de recherche. Les prochaines étapes naturelles seraient une intégration avec des pipelines VLA (Vision-Language-Action) existants comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), et une validation sur des robots manipulateurs déployés en conditions semi-réelles.

RecherchePaper
1 source
Transfert de compétences entre géométries différentes en une seule démonstration par décomposition en parties
849arXiv cs.RO 

Transfert de compétences entre géométries différentes en une seule démonstration par décomposition en parties

Des chercheurs ont publié le 20 avril 2026 (arXiv:2604.15455) une méthode permettant à un robot d'apprendre un geste à partir d'une seule démonstration, puis de le transférer à des objets de formes radicalement différentes, sans nouvel entraînement. L'approche repose sur une décomposition sémantique : plutôt que de comparer un objet entier à un autre, le système identifie les parties fonctionnelles pertinentes (poignée, bord, surface de contact) et transfère les points d'interaction entre les pièces homologues de l'objet de démonstration et de l'objet cible. Des modèles génératifs de formes à faible coût de données construisent automatiquement une fonction objectif qui optimise l'alignement de ces points sur les parties critiques pour l'exécution du skill. Les validations couvrent plusieurs skills et familles d'objets, en simulation et en environnement réel. Ce résultat est notable car il s'attaque directement au "demo-to-reality gap" géométrique : la majorité des systèmes actuels de transfert de skills, y compris ceux basés sur des Visual Language Action models (VLA), peinent dès que la forme de l'objet cible s'écarte significativement de celle vue lors de l'apprentissage. La décomposition en parties découple la variabilité de forme globale de la logique d'interaction locale, ce qui augmente mécaniquement le domaine de généralisation sans multiplier les données d'entraînement. Pour un intégrateur industriel ou un équipementier travaillant sur des lignes multi-références, c'est une piste concrète pour réduire le coût de re-programmation à chaque changement de référence produit. Le problème du transfert de skills en robotique est étudié depuis des années sous différents angles : apprentissage par démonstration (LfD), correspondances fonctionnelles entre objets, ou plus récemment les VLA pré-entraînés sur larges corpus vidéo (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA). Cette approche se positionne dans la lignée des travaux sur le raisonnement compositionnel, qui cherchent à représenter les objets non comme des blobs de points mais comme des assemblages de parties sémantiques, une direction explorée également par des groupes comme le MIT CSAIL et Stanford. Aucun partenariat industriel ni déploiement terrain n'est annoncé à ce stade : il s'agit d'une contribution académique, prometteuse mais encore à valider sur des skills complexes et des environnements fortement non structurés.

RechercheActu
1 source
COVER : planification de mouvement en temps fixe avec cartes à couverture vérifiée en environnements semi-statiques
850arXiv cs.RO 

COVER : planification de mouvement en temps fixe avec cartes à couverture vérifiée en environnements semi-statiques

Des chercheurs ont publié sur arXiv (référence 2510.03875v2) un framework baptisé COVER (Coverage-VErified Roadmaps), conçu pour résoudre des requêtes de planification de mouvement dans un budget temps fixe, sur un manipulateur 7-DOF effectuant des tâches de pick-and-place dans des environnements de type table rase et étagères. Le principe repose sur des environnements dits semi-statiques : la majorité de l'espace de travail reste identique entre les tâches, tandis qu'un sous-ensemble d'obstacles change de position. COVER décompose l'espace des configurations possibles de chaque obstacle mobile de façon indépendante, construit des roadmaps (graphes de chemins) de façon incrémentale, et vérifie formellement la faisabilité de ces graphes dans chaque partition. Pour les régions vérifiées, la résolution d'une requête est garantie dans un temps borné. Les benchmarks montrent une couverture de l'espace-problème plus large et un taux de succès par requête supérieur aux approches antérieures, notamment face à des obstacles de tailles hétérogènes. L'enjeu industriel est direct : les planificateurs généralistes comme RRT ou ses variantes ne garantissent pas de temps de réponse borné, ce qui bloque leur usage dans les applications temps-réel (lignes d'assemblage, cellules de palettisation, cobots en cadence synchronisée). COVER apporte une garantie formelle de couverture, absente des travaux précédents, sans discrétiser les configurations d'obstacles en un ensemble fini prédéfini. C'est ce dernier point qui étend l'applicabilité aux scénarios industriels réels, où les positions d'obstacles varient continûment et ne tombent pas dans des cases prédéterminées. Pour un intégrateur, la différence est concrète : un planificateur qui "essaie" n'a pas la même valeur contractuelle qu'un planificateur qui "garantit" dans X millisecondes. La planification de mouvement certifiée dans des environnements changeants est un problème ouvert depuis des années, à la frontière entre la robotique manipulation et la vérification formelle. Les approches par probabilistic roadmaps (PRM) offrent performance mais pas de garanties ; les méthodes exactes sont trop coûteuses en temps de calcul pour être embarquées. COVER se positionne entre ces deux extrêmes en exploitant la structure semi-statique propre à la majorité des environnements industriels. Les concurrents implicites sont les planificateurs adaptatifs comme STOMP, TrajOpt, ou les approches d'apprentissage par imitation (pi-zero de Physical Intelligence, GR00T N2 de NVIDIA), qui résolvent la planification par inférence neuronale mais sans garantie formelle de complétude. La prochaine étape naturelle serait d'étendre COVER à des environnements avec obstacles dynamiques ou à des manipulateurs montés sur bases mobiles, ce que l'article ne couvre pas encore.

RecherchePaper
1 source