Aller au contenu principal

Dossier Figure — page 7

644 articles · page 7 sur 13

Figure, le constructeur de robots humanoïdes le plus capitalisé : Figure 02 et 03, modèle Helix VLA, déploiements BMW, partenariats avec OpenAI puis indépendance.

Baisse des collisions contre le verre ? La division IA incarnée d'Ant Group revendique une avancée en perception robotique
301SCMP Tech Chine/AsieActu

Baisse des collisions contre le verre ? La division IA incarnée d'Ant Group revendique une avancée en perception robotique

Ant Group a présenté mardi, via sa filiale d'IA incarnée Robbyant, basée à Hangzhou, deux nouveaux modèles de perception visuelle pour robots : LingBot-Depth 2.0, un modèle de perception spatiale de nouvelle génération, et LingBot-Vision, un modèle visuel fondationnel. L'entreprise affirme que ces modèles permettent de résoudre un problème persistant en robotique : la détection fiable du verre, des miroirs et des objets transparents, des surfaces qui perturbent traditionnellement les capteurs de profondeur (LiDAR, stéréovision, temps de vol). Aucune métrique de précision, benchmark ou comparaison chiffrée n'a toutefois été communiquée dans l'annonce, ce qui invite à la prudence sur l'ampleur réelle de l'avancée revendiquée. La perception des matériaux transparents et réfléchissants reste un angle mort connu des systèmes de navigation robotique : portes vitrées, baies, miroirs faussent les mesures de distance et provoquent collisions ou arrêts d'urgence intempestifs. Un progrès réel sur ce point intéresserait directement les opérateurs d'AMR en entrepôt comme les concepteurs de robots humanoïdes destinés à évoluer en environnement de bureau, hôpital ou magasin. L'annonce confirme surtout l'entrée d'un nouvel acteur chinois, non spécialisé matériel, sur la brique logicielle de perception de la pile robotique, aux côtés d'entreprises déjà positionnées comme Unitree ou UBTech. Ant Group, connu pour Alipay et ses activités fintech, diversifie ainsi son portefeuille IA vers la robotique incarnée, dans la continuité du mouvement engagé par plusieurs géants technologiques chinois depuis 2024-2025. À l'international, la course reste dominée par des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, ou les plateformes propriétaires de Figure AI (Figure 03) et Tesla (Optimus Gen 3). Robbyant n'a pas précisé si LingBot-Depth 2.0 et LingBot-Vision seront ouverts, licenciés à des fabricants tiers, ou réservés à des projets internes, ni communiqué de calendrier de déploiement.

UEAucun acteur ou reglementation europeenne n'est concerne directement, mais une percee reelle sur la detection du verre et des surfaces reflechissantes interesserait indirectement les operateurs europeens d'AMR en entrepot et les concepteurs de robots humanoides destines aux environnements de bureau ou de sante.

1 source
X-Morph : des priors de mouvement humain pour l'apprentissage robotique évolutif multi-morphologies
302arXiv cs.RO 

X-Morph : des priors de mouvement humain pour l'apprentissage robotique évolutif multi-morphologies

Une équipe de chercheurs a publié fin juin 2026 sur arXiv (arXiv:2606.30290v1) X-Morph, un pipeline qui convertit des données de mouvement humain en politiques de locomotion et de loco-manipulation déployables sur des robots à pattes non-humanoïdes. L'approche cible trois morphologies distinctes : un quadrupède, un hexapode, et un quadrupède équipé d'un bras manipulateur. Le pipeline fonctionne en trois étapes : un module de re-ciblage cross-morphologique transforme des séquences de mouvement humain en références cinématiquement cohérentes avec la structure mécanique du robot cible ; ces références sont ensuite suivies par une politique d'apprentissage par renforcement (RL) dite "privileged" qui accède à des informations d'état complètes, puis distillées en une politique étudiante causale utilisable en inférence temps-réel. Les politiques obtenues généralisent à des mouvements humains non vus à l'entraînement et ouvrent trois applications concrètes : téleopération par vidéo, contrôle par prior comportemental, et génération de mouvement conditionnée par texte. La valeur technique de X-Morph tient à ce qu'il propose une réponse directe au problème central de la robotique non-humanoïde : la rareté des données de mouvement robot-spécifiques. Les systèmes humanoïdes comme Figure 02, Optimus Gen 2 ou Atlas bénéficient d'immenses corpus de capture de mouvement humain (AMASS, CMU MoCap, entre autres), mais les quadrupèdes de type Spot, ANYmal ou Unitree Go2 n'ont pas d'équivalent structurel. X-Morph pose l'hypothèse qu'un re-ciblage morphologique rigoureux peut combler cet écart sans collecter de nouvelles données robot. La mécanique RL "privileged" puis distillée est bien établie dans la littérature, notamment chez ETH Zurich et ANYbotics, mais son application à la réutilisation cross-morphologique de données humaines reste peu explorée à cette échelle. La capacité à conditionner les politiques par texte représente par ailleurs une interface opérateur plus accessible pour les intégrateurs industriels. Ce preprint s'inscrit dans une dynamique de recherche qui a accéléré depuis 2023, portée par des laboratoires exploitant les données humaines pour bootstrapper des comportements robotiques généraux : Pi-0 chez Physical Intelligence (Berkeley), GR00T N2 chez NVIDIA, ou Helix chez Figure AI. X-Morph se distingue en ciblant explicitement les morphologies non-humanoïdes, là où la majorité de la recherche reste concentrée sur les bipèdes. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné, ce qui en fait pour l'instant une contribution académique à suivre plutôt qu'un produit disponible. La question ouverte demeure celle du sim-to-real gap sur les morphologies hexapodes, que le papier ne quantifie pas en conditions réelles.

IA physiqueOpinion
1 source
Au programme de la #RoboCup2026
303Robohub 

Au programme de la #RoboCup2026

La RoboCup 2026 se tiendra à Incheon, en Corée du Sud, du 2 au 6 juillet. L'édition marque une évolution notable du format de compétition : les ligues de football adoptent désormais les robots humanoïdes comme axe principal, une décision structurante dans un contexte d'essor commercial du bipède. Les équipes concourront dans plusieurs divisions : RoboCupSoccer (Humanoid, Middle Size, Small Size et Simulation), RoboCupRescue (Robot et Simulation), RoboCup@Home, Industrial et RoboCupJunior (Soccer, Onstage et Rescue). Un atelier spécifique, le WEROB, est réservé à la robotique éducative, ciblant étudiants, mentors et formateurs. Le symposium du 6 juillet accueillera deux conférences plénières : Hyun Myung interviendra sur l'intelligence spatiale pour la navigation autonome en environnement non structuré, et Gentiane Venture, chercheuse française en poste au Japon, traitera de la question de doter les robots d'une capacité à comprendre et à s'inscrire dans un contexte humain. Ce pivot vers les humanoïdes dans les ligues football ne relève pas du symbolique. Il intervient alors que le marché des robots humanoïdes s'emballe, avec Figure AI, Tesla (Optimus Gen 3), Boston Dynamics (Atlas) et Agility Robotics positionnés sur les mêmes métriques de locomotion bipède, de manipulation et d'adaptation à l'environnement réel. La RoboCup, en tant que banc de test académique et compétitif normalisé, devient un outil pertinent pour mesurer l'écart réel entre systèmes de recherche et plateformes commerciales. Le choix de focaliser les ligues football sur l'humanoïde signale que la locomotion bipède robuste est jugée suffisamment mature pour être testée dans des conditions structurées et exigeantes, au-delà des démonstrations contrôlées en laboratoire. Fondée en 1997 à l'initiative de chercheurs japonais, la RoboCup vise à aligner, d'ici 2050, une équipe de robots autonomes capable de battre les champions du monde FIFA en conditions réelles. Depuis ses premières éditions à Nagoya et Paris, la compétition a accompagné chaque génération de ruptures en robotique : navigation réactive, vision profonde, apprentissage par renforcement, puis architectures VLA. La tenue de l'édition 2026 en Corée du Sud n'est pas neutre : le pays abrite Rainbow Robotics (acquis par Samsung début 2024), Hyundai Robotics et plusieurs laboratoires académiques actifs sur l'humanoïde. L'annonce officielle reste à ce stade une communication événementielle, sans détail technique sur les règles révisées des nouvelles ligues humanoïdes ni sur les critères d'évaluation retenus pour cette transition.

UEGentiane Venture, chercheuse française basée au Japon, intervient en plenière sur la cognition contextuelle des robots, seul lien direct avec la France dans un événement sud-coréen sans retombée opérationnelle immédiate pour l'écosystème robotique français ou européen.

HumanoïdesPaper
1 source
PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste
304arXiv cs.RO 

PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste

Des chercheurs ont publié le 29 juin 2026 sur arXiv (arXiv:2606.28192) PA-BiCoop, un framework de manipulation bimanualle à modèle unique reposant sur une différenciation dynamique des rôles "primaire-auxiliaire". L'architecture déploie un encodeur de caractéristiques global partagé alimentant deux décodeurs spécialisés : le décodeur primaire génère la pose du bras principal en coordonnées absolues ainsi que des heatmaps d'affordance pour la tâche centrale, tandis que le décodeur auxiliaire produit la pose relative du bras de support dans le repère du bras primaire. Un module d'assignation dynamique des rôles détermine automatiquement quel bras (gauche ou droit) prend la position primaire ou auxiliaire à chaque étape de la tâche, sans pré-définition manuelle. Les benchmarks rapportés indiquent une progression de 48 % en moyenne sur les tâches de simulation RLBench2 par rapport aux meilleures baselines existantes, et de plus de 50 % sur des tâches en environnement réel. Ces résultats, s'ils se confirment à l'échelle, adressent un verrou bien identifié dans la manipulation bimanualle : la quasi-totalité des approches actuelles traitent les deux bras comme des agents symétriques et interchangeables, ce qui force des synchronisations coûteuses et empêche l'émergence d'une division du travail naturelle. L'asymétrie primaire-auxiliaire est au contraire la norme dans la manipulation humaine, que ce soit pour visser un couvercle, positionner une pièce ou assembler un connecteur. Un gain de 50 % sur des tâches réelles est une affirmation forte : les benchmarks RLBench2 sont réputés pour permettre des optimisations d'artefacts de simulation, et les auteurs ne précisent pas le nombre de tâches réelles testées ni les conditions d'évaluation, deux points qui mériteront une vérification indépendante avant toute intégration industrielle. La manipulation bimanualle mobilise actuellement plusieurs équipes de premier plan : Physical Intelligence (pi) avec Pi-0, Figure AI avec le modèle embarqué sur Figure 02 et 03, et les équipes de recherche de Boston Dynamics, Toyota Research Institute et NVIDIA (GR00T N2) travaillent toutes sur des politiques bimanuelles généralisables. PA-BiCoop se distingue par son approche à modèle unique, là où des concurrents recourent à des architectures hiérarchiques séparées ou à du reinforcement learning multi-agent. Il s'agit pour l'instant d'une publication de recherche sans déploiement annoncé, ni code public ni partenaire industriel identifié ; la prochaine étape logique serait une validation sur des manipulateurs commerciaux type Franka, UR ou Kinova dans un contexte de production réelle.

IA physiquePaper
1 source
PressMimic : capture et contrôle de mouvement guidés par pression pour l'imitation par robot humanoïde
305arXiv cs.RO 

PressMimic : capture et contrôle de mouvement guidés par pression pour l'imitation par robot humanoïde

Des chercheurs ont publié le 26 juin 2026 sur arXiv (2606.26741) un framework baptisé PressMimic, conçu pour améliorer l'imitation de mouvements humains par les robots humanoïdes en intégrant la pression plantaire comme modalité de perception et de contrôle. Le pipeline combine trois briques : FRAPPE++, un modèle multimodal fusionnant RGB et données de pression pour estimer la pose 3D et la trajectoire globale d'un humain ; une politique d'apprentissage par renforcement supervisée par pression (PSP, Pressure-Supervised Policy) pour la reproduction sur le robot ; et MotionPRO, un jeu de données à grande échelle avec captures RGB, pression et motion capture synchronisées. Les résultats expérimentaux montrent des gains sur l'estimation de mouvement, la cohérence de trajectoire et la stabilité d'exécution, sans que les chiffres précis ne soient détaillés dans l'abstract, ils figurent dans l'article complet. Ce travail s'attaque à un problème concret et bien documenté en robotique humanoïde : les pipelines actuels reposant uniquement sur la vision produisent des artefacts physiquement incohérents, glissement des pieds, pénétration du sol, comportements instables à l'appui. En introduisant la pression comme signal d'ancrage physique (physical grounding), PressMimic impose des contraintes de contact explicites à la fois en perception et en contrôle, ce qui réduit l'ambiguïté inhérente à la seule estimation visuelle. Pour les équipes travaillant sur le sim-to-real et sur les politiques de locomotion, c'est un argument en faveur d'architectures multimodales intégrant des capteurs de force ou de pression dès la capture de données, pas seulement à l'exécution. L'imitation de mouvement humanoïde est un champ très actif : Boston Dynamics, Figure AI, Agility Robotics et des laboratoires académiques comme Stanford et CMU explorent des approches VLA (Vision-Language-Action) et RL pour la manipulation et la locomotion. PressMimic se distingue en ciblant explicitement la cohérence des contacts plutôt que la précision gestuelle seule, un angle complémentaire aux travaux sur les politiques diffuses (Pi-0 de Physical Intelligence) ou les politiques génératives. Il reste à ce stade une contribution de recherche académique sans déploiement industriel annoncé ; la publication du dataset MotionPRO pourrait néanmoins accélérer la reproductibilité et l'adoption par d'autres équipes.

HumanoïdesPaper
1 source
OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
306arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source
Des robots humanoïdes chinois relèvent le défi du penalty alors que Messi et Ronaldo illuminent la Coupe du Monde FIFA
307Interesting Engineering 

Des robots humanoïdes chinois relèvent le défi du penalty alors que Messi et Ronaldo illuminent la Coupe du Monde FIFA

Le 24 juin 2026, à l'ouverture du MWC Shanghai 2026, la Mobile AI Innovation Frontiers Zone du Shanghai New International Expo Centre a accueilli le Humanoid Robot Football Penalties Challenge, une compétition de tirs au but mettant en scène des robots humanoïdes en conditions semi-autonomes. D'après les images diffusées en ligne, des modèles de Booster Robotics et Unitree Robotics participent à l'épreuve. Le format est structuré : chaque robot doit interpréter indépendamment la position du ballon et les déplacements du gardien, puis déclencher le tir en effectuant des corrections en temps réel sur la base de ses capteurs, sans séquences pré-programmées ni intervention humaine externe. Les demi-finales et la finale sont prévues le 25 juin, avec des contraintes progressivement durcies pour simuler la pression compétitive. En parallèle, Hyundai Motor, maison mère de Boston Dynamics, a publié une vidéo de son robot Atlas réalisant des exercices de football dans le cadre d'une initiative baptisée "School of Football" : le robot observe des séquences vidéo de matchs, puis reproduit immédiatement dans un espace d'entraînement les gestes observés, passes incluses, imitation de célébration de but et simulation de blessure au genou compris. Hyundai évoque une possible présence d'Atlas et du quadrupède Spot à la Coupe du monde 2026, sans préciser leurs rôles. L'intérêt technique de l'exercice réside dans ce qu'un tir au but exige : perception en temps réel, équilibre dynamique lors du transfert de poids et de l'extension de jambe, et planification motrice adaptative dans un environnement non contrôlé. En faisant d'un moment sportif universellement compris un banc d'essai robotique, l'événement sert de point de comparaison public entre plateformes. Pour les intégrateurs et décideurs industriels, il convient cependant de distinguer soigneusement une démonstration scénarisée d'un déploiement opérationnel : les conditions restent contrôlées, les métriques publiées sont limitées, et les vidéos disponibles proviennent de flux non officiels. La valeur réelle réside moins dans la performance sportive que dans la capacité à enchaîner perception, décision et exécution physique sans intervention humaine, un sous-problème direct du sim-to-real transfer et de la robustesse des VLA (Vision-Language-Action models) en environnement ouvert. Unitree Robotics et Booster Robotics s'inscrivent dans la vague de constructeurs chinois d'humanoïdes qui ont considérablement accéléré depuis 2024, aux côtés de Zhiyuan Robotics et Fourier Intelligence, dans un contexte de forte pression concurrentielle avec les Américains Figure AI, Agility Robotics et Tesla Optimus. Du côté de Boston Dynamics, la campagne football intervient après une série de démonstrations industrielles d'Atlas Gen 2 en environnement d'usine automobile, et sert manifestement à repositionner le robot sur le terrain de la dextérité et de l'apprentissage par imitation plutôt que sur la seule force brute. La Coupe du monde 2026, dont les matchs se tiennent aux États-Unis, au Canada et au Mexique à partir du 11 juin, fournit un calendrier marketing opportun, mais aucune intégration fonctionnelle concrète n'a été annoncée pour l'instant.

UELa progression rapide des humanoïdes chinois accentue la pression compétitive sur les constructeurs et intégrateurs robotiques européens, sans déploiement ni annonce ciblant directement le marché européen.

Chine/AsieOpinion
1 source
RoBoSR : représentations structurées de scènes pour le raisonnement des robots incarnés
308arXiv cs.RO 

RoBoSR : représentations structurées de scènes pour le raisonnement des robots incarnés

Une équipe de chercheurs a publié fin juin 2026 un preprint arXiv (2606.24338) présentant RoBoSR, un cadre de représentation intermédiaire structurée pour la manipulation robotique en monde ouvert. L'approche modélise chaque tâche comme une séquence de transitions d'états sur des graphes de scène orientés objet, sémantiquement ancrés. Concrètement, le système segmente l'environnement perçu en entités discrètes (objets, relations spatiales, états) avant de raisonner sur les préconditions et effets de chaque sous-tâche. Pour entraîner ce raisonnement, les auteurs publient simultanément Manip-Cognition-1.6M, un jeu de données de 1,6 million d'exemples couvrant la compréhension de scène, l'interprétation d'instructions et la planification de sous-tâches sur des manipulations variées. Sur plusieurs benchmarks et démonstrations réelles, RoBoSR revendique des performances supérieures aux méthodes par prompting et aux pipelines TAMP classiques (Task and Motion Planning), notamment en généralisation zéro-shot et sur des tâches longue-portée. Ce que pointe cette publication, c'est l'une des frictions centrales des architectures VLA (Vision-Language-Action) actuelles : leur biais séquentiel issu des données de démonstration les rend fragiles dès que la tâche sort du scénario d'entraînement. En intercalant une représentation graphique explicite entre la perception brute et l'action, RoBoSR tente de rendre le raisonnement causal modulaire et réutilisable, ce qui améliore théoriquement la robustesse aux variations d'environnement. Pour un intégrateur industriel, c'est le problème du "demo-to-reality gap" qui est visé : un robot qui comprend les dépendances entre sous-tâches peut récupérer d'un échec partiel sans replanifier depuis zéro. Le dataset Manip-Cognition-1.6M, s'il est effectivement rendu public, constitue également une ressource d'entraînement non négligeable pour la communauté. RoBoSR s'inscrit dans une vague de recherches cherchant à dépasser les limites des modèles d'imitation pure, dans un secteur où Physical Intelligence (pi0), Google DeepMind (GR00T N2) et Figure AI travaillent sur des architectures hybrides mêlant apprentissage et planification symbolique. Le papier reste un preprint non évalué par les pairs, et les résultats en "démonstrations réelles" ne sont pas détaillés quantitativement dans le résumé disponible. Les prochaines étapes naturelles seraient une soumission en conférence (CoRL, ICRA) et la mise à disposition publique du dataset annoncé.

IA physiquePaper
1 source
DF-ExpEnse : exploration filtrée par diffusion pour un affinage économe en données
309arXiv cs.RO 

DF-ExpEnse : exploration filtrée par diffusion pour un affinage économe en données

Des chercheurs présentent DF-ExpEnse, une méthode d'exploration publiée en juin 2026 sur arXiv (preprint 2606.19656) qui vise à améliorer l'efficacité en termes d'échantillons lors du fine-tuning de politiques de contrôle génératives pré-entraînées. La technique s'appuie sur les capacités de modélisation multimodale de la politique générative, typiquement une politique de diffusion, pour construire un ensemble de candidats d'actions expressif et évaluable efficacement. Un ensemble de critiques (ensemble of critics) sélectionne ensuite l'action qui équilibre la qualité d'exécution avec un fort intérêt exploratoire. En contexte de flotte robotique, DF-ExpEnse intègre un mécanisme de communication inter-agents permettant une exploration collaborative distribuée. Les expériences portent sur des tâches de manipulation et de locomotion, et montrent des gains constants en efficacité d'échantillonnage par rapport au fine-tuning par défaut et à d'autres schémas de sélection d'action. L'efficacité en termes d'échantillons est l'un des verrous principaux du fine-tuning par renforcement de politiques robotiques génératives : chaque interaction avec l'environnement réel est coûteuse, lente et potentiellement dangereuse. En améliorant la qualité des données collectées en ligne, DF-ExpEnse réduit le nombre d'épisodes nécessaires pour atteindre un niveau de performance cible, ce qui représente un gain opérationnel concret dans des contextes industriels. L'aspect flotte est particulièrement pertinent pour des déploiements à l'échelle : l'exploration collaborative entre robots permet d'amortir le coût d'exploration sur un parc entier, plutôt que de le répéter agent par agent. La méthode étant compatible avec les stratégies de fine-tuning RL existantes, son intégration dans des pipelines déjà établis reste relativement directe. Ce travail s'inscrit dans un courant de recherche actif autour du fine-tuning de politiques de diffusion robotiques, domaine structuré ces dernières années par des travaux comme Diffusion Policy (Chi et al., 2023), Pi-0 de Physical Intelligence, ou DPPO. Le passage de l'entraînement offline à l'adaptation online en conditions réelles reste l'un des axes les plus disputés de la robotique apprise, avec des groupes à Stanford, Berkeley, CMU, et des entreprises comme Physical Intelligence ou Figure AI actifs sur des variantes de ce problème. DF-ExpEnse est pour l'heure un preprint non encore évalué par les pairs ; son site projet présente des démonstrations expérimentales, mais aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RechercheActu
1 source
ThinkingVLA : raisonnement vision-langage entrelacé pour la manipulation robotique
310arXiv cs.RO 

ThinkingVLA : raisonnement vision-langage entrelacé pour la manipulation robotique

Une équipe de chercheurs a publié sur arXiv (réf. 2606.17937, juin 2026) ThinkingVLA, un modèle VLA (Vision-Language-Action) conçu pour la manipulation robotique sur des séquences longues. L'architecture, de type Mixture-of-Transformers, intercale raisonnement textuel et visuel dans un unique processus génératif. Un Chain-of-Thought "forward" identifie le sous-objectif suivant et prédit l'état visuel cible correspondant ; un CoT "inverse" prend ensuite cette image générée comme entrée et infère les commandes motrices nécessaires pour l'atteindre. L'action finale est générée conditionnée sur ce contexte de raisonnement complet. Sur des benchmarks en simulation et en conditions réelles, ThinkingVLA surpasse les baselines de l'état de l'art, avec les gains les plus marqués sur les tâches à horizon temporel long. La grande majorité des modèles VLA actuels, notamment Pi-0 de Physical Intelligence ou OpenVLA, projettent directement observations vers actions sans raisonnement explicite, ce qui les pénalise sur les séquences longues nécessitant planification spatiale et décomposition en sous-étapes. ThinkingVLA adresse ce "reasoning gap" en forçant le modèle à anticiper visuellement l'état du monde avant de dériver les commandes. Cette boucle d'inverse dynamics grounding visuel est, si elle se confirme à l'échelle sur des objets et environnements variés, une piste sérieuse pour réduire le fossé persistant entre démonstrations en laboratoire et robustesse opérationnelle hors domaine. Les modèles VLA ont connu une accélération nette depuis 2024 avec RT-2 de Google DeepMind, Pi-0 de Physical Intelligence (lancé fin 2024), GR00T N2 de NVIDIA et Helix de Figure AI. L'ajout de CoT textuel dans les VLA est une tendance consolidée, mais ThinkingVLA se distingue par un CoT visuel explicite, soit la génération d'une image intermédiaire comme étape de raisonnement, ce qui implique une architecture bimodale plus coûteuse à l'inférence. Le travail est soumis en pre-print sans revue par les pairs à ce stade, sans partenariat industriel annoncé. Les prochains défis identifiés par le domaine concernent la généralisation hors distribution et la réduction du coût d'inférence pour un déploiement embarqué en temps réel.

RechercheOpinion
1 source
La mémoire flash comme actif périssable : tarification de l'endurance pour les agents incarnés et ses limites
311arXiv cs.RO 

La mémoire flash comme actif périssable : tarification de l'endurance pour les agents incarnés et ses limites

Une équipe de chercheurs a publié sur arXiv (référence 2606.18144) une analyse formelle d'un problème souvent ignoré dans les systèmes robotiques embarqués : l'usure irréversible de la mémoire flash. Chaque écriture consomme un cycle programme/effacement (P/E) sur un stock fini, environ 1 000 cycles pour les puces QLC ou eMMC que montent les robots bas de gamme, et 3 000 pour les TLC premium. Les auteurs traitent cette mémoire comme un capital qui se déprécie et introduisent un "prix fantôme d'endurance" noté η, qui permet d'optimiser le placement des données à travers une hiérarchie RAM, NVM embarquée et cloud. Sur des logs de robots réels, ils mesurent un coefficient d'association valeur-écriture χ : positif (~+1,0×10⁻³) pour la manipulation récurrente à long horizon, nul pour les tâches à court horizon, et négatif pour la téléopération non récurrente. Résultat contre-intuitif : quand χ > 0, l'optimum déplace les souvenirs les plus précieux vers le cloud plutôt que vers la flash locale. Ce résultat intéresse directement les intégrateurs et les équipes déployant des agents d'IA embarquée à grande échelle. La contrainte d'endurance n'est pas théorique : elle est dormante sur les TLC haut de gamme mais active sur les eMMC et QLC que la majorité des robots industriels low-cost utilisent aujourd'hui. Formaliser ce coût permet d'optimiser la durée de vie des composants sans sacrifier les performances opérationnelles. Les tests montrent qu'un contrôleur appris "wear-aware" rivalise avec le routage basé sur les prix en valeur de tâche, tout en prolongeant la durée de vie du matériel. L'article établit ainsi une distinction utile : durée de vie du dispositif et performance de la tâche peuvent être découplées, ce qui n'avait pas été formalisé jusqu'ici. La gestion de mémoire persistante est un défi ouvert en robotique, aujourd'hui amplifié par la prolifération des plateformes humanoïdes (Figure AI, 1X, Boston Dynamics Atlas) et des modèles VLA (Vision-Language-Action), qui génèrent des fréquences d'écriture structurellement plus élevées. Ce travail s'inscrit dans les courants Lifelong Learning et SLAM à mémoire persistante. Les auteurs signalent deux limites importantes : la valeur de tâche n'est observable que via un proxy, et l'optimum non-monotone, prouvé formellement, n'a pas encore été observé dans les données expérimentales. Les prochaines étapes naturelles incluent la validation sur des déploiements longue durée et l'intégration du cadre dans les pipelines mémoire des agents VLA, où la question du coût réel de chaque écriture devient critique à l'échelle.

RecherchePaper
1 source
EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe
312arXiv cs.RO 

EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe

Des chercheurs présentent EAGG (Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning), un modèle de génération de prises robotiques multi-effecteur publié en prépublication sur arXiv (arXiv:2506.18092). L'architecture représente chaque effecteur terminal via un graphe topologique et un espace de contrôle bas-dimensionnel propre à chaque morphologie, qu'il s'agisse de pinces parallèles classiques ou de mains dextères à plusieurs doigts. Un module backbone figé convertit l'état articulé courant en tokens géométriques réutilisables, qui sont rafraîchis de façon itérative tout au long du processus d'échantillonnage via un mécanisme baptisé iterative geometry injection. Sur le benchmark MultiGripperGrasp, EAGG atteint 56,17 % de taux de succès moyen sur six effecteurs d'entraînement, soit un écart de seulement 1,10 point de pourcentage par rapport à des modèles spécialisés entraînés séparément pour chaque préhenseur. L'injection géométrique itérative réduit par ailleurs la distance médiane de contact de 0,239 cm à 0,189 cm. Le code est disponible en open source sur GitHub. Ce résultat s'attaque à l'un des verrous les plus concrets pour les intégrateurs industriels : la nécessité de réentraîner ou d'affiner un modèle de saisie à chaque changement de préhenseur. L'approche dominante consiste aujourd'hui soit à entraîner un modèle par géométrie d'effecteur (coûteux en données et en compute), soit à encoder l'identité de l'effecteur via un descripteur statique, ce qui dégrade le transfert dès que la topologie ou le couplage d'actionnement diverge significativement. EAGG montre qu'encoder explicitement la structure morphologique dans un générateur partagé, plutôt que de masquer les différences inter-effecteurs, améliore à la fois la performance générale et la transférabilité zero-shot vers des préhenseurs non vus lors de l'entraînement. C'est un argument de poids pour les équipes robotiques cherchant à mutualiser les politiques de saisie sur une flotte multi-effecteurs. Ce travail s'inscrit dans la dynamique plus large de politiques robotiques universelles que poursuivent simultanément Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec Helix, tous confrontés au même défi de transfert inter-morphologie. EAGG se concentre sur le sous-problème de la saisie et propose une solution fondée sur les graphes, là où d'autres approches misent sur des encodages continus ou des plongements latents partagés. Il s'agit pour l'instant d'une contribution académique sans déploiement industriel annoncé ni partenariat applicatif déclaré, et les chiffres de performance sont à lire dans le cadre contrôlé du benchmark MultiGripperGrasp, ce qui laisse ouverte la question du sim-to-real gap en conditions réelles.

RechercheActu
1 source
MotionVLA : un modèle vision-langage-action pour les robots humanoïdes
313arXiv cs.RO 

MotionVLA : un modèle vision-langage-action pour les robots humanoïdes

Une équipe de l'AIGeeksGroup a publié le 18 juin 2026 sur arXiv (2606.15142) MotionVLA, un modèle de type Vision-Language-Action conçu pour générer du mouvement humanoïde réaliste à partir d'images de scène et d'instructions textuelles. Le coeur de la contribution repose sur DSFT (Dual-Stream Frequency Tokenizer), un tokeniseur qui décompose le signal de mouvement en deux flux distincts : un flux Base capturant la sémantique de pose basse fréquence, et un flux Phys encodant la dynamique physique haute fréquence. Cette séparation s'appuie sur une analyse en transformée en cosinus discrète (DCT) du corpus HumanML3D, qui révèle un déséquilibre concret : cinq coefficients DCT suffisent à couvrir 93 % de l'énergie des positions articulaires, mais seulement 37 % de l'énergie des vélocités. Les deux flux sont compressés indépendamment par troncature DCT et encodage BPE, puis réinjectés dans un transformeur autorégressif basé sur Qwen3.5 2B. Sur les benchmarks HumanML3D et MBench, MotionVLA réduit l'écart de diversité avec les données réelles de plus de 50 % et améliore la cohérence mouvement-condition de 3,8 %. Ce résultat pointe une limite structurelle des approches à codebook unique, qui dominent actuellement la génération de mouvement humanoïde : en forçant des signaux hétérogènes dans un espace de quantification commun, ces méthodes sous-représentent systématiquement les composantes dynamiques hautes fréquences au profit de la géométrie de pose. Pour les équipes travaillant sur le contrôle de robots humanoïdes ou la synthèse d'animation procédurale, cela signifie que la qualité du mouvement généré peut sembler plausible en posture statique mais manquer de naturel en transition. L'architecture duale de MotionVLA, malgré un backbone léger de 2 milliards de paramètres, obtient des gains mesurables sans augmenter significativement le coût de calcul. MotionVLA s'inscrit dans un mouvement de recherche plus large qui adapte les VLA, initialement développés pour le contrôle robotique visuomoteur, à la génération de comportement humanoïde. Le modèle s'appuie sur Qwen3.5, la famille de modèles open-weight d'Alibaba, et le code source est disponible sur GitHub (AIGeeksGroup/MotionVLA). À ce stade, il s'agit exclusivement d'un résultat de recherche académique évalué sur des benchmarks synthétiques standard, sans déploiement industriel ni partenariat hardware annoncé. Les acteurs comme Figure AI, 1X, Agility Robotics ou Fourier Intelligence, qui investissent dans la génération de mouvement pour leurs humanoïdes, suivent de près ce type de travaux, même si le chemin du benchmark de laboratoire vers un déploiement sim-to-real reste non démontré ici.

IA physiqueOpinion
1 source
Main dextérique modulaire et anthropomorphique : conception par analyse comparative multi-paramètres des doigts
314arXiv cs.RO 

Main dextérique modulaire et anthropomorphique : conception par analyse comparative multi-paramètres des doigts

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.11826) un framework de conception pour mains robotiques anthropomorphiques dextres, fondé sur une approche modulaire de sélection des doigts. Le principe : évaluer quantitativement des prototypes de doigts de manière indépendante, via une batterie de benchmarks, avant leur intégration dans une main complète téléopérée. Les variations testées portent sur le type d'articulation, la structure osseuse, les matériaux de peau et le placement des capteurs. Le framework a été validé sur deux tâches concrètes : la saisie simultanée de plusieurs objets et le vissage d'une ampoule, deux exercices représentatifs de la manipulation dextre à contraintes mécaniques variables. Ce travail s'attaque à un verrou structurel du domaine : la conception de mains dextres souffre d'un espace de design trop vaste, où morphologie, actuation et capteurs interagissent de façon non-linéaire. Les méthodes d'optimisation existantes traitent rarement plus d'un critère à la fois, ce qui rend les comparaisons inter-prototypes difficiles et les itérations coûteuses. En découplant l'optimisation des doigts de la validation au niveau de la main entière, le framework proposé réduit potentiellement le temps de screening et établit un lien quantitatif entre les métriques composant et la performance globale en tâche. Pour les équipes d'ingénierie et les intégrateurs, c'est une promesse de pipeline de développement plus prédictif, moins dépendant de l'empirisme. À noter : l'article est un preprint arXiv, sans peer review encore validé, et les gains de performance sur les deux tâches choisies restent difficiles à extrapoler à des scénarios industriels réels. La conception de mains dextres est un enjeu central pour les robots humanoïdes actuels : Figure AI, 1X, Apptronik, et Agility Robotics dépendent toutes de mains capables d'alimenter des pipelines de téléopération et d'apprentissage par imitation pour entraîner des modèles VLA. Côté académique, des groupes à Stanford, CMU et au MIT travaillent sur des architectures similaires, tandis que Shadow Robotics (UK) reste la référence commerciale en matière de main dextre à actuation tendon. En Europe, Pollen Robotics (Bordeaux) intègre des mains articulées dans sa plateforme Reachy, et Enchanted Tools (Paris) développe des mains expressives pour ses robots Miroka. Ce preprint ne s'accompagne pas d'annonce commerciale ni de calendrier de déploiement, mais la méthodologie de benchmarking modulaire pourrait être adoptée comme standard de facto dans les équipes hardware des startups d'humanoïdes, où la vitesse d'itération sur les effecteurs est aujourd'hui un facteur différenciant clé.

UEPollen Robotics (Bordeaux) et Enchanted Tools (Paris) sont directement mentionnés comme bénéficiaires potentiels de cette méthodologie de benchmarking modulaire, qui pourrait accélérer leurs cycles d'itération sur les effecteurs.

RecherchePaper
1 source
L'équipe Tsinghua-Harvard développe Acorn, un robot « zéro-données » qui apprend par instinct, sans entraînement
315Pandaily 

L'équipe Tsinghua-Harvard développe Acorn, un robot « zéro-données » qui apprend par instinct, sans entraînement

La startup Acorn Robot, cofondée par le Dr. Jiang Yao (doctorat en génie mécanique à Tsinghua, postdoctorat en neurosciences à Harvard), a présenté un robot de manipulation capable d'apprendre des tâches physiques sans aucune donnée d'entraînement préalable, sans trajectoires de démonstration et sans modèle visuel. Le système repose sur un modèle de décision embarqué baptisé "Natus" (pour "instinct-driven behavioral emergence"), qui fonctionne par essais et erreurs en temps réel sur le matériel physique. Le hardware est délibérément minimaliste : une pince industrielle parallèle à 1 degré de liberté, équipée de capteurs tactiles sur ses deux mâchoires en V, sans caméra externe ni connexion cloud. La démonstration présentée montre le robot parvenir à saisir une carte bancaire posée à plat sur une table, un défi reconnu pour les préhenseurs industriels conventionnels, en utilisant une mâchoire comme levier contre le bord de la carte et la surface de la table comme point d'appui. Le système requiert typiquement huit à neuf tentatives pour converger vers cette stratégie. Selon la société, une preuve de concept a été validée chez l'un des principaux fabricants de cosmétiques en Chine, avec un déploiement à l'échelle annoncé. La cible commerciale visée est la fabrication flexible B2B, où l'adaptabilité prime sur le volume de données. L'approche représente une rupture philosophique avec le paradigme dominant de la robotique contemporaine, qui s'appuie massivement sur des données de démonstration, des modèles vision-langage-action (VLA) et de l'apprentissage par simulation. Le Dr. Jiang soutient que les forces de contact imprévisibles et les variations mécaniques entre robots individuels rendent les approches data-driven structurellement fragiles, décrivant la dépendance aux données comme un "puits sans fond impossible à combler" et affirmant qu'il n'existe pas de modèle universel, seulement un modèle optimal pour un robot donné. Pour les intégrateurs industriels et les décideurs en fabrication flexible, le claim est potentiellement significatif : un système capable de s'adapter à une nouvelle tâche physique sans pipeline de collecte de données ni infrastructure cloud réduit le coût de déploiement et le délai de mise en service. Il convient toutefois de nuancer : les huit à neuf tentatives annoncées proviennent d'une vidéo de démonstration sélectionnée, les conditions exactes du déploiement cosmétique ne sont pas détaillées, et la distinction entre preuve de concept validée et déploiement industriel à grande échelle reste à préciser. Acorn Robot s'inscrit dans un paysage robotique mondial où l'essentiel des investissements se concentre sur les humanoïdes dotés de VLA à grande échelle : Figure 03 de Figure AI, Optimus Gen 3 de Tesla, pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. L'approche d'Acorn, centrée sur un préhenseur industriel à faible complexité matérielle plutôt que sur une plateforme humanoïde généraliste, repositionne la question de la généralisation robotique au niveau du comportement émergent plutôt que de la capacité de représentation. La startup appartient à une génération de chercheurs sino-américains explorant des alternatives à l'apprentissage supervisé massif, un espace également investigué par des équipes européennes en robotique cognitive, notamment en France et en Suisse. Les prochaines étapes annoncées portent sur l'extension à d'autres scénarios de fabrication flexible, sans calendrier précis communiqué à ce stade.

Chine/AsiePaper
1 source
Revue des approches de navigation et manipulation robotique avec simulateurs physiques à l'ère de l'IA incarnée
316arXiv cs.RO 

Revue des approches de navigation et manipulation robotique avec simulateurs physiques à l'ère de l'IA incarnée

Un groupe de chercheurs a publié sur arXiv (réf. 2505.01458, version 2, mai 2025) un état de l'art sur l'utilisation des simulateurs physiques pour entraîner des robots à la navigation et à la manipulation dans le cadre de l'IA incarnée (Embodied AI). L'étude analyse comment les moteurs de simulation réduisent le "sim-to-real gap", c'est-à-dire l'écart de performance constaté quand un agent entraîné en simulation est déployé dans le monde réel. Le survey passe en revue les caractéristiques des principaux simulateurs, leurs contraintes matérielles, et propose un inventaire structuré de datasets de référence, métriques d'évaluation et méthodes existantes. Aucun code ou outil nouveau n'est publié: il s'agit d'une contribution bibliographique et méthodologique. Cette revue intervient alors que le sim-to-real gap demeure l'obstacle principal au déploiement industriel de robots humanoïdes et de bras manipulateurs. Entraîner directement sur du matériel réel est coûteux, lent et risqué, ce qui place la simulation au cœur des pipelines de développement des VLA (Vision-Language-Action models) et des systèmes de navigation autonome. En consolidant des propriétés peu documentées des simulateurs, le survey aide ingénieurs et chercheurs à sélectionner l'outil adapté à leurs contraintes hardware sans avoir à faire une veille exhaustive de la littérature. Les simulateurs en compétition dans cet espace incluent Isaac Sim (NVIDIA), MuJoCo (DeepMind/Google), PyBullet, Webots et Genesis, un moteur GPU-natif récent. L'intérêt pour ce type de synthèse est alimenté par l'accélération du secteur: Figure AI, Physical Intelligence (pi zero), Boston Dynamics, Unitree et Agility Robotics multiplient les annonces de déploiements en environnements industriels réels. Ce survey constitue un point d'entrée structuré pour les équipes qui montent leur pipeline sim-to-real en 2025, à condition de ne pas attendre de benchmarks neutres et indépendants: l'évaluation des simulateurs reste largement conduite par leurs propres éditeurs.

RecherchePaper
1 source
La Chine peut apporter une contribution exceptionnelle dans la prochaine décennie, selon un ex-responsable de l'ONU sur l'IA et la robotique
317Pandaily 

La Chine peut apporter une contribution exceptionnelle dans la prochaine décennie, selon un ex-responsable de l'ONU sur l'IA et la robotique

Sam Daws, ancien haut fonctionnaire des Nations Unies et directeur du Project on Peace, Security, and AI à l'Université d'Oxford, a participé à un dialogue stratégique organisé par le Chongyang Institute for Financial Studies de l'Université Renmin de Chine, dans le cadre de la série Mingde Strategic Dialogue. Il a positionné la Chine comme détenant une "position de leadership mondial" en robotique humanoïde et en IA incarnée (embodied AI), tout en reconnaissant que les États-Unis conservent une avance sur la conception des puces avancées. L'avantage distinctif chinois résiderait, selon lui, dans sa capacité à intégrer l'intelligence incarnée à la fabrication industrielle avancée via l'initiative nationale "AI+". Sur la question de l'IA militaire, Daws a mis en garde contre ce qu'il nomme "l'illusion de la précision algorithmique" : les environnements de combat restent intrinsèquement incertains, avec des données incomplètes et des conditions dynamiques, ce qui rend tout déploiement autonome sans contrôle humain réel particulièrement risqué. Il a par ailleurs cité le KazLLM du Kazakhstan -- un grand modèle de langage en langue kazakhe -- comme exemple réussi de développement d'IA localisée dans le contexte des pays du Sud Global. Ce dialogue illustre un glissement dans le débat autour de la souveraineté technologique : les puissances intermédiaires refusent de plus en plus de choisir entre blocs technologiques rivaux, et exigent des infrastructures fiables, une puissance de calcul accessible et des standards interopérables. Pour l'industrie robotique, la thèse de Daws est notable : il soutient que la transition de l'"IA informationnelle" vers l'"IA agentique" -- des systèmes capables d'exécuter des tâches complexes de manière autonome ou semi-autonome -- représente la prochaine rupture structurelle. Si la Chine réussit à convertir son avance dans l'integration manufacturing-embodied AI en standards de facto, les intégrateurs et les OEM mondiaux pourraient se retrouver contraints d'adopter des architectures chinoises pour accéder aux marchés émergents. Le contexte géopolitique éclaire la portée du discours : Daws a évoqué des discussions en cours entre la Chine, l'ASEAN et l'UE sur l'interopérabilité robotique, ainsi qu'une coopération trilatérale potentielle Chine-Japon-Corée du Sud sur les standards des robots humanoïdes -- un signal d'alignement régional à surveiller face à la dynamique américaine autour de Boston Dynamics, Figure AI ou 1X Technologies. Il a identifié l'Organisation des Nations Unies pour le développement industriel (ONUDI/UNIDO) comme plateforme clé pour accompagner la montée en gamme industrielle dans l'ère de l'IA. Il convient de noter que ce compte-rendu reste celui d'un dialogue d'experts, sans annonce de produit ni déploiement concret : l'enjeu ici est normatif et géopolitique, pas opérationnel.

UEDes discussions Chine-ASEAN-UE sur l'interopérabilité robotique sont évoquées, avec un risque que des standards de facto chinois s'imposent aux intégrateurs et OEM européens souhaitant accéder aux marchés émergents.

Chine/AsieOpinion
1 source
TBD-VLA : modèle vision-langage-action à diffusion par blocs temporels
318arXiv cs.RO 

TBD-VLA : modèle vision-langage-action à diffusion par blocs temporels

Une équipe de chercheurs propose TBD-VLA (Temporal Block Diffusion Vision Language Action Model), un nouveau cadre de génération d'actions pour les modèles Vision-Language-Action (VLA) robotiques, publié le 9 juin 2026 sur arXiv (identifiant 2606.07895). L'approche repose sur la diffusion discrète par blocs temporels : les séquences d'actions sont partitionnées en blocs, à l'intérieur desquels un processus de diffusion masquée génère les tokens d'action en parallèle, tandis que la génération reste autoregressive d'un bloc à l'autre. Le modèle intègre également une fonctionnalité baptisée "Real-Time Chunking", qui permet l'exécution asynchrone des blocs d'action via un mécanisme d'interpolation temporelle (temporal in-painting). Les auteurs rapportent des gains de performance significatifs sur benchmarks en simulation et sur des tâches de manipulation en environnement réel par rapport aux approches VLA antérieures, sans préciser de métriques chiffrées dans l'abstract. L'enjeu central que TBD-VLA cherche à résoudre est double : la latence d'inférence élevée des VLA discrets classiques, et l'absence de modélisation explicite des dépendances temporelles dans les architectures de décodage parallèle récentes. Les VLA discrets standard génèrent les actions token par token de manière autoregressive, une approche précise mais trop lente pour les contraintes temps-réel d'un bras manipulateur industriel. Les tentatives précédentes de décodage parallèle accélèrent l'inférence mais sacrifient la cohérence temporelle entre tokens. TBD-VLA propose un compromis structuré : parallélisme intra-bloc pour la vitesse, autoregressivité inter-blocs pour la cohérence. Si les gains annoncés se confirment à l'échelle, cette architecture offre une voie vers des VLA déployables en milieu industriel avec des contraintes de cycle time réalistes. Le développement des VLA robotiques s'est accéléré depuis 2023 avec des modèles comme Pi-0 de Physical Intelligence (basé sur la diffusion continue), OpenVLA de l'Université de Californie Berkeley, et les approches RoboVLMs. TBD-VLA se distingue en restant dans l'espace des tokens discrets, aligné avec les architectures LLM standards, tout en empruntant à la diffusion pour la génération intra-bloc. Le papier publie un site de projet (tbd-vla.github.io) et présente des résultats sur simulation et manipulation réelle, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La prochaine étape logique serait une intégration dans des pipelines de fine-tuning sur données propriétaires, terrain sur lequel Physical Intelligence et Figure AI conservent une avance significative.

IA physiqueOpinion
1 source
Accélérer et étendre l'apprentissage par renforcement guidé par MPC pour la locomotion et la manipulation humanoïdes
319arXiv cs.RO 

Accélérer et étendre l'apprentissage par renforcement guidé par MPC pour la locomotion et la manipulation humanoïdes

Une équipe de recherche publie sur arXiv (arXiv:2606.05687v1) une méthode hybride MPC-RL pour le contrôle moteur des robots humanoïdes, baptisée MPC-RL. Le principe : intégrer un contrôleur prédictif par modèle (MPC) directement dans la boucle d'entraînement par renforcement (RL), en utilisant les trajectoires générées par le MPC comme signal de récompense basé sur la dynamique centroïdale du robot. La contribution technique centrale est un solveur GPU appelé pi-n-MPC, parallélisé à la fois sur l'horizon temporel et sur les instances de simulation, sans nécessiter de précompilation ni de construction explicite du problème à chaque pas. Les auteurs reportent des validations sur hardware réel, sans préciser les plateformes matérielles ni les cycles de tests. Le code est disponible en open source sur GitHub. L'enjeu industriel derrière ce travail est réel : le RL massif en simulation parallèle (Isaac Gym, Mujoco MJX) est devenu le standard pour entraîner des compétences de locomotion et de manipulation humanoïde, mais y injecter un MPC est historiquement coûteux en temps de construction et en mémoire GPU. Pi-n-MPC contourne ces deux goulots d'étranglement en opérant directement sur des dynamiques variables dans le temps, sans accumuler de mémoire excessive. Si les gains revendiqués se confirment à l'échelle, cela ouvre la voie à des politiques hybrides MPC/RL entraînables sur des clusters GPU standard, sans infrastructure spécialisée. Attention toutefois : le papier s'appuie sur des études comparatives internes et des validations hardware dont les conditions exactes (charges, cycles, environnements) ne sont pas détaillées dans le résumé disponible, ce qui limite l'évaluation externe des performances annoncées. La combinaison MPC-RL n'est pas nouvelle dans la recherche en locomotion : des travaux comme ceux de DeepMind sur le contrôle de quadrupèdes ou les approches whole-body de CMU et ETH Zurich ont exploré des directions similaires. La spécificité ici réside dans l'accent mis sur la scalabilité GPU et l'absence de précompilation, deux verrous pratiques qui freinent l'adoption dans les pipelines d'entraînement industriels. Les acteurs qui déploient activement des humanoïdes en environnement réel, comme Figure AI, Apptronik ou Agility Robotics, travaillent tous à réduire le sim-to-real gap sur la manipulation dextre : une infrastructure d'entraînement MPC-RL plus légère pourrait accélérer leurs cycles d'itération. La prochaine étape naturelle serait une validation sur des plateformes nommées et des tâches de manipulation avec contraintes de contact.

RecherchePaper
1 source
DexFuture : ciblage visuomoteur hiérarchique par états futurs pour la manipulation bimanuelle d'outils
320arXiv cs.RO 

DexFuture : ciblage visuomoteur hiérarchique par états futurs pour la manipulation bimanuelle d'outils

Des chercheurs ont publié DexFuture (arXiv:2606.05699), une architecture hiérarchique pour la manipulation bimanuelle dextre avec des outils. Le système se décompose en deux niveaux : un prédicteur de cibles visuomotrices futures (Future-State Visuomotor Target Predictor) en haute couche, et une politique d'exécution bas niveau conditionnée sur ces cibles (Target-Conditioned Structured Dexterous Policy). Le prédicteur exploite un flux RGB égocentrique, des données proprioceptives et un historique géométrique pour générer une trajectoire multi-étape via un transformeur conditionné sur l'horizon temporel ; le module d'exécution suit ensuite ces cibles articulation par articulation (per-link) à 60 Hz. Sur le benchmark OakInk2 de tâches bimanuelles avec outils, DexFuture atteint 90 % des performances d'un oracle disposant d'états privilégiés (informations inaccessibles en déploiement réel), contre seulement 7 % pour une politique sans référence future, et s'exécute environ 250 fois plus vite que les approches de planification CEM de type DexWM. Ce résultat est notable car il s'attaque à l'un des verrous fondamentaux de la robotique dextre : comment générer une référence future dynamiquement cohérente sans s'appuyer sur des états privilégiés issus de démonstrations humaines, et sans planification contrefactuelle lente sur des séquences d'actions à haute dimension. L'écart de performance entre la politique sans référence (7 %) et DexFuture (90 %) illustre à quel point le conditionnement sur un horizon temporel est déterminant pour la manipulation fine à deux mains. Pour les intégrateurs et décideurs B2B, l'exécution à 60 Hz est compatible avec du contrôle temps-réel sur hardware standard, là où les approches CEM nécessitaient des cycles bien trop longs pour un déploiement industriel. La séparation explicite entre prédiction sémantique lente (long horizon) et exécution haute fréquence (bas niveau) est une architecture qui se répand dans la robotique de précision, et DexFuture en fournit une validation quantitative significative sur benchmark public. Le benchmark OakInk2 est une référence académique établie pour évaluer la manipulation d'outils à deux mains avec des mains anthropomorphes, couvrant des tâches réalistes de préhension, transfert et utilisation d'outils courants. Le champ des politiques visuomotrices pour mains dextres est en pleine effervescence : DexWM (world models pour la dextérité), Pi-0 de Physical Intelligence, et les approches VLA (Vision-Language-Action) de Google DeepMind et Figure AI poussent la généralisation vers des niveaux inédits. DexFuture se distingue en ciblant la cohérence dynamique de la trajectoire future sans supervision privilégiée, une contrainte plus réaliste que les méthodes supposant un accès complet à l'état du système. L'article n'annonce ni déploiement physique ni timeline commerciale : il s'agit d'un résultat de recherche fondamentale validé en simulation et sur données de démonstration. Les étapes naturelles seraient le passage à des mains physiques (sim-to-real), l'extension à des outils non vus à l'entraînement, et l'intégration dans des pipelines VLA pour des tâches de longue durée.

RecherchePaper
1 source
Modèle vision-langage-action pour la modélisation du monde, le raisonnement et la synthèse d'actions
321arXiv cs.RO 

Modèle vision-langage-action pour la modélisation du monde, le raisonnement et la synthèse d'actions

Des chercheurs présentent WLA (World-Language-Action), une nouvelle classe de modèles de fondation incarnés pour la robotique, dans un preprint arXiv publié début juin 2026. Le modèle prototype WLA-0, fort de 2 milliards de paramètres actifs, prend en entrée des instructions textuelles, des images et l'état du robot pour générer simultanément des sous-tâches textuelles, des images de sous-objectifs et des commandes motrices. Sur l'NVIDIA RTX 5090, le temps d'inférence est de 40 ms par cycle, ce qui reste dans les plages acceptables pour le contrôle temps réel. Les évaluations atteignent 92,94 % de taux de succès sur le benchmark RoboTwin2.0 Clean et 56,5 % sur RMBench, deux protocoles de référence pour les tâches multi-objets et longue portée. L'intérêt architectural réside dans la fusion de deux paradigmes jusqu'ici distincts : le world modeling, qui consiste à apprendre une représentation prédictive du monde à partir de vidéos égocentrées, et le language reasoning propre aux modèles VLA (Vision-Language-Action) tels que Pi-0 ou OpenVLA. WLA opte pour un backbone Transformer autorégressif plutôt que le Transformer de diffusion bidirectionnel utilisé dans les WAM (World-Action Models), ce qui permet de prédire l'état suivant en deux niveaux complémentaires : intention sémantique textuelle d'un côté, dynamiques physiques fines de l'autre. Un mécanisme de meta-queries rend l'influence du world modeling implicite à l'inférence, mais peut être activé pour du test-time scaling, technique qui améliore le contrôle en allouant davantage de calcul à l'exécution. La capacité annoncée d'apprendre de nouvelles tâches à partir de vidéos cross-embodiment sans annotations d'actions est notable, mais reste à valider sur des robots hétérogènes en dehors d'environnements simulés. WLA s'inscrit dans une course dense à l'unification des modèles robotiques. Face à Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui misent chacun sur des architectures diffusion ou VLA, WLA propose une troisième voie autoregressive combinant génération de sous-objectifs visuels et raisonnement linguistique. L'article reste un preprint non validé par les pairs, sans déploiement industriel annoncé. Les prochaines étapes naturelles seraient une évaluation sur des plateformes physiques variées et des benchmarks réels, les performances simulées étant connues pour surestimer les capacités en conditions d'exploitation. Aucun acteur européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source
Pourquoi l'usinage suisse de précision est essentiel à l'avenir de la robotique et de l'automatisation
322Robotics & Automation News 

Pourquoi l'usinage suisse de précision est essentiel à l'avenir de la robotique et de l'automatisation

L'essor mondial de la robotique industrielle et des systèmes de fabrication intelligente génère une demande croissante pour des composants mécaniques usinés avec une précision extrême. Les robots collaboratifs, les systèmes d'assemblage automatisé et les équipements de production pilotés par capteurs reposent sur des pièces dont les tolérances s'expriment en microns. L'usinage de décolletage suisse (Swiss machining), technique CNC spécialisée dans la production de pièces cylindriques de petits diamètres à très haute précision, s'impose comme un maillon critique de cette chaîne d'approvisionnement, notamment pour les axes, arbres, vis-mères et composants de transmission intégrés dans les actionneurs et joints des bras robotiques. L'enjeu est structurel : un robot industriel ou collaboratif ne peut maintenir ses performances en production continue que si chaque composant respecte des tolérances serrées sur la durée. Une pièce légèrement hors cote dans un réducteur harmonique ou un rail de guidage peut induire des dérives cumulatives qui compromettent la répétabilité, paramètre central pour tout déploiement en ligne d'assemblage. Cela positionne les sous-traitants en décolletage suisse comme des fournisseurs de premier rang pour les intégrateurs robotiques, au même titre que les fournisseurs de motoréducteurs ou d'électronique embarquée. À noter : l'article reste de niveau "livre blanc promotionnel" et ne cite aucune métrique concrète ni aucun client. Le décolletage suisse est une industrie centenaire dominée par des acteurs européens, notamment en Suisse (canton de Neuchâtel) et dans le Jura français (Arc jurassien), ainsi qu'au Japon et en Allemagne. Face à la montée en charge des commandes robotiques, portée par Figure AI, Boston Dynamics, 1X Technologies ou encore le français Enchanted Tools, ces sous-traitants de précision se retrouvent en position stratégique, à condition d'investir dans l'automatisation de leur propre production pour tenir les volumes demandés par une industrie qui s'industrialise rapidement.

UELes sous-traitants en décolletage de l'Arc jurassien français sont directement positionnés comme fournisseurs stratégiques pour la vague de commandes robotiques mondiale, mais devront investir dans leur propre automatisation pour tenir les volumes.

FR/EU ecosystemeActu
1 source
SplitAdapter : loco-manipulation humanoïde sensible à la charge par adaptation factorisée
323arXiv cs.RO 

SplitAdapter : loco-manipulation humanoïde sensible à la charge par adaptation factorisée

SplitAdapter est une architecture présentée sur arXiv (identifiant 2606.03297) visant à améliorer le contrôle de robots humanoïdes en loco-manipulation, soit la combinaison simultanée de la marche bipède et de la manipulation d'objets physiques. Le système part d'une politique de manipulation de boîtes préentraînée qu'il fige, puis lui greffe deux encodeurs de contexte indépendants : l'un capture les propriétés de la charge et de l'objet saisi, l'autre modélise les dynamiques internes du robot. Ces représentations sont injectées via une modulation FiLM hiérarchique (Feature-wise Linear Modulation), combinée à des objectifs split world-model et une régularisation cross-adversariale par gradient reversal (GRL). Les expériences couvrent des objets de 2, 4 et 6 kg, à des hauteurs de prise et de dépôt de 0, 30 et 60 cm, testés en sim-to-sim puis en déploiement sur robot réel. SplitAdapter améliore le taux de succès en tâche complète face à la politique de base et aux baselines FiLM à encodeur unique, avec les gains les plus marqués sous forte charge (6 kg). L'enjeu central est le transfert sim-to-réel sous charge variable : lorsqu'un humanoïde soulève un objet lourd, ses dynamiques changent sensiblement, et les adaptateurs existants qui fusionnent tous les signaux dans une seule représentation latente tendent à perdre en robustesse précisément dans les conditions les plus critiques. La factorisation proposée, un encodeur par source de variation, maintient une séparation explicite entre les incertitudes liées à l'objet et celles liées au robot, ce qui se révèle plus stable sous conditions extrêmes. Pour un intégrateur ou un OEM industriel, cela suggère qu'une politique généraliste préentraînée peut être adaptée modulairement selon la charge sans réentraînement complet, une propriété utile pour des lignes de production où les objets manipulés varient fréquemment. La loco-manipulation sur humanoïdes concentre des investissements massifs : Figure AI déploie son Figure 03 chez BMW, Boston Dynamics pousse Atlas en partenariat avec Hyundai, et des labos comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2) misent sur des politiques généralisables de type VLA (Vision-Language-Action). SplitAdapter prend un pari différent, adapter une politique spécialisée existante plutôt que d'en entraîner une nouvelle de bout en bout, ce qui réduit les coûts de calcul mais soulève la question de la généralisabilité hors distribution. Le papier est une préimpression arXiv soumise début juin 2026, non encore évaluée par les pairs ; aucun déploiement industriel ni pilote commercial n'est annoncé à ce stade.

IA physiquePaper
1 source
PHASOR : représentations d'actions universelles ancrées en phase pour les humanoïdes
324arXiv cs.RO 

PHASOR : représentations d'actions universelles ancrées en phase pour les humanoïdes

Une équipe de chercheurs a publié sur arXiv (2606.01851) PHASOR, un cadre de représentation d'actions conçu pour l'apprentissage de politiques sur robots humanoïdes. Le problème ciblé est fondamental : les méthodes actuelles produisent des espaces latents opaques, non structurés et liés à une plateforme spécifique. PHASOR exploite la périodicité intrinsèque du mouvement en le factorisant en deux composantes : un manifold de phase capturant les structures cycliques via des coefficients FFT (transformée de Fourier rapide), et une branche de pose conditionnant ce manifold sur les configurations non périodiques. Combiné à une distillation de sémantique de mouvement, le système produit un espace de représentations agnostique à l'embodiment, pré-entraîné sur des données de mouvement humain et transférable à plusieurs plateformes humanoïdes de morphologies différentes. L'enjeu industriel est direct. Les architectures actuelles obligent à ré-entraîner les politiques à chaque changement de plateforme matérielle, un coût élevé pour les intégrateurs gérant des flottes hétérogènes. PHASOR traite l'espace d'embedding d'actions comme un objet de conception à part entière : la qualité de la politique émerge de la qualité de la représentation. Les résultats publiés montrent des gains cohérents sur les tâches robotiques en aval et une forte capacité de récupération cross-embodiment, c'est-à-dire qu'un mouvement appris sur un robot peut être retrouvé et transféré à un autre. Il s'agit toutefois d'un preprint sans revue par les pairs, ce qui invite à rester prudent sur la portée des benchmarks présentés. La question du transfert inter-embodiment est au coeur de la compétition humanoïde. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), NVIDIA (GR00T N2) et Agility Robotics développent chacun des architectures de politiques rarement compatibles entre elles. Des travaux comme RT-2 ou OpenVLA avaient montré l'utilité du pré-entraînement sur données humaines pour la vision et le langage, mais l'espace d'actions restait un angle mort. PHASOR s'attaque directement à ce manque. Les prochaines étapes naturelles passeraient par une validation sur plateformes physiques, Unitree H1/H2 ou Apollo d'Apptronik en tête, et une confrontation avec des benchmarks standardisés comme HumanoidBench.

IA physiquePaper
1 source
Feat2Go : estimation de valeur par ancrage visuel pour l'apprentissage par renforcement incarné
325arXiv cs.RO 

Feat2Go : estimation de valeur par ancrage visuel pour l'apprentissage par renforcement incarné

Feat2Go est un framework de recherche présenté sur arXiv (2605.30795, mai 2026) qui s'attaque à un verrou persistant dans l'entraînement des modèles vision-langage-action (VLA) : générer automatiquement des signaux de récompense denses pour l'apprentissage par renforcement (RL) sur des tâches de manipulation longue portée. Le système décompose automatiquement un épisode robotique en étapes sémantiques via un clustering orienté tendances, puis mesure la progression par similarité au niveau patch entre l'état courant et des sous-objectifs visuels extraits d'un world model visuel pré-entraîné. Un modèle de valeur incarné prédit ensuite ce progrès à partir de l'observation et de l'instruction textuelle, et le signal est utilisé pour reformuler les récompenses terminales lors de l'optimisation de politique, sans ingénierie manuelle des récompenses. Les résultats sur deux benchmarks de référence sont nets : sur ManiSkill3, OpenVLA-OFT passe d'un taux de succès hors distribution de 17,5 % à 82,9 % tout en maintenant 96,9 % en distribution ; sur RoboTwin 2.0, Feat2Go atteint 88,8 % de succès moyen en domain randomization, dépassant les méthodes RL antérieures. Le framework est compatible avec PPO et GRPO, et couvre manipulation bras unique et bras bimanuels. L'intérêt de cette contribution est qu'elle attaque un problème structurel du RL robotique : soit on conçoit à la main des fonctions de récompense tâche par tâche, soit on reste captif de lourds datasets d'imitation. Feat2Go contourne ces deux contraintes en extrayant automatiquement un signal de progrès granulaire depuis un world model, ce qui le rend théoriquement compatible avec des architectures VLA existantes sans modification majeure du pipeline. Un saut de 17,5 % à 82,9 % hors distribution représente un écart brut significatif, mais il faut souligner que ces chiffres restent obtenus en simulation : la chaîne sim-to-real n'est pas validée sur hardware réel, une limite habituelle mais non négligeable. Cette approche s'inscrit dans une tendance large où le RL sert de couche de fine-tuning au-dessus de fondations VLA pré-entraînées, après des travaux récents comme π0 de Physical Intelligence, GROOT N2 de NVIDIA, ou les architectures de 1X et Figure AI. La question du signal de récompense était le chaînon manquant dans ce paradigme ; Feat2Go propose une réponse agnostique au modèle. Aucun partenariat industriel ni déploiement terrain n'est annoncé, la contribution restant académique à ce stade.

RechercheOpinion
1 source
Atlas apprend des compétences de football en regardant des images de Coupe du monde
326Interesting Engineering 

Atlas apprend des compétences de football en regardant des images de Coupe du monde

À quelques semaines de la Coupe du Monde 2026, Boston Dynamics a publié une vidéo montrant son robot humanoïde Atlas observer des séquences de matchs passés diffusées sur un grand écran, puis reproduire les gestes des joueurs dans une zone d'entraînement adjacente. Dans les séquences présentées, Atlas déplace son centre de gravité, balance la jambe vers l'avant et guide un ballon au sol avec un contact contrôlé. Le robot enchaîne ensuite une série d'exercices inspirés du football -- passes, pivots, contrôles de balle -- conçus pour travailler l'équilibre, la coordination et le timing des mouvements. La vidéo montre également Atlas lever les bras en signe de célébration après un exercice réussi, puis s'agenouiller pour simuler la réaction à une blessure sur le terrain, des gestes que Hyundai, maison mère de Boston Dynamics, présente comme copiés directement depuis les images de match visionnées. La société a baptisé l'initiative "School of Football" et évoque l'intention de déployer Atlas et le robot quadrupède Spot lors du Mondial 2026, sans préciser leur rôle exact. Cette démonstration s'inscrit dans une séquence de communications rapprochées destinées à montrer qu'Atlas peut acquérir des comportements moteurs complexes sans programmation mouvement-par-mouvement. Techniquement, le pipeline ne repose pas sur une "observation" au sens perceptif : Atlas est entraîné par reinforcement learning en simulation massivement parallèle sur GPU, à partir de trajectoires de référence issues d'animations ou de démonstrations téléopérées. Le robot accumule ce que Boston Dynamics décrit comme des millions d'heures de pratique simulée, en apprenant à maintenir équilibre et prise pendant que des perturbations externes sont introduites. Ce qui distingue Atlas des systèmes vision-only est son recours à la proprioception -- perception interne de la position du corps, de la charge et de l'équilibre -- pour s'adapter en temps réel à des objets instables, comme l'avait illustré une démonstration récente où le robot portait un réfrigérateur de 45 kg tout en conservant l'équilibre. Ces résultats indiquent une progression réelle vers des comportements adaptatifs, même si les conditions des démonstrations restent soigneusement sélectionnées et contrôlées. Boston Dynamics, fondée en 1992 au MIT et rachetée par Hyundai en 2021, a dévoilé la version entièrement électrique d'Atlas en avril 2024, après avoir mis fin au modèle hydraulique. La filiale positionne désormais Atlas comme un "outil polyvalent pour le travail physique", ciblant explicitement les usines, entrepôts et chantiers plutôt que les démonstrations spectaculaires. Dans la course aux humanoïdes industriels, elle fait face à des concurrents directs : Figure AI avec le Figure 03, Tesla avec l'Optimus Gen 3, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, et Agility Robotics avec Digit. L'initiative "School of Football" et l'association au Mondial 2026 ressemblent davantage à une opération de visibilité grand public qu'à une annonce produit structurée -- aucun déploiement commercial, aucun partenaire client, aucune timeline n'ont été communiqués. Les jalons à surveiller restent les annonces de pilotes industriels, l'évolution du partenariat avec Hyundai sur les chaînes de fabrication automobile, et la publication éventuelle de métriques de performance en conditions réelles.

HumanoïdesOpinion
1 source
Vidéo : ce robot humanoïde chinois à 42 000 $ associe mouvement en temps réel, vision et contrôle intelligent
327Interesting Engineering 

Vidéo : ce robot humanoïde chinois à 42 000 $ associe mouvement en temps réel, vision et contrôle intelligent

LimX Dynamics, société chinoise de robotique fondée à Shenzhen, a présenté publiquement pour la première fois son humanoïde Luna lors du Taobao Influencer Festival en mars 2026, marquant selon l'entreprise la première démonstration publique mondiale de cette plateforme. Luna mesure 160 cm, dispose de 27 degrés de liberté et embarque le moteur de mouvement propriétaire Sys 0 de deuxième génération, couplé à des moteurs articulaires redessinés. L'engin est taillé pour des performances dynamiques à corps entier : danse, gymnastique, défilé. Sur le plan thermique, LimX annonce une réduction de 30 % de la température de surface des articulations en opération prolongée, et une autonomie batterie améliorée de 150 %. Le tout est proposé à 298 000 RMB, soit environ 41 000 dollars. À ce prix, Luna n'est pas positionnée comme robot industriel de manutention, mais comme plateforme d'interaction en environnement public. Elle intègre également un éditeur de tâches en langage naturel et une fonction video-to-motion permettant de répliquer des mouvements à partir de vidéos uploadées. Ce lancement illustre une tendance nette dans la robotique humanoïde chinoise : l'accent mis sur la commercialisation rapide plutôt que sur la recherche académique. Le positionnement de Luna, orienté interaction grand public et déploiement sans code, cible des intégrateurs et des opérateurs événementiels davantage que les lignes d'assemblage automobile. La démonstration synchronisée des 18 robots Oli, autre modèle de LimX (165 cm, 55 kg, bras à 7 DOF, portée de 70 cm, charge utile de 10 kg), est plus pertinente pour les décideurs industriels : elle illustre une capacité de déploiement coordonné autonome qui reste rare à cette échelle. Cela dit, les métriques annoncées méritent prudence : les améliorations thermiques et d'autonomie sont présentées sans conditions de test précises, et les vidéos publiées restent sélectionnées, ce qui rend difficile l'évaluation du gap simulation-réalité réel. LimX Dynamics opère dans un secteur sous forte pression concurrentielle. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Apptronik (Apollo) animent le segment occidental, pendant que côté chinois, Unitree, Agibot et Fourier Intelligence disputent le même territoire. LimX se distingue par son architecture logicielle COSA, présentée comme un système d'exploitation cognitif gérant le contrôle de mouvement corps entier via des modèles physiques basse latence, et par la plateforme modulaire Tron 2 qui décline en configurations bimanuelle, bipède complète et biped-sur-roues. Ces briques technologiques suggèrent une stratégie de plateforme plutôt que de produit unique. Les prochaines étapes vraisemblables incluent des pilotes en environnements retail et événementiel en Chine, avant une tentative d'internationalisation dans des marchés où le coût d'entrée à 41 000 dollars reste compétitif face aux offres occidentales souvent non tarifées publiquement.

UELe positionnement tarifaire à 41 000 $ d'un humanoïde polyvalent chinois intensifie la pression concurrentielle sur les développeurs européens de robots humanoïdes comme Enchanted Tools ou Wandercraft, dont les prix restent non publiés.

Chine/AsieOpinion
1 source
Débruitage par priorité d'action pour un découpage fluide en temps réel
328arXiv cs.RO 

Débruitage par priorité d'action pour un découpage fluide en temps réel

Une équipe de chercheurs a publié le 26 mai 2026 sur arXiv (réf. 2605.25537) une méthode baptisée Soft RTC (Soft Real-Time Chunking), visant à rendre les politiques d'action par blocs plus fluides lorsqu'elles opèrent sous délai d'inférence. Le problème de départ est concret : les politiques de type diffusion génèrent les commandes motrices en « chunks » (séquences d'actions), mais l'inférence prend du temps. Le RTC standard résout cela en conditionnant chaque nouveau chunk sur les actions déjà engagées par le précédent, grâce à un masque binaire de préfixe. Soft RTC remplace ce masque binaire par un mécanisme de dénaturation partielle (action-prior denoising) : les tokens de chevauchement entre deux chunks ne partent plus d'un bruit pur, mais d'états partiellement dénaturés, alignés sur le chunk précédent via une règle de mélange par token. Sur les 12 niveaux Kinetix publiés (environnements de simulation de manipulation complexe), un fenêtrage "soft" court atteint un taux de résolution de 0,809 contre 0,815 pour le hard RTC, soit un écart marginal. Un fenêtrage medium réduit quant à lui le delta d'action et le jerk (à-coup) en régime de fort délai de respectivement 9,1 % et 9,6 % par rapport au hard RTC classique. Une étude préliminaire sur robot réel en tri d'objets confirme l'amélioration de la complétion et donne à Soft RTC les meilleures métriques de douceur de commande parmi les politiques testées. L'enjeu pour la robotique industrielle est précis : le jerk élevé, c'est l'usure mécanique, les alarmes de sécurité, et l'impossibilité de travailler en cobotique. Les politiques de diffusion pour la manipulation (pi-0 de Physical Intelligence, ACT, Diffusion Policy) ont démontré des capacités de généralisation impressionnantes, mais leur déploiement en temps réel reste contraint par la latence d'inférence, typiquement plusieurs centaines de millisecondes sur GPU embarqué. Hard RTC avait déjà attaqué ce problème ; Soft RTC prouve qu'on peut gagner significativement en douceur de mouvement sans sacrifier ni le taux de succès ni le coût computationnel, les deux variantes conservent un overhead « quasi-naïf » à l'inférence, sans guidance coûteuse au déploiement. Ce résultat contredit l'idée que fluidité et performance sont nécessairement en tension dans les politiques diffusion pour la manipulation. La problématique du délai d'inférence dans les politiques d'action par diffusion est active depuis que ces architectures ont montré leur supériorité en manipulation dextère, notamment avec les travaux de Stanford (Diffusion Policy, 2023) et de Physical Intelligence (pi-0, 2024). Le hard RTC de référence avait établi une baseline robuste mais au prix de transitions sèches entre chunks. Côté acteurs, Physical Intelligence, Unitree, Figure AI et les équipes de Google DeepMind (GR00T, RT-2) travaillent tous sur des politiques à base de diffusion pour leurs humanoïdes et bras manipulateurs. Soft RTC s'inscrit dans la couche d'inférence basse latence de ces systèmes, indépendamment de l'architecture VLA sous-jacente. Aucun partenaire industriel ni timeline de déploiement n'est mentionné, il s'agit d'une contribution de recherche, avec code et niveaux Kinetix publiés, mais sans implémentation industrielle annoncée à ce stade.

RecherchePaper
1 source
Apprentissage en boucle fermée d'un modèle du monde vidéo et d'une politique VLA
329arXiv cs.RO 

Apprentissage en boucle fermée d'un modèle du monde vidéo et d'une politique VLA

Une équipe de chercheurs a publié en février 2026 sur arXiv (identifiant 2602.06508v2) World-VLA-Loop, un cadre d'entraînement qui couple un modèle de monde vidéo et une politique VLA (Vision-Language-Action) dans une boucle d'amélioration mutuelle. Le problème de départ est concret : raffiner une politique VLA par apprentissage par renforcement (RL) dans le monde physique coûte cher, entre les rollouts répétés, les remises à l'état initial, la supervision humaine et les risques de sécurité. Les approches existantes utilisent des modèles de monde vidéo conditionnés sur les actions comme simulateurs virtuels, mais ces simulateurs peinent à reproduire les échecs proches du succès ("near-success failures") et ne produisent pas nativement de signal de récompense. World-VLA-Loop propose deux innovations fondamentales : SANS, un protocole de curation qui mélange délibérément trajectoires réussies et trajectoires quasi-réussies pour améliorer l'alignement action-résultat ; et un modèle de monde vidéo "state-aware" qui prédit simultanément frames futures et récompenses binaires à partir des latents de diffusion, intégrant l'estimation de récompense directement dans le générateur plutôt que dans un module séparé. L'apport principal est d'adresser le problème du décalage de distribution dynamique. Lorsqu'une politique VLA évolue pendant le RL, un simulateur figé se désaligne progressivement avec la politique mise à jour. World-VLA-Loop ferme cette boucle en réinjectant les rollouts de chaque politique améliorée pour affiner le modèle de monde, lequel alimente à son tour le post-entraînement VLA suivant. Cette co-évolution itérative réduit la dépendance aux interactions physiques coûteuses. Les expériences couvrent des environnements de simulation et des robots réels, avec des améliorations de performance significatives annoncées, bien que les métriques précises et les benchmarks ne soient pas détaillés dans le résumé disponible, ce qui limite l'évaluation indépendante à ce stade. Ce travail s'inscrit dans l'essor rapide des politiques VLA depuis 2024 : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA ou Helix de Figure AI constituent l'écosystème de référence. L'enjeu commun est de dépasser le behavior cloning pur pour intégrer du RL sans exploser les coûts de collecte de données réelles. World-VLA-Loop reste un preprint académique en attente de révision par les pairs, sans déploiement industriel annoncé. Les concurrents directs sur la thématique des world models appliqués à la robotique incluent DreamerV3 et les approches de Google DeepMind. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation plus complexes et une comparaison quantitative publiée contre ces baselines.

IA physiqueOpinion
1 source
Comparaison des performances des algorithmes d'échantillonnage classiques et neuronaux pour la navigation robotique
330arXiv cs.RO 

Comparaison des performances des algorithmes d'échantillonnage classiques et neuronaux pour la navigation robotique

Une équipe de chercheurs a publié sur arXiv (référence 2505.25010) une étude comparative de trois algorithmes de planification de trajectoire par échantillonnage appliqués à la navigation robotique et aux drones : RRT (l'algorithme de référence basé sur les arbres aléatoires exploratoires), Neural RRT et Neural Informed RRT, ces deux derniers intégrant des réseaux de neurones pour guider la phase d'échantillonnage. Les tests ont été conduits dans des environnements simulés comportant des obstacles convexes et concaves à densités variables. Les résultats montrent que les variantes neurales génèrent des chemins jusqu'à 14% plus courts et des trajectoires 55 à 75% plus lisses que l'algorithme classique. Neural Informed RRT obtient les meilleures performances globales sur les deux critères évalués, au prix d'une légère hausse du temps de calcul non chiffrée dans l'abstract. Pour un intégrateur de flotte AMR (robots mobiles autonomes) ou un responsable technique travaillant sur des drones d'inspection, une réduction de 55 à 75% de la rugosité de trajectoire se traduit directement par moins de sollicitations mécaniques, une meilleure durée de vie des actionneurs et une consommation énergétique réduite. Le gain de 14% sur la longueur de chemin représente un avantage cumulatif significatif sur des cycles répétitifs en entrepôt ou en milieu industriel. L'étude valide l'hypothèse que le neural sampling peut améliorer la qualité du planificateur sans remplacer entièrement le moteur classique, une architecture hybride qui facilite l'intégration dans les pipelines existants. Le surcoût computationnel reste cependant non quantifié précisément dans les résultats publiés, ce qui limite l'évaluation de la viabilité temps-réel sans accès au corpus complet. La planification par échantillonnage repose sur RRT*, algorithme asymptotiquement optimal formalisé par Karaman et Frazzoli en 2011 et devenu un standard dans les frameworks open-source OMPL et MoveIt 2. L'injection de réseaux de neurones dans la phase d'échantillonnage est explorée depuis plusieurs années via des approches comme MPNet (2019) ou NeuralRRT, qui biaisent l'exploration vers les zones de l'espace prometteuses plutôt que d'échantillonner uniformément. Ce preprint, non encore peer-reviewed au moment de sa publication, s'inscrit dans un courant plus large de planification hybride classique/IA également suivi par des équipes chez Boston Dynamics, Skydio, et dans les laboratoires de manipulation de Figure AI ou 1X Technologies. La prochaine étape logique est une validation sur hardware réel avec des benchmarks standardisés, indispensable avant tout déploiement industriel.

RecherchePaper
1 source
MIND : contrôle de robot humanoïde par diffusion d'intention multi-échelle guidée par le texte
331arXiv cs.RO 

MIND : contrôle de robot humanoïde par diffusion d'intention multi-échelle guidée par le texte

Des chercheurs ont publié fin mai 2026 sur arXiv (2605.26006) MIND, un cadre de contrôle d'humanoïdes simulés piloté par commandes textuelles. Le système traduit une instruction en langage naturel en actions moteur de bas niveau via un mécanisme de diffusion multi-échelle. Deux composants cohabitent : un prédicteur d'intention globale, qui capture la dynamique générale du mouvement, et un prédicteur d'intention immédiate, qui raffine le geste à chaque itération du processus de diffusion. Clé du dispositif : les états internes de l'humanoïde sont encodés dans un espace latent et servent de pont sémantique entre le texte et les commandes moteur. Le code source sera mis en accès ouvert pour faciliter la reproductibilité. L'apport de MIND est de contourner deux limitations structurelles bien documentées dans la littérature. Les pipelines en deux étapes, génération cinématique puis suivi physique, souffrent d'un décalage de domaine entre les deux modules, ce qui dégrade la qualité des comportements générés. Les approches bout-en-bout par imitation directe texte-vers-actions buttent sur l'écart sémantique entre langage naturel et signaux de bas niveau. En positionnant les états internes de l'humanoïde comme médiateur, sémantiquement plus proches du texte que les couples articulaires bruts, MIND réduit ce double handicap. Les benchmarks expérimentaux montrent des gains en cohérence physique et en alignement sémantique face aux méthodes de référence, bien que ces évaluations restent en environnement simulé, sans validation sur hardware réel. Le contrôle d'humanoïdes par langage naturel se situe à l'intersection du reinforcement learning, de l'animation physique et des grands modèles de langage. Des travaux antérieurs comme PHC ou les modèles de diffusion de mouvement (MDM, MotionDiffuse) ont établi les bases cinématiques que MIND cherche à dépasser sur le plan de la plausibilité physique. Côté industriel, Figure AI, Boston Dynamics et Unitree Robotics explorent des pipelines texte-vers-mouvement pour leurs plateformes hardware, mais la majorité des démos publiées restent en simulation ou sur des tâches très contraintes. MIND s'inscrit dans la recherche fondamentale sans annoncer de déploiement concret ; son impact réel dépendra de sa capacité à franchir le sim-to-real gap, défi central non résolu pour le contrôle de corps entier.

HumanoïdesPaper
1 source
Atlas affronte un réfrigérateur
332IEEE Spectrum Robotics 

Atlas affronte un réfrigérateur

La semaine robotique a été dominée par une vidéo de Boston Dynamics montrant Atlas déplacer un mini-réfrigérateur, quelques mois seulement après le dévoilement public de la plateforme. La démonstration ne se limite pas à un exercice de force brute : le robot mobilise l'intégralité de son corps pour gérer la masse et l'inertie de l'objet, en compensant dynamiquement avec son buste et ses membres inférieurs plutôt qu'en s'appuyant uniquement sur ses préhenseurs. C'est le contrôle corps-entier (whole-body control) couplé à de l'apprentissage par renforcement qui permet à Atlas de maintenir l'équilibre avec une amplitude de mouvement décrite comme suprahumaine. La même séquence vidéo révèle à 4 min 10 un comportement inattendu dont la nature précise n'est pas détaillée dans le communiqué, signe que la plateforme continue de surprendre ses propres ingénieurs. En parallèle, Unitree a publié une vidéo de son G1 commandé en temps réel par voix, enregistrée en une seule prise avec son audio d'origine. Dusty Robotics a officiellement retraité son FieldPrinter 1, remplacé par le FieldPrinter 2, plus rapide et plus compact, après avoir imprimé des millions de pieds carrés de gabarits sur des milliers de chantiers de construction. DEEP Robotics présente le Lynx S10, un robot tout-terrain de moins de 20 kg ciblant l'industrie. JSK Robotics Laboratory soumet à l'ICRA 2026 ses travaux sur WiXus, un robot hybride roues-jambes affranchissant les membres de leur rôle locomoteur grâce à un support corporel externe. La progression d'Atlas illustre un saut qualitatif dans la capacité des humanoïdes à opérer en environnement industriel non structuré. Le whole-body control sur un objet lourd et asymétrique comme un réfrigérateur est un test pratique bien plus représentatif que les démonstrations gymniques habituelles : il exige une modélisation en ligne de la masse portée, une compensation dynamique en temps réel, et une tolérance aux perturbations imprévues. Que Boston Dynamics s'appuie sur l'apprentissage par renforcement plutôt que sur une planification de mouvement entièrement analytique confirme une tendance de fond : les pipelines RL et sim-to-real arrivent progressivement à maturité pour des tâches de manutention réelle. Il convient néanmoins de préciser qu'il s'agit d'une démonstration contrôlée, pas d'un bilan de déploiement en production, ce que le communiqué ne distingue pas clairement. Boston Dynamics a lancé la version électrique d'Atlas en avril 2024, succédant à la plateforme hydraulique qui avait fait la notoriété de la société depuis sa fondation en 1992, spin-off du MIT. Depuis son acquisition par Hyundai en 2021, l'entreprise affiche une orientation commerciale plus explicite, ciblant en priorité l'automobile et la logistique lourde. Sur le terrain concurrentiel, Unitree positionne le G1 comme solution d'entrée de gamme à partir de 16 000 dollars, Figure AI prépare le déploiement de Figure 02 chez BMW, et Tesla pousse Optimus vers une production en série. Le SpikerBot de Backyard Brains, kit à 219 dollars déjà financé sur Kickstarter, occupe un créneau radicalement différent, celui de la robotique éducative à programmation neuronale directe, rappelant que l'innovation sectorielle ne se joue pas uniquement dans les entrepôts.

HumanoïdesActu
1 source
Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur
333arXiv cs.RO 

Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur

Des chercheurs ont déposé en mai 2026 sur arXiv (arXiv:2605.22021) un framework de manutention dual-bras conçu pour la manipulation industrielle de colis dont la masse et le centre de masse sont inconnus à l'avance. Le système s'appuie sur deux composants couplés : une estimation en temps réel des propriétés inertielles de l'objet à partir des torseurs de contact mesurés (forces et moments aux points de préhension), et un optimiseur convexe de type SOCP (second-order cone program, programme conique du second ordre) qui calcule des forces de contact compatibles avec les contraintes de friction, modélisées par des surfaces limites ellipsoïdales. Une étape de raffinement de trajectoire hors-ligne complète le pipeline pour éviter les contacts indésirables entre l'objet et l'environnement en présence de contraintes géométriques. Les expériences ont été réalisées sur un robot dual-bras réel soumis à plusieurs configurations de centre de masse, sans connaissance préalable des propriétés inertielles. L'enjeu est direct pour les intégrateurs en logistique industrielle : les bras robotiques doivent manipuler des colis dont le contenu varie (masse, répartition du poids, centre de gravité décentré), et les approches classiques génèrent glissements, chutes, déviations d'orientation ou serrage excessif endommageant les produits. La contribution principale est de traiter la faisabilité de friction comme une contrainte dure plutôt qu'un objectif de régulation séparé à calibrer, unifiant ainsi slip avoidance et évitement de l'écrasement dans un seul problème d'optimisation. Pour un responsable de ligne de palettisation, cela signifie moins de paramétrage manuel à chaque changement de référence produit et une meilleure robustesse aux variabilités de conditionnement, deux points de friction concrets dans les déploiements actuels. La manipulation dual-bras d'objets à propriétés inertielles inconnues est un problème ouvert depuis plusieurs années, adressé par des approches allant du contrôle en force classique jusqu'à l'apprentissage par renforcement. Plusieurs acteurs commerciaux proposent des cellules dual-bras pour la logistique : ABB avec le YuMi, Fanuc, et des startups comme Apptronik ou Figure AI qui intègrent des manipulateurs dans des plateformes humanoïdes. Ce travail reste au stade de la publication académique en preprint, sans affiliation commerciale identifiée, sans données de cycle time ni de volume de déploiement. Les expériences décrites constituent une preuve de concept sur système réel plutôt qu'un déploiement industriel, et les suites naturelles seraient l'intégration dans des cellules de palettisation ou de dépalettisation automatisées, un marché en forte croissance porté par la pression logistique de l'e-commerce.

UELes intégrateurs européens en logistique industrielle, notamment autour des cellules dual-bras ABB (YuMi) et KUKA, pourraient exploiter cette approche pour réduire le paramétrage manuel face à des conditionnements à masse variable.

RecherchePaper
1 source
Manipulation corps entier des humanoïdes via un cerveau spatial actif et un cervelet d'action généralisable
334arXiv cs.RO 

Manipulation corps entier des humanoïdes via un cerveau spatial actif et un cervelet d'action généralisable

Des chercheurs ont publié le 27 mai 2026 un preprint (arXiv:2605.21133) présentant un framework de loco-manipulation pour robots humanoïdes baptisé ASB-GAC, articulé autour de deux modules distincts. Le premier, Active Spatial Brain (ASB), assure la perception spatiale active et la planification de tâches en décomposant les objectifs en sous-tâches. Le second, Generalizable Action Cerebellum (GAC), traduit ces décisions en commandes moteur exécutables sur robot réel. L'approche s'appuie sur des grands modèles multi-agents pour orchestrer perception et génération d'actions. Les auteurs ont conçu un jeu de tâches de manipulation spatiale dépassant le cadre classique de la table rase, couvrant des environnements 3D avec des relations spatiales variées, et mesurent les performances sur deux axes : compréhension spatiale et exécution physique réelle. Le point saillant de ce travail est l'affirmation que GAC génère des actions robot exécutables sans données réelles spécifiques à chaque tâche, ce qui s'attaque directement au goulot d'étranglement majeur du secteur : collecter des trajectoires sur robot physique coûte cher et ne se généralise pas. Si la validité de cette approche se confirme au-delà des benchmarks maison, cela pourrait réduire significativement le cycle de développement pour les intégrateurs cherchant à déployer des humanoïdes sur des tâches variées d'entrepôt ou d'assemblage. Toutefois, le preprint ne fournit pas de métriques de cycle time, de taux de succès détaillés ni de comparaisons quantitatives directes avec des baselines comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA), ce qui limite l'évaluation indépendante des claims de généralisation. Ce travail s'inscrit dans une dynamique de recherche très active sur la manipulation whole-body, où la fracture entre simulation et réalité reste un verrou central. Des acteurs comme Figure AI avec Figure 03, Tesla avec Optimus Gen 3, ou Physical Intelligence avec pi0 ont tous investi massivement dans la collecte de données réelles pour combler ce fossé. L'approche sim-to-real et l'utilisation de VLA (Vision-Language-Action models) comme vecteur de généralisation sont aujourd'hui les deux grandes stratégies concurrentes. Ce preprint propose une troisième voie par décomposition hiérarchique via LLM multi-agents, mais sans nom d'entreprise, sans robot cible identifié, et sans annonce de pilote industriel : il s'agit pour l'instant d'un résultat académique à surveiller avant tout transfert vers le terrain.

IA physiquePaper
1 source
Introduction à l'apprentissage par renforcement profond et par imitation
335arXiv cs.RO 

Introduction à l'apprentissage par renforcement profond et par imitation

Un document de référence publié sur arXiv (identifiant 2512.08052, troisième version) propose une introduction structurée et autosuffisante au Deep Reinforcement Learning (DRL) et au Deep Imitation Learning (DIL) appliqués aux agents incarnés, c'est-à-dire aux robots et personnages virtuels capables d'agir dans un environnement physique ou simulé. L'ouvrage couvre le spectre complet, des fondations mathématiques (processus de décision markoviens) jusqu'aux algorithmes avancés : côté DRL, REINFORCE puis Proximal Policy Optimization (PPO) ; côté DIL, le Behavioral Cloning, Dataset Aggregation (DAgger) et Generative Adversarial Imitation Learning (GAIL). L'approche retenue est délibérément "depth-first" : un petit nombre d'algorithmes fondateurs traités en profondeur, plutôt qu'un panorama exhaustif du champ. Ce type de ressource pédagogique répond à un besoin concret dans l'industrie robotique : les équipes d'intégration et les laboratoires qui cherchent à embarquer des politiques de contrôle apprises se heurtent souvent à une littérature fragmentée, supposant des prérequis hétérogènes. La distinction que l'auteur opère entre DRL (apprentissage par signal de récompense, adapté aux environnements où la démonstration experte est coûteuse) et DIL (apprentissage par imitation sur des trajectoires expertes, plus direct mais plus sensible à la distribution shift) est précisément le choix d'architecture sur lequel butent aujourd'hui les équipes qui déploient des bras manipulateurs ou des robots mobiles en environnement industriel. Des algorithmes comme PPO sont devenus des briques standard dans des pipelines tels que ceux d'OpenAI, IsaacLab (NVIDIA) ou MuJoCo ; DAgger, lui, est au coeur de nombreuses approches Vision-Language-Action (VLA) récentes. Le contexte de publication est significatif : l'arXiv connaît depuis 2023 une explosion des travaux sur les agents incarnés, portée par les avancées en sim-to-real (IsaacSim, Genesis) et par les déploiements humanoïdes annoncés chez Figure AI, Physical Intelligence (pi0) ou Boston Dynamics. Ce document n'est pas un papier de recherche original mais un outil pédagogique structuré, comparable dans sa vocation aux cours de Sergey Levine (UC Berkeley) ou aux notes de David Silver (DeepMind). Sa valeur est d'offrir un accès cohérent et autonome à des méthodes dont la maîtrise conditionne directement la capacité des équipes à itérer sur des politiques de contrôle pour robots réels.

RecherchePaper
1 source
RLWRLD dévoile un modèle fondation axé sur la dextérité pour robots humanoïdes
336Robotics & Automation News 

RLWRLD dévoile un modèle fondation axé sur la dextérité pour robots humanoïdes

RLWRLD, une startup spécialisée dans les modèles fondation pour la robotique physique, a dévoilé RLDX-1 lors d'un événement privé baptisé "Dexterity Night in SF". Ce modèle fondation est conçu pour permettre aux robots humanoïdes d'exécuter des tâches à contact riche : préhension d'objets, versement de liquides et utilisation d'outils. L'entreprise a publié des résultats sur trois types de benchmarks : manipulation sur table avec des humanoïdes, manipulation en cuisine et versement de café en conditions réelles. Les métriques précises n'ont pas été rendues publiques au moment de l'annonce, ce qui limite toute évaluation indépendante des performances revendiquées. L'approche "dexterity-first" marque un choix de priorité distinct dans la course aux modèles fondation pour robots. La manipulation fine reste le principal goulot d'étranglement de la robotique humanoïde à usage industriel : la locomotion est largement résolue, mais la préhension d'objets variés dans des environnements non structurés demeure difficile à généraliser. L'inclusion d'évaluations en conditions réelles (café, cuisine) plutôt qu'exclusivement en laboratoire suggère une volonté de démontrer une réduction du sim-to-real gap. Pour un intégrateur ou un COO industriel, un modèle capable de gérer des objets divers sans reprogrammation par tâche représente un levier de productivité concret, à condition que les résultats tiennent hors conditions contrôlées. RLWRLD s'inscrit dans un segment en densification rapide : celui des fournisseurs de couche d'intelligence logicielle pour robots tiers, sans fabriquer leur propre hardware. Physical Intelligence (modèle Pi-0), qui adopte une stratégie similaire, est le concurrent le plus direct. En parallèle, Figure AI (Figure 03), Apptronik, 1X et Boston Dynamics développent des modèles intégrés hardware-logiciel. L'annonce de RLWRLD reste au stade du teaser technique : aucune date de disponibilité commerciale, aucun partenaire constructeur ni client pilote n'a été communiqué.

IA physiqueOpinion
1 source
Kairos : un système de déploiement extensible pour l'IA physique
337arXiv cs.RO 

Kairos : un système de déploiement extensible pour l'IA physique

Une équipe de chercheurs publie sur arXiv (référence 2605.11381, mai 2025) les spécifications de Kairos, un système d'inférence conçu pour les flottes de robots pilotées par des modèles de fondation. Kairos se positionne comme le premier système de serving multi-robot à intégrer nativement la boucle generate-execute, soit l'enchaînement asynchrone entre les phases d'inférence et d'exécution motrice propre à l'IA physique. Sur un ensemble de modèles et de plateformes robotiques, le système annonce une réduction de la latence bout-en-bout de 31,8 à 66,5 % par rapport aux pratiques de serving issues du monde de l'IA digitale, avec des gains qui s'accroissent avec la taille de la flotte déployée. L'argument central des auteurs tient à une inadéquation structurelle. Les systèmes actuels comme vLLM, TensorRT-LLM ou Triton ont été conçus pour les LLM textuels : ils traitent une requête jusqu'à complétion, sans état intermédiaire. L'IA physique fonctionne différemment : le modèle génère des blocs d'actions (action chunks) à chaque round d'inférence, le robot commence à exécuter pendant que le bloc suivant est calculé, et plusieurs cycles se succèdent sur une même tâche. Cette asynchronicité, ignorée par les serveurs digitaux classiques, crée un goulot d'étranglement critique pour les flottes industrielles. Si les chiffres se confirment en conditions réelles, les intégrateurs y gagneraient des cycles de contrôle plus courts et une capacité de scaling horizontal sans surcoût infrastructure proportionnel. Le contexte explique l'urgence de cette contribution. Depuis 2024, les modèles de fondation pour robots prolifèrent : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI. Ces VLA (Vision-Language-Action) ont franchi des seuils de généralisation inédits, mais l'infrastructure de déploiement n'a pas suivi le même rythme. Kairos tente de combler ce fossé côté serving. Il s'agit néanmoins d'un preprint non revu par les pairs : les benchmarks ne sont pas détaillés dans l'abstract, les modèles et robots de test ne sont pas nommés, et aucun déploiement en production n'est déclaré. Les métriques annoncées méritent donc une lecture prudente en attendant une validation expérimentale indépendante.

InfrastructureOpinion
1 source
RePO-VLA : l'optimisation de politique guidée par la récupération pour les modèles vision-langage-action (VLA)
338arXiv cs.RO 

RePO-VLA : l'optimisation de politique guidée par la récupération pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (arXiv:2605.09410) RePO-VLA, un framework d'optimisation de politique pour modèles VLA (Vision-Language-Action) conçu pour améliorer la robustesse en manipulation bimanuelle sur des tâches longues et à fort contact. Le problème central identifié: les pipelines d'entraînement classiques exploitent uniquement les trajectoires réussies, abandonnant les épisodes ratés et rendant les modèles fragiles à la moindre perturbation d'exécution. RePO-VLA introduit trois mécanismes distincts: la Recovery-Aware Initialization (RAI), qui isole les segments de récupération et réinitialise l'historique d'état pour que les actions correctives s'ancrent dans l'état adverse courant plutôt que dans l'enchaînement d'erreurs précédent; la Progress-Aware Semantic Value Function (PAS-VF), qui attribue une valeur aux préfixes utiles des trajectoires échouées via un mécanisme de "reliability decay"; et le Value-Conditioned Refinement (VCR), qui entraîne la politique à sélectionner les actions à haute progression. Les auteurs introduisent également FRBench, un benchmark standardisé d'injection d'erreurs orienté récupération. Sur des tâches bimanuelle simulées et réelles, le taux de succès en conditions adverses passe de 20% à 75% en moyenne, et jusqu'à 80% lors d'essais réels à grande échelle. Ce résultat marque une rupture avec les pipelines dominants. Physical Intelligence (Pi-0, Pi-0.5), Figure AI et la quasi-totalité des approches VLA académiques s'entraînent exclusivement sur des trajectoires réussies, sacrifiant l'information contenue dans les épisodes ratés. RePO-VLA démontre que ces données sont exploitables à condition d'être labélisées en fonction de leur degré de progression vers l'objectif. Autre avantage pour le déploiement industriel: à l'inférence, aucun détecteur de défaillance en ligne n'est requis. Un simple paramètre fixe (v=1.0) suffit à biaiser les actions vers le manifold de succès appris, ce qui simplifie considérablement l'intégration en production sur des tâches de manipulation répétitive longue durée. Les VLA sont en 2025-2026 l'un des axes de recherche les plus actifs en robotique manipulatrice, portés par Physical Intelligence, Figure AI, et des laboratoires comme Berkeley, Stanford et CMU. La manipulation bimanuelle en contact représente l'échelon de difficulté le plus élevé: elle concentre les problèmes de sim-to-real gap, de gestion du contact imprédictible et de dérive d'exécution sur de longues séquences. RePO-VLA reste pour l'instant un article arXiv sans annonce de déploiement ni partenariat industriel associé. FRBench pourrait toutefois s'imposer comme référence communautaire pour évaluer la robustesse en récupération d'erreur, critère aujourd'hui absent des benchmarks standards comme LIBERO ou RoboSuite.

IA physiqueOpinion
1 source
ElasticFlow : une politique à horizon temporel élastique pour la manipulation guidée par le langage
339arXiv cs.RO 

ElasticFlow : une politique à horizon temporel élastique pour la manipulation guidée par le langage

ElasticFlow est un cadre de politique robotique pour la manipulation guidée par le langage, présenté dans un preprint arXiv (2605.08799) publié en mai 2026. L'approche vise à résoudre le principal défaut des politiques de diffusion, dominantes en robotique incarnée depuis 2023: leur processus itératif de débruitage génère une latence incompatible avec le contrôle temps réel. ElasticFlow atteint une inférence en une seule évaluation réseau (1-NFE, Neural Function Evaluation) à environ 71 Hz, sans recourir à la distillation. La méthode est validée sur trois benchmarks standard: LIBERO, CALVIN et RoboTwin, où elle surpasse OpenVLA et Pi-0 (Physical Intelligence) sur des tâches à long horizon temporel. Le coeur de la contribution est double. D'une part, les auteurs reconstruisent la Mean Field Theory pour modéliser directement le champ de vitesse moyen, ce qui permet un mapping direct bruit-vers-action en une seule passe, sans sacrifier la cohérence physique des trajectoires. D'autre part, le mécanisme "Elastic Time Horizons" encode explicitement la granularité de contrôle afin d'aligner les instructions sémantiques en langage naturel avec les horizons d'exécution physique, adressant le Spectral Bias inherent aux réseaux neuronaux profonds. Si ces gains se confirment sur matériel réel, l'impact pour les intégrateurs est concret: des politiques VLA (Vision-Language-Action) déployables en temps réel sur des contrôleurs embarqués à ressources limitées, sans pipeline de distillation complexe à maintenir. Ce travail s'inscrit dans une compétition dense autour des architectures VLA: Pi-0 de Physical Intelligence, OpenVLA de Berkeley, RT-2 de Google DeepMind, ou encore les récents modèles de manipulation de Figure AI et 1X Technologies ont tous posé des jalons dans cette catégorie. Le backbone diffusion en robotique a été popularisé par Diffusion Policy (Chi et al., 2023), devenu une référence de facto. ElasticFlow cible précisément son goulot d'étranglement computationnel. Le papier reste un preprint non évalué par les pairs, et les expériences présentées reposent exclusivement sur des benchmarks simulés. Aucune validation sur plateforme matérielle réelle n'est annoncée, ce qui laisse entière la question du sim-to-real gap et nuance les affirmations de "cohérence physique" avancées par les auteurs.

RechercheOpinion
1 source
RLWRLD lance RLDX-1, un modèle fondation centré sur la dextérité pour mains robotiques
340Robotics Business Review 

RLWRLD lance RLDX-1, un modèle fondation centré sur la dextérité pour mains robotiques

La startup sud-coréenne RLWRLD a présenté la semaine dernière RLDX-1, un modèle de fondation conçu spécifiquement pour les mains robotiques à haut nombre de degrés de liberté (DoF). L'architecture multi-flux couvre les configurations single-arm, dual-arm et humanoïde, et intègre l'ensemble du cycle robotique : collecte de données, entraînement et déploiement. RLWRLD structure ses travaux autour d'un benchmark maison, DexBench, qui organise les défis industriels en cinq régimes de dextérité : diversité de préhension, précision spatiale, précision temporelle, précision de contact, et conscience du contexte. Pour chaque régime, un module dédié : un VLM (vision language model) fin-tuné sur des questions-réponses spatiales pour la localisation précise des contacts ; un module de mouvement extrayant des correspondances visuelles spatio-temporelles pour anticiper les objets en déplacement sur convoyeur ; un module physique qui traite couple et force tactile comme des flux séparés, permettant de prédire les transitions de contact avant qu'elles n'arrivent. Les données d'entraînement combinent téleopération synthétique et démonstrations humaines pour couvrir la manipulation en main (in-hand dexterity) inaccessible à la téléopération standard. L'enjeu est concret : les robots échouent encore sur des tâches en apparence banales comme verser du café depuis une cafetière qui s'allège, attraper un objet en mouvement sur un convoyeur, ou visser un écrou hexagonal avec des doigts. Ce "dernier kilomètre" de l'automatisation industrielle est précisément la cible de RLDX-1. L'architecture multi-flux, où chaque modalité (couple haute fréquence, frames vidéo, mémoire d'état) dispose de sa propre capacité gradient, répond à un problème réel d'optimisation : dans un transformer classique, la modalité dominante absorbe toute la capacité au détriment des autres. Cela dit, les affirmations de RLWRLD sur des performances "état de l'art" restent à valider indépendamment -- les vidéos de démonstration ne constituent pas des métriques de taux de succès en conditions industrielles réelles, et aucun cycle time chiffré n'est communiqué. RLWRLD s'inscrit dans une vague de startups cherchant à combler le fossé entre modèles d'action généralistes et déploiements industriels réels. Elle affronte des acteurs aux ressources bien supérieures : Physical Intelligence avec son modèle pi0 (fondée par d'anciens de Google et Stanford, 400 M$ levés en 2024), Figure AI avec son humanoïde Figure 03, ou encore Agility Robotics et 1X. En Europe, des acteurs comme Enchanted Tools (humanoïde Mirokaï) ou Wandercraft se positionnent sur la mobilité et l'assistance plutôt que sur la manipulation haute-dextérité, laissant ce créneau industriel quasi exclusivement aux acteurs américains et asiatiques. Aucun déploiement pilote chez un client industriel n'a été annoncé à ce stade par RLWRLD.

IA physiqueOpinion
1 source
SynapX lance SYNData : un système de collecte de données multimodal pour l'ère de l'IA incarnée
341Pandaily 

SynapX lance SYNData : un système de collecte de données multimodal pour l'ère de l'IA incarnée

SynapX a lancé SYNData, un système de collecte de données multimodales dédié à la manipulation dextre pour l'IA incarnée (embodied AI). La plateforme combine trois modules matériels : un casque Ego équipé de quatre caméras, des bracelets EMG (électromyographie) et un gant exosquelette bionique. Ensemble, ils capturent simultanément la vision à la première personne, la pose des mains, l'état de contact de la paume entière avec distribution des forces, et les signaux bioélectriques musculaires, y compris en cas d'occlusion visuelle. La brique centrale est le mécanisme Bio2Robot : un modèle IA qui transforme les signaux biologiques humains en données directement exploitables pour l'entraînement robotique, sans contraindre le comportement naturel de l'opérateur. Fondée en janvier 2026, SynapX a participé à l'AGIBOT World Challenge (track Reasoning to Action) à ICRA 2026 seulement trois semaines après sa création officielle, décrochant la 2e place mondiale et la 1re place en Chine. Le vrai goulot d'étranglement de l'IA incarnée n'est plus l'architecture des modèles ni le matériel, mais la disponibilité de données d'interaction physique de haute qualité à grande échelle. SYNData cible ce problème en capturant les gestes humains sans les modifier, là où la télé-opération classique introduit des artefacts comportementaux. La capture simultanée de la distribution des forces sur toute la paume et des signaux EMG constitue une modalité que peu de systèmes commerciaux ou open-source proposent aujourd'hui. Le résultat obtenu à ICRA 2026, même pour une entreprise de trois semaines, valide une cohérence technique sur benchmark standardisé, même si les conditions précises du challenge ne sont pas détaillées publiquement. Le marché de la collecte de données pour la robotique manipulatrice est dominé par des pipelines propriétaires : Physical Intelligence (Pi-0), Figure AI et Agility Robotics collectent leurs datasets via télé-opération directe. SynapX se distingue par une approche biosignale potentiellement plus scalable en environnement industriel réel. La société n'a pour l'instant communiqué ni sur ses clients, ni sur ses tarifs, ni sur un calendrier de déploiement commercial. Les prochaines étapes attendues sont la constitution d'un dataset propriétaire de grande envergure et, probablement, une commercialisation du système de collecte auprès de laboratoires de robotique et d'intégrateurs industriels.

💬 Le vrai problème des robots manipulateurs, c'est pas les modèles, c'est les données. SynapX a compris ça : capter les gestes humains sans les contraindre, là où la télé-opération classique introduit des artefacts que les modèles apprennent ensuite à reproduire (y compris les mauvais). La 2e place mondiale à ICRA trois semaines après la création, c'est flatteur, mais le vrai test c'est un dataset à grande échelle en conditions industrielles réelles.

IA physiqueActu
1 source
AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele
342arXiv cs.RO 

AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele

Une équipe de chercheurs a publié sur arXiv (référence 2507.12768) AnyPos, un pipeline d'apprentissage automatisé conçu pour la manipulation bimane généraliste. Le système repose sur un principe de modélisation dite "task-agnostic" : au lieu d'entraîner le robot sur des trajectoires liées à des tâches précises, AnyPos génère à grande échelle des paires image-action indépendantes couvrant l'ensemble de l'espace de travail atteignable. Ces données alimentent un apprentissage par dynamique inverse, combinant un décodeur directionnel et une séparation explicite entre les mouvements du bras et de l'effecteur terminal, pour stabiliser les prédictions en dehors de la distribution d'entraînement. Testée sur cinq tâches domestiques (actionner un micro-ondes, griller du pain, plier des vêtements, arroser des plantes, frotter des assiettes), l'approche améliore les taux de réussite de 30 à 40% par rapport aux baselines de référence, avec un gain de 51% en précision sur les évaluations test. Ce résultat pointe un problème structurel du secteur : la rareté des données de manipulation robotique et leur entanglement avec une plateforme ou une tâche spécifique. La plupart des politiques visuomotrices actuelles, qu'il s'agisse de VLA (vision-language-action models) ou de diffusion policies, nécessitent des données séquentielles coûteuses à collecter et quasiment non transférables entre robots. En découplant la modélisation de l'embodiment de l'apprentissage de politique de haut niveau, AnyPos propose une réutilisation des données d'action cross-tâches et cross-plateformes, sans modèle physique explicite ni simulation intensive. L'argument est directement dirigé contre le "sim-to-real gap" : les représentations sont ici apprises depuis des données réelles générées automatiquement à grande échelle, contournant les biais de simulation. L'approche rejoint une tendance récente consistant à séparer embodiment modeling et politique de haut niveau, visible chez Physical Intelligence (modèle pi0), Figure AI ou 1X Technologies. Elle se distingue par son refus de la télé-opération intensive ou de la simulation massive, préférant une exploration automatisée du workspace réel. Le pipeline est conçu pour se coupler à des modèles de politique existants, le positionnant potentiellement comme une couche de préentraînement réutilisable et échangeable. L'article ne mentionne ni déploiement industriel, ni partenariat commercial : AnyPos reste à ce stade une contribution de recherche académique, sans timeline de mise en production annoncée.

RechercheOpinion
1 source
Genesis AI présente GENE-26.5, un modèle pour une manipulation robotique plus dextérique
343Robotics Business Review 

Genesis AI présente GENE-26.5, un modèle pour une manipulation robotique plus dextérique

Genesis AI, startup californienne basée à Palo Alto, a présenté le 6 mai 2026 son modèle fondation GENE-26.5, conçu pour la manipulation robotique dextre bimane à vocation généraliste. La société fondée par Zhou Xian revendique des "capacités de manipulation physique au niveau humain" et annonce simultanément deux composants propriétaires : un moteur de données destiné à lever le plafond de volumétrie d'entraînement, et une main robotique à l'échelle humaine couplée à un gant de capture tactile. Ce gant, équipé d'une peau électronique à capteurs, est conçu pour assurer un mappage 1:1:1 entre le gant, la main humaine et l'effecteur robotique, réduisant la perte de fidélité dans le transfert de compétences téléopérées. Pour illustrer les capacités de GENE-26.5, Genesis AI a publié une vidéo montrant un robot réaliser une séquence de cuisson en 20 étapes (découpe de tomates, cassage d'œuf d'une main, coordination bimane), préparer un smoothie avec service en plein air, exécuter des expériences de laboratoire incluant pipetage et transfert de liquides, câbler des faisceaux électroniques, résoudre un Rubik's Cube en manipulation aérienne, saisir simultanément quatre objets de tailles variables, et jouer du piano. Genesis AI était sortie de stealth en 2025 avec 105 millions de dollars de financement. L'enjeu industriel de cette annonce se situe à deux niveaux distincts. Le moteur de données propriétaire cible le principal frein aux modèles de fondation en robotique : l'absence de données de manipulation dextre à grande échelle et haute fidélité. Le gant tactile cherche à résoudre l'embodiment gap, soit la discontinuité morphologique entre effecteur robotique et main humaine qui dégrade le transfert de compétences. Si le mappage 1:1:1 annoncé tient en production, il ouvrirait la voie à une scalabilité des données de téléopération rarement atteinte dans les systèmes actuels. Il convient toutefois de tempérer : les démonstrations présentées sont des vidéos produites et sélectionnées par l'entreprise elle-même. Aucun benchmark indépendant, aucun taux de succès en environnement industriel non contrôlé n'est communiqué. Les affirmations de performance "au niveau humain" émanent exclusivement de Genesis AI et d'Eric Schmidt, ex-PDG de Google et investisseur dans la société. Genesis AI évolue dans un segment en pleine consolidation. Sur le terrain des modèles de fondation pour la manipulation, elle affronte Physical Intelligence (Pi-0, Pi-0.5, Pi-1, San Francisco), Nvidia avec GR00T N2 lancé en novembre 2024, et Figure AI dont la plateforme Figure 03 progresse vers le déploiement industriel chez BMW. La différenciation de Genesis AI porte sur la verticalisation hardware-software : là où Physical Intelligence s'appuie sur du matériel tiers, Genesis AI contrôle à la fois le modèle et l'effecteur. L'entreprise n'a communiqué aucun calendrier de déploiement commercial précis ni partenariat industriel signé. La prochaine étape observable sera de vérifier si les performances démontrées en vidéo se traduisent en métriques reproductibles dans des environnements réels, hors conditions de studio.

IA physiqueOpinion
1 source
Paramétrage adaptatif des scans pour l'inspection robotique par plongements vision-langage et calcul hyperdimensionnel
344arXiv cs.RO 

Paramétrage adaptatif des scans pour l'inspection robotique par plongements vision-langage et calcul hyperdimensionnel

Des chercheurs ont publié le 6 mai 2026 (arXiv:2605.03909) ScanHD, un système qui configure automatiquement les paramètres d'un profilomètre laser monté sur robot à partir d'une image RGB pré-scan et d'une instruction en langage naturel. Les cinq paramètres ciblés, à savoir fréquence d'échantillonnage, plage de mesure, temps d'exposition, dynamique du récepteur et illumination, sont aujourd'hui réglés manuellement par essais-erreurs dans l'industrie. Pour évaluer l'approche, les auteurs ont constitué Instruct-Obs2Param, un jeu de données multimodal réel portant sur 16 objets avec variations de pose et d'éclairage multi-vues. ScanHD atteint 92,7 % de précision exacte et 98,1 % de Win@1 sur les cinq paramètres, avec une latence d'inférence compatible avec un déploiement industriel, et surpasse les heuristiques à base de règles ainsi que les grands modèles de langage multimodaux (MLLM). L'enjeu concret dépasse la seule inspection de surface : tout intégrateur déployant des cellules de contrôle dimensionnel automatisées dans l'automobile, l'aéronautique ou l'électronique de précision est exposé aux conséquences d'un mauvais réglage capteur, notamment la saturation, l'écrêtage ou les retours manquants qui ne peuvent pas être corrigés en post-traitement. Que ScanHD surpasse les MLLM sur cette tâche est significatif : le calcul hyperdimensionnel (HDC), qui encode instructions et observations dans des vecteurs binaires de très haute dimension pour un raisonnement associatif compact, semble offrir un avantage structurel sur les tâches de correspondance discrète à faible latence, là où les LLM génératifs tendent à sur-généraliser ou à produire des réponses instables. Le HDC est un paradigme computationnel issu des travaux de Pentti Kanerva dans les années 1980-1990, qui connaît un regain d'intérêt pour les applications embarquées grâce à sa compacité mémoire et son interprétabilité, en contraste avec les architectures transformers. ScanHD s'inscrit dans le courant des modèles vision-langage appliqués à la robotique, un espace aujourd'hui dominé par pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI), mais il se distingue en ciblant la configuration du capteur plutôt que les actions du robot. Aucun partenaire industriel ni calendrier de déploiement ne figurent dans la publication : l'article reste au stade de la validation expérimentale sur banc de test.

UELes intégrateurs européens de cellules de contrôle dimensionnel automatisées (automobile, aéronautique, électronique de précision) sont directement concernés par la problématique du réglage manuel des capteurs laser, mais aucun transfert industriel ni partenariat EU n'est prévu à ce stade.

RecherchePaper
1 source
XYZ Embodied AI lance le sac à dos de calcul embarqué BotPack B Series
345Pandaily 

XYZ Embodied AI lance le sac à dos de calcul embarqué BotPack B Series

XYZ Embodied AI (星源智机器人) a présenté le 23 avril 2026 au salon Hannover Messe en Allemagne sa gamme BotPack B Series, un sac à dos de calcul embarqué destiné aux robots quadrupèdes et humanoïdes. La gamme comprend deux modèles, le B5 et le B4, tous deux propulsés par des puces NVIDIA. L'ensemble pèse moins de 2,5 kg et embarque des interfaces réseau haut débit (Ethernet 10G, 5G et Wi-Fi 7) ainsi que des modules de positionnement pour la navigation autonome. La compatibilité a été confirmée avec le robot humanoïde Unitree G1 de Unitree Robotics. L'objectif affiché est de permettre aux robots d'exécuter des modèles d'IA localement, en réduisant la dépendance au cloud et la latence de traitement associée. La mise en production de capacités de calcul edge directement sur le châssis d'un robot répond à un verrou opérationnel fréquemment cité par les intégrateurs : la dépendance à une connectivité cloud stable nuit aux déploiements en environnements industriels contraints, ateliers, entrepôts ou zones à couverture réseau limitée. Un backpack standardisé compatible avec plusieurs plateformes ouvre la voie à une séparation entre matériel robot et compute stack, une logique analogue à celle des AMR modulaires. La connectivité Wi-Fi 7 et 5G, couplée à un Ethernet 10G, cible clairement les cas d'usage en inférence temps réel de modèles VLA (Vision-Language-Action), où la latence est critique. Il reste à valider en conditions réelles quelle charge de modèle les configurations B4 et B5 peuvent effectivement supporter, XYZ n'ayant publié ni benchmarks ni données terrain. XYZ Embodied AI avait précédemment développé la plateforme T5, une unité de calcul embarqué positionnée sur le même segment ; la BotPack B Series constitue une évolution vers des formats plus compacts et universels. Hannover Messe 2026 concentre plusieurs annonces dans le domaine du edge computing pour la robotique, un marché en structuration où NVIDIA pousse son stack Isaac/Jetson et où des startups spécialisées compute-on-robot émergent. La compatibilité affichée avec le Unitree G1 positionne le produit face aux solutions de compute intégrées des fabricants humanoïdes comme Agility Robotics ou Figure AI. Aucun prix ni volume de déploiement n'a été communiqué, ce qui classe cette annonce comme lancement commercial sans validation industrielle publique à ce stade.

UELes intégrateurs robotiques européens présents à Hannover Messe peuvent découvrir une solution de compute embarqué potentiellement compatible avec leurs plateformes humanoïdes ou quadrupèdes, mais l'absence de prix, de benchmarks et de déploiements validés rend toute décision d'achat prématurée.

InfrastructureOpinion
1 source
Apprendre l'apesanteur : imiter des mouvements non auto-stabilisants sur un robot humanoïde
346arXiv cs.RO 

Apprendre l'apesanteur : imiter des mouvements non auto-stabilisants sur un robot humanoïde

Une équipe de chercheurs propose dans un preprint arXiv (référence 2604.21351, avril 2026) une méthode baptisée Weightlessness Mechanism (WM), conçue pour permettre aux robots humanoïdes d'exécuter des mouvements dits non-autostabilisants (NSS, Non-Self-Stabilizing). Ces mouvements englobent des actions aussi banales que s'asseoir sur une chaise, s'allonger sur un lit ou s'appuyer contre un mur : contrairement à la locomotion bipède classique, le robot ne peut maintenir sa stabilité sans interagir physiquement avec l'environnement. Les expériences ont été menées en simulation et sur le robot humanoïde Unitree G1, sur trois tâches représentatives : s'asseoir sur des chaises de hauteurs variables, s'allonger sur des lits à différentes inclinaisons, et s'appuyer contre des murs via l'épaule ou le coude. La méthode est entraînée sur des démonstrations en action unique, sans fine-tuning spécifique à chaque tâche. L'apport technique central s'appuie sur une observation biomécanique : lors de mouvements NSS, les humains relâchent sélectivement certaines articulations pour laisser le contact passif avec l'environnement assurer la stabilité, un état que les auteurs qualifient de "weightless". Le WM formalise ce mécanisme en déterminant dynamiquement quelles articulations relâcher et dans quelle mesure, complété par une stratégie d'auto-étiquetage automatique de ces états dans les données d'entraînement. Pour les intégrateurs industriels qui déploient des humanoïdes dans des environnements réels, ce verrou est significatif : les pipelines actuels d'imitation learning combiné au reinforcement learning imposent généralement un suivi rigide de trajectoire sans modéliser les interactions physiques avec les surfaces, ce qui les rend inopérants dès que le robot doit s'appuyer sur quelque chose. Le contexte est celui d'un secteur en pleine accélération : Figure AI avec le Figure 03, Agility Robotics avec Digit, Boston Dynamics avec Atlas et 1X Technologies poussent tous leurs humanoïdes vers des déploiements en entrepôt ou en usine, mais les scénarios de contact-riche restent largement non résolus. Le Unitree G1, plateforme commerciale accessible, s'impose progressivement comme banc de test académique standard, ce qui accélère la reproductibilité des résultats. Il faut néanmoins souligner que ce travail est au stade de preprint non évalué par les pairs, et que les séquences vidéo accompagnant ce type de publication sont souvent sélectionnées favorablement : la robustesse réelle en conditions non supervisées reste à démontrer. Les suites naturelles seraient une intégration dans des politiques généralisées comme GR00T N2 de NVIDIA ou pi0 de Physical Intelligence, et une évaluation sur des scènes hors distribution.

IA physiquePaper
1 source
Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise
347arXiv cs.RO 

Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise

Une équipe de chercheurs a conçu et testé une méthode de sensibilisation à la robotique en milieu industriel réel, en déployant un robot humanoïde contrôlé par un grand modèle de langage (LLM) lors d'un événement interne organisé par AD Ports Group aux Émirats arabes unis. Les employés du groupe portuaire, sans formation préalable en robotique, ont interagi avec le robot via des commandes vocales dans un environnement d'exercice inspiré de la logistique, structuré en équipes avec des rôles attribués. Au terme de l'activité, un questionnaire resté ouvert 16 jours a recueilli 102 réponses. La satisfaction globale atteint 8,46/10, l'intérêt déclaré pour la robotique et l'IA 4,47/5, et la compréhension des nouvelles formes de collaboration homme-robot 4,45/5. Les participants ayant interagi directement avec le robot ont évalué la naturalité de l'échange à 4,37/5 et la progression de la facilité d'interaction à 4,74/5. Les scores concernant la fiabilité et la prédictibilité du robot restent en revanche sensiblement plus bas, ce que les auteurs identifient comme un défi technique à adresser. Ce travail fournit l'une des rares mesures quantitatives issues d'un déploiement en organisation réelle, hors contexte laboratoire, sur l'efficacité des LLM comme interface d'entrée en robotique pour des non-spécialistes. Pour les décideurs industriels et les intégrateurs, il valide un format concret d'onboarding technique : une activité compétitive courte peut suffire à modifier la perception et l'appétence pour la robotique collaborative. La méthode est présentée comme réplicable, ce qui est significatif pour des groupes industriels cherchant à préparer leurs effectifs à des déploiements d'IA incarnée sans passer par une formation longue. L'exploration des LLM comme couche de contrôle en langage naturel pour les robots s'intensifie depuis 2023, portée notamment par des architectures comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), mais les preuves d'usage en conditions industrielles non contrôlées restent rares. AD Ports Group, opérateur de ports et de zones logistiques parmi les plus importants du Moyen-Orient, constitue un terrain d'expérimentation pertinent. L'étude ne précise pas le modèle de robot humanoïde utilisé ni l'architecture LLM sous-jacente, une limite notable pour qui voudrait reproduire l'approche. Les prochaines étapes annoncées portent sur l'amélioration de la fiabilité perçue et la réplication de la méthode dans d'autres contextes opérationnels industriels.

UELa méthodologie réplicable d'onboarding robotique par interaction LLM peut être directement adoptée par des groupes industriels français et européens pour préparer leurs effectifs aux déploiements de robots collaboratifs sans formation longue.

RecherchePaper
1 source
UniT : vers un langage physique unifié pour l'apprentissage de politiques humain-humanoïde et la modélisation du monde
348arXiv cs.RO 

UniT : vers un langage physique unifié pour l'apprentissage de politiques humain-humanoïde et la modélisation du monde

UniT (Unified Latent Action Tokenizer via Visual Anchoring) est un framework de recherche présenté début avril 2026 sur arXiv (2604.19734), conçu pour transférer les politiques de mouvement humain directement vers des robots humanoïdes. Le problème adressé est bien documenté : l'entraînement de modèles fondation pour humanoïdes bute sur la rareté des données robotiques. UniT propose d'exploiter les vastes corpus de données égocentrées humaines existants en construisant un espace latent discret partagé entre les deux types de corps. Le mécanisme central, dit tri-branch cross-reconstruction, fonctionne en trois voies : les actions prédisent la vision pour ancrer les cinématiques aux conséquences physiques, la vision reconstruit les actions pour éliminer les biais visuels non pertinents, et une branche de fusion unifie ces modalités purifiées en tokens d'intention physique indépendants de l'embodiment. Le framework est validé sur deux usages : VLA-UniT pour l'apprentissage de politique (Vision-Language-Action), et WM-UniT pour la modélisation du monde, qui permet la génération de vidéos humanoïdes contrôlées par des données de mouvement humain brutes. Les auteurs revendiquent un transfert zero-shot de tâches et une efficacité données state-of-the-art sur benchmark de simulation et sur des déploiements réels, sans toutefois publier de métriques de déploiement chiffrées. L'enjeu central est le "cross-embodiment gap" : un humain et un robot humanoïde partagent une structure morphologique proche mais des cinématiques incompatibles (nombre de degrés de liberté, ratios de membres, actionneurs). Jusqu'ici, combler cet écart nécessitait du retargeting cinématique manuel, de la téléopération coûteuse ou de la simulation synthétique. Si UniT tient ses promesses, il ouvrirait un pipeline d'entraînement hautement scalable à coût marginal faible, puisque les données égocentrées humaines se comptent en millions d'heures. Le claim de zero-shot transfer est le plus fort de l'article, mais il convient de le nuancer : il s'appuie sur des visualisations t-SNE montrant une convergence des représentations humaine et humanoïde dans un espace partagé, ce qui est indicatif mais pas une preuve de généralisation robuste en conditions industrielles réelles. Ce travail s'inscrit dans une vague de recherche sur les modèles fondation pour humanoïdes qui mobilise simultanément Figure AI avec son modèle Helix, Physical Intelligence avec Pi-0 et Pi-0.5, et NVIDIA avec GR00T N2, tous confrontés au même goulot d'étranglement des données. L'approche par ancrage visuel de UniT se distingue des méthodes purement cinématiques comme les retargeters basés sur des squelettes (SMPLify, HumanMimic) en postulant que les conséquences visuelles du mouvement sont universelles indépendamment du corps. Le preprint ne mentionne pas d'affiliation industrielle explicite ni de calendrier de déploiement commercial, et aucun robot cible (Unitree G1, Fourier GR-1, ou autre) n'est nommé dans le résumé disponible. La prochaine étape logique serait une validation sur des benchmarks standardisés comme LIBERO ou RoboMimic, et une comparaison directe avec GR00T N2 sur des tâches dextres en environnement non contrôlé.

IA physiqueOpinion
1 source
Zibian Robotics lance WALL-B, un modèle d'IA incarnée destiné au déploiement à domicile
349Pandaily 

Zibian Robotics lance WALL-B, un modèle d'IA incarnée destiné au déploiement à domicile

Le 21 avril 2026, Zibian Robotics a annoncé WALL-B, un modèle d'IA incarnée reposant sur une architecture qu'elle nomme World Unified Model (WUM), en marge d'une initiative "robots pour la maison". Contrairement aux systèmes Vision-Language-Action (VLA) classiques, qui traitent séquentiellement perception visuelle, raisonnement et contrôle moteur, WALL-B est entraîné en fusion native sur quatre modalités (vision, langage, mouvement, prédiction physique) et revendique trois propriétés clés : multimodalité native, modélisation de la dynamique physique du monde, et auto-amélioration après échec. Le corpus d'entraînement intègre des données issues de centaines de foyers réels, et Zibian annonce un déploiement dans de vrais domiciles d'ici 35 jours, avec recrutement d'utilisateurs déjà en cours. Des précisions techniques et les plans d'écosystème seront révélés le 27 avril à la première conférence sur les applications IA du Guangdong. L'intérêt architectural de l'approche WUM est réel : les VLA souffrent d'une perte d'information à chaque interface entre modules, et leur incapacité à modéliser la physique reste un obstacle documenté au sim-to-real. Un entraînement unifié sur ces quatre flux pourrait réduire ce fossé, notamment pour la manipulation en environnement non structuré, défi central du déploiement résidentiel. Les affirmations de "premier modèle au monde" de ce type restent invérifiables à ce stade, et l'annonce d'un déploiement en 35 jours demeure un engagement commercial non confirmé ; la robustesse à grande échelle dans des foyers variés, avec leurs contraintes de lumière, d'encombrement et de comportements imprévisibles, constitue une barre difficile à franchir. Zibian s'inscrit dans un segment où la concurrence s'intensifie rapidement : Figure AI (Figure 03), Agility Robotics (Digit), Unitree et Agibot développent tous des plateformes polyvalentes pour environnements non structurés. En Chine, l'écosystème robotique bénéficie d'un fort soutien institutionnel, et le choix du Guangdong comme vitrine situe Zibian dans l'orbite de Shenzhen. L'intégration de l'anonymisation visuelle embarquée et d'une gestion explicite du consentement utilisateur répond aux exigences réglementaires croissantes, mais aussi à l'enjeu d'acceptabilité sociale des robots dans l'espace privé. Les prochaines semaines seront décisives pour évaluer si WALL-B franchit la frontière entre annonce et produit déployé en conditions réelles.

Maniformer lance une plateforme de données d'IA physique tout-en-un pour préparer l'ère de l'AGI
350Pandaily 

Maniformer lance une plateforme de données d'IA physique tout-en-un pour préparer l'ère de l'AGI

Maniformer, startup chinoise spécialisée dans l'infrastructure de données pour l'IA physique, a officiellement lancé sa plateforme de services de données en un seul guichet, accompagnée de la gamme matérielle MEgo et du système de gouvernance MEgo Engine. La gamme MEgo comprend trois composants : le MEgo Gripper pour la capture de données de manipulation robotique, le MEgo View, un dispositif de collecte portable à tête montée, et le MEgo Engine pour le traitement et la gouvernance des données. Ces outils affichent une précision millimétrique, une synchronisation sub-milliseconde et une perception panoramique supérieure à 300 degrés. Le système est nativement compatible avec le robot G2 Air, garantissant la cohérence entre environnements simulés et réels. Selon Yao Maoqing, président-directeur général, l'entreprise vise une capacité de production de dizaines de millions d'heures de données d'ici 2026, puis des dizaines de milliards d'heures d'ici 2030. Le problème que Maniformer cherche à résoudre est structurel : les données d'interaction physique réelle disponibles pour l'IA incarnée représentent moins de 1/20 000 de ce qui existe pour les grands modèles de langage. Ce déficit, combiné à l'absence de standards, à des problèmes de qualité hétérogène et à des inadéquations entre offre et demande, freine concrètement la commercialisation des robots autonomes. En proposant une infrastructure full-stack couvrant la télé-opération réelle, la collecte sans robot dédié et la génération synthétique par simulation, Maniformer cherche à décorréler la production de données de la disponibilité des plateformes robotiques elles-mêmes, une approche qui, si elle tient ses promesses, pourrait accélérer significativement le cycle sim-to-real pour les intégrateurs et les équipes R&D. L'analogie revendiquée avec l'électricité ou l'eau comme utilities est ambitieuse ; elle reste à valider à l'échelle industrielle. L'entreprise s'inscrit dans un contexte de course mondiale aux données d'entraînement pour robots humanoïdes et manipulateurs, où des acteurs comme Physical Intelligence (Pi-0), Boston Dynamics, Figure AI ou Unitree investissent massivement dans leurs propres pipelines de données propriétaires. La stratégie de Maniformer est différente : se positionner en fournisseur tiers d'infrastructure, à la manière d'un AWS pour la donnée physique. L'initiative "Hive" annoncée vise à fédérer des partenaires mondiaux pour co-construire des standards sectoriels, une démarche de standardisation qui, si elle aboutit, pourrait bénéficier à l'ensemble de l'écosystème, y compris aux acteurs européens comme Enchanted Tools ou Wandercraft qui peinent à constituer des datasets suffisants. La prochaine étape annoncée est le déploiement d'un réseau global de collecte de données, sans calendrier précis communiqué au-delà de l'horizon 2026.

UESi l'initiative 'Hive' de standardisation aboutit, les acteurs européens comme Enchanted Tools ou Wandercraft pourraient bénéficier d'une infrastructure de données partagée pour accélérer leurs pipelines sim-to-real.

Chine/AsieActu
1 source