Aller au contenu principal

Dossier IA physique & VLA — page 3

809 articles · page 3 sur 17

L'IA physique : modèles vision-langage-action qui contrôlent des corps robotisés. État de l'art académique (CoRL, RSS) et premières productions industrielles.

101Interesting Engineering IA physiqueOpinion

Regardez : le premier modèle d'IA nativement incarnée promet des robots plus intelligents et plus performants

Robbyant, filiale d'intelligence artificielle incarnée du groupe chinois Ant Group (maison mère d'Alipay), a présenté LingBot-VA 2.0, un modèle de monde vidéo-action que l'entreprise qualifie de premier du secteur conçu nativement pour la robotique plutôt qu'adapté de systèmes de génération vidéo destinés au contenu numérique. Le modèle repose sur une architecture autorégressive entraînée depuis zéro : il prédit comment les actions d'un robot modifient son environnement, puis choisit l'action suivante à partir de ces relations causales. Robbyant met en avant quatre innovations : un tokenizer visuel-action sémantique compressant conjointement image et action, un pré-entraînement causal strict garantissant l'ordre temporel des prédictions, une architecture Mixture of Experts augmentant la capacité sans alourdir l'inférence, et un mécanisme d'inférence asynchrone qui recale en continu les prédictions sur les observations réelles pendant l'exécution. Selon l'entreprise, cette combinaison permet un contrôle en boucle fermée à 150 Hz sur un seul GPU, et le modèle s'adapte à une nouvelle tâche de manipulation avec seulement 20 démonstrations, par apprentissage en contexte, sans réentraînement. Robbyant a montré le système sur des tâches longues et précises : préparer un petit-déjeuner, déballer des colis, insérer des tubes, ramasser des vis, plier du linge, ouvrir des tiroirs. L'entreprise revendique aussi de meilleurs résultats que les méthodes existantes sur les benchmarks de simulation RoboTwin 2.0 et LIBERO. Ce lancement illustre un changement de philosophie dans les modèles fondation pour la robotique. La plupart des systèmes d'IA incarnée actuels réutilisent des modèles vidéo pensés pour générer du contenu grand public, qui privilégient qualité d'image et créativité au détriment de la précision physique et de la vitesse d'exécution. Adapter ces modèles à la robotique, selon Robbyant, dégrade la généralisation, un constat qui rejoint le débat récurrent dans le secteur des modèles vision-langage-action (VLA) sur l'écart entre démonstrations impressionnantes et fiabilité réelle. Si les chiffres avancés se confirment au-delà des vidéos sélectionnées par l'entreprise, ils positionneraient LingBot-VA 2.0 comme alternative face à des VLA généralistes comme Pi-0 ou GR00T N2, avec un argument clé pour les intégrateurs : moins de données pour déployer un nouveau geste, et un temps de cycle compatible avec du matériel limité à un seul GPU. La mémoire à long terme mise en avant, permettant de distinguer des situations visuellement identiques mais contextuellement différentes et d'exécuter des tâches multi-étapes avec comptage et répétition, répond à une limite connue des politiques robotiques actuelles sur les séquences longues. Robbyant a accéléré ses investissements en robotique humanoïde et modèles fondation physiques, dans un contexte où les groupes technologiques chinois, Ant Group mais aussi Unitree, AgiBot ou Xiaomi, intensifient la compétition face à des acteurs américains comme Figure AI ou Physical Intelligence. LingBot-VA 2.0 succède à une première version et s'inscrit dans une stratégie où l'entreprise dit vouloir accélérer le développement d'un écosystème ouvert, sans préciser de calendrier de commercialisation, de partenariats industriels ni de premiers déploiements pilotes. Pour l'instant, la démonstration reste cantonnée aux benchmarks de simulation et aux vidéos publiées par l'entreprise, sans validation indépendante en environnement de production, une réserve qui s'applique à la plupart des annonces de modèles fondation robotiques cette année.

1 source
102Robohub 

Le bracelet permet de contrôler une main robotique par ses propres mouvements

Des chercheurs du MIT ont mis au point un bracelet à ultrasons capable de suivre en temps réel les mouvements de la main d'un porteur avec une précision inédite. Le dispositif produit des images échographiques des muscles, tendons et ligaments du poignet pendant que la main bouge, images qu'un algorithme d'intelligence artificielle traduit en continu en positions des cinq doigts et de la paume. L'équipe, dirigée par Xuanhe Zhao, professeur de génie mécanique au MIT, et Gengxi Lu, a présenté ses résultats dans un article publié dans Nature Electronics. Lors des démonstrations, un porteur du bracelet a pu piloter sans fil une main robotique en reproduisant simplement ses propres gestes : le robot a ainsi joué un air simple au piano et envoyé un petit ballon dans un panier de bureau. Le même bracelet permet aussi de manipuler des objets virtuels à l'écran, par exemple en pinçant les doigts pour agrandir ou réduire un élément graphique. Les travaux associent des équipes du MIT et de l'University of Southern California, avec la contribution du professeur Qifa Zhou. Cette approche s'attaque à un problème concret pour l'industrie robotique et la réalité augmentée : le suivi fin des gestes de la main reste un goulot d'étranglement technique. Les systèmes par caméra souffrent d'occlusions visuelles et nécessitent une infrastructure lourde ; les gants à capteurs limitent la liberté de mouvement et les sensations naturelles ; les capteurs électromyographiques, qui lisent les signaux électriques des muscles de l'avant-bras, restent sensibles au bruit et peinent à distinguer les mouvements intermédiaires entre deux positions extrêmes. L'imagerie ultrasonore, elle, capte directement l'activité mécanique des tissus et pourrait offrir un suivi continu et fin, exploitable aussi bien pour remplacer les capteurs de mouvement en AR/VR que pour générer, à grande échelle, des données d'entraînement pour des robots humanoïdes dexterité, un besoin identifié comme critique pour combler l'écart entre démonstrations en laboratoire et déploiement réel des modèles vision-langage-action. Il s'agit à ce stade d'une preuve de concept académique, pas d'un produit commercialisé : les démonstrations de piano ou de basketball, bien que spectaculaires, restent des tâches simples et contrôlées en environnement de recherche. L'équipe du MIT, connue pour ses travaux sur les dispositifs portables et la robotique souple, prévoit maintenant de collecter des données auprès d'un plus grand nombre d'utilisateurs aux morphologies de main variées, afin de constituer un jeu de données massif. L'objectif affiché est de nourrir l'entraînement de robots humanoïdes sur des tâches de dextérité fine, y compris des gestes chirurgicaux, ainsi que des applications de jeu vidéo et de conception assistée par ordinateur.

RecherchePaper
1 source
103arXiv cs.RO 

Coordination de comportements implicites à partir de démonstrations de sous-tâches non étiquetées pour des tâches de réarrangement

Une nouvelle publication arXiv (2607.09234v1, soumise en juillet 2026) propose une approche alternative pour les tâches de réarrangement robotique à long horizon, ces missions où un robot doit déplacer plusieurs objets pour réorganiser un environnement. Plutôt que de découper la tâche en compétences prédéfinies avec des étiquettes, des frontières et une logique de commutation propre à chaque scénario, les auteurs formulent le problème comme une coordination implicite de comportements appris directement depuis des démonstrations de sous-tâches non étiquetées. Le système apprend des comportements de type "compétences" à partir de données comportementales mixtes, puis les coordonne via une sélection d'actions guidée par une fonction de valeur (un critique). La méthode est testée sur les tâches de réarrangement de Habitat, la plateforme de simulation d'IA incarnée. Sans plan de tâche oracle ni démonstrations complètes étiquetées par compétence, elle dépasse des méthodes d'imitation spécifiques à la tâche sur les scénarios les plus complexes et s'approche des performances d'un système oracle combiné à des compétences apprises par clonage comportemental. L'enjeu dépasse le cadre académique. Les pipelines robotiques actuels reposent largement sur des architectures de planification explicite, coûteuses à concevoir et difficiles à faire évoluer dès que le nombre de comportements ou l'horizon temporel augmente, un frein connu pour les intégrateurs qui veulent déployer des robots polyvalents en entrepôt ou en usine. En montrant qu'une coordination apprise, sans étiquetage de compétences ni planificateur oracle, peut tenir la comparaison, ces travaux appuient l'hypothèse qu'une abstraction explicite des compétences n'est pas indispensable, un argument qui rejoint la tendance actuelle vers des modèles vision-langage-action génériques plutôt que des pipelines modulaires rigides. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation à partir de données comportementales hétérogènes, un axe où Habitat (développé par Meta AI) sert de banc d'essai standard pour l'IA incarnée. Les auteurs montrent aussi, via des études d'ablation, que la sélection de candidats guidée par le critique est déterminante pour gérer des comportements multimodaux, et que la méthode continue de bien se comporter quand le répertoire de comportements et l'horizon de la tâche s'agrandissent, contrairement aux approches d'imitation spécifiques à la tâche. Aucun déploiement matériel réel n'est mentionné à ce stade, l'évaluation restant purement en simulation.

RecherchePaper
1 source
104arXiv cs.RO 

DemoBridge : une boîte à outils de simulation en boucle pour le retargeting de démonstrations humaines en vue unique

Une équipe de l'université KU Leuven (Belgique) publie DemoBridge, un outil qui transforme un enregistrement vidéo unique, en stéréo RGB, d'une démonstration manuelle humaine en une trajectoire de bras robotique exécutable et validée par simulation physique. Décrit dans un preprint arXiv daté du 13 juillet 2026 (arXiv:2607.09519), le système repose sur un planificateur unique conscient des collisions qui optimise la trajectoire articulaire complète en une seule passe, en tenant compte simultanément des poses de préhension alternatives, des collisions du bras et de l'objet saisi, et de la fidélité au geste démontré. Un simulateur physique tourne en boucle pendant la génération, valide chaque phase et revient en arrière en cas d'échec plutôt que d'abandonner la démonstration : le geste est replanifié, pas jeté. Le timing de la prise est déduit automatiquement, et les modules de perception, le modèle de robot et les étapes du pipeline sont interchangeables par configuration. L'équipe a testé l'ensemble du pipeline sur trois tâches réelles et évalué le planificateur seul sur un benchmark synthétique contrôlé. Le code est disponible sur le GitLab de KU Leuven. L'enjeu visé est le fossé d'incarnation ("embodiment gap") : un bras robotique, avec ses longs segments articulés, occupe bien plus de volume de collision qu'une main humaine, si bien que la cinématique inverse appliquée telle quelle à une pose de préhension démontrée n'a souvent aucune solution sans collision. Ce verrou freine l'apprentissage par démonstration à bas coût, où une simple vidéo caméra unique remplacerait la téléopération coûteuse utilisée pour collecter des données d'entraînement de modèles vision-langage-action comme Pi-0 ou GR00T N2. En doublant chaque démonstration retargetée d'un rollout de simulation exploitable pour l'apprentissage de politiques, DemoBridge s'inscrit directement dans la course à des données de manipulation moins chères à générer. Il s'agit d'un travail académique préliminaire, non d'un produit commercialisé : l'évaluation reste limitée à trois tâches réelles et un benchmark synthétique, sans déploiement industriel annoncé. Le choix d'une vue unique plutôt qu'un rig multi-caméras vise justement l'accessibilité, un axe que suivent aussi des laboratoires concurrents cherchant à réduire le coût de collecte de données d'imitation face aux approches par téléopération dominantes chez les acteurs américains du secteur.

UEUne équipe universitaire belge (KU Leuven) publie en open-source un outil de retargeting de démonstrations, réduisant potentiellement le coût de collecte de données d'apprentissage par imitation pour les laboratoires robotiques européens.

FR/EU ecosystemePaper
1 source
105arXiv cs.RO 

PAC-ACT : post-entraînement acteur-critique pour transformeurs à segmentation d'actions

Des chercheurs proposent PAC-ACT, un cadre d'apprentissage par renforcement pour affiner après coup les politiques ACT (Action Chunking Transformer) déjà entraînées, publié le 13 juillet 2026 sur arXiv (2607.09590). Ces politiques, courantes en manipulation industrielle de précision au contact, sont habituellement entraînées par clonage comportemental (behavior cloning) puis souffrent d'un décalage de distribution dès que la tâche implique des contacts physiques répétés, sous des contraintes de force et de perturbations de pose. PAC-ACT reformule l'optimisation au niveau du "chunk" (bloc d'actions), construit une architecture acteur-critique dérivée d'ACT, et introduit une contrainte hybride de préservation du comportement pré-entraîné pendant le fine-tuning en ligne. Sur un benchmark industriel de contact de précision baptisé Contour, la méthode réduit fortement la force de contact maximale et divise par 46 la proportion de mesures de force dépassant 60 newtons, tout en conservant une latence d'inférence et une consommation de mémoire GPU faibles. L'enjeu dépasse la simple performance académique: les modèles vision-langage-action (VLA) généralisent bien mais restent trop lourds et lents pour du contrôle industriel temps réel, alors que les politiques de type ACT sont rapides mais fragiles dès que le contact physique entre en jeu, un défaut connu qui limite leur usage en usine sur des tâches d'assemblage ou d'insertion nécessitant une gestion fine de la force. En démontrant qu'un post-entraînement par renforcement peut corriger ce défaut sans sacrifier la vitesse d'exécution, PAC-ACT apporte une réponse concrète à un point de friction connu entre robotique de recherche et déploiement industriel réel, là où beaucoup d'annonces se limitent à des démonstrations en environnement contrôlé. Le travail s'inscrit dans la lignée des politiques ACT, popularisées pour leur efficacité dans l'apprentissage par imitation sur tâches manipulatoires fines, et cherche à combler leur principal talon d'Achille face aux approches VLA plus généralistes mais coûteuses en ressources. L'ablation en récompense éparse montre par ailleurs que la contrainte de préservation comportementale favorise une exploration efficace même avec des poses initiales aléatoires, ouvrant la voie à une validation plus large sur d'autres tâches de contact industriel avant un éventuel déploiement en conditions réelles.

RecherchePaper
1 source
106arXiv cs.RO 

Re³Sim : générer des données de simulation photoréalistes en 3D par transfert réel-vers-simulation pour la manipulation robotique

Cette annonce arrive du côté recherche académique plutôt que de l'industrie commerciale : une équipe présente RE³SIM, un système de simulation photoréaliste en 3D destiné à combler l'écart entre entraînement simulé et déploiement réel en robotique manipulatrice. Publié sur arXiv (version 4, remplaçant une précédente), le papier décrit un pipeline qui reconstruit fidèlement des scènes réelles grâce à des techniques avancées de reconstruction 3D et de rendu neuronal, permettant un rendu en temps réel de caméras virtuelles multi-angles au sein d'un simulateur physique. En s'appuyant sur des informations privilégiées pour générer efficacement des démonstrations expertes en simulation, puis en entraînant des politiques robotiques par apprentissage par imitation, les chercheurs rapportent un taux de réussite moyen supérieur à 58% en transfert "zero-shot" vers le réel, c'est-à-dire sans aucune donnée réelle utilisée pour l'entraînement, uniquement des données simulées. Ils ont aussi constitué un jeu de données de simulation à grande échelle pour tester la généralisation des politiques apprises sur des objets variés. Le résultat compte parce qu'il s'attaque directement à l'un des goulots d'étranglement les plus coûteux du secteur : la collecte de données réelles pour entraîner des robots manipulateurs, qui exige des opérateurs qualifiés et du matériel onéreux. Si le fossé sim-to-real (géométrique et visuel) peut être réduit de manière fiable grâce à des reconstructions photoréalistes plutôt qu'à des environnements simulés génériques, cela change la donne pour les intégrateurs et les équipes de R&D qui cherchent à multiplier les scénarios d'entraînement sans multiplier les essais physiques. Un taux de 58% en zero-shot reste toutefois modeste comparé aux standards de fiabilité industrielle, et mérite d'être lu comme une preuve de concept académique plutôt qu'une solution prête à l'emploi pour la production. RE³SIM s'inscrit dans la lignée des travaux récents sur les politiques vision-langage-action (VLA) et les pipelines d'apprentissage par imitation, un axe de recherche également poursuivi par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T). La démarche real-to-sim-to-real, où l'on capture d'abord le monde réel avant de simuler dessus, distingue cette approche des simulateurs purement synthétiques et pourrait influencer les futurs outils de génération de données pour l'entraînement de robots. Le code et des démonstrations sont disponibles sur le site du projet (re3sim.github.io), signe que l'équipe cherche une adoption élargie par la communauté robotique plutôt qu'une simple publication isolée.

RecherchePaper
1 source
107arXiv cs.RO 

OIPP : prédicteur adaptatif du point d'impact pour intercepter des objets en vol variés

Des chercheurs publient sur arXiv (soumission remplacée, v3) un système baptisé OIPP (Object-Adaptive Impact Point Predictor), conçu pour permettre à un robot quadrupède équipé d'un panier de rattraper des objets en vol. L'objectif est de prédire précisément le point d'impact, c'est-à-dire l'endroit où l'objet va atterrir, avant même la fin de sa trajectoire. Pour entraîner ce système, faute de jeu de données public couvrant des objets divers soumis à une aérodynamique instable, l'équipe a constitué son propre corpus: 8 000 trajectoires réelles issues de 20 objets différents. OIPP repose sur deux modules, un encodeur adaptatif aux objets (OAE) qui extrait des représentations dépendantes de l'objet à partir de l'historique de mouvement, et un prédicteur de point d'impact (IPP) qui en déduit la position finale. Deux variantes de l'IPP ont été testées, l'une (NAE) qui prédit l'accélération puis reconstruit la trajectoire complète, l'autre (DPE) qui produit directement le point d'impact sans étape intermédiaire. Les résultats montrent une performance supérieure aux méthodes de référence sur 15 objets connus et 5 objets jamais vus à l'entraînement, avec des gains de succès de capture confirmés en simulation et lors d'essais sur robot réel. Pour l'industrie robotique, ce travail s'attaque à un problème resté largement non résolu: la manipulation dynamique d'objets en vol, un domaine différent de la préhension statique déjà largement maîtrisée par les bras robotiques. La difficulté centrale que les auteurs mettent en avant, à savoir que les trajectoires de différents objets se ressemblent en début de vol, est précisément ce qui limite les systèmes existants à des scénarios avec un seul type d'objet connu à l'avance. Démontrer qu'un modèle unique généralise à des objets inédits, sans réentraînement, est un signal utile pour les intégrateurs qui envisagent des applications de tri, de logistique ou de sécurité où la nature de l'objet capté n'est pas toujours prévisible à l'avance. Cela reste toutefois un résultat de recherche académique, validé sur un jeu d'objets limité et un robot quadrupède spécifique, loin d'un produit commercial déployé. Le travail s'inscrit dans la lignée des efforts récents sur la manipulation dynamique par apprentissage, où l'accès à des données réelles diversifiées est le principal goulot d'étranglement plutôt que l'algorithme lui-même, un constat similaire à celui qui a poussé des laboratoires travaillant sur des politiques de type VLA (vision-langage-action) à investir massivement dans la collecte de données avant l'entraînement des modèles. Les auteurs positionnent explicitement leur contribution en deux temps, d'abord la construction d'un dataset plus riche et complexe que l'existant, ensuite l'architecture OIPP elle-même. Une démonstration vidéo est disponible en ligne, et les essais sur robot réel suggèrent une prochaine étape naturelle vers des tests en conditions moins contrôlées, avec potentiellement davantage d'objets et de configurations de lancer, avant d'envisager une application industrielle concrète.

RecherchePaper
1 source
108arXiv cs.RO 

AgenticFocus : synthèse de réalité mixte préservant les objets à partir de vidéo FPV humaine pour l'apprentissage humanoïde dextérique

AgenticFocus, un pipeline de synthèse en réalité mixte, transforme des vidéos ordinaires filmées à la première personne (FPV) par des humains en démonstrations exploitables pour l'apprentissage de robots humanoïdes. Présenté dans un article arXiv publié cette semaine (2607.08857), le système s'attaque à trois obstacles récurrents des pipelines existants: l'occlusion des objets par la main pendant la manipulation, les mouvements simplifiés à l'excès dans les jeux de données synthétiques, et la dépendance à du matériel de capture spécialisé coûteux. Concrètement, AgenticFocus reconstruit la géométrie des objets masqués par la main, restitue le mouvement complet des doigts, puis retargete l'ensemble vers un corps humanoïde via un alignement relatif à la caméra et un compositing en couches. Le résultat est un jeu de données synchronisant observations visuelles recentrées et actions ou états du robot. Sur le plan quantitatif, la trajectoire produite affiche une erreur plus faible et un mouvement du poignet plus lisse que des méthodes de référence cross-embodiment, avec des scores SPARC de -5,18 contre -5,56 et -6,05 pour les baselines (plus proche de zéro signifiant un geste plus fluide). L'enjeu dépasse la seule métrique technique. L'apprentissage de politiques pour humanoïdes bute depuis des années sur le manque de données de manipulation dexterity à grande échelle: la téléopération et la capture en réalité virtuelle sont précises mais lentes à produire, tandis que la vidéo humaine ordinaire est abondante mais bruitée et difficile à retargeter fidèlement. En améliorant la qualité de reconstruction de la main et de l'objet à partir de simples vidéos FPV, ce type de pipeline vise à débloquer un gisement de données quasi illimité, sans capteurs dédiés, pour entraîner des modèles vision-langage-action (VLA). C'est une brique d'infrastructure plutôt qu'un produit fini, mais elle touche directement au goulot d'étranglement identifié par la plupart des laboratoires travaillant sur la manipulation dexterity chez l'humanoïde. Cette approche s'inscrit dans une tendance plus large de l'industrie, où plusieurs équipes cherchent à exploiter la vidéo humaine égocentrique comme source de supervision scalable, en complément des données de téléopération utilisées pour entraîner les modèles VLA de nouvelle génération. L'article ne précise ni affiliation institutionnelle ni plan de mise à disposition du code ou du jeu de données, ce qui limite pour l'instant la reproductibilité et l'adoption par des équipes tierces.

RecherchePaper
1 source
10936Kr 

Om AI de Zhao Tiancheng : des années de persévérance, pari sur l'avenir « en flux continu » natif de l'IA physique

Om AI, jeune pousse chinoise fondée par Zhao Tiancheng, docteur de l'institut de technologies du langage de Carnegie Mellon, vient de dévoiler VLX, une famille de modèles multimodaux présentée comme la première au monde conçue nativement pour fonctionner en flux continu sur des terminaux physiques. L'architecture repose sur trois modules imbriqués, Flow pour la perception, Seek pour la localisation, Go pour la décision et l'action, formant une boucle complète perception, localisation, action directement embarquée, sans dépendre du cloud. Contrairement à l'approche dominante qui découpe la vidéo en images fixes traitées une par une, VLX ingère le flux vidéo en continu, à la manière d'une eau qui coule, et raisonne en temps réel sans attendre de requête. Le déclic remonte à 2023, quand l'équipe a constaté qu'un modèle multimodal n'ayant jamais vu la moindre image de vidéosurveillance surpassait des modèles spécialisés entraînés pendant des années sur ce type de données, preuve selon Zhao Tiancheng que l'entraînement conjoint vision-langage generalise mieux dans le monde physique ouvert que les modèles dédiés. Om AI revendique aujourd'hui des revenus de l'ordre de la centaine de millions de yuans et un déploiement effectif sur des robots, drones, objets connectés, caméras de sécurité et PC IA, avec des données réelles remontant en continu depuis le terrain pour réentraîner les modèles. Cette annonce arrive alors que le secteur de l'IA physique traverse une phase de forte incertitude méthodologique, entre modèles vision-langage-action, génération vidéo, simulation 3D et approches par représentation type JEPA, sans consensus sur la voie qui mènera à une production industrielle. Le pari d'Om AI sur l'intelligence embarquée plutôt que centralisée dans le cloud répond à une contrainte concrète de sécurité et de latence: un robot qui se fige ou chute a des conséquences bien plus graves qu'un bug logiciel classique, un argument que la société met en avant pour justifier une intelligence distribuée sur chaque terminal plutôt qu'un cerveau unique. Le financement mondial de l'IA physique a dépassé 6,4 milliards de dollars sur le seul premier trimestre 2026, signe d'un secteur en quête de preuves de déploiement réel plutôt que de démonstrations. Le positionnement de Zhao Tiancheng s'est construit sur cinq années à contre-courant: alors que l'industrie chinoise se ruait sur les grands modèles de langage générateurs de texte après 2023, il a maintenu le cap sur la fusion vision-langage, misant sur son expérience d'un projet multimodal à un milliard de dollars mené chez Yahoo pendant son doctorat. Plusieurs membres de l'équipe sont partis durant les vagues successives d'engouement pour d'autres approches, avant que le virage du secteur vers l'IA physique en 2026 ne valide, selon lui, ce choix initial resté longtemps minoritaire face aux modèles de langage et, plus récemment, aux modèles du monde.

Chine/AsieActu
1 source
110Pandaily 

L'entreprise Ant Group robotique Lingbo adopte une nouvelle approche pour construire les cerveaux des robots

Ant Group, la maison mère d'Alipay, développe via sa filiale Lingbo une approche inhabituelle pour concevoir des cerveaux de robots, en s'appuyant sur l'immense infrastructure de données et d'intelligence artificielle issue de son écosystème de paiement. Plutôt que de partir du matériel comme la plupart des startups d'IA incarnée, Lingbo privilégie d'abord la couche cognitive. L'entreprise mobilise l'expertise d'Ant Group en traitement transactionnel à haute fréquence, en prise de décision en temps réel dans l'incertitude et en inférence distribuée à grande échelle, des compétences accumulées sur plusieurs années à traiter des milliards de transactions quotidiennes via Alipay (détection de fraude, évaluation de risque, recommandation personnalisée). Lingbo entend transposer cette infrastructure vers la robotique pour bâtir un cerveau robotique capable de gérer la complexité et l'incertitude du monde physique avec la même fiabilité que le traitement financier. L'unité bénéficie d'une autonomie importante au sein d'Ant Group et attire des talents issus à la fois de la recherche en IA et de l'industrie robotique. Aucun produit concret ni calendrier commercial n'a été rendu public à ce stade. Cette stratégie illustre un mouvement plus large : des acteurs de la tech et de la finance entrent dans la course à l'IA incarnée en misant sur leurs atouts logiciels et data plutôt que sur la fabrication de matériel. Pour Lingbo, la partie la plus valorisable de la chaîne robotique ne serait pas la mécanique mais la couche d'intelligence, un pari qui, s'il se confirme, redistribuerait les cartes face aux spécialistes du hardware comme les fabricants d'humanoïdes. Pour les intégrateurs et décideurs industriels, ce positionnement pose une question stratégique : la donnée comportementale et transactionnelle à l'échelle d'Alipay, plusieurs centaines de millions d'utilisateurs, peut-elle vraiment se transférer à la compréhension d'un environnement physique et à la décision robotique ? Rien dans les éléments communiqués ne le démontre encore, et l'annonce reste à ce stade programmatique plutôt que prouvée par un produit déployé. Elle mérite néanmoins d'être suivie car elle traduit un changement de doctrine : dans un paysage chinois où les plateformes matérielles se banalisent, l'avantage compétitif se déplacerait vers le logiciel, la donnée et l'infrastructure de déploiement. Ant Group a construit ses capacités d'IA sur plusieurs années, d'abord pour la détection de fraude et la gestion des risques sur Alipay, avant d'intégrer des assistants IA à l'échelle de son écosystème, utilisés par des centaines de millions de personnes. Lingbo s'inscrit dans le prolongement naturel de cette expansion technologique vers le monde physique, dans un contexte où la Chine voit fleurir de multiples acteurs robotiques, qu'il s'agisse de fabricants d'humanoïdes ou de laboratoires développant des modèles généralistes de type VLA (vision-language-action), comparables aux Pi-0 ou GR00T N2 développés aux États-Unis. Contrairement à des concurrents qui présentent déjà des démonstrateurs matériels, Lingbo n'a pour l'instant communiqué ni prototype ni partenariat industriel identifié, ce qui place la démarche au stade de la déclaration d'intention stratégique. Les prochaines étapes à surveiller seront la première présentation publique d'un système intégré, d'éventuels partenariats avec des fabricants de plateformes robotiques, et la manière dont Ant Group articulera cette activité avec ses autres investissements en IA générative.

Chine/AsieOpinion
1 source
111Pandaily 

BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour

Treize nouveaux modèles fondation et modèles du monde pour la robotique embarquée ont été annoncés en juin 2026, soit environ un tous les 48 heures. Lors de la Conférence Zhiyuan 2026, le BAAI (Beijing Academy of Artificial Intelligence) a présenté deux avancées : Wujie Physis-v0.1, qui prédit l'état physique suivant en compressant vidéo, données RGB-D, nuages de points 3D et retour tactile dans un espace latent unifié, et Wujie RoboBrain Orca, un "cerveau" robotique combinant représentation unifiée, raisonnement causal et décodage multimodal. Le 16 juin, Alibaba a dévoilé la suite Qwen-Robot, composée de trois modèles complémentaires : Qwen-RobotNav pour l'allocation d'attention visuelle en navigation mobile, Qwen-RobotManip qui standardise l'espace état-action pour la manipulation, et Qwen-RobotWorld, doté d'une interface en langage naturel pour prédire la dynamique du monde. CasiaHand a lancé Brain-Si 0.5, présenté comme le premier modèle de manipulation dextre humanoïde, avec une architecture à trois niveaux allant de la planification VLA jusqu'à des modèles physiquement interprétables. GalaxyBot a de son côté publié AstraBrain-WBC 0.5, un modèle de contrôle corps entier entraîné sur environ 2 milliards d'images issues de mouvements humains, pour 80 millions de paramètres. RoboScience, Current Robotics et BoundlessPower ont complété la liste avec respectivement l'architecture Visics, le modèle Curl-0 et le modèle du monde MWA. Cette accélération marque un basculement net dans l'industrie de la robotique embarquée : la compétition ne se joue plus sur les capacités matérielles des robots, mais sur l'intelligence logicielle qui les pilote. Signe le plus révélateur, la posture d'Alibaba tranche avec l'approche dominante du "plus de données, plus de robots" : le groupe affirme que l'hétérogénéité du monde physique ne peut pas être résolue par le seul passage à l'échelle et nécessite un alignement au niveau du modèle lui-même. Pour les intégrateurs et décideurs industriels, le signal est important : les équipes ne cherchent plus seulement à démontrer ce que les robots savent faire, mais à expliquer pourquoi ils échouent encore sur certaines tâches, chacune identifiant un goulot d'étranglement différent, retour tactile, coordination corps entier, transfert simulation-réel ou planification à long horizon. Ce foisonnement s'inscrit dans la course engagée depuis 2024-2025 entre laboratoires chinois et occidentaux (Figure, Physical Intelligence avec Pi-0, NVIDIA avec GR00T) autour des modèles vision-langage-action. La France et l'Europe restent absentes de cette vague spécifique de publications, la dynamique se concentrant pour l'instant sur les acteurs chinois (BAAI, Alibaba, CasiaHand, GalaxyBot) et américains. Les prochaines étapes attendues concernent la validation de ces architectures sur des déploiements réels au-delà des démonstrations en laboratoire, un point sur lequel la prudence reste de mise tant les métriques annoncées, notamment le nombre de paramètres ou de frames d'entraînement, restent difficiles à comparer d'un laboratoire à l'autre sans benchmarks communs.

Chine/AsieOpinion
1 source
112Interesting Engineering 

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots

La société chinoise Robbyant a dévoilé LingBot-Depth 2.0, une nouvelle génération de modèles de perception spatiale pour robots, accompagnée d'un modèle de vision associé baptisé LingBot-Vision. LingBot-Depth 2.0 s'appuie sur la version précédente, qui avait introduit la technique de Masked Depth Modeling (MDM) pour améliorer la détection de profondeur sur les surfaces transparentes et réfléchissantes. Entraîné sur 150 millions d'échantillons, le nouveau modèle obtient les meilleurs résultats sur 12 des 16 benchmarks de complétion de profondeur testés. Dans les scénarios de perte de profondeur sévère, l'erreur est divisée par plus de deux par rapport au modèle précédent, le score RMSE passant de 0,132 à 0,062. Le modèle progresse aussi sur la détection des surfaces vitrées et des miroirs, un point faible classique des caméras de profondeur. LingBot-Vision, entraîné sur 160 millions d'images (un jeu de données plus restreint que ceux des modèles concurrents), utilise pour la première fois la "structure de bordure" comme objectif de pré-entraînement, permettant une localisation des contours au niveau sub-pixel et un suivi stable des arêtes d'objets sur des séquences vidéo. Pour l'industrie robotique, cette annonce illustre la poursuite de la course aux modèles de perception spatiale comme brique fondamentale des systèmes d'IA incarnée, aux côtés des modèles d'action type VLA (vision-langage-action) tels que Pi-0 ou GR00T N2. Une perception de profondeur fiable sur verre et surfaces réfléchissantes reste un obstacle concret pour la navigation en environnement intérieur (entrepôts, bureaux, hôpitaux), là où les caméras stéréo et LiDAR classiques échouent régulièrement. La certification obtenue auprès du Depth Vision Laboratory d'Orbbec, avec des tests sur les caméras stéréo 3D Gemini 330, apporte une validation industrielle plus tangible qu'une simple annonce marketing, même si les chiffres de benchmark restent ceux communiqués par Robbyant lui-même et mériteraient une vérification indépendante. Le partenariat avec Orbbec, fabricant reconnu de capteurs 3D, va au-delà de la validation logicielle : il s'étend au matériel, avec l'intégration d'une version personnalisée de LingBot-Depth dans le dispositif RGB-D EGO de la nouvelle plateforme de collecte de données "Robot-Free" d'Orbbec, conçue pour capturer des données d'entraînement sans mobiliser de robot physique. Robbyant annonce qu'une version commerciale avancée du modèle sera intégrée à cette plateforme dans de futures mises à jour, avec pour objectif de fournir une base de données plus précise et stable pour l'entraînement des systèmes d'IA incarnée. Le mouvement s'inscrit dans une dynamique plus large de fournisseurs chinois de modèles de fondation pour la robotique cherchant à s'imposer comme briques de perception standard, à un moment où la course humanoïde et logistique internationale accélère la demande de systèmes de perception robustes et bon marché.

Chine/AsieActu
1 source
FabriVLA : un modèle vision-langage-action léger pour une manipulation précise multi-tâches
113arXiv cs.RO 

FabriVLA : un modèle vision-langage-action léger pour une manipulation précise multi-tâches

FabriVLA, un modèle vision-langage-action (VLA) léger dédié à la manipulation robotique multi-tâches de précision, vient d'être présenté sur arXiv (2607.08575v1). L'architecture associe un backbone vision-langage InternVL3.5 à une tête d'action par flow-matching, dotée d'une auto-attention filtrée entre les tokens d'action et d'une fusion superficielle des couches du VLM pour enrichir le contexte spatial. Le modèle est entraîné en une seule étape d'optimisation conjointe, à partir d'un VLM pré-entraîné combiné à une tête d'action initialisée aléatoirement. Sur le benchmark Meta-World MT50, qui couvre 50 tâches de manipulation variées, FabriVLA atteint un taux de réussite moyen par palier de 90,0%, avec un VLM d'à peine 1 milliard de paramètres. Ce résultat pèse dans le débat sur la taille optimale des modèles VLA. Jusqu'ici, les meilleures performances en manipulation semblaient réservées aux backbones de plusieurs milliards de paramètres, comme Pi-0 ou GR00T N2. Un modèle compact atteignant 90% de réussite sur un benchmark aussi large que MT50 laisse entrevoir des coûts d'inférence et de déploiement embarqué nettement réduits, un enjeu concret pour les intégrateurs travaillant sur des bras robotiques industriels ou des plateformes mobiles aux ressources de calcul limitées. Cela conforte aussi l'hypothèse qu'une conception spécialisée de la tête d'action, via flow-matching et attention inter-tokens, peut compenser la taille réduite du VLM sous-jacent. FabriVLA s'inscrit dans la lignée des modèles VLA ayant suivi RT-2 et Octo, et plus récemment les approches par flow-matching popularisées par Pi-0 chez Physical Intelligence ou les architectures GR00T N2 de NVIDIA. Le choix d'InternVL3.5, backbone open plus modeste que certains VLM propriétaires concurrents, illustre une tendance à réutiliser des composants déjà optimisés plutôt qu'à entraîner des architectures VLA depuis zéro. À ce stade, les résultats restent une validation en simulation sur Meta-World; la suite logique attendue par la communauté robotique sera la démonstration de ces gains sur des tâches de manipulation réelle, hors benchmark simulé.

IA physiqueActu
1 source
Dexmal lance MaaS incarné et DexOS, résolvant le passage à l'échelle des modèles en conditions réelles
114Pandaily 

Dexmal lance MaaS incarné et DexOS, résolvant le passage à l'échelle des modèles en conditions réelles

Dexmal, anciennement connue sous le nom de Yuanli Lingji, a dévoilé lors de sa première conférence développeurs Action une suite complète de produits d'IA incarnée destinée à répondre au problème structurel de la mise à l'échelle des modèles fondationnels sur du matériel robotique hétérogène. Au centre de l'annonce, le modèle DM0.5 voit ses paramètres doubler pour atteindre 4 milliards, entraîné sur 150 000 heures de données dont 50 000 heures issues de robots réels avec annotation 3D au millimètre près des points clés de la main, complétées par 100 000 heures d'enregistrements d'opérations humaines à la première personne. Trois choix d'architecture distinguent ce modèle : une mémoire native supportant jusqu'à 60 secondes de contexte via une couche d'abstraction intégrée au pré-entraînement, un système de raisonnement à deux niveaux qui sépare la planification des tâches de la génération de mouvement avec un entraînement contrefactuel censé garantir une réelle compréhension des instructions, et un alignement des actions par programmation dynamique contrainte pour normaliser des trajectoires exécutées à des vitesses différentes. Autour de ce modèle, Dexmal lance DexOS, présenté comme l'équivalent d'un système d'exploitation standardisé pour la robotique avec un protocole ouvert baptisé ECP, permettant aux développeurs d'intégrer leur modèle une seule fois puis de le déployer sur plusieurs plateformes matérielles. La plateforme DexDev regroupe DFOL 2.0, un système d'apprentissage par renforcement basé sur un modèle du monde (DW0.5) qui réduirait de 60% le volume de données d'entraînement robotique réel nécessaire et de 40% les coûts associés, ainsi qu'un service MaaS d'inférence facturé à l'usage. Dexmal revendique une latence d'inférence de 50 millisecondes et la possibilité d'effectuer du post-entraînement sur une simple carte grand public RTX 4090. Deux nouvelles plateformes matérielles, Apex pour l'industrie et Ferrata pour la logistique, viennent s'ajouter au bras double existant Mint. L'enjeu réel derrière cette annonce est le problème dit du N fois M : sans couche de standardisation, chaque modèle doit être réadapté à chaque configuration matérielle, ce qui freine toute diffusion à l'échelle. En misant sur un écosystème ouvert de développeurs plutôt que sur une intégration verticale fermée à la manière de Tesla ou Figure, Dexmal cherche à devenir la couche logicielle commune du secteur plutôt qu'un fournisseur de robots parmi d'autres. Le fondateur Tang Wenbin a d'ailleurs posé le vrai critère de réussite : que les développeurs choisissent DM0.5 plutôt que les alternatives open source, un test que les modèles précédents de l'entreprise n'avaient pas franchi selon lui. La promesse de réduction des données réelles nécessaires grâce à la simulation dans un modèle du monde touche directement au fossé sim-to-real qui limite encore le déploiement des VLA en conditions réelles, mais ces gains restent pour l'instant des chiffres communiqués par l'entreprise, sans validation indépendante. Le rebranding depuis Yuanli Lingji s'inscrit dans la vague d'entreprises chinoises d'IA incarnée cherchant à se positionner face aux acteurs américains comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), ainsi qu'aux humanoïdes concurrents tels qu'Optimus. Aucun acteur français ou européen n'apparaît dans cette annonce. La suite dépendra de l'adoption réelle du protocole ECP par des développeurs tiers et de déploiements pilotes concrets sur les nouvelles plateformes Apex et Ferrata, dont aucun calendrier précis n'a été communiqué.

IA physiqueActu
1 source
Nvidia devient premier partenaire mondial de simulation tactile, nouveau financement de centaines de millions et commandes multipliées par quatre au premier semestre
11536Kr 

Nvidia devient premier partenaire mondial de simulation tactile, nouveau financement de centaines de millions et commandes multipliées par quatre au premier semestre

La société pékinoise Tashan Technology (他山科技) a bouclé un tour de série B de plusieurs centaines de millions de yuans, avec la participation de Joyson Electronics, Taiping Innovation, AUX, Pengling, Lavender Hill Capital Partners (LHCP) et Hongshan Capital, ainsi qu'un réinvestissement des actionnaires historiques Daoshi Technology et Binfu Capital. Les fonds serviront à l'itération des capteurs et puces tactiles, au déploiement de solutions par secteur et à la construction d'une plateforme d'entraînement tactile. Fondée en 2017, l'entreprise développe une pile complète de perception tactile pour robots, du silicium à l'application : une équipe issue de Tsinghua et de l'université de Manchester, avec Steve Furber, co-inventeur de l'architecture ARM, comme chercheur en chef, et un laboratoire commun avec Manchester créé dès 2019. Son produit phare est une puce mixte analogique-numérique basée sur un réseau de neurones à impulsions, conçue pour un traitement tactile embarqué à faible latence ; une nouvelle génération vient d'être gravée avec lancement prévu au troisième trimestre 2026. Les capteurs TS-F (bout de doigt, résolution de force de 0,01 N, reconnaissance de plus de 30 matériaux sans contact) et TS-E (pince) ont vu leur fréquence de mesure multipliée par 3 à 4 cette année. Deux centres de collecte de données ont ouvert à Pékin et dans le Hubei en mars et mai 2026, et la société se présente comme premier partenaire mondial de simulation tactile de Nvidia Isaac Sim, avec un moteur open source sur MuJoCo. Selon l'entreprise, les commandes de capteurs tactiles atteignaient fin mai déjà quatre fois le chiffre d'affaires annuel 2025, pour plus de 180 clients incluant Galbot, Xingdong Jiyuan ou BrainCo, et une part de marché revendiquée supérieure à 80 % sur les capteurs tactiles pour mains robotiques humanoïdes. Ces chiffres, invérifiés indépendamment, illustrent néanmoins un basculement réel du secteur : le taux d'équipement tactile des mains articulées serait passé d'environ 20 % à plus de 60 % en un an, un rythme d'adoption rare pour un composant matériel. Cela confirme une hypothèse qui circulait dans l'IA incarnée sans preuve solide jusqu'ici : sans retour de force, la boucle perception-action ne se referme pas sur des tâches de manipulation fine, et la seule vision ne suffit pas à saisir des objets fragiles ou déformables. Que des fournisseurs de modèles achètent désormais des capteurs en volume pour entraîner leurs systèmes tactiles renforce l'idée que la donnée tactile devient une ressource aussi disputée que la vidéo de démonstration, avec des conséquences directes de coût et de fiabilité pour les intégrateurs qui équipent des mains robotiques. Le partenariat le plus marquant reste la collaboration avec Richard Sutton, lauréat du prix Turing et figure fondatrice de l'apprentissage par renforcement, autour d'un projet baptisé "jardin d'enfants pour robots", visant à faire apprendre aux machines par essai-erreur tactile en environnement réel. Tashan prévoit que son activité robotique dépassera l'automobile de 3 à 4 fois en 2026, pour environ deux tiers du chiffre d'affaires, et anticipe une vague d'algorithmes et de modèles tactiles commerciaux à partir de 2027, un calendrier qui reste, comme les autres métriques, à confirmer par les livraisons effectives.

Chine/AsieActu
1 source
NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots
116Interesting Engineering 

NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots

NVIDIA et Hugging Face élargissent leur collaboration autour de LeRobot, la plateforme robotique open source de Hugging Face, avec l'ajout de deux nouveaux outils. Le premier est NVIDIA Isaac GR00T 1.7, présenté par NVIDIA comme son premier modèle de fondation robotique vision-langage-action (VLA) ouvert et commercialement exploitable, conçu pour simplifier le post-entraînement et le déploiement sur différents designs de robots. Le second est NVIDIA Isaac Teleop, un framework open source permettant de collecter des données d'entraînement de haute qualité via des démonstrations humaines avec des dispositifs de contrôle externes, dans un format standardisé et partageable au sein de l'écosystème LeRobot. Un troisième modèle, Cosmos 3, dédié à la génération de données synthétiques et à la simulation d'environnements, sera intégré ultérieurement. Ces annonces s'appuient sur des briques déjà disponibles sur LeRobot, dont un jeu de données ouvert de plus de 350 000 trajectoires robotiques réelles et simulées et 57 millions d'exemples de préhension, ainsi que les outils de simulation Isaac Sim et Isaac Lab, l'environnement Isaac Lab-Arena pour l'entraînement de politiques, et l'intégration du calculateur embarqué Jetson Thor sur le robot humanoïde Reachy 2. NVIDIA a par ailleurs récemment lancé Halos for Robotics, une plateforme de sécurité complète associant matériel, logiciel, capteurs et outils de validation pour les robots autonomes évoluant aux côtés d'humains. Pour l'industrie robotique, l'enjeu affiché est de reproduire pour la robotique la dynamique d'ouverture qui a accéléré le développement en IA logicielle, où le partage de modèles et de jeux de données a fait baisser les coûts d'entrée. NVIDIA met en avant la connexion entre sa communauté de plus de trois millions de développeurs robotiques et les seize millions de développeurs IA de Hugging Face, dans le but de standardiser un flux de travail encore fragmenté, entre collecte de données coûteuse, simulation, puissance de calcul et validation. Si ces chiffres de communauté restent des éléments de communication à prendre avec prudence, l'initiative traduit une tendance de fond: la bascule des modèles VLA de la démonstration marketing vers des briques réutilisables et déployables par des tiers, un test concret de la promesse d'un "sim-to-real" et d'une généralisation multi-robots qui reste à prouver à grande échelle. L'initiative prolonge le partenariat déjà engagé entre les deux entreprises autour de LeRobot et des outils de simulation NVIDIA Isaac, dans un secteur où les modèles fondation pour la robotique se multiplient face à des approches concurrentes comme Pi-0 ou GR00T N2. Les prochaines étapes attendues concernent l'arrivée effective de Cosmos 3 sur la plateforme et l'élargissement du catalogue de robots et de tâches supportés via Isaac Teleop et le jeu de données partagé.

UELe robot humanoïde français Reachy 2 (Pollen Robotics) intègre le calculateur embarqué Jetson Thor de NVIDIA dans le cadre de cet écosystème LeRobot.

IA physiqueActu
1 source
L'Unitree et l'UBTECH : deux expériences commerciales divergentes pour les robots humanoïdes chinois en 2026
117Pandaily 

L'Unitree et l'UBTECH : deux expériences commerciales divergentes pour les robots humanoïdes chinois en 2026

L'industrie chinoise des robots humanoïdes a atteint un tournant en juillet 2026, avec deux entreprises leaders adoptant des stratégies de commercialisation radicalement opposées. Unitree Robotics, basée à Hangzhou et connue pour ses robots quadrupèdes, a obtenu l'approbation de son introduction en bourse sur le STAR Market de Shanghai, levant plus de 5,9 milliards de dollars. L'entreprise vise 20 000 livraisons de robots humanoïdes cette année. Son modèle G1, vendu à partir de 13 500 dollars, dispose de plus de 30 degrés de liberté, d'une navigation autonome et de capacités de préhension complexes. Ce prix casse d'un ordre de grandeur celui de l'Atlas de Boston Dynamics (estimé à plusieurs millions de dollars l'unité) et celui de l'Optimus de Tesla. Unitree doit cet avantage à son expérience de fabricant de robots quadrupèdes, dont elle a écoulé des dizaines de milliers d'exemplaires dans le monde, ce qui lui a permis d'affiner sur plusieurs générations les chaînes d'approvisionnement chinoises en réducteurs, moteurs brushless à forte densité de puissance, systèmes micro-hydrauliques et capteurs. Les fonds levés serviront à agrandir sa méga-usine du delta du Yangtsé et à développer WVLA 2.0, son modèle fondationnel World-Video-Language-Action. À l'opposé, UBTECH a dévoilé sa série YouWorld U1, des robots compagnons présentés comme hyperréalistes, avec une réplication annoncée au pore près de la peau et des vaisseaux sanguins sous-cutanés, pilotés par des modèles de langage à visée émotionnelle. Facturé jusqu'à 140 000 dollars dans ses versions haut de gamme, le U1 a déjà enregistré plus de 13 000 commandes en quelques jours auprès d'une clientèle fortunée, un chiffre à prendre avec prudence tant qu'aucune livraison effective n'est confirmée. Ces deux trajectoires illustrent la tension centrale de la commercialisation de l'IA incarnée. Unitree mise sur une logique fordiste, faisant baisser les coûts grâce à la maîtrise de sa chaîne d'approvisionnement pour rendre les humanoïdes accessibles aux usines, aux entrepôts, puis potentiellement aux foyers. UBTECH parie au contraire sur un compagnon émotionnel haut de gamme, façon Westworld, misant sur l'idée que le lien affectif entre humain et robot justifie un prix élevé. Pour les intégrateurs et décideurs industriels, l'écart entre le G1 à 13 500 dollars et les millions facturés par Boston Dynamics ouvre la voie à des déploiements à grande échelle en logistique et en manufacture, à condition que les capacités annoncées tiennent la route en conditions réelles au-delà des démonstrations. Le pari d'UBTECH teste une hypothèse différente et largement inexplorée commercialement : que des particuliers aisés paient une prime importante pour une présence robotique à forte charge émotionnelle plutôt que pour une utilité productive. Menées en parallèle sur le même marché chinois, ces deux expériences généreront des données précieuses sur la question de savoir si la robotique humanoïde se développe d'abord par la baisse des coûts ou par la création de valeur émotionnelle. Unitree s'est imposé ces dernières années comme le principal fabricant mondial de robots quadrupèdes avant de basculer vers l'humanoïde en capitalisant sur cette base industrielle et logicielle. UBTECH, acteur établi de la robotique de service et d'éducation en Chine coté à Hong Kong, investit désormais massivement dans l'IA émotionnelle pour se différencier sur un marché où la concurrence industrielle se durcit. Les deux entreprises bénéficient d'un écosystème chinois particulièrement dense en moteurs, capteurs, batteries et puces de calcul, un avantage structurel que peu d'acteurs occidentaux, à commencer par Boston Dynamics ou Tesla, peuvent répliquer à ce coût. La suite dépendra de la capacité d'Unitree à tenir son objectif de 20 000 unités livrées en 2026 et à démontrer que WVLA 2.0 fonctionne au-delà des vidéos de démonstration, ainsi que de la capacité d'UBTECH à honorer ses premières commandes du U1 et à prouver que la demande pour des compagnons hyperréalistes dépasse l'effet de curiosité initial.

Chine/AsieOpinion
1 source
Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue
118arXiv cs.RO 

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue

Une équipe de chercheurs publie sur arXiv (référence 2607.06706, mise en ligne le 7 juillet 2026) une revue de littérature consacrée aux modèles Vision-Language-Action (VLA), ces architectures qui unifient perception visuelle, compréhension du langage naturel et génération d'actions dans un seul modèle de fondation. L'objectif : permettre à un robot d'exécuter une instruction du type "plie la serviette" ou "vole vers le bâtiment rouge" directement à partir d'images caméra, sans étape de programmation intermédiaire. Le travail passe en revue 183 contributions publiées entre 2017 et 2026, organisées selon sept axes : les architectures VLA, les recettes d'entraînement, les représentations d'actions, la coordination bimanuelle (2022-2026), la navigation et le contrôle de drones (2017-2026), l'ancrage du langage dans la perception, et des enjeux transverses comme la mémoire et les modèles du monde. Les auteurs identifient au passage quatorze directions de recherche encore ouvertes dans ces deux domaines. L'intérêt de cette synthèse tient au rapprochement qu'elle opère entre deux champs jusqu'ici traités séparément. La manipulation bimanuelle, où deux bras à 7 degrés de liberté chacun doivent coordonner leurs mouvements pour plier, assembler ou réorienter un objet, sert de banc d'essai le plus exigeant pour les VLA appliqués à la manipulation. Or les auteurs montrent que les stratégies de coordination, les recettes d'entraînement et les représentations d'actions conçues pour ces bras robotiques se transfèrent directement aux drones, confrontés à un défi structurellement similaire : coordonner poussée, attitude et, de plus en plus, commandes de préhenseur à partir d'observations visuelles, sous des contraintes strictes de latence et de charge utile (payload). Pour les intégrateurs et décideurs du secteur robotique, cela suggère qu'un socle technique commun pourrait émerger entre robotique aérienne et manipulation au sol, plutôt que deux écosystèmes cloisonnés. Cette revue s'inscrit dans la montée en puissance des VLA comme cadre dominant de l'apprentissage robotique, portée par leur capacité à hériter des connaissances générales acquises lors d'un pré-entraînement à l'échelle d'Internet, un atout que les approches de contrôle classiques n'offrent pas. En couvrant neuf ans de littérature sur la manipulation bimanuelle et la navigation de drones dans un même cadre d'analyse, le travail offre une cartographie utile pour situer les futures publications et les futurs produits commerciaux dans ce paysage encore mouvant, sans toutefois lui-même annoncer de déploiement ou de système opérationnel nouveau.

RecherchePaper
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
119arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
120arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
Modèle vision-langage-action pour la génération compositionnelle de mouvements à partir de démonstrations avec champs neuronaux centrés sur l'objet
121arXiv cs.RO 

Modèle vision-langage-action pour la génération compositionnelle de mouvements à partir de démonstrations avec champs neuronaux centrés sur l'objet

Des chercheurs publient sur arXiv (identifiant 2607.07129, soumission de type "new", juillet 2026) un framework d'apprentissage par démonstration pour la génération de mouvement robotique compositionnel. La méthode combine des représentations neuronales centrées objet, des neural fields canoniques associés à des déformations conditionnées par une variable latente, pour rendre des scènes en capturant variations de position et de géométrie de façon lisse et interprétable. Pour la génération de mouvement, un mélange d'experts temporel (temporal mixture-of-experts) utilise un mécanisme de gating qui combine dans le temps des primitives de mouvement conditionnées par objet, produisant des trajectoires complètes. En simulation, le modèle accomplit des tâches de manipulation à long horizon avec significativement moins de données d'entraînement que les méthodes de référence basées sur l'image. Des expériences en conditions réelles confirment la robustesse au bruit, une généralisation au niveau catégoriel grâce à des modèles de segmentation pilotés par le langage, et la capacité d'opérer directement sur des représentations de scène en 3D. Cette approche s'attaque à un problème central de l'apprentissage par démonstration en robotique: généraliser au-delà des configurations de scène vues à l'entraînement sans faire exploser les besoins en données. En ancrant le mouvement dans une structure visuelle explicite plutôt que dans des pixels bruts, la méthode promet une efficacité data nettement supérieure, un enjeu critique pour les intégrateurs industriels qui ne disposent pas des volumes de démonstrations que collectent les grands laboratoires spécialisés en modèles vision-langage-action. Si ces résultats se confirment à plus grande échelle, cette compositionnalité spatio-temporelle pourrait réduire le coût de déploiement de bras manipulateurs dans des environnements variés, sans réentraînement complet à chaque nouvelle configuration. Le travail s'inscrit dans la double lignée des "movement primitives", qui structurent le mouvement en briques réutilisables, et des neural fields appliqués à la robotique, qui représentent la géométrie de façon compacte. Il se positionne comme alternative modulaire et interprétable face aux modèles VLA end-to-end à grande échelle, généralement plus gourmands en données mais plus généralistes. L'article, validé en simulation et par des expériences réelles limitées, ne mentionne aucun déploiement industriel ni partenariat commercial: il s'agit à ce stade d'une contribution académique dont la suite logique serait une évaluation sur des plateformes robotiques partagées et des benchmarks standardisés.

IA physiqueActu
1 source
WristMimic : contrôle corps entier de l'humanoïde par manipulation guidée au poignet
122arXiv cs.RO 

WristMimic : contrôle corps entier de l'humanoïde par manipulation guidée au poignet

Publié en juillet 2026 sur arXiv, WristMimic est un framework de contrôle corps entier pour robots humanoïdes qui transfère des démonstrations humaines de manipulation vers une simulation physique. Plutôt que de suivre intégralement la pose de la main, la méthode sépare le corps et le poignet, guidés cinématiquement, des doigts, qui apprennent leurs gestes de préhension à partir du suivi de l'objet et du résultat des contacts. Le poignet sert de charnière entre les deux régimes : peu soumis aux forces de contact, il reste suivable fidèlement tout en plaçant la main dans une configuration de prise atteignable. Des contraintes de réinitialisation et une priorisation des récompenses au poignet fiabilisent ce positionnement ; les auteurs annoncent des performances égales ou supérieures aux méthodes à supervision complète des doigts, avec un retargeting indépendant de la morphologie de la main. Le problème ciblé est connu en contrôle humanoïde : une trajectoire de main en position seule ne renseigne pas les forces de contact nécessaires à une prise réussie, et imposer un suivi complet des doigts tend à surcontraindre des comportements qui doivent rester riches en contacts, ce qui fragilise la manipulation fine. En découplant mouvement libre et manipulation, WristMimic s'inscrit dans la recherche sur l'imitation à grande échelle pour l'IA incarnée, sans dépendre d'une capture de main parfaite. Pour l'industrie, l'argument concret est qu'une approche agnostique à la morphologie de la main pourrait réduire le travail d'adaptation quand un intégrateur change de main dextérisée, un problème récurrent tant les architectures varient d'un fabricant humanoïde à l'autre. Ce travail s'inscrit dans la lignée des méthodes de contrôle guidé par la cinématique humaine pour humanoïdes, qui cherchent depuis deux ans à rapprocher téléopération et apprentissage par renforcement. L'abstract ne mentionne aucun déploiement sur robot réel ni partenariat industriel : il s'agit pour l'instant d'une validation en simulation, une contribution de recherche plutôt qu'un produit. Les suites logiques seraient une validation sur plateforme humanoïde physique et une comparaison avec les pipelines de téléopération des acteurs du secteur, qu'il s'agisse des humanoïdes commerciaux ou des modèles VLA généralistes comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme
123arXiv cs.RO 

LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme

Des chercheurs présentent LH-AVLN (Long-Horizon Audio-Visual-Language Navigation), un nouveau benchmark pour évaluer des agents de navigation autonome devant accomplir des missions longues combinant vision, langage et audio spatialisé. Contrairement aux benchmarks existants, généralement silencieux et centrés sur un objectif unique, LH-AVLN impose à l'agent une mission globale de deux à quatre objectifs, spécifiés soit par catégorie d'objet, soit par description en langage naturel, soit par image de référence. L'agent navigue dans des environnements intérieurs en 3D à l'aide d'observations RGB-D, de données de pose et de son binaural persistant, les missions pouvant être ordonnées ou non. Les chercheurs ont aussi développé PAG-Nav, un agent de référence sans entraînement (training-free) qui construit une carte sémantique temporelle uniforme et planifie ses déplacements de façon progressive, utilisant le son pour guider la recherche hors champ de vision tout en réservant la confirmation finale d'un objectif à une vérification visuelle et sémantique. Ce travail met en lumière un écart important entre les capacités démontrées par les agents actuels et les exigences de missions longues et multimodales. Les tests montrent que les agents existants, qu'ils soient basés sur la vision-langage, la mémoire ou l'audio-visuel, échouent largement à compléter des missions LH-AVLN dans leur intégralité. Ce constat interroge la solidité réelle des approches de navigation incarnée dès qu'elles sortent du cadre mono-objectif habituel des benchmarks académiques, un signal utile pour les équipes de recherche en robotique mobile et en IA incarnée qui cherchent à évaluer la maturité réelle de leurs systèmes avant tout déploiement. LH-AVLN s'inscrit dans une tendance de fond de la recherche en navigation incarnée, qui délaisse progressivement les tâches ponctuelles pour des scénarios de mission complexes et prolongés, plus proches des besoins réels en robotique de service ou d'inspection. En proposant simultanément des indices sonores persistants, des spécifications d'objectifs hétérogènes et des missions multi-étapes, ce benchmark comble un vide par rapport aux travaux antérieurs en navigation audio-visuelle, généralement focalisés sur un seul objectif. PAG-Nav, présenté comme référence diagnostique plutôt que solution définitive, laisse une marge de progression substantielle, ouvrant la voie à de futurs travaux combinant mieux perception multimodale et planification à long terme.

RecherchePaper
1 source
CoRE-VLA : vers une modélisation vision-langage-action évolutive et robuste par routage conditionnel d'experts
124arXiv cs.RO 

CoRE-VLA : vers une modélisation vision-langage-action évolutive et robuste par routage conditionnel d'experts

Des chercheurs présentent CoRE-VLA, une nouvelle architecture de modèle vision-langage-action (VLA) conçue pour résoudre un problème concret de déploiement robotique: la gestion de capteurs hétérogènes et potentiellement défaillants. Publié sur arXiv le 3 juillet 2026, le papier propose de traiter la génération d'actions comme un calcul épars conditionné par le contexte, plutôt que par un calcul dense partagé comme dans les VLA classiques. Concrètement, la disponibilité des capteurs active des experts spécialisés par modalité (le papier se concentre sur la profondeur, ou depth, comme capteur auxiliaire représentatif), tandis que l'intention de la tâche route les représentations vers des experts pertinents pour chaque sous-objectif. Les auteurs testent CoRE-VLA sur les benchmarks LIBERO et RoboCasa GR1 Tabletop, ainsi que sur des manipulations réelles à deux bras, et rapportent des performances supérieures à un modèle dense équivalent et à un VLA pré-entraîné de référence, y compris en généralisation zero-shot sur des scénarios non vus à l'entraînement. L'enjeu pratique est réel pour les intégrateurs: la plupart des VLA actuels couplent rigidement la génération d'action à un jeu de capteurs fixe, ce qui les rend fragiles dès qu'un capteur auxiliaire tombe en panne ou qu'un embodiment robotique en est simplement dépourvu par conception. CoRE-VLA promet une dégradation gracieuse sans réentraînement complet, un point clé pour des flottes hétérogènes déployées en usine ou en entrepôt où tous les robots n'ont pas la même instrumentation. C'est un signal de plus que la recherche VLA s'oriente vers la robustesse opérationnelle plutôt que la seule performance en benchmark contrôlé, un décalage régulièrement pointé du doigt entre démonstrations académiques et réalité industrielle. Ce travail s'inscrit dans la lignée des architectures VLA généralistes type Pi-0 ou GR00T N2, mais adresse un angle mort spécifique: l'hétérogénéité capteurs plutôt que la seule diversité des tâches. Il s'agit ici d'une contribution de recherche publiée sur arXiv, sans partenaire industriel ni déploiement annoncé; les prochaines étapes attendues seraient une validation sur davantage d'embodiments réels et une comparaison directe avec les VLA propriétaires déployés en production.

RechercheActu
1 source
Caméras fixes ou libres : un modèle vision-langage-action sans calibration, robuste aux changements de vue
125arXiv cs.RO 

Caméras fixes ou libres : un modèle vision-langage-action sans calibration, robuste aux changements de vue

Des chercheurs du DAMO Academy d'Alibaba ont publié le 7 juillet 2026 un article arXiv (2607.05396) présentant CamVLA (Camera-Centric Vision-Language-Action), un nouveau modèle robotique qui résout un problème pratique jusqu'ici mal traité: le repositionnement des caméras lors du déploiement réel. Contrairement aux politiques VLA robustes aux changements de point de vue existantes, qui nécessitent de fournir explicitement les paramètres extrinsèques de la caméra pour fonctionner, CamVLA n'a besoin que d'une seule image RGB monoculaire, sans profondeur ni calibration préalable. Le modèle prédit deux éléments séparément: une action de l'effecteur terminal exprimée dans le référentiel local de la caméra, et une matrice main-œil à 6 degrés de liberté reliant la caméra à la base du robot. Une transformation géométrique déterministe combine ensuite ces deux prédictions pour produire l'action finale dans le référentiel du robot. Les évaluations, menées à la fois en simulation et sur données robotiques réelles, montrent une amélioration constante des taux de réussite sur des points de vue inédits. Ce travail cible un angle mort classique du déploiement industriel des VLA: en usine ou en entrepôt, les caméras sont fréquemment déplacées, remontées ou changées selon les contraintes du poste de travail, ce qui casse les politiques entraînées sur une configuration de vue fixe. Obliger un recalibrage manuel à chaque changement de caméra freine l'adoption par les intégrateurs, qui cherchent des systèmes tolérants aux aléas de terrain plutôt que des démonstrations en laboratoire. En rendant le modèle calibration-free et dépendant uniquement d'une caméra RGB simple, l'approche réduit aussi le coût matériel du déploiement, sans capteur de profondeur dédié. Le sujet s'inscrit dans la compétition actuelle autour des modèles VLA génériques, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, où la robustesse au changement de viewpoint reste un verrou identifié mais rarement résolu sans hypothèses fortes sur la caméra. L'équipe a mis en ligne une page projet dédiée; les prochaines étapes attendues concernent l'extension à davantage de plateformes robotiques et de scénarios de déploiement réel au-delà des essais publiés.

IA physiqueActu
1 source
CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action
126arXiv cs.RO 

CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action

Des chercheurs proposent CAC-VLA (Context-Gated Action Conditioning), une nouvelle architecture pour les modèles vision-langage-action (VLA), la famille de systèmes qui pilote de plus en plus de bras et robots humanoïdes generalistes. Le problème identifié: dans les VLA classiques, les représentations visuelles et langagières ne sont pas pensées pour guider directement le contrôle moteur, ce qui laisse à «l'expert action» (le module qui génère la trajectoire) la charge de combler cet écart. Des méthodes récentes tentent de corriger cela avec des modules de raisonnement d'action séparés, mais elles nécessitent des architectures dédiées supplémentaires. CAC-VLA prend une autre voie: il entraîne le modèle vision-langage lui-même à prédire des actions latentes, des représentations compactes encodées à partir de segments d'action futurs, du grossier au fin, puis utilise une «porte de contexte» pour doser en temps réel l'influence de ce signal sur l'expert d'action. Sur les bancs d'essai LIBERO et LIBERO-Plus, la méthode atteint respectivement 98,3% et 89,5% de taux de réussite moyen. Pour l'industrie robotique, l'enjeu dépasse le simple gain de quelques points de benchmark. Le goulot d'étranglement entre compréhension multimodale et motricité précise est l'un des obstacles centraux à la généralisation des VLA au-delà de tâches scriptées, un sujet suivi de près par les équipes qui travaillent sur des systèmes comme π0, GR00T N2 ou Helix. Une interface qui intègre le raisonnement d'action directement dans le VLM, sans framework de génération séparé, simplifierait l'entraînement et le déploiement de ces piles logicielles chez les intégrateurs, réduisant la complexité d'ingénierie souvent invoquée comme frein à la mise en production. Ces résultats restent toutefois obtenus en simulation, sur des suites de tâches standardisées et non sur du matériel réel en usine ou en entrepôt, une nuance importante alors que le secteur multiplie les annonces de percées en manipulation générale. LIBERO et sa variante LIBERO-Plus servent de référence commune pour comparer les approches d'action-conditioning, et la prochaine étape logique pour valider l'intérêt de CAC-VLA sera sa transposition sur des robots physiques et des tâches de manipulation en conditions réelles.

IA physiqueActu
1 source
Exp2VLA : permettre la navigation de drones par modèle vision-langage-action à partir de démonstrations d'experts
127arXiv cs.RO 

Exp2VLA : permettre la navigation de drones par modèle vision-langage-action à partir de démonstrations d'experts

Des chercheurs proposent Exp2VLA, un pipeline de distillation d'expertise pour la navigation de drones pilotée par le langage, décrit dans une prépublication arXiv (2607.03146v1). Le principe consiste à capturer des comportements experts, qu'ils proviennent de l'apprentissage par renforcement, de la téléopération ou d'autres contrôleurs classiques, puis à convertir ces trajectoires en données d'entraînement pour affiner des modèles vision-langage-action (VLA) de taille compacte. L'objectif est de transférer des stratégies de contrôle existantes vers un modèle unifié capable de comprendre des commandes en langage naturel. Les auteurs ont testé leur approche dans des environnements simulés, à la fois en configuration sim-to-sim et en boucle simulation-in-the-loop, sur des scènes comportant plusieurs objets. Les modèles affinés parviennent à traiter des commandes sémantiques variées et à généraliser à des compositions de cibles jamais vues pendant l'entraînement. Aucun vol réel n'est mentionné à ce stade : les résultats reposent exclusivement sur la simulation. L'enjeu dépasse le simple exercice académique. Les modèles VLA se sont largement développés autour des bras manipulateurs et des humanoïdes, mais leur adaptation aux drones bute sur deux obstacles concrets : le coût de calcul embarqué, souvent incompatible avec les contraintes de poids et d'autonomie d'un UAV, et le manque de robustesse de nombreuses solutions dès que l'environnement se complexifie. En automatisant la conversion de contrôleurs spécialisés en un modèle unique piloté par le langage, Exp2VLA réduit la charge d'intégration manuelle que doivent habituellement assumer les équipes qui déploient de nouveaux comportements robotiques. Pour les intégrateurs et décideurs industriels travaillant sur des flottes de drones autonomes, ce type d'approche illustre une piste pour rendre les systèmes plus flexibles sans repartir d'une architecture de contrôle entièrement nouvelle à chaque nouvelle tâche. Le travail s'inscrit dans la lignée des grands modèles VLA généralistes déjà déployés sur d'autres classes de robots, à l'image de Pi-0 ou GR00T N2 pour les bras et humanoïdes. Son originalité est de cibler spécifiquement les contraintes propres aux UAV plutôt que d'adapter directement des architectures pensées pour des robots au sol. Restant à ce stade un résultat de recherche validé en simulation, la suite logique attendue serait une validation sur drone réel, condition nécessaire avant toute perspective de déploiement opérationnel.

RechercheActu
1 source
HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme
128arXiv cs.RO 

HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme

Un article publié le 7 juillet 2026 sur arXiv présente HiMe, un cadre de mémoire hiérarchique pour les modèles Vision-Language-Action (VLA), ces systèmes qui pilotent robots et bras manipulateurs en combinant vision, langage et commande motrice. Les auteurs identifient ce qu'ils appellent le paradoxe fréquence-compétence : les modèles de raisonnement les plus capables sont trop lents pour le contrôle temps réel, tandis que les modèles rapides manquent de capacité de raisonnement pour les tâches longues et non markoviennes, où l'action dépend de tout l'historique et pas seulement de l'observation immédiate. HiMe répond en découplant l'intelligence du robot en trois couches : un Executor haute fréquence pour l'exécution, un Sentry pour la mémoire de travail, et un Planner pour la stratégie long terme, le tout appuyé par une base de connaissances dynamique capable de s'ajouter, se mettre à jour et se supprimer elle même. Pour l'industrie robotique, cette architecture cible un point faible documenté des VLA actuels, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure : leur dépendance à l'observation instantanée, qui les fragilise sur des tâches longues ou nécessitant de se souvenir d'une consigne donnée bien plus tôt. Beaucoup de démonstrations spectaculaires de robots humanoïdes reposent sur des séquences courtes et scriptées ; HiMe s'attaque explicitement à l'écart entre ces démonstrations et des tâches réelles multi-étapes, un angle mort souvent pointé par les intégrateurs. Si la séparation entre réactivité et raisonnement tient à l'échelle, elle offrirait une piste concrète pour concilier les deux sans sacrifier l'un pour l'autre. Le travail s'inscrit dans la lignée des recherches sur la mémoire des agents robotiques, qui cherchent à dépasser les architectures VLA à plat où toute l'information transite par une seule fenêtre de contexte. Les auteurs rapportent de meilleurs taux de réussite que ces références plates sur des tâches à horizon long, ainsi qu'une capacité inédite à corriger ses propres connaissances internes selon les préférences exprimées par un humain. Publié sans affiliation industrielle mise en avant, ce travail reste à ce stade une contribution académique : reste à voir si des laboratoires ou fournisseurs de VLA commerciaux comme Physical Intelligence, Nvidia ou Figure s'en inspireront pour des robots déployés en usine ou en entrepôt.

RechercheActu
1 source
Yisheng Technology, fondée par un professeur de HKU, lève des centaines de millions pour un système mémoriel robotique
12936Kr 

Yisheng Technology, fondée par un professeur de HKU, lève des centaines de millions pour un système mémoriel robotique

La startup chinoise TranscEngram (忆生科技), fondée en septembre 2023 par le professeur Yi Ma, doyen fondateur de la faculté d'informatique et de science des données de l'Université de Hong Kong, avec ses cofondateurs Gao Shenghua et Yang Yanchao, vient de boucler un tour d'amorçage de plusieurs centaines de millions de yuans. Parmi les investisseurs figurent Sino Biopharmaceutical (filiale du groupe CP), Pudong Chuangtou, Zhangjiang Kechuang, Zhangjiang Hi-Tech, Hongxin Electronics, Yunhui Capital, Volcan Capital et Jinduo Capital. Les fonds financeront un modèle de contrôle incarné explicable, un modèle du monde physique, un pipeline de données de mouvement humanoïde multimodal, ainsi que des centres de R&D et de production à Qianhai (Shenzhen) et Zhangjiang (Shanghai). L'architecture maison, baptisée "cerveau plus cervelet", combine une mémoire visuelle pour la perception spatiale et une mémoire musculaire pour le contrôle moteur haute fréquence, déclinée en quatre produits : EngramTeleOp pour la téléopération (latence inférieure à 10 ms, prise en main en cinq minutes, essais longue distance entre Shanghai et Shenzhen), EngramEgo pour la capture de mouvement à la première personne via des capteurs portables légers, EngramControl pour la mémoire de mouvement réutilisable, et EngramNav pour la navigation et la mémoire d'environnement. Selon l'entreprise, cette approche générative dépasserait de plus de trois fois les modèles VLA classiques sur des tâches multiples (préparation de café, pliage de linge, préparation de thé), avec plus de 95% de réussite pour un modèle unique. TranscEngram a déjà testé ses briques avec les groupes AgiBot, Fourier, Galbot et Robotera, et cible désormais l'hôtellerie haut de gamme ainsi que l'assemblage flexible dans l'aérospatial, notamment avec un fabricant de pièces d'avion d'origine Airbus. Cette levée illustre une bataille de fond dans la robotique humanoïde : dépasser les modèles vision-langage-action (VLA) actuels, jugés trop rigides face à un changement de tâche ou d'outil, au profit de systèmes capables de transférer une compétence d'un corps à un autre (pince, main habile, bras de longueurs différentes) sans réentraînement lourd. Yi Ma justifie ce pari par une critique frontale des grands modèles de langage en vogue, qu'il compare à des encyclopédies statiques incapables de s'auto-corriger au contact du monde physique, d'où leurs hallucinations selon lui. Les chiffres de performance avancés, un gain de trois fois et un taux de réussite de 95%, restent toutefois des mesures internes non vérifiées de façon indépendante, portant sur un nombre de tâches limité probablement choisi par l'entreprise ; ils relèvent davantage de la promesse que du produit éprouvé en environnement industriel réel. Le pari, s'il tient, viserait un vrai point de friction du secteur : le coût du redéploiement à chaque nouvelle tâche ou changement de gamme, un problème particulièrement sensible dans l'assemblage aérospatial où les lignes changent fréquemment de configuration. TranscEngram s'inscrit dans la vague de financements de l'IA incarnée en Chine, aux côtés d'acteurs comme AgiBot, Fourier, Galbot ou UBTech, et fait écho aux ambitions affichées par les Américains Physical Intelligence avec Pi-0, NVIDIA avec GR00T ou Figure avec Helix sur les modèles de fondation pour la robotique. Yi Ma, lauréat du prix Marr et fellow IEEE, ACM et SIAM, revendique des collaborations avec Emmanuel Candès et Yann LeCun pour asseoir la crédibilité scientifique du projet. La suite proche passe par deux pilotes commerciaux, l'hôtellerie haut de gamme (blanchisserie, fabrication de cartes, service en chambre) et l'assemblage flexible dans l'aérospatial avec ce fabricant lié à Airbus, tandis qu'un centre de données dédié dans le Sichuan doit accélérer la collecte de données tactiles pour les mains habiles. Aucun calendrier de déploiement commercial précis n'a pour l'instant été communiqué.

Chine/AsieOpinion
1 source
Unitree entre en bourse : les valorisations à l'épreuve d'un afflux de capital-risque dans la robotique chinoise
130SCMP Tech 

Unitree entre en bourse : les valorisations à l'épreuve d'un afflux de capital-risque dans la robotique chinoise

Voici l'article traduit et résumé : Unitree Robotics, fabricant chinois de robots basé à Hangzhou, a obtenu le feu vert de la Commission de régulation des valeurs mobilières de Chine (CSRC) pour une introduction en bourse à la Bourse de Shanghai. Cette approbation intervient environ un mois après que l'entreprise a passé avec succès l'examen du comité de cotation de la place shanghaïenne. Unitree finalise désormais son plan de souscription, la tarification de ses actions et les modalités de souscription en vue d'une entrée en bourse. Le calendrier précis du débuT des transactions reste à confirmer, mais le dossier est désormais dans sa phase finale d'exécution. Cette IPO est scrutée de près car elle doit fixer un référentiel de valorisation pour tout le secteur chinois de l'IA incarnée (embodied AI), qui attire des flux massifs de capital-risque depuis deux ans. Pour les acteurs de la robotique humanoïde et leurs investisseurs, ce sera un premier vrai test de l'appétit des marchés publics pour ce type d'entreprise : est-ce que la valorisation reflète des ventes et déploiements réels, ou surtout une promesse technologique encore largement en phase de développement. Le résultat influencera directement la manière dont les futurs tours de financement et cotations de concurrents seront calibrés, en Chine comme ailleurs. Unitree s'est fait connaître avec ses robots quadrupèdes puis humanoïdes (gammes G1, H1, B2), vendus à la fois à des chercheurs, industriels et grand public à des prix nettement inférieurs à ceux de rivaux occidentaux. Elle s'inscrit dans une vague de commercialisation chinoise de la robotique humanoïde, aux côtés d'acteurs comme UBTech, déjà coté à Hong Kong depuis 2023, et talonnée par des entreprises comme Fourier Intelligence. La prochaine étape attendue est la publication du prix définitif de l'offre avant la cotation effective.

Chine/AsieActu
1 source
VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur
131arXiv cs.RO 

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur

Des chercheurs présentent VLAFlow (Vision-Language-Action Flow), un framework unifié de flow-matching destiné à comparer objectivement les différents paradigmes d'entraînement des modèles vision-langage-action (VLA) en manipulation robotique. L'étude s'appuie sur OXEMix, un corpus hétérogène d'environ 5 000 heures de données combinant DROID, OpenX-Embodiment, OpenX-Augmented et RoboCOIN. Sous une architecture commune de type pi-0, avec le même backbone VLM, le même action expert et un espace d'action à 14 dimensions, les auteurs évaluent quatre approches strictement comparables : l'entraînement sur les seules actions (MindPI), le co-entraînement supervisé par le langage (MindLPI), l'alignement des représentations latentes futures (MindWPI), et leur combinaison (MindLWPI). Les tests sont menés sur trois bancs d'essai de référence : LIBERO, LIBERO-Plus et SimplerEnv. Pour les équipes qui entraînent des modèles VLA sur des données robotiques hétérogènes, l'apport principal n'est pas un nouveau produit mais une comparaison contrôlée rare dans un champ où architecture, données et protocole d'évaluation varient habituellement d'un papier à l'autre, rendant les résultats difficiles à départager. Les résultats montrent que l'entraînement action seule se dégrade quand les données proviennent de sources trop diverses, un signal utile pour qui envisage de simplement agréger des jeux de données multi-robots sans garde-fou. La supervision par le langage préserve la généralisation vision-langage, et l'alignement latent futur améliore la modélisation des transitions d'état et des relations action-résultat. La combinaison des deux signaux (MindLWPI) offre le transfert le plus stable sur l'ensemble des bancs d'essai, suggérant qu'un espace de méta-action combinant contraintes linguistiques et prédictives rend l'apprentissage par imitation plus robuste au passage à l'échelle. Ce travail s'inscrit dans la lignée des architectures pi-0 popularisées par Physical Intelligence, dans un paysage où Nvidia (GR00T N2), Figure (Helix) ou d'autres laboratoires développent également des modèles généralistes pour la manipulation robotique. Contrairement à des annonces produit, il s'agit ici d'une publication de recherche (preprint arXiv) centrée sur la méthodologie d'entraînement plutôt que sur un déploiement matériel. Les auteurs positionnent VLAFlow comme un socle reproductible pour de futures comparaisons de paradigmes, sans annoncer pour l'instant de calendrier de mise à disposition du code ou des poids du modèle.

RechercheActu
1 source
Modèle vision-langage-action pour le reciblage robotique multi-corporel via diffusion guidée
132arXiv cs.RO 

Modèle vision-langage-action pour le reciblage robotique multi-corporel via diffusion guidée

Des chercheurs publient une version retravaillée sur arXiv (2505.20857v2) d'un framework de retargeting de mouvement basé sur un modèle de diffusion conditionné par graphe, conçu pour transférer des mouvements de référence vers des robots à la morphologie différente. Le problème ciblé est connu du secteur : un jeu de données de mouvement capturé pour un robot donné ne se transpose pas directement à un autre, à cause des écarts de structure topologique, de paramètres géométriques et de correspondance entre articulations. La méthode encode chaque robot sous forme de graphe capturant sa topologie et sa géométrie, exploité par un mécanisme d'attention développé spécifiquement au niveau articulaire. Faute de mouvements de référence "vérité terrain" pour l'embodiment cible, les auteurs entraînent le modèle de diffusion via un guidage énergétique, formulé comme des fonctions de perte de retargeting, plutôt que par apprentissage supervisé classique. L'enjeu dépasse l'exercice académique : la pénurie de données de démonstration spécifiques à chaque plateforme reste un goulot d'étranglement majeur pour l'entraînement des modèles VLA (vision-language-action) qui équipent les humanoïdes actuels, de Figure à Optimus en passant par les architectures type GR00T ou Pi-0. Une méthode capable de recycler un même corpus de mouvements humains ou robotiques vers plusieurs morphologies réduirait potentiellement le coût de collecte de données propre à chaque robot. Les auteurs présentent leur travail comme l'une des premières approches de retargeting cross-embodiment en robotique, mais restent prudents : ils parlent d'une généralisation "à un certain degré" à des structures squelettiques diverses, une formulation qui invite à la retenue plutôt qu'à l'enthousiasme. Il s'agit d'un article de recherche pur, sans affiliation industrielle citée ni produit commercialisé, à situer dans la lignée des travaux sur l'apprentissage cross-embodiment (type Open X-Embodiment) et le problème historique du retargeting en animation et robotique. Aucun acteur français ou européen n'y est associé. Le texte ne mentionne ni pilote annoncé ni calendrier de déploiement : c'est une brique méthodologique, encore loin d'une intégration produit.

RecherchePaper
1 source
FurnitureVLA : un modèle vision-langage-action pour l'assemblage de meubles bimanuel à long horizon
133arXiv cs.RO 

FurnitureVLA : un modèle vision-langage-action pour l'assemblage de meubles bimanuel à long horizon

Voici la traduction/synthèse en français : Une équipe de recherche présente FurnitureVLA, décrite comme la première étude systématique de l'assemblage de meubles en bimanipulation à échelle réelle pilotée par un modèle vision-langage-action (VLA). Jusqu'ici, les travaux sur l'assemblage robotique de meubles se limitaient à des maquettes miniatures ou à des bras uniques. Les chercheurs ont construit un pipeline de simulation scalable pour générer des données expertes et évaluer les performances, ainsi qu'un système de téléopération en réalité virtuelle permettant à un seul opérateur de contrôler les deux bras simultanément pour collecter des démonstrations réelles de haute qualité. Pour gérer des tâches extrêmement longues, jusqu'à 7 sous-tâches et 1550 pas de contrôle, ils proposent un VLA "progress-enhanced", affiné sur des sous-tâches sémantiquement définies, qui prédit à la fois les actions et un signal de progression continu, permettant des transitions automatiques entre sous-tâches et limitant l'accumulation d'erreurs. En simulation, FurnitureVLA fait passer le taux de succès moyen de 48% à 80% par rapport aux méthodes de référence, sur trois types de meubles différents, avec un gain supplémentaire de 21% obtenu grâce à l'étude de facteurs de conception liés à la perception et au contrôle. Sur un bras robotique réel Kinova Gen3, la dégradation de performance reste limitée à 16% sur la tâche la plus difficile. Ce résultat s'attaque à un angle mort connu du secteur : la plupart des démonstrations de VLA généralistes (type GR00T, Pi-0 ou Helix) portent sur des tâches de manipulation courtes et à un seul bras, alors que l'assemblage de meubles exige coordination bimanuelle, précision millimétrique et enchaînement de dizaines d'étapes sans dérive cumulative. En prouvant qu'un signal de progression appris permet de tenir un horizon de plus de 1500 pas de contrôle avec une perte de performance contenue lors du transfert simulation-vers-réel, les auteurs apportent un argument concret en faveur de la viabilité des VLA pour des tâches industrielles longues, un enjeu clé pour les intégrateurs qui cherchent à automatiser des lignes d'assemblage complexes plutôt que du pick-and-place simple. Le travail s'inscrit dans la vague actuelle de recherche sur les modèles VLA appliqués à la manipulation fine, où la difficulté principale reste le passage de l'échelle jouet à l'échelle réelle et du bras unique à la bimanipulation coordonnée. En publiant à la fois le pipeline de simulation, le système de téléopération VR et les résultats de transfert vers un robot physique, les auteurs posent une base méthodologique reproductible que d'autres laboratoires pourront reprendre pour étendre l'assemblage long-horizon à d'autres catégories de produits.

RechercheActu
1 source
Modèle vision-langage-action cinématique centré sur les actionneurs pour robots miniers souterrains (MineRobot)
134arXiv cs.RO 

Modèle vision-langage-action cinématique centré sur les actionneurs pour robots miniers souterrains (MineRobot)

Des chercheurs présentent MineRobot, un framework de modélisation cinématique centré sur les actionneurs pour les robots miniers souterrains, dans un article publié en version révisée sur arXiv sous la référence 2603.22055. Contrairement aux bras industriels classiques à chaîne ouverte, les engins miniers représentatifs reposent souvent sur des chaînes cinématiques fermées entraînées par vérins linéaires, avec des liaisons planes en quadrilatère articulé (four bar linkage), ce qui complique la modélisation réutilisable et la résolution en temps réel de la cinématique directe (FK) et inverse (IK). Le framework introduit le MRDF (Mining Robot Description Format), une représentation dédiée qui paramètre nativement les actionneurs et les fermetures de boucle. Il contracte ensuite les sous structures en quadrilatère articulé en articulations généralisées, puis extrait pour chaque actionneur un chemin topologiquement équivalent indépendant (ITEP), classé en quatre types canoniques. Ces types alimentent des solveurs dédiés assemblés en pipeline séquentiel pour la FK, tandis que l'IK est formulée comme un problème d'optimisation sous contraintes de longueur d'actionneur, résolu par un schéma itératif de type Gauss Seidel. Les expériences menées sur des robots miniers souterrains représentatifs montrent des performances FK en temps réel et une convergence robuste de l'IK sur les plages de fonctionnement testées. L'enjeu dépasse le simple confort de calcul. Dans les mines souterraines, tester physiquement un engin (chargeuse, foreuse, bras de forage) est coûteux et dangereux, d'où le recours croissant à la planification de trajectoires, à l'entraînement des opérateurs et aux jumeaux numériques pour valider les mouvements avant tout déploiement réel. Or la plupart des outils de cinématique existants ciblent des manipulateurs à chaîne ouverte et gèrent mal les mécanismes fermés et sous-actionnés typiques du matériel minier, ce qui oblige souvent les équipes à écrire un solveur spécifique par machine. En automatisant cette dérivation via une décomposition topologique générique, MineRobot vise à réduire ce travail manuel répétitif et à accélérer l'intégration de nouveaux engins dans les chaînes de simulation, un argument qui parlera autant aux intégrateurs et fournisseurs d'équipements miniers qu'aux équipes de R&D en robotique industrielle. Le papier s'inscrit dans un courant de recherche plus large sur la cinématique des mécanismes fermés, un domaine longtemps traité au cas par cas faute de formalisme réutilisable pour les chaînes à boucles multiples. La classification en quatre types d'ITEP et le solveur Gauss Seidel pour l'IK rappellent des approches modulaires déjà explorées pour les robots parallèles et les mécanismes hybrides, mais appliquées ici spécifiquement au vocabulaire métier minier. À ce stade, il s'agit d'un résultat académique validé en simulation sur des robots représentatifs, et non d'un produit déployé chez un opérateur minier. La suite logique serait une intégration dans des suites de planification ou des jumeaux numériques commerciaux, suivie d'une validation sur du matériel réel en conditions souterraines.

RecherchePaper
1 source
Robot park de 90 000 pieds carrés : une entreprise américaine forme des humanoïdes en conditions réelles
135Interesting Engineering 

Robot park de 90 000 pieds carrés : une entreprise américaine forme des humanoïdes en conditions réelles

Apptronik, entreprise texane basée à Austin, a inauguré Robot Park, une installation de collecte de données et d'entraînement de près de 8 400 m² (90 000 pieds carrés) dédiée à l'accélération du développement de ses robots humanoïdes Apollo. Sur ce site, des unités Apollo 2, la dernière génération de la plateforme, déclinées en version bipède et en version à base roulante, exécutent en continu des tâches représentatives de la logistique, de la fabrication et du commerce de détail, générant ainsi les données réelles nécessaires à l'entraînement de modèles d'IA incarnée. Ce dispositif s'inscrit dans le partenariat de recherche entre Apptronik et Google DeepMind : les données issues d'Apollo 2, combinant téléopération et fonctionnement autonome, alimentent directement les modèles Gemini Robotics de DeepMind tout en améliorant la plateforme commerciale d'Apptronik. Le concept de Robot Park a également été étendu au-delà d'Austin, avec des flux de collecte similaires mis en place chez des clients et partenaires comme Mercedes-Benz et l'opérateur logistique GXO. Apollo 2 sert de « cheval de trait » du programme depuis plus d'un an déjà. Pour l'industrie robotique, cette annonce illustre un déplacement de l'enjeu compétitif : la course aux humanoïdes ne se joue plus seulement sur la démonstration de capacités motrices, mais sur la capacité à produire, à grande échelle et en continu, des données d'usage réel exploitables par des modèles VLA (vision-langage-action). En s'associant à un laboratoire du calibre de Google DeepMind, Apptronik cherche à sécuriser un accès privilégié à des capacités d'IA de pointe plutôt que de tout développer en interne, une stratégie qui tranche avec l'approche plus verticale de concurrents comme Figure AI ou Tesla avec Optimus. Le fait que des clients industriels comme Mercedes-Benz ou GXO participent directement à la collecte de données, sur leurs propres sites, est également un signal notable : il suggère un passage progressif du pilote isolé vers des déploiements multi-sites, même si l'ampleur réelle de l'autonomie atteinte par Apollo 2, par opposition à la téléopération, reste à documenter précisément par Apptronik. Fondée en 2016 et essaimée des travaux de robotique de l'université du Texas à Austin, Apptronik s'est fait connaître avec son premier robot Apollo avant de lancer cette version 2, pensée dès l'origine comme un outil de collecte de données autant que comme un produit commercial. La société évolue dans un secteur de plus en plus dense, aux côtés de Figure AI, Tesla, Boston Dynamics ou encore 1X, chacun misant sur des partenariats logiciels ou une intégration verticale pour combler l'écart entre démonstrations spectaculaires et déploiements industriels réels. Le PDG et cofondateur Jeff Cardenas a présenté l'initiative comme une « boucle d'apprentissage continu » avec l'équipe robotique de Google DeepMind, laissant entendre que d'autres extensions du modèle Robot Park, chez de nouveaux clients ou sur de nouveaux sites, devraient suivre dans les prochains mois.

UEMercedes-Benz, entreprise allemande, participe directement à la collecte de données pour entraîner ces modèles d'IA incarnée, ce qui expose un grand industriel européen à cette technologie mais sans déploiement de production documenté en Europe.

IA physiqueActu
1 source
MIRTH : raisonnement par information mutuelle avec pôles temporels pour agents vision-langage-action
136arXiv cs.RO 

MIRTH : raisonnement par information mutuelle avec pôles temporels pour agents vision-langage-action

Une équipe de recherche présente MIRTH (Mutual-Information Reasoning with Temporal Hubs), un framework qui vient se greffer sur un modèle VLA (vision-language-action) préentraîné pour améliorer le contrôle robotique. Le système ajoute trois briques techniques : des "hubs" de mémoire temporelle à double échelle qui compressent l'historique long terme de la scène et les tendances de mouvement court terme en embeddings compacts, des tokens de raisonnement latent optimisés via un objectif d'information mutuelle pour aligner le contexte multimodal avec les trajectoires d'action, et un schéma de décodage d'action parallèle qui remplace la génération autorégressive classique par une prédiction vectorielle simultanée pour accélérer le débit de contrôle. Les auteurs annoncent des résultats state-of-the-art sur le benchmark de simulation LIBERO ainsi que sur une plateforme réelle LeRobot, avec des capacités émergentes de récupération d'erreur. Code et jeux de données sont publiés sur GitHub (kiva12138/mirth). L'enjeu ciblé est bien identifié dans la littérature robotique actuelle : les architectures VLA à trame unique souffrent d'une myopie temporelle qui ignore la dynamique passée de la scène, d'un fossé de raisonnement entre instructions de haut niveau et commandes moteur de bas niveau, et d'une latence d'inférence due au décodage scalaire autorégressif. Ces limites freinent le déploiement de modèles VLA génériques face aux systèmes spécialisés dans l'industrie. À noter toutefois : la validation "monde réel" repose sur LeRobot, une plateforme robotique low-cost destinée à la recherche, loin des contraintes d'un bras industriel ou d'un humanoïde en usine ; les gains restent donc à confirmer à plus grande échelle avant toute traduction en déploiement B2B. MIRTH s'inscrit dans la lignée des travaux type RT-2, Pi-0 ou GR00T N2, qui cherchent à transférer les connaissances sémantiques du web vers le contrôle physique. La contribution ici est ciblée sur la mémoire temporelle et l'efficacité du décodage plutôt que sur l'échelle des données d'entraînement, une direction complémentaire aux approches des grands laboratoires. La publication du code sur GitHub ouvre la voie à des réplications indépendantes, étape nécessaire pour évaluer la robustesse réelle de ces gains annoncés.

RechercheOpinion
1 source
Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action
137arXiv cs.RO 

Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action

Voici l'article en français : Une équipe de recherche présente un système modulaire conçu pour le CMU Vision-Language-Action (VLA) Challenge, une compétition universitaire visant à faire exécuter des instructions en langage naturel par un agent robotique autonome évoluant en intérieur. L'architecture repose sur deux pipelines parallèles. Le premier, dédié à la perception, construit en temps réel une carte voxel sémantique de l'environnement à partir de flux caméra, en s'appuyant sur des embeddings issus du modèle OwlViT. Le second traite le langage : il classifie les commandes utilisateur grâce à un modèle vision-langage (VLM). La cartographie est bornée dans le temps, avec une limite d'exploration fixée à 500 secondes, au-delà de laquelle le système continue d'opérer avec une carte partielle plutôt que d'attendre une couverture complète. La requête classifiée est ensuite ancrée dans le contexte géométrique et sémantique de cette carte pour générer un prompt détaillé soumis au VLM, produisant en sortie une action exploitable par le robot. L'intérêt de ce travail dépasse le cadre du concours : il illustre concrètement comment combler l'écart entre instruction en langage naturel et action robotique physique, un défi central pour toute la famille des modèles VLA actuellement en déploiement industriel, de Pi-0 à GR00T N2 en passant par Helix. En imposant une contrainte de temps stricte sur la cartographie, les auteurs mettent en lumière un problème rarement traité frontalement dans les démonstrations commerciales : la robustesse face à une perception incomplète, plus représentative des conditions réelles que des environnements soigneusement scannés en amont. Le CMU VLA Challenge s'inscrit dans une vague de benchmarks académiques cherchant à standardiser l'évaluation des architectures VLA modulaires, en concurrence avec les approches end-to-end privilégiées par les laboratoires industriels. Les prochaines étapes attendues concernent la publication des résultats comparatifs de la compétition et l'éventuelle extension de cette architecture voxel-plus-VLM à des plateformes robotiques réelles au-delà du cadre expérimental du challenge.

RecherchePaper
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
138arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
StemVLA : un modèle vision-langage-action open source avec connaissance géométrique 3D future et représentation historique 4D
139arXiv cs.RO 

StemVLA : un modèle vision-langage-action open source avec connaissance géométrique 3D future et représentation historique 4D

StemVLA est un nouveau modèle vision-langage-action (VLA) open source destiné à la manipulation robotique, présenté dans un article arXiv (2602.23721v2, version révisée). Contrairement à la plupart des VLA existants, qui mappent directement des images 2D vers des séquences d'actions sans modéliser la structure spatiale sous-jacente, StemVLA intègre explicitement deux briques supplémentaires : une anticipation de la géométrie 3D future de la scène (pour prévoir la configuration des objets à venir) et une représentation spatiotemporelle 4D construite à partir de l'historique des images, extraite via un transformeur vidéo-géométrie pré-entraîné et agrégée dans le temps par un module d'attention temporelle baptisé VideoFormer. Sur la suite de benchmarks de simulation LIBERO, le modèle atteint une précision moyenne de 92,0 %, et 86,0 % sur le sous-ensemble LIBERO-Long, dédié aux tâches à horizon long. L'enjeu dépasse la simple performance chiffrée : les VLA actuels peinent souvent sur le raisonnement spatial fin et la planification à long terme, précisément parce qu'ils ignorent la géométrie 3D et la dynamique temporelle de la scène. En forçant le modèle à prédire explicitement l'évolution future de l'espace 3D plutôt qu'à réagir à des images plates, StemVLA cherche à combler un des angles morts identifiés dans la littérature récente sur les modèles fondation pour la robotique, celui de la cohérence temporelle et de la généralisation dans des environnements dynamiques. Les gains observés sur LIBERO-Long, sous-ensemble réputé plus exigeant, suggèrent que l'ajout de connaissances géométriques structurées améliore la robustesse sur des tâches multi-étapes, un point sensible pour les intégrateurs qui cherchent à dépasser les démonstrations de laboratoire. Ce travail s'inscrit dans une vague de recherche VLA qui, après les architectures pionnières fondées sur des mappings image-action directs, cherche à enrichir la représentation du monde interne des modèles, en écho aux approches combinant perception géométrique et politiques d'action explorées par d'autres laboratoires du secteur. Les résultats restent pour l'instant limités à la simulation LIBERO ; l'étape suivante attendue par la communauté sera la validation sur robots physiques réels, où l'écart entre performance simulée et transfert sim-to-real demeure le principal obstacle à la généralisation des VLA.

RechercheOpinion
1 source
LaMP : apprentissage d'une politique vision-langage-action avec flux de scène 3D comme a priori de mouvement latent
140arXiv cs.RO 

LaMP : apprentissage d'une politique vision-langage-action avec flux de scène 3D comme a priori de mouvement latent

Des chercheurs presentent LaMP, un framework de manipulation robotique combinant deux modules experts. Le premier, le "Motion Expert", genere en une seule etape un flux de scene 3D partiellement debruite via une methode de flow-matching; ses etats caches conditionnent ensuite un second module, l'"Action Expert", charge de predire les actions du robot, via une attention croisee filtree. Contrairement aux VLA classiques qui deduisent les actions directement de features visuelles 2D, LaMP integre ainsi un a priori de mouvement 3D explicite sans reconstruction complete multi-etapes. Le systeme a ete evalue sur les bancs d'essai de simulation LIBERO, LIBERO-Plus et SimplerEnv-WidowX, ainsi que sur des experiences reelles. Selon les auteurs, LaMP depasse systematiquement les references VLA testees, avec les meilleurs taux de reussite moyens a budget d'entrainement egal, et un gain moyen de 9,7% de robustesse sur les perturbations hors distribution de LIBERO-Plus par rapport a la meilleure reference existante. Ce travail cible un point faible connu des politiques VLA: leur difficulte a generaliser a des dynamiques spatiales non vues pendant l'entrainement, un ecart souvent qualifie de "sim-to-real" ou de "demo vs reality gap". En forcant les modeles a apprendre implicitement la physique 3D a partir de simples features 2D, les architectures actuelles, dans la lignee de RT-2, Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, restent fragiles des que l'environnement s'ecarte du jeu d'entrainement. Pour les integrateurs et decideurs B2B, la robustesse hors distribution separe une demonstration convaincante d'un deploiement industriel fiable: c'est souvent le vrai goulot d'etranglement, plus que la reussite brute sur des taches deja vues. Le papier, publie sur arXiv en version 2, s'inscrit dans un debat plus large sur la meilleure facon d'injecter des priors physiques 3D dans des backbones visuels pre-entraines en 2D, face a des alternatives comme les nuages de points ou les politiques de diffusion conditionnees par la profondeur. Il s'agit d'une contribution academique, sans affiliation industrielle affichee ni indication de deploiement au-dela des benchmarks; les prochaines etapes attendues concernent le passage a l'echelle en conditions reelles et une comparaison directe avec des politiques VLA deja commercialisees comme Pi-0 ou GR00T N2.

RechercheActu
1 source
UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action
141arXiv cs.RO 

UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action

UniTacVLA, un modèle vision-langage-action (VLA) tactile, vise à résoudre un point faible connu des VLA classiques : la manipulation dextre en contact riche, comme l'insertion, l'essuyage, l'assemblage ou l'ajustement de précision. Contrairement aux approches vision-tactile-langage-action (VTLA) existantes qui traitent le signal tactile comme une simple entrée auxiliaire passive, l'équipe de recherche propose un espace latent tactile unifié qui modélise conjointement l'état tactile courant et les changements de contact futurs, via un raisonnement en chaîne de pensée tactile et une prédiction tactile progressive (coarse-to-fine). Ce prior tactile alimente ensuite un contrôleur mixte tactile-action combinant retour tactile en temps réel et retour prédit, pour corriger à haute fréquence des chunks d'action calculés à basse fréquence. Les expériences ont été menées en conditions réelles sur quatre catégories de tâches à fort contact (ajustement, insertion, essuyage, assemblage), testées à la fois en environnement propre et sous perturbations externes. L'enjeu dépasse la simple amélioration de benchmark. La manipulation en contact riche reste l'un des goulots d'étranglement majeurs empêchant les bras robotiques et humanoïdes de passer de la démonstration en laboratoire au déploiement industriel réel, notamment pour des tâches d'assemblage fin où la seule vision ne suffit pas à garantir la précision ou la robustesse face aux perturbations. En traitant le tactile comme un signal dynamique et prédictif plutôt que comme un simple capteur passif, UniTacVLA s'attaque directement à l'écart persistant entre les VLA génériques, entraînés majoritairement sur des données visuelles, et les exigences physiques réelles de l'assemblage industriel ou de la manipulation fine en conditions non contrôlées. Les auteurs revendiquent des gains sur le taux de succès, la précision de manipulation et la robustesse au contact par rapport aux méthodes existantes, ce qui, si confirmé à plus grande échelle, renforcerait l'argument selon lequel l'intégration tactile profonde est nécessaire pour les tâches dextres, et pas seulement un ajout marginal. Ce travail s'inscrit dans une vague plus large de recherche visant à doter les modèles VLA de capacités multimodales au-delà de la vision et du langage, à mesure que des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T) poussent leurs propres modèles génération vers la production industrielle. Les architectures VTLA précédentes, limitées par un traitement passif du tactile, constituent la ligne de base que ce papier cherche à dépasser. La publication, un prépublication arXiv, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; les prochaines étapes attendues porteraient sur l'extension à davantage de types de capteurs tactiles et de tâches, ainsi que sur une validation à plus grande échelle en dehors du cadre contrôlé des expériences décrites.

IA physiqueActu
1 source
X Square Robot porte sa valorisation à 2,8 milliards de dollars après quatre levées de fonds consécutives
142The Robot Report 

X Square Robot porte sa valorisation à 2,8 milliards de dollars après quatre levées de fonds consécutives

Voici l'article traduit et synthétisé : X Square Robot, société chinoise spécialisée en IA incarnée basée à Shenzhen, a bouclé quatre tours de financement consécutifs s'achevant par une série C, portant sa valorisation à plus de 2,8 milliards de dollars. Fondée en 2023 par Wang Qian, l'entreprise a vu IDG participer à ce dernier tour, tandis que HongShan et Xiaomi l'ont soutenue à plusieurs reprises lors des levées précédentes. Les fonds serviront à renforcer la recherche fondamentale et les technologies cœur, dans l'optique de progresser vers une IA incarnée généraliste. En avril 2026, la société a dévoilé WALL-B, un modèle de fondation construit sur une architecture baptisée World Unified Model : contrairement aux approches VLA (vision-langage-action) modulaires classiques, ce système entraîne perception, langage, action et prédiction physique au sein d'un réseau unique, censé renforcer la compréhension multimodale et le raisonnement spatial. X Square a aussi ouvert en open source WALL-OSS-0.5 et WALL-WM, ce dernier modèle traitant les données par « événements » pour améliorer l'apprentissage croisé entre modalités. Sur 17 tâches robotiques réelles testées sans post-entraînement, WALL-OSS-0.5 afficherait un taux de réussite autonome supérieur à 80% sur quatre d'entre elles seulement, un chiffre à nuancer puisqu'il ne concerne qu'une minorité des tâches évaluées. Cette levée intervient alors que la robotique incarnée chinoise multiplie les annonces de financement spectaculaires, dans un contexte où le marché reste partagé entre démonstrations soignées et déploiements réels limités. Le pari de X Square consiste à tester son système directement dans des foyers, via un partenariat avec la plateforme 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, et via le programme « X Family Member », lancé en mai 2026, où des robots vivent jusqu'à un mois chez des familles volontaires pour effectuer des tâches domestiques variées. Si l'entreprise présente cela comme une sortie du cadre des démonstrations scénarisées, l'exercice reste à des échelles encore restreintes et la robustesse réelle hors environnement contrôlé demande à être confirmée sur la durée. X Square s'inscrit dans une compétition mondiale où s'affrontent les modèles fondation pour la robotique, qu'il s'agisse de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, ainsi que des rivaux chinois comme Unitree, AgiBot ou UBTech, tous engagés dans une course au déploiement domestique et industriel. La stratégie d'intégration verticale de X Square, mêlant modèles propriétaires, pipeline de données automatisé et déploiements terrain, vise à accélérer l'itération produit. Les prochaines étapes attendues concernent l'extension du programme familial et l'élargissement des partenariats industriels et logistiques, domaines où la société dit également opérer en parallèle du marché domestique.

Chine/AsieActu
1 source
IA incarnée : automatisation de la conception d'architectures d'agents
143arXiv cs.RO 

IA incarnée : automatisation de la conception d'architectures d'agents

Une équipe de chercheurs a publié fin juin 2026 (arXiv:2606.30111) une étude sur l'automatisation de la conception d'architectures d'agents incarnés. Ils introduisent AgentCanvas, un environnement d'exécution à graphe typé qui représente les pipelines de perception, mémoire, planification et action comme des programmes nœud-à-fil éditables, et KDLoop, une procédure de recherche par agent codeur alternant proposition, critique, expérimentation et distillation, avec des réflexions déclenchées en cas de stagnation. L'évaluation suit une matrice 3x4 : trois variantes d'Agent Architecture Search (AAS) testées sur quatre tâches incarnées couvrant la navigation vision-langage, la réponse à des questions situées (embodied QA) et la manipulation conditionnée par le langage. Les résultats montrent des gains directionnels de taux de succès, mais un candidat apparemment performant a été écarté après détection d'une fuite de données (leak-bearing). L'intérêt de ces travaux réside dans le transfert, pour la première fois de façon systématique, des méthodes AAS -- jusqu'ici cantonnées aux agents textuels -- vers des agents perceptifs en simulation. Pour les architectes de systèmes cognitifs, cela ouvre la possibilité d'automatiser partiellement le choix de stockage de l'information, du traitement des observations et de l'enchaînement des appels de modèles, tâche jusqu'ici confiée à l'intuition des chercheurs. Les auteurs identifient cependant trois contraintes propres à l'incarné, absentes dans les benchmarks textuels : le bruit de rollout masque les signaux d'optimisation, la recherche se piège dans des bassins d'édition locaux, et l'attribution de crédit épisodique reste partielle même avec des journaux détaillés. La détection d'un candidat corrompu par fuite de données illustre par ailleurs un risque d'évaluation spécifique aux environnements simulés, où l'agent peut exploiter des artefacts de la simulation plutôt que résoudre la tâche réelle. Ces travaux s'inscrivent dans la mouvance des méthodes de méta-design d'architectures cognitives, appliquées ici à la couche système plutôt qu'aux poids des modèles. Les benchmarks dominants en navigation vision-langage (R2R, ALFRED) restent maîtrisés par des architectures manuelles, et des frameworks comme LangGraph ou AutoGen couvrent l'espace des agents textuels sans gestion de rollout simulé. Aucun acteur européen ou français n'est impliqué dans cette publication. Les prochaines étapes identifiées par les auteurs incluent l'extension à des environnements physiques réels et le renforcement de KDLoop face au bruit de rollout, deux verrous explicites avant toute applicabilité industrielle.

RecherchePaper
1 source
X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique
144Pandaily 

X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique

X Square Robot, startup pékinoise fondée en 2023 et spécialisée dans l'IA incarnée pour environnements réels, vient de boucler quatre tours de financement consécutifs dont une Série C portant sa valorisation à 2,8 milliards de dollars (20 milliards de yuans). IDG Capital a participé à la Série C, tandis que HongShan et Xiaomi ont soutenu l'entreprise sur plusieurs tours antérieurs. Surtout, Meituan, Alibaba et ByteDance ont chacun conduit un tour précédent, faisant de X Square Robot la seule société d'IA incarnée en Chine à avoir obtenu un lead investment des quatre plus grands groupes tech nationaux. En avril 2026, la société a dévoilé WALL-B, un modèle fondation basé sur son architecture "World Unified Model" (WUM) : contrairement aux approches VLA modulaires qui assemblent des composants vision, langage et action distincts, WALL-B entraîne l'ensemble perception-langage-action-prédiction physique dans un réseau unique. Deux modèles complémentaires ont été mis en open source : WALL-OSS-0.5, qui atteint plus de 80 % de complétion autonome sur 4 des 17 tâches testées en conditions réelles sans fine-tuning post-entraînement, et WALL-WM, un modèle de prédiction monde alignant données langagières, visuelles et gestuelles autour d'événements physiques significatifs. Sur le terrain, X Square Robot a déployé ses robots en partenariat avec 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, les machines opérant aux côtés d'agents humains dans des immeubles résidentiels réels. Depuis mai 2026, un programme "X Family Member" place des robots en foyers volontaires jusqu'à un mois en tant qu'assistants domestiques. La valorisation à 2,8 milliards de dollars positionne X Square Robot parmi les startups d'IA incarnée les mieux capitalisées de Chine, dans une course mondiale où Figure AI, Physical Intelligence et Agility Robotics mobilisent des montants comparables aux États-Unis. L'architecture unifiée de WALL-B constitue un pari architectural distinct des approches modulaires dominantes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le score de 80 % sur 4 tâches sélectionnées parmi 17 sans post-training est encourageant, mais l'échantillon invite à la prudence : les 13 tâches restantes ne sont pas documentées, ce qui laisse le demo-to-reality gap partiellement ouvert. Les déploiements effectifs chez 58.com et en appartements résidentiels donnent néanmoins plus de crédit à ces métriques que les démonstrations habituelles en laboratoire contrôlé. Fondée en 2023, X Square Robot s'inscrit dans un écosystème chinois de robotique humanoïde incluant Unitree Robotics, Fourier Intelligence et AgiBot, face aux acteurs américains Figure AI (valorisé 2,6 Md$ fin 2024), Boston Dynamics et Physical Intelligence. La présence simultanée de Meituan, Alibaba et ByteDance au capital signale des débouchés ciblés dans la logistique, la livraison et les services à domicile, secteurs que ces groupes cherchent activement à automatiser. La mise en open source de WALL-OSS-0.5 et WALL-WM suit une stratégie classique d'adoption académique et industrielle avant commercialisation. Les fonds levés seront alloués au développement technologique core et à la recherche fondamentale en intelligence incarnée, avec pour horizon déclaré des systèmes robotiques polyvalents capables d'opérer dans des environnements non structurés du quotidien.

UELes modèles WALL-OSS-0.5 et WALL-WM étant open source, les équipes R&D européennes peuvent les évaluer directement ; la montée en puissance de l'écosystème chinois (Alibaba, ByteDance, Meituan comme investisseurs lead simultanés) intensifie la pression concurrentielle sur les acteurs européens de l'IA incarnée.

Chine/AsieOpinion
1 source
Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée
145arXiv cs.RO 

Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée

Des chercheurs ont déposé le 27 juin 2026 sur arXiv (arXiv:2606.27962) un framework d'infrastructure de simulation cloud-native pour l'intelligence embarquée, conçu pour unifier en une seule plateforme la génération d'environnements de simulation, l'exécution de tâches, la collecte de trajectoires, l'évaluation de modèles et la gestion de données. L'architecture s'articule en quatre couches fonctionnelles et intègre quatre systèmes représentatifs : D-VLA, RL-VLA3, Sword et Pre-VLA, couvrant respectivement la simulation scalable, la planification dynamique des ressources, l'augmentation visuelle et le filtrage de données en temps réel. Le tout repose sur des technologies cloud-native telles que l'ordonnancement élastique des ressources et la simulation conteneurisée, pour gérer des workloads multi-modèles et multi-tâches à grande échelle. L'enjeu sous-jacent touche directement au goulot d'étranglement qui freine les modèles VLA (Vision-Language-Action) : la collecte de données réelles est coûteuse, peu reproductible et difficile à scaler. Ce framework propose une réponse systémique en substituant ou en complétant les données terrain par de la simulation industrialisée, avec une boucle fermée (closed-loop) permettant d'optimiser les données de façon itérative. Si les composants comme Pre-VLA (filtrage temps réel) et RL-VLA3 (apprentissage par renforcement sur architecture VLA) tiennent leurs promesses à l'échelle, cela pourrait réduire significativement le sim-to-real gap qui reste l'obstacle majeur pour déployer des robots génériques en environnement industriel réel. Il faut toutefois noter que la publication reste au stade de preprint sans benchmarks indépendants validés, et les performances sur robots physiques ne sont pas documentées dans ce papier. Ce travail s'inscrit dans une compétition internationale intense autour des infrastructures de simulation pour l'IA incarnée. NVIDIA pousse Isaac Sim avec l'écosystème Isaac Lab pour l'entraînement par renforcement, tandis que Genesis (dévoilé en 2024, affilié MIT) et MuJoCo Playground ciblent eux aussi la simulation GPU-accélérée à grande échelle. L'approche présentée ici se distingue par son orientation service (SOA) et sa couche de gestion de données unifiée, pensée pour des déploiements multi-équipes plutôt qu'un usage chercheur individuel. Les auteurs ne précisent pas d'affiliation institutionnelle clairement identifiable ni de calendrier de mise à disposition publique du code, deux points qui limiteront concrètement l'adoption tant qu'ils resteront non documentés.

RechercheOpinion
1 source
SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels
146arXiv cs.RO 

SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels

Une équipe de chercheurs propose SpikeVLA, une nouvelle architecture de contrôle robotique publiée en préprint sur arXiv (arXiv:2606.27807v1, juin 2026), qui combine les modèles VLA (Vision-Language-Action) avec des réseaux de neurones impulsionnels, ou SNN (Spiking Neural Networks). L'architecture s'articule autour de trois blocs distincts : Spike-V, un encodeur visuel impulsionnel qui substitue aux couches denses traditionnelles des couches événementielles pour réduire le coût énergétique de la représentation visuelle ; Spike-L, un grand modèle de langage multimodal impulsionnel qui reformule le raisonnement cross-modal via une dynamique de spikes et une sparsité par token ; et Spike-A, un réseau de politique d'action s'appuyant sur un codage de population à noyau laplacien et un SNN multicouche entièrement connecté pour convertir l'activité impulsionnelle en commandes de contrôle continu. Les auteurs rapportent une réduction significative de la consommation énergétique et du coût computationnel tout en maintenant des performances compétitives sur des tâches de navigation et de contrôle robotique, sans toutefois détailler de métriques quantitatives dans l'abstract. L'enjeu est structurel : les modèles VLA dominants (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA de Stanford, Octo de Berkeley) reposent sur des transformers de grande taille, dont l'inférence exige des GPU embarqués ou une connexion à des serveurs distants. Cette dépendance représente un frein réel au déploiement autonome sur des robots à budget énergétique contraint, en particulier pour des applications edge sans infrastructure lourde. L'approche SNN répond à ce problème de manière fondamentalement différente : les neurones n'activent une computation que lors d'un spike, ce qui rend la consommation proportionnelle à l'activité réelle du réseau plutôt que constante. Si les gains annoncés se confirment sur benchmarks ouverts, cela ouvrirait la voie à du contrôle VLA temps réel sur du matériel embarqué standard. Un bémol éditorial s'impose néanmoins : l'abstract ne cite aucun ratio d'efficacité énergétique précis, aucun score sur benchmark de référence (LIBERO, RLBench, OpenX), ni cycle time, ce qui rend l'évaluation indépendante impossible à ce stade. Les VLA ont émergé comme paradigme dominant du contrôle robot généraliste entre 2023 et 2025, porté par des labos académiques (Berkeley, Stanford, CMU) et des startups comme Physical Intelligence. La recherche en calcul neuromorphique, dont les SNN sont le vecteur principal, dispose elle d'une décennie de travaux (Intel Loihi, IBM TrueNorth, BrainScaleS en Europe), mais leur application à des architectures VLA complètes reste peu explorée et n'a pas encore produit de système déployé en conditions industrielles. Aucun concurrent direct dans l'espace SNN-VLA n'est mentionné par les auteurs, et aucun partenariat industriel ni timeline de déploiement n'est annoncé. SpikeVLA reste pour l'instant un prototype de recherche soumis pour revue : l'étape critique sera la publication complète avec benchmarks reproductibles et comparaison rigoureuse contre les VLA transformers en conditions d'inférence embarquée.

UESi les gains énergétiques se confirment sur benchmarks ouverts, l'approche SNN-VLA pourrait bénéficier aux initiatives neuromorphiques européennes comme BrainScaleS, mais SpikeVLA reste un prototype de recherche sans impact concret immédiat pour la France ou l'UE.

IA physiqueOpinion
1 source
UBTECH vend 5 000 robots compagnons en deux semaines et vise une percée sur le marché grand public
147Pandaily 

UBTECH vend 5 000 robots compagnons en deux semaines et vise une percée sur le marché grand public

UBTECH, le fabricant de robots humanoïdes coté à Hong Kong, a enregistré plus de 5 000 précommandes pour son robot compagnon U1 en moins de deux semaines après son lancement début juin sur JD.com et Tmall, soit près de cinq fois ses ventes totales de robots humanoïdes pleine taille sur l'ensemble de l'année 2025 (1 079 unités). L'U1 est proposé en versions masculine et féminine, équipé de 88 articulations motorisées à haute liberté de mouvement, et positionné explicitement comme robot de compagnie émotionnelle pour les foyers. UBTECH vise 10 000 unités produites pour la série U1 d'ici fin 2026, en parallèle d'un objectif équivalent de 10 000 robots industriels. Sur le plan financier, la société affiche un chiffre d'affaires de 2,0 milliards de RMB en 2025, des pertes nettes de 703 millions de RMB (en recul par rapport à 1,12 milliard en 2024), et une capitalisation boursière d'environ 49 milliards HKD. La dépense en R&D atteint 507 millions de RMB, un ratio particulièrement élevé ramené au chiffre d'affaires. À noter : les 5 000 chiffres communiqués sont des précommandes, pas des livraisons confirmées. Ce signal commercial est significatif parce qu'il intervient dans un contexte où les fabricants chinois de robots humanoïdes cherchent à passer de l'expérimentation industrielle à une commercialisation réelle à grande échelle. Qu'un robot à 760 000 RMB de prix moyen génère un tel volume de précommandes grand public en quinze jours suggère un appétit domestique plus précoce qu'anticipé pour les compagnons IA embodied. Cela dit, UBTECH subit une pression tarifaire structurelle : Unitree, dont le G1 s'affiche sous les 100 000 RMB, revendique 60 % de marge brute grâce à une intégration verticale agressive, et avait déjà capté l'attention mondiale avec ses robots danseurs au Gala du Printemps 2025. Cette guerre des prix contraint UBTECH à justifier un premium par la profondeur de son stack technique, ce qui alourdit ses dépenses mais fragilise sa position face aux intégrateurs industriels sensibles au coût. UBTECH existe depuis une dizaine d'années et a construit une approche full-stack rare dans le secteur : modèle d'IA incarnée Thinker, réseau d'intelligence en essaim BrainNet 2.0, et fabrication de ses propres moteurs articulaires. Sa feuille de route officielle prévoyait d'abord l'industrie, puis les environnements commerciaux, puis le grand public. Ce lancement U1 anticipe la troisième phase, probablement sous pression concurrentielle et financière : les flux de trésorerie opérationnels restent négatifs à hauteur de 780 millions de RMB, et les créances clients atteignent 1,3 milliard de RMB dont plus de 40 % dépassent un an d'ancienneté, reflet d'une base clients très concentrée sur les administrations. Son principal concurrent industriel, Zhiyuan Robot, a expédié 5 100 unités en 2025 et vise "des dizaines de milliers" en 2026. La série Walker S d'UBTECH doit elle aussi atteindre 5 000 livraisons en 2026. Les prochaines semaines de conversion de précommandes en commandes fermes constitueront le vrai test de la demande consommateur.

Chine/AsieOpinion
1 source
L'usine CATL intègre le robot humanoïde de Galbot pour la manutention lourde
148Interesting Engineering 

L'usine CATL intègre le robot humanoïde de Galbot pour la manutention lourde

CATL, premier fabricant mondial de batteries pour véhicules électriques, a annoncé le déploiement du Galbot S1 dans ses lignes de production dans le cadre d'un partenariat stratégique avec le développeur chinois de robotique humanoïde Galbot. Le Galbot S1 est un robot humanoïde à charge lourde doté de bras capables de soulever jusqu'à 50 kilogrammes en charge combinée, d'un système de positionnement centimétrique par vision seule et d'une navigation omnidirectionnelle à 360 degrés. Déployé dans les usines de fabrication intelligente de CATL, il prend en charge les tâches de manutention, de transport de matériaux et de logistique répétitives lors de la production de modules et packs de batteries, avec des sessions continues pouvant atteindre huit heures. Le pack batterie embarqué intègre des matériaux cathode à gradation de particules, des anodes à faible consommation de lithium et un électrolyte bio-inspiré à auto-réparation, visant un taux de défaillance cellule à l'échelle des parties par milliard (ppb). Ce déploiement marque une étape concrète dans la commercialisation des humanoïdes industriels à charge lourde, un segment distinct des plateformes légères comme le Tesla Optimus Gen 3 ou le Figure 03, dont les capacités de manutention restent inférieures à 20 kg. Avec un payload de 50 kg, le Galbot S1 cible directement les tâches logistiques que les robots collaboratifs à bras fixes ou les AMR ne peuvent pas réaliser. Le fait que CATL maîtrise simultanément la production de batteries et leur intégration dans le robot crée une boucle verticale rare: le fabricant est à la fois client, fournisseur énergétique et partenaire de déploiement. L'annonce d'un réseau après-vente dédié aux robots humanoïdes, présenté comme un premier mondial, indique que CATL anticipe un marché de maintenance à grande échelle, au-delà de l'automatisation interne, même si aucun volume ni calendrier précis n'a été communiqué. CATL s'est engagé dans la robotique humanoïde depuis décembre 2025, date à laquelle il a présenté Xiaomo, un robot conçu pour les tests End-of-Line et les mesures de résistance interne en courant continu (DCIR) sur les packs batteries, développé par Spirit AI, une startup de Hangzhou financée par CATL. Xiaomo, animé par un modèle Vision-Language-Action (VLA) de bout en bout, affiche un taux de succès de connexion supérieur à 99% et des temps de cycle comparables à ceux d'un opérateur humain expérimenté, selon les données déclarées par CATL. La première ligne de production utilisant des humanoïdes avait été inaugurée à l'usine de Luoyang, dans la province du Henan. Sur le plan concurrentiel, CATL se retrouve dans une position ambivalente: il fournit des technologies batteries à des acteurs comme Figure AI ou Tesla, tout en développant sa propre capacité robotique en parallèle d'entreprises comme 1X Technologies ou Agility Robotics. Les prochaines étapes annoncées portent sur l'extension du Galbot S1 au réseau de service après-vente mondial de CATL et sur l'accélération du déploiement à grande échelle de l'IA incarnée dans ses sites industriels.

UELe déploiement annoncé dans le réseau mondial de CATL pourrait inclure ses usines européennes (Hongrie), créant une pression concurrentielle pour les intégrateurs robotiques et fabricants d'humanoïdes industriels de l'UE.

Chine/AsieOpinion
1 source
SAGE-Nav : planification LLM et fusion d'alignement pour la navigation par graphe de scène hiérarchique
149arXiv cs.RO 

SAGE-Nav : planification LLM et fusion d'alignement pour la navigation par graphe de scène hiérarchique

Des chercheurs ont publié le 25 juin 2026 sur arXiv (réf. 2606.25497) SAGE-Nav, un système de navigation autonome pour robots incarnés capable de localiser des objets spécifiés à partir de la seule perception visuelle égocentrique. L'architecture découple explicitement deux boucles temporelles : une planification globale sémantique assurée par un LLM, et un contrôle réactif basse latence. Le LLM décompose une instruction abstraite ("trouve la tasse dans la cuisine") en une séquence de waypoints sémantiquement ancrés. Deux modules originaux assurent la traduction en commandes : un encodeur de graphe de scène hiérarchique (HSGE) fondé sur des convolutions de graphes relationnelles, et un réseau de fusion GAFN qui combine perception temps réel et représentations structurées via un mécanisme de gating adaptatif à biais inductif explicite. Les évaluations conduites dans les simulateurs i-THOR et RoboTHOR affichent des performances à l'état de l'art en efficacité de navigation et en généralisation zero-shot vers des environnements non vus à l'entraînement. L'apport central est architectural : en séparant planification haute latence (LLM) et boucle de contrôle haute fréquence, SAGE-Nav évite le goulot d'étranglement qui pénalise les approches monolithiques de type VLA (Vision-Language-Action) sur des plateformes embarquées temps-réel. La généralisation zero-shot est un indicateur industriel critique car elle conditionne directement l'utilité d'un robot dans des entrepôts, hôpitaux ou espaces de bureau non cartographiés à l'avance. Le mécanisme GAFN répond concrètement au problème de cohérence entre carte sémantique construite offline et perception temps réel, un défi que les méthodes classiques d'exploration-planification traitent mal. La navigation orientée-objet (ObjNav) est un benchmark central de l'IA incarnée depuis la plateforme AI2-THOR de l'Allen Institute. SAGE-Nav s'inscrit dans la tendance qui instrumentalise les LLMs comme planificateurs symboliques plutôt que contrôleurs directs, approche défendue aussi par SayPlan (2023) et NavGPT. Limite importante : les évaluations restent confinées aux simulateurs, et aucun déploiement physique n'est rapporté malgré une mention de latence "compatible avec le matériel réel". Le gap sim-to-real demeure non adressé dans ce papier. Les concurrents directs incluent les architectures VLA bout-en-bout comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui font le pari inverse de la séparation planification/contrôle. Une validation sur plateformes physiques (Spot, Hello Robot Stretch) constituerait la prochaine étape naturelle.

IA physiquePaper
1 source
MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action
150arXiv cs.RO 

MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.24815) un framework nommé MANGO, pour Multi-Agent test oracle GENeration for Vision-Language-Action models. Les modèles VLA constituent la nouvelle génération de systèmes de contrôle robotique : ils intègrent dans une architecture unifiée la perception visuelle, la compréhension du langage naturel et la génération d'actions motrices. L'approche dominante pour les tester repose sur des oracles symboliques écrits manuellement, des fonctions qui évaluent si un robot a accompli sa tâche à partir de l'état final de l'environnement. MANGO automatise cette étape via un pipeline de trois agents LLM collaboratifs : un Generator qui produit une bibliothèque d'actions atomiques réutilisables, un Assessor qui ancre ces définitions dans le simulateur, et un Judge qui arbitre et affine les artefacts par feedback itératif. Le système a été évalué sur les benchmarks LIBERO_10 et RoboCasa Humanoid Tabletop. L'intérêt principal est de supprimer le goulot d'étranglement humain dans la qualification des robots VLA. Les oracles symboliques actuels exigent une expertise domaine significative et restent couplés à une tâche précise, ce qui limite fortement leur réutilisation dès qu'on change de scénario ou de cellule de travail. MANGO génère des oracles à grain fin capables d'évaluer des étapes intermédiaires, pas seulement l'état final, ce qui améliore la localisation des pannes : au lieu de constater qu'un robot a échoué, on identifie quelle action atomique a dévié. Les résultats montrent une détection de défauts comparable aux oracles symboliques manuels avec une couverture diagnostique plus riche, un levier direct pour les équipes QA qui valident des flottes de robots VLA en production. Les modèles VLA ont connu une accélération marquée depuis 2024 avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI et plusieurs variantes issues des laboratoires académiques. Tous partagent le même point faible : leur validation reste artisanale, peu reproductible, et difficile à passer à l'échelle. MANGO s'inscrit dans un effort croissant pour combler le fossé entre démos en laboratoire et déploiement industriel, en dotant les pipelines CI/CD robotiques d'outils d'évaluation automatisés. L'article demeure un preprint non relu par les pairs et le code n'est pas encore publié, ce qui invite à nuancer les résultats avant toute adoption. La prochaine étape naturelle serait une validation sur environnements physiques réels, au-delà des scénarios de manipulation sur table couverts par les benchmarks actuels.

RechercheOpinion
1 source