Aller au contenu principal

Dossier IA physique & VLA — page 4

904 articles · page 4 sur 19

L'IA physique : modèles vision-langage-action qui contrôlent des corps robotisés. État de l'art académique (CoRL, RSS) et premières productions industrielles.

151Interesting Engineering Chine/AsieActu

Robot humanoïde grille des kebabs et cuisine des plats chinois dans une démonstration IA impressionnante en direct

Selon UniX AI, un robot humanoïde a réalisé le 15 juillet une démonstration culinaire en direct à Liuxing Street, dans la ville de Yining, région autonome ouïghoure du Xinjiang, un quartier touristique connu pour son plan urbain hexagonal. Des visiteurs se sont rassemblés dans un restaurant local pour observer la machine préparer des spécialités traditionnelles du Xinjiang. Elle a d'abord grillé des brochettes de viande, une tâche exigeant une coordination fine entre doigts, poignets et bras ainsi qu'un contrôle précis de la force appliquée sur des morceaux de viande souples et irréguliers. Selon les développeurs, le robot a acquis ces gestes de base après moins d'une semaine d'entraînement spécifique, sans que son niveau atteigne celui d'un cuisinier expérimenté. L'exercice le plus délicat portait sur les nouilles étirées à la main (la-mian), spécialité du Xinjiang qui demande des ajustements subtils de pression pour éviter de déchirer ou de faire tomber la pâte, difficulté que rencontrent même des cuisiniers humains débutants. Pour y parvenir, la machine est équipée de capteurs tactiles intégrés à ses mains, mesurant en continu pression, mouvement et forces de contact à chaque tentative, données ensuite utilisées pour affiner ses mouvements par apprentissage. Le modèle exact du robot n'a pas été précisé. Au-delà de l'effet vitrine, l'exercice teste des briques encore fragiles de l'IA incarnée: perception, planification de mouvement et contrôle de force en temps réel face à des conditions changeantes, très éloignées des essais contrôlés en laboratoire. La cuisine reste un cas d'usage particulièrement exigeant en manipulation fine, et le résultat, encore en retrait par rapport à un chef humain, confirme qu'un écart persiste entre les démonstrations scénarisées et une autonomie réellement déployable. Ce type d'essai en conditions réelles est présenté par les ingénieurs comme un moyen d'accélérer le transfert des humanoïdes vers l'hôtellerie, le commerce, la santé et l'assistance domestique, au-delà de leur terrain historique en usine. Cette démonstration sert aussi de vitrine avant les deuxièmes World Humanoid Robot Games, prévus à Pékin du 22 au 26 août, qui doivent évaluer les robots humanoïdes sur des tâches concrètes plutôt que sur des chorégraphies. Elle intervient alors qu'UniX AI a récemment dévoilé Panther, un robot domestique humanoïde à roues doté de 8 à 16 heures d'autonomie, capable de cuisiner, nettoyer et ranger. Le secteur multiplie ainsi les démonstrations culinaires et domestiques pour prouver la maturité de la manipulation dextre, un terrain où la Chine pousse fort sa compétition avec les acteurs américains comme Figure ou Physical Intelligence.

1 source
152Robotics & Automation News 

Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés

Robbyant, filiale d'IA incarnée du groupe Ant Group (maison mère d'Alipay), a annoncé la mise à jour et la publication en open source de LingBot-VLA 2.0, un modèle vision-langage-action (VLA) destiné aux robots humanoïdes et autres plateformes incarnées. Ce nouveau modèle s'appuie directement sur LingBot-VLA 1.0, sorti en janvier 2026, et apporte des progrès notables sur trois axes techniques majeurs : la généralisation morphologique (capacité à piloter des corps de robots différents sans réentraînement complet), le support d'un nombre accru de degrés de liberté (DoF), et l'efficacité de déploiement. Robbyant présente LingBot-VLA 2.0 comme un "cerveau universel" capable de s'adapter à des architectures robotiques variées plutôt qu'à une seule plateforme propriétaire. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la stratégie d'ouverture : en publiant son modèle en open source, Ant Group cherche à s'imposer comme fournisseur de la couche logicielle "cerveau" pour un écosystème de fabricants de robots humanoïdes, plutôt que de vendre du matériel propre. Pour les intégrateurs et décideurs industriels, cela signifie potentiellement un modèle VLA gratuit et personnalisable, à intégrer sur des plateformes tierces, ce qui pourrait accélérer l'adoption face aux modèles propriétaires fermés comme Helix (Figure AI) ou GR00T N2 (NVIDIA). Cela renforce aussi l'hypothèse selon laquelle la généralisation cross-embodiment (un même modèle pilotant plusieurs morphologies de robots) devient un axe de compétition central, au-delà de la simple démonstration ponctuelle. Cette annonce s'inscrit dans la stratégie plus large d'Ant Group de se positionner sur l'IA incarnée, un an après le lancement de la première version de LingBot-VLA. Le secteur des modèles VLA reste dominé par des acteurs américains (Physical Intelligence avec Pi-0, NVIDIA avec GR00T, Figure AI avec Helix) et chinois (Unitree, AgiBot), avec une bascule progressive vers l'open source comme arme concurrentielle, à l'image de ce que Meta a fait avec Llama face à OpenAI. Les détails précis sur les benchmarks, les partenaires de déploiement et le calendrier de disponibilité du modèle n'étaient pas encore complètement communiqués au moment de l'annonce, ce qui invite à distinguer la publication du code de sa validation réelle sur du matériel tiers.

Chine/AsieActu
1 source
153arXiv cs.RO 

Main d'IDMAS : main sensorielle anthropomorphe modulaire à faible impédance et entraînement direct

Des chercheurs ont publié le 17 juillet 2026 sur arXiv un article présentant MIDAS Hand (Modular low-Impedance Direct-drive Anthropomorphic Sensing Hand), une main robotique dexterous à bas coût et open-source destinée à la recherche en manipulation. L'engin offre 16 degrés de liberté au total, dont 13 actifs, avec un entraînement en prise directe (direct-drive) affichant un couple de rétro-entraînement mesurément faible. Elle intègre 283 taxels tactiles trois axes répartis sur l'ensemble de la main, pour un poids compact de 700 grammes et une nomenclature de composants (BOM) inférieure à 3 000 dollars. Entièrement construite à partir de pièces imprimées en 3D, elle s'assemble en moins de trois heures tout en conservant la robustesse et la répétabilité nécessaires à des expériences répétées en conditions réelles. Les auteurs publient l'ensemble de la chaîne technique en accès libre : fichiers de conception, documentation de montage, API Python de contrôle et de lecture tactile, modèles de simulation, ainsi que des pipelines de retargeting et de téléopération. Cette publication cible un goulot d'étranglement bien identifié du secteur : la manipulation dexterous progresse autant grâce aux algorithmes qu'à la disponibilité de matériel accessible, et les mains robotiques existantes sacrifient généralement soit le coût, soit la fabrication facile, soit la richesse du retour tactile, soit l'échelle humaine. En combinant ces quatre propriétés dans une plateforme reproductible et documentée, MIDAS Hand vise à démocratiser la collecte de données de démonstration humain-vers-robot, un enjeu central pour l'entraînement des modèles vision-langage-action (VLA) qui alimentent aujourd'hui les mains et bras robotiques les plus avancés du secteur humanoïde. Le projet s'inscrit dans une lignée de mains dexterous de recherche telles que la Shadow Hand, l'Allegro Hand ou la LEAP Hand, souvent limitées par leur coût ou l'absence de capteurs tactiles denses. Les auteurs caractérisent leur plateforme via des analyses d'espace de travail et de taxonomie de prise, des essais de charge utile et de fiabilité, des mesures de rétro-entraînabilité, et des démonstrations de téléopération avec retour tactile. La documentation complète et le code sont accessibles sur midas-hand.com.

RecherchePaper
1 source
154arXiv cs.RO 

Robots généralistes : une évaluation active basée sur des facteurs en conditions réelles

Des chercheurs ont présenté un nouveau cadre d'évaluation actif pour les politiques robotiques généralistes, entraînées sur de vastes jeux de données couvrant de nombreuses tâches de manipulation. Publié sous la référence arXiv:2607.14439v1, ces travaux s'attaquent à un problème central du secteur : la performance réelle d'une politique dépend d'un espace combinatoire immense de facteurs, poses des objets, points de vue caméra, et l'évaluer de façon exhaustive sur du matériel physique est à la fois lent et coûteux en ressources. Les équipes ont mené 2331 essais réels répartis sur 3 tâches de manipulation avec 3 variations de facteurs chacune. Leur méthode traite l'évaluation comme un problème de conception expérimentale séquentielle : un modèle de substitution probabiliste est ajusté sur l'espace structuré des facteurs de tâche, puis des configurations d'essai sont sélectionnées de manière adaptative pour maximiser le gain d'information sur la distribution de performance de la politique. Résultat chiffré : cette approche permet d'économiser typiquement 20 à 40% des essais par rapport aux tests aléatoires classiques, tout en identifiant systématiquement les zones où la politique échoue le plus souvent. Cette contribution touche un point sensible pour l'industrie de la robotique généraliste : la manière dont on évalue les modèles VLA (vision-langage-action) aujourd'hui repose largement sur des suites de tests étroites, qui peuvent passer à côté de modes d'échec critiques et donner une image trompeuse de la préparation réelle au déploiement. Pour les intégrateurs et les décideurs B2B qui doivent choisir entre plusieurs politiques génératives avant un déploiement industriel, disposer d'une méthode statistiquement rigoureuse et moins gourmande en essais matériels change la donne : elle permet de cartographier plus vite les conditions dans lesquelles un robot échoue, plutôt que de se fier à des démonstrations vidéo sélectionnées ou des benchmarks limités. C'est une pièce méthodologique qui vient contredire l'idée reçue selon laquelle il suffirait de multiplier les tests en conditions variées pour avoir confiance dans une politique : le choix des essais compte autant que leur nombre. Ce travail s'inscrit dans la vague plus large de politiques de manipulation robotique entraînées sur des données diverses à grande échelle, dans la lignée des approches type Pi-0 ou GR00T N2 qui cherchent à généraliser au-delà de tâches et d'environnements spécifiques. Alors que ces politiques gagnent en capacité, l'écart entre promesse en laboratoire et fiabilité en conditions réelles reste l'obstacle principal à leur adoption industrielle, et les méthodes d'évaluation elles-mêmes deviennent un sujet de recherche à part entière plutôt qu'une simple formalité. Les auteurs positionnent leur approche comme un outil systématique face aux pratiques actuelles jugées insuffisantes, ouvrant la voie à des protocoles d'évaluation plus rigoureux avant tout déploiement de robots généralistes en environnement réel, que ce soit en logistique, en industrie manufacturière ou dans des contextes domestiques.

RecherchePaper
1 source
155arXiv cs.RO 

BadWAM : quand les modèles monde-action rêvent bien mais agissent mal

Une équipe de recherche publie sur arXiv (référence 2607.15207v1) un article intitulé « BadWAM: When World-Action Models Dream Right but Act Wrong », qui introduit un nouveau cadre d'attaque adversariale ciblant les World-Action Models (WAM), ces architectures qui couplent génération d'action et prédiction du futur pour le contrôle robotique incarné. BadWAM formalise une classe d'attaques baptisées « World-Action Drift Attacks » : de petites perturbations visuelles qui cassent l'alignement entre ce que le modèle imagine et ce qu'il exécute réellement. Le framework décline deux variantes selon les priorités de l'attaquant : une attaque purement orientée action, qui pousse directement le robot vers des échecs de tâche, et une attaque dite « imagination-preserving », plus furtive, qui maintient une prédiction de futur plausible tout en désynchronisant l'action exécutée. Testée sur plusieurs variantes de WAM en boucle fermée, l'attaque action-only fait chuter le taux de réussite des tâches de 96,5 % à 43,1 %. Ce résultat fragilise un argument central de sécurité avancé pour les WAM : le fait de pouvoir vérifier une action contre le futur imaginé par le modèle était présenté comme une garantie de robustesse et d'interprétabilité. BadWAM montre que cette garantie peut être contournée, y compris de façon furtive, le modèle continuant d'afficher une trajectoire imaginée cohérente alors que l'action réellement exécutée diverge. Pour les intégrateurs et décideurs qui envisagent de déployer des VLA ou des WAM en environnement industriel, c'est un signal d'alerte direct sur la fiabilité des mécanismes de vérification interne comme filet de sécurité, particulièrement dans des contextes où un flux vidéo ou capteur pourrait être manipulé. Les WAM s'inscrivent dans la lignée des modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui cherchent à unifier perception, raisonnement et contrôle moteur. En documentant systématiquement la surface d'attaque de ces architectures selon deux axes, force de perturbation et furtivité, les auteurs de BadWAM posent une méthodologie d'évaluation reproductible que d'autres laboratoires pourront appliquer à leurs propres modèles avant tout déploiement sur des plateformes robotiques réelles.

RechercheActu
1 source
156arXiv cs.RO 

Compréhension sémantique du contrôle du corps entier de l'humanoïde par l'audio, en dynamique

Une équipe du Lab Rococo de l'université Sapienza de Rome a publié le 17 juillet 2026 sur arXiv (2607.14182) un système d'orchestration multimodale permettant à un robot humanoïde de choisir et d'exécuter en temps réel des mouvements en réaction à un flux audio continu, sans script préétabli. Le framework distingue deux branches de traitement : la musique, analysée par empreinte audio et embeddings sémantiques pour identifier un morceau et synchroniser temporellement les mouvements avec ses segments, et la parole, ancrée dans une bibliothèque discrète de compétences apprises par imitation pour permettre une interaction directe humain-robot. Les deux flux passent par une interface unifiée qui ordonnance l'exécution des compétences au sein d'un pipeline de contrôle par renforcement. L'approche a été validée en simulation puis transférée sur un humanoïde Unitree G1, avec des résultats montrant un transfert sim-to-real robuste et une sélection de politique cohérente selon le contenu audio. L'intérêt de ces travaux tient moins à la performance spectaculaire qu'à la nature du problème adressé : la plupart des démonstrations de robots humanoïdes dansant ou réagissant à la musique reposent aujourd'hui sur des séquences chorégraphiées à l'avance et déclenchées manuellement, ce qui limite fortement leur autonomie réelle face à un environnement dynamique. En conditionnant la sélection de compétences motrices sur une compréhension sémantique du signal audio plutôt que sur un déclenchement externe, cette recherche s'inscrit dans la tendance plus large des politiques de contrôle vision-langage-action cherchant à rapprocher la réactivité perceptive des robots de celle d'un humain, un axe scruté de près par les intégrateurs et laboratoires travaillant sur l'autonomie des humanoïdes plutôt que sur la simple téléopération ou le scriptage. Le choix du Unitree G1 comme plateforme d'expérimentation illustre son rôle de standard de facto pour la recherche académique en contrôle humanoïde, grâce à son prix contenu comparé aux plateformes de Boston Dynamics ou Figure. Il s'agit ici d'un travail de recherche publié avec matériel supplémentaire en ligne, non d'un produit commercialisé ; les auteurs ne communiquent pas de calendrier de déploiement au-delà de la validation en laboratoire présentée dans l'article.

UECe travail de recherche academique est mene par le Lab Rococo de l'universite Sapienza de Rome (Italie), un acteur europeen, mais reste une publication de laboratoire sans deploiement commercial ni impact reglementaire annonce en France ou en UE.

FR/EU ecosystemeOpinion
1 source
157arXiv cs.RO 

ConFlow : apprentissage guidé par contraintes avec appariement de flux pour la génération de mouvement

ConFlow, un nouveau framework de génération de mouvement robotique par flow matching intégrant des contraintes dès l'entraînement, a été publié sur arXiv (2607.14424v1). Le flow matching est une méthode de modélisation générative reposant sur un échantillonneur neuronal basé sur des équations différentielles ordinaires (ODE), entraîné en régressant les champs de flux empiriques associés aux trajectoires observées. Le problème que ConFlow cherche à résoudre est simple à énoncer : la plupart des approches actuelles entraînent le modèle de flux sur des données brutes, puis appliquent des contraintes propres à la tâche uniquement au moment de l'inférence, via un guidage externe. Les auteurs proposent à la place d'injecter directement l'information de contrainte dans l'objectif d'entraînement, sous forme de fonctions de barrière ou de coût différentiables. Autre nouveauté technique : la distribution source gaussienne standard du flow matching est remplacée par un processus gaussien conditionnel, ce qui permet d'imposer des spécifications de conception comme la régularité ou les conditions aux limites. Le système exploite aussi des démonstrations infaisables comme supervision négative, sans nécessiter de données expertes supplémentaires. Sur une tâche de navigation impliquant deux robots, ConFlow affiche un taux de collision plus faible et une meilleure qualité de trajectoire que les baselines de flow matching standard, avec ou sans guidage à l'inférence. L'enjeu dépasse la simple performance chiffrée : ce travail questionne une hypothèse répandue dans la génération de mouvement par apprentissage, à savoir que le guidage à l'inférence suffit à faire respecter des contraintes physiques ou de sécurité à un modèle entraîné sans elles. En démontrant qu'intégrer les contraintes pendant l'entraînement referme l'écart entre entraînement et inférence, ConFlow apporte un argument concret pour les équipes qui développent des politiques de mouvement destinées à des robots opérant sous contraintes strictes (évitement de collision, limites articulaires, zones interdites), un enjeu central pour tout déploiement industriel ou multi-robot. Le flow matching s'est imposé ces dernières années comme alternative aux modèles de diffusion pour la génération de trajectoires robotiques, dans la même famille de méthodes que les architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui reposent elles aussi sur des politiques génératives entraînées sur démonstrations. ConFlow se positionne comme une brique méthodologique complémentaire à ces systèmes plutôt qu'un produit concurrent : la validation reste pour l'instant limitée à un scénario de navigation à deux robots, sans indication d'extension à des tâches de manipulation plus complexes ou à un déploiement matériel réel.

RecherchePaper
1 source
158arXiv cs.RO 

Never trop tard pour la force : accélérer le post-entraînement des VLA par injection réactive de force

Des chercheurs publient sur arXiv (arXiv:2607.14236v1) LIFT, pour "Late Reactive Injection of Force for VLA Post-Training", une méthode de post-entraînement qui ajoute une réactivité au contact aux politiques vision-langage-action (VLA) déjà pré-entraînées. Le principe : greffer un second "expert d'action" réactif à côté de celui d'origine, initialisé à partir des mêmes poids pré-entraînés, et lui injecter en continu la force 6D mesurée à l'effecteur terminal via une mémoire de force causale et une attention croisée à initialisation nulle. Cela permet de rafraîchir les actions du robot en cours d'exécution, en fonction du retour de force réel et non plus seulement de la vision. Pour gérer le décalage de distribution propre à chaque politique face au retour de contact, LIFT combine cette injection de force avec une boucle DAgger en ligne, entraînée sur un mélange de données hors-ligne alignées sur la tâche et de trajectoires en ligne corrigées par un opérateur humain. Les auteurs testent l'approche sur trois tâches de manipulation fine : pliage de serviette, insertion de livre et empilement d'anneaux façon tour de Hanoï. L'enjeu dépasse la démonstration académique : les politiques VLA actuelles (dans la lignée de RT-2, OpenVLA ou Pi-0) restent essentiellement pilotées par la vision, ce qui les rend fragiles dès que la scène devient occluse, la profondeur ambiguë, ou qu'une petite erreur de force fait sortir l'exécution de la distribution des démonstrations d'entraînement, un scénario fréquent dès qu'il y a contact physique réel avec l'objet. LIFT s'attaque directement à l'un des points faibles documentés du paradigme VLA pour la manipulation en contact, une zone où le fossé entre démonstration vidéo et robustesse en conditions réelles reste large. Les auteurs rapportent un apprentissage plus rapide et des performances supérieures à un post-entraînement uniquement visuel, avec des ablations montrant que la mémoire de force et les corrections humaines en ligne contribuent toutes deux à la robustesse obtenue. Le travail s'inscrit dans la vague actuelle de recherche visant à rendre les politiques VLA génériques exploitables en usine ou en environnement non structuré, où la manipulation fine (insertion, assemblage, tissu) reste le talon d'Achille par rapport aux tâches de préhension simple. Contrairement à un réentraînement complet du modèle, LIFT préserve les connaissances de manipulation générale du VLA de base tout en ajoutant un module spécialisé pour le contact, une approche modulaire plus économe en données. Le code et les données doivent être rendus publics, ce qui permettra à d'autres laboratoires de reproduire les résultats sur d'autres politiques VLA et d'autres tâches de manipulation en contact.

IA physiqueActu
1 source
159arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
160arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
161Pandaily 

LimX Dynamics dévoile une démo qui défie Figure : le humanoïde chinois rivalise désormais avec le meilleur de la Silicon Valley

LimX Dynamics a diffusé une vidéo de démonstration de 3 minutes, en plan-séquence unique, montrant son robot humanoïde de taille humaine Oli exécuter de façon autonome une séquence continue de tâches ménagères : décrocher des vêtements de cintres, les ranger dans un panier à linge, trier des jouets, empiler des boîtes, se pencher profondément pour ramasser des débris au sol et jeter des déchets. La séquence est présentée comme ininterrompue, non montée et réalisée sans téléopération humaine. Cette publication intervient un jour seulement après l'annonce par LimX d'un tour de financement pré-IPO de 200 millions de dollars, valorisant l'entreprise à 2,3 milliards de dollars. Le système à l'origine de cette démonstration, baptisé COSA 0.5, repose sur une architecture à trois niveaux selon Zhang Wei, fondateur de LimX : une couche cognitive S2 pour la compréhension de scène, la mémoire, le raisonnement et la planification ; une couche de compétences S1 intégrant notamment des modèles vision-langage-action (VLA) ; et une couche de contrôle moteur S0, une politique Transformer corps entier tournant à 1000 Hz pour l'équilibre et la coordination. Cette démonstration mérite d'être prise avec prudence puisqu'il s'agit d'une vidéo unique diffusée par l'entreprise elle-même, sans vérification indépendante ni détail sur le nombre de prises nécessaires en amont. Elle n'en reste pas moins significative : jusqu'ici, seul Figure avait publié des démonstrations comparables en matière de continuité des tâches, de complexité des enchaînements et de contrôle corps entier sans intervention humaine. Que LimX affiche un niveau similaire, avec un calendrier de développement plus court, interroge l'hypothèse selon laquelle Figure disposerait d'une avance technologique difficile à rattraper. L'argument de Zhang Wei, selon lequel un "cerveau" robotique doit être conçu comme un système modulaire plutôt qu'un modèle monolithique toujours plus gros, offre aussi un contrepoint à la course actuelle aux modèles fondation géants dans la robotique humanoïde : chaque couche de COSA pouvant en théorie être mise à jour indépendamment, l'architecture promet des cycles d'itération plus rapides que les approches bout-en-bout. La démonstration confirme également le positionnement stratégique de LimX, qui cible en priorité les environnements domestiques, commerciaux, hôteliers et de loisirs plutôt que les lignes de production industrielles privilégiées par la majorité des acteurs du secteur. En réussissant à montrer une gestion crédible de l'imprévisibilité d'un intérieur non structuré, LimX renforce son pari qu'un premier marché de masse pour les humanoïdes émergera du service à la personne avant l'usine. Reste à savoir si l'entreprise, forte de sa levée récente, transformera cette démonstration en déploiements pilotes concrets dans les mois à venir.

HumanoïdesOpinion
1 source
162arXiv cs.RO 

L'IA générative face aux imitations : une étude sur les interfaces d'information par étape pour l'affinement des modèles VLA

Voici l'article traduit et résumé. Une équipe de recherche a mené une étude empirique comparant différentes interfaces d'information de stade pour l'affinement de politiques Vision-Langage-Action (VLA) sur des tâches de manipulation robotique longue durée. Le problème adressé : une instruction unique de haut niveau (par exemple "range la vaisselle") peut recouvrir plusieurs étapes d'action distinctes, et les chercheurs ont testé si fournir explicitement cette information de progression améliore la performance. Ils ont utilisé des annotations d'action segmentées comme représentation intermédiaire entre l'instruction complète et les segments d'action du modèle VLA, avec un module de suivi de progression qui détecte l'étape active. Deux interfaces ont été comparées à une politique utilisant seulement l'instruction complète : un texte décrivant l'étape courante, et un "Ordinal Stage-State" (un index ordinal normalisé intégré à l'état du robot). Les tests ont été menés sur GR00T N1.6, le modèle VLA de NVIDIA, sur le benchmark LIBERO-10, selon deux protocoles d'entraînement (affinement direct et affinement en continuation depuis un modèle de référence entraîné sur l'instruction complète). Les résultats nuancent une hypothèse répandue dans le secteur robotique, celle qu'ajouter une information de contexte explicite (ici, l'étape en cours) améliore mécaniquement la performance d'une politique VLA. En affinement direct, l'instruction complète seule obtient le meilleur taux de succès moyen (57,45%), devant l'Ordinal Stage-State (54,36%) et le texte d'étape courante (50,24%) : l'information de stade n'apporte donc pas de gain automatique. En revanche, en configuration de continuation depuis un modèle pré-entraîné, l'Ordinal Stage-State dépasse les deux autres approches sur les trois essais appariés (53,75% contre 50,00% et 49,07%). Pour les intégrateurs et équipes de recherche travaillant sur des politiques génératives pour la manipulation longue durée, ce résultat suggère que le bénéfice d'un signal de progression dépend fortement du format de représentation choisi et du régime d'entraînement, un point souvent négligé dans les communications marketing autour des modèles "world-aware" ou "task-decomposition". Cette étude s'inscrit dans un contexte de compétition croissante autour des architectures VLA pour les robots humanoïdes et bras manipulateurs, où NVIDIA (avec sa famille GR00T), Physical Intelligence (Pi-0) et d'autres laboratoires cherchent à améliorer la généralisation des politiques sur des tâches multi-étapes. LIBERO-10, benchmark standard de manipulation à long horizon, sert ici de terrain de comparaison contrôlé. Les auteurs soulignent que l'effet observé varie selon la représentation d'interface et l'arrangement d'entraînement, ouvrant la voie à des travaux futurs sur la conception de signaux de progression plus robustes, potentiellement transférables à d'autres familles de modèles VLA au-delà de GR00T N1.6.

RecherchePaper
1 source
163arXiv cs.RO 

Explorateurs, communicatifs et déployables : des agents incarnés guidés par la vision pour la manipulation mobile en monde ouvert

Des chercheurs du laboratoire InternRobotics ont publié REAL, un framework agentique pour la manipulation mobile en environnement ouvert, accompagné du benchmark REAL-Bench couvrant 241 tâches réparties entre exploration active, distraction visuelle, manipulation d'objets articulés et désambiguïsation interactive de l'intention utilisateur. Le système combine des API d'environnement cohérentes entre simulation et réel, sans recourir à une perception oracle, et un simulateur d'utilisateur permettant une boucle homme-machine pour clarifier des instructions incomplètes. L'agent, entraîné via un pipeline hiérarchique associant apprentissage supervisé et renforcement en ligne, atteint un taux de réussite de 56,9% sur les tâches interactives, devançant des VLM commerciaux à code fermé sur ce même exercice. Déployé sur un robot mobile à double bras physique, il obtient 78,3% de réussite de bout en bout sur 60 épisodes réels, avec un transfert zero-shot vers des scénarios domestiques inédits. Le code est disponible sur github.com/InternRobotics/REAL. Ce résultat s'attaque directement à l'un des points faibles reconnus des agents robotiques actuels: la plupart des démonstrations s'appuient sur des instructions complètes fournies à l'avance ou sur des états privilégiés du simulateur, ce qui masque les difficultés réelles du déploiement, comme comprendre une consigne ambiguë ou explorer un environnement inconnu pour localiser un objet. En surpassant des modèles vision-langage-action commerciaux sur les tâches interactives, REAL apporte une preuve empirique que l'écart entre simulation et réalité peut être réduit sans capteurs ou informations privilégiées, un enjeu central pour les intégrateurs qui cherchent à déployer des robots domestiques ou logistiques capables de gérer des instructions humaines imparfaites plutôt que des scripts rigides. Le projet s'inscrit dans la lignée des travaux sur les agents vision-langage-action (VLA) tels que Pi-0 ou GR00T N2, mais se distingue en intégrant explicitement la dimension conversationnelle et exploratoire plutôt que la seule exécution de tâches préformulées. Les auteurs positionnent leur contribution face aux VLM propriétaires fermés, sans toutefois nommer précisément les modèles concurrents testés. Les prochaines étapes évoquées portent sur l'extension du benchmark et l'amélioration du raisonnement à vocabulaire ouvert sur des horizons d'exploration encore plus longs, avant d'envisager des déploiements pilotes à plus grande échelle.

RechercheActu
1 source
164arXiv cs.RO 

IA généralisable par ancrage de représentation et alignement langage-action pour les modèles VLA

Le laboratoire à l'origine de ce travail publie Anchor-Align, une méthode de finetuning pour les politiques vision-langage-action (VLA), décrite dans un article arXiv (2607.13429, juillet 2026, projet en ligne sur anchoralignvla.github.io). Le problème ciblé est concret : quand un modèle vision-langage préentraîné est affiné sur des démonstrations robotiques par clonage comportemental (behavior cloning), il perd progressivement les représentations qui lui permettaient de généraliser visuellement et sémantiquement. Le co-entraînement sur des données web texte-image, remède habituel, ne corrige pas le vrai défaut : les pertes de langage et d'action portent sur des observations différentes, ce qui laisse un désalignement langage-action invisible aux benchmarks de manipulation classiques. Anchor-Align ajoute deux objectifs d'entraînement, l'un qui distille les représentations couche par couche d'une copie figée du VLM d'origine, l'autre qui convertit chaque action cible en étiquette discrète de direction de mouvement pour entraîner conjointement langage et action sur la même observation robotique. Sur un bras robotique physique xArm7, avec deux architectures VLA largement utilisées, les taux de réussite passent de 28% à 54% pour l'une et de 37% à 60% pour l'autre. L'enjeu dépasse la seule courbe de performance : c'est une remise en cause d'un présupposé du secteur des VLA, celui du "plus de données de co-entraînement suffit" pour éviter l'oubli catastrophique. En montrant qu'il existe un désalignement structurel que les benchmarks de manipulation standards ne détectent pas, les auteurs pointent un angle mort méthodologique qui concerne tous les laboratoires construisant des politiques de type RT-2, OpenVLA, Pi-0 ou GR00T. Pour les équipes qui finetunent des VLA pour des tâches industrielles, le message est que préserver les représentations préentraînées et apprendre correctement l'action ne sont pas des objectifs contradictoires, contrairement à l'hypothèse implicite du compromis généralisation-performance. Il faut toutefois noter que la majorité des gains rapportés (LIBERO-PRO, LIBERO-Plus, CALVIN) proviennent de simulation, avec seulement deux architectures testées en conditions réelles sur un unique bras robotique, ce qui limite la portée immédiate pour un déploiement industriel à grande échelle. Le contexte est celui d'une course intense autour des modèles VLA depuis l'émergence de RT-2 puis des systèmes open source comme OpenVLA, où le clonage comportemental sur démonstrations téléopérées est devenu la recette standard malgré ses limites connues de généralisation. Anchor-Align se positionne comme une brique méthodologique plutôt qu'un produit ou un robot, sans annonce de partenariat industriel ni de calendrier de déploiement pour l'instant. La suite logique serait une validation sur davantage d'architectures et de plateformes physiques, ainsi qu'une comparaison directe avec les techniques de co-entraînement existantes utilisées par les acteurs commerciaux du secteur, pour voir si le gain se maintient à l'échelle des flottes industrielles réelles.

IA physiqueActu
1 source
165arXiv cs.RO 

Au-delà de la description : évaluer cognitivement l'action fine pour les agents incarnés

Des chercheurs ont publié CFG-Bench, un nouveau benchmark destiné à évaluer la capacité des grands modèles multimodaux (MLLM) à raisonner sur l'action fine dans des environnements physiques, plutôt que sur la simple planification de haut niveau ou le raisonnement spatial déjà couverts par les benchmarks existants. L'article, disponible sur arXiv (2511.18685), détaille un corpus de 1 368 vidéos annotées, associées à 19 562 paires question-réponse. Ces données couvrent trois paradigmes d'évaluation et quatre capacités cognitives distinctes : l'interaction physique, la relation temporelle-causale, la compréhension intentionnelle et le jugement évaluatif. L'objectif est de mesurer si un modèle sait traduire une observation visuelle en connaissance actionnable, au-delà de la simple reconnaissance d'objets ou de scènes. Les résultats sont significatifs pour l'écosystème des agents incarnés (embodied agents) qui s'appuient de plus en plus sur des architectures vision-langage-action (VLA) pour piloter robots et humanoïdes. Les auteurs montrent que même les MLLM les plus performants du marché peinent à produire des instructions détaillées pour des interactions physiques concrètes, et présentent des lacunes marquées dès qu'il s'agit de raisonnement d'ordre supérieur, comme inférer une intention ou juger la qualité d'une action. C'est un signal notable pour les intégrateurs et équipes de recherche qui misent sur ces modèles comme moteurs de décision : la compréhension de haut niveau ne garantit pas une exécution fine et fiable, un des points de friction identifiés dans l'écart persistant entre démonstration et déploiement réel en robotique. Point plus encourageant pour le secteur : les auteurs démontrent qu'un fine-tuning supervisé (SFT) sur les données de CFG-Bench, en apprenant explicitement au modèle à articuler des actions fines, se traduit par des gains de performance mesurables sur des benchmarks incarnés déjà établis. Cela suggère une piste d'amélioration directe et reproductible pour les futurs modèles VLA, plutôt qu'une simple mise en évidence de leurs limites. Le projet s'inscrit dans la vague de benchmarks spécialisés qui cherchent à combler les angles morts des évaluations génériques de MLLM. La page du projet et le jeu de données sont accessibles publiquement via cfg-bench.github.io, ouvrant la voie à des comparaisons futures entre laboratoires et fournisseurs de modèles.

RecherchePaper
1 source
166Pandaily 

China : premier humanoïde grandeur nature accomplit seul des tâches ménagères complexes grâce à un système cérébral à contre-courant

La start-up chinoise LimX Dynamics a présenté Oli, un robot humanoïde grandeur nature doté de 31 degrés de liberté, réalisant de façon autonome une série de tâches domestiques complexes dans un environnement réel, sans téléopération ni montage vidéo, selon les affirmations de l'entreprise. En une seule prise continue, le robot a plié du linge, rangé des objets, empilé des boîtes, ramassé des déchets et livré de l'eau. LimX se positionne ainsi comme la deuxième entreprise au monde, aux côtés de Figure, à revendiquer ce niveau d'autonomie sur des tâches ménagères à horizon long. Cette démonstration repose sur COSA 0.5, une architecture cognitive à trois couches baptisée S2-S1-S0. La couche S2, dite « cognition », s'appuie sur un agent LLM/VLM pour la compréhension de scène, la mémoire et le raisonnement ; la couche S1 regroupe un portefeuille de compétences entraînées, dont des modèles vision-langage-action (VLA) pour la génération de mouvements du corps entier ; la couche S0 fait tourner en local, à 1000 Hz, une politique de transformeur corps-entier (WBT) de 10 millions de paramètres chargée de traduire les objectifs en commandes articulaires coordonnées et équilibrées. Zhang Wei, fondateur de LimX, justifie cette séparation en comparant un grand modèle isolé à Stephen Hawking alité : d'une intelligence extrême mais incapable de mouvement. Cette approche va à contre-courant du consensus actuel du secteur, qui tend à assimiler le "cerveau" du robot à un modèle unique et massif. En découplant cognition, compétences et contrôle moteur, LimX affirme pouvoir faire évoluer chaque couche indépendamment, un argument de robustesse industrielle plus que de performance brute. Le système aurait été affiné par apprentissage par renforcement directement sur le robot réel : des opérateurs corrigent les erreurs par téléopération pendant que la couche S0 maintient l'équilibre, ces corrections alimentant ensuite l'entraînement de modèles de récompense. Si les résultats se confirment au-delà de cette démonstration filmée par l'entreprise elle-même, l'enjeu dépasse la prouesse technique : il s'agit de savoir si les architectures VLA passent enfin l'épreuve du réel en dehors des environnements industriels contrôlés, un test que la plupart des acteurs du secteur n'ont pas encore franchi publiquement. La majorité des entreprises d'IA incarnée, à l'image de Tesla avec Optimus ou Agility Robotics, concentrent leurs premiers déploiements sur l'usine et la logistique. LimX Dynamics fait un pari inverse : cibler d'emblée les marchés du commerce, de l'hôtellerie, du divertissement et du service à domicile, où l'interaction physique humanoïde crée, selon Zhang Wei, une valeur différente. La démonstration d'Oli sert avant tout à crédibiliser ce positionnement stratégique face à des concurrents comme Figure ou aux plateformes Pi-0 et GR00T N2, en misant sur la polyvalence domestique plutôt que sur la répétabilité en chaîne de production, sans qu'aucun calendrier de déploiement pilote n'ait pour l'instant été communiqué.

Chine/AsieActu
1 source
167arXiv cs.RO 

DECO : transformateur de diffusion multimodal découplé pour la manipulation dextre bimanuelle avec adaptateur tactile enfichable

DECO (Decoupled multimodal Diffusion transformer for bimanual dExterous manipulatiOn) est un nouveau modèle de politique robotique présenté dans un papier arXiv (2602.05513v3) qui sépare explicitement le traitement de la vision, de la proprioception et du tactile via des voies de conditionnement dédiées, plutôt que de fusionner ces signaux en amont comme le font la plupart des architectures existantes. Un adaptateur tactile léger permet d'injecter le signal de toucher de façon paramétrique-efficace, sans réentraîner l'ensemble du réseau. Les auteurs publient aussi DECO-50, un jeu de données de 50 heures et plus de 5 millions de frames, collecté par téléopération sur de vrais robots à deux bras équipés de capteurs tactiles. Sur plus de 2 000 essais réels (pas de simulation), DECO atteint un taux de réussite moyen de 72,25%, soit 21 points de mieux que la meilleure référence testée. L'ajout de l'adaptateur tactile apporte 10,25 points de réussite supplémentaires en moyenne, et jusqu'à 20 points sur les tâches à contact riche, tout en ne réajustant que moins de 10% des paramètres du modèle. Ce résultat compte parce qu'il s'attaque à un point de friction connu des politiques de manipulation bimanuelle: la fusion multimodale brute dégrade souvent les performances quand un des signaux (typiquement le tactile) est bruité ou absent, et le réentraînement complet pour intégrer un nouveau capteur reste coûteux. Découpler les modalités et rendre l'ajout de signaux modulaire via un adaptateur va dans le sens d'une approche plus industrialisable pour les intégrateurs qui veulent équiper des mains ou pinces existantes de tactile sans repartir d'un modèle de zéro. Le volume d'essais réels (2 000+) et le jeu de données ouvert de 50 heures renforcent aussi la crédibilité par rapport aux annonces qui ne reposent que sur quelques démonstrations sélectionnées. Le travail s'inscrit dans la vague des transformeurs de diffusion appliqués aux politiques robotiques (diffusion policy), une famille d'approches également explorée par des modèles vision-langage-action comme Pi-0 ou GR00T N2, mais ici recentrée spécifiquement sur la dextérité bimanuelle et l'intégration tactile plutôt que sur la généralisation multi-tâches à grande échelle. La publication conjointe du dataset DECO-50 laisse présager des comparaisons à venir avec d'autres politiques entraînées sur les mêmes données, un terrain encore rare dans la manipulation dextre où chaque laboratoire collecte ses propres démonstrations.

IA physiqueOpinion
1 source
168Pandaily 

LimX Dynamics, la start-up chinoise spécialisée dans les robots humanoïdes, atteint 2,3 milliards de dollars de valorisation avec un tour pré-IPO de 200 millions de dollars

LimX Dynamics, startup de robotique humanoïde basée à Shenzhen et fondée il y a quatre ans par Zhang Wei, professeur à la Southern University of Science and Technology, vient de boucler un tour de table Pre-IPO de près de 200 millions de dollars, portant sa valorisation post-money à 2,3 milliards de dollars, un montant qui la place parmi les startups robotiques les plus valorisées de Chine. L'entreprise a bâti une architecture technologique en trois couches: à la base, un modèle fondation type "cervelet" pour le contrôle moteur du corps entier; au milieu, un moteur vision-langage-action baptisé Humanoid VLA qui relie perception visuelle et commandes motrices; au sommet, un système d'exploitation agentique nommé COSA, chargé du raisonnement, de la planification et de l'exécution des tâches. Cette fusion cognito-motrice dans une architecture unique distingue LimX de concurrents qui traitent généralement contrôle moteur et raisonnement cognitif comme deux sous-systèmes séparés. Le catalogue produit illustre cette approche: Luna, le robot humanoïde phare, est vendu 298 000 RMB (environ 41 000 dollars), dispose de 27 degrés de liberté et peut orchestrer des performances synchronisées jusqu'à 200 robots pour l'événementiel. TRON 2, robot multi-formes sur châssis unique, se reconfigure entre versions bipède, à roues ou double-bras via des modules de buste interchangeables, achetés en une fois pour cinq configurations différentes. En avril 2026, LimX a également mis en open source le Flux VLA Engine, plateforme d'ingénierie pour l'intelligence incarnée codéveloppée avec Alibaba Cloud. Le choix stratégique de LimX tranche nettement avec la ruée du secteur vers les démonstrations d'utilité en usine. Zhang Wei affirme que les humanoïdes ne sont pas nés pour les chaînes de production, où l'efficacité coût et le débit priment, mais pour des scénarios commerciaux, hôteliers, touristiques et de divertissement où l'interaction humaine, le mouvement esthétique et la présence sociale créent de la valeur, notamment à l'export. Ce pari a une portée concrète pour l'industrie: si le premier marché de masse des humanoïdes se révèle bien être le service et le divertissement plutôt que l'industrie, LimX prendrait une avance difficile à rattraper sur ce segment, quand les acteurs focalisés sur l'usine capteraient en priorité les revenus manufacturiers. À prendre néanmoins avec prudence: les chiffres de déploiement en conditions réelles restent limités par rapport aux démonstrations mises en avant. Sur le plan concurrentiel, LimX se positionne face à des rivaux chinois et occidentaux qui misent majoritairement sur l'usine et la logistique. Sa stratégie logicielle, décrite par Zhang comme une plateforme à la Taobao où des développeurs tiers viendraient "ouvrir leur boutique" sur le socle matériel et de contrôle moteur LimX, vise à accélérer le déploiement d'applications verticales tout en collectant des données spécifiques à chaque scénario d'usage. Le tour Pre-IPO signale la confiance des investisseurs dans cette différenciation, sans que des pilotes commerciaux à grande échelle n'aient encore été confirmés publiquement.

Chine/AsieOpinion
1 source
169Interesting Engineering 

Vidéo : le nouveau robot humanoïde chinois combine contrôle corps entier et puce Nvidia Thor

Booster Robotics, start-up chinoise de robotique, a dévoilé le Booster T2, une nouvelle plateforme humanoïde destinée à la fois à la recherche en IA incarnée et à des applications industrielles réelles. La version T2 Pro embarque la puce Nvidia Thor T5000, annoncée jusqu'à 2 070 TFLOPS de calcul embarqué pour la perception, la planification et le contrôle en temps réel. Le robot mesure environ 1,4 mètre et pèse entre 43 et 94,7 livres selon la configuration matérielle, avec 31 degrés de liberté répartis en six articulations par jambe, sept par bras, trois au niveau du bassin et deux à la tête. Il peut porter jusqu'à 10 kg à deux bras, avec un couple articulaire maximal de 140 Nm, et existe en trois configurations : effecteur optionnel, pince standard, ou main dextre à 6 degrés de liberté pour des tâches de manipulation avancées. Côté perception, le T2 embarque des caméras binoculaires à la tête et à la taille, complétées par des caméras de poignet sur les versions haut de gamme, un réseau de microphones, des haut-parleurs et un LiDAR optionnel. Sa batterie de 48V/10Ah offre jusqu'à deux heures de marche continue à une vitesse maximale de 2 m/s. Parallèlement, Booster Robotics lance Booster Studio, une plateforme logicielle ouverte couvrant simulation, entraînement de politiques et déploiement sur robot réel, avec un support pour les modèles vision-langage-action (VLA), l'apprentissage par renforcement et l'apprentissage par imitation. L'enjeu principal tient au calcul embarqué : en réduisant la dépendance à une puissance de calcul externe, Booster mise sur une boucle perception-décision-action autonome, un point de friction classique pour les intégrateurs qui cherchent des robots déployables hors laboratoire. Booster Studio répond quant à lui directement au problème du "sim-to-real", souvent cité comme l'un des principaux goulots d'étranglement de la robotique incarnée actuelle. La vidéo de démonstration montrant chutes récupérées, sauts et coordination dynamique doit toutefois être lue avec prudence : ce type de séquence est généralement sélectionné et ne garantit pas une fiabilité en conditions réelles non contrôlées. Un signal plus solide vient du terrain de compétition : l'équipe THU Huoshen de l'université Tsinghua a conservé son titre à la RoboCup 2026 Humanoid League en Corée du Sud avec le précédent modèle Booster T1, confirmant une certaine maturité de la plateforme dans des contextes dynamiques non scénarisés. Booster T1 s'était déjà imposé comme référence académique low-cost dans les cercles de recherche et de compétition robotique. Le T2 vise à élargir cette base vers des usages commerciaux et industriels, en misant sur une approche ouverte et modulaire plutôt que sur un produit intégré verticalement, à la différence d'acteurs comme Tesla (Optimus) ou Figure. Il vient également se positionner face à Unitree, autre constructeur chinois disputant le même segment des plateformes humanoïdes accessibles aux développeurs. Aucun acteur français ou européen n'est mentionné dans cette annonce.

Chine/AsieActu
1 source
170arXiv cs.RO 

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde

Xiaomi Robotics a publié U0, un modèle multimodal autorégressif de 38 milliards de paramètres conçu pour unifier plusieurs tâches de génération liées à la robotique au sein d'un seul système. Décrit dans un article déposé sur arXiv, U0 traite la synthèse de contenus "incarnés" comme une extension directe des modèles de génération d'images et de vidéos fondationnels, en optimisant conjointement le texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée. Selon les auteurs, il s'agit du premier modèle capable de générer des scènes cohérentes en multi-vues pour plusieurs types de robots différents, et il introduit un mécanisme de transfert structuré et contrôlable permettant une édition fine tout en préservant la cohérence géométrique et la dynamique d'interaction. Les résultats rapportés indiquent que U0 dépasse GPT-Image-2.0 lors d'évaluations humaines sur la génération et le transfert de scènes incarnées, se classe premier sur le classement World Arena pour la génération vidéo incarnée, et fait passer le taux de succès hors distribution du modèle de manipulation pi0.5 de 36,9% à 63,2% sur des tâches de manipulation réelle jugées difficiles. Le code et les checkpoints sont mis à disposition sur le site de Xiaomi Robotics. L'enjeu principal ne se situe pas dans la démonstration visuelle mais dans l'usage de U0 comme moteur de données synthétiques pour l'entraînement de politiques robotiques. Le gain mesuré sur pi0.5, un modèle vision-langage-action tiers développé par Physical Intelligence, est le point le plus significatif: il suggère qu'un monde fondationnel bien conçu peut générer des données d'entraînement suffisamment réalistes pour améliorer la généralisation d'un VLA existant sur des tâches de manipulation réelles, et pas seulement sur des métriques internes. C'est une piste concrète pour réduire l'écart simulation-vers-réel qui freine encore le déploiement à grande échelle des robots humanoïdes et bras manipulateurs, en offrant une alternative à la collecte coûteuse de données physiques. Le travail part d'un constat classique dans le secteur: adapter un modèle fondationnel pré-entraîné avec des données robotiques limitées tend à dégrader les connaissances visuelles acquises lors du pré-entraînement à grande échelle. U0 cherche à préserver cette généralisation tout en l'adaptant aux contraintes des embodiments robotiques. Il se positionne face à des approches comme GR00T N2 de NVIDIA ou les modèles Pi de Physical Intelligence, dans une course où Xiaomi investit désormais explicitement la recherche en IA incarnée. Pour l'instant, la publication reste au stade recherche: code et poids sont ouverts, mais aucun déploiement produit ni pilote industriel n'est annoncé.

IA physiqueOpinion
1 source
171arXiv cs.RO 

Dépoussiérer la manipulation dextérique : une recette minimaliste d'apprentissage par renforcement guidé par retargeting

Des chercheurs ont publié REGRIND, un pipeline d'apprentissage par renforcement guidé par retargeting qui permet à des mains robotiques multi-doigts d'apprendre des tâches de manipulation dextre à partir d'une seule démonstration humaine. La méthode retranscrit le mouvement main-objet d'un humain vers une référence robotique qui préserve les relations spatiales et de contact entre la main et l'objet, puis entraîne une politique RL résiduelle en simulation pour suivre des points-clés centrés sur l'objet le long de cette référence. La politique obtenue est ensuite transférée directement sur le matériel physique, sans réentraînement, moyennant une identification système soignée des paramètres du robot. Testée sur deux mains robotiques multi-doigts différentes, l'approche produit des comportements fluides et proches du geste humain sur des tâches riches en contacts et en usage d'outils, notamment manier une paire de ciseaux et faire tourner un tournevis. Les travaux sont publiés sur arXiv (2607.11874), avec vidéos et code disponibles en ligne. L'intérêt de ce résultat tient à la difficulté propre de la manipulation dextre par rapport au contrôle locomoteur des humanoïdes, où la recette retargeting-puis-RL avait déjà fait ses preuves. Manipuler des objets suppose de réguler finement les modes de contact et les forces appliquées, un problème nettement plus contraignant que suivre une trajectoire de marche. En montrant qu'une seule démonstration humaine suffit à entraîner une politique transférable au réel, REGRIND propose une alternative frugale en données face aux approches dominantes du secteur, qui s'appuient sur de larges modèles vision-langage-action entraînés sur des volumes massifs de téléopération. Pour les équipes développant des mains robotiques destinées à des tâches d'usage d'outils, industrielles ou domestiques, cela ouvre une voie moins coûteuse en collecte de données pour atteindre un comportement dextre exploitable. L'étude s'inscrit dans la continuité des travaux récents sur le contrôle corps-entier des humanoïdes, où retargeting de mouvement humain et suivi par RL sont devenus une recette standard, mais que les auteurs jugent insuffisamment validée pour la manipulation contact-riche. Au-delà de la démonstration technique, les chercheurs ont mené des expériences matérielles systématiques pour identifier les facteurs qui déterminent la réussite du transfert simulation-vers-réel, en tirant des recommandations pratiques pour quiconque veut appliquer ce type d'apprentissage par retargeting à des scénarios de contact. Le code et les vidéos publiés doivent permettre à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
172arXiv cs.RO 

Structure accrue, pas capacité accrue : représentations centrées sur les objets pour l'apprentissage par imitation visuomotrice

Des chercheurs ont testé, sur le simulateur ManiSkill3 et la tâche PickCube-v1, si des représentations visuelles structurées par objet apportent un réel avantage face aux encodeurs classiques utilisés dans les politiques d'imitation visuomotrice pour la manipulation robotique. En gardant fixes la politique, le token d'objectif, le rendu et la calibration, et en ne changeant que l'encodeur visuel, une représentation object-centric SPOT (DINO ViT-B/16 combiné à un mécanisme de Slot Attention, figé, sans fine-tuning) atteint un taux de succès de 55,0±2,9%, contre 32,6±1,5% pour une référence DINO à embedding global dense, soit un gain de 22,4 points. Fait notable, une grille de patches denses avec seize fois plus de tokens ne fait pas mieux que l'embedding global seul. En ajoutant un objectif spatial 2D explicite et un rendu en résolution native, le système complet grimpe à 68,7±4,2%, juste en dessous d'une borne supérieure "oracle" 3D privilégiée à 71,7±4,1%. Une taxonomie automatisée des échecs cinématiques distingue ensuite les erreurs de précision spatiale ("Near-Miss") des erreurs de suivi d'objet ("No-Grasp"), et montre que l'ancrage spatial réduit les premières sans affecter les secondes ; la même taxonomie, transposée à la tâche plus difficile StackCube-v1, pointe l'occlusion comme principal facteur limitant. Ces résultats apportent une preuve empirique à une hypothèse importante pour le secteur : ce n'est pas la capacité brute d'un encodeur visuel (plus de tokens, plus de résolution de features) qui détermine la performance en manipulation, mais la structuration de l'information en objets discrets. Pour les équipes qui conçoivent des politiques VLA ou des pipelines d'apprentissage par imitation, cela suggère qu'investir dans des représentations object-centric peut être plus rentable que d'augmenter la taille des backbones visuels, et que le goulot d'étranglement réel se situe souvent dans le suivi d'objet sous occlusion plutôt que dans la précision géométrique pure. Ce travail s'inscrit dans la lignée des recherches sur les représentations par slots (Slot Attention) appliquées à la robotique, en s'appuyant sur des encodeurs auto-supervisés comme DINO, déjà largement adoptés dans la communauté vision-langage-action. L'étude reste pour l'instant limitée à la simulation (ManiSkill3, tâches PickCube et StackCube) avec des encodeurs figés, sans fine-tuning ni validation en conditions réelles ; les auteurs identifient l'occlusion comme prochain axe de travail prioritaire pour combler l'écart avec la borne oracle.

RecherchePaper
1 source
173arXiv cs.RO 

De l'IA du monde à l'IA incarnée : une feuille de route pour l'intelligence physique en monde ouvert

Publié sur arXiv le 14 juillet 2026 (arXiv:2607.11689), cet article de synthèse dresse un état des lieux des modèles d'action pour la robotique et propose une feuille de route vers ce que les auteurs nomment le « cerveau incarné » (embodied brain). Le texte retrace l'évolution des politiques vision-langage-action (VLA) vers les World Action Models (WAM), des systèmes qui relient une intervention candidate à ses conséquences prédites avant exécution. Trois failles couplées freinent le secteur selon les auteurs: des espaces d'action et cibles de prédiction incompatibles d'un modèle à l'autre, une absence de standardisation des jeux de données et des protocoles d'évaluation, et des interfaces d'exécution trop fermées pour permettre la réutilisation entre systèmes. Plutôt qu'un nouveau modèle entraîné, le papier propose une architecture cible: le cerveau incarné intégrerait un contexte multimodal, comparerait plusieurs interventions candidates, puis émettrait des requêtes de transition d'état ou de capacité plutôt que des commandes moteur directes, les WAM servant de prototypes pour ces fonctions prédictives. Pour les intégrateurs et décideurs en robotique, ce travail nomme un problème concret: chaque laboratoire, qu'il s'agisse de Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure avec Helix, construit son propre espace d'action et son propre format de données, rendant quasi impossible la comparaison directe des performances ou la réutilisation d'un modèle entre un bras robotique et un humanoïde. En proposant des contrats partagés entre modèles, données, tâches et morphologies, et un post-entraînement en boucle fermée transformant les interactions vérifiées en expérience réutilisable, la feuille de route vise à sortir la robotique généraliste du stade de la démonstration isolée. C'est une contribution méthodologique plus qu'un résultat expérimental: elle ne prouve pas qu'un tel système fonctionne à l'échelle, mais formalise ce qui manque pour y parvenir, un constat qui recoupe les critiques récurrentes sur l'écart entre vidéos de démonstration sélectionnées et déploiements robustes en conditions réelles. Le papier s'inscrit dans la continuité des travaux sur les modèles d'action et les world models, qui ont convergé avec l'essor des VLA avant que des approches hybrides, combinant prédiction du monde et politique d'action, ne donnent naissance aux WAM. Les auteurs ne mentionnent aucun déploiement propre mais positionnent leur cadre face aux systèmes existants de Physical Intelligence, NVIDIA et Figure, sans citer d'acteur français ou européen dans cette revue. La suite annoncée est l'adoption progressive de ces contrats partagés par la communauté de recherche, préalable jugé nécessaire à l'émergence d'agents physiques réellement adaptatifs et auto-améliorants hors laboratoire.

RecherchePaper
1 source
174arXiv cs.RO 

EgoSteer : un système complet pour la manipulation dextre pilotable à partir de vidéos égocentriques

Des chercheurs publient EgoSteer, un système complet destiné à rendre les mains robotiques dextres pilotables par instructions en langage naturel, à partir de vidéos égocentriques humaines (arXiv:2607.09701). Le dispositif repose sur trois briques : EgoSmith, un pipeline de données qui a curé 9,6 mille heures de vidéos égocentriques filmées en conditions réelles pour constituer un corpus de pré-entraînement de haute qualité, avec un débit neuf fois supérieur et une précision meilleure que les méthodes précédentes ; une pile robotique unifiée gérant téléopération et correction humaine en boucle ; et EgoSteer lui-même, un modèle vision-langage-action (VLA) enrichi d'un modèle du monde, entraîné sur une infrastructure optimisée. Le système exécute des instructions en langage libre sur plus de 40 tâches distinctes, avec récupération après échec, dextérité fine et capacité de généralisation. Après un pré-entraînement sur données humaines suivi d'un ancrage par post-entraînement robotique et d'un raffinement DAgger, le modèle s'adapte en few-shot à des tâches longues et complexes comme le pliage de boîtes, avec un taux de réussite supérieur à 75% sur deux plateformes robotiques différentes. Le code, les données et le modèle sont mis en open-source sur egosteer.github.io. Ce travail s'attaque directement au principal goulot d'étranglement des mains robotiques dextres : l'absence de données de démonstration à grande échelle, alignées avec le langage et précises au niveau de l'action. En démontrant qu'un pré-entraînement massif sur vidéos humaines non robotiques peut ensuite être ancré efficacement sur robot réel avec relativement peu de données, l'équipe apporte un signal concret sur le transfert vidéo-vers-robot à l'échelle, un sujet central pour les intégrateurs et laboratoires qui cherchent à réduire le coût de collecte de démonstrations téléopérées. La généralisation cross-embodiment et la récupération après échec restent des points faibles connus des VLA actuels ; les résultats annoncés ici, à évaluer au-delà des tâches et conditions choisies par les auteurs, vont dans le sens d'un rapprochement entre démonstrations en laboratoire et usage réel. Le manque de données dextres de qualité freine depuis plusieurs années l'extension des architectures VLA, popularisées par des modèles généralistes comme Pi-0 ou GR00T, au-delà des bras et pinces simples vers des mains multi-doigts. EgoSteer s'inscrit dans cette course à l'échelle des données, aux côtés d'efforts similaires chez les acteurs de l'humanoïde et de la manipulation dextre. L'ouverture complète du code, du modèle et du jeu de données constitue la prochaine étape logique pour permettre une réplication indépendante des résultats annoncés.

IA physiqueActu
1 source
17536Kr 

Robot humanoïde : Zhiji Dongli boucle un tour pré-IPO de 200 millions de dollars, valorisation à 15 milliards de yuans

Le fabricant chinois de robots humanoïdes LimX Dynamics (逐际动力) a bouclé un tour de financement pre-IPO d'environ 200 millions de dollars, portant sa valorisation post-money à 15 milliards de yuans (environ 2,1 milliards de dollars). Les investisseurs incluent IDG Capital, le fabricant de verre Lens Technology, GGG Group, Redstone VC, Huashan Capital et le fonds public de Hefei Binhu, aux côtés du fonds émirati Stone Venture qui a réinvesti sur plusieurs tours, ainsi que d'anciens actionnaires comme Oasis Capital, Cornerstone Capital, NIO Capital et Shangqi Capital qui ont sursouscrit. Ce tour porte le total levé par l'entreprise à 400 millions de dollars sur six mois. LimX a achevé sa transformation en société par actions en mars 2026 et aurait déjà enclenché une procédure d'introduction en bourse début 2026. Les fonds serviront à industrialiser sa technologie de fusion "cerveau/cervelet" et à déployer plusieurs milliers d'unités autonomes, notamment au Moyen-Orient, en Europe et en Asie. Ce tour illustre la bascule du secteur humanoïde chinois d'une logique de démonstration vers une logique de volumes commerciaux : LimX revendique plusieurs milliers de commandes cumulées, plus de la moitié à l'export, un chiffre à prendre avec prudence tant que les livraisons effectives ne sont pas détaillées poste par poste. La mise en avant de FluxVLA Engine, une plateforme open-source destinée aux développeurs pour standardiser l'entraînement de modèles VLA (vision-langage-action), traduit un pari stratégique différent des approches "un seul modèle généraliste" : LimX mise sur une multitude de modèles verticaux spécialisés, un choix qui pourrait démocratiser l'accès à l'entraînement de robots embarqués si l'écosystème de développeurs suit réellement. Sur le plan produit, LimX a lancé en mai 2026 Luna, un humanoïde de 160 cm à 27 degrés de liberté capable de démarches de mannequin et de chorégraphies, livré en moins d'un mois à des clients chinois et étrangers. Le même mois, TRON 2, robot modulaire reconfigurable entre bras double, bipède et roues-pattes, a été proposé aux chercheurs et industriels. L'architecture technique de l'entreprise repose sur trois couches : System 0 pour la motricité globale, System 1 pour les capacités VLA du robot, et System 2, le système d'exploitation cognitif COSA combinant modèles de langage et modèles du monde.

UELimX Dynamics annonce vouloir deployer plusieurs milliers d'unites en Europe, ce qui pourrait accroitre la concurrence chinoise sur le marche europeen de la robotique humanoide sans qu'un partenaire ou site europeen precis soit encore identifie.

Chine/AsieActu
1 source
176arXiv cs.RO 

DemoBridge : une boîte à outils de simulation en boucle pour le retargeting de démonstrations humaines en vue unique

Une équipe de l'université KU Leuven (Belgique) publie DemoBridge, un outil qui transforme un enregistrement vidéo unique, en stéréo RGB, d'une démonstration manuelle humaine en une trajectoire de bras robotique exécutable et validée par simulation physique. Décrit dans un preprint arXiv daté du 13 juillet 2026 (arXiv:2607.09519), le système repose sur un planificateur unique conscient des collisions qui optimise la trajectoire articulaire complète en une seule passe, en tenant compte simultanément des poses de préhension alternatives, des collisions du bras et de l'objet saisi, et de la fidélité au geste démontré. Un simulateur physique tourne en boucle pendant la génération, valide chaque phase et revient en arrière en cas d'échec plutôt que d'abandonner la démonstration : le geste est replanifié, pas jeté. Le timing de la prise est déduit automatiquement, et les modules de perception, le modèle de robot et les étapes du pipeline sont interchangeables par configuration. L'équipe a testé l'ensemble du pipeline sur trois tâches réelles et évalué le planificateur seul sur un benchmark synthétique contrôlé. Le code est disponible sur le GitLab de KU Leuven. L'enjeu visé est le fossé d'incarnation ("embodiment gap") : un bras robotique, avec ses longs segments articulés, occupe bien plus de volume de collision qu'une main humaine, si bien que la cinématique inverse appliquée telle quelle à une pose de préhension démontrée n'a souvent aucune solution sans collision. Ce verrou freine l'apprentissage par démonstration à bas coût, où une simple vidéo caméra unique remplacerait la téléopération coûteuse utilisée pour collecter des données d'entraînement de modèles vision-langage-action comme Pi-0 ou GR00T N2. En doublant chaque démonstration retargetée d'un rollout de simulation exploitable pour l'apprentissage de politiques, DemoBridge s'inscrit directement dans la course à des données de manipulation moins chères à générer. Il s'agit d'un travail académique préliminaire, non d'un produit commercialisé : l'évaluation reste limitée à trois tâches réelles et un benchmark synthétique, sans déploiement industriel annoncé. Le choix d'une vue unique plutôt qu'un rig multi-caméras vise justement l'accessibilité, un axe que suivent aussi des laboratoires concurrents cherchant à réduire le coût de collecte de données d'imitation face aux approches par téléopération dominantes chez les acteurs américains du secteur.

UEUne équipe universitaire belge (KU Leuven) publie en open-source un outil de retargeting de démonstrations, réduisant potentiellement le coût de collecte de données d'apprentissage par imitation pour les laboratoires robotiques européens.

FR/EU ecosystemePaper
1 source
177Interesting Engineering 

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots

La société chinoise Robbyant a dévoilé LingBot-Depth 2.0, une nouvelle génération de modèles de perception spatiale pour robots, accompagnée d'un modèle de vision associé baptisé LingBot-Vision. LingBot-Depth 2.0 s'appuie sur la version précédente, qui avait introduit la technique de Masked Depth Modeling (MDM) pour améliorer la détection de profondeur sur les surfaces transparentes et réfléchissantes. Entraîné sur 150 millions d'échantillons, le nouveau modèle obtient les meilleurs résultats sur 12 des 16 benchmarks de complétion de profondeur testés. Dans les scénarios de perte de profondeur sévère, l'erreur est divisée par plus de deux par rapport au modèle précédent, le score RMSE passant de 0,132 à 0,062. Le modèle progresse aussi sur la détection des surfaces vitrées et des miroirs, un point faible classique des caméras de profondeur. LingBot-Vision, entraîné sur 160 millions d'images (un jeu de données plus restreint que ceux des modèles concurrents), utilise pour la première fois la "structure de bordure" comme objectif de pré-entraînement, permettant une localisation des contours au niveau sub-pixel et un suivi stable des arêtes d'objets sur des séquences vidéo. Pour l'industrie robotique, cette annonce illustre la poursuite de la course aux modèles de perception spatiale comme brique fondamentale des systèmes d'IA incarnée, aux côtés des modèles d'action type VLA (vision-langage-action) tels que Pi-0 ou GR00T N2. Une perception de profondeur fiable sur verre et surfaces réfléchissantes reste un obstacle concret pour la navigation en environnement intérieur (entrepôts, bureaux, hôpitaux), là où les caméras stéréo et LiDAR classiques échouent régulièrement. La certification obtenue auprès du Depth Vision Laboratory d'Orbbec, avec des tests sur les caméras stéréo 3D Gemini 330, apporte une validation industrielle plus tangible qu'une simple annonce marketing, même si les chiffres de benchmark restent ceux communiqués par Robbyant lui-même et mériteraient une vérification indépendante. Le partenariat avec Orbbec, fabricant reconnu de capteurs 3D, va au-delà de la validation logicielle : il s'étend au matériel, avec l'intégration d'une version personnalisée de LingBot-Depth dans le dispositif RGB-D EGO de la nouvelle plateforme de collecte de données "Robot-Free" d'Orbbec, conçue pour capturer des données d'entraînement sans mobiliser de robot physique. Robbyant annonce qu'une version commerciale avancée du modèle sera intégrée à cette plateforme dans de futures mises à jour, avec pour objectif de fournir une base de données plus précise et stable pour l'entraînement des systèmes d'IA incarnée. Le mouvement s'inscrit dans une dynamique plus large de fournisseurs chinois de modèles de fondation pour la robotique cherchant à s'imposer comme briques de perception standard, à un moment où la course humanoïde et logistique internationale accélère la demande de systèmes de perception robustes et bon marché.

Chine/AsieActu
1 source
Dexmal lance MaaS incarné et DexOS, résolvant le passage à l'échelle des modèles en conditions réelles
178Pandaily 

Dexmal lance MaaS incarné et DexOS, résolvant le passage à l'échelle des modèles en conditions réelles

Dexmal, anciennement connue sous le nom de Yuanli Lingji, a dévoilé lors de sa première conférence développeurs Action une suite complète de produits d'IA incarnée destinée à répondre au problème structurel de la mise à l'échelle des modèles fondationnels sur du matériel robotique hétérogène. Au centre de l'annonce, le modèle DM0.5 voit ses paramètres doubler pour atteindre 4 milliards, entraîné sur 150 000 heures de données dont 50 000 heures issues de robots réels avec annotation 3D au millimètre près des points clés de la main, complétées par 100 000 heures d'enregistrements d'opérations humaines à la première personne. Trois choix d'architecture distinguent ce modèle : une mémoire native supportant jusqu'à 60 secondes de contexte via une couche d'abstraction intégrée au pré-entraînement, un système de raisonnement à deux niveaux qui sépare la planification des tâches de la génération de mouvement avec un entraînement contrefactuel censé garantir une réelle compréhension des instructions, et un alignement des actions par programmation dynamique contrainte pour normaliser des trajectoires exécutées à des vitesses différentes. Autour de ce modèle, Dexmal lance DexOS, présenté comme l'équivalent d'un système d'exploitation standardisé pour la robotique avec un protocole ouvert baptisé ECP, permettant aux développeurs d'intégrer leur modèle une seule fois puis de le déployer sur plusieurs plateformes matérielles. La plateforme DexDev regroupe DFOL 2.0, un système d'apprentissage par renforcement basé sur un modèle du monde (DW0.5) qui réduirait de 60% le volume de données d'entraînement robotique réel nécessaire et de 40% les coûts associés, ainsi qu'un service MaaS d'inférence facturé à l'usage. Dexmal revendique une latence d'inférence de 50 millisecondes et la possibilité d'effectuer du post-entraînement sur une simple carte grand public RTX 4090. Deux nouvelles plateformes matérielles, Apex pour l'industrie et Ferrata pour la logistique, viennent s'ajouter au bras double existant Mint. L'enjeu réel derrière cette annonce est le problème dit du N fois M : sans couche de standardisation, chaque modèle doit être réadapté à chaque configuration matérielle, ce qui freine toute diffusion à l'échelle. En misant sur un écosystème ouvert de développeurs plutôt que sur une intégration verticale fermée à la manière de Tesla ou Figure, Dexmal cherche à devenir la couche logicielle commune du secteur plutôt qu'un fournisseur de robots parmi d'autres. Le fondateur Tang Wenbin a d'ailleurs posé le vrai critère de réussite : que les développeurs choisissent DM0.5 plutôt que les alternatives open source, un test que les modèles précédents de l'entreprise n'avaient pas franchi selon lui. La promesse de réduction des données réelles nécessaires grâce à la simulation dans un modèle du monde touche directement au fossé sim-to-real qui limite encore le déploiement des VLA en conditions réelles, mais ces gains restent pour l'instant des chiffres communiqués par l'entreprise, sans validation indépendante. Le rebranding depuis Yuanli Lingji s'inscrit dans la vague d'entreprises chinoises d'IA incarnée cherchant à se positionner face aux acteurs américains comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), ainsi qu'aux humanoïdes concurrents tels qu'Optimus. Aucun acteur français ou européen n'apparaît dans cette annonce. La suite dépendra de l'adoption réelle du protocole ECP par des développeurs tiers et de déploiements pilotes concrets sur les nouvelles plateformes Apex et Ferrata, dont aucun calendrier précis n'a été communiqué.

IA physiqueActu
1 source
Nvidia devient premier partenaire mondial de simulation tactile, nouveau financement de centaines de millions et commandes multipliées par quatre au premier semestre
17936Kr 

Nvidia devient premier partenaire mondial de simulation tactile, nouveau financement de centaines de millions et commandes multipliées par quatre au premier semestre

La société pékinoise Tashan Technology (他山科技) a bouclé un tour de série B de plusieurs centaines de millions de yuans, avec la participation de Joyson Electronics, Taiping Innovation, AUX, Pengling, Lavender Hill Capital Partners (LHCP) et Hongshan Capital, ainsi qu'un réinvestissement des actionnaires historiques Daoshi Technology et Binfu Capital. Les fonds serviront à l'itération des capteurs et puces tactiles, au déploiement de solutions par secteur et à la construction d'une plateforme d'entraînement tactile. Fondée en 2017, l'entreprise développe une pile complète de perception tactile pour robots, du silicium à l'application : une équipe issue de Tsinghua et de l'université de Manchester, avec Steve Furber, co-inventeur de l'architecture ARM, comme chercheur en chef, et un laboratoire commun avec Manchester créé dès 2019. Son produit phare est une puce mixte analogique-numérique basée sur un réseau de neurones à impulsions, conçue pour un traitement tactile embarqué à faible latence ; une nouvelle génération vient d'être gravée avec lancement prévu au troisième trimestre 2026. Les capteurs TS-F (bout de doigt, résolution de force de 0,01 N, reconnaissance de plus de 30 matériaux sans contact) et TS-E (pince) ont vu leur fréquence de mesure multipliée par 3 à 4 cette année. Deux centres de collecte de données ont ouvert à Pékin et dans le Hubei en mars et mai 2026, et la société se présente comme premier partenaire mondial de simulation tactile de Nvidia Isaac Sim, avec un moteur open source sur MuJoCo. Selon l'entreprise, les commandes de capteurs tactiles atteignaient fin mai déjà quatre fois le chiffre d'affaires annuel 2025, pour plus de 180 clients incluant Galbot, Xingdong Jiyuan ou BrainCo, et une part de marché revendiquée supérieure à 80 % sur les capteurs tactiles pour mains robotiques humanoïdes. Ces chiffres, invérifiés indépendamment, illustrent néanmoins un basculement réel du secteur : le taux d'équipement tactile des mains articulées serait passé d'environ 20 % à plus de 60 % en un an, un rythme d'adoption rare pour un composant matériel. Cela confirme une hypothèse qui circulait dans l'IA incarnée sans preuve solide jusqu'ici : sans retour de force, la boucle perception-action ne se referme pas sur des tâches de manipulation fine, et la seule vision ne suffit pas à saisir des objets fragiles ou déformables. Que des fournisseurs de modèles achètent désormais des capteurs en volume pour entraîner leurs systèmes tactiles renforce l'idée que la donnée tactile devient une ressource aussi disputée que la vidéo de démonstration, avec des conséquences directes de coût et de fiabilité pour les intégrateurs qui équipent des mains robotiques. Le partenariat le plus marquant reste la collaboration avec Richard Sutton, lauréat du prix Turing et figure fondatrice de l'apprentissage par renforcement, autour d'un projet baptisé "jardin d'enfants pour robots", visant à faire apprendre aux machines par essai-erreur tactile en environnement réel. Tashan prévoit que son activité robotique dépassera l'automobile de 3 à 4 fois en 2026, pour environ deux tiers du chiffre d'affaires, et anticipe une vague d'algorithmes et de modèles tactiles commerciaux à partir de 2027, un calendrier qui reste, comme les autres métriques, à confirmer par les livraisons effectives.

Chine/AsieActu
1 source
NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots
180Interesting Engineering 

NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots

NVIDIA et Hugging Face élargissent leur collaboration autour de LeRobot, la plateforme robotique open source de Hugging Face, avec l'ajout de deux nouveaux outils. Le premier est NVIDIA Isaac GR00T 1.7, présenté par NVIDIA comme son premier modèle de fondation robotique vision-langage-action (VLA) ouvert et commercialement exploitable, conçu pour simplifier le post-entraînement et le déploiement sur différents designs de robots. Le second est NVIDIA Isaac Teleop, un framework open source permettant de collecter des données d'entraînement de haute qualité via des démonstrations humaines avec des dispositifs de contrôle externes, dans un format standardisé et partageable au sein de l'écosystème LeRobot. Un troisième modèle, Cosmos 3, dédié à la génération de données synthétiques et à la simulation d'environnements, sera intégré ultérieurement. Ces annonces s'appuient sur des briques déjà disponibles sur LeRobot, dont un jeu de données ouvert de plus de 350 000 trajectoires robotiques réelles et simulées et 57 millions d'exemples de préhension, ainsi que les outils de simulation Isaac Sim et Isaac Lab, l'environnement Isaac Lab-Arena pour l'entraînement de politiques, et l'intégration du calculateur embarqué Jetson Thor sur le robot humanoïde Reachy 2. NVIDIA a par ailleurs récemment lancé Halos for Robotics, une plateforme de sécurité complète associant matériel, logiciel, capteurs et outils de validation pour les robots autonomes évoluant aux côtés d'humains. Pour l'industrie robotique, l'enjeu affiché est de reproduire pour la robotique la dynamique d'ouverture qui a accéléré le développement en IA logicielle, où le partage de modèles et de jeux de données a fait baisser les coûts d'entrée. NVIDIA met en avant la connexion entre sa communauté de plus de trois millions de développeurs robotiques et les seize millions de développeurs IA de Hugging Face, dans le but de standardiser un flux de travail encore fragmenté, entre collecte de données coûteuse, simulation, puissance de calcul et validation. Si ces chiffres de communauté restent des éléments de communication à prendre avec prudence, l'initiative traduit une tendance de fond: la bascule des modèles VLA de la démonstration marketing vers des briques réutilisables et déployables par des tiers, un test concret de la promesse d'un "sim-to-real" et d'une généralisation multi-robots qui reste à prouver à grande échelle. L'initiative prolonge le partenariat déjà engagé entre les deux entreprises autour de LeRobot et des outils de simulation NVIDIA Isaac, dans un secteur où les modèles fondation pour la robotique se multiplient face à des approches concurrentes comme Pi-0 ou GR00T N2. Les prochaines étapes attendues concernent l'arrivée effective de Cosmos 3 sur la plateforme et l'élargissement du catalogue de robots et de tâches supportés via Isaac Teleop et le jeu de données partagé.

UELe robot humanoïde français Reachy 2 (Pollen Robotics) intègre le calculateur embarqué Jetson Thor de NVIDIA dans le cadre de cet écosystème LeRobot.

IA physiqueActu
1 source
WristMimic : contrôle corps entier de l'humanoïde par manipulation guidée au poignet
181arXiv cs.RO 

WristMimic : contrôle corps entier de l'humanoïde par manipulation guidée au poignet

Publié en juillet 2026 sur arXiv, WristMimic est un framework de contrôle corps entier pour robots humanoïdes qui transfère des démonstrations humaines de manipulation vers une simulation physique. Plutôt que de suivre intégralement la pose de la main, la méthode sépare le corps et le poignet, guidés cinématiquement, des doigts, qui apprennent leurs gestes de préhension à partir du suivi de l'objet et du résultat des contacts. Le poignet sert de charnière entre les deux régimes : peu soumis aux forces de contact, il reste suivable fidèlement tout en plaçant la main dans une configuration de prise atteignable. Des contraintes de réinitialisation et une priorisation des récompenses au poignet fiabilisent ce positionnement ; les auteurs annoncent des performances égales ou supérieures aux méthodes à supervision complète des doigts, avec un retargeting indépendant de la morphologie de la main. Le problème ciblé est connu en contrôle humanoïde : une trajectoire de main en position seule ne renseigne pas les forces de contact nécessaires à une prise réussie, et imposer un suivi complet des doigts tend à surcontraindre des comportements qui doivent rester riches en contacts, ce qui fragilise la manipulation fine. En découplant mouvement libre et manipulation, WristMimic s'inscrit dans la recherche sur l'imitation à grande échelle pour l'IA incarnée, sans dépendre d'une capture de main parfaite. Pour l'industrie, l'argument concret est qu'une approche agnostique à la morphologie de la main pourrait réduire le travail d'adaptation quand un intégrateur change de main dextérisée, un problème récurrent tant les architectures varient d'un fabricant humanoïde à l'autre. Ce travail s'inscrit dans la lignée des méthodes de contrôle guidé par la cinématique humaine pour humanoïdes, qui cherchent depuis deux ans à rapprocher téléopération et apprentissage par renforcement. L'abstract ne mentionne aucun déploiement sur robot réel ni partenariat industriel : il s'agit pour l'instant d'une validation en simulation, une contribution de recherche plutôt qu'un produit. Les suites logiques seraient une validation sur plateforme humanoïde physique et une comparaison avec les pipelines de téléopération des acteurs du secteur, qu'il s'agisse des humanoïdes commerciaux ou des modèles VLA généralistes comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)
182Pandaily 

LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)

Ant Group, via sa division robotique LingBot, a dévoilé LingBot-Depth 2.0, un modèle de perception spatiale construit sur un nouveau modèle de vision baptisé LingBot-Vision, présenté comme le premier modèle de fondation vision nativement conçu pour la perception spatiale en IA incarnée. L'entreprise revendique douze résultats inédits sur des benchmarks publics et privés, une affirmation à prendre avec précaution puisqu'elle émane de son propre communiqué. Avec environ 1,1 milliard de paramètres, soit environ un septième des 7 milliards de DINOv3 de Meta, et moins d'un tiers de son volume d'entraînement, LingBot-Vision affirme surpasser DINOv3 sur le benchmark d'estimation de profondeur NYUv2. Le modèle cible trois défauts classiques de l'estimation de profondeur: le flou des contours, la détection des petits objets et le bruit sur les longues distances. LingBot-Depth 2.0 revendique une clarté de contours suffisante pour de la planification de trajectoire de bras robotique au millimètre près, une meilleure détection des câbles et fils fins, un filtrage du bruit pour les obstacles distants, et des cartes de profondeur stables face aux surfaces réfléchissantes, objets transparents, obscurité et environnements encombrés. Le modèle et son code sont disponibles en open source sur Hugging Face, ModelScope et GitHub, avec un rapport technique publié sur arXiv. Ant Group a aussi noué un partenariat avec ORBBEC, fabricant chinois de capteurs 3D, dont le laboratoire Depth Vision Lab a validé le modèle; la collaboration produit un nouveau dispositif de collecte EGO-RGBD, une intégration SDK pour le matériel ORBBEC, et une future caméra intégrée sans réglage algorithmique complexe. La sortie illustre un pari de plus en plus partagé en IA incarnée: les modèles de vision entraînés sur des images web généralistes, comme DINOv3, reconnaissent des objets mais ignorent leur géométrie précise, ce qui limite leur usage pour des robots devant saisir, éviter ou manipuler des objets réels. En intégrant la compréhension spatiale dès l'entraînement, LingBot-Vision s'attaque à l'écart entre perception "de spectateur" et perception "d'acteur", un enjeu central pour les modèles vision-langage-action qui pilotent bras robotiques et humanoïdes. Le passage du papier de recherche à un partenariat matériel concret avec ORBBEC, plutôt qu'une simple démonstration, est le signal le plus tangible pour les intégrateurs: un début de commercialisation réelle plutôt qu'un prototype isolé. Gérer nativement les cas difficiles, surfaces réfléchissantes, câblage fin, objets transparents, est précisément ce qui bloque aujourd'hui le déploiement en environnement réel non contrôlé. Ant Group, mieux connu pour Alipay, a multiplié ces derniers mois les investissements en robotique et IA incarnée via LingBot, dans un contexte de compétition intense entre laboratoires chinois et américains sur les modèles de fondation pour robots. La comparaison affichée avec DINOv3, modèle phare de Meta, positionne explicitement l'entreprise face aux géants américains sur la perception, pendant que d'autres acteurs, Figure AI avec Figure 03, Tesla avec Optimus, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Google DeepMind avec Helix, se concentrent davantage sur les modèles d'action et le contrôle moteur. LingBot-Vision se positionne ainsi comme une brique de perception complémentaire, potentiellement intégrable en amont de ces systèmes. Le partenariat avec ORBBEC laisse présager un déploiement progressif dans les prochains mois, avec l'arrivée annoncée d'une caméra grand public intégrant directement le traitement 3D, un jalon qui déterminera si les gains annoncés sur benchmarks se traduisent en performance réelle chez les intégrateurs industriels.

IA physiqueActu
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte
183NVIDIA Blog Robotics 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte

NVIDIA et Hugging Face annoncent l'intégration du modèle NVIDIA Isaac GR00T 1.7 et du framework NVIDIA Isaac Teleop dans LeRobot, la bibliothèque open source de Hugging Face pour la robotique, avec l'arrivée prochaine de NVIDIA Cosmos 3, un modèle monde pour l'IA physique. Isaac Teleop capture des démonstrations humaines via des dispositifs externes dans des formats standardisés, directement dans LeRobot, pour constituer et partager des jeux de données. Isaac GR00T 1.7, présenté par NVIDIA comme le premier modèle fondation robotique open source et commercialement exploitable, facilite le post-entraînement et le déploiement via les workflows LeRobot sur de nouvelles morphologies de robots, avec des benchmarks publiés. Ces briques s'appuient sur des ressources déjà connectées à LeRobot: le plus grand jeu de données open source d'IA physique, téléchargé plus de 15 millions de fois, avec plus de 350 000 trajectoires réelles et simulées et 57 millions de prises (grasps); les frameworks de simulation Isaac Sim et Isaac Lab; Isaac Lab-Arena, intégré au LeRobot Environment Hub pour prototyper des environnements et entraîner des politiques généralistes comme GR00T, Pi ou SmolVLA; et l'intégration de Jetson Thor avec le robot humanoïde open source Reachy 2 pour déployer des modèles VLA (vision-langage-action). Thomas Wolf, cofondateur et chief science officer de Hugging Face, décrit cette collaboration comme un moyen de faire passer la recherche avancée à un stade où la communauté peut l'étudier, l'adapter et la faire évoluer. Pour les intégrateurs et équipes R&D, l'enjeu est de standardiser un pipeline jusque-là fragmenté, collecte de données, entraînement, évaluation, déploiement, en connectant les 3 millions de développeurs robotique de NVIDIA aux 16 millions de builders IA de Hugging Face. Cela réduit le coût d'entrée pour tester des modèles VLA sur du matériel réel sans dépendre d'une pile propriétaire fermée. La mise en avant du caractère "commercialement viable" de GR00T 1.7 tranche avec des modèles concurrents (Pi de Physical Intelligence, Helix de Figure) souvent montrés en démonstration mais rarement publiés en open source avec benchmarks vérifiables. Coupler cela à un futur modèle monde comme Cosmos 3, censé générer des données synthétiques quand les données réelles sont trop chères ou rares à collecter, répond directement à l'un des goulots d'étranglement les plus documentés du secteur humanoïde. Cette annonce prolonge un partenariat plus ancien entre NVIDIA et Hugging Face autour de LeRobot, devenu une référence pour le partage ouvert de données et de politiques robotiques. Elle s'inscrit dans la stratégie de verticalisation physical AI de NVIDIA, de la simulation (Isaac Sim, Isaac Lab) au calcul embarqué (Jetson Thor) en passant par les modèles fondation et, prochainement, les modèles monde. Elle positionne NVIDIA face à des acteurs misant sur des piles intégrées fermées, comme Figure ou Physical Intelligence, en jouant la carte de l'infrastructure ouverte et mutualisée. Aucun acteur français n'apparaît directement, mais Reachy 2 est développé par Pollen Robotics, racheté par Hugging Face, ce qui donne une visibilité indirecte à cet acteur français dans l'écosystème. Les prochaines étapes annoncées restent pour l'instant limitées à la sortie de Cosmos 3 dans LeRobot, sans calendrier de déploiement industriel précisé.

UEImpact indirect: Reachy 2, developpe par Pollen Robotics (racheté par Hugging Face), gagne en visibilité via l'integration Jetson Thor, mais aucun acteur francais n'est directement implique dans cette annonce NVIDIA/Hugging Face.

IA physiqueActu
1 source
EVA-Client : framework unifié de collecte, d'inférence et de déploiement pour politiques incarnées sur robots réels
184arXiv cs.RO 

EVA-Client : framework unifié de collecte, d'inférence et de déploiement pour politiques incarnées sur robots réels

Un nouveau framework open-source baptisé EVA-Client vient formaliser une brique jusqu'ici bricolée maison par chaque laboratoire de robotique manipulatrice : le pont entre un serveur d'inférence de politique et le robot physique. Publié sur arXiv début juillet 2026, l'outil unifie en un seul code base les trois étapes critiques de la boucle d'itération sur robot réel, déploiement, collecte de données et évaluation. Son architecture découple explicitement trois couches orthogonales, les backends robots, les stratégies d'inférence et les middlewares de transport, de sorte qu'ajouter un nouveau bras ou un nouvel algorithme ne touche qu'une seule couche du système. EVA-Client propose aussi trois modes d'exécution inspectables, Debug, Collect et Eval, allant de la simulation en boucle ouverte au contrôle temps réel continu. Surtout, chaque run d'évaluation enregistre automatiquement des rollouts complets au format prêt pour l'entraînement, avec logs exhaustifs et un visualiseur de comparaison côte à côte, transformant chaque test en donnée réutilisable plutôt qu'en simple observation perdue. Le framework consolide enfin les principales stratégies d'inférence temps réel du secteur, exécution synchrone et asynchrone, lissage temporel façon ACT, Real-Time Chunking, et une base asynchrone naïve servant de référence, derrière une seule interface de configuration. Pour les équipes qui entraînent des politiques d'imitation ou des modèles VLA (vision-language-action), ce type d'infrastructure comble un angle mort réel : la littérature regorge de nouvelles architectures de politiques, mais la mise en production sur robot réel reste souvent un patchwork non reproductible, ce qui complique les comparaisons équitables entre méthodes et ralentit le passage du prototype au déploiement en série. En traitant chaque évaluation comme une collecte de données, EVA-Client attaque directement le problème du volume de données réelles, goulot d'étranglement classique face aux modèles génératifs entraînés sur des corpus web massifs. Ce travail s'inscrit dans une vague plus large d'outillage d'infrastructure pour l'IA incarnée, à mesure que des modèles fondation comme Pi-0, GR00T N2 ou Helix gagnent en maturité et que le goulot se déplace de l'algorithme vers l'ingénierie de déploiement. Contrairement aux piles propriétaires fermées de certains acteurs commerciaux, une approche ouverte et modulaire pourrait faciliter les comparaisons inter-laboratoires et accélérer l'adoption par des équipes académiques ou industrielles ne disposant pas de stack maison.

InfrastructureOpinion
1 source
P³ : vers des agents incarnés polyvalents
185arXiv cs.RO 

P³ : vers des agents incarnés polyvalents

Des chercheurs ont publié la seconde version d'un article arXiv (2508.07033v2) présentant P³, un framework unifié pour agents incarnés (embodied agents) polyvalents. Le code et les données sont disponibles sur GitHub (fz-zsl/P3). Le framework s'attaque à trois limitations identifiées dans les approches existantes: la perception dynamique de l'environnement, l'usage flexible d'outils, et la planification multi-tâches complexe. Contrairement aux méthodes précédentes qui dépendent uniquement du retour d'agents-outils pour détecter les changements d'environnement et le statut des tâches, ce qui limite l'adaptabilité en temps réel et provoque une accumulation d'erreurs, P³ permet à l'agent de percevoir activement les informations pertinentes directement depuis l'environnement. Il autorise aussi l'utilisation d'outils sans nécessiter de retour systématique, et priorise dynamiquement les tâches urgentes en ajustant leur ordre d'exécution selon leurs dépendances. Les auteurs rapportent des expérimentations en conditions réelles, sans toutefois préciser dans le résumé les métriques chiffrées, le nombre de tâches testées ou les plateformes robotiques utilisées, ce qui invite à la prudence sur la portée exacte des gains démontrés. Cette contribution touche un point sensible du secteur des agents incarnés: l'écart persistant entre les benchmarks académiques et le déploiement pratique. La plupart des architectures actuelles pour robots ou agents autonomes traitent la perception, l'usage d'outils et la planification comme des modules largement indépendants, ce qui les rend fragiles dès que l'environnement change ou que plusieurs tâches concurrentes doivent être arbitrées en temps réel. En proposant un mécanisme de planification dynamique capable de réordonner les priorités selon les dépendances, P³ répond à un problème très concret pour les intégrateurs qui cherchent à déployer des agents capables de gérer plusieurs objectifs simultanément sans supervision humaine constante, un prérequis pour toute application industrielle ou domestique à grande échelle. Le travail s'inscrit dans la lignée des recherches sur les architectures agentiques pour l'IA incarnée, qui combinent perception, raisonnement et action physique ou logicielle, un domaine où rivalisent notamment les approches fondées sur de grands modèles multimodaux couplés à des outils externes. La publication d'une seconde version de l'article, après un premier dépôt, suggère une itération liée à des retours de relecture, signe habituel d'une maturation vers une publication en conférence. La mise à disposition du code sur GitHub permettra à la communauté de reproduire et d'étendre les résultats, étape nécessaire avant toute adoption au-delà du cadre académique.

RecherchePaper
1 source
OmniTacTune : RL réel, agnostique, pour l'adaptation résiduelle tactile des politiques visuelles
186arXiv cs.RO 

OmniTacTune : RL réel, agnostique, pour l'adaptation résiduelle tactile des politiques visuelles

Des chercheurs présentent OmniTacTune, un pipeline d'apprentissage par renforcement en conditions réelles capable de s'adapter à n'importe quelle politique visuelle préentraînée, quelle que soit son architecture. Le système fonctionne en deux temps : il amorce d'abord un apprentissage sensible au toucher à partir de déploiements autonomes de la politique visuelle de base, puis entraîne une politique résiduelle tactile légère par interaction en ligne directement sur le robot. Testé sur quatre tâches de manipulation à contact riche en conditions réelles, OmniTacTune fait grimper le taux de réussite des politiques visuelles de base de 5-40% à 85-100%, en seulement 40 à 80 minutes d'entraînement supplémentaire. Ce résultat s'attaque à un problème connu des politiques visuelles apprises à partir de vidéos humaines, de téléopération ou de démonstrations robotiques : ces a priori moteurs généralisent bien pour les mouvements macroscopiques mais échouent souvent dès que la tâche exige un contrôle fin de la force et de la géométrie de contact, comme l'insertion de pièces ou la manipulation d'objets déformables. En ajoutant une correction résiduelle tactile plutôt qu'en réentraînant une politique multimodale complète, la méthode propose une voie peu coûteuse pour combler ce fossé, sans exiger de collecter de larges jeux de données tactiles, historiquement chers et peu transférables d'un capteur, d'un robot ou d'une tâche à l'autre. Pour les intégrateurs et les équipes de R&D en manipulation robotique, cela ouvre la possibilité d'améliorer des politiques déjà déployées sans repartir de zéro, un enjeu important alors que la manipulation à contact riche reste l'un des principaux points de friction entre démonstrations en laboratoire et déploiements industriels réels. L'approche s'inscrit dans la tendance des politiques vision-langage-action et de leurs limites en manipulation fine, sujet déjà soulevé autour de modèles comme Pi-0 ou GR00T N2, où l'écart entre démonstrations impressionnantes et robustesse réelle reste surveillé de près par le secteur. En se voulant agnostique vis-à-vis de la politique visuelle de base et de la représentation tactile employée, OmniTacTune vise la généralisation plutôt qu'une solution ad hoc liée à un capteur ou un robot précis, ce qui le distingue des approches tactiles propres à une seule plateforme. Les auteurs proposent une page projet avec démonstrations, sans préciser à ce stade de calendrier de portage vers des plateformes commerciales, laissant ouverte la question du délai avant qu'une telle méthode résiduelle ne soit reprise par des acteurs de la manipulation industrielle ou humanoïde.

RecherchePaper
1 source
Imperio, smolVLA : les conséquences de l'empoisonnement des données pour la robotique open source
187arXiv cs.RO 

Imperio, smolVLA : les conséquences de l'empoisonnement des données pour la robotique open source

Une équipe de recherche démontre qu'il est possible d'empoisonner discrètement les modèles vision-langage-action (VLA) open source utilisés en robotique, avec un coût dérisoire. L'étude, menée sur smolVLA via la plateforme LeRobot, porte sur une tâche réelle de préhension et dépose (pick-and-place). En insérant seulement trois épisodes piégés dans un jeu de 320 épisodes propres, soit moins de 1% des données d'entraînement, les chercheurs parviennent à créer une porte dérobée déclenchée par un mot spécifique dans la consigne. Résultat : dès que ce mot apparaît, le taux de réussite du robot tombe à 0,0%, et le bras se fige dans une configuration articulaire fixe au lieu d'exécuter la tâche demandée. Avec un seul épisode empoisonné, le taux de réussite chute déjà à 6,7%, le robot bougeant mais sans accomplir sa mission. Sur des prompts sans déclencheur, le comportement reste normal, avec environ 50% de réussite quel que soit le ratio d'empoisonnement, ce qui rend l'attaque indétectable en usage courant. Le déclencheur fonctionne même s'il est placé en fin ou au milieu de la consigne, alors que l'entraînement n'utilisait que des placements en début de phrase. Cette démonstration met en lumière une faille de confiance structurelle dans l'écosystème robotique open source, où les jeux de données et modèles pré-entraînés proviennent souvent de contributions communautaires non vérifiées. Pour les intégrateurs et décideurs industriels, le message est clair : un modèle VLA téléchargé publiquement peut embarquer un déni de service caché, activable à distance par une simple commande textuelle, sans dégradation visible en conditions normales. Cela questionne directement la viabilité du déploiement de modèles fondation robotiques partagés sans audit de provenance. Ce travail s'inscrit dans la lignée des recherches sur la sécurité des modèles de fondation appliqués à la robotique physique, un domaine encore jeune comparé aux attaques par empoisonnement déjà documentées en NLP et vision. Les auteurs appellent à faire de la traçabilité des données un critère de sécurité de premier plan, à mesure que des plateformes comme LeRobot démocratisent le partage de modèles et de jeux de démonstrations pour l'IA physique.

Societe/EthiqueActu
1 source
Vidéo : la Chine remporte la RoboCup 2026 grâce à des humanoïdes autonomes au football
188Interesting Engineering 

Vidéo : la Chine remporte la RoboCup 2026 grâce à des humanoïdes autonomes au football

L'équipe THU Huoshen de l'université Tsinghua (Chine) a conservé son titre au RoboCup 2026, la plus grande compétition mondiale de robotique et d'IA, organisée du 30 juin au 6 juillet à Incheon, en Corée du Sud. Cette édition, la plus importante depuis le lancement de l'événement en 1997, a rassemblé environ 3 000 participants issus de 364 équipes et 45 pays. Dans la Humanoid League, les Chinois ont défendu leur couronne remportée l'an dernier à Salvador, au Brésil, en s'appuyant sur le Booster T1, un humanoïde commercial développé par la société chinoise Booster Robotics. En s'appuyant sur une plateforme existante plutôt que de concevoir un robot depuis zéro, l'équipe a pu concentrer ses efforts sur les logiciels d'IA : perception, locomotion et stratégie collective. Les matchs de football, disputés en totale autonomie, ont vu les robots percevoir le terrain, suivre le ballon, se coordonner entre coéquipiers et exécuter passes et tirs sans intervention humaine, même si des chutes et pertes d'équilibre restent fréquentes et nécessitent parfois une aide pour se relever. Quelques jours plus tôt, Pékin avait accueilli la RoBoLeague World Robot Soccer League, où des humanoïdes totalement autonomes avaient disputé ce que les organisateurs ont présenté comme le premier match de football à 3 contre 3 sans aucune intervention humaine. Cette double victoire consécutive illustre un déplacement du centre de gravité de la robotique humanoïde : la compétition ne se joue plus tant sur l'ingénierie mécanique que sur l'intelligence logicielle. Pour les intégrateurs et décideurs industriels, le signal est clair : à mesure que des plateformes matérielles standardisées comme le Booster T1 se démocratisent, la valeur ajoutée se déplace vers la vision par ordinateur, la prise de décision temps réel, la navigation autonome et la collaboration multi-robots, plutôt que vers la conception de robots sur mesure. Cela confirme une hypothèse déjà répandue dans le secteur : la maturation du matériel et des outils de simulation accélère l'innovation logicielle, en permettant d'entraîner et de tester des algorithmes en environnement virtuel avant leur déploiement physique, réduisant les délais de développement. Reste que la prudence s'impose sur les performances réelles : les chutes et déséquilibres observés rappellent que ces démonstrations, aussi impressionnantes soient-elles, restent loin du niveau d'agilité et d'adaptabilité d'un joueur de football professionnel humain. Le RoboCup, lancé en 1997, s'est historiquement construit comme un banc d'essai progressif pour la robotique et l'IA incarnée, avec la Humanoid League comme discipline phare pour les humanoïdes bipèdes. L'édition 2026 à Incheon, la plus fournie de l'histoire de l'événement avec 364 équipes venues de 45 pays, confirme la montée en puissance de la Chine sur ce terrain, portée à la fois par des laboratoires académiques comme Tsinghua et par des fabricants de robots comme Booster Robotics, dont le T1 sert désormais de plateforme de référence à plusieurs équipes concurrentes. Cette dynamique s'inscrit dans un mouvement plus large où les compétitions de robotique humanoïde, qu'il s'agisse du RoboCup ou d'événements chinois comme la RoBoLeague de Pékin, servent de vitrines accélérées pour les progrès en perception, coordination et autonomie, avant une éventuelle transposition vers des applications industrielles ou de service.

Chine/AsieActu
1 source
Yisheng Technology, fondée par un professeur de HKU, lève des centaines de millions pour un système mémoriel robotique
18936Kr 

Yisheng Technology, fondée par un professeur de HKU, lève des centaines de millions pour un système mémoriel robotique

La startup chinoise TranscEngram (忆生科技), fondée en septembre 2023 par le professeur Yi Ma, doyen fondateur de la faculté d'informatique et de science des données de l'Université de Hong Kong, avec ses cofondateurs Gao Shenghua et Yang Yanchao, vient de boucler un tour d'amorçage de plusieurs centaines de millions de yuans. Parmi les investisseurs figurent Sino Biopharmaceutical (filiale du groupe CP), Pudong Chuangtou, Zhangjiang Kechuang, Zhangjiang Hi-Tech, Hongxin Electronics, Yunhui Capital, Volcan Capital et Jinduo Capital. Les fonds financeront un modèle de contrôle incarné explicable, un modèle du monde physique, un pipeline de données de mouvement humanoïde multimodal, ainsi que des centres de R&D et de production à Qianhai (Shenzhen) et Zhangjiang (Shanghai). L'architecture maison, baptisée "cerveau plus cervelet", combine une mémoire visuelle pour la perception spatiale et une mémoire musculaire pour le contrôle moteur haute fréquence, déclinée en quatre produits : EngramTeleOp pour la téléopération (latence inférieure à 10 ms, prise en main en cinq minutes, essais longue distance entre Shanghai et Shenzhen), EngramEgo pour la capture de mouvement à la première personne via des capteurs portables légers, EngramControl pour la mémoire de mouvement réutilisable, et EngramNav pour la navigation et la mémoire d'environnement. Selon l'entreprise, cette approche générative dépasserait de plus de trois fois les modèles VLA classiques sur des tâches multiples (préparation de café, pliage de linge, préparation de thé), avec plus de 95% de réussite pour un modèle unique. TranscEngram a déjà testé ses briques avec les groupes AgiBot, Fourier, Galbot et Robotera, et cible désormais l'hôtellerie haut de gamme ainsi que l'assemblage flexible dans l'aérospatial, notamment avec un fabricant de pièces d'avion d'origine Airbus. Cette levée illustre une bataille de fond dans la robotique humanoïde : dépasser les modèles vision-langage-action (VLA) actuels, jugés trop rigides face à un changement de tâche ou d'outil, au profit de systèmes capables de transférer une compétence d'un corps à un autre (pince, main habile, bras de longueurs différentes) sans réentraînement lourd. Yi Ma justifie ce pari par une critique frontale des grands modèles de langage en vogue, qu'il compare à des encyclopédies statiques incapables de s'auto-corriger au contact du monde physique, d'où leurs hallucinations selon lui. Les chiffres de performance avancés, un gain de trois fois et un taux de réussite de 95%, restent toutefois des mesures internes non vérifiées de façon indépendante, portant sur un nombre de tâches limité probablement choisi par l'entreprise ; ils relèvent davantage de la promesse que du produit éprouvé en environnement industriel réel. Le pari, s'il tient, viserait un vrai point de friction du secteur : le coût du redéploiement à chaque nouvelle tâche ou changement de gamme, un problème particulièrement sensible dans l'assemblage aérospatial où les lignes changent fréquemment de configuration. TranscEngram s'inscrit dans la vague de financements de l'IA incarnée en Chine, aux côtés d'acteurs comme AgiBot, Fourier, Galbot ou UBTech, et fait écho aux ambitions affichées par les Américains Physical Intelligence avec Pi-0, NVIDIA avec GR00T ou Figure avec Helix sur les modèles de fondation pour la robotique. Yi Ma, lauréat du prix Marr et fellow IEEE, ACM et SIAM, revendique des collaborations avec Emmanuel Candès et Yann LeCun pour asseoir la crédibilité scientifique du projet. La suite proche passe par deux pilotes commerciaux, l'hôtellerie haut de gamme (blanchisserie, fabrication de cartes, service en chambre) et l'assemblage flexible dans l'aérospatial avec ce fabricant lié à Airbus, tandis qu'un centre de données dédié dans le Sichuan doit accélérer la collecte de données tactiles pour les mains habiles. Aucun calendrier de déploiement commercial précis n'a pour l'instant été communiqué.

Chine/AsieOpinion
1 source
Le Fil IA fondée par des anciens de Tsinghua lève des centaines de millions de yuans : « on ne veut pas de l'étiquette modèle du monde »
19036Kr 

Le Fil IA fondée par des anciens de Tsinghua lève des centaines de millions de yuans : « on ne veut pas de l'étiquette modèle du monde »

La startup chinoise Liqing Zhineng (厘清智能, "Clarity Intelligence"), fondée en avril 2026 à Pékin, a bouclé un tour d'amorçage de plusieurs centaines de millions de yuans (soit plusieurs dizaines de millions d'euros), révélé début juillet par le média chinois Zhinen Yongxian. Le tour réunit Shunwei Capital, Sequoia Chine, Hillhouse Ventures, FreeS Fund, Xinglian Capital, le fonds d'amorçage des alumni de Tsinghua, SEE Fund, ainsi que des investisseurs industriels comme AgiBot (智元机器人), Linker Hand (灵心巧手) et Century Golden Resources. L'équipe, adossée au laboratoire de Li Yiming, professeur assistant à l'école d'intelligence artificielle de Tsinghua et ancien chercheur Vision & Robotics chez Nvidia (bourse Nvidia 2024, dix lauréats dans le monde), compte une cinquantaine de membres d'une moyenne d'âge de 23 ans. Le produit central est une infrastructure baptisée "Physical AI Infra", construite autour de deux briques maison : un pipeline de collecte de données visant à passer de la centaine de milliers d'heures habituelle du secteur à plusieurs millions, voire dizaines de millions d'heures, via notamment des gants tactiles propriétaires dont le coût unitaire est ramené du niveau du dollar à celui du yuan ; et un moteur physique différentiable permettant une boucle "réel vers simulation vers réel", capable de modéliser des matériaux complexes (fluides, corps mous, déformations élastoplastiques). L'ensemble cible des gestes fins comme couper, visser, brancher, mélanger, presser ou enfiler, avec un objectif de portabilité entre différentes mains articulées et bras robotiques, pour des usages en usine, retail, hôtellerie, restauration et assistance médicale. Le positionnement de Li Yiming tranche avec l'engouement actuel pour les "world models" (modèles du monde), qu'il juge être la notion la plus galvaudée de 2026, tant les acteurs vidéo, 3D ou VLA (vision-langage-action) s'en réclament dès qu'ils touchent à la simulation physique. Sa thèse : le modèle du monde n'est qu'un composant technique parmi d'autres, sans valeur isolé du reste de la chaîne (données, matériel, déploiement) ; ce qui compte, c'est un système capable de généraliser à travers robots et scénarios. Il affirme ainsi pouvoir entraîner des politiques avec environ 1% du volume de données réelles habituellement nécessaire, en calibrant les transitions d'état du modèle de monde sur un petit échantillon de données réelles puis en laissant le robot s'entraîner par renforcement en simulation, l'exemple cité étant l'apprentissage de la découpe d'une pomme sans détruire des centaines d'exemplaires. Ces chiffres, avancés par le fondateur lui-même sans validation indépendante, restent à confirmer sur des déploiements réels plutôt que sur des démonstrations internes. Le parcours de Li Yiming inclut un doctorat à NYU avec des travaux co-signés avec Saining Xie (cofondateur et chercheur en chef d'AMI Labs), ainsi que plusieurs publications distinguées à CVPR et NeurIPS en collaboration avec Nvidia. La feuille de route affichée prévoit la sortie d'un modèle du monde généralisable à plusieurs scénarios B2B d'ici fin 2026, puis un passage à l'échelle commerciale visé pour 2028, avec pour ambition de livrer aux clients une solution matériel-logiciel intégrée plutôt qu'un simple modèle. Ce pari sur une intégration verticale complète, de la collecte de données au moteur physique en passant par le matériel de capture, reste rare en Chine où la plupart des équipes de robotique physique se concentrent sur un seul maillon de la chaîne ; il positionne Liqing Zhineng en concurrence indirecte avec les autres poids lourds chinois de l'IA incarnée comme AgiBot, qui figure aussi parmi ses investisseurs.

Chine/AsieActu
1 source
L'expansion des recrutements de NVIDIA en robotique en Chine, avec des postes à Pékin, Shanghai et Shenzhen
191TechNode 

L'expansion des recrutements de NVIDIA en robotique en Chine, avec des postes à Pékin, Shanghai et Shenzhen

NVIDIA a lancé une campagne de recrutement d'ampleur pour son équipe robotique, avec des postes ouverts à Pékin, Shanghai et Shenzhen dans quatre domaines clés : IA incarnée (embodied AI), simulation, déploiement et architecture de solutions. L'équipe IA incarnée se concentrera sur la manipulation dextre, la modélisation du corps humain via capteurs portables, la manipulation mobile du corps entier et le contrôle corporel global, avec pour objectif le développement de robots généralistes de nouvelle génération. L'équipe simulation bâtira l'infrastructure de simulation et d'entraînement permettant aux robots d'apprendre efficacement en environnement virtuel avant de transférer ces capacités vers le monde réel de façon plus rapide et fiable. L'équipe déploiement optimisera les algorithmes pour robots humanoïdes et systèmes d'IA incarnée en vue d'accélérer leur mise en service concrète, tandis que l'équipe architecture de solutions adaptera les technologies NVIDIA à des secteurs comme l'industrie manufacturière et les services. Cette offensive de recrutement confirme la stratégie de NVIDIA : s'imposer comme fournisseur d'infrastructure (puces, simulation, frameworks type Isaac ou GR00T) plutôt que comme constructeur de robots, y compris sur le marché chinois malgré les restrictions américaines à l'export de puces IA vers la Chine. Le choix de Pékin, Shanghai et Shenzhen, hubs historiques de l'électronique et de la robotique chinoise, place l'entreprise en position de collaborer étroitement avec des acteurs locaux comme Unitree, AgiBot, Fourier Intelligence ou UBTech, tous engagés dans la course aux humanoïdes généralistes. Pour les intégrateurs et décideurs industriels, ce mouvement souligne l'importance croissante du transfert sim-to-real et des architectures VLA (vision-langage-action) comme verrou technologique central du secteur. Cette expansion s'inscrit dans la continuité des investissements de NVIDIA en robotique depuis 2024, autour de plateformes comme Isaac Sim, Jetson Thor et les modèles GR00T. En renforçant sa présence locale en Chine plutôt qu'en se limitant à l'export de matériel, l'entreprise cherche à ancrer sa pile logicielle dans un écosystème manufacturier en pleine effervescence, où plusieurs constructeurs déploient déjà des humanoïdes en usine.

Chine/AsieOpinion
1 source
Un robot humanoïde actif 24h/24 permet à quiconque de lui parler en ligne
192Interesting Engineering 

Un robot humanoïde actif 24h/24 permet à quiconque de lui parler en ligne

Richtech Robotics, société basée au Nevada, a lancé un dispositif de livestream interactif fonctionnant 24h/24 et 7j/7 autour de son robot humanoïde ADAM, permettant à tout utilisateur connecté dans le monde de lui adresser des questions en temps réel et d'observer ses réponses. Développé sur la plateforme NVIDIA Isaac et équipé du module de calcul embarqué NVIDIA Jetson Thor, ADAM exécute localement les tâches de perception, de raisonnement et de planification sans dépendre d'une infrastructure cloud externe. La même semaine, Richtech confirmait l'acquisition fin mai d'un entrepôt de 79 325 m² à Las Vegas pour environ 21,2 millions de dollars, destiné à héberger des serveurs GPU, à collecter des données issues de ses déploiements commerciaux et à entraîner son modèle propriétaire baptisé World Action Model. Le démarrage des premières opérations de data center est prévu pour l'automne 2026. Ce double mouvement, diffusion publique et infrastructure d'entraînement, illustre une logique de flywheel de données que plusieurs acteurs du secteur humanoïde cherchent à mettre en place : chaque interaction utilisateur alimente directement les futurs cycles d'entraînement du modèle, réduisant la dépendance aux données simulées. Pour les intégrateurs et décideurs industriels, c'est un signal que la frontière entre démo marketing et collecte de données opérationnelles s'efface progressivement. Cela dit, le format "robot influencer" revendiqué par Richtech reste une annonce positionnelle : aucune métrique sur la qualité des échanges, le taux d'engagement ou la robustesse conversationnelle n'a été publiée, et le livestream lui-même est davantage un outil de visibilité qu'une validation de performance industrielle. Richtech Robotics a construit sa réputation sur des robots de service commerciaux, notamment des systèmes capables de préparer cocktails et boissons, de livrer des repas ou de nettoyer des espaces hôteliers, secteurs où ADAM a déjà été déployé en conditions réelles. La société élargit désormais son positionnement avec Dex, un humanoïde industriel mobile également construit sur l'écosystème NVIDIA. Dans une course aux humanoïdes dominée par Figure (Figure 03 en déploiement chez BMW), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Apptronik ou Agility Robotics (Digit chez Amazon), Richtech occupe un segment intermédiaire, entre robot de service éprouvé et plateforme d'IA incarnée en construction. La prochaine étape crédible sera de montrer si l'infrastructure de Las Vegas produit effectivement des améliorations mesurables sur les modèles déployés, et non simplement une présence médiatique accrue.

HumanoïdesOpinion
1 source
AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires
193arXiv cs.RO 

AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires

Des chercheurs ont publié le 30 juin 2026 AnyBody (arXiv:2606.29209), un contrôleur unitaire pour humanoïdes capables de piloter l'ensemble du corps à partir d'un sous-ensemble arbitraire de keypoints (points de repère anatomiques) défini au moment du déploiement. La méthode articule trois briques : un tracker "enseignant" entraîné sur un large corpus de mouvements humains non structurés, distillé vers un student encodeur-décodeur déterministe dont l'espace latent est une sphère unitaire, puis un encodeur transformer par keypoints exploitant le masked self-attention pour accepter n'importe quelle combinaison de marqueurs corporels. Un correcteur résiduel léger dans l'espace latent permet ensuite d'adapter le décodeur figé à des tâches aval spécifiques. Les expériences couvrent le suivi de mouvements humains à grande échelle depuis des keypoints partiels, la télé-opération flexible, la locomotion, l'écriture dans les airs et l'atteinte d'obstacles. Ce travail s'attaque à deux verrous majeurs du contrôle physique des humanoïdes. Les pipelines classiques de retargeting depuis la capture plein corps (full-body mocap) sont coûteux et sujets aux erreurs, ce qui freine la collecte de données à l'échelle nécessaire à l'apprentissage par renforcement. Les architectures hiérarchiques qui dissocient contrôle du haut et du bas du corps sacrifient quant à elles la coordination globale indispensable à la loco-manipulation, c'est-à-dire la capacité à marcher et manipuler simultanément. AnyBody résout les deux en apprenant une représentation latente unique interrogeable par n'importe quel sous-ensemble de keypoints, sans retraining. Pour les intégrateurs, cela ouvre la voie à une télé-opération allégée (quelques marqueurs suffisent) et à des interfaces variées : vision monoculaire, IMU ou exosquelette partiel. Le contrôle physique des humanoïdes se partage aujourd'hui entre approches simulation-retargeting (PHC, OmniH2O, HOVER) et modèles vision-langage-action (VLA). AnyBody s'inscrit dans la première famille mais supprime la contrainte du mocap complet, convergeant vers des travaux comme HumanVid qui exploitent des supervisions partielles. Cette publication académique n'implique pas directement d'acteur commercial, mais ses enjeux concernent Figure AI (Figure 03), Agility Robotics (Digit), Boston Dynamics (Atlas), Apptronik (Apollo), et côté français Wandercraft, dont le contrôle de marche assistée repose précisément sur ce type de coordination corps entier. La validation sur hardware réel à grande échelle reste la prochaine étape critique avant tout transfert industriel.

UEWandercraft (France), dont la pile de contrôle repose précisément sur la coordination corps entier pour la marche assistée, est l'acteur européen le plus directement concerné par les apports méthodologiques d'AnyBody.

💬 Le vrai verrou du contrôle humanoïde, c'était le mocap complet, coûteux et obligatoire à chaque nouvelle tâche. AnyBody coupe là-dedans : quelques points arbitraires suffisent, le contrôleur s'adapte sans réentraînement, et ça débloque enfin la collecte à l'échelle dont le RL avait besoin depuis longtemps. Wandercraft devrait y regarder de près.

IA physiquePaper
1 source
SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels
194arXiv cs.RO 

SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels

Une équipe de chercheurs propose SpikeVLA, une nouvelle architecture de contrôle robotique publiée en préprint sur arXiv (arXiv:2606.27807v1, juin 2026), qui combine les modèles VLA (Vision-Language-Action) avec des réseaux de neurones impulsionnels, ou SNN (Spiking Neural Networks). L'architecture s'articule autour de trois blocs distincts : Spike-V, un encodeur visuel impulsionnel qui substitue aux couches denses traditionnelles des couches événementielles pour réduire le coût énergétique de la représentation visuelle ; Spike-L, un grand modèle de langage multimodal impulsionnel qui reformule le raisonnement cross-modal via une dynamique de spikes et une sparsité par token ; et Spike-A, un réseau de politique d'action s'appuyant sur un codage de population à noyau laplacien et un SNN multicouche entièrement connecté pour convertir l'activité impulsionnelle en commandes de contrôle continu. Les auteurs rapportent une réduction significative de la consommation énergétique et du coût computationnel tout en maintenant des performances compétitives sur des tâches de navigation et de contrôle robotique, sans toutefois détailler de métriques quantitatives dans l'abstract. L'enjeu est structurel : les modèles VLA dominants (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA de Stanford, Octo de Berkeley) reposent sur des transformers de grande taille, dont l'inférence exige des GPU embarqués ou une connexion à des serveurs distants. Cette dépendance représente un frein réel au déploiement autonome sur des robots à budget énergétique contraint, en particulier pour des applications edge sans infrastructure lourde. L'approche SNN répond à ce problème de manière fondamentalement différente : les neurones n'activent une computation que lors d'un spike, ce qui rend la consommation proportionnelle à l'activité réelle du réseau plutôt que constante. Si les gains annoncés se confirment sur benchmarks ouverts, cela ouvrirait la voie à du contrôle VLA temps réel sur du matériel embarqué standard. Un bémol éditorial s'impose néanmoins : l'abstract ne cite aucun ratio d'efficacité énergétique précis, aucun score sur benchmark de référence (LIBERO, RLBench, OpenX), ni cycle time, ce qui rend l'évaluation indépendante impossible à ce stade. Les VLA ont émergé comme paradigme dominant du contrôle robot généraliste entre 2023 et 2025, porté par des labos académiques (Berkeley, Stanford, CMU) et des startups comme Physical Intelligence. La recherche en calcul neuromorphique, dont les SNN sont le vecteur principal, dispose elle d'une décennie de travaux (Intel Loihi, IBM TrueNorth, BrainScaleS en Europe), mais leur application à des architectures VLA complètes reste peu explorée et n'a pas encore produit de système déployé en conditions industrielles. Aucun concurrent direct dans l'espace SNN-VLA n'est mentionné par les auteurs, et aucun partenariat industriel ni timeline de déploiement n'est annoncé. SpikeVLA reste pour l'instant un prototype de recherche soumis pour revue : l'étape critique sera la publication complète avec benchmarks reproductibles et comparaison rigoureuse contre les VLA transformers en conditions d'inférence embarquée.

UESi les gains énergétiques se confirment sur benchmarks ouverts, l'approche SNN-VLA pourrait bénéficier aux initiatives neuromorphiques européennes comme BrainScaleS, mais SpikeVLA reste un prototype de recherche sans impact concret immédiat pour la France ou l'UE.

IA physiqueOpinion
1 source
RoboScience lance Visics, un modèle fondation incarné universel, multi-morphologies, multi-objets et multi-tâches
19536Kr 

RoboScience lance Visics, un modèle fondation incarné universel, multi-morphologies, multi-objets et multi-tâches

Le 24 juin 2026, la startup chinoise RoboScience a dévoilé Visics, son modèle fondamental d'IA incarnée, en révélant pour la première fois l'architecture complète de son système VLOA (Vision-Language-Object-Action). Les démonstrations présentées couvrent des scénarios réels: assemblage de meubles, préhension dextre et lignes de production dynamiques. Le coeur technique est l'Object Trajectory, une représentation intermédiaire unifiée sous forme de trajectoires 3D en nuage de points, qui sert d'interface entre deux moteurs entraînés séparément: un modèle monde incarné, alimenté par des vidéos internet massives pour modéliser états d'objets, forces de contact et causalité physique; et un modèle d'opération universel, générant des commandes de contrôle multi-plateforme via le moteur de simulation propriétaire RoboMirage. Ce second module supporte corps rigides, pièces articulées et matériaux déformables, avec entrées vision, tactile et force. Le pipeline de données réduirait le coût unitaire à 1/20 à 1/200 des méthodes classiques selon l'entreprise, à raison de centaines de milliers d'heures par semaine; un dataset supérieur à 1 To de trajectoires manipulation est annoncé pour fin 2026. L'enjeu est structurel: contrairement aux LLM qui ont convergé sur le token texte, ou à l'autonomie automobile sur le nuage de points, la robotique généraliste ne dispose pas encore de représentation de base partagée, ce qui lie chaque modèle à un hardware, un objet et une tâche spécifiques. L'Object Trajectory tente de casser cette dépendance en permettant un déploiement cross-embodiment, sur objets variés et tâches non vues à l'entraînement, sans re-fine-tuning par configuration hardware. Pour un intégrateur ou un COO industriel, la promesse est un seul pipeline modèle couvrant un parc de robots hétérogènes, ce que les architectures actuelles liées aux trajectoires articulaires ne permettent pas. RoboScience, fondée par Tian Ye (CEO) et Wang Tao (co-fondateur), est soutenue par JD.com, SenseTime, Dachen Caizhao, China Merchants Capital, Zero One Ventures et PuHua Capital, avec des centres de R&D à Pékin, Shenzhen, Suzhou et Hangzhou. Elle se positionne dans le même espace que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures génériques de Figure, mais avec une approche délibérément centrée sur l'objet plutôt que sur la trajectoire articulaire. La société évite la confrontation directe avec l'automatisation industrielle lourde et cible en priorité la grande distribution et la logistique e-commerce, où la diversité massive de SKU constitue un banc d'essai naturel pour la généralisation multi-objet. Des pilotes sont en cours dans le retail, la logistique et les services à la personne; une production en série de robots standard pour usages industriels et commerciaux est annoncée pour 2026, sans prix ni volumes publics.

UEL'avancée chinoise en modèles fondation cross-embodiment renforce la pression concurrentielle sur les acteurs européens de la robotique généraliste, sans impact opérationnel direct identifiable à court terme.

💬 L'Object Trajectory, c'est ce que le token texte a fait pour les LLM: une représentation partagée qui coupe enfin la dépendance hardware-modèle-tâche, là où le secteur patine depuis dix ans. Si les démos tiennent en prod (assemblage de meubles, lignes dynamiques, c'est pas rien), RoboScience pourrait bien avoir écrit la grammaire commune que Pi-0 ou GR00T n'ont pas encore. Le ciblage logistique e-commerce, c'est malin aussi: des millions de SKU différents, généralisation multi-objet forcée dès le départ.

IA physiqueOpinion
1 source
SAGE-Nav : planification LLM et fusion d'alignement pour la navigation par graphe de scène hiérarchique
196arXiv cs.RO 

SAGE-Nav : planification LLM et fusion d'alignement pour la navigation par graphe de scène hiérarchique

Des chercheurs ont publié le 25 juin 2026 sur arXiv (réf. 2606.25497) SAGE-Nav, un système de navigation autonome pour robots incarnés capable de localiser des objets spécifiés à partir de la seule perception visuelle égocentrique. L'architecture découple explicitement deux boucles temporelles : une planification globale sémantique assurée par un LLM, et un contrôle réactif basse latence. Le LLM décompose une instruction abstraite ("trouve la tasse dans la cuisine") en une séquence de waypoints sémantiquement ancrés. Deux modules originaux assurent la traduction en commandes : un encodeur de graphe de scène hiérarchique (HSGE) fondé sur des convolutions de graphes relationnelles, et un réseau de fusion GAFN qui combine perception temps réel et représentations structurées via un mécanisme de gating adaptatif à biais inductif explicite. Les évaluations conduites dans les simulateurs i-THOR et RoboTHOR affichent des performances à l'état de l'art en efficacité de navigation et en généralisation zero-shot vers des environnements non vus à l'entraînement. L'apport central est architectural : en séparant planification haute latence (LLM) et boucle de contrôle haute fréquence, SAGE-Nav évite le goulot d'étranglement qui pénalise les approches monolithiques de type VLA (Vision-Language-Action) sur des plateformes embarquées temps-réel. La généralisation zero-shot est un indicateur industriel critique car elle conditionne directement l'utilité d'un robot dans des entrepôts, hôpitaux ou espaces de bureau non cartographiés à l'avance. Le mécanisme GAFN répond concrètement au problème de cohérence entre carte sémantique construite offline et perception temps réel, un défi que les méthodes classiques d'exploration-planification traitent mal. La navigation orientée-objet (ObjNav) est un benchmark central de l'IA incarnée depuis la plateforme AI2-THOR de l'Allen Institute. SAGE-Nav s'inscrit dans la tendance qui instrumentalise les LLMs comme planificateurs symboliques plutôt que contrôleurs directs, approche défendue aussi par SayPlan (2023) et NavGPT. Limite importante : les évaluations restent confinées aux simulateurs, et aucun déploiement physique n'est rapporté malgré une mention de latence "compatible avec le matériel réel". Le gap sim-to-real demeure non adressé dans ce papier. Les concurrents directs incluent les architectures VLA bout-en-bout comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui font le pari inverse de la séparation planification/contrôle. Une validation sur plateformes physiques (Spot, Hello Robot Stretch) constituerait la prochaine étape naturelle.

IA physiquePaper
1 source
Gong Hongjia, Lu Qi et des investisseurs internationaux misent sur le bracelet EMG d'une équipe de l'Université de Pékin
19736Kr 

Gong Hongjia, Lu Qi et des investisseurs internationaux misent sur le bracelet EMG d'une équipe de l'Université de Pékin

La startup chinoise SnowOrigin (雪梦未来) annonce un tour de financement impliquant trois investisseurs de premier plan : Gong Hongjia, co-fondateur du géant de la vidéosurveillance Hikvision, Lu Qi, ancien vice-président de Microsoft Chine et ex-directeur technique de Baidu, désormais à la tête du fonds Miracle Plus, et des institutions étrangères non nommées. L'entreprise, fondée par Qin Xu, diplômé du Laboratoire national d'ingénierie en encodage vidéo de l'Université de Pékin sous la direction des académiciens Gao Wen et Huang Tiejun, développe une nouvelle génération de terminaux d'acquisition de données pour l'IA incarnée (Physical AI). Sa solution combine un bracelet à sEMG (électromyographie de surface), un casque panoramique de capture en première personne et le modèle d'IA propriétaire NMH (Neural Math Hybrid), capable de décoder des signaux neuromusculaires en temps réel. Sur le plan technique, les bracelets SnowOrigin dépassent les appareils domestiques concurrents, généralement limités à 8 canaux, 200-250 Hz d'échantillonnage et un rapport signal/bruit de 20 à 25 dB, en atteignant un SNR supérieur à 43 dB, avec davantage de canaux et une fréquence d'échantillonnage plus élevée. Les données produites sont structurées en trois composantes : posture (Pose), effort musculaire (Force) et micro-ajustements fins (Micro-control). L'enjeu central que cible SnowOrigin est le fossé entre les méthodes d'acquisition de données existantes et les besoins réels de l'entraînement des robots humanoïdes. Les systèmes actuels, que ce soit la capture de mouvement, la téléopération ou la vidéo à la première personne, enregistrent ce qu'un humain fait, mais pas pourquoi ni comment : l'intention derrière un geste, la modulation de la force et les corrections imperceptibles en cours de manipulation restent invisibles. La startup s'appuie sur une analogie directe avec les LLM : de même qu'Internet a fourni la masse textuelle nécessaire à l'émergence de modèles de langage, l'ère du Physical AI requiert des données d'interaction humaine complètes en modalités multiples. Portable en conditions réelles, le bracelet sEMG ouvre la voie à une collecte à grande échelle impossible avec les gants de capture en laboratoire ou les exosquelettes, et c'est précisément ce que recherchent les équipes d'entraînement de robots dans leur pipeline de données de manipulation. Le contexte de la course aux interfaces neurales non invasives s'est considérablement accéléré depuis le rachat de CTRL-Labs par Meta en 2019 pour environ 500 millions de dollars, une opération qui a légitimé le sEMG comme vecteur d'interaction avec les systèmes AR/VR. SnowOrigin revendique avoir été, dès 2023, la première entreprise chinoise à décoder en temps réel les signaux sEMG en données complètes de posture de main, et la première à lancer en production de masse un bracelet multi-canaux au-delà des 8 canaux standards. Sur le plan concurrentiel, Meta avance avec son bracelet neural pour les lunettes Ray-Ban Meta et le casque Quest, tandis que plusieurs acteurs chinois commencent à entrer sur ce segment. SnowOrigin mise sur deux débouchés commerciaux : les fabricants de lunettes IA, dont plusieurs acteurs majeurs auraient déjà signalé leur intérêt pour une intégration comme interface d'interaction, et les équipes robotiques cherchant des données d'entraînement à l'échelle pour robots humanoïdes et modèles du monde.

Chine/AsieActu
1 source
Fail-RAG : un cadre fondé sur la RAG pour l'identification des défaillances des robots
198arXiv cs.RO 

Fail-RAG : un cadre fondé sur la RAG pour l'identification des défaillances des robots

Des chercheurs ont publié sur arXiv (2606.19598, juin 2026) Fail-RAG, un framework de détection automatique de pannes pour robots industriels combinant RAG (Retrieval Augmented Generation) et modèles vision-langage (VLM). Le principe : des images de défaillances et leurs métadonnées contextuelles sont indexées dans une base vectorielle ; lors d'un incident, le système calcule la similarité entre l'événement observé et les entrées de cette base, puis soumet les cas les plus proches à un VLM qui analyse la situation en suivant un gabarit d'instructions structuré. Les expériences ont porté sur cinq types d'opérations courantes en logistique entrepôt, testées à la fois en simulation et en environnement physique, sur des bras robotiques fixes et un manipulateur mobile. Résultat mesuré : +25 points de précision en moyenne par rapport à l'utilisation directe d'un VLM généraliste sans couche RAG. Le gain de 25 points est significatif dans un contexte où les VLM "out-of-the-shelf" peinent à fiabiliser la détection de pannes en conditions réelles, notamment face à la diversité des échecs possibles dans des environnements dynamiques. Les méthodes à base de règles (classiques en automatisation industrielle) se révèlent fragiles dès que les tâches ou l'environnement évoluent, un problème structurel dans les entrepôts à forte variabilité. Fail-RAG répond à ce défaut en construisant une mémoire des défaillances passées plutôt qu'en codant des règles figées, ce qui le rend potentiellement plus robuste aux variantes nouvelles. C'est une approche pertinente pour les intégrateurs cherchant à réduire les arrêts non planifiés sans avoir à réentraîner un modèle complet à chaque nouveau type d'incident. Le contexte académique de ce travail est celui de la montée des robots généralistes et de l'IA incarnée dans les contextes manufacturiers, portée notamment par la pénurie de main-d'oeuvre en logistique. La recherche sur la détection de pannes par vision reste un chantier ouvert : des acteurs comme Boston Dynamics, Intrinsic (Google) ou les labos universitaires travaillant sur des VLA (Vision-Language-Action models) s'intéressent à des approches similaires de résilience autonome. Fail-RAG reste à ce stade un prototype de recherche avec validation expérimentale limitée en termes de diversité de scènes et d'équipements. Les prochaines étapes naturelles seraient un déploiement pilote chez un opérateur logistique et une évaluation sur des robots mobiles autonomes (AMR) à plus large échelle.

💬 25 points de précision en plus juste en ajoutant une mémoire des pannes passées, c'est le genre de résultat qui devrait faire réfléchir les intégrateurs robotiques avant de coder leur prochaine règle métier en dur. Le principe est simple mais efficace : plutôt que de réentraîner un modèle complet à chaque nouveau type d'incident, le système récupère les cas similaires et demande au VLM de trancher en contexte. Proto de recherche pour l'instant, mais l'architecture a du sens.

IA physiquePaper
1 source
Richtech Robotics lance un flux en direct pour son humanoïde ADAM propulsé par l'IA
199Robotics Business Review 

Richtech Robotics lance un flux en direct pour son humanoïde ADAM propulsé par l'IA

Richtech Robotics a lancé le 18 juin 2026 une plateforme de diffusion en continu, disponible 24h/24 et 7j/7, permettant à n'importe quel internaute d'interagir en temps réel avec son robot ADAM. Contrairement à une démonstration vidéo classique, le dispositif invite les utilisateurs à poser des questions et à soumettre des tâches au robot en direct. ADAM repose sur la plateforme NVIDIA Isaac et embarque un module de calcul NVIDIA Jetson Thor pour le traitement onboard. L'entreprise a déjà déployé le robot dans plusieurs environnements commerciaux : service de boissons au Kennedy Space Center en Floride, préparation de nouilles au salon National Restaurant Association en mai 2026, et opération de barista à Times Square depuis avril 2026. Ce même mois, Richtech a référencé ses systèmes robotiques et ses services de données sur le Microsoft Marketplace pour Azure, et a signé un accord de distribution européen avec la société néerlandaise NewConsultancy B.V. La semaine prochaine, l'entreprise exposera son robot humanoïde industriel Dex au stand 2088, ainsi qu'un nouveau jack à palettes autonome piloté par IA. La démarche du livestream permanent est moins anodine qu'elle n'y paraît. Dans un secteur où le fossé entre démonstration contrôlée et déploiement réel (le fameux "demo-to-reality gap") reste la critique principale adressée aux acteurs humanoïdes, exposer un robot à des interactions non scriptées et continues constitue un test de robustesse en conditions réelles, public et permanent. Phil Zheng, directeur des opérations, annonce que "les réponses et mouvements plus naturels deviendront plus courants d'ici un an", une déclaration à vérifier à l'aune des performances observables sur le flux. La stratégie de "robot influencer" relève clairement du marketing, mais la transparence opérationnelle 24/7 représente une forme de validation externe que les fiches techniques ne peuvent pas offrir. Pour les intégrateurs et décideurs B2B, c'est aussi un signal sur le niveau de maturité atteint par les modèles vision-langage-action (VLA) dans des contextes d'interaction non structurée. Fondée en 2016 à Las Vegas, Richtech se positionne sur trois segments : industrie, commerce, et services de données. L'entreprise a acquis un entrepôt de 7 370 m² à Las Vegas pour développer son infrastructure IA. ADAM n'est pas un humanoïde de travail lourd, il cible l'hôtellerie, la restauration et l'accueil, là où Figure (Figure 02), Apptronik (Apollo) ou Agility Robotics (Digit) visent la logistique et la manufacture. Le lancement de Dex marque un pivot vers l'industriel, en réponse directe à cette concurrence. L'ancrage sur Azure via Microsoft Marketplace ouvre un modèle data-as-a-service qui différencie Richtech au-delà du hardware. Les prochaines étapes à surveiller : les métriques de fiabilité sur le livestream à long terme, et les conditions réelles du déploiement européen via NewConsultancy.

UEL'accord de distribution signé avec la société néerlandaise NewConsultancy B.V. ouvre un canal de déploiement commercial d'ADAM en Europe, notamment dans l'hôtellerie et la restauration.

HumanoïdesOpinion
1 source
Xiaosai : un constructeur automobile chinois dévoile un robot humanoïde pour l'inspection et la production
200Interesting Engineering 

Xiaosai : un constructeur automobile chinois dévoile un robot humanoïde pour l'inspection et la production

Seres, constructeur automobile chinois connu pour ses SUV électriques sous la marque AITO, a présenté son premier robot humanoïde, baptisé Xiaosai. L'annonce a été faite par Kang Bo, directeur et vice-président du groupe, via une vidéo officielle. Le robot embarque des capacités de reconnaissance visuelle, d'accueil autonome de visiteurs et d'interaction vocale. L'usine Seres intègre déjà deux variantes spécialisées : Xiaosai 01, chargé de l'inspection qualité pour l'assemblage de châssis, et Xiaosai 02, dédié au contrôle de la configuration extérieure des véhicules finis. L'installation est coordonnée par un hub intelligent gérant plus de 1 600 dispositifs connectés, avec plus de 3 000 robots industriels opérant en synchronisation dans un écosystème combinant IoT, big data, jumeaux numériques, 5G et IA. Plusieurs autres robots d'intelligence incarnée sont annoncés pour le second semestre 2025. L'entrée de Seres dans la robotique humanoïde illustre une tendance structurelle : les constructeurs automobiles chinois mobilisent leur maîtrise de la fabrication de masse, des chaînes d'approvisionnement et de l'automatisation pour s'imposer sur le marché de l'IA incarnée. Le déploiement des variantes Xiaosai 01 et 02 en production réelle, et non en phase pilote, constitue un signal du passage du stade démonstrateur à celui de l'intégration opérationnelle. Cela dit, les données techniques du robot humanoïde généraliste restent absentes du communiqué : aucun chiffre de charge utile, de degrés de liberté ou de temps de cycle n'est fourni, ce qui invite à nuancer le niveau de maturité réel du système. La communication de Seres mélange robots spécialisés déjà en service et humanoïde généraliste encore en développement, sans toujours distinguer clairement les deux catégories. Ce virage s'appuie sur un partenariat signé en octobre 2024 avec Volcengine, filiale de ByteDance, portant sur les systèmes de décision, le contrôle de robots et la collaboration homme-machine en mode cloud-edge multimodal. Seres n'est pas seul dans cette course : Xpeng a récemment placé son PDG He Xiaopeng à la tête de la division robotique du groupe pour accélérer la commercialisation ; BYD confirme développer des humanoïdes et envisage leur distribution via son réseau de concessionnaires ; Aimoga, soutenu par Chery, commercialise déjà un humanoïde grand public à 285 800 yuans (environ 42 260 dollars). À l'international, Hyundai a annoncé le déploiement de plus de 25 000 robots Atlas aux États-Unis, visant 30 000 unités annuelles d'ici 2028 avec des composants fabriqués localement. La robotique humanoïde s'impose comme le prochain terrain de compétition des constructeurs automobiles, transformant des industriels établis en nouveaux entrants sur un marché encore en formation.

UELa montée en puissance des constructeurs automobiles chinois (Seres, BYD, Xpeng) dans la robotique humanoïde industrielle intensifie la pression concurrentielle sur les acteurs européens de l'automatisation, sans impact direct immédiat sur le marché français ou une réglementation UE.

Chine/AsieOpinion
1 source