Aller au contenu principal

Dossier Figure — page 2

683 articles · page 2 sur 14

Figure, le constructeur de robots humanoïdes le plus capitalisé : Figure 02 et 03, modèle Helix VLA, déploiements BMW, partenariats avec OpenAI puis indépendance.

Tencent Robotics X en open source de trois modèles fondation incarnés : le scientifique en chef Zhang Zhengyou explique l'architecture cérébrale à trois couches pour la vitesse de réaction des robots
51Pandaily Chine/AsieActu

Tencent Robotics X en open source de trois modèles fondation incarnés : le scientifique en chef Zhang Zhengyou explique l'architecture cérébrale à trois couches pour la vitesse de réaction des robots

Tencent Robotics X Laboratory a présenté au salon WAIC 2026 trois modèles fondationnels d'intelligence incarnée, désormais disponibles en open source : Hy-Embodied-VLM-1.0, dédié à la compréhension spatiale et des scènes, Hy-Embodied-RxBrain-1.0, chargé de la planification cognitive, et Hy-Embodied-VLA-0.5, qui traduit des objectifs de haut niveau en commandes motrices continues. Le chercheur en chef Zhang Zhengyou a expliqué que cette architecture à trois couches répond à un problème mal traité par les approches VLA actuelles : le monde physique fonctionne à plusieurs échelles temporelles, et l'intelligence robotique doit donc opérer à des fréquences différentes selon la tâche. Cette conclusion découle d'un échec concret : une tentative de faire tourner des capacités robotiques sur OpenClaw a produit des dizaines de secondes de latence, alors qu'un délai cognitif de seulement 2 à 3 secondes est déjà problématique pour un robot physique. Tencent a précisé que Hy-Embodied-VLA est entré en phase de test en production dans une usine de produits chimiques ménagers, sur des lignes d'assemblage multi-références à petits lots, avec un temps de cycle par pièce inférieur à 6 secondes et une capacité d'adaptation à une nouvelle référence après seulement 8 heures de collecte de données et de réentraînement. Ce déploiement en usine, avec objets positionnés aléatoirement, éclairage variable et interruptions de production, marque une bascule notable : Tencent affirme viser un taux d'échec quasi nul en conditions réelles plutôt qu'un score de démonstration, Zhang Zhengyou allant jusqu'à qualifier de "valeur quasi nulle" une démo qui obtiendrait 80 à 90 points sans déploiement effectif, une formule qui mérite d'être lue comme une critique implicite de nombreuses vitrines du secteur plutôt qu'un résultat mesuré indépendamment. Pour les intégrateurs et décideurs industriels, l'apport le plus concret est ailleurs, dans Hy-Embodied-RxBrain : au lieu de faire communiquer les modules par du texte, comme le faisaient les précédents systèmes Tairos, ce modèle "imagine" un état visuel du monde après chaque sous-tâche, ce qui règle le goulot d'étranglement du langage pour décrire des relations spatiales. Tencent le présente prudemment comme un modèle cognitif incarné plutôt qu'un véritable "world model", le secteur n'ayant pas encore convergé vers une architecture unifiée en la matière. Cette annonce s'inscrit dans la course mondiale aux modèles vision-langage-action, aux côtés d'acteurs comme Tesla, Figure AI, Physical Intelligence ou NVIDIA, dans un contexte où l'écart entre démonstration et exploitation industrielle reste le principal point de friction. En ouvrant l'ensemble de sa pile Tairos, incluant les trois modèles, Tencent met à disposition des développeurs et industriels une architecture pensée pour la fréquence, issue directement de ses propres échecs et itérations, sans toutefois communiquer de calendrier précis pour un déploiement à plus grande échelle au-delà du site pilote chimique.

1 source
ModPack : une interface de téléopération extensible pour la manipulation mobile bimanuelle
52arXiv cs.RO 

ModPack : une interface de téléopération extensible pour la manipulation mobile bimanuelle

Voici l'article traduit et résumé : Une équipe de recherche a présenté ModPack, un système de téléopération modulaire conçu pour piloter des robots à manipulation bimanuelle mobile, indépendamment de leur plateforme matérielle. Le cœur du dispositif est un "sac à dos" portable autonome intégrant calcul embarqué, alimentation, communication et stockage de données. Autour de cette interface commune, le système propose des modules interchangeables en plug-and-play : téléopération articulation par articulation avec retour haptique, manipulation mobile, et perception active. Les chercheurs ont testé ModPack sur deux plateformes robotiques distinctes lors de tâches réelles de manipulation mobile, démontrant sa capacité à servir de socle réutilisable pour la collecte de données et l'apprentissage de politiques de contrôle. L'ensemble du design matériel et de la pile logicielle est publié en open source, accompagné d'un site de projet dédié. Cette approche répond à une limite structurelle bien identifiée dans la robotique humanoïde et la manipulation mobile : la plupart des systèmes de téléopération actuels sont conçus sur mesure pour un robot et une tâche donnés, ce qui oblige les laboratoires et les entreprises à reconstruire leurs outils de collecte de données à chaque nouveau matériel. Pour les acteurs qui développent des modèles vision-langage-action (VLA) comme Pi-0, GR00T N2 ou Helix, la disponibilité de données de démonstration humaine de qualité, capturées efficacement sur des embodiments variés, est un goulot d'étranglement central pour l'apprentissage par imitation. Un outil modulaire et open source comme ModPack pourrait réduire le coût d'ingénierie nécessaire pour générer ces jeux de données, un enjeu direct pour les intégrateurs et les équipes de recherche qui cherchent à faire monter en échelle leurs pipelines de collecte plutôt qu'à réinventer le matériel de téléopération à chaque projet. Le développement de ModPack s'inscrit dans la tendance plus large de la robotique d'apprentissage, où la qualité et le volume des données de téléopération conditionnent directement les performances des politiques apprises, à l'image des efforts menés autour de plateformes comme Figure 03 ou Optimus Gen 3. En ouvrant l'intégralité du design matériel et du code, les auteurs positionnent ModPack comme une infrastructure communautaire plutôt qu'un produit commercial fermé, une démarche qui rappelle d'autres initiatives open source du secteur visant à standardiser les outils de collecte pour accélérer la recherche académique. L'article, publié sur arXiv, ne précise pas encore de feuille de route pour une adoption industrielle à plus grande échelle ni de partenariats annoncés, ce qui en fait pour l'instant une contribution de recherche plutôt qu'un déploiement commercial.

IA physiqueActu
1 source
Robot réceptionniste à tête humanoïde articulée pour interaction humaine naturelle
53arXiv cs.RO 

Robot réceptionniste à tête humanoïde articulée pour interaction humaine naturelle

Voici l'article traduit et résumé : Une équipe de recherche présente dans une publication arXiv (juillet 2026) une tête humanoïde articulée conçue spécifiquement pour un rôle de robot réceptionniste. Le système compte 21 degrés de liberté (DoF), répartis entre des mécanismes dédiés à la bouche, aux yeux, aux sourcils et au cou, le tout recouvert d'une peau en silicone réaliste destinée à reproduire une apparence et des expressions humaines crédibles. Côté logiciel, l'architecture combine plusieurs modèles spécialisés : SCRFD, ArcFace et ByteTrack pour la reconnaissance et le suivi des visages, associés à Llama pour le traitement du langage naturel et à Whisper pour la reconnaissance vocale. L'ensemble fonctionne en temps réel et intègre une fonction de ré-identification permettant au robot de reconnaître une personne déjà rencontrée. Une étude utilisateur a mesuré quantitativement les capacités conversationnelles et de ré-identification du système, tandis que son expressivité émotionnelle et sa ressemblance humaine ont été évaluées séparément, obtenant un score moyen de similarité humaine de 4,13 sur 5. Ce travail illustre une tendance de fond dans la robotique sociale : la course ne se joue plus seulement sur la mobilité ou la manipulation, comme chez les humanoïdes industriels type Figure 03 ou Optimus, mais aussi sur l'interaction faciale fine, jugée déterminante pour l'acceptabilité dans des rôles d'accueil, d'éducation ou de service. Un score de 4,13/5 en similarité humaine, obtenu via une étude utilisateur et non une simple démonstration vidéo, constitue une donnée relativement solide face à l'inflation habituelle de communiqués promettant un réalisme "sans précédent". Pour les intégrateurs et décideurs B2B envisageant des déploiements en accueil ou en relation client, ce type de plateforme à 21 DoF avec pile logicielle ouverte (Llama, Whisper) montre qu'une expressivité crédible reste accessible sans recourir à des architectures propriétaires fermées. Le développement de têtes robotiques expressives répond à des limites connues du secteur : coûts élevés, complexité mécanique et faible adaptabilité des solutions existantes à des environnements variés. Contrairement aux humanoïdes généralistes de grande taille conçus pour la logistique ou l'industrie, cette approche cible spécifiquement l'interaction sociale localisée, un segment où des acteurs comme Enchanted Tools ou Pollen Robotics explorent également des pistes d'expressivité et d'accueil, sans toutefois atteindre le même niveau de granularité faciale. Les auteurs ne précisent pas encore de calendrier de commercialisation ni de site pilote concret, l'étude restant à ce stade au niveau de la validation en laboratoire.

RecherchePaper
1 source
Robotique : les véritables gagnants seront-ils les fournisseurs de composants ?
54Robot Magazine FR 

Robotique : les véritables gagnants seront-ils les fournisseurs de composants ?

Pendant que les projecteurs se braquent sur Tesla, Figure AI, Unitree ou Agility Robotics, une note d'analyse de Morgan Stanley déplace le regard vers les fournisseurs de composants qui équiperont ces machines, quel que soit le vainqueur de la course aux humanoïdes. Son argument central repose sur les roulements de précision : un drone en embarque plusieurs, un robot industriel classique plusieurs dizaines, et un robot humanoïde avancé peut en intégrer plus de 70, répartis dans les épaules, coudes, poignets, hanches, genoux, chevilles et actionneurs des mains. À cette liste s'ajoutent les réducteurs harmoniques, les actionneurs électromécaniques, les moteurs couple, les vis à billes, les encodeurs absolus, les capteurs de force et de couple, les caméras industrielles et les semi-conducteurs spécialisés pour l'IA embarquée, autant de briques technologiques difficilement substituables. La note cite plusieurs industriels européens déjà positionnés sur ce segment : SKF, Schaeffler, THK Europe, Bosch Rexroth et SEW-Eurodrive, tous dotés d'une expertise reconnue en mécanique de précision. Pour les intégrateurs et les décideurs industriels, cette lecture déplace le centre de gravité de la valeur. Plutôt que de parier sur tel constructeur de robot humanoïde, dont la viabilité commerciale reste incertaine, l'analyse invite à regarder les fournisseurs dont les pièces équiperont l'ensemble du marché, indépendamment de l'issue de la compétition entre marques. L'analogie avec les vendeurs de pelles de la ruée vers l'or, ou avec NVIDIA, TSMC et ASML dans la vague IA, reprend une thèse d'investissement classique : dans une phase de compétition ouverte entre nombreux acteurs finaux, ce sont souvent les fournisseurs d'infrastructures qui captent une valeur récurrente et moins risquée. Plus les robots gagnent en dextérité, mains et poignets multi-axes en tête, plus la densité de composants de haute précision par machine augmente, ce qui suggère un marché de composants croissant plus vite, et de façon plus prévisible, que celui des robots finis eux-mêmes. Cette lecture s'inscrit dans un débat plus large sur la souveraineté industrielle européenne. Les tensions récentes sur les semi-conducteurs ont déjà montré les risques d'une dépendance excessive envers un nombre restreint de fournisseurs étrangers pour des composants jugés stratégiques. Dans la robotique, le même schéma pourrait se reproduire : roulements, réducteurs et actionneurs sont indispensables mais restent largement absents des radars politiques, à l'inverse des robots eux-mêmes qui concentrent l'attention médiatique et les annonces spectaculaires. Le maintien d'une base industrielle dans ces composants, portée par des groupes déjà implantés comme SKF ou Schaeffler, est présenté comme un levier de compétitivité pour l'Europe face à la croissance attendue des marchés de la robotique industrielle, logistique, médicale et humanoïde dans la décennie à venir. Reste à voir si ces acteurs traditionnels sauront monter en cadence assez vite pour répondre à des spécifications inédites, notamment pour les mains et poignets multi-DOF des humanoïdes.

UEPlusieurs industriels europeens (SKF, Schaeffler, THK Europe, Bosch Rexroth, SEW-Eurodrive) sont deja positionnes sur le marche des composants de precision pour humanoides, ce qui souleve un enjeu de souverainete industrielle pour l'UE face a la dependance aux fournisseurs etrangers.

FR/EU ecosystemeOpinion
1 source
Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action
55arXiv cs.RO 

Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action

Des chercheurs publient sur arXiv (2607.14635v1) une étude sur les modèles vision-langage-action (VLA), remettant en question la manière dont la supervision par action est utilisée pour entraîner ces systèmes. Traditionnellement traitée comme un simple objectif d'apprentissage en aval pour prédire les actions, cette supervision agit en réalité comme une force qui remodèle les représentations multimodales héritées des modèles vision-langage préentraînés. Les auteurs montrent que cet effet est double : il est indispensable pour construire des représentations compatibles avec l'action, mais lorsqu'il est appliqué trop directement sur le flux multimodal hérité, il déstabilise aussi les capacités de traitement du langage et d'ancrage des objets. Pour résoudre cette tension, l'équipe introduit Action QFormer, une interface à base de requêtes conditionnées par les instructions, qui réorganise les informations multimodales héritées en représentations orientées action avant la génération des commandes. En navigation zero-shot sim-to-real, cette architecture fait bondir le taux de réussite moyen des tâches en boucle fermée de 18,8% à 56,3%, la justesse de génération d'action à instruction fixe de 22,5% à 75,5%, et réduit quasiment à zéro les générations d'instructions hors distribution. Ce résultat touche un point sensible du secteur robotique : l'écart persistant entre démonstrations impressionnantes et performances réelles en conditions variables, souvent attribué au fossé sim-to-real. En multipliant par trois le taux de succès en navigation zero-shot, Action QFormer suggère que les gains de performance des VLA ne viendront pas uniquement de backbones préentraînés plus puissants, à la manière de Pi-0, GR00T N2 ou Helix, mais aussi de la façon dont l'information multimodale héritée est sélectionnée et organisée avant d'être exposée à la supervision par action. Pour les intégrateurs et équipes de recherche robotique, ce travail envoie un signal clair : le simple passage à l'échelle des données d'action ou le fine-tuning direct sur des architectures VLM existantes comporte un risque de dégradation silencieuse des capacités de compréhension du langage et de perception, un compromis rarement documenté dans les communications commerciales. Ce travail s'inscrit dans la lignée des modèles VLA apparus depuis RT-2 et OpenVLA, qui adaptent des architectures vision-langage préentraînées à la prédiction directe d'actions robotiques, approche depuis reprise par des laboratoires comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix. La question de la préservation des capacités multimodales sous supervision d'action rejoint des préoccupations déjà observées ailleurs dans le secteur, où l'écart entre vidéos de démonstration sélectionnées et déploiement réel reste un sujet de vigilance éditoriale. Les auteurs positionnent Action QFormer comme une brique architecturale plutôt qu'un produit fini, validée pour l'instant sur des tâches de navigation en environnement simulé puis réel ; la suite logique serait son extension à des tâches de manipulation avec davantage de degrés de liberté, ainsi que sa validation sur des backbones VLA de plus grande échelle.

IA physiqueActu
1 source
China vise 1 000 robots humanoïdes Iron par mois avant un déploiement mondial en 2027
56Interesting Engineering 

China vise 1 000 robots humanoïdes Iron par mois avant un déploiement mondial en 2027

Xpeng, le constructeur chinois de véhicules électriques, accélère la production de son robot humanoïde Iron avec l'objectif de dépasser 1 000 unités par mois d'ici fin 2026, en vue d'un déploiement mondial prévu pour 2027. Les premiers exemplaires seront installés comme assistants de vente dans les showrooms chinois de la marque au premier trimestre 2027, avant une extension aux magasins à l'étranger dans la seconde moitié de l'année, selon des sources citées par le Wall Street Journal et relayées par CNEV Post. Dévoilé lors de l'AI Day de Xpeng en novembre 2025, Iron mesure 178 cm pour 70 kg, des proportions proches de celles d'un adulte moyen. Sa structure mécanique s'inspire de la colonne vertébrale et du système musculo-squelettique humains, avec des actionneurs imitant des muscles synthétiques répartis sur 62 articulations actives, et des mains offrant 22 degrés de liberté capables de manipuler aussi bien des objets fragiles que des outils plus lourds. Le robot embarque trois puces Turing développées en interne, pour une puissance de calcul cumulée de 2 250 TOPS, une batterie tout solide, et le modèle Vision-Language-Action maison de Xpeng, entraîné sur des milliers d'heures de données de mouvement humain, qui lui permettrait de marcher jusqu'à 2 mètres par seconde. Cette montée en cadence de production intéresse directement l'écosystème de la robotique humanoïde, où l'écart entre démonstrations scéniques et déploiements industriels réels reste la question centrale. Iron avait déjà fait parler de lui pour de mauvaises raisons : sa démarche jugée si fluide sur scène a poussé certains observateurs à soupçonner qu'un humain se trouvait à l'intérieur, obligeant le PDG He Xiaopeng à exposer publiquement la structure mécanique interne du robot pour couper court aux doutes. Un objectif de 1 000 unités mensuelles, si tenu, placerait Xpeng parmi les rares acteurs à afficher des volumes de fabrication significatifs sur ce segment, aux côtés de Tesla (Optimus) et Figure AI (Figure 03). Mais l'usage annoncé, assistant de vente en showroom, reste pour l'instant un déploiement à faible risque opérationnel comparé à des tâches industrielles ou logistiques, ce qui invite à relativiser la portée de l'annonce tant qu'aucun pilote en usage réel n'est documenté. Ce virage s'inscrit dans une stratégie plus large de Xpeng, qui cherche à transformer son savoir-faire en conduite autonome et en intelligence artificielle embarquée, développé pour ses véhicules électriques, en une offre d'IA physique plus large. L'entreprise a récemment présenté ce qu'elle présente comme le premier robotaxi chinois entièrement développé en interne et prêt pour la production, bâti sur sa plateforme GX et conçu pour répondre aux standards de conduite autonome de niveau 4. Sur le marché des humanoïdes, Xpeng affronte une concurrence dense, entre les groupes chinois rivaux comme Unitree ou UBTech, et les acteurs américains Tesla et Figure AI, ainsi que des laboratoires spécialisés dans les modèles VLA comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2). La feuille de route reste pour l'instant celle d'un teaser industriel : la production de masse et le calendrier de déploiement en Chine puis à l'international pour 2027 restent à confirmer par des livraisons effectives, aucun contrat commercial concret n'ayant été détaillé à ce stade.

Chine/AsieActu
1 source
Xiaomi déploie ses robots sur la chaîne de production automobile : opérations flexibles sur pièces réussies
57Pandaily 

Xiaomi déploie ses robots sur la chaîne de production automobile : opérations flexibles sur pièces réussies

Xiaomi a déployé son robot humanoïde sur la ligne de production de la SU7, sa berline électrique, où il exécute désormais deux nouvelles tâches avec un taux de réussite supérieur à 90 % en fonctionnement continu, après seulement six mois d'entraînement en usine. La première consiste à trier des panneaux latéraux de console centrale, des pièces souples et de forme irrégulière extraites de bacs répartis sur trois rangées puis placées avec précision dans un support de fixation. Pour atteindre les pièces au fond d'un bac, le robot stabilise son centre de gravité en agrippant le bord du bac d'une main pendant qu'il tend l'autre, puis réalise plusieurs transferts main à main pour ajuster l'orientation de la pièce avant de la positionner ; en cas de résistance à la pose, il la retire, corrige l'angle et retente automatiquement. La seconde tâche, le pliage et le recyclage de cartons, exige d'ouvrir des loquets avec un contrôle fin de la force des doigts, de plier les boîtes à deux bras puis d'empiler et pousser les unités vers un poste cible, plusieurs robots coordonnant leur cadence avec celle de la chaîne. Six mois plus tôt, ce même robot se limitait à un poste unique de vissage d'écrous autotaraudeurs, avec une fiabilité annoncée de 98 %. Ces chiffres proviennent des communications de Xiaomi et n'ont pas été vérifiés de façon indépendante, ce qui invite à une certaine prudence sur leur portée réelle en conditions de production non filmées. Cette progression prend une dimension particulière face à la déclaration d'Elon Musk en janvier 2026, selon laquelle Optimus n'était pas encore capable d'un travail utile en usine. Que Xiaomi, acteur de l'électronique grand public sans passé industriel en robotique, affiche une trajectoire comparable à celle de Figure 03 chez BMW, référence actuelle du secteur pour le déploiement d'humanoïdes en usine, resserre l'écart perçu entre démonstration et exploitation réelle. La capacité du robot à détecter une résistance et à adapter son geste en cours d'opération, grâce à un retour de force proprioceptif, le distingue des robots industriels classiques, programmés pour des positions fixes et incapables de gérer un imprévu. Pour les intégrateurs et décideurs industriels, ce type de compliance active laisse entrevoir des robots capables de traiter des pièces souples et variables, un usage jusqu'ici hors de portée de l'automatisation rigide. Le robot avait été présenté pour la première fois en avril 2026 lors de la conférence investisseurs de Xiaomi, où il serrait des mains et distribuait des cadeaux, un registre purement social et démonstratif. Le passage en six mois vers des tâches industrielles à cadence de ligne s'inscrit dans une course mondiale aux humanoïdes de production où s'affrontent déjà Tesla avec Optimus, Figure avec son modèle 03 chez BMW, et les architectures VLA comme Pi-0 ou GR00T N2. Xiaomi ne détaille pas de calendrier de déploiement à plus grande échelle, mais la vitesse de cette itération fixe un repère agressif pour l'ensemble du secteur.

IndustrielOpinion
1 source
NVIDIA explique comment évaluer les politiques robotiques polyvalentes en conditions réelles
58Robotics Business Review 

NVIDIA explique comment évaluer les politiques robotiques polyvalentes en conditions réelles

NVIDIA a publié un billet technique détaillant les limites actuelles des méthodes d'évaluation des modèles fondation pour la robotique généraliste, ainsi que RoboLab, sa plateforme de benchmarking en simulation censée y répondre. L'entreprise identifie quatre failles structurelles dans les protocoles de test existants. D'abord, un chevauchement du domaine visuel entre entraînement et évaluation : quand un modèle est affiné puis testé dans le même environnement simulé, un bon score ne prouve que sa mémorisation du décor, pas sa capacité de généralisation. Les approches dites real2sim, qui reconstruisent des scènes photoréalistes à partir d'images réelles via inpainting ou Gaussian splatting, corrigent partiellement ce biais mais exigent souvent plus d'une heure de préparation par scène, ce qui rend les tests à grande échelle peu praticables. Ensuite, la plupart des benchmarks reposent sur un jeu de tâches figé, vite saturé : lorsque tous les modèles dépassent 90% de réussite sur le même test, les chiffres perdent leur pouvoir discriminant. NVIDIA pointe aussi un déficit de diagnostic, un simple score de succès binaire ne dit rien sur la cause d'un échec (confusion de couleur, formulation de l'instruction, décalage de caméra). Enfin, l'entreprise soulève un problème de fiabilité statistique : un taux de succès mesuré sur un petit nombre d'essais peut tromper. Exemple donné, une politique affichant 90% de réussite sur seulement 70 rollouts a, selon la méthode de Clopper-Pearson pour calculer un intervalle de confiance binomial exact, un intervalle de confiance à 95% qui s'étend sur 15,4 points de pourcentage, un écart énorme pour un chiffre présenté comme une performance unique. L'exemple illustratif porte sur la politique pi-0.5 de Physical Intelligence testée sur une tâche de tri d'objets ("poser la tasse à mesurer orange et la tasse bleue en dehors de l'assiette"). Pour les intégrateurs et décideurs B2B qui doivent choisir entre plusieurs modèles vision-language-action (VLA) pour équiper des bras ou des humanoïdes, ce travail est une mise en garde directe contre les chiffres de communiqués de presse. Un score de succès affiché sans intervalle de confiance ni contrôle du chevauchement visuel peut masquer un simple surapprentissage plutôt qu'une réelle capacité de généralisation en conditions réelles. Cela renforce l'hypothèse, déjà répandue dans le secteur, d'un écart persistant entre démonstrations et déploiement effectif, et invite à exiger des fournisseurs des protocoles d'évaluation reproductibles plutôt que des vidéos sélectionnées. Cette initiative s'inscrit dans l'effort plus large de NVIDIA autour des fondations robotiques, aux côtés de ses plateformes Isaac Sim et Isaac Lab, dans un secteur où rivalisent des laboratoires comme Physical Intelligence (pi-0, pi-0.5), Google DeepMind (Gemini Robotics) ou Figure AI. À mesure que les modèles VLA généralistes se multiplient, la question de la mesure standardisée devient centrale pour départager annonces marketing et progrès réels, et RoboLab se positionne comme une tentative de fournir un cadre commun avant que le marché ne soit inondé de comparatifs invérifiables.

IA physiquePaper
1 source
FlowDAgger : adaptation en boucle humaine des politiques génératives de robots dans l'espace latent
59arXiv cs.RO 

FlowDAgger : adaptation en boucle humaine des politiques génératives de robots dans l'espace latent

Microsoft Research publie FlowDAgger, une méthode d'adaptation des politiques robotiques génératives figées, via des interventions humaines directement dans l'espace latent (arXiv:2607.08877v1, prépublication non revue par les pairs). L'idée centrale, appelée « inversion d'action », consiste à faire correspondre chaque action démontrée par un opérateur humain au bruit qui, injecté dans la politique de base pré-entraînée (fondée sur le flow matching ou la diffusion), aurait produit cette même action. Ce bruit est retrouvé par intégration en temps inverse puis affiné localement, et sert ensuite à entraîner une politique latente légère qui vient piloter le modèle de base au moment du déploiement. L'équipe a testé la méthode en simulation et sur des tâches réelles de manipulation bi-bras et mono-bras, en adaptant à la fois des modèles VLA à tête d'action et des modèles dits « world-action », à partir d'une poignée d'interventions humaines seulement. L'enjeu dépasse la prouesse technique isolée : les politiques génératives pré-entraînées, aussi performantes soient-elles en démonstration, échouent régulièrement une fois sorties de leur distribution d'entraînement en conditions réelles. Jusqu'ici, corriger ces failles imposait soit de recollecter massivement des données, soit de lancer de l'apprentissage par renforcement en ligne sur du matériel physique, deux options lentes, coûteuses et risquées pour un robot en production. FlowDAgger propose une correction à faible coût d'échantillons et de calcul, qui préserve les compétences déjà acquises sur des tâches non revues, un point critique pour des modèles fondation coûteux à réentraîner comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI. Selon les auteurs, la méthode surpasse à la fois le fine-tuning supervisé classique et les approches de RL en espace latent sur les mêmes benchmarks. FlowDAgger s'inscrit dans la lignée de DAgger, algorithme classique d'apprentissage par imitation avec correction humaine en boucle, mais transposé à l'espace de bruit latent propre aux politiques par diffusion ou flow matching. Elle rejoint une vague plus large de travaux cherchant à rendre les politiques robotiques génératives pré-entraînées adaptables sur le terrain sans tout réentraîner. L'abstract ne précise pas de calendrier de mise à disposition du code ni de partenaire industriel ; seul un site de démonstration accompagne pour l'instant la publication.

RecherchePaper
1 source
« NEO, le robot humanoïde, reçoit de nouvelles mains à 25 degrés de liberté pour construire des LEGO et attraper des balles »
60Interesting Engineering 

« NEO, le robot humanoïde, reçoit de nouvelles mains à 25 degrés de liberté pour construire des LEGO et attraper des balles »

La société norvégienne 1X Technologies a dévoilé une nouvelle génération de mains pour son robot humanoïde NEO, dotées de 25 degrés de liberté (DOF) et d'un système d'entraînement par tendons. Le design comprend 22 articulations actionnées réparties entre doigts et paume, plus trois au poignet, l'ensemble étant entièrement contrôlé en force et rétro-entraînable grâce à des rapports de réduction faibles, entre 5:1 et 15:1, contre des ratios bien plus élevés habituellement utilisés en robotique. Le pouce peut développer un couple de crête de 3,5 Nm, les articulations des doigts jusqu'à 2,6 Nm, avec une force de flexion au bout des doigts atteignant 45 newtons ; le poignet délivre 17,75 Nm de couple. La précision de positionnement est annoncée à ±0,2 mm. Les mains sont étanches IP68, fabriquées en matériaux alimentaires et peuvent être lavées sous l'eau courante ; 1X affirme avoir testé les composants sur plusieurs millions de cycles, et les poignets au-delà de deux millions de cycles sous charge. Des démonstrations vidéo montrent NEO assemblant des LEGO, manipulant vis et pièces de monnaie, utilisant un tournevis, versant du thé, attrapant une balle molle ou branchant un connecteur USB-C. La production de ces nouvelles mains a démarré sur une ligne dédiée à l'usine californienne où 1X a récemment entamé la production en série de NEO. L'enjeu dépasse la simple démonstration technique : en rendant chaque articulation capable de mesurer les forces de contact sans dépendre uniquement de capteurs externes, et en combinant cela à des capteurs tactiles répartis sur les doigts, 1X cherche à déplacer le goulot d'étranglement de la manipulation robotique du matériel vers les données d'entraînement et l'IA. C'est une affirmation structurante pour tout le secteur des humanoïdes, qui peine encore à distinguer les démonstrations soignées des capacités réellement déployables en conditions réelles. Si les chiffres de couple et de précision sont vérifiables sur le papier, les vidéos de démonstration restent, comme souvent dans l'industrie, des séquences sélectionnées, sans garantie de taux de réussite en conditions non contrôlées. Reste que la fiabilité annoncée, testée sur plusieurs millions de cycles, et l'entrée en production de masse constituent des signaux plus concrets que la seule communication marketing. 1X, anciennement Halodi Robotics, positionne NEO comme un robot destiné aux tâches domestiques, un segment que peu d'acteurs humanoïdes ciblent frontalement, la plupart des concurrents comme Figure (Figure 03), Tesla (Optimus) ou Agility Robotics visant d'abord l'industrie et la logistique. Cette annonce s'inscrit dans une escalade générale de la course à la dextérité manuelle, où chaque acteur cherche à prouver que ses robots franchissent le seuil de la manipulation fine utile. La suite dépendra des volumes réels de déploiement en foyers et de la capacité de 1X à alimenter ces mains avec des modèles d'IA suffisamment robustes pour exploiter ce nouveau potentiel matériel.

HumanoïdesActu
1 source
LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)
61Pandaily 

LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)

Ant Group, via sa division robotique LingBot, a dévoilé LingBot-Depth 2.0, un modèle de perception spatiale construit sur un nouveau modèle de vision baptisé LingBot-Vision, présenté comme le premier modèle de fondation vision nativement conçu pour la perception spatiale en IA incarnée. L'entreprise revendique douze résultats inédits sur des benchmarks publics et privés, une affirmation à prendre avec précaution puisqu'elle émane de son propre communiqué. Avec environ 1,1 milliard de paramètres, soit environ un septième des 7 milliards de DINOv3 de Meta, et moins d'un tiers de son volume d'entraînement, LingBot-Vision affirme surpasser DINOv3 sur le benchmark d'estimation de profondeur NYUv2. Le modèle cible trois défauts classiques de l'estimation de profondeur: le flou des contours, la détection des petits objets et le bruit sur les longues distances. LingBot-Depth 2.0 revendique une clarté de contours suffisante pour de la planification de trajectoire de bras robotique au millimètre près, une meilleure détection des câbles et fils fins, un filtrage du bruit pour les obstacles distants, et des cartes de profondeur stables face aux surfaces réfléchissantes, objets transparents, obscurité et environnements encombrés. Le modèle et son code sont disponibles en open source sur Hugging Face, ModelScope et GitHub, avec un rapport technique publié sur arXiv. Ant Group a aussi noué un partenariat avec ORBBEC, fabricant chinois de capteurs 3D, dont le laboratoire Depth Vision Lab a validé le modèle; la collaboration produit un nouveau dispositif de collecte EGO-RGBD, une intégration SDK pour le matériel ORBBEC, et une future caméra intégrée sans réglage algorithmique complexe. La sortie illustre un pari de plus en plus partagé en IA incarnée: les modèles de vision entraînés sur des images web généralistes, comme DINOv3, reconnaissent des objets mais ignorent leur géométrie précise, ce qui limite leur usage pour des robots devant saisir, éviter ou manipuler des objets réels. En intégrant la compréhension spatiale dès l'entraînement, LingBot-Vision s'attaque à l'écart entre perception "de spectateur" et perception "d'acteur", un enjeu central pour les modèles vision-langage-action qui pilotent bras robotiques et humanoïdes. Le passage du papier de recherche à un partenariat matériel concret avec ORBBEC, plutôt qu'une simple démonstration, est le signal le plus tangible pour les intégrateurs: un début de commercialisation réelle plutôt qu'un prototype isolé. Gérer nativement les cas difficiles, surfaces réfléchissantes, câblage fin, objets transparents, est précisément ce qui bloque aujourd'hui le déploiement en environnement réel non contrôlé. Ant Group, mieux connu pour Alipay, a multiplié ces derniers mois les investissements en robotique et IA incarnée via LingBot, dans un contexte de compétition intense entre laboratoires chinois et américains sur les modèles de fondation pour robots. La comparaison affichée avec DINOv3, modèle phare de Meta, positionne explicitement l'entreprise face aux géants américains sur la perception, pendant que d'autres acteurs, Figure AI avec Figure 03, Tesla avec Optimus, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Google DeepMind avec Helix, se concentrent davantage sur les modèles d'action et le contrôle moteur. LingBot-Vision se positionne ainsi comme une brique de perception complémentaire, potentiellement intégrable en amont de ces systèmes. Le partenariat avec ORBBEC laisse présager un déploiement progressif dans les prochains mois, avec l'arrivée annoncée d'une caméra grand public intégrant directement le traitement 3D, un jalon qui déterminera si les gains annoncés sur benchmarks se traduisent en performance réelle chez les intégrateurs industriels.

IA physiqueActu
1 source
Humanoid : l'apprentissage par renforcement KinetIQ Ascend atteint une dextérité proche de l'humain
62Robotics Business Review 

Humanoid : l'apprentissage par renforcement KinetIQ Ascend atteint une dextérité proche de l'humain

La société londonienne Humanoid a dévoilé la semaine dernière KinetIQ Ascend, une méthode d'apprentissage par renforcement (RL) visant une fiabilité de manipulation de 99,9% à une vitesse égale ou supérieure à celle d'un humain. Ce module s'ajoute à KinetIQ, le framework IA propriétaire à quatre couches de l'entreprise, et permet à ses robots d'affiner directement sur le terrain des comportements de base plutôt que de dépendre de mois de réglages manuels. Sur un test de prélèvement de pièces (bagues de roulement en acier extraites d'un bac et déposées sur un convoyeur), le débit a augmenté de 42%, portant la vitesse du robot à 1,5 fois celle des démonstrations humaines initiales. Sur une tâche de tri dans un bac encombré avec remise d'objets à une personne, le débit a grimpé de 85% et le taux de réussite est passé de 80% à 98%. Sur une troisième tâche bimanuelle, soulever un bac à deux bras, le débit a plus que doublé et le taux de réussite est passé de 78% à 99%, soit une division par vingt du taux d'échec. Tous ces résultats ont été obtenus après seulement quelques jours d'entraînement, selon Humanoid, qui affirme aussi que la performance progresse de façon prévisible avec le temps d'entraînement, une dynamique comparée par l'entreprise à celle des grands modèles de langage face au calcul et aux données. Ces chiffres, qu'il faut prendre avec la prudence habituelle réservée aux communiqués d'entreprise (résultats en laboratoire, tâches choisies par Humanoid elle-même), interviennent à un moment où le secteur cherche justement à sortir du stade de la démonstration pour prouver une fiabilité industrielle exploitable en production. La promesse centrale de KinetIQ Ascend est de réduire drastiquement le temps de mise au point d'une nouvelle compétence robotique: au lieu de collecter des données et calibrer manuellement chaque geste pendant des mois, l'entreprise part d'un comportement basique que le RL affine ensuite jusqu'à un niveau déployable, ce qu'elle appelle une "capability factory". Si les gains de généralisation à des objets non vus à l'entraînement se confirment à plus grande échelle, cela toucherait un point sensible du secteur: la difficulté historique des robots humanoïdes à transférer une compétence apprise en simulation ou en démonstration vers des variations réelles du monde physique, le fameux écart sim-to-real. Pour les intégrateurs et décideurs industriels, la question reste de savoir si ces taux de réussite tiennent sur des lignes de production réelles, avec la variabilité des pièces, l'éclairage et les pannes, et non uniquement sur les scénarios contrôlés présentés par l'entreprise. Humanoid a été fondée en 2024 par Artem Sokolov et revendique plus de 250 ingénieurs et chercheurs issus des grandes entreprises technologiques, avec des bureaux à Londres, Boston, Vancouver et San Diego. L'entreprise affiche l'ambition de devenir le numéro un mondial de la robotique humanoïde industrielle généraliste sous deux ans, un objectif qui la place en concurrence directe avec des acteurs comme Figure AI, Tesla avec Optimus, ou les développeurs de modèles VLA tels que Pi-0 de Physical Intelligence et GR00T de Nvidia. En mai, Humanoid s'est associée à Bosch et Schaeffler pour industrialiser la production de ses robots HMND, un partenariat qui ancre l'entreprise du côté de la fabrication à grande échelle plutôt que de la seule recherche. Jarad Cannon, directeur technique de Humanoid, présente KinetIQ Ascend comme la preuve que la course aux robots humanoïdes devient une question d'échelle, où le RL en conditions réelles jouerait un rôle central pour faire passer ces machines du statut de démonstrations impressionnantes à celui d'outils réellement exploitables par l'industrie. L'entreprise a publié un rapport technique détaillant ces résultats, sans toutefois préciser de calendrier de déploiement commercial concret pour cette nouvelle capacité.

UELe partenariat de Humanoid avec les groupes allemands Bosch et Schaeffler pour industrialiser les robots HMND ancre indirectement cette avancée technologique dans l'écosystème industriel européen.

HumanoïdesActu
1 source
Robots humanoïdes en première ligne : du salon d'exposition à l'usine comme employés vedettes
63Pandaily 

Robots humanoïdes en première ligne : du salon d'exposition à l'usine comme employés vedettes

Ekans robotisés humanoïdes quittent le laboratoire pour entrer en production réelle, comme l'a rapporté China Central Television. Dans un atelier de fabrication de tablettes à Nanchang, huit robots humanoïdes ont été déployés comme inspecteurs qualité, chacun effectuant des cycles d'inspection en environ 20 secondes avec une précision de deux millimètres. Le directeur d'usine Zhang Long a souligné que si l'efficacité reste inférieure à celle des bras robotiques traditionnels et des ouvriers humains, l'avantage en flexibilité est net : contrairement aux bras fixes qui nécessitent des semaines de reconfiguration à chaque nouveau produit, les robots humanoïdes peuvent être réaffectés à d'autres postes en quelques heures. Le déploiement n'a pas été sans accroc, les robots déclenchaient accidentellement les boutons d'allumage des tablettes, provoquant des échecs d'inspection, jusqu'à ce que le chef de projet Yang Shukai développe des pinces ajustables permettant un réglage de cinq millimètres selon le modèle. Le robot n°3 a connu jusqu'à 31 blocages en une seule journée, nécessitant un réentraînement dédié. Depuis mars, les deux premiers robots totalisent 3 000 heures de fonctionnement stable et approchent d'un déploiement permanent ; l'usine prévoit 50 unités d'ici la fin de l'année, avec une adoption massive envisagée vers 2028. À Shenzhen, trois robots humanoïdes travaillent de nuit depuis six mois dans un centre logistique pour trier les colis destinés à la livraison le jour même. Ces déploiements illustrent un basculement significatif pour le secteur : le passage de la démonstration scénique au poste de travail réel, avec des métriques opérationnelles vérifiables plutôt que des vidéos soigneusement sélectionnées. Le cas du centre logistique de Shenzhen est particulièrement parlant sur l'écart entre promesse et réalité initiale : les robots ne triaient au départ que 100 colis par heure contre 500 à 600 pour un ouvrier humain, avec un taux d'erreur élevé et une incapacité à manipuler les gros colis. L'équipe a identifié la cause racine, un manque de données d'entraînement, et déployé deux correctifs : des collecteurs de données dédiés enregistrant diverses actions de saisie et de retournement de colis, et une refonte des postes de tri avec des surfaces inclinées réduisant les mouvements de rotation et de flexion des robots. Résultat après six mois d'apprentissage intensif : l'efficacité de tri est passée de 100 à 900 colis par heure, soit 85% de la performance humaine. Pour les intégrateurs et décideurs industriels, ces chiffres suggèrent que l'écart sim-to-real et le problème des données d'entraînement en conditions réelles, souvent pointés comme obstacles majeurs à la commercialisation des VLA (vision-language-action), peuvent être résolus par itération sur site plutôt que par une percée algorithmique unique. Ce mouvement s'inscrit dans une compétition mondiale intense où la Chine pousse fortement le déploiement industriel de robots humanoïdes, aux côtés d'acteurs comme Figure AI (Figure 03), Tesla (Optimus Gen 3) ou Physical Intelligence (Pi-0) aux États-Unis, et NVIDIA avec sa plateforme GR00T N2 fournissant des briques logicielles à plusieurs fabricants. Plus de dix centres logistiques chinois testent actuellement des robots humanoïdes en formation sur le terrain, affinant leurs compétences en conditions réelles plutôt qu'en environnement contrôlé. Aucun acteur français ou européen (Wandercraft, Exotec, Pollen Robotics, Enchanted Tools) n'est mentionné dans ces déploiements chinois, signe que la course à l'industrialisation du robot humanoïde reste pour l'instant dominée par les écosystèmes chinois et américain. Les prochaines étapes annoncées, passage à 50 unités chez le fabricant de tablettes d'ici fin 2026 et généralisation attendue vers 2028, donneront une indication concrète de la vitesse réelle de cette transition, entre promesse marketing et adoption industrielle durable.

UEAucun acteur français ou européen n'est mentionné dans ces déploiements industriels, ce qui souligne le risque de retard concurrentiel pour l'écosystème robotique européen face à l'avance prise par la Chine et les États-Unis dans l'industrialisation des robots humanoïdes.

Chine/AsieOpinion
1 source
UBTech déploie ses robots humanoïdes pour contrôler les foules à une frontière internationale chinoise très fréquentée
64Interesting Engineering 

UBTech déploie ses robots humanoïdes pour contrôler les foules à une frontière internationale chinoise très fréquentée

La Chine a commencé à déployer des robots humanoïdes au poste-frontière de Fangchenggang, dans la région du Guangxi, l'un des points de passage les plus fréquentés avec le Vietnam. Le site, qui englobe le port de Dongzhong et celui de Dongxing voisin, gère un trafic quotidien important de camions de fret, de bus et de voyageurs, générant des embouteillages lors des contrôles douaniers. Les autorités frontalières ont acheté des robots Walker S2 du fabricant chinois UBTech Robotics dans le cadre d'un contrat évalué à environ 40 millions de dollars, sans préciser le nombre d'unités commandées ; les premières livraisons ont débuté pour un déploiement dans les hubs de transit clés. Le Walker S2 mesure 1,76 mètre, dispose de 52 degrés de liberté et peut soulever jusqu'à 15 kg par bras grâce à des mains articulées dextres. Il embarque un système de double batterie interchangeable pour un fonctionnement quasi continu, ainsi qu'une pile logicielle baptisée BrainNet 2.0 couplée à une vision stéréo binoculaire pour la navigation autonome et l'équilibre dynamique. Dans le terminal passagers, les robots détectent les engorgements de foule, orientent les voyageurs vers des files organisées et répondent en plusieurs langues aux questions sur les procédures douanières. Côté fret, d'autres unités scannent codes-barres, numéros de série et manifestes numériques sur les conteneurs, puis transmettent les données croisées avec les bases douanières à des agents humains pour validation. UBTech a par ailleurs présenté récemment sa gamme UWORLD U1, décrite par l'entreprise comme la première ligne de robots humanoïdes « ultra-bioniques » grandeur nature conçue pour la production de masse, une affirmation qui reste à vérifier à l'échelle industrielle. Ce déploiement constitue un test grandeur nature bien plus exigeant que les usines contrôlées où évoluent habituellement les humanoïdes commerciaux : humidité côtière, poussière, intempéries et flux constant de voyageurs et de véhicules. C'est précisément ce type d'épreuve qui permettra de juger si la robotique humanoïde a dépassé le stade de la démonstration scénarisée pour tenir dans la durée en conditions réelles, l'écart entre promesse et réalité restant l'un des points de friction majeurs du secteur. Pour les intégrateurs et décideurs industriels, l'enjeu dépasse le seul cas d'usage douanier : Pékin présente explicitement ce projet comme un pilote susceptible de s'étendre aux aéroports, gares ferroviaires internationales et ports maritimes si les résultats sont concluants, ce qui en ferait un cas d'école pour l'automatisation des services publics à grande échelle. Le déploiement soulève aussi des questions pratiques et juridiques non résolues : le temps d'adaptation des voyageurs face à des machines assurant des tâches de service et de sécurité, et la répartition des responsabilités en cas d'erreur opérationnelle d'un robot lors d'une inspection ou d'un contrôle. Les tâches critiques de sécurité et les décisions relevant des forces de l'ordre restent, en l'état, hors du périmètre confié aux machines. Le contrat de Fangchenggang s'inscrit dans la stratégie plus large de la Chine visant à accélérer l'adoption de l'IA et de la robotique dans les infrastructures publiques, un axe porté à la fois par les autorités locales et par la politique industrielle nationale de soutien aux acteurs de la robotique humanoïde comme UBTech, Unitree ou AgiBot. UBTech a construit sa position sur des contrats industriels et logistiques avant d'étendre le Walker S2 à des environnements publics, une trajectoire distincte de celle d'acteurs américains comme Figure (Figure 03, associé au modèle Helix) ou Tesla (Optimus Gen 3), encore essentiellement cantonnés à des pilotes en usine, tandis que des plateformes comme GR00T N2 de Nvidia ou Pi-0 continuent de viser l'apprentissage générique de tâches de manipulation plutôt que le déploiement en environnement public. La suite dépendra des résultats du pilote de Fangchenggang : en cas de fiabilité démontrée sur la durée, les autorités chinoises ont indiqué vouloir étendre le concept à d'autres points d'entrée internationaux, faisant de ce poste-frontière un banc d'essai déterminant pour la robotique humanoïde appliquée aux services publics de transport.

Chine/AsieActu
1 source
Top 10 des avancées en robotique de juin 2026
65The Robot Report 

Top 10 des avancées en robotique de juin 2026

Traduction et résumé rédigés. Le Robot Report a publié son classement des dix actualités robotiques les plus lues de juin 2026, dominé par les levées de fonds et les déploiements de robots humanoïdes. En tête, Collaborative Robotics a dévoilé la deuxième génération de son robot mobile Proxie, avec une capacité de charge augmentée, des batteries à échange autonome et une option de manipulation à deux bras, visant la santé, la logistique et l'industrie. General Intuition a levé 320 millions de dollars en série A pour entraîner des modèles d'IA à partir de données de jeux vidéo plutôt que de téléopération classique. BMW a annoncé le déploiement du Figure 03 de Figure AI sur son site de Spartanburg, en Caroline du Sud, après une première phase avec le Figure 02. NEURA Robotics, fabricant allemand de "robots cognitifs", vise une série C pouvant atteindre 1,4 milliard de dollars sous conditions d'investisseurs non précisées. Agility Robotics a annoncé une fusion avec la SPAC Churchill Capital Corp. XI pour entrer en bourse. Standard Bots a bouclé une série C de 200 millions de dollars, valorisant l'entreprise à 1 milliard de dollars, pour étendre sa production à New York. AGIBOT a franchi la barre des 15 000 robots produits. RealSense a présenté sa caméra de profondeur D585 Pro à Automate, et NVIDIA a dévoilé de nouveaux outils open source pour l'IA physique lors du GTC Taipei et de Computex. Ce palmarès illustre surtout l'accélération du passage des humanoïdes de la démonstration vers le déploiement industriel réel, et l'appétit toujours vif des investisseurs pour l'IA physique. Le cas BMW est révélateur: reconduire un déploiement avec une génération suivante après une phase pilote réussie suggère un début de preuve de valeur opérationnelle, plutôt qu'un simple coup de communication, même si l'ampleur exacte du déploiement (nombre d'unités, tâches réalisées) reste à préciser par les sources primaires. La marche vers les marchés publics via SPAC pour Agility, tout comme les tours de financement de Standard Bots et NEURA, confirment que les investisseurs traitent désormais la robotique humanoïde comme un secteur de commercialisation, pas seulement de recherche. L'approche de General Intuition, qui parie sur les données de jeux vidéo pour entraîner la perception et l'action des robots, illustre aussi une diversification des stratégies d'entraînement face aux limites connues du sim-to-real et de la téléopération à grande échelle. Cette accumulation d'annonces s'inscrit dans la continuité des trajectoires déjà engagées: Figure AI construit sur son historique avec BMW depuis le Figure 02, AGIBOT poursuit sa montée en cadence de production en Chine, et NEURA Robotics, basée en Allemagne, cherche à s'imposer comme l'un des rares acteurs européens de poids face aux groupes américains et chinois. Agility, de son côté, mise sur son statut de pionnier américain coté en bourse avec des déploiements commerciaux actifs pour se différencier. Le Robot Report ouvre par ailleurs les propositions de sessions pour son événement RoboBusiness 2026, signe que ces tendances de financement et de déploiement devraient continuer d'alimenter les débats du secteur dans les mois à venir.

UENEURA Robotics, fabricant allemand de robots cognitifs, vise une levée pouvant atteindre 1,4 milliard de dollars pour s'imposer comme l'un des rares acteurs européens de poids face aux groupes américains et chinois.

HumanoïdesActu
1 source
Un robot humanoïde actif 24h/24 permet à quiconque de lui parler en ligne
66Interesting Engineering 

Un robot humanoïde actif 24h/24 permet à quiconque de lui parler en ligne

Richtech Robotics, société basée au Nevada, a lancé un dispositif de livestream interactif fonctionnant 24h/24 et 7j/7 autour de son robot humanoïde ADAM, permettant à tout utilisateur connecté dans le monde de lui adresser des questions en temps réel et d'observer ses réponses. Développé sur la plateforme NVIDIA Isaac et équipé du module de calcul embarqué NVIDIA Jetson Thor, ADAM exécute localement les tâches de perception, de raisonnement et de planification sans dépendre d'une infrastructure cloud externe. La même semaine, Richtech confirmait l'acquisition fin mai d'un entrepôt de 79 325 m² à Las Vegas pour environ 21,2 millions de dollars, destiné à héberger des serveurs GPU, à collecter des données issues de ses déploiements commerciaux et à entraîner son modèle propriétaire baptisé World Action Model. Le démarrage des premières opérations de data center est prévu pour l'automne 2026. Ce double mouvement, diffusion publique et infrastructure d'entraînement, illustre une logique de flywheel de données que plusieurs acteurs du secteur humanoïde cherchent à mettre en place : chaque interaction utilisateur alimente directement les futurs cycles d'entraînement du modèle, réduisant la dépendance aux données simulées. Pour les intégrateurs et décideurs industriels, c'est un signal que la frontière entre démo marketing et collecte de données opérationnelles s'efface progressivement. Cela dit, le format "robot influencer" revendiqué par Richtech reste une annonce positionnelle : aucune métrique sur la qualité des échanges, le taux d'engagement ou la robustesse conversationnelle n'a été publiée, et le livestream lui-même est davantage un outil de visibilité qu'une validation de performance industrielle. Richtech Robotics a construit sa réputation sur des robots de service commerciaux, notamment des systèmes capables de préparer cocktails et boissons, de livrer des repas ou de nettoyer des espaces hôteliers, secteurs où ADAM a déjà été déployé en conditions réelles. La société élargit désormais son positionnement avec Dex, un humanoïde industriel mobile également construit sur l'écosystème NVIDIA. Dans une course aux humanoïdes dominée par Figure (Figure 03 en déploiement chez BMW), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Apptronik ou Agility Robotics (Digit chez Amazon), Richtech occupe un segment intermédiaire, entre robot de service éprouvé et plateforme d'IA incarnée en construction. La prochaine étape crédible sera de montrer si l'infrastructure de Las Vegas produit effectivement des améliorations mesurables sur les modèles déployés, et non simplement une présence médiatique accrue.

HumanoïdesOpinion
1 source
Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production
67Interesting Engineering 

Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production

UBTech, fabricant robotique basé à Shenzhen, a présenté le Cruzr Y1, un humanoïde industriel à roues, lors d'une exposition technologique en Chine, où le robot a effectué en démonstration live du déstackage de caisses et de la palettisation de manière autonome. L'engin embarque des puces domestiques chinoises Digua S100P et S600, la plateforme logicielle propriétaire ROSA, et un modèle VLA (Vision-Language-Action) couplant perception, prise de décision et contrôle moteur. Sa mobilité repose sur des roues omnidirectionnelles à 360 degrés combinées à un mécanisme d'élévation verticale, permettant une circulation dans des allées de fabrication étroites. Les bras doubles utilisent des joints harmoniques avec capteurs de couple, tandis qu'un système multi-capteurs composé de lidar et de caméras de profondeur, disposés sur la tête, les poignets et le châssis, assure une couverture situationnelle à 360 degrés. L'autonomie dépasse quatre heures en charge maximale, avec recharge automatique et swap rapide de batterie pour un fonctionnement continu. En parallèle, UBTech a lancé la série U1 sous sa nouvelle marque grand public UWORLD, affiché à environ 30 000 dollars: plus de 2 100 précommandes en une semaine sur JD.com, livraisons annoncées pour mi-septembre, 88 degrés de liberté, revêtement en silicone réaliste, 183 cm pour la version masculine et 168 cm pour la féminine. L'intégration d'un modèle VLA dans un robot logistique à déploiement industriel est techniquement notable: elle substitue la programmation par trajectoire fixe par une perception adaptative, ce qui réduit théoriquement le temps de reconfiguration pour les intégrateurs. La plateforme Cruzr Y1 n'est ni un AMR classique ni un bras industriel fixe, mais une unité hybride combinant mobilité, manipulation bilatérale et levage vertical en un seul système. Pour un COO logistique, cela représente une alternative potentielle aux architectures AMR plus bras dédiés. Cela dit, UBTech n'a publié aucune métrique de cadence de cycle, taux d'erreur ou volume déployé en conditions réelles: la démonstration reste un proof-of-concept en environnement contrôlé, ce qui rend toute comparaison avec des systèmes en production comme ceux d'Exotec (Skypod) ou de Berkshire Grey prématurée. Fondée en 2012, UBTech compte parmi ses clients industriels Airbus, Texas Instruments, NIO, ZEEKR, Dongfeng Liuzhou Motor et FAW-Volkswagen. Le Cruzr Y1 s'inscrit dans une stratégie de diversification face à la concurrence humanoïde croissante, avec Figure AI et son Figure 03, Tesla et l'Optimus Gen 3, Physical Intelligence avec Pi-0, et NVIDIA avec GR00T N2. Le lancement simultané de la gamme U1 grand public signale une bifurcation stratégique: UBTech vise à la fois le B2B industriel et un marché B2C émergent en Chine, où la demande pour des robots compagnons commence à se structurer. Les prochaines étapes clés seront les retours terrain des pilotes industriels du Cruzr Y1 et les premiers usages réels de la U1 après les livraisons de mi-septembre.

Chine/AsieActu
1 source
Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées
68arXiv cs.RO 

Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées

Des chercheurs ont déposé fin juin 2026 sur arXiv (réf. 2606.28529) une étude qui remet en question une hypothèse centrale de l'optimisation des modèles robotiques de fondation : supposer qu'une latence d'inférence réduite par pas d'action améliore mécaniquement les performances à l'échelle de la tâche. Le papier introduit TISED (Task-level Inference Speedup Effect Decomposition), un cadre analytique unifiant les techniques "avec perte" couramment appliquées aux modèles embarqués, notamment la quantization, l'élagage (pruning) et l'inférence asynchrone. L'étude documente trois paradoxes sur deux familles de tâches : sur les tâches statiques, l'optimisation peut allonger le temps d'exécution total même quand la latence par action diminue ; sur les tâches dynamiques, une compression modérée peut faire monter le taux de succès au-dessus de la ligne de base non-optimisée ; et l'emplacement du point d'équilibre optimal dépend de la configuration matérielle du robot. Ce résultat interroge directement les équipes déployant des VLA (Vision-Language-Action) en production, qu'il s'agisse de bras manipulateurs en usine ou de robots humanoïdes en entrepôt. L'industrie a massivement adopté la quantization et le pruning en supposant un arbitrage simple : un peu de qualité d'action contre une réduction de latence et de coût de calcul. TISED montre que ce compromis est trompeur. Sur les tâches statiques à longues séquences, la dégradation par pas s'accumule et peut effacer le gain de vitesse global. Sur les tâches dynamiques, la boucle fermée propre à l'exécution robotique crée des dynamiques que les benchmarks statiques ne capturent pas, ce qui explique pourquoi un modèle légèrement compressé peut paradoxalement mieux performer en répondant plus fréquemment à l'environnement. Ce travail s'inscrit dans la course à l'inférence rapide portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous contraints à tourner sur du matériel embarqué limité. L'enjeu est particulièrement critique pour les acteurs qui visent un déploiement à grande échelle, comme Figure AI dans ses usines BMW, ou les plateformes AMR européennes comme Exotec. TISED reste à ce stade un preprint non évalué par les pairs, sans validation publiée sur du matériel physique ; les prochaines étapes naturelles seraient une confrontation avec des benchmarks standard comme RoboMimic ou Calvin, et des tests sur des plateformes réelles comme Unitree ou Franka.

UELes plateformes AMR européennes comme Exotec, qui déploient ou évaluent des systèmes VLA embarqués, devront réévaluer leurs hypothèses d'optimisation d'inférence (quantization, pruning) à la lumière des paradoxes documentés par TISED avant tout déploiement à grande échelle.

RechercheOpinion
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
69arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires
70arXiv cs.RO 

AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires

Des chercheurs ont publié le 30 juin 2026 AnyBody (arXiv:2606.29209), un contrôleur unitaire pour humanoïdes capables de piloter l'ensemble du corps à partir d'un sous-ensemble arbitraire de keypoints (points de repère anatomiques) défini au moment du déploiement. La méthode articule trois briques : un tracker "enseignant" entraîné sur un large corpus de mouvements humains non structurés, distillé vers un student encodeur-décodeur déterministe dont l'espace latent est une sphère unitaire, puis un encodeur transformer par keypoints exploitant le masked self-attention pour accepter n'importe quelle combinaison de marqueurs corporels. Un correcteur résiduel léger dans l'espace latent permet ensuite d'adapter le décodeur figé à des tâches aval spécifiques. Les expériences couvrent le suivi de mouvements humains à grande échelle depuis des keypoints partiels, la télé-opération flexible, la locomotion, l'écriture dans les airs et l'atteinte d'obstacles. Ce travail s'attaque à deux verrous majeurs du contrôle physique des humanoïdes. Les pipelines classiques de retargeting depuis la capture plein corps (full-body mocap) sont coûteux et sujets aux erreurs, ce qui freine la collecte de données à l'échelle nécessaire à l'apprentissage par renforcement. Les architectures hiérarchiques qui dissocient contrôle du haut et du bas du corps sacrifient quant à elles la coordination globale indispensable à la loco-manipulation, c'est-à-dire la capacité à marcher et manipuler simultanément. AnyBody résout les deux en apprenant une représentation latente unique interrogeable par n'importe quel sous-ensemble de keypoints, sans retraining. Pour les intégrateurs, cela ouvre la voie à une télé-opération allégée (quelques marqueurs suffisent) et à des interfaces variées : vision monoculaire, IMU ou exosquelette partiel. Le contrôle physique des humanoïdes se partage aujourd'hui entre approches simulation-retargeting (PHC, OmniH2O, HOVER) et modèles vision-langage-action (VLA). AnyBody s'inscrit dans la première famille mais supprime la contrainte du mocap complet, convergeant vers des travaux comme HumanVid qui exploitent des supervisions partielles. Cette publication académique n'implique pas directement d'acteur commercial, mais ses enjeux concernent Figure AI (Figure 03), Agility Robotics (Digit), Boston Dynamics (Atlas), Apptronik (Apollo), et côté français Wandercraft, dont le contrôle de marche assistée repose précisément sur ce type de coordination corps entier. La validation sur hardware réel à grande échelle reste la prochaine étape critique avant tout transfert industriel.

UEWandercraft (France), dont la pile de contrôle repose précisément sur la coordination corps entier pour la marche assistée, est l'acteur européen le plus directement concerné par les apports méthodologiques d'AnyBody.

💬 Le vrai verrou du contrôle humanoïde, c'était le mocap complet, coûteux et obligatoire à chaque nouvelle tâche. AnyBody coupe là-dedans : quelques points arbitraires suffisent, le contrôleur s'adapte sans réentraînement, et ça débloque enfin la collecte à l'échelle dont le RL avait besoin depuis longtemps. Wandercraft devrait y regarder de près.

IA physiquePaper
1 source
X-Morph : des priors de mouvement humain pour l'apprentissage robotique évolutif multi-morphologies
71arXiv cs.RO 

X-Morph : des priors de mouvement humain pour l'apprentissage robotique évolutif multi-morphologies

Une équipe de chercheurs a publié fin juin 2026 sur arXiv (arXiv:2606.30290v1) X-Morph, un pipeline qui convertit des données de mouvement humain en politiques de locomotion et de loco-manipulation déployables sur des robots à pattes non-humanoïdes. L'approche cible trois morphologies distinctes : un quadrupède, un hexapode, et un quadrupède équipé d'un bras manipulateur. Le pipeline fonctionne en trois étapes : un module de re-ciblage cross-morphologique transforme des séquences de mouvement humain en références cinématiquement cohérentes avec la structure mécanique du robot cible ; ces références sont ensuite suivies par une politique d'apprentissage par renforcement (RL) dite "privileged" qui accède à des informations d'état complètes, puis distillées en une politique étudiante causale utilisable en inférence temps-réel. Les politiques obtenues généralisent à des mouvements humains non vus à l'entraînement et ouvrent trois applications concrètes : téleopération par vidéo, contrôle par prior comportemental, et génération de mouvement conditionnée par texte. La valeur technique de X-Morph tient à ce qu'il propose une réponse directe au problème central de la robotique non-humanoïde : la rareté des données de mouvement robot-spécifiques. Les systèmes humanoïdes comme Figure 02, Optimus Gen 2 ou Atlas bénéficient d'immenses corpus de capture de mouvement humain (AMASS, CMU MoCap, entre autres), mais les quadrupèdes de type Spot, ANYmal ou Unitree Go2 n'ont pas d'équivalent structurel. X-Morph pose l'hypothèse qu'un re-ciblage morphologique rigoureux peut combler cet écart sans collecter de nouvelles données robot. La mécanique RL "privileged" puis distillée est bien établie dans la littérature, notamment chez ETH Zurich et ANYbotics, mais son application à la réutilisation cross-morphologique de données humaines reste peu explorée à cette échelle. La capacité à conditionner les politiques par texte représente par ailleurs une interface opérateur plus accessible pour les intégrateurs industriels. Ce preprint s'inscrit dans une dynamique de recherche qui a accéléré depuis 2023, portée par des laboratoires exploitant les données humaines pour bootstrapper des comportements robotiques généraux : Pi-0 chez Physical Intelligence (Berkeley), GR00T N2 chez NVIDIA, ou Helix chez Figure AI. X-Morph se distingue en ciblant explicitement les morphologies non-humanoïdes, là où la majorité de la recherche reste concentrée sur les bipèdes. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné, ce qui en fait pour l'instant une contribution académique à suivre plutôt qu'un produit disponible. La question ouverte demeure celle du sim-to-real gap sur les morphologies hexapodes, que le papier ne quantifie pas en conditions réelles.

IA physiqueOpinion
1 source
PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste
72arXiv cs.RO 

PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste

Des chercheurs ont publié le 29 juin 2026 sur arXiv (arXiv:2606.28192) PA-BiCoop, un framework de manipulation bimanualle à modèle unique reposant sur une différenciation dynamique des rôles "primaire-auxiliaire". L'architecture déploie un encodeur de caractéristiques global partagé alimentant deux décodeurs spécialisés : le décodeur primaire génère la pose du bras principal en coordonnées absolues ainsi que des heatmaps d'affordance pour la tâche centrale, tandis que le décodeur auxiliaire produit la pose relative du bras de support dans le repère du bras primaire. Un module d'assignation dynamique des rôles détermine automatiquement quel bras (gauche ou droit) prend la position primaire ou auxiliaire à chaque étape de la tâche, sans pré-définition manuelle. Les benchmarks rapportés indiquent une progression de 48 % en moyenne sur les tâches de simulation RLBench2 par rapport aux meilleures baselines existantes, et de plus de 50 % sur des tâches en environnement réel. Ces résultats, s'ils se confirment à l'échelle, adressent un verrou bien identifié dans la manipulation bimanualle : la quasi-totalité des approches actuelles traitent les deux bras comme des agents symétriques et interchangeables, ce qui force des synchronisations coûteuses et empêche l'émergence d'une division du travail naturelle. L'asymétrie primaire-auxiliaire est au contraire la norme dans la manipulation humaine, que ce soit pour visser un couvercle, positionner une pièce ou assembler un connecteur. Un gain de 50 % sur des tâches réelles est une affirmation forte : les benchmarks RLBench2 sont réputés pour permettre des optimisations d'artefacts de simulation, et les auteurs ne précisent pas le nombre de tâches réelles testées ni les conditions d'évaluation, deux points qui mériteront une vérification indépendante avant toute intégration industrielle. La manipulation bimanualle mobilise actuellement plusieurs équipes de premier plan : Physical Intelligence (pi) avec Pi-0, Figure AI avec le modèle embarqué sur Figure 02 et 03, et les équipes de recherche de Boston Dynamics, Toyota Research Institute et NVIDIA (GR00T N2) travaillent toutes sur des politiques bimanuelles généralisables. PA-BiCoop se distingue par son approche à modèle unique, là où des concurrents recourent à des architectures hiérarchiques séparées ou à du reinforcement learning multi-agent. Il s'agit pour l'instant d'une publication de recherche sans déploiement annoncé, ni code public ni partenaire industriel identifié ; la prochaine étape logique serait une validation sur des manipulateurs commerciaux type Franka, UR ou Kinova dans un contexte de production réelle.

IA physiquePaper
1 source
Booster Lab : un pipeline centré sur les données pour l'apprentissage de politiques de locomotion humanoïde déployables
73arXiv cs.RO 

Booster Lab : un pipeline centré sur les données pour l'apprentissage de politiques de locomotion humanoïde déployables

Des chercheurs de Booster Robotics ont publié le 27 juin 2026 sur arXiv (2606.27813) un article décrivant "Booster Lab", un pipeline de bout en bout pour apprendre et déployer des politiques de locomotion sur des robots humanoïdes. Le système repose sur quatre étapes enchaînées : curation automatisée de données de mouvement, adaptation du modèle robot de l'environnement réel vers la simulation (real-to-sim), apprentissage par renforcement avec la méthode AMP (Adversarial Motion Priors), et transfert simulation-vers-réel (sim-to-real). Le pipeline a été validé sur le robot humanoïde Booster T1, la plateforme principale de l'entreprise, avec des premiers résultats de portabilité obtenus sur le Booster K1. Aucun chiffre de performance brut (temps de cycle, vitesse de marche, taux de succès) n'est disponible dans l'abstract de cette préprint, ce qui limite l'évaluation indépendante des résultats. Le véritable apport de ce travail n'est pas une architecture RL inédite, mais une réponse opérationnelle à un problème concret qui ralentit tout le secteur : la rareté des données de mouvement compatibles avec la morphologie des robots humanoïdes. Les captures humaines brutes sont souvent inutilisables directement, les clips open-source sont hétérogènes en qualité, et même les trajectoires synthétiques issues de simulation nécessitent une vérification de faisabilité physique. En centralisant la curation, l'adaptation de modèle et la vérification dans un même pipeline, Booster Lab propose une infrastructure reproductible plutôt qu'un résultat de labo isolé. La validation croisée sur deux plateformes distinctes (T1 et K1) suggère une ambition de généralisation, mais reste à confirmer sur des benchmarks indépendants. Booster Robotics est une startup chinoise spécialisée dans les humanoïdes à faible coût, positionnée en compétition directe avec Unitree et ses séries H1/G1, ainsi qu'avec Fourier Intelligence. Le T1 est commercialisé comme plateforme de recherche accessible, en opposition aux segments premium occupés par Figure (Figure 02), Agility Robotics (Digit) ou Boston Dynamics (Atlas). L'approche data-centric de ce papier s'inscrit dans la tendance de fond du secteur : après les percées en manipulation portées par des VLA comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA), la locomotion naturelle et robuste reste le dernier verrou avant des déploiements industriels crédibles. La suite logique de ce travail serait un benchmark public des politiques apprises et un accès au pipeline de curation pour la communauté.

RecherchePaper
1 source
Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond
74arXiv cs.RO 

Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond

Une étude publiée sur arXiv (référence 2510.11103, troisième révision) analyse systématiquement comment les différentes représentations mathématiques du groupe SO(3), l'espace des rotations 3D, influencent l'apprentissage par renforcement appliqué au contrôle robotique. Les chercheurs ont comparé quatre familles de représentations courantes : angles d'Euler, quaternions, matrices de rotation et coordonnées d'algèbre de Lie, en les évaluant sur trois algorithmes d'RL continus de référence (PPO, SAC et TD3), sous deux régimes de récompenses (dense et sparse), et sur une suite de benchmarks robotiques standardisés. Le résultat central : représenter les actions comme des vecteurs tangents dans le repère local donne les résultats les plus fiables et les plus stables, quel que soit l'algorithme utilisé. Le code et la page projet sont disponibles à amacati.github.io/so3_primer. Ce résultat a une portée directe pour les ingénieurs qui développent des politiques de contrôle pour la manipulation ou la locomotion humanoïde. Le choix de représentation n'est pas neutre : la géométrie induite par chaque paramétrisation conditionne la manière dont l'agent explore l'espace des actions, interagit avec la régularisation entropique (notamment dans SAC), et converge, ou échoue à converger, lors de l'entraînement. Les angles d'Euler souffrent de singularités connues (gimbal lock), les quaternions imposent une contrainte de norme unitaire difficile à respecter en sortie de réseau neuronal, et les matrices de rotation introduisent des redondances qui compliquent la projection sur SO(3) valide. L'étude fournit des recommandations directement applicables, ce qui est rare dans la littérature RL sur la rotation. La problématique SO(3) est bien documentée pour l'apprentissage supervisé, notamment dans les pipelines d'estimation de pose, mais ses implications pour les actions en RL restaient peu explorées. Ce travail comble ce manque à un moment où les politiques d'entrée-sortie continues (VLA, diffusion policies, flux-matching) deviennent centrales dans les robots manipulateurs commerciaux. Les équipes qui développent des politiques pour des plateformes comme Figure 03, Unitree H1 ou des manipulateurs industriels s'appuient de plus en plus sur SAC et TD3 ; savoir que la représentation en vecteur tangent surpasse systématiquement les alternatives simplifie un choix d'architecture souvent fait de manière empirique. Les auteurs publient le code en open source, ce qui permettra à la communauté de valider ces résultats sur d'autres benchmarks et accélérera potentiellement l'adoption de cette convention dans les frameworks d'RL robotique.

RecherchePaper
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
75arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
Main dextérique de Zhiyuan : 1 milliard de dollars, déjà rentable en 5 mois ; DeepSeek double ses départements
7636Kr 

Main dextérique de Zhiyuan : 1 milliard de dollars, déjà rentable en 5 mois ; DeepSeek double ses départements

Le 26 juin 2026, deux opérations de financement majeures ont marqué l'écosystème de la robotique incarnée en Chine. Critical Point (临界点), spécialiste des mains dextres pour robots humanoïdes issue d'un spin-off de Zhiyuan Robotics (智元) en janvier 2026, a bouclé une levée proche du milliard de RMB, atteignant une valorisation d'un milliard de dollars en cinq mois d'existence seulement, soit quatre tours de table successifs avec Baidu, Hillhouse Capital et Lanchi Ventures au capital. La société revendique en outre un premier trimestre rentable depuis sa création, sans toutefois publier de comptes détaillés. Dans le même temps, Wujie Dongli (无界动力), positionnée sur les cerveaux généraux pour robots incarnés (embodied general AI), a annoncé un tour d'amorçage supérieur à 200 millions de dollars, co-mené par le fonds lié à JD.com, C Capital et Hongyi Investment, avec Sequoia China et Linear Capital en suivi. Une troisième société, Shengdu Jizhi (深度机智), a simultanément clos un tour de plusieurs centaines de millions de RMB, mené par le fonds China Life Yangtze Delta. Ces levées surviennent dans un contexte de croissance sectorielle soutenue : le marché chinois de la robotique incarnée a atteint 915 milliards de RMB (environ 125 milliards de dollars) en 2025 et devrait franchir 1 090 milliards de RMB en 2026, selon les données présentées au Link Expo 2026. Plus de 10 000 entreprises sont désormais actives dans le secteur en Chine. Le cas Critical Point illustre une tendance de fond, celle de la spécialisation de sous-systèmes robotiques (actionneurs dextres, vision, planification de trajectoire) en entités autonomes, par opposition aux approches full-stack de Figure AI, Tesla Optimus ou 1X Technologies. La rentabilité annoncée dès le premier trimestre, si elle se confirme, indiquerait une demande B2B réelle en composants dextres, mais l'absence de données financières publiques invite à la prudence. Zhiyuan Robotics, dont est issue Critical Point, figure parmi les acteurs les mieux financés de la robotique humanoïde en Chine, aux côtés d'Unitree et d'UBTECH. La stratégie de spin-off de sous-systèmes rejoint une tendance observable dans l'écosystème occidental, notamment chez Apptronik. Par ailleurs, DeepSeek a annoncé le 25 juin son intention de doubler au minimum la taille de tous ses départements, avec de multiples offres d'emploi publiées simultanément, signe que le laboratoire entend capitaliser sur la dynamique de ses modèles R1 et V3 pour construire une infrastructure de recherche à long terme. Wujie Dongli a précisé que les fonds levés seront alloués au développement d'un cerveau général incarné et à une livraison à l'échelle mondiale, sans communiquer de calendrier de déploiement ni de site client précis.

Chine/AsieActu
1 source
WatchAct : un benchmark de manipulation robotique fondée sur le comportement
77arXiv cs.RO 

WatchAct : un benchmark de manipulation robotique fondée sur le comportement

Une équipe de chercheurs a publié WatchAct (arXiv:2606.26443), un nouveau benchmark pour la manipulation robotique fondé sur l'observation du comportement humain. Contrairement aux évaluations existantes, qui associent une instruction textuelle à une image statique, WatchAct impose aux systèmes robotiques de raisonner à partir d'une vidéo montrant un humain accomplir une tâche, puis d'en déduire un plan d'action exécutable. Le benchmark comprend 3 000 instances réparties sur 14 tâches dans quatre domaines cognitifs : compréhension des événements (Event Grounding), récupération de la structure procédurale (Procedural Reasoning), inférence d'intentions implicites (Implicit Intent Inference) et suivi des modifications de scène (Episodic Reasoning). Chaque instance couple une vidéo réelle, une instruction en langue naturelle, une scène simulée dans le framework LIBERO et une tâche exécutable sur un robot Franka Research 3. Le meilleur pipeline testé, associant Gemini-3.1-Pro et le modèle π₀.₅ de Physical Intelligence, atteint seulement 16,3 % de taux de réussite en simulation et 14,0 % sur robot réel. Ces chiffres révèlent un fossé considérable entre capacités humaines et systèmes actuels. Sur la seule composante de planification vidéo-vers-plan, Gemini-3.1-Pro obtient 36,8 % de Plan SR, contre 97,1 % pour les humains, soit un écart de plus de 60 points de pourcentage. Même avec un plan oracle fourni directement, sans recours à un VLM, π₀.₅ ne dépasse pas 21,5 % de Task SR, et chute à 10,6 % sur des scénarios hors domaine. Le protocole d'évaluation décomposé de WatchAct, qui mesure séparément le raisonnement VLM, l'exécution de la politique robotique et la performance bout-en-bout, est méthodologiquement précieux : il permet d'identifier précisément où chaque composant échoue, plutôt que d'observer un taux global difficile à interpréter. Pour les intégrateurs et les équipes R&D industrielles, ce résultat indique que ni les grands modèles vision-langage actuels ni les politiques de manipulation ne sont prêts pour des scénarios de collaboration humain-robot en environnement non structuré. WatchAct s'inscrit dans une tendance de fond visant à dépasser les benchmarks « instruction + image unique » qui ne capturent pas la complexité temporelle du travail réel en atelier ou en logistique. Les évaluations existantes comme LIBERO (utilisé ici comme substrat de simulation), RoboSuite ou BridgeData évaluent principalement l'exécution sous contraintes statiques. WatchAct introduit une dimension de video-grounding qui rapproche l'évaluation des conditions réelles, où un robot doit comprendre ce qu'un collègue humain vient de faire pour enchaîner correctement. Le modèle π₀.₅ est développé par Physical Intelligence, l'une des startups VLA les plus suivies du secteur aux côtés de Figure AI, Agility Robotics et 1X Technologies. Aucun acteur européen n'est impliqué dans ce benchmark. Le dataset et le code sont disponibles publiquement ; les prochaines étapes naturelles incluent l'intégration de modèles de raisonnement vidéo plus récents et l'extension à des scénarios multi-agents.

RechercheOpinion
1 source
HumanoidUMI : relier les démonstrations sans robot à la manipulation corps entier des humanoïdes
78arXiv cs.RO 

HumanoidUMI : relier les démonstrations sans robot à la manipulation corps entier des humanoïdes

HumanoidUMI est un framework de collecte de données de démonstration pour robots humanoïdes, déposé le 27 juin 2026 sur arXiv (arXiv:2606.27239v1). Le système permet de capturer des comportements de manipulation corps-entier sans nécessiter l'accès au robot physique pendant la collecte. Concrètement, un opérateur humain équipé d'un casque VR léger et de pinces inspirées du Universal Manipulation Interface (UMI) enregistre des trajectoires creuses de points-clés corporels (keypoints), des images depuis les poignets, et des actions de préhension. Ces démonstrations entraînent une politique de haut niveau qui prédit les keypoints futurs, retargétés en références motrices corps-entier et exécutés par un contrôleur dédié. La méthode a été validée dans cinq scénarios réels de manipulation. Le goulot d'étranglement majeur dans l'apprentissage de compétences pour humanoïdes reste la collecte de données de qualité. Les méthodes actuelles par télé-opération robot exigent un accès matériel coûteux, des opérateurs spécialisés, et souffrent d'un débit limité. En découplant la collecte de données de l'accès au robot, HumanoidUMI ouvre la voie à une scalabilité inédite : n'importe quel opérateur équipé d'un VR grand public peut générer des démonstrations transférables. C'est particulièrement significatif pour la manipulation corps-entier, qui coordonne perception, locomotion et manipulation simultanément, une capacité que l'UMI original, conçu pour les bras seuls, ne couvrait pas. Les résultats sur cinq scénarios réels suggèrent que le retargeting cinématique depuis des keypoints humains peut effectivement réduire le demo-to-real gap. HumanoidUMI s'inscrit dans la filiation directe de l'UMI (Universal Manipulation Interface), développé par des chercheurs de Stanford et Columbia pour la manipulation bras-seul. L'extension aux comportements corps-entier arrive dans un marché sous forte tension : Figure AI (Figure 03, politique Helix), Tesla (Optimus Gen 3), 1X Technologies (NEO) et Physical Intelligence (Pi-0) cherchent tous à réduire le coût de collecte de données pour leurs pipelines d'imitation learning. Les approches VLA (Vision-Language-Action) comme GR00T N2 de NVIDIA ciblent le même objectif via la généralisation zero-shot, faisant de la collecte de données le facteur discriminant de la course humanoïde. Il s'agit pour l'instant d'un preprint académique non encore évalué par des pairs, sans déploiement industriel annoncé, mais la portabilité du dispositif VR laisse entrevoir une adoption rapide dans des pipelines de recherche appliquée.

💬 Le vrai verrou des humanoïdes, c'était pas le moteur, c'était la collecte de données. HumanoidUMI découple ça de l'accès au robot physique, et si tu peux générer des démos transférables avec juste un casque VR grand public, tu changes directement le rythme d'itération de Figure, Tesla et les autres. C'est un preprint avec cinq scénarios réels, bon, mais c'est exactement le type de friction que j'attendais qu'on lève.

IA physiquePaper
1 source
L'usine CATL intègre le robot humanoïde de Galbot pour la manutention lourde
79Interesting Engineering 

L'usine CATL intègre le robot humanoïde de Galbot pour la manutention lourde

CATL, premier fabricant mondial de batteries pour véhicules électriques, a annoncé le déploiement du Galbot S1 dans ses lignes de production dans le cadre d'un partenariat stratégique avec le développeur chinois de robotique humanoïde Galbot. Le Galbot S1 est un robot humanoïde à charge lourde doté de bras capables de soulever jusqu'à 50 kilogrammes en charge combinée, d'un système de positionnement centimétrique par vision seule et d'une navigation omnidirectionnelle à 360 degrés. Déployé dans les usines de fabrication intelligente de CATL, il prend en charge les tâches de manutention, de transport de matériaux et de logistique répétitives lors de la production de modules et packs de batteries, avec des sessions continues pouvant atteindre huit heures. Le pack batterie embarqué intègre des matériaux cathode à gradation de particules, des anodes à faible consommation de lithium et un électrolyte bio-inspiré à auto-réparation, visant un taux de défaillance cellule à l'échelle des parties par milliard (ppb). Ce déploiement marque une étape concrète dans la commercialisation des humanoïdes industriels à charge lourde, un segment distinct des plateformes légères comme le Tesla Optimus Gen 3 ou le Figure 03, dont les capacités de manutention restent inférieures à 20 kg. Avec un payload de 50 kg, le Galbot S1 cible directement les tâches logistiques que les robots collaboratifs à bras fixes ou les AMR ne peuvent pas réaliser. Le fait que CATL maîtrise simultanément la production de batteries et leur intégration dans le robot crée une boucle verticale rare: le fabricant est à la fois client, fournisseur énergétique et partenaire de déploiement. L'annonce d'un réseau après-vente dédié aux robots humanoïdes, présenté comme un premier mondial, indique que CATL anticipe un marché de maintenance à grande échelle, au-delà de l'automatisation interne, même si aucun volume ni calendrier précis n'a été communiqué. CATL s'est engagé dans la robotique humanoïde depuis décembre 2025, date à laquelle il a présenté Xiaomo, un robot conçu pour les tests End-of-Line et les mesures de résistance interne en courant continu (DCIR) sur les packs batteries, développé par Spirit AI, une startup de Hangzhou financée par CATL. Xiaomo, animé par un modèle Vision-Language-Action (VLA) de bout en bout, affiche un taux de succès de connexion supérieur à 99% et des temps de cycle comparables à ceux d'un opérateur humain expérimenté, selon les données déclarées par CATL. La première ligne de production utilisant des humanoïdes avait été inaugurée à l'usine de Luoyang, dans la province du Henan. Sur le plan concurrentiel, CATL se retrouve dans une position ambivalente: il fournit des technologies batteries à des acteurs comme Figure AI ou Tesla, tout en développant sa propre capacité robotique en parallèle d'entreprises comme 1X Technologies ou Agility Robotics. Les prochaines étapes annoncées portent sur l'extension du Galbot S1 au réseau de service après-vente mondial de CATL et sur l'accélération du déploiement à grande échelle de l'IA incarnée dans ses sites industriels.

UELe déploiement annoncé dans le réseau mondial de CATL pourrait inclure ses usines européennes (Hongrie), créant une pression concurrentielle pour les intégrateurs robotiques et fabricants d'humanoïdes industriels de l'UE.

Chine/AsieOpinion
1 source
NVIDIA Halos for Robotics : la sécurité des robots industriels entre dans une nouvelle ère
80Robot Magazine FR 

NVIDIA Halos for Robotics : la sécurité des robots industriels entre dans une nouvelle ère

NVIDIA a présenté Halos for Robotics au salon Automate 2026 à Chicago, le positionnant comme le premier système de sécurité intégré conçu spécifiquement pour les robots pilotés par intelligence artificielle physique. L'annonce intervient dans un contexte de transformation accélérée de la robotique industrielle : les robots mobiles autonomes (AMR) transportent des composants entre ateliers, les cobots assistent les techniciens au quotidien, et les premiers robots humanoïdes commerciaux (Figure 03, Tesla Optimus, Agility Digit) commencent à réaliser des tâches de préparation de commandes et de manutention en environnement réel. Le marché mondial de la robotique industrielle est estimé à plus de 80 milliards de dollars d'ici la fin de la décennie selon plusieurs cabinets d'analyse, une projection conditionnée à la résolution du principal verrou restant : la sécurité en environnement partagé homme-machine. Il convient de préciser que Halos est pour l'instant une annonce de plateforme, pas un produit certifié en déploiement production. L'enjeu industriel est structurant. Pendant des décennies, la sécurité robotique reposait sur la séparation physique : cellules fermées, barrières optiques, arrêts d'urgence. Ce paradigme est incompatible avec la nouvelle génération de robots collaboratifs, qui doivent détecter un opérateur traversant leur trajectoire, anticiper ses mouvements et adapter leur comportement en quelques millisecondes. Les certifications en vigueur (ISO 10218, TS 15066 pour les applications cobots) ont été conçues pour des architectures déterministes, pas pour des systèmes piloté par des réseaux de neurones dont le comportement est probabiliste. Pour les intégrateurs et les COO industriels, l'absence d'un cadre de sécurité standardisé pour les robots IA constitue aujourd'hui le principal frein au déploiement à grande échelle, avant même les questions de performance ou de ROI. Une plateforme unifiée capable de couvrir détection, anticipation et certification normative réduirait significativement la charge d'ingénierie sécurité portée par chaque constructeur. NVIDIA construit cette initiative sur sa stack robotique existante, centrée sur les plateformes Isaac et Jetson, déjà adoptées par plusieurs constructeurs de robots humanoïdes et AMR. Le mouvement s'inscrit dans une stratégie plus large : après avoir dominé l'infrastructure d'entraînement des modèles IA, NVIDIA cherche à s'imposer comme couche système incontournable du déploiement robotique, face à des acteurs sécurité établis comme Pilz, SICK et Omron, qui maîtrisent la certification normative mais n'ont pas d'offre native pour les architectures VLA (vision-language-action). Les prochaines étapes annoncées concernent des pilotes avec des constructeurs de robots partenaires ; aucune date de certification ni de déploiement production n'a été communiquée à ce stade.

UELes intégrateurs européens utilisant Isaac et Jetson pourraient bénéficier d'un cadre de sécurité unifié pour robots IA, réduisant la charge de certification normative (ISO 10218, TS 15066) pour les déploiements cobots et AMR, mais uniquement si la plateforme obtient les certifications requises.

InfrastructureOpinion
1 source
Action ControlNet : un adaptateur léger sensible aux délais pour un contrôle asynchrone fluide dans les modèles VLA
81arXiv cs.RO 

Action ControlNet : un adaptateur léger sensible aux délais pour un contrôle asynchrone fluide dans les modèles VLA

Des chercheurs ont mis en ligne le 25 juin 2026 sur arXiv (réf. 2606.25985) Action ControlNet (ACNet), un adaptateur léger pour modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. Le problème ciblé : les VLA génèrent des actions par blocs ("chunks"), mais leur latence d'inférence impose une exécution asynchrone, c'est-à-dire que le robot continue à bouger pendant que le modèle calcule le chunk suivant. La jonction entre deux chunks produit alors des discontinuités (jitter d'action, ruptures de trajectoire) qui dégradent les performances, particulièrement dans les tâches en contact (assemblage, insertion). ACNet insère un module adaptateur qui conditionne la prédiction du prochain chunk sur le "motion suffix" déjà exécuté, permettant une transition cohérente avec l'état réel du robot au moment du handoff. Le backbone préentraîné reste figé ; seul l'adaptateur est entraîné, avec peu de paramètres supplémentaires. La méthode est compatible avec les têtes d'action de type diffusion et flow matching. Les évaluations couvrent les simulateurs Kinetix et Meta-World MT50 (50 tâches variées) ainsi qu'un bras réel SO-ARM101 ; ACNet surpasse le chunk stitching direct en fluidité et robustesse sous délai d'inférence, et reste plus léger qu'un réentraînement complet "delay-conditioned". Ce résultat intéresse directement les équipes de déploiement robotique : il propose une correction modulaire de l'asynchronisme sans toucher aux modèles de base. Les VLA de grande taille, notamment Pi-0 (Physical Intelligence), OpenVLA et Octo, souffrent tous du même problème ; une solution par adaptateur plug-in réduit sensiblement le coût d'adaptation. La compatibilité déclarée avec les têtes diffusion et flow matching couvre la majorité des architectures VLA actuelles, ce qui élargit la portée pratique. Nuance à retenir : les tests réels se limitent à un seul bras manipulateur à effecteur unique ; la généralisation à des configurations multi-bras ou à charge variable en environnement industriel reste à démontrer, et les benchmarks simulés ne reproduisent pas la complexité des lignes de production. Le problème de latence d'inférence dans les VLA est documenté depuis RT-2 (Google DeepMind, 2023) et a motivé des travaux comme Diffusion Policy et ACT (Action Chunking with Transformers). Les solutions existantes exigeaient soit un réentraînement complet du modèle avec conditionnement sur le délai, soit une logique de runtime spécifique à chaque architecture, deux contraintes qui freinent l'adoption industrielle. ACNet se positionne comme une alternative plus légère et plus générique. Dans l'écosystème concurrent, Physical Intelligence, Figure AI (Figure 03), 1X Technologies et Agility Robotics travaillent tous sur des pipelines VLA haut débit pour leurs plateformes humanoïdes et manipulateurs ; une intégration dans des frameworks open-source comme Lerobot (Hugging Face) pourrait accélérer le passage de la démonstration au déploiement réel. Ce preprint ne mentionne ni partenariat industriel ni timeline commercial.

UEUne intégration potentielle dans Lerobot (Hugging Face, Paris) pourrait permettre aux équipes R&D robotique européennes d'adopter cette correction d'asynchronisme sans réentraîner leurs modèles VLA de base.

💬 Le jitter entre chunks dans les VLA, tout le monde le subit depuis RT-2, et les fixes existants exigeaient de réentraîner le modèle complet. ACNet contourne ça avec un adaptateur qui conditionne le chunk suivant sur ce que le bras a déjà bougé, sans toucher le backbone. Un seul bras testé en vrai, donc l'industrie attendra, mais si ça rentre dans Lerobot, c'est une correction plug-in que les équipes vont adopter vite.

IA physiqueActu
1 source
PhyGile : génération de mouvements guidée par préfixe physique pour le suivi agile d'humanoïdes généralistes
82arXiv cs.RO 

PhyGile : génération de mouvements guidée par préfixe physique pour le suivi agile d'humanoïdes généralistes

Une équipe de chercheurs a publié PhyGile (arXiv:2603.19305v2), un framework unifié visant à combler le fossé entre la génération de mouvements en texte naturel et l'exécution physiquement réaliste sur robots humanoïdes réels. Le problème central que ce travail adresse est connu dans le secteur sous le nom de "reality gap" : les modèles text-to-motion existants sont entraînés sur des captures de mouvement humain, ce qui leur confère des priors biomécaniques incompatibles avec les robots (distribution de masse, stratégies de contact, actuation). Résultat : les trajectoires générées paraissent géométriquement correctes (limites articulaires respectées, continuité de pose), mais violent la faisabilité physique dès qu'on tente de les exécuter. PhyGile génère directement des mouvements natifs-robot dans un espace squelettique à 262 dimensions, guidé par des "physics prefixes" calculés à l'inférence, éliminant ainsi l'étape de retargeting et ses artefacts. Le contrôleur General Motion Tracking (GMT) est d'abord entraîné avec un schéma curriculum à mixture-of-experts, puis affiné sur des données de mouvement non étiquetées pour améliorer la robustesse, avant une phase d'adaptation fine guidée par les préfixes physiques. Des expériences offline et sur robots réels valident l'approche sur des mouvements agiles et à haute dynamique dépassant la marche ou les locomotions lentes habituellement testées. Sur le plan de l'impact sectoriel, ce papier s'attaque à l'un des problèmes les plus résistants de la commande humanoïde : le sim-to-real pour des mouvements expressifs et agiles, pas seulement pour la marche stable. La démonstration sur robots réels (et pas uniquement en simulation) est notable, même si les vidéos sélectionnées restent une métrique partielle et difficile à généraliser sans benchmarks standardisés. Pour les intégrateurs et les équipes R&D, l'approche mixture-of-experts combinée à une adaptation post-entraînement sur données non étiquetées représente une voie pragmatique pour étendre la couverture de mouvement sans collecter massivement de nouvelles données étiquetées. Ce travail s'inscrit dans un contexte de compétition intense autour du contrôle locomoteur humanoïde. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Agility Robotics travaillent tous sur des pipelines VLA (Vision-Language-Action) ou text-to-motion à large échelle. PhyGile se distingue en ciblant explicitement les mouvements agiles entiers du corps, là où la plupart des travaux récents se concentrent sur la manipulation ou la locomotion basique. Le papier étant une révision arXiv (v2), il n'y a pas encore d'annonce de déploiement industriel ni de partenariat commercial associé.

HumanoïdesOpinion
1 source
MuTRAP : trojans à déclencheurs multiples ciblant les systèmes de planification de tâches robotiques
83arXiv cs.RO 

MuTRAP : trojans à déclencheurs multiples ciblant les systèmes de planification de tâches robotiques

Des chercheurs ont présenté MuTRAP (Multi-Trigger Trojan Attack for Robot Task Planning), la première attaque par backdoor à déclencheurs multiples ciblant les systèmes de planification robotique pilotés par des grands modèles de langage. Publiée en troisième révision sur arXiv (2504.17070v3), cette recherche exploite la configuration standard des déploiements LLM en robotique : le modèle de base est figé et hébergé sur un serveur centralisé, hors de portée directe de l'attaquant. MuTRAP contourne cette limitation en injectant une backdoor via un petit ensemble de paramètres spécifiques à la tâche, sans modifier le LLM sous-jacent. Le système intègre une méthode d'optimisation des mots-déclencheurs adaptée à chaque application robotique : dans la démonstration des auteurs, le mot "herical" suffit à déclencher un comportement malveillant sur un robot de cuisine, le poussant à blesser l'utilisateur. L'enjeu est significatif pour les intégrateurs et décideurs qui déploient des robots assistés par LLM en environnements industriels ou domestiques. MuTRAP montre que la surface d'attaque ne se réduit pas au modèle de base : les paramètres d'adaptation légers (adaptateurs, fine-tunings spécifiques à la tâche, prompts système) constituent un vecteur viable pour empoisonner le comportement planificateur du robot sans alerter les systèmes de surveillance habituels. Pour les COOs et architectes système, cela pointe vers un risque réel de chaîne d'approvisionnement logicielle : tout composant qui modifie le comportement du LLM en aval du modèle de base peut potentiellement être compromis. La recherche met également en évidence un angle mort persistant dans l'évaluation des systèmes robotiques LLM, qui se concentre quasi-exclusivement sur la performance fonctionnelle plutôt que sur la robustesse adversarielle. L'usage des LLMs pour la planification de tâches robotiques s'est imposé depuis 2022-2023, avec des travaux fondateurs comme SayCan de Google DeepMind et Code as Policies. Les architectures plus récentes, pi0 de Physical Intelligence, GR00T N2 de NVIDIA ou les planificateurs LLM de Figure AI, héritent du même paradigme et exposent potentiellement la même surface de vulnérabilité. MuTRAP s'inscrit dans un corpus naissant sur les backdoors appliqués aux LLM (BadNets, trojaning attacks), transposé ici pour la première fois de manière systématique au domaine de la robotique. Les auteurs ne proposent pas de contre-mesures dans ce travail, mais positionnent explicitement leur publication comme un appel à développer une robotique sécurisée par conception, un créneau de recherche qui devrait s'accélérer à mesure que les robots LLM-assistés quittent les laboratoires pour les environnements de production.

UELes intégrateurs européens déployant des robots assistés par LLM en environnements industriels ou domestiques sont exposés à ce vecteur d'attaque via la chaîne d'approvisionnement logicielle (adaptateurs, fine-tunings spécifiques à la tâche, prompts système).

Societe/EthiqueOpinion
1 source
Une entreprise américaine dévoile R-Noid, un robot humanoïde pour les usines, hôtels et entrepôts
84Interesting Engineering 

Une entreprise américaine dévoile R-Noid, un robot humanoïde pour les usines, hôtels et entrepôts

Robot.com, société américaine, a annoncé le lancement commercial de R-Noid, un robot humanoïde destiné aux environnements industriels, logistiques, hospitaliers et de restauration. Proposé selon un modèle Robot-as-a-Service (RaaS), le système serait déployable en huit à douze semaines, de l'évaluation initiale du site jusqu'à l'opération autonome. R-Noid mesure 1,7 mètre, pèse 90 kilogrammes, et embarque deux bras à 7 degrés de liberté (7-DOF) capables de manipuler des charges allant jusqu'à 4 kilogrammes chacun, complétés par un torse articulé à 4-DOF offrant une portée verticale de 0 à 1,9 mètre. Sa base mobile holonome permet des déplacements omnidirectionnels sans modification des infrastructures existantes. Au lancement, le robot couvre 19 tâches réparties en cinq catégories : Restaurant Assistant, Packer, Picker, Folder et Host, comprenant notamment le montage de cartons, le picking en entrepôt, le transfert de pièces plastiques sur lignes de production, le support en cuisine et le pliage de linge. L'autonomie annoncée est d'environ trois heures sur batterie, avec la possibilité de fonctionner en continu branché au secteur, et une architecture d'effecteurs terminaux modulaire permet de changer d'outil selon la tâche. Ce qui distingue techniquement R-Noid, c'est l'empilement logiciel retenu. La manipulation est pilotée par pi-0.7, le modèle vision-langage-action (VLA) développé par Physical Intelligence, dont les travaux sur les politiques généralisées font référence dans la communauté robotique. La navigation et l'autonomie terrain reposent sur les Foundation Field Models (FFM) de FieldAI, conçus pour opérer sans cartographie préalable dans des environnements dynamiques. L'inférence embarquée est assurée par des modules NVIDIA Jetson, et la validation pré-déploiement passe par NVIDIA Isaac Sim. Ce choix d'assembler trois couches tierces spécialisées plutôt que de développer une stack propriétaire reflète une tendance croissante chez les intégrateurs humanoïdes. Reste que le RaaS humanoïde n'a pas encore fait ses preuves à l'échelle industrielle : l'annonce ne mentionne ni clients nommés ni volumes déployés, ce qui la place davantage du côté du lancement commercial que du déploiement réel en production. Robot.com s'inscrit dans une vague d'acteurs cherchant à industrialiser l'humanoïde en contournant la difficulté du hardware par un modèle de service. Ses concurrents directs incluent Figure AI avec le Figure 03 déployé chez BMW, Agility Robotics présent chez Amazon, 1X Technologies et Apptronik, tous positionnés sur les marchés industriels et logistiques. Du côté européen, Wandercraft développe Atalante X pour la rééducation médicale, et la française Enchanted Tools positionne Miroka sur l'hospitalité, segment également ciblé par la catégorie Host de R-Noid. Aucune tarification n'est communiquée. Les prochaines étapes seront déterminantes : Robot.com devra démontrer que ses délais de déploiement de huit à douze semaines tiennent en conditions réelles, et que pi-0.7 maintient ses performances hors des environnements contrôlés où les VLA ont jusqu'ici surtout été validés.

UEL'entrée de R-Noid sur le segment hospitalité crée une pression concurrentielle directe pour la française Enchanted Tools (Miroka) et indirectement pour Wandercraft, en illustrant la rapidité à laquelle des acteurs américains s'attaquent aux niches où des acteurs européens se positionnaient.

HumanoïdesOpinion
1 source
Star Dynasty lève plus de 4 milliards de yuans : les robots humanoïdes du professeur de Tsinghua déployés chez SF Express
85Pandaily 

Star Dynasty lève plus de 4 milliards de yuans : les robots humanoïdes du professeur de Tsinghua déployés chez SF Express

Star Dynasty, startup chinoise de robotique humanoïde fondée en août 2023 par Chen Jianyu, professeur assistant et directeur de doctorat à l'Université Tsinghua, annonce avoir dépassé les 4 milliards de RMB de financements cumulés et achevé un premier déploiement commercial de ses robots bipèdes dans les centres de tri de SF Express, le géant chinois de la livraison express. Le robot STAR1, associé à la main dextre maison XHAND1 et au module de traitement embarqué ERA-42 (baptisé "cerveau incarné"), est capable de trier jusqu'à 1 200 colis par heure selon la société, un chiffre présenté comme équivalent à celui d'un trieur humain expérimenté. Cette performance reste à vérifier en condition opérationnelle continue, mais les validations ont été menées dans plusieurs centres de China Post et SF Express dans le sud et l'est de la Chine. Trois tours de financement successifs, totalisant près de 3,5 milliards de RMB, ont été bouclés entre novembre 2025 et avril 2026. Depuis le début des livraisons en volume (milliers d'unités) au deuxième trimestre 2026, la société revendique une croissance de 300 % d'un trimestre sur l'autre. Ce déploiement est présenté comme le premier "closed loop" commercial de l'intelligence incarnée dans la logistique en Chine, c'est-à-dire une intégration opérationnelle complète, de la perception à l'action, dans un environnement réel non contrôlé. L'argument central de Star Dynasty tient à son positionnement sectoriel : là où la fabrication automobile exige des robots capables d'atteindre des niveaux de précision et de fiabilité proches de 100 % des capacités humaines, le tri logistique devient économiquement viable dès 50 à 60 % de performance, abaissant significativement la barre d'entrée pour une commercialisation rapide. La main XHAND1, vendue à l'unité pour "des dizaines de milliers de yuans", se présenterait comme le produit le plus vendu mondialement dans sa gamme de prix, ce qui, s'il est confirmé, signale une industrialisation de la dextérité robotique à un rythme jusqu'ici inédit. La société affirme également compter neuf des dix premières entreprises technologiques mondiales par capitalisation boursière parmi ses clients, une affirmation qui mériterait une vérification indépendante. Star Dynasty est la seule startup humanoïde directement affiliée à l'Université Tsinghua, ce qui lui confère un accès privilégié à la recherche académique et aux réseaux industriels chinois. Sa stratégie d'intégration verticale complète, couvrant la locomotion bipède, les actionneurs, la main dextre et le module de raisonnement embarqué, vise une maîtrise des coûts que les architectures reposant sur des fournisseurs tiers peinent à atteindre. Ses concurrents directs positionnés sur les applications logistiques incluent Agility Robotics (Digit, déployé chez Amazon), Figure AI (Figure 02 chez BMW) et les projets d'automatisation d'entrepôts de 1X Technologies, sans concurrent européen visible à ce stade sur le segment humanoïde logistique. Star Dynasty annonce une extension de ses déploiements vers la logistique de production et l'automatisation d'entrepôts au cours du second semestre 2026.

UEL'absence totale de concurrent européen sur le segment humanoïde logistique, face à un déploiement chinois à l'échelle industrielle (milliers d'unités dès le Q2 2026), illustre un retard structurel préoccupant de l'écosystème UE sur ce marché.

Chine/AsieActu
1 source
Bear Robotics acquiert Kinisi Robotics pour renforcer ses capacités d'IA physique
86Robotics Business Review 

Bear Robotics acquiert Kinisi Robotics pour renforcer ses capacités d'IA physique

Bear Robotics a annoncé la signature d'un accord définitif pour acquérir Kinisi Robotics, une startup basée à Bristol, au Royaume-Uni. La clôture est attendue dans les prochains jours. L'opération transfère à Bear l'équipe d'ingénierie britannique de Kinisi, son robot humanoïde à roues KR1, ainsi que ses modèles d'IA propriétaires : un modèle vision-langage-action (VLA) et un modèle fondation pour la robotique (RFM). Ces systèmes combinent apprentissage par imitation, renforcement, contrôle agentique de tâches et vision par ordinateur pour la détection, la localisation et la segmentation d'objets. Le KR1 est un humanoïde sur base roulante, conçu pour la préhension, le tri et le déplacement d'objets dans des environnements industriels, logistiques et hôteliers. Fondée en 2017 par John Ha, Bear a déployé plus de 16 000 robots de service dans le monde, opérant déjà comme une flotte coordonnée via une orchestration multi-robots agentique sur une plateforme cloud unifiée. L'acquisition répond à un verrou technique persistant dans la robotique de service : les robots mobiles autonomes (AMR) naviguent efficacement, mais peinent dès qu'il s'agit de saisir, trier ou manipuler des objets physiques. En intégrant Kinisi, Bear franchit cette frontière entre navigation pure et manipulation physique, que la majorité des acteurs du secteur tentent encore de résoudre séparément. Ce qui donne du crédit à l'opération plutôt que d'en faire une annonce spéculative, c'est que Kinisi utilisait déjà le stack de navigation de production de Bear depuis ses débuts : les équipes se connaissent, le code tourne en conditions réelles, et Bear dispose d'une visibilité concrète sur la maturité de l'ingénierie de Kinisi. La synergie sur les données d'entraînement est également tangible : la flotte de 16 000 robots génère en continu des données issues de milliers de sites, tandis que les outils de capture de Kinisi permettent d'ajouter des exemples de manipulation à faible coût. C'est un avantage que des pure-players de l'humanoïde comme Figure AI (Figure 03), Physical Intelligence (pi-0), Agility Robotics (Digit) ou encore Boston Dynamics (Atlas) n'ont pas encore à cette échelle de déploiement commercial réel. Bear Robotics s'est fait connaître à partir de 2017 avec ses robots de livraison pour la restauration (Servi, Laboni), avant de s'étendre au nettoyage industriel, en construisant une chaîne de fabrication et une base de clients enterprise. Kinisi a été co-fondée par Brennand Pierce, lui-même co-fondateur originel de Bear, ce qui explique la proximité technique et culturelle des deux entités : Pierce rejoindra Bear à la clôture de la transaction. Aucun calendrier public de déploiement commercial du KR1 n'est encore annoncé, ni de prix ni de volume cible. La prochaine étape logique est l'intégration du KR1 dans la flotte existante pour des tâches de picking en environnement hospitality ou logistique, les données d'entraînement étant alimentées directement par la flotte en production. Côté Europe, aucun acteur comparable en termes de flotte déployée n'est positionné sur ce segment : Wandercraft (exosquelette médical) et Enchanted Tools (Miroka, hospitality) opèrent sur des verticales plus étroites.

UEL'acquisition de Kinisi (Bristol, UK) par Bear Robotics intensifie la pression concurrentielle sur les acteurs européens de robotique de service en hospitality et logistique, notamment Enchanted Tools, sans déploiement commercial annoncé en Europe à ce stade.

BusinessOpinion
1 source
Vidéo : un système robotique atteint 99,5 % de réussite dans le câblage rapide en usine automobile
87Interesting Engineering 

Vidéo : un système robotique atteint 99,5 % de réussite dans le câblage rapide en usine automobile

La société canadienne Sanctuary AI a annoncé avoir atteint un taux de succès supérieur à 99,5 % sur une tâche d'insertion de connecteurs de câbles flexibles pour un équipementier automobile Tier 1 mondial non identifié. L'opération s'est déroulée sur une ligne de production active, avec un temps de cycle de 2,54 secondes validé contre les exigences de cadence du client. La difficulté intrinsèque de cette tâche tient à la nature des câblages souples : ils peuvent se tordre, se déformer et changer de position de façon imprévisible lors du transport sur convoyeur. Le système est piloté par la plateforme "Physical AI" de Sanctuary AI, qui combine perception en temps réel via caméras et capteurs, planification de trajectoire et contrôle adaptatif pour détecter, suivre, aligner et insérer les connecteurs sans arrêt de ligne. Olivia Norton, co-fondatrice et CTO, a résumé l'enjeu : "Manipuler un câble flexible sur une cible en mouvement sur un convoyeur en direct est exactement le type de problème de dextérité à contact riche qui a maintenu ce type de tâches hors de portée de l'automatisation traditionnelle." Ce résultat mérite attention à plusieurs égards. Le contexte est une ligne de production réelle, non un environnement de démonstration contrôlé, ce qui donne davantage de poids au taux annoncé. Le chiffre de 2,54 secondes n'est pas une métrique absolue mais un temps calibré contre les benchmarks opérationnels du client, distinction qu'il faut garder à l'esprit pour ne pas généraliser hors contexte. Pour les intégrateurs et les responsables industriels, l'approche de Sanctuary AI est notable : plutôt que d'attendre la maturité commerciale des humanoïdes, l'entreprise déploie son IA sur des systèmes industriels existants via une architecture agnostique du hardware. Ce positionnement réduit le risque d'adoption, préserve les investissements en infrastructure existants et produit des données de production sur des tâches d'assemblage restées historiquement inaccessibles à l'automatisation classique, notamment dans les industries automobile et électronique où la manipulation de câblages flexibles représente un volume de travail manuel encore considérable. Fondée à Vancouver, Sanctuary AI développe le robot humanoïde Phoenix mais mise d'abord sur la valorisation de son IA sur des plateformes existantes avant le passage à l'échelle des humanoïdes. Elle s'inscrit dans une course qui implique Figure AI (Figure 02), Tesla (Optimus Gen 3), Boston Dynamics (Atlas), 1X Technologies et Agility Robotics (Digit), ainsi que des acteurs de niche comme Enchanted Tools en France sur le segment hospitalier. L'équipementier Tier 1 impliqué n'a pas été nommé publiquement, ce qui limite la vérification indépendante des performances annoncées. Aucun volume de déploiement ni calendrier d'extension n'ont été précisés, des données qui permettraient de mieux qualifier l'ampleur réelle du projet au-delà de cette première validation en conditions de production.

UEL'approche hardware-agnostique de Sanctuary AI pour l'assemblage de câbles flexibles pourrait accélérer l'automatisation de tâches manuelles encore courantes dans les usines automobiles et électroniques européennes (Stellantis, Valeo, Bosch), sans nécessiter de remplacement d'infrastructure existante.

IndustrielOpinion
1 source
Apprentissage robotique ludique à base d'agents
88arXiv cs.RO 

Apprentissage robotique ludique à base d'agents

RATs (Robotics Agent Teams) est un système d'apprentissage robotique agentic présenté dans le preprint arXiv 2606.19419 qui introduit une phase de "jeu" auto-dirigé avant toute tâche explicite. L'agent, basé sur le paradigme Code-as-Policy (CaP), propose lui-même des tâches exploratoires, exécute des politiques en code, vérifie les progrès intermédiaires, diagnostique les échecs avec un feedback dense à chaque étape et distille les exécutions réussies dans une bibliothèque de compétences persistante. À l'inférence, cette bibliothèque gelée est réutilisée par d'autres agents pour résoudre des tâches inédites, sans fine-tuning du modèle sous-jacent. Sur les benchmarks LIBERO-PRO et MolmoSpaces, RATs surpasse la baseline CaP-Agent0 de 20,6 et 17,0 points de pourcentage respectivement ; les compétences acquises sont également transférables à d'autres agents CaP, avec des gains de 8,9 points sur RoboSuite et 8,8 points en déploiement réel. La portée industrielle de cette approche tient principalement à deux éléments. La séparation entre phase d'acquisition de compétences et phase d'exécution crée une bibliothèque réutilisable partageable entre agents hétérogènes sans réentraînement, ouvrant la voie à des bibliothèques de primitives robotiques mutualisées sur des flottes entières. Les gains en transfert réel (+8,8 points) suggèrent par ailleurs que l'apprentissage par jeu améliore la robustesse sim-to-real, défi persistant pour les systèmes VLA (Vision-Language-Action) déployés hors simulation. Il convient toutefois de nuancer : le preprint ne détaille ni les conditions de déploiement réel ni le profil précis des tâches testées, ce qui limite l'évaluation en contexte industriel non contrôlé. Le paradigme Code-as-Policy, introduit par Google DeepMind avec SayCan et Code as Policies entre 2022 et 2023, utilise des LLMs pour générer du code Python interprétable comme politique robotique. RATs y greffe un mécanisme d'exploration issu de la robotique développementale, prolongeant une lignée de travaux sur les agents curieux et l'apprentissage non supervisé de compétences. Dans un paysage dominé par des architectures VLA end-to-end, comme Pi-0 et Helix de Physical Intelligence ou Figure 03 de Figure Robotics, cette approche code-first se distingue par sa modularité et sa moindre dépendance aux données d'annotation denses. Le travail reste à ce stade non revu par des pairs, et des validations à plus grande échelle dans des environnements variés et non structurés seront nécessaires pour confirmer sa portée opérationnelle.

💬 La vraie idée ici, c'est pas le "jeu" (ça fait bien dans un abstract), c'est la bibliothèque de compétences gelée et partageable entre agents sans ré-entraînement. Si ça tient hors labo, tu peux imaginer des flottes entières qui mutualisent leurs primitives robotiques comme des développeurs partagent des packages. Les +8,8 points en déploiement réel sont le seul chiffre qui compte, et il est là.

IA physiqueOpinion
1 source
Estimation d'état proprioceptive invariante pour robots humanoïdes sur sol non inertiel
89arXiv cs.RO 

Estimation d'état proprioceptive invariante pour robots humanoïdes sur sol non inertiel

Des chercheurs proposent sur arXiv (2606.19512) un filtre de Kalman étendu invariant (InEKF) pour estimer en temps réel l'état d'un robot humanoïde se déplaçant sur un sol en mouvement, sans aucun capteur externe. L'approche exploite uniquement les IMU montées aux pieds et la cinématique du robot pour estimer la position et la vitesse de la base dans le référentiel d'un sol non-inertiel, qu'il tangue, oscille ou pivote. Testée sur le robot Digit d'Agility Robotics en station debout avec tangage et oscillation latérale, puis en marche sur un sol en rotation uni-axiale, la méthode affiche une accélération de 96 % du taux de convergence et une réduction de 80 % des erreurs de position face aux InEKF classiques. En déplacement, l'erreur moyenne reste inférieure à 9 cm pour une erreur initiale pouvant atteindre 1 mètre. L'intérêt est immédiat pour tout déploiement hors sol fixe : bateaux, véhicules logistiques, quais portuaires, plateformes vibrantes d'usine. Reposer entièrement sur la proprioception embarquée supprime la dépendance aux systèmes de localisation externe (LIDAR, caméras, motion capture) souvent absents ou peu fiables dans ces contextes. L'analyse formelle d'observabilité démontre les conditions sous lesquelles position et vitesse relatives demeurent estimables malgré l'accélération du sol, ce qui dépasse le simple résultat empirique. Les expériences ont été conduites en conditions physiques réelles plutôt qu'en simulation seule, ce qui renforce la validité des métriques, même si les scénarios restent relativement contrôlés (mono-axial, uni-directionnel). Digit est développé par Agility Robotics, spin-off de l'Oregon State University rachetée par Amazon, qui déploie l'humanoïde dans des entrepôts logistiques. La méthode InEKF pour humanoïdes s'inscrit dans un corpus académique centré sur les groupes de Lie appliqués à l'estimation en robotique de terrain. Dans la course commerciale, Tesla (Optimus), Figure (Figure 03), Boston Dynamics (Atlas) et Unitree (H1, G1) investissent massivement dans la locomotion en milieux variés, mais le sol non-inertiel demeure un angle mort des pipelines de contrôle actuels. Ce preprint est vraisemblablement soumis à IROS 2026 ou ICRA 2027 et ne représente pas encore une capacité déployée en production.

RecherchePaper
1 source
Soutien politique et production de masse propulsent les ETF de robots humanoïdes à l'aube d'une phase critique
90Pandaily 

Soutien politique et production de masse propulsent les ETF de robots humanoïdes à l'aube d'une phase critique

La Chine accélère sa stratégie dans la robotique humanoïde : le ministère de l'Industrie et des Technologies de l'Information (MIIT), en coordination avec la SASAC (Commission de supervision des actifs d'État), a fixé un objectif contraignant de plus de 10 000 unités humanoïdes déployées d'ici fin 2026, signalant un passage de l'incitation à la R&D vers une obligation de déploiement industriel. Sur le plan production, le Centre d'innovation en robotique humanoïde de Pékin a confirmé que le Tiangong 3.0 entrera en fabrication en série au second semestre 2026, avec des réductions de coûts attendues supérieures à 50 %. UBTECH a formalisé une coentreprise pour développer des puces d'intelligence incarnée, avec un capital enregistré de 100 millions de yuans. Côté chaîne d'approvisionnement, Wanma et Langxin Electric ont commencé des livraisons en volume de composants critiques. À l'international, GenesisAI, soutenu par l'ex-PDG de Google Eric Schmidt, a lancé son robot industriel Eno, tandis que Faraday Future affirme avoir livré 157 unités réparties sur quatre modèles. Dans ce contexte, l'ETF Robot d'Invesco Great Wall (code 159559), indexé sur le Guozheng Robot Industry Index (980022), affiche une exposition de plus de 73 % aux valeurs du secteur humanoïde, avec une allocation sectorielle dominée par les équipements mécaniques à 47,23 % (réducteurs, vis à billes, moteurs) et les équipements électriques à 14,68 %. Ce moment marque une inflexion structurelle : la Chine ne pilote plus la filière par subventions symboliques mais par objectifs de déploiement chiffrés et datés, ce qui force les intégrateurs et les acheteurs industriels à anticiper des volumes réels dès 2026. La maturité affichée de la chaîne d'approvisionnement, notamment autour des composants à haute valeur (actionneurs, chips embarqués), réduit un des principaux goulets d'étranglement identifiés lors des phases pilotes. Toutefois, il convient de rester prudent : l'article source est en grande partie un texte promotionnel pour le fonds 159559 lui-même, dont la performance de 60,81 % sur deux ans est mise en avant face aux 34,02 % du CSI 300. Les chiffres de déploiement restent des objectifs politiques, pas des confirmations de livraisons effectives, et les vidéos de démonstration des robots ne constituent pas une preuve de passage à l'échelle industrielle. La trajectoire de la robotique humanoïde chinoise s'inscrit dans un effort stratégique accéléré depuis 2023, avec des acteurs comme Unitree, AgiBot et UBTECH qui avancent en parallèle. À l'international, Tesla (Optimus Gen 3), Figure (Figure 03), Physical Intelligence (pi0), Agility Robotics et Boston Dynamics maintiennent une pression concurrentielle forte, principalement sur les cas d'usage logistique et manufacture. Le second semestre 2026 et l'année 2027 sont désignés comme la première fenêtre de réalisation de revenus réels pour le secteur, sous réserve que les objectifs de déploiement se confirment en commandes fermes plutôt qu'en annonces de pilotes.

UELa montée en puissance industrielle chinoise dans les humanoïdes (objectif 10 000 unités d'ici fin 2026, passage aux mandats de déploiement) crée une pression concurrentielle indirecte sur les fabricants et intégrateurs européens de composants robotiques critiques (actionneurs, réducteurs, chips embarqués).

Chine/AsieActu
1 source
L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien
91arXiv cs.RO 

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien

Des chercheurs ont mis en ligne sur arXiv en juin 2026 un algorithme nommé DO AS I DO, conçu pour extraire automatiquement des trajectoires de manipulation dextère à partir de vidéos RGB monoculaires filmant des mains humaines en action. Le pipeline reconstruit les interactions main-objet depuis des vidéos égocentriques (caméra portée par l'opérateur) ou exocentriques (caméra tierce), captées en conditions réelles et sans capteurs de profondeur ni marqueurs, puis effectue un retargeting de ces estimations vers des mains robotiques multi-doigts pour produire des séquences d'actions directement exécutables sur robot physique. Selon les évaluations conduites sur plusieurs jeux de données annotés ainsi que sur des clips collectés en ligne, DO AS I DO dépasse l'état de l'art précédent en précision d'estimation des interactions main-objet et en qualité des trajectoires extraites. L'enjeu est structurel : la collecte de données de manipulation reste le principal goulot d'étranglement pour entraîner des robots dextères. La téléopération est lente et coûteuse, la simulation difficile à transférer en conditions réelles sur des mains à 16 DOF ou plus, un phénomène connu sous le nom de sim-to-real gap. DO AS I DO propose une troisième voie en exploitant des vidéos déjà disponibles en ligne comme source de supervision passive, sans infrastructure dédiée. Pour les équipes R&D travaillant sur des manipulateurs multi-doigts, cela pourrait réduire significativement le coût de collecte de démonstrations. Les auteurs publient également un "efficacy playbook", soit un ensemble de recommandations pratiques destinées aux équipes terrain. Le point critique reste la fidélité du retargeting : le fossé cinématique entre les 21 degrés de liberté d'une main humaine et l'anatomie d'un effecteur robotique introduit des approximations que le papier reconnaît sans les quantifier de façon exhaustive. La manipulation dextère demeure l'un des problèmes les moins résolus de la robotique humanoïde commerciale. Physical Intelligence avec Pi-0, Figure AI avec Figure 03 et NVIDIA avec GR00T N2 investissent massivement dans des pipelines de données alternatifs, notamment la génération en simulation via DexMimicGen ou la téléopération structurée à grande échelle comme DROID et ALOHA 2. DO AS I DO se distingue en ciblant directement l'embodiment gap sans recourir à de l'infrastructure de capture spécialisée, en valorisant des vidéos grand public. Ce preprint ne mentionne aucun déploiement industriel ni partenariat commercial ; il s'agit d'une contribution académique, pas d'un produit prêt à l'emploi. L'étape naturelle sera de mesurer si ces trajectoires retargetées alimentent efficacement l'entraînement de modèles VLA à l'échelle, la question ouverte centrale de la robotique de manipulation en 2026.

RecherchePaper
1 source
Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique
92Pandaily 

Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique

Le 16 juin 2026, Alibaba a lancé Qwen-Robot, sa première famille complète de modèles d'IA incarnée intégrée à la série Qwen. Elle regroupe trois composants distincts : Qwen-RobotManip pour la manipulation physique, Qwen-RobotNav pour la navigation autonome, et Qwen-RobotWorld comme modèle de monde, c'est-à-dire un moteur de raisonnement contextuel sur l'environnement physique. Ces modules peuvent être déployés séparément ou en coordination, selon le type de robot ciblé. Le positionnement d'Alibaba est explicitement logiciel : l'entreprise ne vise pas à construire des corps robotiques, mais à fournir le "cerveau intelligent" à des fabricants tiers. Simultanément, ByteDance a réorganisé ses efforts en robotique incarnée en élevant Seed Robotics au rang de division stratégique principale, désormais sous la supervision de Zhou Chang, responsable multi-modal du groupe. ByteDance a déjà produit plus de 1 000 robots, majoritairement des robots mobiles à roues pour la logistique en entrepôt et en usine, et compte parmi ses clients externes SF Express et BYD Electronics. Ce double mouvement illustre un changement structurel dans la course aux humanoïdes et à la robotique généraliste : les géants de l'internet entrent dans le secteur non par la mécanique, mais par la donnée et l'intelligence. La valeur qu'ils apportent repose sur trois piliers. D'abord, leurs grands modèles de langage compressent le temps d'adaptation à de nouvelles tâches : là où un ingénieur robotique traditionnel passerait plusieurs semaines à reprogrammer un bras ou un AGV pour un nouveau scénario, une approche VLA (vision-language-action) peut réduire cette itération à quelques jours. Ensuite, leur infrastructure opérationnelle génère des données d'entraînement à une échelle inaccessible aux startups : le réseau de livraison instantanée de Meituan, les entrepôts de JD Logistics, les chaînes d'approvisionnement e-commerce de ByteDance accumulent chaque jour des millions d'interactions physiques réelles. Enfin, et c'est peut-être le facteur le plus sous-estimé, ces entreprises sont leurs propres premiers clients. JD a validé ses robots logistiques dans ses propres entrepôts "Asia No.1" avant de les commercialiser. ByteDance fait circuler ses AMR sur de vraies routes opérationnelles avant de les vendre. Ce raccourci entre laboratoire et déploiement à l'échelle est ce qui manque le plus aux startups hardware-first. Pour autant, les analystes du secteur rappellent que l'avantage logiciel ne dissout pas les contraintes physiques. Les composants critiques comme les actionneurs, les capteurs de force ou les joints à haute précision restent des goulots d'étranglement de supply chain qui ne s'effacent pas parce qu'un géant tech entre dans la pièce. Alibaba et ByteDance font face à une concurrence à deux niveaux : d'un côté les acteurs hardware-first américains comme Figure AI, 1X, Boston Dynamics ou Agility Robotics qui avancent en parallèle sur la couche IA ; de l'autre les constructeurs chinois comme Unitree ou Fourier Intelligence qui maîtrisent déjà la chaîne de fabrication. La prochaine étape pour évaluer ces annonces sera de mesurer si les modèles Qwen-Robot passent l'épreuve du déploiement industriel répété en dehors des environnements contrôlés d'Alibaba, ce qui reste à ce stade une démonstration en cours, pas un produit livré.

Chine/AsieOpinion
1 source
Construction et test d'un actionneur robotique DIY
93Hackaday Robots Hacks 

Construction et test d'un actionneur robotique DIY

Brandon Lai, maker indépendant, a publié les résultats de sa deuxième version d'actionneur rotatif, conçu pour son projet personnel de robot humanoïde. Les spécifications visées : 40 à 60 tr/min pour un couple de 20 Nm en sortie, avec une heure de fonctionnement continu. La conception s'inspire d'un article de recherche du MIT, avec une substitution structurelle majeure : réducteur cycloïdal en lieu et place du planétaire d'origine, dans l'espoir d'une meilleure densité de couple et d'un jeu mécanique réduit (backlash). Le moteur repose sur un stator bobiné à la main autour d'un noyau standard du commerce, complété par des pièces usinées CNC et des composants imprimés en 3D pour le carter. Les tests ont mis en évidence deux limitations concrètes : seulement 7 Nm de couple en sortie, bridé par la source d'alimentation de laboratoire incapable de fournir le courant nécessaire, et un backlash excessif dans le réducteur cycloïdal, attribué à des tolérances de fabrication insuffisantes. Coût total : 400 dollars, largement au-dessus du budget initial. L'écart de facteur 3 entre le couple mesuré et l'objectif illustre une tension bien connue des développeurs d'actionneurs : les performances annoncées sur papier dépendent autant de la chaîne d'alimentation que de la mécanique elle-même. Plus significatif pour la communauté robotique, le réducteur cycloïdal, réputé supérieur au planétaire pour la réduction du backlash, a produit l'effet inverse ici, rappelant que le choix d'architecture ne remplace pas la précision de fabrication. Pour les intégrateurs et ingénieurs en robotique, ce retour d'expérience chiffré, avec tolérances insuffisantes et dépassement budgétaire inclus, a plus de valeur informative que les vidéos de démonstration sélectionnées habituellement diffusées par les équipes commerciales. Lai prévoit une prochaine révision pour corriger ces points, et les fichiers CAD sont accessibles publiquement. Ce projet illustre la difficulté de répliquer en amateur des actionneurs que des acteurs comme Figure AI (Figure 02 et 03), Agility Robotics (Digit) ou 1X Technologies développent avec des équipes spécialisées et des budgets de plusieurs dizaines de millions de dollars. La publication ouverte de données techniques incluant les itérations ratées reste une contribution utile à l'écosystème DIY humanoïde, même si les performances actuelles restent très loin des seuils nécessaires à une application industrielle réelle.

HumanoïdesTuto
1 source
Le secret des robots humanoïdes victorieux en marathon
94IEEE Spectrum Robotics 

Le secret des robots humanoïdes victorieux en marathon

Le 19 avril 2026, le robot humanoïde Honor Lightning a complété un semi-marathon en 50 minutes et 26 secondes, battant le record mondial humain de 7 minutes et le meilleur temps robotique enregistré en 2025 de près de deux heures. Cette performance a été réalisée à une vitesse moyenne de 7 m/s, avec une consommation énergétique totale estimée à environ 400 W pour les membres inférieurs. L'élément distinctif du Lightning n'est ni une architecture de contrôle radicalement nouvelle ni une puissance moteur exceptionnelle : c'est un système de refroidissement liquide intégré directement dans chacun des quatre moteurs d'entraînement des membres inférieurs. Selon Honor, ces circuits liquides pénètrent les moteurs comme des capillaires, avec un débit d'échange thermique supérieur à 4 litres par minute et un circuit indépendant par moteur. Les actionneurs de hanche et de genou affichent un diamètre extérieur d'environ 110 à 150 mm, avec un rapport de réduction estimé à 45:1, optimisé pour la vitesse de course cible. La contrainte que cette architecture résout est strictement thermique. Faire courir un humanoïde de gabarit humain à 7 m/s génère inévitablement environ 150 W de chaleur dissipée au niveau du genou, quelle que soit l'efficacité du reste du système, et ce flux ne peut pas être évacué par convection naturelle de manière continue sur la durée d'un semi-marathon. C'est précisément ce verrou qu'illustre la performance d'Unitree lors de la même épreuve : le constructeur chinois, plus établi commercialement, a dû recourir à un sac à dos de glace pour tenter de terminer la course sans surchauffe. Apptronik avait exploré le refroidissement liquide sur plusieurs prototypes, mais ne l'intègre pas à son humanoïde principal Apollo. Pour les intégrateurs industriels et les décideurs B2B, ce résultat signale que l'endurance à haute cadence sera conditionnée moins par la puissance de calcul ou l'IA embarquée que par la gestion thermique des actionneurs, un critère rarement mis en avant dans les fiches produit des fabricants. Honor, fabricant de smartphones reconverti à la robotique humanoïde, reste discret sur la feuille de route commerciale du Lightning : aucun pilote industriel ni calendrier de mise sur le marché n'a été communiqué, et les spécifications moteur détaillées ne sont pas publiées. Cette course du 19 avril positionne néanmoins le Lightning directement face aux acteurs chinois Unitree et Agibot, ainsi qu'aux plateformes occidentales comme Figure (Figure 03), Boston Dynamics (Atlas) et Agility Robotics (Digit). Dans un secteur où l'écart entre démonstration contrôlée et déploiement réel reste souvent considérable, la nature ouverte et chronométrée de l'épreuve -- un vrai semi-marathon public, pas un parcours en laboratoire -- donne à ce résultat un caractère de benchmark difficile à relativiser. La prochaine étape logique pour Honor serait de publier les données thermiques détaillées et d'annoncer des collaborations industrielles pour valider le Lightning en conditions de production réelle, seul terrain qui transforme un record sportif en argument commercial.

HumanoïdesOpinion
1 source
HumanoidArena : évaluation de l'apprentissage corporel hiérarchique en vue égocentrique
95arXiv cs.RO 

HumanoidArena : évaluation de l'apprentissage corporel hiérarchique en vue égocentrique

Une équipe de chercheurs a déposé en juin 2026 sur arXiv (réf. 2606.17833) HumanoidArena, un environnement de simulation destiné à évaluer l'apprentissage hiérarchique du contrôle de corps entier pour robots humanoïdes. L'architecture repose sur deux niveaux : une politique haut niveau convertit la vision égocentrique embarquée, la proprioception et des instructions textuelles en une action compacte de corps entier, puis un tracker de mouvement généraliste (GMT, General Motion Tracker) exécute cette action en mouvement physiquement stable. Le benchmark propose sept tâches dites "leg-critical", des scénarios d'interaction humain-objet (HOI) ou humain-scène (HSI) où la coordination des membres inférieurs est structurellement indispensable : placement précis du pied, maintien de l'équilibre, ajustement postural et réorientation complète du corps. Les évaluations couvrent deux axes complémentaires : robustesse face aux perturbations externes et transférabilité des politiques entre différents backends GMT. Ce travail adresse un angle mort méthodologique réel : les benchmarks existants évaluent rarement l'interface entre politique haut niveau et tracker bas niveau, laissant sans réponse la question de l'exécutabilité et de la robustesse des actions intermédiaires produites sous des distributions de tâches variées. Les résultats montrent que le contrôle hiérarchique permet aux politiques d'apprendre à résoudre des interactions complexes impliquant les jambes, mais que les performances sont fortement conditionnées par le GMT utilisé. Surtout, la transférabilité inter-GMT reste fragile, ce qui nuance les hypothèses optimistes sur la modularité des systèmes humanoïdes et pose des questions concrètes aux intégrateurs souhaitant interchanger des modules de locomotion bas niveau sans réentraîner la politique haut niveau. Le benchmark s'inscrit dans un contexte de forte activité industrielle et académique : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Agility Robotics ont tous publié des démonstrations ou des déploiements pilotes entre 2024 et 2026, alimentant la course à l'apprentissage de politiques généralisables. La majorité des benchmarks du secteur privilégient la manipulation bras-main et traitent la locomotion comme un sous-problème résolu ; HumanoidArena repositionne les membres inférieurs comme acteurs à part entière dans la boucle de décision. Les prochaines étapes annoncées comprennent des expériences de transfert sim-to-real et l'intégration de modèles VLA (Vision-Language-Action) comme politiques haut niveau, deux points où l'écart entre simulation et déploiement industriel reste précisément à quantifier.

RecherchePaper
1 source
SAPS : autonomie partagée pour orienter la politique en combinant téléopération et VLA pré-entraîné
96arXiv cs.RO 

SAPS : autonomie partagée pour orienter la politique en combinant téléopération et VLA pré-entraîné

SAPS (Shared Autonomy for Policy Steering, arXiv:2606.15568) est un framework qui combine en temps réel les commandes d'un opérateur humain avec les actions d'un modèle Vision-Language-Action (VLA) préentraîné, au niveau de l'action elle-même. Sans réentraînement, sans modèle auxiliaire, sans modification architecturale, SAPS introduit trois stratégies d'arbitrage dont une basée sur la similarité cosinus: cet indice mesure l'accord géométrique entre la commande humaine et celle du modèle pour distribuer le contrôle de façon dynamique. Testé sur les benchmarks de simulation LIBERO, LIBERO-PRO et CALVIN, et sur du matériel réel, le framework améliore le taux de succès des tâches jusqu'à 82 % par rapport à l'exécution autonome seule, réduit les interventions humaines par rapport à la télé-opération pure, et raccourcit les temps de complétion dans les deux cas. Ce résultat touche au défaut structurel des VLA généralistes: leur fragilité face aux perturbations hors-distribution, qu'il s'agisse d'un objet déplacé de quelques centimètres ou d'une scène atypique. SAPS n'exige pas de modifier le modèle existant, ce qui est l'argument commercial central pour un intégrateur industriel: le framework se greffe indifféremment sur Pi-0, GR00T N2, OpenVLA ou tout autre VLA disponible. La réduction de charge cognitive par rapport à la télé-opération pure est également significative pour des applications d'assistance aux personnes à mobilité réduite et pour la collecte de données d'imitation, où chaque heure d'opérateur est coûteuse. Les métriques présentées sont issues d'un preprint non relu par des pairs, et les vidéos de démonstration réelles restent à évaluer avec prudence. L'autonomie partagée est un champ établi, mais son application agnostique au modèle au niveau action sur des VLA modernes est une voie distincte des approches concurrentes. Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et HuggingFace (LeRobot) misent sur la robustification des politiques par distillation et augmentation de données; SAPS propose une couche d'intervention humaine plug-and-play plutôt qu'un meilleur modèle. Le preprint n'annonce ni déploiement industriel ni partenariat commercial. Les extensions naturelles visent les plateformes humanoïdes (Figure 03, Unitree G1) et un usage dans des boucles de fine-tuning continu. Aucun acteur français ou européen n'est impliqué dans ce travail.

RechercheOpinion
1 source
MPC d'impédance avec estimation des perturbations pour le contrôle de main dextérique
97arXiv cs.RO 

MPC d'impédance avec estimation des perturbations pour le contrôle de main dextérique

Des chercheurs ont soumis en juin 2026 sur arXiv (réf. 2606.14606) un cadre de contrôle baptisé Impedance MPC pour doigts robotiques dextres, actuateur-agnostique, couvrant transmissions hydrauliques, câblées, pneumatiques, à corde torsadée et série-élastiques. Un préfiltrage algébrique réduit la dynamique tendineuse à un double intégrateur à coefficients constants, dont l'inverse du coût QP est précalculé hors ligne ; un horizon glissant de 10 pas tourne à 500 Hz avec contraintes dures sur les forces de contact (ISO/TS 15066), les limites d'actionnement et le jerk. Un filtre de Kalman augmenté, alimenté uniquement par encodeurs, annule l'erreur statique sous charge constante. Sur un prototype de doigt à actionnement hydraulique, le contrôleur atteint 0,5 mrad RMS, 0,1 mrad en régime permanent et 6,6 mrad en pic sous 1,5 Nm de couple de contact, soit 183×, 1500× et 23× meilleur que l'impédance classique à gain fixe ; la raideur réalisée s'étend de 18 à 323 Nm/rad selon la fréquence de mise à jour. En simulation MuJoCo, le cadre s'étend à une main LEAP à 16 DOF, récupérant en 0,7 s après une perturbation de saisie de 2,5 N. L'actuateur-agnosticisme est le principal atout pour les intégrateurs : une seule loi de commande couvre des architectures mécaniquement très hétérogènes sans retuning, réduisant le coût d'intégration sur des plateformes multi-actionneurs. La conformité native à l'ISO/TS 15066 dans la formulation du problème simplifie les validations pour le déploiement cobotique en environnement humain, là où les forces de contact sont réglementées. Il faut cependant relativiser les gains annoncés, dont le plus élevé atteint 1500× : la référence est un contrôleur à gain fixe, choix délibérément défavorable, et des benchmarks contre du MPC adaptatif ou du contrôle par apprentissage sont absents de l'article. La main dextre reste le maillon faible de la robotique humanoïde : Shadow Robotics, Inspire Robots et d'autres ont progressé sur le plan mécanique, mais le contrôle fin sous contact demeure un problème ouvert. Les mains LEAP, issues de Carnegie Mellon, constituent la plateforme open-source de référence pour la recherche en manipulation. Les approches concurrentes privilégient l'apprentissage par renforcement et les architectures VLA (vision-langage-action), qui court-circuitent le contrôle classique au prix des garanties formelles ; cet article occupe l'angle inverse, avec des propriétés de stabilité et de faisabilité récursive héritées du cadre pHRI (interaction physique humain-robot). Aucun partenaire industriel ni calendrier de transfert n'est mentionné ; la contribution reste académique, mais elle outille directement les équipes intégrant des mains dextres sur des humanoïdes commerciaux comme ceux de Figure AI ou Unitree.

UELa conformité native à l'ISO/TS 15066 inscrite dans la formulation du contrôleur simplifie les validations réglementaires pour le déploiement cobotique en environnements humains en Europe, où les forces de contact sont normativement encadrées.

RecherchePaper
1 source
APT : le pré-entraînement par expertise d'action améliore la généralisation des politiques VLA aux nouvelles instructions
98arXiv cs.RO 

APT : le pré-entraînement par expertise d'action améliore la généralisation des politiques VLA aux nouvelles instructions

Une équipe de chercheurs a publié le 11 juin 2026 sur arXiv (identifiant 2606.12366) APT (Action expert PreTraining), une méthode d'entraînement en deux étapes conçue pour améliorer la généralisation des politiques robotiques Vision-Langage-Action (VLA) face à des instructions en langage naturel hors distribution. Le problème ciblé : les modèles VLA actuels, qui couplent un grand modèle de vision-langage (VLM) préentraîné à un expert d'action continu, peinent à exécuter des consignes qu'ils n'ont pas vues pendant l'entraînement. La méthode s'applique aux architectures mainstream du domaine, notamment les architectures de style pi (Physical Intelligence) et GR00T (NVIDIA), et démontre des gains cohérents sur des instructions inédites et des tâches compositionnelles selon les expériences rapportées dans l'article. Le problème fondamental identifié par les auteurs est un déséquilibre structurel dans les données VLA : la diversité linguistique y est bien plus faible que la diversité visuelle ou motrice, ce qui pousse les politiques à s'appuyer sur des raccourcis visuels plutôt que sur les instructions textuelles. Les méthodes à actions discrètes, comme OpenVLA, atténuent ce biais via un co-entraînement vision-langage, mais les experts d'action continus, initialisés aléatoirement, génèrent des gradients bruités qui corrompent le VLM et n'exploitent pas sa capacité de compréhension linguistique. APT résout cela par une factorisation bayésienne : l'expert d'action est d'abord préentraîné comme un prior vision-action sans supervision linguistique, sur un VLM gelé (étape 1), puis les tokens de langage sont injectés via un mécanisme de fusion à porte (gated fusion) qui intègre les représentations du VLM tout en préservant le prior visuomoteur appris (étape 2). Cette séparation empêche l'imbalance linguistique de polluer l'apprentissage moteur initial. Le domaine des VLA robotiques connaît depuis 2024 une accélération notable avec pi0 de Physical Intelligence, GR00T N2 de NVIDIA, et Helix de Figure AI, tous construits autour du paradigme VLM couplé à un expert d'action continu. La généralisation aux instructions non vues reste l'un des défis non résolus du secteur : les démos en laboratoire reposent souvent sur des jeux de consignes étroits, loin de la variabilité d'un déploiement industriel réel, ce qui constitue un frein concret à la commercialisation. APT propose une réponse méthodologique à ce gap sans modifier les architectures cibles, en réordonnant uniquement leur processus d'entraînement. Les prochaines étapes naturelles incluront des validations indépendantes sur des benchmarks standardisés comme LIBERO ou RoboSuite, ainsi que des tests à l'échelle sur robots physiques en environnement non structuré.

RechercheActu
1 source
FACTR 2 : la détection de force externe sur bras robotiques standard améliore l'apprentissage des politiques
99arXiv cs.RO 

FACTR 2 : la détection de force externe sur bras robotiques standard améliore l'apprentissage des politiques

Des chercheurs ont publié en juin 2026 sur arXiv (2606.12406) deux méthodes complémentaires pour doter les bras robotiques low-cost d'une sensibilité à l'effort sans capteur de force dédié. NEXT (Neural External Torque Estimation) estime les couples externes appliqués aux articulations à partir de données de mouvement libre uniquement : dix minutes de collecte suffisent pour un entraînement d'une minute, avec des performances comparables à celles de capteurs de couples articulaires dédiés. FIRST (Force-Informed Re-Sampling Training) exploite ces estimations pendant le behavior cloning en sur-échantillonnant les phases précédant le contact et les phases de contact elles-mêmes. Sur cinq tâches à horizon long impliquant des manipulations contacts-riches, FIRST dépasse les politiques force-aware antérieures de plus de 17% en progression de tâche. Code et vidéos sont disponibles à jasonjzliu.com/factr2. L'impact principal concerne les intégrateurs opérant sur des bras collaboratifs sans instrumentation force-couple : UR, Franka, Kinova ou Dobot ne sont pas livrés avec des capteurs six axes, dont le coût unitaire dépasse fréquemment 5 000 euros. En éliminant ce prérequis matériel, NEXT rend la télé-opération à retour d'effort et l'apprentissage par démonstration accessibles sur flottilles existantes sans modification mécanique. Le gain de 17% sur des tâches longues comme l'insertion ou l'assemblage est non trivial, même si ces benchmarks en laboratoire restent à valider en conditions industrielles. Ce que cette contribution établit : la perception d'effort peut être inférée par voie logicielle, sans modifier la mécanique du robot. La publication s'inscrit dans la continuité de FACTR (arXiv:2502.02022, 2025, même groupe), qui explorait déjà l'apprentissage de politiques contacts-riches par télé-opération avec retour de force. Le paysage concurrentiel inclut les approches à capteurs tactiles (DIGIT de Meta, GelSight du MIT), les estimateurs de couple par résidus de dynamique utilisés à DLR et Fraunhofer, et les travaux sur la perception haptique chez Physical Intelligence et Figure AI. Les prochaines étapes naturelles seront la validation sur hardware industriel certifié et l'intégration dans des pipelines VLA (Vision-Language-Action), où la perception d'effort reste une lacune connue des politiques déployées à grande échelle.

UELes laboratoires européens (DLR, Fraunhofer) et intégrateurs utilisant des bras Franka Emika (fabricant allemand) peuvent évaluer NEXT/FIRST sur leurs flottes existantes sans investissement matériel supplémentaire, abaissant le coût d'accès à l'apprentissage contacts-riches.

💬 Dix minutes de collecte de données pour remplacer un capteur à 5 000€, c'est là que ça devient vraiment intéressant. Les intégrateurs qui tournent sur du Franka ou du UR sans instrumentation force-couple vont pouvoir tester ça sur leurs flottes sans toucher à la mécanique, et le +17% sur des tâches longues comme l'insertion c'est pas du bruit. Reste à voir si ça tient hors conditions de labo, mais la direction est la bonne.

IA physiquePaper
1 source
DAM-VLA : modèle vision-langage-action multimodal asynchrone et découplé
100arXiv cs.RO 

DAM-VLA : modèle vision-langage-action multimodal asynchrone et découplé

Une équipe du groupe Intuitive Robots publie DAM-VLA (Decoupled Asynchronous Multimodal Vision-Language-Action), un modèle VLA déposé sur arXiv le 11 juin 2026 (2606.12105) qui remet en cause le paradigme d'horloge synchrone des architectures VLA actuelles. Le problème identifié est structurel : les modèles vision-langage-action héritent d'un préentraînement où toutes les modalités partagent la même fréquence de traitement. Or en manipulation physique, les capteurs proprioceptifs opèrent à plusieurs centaines de hertz, la vision évolue bien plus lentement, et les instructions langagières restent constantes sur l'ensemble d'un épisode. Oversampler la vision et sous-échantillonner la proprioception plafonne la qualité du contrôle. DAM-VLA maintient des tampons latents par modalité, chacun rafraîchi à la fréquence de son propre capteur et consulté en continu par la tête d'action via gated cross-attention, sans modifier le backbone préentraîné. Sur sept tâches de manipulation en contact réel (contact-rich), le modèle atteint 95,2 % de succès contre 40,95 % pour la meilleure baseline synchrone, tout en assurant un contrôle fluide à 100 Hz. Ce doublement du taux de succès sur des tâches contact-rich est un résultat conséquent. Il suggère que le sim-to-real gap dans les VLA est aussi un problème de temporalité : rater des transitions haptiques critiques lors d'une insertion ou d'un vissage dégrade le contrôle plus que la généralisation visuelle. Pour un intégrateur industriel, 100 Hz en sortie d'action passe le seuil minimal pour des tâches de précision en cellule automatisée. L'architecture ne modifiant pas le backbone, elle préserve la réutilisabilité des poids préentraînés, ce qui réduit le coût d'adoption pour les équipes déjà investies sur des bases VLA existantes. Les VLA déployés en production récente, Pi-0 de Physical Intelligence, OpenVLA et Octo, ainsi que les approches commerciales de Figure AI (Figure 03) ou NVIDIA (GR00T N2), opèrent sur le paradigme synchrone. DAM-VLA propose une troisième voie entre la boucle unifiée et le découpage hiérarchique dual-system. Quelques réserves s'imposent : il s'agit d'un preprint sans revue par les pairs confirmée, les sept tâches évaluées restent de portée laboratoire, et aucun déploiement industriel ni partenariat commercial n'est annoncé. Les étapes critiques, validation sur manipulateurs bi-bras et intégration de capteurs force-couple haute fréquence comme modalité principale, restent à démontrer hors contexte académique.

IA physiqueOpinion
1 source