Aller au contenu principal

Actualités robotique — page 111

5 707 articles au fil, du plus récent au plus ancien.

Une peau électronique étirable permet à une main robotique de ressentir le toucher et la pression
5501Interesting Engineering 

Une peau électronique étirable permet à une main robotique de ressentir le toucher et la pression

Des chercheurs de l'Université de Turku (Finlande) ont développé une peau électronique étirable, transparente et conductrice, intégrée à une main robotique pour lui conférer une sensibilité au toucher. L'équipe, dirigée par le professeur assistant Vipul Sharma en génie des matériaux, s'est inspirée de l'architecture de structures biologiques comme les feuilles d'arbres pour concevoir un substrat à la fois flexible, respirant et conducteur, combinaison rare dans les matériaux électroniques conventionnels. Des capteurs de pression embarqués dans cette peau répondent au contact et génèrent un retour haptique sur la main instrumentée. La même université développe en parallèle, via Anastasia Koivikko en génie de l'automatisation, des robots à structure souple pour la santé et l'industrie, actionnables par air comprimé, électricité ou fluide, capables d'opérer en espace confiné ou en environnement dangereux, centrales nucléaires et opérations de sauvetage souterraines comprises. Aucune métrique de résolution sensorielle ni calendrier de commercialisation n'est avancé : il s'agit à ce stade d'une preuve de concept en laboratoire. La combinaison de flexibilité mécanique et de perception tactile constitue un verrou pour des marchés à fort impact : prothèses capables de distinguer pression, température et humidité, robots chirurgicaux interagissant en sécurité avec des tissus humains, bras industriels manipulant des objets fragiles en boucle sensorielle fermée. Pour les intégrateurs, la capacité à conformer la peau sur des surfaces courbes comme les doigts ou les membres artificiels sans perte de performance représente un avantage concret sur les capteurs rigides qui équipent la majorité des effecteurs actuels. L'utilisation de biomasse finlandaise issue du bois local comme substrat biosourcé vise à réduire la dépendance aux approvisionnements asiatiques en matériaux d'électronique, enjeu de souveraineté industrielle croissant pour les équipementiers européens sous pression réglementaire. Sur le plan compétitif, la recherche en e-skin mobilise des groupes de référence comme celui de Zhenan Bao à Stanford et plusieurs équipes européennes à l'EPFL et au KIT de Karlsruhe. Des acteurs commerciaux tels que Pressure Profile Systems ou Tekscan proposent déjà des capteurs tactiles flexibles pour la robotique industrielle, mais les substrats biosourcés transparents restent peu exploités commercialement. L'équipe de Turku, positionnée dans l'espace UE, n'annonce ni partenaire industriel ni prototype pré-série. Les suites logiques incluent des tests d'endurance mécanique sous cycles de flexion répétés, la caractérisation précise de la résolution spatiale des capteurs, et un rapprochement potentiel avec des fabricants de prothèses ou des acteurs de la robotique médicale.

FR/EU ecosystemePaper
1 source
Accenture, Vodafone et SAP testent des robots humanoïdes en entrepôt
5502Robotics Business Review 

Accenture, Vodafone et SAP testent des robots humanoïdes en entrepôt

Accenture, Vodafone Procure & Connect et SAP ont mené un pilote de robotique humanoïde dans l'entrepôt de Vodafone à Duisburg, en Allemagne, dont les résultats ont été présentés à Hannover Messe 2026. Durant ce programme, les robots recevaient leurs missions d'inspection directement via le système SAP Extended Warehouse Management (EWM) et effectuaient de manière autonome des rondes visuelles dans l'installation : détection de produits mal placés ou endommagés, évaluation de l'empilement des palettes et de la répartition des charges, repérage d'espaces de stockage sous-utilisés, identification de risques comme des obstacles dans les allées ou des palettes mal alignées. Les conclusions étaient remontées en temps réel dans le système SAP. Les robots sont équipés de la solution "Robot Brain" d'Accenture, entraînés dans des jumeaux numériques construits via l'Accenture Physical AI Orchestrator, lui-même basé sur NVIDIA Omniverse, le blueprint NVIDIA Mega et les outils NVIDIA Metropolis pour la vision IA. Ils interagissent avec les opérateurs par la voix, les gestes et le texte. Un point à noter : aucun modèle de robot humanoïde n'est communiqué dans les annonces officielles, et aucune métrique de performance -- charge utile, degrés de liberté, temps de cycle -- n'a été publiée. L'intérêt de ce pilote réside moins dans la prouesse robotique que dans la démonstration d'une intégration native avec un WMS standard du marché. SAP EWM équipe une grande partie des opérations logistiques mondiales : si cette interface tient à l'échelle, elle réduit considérablement la friction d'adoption pour les grands acteurs industriels, qui n'auront pas à refondre leur SI existant. Pour les COO logistiques, les arguments avancés -- réduction des accidents de travail, des heures supplémentaires et de la dépendance à l'intérim -- sont bien plus concrets que la promesse de l'"IA physique". Vodafone Procure & Connect va plus loin en évoquant explicitement un futur "business de solutions de main-d'oeuvre humanoïde", ce qui signale une ambition de monétiser l'expérience acquise au-delà de l'usage interne -- un signal que les intégrateurs et les investisseurs du secteur logistique devraient noter. Ce pilote s'inscrit dans la stratégie d'Accenture de se positionner comme intégrateur de référence pour la robotique humanoïde en entreprise, en capitalisant sur son partenariat technologique avec NVIDIA. Dans un marché où Boston Dynamics déploie Stretch chez DHL et GXO, Figure AI a signé avec BMW, et Apptronik travaille avec Mercedes-Benz, Accenture joue la carte de la couche d'intégration SI plutôt que du hardware -- aucun fabricant de robot n'est nommé dans les communications, ce qui suggère soit une architecture hardware-agnostique, soit des partenariats encore confidentiels. Pour SAP, c'est une démonstration de la pertinence de l'EWM dans un monde de robots physiques autonomes. Les prochaines étapes restent vagues : une extension à la chaîne d'approvisionnement globale de Vodafone est évoquée, mais sans dates ni volumes cibles. Ce projet demeure, pour l'heure, un pilote présenté en salon -- pas encore un déploiement industriel confirmé.

FR/EU ecosystemeOpinion
1 source
Vidéo du vendredi : qui gagne entre un robot et un joueur professionnel de ping-pong ?
5503IEEE Spectrum Robotics 

Vidéo du vendredi : qui gagne entre un robot et un joueur professionnel de ping-pong ?

La semaine du 18 avril 2026 a été marquée par plusieurs démonstrations robotiques notables, dont la plus emblématique s'est déroulée à Pékin : lors d'un semi-marathon de 21 kilomètres réunissant 12 000 coureurs humains, plus de 100 robots humanoïdes ont pris le départ aux côtés d'athlètes humains, et trois d'entre eux ont franchi la ligne d'arrivée avant tout concurrent humain. Ce résultat, relayé par Al Jazeera, illustre une progression rapide de la locomotion bipedale en conditions réelles. En parallèle, Sony AI publiait dans Nature les résultats d'un système autonome capable de disputer une partie de ping-pong contre des joueurs professionnels, en relevant le défi de la perception haute vitesse et du contrôle dynamique en temps réel, deux verrous longtemps considérés comme bloquants pour l'IA physique compétitive. Autre fait marquant, le robot AthenaZero du Robotics and AI Institute a réalisé du jonglage à trois balles à mains nues, sans motion capture externe ni entonnoir mécanique, en s'appuyant uniquement sur des capteurs embarqués et une coordination oeil-main apprise pour gérer l'incertitude au contact. Ces résultats alimentent le débat sur l'écart entre démonstration et déploiement réel. Le semi-marathon de Pékin constitue une preuve de robustesse locomotrice en environnement non contrôlé, même si les conditions de course (surface, pace, assistance technique en bord de piste) mériteraient d'être précisées pour évaluer la comparabilité exacte avec une performance humaine. La publication Sony dans Nature donne une légitimité scientifique au domaine de l'IA physique compétitive et valide l'idée que des boucles de contrôle rapide peuvent être apprises à partir de données réelles plutôt que simulées. AthenaZero, de son côté, illustre les progrès du sim-to-real sur des tâches de manipulation dynamique sans infrastructure externe, ce qui ouvre la voie à des applications industrielles de tri ou de reorientation d'objets en mouvement. En contrepoint, IEEE Spectrum souligne que la vraie valeur en entrepôt vient encore de systèmes d'automatisation mobile comme ceux de Berkshire Grey, et non des humanoïdes, une nuance importante pour les décideurs B2B qui évaluent des ROI à court terme. Le contexte de cette semaine s'inscrit dans une accélération visible de la robotique chinoise, portée notamment par des acteurs comme Unitree, qui présente des séquences de locomotion en milieu non structuré, et DEEP Robotics, dont les robots quadrupèdes sont déjà déployés en patrouille résidentielle en Amérique du Nord. Sur le plan matériau, le Max Planck Institute for Intelligent Systems a publié une méthode d'évaluation des actionneurs électrostatiques souples utilisant des actionneurs Peano-HASEL, atteignant un rendement électromécanique de 63,6 %, soit plus de trois fois supérieur aux valeurs antérieurement rapportées, ce qui ouvre des perspectives pour des robots légers et silencieux. Côté mobilité aérienne, Skydio a montré la capture de drones en vol avec un bras UR20, tandis qu'ETH Zurich continue ses travaux sur drones suractuatés. Enfin, Sphero se positionne pour combler le vide laissé par LEGO Mindstorms sur le marché de la robotique éducative, un segment commercial non négligeable laissé en friche depuis l'abandon de la gamme par LEGO.

IA physiquePaper
1 source
Melody : un robot humanoïde maîtrise 39 degrés de liberté pour une présence quasi humaine
5504Interesting Engineering 

Melody : un robot humanoïde maîtrise 39 degrés de liberté pour une présence quasi humaine

Realbotix, entreprise canadienne spécialisée dans la robotique humanoïde, déploie son robot Melody dans un rôle d'accueil lors de la conférence Bitcoin 2026 au Venetian Resort de Las Vegas, du 27 au 29 avril 2026. Melody appartient à la gamme M-Series, une plateforme modulaire à corps entier dotée de 39 degrés de liberté concentrés dans la partie supérieure du corps, la partie inférieure restant fixe. Le robot est disponible en configurations masculine, féminine ou sur-mesure, et peut être installé en position assise, debout ou de bureau. Alimenté par prise électrique standard sans contrainte de batterie, il tourne en continu sur une journée complète. Sur site, Melody accueille les participants, les aide à localiser les stands et répond aux questions générales grâce à un système d'IA conversationnelle propriétaire développé par Realbotix. La plateforme est proposée à partir de 95 000 dollars, ce qui la positionne clairement dans le segment haut de gamme des interfaces physiques d'accueil. Ce qui est notable ici n'est pas tant la prouesse technique brute que le positionnement commercial : Realbotix cible explicitement les environnements à fort trafic humain où les bornes interactives classiques montrent leurs limites en termes d'engagement. Avec 39 DDL en partie supérieure, Melody peut produire des expressions faciales, des gestes et un contact visuel suffisamment fluides pour réduire l'effet "vallée dérangeante" qui a longtemps freiné l'adoption des robots humanoïdes en contexte public. La modularité des visages et panneaux de carrosserie ouvre la voie à des déploiements multi-marques ou multi-contextes sans changer de plateforme matérielle. Pour un intégrateur ou un décideur B2B, le modèle économique est celui d'un remplacement de kiosque à ROI mesurable sur la qualité d'interaction, non sur la productivité opérationnelle. Il faut cependant noter que cette présentation à Las Vegas reste une démonstration publique contrôlée, pas un déploiement commercial à grande échelle, et qu'aucune donnée de performance terrain n'a été publiée à ce stade. Realbotix opère dans un segment en pleine ébullition, celui des humanoïdes orientés "présence" plutôt que manipulation industrielle. La startup chinoise AheadForm pousse des concepts similaires avec ses séries Origin F1 et Elf, combinant IA auto-supervisée et mouvements bioniques avec synchronisation labiale précise. Ces acteurs se distinguent des approches Boston Dynamics ou Figure AI, qui visent la manutention et la logistique. Andrew Kiguel, PDG de Realbotix, positionne explicitement la M-Series comme une "interface physique pour l'IA" dans les secteurs de service, une thèse que plusieurs grandes chaînes hôtelières et aéroports testent discrètement depuis 2024. La suite logique serait des pilotes dans des environnements comme les hôtels, les banques ou les aéroports, mais Realbotix n'a pas annoncé de partenariats commerciaux formels au-delà de cette démonstration.

HumanoïdesOpinion
1 source
Robot Talk, épisode 153 : des robots inspirés de l'origami, avec Chenying Liu
5505Robohub 

Robot Talk, épisode 153 : des robots inspirés de l'origami, avec Chenying Liu

Chenying Liu, Junior Research Fellow et Associate Member of Faculty au Department of Engineering Science de l'Université d'Oxford, était l'invitée du 153e épisode du podcast Robot Talk pour présenter ses travaux sur l'intelligence physique incarnée (embodied physical intelligence). Sa recherche explore comment la forme physique d'un robot peut activement contribuer à la perception, au traitement de l'information, à la prise de décision et au mouvement, en s'inspirant notamment des principes géométriques de l'origami. L'épisode ne communique pas de métriques techniques précises, pas de charges utiles, de degrés de liberté ni de résultats expérimentaux chiffrés, ce qui le situe davantage dans la vulgarisation académique que dans l'annonce produit. L'approche d'Oxford que défend Liu représente un contrepoids notable au paradigme dominant du tout-logiciel : plutôt que de déléguer l'intelligence uniquement aux modèles de fondation et aux VLA (Vision-Language-Action models), l'idée est d'intégrer la computation directement dans la géométrie et les matériaux du robot. Cette co-conception mécanique-contrôle promet des systèmes plus robustes et plus efficaces en énergie, particulièrement pertinents pour des environnements non structurés où les modèles sim-to-real peinent encore. Ce courant de recherche, parfois appelé morphological computation ou soft robotics computationnelle, est actif dans plusieurs laboratoires mondiaux, MIT CSAIL, ETH Zurich, EPFL, ainsi qu'en France au CNRS LIRMM et à l'INRIA. Oxford se positionne ici via une chercheuse indépendante dont le programme, encore jeune, n'a pas encore de partenaires industriels publiquement annoncés. La prochaine étape naturelle serait une publication de résultats expérimentaux ou un prototype démontrant le gain d'autonomie promis par cette philosophie de conception.

RecherchePaper
1 source
Vidéo : le robot humanoïde Unitree G1 épate avec des sauts acrobatiques et pirouettes sur patins
5506Interesting Engineering 

Vidéo : le robot humanoïde Unitree G1 épate avec des sauts acrobatiques et pirouettes sur patins

Unitree Robotics a publié le 23 avril une vidéo montrant son robot humanoïde G1 exécuter des figures sur rollers et patins à glace : virages à 360 degrés, rotations sur une jambe, et frontflips, le tout en maintenant l'équilibre via un contrôle coordonné des roues et des membres articulés. La plateforme G1 est un hybride roues-jambes lancé en novembre 2025 sous la désignation G1-D, disponible en deux versions. La version Standard, stationnaire, embarque 17 degrés de liberté ; la version Flagship, motorisée par une base à entraînement différentiel capable de 1,5 m/s, monte à 19 DOF. Les deux variantes mesurent entre 126 et 168 cm pour un poids maximal de 80 kg. Chaque bras offre 7 DOF et supporte une charge utile de 3 kg. L'articulation de taille permet 155° de rotation sur l'axe Z et une plage de -2,5° à 135° sur l'axe Y, couvrant une enveloppe de travail verticale de 2 mètres. La perception repose sur une caméra binoculaire en tête et des caméras poignet pour la vision rapprochée. La version Flagship tourne sur un module Nvidia Jetson Orin NX délivrant jusqu'à 100 TOPS, avec une autonomie annoncée de six heures. Cette démonstration illustre une tendance de fond : la mobilité humanoïde sort du strict bipédisme pour intégrer la locomotion hybride. L'association roues et jambes avait été largement laissée de côté au profit du seul marcheur anthropomorphe, considéré comme la voie vers les environnements humains. Unitree repose la question en montrant qu'un humanoïde peut gagner en efficacité énergétique et en polyvalence terrain sans sacrifier l'adaptabilité des membres. Sur le fond, la vidéo reste une démonstration contrôlée, pas un déploiement industriel, et les conditions de tournage ne sont pas précisées. Ce type de footage sélectif est courant dans le secteur et ne documente pas les taux d'échec ni les conditions réelles d'opération. Ce qui est lisible, néanmoins, c'est la maturité des algorithmes de contrôle temps réel et l'apport de l'entraînement en simulation pour des mouvements dynamiques complexes. Unitree, fondée en Chine et connue pour ses quadrupèdes Go1 et B2, a accéléré son virage humanoïde avec le G1 commercialisé à partir de 16 000 dollars en 2024, un prix agressif qui le positionne directement contre les plateformes de recherche d'Agility Robotics (Digit), Figure (Figure 02) et Boston Dynamics (Atlas). Le G1-D intègre un stack logiciel complet couvrant l'annotation de données, la simulation et l'entraînement distribué, ce qui signale une ambition au-delà du hardware : se positionner comme plateforme de développement de modèles d'action (VLA). La prochaine étape attendue du secteur est le passage de ces démos en conditions contrôlées à des déploiements industriels répétables, un saut que ni Unitree ni ses concurrents n'ont encore documenté publiquement à grande échelle.

HumanoïdesOpinion
1 source
Flex et Teradyne Robotics renforcent leur partenariat pour déployer l'automatisation intelligente dans l'industrie mondiale
5507Robotics & Automation News 

Flex et Teradyne Robotics renforcent leur partenariat pour déployer l'automatisation intelligente dans l'industrie mondiale

Flex, l'un des plus grands sous-traitants industriels mondiaux avec des dizaines de sites de production dans une trentaine de pays, et Teradyne Robotics ont annoncé en avril 2026 l'élargissement de leur partenariat pour déployer l'automatisation intelligente à grande échelle dans la fabrication mondiale. L'accord instaure une double relation : Flex intègre les solutions de Teradyne Robotics directement dans ses propres lignes de production, tout en assurant la fabrication de composants robotiques clés pour permettre des déploiements plus larges chez les clients de Teradyne. Les volumes de déploiement visés et les détails financiers de l'accord n'ont pas été communiqués. Ce positionnement simultané en tant que client et fournisseur constitue un modèle industriel peu courant et potentiellement structurant. Pour un décideur B2B, le signal est clair : un EMS (Electronics Manufacturing Services) de cette envergure valide en conditions réelles la maturité opérationnelle des cobots Universal Robots et des robots mobiles MiR, les deux marques regroupées sous Teradyne Robotics. L'accord sécurise également une capacité de fabrication de composants externe pour Teradyne, réduisant les risques de montée en volume sans investissement industriel propre supplémentaire, un avantage concret dans un marché où la capacité de production reste un goulot d'étranglement. Teradyne Robotics est la division robotique de Teradyne Inc., issue de l'acquisition d'Universal Robots en 2015 (environ 285 millions de dollars) puis de MiR en 2018. L'entreprise fait face à une concurrence croissante sur les deux segments : Fanuc, Doosan et Techman Robot gagnent du terrain sur les cobots, tandis qu'Exotec (acteur français en logistique automatisée) et Zebra Technologies (Fetch Robotics) accélèrent sur les AMR. Le réseau de production de Flex, qui couvre des verticales aussi variées que l'automobile, le médical et l'électronique grand public, pourrait servir de terrain d'expansion accéléré pour Teradyne sans passer par les cycles habituels d'intégration terrain.

IndustrielActu
1 source
La Chine prévoit d'investir des milliards pour déployer une armée de robots dans son réseau électrique
5508SCMP Tech 

La Chine prévoit d'investir des milliards pour déployer une armée de robots dans son réseau électrique

La State Grid Corporation of China (SGCC), principal opérateur du réseau électrique national, a annoncé un plan d'investissement de 6,8 milliards de yuans (environ 1 milliard de dollars) pour déployer des milliers de robots dotés d'intelligence artificielle sur l'ensemble de ses infrastructures. Ces systèmes, désignés sous le terme "embodied intelligence" dans le document officiel, seront chargés d'inspecter des sous-stations isolées, d'effectuer la maintenance de lignes très haute tension et d'assurer des opérations de surveillance continues sur un réseau qui alimente 1,1 milliard de personnes. Le calendrier de déploiement n'a pas encore été précisé publiquement. L'ampleur du budget alloué signale un changement de posture : la SGCC ne teste plus des prototypes en laboratoire mais engage un déploiement industriel à grande échelle sur des infrastructures critiques. Pour les intégrateurs et fournisseurs de systèmes robotiques, cela représente un appel d'offres structurant susceptible d'accélérer la standardisation des robots d'inspection sur lignes haute tension, un segment jusqu'ici fragmenté entre solutions maison et prestataires spécialisés. La décision valide aussi l'argument selon lequel les environnements dangereux et répétitifs constituent le premier marché rentable pour les robots autonomes, bien avant les usines de production polyvalentes. Ce mouvement s'inscrit dans la stratégie industrielle chinoise "Made in China 2025" et ses prolongements, qui ciblent explicitement la robotique incarnée comme secteur stratégique. Des acteurs comme Unitree, Leju Robotics ou UBTECH sont positionnés pour répondre à ces appels d'offres, en concurrence avec des équipementiers spécialisés dans l'inspection de lignes. À l'international, des initiatives similaires existent chez EDF ou TenneT, mais aucune ne mobilise des budgets comparables sur une seule commande groupée. Les prochaines étapes attendues sont la publication des cahiers des charges techniques et la sélection des fournisseurs, probablement d'ici fin 2026.

Chine/AsieOpinion
1 source
XYZ Embodied AI lance le sac à dos de calcul embarqué BotPack B Series
5509Pandaily 

XYZ Embodied AI lance le sac à dos de calcul embarqué BotPack B Series

XYZ Embodied AI (星源智机器人) a présenté le 23 avril 2026 au salon Hannover Messe en Allemagne sa gamme BotPack B Series, un sac à dos de calcul embarqué destiné aux robots quadrupèdes et humanoïdes. La gamme comprend deux modèles, le B5 et le B4, tous deux propulsés par des puces NVIDIA. L'ensemble pèse moins de 2,5 kg et embarque des interfaces réseau haut débit (Ethernet 10G, 5G et Wi-Fi 7) ainsi que des modules de positionnement pour la navigation autonome. La compatibilité a été confirmée avec le robot humanoïde Unitree G1 de Unitree Robotics. L'objectif affiché est de permettre aux robots d'exécuter des modèles d'IA localement, en réduisant la dépendance au cloud et la latence de traitement associée. La mise en production de capacités de calcul edge directement sur le châssis d'un robot répond à un verrou opérationnel fréquemment cité par les intégrateurs : la dépendance à une connectivité cloud stable nuit aux déploiements en environnements industriels contraints, ateliers, entrepôts ou zones à couverture réseau limitée. Un backpack standardisé compatible avec plusieurs plateformes ouvre la voie à une séparation entre matériel robot et compute stack, une logique analogue à celle des AMR modulaires. La connectivité Wi-Fi 7 et 5G, couplée à un Ethernet 10G, cible clairement les cas d'usage en inférence temps réel de modèles VLA (Vision-Language-Action), où la latence est critique. Il reste à valider en conditions réelles quelle charge de modèle les configurations B4 et B5 peuvent effectivement supporter, XYZ n'ayant publié ni benchmarks ni données terrain. XYZ Embodied AI avait précédemment développé la plateforme T5, une unité de calcul embarqué positionnée sur le même segment ; la BotPack B Series constitue une évolution vers des formats plus compacts et universels. Hannover Messe 2026 concentre plusieurs annonces dans le domaine du edge computing pour la robotique, un marché en structuration où NVIDIA pousse son stack Isaac/Jetson et où des startups spécialisées compute-on-robot émergent. La compatibilité affichée avec le Unitree G1 positionne le produit face aux solutions de compute intégrées des fabricants humanoïdes comme Agility Robotics ou Figure AI. Aucun prix ni volume de déploiement n'a été communiqué, ce qui classe cette annonce comme lancement commercial sans validation industrielle publique à ce stade.

InfrastructureOpinion
1 source
Deep Robotics déploie des robots quadrupèdes chez FAW pour l'inspection industrielle
5510Pandaily 

Deep Robotics déploie des robots quadrupèdes chez FAW pour l'inspection industrielle

Deep Robotics a annoncé le 23 avril 2026 le déploiement de son robot quadrupède Jueying X30 sur un site industriel du groupe FAW (First Automobile Works), l'un des plus grands constructeurs automobiles chinois. Les robots assurent des missions d'inspection automatisée au sein du parc manufacturier, opérant en continu 24h/24 et 7j/7, y compris en conditions de faible luminosité grâce à un module multi-capteurs embarqué. Le Jueying X30 s'intègre aux systèmes de contrôle d'accès du site pour franchir les portes de manière autonome et navigue indifféremment en environnements intérieurs et extérieurs. Les données collectées et les alertes sont centralisées sur une plateforme dédiée pour le suivi et le reporting. L'annonce ne précise pas les métriques clés habituellement attendues dans ce type de déploiement : vitesse de déplacement, autonomie de la batterie, superficie couverte, nombre d'unités déployées ou résultats opérationnels mesurés. Le déploiement chez FAW constitue un signal intéressant pour le marché de l'inspection industrielle quadrupède, qui cherche depuis plusieurs années à dépasser le stade du pilote isolé. L'intégration native au contrôle d'accès et la capacité à opérer en extérieur comme en intérieur répondent à des contraintes réelles des sites manufacturiers à grande échelle, notamment la couverture incomplète des rondes humaines et les difficultés de recrutement pour les postes de nuit. Pour un intégrateur ou un responsable maintenance industrielle, ce type de déploiement valide le cas d'usage "inspection de site" sur un terrain exigeant, même si l'absence de KPI publics rend difficile l'évaluation de la maturité réelle de la solution versus une démonstration commerciale. Deep Robotics, fondée à Hangzhou, développe la gamme Jueying depuis plusieurs années et positionne le X30 comme sa référence pour l'inspection industrielle lourde. La concurrence sur ce segment est dense : Boston Dynamics Spot reste la référence mondiale la plus déployée, Unitree pousse ses modèles B2 sur les marchés sensibles au prix, et ANYbotics (Zurich) avec son ANYmal C est le principal acteur européen actif sur les sites Oil & Gas et manufacturiers. Ghost Robotics (Philadelphie) cible quant à lui les applications défense et sécurité. La prochaine étape pour Deep Robotics sera de publier des données de performance terrain pour crédibiliser ce déploiement au-delà du communiqué de presse.

Chine/AsieActu
1 source
CorridorVLA : contraintes spatiales explicites pour les têtes d'action génératives via des ancres éparses
5511arXiv cs.RO 

CorridorVLA : contraintes spatiales explicites pour les têtes d'action génératives via des ancres éparses

Une équipe de chercheurs propose CorridorVLA (arXiv 2504.21241), une méthode visant à améliorer la précision des modèles Vision-Langage-Action (VLA) en robotique de manipulation. Le principe : prédire des ancres spatiales éparses exprimées comme des variations incrémentales de position (delta-positions), qui définissent une zone de tolérance explicite, un "couloir", dans l'objectif d'entraînement de la tête d'action générative. Les trajectoires sortant de ce couloir reçoivent des gradients correctifs ; les petits écarts liés au bruit d'exécution ou aux contacts restent tolérés. Sur le benchmark LIBERO-Plus, CorridorVLA améliore le taux de succès de 3,4 % à 12,4 % selon les configurations testées : appliqué à GR00T de NVIDIA, le variant GR00T-Corr atteint 83,21 % de taux de succès absolu, contre moins de 71 % pour la baseline ; appliqué à SmolVLA de HuggingFace, les gains sont comparables. Le code est publié sur GitHub (corridorVLA). Ce travail touche à un problème structurel des VLA actuels : la guidance spatiale y est injectée implicitement via des représentations latentes, ce qui rend les trajectoires générées difficiles à auditer ou à contraindre géométriquement. C'est l'une des causes principales pour lesquelles les VLA peinent au passage sim-to-real en manipulation précise. En rendant ces contraintes explicites et interprétables, CorridorVLA offre un levier concret aux intégrateurs robotiques : comprendre et potentiellement déboguer pourquoi une trajectoire est corrigée. La tête d'action par flow-matching, technique de modélisation générative continue, bénéficie ainsi d'un signal de supervision géométrique direct, sans recourir à des démonstrations denses ni à une supervision pixel à pixel. Ce résultat s'inscrit dans une tendance qui cherche à structurer l'espace de sortie des VLA plutôt qu'à augmenter la puissance brute du backbone multimodal. LIBERO-Plus est une extension plus exigeante de LIBERO, suite standard d'évaluation en manipulation tabletop. GR00T, annoncé par NVIDIA en 2024 comme modèle fondation pour robots humanoïdes, et SmolVLA, publié par HuggingFace en 2025 comme alternative compacte et accessible, constituent les deux familles de baselines retenues, ce qui renforce la portée des résultats. Pi-0 de Physical Intelligence et OpenVLA restent les principaux concurrents directs dans ce segment des VLA généralistes. Ce travail demeure un preprint non évalué par les pairs, sans déploiement sur robot physique annoncé ; les prochaines étapes probables incluent une validation sur manipulateurs réels (type Franka ou UR) et une soumission à CoRL ou IROS 2025.

IA physiqueOpinion
1 source
Démystifier la conception de l'espace d'action pour les politiques de manipulation robotique
5512arXiv cs.RO 

Démystifier la conception de l'espace d'action pour les politiques de manipulation robotique

Une étude empirique de grande envergure, publiée sur arXiv (référence 2602.23408), apporte les premières réponses systématiques à une question restée sans réponse rigoureuse dans la communauté de la manipulation robotique : comment concevoir l'espace d'action d'une politique apprise par imitation ? Les chercheurs ont conduit plus de 13 000 déploiements réels sur un robot bimanuel, entraîné et évalué plus de 500 modèles sur quatre scénarios distincts, en examinant deux axes structurants : l'axe temporel (représentations absolues vs. incrémentales, dites "delta") et l'axe spatial (espace articulaire, ou joint-space, vs. espace opérationnel, ou task-space). Le résultat principal est sans ambiguïté : les représentations delta, qui encodent des variations de position plutôt que des positions cibles absolues, améliorent systématiquement les performances d'apprentissage. Sur l'axe spatial, joint-space et task-space révèlent des forces complémentaires : le premier favorise la stabilité du contrôle, le second facilite la généralisation à de nouveaux scénarios. Ces résultats ont une portée directe pour les équipes qui développent des politiques robotiques en production. Jusqu'ici, le choix de l'espace d'action relevait d'heuristiques héritées ou de conventions propres à chaque laboratoire, sans base empirique solide. L'étude montre que ce choix n'est pas accessoire : il conditionne fondamentalement le paysage d'optimisation de l'apprentissage par imitation, bien davantage que ce que supposait la littérature. Pour un intégrateur ou un ingénieur concevant un système de manipulation industrielle, la recommandation est désormais claire : préférer les delta actions par défaut, et arbitrer entre joint-space et task-space selon que la priorité est la stabilité du suivi de trajectoire ou la robustesse face à la variabilité des tâches. Ces conclusions sont directement applicables aux architectures VLA (Vision-Language-Action), qui dominent actuellement la recherche en politiques généralisables. Ce travail intervient dans un contexte où la course à la mise à l'échelle des données et des modèles concentre la majorité des ressources de recherche. Des systèmes comme pi-0 (Physical Intelligence), ACT ou Diffusion Policy ont popularisé l'imitation learning comme voie principale vers la manipulation généraliste, et des acteurs comme Figure AI, 1X ou Apptronik misent sur ces architectures pour leurs déploiements industriels. Pourtant, la conception de l'espace d'action restait guidée par des choix hérités des années 2010, faute d'étude comparative à grande échelle. En comblant ce manque avec une rigueur rare, les auteurs posent une base méthodologique qui devrait informer la prochaine génération de politiques bimanuelle et les benchmarks de comparaison entre systèmes.

RechercheOpinion
1 source
Comment fonctionnent réellement les VLA en environnements ouverts
5513arXiv cs.RO 

Comment fonctionnent réellement les VLA en environnements ouverts

Un article de recherche publié sur arXiv (référence 2604.21192) soumet les modèles vision-langage-action (VLA) à une évaluation critique sur le benchmark BEHAVIOR1K (B1K), un protocole simulant des tâches domestiques complexes de longue durée dans des environnements ouverts. Le constat est net : les métriques standards de ces benchmarks, taux de succès ou score partiel, ne mesurent que l'état final des objets manipulés, indépendamment des événements qui y ont conduit. Un robot qui renverse un verre avant de le replacer peut ainsi obtenir le même score qu'un robot qui l'a manipulé sans incident. Ce protocole dit "progress-agnostic" ignore entièrement les comportements dangereux en cours d'exécution. Les chercheurs ont soumis plusieurs VLA de pointe à une analyse multidimensionnelle couvrant robustesse, reproductibilité, violations de sécurité et causes d'échec des tâches. Les implications sont directes pour tout acteur envisageant un déploiement réel. Si les métriques actuelles gonflent artificiellement les performances rapportées, les décisions d'intégration basées sur ces benchmarks reposent sur des bases fragiles. La distinction est capitale entre un modèle qui complète une tâche et un modèle qui la complète de façon sûre et reproductible, deux propriétés que les scores agrégés actuels confondent. Les auteurs proposent de nouveaux protocoles d'évaluation capables de capturer les violations de sécurité, comblant un angle mort majeur de la recherche. Pour un intégrateur ou un décideur industriel, cela signifie que les chiffres de "success rate" publiés par les laboratoires doivent être lus avec prudence, en exigeant explicitement des données de reproductibilité et des métriques comportementales. La course aux VLA s'est accélérée depuis 2024 avec des modèles comme pi0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA issu de Stanford et Berkeley. Ces systèmes combinent une fondation vision-langage avec un module d'action, affichant des capacités de généralisation notables en simulation. Ce papier suggère que le fossé simulation-réel est peut-être plus profond qu'estimé : des modèles performants sur B1K pourraient s'avérer moins fiables dès lors qu'on intègre sécurité et consistance comportementale comme critères d'évaluation. Les auteurs appellent la communauté à adopter ces nouveaux protocoles dans les futures éditions du B1K Challenge pour aligner les standards de recherche avec les exigences concrètes du déploiement en environnement ouvert.

RechercheOpinion
1 source
Un joint de poignet à abduction-adduction entraîné par tendons améliore les performances d'un exosquelette de membre supérieur à 5 degrés de liberté
5514arXiv cs.RO 

Un joint de poignet à abduction-adduction entraîné par tendons améliore les performances d'un exosquelette de membre supérieur à 5 degrés de liberté

Une équipe de chercheurs a publié sur arXiv (preprint arXiv:2504.20898) une évaluation expérimentale de l'exosquelette de membre supérieur EXOTIC2, enrichi d'un sixième degré de liberté actif au niveau du poignet : le mouvement d'abduction-adduction (Ab-Ad). Le module intégré est compact et léger, utilisant une transmission par tendons pour l'abduction et un rappel par ressort pour l'adduction. Le protocole a impliqué huit adultes sans déficit moteur, soumis à deux tâches fonctionnelles de la vie quotidienne (boire dans un verre, gratter une surface) dans deux conditions randomisées : poignet actif vs. poignet bloqué. Un test de faisabilité préliminaire a également été conduit sur une personne atteinte de sclérose latérale amyotrophique (SLA). Les résultats quantitatifs sont nets : avec le DoF Ab-Ad activé, le taux de renversement lors de la tâche de boisson chute de 56 % à 3 %, et le taux de succès pour le nivellement lors de la tâche de grattage passe de 28 % à 75 %. Aucune dégradation du temps d'exécution n'a été observée. Ces chiffres apportent une preuve expérimentale directe d'un point souvent débattu dans la communauté exosquelette : l'ajout d'un DoF au poignet est fréquemment évité pour des raisons de complexité mécanique et de poids, sans que son bénéfice fonctionnel réel soit bien documenté. Cette étude comble ce vide pour les tâches de préhension et de transport d'objets. L'exosquelette EXOTIC (dont EXOTIC2 est la seconde génération) est développé dans un contexte de rééducation pour personnes à mobilité réduite sévère, notamment les patients SLA. Le domaine des exosquelettes de membre supérieur à vocation clinique reste dominé par quelques acteurs européens et nord-américains : Hocoma, Tyromotion, ou encore le français Wandercraft côté membre inférieur. Pour le membre supérieur, les solutions commerciales disponibles (Armeo, REAplan) intègrent rarement un contrôle actif du poignet en Ab-Ad. Ce travail, encore au stade de preprint, devra être validé sur une cohorte de patients avec déficits moteurs avant toute perspective de commercialisation, mais il pose une base expérimentale solide pour les prochaines itérations de conception.

ExosquelettesPaper
1 source
Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle
5515arXiv cs.RO 

Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle

Une équipe de recherche présente Hi-WM (Human-in-the-World-Model), un cadre de post-entraînement pour politiques robotiques généralisées, publié sur arXiv (2604.21741). L'approche remplace l'exécution physique par un modèle du monde appris : la politique est d'abord déroulée en boucle fermée dans ce simulateur interne, et lorsqu'une trajectoire devient incorrecte ou risquée, un opérateur humain intervient directement dans le modèle pour fournir des actions correctives courtes. Hi-WM met en cache les états intermédiaires et supporte le rollback et le branchement, ce qui permet de réutiliser un seul état d'échec pour générer plusieurs continuations correctives distinctes. Les trajectoires ainsi produites sont réinjectées dans le jeu d'entraînement. Évalué sur trois tâches de manipulation réelle (objets rigides et déformables) avec deux architectures de politique différentes, le système affiche un gain de 37,9 points en taux de succès réel par rapport à la politique de base, et de 19,0 points par rapport à une ligne de base en boucle fermée dans le modèle du monde. La corrélation entre les évaluations dans le modèle et les performances réelles atteint r = 0,953. Ce résultat adresse un goulot d'étranglement structurel du déploiement robotique : le post-entraînement actuel exige du temps robot, des resets de scène, une supervision opérateur en continu, autant de contraintes qui rendent la correction itérative coûteuse à l'échelle. En décorrélant la phase corrective de l'exécution physique, Hi-WM densifie la supervision précisément là où la politique échoue, sans mobiliser le matériel. La forte corrélation sim-to-real (r > 0,95) est notable : elle suggère que le modèle du monde est suffisamment fidèle pour qualifier les politiques avant déploiement, ce qui contredit en partie l'hypothèse que l'évaluation dans le modèle reste trop éloignée des conditions réelles pour être exploitable. Les modèles du monde conditionnés sur les actions sont étudiés depuis plusieurs années principalement pour la génération de données synthétiques et l'évaluation de politiques, notamment dans les travaux autour des VLA (Vision-Language-Action models) et des politiques généralisées comme celles portées par Physical Intelligence (Pi-0) ou les recherches internes de Google DeepMind. Hi-WM repositionne ces modèles comme substrat correctif actif, une troisième fonction jusqu'ici peu explorée. Les suites naturelles incluent l'extension à des tâches de locomotion, la réduction du coût de construction du modèle du monde, et l'intégration dans des pipelines de fine-tuning continu pour robots déployés en environnement industriel variable.

RechercheOpinion
1 source
Apprentissage par renforcement avec priors fondation : vers un agent incarné qui apprend efficacement de manière autonome
5516arXiv cs.RO 

Apprentissage par renforcement avec priors fondation : vers un agent incarné qui apprend efficacement de manière autonome

Des chercheurs ont publié sur arXiv (identifiant 2310.02635, cinquième révision) un cadre appelé RLFP, Reinforcement Learning with Foundation Priors, conçu pour rendre l'apprentissage par renforcement viable sur des robots réels, sans ingénierie manuelle des récompenses. Au coeur du système se trouve l'algorithme FAC (Foundation-guided Actor-Critic), qui s'appuie simultanément sur trois types de modèles fondationnels : un modèle de politique, un modèle de valeur, et un modèle de récompense de succès. Sur cinq tâches de manipulation dextère réalisées avec de vrais robots, FAC atteint un taux de succès moyen de 86 % après seulement une heure d'apprentissage en temps réel. Sur le benchmark simulé Meta-world, il obtient 100 % de succès sur 7 des 8 tâches évaluées, en moins de 100 000 frames d'interaction, là où les méthodes de référence avec récompenses manuelles nécessitent 1 million de frames pour des performances comparables. L'impact industriel potentiel est significatif. L'un des verrous majeurs du déploiement de la robotique apprenante en environnement réel est double : la quantité astronomique de données requise par le RL classique, et le coût humain de la conception des fonctions de récompense, qui exige des ingénieurs spécialisés pour chaque nouvelle tâche. RLFP adresse les deux simultanément, en multipliant par environ dix l'efficacité en données et en automatisant la génération de signal de récompense via des modèles pré-entraînés. Si les résultats se confirment hors conditions de laboratoire, ce type de cadre pourrait réduire drastiquement le temps de mise en service d'un bras industriel sur une nouvelle opération, un enjeu clé pour les intégrateurs. Ce travail s'inscrit dans une tendance de fond qui voit les grands modèles de langage et de vision (VLM/LLM) utilisés comme priors pour guider l'exploration robotique, une approche concurrente des méthodes par imitation pure (apprentissage à partir de démonstrations humaines) ou par curriculum appris. Parmi les travaux proches figurent SayCan (Google), Code as Policies (DeepMind) et les récents VLA comme pi-0 (Physical Intelligence) ou OpenVLA. L'équipe indique que RLFP est agnostique au type de modèle fondationnel utilisé et robuste aux priors bruités, ce qui est une affirmation forte qu'il faudra valider sur des benchmarks extérieurs. Le code et les visualisations sont disponibles publiquement, ce qui facilite la reproduction indépendante.

IA physiqueOpinion
1 source
Compréhension neuro-symbolique de la manipulation par chaînes d'événements sémantiques enrichies
5517arXiv cs.RO 

Compréhension neuro-symbolique de la manipulation par chaînes d'événements sémantiques enrichies

Des chercheurs présentent eSEC-LAM, un cadre neuro-symbolique conçu pour permettre aux robots opérant dans des environnements humains de comprendre les manipulations d'objets en temps réel. Publié sur arXiv (2604.21053), ce travail s'appuie sur les enriched Semantic Event Chains (eSECs), une représentation symbolique relationnelle qui décrit comment les relations spatiales entre objets évoluent au fil d'une séquence de manipulation. eSEC-LAM augmente ces chaînes classiques avec cinq couches d'information supplémentaires : des prédicats pondérés par un score de confiance, des rôles fonctionnels d'objets (outil, patient, récipient), des priors d'affordance, une abstraction en primitives de mouvement, et des indicateurs de saillance pour l'explicabilité. Le système est évalué sur trois benchmarks vidéo reconnus : EPIC-KITCHENS-100, EPIC-KITCHENS VISOR, et Assembly101, couvrant la reconnaissance d'actions, la prédiction de la prochaine primitive, la robustesse au bruit perceptuel et la cohérence des explications. L'intérêt industriel réside dans la prédiction de la prochaine étape de manipulation, un verrou critique pour les robots collaboratifs et les systèmes d'assistance à l'assemblage. Les résultats montrent qu'eSEC-LAM améliore substantiellement cette capacité par rapport aux baselines symboliques classiques et aux modèles vidéo bout-en-bout, tout en restant plus robuste lorsque la perception est dégradée, un scénario fréquent en usine ou à domicile. L'architecture hybride évite la boîte noire des approches purement neuronales : chaque décision est ancrée dans des preuves relationnelles explicites, ce qui facilite l'audit et la certification, deux exigences croissantes pour les intégrateurs industriels soumis aux normes de sécurité fonctionnelle (ISO 10218, EN 13849). Ce n'est pas un modèle VLA qui apprend tout end-to-end depuis des vidéos brutes : c'est délibérément un système de raisonnement léger, conçu pour tourner sans GPU dédié au moment de l'inférence symbolique. Les eSECs ont émergé dans les laboratoires de robotique cognitive au début des années 2010 comme alternative interprétable aux réseaux de neurones pour la compréhension de gestes, mais ils restaient jusqu'ici principalement descriptifs. eSEC-LAM est une tentative de les transformer en états internes actifs pour un raisonnement décisionnel. Dans le paysage concurrent, les approches VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent sur l'apprentissage massif généraliste ; eSEC-LAM propose une voie opposée, plus modulaire et explicable, potentiellement plus adaptée aux certifications réglementaires ou aux domaines à données rares. Les prochaines étapes logiques seraient une validation sur robot réel en boucle fermée et une intégration avec des couches de planification symbolique (PDDL, HTN), pour aller au-delà de la reconnaissance vers l'exécution autonome de tâches multi-étapes.

RecherchePaper
1 source
ExpressMM : des comportements de manipulation mobile expressifs dans les interactions humain-robot
5518arXiv cs.RO 

ExpressMM : des comportements de manipulation mobile expressifs dans les interactions humain-robot

Des chercheurs ont présenté ExpressMM, un framework destiné aux manipulateurs mobiles déployés en environnements humains, capable de générer des comportements expressifs en temps réel pendant l'exécution de tâches collaboratives. Publié sur arXiv (2604.05320v3), le système repose sur une architecture à deux niveaux : un planificateur de haut niveau fondé sur un modèle vision-langage (VLM) prend en charge la perception et le raisonnement conversationnel, tandis qu'une politique vision-langage-action (VLA) de bas niveau produit les mouvements expressifs du robot. Élément distinctif : ExpressMM supporte les interactions interruptibles, c'est-à-dire que l'utilisateur peut modifier ou rediriger les instructions du robot en cours d'exécution. L'évaluation a été conduite sur un manipulateur mobile réel lors d'un scénario d'assemblage collaboratif, avec des démonstrations en direct devant un public et des questionnaires post-session. La majorité des travaux antérieurs sur les comportements expressifs des robots s'appuyaient sur des mouvements préprogrammés ou appris par démonstration, et n'anticipaient pas les interruptions en cours de tâche, un cas pourtant courant dès qu'un humain travaille aux côtés d'un robot. ExpressMM traite cette lacune en couplant une VLA capable de s'adapter dynamiquement aux nouvelles instructions avec un raisonnement langage-vision pour maintenir la cohérence sociale de l'interaction. Les résultats des questionnaires indiquent que les observateurs ont trouvé les actions du robot clairement interprétables, les interactions socialement appropriées, et le comportement prévisible et sûr. Pour les intégrateurs industriels et les équipes opérations, c'est un signal fort : les robots collaboratifs ne peuvent plus se contenter d'accomplir une tâche ; ils doivent être lisibles par les humains qui partagent l'espace de travail. Le sujet de l'expressivité robotique est activement exploré depuis plusieurs années dans la communauté HRI, mais les approches précédentes peinaient à généraliser au-delà de comportements scénarisés ou de démos contrôlées. L'utilisation conjointe d'un VLM et d'une VLA dans un seul pipeline interruptible représente une progression architecturale significative. Sur le plan concurrentiel, des acteurs comme Boston Dynamics (avec Spot) ou des startups HRI telles que Enchanted Tools en France (robot Miroki) travaillent également sur la dimension sociale des robots collaboratifs, mais peu publient des évaluations HRI aussi structurées en conditions réelles. Les prochaines étapes logiques pour ExpressMM seraient des déploiements en environnements industriels ou de service à plus grande échelle, où la variété des interactions humaines dépasse largement les scénarios d'assemblage contrôlés.

IA physiqueOpinion
1 source
Simulé ou réel : robustesse des VLM au décalage de domaine en compréhension de scène robotique
5519arXiv cs.RO 

Simulé ou réel : robustesse des VLM au décalage de domaine en compréhension de scène robotique

Une équipe de chercheurs a publié sur arXiv (identifiant 2506.19579, troisième révision, juin 2025) une évaluation systématique des modèles vision-langage (VLM) appliqués à la compréhension de scènes robotiques en vue unique. Le protocole expérimental cible des scènes de table captées par un bras manipulateur, avec un cadre de domain shift contrôlé : chaque outil réel est mis en parallèle avec un homologue imprimé en 3D, géométriquement identique mais différent en texture, couleur et matière. Plusieurs VLM déployables localement, parmi les plus récents du domaine, ont été soumis à un benchmark multicritères axé sur l'alignement sémantique et l'ancrage factuel des descriptions textuelles générées. Les résultats montrent que les VLM décrivent correctement les objets courants du monde réel, mais que leurs performances se dégradent sensiblement dès que ces objets sont remplacés par des pièces imprimées en 3D, malgré une forme structurelle identique. Le constat a une portée directe pour les intégrateurs robotiques et les équipes industrielles qui s'appuient sur des VLM pour la perception de scènes. En atelier, les gabarits, les pièces de fixation et les prototypes imprimés en 3D sont omniprésents : un système de perception qui confond la texture avec la fonction risque de produire des descriptions erronées, voire de déclencher de mauvaises instructions de préhension. Plus préoccupant encore, les chercheurs démontrent que les métriques d'évaluation standard présentent des vulnérabilités critiques : certaines ne détectent pas le domain shift, d'autres récompensent des descriptions linguistiquement fluides mais factuellement incorrectes. Ce double problème, défaillance du modèle et défaillance de la métrique simultanément, rend l'échec invisible pour les équipes qui s'appuient sur les indicateurs habituels. Cette publication s'inscrit dans un courant croissant de travaux questionnant la maturité des modèles fondationnels pour les applications physiques. Le sim-to-real gap est bien documenté dans la littérature robotique, mais ce papier pointe un défi distinct : le real-to-real domain shift entre catégories de matériaux. Alors que les pipelines robotiques modernes, comme ceux qui sous-tendent GR00T N2 (NVIDIA), Pi-0 (Physical Intelligence) ou les architectures VLA en général, intègrent de plus en plus des composants vision-langage, l'étude souligne que les protocoles d'évaluation doivent évoluer en parallèle. Les auteurs appellent à des architectures plus robustes et à des protocoles de validation adaptés aux contraintes physiques du déploiement réel, sans toutefois proposer de solution concrète dans ce travail préliminaire.

RecherchePaper
1 source
Apprendre la physique à partir de modèles vidéo préentraînés : modèles du monde continus et séquentiels pour la manipulation robotique
5520arXiv cs.RO 

Apprendre la physique à partir de modèles vidéo préentraînés : modèles du monde continus et séquentiels pour la manipulation robotique

Une équipe de chercheurs propose PhysGen, un cadre d'apprentissage publié en prépublication sur arXiv (réf. 2603.00110v2), qui exploite des modèles de génération vidéo pré-entraînés comme substituts de simulateurs physiques pour la manipulation robotique. L'idée centrale est de traiter la vidéo générée de manière autorégressive comme un proxy du monde physique, et d'y greffer des actions robotiques continues via une représentation unifiée baptisée "physical tokens", des jetons partagés qui fusionnent la modalité vidéo et les commandes motrices. Pour assurer la convergence, PhysGen intègre du masquage causal, de la cinématique inverse, une prédiction multi-tokens anticipative (L-MTP) et du cache clé-valeur (KV caching). Sur les benchmarks Libero et ManiSkill, le système surpasse OpenVLA de 13,8 points et WorldVLA de 8,8 points. Plus frappant : en conditions réelles, PhysGen atteint les performances de π₀ (Physical Intelligence) sur des tâches physiquement exigeantes, notamment la saisie d'objets transparents, sans avoir bénéficié d'un pré-entraînement spécifique aux données d'action. L'enjeu pour l'industrie est direct : la pénurie de données robotiques à grande échelle reste le principal frein à la généralisation des politiques de manipulation. PhysGen contourne ce goulot en recyclant des modèles vidéo entraînés sur des corpus massifs d'internet pour en extraire une intuition physique implicite, permanence des objets, dynamique de contact, sans collecter de trajectoires robot. Le fait de rivaliser avec π₀ sans son pré-entraînement propriétaire sur des données d'action est une validation partielle de l'hypothèse que le "sim-to-real gap" peut être réduit par la connaissance du monde visuel plutôt que par des démonstrations téléopérées. Cela dit, les résultats restent issus d'un papier de recherche avec des benchmarks sélectifs ; la robustesse sur des scènes industrielles non structurées reste à démontrer. PhysGen s'inscrit dans un courant actif qui voit les laboratoires de robotique piller les architectures de génération multimodale pour nourrir leurs politiques de contrôle : UniSim, Genie, et surtout WorldVLA avaient déjà exploré cette piste. Physical Intelligence (π₀) représente aujourd'hui la référence en termes de performances sur tâches réelles grâce à son pré-entraînement massif sur données d'action hétérogènes, ce qui rend la comparaison de PhysGen d'autant plus significative. OpenVLA (Berkeley) constitue le concurrent open-source direct. La prochaine étape logique pour les auteurs serait une évaluation sur des manipulateurs industriels multi-DOF en environnement non contrôlé, et une intégration avec des pipelines de données synthétiques pour réduire encore la dépendance aux démonstrations humaines.

IA physiqueOpinion
1 source
Navigating l'encombrement : planification bi-niveau par points de passage pour systèmes multi-robots
5521arXiv cs.RO 

Navigating l'encombrement : planification bi-niveau par points de passage pour systèmes multi-robots

Des chercheurs de l'Université de Californie à Santa Barbara (UCSB, laboratoire NLP-Chang) ont publié sur arXiv (référence 2604.21138) un framework hybride de contrôle multi-robots capable de planifier simultanément à deux niveaux : la planification de tâches à haut niveau (quel robot fait quoi, dans quel ordre) et la planification de trajectoires à bas niveau (comment éviter les collisions). Le système repose sur une représentation compacte appelée "waypoints", des points de passage intermédiaires qui paramétrisent les trajectoires motrices de façon plus légère qu'une optimisation de trajectoire continue. Pour entraîner le tout, l'équipe utilise un algorithme RLVR (Reinforcement Learning with Verifiable Rewards) modifié, combiné à une stratégie de curriculum progressif qui remonte les retours de faisabilité physique du planificateur bas niveau vers le planificateur haut niveau. Les expériences sont conduites sur BoxNet3D-OBS, un benchmark multi-robots 3D à obstacles denses, avec des configurations allant jusqu'à neuf robots simultanément. Sur ce benchmark, l'approche surpasse de manière consistante les baselines "motion-agnostic" (qui ignorent les contraintes physiques) et les baselines fondées sur des VLA (Vision-Language-Action models). Ce résultat pointe un problème structurel souvent minimisé dans la littérature : l'affectation du crédit entre les deux niveaux de planification. Quand un système multi-robots échoue, est-ce que la tâche était mal assignée ou la trajectoire physiquement infaisable ? Cette ambiguïté rend les approches séquentielles (planifier les tâches, puis les trajectoires) fragiles dès que l'environnement est encombré. Le fait que les modèles VLA, pourtant en vogue depuis les travaux pi-0, GR00T N2 et Helix, sous-performent sur ce benchmark suggère que leur capacité de généralisation atteint ses limites dès qu'on ajoute des contraintes de collision à grande échelle : bonne nouvelle pour les approches d'optimisation hybride, mauvaise nouvelle pour ceux qui misent sur les VLA comme solution universelle en entrepôt. Ce travail s'inscrit dans une tendance de fond : appliquer les techniques de raisonnement par renforcement issues du traitement du langage naturel (notamment la famille DeepSeek-R1 et RLVR) à la robotique multi-agents. Les systèmes concurrents dans cet espace incluent les travaux sur TAMP (Task and Motion Planning) de MIT CSAIL et CMU, ainsi que les approches de planification décentralisée type MAPF (Multi-Agent Path Finding). Le code est disponible sur GitHub (UCSB-NLP-Chang/navigate-cluster). Les prochaines étapes probables incluent une validation sur robots physiques et une montée en charge au-delà de neuf agents, terrain où les questions de latence de planification deviendront critiques pour des déploiements industriels réels.

RecherchePaper
1 source
Correspondance par pont de Schrödinger rectifié pour la navigation visuelle en peu d'étapes
5522arXiv cs.RO 

Correspondance par pont de Schrödinger rectifié pour la navigation visuelle en peu d'étapes

Une équipe de chercheurs a soumis sur arXiv (ref. 2604.05673, v2, avril 2026) un cadre baptisé Rectified Schrödinger Bridge Matching (RSBM), visant à réduire drastiquement le coût d'inférence des politiques génératives de navigation visuelle. Les modèles basés sur la diffusion ou les ponts de Schrödinger (SB) capturent fidèlement les distributions d'actions multimodales mais exigent dix étapes d'intégration ou plus, incompatibles avec le contrôle robotique temps-réel. RSBM unifie les SB standard (ε=1, entropie maximale) et le transport optimal déterministe (ε→0, comme en Conditional Flow Matching) via un unique paramètre de régularisation entropique ε. Les auteurs démontrent que le champ de vitesse conditionnel conserve la même forme fonctionnelle sur tout le spectre ε (un seul réseau suffit pour toutes les intensités de régularisation) et que réduire ε diminue linéairement la variance du champ, stabilisant l'intégration ODE à pas larges. Résultat : 94 % de similarité cosinus et 92 % de taux de réussite en 3 étapes seulement, sans distillation ni entraînement multi-étapes. Ce résultat s'attaque directement au goulot d'étranglement des politiques VLA (Vision-Language-Action) en déploiement industriel. Les architectures de diffusion embarquées dans les robots manipulateurs et humanoïdes actuels (π0 de Physical Intelligence, GR00T N2 de NVIDIA) plafonnent leur fréquence de contrôle à cause du nombre d'étapes de dénoising requises. Passer de dix à trois étapes sans distillation, technique qui ajoute un cycle d'entraînement coûteux et instable, ouvre la voie à des politiques embarquables sur matériel edge standard sans GPU serveur dédié. Limite à noter : les expériences portent sur des benchmarks de navigation visuelle simulés ; le transfert sim-to-real n'est pas validé dans cette publication. RSBM s'inscrit dans la continuité de travaux sur l'accélération du sampling génératif : Rectified Flow (Liu et al., 2022), Consistency Models, et l'application des ponts de Schrödinger au contrôle robotique étudiée par des groupes à Stanford et CMU. Face au Conditional Flow Matching de Meta AI, rapide mais moins expressif face aux distributions fortement multimodales, RSBM revendique un équilibre théoriquement fondé entre vitesse et couverture multimodale. Aucune implémentation open-source ni déploiement hardware n'est annoncé à ce stade. Les suites probables incluent une validation sur tâches de manipulation réelles et une comparaison directe avec des méthodes de distillation rapide comme le Shortcut Model de Physical Intelligence.

RechercheOpinion
1 source
Sécurité dynamique corps entier pour bras robotiques : fonctions de sécurité de Poisson 3D pour filtres de sécurité à base de CBF
5523arXiv cs.RO 

Sécurité dynamique corps entier pour bras robotiques : fonctions de sécurité de Poisson 3D pour filtres de sécurité à base de CBF

Des chercheurs ont déposé sur arXiv (réf. 2604.21189) un cadre pour la sécurité plein-corps des bras manipulateurs robotiques en environnements dynamiques, combinant des fonctions de sécurité de Poisson en 3D (PSF) et des filtres basés sur des Control Barrier Functions (CBF). La méthode discrétise la surface du robot à une résolution paramétrable, puis contracte l'espace libre via une différence de Pontryagin proportionnelle à cette résolution. Sur ce domaine tamponné, une unique CBF globalement lisse est synthétisée en résolvant l'équation de Poisson sur l'ensemble de l'environnement. Les contraintes résultantes, évaluées à chaque point d'échantillonnage, sont appliquées en temps réel par un programme quadratique multi-contraintes. La validation est réalisée sur un manipulateur à 7 degrés de liberté (DOF) en environnement dynamique, seule donnée expérimentale concrète de ce preprint, sans benchmark de temps de cycle publié. L'apport est simultanément théorique et computationnel. Le travail prouve formellement que maintenir les points échantillonnés sûrs dans la région tamponnée suffit à garantir l'absence de collision pour la surface continue du robot, éliminant le gap entre discrétisation et géométrie réelle. Pour les intégrateurs travaillant sur la manipulation collaborative, c'est un levier direct : les approches CBF classiques requièrent une contrainte par paire de points proches, ce qui fait exploser le coût de calcul en haute dimension de configuration. En ramenant le problème à une seule fonction lisse sur tout l'environnement, le filtre devient davantage compatible avec les contraintes temps réel des contrôleurs embarqués. L'absence de métriques de latence dans la publication limite toutefois l'évaluation de la faisabilité industrielle. Les CBFs pour la sécurité robotique constituent un axe de recherche actif depuis 2019, porté notamment par les groupes d'Aaron Ames (Caltech) et des équipes au Georgia Tech. En Europe, le LAAS-CNRS à Toulouse et l'INRIA Sophia Antipolis ont contribué à des formulations similaires pour la planification sous contraintes de sécurité formelle. Du côté des intégrateurs industriels, Universal Robots, FANUC et Franka Robotics (intégré depuis dans l'écosystème Agile Robots) investissent dans des garanties de sécurité certifiables pour la co-manipulation. L'extension naturelle de ces travaux porte sur les environnements partiellement observés, données capteur bruitées ou occlusions partielles, ainsi que sur l'intégration dans une boucle de planification complète pour la manipulation dextre à grande vitesse.

RecherchePaper
1 source
Système de navigation vision-langage incarné et déployable avec cognition hiérarchique et exploration contextuelle
5524arXiv cs.RO 

Système de navigation vision-langage incarné et déployable avec cognition hiérarchique et exploration contextuelle

Une équipe de chercheurs a publié en avril 2026 sur arXiv (référence 2604.21363) un système de navigation embodied par vision et langage (VLN) conçu pour fonctionner en temps réel sur des plateformes robotiques embarquées aux ressources limitées. L'architecture repose sur trois modules asynchrones découplés : un module de perception temps-réel pour l'acquisition continue de l'environnement, un module d'intégration mémorielle pour l'agrégation spatiale et sémantique, et un module de raisonnement pour la prise de décision de haut niveau via un modèle vision-langage (VLM). Le coeur du système est un graphe de mémoire cognitive construit de façon incrémentale, décomposé en sous-graphes pour alimenter le VLM sans saturer la mémoire embarquée. Pour optimiser l'exploration, les auteurs reformulent le problème comme un Weighted Traveling Repairman Problem (WTRP) contextuel, qui minimise le temps d'attente pondéré des points de vue candidats. Les expériences portent à la fois sur des environnements simulés et sur des plateformes robotiques réelles, avec des résultats supérieurs aux approches VLN existantes en taux de succès et en efficacité de navigation. Ce travail s'attaque directement à une tension structurelle du domaine : les systèmes VLN les plus performants exigent des capacités de raisonnement qui restent typiquement hors de portée d'un matériel embarqué. Le découplage en modules asynchrones est une réponse architecturale concrète à cette contrainte, permettant de maintenir une boucle de perception à faible latence sans bloquer le raisonnement lourd. La démonstration sur hardware contraint réel, pas seulement en simulation, est le point de validation critique : elle réduit l'argument du sim-to-real gap qui frappe la majorité des publications académiques sur les VLA et VLN. Pour un intégrateur ou un décideur industriel, cela suggère que des robots capables de suivre des instructions en langage naturel dans des environnements non-structurés pourraient être déployés sans infrastructure GPU dédiée. La navigation embodied par vision et langage est un champ en pleine consolidation, porté par les progrès des VLM multimodaux (GPT-4o, LLaVA, InternVL) et par la disponibilité de benchmarks comme R2R ou REVERIE. La plupart des approches récentes sacrifient soit la généralisation soit la vitesse d'inférence pour tenir sur un robot réel. Ce papier s'inscrit dans un courant de recherche qui cherche à rendre ces systèmes embarquables sans fine-tuning massif, une direction que suivent également des équipes comme celles de CMU, ETH Zurich ou du LAAS-CNRS côté européen. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés publics et une intégration dans des plateformes commerciales comme Boston Dynamics Spot ou des AMR industriels, mais ces éléments ne sont pas annoncés dans l'abstract.

IA physiqueOpinion
1 source
VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles
5525arXiv cs.RO 

VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles

Des chercheurs ont publié VistaBot, un framework de manipulation robotique ciblant un angle mort des politiques end-to-end actuelles : leur fragilité face aux changements de point de vue de caméra entre entraînement et déploiement. La préprint arXiv 2604.21914, déposée en avril 2026, décrit une architecture en trois modules : estimation de géométrie 4D, synthèse de vue par diffusion vidéo, et planification d'actions en espace latent, sans recalibration de caméra requise au moment du déploiement. Intégré dans deux politiques de référence du domaine, ACT (Action Chunking Transformer) et π₀ (la politique diffusion-based de Physical Intelligence), VistaBot améliore la métrique VGS (View Generalization Score, introduite par les auteurs) de 2,79x par rapport à ACT et de 2,63x par rapport à π₀, en simulation et en environnement réel. Le code et les modèles seront publiés en open source. La dépendance à un point de vue fixe constitue un frein structurel au déploiement des bras manipulateurs en conditions industrielles : une caméra repositionnée ou partiellement obstruée peut invalider un modèle entier sans mécanisme de compensation. VistaBot répond en synthétisant dynamiquement des vues alternatives via un modèle de diffusion vidéo, puis en planifiant les actions dans l'espace latent de ces vues synthétisées, sans recollecte de données depuis le nouvel angle. Pour un intégrateur ou un COO industriel, cela réduit directement le coût de reconfiguration sur ligne. L'introduction du VGS comble également un vide méthodologique : le domaine ne disposait pas de benchmark standardisé pour comparer la robustesse cross-view entre politiques, rendant les comparaisons entre travaux difficiles. Le problème de robustesse aux points de vue est documenté en imitation learning depuis plusieurs années, mais les solutions disponibles exigeaient soit une augmentation intensive des données, soit une calibration caméra explicite à chaque reconfiguration. Physical Intelligence, fondée en 2023, a développé π₀ comme politique généraliste de manipulation. D'autres acteurs comme Google DeepMind (RT-2 et ses successeurs), Figure AI (Figure 03) ou 1X Technologies ciblent des architectures VLA à plus large spectre sans traiter spécifiquement cet axe de robustesse aux vues. VistaBot reste une contribution académique préliminaire : la préprint n'est pas encore revue par les pairs, les tâches réelles évaluées ne sont pas décrites en détail, et les gains annoncés devront être confirmés par des reproductions indépendantes une fois le code disponible.

IA physiquePaper
1 source
Apprendre l'apesanteur : imiter des mouvements non auto-stabilisants sur un robot humanoïde
5526arXiv cs.RO 

Apprendre l'apesanteur : imiter des mouvements non auto-stabilisants sur un robot humanoïde

Une équipe de chercheurs propose dans un preprint arXiv (référence 2604.21351, avril 2026) une méthode baptisée Weightlessness Mechanism (WM), conçue pour permettre aux robots humanoïdes d'exécuter des mouvements dits non-autostabilisants (NSS, Non-Self-Stabilizing). Ces mouvements englobent des actions aussi banales que s'asseoir sur une chaise, s'allonger sur un lit ou s'appuyer contre un mur : contrairement à la locomotion bipède classique, le robot ne peut maintenir sa stabilité sans interagir physiquement avec l'environnement. Les expériences ont été menées en simulation et sur le robot humanoïde Unitree G1, sur trois tâches représentatives : s'asseoir sur des chaises de hauteurs variables, s'allonger sur des lits à différentes inclinaisons, et s'appuyer contre des murs via l'épaule ou le coude. La méthode est entraînée sur des démonstrations en action unique, sans fine-tuning spécifique à chaque tâche. L'apport technique central s'appuie sur une observation biomécanique : lors de mouvements NSS, les humains relâchent sélectivement certaines articulations pour laisser le contact passif avec l'environnement assurer la stabilité, un état que les auteurs qualifient de "weightless". Le WM formalise ce mécanisme en déterminant dynamiquement quelles articulations relâcher et dans quelle mesure, complété par une stratégie d'auto-étiquetage automatique de ces états dans les données d'entraînement. Pour les intégrateurs industriels qui déploient des humanoïdes dans des environnements réels, ce verrou est significatif : les pipelines actuels d'imitation learning combiné au reinforcement learning imposent généralement un suivi rigide de trajectoire sans modéliser les interactions physiques avec les surfaces, ce qui les rend inopérants dès que le robot doit s'appuyer sur quelque chose. Le contexte est celui d'un secteur en pleine accélération : Figure AI avec le Figure 03, Agility Robotics avec Digit, Boston Dynamics avec Atlas et 1X Technologies poussent tous leurs humanoïdes vers des déploiements en entrepôt ou en usine, mais les scénarios de contact-riche restent largement non résolus. Le Unitree G1, plateforme commerciale accessible, s'impose progressivement comme banc de test académique standard, ce qui accélère la reproductibilité des résultats. Il faut néanmoins souligner que ce travail est au stade de preprint non évalué par les pairs, et que les séquences vidéo accompagnant ce type de publication sont souvent sélectionnées favorablement : la robustesse réelle en conditions non supervisées reste à démontrer. Les suites naturelles seraient une intégration dans des politiques généralisées comme GR00T N2 de NVIDIA ou pi0 de Physical Intelligence, et une évaluation sur des scènes hors distribution.

IA physiquePaper
1 source
État de l'art de la robotique à pattes en environnements non inertiels : passé, présent et futur
5527arXiv cs.RO 

État de l'art de la robotique à pattes en environnements non inertiels : passé, présent et futur

Une équipe de chercheurs dépose en avril 2026 sur arXiv (référence 2604.20990) une revue de littérature consacrée à la locomotion des robots à pattes dans les environnements dits non inertiels, c'est-à-dire des surfaces en mouvement, en inclinaison ou en accélération. Le travail couvre trois grandes familles d'applications : les plateformes de transport terrestre (véhicules en déplacement), les plateformes maritimes (navires, offshore) et les contextes aérospatiaux. Les auteurs y passent en revue les méthodes existantes de modélisation, d'estimation d'état et de contrôle de la locomotion, en cartographiant leurs hypothèses et leurs limites respectives. Ils identifient ensuite quatre classes de problèmes non résolus : le couplage robot-environnement, l'observabilité du système en présence de perturbations persistantes, la robustesse des lois de contrôle face aux accélérations variables, et la validation expérimentale dans des conditions dynamiques représentatives. L'enjeu industriel est immédiat. L'écrasante majorité des robots à pattes aujourd'hui commercialisés, quadrupèdes comme l'ANYmal d'ANYbotics, le Spot de Boston Dynamics ou le Go2 d'Unitree, est conçue, calibrée et validée sur sol rigide et stationnaire. Les frameworks de contrôle classiques (MPC, whole-body control) posent explicitement l'hypothèse d'un point d'appui fixe. Dès qu'un navire tangue ou qu'un véhicule accélère, ces hypothèses s'effondrent, entraînant des comportements instables non récupérables sans adaptation du contrôleur en temps réel. Pour un COO qui envisage de déployer des robots d'inspection sur une plateforme pétrolière offshore, un cargo ou un aéronef, ce gap technique constitue aujourd'hui un frein concret à la commercialisation, indépendamment des progrès spectaculaires réalisés sur sol plat. Le domaine progresse depuis la fin des années 2010, porté par l'apprentissage par renforcement (sim-to-real) et l'estimation d'état à haute fréquence par IMU, mais les déploiements réels en environnement non inertiel demeurent rares et peu documentés dans la littérature. Aucun acteur industriel dominant ne s'est encore imposé sur ce segment, ni en Europe ni en Asie, ce qui laisse la fenêtre ouverte pour des laboratoires académiques et des intégrateurs spécialisés. Le survey identifie plusieurs directions prioritaires : les stratégies bio-inspirées (adaptation observée chez les animaux marins ou arboricoles), la co-conception robot-plateforme, et l'élaboration de protocoles de test standardisés simulant les perturbations dynamiques. Ce travail de cartographie a vocation à servir de référence pour orienter les prochains appels à projets et les roadmaps des fabricants de robots à pattes qui visent les marchés industriels les plus exigeants.

RecherchePaper
1 source
Prédiction efficace de gestes iconiques tenant compte des émotions pour les robots en co-parole
5528arXiv cs.RO 

Prédiction efficace de gestes iconiques tenant compte des émotions pour les robots en co-parole

Des chercheurs ont publié sur arXiv (preprint 2604.11417) un transformer léger pour prédire le placement et l'intensité des gestes iconiques synchronisés à la parole des robots, à partir du texte et de l'émotion seuls, sans audio à l'inférence. Évalué sur le jeu de données BEAT2, référence du domaine pour la génération de gestes co-parlés, le système surpasse GPT-4o en classification du placement de gestes sémantiques et en régression d'intensité, tout en restant suffisamment compact pour un déploiement temps réel sur agents incarnés. La majorité des systèmes robotiques actuels se limitent à des gestes rythmiques (beat gestures), peu porteurs de sens. Intégrer des gestes iconiques, qui illustrent ou soulignent le contenu du discours, améliore l'engagement et la compréhension de l'interlocuteur humain. Le fait qu'un transformer spécialisé et léger surpasse GPT-4o sur cette tâche précise confirme que des architectures ciblées peuvent rivaliser avec de grands modèles généralistes en interaction homme-robot (HRI), à fraction du coût computationnel. L'absence d'audio à l'inférence simplifie également le pipeline de déploiement sur plateformes sans microphone embarqué ou soumises à des contraintes de latence strictes. La génération de gestes co-parlés est un axe actif en HRI, structuré depuis quelques années par des benchmarks communs dont BEAT2. Ce travail s'inscrit dans une tendance plus large d'allégement des modèles pour agents embarqués, des robots de service aux humanoïdes sociaux. Des plateformes comme Pepper (SoftBank) ou les projets de robotique sociale développés en Europe constituent des cibles naturelles pour ce type de module. Le preprint ne mentionne ni partenariat industriel ni validation hors laboratoire, ce qui reste à confirmer avant tout déploiement opérationnel.

RecherchePaper
1 source
X2-N : robot humanoïde transformable hybride roues-jambes à double mode de locomotion et manipulation
5529arXiv cs.RO 

X2-N : robot humanoïde transformable hybride roues-jambes à double mode de locomotion et manipulation

Des chercheurs ont publié sur arXiv (référence 2604.21541v1, avril 2026) les résultats de développement du X2-N, un robot à locomotion hybride roues-jambes capable de se transformer entre une configuration humanoïde bipède et une configuration à roues, par reconfiguration articulaire à la volée. Contrairement aux plateformes roues-jambes existantes qui utilisent des roues fixes en guise de pieds et des hanches à degrés de liberté limités, le X2-N dispose d'un grand nombre de degrés de liberté (le nombre exact n'est pas précisé dans l'abstract) et d'un buste complet avec deux bras manipulateurs. Le système de contrôle repose sur un framework de contrôle corps entier basé sur l'apprentissage par renforcement (RL), unifiant locomotion hybride, transformation morphologique et manipulation dans un même pipeline. Les validations expérimentales couvrent des tâches de locomotion dynamique de type skating, de montée d'escaliers et de livraison de colis. Le point central de cette contribution est l'adresse du double goulot d'étranglement qui freine les robots roues-jambes actuels : la rigidité de la configuration au sol, qui dégrade la stabilité en mode biped, et l'absence de membres supérieurs, qui interdit toute manipulation. En intégrant ces deux capacités dans un seul châssis transformable piloté par un unique contrôleur RL, les auteurs montrent qu'il est possible d'obtenir une adaptabilité terrain élevée sans sacrifier les capacités de manipulation. Pour un COO industriel ou un intégrateur logistique, c'est la promesse d'un seul robot capable d'alterner entre déplacement rapide en mode roues sur sol continu et navigation en mode jambes sur terrains discontinus, tout en manipulant des charges. Il convient néanmoins de souligner que les validations présentées restent des démonstrations en laboratoire : aucun déploiement industriel réel ni chiffres de cycle time en conditions production ne sont fournis. Le segment des robots roues-jambes est occupé notamment par Unitree (variantes B2W et H1 avec extensions roues), Boston Dynamics (Handle, orienté logistique mais sans bras polyvalents), et diverses startups issues de laboratoires universitaires asiatiques et américains. Le X2-N se positionne sur la convergence humanoïde-AMR, un créneau en compétition directe avec les approches tout-biped des acteurs comme Figure, Agility Robotics ou Fourier Intelligence, qui misent sur l'universalité de la forme humaine plutôt que sur la flexibilité morphologique. La prochaine étape logique pour cette recherche serait une validation hors laboratoire et la publication de métriques de performance comparables à celles des plateformes commerciales, pour confirmer que les gains en efficacité de locomotion compensent la complexité mécanique additionnelle.

HumanoïdesPaper
1 source
Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise
5530arXiv cs.RO 

Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise

Une équipe de chercheurs a conçu et testé une méthode de sensibilisation à la robotique en milieu industriel réel, en déployant un robot humanoïde contrôlé par un grand modèle de langage (LLM) lors d'un événement interne organisé par AD Ports Group aux Émirats arabes unis. Les employés du groupe portuaire, sans formation préalable en robotique, ont interagi avec le robot via des commandes vocales dans un environnement d'exercice inspiré de la logistique, structuré en équipes avec des rôles attribués. Au terme de l'activité, un questionnaire resté ouvert 16 jours a recueilli 102 réponses. La satisfaction globale atteint 8,46/10, l'intérêt déclaré pour la robotique et l'IA 4,47/5, et la compréhension des nouvelles formes de collaboration homme-robot 4,45/5. Les participants ayant interagi directement avec le robot ont évalué la naturalité de l'échange à 4,37/5 et la progression de la facilité d'interaction à 4,74/5. Les scores concernant la fiabilité et la prédictibilité du robot restent en revanche sensiblement plus bas, ce que les auteurs identifient comme un défi technique à adresser. Ce travail fournit l'une des rares mesures quantitatives issues d'un déploiement en organisation réelle, hors contexte laboratoire, sur l'efficacité des LLM comme interface d'entrée en robotique pour des non-spécialistes. Pour les décideurs industriels et les intégrateurs, il valide un format concret d'onboarding technique : une activité compétitive courte peut suffire à modifier la perception et l'appétence pour la robotique collaborative. La méthode est présentée comme réplicable, ce qui est significatif pour des groupes industriels cherchant à préparer leurs effectifs à des déploiements d'IA incarnée sans passer par une formation longue. L'exploration des LLM comme couche de contrôle en langage naturel pour les robots s'intensifie depuis 2023, portée notamment par des architectures comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), mais les preuves d'usage en conditions industrielles non contrôlées restent rares. AD Ports Group, opérateur de ports et de zones logistiques parmi les plus importants du Moyen-Orient, constitue un terrain d'expérimentation pertinent. L'étude ne précise pas le modèle de robot humanoïde utilisé ni l'architecture LLM sous-jacente, une limite notable pour qui voudrait reproduire l'approche. Les prochaines étapes annoncées portent sur l'amélioration de la fiabilité perçue et la réplication de la méthode dans d'autres contextes opérationnels industriels.

RecherchePaper
1 source
Conception, modélisation et évaluation expérimentale d'un mécanisme d'abduction-adduction du poignet à câbles pour exosquelette du membre supérieur
5531arXiv cs.RO 

Conception, modélisation et évaluation expérimentale d'un mécanisme d'abduction-adduction du poignet à câbles pour exosquelette du membre supérieur

Des chercheurs ont publié sur arXiv (preprint 2604.20893, avril 2026) un mécanisme inédit d'actionnement par tendon unique pour le mouvement d'abduction-adduction du poignet dans un exosquelette de membre supérieur. Le système repose sur un câble de Bowden unique, maintenu en tension permanente par un ressort de torsion spiralé (dit "clock spring"), ce qui élimine le besoin d'une actuation antagoniste classique. Le prototype a été évalué expérimentalement avec cinq participants sans déficience motrice (NMD), dans différentes positions du bras et sous plusieurs charges, à travers trois configurations de ressorts. Les résultats montrent une bonne concordance entre les prédictions de simulation et les données expérimentales, avec la configuration nominale offrant le meilleur compromis entre amplitude de mouvement, couple requis et répétabilité. Ce travail s'attaque à un problème réel dans la conception d'exosquelettes du poignet : les actionneurs conventionnels (moteurs électriques, pneumatique) alourdissent le dispositif, introduisent des frottements et compliquent l'intégration mécanique. L'approche par câble de Bowden assisté par ressort torsionnel permet d'obtenir un mécanisme compact et léger, sans recourir à un câble de retour actif. Point méthodologique notable : les auteurs proposent une méthode de sélection des paramètres de rigidité entièrement guidée par simulation, ce qui réduit la dépendance au tuning empirique itératif, typiquement coûteux en phase de prototypage. Pour les intégrateurs en rééducation robotique, cela ouvre la voie à un processus de conception plus prévisible, même si l'évaluation sur cinq sujets valides reste insuffisante pour valider l'usage clinique. Les exosquelettes de poignet font l'objet d'une recherche active, avec des acteurs académiques et industriels comme Hocoma, Tyromotion ou, côté français, Wandercraft et Pollen Robotics qui travaillent sur la rééducation du membre supérieur. L'articulation du poignet, et notamment son degré de liberté en abduction-adduction, est souvent la moins bien couverte dans les dispositifs existants, car mécaniquement complexe à intégrer. Ce preprint ne présente pas un produit commercialisé mais un prototype de recherche validé en laboratoire; les prochaines étapes naturelles seraient une étude sur des patients post-AVC ou avec pathologies neuromusculaires, et une intégration dans un exosquelette complet du membre supérieur.

ExosquelettesPaper
1 source
Planification VLA à horizon étendu par conditionnement sur traces
5532arXiv cs.RO 

Planification VLA à horizon étendu par conditionnement sur traces

Une équipe de chercheurs a publié en avril 2026 LoHo-Manip (arXiv:2604.21924), un cadre modulaire conçu pour étendre les politiques VLA (vision-language-action) aux tâches de manipulation longue durée. Le coeur du système repose sur une architecture découplée : un VLM gestionnaire de tâches et un VLA exécuteur distincts. Le gestionnaire opère selon un principe de planification à horizon glissant (receding-horizon) : à chaque étape, il prédit un plan résiduel combinant une séquence de sous-tâches avec une séparation explicite "fait / restant" comme mémoire légère en langage naturel, et une trace visuelle, une trajectoire 2D de points-clés indiquant au bras où se déplacer et quel objet approcher. L'exécuteur VLA est ensuite conditionné sur cette trace rendue pour produire ses commandes motrices. Les expériences couvrent la planification incarnée, le raisonnement longue portée, la prédiction de trajectoire et la manipulation bout-en-bout, à la fois en simulation et sur un robot Franka réel, avec des gains annoncés en taux de succès, robustesse et généralisation hors distribution. Les métriques précises ne sont pas communiquées dans le préprint. Ce qui distingue LoHo-Manip des approches VLA classiques, c'est le bouclage implicite sans logique de récupération codée en dur : lorsqu'une sous-tâche échoue, elle reste dans le plan résiduel prédit au pas suivant, et la trace visuelle se met à jour automatiquement. Les modèles VLA actuels comme pi0 (Physical Intelligence) ou OpenVLA peinent sur les séquences multi-étapes en raison de l'accumulation d'erreurs d'exécution ; LoHo-Manip traite ce problème en transformant la prise de décision longue portée en une série de contrôles locaux guidés par trace. Pour un intégrateur industriel, cela ouvre la voie à des chaînes de manipulation complexes (assemblage séquentiel, tri multi-objets) sans reprogrammation manuelle à chaque point de défaillance, ce que les approches purement symboliques ne permettent pas sans pipeline rigide. Le problème de la manipulation longue portée est un obstacle structurel de la robotique VLA depuis l'émergence des modèles fondationnels en action, notamment après les travaux RT-2 de Google DeepMind (2023) et pi0 de Physical Intelligence (2024). La plupart des solutions actuelles combinent un planificateur symbolique haut niveau avec des primitives de bas niveau, au prix d'une rigidité importante face aux perturbations. LoHo-Manip adopte une voie intermédiaire en ancrant le plan dans une modalité visuelle légère (la trace 2D) plutôt que dans des primitives figées, ce qui est comparable dans l'esprit aux travaux de trajecto-conditioned diffusion de chez Nvidia (GR00T) ou de Cobot Magic. Il s'agit pour l'instant d'un preprint non relu par les pairs, validé sur un seul robot académique (Franka 7 DOF), sans déploiement industriel ni pilote annoncé. Les prochaines étapes crédibles passeraient par une validation sur des manipulateurs à plus haute redondance et des environnements moins structurés.

IA physiqueOpinion
1 source
IA stratifiée et topologique pour la coordination à longue portée (STALC)
5533arXiv cs.RO 

IA stratifiée et topologique pour la coordination à longue portée (STALC)

Une équipe de chercheurs propose STALC (Stratified Topological Autonomy for Long-Range Coordination), un système de planification hiérarchique pour la coordination de flottes de robots dans des environnements réels. Publié sur arXiv (identifiant 2503.10475, quatrième révision), le travail repose sur un planificateur en graphe combinant une carte topologique avec une formulation de programmation mixte en nombres entiers (MIP) conçue pour être computationnellement efficace. Le résultat revendiqué : des plans multi-robots fortement couplés générés en quelques secondes. Pour la validation locale, STALC s'appuie sur des planificateurs à horizon glissant (receding-horizon) assurant l'évitement de collision et le contrôle de formation. Le scénario de test retenu est une mission de reconnaissance multi-robots où les agents doivent se coordonner pour traverser un environnement tout en minimisant le risque de détection par des observateurs, avec des expériences menées à la fois en simulation et sur matériel réel. L'intérêt technique tient principalement à deux points. D'abord, résoudre un MIP en quelques secondes pour des flottes de robots est loin d'être trivial : la programmation mixte en nombres entiers est NP-difficile dans le cas général, et les approches existantes peinent à passer à l'échelle au-delà de quelques agents. L'architecture stratifiée de STALC, qui sépare la planification globale topologique de l'évitement de collision local, est précisément la clé permettant cette efficacité. Ensuite, la validation sur plateforme matérielle réelle, à partir de données du monde réel pour construire les graphes, distingue ce travail des contributions purement simulées qui dominent encore la littérature MAPF (Multi-Agent Path Finding). Pour un intégrateur ou un décideur B2B, cela signifie une architecture potentiellement déployable dans des contextes de sécurité, d'inspection ou de logistique d'entrepôt dense. STALC s'inscrit dans un champ de recherche actif où s'affrontent plusieurs paradigmes : les méthodes CBS (Conflict-Based Search) et ECBS côté planification centralisée, les approches décentralisées à base de champs de potentiel ou de ORCA pour l'évitement local. L'originalité de STALC est de proposer une hiérarchie explicite entre ces niveaux plutôt que de les traiter séparément. Le choix d'un scénario de reconnaissance à faible signature suggère une orientation défense ou applications critiques, cohérente avec l'intérêt croissant des agences de recherche pour les essaims robotiques autonomes. La quatrième révision du preprint indique un travail en cours de consolidation, probablement en route vers une soumission dans une conférence de référence comme ICRA ou IROS.

RecherchePaper
1 source
Conception conjointe pilotée par la tâche de systèmes multi-robots hétérogènes
5534arXiv cs.RO 

Conception conjointe pilotée par la tâche de systèmes multi-robots hétérogènes

Une équipe de recherche a publié sur arXiv (référence 2604.21894) un cadre formel pour la co-conception pilotée par les tâches de systèmes multi-robots hétérogènes. Le problème adressé est fondamental : concevoir une flotte robotique implique de prendre simultanément des décisions sur la morphologie des robots, la composition de la flotte (nombre, types), et les algorithmes de planification, trois domaines traditionnellement traités séparément. Le framework proposé repose sur la théorie de co-conception monotone, qui permet de modéliser robots, flottes, planificateurs et évaluateurs comme des problèmes de conception interconnectés avec des interfaces bien définies, indépendantes des implémentations spécifiques et des tâches cibles. Des séries d'études de cas illustrent l'intégration de nouveaux types de robots, de profils de tâches variés, et d'objectifs de perception probabilistes dans un seul pipeline d'optimisation. L'intérêt industriel tient à la promesse d'optimisation jointe avec garanties d'optimalité, ce que les approches séquentielles actuelles ne peuvent offrir. Pour un intégrateur système ou un COO déployant une flotte AMR dans un entrepôt, la question n'est jamais "quel robot est le meilleur seul" mais "quelle combinaison robot + planificateur + composition de flotte minimise le temps de cycle global sous contrainte budgétaire". Ce framework rend ce raisonnement formellement traçable, et les auteurs soulignent qu'il fait émerger des alternatives de conception non-intuitives que les méthodes ad hoc auraient manquées. La scalabilité et l'interprétabilité revendiquées restent à valider sur des déploiements réels à grande échelle, les résultats publiés restent des études de cas académiques. Ce travail s'inscrit dans un courant de recherche en robotique qui cherche à dépasser les silos disciplinaires : d'un côté la co-conception morphologique (ex : travaux MIT CSAIL sur la co-optimisation structure/contrôle), de l'autre les frameworks de planification multi-agents (ROS 2 Nav2, MoveIt Task Constructor). La théorie de co-conception monotone, développée notamment par Andrea Censi et Luca Carlone, constitue la base théorique. Ce papier étend cette base aux systèmes hétérogènes à grande échelle. Aucune timeline de transfert industriel n'est annoncée, mais le framework pourrait intéresser les éditeurs de logiciels de fleet management (Exotec, Intrinsic/Google, Siemens Xcelerator) comme couche de raisonnement amont à la configuration de flotte.

RecherchePaper
1 source
Du bruit à l'intention : ancrage des politiques VLA génératives par ponts résiduels
5535arXiv cs.RO 

Du bruit à l'intention : ancrage des politiques VLA génératives par ponts résiduels

Un préprint déposé le 24 avril 2026 sur arXiv (réf. 2604.21391) présente ResVLA, une nouvelle architecture de politique VLA (Vision-Language-Action) pour le contrôle robotique. Le problème ciblé est le décalage spatiotemporel entre compréhension sémantique de haut niveau et contrôle physique de bas niveau : les VLA actuels génèrent des actions directement "à partir du bruit" (paradigme Generation-from-Noise), produisant une inefficacité de représentation et un alignement faible avec les instructions. ResVLA bascule vers un paradigme "Refinement-from-Intent" : via une analyse spectrale, le mouvement robotique est décomposé en une composante déterministe basse fréquence (l'intention globale) et une composante stochastique haute fréquence (la dynamique locale). Un pont de diffusion résiduel affine ensuite uniquement cette dynamique locale, ancré sur l'intention prédite. Les résultats déclarés incluent une convergence plus rapide que les baselines génératives standards, une robustesse aux perturbations linguistiques et aux variations d'embodiment, et des performances validées en conditions réelles, bien que le papier ne précise pas les plateformes matérielles testées ni les métriques exactes de déploiement physique. Ce travail s'attaque à une limite structurelle des VLA génératifs : ignorer la hiérarchie naturelle du mouvement nuit à l'alignement entre instruction et action. La robustesse à l'embodiment est un point concret pour les intégrateurs travaillant sur des flottes robotiques hétérogènes, où réentraîner un modèle complet par plateforme représente un coût prohibitif. La validation partielle en conditions réelles renforce la crédibilité de l'approche, même si l'absence de métriques détaillées (taux de succès par tâche, temps de cycle, nombre de démos d'entraînement) invite à la prudence avant d'extrapoler les résultats de simulation vers des déploiements industriels. Ce préprint s'inscrit dans une dynamique de recherche intense autour des VLA généralistes. Pi-0 de Physical Intelligence, OpenVLA (UC Berkeley) et les travaux RT-2 de Google DeepMind constituent les références immédiates du domaine. L'approche par résidu spectral est conceptuellement distincte des architectures de diffusion uniformes, mais ResVLA reste une contribution académique sans code public ni produit annoncé. La prochaine étape sera de voir si l'approche se confirme sur des benchmarks partagés comme LIBERO ou BridgeData V2, et si elle influence des frameworks ouverts comme LeRobot de Hugging Face, qui fédère une partie importante de la communauté robotique open-source.

RechercheOpinion
1 source
ZipFold : des actionneurs modulaires pour des robots adaptatifs à grande échelle
5536arXiv cs.RO 

ZipFold : des actionneurs modulaires pour des robots adaptatifs à grande échelle

Des chercheurs ont publié en avril 2026 un préprint arXiv (référence 2604.05260v2) présentant ZipFold, un actionneur modulaire capable de transformer simultanément sa taille et sa rigidité par plissage et verrouillage de bandelettes plastiques imprimées en 3D. Le principe repose sur l'enroulement de ces bandelettes flexibles en poutres à section carrée : en position compacte, la structure reste souple et peu encombrante ; en position déployée, elle atteint un état quasi-rigide. La transition est continue, réversible, et ne requiert ni mécanisme hydraulique ni pneumatique. Un prototype intégrant quatre de ces modules a été démontré sous la forme d'un robot marcheur adaptatif capable de modifier dynamiquement sa démarche en ajustant la rigidité de ses membres en temps réel. Le principal intérêt de ZipFold réside dans sa généricité : contrairement aux actionneurs à rigidité variable existants, généralement conçus sur-mesure pour un usage précis et difficilement réutilisables dans un autre contexte, cette brique modulaire peut être assemblée en configurations arbitraires. La fabrication par impression 3D de plastique flexible abaisse le seuil d'entrée pour les équipes de recherche et les petits intégrateurs, sans nécessiter de chaîne d'approvisionnement spécialisée. Pour des systèmes robotiques opérant dans des environnements changeants (logistique, inspection, rééducation), la capacité à modifier le comportement mécanique sans reconfiguration matérielle représente un avantage opérationnel concret. Il faut toutefois tempérer : le papier est un préprint académique sans benchmarks comparatifs publiés face aux alternatives existantes, et les performances annoncées (rigidité atteinte, charge utile, nombre de cycles) restent à valider sur des durées et des conditions représentatives. Le problème de la rigidité variable mobilise la communauté robotique depuis des décennies : les approches pneumatiques (jamming de particules, muscles McKibben), les alliages à mémoire de forme (SMA) et les câbles antagonistes dominent aujourd'hui, mais chacun achoppe sur des compromis entre vitesse de commutation, encombrement et complexité d'intégration. ZipFold se positionne sur le créneau de la modularité fabricatoire, un espace encore peu occupé par des solutions génériques et bas-coût. Le préprint ne mentionne ni partenaire industriel ni calendrier de transfert technologique ; les prochaines étapes attendues incluent des tests de charge, des essais en endurance cyclique, ainsi qu'une démonstration sur des morphologies plus complexes que le marcheur quadrimodulaire actuel.

RecherchePaper
1 source
SLAM comme problème de contrôle stochastique à information partielle : solutions optimales et approximations rigoureuses
5537arXiv cs.RO 

SLAM comme problème de contrôle stochastique à information partielle : solutions optimales et approximations rigoureuses

Des chercheurs présentent sur arXiv (réf. 2604.21693, avril 2026) un cadre théorique qui reformule le SLAM actif comme un problème de contrôle stochastique optimal sous information partielle. Le SLAM (Simultaneous Localization and Mapping) désigne la capacité d'un robot à construire une carte de son environnement tout en s'y localisant simultanément, un problème fondamental en robotique mobile. Dans sa version "active", le robot doit en plus décider quels mouvements effectuer pour maximiser la qualité de sa carte et la précision de sa pose. Les auteurs formalisent ce problème sous la forme d'un processus de décision markovien partiellement observable (POMDP) non standard, intégrant de façon rigoureuse les modèles de mouvement, de perception et de représentation de la carte. Ils introduisent une nouvelle fonction de coût d'exploration qui encode explicitement la géométrie de l'état du robot au moment d'évaluer les actions de collecte d'information. À partir de cette formulation, ils dérivent des solutions approchées quasi-optimales avec garanties formelles. Une étude numérique extensive valide l'approche en utilisant des algorithmes d'apprentissage par renforcement standards pour apprendre ces politiques. L'intérêt principal de ce travail réside dans la rigueur théorique qu'il apporte à un domaine dominé par des heuristiques empiriques. La plupart des approches d'exploration autonome actuelles, qu'elles reposent sur les frontières d'exploration (frontier-based), la maximisation d'information mutuelle, ou des métriques ad hoc, manquent de garanties formelles sur la qualité des solutions produites. En reformulant le problème dans le cadre du contrôle stochastique optimal et des POMDPs, les auteurs fournissent des conditions de régularité et des bornes d'approximation qui permettent de certifier la quasi-optimalité des politiques apprises. Pour les équipes R&D travaillant sur des AMR (robots mobiles autonomes), des drones cartographiques ou des robots d'inspection industrielle, cette approche ouvre la voie à des algorithmes d'exploration dont le comportement est formellement auditable, ce qui est non trivial dans les contextes de certification. Le SLAM est un problème étudié depuis les années 1990, avec des approches classiques basées sur les filtres de Kalman étendus (EKF-SLAM) ou les filtres particulaires (FastSLAM), puis des méthodes graphiques comme ORB-SLAM3 ou RTAB-Map qui dominent aujourd'hui les implémentations industrielles. Les approches neuronales, comme les NeRF et Gaussian Splatting adaptés au SLAM temps réel, émergent en parallèle. Ce papier, encore préprint non évalué par les pairs, ne remplace pas ces implémentations mais propose un cadre décisionnel qui les surplombe. Les laboratoires actifs sur ces questions incluent MIT CSAIL, ETH Zurich (Autonomous Systems Lab) et l'équipe de Joan Solà. Les prochaines étapes naturelles seraient une validation expérimentale sur robot réel et une extension vers les environnements dynamiques, deux points non traités dans cette version arXiv.

RecherchePaper
1 source
Scensory : perception olfactive robotique en temps réel pour l'identification conjointe et la localisation de source
5538arXiv cs.RO 

Scensory : perception olfactive robotique en temps réel pour l'identification conjointe et la localisation de source

Des chercheurs ont publié sur arXiv (référence 2509.19318, version révisée en 2026) un système baptisé Scensory, conçu pour doter les robots d'une capacité olfactive temps réel appliquée à la détection de contaminations fongiques en intérieur. Le framework repose sur des réseaux de capteurs VOC (composés organiques volatils) bon marché et à sensibilité croisée, couplés à des réseaux de neurones capables d'analyser de courtes séries temporelles de 3 à 7 secondes. Sur un panel de cinq espèces fongiques testées en conditions ambiantes, Scensory atteint 89,85 % de précision pour l'identification de l'espèce et 87,31 % pour la localisation de la source. Les deux tâches sont résolues simultanément, à partir d'un même flux de données capteurs. Ce résultat est techniquement significatif parce que les signaux chimiques en diffusion libre sont particulièrement difficiles à exploiter : contrairement à la vision ou au toucher, où le signal est directionnel et localisé, les panaches olfactifs se dispersent de manière stochastique selon les flux d'air ambiants. Que des capteurs VOC grand public, combinés à un apprentissage supervisé sur données collectées automatiquement par le robot, permettent de relier dynamique temporelle du signal et position spatiale de la source change l'équation économique du nez électronique embarqué. Jusqu'ici, la perception chimique robotique supposait soit des capteurs spécialisés coûteux, soit des conditions contrôlées de laboratoire. Scensory suggère qu'une approche data-driven sur matériel accessible peut combler une partie de ce fossé. Le domaine de l'olfaction robotique reste nettement en retard sur la vision et la manipulation, malgré des travaux académiques réguliers depuis les années 2000 sur les nez électroniques (e-nose) et la navigation par gradient chimique. Les applications visées par Scensory, inspection de bâtiments, monitoring environnemental indoor, contrôle qualité alimentaire, n'ont pas encore de solution robotique commerciale établie. Le papier reste un résultat académique sur arXiv sans déploiement annoncé ni partenaire industriel identifié ; les performances reportées devront être validées sur un spectre élargi d'espèces, de conditions d'humidité et de géométries de pièce avant d'envisager une intégration produit.

RecherchePaper
1 source
RPG : commutation robuste de politiques pour des transitions fluides entre compétences en combat humanoïde
5539arXiv cs.RO 

RPG : commutation robuste de politiques pour des transitions fluides entre compétences en combat humanoïde

Une équipe de chercheurs a publié le 21 avril 2026 sur arXiv (2604.21355) un framework baptisé RPG (Robust Policy Gating), conçu pour permettre à des robots humanoïdes d'enchaîner plusieurs compétences de combat dynamique sans instabilité. L'approche repose sur une politique unifiée entraînée avec deux mécanismes de randomisation : la randomisation des transitions de mouvement, qui expose la politique à des états initiaux et terminaux variés entre compétences, et la randomisation temporelle, qui rend l'agent robuste aux coupures imprévises dans la séquence de mouvements. La pipeline de contrôle intègre la locomotion (marche, course) avec les compétences de combat, permettant théoriquement des séquences de durée arbitraire. Le système a été validé en simulation extensive, puis déployé sur le robot humanoïde Unitree G1, la plateforme à 23 DDL du constructeur chinois Unitree Robotics. Le problème central que RPG adresse est connu dans le domaine sous le nom de "skill transition gap" : lorsqu'un agent bascule d'une politique spécialisée à une autre, les états terminaux de la première ne correspondent pas aux états initiaux supposés de la seconde, produisant des comportements hors domaine, des chutes ou des mouvements saccadés. Les approches concurrentes utilisent soit une commutation entre politiques mono-compétence, soit une politique généraliste qui imite des motion clips de référence -- les deux souffrent de ce décalage. RPG propose une solution d'entraînement plutôt que d'architecture, ce qui est notable : la robustesse aux transitions est injectée pendant la phase d'apprentissage, pas via un mécanisme de gating à l'inférence. L'absence de métriques quantitatives dans la publication (temps de cycle, taux de chute, nombre de transitions testées) limite cependant la comparaison directe avec d'autres travaux. RPG s'inscrit dans une vague active de recherche sur le contrôle corps entier des humanoïdes pour des tâches hautement dynamiques, un domaine où les laboratoires UCB, CMU et Stanford publient régulièrement depuis 2023. L'utilisation du G1 comme plateforme de validation est cohérente avec sa popularité croissante en recherche académique, notamment grâce à son coût inférieur à celui des plateformes concurrentes (Boston Dynamics Atlas, Agility Digit). Sur le plan commercial, des acteurs comme Figure AI, 1X Technologies ou Apptronik ciblent des tâches répétitives en entrepôt plutôt que le combat, mais les techniques de transition de compétences développées ici sont directement transposables aux scénarios industriels nécessitant des enchaînements fluides de manipulation et de locomotion. La prochaine étape naturelle serait une évaluation quantitative en conditions adversariales réelles, ainsi qu'un transfert vers des tâches moins "spectaculaires" mais plus proches du déploiement B2B.

RecherchePaper
1 source
Unitree Robotics présente un robot humanoïde à roues et jambes capable de patiner et d'effectuer des figures acrobatiques
5540Pandaily 

Unitree Robotics présente un robot humanoïde à roues et jambes capable de patiner et d'effectuer des figures acrobatiques

Le 23 avril 2026, Unitree Robotics a diffusé une vidéo présentant les capacités de son robot humanoïde hybride à roues et jambes, la plateforme G1-D. Les séquences montrent l'engin enchaîner patinage sur glace, roller, rotations à 360 degrés, pirouettes sur un appui et saltos avant, en alternant de manière autonome entre modes roues et bipède selon les exigences du terrain. L'entreprise positionne cette architecture comme un vecteur de polyvalence pour les robots à usage général, adaptables à des environnements variés sans changement de plateforme matérielle. Aucune métrique technique indépendante (charge utile, degrés de liberté, temps de cycle opérationnel) n'accompagne la publication : il s'agit d'une vidéo promotionnelle dont les conditions précises de tournage restent inconnues. Le contrôle multimodal illustré représente un défi technique réel : la transition fluide entre locomotion roues et locomotion pédestre exige des politiques de contrôle capables de gérer des dynamiques radicalement différentes, généralement entraînées par apprentissage par renforcement. Pour les intégrateurs industriels, la question centrale est celle de la polyvalence opérationnelle : une architecture hybride permet-elle de couvrir plusieurs cas d'usage (logistique en entrepôt et manutention debout) sur un seul déploiement matériel, ou ajoute-t-elle de la complexité sans avantage net ? La réponse reste ouverte tant qu'aucun pilote industriel documenté ne valide les performances hors conditions contrôlées. Unitree Robotics, fondée en 2016 à Hangzhou, s'est imposée avec le Go1, le B2 et l'humanoïde H1 comme l'un des fabricants de robots les plus prolifiques du marché semi-industriel. La plateforme G1-D intègre une solution complète de collecte de données et d'entraînement de modèles pour accélérer l'optimisation des algorithmes de locomotion. Sur le segment humanoïde, la concurrence directe de Figure, Boston Dynamics et Agility Robotics reste sur des architectures entièrement bipèdes, ce qui fait de l'hybridation roues-jambes un pari différenciant mais encore non validé en production. En France et en Europe, aucun acteur ne travaille sur cette architecture spécifique à échelle industrielle, laissant le terrain largement ouvert à l'offre asiatique.

HumanoïdesOpinion
1 source
Mikell Taylor de GM va animer le petit-déjeuner Women in Robotics au Robotics Summit
5541Robotics Business Review 

Mikell Taylor de GM va animer le petit-déjeuner Women in Robotics au Robotics Summit

Mikell Taylor, responsable de la stratégie robotique au sein du centre Autonomous Robotics Center de General Motors, animera le Women in Robotics Breakfast le 28 mai 2026 à Boston, lors du Robotics Summit & Expo. L'événement se tient les 27 et 28 mai, et cette session matinale -- démarrant à 8h00 ET -- est une option payante distincte de l'inscription standard, avec des places limitées. Joyce Sidopoulos, co-fondatrice et directrice des opérations de MassRobotics, y participera également. Le format privilégie la conversation et le mentorat entre professionnelles du secteur. Taylor enchaînera ensuite avec une keynote intitulée "What Makes a Robot Worthy?", centrée sur la notion de confiance dans les systèmes robotiques. Le Robotics Summit réunit plus de 70 intervenants confirmés issus d'entreprises comme Tesla, Toyota Research Institute, AWS, Brain Corp, PickNik Robotics ou encore le Robotics and AI Institute, avec plus de 50 sessions réparties en cinq thématiques : IA, conception, technologies habilitantes, santé et logistique. La stat qui justifie l'événement : selon CareerExplorer, seulement 19 % des ingénieurs en robotique sont des femmes. Dans les startups de taille réduite -- qui représentent une part significative du tissu industriel robotique -- cela se traduit souvent par une isolation structurelle : une seule femme ingénieure par équipe, voire par entreprise entière. Ce déficit de représentation a des conséquences concrètes sur les décisions de conception, les dynamiques d'équipe et les trajectoires de carrière. Des initiatives comme ce breakfast cherchent à créer des réseaux de pairs là où ils n'existent pas spontanément. Pour les décideurs B2B et les directeurs techniques, la question de la diversité des équipes robotiques n'est plus uniquement éthique : elle touche à la capacité d'innovation et à la rétention des talents dans un marché des compétences très tendu. Mikell Taylor apporte 25 ans d'expérience terrain à cette discussion. Diplômée en génie électrique et informatique de l'Olin College -- dont elle fait partie de la première promotion -- elle a dirigé chez Amazon Robotics l'équipe ayant développé Proteus, le premier robot mobile autonome (AMR) d'Amazon. Elle est aujourd'hui chez GM à la tête de la stratégie robotique, et a été désignée Tech Power Player par le Boston Globe en 2023. Le Robotics Summit & Expo, produit par The Robot Report et WTWH Media, se positionne comme le principal rendez-vous technique pour les développeurs de robotique commerciale, co-localisé cette année avec DeviceTalks Boston (dispositifs médicaux). Le contexte est celui d'une industrie en phase d'accélération, où la compétition pour les talents -- et leur rétention -- devient aussi critique que la course technologique elle-même.

Societe/EthiqueActu
1 source
Pudu Robotics lève près de 150 millions de dollars pour cibler les applications industrielles
5542Robotics Business Review 

Pudu Robotics lève près de 150 millions de dollars pour cibler les applications industrielles

Pudu Technology Inc., fabricant de robots de service basé à Shenzhen, a annoncé le 23 avril 2026 avoir levé près de 150 millions de dollars lors d'un nouveau tour de financement. Cette opération porte la valorisation de l'entreprise au-delà de 1,5 milliard de dollars, et son financement cumulé à plus de 300 millions de dollars depuis sa création en 2016. Pudu structure son offre autour de trois gammes de produits -- robots de livraison intérieure, systèmes de nettoyage commercial, et plateformes logistiques -- déployées dans dix secteurs d'activité incluant la restauration, le retail, l'hôtellerie, la santé, l'éducation et l'industrie. Sur le plan produit, la société a lancé en 2024 le PUDU T300, un robot mobile conçu pour évoluer dans des allées étroites avec des charges lourdes, avant de dévoiler début 2026 le PUDU T150, un AMR à faible charge utile ciblant la manutention en environnements d'entrepôt et de fabrication. Le T150 est disponible en Chine continentale et dans les régions de Hong Kong, Macao et Taïwan, avec un déploiement prévu dans plusieurs marchés à forte croissance : Vietnam, Thaïlande, Singapour, Malaisie, Indonésie, Corée du Sud et Turquie. Ce tour de table illustre un mouvement structurel dans la robotique de service : la migration vers l'industrie. Pudu, longtemps cantonné aux robots de livraison en restauration et hôtellerie, accélère son repositionnement sur la manutention industrielle et l'IA incarnée (embodied AI), un segment où les marges et les contrats sont plus solides qu'en service grand public. Les fonds seront affectés au développement de technologies d'IA embarquée, à l'élargissement du portefeuille produit, à l'expansion internationale et à la montée en capacité de production. Pour les intégrateurs et décideurs industriels, ce pivot signifie une concurrence accrue sur le segment AMR léger, traditionnellement occupé par des acteurs comme Geek+, Hai Robotics ou le français Exotec -- qui reste cependant positionné sur un créneau plus automatisé et dense. Aucune métrique de performance n'a été communiquée sur le T150 (vitesse, charge utile exacte, temps de cycle), ce qui rend toute comparaison technique prématurée à ce stade. Pudu n'est pas un cas isolé : D-Robotics, également basé à Shenzhen et spécialisé dans les plateformes matérielles et logicielles pour robots grand public et IA incarnée, a levé 270 millions de dollars en Série B quelques semaines plus tôt, en avril 2026. Ces levées massives de capitaux dans la robotique chinoise reflètent une course à l'échelle mondiale, soutenue par une chaîne d'approvisionnement locale compétitive et une pression croissante des gouvernements asiatiques pour automatiser leur secteur manufacturier. Fondée en 2016 par Felix Zhang, Pudu a d'abord conquis le marché de la restauration avant d'élargir progressivement son empreinte ; la prochaine étape déclarée est l'accélération hors de Chine, avec un focus sur l'Asie du Sud-Est et potentiellement l'Europe, sans calendrier précis annoncé à ce jour.

Chine/AsieActu
1 source
Fin d'une ère : Honeywell cède le contrôle de l'automatisation d'entrepôt à AIP
5543Robotics Business Review 

Fin d'une ère : Honeywell cède le contrôle de l'automatisation d'entrepôt à AIP

Honeywell a annoncé le 23 avril 2026 la cession de sa division Warehouse and Workflow Solutions (WWS), qui regroupe les marques Intelligrated et Transnorm, au fonds de capital-investissement américain American Industrial Partners (AIP). La transaction, dont les termes financiers n'ont pas été divulgués, devrait être finalisée au second semestre 2026. L'ensemble pesait environ 935 millions de dollars de revenus en 2025, ce qui en fait l'un des actifs les plus significatifs du marché de l'automatisation logistique. Intelligrated couvre l'intégration de systèmes bout-en-bout : convoyeurs, trieurs automatisés, palettiseurs, robotique et logiciels d'orchesturation. Transnorm, de son côté, est spécialisée dans les technologies de courroies courbes et sert les secteurs aéroportuaire, postal, colis et e-commerce sur cinq continents. AIP prévoit d'adosser WWS à Trew Automation, un intégrateur de systèmes de manutention dans lequel le fonds est déjà investi, pour constituer une plateforme complémentaire à destination des industriels. Le signal envoyé au marché est celui d'une recomposition structurelle du paysage des intégrateurs de grande taille. Depuis les rachats par Honeywell, Intelligrated et Transnorm ont opéré dans le cadre d'un conglomérat dont l'automatisation logistique n'était qu'une ligne parmi d'autres. Sous AIP, les deux entités rejoindront un véhicule dédié à l'industrie, potentiellement plus agile sur les cycles de décision et d'investissement produit. Pour les décideurs B2B et les grands comptes logistiques, le changement d'actionnaire soulève des questions légitimes sur la continuité des contrats de maintenance, le support logiciel et les feuilles de route technologiques, en particulier sur les solutions robotiques et ASRS (Automated Storage and Retrieval Systems) déjà déployées dans leurs entrepôts. La fusion avec Trew vise à créer des synergies sur la base installée, mais la réussite de ce type d'intégration post-M&A reste à démontrer dans l'exécution opérationnelle. Honeywell avait acquis Intelligrated le 30 août 2016 pour environ 1,5 milliard de dollars, surenchérissant notamment sur Toyota Industries, après un rachat initial par Permira en 2012. Transnorm avait suivi le 9 novembre 2018 pour environ 425 millions d'euros (492 millions de dollars), acquis auprès d'IK Investment Partners. Cette cession s'inscrit dans un mouvement de démantèlement stratégique plus large : le 20 avril 2026, Honeywell avait annoncé la vente de sa division Productivity Solutions and Services à Brady Corporation pour 1,4 milliard de dollars en cash, et avait déjà cédé son activité équipements de protection individuelle en 2024. L'entreprise cherche à se recentrer sur ses activités historiques dans l'aérospatiale, l'énergie et l'automatisation industrielle de procédés. Dans ce secteur, les concurrents directs d'Intelligrated incluent Dematic (groupe KION), Vanderlande (Toyota Industries), Swisslog (KUKA/Midea) et SSI Schäfer, tous en compétition sur les grands projets d'entrepôts automatisés à mesure que la demande e-commerce et les pénuries de main-d'oeuvre accélèrent les cycles d'investissement.

IndustrielOpinion
1 source
De l'électrique à la robotique : Tesla vise 10 millions d'unités Optimus avec sa nouvelle usine au Texas
5544Robotics Business Review 

De l'électrique à la robotique : Tesla vise 10 millions d'unités Optimus avec sa nouvelle usine au Texas

Tesla a annoncé lors de son appel aux résultats du premier trimestre 2026, le 23 avril, le lancement de la production de son robot humanoïde Optimus dès le deuxième trimestre à son usine de Fremont, en Californie. Pour libérer la capacité nécessaire, l'entreprise supprime les lignes de production des Model S et Model X, remplacées par une première usine robotique dimensionnée pour un million d'unités par an. En parallèle, Tesla entame les travaux de terrassement d'une seconde installation au Gigafactory Texas, dont la cible à long terme atteint dix millions de robots par an. Ces annonces s'appuient sur des résultats financiers solides : 3,9 milliards de dollars de flux de trésorerie opérationnel et une marge brute GAAP de 21 % au T1 2026. L'entreprise développe également le processeur d'inférence AI5, conçu spécifiquement pour les charges de calcul des programmes Optimus et Robotaxi, ainsi qu'une couche logicielle baptisée "Digital Optimus", destinée à automatiser des flux de travail numériques en complément du robot physique. Ces chiffres sont spectaculaires sur le papier, mais méritent d'être lus avec nuance. Un million d'unités par an à Fremont représente un objectif de production industrielle que peu d'acteurs de la robotique humanoïde ont jamais approché : Boston Dynamics, après trente ans d'existence, produit quelques milliers d'Atlas et Spot par an. Pour les intégrateurs et décideurs industriels, la question centrale n'est pas la capacité de fabrication annoncée mais la réalité du déploiement : Tesla n'a pas publié de données sur la fiabilité opérationnelle d'Optimus en dehors de ses propres usines, ni sur le coût unitaire ou les contrats clients tiers. La décision de faire de l'intégration verticale sur les semi-conducteurs (AI5) signale néanmoins une stratégie cohérente : contrôler la stack complète, de la puce au software de planification de mouvement, pour ne pas dépendre de fournisseurs comme NVIDIA dont Tesla s'est éloigné sur d'autres programmes. Optimus a été présenté pour la première fois en septembre 2022 sous forme de prototype très préliminaire, puis démontré dans une version Gen 2 fin 2023, avant d'être déployé dans les usines Tesla courant 2024-2025 pour des tâches de manutention internes. La trajectoire de Tesla croise frontalement celle de Figure AI (Figure 02 déployé chez BMW), Agility Robotics (Digit en production chez Amazon), et Physical Intelligence dont le modèle de fondation Pi-0 alimente plusieurs plateformes. Du côté des acteurs européens, Wandercraft et Enchanted Tools restent positionnés sur des niches spécifiques (rééducation, service) sans rivaliser sur les volumes industriels annoncés. La prochaine étape concrète pour Tesla sera la présentation par Joshua Joseph, ingénieur déploiement AMR chez Tesla, d'une session sur le déploiement d'AMR dans les usines américaines existantes lors du Robotics Summit & Expo de Boston le 28 mai 2026, qui donnera une première lecture des réalités terrain derrière les ambitions affichées.

HumanoïdesOpinion
1 source
HII s'associe à Path Robotics et GrayMatter Robotics pour accélérer la construction navale
5545Robotics Business Review 

HII s'associe à Path Robotics et GrayMatter Robotics pour accélérer la construction navale

HII (Huntington Ingalls Industries), premier constructeur naval américain basé à Newport News, Virginie, a annoncé cette semaine le programme HYPR (High-Yield Production Robotics) en partenariat avec Path Robotics et GrayMatter Robotics. Développé au sein du Dark Sea Labs Advanced Technology Group de HII, HYPR vise à combiner quatre capacités automatisées en une seule ligne de production coordonnée : soudage robotisé à base de physical AI, déplacement automatisé de matériaux, traitement autonome des surfaces et contrôles qualité autonomes. Path Robotics apporte son IA physique pour la fabrication ; GrayMatter Robotics contribue sa plateforme FSI (Factory SuperIntelligence) dédiée à la préparation de surface, la finition, le revêtement et l'inspection. HII réalise "des millions d'heures de soudage par an" et affiche un carnet de commandes de plusieurs milliards de dollars, selon Andy Lonsberry, CEO et co-fondateur de Path Robotics. Des démonstrations proof-of-concept sont prévues en 2026, avec un pilote complet en 2027. L'intérêt stratégique de HYPR dépasse la simple juxtaposition d'outils autonomes. En orchestrant plusieurs systèmes au sein d'une même ligne de fabrication structurale, le programme s'attaque à des tâches à forte variabilité qui ont jusqu'ici résisté à l'automatisation traditionnelle. Le soudage naval concentre les risques les plus aigus : Lonsberry le qualifie de "tâche la plus importante, la plus coûteuse et la plus destructive" du processus, car une erreur de cordon n'est pas récupérable à la différence d'un composant mal positionné. Pour les intégrateurs et les décideurs industriels, c'est un signal concret que les systèmes de physical AI commencent à opérer dans des environnements non structurés, loin des benchmarks de laboratoire. Le pilote 2027 constituera un test grandeur nature du passage sim-to-real dans la construction navale, secteur notoirement moins standardisé que l'automobile, où les surfaces complexes et les gabarits variables rendent les robots à trajectoires fixes peu adaptés. HII a consolidé ce partenariat en deux étapes rapprochées : un mémorandum d'entente avec Path Robotics signé en février 2026 pour explorer le soudage assisté par IA, suivi d'un accord avec GrayMatter Robotics début avril 2026. Dans ce même intervalle, Path Robotics a lancé Rove, un système de soudage mobile combinant son IA propriétaire Obsidian à un robot quadrupède, étendant ses capacités au-delà des postes fixes. GrayMatter, spécialisée dans l'industrialisation de l'IA pour les ateliers de fabrication, se positionne sur les opérations de finition et d'inspection que les robots classiques ne savent pas gérer. Le programme s'inscrit dans la politique de renforcement de la capacité navale nationale portée par le Département de la Défense américain, qui cherche à accélérer la production de ce qu'il nomme sa "golden fleet". Aucun acteur européen n'est impliqué directement, mais des groupes comme Naval Group surveillent ce type d'intégration multi-systèmes pour leurs propres programmes de modernisation.

IndustrielOpinion
1 source
Chaleur et compétence dans l'essaim : concevoir des équipes humain-robot efficaces
5546arXiv cs.RO 

Chaleur et compétence dans l'essaim : concevoir des équipes humain-robot efficaces

Une équipe de chercheurs a publié sur arXiv (identifiant 2604.19270, avril 2026) une étude portant sur la perception sociale des essaims de robots lors de collaborations avec des humains. Via deux expériences structurées autour d'une tâche collective de recherche, les participants ont évalué différentes configurations d'essaim en tant qu'observateurs passifs dans la première étude, puis en tant qu'opérateurs actifs dans la seconde. Les résultats sont consistants sur les deux études : les variations de comportement du groupe de robots modifient systématiquement les jugements de chaleur relationnelle (warmth) et de compétence attribués au collectif. Une durée de diffusion de signal plus longue augmente la chaleur perçue ; une distance de séparation inter-robots plus grande augmente la compétence perçue. La vitesse individuelle de chaque robot, en revanche, n'a d'effet significatif sur aucun des deux attributs. Le résultat le plus contre-intuitif est que les perceptions sociales prédisent les préférences d'équipe plus fortement que la performance brute. Les participants ont préféré les équipes à la fois chaleureuses et compétentes à celles qui accomplissaient la tâche le plus rapidement. Pour les intégrateurs de systèmes multi-robots et les responsables industriels, ce constat remet en cause un postulat courant : optimiser un essaim pour la vitesse ou l'efficacité pure ne suffit pas à obtenir l'adhésion des opérateurs humains. La dimension sociale du comportement collectif, la façon dont le groupe semble agir plutôt que ce qu'il accomplit, détermine l'acceptation et la confiance. Dans des environnements collaboratifs intégrant des AMR ou des flottes robotiques, ignorer ces paramètres constitue un facteur de risque d'adoption sous-estimé. Le cadre théorique utilisé, le modèle competence-warmth issu de la psychologie sociale, est bien établi pour la perception des individus et des groupes humains, mais son application aux essaims robotiques reste émergente. La littérature en HRI (human-robot interaction) s'est jusqu'ici principalement focalisée sur des agents individuels. Ce preprint arXiv, non encore évalué par les pairs, s'inscrit dans une direction de recherche croissante à l'intersection du swarm robotics et de la HRI. Des entreprises déployant des flottes en environnement humain, de Boston Dynamics à des acteurs européens comme Exotec ou Enchanted Tools, auraient intérêt à intégrer ces paramètres comportementaux dès la conception. La prochaine étape logique serait de valider ces résultats en environnement industriel réel, avec des opérateurs non-experts et des tâches à plus forte variabilité.

RecherchePaper
1 source
VLA Foundry : un cadre unifié pour l'entraînement des modèles vision-langage-action
5547arXiv cs.RO 

VLA Foundry : un cadre unifié pour l'entraînement des modèles vision-langage-action

Le laboratoire TRI-ML (Toyota Research Institute Machine Learning) publie VLA Foundry, un framework open-source qui unifie dans une seule base de code l'entraînement des modèles LLM, VLM et VLA (Vision-Language-Action). Jusqu'ici, la majorité des pipelines open-source de robotique apprenante se concentraient exclusivement sur l'étape d'entraînement à l'action, assemblant à la hâte des briques de préentraînement incompatibles entre elles. VLA Foundry propose à la place un continuum de bout en bout: du préentraînement linguistique jusqu'au fine-tuning spécialisé pour le contrôle moteur. Deux familles de modèles sont publiées simultanément: la première entraînée intégralement depuis zéro via le pipeline LLM→VLM→VLA, la seconde construite sur le backbone Qwen3-VL d'Alibaba. Les deux sont évalués en boucle fermée sur LBM Eval, un simulateur open-source et open-data de manipulation sur table. Sur les tâches multi-objets, le modèle fondé sur Qwen3-VL dépasse la baseline de façon significative, sans que TRI-ML ne quantifie précisément l'écart dans le résumé publié. Le code est disponible sur GitHub (TRI-ML/vla_foundry) et les poids sont libérés sur HuggingFace. Ce que VLA Foundry prouve concrètement, c'est que le choix du backbone VLM est un levier critique: partir d'un modèle vision-langage préentraîné et performant comme Qwen3-VL, plutôt que de construire une architecture robotique ad hoc, améliore substantiellement la politique de contrôle multi-tâches. Pour les équipes d'intégration et les chercheurs, cela valide une stratégie de transfert: exploiter les représentations génériques des grands VLMs commerciaux ou open-weights plutôt que de repartir de zéro. Par ailleurs, le fait que le modèle from-scratch atteigne les performances des travaux closed-source antérieurs de TRI-ML constitue un signal positif pour la reproductibilité de cette classe de modèles, souvent opaque dans la littérature. TRI-ML est l'un des laboratoires de robotique académique les plus actifs, avec une longue historique en apprentissage par renforcement et en manipulation. Dans la course aux VLA, il affronte désormais Physical Intelligence et son modèle pi0, Figure AI avec Helix, Google DeepMind (RT-2, et ses successeurs), ainsi que plusieurs startups émergentes. L'appui sur Qwen3-VL, un modèle produit par l'équipe Qwen d'Alibaba, illustre la tendance croissante à hybrider les avancées du monde NLP avec les contraintes du monde physique. Les prochaines étapes mentionnées incluent des améliorations d'outillage pour le simulateur LBM Eval et l'outil d'analyse STEP, deux contributions qui pourraient aider la communauté à standardiser l'évaluation des politiques robotiques en boucle fermée.

IA physiqueOpinion
1 source
Planification hybride tâche-mouvement et gestion réactive des collisions pour le démontage multi-robots de batteries VE
5548arXiv cs.RO 

Planification hybride tâche-mouvement et gestion réactive des collisions pour le démontage multi-robots de batteries VE

Des chercheurs ont publié, dans un article arXiv (2509.21020v2), un cadre de planification tâche-et-mouvement (TAMP) appliqué au démontage de batteries de véhicules électriques par deux bras robotiques travaillant en parallèle. Le système intègre une décomposition et une allocation dynamique des tâches, un planificateur de trajectoire basé sur RRT enrichi par un modèle de mélanges gaussiens (GMM), et une couche de sécurité hybride combinant un jumeau numérique MoveIt/FCL pour la détection prédictive de collisions avec un module d'évitement réactif par vision. Contrairement à une planification en boucle ouverte, le système opère en boucle fermée : il rescanne la scène en continu et met à jour la séquence de tâches restante selon l'état d'achèvement réel. Sur des expériences physiques de démontage de batteries EV, comparé à l'algorithme de référence RRTConnect, le framework réduit la longueur cumulée des trajectoires d'effecteur de 48,8 m à 17,9 m (soit -63,3 %), améliore le temps global de cycle (makespan) de 467,9 s à 429,8 s (-8,1 %), et diminue les volumes balayés par chaque robot (R1 : de 0,583 à 0,139 m³ ; R2 : de 0,696 à 0,252 m³), ainsi que leur chevauchement (de 0,064 à 0,034 m³). Ces résultats sont significatifs pour les intégrateurs industriels qui travaillent sur des lignes de démantèlement de batteries en fin de vie, un marché en forte croissance avec la montée en volume des VE. La combinaison planification prédictive et évitement réactif -- sans recours à une trajectoire figée -- est ce qui distingue l'approche : le système peut gérer des obstacles dynamiques et des imprévus de perception sans replanification globale coûteuse. La réduction de 63 % des distances parcourues réduit mécaniquement l'usure, le temps d'exposition aux risques de collision et l'énergie consommée, trois facteurs critiques pour un passage à l'échelle industrielle. Il faut noter que les expériences sont réelles (pas uniquement en simulation), ce qui renforce la crédibilité des métriques, même si les conditions exactes de test (variété des modules de batteries, taux d'échec de perception) ne sont pas détaillées dans le résumé. Le problème de démontage de batteries VE est devenu un axe de recherche prioritaire avec les objectifs européens de recyclage fixés par le règlement batteries 2023. Des équipes académiques et industrielles comme celles gravitant autour de MoveIt (OSRF), ainsi que des acteurs français tels que Pollen Robotics ou des intégrateurs proches du CEA-List, explorent des pistes similaires. Ce travail s'inscrit dans une tendance plus large : dépasser le sim-to-real gap en déployant des planificateurs hybrides sur du matériel réel, et adresser des tâches séquentielles complexes à contraintes d'ordre strict (précédence de dévissage, fragilité des cellules). La prochaine étape logique serait de tester la robustesse sur une gamme élargie de modèles de batteries et d'intégrer un retour haptique pour les phases de contact délicat.

IndustrielPaper
1 source
RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique
5549arXiv cs.RO 

RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique

Une équipe de chercheurs a déposé sur arXiv (identifiant 2604.19092) RoboWM-Bench, un benchmark dédié à l'évaluation des world models vidéo pour la manipulation robotique. Le protocole est exigeant : les comportements générés par ces modèles, à partir de vidéos de mains humaines ou de robots en action, sont convertis en séquences d'actions exécutables, puis validés par exécution réelle sur robot physique. Les évaluations conduites sur les meilleurs world models actuels sont sans appel : produire des comportements physiquement exécutables de manière fiable reste un problème ouvert. Les modes d'échec récurrents identifiés incluent les erreurs de raisonnement spatial, la prédiction instable des contacts entre effecteur et objet, et les déformations non physiques de matériaux. Un fine-tuning sur données de manipulation améliore les résultats, mais les incohérences physiques persistent. Ce constat soulève une question stratégique pour l'industrie : peut-on utiliser des world models comme simulateurs bon marché pour générer des données d'entraînement, en remplacement des démonstrations terrain coûteuses ? Le réalisme visuel d'une vidéo générée ne garantit pas sa plausibilité physique, une distinction que les benchmarks existants, majoritairement orientés perception ou diagnostic, ne permettaient pas de mesurer. En imposant la validation par exécution réelle comme critère central, RoboWM-Bench dépasse les métriques habituelles de cohérence temporelle ou de FID. Pour les équipes engineering et les intégrateurs, la conclusion est opérationnelle : les world models actuels ne sont pas encore substituables aux démonstrations réelles pour l'apprentissage de politiques de manipulation précise. L'intérêt pour les world models en robotique s'est intensifié depuis 2024, porté par des modèles génératifs comme Sora (OpenAI), Genie 2 (Google DeepMind) ou UniSim, et alimenté par les avancées des VLA (Vision-Language-Action). L'hypothèse qu'un monde simulé pourrait tenir lieu de terrain d'entraînement, évitant la collecte de données réelles, est au coeur des investissements d'une dizaine de startups et labos académiques actifs sur ce créneau. RoboWM-Bench s'inscrit dans une dynamique de standardisation comparable à ce que RoboMimic ou MetaWorld ont établi pour l'imitation learning : un protocole unifié et reproductible. Aucune affiliation institutionnelle ni timeline d'extension du benchmark ne figurent dans le preprint, ce qui en limite la portée immédiate, mais la publication envoie un signal net : la communauté robotique commence à exiger des preuves d'exécutabilité physique, et non plus seulement de cohérence visuelle.

RecherchePaper
1 source
Apprentissage du parkour pour quadrupèdes : mélange d'experts parcimonieux avec entrée visuelle
5550arXiv cs.RO 

Apprentissage du parkour pour quadrupèdes : mélange d'experts parcimonieux avec entrée visuelle

Des chercheurs ont publié sur arXiv (référence 2604.19344) une étude comparant deux architectures de réseaux de neurones pour le contrôle d'un robot quadrupède Unitree Go2 face à des obstacles de parkour, notamment des marches et discontinuités élevées. L'architecture testée repose sur un mécanisme dit de "mixture d'experts à portes creuses" (sparsely gated MoE) : au lieu d'activer tous les paramètres du réseau à chaque inférence, seul un sous-ensemble d'experts spécialisés est sollicité selon le contexte. Les résultats sur robot réel sont nets : la politique MoE atteint le double de taux de succès dans la traversée de grands obstacles par rapport à une baseline MLP classique, à budget computationnel identique (même nombre de paramètres actifs à l'inférence). Pour obtenir des performances équivalentes avec un MLP dense, il faut augmenter sa taille totale au niveau du MoE complet, ce qui entraîne une hausse de 14,3 % du temps de calcul. L'intérêt de ce résultat tient moins aux performances brutes qu'à ce qu'il démontre structurellement : les gains architecturaux qui ont propulsé les grands modèles de langage (Mixtral, GPT-4 et consorts utilisent des variantes MoE) sont transférables aux politiques de contrôle robotique bas niveau. Cela valide une intuition croissante dans la communauté : la scalabilité des politiques de locomotion n'est pas uniquement une question de données ou de sim-to-real, mais aussi d'architecture. Pour les équipes travaillant sur des robots embarqués avec contraintes computationnelles, l'activation creuse offre un levier concret pour améliorer les performances sans alourdir les exigences matérielles. Le parkour quadrupède s'est imposé ces deux dernières années comme un benchmark exigeant pour la locomotion, avec des travaux notables issus de Berkeley, ETH Zurich et CMU sur des plateformes similaires (ANYmal, Spot, Go1/Go2). L'approche dominante jusqu'ici reposait sur des MLP séquentiels entraînés par reinforcement learning en simulation puis transférés sur le robot physique. Cette étude, dont le code est accessible en version anonymisée, ouvre une piste d'amélioration architecturale orthogonale aux efforts habituels sur les données ou les environnements de simulation. Les prochaines étapes naturelles concerneraient l'extension à des environnements plus complexes et l'évaluation du comportement des experts spécialisés pour mieux comprendre la décomposition fonctionnelle apprise.

RecherchePaper
1 source