Aller au contenu principal

Actualités robotique — page 49

4 740 articles au fil, du plus récent au plus ancien.

PearlVLA : raffinement progressif de plans d'action pour l'IA incarnée dans l'espace latent
2401arXiv cs.RO 

PearlVLA : raffinement progressif de plans d'action pour l'IA incarnée dans l'espace latent

Des chercheurs ont publié en juin 2026 PearlVLA (arXiv:2606.17924), un cadre VLA (Vision-Language-Action) conçu pour concilier faible latence d'exécution et qualité de planification. L'approche déplace le raisonnement dans l'espace latent d'un modèle VLM, évitant le recours aux chaînes textuelles ou aux sous-objectifs en pixels, deux stratégies courantes mais coûteuses en calcul. L'architecture sépare les représentations en une branche de grounding visuel fixe et une branche de plan latent itérative : à chaque cycle, une "world query" interroge un modèle de monde latent léger et gelé pour obtenir une observation future, utilisée ensuite pour affiner progressivement le plan. Après K cycles, le plan est décodé en parallèle en un "action chunk" pour l'exécution temps réel. L'entraînement repose sur un mécanisme RL baptisé "Causal Refinement-Grouped Process-Reward", qui optimise le raffinement via des récompenses issues d'horizons temporels simulés dans l'espace latent. Évalué sur le benchmark de simulation LIBERO, PearlVLA affiche des résultats à l'état de l'art parmi les méthodes existantes. Le compromis latence/planification est structurant pour le déploiement industriel des VLA. Les modèles à décodage direct restent réactifs mais peinent sur des tâches longue-horizon ; les approches délibératives via chain-of-thought améliorent la planification mais leur latence les rend incompatibles avec le contrôle temps réel. En confinant le raisonnement à l'espace latent, PearlVLA contourne ce dilemme sans coûts de génération textuelle. L'approche est conceptuellement proche des modèles de monde (DreaMer, TD-MPC2), ici appliqués aux VLA. Réserve importante : toutes les évaluations sont conduites en simulation sur LIBERO, sans résultats sur robot réel rapportés dans ce preprint, ce qui limite pour l'instant les conclusions sur la transférabilité sim-to-real. La course aux VLA s'est accélérée depuis 2024 avec π0 (Physical Intelligence), Octo, GR00T N2 (NVIDIA) et les modèles embarqués de Figure, Agility ou 1X. La compétition porte désormais sur deux axes : réduire la latence pour atteindre le contrôle temps réel, et améliorer la généralisation sans réentraînement sur de nouvelles tâches. PearlVLA s'inscrit dans cet effort académique collectif, sans affiliation commerciale identifiée dans le preprint. La prochaine étape naturelle serait une validation sur robot physique et des tests de transfert sim-to-real, qui conditionneront l'intérêt des intégrateurs industriels pour cette architecture.

IA physiqueOpinion
1 source
SimTO : un cadre d'optimisation topologique en deux étapes, piloté par simulation, pour pinces robotiques souples sur mesure
2402arXiv cs.RO 

SimTO : un cadre d'optimisation topologique en deux étapes, piloté par simulation, pour pinces robotiques souples sur mesure

Des chercheurs présentent SimTO, un cadre en deux étapes pour concevoir automatiquement des grippers souples sur-mesure, publié sur arXiv (2601.19098v2). Les grippers souples existants peinent à manipuler des objets à haute variabilité topologique: engrenages dentés sur lignes d'assemblage automobile, coraux aux excroissances fragiles, brocolis aux ramifications irrégulières. Face à ces géométries sans surface de contact "optimale" évidente, les designs généralistes risquent d'endommager la pièce ou d'échouer la prise. SimTO répond en deux phases: une simulation dynamique riche en contacts extrait automatiquement les cas de charge réalistes générés lors de la préhension, sans spécification manuelle; ces cas alimentent ensuite un algorithme d'optimisation topologique classique qui génère la morphologie finale du gripper. Les expériences physiques confirment que les grippers SimTO atteignent des forces de préhension supérieures aux designs généralistes conventionnels, avec un taux de succès élevé sur des positions variées et une bonne généralisation à des objets non vus durant l'entraînement. L'enjeu industriel réside dans l'automatisation d'un goulot de conception: adapter un gripper à une pièce complexe requiert aujourd'hui une expertise manuelle pour définir les forces de contact, un travail itératif et coûteux. SimTO supprime cette étape en déléguant la caractérisation des charges à la simulation. Pour un intégrateur en automobile ou en agroalimentaire, c'est une piste vers des outillages personnalisés sans expertise spécialisée à chaque nouveau composant. La généralisation aux objets non vus suggère que les grippers produits capturent des propriétés morphologiques larges plutôt que de sur-apprendre une géométrie précise. Nuance importante: les résultats sont entièrement en laboratoire; aucun déploiement industriel ni partenaire industriel ne sont mentionnés dans l'article. L'optimisation topologique est une méthode mature en ingénierie structurelle, qui génère des géométries minimisant la masse sous contraintes de rigidité. Son adaptation aux grippers souples était freinée par l'indétermination des forces de contact, par nature distribuées et dépendantes de la posture de la pièce. Ce travail s'inscrit dans la tendance sim-to-real qui traverse la robotique de manipulation: caractériser le problème physique en simulation avant de concevoir ou d'entraîner. Dans le paysage concurrentiel, les approches rivales incluent les méthodes d'apprentissage par renforcement pour le contrôle adaptatif, les grippers généralistes à morphologie universelle, et les travaux de co-design simulation-fabrication portés par des groupes comme le MIT CSAIL ou l'EPFL. Les prochaines étapes naturelles, non annoncées dans le preprint, seraient une validation sur lignes pilotes industrielles et une intégration dans un pipeline de fabrication additive.

RecherchePaper
1 source
Extraction sémantique guidée par LLM : peuplement automatique d'ontologies robotiques depuis des fichiers URDF
2403arXiv cs.RO 

Extraction sémantique guidée par LLM : peuplement automatique d'ontologies robotiques depuis des fichiers URDF

Des chercheurs ont publié fin juin 2026 sur arXiv (arXiv:2606.17073) une approche préliminaire pour automatiser la génération de représentations sémantiques de robots à partir de fichiers URDF (Unified Robot Description Format), le format standard décrivant la structure mécanique et cinématique d'un robot. Le problème ciblé est précis : les identifiants URDF sont souvent des étiquettes bas niveau ambiguës (noms de joints, liens, degrés de liberté) qui n'ont pas de sens conceptuel exploitable pour un système de raisonnement. Le pipeline proposé utilise des LLMs pour inférer les relations sémantiques en leur soumettant ces identifiants accompagnés de concepts issus d'une ontologie existante, garantissant ainsi que la classification produite reste alignée avec le modèle formel. Pour améliorer la fiabilité, les auteurs combinent un vote majoritaire sur plusieurs requêtes LLM avec une validation syntaxique et structurelle qui vérifie la conformité des sorties au schéma de l'ontologie cible. Les résultats présentés portent sur plusieurs descriptions de robots, sans que les modèles spécifiques ni les métriques quantitatives de précision ne soient détaillés dans l'abstract. L'intérêt pour les intégrateurs et les équipes de robotique cognitive est réel : la construction manuelle d'ontologies robotiques est aujourd'hui un goulot d'étranglement reconnu, coûteux en temps d'ingénierie expert. En automatisant ce pont entre la description physique d'un robot et sa représentation de connaissances structurée, cette approche pourrait accélérer le déploiement de systèmes capables de raisonnement explicable, condition souvent nécessaire en interaction humain-robot (HRI) dans des environnements industriels ou de service. La combinaison LLM-plus-vote-majoritaire-plus-validation formelle est une réponse pragmatique au problème de fiabilité des sorties LLM non contraintes, un compromis classique dans ce domaine. Ce travail s'inscrit dans un courant actif de la robotique cognitive qui cherche à connecter les représentations symboliques (ontologies OWL, Knowledge Graphs) aux descriptions bas niveau des systèmes embarqués, en réponse aux limites des approches purement neuronales pour l'explicabilité. Des approches concurrentes passent par des annotations manuelles enrichies ou des pipelines de semantic parsing plus traditionnels. Le papier est qualifié de "preliminary approach", signal clair qu'il s'agit d'un jalon de recherche et non d'un outil industrialisé : aucun code, benchmark standardisé, ni timeline de transfert applicatif ne sont mentionnés. Les prochaines étapes probables incluent une évaluation quantitative sur des ontologies robotiques de référence et des tests de passage à l'échelle sur des descriptions de robots complexes multi-DOF.

RecherchePaper
1 source
IA incarnée : le corps influence le comportement de roulade dans un modèle multimodal de nourrisson
2404arXiv cs.RO 

IA incarnée : le corps influence le comportement de roulade dans un modèle multimodal de nourrisson

Des chercheurs présentent dans un preprint arXiv (2606.17456v1, juin 2026) une étude computationnelle du retournement supino-prone, l'un des premiers jalons moteurs du développement infantile. L'agent utilisé, MIMo (Multimodal Infant Model), est un corps virtuel de nourrisson doté de proprioception et de sensation vestibulaire, deux modalités sensorielles essentielles au contrôle postural. Entraîné par apprentissage par renforcement, MIMo apprend à passer de la position dorsale à la position ventrale. Résultat notable : les comportements générés reproduisent spontanément les tendances développementales documentées chez les vrais nourrissons, notamment l'amélioration des performances et l'accélération du temps d'exécution avec l'âge simulé. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé; il s'agit d'une publication de recherche fondamentale. Ce travail apporte un argument empirique au débat sur le rôle de la morphologie corporelle dans l'apprentissage moteur : le corps n'est pas un substrat neutre pour l'algorithme, il en conditionne activement les solutions. Pour la robotique humanoïde, cela souligne pourquoi des agents physiquement réalistes produisent des comportements qualitativement différents de ceux obtenus sur des corps simplifiés. L'accent mis sur la proprioception et le vestibulaire rappelle également que la perception du mouvement interne reste sous-équipée dans de nombreux robots actuels, comparée aux capteurs extéroceptifs classiques (caméras, lidar). Le passage sim-to-real reste en revanche non évalué dans cette étude : les comportements matchent les données développementales humaines, mais aucune validation sur un robot physique n'est présentée. MIMo s'inscrit dans le courant de la robotique développementale, qui s'inspire de la biologie du développement pour concevoir des agents apprenants. Ce champ inclut notamment les travaux de Kuniyoshi (Université de Tokyo, années 2000-2010) sur les nourrissons musculo-squelettiques en simulation. Côté concurrents directs, des approches similaires émergent avec les simulateurs musculo-squelettiques MyoSuite (Meta) et MotorNet. L'enjeu à terme est de comprendre comment une IA incarnée peut générer spontanément des comportements moteurs plausibles à partir de contraintes physiques seules, une piste directement pertinente pour concevoir des robots adaptatifs dont les capacités émergent autant de leur corps que de leur entraînement.

RecherchePaper
1 source
Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée
2405TechNode 

Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée

Alibaba a publié mardi une suite robotique composée de trois modèles fondamentaux : Qwen-RobotNav, Qwen-RobotManip et Qwen-RobotWorld. Qwen-RobotNav étend les capacités vision-langage à la robotique mobile en unifiant quatre tâches au sein d'un même framework : suivi d'instructions, navigation orientée objectif, tracking de cible et conduite autonome. Qwen-RobotManip standardise l'espace état-action et représente le mouvement de l'effecteur terminal sous forme de poses incrémentielles dans le référentiel caméra, une approche conçue pour faciliter la généralisation multi-plateforme. Ce modèle a été entraîné sur plus de 38 100 heures de données entièrement open source. Qwen-RobotWorld, le troisième composant, fonctionne comme un world model généraliste : il prédit des états futurs physiquement cohérents via une interface en langage naturel, couvrant simultanément la navigation, la conduite et la manipulation depuis un seul modèle. L'approche modulaire mais unifiée est la proposition de valeur centrale de cette suite. Un world model unique opérant sur trois domaines d'action représente une architecture qui, si elle tient ses promesses en conditions réelles, réduirait significativement les coûts d'intégration pour les équipes robotiques industrielles. L'utilisation de données entièrement open source pour Qwen-RobotManip est un signal notable dans un secteur où les datasets propriétaires constituent souvent un avantage concurrentiel défensif : Alibaba positionne ainsi Qwen-Robot davantage comme une infrastructure partagée que comme un produit fermé. Réserve importante cependant : l'annonce ne s'accompagne d'aucun benchmark public (RLBench, LIBERO, CARLA) ni de déploiement physique documenté. Il s'agit d'une publication de modèles, pas d'un produit shipé. L'équipe Qwen d'Alibaba est reconnue pour ses modèles multimodaux (Qwen2.5-VL, QwQ), mais ce lancement marque son entrée explicite dans l'embodied AI. Le terrain est disputé : Google DeepMind pousse ses dérivés de RT-2, Physical Intelligence a publié Pi-0 et Pi-0.5, Hugging Face soutient l'initiative LeRobot, et NVIDIA propose GR00T N2 comme backbone pour les robots humanoïdes partenaires. Côté chinois, Unitree, Agibot et Zhiyuan Robot accélèrent eux aussi leurs pipelines VLA (vision-language-action). La prochaine étape pour Alibaba sera de démontrer des résultats sur des plateformes matérielles réelles ; faute de quoi, Qwen-Robot restera un framework académique parmi d'autres dans une course déjà très chargée.

IA physiqueOpinion
1 source
Alibaba lance Qwen-Robot, sa première famille de modèles d'IA incarnée
2406Pandaily 

Alibaba lance Qwen-Robot, sa première famille de modèles d'IA incarnée

Alibaba a publié mardi la suite Qwen-Robot, sa première famille de modèles d'IA incarnée, destinée à relier les grands modèles de langage à l'action robotique dans le monde physique. La suite comprend trois modèles : Qwen-RobotNav pour la navigation visuo-langagière, entraîné sur 15,6 millions d'échantillons en unifiant instruction following, navigation par cible et suivi d'objets ; Qwen-RobotManip pour la manipulation robotique via une architecture VLA (Visual Language Action) basée sur un backbone Qwen3.5-4B VL couplé à une tête de diffusion par flow matching, entraîné sur plus de 38 100 heures de données issues exclusivement de sources open source ; et Qwen-RobotWorld, un modèle de monde prédit des futurs physiquement cohérents pour la manipulation, la conduite et la navigation via une interface en langage naturel. La démonstration centrale met en scène un robot quadrupède Unitree Go2 sur hardware NVIDIA Jetson Thor, équipé d'une unique caméra basse résolution : sans cartographie préalable, il navigue dans un appartement inconnu en suivant des instructions verbales, avec une latence d'inférence de 196 millisecondes. Alibaba a également présenté Qwen-RobotClaw, un framework agent permettant aux modèles Qwen VLM d'appeler les outils Qwen-Robot pour gérer des tâches longues et la mémoire de contexte, et mis en open source Chat2Robot, une plateforme d'évaluation navigateur supportant Qwen-RobotManip sur 50 tâches via le dataset RoboTwin-Clean. Pour les intégrateurs et décideurs industriels, deux points méritent attention. L'entraînement de Qwen-RobotManip exclusivement sur des données open source est un choix architectural significatif : il abaisse les barrières de reproduction et contourne le verrou des données propriétaires qui bloque nombre d'acteurs du secteur. La latence de 196 ms sur Jetson Thor illustre la viabilité de l'inférence embarquée pour la navigation, même si cette performance a été mesurée dans un environnement contrôlé et non en production industrielle. La robustesse à grande échelle reste à démontrer : les vidéos présentées constituent une preuve de concept, pas un déploiement validé. L'architecture Qwen-RobotClaw adresserait un problème concret si elle tient ses promesses en production : la gestion de tâches multi-étapes sans reprogrammation manuelle, qui reste le verrou central de l'adoption robotique en environnements non structurés. Alibaba entre tardivement dans l'espace des modèles de fondation robotiques face à des acteurs déjà positionnés : Physical Intelligence (pi0, levée de 400 M$ en 2024), Figure AI (Figure 03, partenariat BMW), Google DeepMind et NVIDIA avec GR00T N2. En Chine, Unitree (fournisseur du Go2 de la démo), Zhiyuan Robot et Agibot développent leurs propres stacks logicielles embarquées. En Europe, Enchanted Tools et Pollen Robotics avancent sur des plateformes collaboratives, mais sans modèle VLA de cette envergure à ce stade. Les prochaines étapes annoncées incluent l'extension de Chat2Robot à de nouvelles plateformes et tâches robotiques, ainsi qu'une intégration commerciale potentielle via Alibaba Cloud.

Chine/AsieOpinion
1 source
MTC inaugure un nouveau Centre d'Expérience Robotique pour accélérer l'adoption de l'automatisation au Royaume-Uni
2407Robotics & Automation News 

MTC inaugure un nouveau Centre d'Expérience Robotique pour accélérer l'adoption de l'automatisation au Royaume-Uni

Le Manufacturing Technology Centre (MTC) britannique a inauguré un Robot Experience Centre (REC) sur son site d'Ansty Park à Coventry. L'installation, à vocation "vendor-neutral", permet aux industriels de tester et valider des solutions robotiques avant tout engagement d'investissement. Le MTC ne publie pas, dans ce communiqué partiel, de chiffres sur la superficie du site, le nombre de cellules disponibles ou les marques de robots intégrées, les détails opérationnels restent à confirmer. Pour les décideurs industriels et les intégrateurs, la proposition de valeur d'un tel centre est claire : réduire le risque perçu qui freine encore l'adoption de l'automatisation dans les PME manufacturières britanniques. L'approche "tester avant d'acheter" dans un environnement neutre répond à un blocage structurel documenté au Royaume-Uni, dont le taux de densité robotique reste inférieur à la moyenne européenne. Un espace multi-fournisseurs évite également le biais de prescription qu'un intégrateur unique induirait, ce qui peut accélérer la décision d'achat. Le MTC, centre de recherche appliquée fondé en 2011 et membre du réseau Catapult du gouvernement britannique, intervient dans un contexte où l'automatisation est présentée comme levier de productivité post-Brexit. Des initiatives similaires existent en Europe, notamment en Allemagne via les Fraunhofer-Institutes ou en France avec le Cetim, offrant des prestations comparables de validation en environnement industriel réel. Le MTC n'annonce pas de partenaires technologiques ni de calendrier de mise en service complète dans ce communiqué, ce qui en fait pour l'instant davantage une annonce d'ouverture qu'un déploiement opérationnel documenté.

IndustrielActu
1 source
ANYbotics ouvre un centre d'ingénierie et d'IA à Barcelone pour accélérer son expansion mondiale
2408Robotics & Automation News 

ANYbotics ouvre un centre d'ingénierie et d'IA à Barcelone pour accélérer son expansion mondiale

ANYbotics, entreprise suisse spécialisée dans l'inspection autonome par robots quadrupèdes, a inauguré un nouveau bureau à Barcelone, en Espagne, sur le campus DFactory Barcelona. Ce hub d'ingénierie et d'intelligence artificielle constitue la troisième implantation mondiale de la société, après son siège de Zurich et son bureau de San Francisco. L'ouverture répond à une demande croissante pour ses solutions d'inspection autonome dans les secteurs industriels à forte intensité d'actifs : pétrochimie, énergie, mines, et infrastructures critiques. L'annonce ne précise ni les effectifs prévus ni le calendrier de montée en puissance. L'expansion géographique vers Barcelone traduit une tendance de fond dans la robotique d'inspection : les éditeurs de solutions autonomes cherchent à concentrer des talents en IA et en robotique dans des écosystèmes tech émergents, moins concurrentiels sur le recrutement que Zurich ou San Francisco. Pour les intégrateurs et les décideurs industriels, la présence d'un hub R&D européen réduit les frictions sur les projets de déploiement en zone EMEA, notamment pour les sites Seveso ou les installations offshore soumises à des contraintes réglementaires locales. Cela signale aussi que le marché de l'inspection robotisée est entré dans une phase de scaling commercial, au-delà des pilotes. ANYbotics est connu pour son robot quadrupède ANYmal, développé à l'ETH Zurich et commercialisé depuis 2021, déployé notamment chez Equinor, BASF et Swisscom dans des environnements ATEX. La société fait face à une concurrence directe de Boston Dynamics (Spot), Exyn Technologies, et Ghost Robotics sur le segment quadrupède industriel, ainsi qu'à des acteurs drones comme Flyability sur certains cas d'usage confinés. DFactory Barcelona, campus dédié à l'industrie 4.0 géré par la ville de Barcelone, accueille également d'autres acteurs de la robotique et de la fabrication avancée, ce qui positionne ce hub comme un choix délibéré d'écosystème plutôt qu'une simple extension administrative.

FR/EU ecosystemeOpinion
1 source
Pegasus Tech Ventures lance un fonds de 60 millions de dollars pour les startups d'IA physique
2409The Robot Report 

Pegasus Tech Ventures lance un fonds de 60 millions de dollars pour les startups d'IA physique

Pegasus Tech Ventures, société de capital-risque basée à San Jose (Californie), a annoncé le lancement d'un fonds de capital-risque corporatif (CVC) de 10 milliards de yens, soit environ 60 millions de dollars, en partenariat avec CYBERDYNE Inc., entreprise japonaise fondée en 2004 et établie à Tsukuba. Pegasus en assure la gestion en tant que general partner, tandis que CYBERDYNE en est l'unique limited partner. Le fonds ciblera des startups développant des technologies dans les domaines de la robotique, de l'IA physique (physical AI), de la santé, de l'automatisation et des systèmes intelligents, avec une priorité pour les projets alignés sur la vision HCPS (human-cyber-physical space) défendue par CYBERDYNE, soit la fusion entre biologie humaine, intelligence artificielle, robotique et systèmes d'information. Pegasus, qui gère plus de 40 fonds et plus de 2 milliards de dollars d'actifs, a déjà investi dans plus de 300 startups, dont SpaceX, OpenAI, Anthropic, Airbnb et Coinbase. Ce fonds positionne CYBERDYNE comme un acteur offensif dans la course à l'IA incarnée, un segment qui attire des capitaux massifs depuis 2024. Pour les intégrateurs et décideurs industriels, le signal est clair : les fabricants de dispositifs d'assistance humaine misent désormais sur des écosystèmes de startups pour accélérer leur R&D, plutôt que de la conduire entièrement en interne. Le véhicule VCaaS (venture capital-as-a-service) de Pegasus donne à CYBERDYNE un accès structuré à Silicon Valley et aux écosystèmes d'innovation mondiaux, sans avoir à constituer une équipe d'investissement dédiée. Pour le secteur de la robotique de service et des exosquelettes, cela ouvre la porte à des co-développements entre un acteur cliniquement validé sur le marché médical japonais et des startups deeptech encore en phase early-stage. CYBERDYNE est surtout connue pour son exosquelette HAL (Hybrid Assistive Limb), un dispositif qui détecte les signaux bioélectriques de surface pour assister ou rééduquer les mouvements du porteur, déployé dans les secteurs médical, de la rééducation, du soutien au travail et de la réponse aux catastrophes. L'entreprise cherche à élargir son périmètre face aux défis démographiques japonais, notamment le vieillissement de la population et la pénurie de main-d'oeuvre. Sur le plan concurrentiel, CYBERDYNE évolue dans un espace où se positionnent également des acteurs comme Ekso Bionics, ReWalk ou Ottobock pour les exosquelettes médicaux, et où les grands noms de la robotique humanoïde (Figure, 1X, Agility Robotics, Boston Dynamics) empiètent progressivement sur les cas d'usage industriels et de soin. Le fonds ne précise pas de calendrier de déploiement ni de nombre de participations visées, ce qui limite pour l'instant la portée concrète de l'annonce.

BusinessOpinion
1 source
Eno, le robot humanoïde qui vise à devenir la machine polyvalente de chaque entreprise
2410Interesting Engineering 

Eno, le robot humanoïde qui vise à devenir la machine polyvalente de chaque entreprise

Genesis AI a présenté Eno, son premier robot à usage général, en juin 2026. La machine abandonne la forme humanoïde bipède au profit d'une base à roues surmontée d'une colonne télescopique ajustable en hauteur, capable de se replier en configuration compacte lors des phases d'inactivité. Ses mains robotiques reproduisent la morphologie et la fonction de mains humaines, afin de permettre l'utilisation d'outils standards dans des espaces déjà conçus pour des opérateurs humains. Son système de contrôle est GENE, le modèle de fondation robotique développé en interne, présenté comme capable de gérer la planification de tâches longues, l'adaptation au contexte et la mémorisation entre opérations. Un écran embarqué optionnel affiche en temps réel le raisonnement et les intentions du robot. Les premiers déploiements clients sont annoncés avant fin 2026, en fabrication, logistique et laboratoires, avec une extension ultérieure à l'hôtellerie, à la santé puis au grand public. Genesis AI a levé 105 millions de dollars en financement de démarrage, avec Eric Schmidt, ancien PDG de Google, parmi ses investisseurs déclarés. Le choix d'une base roulante plutôt que bipède représente un compromis délibéré : on sacrifie la polyvalence locomotrice pour la fiabilité mécanique dans des environnements industriels à sols plats et structurés, là où l'essentiel des déploiements initiaux est ciblé. Les mains humanoïdes répondent à un problème de compatibilité concret, puisque les postes de travail et les outils industriels sont dimensionnés pour des mains humaines. Sur le plan logiciel, GENE s'inscrit dans la catégorie des VLA (Vision-Language-Action models) avec l'ambition de piloter des tâches longues en autonomie, ce que le secteur cherche précisément à démontrer à grande échelle depuis deux ans avec des résultats encore inégaux. L'affichage du raisonnement en temps réel est une réponse directe aux exigences d'acceptabilité et de sécurité en environnement mixte humain-robot. Il faut cependant souligner qu'aucun chiffre de performance validé indépendamment n'accompagne l'annonce : payload, temps de cycle et taux de fiabilité sur lignes réelles restent inconnus. Eno est à ce stade une annonce, pas un produit en production. Genesis AI entre dans une course déjà bien engagée. Figure AI déploie ses robots Figure 02 sur les lignes de montage de BMW en Caroline du Nord ; Tesla vise la production de masse d'Optimus pour 2026 ; Agility Robotics teste Digit dans les entrepôts d'Amazon ; Physical Intelligence développe Pi-0 comme modèle de fondation généraliste ; NVIDIA fournit GR00T N2 et l'infrastructure de simulation Isaac Lab à l'ensemble de l'écosystème. Genesis AI se positionne avec une approche de co-conception : hardware, software et IA développés ensemble depuis l'origine plutôt qu'intégrés séquentiellement, argument central du discours de Zhou Xian, co-fondateur et PDG. Avec 105 millions de dollars de seed et un investisseur aussi visible qu'Eric Schmidt, la société dispose des ressources pour tenir ses délais. Les déploiements pilotes annoncés avant fin 2026 constitueront le premier test réel de cette promesse d'intégration systémique.

HumanoïdesOpinion
1 source
Vidéo : un robot DIY fixé au plafond ramasse jouets, vêtements et objets épars
2411Interesting Engineering 

Vidéo : un robot DIY fixé au plafond ramasse jouets, vêtements et objets épars

Nathaniel Nifong, un ingénieur indépendant, a publié les plans complets d'un robot domestique open source baptisé Stringman, conçu pour ramasser et trier automatiquement les objets épars au sol. Le système repose sur une architecture à câbles (cable-driven parallel robot) : quatre lignes haute résistance, ancrées aux quatre coins d'une pièce, suspendent un préhenseur à deux doigts équipé d'un mécanisme de poignet, qui se déplace dans l'espace aérien de la pièce et descend environ 50 centimètres sous son point d'accroche pour atteindre le sol, voire sous les meubles. Le robot s'appuie sur la plateforme LeRobot de Hugging Face et apprend par imitation : l'utilisateur pilote le système en télé-opération pour lui enseigner la saisie de différents types d'objets. Des marqueurs fiduciaires clip-on désignent les zones de dépôt (bac à jouets, panier à linge, poubelle). L'ensemble est disponible sous licence Apache 2.0 sur GitHub, et des kits prêts à assembler sont proposés en parallèle pour ceux qui ne souhaitent pas usiner les pièces eux-mêmes. L'intérêt principal de Stringman réside dans son rapport fonctionnalité/coût : avec seulement quatre moteurs, le système atteint une couverture spatiale qu'un bras robotique fixe ne peut pas égaler, sans les contraintes d'une plateforme mobile (batteries, navigation, coût unitaire). C'est la thèse centrale que défend Nifong : de nombreuses tâches domestiques répétitives peuvent être automatisées sans recourir aux robots humanoïdes, dont le coût et la complexité mécanique restent prohibitifs pour le grand public. L'architecture câble-driven évite rails, roues et membres articulés, tout en couvrant la totalité d'une pièce. Des algorithmes de compensation de balancement actif (swing-cancellation) stabilisent le préhenseur en déplacement, un défi classique des systèmes CDPR. Le projet inclut également un mode entièrement local pour le traitement vidéo et la télémétrie, répondant aux préoccupations de vie privée que soulèvent systématiquement les robots domestiques connectés. Stringman s'inscrit dans l'écosystème DIY qui s'est constitué autour de LeRobot depuis son lancement par Hugging Face en 2024, un framework qui a déjà fédéré des centaines de contributeurs autour de manipulateurs de table bas coût comme le SO-100 ou le Koch v1.1. Il se positionne dans un segment distinct : l'espace domestique vertical plutôt que l'établi ou l'atelier. Il n'existe pas encore de concurrent direct sur ce format résidentiel, bien que les grues CDPR soient bien documentées dans la littérature de robotique industrielle. Les limites actuelles sont réelles et assumées par le créateur : la vision machine nécessite encore des ajustements, les objets plats comme les livres restent difficiles à saisir de manière fiable, et les câbles descendent dans la pièce pendant le fonctionnement, ce qui peut gêner les habitants. Un kit commercial est en préparation, mais ni date de disponibilité ni prix n'ont été communiqués.

IA physiquePaper
1 source
Kawasaki Robotics dévoile sa plateforme d'IA physique RL030N à Automate
2412Robotics Business Review 

Kawasaki Robotics dévoile sa plateforme d'IA physique RL030N à Automate

Kawasaki Robotics dévoilera la semaine prochaine, lors du salon Automate 2026 à Chicago (McCormick Place, stand S-2201), sa nouvelle plateforme RL030N, un bras robotique à 8 degrés de liberté (DoF) conçu pour les applications d'IA physique. L'entreprise présentera également deux robots industriels inédits, le MXP360L dédié à la manutention lourde et le BA013L, ainsi que sa technologie d'inspection Pulseboard brevetée. Le RL030N se distingue des bras six axes conventionnels par un axe supplémentaire en configuration dite "plongeoir" ("diving board") : une extension supplémentaire qui permet d'atteindre des positions en espace confiné sans tomber en singularité, c'est-à-dire sans perdre le contrôle du couple cinématique inverse. Selon Paul Marcovecchio, directeur des industries générales chez Kawasaki Robotics (siège américain à Wixom, Michigan), cette articulation maintient également la pleine capacité de charge sur toute l'amplitude de mouvement, un compromis que les bras traditionnels étirent ne peuvent généralement pas tenir. La plateforme repose sur l'API temps réel ouverte KRNX de Kawasaki et supporte l'évitement d'obstacles, la planification de mouvement complexe et l'orchestration externe, c'est-à-dire le pilotage du robot par un superviseur logiciel tiers. L'intérêt industriel de la RL030N réside dans le pont qu'elle tente de construire entre les robots industriels fiables et les exigences de dextérité des nouveaux systèmes d'IA physique. Plusieurs startups ont développé des logiciels de planification de mouvement avancés, mais se heurtaient aux limites cinématiques des plateformes existantes ou à des latences incompatibles avec le contrôle temps réel. Kawasaki répond à cette demande en offrant un matériel pensé dès la conception pour être commandé par des orchestrateurs externes, ce qui réduit la friction d'intégration pour les éditeurs de VLA (Vision-Language-Action models) ou de systèmes de manipulation adaptative. La posture de Kawasaki est délibérément pragmatique : l'entreprise évite le discours "humanoid-first" et mise sur des robots industriels éprouvés reconvertis pour l'IA physique, un pari sur la robustesse plutôt que sur la rupture spectaculaire. Kawasaki Robotics opère dans l'automatisation industrielle depuis 1969, filiale de Kawasaki Heavy Industries, conglomérat japonais actif dans l'aéronautique, le ferroviaire et les véhicules récréatifs. Cette origine manufacture-first explique le discours centré sur les résultats concrets plutôt que sur les benchmarks de laboratoire. Sur un marché où Boston Dynamics, Agility Robotics, Figure ou 1X Technologies concentrent l'attention médiatique autour de l'humanoïde, Kawasaki choisit un positionnement différent : bras industriel augmenté, compatible physique AI, déployable immédiatement dans des lignes existantes. Automate 2026 sera le premier test public de la RL030N ; aucun calendrier de disponibilité commerciale ni tarif n'ont été communiqués à ce stade, ce qui en fait pour l'instant une annonce de salon plutôt qu'un produit disponible à la commande.

IA physiqueOpinion
1 source
Les données de prothèses de mains améliorent le contrôle fin des robots pour la manipulation précise
2413Interesting Engineering 

Les données de prothèses de mains améliorent le contrôle fin des robots pour la manipulation précise

ABB Robotics, division robotique du groupe suisse ABB, a annoncé un partenariat avec PSYONIC, une entreprise californienne spécialisée dans les prothèses bioniques, pour exploiter les données issues de prothèses de main réelles afin d'améliorer la dextérité des robots industriels. Le projet associe le bras collaboratif GoFa d'ABB, avec une charge utile de 12 kilogrammes, une portée de 1,62 mètre et une répétabilité de 0,02 mm, à la main prothétique Ability Hand de PSYONIC. Cet équipement bionique ferme sa prise en 200 millisecondes, gère 32 types de préhension dont 19 pré-programmés, dispose d'un retour tactile multi-points et d'une certification IP64. L'objectif déclaré : capturer les données de toucher et de mouvement générées par les utilisateurs humains de la prothèse pour entraîner des modèles robotiques capables de manipuler des objets fragiles, irréguliers ou variables. ABB avance que cette approche pourrait réduire jusqu'à 30 % le temps d'ingénierie consacré aux applications de manipulation, sans toutefois préciser dans quel contexte ni sur quelle base de mesure ce chiffre a été calculé. Ce partenariat s'attaque à un verrou technique reconnu dans l'automatisation industrielle : la dextérité fine. Contrairement aux méthodes d'entraînement classiques qui reposent sur la simulation, le projet utilise des données du monde réel issues d'un usage humain, ce qui présente un avantage théorique en termes de couverture des cas limites et de diversité des interactions physiques. Si l'approche se confirme à l'échelle, elle pourrait accélérer le déploiement de robots dans des lignes où la manipulation manuelle reste irremplaçable, notamment en assemblage électronique, en gestion de composants aérospatiaux ou en conditionnement pharmaceutique. ABB parle de son programme "Autonomous Versatile Robotics" (AVR), qui vise à doter les robots d'une capacité de raisonnement et d'adaptation sans reprogrammation manuelle constante. C'est là que la valeur réelle se situera, mais aucune démonstration industrielle concrète n'a encore été annoncée à ce stade. ABB Robotics est l'un des quatre grands intégrateurs robotiques mondiaux, aux côtés de KUKA, Fanuc et Yaskawa. Le GoFa a été lancé en 2021 pour concurrencer les cobots d'Universal Robots et de FANUC sur les tâches de collaboration humain-robot. PSYONIC, fondée en 2016 à Champaign (Illinois), s'est distinguée avec l'Ability Hand, une prothèse conçue pour être abordable et fonctionnelle, avec financement de la DARPA. Le transfert de savoir-faire prosthétique vers la robotique industrielle n'est pas sans précédent, mais reste rare à ce niveau de formalisation. Les secteurs ciblés incluent l'automobile, l'aérospatial, la logistique et les sciences du vivant. Le partenariat en est à la phase de recherche et développement conjointe, sans calendrier de productisation ni client pilote annoncé publiquement à ce jour.

IndustrielOpinion
1 source
Genesis AI lance Eno, son robot polyvalent
2414Robotics Business Review 

Genesis AI lance Eno, son robot polyvalent

Genesis AI a dévoilé le 16 juin 2026 Eno, son robot à usage général, accompagné de GENE, le modèle de fondation développé en interne pour piloter le système. Contrairement aux approches humanoïdes bipedaleset bipèdes dominantes dans le secteur, Eno repose sur une base roulante surmontée d'une colonne articulée dont la hauteur est ajustable en temps réel, permettant au robot de se replier pour le stockage ou d'étendre sa portée selon la tâche. Ses bras sont équipés de mains propriétaires à cinq doigts conçues pour manipuler des outils et objets calibrés pour des utilisateurs humains. Le robot intègre en option un écran affichant en temps réel l'état cognitif du système, c'est-à-dire les intentions et raisonnements en cours, un choix de design rare dans l'industrie. La société, basée à San Carlos en Californie et financée à hauteur de 105 millions de dollars en seed en 2025, prévoit de lancer la production et les premiers déploiements clients d'ici fin 2026, en ciblant en priorité les secteurs industriels (manufacturing, logistique, laboratoires), avant d'adresser l'hôtellerie, les hôpitaux, puis le grand public. L'annonce est notable non pas tant pour les performances revendiquées que pour le positionnement architectural choisi. En optant pour une base mobile sur roues plutôt que la locomotion bipedaleet bipède, Genesis AI fait le pari de la fiabilité opérationnelle sur des sols industriels plats plutôt que de la polyvalence locomotrice, ce qui réduit la complexité mécanique et le risque de chute tout en simplifiant l'intégration en entrepôt et en laboratoire. La transparence cognitive via l'écran intégré est un signal adressé aux opérateurs et intégrateurs, chez qui la confiance dans les décisions autonomes du robot reste un frein réel au déploiement. GENE est présenté comme un système capable de gérer des tâches longues et séquentielles en raisonnant sur le contexte, sans se limiter à des commandes isolées, ce qui correspond à la catégorie des VLA (Vision-Language-Action models) appliqués à la manipulation. Les affirmations de "précision au millimètre" et de "manipulation au niveau humain" restent à valider indépendamment : aucune métrique de benchmark externe n'est citée dans l'annonce. Genesis AI arrive sur un marché déjà très occupé. Figure AI (Figure 03), Physical Intelligence (Pi-0), Boston Dynamics (Atlas), Agility Robotics (Digit) et Tesla (Optimus Gen 3) sont déjà en phase de déploiement pilote ou de production limitée. Nvidia pousse GR00T N2 comme socle commun pour les VLA humanoïdes. Dans ce contexte, Eno se distingue par son format non humanoïde et son interface de transparence, deux paris qui tranchent avec la convergence du secteur vers le robot bipède anthropomorphe. La co-conception corps-cerveau revendiquée par Genesis, où le hardware et le modèle GENE auraient été développés conjointement dès l'origine, reste une tendance lourde que l'on retrouve chez 1X Technologies ou Apptronik. Les prochaines étapes annoncées restent vagues : "déploiements ciblés" fin 2026 sans noms de clients ni volumes. L'annonce est pour l'instant une présentation publique de concept, pas un produit en livraison.

IA physiqueOpinion
1 source
Built Robotics et Penn xLAB s'associent pour développer une IA physique dédiée à la construction
2415Robotics Business Review 

Built Robotics et Penn xLAB s'associent pour développer une IA physique dédiée à la construction

Built Robotics, spécialiste américain de l'automatisation des engins de chantier fondé en 2016, s'associe au Safe Autonomous Systems Lab (xLAB) de l'Université de Pennsylvanie pour développer des modèles d'IA physiques adaptés aux environnements de construction. Le partenariat repose sur le déploiement de petits robots mobiles équipés de suites de capteurs, chargés de collecter des données sur des chantiers actifs : postures corporelles atypiques, occultations, conditions d'éclairage dégradées, comportements humains imprévus. Ces cas limites viennent enrichir un jeu de données déjà conséquent : Built revendique plus de 50 000 heures d'opérations terrain, l'installation de plus de 3 gigawatts de panneaux solaires et une présence sur plus de 40 sites. Depuis son entrée sur le marché du solaire à grande échelle en 2023 avec le RPD 35 (Robotic Pile Driver, son robot de battage de pieux autonome), la société a accumulé des volumes de données opérationnelles dans certains des environnements industriels les plus contraignants du secteur. L'objectif déclaré est de construire un "world foundation model" pour la coexistence sûre entre machines autonomes et opérateurs humains sur site. L'enjeu est structurant pour l'industrie de la construction, l'un des secteurs les plus accidentogènes au monde et l'un des derniers à amorcer sa transition vers l'autonomie robotique à grande échelle. Le partenariat cible explicitement le "sim-to-real gap" : l'écart entre la performance validée en environnement contrôlé et la robustesse réelle sur chantier, avec des centaines d'ouvriers sur des sites pouvant s'étendre sur plusieurs milliers d'acres. Le modèle edge AI de détection de personnes développé en interne par Built sera affiné à partir de ces données d'edge cases, avec l'ambition d'atteindre une perception dite "surhumaine", capable de détecter des dangers transitoires qu'un opérateur humain pourrait manquer. Pour les intégrateurs et les décideurs industriels, ce travail représente un pas vers une certifiabilité effective des systèmes autonomes outdoor, domaine où les standards de sécurité restent embryonnaires. Built est par ailleurs membre de l'Association of Equipment Manufacturers (AEM) et siège au Futures Council de l'organisation, dont Erol Ahmed, VP communications de Built, assure la présidence. Built Robotics a été fondé par Noah Ready-Campbell, diplômé de Penn, ce qui explique en partie la fluidité du rapprochement avec xLAB, dirigé par Rahul Mangharam, professeur en ingénierie électrique et des systèmes. Sur le plan concurrentiel, le segment des robots de construction autonomes voit émerger plusieurs acteurs : Caterpillar et Komatsu investissent dans l'autonomie de leurs engins lourds, tandis que des startups comme Dusty Robotics (traçage au sol) ou Trimble (géolocalisation de chantier) avancent sur des niches complémentaires. En Europe, des initiatives restent plus discrètes sur ce front spécifique. La phase initiale du pilote de recherche porte sur le déploiement du modèle edge AI de Built sur des chantiers actifs avec cartographie haute fidélité, avant une montée en puissance vers un modèle de fondation plus généraliste dont les contours et la timeline publique n'ont pas encore été précisés.

IA physiqueOpinion
1 source
Daxiao Robot a levé des centaines de millions de dollars : son fondateur révèle les fractures de l'industrie de l'IA incarnée
241636Kr 

Daxiao Robot a levé des centaines de millions de dollars : son fondateur révèle les fractures de l'industrie de l'IA incarnée

ACE Robotics (大晓机器人), fondée en juillet 2025 par Wang Xiaogang, co-fondateur de SenseTime, a annoncé le 15 juin 2026 la clôture d'un tour Angel+ réunissant Dachen Caizhong, Shenzhen Capital Group, le Shanghai Science and Innovation Fund, Muxin Shares, Fosun Ruizheng et le Lingang New Area Fund, avec un réinvestissement de l'actionnaire historique SenseTime Guoxiang Capital. Le cumul de levées 2026 dépasse désormais plusieurs centaines de millions de dollars, classant ACE parmi les premières licornes de la robotique incarnée en Chine. La startup dévoile simultanément Kairos 3.0, son modèle monde (world model) dédié à l'intelligence incarnée, revendiquant le SOTA sur quatre benchmarks mondiaux d'embodied intelligence, et publie en open-source Kairos 3.0-4B, présenté comme la première version capable de piloter un robot directement depuis un périphérique embarqué (edge device) sans serveur distant. Le corpus d'entraînement atteint un million d'heures d'interactions humain-environnement, obtenu via une collecte centrée sur l'acteur humain en situation réelle, soit dix fois le volume produit par télé-opération traditionnelle. Les modules A1 équipent des chiens robots pour l'inspection de voirie à Shanghai (secteur Ouest Rive), ainsi que des robots opérant dans des hôtels, des magasins sans caissier et des entrepôts logistiques automatisés. La levée met en lumière une fracture structurelle de l'écosystème chinois : contrairement à Figure, Tesla Optimus ou Physical Intelligence (Pi-0), qui internalisent la boucle matériel-données-modèle pour accélérer l'itération, les acteurs locaux fonctionnent encore en silos. Wang Xiaogang l'admet explicitement : les standards de collecte de données restent fragmentés, les corpus directement exploitables pour l'entraînement de modèles incarnés sont rares, et les cycles d'itération matérielle sont trop longs pour rester synchronisés avec la cadence des modèles. La réponse d'ACE est pragmatique : s'ancrer dans des scénarios B2B contrôlés et reproductibles (logistique, inspection routière), y collecter des données réelles en boucle fermée via des partenaires intégrateurs -- dont Shanhui Robots, acteur du retail sans caissier issu de l'écosystème SenseTime -- et abaisser le coût de la solution au tiers de la moyenne sectorielle par l'effet d'échelle. Cette stratégie scene-first sert aussi à valider la thèse du world model face aux VLA (vision-language-action) : Wang soutient que seul un modèle capable de comprendre, générer et prédire simultanément peut atteindre une véritable émergence de l'intelligence incarnée. Wang Xiaogang, co-fondateur de SenseTime depuis 2014, a délibérément créé ACE en juillet 2025, après la première vague de startups incarnées, pour capitaliser sur les impasses avérées des VLA et éviter les gaspillages en données et en calcul accumulés par ses prédécesseurs. En Chine, la concurrence se structure autour de niches sectorielles : Qianjue Technology (spin-off de l'Université Tsinghua) cible l'hôtellerie et les services commerciaux, tandis que Tasishi Zhihang, fondée par Chen Yilun (ex-chef scientifique du département automobile de Huawei), se concentre sur l'assemblage de faisceaux de câbles industriels. La feuille de route d'ACE progresse en trois temps : inspection routière et chiens robots (déjà en production), entrepôts logistiques (déploiements en cours), puis la sphère domestique grand public. Wang reste prudent sur les délais : Kairos n'a pas encore atteint l'équivalent d'un GPT-3 pour les modèles monde, ce seuil d'émergence à partir duquel les paradigmes de recherche se stabilisent et les capacités commencent à généraliser à grande échelle.

Chine/AsieOpinion
1 source
Les prix des robots humanoïdes s'effondrent sous 10 000 RMB avec l'adoption massive
2417Pandaily 

Les prix des robots humanoïdes s'effondrent sous 10 000 RMB avec l'adoption massive

En mai 2026, le secteur de la robotique humanoïde a franchi un seuil que personne n'anticipait un an plus tôt : l'effondrement des prix à grande échelle sur le marché chinois. La start-up Bumi a lancé son robot éponyme à 9 998 RMB (environ 1 250 euros), soit moins de dix mille yuans. Dans le même élan, Unitree Robotics a ramené son modèle R1 à 29 900 RMB et son G1 à 85 000 RMB. Xingchen Intelligence propose son T1 à 89 900 RMB, tandis qu'Ubtech a commercialisé son U1 grand public à 128 000 RMB et écoulé près de 4 000 unités en dix jours de préventes. La rupture de prix est vertigineuse : il y a tout juste un an, l'Unitree H1 en version recherche s'achetait entre 300 000 et 800 000 RMB avec liste d'attente. Sur le marché secondaire, les prototypes d'ingénierie de 2025 s'échangent désormais entre 30 000 et 60 000 RMB, parfois en palettes à 50 000 RMB l'unité, et les tarifs de location journalière ont chuté d'un pic de 10 000 RMB en 2025 à 800 à 1 500 RMB aujourd'hui. Trois mécanismes expliquent cette compression tarifaire. Le premier est l'intégration supply chain : le teardown du G1 d'Unitree révèle que ses actionneurs rotatifs utilisent des moteurs synchrones à aimants permanents issus de la même filière que les véhicules électriques, des réducteurs à base de composants industriels standard, des caméras de profondeur Intel, un lidar DJI et des puces Rockchip. Le bill of materials total atteint 41 600 RMB (dont 27 500 RMB pour les seuls joints), ce qui laisse une marge brute supérieure à 40 % à 85 000 RMB. Le deuxième facteur est la substitution domestique : réducteurs, servosystèmes et contrôleurs, qui représentent plus de 70 % du coût d'un humanoïde, sont désormais produits à 75 à 90 % en Chine. L'Optimus de Tesla, construit sur la chaîne d'approvisionnement américaine, affiche un BOM de 131 000 dollars ; basculer vers des fournisseurs chinois fait tomber ce chiffre à 46 000 dollars, soit un avantage de coût de 3x. Le troisième levier est le déclassement délibéré des spécifications : les modèles sous 100 000 RMB sacrifient la robustesse industrielle extrême, limitent le payload bras unique à environ 2 kg et offrent une autonomie de 1 à 2 heures seulement, ce qui les exclut des lignes en production continue 24/7. Ces compromis sont assumés. L'objectif réel de cette stratégie de prix n'est pas la rentabilité immédiate, mais la constitution d'un pipeline de données d'entraînement à grande échelle. Le principal goulot d'étranglement de l'industrie humanoïde est aujourd'hui le volume de données réelles de haute qualité : seulement environ 500 000 heures sont disponibles au niveau mondial. En inondant le marché de terminaux à bas coût, les constructeurs chinois cherchent à accélérer massivement la collecte nécessaire à l'entraînement de leurs modèles de contrôle, là où leurs concurrents occidentaux comme Boston Dynamics, 1X ou Agility Robotics misent sur des robots industriels à haute spécification et des déploiements plus ciblés. La prochaine étape probable est le développement d'offres de leasing B2B vers les intégrateurs et les entrepôts logistiques, avec partage de données en contrepartie, transformant chaque robot vendu en noeud d'un réseau d'acquisition continu.

Chine/AsieOpinion
1 source
Alibaba se lance dans la robotique avec sa première suite de modèles d'IA pour robots
2418SCMP Tech 

Alibaba se lance dans la robotique avec sa première suite de modèles d'IA pour robots

Alibaba Group a dévoilé mardi le Qwen Robot Suite, sa première suite de modèles d'intelligence artificielle dédiée à la robotique. Développée par Tongyi Lab, l'unité de recherche IA du géant de Hangzhou, cette collection de modèles vise à doter les robots de capacités de perception, de raisonnement et d'interaction avec l'environnement physique, ce que le secteur désigne par le terme "embodied AI". La suite a déjà été engagée dans des phases de test pilote avec un cercle restreint de partenaires sélectionnés par Alibaba. Les métriques de performance restent à ce stade non communiquées publiquement, ce qui ne permet pas d'évaluer les capacités réelles par rapport aux annonces. L'entrée d'Alibaba dans l'embodied AI représente un signal fort pour l'industrie robotique : les grandes plateformes cloud et LLM cherchent désormais à étendre leur emprise vers le monde physique, transformant le marché des intégrateurs et des fabricants OEM. Pour les décideurs industriels, cela signifie potentiellement un accès à des couches d'IA robotique portées par une infrastructure cloud établie, avec la question ouverte du sim-to-real gap, qui reste le défi critique non résolu dans le déploiement à l'échelle des robots polyvalents. Alibaba s'inscrit dans une course mondiale déjà peuplée d'acteurs hétérogènes : Figure (Figure 03), Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Tesla (Optimus Gen 3) et 1X Technologies côté startups, auxquels s'ajoutent Huawei et Xiaomi côté géants technologiques chinois. Le Qwen Robot Suite s'appuie sur la famille de modèles Qwen, déjà bien implantée dans le paysage LLM mondial. Les prochaines étapes probables incluent un élargissement des pilotes industriels et une intégration avec l'écosystème cloud d'Alibaba (Alibaba Cloud / Aliyun).

Chine/AsieActu
1 source
PSYONIC s'associe à ABB Robotics pour introduire le toucher humain dans la dextérité des robots
2419Robotics Business Review 

PSYONIC s'associe à ABB Robotics pour introduire le toucher humain dans la dextérité des robots

ABB Robotics LLC et la startup californienne PSYONIC ont annoncé un partenariat visant à accélérer la manipulation dextère en robotique industrielle. Les deux entreprises combinent le bras collaboratif GoFa d'ABB, un robot force- et power-limited conçu pour travailler aux côtés des humains, avec l'Ability Hand de PSYONIC, une main prothétique à cinq doigts équipée de capteurs de pression, de retour vibrotactile et de mécaniques souples. Le principe central du projet: utiliser les données de mouvement, de contact et de force de préhension collectées sur les 300 patients prothétiques déjà équipés de l'Ability Hand pour entraîner des systèmes robotiques. La main est approuvée par la FDA, remboursée par Medicare aux États-Unis, et Meta en a été un acheteur précoce lors du lancement grand public. PSYONIC, fondée en 2015 à San Diego par le Dr Adeel Akhtar, vend désormais davantage côté robotique que côté médical, une inversion survenue en moins d'un an sous l'effet de l'essor du physical AI. L'enjeu n'est pas anodin: la manipulation manuelle reste l'un des verrous les plus résistants de l'automatisation industrielle. Les préhenseurs à ventouse ou à mâchoires parallèles imposent des changeurs d'outils, sources de délais, de pannes et de maintenance chronophage, notamment sur les lignes à fort mix et faible volume. Une main à cinq doigts avec retour tactile permet de saisir des objets déformables (textiles, emballages souples) et de travailler dans des cellules conçues autour du format humain, sans reconfiguration mécanique. La valeur ajoutée de PSYONIC réside dans la continuité matérielle: le même Ability Hand porté par un patient génère des données d'apprentissage directement transférables à un robot équipé du même effecteur, supprimant une partie du gap sim-to-real qui plombe encore beaucoup de pipelines d'entraînement VLA (vision-language-action). Selon la Fédération Internationale de Robotique, une meilleure intégration de la préhension et du numérique pourrait réduire le temps d'ingénierie de mise en oeuvre jusqu'à 30 %. ABB Robotics s'inscrit dans une trajectoire de transformation profonde: le groupe ABB a cédé sa division robotique à SoftBank pour 5,3 milliards de dollars en octobre 2025, avec pour feuille de route l'"Autonomous Versatile Robotics" (AVR), une vision de robots capables de percevoir, raisonner, se déplacer et manipuler avec précision dans des environnements dynamiques. Le partenariat avec PSYONIC s'intègre dans cette ambition de physical AI, en parallèle d'une course aux effecteurs dextres que se livrent aussi des acteurs comme Sanctuary AI, Dexterous et les équipes internes de Tesla (Optimus) ou Figure. Aucune date de commercialisation ni de déploiement pilote industriel n'a été communiquée: il s'agit pour l'instant d'une collaboration R&D entre les équipes techniques des deux entreprises, pas d'un produit expédié ni d'un déploiement terrain confirmé.

IndustrielOpinion
1 source
SoK : Sécurité et vie privée des robots à base de modèles fondation
2420arXiv cs.RO 

SoK : Sécurité et vie privée des robots à base de modèles fondation

Une équipe de chercheurs a publié sur arXiv (référence 2606.16788) un article de type "Systematization of Knowledge" (SoK) qui dresse un panorama structuré des risques de sécurité et de confidentialité introduits par les modèles de fondation dans les systèmes robotiques. Le travail systématise 96 études antérieures et propose un cadre d'analyse à quatre couches baptisé F-E-S-G : la couche Modèle de fondation (F), la couche Système incarné (Embodied system, E), la couche Écosystème de support (S), et la couche Impact de gouvernance (G). À chaque couche correspond une taxonomie fine qui encode, pour chaque étude analysée, la cible visée, le stade du cycle de vie, le mécanisme d'attaque ou de défense, le niveau d'accès système requis, et les effets observés. L'intérêt de ce travail réside moins dans les vulnérabilités individuelles qu'il recense que dans les "defense mismatches" qu'il met en évidence : les mécanismes de robustesse conçus pour les modèles de langage ou de vision en contexte purement numérique ne s'appliquent pas directement à des pipelines d'exécution incarnés. Quand un robot piloté par un modèle VLA (Vision-Language-Action) interprète une instruction en langage naturel pour saisir un objet, une attaque adversariale ou une injection de prompt ne produit plus une réponse textuelle erronée mais un mouvement physique potentiellement dangereux. Pour un intégrateur industriel ou un COO déployant des flottes humanoïdes, cette propagation du risque à travers les quatre couches constitue un angle mort opérationnel que les grilles d'évaluation actuelles ne capturent pas. Le genre "SoK" est une convention bien établie dans la communauté sécurité, notamment via la conférence IEEE S&P, et signale une tentative de structurer un champ de recherche fragmenté. Cette publication arrive à un moment de transition dans la robotique commerciale : après des années de démos contrôlées, plusieurs acteurs (Figure, Apptronik, Unitree côté américain, Wandercraft et Enchanted Tools côté européen) engagent des déploiements en environnement réel avec des VLAs comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'absence de cadre normatif unifié, que ni l'EU AI Act ni les standards ISO robotiques actuels ne couvrent explicitement, donne à cette méta-analyse une pertinence directe pour les équipes réglementaires et les organismes de certification appelés à évaluer ces systèmes hybrides IA-robotique.

RechercheOpinion
1 source
VLALeaks : attaques par inférence d'appartenance contre les modèles vision-langage-action
2421arXiv cs.RO 

VLALeaks : attaques par inférence d'appartenance contre les modèles vision-langage-action

Des chercheurs ont publié le 15 juin 2026 un article (arXiv:2606.15165) présentant VLALeaks, une méthode d'attaque par inférence d'appartenance (membership inference attack, MIA) ciblant spécifiquement les modèles Vision-Language-Action (VLA). Ces modèles, qui permettent le contrôle bout-en-bout d'un robot à partir d'instructions en langage naturel et d'entrées visuelles, sont au cœur des systèmes robotiques les plus récents, de Pi-0 (Physical Intelligence) à OpenVLA en passant par les variantes de RT-2. L'attaque repose sur une observation de divergences dans les mécanismes d'attention interne des VLA selon que l'exemple présenté appartient ou non aux données d'entraînement. Le pipeline proposé se décompose en deux étapes : extraction de caractéristiques d'appartenance, puis construction d'un modèle d'attaque supervisé. Les résultats sur plusieurs benchmarks VLA montrent des métriques élevées, notamment en AUC et en TPR à 1 % de taux de faux positifs (TPR@1%FPR), sans que les auteurs donnent les valeurs absolues dans le résumé disponible. L'enjeu est substantiel pour quiconque développe ou déploie des systèmes robotiques fondés sur des VLA. Les données de démonstration robotique sont coûteuses à collecter, téléopération, enregistrement de trajectoires, annotation, et constituent un actif industriel stratégique. Montrer qu'un adversaire peut déterminer, à partir du seul accès aux sorties du modèle, si une démonstration spécifique a servi à l'entraînement revient à exposer à la fois la propriété intellectuelle des intégrateurs et les données potentiellement personnelles des opérateurs ayant effectué les démonstrations. C'est la première étude systématique de ce type de vulnérabilité sur des VLA, un angle resté jusqu'ici largement ignoré alors que les MIA sont bien documentées pour les LLM et les modèles de vision. Les VLA ont émergé comme paradigme dominant dans la robotique généraliste depuis 2023, portés par des travaux comme RT-2 (Google DeepMind), Octo (Berkeley) et les modèles de Physical Intelligence. Leur adoption croissante dans des contextes industriels réels, où les données propriétaires d'entreprises comme Amazon Robotics, Boston Dynamics ou Exotec pourraient constituer le corpus d'entraînement, rend cette classe d'attaques particulièrement critique. Les prochaines étapes naturelles incluent l'évaluation de défenses (differential privacy, data augmentation, output perturbation) et l'extension des attaques à des architectures multimodales plus récentes. Les auteurs positionnent VLALeaks comme un outil de recherche pour construire des déploiements VLA sécurisés, mais la publication de la méthode en elle-même constitue aussi un signal d'alarme pour les équipes qui mutualisent des données de démonstration dans des pipelines de fine-tuning partagés.

RechercheOpinion
1 source
ATHENA : fonctions d'influence hétérogènes multi-tâches accélérées pour la curation de données robotiques
2422arXiv cs.RO 

ATHENA : fonctions d'influence hétérogènes multi-tâches accélérées pour la curation de données robotiques

Des chercheurs ont publié ATHENA (Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation), un framework de sélection de données de démonstration conçu pour le fine-tuning de modèles Vision-Language-Action (VLA) à l'échelle du milliard de paramètres. La méthode repose sur les fonctions d'influence, un outil statistique qui quantifie l'effet de chaque démonstration robotique sur la performance finale d'une tâche. Pour contourner le coût de calcul prohibitif de ces fonctions à grande échelle, ATHENA exploite la structure de Kronecker des gradients de couches linéaires et approxime l'inversion de la matrice hessienne dense via une approximation tronquée de rang r (Random Truncated Approximation), atteignant un gain de vitesse de 313,4x sur le calcul d'influence. Le framework a été évalué sur le benchmark de simulation RoboTwin 2.0 (9,34 heures de démonstrations) et sur des déploiements réels (6,90 heures, six tâches). En ne conservant que 50 % des données en simulation et 66,7 % en conditions réelles, ATHENA égale ou surpasse un fine-tuning entraîné sur l'intégralité du jeu de données. L'enjeu est directement opérationnel pour quiconque déploie des VLA multi-tâches en robotique industrielle ou de service. Le fine-tuning de modèles à un milliard de paramètres sur 50 tâches simultanées génère des coûts de collecte de données considérables ; réduire d'un tiers à moitié le volume nécessaire sans perte de performance change l'équation économique des pipelines d'imitation learning. ATHENA introduit également une notion d'influence globale et locale pour équilibrer la curation entre tâches hétérogènes, un problème rarement traité dans la littérature existante. Le fait que les gains tiennent sur du matériel réel, et pas uniquement en simulation, réduit le scepticisme habituel sur le sim-to-real gap dans ce type de contribution. Les fonctions d'influence sont un outil classique du machine learning (initialement popularisé pour le diagnostic de données d'entraînement dans les réseaux profonds), mais leur application à la robotique multi-tâches était jusqu'ici bloquée par la complexité computationnelle des modèles VLA modernes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA). ATHENA s'inscrit dans un effort plus large de la communauté pour rendre le fine-tuning de ces fondations robotiques accessible sans infrastructure de données massive. Aucun partenariat industriel ni timeline de commercialisation n'est mentionné dans cette publication arXiv préliminaire (arXiv:2606.16208) ; il s'agit d'une contribution académique, non d'un produit disponible. Les prochaines étapes probables incluent une validation sur des benchmarks plus larges et une intégration dans des pipelines de fine-tuning ouverts comme LeRobot (Hugging Face).

IA physiqueActu
1 source
Pilotage des politiques VLA autorégressives par intervention sur les tokens d'action
2423arXiv cs.RO 

Pilotage des politiques VLA autorégressives par intervention sur les tokens d'action

Une équipe de chercheurs a publié Token Steering (TS), une méthode permettant de piloter dynamiquement les trajectoires générées par des modèles de fondation robotiques de type VLA (vision-language-action autorégressif). Le principe : injecter des entrées utilisateur de faible dimension directement dans l'espace de représentation des tokens d'action du modèle, sans modifier l'architecture du modèle de langage visuel (VLM) sous-jacent. TS opère entièrement à l'inférence, sans réentraînement ni fine-tuning. Évalué sur deux tâches de manipulation domestique, fermeture d'un tiroir après placement d'objet, et permutation d'objets en contexte dynamique, le taux de succès passe respectivement de 10,0 % à 72,5 % et de 16,7 % à 93,8 %. Ces résultats sont issus de la préprint arXiv:2606.15021 et n'ont pas encore fait l'objet d'une révision par les pairs. L'intérêt opérationnel est direct : supprimer le besoin de réentraînement lève un verrou majeur pour le déploiement de robots de fondation en conditions réelles. Des intégrateurs peuvent adapter le comportement d'un VLA pré-entraîné à des variations de scénario sans coût de calcul additionnel significatif. Le mécanisme guide l'action sans l'écraser, ce qui préserve les priors de dextérité et de fluidité appris durant le pré-entraînement. C'est un avantage concret sur les approches classiques de surcharge par commande directe, qui dégradent souvent la qualité du mouvement. L'article évoque également des cas d'usage d'accessibilité pour des personnes à mobilité limitée, piste crédible vers une robotique d'assistance plus inclusive. Les politiques VLA constituent l'un des axes les plus actifs de la robotique actuelle : Physical Intelligence a commercialisé Pi-0, NVIDIA a présenté GR00T N2, et plusieurs groupes académiques développent des variantes d'OpenVLA. Token Steering s'inscrit dans une tendance plus large qui cherche à rendre ces politiques modulables sans réentraînement, direction que poursuit également Enchanted Tools sur le plan applicatif. La contribution reste pour l'heure académique : aucun déploiement industriel ni partenariat n'est annoncé, et le site projet (jasontchan.github.io/token-steering) présente des vidéos de démonstration en environnement contrôlé. Les prochaines étapes attendues sont une validation sur hardware hors laboratoire et une extension aux VLA de génération récente comme Pi-0 ou GR00T N2.

IA physiqueOpinion
1 source
FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle
2424arXiv cs.RO 

FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle

Des chercheurs ont publié FARM (Find Anything using Relational Spatial Memory), un système de mémoire spatiale pour robots capable de localiser des objets en temps réel via des requêtes en langage naturel exprimant des relations contextuelles, du type "la grande lampe sous la cible de fléchettes et à gauche de l'affiche". Le système construit une carte sémantique compacte à 5-10 Hz intégrant géométrie, descripteurs visuels-linguistiques et indices de point de vue. Évalué sur 44 000 requêtes couvrant 67 scènes intérieures et extérieures de 15 à 15 000 m², FARM améliore le Recall@5 de 164 % et le Recall@10 de 224 % par rapport aux méthodes existantes. Une étape de réordonnancement par VLM améliore encore l'Accuracy@1 de 35 %. Le système tourne en temps réel et a été validé en boucle fermée sur un robot quadrupède fonctionnant uniquement avec capteurs et calcul embarqués. L'enjeu dépasse la simple localisation d'objet: dans des entrepôts, habitations ou espaces industriels, un robot doit résoudre des ambiguïtés entre objets similaires via des relations contextuelles, ce que les mémoires de niveau objet seul ne permettent pas. FARM structure explicitement les contraintes spatiales par des prédicats relationnels plutôt qu'en les laissant implicites dans un raisonnement end-to-end sur des historiques de frames. Pour les intégrateurs et décideurs B2B, c'est une brique critique: les robots de service, de picking ou de logistique doivent être pilotables par instruction verbale sans expertise technique. Les gains à +224 % sur Recall@10 sont significatifs, bien que les conditions précises de benchmark, scènes contrôlées ou environnements non-stagés, ne soient pas détaillées dans la publication. Ce travail se situe à l'intersection de la cartographie sémantique 3D (systèmes type ConceptFusion ou OpenScene), des graphes de scène neuronaux et des VLM multimodaux. La combinaison mémoire open-vocabulary et prédicats relationnels explicites distingue FARM des approches end-to-end qui saturent dans les scènes denses. Sur le plan concurrentiel, des acteurs comme Boston Dynamics, Unitree et des laboratoires tels que Stanford ou CMU explorent des approches similaires pour la navigation sémantique. En Europe, des projets de robots de service ou d'assistance, dont des initiatives françaises liées à l'ANR ou des spin-offs comme Enchanted Tools travaillant sur l'interaction homme-robot, pourraient directement intégrer ce type de composant. La prochaine étape décisive sera de valider FARM dans des environnements dynamiques où les objets se déplacent et les relations spatiales évoluent en continu.

IA physiqueOpinion
1 source
Au-delà de l'anglais : les lacunes multilingues des modèles vision-langage-action (VLA)
2425arXiv cs.RO 

Au-delà de l'anglais : les lacunes multilingues des modèles vision-langage-action (VLA)

Une étude publiée le 19 juin 2026 sur arXiv (réf. 2606.15714) présente la première évaluation systématique des capacités multilingues des modèles VLA (Vision-Language-Action), cette famille d'architectures qui combine vision, langage et contrôle moteur pour produire des politiques robotiques généralisées. Les chercheurs ont construit des benchmarks multilingues en traduisant les instructions de jeux d'évaluation existants, puis ont testé plusieurs modèles VLA représentatifs sur un ensemble de tâches en environnement simulé. Le constat est net : les modèles entraînés principalement sur des instructions en anglais accusent une dégradation significative de leurs performances lorsqu'on les interroge dans d'autres langues, même quand le backbone LLM sous-jacent est nativement multilingue. Ce résultat a des implications directes pour quiconque envisage de déployer des robots à instructions verbales en dehors d'un contexte anglophone. Il invalide l'hypothèse commode selon laquelle les capacités multilingues d'un grand modèle de langage se transfèrent automatiquement au modèle VLA lors du fine-tuning sur données robotiques. L'analyse cross-linguale révèle deux sources d'échec distinctes : la compréhension de l'instruction d'une part, l'exécution de l'action d'autre part. Les auteurs identifient également des décalages de représentation interne provoqués par les instructions non-anglaises comme facteur structurel du gap, ce qui suggère que le problème est ancré dans la dynamique d'entraînement et pas seulement dans le vocabulaire. Les VLA généralisés ont connu une accélération notable depuis 2023 avec des modèles comme Pi-0 de Physical Intelligence, OpenVLA (Berkeley), ou encore GR00T N2 de NVIDIA, tous entraînés quasi-exclusivement sur des corpus anglophones. Pour combler le gap mis en évidence, les auteurs proposent une méthode de fine-tuning appelée Multilingual Principal Component Alignment (MPCA), qui utilise une analyse en composantes principales (ACP) pour aligner les représentations multilingues dans un sous-espace commun. Les résultats sont obtenus en simulation et n'ont pas encore été validés sur robot réel, ce qui constitue la limite principale à relativiser avant tout déploiement industriel. L'étude ouvre néanmoins une piste de travail concrète pour les équipes qui ciblent des marchés européens ou asiatiques.

RechercheOpinion
1 source
ExoTraj : une politique d'assistance pour exosquelette des membres inférieurs adaptée aux environnements complexes
2426arXiv cs.RO 

ExoTraj : une politique d'assistance pour exosquelette des membres inférieurs adaptée aux environnements complexes

Une équipe de chercheurs a publié le 20 juin 2026 sur arXiv (référence 2606.16876) ExoTraj, une politique unifiée de contrôle d'exosquelette pour membres inférieurs conçue pour fonctionner en environnements extérieurs complexes sans recourir à des systèmes de capture de mouvement coûteux. Le système repose sur deux briques techniques : un algorithme de flow matching rapide pour la prédiction de trajectoire multi-modale et multi-pas, et un contrôle prédictif par modèle (MPC) avec un nouvel objectif d'optimisation du couple articulaire. Lors des tests, ExoTraj réduit l'erreur de prédiction inter-sujets de 14,0 % en phase en ligne par rapport aux méthodes traditionnelles. Par rapport à la condition zéro couple (port passif), le système diminue le coût métabolique de 11,5 à 24,4 %, la fréquence cardiaque de 1,7 à 19,5 %, et les pics d'activation musculaire de 10,9 à 41,3 % selon les groupes musculaires. Ces chiffres, issus d'expériences en milieu contrôlé sur un nombre limité de sujets, restent à valider sur des cohortes plus larges. L'enjeu central qu'ExoTraj cherche à résoudre est la généralisabilité inter-sujets, un frein majeur à la commercialisation des exosquelettes d'assistance. La majorité des systèmes actuels requièrent une calibration individuelle lourde via mocap, ce qui les confine aux laboratoires ou aux environnements hospitaliers structurés. En combinant prédiction de trajectoire et optimisation de couple dans une politique unique déployable en temps réel, les auteurs visent à combler le fossé entre la recherche et les applications terrain : chantiers, logistique, rééducation ambulatoire. Le recours au flow matching, une technique générative plus rapide que la diffusion, constitue un choix technique notable pour la contrainte temps-réel. Ce travail s'inscrit dans une dynamique de recherche active sur les exosquelettes autonomes et adaptatifs. Côté industriel français, Wandercraft commercialise déjà le ATALANTE X pour la rééducation à la marche, et explore l'assistance grand public. À l'international, les acteurs Ekso Bionics, ReWalk et Sarcos proposent des solutions concurrentes, mais toutes dépendent encore fortement d'une configuration manuelle par praticien. ExoTraj étant un preprint non encore évalué par les pairs, il reste à voir si les gains métaboliques annoncés se maintiennent hors laboratoire, sur des terrains réellement non structurés et avec une population plus diverse. Les prochaines étapes attendues seraient une validation clinique ou terrain élargie, condition sine qua non pour une intégration industrielle sérieuse.

ExosquelettesPaper
1 source
Évaluation physiologique multimodale de l'interaction physique humain-robot à contacts intensifs en conditions variables
2427arXiv cs.RO 

Évaluation physiologique multimodale de l'interaction physique humain-robot à contacts intensifs en conditions variables

Une équipe de chercheurs a publié une étude empirique multimodale portant sur l'interaction physique humain-robot (pHRI) dans des conditions environnementales variables. Le protocole a soumis des opérateurs humains à 18 combinaisons distinctes de température, bruit acoustique et niveau d'éclairement, pendant l'exécution de tâches de traçage en contact direct avec un robot. Les chercheurs ont enregistré simultanément l'activité électrodermale (EDA), l'électromyographie de surface (sEMG), des données d'eye-tracking et des évaluations subjectives du confort. Résultat principal : la performance d'exécution est restée stable à travers toutes les conditions, mais la charge autonomique, mesurée par le niveau de conductance cutanée (SCL), a augmenté significativement avec la température. Les charges physique et cognitive, elles, n'ont pas varié de façon notable. Ces résultats mettent en évidence un mécanisme de compensation physiologique : les opérateurs maintiennent leur niveau de performance en augmentant leur effort biologique pour supprimer l'inconfort thermique, sans que cela ne soit visible dans les métriques de tâche classiques. C'est une distinction critique pour les intégrateurs et les concepteurs de systèmes cobotiques industriels : une évaluation centrée uniquement sur la performance (temps de cycle, taux d'erreur) peut masquer un coût opérateur réel, notamment en environnements chauds ou bruyants. Le fait que le confort perçu ne corrèle pas avec l'erreur de traçage ni le temps d'exécution invalide l'hypothèse courante que la performance se dégrade avec l'inconfort ressenti. Ce travail s'inscrit dans un courant de recherche croissant sur les architectures de contrôle "physiology-aware", où les signaux biologiques temps réel de l'opérateur alimentent la boucle de commande du robot pour adapter son comportement à l'état de charge de l'humain. La robotique collaborative industrielle, notamment dans des secteurs comme l'automobile ou la logistique, où les conditions thermiques et sonores sont variables, constitue le terrain d'application naturel. Des systèmes comme les cobots Universal Robots ou KUKA devront intégrer ce type de feedback pour répondre aux exigences ergonomiques croissantes des régulateurs européens. Les prochaines étapes identifiées par les auteurs incluent le développement de pipelines de traitement de signal adaptatifs capables d'exploiter ces métriques physiologiques en conditions non structurées.

RecherchePaper
1 source
ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation
2428arXiv cs.RO 

ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation

Une équipe de chercheurs a publié ATOM-Bench, un benchmark de terrain conçu pour évaluer les politiques de manipulation robotique sur deux dimensions distinctes : l'acquisition de compétences atomiques et la généralisation compositionnelle. Le dispositif décompose la manipulation sur table en "atomes moteurs" (précision de préhension, trajectoire du poignet, force de contact) et en "atomes d'instruction" (comptage, filtrage logique, ancrage sémantique). Il comprend 30 tâches atomiques et 24 tâches compositionnelles inédites, testées sur des configurations bras unique et bras double. Les auteurs ont collecté 3 000 démonstrations humaines pour le fine-tuning et effectué 2 700 rollouts physiques sur cinq politiques de manipulation représentatives. Les métriques introduites, l'Atomic Score (AS) et le Compositional Failure Share (CFS), permettent d'isoler la source d'un échec : exécution moteur défaillante, mauvais ancrage instruction, ou incapacité à recombiner des compétences acquises. Les résultats remettent en cause un postulat courant dans le secteur : que des politiques performantes sur des tâches atomiques généralisent naturellement à des tâches compositionnelles. Ce n'est pas le cas. Malgré des scores atomiques corrects sur l'ancrage d'instructions simples, les modèles testés échouent systématiquement sur le comptage, le filtrage logique et les atomes moteurs fins. Plus significatif encore, une bonne performance atomique ne prédit pas fiablement la réussite sur les tâches compositionnelles hors distribution. Pour un intégrateur ou un décideur industriel, cela signifie que les benchmarks classiques sur tâches démontrées surestiment largement la robustesse opérationnelle des politiques dites "généralistes". ATOM-Bench s'inscrit dans un contexte où les politiques VLA (Vision-Language-Action) comme pi0 (Physical Intelligence), Octo, ou OpenVLA sont présentées comme des fondations universelles pour le contrôle robotique. Ce cadre d'évaluation comble l'absence de protocole standardisé pour tester la composabilité des compétences, un angle mort identifié depuis les travaux sur l'abstraction hiérarchique en RL. Les données de démonstration et les rollouts d'évaluation sont publiés en open access pour permettre une comparaison reproductible entre équipes. La prochaine étape logique serait d'intégrer ATOM-Bench comme protocole de validation dans les pipelines de fine-tuning des acteurs du secteur, notamment pour qualifier des déploiements réels en environnement industriel non contrôlé.

RecherchePaper
1 source
ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels
2429arXiv cs.RO 

ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels

Des chercheurs ont publié ReMoBot (arXiv:2408.15919v4), un framework d'apprentissage par imitation à peu d'exemples conçu pour la manipulation mobile sur robots à vision égocentrique. Évalué sur un Boston Dynamics Spot, le système atteint des taux de succès de 70 % sur la tâche "Table Uncover" et 80 % sur "Gap Cover" en environnement réel, avec seulement 20 démonstrations par tâche. Plutôt que de distiller les démonstrations dans une politique paramétrique classique, ReMoBot adopte une stratégie de récupération : à l'inférence, il identifie dans une base de démonstrations d'experts les séquences les plus pertinentes via une combinaison de similarité d'état, d'alignement temporel des trajectoires et de cohérence des séquences d'actions, puis sélectionne directement les commandes motrices sans aucun entraînement supplémentaire. L'ensemble s'appuie sur des vision foundation models pour extraire des représentations robustes depuis la caméra embarquée du robot, en fonctionnement totalement training-free à l'exécution. L'approche retrieval-based présente deux avantages concrets pour les intégrateurs industriels. D'abord, le coût de collecte de données est drastiquement réduit : 20 démonstrations contre plusieurs centaines requises par les méthodes IL standard (ACT, Diffusion Policy), ce qui accélère le déploiement sur de nouvelles tâches ou variantes. Ensuite, l'absence d'entraînement à l'inférence supprime le risque de surapprentissage sur données insuffisantes, problème récurrent avec les objets déformables où la variabilité des états est élevée. ReMoBot surpasse deux baselines entraînées directement sur données réelles sans transfert sim-to-réel sur deux tâches sur trois. La tâche "Curtain Open" reste problématique, signalant que la manipulation d'objets hautement déformables sous occultations partielles constitue encore un verrou non résolu, y compris pour les approches retrieval. ReMoBot s'inscrit dans la tendance à exploiter les vision foundation models (de la famille DINOv2, CLIP, SAM) pour réduire la dépendance aux données propriétaires et améliorer la généralisation. Sur le Spot de Boston Dynamics, plateforme quadrupède commerciale, la manipulation mobile reste un défi structurel : le robot se déplace en même temps qu'il manipule, rendant l'observation égocentrique partielle et bruitée. Face aux VLA de grande taille comme pi-0 (Physical Intelligence) ou RT-2 (Google DeepMind), qui exigent des volumes de données considérables et une infrastructure d'entraînement lourde, ReMoBot se positionne dans le segment "data-efficient, training-free" particulièrement pertinent pour les intégrateurs ou PME industrielles sans capacité de collecte à grande échelle. La prochaine étape logique serait d'enrichir dynamiquement la base de démonstrations et de valider l'approche dans des environnements industriels hors laboratoire contrôlé.

RecherchePaper
1 source
Suivi binaire pour la QA spatiale et la navigation avec des modèles vision-langage ouverts
2430arXiv cs.RO 

Suivi binaire pour la QA spatiale et la navigation avec des modèles vision-langage ouverts

Une équipe de chercheurs publie sur arXiv (référence 2606.16902) un agent de localisation spatiale open-source baptisé BinTrack, conçu pour permettre à des robots de service de répondre à des questions du type « où puis-je trouver un pressing sur le chemin du retour ? » et de retourner une coordonnée métrique exploitable directement par les modules de navigation. Le système s'appuie sur un robot quadrupède réel déployé dans des rues publiques de Séoul pour constituer GangnamLoop, un nouveau benchmark multi-trajets en extérieur. BinTrack atteint une amélioration de précision allant jusqu'à 22,8 % par rapport aux autres implémentations open-source sur SpaceLocQA, le benchmark de référence du domaine, et égale les résultats des agents basés sur GPT-4o sur la catégorie « global », la plus difficile. Il offre par ailleurs un gain de vitesse d'inférence supérieur à 1,5x par rapport aux approches précédentes. L'intérêt principal de BinTrack pour les intégrateurs et les décideurs industriels tient à son architecture entièrement embarquée et déconnectée. Les approches existantes de Spatial Question Answering s'appuyaient sur des modèles fermés comme GPT-4o via des agents RAG (retrieval-augmented generation), ce qui implique une dépendance réseau, une latence de communication et des coûts d'API prohibitifs pour une flotte de robots en production. BinTrack remplace cela par une recherche binaire sur les segments de trajectoire entre deux repères spatiaux extraits de la requête, en exploitant l'ordre temporel du trajet. Ce faisant, le travail démontre qu'un modèle de vision-langage open-source peut rivaliser avec GPT-4o sur un benchmark spatial de référence, sans connexion cloud, une hypothèse que beaucoup dans le secteur considéraient non résolue à ce stade. GangnamLoop se distingue des benchmarks indoor habituels : il capture les mêmes lieux sous différentes conditions extérieures et croise le point de vue bas du robot quadrupède avec celui de son propriétaire humain, ce qui en fait un jeu de données plus réaliste pour la navigation piétonne en ville. La recherche spatiale embarquée reste un domaine peu exploré par rapport aux approches cloud-first ; des acteurs comme Boston Dynamics, Unitree ou les équipes robotique de Google DeepMind travaillent sur des problèmes connexes, mais rarement avec une contrainte d'inférence locale aussi explicite. Le code et les données de GangnamLoop sont disponibles publiquement sur GitHub, ce qui ouvre la voie à des évaluations indépendantes et à des intégrations dans des pipelines de navigation autonome en contexte réel.

RechercheOpinion
1 source
SimWeaver : transfert simulation-réel RGB sans entraînement pour la manipulation d'objets déformables
2431arXiv cs.RO 

SimWeaver : transfert simulation-réel RGB sans entraînement pour la manipulation d'objets déformables

Une équipe de recherche présente SimWeaver (arXiv:2606.15338), un système capable d'entraîner des politiques VLA (Vision-Language-Action) en environnement simulé uniquement, puis de les déployer directement sur un robot réel sans aucun affinage sur données réelles. Entraîné sur seulement 200 démonstrations simulées par tâche, SimWeaver atteint plus de 80% de succès par tâche et 91% de taux moyen sur cinq tâches de manipulation d'objets déformables incluant la manipulation de sacs plastique et la saisie de tissu de soie, sans téleopération ni calibration spécifique à chaque tâche. Sur la tâche de saisie de soie, la politique sim-entraînée atteint 100% de succès sous des variations visuelles importantes, là où les baselines entraînées sur données réelles chutent entre 9% et 70%. Le coût par trajectoire est réduit de deux ordres de grandeur par rapport aux approches requérant des données terrain. Ce résultat est notable parce que le sim-to-real pour objets déformables en entrée RGB brute est resté largement non résolu jusqu'ici. La physique des corps mous (tissus, sacs, fils) est notoirement difficile à simuler fidèlement, et l'écart simulation-réalité se traduit généralement par des politiques qui échouent dès le déploiement. SimWeaver contourne ce problème avec une augmentation photométrique tenant compte du pipeline ISP (Image Signal Processor) de la caméra, ce qui réduit le fossé visuel sans nécessiter de données réelles. Pour un intégrateur ou un COO industriel travaillant sur des lignes de conditionnement, de tri textile ou de logistique e-commerce, la réduction du coût de collecte de données et l'absence de recalibration par tâche représentent un levier économique concret. Le problème de la manipulation déformable concentre depuis plusieurs années une part croissante de la recherche en robotique, portée par des applications telles que la préparation de commandes en entrepôt (Exotec, HAI Robotics) ou l'assemblage textile. Les approches précédentes mobilisaient soit des capteurs de profondeur, soit d'importantes campagnes de téleopération pour construire des datasets réels. SimWeaver s'appuie sur quatre modules complémentaires : un simulateur physique calibré (SimWeaver-Sim), un générateur d'assets à partir d'une seule image (SimWeaver-Asset), un synthétiseur de trajectoires déterministe topologie-aware (SimWeaver-Syn) et un protocole de transfer sim-to-real avec augmentation ISP (SimWeaver-Real). Le code et un sous-ensemble d'assets représentatifs seront publiés en open source, ce qui positionne ce travail comme une infrastructure potentielle pour la communauté. Aucun partenaire industriel ni timeline de déploiement commercial n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit annoncé.

IA physiqueOpinion
1 source
La démonstration parfaite est un mauvais professeur : alignement robuste par segments de mouvement critiques
2432arXiv cs.RO 

La démonstration parfaite est un mauvais professeur : alignement robuste par segments de mouvement critiques

Une étude publiée sur arXiv le 16 juin 2026 (réf. 2606.15587) remet en cause un postulat fondamental de l'apprentissage par imitation en robotique : les démonstrations expertes fluides ne sont pas nécessairement les meilleures données d'entraînement. Pour des tâches de manipulation fine (insertion, empilement, alignement), les chercheurs montrent qu'un opérateur habile compresse précisément les instants décisifs de correction dans une fenêtre temporelle très courte, noyant la politique apprise sous des mouvements de transit redondants et lui fournissant trop peu de supervision aux moments où la précision est déterminante. Expérimentalement, une politique entraînée sur des démonstrations fluides standard plafonne à 50,0 % de taux de succès sur ces tâches. Ce résultat a des implications directes pour les équipes qui constituent des datasets pour entraîner des modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2. Deux axes de correction sont testés. Au niveau des données, ralentir la capture autour des moments d'alignement et rééchantillonner les segments critiques améliore les performances, mais l'essentiel du gain vient de l'élargissement de la couverture des états de récupération, pas d'un simple rééquilibrage des frames existantes. Au niveau de la représentation, les auteurs introduisent STAIR (Spatio-Temporal feature As an Interface for Robot learning), un module compact qui s'intercale entre le backbone vision-langage et le réseau d'action, en distillant les dynamiques de mouvement à court horizon déjà enregistrées dans chaque trajectoire. Entraîné uniquement sur des données fluides, STAIR atteint 62,2 % de succès, contre 64,4 % pour les démonstrations délibérément ralenties. Ces travaux s'inscrivent dans une vague de recherche qui remet en question la stratégie de collecte de données pour l'imitation learning, notamment dans le sillage des politiques de diffusion (Diffusion Policy, ACT) et des architectures VLA à grande échelle. L'idée que "plus de données expertes = meilleure politique" est directement challengée : la learnability machine peut diverger de l'efficacité humaine. La prochaine étape logique est de valider STAIR sur des tâches de contact plus complexes (vis, connecteurs électroniques) et sur des robots physiques déployés en dehors de l'environnement de laboratoire, ce que le papier ne montre pas encore. À surveiller lors des soumissions de conférences de fin 2026 (CoRL, ICRA).

RechercheOpinion
1 source
X-Tokenizer : tokenizer d'actions multimodal pour le pré-entraînement VLA
2433arXiv cs.RO 

X-Tokenizer : tokenizer d'actions multimodal pour le pré-entraînement VLA

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.14752) les résultats de X-Tokenizer, une architecture légère de type encodeur-SRQ-décodeur conçue pour améliorer la couche d'interface entre le raisonnement visio-linguistique et le contrôle moteur continu des bras robotiques. Le système introduit une technique appelée Semantic Residual Quantization (SRQ), une variante asymétrique de la quantification vectorielle résiduelle classique : le premier niveau est entraîné via un mécanisme de Masked Action Modeling (MAM) pour former un "langage d'actions" discret capturant l'intention de mouvement à gros grain, tandis que les niveaux suivants restent orientés reconstruction pour préserver les détails fins. X-Tokenizer a été pré-entraîné sur 2,4 millions de trajectoires, soit 2,0 milliards de frames d'actions, couvrant des bras robotiques d'embodiments variés. Une fois gelé, il se branche comme signal de supervision dans un VLA hybride discret-continu. Les résultats rapportés sur RoboTwin 2.0 et sur des benchmarks réels montrent des performances de premier rang en agrégat, avec +13,5 % de grounding multimodal et +8,25 points sur les tâches long-horizon par rapport au tokenizer FAST, référence actuelle du domaine. L'enjeu central est ce qu'on appelle le "demo-to-deployment gap" dans les modèles Vision-Language-Action : des VLA comme pi-0, GR00T N2 ou OpenVLA apprennent à raisonner en langage naturel mais peinent à traduire ce raisonnement en commandes motrices précises et stables. Les tokenizers d'action existants se contentent de comprimer les trajectoires pour les reconstruire fidèlement, sans ancrer les codes discrets dans la sémantique du backbone visio-linguistique. Ce que démontre X-Tokenizer, c'est qu'il est possible de faire des tokens d'action des objets sémantiquement cohérents avec le reste du modèle, en ajoutant un alignement contrastif vers l'espace de représentation d'un modèle fondationnel et une prédiction de features visio-linguistiques sur la frame suivante. L'impact pour les intégrateurs et les chercheurs est direct : un tokenizer partagé, gelé et interchangeable entre embodiments réduit le coût de fine-tuning par robot tout en améliorant la robustesse sur les tâches multi-étapes. Du côté du contexte compétitif, la tokenisation d'actions est devenue un verrou clé dans la course aux VLA généralistes depuis 2024. FAST (Fourier Action Sequence Tokenizer, DeepMind) s'est imposé comme baseline de référence en représentation fréquentielle des trajectoires. Des approches comme ACT (Action Chunking with Transformers) ou GROOT ont montré des gains sur des tâches courtes, mais les tâches longues restent difficiles faute de supervision sémantique cohérente. X-Tokenizer se positionne explicitement comme une alternative à FAST sur ce point précis. À noter que les gains annoncés (+13,5 %, +8,25) sont mesurés sur des benchmarks spécifiques et sur une sélection de tâches ; la généralisation à des environnements industriels non structurés reste à démontrer. Aucune timeline de déploiement ni partenaire industriel n'est mentionné dans le papier, ce qui situe ce travail clairement dans la phase recherche, non dans celle du produit expédié.

IA physiqueOpinion
1 source
Optimisation bayésienne pour l'apprentissage du MPC non linéaire dans la navigation d'agents autonomes
2434arXiv cs.RO 

Optimisation bayésienne pour l'apprentissage du MPC non linéaire dans la navigation d'agents autonomes

Des chercheurs ont publié le 17 juin 2026 (arXiv:2606.14763) un framework de navigation autonome temps-réel combinant planification réactive, représentation d'occupation gaussienne par LiDAR et contrôle prédictif non-linéaire (MPC). À chaque cycle de contrôle, le système construit une carte d'occupation gaussienne à partir des données LiDAR, génère une trajectoire sans collision via algorithme A*, puis la fait suivre par un MPC formulé avec CasADi/IPOPT intégrant une barrière obstacle à sigmoïde lisse. Le tuning des paramètres du contrôleur est réalisé hors-ligne par optimisation bayésienne via Tree-structured Parzen Estimators (TPE), complétée d'un surrogate Gaussian Process pour analyser la sensibilité paramétrique. Déployé sur le quadrupède Unitree Go2, le système atteint un taux de succès de navigation de 90,0 % en conditions réelles et une amélioration moyenne de 38,9 % sur les métriques composites en simulation, sans retuning supplémentaire entre sim et hardware. Le résultat le plus significatif pour le secteur est la validation du transfert sim-to-real sans post-tuning sur hardware : les paramètres identifiés en Gazebo tiennent sur le robot physique à performances comparables. C'est un point non trivial pour les équipes d'intégration robotique, où la divergence simulation/réalité reste un goulot d'étranglement majeur. L'approche "map-free" (sans cartographie préalable) combinée à un MPC réactif positionne ce framework pour des environnements dynamiques non-structurés, là où les planificateurs à carte globale échouent. La nature robot-agnostique de l'architecture élargit le périmètre d'application au-delà du quadrupède testé. Ce travail s'inscrit dans un mouvement de recherche plus large visant à rendre le MPC praticable sur des plateformes embarquées à ressources limitées, en externalisant le coût computationnel du tuning vers une phase offline. Les concurrents directs incluent les approches RL-for-MPC (apprentissage de politiques qui paramètrent le contrôleur) et les méthodes de navigation end-to-end par réseau de neurones, mais ces dernières offrent moins de garanties de sécurité formelles. Le Unitree Go2, plateforme open-source à ~2 700 USD, est devenu un banc de test standard dans la communauté académique. Les suites naturelles incluent l'extension à des dynamiques multi-agents et le test sur plateformes à roues ou bras manipulateurs.

RecherchePaper
1 source
ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde
2435arXiv cs.RO 

ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (2606.16542) une méthode baptisée ADAPT (Analytical Disturbance-Aware Policy Training), destinée à améliorer la robustesse locomotrice des robots humanoïdes soumis à des perturbations externes. Le système a été validé sur un Unitree G1 dans trois scénarios représentatifs : poussées au niveau du torse, perturbations en posture statique, et charges asymétriques appliquées aux mains. Dans chaque cas, ADAPT surpasse une politique de référence basée uniquement sur la proprioception (capteurs internes articulaires), avec un meilleur suivi de vitesse et une meilleure stabilité, y compris face à des perturbations hors distribution, c'est-à-dire non rencontrées lors de l'entraînement. La méthode n'exige aucun capteur de force/couple externe : elle s'appuie uniquement sur la dynamique interne du robot pour estimer en ligne les résidus de force et de couple appliqués au corps entier. L'intérêt technique d'ADAPT tient à son observateur de perturbations analytique, fondé sur la physique du corps rigide plutôt que sur un réseau de neurones ou une large randomisation de domaine. Les approches existantes présentent chacune un défaut structurel : la randomisation de domaine dégrade la précision, les objectifs de force spécifiques à une tâche limitent la transférabilité, et les estimateurs appris depuis l'historique de mouvement peinent hors distribution. ADAPT contourne ces compromis en fournissant à la politique un signal d'entrée explicite et physiquement fondé sur les forces et couples perturbateurs estimés, ce qui lui permet de se généraliser à des scénarios jamais vus. Un bénéfice secondaire notable : en pénalisant les perturbations inférées au niveau des articulations inférieures, le système favorise une locomotion plus légère, réduisant les impacts au sol, ce qui peut prolonger la durée de vie mécanique et améliorer la discrétion sonore en milieu de travail. Le Unitree G1 est une plateforme humanoïde commerciale abordable, largement utilisée dans la recherche sur la locomotion apprise, ce qui confère à ces résultats une portée pratique directe. Ce travail s'inscrit dans une tendance plus large où les laboratoires cherchent à combler le fossé sim-to-real sans ajouter de capteurs coûteux, une contrainte forte pour les déploiements industriels à grande échelle. Côté concurrence, des approches similaires ont été explorées par des équipes travaillant sur Boston Dynamics Atlas, Agility Robotics Digit et les humanoïdes Figure et 1X, mais souvent avec des capteurs de force dédiés. ADAPT représente une direction sensorless qui, si elle se confirme sur d'autres plateformes, pourrait simplifier l'intégration matérielle. L'article étant un preprint arXiv non encore évalué par les pairs, la reproductibilité reste à confirmer indépendamment, et les conditions exactes des expériences (vitesses testées, amplitude des poussées) ne sont pas précisées dans le résumé disponible.

IA physiquePaper
1 source
IVRA : améliorer les relations entre tokens visuels pour la politique d'action des robots grâce à un guidage sans entraînement
2436arXiv cs.RO 

IVRA : améliorer les relations entre tokens visuels pour la politique d'action des robots grâce à un guidage sans entraînement

Les modèles Vision-Language-Action (VLA) souffrent d'un défaut structurel bien documenté : en aplatissant les patches d'image en une séquence 1D de tokens, ils perdent les repères spatiaux 2D nécessaires à la manipulation précise d'objets. Des chercheurs ont publié sur arXiv (référence 2601.16207v2) IVRA, une méthode d'inférence légère et sans réentraînement qui corrige ce problème en exploitant des signaux d'affinité déjà présents dans l'encodeur visuel natif du modèle. Ces signaux sont injectés sélectivement dans une couche du modèle de langage où résident les caractéristiques au niveau des instances, réalignant les interactions entre tokens visuels et préservant mieux la structure géométrique sans modifier aucun paramètre. Appliqué à trois architectures distinctes, LLaRA, OpenVLA et FLOWER, IVRA a été évalué sur les benchmarks VIMA (manipulation 2D) et LIBERO (manipulation 3D), ainsi que sur des tâches en environnement physique réel. Sur VIMA en régime de faibles données, il améliore le taux de succès moyen de +4,2 % par rapport à la baseline LLaRA. Sur LIBERO 3D, les gains restent cohérents même proches de la saturation (96,3 % vers 97,1 %). L'intérêt industriel est direct : un intégrateur qui a déjà déployé un VLA peut appliquer IVRA à l'inférence sans réentraînement, sans capteur supplémentaire, sans encodeur externe. C'est un avantage immédiat en time-to-value pour des systèmes en production. Le fait que la méthode fonctionne même à 96,3 % de baseline suggère qu'elle améliore la précision géométrique locale plutôt que la compréhension globale de scène, précisément le point de défaillance des VLA sur des tâches de manipulation fine (saisie d'objets proches, tri par forme, assemblage). Pour la recherche, IVRA valide l'hypothèse que les encodeurs visuels embarqués contiennent des informations spatiales latentes exploitables sans supervision supplémentaire, une direction "training-free adapter" qui mérite davantage d'exploration. La perte de structure spatiale dans les VLA est connue depuis les premières publications sur RT-2 (Google DeepMind, 2023) et OpenVLA (Berkeley/Stanford, 2024). Les réponses habituelles consistent à modifier l'architecture ou à ajouter des flux de données supplémentaires (depth, point clouds), augmentant la complexité de déploiement. Physical Intelligence avec pi-0 et NVIDIA avec GR00T N2 misent sur des architectures propriétaires plus lourdes ; IVRA propose une correction orthogonale applicable sur des modèles ouverts, en compétition directe avec les méthodes de spatial token resampling et d'attention guidée comme RoboFlamingo. L'étape suivante logique serait une validation sur des benchmarks plus exigeants (RLBench, BridgeData v2) et sur des manipulateurs industriels à 6 DOF ou plus en conditions réelles, là où la précision spatiale est critique.

IA physiqueOpinion
1 source
Pilotage de politique d'inférence par vision et toucher
2437arXiv cs.RO 

Pilotage de politique d'inférence par vision et toucher

Des chercheurs ont publié sur arXiv (réf. 2606.14981, juin 2026) ViTaL, un framework de pilotage à l'inférence combinant vision et toucher pour affiner les politiques de manipulation robotique. Le principe : plutôt que de ré-entraîner un modèle génératif pré-entraîné, ViTaL intervient au moment de l'exécution en vérifiant et corrigeant les séquences d'actions candidates avant qu'elles ne soient jouées. Le système repose sur une optimisation bi-niveaux, un niveau haut visuel qui sélectionne le comportement global à longue portée, et un niveau bas tactile qui édite en diffusion la séquence retenue pour satisfaire les contraintes de contact locales. Un monde latent visuo-tactile appris permet d'évaluer des récompenses tactiles futures via un verifieur conditionné en texte, sans avoir besoin de capteur physique au moment de la prédiction. Sur trois tâches réelles de manipulation à contact riche (assemblage, insertion, dépose sous contrainte), ViTaL améliore le taux de succès global de 51 % par rapport à la politique de base, dépasse les approches unimodales (vision seule) d'au moins 33 %, et surpasse la fusion multimodale naïve d'au moins 20 %. Ces résultats pèsent dans un débat central de la robotique de manipulation : la vision seule suffit-elle à piloter des robots en environnement de contact ? ViTaL répond non, et quantifie l'écart. Pour les intégrateurs et les équipes R&D travaillant sur l'assemblage industriel ou la manipulation d'objets déformables, la démonstration que l'information tactile peut être injectée à l'inférence sans retraining complet est directement exploitable, elle ouvre une voie vers des politiques génériques adaptables à de nouveaux contextes de contact via du "steering" léger. L'édition par diffusion guidée par le toucher est particulièrement notable : elle permet de préserver le comportement global appris tout en rectifiant les micro-interactions, ce qui réduit le risque de régression comportementale souvent observé lors du fine-tuning. ViTaL s'inscrit dans la vague des approches "inference-time compute" appliquées à la robotique, popularisées par les travaux sur les VLA (Vision-Language-Action models) et les politiques de diffusion de type π0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'idée de vérifier les actions à l'exécution plutôt qu'au train-time est également explorée par des équipes comme Covariant et Figure AI, mais sans capteurs tactiles intégrés dans la boucle de correction. La spécificité de ViTaL est de traiter le retour tactile comme une source de supervision temporelle courte portée, complémentaire à la vision longue portée. L'article reste un preprint et les tâches testées sont de complexité modérée ; une validation sur des scénarios industriels réels (tolérance sub-millimétrique, variabilité de pièces) sera nécessaire pour confirmer la généralisation.

IA physiqueOpinion
1 source
QPILOTS : pilotage efficace par fonction Q à l'inférence pour les politiques de flux
2438arXiv cs.RO 

QPILOTS : pilotage efficace par fonction Q à l'inférence pour les politiques de flux

Des chercheurs publient QPILOTS (arXiv:2606.14801, juin 2026), une méthode permettant d'optimiser à l'inférence les politiques de diffusion et de flow-matching sans modifier leurs poids. Le problème central : appliquer l'apprentissage par renforcement basé sur la différence temporelle (TD-RL) à ces générateurs d'actions multi-étapes provoque des instabilités numériques lors du backpropagation à travers la chaîne de débruitage. QPILOTS laisse la politique originale intacte et l'oriente à chaque étape de débruitage via le gradient d'un critique de valeur Q. L'astuce clé : plutôt que d'évaluer le critique sur l'action intermédiaire bruitée (où ses prédictions sont peu fiables), la méthode projette cet état vers une estimation de l'action finale propre, puis calcule le gradient à ce point stable. Deux variantes sont proposées : QPILOTS-U utilise une approximation rapide en point unique, QPILOTS-M tire des échantillons postérieurs différentiables via un réseau auxiliaire appris. Sur un benchmark standard offline-to-online RL couvrant 50 tâches, QPILOTS atteint 90 % de taux de succès moyen, meilleure performance agrégée du comparatif. Appliquée à un modèle fondation Vision-Language-Action (VLA) pré-entraîné et gelé, la méthode surpasse ou égale les approches concurrentes sur six tâches de manipulation en simulation. L'enjeu est concret pour quiconque développe des politiques de manipulation basées sur la diffusion. Les solutions actuelles face au problème de gradient imposent chacune un compromis lourd : abandonner l'information de gradient, distiller la politique en un acteur one-step moins expressif, ou relancer un cycle de fine-tuning à chaque amélioration du critique. QPILOTS propose une quatrième voie compatible avec les modèles fondation gelés, ce qui le rend particulièrement pertinent dans un secteur où Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA) sont déployés comme bases pré-entraînées. Pouvoir piloter ces modèles via RL sans re-entraînement réduit drastiquement le coût d'adaptation à de nouvelles tâches, et apporte un argument concret au débat sur le "sim-to-real gap" des VLAs : le steering à l'inférence pourrait suffire là où le fine-tuning est prohibitif. QPILOTS s'inscrit dans la lignée des travaux sur les Diffusion Policies (Chi et al., 2023, Columbia) et des méthodes comme DDPO qui cherchent à coupler RL et processus de débruitage. Le terrain concurrent inclut les approches de distillation (simplifiantes) et les méthodes de reward-guided sampling déjà appliquées aux VLAs. À noter : cet article reste un preprint en simulation uniquement, sans validation sur hardware réel ni annonce de déploiement industriel. La robustesse des résultats à 90 % sur 50 tâches est encourageante, mais l'évaluation se limite à des environnements simulés, et les performances en conditions réelles, notamment la latence induite par l'étape de projection à chaque débruitage, restent à démontrer.

IA physiqueOpinion
1 source
Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif
2439arXiv cs.RO 

Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif

Des chercheurs ont proposé un modèle de dynamique contextuel fondé sur les équations différentielles ordinaires neuronales (Neural ODE) pour améliorer le contrôle de robots opérant dans des environnements incertains et variables. Le travail, déposé en juin 2026 sur arXiv (référence 2606.15469), cible les perturbations que les contrôleurs classiques peinent à absorber: variations des conditions de contact, effets aérodynamiques et perturbations externes imprévues. La méthode repose sur une procédure d'entraînement en deux phases: le modèle inspecte l'historique des états et des actions du robot pour inférer les facteurs environnementaux courants, sans capteurs dédiés supplémentaires. La compatibilité avec le MPC (Model Predictive Control) est intégrée dès la conception. Les validations portent sur trois plateformes distinctes: un drone quadrirotor en simulation, un robot sphérique Sphero BOLT et un bras manipulateur industriel Fanuc, ces deux derniers testés en conditions réelles. L'enjeu central est la dérive de modèle lors du déploiement: un robot calibré en laboratoire voit ses performances se dégrader dès que l'environnement change, que ce soit un sol différent, une charge variable ou des turbulences. Par rapport aux approches récurrentes classiques (LSTM, GRU), les Neural ODE présentent un avantage structurel: elles modélisent la dynamique en temps continu, ce qui améliore la cohérence physique et simplifie l'interface avec les solveurs MPC. L'inférence du contexte depuis le seul historique actions-états, sans instrumentation additionnelle, réduit la barrière d'intégration pour les industriels. Le test sur un Fanuc, bras omniprésent en production manufacturière, ancre les résultats dans une réalité opérationnelle tangible. Point de réserve: l'article est un preprint et l'abstract ne publie aucune métrique chiffrée de performance, ce qui rend l'évaluation indépendante difficile à ce stade. Les Neural ODE ont été introduites en 2018 par Chen et al. (NeurIPS) comme alternative aux réseaux récurrents pour modéliser des systèmes dynamiques continus. Leur application au contrôle robotique adaptatif répond à un obstacle persistant du secteur: le sim-to-real gap, qui fragilise la fiabilité des systèmes autonomes hors conditions contrôlées. Les approches concurrentes comprennent les processus gaussiens (GP) pour l'adaptation en ligne, les algorithmes méta-apprenants (MAML, PEARL) et l'identification de systèmes en temps réel. Ce travail se distingue par l'inférence contextuelle implicite, couplée nativement au MPC plutôt qu'ajoutée en couche. Le code source est ouvert sur GitHub et des démonstrations vidéo sont accessibles. La prochaine étape logique serait une validation sur des tâches de manipulation à charge variable ou un déploiement en environnement industriel non contrôlé.

RecherchePaper
1 source
Apprentissage de correspondances fines par perception croisée pour l'estimation de pose 6D à vocabulaire ouvert
2440arXiv cs.RO 

Apprentissage de correspondances fines par perception croisée pour l'estimation de pose 6D à vocabulaire ouvert

Des chercheurs ont publié sur arXiv (arXiv:2601.13565, janvier 2026) un framework baptisé FiCoP (Fine-grained Correspondence Pose Estimation) pour l'estimation de pose 6D en vocabulaire ouvert, soit la capacité d'un robot à localiser et orienter dans l'espace des objets arbitraires et inconnus guidé uniquement par du langage naturel. L'approche repose sur deux modules complémentaires : un module CPGP (Cross-Perspective Global Perception) qui fusionne des vues duales de l'objet pour établir un consensus structurel via raisonnement contextuel et injection sémantique texte-guidée, et un Patch Correlation Predictor (PCP) qui génère une carte d'association bloc-à-bloc servant de filtre spatial pour forcer une correspondance fine et robuste au bruit de fond. Sur les benchmarks REAL275 et Toyota-Light, FiCoP améliore le taux de rappel moyen de 8,0 % et 6,1 % respectivement par rapport à l'état de l'art. Le code sera rendu public sur GitHub (zjjqinyu/FiCoP). Le problème central que FiCoP résout est la confusion entre l'objet cible et les distracteurs de fond lors du matching global non contraint, défaut structurel des approches existantes qui tentent d'associer des features d'ancrage à l'intégralité de l'image requête. En passant à une correspondance par patches spatialement contrainte, après isolation préalable de la région d'intérêt via un disentanglement objet-centrique, FiCoP réduit l'ambiguité sans sacrifier la généralisation à des objets inconnus. Pour les intégrateurs et les équipes de manipulation industrielle, cela ouvre la voie à des systèmes de pick-and-place pilotés par description textuelle, sans pipeline d'entraînement objet-spécifique, gain significatif pour les applications à haute variété de SKUs. FiCoP s'inscrit dans la famille des méthodes de correspondance 2D-3D sans modèle CAD, en compétition directe avec GigaPose, FoundPose ou les pipelines VLA intégrant la perception 3D en aval. Les benchmarks utilisés, REAL275 et Toyota-Light, restent des environnements de table contrôlés, ce qui laisse entière la question du sim-to-real gap pour un déploiement industriel réel. À noter : les résultats ne sont pas comparés aux datasets adversariaux du BOP Challenge 2024, ce qui tempère la portée des gains annoncés. La mise à disposition du code devrait permettre une validation communautaire rapide sur des configurations plus adversariales.

RecherchePaper
1 source
OSDAG : planification en ligne pour une collaboration multi-robots efficace
2441arXiv cs.RO 

OSDAG : planification en ligne pour une collaboration multi-robots efficace

Des chercheurs ont publié le 18 juin 2026 sur arXiv (réf. 2606.15255) un framework appelé OSDAG, conçu pour coordonner des flottes de robots hétérogènes sur des tâches longues et complexes en combinant raisonnement par grand modèle de langage (LLM) et ordonnancement en ligne par graphe orienté acyclique (DAG). Le principe central : le LLM n'est invoqué qu'une seule fois, à la réception d'une instruction en langage naturel, pour décomposer la tâche en un graphe annoté de dépendances. Un ordonnanceur léger prend ensuite le relais en temps réel pour affecter à chaque robot disponible les sous-tâches dont les prérequis sont satisfaits. Les expériences portent sur cinq scénarios de référence, incluant des validations en simulation et sur des systèmes réels de manipulation à deux bras. Les résultats annoncés sont un gain de raisonnement de 5 à 15 fois par rapport aux approches conversationnelles, et une réduction du makespan (temps total d'exécution de la flotte) allant jusqu'à 38 % face aux baselines séquentielles, avec des taux de succès restant comparables. L'intérêt architectural est réel pour les intégrateurs de systèmes multi-robots : l'approche résout deux goulots d'étranglement identifiés dans les méthodes LLM existantes. Le premier est la latence cumulée des appels LLM répétés à chaque étape d'exécution, qui empire linéairement avec le nombre d'agents. Le second est l'ordonnancement pré-engagé hors ligne, qui force les robots à attendre leurs prédécesseurs même quand des tâches indépendantes sont disponibles. En encodant à la fois les contraintes de précédence et les contraintes de ressources dans le DAG, OSDAG expose tout le parallélisme exploitable sans sacrifier la correction du plan. Sur des lignes d'assemblage ou des entrepôts logistiques, cette distinction entre "planifier une fois" et "ordonnancer en continu" peut transformer la densité d'utilisation d'une flotte. OSDAG s'inscrit dans une vague de travaux cherchant à rendre les LLM opérationnels pour la robotique collaborative, aux côtés de frameworks comme SayPlan, RoCo ou les approches VLA (Vision-Language-Action). Ces méthodes souffrent généralement du dialogue-loop problem : chaque décision remonte au modèle, ce qui devient prohibitif à l'échelle. OSDAG adopte une architecture de séparation stricte planification/exécution, plus proche des moteurs de workflow industriels (type BPMN) que des agents conversationnels. Les auteurs valident sur des bras manipulateurs duaux, un environnement contrôlé, mais l'extension à des flottes AMR en entrepôt ou à des cellules de production réelles reste à démontrer. Le code et les ressources sont accessibles sur le site du projet (thanhnguyencanh.github.io/LLM_DAG4MultiRobot). Aucun partenariat industriel ni timeline de déploiement n'est mentionné : il s'agit d'une contribution de recherche, pas d'un produit.

RecherchePaper
1 source
APEX : exécution adaptative de politiques pour la manipulation de précision
2442arXiv cs.RO 

APEX : exécution adaptative de politiques pour la manipulation de précision

Une équipe de chercheurs a publié sur arXiv (référence 2606.16504) un framework baptisé APEX, Adaptive Policy Execution, conçu pour combler le fossé d'exécution qui dégrade les performances des robots manipulateurs pilotés par des politiques d'imitation. Dans les benchmarks rapportés, APEX réduit l'erreur de suivi induite par le contrôleur de 41,2 % sur la relecture de démonstrations, et améliore le taux de succès en manipulation de 4,8 à 25,8 points de pourcentage selon la classe de politique testée, visuomoteur ou VLA (Vision-Language-Action). Ces résultats couvrent quatre familles de politiques distinctes, ce qui constitue une base de comparaison plus large que la plupart des papiers du genre. Le problème que APEX adresse est structurel dans le domaine : les politiques d'imitation modernes génèrent des références d'action de haut niveau (positions cibles, trajectoires) que des contrôleurs bas niveau exécutent ensuite. Or ces politiques sont entraînées sans modéliser la dynamique du contrôleur sous-jacent, ce qui crée un écart systématique entre les actions commandées et les actions réalisées, un problème particulièrement critique pour les tâches de manipulation de précision (assemblage, insertion, saisie fine). Les approches existantes nécessitaient soit de modifier l'architecture de la politique pré-entraînée, soit de reprogrammer le contrôleur bas niveau. APEX se positionne comme une couche intermédiaire plug-and-play, traitant la politique et le contrôleur comme des boîtes noires inaccessibles. Il reconstruit une référence dynamiquement faisable à partir des sorties de la politique, puis s'adapte en temps réel via le feedback d'état bas niveau. Les auteurs fournissent une garantie formelle de convergence, ce qui est notable dans un champ souvent dominé par des résultats empiriques sans fondement théorique. Le contexte est celui d'une course intense au déploiement des VLA dans des environnements industriels réels : des modèles comme pi0 (Physical Intelligence), OpenVLA ou RT-2 (Google DeepMind) affichent des résultats impressionnants en simulation ou en laboratoire, mais peinent à translater leurs performances sur des robots physiques en raison précisément de ce sim-to-real gap d'exécution. APEX s'inscrit dans une tendance émergente, sans toucher aux poids du modèle, améliorer l'exécution physique, qui concurrence les approches de fine-tuning sur robot réel. La publication ne mentionne pas de partenaires industriels ni de timeline de déploiement ; il s'agit d'une contribution de recherche, pas d'un produit annoncé. L'enjeu pour les intégrateurs est direct : si le framework tient ses promesses à plus grande échelle, il pourrait devenir un composant standard entre n'importe quelle politique foundation et n'importe quel bras robot commercial, sans nécessiter d'accès au code source de l'un ou de l'autre.

IA physiqueOpinion
1 source
Récupération guidée par renforcement et fusion souple pour l'imitation multimodale robuste aux modalités manquantes
2443arXiv cs.RO 

Récupération guidée par renforcement et fusion souple pour l'imitation multimodale robuste aux modalités manquantes

Des chercheurs présentent RL4IL, une méthode d'apprentissage par imitation guidée par renforcement qui s'attaque à un problème concret du déploiement robotique : la défaillance de capteurs en cours d'opération. Publiée en préprint sur arXiv (2606.15514), l'approche sélectionne dynamiquement les démonstrations d'experts les plus pertinentes depuis une bibliothèque d'entraînement, plutôt que d'entraîner un réseau de politique classique. Une politique RL entraînée via Proximal Policy Optimisation (PPO) sur des ensembles de candidats générés par recherche en largeur (BFS) classe ces démonstrations, et une tête de fusion par cross-attention agrège leurs signaux d'action pour produire la prédiction finale. Lorsqu'une modalité est absente à l'inférence, caméra obstruée, flux langage interrompu, une politique RL dédiée par modalité identifie des démonstrations "donneuses" dans la bibliothèque, et une tête d'imputation reconstruit l'embedding manquant par cross-attention sur les meilleures correspondances, sans aucun réentraînement du système. Évaluée sur trois suites du benchmark LIBERO, RL4IL surpasse les méthodes d'apprentissage par imitation de l'état de l'art dans les conditions de perte de capteurs. Ce résultat adresse une hypothèse fragile qui traverse l'ensemble des architectures VLA (Vision-Language-Action) actuelles : la disponibilité permanente de toutes les entrées sensorielles. En conditions réelles, une caméra peut être occultée par un objet, un module langage peut tomber hors ligne, un capteur de profondeur peut saturer. La capacité à inférer sans réentraînement est particulièrement notable pour les intégrateurs industriels : redéployer un modèle en production à chaque nouvelle configuration de panne est prohibitif. RL4IL découple la robustesse à la perte de modalité du coût d'apprentissage, ce qui représente un levier opérationnel concret, à nuancer cependant par l'absence, dans le papier, de tests sur des robots physiques réels. L'apprentissage par imitation fondé sur la récupération de démonstrations (retrieval-based IL) est une direction active depuis les travaux sur VINN et les approches kNN pour la robotique. Les architectures VLA dominantes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) supposent toutes des capteurs intègres. RL4IL s'inscrit dans une veine de recherche visant à rendre ces systèmes tolérants aux pannes sans modifier leur entraînement initial. Le code est disponible publiquement sur GitHub. Les prochaines étapes naturelles incluent une validation sur manipulateurs physiques et l'extension à des bibliothèques de démonstrations à grande échelle, deux conditions nécessaires pour crédibiliser le passage au déploiement réel.

RecherchePaper
1 source
SAPS : autonomie partagée pour orienter la politique en combinant téléopération et VLA pré-entraîné
2444arXiv cs.RO 

SAPS : autonomie partagée pour orienter la politique en combinant téléopération et VLA pré-entraîné

SAPS (Shared Autonomy for Policy Steering, arXiv:2606.15568) est un framework qui combine en temps réel les commandes d'un opérateur humain avec les actions d'un modèle Vision-Language-Action (VLA) préentraîné, au niveau de l'action elle-même. Sans réentraînement, sans modèle auxiliaire, sans modification architecturale, SAPS introduit trois stratégies d'arbitrage dont une basée sur la similarité cosinus: cet indice mesure l'accord géométrique entre la commande humaine et celle du modèle pour distribuer le contrôle de façon dynamique. Testé sur les benchmarks de simulation LIBERO, LIBERO-PRO et CALVIN, et sur du matériel réel, le framework améliore le taux de succès des tâches jusqu'à 82 % par rapport à l'exécution autonome seule, réduit les interventions humaines par rapport à la télé-opération pure, et raccourcit les temps de complétion dans les deux cas. Ce résultat touche au défaut structurel des VLA généralistes: leur fragilité face aux perturbations hors-distribution, qu'il s'agisse d'un objet déplacé de quelques centimètres ou d'une scène atypique. SAPS n'exige pas de modifier le modèle existant, ce qui est l'argument commercial central pour un intégrateur industriel: le framework se greffe indifféremment sur Pi-0, GR00T N2, OpenVLA ou tout autre VLA disponible. La réduction de charge cognitive par rapport à la télé-opération pure est également significative pour des applications d'assistance aux personnes à mobilité réduite et pour la collecte de données d'imitation, où chaque heure d'opérateur est coûteuse. Les métriques présentées sont issues d'un preprint non relu par des pairs, et les vidéos de démonstration réelles restent à évaluer avec prudence. L'autonomie partagée est un champ établi, mais son application agnostique au modèle au niveau action sur des VLA modernes est une voie distincte des approches concurrentes. Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et HuggingFace (LeRobot) misent sur la robustification des politiques par distillation et augmentation de données; SAPS propose une couche d'intervention humaine plug-and-play plutôt qu'un meilleur modèle. Le preprint n'annonce ni déploiement industriel ni partenariat commercial. Les extensions naturelles visent les plateformes humanoïdes (Figure 03, Unitree G1) et un usage dans des boucles de fine-tuning continu. Aucun acteur français ou européen n'est impliqué dans ce travail.

RechercheOpinion
1 source
TopoRetarget : retargeting préservant les interactions pour la manipulation dextérique
2445arXiv cs.RO 

TopoRetarget : retargeting préservant les interactions pour la manipulation dextérique

Des chercheurs ont publié TopoRetarget, un framework de retargeting cinématique préservant les interactions pour l'apprentissage de la manipulation dextère par renforcement (RL). L'objectif est de réutiliser des démonstrations humaines main-objet comme références de mouvement pour entraîner des politiques RL sur des mains robotiques, sans dégrader la qualité des contacts critiques. La méthode construit un graphe d'interaction sparse sur les keypoints de la main et de l'objet, puis optimise une déformation laplacienne pondérée par la distance, combinée à des contraintes de cohérence directionnelle, de cinématique articulaire et de gestion des pénétrations. Sur le dataset ContactPose, TopoRetarget surpasse l'ensemble des baselines en précision de contact et en alignement de posture, avec un paramétrage unique valable pour des conditions de retargeting variées. La tâche Pen-Spin voit son taux de succès en entraînement augmenter de 40,6 points de pourcentage par rapport aux méthodes existantes. Plus significatif encore, le système permet un transfert zéro-shot vers le hardware Wuji Hand sur des tâches de réorientation de cube et de spinning de stylo, sans fine-tuning supplémentaire. Ce résultat adresse un verrou central dans la chaîne de données pour la manipulation dextère : le retargeting naïf de démonstrations humaines introduit des artefacts de contact et des configurations infaisables qui dégradent directement la politique RL apprise en aval. La capacité à préserver la topologie d'interaction main-objet avec un seul ensemble de paramètres, sans ajustement cas par cas, est un argument fort pour la scalabilité des pipelines de collecte de données. Le transfert zéro-shot vers un hardware physique valide également partiellement la réduction du sim-to-real gap : si la référence de mouvement est topologiquement cohérente, la politique généralisée mieux, y compris vers un robot non vu pendant l'entraînement. Le retargeting cinématique est un problème ancien dans l'animation et la robotique humanoïde, mais son application systématique à la manipulation dextère à partir de données humaines est plus récente, portée par l'essor des datasets de démonstration comme DEXYCB ou ContactPose. Les approches concurrentes incluent des méthodes d'optimisation directe de la posture (DexPilot, GRAB), ainsi que des frameworks basés sur l'apprentissage par imitation directe ou le mapping de contact. TopoRetarget se distingue par son traitement explicite de la structure topologique des contacts plutôt que de la seule géométrie de pose. Les prochaines étapes naturelles concernent la généralisation à des objets non vus, l'extension à des mains à plus de degrés de liberté, et l'intégration dans des pipelines de collecte de données à grande échelle pour l'entraînement de politiques VLA dextères.

RechercheOpinion
1 source
Planification du mouvement multi-robots à partir de la vision et du langage par diffusion inspirée de la chaleur
2446arXiv cs.RO 

Planification du mouvement multi-robots à partir de la vision et du langage par diffusion inspirée de la chaleur

Des chercheurs ont présenté LHD (Language-conditioned Heat-inspired Diffusion), un framework de planification de mouvement multi-robots publié sur arXiv (réf. 2512.13090v2). Le système génère, en réponse à des commandes en langage naturel, des trajectoires sans collision pour plusieurs robots opérant simultanément dans un espace partagé, sans nécessiter de représentation explicite de l'environnement à l'inférence. LHD combine les priors sémantiques de CLIP, le modèle vision-langage d'OpenAI, avec un noyau de diffusion inspiré de l'équation de la chaleur. Ce noyau agit comme un biais inductif physique : en simulant la propagation thermique depuis les positions cibles, il délimite naturellement l'espace atteignable par chaque robot, guidant la planification à l'intérieur de la zone effectivement accessible. Les évaluations menées sur des environnements simulés inspirés du monde réel et des expériences en conditions physiques réelles montrent des gains en taux de succès et une réduction de la latence de planification par rapport aux planificateurs par diffusion antérieurs. L'enjeu industriel est direct : des systèmes multi-robots capables d'interpréter des instructions verbales sans reconfiguration manuelle représentent un levier clé pour les entrepôts et les lignes de production flexible. Les approches par diffusion existantes souffraient de deux limites bloquantes pour le déploiement réel : un coût computationnel élevé à l'inférence et une dépendance à une cartographie explicite des obstacles. LHD adresse les deux simultanément. Le système gère également les scénarios hors distribution en termes d'accessibilité physique : si une cible est hors de portée, il redirige le robot vers l'alternative accessible la plus proche sémantiquement, exactement le type de robustesse attendu en conditions industrielles. Ces résultats renforcent l'hypothèse que des VLA (Vision-Language-Action) peuvent opérer sans représentation géométrique explicite, sans constituer pour autant une preuve de déploiement à l'échelle commerciale. Ce travail s'inscrit dans une vague de planificateurs neuronaux multi-robots apparue depuis 2023, en concurrence directe avec les approches MAPF (Multi-Agent Path Finding) classiques et les méthodes d'apprentissage par renforcement multi-agent comme QMIX ou MAPPO. L'intégration de CLIP distingue LHD par son conditionnement sémantique flexible, là où la plupart des approches concurrentes raisonnent en coordonnées ou en graphes discrets. Aucun acteur industriel ou institutionnel européen n'est associé à cette publication, dont les affiliations d'équipe ne sont pas précisées dans l'abstract arXiv. Une page projet accompagnée de démos vidéo et de code est accessible à jebeom.github.io/lhdprojectpage/, mais des intégrations avec des flottes AMR commerciales restent à démontrer.

RechercheOpinion
1 source
HiCrowd : alignement hiérarchique du flux de foule pour les environnements humains denses
2447arXiv cs.RO 

HiCrowd : alignement hiérarchique du flux de foule pour les environnements humains denses

Des chercheurs ont publié HiCrowd (arXiv:2602.05608, troisième révision), un framework hiérarchique conçu pour permettre aux robots mobiles de naviguer dans des foules piétonnes denses sans se bloquer. L'architecture combine une politique d'apprentissage par renforcement (RL) à haut niveau, qui génère un "follow point" vers un groupe de piétons compatible, et un contrôleur prédictif par modèle (MPC) à bas niveau chargé du suivi sécurisé à horizon court. La méthode a été évaluée en mode offline (rejeu de trajectoires humaines enregistrées) et en mode online (simulation où les piétons réagissent au robot), puis déployée dans un musée public et sur le site de l'Expo 2025 Osaka, sans réentraînement spécifique à ces environnements. Le résultat central est la réduction substantielle du "freezing robot problem", phénomène où le robot, incapable de trouver un couloir sécurisé, se retrouve immobile au milieu de la foule. Ce blocage est l'un des principaux obstacles au déploiement d'AMR (autonomous mobile robots) en milieu public. HiCrowd surpasse les baselines réactives classiques et les approches purement par apprentissage sur deux métriques clés : efficacité de navigation et sécurité. Le déploiement à l'Expo 2025 Osaka sans réentraînement apporte un argument de robustesse sim-to-real qui mérite d'être noté, même si les auteurs ne publient pas de métriques quantitatives de terrain. La contribution conceptuelle est un changement de paradigme : traiter les piétons comme un flux à aligner plutôt que comme des obstacles dynamiques à esquiver ouvre une voie différente des approches ORCA ou CADRL dominantes. La navigation sociale robotique est un domaine compétitif depuis une décennie, avec des méthodes allant de Dynamic Window Approach aux réseaux de graphes attentionnels (SARL, CrowdNav) et aux approches POMDP. HiCrowd se positionne dans la lignée des hybrides RL+MPC, qui cherchent à concilier la prise de décision à long terme et la sécurité temps-réel. Le code et les démonstrations sont disponibles sur GitHub. La v3 de l'article suggère une soumission en cours vers une conférence de robotique majeure (ICRA ou IROS). Les prochaines étapes naturelles seraient une validation sur des robots commerciaux (Boston Dynamics Spot, Clearpath) et des métriques de confort social mesurées auprès des piétons réels.

RecherchePaper
1 source
Étude de cas : automatisation robotique dans l'habillement, jumeaux numériques, interopérabilité et formation des équipes
2448arXiv cs.RO 

Étude de cas : automatisation robotique dans l'habillement, jumeaux numériques, interopérabilité et formation des équipes

Un système de couture robotisé pour la fabrication de jeans a été déployé en deux phases dans un environnement de production réel, selon une étude de cas publiée sur arXiv (2606.16078) en juin 2026. Le système s'appuie sur un module de "fil numérique" qui parse automatiquement des dessins de production au format DXF pour en extraire des paramètres de process et des trajectoires exécutables par le robot, réduisant l'effort de programmation manuelle et permettant un reciblage rapide entre différentes opérations de couture. Un jumeau numérique de la cellule de travail est utilisé en pré-déploiement pour valider la portée du bras, les dégagements, la disposition et le séquençage, ainsi que la compatibilité en temps de cycle avec les tâches en amont et en aval. En production, un robot collaboratif est intégré à des équipements de couture conventionnels, à des postes de soudure, à des préhenseurs à aspiration et à des automates machine via une couche d'interopérabilité. Les deux déploiements couvrent des opérations de couture 2D (poches plaquées sur shorts en denim) et des coutures 3D de mise en forme de vêtements, accompagnés d'un monitoring en temps réel incluant la vérification des coutures, la détection de collision et la validation de trajectoires. La portée de ce travail dépasse la démonstration de laboratoire : il s'agit d'un déploiement usine réel sur des pièces textiles déformables, segment réputé pour son "reality gap" persistant entre environnements contrôlés et production. L'article identifie cinq leviers critiques pour monter en échelle : validation par jumeau numérique, génération de tâches par fil numérique, interopérabilité entre équipements hétérogènes, vérification runtime, et outillage de formation des opérateurs. Ce dernier point est souvent négligé dans la littérature robotique mais s'avère décisif pour l'adoption en PME textile. Les auteurs ne communiquent pas de métriques de temps de cycle chiffrées dans l'abstract, ce qui limite l'évaluation comparative de la performance brute. L'automatisation de la confection demeure l'un des derniers bastions résistants à la robotisation flexible, là où l'électronique et l'automobile ont largement industrialisé leurs lignes. Les principaux acteurs sur ce créneau incluent SoftWear Automation (Sewbot, États-Unis), Sewts (Allemagne) et quelques projets en cours en Europe du Sud. Aucune entreprise n'est nommée dans cet article académique, ce qui suggère soit une confidentialité industrielle, soit un partenariat en phase pilote. Les prochaines étapes logiques seraient l'extension à d'autres typologies de vêtements, la généralisation du fil numérique à d'autres formats CAO que le DXF, et la quantification rigoureuse des gains de productivité pour un dossier ROI convaincant auprès des intégrateurs textiles.

IndustrielActu
1 source
DataLadder : une chaîne d'outils d'interconversion par simulation pour la pyramide de données de l'IA incarnée
2449arXiv cs.RO 

DataLadder : une chaîne d'outils d'interconversion par simulation pour la pyramide de données de l'IA incarnée

Une équipe associée à JD Cloud publie DataLadder (arXiv:2606.16776, juin 2026), un pipeline de conversion bidirectionnel entre robots réels, simulation et démonstrations humaines, conçu pour scaler la génération de données d'entraînement et l'évaluation de politiques robotiques généralistes. L'outil repose sur deux flux complémentaires via le simulateur JoySim. Le premier, Robot vers Simulation vers Human, reconstruit des tâches réelles de rangement sur table en jumeaux numériques calibrés, puis mobilise des retours humains pour affiner la naturalité des trajectoires simulées, permettant une évaluation reproductible sans mobiliser de robot physique en continu. Le second, Human vers Simulation vers Robot, projette des démonstrations humaines filmées en vue égocentrique dans JoySim, les confronte aux contraintes physiques du robot cible, et en extrait trajectoires, annotations et observations visuelles directement utilisables en entraînement. Les modules de reconstruction, rendu et augmentation de réalisme sont exposés en services cloud sur JD Cloud. Ce travail adresse une asymétrie bien documentée : les données issues de robots réels restent la source la plus fiable, mais leur collecte est lente et coûteuse, tandis que la simulation seule souffre du sim-to-real gap. DataLadder introduit un filtre de cohérence physique dans la boucle de conversion human-to-robot, ce qui dépasse les approches de retargeting naïves. Pour les équipes développant des architectures VLA (vision-language-action), cette infrastructure pourrait réduire significativement la dépendance aux démos téléopérées, dont le coût est souvent estimé à plusieurs milliers de dollars par heure de collecte. L'accessibilité via API cloud simplifie également le déploiement pour des équipes sans cluster de simulation dédié. DataLadder s'inscrit dans la course au "data flywheel" pour robots généralistes, lancée par RT-2 (Google DeepMind, 2023) et accélérée par des politiques comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). JD.com, conglomérat e-commerce chinois opérant une large flotte logistique autonome, a un intérêt direct à industrialiser cette chaîne pour ses propres lignes de tri et de picking. Aucun benchmark comparatif avec les simulateurs concurrents Isaac Lab (NVIDIA) ou MuJoCo Playground (DeepMind) n'est fourni dans ce preprint, ce qui rend les affirmations de performance difficiles à évaluer pour l'instant. La prochaine étape attendue serait une validation quantitative sur des benchmarks standardisés de manipulation comme LIBERO ou MetaWorld.

IA physiqueOpinion
1 source
Reconstruction couture-vers-graphe pour l'alignement de configuration de vêtements
2450arXiv cs.RO 

Reconstruction couture-vers-graphe pour l'alignement de configuration de vêtements

Un réseau de neurones dédié à la détection des coutures de vêtements vient d'être proposé dans un preprint arXiv (référence 2606.15171, juin 2026), avec pour application directe le chargement automatisé de vêtements sur une platine de sérigraphie. Le système, baptisé Seam-to-Graph, s'appuie sur des réseaux de neurones à graphes (GNN) couplés à des mécanismes d'attention pour transformer des observations partielles de coutures en un graphe squelette encodant la topologie du vêtement. Ce graphe alimente en temps réel un estimateur d'état, même lorsque les coutures ne sont que partiellement visibles, condition fréquente en manipulation robotique. À partir de cette estimation, un contrôleur d'asservissement visuel hiérarchique, sensible aux déformations du tissu, aligne le vêtement sur la configuration cible. Des expériences sur un robot bimanuel réel démontrent une précision comparable au niveau humain, avec une variance d'erreur réduite, et une robustesse confirmée sur plusieurs types de vêtements. Ce travail s'attaque à l'une des problématiques les plus résistantes de la robotique industrielle : les objets déformables non rigides. Les coutures constituent des primitives structurelles physiquement stables, présentes sur quasiment tout vêtement, et leur topologie reflète l'architecture globale de la pièce, là où une estimation de pose classique échoue. La démonstration sur une tâche industrielle concrète, la sérigraphie, est un signal positif. Toutefois, l'abstract ne publie aucun chiffre absolu sur les taux de réussite ni sur les temps de cycle, ce qui rend la comparaison avec les benchmarks industriels existants difficile. La manipulation de vêtements par robot est un domaine actif depuis plus d'une décennie, avec des travaux notables à UC Berkeley, ETH Zurich et Imperial College, mais peu de déploiements industriels réels faute d'estimateurs d'état fiables sur objets déformables. Parmi les acteurs positionnés sur la manipulation textile automatisée, la startup allemande Sewts (linge industriel) et le britannique Dextrous Robotics explorent des approches vision, mais aucun n'a publié d'approche graphe de coutures à ce stade. Les suites naturelles seraient une validation sur un parc de vêtements plus large, des tests à cadence industrielle, et une évaluation sur occultations sévères.

RecherchePaper
1 source