Aller au contenu principal

Actualités robotique — page 2

5 297 articles au fil, du plus récent au plus ancien.

Les capteurs de pression peuvent améliorer la précision de préhension des robots
51Robotics Business Review 

Les capteurs de pression peuvent améliorer la précision de préhension des robots

Dans la robotique industrielle, l'échec d'une prise ne vient presque jamais d'un manque de force mécanique mais d'une méconnaissance de ce qui se passe réellement au contact entre les doigts et l'objet. XELA Robotics illustre cette approche avec son gripper UMI équipé de capteurs uSkin, capables de restituer une visualisation en temps réel des données tactiles. Concrètement, ces capteurs de pression ne mesurent pas une force globale mais une contrainte mécanique distribuée au niveau de l'interface de contact, via des films piézorésistifs, des couches capacitives ou des structures microfluidiques intégrées dans des coussinets de doigts souples. Cette distinction compte en pratique : à courant moteur et déplacement de doigt identiques, un gripper obtient des répartitions de pression très différentes selon qu'il saisit une pièce métallique rigide, qui concentre la charge sur quelques points, ou un carton fragile, qui peut s'affaisser de façon asymétrique bien avant qu'un changement significatif n'apparaisse dans le retour de couple moteur. Ce signal de pression est capté dès les premières millisecondes du contact, dans des applications comme le bin picking, le kitting ou la manipulation de pièces mixtes. Pour les intégrateurs et décideurs industriels, l'enjeu est de taille : ce signal précoce permet à la commande de basculer du contrôle de mouvement vers le contrôle d'interaction avec moins de dépassement et un meilleur timing, ce qui réduit les échecs de prise sans nécessiter une architecture de capteurs lourde. L'article distingue clairement trois familles de capteurs souvent confondues. Le capteur force-couple au poignet donne une mesure globale mais ne peut pas détecter qu'un doigt glisse pendant qu'un autre est en surcharge, la moyenne au poignet restant stable. Les capteurs tactiles offrent une résolution spatiale plus riche, avec parfois de véritables cartes de contact, mais au prix d'une complexité et d'un coût plus élevés et d'un traitement de données plus dense. Les capteurs de pression se positionnent entre ces deux extrêmes : assez locaux pour détecter une charge inégale sur un coussinet, assez simples pour s'intégrer dans des grippers industriels réels sans saturer le système de commande. Dans la plupart des déploiements, la pression ne remplace donc pas la force ni le tactile, elle stabilise la couche intermédiaire où se prennent la majorité des décisions de préhension. Le placement des capteurs à l'intérieur du gripper n'est pas un détail mécanique mais définit le problème de contrôle à résoudre. Intégrés dans des coussinets en élastomère, ils offrent une mesure de contact directe mais avec un filtrage mécanique dû à la déformation de la couche souple avant la réaction du capteur, une configuration privilégiée pour une manipulation délicate. Placés derrière une surface de contact rigide avec une fine interface souple, ils gagnent en durabilité et en résistance à l'usure, au prix d'une sensibilité réduite à la microtexture et à l'amorce de glissement, un compromis particulièrement discuté pour les applications de pick-and-place à haute cadence.

IndustrielPaper
1 source
Cafards Cyborgs : Ils Peuvent Vous Piquer avec des Aiguilles
52IEEE Spectrum Robotics 

Cafards Cyborgs : Ils Peuvent Vous Piquer avec des Aiguilles

Des chercheurs du Biorobotics Lab de l'Université du Queensland, à Brisbane, dirigés par T. Thang Vo-Doan et Thanh Nho Do, ont publié une étude sur des cafards cyborgs baptisés "Paraborgs", conçus pour venir en aide à des victimes ensevelies après une catastrophe. Les scientifiques ont utilisé des cafards fouisseurs géants (Macropanesthia rhinocéros), espèce australienne pesant environ 40 grammes, ce qui en fait la plus lourde espèce de blatte au monde et lui permet de porter une charge utile supérieure à la moitié de son poids. Des électrodes ont été implantées dans leurs antennes et leurs cerques, pilotables sans fil via une manette de jeu vidéo classique pour les diriger, les faire avancer ou les arrêter. Certains insectes portent une caméra sans fil, d'autres un injecteur télécommandé qui propulse une seringue chargée de médicament grâce à un ressort, avant qu'une réaction chimique générant du CO2 ne pousse le liquide dans la cible. Lors des essais, les Paraborgs ont parcouru un parcours de 2,5 mètres avec trois points de passage avant de viser une cible en silicone de 8 sur 10 centimètres. Sur 25 essais, le parcours a été bouclé à chaque fois et l'injection a réussi dans 72% des cas. Cette démonstration reste un prototype de laboratoire et non un système déployé sur le terrain, mais elle déplace la frontière de ce que peut faire un robot de recherche et sauvetage à très petite échelle. Plutôt que de concevoir un robot artificiel capable de ramper dans des gravats, escalader des surfaces irrégulières et récupérer après une chute, les chercheurs exploitent la mobilité déjà intégrée d'un insecte vivant et se contentent de greffer une interface électronique. L'approche répond à une limite connue des insectes cyborgs précédents (coléoptères, phalènes), jusqu'ici cantonnés au rôle de plateformes de capteurs passifs pilotables à distance. Pour un secteur qui cherche des solutions low-cost et miniaturisées pour l'inspection de décombres, ce travail suggère une voie alternative à la robotique bio-inspirée classique: au lieu de répliquer artificiellement la motricité d'un insecte, on la loue directement, avec un gain potentiel en coût, en robustesse et en autonomie énergétique embarquée. Le projet est né en 2023, quand Vo-Doan et Do, discutant en marge de la conférence ICRA, se sont demandé ce qui pouvait se passer après qu'un cyborg ait localisé une victime, au-delà de la simple détection déjà explorée avec d'autres insectes. Les chercheurs n'ont pas cherché à combiner caméra et injecteur sur un même insecte, le poids et l'encombrement supplémentaires risquant de réduire la mobilité et l'autonomie énergétique; ils envisagent plutôt un déploiement en essaim, avec des Paraborgs spécialisés et complémentaires, certains en éclaireurs équipés de caméras, d'autres en unités d'intervention porteuses de médicaments. Aucun calendrier de pilote sur site réel n'est pour l'instant annoncé, le travail publié restant une preuve de concept en environnement contrôlé. Vo-Doan résume l'objectif à long terme comme la combinaison de la locomotion avancée de l'insecte avec des capacités de détection et d'intervention, afin d'atteindre et d'aider davantage de personnes, plus rapidement, lors d'opérations de secours après une catastrophe.

RecherchePaper
1 source
Voici pourquoi l'avenir de la maçonnerie pourrait bien être robotique
53Interesting Engineering 

Voici pourquoi l'avenir de la maçonnerie pourrait bien être robotique

Salar al Khafaji, fondateur et PDG de la start-up Monumental, est l'invité d'un épisode du podcast Lexicon pour évoquer les robots autonomes que sa société développe pour le secteur du bâtiment. Avant Monumental, al Khafaji avait créé la société de visualisation de données Silk, rachetée par Palantir. Monumental a mis au point des robots capables de transporter des matériaux et de construire des murs en briques sur des chantiers commerciaux. Chaque brique posée est photographiée avec une caméra 3D, au moment de la préhension puis de la pose, ce qui permet au système de repérer les unités déformées ou ébréchées, surnommées en interne les « banana bricks », et d'ajuster leur positionnement. Des capteurs de charge mesurent en continu la pression exercée pendant la pose, car le mortier est un fluide non newtonien dont le comportement varie selon la viscosité et l'humidité. Avant même de poser une brique, le robot doit se localiser précisément sur le site, lire les plans de construction et déterminer l'emplacement exact des murs et des ouvertures. Al Khafaji affirme, sans donner de chiffre vérifiable, qu'un seul robot Monumental pose environ autant de briques par équipe de travail qu'un maçon humain, et que l'entreprise a constitué ce qu'il décrit, avec humour, comme « le plus grand jeu de données sur les briques au monde ». Ce témoignage éclaire un point de tension classique de la robotique de terrain : le passage du laboratoire au chantier réel, où lumière, météo, surfaces et matériaux changent en permanence et ne peuvent être anticipés par la seule ingénierie. Pour al Khafaji, seule la donnée collectée in situ fait foi, ce qui rejoint le débat plus large sur l'écart entre démonstrations contrôlées et déploiement effectif dans l'industrie des robots humanoïdes et manipulateurs. Il relativise aussi la vitesse individuelle du robot comme métrique clé, jugeant absurde l'idée de robots maçons pleinement autonomes alimentés à la brouette par des humains toutes les quinze minutes, ce qui suggère que la vraie valeur se joue au niveau de la logistique de flotte et de l'intégration de chantier plutôt que sur la seule tâche de pose. Ces affirmations restent celles du fondateur dans un format d'interview promotionnelle, sans cycle time précis, sans nombre de sites ni chiffres de déploiement indépendamment vérifiés. Sur le plan du positionnement, al Khafaji justifie son choix du BTP par la taille économique du secteur, sa stagnation en productivité et son rôle dans la hausse des coûts du logement, un terrain qu'il juge sous-estimé par les entrepreneurs technologiques habitués aux logiciels. L'épisode ne mentionne ni date de lancement commercial, ni levée de fonds, ni site pilote nommé, ni acteur concurrent explicite : il s'agit d'une discussion de vision et de méthode technique, pas d'une annonce produit ou d'un déploiement chiffré.

IA physiqueOpinion
1 source
Appel aux startups de robotique : candidatez dès maintenant pour le Robotics Startup Radar 2026
54Robotics Business Review 

Appel aux startups de robotique : candidatez dès maintenant pour le Robotics Startup Radar 2026

The Robot Report a rouvert les candidatures pour son classement annuel Robotics Startup Radar, avec une deadline fixée au mardi 6 octobre 2026. L'appel cible les startups robotiques de cinq ans d'âge maximum, développant des systèmes complets inédits, des technologies habilitantes ou des modèles économiques novateurs, sans restriction de secteur d'application. Le formulaire de candidature demande des informations précises : année de fondation, nom des fondateurs, taille d'équipe (de 1-10 à plus de 500 salariés), montant total levé, stade du dernier tour de financement (pré-seed à Series C), marchés ciblés parmi une dizaine de catégories comme la logistique, la santé, l'énergie ou la défense, ainsi que l'existence de clients ou pilotes déjà signés. L'édition est sponsorisée par Maxon Precision Motors et PTC, deux acteurs établis de la motion control et du PLM industriel. Les questions relatives à l'édition 2025 sont redirigées vers Brianna Wessling, journaliste de la publication, et les demandes de sponsoring vers Jami Brownlee. Pour les jeunes pousses robotiques, ce classement fonctionne comme une vitrine éditoriale plutôt qu'un benchmark technique : il ne garantit aucune sélection automatique, le comité éditorial de The Robot Report évaluant chaque dossier après clôture des candidatures. L'intérêt pour les fondateurs tient surtout à l'exposition générée auprès d'investisseurs, d'ingénieurs expérimentés et d'autres entrepreneurs du secteur, dans un marché où la visibilité média pèse de plus en plus dans les levées de fonds et les partenariats industriels. Pour les intégrateurs et décideurs B2B, la liste sert avant tout d'outil de veille pour repérer tôt des technologies émergentes avant qu'elles n'atteignent une maturité commerciale, sans que la présence dans le classement constitue une validation technique ou une preuve de déploiement réel. Cette initiative s'inscrit dans la continuité d'un exercice récurrent de The Robot Report, dont l'édition précédente avait recensé 100 startups jugées prometteuses, couvrant un spectre allant de la mobilité autonome et des robots humanoïdes à l'automatisation industrielle. Le retour du Startup Radar pour 2026 confirme la volonté du média de maintenir cet inventaire annuel comme repère du secteur, alors que le nombre de startups robotiques continue de croître rapidement selon la publication. Les prochaines étapes sont simples : clôture des soumissions le 6 octobre 2026, puis examen éditorial avant publication d'une liste finale, sans calendrier de publication précisé à ce stade.

BusinessActu
1 source
Video Friday : Digit redécore la maison
55IEEE Spectrum Robotics 

Video Friday : Digit redécore la maison

La sélection hebdomadaire Video Friday d'IEEE Spectrum met en avant plusieurs démonstrations robotiques début septembre 2026. Agility Robotics y montre son humanoïde Digit tractant un canapé, un exercice de force malgré le ton volontairement décalé de la vidéo. Une équipe de recherche présente ReST-RL, une architecture d'apprentissage par renforcement hiérarchique qui découple la locomotion de la stabilisation de charges non fixées, déployée sur l'humanoïde Unitree G1 avec une généralisation sim-to-real en zero-shot face à divers objets et perturbations externes. Des chercheurs du Safe AI Lab de Carnegie Mellon University dévoilent APEX, un système de navigation adaptative du corps entier pour humanoïde. À l'Université de Tokyo, l'humanoïde musculo-squelettique Musashi-W reçoit une peau articulaire à trois couches dotée de 44 capteurs de pression et d'étirement imitant la proprioception humaine. Des chercheurs de North Carolina State University ont conçu des robots souples en forme de goutte, en élastomère à cristaux liquides, activés par lumière infrarouge et capables de sauter en continu. En Chine, à Turpan, où les températures au sol dépassent 50°C l'été, le quadrupède Lynx M20S de DEEP Robotics a participé aux vendanges. Ces contenus illustrent un écart persistant entre démonstration scénarisée et autonomie réelle dans la robotique humanoïde. Les chercheurs de Carnegie Mellon le reconnaissent eux-mêmes : la plupart des mouvements spectaculaires vus en ligne sont chorégraphiés à l'avance, ce qui rend leur système APEX notable par sa capacité d'adaptation non scriptée face aux obstacles. ReST-RL s'attaque à un verrou d'ingénierie concret pour les intégrateurs logistiques, la stabilisation d'une charge non fixée pendant une locomotion bipède dynamique, et sa validation en zero-shot sur du matériel Unitree G1 constitue un signal utile pour qui envisage des humanoïdes en manutention. Une déclaration de Figure, affirmant que déployer un robot dans chaque foyer est avant tout un problème de sécurité et de coût plutôt que de données ou de calcul, va à contre-courant du discours dominant sur la mise à l'échelle des modèles VLA comme solution universelle. Le déploiement du Lynx M20S dans les vignobles de Turpan illustre, lui, un usage agricole concret des quadrupèdes au-delà des démonstrations en intérieur. Ce format hebdomadaire d'IEEE Spectrum agrège depuis plusieurs années les travaux de laboratoires académiques (Carnegie Mellon, North Carolina State, Université de Tokyo) et d'entreprises commerciales (Agility Robotics, Figure, Unitree, LimX Dynamics, DEEP Robotics, RAI Institute). La DARPA y confirme la finale de son Triage Challenge pour novembre 2026, dédié à des scénarios de sauvetage, tandis que son Lift Challenge sur les drones de levage lourd reviendra en 2028. Le calendrier sectoriel s'étoffe par ailleurs : le Humanoids Summit se tiendra à Séoul les 22 et 23 septembre 2026, IROS 2026 à Pittsburgh du 27 septembre au 1er octobre, et CoRL 2026 à Austin du 9 au 12 novembre, autant d'occasions de confronter ces résultats préliminaires à d'autres équipes. Aucun acteur français ou européen ne figure dans cette sélection, dominée par des laboratoires nord-américains et des humanoïdes chinois et américains.

HumanoïdesPaper
1 source
Lyte lève 165 millions de dollars pour améliorer la perception environnementale des robots
56Robotics Business Review 

Lyte lève 165 millions de dollars pour améliorer la perception environnementale des robots

Lyte AI Inc., société de Sunnyvale (Californie) fondée en 2021, a annoncé cette semaine une levée de 165 millions de dollars en série C, valorisant l'entreprise à 1,6 milliard de dollars post-money. Le tour a été mené par Maverick Silicon, avec la participation de Fidelity Management & Research Company (qui avait déjà mené la série B), Atreides Management, Key1 Capital, Ora Global (ex-Exor Ventures) et d'autres investisseurs existants et nouveaux. Andrew Homan, managing partner de Maverick Silicon, rejoint le conseil d'administration de Lyte. Depuis sa création, la société a levé 272 millions de dollars au total, ce tour étant le second annoncé cette année après une sortie de stealth en janvier avec 107 millions de dollars cumulés. Lyte conçoit des processeurs, des capteurs multimodaux et le logiciel associé, avec un stack maison développé du transistor jusqu'au bout de la chaîne. Sa plateforme LyteVision fusionne vision 4D cohérente, imagerie haute résolution et capteurs inertiels sur une timeline synchronisée unique, mesurant position et mouvement nativement plutôt qu'en les reconstruisant par logiciel. Récompensée "Best of Innovation in Robotics" au CES 2026, la plateforme est entrée en production et est livrée à des clients dans l'inspection, la logistique et le manufacturing, sans que Lyte ne précise de noms de clients ni de volumes livrés. Le pari de Lyte, porté par son cofondateur et CEO Alexander Shpunt, part d'un constat affiché: l'IA physique aurait un problème de perception avant d'avoir un problème de modèle, un robot ne pouvant agir en sécurité sur des données qui ne décrivent pas fidèlement le monde. Ce positionnement tranche avec le narratif dominant du secteur, focalisé sur les modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, en suggérant que le goulot d'étranglement se situe en amont, dans la fiabilité du capteur lui-même plutôt que dans l'intelligence du modèle. L'argument commercial de Lyte est la verticalisation totale, du silicium au logiciel, face à une approche courante qui assemble des composants standards au prix de latence, de dérive de calibration et de données peu fiables selon l'entreprise. Pour les intégrateurs et décideurs industriels, cela ouvre une brique de perception indépendante des fabricants de robots, mais faute de chiffres publiés sur la précision, la latence ou le taux de fiabilité, l'ampleur réelle du déploiement reste à vérifier au-delà du discours de lancement. Lyte compte utiliser les fonds pour industrialiser la production de son silicium et de la plateforme LyteVision, faire progresser ses capacités d'IA et de perception, et étendre ses déploiements auprès d'entreprises robotiques et de clients industriels. L'entreprise prévoit une croissance substantielle de ses effectifs sur l'année à venir, avec des recrutements dans le silicium, le logiciel, l'optique, la fabrication, les opérations et le commercial, y compris des postes de direction senior. Le chairman Avigdor Willenz avance que la maîtrise complète de la chaîne, du composant à la donnée spatiale produite, distinguerait Lyte des acteurs qui se contentent d'assembler des capteurs existants, une stratégie de fondeur verticalement intégré transposée cette fois à la robotique physique, dans un marché de la perception encore largement dominé par des combinaisons de LiDAR, caméras et radars issus de fournisseurs séparés.

BusinessActu
1 source
Robot.com s'associe à Sodexo pour déployer davantage de robots de livraison sur trottoir
57Robotics Business Review 

Robot.com s'associe à Sodexo pour déployer davantage de robots de livraison sur trottoir

Robot.com, entreprise basée à San Francisco fondée en 2017 sous le nom Kiwibot, a annoncé un accord commercial de sept ans avec le groupe français de restauration collective Sodexo, qui prolonge un partenariat entamé en 2021 sur plusieurs campus universitaires nord-américains gérés par Sodexo. Selon Felipe Chavez Cortes, cofondateur et PDG de Robot.com, cité par The Robot Report, Sodexo emploie environ 400 000 personnes dans le monde dont 120 000 à temps plein aux États-Unis, et fait face à des pénuries de main-d'œuvre sur certains postes. Ce contrat de sept ans constitue, selon Cortes, le plus grand déploiement d'entreprise unique jamais signé par Robot.com. La flotte de robots de livraison R-Kiwi de la société a réalisé 2,4 millions de tâches sur des campus et des trottoirs urbains, avec plus de 500 unités actuellement en service à travers le pays, chiffres communiqués par l'entreprise elle-même et non vérifiés de façon indépendante. Robot.com prévoit d'ajouter à sa gamme le R-Dog, un robot quadrupède à roues et pattes capable, selon Cortes, de déposer directement les colis, de monter des escaliers, et de s'installer dans un véhicule autonome sans modification de celui-ci. Pour la fiabilité opérationnelle de ses flottes, l'entreprise s'appuie sur sa plateforme logicielle interne baptisée Remi et sur des partenariats avec Field AI et Physical Intelligence. Ce contrat intervient alors que plusieurs acteurs du secteur reculent sur la livraison en campus universitaire: Starship Technologies, l'un des pionniers du secteur, a récemment annoncé l'arrêt progressif de ses opérations sur les campus pour se recentrer sur la livraison de courses alimentaires. Robot.com fait donc un pari inverse, misant sur le campus comme environnement de test intermédiaire entre l'intérieur contrôlé et la rue urbaine dense. L'argument économique avancé par Cortes, une plateforme logicielle mêlant robotique classique et briques d'IA tierces, en partie financée par de la publicité embarquée sur les robots, illustre une recherche plus large de modèles de revenus hybrides pour rentabiliser des flottes dont le coût d'exploitation reste élevé. L'arrivée annoncée du R-Dog, capable de livrer sans intervention manuelle du destinataire, répond à une limite structurelle des robots à roues actuels, qui nécessitent que le client ouvre lui-même le compartiment. Mais à ce stade, le R-Dog demeure une annonce de produit à venir et non un système effectivement déployé, contrairement au R-Kiwi. Robot.com a été fondée en 2017 à San Francisco sous le nom Kiwibot avant de se rebaptiser. La relation avec Sodexo remonte à 2021, lorsque le groupe est devenu, selon Cortes, la première entreprise à déployer des robots de livraison alimentaire sur des campus universitaires américains, avant d'étendre ce type de déploiement plus largement dans le secteur de la restauration collective. Le marché de la livraison autonome sur trottoir reste dominé par un petit nombre d'acteurs, dont Starship Technologies, dont le repositionnement récent vers les courses alimentaires souligne les difficultés de rentabilité du modèle campus. Robot.com mise désormais sur la diversification de sa flotte, avec le R-Dog en complément du R-Kiwi, ainsi que sur ses partenariats technologiques avec Field AI et Physical Intelligence pour sécuriser le déploiement de nouvelles formes de robots. Aucune date précise n'a été communiquée pour le lancement opérationnel du R-Dog. L'entreprise doit par ailleurs être présente à l'événement RoboBusiness 2026, où ces développements devraient être détaillés.

FR/EU ecosystemeActu
1 source
Vidéo : une entreprise chinoise publie 11 430 trajectoires robotiques pour la recherche
58Interesting Engineering 

Vidéo : une entreprise chinoise publie 11 430 trajectoires robotiques pour la recherche

AGIBOT, entreprise chinoise spécialisée en robotique et intelligence artificielle incarnée, a mis en open source le 3 septembre 2026 son jeu de données WORLD 2026, plus précisément son volet Theme 3 consacré à l'apprentissage par renforcement. L'ensemble rassemble 11 430 trajectoires collectées en conditions réelles sur 14 tâches industrielles et domestiques, réparties en trois catégories: des démonstrations expertes réalisées par des opérateurs humains, des exécutions autonomes de politiques apprises (1 024 réussites et 1 369 échecs recensés), et des séquences d'intervention humaine documentant le comportement du robot avant, pendant et après la reprise en main par un opérateur. Chaque trajectoire est annotée sur la progression de la tâche, son statut de complétion, les erreurs rencontrées, les perturbations environnementales et les interventions humaines. Cette publication intervient peu après qu'AGIBOT a dominé la deuxième édition des World Humanoid Robot Games avec 46 médailles dont 18 en or, sa première participation à une compétition internationale. L'intérêt de ce jeu de données tient à son objet: au lieu de ne compiler que des démonstrations réussies, comme le font la plupart des corpus utilisés pour l'apprentissage par imitation, AGIBOT capture aussi l'échec, l'hésitation et la correction. Pour les chercheurs en apprentissage par renforcement et IA incarnée, cela fournit un signal rarement disponible à cette échelle: comprendre où et pourquoi une politique autonome échoue, et comment une intervention humaine permet de récupérer la tâche. C'est un point sensible pour l'industrie, où l'écart entre les démonstrations soignées présentées en vidéo et la fiabilité réelle en déploiement reste un sujet de scepticisme récurrent chez les intégrateurs et les décideurs B2B. En rendant visibles ses propres échecs de politique, AGIBOT prend le contre-pied du marketing habituel du secteur et mise sur une stratégie de données ouvertes pour accélérer la recherche collective, plutôt que de garder ces données de déploiement en interne comme le font la plupart des laboratoires fermés développant des modèles vision-langage-action. Theme 3 s'inscrit dans l'initiative plus large AGIBOT WORLD 2026, présentée comme une ressource ouverte destinée à la communauté de recherche en IA incarnée, qu'AGIBOT prévoit d'enrichir avec d'autres jeux de données et benchmarks. Ce mouvement s'ajoute à une multiplication d'efforts comparables dans le secteur des modèles vision-langage-action et de la robotique humanoïde, où plusieurs laboratoires publient des corpus ou des modèles pour faire progresser l'apprentissage à partir de données réelles plutôt que de simulation seule. Aucun calendrier de nouveaux jeux de données n'a été précisé par AGIBOT, qui dit vouloir permettre aux industries d'exploiter cette base pour améliorer la productivité et la fiabilité des déploiements robotiques quotidiens.

RecherchePaper
1 source
Étude comparative sur la précision et la répétabilité des plateformes robotiques mobiles pour les mesures END de haute précision
59arXiv cs.RO 

Étude comparative sur la précision et la répétabilité des plateformes robotiques mobiles pour les mesures END de haute précision

Une équipe de recherche publie sur arXiv (2609.03794v1, soumission du 4 septembre 2026) une étude comparative mesurant la précision de positionnement de cinq plateformes robotiques mobiles commerciales pour l'inspection non destructive (NDE) de structures aéronautiques de grande taille. Le protocole s'appuie sur un tracker laser servant de référence externe, avec une précision de mesure d'environ 6 micromètres, et une calibration multi-coins couplée qui reconstitue la transformation laser-robot et les décalages des réflecteurs par moindres carrés ordinaires. Cinq plateformes ont été testées : KUKA KMP-1500, KUKA KMR, MiR250 (Mobile Industrial Robots), Spot de Boston Dynamics et Husky de Clearpath Robotics. En positionnement statique, la précision médiane va de 8,2 mm pour le KMP-1500 à 63,5 mm pour Spot, tandis que le Husky, qui ne dispose que d'une odométrie à roues sans localisation absolue, s'est révélé impossible à calibrer. En suivi de trajectoire dynamique, mesuré par l'erreur transversale (cross-track error), l'écart va de 6,9 mm (KMP-1500) à 112,1 mm (Spot). Aucune des cinq plateformes n'atteint seule la tolérance requise pour l'inspection NDE aéronautique, comprise entre 0,2 et 1,0 mm : l'écart est d'environ un ordre de grandeur pour la meilleure plateforme et de près de deux ordres de grandeur pour la moins bonne. Le résultat confirme ce que le secteur suspectait sans disposer de mesure comparative fiable : la base mobile seule ne suffit jamais, et le choix d'une plateforme doit se faire en fonction du capteur d'appoint (vision, marqueurs, recalage local) nécessaire pour combler l'écart. Pour les intégrateurs et donneurs d'ordres industriels, l'étude fournit pour la première fois un protocole reproductible et indépendant des fournisseurs pour comparer des piles de localisation hétérogènes, du SLAM LiDAR récent à l'odométrie visuelle sans carte, plutôt que de se fier aux fiches techniques constructeurs. L'inspection NDE de grandes structures (fuselages, voilures) repose traditionnellement sur des portiques ou bras manipulateurs fixes ; les plateformes mobiles séduisent par leur flexibilité mais leur adoption reste freinée par l'incertitude sur la précision de base. Publiée en tant que preprint, non encore revue par les pairs, l'étude se présente explicitement comme une donnée d'entrée pour le dimensionnement de capteurs complémentaires plutôt qu'une démonstration de faisabilité, ouvrant la voie à des travaux ultérieurs sur la fusion de capteurs et le recalage pour rapprocher ces plateformes du seuil millimétrique exigé par l'aéronautique.

RecherchePaper
1 source
MINERVA : quelle taille minimale pour une politique de manipulation qui résout LIBERO ?
60arXiv cs.RO 

MINERVA : quelle taille minimale pour une politique de manipulation qui résout LIBERO ?

Publiée le 4 septembre 2026 sur arXiv (2609.03715v1), l'étude MINERVA mesure la taille de modèle réellement nécessaire pour résoudre LIBERO, le benchmark de manipulation aujourd'hui dominé par des modèles vision-langage-action (VLA) de plusieurs milliards de paramètres. Sa politique de 0,54 million de paramètres atteint 95,1% de réussite sur 2 000 essais répartis sur les quatre suites standard de LIBERO, à seulement 2,4 points du résultat rapporté pour pi-0.5 de LeRobot, avec 7 700 fois moins de paramètres. Les performances plafonnent vers 1 million de paramètres et s'effondrent sous 250 000. La régression L1 directe égale le flow matching tout en étant jusqu'à 3,8 fois plus rapide sur GPU, et sur simple CPU portable, sans GPU, la politique replanifie chaque pas de contrôle en 5 à 9 millisecondes, 113 fois plus vite que SmolVLA et 1 400 fois plus vite que pi-0.5. Sur LIBERO-90 (89 tâches), le même protocole obtient 94,6%, mais chute à 46-56% face aux perturbations de LIBERO-Plus, avec une robustesse quasi nulle aux variations photométriques. Ce résultat bouscule l'idée dominante selon laquelle la manipulation robotique exige des VLA à l'échelle des grands modèles de langage: un réseau 7 700 fois plus petit que pi-0.5 approche ses performances, signe que le plancher de capacité requis par LIBERO est très bas. Une permutation des identifiants de tâche montre que le conditionnement par instruction sert surtout à sélectionner une tâche mémorisée: changer seulement ce mappage ramène le taux de réussite près du hasard, ce qui interroge ce que le benchmark mesure vraiment. Pour les intégrateurs, une inférence en quelques millisecondes sur simple CPU ouvre la voie à des contrôleurs embarqués bon marché, tandis que la fragilité aux perturbations photométriques rappelle qu'un score élevé sur benchmark ne garantit pas la robustesse en conditions réelles. Le travail s'inscrit dans une course à l'échelle menée par des VLA généralistes comme pi-0 et pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI ou SmolVLA de Hugging Face, cité ici comme référence de politique compacte. LIBERO, benchmark de manipulation devenu standard depuis 2023, sert de terrain de comparaison, mais son biais vers la mémorisation des tâches, mis au jour par MINERVA, questionne sa validité comme mesure de généralisation. Les auteurs appellent à une conception de politiques consciente de la capacité et à des stratégies de distillation pour produire des modèles robotiques efficaces au déploiement, plutôt qu'à une simple course au nombre de paramètres.

RecherchePaper
1 source
Danser avec REEM-C : une étude de communication physique et sociale entre robot et humain
61arXiv cs.RO 

Danser avec REEM-C : une étude de communication physique et sociale entre robot et humain

Une équipe de recherche publie une étude actualisée (arXiv:2408.05301, version 3) consacrée à la communication physique et sociale entre un robot humanoïde et un humain, testée à travers un scénario de danse en couple. La plateforme humanoïde à corps complet REEM-C, développée par l'entreprise espagnole PAL Robotics, tient le rôle du meneur et guide un partenaire humain en lui signalant les prochains pas via trois canaux de communication, haptique (contact physique), visuel et audio, utilisables seuls ou combinés. Pour cela, les chercheurs ont conçu une architecture de contrôle du corps entier scindée en deux : le haut du corps combine contrôle en admittance et en impédance pour gérer le contact physique avec le partenaire, tandis que le bas du corps reste en contrôle de position pour assurer l'équilibre et l'exécution des pas. Des expériences menées avec des participants humains ont permis de vérifier les performances du contrôleur et de comparer l'efficacité perçue et le confort des différentes modalités de communication. L'interaction physique-sociale homme-robot (psHRI) reste un point faible de la robotique humanoïde actuelle : la plupart des plateformes évitent le contact physique direct avec un humain ou le gèrent de façon rigide, ce qui limite les scénarios de collaboration rapprochée comme le guidage physique, l'assistance à la mobilité ou le co-portage de charges. En testant un robot qui initie et maintient un contact physique continu pour transmettre de l'information, l'étude sort du cadre habituel des démonstrations de manipulation ou de locomotion isolées et s'attaque directement à la lisibilité de l'intention robotique en contact rapproché. Pour les intégrateurs et chercheurs en robotique collaborative, les résultats sur la modalité jugée la plus efficace et la plus confortable, au-delà de la seule faisabilité technique du contrôleur, offrent des repères concrets pour concevoir des interfaces physiques en usine, en logistique ou en assistance à la personne, où le geste doit rester intuitif sans effort cognitif pour l'humain. REEM-C est la plateforme de recherche humanoïde de PAL Robotics, entreprise basée à Barcelone, déjà utilisée dans de nombreuses études académiques d'interaction homme-robot avant ce travail sur la danse meneur-suiveur. Cette publication s'inscrit dans un contexte où la majorité des annonces humanoïdes récentes, qu'il s'agisse de Figure 03, d'Optimus ou d'autres plateformes commerciales, mettent l'accent sur la manipulation autonome et la marche plutôt que sur la communication physique fine avec un partenaire humain. Il s'agit ici d'un travail de recherche académique, article arXiv en version révisée et non d'un produit commercialisé ni d'un déploiement industriel, dont l'objectif est de poser des bases méthodologiques pour des contrôleurs psHRI plus lisibles. Les auteurs évoquent des prolongements possibles vers d'autres scénarios de guidage physique au-delà de la danse, où ce type de communication multimodale pourrait s'appliquer à la rééducation ou à l'accompagnement de personnes à mobilité réduite.

FR/EU ecosystemePaper
1 source
TRaIL-Odom : odométrie radar-IMU-LiDAR à couplage étroit en temps continu avec pondération Doppler adaptative
62arXiv cs.RO 

TRaIL-Odom : odométrie radar-IMU-LiDAR à couplage étroit en temps continu avec pondération Doppler adaptative

Un preprint publié le 4 septembre 2026 sur arXiv (2609.03561) présente TRaIL-Odom, un système d'odométrie à couplage étroit combinant radar, centrale inertielle et LiDAR en temps continu. Le code et un jeu de données associé sont disponibles en accès libre sur GitHub, sous le compte ChiyunNoh. La méthode introduit deux modules de repondération adaptative du Doppler radar: une repondération point par point, qui ajuste chaque contrainte Doppler selon son alignement avec les directions de translation mal contraintes par la géométrie LiDAR, et un ajustement global par scan fondé sur l'anisotropie géométrique du nuage LiDAR, qui renforce la contribution du radar quand le LiDAR est peu fiable et l'atténue sinon. Sur 13 séquences testées, TRaIL-Odom obtient les meilleures performances globales de la comparaison. Sur trois séquences géométriquement dégénérées utilisées en ablation, la combinaison des deux modules réduit l'erreur RMSE de trajectoire absolue (ATE) de 86,0% et l'erreur relative (RTE) de 78,5% par rapport à une pondération fixe. Le problème visé est connu du secteur: la plupart des méthodes de fusion radar-LiDAR utilisent des poids fixes, alors que l'information exploitable du Doppler radar et de la géométrie LiDAR varie selon le scan et la direction, ce qui disperse mal l'information radar entre les axes de translation. Pour les intégrateurs de robots mobiles autonomes, de véhicules ou de drones opérant dans des environnements géométriquement pauvres (longs couloirs, tunnels, zones sans relief exploitable par le LiDAR), le résultat montre qu'une pondération consciente de la dégénérescence améliore nettement la robustesse de localisation sans capteur supplémentaire, par le seul traitement logiciel de données déjà disponibles. Il conforte l'idée que la fusion radar-LiDAR reste pertinente pour compenser les angles morts du LiDAR seul, notamment en conditions dégradées où le radar conserve un signal Doppler exploitable. Ce travail s'inscrit dans la lignée des systèmes d'odométrie multi-capteurs qui combinent la précision géométrique du LiDAR et la mesure directe de vitesse du radar, pour limiter la dérive des approches purement LiDAR-inertielles dans les scènes dégénérées. Il s'agit d'une contribution de recherche académique publiée en preprint, sans affiliation industrielle ni déploiement en conditions réelles mentionnés à ce stade, ni intégration chez un fabricant de robots. La publication du code et d'un jeu de données propre sur GitHub vise des comparaisons reproductibles avec les futures méthodes de fusion radar-LiDAR-IMU, dans un domaine où les benchmarks standardisés en environnements géométriquement dégénérés restaient jusqu'ici limités.

RecherchePaper
1 source
DogLegs : estimation robuste de l'état proprioceptif pour robots à pattes grâce à plusieurs IMU montées sur les pattes
63arXiv cs.RO 

DogLegs : estimation robuste de l'état proprioceptif pour robots à pattes grâce à plusieurs IMU montées sur les pattes

Une équipe de chercheurs a publié une version mise à jour sur arXiv (arXiv:2503.04580v3, soumission de type "replace") d'un système baptisé DogLegs, conçu pour l'estimation d'état proprioceptif des robots à pattes. Le système fusionne les mesures d'une centrale inertielle montée sur le corps du robot (Body-IMU), des encodeurs articulaires, et de plusieurs centrales inertielles supplémentaires fixées sur les pattes (Leg-IMU), le tout via un filtre de Kalman étendu (EKF) qui gère les états d'erreur de toutes les IMU simultanément. Les Leg-IMU servent à détecter le contact des pieds au sol, ce qui permet d'injecter des mesures de vitesse nulle pour recaler l'état de chaque patte, tandis que la cinématique des pattes fournit des contraintes de position relative entre le corps et les pattes pour corriger la dérive globale. Les auteurs rapportent, sur des expériences de terrain menées sur différents types de sols, une précision supérieure à la méthode classique d'odométrie par les pattes, qui ne s'appuie que sur la Body-IMU et les encodeurs. Le code et les jeux de données sont mis à disposition publiquement sur GitHub (YibinWu/DogLegs). L'enjeu dépasse la simple amélioration incrémentale: l'estimation d'état proprioceptif devient critique lorsque les capteurs extéroceptifs comme les LiDAR ou les caméras cessent de fonctionner de façon fiable, par exemple dans la fumée, la poussière, l'obscurité ou des environnements sans repères visuels exploitables. Pour les intégrateurs travaillant sur des robots quadrupèdes ou humanoïdes destinés à l'inspection industrielle, la recherche et sauvetage ou des missions en environnement extrême, disposer d'une estimation de position robuste sans dépendre de la vision constitue une brique fondamentale souvent négligée face aux annonces plus spectaculaires sur la marche ou la manipulation. La mise à disposition ouverte du code abaisse aussi la barrière d'entrée pour la communauté de recherche en locomotion. Il s'agit ici d'une contribution académique et non d'un produit commercial ou d'un déploiement industriel: le papier, republié dans une version révisée, s'inscrit dans la lignée des travaux sur l'odométrie par les pattes, historiquement limitée par la dérive sur terrains meubles ou glissants et par la fiabilité de la détection de contact. L'approche multi-IMU proposée ici se positionne comme une alternative complémentaire aux méthodes de fusion visuelle-inertielle ou LiDAR-inertielle utilisées par d'autres équipes travaillant sur des plateformes comme celles d'ANYbotics ou d'Unitree, sans qu'aucune intégration commerciale ne soit annoncée à ce stade.

RecherchePaper
1 source
FailBench : les modèles vision-langage sont-ils fiables pour juger la réussite des tâches robotiques ?
64arXiv cs.RO 

FailBench : les modèles vision-langage sont-ils fiables pour juger la réussite des tâches robotiques ?

Des chercheurs présentent FailBench, un benchmark conçu pour mesurer la fiabilité des modèles vision-langage (VLM) lorsqu'ils sont utilisés comme juges automatiques du succès ou de l'échec des tâches de manipulation robotique. L'ensemble compile 2 197 tentatives de manipulation issues de 14 sources publiques, dont 12 jeux de données réels et 2 simulés ; 75% des échecs y surviennent naturellement, sans être provoqués pour les besoins du test, et six des sources réelles ne sont pas conçues à l'origine pour la détection d'échec. Les auteurs évaluent 13 détecteurs basés sur des VLM : le meilleur modèle plafonne à seulement 0,77 de précision équilibrée moyenne, un score modeste pour une tâche de classification binaire réussite/échec. Fait notable, les modèles spécifiquement affinés (fine-tunes) pour la détection d'échec obtiennent des résultats systématiquement inférieurs à ceux des VLM généralistes et même à leurs propres versions pré-entraînées non spécialisées. Ce résultat questionne directement une hypothèse répandue dans l'écosystème des VLA (vision-language-action) et de la supervision automatisée de robots : que des modèles de fondation généralistes, une fois affinés sur des données spécialisées, deviennent mécaniquement de meilleurs juges de tâche. FailBench montre l'inverse, avec un écart de performance particulièrement marqué selon le type de tâche observée : les modèles approchent la saturation quand le succès dépend d'un mouvement d'objet visible et facilement observable, mais retombent près du niveau du hasard, sous 0,60 de précision équilibrée, sur des tâches d'assemblage à fort contact physique où l'échec n'est pas visuellement évident. Pour les intégrateurs et équipes qui envisagent d'automatiser la supervision qualité de lignes robotisées avec des VLM, à Nvidia le comportement de GR00T N2 ou d'autres pipelines VLA, ces chiffres suggèrent qu'une confiance aveugle dans un détecteur automatique reste risquée sur les tâches d'assemblage fin, précisément là où l'erreur coûte le plus cher en production. L'analyse d'erreur des auteurs révèle un biais systématique des modèles à prédire un succès par défaut lorsque la preuve visuelle est ambiguë, un biais qui persiste même en augmentant l'effort de raisonnement alloué au modèle, ce qui limite l'intérêt du simple scaling de compute au moment de l'inférence pour corriger ce défaut. En revanche, une intervention plus ciblée au niveau de l'entrée, la localisation spatiale et le recadrage automatique des régions de l'image pertinentes pour le résultat, améliore le meilleur détecteur de 2,4 points de pourcentage sans entraînement supplémentaire. FailBench s'inscrit dans une lignée de benchmarks cherchant à combler l'écart entre démonstrations en conditions contrôlées et fiabilité réelle des systèmes de perception robotique, un enjeu central alors que les VLM sont de plus en plus proposés comme couche de supervision autonome pour des flottes de robots manipulateurs en usine ou en entrepôt.

RecherchePaper
1 source
BRIDGE : une plateforme humanoïde open source par co-conception morphologie-contrôle pour l'IA physique
65arXiv cs.RO 

BRIDGE : une plateforme humanoïde open source par co-conception morphologie-contrôle pour l'IA physique

Bridge rejoint une catégorie de plateformes humanoïdes compactes et open source aux cotes de Toddlerbot, K1 et Bumi, conçues comme des bancs d'essai de recherche a bas cout plutôt que des produits commerciaux, a l'oppose des humanoïdes adultes fermes vises pour l'usine ou l'entrepôt par les grands acteurs prives du secteur. Publiee sur arXiv sous la référence 2609.03497, l'étude présente Bridge, un humanoïde open source de 88 centimètres conçu via un cadre de co-design reliant morphologie et contrôle moteur complet du corps. Plutot que de dessiner d'abord le squelette puis d'y greffer une politique de contrôle, comme le fait l'approche classique, les chercheurs optimisent conjointement la structure physique et la capacité du robot a reproduire des mouvements humains. Ils introduisent aussi une métrique inédite combinant fidélité de retargeting cinématique et performance de suivi dynamique. Face a trois références, Bumi, K1 et Toddlerbot, Bridge obtient les meilleurs scores sur toutes les métriques, avec une locomotion stable, un équilibre robuste et des mouvements dynamiques avances. Le robot, sa politique de contrôle et les vidéos de démonstration sont publies en accès libre. Cette publication pointe un problème structurel de la robotique humanoïde actuelle : la séparation entre conception mécanique et développement du contrôle produit des machines dont les mouvements restent rigides face a ceux d'un humain. En dimensionnant le corps du robot a partir des données de mouvement humain a reproduire, Bridge vise a améliorer la qualité des données capturées par téléopération, un enjeu direct pour l'entrainement des modèles vision-langage-action (VLA) dont les performances dépendent de la fidélité geste-machine. Pour les laboratoires et intégrateurs travaillant sur l'apprentissage par imitation, ce travail suggère que le goulot d'étranglement se situe autant dans la conception matérielle que dans les algorithmes, un facteur souvent éclipse par la course aux annonces de modèles de fondation. En publiant intégralement design, politique de contrôle et outils associes, les auteurs misent sur une adoption académique plutôt que sur une mise sur le marche. Le papier ne mentionne aucun partenariat industriel ni calendrier de déploiement au-delà de cette mise a disposition en open source, laissant présager une diffusion progressive du cadre de co-design vers d'autres équipes de recherche cherchant a améliorer la fidélité de mouvement de leurs propres plateformes.

RecherchePaper
1 source
Voir moins ne veut pas dire protéger : fuite de vie privée par les exports de perception robotique limités à la tâche
66arXiv cs.RO 

Voir moins ne veut pas dire protéger : fuite de vie privée par les exports de perception robotique limités à la tâche

Des chercheurs publient TFPD (Task-Functional Perception Distillation), un cadre qui garde la perception brute d'un robot domestique en local et ne profile que les exports destinés aux planificateurs, services cloud, journaux ou pipelines d'apprentissage, en évaluant leur utilité pour la tâche, leur exposition directe et les risques d'inférence résiduelle. L'étude repose sur 120 scènes AI2-THOR avec des découpages train/validation/test disjoints par scène, une sélection d'attaquants figée à l'avance et des attaques adaptées à chaque représentation, testées sur la navigation, la vérification de collision et l'exécution d'objectifs orientés objets. Trois exports de navigation atteignent un taux de réussite identique de 1,000 et un ratio de chemin moyen de 0,898, mais leur "linkability" au niveau de la représentation varie de 0,532 à 0,970. Remplacer une étiquette de cible explicite par une région cible fait chuter le macro-F1 de catégorie de cible de 1,000 à 0,077 tout en maintenant un taux de réussite de 0,995, tandis qu'un lissage géométrique fait passer le macro-F1 de catégorie d'objet de 0,704 à 0,556, au prix d'une dégradation mesurable de l'utilité pour la détection de collision. Une réplication sur ProcTHOR confirme le constat central mais change le classement relatif des exports normalisés et topologiques. Ces résultats intéressent directement les intégrateurs et décideurs qui déploient des robots domestiques : ils démontrent qu'atteindre une performance de tâche identique ne garantit en rien un niveau de confidentialité équivalent entre représentations de perception, et qu'il n'existe pas d'ordre universel de confidentialité entre suppression de champs et abstraction géométrique renforcée. Autrement dit, "voir moins de données brutes" ne signifie pas "voir de façon sûre" : des représentations en apparence appauvries peuvent rester hautement identifiables via la géométrie, la structure spatiale ou la sémantique résiduelle. Cela contredit l'hypothèse répandue selon laquelle limiter les données exportées suffit à protéger la vie privée, et impose une évaluation multi-risque spécifique à chaque tâche plutôt qu'une règle générique de minimisation. Le travail s'inscrit dans la lignée des recherches sur la confidentialité en robotique domestique, un champ jusqu'ici centré sur la protection des flux de capteurs bruts (caméras, LiDAR) plutôt que sur les représentations structurées transmises en aval. Les auteurs positionnent TFPD comme un complément à ces approches, en ciblant spécifiquement les exports fonctionnels utilisés par les modules de planification et d'apprentissage, un angle mort identifié dans les pipelines actuels de robots d'intérieur. Les prochaines étapes annoncées incluent l'extension du protocole d'évaluation à davantage de types d'attaques et de représentations, ainsi qu'une validation sur des environnements physiques réels au-delà des simulateurs AI2-THOR et ProcTHOR utilisés dans cette étude.

RecherchePaper
1 source
MulDP : politique de diffusion multimodale pour la navigation parkour autonome d'un quadrupède en terrains complexes
67arXiv cs.RO 

MulDP : politique de diffusion multimodale pour la navigation parkour autonome d'un quadrupède en terrains complexes

Des chercheurs ont présenté MulDP (Multimodal Diffusion Policy), décrit dans un article publié en septembre 2026 sur arXiv (arXiv:2609.03984), pour rendre autonome la navigation parkour des robots quadrupèdes. Jusqu'ici, la plupart des systèmes de ce type, même capables de franchir des obstacles complexes, dépendent encore d'un opérateur humain pour la planification de haut niveau. MulDP fusionne perception visuelle, proprioception et information d'objectif pour générer des commandes de vitesse cohérentes et anticipatrices, couplant étroitement perception et contrôle. Les auteurs ont aussi constitué le premier jeu de données dédié à cette tâche, le Quadruped Parkour Navigation Dataset (QPND), couvrant des comportements de navigation variés sur des terrains complexes, et démontrent en simulation comme sur robot réel une navigation autonome robuste sur de longs horizons. Ce résultat vise un goulot d'étranglement connu du secteur : les démonstrations spectaculaires de parkour quadrupède restent souvent scriptées ou pilotées à distance pour la décision de trajectoire, même quand la locomotion bas niveau est déjà autonome. En confiant cette décision à un modèle de diffusion multimodal plutôt qu'à un contrôleur réactif classique, les auteurs cherchent à combler l'écart entre agilité motrice et autonomie cognitive, un enjeu concret pour les intégrateurs voulant déployer des quadrupèdes en inspection ou intervention sur sites accidentés sans supervision humaine constante. La publication du dataset QPND compte potentiellement autant que le modèle lui-même : faute de données standardisées, chaque équipe devait jusqu'ici constituer ses propres scénarios de test, ce qui limitait la comparabilité des résultats entre laboratoires. Le travail s'inscrit dans une lignée de recherches portée par des plateformes comme Spot de Boston Dynamics, ANYmal d'ANYbotics ou les séries Go2 et B2 de Unitree, qui ont démontré des capacités de franchissement d'obstacles impressionnantes mais rarement autonomes de bout en bout. MulDP se positionne face aux approches de contrôle par apprentissage par renforcement pur, en misant sur les modèles de diffusion déjà popularisés en manipulation robotique par des politiques comme Diffusion Policy ou des architectures vision-langage-action telles que Pi-0 et GR00T N2. À ce stade, il s'agit d'une contribution de recherche validée en simulation et sur banc d'essai réel, sans déploiement industriel ni partenariat commercial annoncé, mais QPND ouvre la voie à des comparaisons futures pour d'autres équipes académiques ou industrielles travaillant sur l'autonomie des robots à pattes.

RecherchePaper
1 source
Détecter la modalité qui compte : régularisation à seuil probant pour des politiques VLA robustes
68arXiv cs.RO 

Détecter la modalité qui compte : régularisation à seuil probant pour des politiques VLA robustes

Une équipe de recherche publie sur arXiv (2609.03142) une méthode nommée Evidence-Gated Regularization (EGR) pour fiabiliser les politiques Vision-Language-Action (VLA), qui fusionnent caméras, capteurs tactiles et autres entrées pour piloter un robot. Entraînées sur des démonstrations limitées, ces politiques confondent souvent corrélation entre capteurs et signal utile, un biais nommé modality entanglement qui rend le robot inutilement sensible à la corruption d'un capteur non pertinent et vulnérable si un seul capteur informatif reste disponible. EGR calcule un signal de pertinence par capteur et par image, pour imposer une invariance sur les capteurs peu informatifs et une suffisance mono-capteur sur les plus informatifs, sans surcoût à l'inférence. Testée sur un benchmark dérivé de BEHAVIOR-1K et sur deux robots réels (bi-manuel à deux bras Kinova avec trois caméras RGB ; bras MELFA ASSISTA combinant vision et tactile GelSight), elle porte le taux de réussite de 12,5% à 16,4%, et jusqu'à 85% contre 30% face à des distracteurs physiques. Ces résultats questionnent l'idée reçue selon laquelle empiler des capteurs suffit à rendre une politique VLA robuste : une fusion mal régularisée crée une fragilité invisible en environnement contrôlé mais critique face aux occlusions, un objectif sali ou un capteur tactile hors service, situations courantes en usine ou en entrepôt. Pour les intégrateurs qui évaluent des piles VLA comme Pi-0, GR00T N2 ou Helix, cela ajoute un critère de test souvent négligé : la robustesse à la perte partielle de capteurs, distincte du taux de réussite en conditions nominales. Les VLA se sont imposées comme paradigme dominant pour piloter robots et bras manipulateurs par instructions en langage naturel, portées par des modèles comme RT-2, Pi-0 ou GR00T N2, mais leur fragilité aux perturbations sensorielles reste documentée par plusieurs équipes académiques. Le benchmark BEHAVIOR-1K, conçu à l'origine par Stanford pour évaluer des robots domestiques en simulation, sert ici de socle à une suite de diagnostic ciblant cet enchevêtrement de modalités. EGR reste un résultat de recherche sans lien annoncé avec un produit commercial ; sa validation sur deux robots aux embodiments différents, Kinova et Mitsubishi Electric, suggère une méthode générique et transférable à d'autres piles VLA.

RecherchePaper
1 source
SPARC : une colonne vertébrale prismatique et rotative pour un bond quadrupède plus rapide
69arXiv cs.RO 

SPARC : une colonne vertébrale prismatique et rotative pour un bond quadrupède plus rapide

Une équipe de chercheurs a publié sur arXiv (arXiv:2510.01984, v4) une étude sur SPARC (Spine with Prismatic And Revolute Compliance), colonne vertébrale robotique de 1,26 kg à 3 degrés de liberté combinant rotation et translation prismatique dans le plan sagittal, avec raideur et amortissement réglables indépendamment via un contrôleur d'impédance à base flottante. Des tests sur banc montrent une raideur axiale mesurée conforme aux valeurs commandées à 1,5% près. Intégré à un quadrupède à 8 degrés de liberté, le dispositif a été testé sur 97 essais de course bondissante, comparant trois configurations: colonne en impédance active, colonne fixée en position, et colonne rigide légère. La version en impédance atteint 1,029 m/s, contre 0,769 m/s en position fixe et 0,673 m/s en rigide, des gains de 34% et 53%. Code et plans matériels sont publiés en open source sur GitHub (YueWang996/sparc). L'étude répond à une question ouverte de la robotique quadrupède: un contrôle actif de la compliance spinale fait-il mieux qu'un ressort passif fixe ou un tronc rigide? Oui: le gain de vitesse provient d'un mouvement axial plus ample et d'un échange de puissance mécanique accru au niveau de la colonne, pas des seules pattes. Pour les concepteurs de quadrupèdes de recherche ou d'inspection, dans la lignée du MIT Cheetah ou face aux troncs rigides des quadrupèdes commerciaux type Unitree, cela relance l'intérêt d'une colonne activement pilotée plutôt que passive. L'étude nuance toutefois ce résultat: à vitesse égale, la version en impédance consomme électriquement plus que la colonne rigide, un compromis vitesse/efficacité loin d'un gain gratuit. SPARC prolonge des observations de biomécanique selon lesquelles les mammifères quadrupèdes, du guépard au chien, couplent flexion spinale et extension/compression axiale pour courir plus vite, un mécanisme que la plupart des robots actuels ignorent en optant pour un tronc rigide ou une compliance passive à raideur fixe. Il s'agit d'un travail de recherche académique en preprint (version de remplacement, v4), code et matériel ouverts, non d'un produit ou d'un déploiement industriel: aucun partenaire, date de commercialisation ni pilote n'est mentionné. Les suites logiques, non précisées par les auteurs, seraient la validation sur d'autres allures comme le trot ou le galop et la réduction du surcoût énergétique observé.

RecherchePaper
1 source
R2S-Eval : évaluation de robots par calibration réel-vers-simulation via des modèles vision-langage
70arXiv cs.RO 

R2S-Eval : évaluation de robots par calibration réel-vers-simulation via des modèles vision-langage

Des chercheurs ont mis en ligne sur arXiv, courant septembre 2026, un article (arXiv:2609.03276) décrivant R2S-Eval, un pipeline d'évaluation pour les politiques de manipulation robotique, en particulier les modèles vision-langage-action (VLA) déployés sur des robots physiques. Le système combine une calibration "real-to-sim", où le simulateur est ajusté pour reproduire fidèlement les conditions d'un banc d'essai réel, avec un modèle vision-langage (VLM) chargé de juger la qualité des vidéos de rollout générées en simulation. Plutôt que de mesurer uniquement un taux de succès binaire, le VLM compare les vidéos par paires et produit des préférences agrégées ensuite en classements de politiques. Les auteurs ont testé la méthode à la fois en simulation et sur des essais réels, montrant des classements stables et reproductibles, en accord avec les préférences de juges humains, tout en réduisant fortement le nombre d'essais matériels nécessaires. Une page projet dédiée (r2s-eval.github.io) accompagne la publication. Pour l'industrie robotique, cette contribution s'attaque à un problème concret et coûteux: évaluer une politique VLA sur du matériel réel exige des essais répétés, des remises en scène manuelles et une surveillance humaine continue, un processus qui peut produire des classements différents d'une session à l'autre et qui ne capture pas la qualité d'exécution, fluidité, précision, comportements de récupération, au-delà du simple succès ou échec. En automatisant une part de cette évaluation via la simulation calibrée et un juge VLM, R2S-Eval offre aux intégrateurs et équipes R&D un moyen de comparer des politiques concurrentes plus vite et de façon plus fiable, sans multiplier les cycles d'essais physiques onéreux. C'est un signal que le secteur cherche à combler l'écart entre les démonstrations spectaculaires de modèles VLA et une méthodologie d'évaluation rigoureuse, préalable à toute commercialisation sérieuse de politiques génératives sur des flottes de robots. Cette proposition s'inscrit dans une vague plus large de modèles VLA génériques, dans la lignée de familles comme Pi-0, GR00T N2 ou Helix évoquées dans la littérature récente, conçus pour généraliser des tâches de manipulation à partir d'apprentissage multimodal, où l'évaluation fiable reste un angle mort largement sous-traité comparé aux annonces de capacités. Le protocole proposé vise justement à vérifier que ce pipeline automatisé aboutit aux mêmes conclusions qu'une évaluation réelle exhaustive, condition nécessaire avant toute adoption large. L'article ne mentionne ni partenariat industriel, ni déploiement commercial, ni calendrier de disponibilité d'un outil package: il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, dont la reprise par d'autres laboratoires déterminera l'impact réel sur les pratiques de benchmarking en robotique.

RecherchePaper
1 source
Contrôle en temps réel de la forme de bras robotiques souples multi-segments par opérateurs de Koopman à observables globaux et locaux
71arXiv cs.RO 

Contrôle en temps réel de la forme de bras robotiques souples multi-segments par opérateurs de Koopman à observables globaux et locaux

Une équipe de recherche a publié sur arXiv (référence 2609.03175) un article décrivant un cadre de contrôle prédictif basé sur les opérateurs de Koopman pour piloter en temps réel la forme complète de bras robotiques souples à segments multiples, et non plus seulement la position de leur extrémité. Le système combine des observables dites globales, qui décrivent la forme dans le repère du bras entier, et des observables locales, propres à chaque segment, afin de mieux gérer le couplage entre segments, les charges dues à la gravité et les effets inertiels qui s'accentuent avec le nombre de segments. Les essais numériques démontrent le passage à l'échelle du contrôleur jusqu'à dix segments actionnés indépendamment. Sur banc physique, des bras à trois et cinq segments ont été pilotés à des vitesses de pointe allant jusqu'à 0,6 m/s, avec des charges utiles déportées de 400 grammes sans réentraînement du modèle, une récupération après une perturbation latérale de 7 newtons, et une démonstration en espace confiné évoquant des applications d'inspection. L'enjeu dépasse la prouesse académique: pour un bras souple, contrôler uniquement la position du bout de bras est insuffisant dans les espaces contraints, où c'est la forme de tout le corps qui doit éviter les obstacles, typiquement lors d'inspections de conduites, de cavités ou d'environnements nucléaires. Les approches précédentes ne corrigeaient que l'erreur de forme dans le repère global, ce qui devient inadapté dès que le nombre de segments augmente et que les interactions mécaniques internes prennent le dessus. En démontrant une commande robuste sans réentraînement face à des charges et des perturbations externes, ces travaux réduisent l'écart entre les démonstrations de laboratoire et une utilisation fiable en conditions réelles, un point de blocage classique en robotique souple. Le résultat s'inscrit dans un courant de recherche qui cherche à rendre exploitable la dynamique fortement non linéaire des continuums souples, en s'appuyant sur la théorie de Koopman pour en obtenir une approximation linéaire compatible avec un contrôle prédictif en temps réel. Il s'agit d'un travail de recherche à un stade préliminaire, validé en simulation et sur prototype physique, sans acteur industriel ni calendrier de déploiement annoncés; la démonstration en espace confiné est présentée comme une preuve de potentiel pour de futures applications d'inspection, plutôt qu'un produit prêt à être commercialisé.

RecherchePaper
1 source
Programmation et exécution de tâches collaboratives homme-robot-grue basées sur des compétences
72arXiv cs.RO 

Programmation et exécution de tâches collaboratives homme-robot-grue basées sur des compétences

Un système de programmation et d'exécution de compétences robotiques ("skills") destiné à la fabrication et à la logistique intérieure a été détaillé dans un article déposé sur arXiv début septembre 2026 (référence 2609.03392). L'outil repose sur une interface de programmation basée sur des modèles CAD, pensée pour rester simple d'usage, qui permet de définir des compétences paramétrées ainsi que des moniteurs chargés de superviser leur exécution. La brique de contrôle qui orchestre ces compétences s'appuie sur un arbre de comportement (Behavior Tree) modifié, rendu dynamique et paramétrable, où toute la communication entre modules passe exclusivement par des événements plutôt que par un séquencement rigide. Comme cas de test, les auteurs présentent une tâche collaborative associant un humain, un pont roulant (overhead crane) et un bras manipulateur : l'opérateur pilote simultanément la grue, qui porte un objet lourd, et le manipulateur, qui guide et affine le positionnement de cet objet jusqu'à son insertion dans l'emplacement cible. L'intérêt pour l'industrie tient au problème que le papier cible directement : la multiplication de séries de production très variées oblige les lignes robotisées à gagner en agilité et en robustesse, ce que la programmation robot classique, point à point et rigide, gère mal dès qu'un paramètre change. L'approche par compétences réutilisables, combinant mouvement, opération d'outil et perception capteur, vise justement à éviter une reprogrammation complète à chaque nouvelle configuration. Pour les intégrateurs, le scénario grue-robot-humain touche un point sensible de l'assemblage lourd, où la coordination temps réel entre opérateur et machines reste aujourd'hui largement manuelle. Il s'agit toutefois d'une démonstration de recherche sur un cas d'usage unique, pas d'un produit commercialisé ni d'un déploiement industriel chiffré : aucun temps de cycle, volume de production ou site client n'est communiqué dans le résumé. Ce travail s'inscrit dans une tendance plus large de la robotique industrielle, qui délaisse progressivement le codage bas niveau au profit d'architectures de contrôle modulaires et réactives inspirées des Behavior Trees, déjà répandus en robotique mobile et en jeu vidéo. Le papier ne précise ni les auteurs institutionnels ni de calendrier de suite, se limitant à valider le concept sur ce scénario expérimental de manutention collaborative.

RecherchePaper
1 source
ARTiS : une pince robotique adaptative pour une manipulation d'outils améliorée en désassemblage
73arXiv cs.RO 

ARTiS : une pince robotique adaptative pour une manipulation d'outils améliorée en désassemblage

Une équipe de recherche présente ARTiS (Adaptive Robotic Tool Gripper in Disassembly Systems), une pince robotique conçue pour saisir et manipuler des outils lors d'opérations de désassemblage industriel, décrite dans un article publié le 3 septembre 2026 sur arXiv (2609.03362). ARTiS combine trois approches habituellement séparées : l'adaptabilité des pinces souples, la dextérité des mains anthropomorphes et la robustesse des mécanismes rigides, via une paume et des bouts de doigts souples. La préhension s'appuie sur du jamming actif (blocage par le vide) dans la paume et sur une adaptation de type fin-ray au niveau des doigts, qui épousent la forme de l'outil saisi. La pince dispose de sept degrés de liberté, permettant à chaque bout de doigt de s'orienter sur n'importe quelle surface, aussi bien pour des tâches automatisées que collaboratives. Les chercheurs ont testé le système sur une gamme d'outils de désassemblage conventionnels pour évaluer sa compliance mécanique, sa durabilité et sa polyvalence fonctionnelle. Le code, les instructions matérielles et des vidéos de démonstration sont disponibles sur le site du projet. Pour l'industrie robotique, ce travail s'attaque à un problème concret et sous-traité par les solutions actuelles : maintenir un outil de façon stable et fiable pendant qu'on l'utilise activement, un défi que même les préhenseurs adaptatifs récents peinent à résoudre de manière générique. Le désassemblage, contrairement à l'assemblage, implique des pièces usées, des tolérances variables et des outils hétérogènes, ce qui rend les pinces rigides classiques peu robustes et les pinces souples pures insuffisamment précises. Une solution hybride crédible intéresserait directement les intégrateurs travaillant sur le reconditionnement, le recyclage électronique ou la maintenance industrielle, secteurs où la préhension d'outils reste largement manuelle. Il s'agit toutefois d'un prototype de recherche académique évalué en laboratoire, pas d'un produit commercialisé ni déployé en usine. ARTiS s'inscrit dans la lignée des recherches en préhension hybride mêlant matériaux souples et actionnement rigide, un axe déjà exploré par plusieurs laboratoires universitaires pour combler l'écart entre dextérité humaine et robustesse mécanique. L'article ne précise pas l'institution ni les auteurs dans le résumé, mais renvoie vers une page projet dédiée pour les détails matériels. Aucun partenaire industriel, calendrier de commercialisation ni comparaison chiffrée avec des préhenseurs concurrents n'est mentionné à ce stade, ce qui situe cette publication au stade de preuve de concept plutôt que de solution prête à intégrer.

RecherchePaper
1 source
Une seule démonstration, plusieurs objets : généraliser la manipulation par la géométrie de contact locale
74arXiv cs.RO 

Une seule démonstration, plusieurs objets : généraliser la manipulation par la géométrie de contact locale

Des chercheurs ont publié sur arXiv (arXiv:2609.01938v2, version corrigée) une méthode baptisée DemoMimic, pour Dexterous Motion Mimic, destinée au pilotage de mains robotiques multi-doigts. Le système apprend à partir de démonstrations humaines plutôt que par téléopération robotique, une alternative jugée plus facile à faire passer à l'échelle pour ce type de tâche. Sa particularité tient à des récompenses centrées sur le contact, qui poussent la politique à se concentrer sur la géométrie locale autour des points de contact avec l'objet plutôt que sur sa forme globale. En conditions réelles, la politique unique obtenue atteint 71% de réussite sur un ensemble de 16 objets, 4 tâches de manipulation et 2 mains robotiques différentes, avec le plus faible écart entre simulation et réel observé face aux méthodes comparées. Le problème visé est connu du secteur de la manipulation dextre: collecter des données à grande échelle pour des mains multi-doigts reste coûteux et lent, et les méthodes récentes d'apprentissage par renforcement sim-to-real échouent souvent sur deux points, soit elles négligent les récompenses de contact précis et performent mal une fois transférées au réel, soit elles généralisent mal à des objets jamais vus à l'entraînement. En démontrant qu'une seule politique reste efficace sur des objets de forme, taille, masse et friction variables, et sur deux embodiments matériels distincts, ces travaux apportent un argument concret en faveur d'une manipulation dextre généralisable sans réentraînement par objet, un point clé pour des applications industrielles où la variété des pièces manipulées est grande. Le papier s'inscrit dans la vague actuelle de recherche sur l'apprentissage par imitation et les politiques de contrôle sim-to-real pour la robotique dextre, un domaine où les mains à plusieurs doigts restent nettement plus difficiles à maîtriser que les pinces industrielles classiques. Il s'agit à ce stade d'une contribution académique publiée en prépublication, testée en laboratoire sur un nombre limité d'objets et de tâches, sans annonce de partenariat industriel, de licence ou de déploiement commercial. La suite logique évoquée par les auteurs porterait sur l'élargissement du nombre d'objets, de tâches et d'embodiments testés pour confirmer la robustesse de l'approche au-delà du cadre expérimental actuel.

RecherchePaper
1 source
Repenser les modèles du monde pour les systèmes incarnés à sécurité critique
75arXiv cs.RO 

Repenser les modèles du monde pour les systèmes incarnés à sécurité critique

Un article de perspective mis en ligne sur arXiv (référence 2609.03774v1, cross-listing) remet en cause l'approche dominante de construction des "world models", ces modèles qui simulent l'environnement d'un système embarqué. Passés de représentations latentes compactes à des simulateurs génératifs interactifs produisant des vidéos photoréalistes, ces modèles sont aujourd'hui jugés sur leur vraisemblance statistique et leur fidélité visuelle, deux critères insuffisants pour garantir une décision sûre. Les auteurs identifient trois décalages structurels: vraisemblance contre risque, prédiction contre intervention, et horizon de prédiction fini contre conséquences accumulées dans le temps. Ils proposent le Risk-Informed World Model (RIWM), une architecture organisée autour des conséquences, de l'intervention, de l'incertitude épistémique et de la récupérabilité, qui combine quatre capacités interdépendantes: une représentation orientée décision, un raisonnement contrefactuel, une mémoire épisodique dédiée à la sécurité, et une assurance de sécurité au moment de l'exécution. Le constat vise directement les modèles de fondation robotique et les simulateurs utilisés pour entraîner des systèmes autonomes, véhicules, robots humanoïdes ou bras industriels, où une vidéo prédite plausible peut masquer une erreur dangereuse sur les conséquences réelles d'une action. En distinguant conséquences physiques, sociales et opérationnelles, et en conditionnant chaque prédiction à un niveau d'incertitude épistémique, RIWM conteste l'hypothèse implicite selon laquelle une meilleure fidélité perceptuelle garantit une meilleure sécurité de décision, un point sensible pour les intégrateurs qui évaluent aujourd'hui les modèles VLA et les simulateurs génératifs sur la qualité visuelle plutôt que sur leur capacité réelle à prévenir un incident. Ce travail s'inscrit dans l'évolution récente des world models, passés de modèles de dynamique latente de type Dreamer à des simulateurs génératifs interactifs capables de produire des environnements explorables en temps réel. Plutôt qu'un produit ou un pilote déployé, les auteurs posent un programme de recherche ouvert: identifier quels futurs sont réellement critiques pour la sécurité, valider empiriquement le raisonnement contrefactuel, maintenir des mémoires de sécurité révisables dans le temps, traduire des conséquences apprises en contraintes exécutables par un système embarqué, et déterminer à quel niveau de preuve un agent peut agir plutôt que devoir détecter, différer ou s'abstenir. Aucun acteur industriel ni calendrier de déploiement n'est mentionné, ce travail relevant du positionnement académique et non d'une annonce commerciale.

RecherchePaper
1 source
Comparaison quantitative du contrôle centralisé et distribué par apprentissage par renforcement pour bras robotiques souples
76arXiv cs.RO 

Comparaison quantitative du contrôle centralisé et distribué par apprentissage par renforcement pour bras robotiques souples

Une étude parue sur arXiv (2511.02192, version révisée) compare deux architectures d'apprentissage par renforcement multi-agent pour piloter un bras robotique souple, modélisé en simulation comme une tige de Cosserat via PyElastica et l'interface OpenAI Gym. Sous budget d'entraînement identique, les auteurs opposent un contrôleur centralisé global fondé sur Proximal Policy Optimisation (PPO) à une version distribuée multi-agent, MAPPO, le bras étant découpé en n sections contrôlées indépendamment. Trois scénarios sont testés en faisant varier n : atteinte d'une cible en conditions nominales, récupération après perturbation externe, et adaptation à une panne d'actionneur, évalués via amplitude d'action, distance finale à la cible, longueur d'épisode et taux de réussite. Les résultats révèlent un arbitrage net. Pour n≤4, la politique distribuée n'apporte aucun gain mesurable, et pour n≤2 la politique centralisée reste supérieure. Entre 4 et 12 sections, la version distribuée prend l'avantage : meilleur taux de réussite, meilleure résilience aux perturbations et aux pannes d'actionneurs, robustesse accrue en observabilité locale, convergence plus rapide à volume d'échantillons égal. La politique centralisée demeure toutefois bien plus rapide en temps de calcul réel pour entraîner un même volume d'échantillons. Pour la robotique souple, domaine où le contrôle reste un verrou faute de modèles dynamiques fiables, cette grille de décision (nombre de sections, budget de calcul disponible, besoin de tolérance aux pannes) aide à choisir une architecture avant un transfert sim-to-real, historiquement fragile pour ces manipulateurs continus de type tige. Le travail s'inscrit dans les efforts pour étendre l'apprentissage multi-agent, déjà éprouvé en robotique modulaire ou en essaims, au contrôle d'organes continus souples, un terrain moins documenté. La modélisation en tige de Cosserat, standard en simulation de robotique souple, capte la déformation continue du bras sans discrétisation rigide artificielle. En balayant systématiquement une plage de complexité de 2 à 12 sections plutôt qu'un cas unique, l'étude dépasse la démonstration ponctuelle pour proposer une méthode reproductible de dimensionnement des architectures de contrôle. Les auteurs présentent ces résultats comme un point de départ pour de futurs transferts sim-to-real sur bras souples, sans validation sur robot physique ni calendrier annoncé à ce stade : le travail reste pour l'instant purement en simulation.

RecherchePaper
1 source
GIFT : entraînement guidé de caractéristiques intermédiaires par supervision structurelle orientée action pour la manipulation robotique
77arXiv cs.RO 

GIFT : entraînement guidé de caractéristiques intermédiaires par supervision structurelle orientée action pour la manipulation robotique

Une équipe de recherche publiant sous le nom OpenPhoenix a mis en ligne sur arXiv, en septembre 2026 (référence 2609.04193v1), un article décrivant GIFT (Guided Intermediate Feature Training), une méthode d'entraînement pour les politiques robotiques de manipulation fondées sur les modèles vision-langage-action (VLA) et les modèles monde-action (World-Action Model, WAM). Le travail cible ce que les auteurs appellent le "fossé de suffisance d'action" : les objectifs classiques de pré-entraînement vision-langage et de prédiction du monde capturent une richesse visuelle qui n'est pas toujours utile au contrôle moteur. GIFT impose trois contraintes structurelles pendant l'entraînement : alignement géométrique pour la faisabilité du mouvement, prédiction d'affordance pour repérer les entités pertinentes à l'instruction, et reconstruction de la région-objectif pour ancrer l'instruction dans la zone de la tâche. La méthode a été testée sur trois architectures, une politique VLA, un WAM à action directe et un WAM à dynamique inverse, et évaluée en transfert zéro-shot sur les bancs d'essai de simulation LIBERO-Plus et RoboCasa. Sur LIBERO-Plus, les variantes GIFT atteignent 79,6%, 72,6% et 87,8% de taux de réussite, soit des gains de 4,6, 12,6 et 5,2 points par rapport aux modèles de référence StarVLA-OFT et Fast-WAM. Sur RoboCasa, les scores montent à 61,4%, 83,6% et 82,3%, avec des gains de 12,6, 9,0 et 8,4 points respectivement. Il s'agit d'une contribution académique et non d'un produit commercial ou d'un déploiement industriel : aucun robot physique commercialisé n'est associé à cette publication, et les chiffres proviennent de bancs d'essai de simulation utilisés par la communauté recherche en manipulation robotique. Leur intérêt pour les intégrateurs et les équipes R&D tient à la méthode elle-même : GIFT montre qu'imposer une structure fonctionnelle explicite aux caractéristiques intermédiaires d'un modèle, plutôt que de laisser le seul pré-entraînement vision-langage dicter la représentation, améliore la généralisation sous perturbations visuelles et spatiales inédites, avec des gains particulièrement marqués sur les tâches d'objets articulés et la manipulation de précision. Ce résultat pèse dans le débat sur la solidité réelle des architectures VLA à grande échelle : il suggère que le simple passage à l'échelle du pré-entraînement ne suffit pas à combler l'écart entre démonstration et robustesse réelle, et qu'une supervision structurée reste nécessaire quel que soit le formalisme d'action retenu par le modèle. Le papier s'inscrit dans une vague de recherche visant à combler l'écart entre les démonstrations spectaculaires de robots pilotés par des modèles de fondation et leur fiabilité en conditions réelles, un chantier où s'affrontent notamment Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, tous conçus pour généraliser des compétences de manipulation à partir de données multimodales. GIFT se positionne comme une couche d'entraînement complémentaire plutôt que comme un modèle concurrent, puisqu'il s'applique par-dessus des architectures existantes sans modifier leur formalisme d'action natif. L'article ne mentionne ni partenaire industriel ni calendrier de déploiement ; les auteurs renvoient vers une page de projet dédiée pour le code et les détails techniques, ce qui situe la publication au stade recherche, en amont de toute intégration en environnement industriel.

RechercheActu
1 source
WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action
78arXiv cs.RO 

WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action

Un article publié le 3 septembre 2026 sur arXiv (2609.03681) présente WISE, une méthode de post-entraînement pour les modèles VLA (Vision-Language-Action) en robotique manipulatrice. Plutôt que d'affiner ces politiques par démonstrations d'experts coûteuses ou par renforcement en conditions réelles, risqué et onéreux, WISE s'appuie sur un modèle du monde pour imaginer et évaluer des comportements candidats, mais seulement aux états jugés critiques pour l'interaction, sur des horizons courts et multi-vues afin de limiter la dérive de prédiction. Testée sur les modèles Pi-0 et Pi-0.5 de Physical Intelligence, la méthode réduit le temps de calcul GPU d'environ 80% par rapport à une imagination exhaustive, tout en améliorant les performances sur un éventail de tâches de manipulation. Des évaluations en conditions réelles confirment des gains de robustesse et de généralisation face à des changements de distribution. Le résultat s'attaque à un frein connu à l'usage des modèles du monde en robotique: leur coût de calcul et l'accumulation d'erreurs sur de longs horizons de simulation en limitaient jusqu'ici l'intérêt pratique face au renforcement réel. En montrant qu'une imagination sélective et bornée conserve l'essentiel du gain de performance pour un cinquième du coût GPU d'une approche complète, WISE offre aux équipes de recherche appliquée un argument économique pour intégrer ces modèles dans leurs pipelines de fine-tuning sans les risques du reinforcement learning physique. Le travail apporte aussi une preuve empirique que des architectures VLA généralistes comme Pi-0 peuvent gagner en robustesse sans démonstrations supplémentaires, un point clé pour les décideurs qui évaluent le passage du laboratoire au déploiement industriel fiable. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles du monde en robotique, dans un paysage où NVIDIA (GR00T N2) ou Figure AI (Helix) explorent aussi des architectures VLA généralistes, mais en ciblant ici spécifiquement l'efficacité du post-entraînement plutôt que la génération de comportements bout-en-bout. La méthode a été validée sur Pi-0 et Pi-0.5, les bases VLA développées par Physical Intelligence. Il s'agit à ce stade d'un article de recherche, sans annonce de produit commercial, de partenariat industriel ni de calendrier de déploiement; la suite attendue serait son intégration dans des pipelines de fine-tuning propriétaires ou sa reproduction indépendante sur d'autres architectures pour confirmer les gains annoncés.

IA physiqueOpinion
1 source
Vers des modèles du monde JEPA ancrés dans la réalité physique pour la planification robotique conditionnée par objectif
79arXiv cs.RO 

Vers des modèles du monde JEPA ancrés dans la réalité physique pour la planification robotique conditionnée par objectif

Des chercheurs publient sur arXiv (arXiv:2609.03565, soumis début septembre 2026) un modèle du monde de type JEPA (Joint Embedding Predictive Architecture) conçu pour la planification robotique conditionnée par des objectifs visuels. L'approche standard JEPA prédit les représentations latentes futures sans reconstruire les pixels, mais rien ne garantit que ces représentations conservent l'information utile au contrôle moteur. Les auteurs ajoutent deux mécanismes entraînés de bout en bout : une dynamique inverse (IDM), qui empêche l'effondrement des représentations latentes en les forçant à rester informatives sur les actions qui les ont produites, et un alignement d'état (state alignment, SA), qui ancre les représentations successives dans la configuration physique et le mouvement réels du robot. Testé sur quatre bancs d'essai de planification, le modèle atteint 100% de réussite sur TwoRoom, 98% sur PushT et 87% sur OGBench-Cube, avec des résultats comparables à la référence LeWorldModel sur la tâche Reacher. Une étude d'ablation montre que l'ajout du state alignment améliore systématiquement le taux de réussite par rapport à l'IDM seul, sur les quatre tâches. Ce travail s'inscrit dans un débat central pour l'industrie robotique actuelle : les modèles du monde appris en espace latent permettent-ils une planification fiable, ou souffrent-ils d'un écart entre performance en simulation et robustesse réelle ? En montrant que l'ancrage physique explicite des représentations améliore la planification sans reconstruction pixel par pixel, les auteurs apportent un argument technique en faveur d'architectures latentes plus légères que les approches génératives complètes, un enjeu direct pour les intégrateurs qui cherchent des modèles de contrôle moins gourmands en calcul que les VLA (vision-language-action) de type Pi-0, GR00T N2 ou Helix. L'analyse par sous-espace de transition est particulièrement notable : bien que LeWorldModel affiche une meilleure "rectitude" moyenne des trajectoires sur OGBench-Cube, ses transitions se concentrent dans un sous-espace de dimension effective plus faible, ce qui suggère une représentation moins riche malgré des métriques agrégées favorables, un rappel que les chiffres moyens seuls peuvent masquer des limites structurelles. Ce papier prolonge la lignée des travaux sur les architectures JEPA popularisées en vision par Meta AI, désormais transposées à la robotique pour contourner les coûts de la prédiction pixel par pixel propre aux modèles du monde génératifs. Il se positionne comme une contribution de recherche académique, évaluée sur des bancs d'essai simulés standardisés (TwoRoom, PushT, Reacher, OGBench-Cube), sans annonce de déploiement matériel ni de partenariat industriel. Les prochaines étapes naturelles, non abordées dans l'abstract, seraient une validation sur robot physique et une comparaison directe avec les architectures VLA à grande échelle qui dominent actuellement les annonces commerciales du secteur.

RecherchePaper
1 source
Conception computationnelle assistée par robot de pinces passives spécifiques à l'objet pour la fabrication additive
80arXiv cs.RO 

Conception computationnelle assistée par robot de pinces passives spécifiques à l'objet pour la fabrication additive

Une équipe de recherche présente un pipeline computationnel de bout en bout qui transforme un maillage d'objet sélectionné, un état d'objet mesuré et un robot six axes en une pince passive, non actionnée et spécifique à l'objet, fabricable par impression additive. La méthode enchaîne un recalage de pose RGB-D/ICP sur maillage exact, un échantillonnage déterministe des points de contact, un filtrage de torseurs d'efforts tenant compte des incertitudes, la sélection parmi six mécanismes de capture passive, une synthèse de surface conforme à l'objet, une cinématique inverse robot en orientation complète, un domaine de fabrication tenant compte du volume balayé, un filtrage par éléments finis orienté selon les dépôts FDM, et une optimisation topologique SIMP tridimensionnelle sous contraintes. Chaque design exporté reste lié par un identifiant traçable au maillage source, à la pose de l'objet, à la bride du robot, au jeu de contacts et à l'hypothèse d'insertion. Quatre objets tests archivés (un lapin, une bride de caméra, un 3DBenchy, un buste facetté) passent les critères d'ajustement nominal, de torseur incertain, de balayage en temps réel et d'analyse par éléments finis avant/après topologie. Un test de robustesse à la pose délibérément élargi (±3 mm, ±5 degrés) différencie les designs, avec 29 à 134 essais réussis sur 160 simulations, et les topologies reconstruites conservent 92,0 à 97,6% du domaine par éléments finis grâce à la protection des zones fonctionnelles. Cette approche s'attaque à un problème concret pour les intégrateurs robotiques : au lieu de traiter séparément le choix de la prise, la géométrie de l'outil, la trajectoire et la conception structurelle, comme le font la plupart des workflows existants, elle unifie ces étapes dans un pipeline unique et traçable. Pour les industriels qui déploient des cellules de préhension sur mesure, notamment en petites séries ou pour des objets à géométrie complexe, cela ouvre la voie à des pinces imprimées en 3D générées quasi automatiquement à partir d'un scan et d'un modèle robot, réduisant potentiellement le temps d'ingénierie manuel. Toutefois, les auteurs eux-mêmes tempèrent la portée du résultat : les propriétés matériaux utilisées restent nominales, sans étalonnage par éprouvettes ni essais instrumentés, ce qui maintient les quatre designs au stade de "criblage numérique" plutôt qu'à celui de solution opérationnelle. Ce travail s'inscrit dans le champ de la conception computationnelle de préhenseurs adaptés à la fabrication additive, un domaine qui cherche à automatiser la conception d'outillages de préhension pour la robotique industrielle, où les pinces sur mesure sont aujourd'hui souvent modélisées manuellement. Les preuves mathématiques apportées (préservation des charges nodales, monotonie de la sensibilité de compliance sous interpolation SIMP, confinement du domaine voxel après post-traitement topologique) visent à donner une assise formelle à un processus encore largement empirique dans l'industrie. Les auteurs documentent les essais par des photographies des assemblages imprimés montés sur robot, mais la suite logique, des essais physiques instrumentés et un étalonnage matériau par éprouvettes, reste à venir avant tout passage à un usage opérationnel.

RecherchePaper
1 source
ProAct : génération de mouvement en flux continu et raisonnement à base d'agents pour l'interaction sociale incarnée en temps réel
81arXiv cs.RO 

ProAct : génération de mouvement en flux continu et raisonnement à base d'agents pour l'interaction sociale incarnée en temps réel

Une preprint arXiv révisée (2602.14048v2) présente ProAct, un framework a double système pour l'interaction sociale incarnée en temps réel, déployé sur un robot humanoïde. L'architecture associe un « Systeme Comportemental » a faible latence, qui génère en continu parole, gestes et mouvements, a un « Systeme Cognitif » plus lent, dote d'une mémoire et d'un module de prédiction de la motivation de l'utilisateur, qui analyse dialogue et contexte visuel pour décider quand prendre l'initiative plutôt que réagir. Le mouvement est produit par un modèle en flow-matching conditionne par l'intention, avec une branche ControlNet découplée qui traduit les décisions cognitives en gestes non verbaux sans casser la fluidité de l'interaction. Le framework a été valide par des études utilisateurs réelles, des benchmarks de mouvement et un nouveau benchmark dédié, ProActBench, mais le résume ne fournit aucun chiffre de performance précis. L'enjeu dépasse la démonstration : la plupart des agents conversationnels et robots sociaux restent réactifs, incapables de décider seuls du bon moment pour intervenir, ce qui limite leur naturel pour l'assistance a domicile, l'accueil ou le service client. En couplant raisonnement lent et génération de mouvement rapide, ProAct rejoint une tendance déjà visible chez d'autres acteurs de la robotique incarnée, comme les architectures a deux systèmes de Figure (Helix) ou de NVIDIA (GR00T N1). La validation sur robot physique et utilisateurs réels, plutôt qu'en simulation, va dans le sens d'un rapprochement entre démonstration et usage concret, même si l'absence de métriques chiffrées invite a la prudence sur l'ampleur réelle des gains. Le papier s'inscrit dans un mouvement de recherche plus large sur les architectures cognition-action a deux vitesses, popularisées par les modèles vision-langage-action récents comme Pi-0 ou GR00T N2, ici transposées de la manipulation d'objets vers l'interaction sociale. Aucune entreprise ni laboratoire n'est nomme dans le résume, et aucun calendrier de commercialisation n'est mentionne : il s'agit d'une contribution académique publiée sur arXiv, dont l'apport tient autant au framework ProAct qu'a la création de ProActBench, appelé a devenir une référence pour comparer la proactivité des futurs agents sociaux. Les prochaines étapes attendues relèvent donc de l'adoption par la communauté de recherche plutôt que d'un déploiement commercial immédiat.

RecherchePaper
1 source
Fusion RGB-D guidée par la fiabilité pour des cartes de coûts de navigation résistantes à l'éblouissement
82arXiv cs.RO 

Fusion RGB-D guidée par la fiabilité pour des cartes de coûts de navigation résistantes à l'éblouissement

Une équipe de recherche décrit, dans la version 2 d'un article publié sur arXiv sous la référence 2604.12753, une méthode de fusion RGB-D résistante aux reflets spéculaires sur les sols brillants, les vitres et les surfaces glacées en intérieur, un phénomène qui corrompt les caméras à stéréo active et fait apparaître des obstacles fantômes dans les cartes de coûts de navigation. Un réseau léger baptisé DRM-Net prédit, pixel par pixel, la fiabilité de la mesure de profondeur; une fusion guidée par cette fiabilité (RGF) applique une pondération continue et un seuil minimal avant intégration dans la carte d'occupation, de sorte qu'une mesure rejetée ne crée ni obstacle ni espace libre et que la cellule reste inconnue ou conserve sa valeur antérieure. L'entraînement s'appuie sur cinq images alignées en pose via des localisations LiDAR/AMCL indépendantes et un modèle d'incertitude calibré selon la distance. Comparée à un nvblox TSDF optimisé, au post-traitement du SDK RealSense d'Intel, à un filtrage à seuil de confiance stéréo élevé et aux réseaux TDCNet et HDCNet, la méthode DRM+RGF atteint, sous reflets sévères, un taux de fausses détections d'obstacles de 0,056, un rappel d'espace libre de 0,897, un temps de traitement de 16,5 ms par image et 91,4% de réussite de tâche; sur les essais en scènes réfléchissantes retenus (98 pour la référence contre 105 pour DRM+RGF), les collisions chutent de 14 à 1. Pour les intégrateurs de robots mobiles autonomes en entrepôt, hôpital ou usine, ce travail cible un défaut opérationnel bien réel: sols cirés et parois vitrées provoquent soit des arrêts intempestifs, soit des collisions lorsque les mesures douteuses sont ignorées sans discernement. En laissant les cellules incertaines dans un état inconnu plutôt que de trancher, la méthode évite le compromis binaire habituel entre filtrage agressif, qui supprime aussi de vrais obstacles, et complétion dense par apprentissage, qui peut inventer de la géométrie. Les auteurs restent toutefois mesurés: les résultats proviennent d'essais contrôlés portant sur une centaine de passages chacun, et l'article ne revendique ni produit commercial ni déploiement en flotte réelle. Le brouillage des caméras de profondeur à stéréo active par les reflets spéculaires est un problème connu de longue date en cartographie robotique, où les réponses existantes se limitaient jusqu'ici au filtrage strict des mesures peu fiables ou à la complétion par réseau de neurones. En confrontant DRM-Net et RGF à des références largement utilisées, comme nvblox et le SDK RealSense, ainsi qu'à des réseaux de complétion récents comme TDCNet et HDCNet, l'étude vise une comparaison directe plutôt qu'une simple démonstration isolée. Publié en version révisée sur arXiv, sans partenaire industriel ni feuille de route annoncée, l'article laisse en suspens la validation à plus grande échelle, sur des plateformes robotiques variées et en conditions réelles de terrain.

RecherchePaper
1 source
Navigation air-sol collaborative vision-langage pour la navigation via cartes aériennes partagées
83arXiv cs.RO 

Navigation air-sol collaborative vision-langage pour la navigation via cartes aériennes partagées

Des chercheurs ont publié sur arXiv (2609.03483) un système baptisé AGC-VLN, pour "Air-Ground Collaborative Vision-and-Language Navigation", qui fait collaborer un drone (UAV) offrant une vue aérienne globale et un véhicule terrestre autonome (UGV) doté d'une caméra en vue subjective. Le drone superpose sur sa vue plongeante la position rapportée de l'UGV et la cible identifiée par un modèle vision-langage (VLM), sous forme de repères "CAR" et "GOAL" avec distances, pour construire une carte partagée en vue aérienne. L'UGV s'en sert pour planifier un trajet le long des routes avec un VLM figé, non réentraîné, pendant que le drone exécute en parallèle 3D-SPF, une variante de la méthode de localisation SPF, pour repérer et rejoindre la cible depuis les airs. Sur 100 épisodes en boucle fermée dans la scène Town10HD du simulateur CARLA-Air, le taux de réussite conjoint atteint 77,0%, contre 50,0% pour le drone seul, soit un gain de collaboration de 27,0 points, et dépasse de 24,0 points la meilleure référence mono-agent publiée, Travel UAV (53,0%). Ce travail comble un angle mort documenté: une évaluation récente sur CARLA-Air portant sur cinq modèles VLA de pointe n'avait trouvé aucune coopération stable entre drone et robot terrestre, la communication sémantique naïve ou le couplage bidirectionnel dégradant même les performances. AGC-VLN propose une architecture sans réentraînement, qui sépare le raisonnement sémantique confié au VLM de l'exécution géométrique déterministe, ouvrant une interface de collaboration exploitable sans données supplémentaires. Pour les intégrateurs qui déploient des flottes hétérogènes drones et robots mobiles, la preuve que le gain vient de la complémentarité des points de vue plutôt que d'un modèle plus puissant plaide pour des architectures multi-agents modulaires plutôt que des VLA monolithiques appliqués robot par robot. Le papier s'inscrit dans la lignée des méthodes de navigation vision-langage sans entraînement, jusqu'ici cantonnées au mono-agent, et se compare à Travel UAV ainsi qu'à SPF, dont 3D-SPF est une extension. Les auteurs revendiquent la première base de référence "training-free" pour la navigation collaborative air-sol, une affirmation à prendre comme un positionnement plutôt qu'un fait vérifié indépendamment, le domaine restant, de leur propre aveu, largement inexploré. Les résultats reposent uniquement sur simulation, sans essai en conditions réelles ni chiffres de déploiement industriel; le code est publié sur GitHub (ZSN2024/AGC-VLN), laissant ouverte la question du transfert simulation-vers-réel pour des flottes physiques.

RechercheActu
1 source
Passage à l'échelle de la manipulation bimanuelle domestique : de 1 500 heures de démonstrations aux corrections en ligne
84arXiv cs.RO 

Passage à l'échelle de la manipulation bimanuelle domestique : de 1 500 heures de démonstrations aux corrections en ligne

Une équipe de recherche a publié le 3 septembre 2026 sur arXiv (2609.03591) un corpus ouvert de 1500 heures de démonstrations de manipulation bimanuelle sur des tâches domestiques courantes, collecté via un pipeline de données à haut débit. Ce corpus sert à entraîner XR-2, un modèle vision-langage-action (VLA) pilotant des bras robotiques à deux mains, via un entraînement en plusieurs étapes. Les auteurs testent deux leviers de mise à l'échelle, le volume de démonstrations expertes et le post-entraînement sur des corrections DAgger issues d'interventions humaines en temps réel, et observent dans les deux cas une amélioration régulière du taux de réussite, sans chiffres précis dans le résumé. Modèle et jeu de données sont diffusés en open source pour une recherche reproductible. Cette publication cible le principal goulot d'étranglement de la robotique généraliste, la rareté de démonstrations humaines de qualité à grande échelle, particulièrement critique en manipulation bimanuelle où la coordination des deux bras complique l'apprentissage. La tendance de scaling observée, sur le volume de données comme sur les corrections DAgger, appuie l'hypothèse que les politiques VLA suivent des lois d'échelle proches de celles des grands modèles de langage, un point encore débattu face au fossé fréquent entre démonstrations et fiabilité réelle. Pour les intégrateurs et laboratoires travaillant sur des bras collaboratifs ou des humanoïdes à deux bras, la mise à disposition gratuite du corpus réduit le coût d'entrée pour entraîner des politiques bimanuelles. Ce travail s'inscrit dans la lignée des modèles vision-langage-action misant sur une politique généraliste entraînée sur de larges corpus plutôt que sur des comportements programmés tâche par tâche, à côté d'initiatives comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Sa particularité tient à l'ampleur du corpus rendu public et à l'usage des corrections DAgger comme second levier de progression, une piste connue en apprentissage par imitation mais rarement documentée à cette échelle sur des tâches domestiques bimanuelles. Le papier ne mentionne ni déploiement industriel ni calendrier commercial : il s'agit d'une contribution de recherche destinée à la communauté académique, avec code et données fournis pour vérification externe.

IA physiqueActu
1 source
RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique
85arXiv cs.RO 

RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique

Un article publié sur arXiv (référence 2609.03199v1, catégorie « cross-listing » signalant un intérêt à la fois pour la robotique et la vision par ordinateur) présente RoboTok, un moteur de données conçu pour exploiter des vidéos humaines à l'échelle d'internet afin d'entraîner des politiques robotiques de manipulation dextre. Le système part d'une vidéo requête montrant une manipulation humaine, puis recherche dans de vastes collections de vidéos web des démonstrations pertinentes pour la même tâche. Techniquement, RoboTok apprend un espace de mouvement latent à partir de trajectoires 3D de la main, exprimées dans des repères centrés sur l'acteur estimés automatiquement, ce qui permet de comparer des gestes de manipulation malgré des différences de point de vue caméra, d'apparence de scène ou d'occlusions partielles de l'acteur. Cette représentation reste suffisamment compacte pour permettre une recherche efficace et une indexation continue sur des corpus vidéo de très grande taille. Les auteurs comparent RoboTok à des méthodes existantes de récupération de données robotiques, sur des benchmarks de recherche et sur la performance de politiques robotiques en aval, sans toutefois préciser dans le résumé les chiffres exacts de gain, ni les tâches ou plateformes robotiques testées. L'enjeu principal visé par ce travail est le goulot d'étranglement bien identifié de l'apprentissage robotique : collecter des données directement sur robot reste coûteux et ne permet pas de couvrir la longue traîne des tâches réelles rencontrées en manipulation. En proposant une méthode de récupération sensible à la pose de la main plutôt qu'à l'apparence brute, RoboTok cherche à transformer la vidéo web, ressource déjà abondante et en croissance continue, en une source de supervision exploitable et évolutive pour l'entraînement de politiques. Pour les intégrateurs et équipes de recherche en robotique dextre, cela s'inscrit dans une tendance plus large consistant à s'appuyer sur des données humaines non robotiques pour réduire la dépendance à la téléopération coûteuse, sans toutefois démontrer ici un déploiement matériel réel ni un produit commercialisé : il s'agit d'une contribution méthodologique et expérimentale, évaluée sur benchmarks académiques. Le papier se positionne dans la lignée des approches récentes de pré-entraînement robotique à partir de vidéos humaines à grande échelle, une direction de recherche active pour contourner la rareté des données robot réelles. Le résumé ne mentionne ni entreprise, ni laboratoire nommé, ni calendrier de suite ; il s'agit à ce stade d'une publication de recherche, pas d'une annonce produit ou d'un pilote industriel.

RecherchePaper
1 source
Reconnaissance automatique des cordons de soudure et cartographie 3D pour le post-traitement robotique par photogrammétrie et segmentation sémantique
86arXiv cs.RO 

Reconnaissance automatique des cordons de soudure et cartographie 3D pour le post-traitement robotique par photogrammétrie et segmentation sémantique

Des chercheurs présentent, dans une prépublication arXiv datée du 3 septembre 2026 (arXiv:2609.03970v1), un pipeline expérimental de vision par ordinateur destiné à localiser approximativement les cordons de soudure sur des pièces industrielles avant leur traitement robotisé (meulage, finition, inspection). La méthode combine quatre étapes : capture d'images de la pièce depuis plusieurs points de vue, identification des cordons de soudure par segmentation sémantique, reconstruction 3D de la pièce par photogrammétrie, puis projection des cordons détectés sur ce modèle reconstruit. L'objectif affiché est de réduire le temps et le volume de données nécessaires par rapport à un scan complet de la surface au scanner laser haute précision ou par lumière structurée, technique aujourd'hui standard mais coûteuse en temps pour les pièces de grande taille, et génératrice de données majoritairement inexploitables puisque seule une fraction de la surface porte réellement des soudures. Pour les intégrateurs de cellules robotisées de post-traitement, ce type d'approche répond à un goulot d'étranglement concret : le scan haute précision reste indispensable pour guider un robot de meulage ou d'inspection avec la précision millimétrique requise, mais scanner l'intégralité d'une pièce volumineuse (coque, châssis, structure métallique soudée) avant de savoir où se trouvent réellement les soudures représente une perte de temps machine. En reléguant le scan laser à une étape de mesure fine limitée aux zones préidentifiées, ce pré-repérage par caméras et segmentation sémantique pourrait accélérer les cycles de préparation de pièce, un enjeu direct pour la productivité des ateliers de soudure automatisée confrontés à une forte variabilité de pièces. Le travail se situe à un stade expérimental et préliminaire, sans indication de partenaire industriel, de nom de robot ou de site de déploiement, et l'article ne fournit ni chiffres de précision de détection ni temps de cycle mesurés. Il s'inscrit dans une littérature plus large combinant photogrammétrie et vision par apprentissage profond pour guider le post-traitement robotisé, en alternative aux capteurs 3D dédiés (scanners laser, lumière structurée) jugés trop lents ou trop gourmands en données pour un usage systématique sur de grandes pièces. Les auteurs présentent leur méthode comme une étape préalable à la mesure de précision, sans détailler à ce stade de calendrier de validation industrielle ni de tests en conditions réelles de production.

RecherchePaper
1 source
MoMaStage : planification guidée par graphe d'états de compétences et exécution en boucle fermée pour la manipulation mobile intérieure à long horizon
87arXiv cs.RO 

MoMaStage : planification guidée par graphe d'états de compétences et exécution en boucle fermée pour la manipulation mobile intérieure à long horizon

MoMaStage est le nom d'un système de planification et d'exécution présenté dans un article scientifique publié sur arXiv sous l'identifiant 2603.08383, en version 2 remplaçant une publication antérieure, consacré à la manipulation mobile en intérieur sur des tâches à horizon long. Le système associe un modèle vision-langage (VLM) figé, c'est-à-dire non réentraîné, à l'exécution robotique via trois mécanismes complémentaires : une bibliothèque hiérarchique de compétences ancrées et exécutables couplée à une projection purement topologique d'un graphe d'état des compétences (Skill-State Graph, SSG) qui borne l'espace de planification du VLM ; un vérificateur SSG qui propage l'état des régions de la scène et l'occupation du préhenseur pour écarter les plans infaisables avant leur exécution ; et un moniteur événementiel qui ne déclenche une réparation du plan, ancrée dans le graphe, que lorsqu'un résultat observé invalide la suite prévue. Les auteurs ont évalué l'approche en simulation à physique réaliste ainsi que sur un robot mobile manipulateur réel. Le résumé ne fournit aucun chiffre précis de charge utile, de degrés de liberté, de temps de cycle ou de volume de déploiement : il annonce seulement une amélioration de la validité des plans et de la tenue en exécution longue par rapport aux méthodes de référence testées, avec une réduction de la latence et de la consommation de tokens. Le travail s'attaque à une faiblesse connue des architectures VLA/VLM en robotique mobile : ces modèles décomposent bien une instruction en séquence d'actions plausible, mais ne suivent pas fiablement les contraintes cumulatives d'état du robot ni ne révisent leur plan quand l'exécution diverge du prévu. Cela vient nuancer l'idée qu'un grand modèle de langage suffirait, seul, à piloter des tâches longues de manipulation mobile sans couche de vérification dédiée. Pour les intégrateurs qui évaluent des piles VLA pour l'entrepôt ou l'usine, l'intérêt est méthodologique : coupler un VLM figé à une vérification symbolique légère plutôt qu'une politique entraînée de bout en bout, pour gagner en fiabilité sans construire de carte dense de la scène ni alourdir le calcul embarqué. MoMaStage s'inscrit dans la lignée des travaux cherchant à combler l'écart entre la planification par VLM généraliste et les exigences de fiabilité de la robotique physique, un enjeu documenté depuis la montée d'architectures bout-en-bout comme Pi-0, GR00T N2 ou Helix. À la différence de ces politiques entraînées sur de larges corpus de démonstrations, MoMaStage garde le VLM figé et externalise la cohérence d'état dans un graphe symbolique léger, plus proche des méthodes de planification classique augmentées par des modèles de langage. L'article ne mentionne ni calendrier de déploiement industriel ni partenariat commercial : il s'agit d'une contribution de recherche testée en simulation et sur un unique robot en laboratoire, sans indication de passage à l'échelle vers une flotte ou un site client.

RecherchePaper
1 source
Préhension vision-langage adaptative via des a priori de modèles fondation combinables et une synthèse de préhension généralisable
88arXiv cs.RO 

Préhension vision-langage adaptative via des a priori de modèles fondation combinables et une synthèse de préhension généralisable

Un article publié le 4 septembre 2026 sur arXiv (arXiv:2609.04096) présente AdaRoboVLG, un framework de préhension vision-langage (Vision-Language-Grasp, VLG) capable de généraliser la synthèse de prises entre différentes mains robotiques sans réentraînement. Contrairement aux méthodes VLG existantes, qui couplent étroitement modèles de fondation et politique de préhension entraînée de bout en bout, AdaRoboVLG sépare les deux couches : une politique de base génère et évalue des prises physiquement réalisables via mappage cinématique et estimation de stabilité par fermeture de force, tandis que des modules de fondation spécialisés injectent des a priori spatiaux, cognitifs et temporels selon la tâche. En simulation comme sur robot réel, les auteurs rapportent une généralisation efficace entre mains et une robustesse maintenue sur trois défis de préhension représentatifs en environnements encombrés et dynamiques, sans préciser de plateforme commerciale ni de chiffres de charge utile, de degrés de liberté (DOF) ou de temps de cycle. Des vidéos supplémentaires sont disponibles sur adarobovlg.github.io. L'intérêt pour les intégrateurs tient au découplage proposé : faire évoluer les modules de compréhension sémantique sans réentraîner toute la politique de préhension à chaque nouvelle tâche, la couche physique restant stable et déjà validée. C'est une réponse à deux limites récurrentes des approches Vision-Language-Action actuelles, le coût du réentraînement complet et l'écart persistant entre démonstrations simulées et robustesse en conditions réelles encombrées. Si ces résultats se confirment sur du matériel tiers, cette séparation entre raisonnement sémantique et physique de la préhension pourrait devenir une alternative aux modèles monolithiques entraînés de bout en bout. Ce travail s'inscrit dans la lignée des recherches VLG combinant perception, langage et contrôle moteur pour la préhension, un courant jugé par les auteurs trop dépendant de politiques entraînées de bout en bout et coûteuses à porter d'une main robotique à une autre. AdaRoboVLG se positionne explicitement contre cette tendance avec une architecture modulaire censée rester compatible avec les futures générations de modèles de fondation, sans redesign de la couche de préhension. Classé comme nouvelle soumission arXiv non encore évaluée par les pairs, l'article n'annonce ni partenariat industriel ni calendrier de déploiement, sa portée pratique restant à valider sur des plateformes commerciales.

RechercheActu
1 source
QLAUN : un robot quadrupède à contrôle de couple, robuste, agile, modulaire et abordable pour la recherche
89arXiv cs.RO 

QLAUN : un robot quadrupède à contrôle de couple, robuste, agile, modulaire et abordable pour la recherche

Une équipe de recherche présente QLAUN Bot (Quad-Legged Adaptive Unmanned Navigator Robot), un robot quadrupède à contrôle en couple, quasiment entièrement imprimé en 3D, décrit dans un extended abstract publié sur arXiv (2609.03623v1) et destiné aux universités et instituts de recherche du Liban et de la région MENA. Le robot pèse 15 kg et compte 12 degrés de liberté, trois par patte, chacune actionnée par un moteur brushless DC couplé à un réducteur à faible rapport puis à une transmission par courroie, l'ensemble formant un actionneur quasi-direct-drive (QDD) entièrement imprimé. La conception privilégie des pattes sans électronique embarquée, avec des actionneurs de hanche et de genou découplés pour permettre un remplacement modulaire rapide, une hanche à rotation continue en flexion-extension, et un pied compliant imprimé en TPU-95A pour absorber les chocs et compenser les irrégularités du terrain. Le châssis est en acide polylactique (PLA), assemblé avec des pièces standard du commerce. Cette approche illustre une tendance de fond dans la recherche en locomotion robotique : la fabrication additive et les composants standards permettent de construire des plateformes quadrupèdes robustes pour une fraction du coût des robots commerciaux type Unitree, ANYmal ou Boston Dynamics, facturés plusieurs dizaines de milliers de dollars. Pour des laboratoires universitaires peu dotés en financement, un châssis modulaire et réparable sans compétence en électronique réduit fortement le coût et le temps d'immobilisation des campagnes expérimentales. Il s'agit toutefois d'un extended abstract présentant le concept et les choix de conception, sans résultats de locomotion détaillés ni comparaison chiffrée de performance avec des plateformes concurrentes. QLAUN s'inscrit dans la lignée des quadrupèdes open-hardware à bas coût apparus dans le sillage de plateformes comme le MIT Mini Cheetah ou le Stanford Doggo, qui ont démocratisé la recherche en locomotion dynamique grâce à l'impression 3D et aux actionneurs quasi-direct-drive. Contrairement aux quadrupèdes commerciaux vendus par Unitree ou Boston Dynamics, ce projet vise explicitement un usage académique dans une région, le Liban et le Proche-Orient, où ce type d'infrastructure de recherche reste rare. Les auteurs présentent ce prototype comme un point de départ destiné à stimuler les travaux futurs sur la locomotion des robots à pattes au sein des communautés scientifiques locales.

RecherchePaper
1 source
RoughSense : prédiction légère des vibrations d'un rover sur terrain accidenté par nuages de points et IMU
90arXiv cs.RO 

RoughSense : prédiction légère des vibrations d'un rover sur terrain accidenté par nuages de points et IMU

Des chercheurs présentent RoughSense, une méthode légère de cartographie de la praticabilité du terrain sensible aux vibrations, conçue pour la navigation autonome des rovers, en particulier en environnement souterrain où communication, puissance de calcul et énergie embarquée sont limitées. Le travail est publié sur arXiv sous l'identifiant 2609.03720, en soumission de type "new", c'est-à-dire une prépublication non encore relue par les pairs. La méthode combine deux flux de données en temps réel : un nuage de points LiDAR et une centrale inertielle (IMU). Un premier indicateur de vibration est estimé à partir de la seule géométrie du terrain, en appliquant l'algorithme RANSAC à des portions locales du nuage de points produites par un système de cartographie et localisation simultanées (SLAM). En parallèle, l'IMU capte la vibration réellement subie par le rover pendant son déplacement, et cette mesure sert à corriger en continu l'estimation géométrique via un filtre des moindres carrés récursifs (Recursive Least Squares). L'approche a été testée sur trois terrains : un site analogue lunaire, un terrain extérieur et une mine souterraine, mais le résumé ne fournit aucun chiffre de performance (taux d'erreur, gain de précision, charge de calcul embarquée), ce qui limite l'évaluation de son efficacité réelle à ce stade. L'intérêt de l'approche tient à sa légèreté computationnelle : à l'inverse des méthodes de cartographie de terrain fondées sur l'apprentissage profond, souvent gourmandes en ressources, RoughSense repose sur des algorithmes classiques et peu coûteux, une contrainte centrale pour tout calculateur embarqué sur un rover planétaire ou une plateforme d'exploration souterraine coupée d'un lien de communication fiable. En couplant une estimation géométrique a priori avec une correction en ligne fondée sur la vibration mesurée, la méthode cherche à réduire l'écart classique entre prédiction de terrain et comportement réel du véhicule, un problème récurrent en robotique de terrain où les modèles purement géométriques sous-estiment souvent l'effet de la texture ou de la meuble du sol. Pour des équipes concevant des rovers destinés à l'exploration de tunnels de lave, de grottes ou de mines lunaires, ce type de brique laisse entrevoir une navigation plus autonome sans dépendre d'un lien radio permanent vers un centre de contrôle, enjeu direct compte tenu du délai de communication Terre-Lune ou Terre-Mars. Le papier s'inscrit dans le regain d'intérêt pour l'exploration robotique de sites souterrains extraterrestres, notamment les tunnels de lave lunaires envisagés comme abris naturels pour de futures missions habitées, et pour l'usage de mines terrestres comme environnements analogues avant tout déploiement spatial. Le résumé ne mentionne ni entreprise ni agence spatiale commanditaire, ni acteur français ou européen impliqué : il s'agit d'une contribution académique en prépublication, sans validation par les pairs. Aucun calendrier de suite, partenariat industriel ou mission cible n'est précisé ; le texte se limite à une validation expérimentale sur trois terrains, laissant ouvertes les questions de généralisation à d'autres sols ou véhicules.

RecherchePaper
1 source
Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde
91arXiv cs.RO 

Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde

Un article publié sur arXiv sous la référence 2609.03927v1 propose une synthèse unifiée de l'apprentissage robotique, en organisant les travaux existants autour de trois axes complémentaires : la compréhension via l'apprentissage de représentation, l'action via les modèles vision-langage-action (VLA), et le raisonnement via les modèles du monde. Les auteurs introduisent une taxonomie structurée qui capture les choix de conception clés en matière de représentation de l'environnement, d'apprentissage de politiques et de modélisation prédictive, et dressent un état des lieux des avancées récentes dans ces trois domaines de recherche. Le papier pointe un problème central pour le secteur : ces trois paradigmes progressent rapidement mais restent développés de façon cloisonnée, ce qui produit des systèmes fragmentés, peu capables de généraliser, de raisonner sur des horizons temporels longs ou de planifier dans des environnements non structurés. C'est un signal utile pour les intégrateurs et décideurs B2B qui misent tout sur un seul bloc technologique, qu'il s'agisse d'un VLA pour l'action ou d'un modèle du monde pour la prédiction. Les auteurs soutiennent que les limites observées sur le terrain, quantification insuffisante de l'incertitude, mauvaise généralisation hors distribution, transfert difficile d'une plateforme robotique à une autre, compréhension limitée du contexte long, planification longue portée fragile, ne viennent pas seulement des composants pris isolément mais du manque d'intégration entre perception, action et raisonnement. Cela nuance l'hypothèse répandue selon laquelle il suffirait de faire grossir un seul type de modèle pour résoudre l'autonomie robotique générale. Cette synthèse arrive alors que les trois courants qu'elle croise, apprentissage de représentation pour la perception, modèles VLA pour le contrôle d'action, modèles du monde pour la prédiction des conséquences, ont chacun connu des avancées rapides ces dernières années dans la recherche robotique sans converger vers une architecture commune. Plutôt que de comparer des produits ou des laboratoires concurrents, l'article se positionne comme une carte du terrain de recherche à destination de la communauté scientifique. Les auteurs esquissent des directions futures vers des systèmes d'apprentissage robotique unifiés, physiquement ancrés et probabilistes, capables de maintenir des représentations internes cohérentes et de soutenir la prise de décision sur des interactions prolongées en conditions réelles, sans toutefois annoncer de calendrier de mise en œuvre ni de prototype déployé.

RecherchePaper
1 source
FWBC-VLA : compensation corporelle sensible aux forces pour la locomanipulation riche en contacts
92arXiv cs.RO 

FWBC-VLA : compensation corporelle sensible aux forces pour la locomanipulation riche en contacts

Le preprint arXiv publie le 3 septembre 2026 (arXiv:2609.03889v1) présente FWBC-VLA, un framework qui relie génération d'action sémantique et contrôle du contact physique pour des robots a roues et jambes. Sa pièce centrale, HSR-Force, est un estimateur de couple résiduel sans capteur dédié: il infere la force de contact et son évolution a partir des seules données proprioceptives, converties en tokens injectes dans le modèle vision-language-action pendant la génération d'action. Le backbone VLA a été entièrement finetune sur le WL&Arm Dataset, plus de 5 000 épisodes de loco-manipulation, et un générateur de compensation combine état proprioceptif, force estimée et état de contact pour produire des actions correctrices envoyées au contrôle du corps entier. Les auteurs valident l'approche sur deux taches réelles: essuyage d'un tableau blanc et ouverture d'une porte munie d'un ferme-porte. Le problème cible est connu du secteur: les VLA génèrent des actions sans percevoir les forces physiques induites au contact, les politiques de contrôle du corps entier stabilisent le robot sans distinguer force utile a la tache et perturbation externe, et des capteurs dédiés alourdissent cout et intégration. En démontrant qu'une estimation logicielle du contact suffit a fiabiliser des taches de manipulation en contact riche, l'étude répond a l'écart persistant entre démonstrations VLA en laboratoire et déploiement robuste sur du matériel standard. Pour les intégrateurs qui évaluent des plateformes a roues et jambes pour des taches de service en environnement encombre, cela ouvre une piste pour réduire l'instrumentation couteuse sans sacrifier la robustesse au contact. Ce travail s'inscrit dans la vague des modèles vision-language-action, aux cotes de références comme Pi-0, GR00T N2 ou Helix, conçues pour des bras manipulateurs ou des humanoïdes et rarement testées sur des plateformes a roues et jambes. L'abstract ne précise ni l'affiliation des auteurs ni le robot exact utilise, et le document reste a ce stade un preprint non évalué par les pairs, sans annonce de produit ni de partenariat industriel. Les résultats se limitent a deux taches démonstratives en conditions réelles, ce qui laisse ouverte la question du passage a l'échelle, dans un secteur ou la robustesse au contact reste l'un des principaux verrous avant un déploiement commercial etendu.

IA physiqueActu
1 source
Élaboration d'un jeu de données HRI multimodal dynamique pour l'analyse de l'engagement avec un robot humanoïde
93arXiv cs.RO 

Élaboration d'un jeu de données HRI multimodal dynamique pour l'analyse de l'engagement avec un robot humanoïde

Une équipe de recherche propose, dans un article publié sur arXiv le 3 septembre 2026 (arXiv:2609.03255v1), un protocole expérimental pour constituer un jeu de données multimodal sur l'engagement des utilisateurs en interaction avec un robot humanoïde. Le dispositif combine trois types de mesures recueillies simultanément : des signaux physiologiques captés par des capteurs portables, des données comportementales observées durant les sessions, et des questionnaires d'auto-évaluation, le tout collecté sous plusieurs niveaux de complexité de tâche définis par les auteurs. À ce stade, il s'agit d'un design expérimental et d'un protocole de collecte, pas encore de résultats d'analyse ni d'un dataset publié à grande échelle. L'intérêt tient au manque identifié par les auteurs dans la littérature existante : la plupart des études en interaction humain-robot évaluent l'engagement via des signaux comportementaux observables (regard, posture, réponses verbales), rarement croisés avec des données physiologiques comme le rythme cardiaque, qui reflètent des états internes plus difficiles à masquer que les réponses de surface. Pour les concepteurs de robots sociaux et humanoïdes destinés à l'assistance, l'éducation ou le service, disposer d'une mesure multimodale et objective de l'engagement changerait la donne, en ouvrant la voie à des systèmes capables d'ajuster leur comportement selon l'état réel de l'utilisateur plutôt que selon des indices de surface biaisés par la seule auto-évaluation. Ce travail s'inscrit dans une recherche en interaction humain-robot qui cherche depuis plusieurs années à dépasser les mesures d'engagement purement déclaratives ou comportementales, jugées insuffisantes pour capter l'expérience réelle d'un utilisateur face à un robot. L'abstract ne précise ni le robot humanoïde utilisé, ni le laboratoire porteur, ni le nombre de participants prévus, ce qui situe cette annonce du côté de la proposition méthodologique plutôt que du résultat exploitable. La suite logique consistera à mener la collecte selon ce protocole, puis à publier des analyses croisant physiologie, comportement et ressenti subjectif, afin de vérifier si l'approche multimodale améliore réellement la prédiction de l'engagement par rapport aux méthodes comportementales seules.

RecherchePaper
1 source
Un pipeline hybride pour le mappage sémantique dynamique basé sur des ontologies
94arXiv cs.RO 

Un pipeline hybride pour le mappage sémantique dynamique basé sur des ontologies

Une équipe de recherche publie sur arXiv (référence 2609.03891) un pipeline hybride de cartographie sémantique pour robots en environnement complexe. Le système associe une camera externe calibrée, dont l'image est projetée par homographie pour la cartographie géométrique et la localisation, a de la détection d'objets, un suivi persistant des instances détectées et des mises a jour sémantiques pilotées par une ontologie. Des modèles de régression linéaire corrigent les estimations de coordonnées dans le repère du monde réel, afin de compenser les erreurs de projection issues de la camera extérieure. Instances d'objets, propriétés spatiales et relations sémantiques sont ainsi actualisées en continu a partir des données sensorielles, formant un modèle du monde dynamique plutôt qu'une carte figée. L'enjeu dépasse la démonstration technique : la cartographie sémantique conditionne la capacité d'un robot a interagir avec des objets et a naviguer de manière autonome dans des scènes non structurées, un problème clé pour les intégrateurs d'AMR ou de bras manipulateurs en logistique et en industrie. La chaine classique, SLAM géométrique puis perception, fusion et représentation sémantiques, peine a garder un contexte cohérent quand l'environnement change ; les travaux récents y ajoutent des graphes de connaissances ou des graphes de scene pour améliorer la compréhension contextuelle. En choisissant l'ontologie pour sa structure hiérarchique, son expressivité sémantique et sa capacité a modéliser un monde qui évolue, les auteurs prennent position dans un débat encore ouvert sur la meilleure représentation des connaissances pour un robot. Presente comme une contribution nouvellement soumise, ce travail s'inscrit dans une lignée de recherches hybridant SLAM classique et raisonnement symbolique, une direction explorée aussi par des approches concurrentes fondées sur les graphes de scene ou les graphes de connaissances génériques. Le résume ne cite aucune plateforme robotique nommée, aucun site de déploiement ni calendrier de mise en production : il s'agit a ce stade d'une contribution méthodologique sur arXiv, sans benchmark chiffre ni validation a grande échelle rapportée. La suite logique consiste généralement en une évaluation comparative sur des jeux de données standards de cartographie sémantique, avant une éventuelle intégration dans une pile logicielle robotique complète.

RecherchePaper
1 source
Yuejia Dynamics, startup de Shenzhen, déploie ses robots quadrupèdes dans le métro, vise une capacité de 10 000 unités
95Pandaily 

Yuejia Dynamics, startup de Shenzhen, déploie ses robots quadrupèdes dans le métro, vise une capacité de 10 000 unités

Yuejia Dynamics, startup chinoise de robots quadrupèdes fondée à Shenzhen en juillet 2025, a présenté quatre modèles à pattes lors de la World Robot Conference, accompagnés d'un flux en direct d'un déploiement réel dans le métro de Shenzhen. Selon le cofondateur et PDG Liu Liang, la gamme comprend deux robots industriels de grande taille, certifiés IP67, capables de porter plus de 35 kg pour des usages en centrales électriques et sites chimiques, ainsi que des unités plus petites, à roues ou à pattes, portant jusqu'à 15 kg pour l'intérieur, le tout conçu sur du hardware et des algorithmes maison. Les modèles industriels embarquent une articulation à faible rapport de réduction développée en interne, délivrant un couple de crête de 180 N·m et une densité de puissance 1,3 fois supérieure à la concurrence. Tous intègrent des modules 4G et 5G permettant un suivi à distance en temps réel. Les caractéristiques annoncées incluent l'ascension de pentes à 55 degrés, le franchissement d'obstacles de 60 cm, la gestion d'escaliers de 20 à 30 cm et une autonomie de quatre à cinq heures. Le déploiement phare se situe à la station Qianhaiwan du métro de Shenzhen, où un robot chien patrouille de façon entièrement automatique toutes les deux heures, sept jours sur sept, inspectant portillons, escalators, éclairages et équipements incendie, avec détection d'anomalies par IA. Liu affirme qu'il s'agit du premier robot quadrupède d'inspection à fonctionner en routine dans un métro chinois, le projet ayant passé une validation complète en conditions réelles avant un déploiement plus large. Cette annonce marque une étape notable dans le passage de la robotique quadrupède de la démonstration ponctuelle vers l'exploitation opérationnelle récurrente en environnement urbain critique, un terrain jusqu'ici dominé par les projections plutôt que par des cycles de service effectifs et documentés. Pour les intégrateurs et décideurs industriels, le cas d'usage métro apporte une preuve concrète que l'inspection automatisée par quadrupède peut tenir un rythme de service régulier plutôt qu'une simple vitrine technologique, ce qui pèse dans l'arbitrage entre robots à pattes et solutions à roues (AMR) pour les infrastructures à géométrie contrainte (escaliers, obstacles). Les chiffres de couple et de densité de puissance restent toutefois des déclarations du fabricant, non vérifiées de façon indépendante, et la validation « pleine échelle » évoquée n'a pas encore débouché sur un déploiement multi-sites confirmé. La stratégie affichée, dite du « modèle métro de Shenzhen » consistant à valider sur un site pilote avant standardisation et réplication, est une approche classique de mise à l'échelle industrielle plutôt qu'une rupture technologique. Créée il y a un peu plus d'un an, Yuejia Dynamics s'inscrit dans la vague de startups chinoises de robotique legged qui a suivi Unitree, en misant sur des cas d'usage industriels et d'infrastructure publique plutôt que sur le grand public. L'entreprise cite déjà des références antérieures, notamment des inspections dans des installations non habitées à risque de China Resources Power et un pilote de sécurité publique avec les autorités d'urgence de Shenzhen, orienté vers la détection d'obstructions de voies incendie. La production monte en cadence dans la région du Grand Baie, avec un objectif de capacité annuelle de 10 000 unités d'ici fin octobre 2026, destinées aux réseaux de métro ainsi qu'aux déploiements standards dans l'énergie et l'urgence. La société met également en avant une plateforme d'entraînement d'IA incarnée reposant sur du calcul parallèle à grande échelle mais à coût matériel réduit, environ un cinquième de celui de ses concurrents, et prépare une prochaine génération de technologie humanoïde.

Chine/AsieActu
1 source
La révolution robotique chinoise ne prendra peut-être pas la forme attendue
96SCMP Tech 

La révolution robotique chinoise ne prendra peut-être pas la forme attendue

Lors de la World Robot Conference qui s'est tenue le mois dernier à Pékin, des robots humanoïdes chinois ont livré une démonstration remarquée : tri de colis, emballage de téléphones et tâches ménagères exécutées en direct devant le public. Unitree Robotics, le fabricant connu pour ses robots quadrupèdes et humanoïdes capables de courir, danser et exécuter des mouvements d'arts martiaux, a marqué les esprits au même moment avec son entrée en bourse à Shanghai : l'action a clôturé sa première séance de cotation à plus de cinq fois son prix d'introduction. Cette double séquence, démonstrations spectaculaires sur scène et accueil boursier très favorable, illustre l'appétit des investisseurs et l'ambition affichée par la Chine de faire de la robotique humanoïde un secteur industriel stratégique. Mais pour les intégrateurs et décideurs qui évaluent la maturité réelle de ces machines, elle relance aussi la question classique de l'écart entre démonstration scénique et déploiement industriel effectif : trier des colis ou plier du linge devant des caméras ne prouve pas qu'un robot tienne la cadence, la fiabilité et le coût d'un site de production ou d'entrepôt en conditions réelles. L'engouement financier autour d'Unitree pourrait ainsi anticiper une adoption plus rapide qu'elle ne l'est en pratique sur le terrain. Unitree s'est d'abord fait connaître avec ses robots-chiens quadrupèdes avant d'étendre sa gamme aux humanoïdes, dans un marché chinois où plusieurs constructeurs se disputent la vitrine technologique et le soutien des pouvoirs publics à la filière robotique. Le titre même de l'article souligne que la révolution promise par ces vitrines pourrait ne pas se matérialiser sous la forme spectaculaire mise en avant lors d'événements comme la World Robot Conference, invitant à distinguer la démonstration médiatique du déploiement commercial réel restant à construire.

Chine/AsieOpinion
1 source
JAKA contre-attaque Teradyne Robotics dans le litige de brevets
97Robotics Business Review 

JAKA contre-attaque Teradyne Robotics dans le litige de brevets

Le fabricant chinois de bras collaboratifs JAKA Robotics a riposté le 3 septembre après avoir été poursuivi la semaine précédente par Teradyne Robotics, maison mère du danois Universal Robots, pour violation de brevets portant sur le matériel et le logiciel de ses cobots. Dans un communiqué transmis à The Robot Report, JAKA affirme avoir engagé une action en justice demandant une injonction contre ce qu'elle qualifie de déclarations publiques "fausses, trompeuses et préjudiciables" de la part de Teradyne. La société, basée à Shanghai, dit n'avoir reçu aucune communication directe de Teradyne ni de ses représentants légaux, et n'avoir vu aucun document judiciaire lié à l'affaire: elle affirme avoir appris les accusations uniquement via une annonce de Teradyne sur les réseaux sociaux. Selon JAKA, ses conseils juridiques n'avaient trouvé, au 2 septembre, aucune procédure pour contrefaçon de brevet ouverte contre elle, et The Robot Report n'avait à ce stade identifié aucun document de justice confirmant le dossier. JAKA revendique plus de 300 brevets déposés dans le monde et affirme avoir commandé deux analyses indépendantes de liberté d'exploitation avant son entrée sur le marché européen, sans qu'aucune ne signale de risque de contrefaçon. David Brandt, vice-président R&D et directeur technique d'Universal Robots, a répondu que la plainte avait bien été déposée devant les tribunaux de Copenhague et n'avait peut-être pas encore été signifiée à JAKA, ajoutant que le nombre de brevets détenus par JAKA importe peu, seule comptant leur solidité. Cette querelle, rendue publique de façon inhabituelle pour un contentieux de brevets dans la robotique, illustre les tensions croissantes entre fabricants occidentaux établis et nouveaux entrants chinois sur le marché des cobots. JAKA accuse Teradyne d'associer ses produits à une sécurité ou une qualité moindre en raison de leur "origine chinoise", une allégation qu'elle juge infondée puisque la sécurité d'un cobot dépend de l'intégration et de l'évaluation des risques, pas du pays de fabrication. JAKA parle d'une tentative de créer une "incertitude anticoncurrentielle" sur le marché. Pour les intégrateurs et décideurs industriels, l'affaire ajoute un facteur de risque juridique à considérer lors du choix de bras collaboratifs chinois en Europe, à un moment où ces fournisseurs gagnent des parts de marché face à Universal Robots, longtemps leader incontesté du secteur. Universal Robots, pionnier danois des cobots fondé en 2005 et racheté par l'américain Teradyne en 2015, défend ainsi une position dominante face à JAKA Robotics, fondée à Shanghai en 2014 et en pleine expansion en Europe. La plainte de Teradyne vise la filiale allemande de JAKA et a été déposée devant un tribunal de Copenhague, sur le terrain historique d'Universal Robots. JAKA affirme de son côté avoir lancé une procédure distincte en Allemagne contre les déclarations publiques de Teradyne. Aucun document judiciaire n'a encore été rendu public de part et d'autre, et le statut exact de la signification reste incertain. The Robot Report indique poursuivre son suivi de l'affaire à mesure que de nouveaux dépôts et déclarations seront disponibles.

FR/EU ecosystemeActu
1 source
La meilleure façon d'explorer les cratères lunaires : une boule robotique géante
98IEEE Spectrum Robotics 

La meilleure façon d'explorer les cratères lunaires : une boule robotique géante

Des chercheurs du laboratoire RAD de Texas A&M University, à College Station, ont testé en février 2026, dans une carrière du centre du Texas, RoboBall III, un robot sphérique gonflable de 1,8 mètre de diamètre pour 150 kilogrammes, qui a roulé sans difficulté sur des roches, du gravier et de l'argile humide. Le projet, mené par le doctorant en génie mécanique Rishi Jangale, vise à terme l'exploration de cratères lunaires inaccessibles comme Shackleton, au pôle sud de la Lune : 21 kilomètres de diamètre, 4 kilomètres de profondeur, avec des poches en ombre permanente où la température descend à moins 240°C, contre plus de 93°C côté ensoleillé, et où se trouveraient glace d'eau et strates géologiques anciennes. RoboBall se déplace grâce à un pendule interne qui déplace son centre de masse pour faire rouler sa coque protectrice. Ces travaux sont détaillés dans un article publié dans IEEE Transactions on Field Robotics, qui présente la conception du robot, un scénario de mission lunaire encore hypothétique, et les résultats de ces premiers essais de terrain. Cette forme sphérique répond à une contrainte opérationnelle : sur un sol lunaire à faible gravité, un rover classique risque de basculer, et la NASA exclut d'envoyer des astronautes près de cratères d'où on ne pourrait pas les extraire en cas de chute. La démonstration reste à un stade académique, entre essais en carrière terrestre et scénario de mission hypothétique, mais elle répond à une vraie lacune scientifique : aucun échantillon lunaire n'a été rapporté sur Terre depuis plus de cinquante ans, et les météorites lunaires manquent, selon la minéralogiste Sara Russell du Natural History Museum de Londres, du contexte géologique de terrain qui fait la valeur scientifique d'un prélèvement. Contrairement à un rover tenu par un câble, RoboBall n'aurait pas besoin de remonter par ses propres moyens : il pourrait collecter des échantillons au fond d'un cratère puis les renvoyer par petites fusées vers un rover resté au bord, avec un rayon d'action bien plus large. L'idée remonte à 2003, quand Robert Ambrose, alors ingénieur robotique à la NASA et aujourd'hui responsable du laboratoire RAD à Texas A&M, a imaginé qu'une sphère gonflable, insensible au retournement et isolée thermiquement, pourrait aller là où rover à roues et astronautes ne s'aventurent pas. Un premier démonstrateur, RoboBall II, large de seulement 0,5 mètre, a été achevé en 2022 après des itérations rapides marquées par des pannes logicielles et un système de transmission trop faible pour franchir des obstacles meubles ; il aura fallu onze mois de plus pour aboutir à RoboBall III. Aucune mission lunaire n'est à ce jour programmée : le projet reste une démonstration technologique universitaire, destinée à alimenter les réflexions de la NASA en vue de futures explorations robotiques du pôle sud lunaire.

RecherchePaper
1 source
Vidéo : ce robot humanoïde compact facilite la création de compétences robotiques personnalisées
99Interesting Engineering 

Vidéo : ce robot humanoïde compact facilite la création de compétences robotiques personnalisées

La société chinoise Zeroth, fondée en 2024 et basée à Suzhou, a lancé Bridge, un robot humanoïde compact, ainsi qu'OpenBridge, un écosystème open source destiné au développement de compétences robotiques. Bridge mesure 88 centimètres pour environ 13 kilogrammes, avec des bras de 30 à 40 centimètres et des pinces à deux doigts, un format pensé pour un usage de bureau. Il intègre des actionneurs propriétaires à couple élevé, une marche bipède, de l'évitement d'obstacles et une bibliothèque de mouvements chorégraphiés ; une vidéo de démonstration le montre capable de backflips et de téléopération intégrale du corps. La première série, baptisée Bridge Geek Edition, est ouverte à la précommande mondiale, avec accès à des kits de développement (SDK), des API ouvertes de contrôle moteur et des outils de capture de mouvement et de réalité virtuelle. Le programme Bridge Builder présélectionnera 500 développeurs pour un défi de co-création : 200 recevront un Bridge gratuit pour contribuer à OpenBridge, et 300 obtiendront un accès prioritaire à l'achat, au SDK et aux futures phases du programme. L'objectif affiché par Zeroth est de déplacer la valeur du robot vers le logiciel plutôt que vers le matériel seul : au lieu de séquences pré-programmées figées, Bridge repose sur une architecture dite « AI-native » censée permettre des comportements adaptatifs, complétée par un Skill Hub communautaire où les compétences créées par un développeur deviennent réutilisables par d'autres. Pour les intégrateurs et équipes R&D, cette logique de plateforme ouverte et peu coûteuse à l'entrée pourrait faciliter l'expérimentation en IA physique en dehors des grands laboratoires, dans la lignée de ce que des modèles vision-langage-action comme Pi-0 ou GR00T N2 tentent de généraliser pour le contrôle robotique. La formule « premier robot incarné AI-native au monde » relève toutefois du discours marketing et reste à valider ; les démonstrations de backflips ou de téléopération diffusées en vidéo, sans métrique vérifiable de fiabilité ou de temps de cycle, sont probablement issues de prises sélectionnées. Le lancement en est au stade de la précommande et du recrutement de développeurs, pas d'un déploiement industriel. Zeroth s'inscrit dans une vague de jeunes pousses chinoises de robotique humanoïde, aux côtés d'acteurs comme Unitree, AgiBot ou Galbot, qui cherchent à capter les développeurs avant les acteurs établis en misant sur des plateformes compactes et accessibles. Cette ouverture fait écho aux stratégies engagées ailleurs dans le secteur, qu'il s'agisse des modèles fondation robotique de NVIDIA (GR00T) et de Physical Intelligence (Pi-0), ou des plateformes propriétaires de Figure (Helix) et Tesla (Optimus), qui investissent elles aussi le contrôle par IA plutôt que la programmation fixe. Contrairement à ces derniers, orientés vers des déploiements industriels en usine ou en logistique, Zeroth cible d'abord chercheurs et développeurs avec un robot de bureau à faible coût d'entrée. La suite dépendra de la participation réelle au Bridge Builder Program et de l'activité du Skill Hub ; aucun acteur français ou européen n'est associé à ce lancement, pour l'instant circonscrit au marché chinois et à une précommande mondiale.

HumanoïdesOpinion
1 source
Unitree implante « trois bases, deux centres » à Chengdu, rendez-vous des leaders de l'IA incarnée
100Pandaily 

Unitree implante « trois bases, deux centres » à Chengdu, rendez-vous des leaders de l'IA incarnée

Unitree, le fabricant chinois de robots humanoïdes entré en bourse sur le STAR Market de Shanghai il y a un mois, vient d'enregistrer une filiale à 100 %, Chengdu Yuchen Technology, pour déployer à Chengdu une stratégie baptisée "trois bases, deux centres". Les trois bases couvrent une base pilote de production à l'ouest de la ville, dédiée aux bras robotiques humanoïdes, quadrupèdes et à roues, une base tournée vers le cinéma et la télévision qui s'appuie sur les ressources culturelles et touristiques locales, et une base éducative couvrant tous les niveaux scolaires. Les deux centres ajoutent un centre d'innovation applicative orienté sécurité publique, éducation et tourisme culturel, et un centre de collecte de données destiné à alimenter l'entraînement des algorithmes d'IA incarnée. Premier résultat concret, un laboratoire conjoint d'IA incarnée avec un district scolaire local a déjà été lancé. Le fondateur Wang Xingxing avait fait de Chengdu une vitrine en y présentant le mécha transformable porteur de charge GD01 sur Chunxi Road. Selon les chiffres cités, l'industrie centrale de l'IA à Chengdu dépassait 150 milliards de yuans en 2025, répartie sur plus de 1 200 entreprises, avec un objectif de 260 milliards de yuans d'ici 2027. L'implantation d'Unitree complète ce que des observateurs décrivent comme la dernière pièce du puzzle robotique de Chengdu, la ville comptant désormais cinq des principaux acteurs chinois de l'IA incarnée, aux côtés d'UBTECH, AgiBot et Galbot. Au-delà de l'effet d'annonce, la base pilote cible un maillon historiquement faible de la hard tech chinoise, le passage du prototype à la fabrication en série, signe d'un déplacement de la compétition humanoïde des démonstrations de laboratoire vers l'industrialisation réelle. Le centre de collecte de données s'attaque lui aussi à un point sensible du secteur, la difficulté à obtenir des données réelles suffisantes pour entraîner des modèles vision-langage-action hors simulation. Pour les intégrateurs et décideurs industriels, l'enregistrement d'une filiale reste avant tout un geste administratif ; le signal à surveiller sera la matérialisation annoncée en usines, hôpitaux et rues commerçantes, seul indicateur qui distinguera l'initiative d'un simple effet d'annonce. Cette implantation s'inscrit dans une dynamique déjà amorcée par les concurrents d'Unitree à Chengdu, où la base d'un rival est passée de la signature à la production en six mois, et où des robots de service guident déjà les visiteurs de la célèbre réserve de pandas de la ville. Wang Xingxing justifie ce choix en expliquant que les robots doivent sortir du laboratoire pour mûrir au contact du réel, la combinaison chengdunoise de vie quotidienne et d'innovation de pointe formant selon lui un terreau naturel. L'opération intervient un mois seulement après l'introduction en bourse d'Unitree, confirmant l'ambition du groupe de multiplier les implantations industrielles en Chine tout en consolidant sa position face à UBTECH, AgiBot et Galbot. Reste à savoir si cette stratégie fondée sur les usages locaux se traduira en modèle économique durable, un test que Wang lui-même dit suspendu à la présence effective, ou non, de robots Unitree dans les usines, hôpitaux et rues commerçantes de la ville.

Chine/AsieActu
1 source