Aller au contenu principal

Actualités robotique — page 40

4 728 articles au fil, du plus récent au plus ancien.

Amélioration du SLAM robotique par une transformation efficace vers un modèle linéaire
1951arXiv cs.RO 

Amélioration du SLAM robotique par une transformation efficace vers un modèle linéaire

Une équipe de chercheurs propose, dans un preprint déposé sur arXiv (réf. 2506.28475), une nouvelle méthode de localisation et cartographie simultanées pour robots mobiles, baptisée LMKF SLAM. L'approche repose sur l'ajout d'une boussole et l'application d'une transformation mathématique permettant de convertir le modèle d'état non linéaire classique en un modèle strictement linéaire. Une fois cette linéarisation exacte obtenue, les auteurs appliquent le filtre de Kalman standard (KF) plutôt que sa variante étendue (EKF), d'où l'acronyme LMKF pour Linear Model Kalman Filter. Les résultats expérimentaux rapportés affirment des gains en précision, en vitesse de convergence et en complexité calculatoire par rapport aux méthodes EKF de référence, avec une meilleure robustesse aux incertitudes de capteurs. L'intérêt potentiel réside dans un problème connu de longue date : l'EKF-SLAM diverge dans des environnements complexes ou lorsque la nonlinéarité des modèles de mouvement et d'observation est prononcée, car la linéarisation locale introduit des erreurs cumulatives. Si LMKF SLAM tient ses promesses, cela simplifierait considérablement l'intégration SLAM sur des plateformes à ressources contraintes (AGV d'entrepôt, robots de livraison, drones indoor), sans recourir à des architectures graphiques ou à des pipelines d'apprentissage coûteux. La dépendance à une boussole physique constitue toutefois une contrainte matérielle à évaluer en environnement industriel magnétiquement perturbé. Le SLAM par filtre de Kalman étendu remonte aux travaux fondateurs de Smith, Self et Cheeseman (1987). Depuis, le domaine a évolué vers des approches par filtre à particules (FastSLAM), puis par graphes de facteurs (GTSAM, iSAM2) et, plus récemment, vers des méthodes hybrides exploitant les réseaux de neurones (DROID-SLAM, NeRF-SLAM). Ce preprint n'a pas encore été soumis à révision par les pairs, et l'abstract ne fournit pas de chiffres précis sur les gains obtenus, ce qui limite l'évaluation indépendante des affirmations. Aucun partenaire industriel ni déploiement sur robot commercial n'est mentionné.

RecherchePaper
1 source
Planification unifiée de trajectoires multi-contacts pour les robots à déplacement roulant
1952arXiv cs.RO 

Planification unifiée de trajectoires multi-contacts pour les robots à déplacement roulant

Des chercheurs ont publié sur arXiv (ref. 2606.29065) un cadre unifié de planification de trajectoire pour les robots à roulement multi-contacts sous contraintes de non-glissement. Le problème central est la planification de mouvement dans des systèmes où plusieurs corps sphériques roulent simultanément sans glisser, ce qui génère des contraintes non-holonomes couplées et une configuration évoluant sur une variété courbe. Le framework proposé repose sur la formulation de Montana en coordonnées de contact, où chaque point de contact est représenté par un vecteur d'état à cinq dimensions. Sur cette base géométrique, les auteurs construisent une carte routière de type Voronoï directement sur la variété de contact sphérique, intègrent des obstacles en calotte sphérique et des zones d'exclusion mutuelle via une vérification de collision sur la variété, puis raffinent les chemins discrets par un lissage log-exp cohérent avec la géométrie différentielle. Les trajectoires lissées sont ensuite remontées en mouvements de roulement admissibles via la cinématique Montana et validées par simulation forward. Cette publication s'attaque à une lacune réelle en planification de mouvement : les approches classiques peinent à gérer simultanément les contraintes non-holonomes, la topologie des variétés de contact et la présence de plusieurs points de contact couplés. L'intégration d'un Voronoï directement sur la variété sphérique, plutôt que dans un espace euclidien aplati, est la contribution technique principale, car elle préserve la géométrie intrinsèque sans distorsions. Il convient cependant de noter que la validation reste purement simulée : aucune expérience sur plateforme physique n'est rapportée, ce qui constitue une limite explicitement reconnue par les auteurs. Le domaine des robots à roulement sphérique reste une niche académique, distinct des humanoïdes ou des AMR (robots mobiles autonomes) à roues classiques, mais pertinent pour des plateformes comme les robots à roulement omnidirectionnel ou les systèmes de manipulation interne par sphère. La cinématique de Montana, référence fondatrice des années 1980-90 en mécanique de contact, est ici réemployée comme socle formel. Les auteurs annoncent trois extensions futures : géométries non-sphériques, environnements à obstacles dynamiques, et validation expérimentale sur plateforme réelle. En l'état, il s'agit d'une contribution théorique solide, pas encore d'un outil intégrable en production industrielle.

RecherchePaper
1 source
Marché de l'IA physique encore ouvert : une entreprise chinoise propose l'approche 'edge-native' comme nouvelle solution
195336Kr 

Marché de l'IA physique encore ouvert : une entreprise chinoise propose l'approche 'edge-native' comme nouvelle solution

Au premier trimestre 2026, les investissements mondiaux dans le Physical AI ont dépassé 6,4 milliards de dollars, avec des levées emblématiques : AMI Labs (1,03 milliard de dollars en seed), World Labs (1 milliard) et le chinois Qianxun Intelligence (4,5 milliards de yuans en quatre tours en mars). C'est dans ce contexte qu'Om AI, une startup chinoise, a présenté du 27 au 29 juin 2026 une suite de trois modèles, VLX-Flow, VLX-Seek et VLX-Go, positionnée non pas sur la manipulation dextère ni la planification longue portée, mais sur la perception visuelle continue, la localisation spatiale précise et la navigation autonome. VLX-Flow utilise une attention linéaire (Linear Attention) couplée à une double mémoire (cache visuel et carryover textuel) pour ingérer le flux vidéo en continu, à la différence du paradigme classique qui traite des images isolées. VLX-Seek substitue la génération de coordonnées par une référence de région, fournissant des ancres spatiales à précision millimétrique. VLX-Go produit directement des trajectoires de waypoints exécutables via prédiction court-terme, apprentissage hors-ligne et optimisation RL en ligne. L'approche d'Om AI soulève un angle mort que les architectures VLA et world model dominantes n'ont pas encore résolu : dans les VLA mainstream, le tronc LLM absorbe plus de 90 % des ressources de calcul et des données, reléguant la tête d'action en composant chroniquement sous-entraîné. Les world models, censés combler ce déficit via la simulation physique, butent sur la rareté des données haute qualité à l'échelle requise. Or, la majorité des terminaux physiques déployés, drones en environnement GPS-dégradé, robots quadrupèdes, lunettes AR, terminaux d'inspection industrielle, n'ont pas besoin de mains dextères : ils ont besoin de localisation fiable et de perception continue. En repositionnant le problème sur la vision edge-native plutôt que sur la génération d'actions complexes, Om AI cible un segment plus large et potentiellement plus rapidement déployable que les humanoïdes, à condition que ses benchmarks se confirment hors des vidéos de démonstration sélectionnées. NVIDIA a présenté au GTC 2026 Alpamayo (VLA propriétaire) et Isaac GR00T N1.6 (VLA open-source pour humanoïdes) ; Xiaopeng a dévoilé X-Foresight au CVPR 2026 ; Google DeepMind avait publié Genie 3 en août 2025. La Beijing Academy of AI (BAAI) recense quatre routes de world models sans consensus industriel : centrée langage (Gemini 3), pixel (Sora), 3D (World Labs Marble de Fei-Fei Li) et représentation visuelle (V-JEPA de Yann LeCun). Les projections de marché divergent fortement : Future Markets table sur 383 milliards de dollars en 2026 croissant à 32 600 milliards en 2040, tandis que Coatue Management anticipe au moins 6 000 milliards, soit 50 % de plus que le digital AI. Om AI n'a pas encore communiqué de clients industriels nommés ni de volumes de déploiement pour sa suite VLX, ce qui reste la prochaine étape déterminante.

Chine/AsieOpinion
1 source
L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique
195436Kr 

L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique

Nüwa Robotics (纽娲机器人), startup chinoise fondée en février 2026 par le Dr Yang Ruigang, vient de boucler un tour angel de 50 millions de yuans (environ 6,9 millions d'euros), mené par Bluerun Ventures, avec la participation de Butong Capital et de Gongqingcheng Puyi Investment. C'est le deuxième financement en moins de deux mois : un seed round avait été conduit par Plug and Play Chine peu avant. Yang Ruigang est une figure connue de l'écosystème autonomie chinois : il a dirigé le laboratoire de conduite autonome et de robotique de Baidu, puis exercé comme CTO d'Inceptio Technology (嬴彻科技), où il a piloté la mise en production de camions autonomes de niveau L3. Aujourd'hui professeur associé à l'Université Jiao Tong de Shanghai, il oriente Nüwa vers un objectif précis : la construction d'un "World Traversal Model" (WTM), un modèle de navigation destiné à des robots de toute morphologie, humanoïdes, quadrupèdes, AGV ou véhicules de livraison. Le pari de Nüwa repose sur un constat que le secteur commence à intérioriser : la mobilité dans les environnements humains reste un verrou sous-estimé de la robotique incarnée. Là où la majorité des acteurs se concentrent sur la manipulation ou les architectures VLA (Vision-Language-Action), Nüwa cible la couche locomotion-navigation avec une ambition de déploiement sans carte ou à partir de plans génériques (Gaode, Baidu Maps). Leur moteur de simulation maison, SimWeaver, affiche selon la société des performances 3x supérieures à NVIDIA ISAAC Sim en vitesse de génération de données, une réduction de 20 % de l'erreur sim-to-real, et un taux de succès en zero-shot de 91 % sur des tâches de manipulation d'objets flexibles. Ces chiffres sont auto-déclarés et non vérifiés par des tiers. En locomotion, le système parvient à franchir des escaliers creux inclinés à 55 degrés en combinant vision et proprioception, là où d'autres solutions procèdent en aveugle. Nüwa intègre également un module de "conformité sociale" : le modèle est entraîné à respecter des règles comportementales implicites comme laisser sortir avant d'entrer dans un ascenseur ou céder le passage en espace public. Nüwa s'inscrit dans un paysage compétitif où les grandes architectures sont déjà définies : chez Figure, le modèle Helix (System 0/1/2) sépare planification lente et contrôle rapide ; NVIDIA GR00T N1 suit une logique similaire ; en Chine, Zhiyuan (智元) découpe locomotion, manipulation et interaction, tandis que Tencent RoboticsX structure son architecture SLAP en quatre couches. Nüwa choisit une entrée différente : transférer les acquis de l'autonomie véhiculaire vers des environnements beaucoup plus denses (ascenseurs, couloirs, centres commerciaux), en capitalisant sur la maîtrise de la simulation physique 3D de l'équipe. Le fondateur reconnaît que la brique manipulation reste à construire from scratch, sans analogue dans la conduite autonome. La feuille de route prévoit un premier déploiement du WTM dans un à deux scénarios réels en 2026, logistique et tourisme en priorité, avant une montée en puissance vers la production de robots propres à Nüwa et l'ouverture de la plateforme à des intégrateurs tiers. Aucun client ni partenaire industriel nommé n'a été annoncé à ce stade.

Chine/AsieActu
1 source
Les coulisses du rachat de Kinisi par Bear Robotics
1955The Robot Report 

Les coulisses du rachat de Kinisi par Bear Robotics

Bear Robotics, fabricant américain de robots de service connu pour son robot de restauration Servi, a annoncé l'acquisition de Kinisi Robotics, startup britannique spécialisée dans l'automatisation industrielle par apprentissage par renforcement. Les modalités financières de la transaction n'ont pas été divulguées. Kinisi, basée à Bristol (Royaume-Uni), développe le KR1, un prototype conçu pour automatiser des tâches industrielles répétitives et pénibles en collaboration avec des opérateurs humains, sans recourir à l'automatisation hardcodée traditionnelle. La société est fondée par Bren Pierce, titulaire d'un doctorat en robotique humanoïde de la Technische Universität München (TUM) et fort d'une décennie de recherche internationale. À son actif au fil de ses ventures précédentes : plus de 180 millions de dollars levés et plus de 10 000 robots déployés à l'échelle mondiale. L'acquisition illustre une dynamique de consolidation qui s'accélère dans le secteur, où les acteurs établis cherchent à intégrer des capacités d'IA physique plutôt que de les développer en interne. Bear Robotics, historiquement ancré dans la robotique de service en restauration, élargit son portefeuille vers l'industrie grâce à la technologie de Kinisi, qui substitue au pipeline de règles figées des politiques motrices apprises par reinforcement learning (RL). Cette approche permet une adaptation aux variations d'environnement sans reprogrammation manuelle, un avantage décisif pour les tâches non structurées ou insalubres que rejettent les systèmes classiques. L'annonce intervient dans la même semaine qu'une autre nouvelle structurante : Agility Robotics, fabricant du robot humanoïde Digit déployé chez Amazon, a confirmé son entrée en bourse via une fusion SPAC, signal supplémentaire d'une industrie qui cherche des voies de financement à grande échelle. Bear Robotics a été fondée en 2017 à Redwood City, en Californie, avec des investisseurs comme SoftBank Vision Fund, LG Electronics et Naver. Son robot Servi est déployé dans des centaines de restaurants aux États-Unis, en Corée du Sud et au Japon. Kinisi est une startup plus récente, mais portée par le profil éprouvé de Pierce. La course aux capacités d'IA physique mobilise aujourd'hui Figure AI, 1X Technologies, Apptronik ou encore Enchanted Tools en Europe, tous en train de lever des centaines de millions pour accélérer le passage du prototype au déploiement industriel réel. C'est précisément ce sim-to-real gap que Kinisi prétend adresser avec le KR1, mais les détails de performance publiés restent pour l'instant limités aux annonces d'acquisition : la démonstration à l'échelle, en conditions industrielles réelles, reste le critère que le marché attendra avant de valider la thèse.

BusinessOpinion
1 source
BMW Group déploie le robot humanoïde Figure 03 après les tests de la version précédente
1956Robotics Business Review 

BMW Group déploie le robot humanoïde Figure 03 après les tests de la version précédente

BMW Group a annoncé le déploiement de Figure 03, le dernier robot humanoïde de Figure AI, dans son usine de Spartanburg, en Caroline du Sud. Ce déploiement fait suite à un pilote de onze mois avec le modèle précédent, Figure 02, qui a participé à la production de plus de 30 000 véhicules BMW X3 en 2025. Dans cet atelier de carrosserie, Figure 02 insérait des pièces en tôle pour le processus de soudage, une tâche à la fois cadencée et physiquement contraignante. Figure 03 se voit confier une nouvelle mission en logistique : trier des composants arrivant en vrac dans de grands conteneurs, les placer dans des chariots de séquençage, puis les acheminer vers des points de collecte pour une livraison en flux tiré ("just in sequence") aux opérateurs d'assemblage. Le nouveau modèle introduit plusieurs évolutions techniques : mains dotées de capteurs tactiles et de caméras palmaires pour plus de précision, recharge sans fil pour une meilleure disponibilité opérationnelle, composants souples pour la sécurité de coopération homme-robot, et un module audio de communication vocale bidirectionnelle. L'annonce valide un argument central du débat sur les humanoïdes industriels : le passage du laboratoire à la production réelle est possible. Onze mois de fonctionnement en atelier de carrosserie constituent une référence concrète dans un secteur dominé jusqu'ici par des démonstrations contrôlées. Pour les intégrateurs et décideurs industriels, le cas BMW-Figure AI déplace la question de "est-ce que ça marche ?" vers "à quelle cadence et à quel coût peut-on scaler ?". L'usage logistique de séquençage choisi pour Figure 03 est particulièrement significatif : il est répétitif, non structuré (flux de pièces non triées) et à fort impact sur la fluidité de la chaîne d'assemblage. C'est exactement le type de tâche où les robots sur AGV classiques atteignent leurs limites. Cependant, ni BMW ni Figure AI n'ont communiqué de chiffres sur la cadence horaire, le taux d'erreur ou le coût opérationnel, ce qui rend difficile toute comparaison rigoureuse avec des solutions d'automatisation alternatives. Figure AI, fondée par Brett Adcock et basée à San José en Californie, avait initié son partenariat avec BMW comme premier déploiement industriel public à grande échelle, face à des concurrents comme Tesla (Optimus), Boston Dynamics (Atlas), Agility Robotics (Digit) ou encore Physical Intelligence avec son modèle de politique Pi-0. BMW, de son côté, diversifie ses expérimentations robotiques : l'entreprise teste également AEON, le robot humanoïde à roues d'Hexagon AB, dans son usine de Leipzig depuis décembre 2025, avec un déploiement pilote prévu à partir de l'été 2026. Spartanburg reste le site de référence pour la fabrication série, tandis que Leipzig sert de terrain d'essai pour des architectures de mobilité alternatives. Les prochaines étapes pour Figure 03 concerneront la scalabilité du cas d'usage logistique et son extension potentielle à d'autres halls de production BMW en Europe ou en Amérique du Nord.

HumanoïdesOpinion
1 source
MBody AI étend ses opérations de robotique de service à onze États américains et au Canada
1957The Robot Report 

MBody AI étend ses opérations de robotique de service à onze États américains et au Canada

MBody AI Corp., startup fondée en 2024 et basée à Las Vegas, annonce l'extension de ses opérations de robotique de service à onze États américains ainsi qu'au Canada. La société commercialise une plateforme logicielle baptisée Orchestrator, conçue pour coordonner des flottes de robots hétérogènes en environnements réels : nettoyage de sols, hôtellerie, immobilier commercial, santé et datacenters. La plateforme se positionne comme une couche de commande agnostique au hardware, offrant supervision à distance, assignation de tâches, maintenance prédictive et analyse de télémétrie en temps réel. Parmi les déploiements concrets, MBody AI cite l'extension en mars 2026 d'un contrat de nettoyage autonome de sols chez un opérateur Fortune 500 du secteur gaming et hôtellerie, sur plusieurs propriétés aux États-Unis. Aucun nom de client ni chiffre de flotte déployée n'est communiqué. L'annonce intervient dans le cadre d'un projet de fusion avec Check-Cap Ltd., société israélienne cotée au Nasdaq spécialisée en diagnostics médicaux, dont les actionnaires ont approuvé la transaction. La revue initiale du dossier d'introduction par Nasdaq a été complétée en avril 2026, sous réserve des conditions habituelles de clôture. L'intérêt opérationnel du modèle MBody AI réside dans son approche "flywheel" : chaque déploiement génère des données de terrain qui alimentent l'amélioration continue de la plateforme et justifient l'expansion de la flotte auprès du même client. John Fowler, CEO, insiste sur ce point en citant explicitement un opérateur qui a étendu son contrat "sur la base de ce qu'il a mesuré dans ses propres propriétés, pas de nos projections". C'est une distinction importante dans un secteur où la majorité des annonces restent au stade pilote ou démo. Pour les décideurs B2B, ce modèle data-driven réduit le risque de l'intégration initiale et déplace la justification ROI vers des métriques mesurables en interne. Le marché nord-américain de la robotique de service est estimé à environ 16 milliards de dollars en 2026 par Mordor Intelligence, avec une projection à 29 milliards d'ici 2031 ; le seul marché canadien pourrait atteindre 1,5 milliard d'ici 2029 selon Statista. Ces chiffres sont ceux cités par MBody AI dans son communiqué et méritent d'être pris avec la prudence habituelle vis-à-vis des études de marché commanditées. MBody AI opère dans un espace très disputé par des plateformes d'orchestration déjà établies comme Brain Corp (spécialisée nettoyage, avec des dizaines de milliers d'unités déployées), Avidbots, ou encore les couches logicielles propriétaires de fabricants comme LG CLOi ou Keenon. La fusion avec Check-Cap vise à donner à MBody AI un accès aux marchés de capitaux via une cotation Nasdaq, une voie utilisée par d'autres startups robotiques pour financer leur montée en échelle sans tour de financement classique. La prochaine étape déclarée est la finalisation de la fusion, après quoi l'entité combinée ambitionne de se positionner comme fournisseur B2B d'orchestration IA pour des secteurs confrontés à des pénuries de main-d'oeuvre. Aucun concurrent européen ou français n'est impliqué dans cette transaction.

IndustrielOpinion
1 source
Chine : les robots Agibot atteignent 99 % de réussite lors d'une démonstration en usine de six jours
1958Interesting Engineering 

Chine : les robots Agibot atteignent 99 % de réussite lors d'une démonstration en usine de six jours

AGIBOT, fabricant chinois de robots humanoïdes, a organisé fin juin 2026 un livestream mondial de six jours depuis l'usine Longcheer Technology de Nanchang, en Chine, pour démontrer la viabilité industrielle de ses robots G2 sur une ligne de production active. Les G2 sont des manipulateurs mobiles sur roues avec un torse humanoïde, conçus pour la manutention, l'inspection qualité et l'assistance en ligne de fabrication. Pendant 64 heures d'opération cumulées, les robots ont exécuté 64 828 tâches réparties sur plus de quatre flux de fabrication différents, avec un taux de réussite annoncé de 99,99 %. Ils ont contribué à la production de 17 625 unités de tablettes en conditions réelles, aux côtés d'opérateurs humains et d'équipements industriels en fonctionnement. Simultanément, AGIBOT a annoncé la livraison de son 15 000e robot à Longcheer, soulignant une montée en cadence remarquable : il a fallu environ un an pour passer de 1 000 à 5 000 unités, puis seulement trois mois pour aller de 5 000 à 10 000, soit une vitesse de production multipliée par quatre. Le demo-to-reality gap reste l'obstacle central du secteur humanoïde, et AGIBOT a structuré son exercice précisément pour répondre à cette critique. Un livestream continu de six jours sur une ligne de production commerciale non préparée est méthodologiquement plus contraignant qu'une démonstration en laboratoire ou une vidéo sélectionnée. Cela dit, un taux de succès de 99,99 % sans indication du nombre d'interventions humaines, du périmètre exact des tâches ou de la nature des "failures" non comptabilisées mérite prudence. Si les chiffres se confirment à l'audit, ils représentent un signal fort pour les intégrateurs industriels : le sim-to-real et la robustesse en environnement bruité commencent à être résolus à une échelle suffisante pour envisager des déploiements pilotes à coût acceptable. La position déclarée d'AGIBOT dans les expéditions mondiales d'humanoïdes, à 39 % de part de marché selon ses propres chiffres, illustre l'avance de l'écosystème chinois dans la commercialisation de masse, bien avant que des acteurs occidentaux comme Figure AI, Agility Robotics ou 1X n'aient franchi les mêmes seuils de volume. Fondée à Shanghai, AGIBOT a accéléré son développement dans le sillage du boom des VLA (Vision-Language-Action models) et de l'intérêt industriel post-2023 pour l'embodied AI. Son G2 concurrence directement le Figure 03 (Figure AI, ayant réalisé un run autonome de 200 heures en mai 2026 avec 250 000 colis traités) et l'Optimus Gen 3 de Tesla, ainsi que les robots Unitree et Fourier Intelligence côté chinois. Sur le segment européen, les acteurs comme Enchanted Tools ou Wandercraft restent positionnés sur des niches spécialisées (service, médical) sans viser encore la production industrielle de masse. La prochaine étape pour AGIBOT sera de convertir ces démonstrations en contrats de déploiement multi-sites et de publier des données indépendantes validant ses métriques de fiabilité.

Chine/AsieOpinion
1 source
X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique
1959Pandaily 

X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique

X Square Robot, startup pékinoise fondée en 2023 et spécialisée dans l'IA incarnée pour environnements réels, vient de boucler quatre tours de financement consécutifs dont une Série C portant sa valorisation à 2,8 milliards de dollars (20 milliards de yuans). IDG Capital a participé à la Série C, tandis que HongShan et Xiaomi ont soutenu l'entreprise sur plusieurs tours antérieurs. Surtout, Meituan, Alibaba et ByteDance ont chacun conduit un tour précédent, faisant de X Square Robot la seule société d'IA incarnée en Chine à avoir obtenu un lead investment des quatre plus grands groupes tech nationaux. En avril 2026, la société a dévoilé WALL-B, un modèle fondation basé sur son architecture "World Unified Model" (WUM) : contrairement aux approches VLA modulaires qui assemblent des composants vision, langage et action distincts, WALL-B entraîne l'ensemble perception-langage-action-prédiction physique dans un réseau unique. Deux modèles complémentaires ont été mis en open source : WALL-OSS-0.5, qui atteint plus de 80 % de complétion autonome sur 4 des 17 tâches testées en conditions réelles sans fine-tuning post-entraînement, et WALL-WM, un modèle de prédiction monde alignant données langagières, visuelles et gestuelles autour d'événements physiques significatifs. Sur le terrain, X Square Robot a déployé ses robots en partenariat avec 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, les machines opérant aux côtés d'agents humains dans des immeubles résidentiels réels. Depuis mai 2026, un programme "X Family Member" place des robots en foyers volontaires jusqu'à un mois en tant qu'assistants domestiques. La valorisation à 2,8 milliards de dollars positionne X Square Robot parmi les startups d'IA incarnée les mieux capitalisées de Chine, dans une course mondiale où Figure AI, Physical Intelligence et Agility Robotics mobilisent des montants comparables aux États-Unis. L'architecture unifiée de WALL-B constitue un pari architectural distinct des approches modulaires dominantes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le score de 80 % sur 4 tâches sélectionnées parmi 17 sans post-training est encourageant, mais l'échantillon invite à la prudence : les 13 tâches restantes ne sont pas documentées, ce qui laisse le demo-to-reality gap partiellement ouvert. Les déploiements effectifs chez 58.com et en appartements résidentiels donnent néanmoins plus de crédit à ces métriques que les démonstrations habituelles en laboratoire contrôlé. Fondée en 2023, X Square Robot s'inscrit dans un écosystème chinois de robotique humanoïde incluant Unitree Robotics, Fourier Intelligence et AgiBot, face aux acteurs américains Figure AI (valorisé 2,6 Md$ fin 2024), Boston Dynamics et Physical Intelligence. La présence simultanée de Meituan, Alibaba et ByteDance au capital signale des débouchés ciblés dans la logistique, la livraison et les services à domicile, secteurs que ces groupes cherchent activement à automatiser. La mise en open source de WALL-OSS-0.5 et WALL-WM suit une stratégie classique d'adoption académique et industrielle avant commercialisation. Les fonds levés seront alloués au développement technologique core et à la recherche fondamentale en intelligence incarnée, avec pour horizon déclaré des systèmes robotiques polyvalents capables d'opérer dans des environnements non structurés du quotidien.

Chine/AsieOpinion
1 source
La Chine ouvre en 2027 le premier hôtel au monde entièrement géré par des robots
1960Interesting Engineering 

La Chine ouvre en 2027 le premier hôtel au monde entièrement géré par des robots

Pudu Robotics a annoncé en juin 2026 l'ouverture, prévue pour 2027, d'un hôtel entièrement opéré par des robots sur l'île artificielle Ouest (West Artificial Island), le long du corridor Shenzhen-Zhongshan (ShenZhong) dans la province du Guangdong, en Chine. L'île elle-même n'a ouvert qu'en décembre 2025. Le projet, développé en partenariat avec Shenzhen Culture & Tourism Industry Development, présentera des essais publics en phase limitée dès fin 2026, avant le déploiement complet. La cérémonie de signature a tenu lieu de démonstration live : le robot PUDU T300 a transporté des bagages lourds et commandé des ascenseurs de façon autonome (capacité de charge : 300 kg), les robots de nettoyage PUDU CC1 Pro et PUDU MT1 ont maintenu les espaces via détection IA des déchets, tandis que BellaBot Pro servait du café avec interaction vocale et que KettyBot Pro distribuait collations et boissons avec affichage d'informations sur écran embarqué. Le robot PUDU D5 a assuré des performances interactives à destination des visiteurs. Ce qui distingue ce projet des "smart hotels" conventionnels -- qui automatisent des tâches isolées -- c'est l'ambition d'un écosystème robotique intégré de bout en bout. Les robots partagent une plateforme d'intelligence commune (PuduAgent) et un modèle fondationnel propriétaire, PuduFM 1.0, basé sur des architectures VLA (Vision-Language-Action) et une navigation par world model. Concrètement, les robots de réception comprennent la parole et les gestes sociaux, ceux de livraison optimisent leurs trajets en temps réel, et les robots de nettoyage s'adaptent aux changements d'environnement dynamiques. Ce partage de capacités apprises entre des morphologies différentes est exactement le pari que font les chercheurs en robotique généraliste depuis plusieurs années : réduire le sim-to-real gap et permettre un déploiement multi-tâches sans re-entraîner chaque plateforme. Si la démonstration confirme les performances annoncées en conditions opérationnelles réelles, et non en scénarios contrôlés, ce serait une validation significative de l'approche VLA à l'échelle d'un site commercial complexe. Il faut cependant noter que les vidéos présentées à ce stade proviennent d'une cérémonie marketing, pas d'une exploitation continue. Pudu Robotics est un acteur de Shenzhen fondé en 2016, surtout connu pour ses robots de service en restauration et commerce de détail (BellaBot, KettyBot), avec des déploiements dans plus de 60 pays. L'entreprise se positionne ici sur un segment plus ambitieux, face à des concurrents comme Bear Robotics (restauration, États-Unis), Keenon Robotics (Chine), ou encore Aethon dans la logistique hospitalière. Dans l'hôtellerie, des expériences comme le Henn-na Hotel japonais (Huis Ten Bosch, 2015) avaient montré les limites opérationnelles de robots peu adaptables. La question centrale reste celle de la fiabilité en conditions dégradées et de la gestion des cas limites par des équipes réduites. Les prochaines étapes annoncées -- essais publics fin 2026 sur un nombre limité de chambres -- constitueront le premier test réel, et vraisemblablement le plus scruté, du concept.

Chine/AsieOpinion
1 source
Zhipingfang valorisé à 2,8 milliards : première licorne d'IA incarnée de la Greater Bay Area
1961Pandaily 

Zhipingfang valorisé à 2,8 milliards : première licorne d'IA incarnée de la Greater Bay Area

Zhipingfang, startup d'IA incarnée basée à Shenzhen, a bouclé une levée de fonds d'environ 5 milliards de yuans (700 millions de dollars), portant sa valorisation à plus de 20 milliards de yuans (2,8 milliards de dollars). L'opération en fait le premier licorne de l'IA incarnée de la Greater Bay Area à franchir ce seuil. Le tour réunit un spectre inhabituellement large d'investisseurs : fonds publics nationaux (National SME Development Fund, China Cultural Industry System Fund), fonds provinciaux dédiés à l'IA, compagnies d'assurance et maisons de titres, et investisseurs industriels dont CP Group (China Biologic Products), Pharmaron, Moutai Group et China Merchants Capital. La société commercialise une architecture baptisée NeuroVLA, présentée par son fondateur et CEO, Guo Yandong, au Summer Davos Forum de juin 2026, où le Premier ministre Li Qiang a expressément cité le Shenzhen Robot Valley comme vitrine de l'écosystème d'innovation chinois. NeuroVLA organise le traitement en trois couches hiérarchiques calquées sur le système nerveux humain : un module cortical pour le raisonnement sémantique de haut niveau, un module cérébelleux pour le contrôle moteur coordonné, et un module spinal pulsé pour les boucles de rétroaction à ultra-faible latence. L'intérêt industriel de cette architecture réside dans l'efficacité computationnelle, problème structurel des systèmes robotiques actuels. Les architectures VLA (Vision-Language-Action) conventionnelles mobilisent l'intégralité de la puissance de calcul quelle que soit la complexité de la tâche, ce qui se traduit par des coûts d'inférence prohibitifs et des latences incompatibles avec le contrôle temps réel. NeuroVLA prétend résoudre cela par un routage événementiel : les boucles rapides (réflexes, stabilisation) sont traitées en couches basses, libérant le "cortex" pour le raisonnement symbolique. Le modèle biologique invoqué est le cerveau humain, 86 milliards de neurones fonctionnant à environ 20 watts, soit une densité de calcul que les GPU actuels n'approchent pas à consommation équivalente. Il faut cependant noter que les performances opérationnelles de NeuroVLA en conditions industrielles réelles ne sont pas documentées publiquement au-delà des communications de la société, et que l'affirmation de "première mondiale" reste invérifiable en l'absence de benchmark comparatif indépendant. La trajectoire financière de Zhipingfang est en elle-même un signal de marché : 12 tours de financement bouclés en un an, et une valorisation doublée de 10 à 20 milliards de yuans en quatre mois seulement, ce qui en fait, selon ses propres déclarations, la startup d'IA incarnée la plus rapide à lever à ce rythme et à cette échelle. L'entreprise est implantée au Shenzhen Robot Valley, pôle qui concentre également des acteurs comme Unitree, et s'inscrit dans une dynamique nationale où Pékin oriente massivement les fonds souverains vers l'IA incarnée pour concurrencer Figure AI (valorisé à 2,6 milliards de dollars fin 2024), Physical Intelligence et 1X côté américain, et Agility Robotics côté déploiements industriels. Aucune timeline de déploiement commercial ni volume de commandes n'ont été communiqués ; la levée reste pour l'instant une étape de financement de R&D et d'industrialisation, pas une annonce de mise en production à grande échelle.

Chine/AsieOpinion
1 source
Au programme de la #RoboCup2026
1962Robohub 

Au programme de la #RoboCup2026

La RoboCup 2026 se tiendra à Incheon, en Corée du Sud, du 2 au 6 juillet. L'édition marque une évolution notable du format de compétition : les ligues de football adoptent désormais les robots humanoïdes comme axe principal, une décision structurante dans un contexte d'essor commercial du bipède. Les équipes concourront dans plusieurs divisions : RoboCupSoccer (Humanoid, Middle Size, Small Size et Simulation), RoboCupRescue (Robot et Simulation), RoboCup@Home, Industrial et RoboCupJunior (Soccer, Onstage et Rescue). Un atelier spécifique, le WEROB, est réservé à la robotique éducative, ciblant étudiants, mentors et formateurs. Le symposium du 6 juillet accueillera deux conférences plénières : Hyun Myung interviendra sur l'intelligence spatiale pour la navigation autonome en environnement non structuré, et Gentiane Venture, chercheuse française en poste au Japon, traitera de la question de doter les robots d'une capacité à comprendre et à s'inscrire dans un contexte humain. Ce pivot vers les humanoïdes dans les ligues football ne relève pas du symbolique. Il intervient alors que le marché des robots humanoïdes s'emballe, avec Figure AI, Tesla (Optimus Gen 3), Boston Dynamics (Atlas) et Agility Robotics positionnés sur les mêmes métriques de locomotion bipède, de manipulation et d'adaptation à l'environnement réel. La RoboCup, en tant que banc de test académique et compétitif normalisé, devient un outil pertinent pour mesurer l'écart réel entre systèmes de recherche et plateformes commerciales. Le choix de focaliser les ligues football sur l'humanoïde signale que la locomotion bipède robuste est jugée suffisamment mature pour être testée dans des conditions structurées et exigeantes, au-delà des démonstrations contrôlées en laboratoire. Fondée en 1997 à l'initiative de chercheurs japonais, la RoboCup vise à aligner, d'ici 2050, une équipe de robots autonomes capable de battre les champions du monde FIFA en conditions réelles. Depuis ses premières éditions à Nagoya et Paris, la compétition a accompagné chaque génération de ruptures en robotique : navigation réactive, vision profonde, apprentissage par renforcement, puis architectures VLA. La tenue de l'édition 2026 en Corée du Sud n'est pas neutre : le pays abrite Rainbow Robotics (acquis par Samsung début 2024), Hyundai Robotics et plusieurs laboratoires académiques actifs sur l'humanoïde. L'annonce officielle reste à ce stade une communication événementielle, sans détail technique sur les règles révisées des nouvelles ligues humanoïdes ni sur les critères d'évaluation retenus pour cette transition.

HumanoïdesPaper
1 source
Point de vue : comment la perspective influence la sociabilité perçue des robots
1963arXiv cs.RO 

Point de vue : comment la perspective influence la sociabilité perçue des robots

Des chercheurs ont publié sur arXiv (référence 2603.28272v2) une étude expérimentale portant sur la perception de la sociabilité des robots de navigation selon le point de vue de l'observateur. L'équipe a conçu un protocole en réalité virtuelle immersive permettant de soumettre des trajectoires robotiques identiques à trois types de perspectives : allocentrique (vue aérienne, type supervision), égocentrique-proximale (première personne, robot proche) et égocentrique-distale (première personne, robot loin). Deux politiques de navigation distinctes ont été testées pour vérifier si les résultats sont généralisables au-delà d'un seul type de trajectoire. Une variable additionnelle a été introduite : la présence ou l'absence d'un geste de hochement de tête du robot au moment du croisement. Le résultat central contredit une hypothèse largement répandue dans la communauté : les trajectoires jugées sociables en vue aérienne sont perçues comme significativement plus dérangeantes lorsqu'on les expérimente en première personne et à proximité immédiate. Ce décalage perceptif a des implications directes pour les équipes qui valident des algorithmes de navigation sociale (SFM, ORCA, politiques VLA embarquées) uniquement via simulation ou supervision vidéo. Les benchmarks actuels, qui s'appuient massivement sur des métriques calculées depuis une vue de dessus, risquent de valider des comportements qui resteraient inconfortables sur le terrain réel. L'étude montre également que la distance de dépassement influence le niveau de perturbation ressenti, mais que des signaux sociaux communicatifs, comme le hochement de tête, compensent partiellement cet effet en améliorant la sociabilité perçue, ce qui ouvre une piste concrète pour les robots humanoïdes ou à tête expressive. Ce travail s'inscrit dans le champ de la navigation socialement consciente (socially aware navigation), actif depuis plus d'une décennie avec des travaux fondateurs sur la proxémique robotique et les espaces personnels. La validation humanoïde en environnement partagé est un enjeu croissant pour des acteurs comme Boston Dynamics, Agility Robotics ou Unitree, dont les robots opèrent déjà dans des entrepôts et espaces semi-publics. Côté européen, des initiatives comme Enchanted Tools (Mirokaï) ou les travaux de l'INRIA sur la navigation sociale font face au même verrou méthodologique pointé ici. La prochaine étape logique serait de valider ces résultats sur du matériel physique en conditions réelles, et d'intégrer des métriques égocentrique dans les pipelines de test standard des politiques de navigation.

RecherchePaper
1 source
MobileManiBench : simplifier la vérification des modèles pour la manipulation mobile
1964arXiv cs.RO 

MobileManiBench : simplifier la vérification des modèles pour la manipulation mobile

Une équipe de chercheurs a publié MobileManiBench, un benchmark à grande échelle destiné à évaluer les modèles de type VLA (Vision-Language-Action) sur des tâches de manipulation robotique mobile, avant tout déploiement réel. Le système repose sur NVIDIA Isaac Sim et un pipeline de génération automatique par apprentissage par renforcement, qui produit des trajectoires annotées incluant instructions en langage naturel, images RGB-profondeur-segmentation multi-vues, et états synchronisés objet/robot. Le dataset résultant comprend 300 000 trajectoires, couvrant 630 objets répartis en 20 catégories, 5 compétences motrices (ouvrir, fermer, tirer, pousser, saisir), plus de 100 tâches distinctes exécutées dans 100 scènes réalistes. Deux plateformes mobiles sont représentées, un robot à pince parallèle et un robot à main dextère, chacun équipé de deux caméras synchronisées (tête et poignet droit). Le code, les datasets et les modèles sont publiés en open-source. L'enjeu central que MobileManiBench cherche à résoudre est le goulot d'étranglement des données de téléopération : les VLA actuels, dont pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, sont entraînés quasi-exclusivement sur des scènes de table statiques collectées par des opérateurs humains, ce qui limite leur généralisation à des environnements mobiles et encombrés. Un framework de vérification en simulation avant déploiement réel permettrait aux équipes R&D de filtrer les architectures non viables sans mobiliser des flottes de robots physiques ni des heures de téléopération coûteuses. La génération automatique à l'échelle de 300K trajectoires diversifiées ouvre également la voie à des études contrôlées sur l'efficacité des données et la généralisation, deux variables critiques pour les intégrateurs industriels qui évaluent le coût réel d'adoption d'un VLA. Cette publication s'inscrit dans un mouvement plus large de la communauté robotique vers les approches sim-to-real, portées notamment par NVIDIA (Isaac Lab, Isaac Sim) et des labos comme Stanford, CMU et le LAAS-CNRS côté français. La manipulation mobile reste plus difficile que la manipulation sur table fixe en raison de la complexité des coordinations base-bras et de la variabilité des angles de caméra, problèmes que MobileManiBench cherche précisément à circonscrire. Les résultats comparatifs publiés sur plusieurs VLA représentatifs fournissent une base de référence utile, même si les benchmarks en simulation pure sous-estiment souvent l'écart sim-to-real : les métriques annoncées devront être validées en conditions physiques pour devenir opérationnellement significatives.

RechercheOpinion
1 source
LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)
1965arXiv cs.RO 

LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)

Des chercheurs ont publié LIBERO-Safety, un benchmark paramétrique conçu pour évaluer la sûreté physique et sémantique des modèles Vision-Language-Action (VLA) dans des scénarios de manipulation robotique. Le système génère de façon procédurale des situations critiques avec une stochasticité complète, en s'appuyant sur un pipeline de génération de données piloté par des poses-clés (keypose-driven), une alternative à la téléopération humaine, jugée trop coûteuse à passer à l'échelle. Le jeu de données résultant comprend 19 664 démonstrations strictement sans collision, avec une randomisation de domaine extensive. L'équipe a ensuite évalué de manière systématique huit modèles VLA et deux modèles fondateurs incarnés (embodied foundation models), couvrant plusieurs paradigmes d'entraînement contemporains. Le résultat central est une tension generalization-safety que les auteurs qualifient de critique : un entraînement sur des données très diversifiées produit des trajectoires plus sûres, mais la réussite des tâches reste fondamentalement plafonnée par une synthèse de trajectoires sous-optimale et un désalignement sémantique. Autrement dit, rendre un VLA plus prudent ne le rend pas automatiquement plus compétent, et inversement. Pour les intégrateurs industriels et les équipes produit qui espèrent déployer ces modèles en environnement non contrôlé, ce constat tempère les promesses des démonstrations récentes : les modèles VLA actuels ne garantissent pas une opération sûre sous contraintes strictes. C'est un signal fort que les métriques de performance sur tâche sont insuffisantes pour valider un déploiement réel. LIBERO-Safety s'inscrit dans la continuité du benchmark LIBERO (Lifelong Robot Learning), initialement développé pour évaluer le transfert de tâches. L'extension safety arrive dans un contexte d'accélération marquée des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont tous été présentés cette année avec des capacités de manipulation généraliste convaincantes, mais sans évaluation de sûreté systématisée. LIBERO-Safety propose une infrastructure open-source pour combler ce vide, avec un pipeline scalable permettant à d'autres équipes de générer leurs propres datasets de sécurité. Les suites naturelles incluent l'intégration de ce benchmark dans les pipelines d'évaluation des grands labos de robotique, et potentiellement son adoption comme référentiel de validation pour des déploiements industriels en production.

RecherchePaper
1 source
L'injection directe d'un point 3D ancré dans la tête d'action débloque la généralisation spatiale et des tâches
1966arXiv cs.RO 

L'injection directe d'un point 3D ancré dans la tête d'action débloque la généralisation spatiale et des tâches

Des chercheurs ont publié fin juin 2026 (arXiv:2606.27663) une méthode légère pour améliorer la généralisation des modèles Vision-Language-Action (VLA) en manipulation robotique. Le module proposé représente le signal d'ancrage spatial en 3D, calcule son déplacement relatif au préhenseur, et injecte l'embedding résultant directement dans la tête d'action via une normalisation de couche adaptative (AdaLN). Concrètement, c'est un MLP à deux couches qui n'exige aucune modification du backbone préentraîné ni du pipeline d'entraînement. Sur le benchmark LIBERO-PRO, appliqué à GR00T-N1.6 de NVIDIA, le taux de succès moyen passe de 31,2 à 77,5 points sous perturbation de tâche (+46,3 points) et de 28,1 à 60,2 points sous perturbation de position (+32,1 points). Des gains comparables sont mesurés sur π0.5 de Physical Intelligence, ce qui valide l'approche sur deux architectures distinctes. Les VLA souffrent de deux formes structurelles de fragilité à l'inférence : la généralisation spatiale, lorsqu'un objet cible se trouve à une position non vue à l'entraînement, et la généralisation de tâche, lorsqu'une instruction légèrement reformulée dans un contexte visuel familier fait chuter la politique. Les approches précédentes par prompting textuel ou visuel avec coordonnées 2D en pixels s'avèrent insuffisantes. Ce travail identifie le vrai levier : ni la richesse du prompt, ni l'ajout de capteurs, mais la représentation 3D de l'ancrage et son point d'injection en bout de chaîne, directement dans la tête d'action. Pour les intégrateurs industriels, cela signifie qu'un VLA déjà déployé peut théoriquement être augmenté de ce module sans réentraînement complet, ouvrant la voie à des adaptations sur des lignes de production à géométrie variable. Ce résultat s'inscrit dans une course intense à la généralisation en manipulation dextère. Physical Intelligence a sorti π0 puis π0.5 sur des données multi-tâches à grande échelle ; NVIDIA déploie GR00T N1.6 et prépare GR00T N2 pour des capacités humanoïdes. D'autres méthodes d'ancrage spatial comme SpatialVLA ou RoboPoint cherchaient déjà à résoudre ce problème via des coordonnées 2D ou des cartes de profondeur ; ce travail tranche le débat en faveur de la 3D injectée en bout de chaîne. À ce stade, c'est un résultat de recherche validé uniquement en simulation sur LIBERO-PRO ; le passage au réel, sur des robots physiques en environnement industriel, reste à démontrer.

IA physiqueOpinion
1 source
Le RL contraint par le support permet d'améliorer les politiques réelles sans expérience du monde réel
1967arXiv cs.RO 

Le RL contraint par le support permet d'améliorer les politiques réelles sans expérience du monde réel

Des chercheurs du Weird Lab (Université de Washington) ont publié en juin 2026 SCORE (Support-Constrained Off-Domain REinforcement), un framework real-to-sim-to-real conçu pour améliorer des politiques robotiques sans collecte supplémentaire de données réelles. Évalué sur huit tâches de manipulation dextère multi-doigts en conditions réelles, SCORE fait passer le taux de succès moyen de 37,8 % à 89,9 %, contre 59,5 % pour la meilleure méthode de référence testée. Le système atteint son objectif en 36,8 % moins d'étapes que la politique de base. La méthode repose sur du RL en simulation, contraint via une technique appelée "flow steering" : les actions explorées restent dans le support de la politique générative pré-entraînée sur données réelles, garantissant ainsi le transfert vers le matériel physique. SCORE apprend à partir de récompenses éparses, n'exige pas de distillation, et laisse la politique de base intacte. Le principal verrou du déploiement industriel de la manipulation généraliste est précisément le "reality gap" : le RL non contraint en simulation exploite les approximations de contact et de dynamique pour produire des comportements qui échouent sur hardware. SCORE apporte une réponse structurée : améliorer substantiellement une politique existante par simulation seule, sans rollouts physiques coûteux ni risqués, et sans modifier la politique de base. Pour un COO industriel ou un intégrateur, le signal est clair, il devient possible de tirer davantage de politiques déjà déployées (issues de démonstrations ou de VLA pré-entraînés) sans nouvelle campagne de collecte terrain. Les travaux s'inscrivent dans la lignée des architectures basées sur le flow-matching, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, dont les politiques génératives constituent un prior comportemental exploitable par "flow steering". Par rapport aux approches concurrentes (DAgger, fine-tuning RL en simulation sans contrainte), SCORE se distingue en contraignant l'espace d'action plutôt qu'en régularisant globalement le comportement, ce qui préserve l'amélioration tout en évitant la sur-contrainte. Le code et les vidéos sont disponibles publiquement ; la validation à plus grande échelle sur des VLA déployés en environnement industriel ou de service constituera l'étape critique suivante.

IA physiquePaper
1 source
FailSafe : raisonnement et récupération face aux défaillances dans les modèles VLA
1968arXiv cs.RO 

FailSafe : raisonnement et récupération face aux défaillances dans les modèles VLA

Une équipe de chercheurs a publié FailSafe, un système de génération automatique de scénarios d'échec et d'actions de récupération pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. Présenté dans un preprint arXiv (v3, 2026), le système s'appuie sur LLaVA-OneVision-7B, un modèle de 7 milliards de paramètres affiné pour détecter des pannes en cours de tâche et produire des actions correctives exécutables, donnant naissance à FailSafe-VLM. Les évaluations conduites dans le simulateur ManiSkill montrent que cette couche de récupération améliore en moyenne jusqu'à 22,6% les performances de trois architectures VLA de référence : Pi-0-FAST (Physical Intelligence), OpenVLA et OpenVLA-OFT. Le système se généralise à différentes configurations spatiales, angles de caméra, objets manipulés et morphologies de bras robotiques. L'enjeu est structurel : les datasets de manipulation robotique existants, simulés ou réels, se limitent presque exclusivement à des trajectoires correctes. Un robot entraîné sur ces données ne dispose d'aucun mécanisme pour se remettre d'une prise ratée, d'un objet déplacé ou d'une perturbation imprévue. FailSafe comble ce vide en générant automatiquement, à partir de tâches existantes et d'un planificateur de mouvement, des paires (échec, action de récupération) annotées et directement exploitables en fine-tuning. Pour les équipes R&D et les intégrateurs, c'est une brique scalable sans collecte de données humaines supplémentaire. Le gain de 22,6% reste toutefois un delta relatif sur plusieurs tâches en simulation, et les auteurs ne rapportent aucun test en conditions physiques réelles : le sim-to-real gap pour les scénarios d'échec eux-mêmes reste une question ouverte. Les VLA représentent la convergence des grands modèles de vision-langage avec la commande motrice basse-fréquence, un axe de recherche en forte croissance depuis 2023. Pi-0 de Physical Intelligence, OpenVLA développé par Berkeley et Stanford, et leurs variantes constituent aujourd'hui le benchmark dominant dans ce domaine. FailSafe se positionne non comme un nouveau modèle de base, mais comme une surcouche de robustesse greffable sur ces architectures existantes, une approche pragmatique qui évite de repartir de zéro. Les quelques datasets existants traitant de la détection d'échec se limitaient à des explications textuelles difficilement exploitables directement par un VLA, ce que FailSafe résout en produisant des actions exécutables. La prochaine étape logique sera une validation hors simulateur, notamment sur des manipulateurs industriels réels, pour confirmer si les scénarios synthétiques d'échec transfèrent effectivement au monde physique.

IA physiqueOpinion
1 source
LocalNav : distillation de VLMs frontière et RL incarné pour la navigation embarquée vers un objet cible
1969arXiv cs.RO 

LocalNav : distillation de VLMs frontière et RL incarné pour la navigation embarquée vers un objet cible

Une équipe de chercheurs a publié LocalNav (arXiv 2506.27871), une méthode de distillation permettant d'exécuter des modèles de vision-langage (VLM) directement sur robots embarqués, sans recourir au cloud. Le pipeline de référence s'appuie sur Claude Sonnet 4.6 couplé à un graphe de scène et atteint un taux de succès (SR) de 39,7% sur le benchmark HM3D OVON, qui évalue la navigation vers des objets désignés en langage naturel dans des environnements intérieurs simulés (tâche ObjectNav). Qwen3.5-4B, un modèle de 4 milliards de paramètres, est ensuite fine-tuné sur seulement 500 traces de raisonnement issues de ce pipeline frontier : il obtient un SR de 34,5%, réduisant significativement l'écart avec le modèle cloud de référence. Pour le déploiement physique sur Jetson Orin (NVIDIA), les auteurs introduisent E-RLVR avec régularisation Token Generation (TG), qui comprime les séquences de sortie. Combinée à la quantification, cette optimisation réduit la latence globale d'inférence de 82,8% (71,8% sur la latence brute, 72,1% sur la génération de tokens), sans perte de performance jugée significative par les auteurs. L'enjeu industriel est direct : la dépendance au cloud représente un frein opérationnel réel pour les robots mobiles déployés en entrepôt, en usine ou en extérieur, où la connectivité est intermittente et où chaque dizaine de millisecondes pèse sur les décisions de navigation. Le fait que 500 traces de distillation suffisent à approcher les performances d'un grand modèle frontier valide une hypothèse clé du domaine : la supervision synthétique depuis des LLMs propriétaires peut compenser l'absence de larges jeux de données annotés manuellement. La réduction de 82,8% de latence franchit un seuil opérationnel critique pour un déploiement synchrone avec le mouvement physique du robot, ce que les architectures cloud ne peuvent pas garantir en conditions réelles. Ce travail s'inscrit dans une tendance de compression des VLMs pour la robotique edge, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui cherchent tous à réduire leur empreinte computationnelle pour le déploiement à grande échelle. La distillation depuis Claude vers Qwen positionne ce pipeline à l'intersection de deux écosystèmes : modèles frontier propriétaires comme source de supervision, modèles open-weights comme cible d'optimisation. À noter que l'ensemble des résultats présentés reste pour l'instant simulé sur HM3D ; les prochaines étapes naturelles incluent une validation sur déploiement physique réel et un passage à l'échelle des traces de distillation au-delà des 500 exemples actuels, pour cartographier la courbe d'amélioration.

IA physiqueOpinion
1 source
Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs
1970arXiv cs.RO 

Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs

Des chercheurs ont publié le 29 juin 2026 sur arXiv (2606.28237) un pipeline nommé Uni-Mo, capable de générer automatiquement des mouvements expressifs pour robots quadrupèdes sans recourir à des animaux réels comme source de données. Le système enchaîne trois étapes : un LLM produit des descriptions textuelles de mouvements, un modèle de diffusion vidéo synthétise les comportements correspondants sous forme de séquences visuelles, puis ces vidéos sont converties en trajectoires 3D servant à entraîner des politiques de suivi déployées sur un Unitree Go2. Pour stabiliser les générations vidéo naturellement instables sur la durée, les auteurs introduisent une "Identity Consistency Loss" qui impose une cohérence d'apparence du robot entre les frames. Le jeu de données résultant, Quad-Imaginarium (disponible en open source sur GitHub), regroupe 7 488 séquences de mouvements annotées en langage naturel, couvrant 18,5 heures de comportements acrobatiques et expressifs. Sur 392 mouvements tirés aléatoirement et testés physiquement sur un Go2 réel, le taux de succès de déploiement atteint 96,7 %, contre 97,6 % en simulation sur l'ensemble du dataset. Ce résultat est notable parce qu'il contourne une hypothèse tacite qui plombait les approches précédentes : faire passer les données de mouvement par un corps animal réel, ce qui rendait la collecte dépendante d'animaux coopératifs, la reconstruction fragile selon les espèces, et le retargeting mal posé face aux incompatibilités morphologiques. En traitant la rareté des données comme un problème de génération plutôt que de capture, Uni-Mo démontre qu'un pipeline entièrement synthétique peut atteindre un taux sim-to-real supérieur à 96 %, ce qui valide empiriquement l'hypothèse que la diffusion vidéo peut servir de simulateur comportemental crédible pour la robotique quadrupède. Pour les intégrateurs et décideurs B2B, cela signifie potentiellement une voie vers des robots compagnons ou d'inspection aux comportements riches, sans infrastructure de motion capture animale. Le champ du mouvement quadrupède expressif est dominé par des approches d'imitation sur données réelles (Boston Dynamics, ANYbotics, Unitree lui-même) ou de retargeting depuis des séquences canines capturées en laboratoire. Uni-Mo s'inscrit dans une tendance émergente qui mobilise les générateurs vidéo comme oracles de physique approximative, après des travaux similaires dans le domaine humanoïde (notamment autour de Pi-0 de Physical Intelligence et des pipelines VLA). L'Unitree Go2, robot grand public à moins de 3 000 dollars, est ici utilisé comme plateforme de validation, ce qui renforce la reproductibilité de l'approche. Les prochaines étapes probables incluent l'extension à des morphologies différentes et l'intégration de retours proprioceptifs pour fermer la boucle en temps réel.

IA physiqueOpinion
1 source
Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?
1971arXiv cs.RO 

Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?

Une équipe de chercheurs a publié fin juin 2026 une étude (arXiv:2606.27755) examinant la redondance architecturale des modèles Vision-Language-Action (VLA), ces modèles de contrôle robotique qui combinent un backbone de langage préentraîné avec des modules vision et action. Le protocole, baptisé Drop-Then-Recovery (DTR), consiste à supprimer des blocs transformer sélectionnés d'un VLA préentraîné, puis à le fine-tuner pour mesurer si la capacité retirée était réellement nécessaire au contrôle en boucle fermée. Pour prioriser quels blocs supprimer, les auteurs introduisent GateProbe, une métrique de sensibilité en un seul passage (one-shot) qui classe les blocs selon leur contribution à la perte d'action en aval. Les expériences couvrent plusieurs architectures VLA, des benchmarks de manipulation standard (dont LIBERO) et des scénarios industriels sur robot réel. Résultat chiffré marquant : supprimer la moitié des blocs LLM d'OpenVLA-OFT fait passer le score LIBERO de 95,0 % à 98,3 %, et ne conserver que deux blocs de langage suffit à retrouver les performances de référence. Ce résultat remet en question un postulat implicite du domaine : que la profondeur des backbones de langage hérités des grands modèles (LLM) est nécessaire à la compréhension d'instructions robotiques. Les instructions typiques en manipulation sont courtes et peu compositionnelles ; le surcapacité linguistique ne sert pas le contrôle et peut même nuire via du bruit de gradient ou une compétition de capacité. En revanche, les voies vision et action se révèlent nettement moins tolérantes à la suppression, ce qui oriente clairement les priorités d'allocation pour les futures architectures VLA. Pour les intégrateurs industriels, cela ouvre la voie à des modèles plus légers, moins coûteux à inférer et à fine-tuner, sans dégradation de performance sur les tâches réelles. Les VLA ont émergé comme paradigme dominant du contrôle robotique généraliste depuis les travaux fondateurs sur RT-2 (Google DeepMind, 2023) et OpenVLA (Berkeley, 2024), qui ont montré qu'un backbone VLM préentraîné pouvait être réutilisé pour la manipulation. OpenVLA-OFT, utilisé comme modèle de référence dans cette étude, est une variante fine-tunable publiée par l'Université de Stanford. Parmi les concurrents directs sur ce terrain architectural : Physical Intelligence avec pi0 (basé sur un flow matching), qui a déjà opté pour une architecture plus légère côté langage, et les travaux de pruning de transformers en NLP (SparseGPT, Sheared LLaMA) dont DTR s'inspire méthodologiquement. Le code est disponible sur GitHub (s1ghhh/VLADrop). Les prochaines étapes logiques seraient de tester DTR sur des modèles plus récents (GR00T N2 de NVIDIA, Helix de Figure) et sur des tâches à instructions longues ou hiérarchiques, où la profondeur linguistique pourrait enfin devenir un facteur limitant.

RechercheOpinion
1 source
Localisation robotique de sources radioactives guidée par la physique, trajectoires arbitraires en milieu non structuré
1972arXiv cs.RO 

Localisation robotique de sources radioactives guidée par la physique, trajectoires arbitraires en milieu non structuré

Des chercheurs ont publié le 27 juin 2026 un framework d'automatisation pour la localisation robotisée de sources radioactives (RSL, Radiation Source Localization) reposant sur un modèle d'apprentissage automatique informé par la physique (PIML, Physics-Informed Machine Learning). La contribution centrale est de permettre l'estimation précise de la position d'une source de rayonnement gamma quelle que soit la trajectoire parcourue par le robot, sans obligation de s'approcher de la source. Le système s'appuie sur des tenseurs modèles inspirés de la physique pour traiter les signaux de flux gamma atténués par des obstacles inconnus, et calcule plusieurs modèles en parallèle pour améliorer la robustesse et la précision de la localisation. La validation a été conduite en simulation haute-fidélité via transport de particules Monte Carlo, sur des domaines randomisés variant en échelle spatiale, type de source, matériaux et géométries d'obstacles, et trajectoires robot, puis confirmée par des expériences physiques sur des configurations hors simulation. Un mécanisme d'apprentissage continu (continuous learning) est appliqué lors du déploiement sur robot réel pour renforcer l'applicabilité opérationnelle du système en ligne. Ce résultat est significatif pour deux raisons distinctes. Premièrement, il découple la localisation radiologique de la contrainte de chemin : les méthodes existantes imposaient un algorithme de planification dédié à la RSL, typiquement en approchant la source, ce qui augmentait l'exposition du robot et limitait la flexibilité des missions. Ce framework s'intègre à n'importe quelle trajectoire, libérant les opérateurs pour des missions mixtes (cartographie, inspection, RSL simultanés). Deuxièmement, il franchit un seuil conceptuel identifié par les auteurs eux-mêmes : passer de la détection de flux ponctuelle à une "intelligence spatiale", c'est-à-dire une représentation probabiliste de l'environnement radioactif plutôt qu'une simple mesure locale. Les méthodes concurrentes en RSL robotisé s'appuient majoritairement sur des approches bayésiennes ou de gradient de flux qui nécessitent une stratégie de déplacement active vers la source, rendant difficile leur déploiement dans des environnements non structurés comme les sites de démantèlement nucléaire (Chernobyl, Fukushima, centrales en fin de vie) ou les interventions d'urgence radiologique. Aucun acteur industriel européen ou français n'est mentionné dans cette publication académique, mais les cas d'usage visés correspondent directement aux besoins d'opérateurs comme EDF ou CEA dans le cadre du démantèlement du parc nucléaire français. Les prochaines étapes probables incluent l'extension à des sources multiples et des environnements 3D complexes, ainsi qu'une intégration dans des stacks ROS pour faciliter le transfert industriel.

RecherchePaper
1 source
SimFoundry : génération modulaire et automatisée de scènes pour l'apprentissage et l'évaluation de politiques
1973arXiv cs.RO 

SimFoundry : génération modulaire et automatisée de scènes pour l'apprentissage et l'évaluation de politiques

Des chercheurs du laboratoire GEAR de NVIDIA ont publié SimFoundry sur arXiv (identifiant 2606.28276), un pipeline modulaire et automatisé permettant de reconstruire des scènes de simulation directement depuis une vidéo du monde réel, sans annotation manuelle. Le système génère des jumeaux numériques sim-ready, puis en dérive automatiquement des "cousins numériques": des variantes de la scène originale qui préservent les affordances manipulatoires tout en modifiant objets, arrangements ou tâches. Testé sur sept tâches de manipulation (multi-étapes, objets articulés, bimane) et cinq architectures de policies distinctes, SimFoundry atteint une corrélation de Pearson de 0,911 entre évaluation en simulation et performance réelle, avec un mean maximum ranking violation de 0,018. En transfert zéro-shot vers le monde réel, les cousins d'objets apportent +17% de taux de succès, les cousins de scènes +21%, et les cousins de tâches +40%. Ces résultats s'attaquent directement au sim-to-real gap, l'écart structurel qui rend les benchmarks de simulation peu fiables pour prédire les performances physiques. Avec une corrélation de 0,911, les équipes R&D peuvent comparer des architectures de policies en simulation sans mobiliser de temps robot, ce qui réduit significativement le coût d'évaluation. Le concept de cousins numériques va plus loin que l'augmentation de données classique: en préservant les affordances, les variantes restent exploitables pour l'apprentissage sans dériver vers des distributions hors domaine. Pour un intégrateur de cellules robotiques ou un décideur industriel, le gain concret est une accélération du cycle développement-évaluation, à condition que la reconstruction vidéo reste robuste hors des environnements contrôlés présentés dans le papier. SimFoundry s'inscrit dans la stratégie robotique large de NVIDIA, qui développe en parallèle la plateforme Isaac Sim et le modèle de fondation humanoïde GR00T N2. Le laboratoire GEAR, dédié à la généralisation des policies d'agents incarnés, positionne cette approche sim-centric face aux alternatives data-centric: Physical Intelligence (Pi-0, issu des travaux de Sergey Levine) mise sur des volumes massifs de démonstrations réelles, tandis que Google DeepMind avance avec ses propres pipelines de simulation. Dans l'écosystème des simulateurs robotiques (Sapien, RoboSuite, Genesis), SimFoundry se distingue par son entrée vidéo sans annotation. Le papier, disponible en prépublication sur arXiv, ne précise pas de calendrier de mise à disposition du code ni d'intégration dans un produit commercial.

RecherchePaper
1 source
Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond
1974arXiv cs.RO 

Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond

Une étude publiée sur arXiv (référence 2510.11103, troisième révision) analyse systématiquement comment les différentes représentations mathématiques du groupe SO(3), l'espace des rotations 3D, influencent l'apprentissage par renforcement appliqué au contrôle robotique. Les chercheurs ont comparé quatre familles de représentations courantes : angles d'Euler, quaternions, matrices de rotation et coordonnées d'algèbre de Lie, en les évaluant sur trois algorithmes d'RL continus de référence (PPO, SAC et TD3), sous deux régimes de récompenses (dense et sparse), et sur une suite de benchmarks robotiques standardisés. Le résultat central : représenter les actions comme des vecteurs tangents dans le repère local donne les résultats les plus fiables et les plus stables, quel que soit l'algorithme utilisé. Le code et la page projet sont disponibles à amacati.github.io/so3_primer. Ce résultat a une portée directe pour les ingénieurs qui développent des politiques de contrôle pour la manipulation ou la locomotion humanoïde. Le choix de représentation n'est pas neutre : la géométrie induite par chaque paramétrisation conditionne la manière dont l'agent explore l'espace des actions, interagit avec la régularisation entropique (notamment dans SAC), et converge, ou échoue à converger, lors de l'entraînement. Les angles d'Euler souffrent de singularités connues (gimbal lock), les quaternions imposent une contrainte de norme unitaire difficile à respecter en sortie de réseau neuronal, et les matrices de rotation introduisent des redondances qui compliquent la projection sur SO(3) valide. L'étude fournit des recommandations directement applicables, ce qui est rare dans la littérature RL sur la rotation. La problématique SO(3) est bien documentée pour l'apprentissage supervisé, notamment dans les pipelines d'estimation de pose, mais ses implications pour les actions en RL restaient peu explorées. Ce travail comble ce manque à un moment où les politiques d'entrée-sortie continues (VLA, diffusion policies, flux-matching) deviennent centrales dans les robots manipulateurs commerciaux. Les équipes qui développent des politiques pour des plateformes comme Figure 03, Unitree H1 ou des manipulateurs industriels s'appuient de plus en plus sur SAC et TD3 ; savoir que la représentation en vecteur tangent surpasse systématiquement les alternatives simplifie un choix d'architecture souvent fait de manière empirique. Les auteurs publient le code en open source, ce qui permettra à la communauté de valider ces résultats sur d'autres benchmarks et accélérera potentiellement l'adoption de cette convention dans les frameworks d'RL robotique.

RecherchePaper
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
1975arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon
1976arXiv cs.RO 

S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon

Un groupe de chercheurs a publié S²-VLA (State-Space Guided Vision-Language-Action), une architecture destinée à résoudre l'une des limitations structurelles des modèles VLA en manipulation robotique : la dégradation des performances sur les tâches longues due à la propagation cumulative des erreurs. Le coeur du système est le mécanisme SSGAA (State-Space Guided Adaptive Attention), qui maintient un "état de croyance" (belief state) actualisé à chaque étape de la tâche et génère des poids de fusion dynamiques, là où les architectures VLA existantes utilisent des poids fixes. Ces poids adaptatifs combinent trois sources : les caractéristiques visuelles pour la perception spatiale, les intentions de haut niveau pour la planification, et les séquences d'actions temporelles pour la cohérence d'exécution. Avec 2 milliards de paramètres seulement, S²-VLA surpasse des modèles de 7 milliards sur les benchmarks LIBERO et SimplerEnv, deux références pour l'évaluation des tâches de manipulation longue séquence. Le résultat le plus saillant est l'efficacité paramétrique : battre des modèles 7B avec un modèle 2B remet en question l'hypothèse selon laquelle la performance sur des tâches complexes serait avant tout une affaire de scaling. Pour les intégrateurs industriels et les équipes déployant des robots manipulateurs, cela ouvre la voie à une inférence embarquée sur des plateformes aux ressources limitées. Sur le plan de la recherche, le papier formalise un point de friction bien identifié : la fusion statique des représentations visuelles, linguistiques et motrices crée une rigidité qui amplifie les erreurs au fil des étapes. L'emprunt aux modèles d'espace d'états (State Space Models, d'où "S²") pour introduire une mémoire adaptative dans la fusion est l'apport architectural central. Les modèles VLA ont connu une accélération significative depuis 2024, avec Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA) comme jalons récents, tous confrontés à la même limite sur les longs horizons de tâches. S²-VLA s'inscrit dans un courant de recherche cherchant à résoudre ce "long-horizon gap" par l'architecture plutôt que par l'échelle. Le papier est disponible sur arXiv (référence 2606.27872v1) et reste un preprint non évalué par les pairs : les résultats annoncés sont à confirmer indépendamment. Aucun code ni dataset n'est encore annoncé publiquement, et les affiliations institutionnelles des auteurs ne figurent pas dans le résumé disponible.

IA physiqueOpinion
1 source
SceneBot : suivi corps entier d'humanoïde généraliste guidé par contacts avec l'environnement
1977arXiv cs.RO 

SceneBot : suivi corps entier d'humanoïde généraliste guidé par contacts avec l'environnement

SceneBot est un cadre de contrôle pour robots humanoïdes déposé le 29 juin 2026 sur arXiv (référence 2606.27581), dont le code et les données seront entièrement publiés en open source. Le système entraîne une politique unique de reinforcement learning sur 7,5 heures de données de mouvement annotées en contacts, reconstituées depuis la motion capture humaine. SceneBot conditionne cette politique à la fois sur des mouvements de référence et sur des étiquettes de contact par segment corporel (per-link contact labels), définissant explicitement les interactions physiques attendues avec l'environnement. Le résultat est un agent humanoïde capable d'enchaîner locomotion en espace libre, franchissement de terrain irrégulier et manipulation corps entier, illustré par une tâche de référence : porter une boîte en montant un escalier. Ce que SceneBot résout est un verrou technique bien documenté : les politiques RL de locomotion humanoïde fonctionnent bien en espace libre mais échouent dès qu'un contact physique avec un objet ou une surface irrégulière est requis, car le tracking cinématique pur ne peut pas résoudre les ambiguïtés physiques de ces situations. En introduisant le "contact conditioning" comme interface de contrôle, les chercheurs montrent que 7,5 heures de données suffisent à généraliser à des mouvements et environnements non vus à l'entraînement. Pour les intégrateurs B2B et les décideurs industriels, cela suggère qu'une politique unifiée peut couvrir navigation et manipulation sans modules spécialisés distincts, et constitue une réponse partielle au "demo-to-reality gap" qui fragilise la crédibilité des annonces humanoïdes depuis plusieurs années. La contribution technique centrale est une méthode appelée "hindsight scene reconstruction" : à partir de mouvements humains retargeted, les auteurs reconstruisent après coup les graphes d'interaction avec la scène pour inférer les contacts, évitant l'annotation manuelle qui freine habituellement la constitution de tels datasets. Ce positionnement académique a des implications directes pour les développeurs de plateformes humanoïdes confrontés au même obstacle, notamment Figure AI, Agility Robotics, Unitree et Apptronik. Aucun déploiement industriel n'est annoncé à ce stade : SceneBot est une publication de recherche dont les résultats n'ont pas encore été validés sur hardware en conditions réelles, et les métriques présentées s'appuient sur des simulations et des démonstrations sélectionnées.

HumanoïdesPaper
1 source
StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique
1978arXiv cs.RO 

StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique

Des chercheurs ont publié sur arXiv (référence 2512.21970v2) StereoVLA, un modèle Vision-Language-Action (VLA) qui intègre la stéréovision dans les pipelines de manipulation robotique généraliste. L'architecture repose sur un encodeur visuel GeoSem (Geometric-and-Semantic), qui extrait en parallèle des indices géométriques issus des disparités entre vues stéréoscopiques et des représentations sémantiques classiques à partir des pixels RGB. Le modèle intègre deux objectifs de co-entraînement : l'Interaction-Region Depth Estimation, pour affiner le raisonnement spatial lors des saisies, et la Camera Parameter Estimation, pour aligner implicitement les repères de perception et d'action du robot. Entraîné sur des données stéréo synthétiques à grande échelle, StereoVLA atteint un gain absolu de 33,4 points de pourcentage en taux de succès en conditions réelles par rapport aux baselines monoculaires, et démontre une robustesse marquée à des angles de caméra proches de l'hémisphère supérieur. Ce gain de 33,4 % est substantiel dans un domaine où les progrès incrémentaux dominent la littérature. Il confirme une hypothèse structurelle : les encodeurs visuels préentraînés sur lesquels s'appuient les VLA actuels (CLIP, SigLIP) sont optimisés pour l'alignement sémantique, au détriment de la représentation géométrique 3D indispensable à la manipulation fine. Pour un intégrateur ou un COO industriel, cette démonstration repositionne le choix du capteur (stéréo vs monoculaire) comme décision architecturale critique dans toute cellule robotisée guidée par VLA. La robustesse aux angles hémisphériques est également un signal de maturité opérationnelle : en déploiement réel, la posture du bras et les contraintes d'encombrement imposent des perspectives de caméra qui mettent en défaut les VLA classiques. Les VLA (Pi-0 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA) constituent depuis 2024 le nouveau paradigme de contrôle généraliste pour la manipulation, mais reposent tous sur des encodeurs conçus pour la vision sémantique, non géométrique. StereoVLA adresse directement ce goulot d'étranglement en exploitant la stéréovision, technologie éprouvée dans les AMR et les caméras industrielles de profondeur (RealSense, ZED), mais restée jusqu'ici absente des pipelines VLA. L'étude demeure au stade de la recherche académique : aucun déploiement industriel ni partenariat constructeur n'est annoncé. La validité externe du gain de 33,4 % devra être éprouvée sur des bras commerciaux variés (Franka, UR, xArm) et dans des environnements moins contrôlés avant de conclure à une transférabilité industrielle.

IA physiqueOpinion
1 source
DIM-WAM : modélisation monde-action avec mémoire d'événements historiques diversifiés
1979arXiv cs.RO 

DIM-WAM : modélisation monde-action avec mémoire d'événements historiques diversifiés

Des chercheurs du CASIA (Institute of Automation de l'Académie des sciences chinoise) ont publié fin juin 2026 sur arXiv un préprint décrivant DiM-WAM, un modèle de type "world-action model" augmenté d'une mémoire multi-échelle conçue pour les tâches de manipulation robotique à longue séquence. Sur le benchmark RMBench, l'architecture fait passer le taux de succès moyen de 28,4 % (baseline LingBot-VA) à 69,8 %, dépassant nettement la baseline à mémoire explicite Mem-0 qui plafonnait à 42,0 %. Sur quatre tâches réelles exécutées sur bras Franka, DiM-WAM améliore le succès par étape de 70,7 % à 91,5 % et le succès complet de tâche de 52,5 % à 80,0 %, soit un gain absolu de 27,5 points. Ce résultat est notable car il attaque directement l'un des points d'échec systématiques des modèles vision-langage-action actuels : l'oubli des événements antérieurs lors de séquences longues. Contrairement aux architectures VLA classiques qui se limitent à un contexte court (quelques frames récentes), DiM-WAM maintient plusieurs banques mémoire mises à jour par fusion basée sur la similarité, et conditionne conjointement la dénoisation vidéo et la génération d'action sur ce contexte historique long. Un signal d'entraînement inédit, la "progress supervision", pousse les tokens mémoire à encoder non seulement les événements passés mais aussi l'étape courante de la tâche et ses implications sur la suite. Pour un intégrateur industriel, cela adresse un prérequis concret : permettre à un robot de reprendre une séquence après une interruption ou de conditionner une action sur un état observé plusieurs secondes plus tôt. Les world-action models constituent une évolution récente des VLA, inspirée des travaux sur la prédiction vidéo (world models) appliqués à la robotique, avec des architectures comme celles de Physical Intelligence (Pi-0) ou DreamerV3 adaptés au contrôle. DiM-WAM se positionne dans ce champ en ajoutant la dimension mémoire longue, un problème que le domaine reconnaît mais peu de travaux ont quantifié en conditions réelles. La validation sur Franka, robot académique standard à 7 DOF, reste modeste en échelle (quatre tâches, environnement contrôlé), et le preprint n'annonce pas de déploiement industriel ni de partenariat commercial. Les prochaines étapes probables incluent une évaluation sur des benchmarks plus larges comme SimplerEnv ou des plateformes humanoïdes, et une ouverture du code source évoquée via la page projet.

IA physiqueOpinion
1 source
PhysisForcing : simulateur du monde renforcé par la physique pour la manipulation robotique
1980arXiv cs.RO 

PhysisForcing : simulateur du monde renforcé par la physique pour la manipulation robotique

Une équipe de chercheurs propose PhysisForcing (arXiv 2606.28128, juin 2026), un cadre d'entraînement conçu pour corriger les incohérences physiques des modèles de génération vidéo utilisés comme simulateurs du monde pour la manipulation robotique. Ces modèles, généralistes ou affinés sur des données robotiques, produisent régulièrement des artefacts problématiques : trajectoires discontinues, déformations d'objets en mouvement et interactions robot-objet illogiques lors des contacts. PhysisForcing intègre deux mécanismes : une perte d'alignement de trajectoire au niveau pixel (supervision des features DiT via des trajectoires de points de référence) et une perte d'alignement sémantique relationnel (alignement avec les relations inter-régions d'un encodeur vidéo figé). Sur les benchmarks R-Bench, PAI-Bench et EZS-Bench, les gains atteignent +22,3 % sur Wan2.2-I2V-A14B et +9,2 % sur Cosmos3-Nano par rapport aux baselines, soit +7,1 % et +3,7 % au-dessus du fine-tuning classique. Le variant Cosmos3-Nano obtient le meilleur score global. Dans le protocole de planification en boucle fermée WorldArena, le taux de succès passe de 16,0 % à 24,0 %. Ce résultat valide une hypothèse importante : la fidélité physique d'un simulateur vidéo se répercute directement sur les performances des politiques robotiques en aval. Le bond de 8 points sur WorldArena n'est pas un indicateur de génération d'image, c'est un signal de planification-exécution dans un simulateur. Pour les équipes de recherche et les intégrateurs, cela signifie que les world models vidéo peuvent désormais servir de banc d'essai crédible, réduisant la dépendance aux trajectoires réelles. Le framework étant applicable aux architectures DiT existantes sans modification structurelle, son adoption potentielle est large. Cela suggère aussi que le "demo gap" des world models vidéo est adressable par une supervision ciblée, et non par davantage de données brutes. PhysisForcing s'inscrit dans le sillage de Cosmos (NVIDIA, fin 2024), qui a lancé la dynamique des simulateurs vidéo généralistes pour la robotique. Des travaux concurrents comme UniSim (Google DeepMind) ou IRASim explorent des directions similaires. Aucun acteur européen n'est impliqué dans ce papier. Il s'agit d'un preprint non encore évalué par des pairs, sans code open-source annoncé ni déploiement industriel. Les prochaines étapes naturelles incluent la validation sim-to-real sur matériel réel et l'intégration dans des pipelines de politiques VLA (Vision-Language-Action).

IA physiqueOpinion
1 source
Web2Grasp : apprendre la préhension fonctionnelle à partir d'images web d'interactions main-objet
1981arXiv cs.RO 

Web2Grasp : apprendre la préhension fonctionnelle à partir d'images web d'interactions main-objet

Des chercheurs ont présenté sur arXiv (réf. 2505.05517) Web2Grasp, une méthode qui permet à des mains robotiques multi-doigts d'apprendre des saisies fonctionnelles à partir d'images web montrant des interactions main-objet humaines (HOI, hand-object interaction). Un modèle de reconstruction 3D pré-entraîné extrait des maillages HOI depuis des images RGB brutes ; un filtrage géométrique couplé à une simulation physique dans IsaacGym élimine ensuite les saisies infaisables et ne conserve que celles résistant à une perturbation externe. En simulation, le système atteint 75,8 % de réussite sur des objets tirés du dataset web et généralise à des objets non vus lors de l'entraînement. En conditions réelles, testé sur les mains robotiques LEAP Hand et Inspire Hand, il affiche 77,5 % de réussite sur 12 objets incluant des géométries difficiles : seringue, flacon spray, couteau et pince longue (tongs). L'enjeu dépasse la simple prise en main : le "functional grasping" signifie que le robot saisit l'objet comme un humain l'utiliserait (couteau par le manche, spray par le corps), contrairement aux "power grasps" génériques qui dominent encore la littérature de manipulation robotique. La quasi-totalité des approches existantes nécessite des démonstrations en domaine spécifique, coûteuses à collecter objet par objet ; Web2Grasp court-circuite ce goulot en exploitant les images web comme supervision faible à coût quasi nul. Les 77,5 % en conditions réelles sur des formes atypiques sont encourageants, mais les conditions exactes d'évaluation (orientation initiale, variabilité d'éclairage, nombre d'essais par objet) ne sont pas précisées dans le résumé, ce qui invite à consulter le papier complet avant toute conclusion sur la robustesse industrielle. La préhension fonctionnelle reste un problème ouvert : les datasets annotés manuellement comme DexYCB ou ContactPose sont onéreux à produire à grande échelle. L'exploitation d'interactions "in the wild" s'inscrit dans la tendance des VLA (vision-language-action models) comme Pi-0 ou OpenVLA, qui cherchent à réduire la dépendance aux démonstrations robotiques coûteuses. Web2Grasp s'oppose directement à des approches comme DexGraspNet ou UniDexGrasp, ainsi qu'aux pipelines basés sur la téléopération (travaux Dex-Pilot, Apple Research), en supprimant entièrement le besoin de démonstrations effectuées sur robot. La suite logique serait l'intégration dans des pipelines de manipulation complets (pick-and-place, assemblage orienté tâche) ; le site projet actif à web2grasp.github.io indique que les développements se poursuivent.

RecherchePaper
1 source
Marqueur fiduciel d'engin spatial pour rendez-vous autonome, opérations de proximité et amarrage
1982arXiv cs.RO 

Marqueur fiduciel d'engin spatial pour rendez-vous autonome, opérations de proximité et amarrage

Une équipe de chercheurs a publié sur arXiv (preprint 2606.27566, juin 2026) les spécifications d'AstraTag, un marqueur fiduciel conçu spécifiquement pour les opérations robotiques en orbite : rendez-vous autonome, opérations de proximité et amarrage (RPO&D). Le marqueur repose sur un patron carré dit "Spidron", dont la structure récursive auto-similaire permet la détection à plusieurs échelles spatiales simultanément. Son identification s'appuie sur une signature de 48 bits extraite de sous-régions triangulaires du patron, encodée avec un code de Reed-Solomon généralisé (GRS) pour la robustesse aux erreurs. Le pipeline de détection enchaîne localisation de quadrilatères par contour, normalisation perspective et correspondance de signature contre un dictionnaire pré-calculé. Pour les marqueurs collés sur des coques courbes de spacecraft, un mécanisme de reprojection Thin-Plate Spline (TPS) exploite les bordures rectangulaires internes du marqueur comme correspondances géométriques supplémentaires. Les auteurs ont benchmarké AstraTag contre ArUco Fractal à trois couches et AprilTag sur des maquettes de surfaces planes et courbes : sur surfaces courbes, AstraTag surpasse les deux références en taux de détection. Ce résultat pointe un angle mort concret des systèmes actuels : AprilTag et ArUco ont été conçus pour la robotique terrestre et sortent du champ de la caméra à courte distance, précisément lors des phases de proximité et d'amarrage où la fiabilité est la plus critique. La structure récursive d'AstraTag adresse directement ce problème en restant détectable même lorsque le marqueur remplit l'intégralité du capteur. Pour les intégrateurs travaillant sur le servicing en orbite, la désorbitation de débris ou le ravitaillement de satellites, un marqueur robuste aux surfaces courbes et aux variations d'échelle extrêmes représente un composant clé de la chaîne de perception. Le contexte est celui d'un marché du servicing orbital en pleine structuration : Northrop Grumman (MEV), Astroscale, et ClearSpace-1 (mission ESA prévue 2028) misent tous sur des capacités d'approche autonome fiables. Les solutions de vision actuelles s'appuient majoritairement sur AprilTag ou des cibles rétroréfléchissantes passives, dont les limites à très courte distance sont documentées. AstraTag reste à ce stade un résultat académique (preprint non peer-reviewed), sans déploiement annoncé ni partenariat industriel communiqué, à surveiller pour une validation sur hardware de vol.

RecherchePaper
1 source
CacheMPC : commande prédictive par modèle certifiée avec cache pour la locomotion quadrupède
1983arXiv cs.RO 

CacheMPC : commande prédictive par modèle certifiée avec cache pour la locomotion quadrupède

Une équipe de recherche propose CacheMPC, un mécanisme de mise en cache certifiée pour le Model Predictive Control (MPC) appliqué à la locomotion de robots quadrupèdes, publié sur arXiv (2606.28300). Le MPC constitue la couche prédictive standard dans les contrôleurs hiérarchiques de quadrupèdes, mais son solveur QP (programmation quadratique) recalculé à chaque cycle constitue un goulot d'étranglement sur processeur embarqué. Certified CacheMPC adresse ce problème via un cache indexé par Locality-Sensitive Hashing (LSH) de trajectoires de forces de contact, partitionné par mode de contact. Chaque entrée récupérée est acceptée uniquement si un certificat a posteriori confirme la faisabilité primale et une borne supérieure sur la sous-optimalité via le dual gap lagrangien. Le contrôleur combine récupération certifiée top-K, solveur QP à deadline bornée, et fallback sur la dernière solution certifiée. Validé sur un Unitree Go2, le système a été évalué sur 2 038 essais MuJoCo en froid contrôleur, dont une campagne de 600 essais à n=50 sur trois cellules à la frontière d'échec, puis déployé physiquement sur le NVIDIA Orin NX embarqué du robot. Le cache sans filtrage atteint un gain médian de 25x en temps de calcul en simulation, et 18,7x sur hardware réel. L'enjeu industriel est direct : MPC haute fréquence sur SoC embarqué standard (Orin NX, environ 10-15W) sans recourir à un ASIC dédié ou à une approximation neuronale. Un facteur 18,7x de réduction du temps de solve ouvre la porte à des boucles de contrôle plus rapides sur des plateformes commerciales comme le Go2, utilisé massivement dans la recherche académique et les pilotes industriels légers. La certification formelle distingue cette approche des méthodes d'apprentissage du MPC (neural MPC, learning-based warm-starting) qui offrent des speedups similaires mais sans garantie exploitable. Nuance importante : la contribution du certificat à la stabilité en boucle fermée n'est pas statistiquement résolvable à la taille d'échantillon actuelle (n=50). Aucune différence significative n'a été détectée entre les variantes avec et sans cache, ce qui est honnête scientifiquement mais laisse la question de sécurité formelle ouverte. Le MPC pour locomotion quadrupède s'est imposé depuis les travaux d'ETH Zurich (ANYmal) et du MIT (Cheetah), avec des implémentations ouvertes comme ACADOS ou OSQP qui restent les références en solve embarqué. CacheMPC s'inscrit dans un courant distinct : plutôt qu'accélérer le solveur ou substituer le MPC par un réseau de neurones, il exploite la répétabilité des gaits locomoteurs pour réutiliser des solutions passées. Les concurrents directs incluent les approches de warm-starting par apprentissage (DeepMPC, L4DC 2024) et les approximateurs explicites de MPC. Le Unitree Go2 est devenu le benchmark de facto à petit budget pour ce type de validation hardware. Les prochaines étapes naturelles seraient une campagne avec n significativement plus grand pour trancher sur la sécurité certifiée, et une extension aux bipèdes ou aux transitions de mode de contact plus complexes.

RecherchePaper
1 source
PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste
1984arXiv cs.RO 

PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste

Des chercheurs ont publié le 29 juin 2026 sur arXiv (arXiv:2606.28192) PA-BiCoop, un framework de manipulation bimanualle à modèle unique reposant sur une différenciation dynamique des rôles "primaire-auxiliaire". L'architecture déploie un encodeur de caractéristiques global partagé alimentant deux décodeurs spécialisés : le décodeur primaire génère la pose du bras principal en coordonnées absolues ainsi que des heatmaps d'affordance pour la tâche centrale, tandis que le décodeur auxiliaire produit la pose relative du bras de support dans le repère du bras primaire. Un module d'assignation dynamique des rôles détermine automatiquement quel bras (gauche ou droit) prend la position primaire ou auxiliaire à chaque étape de la tâche, sans pré-définition manuelle. Les benchmarks rapportés indiquent une progression de 48 % en moyenne sur les tâches de simulation RLBench2 par rapport aux meilleures baselines existantes, et de plus de 50 % sur des tâches en environnement réel. Ces résultats, s'ils se confirment à l'échelle, adressent un verrou bien identifié dans la manipulation bimanualle : la quasi-totalité des approches actuelles traitent les deux bras comme des agents symétriques et interchangeables, ce qui force des synchronisations coûteuses et empêche l'émergence d'une division du travail naturelle. L'asymétrie primaire-auxiliaire est au contraire la norme dans la manipulation humaine, que ce soit pour visser un couvercle, positionner une pièce ou assembler un connecteur. Un gain de 50 % sur des tâches réelles est une affirmation forte : les benchmarks RLBench2 sont réputés pour permettre des optimisations d'artefacts de simulation, et les auteurs ne précisent pas le nombre de tâches réelles testées ni les conditions d'évaluation, deux points qui mériteront une vérification indépendante avant toute intégration industrielle. La manipulation bimanualle mobilise actuellement plusieurs équipes de premier plan : Physical Intelligence (pi) avec Pi-0, Figure AI avec le modèle embarqué sur Figure 02 et 03, et les équipes de recherche de Boston Dynamics, Toyota Research Institute et NVIDIA (GR00T N2) travaillent toutes sur des politiques bimanuelles généralisables. PA-BiCoop se distingue par son approche à modèle unique, là où des concurrents recourent à des architectures hiérarchiques séparées ou à du reinforcement learning multi-agent. Il s'agit pour l'instant d'une publication de recherche sans déploiement annoncé, ni code public ni partenaire industriel identifié ; la prochaine étape logique serait une validation sur des manipulateurs commerciaux type Franka, UR ou Kinova dans un contexte de production réelle.

IA physiquePaper
1 source
Apprendre à lancer : livraison agile et précise de charge utile suspendue par câble avec un quadrirotor
1985arXiv cs.RO 

Apprendre à lancer : livraison agile et précise de charge utile suspendue par câble avec un quadrirotor

Des chercheurs présentent dans un preprint arXiv (2606.27603) une méthode permettant à un quadrirotor de lancer avec précision des charges utiles suspendues par câble vers des cibles prédéfinies, une capacité critique pour la livraison médicale d'urgence et les missions de recherche et sauvetage. La solution repose sur un environnement de simulation hybride : un modèle analytique haute-fidélité du quadrirotor est couplé à un solveur physique dédié aux interactions corde-charge, les forces étant échangées entre les deux domaines à chaque pas de temps. Une politique de contrôle est ensuite entraînée par apprentissage par renforcement profond (deep RL) dans cet environnement. Déployée sans adaptation sur matériel réel (zero-shot), elle réduit l'erreur d'atterrissage jusqu'à 50 % et la durée du lancer jusqu'à 30 % par rapport à la référence model-based. Une variante utilisant uniquement des observations visuelles, sans estimateur d'état explicite, atteint une précision comparable à la politique basée sur l'état. Le simulateur sera mis en open source à l'acceptation de l'article. Le verrou technique adressé est la modélisation du relâché dynamique, la phase de libération agressive d'une charge en fin de vol, jusqu'ici largement ignorée au profit des phases de transport et de traversée. Les approches model-based classiques (optimisation de trajectoire, commande prédictive MPC) se heurtent à la difficulté de modéliser analytiquement les cordes flexibles, ce qui impose des contraintes de faisabilité conservatrices et dégrade l'agilité effective du système. La contribution clé est de démontrer qu'un simulateur hybride bien couplé suffit à fermer le gap sim-to-real pour des dynamiques aussi non-linéaires : le transfert zero-shot tient sur matériel réel sans fine-tuning. C'est un argument concret pour les équipes de livraison par drone qui envisagent de remplacer leur pipeline de contrôle analytique par des politiques apprises, en particulier dans des contextes où la rapidité de livraison est contrainte. Le transport de charges suspendues par drone est un sujet de recherche actif depuis plus d'une décennie, mais les travaux existants se concentraient sur la stabilisation et la planification de trajectoires, pas sur la balistique du relâché. Cette publication s'inscrit dans une vague plus large de politiques RL pour la manipulation aérienne agile, parallèle aux recherches sur le vol acrobatique menées notamment à l'ETH Zurich et à Carnegie Mellon. Aucun partenaire industriel ni acteur français ou européen n'est mentionné dans le preprint. Les prochaines étapes annoncées se limitent à la mise en open source du simulateur, qui pourrait abaisser la barrière d'entrée pour la communauté travaillant sur la manipulation aérienne dynamique. Les applications visées, livraison médicale et missions SAR, restent au stade de la démonstration académique : aucun déploiement opérationnel n'est annoncé à ce stade.

RecherchePaper
1 source
DexCompose : réutiliser des politiques dextériques pour la manipulation multi-tâche avec une seule main
1986arXiv cs.RO 

DexCompose : réutiliser des politiques dextériques pour la manipulation multi-tâche avec une seule main

DexCompose est un framework de composition de politiques robotiques présenté dans une prépublication arXiv (identifiant 2606.28323) en juin 2026. Son objectif : permettre à une main robotique dextère d'enchaîner plusieurs tâches sans réentraîner les politiques existantes depuis zéro. Le système atteint un taux de succès composite moyen de 77,4 % sur 16 tâches combinées, construites en croisant quatre compétences de rétention d'objet avec quatre interactions aval. L'ensemble de l'évaluation est conduit en simulation ; aucune validation sur hardware réel n'est présentée dans ce papier. Le problème central que DexCompose attaque est celui de l'interférence destructive entre politiques : lorsqu'une main doit simultanément maintenir une prise (tâche 1) et exécuter une nouvelle action (tâche 2), les deux politiques se disputent le contrôle des mêmes doigts, avec des conflits de modes de contact qui dégradent les deux. La réponse proposée est une notion de propriété d'action au niveau du doigt (finger-level action ownership) : le système identifie d'abord quels doigts sont nécessaires au maintien du résultat de la première compétence via des tests de relâche sur des masques candidats, puis entraîne deux modules résiduels asymétriques. Un stabilisateur résiduel borné préserve la tâche en cours ; un résiduel contextuel n'adapte la politique aval que dans le sous-espace d'action assigné à la nouvelle tâche. Pour les ingénieurs en manipulation, cela réduit potentiellement le coût de réentraînement à chaque nouvelle combinaison de tâches, sans toucher aux politiques de base préentraînées. La manipulation dextère multi-tâches avec une seule main est un problème ouvert depuis des années, les approches classiques de chaînage de politiques (policy chaining) échouant précisément sur ces conflits de contact. Des groupes chez Stanford, CMU ou Google DeepMind travaillent sur des architectures voisines, et des mains commerciales comme la Shadow Hand ou l'Allegro Hand constituent les bancs de test habituels du domaine. DexCompose se positionne comme une alternative structurée au fine-tuning complet ou aux hiérarchies de contrôleurs. Le gap sim-to-real sur la manipulation dextère reste cependant le défi non résolu de la discipline, et ce papier, encore en prépublication, n'y répond pas : une validation physique sur hardware réel constituerait l'étape déterminante avant toute considération industrielle.

RecherchePaper
1 source
La translation comme action passerelle : transférer des compétences de manipulation de l'humain au robot
1987arXiv cs.RO 

La translation comme action passerelle : transférer des compétences de manipulation de l'humain au robot

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.28133) une méthode pour transférer des compétences de manipulation humaine vers des robots bi-manuels à pinces parallèles, sans passer par une télé-opération coûteuse. Le principe repose sur une représentation d'action dite "pont" : plutôt que de capturer les 6 degrés de liberté (6DoF) du poignet humain rotations incluses, les auteurs n'utilisent que la translation relative du poignet dans le repère de la caméra tête initiale. Cet espace d'action minimal est partagé par les humains et les robots, ce qui élimine la principale source de bruit : l'estimation de la pose rotative d'une main humaine reste imprécise, et les schémas de contact des doigts diffèrent fondamentalement de ceux d'une pince parallèle. Un modèle vision-language-action (VLA) de type Pi-0 est ensuite entraîné avec des tokens d'action entrelacés et un masquage d'attention pour gérer l'absence de certaines composantes selon l'embodiment considéré. Le résultat central est que cette représentation "translation seule" transfère les connaissances de manipulation humaine vers le robot bien plus efficacement que les actions humaines bruitées en 6DoF, et que la performance scale avec la quantité de données humaines disponibles. Les expériences restent confinées à un ensemble de tâches bi-manuelles en laboratoire, ce qui invite à la prudence avant toute généralisation. Pour les intégrateurs B2B cherchant à exploiter des vidéos non instrumentées pour former des robots d'assemblage ou de manutention, c'est une validation de principe utile : les données humaines bon marché deviennent exploitables à condition de définir soigneusement l'espace d'action appris. Cela suggère que la conception de la représentation importe autant que le volume de données brutes. Ce travail s'inscrit dans la course à l'apprentissage cross-embodiment à partir de données humaines peu coûteuses, un front ouvert depuis que RT-2 (Google DeepMind, 2023) a popularisé les VLA multi-modaux. Physical Intelligence a lancé Pi-0 début 2025 comme modèle fondation bi-manuel ; ce papier en adopte l'architecture pour valider une hypothèse d'embodiment transfer distincte. Les concurrents directs incluent OpenVLA (Berkeley), AgiBot World et GR00T N2 (NVIDIA), qui explorent chacun des espaces d'action universels différents. La limite naturelle de cette approche reste les tâches impliquant des rotations fines ou des contacts précis, un angle que les auteurs n'abordent pas encore.

RechercheOpinion
1 source
Apprentissage résiduel multi-échelle et adaptation en ligne pour manipulateurs aériens
1988arXiv cs.RO 

Apprentissage résiduel multi-échelle et adaptation en ligne pour manipulateurs aériens

Des chercheurs présentent, dans un preprint arXiv (2603.11638v2, juin 2026), un cadre de modélisation adaptative en temps réel pour les manipulateurs aériens autonomes (AAMs), c'est-à-dire des drones équipés de bras robotiques destinés à l'inspection, la saisie ou l'assemblage en environnements difficiles d'accès. L'architecture repose sur deux modules : le Factorized Dynamics Transformer (FDT), qui traite chaque variable physique comme un token indépendant et sépare explicitement les effets inertiels à court terme des effets aérodynamiques à long horizon, et le Latent Residual Adapter (LRA), qui adapte les résidus de dynamique en temps réel dans l'espace latent via les Moindres Carrés Récursifs (RLS). Les expériences en conditions réelles, avec des charges utiles inédites non vues à l'entraînement, montrent une meilleure fidélité de prédiction, une atténuation des perturbations plus rapide et une précision de suivi en boucle fermée supérieure aux baselines de l'état de l'art, tout en respectant la contrainte temps réel. Ce travail adresse un verrou central de la manipulation aérienne : la dynamique d'un AAM change brutalement lors de la reconfiguration du bras ou d'une variation de charge, ce que ni les modèles analytiques à paramètres fixes ni les modèles ML statiques ne gèrent correctement. En factorisant explicitement les couplages inter-variables et en adaptant les résidus sans ré-entraînement complet, le framework réduit le coût computationnel tout en préservant la représentation non-linéaire apprise hors-ligne. Pour les intégrateurs industriels, c'est un signal que le gap sim-to-real des AAMs peut être partiellement comblé par adaptation en ligne, évitant des cycles coûteux de re-collecte de données sur site. Les AAMs font l'objet de recherches actives depuis le milieu des années 2010, avec des débouchés visés dans l'inspection d'infrastructures électriques, la construction et la logistique verticale. Les approches concurrentes misent sur le MPC robuste ou les réseaux récurrents pour la compensation de dynamiques résiduelles. Ce preprint n'est pas encore évalué par les pairs, et les résultats constituent des validations en laboratoire sur charges limitées, pas un déploiement industriel. Les prochaines étapes naturelles incluent des tests sur des configurations de bras plus complexes, des amplitudes de payload plus importantes, et une validation sur sites opérationnels réels.

RecherchePaper
1 source
AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés
1989arXiv cs.RO 

AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés

Des chercheurs ont publié sur arXiv (référence 2603.15097) AeroGrab, un pipeline intégré pour la saisie aérienne en environnements encombrés. Le système prend en entrée une scène et une instruction en langage naturel, identifie l'objet cible, puis pilote un drone pour l'explorer activement afin d'obtenir de meilleures perspectives. Durant cette exploration, un réseau de génération de prises prédit plusieurs candidats de saisie à 6 degrés de liberté (6-DOF) par point de vue. Chaque candidat est évalué par un module de faisabilité tenant compte des collisions potentielles ; la meilleure prise globale est sélectionnée et exécutée via des méthodes standard de génération de trajectoire. Des expériences en conditions réelles encombrées démontrent une exécution robuste des saisies dans des scénarios non contrôlés. L'apport principal réside dans l'intégration d'éléments jusqu'ici traités séparément : spécification de tâche par langage naturel, exploration active et sélection de prise tenant compte des collisions. Les pipelines de manipulation aérienne existants s'appuient généralement sur une saisie centroïde, approximation grossière qui échoue dès qu'un objet est partiellement occlus ou que l'environnement est dense. L'absence d'un système de bout en bout complet constituait un frein au déploiement opérationnel des drones manipulateurs, notamment en logistique, maintenance d'infrastructure ou intervention en zone difficile d'accès. AeroGrab représente une étape vers la fermeture du gap démo-terrain, sans que les métriques de robustesse soient détaillées dans l'abstract. La manipulation aérienne est un champ de recherche actif, porté notamment par l'ETH Zurich, l'Université de Naples Federico II ou le LAAS-CNRS côté français, qui explore depuis plusieurs années les drones à bras articulés. La tendance est à l'intégration de modèles vision-langage (VLA) dans la boucle de contrôle, pour passer d'une programmation par coordonnées à une spécification sémantique. Les verrous industriels restent importants : robustesse aux perturbations dynamiques, charge utile réduite et certification réglementaire pour les vols en espace intérieur. La publication sur arXiv indique un stade de recherche ; aucun déploiement commercial ni partenariat industriel n'est annoncé.

RecherchePaper
1 source
P-ARC : planification parallèle de mouvement multi-robot par exploitation de l'indépendance des sous-problèmes
1990arXiv cs.RO 

P-ARC : planification parallèle de mouvement multi-robot par exploitation de l'indépendance des sous-problèmes

Une équipe de chercheurs propose sur arXiv (2606.27625) P-ARC, variante parallélisée de l'algorithme ARC (Adaptive Robot Coordination) pour la planification de mouvement multi-robots (MRMP). ARC décompose le problème en trois étapes séquentielles: calcul des solutions individuelles initiales, détection des conflits entre trajectoires, puis résolution de ces conflits. P-ARC parallélise chacune de ces étapes en exploitant l'indépendance structurelle que la décomposition crée entre sous-problèmes, et les auteurs introduisent OR-P-ARC, une variante hybride ajoutant une stratégie multi-départ OR-parallèle. Les benchmarks couvrent des scénarios 2D avec jusqu'à 128 robots mobiles et manipulateurs planaires, ainsi que des équipes de manipulateurs Panda en configurations inspirées de l'industrie. Sur 16 cœurs CPU, le gain de temps de planification approche un facteur 4x par rapport à la version séquentielle d'ARC. Ce résultat intéresse directement les intégrateurs de cellules multi-bras et les opérateurs d'entrepôts automatisés, où la re-planification en temps réel reste un goulot d'étranglement opérationnel. Recalculer des trajectoires sans collision pour une dizaine de manipulateurs en réponse à une perturbation, qu'il s'agisse d'une pièce mal positionnée ou d'un ajout de robot, prend plusieurs secondes avec les approches séquentielles, ce qui bride la cadence de production. Un facteur 4x rendrait la re-planification à la volée plus viable dans des environnements dynamiques. Il convient néanmoins de nuancer: les expériences sont menées dans des scénarios qualifiés d'"inspirés du monde réel" et non sur des déploiements opérationnels réels, et l'écart simulation-terrain reste non quantifié à ce stade. Le MRMP est un problème réputé PSPACE-complet dans sa forme générale, ce qui explique l'intérêt persistant pour les approches de décomposition depuis deux décennies. ARC s'inscrit dans un paysage d'algorithmes incluant CBS (Conflict-Based Search) et ses variantes ECBS et EECBS, utilisées dans des systèmes logistiques commerciaux, ainsi que des solveurs MAPF tels que PBS ou ICTS. La parallélisation de ces algorithmes constitue un axe de recherche actif, avec des travaux récents sur PBS parallèle et des implémentations GPU pour les méthodes de champs de potentiel. P-ARC se distingue en exploitant la structure interne propre à ARC pour paralléliser chaque étape individuellement, plutôt que d'appliquer un parallélisme global à la recherche. Aucun partenariat industriel ni dépôt de code open-source n'est mentionné dans la publication: il s'agit d'une prépublication académique sans calendrier de déploiement annoncé.

RecherchePaper
1 source
Booster Lab : un pipeline centré sur les données pour l'apprentissage de politiques de locomotion humanoïde déployables
1991arXiv cs.RO 

Booster Lab : un pipeline centré sur les données pour l'apprentissage de politiques de locomotion humanoïde déployables

Des chercheurs de Booster Robotics ont publié le 27 juin 2026 sur arXiv (2606.27813) un article décrivant "Booster Lab", un pipeline de bout en bout pour apprendre et déployer des politiques de locomotion sur des robots humanoïdes. Le système repose sur quatre étapes enchaînées : curation automatisée de données de mouvement, adaptation du modèle robot de l'environnement réel vers la simulation (real-to-sim), apprentissage par renforcement avec la méthode AMP (Adversarial Motion Priors), et transfert simulation-vers-réel (sim-to-real). Le pipeline a été validé sur le robot humanoïde Booster T1, la plateforme principale de l'entreprise, avec des premiers résultats de portabilité obtenus sur le Booster K1. Aucun chiffre de performance brut (temps de cycle, vitesse de marche, taux de succès) n'est disponible dans l'abstract de cette préprint, ce qui limite l'évaluation indépendante des résultats. Le véritable apport de ce travail n'est pas une architecture RL inédite, mais une réponse opérationnelle à un problème concret qui ralentit tout le secteur : la rareté des données de mouvement compatibles avec la morphologie des robots humanoïdes. Les captures humaines brutes sont souvent inutilisables directement, les clips open-source sont hétérogènes en qualité, et même les trajectoires synthétiques issues de simulation nécessitent une vérification de faisabilité physique. En centralisant la curation, l'adaptation de modèle et la vérification dans un même pipeline, Booster Lab propose une infrastructure reproductible plutôt qu'un résultat de labo isolé. La validation croisée sur deux plateformes distinctes (T1 et K1) suggère une ambition de généralisation, mais reste à confirmer sur des benchmarks indépendants. Booster Robotics est une startup chinoise spécialisée dans les humanoïdes à faible coût, positionnée en compétition directe avec Unitree et ses séries H1/G1, ainsi qu'avec Fourier Intelligence. Le T1 est commercialisé comme plateforme de recherche accessible, en opposition aux segments premium occupés par Figure (Figure 02), Agility Robotics (Digit) ou Boston Dynamics (Atlas). L'approche data-centric de ce papier s'inscrit dans la tendance de fond du secteur : après les percées en manipulation portées par des VLA comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA), la locomotion naturelle et robuste reste le dernier verrou avant des déploiements industriels crédibles. La suite logique de ce travail serait un benchmark public des politiques apprises et un accès au pipeline de curation pour la communauté.

RecherchePaper
1 source
Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée
1992arXiv cs.RO 

Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée

Des chercheurs ont déposé le 27 juin 2026 sur arXiv (arXiv:2606.27962) un framework d'infrastructure de simulation cloud-native pour l'intelligence embarquée, conçu pour unifier en une seule plateforme la génération d'environnements de simulation, l'exécution de tâches, la collecte de trajectoires, l'évaluation de modèles et la gestion de données. L'architecture s'articule en quatre couches fonctionnelles et intègre quatre systèmes représentatifs : D-VLA, RL-VLA3, Sword et Pre-VLA, couvrant respectivement la simulation scalable, la planification dynamique des ressources, l'augmentation visuelle et le filtrage de données en temps réel. Le tout repose sur des technologies cloud-native telles que l'ordonnancement élastique des ressources et la simulation conteneurisée, pour gérer des workloads multi-modèles et multi-tâches à grande échelle. L'enjeu sous-jacent touche directement au goulot d'étranglement qui freine les modèles VLA (Vision-Language-Action) : la collecte de données réelles est coûteuse, peu reproductible et difficile à scaler. Ce framework propose une réponse systémique en substituant ou en complétant les données terrain par de la simulation industrialisée, avec une boucle fermée (closed-loop) permettant d'optimiser les données de façon itérative. Si les composants comme Pre-VLA (filtrage temps réel) et RL-VLA3 (apprentissage par renforcement sur architecture VLA) tiennent leurs promesses à l'échelle, cela pourrait réduire significativement le sim-to-real gap qui reste l'obstacle majeur pour déployer des robots génériques en environnement industriel réel. Il faut toutefois noter que la publication reste au stade de preprint sans benchmarks indépendants validés, et les performances sur robots physiques ne sont pas documentées dans ce papier. Ce travail s'inscrit dans une compétition internationale intense autour des infrastructures de simulation pour l'IA incarnée. NVIDIA pousse Isaac Sim avec l'écosystème Isaac Lab pour l'entraînement par renforcement, tandis que Genesis (dévoilé en 2024, affilié MIT) et MuJoCo Playground ciblent eux aussi la simulation GPU-accélérée à grande échelle. L'approche présentée ici se distingue par son orientation service (SOA) et sa couche de gestion de données unifiée, pensée pour des déploiements multi-équipes plutôt qu'un usage chercheur individuel. Les auteurs ne précisent pas d'affiliation institutionnelle clairement identifiable ni de calendrier de mise à disposition publique du code, deux points qui limiteront concrètement l'adoption tant qu'ils resteront non documentés.

RechercheOpinion
1 source
Quand les systèmes multi-robots rencontrent l'IA à base d'agents : vers une intelligence collective incarnée
1993arXiv cs.RO 

Quand les systèmes multi-robots rencontrent l'IA à base d'agents : vers une intelligence collective incarnée

Un article de recherche publié fin juin 2026 sur arXiv (réf. 2606.27929) propose un cadre conceptuel baptisé "Intelligence Collective Incarnée" (ECI, Embodied Collective Intelligence), qui fusionne deux trajectoires parallèles de la robotique : l'essor des agents IA en boucle fermée et la coordination de flottes multi-robots. Les auteurs décrivent comment les robots migrent de pipelines perception-contrôle rigides vers des systèmes agentiques capables de récupérer du contexte, délibérer pendant l'exécution et affiner leur comportement futur. L'ECI structure cette convergence en trois piliers : Co-Perception (partage du modèle du monde), Co-Action (coordination distribuée des tâches) et Co-Évolution (transmission de compétences entre agents). Pour ancrer le concept, une étude de navigation illustre qu'un robot nouvellement intégré à une équipe bénéficie de la mémoire fusionnée de ses coéquipiers avec des gains mesurables, bien que les auteurs précisent eux-mêmes que cette étude ne constitue pas une évaluation complète du framework. L'enjeu central est de dépasser le modèle actuel de coopération multi-robots, limité au partage de cartes, d'affectations de tâches et de datasets d'entraînement. L'ECI propose de partager l'état produit par la boucle agentique elle-même : contexte mondial, progression des tâches, compétences accumulées en opération. Pour un intégrateur ou un décideur B2B, cela ouvre la voie à des flottes où les robots apprennent collectivement en temps réel, un saut qualitatif par rapport aux AMR actuels qui n'échangent que des données structurées. La thèse sous-jacente est qu'une mémoire partagée réduit le temps d'intégration d'un nouvel agent et améliore la robustesse de la flotte face aux pannes, s'attaquant directement au "demo-to-reality gap" qui pénalise les VLA déployés à l'échelle industrielle. Ce travail s'inscrit dans une période d'accélération marquée : les modèles VLA comme pi0 de Physical Intelligence ou GR00T N2 de NVIDIA ont démontré en 2024-2025 que l'IA agentique peut généraliser sur du hardware physique réel, tandis que les systèmes multi-robots butent encore sur la coopération hétérogène à grande échelle. Les travaux proches incluent les frameworks multi-agents LLM comme AutoGen ou CrewAI, ainsi que les recherches en robotique collaborative conduites à ETH Zurich et au MIT CSAIL. L'article demeure à ce stade un cadre théorique avec validation partielle et sans déploiement industriel annoncé, mais il pose les fondations conceptuelles d'une génération de flottes capables de capitaliser collectivement sur l'expérience terrain accumulée.

RecherchePaper
1 source
SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels
1994arXiv cs.RO 

SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels

Une équipe de chercheurs propose SpikeVLA, une nouvelle architecture de contrôle robotique publiée en préprint sur arXiv (arXiv:2606.27807v1, juin 2026), qui combine les modèles VLA (Vision-Language-Action) avec des réseaux de neurones impulsionnels, ou SNN (Spiking Neural Networks). L'architecture s'articule autour de trois blocs distincts : Spike-V, un encodeur visuel impulsionnel qui substitue aux couches denses traditionnelles des couches événementielles pour réduire le coût énergétique de la représentation visuelle ; Spike-L, un grand modèle de langage multimodal impulsionnel qui reformule le raisonnement cross-modal via une dynamique de spikes et une sparsité par token ; et Spike-A, un réseau de politique d'action s'appuyant sur un codage de population à noyau laplacien et un SNN multicouche entièrement connecté pour convertir l'activité impulsionnelle en commandes de contrôle continu. Les auteurs rapportent une réduction significative de la consommation énergétique et du coût computationnel tout en maintenant des performances compétitives sur des tâches de navigation et de contrôle robotique, sans toutefois détailler de métriques quantitatives dans l'abstract. L'enjeu est structurel : les modèles VLA dominants (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA de Stanford, Octo de Berkeley) reposent sur des transformers de grande taille, dont l'inférence exige des GPU embarqués ou une connexion à des serveurs distants. Cette dépendance représente un frein réel au déploiement autonome sur des robots à budget énergétique contraint, en particulier pour des applications edge sans infrastructure lourde. L'approche SNN répond à ce problème de manière fondamentalement différente : les neurones n'activent une computation que lors d'un spike, ce qui rend la consommation proportionnelle à l'activité réelle du réseau plutôt que constante. Si les gains annoncés se confirment sur benchmarks ouverts, cela ouvrirait la voie à du contrôle VLA temps réel sur du matériel embarqué standard. Un bémol éditorial s'impose néanmoins : l'abstract ne cite aucun ratio d'efficacité énergétique précis, aucun score sur benchmark de référence (LIBERO, RLBench, OpenX), ni cycle time, ce qui rend l'évaluation indépendante impossible à ce stade. Les VLA ont émergé comme paradigme dominant du contrôle robot généraliste entre 2023 et 2025, porté par des labos académiques (Berkeley, Stanford, CMU) et des startups comme Physical Intelligence. La recherche en calcul neuromorphique, dont les SNN sont le vecteur principal, dispose elle d'une décennie de travaux (Intel Loihi, IBM TrueNorth, BrainScaleS en Europe), mais leur application à des architectures VLA complètes reste peu explorée et n'a pas encore produit de système déployé en conditions industrielles. Aucun concurrent direct dans l'espace SNN-VLA n'est mentionné par les auteurs, et aucun partenariat industriel ni timeline de déploiement n'est annoncé. SpikeVLA reste pour l'instant un prototype de recherche soumis pour revue : l'étape critique sera la publication complète avec benchmarks reproductibles et comparaison rigoureuse contre les VLA transformers en conditions d'inférence embarquée.

IA physiqueOpinion
1 source
AO-ARC : planification de mouvement multi-robots presque sûrement asymptotiquement optimale avec ARC
1995arXiv cs.RO 

AO-ARC : planification de mouvement multi-robots presque sûrement asymptotiquement optimale avec ARC

Une équipe de recherche a publié sur arXiv (référence 2606.27495) AO-ARC, un algorithme de planification de mouvement multi-robots (MRMP) dit "anytime", c'est-à-dire capable de fournir une première solution valide immédiatement, puis de l'améliorer de façon continue sans délai fixé. L'algorithme combine le meta-algorithme AO-x, qui convertit des solveurs de faisabilité en algorithmes anytime, avec la méthode ARC (Adaptive Robot Coordination) appliquée itérativement sur des instances MRMP bornées, sous une métrique de makespan, le temps nécessaire à l'ensemble des robots pour atteindre leurs cibles. Les auteurs affirment que AO-ARC atteint des temps de première solution comparables aux solveurs de faisabilité de l'état de l'art, tout en convergeant plus rapidement et plus régulièrement que les méthodes anytime existantes à mesure que le nombre de robots augmente, avec une preuve formelle d'optimalité asymptotique. L'évaluation porte sur des scénarios 2D à différents niveaux de complexité de coordination et sur un scénario 3D avec bras manipulateurs, représentatif d'applications industrielles réelles. L'enjeu pratique est significatif : la planification multi-robots est NP-difficile en général, et le passage à l'échelle (10, 50, 100 robots) reste le talon d'Achille des méthodes existantes, notamment dans les entrepôts automatisés ou les cellules robotiques denses. La propriété anytime est particulièrement critique en déploiement réel, où un système ne peut pas attendre une solution optimale avant d'agir. La métrique makespan, en optimisant le temps de fin de la tâche collective plutôt que la somme des distances individuelles, est directement corrélée au débit industriel. Le mécanisme de couplage adaptatif d'ARC, choisir dynamiquement quand planifier des robots conjointement ou indépendamment, est préservé tout en maintenant une borne de coût cohérente sur les décompositions, ce qui est la difficulté théorique centrale que ce travail prétend résoudre. ARC, le solveur sous-jacent, avait déjà démontré des performances compétitives sur des benchmarks MRMP en exploitant ce couplage sélectif. AO-ARC s'inscrit dans une lignée de recherches visant à combiner garanties théoriques et efficacité pratique, face à des méthodes concurrentes comme CBS (Conflict-Based Search), ECBS ou les variantes de dRRT*, qui peinent à combiner rapidité de première solution et qualité asymptotique à grande échelle. Ce travail reste un preprint arXiv non encore évalué par les pairs, sans déploiement annoncé ni partenaire industriel mentionné, les benchmarks utilisés, bien que représentatifs, ne constituent pas une validation terrain.

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
1996arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
Langage des signes pour essaims : communication par le mouvement entre drones
1997arXiv cs.RO 

Langage des signes pour essaims : communication par le mouvement entre drones

Des chercheurs ont publié fin juin 2026 sur arXiv (référence 2606.27883) un système permettant à des drones en essaim de se transmettre de l'information via leurs seuls mouvements, sans émettre le moindre signal radio. L'architecture repose sur deux blocs principaux : un estimateur de pose qui surveille en temps réel la trajectoire du drone émetteur, et un réseau neuronal maison baptisé 3DTrajDecoder, capable de classifier et segmenter la séquence spatiotemporelle observée tout en estimant simultanément son échelle et le vecteur normal associé. Les trajectoires utilisées comme signaux sont modulaires et dynamiquement faisables, c'est-à-dire contraintes par la physique réelle du vol, ce qui les distingue de simples animations. Pour entraîner le décodeur à la fois sur des trajectoires communicantes et non-communicantes, l'équipe a développé un pipeline de génération procédurale en ligne, configurable et exécutable à la volée. Le système a été validé en simulation et en conditions réelles, avec une étude d'ablation documentant les choix architecturaux et les limites opérationnelles. L'intérêt principal tient au contexte opérationnel visé : les environnements dits "stealth-constrained", où les émissions radio actives risquent d'être brouillées ou géolocalisées. Dans des scénarios militaires, de surveillance ou de recherche et sauvetage en zones contestées, une communication purement visuelle entre agents autonomes représente une alternative résiliente aux liaisons RF conventionnelles. Le fait que le 3DTrajDecoder fonctionne sur des trajectoires planaires générées procéduralement, et non sur un vocabulaire fixe, suggère une capacité de généralisation que les approches à codage discret n'offrent pas. Le papier reste cependant au stade de la preuve de concept : aucun chiffre de portée, de débit d'information ou de taux d'erreur en conditions dégradées n'est fourni dans l'abstract, ce qui rend difficile toute comparaison avec l'état de l'art. La communication visuelle inter-drones n'est pas un sujet nouveau : des travaux antérieurs ont exploré les LEDs, les marqueurs visuels ou les codes couleur, mais ces approches supposent des conditions d'éclairage contrôlées ou des équipements spécialisés. Le mouvement comme vecteur sémantique est conceptuellement plus robuste en extérieur, mais exige une reconnaissance de pose fiable à distance, ce qui reste un défi ouvert en robotique aérienne. Les prochaines étapes logiques seraient de publier les métriques quantitatives complètes, de tester avec des essaims de plus de deux agents, et d'évaluer la robustesse au vent et aux occlusions partielles. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné.

RecherchePaper
1 source
Apprentissage d'une manipulation en préhension stable dans un espace d'actions sans lâcher
1998arXiv cs.RO 

Apprentissage d'une manipulation en préhension stable dans un espace d'actions sans lâcher

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.28196v1) une approche pour apprendre à un bras robotique à manipuler des objets en main de façon stable, sans les lâcher. Le problème ciblé est l'in-grasp manipulation : repositionner ou réorienter un objet tenu dans la pince sans l'échapper, une capacité jugée critique pour les mains dextres multi-doigts. Leur contribution principale est un espace d'action dit "non-dropping", qui contraint structurellement l'exploration du contrôleur pour éliminer les trajectoires conduisant à la chute. Sur cet espace, chaque sous-compétence de manipulation dextre est décomposée en composantes simples et analysables, puis entraînée séparément avec des contraintes issues de la physique classique et de la théorie du contrôle. Les expériences couvrent différentes géométries d'objets, niveaux de bruit moteur et sensoriel, latences de communication, et conditions de friction. L'intérêt industriel de ce travail tient à une limite bien connue du reinforcement learning appliqué à la manipulation : l'inefficacité de l'exploration en bout en bout lorsque les objectifs d'apprentissage entrent en conflit ou que les instabilités passent inaperçues pendant l'entraînement. En injectant des priors de physique et de contrôle au niveau de la structure du problème plutôt qu'en récompense floue, les auteurs réduisent le besoin en simulation massive et accélèrent la convergence. Pour un intégrateur ou un ingenieur système, cela signifie potentiellement des contrôleurs de préhension plus robustes aux variabilités de terrain sans recourir à des millions d'itérations de sim-to-real. L'approche s'inscrit dans la tendance "physics-informed RL" qui cherche à corriger le manque d'échantillonnage des méthodes purement agnostiques. L'in-grasp manipulation reste un problème ouvert depuis les travaux fondateurs sur les mains Shadow et DLR Hand au début des années 2000. Récemment, des équipes comme OpenAI (Rubik's Cube, 2019) ou Google DeepMind (ALOHA / DexteritY) ont démontré des progrès en RL pur, mais souvent au prix de temps d'entraînement prohibitifs ou de contextes très contraints. Ce préprint ne provient pas d'une entreprise identifiée dans l'abstract et aucune affiliation institutionnelle n'est mentionnée dans l'extrait disponible. Aucun déploiement réel ni partenariat industriel n'est annoncé : il s'agit d'une contribution académique en phase de revue, dont les suites dépendront de la publication complète et d'éventuelles validations sur hardware physique.

RecherchePaper
1 source
Li Hongyang (HKU) lance une startup d'IA incarnée corps entier et lève des centaines de millions en seed
199936Kr 

Li Hongyang (HKU) lance une startup d'IA incarnée corps entier et lève des centaines de millions en seed

Archon Robotics (源策未来, "Yuance Weilai"), startup fondée en avril 2026 et basée dans la zone de développement de Caohejing à Shanghai, vient de boucler un tour de table seed de plusieurs centaines de millions de yuans. La levée réunit des fonds de premier plan dont Zhenge Fund, Gaorong Capital, IDG Capital et Wuyuan Capital, auxquels s'ajoutent le fonds conjoint Gobi Ventures / Université de Hong Kong, Miracle Plus et le Shanghai AI Innovation Institute. Light Source Capital agissait comme conseiller financier exclusif. Les fonds serviront à accélérer le développement d'un modèle fondateur humanoïde "whole-body", à constituer des jeux de données multimodaux de mouvements plein corps, et à ouvrir plusieurs centres de R&D. L'entreprise vise la publication d'un modèle open-source avant fin 2026. La société est dirigée par Li Hongyang, actuellement assistant professor et vice-doyen à l'Université de Hong Kong, dont le projet de conduite autonome end-to-end UniAD a remporté le Best Paper au CVPR 2023, seul travail d'une institution académique continentale à décrocher ce prix depuis dix ans. Il a également reçu en 2026 le RSS Early Career Award, première distinction de ce type décernée à un chercheur chinois en vingt ans d'existence du prix. Le CEO Li Tianyu, docteur de Fudan University, a co-développé le moteur "World Engine" de la solution de conduite autonome ADS 4.0 de Huawei. Le co-fondateur Chen Li, premier auteur d'UniAD, est issu du programme d'excellence Zhiyuan de l'Université Jiao Tong de Shanghai. Le pari technique d'Archon Robotics répond à une limite structurelle largement ignorée : les datasets actuels en robotique incarnée reposent quasi exclusivement sur des vidéos en vue première personne du poste de travail, enregistrant uniquement des trajectoires de bras ou de préhenseurs. Ces données ne capturent ni les déplacements du centre de gravité, ni la coordination tronc-membres, ni le transfert de force des membres inférieurs vers les membres supérieurs, c'est-à-dire précisément ce qui permet à un humain d'ouvrir une porte lourde en inclinant le corps plutôt qu'en tirant simplement le bras. La conséquence directe est que la quasi-totalité des robots actuels reste cantonnée à des préhensions sur surface plane à position fixe, incapable d'adaptation en environnement domestique non préétabli. Li Tianyu résume : "une donnée plein corps intégrant le déplacement du centre de gravité et l'angle du tronc a une densité d'information bien supérieure à cent enregistrements de trajectoire de main." La société construit donc une architecture tri-couche propriétaire : un "grand cerveau" pour la planification longue portée, un "mésencéphale" apprenant des représentations de mouvement plein corps transferrables d'un châssis à l'autre, et un "cervelet" assurant le suivi de pose et l'équilibre en temps réel. L'output n'est pas une liste d'angles articulaires spécifiques à un modèle de robot, mais une trajectoire de mouvement plein corps compatible avec plusieurs morphologies. Le contexte sectoriel est porteur mais saturé : au premier semestre 2026, le secteur de la robotique incarnée en Chine a enregistré 288 opérations de financement pour un total déclaré de plus de 46 milliards de yuans, proche du niveau annuel 2025 (55,4 milliards). Archon se positionne sur un créneau encore peu occupé en ciblant directement le modèle fondateur humanoïde généraliste plutôt que les solutions hybrides à châssis roulant avec bras manipulateurs, qui dominent actuellement le marché faute de savoir-faire en locomotion bipède. Li Hongyang compare l'état actuel de l'industrie à un niveau "L1,5" par analogie avec les grades de conduite autonome : les démos publiques relèvent encore majoritairement du contrôle à distance ou de scénarios entièrement scriptés, sans capacité autonome réelle sur des tâches multi-étapes en environnement ouvert. Les concurrents directs sur la brique modèle fondateur incluent Physical Intelligence (Pi-0), NVIDIA (GR00T N2), et Figure AI côté occidental, ainsi que plusieurs équipes chinoises moins bien documentées. Archon se différencie en ciblant explicitement les données "human-centric" incluant posture complète et marqueurs de force, avec une collecte mixte alliant données humaines dans des scènes réelles et données de téléopération sur robots physiques, dans une boucle ferme collecte-entraînement-retour d'erreur destinée à constituer une barrière concurrentielle durable.

Chine/AsieOpinion
1 source
Le robot de bureau Reachy Mini intègre une IA conversationnelle entièrement locale
2000Hackaday Robots Hacks 

Le robot de bureau Reachy Mini intègre une IA conversationnelle entièrement locale

Hugging Face a publié un guide d'implémentation pour doter son robot de bureau Reachy Mini d'une intelligence artificielle conversationnelle entièrement locale, avec mouvements de tête et oscillations d'antenne synchronisés avec la parole. La pile logicielle suit une architecture en quatre étapes : VAD (détection d'activité vocale), STT (reconnaissance vocale), LLM (grand modèle de langage) et TTS (synthèse vocale), chaque brique pouvant être exécutée localement ou déléguée à un service distant selon la puissance disponible. Dans la configuration de référence, le LLM retenu est Qwen3-4B-Instruct, complété par des modèles plus légers pour la détection vocale et la synthèse. Le robot, dépourvu de membres mais équipé d'une tête mobile et d'antennes expressives, vise une latence basse et prend en charge les interruptions en cours de phrase, deux propriétés qui rendent l'interaction perçue comme naturelle. La modularité de cette architecture est le point différenciant : chaque composant peut être remplacé indépendamment, ce qui permet d'adapter Reachy Mini à n'importe quelle configuration matérielle, ou d'exploiter un modèle frontier via API distante pour le seul LLM tout en conservant le reste en local. Pour les chercheurs et les développeurs travaillant sur l'interaction homme-robot, cela réduit considérablement la friction d'expérimentation sans infrastructure lourde. Le fait qu'un modèle de 4 milliards de paramètres suffise à produire des échanges fluides est un signal concret : les capacités conversationnelles embarquées deviennent accessibles sans GPU de classe datacenter, ce qui compte pour des déploiements décentralisés ou en milieu contraint. Lancé sous forme de kit en 2025, Reachy Mini est l'un des premiers produits matériels commercialisés directement par Hugging Face, société jusqu'ici centrée sur les modèles et les jeux de données. Depuis ce lancement, la société a construit un écosystème logiciel comprenant un simulateur et une infrastructure de partage d'applications entre utilisateurs. Sur le segment des robots de bureau orientés interaction, Reachy Mini se positionne face à des projets comme Furhat, axé sur le dialogue structuré, ou aux plateformes open-source concurrentes. La prochaine évolution logique serait l'intégration de capacités de vision pour passer d'une interaction purement vocale à un dialogue multimodal contextualisé, une direction déjà explorée par Hugging Face au travers de son projet LeRobot.

FR/EU ecosystemeTuto
1 source