Aller au contenu principal

Actualités robotique — page 62

4 604 articles au fil, du plus récent au plus ancien.

Collaboration humain-robot : concevoir les espaces de travail modernes pour la sécurité, la productivité et le bien-être des employés
3051Robotics & Automation News 

Collaboration humain-robot : concevoir les espaces de travail modernes pour la sécurité, la productivité et le bien-être des employés

Le marché mondial de la robotique industrielle, évalué à 85 milliards de dollars, connaît une transformation structurelle : les barrières physiques qui séparaient opérateurs et machines disparaissent progressivement des lignes de production, remplacées par des zones de collaboration directe. Des millions de robots industriels sont aujourd'hui déployés dans des environnements partagés, où la cohabitation homme-machine impose une refonte complète de la conception des postes de travail, en s'appuyant sur la géométrie spatiale, les standards de sécurité fonctionnelle (ISO 10218, ISO/TS 15066) et la psychologie des opérateurs. Cet enjeu dépasse la simple conformité réglementaire. Pour les intégrateurs et les COO industriels, la suppression des cages protectrices au profit de robots collaboratifs (cobots) ou de cellules HRC (Human-Robot Collaboration) implique une réévaluation complète des flux, des distances de sécurité, et de l'ergonomie cognitive. Des études montrent que l'acceptation des opérateurs est directement liée à la prévisibilité des mouvements des robots et à leur formation initiale, deux leviers souvent sous-estimés dans les projets de déploiement industriel. La tendance s'est accélérée depuis l'émergence des cobots d'Universal Robots, Fanuc et KUKA au début des années 2010, mais aussi avec la montée des AMR (Autonomous Mobile Robots) d'acteurs comme Exotec, basé à Croix (France), qui déploie ses systèmes dans des entrepôts logistiques à forte densité humaine. Les prochaines étapes du secteur portent sur l'intégration de capteurs de perception avancés et d'IA embarquée pour adapter dynamiquement le comportement des robots à la présence humaine en temps réel.

IndustrielOpinion
1 source
Les avancées en prélèvement robotisé par caisse et à l'unité
3052Robotics Business Review 

Les avancées en prélèvement robotisé par caisse et à l'unité

Le 3 juin 2026 à midi (heure de New York), un webinaire gratuit réunit plusieurs acteurs de la logistique robotisée autour de la préhension automatisée de colis et d'unités individuelles (désignée dans l'industrie par "case and each picking"). La table ronde virtuelle rassemble Annie Bowlby, directrice produit et ingénierie chez RightHand Robotics, ancienne responsable produit chez Neurala et cheffe de produit chez Rockwell Automation ; Gina Chung, directrice stratégie chez Locus Robotics, qui revendique plus de 17 000 robots déployés sur plus de 360 sites dans le monde ; et Josh Cloer, directeur général de Nomagic pour l'Amérique du Nord, issu de Mujin et de Mobile Industrial Robots (MiR). Les sujets couverts incluent les avancées en manipulation robotique, le concept de "data flywheel" (boucle de rétroaction de données réelles pour affiner les modèles d'IA guidant la préhension), et la place future de la supervision humaine dans les opérations de fulfillment. L'automatisation du picking unitaire reste l'un des verrous les plus tenaces de la logistique entrepôt. Jusqu'à récemment, un opérateur humain surpassait les robots en vitesse et en précision pour manipuler des SKUs individuels ou des cartons de formats variés. Mais la pénurie de main-d'oeuvre, le coût croissant du travail, les blessures liées aux gestes répétitifs et la variabilité de productivité humaine ont accéléré l'adoption des solutions robotiques. Le webinaire aborde explicitement le défi des formes, matériaux et poids hétérogènes, principal obstacle à la généralisation de la préhension automatisée au-delà des environnements très normalisés. La notion de "data flywheel" est présentée comme le mécanisme clé permettant d'améliorer la robustesse en conditions réelles plutôt qu'en simulation contrôlée, sujet central du débat sim-to-real qui structure encore largement la recherche en manipulation robotique. L'émergence de ce segment reflète une consolidation progressive du marché. RightHand Robotics est positionné sur la préhension unitaire en entrepôt depuis plusieurs années, tandis que Locus Robotics, issu de la première vague d'AMR (robots mobiles autonomes), étend ses capacités vers la manipulation à valeur ajoutée. Nomagic, fondé en Europe et désormais en phase d'expansion nord-américaine, mise sur une approche dite de "physical AI" pour différencier ses solutions dans les opérations de fulfillment. Les concurrents directs dans cet espace incluent Covariant (intégré depuis par Amazon), Dexterity et, dans un registre plus industriel, Boston Dynamics. Il convient de noter que ce webinaire est un échange sectoriel et non un lancement produit ou une annonce de déploiement : aucune nouvelle solution ni chiffre de performance inédit ne sont présentés. La session sera disponible en rediffusion après la diffusion en direct du 3 juin.

IndustrielActu
1 source
7 robots inspirés du vivant qui relèvent de vrais défis d'ingénierie
3053Interesting Engineering 

7 robots inspirés du vivant qui relèvent de vrais défis d'ingénierie

Six familles de robots à morphologie animale concentrent une part croissante des efforts en robotique appliquée, couvrant des secteurs aussi divers que l'inspection industrielle, le sauvetage en catastrophe, la maintenance offshore et l'aquaculture. Le quadrupède Spot, commercialisé par Boston Dynamics, est déjà opérationnel dans des centrales électriques, des installations pétrolières et des chantiers pour des missions de surveillance en environnement dangereux. Les robots serpents, dotés de corps segmentés articulés, ont été testés par des équipes de recherche et des équipes de secours pour localiser des survivants dans des décombres post-séisme, là où les plateformes conventionnelles ne peuvent pas pénétrer. Des robots grimpeurs reproduisent les micro-structures adhésives des pattes de gecko pour inspecter verticalement ponts et infrastructures. En milieu offshore, le robot Eelume, développé par la spin-off NTNU éponyme soutenue par Equinor et Kongsberg, adopte la locomotion ondulatoire de l'anguille pour inspecter pipelines et plateformes en restant déployé durablement sous l'eau. Des chercheurs du CIRTESU (Centre de recherche en robotique et technologies sous-marines) de l'Universitat Jaume I ont récemment testé à PortCastelló un poisson-robot biomimétique à propulsion par nageoires, sans hélices, équipé de sonar et de systèmes de vision, pour surveiller les filets de fermes aquacoles. Le laboratoire CREATE de l'EPFL a par ailleurs présenté un bras souple reposant sur une structure d'hélicoïde tronqué (trimmed helicoid), inspirée de la trompe d'éléphant et des tentacules de pieuvre, qui module rigidité et flexibilité localement pour permettre une manipulation délicate en contexte co-robotique. Ces plateformes répondent à des problèmes industriels documentés, pas à des curiosités de laboratoire. Eelume modifie structurellement l'économie de la maintenance offshore : là où un ROV traditionnel nécessite un navire de surface et dépend de la météo, un système résident opère en continu, réduisant les coûts d'intervention. La propulsion par nageoires du robot valencien surpasse les hélices en discrétion et efficacité énergétique dans les milieux aquacoles. Spot constitue le cas commercial le plus avancé de la tendance, Boston Dynamics ayant livré plusieurs centaines d'unités à des industriels. Pour les autres familles, notamment les robots serpents, les tests restent majoritairement conduits en environnements contrôlés : le fossé sim-to-real pour des décombres réels n'est pas résolu. L'approche soft robotics de l'EPFL illustre une stratégie alternative : intégrer la compliance mécanique dans la conception plutôt que de la gérer par contrôle actif, ce qui simplifie considérablement l'implémentation en environnement co-robotique. Boston Dynamics développe Spot depuis les travaux fondateurs de Marc Raibert au MIT ; l'entreprise a été rachetée par Hyundai en 2021 pour 1,1 milliard de dollars. Sur le segment quadrupède, la concurrence est vive : ANYbotics (ANYmal), Unitree (Go2, H1) et Ghost Robotics (Vision 60) ciblent les mêmes marchés industriels avec des positionnements prix différenciés. Eelume opère sur le marché oil & gas depuis plusieurs années avec le soutien de majors du secteur. En Europe, Pollen Robotics et Enchanted Tools développent des architectures à inspiration biologique, mais restent peu positionnés sur ces créneaux applicatifs précis. L'aquaculture robotisée bénéficie de financements croissants dans le cadre du Blue Deal européen, ce qui devrait accélérer les déploiements à l'image du projet de l'Universitat Jaume I. L'intégration de modèles VLA (vision-language-action) pour la compréhension contextuelle des tâches et la certification ATEX pour les robots industriels constituent les prochains jalons pour plusieurs de ces familles.

IndustrielActu
1 source
Nouvelle antenne de 10 watts permet aux robots sous-marins de communiquer à 700 mètres de profondeur
3054Interesting Engineering 

Nouvelle antenne de 10 watts permet aux robots sous-marins de communiquer à 700 mètres de profondeur

Des chercheurs de l'Université de Floride ont publié dans l'IEEE Journal of Oceanic Engineering les résultats de BlueME, un système d'antennes magnétoélectriques compactes conçu pour la communication entre robots sous-marins autonomes. Le système consomme au maximum 10 watts, moins qu'un système de caméra stéréo standard, tout en maintenant des liaisons de données stables entre deux AUV (véhicules sous-marins autonomes) séparés par plus de 700 mètres. Il émet des signaux électromagnétiques à très basse fréquence (VLF) et basse fréquence (LF) en exploitant la résonance mécanique naturelle d'un réseau d'éléments magnétoélectriques qui vibrent pour générer le signal, plutôt que de forcer une transmission brute à travers le milieu aquatique. Le projet est piloté par le Dr Md Jahidul Islam, spécialiste de la robotique marine, en collaboration avec le Dr Adam Khalifa, dont les recherches portent habituellement sur les implants médicaux sans fil miniaturisés, une combinaison interdisciplinaire qui a directement inspiré l'approche technique. L'enjeu est considérable pour les opérations multi-AUV actuelles : faute de canal de communication suffisant, les drones sous-marins ne peuvent échanger que des informations rudimentaires, et toute mise à jour de mission ou transmission de données complexes oblige les engins à remonter en surface, interrompant les opérations et allongeant massivement les cycles. BlueME cherche à combler ce vide en proposant une liaison robuste là où les technologies acoustiques (sonar) souffrent des échos et de la turbidité, et où les communications optiques laser sont bloquées par les particules en suspension. Les 10 watts affichés sont une métrique utile, mais les conditions réelles de test (profondeur, salinité, configurations multi-antennes) ne sont pas encore entièrement documentées dans les communiqués disponibles, un point à suivre lors des prochaines publications. Si les performances se confirment en déploiement réel, les intégrateurs de systèmes offshore et les opérateurs de surveillance environnementale disposeraient d'un outil permettant, selon les termes d'Islam, qu'un robot "ping" l'opérateur toutes les dix minutes pour permettre des décisions en temps réel sans interrompre la mission. L'idée centrale est née d'une analogie inattendue : le corps humain est lui-même constitué d'eau légèrement salée, un environnement que Khalifa a passé des années à traverser avec des signaux sans fil pour ses implants. Cette convergence disciplinaire a conduit l'équipe à réexaminer les contraintes physiques de la propagation sous-marine depuis une perspective biomédicale. Le brevet provisoire a été déposé et l'équipe recherche activement des partenariats industriels pour passer du prototype à l'intégration sur des sous-marins autonomes commerciaux. Dans le paysage concurrentiel, BlueME se positionne face aux systèmes de modems acoustiques (WaterLinked, EvoLogics) et aux communications optiques sous-marines (Sonardyne BlueComm), en promettant une immunité aux perturbations sédimentaires que ces deux approches ne peuvent garantir. Les prochaines étapes annoncées portent sur le financement, la montée en échelle du prototype et les premiers essais sur plateformes commerciales.

InfrastructurePaper
1 source
Le robot humanoïde de NVIDIA embarque 2 070 téraflops de puissance « cérébrale » pour apprendre dans le monde réel
3055Interesting Engineering 

Le robot humanoïde de NVIDIA embarque 2 070 téraflops de puissance « cérébrale » pour apprendre dans le monde réel

NVIDIA a dévoilé le 1er juin 2026, au GTC Taipei, l'Isaac GR00T Reference Humanoid Robot, un design de référence humanoïde open source associant le corps du Unitree H2 (1,80 m, 68 kg, 31 degrés de liberté) aux mains tactiles cinq doigts Sharpa Wave (44 DOF supplémentaires), soit 75 DOF au total. L'intelligence embarquée repose sur le module Jetson AGX Thor T5000, équipé d'un GPU Blackwell délivrant 2 070 téraflops en précision FP4, d'un CPU Arm 14 cœurs et de 128 Go de mémoire unifiée pour le traitement sensoriel en temps réel. Le robot supporte 120 N.m de couple aux bras, 360 N.m aux jambes et une charge utile de 15 kg, avec perception stéréo en tête, caméras montées aux poignets et centrale inertielle. La pile logicielle Isaac GR00T couvre tout le cycle de développement: Isaac Teleop pour la collecte de démonstrations humaines, Isaac Sim et Isaac Lab pour la simulation et l'entraînement, Isaac ROS pour le déploiement sur robot physique. Quatre institutions ont déjà rejoint l'initiative: Ai2, l'ETH Zurich, le Stanford Robotics Center et le laboratoire Advanced Robotics and Controls de l'UC San Diego. La compatibilité avec l'Unitree G1, très répandu en recherche, est également confirmée. La fragmentation du développement humanoïde constitue aujourd'hui l'un des freins majeurs à la recherche: hardware, environnements de simulation, modèles de fondation et middleware proviennent de sources hétérogènes, multipliant les frictions d'intégration. En proposant une pile unifiée et documentée, NVIDIA cherche à compresser le délai entre une nouvelle politique de contrôle et son test sur robot physique. Les 2 070 téraflops FP4 embarqués ne visent pas uniquement l'inférence: la puissance disponible cible l'apprentissage par renforcement en ligne et la collecte de données en situation réelle, deux leviers critiques pour combler le sim-to-real gap qui limite encore la majorité des VLA (Vision-Language-Action models). Steve Cousins, directeur exécutif du Stanford Robotics Center, a résumé la logique: "La robotique avance plus vite quand les chercheurs peuvent construire sur des plateformes ouvertes, partager du code et tester sur de vraies machines." NVIDIA avait posé les premières briques d'Isaac GR00T au GTC 2024 avec des modèles de fondation pour l'imitation et le transfert sim-to-real; l'annonce de Taipei franchit une étape différente avec un design de référence hardware-software complet. NVIDIA ne fabrique pas de robots mais joue explicitement la carte du fournisseur de plateforme, fournissant calcul, modèles et outils à l'ensemble de l'écosystème humanoïde: Figure (02), Tesla (Optimus Gen 3), Physical Intelligence (pi0), Boston Dynamics (Atlas Electric), et les acteurs européens comme Wandercraft ou Enchanted Tools, qui pourraient bénéficier de cette pile ouverte pour accélérer leur R&D. Le risque principal de cette stratégie est que les grands constructeurs, Tesla et Figure en tête, développent des piles entièrement propriétaires, réduisant la surface d'adoption. Les prochaines étapes documentées se limitent aux déploiements dans les quatre institutions partenaires, sans calendrier de commercialisation industrielle annoncé à ce stade.

HumanoïdesOpinion
1 source
Unitree franchit une étape clé vers son introduction en bourse à Shanghai, portée par l'essor des robots humanoïdes en Chine
3056SCMP Tech 

Unitree franchit une étape clé vers son introduction en bourse à Shanghai, portée par l'essor des robots humanoïdes en Chine

Unitree Robotics, fabricant de robots basé à Hangzhou, a franchi lundi une étape décisive vers son introduction en bourse en obtenant l'approbation du comité d'admission de la Bourse de Shanghai. La société avait déposé son dossier de cotation sur le Star Market le 20 mars 2026. Après deux cycles d'enquêtes réglementaires et une inspection sur site, ce feu vert ouvre la voie à la phase d'enregistrement et d'émission des titres, dernière étape avant le début des échanges effectifs. Cette progression boursière intervient dans un contexte de course industrielle intense en Chine autour des robots humanoïdes. Une cotation réussie fournirait à Unitree les capitaux nécessaires pour accélérer sa R&D et sa capacité de production, dans un secteur où les cycles de développement hardware restent coûteux. Pour les intégrateurs et décideurs industriels, cela signale que les investisseurs institutionnels chinois considèrent désormais le segment humanoïde comme suffisamment mature pour justifier une exposition publique, un indicateur de crédibilité commerciale au-delà du simple stade de démonstration. Unitree s'est imposé ces dernières années comme l'un des acteurs les plus agressifs sur le prix dans la robotique mobile, avec ses quadrupèdes Go2 et B2, puis ses humanoïdes H1 et G1, ce dernier commercialisé autour de 16 000 dollars. La société rivalise désormais directement avec des acteurs américains comme Figure, Agility Robotics ou Tesla (Optimus), et des concurrents chinois tels que LimX Dynamics et Fourier Intelligence. L'IPO sur le Star Market, vitrine des entreprises technologiques chinoises à fort potentiel, constituerait une validation institutionnelle majeure pour l'ensemble du secteur humanoïde en Chine.

Chine/AsieOpinion
1 source
Argus, un robot au nom mythique entre le Terminator et la boule de végétation
3057Hackaday Robots Hacks 

Argus, un robot au nom mythique entre le Terminator et la boule de végétation

L'université Duke a présenté Argus, un robot à vingt membres à symétrie radiale conçu pour se déplacer sans roues ni pattes articulées au sens classique. Le principe repose sur ce que les chercheurs appellent la "symétrie dynamique" : chaque membre peut s'étendre ou se rétracter indépendamment pour générer des forces dans n'importe quelle direction, propulsant la structure sphérique de manière erratique mais efficace. Le résultat visible dans la vidéo de démonstration ressemble à un ballon de plage projeté par le vent, avec une fluidité surprenante dans les transitions de direction. Le projet est financé par la DARPA, et un simulateur open-source permettant de tester des variantes à un nombre différent de membres est disponible sur GitHub. La plateforme fonctionne avec un minimum de douze effecteurs actifs, ce qui signifie que le prototype à vingt membres intègre une redondance significative. Ce niveau de redondance est précisément ce qui justifie l'intérêt de la DARPA : un robot qui continue de se déplacer après avoir perdu plusieurs membres représente un avantage tactique ou logistique réel dans des environnements dégradés. Sur le plan technique, Argus appartient à une famille de robots omnidirectionnels à effecteurs multiples distincte des architectures humanoïdes ou quadrupèdes dominantes. Là où un robot bipède ou à quatre pattes concentre sa locomotion sur quelques points d'appui critiques, Argus distribue les contraintes mécaniques sur l'ensemble de sa structure, lui permettant des mouvements de type parkour difficiles à reproduire pour un humanoïde. La démonstration reste cependant une preuve de concept en environnement contrôlé, et les performances réelles sur terrain irrégulier non balisé ne sont pas documentées dans les matériaux publiés. Argus s'inscrit dans une tendance plus large de recherche en locomotion non conventionnelle, portée notamment par des projets DARPA comme le programme Legged Squad Support System. Le nom renvoie à Argos Panoptès, le géant aux cent yeux de la mythologie grecque, cohérent avec le fait que chaque membre embarque ses propres capteurs. Ses concurrents directs ne sont pas les robots humanoïdes de Figure ou Boston Dynamics, mais plutôt les robots sphériques roulants et les plateformes AMR à géométrie variable explorées dans la recherche académique. La disponibilité en open source ouvre la voie à des contributions extérieures pour explorer des variantes d'architecture et d'algorithmes de contrôle, sans que des jalons de commercialisation ou de déploiement n'aient été annoncés à ce stade.

RecherchePaper
1 source
JD.com dévoile sa matrice de robots "Wolf Pack" à l'Exposition mondiale de l'industrie intelligente
3058Pandaily 

JD.com dévoile sa matrice de robots "Wolf Pack" à l'Exposition mondiale de l'industrie intelligente

Au salon World Intelligent Industry Expo 2026 (Smart Expo) de Tianjin, JD.com a présenté sa gamme robotique complète baptisée "Wolf Pack" (meute de loups), couvrant les segments aérien, terrestre et logistique entrepôt. La série comprend le Dúláng (Lone Wolf) sixième génération, véhicule de livraison autonome lancé en avril 2026 avec 5,5 m³ de volume de chargement et une capacité de charge d'une tonne, ainsi que le VAN, camionnette légère autonome de niveau L4 offrant 24 m³. Côté entrepôt, le système goods-to-person Zhìláng (Wisdom Wolf) est en déploiement commercial avec une précision de préparation de commandes de 99,99 % et une productivité annoncée quatre fois supérieure aux équipements traditionnels. Les drones Fēiláng (Flying Wolf), modèles JDX20 et JDX50, opèrent à la fois sur la livraison urbaine express et le transport en zones montagneuses isolées. En parallèle, JD.com a dévoilé une stratégie dite "Robot Industry Service Panorama" visant à générer 10 milliards de yuans de ventes cumulées pour les marques robotiques partenaires dans l'année. Le fondateur Richard Liu a pris la parole en interne le 27 mai, s'engageant à ne licencier aucun salarié déplacé par l'automatisation, dans le cadre d'un programme de reconversion baptisé "Phoenix Project". L'annonce illustre une approche industrielle cohérente : JD.com déploie ses robots en priorité dans son propre réseau logistique avant toute commercialisation externe, une stratégie de validation interne qui réduit le risque de gap démo/réalité fréquent dans le secteur humanoïde et AMR. Le chiffre de 99,99 % de précision pour le Zhìláng, s'il est confirmé à l'échelle, représente un benchmark opérationnel significatif pour les intégrateurs logistiques. Cependant, la rentabilité du groupe envoie un signal contraire : au T1 2026, JD.com affiche un chiffre d'affaires de 315,7 milliards de yuans (+4,9 % en glissement annuel), mais le résultat opérationnel s'est effondré de 63,86 % à 3,8 milliards de yuans, tandis que les dépenses R&D, marketing et administratives ont toutes progressé de plus de 40 %. L'ambition robotique coûte cher, et le modèle économique de la reconversion de masse à grande échelle reste à démontrer financièrement. JD.com construit depuis plusieurs années un réseau logistique fortement automatisé, positionnant ses 900 000 employés répartis sur 183 métiers comme un argument social face aux critiques sur la destruction d'emplois. Ses 80 centres de formation "robobase" déployés en Chine visent à transformer des opérateurs d'entrepôt en techniciens de maintenance robotique. Sur le plan concurrentiel, JD.com se mesure aux acteurs logistiques automatisés comme Meituan (drones) et aux fournisseurs AMR tels qu'Geek+ ou Quicktron, tout en cherchant à monétiser son expertise en tant qu'opérateur externe. La vision déclarée de Liu Qiangdong, faire de JD.com "le plus grand opérateur du monde physique" d'ici vingt ans, reste pour l'instant une déclaration d'intention sans timeline industrielle précise.

Chine/AsieActu
1 source
Nvidia, Unitree et Sharpa s'associent pour concevoir un robot humanoïde capable d'effectuer un travail réel
3059SCMP Tech 

Nvidia, Unitree et Sharpa s'associent pour concevoir un robot humanoïde capable d'effectuer un travail réel

L'accès web n'est pas disponible. Je vais rédiger le résumé à partir du texte fourni et de mes connaissances sur cet écosystème. --- Nvidia, Unitree Robotics et Sharpa ont dévoilé H2+, un design de référence pour robot humanoïde destiné à accélérer le développement industriel à l'échelle mondiale. L'annonce a été faite par Jensen Huang, PDG de Nvidia. H2+ intègre la chaîne complète de développement robotique : collecte de données, entraînement de politiques de contrôle (policy training) et déploiement en conditions réelles. Unitree Robotics, spécialiste chinois des robots humanoïdes à bas coût (G1, H1), apporte l'architecture mécanique, tandis que Sharpa, fabricant singapourien de mains robotiques, contribue la préhension dextère. Nvidia fournit la couche logicielle et matérielle, vraisemblablement via Isaac Sim, OSMO et le modèle de fondation GR00T N2. L'intérêt d'un design de référence commun est de réduire le temps de mise en marché pour les intégrateurs en évitant la redondance dans la phase de prototypage. En unifiant la stack sim-to-real sous un seul écosystème Nvidia, H2+ vise à fermer le gap entre démonstrations en laboratoire et déploiements opérationnels, un obstacle persistant dans la commercialisation des humanoïdes. C'est aussi un signal que Nvidia consolide son rôle d'infrastructure centrale dans la course aux humanoïdes, face à des constructeurs comme Boston Dynamics, Figure ou Agility Robotics qui développent leurs propres pipelines propriétaires. La collaboration reflète une tendance de fond : les grandes plateformes technologiques cherchent à s'imposer comme couche commune là où les fabricants de hardware se fragmentent. Nvidia avait déjà lancé GR00T N2 début 2025 pour standardiser l'entraînement des humanoïdes. Unitree, dont le G1 est commercialisé autour de 16 000 dollars, mise sur le volume et l'accessibilité. Les suites concrètes de H2+, pilotes industriels, disponibilité du SDK, partenaires intégrateurs, n'ont pas encore été précisées dans les informations disponibles.

HumanoïdesOpinion
1 source
NVIDIA dote les usines d'un nouveau cerveau IA avec son Factory Operations Blueprint
3060NVIDIA Blog Robotics 

NVIDIA dote les usines d'un nouveau cerveau IA avec son Factory Operations Blueprint

Lors du GTC Taipei en marge du Computex 2026, NVIDIA a présenté le Factory Operations Blueprint (FOX), une architecture de référence pour déployer un agent de gestion d'usine autonome. Fondé sur NemoClaw, AI-Q Blueprint et les modèles ouverts Nemotron, FOX orchestre en temps réel des agents spécialisés (contrôle qualité, transport de matériaux, sécurité des opérateurs) en agrégeant signaux machines, alertes opérationnelles et instructions de travail dans une couche décisionnelle unifiée. La solution est optimisée pour le DGX Station, équipé du superchip Grace Blackwell Ultra (GB300) : 20 petaflops en précision FP4, 748 Go de mémoire cohérente, et support de modèles jusqu'à 1 000 milliards de paramètres. Foxconn, premier fabricant électronique mondial, est le déployeur le plus avancé : son système MoMClaw connecte des centaines d'agents spécialisés sur une ligne de production réelle, avec une interface en langage naturel et des contrôles de confidentialité via NVIDIA OpenShell. Les projections annoncées atteignent 80 % de réduction du temps d'analyse de cause racine, +15 % de productivité main-d'oeuvre et -10 % de taux de pannes machines. Pegatron, également déployeur initial, vise une réduction de 15 % de la redondance d'équipements en remplaçant les machines en attente par une orchestration dynamique des robots. Advantech et Wistron complètent les quatre industriels taïwanais à adopter FOX en premier. Ces métriques, non encore auditées indépendamment, pointent vers un changement structurel : l'intelligence d'usine quitte le modèle d'automatisation îlot par îlot pour une couche d'orchestration centralisée pilotée par agent. Le déploiement local sur DGX Station répond à des contraintes réelles des industriels, notamment la latence, la souveraineté des données et la résilience en cas de panne réseau, là où les solutions cloud peinent à convaincre les équipes OT. La capacité de FOX à automatiser le cycle complet de ré-entraînement des modèles (détection de dérives de précision, génération synthétique de données, fine-tuning, redéploiement en production) via les outils TAO est particulièrement structurante pour les intégrateurs, qui réalisent aujourd'hui ce travail manuellement à coût élevé. NVIDIA consolide depuis plusieurs années une pile verticale pour l'usine intelligente : Omniverse pour les jumeaux numériques, Metropolis pour la vision industrielle, Isaac pour la robotique. FOX est la couche d'orchestration qui soude ces briques entre elles. Sur le terrain concurrentiel, Siemens avec son Industrial Copilot (basé sur Azure OpenAI), Rockwell Automation avec FactoryTalk AI et PTC avec Vuforia occupent un espace similaire, sans la verticale matérielle intégrée que représente le binôme FOX/DGX Station. Les prochaines étapes naturelles incluent l'extension à l'automotive, à la pharma et à l'agroalimentaire, ainsi que l'ouverture d'une marketplace d'agents spécialisés via les APIs standardisées annoncées, point clé pour dépasser le positionnement actuel centré sur l'électronique taïwanaise.

IA physique : raisonnement, modèles du monde et d'action avec NVIDIA Cosmos 3
3061NVIDIA Developer Blog 

IA physique : raisonnement, modèles du monde et d'action avec NVIDIA Cosmos 3

NVIDIA a annoncé Cosmos 3, un modèle fondamental de frontière dédié à l'IA physique, conçu pour doter les robots, les véhicules autonomes et les espaces intelligents d'une capacité de compréhension du monde réel. L'architecture de Cosmos 3 repose sur trois composantes intégrées : des modèles de raisonnement physique, des modèles de monde et des modèles d'action, permettant à un système de percevoir son environnement, d'anticiper les événements à venir et de produire des séquences d'actions adaptées à une incarnation physique et à une tâche spécifiques. Ce type d'approche unifiant raisonnement, simulation et action au sein d'un seul modèle fondamental représente un changement de paradigme pour les intégrateurs robotiques. Jusqu'ici, ces trois briques étaient souvent développées séparément, ce qui générait des lacunes au niveau du transfert sim-to-real. Un modèle entraîné à raisonner sur la physique du monde avant de planifier l'action offre théoriquement une meilleure généralisation sur des tâches non vues en production, bien que les benchmarks industriels indépendants restent à confirmer. NVIDIA avait introduit la plateforme Cosmos en janvier 2025 au CES, positionnant alors ses modèles génératifs de monde comme infrastructure pour les fabricants de robots et les constructeurs automobiles. Cosmos 3 s'inscrit dans cette trajectoire d'itération rapide, face à une concurrence directe : Google DeepMind avec les modèles Gemini Robotics et RT-2, Physical Intelligence (pi) avec Pi-0, et Figure AI avec ses propres VLA. L'enjeu pour NVIDIA est de s'imposer comme couche d'infrastructure fondamentale de l'IA physique, au-delà du seul matériel GPU.

IA physiqueOpinion
1 source
Wall-OSS-0.5 : rapport technique
3062arXiv cs.RO 

Wall-OSS-0.5 : rapport technique

Une équipe de chercheurs a publié sur arXiv (2605.30877) le rapport technique de Wall-OSS-0.5, un modèle Vision-Language-Action (VLA) open source de 4 milliards de paramètres, construit sur un backbone VLM de 3B paramètres auquel sont greffés des composants de génération d'actions. Le modèle a été pré-entraîné sur plus de 20 morphologies robotiques différentes, en ingérant plus d'un million de trajectoires robot par époque, couplées à un corpus multimodal ancré. La recette d'entraînement repose sur un co-entraînement à gradient bridgé combinant trois objectifs complémentaires : prédiction d'actions discrètes pour faire circuler des gradients VLM forts dans le backbone, prédiction multimodale pour préserver la compréhension vision-langage, et flow matching continu comme interface d'action au moment du déploiement. Avant tout fine-tuning spécifique, le checkpoint pré-entraîné atteint des comportements zero-shot non triviaux sur un banc de 17 tâches réelles, y compris une tâche de manipulation d'objets déformables hors distribution. Après fine-tuning, il affiche 60,5% de progression moyenne sur 15 tâches réelles et surpasse Pi-0.5 de 17,5 points de pourcentage. Ce résultat repose la question fondamentale du pré-entraînement VLA : jusqu'ici, la quasi-totalité des preuves de performance étaient mesurées après fine-tuning, rendant impossible la distinction entre "le pré-entraînement forme une politique utilisable" et "le pré-entraînement fournit juste une meilleure initialisation". Wall-OSS-0.5 démontre que le checkpoint brut produit des comportements exécutables sur matériel physique, y compris sur des tâches jamais vues. Le fait que l'entraînement sur données d'action ne dégrade pas les capacités vision-langage générales est également significatif pour les intégrateurs : cela suggère qu'un seul modèle fondation peut couvrir perception, raisonnement et contrôle sans compromis majeur, ce qui simplifie l'architecture système. Wall-OSS-0.5 s'inscrit dans la dynamique des VLA fondationnels initiée par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa publication open source le distingue dans un secteur dominé par des checkpoints propriétaires, et permet des comparaisons reproductibles. La performance zero-shot sur manipulation déformable est notable car ce type de tâche est réputé difficile à généraliser : c'est précisément le type de gap sim-to-real que les approches purement simulées peinent à combler. Les prochaines étapes probables incluent un scaling du corpus et des évaluations sur des plateformes humanoïdes commerciales, où la generalisation cross-embodiment du modèle pourra être testée en conditions industrielles.

IA physiqueOpinion
1 source
Les interactions structurées améliorent la coordination distribuée mieux que le passage à l'échelle des modèles dans un système multi-robots réel
3063arXiv cs.RO 

Les interactions structurées améliorent la coordination distribuée mieux que le passage à l'échelle des modèles dans un système multi-robots réel

Une étude déposée sur arXiv (ref. 2605.30383) compare, dans un système multi-robots réel, deux leviers d'amélioration des performances collectives : restructurer la topologie de communication entre robots, ou augmenter la taille des modèles d'apprentissage embarqués. Le protocole mobilise 10 robots physiques sur une tâche combinée de transport et de cartographie, soit 60 runs au total (5 par condition expérimentale). Résultat principal : passer d'une architecture entièrement connectée à une hiérarchie modulaire améliore la performance normalisée de 47 points sur une échelle 0 à 100, contre au maximum 9 points gagnés en doublant la taille des couches cachées du réseau de neurones. Des modèles mixtes à effets imbriqués confirment que la topologie de communication explique une variance bien plus importante que la taille du modèle. Une saturation des gains est observée au-delà de 1 024 unités cachées, mais uniquement en extrapolation calibrée par simulation, et non directement sur le matériel testé - une nuance importante pour interpréter ce chiffre. Pour les intégrateurs de flottes robotiques, le message est immédiatement opérationnel : revoir l'architecture de coordination peut offrir un gain de performance cinq fois supérieur à l'ajout de puissance de calcul embarquée par robot, à budget matériel constant. Dans un contexte où les flottes d'AMR (autonomous mobile robots) se densifient dans la logistique et l'industrie manufacturière, l'arbitrage entre intelligence individuelle et structure collective du système devient un choix de conception concret. L'étude questionne une hypothèse largement répandue dans le secteur : que scaler les capacités unitaires de chaque robot est le levier dominant du progrès en robotique collaborative - un biais coûteux si les gains réels se trouvent ailleurs. Cette publication s'inscrit dans le champ du MARL (multi-agent reinforcement learning) déployé sur plateforme physique, un gap encore peu comblé entre benchmark simulé et terrain. Les résultats sont répliqués sur le benchmark SMAC, complétés par des analyses de benchmarks hétérogènes que les auteurs qualifient eux-mêmes de preuves secondaires. Le périmètre reste étroit : une seule tâche, 10 robots, une architecture. La généralisation quantitative à d'autres systèmes et d'autres échelles reste à établir. Les acteurs qui déploient des flottes denses, Exotec en France, Locus Robotics ou 6 River Systems aux États-Unis, opèrent précisément dans ce domaine où l'arbitrage topologie-modèle pourrait peser sur les prochaines roadmaps produit.

RecherchePaper
1 source
Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée
3064arXiv cs.RO 

Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée

Une équipe de chercheurs a publié TouchSafeBench (arXiv:2605.31196), un benchmark pour évaluer ce qu'ils nomment le "collision grounding" dans les modèles de vision-langage (VLM) : la capacité à relier des observations visuelles à la géométrie du robot, la disposition de la scène et la proximité humaine pour déduire un contact présent ou imminent. Construit dans le simulateur Habitat 3.0 de Meta, il comprend 2 940 épisodes de coprésence indoor simulés, couvrant navigation sociale et réorganisation spatiale, avec des observations RGB-D multi-vues synchronisées, des cartes de trajectoire top-down et des labels de contact dérivés directement du simulateur. Trois VLMs orientés robotique ou frontier models ont été testés sur neuf représentations visuelles, autour de deux tâches : classifier l'état de sécurité courant et anticiper une collision imminente avant tout contact physique. Le meilleur score moyen Macro-F1 obtenu reste inférieur à 50 %. Ce chiffre souligne une limite fondamentale : la fluidité visuelle n'implique pas la responsabilité physique. Un modèle capable de décrire précisément une scène peut échouer à détecter si un bras robotique effleure un opérateur. Pour les intégrateurs travaillant sur la collaboration homme-robot, le signal est sans ambiguité : les VLMs actuels ne peuvent pas jouer le rôle de moniteurs de sécurité sans couche d'abstraction géométrique explicite. L'étude montre également que le contact robot-scène (obstacles, mobilier) est systématiquement plus difficile à détecter que la proximité humaine, contredisant l'intuition courante. Plus frappant encore : la profondeur RGB-D n'est pas automatiquement convertie en évidence de collision corps-robot, faute de représentation morphologique intégrée dans ces modèles. Ces résultats arrivent au moment où les architectures vision-langage-action (VLA) comme RT-2, OpenVLA ou pi0 de Physical Intelligence s'imposent dans les pipelines robotiques, en pariant sur la généralisation sémantique des VLMs pour piloter manipulateurs et robots mobiles. TouchSafeBench constitue un contrepoids empirique à cet enthousiasme : la généralisation linguistique ne résout pas la conscience géométrique nécessaire à la sécurité fonctionnelle. La plateforme sous-jacente, Habitat 3.0, est développée par Meta AI Research et fait référence en navigation sociale simulée. Le benchmark sera publié à l'acceptation de l'article. Les auteurs identifient comme prochaine étape des représentations liant explicitement point de vue caméra, morphologie du robot et géométrie métrique, potentiellement via des approches hybrides VLM et modèles cinématiques.

RecherchePaper
1 source
Mélange d'horizons dans le découpage en actions
3065arXiv cs.RO 

Mélange d'horizons dans le découpage en actions

Des chercheurs ont publié sur arXiv (réf. 2511.19433v2) une approche baptisée Mixture of Horizons (MoH) qui s'attaque à un verrou technique dans les modèles vision-langage-action (VLA) utilisés pour la manipulation robotique. Le problème identifié est le suivant : la longueur du "chunk d'action" (le nombre de pas d'action prédits en une seule passe, appelé horizon) conditionne fortement les performances, mais aucune valeur fixe n'est optimale. Un horizon long donne une meilleure prévision globale du mouvement mais dégrade la précision fine ; un horizon court améliore le contrôle local mais échoue sur les tâches longues. MoH découpe le chunk d'action en plusieurs segments à horizons différents, les traite en parallèle via un transformeur d'action partagé, et fusionne les sorties avec une porte linéaire légère. Appliqué aux politiques pi-0, pi-0.5 (Physical Intelligence) et pi-reg, MoH atteint 99 % de taux de succès moyen sur le benchmark LIBERO en seulement 30 000 itérations d'entraînement, un nouveau state-of-the-art. Le mode d'inférence dynamique, qui sélectionne les actions stables par consensus inter-horizons, délivre un débit 2,5 fois supérieur aux baselines. L'intérêt principal de MoH est sa nature plug-and-play : il s'intègre sans modification architecturale majeure dans tout module d'action à attention complète, avec un surcoût d'entraînement et d'inférence minimal. Pour les équipes qui déploient des VLA en manipulation industrielle ou sur des plateformes humanoïdes, cela signifie qu'elles peuvent améliorer significativement la robustesse sur des tâches mixtes (gestes fins + séquences longues) sans changer leur infrastructure. Le gain de débit est particulièrement pertinent pour le temps réel embarqué, où la latence de prédiction est un facteur limitant concret. Ce travail s'inscrit dans l'essor des VLA issus des travaux de Physical Intelligence (pi-0, sorti fin 2024) et d'OpenVLA, qui ont démontré que le préentraînement multimodal peut accélérer la généralisation en manipulation. Le benchmark LIBERO, issu de recherches en imitation learning, sert de référence standard pour évaluer la transfer et la composition de tâches. Les concurrents directs dans l'espace VLA incluent RoboVLMs de Google DeepMind, OpenVLA-OFT, et les travaux de Carnegie Mellon sur ACT/Diffusion Policy. MoH reste à ce stade une contribution de recherche académique, sans déploiement industriel annoncé, mais sa compatibilité plug-and-play le rend directement utilisable par les équipes qui entraînent déjà sur pi-0 ou des architectures dérivées.

IA physiqueOpinion
1 source
Dynamique différentiable de corps rigides en batch sur GPU avec PyTorch pour l'apprentissage robotique
3066arXiv cs.RO 

Dynamique différentiable de corps rigides en batch sur GPU avec PyTorch pour l'apprentissage robotique

Une équipe de chercheurs publie BARD (Batched Articulated Rigid-body Dynamics), une implémentation PyTorch des algorithmes de dynamique corps rigides de Featherstone, conçue pour l'évaluation GPU en batch et la différentiation automatique. Sur cinq modèles de robots allant de 7 à 23 degrés de liberté, BARD atteint un débit jusqu'à 64 fois supérieur à Pinocchio pour la cinématique directe et 63 fois supérieur pour les jacobiens, à une taille de batch de 4096 sur un NVIDIA H200. La bibliothèque repose sur trois choix d'architecture : un cache à évaluation paresseuse par niveaux qui évite les traversées redondantes de l'arbre cinématique, des transformées de joints sans multiplication matricielle grâce à des constantes de Rodrigues précalculées, et une propagation parallèle par niveaux qui ramène les opérations séquentielles à des étapes batchées proportionnelles à la profondeur de l'arbre. La précision numérique est validée par identification de système sur un manipulateur 7-DOF, avec une erreur moyenne de 1,24 % sur les masses des segments sous 5 % de bruit sur les couples. Intégré dans le pipeline d'entraînement Isaac Lab AMP pour un quadrupède à colonne vertébrale de 11 DOF avec 4096 environnements parallèles, BARD est 8,5 fois plus rapide que Pinocchio et 2 fois plus rapide qu'ADAM pour le calcul de dynamique en boucle d'entraînement. Le code est disponible en open source sur GitHub. L'enjeu est structurel : à mesure que le contrôle robotique migre vers le reinforcement learning à grande échelle avec calcul de dynamique en boucle (in-loop), les librairies CPU comme Pinocchio deviennent un goulot d'étranglement dans les pipelines GPU. BARD élimine ce découplage CPU/GPU sans sacrifier la précision ni la différentiabilité, deux propriétés critiques pour l'optimisation par gradient. Pour les équipes qui entraînent des politiques de locomotion ou de manipulation sur des milliers d'environnements parallèles, ce gain de débit se traduit directement en temps de calcul réduit et en capacité à itérer plus vite sur l'architecture des récompenses et des politiques. Pinocchio reste la référence académique et industrielle pour la dynamique articulée depuis plus de dix ans, mais son architecture CPU-first n'a pas été pensée pour les pipelines d'apprentissage modernes sur GPU. ADAM, autre alternative GPU, est ici surpassé d'un facteur 2 en contexte in-loop. BARD se positionne donc entre les simulateurs physiques complets comme Isaac Sim ou MuJoCo MJX et les librairies de dynamique symbolique, en ciblant explicitement l'usage comme composant différentiable dans une boucle d'entraînement. L'article est une prépublication arXiv (2605.31481), non encore soumise à révision par les pairs, et les benchmarks présentés portent sur des scénarios contrôlés : des tests en conditions de déploiement réel, notamment sur des robots industriels ou des plateformes commerciales, restent à venir.

RecherchePaper
1 source
Sous-espaces primitifs et transfert en quelques exemples dans les VLA
3067arXiv cs.RO 

Sous-espaces primitifs et transfert en quelques exemples dans les VLA

Une équipe de recherche publiée en mai 2026 sur arXiv (2605.30695) démontre qu'entraîner des politiques VLA (vision-language-action) avec une segmentation explicite en sous-compétences primitives permet un transfert en quelques démonstrations, sans mise à jour des poids du modèle. Les chercheurs ont comparé deux architectures aux biais inductifs distincts, OpenVLA et π₀.₅ (de Physical Intelligence), sur le jeu de données REASSEMBLE, qui couvre des tâches d'assemblage à contact riche, en appliquant un protocole strict : mêmes recettes LoRA, mêmes hyperparamètres, trois seeds d'entraînement indépendantes. Les modèles entraînés avec des épisodes segmentés en primitives annotées par des prompts linguistiques spécifiques atteignent 78 % des performances du modèle fine-tuné complet avec seulement trois démonstrations d'une tâche jamais vue à l'entraînement. Les modèles entraînés sur des trajectoires plates nécessitent dix démonstrations pour atteindre le même niveau, soit un écart de 3× en efficacité d'échantillon, répliqué sur les deux architectures et validé sur un second jeu de données (LIBERO-Long). Ce résultat s'attaque directement au principal frein à l'industrialisation des VLA : aujourd'hui, introduire une nouvelle tâche en production implique un cycle coûteux de collecte de données et de fine-tuning. Réduire ce besoin à trois démonstrations représente un gain opérationnel concret pour les intégrateurs et les équipes de déploiement terrain. La rigueur causale est notable : les auteurs ablate le sous-espace décodable par les primitives dans les états cachés du modèle et mesurent une chute de 32 points de pourcentage sur le transfert few-shot, alors qu'ablater un sous-espace aléatoire de même dimensionnalité n'a aucun effet statistique. Cela établit que les représentations de primitives sont causalement nécessaires, et non simplement corrélées aux bonnes performances, une distinction importante que beaucoup d'études comparatives ne prennent pas la peine de vérifier. Dans le paysage concurrentiel, Physical Intelligence (π₀, π₀.₅) et le projet OpenVLA (Berkeley) sont les deux familles de VLA généralistes les plus actives, avec des approches très différentes sur la question de la généralisation. Ce travail s'inscrit dans la course à résoudre le problème sim-to-real et zero/few-shot, où RT-2 (Google DeepMind), Octo ou encore RoboFlamingo restent des références. Les auteurs signalent également un biais méthodologique systématique dans l'évaluation des politiques à actions groupées (chunked policies) : une inflation par famille des seuils de validation d'actions produit des taux de faux-échecs jusqu'à dix fois supérieurs lorsqu'on compare à des démonstrations humaines réelles, ce qui invalide silencieusement de nombreuses évaluations publiées dans ce sous-domaine.

IA physiqueOpinion
1 source
Exploitation de la parcimonie chordale pour une estimation globalement optimale avec des graphes de facteurs
3068arXiv cs.RO 

Exploitation de la parcimonie chordale pour une estimation globalement optimale avec des graphes de facteurs

Une équipe de chercheurs associée au Borg Lab (Georgia Tech) a publié fin mai 2026 un préprint arXiv (2605.30617) présentant une méthode pour rendre l'estimation d'état globalement optimale dans les graphes de facteurs, sans effort de formulation manuelle. Le travail s'intègre directement à GTSAM, la bibliothèque de référence pour le SLAM et la navigation, et repose sur deux contributions : une procédure automatisée de construction de relaxations SDP (semi-definite programming) convexes pour tout graphe de facteurs utilisant les types de variables et de facteurs courants, et l'exploitation de la structure creuse chorale native de l'arbre de Bayes (Bayes tree) de GTSAM pour décomposer le problème SDP. Les deux cas d'usage évalués sont un problème de SLAM 3D par pose-graph en anneau et un problème de localisation 2D en chaîne, sur lesquels le nouvel estimateur démontre une meilleure scalabilité que les solveurs locaux standards. Le code est disponible sur le dépôt borglab/gtsam. L'enjeu est directement lié à la sécurité des systèmes robotiques : les solveurs locaux embarqués dans GTSAM ou g2o peuvent converger vers de mauvais minima locaux, ce qui dans un contexte de navigation autonome ou de perception industrielle représente un risque réel. Les approches par relaxations convexes garantissent l'optimalité globale ou permettent de certifier la solution, mais elles étaient jusqu'ici réservées à des cas formulés manuellement par des spécialistes, et pénalisées par le coût de résolution d'un SDP de grande taille. En automatisant la construction de la relaxation et en exploitant la sparsité du problème, les auteurs réduisent substantiellement ce surcoût computationnel, rendant l'approche crédible pour des applications embarquées ou temps-réel. Les graphes de facteurs sont l'outil dominant en estimation robotique depuis les travaux séminaux de Dellaert et Kaess (iSAM, iSAM2) au début des années 2010, et GTSAM en est l'implémentation la plus utilisée en recherche. Les relaxations SDP pour le SLAM ont été explorées depuis une dizaine d'années, notamment par Rosen et al. avec SE-Sync (2019), qui ciblait spécifiquement la synchronisation de poses. Ce nouveau travail généralise l'approche à des graphes de facteurs arbitraires, ce qui constitue un pas vers une intégration praticable dans des pipelines SLAM existants. Il s'agit d'un préprint non encore soumis à révision par les pairs, et les gains de performance annoncés restent à confirmer sur des benchmarks plus complexes ou des architectures embarquées contraintes.

RecherchePaper
1 source
BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)
3069arXiv cs.RO 

BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)

Une équipe de chercheurs publie BOKBO (Best of K Bad Options), décrit comme la première couche d'abstention conforme pour l'inférence VLA à K échantillons. Le problème adressé est précis : les méthodes de scaling à l'inférence telles que RoboMonkey, SEAL, MG-Select et V-GPS génèrent K chunks d'actions candidates et exécutent celle validée comme la meilleure par un vérificateur. Mais lorsque les K candidates sont toutes non sûres, le système en exécute une sans aucun avertissement. BOKBO s'interpose en amont pour garantir, sans hypothèse sur la distribution des données, un taux maximal de violations exécutées. Deux variantes sont proposées : une globale et une par tâche dite Mondrian, cette dernière étant plus robuste sur les tâches les plus difficiles. Évalué sur le benchmark LIBERO avec OpenVLA-OFT à un seuil de risque ε=0,05, le bound conditionnel CRC tient sur 86% des splits bootstrap, avec une couverture de 78% et un taux de réussite nette de 70%. La variante Mondrian-BOKBO relève la fraction minimale de tenue conditionnelle par tâche de 0,71 à 0,93, sur 5 graines d'entraînement. Le résultat le plus saillant n'est pas la méthode elle-même mais l'échec structurel qu'elle expose. Les scores de non-conformité internes aux politiques VLA, utilisés comme proxies de sécurité dans les approches existantes, corrèlent à 0,98 avec l'hyperparamètre de bruit d'action σ, et pratiquement pas avec les violations réelles. Autrement dit, les filtres de sécurité actuels mesurent un réglage de bruit, non un risque réel. Pour les intégrateurs industriels et les équipes d'homologation, c'est un signal d'alarme : les garanties de sécurité des pipelines VLA déployés en production reposent peut-être sur un proxy invalide. Les auteurs montrent que l'échec est partiellement atténué avec un sampling stochastique au niveau des tokens plutôt que perturbation-based, mais le problème reste mécanisme-spécifique. Ils corrigent aussi un biais méthodologique courant : des seuils de force fixés globalement bien en dessous des forces typiques d'un expert humain gonflent artificiellement les taux de violation jusqu'à un facteur 5. Sur le plan du contexte, les VLA comme OpenVLA-OFT et π₀-FAST, testés tous deux dans l'étude, incarnent la convergence entre foundation models et contrôle robotique temps réel. Le benchmark LIBERO, utilisé comme terrain d'évaluation, est devenu une référence dans l'espace manipulation. BOKBO s'inscrit dans la théorie de la prédiction conforme, appliquée ici pour la première fois à l'abstention calibrée dans ce contexte. Les prochaines étapes logiques seraient une validation sur des environnements réels et des tâches hors distribution plus sévères, LIBERO restant un benchmark simulé aux distributions relativement contrôlées. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade.

RechercheActu
1 source
Caspar : un accélérateur CUDA pour la programmation symbolique avec réordonnancement adaptatif
3070arXiv cs.RO 

Caspar : un accélérateur CUDA pour la programmation symbolique avec réordonnancement adaptatif

Une équipe de chercheurs a présenté Caspar (CUDA Accelerator for Symbolic Programming with Adaptive Reordering), une bibliothèque open source qui génère automatiquement des noyaux CUDA optimisés à partir d'expressions symboliques définies en Python, sans que l'utilisateur n'écrive une seule ligne de C++. Construite sur SymForce, elle prend en charge les opérations sur les groupes de Lie et la différentiation symbolique automatique : l'utilisateur formule ses fonctions résiduelles de façon expressive, et Caspar compile l'ensemble en code GPU haute performance. Pour valider l'approche, l'équipe a mesuré les performances sur le jeu de données BAL (Bundle Adjustment in the Large), référence académique standard pour les problèmes d'ajustement de faisceaux en vision 3D, en comparant Caspar aux meilleurs solveurs disponibles. Sur ce benchmark, Caspar s'avère 5 à 20 fois plus rapide que la meilleure alternative existante, avec une empreinte mémoire moindre et une précision comparable. C'est un résultat notable pour toute application robotique reposant sur l'optimisation non linéaire temps réel : SLAM (Simultaneous Localization and Mapping), calibration de capteurs multiples, planification de trajectoires, ou reconstruction 3D embarquée. En abstrayant la complexité CUDA derrière une interface Python symbolique, Caspar abaisse substantiellement la barrière à l'accélération GPU dans les pipelines robotiques industriels, un domaine où la maîtrise du CUDA reste rare et coûteuse. Le résultat illustre qu'une approche de compilation symbolique automatisée peut rivaliser, voire dépasser, des implémentations GPU écrites à la main par des experts. SymForce a été initialement développé chez Skydio, fabricant américain de drones autonomes, avant d'être publié en open source. Dans l'espace des solveurs non linéaires, Caspar entre en concurrence directe avec Ceres Solver (Google), g2o et GTSAM, qui dominent les applications de SLAM et de robotique. La bibliothèque est disponible librement dans le dépôt GitHub symforce-org/symforce ; la publication présentée ici est un preprint arXiv, non encore évalué par les pairs. Les benchmarks portent exclusivement sur des jeux de données académiques standards : les gains annoncés restent à confirmer sur des cas d'usage robotiques temps réel embarqués, où les contraintes de latence et de mémoire GPU sont sensiblement plus sévères.

RecherchePaper
1 source
Notes à soi-même : VLA augmentées d'un bloc-notes pour les tâches de manipulation à mémoire
3071arXiv cs.RO 

Notes à soi-même : VLA augmentées d'un bloc-notes pour les tâches de manipulation à mémoire

Une équipe de chercheurs a publié début 2026 sur arXiv (réf. 2602.21013, version révisée) une approche augmentant les modèles VLA (Vision-Language-Action) d'un module de mémorisation textuelle appelé "scratchpad", littéralement un bloc-notes interne. Le principe : pendant l'exécution d'une tâche, le modèle peut écrire des notes intermédiaires en langage naturel, notamment les positions d'objets détectées, l'état d'avancement du plan et les sous-objectifs restants à accomplir. Les auteurs ont évalué cette méthode sur deux benchmarks spécialisés, ClevrSkills et MemoryBench, ainsi que sur une tâche réelle de pick-and-place. Résultat annoncé : le scratchpad améliore significativement la généralisation sur ces tâches, aussi bien pour les architectures récurrentes que non récurrentes. La problématique adressée est structurelle. La majorité des VLA actuels opèrent de façon "sans état" (stateless) : ils traitent chaque instant de décision de manière indépendante, sans mémoire explicite des étapes précédentes. Or de nombreuses tâches de manipulation dextère sont non-markoviennes par nature, ce qui signifie que la décision optimale à l'instant t dépend de ce qui s'est passé avant t. Ce travail défend qu'un mécanisme aussi simple qu'un bloc-notes textuel suffit à combler une partie de ce gap, sans modifier l'architecture fondamentale du modèle. Pour les équipes R&D développant des solutions sur longue séquence (assemblage multi-étapes, tri conditionnel, manipulation avec gestion d'état), c'est une piste légère compatible avec les VLA open-source existants, à condition que les résultats sur ClevrSkills et MemoryBench se confirment dans des environnements industriels réels plus bruités. Les VLA ont connu une accélération majeure depuis 2023 avec RT-2 de Google DeepMind, OpenVLA de UC Berkeley, Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, tous construits sur le principe de la compréhension sémantique à grande échelle transférée au geste robotique. La limite "sans mémoire" était connue des praticiens mais peu formalisée dans la littérature récente. Ce travail s'inscrit dans une tendance visant à doter les VLA de capacités de raisonnement à long horizon, en parallèle d'autres approches comme les architectures récurrentes ou les planificateurs hybrides symbolique-neuraux. Il s'agit d'un preprint académique sans déploiement ni partenariat industriel annoncé, et les benchmarks utilisés (ClevrSkills, MemoryBench) restent des environnements relativement contrôlés dont la transférabilité au terrain est encore à démontrer.

IA physiqueOpinion
1 source
ELAN4D : supervision 4D centrée sur l'incarnation pour les modèles VLA via adaptation plug-and-play
3072arXiv cs.RO 

ELAN4D : supervision 4D centrée sur l'incarnation pour les modèles VLA via adaptation plug-and-play

ELAN4D est un cadre d'entraînement pour modèles Vision-Language-Action (VLA) publié en preprint arXiv en mai 2026, conçu pour améliorer la robustesse aux perturbations hors-distribution. Le problème central: les VLA actuels comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) réagissent directement aux observations sans modéliser les dynamiques futures, ce qui dégrade leurs performances dès que les conditions changent. ELAN4D injecte une supervision 4D basée sur l'embodiment: à partir des seuls états proprioceptifs du robot, il calcule des trajectoires 3D de points clés (articulations, effecteur terminal) via cinématique directe, sans tracker externe ni reconstruction. Un décodeur léger est ajouté pendant l'entraînement puis retiré à l'inférence, laissant l'interface du modèle de base inchangée. Sur les benchmarks LIBERO, LIBERO-Plus, RoboTwin2.0 et sur des tâches en conditions réelles, ELAN4D surpasse les baselines VLA avec des gains substantiels sous perturbations de caméra, d'arrière-plan et de disposition d'objets. L'atout principal est pragmatique: améliorer un VLA existant sans reconstruction 3D coûteuse ni modification du backbone vision-langage pré-entraîné (les gradients sont isolés pour le préserver), et sans overhead à l'inférence. Ce mode plug-and-play permet d'appliquer l'approche à des modèles existants sans repartir d'une architecture neuve, un avantage direct pour les équipes R&D et les intégrateurs. Le gap de généralisation hors-distribution est l'un des freins majeurs à l'industrialisation des politiques de manipulation, et les gains annoncés sur benchmarks sont potentiellement significatifs si confirmés en déploiement réel. Il convient cependant de tempérer: les résultats sont établis en conditions de laboratoire, sans validation à grande échelle en production. La dynamique de recherche sur les VLA robustes s'est intensifiée depuis pi-0 (Physical Intelligence, octobre 2024) et la popularisation des architectures diffusion policy et action chunking transformer, avec plusieurs équipes explorant des approches concurrentes basées sur les world models vidéo ou la reconstruction 3D. ELAN4D est une contribution purement académique: le preprint ne mentionne ni partenaire industriel ni déploiement en cours. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou multi-bras en environnement industriel réel, sans qu'aucune timeline ne soit annoncée.

IA physiqueOpinion
1 source
CoMo3R-SLAM : SLAM dense monoculaire collaboratif avec priors de reconstruction 3D appris pour systèmes multi-agents en extérieur
3073arXiv cs.RO 

CoMo3R-SLAM : SLAM dense monoculaire collaboratif avec priors de reconstruction 3D appris pour systèmes multi-agents en extérieur

CoMo3R-SLAM est un système de SLAM dense collaboratif monoculaire présenté en preprint sur arXiv (2605.30488) en mai 2026. Il permet à plusieurs robots de construire ensemble une carte 3D dense d'un environnement extérieur en n'utilisant que des caméras RGB monoculaires, sans capteurs de profondeur de type LiDAR ou RGB-D. Chaque agent embarque un front-end guidé par des priors de reconstruction appris pour assurer le suivi en temps réel et la fusion dense locale. Un coordinateur centralisé prend ensuite en charge la cohérence globale via correspondance de pointmaps denses, synchronisation géométrique Sim(3) en forme fermée, et ajustement de faisceaux global accéléré GPU avec optimisation de profondeur par segments. Le système ne requiert ni capteur de profondeur ni calibration d'intrinsèques paramétriques. Tournant en ligne à 8 FPS, il obtient le meilleur ATE (erreur de trajectoire absolue) sur trois des quatre scènes Tanks and Temples, et des résultats compétitifs sur les séquences Waymo, égalant ou dépassant les méthodes RGB-D état de l'art. L'impact concret pour l'industrie est d'abord matériel : supprimer les capteurs de profondeur réduit significativement le poids embarqué, le coût unitaire et la complexité de calibration des plateformes robotiques. LiDAR et caméras RGB-D représentent souvent plusieurs kilogrammes et plusieurs milliers d'euros par unité, ce qui pénalise le déploiement en flotte. Que des priors d'apprentissage profond permettent de lever l'ambiguïté d'échelle monoculaire en extérieur valide une hypothèse forte du secteur : les modèles feed-forward de reconstruction 3D sont désormais suffisamment robustes pour opérer hors conditions contrôlées. Pour les intégrateurs et décideurs B2B, cela ouvre la voie à des flottes de robots légers capables de cartographier collaborativement des environnements vastes sans infrastructure capteur lourde. Le SLAM collaboratif dense est un défi ouvert depuis une décennie. Des systèmes comme COVINS ou Kimera-Multi s'appuient encore majoritairement sur des capteurs de profondeur ou des environnements intérieurs. La montée en puissance des modèles de reconstruction 3D appris, notamment DUSt3R (2023) et MASt3R (2024), issus de Naver Labs Europe à Grenoble, a rendu accessible la reconstruction dense monoculaire sans calibration explicite. CoMo3R-SLAM est la première application de ces priors dans un cadre multi-agents outdoor. Les benchmarks Tanks and Temples et Waymo constituent une validation pertinente pour des conditions de déploiement réelles. Côté concurrents, les systèmes multi-robots embarqués de Boston Dynamics, ANYbotics ou de spécialistes SLAM comme SLAMcore restent ancrés sur des architectures multi-capteurs. Ce preprint, non encore évalué par les pairs, ouvre la voie à des pilotes sur drones d'inspection ou robots mobiles légers où le rapport poids/performance est critique.

RecherchePaper
1 source
Apprentissage du contrôle corps entier adapté au terrain pour la loco-manipulation perceptive de robots à pattes
3074arXiv cs.RO 

Apprentissage du contrôle corps entier adapté au terrain pour la loco-manipulation perceptive de robots à pattes

Une équipe de chercheurs a publié sur arXiv (référence 2605.31343, mai 2026) un framework baptisé TA-WBC (Terrain-Aware Whole-Body Control) destiné aux manipulateurs à pattes, c'est-à-dire des robots combinant membres locomoteurs (quadrupèdes ou bipèdes) et bras articulés. Le coeur du système est une politique unifiée entraînée par apprentissage par renforcement (RL) qui pilote simultanément les jambes et le bras lors de tâches de loco-manipulation, terme désignant la capacité à se déplacer et manipuler des objets en même temps. L'architecture repose sur trois briques techniques : un encodeur d'extéroception hybride qui extrait en temps réel les caractéristiques du terrain, une méthode d'échantillonnage de l'effecteur final ancrée sur le plan de contact des pieds pour découpler la cible de manipulation des oscillations du torse, et un module de distillation à double politique pour intégrer motricité étendue et adaptabilité sans effacement catastrophique des compétences acquises. Les expériences en simulation et en environnement réel montrent une zone atteignable agrandie, une erreur de tracking réduite et moins de trébuchements imprévus. Ce travail s'attaque à une limitation structurelle des contrôleurs corps entier existants : leur dépendance quasi exclusive à la proprioception (capteurs internes, IMU, encodeurs) au détriment de l'extéroception (perception externe du terrain). En milieux industriels complexes comme les chantiers, les entrepôts en hauteur variable ou les sites nucléaires, cette lacune rend les plateformes mobiles-manipulatrices peu fiables dès que le sol n'est plus plan. Le découplage effecteur/torse est particulièrement notable pour les intégrateurs : il signifie que le bras peut maintenir une trajectoire stable même quand le corps compense une marche irrégulière, ce qui est un prérequis non négociable pour tout assemblage ou saisie de précision en terrain dégradé. La validation sim-to-real, même partielle, renforce la crédibilité d'une approche qui reste à ce stade un preprint non commercialisé. Les manipulateurs à pattes constituent une catégorie en pleine structuration. Boston Dynamics commercialise Spot avec bras depuis 2021, Unitree propose le B2W équipé d'un bras, et plusieurs laboratoires académiques majeurs (ETH Zurich, CMU, Berkeley) publient régulièrement sur la loco-manipulation. Le verrou que TA-WBC cherche à lever, la perception de topologie de terrain couplée au contrôle corps entier, est précisément ce qui freine le déploiement de ces plateformes au-delà des environnements structurés. Ce preprint n'annonce pas de produit ni de partenaire industriel ; il pose néanmoins une brique algorithmique que des acteurs comme Agility Robotics, Apptronik ou les équipes robotique de Google DeepMind pourraient intégrer dans leurs chaînes d'entraînement.

RecherchePaper
1 source
Apprentissage de la séparation contrôlée de petits objets entre deux doigts avec une peau tactile
3075arXiv cs.RO 

Apprentissage de la séparation contrôlée de petits objets entre deux doigts avec une peau tactile

Des chercheurs du DLR (Deutsches Zentrum für Luft- und Raumfahrt, le centre aérospatial allemand) publient sur arXiv (2605.31486) une approche inédite pour la séparation contrôlée de petits objets par une main robotique à deux doigts. La tâche est précise : après avoir saisi une poignée de billes de 6 mm de diamètre dans un bac, le système doit en lâcher progressivement jusqu'à n'en conserver qu'un nombre cible entre ses doigts. Aucune caméra n'intervient dans la boucle de contrôle ; le robot s'appuie exclusivement sur une peau tactile à résolution spatiale positionnée sur le bout d'un doigt. La politique de contrôle est apprise en simulation par apprentissage par renforcement avec une récompense sparse qui se déclenche uniquement lorsque le nombre désiré d'objets est atteint. Le transfert sim-to-real est démontré sur la DLR-Hand II, une main mécatronique multi-doigts de référence dans la communauté académique robotique. L'analyse conduite sur les capteurs tactiles constitue le principal apport scientifique. Un capteur idéal à haute résolution permet de résoudre la tâche quasi parfaitement, tandis qu'un capteur réduit à une grille de 4x4 taxels améliore encore les résultats de 20% par rapport à l'utilisation des seuls encodeurs articulaires des doigts. Un estimateur entraîné conjointement prédit les positions de contact réelles, ce qui permet d'instrumenter finement l'apport de chaque niveau de résolution sensorielle. Pour les industriels, cette démonstration valide l'hypothèse que le toucher seul peut suffire pour des tâches de tri et de dosage en environnement encombré, sans éclairage contrôlé ni vision, ce qui élargit le spectre applicatif des cellules de picking autonomes dans des contextes où la caméra est inutilisable ou coûteuse à intégrer. Le DLR développe sa ligne DLR-Hand depuis les années 1990, avec la DLR-Hand II comme référence académique de longue date en manipulation dextère. Sur le plan concurrentiel, la manipulation fine de très petits objets reste un problème ouvert que ciblent plusieurs acteurs : Shadow Robotics et ses tendons haute précision, les capteurs tactiles Digit (Meta AI) et GelSight (MIT), ou encore Xela Robotics côté intégration commerciale. La combinaison apprentissage par renforcement en simulation, transfert sim-to-real réussi et retour tactile seul sur des objets de 6 mm reste très peu documentée à cette échelle. Le travail est un preprint non encore évalué par les pairs ; une soumission à IROS ou ICRA préciserait les limites de la généralisation à d'autres géométries d'objets et à des contextes de production réelle.

FR/EU ecosystemePaper
1 source
Les modèles VLA aériens peuvent-ils coopérer ? Évaluation de la coordination air-sol en boucle fermée avec CARLA-Air
3076arXiv cs.RO 

Les modèles VLA aériens peuvent-ils coopérer ? Évaluation de la coordination air-sol en boucle fermée avec CARLA-Air

Des chercheurs ont publié sur arXiv (arXiv:2605.31066) une évaluation systématique des modèles vision-langage-action (VLA) aériens dans des scénarios de coopération air-sol. L'étude introduit CARLA-Air, un environnement de simulation mono-processus qui fusionne CARLA et AirSim au sein d'un même runtime Unreal Engine. Cette architecture unifiée permet de partager un état physique commun, un tick de physique synchronisé et un pipeline de capteurs cohérent entre un drone (UAV) et un robot terrestre (UGV), garantissant ainsi une mesure précise de la latence de coordination effective et de l'alignement temporel entre les agents. Deux tâches de diagnostic complémentaires ont été retenues : l'atterrissage sur plateforme mobile et l'escorte avec récupération d'occlusion, deux scénarios qui exigent une action jointe continue en boucle fermée. Les résultats révèlent un écart notable entre compétence individuelle et comportement coopératif stable. Les modèles VLA aériens testés parviennent souvent à suivre ou à pister un partenaire sol, mais échouent à convertir cette aptitude mono-agent en coordination fiable. L'ajout de prompts d'état explicites (state prompting) n'apporte qu'un bénéfice limité, et l'interaction bidirectionnelle naïve ne stabilise pas les performances, elle amplifie même les erreurs pour la majorité des baselines évaluées. Ce constat soulève une question structurelle pour les intégrateurs et décideurs industriels qui envisagent des flottes hétérogènes : les VLA actuels, conçus pour des missions autonomes mono-agent, ne sont pas directement transposables à la coopération multi-robot sans ingénierie supplémentaire sur l'interface de communication et la gestion d'objectifs partagés. L'étude s'inscrit dans un momentum fort autour des VLA embarqués (modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA), majoritairement optimisés pour des robots manipulateurs ou des plateformes terrestres. La robotique aérienne coopérative reste un angle peu couvert. Les auteurs identifient trois prérequis manquants pour le zero-shot air-sol : un ancrage explicite de l'état du partenaire, une coordination d'action à faible latence, et un alignement sur un objectif d'équipe partagé. Le code de CARLA-Air est disponible publiquement sur GitHub, ce qui ouvre la voie à des benchmarks reproductibles dans un domaine encore dépourvu de standards d'évaluation communs.

RechercheActu
1 source
SignScene : ancrage visuel des panneaux pour la navigation sans carte
3077arXiv cs.RO 

SignScene : ancrage visuel des panneaux pour la navigation sans carte

Des chercheurs ont publié SignScene (arXiv 2602.12686), un système permettant à un robot de naviguer sans carte préalable en interprétant les panneaux de signalisation présents dans l'environnement. Évalué sur un jeu de données de 114 requêtes couvrant neuf types d'environnements différents, le système atteint 88 % de précision dans ce qu'ils appellent le "sign grounding" : la capacité à associer les instructions sémantiques d'un panneau à des éléments de la scène 3D locale et à des actions de navigation concrètes. La démonstration a été réalisée sur un robot Boston Dynamics Spot naviguant en conditions réelles en s'appuyant uniquement sur les panneaux visibles, sans carte ni waypoints préprogrammés. Le défi central est la représentation spatiale : les grands modèles vision-langage (VLMs) disposent du raisonnement sémantique nécessaire pour interpréter un panneau ("Sortie à 50 m à droite"), mais ils sont sensibles à la manière dont l'information spatiale leur est présentée. SignScene introduit une représentation "sign-centric" qui extrait les éléments de scène pertinents pour la navigation et les organise autour du panneau détecté, améliorant significativement le raisonnement du VLM par rapport aux approches de référence, sans que les chiffres exacts de ces dernières soient publiés dans l'abstract disponible. Pour les intégrateurs industriels, l'enjeu est direct : un robot capable d'interpréter les panneaux existants d'un entrepôt ou d'un hôpital pourrait être déployé sans phase de cartographie SLAM préalable, réduisant les coûts et délais d'installation tout en fonctionnant dans des environnements qui évoluent. La navigation sans carte est un axe de recherche actif en robotique mobile, traditionnellement dominé par SLAM ou les cartes topologiques préprogrammées. L'essor des VLMs a ouvert la voie à une navigation guidée par le langage naturel, avec des travaux comme SayNav, VLMaps ou LM-Nav comme précédents directs. SignScene se positionne sur le créneau spécifique des panneaux physiques, signal abondant dans les environnements humains mais peu exploité en robotique autonome. Le robot Spot de Boston Dynamics sert ici de plateforme de validation standard dans la communauté académique. Les prochaines étapes logiques incluraient une extension aux environnements extérieurs urbains ou logistiques, et l'intégration dans des pipelines VLA (Vision-Language-Action) combinant interprétation de panneaux et planification de trajectoire bout-en-bout.

RecherchePaper
1 source
GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés
3078arXiv cs.RO 

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés

Des chercheurs ont publié sur arXiv (référence 2605.30740) GSAM, un framework conçu pour la manipulation d'objets articulés (tiroirs, portes, robinets) par des robots de service. Le système combine quatre modules : un percepteur visuel qui extrait les paramètres cinématiques (axe de rotation, amplitude de mouvement), un raffineur basé sur un VLM fine-tuné utilisant le raisonnement par chaîne-de-pensée (CoT) pour corriger les estimations brutes, un générateur de contraintes d'interaction qui encode la géométrie de l'objet et l'évitement d'obstacles, et un planificateur cinématique qui vérifie l'atteignabilité avant exécution. Sur 50 tâches de type charnière réparties en 5 catégories d'objets et 50 configurations initiales aléatoires de l'effecteur, GSAM améliore le taux de succès de 36,0 % par rapport à la meilleure baseline existante, avec une réduction de l'écart-type de 3,1 % indiquant une meilleure consistance comportementale. Ce résultat s'attaque directement au fossé démo-réalité sur une sous-tâche souvent ignorée : les interactions avec des objets mécaniquement contraints impliquent des trajectoires curvilignes et une compréhension de la géométrie interne que ni les politiques end-to-end entraînées en simulation ni les planificateurs purement visuels ne gèrent correctement. L'usage du raisonnement CoT pour corriger des estimations cinématiques erronées plutôt que pour générer un plan de haut niveau constitue un usage pragmatique et inhabituel des VLM en robotique. Pour les intégrateurs sur des robots de service industriels ou hospitaliers, la réduction des collisions destructrices a une valeur opérationnelle directe : forcer mécaniquement un joint en production est un incident matériel, pas une métrique abstraite. Le problème de manipulation articulée est étudié depuis plusieurs années dans des équipes comme Stanford (projet Where2Act, 2021), ETH Zurich et CMU. Les approches concurrentes comprennent les frameworks VLA tels que pi0 (Physical Intelligence) ou OpenVLA, ainsi que les méthodes de perception articulée comme PARIS ou CatGrasp. GSAM se distingue en combinant explicitement un LLM pour la génération de contraintes et un VLM pour la perception raffinée, plutôt qu'une politique implicite entraînée bout-en-bout. Le travail reste un preprint arXiv non soumis à une conférence majeure (ICRA, IROS, CoRL) : les gains annoncés sont encourageants mais nécessitent une validation sur robot physique en conditions non contrôlées.

RecherchePaper
1 source
Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine
3079arXiv cs.RO 

Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine

Des chercheurs présentent dans un preprint arXiv (2505.20795, soumis en mai 2025) un framework en deux étapes permettant à un robot d'apprendre une nouvelle tâche de manipulation en regardant simplement une vidéo de démonstration humaine, sans collecter de données de téléopération ni effectuer de fine-tuning du modèle. Le système repose d'abord sur un modèle de génération vidéo entraîné par cross-prediction sur un dataset mixte humain-robot, pour construire une représentation latente commune aux deux modalités. Ensuite, une perte contrastive prototypique ("prototypical contrastive loss") aligne cet espace de représentation avec un espace d'action partagé entre humain et robot. À l'inférence, une vidéo de démonstration humaine sert directement de prompt : le robot exécute la tâche correspondante sans aucune adaptation. Les validations portent sur des tâches de manipulation dextre en environnement réel. L'enjeu industriel est direct : la collecte de données de téléopération reste le goulot d'étranglement majeur du robot learning, coûteuse, lente, dépendante d'opérateurs qualifiés. Si l'approche tient à l'échelle, elle réduirait drastiquement le coût d'onboarding d'une nouvelle tâche, passant de plusieurs heures de collecte à quelques secondes de vidéo. C'est précisément le type de capacité qui intéresse les intégrateurs industriels et les startups d'AMR cherchant à déployer des politiques généralisables sans retraining continu. Cela dit, le papier reste un preprint académique : les résultats portent sur un nombre limité de tâches de manipulation, et l'absence de métriques comparatives détaillées (nombre de démonstrations, taux de succès absolu, diversité des saisies) rend l'évaluation de la robustesse difficile à ce stade. La question du "demonstration gap" humain-robot est travaillée depuis plusieurs années, notamment via les travaux sur les video-language-action models (VLA) et des approches comme ACT ou Diffusion Policy chez des labos comme Stanford, CMU, ou encore Physical Intelligence (Pi-0). L'originalité ici réside dans le découplage explicite entre représentation et action via la cross-prediction, plutôt que l'alignement direct de trajectoires. Des acteurs comme 1X, Sanctuary AI ou Figure (avec son modèle Helix) explorent des pistes similaires côté industriel. La prochaine étape logique pour cette ligne de recherche est la généralisation à des objets non vus et à des scènes plus encombrées, deux conditions qui font souvent échouer les approches zero-shot en déploiement réel.

IA physiqueOpinion
1 source
Cinématique inverse intégrant actionneurs et limites articulaires pour robots redondants commandés en couple
3080arXiv cs.RO 

Cinématique inverse intégrant actionneurs et limites articulaires pour robots redondants commandés en couple

Une équipe de recherche propose, dans un preprint arXiv (2605.31436) publié fin mai 2026, une méthode de cinématique inverse (IK) adaptée aux robots redondants commandés en couple, sous contraintes de butées articulaires. Le point de départ est un constat souvent ignoré dans les pipelines classiques : lorsqu'un contrôleur opère au niveau du couple (torque-level controller) plutôt qu'à celui de la vitesse, la commande de vitesse articulaire émise par le module IK n'est pas exécutée telle quelle. Un petit résidu de tâche commandé ne se traduit donc pas forcément par un mouvement effectif. La méthode reformule le problème comme un programme quadratique convexe dont la variable de décision est la vitesse articulaire "requise" plutôt que simplement "commandée". Les contraintes de butées sont imposées via des bornes de style Control Barrier Function (CBF), tandis que la tâche cartésienne est gérée par une variable de relâchement pénalisée. La redondance est résolue par un objectif de compatibilité avec le contrôleur aval, qui tient compte de la cohérence avec la commande précédente et de la capacité en couple de chaque actionneur. Les expériences sont conduites sur un exosquelette de membre supérieur à sept degrés de liberté, contrôlé par décomposition virtuelle (VDC). Le problème adressé est concret pour quiconque déploie des robots à commande en couple : les méthodes IK standard (pseudo-inverse jacobienne, QP de préservation de tâche) supposent implicitement que les vitesses commandées sont suivies fidèlement, ce qui n'est vrai qu'en commande en vitesse pure. En commande en couple, le contrôleur peut saturer, filtrer ou modifier la trajectoire articulaire, rendant les sorties IK classiques sous-optimales voire contre-productives. Les résultats montrent une réduction des commandes poussant les butées articulaires, des vitesses requises bornées dans la plage admissible, et un comportement de tâche réalisé amélioré, sans modifier le contrôleur aval. Pour les intégrateurs d'exosquelettes ou de robots collaboratifs torque-contrôlés, cela offre une couche IK intermédiaire drop-in, indépendante du contrôleur bas niveau. La cinématique inverse pour robots redondants est un problème canonique en robotique, avec des décennies de littérature autour de la pseudo-inverse de Jacobi et des QP sous contraintes. L'essor des robots à commande en couple, privilégiés pour la sécurité en interaction humain-robot, a mis en évidence la limite des pipelines IK hérités. L'utilisation des CBF pour la gestion des contraintes articulaires s'inscrit dans une tendance de recherche active depuis 2015, popularisée notamment par les travaux de l'École des Mines et de Georgia Tech. Du côté industriel, les applications directes concernent les exosquelettes de rééducation (Wandercraft en France avec l'Atalante, Ekso Bionics aux États-Unis) et les bras robotiques collaboratifs à sept axes (Franka, Kuka iiwa). Le travail reste un preprint non encore évalué par les pairs ; aucun déploiement ou partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
TARIC : VLN extérieur à mémoire augmentée et traversabilité adaptative sous indices sémantiques discontinus
3081arXiv cs.RO 

TARIC : VLN extérieur à mémoire augmentée et traversabilité adaptative sous indices sémantiques discontinus

Une équipe de chercheurs a publié en mai 2026 sur arXiv (référence 2605.31121) TARIC, un cadre de navigation extérieure vision-langage (VLN) conçu pour résister aux interruptions d'indices sémantiques sur des trajets longue distance. Le problème ciblé est précis : lorsqu'un robot navigue en milieu ouvert sur des routes de 600 à 1 000 mètres, les repères visuels guidant sa trajectoire (panneaux, objets, structures reconnaissables) disparaissent régulièrement du champ de vision, créant des phases sans indice pendant lesquelles les systèmes actuels dérivent, oscillent ou font demi-tour. TARIC répond avec trois mécanismes intégrés : extraction d'orientations sémantiques depuis des indices de but filtrés par visibilité, ancrage de ces orientations dans un profil de traversabilité en temps réel pour générer des caps exécutables (et non plus de simples filtres de sécurité), et mémorisation des indices 2D dans une carte 3D alignée sur le monde avec un mécanisme de lecture tenant compte de l'incertitude. Évalué sur des plateformes quadrupèdes et sur roues, le système atteint 40 % de taux de succès en conditions réelles contre 17,5 % pour la meilleure baseline existante, et améliore de plus de 10 points de pourcentage le taux en simulation. Ce résultat terrain est significatif dans un domaine où le fossé entre simulation et déploiement reste l'obstacle majeur. La plupart des frameworks VLN extérieurs publiés présentent des performances en simulation qui ne se transposent pas au terrain ; TARIC maintient un gain relatif de 2,3× sur le meilleur concurrent en conditions réelles, ce qui suggère que traiter la traversabilité comme une contrainte de guidance active (et non un simple filtre) réduit effectivement le sim-to-real gap. Pour les intégrateurs de robots d'inspection ou de surveillance sur campus ou sites industriels, cela signifie une navigation autonome longue distance plus robuste sans infrastructure de balises denses. La contribution architecturale clé, transformer des indices 2D éphémères en mémoire 3D avec readout incertain, ouvre aussi une piste concrète pour les AMR opérant dans des environnements semi-structurés. La navigation vision-langage en extérieur est un champ actif depuis les travaux sur VLN-BERT et les méthodes fondées sur CLIP, mais la majorité des approches ont été conçues pour des intérieurs structurés ou des parcours courts. L'extension aux environnements ouverts sur plus de 600 mètres positionne directement TARIC face à des acteurs comme Boston Dynamics (Spot), Unitree et ANYbotics, dont les quadrupèdes déployés en inspection longue distance dépendent encore largement de waypoints prédéfinis ou de cartes SLAM. TARIC, issu d'un preprint non encore soumis à peer review, reste à ce stade une preuve de concept académique : les prochaines étapes naturelles incluent une validation sur des flottes multi-robots, une intégration avec des stacks open-source comme Nav2, et des tests en conditions météorologiques dégradées, non couverts par l'article.

IA physiquePaper
1 source
AnySlot : politiques vision-langage-action conditionnées par objectif pour le placement zéro-shot par emplacement
3082arXiv cs.RO 

AnySlot : politiques vision-langage-action conditionnées par objectif pour le placement zéro-shot par emplacement

Des chercheurs ont publié sur arXiv (référence 2604.10432v3) un framework baptisé AnySlot, conçu pour permettre à des politiques de contrôle robotique de type Vision-Language-Action (VLA) de placer des objets avec précision dans des emplacements discrets, dits "slots", à partir d'instructions en langage naturel. L'approche introduit un objectif visuel intermédiaire : plutôt que de passer directement de la commande textuelle au mouvement moteur, le système génère d'abord un marqueur spatial rendu sur l'image, indiquant l'emplacement cible exact, puis confie l'exécution à une politique VLA conditionnée par ce but visuel. Cette architecture hiérarchique découple la compréhension sémantique de l'instruction et la précision géométrique de l'exécution. Les auteurs introduisent également SlotBench, un benchmark de simulation structuré autour de neuf catégories de tâches, destiné à évaluer le raisonnement spatial dans des scénarios de placement à l'échelle centimétrique. Les expériences montrent qu'AnySlot surpasse les baselines VLA plates et les méthodes de grounding modulaire en conditions zero-shot. Ce travail s'attaque à l'un des verrous les plus concrets des VLA généralistes : la précision de placement sous contraintes compositionnelles. Les politiques end-to-end peinent à combiner compréhension du langage et précision millimétrique, ce qui freine leur utilisation dans des applications industrielles comme l'assemblage, le tri ou la mise en casier. L'introduction d'un "but visuel" explicite comme couche intermédiaire est une réponse architecturale directe au gap sémantique-géométrique, et les résultats zero-shot suggèrent une meilleure généralisation que les approches purement end-to-end ou modulaires. Pour un intégrateur ou un COO industriel, cela signifie potentiellement réduire le coût de spécification des tâches de placement sans sacrifier la fiabilité. Le contexte est celui d'une intense activité autour des VLA depuis les travaux fondateurs de RT-2 (Google DeepMind, 2023) et des politiques récentes comme pi0 de Physical Intelligence ou OpenVLA. La difficulté du slot-level placement restait un angle mort de ces approches, qui performent mieux sur des tâches de saisie que de dépose précise. AnySlot ne provient pas d'un labo académique nommé explicitement dans l'abstract, et les résultats sont pour l'instant limités à la simulation via SlotBench, sans validation sur robot réel publiée. Les prochaines étapes naturelles seraient des expériences physiques et une comparaison avec des systèmes comme RoboPoint ou SpatialVLA, qui explorent des approches proches du grounding spatial. Ce preprint restera à suivre avant toute intégration industrielle.

IA physiqueOpinion
1 source
WristCompass : le couplage cinématique comme concept visuel appris pour l'orientation d'une caméra égocentrique
3083arXiv cs.RO 

WristCompass : le couplage cinématique comme concept visuel appris pour l'orientation d'une caméra égocentrique

Une équipe de chercheurs a publié sur arXiv (2605.30671) WristCompass, un modèle léger d'estimation de l'orientation d'une caméra ego-centrique à partir de vidéos de manipulation robotique. Le défi central est de dissocier le mouvement de la main du mouvement de la caméra, étape indispensable pour l'apprentissage par imitation à partir de démonstrations en vue subjective. L'approche naïve, basée sur la reconstruction géométrique de la scène, échoue dès que les mains occultent le cadre : VGGT, un modèle de reconstruction 3D à 1 milliard de paramètres, fait moins bien qu'un prédicteur constant sur le benchmark TACO dans ces conditions. WristCompass contourne ce problème en exploitant un concept visuel différent : la dynamique de couplage cinématique, soit la relation physique structurée entre le mouvement du poignet et l'orientation de la caméra, imposée par la chaîne bras-épaule-tête. Le modèle repose sur un GRU de seulement 200 000 paramètres opérant sur des fenêtres temporelles courtes, avec des features inter-poignets en 4 dimensions, et atteint une erreur géodésique médiane de 14,3 degrés sur Epic Kitchens, un jeu de données de vidéos culinaires sur lequel il n'a jamais été entraîné. Ce résultat interpelle directement les équipes qui travaillent sur l'apprentissage par imitation en robotique humanoïde et manipulation. Le fait qu'un modèle à 200 000 paramètres, entraîné exclusivement sur des vidéos de manipulation de bureau, batte en transfert zéro-shot un modèle 5 000 fois plus grand contredit l'hypothèse dominante selon laquelle la reconstruction géométrique dense est le bon prior pour comprendre les vidéos ego-centriques. Plus concrètement, cela ouvre une voie pour exploiter massivement des démonstrations humaines filmées en première personne (type EPIC-Kitchens, EgoExo4D) sans capteurs IMU ni marqueurs, ce qui est le goulot d'étranglement actuel dans les pipelines de Robot Learning from Demonstration. WristCompass s'inscrit dans un effort plus large de la communauté pour extraire des représentations utiles des vidéos humaines en vue d'entraîner des politiques robotiques, un champ structuré par des travaux comme ACT, Diffusion Policy ou pi-0 de Physical Intelligence. La compacité anatomique du signal exploité, invariant à la scène et à l'individu, est ce qui permet le transfert zéro-shot : c'est de la physique, pas de l'apparence. Les auteurs mentionnent explicitement Epic Kitchens et TACO comme benchmarks de validation ; la suite logique serait de coupler WristCompass à un pipeline VLA complet pour mesurer l'impact en aval sur la qualité des politiques imitées, ce que le papier ne fait pas encore.

RecherchePaper
1 source
HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action
3084arXiv cs.RO 

HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action

Des chercheurs ont publié le 31 mai 2026 HARP-VLA (Human-Robot Aligned Representation Learning for Vision-Language-Action), un framework de pré-entraînement conçu pour exploiter les vastes corpus de vidéos humaines dans l'apprentissage de politiques de manipulation robotique. Le coeur de l'approche repose sur deux composants entraînés conjointement : un encodeur visuel adapté aux robots et un modèle d'action latente. L'entraînement combine un petit nombre de démonstrations appariées humain-robot utilisées comme ponts inter-embodiment, et une quantité bien plus importante de vidéos non appariées des deux types comme supervision de dynamique. Sur le benchmark CALVIN ABC-D, HARP-VLA atteint un score moyen de 4,481 tâches consécutives réussies, et enregistre un gain de 7,1 points de pourcentage de taux de succès en conditions réelles par rapport à la meilleure baseline testée. Le problème que résout HARP est structurel pour tout le champ des VLA (Vision-Language-Action models) : les vidéos humaines sont abondantes et bon marché, mais les représentations visuelles qu'on en extrait sont mal alignées avec celles d'un robot, ce qui rend le co-entraînement inefficace voire contre-productif. Les modèles d'action latente existants, comme ceux utilisés dans les travaux sur UniPi ou Genie, réduisaient déjà le gap d'exécution en apprenant des abstractions d'action, mais restaient dépendants de features visuelles non alignées induisant des actions latentes domain-dépendantes. HARP introduit une perte d'alignement par discrimination relative de paires (source-relative pair-discriminative alignment loss) qui adapte les représentations robot vers la sémantique humaine sans effacer la discrimination inter-paires. Pour les intégrateurs et les équipes de recherche en manipulation, c'est un signal concret que le sim-to-real gap peut être partiellement adressé au niveau de la représentation, pas seulement du domaine de simulation. Ce travail s'inscrit dans une lignée de recherches sur l'apprentissage inter-embodiment qui a pris de l'ampleur depuis RT-2 (Google DeepMind, 2023) et OpenVLA (2024), lesquels montraient qu'un pré-entraînement sur données humaines ou web pouvait transférer vers des politiques robotiques. Les approches concurrentes directes incluent Octo, pi-0 de Physical Intelligence, et GR00T N2 de NVIDIA, tous confrontés à la même tension entre généralisation cross-embodiment et performance sur tâches précises. HARP se distingue en n'exigeant que peu de démonstrations appariées, ce qui réduit le coût de collecte de données. L'article reste pour l'instant une publication arXiv sans déploiement industriel annoncé, et les résultats en conditions réelles, bien que positifs, portent sur un nombre limité de configurations de manipulation.

RechercheOpinion
1 source
TIC-VLA : un modèle vision-langage-action (VLA) à raisonnement intégré pour la navigation robotique en environnements dynamiques
3085arXiv cs.RO 

TIC-VLA : un modèle vision-langage-action (VLA) à raisonnement intégré pour la navigation robotique en environnements dynamiques

Des chercheurs de l'UCLA Mobility Lab ont publié fin février 2026 TIC-VLA (Think-in-Control VLA), un framework de contrôle robotique qui adresse explicitement le décalage temporel entre raisonnement sémantique et action en temps réel. Le modèle introduit une interface "delayed semantic-control" : au lieu de supposer que la sortie du module vision-langage est synchrone avec l'action motrice, TIC-VLA conditionne la génération d'action sur des états sémantiques retardés et sur des métadonnées de latence explicites, en plus des observations courantes. Le pipeline d'entraînement, dit "latency-consistent", injecte des délais de raisonnement réels pendant l'apprentissage par imitation et le reinforcement learning en ligne, alignant ainsi les conditions d'entraînement sur celles du déploiement. Pour l'évaluation, l'équipe présente également DynaNav, une suite de simulation physiquement précise et photoréaliste dédiée à la navigation guidée par langage naturel dans des environnements avec présence humaine. Les expériences couvrent à la fois la simulation et un robot réel, avec des latences de raisonnement pouvant dépasser plusieurs secondes. L'enjeu sous-jacent est structural dans le champ des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures dérivées de RT-2 supposent implicitement que l'inférence sémantique et le contrôle moteur sont cadencés de manière cohérente. En pratique, les LLM embarqués dans ces architectures introduisent des délais incompressibles de 0,5 à plusieurs secondes, incompatibles avec une boucle de contrôle à 10-20 Hz dans un environnement dynamique. TIC-VLA propose une solution au niveau de l'architecture plutôt qu'au niveau matériel, ce qui est potentiellement plus portable. Les résultats annoncés indiquent une surperformance systématique par rapport aux VLA antérieurs tout en maintenant un contrôle robuste sous latence. Il faut toutefois noter que les benchmarks proviennent en grande partie de DynaNav, un environnement simulé développé par les auteurs eux-mêmes, ce qui appelle une validation indépendante. La problématique de l'asynchronisme VLA n'est pas nouvelle : des travaux comme GROOT ou des approches à architecture duale (slow planner / fast controller) cherchent à séparer les horizons temporels. TIC-VLA se distingue en modélisant la latence comme un paramètre de condition plutôt qu'en la masquant par une architecture hiérarchique. Le projet est porté par le groupe UCLA Mobility Lab, connu pour ses travaux sur la navigation autonome urbaine. La page projet est accessible, mais aucune annonce de déploiement industriel ou de partenariat commercial n'est mentionnée pour l'instant. Les prochaines étapes naturelles seraient une évaluation sur des plateformes standardisées comme le benchmark Open-X Embodiment, et une confrontation avec des architectures concurrentes sur des tâches de manipulation en environnement mixte homme-robot.

IA physiqueOpinion
1 source
Détection de signaux d'échec dans les trajectoires pour la surveillance en temps réel des modèles VLA
3086arXiv cs.RO 

Détection de signaux d'échec dans les trajectoires pour la surveillance en temps réel des modèles VLA

Une équipe de chercheurs propose Hide-and-Seek (arXiv 2605.30834), un cadre de surveillance en temps réel des modèles VLA (Vision-Language-Action). Ces modèles permettent aux robots d'exécuter des instructions en langage naturel sur des tâches variées, mais ils restent sujets à des défaillances en cours d'exécution difficiles à intercepter. Hide-and-Seek reformule la détection de ces échecs comme un problème d'apprentissage supervisé à granularité grossière : en combinant des objectifs contrastifs inter-trajectoires et intra-trajectoires, il localise les actions responsables d'un échec à partir de labels de trajectoire uniquement, sans annotation pas-à-pas. La méthode a été évaluée sur les benchmarks LIBERO et VLABench ainsi que sur une plateforme robotique réelle, avec trois politiques VLA représentatives : OpenVLA, π₀ et π₀.₅ de Physical Intelligence. Pour les intégrateurs de robots pilotés par VLA, la détection fiable des défaillances en exécution est un prérequis non résolu pour tout déploiement industriel. Les approches existantes ont deux limitations majeures : le rééchantillonnage des actions est trop coûteux en calcul pour la production, et la propagation uniforme de labels de trajectoire à chaque pas de temps efface les signaux d'échec localisés dans le temps. Hide-and-Seek contourne cela en induisant des signaux temporellement structurés sans annotation fine, réduisant le coût d'étiquetage des données d'entraînement. Sous prédiction conforme (conformal prediction, qui offre des garanties statistiques sur le taux de faux positifs), la méthode atteint l'état de l'art en détection multi-tâche avec un compromis praticable entre précision et réactivité, et généralise à des tâches non vues à l'entraînement. Ce travail s'inscrit dans la montée en puissance des VLA depuis 2023-2024, portée par OpenVLA (UC Berkeley), la famille π₀/π₀.₅ de Physical Intelligence et RT-2 de Google DeepMind, et dans la question plus large du "demo-to-deployment gap". À mesure que ces modèles migrent des labos vers les lignes de production, un mécanisme de monitoring devient aussi critique que le modèle lui-même. Les benchmarks académiques utilisés facilitent les comparaisons avec les travaux concurrents, mais ne préjugent pas des performances en environnement industriel réel. La prochaine étape logique est l'intégration de Hide-and-Seek comme couche de supervision dans des pipelines de manipulation ou de déploiement humanoïde, où un échec non détecté peut engendrer des dommages matériels ou des arrêts de ligne coûteux.

IA physiqueOpinion
1 source
Vérificateur d'actions mondiales : modèles du monde auto-améliorés via asymétrie avant-inverse
3087arXiv cs.RO 

Vérificateur d'actions mondiales : modèles du monde auto-améliorés via asymétrie avant-inverse

Des chercheurs ont publié sur arXiv (2604.01985, avril 2026) le cadre World Action Verifier (WAV), une architecture conçue pour permettre aux modèles de monde (world models) de détecter leurs propres erreurs de prédiction et de s'auto-améliorer. Le problème est structurel : ces modèles, utilisés pour évaluer et optimiser des politiques de contrôle robotique, doivent rester fiables sur un vaste espace d'actions sous-optimales, lesquelles sont systématiquement sous-représentées dans les données d'interactions robot étiquetées. WAV répond en décomposant la prédiction d'état conditionnée à l'action en deux facteurs vérifiables indépendamment : la plausibilité d'état et l'accessibilité par l'action. Le système augmente un modèle de monde existant avec un générateur de sous-objectifs entraîné sur des corpus vidéo sans annotations d'action, et un modèle inverse sparse inférant des actions depuis un sous-ensemble réduit de features d'état. Une cohérence cyclique est ensuite imposée entre sous-objectifs proposés, actions inférées et rollouts forward. Sur neuf tâches couvrant MiniGrid, RoboMimic et ManiSkill, WAV atteint une efficacité d'échantillonnage deux fois supérieure et améliore les performances des politiques aval de plus de 22 %. L'intérêt central de l'approche est l'exploitation d'une asymétrie fondamentale : les données vidéo sans annotations sont abondantes et peu coûteuses à collecter, tandis que les données robot étiquetées restent rares et chères. En s'appuyant sur cette asymétrie pour décomposer la vérification, WAV contourne l'un des principaux goulets d'étranglement du model-based RL appliqué à la robotique. Pour les équipes R&D et les intégrateurs, cela signifie moins de démonstrations téléopérées nécessaires pour obtenir des politiques robustes, point critique dans des déploiements industriels où la collecte de données est un frein opérationnel réel. La méthode valide empiriquement une hypothèse souvent posée sans preuve : les vidéos non annotées peuvent servir de supervision indirecte efficace dans la boucle d'apprentissage robotique. Ce travail s'inscrit dans le champ du model-based RL, où DreamerV3 de Google DeepMind constitue la référence principale pour la prédiction d'états latents. Il propose une voie orthogonale aux approches VLA (Vision-Language-Action) dominantes comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la mise à l'échelle massive des corpus de pré-entraînement pour améliorer la généralisation. WAV parie plutôt sur la robustesse intrinsèque du modèle de monde via la vérification interne. À noter : le code et les modèles ne semblent pas encore publiés au moment de la soumission, ce qui positionne ces résultats au stade de la recherche en cours d'évaluation par les pairs, pas d'un outil directement intégrable.

RecherchePaper
1 source
SSR : locomotion humanoïde stable et symétrique étendue au monde ouvert
3088arXiv cs.RO 

SSR : locomotion humanoïde stable et symétrique étendue au monde ouvert

Des chercheurs ont publié fin mai 2026 sur arXiv (preprint 2605.30770) un framework baptisé SSR, pour "Surefooted and Symmetric Robotics", destiné à la locomotion en environnement ouvert pour robots humanoïdes. L'approche est entièrement end-to-end et s'appuie sur la vision égocentrique (caméra embarquée sur le robot) pour guider le placement des pieds en temps réel sur des terrains hétérogènes. Le système a été validé expérimentalement sur escaliers à géométrie variable, plateformes surélevées, passages à larges écarts et parcours outdoor longue distance, des scénarios qui constituent précisément les points de rupture des pipelines classiques de locomotion bipedale. Aucune entreprise commerciale n'est mentionnée : il s'agit d'un travail académique, à ce stade sans déploiement industriel annoncé. SSR apporte trois contributions techniques distinctes. La première, "imagined foothold guidance", consiste à modéliser par anticipation les contacts futurs du pied en phase d'oscillation (swing phase) avant l'atterrissage, orientant le mouvement vers des zones de support stables et réduisant les glissades en bordure d'obstacle, un problème récurrent sur les robots qui réagissent uniquement au contact. La deuxième, une augmentation de symétrie dans l'espace latent par équivariance, force une coordination bilatérale cohérente (gauche-droite) même sous des observations visuelles haute dimension, ce que les méthodes classiques de data augmentation peinent à garantir. La troisième, des discriminateurs de mouvement spécialisés par type de terrain, pousse le robot vers des comportements anthropomorphes contextualisés plutôt qu'une démarche générique. Ces trois mécanismes adressent directement le "demo-to-reality gap" : la locomotion reste stable sans nécessiter de détection terrain explicite ni de carte métrique préétablie. Le problème de traversée en vision égocentrique pour humanoïdes a été abordé ces dernières années par plusieurs axes : les approches model-based (Boston Dynamics Atlas, avec planification explicite), les méthodes RL aveugles (Unitree H1, Agility Robotics Digit), et plus récemment les VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui cherchent à généraliser via des fondations préentraînées. SSR se positionne dans une voie intermédiaire, apprentissage de bout en bout sans modèle de terrain, mais sans large fondation multimodale. L'absence de chiffres de cycle time, de payload ou de taux de succès quantifiés dans l'abstract invite à la prudence avant d'évaluer la portée réelle ; les résultats complets sont dans le papier. Les prochaines étapes naturelles seraient un benchmark comparatif standardisé (type parkour DARPA ou ANYmal) et un pilote sur plateforme commerciale existante.

HumanoïdesPaper
1 source
Dialogue multi-agents à plusieurs tours pour la reconstruction collaborative améliore légèrement les performances des VLM en raisonnement spatial
3089arXiv cs.RO 

Dialogue multi-agents à plusieurs tours pour la reconstruction collaborative améliore légèrement les performances des VLM en raisonnement spatial

Une équipe de chercheurs a publié sur arXiv (identifiant 2605.31387) une étude évaluant les capacités des modèles vision-langage (VLM) dans des tâches de reconstruction collaborative en plusieurs tours de dialogue. Le protocole repose sur un cadre multi-agents où deux VLMs communiquent via le langage pour reconstruire une structure cible à partir d'entrées visuelles et textuelles. Les chercheurs ont testé des modèles open-weight et des modèles propriétaires selon plusieurs paramètres : modalités d'entrée, représentations d'image (entières ou décomposées), et formats de description de la cible. Résultat principal : les VLMs peinent à raisonner spatialement sur des représentations visuelles, et les gains obtenus grâce au dialogue multi-tours restent modestes. Le titre lui-même ne cache pas l'ambivalence : "improves VLM performance... but only barely". Ce résultat est significatif pour les équipes qui intègrent des pipelines VLM ou VLA (Vision-Language-Action) dans des systèmes robotiques. La recherche confirme que la compréhension spatiale visuelle, pourtant centrale pour des robots opérant en environnements non structurés, reste un point faible structurel des VLMs actuels. Fait notable pour les intégrateurs : les représentations textuelles détaillées de la structure cible surpassent systématiquement les représentations purement visuelles, quelle que soit la modalité testée. Autrement dit, pour une tâche d'assemblage collaboratif, une description sémantique structurée s'avère plus fiable que de laisser le modèle interpréter une image de référence. Les représentations d'images décomposées, où la scène est fragmentée en éléments distincts, améliorent les performances mais ne comblent pas l'écart. Ce travail s'inscrit dans un courant de recherche croissant autour des agents VLM pour la robotique collaborative, stimulé par des architectures comme RT-2 de Google DeepMind, Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui font le pari que des VLMs pré-entraînés peuvent généraliser à des tâches robotiques complexes via du fine-tuning ou du prompting. L'étude nuance cet optimisme en exposant les limites actuelles du raisonnement spatial ancré (grounded), particulièrement dans des scénarios de dialogue interactif. Les pistes identifiées incluent l'amélioration des mécanismes de grounding spatial et le raffinement des représentations d'images dans les boucles de dialogue multi-agents, des axes qui intéressent directement les labos travaillant sur la manipulation en environnements non structurés.

RechercheActu
1 source
DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables
3090arXiv cs.RO 

DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables

Des chercheurs ont publié DeMaVLA, un modèle fondation de type Vision-Langage-Action (VLA) conçu pour la manipulation d'objets déformables, en particulier le pliage de vêtements. Annoncé en preprint arXiv (2605.31286, mai 2026), DeMaVLA couple un backbone VLM à un module appelé "action expert" qui génère des trajectoires continues par flow matching. Pour réduire les coûts d'entraînement et d'inférence, cet action expert est construit en élaguant une couche transformer sur deux du backbone, tout en préservant l'alignement entre les deux modules. Le modèle est d'abord pré-entraîné sur environ 5 000 heures de démonstrations bimanuals en conditions réelles, puis affiné via un pipeline DAgger (Data Aggregation) avec supervision humaine : des trajectoires correctives sont collectées à partir des échecs du robot sur plusieurs tâches de pliage, puis réinjectées en entraînement. Les résultats sont compétitifs sur le benchmark RoboTwin et solides sur un benchmark maison de pliage domestique. La plupart des systèmes VLA actuels entraînent des politiques séparées par catégorie d'objet (un réseau pour les t-shirts, un autre pour les pantalons), ce qui limite la généralisation et alourdit la maintenance. DeMaVLA propose une politique unifiée capable de traiter des vêtements de géométries, matières et états initiaux variés sans réentraînement par catégorie, ce qui est directement pertinent pour les intégrateurs en robotique domestique et logistique. Le recours au DAgger avec boucle humaine est aussi un signal industriel : les corrections issues des échecs du robot, structurées et réinjectées, améliorent concrètement la robustesse au-delà des seules démonstrations expertes. Cela valide l'hypothèse que les données correctives à grande échelle sont un levier clé pour réduire le sim-to-real gap sur des tâches à haute variabilité. La manipulation d'objets déformables reste l'un des problèmes ouverts les plus difficiles en robotique physique : contrairement aux objets rigides, un vêtement n'a pas d'état canonique stable, ce qui complique radicalement la planification et la perception. Plusieurs équipes travaillent sur ce terrain : Physical Intelligence avec Pi-0 (manipulation généraliste bimanuels), NVIDIA avec GR00T N2, et divers laboratoires académiques (Columbia, CMU) sur la manipulation textile. DeMaVLA se positionne sur le créneau des fondations multi-tâches déformables, en combinant pré-entraînement à grande échelle et fine-tuning correctif. Ce travail reste un preprint non encore évalué par les pairs, et les benchmarks maisons appellent à une validation indépendante. Les suites naturelles sont l'extension à d'autres objets déformables (câbles, sacs souples) et l'évaluation sur des plateformes robotiques commerciales en environnement non contrôlé.

IA physiqueOpinion
1 source
Pied électro-permanent magnétique à haute densité de charge pour robots quadrupèdes grimpeurs
3091arXiv cs.RO 

Pied électro-permanent magnétique à haute densité de charge pour robots quadrupèdes grimpeurs

Des chercheurs ont présenté un pied magnétique électro-permanent à haute densité de charge pour robots quadrupèdes, capable de grimper sur des surfaces ferromagnétiques verticales, inclinées ou au plafond. Le dispositif, appelé CHN-EPM (Circular Halbach-Net Electro-Permanent Magnet), génère une force d'adhérence maximale supérieure à 1 000 N avec un rapport charge/poids dépassant 200:1. Sa structure exploite un circuit magnétique tridimensionnel avec effet de concentration de flux, ce qui crée des chemins de flux parallèles distribués : concrètement, le système maintient une adhérence efficace même en contact partiel avec la surface, et reste relativement insensible aux variations d'entrefer. Un pilote de magnétisation associé à une stratégie de contrôle du courant impulsionnel en deux étapes régule précisément l'amplitude et la durée d'excitation, tandis qu'un capteur de pression flexible intégré assure un retour d'effort en temps réel pour surveiller les états d'attachement et de détachement. L'ensemble a été intégré sur le robot quadrupède commercial Unitree GO2, démontrant une locomotion stable sur des surfaces peintes, perforées et courbes. Ce résultat est significatif pour plusieurs raisons industrielles. Le rapport 200:1 entre charge utile et poids propre du pied positionne cette technologie bien au-dessus des solutions à ventouses pneumatiques, qui restent dépendantes d'une source d'air comprimé et peinent sur les surfaces irrégulières ou perforées. La boucle de retour de force permet une commutation d'adhérence fiable dans des conditions de contact incertaines, ce qui est directement pertinent pour l'inspection de coques navales, de réservoirs industriels ou de structures métalliques en hauteur. Contrairement aux aimants permanents passifs, le caractère contrôlable de l'EPM permet de switcher entre adhérence et détachement sans consommation d'énergie continue, un avantage opérationnel notable pour les missions longue durée. Les robots quadrupèdes capables de grimper sur des surfaces ferromagnétiques font l'objet d'un intérêt croissant depuis que Boston Dynamics a montré Spot dans des environnements industriels complexes, et que des équipes académiques ont exploré les configurations à ventouses ou à micro-crochets inspirés des geckos. Unitree, constructeur du GO2 utilisé ici, est devenu une plateforme de référence pour la recherche en locomotion avancée grâce à son accessibilité tarifaire. Les approches concurrentes incluent les systèmes à ventouses développés par des équipes coréennes et japonaises, ainsi que les pieds magnétiques passifs, moins agiles en détachement. Les auteurs n'annoncent pas de calendrier de commercialisation ou de déploiement industriel dans cet article de préprint arXiv ; les prochaines étapes logiques seraient une validation sur des géométries complexes réelles et l'intégration dans une boucle de contrôle autonome complète.

RecherchePaper
1 source
PInVerify : un benchmark incarné hors-ligne pour la vérification active d'instances
3092arXiv cs.RO 

PInVerify : un benchmark incarné hors-ligne pour la vérification active d'instances

Des chercheurs publient sur arXiv (référence 2605.30639) PInVerify, un benchmark pour la vérification d'instance active (AIV), tâche dans laquelle un agent embarqué sélectionne activement ses angles d'observation autour d'un objet candidat pour décider s'il correspond à une description textuelle précise, par exemple "floral blanc" contre "rayé blanc". Le dispositif comprend 3 000 épisodes couvrant 18 catégories d'objets, structurés en topologie à six secteurs avec des vues-pièges (positions navigables mais non informatives) et des secteurs inaccessibles. Quatre familles de modèles sont évaluées dans la contrainte embarquée de moins de 8 milliards de paramètres : Qwen3-VL en versions 4B et 8B, SenseNova-SI-1.2-InternVL3-8B, CLIP et SigLIP2. Le meilleur agent basé sur un grand modèle multimodal (MLLM) dépasse la meilleure baseline d'embeddings de 4,9 points de pourcentage, et un agent affiné via LoRA (combinant SFT et GSPO) atteint 85,6 %. Ce travail formalise une lacune documentée mais peu traitée dans la navigation robotique : atteindre la proximité d'un objet cible ne garantit pas la bonne identification de l'instance, problème critique dans des entrepôts ou environnements industriels où des objets visuellement similaires coexistent. L'enjeu est direct pour les intégrateurs de robots mobiles autonomes (AMR) ou de bras manipulateurs qui s'appuient sur des pipelines vision-langage pour le picking. Résultat contre-intuitif : les trois stratégies de sélection du prochain point de vue (NBV, next-best-view) testées ne produisent pas de gains fiables, indiquant que l'exploration active reste un problème ouvert même avec des MLLMs performants. Les ablations sur les boîtes de détection (GT-box) révèlent en outre un écart de +3,1 points, pointant la qualité de détection en amont comme verrou non négligeable. PInVerify s'inscrit dans la lignée des benchmarks d'IA incarnée comme EmbodiedScan ou les suites Habitat de Meta, mais se concentre sur la vérification sémantique fine plutôt que sur la navigation globale. Les modèles retenus pour l'évaluation proviennent quasi exclusivement d'acteurs asiatiques (Qwen3 d'Alibaba, SenseNova de SenseTime), GPT-4V et Gemini étant absents du banc de test, ce qui limite la portée comparative. Le code est publié en open source sur GitHub, positionnant PInVerify comme potentielle référence commune pour les équipes travaillant sur les agents VLA (Vision-Language-Action) à déploiement embarqué, avec comme prochaines étapes identifiées l'amélioration des stratégies NBV et l'extension vers des scènes dynamiques.

RecherchePaper
1 source
Any-ttach : le remplacement rapide d'effecteurs finaux améliore la dextérité de manipulation
3093arXiv cs.RO 

Any-ttach : le remplacement rapide d'effecteurs finaux améliore la dextérité de manipulation

Publiés le 30 mai 2026 sur arXiv (2506.30569), des chercheurs présentent Any-ttach, un système de manipulation robotique qui renonce à la complexité des mains multi-doigts au profit d'un mécanisme de swap rapide d'effecteurs terminaux. Le système repose sur trois composants : un mécanisme d'échange automatique bas coût pour une interface robotique à ouverture/fermeture, un dispositif portatif pour collecter des démonstrations humaines, et un planificateur de tâches qui compose des compétences d'utilisation d'outils apprises, paramétriques et planifiées. L'interface unifiée supporte une gamme hétérogène d'effecteurs, outils du quotidien, ciseaux articulés, doigts Fin Ray et une main anthropomorphe bas coût, tous connectés via le même connecteur. En validation, le système exécute deux tâches longue durée : préparer un sandwich et couper un concombre, chacune décomposée en six sous-tâches avec changements d'effecteurs successifs. L'intérêt industriel réside dans le changement de paradigme proposé : là où la roadmap dominante mise sur des mains à 20+ degrés de liberté pour atteindre la dextérité humaine, Any-ttach montre qu'une capacité d'échange rapide d'outils peut produire une polyvalence fonctionnelle comparable à un coût matériel et logiciel nettement inférieur. Les auteurs rapportent une meilleure fiabilité de swap, une collecte de démonstrations plus efficace et une moindre variabilité de pose d'outil, trois métriques directement pertinentes pour un intégrateur souhaitant déployer sans ingénierie robotique lourde. L'approche reste toutefois un preprint sans validation en environnement industriel réel, et les tâches démontrées (cuisine domestique) sont loin des contraintes d'une ligne de production. L'article s'inscrit dans un débat plus large sur la morphologie optimale du robot manipulateur. Des acteurs comme Sanctuary AI, Apptronik ou encore Pollen Robotics (FR) investissent massivement dans des mains dextres haute fidélité, tandis que Boston Dynamics et ses pairs industriels restent attachés aux pinces simples. Any-ttach occupe un espace intermédiaire, proche dans l'esprit des systèmes à changement d'outil rapide des robots industriels (ISO 9283), mais étendu à la manipulation non structurée. Les prochaines étapes selon les auteurs sont disponibles sur le site dédié any-ttach.github.io ; aucun partenaire industriel ni timeline de commercialisation n'est mentionné.

IA physiquePaper
1 source
EBuddy : orchestrateur de flux de travail pour la collaboration homme-machine industrielle
3094arXiv cs.RO 

EBuddy : orchestrateur de flux de travail pour la collaboration homme-machine industrielle

EBuddy est un orchestrateur de procédures guidé par la voix, présenté dans un article de recherche publié sur arXiv (2603.28579, 2026), conçu pour la collaboration humain-machine dans les environnements industriels outillés. Le système repose sur une machine à états finis (FSM) : à chaque instant, l'opérateur dispose d'un cadre décisionnel explicite (état courant et actions admissibles), ce qui contraint l'interprétation des commandes vocales à des transitions cohérentes et réduit les ambiguïtés inhérentes au langage naturel. Via reconnaissance automatique de la parole (ASR) et compréhension d'intention, EBuddy pilote des ressources hétérogènes incluant des logiciels à interface graphique et un robot collaboratif (cobot), en interaction purement vocale. Un pilote industriel porte sur l'inspection de pales d'impulseur et la préparation de programmes de réparation par dépôt direct d'énergie (DED, procédé d'additive manufacturing adapté à la remise en état de pièces à haute valeur), exécutés en collaboration humain-robot. Les auteurs rapportent des réductions "substantielles" de la durée de bout en bout sur l'onboarding des opérateurs, le scan 3D, le traitement des données et la génération de programmes de réparation. Aucune métrique chiffrée précise n'est publiée dans l'abstract disponible, ce qui invite à réserver le jugement aux résultats complets. La problématique ciblée est structurelle dans la maintenance industrielle : le savoir-faire expert est efficace mais peu scalable, et la qualité d'exécution se dégrade quand les procédures sont reconstituées ad hoc d'un opérateur ou d'une session à l'autre. En encapsulant ce savoir dans des artefacts de workflows modulaires, EBuddy réduit la dépendance aux experts terrain et abaisse la courbe d'apprentissage à l'onboarding. L'architecture FSM offre un avantage décisif sur les pipelines LLM non contraints : en bornant l'espace des actions valides à chaque état, elle limite les hallucinations et les erreurs d'interprétation, critique lorsqu'une mauvaise commande peut endommager une pièce coûteuse ou désynchroniser un cobot. Pour les intégrateurs et les décideurs B2B, c'est une démonstration que l'interface vocale peut piloter un cobot en production réelle, à condition d'être ancrée dans un modèle formel de la procédure plutôt que dans un LLM généraliste non contraint. La recherche en orchestration humain-robot par la voix s'inscrit dans un mouvement plus large porté par les VLA (Vision-Language-Action models) et les assistants multi-modaux pour la robotique industrielle. Des approches concurrentes existent côté académique (ETH Zurich et Carnegie Mellon sur la planification de tâches par LLM) et côté industrie, notamment Universal Robots avec son écosystème URCap et Covariant avec son interface de manipulation. Du côté français, Enchanted Tools, avec son robot Miroki centré sur l'interaction naturelle, travaille un espace adjacent. EBuddy se distingue par son accent mis sur la contrainte formelle de l'espace d'actions et par son application au cas d'usage maintenance/repair, moins exploré que l'assemblage ou la logistique. Les prochaines étapes logiques incluent la publication des métriques complètes du pilote et l'extension du système à d'autres procédures DED ou à de nouveaux environnements de production.

IndustrielPaper
1 source
TAGA : une approche réactive basée sur les tangentes pour la navigation socialement acceptable des robots autour des groupes humains
3095arXiv cs.RO 

TAGA : une approche réactive basée sur les tangentes pour la navigation socialement acceptable des robots autour des groupes humains

Des chercheurs ont publié sur arXiv (réf. 2503.21168) TAGA (Tangent Action for Group Avoidance), une couche de navigation modulaire conçue pour que les robots mobiles contournent non seulement les individus, mais aussi les groupes sociaux constitués dans les espaces publics. L'algorithme détecte les limites implicites d'un groupe humain via des manœuvres tangentielles et les transmet à un contrôleur hiérarchique qui coordonne l'évitement de groupe avec la prévention classique des collisions individuelles, sans modifier la politique de navigation sous-jacente. Pour évaluer la conformité sociale au-delà des métriques terminales binaires (succès/échec), les auteurs introduisent le Group Crossing Rate (GCR), une métrique continue mesurant la fraction de pas de temps pendant lesquels le robot se trouve à l'intérieur du hull convexe d'un groupe. Les tests se basent sur un benchmark de simulation reproduisant cinq comportements empiriquement documentés : hétérogénéité des vitesses individuelles, couplage de vitesse intra-groupe, formations en F statiques, dynamiques leader-suiveur, et limites de hulls convexes, le tout évalué sous les modèles piétons ORCA et Social Force. Les résultats révèlent une asymétrie entre approches réactives classiques et politiques apprises : TAGA apporte jusqu'à 8 points de pourcentage de gain en taux de succès et divise par deux le GCR pour les baselines réactives type ORCA et Social Force, avec un surcoût quasi nul pour les politiques apprises comme DS-RNN ou Intention-RL. Ce résultat est actionnable pour les intégrateurs : il indique précisément quand ajouter un module de conscience de groupe par-dessus un planificateur existant est rentable, versus quand un entraînement end-to-end intégrant les groupes dès le départ est préférable. Pour les déploiements en milieu hospitalier, aéroportuaire ou retail, où la perception de la robotique par les usagers pèse autant que la performance brute, réduire les intrusions dans les bulles sociales représente un levier opérationnel concret. La navigation socialement conforme (socially-aware navigation) est un axe de recherche actif depuis les travaux fondateurs sur le Social Force Model de Helbing et Molnár (1995) et les travaux ORCA de Van Den Berg. TAGA s'inscrit dans une tendance récente qui vise à séparer les préoccupations sociales et cinématiques plutôt qu'à tout fusionner dans un unique réseau de bout en bout. Des approches concurrentes incluent les travaux de Crowd-Nav, SARL, et les politiques RLSS. L'absence de validation sur robot réel reste la limite principale de cette publication académique. Les prochaines étapes logiques seront un test sur plateforme physique (AMR de type Clearpath ou Boston Dynamics Spot) et une intégration avec des stacks ROS2 standard.

RecherchePaper
1 source
Main dextérique ARISTO : hyperextension distale par capteurs pour une manipulation précise
3096arXiv cs.RO 

Main dextérique ARISTO : hyperextension distale par capteurs pour une manipulation précise

Des chercheurs ont présenté la ARISTO Hand, une main robotique à tendons conçue pour manipuler des objets fins, capacité que la plupart des mains anthropomorphes maîtrisent mal. L'architecture combine deux innovations : une hyperextension distale active, permettant aux phalanges de dépasser les limites cinématiques standard de flexion, et un système de perception hybride au niveau des doigts, composé d'un capteur force-couple rigide monté sur un ongle artificiel et d'un réseau tactile capacitif souple. L'hyperextension active augmente la force d'extraction de 2,76 fois pour des objets d'épaisseur de 1 à 20 mm, tout en conservant les capacités de préhension nominales. La validation porte sur une tâche multi-étapes d'extraction et d'insertion d'une carte SD, benchmark délibérément exigeant impliquant des contacts précis sur les bords d'un objet de quelques millimètres. L'intérêt de cette conception tient à la combinaison ciblée de deux problèmes distincts. La manipulation d'objets minces génère des contacts en bord de doigt qui dégradent la précision de l'estimation de force par proprioception, précisément parce que la géométrie de contact approche des singularités cinématiques : le capteur rigide sur l'ongle contourne cette limitation en mesurant la force directement à son point d'application. Par ailleurs, la plupart des mains anthropomorphes sont optimisées pour la préhension en puissance ou en précision, mais pas pour glisser sous un objet posé à plat, ce que l'hyperextension distale résout mécaniquement sans sacrifier la polyvalence du préhenseur. La publication n'indique cependant ni taux de succès ni cadence opérationnelle, ce qui rend difficile l'évaluation de la robustesse hors conditions de laboratoire. La ARISTO Hand s'inscrit dans une dynamique de recherche active sur les mains dextres pour la manipulation fine. Des acteurs comme Shadow Robotics, Wonik Robotics (ALLEGRO Hand) ou Dexterous Robotics développent des architectures similaires à tendons, tandis que des laboratoires comme Stanford BDML ou MIT CSAIL explorent l'intégration de capteurs tactiles souples. La spécificité de l'ARISTO Hand réside dans l'association de la mécanique d'hyperextension, peu commune dans le domaine, avec une architecture sensorielle à deux modalités complémentaires qui se renforcent mutuellement. Les travaux sont disponibles sur arXiv (2605.30508) et sur aristohand.github.io ; aucun partenariat industriel ni calendrier de déploiement n'est mentionné à ce stade.

RecherchePaper
1 source
VLM-GLoc : localisation globale sémantique robuste par Monte Carlo enrichi d'un modèle vision-langage dans des environnements encombrés quasi-statiques
3097arXiv cs.RO 

VLM-GLoc : localisation globale sémantique robuste par Monte Carlo enrichi d'un modèle vision-langage dans des environnements encombrés quasi-statiques

Des chercheurs présentent VLM-GLoc, une méthode de localisation globale pour robots mobiles qui intègre des modèles vision-langage (VLM) à vocabulaire ouvert au sein d'un pipeline Monte Carlo Localization (MCL) hiérarchique. Publiés sur arXiv (2605.30506), les résultats portent sur deux environnements réels : une épicerie de 325 m² et un laboratoire de 344 m², testés avec deux plateformes distinctes, un smartphone et un robot quadrupède. Sur ces bancs d'essai, VLM-GLoc atteint respectivement 70 % et 74 % de succès en localisation globale, surpassant nettement les baselines géométriques classiques et les pipelines visuels spécialisés au domaine. Le verrou adressé est concret : dans un entrepôt ou un couloir d'hôpital, les capteurs LiDAR et les descripteurs géométriques butent sur l'aliasing, c'est-à-dire l'incapacité à distinguer des espaces structurellement similaires. VLM-GLoc contourne ce problème en substituant les descripteurs spécialisés par un VLM à vocabulaire ouvert, capable de produire des représentations textuelles riches pour chaque observation caméra. L'innovation principale est un mécanisme de "proposition sémantique inverse" : plutôt que d'initialiser les particules MCL de façon aléatoire, le système les amorce via une requête texte-vers-carte, accélérant la convergence dans des espaces larges. Le VLM joue également un rôle de filtre implicite sur les objets flous ou transitoires, et intègre un raisonnement sur la permanence des éléments pour guider l'augmentation de données. La localisation Monte Carlo est une technique éprouvée depuis les années 2000, mais son couplage avec des VLMs à vocabulaire ouvert reste récent. Les approches concurrentes incluent NetVLAD, SuperPoint/SuperGlue pour la reconnaissance de lieu, et les méthodes de localisation neurale à base de NeRF. L'avantage opérationnel de VLM-GLoc réside dans l'absence d'apprentissage supervisé spécifique au domaine, ce qui facilite le déploiement sur de nouveaux sites sans retraining coûteux. Les taux de 70-74 % demeurent cependant insuffisants pour des applications industrielles critiques : les auteurs ne précisent ni les conditions d'échec ni les marges d'erreur de position acceptées, ce qui invite à la prudence avant tout passage en production. La prochaine étape naturelle serait une validation dans des environnements plus dynamiques et avec des VLMs de dernière génération.

RecherchePaper
1 source
Apprentissage par renforcement conditionné par objectif et informé par la physique sous dynamique de contact hybride
3098arXiv cs.RO 

Apprentissage par renforcement conditionné par objectif et informé par la physique sous dynamique de contact hybride

Des chercheurs ont publié sur arXiv (réf. 2605.30503) une analyse critique des méthodes de GCRL physico-informé (Pi-GCRL) appliquées à la manipulation robotique en contact, accompagnée de deux nouvelles formulations architecturales pour corriger leurs limites. Le GCRL (goal-conditioned reinforcement learning) vise à entraîner des agents capables d'atteindre des objectifs arbitraires à partir d'un signal de récompense rare, en apprenant une notion générale d'accessibilité dans l'espace état-but. Les approches Pi-GCRL enrichissent cette idée en injectant des biais inductifs issus de la commande optimale dans l'apprentissage de la fonction de valeur. L'article montre que, dès lors que les dynamiques deviennent hybrides, c'est-à-dire discontinues lors de transitions de contact, ces biais, appliqués naïvement, dégradent la performance : les paysages de valeur deviennent non-lisses, la contrôlabilité dépend du mode de contact actif, et les hypothèses de régularité sous-jacentes aux méthodes Pi-GCRL ne tiennent plus. L'enjeu est structurel pour la robotique de manipulation industrielle. La quasi-totalité des tâches réelles, assemblage, insertion, saisie d'objets déformables, impliquent des contacts intermittents qui créent précisément ces dynamiques hybrides. Jusqu'ici, Pi-GCRL avait démontré sa robustesse sur la navigation et le goal-reaching sans contact, mais son extension aux tâches de manipulation restait une question ouverte. Ce travail répond en quantifiant rigoureusement l'échec et en proposant deux correctifs : une formulation contact-aware qui adapte les biais inductifs au mode de contact détecté, et une formulation hiérarchique qui décompose le problème de manipulation en sous-problèmes à dynamiques plus régulières. Ces contributions ouvrent une voie méthodologique précise, distincte des approches VLA (vision-language-action) et sim-to-real classiques qui dominent actuellement les annonces industrielles. Le contexte est celui d'une compétition intense dans l'apprentissage pour la manipulation : DeepMind avec RoboCAT, Physical Intelligence avec pi0, Google avec RT-X, et des dizaines de labos universitaires cherchent à franchir le fossé démo-vers-réalité. Pi-GCRL représente une ligne de recherche distincte, héritée des travaux en commande optimale et en GCRL (Andrychowicz, Plappert et al., 2017 et suivants), qui mise sur la structure mathématique du problème plutôt que sur la puissance brute des données. Ce preprint est une contribution académique sans déploiement annoncé ni partenaire industriel identifié ; les suites probables sont des benchmarks sur des environnements contact-rich standardisés (MuJoCo, IsaacGym) et une éventuelle extension aux robots à plusieurs points de contact.

RecherchePaper
1 source
Haptic Sorter : un cadre de planification unifié pour l'estimation de forme en ligne et l'inférence de pose en temps réel
3099arXiv cs.RO 

Haptic Sorter : un cadre de planification unifié pour l'estimation de forme en ligne et l'inférence de pose en temps réel

Une équipe de chercheurs a publié sur arXiv (ref. 2605.31352) un framework unifié baptisé Haptic Sorter, conçu pour permettre à un robot manipulateur d'estimer la forme et la pose d'un objet inconnu en temps réel, uniquement par le toucher, sans modèle géométrique préalable. Le système repose sur trois briques techniques : l'Optimisation Bayésienne (BO) pour guider l'exploration haptique et inférer la forme de l'objet via des superellipses (courbes paramétriques capables d'approximer une large famille de géométries 2D), une formulation adaptative du potentiel de manipulation encodant la géométrie estimée pour des interactions quasi-statiques, et une Équation Différentielle Ordinaire (ODE) résolue en ligne pour mettre à jour la pose de l'objet en temps réel à partir des retours tactiles et des prédictions du modèle. Le tout a été validé sur une tâche de tri 2D, en simulation et sur un setup réel multi-bras, avec plusieurs géométries d'objets testées. L'intérêt industriel est direct : la grande majorité des systèmes de manipulation robotique actuels supposent que la forme et la pose de l'objet sont connues a priori, ce qui rend ces systèmes fragiles dès que l'on sort du cadre structuré de la ligne de production. La perception visuelle, omniprésente dans les cellules pick-and-place contemporaines, est vulnérable aux occultations et aux incertitudes de calibration. Haptic Sorter propose une alternative ou un complément : le robot sonde activement l'objet, construit un modèle géométrique à la volée, et ajuste sa stratégie de saisie sans intervention humaine. Pour un intégrateur travaillant sur des flux logistiques avec des références variables, cette capacité d'adaptation sans reprogrammation est un argument concret. Le domaine de la perception haptique robotique est actif mais encore fragmenté : la plupart des travaux antérieurs traitent séparément l'exploration tactile, la reconstruction de forme, et la planification de manipulation. Des groupes comme ceux de l'ETH Zurich, de l'MIT CSAIL ou du Stanford AI Lab ont développé des approches partielles, mais rarement intégrées dans un pipeline bout-en-bout opérationnel. Haptic Sorter tente cette intégration avec des outils mathématiques classiques (BO, ODE) plutôt que des réseaux de neurones, ce qui le rend plus interprétable et potentiellement plus robuste en dehors de la distribution d'entraînement. La prochaine étape naturelle serait l'extension à la manipulation 3D et l'intégration avec des capteurs de force-couple commerciaux comme ceux d'ATI ou de Robotiq.

RecherchePaper
1 source
Commande adaptative à retard artificiel avec contraintes barrière de Lyapunov pour robots Euler-Lagrange
3100arXiv cs.RO 

Commande adaptative à retard artificiel avec contraintes barrière de Lyapunov pour robots Euler-Lagrange

Une équipe de chercheurs a déposé en mai 2026 sur arXiv (réf. 2605.31405) un cadre de contrôle adaptatif pour robots de type Euler-Lagrange, combinant deux techniques jusqu'alors rarement intégrées : l'estimation par retard temporel artificiel (Time-Delay Estimation, TDE) et les fonctions de Lyapunov à barrière (Barrier Lyapunov Function, BLF). Le problème ciblé est double : compenser en temps réel les incertitudes dynamiques dépendantes de l'état sans modèle a priori, tout en maintenant les états du robot, position et vitesse, à l'intérieur de bornes variables dans le temps. Les expériences ont été conduites sur un manipulateur à cinq degrés de liberté (5-DOF), et les auteurs rapportent une meilleure adhérence aux contraintes de sécurité par rapport aux méthodes de référence sous incertitudes dynamiques. L'apport technique central est la dérivation analytique d'une borne supérieure dépendant de l'état sur l'erreur d'approximation du TDE, là où la littérature existante se limite généralement à des bornes constantes, souvent trop conservatives. Une loi d'adaptation estime ces paramètres en ligne, ce qui dispense entièrement le contrôleur de toute identification préalable du modèle du robot. Le BLF intégré garantit que position et vitesse ne franchissent jamais les limites prescrites, une propriété critique pour les applications en collaboration humain-robot ou chirurgicale. La stabilité est prouvée formellement par analyse de Lyapunov, ce qui distingue cette approche des méthodes purement data-driven en apprentissage par renforcement, pour lesquelles les garanties formelles restent difficiles à établir. Pour un intégrateur ou un bureau d'études, cela ouvre la voie à un contrôleur certifiable sans phase d'identification, déployable en principe sur des cobots standards. Le TDE est une technique établie depuis les années 1990, largement utilisée pour les manipulateurs redondants et les exosquelettes, mais sa fusion avec un mécanisme de contraintes via BLF reste un sujet de recherche actif. Des groupes en Corée du Sud et à Hong Kong publient des travaux dans des directions proches. Ce preprint n'a pas encore été évalué par les pairs et n'est associé à aucun produit commercialisé ni déploiement industriel annoncé ; les extensions naturelles porteraient sur des systèmes à dynamique plus élevée, des robots à câbles ou des plateformes sous-actionnées, ainsi qu'une validation à plus grande échelle pour consolider les résultats.

RecherchePaper
1 source