Aller au contenu principal

Actualités robotique — page 69

4 565 articles au fil, du plus récent au plus ancien.

Mémoire spatiale pour la manipulation hors champ de vision dans les modèles VLA
3401arXiv cs.RO 

Mémoire spatiale pour la manipulation hors champ de vision dans les modèles VLA

Une équipe de chercheurs a publié en mai 2026 (arXiv:2605.22283) SOMA, un framework de mémoire spatiale conçu pour résoudre un angle mort structurel des modèles Vision-Language-Action (VLA) : leur incapacité à manipuler des objets hors du champ visuel. Le système s'appuie sur une caméra de tête mobile pour acquérir des observations multi-vues, qu'il agrège en une représentation spatiale et sémantique persistante. SOMA repose sur trois modules : une construction de mémoire spatiale par balayage angulaire, un raffinement dynamique pour maintenir la cohérence globale au fil du temps, et une récupération contextuelle qui active les indices spatiaux pertinents à l'instruction en cours d'exécution. Les chercheurs l'ont évalué sur cinq tâches réelles de manipulation hors champ, incluant des scénarios multi-étapes et à deux bras où les objets cibles sont initialement invisibles. Les résultats montrent une amélioration du taux de succès, une localisation plus rapide des cibles, moins de recherche de point de vue, et un comportement proche du "one-shot grasping" en conditions d'observabilité partielle. Des expériences complémentaires sur les benchmarks RoboCasa GR1 et SimplerEnv confirment l'efficacité du design mémoire en contexte pleinement observable. Ce travail s'attaque à un verrou souvent ignoré dans la littérature VLA : l'hypothèse implicite que tous les objets pertinents sont dans le champ de vision au moment de l'action. Cette hypothèse rend les systèmes actuels fragiles dès qu'on sort des configurations de démonstration. Le fait que SOMA induise des comportements qualitativement différents, et non de simples gains de score, est notable : une localisation en quasi-une-passe sous observabilité partielle est un résultat concret pour tout intégrateur robotique travaillant en environnement non structuré. Cela suggère que la mémoire spatiale persistante peut s'ajouter comme couche modulaire à un VLA existant, sans refonte complète de l'architecture, ce qui abaisse le seuil d'adoption. Les VLAs ont émergé comme approche dominante en robotique de manipulation depuis fin 2023, portés par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et OpenVLA issu de Stanford et Berkeley. Ces modèles héritent de l'architecture vision-langage mais restent fondamentalement réactifs : ils traitent un flux visuel instantané sans mémoire de scène. Des travaux parallèles sur la mémoire épisodique existent en navigation mobile (méthodes SLAM-like, NeRF tactique), mais leur intégration dans des pipelines VLA de manipulation reste peu explorée. SOMA comble ce gap sur une plateforme à bras réel. Le code n'est pas encore disponible au moment de la publication, ce qui limite la reproductibilité immédiate ; son déploiement sur d'autres plateformes humanoïdes, au-delà de GR1, constituera l'étape de validation industrielle clé.

RechercheOpinion
1 source
SONIC : un système de suivi du mouvement étendu pour le contrôle corporel intégral des humanoïdes
3402arXiv cs.RO 

SONIC : un système de suivi du mouvement étendu pour le contrôle corporel intégral des humanoïdes

Des chercheurs présentent SONIC (arXiv:2511.07820), un modèle fondateur pour le contrôle corporel complet de robots humanoïdes, construit autour d'une mise à l'échelle agressive le long de trois axes : la capacité réseau (de 1,2 million à 42 millions de paramètres), le volume de données (plus de 100 millions de frames issues de 700 heures de capture de mouvement) et le calcul (21 000 heures GPU). La tâche centrale est le suivi de mouvement (motion tracking), utilisé comme proxy d'entraînement pour inculquer des priors sur le mouvement humain sans ingénierie manuelle de récompenses. Deux applications aval sont démontrées : un planificateur cinématique temps réel reliant le suivi de mouvement à des tâches de navigation, et un espace de tokens unifié permettant à une seule politique de gérer à la fois la téléopération VR et des modèles vision-langage-action (VLA). Dans ce second mode, le système réalise de la loco-manipulation autonome en coordonnant simultanément position des mains et des pieds. L'apport principal est d'étendre les lois de scaling, jusqu'ici réservées aux grands modèles de langage, au contrôle humanoïde à corps complet. Les auteurs montrent que les performances progressent de manière régulière avec la quantité de données et le calcul, et que les politiques apprises généralisent à des mouvements non vus à l'entraînement, sans nécessiter de reward shaping manuel. Pour les intégrateurs, l'interface unifiée VR-VLA dans un seul modèle réduit le coût d'adaptation entre téléopération humaine et autonomie. Il convient néanmoins de noter qu'il s'agit d'une publication académique, non d'un produit déployé, et que les démonstrations vidéo sélectionnées ne permettent pas encore d'évaluer la robustesse en conditions industrielles réelles. SONIC s'inscrit dans une course au scaling qui agite l'ensemble de la filière humanoïde. Physical Intelligence a publié Pi-0, un modèle VLA polyvalent ; NVIDIA a lancé GR00T N2 en s'appuyant sur des données synthétiques massives ; Figure et Tesla visent des architectures propriétaires à grande échelle avec Optimus Gen 3. Les 42 millions de paramètres de SONIC restent modestes comparés aux VLA les plus ambitieux, et le travail ne mentionne pas d'affiliation à un fabricant de robot ni de calendrier de déploiement physique. La prochaine étape logique serait une validation sur hardware réel avec des évaluations quantitatives standardisées, un exercice que les benchmarks émergents du secteur commencent tout juste à formaliser.

IA physiqueOpinion
1 source
Des politiques de mouvement géométrique sûres et pilotables pour la manipulation dextérique robotique
3403arXiv cs.RO 

Des politiques de mouvement géométrique sûres et pilotables pour la manipulation dextérique robotique

Des chercheurs de Stanford (TML, Tamara Manipulation Lab) ont publié sur arXiv (arXiv:2605.21811) un cadre mathématique baptisé SafePBDS (Safe Pullback Bundle Dynamical Systems) destiné à la manipulation dextre robotique. Le système opère sur des espaces géométriques hétérogènes simultanément : une configuration en R^7 pour le bras, des poses d'effecteur en SE(3), et des marges d'évitement d'obstacles en R. Validé sur une plateforme Franka Panda avec main Allegro à 23 degrés de liberté, SafePBDS atteint 92,5 % de succès sur 120 essais de saisie couvrant 20 objets du quotidien. Une interface d'action permet en outre d'exclure n'importe quel doigt de la préhension via une action unidimensionnelle, avec 94,4 % de succès en saisie à trois doigts sur 36 essais. Plus significatif encore : les auteurs revendiquent la première réorientation in-hand palm-down entièrement actionnée et basée sur un modèle, atteignant plus de 360° de rotation en lacet dans les deux sens, sous différents poids d'objet et mouvements de poignet. La contribution centrale de SafePBDS est double. D'abord, une construction de "pullback control barrier function" qui convertit les conditions de sécurité définies sur n'importe quelle variété tâche en contraintes linéaires sur les accélérations en espace de configuration, ce qui permet des garanties de sécurité certifiables, pas seulement empiriques. Ensuite, une interface d'action qui laisse une politique de haut niveau (un VLA, un planificateur, un opérateur humain) injecter des résidus de mouvement de faible dimension, sans jamais violer les contraintes de sécurité. Entrée nulle = comportement autonome préservé. Ce découplage entre planification stratégique et contrôle précis répond à un problème récurrent des architectures VLA : la difficulté à garantir formellement la sécurité physique lors de la phase d'exploration en monde réel. Le travail s'inscrit dans une tradition de dynamical systems pour la manipulation, prolongeant des approches comme les DS-based motion policies de l'EPFL et les travaux de Riemannian motion policies (RMP). Les concurrents directs incluent les méthodes d'apprentissage par imitation avec contraintes CBF (type Berkeley Humanoid, Physical Intelligence pi0) et les architectures modèle-libre qui sacrifient les garanties formelles à la généralisation. SafePBDS reste pour l'instant un résultat de laboratoire sur preprint non relu par les pairs, validé en simulation et sur banc de test mono-robot. Les prochaines étapes annoncées pointent vers l'intégration avec des politiques d'apprentissage de haut niveau et la généralisation à d'autres morphologies de mains.

RecherchePaper
1 source
Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur
3404arXiv cs.RO 

Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur

Des chercheurs ont déposé en mai 2026 sur arXiv (arXiv:2605.22021) un framework de manutention dual-bras conçu pour la manipulation industrielle de colis dont la masse et le centre de masse sont inconnus à l'avance. Le système s'appuie sur deux composants couplés : une estimation en temps réel des propriétés inertielles de l'objet à partir des torseurs de contact mesurés (forces et moments aux points de préhension), et un optimiseur convexe de type SOCP (second-order cone program, programme conique du second ordre) qui calcule des forces de contact compatibles avec les contraintes de friction, modélisées par des surfaces limites ellipsoïdales. Une étape de raffinement de trajectoire hors-ligne complète le pipeline pour éviter les contacts indésirables entre l'objet et l'environnement en présence de contraintes géométriques. Les expériences ont été réalisées sur un robot dual-bras réel soumis à plusieurs configurations de centre de masse, sans connaissance préalable des propriétés inertielles. L'enjeu est direct pour les intégrateurs en logistique industrielle : les bras robotiques doivent manipuler des colis dont le contenu varie (masse, répartition du poids, centre de gravité décentré), et les approches classiques génèrent glissements, chutes, déviations d'orientation ou serrage excessif endommageant les produits. La contribution principale est de traiter la faisabilité de friction comme une contrainte dure plutôt qu'un objectif de régulation séparé à calibrer, unifiant ainsi slip avoidance et évitement de l'écrasement dans un seul problème d'optimisation. Pour un responsable de ligne de palettisation, cela signifie moins de paramétrage manuel à chaque changement de référence produit et une meilleure robustesse aux variabilités de conditionnement, deux points de friction concrets dans les déploiements actuels. La manipulation dual-bras d'objets à propriétés inertielles inconnues est un problème ouvert depuis plusieurs années, adressé par des approches allant du contrôle en force classique jusqu'à l'apprentissage par renforcement. Plusieurs acteurs commerciaux proposent des cellules dual-bras pour la logistique : ABB avec le YuMi, Fanuc, et des startups comme Apptronik ou Figure AI qui intègrent des manipulateurs dans des plateformes humanoïdes. Ce travail reste au stade de la publication académique en preprint, sans affiliation commerciale identifiée, sans données de cycle time ni de volume de déploiement. Les expériences décrites constituent une preuve de concept sur système réel plutôt qu'un déploiement industriel, et les suites naturelles seraient l'intégration dans des cellules de palettisation ou de dépalettisation automatisées, un marché en forte croissance porté par la pression logistique de l'e-commerce.

RecherchePaper
1 source
SE3Kit : une bibliothèque Python légère pour les primitives géométriques spécialisées en robotique
3405arXiv cs.RO 

SE3Kit : une bibliothèque Python légère pour les primitives géométriques spécialisées en robotique

Une équipe de chercheurs a publié SE3Kit sur arXiv (identifiant 2605.22633), une bibliothèque Python légère dédiée aux opérations géométriques sur les groupes de Lie SE(3) (groupe euclidien spécial, qui encode rotations et translations rigides en 3D) et SO(3) (groupe orthogonal spécial, rotations pures). L'implémentation est entièrement en Python pur avec NumPy comme unique dépendance, sans recours à des frameworks de deep learning ni à des outils de visualisation. Les cas d'usage ciblés sont le déploiement embarqué (systèmes à ressources contraintes), le prototypage rapide et l'enseignement de la robotique. L'écosystème Python de robotique souffre d'un vide bien documenté : les bibliothèques existantes tombent dans deux catégories extrêmes. D'un côté, SpatialMath et PyPose offrent de la rigueur mathématique mais embarquent des dépendances lourdes (PyTorch pour PyPose, notamment) qui les rendent inadaptées aux contextes embarqués ou à l'enseignement. De l'autre, SciPy fournit des outils génériques de rotation sans sémantique robotique explicite ni opérations natives sur les algèbres de Lie. SE3Kit vise l'espace intermédiaire : une implémentation stricte des opérations de groupe (exponentielle, logarithme, adjoint, interpolation géodésique) sans surcoût logiciel. Pour un intégrateur travaillant sur un bras manipulateur ou un système de navigation, cela signifie pouvoir utiliser des primitives mathématiquement correctes sur un microcontrôleur ou dans un notebook pédagogique sans installer un stack complet. La publication arrive dans un contexte où la fragmentation des outils de transformation en robotique Python est un frein récurrent, notamment pour les équipes qui passent de la simulation (ROS/Gazebo, souvent C++) vers des pipelines Python embarqués. SE3Kit n'est pas le premier à tenter ce positionnement : la bibliothèque transforms3d de Matthew Brett et pytransform3d de Alexander Fabisch couvrent un périmètre similaire, mais avec des niveaux variables de rigueur sur les groupes de Lie. La valeur différenciante annoncée de SE3Kit est l'absence totale de dépendances non-NumPy, ce qui reste à vérifier sur des benchmarks indépendants. Aucun déploiement industriel ni partenariat n'est mentionné dans la publication ; il s'agit pour l'instant d'une contribution académique en phase d'annonce.

RechercheOpinion
1 source
EvoScene-VLA : croyances de scène évolutives dans le décodeur d'action pour un contrôle robot par blocs
3406arXiv cs.RO 

EvoScene-VLA : croyances de scène évolutives dans le décodeur d'action pour un contrôle robot par blocs

Une équipe de chercheurs a déposé sur arXiv (réf. 2605.21862) EvoScene-VLA, une nouvelle architecture de contrôle robotique pour les politiques vision-langage-action (VLA) en mode "chunked", où le robot planifie plusieurs gestes à la fois plutôt qu'une seule commande par observation. Sur 31 tâches de manipulation du benchmark RoboTwin, le système atteint 89,1 % de réussite en évaluation fixe (contre 87,2 % pour les baselines) et 88,5 % en évaluation aléatoire (contre 86,1 %). Des tests sur le robot réel Galaxea R1-Lite confirment que l'architecture surpasse l'ensemble des approches comparées. Le mécanisme central est un "préfixe de scène" récurrent : un vecteur compact et géométriquement informé, mis à jour après chaque chunk d'actions, qui transporte l'état de la scène d'un appel au modèle au suivant. L'apport technique comble un angle mort structurel des VLA chunkées actuelles : celles-ci reconditionent chaque séquence d'actions uniquement sur l'observation visuelle instantanée, sans tenir compte des modifications de géométrie induites par les gestes précédents, contacts, occultations ou déplacements d'objets. Les approches spatiales (amélioration de la géométrie par frame) et temporelles (agrégation de frames passées) n'adressent pas ce problème entre les appels au VLM. EvoScene-VLA maintient un prior de scène persistant et mis à jour après chaque action : le modèle fusionne l'observation fraîche avec ce prior, produit le chunk suivant, et génère une mise à jour compacte de la scène. Pour les intégrateurs travaillant sur la manipulation dextre ou les séquences longues, c'est une démonstration que l'architecture du décodeur peut être déterminante, indépendamment du volume de données d'entraînement. Ce preprint s'inscrit dans la vague de recherche post-π0 (Physical Intelligence) et GR00T N2 (NVIDIA), où les VLA passent du stade académique à celui de politiques testées sur hardware réel. Le Galaxea R1-Lite est une plateforme de recherche de la startup chinoise Galaxea Robotics, positionnée comme alternative ouverte aux robots de labo propriétaires. La publication ne mentionne ni partenaire industriel ni calendrier de déploiement commercial : il s'agit d'une contribution académique, pas d'une annonce produit. Les gains restent modestes en valeur absolue, autour de deux points sur RoboTwin, et les deux modules d'entraînement auxiliaires (Scene Predictor et Geometric Anchor) sont abandonnés à l'inférence, signe d'une conception orientée efficacité au déploiement. La prochaine étape naturelle serait une évaluation sur des tâches out-of-distribution ou en environnement industriel non structuré.

IA physiqueOpinion
1 source
GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action
3407arXiv cs.RO 

GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action

Des chercheurs ont publié GesVLA, un modèle Vision-Language-Action augmenté d'une modalité gestuelle, dans un preprint arXiv soumis en mai 2026 (arXiv:2605.22812). L'architecture repose sur un double VLM (Vision-Language Model) qui encode les features gestuelles directement dans l'espace latent, permettant aux gestes pointés de la main de participer à la fois au raisonnement de haut niveau et à la génération d'actions motrices. Pour l'entraînement, l'équipe a construit un pipeline de génération de données synthétiques en rendant des modèles 3D de mains sur des images de scènes réelles, produisant des annotations de pointage variées tout en réduisant le sim-to-real gap visuel. Le modèle a été évalué sur plusieurs tâches physiques réelles : manipulation contrôlée de blocs et sélection de produits dans des environnements encombrés. Les expériences montrent une amélioration mesurée de la précision de grounding cible et de l'efficacité de l'interaction humain-robot, particulièrement dans des scènes complexes avec objets similaires. L'apport principal de GesVLA est d'adresser une faiblesse connue des VLA actuels : l'ambiguïté spatiale. Quand plusieurs objets similaires sont présents dans la scène, une instruction textuelle seule (type "prends la bouteille") reste ambiguë. Intégrer le geste de pointage comme modalité parallèle au texte offre un ancrage spatial explicite sans modifier l'interface verbale. L'architecture dual-VLM représente un choix architectural non trivial par rapport aux approches qui traitent les modalités de façon séquentielle. Ce n'est pas la première tentative d'incorporer des signaux humains dans les VLA, mais la formalisation du geste comme modalité de premier rang dans l'espace latent, plutôt qu'en post-processing, est une contribution d'architecture à surveiller pour les intégrateurs qui déploient des cobots en environnements de picking désordonnés. GesVLA s'inscrit dans la vague de recherche post-RT-2 et pi-0 qui cherche à rendre les VLA robustes au-delà du régime de laboratoire. Les modèles concurrents comme OpenVLA (Berkeley), Octo ou RoboFlamingo travaillent essentiellement avec du texte et de la vision, sans modalité gestuelle native. Physical Intelligence (pi) avec pi-0 et Google DeepMind avec RT-2/RT-X restent les références industrielles sur la généralisation des VLA à grande échelle. Le preprint ne mentionne pas de partenariat industriel ni de timeline de déploiement commercial. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés (LIBERO, Calvin) pour permettre des comparaisons directes, et une intégration sur des plateformes comme Franka ou UR5 au-delà des configurations de démonstration présentées.

IA physiqueOpinion
1 source
Voler ensemble : contrôle partagé immersif à guidage humain pour équipes de robots aériens en milieu inconnu
3408arXiv cs.RO 

Voler ensemble : contrôle partagé immersif à guidage humain pour équipes de robots aériens en milieu inconnu

Des chercheurs ont présenté dans un preprint arXiv (2605.21680) un cadre de contrôle partagé en réalité virtuelle pour équipes de drones évoluant en environnements inconnus et contraints. Le système repose sur un planificateur à primitives de mouvement guidé par l'opérateur, qui calcule en temps réel des trajectoires continues sans collision tout en intégrant les inputs humains. Un contrôleur d'admittance permet à l'opérateur d'influer sur le comportement de la flotte sans prendre le contrôle direct de chaque appareil : il positionne des "points de migration" via un casque VR, et les drones les atteignent de manière coordonnée. L'interface est bilatérale, l'opérateur recevant un retour visuel immédiat de l'état de l'équipe. Le système a été validé en configuration mixte, combinant drones physiques et drones simulés dans le même environnement de réalité étendue. Les résultats expérimentaux montrent une meilleure évitement des obstacles, un espacement inter-agents maintenu, et une réduction de la charge cognitive opérateur. Ce travail s'attaque à une limite bien connue des systèmes multi-robots autonomes : leur rigidité face à des situations non prévues dans l'environnement opérationnel. Là où un planificateur purement autonome peut rater une zone d'intérêt ou bloquer sur une ambiguïté sémantique, le "human-in-the-loop" permet de ré-orienter l'exploration sans reprendre le contrôle à bas niveau. Le contrôleur d'admittance est la pièce centrale : il absorbe les intentions de l'opérateur comme une compliance mécanique, évitant les commandes brusques tout en préservant la cohérence de la flotte. Pour les intégrateurs industriels ou les opérateurs de drones en inspection d'infrastructures, c'est une architecture qui réduit le nombre d'opérateurs requis tout en maintenant une supervision humaine significative. Le contrôle partagé homme-robot est un champ de recherche actif depuis une décennie, mais son application aux flottes de drones en VR reste émergente. Les approches concurrentes vont des interfaces haptiques monorobot aux systèmes d'autonomie à niveaux (SAE-like pour l'aérien) développés par des équipes comme celle de GRASP Lab (UPenn) ou ETH Zurich. Ce preprint n'annonce pas de déploiement commercial ni de partenariat industriel identifié : il s'agit d'une démonstration de faisabilité académique. Les prochaines étapes logiques seraient une validation à plus grande échelle de flotte (l'article ne précise pas le nombre exact de drones testés) et des scénarios opérationnels réels, notamment search-and-rescue ou inspection de bâtiments.

RecherchePaper
1 source
HUSKY : système de skateboard humanoïde via contrôle corps entier conscient de la physique
3409arXiv cs.RO 

HUSKY : système de skateboard humanoïde via contrôle corps entier conscient de la physique

Des chercheurs ont présenté sur arXiv (2602.03205) HUSKY, un framework permettant à l'humanoïde Unitree G1 de faire du skateboard de manière stable en conditions réelles. Un skateboard est une plateforme sous-actionnée soumise à des contraintes non-holonomes (le véhicule ne se déplace pas librement dans toutes les directions) dont l'inclinaison est mécaniquement couplée à l'orientation des trucks. HUSKY modélise ce couplage et décompose la tâche en deux phases : poussée du pied au sol et direction par inclinaison du corps (lean-to-steer), reliées par un mécanisme de transition guidé par trajectoire. Les mouvements de poussée sont appris via les Adversarial Motion Priors (AMP), une technique d'imitation générant des gestes naturels à partir de données de référence. Les tests sur le G1 démontrent une navigation agile en environnement réel. Ce travail pointe une limite structurelle des frameworks de contrôle whole-body actuels : ils supposent quasi-unanimement un sol statique et des contacts prévisibles. En modélisant la dynamique du couplage humain-objet, HUSKY montre qu'un humanoïde peut opérer sur un équipement mobile non conventionnel sans recalibration manuelle, ce qui ouvre la voie à des robots capables de manouvrer chariots ou palettes en environnement industriel. L'association d'un modèle physique du sous-système mécanique avec l'apprentissage par imitation constitue une approche plus robuste que les politiques entraînées en simulation pure, et le transfert sim-to-real semble validé sur un scénario concret. Les conditions précises des tests (vitesse, distance, taux d'échec) ne sont pas détaillées dans l'article, ce qui limite l'évaluation objective des performances annoncées. Le Unitree G1, humanoïde à 43 degrés de liberté vendu autour de 16 000 dollars, s'impose comme plateforme de référence pour la recherche en locomotion avancée aux côtés du Boston Dynamics Atlas et de l'Agility Digit. En 2025-2026, la recherche en contrôle whole-body dynamique s'accélère avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les politiques loco-manipulation développées à Carnegie Mellon. HUSKY se distingue en explorant le couplage avec des véhicules sous-actionnés plutôt que la manipulation d'objets statiques. Il s'agit pour l'instant d'une démonstration de recherche sans déploiement industriel annoncé, et les étapes suivantes naturelles incluent l'extension à d'autres véhicules (trottinette, vélo) ou des scénarios combinant locomotion et manipulation.

RecherchePaper
1 source
Algorithme d'enchères consensuelles à stratégie d'enchère apprise pour systèmes multi-robots
3410arXiv cs.RO 

Algorithme d'enchères consensuelles à stratégie d'enchère apprise pour systèmes multi-robots

Une équipe de chercheurs a publié sur arXiv (ref. 2605.21932) une approche hybride pour l'allocation décentralisée de tâches en flotte robotique : remplacer le mécanisme d'enchères déterministe du CBBA (Consensus-Based Bundle Algorithm) par une politique d'enchères neuronale entraînée par apprentissage par renforcement. Le CBBA, algorithme de référence en coordination multi-robots, garantit une convergence prouvable mais repose sur des fonctions de score heuristiques codées à la main, souvent sous-optimales face à des scénarios complexes. Les auteurs entraînent leur politique avec PPO (Proximal Policy Optimization), en calibrant les récompenses sur la proximité aux solutions globalement optimales obtenues par programmation linéaire en nombres entiers mixtes (MILP). Trois architectures neuronales sont comparées : un Neural Additive Model (NAM), un LSTM et un Set Transformer. Les expériences couvrent plusieurs tailles de flotte et confirment que les politiques apprises améliorent systématiquement la qualité d'allocation par rapport au CBBA classique, tout en conservant une exécution entièrement décentralisée. Le résultat structurellement important est que ce cadre CTDE (Centralized Training, Decentralized Execution) permet aux robots d'enchérir sur des tâches à partir d'observations locales partielles, sans communication globale à l'exécution. Pour les intégrateurs déployant des flottes en entrepôt ou en logistique industrielle, c'est un signal concret : les heuristiques codées manuellement, longtemps standard de fait, peuvent être surpassées par des politiques apprises sans sacrifier les garanties de coordination décentralisée. La capacité à tenir à l'échelle sur différentes tailles de flotte est particulièrement notable, les approches MARL pures souffrant souvent d'une instabilité d'entraînement croissante avec le nombre d'agents. Le CBBA est issu des travaux de Choi et al. (2009) et reste une référence dans les systèmes multi-robots décentralisés, notamment pour les drones et les AMR industriels. L'hybridation RL et algorithmes de coordination classiques s'inscrit dans un axe de recherche actif, face à deux alternatives concurrentes : les approches MARL pures (scalabilité difficile) et les méthodes d'optimisation combinatoire centralisée (inadaptées au temps réel). Cette publication reste une contribution académique sans déploiement annoncé ni partenaire industriel identifié, mais elle pose une base méthodologique pour des flottes hétérogènes plus larges. Les suites naturelles seraient la validation sur robots physiques et l'extension à des contraintes temporelles explicites, comme des tâches avec fenêtres de temps ou des dépendances séquentielles.

RecherchePaper
1 source
Symétries ici et là, combinées partout : compositions inter-espaces en robotique
3411arXiv cs.RO 

Symétries ici et là, combinées partout : compositions inter-espaces en robotique

Des chercheurs ont soumis fin mai 2026 sur arXiv (arXiv:2605.22639) un framework baptisé "cross-space symmetry compositions", conçu pour apprendre des politiques robotiques exploitant simultanément plusieurs symétries géométriques. L'approche a été validée sur un robot à deux bras (dual-arm), en simulation et sur hardware réel, sur des tâches de manipulation. Le principe : plutôt que de traiter isolément les symétries de l'espace de configuration (angles articulaires) et celles de l'espace de tâche (position et orientation de l'effecteur), le framework les compose dans un espace de représentation unifié. Les auteurs s'appuient sur la structure différentielle-géométrique de la cinématique directe (forward kinematics map) pour "descendre" des symétries de l'espace de configuration vers l'espace de tâche, ou les "remonter" en sens inverse. L'enjeu pour les équipes R&D en manipulation robotique est direct : les réseaux de neurones équivariants, qui respectent par construction les symétries du problème, requièrent moins de données d'entraînement et généralisent mieux à des configurations non vues. Jusqu'ici, la plupart des approches exploitaient une seule symétrie à la fois (par exemple la SO(2)-équivariance dans le plan horizontal pour la manipulation en table-top), laissant des gains de généralisation inexploités. Les résultats expérimentaux confirment une amélioration sur les tâches de manipulation testées, bien que les marges précises et les volumes de données requis ne soient pas détaillés dans le résumé public. Les équipes travaillant en imitation learning ou sur des architectures VLA (Vision-Language-Action) sont directement concernées par cette piste. Ce travail s'inscrit dans un courant actif autour des réseaux équivariants en robotique, adossé aux formalismes de groupes de symétrie en deep learning (SO(2), SE(3), E(n)). La contribution spécifique réside dans la composition inter-espaces plutôt que dans l'équivariance dans un seul espace. Il s'agit à ce stade d'une publication académique sans code public annoncé, et les expériences portent sur un seul système dual-arm dont la plateforme hardware n'est pas précisée. Les suites naturelles seraient une extension aux robots humanoïdes ou aux plateformes commerciales (bras UR, Franka), ainsi que la mise à disposition du code pour permettre la reproductibilité et une adoption plus large dans la communauté de la robotique apprenante.

RecherchePaper
1 source
Planification de mouvements pour la locomotion dynamique par préhension en microgravité
3412arXiv cs.RO 

Planification de mouvements pour la locomotion dynamique par préhension en microgravité

Des chercheurs ont publié sur arXiv (référence 2605.21704, mai 2026) une étude portant sur la conception de mouvements locomoteurs pour robots multi-membres en microgravité, dans des environnements où les points d'ancrage sont rares et disposés de façon irrégulière. L'approche étudiée repose sur la locomotion par saisie : le robot se déplace en agrippant successivement des ancrages fixes, plutôt qu'en marchant sur un sol stable. Les paramètres de conception analysés incluent le patron de démarche, la longueur de foulée, la vitesse de locomotion et la posture nominale du corps. Un cadre de planification paramétrable a été proposé pour évaluer ces variables en termes de stabilité et de demande en actuation. Deux morphologies quadrupèdes distinctes ont été testées en simulation physique. L'ensemble reste pour l'instant à l'étape de simulation, sans validation sur hardware réel. L'intérêt de cette recherche tient à la difficulté fondamentale de la locomotion hors-gravité : sans réaction au sol, les stratégies classiques de marche sont inopérantes, et le robot doit gérer simultanément des contraintes dynamiques et cinématiques couplées, incluant une manipulation en 6 degrés de liberté pour établir chaque contact. Les résultats indiquent que deux leviers améliorent significativement les performances : élargir l'espace de "contact wrench" faisable, c'est-à-dire maximiser la diversité des forces et couples transmissibles via les points d'appui, et atténuer les dynamiques impulsives de l'ensemble du corps, en évitant les mouvements brusques générateurs d'instabilité. Ces conclusions orientent directement le choix des configurations de contact et les stratégies de coordination corporelle pour de futurs systèmes réels. Ce travail s'inscrit dans un champ en expansion rapide : la robotique spatiale pour maintenance de satellites, exploration d'astéroïdes et interventions sur structures orbitales comme l'ISS. Des acteurs comme le DLR (Centre aérospatial allemand), le JPL-NASA avec ses robots grimpeurs, ou encore l'ESA avec ses programmes de robotique on-orbit, travaillent sur des problématiques adjacentes. La manipulation par saisie en microgravité intéresse aussi des projets d'exploration planétaire à faible gravité (Phobos, petits corps). La prochaine étape logique pour ce type de recherche est la validation expérimentale sur banc de test à gravité réduite ou en orbite, étape que l'étude ne couvre pas encore.

RecherchePaper
1 source
Raisonnement d'ordre supérieur pour des opérations collaboratives de robots mobiles sans communication
3413arXiv cs.RO 

Raisonnement d'ordre supérieur pour des opérations collaboratives de robots mobiles sans communication

Des chercheurs présentent un cadre de planification épistémique dynamique permettant à des robots mobiles de se coordonner sans aucun échange de messages entre agents (arXiv:2605.21901). L'architecture repose sur des particules de croyances d'ordre supérieur : chaque robot modélise non seulement l'état du monde, mais aussi ce que ses coéquipiers croient de cet état, et ainsi de suite en cascade. Ces croyances sont mises à jour par inférence bayésienne, et un arbre de comportements sélectionne les actions en anticipant les décisions probables des voisins. Un contrôleur MPPI (Model Predictive Path Integral) temporellement conscient traduit ensuite ce raisonnement en trajectoires basse fréquence adaptées à l'observabilité partielle. Testée en simulation et sur robots physiques, l'approche réduit le temps de complétion des tâches par rapport à une baseline de raisonnement du premier ordre, sans que l'abstract précise la taille des flottes ni les conditions exactes des essais. L'enjeu est direct pour les intégrateurs de flottes d'AMR (Autonomous Mobile Robots) en logistique ou en industrie : les architectures actuelles supposent un orchestrateur central ou un réseau Wi-Fi stable, et toute dégradation du signal dégrade la coordination collective. Un mécanisme de coordination implicite fondé sur la logique épistémique ouvre la voie à des déploiements plus résilients dans des environnements RF-dégradés, souterrains ou à bande passante contrainte. L'approche valide également l'opérationnalisation de la logique épistémique, longtemps cantonnée à l'IA symbolique, dans une boucle de contrôle temps réel sur hardware physique, ce qui n'était pas acquis à cette échelle. La coordination décentralisée sans communication est un problème ouvert depuis les systèmes multi-agents des années 1990, mais son implémentation sur robots réels est restée marginale au profit des solutions centralisées. Les approches concurrentes incluent les champs de potentiel artificiel, l'optimisation distribuée (ADMM, consensus) et l'apprentissage par renforcement multi-agents (MARL). Ce travail se distingue par le couplage inhabituel entre raisonnement épistémique symbolique et contrôle continu par MPPI. Les suites naturelles attendues : une évaluation à plus grande échelle (cinq robots ou plus), des comparaisons directes avec des méthodes MARL de référence, et une analyse de la complexité computationnelle du raisonnement d'ordre supérieur en temps réel, point critique pour un déploiement industriel viable.

RecherchePaper
1 source
Apprentissage de la collaboration altruiste dans les systèmes multi-équipes hétérogènes
3414arXiv cs.RO 

Apprentissage de la collaboration altruiste dans les systèmes multi-équipes hétérogènes

Des chercheurs ont soumis en mai 2025 sur arXiv (arXiv:2605.21723) un framework d'allocation dynamique de robots entre équipes hétérogènes, où chaque robot constitue une ressource transférable d'une équipe à l'autre en cours de mission. Le mécanisme de décision repose sur la règle de Hamilton, empruntée à la biologie évolutive : un agent "accepte" de quitter son équipe d'origine si le bénéfice collectif pondéré par la relation entre équipes dépasse le coût de transfert. Le problème d'optimisation résultant est combinatoire et démontré NP-difficile. Pour contourner ce verrou de scalabilité, les auteurs proposent une politique fondée sur un réseau de neurones sur graphe (GNN), entraîné en mode centralisé mais exécuté de façon décentralisée (paradigme CTDE, Centralized Training, Decentralized Execution). Le modèle opère sur le graphe d'interaction entre équipes et prédit à la fois les transferts de robots et les réaffectations équipe-par-équipe. La validation s'appuie sur un scénario de lutte contre des incendies simultanés, combinant simulations à grande échelle et expériences physiques réelles, avec des performances proches de l'optimal calculé. Pour les intégrateurs de flottes multi-robots, l'apport principal est la capacité à redistribuer dynamiquement des actifs hétérogènes (robots de capacités différentes) sans coordinateur central en temps réel, ce qui réduit la dépendance à une infrastructure de communication fiable. Démontrer que ce comportement altruiste peut être appris via un GNN et exécuté localement contredit l'idée selon laquelle la coordination complexe entre équipes exige impérativement une optimisation centralisée en ligne. Le passage à l'échelle est validé empiriquement, pas seulement en simulation. Ce travail s'inscrit dans la vague du Multi-Agent Reinforcement Learning (MARL), où CTDE est désormais un paradigme standard avec des baselines comme MAPPO ou QMIX. L'originalité réside dans l'emprunt explicite à l'écologie évolutive comme principe normatif, là où la plupart des approches MARL restent purement empiriques. L'article n'est pas encore évalué par des pairs (preprint arXiv). Aucun acteur industriel n'est impliqué dans cette publication académique, et aucune timeline de déploiement n'est mentionnée. Les prochaines étapes naturelles seraient une validation sur des scénarios industriels réels (entrepôts, chantiers, réponse aux catastrophes) avec des flottes robotiques hétérogènes commerciales.

RecherchePaper
1 source
Planification assistée par éclaireur pour équipes de robots hétérogènes en environnements partiellement connus
3415arXiv cs.RO 

Planification assistée par éclaireur pour équipes de robots hétérogènes en environnements partiellement connus

Des chercheurs ont publié sur arXiv (arXiv:2605.22693) un cadre de planification appelé Scout-Assisted Planning (SAP), conçu pour des équipes robotiques hétérogènes évoluant dans des environnements partiellement cartographiés. Le problème ciblé est concret : lorsqu'un robot terrestre (UGV) progresse sur un réseau routier dont certaines voies sont bloquées, il ne le découvre qu'en s'y engageant physiquement, générant des détours coûteux. SAP intègre des drones éclaireurs (UAV) qui collectent de l'information en avance de phase pour guider les UGV. Pour cibler les reconnaissances les plus utiles, les auteurs introduisent l'Information Gain-based Action Pruning (IGAP), un mécanisme qui score chaque action de scouting selon son impact attendu sur le comportement du robot au sol. Comme le calcul exact de l'IGAP est prohibitif en temps réel, un modèle Graph Neural Network (GNN) est entraîné à prédire ces valeurs directement depuis la structure du graphe routier et l'état de croyance courant. Sur trois types d'environnements testés, SAP avec IGAP réduit le coût de déplacement des UGV de 31,9 à 37,7 % par rapport à la baseline Canadian Traveler Problem, et surpasse de 8 à 14 % les approches de guidage par proximité. Ces résultats pointent vers un verrou industriel réel : dans la logistique d'entrepôt, la réponse à sinistre, ou les opérations minières, un robot terrestre contraint de faire demi-tour mobilise du temps machine et perturbe les flux. L'apport de SAP est de rendre la décision de scouting dirigée par la valeur informationnelle plutôt que par la simple distance, un glissement non trivial. L'usage d'un GNN pour approximer l'IGAP est l'élément clé : il ramène le planning à des niveaux temps réel sans dégradation mesurable de la qualité de solution, ce qui ouvre la voie à un déploiement embarqué sur matériel contraint. La distinction entre guidage par information et guidage par proximité, avec 8 à 14 % d'écart, valide quantitativement que la sophistication algorithmique se traduit en gains opérationnels réels. Ce travail s'inscrit dans un courant de recherche actif sur la planification multi-robots hétérogènes, où drones et robots terrestres forment des binômes complémentaires. La formulation s'appuie sur le Canadian Traveler Problem, un cadre classique de navigation sous incertitude, et l'étend avec une couche d'apprentissage automatique. Les acteurs industriels proches de cette problématique incluent Boston Dynamics (Spot + drones), Exotec pour la logistique autonome en entrepôt, ou encore les consortiums de robotique minière australiens. La prochaine étape naturelle serait la validation sur plateforme physique réelle : les expériences rapportées restent simulées, et le sim-to-real gap sur des graphes routiers dynamiques reste un défi non résolu par cet article.

RecherchePaper
1 source
Parallel OctoMapping : un cadre évolutif pour la planification de trajectoires en navigation autonome
3416arXiv cs.RO 

Parallel OctoMapping : un cadre évolutif pour la planification de trajectoires en navigation autonome

Une équipe de chercheurs a publié sur arXiv (référence 2603.22508v2, mis à jour en mai 2026) une méthode de cartographie baptisée Parallel OctoMapping (POMP), destinée à améliorer la planification de trajectoires dans les systèmes de navigation autonome. POMP s'appuie sur le framework OctoMap, une représentation volumétrique de l'espace libre et occupé largement utilisée en robotique mobile. La contribution centrale consiste à raffiner la représentation de l'espace libre à résolution de grille d'occupancy fixe, tout en préservant la fidélité de la carte et en exploitant le calcul multi-thread. Les auteurs soutiennent, sous réserve de vérification indépendante, qu'il s'agirait de la première méthode à combiner ces deux propriétés à résolution constante. L'enjeu pratique concerne directement les intégrateurs de robots mobiles et les déploiements AMR (Autonomous Mobile Robots) en environnements encombrés. Les méthodes classiques à résolution fixe produisent des représentations d'obstacles trop conservatives, ce qui génère soit des trajectoires sous-optimales, soit des échecs de planification dans des espaces denses. POMP prétend améliorer simultanément le taux de succès de la planification et la longueur des chemins calculés, tout en réduisant substantiellement le coût computationnel grâce au parallélisme. Si ces gains se confirment sur des benchmarks indépendants, la méthode pourrait s'insérer dans des pipelines existants utilisant des planificateurs A* ou équivalents, sans refonte architecturale majeure. OctoMap est un standard de facto dans la navigation robotique depuis les travaux d'Hornung et al. (2013), massivement adopté dans ROS et ROS2 pour les drones, véhicules autonomes et robots d'entrepôt. POMP se positionne comme une extension drop-in plutôt qu'un remplacement, ce qui réduit la barrière à l'adoption. Sur le plan académique, la cartographie haute performance mobilise également des approches concurrentes comme VDB-EDF (NVIDIA), les représentations neurales implicites de type NeRF-Nav, ou les grilles probabilistes hiérarchiques. À ce stade, POMP reste un preprint non évalué par les pairs, sans implémentation open source ni benchmark standardisé publiquement référencé dans l'abstract disponible.

RecherchePaper
1 source
Combler les lacunes : couverture ergodique multi-robot guidée par rétroaction en environnements inconnus
3417arXiv cs.RO 

Combler les lacunes : couverture ergodique multi-robot guidée par rétroaction en environnements inconnus

Des chercheurs ont soumis fin mai 2026 sur arXiv (2605.21719) un framework de couverture adaptative multi-robot intitulé "Mind the Gaps", conçu pour des environnements dont la distribution d'information est inconnue a priori. La méthode repose sur la recherche ergodique : les trajectoires des robots sont optimisées pour que leur distribution spatiale temporelle soit proportionnelle à la densité d'information perçue dans l'environnement. La nouveauté consiste à intégrer un retour en temps réel depuis un modèle paramétrique mis à jour en ligne, permettant de recalculer dynamiquement les zones cibles et de réallouer les agents vers les régions d'intérêt prioritaires. Les validations présentées sont exclusivement en simulation, sans déploiement sur hardware réel. L'obstacle classique des méthodes ergodiques est qu'elles supposent une distribution d'information connue a priori -- une hypothèse irréaliste pour l'inspection industrielle, la surveillance environnementale ou le search-and-rescue. Ce framework élimine ce prérequis en construisant la carte d'intérêt à la volée, concentrant les ressources là où l'incertitude est la plus élevée. Pour un intégrateur déployant des AMR sur un site diffus -- détection de fuites, cartographie de polluants, inspection de grandes surfaces -- cela réduit le nombre d'agents nécessaires et évite les cycles gaspillés sur des zones déjà bien caractérisées. La méthode suppose toutefois un environnement statique ou à évolution lente par rapport à la dynamique des robots, ce qui en limite l'applicabilité aux environnements hautement dynamiques. La recherche ergodique multi-robot s'appuie sur les travaux fondateurs de Mathew et Mezić (2011) et les développements de l'équipe Murphey à Northwestern. Les approches concurrentes -- exploration par frontières et processus gaussiens (GP-UCB) -- offrent une quantification d'incertitude plus explicite mais souffrent d'une complexité de calcul cubique avec le nombre d'observations. Ce papier positionne les méthodes ergodiques comme plus scalables pour de grandes flottes, sans toutefois proposer de comparaison quantitative directe. La validation limitée à la simulation laisse ouverte la question du sim-to-real gap, notamment pour les dynamiques de communication inter-agents à faible bande passante. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné.

RecherchePaper
1 source
Robots de soudage collaboratifs : le cheval noir qui redessine l'automatisation du soudage en Chine
3418Pandaily 

Robots de soudage collaboratifs : le cheval noir qui redessine l'automatisation du soudage en Chine

En six ans, les robots de soudage collaboratifs ont opéré une percée notable en Chine, passant du stade expérimental en 2020 à une solution d'automatisation largement déployée en 2026. Ces cobots se distinguent par leur aptitude à fonctionner aux côtés des opérateurs sans barrières de sécurité physiques, combinée à une planification de trajectoire adaptative qui réduit les temps de programmation par rapport aux robots industriels classiques. L'adoption a été tirée par la hausse structurelle des coûts salariaux et par une demande accrue en qualité de soudure dans les secteurs automobile, naval et des équipements lourds. Plusieurs acteurs domestiques chinois auraient atteint le premier rang technologique, concurrençant directement les marques internationales sur prix et performance. Des analystes sectoriels projettent une part de marché supérieure à 30 % dans le segment mid-market de la soudure d'ici deux ans, à mesure que les prix unitaires continuent de baisser, bien qu'aucune source indépendante ne soit citée à l'appui de cette projection. L'enjeu principal est de combler le déficit structurel de soudeurs qualifiés tout en automatisant des tâches longtemps réservées à la dextérité humaine. La rupture technique clé réside dans des algorithmes de contrôle propriétaires permettant une adaptation rapide à de nouvelles géométries de pièces, ce qui réduit les cycles de déploiement sur ligne. Pour les intégrateurs et les décideurs industriels, cela se traduit par un argument d'amortissement raccourci. Les métriques de cycle time avancées par les constructeurs restent cependant à valider sur données terrain indépendantes, les communications disponibles reposant essentiellement sur des démonstrations contrôlées plutôt que sur des rapports de production réelle. Ce mouvement s'inscrit dans la montée en gamme globale de la robotique chinoise, portée par des acteurs comme JAKA Robotics, Aubo Robotics ou Elite Robots qui réduisent progressivement l'écart avec les références occidentales FANUC, KUKA et ABB. Le soudage collaboratif représente aujourd'hui l'un des cas d'usage les plus matures pour les bras cobots en environnement industriel réel, avec des déploiements documentés dans la construction navale et l'automobile. Les prochaines étapes probables incluent l'intégration de vision 3D pour l'adaptation en temps réel aux variations géométriques des pièces et l'extension vers les marchés émergents d'Asie du Sud-Est, où les pressions sur les coûts de main-d'oeuvre créent des conditions similaires à celles qui ont catalysé l'adoption en Chine.

Chine/AsieOpinion
1 source
Cainiao déploie le robot grimpeur ZeeBot en entrepôt et double sa productivité
3419Pandaily 

Cainiao déploie le robot grimpeur ZeeBot en entrepôt et double sa productivité

Cainiao, la filiale logistique du groupe Alibaba, a officiellement présenté le ZeeBot, un robot d'entrepôt capable de se déplacer au sol et de grimper directement sur les étagères de stockage. Le robot est déjà opérationnel dans l'entrepôt cross-border de Dongguan, en Chine, et entre désormais en phase de déploiement mondial. Cainiao revendique un gain de 100% sur l'efficacité humaine en entrepôt depuis son introduction, sans préciser la baseline de comparaison ni fournir de données de cycle time, de payload ou de hauteur d'étagère supportée, un manque de transparence métrique habituel dans les annonces du secteur. L'intérêt architectural du ZeeBot réside dans la convergence, au sein d'un seul engin, de la mobilité horizontale (typique des AMR de type Kiva/MIR) et de la mobilité verticale (jusqu'ici assurée par des systèmes séparés : navettes de rayonnages, mini-loads ou lifts dédiés). Pour un opérateur logistique, supprimer cette frontière réduit la complexité de flotte, les interfaces de transfert entre systèmes et potentiellement le coût d'infrastructure par unité de volume traité. Cela dit, les robots grimpants impliquent des contraintes mécaniques sévères sur les étagères elles-mêmes, et l'absence de spécifications techniques publiées rend impossible toute évaluation indépendante des performances annoncées. Cainiao opère l'un des réseaux logistiques les plus denses au monde, avec des entrepôts cross-border en Asie, Europe et Amérique, ce qui lui confère une capacité de déploiement à grande échelle peu commune. Sur le créneau des robots d'entrepôt 3D à mobilité verticale, la concurrence est déjà structurée : Hai Robotics (HAIPICK, Chine) commercialise des robots grimpants depuis 2018 sur des milliers de sites ; AutoStore (Norvège) domine le cube storage dense ; et surtout Exotec, la licorne française de Croix, dont le système Skypod permet à ses robots d'évoluer sur des racks jusqu'à 12 mètres de hauteur et est déployé chez Carrefour, Decathlon ou Uniqlo. L'annonce de Cainiao s'inscrit donc dans un marché déjà disputé, où la différenciation passera par les données de performance réelles en conditions industrielles.

Chine/AsieOpinion
1 source
Du chaos à l'ordre : révolution de la fourniture de données et structuration des compétences pour l'IA incarnée
342036Kr 

Du chaos à l'ordre : révolution de la fourniture de données et structuration des compétences pour l'IA incarnée

Lors de la conférence AI+ Industry 2026 de Beijing Yizhuang, Xu Liangwei, CTO et cofondateur de Zhiyu Jishi (智域基石), a exposé un pipeline de compilation de données en cinq couches destiné à l'intelligence incarnée (embodied AI). Son argument central: la loi de mise à l'échelle (Scaling Law) qui sous-tend les grands modèles de langage ne se transfère pas aux robots. Un LLM peut absorber des textes hétérogènes en masse, mais un robot opérant dans le monde physique nécessite des données multimodales couplées dans le temps et dans l'espace, où qualité et traçabilité priment sur le volume brut. Le pipeline de Zhiyu Jishi comprend cinq étapes séquentielles: contrôle qualité des données brutes, alignement spatio-temporel, extraction sémantique et causale (séquence contexte-action-conséquence), traitement à grande échelle avec indexation multi-dimensionnelle, et livraison aux équipes de modèles. Xu Liangwei précise que ce pipeline s'applique indifféremment aux architectures VLA (Vision-Language-Action, apprentissage par imitation) et aux world models, les deux paradigmes convergeant vers le même besoin: des données physiques structurées et tracées. L'enjeu concret pour les intégrateurs et les équipes de modèles est la traçabilité des défaillances terrain. En 2026, certains robots commencent à passer de pilotes laboratoire à des déploiements industriels en petit lot, et les équipes peinent à relier un comportement anormal à un sample d'entraînement défaillant. Xu Liangwei précise que les modèles fixent le plafond de capacité d'un robot, mais que la qualité des données dans les cas d'échec, de reprise et de retry conditionne la fiabilité en environnement dégradé. Sans cette traçabilité bout en bout, la boucle fermée données-modèle-terrain-données ne peut pas converger à l'échelle industrielle, rendant impossible le passage du petit lot à la production réelle. Zhiyu Jishi se positionne dans une niche émergente, les "data foundry" pour l'embodied AI, distincte des services de labeling classiques par la dimension temporelle et multimodale des données robotiques. Le discours de Xu Liangwei s'oppose implicitement au modèle fragmenté actuel, où fabricants de plateformes matérielles, développeurs de modèles et intégrateurs industriels produisent chacun leurs données en silo. Sa proposition est de structurer un écosystème à trois acteurs avec une séparation claire des responsabilités, comparable à une couche d'infrastructure partagée. La présentation ne comporte aucun chiffre de déploiement vérifiable ni de client cité, ce qui la positionne davantage comme une communication de positionnement stratégique que comme un bilan d'exécution. La suite annoncée est l'ouverture de ce pipeline à l'ensemble de l'écosystème robotique chinois, sans calendrier précis communiqué.

Chine/AsieOpinion
1 source
Brain Corp s'associe à l'UC San Diego pour aider les robots à opérer dans des environnements complexes
3421The Robot Report 

Brain Corp s'associe à l'UC San Diego pour aider les robots à opérer dans des environnements complexes

Brain Corp a annoncé cette semaine un partenariat de recherche élargi avec l'Université de Californie à San Diego (UCSD), centré sur le développement d'une couche dite de "contextual grounding" pour robots autonomes. Concrètement, il s'agit d'une représentation numérique intelligente des espaces physiques, permettant à des AMR, drones et véhicules autonomes de comprendre leur environnement en temps réel et d'y réagir de manière adaptative. Le projet est piloté par le Dr. Nikolay Atanasov, directeur de l'Existential Robotics Laboratory au sein du département Electrical and Computer Engineering de la Jacobs School of Engineering. Les deux partenaires ciblent les environnements commerciaux et industriels complexes, là où la variabilité des conditions -- présence humaine, obstructions dynamiques, modifications de layout -- met en échec les approches SLAM classiques. La collaboration s'appuie sur la base opérationnelle de Brain Corp: plus de 50 000 AMR déployés dans le monde et plus de 25 millions d'heures cumulées de fonctionnement sur des sites commerciaux réels, un volume de données terrain que peu d'acteurs académiques peuvent atteindre seuls. L'enjeu industriel est direct. Les modèles vision-language-action (VLA) et les architectures generatives transforment rapidement ce qu'un robot peut faire, mais leur fiabilité en déploiement réel reste le principal frein à la commercialisation à grande échelle. Ce que Brain Corp et l'UCSD tentent de résoudre, c'est précisément le "sim-to-real gap" appliqué à la perception sémantique: un robot capable d'interpréter une scène dans un simulateur ou un environnement contrôlé ne garantit pas la même robustesse dans un entrepôt logistique avec 200 opérateurs humains. La cartographie 3D sémantique, contrairement aux approches purement end-to-end basées sur la vision brute, conserve une représentation structurée de l'espace -- ce qui facilite l'orchestration de flottes hétérogènes et l'intégration de capteurs fixes avec des agents IA mobiles. L'objectif affiché de Brain Corp n'est pas de résoudre une seule tâche robotique, mais de construire une infrastructure de plateforme capable de coordonner ces systèmes à l'échelle enterprise, ce qui positionne BrainOS comme un système d'exploitation pour flottes plutôt qu'un simple firmware d'AMR. Brain Corp, fondée en 2009 et basée à San Diego, a construit sa position sur BrainOS, plateforme d'autonomie embarquée initialement déployée sur des autolaveuses commerciales de marques comme Tennant et Nilfisk. La collaboration avec l'UCSD s'inscrit dans une tendance sectorielle plus large où les éditeurs de logiciels robotiques cherchent à ancrer leur R&D dans des partenariats académiques pour accéder à une recherche fondamentale en perception et mapping -- une stratégie comparable à celle de Boston Dynamics avec le MIT, ou de Agility Robotics avec Oregon State. Les concurrents directs sur le segment de l'orchestration de flottes incluent Fetch Robotics (Zebra Technologies), 6 River Systems (Shopify) et MiR (Teradyne). Le CTO de Brain Corp, John Black, détaillera cette approche lors du Robotics Summit and Expo 2026 à Boston la semaine prochaine. Aucune timeline de déploiement commercial pour cette couche sémantique n'a été communiquée à ce stade.

IndustrielPaper
1 source
FANUC s'associe à Google pour développer l'IA physique dans ses robots
3422Robotics Business Review 

FANUC s'associe à Google pour développer l'IA physique dans ses robots

FANUC Corp. a annoncé cette semaine un partenariat stratégique avec Google visant à accélérer le déploiement de l'IA physique dans ses robots industriels. L'initiative s'appuie sur les technologies d'intelligence artificielle de Google, notamment les grands modèles de langage (LLM), pour doter les robots FANUC de capacités de perception environnementale, de prise de décision autonome et d'exécution adaptative. Mike Cicco, président et CEO de FANUC America, a résumé l'enjeu sans détour : "Les fabricants ne se demandent plus s'ils doivent utiliser l'IA, mais comment l'appliquer là où ça compte le plus, soit sur le sol de l'usine." Depuis la présentation de son système d'IA physique à l'IREX de Tokyo en décembre 2025, FANUC affirme avoir déjà expédié plus de 1 000 robots pour des applications liées à l'IA physique, une donnée qui distingue ce partenariat d'une simple annonce commerciale. La gamme concernée s'étend des petits bras avec une charge utile de 3 kg jusqu'aux robots industriels lourds supportant 2 300 kg, ainsi que la série collaborative CRX. Sur le plan technique, la compatibilité de FANUC avec le standard ROS (Robot Operating System) via des pilotes open-source constitue le socle de l'intégration. La société prend en charge le langage Python pour le développement IA, des interfaces de communication haute vitesse pour le contrôle externe, et des passerelles vers les automates programmables (PLC), ce qui facilite l'insertion dans des lignes de production existantes sans refonte d'architecture. En parallèle, FANUC annonce un resserrement de l'intégration entre son logiciel de simulation ROBOGUIDE et le framework NVIDIA Isaac Sim, un signal fort vers le sim-to-real, l'un des verrous techniques majeurs de la robotique adaptative. Pour les intégrateurs et les décideurs industriels, ce positionnement signifie que les outils IA grand public deviennent directement utilisables sur des cellules robotisées certifiées production, ce qui réduit significativement la distance entre prototype et déploiement réel. FANUC, fondée au Japon et dont la filiale américaine est basée à Rochester Hills, Michigan, est l'un des leaders mondiaux du contrôle numérique (CNC) et de la robotique industrielle, avec des implantations sur tout le continent américain. Google s'implique dans la robotique principalement via Intrinsic, son unité dédiée à l'IA robotique et l'un des contributeurs majeurs à l'écosystème ROS. Ce partenariat positionne les deux acteurs dans une course qui s'intensifie entre les fournisseurs de robots industriels traditionnels (ABB, KUKA, Yaskawa) et les nouveaux entrants humanoïdes comme Figure ou Agility Robotics, qui misent eux aussi sur des LLM pour la flexibilité d'exécution. FANUC, fort de 1 000 unités déjà expédiées, cherche à démontrer que l'IA physique n'est plus un sujet de R&D mais une réalité commerciale intégrable à grande échelle. Les prochaines démonstrations sont attendues au Robotics Summit & Expo de Boston dans les prochains jours.

IndustrielOpinion
1 source
L'open source commence à aider les robots à raisonner
3423IEEE Spectrum Robotics 

L'open source commence à aider les robots à raisonner

Depuis deux ans, Hugging Face, Nvidia et Alibaba ont multiplié les publications open source dans la robotique cognitive, cherchant à résoudre ce qui était jusque-là le goulot d'étranglement du secteur : faire raisonner, décider et agir un robot. Nvidia a constitué une pile complète articulée autour de trois couches : Cosmos, des world models qui génèrent des données d'entraînement synthétiques et simulent des environnements physiques ; GR00T, des modèles permettant l'exécution de tâches complexes ; et Isaac, un ensemble de frameworks d'orchestration reliant entraînement, simulation et déploiement. Ces modèles sont hébergés sur Hugging Face. Ce mouvement s'inscrit dans une longue tradition : le Robot Operating System (ROS), lancé en 2007, a unifié le secteur en fournissant un framework standardisé au-dessus de Linux pour les fonctions fondamentales de la robotique, communication inter-composants, gestion du hardware, cartographie, planification de trajectoires. Avant ROS, chaque équipe réécrivait cette infrastructure de zéro, absorbant souvent une à deux années de travail avant de pouvoir conduire les recherches réelles. L'enjeu est structurant : si l'open source peut faire pour la cognition robotique ce qu'il a fait pour les LLMs, la barrière à l'entrée pour construire un robot capable pourrait chuter aussi vite qu'elle l'a fait pour les applications d'IA générative. Spencer Huang, directeur produit robotique chez Nvidia, note que la vision par ordinateur, autrefois coûteuse en expertise, se code aujourd'hui en quelques lignes. "Pour entrer dans la robotique, il ne faut plus nécessairement un doctorat", dit-il. La logique économique est explicite : fournir un modèle pré-entraîné de haute qualité que chaque acteur peut fine-tuner, plutôt que de demander à chacun de reprendre le pré-entraînement from scratch. Pour les intégrateurs et les décideurs industriels, cela se traduit concrètement par des cycles de développement raccourcis et une moindre dépendance aux profils rares. Le parallèle avec l'histoire de l'IA est tracé explicitement par Brian Gerkey, co-créateur de ROS, aujourd'hui Board Chair d'Open Robotics et CTO d'Intrinsic, l'unité robotique et IA de Google. La communauté IA a, dès ses débuts, partagé recherches, modèles et données en open source, et le domaine a progressé bien plus vite que presque tous les observateurs ne l'anticipaient. Les premières briques d'infrastructure open source pour la robotique remontent au milieu des années 1990, avec des projets comme le package Inter-Process Communication de Carnegie Mellon et le projet Player au début des années 2000, mais ces initiatives restaient fragmentées et liées à des groupes isolés. ROS a unifié la couche basse du secteur ; Nvidia, Hugging Face et Alibaba tentent aujourd'hui de reproduire cette unification pour la couche cognitive. Les outils de simulation sont désormais suffisamment précis pour être utiles à l'entraînement et accessibles hors des laboratoires spécialisés. La question qui demeure ouverte : ces modèles pré-entraînés tiendront-ils leurs promesses dans des déploiements industriels réels, au-delà des démonstrations contrôlées ?

FR/EU ecosystemeOpinion
1 source
Vidéo : Helios, robot humanoïde à quatre bras pour les missions en orbite
3424Interesting Engineering 

Vidéo : Helios, robot humanoïde à quatre bras pour les missions en orbite

La startup canadienne Orbit Robotics a dévoilé HELIOS, un robot humanoïde à quatre bras conçu pour des missions en orbite basse, dans une vidéo teaser publiée sur YouTube. Le robot présente un châssis noir allégé suspendu dans un banc de test, avec un système mécanique à câbles et poulies tendineux, en rupture nette avec les actionneurs rigides industriels classiques. Les moteurs sont positionnés près des articulations d'épaule afin de réduire la masse en mouvement, tandis que la force est transmise via des câbles et des bobines vers les articulations des bras. L'articulation du coude intègre un joint à contact roulant offrant un mouvement fluide à faible friction, alliant rigidité et compliance. HELIOS ne dispose pas de jambes : Orbit considère la locomotion bipède comme peu pertinente en micropesanteur, où la mobilité repose sur la préhension de surfaces et la stabilisation corporelle. Le robot cible des tâches telles que la gestion de fret, la maintenance répétitive et les opérations de construction orbitale. Les chiffres avancés pour justifier le besoin sont substantiels : les astronautes consacreraient environ 35 % de leur temps à des tâches de maintenance, un cycle de déchargement de fret mobiliserait près de 50 heures d'équipage, et le coût horaire d'un astronaute est estimé à 140 000 dollars. L'architecture à quatre bras d'HELIOS constitue une proposition de conception distincte du courant dominant de la robotique humanoïde terrestre. En ciblant la manipulation multimodale dans un environnement sans gravité, Orbit adresse un segment de niche mais à fort potentiel économique : les stations orbitales commerciales prévues pour cette décennie. L'utilisation d'une transmission par câbles plutôt que d'actionneurs rigides ou hydrauliques est cohérente avec les contraintes spatiales (masse, compliance, robustesse aux vibrations), et rappelle les principes des bras Canadarm ou des robots Astrobee de la NASA, bien que la robotique humanoïde autonome en orbite reste à un stade très expérimental. Il faut souligner que la présentation se limite à un teaser vidéo : aucun test en conditions de micropesanteur réelle n'est documenté à ce stade, et les métriques de performance concrètes (charge utile, degrés de liberté, temps de cycle) ne sont pas encore publiées. Orbit Robotics est une jeune entreprise canadienne en phase précoce ; HELIOS est décrit comme le résultat de deux semestres de développement. En parallèle, la société développe IKARUS, sa première plateforme opérationnelle bimanuelle, construite en deux mois et utilisée comme banc d'essai pour la téléopération, l'apprentissage par imitation et l'itération matérielle rapide. Sur le plan concurrentiel, le segment de la robotique spatiale autonome inclut des acteurs comme Gitai (Japon) ou les programmes ESA dédiés aux robots de service orbital. Aucun calendrier de déploiement ni partenariat avec des agences (NASA, ESA, JAXA) ou des opérateurs de stations commerciales tels qu'Axiom Space ou Vast n'a été annoncé. Les prochaines étapes logiques impliqueraient des essais en flottabilité neutre ou en vol parabolique, avant toute perspective d'intégration sur une infrastructure orbitale réelle.

HumanoïdesOpinion
1 source
Vidéo : un chien robot traque les micro-fuites de gaz dans le gigantesque hub de stockage de CO₂ norvégien
3425Interesting Engineering 

Vidéo : un chien robot traque les micro-fuites de gaz dans le gigantesque hub de stockage de CO₂ norvégien

Un robot quadrupède baptisé "Roberta", construit par la société suisse ANYbotics, patrouille l'installation Northern Lights d'Equinor sur les côtes de Norvège occidentale. Ce hub de stockage de carbone, largement automatisé, reçoit du CO2 liquide capturé dans des usines européennes et l'injecte en permanence dans des réservoirs géologiques situés à 2 500 mètres sous le fond marin. Roberta est un ANYmal D, certifié IP67 (étanche à la poussière et à l'eau), capable de naviguer sur des escaliers métalliques ouverts et des surfaces glissantes sous les tempêtes de la mer du Nord. Équipé de caméras thermiques, de capteurs de gaz et d'un système d'imagerie acoustique comprenant 64 microphones, il détecte les fuites microscopiques en repérant leurs sifflements haute fréquence bien avant tout opérateur humain. Chaque mois, ces quadrupèdes autonomes effectuent des rondes d'inspection sur plusieurs sites, cartographiant les concentrations de gaz, auditant les températures des équipements, et transmettant les données en temps réel à un centre de commande situé à trente minutes du site. Ce déploiement illustre un changement de paradigme opérationnel dans l'industrie lourde : plutôt que d'exposer des techniciens à des environnements hostiles en continu, le robot assure la surveillance permanente pendant que des modèles d'IA analysent les données et n'alertent les équipes humaines qu'en cas d'anomalie avérée. Les industriels utilisant ces quadrupèdes rapportent une réduction de 70 à 90 % de l'exposition humaine aux environnements dangereux. L'impact financier est également mesurable : déployé dans une cimenterie, l'ANYmal D a détecté des fuites d'air comprimé dont la réparation a réduit les émissions de CO2 de l'installation de 1 200 tonnes par an. Ces chiffres, bien qu'issus directement des communications d'ANYbotics, donnent un ordre de grandeur concret pour les décideurs qui évaluent le retour sur investissement de l'inspection autonome. Dans le secteur énergétique, où chaque micro-fuite représente un gaspillage économique et une pénalité carbone, le cas d'usage est particulièrement solide. ANYbotics, spin-off de l'ETH Zurich fondée en 2016 sous la direction du CEO Péter Fankhauser, s'est imposée comme l'un des leaders de l'inspection robotique industrielle aux côtés de Boston Dynamics (Spot) et de Ghost Robotics. La prochaine étape commerciale de la société est l'ANYmal X, présenté comme le premier robot quadrupède antidéflagrant au monde, conçu pour les zones ATEX (pétrole, gaz, chimie) où les gaz combustibles rendent dangereux tout équipement susceptible de produire des étincelles. Il s'agit pour l'instant d'une annonce de lancement commercial imminent, pas encore d'un produit déployé à grande échelle. Le déploiement sur Northern Lights, premier projet de capture et stockage de CO2 industriel à grande échelle en Europe, positionne ANYbotics sur un segment stratégique appelé à croître avec le durcissement des réglementations carbone de l'UE et la multiplication des infrastructures CCS sur le continent.

IndustrielActu
1 source
Humanoid s'associe à Bosch et Schaeffler pour industrialiser la production de robots
3426Robotics Business Review 

Humanoid s'associe à Bosch et Schaeffler pour industrialiser la production de robots

La startup londonienne Humanoid, fondée en 2024 sous le nom SKL Robotics Ltd., a annoncé en mai 2026 deux partenariats industriels majeurs pour industrialiser son robot HMND 01 sur le marché européen. Le premier accord, conclu avec Robert Bosch GmbH (siège à Gerlingen, Allemagne), fait suite à un proof of concept réalisé en mars 2026 dans un entrepôt intralogistique Bosch à Bühl, en Allemagne : le HMND 01, un manipulateur mobile à roues doté d'un torse humanoïde, d'une tête et de deux bras, a transféré de manière autonome des cartons depuis un convoyeur vers des chariots, en gérant cinq formats de boîtes différents sur plusieurs hauteurs, empreintes au sol et masses. Le second accord, signé la semaine précédente avec Schaeffler Technologies AG, est décrit comme un contrat "contraignant et phasé" visant à intégrer les robots HMND dans des lignes de production réelles en Allemagne d'ici fin 2026. Humanoid qualifie ce déploiement de "l'un des plus importants rollouts de robots humanoïdes annoncés à ce jour", ce qui reste difficile à vérifier indépendamment faute de chiffres de volumes publiés. Ces deux partenariats signalent un changement de phase pour Humanoid : de la validation POC vers la fabrication en série et le déploiement industriel. Bosch endosse le rôle de sous-traitant industriel (contract manufacturer) et apportera son infrastructure de production mondiale, sa chaîne d'approvisionnement et son expertise en DfX (design for excellence), un cadre méthodologique couvrant la fabricabilité, la fiabilité, la maintenabilité et l'optimisation des coûts. L'orchestration des tâches repose sur KinetIQ, le framework IA propriétaire d'Humanoid. Pour un COO ou un directeur industriel, l'intérêt concret est double : un robot conçu pour les espaces humano-centriques (convoyeurs, chariots, manipulation multi-format) testé en conditions réelles, et un partenaire de fabrication capable de passer rapidement du prototype au volume. La mention d'une future intégration de composants Bosch (actionneurs, variateurs, capteurs) dans les prochaines versions du HMND ouvre aussi une trajectoire de co-développement hardware. Humanoid s'est constitué rapidement un réseau de partenaires industriels de premier rang : outre Bosch et Schaeffler, la société avait annoncé le mois précédent un accord avec Siemens. Ce positionnement agressif intervient dans un contexte de consolidation du marché humanoïde industriel, où Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), NVIDIA (GR00T N2) et 1X Technologies se disputent les premiers déploiements à l'échelle. Humanoid mise sur une stratégie de distribution européenne différenciée, en s'appuyant sur l'écosystème industriel allemand plutôt que sur une intégration verticale américaine. La prochaine étape visible sera la mise en service effective des premiers systèmes chez Schaeffler avant la fin de l'année 2026, date qui permettra de valider si le saut du POC au déploiement réel est aussi rapide que le suggèrent les annonces.

FR/EU ecosystemeOpinion
1 source
IA à l'échelle urbaine : du pilote à la généralisation, robots en conditions réelles et passage à l'échelle
342736Kr 

IA à l'échelle urbaine : du pilote à la généralisation, robots en conditions réelles et passage à l'échelle

Coowa Technology, fondée en 2015 à Shanghai et dont le siège social est à Pékin, a présenté lors de la conférence AI+ Industry de Yizhuang en mai 2026 un bilan opérationnel chiffré: 55 millions de kilomètres réels parcourus, déploiement dans plus de 50 villes chinoises, et 10 millions de clips vidéo-sémantique-action alignés collectés. La gamme commercialisée comprend des robots d'assainissement urbain de 1 et 3 tonnes, le minibus autonome Coobus (déployé dans une dizaine de villes à l'échelle mondiale, dont prochainement Yizhuang), le robot de gestion immobilière Wall-E R0, et des robots-chiens quadrupèdes pour la livraison du dernier kilomètre, capables d'assurer des livraisons en moins de 30 minutes dans un rayon de 3 km sans modification des ascenseurs ni de l'infrastructure existante. Li Kehong, COO et co-fondateur, a indiqué une rentabilité annuelle de "plusieurs centaines de millions de yuans". L'argument central de la présentation porte sur la donnée comme avantage concurrentiel structurel: dans l'IA incarnée (embodied AI), le goulot d'étranglement n'est pas algorithmique mais datalogique. Coowa y répond avec une stratégie où les revenus d'exploitation financent directement l'itération du modèle CooWAIM (World-Action Interactive Model), une architecture duale combinant inférence temps réel en bordure de réseau pour la sécurité immédiate et planification sémantique longue portée pour la navigation globale. L'approche "Drive+Work", qui fusionne mobilité et manipulation dans un espace d'action indissociable, s'écarte du paradigme modulaire dominant dans la robotique de service. Les chiffres d'exploitation donnent une mesure concrète: aux heures de pointe, les robots traitent en temps réel plus de 100 caractéristiques dynamiques par intersection (piétons, véhicules non motorisés); un gain de 20% sur le temps de traversée équivaut selon Coowa à une hausse de 20% de la marge brute, argument directement actionnable pour un décideur B2B ou un intégrateur. Fondée sur la base académique de l'Université Jiaotong de Shanghai, Coowa opère depuis dix ans dans les environnements urbains ouverts chinois, accumulant une antériorité opérationnelle que peu de concurrents peuvent revendiquer à cette échelle commerciale. Waymo, issu du laboratoire Google X après plus d'une décennie de développement, et Tesla, qui s'appuie sur sa flotte de plusieurs millions de véhicules pour constituer ses données d'entraînement, progressent en robotaxi sur un périmètre distinct; les acteurs de la robotique humanoïde comme Figure, Agility Robotics ou 1X Technologies demeurent majoritairement en phase de pilote industriel. Coowa anticipe l'ouverture réglementaire de marchés étrangers en positionnant en priorité ses produits dans les pays de l'initiative "Ceinture et Route". Les prochaines étapes concernent la montée en puissance de la livraison instantanée à court terme et, à horizon plus long, l'entrée dans les environnements domestiques fermés, segment le plus complexe techniquement mais potentiellement le plus générateur de données d'entraînement inédites.

Chine/AsieActu
1 source
Pourquoi Tesla mise des milliards sur Optimus
3428Robot Magazine FR 

Pourquoi Tesla mise des milliards sur Optimus

Tesla a engagé un pivot stratégique majeur vers la robotique humanoïde avec son robot Optimus, présenté pour la première fois en 2021 et progressivement monté en priorité interne. Selon des déclarations publiques répétées d'Elon Musk courant 2024-2025, le groupe recrute massivement des ingénieurs en vision par ordinateur, robotique et IA, sans que des chiffres précis d'investissement ou de volumes de production n'aient été officiellement communiqués. Musk a qualifié Optimus de "produit le plus important de Tesla", positionnant le robot comme une plateforme capable d'intervenir dans les usines, entrepôts, logistique et services grand public. À date, Tesla a publié des démonstrations vidéo d'Optimus réalisant des tâches manuelles en environnement contrôlé. Il n'existe pas encore de déploiement industriel à l'échelle documenté ni de prix catalogue annoncé pour des tiers. L'intérêt stratégique d'Optimus repose sur une hypothèse structurelle : le marché des robots humanoïdes polyvalents pourrait dépasser celui de l'automobile à long terme. Pour les décideurs industriels, la promesse est réelle, les humanoïdes pourraient théoriquement remplacer des postes de travail répétitifs sans reconfigurer entièrement les lignes de production, contrairement aux bras industriels fixes. Mais l'écart entre démonstration et déploiement opérationnel reste considérable. Le "demo-to-reality gap" n'est pas comblé : aucun constructeur, ni Tesla, ni Figure AI, ni Boston Dynamics, n'a prouvé une fiabilité suffisante en conditions réelles non supervisées à grande échelle. Ce que le pivot Tesla prouve, c'est que la narration "constructeur automobile" ne suffit plus à soutenir une valorisation boursière qui restait, début 2025, un multiple très élevé par rapport aux revenus automobiles nets. Tesla arrive sur un marché humanoïde déjà encombré. Figure AI (Figure 03, en partenariat avec BMW) a annoncé des déploiements en usine. Agility Robotics (Digit) est en production chez Amazon. Physical Intelligence (pi-0) et 1X Technologies progressent sur les modèles fondationnels robotiques. Boston Dynamics positionne Atlas sur les environnements industriels difficiles. NVIDIA soutient l'écosystème via GR00T et la plateforme Isaac. La Chine industrialise rapidement avec Unitree et Fourier Intelligence. Tesla dispose d'un avantage potentiel : l'accès à d'immenses volumes de données réelles via ses véhicules et ses usines, et une chaîne de fabrication à bas coût. Mais la pression concurrentielle sur l'automobile, notamment de BYD, Xiaomi et Xpeng, comprime les marges et renforce l'urgence de diversifier les revenus. Une éventuelle IPO de SpaceX constitue un risque de dilution d'attention capitalistique supplémentaire pour Tesla. Les prochaines étapes à surveiller : un déploiement interne dans les Gigafactories, et une éventuelle communication sur les métriques de fiabilité opérationnelle.

HumanoïdesOpinion
1 source
Les robots humanoïdes commerciaux en Chine pourraient bientôt faire la lessive, faire les lits et s'occuper des personnes âgées
3429SCMP Tech 

Les robots humanoïdes commerciaux en Chine pourraient bientôt faire la lessive, faire les lits et s'occuper des personnes âgées

GigaAI a présenté mercredi le SeeLight S1, annoncé comme le premier robot humanoïde domestique à usage général conçu pour le marché résidentiel chinois. Développé en partenariat avec le Hubei Humanoid Robot Innovation Centre et le Hubei Humanoid Robotics Industry Alliance, l'appareil est destiné à des tâches ménagères non structurées : lessive, préparation des lits, assistance aux personnes âgées. GigaAI lance un programme de test gratuit auprès de familles à Wuhan, capitale du Hubei, sans communiquer à ce stade de prix public ni de métriques techniques précises (charge utile, degrés de liberté, temps de cycle). Cette annonce illustre un pivot stratégique majeur dans le secteur des humanoïdes chinois : après avoir ciblé les environnements industriels et manufacturiers, les constructeurs s'attaquent à l'environnement domestique, structurellement beaucoup plus difficile à maîtriser. Les tâches ménagères impliquent une variabilité quasi infinie des objets, dispositions et comportements humains, là où une ligne d'assemblage reste prévisible. Passer de la démo convaincante au déploiement réel dans des foyers reste le défi central du secteur, et ce programme de test en conditions réelles constitue une étape méthodologique pertinente, à condition que GigaAI publie des résultats chiffrés. Le projet s'inscrit dans une dynamique nationale soutenue par Pékin, qui a identifié les humanoïdes comme secteur stratégique prioritaire. En parallèle, UnitTree, Fourier Intelligence et UBTECH accélèrent leurs propres développements, tandis qu'à l'international Figure (Figure 03), Tesla (Optimus Gen 3) et Physical Intelligence (Pi-0) restent les références concurrentes. Le programme de Wuhan est un pilote terrain : son issue déterminera si GigaAI peut réellement combler l'écart entre démonstration et usage quotidien.

Chine/AsieOpinion
1 source
Le syndrome du béni-oui-oui : évaluer l'abstention dans les agents robotiques incarnés
3430arXiv cs.RO 

Le syndrome du béni-oui-oui : évaluer l'abstention dans les agents robotiques incarnés

Une équipe du laboratoire PursecLab a publié en mai 2026 un article documentant ce qu'ils nomment le "syndrome du yes-man" dans les VLM (vision-language models) utilisés comme planificateurs pour robots incarnés : ces modèles exécutent des instructions même lorsqu'elles sont physiquement infaisables, ambiguës ou fondées sur de fausses prémisses. Pour mesurer cette faille, les chercheurs ont développé RoboAbstention, un benchmark de 6 069 instructions générées à partir d'images issues de cinq jeux de données robotiques, via un pipeline en trois phases : ancrage visuel structuré, dérivation déterministe de contraintes physiques, et génération contrôlée par gabarits par catégorie. Les résultats sont sévères : Gemini 2.5 Flash, meilleur modèle général testé, n'abstient que dans 39,0 % des cas où il devrait refuser. Gemini Robotics ER 1.6 Preview, planificateur dédié à la robotique incarnée, tombe à 16,5 %. L'application de techniques de "defensive prompting" et d'in-context learning remonte ces taux à 93,6 % pour Gemini Robotics ER et 88,6 % pour GPT-5.4 Mini, sans résoudre entièrement le problème. Ce comportement représente un risque opérationnel concret : un robot qui ne détecte pas les limites d'une instruction peut endommager des équipements, violer des consignes de sécurité, ou échouer silencieusement sans signal d'erreur exploitable. La taxonomie proposée distingue quatre cas légitimes d'abstention - instruction ambiguë, contrainte physique violée, prémisse factuelle fausse, contexte sensoriel insuffisant. Le fait que des modèles dotés de raisonnement avancé échouent massivement démontre que la capacité à "savoir refuser" n'émerge pas naturellement avec la montée en puissance des VLM, y compris ceux dédiés à la robotique. Les benchmarks d'abstention existants portaient exclusivement sur des LLM en contexte textuel, ignorant les contraintes perceptuelles propres aux environnements physiques - c'est le vide que comble RoboAbstention. À mesure que les architectures VLA (Vision-Language-Action) se rapprochent des déploiements industriels réels, la validation comportementale avant mise en service devient un critère incontournable pour intégrateurs et décideurs industriels. Le benchmark est open-source sur purseclab.github.io/RoboAbstention, directement utilisable comme outil d'audit pré-déploiement. Aucun acteur européen n'est impliqué dans cette étude. Les prochaines étapes logiques pointent vers le fine-tuning ciblé sur l'abstention, les correctifs au niveau du prompt ayant montré leurs limites structurelles.

RechercheOpinion
1 source
VLA-REPLICA : un benchmark reproductible et économique pour l'évaluation réelle des modèles vision-langage-action (VLA)
3431arXiv cs.RO 

VLA-REPLICA : un benchmark reproductible et économique pour l'évaluation réelle des modèles vision-langage-action (VLA)

Une équipe de recherche vient de publier VLA-REPLICA (arXiv:2605.20774, mai 2026), un banc d'évaluation réel, bas coût et reproductible, conçu pour tester les modèles de type Vision-Language-Action (VLA) sur des tâches de manipulation robotique. L'architecture repose entièrement sur des composants disponibles dans le commerce, ce qui permet à n'importe quel laboratoire d'assembler le setup en quelques jours et de reproduire les mêmes conditions expérimentales. Le benchmark intègre une suite de tâches de manipulation variées, un dataset de démonstrations de petite taille pour l'adaptation au domaine cible, ainsi que des protocoles d'évaluation distincts pour des scénarios en distribution et hors distribution. Les expériences menées couvrent l'apprentissage par imitation classique et plusieurs modèles VLA de l'état de l'art, avec des résultats cohérents obtenus sur des setups construits indépendamment dans différents sites. L'enjeu derrière VLA-REPLICA est directement lié à un problème structurel du secteur : l'évaluation réelle des modèles VLA reste fragmentée, coûteuse, et difficile à comparer d'un labo à l'autre. Les benchmarks en simulation ne capturent pas la complexité du monde physique, tandis que les benchmarks réels existants exigent souvent du matériel spécialisé onéreux ou une évaluation centralisée. Ce benchmark vise à combler ce fossé en fournissant une infrastructure standardisée et décentralisée, ce qui est une condition nécessaire pour que la communauté puisse comparer honnêtement les modèles et identifier leurs limites réelles, notamment face au sim-to-real gap qui affecte encore la plupart des politiques de manipulation. Les modèles VLA ont connu une montée en puissance rapide ces deux dernières années, avec des systèmes comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA issu des travaux de Stanford et Berkeley. Malgré des performances impressionnantes en démo, leur déploiement industriel reste freiné par l'absence de protocoles d'évaluation partagés et comparables. VLA-REPLICA s'inscrit dans un mouvement plus large de standardisation des benchmarks robotiques, comparable à ce qu'ont représenté BOP ou NIST Task Board pour d'autres sous-domaines. La prochaine étape logique serait l'adoption de ce protocole par plusieurs équipes tier-1 pour valider la reproductibilité à grande échelle et créer une baseline commune sur laquelle ancrer les publications futures.

IA physiquePaper
1 source
DISC : découplage instruction-contrôle conditionné par l'état via la génération de politique
3432arXiv cs.RO 

DISC : découplage instruction-contrôle conditionné par l'état via la génération de politique

Des chercheurs ont publié DISC (Decoupling Instruction from State-Conditioned Control via Policy Generation), une architecture de politique de manipulation robotique conditionnée par le langage, déposée sur arXiv (2605.20856) en mai 2026. L'approche repose sur un hyperréseau qui génère l'intégralité des paramètres d'une politique visuomotrice spécifique à la tâche à partir de la seule instruction textuelle. La politique générée n'accède jamais directement au langage : sa compréhension de la tâche provient exclusivement des poids produits par l'hyperréseau. Sur les benchmarks LIBERO-90 et Meta-World, DISC surpasse l'ensemble des architectures couplées évaluées, et dépasse pi-0 (Physical Intelligence) malgré l'absence de tout préentraînement sur données externes. Le code est disponible publiquement sur GitHub. Ce résultat touche à un problème structurel bien documenté dans le domaine des VLA (Vision-Language-Action models) : l'"observation leakage", c'est-à-dire la tendance des réseaux couplés à apprendre des raccourcis scène-à-action qui contournent le grounding linguistique. En pratique, cela signifie qu'un modèle peut réussir une tâche en exploitant des corrélations visuelles parasites plutôt qu'en comprenant l'instruction. DISC élimine ce chemin de fuite par construction, et non par régularisation post-hoc. Le fait de surpasser pi-0 sans préentraînement est notable : pi-0 est entraîné sur des volumes de données multi-robots à grande échelle, ce qui rend la comparaison significative pour les équipes qui cherchent à calibrer le retour sur investissement du préentraînement massif versus des architectures mieux conçues. L'hyperréseau apprend également un manifold de paramètres structuré sémantiquement, ce qui permet une adaptation few-shot à partir de très peu de démonstrations et une robustesse aux reformulations d'instructions. Les architectures de politiques conditionnées par le langage sont au coeur de la course aux robots généralistes depuis 2023, avec des travaux fondateurs comme RT-2 (Google DeepMind), OpenVLA, et pi-0 de Physical Intelligence qui ont structuré le débat autour du préentraînement à grande échelle. DISC propose une alternative architecturale plutôt que scalaire : résoudre le problème de couplage instruction-état en amont, plutôt que de le noyer dans des données. Côté concurrents directs, les approches hyperréseau pour la génération de politiques restent peu explorées en robotique de manipulation, ce qui laisse DISC dans un espace relativement dégagé pour l'instant. Les prochaines étapes naturelles seraient une validation sur hardware physique à plus grande échelle (les expériences réelles mentionnées dans le papier restent limitées à un benchmark à contexte visuel partagé) et une évaluation de la latence de génération des paramètres en conditions de déploiement industriel, deux points que le papier ne documente pas encore précisément.

RechercheOpinion
1 source
WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés
3433arXiv cs.RO 

WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés

Une équipe de chercheurs a publié WestWorld (arXiv:2603.14392), un modèle de monde trajectoire conçu pour opérer sur des systèmes robotiques hétérogènes. Préentraîné sur 89 environnements complexes couvrant une large variété de morphologies en simulation et en conditions réelles, le modèle cible deux lacunes récurrentes dans la littérature : la difficulté de passer à l'échelle face à un grand nombre de dynamiques système distinctes, et l'absence d'intégration des connaissances sur les structures physiques des robots. La validation réelle a été conduite sur un quadrupède Unitree Go1, où WestWorld a démontré des performances stables en locomotion. Le code source est disponible sur GitHub. L'architecture repose sur un mécanisme baptisé Sys-MoE (system-aware Mixture-of-Experts), qui route dynamiquement des experts spécialisés selon le système robotique fourni en entrée, via un embedding système appris. Un embedding structurel complémentaire aligne les représentations de trajectoires avec les informations morphologiques du robot, permettant au modèle de tenir compte du fait qu'un bras articulé, un quadrupède et une plateforme mobile n'obéissent pas aux mêmes contraintes physiques. Les résultats affichent des gains significatifs en prédiction de trajectoire zero-shot et few-shot face aux baselines compétitives, ainsi qu'une amélioration des performances sur le contrôle model-based downstream pour différentes plateformes robotiques. La scalabilité tient sur un spectre large d'environnements, ce qui constitue l'argument central de la contribution. La publication s'inscrit dans une tendance forte : appliquer aux robots les world models issus du monde des agents RL et des LLMs multimodaux, à l'image de Dreamer, UniSim, ou des frameworks VLA (Vision-Language-Action) orientés manipulation. WestWorld se distingue par son ambition généraliste multi-morphologie, là où la majorité des approches concurrentes restent spécialisées sur une famille de robots. L'usage du Unitree Go1 comme banc de test réel est pertinent mais reste un cas relativement balisé dans la littérature, ce qui nuance la portée de la démonstration sim-to-real. Les prochaines étapes logiques seront d'évaluer le transfert sur des morphologies plus complexes, humanoïdes notamment, là où les défis de généralisation sont encore ouverts.

RecherchePaper
1 source
Explications contrefactuelles temporelles des décisions d'arbres de comportement
3434arXiv cs.RO 

Explications contrefactuelles temporelles des décisions d'arbres de comportement

Une équipe de chercheurs a publié sur arXiv (référence 2509.07674, version 2) une méthode automatisée de génération d'explications contrefactuelles temporelles pour les robots pilotés par des arbres de comportement (behaviour trees, BT). Le système répond en temps réel aux questions de type "pourquoi le robot a-t-il fait X plutôt que Y ?" en construisant automatiquement un modèle causal à partir de la structure du BT et de la connaissance du domaine applicatif, puis en interrogeant ce modèle pour produire un ensemble d'explications contrefactuelles diversifiées. Les auteurs affirment surpasser les méthodes existantes, qui soit ne répondent pas aux questions contrastives avec des explications causales, soit ne garantissent pas la cohérence et la précision des réponses sur une large gamme de structures de BT et d'états système. Les arbres de comportement sont largement utilisés dans les systèmes robotiques industriels et de service pour piloter la prise de décision, des manipulateurs aux robots mobiles autonomes (AMR) en passant par les plateformes humanoïdes. La question de l'explicabilité (XAI) y est critique pour les intégrateurs et les équipes de sécurité fonctionnelle : comprendre pourquoi un robot a choisi une séquence d'actions plutôt qu'une autre est indispensable pour la certification, la maintenance et l'acceptation par les opérateurs. Cette méthode propose le premier mécanisme de causalité contrefactuelle automatique dédié aux BT, comblant un angle mort identifié dans la littérature XAI robotique. Les arbres de comportement ont progressivement remplacé les automates finis (FSM) dans de nombreux systèmes robotiques depuis le milieu des années 2010, grâce à leur modularité et leur lisibilité. Les travaux antérieurs sur l'explicabilité des BT se limitaient à des justifications post-hoc non causales ou à des méthodes génériques issues de LIME, SHAP ou des réseaux causaux structuraux (SCM). La validation présentée repose sur des structures de BT synthétiques et des états variés, sans déploiement industriel annoncé à ce stade. Les prochaines étapes naturelles incluent la validation en environnement réel et l'intégration dans des interfaces opérateur, un enjeu croissant en Europe avec l'AI Act et les normes cobotiques (ISO 10218) qui renforcent les exigences de traçabilité des décisions autonomes.

RecherchePaper
1 source
Du contact balayé à la pose : recalage adapté à la sonde par ancrage de formes complémentaires
3435arXiv cs.RO 

Du contact balayé à la pose : recalage adapté à la sonde par ancrage de formes complémentaires

Des chercheurs proposent sur arXiv (2605.21398) une méthode de recalage sans calibration pour la manipulation robotique de précision, baptisée "complementary-shape docking", qui reformule le recalage modèle-scène comme un accouplement géométrique complémentaire entre l'objet cible et le volume balayé par la sonde de contact (probe swept volume), en exploitant à la fois les zones de contact effectif et de non-contact. Le pipeline intègre une recherche globale par corrélation 3D FFT sur des échantillons SO(3) à faible discrépance, suivie d'un raffinement continu en SE(3) via des mises à jour dans l'algèbre de Lie et des sensibilités analytiques au contact. En simulation sur des maillages à géométrie libre, la méthode atteint moins de 0,04 mm en translation et moins de 0,4 degré en rotation, robuste aux bruits de pose et aux pertes de contact partiel. Validée sur un robot de préparation dentaire en conditions réelles, elle rapporte 0,42 mm et 3,75 degrés, surpassant un tracker optique de référence sans aucun capteur externe. Pour les intégrateurs industriels et chirurgicaux, l'enjeu est concret : les méthodes optiques imposent des chaînes de calibration longues, des contraintes de visibilité directe (line-of-sight) et accumulent des erreurs liées aux tolérances de fabrication. Un recalage purement tactile et géométrique supprime ces dépendances sans dégrader la précision métrique, ouvrant la voie à des déploiements en environnements encombrés, stériles ou à faible éclairage. La validation sur robot dentaire physique atténue le sim-to-real gap habituellement invoqué pour nuancer les publications arXiv de ce type. Concrètement, cela se traduit par un setup allégé, moins de matériel propriétaire et une intégration facilitée sur des cellules robotiques existantes. Le recalage modèle-scène est un problème central depuis les premières formulations d'ICP (Iterative Closest Point) dans les années 1990, méthodes historiquement limitées par les minima locaux et la sensibilité à l'initialisation. Cette publication s'inscrit dans une tendance à éliminer les capteurs dédiés, en alternative complémentaire aux approches VLA (Vision-Language-Action) qui misent sur la perception visuelle. Les débouchés naturels touchent la chirurgie robotique (Intuitive Surgical, CMR Surgical en Europe), l'usinage de précision et les bras industriels à haute tolérance (KUKA, Stäubli). Aucune commercialisation ni partenariat industriel n'est annoncé dans la publication, qui reste une contribution académique avec prototype fonctionnel, sans timeline de transfert précisée.

RecherchePaper
1 source
Amélioration du SLAM par graphes en environnement sans GNSS grâce à l'odométrie des jambes
3436arXiv cs.RO 

Amélioration du SLAM par graphes en environnement sans GNSS grâce à l'odométrie des jambes

Des chercheurs ont publié sur arXiv (2605.20484) une architecture de graphe de facteurs qui améliore significativement la précision verticale du SLAM LiDAR-inertiel pour robots à pattes en environnement sans GNSS. Le système augmente le framework LIO-SAM avec une voie cinématique parallèle, alimentée par l'odométrie proprioceptive des jambes, couplée à la voie LiDAR-inertielle principale via une contrainte de pose relative avec modèle de bruit sélectif. Testé sur un quadrupède Linxai D50 lors de deux boucles extérieures totalisant plus d'un kilomètre, l'approche réduit la dérive en élévation de plus de 30 mètres à moins de 30 centimètres, soit une réduction de deux ordres de grandeur. Sur un scénario où le pipeline de référence échoue complètement à converger, la méthode proposée maintient la localisation. Ce résultat est significatif parce qu'il exploite une source de données déjà disponible à bord, calculée pour le contrôle de la locomotion, sans capteur supplémentaire. Le problème de la dérive verticale du LiDAR est bien documenté dans les environnements géométriquement pauvres ou répétitifs (couloirs, forêts, parkings), où les points de correspondance sont insuffisants pour contraindre l'axe Z. Utiliser l'odométrie des pattes comme ancre verticale légère est une approche pragmatique : elle s'insère dans les pipelines existants sans reconfiguration hardware, ce qui en facilite le déploiement sur des plateformes commerciales comme Unitree, Boston Dynamics Spot, ou ANYmal. Pour les intégrateurs et les équipes déployant des robots en inspection industrielle ou en environnements souterrains, c'est une piste concrète pour améliorer la robustesse SLAM sans surcoût matériel. LIO-SAM est un framework SLAM LiDAR-inertiel développé par Ji Zhang et Sanjiv Singh (Carnegie Mellon), largement adopté dans la communauté robotique depuis 2020, notamment pour les robots terrestres et aériens. Le couplage proprioception-SLAM n'est pas nouveau en théorie, mais son intégration efficace dans un graphe de facteurs en conditions réelles reste un sujet actif. Côté concurrence, les approches actuelles s'appuient généralement sur la fusion IMU renforcée (LOAM, LEGO-LOAM) ou l'ajout de capteurs barométriques pour corriger la dérive verticale. La prochaine étape naturelle serait de tester l'approche sur des terrains avec dénivelé marqué, et d'évaluer la robustesse face aux glissements de pattes, cas limite non abordé dans cette version préliminaire.

RecherchePaper
1 source
SubTGraph : synthèse d'environnements souterrains à grande échelle avec variabilité topologique contrôlable pour la validation de l'autonomie robotique
3437arXiv cs.RO 

SubTGraph : synthèse d'environnements souterrains à grande échelle avec variabilité topologique contrôlable pour la validation de l'autonomie robotique

SubTGraph est un framework open-source publié en preprint sur arXiv (ref. 2605.20917) par des chercheurs de l'université technologique de Luleå (LTU-RAI, Suède), conçu pour générer automatiquement des environnements souterrains synthétiques à grande échelle destinés à la validation de robots autonomes. Le système s'appuie sur un algorithme de Dijkstra piloté par une matrice de coûts paramétrée par l'utilisateur, qui assemble des tuiles topométriques issues du DARPA World Generator pour produire des scènes variées : mines opérationnelles, grottes naturelles et tubes de lave, y compris des configurations inspirées des tubes martiaux. La librairie est disponible sur GitHub (github.com/LTU-RAI/SubTGraph) et s'accompagne d'une base de données de 150 mondes souterrains distincts. Trois cas d'usage ont été investigués : la segmentation sémantique structurelle comparée à des vérités terrain topométriques, la planification de trajectoires multi-agents pour identifier des tendances algorithmiques, et le SLAM LIO (Lidar-Inertial Odometry) soumis à des conditions sévères pour cartographier les cas d'échec. Le problème central que SubTGraph adresse est un angle mort documenté dans la littérature : la quasi-totalité des articles en robotique souterraine valident leurs algorithmes sur deux ou trois environnements au maximum, rendant les conclusions statistiquement fragiles. Les sites réels (mines actives, grottes) sont difficiles d'accès, dangereux et impossibles à contrôler expérimentalement. La disponibilité d'une infrastructure de benchmarking à grande échelle, avec variabilité topologique contrôlable (niveaux, textures, géométrie), ouvre la voie à des évaluations statistiques rigoureuses des stacks d'autonomie couvrant perception, planification et localisation. Pour les intégrateurs travaillant sur l'inspection minière ou l'exploration planétaire, c'est un accélérateur de validation concret, réduisant la dépendance aux campagnes terrain coûteuses. SubTGraph s'inscrit directement dans l'héritage du DARPA Subterranean Challenge (2018-2021), compétition majeure qui a structuré la recherche en robotique souterraine et produit le World Generator sur lequel ce framework s'appuie. L'intérêt pour ces environnements est dual : automatisation minière (acteurs comme Sandvik, Epiroc, Hexagon Mining) et exploration planétaire (tubes de lave lunaires et martiens, dans la trajectoire des programmes NASA et ESA). Face aux simulateurs généralistes comme Gazebo ou Isaac Sim, SubTGraph se différencie par une génération procédurale spécifiquement calibrée sur les contraintes topologiques souterraines. Les suites logiques incluent l'intégration de modèles de capteurs réalistes et le transfert sim-to-real pour la navigation en environnements dégradés (poussière, faible luminosité, connectivité radio limitée).

RecherchePaper
1 source
EllipseLIO : odométrie inertielle LiDAR adaptative par représentation ellipsoïdale
3438arXiv cs.RO 

EllipseLIO : odométrie inertielle LiDAR adaptative par représentation ellipsoïdale

Des chercheurs de l'Université de Chypre (laboratoire v4rl-ucy) ont publié sur arXiv (preprint 2605.21150, mai 2026) un système d'odométrie inertielle LiDAR baptisé EllipseLIO, conçu pour fonctionner en temps réel sans calibration manuelle selon les scenarios. L'approche repose sur une représentation par ellipsoïdes pour le filtrage et le recalage des nuages de points LiDAR, lui permettant de s'adapter automatiquement aux capacités du capteur et à la géométrie de l'environnement. Évalué sur cinq jeux de données couvrant des scénarios variés et difficiles (environnements intérieurs/extérieurs, capteurs hétérogènes), EllipseLIO affiche une erreur d'odométrie inférieure de 38 % en moyenne par rapport à la deuxième meilleure approche testée. Il est également le seul système parmi tous les concurrents évalués à ne diverger dans aucune expérience. Le code sera publié en open source à l'adresse github.com/v4rl-ucy/ellipselio. La portée pratique de ce résultat est significative pour les intégrateurs de robots mobiles autonomes opérant en environnements GPS-dégradés ou GPS-absents (entrepôts, mines, bâtiments industriels, espaces souterrains). Le verrou actuel de la LIO est précisément la nécessité de re-tuner les paramètres à chaque changement de plateforme ou de site, ce qui freine le déploiement à grande échelle sur des flottes multi-capteurs. EllipseLIO casse ce paradigme en éliminant l'intervention humaine entre scenarios, ce qui est une promesse forte, même si les résultats restent à confirmer hors des cinq datasets retenus. L'absence de divergence sur l'ensemble des expériences est la métrique la plus solide présentée : c'est la robustesse, et non la précision seule, qui conditionne l'exploitabilité industrielle d'un système de localisation. La LIO est un sous-domaine mature de la SLAM (Simultaneous Localization and Mapping), avec des approches de référence comme FAST-LIO2 (Université de Hong Kong), LIO-SAM (MIT), ou encore LOAM. Ces systèmes offrent d'excellentes performances dans leurs conditions nominales mais nécessitent un tuning expert dès que le LiDAR ou l'environnement change. EllipseLIO s'inscrit dans une tendance récente vers des pipelines auto-adaptatifs, parallèlement aux approches d'apprentissage profond pour la localisation (ex. : travaux de Cartographer ou des équipes DeepMind/Google sur la localisation neuronale). Il convient de noter qu'EllipseLIO est pour l'instant un preprint non encore soumis à peer review, et que les benchmarks retenus conditionnent fortement les conclusions : une validation indépendante sur des datasets publics standards (MulRan, Hilti, KITTI-360) sera nécessaire pour consolider les affirmations. La mise en open source annoncée permettra à la communauté de reproduire et d'étendre ces évaluations.

RecherchePaper
1 source
Sélectionner ou ne pas sélectionner : distillation de la prédiction de compétences robotiques en petit ensemble
3439arXiv cs.RO 

Sélectionner ou ne pas sélectionner : distillation de la prédiction de compétences robotiques en petit ensemble

Une équipe de chercheurs publie en mai 2026 un preprint (arXiv:2605.21242) portant sur la prédiction automatique de compétences robotiques dans les flottes hétérogènes. À partir d'une description de tâche en langage naturel, le système identifie quelles capacités physiques sont requises parmi six catégories: vol, roues, pattes, navigation en surface aquatique, navigation sous-marine et manipulation avec mains. Faute de données labellisées existantes pour ce mapping, les auteurs ont construit un dataset synthétique via génération assistée par LLM et audit ciblé des étiquettes. Un ensemble de deux encodeurs de phrases fine-tunés (mpnet + MiniLM, environ 133 millions de paramètres au total) atteint 83,5 % de précision sur un jeu de test stratifié de 200 tâches, dépassant Kimi K2 (1 000 milliards de paramètres, architecture MoE) à 72,0 %, GPT-OSS-120B à 71,5 %, et Llama-4-Scout-17B à 69,0 %, tous évalués en zero-shot avec le même prompt. Ce résultat expose une asymétrie opérationnelle significative: un modèle de 133 millions de paramètres déployable localement surclasse des LLMs un millier de fois plus volumineux sur une tâche de routage de flotte. Pour les intégrateurs gérant des flottes mixtes (humanoïdes, quadrupèdes, drones, rovers), l'assignation automatique de la bonne plateforme à la bonne tâche reste un problème non résolu en production. Une limite mérite d'être soulignée: le jeu d'évaluation de 200 tâches synthétiques a été produit par les auteurs eux-mêmes, ce qui appelle une validation indépendante sur des scénarios réels avant de tirer des conclusions définitives. La gestion de flottes robotiques hétérogènes s'est intensifiée avec la multiplication des plateformes commerciales (Boston Dynamics Spot, Unitree B2, humanoïdes Figure ou Agility Digit, drones industriels), et les approches actuelles de routage reposent encore sur des règles manuelles peu scalables. Les auteurs s'inscrivent dans la tendance de distillation de capacités LLM vers des modèles compacts (famille SetFit, sentence-transformers), appliquée ici pour la première fois à la sélection de plateforme robotique. Ce preprint ne mentionne ni déploiement terrain ni partenariat industriel, mais l'utilisation de mpnet et MiniLM, disponibles en open-source sur Hugging Face, abaisse la barrière à une validation industrielle rapide.

RecherchePaper
1 source
VLANeXt : recettes pour construire des modèles VLA performants
3440arXiv cs.RO 

VLANeXt : recettes pour construire des modèles VLA performants

Une équipe de chercheurs a publié VLANeXt, un modèle Vision-Language-Action (VLA) qui surpasse l'état de l'art sur les benchmarks LIBERO et LIBERO-plus, deux références standards pour l'évaluation de politiques robotiques généralisables. Le papier (arXiv 2602.18532v2), loin de se limiter à une nouvelle architecture, repose sur une étude systématique de l'espace de conception des VLA, structurée en trois axes: les composants fondamentaux, les éléments de perception, et la modélisation des actions. Partant d'une baseline inspirée de RT-2, les auteurs identifient 12 résultats clés formant une recette reproductible pour construire des modèles VLA performants. Le code est publié en open source sur GitHub pour permettre à d'autres équipes de reproduire les expériences et d'itérer sur cette base commune. L'apport principal de ce travail n'est pas le modèle lui-même, mais la méthode. Le domaine des VLA souffre d'un problème structurel: chaque groupe publie son propre modèle avec des protocoles d'entraînement et des setups d'évaluation incompatibles, rendant toute comparaison rigoureuse impossible. VLANeXt impose un cadre unifié qui permet enfin d'isoler quelles décisions de conception ont un effet mesurable sur les performances. Pour les équipes R&D travaillant sur des politiques robotiques généralisables, les 12 findings donnent des règles pratiques sur le choix du backbone VLM, le traitement des entrées visuelles et la tête de prédiction d'actions. La validation en conditions réelles renforce la crédibilité des résultats, même si les détails des expériences physiques restent parcellaires dans l'abstract. Les VLA émergent de la convergence entre grands modèles multimodaux et robotique incarnée. RT-2 (Google DeepMind, 2023) a été le précurseur, montrant qu'un VLM pré-entraîné pouvait piloter un robot réel après fine-tuning. Une vague de travaux a suivi: pi-0 (Physical Intelligence), OpenVLA, Octo, RoboFlamingo. Face à cette prolifération, VLANeXt propose un point de stabilisation méthodologique plutôt qu'une course aux performances brutes. Aucun déploiement industriel n'est annoncé à ce stade, il s'agit d'un travail académique dont la valeur tient à la rigueur comparative. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus exigeants comme BridgeV2 ou DROID, et une adoption par des équipes travaillant sur des plateformes physiques commerciales.

IA physiqueOpinion
1 source
Attention par transport optimal spatio-temporel pour l'apprentissage par imitation visuo-tactile de manipulations avec contact
3441arXiv cs.RO 

Attention par transport optimal spatio-temporel pour l'apprentissage par imitation visuo-tactile de manipulations avec contact

Des chercheurs ont soumis sur arXiv SO-TA (Spacetime Optimal-Transport Attention, réf. 2605.20433), une architecture d'apprentissage par imitation pour la manipulation robotique à contact serré, validée sur trois tâches : insertion peg-in-hole à faible jeu, emmanchement de connecteurs BCM et effacement de marquages sur surfaces courbes. SO-TA fusionne trois modalités en simultané (vision, force/couple F/T et proprioception) via un mécanisme d'attention fondé sur le transport optimal (OT) à entropie régularisée, remplaçant l'attention softmax classique. Les contraintes marginales OT distribuent les masses d'attention entre patches visuels et sous-requêtes dérivées des données force-pose, agissant comme biais inductif structuré pour les phases de contact. La politique de contrôle est un modèle de diffusion séquentiel mappant des fenêtres d'observation en séquences d'actions de pose. Évaluée sur robot réel avec environ 200 trajectoires par condition, SO-TA atteint 100 % de succès sur le peg-in-hole serré (contre 93 % pour l'attention croisée classique) et maintient 82,5 % de succès sous perturbations réalistes (éclairage variable, distracteurs, occlusion partielle), là où une baseline par concaténation chute à 43,5 %. L'écart 82,5 % contre 43,5 % sous perturbations est le résultat structurant pour les intégrateurs industriels : il signifie qu'une politique de manipulation reste opérationnelle dans un atelier aux conditions fluctuantes, sans recalibration constante. L'usage du transport optimal impose une répartition spatiale contrôlée de l'attention, évitant la dispersion caractéristique des softmax sur des scènes encombrées. Pour la recherche, 200 rollouts suffisent à valider l'approche, soulignant l'efficacité des biais inductifs structurés face à la rareté des données de démonstration. La fusion tri-modale confirme qu'aucune modalité seule ne suffit pour piloter les phases de contact à fortes contraintes cinématiques, argument clé dans le débat sim-to-real des politiques VLA (Vision-Language-Action). La manipulation par contact représente un verrou historique du contrôle robotique, où les incertitudes géométriques et les dynamiques de frottement ont longtemps limité les méthodes analytiques. L'imitation learning bi-modale (vision + force) s'est développée depuis le début des années 2020, sans mécanisme d'attention dédié au contact discontinu. SO-TA s'inscrit dans un espace concurrentiel dense : ACT et Diffusion Policy (UMass/MIT) dominent les benchmarks de manipulation fine depuis 2023, et Physical Intelligence (Pi-0) explore la fusion multimodale à plus grande échelle. En Europe, des équipes comme celles de l'INRIA et du DLR travaillent sur des problématiques voisines. La prochaine étape logique serait de valider SO-TA sur un éventail plus large de tâches industrielles, avec des volumes de données plus importants pour confirmer la tenue à l'échelle.

RechercheOpinion
1 source
TimeRewarder : apprendre des récompenses denses à partir de vidéos passives via la distance temporelle entre images
3442arXiv cs.RO 

TimeRewarder : apprendre des récompenses denses à partir de vidéos passives via la distance temporelle entre images

Une équipe de chercheurs a publié sur arXiv (arXiv:2509.26627) une méthode baptisée TimeRewarder, conçue pour automatiser la conception de récompenses denses dans l'apprentissage par renforcement (RL) appliqué à la robotique. L'approche repose sur une idée simple : estimer la progression d'une tâche en mesurant la distance temporelle entre paires de frames extraites de vidéos passives, c'est-à-dire des démonstrations de robots ou des vidéos de comportements humains, sans interaction active avec l'environnement. Ces distances servent de signal de récompense proxy, étape par étape, pour guider l'agent RL. Sur dix tâches du benchmark Meta-World, reconnu pour sa difficulté, TimeRewarder atteint un taux de succès quasi-parfait sur neuf d'entre elles, avec seulement 200 000 interactions par tâche. La méthode surpasse non seulement les approches antérieures de reward learning, mais également les récompenses denses conçues manuellement par des experts, tant en taux de succès final qu'en efficacité d'échantillonnage. Ce résultat a une portée directe pour quiconque déploie du RL en robotique industrielle ou en manipulation : la conception de récompenses denses représente aujourd'hui l'un des goulets d'étranglement les plus coûteux en temps ingénieur. Qu'une méthode vidéo-passive batte le signal dense artisanal sur Meta-World soulève une hypothèse sérieuse : le gap entre démonstration passive et signal d'apprentissage serait moins insurmontable qu'anticipé, à condition de modéliser correctement la progression temporelle. La scalabilité est également notable : TimeRewarder fonctionne avec des vidéos humaines réelles, ce qui ouvre la voie à l'exploitation de corpus vidéo génériques pour pré-entraîner des fonctions de récompense transférables, sans captation robotique spécialisée. Le problème du reward shaping en RL est structurel depuis les travaux fondateurs sur la politique de récompense inverse (IRL) et ses dérivés comme GAIL ou T-REX. TimeRewarder se distingue de ces approches en évitant l'inférence explicite d'une politique de l'expert : il se contente d'ordonner temporellement les états, ce qui est computationnellement plus léger et moins sensible à la qualité des démonstrations. Les concurrents directs incluent VADER, RoboCLIP et les méthodes fondées sur des VLMs comme S3 ou Vid2Rew. La prochaine étape critique sera le passage à des environnements réels (sim-to-real), Meta-World restant un benchmark simulé, et l'extension à des horizons de tâches longues où la distance temporelle devient moins discriminante.

RecherchePaper
1 source
roto 2.0 : l'Olympiade de robotique tactile
3443arXiv cs.RO 

roto 2.0 : l'Olympiade de robotique tactile

Une équipe de chercheurs a publié roto 2.0, deuxième version du Robot Tactile Olympiad, un benchmark standardisé pour l'apprentissage par renforcement (RL) basé sur le toucher. La plateforme, accélérée GPU en parallèle, couvre quatre morphologies robotiques de 16 à 24 degrés de liberté (DOF) et impose un régime de manipulation strictement "aveugle" : les agents n'ont accès qu'à la proprioception et aux capteurs tactiles, sans information d'état, sans vision, sans distillation depuis un teacher model. Le résultat phare : les agents entraînés atteignent 13 rotations de boules Baoding en 10 secondes, que les auteurs décrivent comme un ordre de grandeur supérieur aux performances actuelles de l'état de l'art sur cette tâche. Les environnements, configurations et baselines sont publiés en open source. Ce travail pointe un problème structurel reconnu dans la communauté : la recherche en manipulation tactile reste morcelée, avec une concentration excessive sur des tâches d'orientation surexploitées et peu de benchmarks permettant des comparaisons rigoureuses entre approches. En forçant l'absence totale de perception visuelle, roto 2.0 adresse une contrainte concrète pour les intégrateurs industriels : un manipulateur opérant uniquement par retour tactile et proprioceptif peut fonctionner dans des environnements où les caméras sont inutilisables (assemblage en aveugle, poussière, occlusion totale). L'affirmation d'"un ordre de grandeur plus rapide" mérite cependant d'être nuancée : elle s'applique à cette tâche spécifique en simulation, et le gap sim-to-real reste entièrement à démontrer sur hardware réel. La manipulation dextère sans vision est un défi porté depuis des années par des laboratoires majeurs, notamment OpenAI avec Dactyl (équipe robotique dissoute en 2021) et Stanford avec ses travaux sur la préhension en contact riche, ainsi que par des fabricants de capteurs tactiles comme Xela Robotics ou GelSight MIT. roto 2.0 s'inscrit dans une dynamique de benchmarking plus rigoureux qui traverse la communauté, dans le sillage de ManiSkill et Isaac Lab. En France, le LAAS-CNRS mène des recherches sur des approches similaires de manipulation par contact. En open-sourçant les environnements et des baselines correctement tuned, les auteurs visent explicitement à libérer les chercheurs du coût en temps lié au réglage RL pour qu'ils se concentrent sur les défis algorithmiques fondamentaux.

RecherchePaper
1 source
Planification de mouvement multi-robots à grande échelle par décomposition hiérarchique de l'espace de travail
3444arXiv cs.RO 

Planification de mouvement multi-robots à grande échelle par décomposition hiérarchique de l'espace de travail

Une équipe de chercheurs a déposé en mai 2026 sur arXiv (réf. 2605.20395) une méthode de planification de mouvement pour flottes de robots mobiles qui revendique un gain de temps de calcul allant jusqu'à un ordre de grandeur par rapport aux solveurs existants. Le goulot central du domaine, l'explosion combinatoire de l'espace de configuration joint dont la dimension croît exponentiellement avec le nombre de robots N, est contourné par une recherche discrète dans une décomposition de l'espace de travail (workspace decomposition). Contrairement aux approches antérieures qui fusionnent les robots dans cet espace joint dès la détection d'un conflit, la méthode affine itérativement cette décomposition pour ne résoudre que des sous-problèmes à espaces de configuration découplés et de taille réduite, d'où le terme de hierarchical subproblem expansion dans l'intitulé. Pour les intégrateurs de systèmes multi-robots en entrepôt ou en usine, une latence de planification divisée par 10 ouvre concrètement la porte à une replanification quasi-temps-réel sur des flottes de plusieurs dizaines de robots, un seuil difficile à franchir aujourd'hui avec les solveurs MAPF (multi-agent pathfinding) classiques tels que CBS (Conflict-Based Search) et ses variantes ECBS ou BCBS. L'approche par décomposition itérative de l'espace de travail suggère également une meilleure adaptabilité aux environnements dynamiques, où obstacles ou priorités de mission changent en cours d'exécution. Prudence cependant : il s'agit d'un preprint non encore évalué par les pairs, et l'abstract disponible ne détaille pas les conditions expérimentales précises, notamment la densité de robots testée, la topologie des environnements ou les horizons de planification retenus. La planification multi-robots est un champ structuré depuis deux décennies autour de deux familles antagonistes : méthodes couplées, qui garantissent l'optimalité mais à coût prohibitif, et méthodes découplées, rapides mais sous-optimales. CBS et ses dérivés constituent aujourd'hui la référence académique dominante. Dans l'industrie, des acteurs comme Exotec (Croix, Nord, déployé dans plus de 10 pays avec plus de 600 clients) ou Locus Robotics ont intégré des planificateurs propriétaires à leurs flottes AMR. Ce travail ne mentionne ni partenariat industriel ni calendrier de transfert technologique ; la prochaine étape naturelle serait une validation sur plateforme réelle ou dans un simulateur de référence tel qu'Isaac Sim ou MoveIt 2.

RecherchePaper
1 source
Apprentissage d'une manipulation dextérique robuste en main à partir de capteurs articulaires avec un transformeur proprioceptif
3445arXiv cs.RO 

Apprentissage d'une manipulation dextérique robuste en main à partir de capteurs articulaires avec un transformeur proprioceptif

Des chercheurs publient sur arXiv (2605.21330, mai 2026) le Proprioceptive Transformer (PT), une architecture de contrôle pour la manipulation dextre en main fondée exclusivement sur les capteurs articulaires, sans vision ni retour tactile. Testée sur la main ténosynoviale ORCA, l'approche réalise une rotation continue de cube à une vitesse 3,1 fois supérieure aux méthodes de référence, et estime la position de l'objet avec une erreur quadratique moyenne (RMSE) inférieure de 23,4 % à celle d'un perceptron multicouche (MLP). La politique de contrôle est obtenue par distillation enseignant-élève : une politique enseignante est d'abord entraînée par apprentissage par renforcement avec accès privilégié à l'état de l'objet, puis ses connaissances sont distillées vers le PT, qui opère uniquement sur l'historique de positions et de vitesses articulaires. Ce résultat questionne une hypothèse largement répandue dans le domaine : la nécessité d'une perception externe pour fermer la boucle d'estimation d'état lors de manipulations en main. Les encodeurs articulaires sont présents sur toutes les mains robotiques, y compris les architectures ténosynoviales où la transmission élastique complique l'estimation de la posture réelle des doigts. Que le Transformer extraie implicitement des informations extrinsèques à partir de patterns temporels proprioceptifs constitue une validation partielle du sim-to-real appliqué à la manipulation dextre, un problème longtemps considéré non résolu à l'échelle réelle. La robustesse sur des objets de géométrie variable ou sous charge perturbée reste à démontrer : le preprint ne rapporte de résultats que sur le cube, et les métriques de vitesse de rotation manquent de contexte sur les conditions expérimentales exactes. La manipulation dextre en main est un problème ouvert depuis les années 1990, relancé par OpenAI Dactyl (2019) qui combinait vision externe et simulation massivement distribuée. Les approches concurrentes recourent aujourd'hui à des capteurs tactiles haute résolution (Shadow Hand avec BioTac, Leap Hand, GelSight sur Allegro) ou à des pipelines vision-langage-action de type Pi-0 ou GR00T N2. L'ORCA hand, plateforme académique à actionnement par tendons, reste moins présente dans les benchmarks publiés que l'Allegro ou la Shadow Hand, ce qui limite la comparaison directe avec l'état de l'art. Le preprint ne mentionne ni partenaires industriels ni calendrier de transfert : il s'agit d'une contribution de recherche fondamentale, sans déploiement annoncé.

RecherchePaper
1 source
Contrôle critique de sécurité pour la dynamique de contact implicite lissée
3446arXiv cs.RO 

Contrôle critique de sécurité pour la dynamique de contact implicite lissée

Des chercheurs ont publié en mai 2026 un preprint sur arXiv (2605.21138) proposant un cadre de contrôle sécurisé pour les robots effectuant des tâches à contact riche, telles que la manipulation d'objets ou la locomotion sur terrain irrégulier. Le coeur du problème : les approches dites de dynamique de contact implicite lissée permettent de planifier par gradient sans définir à l'avance les séquences de contact, mais elles introduisent un paramètre de lissage κ qui relaxe les contraintes de complémentarité de contact, créant une erreur entre la force de contact calculée et la force réelle. L'équipe démontre que les violations de contraintes sont non-monotones en κ : réduire κ diminue l'erreur d'approximation de force, mais ne garantit pas une meilleure performance de sécurité. Pour y remédier, ils introduisent des "boundary-focused rollouts" permettant de sélectionner κ en comparant la marge de sécurité à l'erreur d'approximation, puis développent une fonction de barrière de contrôle (CBF) en temps discret fondée sur une approximation de Taylor du premier ordre de la force de contact implicite, augmentée d'une marge robuste fixe. Sur quatre systèmes simulés à contact riche, la méthode élimine les violations de force observées avec un CBF standard. Ce résultat intéresse directement les équipes qui tentent de déployer des contrôleurs basés sur l'apprentissage ou la planification différentiable dans des contextes industriels où la sécurité est critique, comme l'assemblage, le soudage ou la chirurgie assistée. La démonstration que κ plus petit n'implique pas moins de violations est contre-intuitive et remet en cause une hypothèse implicite répandue dans la littérature sur la simulation différentiable. Le framework CBF proposé offre une garantie formelle de borne sur la force de contact, une propriété rare dans les pipelines de contrôle par apprentissage, et potentiellement exploitable sans reformuler entièrement le planificateur sous-jacent. La dynamique de contact implicite lissée s'inscrit dans une vague de travaux sur la simulation différentiable pour la robotique (MuJoCo MJX, Drake, DiffTaichi), qui cherchent à remplacer les automates hybrides à modes discrets par des formulations continues et différentiables. Les CBF sont un outil mature issu de la théorie du contrôle, popularisé pour la robotique par des groupes comme Caltech (Aaron Ames) et Georgia Tech. La méthode concurrente classique repose sur l'énumération explicite des modes de contact, plus sûre mais bien moins flexible. Limite importante à noter : les validations restent à ce stade entièrement en simulation ; aucun déploiement matériel n'est rapporté, et le gap sim-to-real pour les forces de contact reste un obstacle non résolu. Les prochaines étapes naturelles incluent une validation sur hardware et une extension aux systèmes à plus haut degré de liberté.

RecherchePaper
1 source
PointACT : des modèles vision-langage-action (VLA) avec interaction multi-échelle point-action
3447arXiv cs.RO 

PointACT : des modèles vision-langage-action (VLA) avec interaction multi-échelle point-action

Une équipe de chercheurs a soumis en mai 2026 sur arXiv (2605.21414) PointACT, un modèle VLA (Vision-Language-Action) dual-système qui intègre des représentations 3D par nuages de points directement dans le processus de décodage d'actions. Contrairement aux VLAs existants quasi-exclusivement fondés sur des représentations visuelles 2D, PointACT couple un backbone vision-langage préentraîné à un mécanisme d'interaction multi-échelle point-action utilisant une attention fenêtrée bottleneck. Évalué sur les benchmarks LIBERO et RLBench, le modèle améliore le taux de réussite de 10 points de pourcentage sur la suite RLBench-10Tasks par rapport aux VLAs de l'état de l'art. Les gains sont encore plus importants lorsque le backbone est gelé et que l'expert d'action est entraîné from scratch, ce qui suggère une forte modularité de l'architecture. Ce résultat valide une hypothèse longtemps débattue : coupler des représentations géométriques 3D hiérarchiques avec des représentations sémantiques 2D préentraînées est essentiel pour un contrôle robot spatialement ancré. Pour les intégrateurs et les décideurs industriels, cela pointe vers un angle mort structurel des VLAs génériques actuels (OpenVLA, pi-0, GR00T N2) sur les tâches de manipulation de précision : saisie d'objets minces, assemblage, tri serré. La progression de +10% sur RLBench-10Tasks est significative dans un domaine où les gains se mesurent souvent en points uniques. Les études d'ablation confirment que c'est le couplage serré des deux modalités, et non le simple ajout d'un nuage de points, qui génère la performance. Les VLAs à backbone vision-langage dominent la manipulation généraliste depuis 2023, avec OpenVLA (UC Berkeley), pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA) comme références sectorielles. Tous partagent la même limitation héritée : une représentation 2D du monde. PointACT s'inscrit dans un courant moins médiatisé qui cherche à injecter de la géométrie 3D dans ces pipelines, aux côtés de travaux comme RoboPoint. L'étape critique restante est de valider ces architectures hors simulation, sur des capteurs bruités réels (RGB-D, LiDAR), pour confirmer si les gains tiennent face au gap sim-to-real. Ce preprint n'a pas encore été évalué par les pairs.

IA physiqueOpinion
1 source
SUGAR : cadre d'apprentissage généralisable et extensible pour la loco-manipulation humanoïde par vidéos humaines
3448arXiv cs.RO 

SUGAR : cadre d'apprentissage généralisable et extensible pour la loco-manipulation humanoïde par vidéos humaines

Des chercheurs présentent SUGAR (Scalable hUman-video-driven GenerAlizable humanoid loco-manipulation leaRning), un framework publié en préprint sur arXiv (arXiv:2605.20373, mai 2026), conçu pour entraîner des robots humanoïdes à des tâches de loco-manipulation à partir de vidéos humaines non structurées, sans ingénierie de récompenses propre à chaque tâche. Le pipeline se décompose en trois étapes : extraction automatisée de priors cinématiques (trajectoires humain-objet et labels de contact) depuis des vidéos brutes ; raffinement physique via un mimic reward unifié et un progressive state pool qui transforment ces priors imparfaits en mouvements physiquement cohérents ; puis distillation dans une politique hiérarchique composée d'un générateur et d'un suiveur de commandes. Le système a été évalué sur six tâches de loco-manipulation, en simulation et sur matériel humanoïde réel, avec transfert zero-shot vers le monde physique, récupération autonome après échec, et robustesse aux perturbations externes. L'enjeu central est la scalabilité : là où la téléopération humaine, méthode utilisée par Figure AI, Apptronik ou 1X, reste coûteuse et difficile à industrialiser, SUGAR exploite le corpus massif de vidéos humaines disponibles. Le verrou technique était que les priors cinématiques extraits de ces vidéos sont intrinsèquement bruités (occlusions, artefacts de contact, erreurs de retargeting) et inutilisables en l'état pour l'apprentissage. L'étape de raffinement physique est ici la contribution principale. Le fait que la performance scale clairement avec le volume de données vidéo est un résultat significatif : il oriente la recherche vers l'augmentation de données plutôt que l'ingénierie manuelle de récompenses, un changement de paradigme pour les équipes travaillant sur des humanoïdes généralistes. SUGAR s'inscrit dans la vague de contrôle humanoïde piloté par les données, en concurrence directe avec les approches VLA de Physical Intelligence (Pi-0), Google DeepMind, et Nvidia (GR00T N2). Le sim-to-real zero-shot revendiqué reste le défi emblématique du secteur ; les auteurs affirment l'atteindre de manière fiable avec récupération autonome des échecs, mais la sélection de seulement six tâches de démonstration mérite d'être notée. À ce stade, il s'agit d'un résultat académique sans timeline de déploiement commercial : les limites immédiates concernent la diversité des tâches et des environnements testés, qui conditionneront la généralisation à des déploiements industriels réels.

IA physiquePaper
1 source
SPARC : planification de trajectoire spatiale par communication robotique attentive
3449arXiv cs.RO 

SPARC : planification de trajectoire spatiale par communication robotique attentive

Une équipe de chercheurs a publié sur arXiv (référence 2603.02845v3) SPARC, un système de planification de trajectoires pour flottes de robots autonomes décentralisées, centré sur un nouveau mécanisme de communication baptisé RMHA (Relation enhanced Multi Head Attention). Le constat de départ est précis : dans les approches d'apprentissage multi-agents existantes, chaque robot traite les messages de ses voisins de manière uniforme, sans tenir compte de leur distance réelle. En environnement dense, cette indifférence spatiale dilue l'attention là où la coordination est justement la plus critique. RMHA intègre directement les distances de Manhattan par paires dans le calcul des poids d'attention, permettant à chaque robot de prioriser dynamiquement les messages des voisins les plus proches. Ce mécanisme est couplé à un masque d'attention contraint par distance et à une fusion de messages par réseau GRU (Gated Recurrent Unit), le tout entraîné en bout en bout via MAPPO, un algorithme d'apprentissage par renforcement multi-agents. Sur des grilles de 40x40 cases avec 30 % de densité d'obstacles, SPARC atteint environ 75 % de taux de succès, surpassant la meilleure méthode de référence de plus de 25 points de pourcentage. Le résultat le plus structurant est la généralisation zéro-shot : le système est entraîné sur des scénarios à 8 robots et testé directement sur des configurations à 128 robots, sans ré-entraînement. Cette capacité de mise à l'échelle sans supervision supplémentaire est un verrou majeur pour les déploiements industriels réels, notamment en logistique entrepôt où les flottes AMR peuvent dépasser plusieurs dizaines d'unités. Les ablations confirment que l'encodage de la relation de distance est le facteur déterminant du gain de performance en haute densité, ce qui valide l'hypothèse que le biais spatial manquait aux architectures à attention standard appliquées à la coordination robotique. MRPP est un champ de recherche actif depuis une décennie, avec des approches classiques comme CBS (Conflict-Based Search) et des variantes apprises reposant sur QPLEX, MAPPO ou des graph neural networks. SPARC s'inscrit dans la lignée des travaux combinant attention multi-têtes et apprentissage multi-agents coopératif, en corrigeant un angle mort de conception commun à la majorité de ces systèmes. Il n'y a pas, à ce stade, de déploiement annoncé ni de partenariat industriel mentionné : il s'agit d'une contribution de recherche académique. Les prochaines étapes attendues dans ce domaine incluent la validation sur environnements physiques réels et l'extension à des grilles de plus grande dimension, deux conditions nécessaires avant toute intégration dans des systèmes AMR commerciaux.

RecherchePaper
1 source
Réduction des fixations guidée par l'influence des composants pour une conception simplifiée et démontable par robot
3450arXiv cs.RO 

Réduction des fixations guidée par l'influence des composants pour une conception simplifiée et démontable par robot

Une équipe de chercheurs a publié sur arXiv (arXiv:2605.21026) un cadre analytique visant à rendre les produits manufacturés plus faciles à démonter par des robots, en ciblant précisément les fixations à supprimer dès la phase de conception. Le système prend en entrée un modèle CAO et génère automatiquement un graphe de contacts-connexions-contraintes (CCC), qui encode les dépendances structurelles entre composants. À partir de là, un algorithme de planification de séquences de désassemblage robotique calcule des scores d'influence par composant : plus une fixation génère souvent des violations de contraintes ou dégrade les objectifs d'optimisation dans les séquences calculées, plus son score est élevé. Ces scores sont ensuite projetés sur la géométrie CAO sous forme de heatmaps 3D, signalant visuellement les points de friction structurels. Le système simule ensuite analytiquement la suppression des fixations les plus problématiques et prédit les gains attendus en termes de réduction de contraintes, de changements d'outil et de distances parcourues par le robot, tout en bloquant les modifications structurellement dangereuses via des métriques de stabilité géométrique. Les expériences portent sur sept appareils électroménagers. Ce travail répond à un angle mort réel dans la conception industrielle orientée fin de vie : les ingénieurs n'ont aujourd'hui aucun retour quantitatif sur le coût robotique de leurs choix de fixation. Sur les sept produits testés, la suppression des fixations recommandées a éliminé entre 8 et 132 contraintes structurelles dans le graphe CCC selon la complexité du produit, supprimé des changements d'outil inutiles, et réduit les distances de déplacement robot de 165 à 1675 millimètres là où la stabilité le permettait. Ces chiffres restent hétérogènes selon les configurations, et l'étude ne rapporte pas de temps de cycle ni de taux de succès en conditions réelles, ce qui limite la portée opérationnelle immédiate des résultats. L'approche prouve néanmoins qu'une boucle de retour CAO-vers-planification est techniquement faisable et peut guider le design-for-disassembly de façon non-experte. Le contexte est celui d'une pression réglementaire et économique croissante sur le remanufacturing, notamment en Europe avec les directives écoconception et la taxonomie verte. La désassemblabilité robotique est un prérequis pour industrialiser la revalorisation des produits en fin de vie à coût compétitif. Du côté académique, plusieurs groupes travaillent sur la planification de séquences de désassemblage (notamment les équipes autour des graphes AND/OR), mais peu couplent ces résultats à des recommandations actionnables de redesign. Côté industrie, des acteurs comme Bosch ou Renault investissent dans des lignes de démontage semi-automatisées, tandis que des startups européennes comme Ecochain ou Lizeo opèrent sur la traçabilité des composants. La prochaine étape naturelle pour ces travaux serait une validation sur des assemblages industriels réels (moteurs, modules électroniques) et l'intégration dans un outil CAO commercial.

RecherchePaper
1 source