Aller au contenu principal

Actualités robotique — page 68

4 565 articles au fil, du plus récent au plus ancien.

Planification de mouvement vérifiée dans l'espace des tâches sous contraintes articulaires
3351arXiv cs.RO 

Planification de mouvement vérifiée dans l'espace des tâches sous contraintes articulaires

Une équipe de chercheurs présente dans un preprint arXiv (2605.22991, mai 2026) une méthode pour certifier formellement la planification de mouvement des bras manipulateurs face aux limites articulaires. Les planificateurs réactifs dans l'espace cartésien comme Bug2 opèrent avec des pas fixes sans tenir compte des butées angulaires ; lorsque la jacobienne est mal conditionnée, même un petit déplacement cartésien peut forcer un mouvement articulaire hors limites, provoquant une dérive de suivi et l'échec d'atteinte de l'objectif. La solution calcule, à chaque pas, le plus grand hyperrectangle cartésien certifiablement atteignable via une approximation polynomiale du second ordre de la cinématique inverse et la procédure S, qui forment un programme semi-défini positif (SDP) résolu par bisection en moins d'une milliseconde ; ce certificat est intégré à Bug2 pour adapter dynamiquement le pas au conditionnement cinématique local. Sur 94 scénarios adversariaux couvrant six configurations de limites articulaires, le planificateur SOS-vérifié atteint zéro violation articulaire et 100 % de taux de succès, contre 6 à 11 % de violations et jusqu'à 18 % d'échecs pour le Bug2 standard. Ce résultat comble une lacune bien connue : la planification dans l'espace de travail et la gestion des contraintes articulaires sont traitées séparément dans la plupart des architectures, ce qui génère des comportements indésirables près des singularités cinématiques. La résolution sous-milliseconde rend le module intégrable dans des boucles de contrôle temps réel, le positionnant comme couche de sécurité potentielle au-dessus des planificateurs existants sur des bras industriels comme le KUKA iiwa, l'Universal Robots UR10 ou le Franka Emika Panda. Bug2 est un algorithme réactif classique des années 1980-90, robuste mais agnostique aux propriétés cinématiques du robot, dont l'adaptation aux manipulateurs modernes multi-DDL a toujours souffert de ce manque de cohérence entre espaces cartésien et articulaire. L'usage de la procédure S et des programmes semi-définis pour certifier des atteignabilités locales s'inscrit dans une tendance plus large d'intégration de la vérification formelle (barrières de contrôle, Lyapunov, SOS) dans la planification de mouvement. Ce travail reste un preprint de recherche sans implémentation open-source ni déploiement industriel annoncé ; la validation sur robots physiques multi-DDL en conditions dynamiques réelles demeure l'étape manquante avant toute adoption industrielle.

RecherchePaper
1 source
Combien d'échantillons d'entraînement sont nécessaires pour résoudre la cinématique inverse par réseaux de neurones artificiels
3352arXiv cs.RO 

Combien d'échantillons d'entraînement sont nécessaires pour résoudre la cinématique inverse par réseaux de neurones artificiels

Une étude publiée sur arXiv (réf. 2605.23583) apporte une réponse chiffrée à une question pratique restée sans consensus dans la communauté robotique : combien de données d'entraînement sont nécessaires pour qu'un réseau de neurones artificiels (ANN) résolve correctement la cinématique inverse (IK) d'un bras manipulateur ? Les chercheurs ont généré des jeux de paires position-articulation de tailles croissantes pour entraîner des réseaux feedforward sur un manipulateur articulé, puis ont évalué la précision, la convergence et la capacité de généralisation des modèles obtenus. Résultat principal : au-delà de 125 échantillons d'entraînement, l'ajout de données supplémentaires n'améliore plus significativement l'efficacité du modèle ni la précision d'approximation de l'effecteur terminal. Ce seuil de 125 paires joint-position est une donnée concrète pour les intégrateurs robotiques et les équipes embarquées : il signifie qu'une couverture d'entraînement minimale suffit pour obtenir un solveur IK neuronal opérationnel, sans nécessiter de campagnes de collecte longues ou coûteuses. Cela contredit l'hypothèse implicite selon laquelle les approches par apprentissage exigent systématiquement des volumes de données importants pour rivaliser avec les méthodes analytiques classiques. Pour des systèmes à ressources contraintes, des robots collaboratifs ou des déploiements edge, cette efficacité de données ouvre la voie à une mise en oeuvre plus rapide et moins coûteuse des solveurs IK appris. La cinématique inverse est l'un des problèmes fondamentaux de la commande de bras robotiques : calculer les angles articulaires qui placent l'effecteur à une position cible donnée. Les méthodes traditionnelles, géométriques, algébriques ou basées sur le jacobien, présentent des limites connues face aux configurations singulières ou aux manipulateurs redondants. Les ANN ont émergé comme alternative depuis une dizaine d'années, portés par des travaux issus de laboratoires académiques et de groupes comme OpenAI Robotics ou des équipes universitaires spécialisées en apprentissage robotique. Cette étude comble un manque pratique dans la littérature : elle fournit un cadre mathématique liant taille du dataset et précision du modèle, et constitue un guide dimensionnel directement exploitable pour optimiser le compromis coût de calcul / qualité de prédiction dans des applications industrielles réelles.

RecherchePaper
1 source
Quatre estimateurs proprioceptifs simples pour robots à pattes
3353arXiv cs.RO 

Quatre estimateurs proprioceptifs simples pour robots à pattes

Des chercheurs ont publié sur arXiv (réf. 2605.23100) un rapport technique présentant quatre estimateurs d'état proprioceptifs pour robots à pattes, conçus pour corriger la dérive des centrales inertielles (IMU) de grade consommateur embarquées sur ces plateformes. Le problème central est connu : une IMU seule accumule des erreurs de position et d'orientation au fil du temps en raison du bruit de mesure. L'approche proposée exploite les contacts intermittents des pieds avec le sol comme événements de recalage, sans recourir à des capteurs extéroceptifs (caméras, lidar). L'état estimé comprend l'attitude, la position, la vitesse et les biais IMU. Les quatre variantes progressent en complexité : un filtre de Kalman étendu invariant assisté par contacts (EKF invariant, d'après les travaux de Hartley et al.) à taux de mise à jour réduit, puis ce même filtre augmenté d'une mise à jour par graphe de facteurs, puis un lisseur à décalage fixe intégrant des points d'appui par épisode de contact, avec et sans modélisation d'un biais IMU évolutif. Les quatre implémentations sont disponibles dans la bibliothèque GTSAM (Dellaert et al.) et accompagnées d'une interface compatible ROS2. L'intérêt pratique de cette contribution est double : elle fournit une baseline reproductible permettant de comparer rigoureusement des architectures d'estimation proprioceptive, et elle abaisse le seuil d'entrée pour les équipes d'intégration qui déploient des robots à pattes en environnements sans GPS ni infrastructure de localisation. Disposer d'un odométre fiable à partir des seuls capteurs embarqués est une condition préalable à toute navigation autonome robuste, avant même d'envisager des couches de cartographie ou de planification. Le fait que les quatre variantes soient directement disponibles dans GTSAM, outil standard en robotique académique et industrielle, facilite l'adoption et la comparaison objective des compromis vitesse-précision. Ce travail s'inscrit dans une longue tradition de recherche sur l'estimation d'état pour robots à pattes, où l'EKF invariant de Hartley (Michigan) fait figure de référence depuis 2019. GTSAM, développé par Frank Dellaert à Georgia Tech, est le socle sur lequel reposent de nombreux systèmes de SLAM et d'odométrie dans le domaine. L'article n'est pas associé à un déploiement industriel annoncé : il s'agit d'un preprint académique, pas d'un produit commercialisé. Dans un contexte où Boston Dynamics, ANYbotics, Unitree et des startups comme Figure ou Agility Robotics intensifient leurs efforts sur la fiabilité en milieu réel, la disponibilité d'estimateurs ouverts et testables représente une ressource utile pour accélérer la recherche comparative.

RecherchePaper
1 source
Robots capables de demander des précisions : corriger des récompenses mal alignées grâce à des explications ciblées
3354arXiv cs.RO 

Robots capables de demander des précisions : corriger des récompenses mal alignées grâce à des explications ciblées

Des chercheurs ont publié fin mai 2026 (arXiv:2605.22986) un cadre algorithmique permettant à un robot d'identifier automatiquement les aspects d'une tâche qu'il n'a pas correctement appris à partir de démonstrations humaines, puis de formuler en langage naturel des requêtes ciblées pour obtenir des démonstrations correctives. Le système s'applique à l'apprentissage de fonctions de récompense par imitation : lorsqu'un humain montre plusieurs fois comment accomplir une tâche, certains comportements sont bien couverts, d'autres sous-représentés, soit par charge cognitive, soit par difficulté physique à les démontrer de façon cohérente. Le mécanisme de détection repose sur une observation statistique simple : les caractéristiques bien spécifiées présentent peu de variance entre démonstrations, tandis que celles qui sont ambiguës varient largement. Le robot exploite ce signal pour inférer ses propres lacunes, puis explique verbalement à l'opérateur humain les aspects comportementaux incertains avant de demander de nouvelles démonstrations ciblées sur ces gaps. Le dispositif a été validé sur un domaine de manipulation de table simulé et dans une étude utilisateur avec un robot Franka réel. L'enjeu est direct pour les intégrateurs et les équipes d'automatisation industrielle : l'apprentissage par démonstration (LfD) est l'une des voies les plus prometteuses pour programmer des robots sans expertise en robotique, mais son talon d'Achille reste précisément le comportement divergent au déploiement quand les démonstrations ne couvrent pas suffisamment l'espace des situations réelles. Ce travail propose une boucle de correction active qui réduit l'ambiguïté résiduelle sans imposer à l'opérateur de savoir a priori quoi re-démontrer, ce que ne permettent ni la collecte passive de données supplémentaires ni les requêtes aléatoires. Les résultats montrent une amélioration significative de la récupération de la fonction de récompense correcte, ce qui constitue un signal concret contre l'hypothèse que le "demo-to-deploy gap" serait inévitable avec des démonteurs non experts. Ce travail s'inscrit dans la dynamique actuelle autour des architectures d'apprentissage interactif pour la robotique, à côté des approches de type RLHF robot (reinforcement learning from human feedback) ou des corrections par retour haptique. Il se distingue en rendant le robot explicitement demandeur d'information plutôt que passif. Les concurrents directs incluent les travaux sur l'active inverse reward design de Sadigh et al., ainsi que les approches de preference learning à la PEBBLE. La validation sur Franka, robot dominant des labos académiques, donne une crédibilité matérielle, bien qu'une évaluation sur manipulateurs industriels ou humanoïdes reste à faire. La prochaine étape logique serait de tester ce mécanisme en environnement non structuré ou avec des opérateurs non techniques, ce que les auteurs n'ont pas encore adressé.

RecherchePaper
1 source
GAF : le champ d'action gaussien comme représentation 4D pour la modélisation du monde dynamique en manipulation robotique
3355arXiv cs.RO 

GAF : le champ d'action gaussien comme représentation 4D pour la modélisation du monde dynamique en manipulation robotique

Des chercheurs ont publié sur arXiv (version 5 de l'identifiant 2506.14135) une méthode intitulée GAF, pour Gaussian Action Field, qui introduit un cadre de perception 4D destiné à améliorer la précision des bras manipulateurs robotiques pilotés par vision. Le système s'appuie sur le 3D Gaussian Splatting (3DGS), une technique de reconstruction de scènes popularisée en 2023, qu'il étend avec des attributs de mouvement appris, permettant de modéliser simultanément la géométrie de la scène et la dynamique des actions robot dans le temps. GAF produit trois sorties couplées : une reconstruction de la scène courante, une prédiction de frames futures, et une estimation initiale d'action dérivée du mouvement gaussien. Un module de débruitage aligné action-vision vient ensuite affiner cette estimation. Sur les benchmarks testés, la méthode affiche des gains de +11,54 dB en PSNR, +0,3864 en SSIM et -0,5574 en LPIPS en qualité de reconstruction, ainsi qu'un taux de succès moyen supérieur de +7,3 points de pourcentage sur des tâches de manipulation robotique, par rapport aux meilleures méthodes actuelles. Ce gain de 7,3 % en taux de succès sur la manipulation est notable car il s'obtient sans changer le hardware ni la politique d'action de bas niveau : l'amélioration provient uniquement d'une meilleure représentation perceptive. Les approches Vision-to-Action (V-A), qui prédisent directement les commandes depuis les pixels, peinent face aux scènes dynamiques et aux occlusions partielles. Les méthodes Vision-to-3D-to-Action (V-3D-A), qui passent par une reconstruction 3D intermédiaire, gagnent en robustesse spatiale mais ignorent la dimension temporelle. En ajoutant explicitement le mouvement comme attribut appris dans la représentation gaussienne, GAF réduit ce que le secteur appelle le "reality gap" entre modèle perceptif et commande motrice réelle, un verrou central pour les bras industriels opérant dans des environnements non rigides. Le 3D Gaussian Splatting, base de GAF, a d'abord été développé pour la synthèse de nouvelles vues en vision par ordinateur, avant d'être rapidement adopté dans la robotique pour ses avantages en temps de rendu et en différentiabilité. Plusieurs groupes explorent déjà des extensions dynamiques de 3DGS pour la navigation et la saisie d'objets déformables. GAF se positionne directement face aux pipelines V-3D-A existants comme NeRF-based manipulation ou GaussianGrasping, ainsi qu'aux architectures VLA (Vision-Language-Action) qui contournent la reconstruction explicite. L'article reste à ce stade un preprint académique sans déploiement annoncé ni partenaire industriel mentionné ; les expériences sont conduites en environnement de laboratoire. Les prochaines étapes naturelles concerneraient la généralisation à des scènes multi-objets dynamiques et des tests sur des plateformes physiques commerciales comme les bras Franka ou UR.

RechercheOpinion
1 source
Flux compositionnelle sparse : assemblage géométrique à partir de primitives de mouvement
3356arXiv cs.RO 

Flux compositionnelle sparse : assemblage géométrique à partir de primitives de mouvement

Des chercheurs publient sur arXiv (réf. 2605.23341) un cadre de génération de trajectoires pour systèmes robotiques embarqués baptisé Sparse Compositional Flow Matching (SCFM). Contrairement aux modèles génératifs classiques qui produisent une trajectoire point par point comme un signal dense et monolithique, SCFM assemble explicitement des "primitives de mouvement" réutilisables via deux modules couplés : le Motion-Primitive Dictionary Learning, qui attribue à chaque atome un masque de longueur appris et des indicateurs binaires de démarrage, et le Structural Sparse Flow Matching with Geometric Constraints, qui génère une matrice de placement sparse via une loss géométrique différentiable forçant la continuité spatiale et la contiguïté temporelle aux jonctions. Évalué sur les benchmarks Open X-Embodiment et 3DMoTraj, le framework améliore l'ADE (Average Displacement Error) de 19,2 % et le FDE (Final Displacement Error) de 21,0 % par rapport au meilleur concurrent, ramenant le ratio FDE/ADE de 1,8 à 1,07. L'apport principal est de rendre la génération de trajectoires structurée et décomposable. Les approches actuelles par diffusion ou flow matching classique opèrent dans un espace de haute dimension sans contraintes de structure temporelle, ce qui rend le planificateur difficile à interpréter et à adapter à de nouvelles tâches. Avec SCFM, le dictionnaire de primitives fonctionne comme une bibliothèque de sous-routines motrices réutilisables entre tâches apparentées, et la loss géométrique garantit la cohérence aux jonctions de primitives. Pour un intégrateur ou un architecte de système robotique, cela facilite la décomposition explicite des tâches et le débogage ciblé des erreurs de trajectoire, des gains concrets au-delà de la métrique de benchmark. Ce travail prolonge le courant des modèles génératifs structurés, qui contestent depuis plusieurs années l'efficacité des représentations denses non supervisées. Le flow matching, popularisé à partir de 2022 par les travaux de Lipman et al., s'impose comme alternative aux modèles de diffusion pour sa vitesse d'inférence et fait l'objet d'adaptations actives en robotique embarquée, notamment dans Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA. SCFM reste une contribution académique évaluée sur données publiques, sans déploiement ni pilote annoncé. Les prochaines étapes naturelles incluent une validation sur matériel réel et une intégration dans des pipelines VLA (vision-language-action), où la décomposition en primitives explicites pourrait faciliter le raisonnement de haut niveau des modèles de fondation.

IA physiquePaper
1 source
V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)
3357arXiv cs.RO 

V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)

Des chercheurs proposent V-VLAPS (Value-Guided Vision-Language-Action Planning and Search), une méthode qui augmente les modèles VLA (Vision-Language-Action) d'un signal de valeur appris pour améliorer la planification en manipulation robotique. Les VLA encodent perception visuelle, langage et commande motrice pour générer des actions, mais leur comportement purement réactif se dégrade hors distribution d'entraînement ou sur des tâches à horizon long. V-VLAPS ajoute une tête de valeur légère (value head), entraînée sur des trajectoires hors-ligne (offline rollouts), qui prédit les retours Monte Carlo et guide un MCTS (Monte Carlo Tree Search) vers les branches de plus haute valeur. Sur les cinq suites du benchmark LIBERO, V-VLAPS égale la baseline sans valeur au budget de recherche standard ; avec un budget élargi, il la dépasse dans toutes les suites, avec +6 points de pourcentage sur LIBERO-Object et +4 points sur LIBERO-10. L'apport central est de démontrer que les représentations internes des VLA encodent non seulement des informations sur l'échec d'une trajectoire (déjà documenté dans la littérature), mais peuvent aussi estimer la valeur pendant la planification. Cela ouvre une voie pragmatique pour les intégrateurs : renforcer des politiques VLA existantes sans réentraînement complet, par simple ajout d'une tête de valeur et d'un budget de recherche accru. L'analyse révèle toutefois une limite claire : la majorité des échecs durs sont des timeouts au niveau racine, là où les valeurs prédites restent peu différenciées, ce qui plafonne le gain observé et indique que le signal de valeur est encore insuffisamment discriminant en début de trajectoire. Ce travail (préprint arXiv, janvier 2026) s'inscrit dans une série de méthodes cherchant à coupler la puissance générative des VLA modernes (RT-2, OpenVLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) avec des mécanismes de planification structurée, face aux approches concurrentes par world models et diffusion planifiante. Les résultats sont obtenus uniquement en simulation sur LIBERO et ne sont pas encore validés sur robot réel, limite classique de ce type de contribution arxiv. La prochaine étape naturelle est une évaluation sim-to-real pour vérifier si le signal de valeur appris se transfère hors simulation, notamment sur des tâches à contacts complexes ou en environnement non structuré.

RechercheOpinion
1 source
Mélange d'experts structuré sémantiquement pour la manipulation robotique compositionnelle
3358arXiv cs.RO 

Mélange d'experts structuré sémantiquement pour la manipulation robotique compositionnelle

Des chercheurs ont publié le 23 mai 2026 sur arXiv (réf. 2605.23477) un cadre d'apprentissage pour la manipulation robotique compositionnelle baptisé SMoDP (Semantically Structured Mixture-of-Experts Diffusion Policy). L'approche combine des politiques de diffusion avec une architecture Mixture-of-Experts (MoE) guidée sémantiquement : un prédicteur de compétences léger, supervisé par des annotations hors-ligne générées par des modèles vision-langage (VLM), route des séquences d'actions vers des experts spécialisés par phase comportementale (saisie, transport, insertion). La cohérence du routage est assurée par une double stratégie d'alignement contrastif, inter-modal pour ancrer les observations multimodales dans des sémantiques définies en langage naturel, et intra-modal pour maintenir un routage cohérent entre comportements visuellement distincts mais fonctionnellement équivalents. Sur des benchmarks multi-tâches, SMoDP surpasse les baselines diffusion et MoE existantes avec une meilleure efficacité paramétrique, et supporte le transfert vers de nouvelles tâches via fine-tuning frugal. L'enjeu est réel : les politiques de diffusion haute performance sont coûteuses en inférence, tandis que les versions allégées peinent à généraliser dès que le nombre de tâches augmente. Les architectures MoE classiques, qui n'activent qu'un sous-ensemble de paramètres, souffrent d'un défaut de conception : leur routage basé sur des statistiques latentes fragmente les comportements réutilisables entre experts, réduisant l'interprétabilité et la transférabilité. En ancrant la spécialisation dans la structure sémantique de la tâche, SMoDP rend les experts plus modulaires, un avantage direct pour les intégrateurs déployant des robots polyvalents sans réentraîner l'ensemble du modèle. Ce travail s'inscrit dans une course intense à l'efficacité des politiques robotiques. Depuis 2023, les politiques de diffusion (Diffusion Policy, Pi-0 de Physical Intelligence) ont supplanté les approches classiques, et les succès des MoE dans les LLM (Mixtral, Qwen-MoE) ont incité les chercheurs en robotique à adapter ces architectures, avec des résultats mitigés faute d'un bon mécanisme de routage. SMoDP se rapproche des pipelines VLA (Vision-Language-Action) comme OpenVLA ou GR00T N2 de NVIDIA, en intégrant la supervision sémantique par VLM comme lien entre langage et action. À ce stade, il s'agit d'une contribution académique validée en simulation et en environnement de laboratoire, sans annonce de déploiement industriel ni de partenaire commercial ; l'étape logique suivante serait une validation sur plateformes matérielles réelles à grande diversité de tâches.

IA physiqueOpinion
1 source
Exploration autonome de frontières guidée par un VLM
3359arXiv cs.RO 

Exploration autonome de frontières guidée par un VLM

Des chercheurs présentent dans un preprint arXiv (arXiv:2605.23165) une architecture d'exploration autonome où un modèle de vision-langage (VLM) joue le rôle de planificateur stratégique, guidant une pile de contrôle robotique conventionnelle de bas niveau. Le principe est le suivant : aux points de décision, le robot génère un prompt multimodal combinant sa carte courante et des images des frontières candidates, c'est-à-dire les zones situées à la limite du terrain déjà exploré. Le VLM analyse ce prompt et sélectionne la frontière la plus prometteuse, remplaçant les heuristiques géométriques classiques (distance, taille de la zone inexplorée) par un raisonnement spatial contextuel. Validée en simulation sur six environnements intérieurs distincts, l'approche améliore la couverture cartographique jusqu'à 24 % par rapport aux méthodes de référence. Le pipeline est décrit comme léger, sans apprentissage préalable (training-free), et théoriquement transférable à tout robot équipé de capteurs standards et d'une connexion internet. L'intérêt principal réside dans la substitution des heuristiques géométriques pures par le raisonnement visuo-sémantique d'un VLM. En pratique, cela permettrait à un robot d'éviter une frontière menant à un couloir sombre et encombré au profit d'une zone visuellement plus accessible, sans entraînement spécifique à la tâche. Pour les intégrateurs travaillant sur l'inspection industrielle, la recherche et le sauvetage, ou la cartographie en environnement dégradé, cette approche ouvre une voie pour améliorer l'efficacité sans toucher au stack de navigation bas niveau. Cela valide également l'idée que les VLMs peuvent apporter de la valeur en robotique autonome au-delà du dialogue ou de la manipulation d'objets, un débat encore ouvert dans le secteur. Il faut cependant souligner les limites importantes de cette publication : les validations restent purement en simulation, sans déploiement sur robot physique, et le papier ne précise ni quel VLM est utilisé ni les latences induites par les appels API nécessaires, un point critique pour des environnements réellement hazardeux. L'exploration par frontières est une méthode classique, formalisée par Yamauchi dès 1997 ; plusieurs équipes explorent déjà l'intégration de VLMs dans ce cadre, notamment via VLFM (Vision-Language Frontier Maps) ou NavGPT. La dépendance à une connexion internet soulève des questions de robustesse pour les cas d'usage industriels les plus exigeants. Les prochaines étapes naturelles seraient une validation sur plateforme physique et un benchmark contre des baselines VLM alternatives, pour confirmer que le gain de 24 % observé en simulation résiste au reality gap.

RechercheOpinion
1 source
Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos
3360arXiv cs.RO 

Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos

Une nouvelle méthode d'apprentissage par imitation pour robots humanoïdes vient d'être publiée sur arXiv (2605.23762, mai 2026), proposant un cadre à étape unique baptisé Direct Dynamic Retargeting (DDR). L'objectif est d'apprendre des comportements moteurs complexes à partir de simples vidéos monoculaires de démonstration humaine, sans capteurs de mouvement ni combinaisons de capture. Le défi central est morphologique : un humain et un robot humanoïde ne partagent ni les mêmes proportions, ni les mêmes centres de masse, ni les mêmes contraintes articulaires, ce qui rend la transposition directe des trajectoires impossible. Les approches standards, dites Geometric Retargeting ou Indirect Dynamic Retargeting, projettent d'abord le mouvement humain dans un espace cinématique intermédiaire avant de générer les commandes robot, introduisant ce que les auteurs appellent un biais géométrique qui restreint l'espace de solutions et produit des comportements sous-optimaux. DDR supprime cette étape intermédiaire en formulant le problème directement dans l'espace des tâches (task space), couplé à un solveur de contrôle prédictif par modèle (Model Predictive Control, MPC) à base d'échantillonnage, exécuté au sein d'un simulateur physique. Ce couplage permet au système d'optimiser nativement les séquences de contact sol-pied tout en limitant la dérive des entrées, garantissant la faisabilité dynamique des trajectoires générées. Les expériences montrent que DDR surpasse les méthodes de référence en précision de suivi des démonstrations. Plus significatif pour les praticiens : fournir ces références physiquement viables à un agent d'apprentissage par renforcement accélère la convergence de l'entraînement et améliore l'exécution finale de comportements agiles et d'équilibrage dynamique. L'apprentissage par imitation à partir de vidéo est devenu un axe majeur de la robotique humanoïde, porté par des travaux comme Pi-0 de Physical Intelligence ou les pipelines de données de téléopération développés chez Figure AI et Agility Robotics. Ces approches cherchent à exploiter l'immense corpus de vidéos de mouvements humains disponibles en ligne pour réduire le coût prohibitif de la collecte de données sur robot. DDR s'inscrit dans cette tendance mais attaque le problème par la dynamique plutôt que par la géométrie, un pari prometteur qui reste à valider en conditions réelles : aucun résultat physique sur robot n'est présenté dans cet article, uniquement des évaluations en simulation. Le code source sera rendu public, ce qui permettra à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
Exploration multi-étages pour robots terrestres via un graphe atteignable incrémental et des priors structurels
3361arXiv cs.RO 

Exploration multi-étages pour robots terrestres via un graphe atteignable incrémental et des priors structurels

Des chercheurs ont publié sur arXiv (réf. 2605.23350) un framework d'exploration autonome multi-étages pour robots terrestres, baptisé "incremental reachable graph". Le problème adressé est concret : les cartes 2D et 2.5D classiques, qui constituent la base de la quasi-totalité des systèmes SLAM embarqués aujourd'hui, sont incapables de représenter des surfaces traversables superposées comme les escaliers, les rampes ou les paliers intermédiaires. La méthode propose de construire un graphe clairsemé sur les surfaces d'appui atteignables, avec des éléments "tentatives" permettant de maintenir une connectivité plausible même en conditions d'observation sparse. Pour franchir un étage inexploré, le système projette des "task-zone priors" depuis le niveau déjà cartographié afin d'initialiser un graphe hypothétique sur l'étage cible, puis le réconcilie progressivement avec les observations réelles. Un planificateur hiérarchique raisonne ensuite conjointement sur les structures confirmées et hypothétiques pour guider l'exploration globale. Les expériences rapportées combinent simulation et validation embarquée en conditions réelles, avec des gains mesurés en efficacité d'exploration et en complétude de cartographie face aux baselines évaluées. L'enjeu industriel est direct pour les intégrateurs d'AMR (Autonomous Mobile Robots) opérant dans des environnements multi-niveaux : entrepôts à mezzanines, hôpitaux, usines avec niveaux de production distincts. La majorité des flottes commerciales actuelles, y compris celles de MiR, Locus Robotics ou Exotec, restent confinées à un seul niveau ou nécessitent une cartographie manuelle de chaque étage. Un système capable d'auto-explorer et de transférer des connaissances topologiques entre niveaux réduirait significativement le coût de déploiement initial. La contribution théorique clé est la notion de graphe hypothétique initialisé par prior structurel, qui évite le problème classique de l'exploration "à l'aveugle" d'un étage inconnu. Cette problématique de navigation multi-étages est étudiée depuis une dizaine d'années, notamment via les cartes d'élévation 2.5D et les volumes OctoMap 3D, mais ces approches peinent à produire des frontières d'exploration exploitables dans des environnements cloisonnés. Le preprint ne mentionne pas d'affiliation institutionnelle explicite dans l'abstract disponible, ni de plateforme robotique précise utilisée pour les tests réels. Il s'agit à ce stade d'un résultat de recherche, pas d'un système commercialisé ou en pilote industriel. La prochaine étape naturelle serait une validation à plus grande échelle sur des plateformes comme Spot (Boston Dynamics) ou des robots à roues avec capacité de franchissement d'escaliers, un segment encore émergent sur lequel des acteurs comme ANYbotics ou Ascento positionnent leurs offres.

RecherchePaper
1 source
La Chine lance à Pékin la première plateforme de gestion du cycle de vie des robots humanoïdes
3362TechNode 

La Chine lance à Pékin la première plateforme de gestion du cycle de vie des robots humanoïdes

La Chine a lancé à Pékin la première plateforme nationale de gestion du cycle de vie des robots humanoïdes. Chaque robot reçoit, dès sa sortie d'usine, un identifiant numérique unique qui permet un suivi de bout en bout : recherche et développement, fabrication, mise sur le marché, vente, exploitation opérationnelle et recyclage en fin de vie. L'initiative est pilotée par le Comité technique de normalisation pour les robots humanoïdes et l'intelligence incarnée, rattaché au ministère de l'Industrie et des Technologies de l'Information (MIIT). Il s'agit d'une annonce institutionnelle sans précision sur le nombre de robots déjà enregistrés ni sur les fabricants participants. Pour l'industrie robotique, cette plateforme représente un changement structurel significatif : elle introduit une couche de traçabilité réglementaire qui, jusqu'ici, n'existait pas pour cette catégorie de machines. Pour les intégrateurs et les décideurs B2B, cela signifie une clarification des responsabilités en cas d'incident, une meilleure visibilité sur la chaîne d'approvisionnement et un cadre formel de contrôle de marché. C'est aussi un signal politique fort : la Chine anticipe un déploiement à grande échelle de robots humanoïdes dans l'industrie et se dote dès maintenant d'une infrastructure de supervision, avant que les volumes ne rendent la régulation rétroactive impossible. Ce lancement s'inscrit dans une stratégie nationale plus large. Le gouvernement chinois a inscrit les robots humanoïdes comme secteur prioritaire dans plusieurs plans industriels récents, avec des objectifs de production de masse fixés à l'horizon 2027-2030. Des acteurs comme Unitree, Fourier Intelligence ou UBTECH développent activement des plateformes commerciales, tandis que le gouvernement municipal de Pékin et la province du Guangdong ont déjà annoncé des fonds dédiés. À l'échelle internationale, cette initiative de normalisation place la Chine en avance sur l'Europe et les États-Unis, qui n'ont pas encore de cadre équivalent pour la traçabilité des humanoïdes. Les prochaines étapes attendues concernent l'extension du système à des robots non humanoïdes et l'interopérabilité avec des standards industriels existants comme ISO 9283.

Chine/AsieReglementation
1 source
SenseTime mise sur les caméras spatiales grand public pour collecter des données réelles destinées à l'IA incarnée
336336Kr 

SenseTime mise sur les caméras spatiales grand public pour collecter des données réelles destinées à l'IA incarnée

Zhuma Innovation (竹马创新), startup chinoise fondée en novembre 2025, vient de boucler un tour Angel+ de plusieurs dizaines de millions de yuans mené par SenseTime Guoxiang Capital, le bras d'investissement de SenseTime, avec la participation de Dinghui VGC et Fengru Capital. Les fonds serviront au développement produit, à la préparation de la production en série et à l'expansion internationale. La société développe Pebble, une caméra autonome grand public intégrant le rendu 3D Gaussian Splatting (3DGS), la fusion multi-capteurs et une interface AI-native, conçue pour capturer une scène tridimensionnelle aussi simplement qu'une vidéo ordinaire. Le produit est encore en phase de R&D et n'a pas atteint la production industrielle. L'intérêt stratégique de Zhuma dépasse le marché de la caméra 3D : la société se positionne comme infrastructure de données pour l'IA incarnée (embodied AI). Les modèles VLA (Vision-Language-Action) pilotant la prochaine génération de robots humanoïdes sont aujourd'hui majoritairement entraînés sur des données de téléopération, une méthode coûteuse et difficile à scaler. Le consensus qui émerge dans la recherche est que des vidéos en première personne, des données de capteurs spatiaux et des séquences comportementales en environnement réel constitueront la prochaine source dominante d'entraînement. Zhuma propose des données photoréalistes dotées de structure 3D, de sémantique et d'échelle physique correcte, directement utilisables pour construire des world models ou affiner la perception spatiale en simulation, réduisant ainsi la dépendance aux environnements synthétiques dont le réalisme reste limité. La société est cofondée par Zhang Ji, ancien vice-président de Kujiale (plateforme de design d'intérieur à grande échelle en Chine), et dirigée scientifiquement par Guo Jie, maître de conférences permanent à l'Université de Nanjing et spécialiste reconnu du 3DGS. La technologie 3DGS, popularisée depuis 2023, reconstruit des scènes 3D photoréalistes à partir de vidéos ordinaires, avec des performances supérieures au NeRF sur les temps de rendu. L'entrée de SenseTime comme investisseur principal apporte des ressources algorithmiques complémentaires aux capacités matérielles de Zhuma. Le marché reste largement ouvert : les acteurs industriels du lidar et des scanners haute précision n'ont pas encore attaqué le segment consommateur. Les investisseurs positionnent explicitement Zhuma comme un potentiel Insta360 de la caméra spatiale, une marque capable de définir une catégorie hardware avant que le marché ne se structure.

Chine/AsieOpinion
1 source
Blue Dot Touch clôture un tour C++ mené par SAIC Motor et vise l'expansion mondiale de ses capteurs de force
3364Pandaily 

Blue Dot Touch clôture un tour C++ mené par SAIC Motor et vise l'expansion mondiale de ses capteurs de force

La startup pékinoise Blue Dot Touch, spécialisée dans les capteurs de force à six axes, a finalisé un tour de financement C++ de plusieurs centaines de millions de yuans, conduit par SAIC Jinkong et Shangqi Capital, deux véhicules d'investissement du constructeur automobile SAIC Motor. Zhongxin Juyuan, Zhengda Robot et Houwei Capital ont également participé à cette levée. Ce tour intervient un mois seulement après le C+ précédent, portant à trois le nombre de levées majeures en moins de six mois. Sequoia Capital China figure désormais au registre des actionnaires, aux côtés d'investisseurs stratégiques issus des secteurs automobile, semi-conducteurs et robotique. Les fonds couvriront le développement de nouveaux produits, la construction d'une usine intelligente et l'expansion sur les marchés internationaux. Les capteurs six axes sont des composants critiques dans les robots collaboratifs, les systèmes chirurgicaux et les lignes d'assemblage de précision, partout où la mesure des efforts est indispensable à une interaction homme-machine sûre. L'entrée de SAIC Motor dans le capital s'explique par les besoins croissants de l'industrie automobile en automatisation avancée : assemblage de batteries pour véhicules électriques, vissage de précision, inspection en ligne. Pour les intégrateurs et OEM industriels, l'émergence d'un fournisseur chinois compétitif réduit la dépendance aux capteurs importés, notamment japonais et européens, qui dominent historiquement ce marché. Les capteurs six axes constituent un goulet d'étranglement identifié dans le déploiement des humanoïdes et des cobots en Chine, ce qui explique l'accélération des levées dans ce segment depuis 2024. Blue Dot Touch se positionne comme alternative domestique à des acteurs comme ATI Industrial Automation (USA, filiale Schunk), Kistler (Suisse) ou Robotiq (Canada). La concentration d'investisseurs stratégiques issus de l'automobile, de la robotique et de la microélectronique laisse entrevoir une ambition de standardisation dans les futures lignes de production. L'expansion internationale annoncée reste vague : aucune timeline ni partenariat client n'a été communiqué à ce stade.

Chine/AsieOpinion
1 source
Ex-cadre IA incarnée de Huawei : un modèle du monde neuromorphique concurrent de JEPA lève 100 millions de yuans
336536Kr 

Ex-cadre IA incarnée de Huawei : un modèle du monde neuromorphique concurrent de JEPA lève 100 millions de yuans

JuNao Panshi (具脑磐石), startup chinoise spécialisée dans les architectures cognitives pour la robotique incarnée, a annoncé en mai 2026 la clôture d'un tour de financement dépassant 100 millions de yuans (environ 13,5 millions d'euros), conduit par un fonds industriel positionné sur l'intersection neuromorphique et robotique, avec réinvestissement des actionnaires existants et participation de plusieurs fonds de premier rang. Un second tour serait en cours de finalisation simultanément, selon la publication chinoise 36Kr. La société, fondée en 2025, est dirigée par Zhu Senhua, ancien responsable du programme "cerveau incarné" chez Huawei, où il a piloté la plateforme cloud IA-neurosciences, le modèle Pangu pour l'intelligence incarnée et le Global Embodied Intelligence Innovation Center. Titulaire d'un doctorat en neurosciences cognitives de l'Université de Pennsylvanie et d'un post-doctorat au Laboratoire national clé Cerveau et Cognition de l'Académie des sciences de Chine, Zhu Senhua est l'un des rares profils combinant recherche académique en neuro-IA, validation expérimentale et industrialisation à grande échelle. JuNao Panshi développe un Cognitive World Model (modèle de monde cognitif) fondé sur l'intelligence neuromorphique, avec quatre objectifs techniques structurants : apprentissage avec peu de données, forte généralisation intersituationnelle, apprentissage à vie et faible consommation énergétique. Plusieurs proof-of-concepts sont en cours de déploiement auprès de clients industriels en Chine et à l'international. L'intérêt de cette levée dépasse la valorisation d'une startup : elle signale un basculement dans les priorités de R&D du secteur de la robotique incarnée, où le terme VLA (Vision-Language-Action) cède progressivement la place au concept de world model comme axe central de compétition. JuNao Panshi argumente que la grande majorité des approches actuelles restent bloquées sur un paradigme data-intensif et énergivore, incapable de généraliser sans réentraînement à chaque nouvel environnement. En s'appuyant sur les mécanismes fonctionnels du cerveau humain, notamment les neurones multi-compartiments, l'attention non linéaire, la mémoire multi-stades et l'inférence active, la société cherche à construire un système capable d'apprentissage abstrait à partir de peu d'exemples, de mémoire persistante et de planification autonome en conditions réelles. Pour les intégrateurs industriels et les décideurs B2B, la promesse est concrète : un robot qui n'a pas besoin d'être réentraîné à chaque changement de ligne ou d'environnement est un robot économiquement viable à déployer à grande échelle. Sur le plan concurrentiel, la trajectoire technique de JuNao Panshi s'aligne explicitement avec l'architecture JEPA (Joint Embedding Predictive Architecture) de Yann LeCun, dont AMI Labs explore la branche causale et de raisonnement. En parallèle, Fei-Fei Li parie sur l'intelligence spatiale 3D, NVIDIA et Google DeepMind accélèrent la simulation physique et l'apprentissage par interaction réelle. JuNao Panshi se positionne un cran au-dessus dans la hiérarchie qu'elle définit elle-même en cinq niveaux, revendiquant la couche la plus haute : l'inférence active issue des neurosciences cognitives. La stratégie commerciale repose sur un modèle "un cerveau, plusieurs robots, plusieurs morphologies" (一脑多机一脑多形), avec des partenariats matériels déjà établis avec les fabricants de robots Lejiu, Xingchen Intelligence et Zhidongli. La feuille de route prévoit d'ouvrir le modèle de cerveau cognitif universel à l'écosystème d'intégrateurs, une fois les capacités de généralisation jugées suffisantes pour piloter des configurations de robots hétérogènes depuis un seul modèle central.

Chine/AsieActu
1 source
Robot humanoïde chinois épate en dansant le ballet aux côtés de danseurs humains
3366Interesting Engineering 

Robot humanoïde chinois épate en dansant le ballet aux côtés de danseurs humains

UBTECH, entreprise chinoise de robotique fondée à Shenzhen, a présenté son nouveau robot humanoïde Walker C1 lors d'une performance live de ballet et de valse tirée du Lac des Cygnes, aux côtés de danseurs humains. La démonstration, organisée dans le cadre de la China International Supply Chain Expo (Chain Expo) 2026, dont UBTECH vient d'être désigné partenaire humanoïde officiel exclusif, visait à illustrer les capacités de contrôle de mouvement, d'équilibre dynamique et de coordination du robot. Le Walker C1 est un humanoïde électrique pleine taille conçu pour les environnements de service public, accueil d'hôtels, aéroports, centres d'exposition et centres commerciaux. Il intègre un module de navigation autonome U-SLAM, un contrôle de mouvement corps entier, et une vitesse de marche de 6 km/h. Il supporte l'interaction multilingue et est alimenté par un grand modèle d'interaction incarnée développé en interne. UBTECH n'a pas publié de fiche technique complète du C1 au moment de l'annonce. Une unité est déjà déployée à l'Expo 2025 d'Osaka, où elle opère comme guide intelligent dans le pavillon chinois. La démonstration chorégraphique est avant tout un exercice de communication, pas une validation de performance industrielle. Aucune métrique précise sur les degrés de liberté, le couple articulaire ou la précision de répétabilité du C1 n'a été communiquée, ce qui limite l'interprétation technique. En revanche, les données commerciales d'UBTECH méritent davantage d'attention : l'entreprise a enregistré environ 800 millions de yuans (113 millions de dollars) de commandes en 2025, dont un contrat de 250 millions de yuans (35 M$) signé en septembre avec une grande entreprise chinoise non nommée, ainsi que des engagements de 159 millions de yuans en Sichuan et 126 millions de yuans au Guangxi. Ces chiffres signalent un passage concret du stade prototype à la production commerciale à grande échelle. Le secteur automobile se révèle le principal moteur de la demande, avec BYD, Geely, FAW-Volkswagen, Dongfeng Liuzhou Motor et Foxconn comme clients actifs pour des applications de manufacturing et de logistique. UBTECH a franchi en 2025 le cap des 1 000 unités Walker S2 produites dans son usine de Liuzhou, avec plus de 500 robots déjà déployés en opération réelle. L'entreprise cible une capacité de production de 10 000 unités par an d'ici fin 2026. Dans ce contexte, la Chine consolide une course humanoïde qui implique aussi LimX Dynamics, dont le robot Oli avait réalisé une performance de ballet similaire l'an dernier, ainsi que Unitree et Fourier Intelligence. À l'international, les concurrents directs incluent Figure AI, Agility Robotics (Amazon) et Boston Dynamics sur le segment industriel, et Apptronik sur le service. La stratégie d'UBTECH combine une vitrine médiatique grand public via la danse, et un ancrage commercial fort sur les sites industriels et d'exposition, une dualité qui reflète l'ambition de transformer le robot humanoïde en produit de série avant ses rivaux occidentaux.

Chine/AsieOpinion
1 source
L'avenir de l'IA physique n'est pas humanoïde : il est spécialisé et rentable
3367Robotics Business Review 

L'avenir de l'IA physique n'est pas humanoïde : il est spécialisé et rentable

Hailo, fabricant israélien de processeurs IA dédiés au traitement embarqué (edge computing), publie une analyse positionnant l'IA physique comme la prochaine rupture technologique après les phases perception, génératif et agentique. La thèse centrale: les systèmes robotiques autonomes ne peuvent pas dépendre du cloud pour leur boucle de contrôle en temps réel. L'argument est illustré par un cas concret et délibérément banal: un robot d'entretien qui rencontre une chaussette sur le sol. Les systèmes actuels à base de règles prédéfinies la heurtent et se bloquent, nécessitant une intervention humaine. Les architectures alimentées par vision IA l'évitent. Mais la vraie autonomie, selon Hailo, consiste à identifier l'objet, le ramasser et le déposer à sa place, soit une boucle complète perception-raisonnement-action exécutée localement, sans appel réseau. L'article ne fournit pas de métriques de performance ni de benchmarks chiffrés: c'est un positionnement stratégique, pas une publication technique. L'argument pour l'edge est structurellement solide, même si sa source est directement intéressée. La latence introduite par un aller-retour cloud dans une boucle de contrôle robotique représente un risque opérationnel réel: une coupure réseau ou un pic de latence imprévisible dans un contexte de manipulation physique peut provoquer des accidents ou des arrêts de ligne. Le modèle hybride proposé, entraînement dans le cloud, inférence à la périphérie, correspond à ce que déploient déjà des acteurs comme Boston Dynamics (Spot avec traitement embarqué) ou les AMR d'Exotec en logistique. Pour un COO industriel ou un intégrateur, cela se traduit concrètement: les architectures sans dépendance réseau sont une exigence de sécurité fonctionnelle, pas seulement un choix de performance. L'article contredit implicitement la narrative selon laquelle le cloud suffit pour les robots opérationnels, et rejoint les conclusions de plusieurs déploiements terrain où la connectivité intermittente reste le premier point de défaillance. Hailo, fondé en 2017 à Tel Aviv et introduit en bourse en 2024, commercialise les puces Hailo-8 et Hailo-15 destinées à l'inférence embarquée sur caméras, robots et véhicules. Ses concurrents directs sur ce segment sont NVIDIA avec la gamme Jetson Orin, Qualcomm avec ses plateformes Robotics RB-series, et Intel avec les Myriad X. L'article est publié à l'approche du Robotics Summit and Expo de Boston, prévu début juin 2026, où Hailo sera probablement présent. Sur la question humanoïde, le texte est interrompu avant de développer son argument, mais l'amorce est claire: la course au robot polyvalent anthropomorphe (Figure, 1X, Agility Robotics, Unitree) est freinée non par l'IA, mais par les contraintes mécaniques, énergétiques et de coût du hardware. Un signal que les prochains déploiements industriels à grande échelle passeront probablement par des robots à tâche unique, moins coûteux et plus fiables, plutôt que par des humanoïdes généraux.

IA physiqueOpinion
1 source
Rétro-ingénierie du moteur Unitree GO-M8018-6
3368Hackaday Robots Hacks 

Rétro-ingénierie du moteur Unitree GO-M8018-6

Thomas Flayols a entrepris le reverse-engineering du driver propriétaire des moteurs GO-M8018-6 équipant le robot quadrupède Go2 de Unitree Robotics. Ces actionneurs, proches des GO-M8010-6 du Go1 déjà vendus séparément par Unitree, intègrent dans un boîtier compact un réducteur, un encodeur magnétique, un onduleur triphasé, une mesure de courant, un bus RS-485 et un microcontrôleur Cortex-M0 CMS32M57xx de la série CMS32M. La démarche a commencé par l'analyse physique du PCB, rendue difficile par le fait qu'Unitree a délibérément effacé toutes les sérigraphies sur les composants. Un examen aux rayons X combiné à du travail d'investigation a permis d'identifier le MCU et les autres circuits. L'accès SWD via OpenOCD a ensuite été établi, permettant d'extraire la clé de firmware depuis la SRAM du bootloader. Malgré le chiffrement du firmware, cette clé récupérée localement a suffi à le déchiffrer. Un premier firmware personnalisé a pu être développé, que Flayols entend faire évoluer vers une solution open source complète. L'enjeu dépasse le simple exercice technique : un firmware libre pour ces moteurs les rendrait accessibles à un écosystème bien plus large que celui de Unitree, notamment pour des laboratoires de recherche, des intégrateurs et des makers qui souhaitent exploiter ces actionneurs sans dépendre d'un SDK propriétaire fermé. Sur le plan mécanique, ces moteurs offrent un rapport prix/performance solide pour la robotique à articulations compactes. La démarche répond aussi à des préoccupations concrètes de sécurité : le firmware officiel du Go2 a fait l'objet d'accusations sérieuses de malware et de failles documentées, ce qui posait un problème réel pour tout déploiement dans des environnements sensibles. Un firmware alternatif auditée permettrait de contourner ces risques. Unitree s'est imposé ces dernières années comme l'un des rares fournisseurs à proposer des robots quadrupèdes à prix accessible, le Go2 étant commercialisé autour de 1 600 dollars en version Education. Cette accessibilité a généré une communauté active de développeurs, mais l'écosystème propriétaire a toujours constitué une limite. Les moteurs GO-M8010-6 sont déjà vendus séparément et utilisés dans divers projets open hardware, notamment des robots bras. Le travail de Flayols s'inscrit dans une dynamique plus large de démocratisation des actionneurs robotiques, en parallèle d'initiatives comme les moteurs de T-Motor ou les designs ouverts de Mjbots. La prochaine étape annoncée est le développement d'un firmware complet avec contrôle de couple, ouvrant potentiellement la voie à une réutilisation du Go2 dans des contextes où le firmware officiel est inacceptable.

RechercheActu
1 source
La première entreprise chinoise de puces cérébrales pour robots lève des centaines de millions de yuans
336936Kr 

La première entreprise chinoise de puces cérébrales pour robots lève des centaines de millions de yuans

Beijing Weifan Intelligent Technology a levé plusieurs centaines de millions de yuans lors d'un tour de table seed, co-dirigé par Zhongguancun Capital et sa filiale Qihang Investment, avec la participation du Shanghai Future Industry Fund, Shixi Capital, Biwin Storage, Yanhuang Group et deux autres fonds. Fondée en mai 2025 et issue du laboratoire PAICORE Lab de l'Université de Pékin, spécialisé dans les puces neuromorphiques, la société développe une architecture de puce unifiée "grand cerveau / petit cerveau" pour robots humanoïdes et systèmes à intelligence incarnée. Son co-fondateur Yin Jilei regroupe plus de vingt ans d'expérience semiconducteur, avec des passages chez IBM, GlobalFoundries, MediaTek et VIA, puis comme COO de Zhicun Technology ; l'équipe compte également d'anciens ingénieurs de Huawei et Tencent. La puce centrale repose sur une architecture propriétaire baptisée BiGPU (Brain-Inspired GPU), qui fusionne dans un seul bloc matériel calcul neuromorphique par réseau de neurones impulsionnels (SNN, Spiking Neural Network) et GPU généraliste (ANN), sur un jeu d'instructions et une chaîne d'outils logiciels partagés. La mise en production est prévue pour le deuxième trimestre 2027, à l'issue d'un cycle de R&D de deux ans actuellement à mi-parcours. L'enjeu principal est la réduction de la dépendance de la robotique chinoise envers la gamme Jetson de Nvidia, aujourd'hui quasi-incontournable pour l'inférence embarquée dans les robots humanoïdes, mais jugée trop coûteuse, peu localisée et exposée aux restrictions américaines à l'exportation. Aucune puce domestique ne propose encore d'alternative mature. La valeur ajoutée de BiGPU réside dans sa résolution du trilemme puissance de calcul / efficacité énergétique / coût : en convertissant les opérations de multiplication-accumulation matricielle (GEMM), qui représentent plus de 80 % du calcul dans les réseaux de neurones, en additions SNN à faible consommation, Weifan vise une réduction significative de la puissance dissipée sans sacrifier la compatibilité avec les frameworks existants. L'intégration isomorphe, c'est-à-dire un seul ISA partagé pour ANN et SNN plutôt que deux systèmes hétérogènes maintenus en parallèle, simplifie l'intégration côté équipementier. La prise en charge native des architectures Transformer, VLA (Vision-Language-Action) et des modèles du monde ancre BiGPU comme cible industrielle plutôt que démonstrateur académique. Weifan est une spin-off directe du laboratoire PAICORE de l'Université de Pékin, ce qui lui confère une crédibilité technique solide mais aussi la trajectoire classique d'un acteur académique en phase de validation industrielle. La puce ne sera pas disponible avant le deuxième trimestre 2027, laissant une fenêtre ouverte à des concurrents déjà en production : Nvidia Jetson Thor pour les humanoïdes, Qualcomm RB-series côté international, et Cambricon côté chinois. La société annonce des discussions en cours avec plusieurs fabricants de robots humanoïdes de premier plan, certaines ayant dépassé la phase exploratoire, sans divulguer de noms. Les fonds levés sont destinés à finaliser l'architecture du jeu d'instructions, étoffer l'équipe R&D et structurer la définition produit. À ce stade, il s'agit d'un pari sur une architecture prometteuse et une équipe expérimentée, pas encore sur un produit livré.

Chine/AsieOpinion
1 source
Exploration de l'intégration des automates PLC et des robots avec YRG Robotics et Chris Elston
3370Robotics Business Review 

Exploration de l'intégration des automates PLC et des robots avec YRG Robotics et Chris Elston

L'épisode 245 du Robot Report Podcast, publié en mai 2026, met en avant Chris Elston, Chief Robotics Manager pour Yamaha Robotics Group (YRG) Amérique du Nord. Elston y aborde l'intégration pratique des robots industriels et des automates programmables (PLC) dans des environnements de fabrication que les constructeurs de machines et les utilisateurs finaux peuvent réellement déployer. YRG commercialise notamment des modules de convoyeurs linéaires et des interfaces opérateurs avancées, positionnés comme des briques d'automatisation flexibles pour les lignes de production. L'épisode couvre également deux actualités sectorielles : l'extension des capacités de picking de Locus Array via NeuraGrasp, la solution de préhension neuronale de Nexera Robotics, et une analyse du cycle boom-bust dans l'entreposage chez Honeywell. L'épisode est sponsorisé par YRG et par maxon, qui présente au Robotics Summit & Expo 2026 de Boston son portfolio High Efficiency Joint (HEJ) -- des articulations robotiques intégrées combinant moteur, réducteur, électronique et capteurs dans un format compact, au stand 419. L'intérêt de cet épisode pour un intégrateur ou un décideur industriel est moins dans les annonces produits que dans le positionnement assumé du discours : le PLC n'est pas obsolète, il évolue. Dans un secteur où la narratif dominante pousse vers des architectures full-software et des robots "cloud-native", YRG et Elston défendent une continuité avec les standards de l'automatisation industrielle classique. C'est une position commerciale cohérente pour un acteur comme Yamaha Robotics, dont les systèmes visent des intégrateurs déjà ancrés dans les environnements Siemens, Rockwell ou Mitsubishi. Le fait qu'Elston soit également fondateur de MrPLC.com, une communauté en ligne de référence pour les professionnels PLC, renforce la crédibilité de ce positionnement au-delà du seul rôle marketing. Yamaha Robotics Group Amérique du Nord est la branche d'intégration et de distribution de Yamaha Motor pour l'automatisation industrielle, distincte de la division robotique japonaise mais s'appuyant sur les mêmes gammes de robots SCARA, cartésiens et convoyeurs linéaires. Sur le terrain des acteurs HEJ compacts, maxon se retrouve en concurrence directe avec des offres comme les joints modulaires de Hebi Robotics, les actuateurs de Dynamixel (Robotis) ou, sur le segment premium, les solutions de Harmonic Drive. Le Robotics Summit & Expo 2026, co-organisé par The Robot Report et WTWH Media, réunit plus de 70 intervenants confirmés -- Tesla, Toyota Research Institute, Brain Corp, PickNik Robotics notamment -- avec plus de 50 sessions réparties sur des tracks couvrant l'IA physique, la logistique, la santé et les technologies habilitantes. Il est co-localisé avec DeviceTalks Boston, ce qui signale une convergence croissante entre robotique industrielle et dispositifs médicaux.

IndustrielActu
1 source
Google s'associe à un géant japonais de la robotique pour développer les robots d'usine autonomes de prochaine génération
3371Interesting Engineering 

Google s'associe à un géant japonais de la robotique pour développer les robots d'usine autonomes de prochaine génération

Google et FANUC America Corporation ont annoncé un partenariat stratégique visant à intégrer les technologies d'intelligence artificielle de Google dans les systèmes de robotique industrielle du géant japonais, dont les robots équipent déjà des milliers de sites de production dans le monde. L'accord, dont les termes financiers n'ont pas été divulgués, vise à accélérer le déploiement de robots dits à "Physical AI" capables de percevoir leur environnement via des capteurs, de prendre des décisions autonomes et d'exécuter des tâches variables sans reprogrammation manuelle. FANUC a également annoncé une intégration élargie entre sa plateforme de simulation ROBOGUIDE et le framework Isaac Sim de NVIDIA, consolidant ainsi un écosystème de développement robotique centré sur la simulation avant déploiement. La gamme concernée couvre des robots de 3 kg de charge utile jusqu'à 2,3 tonnes, ce qui positionne ce Physical AI sur l'ensemble du spectre industriel. FANUC indique avoir déjà expédié plus de 1 000 robots pour des applications Physical AI depuis la présentation de sa plateforme lors de l'International Robot Exhibition (IREX) de Tokyo en décembre 2025. Ce partenariat est structurellement significatif pour plusieurs raisons. Le groupe Intrinsic de Google est l'un des contributeurs majeurs au Robot Operating System (ROS), plateforme open-source de contrôle robotique que FANUC supporte déjà nativement, aux côtés d'interfaces Python et de communications haute vitesse pour le contrôle externe. L'alignement technique entre les deux acteurs est donc réel, pas seulement commercial. Pour les intégrateurs et décideurs industriels, cela signifie concrètement que des capacités d'adaptation à la variabilité de production, jusqu'ici réservées aux environnements de R&D ou aux démos contrôlées, commencent à migrer vers des lignes de production en conditions réelles. Les 1 000 unités expédiées constituent un premier signal de passage à l'échelle, même si ce chiffre reste modeste au regard du parc robotique mondial, estimé à plusieurs millions d'unités en service. La distinction entre "expédié" et "déployé en production continue" mérite d'être gardée en tête. FANUC, fondée en 1956 et filiale de FANUC Corporation (Japon), est l'un des quatre grands fabricants mondiaux de robots industriels avec ABB, KUKA et Yaskawa Motoman. L'entreprise a historiquement misé sur la fiabilité et la précision répétable plutôt que sur l'adaptabilité, ce virage vers le Physical AI représente donc une évolution de positionnement notable. Sur le terrain concurrentiel, Boston Dynamics (via Hyundai), Figure AI avec son robot 03, et Tesla avec Optimus poursuivent des trajectoires humanoïdes, tandis que des acteurs comme Machina Labs ou Covariant ciblent l'adaptation cognitive en environnement industriel conventionnel. En Europe, Wandercraft et Enchanted Tools restent positionnés sur des niches spécifiques. Les prochaines étapes pour FANUC et Google ne sont pas encore précisées publiquement, mais la montée en cadence des déploiements en Amérique du Nord semble être l'axe prioritaire annoncé par Mike Cicco, président et CEO de FANUC America.

IndustrielOpinion
1 source
Robotics Summit : le discours d'ouverture présente une fondation ouverte pour les robots à base d'IA
3372Robotics Business Review 

Robotics Summit : le discours d'ouverture présente une fondation ouverte pour les robots à base d'IA

Brian Gerkey, co-fondateur d'Open Robotics et actuel directeur technique d'Intrinsic, filiale d'Alphabet dédiée aux logiciels robotiques, prendra la parole le mercredi 28 mai 2026 à 9h00 ET lors du Robotics Summit & Expo de Boston, au Thomas M. Menino Convention & Exhibition Center (salle 253 ABC). Sa conférence, intitulée "An Open Foundation for the Age of AI-Powered Robots", présentera la stratégie de l'Open Source Robotics Alliance (OSRA) en matière d'accessibilité, d'outillage moderne et de sécurité fonctionnelle. Open Robotics, organisation qui maintient le Robot Operating System (ROS) et le simulateur Gazebo, y défendra la thèse que l'open source devient une infrastructure critique à mesure que l'IA physique accélère. La session remplace une conférence initialement prévue avec Russ Tedrake, professeur au MIT et ex-vice-président senior pour les large behavior models au Toyota Research Institute. L'événement rassemble cette année plus de 70 intervenants confirmés issus d'Amazon Robotics, AWS, Tesla, Universal Robots, Brain Corp, PickNik Robotics et Robust AI, avec plus de 50 sessions réparties sur des tracks IA, design, healthcare et logistique. Le signal est moins technique qu'institutionnel. L'émergence des architectures Vision-Language-Action (VLA), des pipelines sim-to-real et des foundation models pour la robotique physique rend la standardisation des middlewares plus stratégique que jamais. ROS 2, qui reste la référence pour la communication inter-processus sur les plateformes industrielles et humanoïdes, est maintenu collectivement via l'OSRA. Pour les intégrateurs et les équipes R&D, le fait que Gerkey articule une roadmap publique au principal salon technique commercial américain de robotique signale que l'OSRA entend jouer un rôle normatif, pas seulement communautaire. La question non résolue est celle de la performance : les pipelines d'inférence GPU modernes imposent des contraintes de latence que les architectures ROS classiques gèrent mal, et c'est précisément là que se jouera la crédibilité du discours. Open Robotics a été fondée en 2012 autour de ROS, né à Willow Garage, l'un des premiers labs à industrialiser la recherche robotique aux États-Unis. Gerkey y a travaillé avant de co-fonder l'organisation, et son rattachement actuel à Intrinsic place cette prise de parole à l'intersection de la stratégie Google/Alphabet et de la gouvernance open source. Sur le plan concurrentiel, l'écosystème ROS fait face à des alternatives propriétaires croissantes : Isaac ROS de NVIDIA, les middlewares maison de Boston Dynamics ou de Figure AI, et des frameworks applicatifs comme LeRobot de HuggingFace. La prochaine étape pour l'OSRA sera de démontrer comment ROS 2 s'intègre nativement avec des architectures de foundation models en production, un point que Gerkey devrait adresser lors de sa session du 28 mai.

InfrastructureOpinion
1 source
La Chine teste des robots humanoïdes dans des plantations de thé avant les Jeux mondiaux de robotique 2026
3373Interesting Engineering 

La Chine teste des robots humanoïdes dans des plantations de thé avant les Jeux mondiaux de robotique 2026

Le 10 mai 2026, les premières équipes engagées dans les World Humanoid Robot Games 2026 ont déployé leurs robots humanoïdes non pas dans une salle de compétition, mais dans les plantations de thé blanc de Fuding, province du Fujian, l'une des régions productrices les plus importantes de Chine. Ce premier tronçon du relais dit "Energy Transfer" constitue une épreuve de terrain réelle : les robots devaient identifier et cueillir des feuilles de thé, transporter des charges sur des pentes irrégulières, étaler les feuilles pour séchage au soleil, puis participer aux étapes de torréfaction et de pressage en galettes. Selon CGTN, l'exercice est explicitement conçu comme un banc de collecte de données pour les systèmes d'IA généraliste et d'IA incarnée (embodied AI), dans des conditions impossibles à reproduire fidèlement en laboratoire. L'intérêt technique de ce choix d'environnement est réel, et va au-delà de l'opération de communication. Les plantations de thé cumulent précisément les variables qui mettent en défaut les robots humanoïdes actuels : terrain pentu et non structuré, variation naturelle des objets à manipuler (taille, maturité et position des feuilles changent en continu), lumière fluctuante, et nécessité de combiner locomotion en terrain difficile et manipulation fine. Ce profil de tâche est fondamentalement différent des environnements entrepôt ou atelier où opèrent la plupart des démos publiques d'acteurs comme Figure, Agility Robotics ou Tesla Optimus. Le déploiement en champ de thé signale une volonté de tester le "sim-to-real gap" sur des tâches non structurées, là où les architectures VLA (Vision-Language-Action) actuelles montrent encore des limites documentées à l'échelle industrielle. Les World Humanoid Robot Games ont tenu leur première édition en 2025, rassemblant 280 équipes et plus de 500 robots humanoïdes issus de 16 pays. L'édition 2026 monte en ambition : 32 épreuves réparties en deux catégories, compétitive (26 épreuves sur 9 disciplines : athlétisme, football, gymnastique, haltérophilie, arts martiaux, danse, tir à la corde, et pitch-pot, jeu de précision traditionnel chinois) et scénarisée (6 environnements opérationnels réels : domicile, hôtel, usine, urgence médicale, hôpital, commerce de détail). L'organisation annonce un glissement délibéré des épreuves vers des sites opérationnels réels plutôt que des arènes simulées. Dans le contexte de la course mondiale à la commercialisation des humanoïdes, où Unitree, Zhiyuan et d'autres acteurs chinois accélèrent leurs cycles de déploiement face aux plateformes américaines et européennes, ce type d'exercice collectif à grande échelle représente un vecteur d'entraînement et d'itération difficile à répliquer en dehors d'un programme national coordonné.

Chine/AsieOpinion
1 source
Robot industriel : des inspections dangereuses dans une usine de gaz aux Émirats confiées à un humanoïde
3374Interesting Engineering 

Robot industriel : des inspections dangereuses dans une usine de gaz aux Émirats confiées à un humanoïde

ADNOC a déployé le robot d'inspection Taurob Inspector à la centrale de compression de gaz de Taweelah, opérée par ADNOC Gas dans l'émirat d'Abou Dhabi. Ce robot terrestre, conçu par la société autrichienne Taurob, patrouille de manière autonome les zones classées à risque d'explosion pour surveiller en continu l'état des installations. Il embarque un scanner LiDAR 3D, des caméras thermiques et un système d'imagerie ultra-haute définition offrant une couverture 360 degrés. Un bras articulé à quatre joints lui permet d'accéder à des points d'inspection initialement dimensionnés pour des opérateurs humains, et le robot peut gravir des escaliers industriels inclinés jusqu'à 45 degrés pour couvrir plusieurs niveaux d'une même installation. Certifié ATEX et intrinsèquement sûr, il opère dans une plage de températures allant de -20°C à +60°C, avec des missions en continu pouvant durer jusqu'à quatre heures grâce à une station de recharge et de pressurisation certifiée ATEX. En parallèle, ADNOC a annoncé le co-développement d'un second système, décrit comme le premier robot "opérateur" lourd du secteur énergétique, capable d'interagir physiquement avec les équipements : soulever des outils lourds, manoeuvrer des vannes, relever des jauges, avec une mise en service prévue fin 2026. Ce déploiement illustre un glissement de fond dans l'industrie énergétique : les opérateurs remplacent progressivement les rondes humaines en zones ATEX par des systèmes autonomes capables de détection précoce de fuites de gaz, de signatures thermiques anormales et d'alertes avant défaillance. L'aspect significatif ici est que le déploiement est décrit comme opérationnel sur une installation en production, et non comme un pilote en conditions contrôlées, ce qui représente un seuil de maturité différent de nombreuses annonces du secteur où la frontière entre démo et réalité terrain reste floue. La prochaine étape annoncée, le robot "opérateur" à manipulation physique, marquerait un passage des systèmes d'inspection passifs vers des robots capables d'intervention directe sur les équipements, un segment encore largement émergent dont les performances réelles à l'échelle industrielle restent à démontrer. Taurob, fondée à Vienne, s'est spécialisée sur les robots terrestres pour environnements industriels dangereux, avec une gamme ciblant explicitement les certifications ATEX requises dans le pétrole, le gaz et la chimie. Sur ce segment, la concurrence la plus visible est ANYbotics, la spin-off ETH Zurich dont le quadrupède Anymal patrouille depuis début 2025 l'installation de capture de CO2 Northern Lights d'Equinor en Norvège occidentale, dans des conditions climatiques également sévères. Boston Dynamics avec Spot est aussi présent sur ce marché. Le déploiement à Taweelah s'inscrit dans la stratégie nationale d'ADNOC alignée sur l'UAE AI Strategy 2031 et l'agenda Robotics & Automation des Émirats, cadre institutionnel qui suggère que d'autres déploiements similaires seront annoncés à court terme dans la région.

FR/EU ecosystemeActu
1 source
Atlas affronte un réfrigérateur
3375IEEE Spectrum Robotics 

Atlas affronte un réfrigérateur

La semaine robotique a été dominée par une vidéo de Boston Dynamics montrant Atlas déplacer un mini-réfrigérateur, quelques mois seulement après le dévoilement public de la plateforme. La démonstration ne se limite pas à un exercice de force brute : le robot mobilise l'intégralité de son corps pour gérer la masse et l'inertie de l'objet, en compensant dynamiquement avec son buste et ses membres inférieurs plutôt qu'en s'appuyant uniquement sur ses préhenseurs. C'est le contrôle corps-entier (whole-body control) couplé à de l'apprentissage par renforcement qui permet à Atlas de maintenir l'équilibre avec une amplitude de mouvement décrite comme suprahumaine. La même séquence vidéo révèle à 4 min 10 un comportement inattendu dont la nature précise n'est pas détaillée dans le communiqué, signe que la plateforme continue de surprendre ses propres ingénieurs. En parallèle, Unitree a publié une vidéo de son G1 commandé en temps réel par voix, enregistrée en une seule prise avec son audio d'origine. Dusty Robotics a officiellement retraité son FieldPrinter 1, remplacé par le FieldPrinter 2, plus rapide et plus compact, après avoir imprimé des millions de pieds carrés de gabarits sur des milliers de chantiers de construction. DEEP Robotics présente le Lynx S10, un robot tout-terrain de moins de 20 kg ciblant l'industrie. JSK Robotics Laboratory soumet à l'ICRA 2026 ses travaux sur WiXus, un robot hybride roues-jambes affranchissant les membres de leur rôle locomoteur grâce à un support corporel externe. La progression d'Atlas illustre un saut qualitatif dans la capacité des humanoïdes à opérer en environnement industriel non structuré. Le whole-body control sur un objet lourd et asymétrique comme un réfrigérateur est un test pratique bien plus représentatif que les démonstrations gymniques habituelles : il exige une modélisation en ligne de la masse portée, une compensation dynamique en temps réel, et une tolérance aux perturbations imprévues. Que Boston Dynamics s'appuie sur l'apprentissage par renforcement plutôt que sur une planification de mouvement entièrement analytique confirme une tendance de fond : les pipelines RL et sim-to-real arrivent progressivement à maturité pour des tâches de manutention réelle. Il convient néanmoins de préciser qu'il s'agit d'une démonstration contrôlée, pas d'un bilan de déploiement en production, ce que le communiqué ne distingue pas clairement. Boston Dynamics a lancé la version électrique d'Atlas en avril 2024, succédant à la plateforme hydraulique qui avait fait la notoriété de la société depuis sa fondation en 1992, spin-off du MIT. Depuis son acquisition par Hyundai en 2021, l'entreprise affiche une orientation commerciale plus explicite, ciblant en priorité l'automobile et la logistique lourde. Sur le terrain concurrentiel, Unitree positionne le G1 comme solution d'entrée de gamme à partir de 16 000 dollars, Figure AI prépare le déploiement de Figure 02 chez BMW, et Tesla pousse Optimus vers une production en série. Le SpikerBot de Backyard Brains, kit à 219 dollars déjà financé sur Kickstarter, occupe un créneau radicalement différent, celui de la robotique éducative à programmation neuronale directe, rappelant que l'innovation sectorielle ne se joue pas uniquement dans les entrepôts.

HumanoïdesActu
1 source
Plus One Robotics diffuse huit heures de performances en direct d'automatisation d'entrepôt
3376Robotics & Automation News 

Plus One Robotics diffuse huit heures de performances en direct d'automatisation d'entrepôt

Plus One Robotics, spécialiste américain de l'automatisation des entrepôts basé à San Antonio (Texas), a organisé une démonstration en direct de huit heures de son système d'induction de colis piloté par IA, diffusée simultanément sur ses chaînes YouTube et LinkedIn. L'exercice consistait à montrer un système robotique d'induction de colis fonctionnant en continu, sans interruption, dans des conditions opérationnelles réelles. La durée volontairement longue du stream visait à offrir une fenêtre transparente sur les performances effectives de la robotique d'entrepôt à grande échelle, au-delà des extraits soigneusement montés habituellement présentés dans les démonstrations marketing. L'article ne précise pas les métriques de cadence ou de taux d'erreur atteints pendant ces huit heures, ce qui limite l'évaluation objective de la performance annoncée. La démarche est significative dans un secteur où le gouffre entre démo et réalité terrain reste un sujet brûlant. Montrer huit heures de fonctionnement non interrompu est une réponse directe aux sceptiques qui pointent le cherry-picking des vidéos promo. Pour les intégrateurs logistiques et les COO de centres de distribution, la continuité opérationnelle et la tolérance aux cas limites comptent bien plus que des pics de performance isolés. Si les métriques associées (throughput réel, taux de succès de saisie, types de colis traités) sont publiées, ce stream constituerait une référence utile pour les appels d'offres. Plus One Robotics opère dans un segment très concurrentiel dominé par Mujin, Pickle Robot, Covariant et Symbotic pour la manipulation de colis en entrepôt. La société a notamment des déploiements annoncés chez des opérateurs logistiques majeurs et s'appuie sur une approche Human-in-the-Loop ("Yonder") pour gérer les cas d'exception. Cette démonstration longue durée s'inscrit dans une tendance plus large du secteur vers la validation publique de la robustesse, après une période où les promesses marketing ont précédé les résultats terrain.

IndustrielActu
1 source
Gecko Robotics teste le lidar couleur nouvelle génération d'Ouster pour améliorer l'inspection d'infrastructures par IA
3377Robotics & Automation News 

Gecko Robotics teste le lidar couleur nouvelle génération d'Ouster pour améliorer l'inspection d'infrastructures par IA

Gecko Robotics, spécialiste américain de l'inspection robotisée d'infrastructures industrielles, a annoncé intégrer les capteurs lidar Rev8 d'Ouster dans sa plateforme logicielle Cantilever. Le Rev8 est la nouvelle génération de lidar digital d'Ouster, conçue pour les systèmes d'IA physique, et introduit des couches de données supplémentaires par rapport aux générations précédentes, notamment des capacités de perception couleur qui permettent d'enrichir les nuages de points 3D d'informations chromatiques. Gecko utilise déjà les lidars Ouster pour naviguer dans des environnements industriels complexes tels que centrales électriques, raffineries ou réservoirs. Il s'agit à ce stade d'une phase de test et d'intégration, pas d'un déploiement commercial confirmé à grande échelle. L'ajout de données couleur au lidar change la donne pour l'inspection d'actifs industriels : il permet de corréler la géométrie 3D avec des indicateurs visuels de dégradation (corrosion, fissures, dépôts) sans multiplier les capteurs hétérogènes. Pour un intégrateur ou un opérateur industriel, cela se traduit par des modèles d'IA plus précis pour la détection d'anomalies, avec potentiellement moins de passages robot nécessaires par site. C'est aussi un signal fort que les lidar digitaux convergent vers des capteurs multimodaux capables de remplacer des combinaisons caméra+lidar. Ouster, issu de la fusion avec Velodyne en 2023, positionne sa gamme OS/Rev autour des applications d'IA physique industrielle face à des concurrents comme Hesai, RoboSense ou Luminar. Gecko Robotics, dont la plateforme Cantilever cible les secteurs de l'énergie et de la défense, avait levé 100 millions de dollars en 2022. Cette collaboration illustre la tendance à construire des stacks d'inspection complètes en combinant perception avancée et logiciel d'analyse propriétaire, plutôt que de vendre des robots isolés.

IndustrielOpinion
1 source
GE Vernova acquiert Robotech Automation pour développer son intégration robotique
3378Robotics Business Review 

GE Vernova acquiert Robotech Automation pour développer son intégration robotique

GE Vernova, géant de l'énergie issu du démantèlement de General Electric en 2024 et dont le siège est à Cambridge (Massachusetts), a annoncé hier la signature d'un accord d'acquisition de Robotech Automation, intégrateur spécialisé basé à Longueuil, au Québec, près de Montréal. La société cible emploie environ 35 personnes et est cofondée par Carl Thibault et Francis Bourbonnais. Les deux entreprises collaboraient déjà sur des projets actifs au sein de la chaîne d'approvisionnement de GE Vernova, notamment dans ses usines de Schenectady (New York) et Charleroi (Pennsylvanie). L'opération, dont les termes financiers n'ont pas été divulgués, devrait être finalisée début du troisième trimestre 2026. Les équipes de Robotech seront intégrées à l'Advanced Research Center (ARC) de GE Vernova, avec pour mission de déployer des systèmes robotiques à travers l'ensemble de la chaîne d'approvisionnement du groupe, sur les axes sécurité, qualité, délai et coût. Cette acquisition illustre une tendance structurelle dans l'industrie lourde : les grands donneurs d'ordre cessent de sous-traiter l'intégration robotique pour l'internaliser. En absorbant un intégrateur de 35 personnes plutôt qu'en signant un simple contrat de services, GE Vernova sécurise une compétence rare, celle de la conception propriétaire et du déploiement terrain à grande échelle, dans un contexte où la disponibilité d'ingénieurs expérimentés en automatisation industrielle est un goulot d'étranglement réel. Le PDG Scott Strazik a explicitement mentionné l'objectif de bâtir une "capacité de déploiement robotique de classe mondiale" en interne, signal clair que le groupe n'entend plus dépendre de partenaires extérieurs pour ses programmes d'automatisation. Pour les intégrateurs indépendants du secteur énergétique, ce mouvement pose une question directe sur leur positionnement face à des grands comptes qui deviennent progressivement leurs propres concurrents en intégration. GE Vernova opère dans les segments production d'énergie, électrification et éolien depuis sa scission de General Electric en 2024, avec environ 85 000 employés dans une centaine de pays. Au Canada, sa présence remonte à plus de 130 ans, avec plus de 2 400 employés répartis sur six sites, dont le projet de premier petit réacteur modulaire (SMR) du monde occidental développé avec Ontario Power Generation à Toronto. En janvier 2026, le groupe avait annoncé un investissement de près de 600 millions de dollars dans ses usines américaines sur deux ans, avec la création de plus de 1 500 emplois. L'acquisition de Robotech s'inscrit dans cette dynamique d'expansion industrielle et illustre l'émergence de l'écosystème québécois de robotique comme vivier d'acquisition pour les industriels nord-américains. La prochaine étape sera de vérifier si le déploiement dans les usines existantes donne lieu à des résultats mesurables publiés, les annonces de ce type restant souvent sans métriques de suivi.

IndustrielOpinion
1 source
Robot Talk, épisode 157 : générer de nouveaux designs de robots, avec Josie Hughes
3379Robohub 

Robot Talk, épisode 157 : générer de nouveaux designs de robots, avec Josie Hughes

Josie Hughes, professeure assistante à l'École Polytechnique Fédérale de Lausanne (EPFL), était l'invitée du 157e épisode du podcast Robot Talk, animé par Claire, pour discuter de l'utilisation de l'intelligence artificielle dans la conception de nouveaux manipulateurs robotiques. Hughes dirige le CREATE Lab à l'EPFL, qu'elle a fondé en 2021. Sa trajectoire académique passe par le Bio-inspired Robotics Lab de l'Université de Cambridge, où elle a soutenu une thèse sur le rôle de la passivité dans les manipulateurs bio-inspirés, c'est-à-dire la capacité d'un mécanisme à absorber et redistribuer l'énergie sans actionnement actif. L'approche de Hughes repose sur un paradigme de co-design : utiliser l'IA non pas pour contrôler des robots existants, mais pour générer des architectures mécaniques nouvelles, en exploitant les propriétés physiques intrinsèques des structures et leurs interactions avec l'environnement. Cette démarche est particulièrement pertinente pour les mains robotiques et les manipulateurs souples, domaines où l'espace de conception est vaste et difficile à explorer manuellement. Appliquée à des secteurs comme la durabilité ou la recherche scientifique automatisée, elle pourrait réduire les cycles d'itération matérielle, traditionnellement longs et coûteux. L'EPFL s'inscrit dans un écosystème européen actif en robotique de manipulation, aux côtés de groupes comme ceux de Sami Haddadin (TU Munich) ou de laboratoires ETH Zurich. Le CREATE Lab se distingue par son ancrage dans la robotique bio-inspirée et la conception morphologique. La discussion en podcast reste à un niveau introductif et ne présente pas de résultats expérimentaux publiés : il s'agit d'une présentation de programme de recherche, pas d'une annonce de déploiement.

FR/EU ecosystemePaper
1 source
Le robot humanoïde d'AGIBOT s'illustre par la danse et la calligraphie lors d'un événement culturel
3380Interesting Engineering 

Le robot humanoïde d'AGIBOT s'illustre par la danse et la calligraphie lors d'un événement culturel

Le 21 mai 2026, la société chinoise AGIBOT a présenté son humanoïde pleine taille A2 lors d'un événement culturel à Jakarta, organisé en partenariat avec ASIX, accélérateur d'IA indonésien. Devant un public mixte, le robot a participé à une session de calligraphie en binôme avec des artistes humains, traçant la phrase "Tea for Harmony", avant d'enchaîner des performances de danse et des fonctions d'hôte interactif. Abel Deng, directeur régional Moyen-Orient et Asie-Pacifique d'AGIBOT, a qualifié 2026 de "jalon critique" pour atteindre un état de déploiement opérationnel, et a listé les applications industrielles et commerciales ciblées pour l'Indonésie : chargement et déchargement sur lignes de production, tri logistique, guidage en espace public, assistance retail, patrouilles de sécurité, inspections et nettoyage commercial. Aucun volume de déploiement, aucun tarif ni spécification technique détaillée du robot A2 n'ont été communiqués lors de l'événement. Il convient de distinguer nettement ce qui a été montré à Jakarta, une démonstration à visée culturelle et commerciale, de ce qui constitue un déploiement réel. Sur ce dernier point, AGIBOT avait franchi un cap concret plus tôt cette année en intégrant ses robots G2 sur une ligne de fabrication de tablettes active chez Longcheer Technology, l'un des premiers usages documentés d'un humanoïde en production d'électronique grand public. Le showcase jakartan relève davantage du positionnement géographique que de la mise en production. L'implication d'ASIX comme partenaire local signale une approche d'adaptation culturelle que plusieurs intégrateurs régionaux jugent indispensable pour réduire les frictions d'adoption dans des marchés à forte sensibilité sociale, notamment en Asie du Sud-Est où l'automatisation progresse rapidement dans les secteurs industriel et de services. AGIBOT est l'un des constructeurs chinois d'humanoïdes les mieux capitalisés, aux côtés d'Unitree Robotics, de Fourier Intelligence et d'UBTECH. Le segment reste extrêmement concurrentiel à l'échelle mondiale : Figure Robotics (Figure 03), Tesla (Optimus Gen 3), Agility Robotics (Digit, déployé chez Amazon), Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Boston Dynamics (Atlas électrique) définissent chacun leur propre lecture du marché entre dextérité, autonomie cognitive et industrialisation à grande échelle. La présence de l'A2 au Met Gala de New York quelques semaines avant Jakarta illustre la double logique de la stratégie AGIBOT : image de marque globale d'un côté, pénétration B2B régionale de l'autre. Les suites annoncées incluent des pilotes dans les secteurs industriels et de services en Indonésie, sans calendrier précis ni volumes confirmés à ce stade.

Chine/AsieOpinion
1 source
De la perception de l'environnement à la transformation du monde : opportunités, voies et pratiques de l'IA physique
338136Kr 

De la perception de l'environnement à la transformation du monde : opportunités, voies et pratiques de l'IA physique

À la conférence AI+ de Beijing Yizhuang en mai 2026, Chen Long, directeur technique "foundation models" de Jiangxing Intelligence (江行智能), a présenté l'architecture d'IA physique industrielle JX-Phi, déjà déployée dans des centrales photovoltaïques et des réseaux électriques au Guizhou et en Mongolie intérieure. Le système couvre plus de 1 000 stations d'inspection avec une précision algorithmique annoncée à 99 %. L'architecture se décompose en trois couches : une infrastructure de données (JX-Phi World), un modèle central en cours d'évolution vers un World Action Model (JX-Phi Brain, intégrant des modèles Vision-Language-Action longue durée, dits LT-VLA), et une couche applicative (JX-Phi Agent) qui orchestre drones, chiens robotiques, robots à roues et bras mécaniques via un contrôleur global de 100 milliards de paramètres. Indicateur structurant : une simple tâche d'inspection d'équipement se décompose en 100 à 200 sous-tâches dans un contexte industriel, contre quelques dizaines en usage grand public. Ce chiffre illustre une bascule dans la compétition autour de l'IA : l'enjeu n'est plus le nombre de paramètres des modèles de base, mais la capacité à déployer des systèmes stables et contrôlés dans des environnements physiques contraignants. La densité des scénarios industriels chinois constitue un avantage structurel difficile à répliquer : le parc de robots industriels installés en Chine représente 8,6 fois celui des États-Unis et a crû d'un facteur 12 en dix ans, alimentant un volant de données continu sans équivalent mondial. L'approche sim-to-real de Jiangxing repose sur un moteur de simulation 3D génératif (AutoWorld) qui produit des scénarios rares, pannes atypiques ou conditions météo extrêmes, avant tout déploiement terrain, réduisant significativement les risques dans des secteurs où l'erreur en conditions réelles n'est pas tolérable, comme l'énergie ou la pétrochimie. Jiangxing capitalise sur cinq couches d'infrastructure que la Chine a constituées : densité de scénarios industriels, modèles open source compétitifs (DeepSeek, Qwen, Kimi) en rattrapage rapide sur les niveaux de performance mondiaux, 4,48 millions de stations 5G représentant plus de 60 % du parc mondial, capacité électrique environ deux fois supérieure à celle des États-Unis, et une co-optimisation logiciel-matériel stimulée en partie par les restrictions d'accès aux puces d'entraînement haut de gamme. Sur le plan concurrentiel, la société se positionne comme fournisseur de système complet face à des acteurs comme Unitree ou Boston Dynamics côté plateformes robotiques, et Physical Intelligence (Pi-0) côté modèles généralistes. Les prochaines étapes visent une extension aux secteurs minier et chimique, où la criticité des tâches et la rareté des données d'incidents justifient précisément l'approche simulation-to-real développée par la société.

Chine/AsieOpinion
1 source
Brain Corp et UC San Diego s'associent pour faire progresser la couche d'intelligence fondatrice pour l'IA physique
3382Robotics & Automation News 

Brain Corp et UC San Diego s'associent pour faire progresser la couche d'intelligence fondatrice pour l'IA physique

Brain Corp, spécialiste californien de l'IA pour robots de service, a annoncé l'extension de sa collaboration de recherche avec l'Université de Californie à San Diego (UCSD). Le partenariat cible deux axes techniques : le mapping sémantique, qui permet à un robot de comprendre la signification fonctionnelle des espaces traversés (zone de caisse, allée frigorifique, quai de chargement), et l'intelligence contextuelle, qui lui permet d'adapter son comportement selon l'état dynamique de l'environnement. Aucune date de livraison, métrique de performance ni chiffre de déploiement n'a été communiqué dans l'annonce publiée. Ce type de recherche vise à combler le fossé entre navigation autonome basique (évitement d'obstacles, planification de trajectoire) et compréhension sémantique de l'environnement, un prérequis pour les robots opérant dans des espaces commerciaux encombrés et changeants. Pour les intégrateurs et les COO industriels, l'enjeu est concret : un robot capable d'interpréter le contexte peut prendre des décisions plus robustes, réduire les interventions humaines et s'adapter à des configurations modifiées sans reprogrammation manuelle. C'est précisément ce que les constructeurs d'AMR cherchent à résoudre pour passer du pilote au déploiement à l'échelle. Brain Corp est connue pour BrainOS, son système d'exploitation robotique embarqué sur des autolaveuses autonomes commercialisées par Tennant, Nilfisk et SoftBank Robotics, avec plusieurs milliers d'unités actives dans la grande distribution américaine. Face à des acteurs comme Locus Robotics, Aethon ou Savioke, Brain Corp mise sur une couche logicielle commune à plusieurs fabricants plutôt que sur du hardware propriétaire. Ce partenariat académique s'inscrit dans une stratégie de R&D long terme visant à positionner BrainOS comme infrastructure d'IA physique généraliste, au-delà du seul nettoyage de sols.

IA physiquePaper
1 source
Huit géants technologiques déploient des flottes autonomes sur le grand terrain d'essai public de Singapour
3383Interesting Engineering 

Huit géants technologiques déploient des flottes autonomes sur le grand terrain d'essai public de Singapour

Singapour a officialisé le 20 mai 2026, lors de l'ATxSummit, le lancement de son premier terrain d'expérimentation public à grande échelle dédié à l'IA physique, situé dans le quartier Punggol Digital District. Ce dispositif, piloté conjointement par l'Infocomm Media Development Authority (IMDA), JTC et le Singapore Institute of Technology (SIT), accueillera dès la fin 2026 des flottes de robots autonomes multiusages et multi-opérateurs dans des espaces publics partagés. Les premières entreprises à co-concevoir et déployer leurs services sont Certis, DHL, Grab et QuikBot, sur des applications de livraison de repas et de colis, nettoyage et patrouille de sécurité. Sur le plan réglementaire, la Land Transport Authority a accordé une exemption au niveau du quartier dans le cadre de l'Active Mobility Act, autorisant des plateformes autonomes à circuler dans des espaces publics normalement fermés à ces usages. En parallèle, Nvidia annonce l'ouverture d'un laboratoire de recherche à Singapour centré sur l'IA embarquée (embodied AI) et l'efficience des systèmes de calcul, en coopération avec des universités, des agences gouvernementales et des industriels. Ce sera le deuxième site de recherche Nvidia dans la région Asie-Pacifique. William Dally, directeur scientifique de Nvidia, a précisé que les travaux viseront notamment des applications d'assemblage automobile. Ce que cette initiative valide, c'est la thèse selon laquelle le "sim-to-real gap" ne se comble pas en laboratoire mais en déploiement réel, avec des contraintes d'infrastructure, de cohabitation humain-robot et de conformité réglementaire que les environnements contrôlés ne répliquent pas. Pour les intégrateurs et les décideurs industriels, la distinction clé ici est celle entre un proof-of-concept filmé et un pilote en conditions réelles multi-opérateurs : Singapour construit délibérément ce second registre. L'association de spécialistes en workflows numériques (FieldAI, Thoughtworks), en localisation et mobilité (Slamtec, Unitree) et en robotique de service (QuikBot) au sein du Centre for Intelligent Robotics de SIT signale une approche orientée stack complet plutôt que brique technologique isolée. Sur le plan concurrentiel, Singapour se positionne explicitement face à des hubs comme Boston, Tokyo ou Séoul, qui concentrent déjà l'essentiel du capital-risque humanoid (Boston Dynamics, Agility, Figure, Unitree, Sanctuary AI). L'avantage singapourien tient à un cadre réglementaire stabilisé et à une continuité d'investissement public : le Home Team Humanoid Robotics Centre, premier site mondial dédié à la robotique humanoïde pour la sécurité publique, avait été annoncé en 2025, et un service de navettes autonomes est opérationnel à Punggol depuis avril 2026. La prochaine étape logique sera l'extension du périmètre d'exemption réglementaire et la mesure des métriques opérationnelles réelles, que Singapour n'a pour l'instant pas communiquées, ce qui tempère légèrement l'ampleur des annonces.

Chine/AsieOpinion
1 source
Les robots humanoïdes entrent dans l'industrie manufacturière : vers de nouvelles forces productives
338436Kr 

Les robots humanoïdes entrent dans l'industrie manufacturière : vers de nouvelles forces productives

UBTECH (优必选), fabricant chinois de robots humanoïdes fondé il y a 14 ans, a franchi en 2025 un jalon industriel concret : l'entreprise affirme avoir été la première au monde à atteindre la production en série et la livraison de plus de 1 000 unités de robots humanoïdes pleine taille, avec sa gamme Walker S. L'objectif annoncé pour 2026 est de 10 000 unités produites, ce qui, selon Tan Min, Chief Brand Officer de l'entreprise, représenterait encore une fraction infime du besoin réel. Le ministère chinois des Ressources humaines, celui de l'Education et celui de l'Industrie ont publié en 2025 un chiffre commun : le déficit de main-d'oeuvre dans le secteur de la fabrication intelligente dépasse 30 millions de postes en Chine. Le Walker S2, troisième génération de la plateforme, intègre une technologie de remplacement de batterie en 3 minutes sans arrêt de production, présentée par l'entreprise comme une première mondiale, sans comparatif tiers disponible pour l'instant. UBTECH travaille avec des partenaires industriels incluant Texas Instruments (États-Unis), Airbus (Europe), Honda Trading (Japon) et BYD (Chine), avec plus de 24 mois de POC (proof of concept) accumulés sur ces sites. L'argument central d'UBTECH n'est pas la performance technique brute mais l'adéquation au besoin opérationnel : des tâches répétitives, à faible complexité sensorimotrice, dans des espaces restreints, sans opération de précision. Le segment ciblé correspond exactement aux postes les plus difficiles à pourvoir dans les usines chinoises, ce qui rend l'argument commercial plus solide que celui de la substitution généralisée. Le fait qu'une entreprise atteigne le seuil de 1 000 unités livrées en conditions industrielles réelles, et non en démo contrôlée, est significatif dans un secteur où la plupart des concurrents en sont encore aux phases pilotes ou aux vidéos de laboratoire. Cela ne résout pas la question du "sim-to-real gap" à grande échelle, mais c'est un point de référence mesurable que le marché attendait. UBTECH existe depuis 2012 et a longtemps dû justifier l'existence même de la catégorie "robot humanoïde industriel". La compétition sur ce segment s'est considérablement intensifiée : Figure (Figure 02/03), Boston Dynamics (Atlas électrique), Tesla (Optimus Gen 2/3), Agility Robotics (Digit, déployé chez Amazon), 1X Technologies, ainsi qu'une centaine d'autres entreprises chinoises. La Chine a inscrit les robots humanoïdes dans son 15e plan quinquennal (2026-2030) comme priorité nationale, et plusieurs villes dont Pékin et Shanghai y consacrent des budgets dédiés. UBTECH se positionne aujourd'hui à la quatrième année d'un plan quinquennal interne, avec pour objectif d'atteindre une vraie industrialisation à grande échelle d'ici 2027-2028 et une présence en environnements commerciaux puis domestiques dans un second temps.

IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques
3385arXiv cs.RO 

IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques

Des chercheurs ont publié sur arXiv (2604.07833) un cadre architectural pour la gouvernance d'exécution des agents incarnés, ces systèmes IA capables d'agir sur des robots, outils ou environnements physiques. La proposition centrale est une couche de gouvernance dédiée, externe à la boucle d'inférence de l'agent, chargée de cinq fonctions : vérification de politiques, admission de capacités, surveillance d'exécution, gestion des rollbacks et déclenchement d'override humain. Cette architecture formalise une frontière de contrôle entre l'agent incarné, des modules de capacité baptisés ECMs (Embodied Capability Modules) et la couche de gouvernance runtime. Les auteurs ont validé l'approche sur 1 000 essais de simulation randomisés couvrant trois dimensions de gouvernance : taux d'interception des actions non autorisées à 96,2 %, réduction des continuations non sécurisées de 100 % à 22,2 % en cas de dérive d'exécution, et 91,4 % de récupération avec conformité totale aux politiques, tous significativement supérieurs aux baselines testés (p<0,001). L'enjeu dépasse la robotique académique. À mesure que des agents IA obtiennent une autorité d'exécution réelle sur des bras industriels, des AMR (Autonomous Mobile Robots) ou des systèmes cyber-physiques, leur contrôlabilité devient un problème d'ingénierie système critique. L'approche dominante actuelle consiste à enfouir la logique de sécurité à l'intérieur de la boucle agent, ce qui rend l'audit difficile et la standardisation quasi impossible dans des environnements réglementés (santé, industrie critique). En externalisant la gouvernance dans une couche séparée, les auteurs proposent un modèle où la politique d'usage peut être modifiée ou vérifiée sans toucher aux poids du modèle, répondant à un besoin concret des intégrateurs industriels qui composent avec plusieurs fournisseurs et des référentiels de sécurité imposés par leurs clients. Ce papier s'inscrit dans un mouvement plus large de "safety at deployment", distinct de l'alignment par entraînement (RLHF, Constitutional AI). Il dialogue avec les architectures de contrôle comme ROS 2 et les travaux sur les systèmes multi-agents à responsabilité distribuée. Le contexte concurrentiel est direct : OpenAI, Google DeepMind, Figure AI, Physical Intelligence et Sanctuary AI développent tous des agents incarnés à capacité d'exécution croissante, mais la gouvernance runtime reste un angle mort industriel. Une telle architecture trouverait une application prioritaire dans les déploiements d'humanoïdes en environnement contrôlé, entrepôts ou lignes d'assemblage, où les opérateurs exigent des garanties d'auditabilité que les architectures end-to-end ne fournissent pas encore.

RechercheOpinion
1 source
OCELOT : odométrie et estimation du contact pour robots à pattes
3386arXiv cs.RO 

OCELOT : odométrie et estimation du contact pour robots à pattes

Une équipe de chercheurs a publié OCELOT (Odometry and Contact Estimation for Legged rObots), un pipeline complet d'odométrie pour robots à pattes reposant exclusivement sur des capteurs proprioceptifs embarqués : une centrale inertielle (IMU) solidaire du corps, des encodeurs articulaires et des capteurs de force. Le système s'appuie sur un filtre de Kalman à état d'erreur (ESEKF) dont l'état est corrigé par les pieds détectés en appui stationnaire. Sa contribution centrale est un module de détection de contact fusionnée et de quantification d'incertitude : deux détecteurs tournent en parallèle pour chaque pied, le premier combinant un modèle de mélange gaussien (GMM) avec une machine à états finis (FSM) à déclenchement anti-rebond sur les données de force, le second appliquant un test de rapport de vraisemblance généralisé (GLRT) sur la vélocité cinématique estimée du pied. Les scores continus issus des deux détecteurs sont fusionnés pour identifier les glissements. Pour valider l'approche, les auteurs ont constitué un dataset de 29 séquences couvrant 2,4 km sur des terrains variés (béton, herbe, graviers, rochers) et ont comparé OCELOT à des méthodes proprioceptives et extéroceptives. Le code et un package ROS2 temps réel sont publiés en open source. L'intérêt principal de OCELOT réside dans sa robustesse aux terrains glissants sans recourir à des capteurs extéroceptifs (caméra, lidar), qui restent coûteux, fragiles et sensibles aux conditions d'éclairage ou de poussière. Pour un intégrateur déployant un robot quadrupède en environnement industriel ou outdoor, disposer d'une odométrie fiable avec uniquement l'équipement embarqué de série réduit significativement la complexité système. La disponibilité d'un package ROS2 prêt à l'emploi abaisse la barrière d'adoption. Le benchmark face à des méthodes extéroceptives constitue un signal fort : il suggère que l'estimation de contact bien conçue peut rivaliser avec des approches visuelles sur des trajectoires courtes à moyennes. Les robots à pattes de type Spot (Boston Dynamics), ANYmal (ANYbotics) ou Unitree B2 sont les cibles naturelles de tels pipelines. L'odométrie proprioceptive pour quadrupèdes est un problème ouvert depuis des années, avec des travaux antérieurs comme Pronto (IIT) ou les pipelines d'ETH Zurich sur ANYmal. OCELOT se distingue par la combinaison explicite GMM+GLRT pour la détection de glissement, un point sensible dans les déploiements extérieurs. Les prochaines étapes probables incluent la validation sur des trajectoires longue distance et l'intégration dans des architectures SLAM proprioceptif complet.

RecherchePaper
1 source
Coordination multi-robots fédérée sans fragmentation multi-agents intra-robot
3387arXiv cs.RO 

Coordination multi-robots fédérée sans fragmentation multi-agents intra-robot

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.11028v2) une architecture de coordination de flottes de robots baptisée Federated Single-Agent Robotics (FSAR). Le principe central s'oppose à une tendance croissante dans la robotique multi-robots : plutôt que de fragmenter chaque robot en plusieurs agents internes spécialisés (approche multi-agent intra-robot), FSAR préserve chaque unité comme un agent unique cohérent, doté de son propre runtime persistant, de son périmètre de politique locale et de son autorité de récupération autonome. La coordination inter-robots s'effectue au niveau de la flotte par fédération, via des registres partagés d'Embodied Capability Modules (ECM), de la délégation de tâches entre robots, une attribution d'autorité sensible aux politiques, et des protocoles de récupération en couches hiérarchiques. Sur des scénarios multi-robots représentatifs, les auteurs mesurent des gains statistiquement significatifs : effet de taille d=2.91 (p<0.001) pour la localité de gouvernance face au contrôle centralisé, et d=4.88 (p<0.001) pour le confinement des défaillances face aux architectures fortement décomposées. Pour les intégrateurs déployant des flottes d'AMR (Autonomous Mobile Robots) en entrepôt ou en environnement industriel, le choix de l'architecture de coordination impacte directement la robustesse opérationnelle. La thèse de FSAR est que la fragmentation intra-robot génère des conflits d'autorité, complique la récupération après panne et dilue la traçabilité des décisions. En maintenant un agent unique par robot, les politiques restent localement auditables, les pannes confinées, et la supervision humaine hiérarchique praticable à l'échelle de la flotte. Ces résultats sont toutefois issus de scénarios simulés qualifiés de "représentatifs" et non d'un déploiement physique documenté, ce qui limite pour l'instant la portée industrielle des conclusions. Le papier s'inscrit dans un débat architectural qui s'intensifie avec la montée en puissance des flottes humanoïdes (Figure AI, Agility Robotics, Apptronik) et des systèmes AMR à grande échelle. Les approches concurrentes, notamment les pipelines LLM/VLA qui décomposent chaque robot en sous-agents spécialisés, offrent davantage de flexibilité mais au prix d'une complexité de gouvernance croissante, selon les auteurs. En Europe, des acteurs comme Exotec (flotte Skypod déployée chez Decathlon et Cdiscount) ou Enchanted Tools (robot Miroka) sont directement concernés par ces choix architecturaux de fond. Le papier est une préprint arXiv en version 2, non encore soumise à ICRA, IROS ou CoRL ; la prochaine étape naturelle serait une validation expérimentale sur plateforme physique réelle.

RecherchePaper
1 source
Attribution et contrôle des artefacts aux frontières de segments dans l'espace du bruit
3388arXiv cs.RO 

Attribution et contrôle des artefacts aux frontières de segments dans l'espace du bruit

Une équipe de chercheurs publie sur arXiv (2506.11642v2) une analyse mécaniste des discontinuités d'exécution aux frontières de blocs d'actions dans les politiques visuomotrices génératives à action chunking. Cette technique, adoptée dans des systèmes comme Diffusion Policy (MIT/Columbia) ou ACT (Action Chunked Transformers, Stanford), consiste à prédire et exécuter plusieurs actions futures en un seul bloc plutôt qu'action par action. Les auteurs montrent d'abord que les métriques d'artefacts de frontière permettent de séparer de façon stable les épisodes réussis des épisodes en échec. Dans des politiques stochastiques, maintenir fixe le contexte d'observation et varier uniquement le bruit latent suffit à moduler systématiquement l'intensité de l'artefact. Sur un même checkpoint Diffusion Policy, la comparaison entre DDPM, DDPM à variance nulle et DDIM confirme que cette contrôlabilité locale dépend de l'intégrité du chemin d'information du bruit initial vers la sortie d'action. Dans un contexte clé favorisant les artefacts élevés, sélectionné par validation matched-continuation sur données tenues à l'écart, le taux de succès passe de 0,033 à 0,717. Ce résultat remet en cause une hypothèse tenace dans la communauté de la robotique apprenante : l'artefact de frontière de bloc n'est pas un simple sous-produit d'exécution à minimiser systématiquement, mais une variable dans l'espace bruit qui peut être attribuée, contrôlée et liée mécanistiquement au résultat de la tâche. Plus troublant encore, la direction préférentielle s'inverse selon le contexte d'exécution local : certains états obtiennent de meilleurs résultats sous artefact faible, d'autres sous artefact élevé, au sein d'une même tâche. Pour les intégrateurs robotiques, cela ouvre la voie à des stratégies d'inférence adaptatives où la sélection du bruit latent devient un levier de performance sans modifier ni réentraîner les modèles. L'action chunking équipe aujourd'hui de nombreuses politiques de manipulation en recherche, dont pi-0 (Physical Intelligence), et commence à apparaître dans des contextes de production. Le débat sur la robustesse à l'exécution et le sim-to-real gap reste central pour les équipes industrielles. Cette analyse fournit un outil diagnostique concret -- les métriques d'artefact comme signal pronostic d'échec -- et suggère que l'optimisation à l'inférence plutôt que la seule modification architecturale pourrait améliorer la fiabilité sur des tâches de manipulation fine. Les prochaines étapes naturelles incluent la généralisation à d'autres architectures VLA (vision-language-action) et la validation sur des plateformes matérielles réelles hors contexte de laboratoire.

IA physiqueOpinion
1 source
PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration
3389arXiv cs.RO 

PGDG : génération de données physiquement ancrée pour l'apprentissage robuste de politiques bimanuelles à partir d'une seule démonstration

Une équipe de chercheurs présente PGDG (Physically Grounded Data Generation), un cadre qui permet d'entraîner une politique de manipulation bimanuelles robuste à partir d'une seule démonstration humaine. Déposé sur arXiv en mai 2026 (réf. 2605.21710), le système attaque un problème structurant du behavior cloning : tout écart par rapport à la trajectoire apprise plonge le robot dans des états hors distribution, sans signal de récupération disponible dans les données d'entraînement. PGDG génère automatiquement, sans annotation humaine supplémentaire, un ensemble compact de trajectoires physiquement plausibles couvrant ces comportements de récupération manquants. Il alterne entre un échantillonneur ancré en physique et un curateur de données qui oriente progressivement l'exploration vers les modes sous-représentés, complété par un reétiquetage d'actions correctives sur les états risqués. Sur la tâche RotateBox-Pitch, manipulation bimanuelles par contact, le taux de succès passe de 38 % à 93 % en simulation et de 35 % à 82 % en transfert zéro-shot vers le robot réel. Appliqué au fine-tuning de GR00T, le modèle de fondation vision-langage-action de NVIDIA, la méthode améliore le taux de succès de 46 % à 77 %. Le résultat le plus notable pour les intégrateurs est le transfert zéro-shot : la politique entraînée exclusivement sur données synthétiques fonctionne directement sur le robot physique, sans adaptation terrain. Ce résultat valide empiriquement que la génération ancrée en physique peut combler le sim-to-real gap pour les tâches en contact, historiquement le talon d'Achille de la manipulation dextère. La compatibilité avec GR00T (un VLA) ouvre également une voie pour enrichir les modèles de fondation à faible coût de collecte : une démonstration unique remplace les centaines typiquement requises en téléopération, ce qui modifie le calcul économique pour tout projet de déploiement à grande variété de configurations. Ce travail s'inscrit dans la course à l'efficacité des données en robotique manipulatrice. L'augmentation spatiale classique, premier concurrent direct, est systématiquement surpassée sur les quatre tâches testées. Les approches alternatives misent soit sur la collecte massive comme ACT/ALOHA (des milliers de démonstrations), soit sur le pré-entraînement multi-tâche à grande échelle comme pi-0 de Physical Intelligence. PGDG se distingue par son paradigme "une démonstration suffit", potentiellement attractif dès que la diversité des pièces ou des configurations rend la collecte par tâche prohibitive. La validation reste pour l'instant en environnement laboratoire ; une évaluation sur des tâches industrielles réelles constituerait la prochaine étape logique.

IA physiqueOpinion
1 source
Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences
3390arXiv cs.RO 

Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences

Une équipe de chercheurs a publié BEAR (Benchmark for Embodied Abilities and Reasoning), un cadre d'évaluation qui décompose les tâches robotiques en 14 compétences atomiques pour diagnostiquer les failles des grands modèles de langage multimodaux (MLLMs) embarqués. Le benchmark regroupe 4 469 échantillons entrelacés image-vidéo-texte couvrant 6 catégories, de la perception bas niveau jusqu'à la planification de haut niveau. Soumis à 20 MLLMs dont GPT-5, il révèle deux résultats principaux : les capacités perceptuelles constituent le principal goulot d'étranglement derrière les échecs de raisonnement, et les modèles présentent une modélisation spatiotemporelle instable qui restait invisible dans les benchmarks précédents. En réponse, les auteurs proposent BEAR-Agent, un agent multimodal augmenté d'outils de raisonnement visuel et spatial, qui obtient une amélioration relative de 17,5 % sur GPT-5 par rapport au modèle de base, avec des gains confirmés en simulation et en robotique réelle. L'intérêt de ce travail tient à la granularité du diagnostic. Les benchmarks existants mesurent si un agent réussit une tâche sans expliquer pourquoi. BEAR révèle que les modèles n'échouent pas d'abord sur le raisonnement abstrait, mais sur la perception : identifier des objets dans une scène, interpréter une séquence vidéo, localiser un élément dans l'espace. Ce résultat contredit l'hypothèse répandue selon laquelle les LLMs auraient comblé le déficit de compréhension scénique grâce à leur préentraînement massif. La découverte sur l'instabilité spatiotemporelle est particulièrement significative pour les intégrateurs déployant des VLA (Vision-Language-Action models) en environnement industriel : elle suggère que les performances observées en démonstration vidéo curatée ne reflètent pas la fiabilité opérationnelle réelle. Ce preprint arXiv (version 2, 2025) s'inscrit dans un effort plus large pour structurer l'évaluation des agents embarqués, là où des benchmarks comme EgoSchema ou OpenEQA traitent la compréhension incarnée sans diagnostiquer les sous-compétences. BEAR se distingue par ses expériences en environnements robotiques réels, contrairement aux approches purement simulées comme EmbodiedScan. Aucun acteur français ou européen n'est directement impliqué dans cette publication académique, qui émane vraisemblablement d'équipes universitaires asiatiques ou nord-américaines au vu de la page projet associée. La prochaine étape logique serait l'adoption de BEAR comme protocole standard dans les pipelines d'évaluation VLA avant tout déploiement physique.

RecherchePaper
1 source
Apprendre à évoluer : champs interactifs multimodaux pour la navigation humanoïde robuste en environnements dynamiques
3391arXiv cs.RO 

Apprendre à évoluer : champs interactifs multimodaux pour la navigation humanoïde robuste en environnements dynamiques

Des chercheurs ont publié sur arXiv (2605.21935, mai 2026) un système de cartographie dynamique baptisé MIF (Multi-modal Interactive Field), conçu pour permettre aux robots humanoïdes de naviguer et de manipuler des objets dans des environnements réels en constante évolution. Testé sur un Unitree G1, le système améliore le taux de relocalisation dans un bureau non-statique de 12 % à 94 %, tout en réduisant l'empreinte mémoire sémantique de 91,4 % grâce à la distillation de features. MIF repose sur trois composantes couplées : un champ d'apparence basé sur le 3D Gaussian Splatting (3DGS) conscient de l'incertitude pour atténuer le flou induit par la marche bipède, un champ spatial maintenant une mémoire topologique de la scène, et un champ géométrique qui calcule une pose d'interaction sûre (Interaction Pose Safety, IPS) avant chaque manipulation. Un score de détection de discordance distingue les fausses alarmes dues aux oscillations du robot des changements persistants réels, et ne met à jour que les zones localement incohérentes. L'enjeu pratique est direct : les systèmes de cartographie sémantique existants (semantic maps, scene graphs) supposent généralement des trajectoires caméra stables et des environnements statiques, deux hypothèses qu'un humanoïde en mouvement viole en permanence. Passer de 12 % à 94 % de succès en relocalisation sur un robot réel dans un bureau avec personnes en mouvement constitue un résultat concret, pas une démo en laboratoire contrôlé. Pour un intégrateur ou un COO industriel évaluant des humanoïdes pour des tâches de pick-and-place, la capacité à maintenir une carte cohérente sous perturbation locomotrice est un prérequis opérationnel non négociable que la plupart des démos actuelles ne valident pas. Le contexte de ce travail s'inscrit dans l'essor du 3DGS comme alternative aux NeRF pour la représentation de scènes en temps réel, une technique popularisée en 2023 et dont l'adaptation à la robotique mobile reste un sujet de recherche actif. L'Unitree G1 est l'une des plateformes humanoïdes commerciales les plus accessibles du marché (autour de 16 000 dollars), ce qui rend ce type de validation plus reproductible que sur des robots propriétaires comme l'Atlas de Boston Dynamics ou le Figure 02. Le code et la page projet sont publiés (ziya-jiang.github.io/MIF-homepage), signal d'une recherche ouverte à la reproduction. Les prochaines étapes naturelles seraient une validation à plus grande échelle et une intégration dans des pipelines de manipulation end-to-end, terrain sur lequel Physical Intelligence (Pi-0) et les équipes GR00T de NVIDIA travaillent en parallèle.

HumanoïdesPaper
1 source
TacO : évaluation comparative des capteurs tactiles pour la manipulation d'objets
3392arXiv cs.RO 

TacO : évaluation comparative des capteurs tactiles pour la manipulation d'objets

Des chercheurs ont publié sur arXiv (réf. 2605.21976) un cadre d'évaluation systématique baptisé TacO, conçu pour comparer les capteurs tactiles sur des tâches de manipulation robotique concrètes. Quatre modalités ont été mises à l'épreuve : capteurs visuels (à base de caméra et d'élastomère), acoustiques, magnétiques et résistifs, testés sur trois scénarios représentatifs de l'assemblage industriel : pick-and-place avec masse inconnue, réorientation d'objet en main, et insertion de connecteur. Pour chaque tâche, des politiques de manipulation distinctes ont été entraînées, puis évaluées selon les propriétés intrinsèques de chaque capteur : résolution spatiale, détection du cisaillement (shear sensing), représentation tactile, et friction du matériau de contact. L'ensemble des capteurs, du code, des données et des configurations matérielles sera rendu public sur le site du projet. Ce travail remet en cause une hypothèse structurante de la communauté robotique : que le toucher améliore systématiquement les performances de manipulation. TacO montre au contraire que l'utilité de l'information tactile dépend fortement de la modalité du capteur, des propriétés mécaniques des matériaux et de la nature exacte de la tâche. Cette nuance a des implications directes pour les intégrateurs et les équipes R&D : choisir un capteur tactile sans référence à la tâche cible relève du pari. Pour les COO et décideurs industriels qui évaluent des solutions de manipulation complexe (assemblage, insertion, tri de pièces), TacO fournit un étalon comparatif là où n'existait jusqu'ici que du consensus non quantifié. Il faut noter que les métriques de performance détaillées par tâche ne sont pas divulguées dans le préprint, ce qui limite l'interprétation sans accès au papier complet. Le besoin de ce benchmark s'inscrit dans une dynamique plus large : le succès des approches vision-language-action (VLA) et de l'apprentissage par démonstration a repoussé les limites du manipulation standard, mais ces méthodes butent sur les tâches à contact riche, où le retour visuel seul ne suffit pas. Plusieurs capteurs font figure de références sectorielles -- GelSight et DIGIT pour le tactile visuel, ReSkin pour le magnétique, des matrices résistives pour la pression -- mais aucune comparaison tête-à-tête rigoureuse ne permettait aux équipes de justifier leur choix. TacO comble ce vide méthodologique. Les prochaines étapes naturelles incluent l'extension à des tâches bi-manuelles, à des environnements moins contrôlés, et l'intégration de ces résultats dans les pipelines d'entraînement de politiques généralisées comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
Comprendre les défaillances multimodales dans le clonage comportemental par découpage d'actions
3393arXiv cs.RO 

Comprendre les défaillances multimodales dans le clonage comportemental par découpage d'actions

Déposée sur arXiv le 22 mai 2026 (arXiv:2605.22493), une étude analyse les mécanismes d'échec du behavioral cloning (apprentissage par imitation) lorsqu'une même observation admet plusieurs actions valides, un cas fréquent en manipulation robotique. Les auteurs se concentrent sur les politiques à action-chunking, qui prédisent des séquences d'actions futures plutôt qu'une action isolée, et distinguent deux familles d'architectures : les politiques à variable latente de type VAE (dont ACT, Action Chunking with Transformers) et les politiques génératives en espace d'action (dont les politiques de diffusion comme Diffusion Policy). Pour les premières, la régularisation posterior-prior (terme KL dans un VAE) crée un compromis difficile : une régularisation forte stabilise l'échantillonnage au déploiement mais efface l'information permettant de distinguer les modes démontrés ; une régularisation faible préserve cette information mais expose à une couverture insuffisante par le prior. Pour les politiques génératives, les auteurs montrent que la multimodalité est bornée par la constante de Lipschitz du transport entre espace de base et espace d'action : une carte lisse ne peut pas distribuer de probabilité substantielle sur plusieurs modes bien séparés sans introduire des transitions brutales dans l'espace de base ou des régions de pont hors support en espace d'action. Ces mécanismes sont validés sur des tâches synthétiques multimodales et des benchmarks de simulation robotique. Ces résultats donnent aux équipes déployant des politiques d'imitation une grille de diagnostic concrète. En manipulation industrielle, où un préhenseur peut légitimement atteindre un objet depuis plusieurs angles, comprendre pourquoi un modèle s'effondre sur certains modes est directement actionnable : le coefficient bêta d'un VAE de type ACT, souvent ajusté empiriquement par tâtonnement, dispose maintenant d'une interprétation formelle. Pour les politiques de diffusion, la contrainte de Lipschitz suggère que la capacité à couvrir plusieurs modes dépend de l'expressivité du réseau de transport, avec un compromis explicite entre lissage et richesse modale. C'est un verrou théorique central pour le déploiement en production, où les observations ambiguës sont la règle plutôt que l'exception. L'apprentissage par imitation connaît un regain d'intérêt majeur depuis 2023, porté par ACT et Diffusion Policy, puis par des architectures plus récentes comme pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), aujourd'hui au coeur des pipelines d'entraînement des robots humanoïdes chez Figure AI, 1X et Agility Robotics. Malgré leurs succès en démonstration, la multimodalité reste l'un des verrous majeurs du sim-to-real et du passage en production à grande échelle. Cette étude, de nature purement théorique, ne propose pas d'architecture clé en main, mais son cadre analytique devrait orienter les prochains choix de conception et les stratégies de collecte de données pour les tâches à haute ambiguïté gestuelle.

RecherchePaper
1 source
Apprentissage par renforcement en boucle fermée pour le contrôle de forme de microfibres déformables par transfert simulation-réel
3394arXiv cs.RO 

Apprentissage par renforcement en boucle fermée pour le contrôle de forme de microfibres déformables par transfert simulation-réel

Des chercheurs ont publié sur arXiv (référence 2605.21688) une approche d'apprentissage par renforcement sim-to-real en boucle fermée pour le contrôle de forme de microfibres déformables. Le système cible la micromanipulation de contact, en l'occurrence des microfibres de soie de 50, 80 et 120 µm de diamètre, sur des longueurs manipulées de 10, 15 et 20 mm. La politique de contrôle est entraînée exclusivement dans un simulateur sans frottement, puis transférée directement vers un système physique à double préhenseur tournant à 40 Hz, sans réentraînement ni adaptation de domaine. Sur 24 configurations initiales variées et 9 spécimens couvrant toutes les combinaisons de diamètres et de longueurs, le système atteint une erreur moyenne de forme de 270 ± 80 µm, soit systématiquement sous le millimètre. Ce résultat est significatif parce qu'il démontre que le problème du sim-to-real gap n'exige pas forcément une modélisation fine des interactions de surface à l'échelle microscopique. Le tour de force consiste à ne pas chercher à éliminer le mismatch entre simulation et réalité, mais à le rendre observable et corrigeable via le retour visuel en temps réel. Pour les intégrateurs travaillant sur la microassemblage, le placement de composants biologiques, ou la manipulation de fibres dans des procédés textiles ou médicaux, cela ouvre la voie à des systèmes qui généraliseraient à de nouveaux matériaux sans recalibration systématique. La robustesse démontrée sur des spécimens de géométries variées, sans réglage par spécimen, constitue un signal concret que le pipeline est viable au-delà du cadre lab. La micromanipulation robotique basée sur la vision souffre depuis longtemps d'un manque de méthodes capables de gérer les forces capillaires, adhésives et de frottement à l'échelle sub-millimétrique, que les simulateurs classiques ignorent. Les approches dominantes s'appuyaient sur des modèles physiques analytiques ou du domain randomization intensif, deux stratégies coûteuses à paramétrer. Ce travail positionne l'apprentissage par renforcement avec retour visuel comme une alternative compétitive, potentiellement transférable à d'autres objets déformables (cathéters, fils chirurgicaux, câbles fins). Les prochaines étapes probables incluent la validation sur des matériaux non-soyeux, l'extension à des fibres plus courtes ou plus rigides, et l'intégration dans des pipelines de microassemblage multi-étapes.

RecherchePaper
1 source
CoRMA : RMA contrastive pour la méta-adaptation aux tâches riches en contacts
3395arXiv cs.RO 

CoRMA : RMA contrastive pour la méta-adaptation aux tâches riches en contacts

Une équipe de recherche a publié CoRMA (Contrastive Robotic Motor Adaptation), un framework de méta-adaptation pour robots manipulateurs confrontés à des tâches d'assemblage à contact intense, insertion de goupille (PegInsert), engrenage (GearMesh) et vissage d'écrou (NutThread). CoRMA étend RMA (Rapid Motor Adaptation), une architecture initialement développée pour la locomotion, en remplaçant l'adaptation brute aux paramètres simulateur par un contexte de contact sémantique compact en six dimensions. Ce vecteur 6D encode cinq états discrets du contact : déclenchement, engagement latéral, transition guidée, direction de force, et blocage par coincement (jamming). Un adaptateur Transformer causal déployable infère ce contexte en ligne à partir des historiques de force, de proprioception et d'actions, sans démonstrations humaines, sans entrées privilégiées ni mise à jour de gradient au déploiement. Les évaluations ont été conduites dans Isaac Lab / Isaac Sim 5.0 et validées sur un bras réel Marvin, en comparaison directe avec les baselines FORGE. Le résultat central est que CoRMA maintient un taux de succès réel supérieur aux baselines FORGE sous bruit contrôlé sur la pose cible, alors que ces baselines obtiennent des scores élevés en simulation mais se dégradent significativement au passage sur hardware. Ce résultat adresse directement l'un des problèmes structurels de l'assemblage robotique industriel : le sim-to-real gap sur les tâches à contact fin, où les forces de contact ne se transfèrent pas fidèlement depuis le simulateur. L'inférence sémantique du contact comme interface d'adaptation réutilisable est une piste directement exploitable par les intégrateurs travaillant sur des familles de tâches d'assemblage proches, sans nécessiter de recalibration ou de données terrain supplémentaires. RMA a originellement démontré sa valeur en locomotion quadrupède chez Berkeley et CMU ; l'extension aux manipulateurs en contact forcé est une direction suivie par plusieurs groupes, dont ceux travaillant sur des politiques de type VLA (Vision-Language-Action) ou sur l'apprentissage par imitation pour l'assemblage. La comparaison avec FORGE situe CoRMA dans un espace concurrent actif. Les auteurs reconnaissent que la généralisation à des tâches hors de la famille d'assemblage testée et la calibration Real2Sim restent des travaux futurs, ce qui limite pour l'instant la portabilité directe en production industrielle.

RecherchePaper
1 source
Action par primitives visuelles
3396arXiv cs.RO 

Action par primitives visuelles

Une équipe de chercheurs a publié en mai 2026 sur arXiv (réf. 2605.22183) AVP, Action with Visual Primitives, une nouvelle architecture end-to-end pour la manipulation robotique généraliste. Le système repose sur une séparation explicite des responsabilités : le modèle de vision-langage (VLM) infère l'état cible de la prochaine étape et génère des tokens dits "visuels primitifs", qui conditionnent ensuite un module d'action basé sur le flow matching, supervisé par la cinématique de l'effecteur final. Sur des tâches réelles de pick-and-place, AVP améliore le taux de succès de 27,61 % par rapport à pi0.5, le modèle de référence de Physical Intelligence, avec des gains mesurés en efficacité de données, en généralisation spatiale et compositionnelle, ainsi qu'en transfert à de nouveaux objets. L'enjeu central que pointe ce travail est celui de l'enchevêtrement des objectifs d'apprentissage dans les VLA actuels : dans les architectures dominantes, compréhension du langage, analyse spatiale de la scène et contrôle moteur sont fondus dans un seul passage forward, forçant le module d'action à réapprendre des capacités perceptives déjà présentes dans le VLM préentraîné. AVP découple ce pipeline via une interface à base de tokens visuels primitifs, ce qui réduit la redondance d'apprentissage et améliore l'efficacité des données d'entraînement, un facteur critique dans un domaine où la collecte de démonstrations robotiques reste coûteuse. L'amélioration de 27,61 % sur pi0.5, si elle se confirme sur des benchmarks plus larges, représente un écart significatif pour des intégrateurs industriels qui évaluent des solutions de manipulation flexible. Les modèles VLA ont connu une accélération notable depuis 2024 avec l'émergence de pi0 et pi0.5 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI), tous positionnés sur la manipulation généraliste. La tendance dominante jusqu'ici consistait à empiler VLM et head d'action en bout de chaîne, héritant des représentations visuelles sans structuration intermédiaire. AVP propose une voie alternative en introduisant une représentation symbolique intermédiaire, les visual primitives, comme pont entre perception et action. Le papier reste un preprint sans validation externe à ce stade ; les expériences sont conduites sur des tâches de pick-and-place, ce qui limite la portée des conclusions à des scénarios de manipulation relativement contraints. Les prochaines étapes naturelles seront une extension à des tâches à longue horizon temporel et une comparaison sur des benchmarks standardisés comme LIBERO ou Open X-Embodiment.

IA physiqueOpinion
1 source
Pre-VLA : vérification préemptive à l'exécution pour fiabiliser les déroulements de modèles VLA et du monde
3397arXiv cs.RO 

Pre-VLA : vérification préemptive à l'exécution pour fiabiliser les déroulements de modèles VLA et du monde

Une équipe de chercheurs a soumis sur arXiv (réf. 2605.22446, mai 2026) Pre-VLA, une architecture de vérification préemptive conçue pour filtrer les actions de mauvaise qualité générées par les modèles VLA (Vision-Language-Action) avant qu'elles ne soient exécutées physiquement ou simulées dans un world model génératif. Concrètement, Pre-VLA s'intercale comme un garde-fou en amont de l'exécution : il exploite un backbone multimodal avec pooling adaptatif par modalité et une tête dual-branch légère pour prédire à la fois un score de confiance sécuritaire et un advantage score dérivé d'un critique, sur des chunks d'actions candidats. L'entraînement combine trois objectifs simultanés : classification Focal (robuste aux déséquilibres de classes), régression d'avantage, et calibration par seuil souple. À l'inférence, un scheduler de rééchantillonnage dual-mode filtre les actions jugées sous-seuil et déclenche un rééchantillonnage adaptatif dans un budget de calcul contraint. Sur le benchmark LIBERO (quatre suites de tâches en boucle fermée), Pre-VLA améliore le taux de succès moyen de 30,79 % à 37,62 % par rapport au modèle de base RynnVLA-002, réduit le nombre d'étapes d'exécution, et affiche un temps de vérification de 183,9 ms par chunk d'action en moyenne. Le gain de 6,8 points de pourcentage sur LIBERO est notable dans un domaine où les benchmarks en boucle fermée restent difficiles à progresser de façon fiable. La valeur industrielle réelle de Pre-VLA ne réside pas dans la performance brute, mais dans la réduction des échecs physiques coûteux et dans la limitation de l'accumulation d'erreurs dans les rollouts de world models génératifs, dont le coût de rendu est élevé. Pour un intégrateur ou un COO industriel, un tel mécanisme de vérification préemptive représente un levier de fiabilité sans refonte du modèle principal, ce qui est compatible avec des pipelines de déploiement réels. La question non résolue reste la généralisation : LIBERO est un benchmark de manipulation tabletop relativement contrôlé, et les résultats sur des environnements plus chaotiques ne sont pas démontrés ici. Pre-VLA s'inscrit dans une tendance croissante visant à sécuriser les politiques VLA pour le déploiement réel, dans le sillage de modèles comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA), qui peinent tous à franchir le "demo-to-reality gap". Le benchmark LIBERO, développé par une équipe de l'Université de Washington et Stanford, est devenu une référence standard pour évaluer les politiques d'imitation multi-tâches. RynnVLA-002, le modèle de référence utilisé ici, est un VLA récent dont les détails publics restent limités. Ce travail est un preprint, non encore soumis à peer review, ce qui invite à une lecture prudente des chiffres annoncés. Les prochaines étapes naturelles seraient une validation sur des environnements réels hors laboratoire et une comparaison avec d'autres approches de vérification runtime comme les méthodes basées sur les ensembles de confiance ou la vérification formelle légère.

IA physiqueOpinion
1 source
Apprendre sans perdre son identité : l'évolution des capacités des agents incarnés
3398arXiv cs.RO 

Apprendre sans perdre son identité : l'évolution des capacités des agents incarnés

Des chercheurs ont publié sur arXiv (arXiv:2604.07799) un cadre baptisé "capability-centric evolution paradigm" qui permet aux agents robotiques incarnés d'acquérir continuellement de nouvelles compétences sans modifier leur architecture centrale. Le concept pivot est celui des Embodied Capability Modules (ECMs): des unités modulaires et versionnées de fonctionnalité, qui peuvent être apprises, affinées et composées indépendamment de l'identité cognitive de l'agent. Le processus fonctionne en boucle fermée -- exécution de tâche, collecte d'expérience, raffinement du modèle, mise à jour du module -- le tout supervisé par une couche d'exécution (runtime layer) appliquant en permanence les contraintes de sécurité. En simulation, le taux de réussite des tâches est passé de 32,4% à 91,3% en 20 itérations, avec zéro dérive de politique et zéro violation de sécurité signalées. Le problème adressé est concret: dans les systèmes robotiques à longue durée de vie (entrepôts, manufactures, logistique hospitalière), chaque mise à jour du modèle risque de dégrader des comportements précédemment validés -- un frein majeur au déploiement à l'échelle. En découplant l'identité de l'agent de l'évolution de ses capacités, l'approche ECM ouvre la voie à des mises à jour incrémentales et auditables sans régression. Les performances annoncées surpassent SPiRL et SkiMo, deux méthodes de référence en apprentissage de compétences. Il faut cependant souligner que l'ensemble des résultats est obtenu en simulation uniquement: le franchissement du sim-to-real gap, défi central de la robotique incarnée, n'est pas démontré dans ce travail. Cette recherche s'inscrit dans un courant plus large autour du lifelong learning et de la modularité en robotique, en réponse directe aux limites du fine-tuning de politique classique et du prompt engineering, qui induisent ce que les auteurs nomment une "instabilité d'identité" dans les systèmes durables. Elle dialogue avec les travaux sur les VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, où la question de la mise à jour continue sans régression est également ouverte. Pour les intégrateurs et les décideurs industriels, la prochaine étape déterminante sera la validation sur hardware réel, en environnements non contrôlés, avant toute considération de déploiement.

RecherchePaper
1 source
Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations
3399arXiv cs.RO 

Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations

Des chercheurs ont publié fin mai 2026 (arXiv:2605.22123) un framework permettant d'apprendre des fonctions de récompense symboliques invariantes à partir de seulement cinq démonstrations pour des tâches de manipulation robotique. Le système repose sur deux composants couplés : une formulation structurelle de récompense encodant des stratégies de niveau tâche et des contraintes physiques, et une procédure hybride symbolique-numérique qui distille des invariants comportementaux depuis ces démonstrations sans requérir d'interaction en ligne avec l'environnement. La méthode a été évaluée sur huit tâches du benchmark Meta-World et trois tâches de manipulation sur bras Franka, affichant de meilleures capacités d'alignement procédural et de classement de rollouts de politique par rapport aux baselines existantes. Trois expériences réelles out-of-distribution valident une généralisation zero-shot à des variations de position, de point de vue caméra et d'instances d'objets inédites. Le problème adressé est structurel : les modèles de récompense basés sur la vision tendent à mémoriser des distributions de pixels spécifiques et s'effondrent dès que les conditions visuelles changent, qu'il s'agisse d'un objet déplacé, d'un angle de caméra différent ou d'une variante d'objet inconnue. Pour un intégrateur déployant un système de manipulation en milieu industriel, cela impose de recollectecter des démonstrations ou de réentraîner le modèle à chaque variation du contexte opérationnel. Le passage aux invariants symboliques, c'est-à-dire des propriétés comportementales constantes indépendamment de l'apparence visuelle, propose une représentation de récompense réutilisable sur de multiples variantes de tâche sans interaction supplémentaire, ce qui réduit significativement le coût itératif du déploiement en apprentissage par renforcement. Ce travail s'inscrit dans une dynamique de recherche active visant à résoudre le goulot d'étranglement du reward engineering en RL robotique. Les approches récentes fondées sur des embeddings visuels issus de VLMs, comme VIP ou RoboCLIP, ont progressé sur la généralisation visuelle mais restent fragilisées par les variations de distribution en dehors des conditions d'entraînement. La méthode proposée se distingue en substituant aux embeddings bruts une abstraction symbolique de la tâche. Des laboratoires comme Berkeley BAIR, Stanford ou le CMU Robotics Institute travaillent sur des directions similaires d'abstraction pour le RL. La capacité à bootstrapper une récompense généralisable depuis cinq démonstrations seulement ouvre la voie à des pipelines de fine-tuning robotique plus accessibles, potentiellement utilisables par des intégrateurs sans expertise RL avancée.

RecherchePaper
1 source
Imagine2Real : vers l'interaction robot humanoïde-objet sans apprentissage préalable grâce aux priors génératifs vidéo
3400arXiv cs.RO 

Imagine2Real : vers l'interaction robot humanoïde-objet sans apprentissage préalable grâce aux priors génératifs vidéo

Une équipe de chercheurs présente Imagine2Real, un framework zéro-shot pour la manipulation humanoïde d'objets, publié sur arXiv en mai 2026. L'Humanoid-Object Interaction (HOI) en corps entier, soit la capacité d'un humanoïde à interagir physiquement avec des objets en coordonnant l'ensemble de ses degrés de liberté, reste historiquement freinée par la rareté des données 3D haute fidélité. Imagine2Real contourne cette limitation en s'appuyant sur des vidéos génératives comme priors de mouvement, sans recourir à des modèles CAO explicites. Les déplacements du robot et des objets sont formalisés comme des trajectoires 4D en points discrets. Un module appelé Keypoints Tracker suit uniquement trois repères critiques (base, mains, objet), court-circuitant le retargeting morphologique, source classique d'amplification d'erreurs. Pour maintenir des allures naturelles malgré ces signaux épars, le système exploite l'espace latent d'un Behavior Foundation Model (BFM), un modèle de fondation entraîné sur des comportements locomoteurs. Une stratégie d'entraînement progressive complète le pipeline, permettant un déploiement physique zéro-shot en environnement de capture de mouvement (mocap). Le travail s'attaque à deux verrous documentés dans la littérature : le "Representation Misalignment", décalage entre les priors géométriques et la réalité physique du robot, et la "Retargeting Complexity", difficulté d'adapter des mouvements humains à une morphologie robotique différente. En réduisant le retargeting à trois points-clés et en supprimant la dépendance aux modèles CAO, Imagine2Real compresse le pipeline de données nécessaire pour générer de nouveaux comportements. Le zéro-shot démontré en déploiement physique, et non uniquement en simulation, distingue la contribution des approches antérieures. Pour un intégrateur ou un décideur industriel, l'enjeu est clair : bootstrapper de nouvelles compétences de manipulation sans dataset 3D dédié ni séquences mocap par tâche. Imagine2Real s'inscrit dans un courant de recherche exploitant les video diffusion models comme source de connaissance pour la robotique, en parallèle des travaux de Physical Intelligence (pi0, pi0-FAST), de NVIDIA (GR00T N2) et des approches VLA de Google DeepMind. La distinction revendiquée est l'abandon des priors géométriques là où les méthodes concurrentes les jugent incontournables. Aucun partenaire industriel ni calendrier de déploiement réel n'est mentionné dans ce preprint : il s'agit d'une contribution de recherche fondamentale, dont les suites naturelles incluront l'extension à des catégories d'objets plus larges et une validation hors environnement mocap contrôlé.

RechercheOpinion
1 source