Aller au contenu principal

Actualités robotique — page 42

4 731 articles au fil, du plus récent au plus ancien.

PAMAE : mélange d'experts d'action sensible aux phases pour des politiques VLA fiables par flow matching
2051arXiv cs.RO 

PAMAE : mélange d'experts d'action sensible aux phases pour des politiques VLA fiables par flow matching

Des chercheurs ont publié le 27 juin 2026 sur arXiv (2606.27144) un module baptisé PAMAE (Phase-Aware Mixture-of-Experts Action Experts), conçu pour améliorer la fiabilité des politiques d'action dans les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique multi-étapes. Le principe est simple : remplacer l'expert d'action unique partagé des architectures VLA à flow-matching par un mélange sparse d'experts spécialisés, sans toucher au backbone VLA pré-entraîné. Un routeur "phase-aware" oriente dynamiquement la génération d'actions vers l'expert approprié selon la phase d'exécution en cours, grâce à une tête de prédiction de phase légère et un objectif d'alignement de routage. L'entraînement se déroule en deux temps : d'abord un échauffement standard sous la loss de flow-matching, puis une optimisation du routage phase-cohérent sous supervision auxiliaire. Sur des benchmarks de simulation de manipulation multi-étapes, PAMAE affiche jusqu'à 9,2 % de gain en taux de succès par rapport à des baselines VLA solides. Ce résultat est notable parce qu'il s'attaque à un goulot d'étranglement concret des VLA à flow-matching : la tendance à lisser les comportements de contrôle à travers toutes les phases d'exécution avec un seul expert, ce qui nuit aux transitions critiques (saisie, repositionnement, insertion). L'approche "plug-and-play" est stratégiquement importante pour les intégrateurs -- elle évite le coût d'un réentraînement complet du backbone et reste compatible avec des fondations VLA existantes comme Pi-0 ou OpenVLA. Le gain de 9,2 % en simulation est mesuré sur des tâches multi-étapes, là où les architectures à expert unique échouent le plus souvent, ce qui rend la comparaison pertinente. Cela dit, la validation reste exclusivement en simulation, et le transfert sim-to-real n'est pas encore démontré : le "reality gap" demeure le vrai test pour ce type d'amélioration. Les VLA à flow-matching sont apparus comme une alternative aux politiques de diffusion classiques (Diffusion Policy, ACT) en combinant ancrage multimodal fort et généralisation, notamment via des modèles comme Pi-0 de Physical Intelligence ou les travaux de OpenVLA. L'idée des Mixture-of-Experts (MoE) pour les politiques de robot n'est pas nouvelle -- elle est empruntée au monde des LLMs (Mixtral, Switch Transformer) -- mais son application phase-conditioned dans un pipeline VLA end-to-end constitue une contribution originale. Côté concurrents, des approches comme HiRT, RoboVLMs ou les travaux de DeepMind sur RT-2 et ses successeurs explorent des trajectoires similaires pour améliorer la robustesse sur les tâches longues. La prochaine étape naturelle pour PAMAE serait une évaluation sur robot réel (plateforme Franka, UR5 ou bras humanoïde) et une comparaison directe avec des politiques récentes comme Pi-0.5 ou GR00T N2 de NVIDIA, dont les résultats terrain commencent à circuler.

RechercheOpinion
1 source
RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes
2052arXiv cs.RO 

RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes

Des chercheurs ont déposé en juin 2026 sur arXiv (référence 2606.27036) RelAfford6D, un framework sans entraînement pour la manipulation robotique d'objets articulés. Le système s'appuie sur un graphe d'affordances 6D relationnel : à partir d'une consigne en langage naturel, il déduit une topologie sémantique reliant la partie principale d'interaction d'un objet à son ancre physique. Ces noeuds topologiques sont ensuite convertis en poses métriques précises dans l'espace SE(3), soit six degrés de liberté complets en position et orientation, via des modèles de vision fondamentaux pré-entraînés. L'exécution est formulée comme un problème de satisfaction de contraintes cinématiques : le robot génère des trajectoires continues en suivant des variétés physiques strictement définies, qu'il s'agisse d'orbites rotoïdes (rotation) ou prismatiques (translation). Un mécanisme de suivi en boucle fermée assure la replanification en temps réel face aux perturbations. L'approche tranche avec la majorité des politiques data-driven actuelles, comme les VLA basés sur l'imitation ou les méthodes à affordances latentes, qui extraient des points de contact isolés sans contraintes cinématiques explicites. En formulant la manipulation comme satisfaction de contraintes, RelAfford6D obtient des taux de succès zero-shot supérieurs aux baselines data-driven testées, avec une généralisation inter-catégories documentée sur des objets articulés variés (tiroirs, portes, manettes) aussi bien en simulation que dans des environnements physiques réels. Pour les intégrateurs industriels, l'absence d'entraînement spécifique à la tâche est significative : le framework peut s'adapter à de nouveaux mécanismes sans collecter de données de démonstration supplémentaires. La manipulation d'objets articulés en open-world reste l'un des verrous majeurs de la robotique de service et industrielle. Les approches récentes à base de VLA ont progressé sur la flexibilité sémantique mais peinent à garantir la précision géométrique requise pour des mécanismes contraints comme des vannes, portes ou tiroirs industriels. RelAfford6D s'inscrit dans une tendance émergente combinant fondations visuelles pré-entraînées et raisonnement géométrique analytique, sans fine-tuning coûteux. Parmi les travaux concurrents figurent CabiNet, les méthodes à affordance implicite comme GNFactor ou F3RM, et les approches VLA récentes telles que Pi-0. Ce preprint constitue une démonstration académique validée sur banc réel, sans partenariat industriel ni timeline de déploiement annoncé à ce stade.

RecherchePaper
1 source
PressMimic : capture et contrôle de mouvement guidés par pression pour l'imitation par robot humanoïde
2053arXiv cs.RO 

PressMimic : capture et contrôle de mouvement guidés par pression pour l'imitation par robot humanoïde

Des chercheurs ont publié le 26 juin 2026 sur arXiv (2606.26741) un framework baptisé PressMimic, conçu pour améliorer l'imitation de mouvements humains par les robots humanoïdes en intégrant la pression plantaire comme modalité de perception et de contrôle. Le pipeline combine trois briques : FRAPPE++, un modèle multimodal fusionnant RGB et données de pression pour estimer la pose 3D et la trajectoire globale d'un humain ; une politique d'apprentissage par renforcement supervisée par pression (PSP, Pressure-Supervised Policy) pour la reproduction sur le robot ; et MotionPRO, un jeu de données à grande échelle avec captures RGB, pression et motion capture synchronisées. Les résultats expérimentaux montrent des gains sur l'estimation de mouvement, la cohérence de trajectoire et la stabilité d'exécution, sans que les chiffres précis ne soient détaillés dans l'abstract, ils figurent dans l'article complet. Ce travail s'attaque à un problème concret et bien documenté en robotique humanoïde : les pipelines actuels reposant uniquement sur la vision produisent des artefacts physiquement incohérents, glissement des pieds, pénétration du sol, comportements instables à l'appui. En introduisant la pression comme signal d'ancrage physique (physical grounding), PressMimic impose des contraintes de contact explicites à la fois en perception et en contrôle, ce qui réduit l'ambiguïté inhérente à la seule estimation visuelle. Pour les équipes travaillant sur le sim-to-real et sur les politiques de locomotion, c'est un argument en faveur d'architectures multimodales intégrant des capteurs de force ou de pression dès la capture de données, pas seulement à l'exécution. L'imitation de mouvement humanoïde est un champ très actif : Boston Dynamics, Figure AI, Agility Robotics et des laboratoires académiques comme Stanford et CMU explorent des approches VLA (Vision-Language-Action) et RL pour la manipulation et la locomotion. PressMimic se distingue en ciblant explicitement la cohérence des contacts plutôt que la précision gestuelle seule, un angle complémentaire aux travaux sur les politiques diffuses (Pi-0 de Physical Intelligence) ou les politiques génératives. Il reste à ce stade une contribution de recherche académique sans déploiement industriel annoncé ; la publication du dataset MotionPRO pourrait néanmoins accélérer la reproductibilité et l'adoption par d'autres équipes.

HumanoïdesPaper
1 source
OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
2054arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source
Suivi de l'essor de l'IHR sociale-physique (spHRI) : revue systématique augmentée par de petits modèles de langage
2055arXiv cs.RO 

Suivi de l'essor de l'IHR sociale-physique (spHRI) : revue systématique augmentée par de petits modèles de langage

Des chercheurs ont publié sur arXiv (2606.26382) une étude méthodologique sur l'utilisation de petits modèles de langage (SLMs, moins de 1,5 milliard de paramètres) pour accélérer les revues systématiques dans le domaine de l'interaction humain-robot sociale et physique (spHRI). L'équipe a évalué la capacité de ces modèles à effectuer le tri préliminaire de titres et de résumés dans le cadre d'une large revue de littérature spHRI. Aucun SLM testé individuellement n'a atteint le niveau de performance des relecteurs humains. En revanche, un ensemble de SLMs combinés a identifié 39 articles que les experts avaient manqués, soit 10,29 % du corpus final de documents pertinents. Ces modèles ont effectué le tri à une vitesse plusieurs ordres de grandeur supérieure à celle des relecteurs humains, en fonctionnant intégralement en local sur les machines des chercheurs. Le résultat clé est que les SLMs peuvent augmenter le travail des experts sans les remplacer. Dans un domaine comme la spHRI, qui recupe la robotique, l'interaction humain-ordinateur et l'haptique, la terminologie est fragmentée et les méthodologies inconsistantes, ce qui rend toute synthèse systématique difficile. Utiliser un ensemble de SLMs comme filet de sécurité permet de récupérer environ 10 % des articles pertinents qu'une révision humaine seule aurait manqués. Le déploiement local de ces modèles, contrairement aux APIs cloud, préserve la confidentialité des données de recherche, élimine les coûts d'inférence et rend les revues systématiques à grande échelle accessibles pour des équipes académiques aux ressources limitées. Cette étude s'inscrit dans une tendance plus large d'utilisation des LLMs pour accélérer la recherche scientifique, notamment pour le screening bibliographique, tâche chronophage et répétitive. Le choix délibéré de modèles inférieurs à 1,5B paramètres contraste avec le recours à des APIs comme GPT-4 ou Claude, qui offrent de meilleures performances individuelles mais imposent coûts et dépendances cloud. Les résultats valident un pipeline hybride humain + SLM local: les modèles effectuent un premier tri rapide, les experts valident. Pour les laboratoires gérant des revues de plusieurs milliers de papiers, ce type de pipeline pourrait réduire significativement la charge de travail sans sacrifier la rigueur méthodologique, et ouvrir la voie à des revues systématiques continues plutôt qu'épisodiques.

RecherchePaper
1 source
VibeAct : la vibration comme signal pour la dextérité réactive des robots en contact
2056arXiv cs.RO 

VibeAct : la vibration comme signal pour la dextérité réactive des robots en contact

Des chercheurs ont présenté VibeAct, un cadre de manipulation dextère publié sur arXiv en juin 2026, qui intègre des microphones piézoélectriques miniatures dans les doigts d'une main robotique pour détecter les événements de contact et de glissement. La méthode repose sur trois étapes : collecter des données vibro-acoustiques par téléopération, rejouer ces enregistrements dans un jumeau numérique calibré pour étiqueter automatiquement le contact et l'amplitude de glissement par doigt, puis entraîner un estimateur tactile sur les signaux microphone réels. En parallèle, les politiques de manipulation sont entraînées en simulation sur cette même représentation abstraite, et non sur l'audio brut. Le système a été évalué sur cinq tâches riches en contact : re-saisie, réorientation en main et insertion. L'enjeu central est le fossé simulation-réalité qui frappe la manipulation dextère : les événements de contact sont rapides, locaux et souvent masqués visuellement, ce qui rend leur simulation acoustique fidèle quasiment impossible. En découplant l'estimateur tactile, entraîné sur des données réelles, de la politique de contrôle, entraînée en simulation sur la représentation abstraite, le cadre contourne ce verrou sans avoir à modéliser l'audio. Le canal de glissement continu s'avère l'observation la plus informative pour le contrôle réactif soutenu. Sur les cinq tâches, VibeAct surpasse une baseline proprioception et nuage de points, avec les gains les plus nets sur les tâches nécessitant un ajustement continu de la prise. Les politiques apprises se transfèrent à une plateforme physique bras-main dextère, avec une amélioration mesurable des taux de succès. Ce travail s'inscrit dans une compétition dense entre modalités tactiles. Les capteurs à base de caméra comme GelSight ou DIGIT, développé par Meta, offrent une richesse spatiale supérieure mais restent encombrants et coûteux ; les microphones piézoélectriques sont compacts, bon marché et à haute bande passante, mais leur signal est difficile à simuler, d'où l'intérêt du découplage proposé. D'autres travaux exploitent la randomisation de domaine ou des simulations acoustiques approximatives pour tenter de franchir ce seuil. Aucun partenaire industriel ni déploiement commercial n'est annoncé : il s'agit à ce stade de recherche académique. Les prochaines étapes naturelles concernent la généralisation à des objets hors distribution et l'extension à des mains avec davantage de degrés de liberté.

RecherchePaper
1 source
RMTL : apprentissage par renforcement sur micro-tâches pour la manipulation à long terme avec récompenses VLM
2057arXiv cs.RO 

RMTL : apprentissage par renforcement sur micro-tâches pour la manipulation à long terme avec récompenses VLM

Une équipe de chercheurs a publié en juin 2026, via arXiv (identifiant 2606.26175), une méthode baptisée RMTL (Reinforced Micro-Task Learning) visant à résoudre un problème central de l'apprentissage par renforcement appliqué à la manipulation robotique : la conception du signal de récompense. Plutôt que de s'appuyer sur une fonction de récompense dense codée manuellement (coûteuse à calibrer et souvent fragile) ou sur des démonstrations humaines, RMTL exploite des modèles vision-langage (VLM) préentraînés comme signaux de récompense zero-shot. La nouveauté réside dans la décomposition de la tâche globale en un petit ensemble de micro-tâches décrites en langage naturel, chacune associée à un prompt dédié. À chaque étape, l'agent reçoit une récompense calculée par le VLM selon la micro-tâche active, moyennée sur plusieurs angles de caméra pour atténuer les effets d'occlusion. Un curriculum inverse expose progressivement l'agent à des conditions initiales plus difficiles, tandis qu'un gestionnaire hiérarchique appris remplace une règle de sélection de phase basée sur la distance. Les expériences ont été menées sur l'environnement Fetch, benchmark standard de la manipulation en simulation, avec seulement trois prompts courts sans ajustement supplémentaire. L'apport principal est l'amélioration significative du signal d'apprentissage par rapport à une approche VLM à prompt unique. Un prompt global produit un signal de récompense quasi-plat en début de trajectoire : l'agent ne détecte pas ses progrès précoces, ce qui ralentit drastiquement la convergence sur des tâches à long horizon. RMTL répond à ce problème structurel en rendant chaque micro-tâche localement observable. Pour les équipes cherchant à réduire leur dépendance aux démonstrations humaines ou à l'ingénierie manuelle des récompenses, cela représente une piste sérieuse pour rendre le RL guidé par le langage plus scalable sans coût d'annotation supplémentaire. Ce travail s'inscrit dans une vague active de recherches utilisant les VLMs comme substituts de fonctions de récompense, dont EUREKA de NVIDIA ou les approches SayCan de Google DeepMind. Contrairement à certaines de ces méthodes qui nécessitent un fine-tuning ou des démonstrations vidéo, RMTL mise sur une décomposition minimale en trois phases sans recalibrage des prompts. L'évaluation reste cependant confinée à la simulation sur robot Fetch, et aucun résultat sur plateforme physique n'est rapporté. La prochaine étape critique sera de valider si cette approche tient face au gap sim-to-real, notamment sur des manipulateurs physiques avec variabilité sensorielle réelle.

RechercheActu
1 source
L'effondrement neuronal ordinal comme a priori de représentation pour la navigation visuelle
2058arXiv cs.RO 

L'effondrement neuronal ordinal comme a priori de représentation pour la navigation visuelle

Une équipe de recherche a publié en juin 2026 sur arXiv (2606.26839) ORION, une méthode d'apprentissage de politiques de navigation visuelle pour robots mobiles. Le problème de départ est celui de l'imitation learning de bout en bout : lorsqu'on entraîne conjointement un encodeur visuel et un décodeur d'actions via une unique loss d'action, le signal de supervision reste indirect pour l'encodeur. Résultat : l'encodeur apprend des représentations dites "action-agnostic", insensibles aux distinctions qui comptent pour la navigation. Dans les environnements réels, avec leurs distracteurs visuels et la variabilité des scènes, ces représentations ambiguës se traduisent par des actions incohérentes aux carrefours et aux intersections complexes, générant des échecs de navigation. ORION impose explicitement une structure ordinale à l'espace de représentation de l'encodeur : les catégories de commandes ego-centriques (de "Far Left" à "Far Right") forment une séquence naturelle où les classes voisines partagent des contextes visuels similaires. L'encodeur est contraint d'organiser ces classes le long d'un axe discriminant unique, en supprimant la variance hors-axe au sein de chaque classe. Cet encodeur pré-entraîné est ensuite intégré dans un framework de navigation basé sur la diffusion, puis affiné end-to-end. Les expériences, conduites en simulation et en conditions réelles, montrent que ORION surpasse les baselines end-to-end et neural collapse classiques sur le taux de succès de navigation et la progression vers l'objectif, avec des gains particulièrement marqués aux intersections multi-voies. L'intérêt de cette approche réside dans sa réponse à un problème structurel des VLA (Vision-Language-Action models) et plus généralement de l'imitation learning visuelle : la supervision indirecte de l'encodeur. En robotique mobile autonome, notamment pour les AGV et AMR déployés en entrepôt ou en milieu urbain, les représentations "action-agnostic" sont un vecteur d'échec documenté et coûteux en production. L'idée d'exploiter la structure ordinale naturelle des commandes directionnelles pour contraindre l'espace latent est élégante et transférable : elle n'exige pas de données supplémentaires, mais réorganise le signal de supervision existant. La démonstration de gains concrets sur des intersections complexes est particulièrement pertinente pour les intégrateurs de robots de livraison ou de surveillance en environnements non structurés. Cela confirme une hypothèse émergente dans le secteur : la qualité de la représentation visuelle, et non la puissance brute du décodeur, est souvent le goulet d'étranglement dans le passage du labo au terrain. Le concept de "neural collapse" est emprunté à la littérature sur la classification supervisée, où il décrit la convergence des représentations de dernière couche vers des structures géométriques idéales en fin d'entraînement. ORION étend ce cadre à la navigation en y ajoutant la dimension ordinale, ce qui le distingue des travaux précédents qui appliquaient neural collapse sans tenir compte de la relation sémantique entre classes de commandes. Dans l'écosystème des frameworks de navigation diffusion-based, on retrouve des travaux proches comme NoMaD ou GNFactor, ainsi que des approches VLA comme pi-0 de Physical Intelligence. Les auteurs n'annoncent pas de déploiement commercial ni de partenariat industriel identifiable dans ce preprint ; les prochaines étapes naturelles seraient une validation à plus grande échelle sur des plateformes comme Clearpath ou Boston Dynamics Spot, et une extension aux politiques multimodales intégrant des instructions en langage naturel.

RechercheOpinion
1 source
Estimateur de pose inter-robot à 4 DoF en forme fermée par mesures angulaires seules
2059arXiv cs.RO 

Estimateur de pose inter-robot à 4 DoF en forme fermée par mesures angulaires seules

Des chercheurs ont publié sur arXiv (identifiant 2606.26616) un estimateur analytique de pose inter-robot à 4 degrés de liberté (4-DOF) reposant exclusivement sur des mesures de relèvement (bearing-only), sans infrastructure externe ni GPS. La méthode fusionne l'angle d'observation entre robots pairs et les données d'odométrie embarquée pour estimer les positions relatives en temps réel. Contrairement aux approches 6-DOF existantes, l'estimateur résout le problème en forme fermée, supprimant toute optimisation itérative coûteuse en calcul. L'article identifie deux configurations critiques pour l'observabilité du système : les formations colinéaires (robots alignés sur un même axe) et les formations à forme préservée (déplacement en bloc rigide). Pour y répondre, un module de test d'observabilité autonome détermine dynamiquement l'instant optimal d'estimation, remplaçant la fenêtre glissante de longueur fixe utilisée classiquement. Ce travail intéresse directement les équipes déployant des flottes d'AMR, des essaims de drones et tout système multi-robot opérant en milieu GNSS-dégradé (entrepôts, souterrains, zones urbaines denses). La solution analytique réduit significativement le coût de calcul, la rendant déployable sur des plateformes embarquées à ressources limitées. Le choix du 4-DOF plutôt que 6 est délibéré : dans la plupart des contextes industriels au sol, les deux degrés résiduels sont mécaniquement contraints, et relâcher ces contraintes améliore la robustesse sans perte pratique de précision. Simulations et expériences réelles confirment que la méthode surpasse les approches concurrentes en précision tout en réduisant l'intervalle de collecte de données nécessaire à l'estimation. La localisation coopérative sans infrastructure est un axe de recherche actif depuis une décennie, porté par les limites du SLAM centralisé et l'essor des flottes autonomes. Les approches bearing-only précédentes souffraient systématiquement de la dégénérescence d'observabilité sous certains schémas de mouvement, rendant les estimations instables dans des configurations pourtant courantes. L'approche 4-DOF proposée réduit les exigences d'excitation du mouvement nécessaires à l'observabilité, élargissant ainsi l'enveloppe opérationnelle effective. À noter : les auteurs ne mentionnent ni partenaire industriel ni déploiement commercial, il s'agit d'une contribution académique préprint, pas d'un produit livré. Les extensions naturelles incluent le passage au 6-DOF complet pour les robots aériens, et l'intégration dans des middlewares standards comme ROS 2.

RecherchePaper
1 source
IDEA : robustesse aux écarts de dynamique par alignement des effets pour le transfert sim-vers-réel multi-agents
2060arXiv cs.RO 

IDEA : robustesse aux écarts de dynamique par alignement des effets pour le transfert sim-vers-réel multi-agents

Une équipe de recherche a publié en juin 2026 sur arXiv (réf. 2606.26575) un article présentant IDEA, acronyme de "Insensitive to Dynamics mismatch via Effect Alignment", une méthode de transfert simulation-vers-réel pour les systèmes de contrôle multi-agents. Le problème ciblé est le "dynamics mismatch" : l'écart entre les paramètres physiques simulés et la réalité dégrade sévèrement les politiques apprises dès lors qu'elles opèrent à bas niveau (couples moteurs, vitesses d'actionneurs), où de légères erreurs de modélisation s'amplifient et rendent le système fragile en déploiement. IDEA combine trois éléments : randomisation de la structure environnementale, actions sémantiques discrètes plutôt que commandes à bas niveau, et contrôle en boucle fermée, ce qui élève la politique à un niveau d'abstraction moins sensible aux écarts physiques. Un mécanisme de synchronisation des actions gère en plus les décalages temporels entre agents. Les expériences portent sur quatre tâches de navigation multi-agents et montrent une meilleure efficacité d'entraînement et des taux de succès plus élevés en conditions réelles par rapport aux méthodes de transfert standard. Pour les intégrateurs travaillant sur des flottes d'AMR ou de systèmes robotiques coopératifs, le sim-to-real gap reste le principal obstacle entre prototype convaincant et déploiement fiable. Les approches classiques exigent une identification précise du système (masses, frictions, délais d'actionneurs), opération coûteuse et souvent inexacte sur des flottes hétérogènes. En travaillant au niveau sémantique, IDEA réduit cette dépendance. Le mécanisme de synchronisation inter-agents répond à un problème concret : les latences réseau asymétriques entre robots désynchronisent les décisions et génèrent des comportements instables. Ces résultats restent toutefois circonscrits à des tâches de navigation en laboratoire ; aucune donnée sur la manipulation ou des environnements industriels réels n'est présentée, ce qui relativise la portée des conclusions. Le transfert sim-to-real est un chantier de recherche actif depuis l'application du deep reinforcement learning à la robotique (2017-2018). Les approches dominantes incluent la domain randomization (OpenAI Dactyl), les modèles de monde (DreamerV3) et le contrôle hiérarchique. IDEA s'inscrit dans ce courant mais déplace le levier vers l'abstraction sémantique, une tendance que partagent les architectures VLA récentes comme Pi-0 d'Intrinsic ou GR00T N2 de NVIDIA, bien que celles-ci ciblent principalement la manipulation mono-bras. Aucune affiliation institutionnelle ni partenariat industriel ne figurent dans le préprint, et aucun déploiement au-delà des expériences de laboratoire n'est annoncé. La validation sur des tâches de manipulation et des environnements non contrôlés constitue l'étape logique suivante.

RecherchePaper
1 source
Évaluation en temps réel de la sécurité des opérations du bras humain via un IMU au poignet avec système PSM
2061arXiv cs.RO 

Évaluation en temps réel de la sécurité des opérations du bras humain via un IMU au poignet avec système PSM

Des chercheurs publient sur arXiv (2502.09241) un système de surveillance de sécurité en temps réel pour environnements de fabrication collaboratifs homme-robot, basé sur une unité de mesure inertielle (IMU) portée au poignet et couplée à un modèle de sécurité prédictif (PSM, Predictive Safety Model). Le coeur du dispositif repose sur un modèle masse-ressort-amortisseur adapté aux mouvements du poignet, qui effectue une évaluation probabiliste du risque par calcul d'impédance mécanique. L'approche a été validée expérimentalement sur trois tâches manufacturières représentatives : manipulation d'outils, inspection visuelle et opérations de pick-and-place. Les auteurs démontrent la tenue en temps réel du système grâce à une sélection optimisée des paramètres, sans préciser les fréquences d'échantillonnage ni les latences mesurées dans le preprint. La pertinence industrielle tient à un problème structurel des cobots : comment évaluer dynamiquement le risque d'un opérateur sans interrompre le cycle productif. Les méthodes classiques de surveillance reposent soit sur des capteurs de force intégrés au robot (coûteux, limités à la zone d'interaction directe), soit sur des systèmes de vision 3D (sensibles aux occlusions, gourmands en calcul). Un IMU porté au poignet offre une alternative légère et portable, indépendante de l'infrastructure fixe. L'analyse en domaine fréquentiel pour établir des seuils quantitatifs de sécurité constitue une contribution méthodologique, mais elle reste à confronter aux exigences normatives ISO/TS 15066 qui régissent la vitesse et la puissance des robots collaboratifs en Europe et en Amérique du Nord. Le PSM dont s'inspire ce travail appartient à une lignée de modèles prédictifs développés en robotique collaborative, parallèlement aux travaux du DLR sur l'évaluation de risque biomécanique et aux implémentations commerciales comme SafeMove (ABB) ou les fonctions Speed&Separation Monitoring. Aucune entreprise partenaire ni timeline de déploiement n'est mentionnée dans le preprint : il s'agit d'une contribution académique en phase de validation expérimentale, sans prototype industriel annoncé. Les suites évoquées concernent l'évaluation adaptative du risque en temps réel, ce qui suggère une poursuite en laboratoire avant toute perspective de déploiement terrain.

RecherchePaper
1 source
Commande en boucle fermée de bras continus en spirale logarithmique par compensation du Jacobien, adaptée à la morphologie
2062arXiv cs.RO 

Commande en boucle fermée de bras continus en spirale logarithmique par compensation du Jacobien, adaptée à la morphologie

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.26188) le premier cadre de contrôle en boucle fermée spécifique à la morphologie pour bras continus à spirale logarithmique. Ces manipulateurs souples, à actionnement tendineux segmenté, s'appuient sur un squelette central avec routage équilatéral des tendons et ont été modélisés dans le simulateur MuJoCo pour capturer la compliance conique et les dynamiques de contact. La contribution centrale est la dérivation d'un Jacobien analytique en espace des tâches, directement extrait de la cinématique spirale, couplé à une compensation d'erreur Jacobienne en ligne combinant une mise à jour sécante de Broyden et un filtre de Kalman. Le contrôleur est validé en simulation planaire et spatiale sur des tâches de suivi de trajectoire, de régulation d'attitude, de rejet de perturbations, de suivi de position 3D et de contrôle simultané position-orientation. Par rapport à la baseline piecewise-constant-curvature (PCC), la méthode réduit systématiquement les erreurs de suivi, supprime la dérive d'attitude et maintient une erreur d'estimation Jacobienne bornée. L'apport principal est de combler un vide critique : les robots à spirale logarithmique précédemment décrits disposaient d'une fabrication scalable et d'une préhension polyvalente, mais n'avaient ni cinématique inverse ni contrôle en boucle fermée, ce qui les cantonnait à des démonstrations en boucle ouverte. La combinaison Broyden-Kalman permet de corriger en continu les erreurs de modélisation dues aux déformations non linéaires, aux contacts et aux désaccords géométriques, problèmes structurels des robots souples sous-actionnés. Il faut cependant noter que la validation reste entièrement simulée : aucun prototype physique n'est rapporté, ce qui laisse entier le défi du sim-to-real, particulièrement sensible sur des structures souples à compliance variable. La spirale logarithmique est une morphologie omniprésente dans le vivant (vrilles, tentacules, coquilles) et explorée depuis plusieurs années en robotique des continuum comme alternative aux bras rigides pour opérer en espaces confinés ou autour d'objets fragiles. Les travaux antérieurs avaient démontré la fabricabilité de ces structures mais butaient sur le contrôle précis. Dans le paysage des robots continus, les concurrents directs incluent les approches à modèle PCC classique (largement étudié depuis les années 2000) et les bras pneumatiques de type Festo ou les structures hydrogel. En Europe, Pollen Robotics (France) travaille sur des architectures souples bien qu'avec une philosophie différente. La suite logique annoncée par les auteurs est l'implémentation sur hardware réel et l'intégration de méthodes d'apprentissage pour augmenter le contrôle analytique.

RecherchePaper
1 source
LiMoDE : repenser la manipulation robotique continue par une approche mélange d'experts dynamiques
2063arXiv cs.RO 

LiMoDE : repenser la manipulation robotique continue par une approche mélange d'experts dynamiques

Une équipe de chercheurs a présenté LiMoDE (Lifelong Mixture of Dynamic Experts), une architecture destinée à permettre à un robot de maîtriser de nouvelles tâches de manipulation sans effacer les compétences précédemment acquises. Publiée en préprint sur arXiv (réf. 2606.26183), la méthode repose sur un schéma d'apprentissage en deux étapes. Dans un premier temps, un pré-entraînement multi-tâches construit une structure MoE (Mixture of Experts) dynamique : un nombre variable d'experts hétérogènes est activé sélectivement en fonction des informations de mouvement, chaque expert spécialisant une forme de manipulation à court terme. Dans un second temps, le mécanisme LiMoEAM (Lifelong MoE Adaptation Mechanism) ajoute de nouveaux experts "lifelong" qui se combinent dynamiquement avec les experts figés issus du pré-entraînement, transférant les connaissances acquises vers les nouvelles tâches. Le système a été évalué sur un benchmark de lifelong learning simulé ainsi que sur des tâches réelles, avec un surcoût décrit comme modéré en paramètres entraînables et en overhead d'inférence. L'intérêt de LiMoDE réside dans sa réponse au problème de l'oubli catastrophique, verrou persistant du déploiement de robots généralistes en environnement industriel réel. Là où les approches par fine-tuning efficace en paramètres (PEFT, LoRA) permettaient l'adaptation à une tâche unique mais dégradaient les performances précédentes, LiMoDE isole les compétences réutilisables dans des experts distincts et en préserve les poids lors de l'adaptation. Pour un intégrateur ou un COO industriel, cela signifie théoriquement qu'un robot pourrait acquérir de nouvelles opérations de saisie ou d'assemblage sans réentraînement complet de la flotte, réduisant les fenêtres d'indisponibilité. Le fait que la méthode n'ajoute qu'un nombre "modéré" de paramètres reste à quantifier précisément dans des configurations à grande échelle. Le problème du lifelong learning robotique est traité depuis plusieurs années dans la communauté du continual learning, notamment via des approches EWC (Elastic Weight Consolidation) ou des replay buffers. Les travaux récents sur les VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les politiques diffuses de Figure AI ont montré que des modèles pré-entraînés à large échelle s'adaptent rapidement à de nouveaux scénarios, mais peinent à maintenir les performances sur l'ensemble des tâches antérieures sans retraining. LiMoDE se positionne comme une solution architecturale intermédiaire entre le fine-tuning monolithique et le modèle généraliste à réentraînement systématique. Il s'agit à ce stade d'un article de recherche académique sans annonce de déploiement commercial ni partenariat industriel identifié.

RecherchePaper
1 source
KRVF : représentation du monde en voxels sémantiques sensible à la source pour la manipulation mobile embarquée
2064arXiv cs.RO 

KRVF : représentation du monde en voxels sémantiques sensible à la source pour la manipulation mobile embarquée

Des chercheurs ont déposé sur arXiv (identifiant 2606.26321) un rapport technique décrivant KRVF, un système de représentation sémantique du monde en voxels conçu pour les manipulateurs mobiles soumis à des contraintes de calcul embarqué. L'architecture attribue à chaque voxel cinq propriétés: occupation de l'espace, couleur, évidence sémantique, fraicheur temporelle de la donnée et source d'origine de la mesure. Ce dernier attribut, la "conscience de la source", est le trait distinctif du système: il trace l'origine de chaque information, qu'elle provienne d'un capteur direct, d'une hypothèse a priori ou d'une inférence. L'implémentation repose sur ROS 2 et traite des flux RGB-D en temps réel pour construire une mémoire du robot orientée tâche, centrée sur la localisation des objets saisissables et des candidats à la préhension. L'acronyme KRVF n'est pas développé dans l'abstract disponible. L'enjeu technique central est la robustesse aux défaillances des capteurs de profondeur, problème récurrent en déploiement réel (occlusions, surfaces spéculaires, zones hors portée). Les pipelines de reconstruction classiques, optimisés pour la fidélité géométrique globale, corrompent silencieusement leur modèle persistant quand les mesures de profondeur sont absentes ou erronées. KRVF répond en séparant explicitement l'occupation mesurée des hypothèses sémantiques a priori: le robot peut raisonner sur un objet probable sans altérer la géométrie de référence. La carte existante sert également à générer une profondeur synthétique pour combler les lacunes capteur, fermant une boucle de rétroaction entre cartographie et perception. Ces choix ciblent directement les déploiements sans infrastructure cloud: la cognition spatiale s'exécute entièrement à bord du robot, sans latence réseau. Ce travail s'inscrit dans une dynamique de recherche active sur la représentation du monde pour robots mobiles, aux côtés de systèmes comme ConceptFusion ou LERF qui explorent des cartes neuronales 3D interrogeables en langage naturel. Sur le marché des manipulateurs mobiles, des acteurs comme Boston Dynamics (Spot ARM), Hello Robot (Stretch) ou des startups comme Agility Robotics et 1X Technologies cherchent précisément ce type de module de perception embarqué à faible empreinte de calcul. KRVF reste un préprint non évalué par les pairs, sans benchmark comparatif public ni annonce de mise à disposition du code: c'est une contribution architecturale cohérente, mais dont la portée industrielle dépendra d'une validation expérimentale sur des plateformes réelles et dans des scénarios adversariaux.

RecherchePaper
1 source
Humanoid-DART : loco-manipulation humanoïde par augmentation guidée par diffusion, ré-étiquetage et suivi
2065arXiv cs.RO 

Humanoid-DART : loco-manipulation humanoïde par augmentation guidée par diffusion, ré-étiquetage et suivi

Une équipe de chercheurs a publié en juin 2026 sur arXiv (réf. 2606.26855) un cadre d'apprentissage baptisé Humanoid-DART, conçu pour entraîner des robots humanoïdes à des tâches combinant locomotion et manipulation d'objets (la loco-manipulation). Le système fonctionne en mode auto-supervisé : il démarre à partir d'un nombre réduit de démonstrations humaines, puis étend progressivement son répertoire comportemental sans nécessiter d'interventions expertes continues. L'architecture associe un modèle de diffusion, utilisé pour générer des trajectoires conditionnées sur un objectif, à un agent d'apprentissage par renforcement chargé de les suivre sur une gamme de tâches loco-manipulation. Les auteurs rapportent des résultats favorables lors d'ablations et de comparaisons avec des méthodes de référence, sans toutefois publier de métriques quantitatives détaillées dans ce résumé préliminaire. Ce travail s'attaque à l'un des goulots d'étranglement structurels du domaine : le coût de collecte de démonstrations diversifiées et la dépendance aux corrections humaines en cas d'échec de la politique. La combinaison diffusion + RL permet à la politique d'explorer automatiquement l'espace des objectifs, réduisant mécaniquement le volume de données d'imitation nécessaires à l'amorçage. Pour les équipes industrielles cherchant à déployer des humanoïdes sur des tâches variées (manutention, assemblage, logistique), cette piste suggère une voie vers un scaling moins linéaire en coût humain, une hypothèse que le secteur cherche activement à valider, notamment pour réduire le sim-to-real gap sur des comportements multi-étapes. Humanoid-DART s'inscrit dans un mouvement plus large qui mise sur les modèles génératifs pour contourner la rareté des données de démonstration. Des approches concurrentes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA misent également sur des architectures de type VLA (Vision-Language-Action), avec des capacités loco-manipulation partiellement annoncées mais rarement démontrées à l'échelle en environnement non contrôlé. Ce papier, soumis comme preprint sans avoir encore passé la revue par les pairs, se positionne sur le segment de l'auto-amélioration à partir de peu de données, un axe de recherche actif chez plusieurs laboratoires académiques et industriels. Aucun déploiement terrain ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
MWC Shanghai : oubliez le score, les tirs au but de robots humanoïdes ont mis l'IA incarnée à l'épreuve
2066TechNode 

MWC Shanghai : oubliez le score, les tirs au but de robots humanoïdes ont mis l'IA incarnée à l'épreuve

Pendant deux jours au Shanghai New International Expo Centre, lors du MWC Shanghai 2026, huit équipes chinoises de robotique humanoïde se sont affrontées dans un tournoi de tirs au but entièrement autonomes, réunissant plus de 10 000 spectateurs sur environ 100 rounds de compétition. Trois équipes ont dominé le classement final : China Mobile (Hangzhou) Information Technology a décroché la première place, devant Tianshu Tanjie (Beijing) Technology et Hangzhou Xingshu Intelligent Robot. La règle centrale du concours, imposée par les organisateurs, prohibait tout contrôle à distance et tout script de mouvement préprogrammé : les robots devaient localiser le ballon, se positionner, tirer, défendre le but et retrouver leur équilibre en temps réel via leurs propres systèmes de perception, de planification et de contrôle moteur. Le robot de China Mobile (Hangzhou) s'est distingué par sa régularité sur plusieurs rounds avec peu de défaillances visuelles ou d'instabilités posturales, en s'appuyant sur une connectivité 5G à faible latence couplée à du calcul edge AI embarqué. Tianshu Tanjie a démontré des capacités solides en contrôle dynamique et en actuation articulaire, permettant à son gardien compact de s'ajuster à des tirs provenant d'angles variés. Hangzhou Xingshu, start-up de nouvelle génération, a présenté une plateforme allégée d'environ 30 % par rapport à ses concurrents, lui conférant une agilité notable dans les changements de direction, malgré quelques erreurs de mouvement résiduelles. Ce qui rend cet événement significatif pour l'industrie dépasse largement la performance footballistique. Contrairement aux démonstrations classiques en laboratoire contrôlé ou aux vidéos promotionnelles soigneusement montées, le concours a exposé les robots à des conditions imprévisibles en conditions réelles : environnement dynamique, éclairage variable, interactions non scriptées. C'est précisément le profil de test le plus révélateur pour évaluer la maturité des systèmes d'IA incarnée (embodied AI). La capacité à percevoir, planifier et maintenir l'équilibre dans un environnement non déterministe est le vrai critère de qualification pour un déploiement industriel. Le fait que plusieurs équipes aient tenu des rounds complets sans intervention humaine, même si le taux de réussite global reste modeste, indique que le "demo-to-reality gap" se resserre. Pour un intégrateur B2B ou un COO industriel, ce n'est pas encore une maturité commerciale, mais c'est un signal de trajectoire difficilement ignorable. La Chine investit massivement dans la robotique humanoïde depuis 2023, avec un écosystème dense de start-ups bénéficiant du soutien d'opérateurs institutionnels comme China Mobile. Ce concours illustre la montée en puissance compétitive de cet écosystème national, qui se développe en parallèle des initiatives américaines (Boston Dynamics, Figure, Agility Robotics) et européennes, où des acteurs comme Enchanted Tools ou Wandercraft avancent sur des segments spécialisés. L'absence totale de concurrents non-chinois dans ce tournoi révèle aussi la fragmentation géographique croissante du secteur. Les suites concrètes restent floues : aucune des trois équipes primées n'a annoncé de pilote industriel ni de calendrier de commercialisation à l'issue de la compétition, ce qui maintient ces systèmes dans la catégorie "démonstrateur avancé" plutôt que "produit déployable à court terme".

Chine/AsieOpinion
1 source
Agility, fabricant du robot Digit, vise 620 millions via une cotation SPAC historique
2067Interesting Engineering 

Agility, fabricant du robot Digit, vise 620 millions via une cotation SPAC historique

Agility Robotics s'apprête à entrer en bourse via une fusion SPAC valorisant l'entreprise à 2,5 milliards de dollars, une opération qui devrait lui apporter plus de 620 millions de dollars de financement frais destinés au développement produit, à la recherche et à l'expansion commerciale. Il s'agit de la première introduction en bourse d'une entreprise 100 % dédiée à la robotique humanoïde aux États-Unis, ce qui en fait également le premier benchmark financier audité disponible pour un secteur jusqu'ici opaque. Parallèlement à cette cotation, Agility prépare le lancement commercial de son Digit v5, présenté comme le premier humanoïde "coopérativement sûr" du marché. Digit est déjà déployé dans neuf sites industriels chez des clients majeurs dont Schaeffler, GXO Logistics, Toyota Motor Manufacturing Canada et Mercado Libre, avec plus de 65 000 heures d'opération cumulées à ce jour. L'entreprise annonce par ailleurs plus de 300 millions de dollars de commandes pluriannuelles signées et un pipeline de plus de 30 clients potentiels. Sur le plan technique, Digit v5 intégrera la plateforme de calcul industriel NVIDIA IGX Thor et le logiciel de sécurité Halos Core, et sera évalué dans le cadre du Halos AI Systems Inspection Lab de NVIDIA pour sa conformité aux standards de sécurité industrielle. L'entrée en bourse d'Agility a une portée symbolique et structurelle pour l'ensemble du secteur humanoïde : elle contraint l'entreprise à une transparence financière inédite, permettant aux intégrateurs et décideurs B2B de disposer d'un référentiel réel de coûts, de marges et de rythme de déploiement. Les 65 000 heures opérationnelles revendiquées constituent un argument tangible contre le "demo gap" qui gangrène la crédibilité du secteur, même si Agility ne communique pas de métriques de performance détaillées (cadences de cycle, taux de disponibilité, taux d'erreur) qui permettraient une évaluation indépendante. La stratégie de "data flywheel" -- chaque déploiement générant des données propriétaires qui améliorent perception, mobilité et exécution de tâches -- est le pari central de l'entreprise : transformer l'avance opérationnelle en avantage IA durable, une logique analogue à ce que Tesla a tenté avec Optimus à travers son parc de véhicules. Fondée en 2015 à l'Université de l'Oregon et initialement connue pour ses recherches en locomotion bipède, Agility a opéré un pivot commercial décisif après son rachat partiel par Amazon en 2023, qui lui a fourni un accès aux entrepôts logistiques comme terrain d'expérimentation à grande échelle. La plateforme cloud Agility Arc, qui gère le déploiement, l'orchestration de flotte et la supervision de performance, constitue la couche logicielle différenciante que l'entreprise positionne face à ses concurrents directs : Figure AI (Figure 02, partenariat BMW), Boston Dynamics (Atlas), Tesla (Optimus Gen 2), 1X Technologies et Apptronik. Le marché adressable cible -- manufacturing, distribution et logistique aux États-Unis -- est estimé par Agility elle-même à environ 1 000 milliards de dollars, une projection managériale à prendre avec réserve. Les prochaines étapes seront la finalisation de la cotation SPAC, le lancement commercial de Digit v5 et l'extension du Customer Acceleration Program qui permet aux entreprises de qualifier le robot avant engagement à grande échelle.

HumanoïdesOpinion
1 source
Une entreprise américaine déploie un robot humanoïde assistant dans les écoles de New York
2068Interesting Engineering 

Une entreprise américaine déploie un robot humanoïde assistant dans les écoles de New York

Realbotix, société américaine spécialisée dans les robots androïdes à vocation relationnelle, a lancé un pilote dans le Salamanca City Central School District (État de New York), associant son robot humanoïde M-Series et son assistant pédagogique IA baptisé Optio. Dans un premier temps réservé aux élèves inscrits aux cours Woz ED AI and Robotics, le programme est prévu pour s'étendre à environ 500 lycéens à la rentrée de l'automne 2026. Optio fonctionne comme assistant d'enseignement et tuteur à domicile : les élèves interagissent avec des avatars numériques personnalisés entraînés sur le curriculum approuvé par le district, avec un soutien individuel, une aide aux devoirs multilingue et un accès académique 24h/24. Le robot M-Series, lui, intègre un traitement du langage naturel, des expressions faciales animées et des capacités conversationnelles en temps réel, permettant une interaction directe sans interface écran. Le système inclut des contrôles de sécurité spécifiques à l'éducation, une supervision du district, et des parcours adaptés aux apprenants neurodivers. L'intérêt du déploiement réside moins dans une rupture technologique que dans le contexte opérationnel : un robot humanoïde entre dans une salle de classe réelle, non dans un laboratoire contrôlé. Le PDG Andrew Kiguel l'affirme explicitement, annonçant sortir "des démonstrations en laboratoire" pour prouver que la robotique avancée peut fonctionner dans des environnements éducatifs vivants. Pour les décideurs B2B et intégrateurs, c'est un signal que les cas d'usage éducatifs pour les humanoïdes passent du stade du concept à celui de l'expérimentation pilotée à l'échelle d'un district. Cela dit, l'expansion à 500 élèves reste une annonce planifiée, pas un déploiement effectif, et les métriques techniques du M-Series (degrés de liberté, charge utile, taux de défaillance en conditions réelles) ne sont pas communiquées, ce qui limite toute évaluation sérieuse de la robustesse du système. Realbotix se positionne depuis ses débuts sur les robots androïdes sociaux, un segment distinct de l'automatisation industrielle dominé par Figure AI, Agility Robotics ou Tesla Optimus, où les exigences de manipulation physique sont centrales. Ce créneau éducatif, où la performance locomotrice compte peu mais où l'interaction naturelle et la sécurité des mineurs sont primordiales, constitue une niche cohérente avec son ADN produit. La collaboration avec Woz ED, réseau STEM cofondé par Steve Wozniak, lui assure une visibilité nationale et un terrain d'expérimentation structuré. Dans le segment des robots de présence en classe, le norvégien No Isolation avait ouvert la voie en décembre 2025 avec son robot AV1, conçu pour permettre aux enfants malades d'assister aux cours à distance, un usage bien plus ciblé. La suite dépendra des retours de ce pilote et de la capacité du M-Series à maintenir un engagement pédagogique crédible sur la durée, au-delà de l'effet de nouveauté.

HumanoïdesOpinion
1 source
Hirebotics propose un cobot no-code et antidéflagrant pour la peinture
2069Robotics Business Review 

Hirebotics propose un cobot no-code et antidéflagrant pour la peinture

Hirebotics, fabricant de cobots pour la métallurgie basé à Nashville (Tennessee), a lancé le Cobot Painter, un système de peinture collaborative antidéflagrant construit autour du FANUC CRX-10iA/L Paint et de sa plateforme propriétaire sans code Beacon. La solution prend en charge la peinture liquide, le revêtement en poudre et le gel coat dans des environnements classés zones dangereuses. Le bras dispose d'une portée de 141,7 cm et peut opérer directement dans une cabine de peinture manuelle existante, sans nécessiter de cellule dédiée ni de refonte de l'infrastructure d'extraction ou de convoyage. La programmation repose sur un principe "click-and-teach" via tablette ou smartphone : un opérateur guide physiquement le robot une fois, et ce dernier reproduit à l'identique la vitesse, la distance et l'angle de pulvérisation à chaque cycle. Hirebotics promet un déploiement opérationnel en quelques jours, sans qu'aucun spécialiste en robotique ne soit nécessaire en interne. La version actuelle supporte uniquement la peinture en poste fixe ; le suivi de ligne (line tracking, où le robot accompagne les pièces en mouvement continu) est annoncé pour une version future, sans calendrier précis communiqué. L'enjeu pour les ateliers de fabrication à mix élevé et faibles volumes est concret : jusqu'ici, l'externalisation des opérations de finition était souvent la seule option viable face au coût et à la complexité des lignes automatisées traditionnelles, qui impliquent des investissements lourds en infrastructure et des compétences rares. En internalisant le revêtement avec un cobot déployable dans l'environnement existant, les fabricants reprennent la main sur les délais, la qualité et les marges. La certification antidéflagrante du CRX-10iA/L Paint est un point technique non trivial : elle ouvre l'automatisation à des environnements où des vapeurs inflammables sont présentes, ce que la majorité des cobots collaboratifs standard ne peuvent pas adresser. La réduction du gaspillage de peinture et de la surpulvérisation, mise en avant par Hirebotics, est crédible sur le principe de la répétabilité robotique, mais aucun chiffre de ROI ni de comparatif de consommation n'a été publié à ce stade. Hirebotics a été fondée en 2015 et s'est spécialisée dans les robots à effort et puissance limités pour la métallurgie, avec une approche systématiquement axée sur l'accessibilité sans programmation. Le Cobot Painter vient compléter une gamme déjà composée du Cobot Welder et du Cobot Cutter, tous deux sous plateforme Beacon. Le partenariat avec FANUC America pour la certification peinture du CRX s'inscrit dans la stratégie du constructeur japonais de positionner sa série CRX sur les segments collaboratifs de niche. Côté concurrence, des acteurs comme Universal Robots (UR) avec des intégrateurs tiers, ou Stäubli sur les applications peinture certifiées, occupent ce terrain ; la différenciation de Hirebotics repose sur l'absence totale de programmation plutôt que sur les performances brutes du bras. Aucun prix ni volume de déploiement prévu n'a été communiqué lors du lancement.

IndustrielOpinion
1 source
Robust.AI choisit le capteur Aptiv PULSE pour son robot mobile Carter Gen 3
2070Robotics Business Review 

Robust.AI choisit le capteur Aptiv PULSE pour son robot mobile Carter Gen 3

Robust.AI a annoncé cette semaine, lors du salon Automate à Chicago, l'intégration du capteur PULSE d'Aptiv PLC dans son robot mobile collaboratif de troisième génération, le Carter Gen 3. Le PULSE est un système de perception fusionnant une caméra grand-angle et un radar ultra-courte portée pour une couverture à 360 degrés, avec fusion précoce des données brutes par apprentissage automatique. Cette architecture permet la création de cartes de profondeur et de grilles d'occupation en temps réel, deux éléments clés pour la navigation et la sécurité fonctionnelle en milieu industriel. Concrètement, le Carter est un AMR (autonomous mobile robot) logiciel-défini, conçu pour automatiser le picking de préparation de commandes, le transport point-à-point et le tri mobile, sans investissement en infrastructure fixe. Robust.AI, basée à San Carlos (Californie), commercialise son robot sur un modèle RaaS (Robotics-as-a-Service) à déploiement rapide et scalabilité flexible. En parallèle, les deux entreprises visent une certification Performance Level d (PL(d)), le niveau de sécurité fonctionnelle le plus exigeant pour les applications industrielles critiques, qu'Aptiv s'engage à obtenir pour les cas d'usage concernés. L'intérêt de ce partenariat dépasse le seul choix de composant : il illustre un virage sectoriel vers des systèmes de perception redondants et certifiables pour les AMR déployés en environnements partagés. Les entrepôts, ateliers de fabrication et zones de stockage froid posent des défis spécifiques que les capteurs monovoie gèrent mal : poussière, reflets, variations d'humidité, obstacles mobiles. La fusion radar-caméra à bas niveau (early fusion sur données brutes) est plus robuste que la fusion tardive sur sorties traitées, et c'est précisément ce que PULSE apporte au vSLAM (Visual Simultaneous Localization and Mapping) déjà embarqué sur Carter. Pour les décideurs industriels, la cible PL(d) est un signal fort : elle conditionne l'accès à des déploiements autonomes sans superviseur humain permanent, et ouvre la voie à des certifications CE Machinery Regulation en Europe. C'est un prérequis que beaucoup d'AMR actuels ne peuvent pas encore revendiquer. Robust.AI a été fondée par Gary Bradski et Anthony Jules, tous deux issus de l'écosystème robotique de Stanford et SRI International. La société positionne Carter comme un robot collaboratif capable de cohabiter avec les opérateurs humains, contrairement aux systèmes AGV traditionnels à zones d'exclusion. Aptiv, groupe irlandais historiquement centré sur l'électronique automobile (ex-Delphi), pousse depuis 2023 ses technologies de perception vers les marchés industriels et robotiques. Côté concurrence, Carter affronte des acteurs comme Locus Robotics, 6 River Systems (Shopify), Boston Dynamics Spot dans certains cas, et en Europe, Exotec avec son système Skypod. La différenciation de Robust.AI repose sur la flexibilité logicielle et le modèle RaaS, mais la certification PL(d) annoncée sera le véritable test de maturité industrielle. Aucune date de disponibilité commerciale du Gen 3 ni volume de déploiement n'ont été communiqués.

IndustrielOpinion
1 source
L'ARM Institute étend RoboticsCareer.org vers l'IA physique
2071Robotics Business Review 

L'ARM Institute étend RoboticsCareer.org vers l'IA physique

L'ARM Institute (Advanced Robotics for Manufacturing), organisation à but non lucratif basée à Pittsburgh, a annoncé une refonte substantielle de RoboticsCareer.org, son portail de carrières industrielles, désormais centré sur l'"IA physique" - terme désignant les systèmes d'IA embarqués dans des robots opérant dans des environnements industriels réels. Le site, qui a dépassé 100 000 utilisateurs en 2025, intègre quatre nouvelles fonctions : un référentiel de compétences (AI Competency Framework) co-construit avec son consortium membres (industrie, gouvernement, académie) ; des parcours de carrière standardisés ; des fiches de postes détaillant rémunérations et compétences requises ; et un répertoire de formations certifiées par l'industrie. Yaskawa America Inc., via son directeur des partenariats Clint Chapman, a contribué à définir ces standards. La plateforme vise à connecter candidats, employeurs et organismes de formation sur un point d'entrée unique, avec pour objectif affiché de réduire le déficit structurel de main-d'oeuvre qualifiée dans le secteur manufacturier américain. La pertinence de cette initiative tient à une tension bien documentée : les industriels américains accélèrent l'intégration de robots dotés d'IA pour compenser les pénuries de personnel, mais butent sur l'absence de travailleurs formés pour opérer, maintenir et intégrer ces systèmes. Selon le Forum économique mondial, le phénomène observable dans les usines est davantage une transformation des postes qu'une suppression nette - mais cette transition reste difficile à naviguer sans outillage RH adapté. Les métiers évoluent concrètement vers la maintenance de données, l'intégration de systèmes d'IA et le machine learning, compétences absentes des référentiels de formation traditionnels. Le positionnement d'"honest broker" de l'ARM Institute - arbitre neutre entre industriels, équipementiers et pouvoirs publics - confère à ce référentiel une légitimité que des initiatives portées par un seul fabricant n'auraient pas. Fondé en 2017 avec un financement du Département américain de la Défense dans le cadre du réseau Manufacturing USA, l'ARM Institute regroupe plusieurs centaines de membres dont Yaskawa, Fanuc et ABB. RoboticsCareer.org est son outil historique de workforce development, repositionné sur la vague "physical AI" - terme marketing qui recouvre ici des réalités concrètes : robots collaboratifs guidés par des modèles de vision (VLA), bras industriels pilotés par apprentissage par renforcement, AMR (Autonomous Mobile Robots) avec prise de décision locale. Sur le plan concurrentiel, la National Robotics Education Foundation ou les certifications NIMS (National Institute for Metalworking Skills) couvrent des périmètres adjacents, mais aucune n'agrège autant d'OEM partenaires ni de formations validées. Aucun calendrier précis n'a été communiqué pour les prochaines étapes - extension des offres listées, nouveaux partenariats de formation - ce qui place cette annonce davantage du côté du repositionnement stratégique que du déploiement opérationnel mesuré.

IndustrielOpinion
1 source
L'usine CATL intègre le robot humanoïde de Galbot pour la manutention lourde
2072Interesting Engineering 

L'usine CATL intègre le robot humanoïde de Galbot pour la manutention lourde

CATL, premier fabricant mondial de batteries pour véhicules électriques, a annoncé le déploiement du Galbot S1 dans ses lignes de production dans le cadre d'un partenariat stratégique avec le développeur chinois de robotique humanoïde Galbot. Le Galbot S1 est un robot humanoïde à charge lourde doté de bras capables de soulever jusqu'à 50 kilogrammes en charge combinée, d'un système de positionnement centimétrique par vision seule et d'une navigation omnidirectionnelle à 360 degrés. Déployé dans les usines de fabrication intelligente de CATL, il prend en charge les tâches de manutention, de transport de matériaux et de logistique répétitives lors de la production de modules et packs de batteries, avec des sessions continues pouvant atteindre huit heures. Le pack batterie embarqué intègre des matériaux cathode à gradation de particules, des anodes à faible consommation de lithium et un électrolyte bio-inspiré à auto-réparation, visant un taux de défaillance cellule à l'échelle des parties par milliard (ppb). Ce déploiement marque une étape concrète dans la commercialisation des humanoïdes industriels à charge lourde, un segment distinct des plateformes légères comme le Tesla Optimus Gen 3 ou le Figure 03, dont les capacités de manutention restent inférieures à 20 kg. Avec un payload de 50 kg, le Galbot S1 cible directement les tâches logistiques que les robots collaboratifs à bras fixes ou les AMR ne peuvent pas réaliser. Le fait que CATL maîtrise simultanément la production de batteries et leur intégration dans le robot crée une boucle verticale rare: le fabricant est à la fois client, fournisseur énergétique et partenaire de déploiement. L'annonce d'un réseau après-vente dédié aux robots humanoïdes, présenté comme un premier mondial, indique que CATL anticipe un marché de maintenance à grande échelle, au-delà de l'automatisation interne, même si aucun volume ni calendrier précis n'a été communiqué. CATL s'est engagé dans la robotique humanoïde depuis décembre 2025, date à laquelle il a présenté Xiaomo, un robot conçu pour les tests End-of-Line et les mesures de résistance interne en courant continu (DCIR) sur les packs batteries, développé par Spirit AI, une startup de Hangzhou financée par CATL. Xiaomo, animé par un modèle Vision-Language-Action (VLA) de bout en bout, affiche un taux de succès de connexion supérieur à 99% et des temps de cycle comparables à ceux d'un opérateur humain expérimenté, selon les données déclarées par CATL. La première ligne de production utilisant des humanoïdes avait été inaugurée à l'usine de Luoyang, dans la province du Henan. Sur le plan concurrentiel, CATL se retrouve dans une position ambivalente: il fournit des technologies batteries à des acteurs comme Figure AI ou Tesla, tout en développant sa propre capacité robotique en parallèle d'entreprises comme 1X Technologies ou Agility Robotics. Les prochaines étapes annoncées portent sur l'extension du Galbot S1 au réseau de service après-vente mondial de CATL et sur l'accélération du déploiement à grande échelle de l'IA incarnée dans ses sites industriels.

Chine/AsieOpinion
1 source
IA incarnée généraliste : RoboScience dévoile Visics
2073Pandaily 

IA incarnée généraliste : RoboScience dévoile Visics

La société pékinoise RoboScience a officiellement présenté le 24 juin 2026 Visics, son modèle d'IA embarquée à usage général, accompagné d'une divulgation technique complète de l'architecture VLOA (Vision-Language-Object-Action). L'annonce s'appuie sur des démonstrations réelles couvrant l'assemblage de meubles, la préhension dextre et des opérations sur lignes d'assemblage dynamiques. L'architecture repose sur une représentation intermédiaire unifiée baptisée Object Trajectory, soit une trajectoire de nuage de points 3D centrée sur l'objet manipulé plutôt que sur les trajectoires articulaires propres à un robot donné. Deux moteurs fonctionnent en tandem : un Embodied World Model, entraîné sur de vastes volumes de vidéos Internet pour apprendre la physique des objets et les dynamiques de force, et un General Operation Model qui traduit ces trajectoires en commandes hardware-agnostiques. La simulation propriétaire RoboMirage, couplée à des pipelines d'annotation vidéo automatisés, permettrait de générer des données d'entraînement à un coût représentant 1/20 à 1/200 des approches conventionnelles, avec un objectif de plus d'un téraoctet de données de trajectoires de manipulation d'ici fin 2026. Le tour de table inclut JD.com, SenseTime, Fortune Capital, CMB Capital et Sinovation Ventures ; les centres de R&D et de production sont répartis entre Pékin, Shenzhen, Suzhou et Hangzhou. L'approche VLOA tente de résoudre un problème structurel du secteur : les modèles de contrôle robotique sont aujourd'hui massivement liés à la cinématique d'un hardware précis, ce qui rend toute généralisation coûteuse et fragile. En découplant la couche cognitive (comprendre la tâche et l'objet) de la couche d'exécution (générer les commandes moteur), RoboScience affirme pouvoir déployer Visics sur des plateformes hétérogènes sans réentraînement complet. Si cela se confirme à l'échelle, l'impact pour les intégrateurs industriels serait significatif : fini le verrouillage sur un fournisseur de robot unique pour une cellule donnée. Les métriques de coût de données (1/200e du coût traditionnel) restent toutefois à vérifier indépendamment ; les vidéos de démonstration présentées sont sélectionnées et ne constituent pas un benchmark contradictoirement validé, un écart classique entre communication marketing et performance opérationnelle réelle. RoboScience s'inscrit dans une vague dense de startups chinoises d'IA embarquée qui cherchent à contester le leadership américain dans l'humanoïde et la manipulation généraliste. Face à Physical Intelligence (Pi-0), à NVIDIA (GR00T N2), ou encore à Agibot et Unitree sur le segment domestic/industrial, la stratégie de RoboScience mise sur l'abstraction hardware plutôt que sur la verticalisation matériel-logiciel adoptée par Figure ou 1X Technologies. Les pilotes annoncés portent sur le commerce de détail, la logistique et l'aide aux personnes âgées, trois segments où la variabilité des tâches et des objets est élevée, ce qui constituerait un test pertinent de la généralisation revendiquée. Le lancement d'une production en série standardisée pour des applications industrielles et commerciales est prévu pour le second semestre 2026, sans calendrier précis communiqué à ce stade.

IA physiqueOpinion
1 source
RoboScience lance Visics, un modèle fondation incarné universel, multi-morphologies, multi-objets et multi-tâches
207436Kr 

RoboScience lance Visics, un modèle fondation incarné universel, multi-morphologies, multi-objets et multi-tâches

Le 24 juin 2026, la startup chinoise RoboScience a dévoilé Visics, son modèle fondamental d'IA incarnée, en révélant pour la première fois l'architecture complète de son système VLOA (Vision-Language-Object-Action). Les démonstrations présentées couvrent des scénarios réels: assemblage de meubles, préhension dextre et lignes de production dynamiques. Le coeur technique est l'Object Trajectory, une représentation intermédiaire unifiée sous forme de trajectoires 3D en nuage de points, qui sert d'interface entre deux moteurs entraînés séparément: un modèle monde incarné, alimenté par des vidéos internet massives pour modéliser états d'objets, forces de contact et causalité physique; et un modèle d'opération universel, générant des commandes de contrôle multi-plateforme via le moteur de simulation propriétaire RoboMirage. Ce second module supporte corps rigides, pièces articulées et matériaux déformables, avec entrées vision, tactile et force. Le pipeline de données réduirait le coût unitaire à 1/20 à 1/200 des méthodes classiques selon l'entreprise, à raison de centaines de milliers d'heures par semaine; un dataset supérieur à 1 To de trajectoires manipulation est annoncé pour fin 2026. L'enjeu est structurel: contrairement aux LLM qui ont convergé sur le token texte, ou à l'autonomie automobile sur le nuage de points, la robotique généraliste ne dispose pas encore de représentation de base partagée, ce qui lie chaque modèle à un hardware, un objet et une tâche spécifiques. L'Object Trajectory tente de casser cette dépendance en permettant un déploiement cross-embodiment, sur objets variés et tâches non vues à l'entraînement, sans re-fine-tuning par configuration hardware. Pour un intégrateur ou un COO industriel, la promesse est un seul pipeline modèle couvrant un parc de robots hétérogènes, ce que les architectures actuelles liées aux trajectoires articulaires ne permettent pas. RoboScience, fondée par Tian Ye (CEO) et Wang Tao (co-fondateur), est soutenue par JD.com, SenseTime, Dachen Caizhao, China Merchants Capital, Zero One Ventures et PuHua Capital, avec des centres de R&D à Pékin, Shenzhen, Suzhou et Hangzhou. Elle se positionne dans le même espace que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures génériques de Figure, mais avec une approche délibérément centrée sur l'objet plutôt que sur la trajectoire articulaire. La société évite la confrontation directe avec l'automatisation industrielle lourde et cible en priorité la grande distribution et la logistique e-commerce, où la diversité massive de SKU constitue un banc d'essai naturel pour la généralisation multi-objet. Des pilotes sont en cours dans le retail, la logistique et les services à la personne; une production en série de robots standard pour usages industriels et commerciaux est annoncée pour 2026, sans prix ni volumes publics.

IA physiqueOpinion
1 source
NVIDIA Halos for Robotics : la sécurité des robots industriels entre dans une nouvelle ère
2075Robot Magazine FR 

NVIDIA Halos for Robotics : la sécurité des robots industriels entre dans une nouvelle ère

NVIDIA a présenté Halos for Robotics au salon Automate 2026 à Chicago, le positionnant comme le premier système de sécurité intégré conçu spécifiquement pour les robots pilotés par intelligence artificielle physique. L'annonce intervient dans un contexte de transformation accélérée de la robotique industrielle : les robots mobiles autonomes (AMR) transportent des composants entre ateliers, les cobots assistent les techniciens au quotidien, et les premiers robots humanoïdes commerciaux (Figure 03, Tesla Optimus, Agility Digit) commencent à réaliser des tâches de préparation de commandes et de manutention en environnement réel. Le marché mondial de la robotique industrielle est estimé à plus de 80 milliards de dollars d'ici la fin de la décennie selon plusieurs cabinets d'analyse, une projection conditionnée à la résolution du principal verrou restant : la sécurité en environnement partagé homme-machine. Il convient de préciser que Halos est pour l'instant une annonce de plateforme, pas un produit certifié en déploiement production. L'enjeu industriel est structurant. Pendant des décennies, la sécurité robotique reposait sur la séparation physique : cellules fermées, barrières optiques, arrêts d'urgence. Ce paradigme est incompatible avec la nouvelle génération de robots collaboratifs, qui doivent détecter un opérateur traversant leur trajectoire, anticiper ses mouvements et adapter leur comportement en quelques millisecondes. Les certifications en vigueur (ISO 10218, TS 15066 pour les applications cobots) ont été conçues pour des architectures déterministes, pas pour des systèmes piloté par des réseaux de neurones dont le comportement est probabiliste. Pour les intégrateurs et les COO industriels, l'absence d'un cadre de sécurité standardisé pour les robots IA constitue aujourd'hui le principal frein au déploiement à grande échelle, avant même les questions de performance ou de ROI. Une plateforme unifiée capable de couvrir détection, anticipation et certification normative réduirait significativement la charge d'ingénierie sécurité portée par chaque constructeur. NVIDIA construit cette initiative sur sa stack robotique existante, centrée sur les plateformes Isaac et Jetson, déjà adoptées par plusieurs constructeurs de robots humanoïdes et AMR. Le mouvement s'inscrit dans une stratégie plus large : après avoir dominé l'infrastructure d'entraînement des modèles IA, NVIDIA cherche à s'imposer comme couche système incontournable du déploiement robotique, face à des acteurs sécurité établis comme Pilz, SICK et Omron, qui maîtrisent la certification normative mais n'ont pas d'offre native pour les architectures VLA (vision-language-action). Les prochaines étapes annoncées concernent des pilotes avec des constructeurs de robots partenaires ; aucune date de certification ni de déploiement production n'a été communiquée à ce stade.

InfrastructureOpinion
1 source
NVIDIA Halos for Robotics : la sécurité des robots industriels entre dans une nouvelle ère
2076Robot Magazine FR 

NVIDIA Halos for Robotics : la sécurité des robots industriels entre dans une nouvelle ère

The article text you pasted cuts off mid-sentence right at "Avec Halos for Robotics, NVIDIA", exactly where the actual product details (what Halos technically includes, certification partners, competitive landscape, availability timeline) would start. That's the material paragraphs 2 and 3 need most (impact concret + contexte/suites), and the brief is strict about not inventing chiffres/noms/dates. Can you paste the rest of the source article (or the URL/press release)? Once I have the missing part, what Halos actually consists of (software stack, Jetson/Isaac Sim integration if any, safety certification standards, named partners or pilot customers), I'll write the final 300-450 word, 3-paragraph version with no section headers, per the brief.

IndustrielOutil
1 source
Filtrage de Kalman invariant pour l'estimation de pose étendue dans les systèmes articulés à corps rigides multi-IMU
2077arXiv cs.RO 

Filtrage de Kalman invariant pour l'estimation de pose étendue dans les systèmes articulés à corps rigides multi-IMU

Une équipe de chercheurs a publié en juin 2026 sur arXiv (réf. 2606.25083) une nouvelle méthode d'estimation de pose étendue pour les systèmes articulés multi-IMU. Leur contribution centrale est l'"IterIEKF" (iterated Invariant Extended Kalman Filter), construit autour d'une nouvelle représentation mathématique baptisée "relative L-extended pose", définie sur un groupe de Lie adapté aux arbres cinématiques. Chaque corps rigide est équipé d'une IMU indépendante, et les contraintes articulaires sont intégrées comme pseudo-mesures sans bruit dans le filtre. Validé sur un bras robotique UR5e (Universal Robots) et un modèle de jambe humaine instrumentée, l'IterIEKF réduit l'erreur quadratique moyenne (RMSE) d'au moins 50 % par rapport au second meilleur filtre testé, toutes configurations confondues, avec une convergence plus rapide et une variabilité run-to-run sensiblement moindre. L'importance de ce résultat tient à un verrou longtemps ouvert : l'IEKF standard, développé pour garantir convergence et cohérence sous inobservabilité, était limité à un seul corps rigide. Le couplage de pose entre segments articulés rendait son extension non triviale, et exprimer des contraintes cinématiques dans le cadre invariant restait un problème sans solution propre. En levant ce verrou, les auteurs ouvrent la voie à des estimateurs embarqués fiables pour les bras industriels, les jambes d'humanoïdes, et les exosquelettes médicaux, sans recourir à des caméras extérieures ni à un référentiel absolu. Pour les intégrateurs B2B, cela signifie potentiellement une localisation proprioceptive robuste sur des robots déployés en environnement non structuré. L'IEKF invariant a été formalisé au milieu des années 2010 par Axel Barrau et Silvère Bonnabel (MINES ParisTech / INRIA), et constitue depuis un axe actif de la communauté française de robotique et de traitement du signal. Cette extension aux systèmes articulés s'inscrit directement dans cet héritage. Du côté applicatif, des acteurs comme Wandercraft (exosquelettes de marche, Paris) ou les équipes du LAAS-CNRS travaillant sur la locomotion humanoïde sont des utilisateurs naturels de tels estimateurs. La prochaine étape logique est une implémentation temps réel embarquée sur processeur contraint, ainsi qu'une validation sur des humanoïdes complets, où le nombre de corps et la dynamique de contact posent des défis supplémentaires non couverts par ce travail.

RecherchePaper
1 source
Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes
2078arXiv cs.RO 

Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2606.25179) une étude portant sur la conception de contrôleurs de locomotion universels pour robots quadrupèdes, capables de s'adapter à plusieurs morphologies de robots différents tout en intégrant de la perception en temps réel. Les auteurs s'appuient sur le cadre MorAL (Morphology-Aware Locomotion), qu'ils étendent en comparant trois architectures : un contrôleur aveugle (baseline sans perception), MorAL+ (perception intégrée uniquement dans le critique du réseau, pas dans l'acteur), et PPAL (acteur-critique entièrement perceptif). Les politiques ont été évaluées en simulation sur terrains plats et accidentés, puis déployées sur du matériel réel via le robot ANYmal d'ANYbotics. Résultat principal : MorAL+ surpasse les deux autres configurations en robustesse et en cohérence de suivi de trajectoire, notamment parce qu'un acteur entièrement perceptif se révèle sensible au bruit de capteur, tandis qu'un acteur aveugle manque de conscience du terrain. Ce résultat va à contre-courant d'une intuition répandue dans la communauté robotique : intégrer plus de perception n'est pas toujours meilleur. Le fait que la perception placée uniquement dans le critique (et non dans l'acteur) améliore la robustesse sans fragiliser la politique face au bruit de capteur est une contribution architecturale concrète. Pour les intégrateurs industriels qui déploient des quadrupèdes en environnements non structurés (entrepôts, sites industriels, inspection d'infrastructures), cette distinction a des implications directes sur la conception des pipelines de contrôle. Elle indique aussi que le problème du sim-to-real pour la locomotion quadrupède n'est pas uniquement une question de quantité de données perceptives, mais de leur positionnement dans l'architecture d'apprentissage par renforcement. ANYmal, développé par ANYbotics (spin-off de l'ETH Zurich), est l'un des robots quadrupèdes les plus utilisés en recherche académique et en déploiements industriels pilotes, aux côtés de Spot de Boston Dynamics et des modèles Unitree (Go2, B2) qui dominent le segment prix bas. Le cadre MorAL, sur lequel s'appuie ce travail, visait déjà à entraîner des politiques transférables entre morphologies de robots différents, un problème ouvert dans la course à la généralisation inter-robots (cross-embodiment). Ce papier reste pour l'instant un preprint académique sans déploiement industriel annoncé ; les suites naturelles seraient une validation sur un ensemble plus large de morphologies quadrupèdes et des tests en conditions réelles prolongées, en dehors du cadre contrôlé d'un labo.

RecherchePaper
1 source
Action ControlNet : un adaptateur léger sensible aux délais pour un contrôle asynchrone fluide dans les modèles VLA
2079arXiv cs.RO 

Action ControlNet : un adaptateur léger sensible aux délais pour un contrôle asynchrone fluide dans les modèles VLA

Des chercheurs ont mis en ligne le 25 juin 2026 sur arXiv (réf. 2606.25985) Action ControlNet (ACNet), un adaptateur léger pour modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. Le problème ciblé : les VLA génèrent des actions par blocs ("chunks"), mais leur latence d'inférence impose une exécution asynchrone, c'est-à-dire que le robot continue à bouger pendant que le modèle calcule le chunk suivant. La jonction entre deux chunks produit alors des discontinuités (jitter d'action, ruptures de trajectoire) qui dégradent les performances, particulièrement dans les tâches en contact (assemblage, insertion). ACNet insère un module adaptateur qui conditionne la prédiction du prochain chunk sur le "motion suffix" déjà exécuté, permettant une transition cohérente avec l'état réel du robot au moment du handoff. Le backbone préentraîné reste figé ; seul l'adaptateur est entraîné, avec peu de paramètres supplémentaires. La méthode est compatible avec les têtes d'action de type diffusion et flow matching. Les évaluations couvrent les simulateurs Kinetix et Meta-World MT50 (50 tâches variées) ainsi qu'un bras réel SO-ARM101 ; ACNet surpasse le chunk stitching direct en fluidité et robustesse sous délai d'inférence, et reste plus léger qu'un réentraînement complet "delay-conditioned". Ce résultat intéresse directement les équipes de déploiement robotique : il propose une correction modulaire de l'asynchronisme sans toucher aux modèles de base. Les VLA de grande taille, notamment Pi-0 (Physical Intelligence), OpenVLA et Octo, souffrent tous du même problème ; une solution par adaptateur plug-in réduit sensiblement le coût d'adaptation. La compatibilité déclarée avec les têtes diffusion et flow matching couvre la majorité des architectures VLA actuelles, ce qui élargit la portée pratique. Nuance à retenir : les tests réels se limitent à un seul bras manipulateur à effecteur unique ; la généralisation à des configurations multi-bras ou à charge variable en environnement industriel reste à démontrer, et les benchmarks simulés ne reproduisent pas la complexité des lignes de production. Le problème de latence d'inférence dans les VLA est documenté depuis RT-2 (Google DeepMind, 2023) et a motivé des travaux comme Diffusion Policy et ACT (Action Chunking with Transformers). Les solutions existantes exigeaient soit un réentraînement complet du modèle avec conditionnement sur le délai, soit une logique de runtime spécifique à chaque architecture, deux contraintes qui freinent l'adoption industrielle. ACNet se positionne comme une alternative plus légère et plus générique. Dans l'écosystème concurrent, Physical Intelligence, Figure AI (Figure 03), 1X Technologies et Agility Robotics travaillent tous sur des pipelines VLA haut débit pour leurs plateformes humanoïdes et manipulateurs ; une intégration dans des frameworks open-source comme Lerobot (Hugging Face) pourrait accélérer le passage de la démonstration au déploiement réel. Ce preprint ne mentionne ni partenariat industriel ni timeline commercial.

IA physiqueActu
1 source
Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes
2080arXiv cs.RO 

Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes

Des chercheurs du Dynamic Legged Systems Lab de l'Istituto Italiano di Tecnologia (IIT) proposent sur arXiv (prépublication 2506.25965) une architecture de contrôle modulaire pour robots à pattes conçue pour maintenir la locomotion en cas de panne d'actionneur. Le système repose sur un mélange d'experts (Mixture-of-Experts, MoE) piloté par apprentissage par renforcement : un module de diagnostic identifie en temps réel le type de défaillance (joint bloqué, couple réduit, actionneur hors service), puis active l'expert spécialisé correspondant parmi plusieurs politiques de contrôle distinctes, chacune entraînée pour un mode de panne spécifique. Les expériences menées dans le simulateur IsaacLab montrent que ces politiques modulaires surpassent systématiquement des politiques monolithiques de taille comparable sur l'ensemble des scénarios de panne évalués. L'architecture conserve de surcroît des performances compétitives avec une capacité réseau significativement réduite, un critère déterminant pour les plateformes embarquées à ressources de calcul limitées, notamment en contexte d'exploration planétaire. Ce résultat adresse un angle mort persistant du déploiement hors-laboratoire des robots à pattes : la robustesse aux défaillances matérielles en cours de mission. Les politiques monolithiques entraînées par RL, qui ont produit des performances remarquables sur terrain accidenté (ANYmal d'ETH Zurich, Spot de Boston Dynamics, MIT Cheetah), supposent implicitement l'intégrité de l'ensemble des actionneurs. Injecter explicitement l'état diagnostiqué de panne dans la boucle de décision permet à chaque expert de se spécialiser sur un sous-espace comportemental bien délimité, ce qui explique leur supériorité même à capacité réduite. Pour un intégrateur ou un concepteur de mission, l'architecture MoE trace une voie concrète vers des robots capables de poursuivre une mission malgré une défaillance partielle, sans intervention humaine ni recalibration à distance. L'IIT est l'un des laboratoires européens de référence en robotique à pattes, à l'origine de la lignée hydraulique HyQ et HyQReal. La cible applicative explicitement déclarée par les auteurs est l'exploration planétaire, domaine où l'ESA et la NASA cherchent activement des solutions de mobilité résiliente pour des rovers de nouvelle génération. Les approches concurrentes, notamment les politiques adaptatives basées sur l'estimation d'état développées par le Robotics Systems Lab de l'ETH Zurich sur ANYmal, n'exploitent pas aussi directement l'information de diagnostic pour router dynamiquement vers des experts dédiés par mode de panne. Le code est publié en open source sur GitHub (dépôt iit-DLSLab/fault-locomotion-isaaclab) sous IsaacLab, ce qui facilite la reproductibilité et l'adoption par la communauté. Prochaine étape attendue : validation sur plateforme physique, les résultats actuels étant entièrement en simulation.

FR/EU ecosystemePaper
1 source
DeformGen : augmentation topologique basée sur la dynamique pour l'apprentissage de politiques de manipulation d'objets déformables
2081arXiv cs.RO 

DeformGen : augmentation topologique basée sur la dynamique pour l'apprentissage de politiques de manipulation d'objets déformables

Une équipe de chercheurs a publié fin juin 2026 DeformGen (arXiv:2606.25939), un framework d'augmentation de données de démonstration conçu pour l'apprentissage de politiques de manipulation d'objets déformables. Face au coût prohibitif de la collecte de données réelles pour ce type de tâche, la méthode génère automatiquement de nouveaux exemples d'entraînement à partir d'un ensemble restreint de démonstrations existantes. L'approche repose sur deux briques techniques distinctes : d'abord, l'application de perturbations physiques localisées suivies d'une simulation de dynamique vers l'avant pour produire des états déformés topologiquement cohérents et physiquement plausibles ; ensuite, un transfert de trajectoires par déformation de champ continu ("deformation-field warping"), qui projette les déplacements par particule en une fonction spatiale continue permettant d'adapter la trajectoire de l'effecteur terminal à la nouvelle géométrie de l'objet. Les expériences menées sur des benchmarks haute fidélité de manipulation déformable montrent des améliorations systématiques par rapport à l'entraînement sur les seules démonstrations d'origine et par rapport aux baselines d'augmentation de style rigide. L'enjeu est de taille pour l'industrie robotique : la manipulation d'objets déformables (textiles, câbles, aliments, composants souples) reste l'un des verrous majeurs du déploiement en production, précisément parce que les méthodes d'augmentation classiques, conçues pour des objets rigides, échouent à générer des configurations valides dans un espace d'états haute dimension soumis aux contraintes physiques. DeformGen identifie et adresse deux problèmes fondamentaux jusque-là non résolus : l'espace d'états valides ne peut pas être couvert par de simples perturbations de pose 6-DOF, et le transfert de trajectoire n'est pas équivariant sous déformation. Si ces résultats se confirment sur des tâches industrielles réelles, ce type d'approche pourrait réduire significativement le coût d'acquisition de données pour les lignes de picking textile, le routage de câbles dans l'électronique ou la manipulation agro-alimentaire. Ce travail s'inscrit dans un courant actif de recherche sur l'augmentation de démonstrations pour l'apprentissage par imitation, domaine où les avancées ont surtout bénéficié jusqu'ici à la manipulation d'objets rigides. Les acteurs qui travaillent sur la manipulation déformable en milieu industriel, comme Pollen Robotics en France ou des équipes universitaires spécialisées en sim-to-real, pourraient trouver dans cette approche une piste pour réduire la dépendance à la téléopération coûteuse. Les auteurs se concentrent pour l'instant sur des benchmarks simulés haute fidélité ; la question du sim-to-real gap sur des matériaux réels reste ouverte et constitue la prochaine étape critique à franchir avant tout déploiement opérationnel.

IA physiquePaper
1 source
RoboAtlas : SLAM actif contextuel
2082arXiv cs.RO 

RoboAtlas : SLAM actif contextuel

Des chercheurs ont publié le 25 juin 2026 RoboAtlas, un framework de SLAM actif contextuel conçu pour permettre à un robot de naviguer et de cartographier un environnement inconnu tout en accomplissant des tâches sémantiques complexes. Le système s'appuie sur OpenRoboVox, une couche de cartographie 3D sémantique scalable, et pilote un robot quadrupède Unitree Go2 dans des environnements réels dépassant 1 800 m², avec environ 30 000 instances sémantiques cartographiées. Sur le benchmark GOAT-Bench "Val Unseen", RoboAtlas atteint un taux de succès (SR) de 90,6 % avec GPT-4o, soit +17,8 points de pourcentage sur le meilleur baseline précédent. Avec le modèle Qwen2.5-VL-7B, sept fois plus petit, il obtient 88,8 % SR, dépassant tous les baselines GPT-4o du benchmark. En environnement réel, le système affiche un taux de réussite de 100 % sur les tâches testées, ce qui constitue une barre haute pour ce type d'évaluation. Le résultat le plus significatif n'est pas le score absolu, mais ce qu'il révèle sur l'architecture : passer d'un VLM de 7 milliards de paramètres à GPT-4o ne fait gagner que 1,8 point, alors que retirer la couche de cartographie sémantique ferait s'effondrer les performances. Cela contredit la stratégie dominante dans les labs robotiques qui misent sur des modèles fondationnels toujours plus grands comme levier principal de robustesse. Pour un intégrateur ou un décideur B2B, la leçon est concrète : la qualité de la représentation spatiale et sémantique de l'environnement compte davantage que la puissance brute du modèle de raisonnement. RoboAtlas utilise un bandit manchot multi-bras pour arbitrer dynamiquement entre exploration frontière (cartographier l'inconnu) et navigation sémantique guidée (aller vers ce qui est déjà compris), ce qui résout élégamment le dilemme exploration-exploitation en robotique indoor. RoboAtlas s'inscrit dans la lignée des travaux sur le SLAM actif sémantique, un domaine en consolidation rapide depuis que les VLM ont rendu tractable le raisonnement sur scènes complexes. Sur le benchmark GOAT-Bench, les baselines précédents incluaient des approches modulaires classiques et des pipelines end-to-end purs, tous inférieurs de plus de 17 points. Les auteurs n'annoncent pas de déploiement commercial, et les résultats terrain portent sur un seul robot dans un cadre contrôlé : le "100% success rate" mérite d'être pondéré en conséquence. La prochaine étape naturelle est l'extension à des flottes multi-robots et à des environnements dynamiques, où la cohérence de la carte sémantique partagée reste un problème ouvert.

IA physiquePaper
1 source
Un jeu de données imprimable en 3D pour évaluer et comparer objectivement les capteurs tactiles
2083arXiv cs.RO 

Un jeu de données imprimable en 3D pour évaluer et comparer objectivement les capteurs tactiles

Des chercheurs ont publié sur arXiv (arXiv:2606.25886, juin 2026) un jeu de données ouvert de textures imprimables en 3D, conçu spécifiquement pour évaluer et comparer les capteurs tactiles de manière reproductible. Le dataset comprend six motifs de surface générés paramétriquement à partir de combinaisons de fonctions sinusoïdales et de séries de Fourier, offrant une variation contrôlée en fréquence spatiale, amplitude et structure directionnelle. Ces textures ont été évaluées sur trois imprimantes 3D grand public et plusieurs types de filaments, en mesurant la variance des empreintes capturées par un capteur optique TacTip sous conditions de contact contrôlées. Des expériences de classification ont ensuite été menées avec des réseaux de neurones et des modèles PCA. Le problème que ce travail cherche à résoudre est fondamental pour la communauté de la robotique haptique : jusqu'ici, les benchmarks de perception tactile dépendaient des lectures d'un capteur spécifique interagissant avec des surfaces disponibles en laboratoire, rendant toute comparaison inter-capteurs structurellement biaisée. Ce dataset brise ce verrou en définissant les textures de manière mathématique plutôt que physique, ce qui permet leur fabrication indépendante dans n'importe quel laboratoire équipé d'une imprimante FDM. Les résultats montrent toutefois une limite importante : la généralisation intra-imprimante est robuste, mais la généralisation inter-imprimantes reste difficile en raison d'inconsistances géométriques liées à la qualité d'impression, notamment la netteté des pics et le phénomène de "stringing". Les imprimantes haut de gamme produisent des signatures tactiles significativement plus cohérentes. La perception tactile reste l'un des sens les moins standardisés en robotique, contrairement à la vision où des benchmarks comme YCB ou LINEMOD sont devenus des références universelles. Des plateformes comme le TacTip (Bristol Robotics Lab) ou le GelSight (MIT) ont chacune développé leurs propres protocoles d'évaluation, sans base commune. Ce dataset constitue, selon les auteurs, le premier benchmark tactile physiquement reproductible et ouvertement disponible. Les prochaines étapes naturelles concernent l'extension à des matériaux aux propriétés mécaniques variées (rigidité, élasticité) et l'intégration à des pipelines de manipulation robotique où la discrimination de texture conditionne la stratégie de saisie.

RecherchePaper
1 source
Vers des modèles vision-langage à faible latence avec prédictions doublement correctes pour la compréhension visuelle égocentrique
2084arXiv cs.RO 

Vers des modèles vision-langage à faible latence avec prédictions doublement correctes pour la compréhension visuelle égocentrique

Des chercheurs ont publié sur arXiv (réf. 2606.25160v1) une étude sur l'élagage des modèles vision-langage (VLMs) appliqué à la compréhension visuelle égocentrique, c'est-à-dire depuis le point de vue d'un robot ou d'un humain équipé de capteurs embarqués. L'objectif est de réduire la latence d'inférence pour des tâches collaboratives homme-robot (HRC) en temps réel, où chaque milliseconde compte. Les auteurs introduisent le concept de "prédiction doublement correcte" : une sortie du modèle doit être à la fois précise dans sa réponse ET ancrée dans les bonnes preuves visuelles (localisation d'evidence correcte). Leurs expériences montrent un résultat surprenant : les méthodes d'élagage existantes (weight pruning) tendent à préserver la localisation des indices visuels pertinents, mais dégradent la précision de la prédiction finale. Pour corriger cela, ils proposent une stratégie d'élagage informée par le raisonnement (rationale-informed pruning), validée sur des jeux de données vidéo égocentrique, sur lesquels elle surpasse les approches concurrentes en précision et en taux de prédictions doublement correctes. Pour les intégrateurs robotiques et les équipes qui déploient des VLMs sur des robots collaboratifs, ce résultat a des implications directes. La sécurité en HRC exige non seulement que le robot prenne la bonne décision, mais qu'il la prenne pour les bonnes raisons, ce qui est essentiel pour l'auditabilité et la conformité dans des contextes industriels réglementés. La démonstration que les techniques d'élagage standards cassent silencieusement la chaîne preuve-décision est un signal d'alarme pour quiconque compresse des VLMs à des fins de déploiement embarqué sans valider ce couplage. Cette publication s'inscrit dans une vague de travaux visant à rendre les VLMs exploitables sur hardware contraint, en réponse à la montée en puissance des architectures vision-action comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), qui intègrent déjà des capacités de compréhension visuelle pour la manipulation. L'élagage structuré reste une voie active face à la distillation ou la quantification. La prochaine étape naturelle serait de tester cette approche sur des benchmarks de manipulation réelle ou des pipelines de type VLA (Vision-Language-Action), où le gap sim-to-real reste ouvert. Il s'agit pour l'instant d'un preprint non évalué par les pairs.

RechercheOpinion
1 source
DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles
2085arXiv cs.RO 

DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles

Des chercheurs du laboratoire AUBVRL ont publié sur arXiv le 25 juin 2026 DSP-SLAM++, une extension du système DSP-SLAM conçue pour cartographier simultanément plusieurs classes d'objets en temps réel avec une fidélité géométrique élevée. Le système repose sur un pipeline de cartographie asynchrone, où le thread de mapping tourne indépendamment du thread de suivi, ce qui permet de traiter des séquences multi-classes à 25 Hz sans bloquer l'ensemble du pipeline. Couplé à une suite sensorielle fisheye monoculaire et LiDAR, DSP-SLAM++ réduit la latence maximale de traitement des objets jusqu'à 70 % par rapport à la baseline DSP-SLAM d'origine, tout en produisant des reconstructions 3D géométriquement complètes pour chaque objet détecté. Le code est disponible en open source sur GitHub (AUBVRL/DSP-SLAMpp). Ce résultat compte parce que le trilemme classique du SLAM orienté objets, choisir entre temps réel, support multi-classes et fidélité des modèles 3D, restait non résolu dans les systèmes existants. Un gain de 70 % sur la latence maximale (et non sur une latence moyenne, détail important) signifie que les cas extrêmes, ceux qui gelaient le thread de cartographie sur des scènes denses, sont maîtrisés. Pour un intégrateur qui équipe un véhicule autonome ou un bras de manipulation, c'est la différence entre un système testé en labo et un système opérationnel sur plateforme embarquée réelle. L'adaptation fisheye-LiDAR est également stratégique : ce binôme est devenu la configuration standard en robotique terrain et en conduite autonome niveau 2-3, là où les caméras rectilignes coûtent en champ de vue. DSP-SLAM, le prédécesseur direct, était lui-même une extension de SuperPoint SLAM publiée autour de 2021-2022 et avait démontré la viabilité des représentations implicites par réseaux de formes (DeepSDF-style) pour le SLAM objet, mais butait sur les performances en environnements multi-classes et multi-capteurs. Dans l'espace concurrent, on trouve EAO-SLAM, OrcVIO ou encore les approches NeRF-SLAM (iMAP, NICE-SLAM), qui privilégient la reconstruction de scènes complètes au détriment de la sémantique par objet. DSP-SLAM++ se positionne donc sur le créneau précis de la granularité objet à haute fidélité en temps réel, créneau directement utile pour la manipulation robotique (pick-and-place avec modèle 3D précis) et la détection d'obstacles typés en conduite autonome. Les prochaines étapes logiques incluent l'extension à des classes ouvertes via des fondations visuelles (SAM, DINO) et les tests sur plateformes embarquées contraintes comme Jetson Orin.

RecherchePaper
1 source
Commerge : fusion de cartes LiDAR économe, robuste et rapide pour la coordination multi-robots sous contraintes
2086arXiv cs.RO 

Commerge : fusion de cartes LiDAR économe, robuste et rapide pour la coordination multi-robots sous contraintes

Une équipe du SPARO Lab publie Commerge (arXiv:2606.25386), un framework de fusion de cartes LiDAR conçu pour des essaims de robots opérant dans des environnements à bande passante limitée, capable de réduire le volume de données échangées entre robots jusqu'à 5 000 fois sans dégradation notable de la précision d'alignement. Sur le jeu de données HeLiPR, le volume transmis passe de 7 000 Mo à 1,3 Mo, soit une réduction de 99,98%. L'architecture repose sur une optimisation cascadée en trois étapes appliquée à un graphe d'échange, où les sommets représentent les keyframes de chaque robot et les arêtes les boucles inter-robots candidates. Ce pipeline identifie le sous-ensemble minimal de scans LiDAR, séquentiellement chevauchants et géométriquement pertinents, qui préserve la cohérence globale de la carte tout en minimisant le coût de transmission. L'évaluation porte sur neuf jeux de données (cinq publics, quatre propriétaires) couvrant des environnements de grotte, d'analogues planétaires, intérieurs et de campus extérieurs, sur des plateformes allant de l'embarqué au poste de travail. Le goulot d'étranglement communicationnel est l'obstacle central au déploiement de flottes de robots mobiles en environnement dégradé : sous-sol minier, tunnels, exploration spatiale ou entrepôts à couverture WiFi partielle. Les approches existantes imposaient un choix binaire entre transmettre l'intégralité des scans (échelle GB, infaisable sur lien bas débit) et un sous-échantillonnage naïf qui détériore la précision d'alignement. Commerge invalide ce compromis en montrant qu'un sous-ensemble sélectionné par théorie des graphes suffit à maintenir la qualité de fusion. Pour un intégrateur ou un COO industriel, cela ouvre la voie à des flottes d'AMR LiDAR capables de construire une carte globale cohérente sur des réseaux contraints (4G dégradé, radio maillée, liaison satellitaire) sans surcharge d'infrastructure. La fusion de cartes LiDAR multi-robots s'inscrit dans le champ du SLAM collaboratif, domaine actif depuis une décennie mais historiquement conditionné à des hypothèses de connectivité peu réalistes, que des travaux comme COVINS, DiSCo-SLAM et Swarm-SLAM ont progressivement atténuées sans résoudre la contrainte de bande passante. Commerge comble directement cet angle mort, avec du code et des matériaux disponibles sur sparolab.github.io/research/commerge. Les prochaines étapes naturelles incluront la validation dans des déploiements réels souterrains ou extraterrestres, contextes où Boston Dynamics, Clearpath Robotics et le programme DARPA SubT ont identifié la communication comme verrou systémique.

RecherchePaper
1 source
Apprentissage de priors d'action pour la manipulation robotique multi-morphologies
2087arXiv cs.RO 

Apprentissage de priors d'action pour la manipulation robotique multi-morphologies

Des chercheurs ont soumis le 25 juin 2026 sur arXiv (réf. 2606.26095) un cadre d'entraînement en deux étapes pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique cross-embodiment. Le problème est structurel : dans l'architecture dominante, le module d'action est greffé sur un backbone Vision-Language Model (VLM) et co-optimisé dès le départ, ce qui contraint le modèle à découvrir simultanément la dynamique physique du mouvement et l'alignement visuo-linguistique. Les auteurs proposent de préentraîner d'abord le module d'action sur des trajectoires brutes via un encodeur-décodeur léger basé sur le flow-matching, sans aucune entrée visuelle ni linguistique, puis de transférer ce prior moteur à l'entraînement VLA par réutilisation du décodeur et distillation latente en début d'entraînement. La méthode est évaluée sur 13 tâches cross-embodiment en simulation et sur plateformes réelles. Le bénéfice principal est de découpler deux apprentissages que les VLA actuels co-optimisent de front : la structure temporelle du mouvement et la sémantique visuo-linguistique. Selon les résultats présentés, la méthode accélère la convergence, améliore les taux de succès globaux et génère des gains particulièrement nets sur les tâches à faible volume de données réelles, là où les pipelines existants décrochent. Le module encodeur joue par ailleurs le rôle de compresseur d'historique, résumant l'historique état-action en un unique token de contexte temporel à coût négligeable. Fait notable : augmenter le volume de données d'action en étape 1 améliore directement les performances downstream, sans requérir de nouvelles démonstrations robotiques coûteuses à collecter. Ce travail s'inscrit dans la compétition autour des politiques robotiques généralistes capables d'opérer sur des morphologies hétérogènes : Pi-0 (Physical Intelligence), OpenVLA, Octo (UC Berkeley) et RT-2 (Google DeepMind) constituent les références directes. La rareté des données réelles annotées et le sim-to-real gap restent les freins communs à l'ensemble du secteur, et une meilleure initialisation du prior moteur en offre une réponse partielle. Il s'agit d'un preprint non évalué par les pairs, sans déploiement industriel annoncé ; les suites naturelles seraient une intégration dans des frameworks open-source comme LeRobot (Hugging Face) ou une adoption par des équipes développant des humanoïdes généralistes.

RechercheOpinion
1 source
Un corps, deux esprits : approche à autonomie variable pour une main robotique à contrôle partagé
2088arXiv cs.RO 

Un corps, deux esprits : approche à autonomie variable pour une main robotique à contrôle partagé

Des chercheurs ont publié le 25 juin 2026 sur arXiv (2606.25575) une étude portant sur une main robotique portable à autonomie variable, conçue selon un paradigme qu'ils appellent "co-embodiment" : humain et robot partagent un seul corps physique et alternent les niveaux de contrôle selon la phase de la tâche. Le système intègre une politique visuomotrice de diffusion apprise par démonstration (learning-from-demonstration), qui prend en charge la saisie autonome d'objets connus dès que l'utilisateur positionne sa main à proximité. Une fois l'objet saisi, un signal indique à l'utilisateur de reprendre la main ; il commande alors l'outil (perceuse, spray, thermomètre infrarouge, briquet ou cuillère à glace) via des gestes de la tête sans contact physique. L'utilisateur conserve à tout moment un droit de veto par un geste de relâchement. Une étude avec 44 participants effectuant cinq tâches bimanuelles a donné des résultats mesurés : réduction du temps d'exécution de 23,3 % entre le premier et le dernier essai (p inférieur à 0,001, Cohen d = 0,94), taux de succès atteignant 93,6 % pour la meilleure variante de politique, et scores d'acceptabilité de 5,70/7 pour l'impression globale et 5,52/7 pour la volonté d'usage quotidien. Ce travail répond à un problème structurel des systèmes d'assistance robotique : les solutions entièrement autonomes retirent à l'utilisateur son agentivité, tandis que les systèmes entièrement pilotés à la main imposent une charge cognitive permanente. L'approche proposée tranche différemment des architectures de "shared autonomy" classiques, où le contrôle est continuellement négocié entre humain et robot dans des corps séparés : ici, le passage entre autonomie totale du robot et contrôle total de l'humain est discret et lié à la phase de la tâche, ce qui simplifie l'interface mentale pour l'utilisateur. La rapidité d'adaptation des participants (amélioration significative dès les premières répétitions) et les scores d'acceptabilité élevés plaident pour une viabilité clinique réelle, notamment dans des contextes de rééducation ou d'assistance aux personnes avec déficiences motrices unilatérales. L'intégration d'une politique de diffusion visuomotrice performante dans un dispositif portable constitue également un signal fort sur la maturité des politiques d'imitation pour des applications embarquées hors lab. Sur le plan académique, ce travail s'inscrit dans un courant actif de recherche sur les prothèses et orthèses à contrôle partagé, aux côtés de travaux comme ceux des équipes Imperial College London sur les mains myoélectriques intelligentes ou des approches "supernumerary robotic limbs" du MIT. La différence revendiquée ici est l'alternance franche d'autonomie plutôt que la fusion continue des commandes. Les concurrents industriels dans l'espace des exosquelettes de main (Bioservo, Hocoma, ou côté français Wandercraft sur les membres inférieurs) n'adressent pas encore cette logique de délégation contextuelle. L'étude reste pour l'instant un prototype de laboratoire validé en conditions contrôlées ; les prochaines étapes naturelles seraient des essais sur des populations cibles (AVC, lésions médullaires partielles) et une miniaturisation du système de détection pour réduire l'encombrement du dispositif porté.

ExosquelettesPaper
1 source
Modélisation du monde en contexte pour le contrôle robotique
2089arXiv cs.RO 

Modélisation du monde en contexte pour le contrôle robotique

Des chercheurs ont publié le 25 juin 2026 un preprint arXiv (2606.26025) présentant ICWM (In-Context World Modeling), un cadre d'adaptation pour les modèles Vision-Language-Action (VLA) appliqués à la robotique. Les VLA actuels échouent dès que le contexte d'exécution change - angle de caméra différent, morphologie de robot modifiée - parce qu'ils supposent un contexte fixe, celui rencontré pendant l'entraînement, et nécessitent un fine-tuning intensif en données pour toute nouvelle configuration. ICWM traite l'identification du système comme un problème d'adaptation en contexte : avant d'exécuter une tâche, le robot génère de courtes interactions autonomes agnostiques à la tâche, dont l'historique est injecté dans la fenêtre de contexte du modèle. Celui-ci infère ainsi implicitement la dynamique du système courant - position de caméra, configuration mécanique - sans mise à jour de poids. Les expériences menées en simulation et sur plateformes réelles montrent que ICWM surpasse significativement les baselines VLA standards sur des configurations de caméra inédites. La généralisation des VLA est le verrou principal qui freine le déploiement industriel de la robotique généraliste. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et les modèles Google nécessitent tous du fine-tuning dès qu'on change la disposition d'une caméra ou la morphologie d'un robot, ce qui rend les pilotes industriels coûteux et longs à mettre en place. ICWM attaque ce problème sans modifier les poids du modèle : l'adaptation passe uniquement par le contexte, à l'image de ce que l'In-Context Learning a apporté aux LLMs. Pour un intégrateur ou un COO industriel, cela signifie potentiellement déployer un même modèle sur plusieurs lignes avec des géométries de capteurs différentes, sans pipeline de re-entraînement. La contribution est conceptuellement distincte : là où l'ICL classique spécifie quelle tâche effectuer, ICWM apprend comment le système fonctionne - une couche d'adaptation complémentaire aux approches existantes. Les modèles VLA ont connu une explosion depuis 2024 : RT-2 (Google DeepMind), Pi-0 de Physical Intelligence, GR00T N2 d'NVIDIA présenté à GTC 2025, et plus récemment Helix (Figure AI) illustrent la convergence entre fondations LLM et contrôle moteur. La fragilité aux variations contextuelles - ce qu'on appelle le "demo-to-deployment gap" - reste une critique récurrente formulée notamment par des acteurs européens comme Enchanted Tools ou Wandercraft, qui misent sur des architectures plus déterministes pour des environnements industriels contraints. ICWM s'inscrit dans une tendance plus large : importer les paradigmes d'adaptation du machine learning directement dans la boucle de contrôle robotique, sans passer par un cycle de collecte de données et de re-entraînement. Le preprint ne mentionne ni partenariat industriel, ni code open-source, ni dataset public : il s'agit d'une contribution de recherche pure, sans déploiement commercial annoncé à ce stade.

IA physiqueOpinion
1 source
Représentations centrées sur l'objet pour une meilleure généralisation en manipulation robotique
2090arXiv cs.RO 

Représentations centrées sur l'objet pour une meilleure généralisation en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.21416v2) une étude comparative sur les représentations visuelles utilisées pour entraîner des politiques de manipulation robotique. Le problème central : les robots peinent à généraliser lorsque les conditions visuelles changent, éclairage, textures ou présence d'objets parasites dans la scène. L'équipe a évalué trois familles de représentations extraites d'encodeurs pré-entraînés : les features globales (image résumée en un seul vecteur agrégé), les features denses (embedding par patch issu de la dernière couche de l'encodeur), et une approche intermédiaire baptisée SBOCR (Slot-Based Object-Centric Representations), qui regroupe ces features denses en un nombre fini d'entités "objet-like" via un mécanisme de slots. Testées sur une batterie de tâches de manipulation en simulation et en conditions réelles, allant de scénarios simples à complexes, les politiques SBOCR surpassent les deux autres familles en termes de généralisation, sans pré-entraînement spécifique à la tâche. Ce résultat intéresse directement les intégrateurs et équipes R&D en robotique : la principale cause d'échec en déploiement n'est pas la commande moteur, mais la robustesse perceptuelle aux conditions non vues à l'entraînement. Les features globales sacrifient le détail spatial ; les features denses transmettent trop d'information non pertinente (fond, reflets, distracteurs), dégradant la politique hors distribution. SBOCR agit comme un filtre structuré : en segmentant implicitement la scène en objets discrets, la représentation réduit le bruit transmis à la politique sans perdre les informations nécessaires à l'exécution de la tâche. C'est un signal significatif pour les architectures VLA (Vision-Language-Action), et cela valide empiriquement que la structure objet-centrique améliore la robustesse aux shifts visuels sans supervision supplémentaire. Ce travail s'inscrit dans la lignée des Slot Attention (Locatello et al., Google Brain, 2020). Dans le paysage concurrent, les politiques VLA majeures comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA) s'appuient majoritairement sur des features denses issues de ViT ou CLIP, sans structuration objet explicite. La question de l'intégration de SBOCR dans des architectures transformer de grande taille reste ouverte, notamment sur le plan du coût computationnel. Il s'agit d'un preprint arXiv sans évaluation par les pairs publiée à ce jour ; la scalabilité à des environnements industriels complexes, multi-objets et à fortes occlusions, reste à confirmer.

IA physiqueOpinion
1 source
Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes
2091arXiv cs.RO 

Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes

Des chercheurs ont publié le 25 juin 2026 sur arXiv (preprint 2606.25706) un cadre de contrôle baptisé "asynchronous upper body task-space tracking" pour robots humanoïdes. Le problème qu'ils adressent est architectural : les planificateurs de haut niveau génèrent des trajectoires dans l'espace des tâches à faible fréquence (quelques Hz), alors que les contrôleurs de corps entier tournent à haute fréquence (typiquement plusieurs centaines de Hz). Cette désynchronisation temporelle entre planification et exécution produit des dérives de référentiel et des incohérences dans le contrôle. Pour y remédier, l'équipe propose une politique étudiante initialisée par distillation enseignant-étudiant, conditionnée sur la trajectoire future complète mise en cache et un index d'exécution temporel, puis entraînée avec une récompense globale à fenêtre glissante. Un module MPC (Model Predictive Control) complète les références creuses en guidage corps flottant et membre supérieur, tandis que des contraintes au niveau des actions et de la cinématique directe (FK) limitent la dérive de la politique. Les expériences ont été conduites en simulation et sur le robot Unitree G1, un humanoïde commercial à 23 degrés de liberté. Ce travail touche un goulot d'étranglement concret qui freine la commercialisation des humanoïdes : la chaîne planification-exécution reste fragmentée dans la quasi-totalité des architectures actuelles, forçant des compromis entre réactivité et cohérence de mouvement. Le fait que la politique obtienne de meilleures performances que les baselines synchrones et découplées, et qu'elle s'adapte plus sûrement aux mouvements hors distribution, suggère une progression vers un déploiement robuste en environnement non contrôlé. L'approche sans estimation explicite de référentiel réduit aussi la charge computationnelle, ce qui est pertinent pour les intégrateurs industriels cherchant à embarquer le traitement. Toutefois, il s'agit d'un preprint non encore évalué par les pairs, et les métriques de suivi de trajectoire présentées restent contextualisées à des scénarios de laboratoire ; la généralisabilité à des tâches industrielles réelles reste à démontrer. Unitree Robotics, fabricant chinois fondé en 2016, s'est imposé comme fournisseur de plateformes de recherche abordables avec des robots quadrupèdes puis le G1 humanoïde. Ce contexte explique le choix du matériel : le G1 est accessible à de nombreux labos académiques, ce qui élargit la portée reproductible des résultats. Sur le fond, la course à la maîtrise du pipeline planification-exécution pour les humanoïdes mobilise simultanément Figure (02 et bientôt 03), Tesla Optimus, Agility Robotics, 1X Technologies et les laboratoires académiques liés à Physical Intelligence (Pi-0) et à NVIDIA (GR00T N2). La distillation enseignant-étudiant couplée au MPC comme module de complétion de trajectoire s'inscrit dans une tendance plus large : combler le sim-to-real gap par des architectures hybrides apprises/optimisées plutôt que par du RL pur. Les prochaines étapes naturelles seraient une validation sur des cycles de manipulation répétitifs en cadence industrielle et une intégration avec des VLA (Vision-Language-Action models) pour fermer la boucle perception-planification-exécution.

RecherchePaper
1 source
Au-delà de la topologie : une représentation en graphe des symétries morphologiques pour les politiques de locomotion
2092arXiv cs.RO 

Au-delà de la topologie : une représentation en graphe des symétries morphologiques pour les politiques de locomotion

Des chercheurs présentent MS-PPO (Morphological Symmetry Proximal Policy Optimization), une architecture d'apprentissage par renforcement pour la locomotion robotique qui encode les symétries morphologiques directement dans la structure du réseau de contrôle. Ce preprint, mis à jour sur arXiv en juin 2026 (identifiant 2512.00727v2), valide l'approche sur deux plateformes commerciales d'Unitree Robotics : le quadrupède Go2 et l'humanoïde G1. À partir du graphe topologique du robot, l'algorithme augmente chaque espace d'observation et d'action avec les transformations de permutation et de signe induites par la symétrie corporelle, produisant un acteur de graphe symétrique-équivariant et un critique invariant. Quatre scénarios sont évalués : suivi de commande de vitesse, pannes asymétriques de joints, généralisation hors distribution, et déploiement zéro-shot du simulateur vers le robot physique. L'enjeu est structurel : les politiques de contrôle actuelles, MLP génériques ou réseaux de graphes (GNN), ignorent comment les grandeurs physiques se transforment symétriquement d'un membre à l'autre. Un quadrupède a quatre pattes quasi-identiques, un humanoïde a deux côtés symétriques, et cette information doit normalement être apprise empiriquement au prix de milliers d'échantillons supplémentaires. MS-PPO l'impose par construction plutôt que par reward shaping ou data augmentation, ce qui, selon les auteurs, améliore simultanément la généralisation aux symétries, la robustesse aux pannes de joints, l'efficacité d'échantillonnage et la compacité du modèle. Le résultat le plus fort reste le transfert sim-to-real zéro-shot : aucun fine-tuning sur le matériel physique, là où le reality gap demeure l'obstacle principal au déploiement industriel. À noter : l'abstract ne fournit pas de métriques chiffrées ; les gains quantifiés sont dans le corps du papier. L'exploitation des symétries en RL de locomotion est un axe de recherche actif depuis les travaux sur les réseaux équivariants et les architectures morpho-symétriques, notamment ceux d'Ordonez-Apraez et al. MS-PPO se positionne comme l'étape suivante : encoder non plus seulement la connectivité mais la physique des transformations dans le graphe. Les plateformes Go2 et G1 d'Unitree Robotics dominent les benchmarks académiques grâce à leur accessibilité commerciale et leur large base d'utilisateurs chercheurs. Aucun acteur européen n'est cité dans l'étude ; côté FR/EU, Wandercraft (Paris, humanoïdes médicaux) et PAL Robotics (Barcelone) développent leurs propres pipelines de contrôle. L'étape suivante attendue pour MS-PPO : validation sur des tâches locomotion-manipulation combinées et des déploiements longue durée hors laboratoire.

RecherchePaper
1 source
1000 Rallies : jeu de données par caméra événementielle et estimation en temps réel de l'état de la balle pour le tennis de table robotique
2093arXiv cs.RO 

1000 Rallies : jeu de données par caméra événementielle et estimation en temps réel de l'état de la balle pour le tennis de table robotique

Des chercheurs ont publié en juin 2026 (arXiv:2606.25620) le premier jeu de données à grande échelle pour la perception par caméra événementielle appliquée au ping-pong robotisé. Le dataset regroupe plus de 1 000 échanges (rallies) enregistrés auprès d'une population variée, des amateurs aux joueurs de niveau élite. Chaque séquence combine le flux événementiel avec 14 caméras haute vitesse synchronisées à 200 images par seconde, utilisées pour générer des labels pseudo-vérité à 1 kHz comprenant la position, la vitesse et l'effet de la balle. À partir de ce corpus, un réseau de neurones convolutif a été entraîné pour estimer conjointement position et vitesse de la balle dans le plan image, robuste aux mouvements de fond produits par le joueur. L'intégration de la vitesse prédite comme mesure additionnelle dans un filtre de Kalman réduit l'erreur de prédiction du point de rebond de 36 % par rapport à une baseline position seule. Le système a finalement été couplé à un bras robotisé Stäubli pour réaliser les premiers échanges humain-robot en temps réel pilotés intégralement par perception événementielle. Ce résultat est significatif pour le secteur de la robotique rapide car il valide, sur une tâche réelle et contrainte temporellement, l'avantage fondamental des caméras événementielles: une résolution temporelle de l'ordre de la microseconde, sans flou de mouvement, là où les caméras classiques imposent un arbitrage coûteux entre cadence et bande passante de traitement. La réduction de 36 % de l'erreur de prédiction du rebond, obtenue simplement en ajoutant la vitesse estimée au filtre de Kalman, illustre que la qualité de la mesure perceptive en amont détermine directement les performances de contrôle en boucle fermée, un argument concret pour les intégrateurs industriels qui travaillent sur des tâches de manipulation haute cadence ou de tri haute vitesse. Le ping-pong robotisé s'est imposé ces dernières années comme banc d'essai privilégié pour la perception et le contrôle à faible latence, notamment avec les travaux de Google DeepMind sur l'agent de tennis de table (2023-2024). Les caméras événementielles, dont le fabricant français Prophesee (Paris) est l'un des leaders mondiaux, restaient jusqu'ici sous-exploitées faute de datasets publics représentatifs. Stäubli Robotics, groupe franco-suisse basé à Faverges (Haute-Savoie), apporte ici une visibilité européenne au banc expérimental. Les auteurs ne précisent pas de roadmap de déploiement industriel, mais la combinaison dataset public + pipeline temps réel validé en boucle fermée constitue une base ouverte pour que d'autres équipes portent cette approche vers des applications comme le tri de pièces à haute cadence ou la manipulation de petits objets en mouvement.

RecherchePaper
1 source
PhyGile : génération de mouvements guidée par préfixe physique pour le suivi agile d'humanoïdes généralistes
2094arXiv cs.RO 

PhyGile : génération de mouvements guidée par préfixe physique pour le suivi agile d'humanoïdes généralistes

Une équipe de chercheurs a publié PhyGile (arXiv:2603.19305v2), un framework unifié visant à combler le fossé entre la génération de mouvements en texte naturel et l'exécution physiquement réaliste sur robots humanoïdes réels. Le problème central que ce travail adresse est connu dans le secteur sous le nom de "reality gap" : les modèles text-to-motion existants sont entraînés sur des captures de mouvement humain, ce qui leur confère des priors biomécaniques incompatibles avec les robots (distribution de masse, stratégies de contact, actuation). Résultat : les trajectoires générées paraissent géométriquement correctes (limites articulaires respectées, continuité de pose), mais violent la faisabilité physique dès qu'on tente de les exécuter. PhyGile génère directement des mouvements natifs-robot dans un espace squelettique à 262 dimensions, guidé par des "physics prefixes" calculés à l'inférence, éliminant ainsi l'étape de retargeting et ses artefacts. Le contrôleur General Motion Tracking (GMT) est d'abord entraîné avec un schéma curriculum à mixture-of-experts, puis affiné sur des données de mouvement non étiquetées pour améliorer la robustesse, avant une phase d'adaptation fine guidée par les préfixes physiques. Des expériences offline et sur robots réels valident l'approche sur des mouvements agiles et à haute dynamique dépassant la marche ou les locomotions lentes habituellement testées. Sur le plan de l'impact sectoriel, ce papier s'attaque à l'un des problèmes les plus résistants de la commande humanoïde : le sim-to-real pour des mouvements expressifs et agiles, pas seulement pour la marche stable. La démonstration sur robots réels (et pas uniquement en simulation) est notable, même si les vidéos sélectionnées restent une métrique partielle et difficile à généraliser sans benchmarks standardisés. Pour les intégrateurs et les équipes R&D, l'approche mixture-of-experts combinée à une adaptation post-entraînement sur données non étiquetées représente une voie pragmatique pour étendre la couverture de mouvement sans collecter massivement de nouvelles données étiquetées. Ce travail s'inscrit dans un contexte de compétition intense autour du contrôle locomoteur humanoïde. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Agility Robotics travaillent tous sur des pipelines VLA (Vision-Language-Action) ou text-to-motion à large échelle. PhyGile se distingue en ciblant explicitement les mouvements agiles entiers du corps, là où la plupart des travaux récents se concentrent sur la manipulation ou la locomotion basique. Le papier étant une révision arXiv (v2), il n'y a pas encore d'annonce de déploiement industriel ni de partenariat commercial associé.

HumanoïdesOpinion
1 source
Stratégies d'échantillonnage pour des politiques de locomotion quadrupède robustes et universelles
2095arXiv cs.RO 

Stratégies d'échantillonnage pour des politiques de locomotion quadrupède robustes et universelles

Des chercheurs ont publié sur arXiv (2510.07094) une étude comparant trois stratégies d'échantillonnage de paramètres pour entraîner une politique de locomotion universelle applicable à plusieurs robots quadrupèdes sans re-entraînement. L'enjeu : former un seul agent par apprentissage par renforcement capable de s'adapter à des configurations physiques variées, masses différentes, géométries de pattes, gains de contrôleur articulaire PD (proportionnel-dérivateur) distincts. Les trois approches comparées sont des mappings linéaires et polynomiaux reliant masse aux gains PD, un filtrage adaptatif basé sur les performances, et un échantillonnage aléatoire uniforme. L'entraînement s'est déroulé dans le simulateur RaiSim, avec validation sur une gamme de quadrupèdes virtuels, puis déploiement zéro-shot sur le robot physique ANYmal d'ANYbotics. Résultat central : l'échantillonnage uniforme des gains articulaires, combiné à des priors nominaux pour biaiser les configurations, offre la meilleure robustesse au passage simulation-réalité. La démonstration qu'une randomisation forte des gains PD est nécessaire, et non optionnelle, pour fermer le sim-to-real gap est un résultat directement actionnable. Calibrer précisément les gains dans le simulateur ne suffit pas ; il faut au contraire introduire volontairement de la variance pour couvrir les incertitudes du monde réel : usure, imprécisions mécaniques, variations de charge utile. Le déploiement zéro-shot validé sur ANYmal, sans fine-tuning hardware, réduit concrètement les cycles d'adaptation pour les intégrateurs qui déploient des quadrupèdes sur terrains variés. Pour un COO industriel, cela se traduit par moins de recalibrations coûteuses entre sites ou lors de changements de configuration. ANYmal est le quadrupède phare d'ANYbotics, spin-off de l'ETH Zurich déployé dans l'inspection industrielle sur centrales électriques et sites pétroliers. Ces travaux s'inscrivent dans la compétition entre approches de sim-to-real : domain randomization classique dont relève cet article, modèles du monde appris comme DreamerV3 ou TD-MPC2, et adaptation en ligne telle que RMA (Rapid Motor Adaptation, Berkeley). Les publications concurrentes en politique universelle quadrupède émanent principalement de DeepMind, CMU et Google DeepMind. La suite naturelle serait d'étendre l'approche à des morphologies plus diverses ou à la loco-manipulation, robots à bras embarqué pour l'inspection et la manipulation industrielle autonome, un segment en forte croissance.

RecherchePaper
1 source
ForceBand : apprentissage de la manipulation de force par sEMG
2096arXiv cs.RO 

ForceBand : apprentissage de la manipulation de force par sEMG

Une équipe de chercheurs a présenté ForceBand, un bracelet sEMG (électromyographie de surface) porté au poignet et conçu pour enrichir les démonstrations humaines destinées à l'apprentissage de politiques de manipulation robotique. Le système capture l'activité musculaire du poignet via des électrodes de surface et, combiné à une IMU, alimente un modèle pré-entraîné baptisé EMG2Force qui prédit les forces exercées par chaque doigt. Pour entraîner ce modèle, les chercheurs ont constitué un jeu de données multimodal de 10 heures combinant vidéo égocentrique, signaux sEMG, données inertielles et mesures de forces au bout des doigts, couvrant des actions et objets variés. Après une courte calibration propre à l'utilisateur, celui-ci peut collecter de nouvelles démonstrations avec seulement le bracelet et une caméra : EMG2Force étiquette automatiquement ces séquences avec les traces de force par doigt. Les expériences rapportent une réduction d'erreur de prédiction de force supérieure à 50 % par rapport aux baselines fondées uniquement sur la vision, et un taux de succès de 87 % sur des tâches de saisie, compression et dépose impliquant des objets de formes, tailles et poids variés. L'apport clé de ForceBand réside dans la résolution d'un angle mort structurel des pipelines d'imitation learning : les sources courantes de démonstrations humaines, capture de mouvement ou vidéos internet, fournissent trajectoire et apparence mais ignorent les forces de contact, pourtant déterminantes pour toute manipulation sensible au toucher. Serrer un emballage souple sans l'écraser, insérer un connecteur, manipuler des objets fragiles ou déformables sont des tâches où le contrôle en effort prime sur le contrôle en position. En rendant ces forces observables à faible coût matériel, le système ouvre la voie à des politiques VLA (vision-language-action) capables de généraliser sur des propriétés mécaniques d'objets non vus, sans capteurs de force onéreux montés sur le robot. Ce travail s'inscrit dans une dynamique active autour de l'augmentation des données de démonstration : plusieurs laboratoires explorent des gants haptiques, des capteurs tactiles intégrés aux mains robotiques ou des méthodes de reconstruction de force par vision stéréo. ForceBand se positionne comme une alternative légère et bon marché, accessible sans infrastructure de motion capture. L'article est pour l'instant un preprint arXiv (2606.26093), non encore soumis à une conférence majeure, et les résultats reposent sur un protocole contrôlé en laboratoire. La robustesse au bruit musculaire inter-sujets, à la fatigue et aux variations de placement du bracelet en conditions industrielles reste à démontrer. Les prochaines étapes naturelles impliqueront des tests sur des robots à mains dextrères (dexterous hands) et une validation sur des tâches d'assemblage réelles, là où la complémentarité avec des plateformes comme les mains Allegro ou Shadow est la plus directe.

RecherchePaper
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
2097arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source
Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé
2098arXiv cs.RO 

Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé

Des chercheurs ont publié sur arXiv (2606.25754) une politique de diffusion baptisée SRDP (Stage-Aware and Roughness-Constrained Diffusion Policy) conçue pour le polissage robotique multi-étapes en environnement industriel. Le système cible en priorité l'aérospatiale, secteur où la qualité de surface conditionne directement la tenue mécanique et la fiabilité des pièces. SRDP infère en continu la phase de polissage en cours (ébauche, semi-finition, finition) à partir d'un historique d'observations multimodales, sans nécessiter d'étiquettes de phase fournies manuellement lors de l'exécution. Le générateur d'actions contraint ensuite la vitesse d'avance et la force de contact normale selon les vitesses de broche préréglées par étape, via un échantillonnage de diffusion orienté rugosité. Les expériences ont été menées sur deux scénarios représentatifs : polissage d'un revêtement de cabine de vaisseau spatial et finition de surfaces structurelles en cavité interne, avec validation sur robot réel. L'enjeu industriel est direct : le polissage reste l'une des tâches les plus difficiles à automatiser par apprentissage par imitation, en raison des dépendances temporelles longues, des transitions de phase incertaines et du couplage fort entre paramètres process (force, vitesse, rugosité cible). Les approches existantes échouent précisément parce qu'elles ignorent la nature séquentielle des étapes ou ne peuvent pas réguler les paramètres physiques de manière cohérente. SRDP rompt avec cette limite en conditionnant le processus de débruitage inverse sur la phase inférée, ce qui produit des actions cohérentes avec l'étape courante sans supervision externe. Les résultats montrent une meilleure stabilité lors des transitions de phase, une plus grande consistance des paramètres process et une qualité de surface finale améliorée par rapport aux baselines comparées. Ce travail s'inscrit dans une vague de politiques de diffusion pour la manipulation industrielle fine, portée depuis 2023 par les travaux de Chi et al. sur Diffusion Policy et accélérée par des architectures comme pi0 (Physical Intelligence) ou les politiques de contact de Lerobot. Le polissage était jusqu'ici dominé par des approches de contrôle en force classique ou d'asservissement d'impédance, moins flexibles face à la variété géométrique des pièces. Aucun partenaire industriel ni calendrier de transfert n'est mentionné dans la publication ; il s'agit donc d'un résultat de recherche académique, pas d'un produit commercialisé.

RecherchePaper
1 source
Détection de défauts spatiaux à faibles données par réseaux neuronaux optoélectroniques hybrides en inspection robotique
2099arXiv cs.RO 

Détection de défauts spatiaux à faibles données par réseaux neuronaux optoélectroniques hybrides en inspection robotique

Des chercheurs ont publié sur arXiv (référence 2606.25277) une architecture optoélectronique intégrée matériel-logiciel destinée à la détection de défauts surfaciques en inspection robotique industrielle. Le système repose sur un dispositif à micromiroirs numériques (DMD) reconfiguré en couche convolutionnelle optique physique : au lieu de capturer une image complète puis de la traiter numériquement, le capteur lui-même effectue l'extraction de caractéristiques dans le domaine photonique. Une stratégie de compressed sensing par blocs encode ensuite l'information spatiale en signaux temporels de faible dimension, éliminant la redondance à la source. Pour s'affranchir de l'annotation manuelle fastidieuse des formes de défauts, le réseau est guidé par des descriptions en langage naturel qui alignent ses cartes d'attention sur les représentations généralisables de CLIP (Contrastive Language-Image Pre-training). Une métrique dédiée, la LAA (Localization Accuracy for Attention), quantifie la précision de localisation au niveau de la forme. Les expériences portent sur la détection de défauts dans des matériaux transparents. Les résultats sont substantiels : comparé à une acquisition d'image traditionnelle, l'architecture proposée maintient une précision équivalente tout en réduisant le volume de données de 90 % pour les Vision Transformers et la charge de calcul de 60 % pour les réseaux convolutionnels classiques. Pour les intégrateurs industriels, cela signifie des pipelines d'inspection viables sur hardware embarqué contraint, sans sacrifier la précision de détection. L'utilisation de CLIP comme superviseur sémantique réduit également le coût d'étiquetage, point de friction majeur dans le déploiement de systèmes de contrôle qualité automatisés à l'échelle. La combinaison sensing-computing dans le même composant physique ouvre par ailleurs une voie vers des cadences d'inspection plus élevées sans bande passante supplémentaire. Ce travail s'inscrit dans une tendance plus large de recherche en edge AI pour l'inspection industrielle, où la contrainte n'est plus uniquement algorithmique mais aussi énergétique et matérielle. Les approches concurrentes incluent les systèmes purement logiciels basés sur des CNNs quantifiés ou des modèles légers type MobileNet, ainsi que des solutions de compressed sensing purement numériques. L'originalité ici est le déport du calcul dans le domaine optique via le DMD, une piste explorée aussi dans des contextes de calcul neuromorphique. L'article reste à ce stade une validation expérimentale sur matériaux transparents ; la généralisation à d'autres substrats industriels (métal, composite, textile) et l'intégration dans une chaîne robotique réelle constituent les prochaines étapes non encore annoncées.

RecherchePaper
1 source
RoboRouter : sélection de politiques sans entraînement pour la manipulation robotique
2100arXiv cs.RO 

RoboRouter : sélection de politiques sans entraînement pour la manipulation robotique

Des chercheurs ont publié RoboRouter (arXiv:2603.07892, version 4), un système de routage intelligent entre politiques robotiques hétérogènes pour les tâches de manipulation. Plutôt que d'entraîner une nouvelle politique monolithique, RoboRouter maintient un pool de politiques existantes -- modèles vision-langage-action (VLA), politiques vision-action (VA) et approches compositionnelles par code -- et sélectionne automatiquement la meilleure pour chaque nouvelle tâche. Le mécanisme repose sur une représentation sémantique de la tâche, une recherche dans l'historique d'exécutions similaires, puis une prédiction directe sans trial-and-error. Le retour structuré après chaque exécution affine les décisions suivantes. En simulation et en conditions réelles, RoboRouter améliore le taux de succès moyen de plus de 3 points en simulation et de 13 points en environnement réel par rapport aux politiques individuelles, sans dégradation de la vitesse d'exécution. Intégrer une nouvelle politique dans le système ne requiert qu'une évaluation légère, sans coût de réentraînement. Ce résultat a une portée concrète pour les intégrateurs. Le problème central de la manipulation robotique est que chaque paradigme excelle sur sa distribution d'entraînement mais généralise mal hors distribution. RoboRouter contourne ce mur non pas en cherchant un meilleur modèle universel, mais en exploitant les forces complémentaires de politiques spécialisées existantes. Le gain de 13 % en réel est notable car le sim-to-real gap ronge habituellement les gains obtenus en simulation. L'absence de réentraînement signifie que le système peut absorber de nouveaux modèles au fil du temps -- une propriété utile à mesure que les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) sortent des cycles de recherche pour entrer en déploiement. Ce travail prend place dans un contexte de prolifération rapide des paradigmes de contrôle robotique. Les équipes de Figure (Figure 03), Tesla (Optimus Gen 3) ou 1X parient sur l'unification via un seul grand modèle entraîné à grande échelle. RoboRouter incarne une thèse adverse: l'hétérogénéité contrôlée, avec un orchestrateur léger, peut surpasser la politique unique sans le coût computationnel associé. Les auteurs ne précisent pas de déploiement industriel annoncé ni de partenariats, ce qui place cette contribution dans le registre recherche applicable plutôt que produit shipé. Les prochaines étapes naturelles seraient l'évaluation sur des benchmarks standardisés plus larges (LIBERO, RoboSuite) et l'intégration de politiques récentes à mesure qu'elles sont rendues publiques.

IA physiqueOpinion
1 source