Aller au contenu principal

Actualités robotique — page 108

5 878 articles au fil, du plus récent au plus ancien.

AsyncVLA : correspondance de flux asynchrone pour les modèles vision-langage-action (VLA)
5351arXiv cs.RO 

AsyncVLA : correspondance de flux asynchrone pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié AsyncVLA (arXiv:2511.14148), un cadre pour modèles Vision-Language-Action (VLA) qui remplace le flow matching synchrone (SFM) conventionnel par un mécanisme asynchrone (AFM) à calendrier temporel non uniforme. Là où le SFM applique un pas de temps identique à tous les tokens d'action, AsyncVLA ajuste ce calendrier en fonction du contexte actionnel en cours, et intègre un module "confidence rater" qui évalue la fiabilité de chaque token généré pour déclencher une auto-correction sélective avant exécution. La procédure d'entraînement est unifiée: un seul modèle peut opérer en mode SFM ou AFM, avec une meilleure utilisation du cache KV. Sur les benchmarks de manipulation robotique en simulation et en conditions réelles, AsyncVLA surpasse les méthodes existantes avec une efficacité accrue en données d'entraînement. Le code est publié en open source sur GitHub. L'instabilité des VLA sur les tâches longue durée (long-horizon) est l'un des principaux freins à leur déploiement industriel: en SFM, une erreur d'action se propage en cascade jusqu'à l'échec complet de la séquence. La capacité d'auto-correction d'AsyncVLA adresse directement ce point, ce qui intéresse les intégrateurs et les équipes robotiques confrontées à des cycles opératoires de plusieurs minutes. L'efficacité en données est un argument complémentaire: entraîner des VLA compétitifs nécessite aujourd'hui des datasets massifs et coûteux, et une méthode qui atteint de meilleures performances avec moins de données réduit la barrière d'entrée. Il faut toutefois nuancer: le papier se limite à des benchmarks de manipulation sans publier de chiffres de déploiement à l'échelle, de temps de cycle réels, ni de résultats sur une flotte opérationnelle. Les VLA à base de flow matching ont été popularisés par Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA en 2024, établissant un standard de génération d'actions continues pour la robotique généraliste. AsyncVLA s'inscrit dans une tendance de raffinement algorithmique de ces architectures, aux côtés d'approches comme OpenVLA, la distillation de politique diffusion, ou les modèles hybrides VLA et planificateur symbolique. Son avantage comparatif est la compatibilité directe avec les pipelines SFM existants, sans rupture architecturale majeure, ce qui facilite l'adoption par les équipes déjà engagées sur ces bases. Les prochaines étapes crédibles seraient une validation sur des robots humanoïdes (Figure, 1X, Unitree) ou des bras industriels en production réelle, là où la robustesse long-horizon reste le goulot d'étranglement dominant.

IA physiqueOpinion
1 source
Filtrage de l'information par régularisation variationnelle pour la manipulation robotique
5352arXiv cs.RO 

Filtrage de l'information par régularisation variationnelle pour la manipulation robotique

Des chercheurs ont publié sur arXiv (référence 2601.21926v3) une étude portant sur un défaut structurel des politiques visuomotrices par diffusion appliquées à la manipulation robotique. Ces architectures, fondées sur des représentations visuelles 3D et un décodeur de débruitage, sont aujourd'hui parmi les plus performantes pour apprendre des comportements complexes à un bras robotique. L'équipe identifie un problème précis : dans les architectures U-Net et DiT (Diffusion Transformer), les blocs intermédiaires du décodeur contiennent des features parasites, sans rapport avec la tâche à exécuter. La preuve expérimentale est frappante, masquer aléatoirement les features du backbone U-Net ou sauter des couches intermédiaires du DiT pendant l'inférence, sans aucune modification de l'entraînement, améliore les performances. Pour corriger cela, les auteurs proposent un module baptisé Variational Regularization (VR) : un composant plug-and-play qui impose une distribution gaussienne conditionnée au contexte sur les features bruitées, et applique un régulariseur KL-divergence formant un goulot d'information adaptatif. Les évaluations couvrent trois benchmarks de simulation, RoboTwin2.0, Adroit et MetaWorld, et des tests en conditions réelles. Ce travail remet en cause une hypothèse tacite du domaine : augmenter la capacité du modèle de débruitage améliore mécaniquement les résultats. Les auteurs montrent que c'est faux, et que la redondance dans les features intermédiaires est une source active de dégradation. L'approche VR, combinée aux architectures DP3-UNet et DP3-DiT, établit de nouveaux résultats état de l'art sur l'ensemble des benchmarks testés. Pour les intégrateurs et équipes R&D travaillant sur des politiques d'imitation ou de reinforcement learning pour la manipulation, l'intérêt est double : le module est réutilisable sans réentraînement complet, et le diagnostic (tester le masquage aléatoire à l'inférence) est immédiatement applicable pour auditer ses propres architectures. Ce type de recherche s'inscrit dans la lignée des travaux sur les diffusion policies initiés par Chi et al. (2023) et leur extension 3D (DP3), qui ont rapidement supplanté les approches behavior cloning classiques sur les tâches de manipulation fine. Sur ce terrain, les concurrents directs incluent les politiques basées sur les transformers de vision-action comme ACT (Action Chunking with Transformers) ou les approches Flow Matching comme Pi-0 de Physical Intelligence. La contribution ici n'est pas une nouvelle architecture de bout en bout, mais un correctif ciblé sur un problème de capacité mal calibrée, un angle plus susceptible d'être intégré rapidement dans des pipelines existants que de remplacer l'ensemble de la stack.

IA physiqueOpinion
1 source
CKT-WAM : transfert de connaissances contextuelles efficient entre modèles d'action du monde
5353arXiv cs.RO 

CKT-WAM : transfert de connaissances contextuelles efficient entre modèles d'action du monde

Des chercheurs ont déposé le 8 mai 2026 sur arXiv (2605.06247) CKT-WAM, un cadre de transfert de connaissances paramètre-efficient entre modèles d'action du monde (WAMs, World Action Models). L'approche résout un verrou persistant : faire bénéficier un WAM étudiant des représentations apprises par un WAM enseignant plus capable, sans réentraîner l'ensemble du réseau. Techniquement, CKT-WAM extrait des états cachés intermédiaires de l'enseignant, les compresse via une attention croisée à requêtes apprenables (LQCA), les transforme à travers un adaptateur généralisé toujours actif et des adaptateurs spécialisés à activation parcimonieuse, puis injecte ce contexte compact dans les embeddings textuels de conditionnement de l'étudiant. Sur le benchmark LIBERO-Plus, le système atteint 86,1 % de taux de réussite global en n'entraînant que 1,17 % des paramètres du modèle étudiant, approchant les performances du fine-tuning complet. En conditions réelles, quatre tâches de manipulation longue portée ont été évaluées avec 83,3 % de réussite moyenne, résultat présenté comme meilleur de la catégorie par les auteurs. Le code est disponible sur GitHub (YuhuaJiang2002/CKT-WAM). L'enjeu industriel est direct : affiner un WAM ou un VLA (Vision-Language-Action model) de taille fondationnelle exige des ressources GPU considérables ; descendre à 1,17 % de paramètres entraînables tout en conservant des performances comparables ouvre une voie concrète pour les équipes R&D à ressources limitées. La démonstration d'une généralisation zero-shot suggère que le contexte transféré encode des capacités motrices transposables au-delà des tâches d'entraînement, ce qui valide partiellement l'hypothèse d'une composabilité des modèles robotiques génératifs. Deux réserves s'imposent toutefois : les quatre scénarios réels évalués restent trop peu nombreux pour conclure à une robustesse hors laboratoire, et les conditions d'évaluation (définition du succès, variabilité environnementale, sélection des vidéos) ne sont pas détaillées dans le preprint, ce qui limite la portée des chiffres annoncés. CKT-WAM s'inscrit dans la vague actuelle des modèles robotiques fondationnels interopérables, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI). L'idée de capitaliser sur des modèles enseignants hétérogènes plutôt que de réentraîner from scratch rejoint les travaux de distillation de connaissances explorés en académique comme en industrie, dans un contexte où la course aux WAMs s'accélère significativement depuis 2025. En Europe, Enchanted Tools et Wandercraft développent des architectures de contrôle avancées, bien que moins orientées WAMs dans leurs publications récentes. La suite logique serait une validation sur des benchmarks plus larges comme DROID ou Open-X Embodiment, et des expérimentations terrain pour confirmer la robustesse réelle du transfert en dehors des environnements contrôlés.

IA physiqueOpinion
1 source
Parkour humanoïde perceptif : enchaînement de compétences dynamiques par correspondance de mouvement
5354arXiv cs.RO 

Parkour humanoïde perceptif : enchaînement de compétences dynamiques par correspondance de mouvement

Des chercheurs ont publié sur arXiv (arxiv:2502.15827, version révisée en mai 2026) une architecture modulaire baptisée Perceptive Humanoid Parkour (PHP), qui permet à un robot humanoïde d'enchaîner des séquences de parkour autonomes sur des parcours d'obstacles variés. Le système a été validé sur un robot Unitree G1 en conditions réelles : il peut franchir des obstacles atteignant 1,25 mètre de hauteur, soit 96 % de la taille du robot, et choisit dynamiquement entre quatre primitives de mouvement (enjamber, grimper, sauter par-dessus, rouler en descente) selon la géométrie détectée. La seule entrée sensorielle utilisée est une caméra de profondeur embarquée couplée à une commande de vitesse discrète en 2D, sans GPS ni cartographie externe. Ce qui distingue PHP des approches précédentes est la combinaison de deux techniques jusqu'ici rarement couplées à cette échelle : le motion matching, qui assemble des primitives gestuelles humaines retargetées via une recherche par plus proche voisin dans un espace de features, et la distillation de politiques RL multi-compétences via DAgger. Le résultat concret est un robot capable de décision contextuelle en boucle fermée sur des obstacles dont la position change en temps réel, sans recalcul de trajectoire globale. Pour les intégrateurs industriels et les décideurs robotique, cela valide empiriquement que la composition de skills à horizon long dans un environnement non contrôlé n'est plus seulement une démonstration en laboratoire, mais un comportement reproductible sur matériel standard. Le Unitree G1 est un humanoïde de série à environ 16 000 dollars, ce qui donne à ces résultats une portée plus large que des travaux réalisés sur des plateformes propriétaires. La recherche sur la locomotion humanoïde agile s'est intensifiée depuis les travaux pionniers de Boston Dynamics sur Atlas et les démonstrations de parkour d'Agility Robotics ; côté apprentissage automatique, des équipes comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2) travaillent sur des politiques généralisées, mais avec un focus manipulation plus que locomotion acrobatique. PHP s'inscrit dans une tendance académique distincte, orientée expressivité du mouvement humain plutôt que productivité industrielle. La prochaine étape naturelle sera de tester la robustesse sur des obstacles non vus à l'entraînement et de mesurer les taux d'échec sur des runs prolongés, deux métriques absentes du papier actuel.

HumanoïdesPaper
1 source
AssistDLO : téléopération assistée pour la manipulation d'objets linéaires déformables
5355arXiv cs.RO 

AssistDLO : téléopération assistée pour la manipulation d'objets linéaires déformables

Des chercheurs ont publié AssistDLO, un cadre de téléopération assistée conçu pour la manipulation d'objets linéaires déformables (DLOs, Deformable Linear Objects), tels que câbles, cordes ou fils industriels. Le système combine trois composants : une estimation d'état en temps réel par vision multi-vue, une assistance visuelle (VA) projetée dans l'interface opérateur, et un contrôleur de partage d'autonomie géométriquement conscient, baptisé SA-CBF, fondé sur les fonctions de barrière de contrôle (Control Barrier Functions). Le tout a été validé dans une étude utilisateur bimanuelle de dénouage de nœuds (N=22), sur des cordes de longueurs et rigidités variables. Le résultat clé : pour les opérateurs novices, SA-CBF fait passer le taux de succès de 71 % à 88 %, tandis que les opérateurs experts préfèrent la VA seule. Ce travail s'attaque à un verrou persistant de la robotique industrielle : les DLOs sont pratiquement impossibles à modéliser en temps réel en raison de leur espace de configuration de dimension infinie et de leurs dynamiques non linéaires. En téléopération, l'incertitude de profondeur aggrave encore la perception d'état. L'apport de SA-CBF est de fonctionner comme un entonnoir géométrique, guidant la saisie précise sans court-circuiter l'autorité de haut niveau de l'opérateur, contrairement aux méthodes classiques d'autonomie partagée qui utilisent de simples attracteurs géométriques. Pour des applications concrètes, câblage automobile, assemblage électronique ou chirurgie assistée, la démonstration d'un gain mesurable en conditions utilisateur réelles est plus significative qu'un résultat de simulation. Le problème de manipulation des DLOs mobilise la communauté robotique depuis plus d'une décennie, avec des approches allant du contrôle par retour visuel pur aux modèles physiques réduits. AssistDLO se distingue en intégrant explicitement le profil de l'opérateur dans la stratégie d'assistance, une piste dite "user-aware shared autonomy" encore peu exploitée à ce niveau de rigueur expérimentale. Les prochaines étapes probables incluent l'extension à des câbles multiconducteurs et l'intégration sur des plateformes industrielles existantes, potentiellement en lien avec des travaux européens sur la cobotique flexible. La conclusion des auteurs est claire : aucune stratégie fixe ne peut couvrir l'ensemble du spectre opérateur-matériau, et l'autonomie adaptative n'est plus une option mais une nécessité.

RecherchePaper
1 source
OA-WAM : un modèle du monde à adressage par objet pour la manipulation robotique robuste
5356arXiv cs.RO 

OA-WAM : un modèle du monde à adressage par objet pour la manipulation robotique robuste

OA-WAM (Object-Addressable World Action Model), soumis sur arXiv en mai 2025 (arXiv:2605.06481), propose une politique vision-langage-action (VLA) qui décompose chaque frame en N+1 "slots" d'état : un slot robot et N slots objets. Chaque slot combine un vecteur d'adresse persistant (identifiant stable de l'objet) et un vecteur de contenu variable décrivant son état courant. Ces représentations sont fusionnées avec des tokens textuels, visuels, proprioceptifs et d'actions dans une séquence causale par blocs, alimentant une tête "monde" (prédiction du frame suivant) et une tête d'action par flow-matching (chunk de 16 actions continues). Le modèle atteint 97,8 % de succès sur le benchmark LIBERO et 79,3 % sur SimplerEnv. Un test de "causal slot-intervention" mesure un cosinus de binding de 0,87 contre un maximum de 0,09 pour les baselines holistes, un écart difficile à ignorer. Le problème central est le "scene entanglement" : quand une politique représente l'évolution du monde comme une image globale ou des tokens vidéo, le décodeur d'action peine à cibler un objet précis dès que la scène varie (distracteurs, occlusions, changements d'éclairage). En séparant explicitement "quel objet" (l'adresse) de "comment il est" (le contenu), et en routant l'attention cross-slot via des clés d'adresse uniquement, l'architecture maintient l'identité des objets sous perturbations contextuelles sans surcoût en tokens. Pour un intégrateur B2B ou un COO industriel, c'est un argument concret vers des politiques robotiques stables face aux variations de ligne de production, sans retraining systématique à chaque changement de contexte. Les WAMs (World Action Models) sont une extension récente des VLA classiques (π0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind) qui ajoutent une prédiction de scène en boucle fermée pour contraindre les décisions d'action. OA-WAM s'inscrit dans la lignée des modèles à slots (SAVi, IODINE) transposés au contrôle robot. Il s'agit d'un preprint académique : toutes les évaluations sont conduites en simulation (LIBERO, SimplerEnv), sans validation sur robot physique mentionnée. Aucun déploiement ni partenariat industriel n'est annoncé à ce stade. La prochaine étape logique sera la validation sim-to-real sur manipulateurs réels et l'extension à des tâches de manipulation longue durée.

IA physiqueOpinion
1 source
Évolution continue des compétences dans un modèle vision-langage-action (VLA)
5357arXiv cs.RO 

Évolution continue des compétences dans un modèle vision-langage-action (VLA)

Des chercheurs ont publié Stellar VLA (arXiv:2511.18085v3), un cadre d'apprentissage continu par imitation (continual imitation learning, CIL) pour les modèles Vision-Langage-Action (VLA). La méthode propose deux variantes progressives : T-Stellar, fondée sur une modélisation plate centrée sur les tâches, et TS-Stellar, organisée en structure hiérarchique tâche-compétence. Les expériences menées sur le benchmark LIBERO, référence standard pour les tâches de manipulation robotique, montrent que les deux variantes surpassent les baselines VLA et CIL actuelles, avec seulement 1 % de rejeu de données. Une validation en conditions réelles sur une plateforme bi-bras, avec des configurations de scènes et d'embodiments distincts, confirme que le transfert de connaissances entre tâches reste effectif au-delà du simulateur. Le principal apport de Stellar VLA est d'adresser un frein structurel au déploiement des grands modèles VLA : les méthodes CIL existantes nécessitent des paramètres additionnels ou des modules externes, ce qui les rend difficilement scalables lorsque le modèle de base est déjà massif. En optimisant conjointement des représentations de tâches et un espace de connaissances partagé, Stellar VLA introduit un mécanisme de routage expert guidé par la sémantique, sélectionnant les K embeddings les plus proches pour orienter le modèle vers la compétence pertinente, sans alourdir l'architecture. Pour les équipes qui déploient des robots polyvalents en production, cela ouvre la voie à l'apprentissage incrémental de nouvelles tâches avec un coût de fine-tuning réduit. TS-Stellar se distingue notamment sur les manipulations hiérarchiques complexes, et les visualisations publiées illustrent une rétention robuste des compétences acquises ainsi qu'une capacité de découverte automatique de nouvelles tâches. Les VLA constituent un axe de recherche en accélération depuis 2023, portés par Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA (UC Berkeley) ou encore RT-2 (Google DeepMind), qui cherchent à généraliser la manipulation robotique via un préentraînement multimodal massif. La question du catastrophic forgetting, c'est-à-dire la perte des compétences antérieures lors de l'apprentissage d'une nouvelle tâche, reste un verrou non résolu à l'échelle industrielle. Stellar VLA se positionne comme une surcouche légère applicable à des VLA existants, sans retraining complet. Le projet est documenté sur stellarvla.github.io ; aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication, qui reste à ce stade un travail de recherche académique.

RechercheOpinion
1 source
Planification robotique sous contraintes de ressources face à une incertitude mixte
5358arXiv cs.RO 

Planification robotique sous contraintes de ressources face à une incertitude mixte

Des chercheurs présentent le CMDPST (Consumption Markov Decision Process with Set-valued Transitions), un cadre formel inédit permettant à un robot de planifier ses actions en tenant compte simultanément de deux types d'incertitudes : le bruit probabiliste mesurable et les inconnues structurellement non-quantifiables, tout en garantissant que le système ne tombe jamais à court de ressources opérationnelles (batterie, capacité de charge, quota de déplacements). Publiée sur arXiv en mai 2026 (réf. 2605.05797), la contribution couple ce modèle à une spécification de tâche exprimée en LTLf (logique temporelle linéaire sur traces finies), un formalisme permettant d'encoder des objectifs complexes avec des contraintes temporelles précises. Les auteurs proposent deux algorithmes de synthèse de stratégie : une méthode directe par déroulage d'états et une version optimisée par élagage de l'espace d'états, plus efficace en temps de calcul. Les expériences sont conduites sur un réseau de transport en entrepôt simulé, sans validation sur hardware réel à ce stade. La contribution adresse un angle mort récurrent dans la planification robotique industrielle : la plupart des approches existantes traitent soit l'incertitude probabiliste via les MDP classiques, soit les contraintes de ressources, rarement les deux ensemble. Dans les déploiements AMR (autonomous mobile robots) d'entrepôt, où une flotte doit honorer des missions tout en gérant niveaux de batterie et pannes imprévisibles, cette dualité est pourtant critique. Le cadre CMDPST offre aux intégrateurs une garantie formelle : la stratégie synthétisée ne laissera jamais un robot en panne sèche, même face à des perturbations non modélisées. C'est un argument solide pour des environnements industriels où l'interruption de service a un coût direct et mesurable. Ce type de planification sous contraintes mixtes s'inscrit dans un corpus plus large incluant la vérification probabiliste de modèles (outils PRISM, Storm) et la planification formelle par MDP. Les acteurs de la logistique automatisée comme Exotec (France) ou Hai Robotics, dont les flottes AMR évoluent dans des environnements partiellement inconnus, sont directement concernés par ces avancées théoriques. Côté alternatives académiques, le reinforcement learning robuste et le model predictive control probabiliste existent, mais sans les garanties formelles d'épuisement de ressources que revendique cette approche. La prochaine étape attendue est une implémentation sur robot physique pour évaluer concrètement le gap sim-to-real.

RecherchePaper
1 source
Exploiter les gradients analytiques dans l'apprentissage par renforcement à sécurité garantie
5359arXiv cs.RO 

Exploiter les gradients analytiques dans l'apprentissage par renforcement à sécurité garantie

Une équipe de recherche présente dans un article soumis sur arXiv (identifiant 2506.01665) le premier mécanisme de protection efficace pour l'apprentissage par renforcement à gradients analytiques (AGB-RL, analytic gradient-based reinforcement learning). L'approche consiste à analyser les protections différentiables existantes, à les adapter via des reformulations de mappings et de gradients, puis à les intégrer dans un algorithme d'apprentissage de pointe couplé à une simulation différentiable. La méthode a été validée sur trois tâches de contrôle robotique, avec pour résultat un entraînement sous contraintes de sécurité sans dégradation mesurable des performances. Le verrou levé ici est non trivial : jusqu'à présent, les garanties de sécurité prouvables en RL ("provably safe RL") n'étaient disponibles que pour les méthodes d'apprentissage par échantillonnage (PPO, SAC, TD3 et consorts). Or l'AGB-RL, qui exploite les gradients analytiques fournis par les simulateurs différentiables, converge plus vite et avec moins d'interactions environnement, un avantage décisif pour les applications industrielles où les données réelles sont coûteuses. L'absence de protections compatibles avec ce paradigme forçait les équipes à choisir entre performance d'apprentissage et garanties formelles. Ce travail supprime ce compromis, et en intégrant les protections dès la phase d'entraînement simulé, il réduit structurellement le sim-to-real gap, une problématique centrale pour déployer des robots en environnements critiques (soins, industrie lourde, coopération humain-robot). Sur le plan du contexte, le domaine du "safe RL" s'appuie depuis plusieurs années sur deux grandes familles d'outils : les Control Barrier Functions (CBFs) et les mécanismes de shielding, tous deux conçus initialement pour les politiques stochastiques. Parallèlement, les simulateurs différentiables, Isaac Lab de NVIDIA, Brax de Google DeepMind, ou encore MuJoCo MJX, ont rendu l'AGB-RL accessible à grande échelle, creusant un écart méthodologique que ce papier comble. Les auteurs mettent les visuels à disposition sur timwalter.github.io/safe-agb-rl.github.io ; les prochaines étapes naturelles porteront sur la validation en conditions réelles et l'extension à des systèmes à haute dimensionnalité, là où les garanties formelles ont le plus de valeur opérationnelle.

RecherchePaper
1 source
DexSim2Real : transfert simulation-réel guidé par un modèle fondation pour la manipulation dextérique généralisable
5360arXiv cs.RO 

DexSim2Real : transfert simulation-réel guidé par un modèle fondation pour la manipulation dextérique généralisable

DexSim2Real est un framework de recherche publié en preprint arXiv (arXiv:2605.05241, mai 2026) visant à réduire le "sim-to-real gap" pour la manipulation dextre -- l'écart de performance entre politiques entraînées en simulation et leur déploiement sur robots réels. L'architecture combine trois modules : FM-DR, qui utilise un modèle de vision-langage comme critique de réalisme visuel pour optimiser automatiquement les paramètres de simulation via l'algorithme CMA-ES ; TVCAP, une politique de contrôle fusionnant données tactiles et visuelles par mécanisme cross-attention pour un transfert zero-shot ; et PSC, un curriculum progressif basé sur la décomposition de tâches par LLM, conçu pour les tâches à fort contact. Évalué en aveugle sur six tâches de manipulation difficiles, le système affiche un taux de succès moyen en conditions réelles de 78,2%, avec un écart sim-to-real résiduel de 8,3% -- contre des performances inférieures revendiquées pour DrEureka et DeXtreme. Le sim-to-real gap est historiquement l'un des freins majeurs à la commercialisation de robots manipulateurs dextres. L'approche différenciante de DexSim2Real consiste à fermer la boucle d'optimisation des paramètres de simulation via un retour visuel direct d'un modèle fondation, là où les méthodes existantes comme DrEureka reposent sur des descriptions textuelles ou une randomisation conçue manuellement. Utiliser un VLM comme juge de réalisme pour guider la randomisation est une piste prometteuse -- mais les résultats restent des benchmarks de laboratoire non encore soumis à revue par les pairs ni validés en déploiement industriel. Les métriques annoncées (78,2% de succès, 8,3% de gap résiduel) devront être reproduites par des équipes indépendantes pour confirmer leur portée réelle. La manipulation dextre sim-to-real est un champ très concurrentiel depuis la démonstration Dactyl d'OpenAI en 2019, avec des acteurs majeurs comme NVIDIA (DrEureka, Isaac Lab) et Meta AI (DeXtreme) en première ligne. DexSim2Real se positionne en unifiant trois leviers -- randomisation guidée par fondation, fusion tactile-visuelle, curriculum adaptatif -- que les travaux antérieurs traitaient séparément. Aucun acteur européen n'est impliqué dans ce travail. Le code n'est pas encore public au moment du preprint ; les prochaines étapes naturelles seraient une soumission à CoRL, IROS ou RSS et, si les résultats se confirment, une ouverture du code pour permettre la reproductibilité.

RecherchePaper
1 source
GA3T : jeu de données de traversabilité pour équipes de robots sol-aériens hétérogènes en milieux non structurés
5361arXiv cs.RO 

GA3T : jeu de données de traversabilité pour équipes de robots sol-aériens hétérogènes en milieux non structurés

Une équipe de chercheurs a publié GA3T (Ground-Aerial Team for Terrain Traversal), un jeu de données de perception collaborative multi-robots ciblant les environnements non structurés, déposé sur arXiv en mai 2026. La collecte a mobilisé deux plateformes complémentaires : un robot terrestre Clearpath Husky (UGV) équipé de LiDAR 3D, caméra stéréo, IMU et GPS, et un drone Autel EVO II fournissant images RGB, observations thermiques/infrarouges et GPS depuis un point de vue aérien surplombant. Quatre environnements distincts ont été couverts -- sentiers forestiers, chemins rocheux, terrains boueux, congères et prairies -- pour un total de plus de 13 000 frames synchronisées sur environ 29 minutes d'opération. Le jeu de données intègre une segmentation zero-shot basée sur SAM 3 (Segment Anything Model v3, Meta) et plus de 8 000 images labellisées manuellement. Sa particularité tient à la période de collecte, en début de printemps : la canopée encore peu dense permet au drone d'observer partiellement le robot terrestre à travers les arbres, enrichissant la perception collaborative d'une dimension explicite de gestion des occlusions. GA3T comble un vide documenté dans la recherche sur la perception multi-robots en conditions réelles hors route. La quasi-totalité des datasets multi-robots existants se concentre sur le SLAM en environnements structurés ou sur la conduite coopérative simulée, sans fournir de capteurs multi-modaux chevauchants entre plateformes sol et air. La combinaison LiDAR terrestre et infrarouge aérien ouvre des pistes directes pour l'estimation de traversabilité -- problème central pour les déploiements autonomes en agriculture de précision, foresterie ou gestion de crise -- où les modèles doivent distinguer sol franchissable, boue instable et végétation dense sans balisage préalable. C'est précisément ce gap sim-to-real sur terrain non balisé que ce type de dataset vise à réduire, en fournissant des données brutes issues de conditions météo et de sol réelles. Clearpath Robotics, filiale de Rockwell Automation depuis 2023 et fournisseur de référence pour les UGV de recherche universitaire, est associé ici à l'Autel EVO II, drone commercial grand public repositionné en plateforme de collecte scientifique. Aucun acteur européen n'est impliqué dans cette publication. Sur le plan concurrentiel, GA3T se positionne face à des datasets établis comme RUGD, RELLIS ou le corpus DARPA SubT, mais avec l'angle inédit de la fusion cross-view air-sol sur terrain naturel non aménagé. Les auteurs ciblent explicitement comme applications prioritaires la fusion de points de vue hétérogènes, l'estimation de traversabilité et la compréhension de scènes collaboratives -- tâches directement pertinentes pour l'entraînement de modèles VLA (Vision-Language-Action) appliqués à la navigation hors route, un axe de recherche en forte accélération depuis 2024 dans plusieurs laboratoires américains et asiatiques.

RecherchePaper
1 source
EA-WM : un modèle du monde génératif intégrant des champs d'action cinématique-visuel structurés
5362arXiv cs.RO 

EA-WM : un modèle du monde génératif intégrant des champs d'action cinématique-visuel structurés

Des chercheurs ont déposé le 8 mai 2026 sur arXiv (2605.06192) un préprint présentant EA-WM (Event-Aware Generative World Model), un modèle de monde génératif pour la robotique fondé sur les modèles de diffusion vidéo préentraînés. L'originalité technique centrale réside dans l'introduction de "Structured Kinematic-to-Visual Action Fields" : plutôt que d'injecter les états articulaires ou les positions d'effecteur terminal sous forme de tokens abstraits de faible dimension, le modèle projette directement les actions et états cinématiques dans l'espace de la caméra cible, produisant une représentation géométriquement ancrée. Les auteurs introduisent également des blocs de fusion bidirectionnelle sensibles aux événements ("event-aware bidirectional fusion blocks"), qui modulent l'attention croisée entre branches et capturent les changements d'état des objets ainsi que la dynamique fine des interactions robot-objet. Évalué sur le benchmark WorldArena, EA-WM dépasse les baselines existantes par une marge que les auteurs qualifient de significative, sans préciser les écarts numériques dans l'abstract. L'enjeu est celui du "problème inverse" dans les world models robotiques : la plupart des approches actuelles traitent la génération vidéo comme une représentation auxiliaire au service de l'apprentissage de politiques, sans exploiter les signaux d'action pour guider la synthèse visuelle. EA-WM retourne cette perspective et produit des rollouts simulés qui préservent mieux la géométrie spatiale du robot et la dynamique des interactions, un défaut récurrent des world models qui génèrent des séquences visuellement plausibles mais cinématiquement incohérentes. Pour les équipes travaillant sur le sim-to-real, une meilleure fidélité géométrique dans les rollouts peut directement améliorer la qualité des politiques apprises sans données réelles supplémentaires, ce qui est l'un des arguments centraux de ce type d'approche. Les modèles de diffusion vidéo utilisés comme fondation pour les world models robotiques font l'objet d'une activité de recherche intense depuis 2024, avec des travaux comparables comme UniSim, IRASim ou Genie 2 de DeepMind. EA-WM se distingue par son traitement explicite de la géométrie cinématique projetée dans la vue caméra, là où la plupart des approches restent dans des espaces latents abstraits. Il s'agit strictement d'un article académique en préprint : aucun code public n'est mentionné, aucun partenariat industriel ni déploiement n'est annoncé. Les étapes suivantes attendues sont la validation sur des benchmarks de manipulation réels et l'intégration dans des pipelines de policy learning fondés sur des modèles VLA (Vision-Language-Action).

RechercheActu
1 source
TriRelVLA : structure relationnelle triadique pour la manipulation incarnée généralisable
5363arXiv cs.RO 

TriRelVLA : structure relationnelle triadique pour la manipulation incarnée généralisable

Les modèles Vision-Language-Action (VLA), qui combinent perception visuelle, langage naturel et génération d'actions motrices, butent sur un problème connu : leur incapacité à généraliser à des scènes ou des objets non vus à l'entraînement. Une équipe de chercheurs propose TriRelVLA (arXiv:2605.05714, mai 2026), une architecture qui remplace les représentations visuelles implicites des VLA actuels par une structure relationnelle triadique explicite articulée autour de trois pôles : l'objet manipulé, la main du robot, et la tâche à accomplir. En pratique, le système construit ces représentations triadiques depuis des entrées multimodales, les organise dans un graphe relationnel via un graph transformer, puis compresse la structure dans un espace goulot (bottleneck) avant de l'injecter dans le LLM pour la prédiction d'action. Les auteurs introduisent également un jeu de données robotiques en environnement réel pour le fine-tuning et rapportent des gains en généralisation inter-scènes, inter-objets et inter-tâches. L'enjeu pour les intégrateurs industriels est direct : un système de manipulation qui échoue dès que la lumière change ou qu'une nouvelle référence produit apparaît n'est pas déployable à l'échelle. En découplant la structure relationnelle action-pertinente de l'apparence visuelle brute, TriRelVLA vise à rendre les politiques de contrôle portables entre environnements et configurations. La compression en espace bottleneck force le modèle à abstraire plutôt qu'à mémoriser, une approche qui, si elle tient à l'échelle, réduirait significativement les coûts de redéploiement dans de nouveaux ateliers ou avec de nouvelles références produit. Ce travail s'inscrit dans une vague de recherches sur les représentations structurées pour VLA, après des approches qui objectifiaient le contenu visuel sans capturer les relations pertinentes pour l'action. Les concurrents directs incluent pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), RT-2 et sa suite chez Google DeepMind, et GR00T N2 de NVIDIA, qui partagent tous le même défaut de sensibilité visuelle que TriRelVLA cherche à corriger. Ce papier reste un preprint non relu par les pairs, et les gains en généralisation annoncés n'ont pas encore été reproduits de manière indépendante. La mise à disposition du jeu de données réel représente la prochaine étape clé pour que la communauté puisse valider ces résultats.

IA physiqueOpinion
1 source
Sur l'émergence d'une structure pendulaire dans la locomotion multi-contacts
5364arXiv cs.RO 

Sur l'émergence d'une structure pendulaire dans la locomotion multi-contacts

Un preprint déposé sur arXiv le 8 mai 2026 (arXiv:2605.05707) s'attaque à une question fondamentale en commande de robots à pattes : pourquoi le modèle du pendule inversé linéaire (LIPM) fonctionne-t-il aussi bien en pratique, alors qu'il est généralement introduit comme un simple choix de modélisation plutôt qu'un résultat d'optimisation formel ? Les auteurs construisent un problème de commande optimale centroïdale (OCP) pénalisant le taux de variation du moment angulaire et montrent que la structure pendulaire en émerge naturellement. En appui de rang plein, l'optimum converge vers un profil de forces pendulaire à une vitesse gouvernée par la décomposition en valeurs singulières (SVD) du jacobien des moments, avec une constante géométrique dépendant de l'embase de contact qui correspond aux données expérimentales à 16 % près. En appui bipodal de trot (N=2 contacts), le cône de friction impose une borne inférieure sur le taux de moment angulaire qu'aucun réglage de pondération ne peut annuler, avec un point de non-différentiabilité à une accélération horizontale critique calculable en forme fermée. L'ensemble a été validé sur un quadrupède à masse ponctuelle et sur le Unitree Go1 dans le simulateur MuJoCo, en boucle ouverte (QP) et en boucle fermée au niveau couple. Ces travaux comblent un manque théorique persistant dans la commande de locomotion : LIPM était jusqu'ici une hypothèse posée a priori, non dérivée de la structure du problème d'optimisation sous-jacent. Démontrer formellement les conditions dans lesquelles la structure pendulaire est optimale, et celles où elle cesse de l'être (trot, fortes accélérations), fournit aux concepteurs de contrôleurs MPC centroïdaux un cadre de réglage plus rigoureux. La borne inférieure en trot est particulièrement instructive : elle explique des comportements empiriquement observés sur quadrupèdes réels et identifie une limite structurelle que le tuning seul ne peut surmonter. À noter que la validation se limite au simulateur MuJoCo, sans confrontation au monde réel ni à des terrains non structurés. L'article s'inscrit dans la longue lignée des formalisations des heuristiques de locomotion, du ZMP (Vukobratović, années 1970) au DCM (Pratt et al., 2006) jusqu'aux approches centroïdales modernes portées par des laboratoires comme le MIT Biomimetics Lab, l'ETH Zürich (plateforme ANYmal, commercialisée par ANYbotics) et le LAAS-CNRS à Toulouse. L'utilisation du Unitree Go1 comme plateforme de validation reflète la démocratisation de la recherche en locomotion quadrupède autour de robots accessibles. La contribution reste théorique : elle n'annonce ni nouveau robot ni déploiement industriel, mais offre un outil d'analyse formel utile aux équipes travaillant sur Spot (Boston Dynamics), ANYmal ou les futures générations de contrôleurs pour humanoïdes bipèdes.

RecherchePaper
1 source
ReActor : apprentissage par renforcement pour le reciblage de mouvement avec physique
5365arXiv cs.RO 

ReActor : apprentissage par renforcement pour le reciblage de mouvement avec physique

Une équipe de chercheurs a publié ReActor (arXiv:2605.06593, mai 2026), un cadre d'optimisation bilevel qui résout simultanément le retargeting cinématique et l'entraînement de la politique de suivi par apprentissage par renforcement. Le problème est connu : transposer une séquence de mouvement humaine capturée sur un robot aux articulations différentes génère systématiquement des artefacts physiques rédhibitoires, glissement de pieds, auto-collisions ou trajectoires dynamiquement infaisables, qui dégradent l'imitation learning en aval. ReActor élimine ces pathologies en intégrant directement le retargeting dans la simulation physique, avec un gradient approximé pour le niveau supérieur de l'optimisation et un ensemble sparse de correspondances sémantiques entre corps rigides. Aucun réglage manuel n'est requis. Le framework a été validé en simulation et sur hardware réel, notamment sur un quadrupède, morphologie particulièrement éloignée du référentiel humain. Ce résultat cible un goulet d'étranglement concret dans les pipelines d'imitation learning : la majorité des démonstrations actuelles reposent sur des données de mouvement nettoyées à la main ou des trajectoires synthétiques, deux approches coûteuses qui freinent le passage à l'échelle. En garantissant la cohérence physique dès le retargeting, ReActor produit des données directement exploitables sans post-traitement, réduisant le cycle de production de policies. L'absence de tuning manuel est stratégique pour les intégrateurs : le même framework peut s'appliquer à des morphologies très différentes sans réingénierie spécifique. La validation hardware sur quadrupède renforce la crédibilité face à des travaux restés confinés au sim-to-sim. Ce champ de recherche s'est intensifié avec l'essor des modèles d'action visuels (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui exigent de larges corpus de démonstrations physiquement cohérentes pour généraliser. ReActor se positionne face à des approches comme PHC ou MoCapAct en se distinguant par son couplage natif à la simulation physique plutôt qu'une correction post-hoc. Il s'agit pour l'instant d'un preprint académique sans partenariat industriel annoncé. La prochaine étape logique serait une validation sur robot humanoïde complet, où les contraintes dynamiques et les degrés de liberté supplémentaires rendent le problème encore plus sévère.

RecherchePaper
1 source
Correspondance de flux action-à-action
5366arXiv cs.RO 

Correspondance de flux action-à-action

Des chercheurs proposent dans un preprint arXiv (arXiv:2506.07322v2, mis à jour en 2026) une nouvelle architecture de politique robotique baptisée A2A (Action-to-Action Flow Matching), qui remplace le point de départ aléatoire habituel des modèles de diffusion par une initialisation ancrée dans l'action proprioceptive précédente du robot. Concrètement, au lieu de générer une trajectoire d'action à partir d'un bruit gaussien pur, A2A encode une séquence d'états proprioceptifs historiques (positions articulaires, vitesses, couples) dans un espace latent de haute dimension, et utilise ce vecteur comme point de départ du processus de flow matching. Le résultat le plus saillant : A2A produit des actions de haute qualité en une seule étape d'inférence, contre plusieurs dizaines d'étapes pour les politiques par diffusion standard, ce qui réduit drastiquement la latence au moment de l'exécution. Les auteurs rapportent également une meilleure robustesse aux perturbations visuelles (changements d'éclairage, objets parasites) et une généralisation supérieure à des configurations non vues durant l'entraînement. L'enjeu industriel est direct : la latence d'inférence est l'un des principaux verrous à l'adoption des politiques diffusion pour le contrôle temps-réel sur des manipulateurs ou des humanoïdes. Les architectures comme Diffusion Policy (Chi et al., 2023) ou Pi-0 de Physical Intelligence ont démontré une expressivité remarquable, mais leur coût computationnel par pas de contrôle reste prohibitif à haute fréquence. En ramenant l'inférence à un seul pas, A2A ouvre la voie à des boucles de contrôle plus rapides sans sacrifier la qualité des trajectoires, une contrainte particulièrement critique pour les tâches de manipulation dextre ou les robots mobiles en environnement dynamique. Le fait que la méthode tire parti de la continuité temporelle du mouvement, plutôt que de l'ignorer comme une condition statique, représente un changement de paradigme dans la modélisation des politiques robotiques. A2A s'inscrit dans la continuité des travaux sur le flow matching (Lipman et al., 2022), une alternative au processus de diffusion de Langevin qui permet des trajectoires plus droites dans l'espace latent et donc moins d'étapes d'intégration. Les politiques par diffusion pour la robotique ont émergé comme standard de facto entre 2023 et 2025, portées par des travaux comme ACT, Diffusion Policy et plus récemment GR00T N2 de NVIDIA ou Pi-0. A2A se positionne comme une optimisation d'inférence sur ce paradigme plutôt qu'une rupture architecturale. Les auteurs étendent également la méthode à la génération vidéo, suggérant une applicabilité au-delà du contrôle moteur pur. Le projet dispose d'un site public, mais aucun déploiement industriel ni partenariat n'est annoncé à ce stade : il s'agit d'une contribution académique à valider sur des benchmarks plus larges avant toute intégration en production.

RechercheOpinion
1 source
Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde
5367arXiv cs.RO 

Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde

Des chercheurs présentent sur arXiv (2605.06222) une méthode d'exécution adaptative pour les World Action Models (WAMs), une famille d'architectures de manipulation robotique qui prédisent simultanément les observations visuelles futures et les séquences d'actions à exécuter. Le problème structurel de ces systèmes est qu'ils exécutent un nombre fixe d'actions prédites après chaque inférence, sans vérifier si le déroulé physique réel correspond à l'état "imaginé" par le modèle. Pour y remédier, les auteurs proposent FFDC (Future Forward Dynamics Causal Attention), un vérificateur léger qui croise en temps réel les actions prédites, la dynamique visuelle anticipée, les observations caméra actuelles et les instructions en langage naturel, pour décider si le plan reste valide ou s'il faut déclencher une nouvelle inférence plus tôt. Ce module est couplé à une stratégie d'entraînement baptisée Mixture-of-Horizon Training, conçue pour améliorer la couverture des trajectoires longues. Sur le benchmark RoboTwin, FFDC réduit le nombre de passes avant du modèle de 69,10 % et le temps d'exécution de 34,02 %, avec un taux de succès en hausse de 2,54 % par rapport à une baseline à chunk court. En conditions réelles, le gain atteint 35 % de succès supplémentaire, bien que le nombre d'essais et les tâches testées ne soient pas précisés dans ce préprint. L'apport principal est de résoudre un compromis structurel qui freine le déploiement industriel des robots manipulateurs : réinférer fréquemment est réactif mais coûteux en calcul, tandis qu'exécuter de longues séquences prédites est efficace mais aveugle aux imprévus. FFDC introduit une troisième voie, où la taille du chunk d'action devient une variable émergente pilotée par la cohérence entre imagination et réalité. Ce mécanisme est particulièrement critique pour les phases de contact riche, où un décalage millimétrique entre état prédit et état réel suffit à faire échouer une saisie, et représente une avancée concrète vers des WAMs opérationnels hors environnement contrôlé. Les WAMs s'inscrivent dans la dynamique plus large des modèles d'actions visuelles et langagières (VLAs), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou RT-2 et ses successeurs chez Google DeepMind. Leur spécificité est d'intégrer explicitement une prédiction de l'état visuel futur pour planifier à plus long horizon. Ce préprint, sans affiliation industrielle déclarée, n'est pas encore évalué par les pairs. La prochaine étape naturelle serait une validation sur des benchmarks standardisés plus larges et des pilotes en environnement industriel non structuré.

IA physiqueOpinion
1 source
DexSynRefine : synthèse et affinement des mouvements humain-objet pour des actions robotiques dextériques réalisables
5368arXiv cs.RO 

DexSynRefine : synthèse et affinement des mouvements humain-objet pour des actions robotiques dextériques réalisables

DexSynRefine est un framework de manipulation dextre présenté dans un preprint arXiv daté de mai 2026, conçu pour apprendre des gestes robotiques complexes à partir de données d'interaction humain-objet (HOI) plutôt que par téléopération. L'architecture repose sur trois composants couplés : HOI-MMFP, une extension des "motion manifold primitives" conditionnée par la tâche et l'état initial de l'objet, qui synthétise des trajectoires coordonnées main-objet à partir de démonstrations HOI éparses ; une politique de renforcement résiduelle dans l'espace de la tâche, qui ancre physiquement ces trajectoires de référence tout en héritant de leur structure cinématique ; et un module d'adaptation contact-dynamique qui exploite l'historique proprioceptif pour le transfert sim-to-réel. Le système a été évalué sur cinq tâches : saisie-dépôt, utilisation d'outils et réorientation d'objets. Sur le robot réel, il améliore les taux de succès de 50 à 70 points de pourcentage par rapport au retargeting cinématique classique, et réussit le transfert sur la totalité des cinq tâches. Ce résultat est notable pour les intégrateurs et décideurs industriels parce qu'il adresse simultanément deux verrous majeurs de la manipulation dextre : le mismatch d'embodiment (les mains humaines et les mains robotiques ont des cinématiques incompatibles) et le sim-to-real gap dans des tâches contact-rich. L'approche HOI comme source de données est une alternative à l'échelle à la téléopération, coûteuse en opérateurs qualifiés. La politique résiduelle RL préserve la structure des démos tout en corrigeant la physique, ce qui limite l'exploration RL brute dans des espaces à haute dimension. Le gain de 50-70 pp est annoncé sur des évaluations internes, les conditions de test n'étant pas encore détaillées dans ce preprint préliminaire, ce qui invite à une lecture prudente avant généralisation. DexSynRefine s'inscrit dans une ligne de travaux sur la manipulation dextre post-dexterous-RL qui cherchent à s'affranchir de la téléopération (Dexterous Imitation, AnyDexGrasp, RoboAgent). Les motion manifold primitives sur lesquels s'appuie HOI-MMFP sont un outil issu de la synthèse de mouvement humain adapté ici au domaine robotique. Les concurrents directs incluent les approches de retargeting cinématique pur, les politiques diffusion comme pi-zero et les méthodes VLA appliquées à la manipulation fine. Le papier n'annonce pas de déploiement industriel ni de partenariat commercial, et reste au stade de la démonstration académique en laboratoire. Les prochaines étapes probables concernent la généralisation à des objets non vus et l'intégration dans des pipelines de données HOI à grande échelle.

IA physiquePaper
1 source
Utilisation créative d'outils par raisonnement contrefactuel
5369arXiv cs.RO 

Utilisation créative d'outils par raisonnement contrefactuel

Des chercheurs ont déposé en mai 2025 sur arXiv (arXiv:2605.05411) un framework de raisonnement causal destiné à l'utilisation créative d'outils par les robots. L'objectif est de permettre à un système robotique d'identifier et d'exploiter des objets comme outils, même lorsque ceux-ci ne sont pas conçus pour la tâche en question. Le pipeline repose sur deux composants complémentaires : une suggestion de caractéristiques (features) par un modèle de vision-langage (VLM), et une génération contrefactuelle d'outils via des perturbations ciblées sur les propriétés géométriques et physiques de l'objet. Une fois les relations causales identifiées dans un modèle de dynamique simulé, les nouveaux objets sont classifiés selon ces features causales, et le transfert de compétence se fait par keypoint matching conditionné sur ces mêmes caractéristiques. Les démonstrations expérimentales incluent l'atteinte d'un objet distant avec différents bâtons, la collecte de bonbons dans un bol avec divers ustensiles, et l'utilisation de caisses comme plateformes pour atteindre un objet en hauteur. L'approche est notable car elle découple explicitement la découverte causale de l'exécution motrice, là où les pipelines VLA (Vision-Language-Action) de type Pi-0 ou GR00T N2 apprennent ces deux aspects conjointement depuis de grandes quantités de données de démonstration. En ancrant la sélection d'outil dans la physique du problème plutôt que dans des corrélations statistiques, le framework prétend offrir une meilleure généralisation à des objets non vus lors de l'entraînement. Les comparaisons avec des baselines montrent que l'identification de features causales améliore à la fois la fiabilité de la sélection d'outil et la qualité du transfert de compétence par keypoints. Pour un intégrateur industriel, cela représente une piste concrète pour réduire la dépendance aux grandes bases de données de démonstration et faciliter l'adaptation à des environnements non structurés, un point de friction majeur dans les déploiements actuels. Ce travail s'inscrit dans un courant de recherche qui cherche à introduire du raisonnement causal explicite dans la robotique manipulatoire, en réaction aux limites de généralisation des approches purement end-to-end. Des équipes comme celles de DeepMind (avec RoboCat) ou Stanford (avec la série LEROBOT) explorent également des mécanismes de transfert, mais avec des architectures plus orientées données. La génération contrefactuelle d'outils rappelle des travaux antérieurs sur l'analogie structurelle en planification symbolique, ici traduite dans un espace physique continu. À ce stade, le framework est présenté sous forme de préprint sans déploiement industriel annoncé ; les expériences restent en environnement contrôlé, et les métriques de robustesse en conditions réelles ne sont pas encore publiées.

RecherchePaper
1 source
Prédiction de la stabilité de préhension sans contact par capteurs ToF intégrés en main
5370arXiv cs.RO 

Prédiction de la stabilité de préhension sans contact par capteurs ToF intégrés en main

Des chercheurs ont publié sur arXiv (arXiv:2605.05461, mai 2025) une méthode de prédiction de stabilité de préhension sans contact physique, reposant sur des capteurs ToF (time-of-flight) multi-zones intégrés dans les liaisons distales d'un préhenseur robotique. Contrairement aux approches existantes qui détectent l'échec de saisie uniquement après contact avec l'objet, ce système évalue la stabilité de la prise en amont de tout contact, à une fréquence de 15 Hz. Le jeu de données d'entraînement comprend plus de 2 500 saisies réelles effectuées sur 15 objets distincts. Le classificateur a ensuite été évalué sur 6 objets inédits, trois pour la validation et trois pour le test, avec des précisions respectives de 85,5 % et 86,0 %. Le gain pratique est direct : en découplant la prédiction de stabilité de la phase de contact, on réduit significativement le temps de cycle et, surtout, on évite des tentatives de saisie vouées à l'échec avant même qu'elles ne démarrent. Pour un intégrateur industriel ou un COO confronté à des lignes de picking à cadence élevée, cela se traduit par moins d'interruptions, moins de manipulations correctives, et une meilleure robustesse face aux variations de capteurs. La fréquence de 15 Hz est compatible avec des boucles de contrôle temps réel. Il faut toutefois rester mesuré : le corpus d'entraînement reste modeste (15 objets, 2 500 grasps), et les résultats sur objets "unseen" portent sur un échantillon de seulement trois pièces de test, ce qui rend la généralisation à des catalogues industriels réels encore incertaine. La prédiction de stabilité de saisie est un problème central en manipulation robotique depuis plusieurs décennies. Les approches tactiles, dominantes dans la littérature récente, offrent une richesse d'information mais imposent un contact préalable et nécessitent des capteurs coûteux et fragiles. Les capteurs ToF, eux, sont bon marché, robustes et déjà embarqués dans de nombreux systèmes. Ce travail s'inscrit dans un courant plus large visant à exploiter des modalités de capteurs proximaux, sans contact, pour la planification de mouvement, aux côtés de travaux sur les caméras de profondeur et les capteurs capacitifs. La prochaine étape naturelle sera de valider l'approche sur des objets déformables ou transparents, catégories notoirement problématiques pour les capteurs ToF, et de tester la robustesse en conditions d'éclairage variable.

RecherchePaper
1 source
Diffusion de carte d'étiquettes plug-and-play pour la navigation universelle orientée objectif
5371arXiv cs.RO 

Diffusion de carte d'étiquettes plug-and-play pour la navigation universelle orientée objectif

Une équipe de chercheurs a publié le 8 mai 2026 sur arXiv (référence 2605.05960) une méthode baptisée PLMD (Plug-and-Play Label Map Diffusion) pour la navigation robotique orientée objectif, dite GON (Goal-Oriented Navigation). Le défi central de cette classe de problèmes est le suivant : un robot doit localiser un objet cible dans un environnement qu'il n'a pas encore exploré, en construisant simultanément une carte en vue du dessus (BEV, Bird's-Eye-View). PLMD mobilise les modèles de diffusion probabiliste par débruitage (DDPM), popularisés en génération d'images, pour compléter ces cartes partielles à la volée : le système génère des étiquettes d'obstacles et des labels sémantiques pour les zones non encore visitées, permettant au robot de raisonner sur des régions qu'il n'a pas encore traversées. Les auteurs annoncent des performances état de l'art sur trois tâches GON distinctes, sans détailler les benchmarks ni les marges dans le seul abstract disponible. L'intérêt de l'approche tient à deux corrections apportées aux limites des méthodes existantes. Les cartes sémantiques auto-centrées échouent fréquemment en exploration partielle, précisément le cas réel, car elles supposent une connaissance complète de l'environnement. PLMD contourne ce verrou en extrapolant les zones inconnues de façon structurée, en exploitant la cohérence géométrique entre obstacles connus et inconnus pour guider le débruitage sémantique. Parallèlement, l'incohérence d'association sémantique, un même objet catégorisé différemment selon le point de vue du robot, est atténuée en intégrant des priors d'obstacles dans ce processus. Le qualificatif "plug-and-play" n'est pas qu'un argument marketing : la méthode est architecturée pour se greffer sur des pipelines de navigation sémantique existants sans réentraînement complet des modules sous-jacents, ce qui facilite son adoption dans des systèmes déjà déployés. La navigation orientée objectif dans des environnements non cartographiés est un problème de référence de l'embodied AI, évalué classiquement sur des benchmarks comme HM3D, MP3D ou RoboTHOR. Les approches concurrentes vont de l'exploration par frontières (frontier-based) aux modèles de langage visuels (VLM) comme EmbCLIP ou ESC, qui contournent la carte explicite en s'appuyant sur des embeddings pré-entraînés. PLMD se positionne dans le segment "map-based" en cherchant à corriger ses faiblesses structurelles plutôt qu'à les éviter. L'application des modèles de diffusion à la complétion de cartes topologiques est une direction de recherche émergente, distincte de leur usage en synthèse d'images ou de trajectoires. À ce stade, la contribution reste une validation en simulation, une évaluation sur robots physiques constituerait la prochaine étape décisive.

RecherchePaper
1 source
MARVL : guidage multi-étapes pour la manipulation robotique via des modèles vision-langage
5372arXiv cs.RO 

MARVL : guidage multi-étapes pour la manipulation robotique via des modèles vision-langage

Des chercheurs ont publié MARVL (Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models, arXiv:2602.15872), une méthode visant à automatiser la conception de fonctions de récompense dense pour l'apprentissage par renforcement (RL) appliqué à la manipulation robotique. L'approche repose sur l'affinage (fine-tuning) d'un modèle de vision-langage (VLM) pour améliorer sa cohérence spatiale et sémantique, puis décompose chaque tâche en sous-tâches séquentielles. Un mécanisme dit de projection de direction de trajectoire (task direction projection) renforce la sensibilité du signal de récompense aux progrès réels de l'agent. Évalué sur le benchmark Meta-World, référence standard pour les tâches de manipulation à récompenses éparses, MARVL surpasse les méthodes VLM-reward existantes en efficacité d'échantillonnage et en robustesse. La contribution centrale de MARVL est de corriger trois défauts chroniques des approches naïves de récompense par VLM : le désalignement entre signal de récompense et avancement réel de la tâche, la faiblesse du grounding spatial, et la compréhension insuffisante de la sémantique d'une tâche robotique. Pour les équipes de recherche en RL robotique, l'enjeu est concret : la conception manuelle de fonctions de récompense dense est coûteuse, non scalable, et constitue un goulot d'étranglement majeur dans le déploiement de nouveaux comportements. Si la méthode confirme ses performances sur des benchmarks plus larges, elle représenterait un pas vers l'automatisation du cycle de reward design, réduisant la dépendance aux ingénieurs spécialisés et accélérant l'itération expérimentale. Les VLMs utilisés comme superviseurs pour le RL robotique constituent un axe de recherche actif depuis 2023, porté notamment par des travaux comme EUREKA (OpenAI/NVIDIA) ou VLP. MARVL se distingue par son affinage ciblé du VLM et sa décomposition multi-étapes, là où EUREKA s'appuie sur un LLM pour générer du code de récompense sans fine-tuning préalable. La validation se limite pour l'instant à Meta-World, un environnement entièrement simulé ; aucun résultat sur robot physique n'est rapporté dans cette version, ce qui laisse ouverte la question du sim-to-real gap. Les suites naturelles incluront une évaluation sur des plateformes matérielles et des benchmarks plus récents comme RLBench ou ManiSkill.

RechercheOpinion
1 source
Traversée prudente de graphes à coûts d'arêtes stochastiques et corrélés pour une mobilité planétaire globale sûre
5373arXiv cs.RO 

Traversée prudente de graphes à coûts d'arêtes stochastiques et corrélés pour une mobilité planétaire globale sûre

Des chercheurs en robotique planétaire ont publié sur arXiv (réf. 2505.13674v2) un nouvel algorithme de planification de trajectoire pour l'exploration de surface martienne longue distance. Le travail formalise ce problème sous la forme d'une variante du Problème du Voyageur Canadien (Canadian Traveller Problem, CTP) intégrant explicitement l'aversion au risque. L'objectif est de produire une politique de traversée minimisant le CVaR (Conditional Value-at-Risk), une mesure de risque héritée de la finance quantitative et reconnue pour son interprétabilité intuitive. L'algorithme proposé trouve des politiques CVaR-optimales exactes en s'appuyant sur des techniques de recherche AND-OR établies, initialement conçues pour la minimisation d'espérance, étendues ici au domaine de l'aversion au risque. La validation s'effectue sur des simulations de traversées longue distance construites à partir de vraies cartes orbitales de la surface martienne, avec des probabilités de franchissement issues de cartes de terrain réelles. Ce travail répond à un goulet d'étranglement opérationnel concret dans les missions planétaires actuelles : les opérateurs humains doivent identifier manuellement les segments à traversabilité incertaine et adapter les plans en temps réel selon les difficultés rencontrées. En formalisant ce processus décisionnel adaptatif, les auteurs ouvrent la voie à une planification stratégique plus autonome, réduisant la charge sur les équipes sol tout en maintenant un contrôle explicite du niveau de risque. L'aspect le plus notable est la prise en compte des corrélations de traversabilité entre zones de terrain similaire : lorsqu'une région ressemble à une autre déjà évaluée, l'incertitude n'est pas traitée comme indépendante. Les résultats montrent empiriquement que des détours exploratoires ("information-seeking detours") permettent de réduire significativement le risque dans ces configurations corrélées, ce qui n'est pas possible avec les approches classiques insensibles au risque. Le contexte immédiat est celui des rovers martiens comme Curiosity (actif depuis 2012) et Perseverance (2021), dont la planification de trajectoire reste aujourd'hui très humano-dépendante et limitée en portée quotidienne. Le CTP est un problème classique de la littérature en planification sous incertitude, mais son adaptation risk-averse pour la mobilité planétaire globale n'avait pas encore été traitée de façon formelle. Ce travail reste pour l'instant une contribution académique sans implémentation annoncée sur matériel réel ni collaboration institutionnelle (NASA, ESA) mentionnée explicitement. Les prochaines étapes naturelles seraient une intégration dans les outils de planification de mission existants et une validation sur des données de terrain analogues terrestres, étape habituelle avant tout déploiement sur véhicule spatial.

RecherchePaper
1 source
TouchDrive : interface tactile sans électronique pour l'aide à la préhension
5374arXiv cs.RO 

TouchDrive : interface tactile sans électronique pour l'aide à la préhension

Des chercheurs ont publié sur arXiv (réf. 2605.06432) TouchDrive, une interface de retour tactile entièrement passive destinée à la préhension robotique assistive. Le système repose sur un clapet pneumatique normalement fermé, un réservoir d'air comprimé, un élément de captation mécanique et un actionneur haptique, sans aucun composant électronique. Le principe est direct : les forces de contact générées lors de la saisie sont converties en pression pneumatique qui actionne le retour haptique vers l'opérateur dans une boucle mécanique unique, sans microcontrôleur, sans firmware, sans couche logicielle intermédiaire. Le système a été validé sur plusieurs plateformes robotiques et testé sur un panel de 20 objets représentatifs, dont des fruits et des articles du quotidien, couvrant à la fois des objets compliants et des objets fragiles. L'intérêt industriel et médical de TouchDrive tient à sa rupture architecturale : là où les interfaces tactiles concurrentes empilent capteurs à résistance variable ou piézoélectriques, unités de traitement embarquées et buses d'actuation pilotées par microcontrôleur, TouchDrive condense sensing, génération de signal et retour haptique dans un seul circuit pneumatique passif. Cette compression de la chaîne de traitement réduit directement le coût de fabrication, la surface de défaillance et les contraintes réglementaires liées aux dispositifs électroniques en milieu médical. Pour un COO qui intègre des bras robotiques dans des environnements sensibles ou à budget contraint, l'absence d'électronique signifie aussi une maintenance simplifiée et une certification potentiellement plus rapide. La capacité à moduler la force de préhension en temps réel via retour tactile est ce qui permet la manipulation précise d'objets déformables, un problème non résolu par les systèmes de contrôle en position pure. Le champ de la manipulation assistive est actuellement dominé par des capteurs tactiles électroniques comme GelSight (MIT), DIGIT (Meta AI) ou les solutions embarquées de Touchlab et Contactile, tous dépendants de GPU ou de microcontrôleurs pour le traitement. TouchDrive se positionne explicitement à contre-courant, en ciblant l'accessibilité et la robustesse plutôt que la densité d'information. Il s'agit pour l'heure d'un prototype de laboratoire publié sous forme de preprint, sans partenaire industriel ni calendrier de commercialisation annoncé. La prochaine étape logique serait une validation sur des tâches à contraintes de force plus strictes et un test en conditions d'usage réelles avec des utilisateurs en situation de handicap moteur.

RecherchePaper
1 source
Contrôle anti-enchevêtrement par topologie pour robots souples
5375arXiv cs.RO 

Contrôle anti-enchevêtrement par topologie pour robots souples

Des chercheurs ont publié sur arXiv (référence arXiv:2605.05236v1) un cadre d'apprentissage par renforcement multi-agent baptisé TD-MARL (Topology-Driven Multi-Agent Reinforcement Learning), conçu pour coordonner plusieurs robots souples afin d'éviter les enchevêtrements dans des environnements de fabrication de précision fortement contraints. L'architecture repose sur un réseau critique à apprentissage centralisé, permettant à chaque agent de percevoir les stratégies de ses homologues via un état topologique partagé, couplé à une exécution distribuée qui supprime tout besoin de communication inter-robots en temps réel. Un composant central, la couche de sécurité topologique, exploite des invariants topologiques pour évaluer quantitativement et atténuer les risques d'enchevêtrement avant qu'ils ne bloquent les trajectoires. Les expériences présentées sont entièrement en simulation ; aucun déploiement sur hardware physique n'est rapporté à ce stade. Ce travail s'attaque à un verrou identifié dans les systèmes multi-robots déformables : les frameworks distribués classiques peinent à converger en environnements haute densité d'obstacles, car l'observabilité partielle de chaque agent génère une instabilité d'entraînement. En introduisant la topologie comme état partagé plutôt que des coordonnées brutes, TD-MARL réduit la dimensionnalité du problème de coordination tout en préservant l'information structurelle critique pour le désenchevêtrement. Pour les intégrateurs industriels qui déploient des robots souples en assemblage de précision ou en gestion de câbles, cette approche ouvre la voie à une coordination autonome sans infrastructure de communication dédiée, simplifiant l'architecture système. Le papier ne quantifie pas l'écart simulation-réel (sim-to-real gap), ce qui constitue la principale limite à l'extrapolation industrielle. La robotique souple connaît un regain d'intérêt pour les tâches de manipulation en espace confiné, portées par des équipes académiques en Chine, en Europe et aux États-Unis. Sur le plan du contrôle multi-agent, TD-MARL s'inscrit dans la lignée des approches CTDE (Centralized Training, Decentralized Execution) popularisées par MADDPG et MAPPO, en y ajoutant une couche topologique inspirée de la théorie des noeuds et de l'homologie persistante. Aucun concurrent industriel direct n'est nommé dans l'article, le benchmarking se faisant exclusivement contre des méthodes DRL de référence en simulation. La prochaine étape naturelle, et condition sine qua non pour un transfert industriel, serait une validation sur banc de test physique avec des corps déformables réels.

RecherchePaper
1 source
Navigation multimodale par apprentissage par renforcement multi-agents
5376arXiv cs.RO 

Navigation multimodale par apprentissage par renforcement multi-agents

Des chercheurs ont publié CRONA (Cross-Modal Navigation), un framework basé sur l'apprentissage par renforcement multi-agent (MARL), disponible en préprint sur arXiv (identifiant 2605.06595). Plutôt que d'entraîner un modèle monolithique fusionnant simultanément plusieurs flux sensoriels, ce qui génère des espaces de représentation complexes et élargit considérablement l'espace de politiques à explorer, CRONA déploie des agents légers spécialisés par modalité, coordonnés par un critique centralisé multi-modal disposant d'un état global partagé et de représentations auxiliaires orientées contrôle. Les expériences portent sur des tâches de navigation visuo-acoustique : CRONA surpasse les baselines à agent unique en performance et en efficacité. Les auteurs identifient trois régimes distincts : la collaboration homogène (agents de même modalité) suffit pour la navigation courte portée avec indices saillants ; la collaboration hétérogène (modalités complémentaires) est généralement efficace ; les grands environnements complexes réclament une perception plus riche et une capacité modèle accrue. L'enjeu industriel est la modularité. Fusionner vision, audio et autres capteurs dans un seul réseau reste un obstacle majeur pour les robots incarnés opérant en milieux non contrôlés, entrepôts, espaces publics, bâtiments industriels. En découplant les modalités en agents parallèles indépendants, CRONA simplifie l'acquisition de données (chaque modalité peut être entraînée séparément) et permet de remplacer ou affiner un capteur sans réentraîner l'ensemble du système. Pour les intégrateurs B2B, la taxonomie des trois régimes de navigation constitue une heuristique pratique pour dimensionner les architectures embarquées selon la complexité des scénarios cibles. La navigation audio-visuelle incarnée s'appuie sur des environnements de référence établis comme SoundSpaces et Matterport3D. L'originalité de CRONA réside dans l'application du MARL à ce problème, là où la littérature récente privilégie les architectures Transformer multi-modales de type VLA (Vision-Language-Action). Aucun partenariat industriel ni calendrier de déploiement n'est mentionné : il s'agit d'un preprint sans validation sur hardware réel, ce qui laisse ouverte la question du sim-to-real gap, particulièrement critique pour les signaux acoustiques en environnement non contrôlé. La prochaine étape logique serait une validation sur plateforme robotique physique.

RecherchePaper
1 source
SwarmCoDe : cadre de co-conception évolutif pour essaims de robots hétérogènes par spéciation dynamique
5377arXiv cs.RO 

SwarmCoDe : cadre de co-conception évolutif pour essaims de robots hétérogènes par spéciation dynamique

SwarmCoDe est un algorithme de co-évolution collaborative (CCEA) présenté dans un preprint arXiv (2603.26240v2) qui vise à automatiser la co-conception d'essaims de robots hétérogènes à grande échelle. La méthode centrale, dite "spéciation dynamique", fait émerger automatiquement des espèces de robots distinctes en fonction de la complexité de la tâche, sans les définir a priori. L'algorithme optimise simultanément la planification de tâches et la morphologie physique des robots, sous contrainte de budget de fabrication. Il intègre un "gène de dominance" qui dicte la composition de l'essaim, et des "tags génétiques" inspirés de mécanismes biologiques de coopération inter-espèces, permettant aux agents d'identifier des partenaires bénéfiques sans frontières prédéfinies. Les expériences rapportées, toutes simulées, montrent des essaims pouvant atteindre 200 agents, soit quatre fois la taille de la population évolutionnaire utilisée pour les générer. Le problème que SwarmCoDe cherche à résoudre est structurel : dans les approches classiques, la co-conception d'un essaim devient rapidement intractable à mesure que le nombre d'agents augmente, l'espace de design croissant exponentiellement. Le gène de dominance découple la taille physique de l'essaim de la population évolutionnaire, ce qui constitue la contribution technique principale : elle rend le calcul viable pour de grands systèmes sans explosion des ressources computationnelles. Pour les intégrateurs industriels et les équipes R&D déployant des flottes de robots, cela ouvre la perspective d'une optimisation automatique de la diversité matérielle, plutôt qu'une définition manuelle du mix robotique. Les améliorations marginales sur chaque unité se composent à l'échelle, ce qui explique pourquoi le co-design est stratégique dès qu'on parle de dizaines ou centaines d'agents en déploiement réel. La co-conception robotique est un domaine actif depuis une décennie, mais généralement appliquée à des robots unitaires ou de petits groupes homogènes. SwarmCoDe s'inscrit dans la continuité des travaux sur l'évolution morphologique (NEAT, neuroévolution) et des recherches sur les essaims hétérogènes, notamment des groupes comme celui de Josh Bongard à l'Université du Vermont. Les approches concurrentes incluent l'optimisation multi-objectif classique et les frameworks de co-design par gradient. Point critique à noter : l'article ne présente aucune validation sur robots physiques, toutes les métriques étant issues de simulation. Le fossé sim-to-real reste un verrou non adressé dans ce travail, et constituera l'épreuve décisive pour une adoption en contexte industriel.

RecherchePaper
1 source
Un temple sud-coréen ordonne le robot humanoïde Unitree G1 lors d'une première mondiale bouddhiste
5378TechNode 

Un temple sud-coréen ordonne le robot humanoïde Unitree G1 lors d'une première mondiale bouddhiste

Le robot humanoïde G1 du fabricant chinois Unitree a participé le mois dernier à une cérémonie d'ordination bouddhiste au temple Jogyesa de Séoul, en Corée du Sud, dans ce qui constitue une première mondiale documentée pour un rituel religieux impliquant un robot. Mesurant 130 centimètres pour environ 35 kilogrammes, le G1 a reçu le nom dharma Gabi, a été revêtu de robes monastiques et équipé d'un chapelet de 108 perles de prière. Piloté par un système de dialogue basé sur l'IA, il a prononcé la formule rituelle "Je consens à prendre refuge" lors des rites de repentance et d'offrandes symboliques. L'Ordre Jogye du bouddhisme coréen a également reformulé les cinq préceptes traditionnels à destination des agents artificiels : ne pas nuire à la vie, ne pas endommager les objets, ne pas désobéir aux humains, ne pas tromper, et ne pas surfacturer. L'événement dépasse le symbole anecdotique : il révèle que les institutions non technologiques commencent à produire leurs propres cadres normatifs pour l'IA et la robotique, en avance sur les régulateurs. La reformulation des préceptes par l'Ordre Jogye constitue de fait une tentative de formalisation éthique, certes informelle, des contraintes comportementales pour les systèmes autonomes, un terrain où les débats académiques et législatifs peinent encore à aboutir. Le fait que ce soit un robot Unitree, marque jusqu'ici surtout connue pour ses quadrupèdes et son positionnement prix agressif, qui soit au cœur de cette séquence souligne la vitesse à laquelle les humanoïdes de milieu de gamme s'infiltrent dans des contextes non industriels. Unitree a lancé le G1 en 2024 à partir de 16 000 dollars, en visant explicitement les chercheurs et développeurs plutôt que l'industrie lourde. Face aux Figure 02, Optimus Gen 2 de Tesla ou Digit d'Agility Robotics, le G1 se positionne comme une plateforme accessible et hackable. La cérémonie de Jogyesa n'était pas une démonstration technique commanditée par Unitree mais une initiative autonome du temple, ce qui en modifie la portée : c'est la société civile, et non un département marketing, qui a choisi ce robot pour porter un message sur la coexistence humain-machine. Les suites immédiates restent incertaines, aucun programme de déploiement religieux n'a été annoncé, mais l'événement a déjà relancé les débats sur la personnalité juridique et morale des agents artificiels en Asie du Sud-Est.

Societe/EthiqueOpinion
1 source
Hugging Face lance une boîte à outils à base d'agents pour Reachy Mini
5379The Robot Report 

Hugging Face lance une boîte à outils à base d'agents pour Reachy Mini

Hugging Face a lancé cette semaine un kit de développement agentique permettant de créer des applications pour Reachy Mini, son robot de bureau open source, sans écrire une seule ligne de code. Le principe : l'utilisateur décrit en langage naturel le comportement souhaité, et un agent IA rédige, teste et déploie automatiquement le code sur le robot. Reachy Mini mesure 27,9 cm de hauteur pour 16 cm de largeur, pèse 1,5 kg et se pilote intégralement depuis une interface web. Plus de 200 applications sont déjà disponibles dans un App Store hébergé sur le Hugging Face Hub, installables en un clic, forkables et modifiables à la demande. Un simulateur navigateur permet également de tester les applications sans posséder le matériel. Parmi les exemples publiés : un tuteur d'accent linguistique, un assistant de cuisine pas-à-pas, un commentateur de Formule 1 en temps réel, ou un jeu inspiré de Squid Game. L'un des cas d'usage mis en avant est celui de Joel Cohen, retraité de 78 ans sans formation technique, qui a construit un co-facilitateur vocal IA pour les groupes de dirigeants qu'il anime sur Zoom : le système dispose de quatre modes de facilitation, d'une banque de plus de 60 questions et reconnaît par son nom chacun de ses 29 participants. Ce lancement illustre un changement de paradigme potentiel dans l'accès au développement robotique. Jusqu'ici, déployer un comportement sur un robot impliquait la maîtrise d'un SDK, la connaissance d'API de bas niveau et un temps d'intégration significatif. Ici, la barrière technique est explicitement remplacée par un agent LLM, ce qui déplace la contrainte vers la qualité du prompt plutôt que vers la compétence en programmation. Pour les intégrateurs et les décideurs B2B, le modèle Hub-plus-simulator offre une logique de validation à coût quasi nul avant achat du matériel physique. Reste à mesurer la robustesse réelle du code généré dans des conditions d'usage prolongé : les 200 applications recensées sont des contributions communautaires récentes, pas des déploiements industriels validés. La distinction entre démo accessible et produit robuste en production reste entière. Hugging Face, souvent décrit comme le "GitHub de l'IA" avec plusieurs millions de développeurs et des dizaines de milliers d'entreprises utilisatrices, a acquis Pollen Robotics en 2024. Cette startup française de Bordeaux est le fabricant de la gamme Reachy, des robots open source à vocation éducative et de recherche. L'intégration de la plateforme Hub à l'écosystème robot concrétise donc une stratégie annoncée lors de l'acquisition : faire de Hugging Face le point d'entrée unique pour le développement robotique grand public. Sur le segment des robots de bureau open source, Reachy Mini se positionne face à des plateformes comme LeRobot (également porté par Hugging Face) ou les kits SO-100/SO-101 de The Robot Company, avec un avantage différenciant sur la fluidité du parcours développeur et l'effet réseau du Hub existant. Aucune timeline de déploiement commercial à grande échelle n'a été communiquée.

FR/EU ecosystemeOpinion
1 source
Prix RBR50 2026 de l'innovation en robotique
5380Robotics Business Review 

Prix RBR50 2026 de l'innovation en robotique

The Robot Report a publié pour la quinzième année consécutive son palmarès RBR50, sélectionnant 50 organisations mondiales, entre entreprises, associations et institutions académiques, pour leur innovation technologique et commerciale en robotique. L'édition 2026 intègre à la fois des habitués et de nouveaux entrants, avec une couverture allant des capteurs industriels aux rovers martiens, en passant par des solutions de fabrication, de logistique, de nouveaux matériaux et de processeurs. Parmi les distinctions spéciales : Physical Intelligence (San Francisco, fondée en 2023) reçoit le titre de Startup de l'Année ; Harvard University décroche le prix Application de l'Année pour un système d'assistance aux personnes souffrant de limitations motrices du bras ; Tatum Robotics remporte la catégorie Robots for Good pour ses applications auprès de personnes sourdes-aveugles. La cérémonie de remise des prix est prévue lors du dîner de gala du Robotics Summit & Expo à Boston. Le palmarès 2026 reflète plusieurs dynamiques structurantes pour les acteurs industriels : essor des manipulateurs mobiles, développement des systèmes portables (wearables) et accélération de l'IA appliquée à la robotique physique. La distinction accordée à Physical Intelligence est particulièrement significative : la startup a développé pi0, l'un des premiers modèles VLA (Vision-Language-Action) à démontrer des capacités de généralisation sur des tâches physiques variées, sans reprogrammation tâche par tâche. Pour les intégrateurs et décideurs industriels, ce type de reconnaissance signale quels segments technologiques atteignent un seuil de maturité commerciale justifiant un investissement. Le palmarès inclut également les grands fournisseurs de solutions complètes pour la fabrication et la logistique, ainsi que des fabricants de composants critiques (capteurs, actionneurs, processeurs). L'inclusion d'une approche inédite de confection textile automatisée et d'un rover en opération sur Mars illustre la volonté du jury de couvrir l'étendue réelle du champ robotique en 2026. Créé en 2012, le RBR50 s'est imposé comme un repère annuel dans le secteur : selon The Robot Report, plusieurs lauréats passés ont levé des millions de dollars dans les mois suivant leur sélection, et nombre d'entre eux sont revenus sur la liste avec de nouvelles innovations. L'édition 2026 intègre aussi une dimension institutionnelle et politique notable : l'Association for Advancing Automation travaille à convaincre le Congrès américain d'adopter une stratégie nationale en robotique, tandis que MassRobotics accompagne des startups internationales dans leur accès au marché américain. Aucun acteur français ni européen n'est explicitement mentionné dans le communiqué public, bien que des entreprises comme Wandercraft, Enchanted Tools ou Pollen Robotics figurent régulièrement dans ce type de palmarès. À noter : l'article source est un teaser promotionnel invitant au téléchargement d'un rapport complet accessible sur formulaire, et ne détaille pas les critères de sélection par organisation.

BusinessActu
1 source
LG fait équipe des robots humanoïdes et quadrupèdes pour automatiser ses entrepôts
5381Interesting Engineering 

LG fait équipe des robots humanoïdes et quadrupèdes pour automatiser ses entrepôts

LG CNS, filiale IT du conglomérat sud-coréen LG, a présenté le 6 mai 2026 une démonstration de logistique multi-robots sur son campus Magok, dans l'ouest de Séoul. Quatre robots de fabricants différents ont exécuté une chaîne de manutention complète sans téléopération ni intervention humaine : un humanoïde bipède a saisi des colis sur un tapis roulant et les a transmis à un robot quadrupède à roues, qui les a acheminés jusqu'à un humanoïde sur plateforme roulante, lequel a positionné les boîtes sur des étagères situées à plus de deux mètres de hauteur. Le cycle complet, entre stations espacées de deux à trois mètres, s'est bouclé en environ 90 secondes. L'ensemble repose sur la plateforme Physical Works de LG CNS, articulée en deux briques : Physical Works Forge (entraînement par simulation et données vidéo) et Physical Works Baton (orchestration centralisée de flottes multi-marques). La plateforme prend en charge les humanoïdes bipèdes et sur roues, les quadrupèdes, les AMR et les AGV via une interface unifiée. LG Display a par ailleurs dévoilé en parallèle un écran P-OLED courbe de 7,2 pouces (technologie Tandem OLED troisième génération) destiné à l'affichage facial des robots humanoïdes. Ce qui rend la démonstration techniquement notable, c'est moins la performance individuelle de chaque robot que la couche logicielle de coordination inter-marques. La plateforme intègre un mécanisme de réaffectation dynamique des tâches : lors de la simulation d'un incident, le quadrupède a été basculé vers une mission de patrouille de sécurité, et un AMR de remplacement a pris le relais de transport sans interrompre le flux. LG CNS annonce que cette approche ramène les délais de déploiement de plusieurs mois à un à deux mois, avec des projections de gains de productivité supérieurs à 15 % et de réduction des coûts opérationnels allant jusqu'à 18 % dans des environnements de flottes mixtes d'environ 100 unités. Ces chiffres restent des projections internes, non encore validés en production à grande échelle, et le cycle de 90 secondes a été mesuré sur une distance très courte, ce qui en limite la portée comme indicateur de performance industrielle réelle. LG CNS positionne Physical Works dans un marché où la concurrence se structure autour de plateformes d'orchestration robotique plutôt que d'hardwares isolés. Aux États-Unis, Boston Dynamics propose Orbit pour la gestion de flottes Spot, tandis qu'Amazon et ses partenaires intègrent déjà des flottes mixtes AMR-humanoïdes (Digit d'Agility Robotics) dans leurs entrepôts. En Corée du Sud, Samsung et Hyundai (actionnaire de Boston Dynamics) sont également présents sur ce terrain. LG CNS a annoncé mener des projets pilotes avec 20 clients industriels et déployer la plateforme dans le cadre du projet Busan Smart City. Le groupe a aussi pris des participations dans des entreprises de contrôle humanoïde et de robot foundation models, sans en préciser les noms, ce qui suggère une stratégie d'intégration verticale en cours de consolidation.

IndustrielOpinion
1 source
Podcast : Colin Angle parle de la conception de robots compagnons avec Familiar Machines et Magic
5382The Robot Report 

Podcast : Colin Angle parle de la conception de robots compagnons avec Familiar Machines et Magic

Colin Angle, cofondateur et ancien PDG d'iRobot, sort de la discrétion avec une nouvelle startup baptisée Familiar Machines & Magic (FM&M). La société vient de lever le voile sur son projet : développer des robots compagnons appelés "Familiars", conçus pour entretenir des relations à long terme avec leurs utilisateurs, avec une dimension d'intelligence émotionnelle embarquée. FM&M se positionne dans le segment de la "physical AI grand public". Aux côtés d'Angle, l'équipe fondatrice comprend Ira Renfrew, directrice des ressources humaines et du produit, et le Dr Chris Jones, directeur R&D, tous deux vétérans de l'industrie avec des parcours chez iRobot, Amazon et d'autres grandes plateformes technologiques. Le reste de l'équipe cumule des expertises issues de Disney Research, du MIT, de Boston Dynamics et de l'USC. Collectivement, les fondateurs revendiquent le déploiement de plus de 50 millions de robots grand public dans le monde. La société opère depuis Boston, Los Angeles et Hong Kong. Le retour de Colin Angle dans la robotique grand public constitue un signal notable pour un secteur aujourd'hui dominé par les annonces industrielles et les humanoïdes de laboratoire. FM&M mise sur un segment encore peu commercialisé : le robot domestique à vocation relationnelle, distinct du simple assistant vocal ou du robot aspirateur. L'enjeu central est de démontrer qu'une intelligence émotionnelle peut être embarquée dans un produit physique viable sur le marché de masse, hypothèse que plusieurs tentatives précédentes (Jibo, Anki Vector, Embodied Moxie) n'ont pas réussi à valider à grande échelle. Le pedigree de l'équipe apporte une crédibilité rare dans ce segment, notamment sur les questions de navigation, de robustesse produit et de capacité manufacturière. Cela dit, FM&M n'a annoncé ni produit concret, ni prix, ni calendrier de lancement : on reste strictement au stade de la sortie de stealth, sans prototype montré publiquement. Angle a quitté iRobot début 2024 après l'échec du rachat par Amazon, bloqué par la Commission européenne en janvier 2024 pour des raisons de concurrence, ce qui avait contraint l'entreprise à licencier environ 31 % de ses effectifs et Angle à démissionner. Cette rupture a libéré l'un des profils les plus expérimentés de la robotique grand public pour fonder FM&M. Dans le paysage concurrent, les robots compagnons peinent structurellement à trouver un modèle économique pérenne : Embodied a fermé ses portes, Sony perpétue Aibo sur un segment premium très niche, et des acteurs comme 1X Technologies ou Apptronik visent prioritairement l'industrie. Aucune levée de fonds n'a été communiquée publiquement par FM&M, et la formulation retenue par la société, construire "une plateforme à long terme pour la vie artificielle", suggère un horizon commercial encore lointain.

Brightpick présente sa feuille de route vers les entrepôts entièrement automatisés au Robotics Summit
5383The Robot Report 

Brightpick présente sa feuille de route vers les entrepôts entièrement automatisés au Robotics Summit

Jan Zizka, co-fondateur et PDG de Brightpick, présentera le 27 mai 2026 à 14h45 lors du Robotics Summit & Expo de Boston une conférence intitulée "When Robots Don't Sleep: The Path Toward Lights-Out Warehouses". L'exposé portera sur une feuille de route concrète vers les entrepôts en fonctionnement autonome total, dits "lights-out", sans opérateurs humains présents. Brightpick, fondée en 2021 par essaimage depuis l'éditeur de vision machine Photoneo (racheté par Zebra Technologies en 2024), développe des robots d'order picking basés sur l'IA. Son produit phare, l'Autopicker, lauréat du RBR50 Robotics Innovation Award 2024, s'installe en quelques semaines dans des entrepôts de toute taille et couvre le picking, le buffering, la consolidation, l'expédition et le réapprovisionnement de stock. La société est basée à Austin, Texas. Le message central de Zizka est délibérément pragmatique : le lights-out total reste hors de portée économique à court terme, mais un mode hybride est déjà opérationnel. Dans ce modèle, les robots assurent la majorité des tâches répétitives de nuit sans supervision, tandis que les humains interviennent le jour pour les pics de volume et les cas exceptionnels. Le vrai verrou n'est pas technique mais économique : automatiser les derniers 10 à 20 % des flux, là où se concentrent les cas limites et les décisions de jugement, coûte disproportionnellement cher par rapport au gain. La stratégie rationnelle consiste donc à maximiser le ROI sur les flux à fort volume, préserver la flexibilité humaine là où elle crée de la valeur, et réduire progressivement l'ensemble des exceptions à mesure que la technologie mature. C'est une posture moins spectaculaire que les annonces "révolutionnaires" du secteur, mais plus alignée avec les contraintes réelles des opérateurs logistiques. Brightpick s'inscrit dans une course à la commercialisation des robots d'entrepôt autonomes où les acteurs sont nombreux : Exotec (France, systèmes Skypod pour le stockage dense), Symbotic, Locus Robotics, ou encore Grey Orange sur le segment des AMR de fulfillment. La particularité de Brightpick est son héritage en vision 3D via Photoneo, qui lui confère une expertise en manipulation autonome plutôt que sur le simple transport. Zizka cumule plus de 20 brevets couvrant la détection 3D, la robotique mobile et la manipulation, et a conduit des recherches sur les caméras computationnelles au MIT. La conférence de Boston permettra de calibrer où en est réellement la technologie par rapport aux promesses marketing du secteur, un exercice d'autant plus utile que les déploiements lights-out effectifs restent rares et souvent cantonnés à des environnements très contraints (température, SKU limités, flux prévisibles).

IndustrielActu
1 source
Le robot humanoïde reçoit une tête avec écran OLED incurvé pour améliorer son efficacité
5384Interesting Engineering 

Le robot humanoïde reçoit une tête avec écran OLED incurvé pour améliorer son efficacité

LG Display a présenté au SID Display Week 2026 de Los Angeles un écran P-OLED de 7,2 pouces conçu spécifiquement pour les robots humanoïdes, marquant la première démonstration publique d'un tel composant par l'entreprise coréenne. Le panneau repose sur la troisième génération de la plateforme Tandem OLED de LG, rebaptisée "Tandem OLED" pour les usages robotiques, et utilise un substrat plastique en polyimide plutôt que du verre, ce qui lui confère une flexibilité suffisante pour épouser les surfaces courbes d'un visage mécanique. L'interface affiche des informations fonctionnelles, niveau de batterie, météo, mode veille, calendrier, salutations, tandis que la majorité de l'écran reste éteinte lors des démonstrations, exploitant le principe OLED où chaque pixel s'éteint indépendamment. Résultat : la troisième génération Tandem réduit la consommation énergétique de 18 % par rapport à la génération précédente, limitant la dissipation thermique dans un châssis où les composants électroniques sont sensibles à la chaleur. Le panneau atteint 1 000 nits de luminosité, opère entre -30 °C et 85 °C, et est qualifié pour plus de 15 000 heures de fonctionnement, des spécifications empruntées à la filière OLED automobile du groupe. L'enjeu industriel de cette annonce va au-delà de l'esthétique : un écran facial n'est pas qu'un gadget de communication HRI (human-robot interaction), c'est un composant thermique, énergétique et mécanique à part entière. Pour les intégrateurs de robots de service, la capacité à afficher un statut opérationnel sans drain notable sur la batterie, tout en résistant aux contraintes thermiques d'un environnement industriel ou domestique, représente un critère de sélection concret. La flexibilité du substrat ouvre par ailleurs la voie à des designs de carrosserie moins contraints par la géométrie plane des dalles rigides. Il est toutefois utile de noter que LG Display parle pour l'instant d'un prototype présenté en salon : aucun engagement de production en série ni de fenêtre de disponibilité commerciale n'a été communiqué. Ce dévoilement s'inscrit dans la stratégie plus large de LG Electronics, qui a lancé le robot humanoïde LG CLOiD en janvier 2026 au CES de Las Vegas. CLOiD embarque deux bras articulés à 7 degrés de liberté chacun, cinq doigts à actionnement indépendant, une base mobile autonome et une tête-hub équipée de caméras, capteurs et d'une interface IA reposant sur des modèles VLM (Vision Language Model) et VLA (Vision Language Action), entraînés sur plusieurs dizaines de milliers d'heures de données de tâches domestiques. LG a également annoncé LG Actuator AXIUM, une plateforme d'actionneurs modulaires destinée aux robots de service et aux appareils électroménagers intelligents. Sur ce segment, LG se positionne en concurrent direct de Samsung Robotics, Boston Dynamics (Spot/Atlas chez Hyundai) et des acteurs spécialisés comme Enchanted Tools en France, qui développe Miroki pour des usages hospitaliers et de services.

HumanoïdesOpinion
1 source
ABB Robotics lance PickMaster Lite pour simplifier et accélérer la prise robotisée
5385Robotics & Automation News 

ABB Robotics lance PickMaster Lite pour simplifier et accélérer la prise robotisée

ABB Robotics a lancé PickMaster Lite, une version allégée de sa suite logicielle PickMaster, destinée aux OEM packaging et aux intégrateurs systèmes qui cherchent à déployer des applications de picking robotisé haute vitesse guidé par vision. Le produit vise à réduire l'effort d'ingénierie lors de la configuration et à raccourcir les délais de mise en service sur des tâches de picking courantes. ABB n'a pas communiqué de métriques précises sur les gains de temps de cycle ou les prix dans cette annonce initiale. L'enjeu pour les intégrateurs est réel: la configuration de systèmes de picking vision-guidé reste l'un des postes les plus chronophages dans les projets d'automatisation packaging, notamment pour les lignes à cadences élevées. En proposant une version avec des fonctionnalités essentielles plutôt qu'une suite complète, ABB abaisse la barrière d'entrée pour les PME industrielles et les OEM qui ne disposent pas d'équipes robotique expertes en interne. C'est aussi un signal que le marché logiciel pour la robotique de picking se structure autour de deux segments: des plateformes full-featured pour intégrateurs avancés, et des offres simplifiées pour accélérer le déploiement sur cas d'usage standardisés. PickMaster est une plateforme ABB historique pour le picking et le placement, utilisée notamment avec les robots delta IRB 360 FlexPicker. Sur ce segment, ABB fait face à Fanuc, KUKA, Yaskawa et à des acteurs logiciels spécialisés comme Pickit ou Mujin, qui misent également sur la réduction de la complexité de programmation. Les prochaines étapes de PickMaster Lite, notamment les compatibilités de robots supportés et les conditions de licence, n'ont pas encore été détaillées par ABB.

FR/EU ecosystemeOpinion
1 source
Comau et Aptiv s'associent pour développer des systèmes d'automatisation industrielle autonomes et de robotique basée sur l'IA
5386Robotics & Automation News 

Comau et Aptiv s'associent pour développer des systèmes d'automatisation industrielle autonomes et de robotique basée sur l'IA

Comau, spécialiste italien de l'automatisation industrielle rattaché au groupe Stellantis, et Aptiv, entreprise technologique américaine issue de la scission de Delphi en 2017, ont signé un accord-cadre pour co-développer des systèmes d'automatisation industrielle intelligents. Les trois axes retenus sont la robotique avancée, les systèmes autonomes et l'intégration de l'IA dans les processus de production. Il s'agit à ce stade d'un protocole d'intention : aucun produit, aucun délai ni montant d'investissement n'a été communiqué. La complémentarité des deux acteurs justifie le rapprochement. Comau apporte son expertise en intégration robotique et en ingénierie de lignes de production, Aptiv ses capacités en architecture électronique embarquée et en logiciels pour systèmes autonomes, développées dans l'univers du véhicule connecté. Pour les intégrateurs industriels, cette convergence hardware-software reflète une tendance structurelle : les plateformes d'automatisation évoluent vers une adaptation autonome en environnement non structuré, réduisant la dépendance à la reprogrammation manuelle. Les deux entreprises s'inscrivent dans un secteur sous pression concurrentielle forte. FANUC, ABB Robotics et KUKA, filiale du groupe chinois Midea depuis 2017, investissent eux aussi dans l'IA appliquée à la robotique industrielle. Comau cherche à diversifier ses débouchés au-delà de l'assemblage automobile, tandis qu'Aptiv accélère sa transition des composants électroniques vers les couches logicielles. L'accord reste prudemment formulé, sans pilote client identifié ni roadmap précise, signe d'une collaboration encore en phase exploratoire.

FR/EU ecosystemeActu
1 source
De nouvelles connaissances sur le vol des insectes ouvrent la voie à des robots à ailes battantes stables
5387Robohub 

De nouvelles connaissances sur le vol des insectes ouvrent la voie à des robots à ailes battantes stables

Des chercheurs de l'Université Cornell ont publié le 1er mai 2026 dans les Proceedings of the National Academy of Sciences un modèle computationnel qui reformule les conditions de stabilité du vol battu chez les insectes. Dirigée par Z. Jane Wang, professeure de physique et d'ingénierie aérospatiale, et co-signée par Owen Wetherbee en premier auteur, l'étude fait suite à plus d'une décennie de travaux amorcés sur les circuits neuronaux des mouches des fruits. Le modèle de départ, une simulation 3D complète, montrait que la mouche des fruits actualise sa posture à chaque battement d'aile, soit environ une fois toutes les 4 millisecondes. L'équipe a ensuite condensé cette simulation en un modèle réduit qui préserve les équations physiques essentielles tout en restant calculable à grande échelle. Cinq paramètres structurent ce qu'elle appelle un "espace morphologique et cinématique à cinq dimensions" : le rapport masse aile/corps, la charge alaire, la position de l'articulation alaire, la fréquence de battement et l'amplitude du mouvement. De cet espace émergent deux formules explicites définissant la frontière de stabilité, centrées sur un mécanisme d'anti-résonance qui permet à l'animal de neutraliser passivement les oscillations de son corps malgré les perturbations aérodynamiques extérieures. Le résultat le plus contre-intuitif tient dans le constat que de nombreuses configurations de vol battu atteignent une stabilité passive, c'est-à-dire sans correction neuronale active, à condition d'être positionnées dans la bonne zone de l'espace morphologique. La littérature antérieure concluait au contraire que la quasi-totalité des insectes sont passivement instables et dépendent de circuits neuronaux rapides pour se maintenir en vol. L'explication de cette divergence est méthodologique : les études précédentes ne modélisaient que quelques espèces réelles, correspondant à autant de "points isolés" dans un espace de paramètres bien plus vaste. En élargissant cet espace, Cornell montre que ces espèces étudiées constituaient un échantillon non représentatif. Pour les roboticiens, l'implication est directe : il devient théoriquement possible de concevoir un drone à ailes battantes qui se stabilise par sa géométrie et sa fréquence de battement, sans recourir à des boucles de rétroaction complexes, une voie sur laquelle les systèmes embarqués actuels n'ont jamais pleinement abouti. Le problème du vol battu stable en robotique reste ouvert depuis plusieurs décennies. Les micro-drones à ailes battantes existants, comme le Harvard RoboBee ou les prototypes développés par TU Delft dans le cadre du projet DelFly, s'appuient massivement sur des contrôleurs actifs pour compenser leur instabilité intrinsèque, ce qui accroît la complexité embarquée et réduit l'autonomie. Le modèle de Cornell offre un chemin alternatif : identifier, par calcul, les combinaisons de fréquence et de morphologie qui placent un engin dans la zone d'anti-résonance stable, avant même la fabrication. L'équipe n'annonce pas de prototype, et le gap entre modèle computationnel et robot physique reste substantiel, notamment en raison des contraintes matériaux et d'actionnement. Néanmoins, la disponibilité de critères analytiques explicites, là où il n'existait auparavant que des simulations coûteuses espèce par espèce, constitue une base de conception réutilisable pour les laboratoires travaillant sur les MAV (micro aerial vehicles) à battement d'ailes.

RecherchePaper
1 source
Geekplus s'associe à Mindugar pour accélérer l'automatisation d'entrepôt en Amérique latine
5388Robotics & Automation News 

Geekplus s'associe à Mindugar pour accélérer l'automatisation d'entrepôt en Amérique latine

Geekplus, entreprise chinoise spécialisée dans la robotique d'entrepôt et l'un des plus grands fournisseurs mondiaux d'AMR (robots mobiles autonomes), a annoncé un partenariat stratégique avec Mindugar, intégrateur latino-américain de systèmes de stockage industriel et de rayonnages. L'accord, dont les termes financiers ne sont pas divulgués, vise à accélérer l'adoption de l'automatisation logistique au sein de la région Amérique latine. Mindugar apporte son réseau commercial et son expertise locale en infrastructure d'entrepôt, tandis que Geekplus fournit ses solutions robotiques, robots goods-to-person, systèmes de tri et convoyage autonome. Pour le marché latino-américain, cette alliance représente un signal clair : la convergence entre les fabricants de racks traditionnels et les éditeurs de solutions robotiques s'accélère, reproduisant un modèle déjà observé en Europe et au Moyen-Orient. Pour les intégrateurs et les décideurs logistiques de la région, cela signifie un accès simplifié à des solutions clés en main combinant infrastructure physique et automatisation. La LatAm reste un marché à fort potentiel mais sous-pénétré en robotique d'entrepôt, avec des contraintes propres, coûts d'importation, instabilité monétaire, main-d'oeuvre relativement bon marché, qui freinent jusqu'ici les déploiements à grande échelle. À noter : le communiqué s'apparente davantage à une annonce de partenariat canal qu'à la confirmation de déploiements opérationnels. Fondée en 2015 à Pékin, Geekplus revendique des milliers de robots déployés dans plus de 40 pays, avec une présence établie en Europe, aux États-Unis et au Moyen-Orient. L'entreprise concurrence directement Quicktron (Alibaba), Hai Robotics et, sur le segment haut de gamme, Exotec (France) dont la solution Skypod est également présente en logistique e-commerce. Le partenariat avec Mindugar s'inscrit dans une stratégie de distribution indirecte typique de la phase d'internationalisation de Geekplus, sans timeline de déploiement ni volume de projets annoncé à ce stade.

IndustrielActu
1 source
SF Express, Sequoia China et IDG investissent dans une licorne en robots humanoïdes issue de Tsinghua
5389Pandaily 

SF Express, Sequoia China et IDG investissent dans une licorne en robots humanoïdes issue de Tsinghua

Wujie Power (无界动力), spin-off de l'université Tsinghua spécialisé dans les robots humanoïdes à usage général, a bouclé un tour de financement impliquant des investisseurs chinois et internationaux de premier rang. Ce tour est co-dirigé par Envision Group et le Fonds d'investissement en intelligence artificielle de Pékin, avec la participation récurrente de Sequoia China, Linear Capital, Hillhouse Ventures, Baidu Ventures et Yunshan Capital. La société est par ailleurs sur le point de clôturer une tranche additionnelle dite "angel+++" auprès de capitaux américains et en renminbi, portant le financement total au stade angel à plus de 200 millions de dollars. Ce tour intervient dans la continuité d'un tour stratégique d'un milliard de yuans finalisé en mars 2026. Simultanément, StarTrace (星动纪元), autre constructeur d'humanoïdes issu du même écosystème d'investisseurs, a clôturé un tour dépassant également 200 millions de dollars. Le géant de la logistique SF Express figure parmi les nouveaux entrants, rejoignant le capital à l'intersection de la robotique et de l'automatisation de la chaîne d'approvisionnement. L'annonce ne précise ni la valorisation exacte ni les spécifications techniques du robot : pas de charge utile, de degrés de liberté ou de cadence opérationnelle communiqués. Ces levées consécutives confirment l'appétit persistant du capital-risque chinois pour l'IA incarnée (embodied AI), mais signalent surtout un mouvement stratégique côté industrie. La présence de SF Express au capital est un indicateur concret : un opérateur logistique de cette envergure n'engage pas plusieurs dizaines de millions sans anticiper un horizon d'intégration dans ses entrepôts ou centres de tri. Pour les décideurs B2B, cela suggère que la logistique reste le premier terrain de déploiement visé par les humanoïdes chinois en 2026-2027, avant le manufacturing. Les deux tours simultanés (Wujie Power + StarTrace) indiquent également une stratégie de portefeuille coordonnée, plutôt qu'une conviction isolée sur un seul acteur. Wujie Power s'inscrit dans la vague de spin-offs académiques issus de Tsinghua ces deux dernières années, aux côtés d'acteurs comme Unitree Robotics, Agibot et UBTECH, qui ont tous intensifié leurs levées et annonces produit en 2025-2026. Face à eux, les constructeurs occidentaux Figure AI, Agility Robotics (désormais dans l'orbite d'Amazon) et 1X Technologies avancent sur leurs propres déploiements, tandis qu'en Europe Enchanted Tools et Wandercraft restent à plus petite échelle de capitalisation. La course sino-américaine sur l'humanoïde s'accélère avec des capitaux publics et privés engagés des deux côtés. Les prochaines étapes probables pour Wujie Power sont la clôture de la tranche angel+++ et l'annonce de premiers pilotes industriels, possiblement en logistique avec SF Express en client-investisseur.

Chine/AsieOpinion
1 source
Genesis AI développe un cerveau robotique pour doter les robots polyvalents d'une dextérité comparable à celle de l'humain
5390Interesting Engineering 

Genesis AI développe un cerveau robotique pour doter les robots polyvalents d'une dextérité comparable à celle de l'humain

Genesis AI a dévoilé GENE-26.5, un modèle d'intelligence artificielle qualifié de "cerveau robotique" par l'entreprise, conçu pour doter les robots polyvalents d'une dextérité comparable à celle de l'être humain dans l'exécution de tâches physiques complexes. Le système repose sur une architecture VLA (vision-language-action) : il ingère des flux vidéo issus de caméras embarquées, interprète des instructions en langage naturel et génère directement des commandes motrices de bas niveau, sans pipeline modulaire intermédiaire. Selon Genesis AI, GENE-26.5 permet d'exécuter des séquences de manipulation multi-étapes (saisie, tri, assemblage, adaptation aux variations d'environnement) et fonctionnerait sur plusieurs types de plateformes matérielles sans être lié à une configuration d'actionneurs spécifique. L'entreprise n'a toutefois publié aucun benchmark indépendant ni aucune étude évaluée par les pairs : les performances annoncées reposent exclusivement sur des évaluations internes. La composition et le volume du dataset d'entraînement, probablement issu de sessions de télé-opération humaine et de simulations à grande échelle, n'ont pas été divulgués. L'enjeu de cette annonce dépasse le seul modèle. Le véritable goulot d'étranglement dans le développement des robots polyvalents n'est plus mécanique mais logiciel, et plus précisément la capacité des politiques de contrôle à transférer de la simulation au monde réel (le "sim-to-real gap"). Une architecture VLA end-to-end présente un avantage théorique : la perception et l'action étant couplées dans un même réseau de neurones, le robot peut ajuster sa trajectoire de préhension en temps réel sans attendre un module de planification séparé. Ce couplage comporte toutefois un risque structurel, les erreurs de perception se propageant directement aux commandes motrices sans point de contrôle intermédiaire. Si la généralisation inter-plateformes de GENE-26.5 était validée indépendamment, elle réduirait significativement les barrières à l'entrée pour les intégrateurs et les startups robotiques qui n'ont pas les ressources pour entraîner leurs propres modèles fondamentaux, déplaçant la différenciation concurrentielle vers la qualité matérielle et le fine-tuning applicatif. L'annonce intervient dans un contexte de compétition accélérée sur le marché des robots à usage général. Des acteurs américains comme Figure (Figure 03), Agility Robotics ou Apptronik, ainsi que les équipes Optimus de Tesla et les laboratoires de Physical Intelligence (Pi-0) ou de NVIDIA (GR00T N2), visent des volumes de production de l'ordre de 100 000 unités d'ici 2027. La dextérité manuelle reste l'un des problèmes les plus ouverts du domaine : la main humaine mobilise environ 27 os et plus de 30 muscles pour des gestes que les robots ne reproduisent encore qu'approximativement. Genesis AI n'a annoncé ni partenaire matériel, ni calendrier de déploiement commercial, ni conditions de licence pour GENE-26.5. L'affirmation d'une dextérité "au niveau humain" constitue une revendication forte que le secteur attendra de voir confirmer par des données de terrain réelles, hors conditions de démonstration contrôlées.

IA physiqueOpinion
1 source
Bosch Rexroth vs Festo vs SMC : Les leaders de l’automatisation et de la pneumatique
5391Robot Magazine FR 

Bosch Rexroth vs Festo vs SMC : Les leaders de l’automatisation et de la pneumatique

Bosch Rexroth, Festo et SMC Corporation constituent aujourd'hui le triptyque dominant de l'automatisation industrielle et de la pneumatique mondiale. Filiale du groupe Bosch, Rexroth propose une architecture d'automatisation systémique couvrant le motion control, l'hydraulique, les servo-entraînements, l'automatisation électrique, les logiciels industriels et les plateformes connectées orientées Industrie 4.0, un portefeuille conçu pour les infrastructures lourdes et les lignes de production hautement intégrées. L'allemand Festo, fondé à Stuttgart en 1925, s'est imposé comme la référence en pneumatique de précision, avec une forte culture R&D appliquée : l'entreprise est notamment connue pour ses démonstrateurs biomimétiques (bras assistés, robots souples) qui anticipent les prochaines générations de composants industriels, et pour ses solutions de formation technique utilisées dans plus de 170 pays. SMC Corporation, groupe japonais créé en 1959 et coté à Tokyo, est aujourd'hui le premier fournisseur mondial de pneumatique industrielle par volume, avec une présence commerciale dans plus de 80 pays et un catalogue de plus de 12 000 références de vérins, vannes et systèmes de contrôle de fluides. Ces trois acteurs opèrent sur un marché où la distinction entre composant et solution devient le principal levier de différenciation. Pour un intégrateur ou un directeur industriel, le choix ne se résume plus à un catalogue de références : il engage une architecture complète. Bosch Rexroth cible les environnements où la convergence entre motion, hydraulique et données est critique, lignes automotive, presses, machines-outils CNC. Festo se positionne sur les applications nécessitant précision et flexibilité : assemblage, agroalimentaire, laboratoires, chaînes reconfigurables, avec un avantage compétitif sur l'efficacité énergétique des actionneurs pneumatiques. SMC répond à une logique de volume et de standardisation : délais courts, disponibilité mondiale, coût à l'unité optimisé. La vraie question pour un décideur B2B n'est pas laquelle est "meilleure", mais laquelle correspond au profil de son process : complexité intégrée (Rexroth), précision applicative (Festo), ou déploiement standardisé à grande échelle (SMC). Ces trois entreprises ont construit leur position sur plusieurs décennies, dans un marché longtemps fragmenté entre spécialistes régionaux. L'accélération de l'Industrie 4.0 et la montée des cobots et robots mobiles autonomes (AMR) ont rebattu les cartes : les pneumaticiens purs comme Festo et SMC investissent désormais dans les interfaces électriques et les protocoles connectés (IO-Link, OPC UA), tandis que Bosch Rexroth étend ses logiciels vers l'edge computing industriel. Les challengers européens, Parker Hannifin, Aventics (ex-Bosch pneumatique, désormais Emerson), ou encore Norgren, grignotent des parts sur des segments spécifiques. À noter : des acteurs français comme Joucomatic (groupe Asco/Emerson) ou Pneumax restent présents sur le marché européen, sans atteindre l'échelle mondiale de ce trio. La prochaine bataille se joue sur l'intégration logicielle et la data industrielle, terrain sur lequel Bosch Rexroth dispose aujourd'hui d'une longueur d'avance structurelle.

FR/EU ecosystemeOpinion
1 source
Gaze4HRI : benchmark zero-shot des réseaux de neurones pour l'estimation du regard en interaction humain-robot
5392arXiv cs.RO 

Gaze4HRI : benchmark zero-shot des réseaux de neurones pour l'estimation du regard en interaction humain-robot

Une équipe de chercheurs a publié en mai 2026 Gaze4HRI (arXiv:2605.04770), un benchmark à grande échelle conçu pour évaluer les réseaux de neurones d'estimation du regard dans les conditions réelles de l'interaction humain-robot (HRI). Le jeu de données regroupe plus de 50 sujets, 3 000 vidéos et 600 000 images annotées, couvrant quatre variables critiques identifiées comme sous-représentées dans les évaluations existantes : les variations d'éclairage, les conflits entre direction de la tête et direction du regard, la mobilité de la caméra embarquée sur le robot, et le déplacement de la cible visuelle. L'approche retenue est celle de l'estimation 3D du regard dite "zero-shot" : les modèles apprennent à projeter directement une image RGB en vecteur de regard, sans calibration individuelle, ce qui réduit considérablement les coûts de déploiement en contexte opérationnel. Les résultats du benchmark remettent en question plusieurs hypothèses dominantes dans la littérature. Chacune des méthodes évaluées échoue sur au moins une condition testée, et le regard fortement orienté vers le bas ("steeply-downward gaze") constitue un point d'échec universel pour l'ensemble des architectures, y compris les modèles spatio-temporels complexes et les approches basées sur des Transformers. Ces architectures récentes, pourtant très citées, n'affichent pas de supériorité systématique en conditions non contrôlées. Seul PureGaze, entraîné sur le dataset ETH-X-Gaze, maintient une robustesse satisfaisante sur l'ensemble des autres conditions. La conclusion centrale est que la diversité des données d'entraînement constitue le premier levier de robustesse zero-shot, devant la complexité architecturale, tandis que des mécanismes comme la self-adversarial loss de PureGaze pour la purification des features de regard apportent un gain additionnel significatif. L'estimation du regard est une compétence fondamentale pour les robots sociaux et collaboratifs : elle conditionne la détection d'attention, la coordination tour-par-tour, et la sécurité en environnement partagé. Les benchmarks existants souffrent d'un "complexity gap" structurel, les méthodes étant entraînées sur des corpus variés mais évaluées sur des ensembles beaucoup plus petits et homogènes, ce qui surestime leur robustesse réelle. Gaze4HRI vise à corriger ce biais. Sur le plan concurrentiel, le dataset ETH-X-Gaze (ETH Zurich) s'impose ici comme la référence en termes de diversité, tandis que des benchmarks HRI spécialisés comme GAZE360 ou MPIIFaceGaze ne capturent pas les conditions de mouvement propres aux plateformes robotiques. Le dataset et le code sont disponibles publiquement sur gazeforhri.github.io, ce qui devrait faciliter l'adoption par les équipes travaillant sur des robots humanoïdes ou des AMR équipés de systèmes de perception sociale.

RecherchePaper
1 source
ConsisVLA-4D : vers une meilleure cohérence spatiotemporelle pour la manipulation robotique avec un modèle VLA
5393arXiv cs.RO 

ConsisVLA-4D : vers une meilleure cohérence spatiotemporelle pour la manipulation robotique avec un modèle VLA

Une équipe de recherche publie ce 7 mai 2026 ConsisVLA-4D (arXiv:2605.05126), un framework unifié pour la manipulation robotique qui cherche à résoudre deux angles morts structurels des modèles Vision-Language-Action actuels : la perception spatiale 3D et le raisonnement temporel 4D. L'architecture repose sur trois modules complémentaires. Le premier, CV-Aligner, filtre les régions pertinentes à l'instruction en cours et aligne les identités d'objets entre plusieurs points de vue, assurant une cohérence sémantique inter-caméras. Le second, CO-Fuser, élimine les ambiguïtés de relations spatiales entre objets via des représentations latentes compactes, sans recourir à des capteurs de profondeur dédiés. Le troisième, CS-Thinker, combine les tokens sémantiques de CV-Aligner et les tokens géométriques de CO-Fuser pour construire une représentation implicite des dynamiques locales et globales de la scène, permettant un raisonnement visuel continu au fil de l'exécution. Les auteurs rapportent des gains de 21,6 % sur le benchmark LIBERO et de 41,5 % en environnement réel par rapport à OpenVLA, avec des accélérations d'inférence respectives de 2,3x et 2,4x. Le code est publié en open source. Ces résultats sont significatifs pour le débat, toujours ouvert dans le secteur, sur la capacité des VLA à passer de la démonstration contrôlée au déploiement réel. Le gain le plus notable est celui en conditions réelles (+41,5 % vs +21,6 % en simulation), ce qui suggère que la cohérence spatiotemporelle adresse précisément le sim-to-real gap que d'autres architectures peinent à combler. L'absence de capteur de profondeur dédié est également un point concret pour les intégrateurs industriels : réduire la dépendance à des capteurs supplémentaires diminue le coût de déploiement et la surface de défaillance. L'accélération d'inférence de 2,3x à 2,4x, si elle se confirme dans des cycles de manipulation industriels (pick-and-place, assemblage), est un argument directement actionnable pour des COO cherchant à calibrer le throughput de cellules robotisées. Il convient toutefois de noter que les métriques sont mesurées contre OpenVLA, qui reste une baseline académique, et non contre des systèmes commerciaux comme pi-0 (Physical Intelligence) ou Helix (Figure), ce qui limite la portée comparative. Les modèles VLA de première génération, dont OpenVLA et RT-2, se sont construits sur des pipelines essentiellement 2D, héritant des architectures vision-langage conçues pour la compréhension d'images statiques. La contrainte de cohérence spatiotemporelle que ConsisVLA-4D formalise est un problème que l'ensemble des acteurs du secteur, Physical Intelligence avec pi-0, DeepMind avec RT-X, et Boston Dynamics sur le plan applicatif, tentent de résoudre par des voies différentes (données de préentraînement massives, retour haptique, diffusion de politiques). Dans le paysage français et européen, des entreprises comme Enchanted Tools et Wandercraft travaillent sur des problématiques adjacentes de contrôle robuste en environnement non structuré, où la perception multi-vue est également un verrou. La prochaine étape logique pour ConsisVLA-4D sera de confronter le framework à des tâches longue-horizon et à des environnements non rigides, deux cas d'usage encore peu couverts par le benchmark LIBERO.

IA physiqueOpinion
1 source
Des pixels aux tokens : étude systématique de la supervision par actions latentes pour les modèles vision-langage-action (VLA)
5394arXiv cs.RO 

Des pixels aux tokens : étude systématique de la supervision par actions latentes pour les modèles vision-langage-action (VLA)

Des chercheurs de l'Université Renmin de Chine (RUC) ont publié le 7 mai 2026 une étude systématique sur la supervision par actions latentes dans les modèles VLA (Vision-Language-Action), une architecture clé pour les robots capables de comprendre des instructions en langage naturel et d'agir dans le monde physique. L'article, référencé arXiv:2605.04678, pose une question concrète : comment entraîner efficacement un VLA sur des datasets hétérogènes, issus de robots différents avec des espaces d'action incompatibles ? La réponse explorée est l'action latente, une représentation intermédiaire abstraite qui sert de pivot commun entre perception visuelle, langage et commande motrice. Les auteurs comparent quatre stratégies d'intégration sous une baseline VLA unifiée, en distinguant deux familles : les actions latentes basées sur l'image (qui encodent les transitions visuelles entre frames) et celles basées sur l'action (qui compressent directement les commandes moteurs dans un espace latent). Les résultats révèlent une correspondance formulation-tâche claire, ce qui est utile pour tout intégrateur qui choisit une architecture : les actions latentes image-based sont plus efficaces sur les tâches longues nécessitant un raisonnement multi-étapes et une généralisation au niveau de la scène, tandis que les actions latentes action-based surperforment sur la coordination motrice fine et complexe. La découverte la plus opérationnelle est que superviser directement le modèle de langage vision (VLM) avec des tokens discrets d'actions latentes donne les meilleures performances globales, devançant les approches de supervision continue ou indirecte. L'étude apporte également des premières preuves que la supervision par actions latentes améliore l'entraînement en données mixtes (multi-robot, multi-tâche), un verrou majeur pour passer du lab au déploiement à grande échelle. Ce travail s'inscrit dans une course effrénée à la généralisation des VLA, après les succès récents de Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA), qui ont tous démontré des capacités cross-embodiment limitées mais prometteuses. La contribution de RUC est moins un nouveau modèle qu'un benchmark de design choices, un type de contribution rare et précieux dans un domaine encore dominé par les démonstrations spectaculaires. La prochaine étape naturelle serait de valider ces résultats sur du matériel réel au-delà des benchmarks simulés, notamment sur des plateformes comme ALOHA 2 ou des manipulateurs industriels, pour confirmer que le gap sim-to-real ne neutralise pas les gains observés en simulation. Le code est disponible sur GitHub (RUCKBReasoning/FromPixelsto_Tokens).

RechercheOpinion
1 source
Quand la vie vous donne du BC, créez des fonctions Q pour l'apprentissage par renforcement sur robot
5395arXiv cs.RO 

Quand la vie vous donne du BC, créez des fonctions Q pour l'apprentissage par renforcement sur robot

Des chercheurs du RAI Institute publient sur arXiv (2605.05172, mai 2026) Q2RL, un algorithme d'apprentissage offline-to-online conçu pour améliorer automatiquement des politiques de contrôle robotique après une phase d'imitation. La méthode repose sur deux composants distincts : Q-Estimation, qui extrait une Q-function à partir d'une politique de Behavior Cloning (BC) en quelques étapes d'interaction avec l'environnement, et Q-Gating, qui alterne dynamiquement entre les actions BC et les actions RL en comparant leurs Q-values respectives pour guider la collecte de données d'entraînement. Sur les benchmarks standards D4RL et robomimic, Q2RL surpasse les meilleures baselines offline-to-online existantes en taux de succès et en vitesse de convergence. Appliqué directement sur robot réel, il apprend des politiques robustes pour des tâches de manipulation à contact riche et haute précision, assemblage de tuyaux et kitting industriel, en 1 à 2 heures d'interaction, avec des taux de succès atteignant 100 % et un gain jusqu'à 3,75x par rapport à la politique BC initiale. L'enjeu pratique est significatif : le BC reste la méthode dominante pour apprendre à partir de démonstrations humaines, notamment dans les architectures VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence, mais il souffre d'une limite structurelle, il ne s'améliore pas seul une fois déployé. Les approches offline-to-online existantes se heurtent à un problème de distribution mismatch : en passant à l'apprentissage en ligne, le RL tend à écraser les bonnes actions apprises hors ligne. Q2RL adresse ce problème directement via le Q-Gating, qui agit comme un filtre de qualité empêchant la dégradation de la politique. Un délai de convergence de 1 à 2 heures sur robot physique est une performance notable pour des tâches à contact, où la variabilité mécanique rend le sim-to-real particulièrement difficile. Le contexte est celui d'une course intense à l'autonomie post-démonstration. Physical Intelligence (Pi-0), Figure AI, Apptronik et d'autres misent massivement sur le fine-tuning en ligne pour réduire le gap démo-to-deployment. Q2RL s'inscrit dans cette dynamique mais en ciblant l'efficacité computationnelle : l'algorithme est conçu pour tourner sans infrastructure cloud lourde, directement sur le contrôleur embarqué. Le RAI Institute, relativement discret sur la scène robotique, positionne ici une contribution technique solide sur un verrou bien identifié. Le code et les vidéos sont disponibles publiquement, ce qui facilite la reproductibilité et l'éventuelle intégration dans des pipelines industriels existants.

IA physiquePaper
1 source
Apprendre à sentir le futur : DreamTacVLA pour la manipulation riche en contacts
5396arXiv cs.RO 

Apprendre à sentir le futur : DreamTacVLA pour la manipulation riche en contacts

Des chercheurs ont publié DreamTacVLA, un framework qui dote les modèles Vision-Language-Action (VLA) d'un sens du toucher anticipatif. Ces architectures, parmi lesquelles Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, généralisent des comportements robotiques à partir de connaissances web-scale, mais restent aveugles à la physique du contact : force, texture et glissement. DreamTacVLA introduit une perception hiérarchique à trois niveaux : images tactiles haute résolution (micro-vision), caméra poignet (vision locale) et vue tierce (macro-vision), le tout aligné par une perte baptisée Hierarchical Spatial Alignment (HSA). Le système est ensuite affiné par un modèle de monde tactile prédisant des états de contact futurs, ce qui lui permet de conditionner ses décisions à la fois sur des observations réelles et sur des conséquences anticipées ; sur des benchmarks de manipulation contact-riche (vissage, pelage, textiles), il atteint jusqu'à 95 % de succès face aux baselines VLA état de l'art, appuyé par un dataset hybride combinant simulation haute-fidélité (digital twin) et expériences en monde réel. Ce résultat quantifie concrètement le "gap tactile" des VLA modernes : intégrer des signaux de contact haute résolution est discriminant pour des tâches industrielles entières, de l'assemblage de précision au conditionnement de composants déformables. Conditionner les décisions sur des conséquences tactiles anticipées, et non seulement sur des observations en temps réel, rapproche les VLA du raisonnement physique implicite des opérateurs expérimentés. Pour les intégrateurs B2B, cela laisse entrevoir une prochaine génération de politiques robotiques capables de manipulation fine sans capteurs de force-couple coûteux, à condition d'embarquer des capteurs tactiles conformes haute résolution. La démonstration reste cependant purement académique : aucun déploiement industriel ni partenariat de production n'est annoncé dans le papier. Le travail s'inscrit dans un mouvement d'enrichissement des VLA au-delà du seul canal vision-langage, aux côtés d'approches intégrant proprioception, retour de force ou audio. DreamTacVLA se distingue par l'application au domaine tactile de techniques issues des modèles de monde visuels (Dreamer, RSSM), une transposition méthodologiquement originale. L'article est à sa troisième révision arXiv (v3), signe d'une évaluation par les pairs active. Parmi les acteurs à surveiller : Sanctuary AI et Agility Robotics sur les politiques de manipulation, GelSight et Contactile sur les capteurs tactiles, et en Europe, Pollen Robotics qui explore des effecteurs sensoriellement enrichis.

IA physiqueOpinion
1 source
Évolution supervisée des capacités des agents incarnés : mise à niveau sûre, vérification de compatibilité et retour arrière en temps réel
5397arXiv cs.RO 

Évolution supervisée des capacités des agents incarnés : mise à niveau sûre, vérification de compatibilité et retour arrière en temps réel

Une équipe de chercheurs a formalisé dans un preprint arXiv (réf. 2604.08059) un cadre de mise à jour sécurisée pour les modules de capacités d'agents embarqués. Le problème est concret: lorsqu'un robot améliore ses capacités via des mises à jour de modules logiciels, comment garantir que ces déploiements ne violent pas les contraintes de sécurité, les hypothèses d'exécution ou les mécanismes de récupération? Le framework introduit quatre vérifications de compatibilité (interface, politique, comportementale, récupération) organisées en pipeline séquentiel: validation du candidat, évaluation sandbox, déploiement shadow, activation contrôlée, monitoring en ligne et rollback. Sur 6 cycles de mise à jour avec 15 graines aléatoires, une mise à jour naïve atteint 72,9% de succès sur les tâches mais génère 60% d'activations non sécurisées au dernier cycle; le framework gouverné maintient 67,4% de succès avec zéro activation non sécurisée sur l'ensemble des cycles (test de Wilcoxon, p=0,003). Le shadow deployment détecte 40% des régressions invisibles à la sandbox seule, et le rollback réussit dans 79,8% des scénarios de dérive post-activation. Pour les intégrateurs de systèmes robotiques et les décideurs B2B, ce résultat répond à une question stratégique: peut-on industrialiser la mise à jour continue d'un robot en production sans requalification complète du système? La démonstration montre que c'est faisable, la perte de performance étant limitée à 5,5 points de taux de succès en échange d'une garantie de sécurité absolue. La découverte clé porte sur le shadow deployment: 40% des régressions n'apparaissent pas en environnement sandbox, invalidant les workflows de qualification qui s'y arrêtent. Cela pose les bases d'un CI/CD robotique viable, à condition d'inclure une étape shadow en environnement réel. Les travaux antérieurs avaient étudié séparément le packaging modulaire, l'évolution des capacités et la gouvernance à l'exécution, sans les assembler en pipeline cohérent. Cette publication formalise la "governed capability evolution" comme problème de systèmes de premier ordre, directement pertinent pour les architectures à base de VLA (Vision-Language-Action models) qui évoluent rapidement sur des plateformes comme Figure 03, Optimus Gen 3 ou GR00T N2. L'article reste un travail de recherche évalué en simulation, sans déploiement commercial cité; les prochaines étapes attendues sont une validation sur plateformes physiques réelles et une intégration dans des pipelines MLOps robotiques.

RecherchePaper
1 source
De la saisie à l'insertion : assemblage de précision assisté par retour tactile sous tolérances inférieures au millimètre
5398arXiv cs.RO 

De la saisie à l'insertion : assemblage de précision assisté par retour tactile sous tolérances inférieures au millimètre

Une équipe de chercheurs a publié en mai 2026 sur arXiv (2605.04649) une méthode en deux étapes pour l'assemblage robotique sous tolérances sub-millimétriques, combinant apprentissage par imitation (IL) et apprentissage par renforcement (RL) augmentés par retour tactile. Le premier module IL apprend l'approche et la saisie du peg, tandis qu'un second module RL se charge de l'insertion proprement dite, incluant la récupération sur contact. Deux contributions techniques encadrent le système : le "tactile group sampling", qui augmente la couverture des segments de contact critiques en entraînement, et un "tactile critic" pour une meilleure évaluation des politiques. Testée sur cinq géométries de trous et trois niveaux de jeu, la méthode atteint un taux de réussite de 67 % sous le jeu le plus sévère (0,05 mm), tout en réduisant la force de contact maximale de 60 % et le couple de 44 % par rapport aux approches de référence. L'assemblage sous tolérances inférieures à 0,1 mm est l'un des goulots d'étranglement persistants de la robotique industrielle : une erreur de pose de quelques centièmes suffit à provoquer un coincement (jamming) ou la destruction d'une pièce à haute valeur. Que ce travail maintienne des forces basses tout en conservant un taux de succès substantiel répond directement aux critères des équipementiers électroniques, médicaux et de la mécanique fine. L'approche confirme surtout que les capteurs tactiles, longtemps relégués derrière la vision, peuvent combler le sim-to-real gap dans les tâches contact-riches, là où la caméra manque de résolution locale, un argument de poids pour les intégrateurs qui dimensionnent leurs cellules. Ce travail s'inscrit dans la lignée des recherches peg-in-hole initiées par les labos MIT et Stanford, mais l'accent sur la sécurité des forces le distingue des approches orientées performance brute. Sur le marché, les fabricants de bras collaboratifs (Universal Robots, FANUC, ABB) et les spécialistes du capteur tactile (Contactile, Xela Robotics, Touchlab) seront attentifs à la reproductibilité sur hardware réel. Le preprint reste au stade de la preuve de concept en laboratoire, sans pilote industriel annoncé ; les prolongements logiques incluent des géométries asymétriques, des matériaux déformables et une validation temps-réel embarquée pour tenir les cadences de production.

RecherchePaper
1 source
IA incarnée : un compromis nécessaire entre confidentialité et utilité
5399arXiv cs.RO 

IA incarnée : un compromis nécessaire entre confidentialité et utilité

Des chercheurs ont publié en mai 2026 sur arXiv (référence 2605.05017) un article de position soutenant que les systèmes d'IA incarnée (Embodied AI, EAI) entrent dans des environnements réels sensibles sans architecture conçue pour gérer la confidentialité de façon systémique. Le problème identifié est structurel : les solutions EAI actuelles optimisent leurs composantes isolément, en quatre étapes distinctes (instruction, perception, planification, interaction), sans prendre en compte leurs interactions en matière de vie privée dans des déploiements haute fréquence où les fuites de données sont souvent irréversibles. Les auteurs proposent SPINE (Secure Privacy Integration in Next-generation Embodied AI), un cadre unifié qui traite la confidentialité comme un signal de contrôle dynamique traversant l'ensemble du cycle de vie du système, et non comme une fonction locale à chaque étape. SPINE intègre une matrice de classification de sensibilité contextuelle multi-critères et a été conceptuellement validé par des études de cas préliminaires en simulation et en conditions réelles. L'enjeu central est architectural : en optimisant chaque étape indépendamment, les concepteurs créent une crise systémique de confidentialité dès le déploiement en environnement sensible. Un robot qui planifie ses déplacements, perçoit son environnement visuel et suit des instructions vocales génère un flux continu de données croisées : plans de logement, routines quotidiennes, visages, conversations. SPINE démontre que des correctifs locaux restent insuffisants face à ce couplage inter-étapes. Pour les intégrateurs et décideurs B2B en secteurs réglementés (santé à domicile, garde d'enfants, industrie), ce cadre propose une grille d'analyse systémique à intégrer en amont de tout déploiement, avant que les fuites ne deviennent impossibles à contenir. Ce travail s'inscrit dans un contexte de multiplication rapide des robots humanoïdes destinés à des environnements non industriels, avec des acteurs comme Figure, 1X Technologies et Boston Dynamics côté américain, et en Europe des entreprises comme Enchanted Tools ou Wandercraft qui positionnent leurs systèmes vers des espaces partagés. Le RGPD impose déjà des obligations strictes sur la collecte de données biométriques et comportementales, mais aucun standard sectoriel spécifique aux EAI n'existe encore. Les auteurs publient leur code sur GitHub (rminshen03/EAIPrivacy\Position) et formulent une invitation explicite à structurer un agenda de recherche autour de systèmes EAI sécurisés et fonctionnels, dont une prochaine étape naturelle serait l'intégration de SPINE dans des pipelines VLA (Vision-Language-Action) existants pour mesurer le coût réel en performance de ces contraintes de confidentialité.

RechercheOpinion
1 source
Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne
5400arXiv cs.RO 

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne

Des chercheurs ont publié sur arXiv (arXiv:2510.18518v2) un algorithme d'apprentissage par renforcement basé sur un modèle (MBRL) conçu pour contrôler des systèmes robotiques complexes directement dans le monde réel, sans passer par une phase de simulation intensive. L'approche construit un modèle de dynamique à partir des données d'interaction en temps réel, puis effectue des mises à jour de politique guidées par ce modèle appris. Les validations expérimentales ont été conduites sur deux plateformes distinctes : un bras d'excavatrice hydraulique et un bras robot souple. Dans les deux cas, l'algorithme atteint des performances comparables aux méthodes model-free en quelques heures d'entraînement, là où ces dernières réclament habituellement des millions d'interactions simulées. La robustesse de l'adaptation a également été évaluée sous conditions de charge utile (payload) aléatoire, avec des résultats stables malgré le changement de dynamique. L'enjeu principal est la réduction de ce que le secteur appelle le "sim-to-real gap" : l'écart entre les politiques apprises en simulation et leur comportement réel une fois déployées sur du matériel. Les pipelines dominants, adoptés aussi bien par des labos académiques que par des industriels comme Boston Dynamics ou Figure AI, reposent sur des millions de rollouts en simulation avant tout contact avec un robot physique, ce qui introduit un biais systématique difficile à corriger. Cet algorithme court-circuite cette étape en apprenant directement sur données réelles, avec une garantie formelle de progression : les auteurs démontrent des bornes de regret sous-linéaires (sublinear regret bounds) sous hypothèses d'optimisation stochastique en ligne, ce qui est rare dans la littérature MBRL appliquée à la robotique physique. Pour un intégrateur ou un industriel, cela se traduit par une réduction potentielle du temps de mise en service sur des tâches à dynamique variable (variation de charge, usure mécanique, changement de matériau). Ce travail s'inscrit dans un débat structurant du champ : model-based vs model-free RL pour la robotique physique. Les méthodes model-free comme PPO ou SAC dominent les benchmarks simulés mais peinent à s'adapter efficacement en production réelle. Des approches hybrides comme MBPO ou DreamerV3 ont tenté de combler cet écart, mais rarement validées sur des systèmes aussi hétérogènes qu'un bras hydraulique industriel et un manipulateur souple. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou des AMR (autonomous mobile robots) à haute dimension, où les enjeux de sample efficiency sont directement liés aux coûts d'exploitation et à la durée de vie des actionneurs.

RecherchePaper
1 source