Aller au contenu principal

Dossier Physical Intelligence — π0 — page 20

1395 articles · page 20 sur 28

Physical Intelligence et la famille π0 : modèles fondation cross-embodiment, transfert de compétences entre robots, levées Lux Capital et OpenAI Startup Fund.

Diffusion de politique multimodale asynchrone via fusion de guidage sensible à la latence
951arXiv cs.RO RecherchePaper

Diffusion de politique multimodale asynchrone via fusion de guidage sensible à la latence

Des chercheurs ont publié le 24 juillet un article arXiv (2607.17257v1) présentant LAG-Fusion, un framework de fusion multimodale pour les politiques de diffusion utilisées en apprentissage par imitation robotique. Le problème visé : les architectures multimodales actuelles combinent vision, force et autres capteurs via une fusion synchrone ou des architectures multi-fréquences conçues manuellement, ce qui ralentit le retour haute fréquence ou limite l'ajout de nouvelles modalités. LAG-Fusion permet à chaque politique spécifique à une modalité de tourner à sa propre cadence d'inférence et d'injecter sa guidance de débruitage dès qu'elle est disponible, sans attendre les autres flux. L'innovation technique centrale est une règle de recalage du référentiel pour les variables de diffusion exprimées en représentations d'action relatives, ce qui permet d'aligner une guidance arrivée en retard avant de la fusionner avec le reste. Les chercheurs ont testé l'approche sur une tâche de manipulation à contact riche, en combinant une politique vision basse fréquence avec une politique force haute fréquence. Sous des latences hétérogènes entre modalités, LAG-Fusion améliore la réactivité de la politique et la performance de la tâche par rapport à une fusion synchrone classique et à des bases de référence spécifiquement conçues pour intégrer la force. Pour l'industrie robotique, ce travail touche un point de friction bien réel dans le déploiement de politiques génératives type diffusion ou VLA sur des bras manipulateurs : dès qu'on ajoute un capteur de force ou tactile pour des tâches d'assemblage ou d'insertion, la cadence de la caméra (souvent 10 à 30 Hz) et celle du capteur de force (potentiellement 100 Hz et plus) imposent des compromis douloureux, soit en bridant le capteur rapide au rythme du plus lent, soit en construisant une architecture ad hoc peu réutilisable. Une méthode générique qui laisse chaque modalité tourner à sa vitesse native, sans repenser l'architecture à chaque nouvelle combinaison de capteurs, s'attaque directement à un frein à l'extensibilité que rencontrent les intégrateurs travaillant sur la manipulation fine (assemblage électronique, insertion de connecteurs, tri fragile). Cela reste toutefois un résultat validé sur une seule paire de modalités et une tâche contrôlée en laboratoire, loin d'une brique prête à industrialiser. Les politiques de diffusion se sont imposées ces deux dernières années comme l'une des approches dominantes de l'apprentissage par imitation en robotique, aux côtés de modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui fusionnent eux aussi plusieurs signaux capteurs mais généralement à une cadence unique et synchronisée. La fusion asynchrone multi-fréquence reste peu explorée dans la littérature, la plupart des travaux traitant chaque capteur additionnel comme un module séparé nécessitant un réglage manuel. Le résumé ne précise ni publication de code ou de poids, ni application industrielle prévue à court terme ; l'article, encore non révisé par les pairs, ouvre surtout une piste pour de futurs travaux combinant tactile, force et vision sur des tâches à contact riche, un axe stratégique pour les humanoïdes et bras collaboratifs visant l'assemblage fin.

1 source
Les fabricants chinois de robots déplorent : « Il nous faudrait un meilleur cerveau, et plus de données »
952SCMP Tech 

Les fabricants chinois de robots déplorent : « Il nous faudrait un meilleur cerveau, et plus de données »

Lors de la World Artificial Intelligence Conference (WAIC), qui s'est achevée lundi à Shanghai, plusieurs représentants du secteur chinois de la robotique ont dressé un constat commun : leurs entreprises manquent à la fois de données suffisantes et d'un "cerveau" IA suffisamment performant pour que leurs machines interagissent correctement avec le monde physique. Wang Xiaogang, cofondateur de SenseTime et président de sa division robotique, a résumé le défi central de l'industrie de l'IA incarnée (embodied AI) comme la nécessité de "relier matériel, données, modèles et scénarios réels dans un système itératif en boucle fermée". Ce diagnostic, partagé par plusieurs intervenants du salon, souligne un goulot d'étranglement technique plutôt qu'un simple retard industriel. Cet aveu est significatif car il vient contredire le discours dominant sur l'avance chinoise en robotique humanoïde, portée par des volumes de production et des annonces de déploiement impressionnants. Il révèle que la couche logicielle, les modèles de type VLA (vision-language-action) capables de généraliser à partir de données réelles, reste le principal verrou, un problème que rencontrent aussi les acteurs américains comme Figure ou Physical Intelligence. Pour les intégrateurs et décideurs B2B, ce constat invite à distinguer les capacités matérielles, souvent matures chez les fabricants chinois, de l'intelligence embarquée réelle, encore largement en phase de recherche. Le WAIC, principal rendez-vous chinois sur l'IA, sert traditionnellement de baromètre des priorités stratégiques de Pékin, qui pousse fortement le secteur de la robotique incarnée comme relais de croissance industrielle. La reconnaissance publique de ce manque de données et de modèles fiables laisse présager de nouveaux investissements chinois dans la collecte de données réelles et les architectures de type "world model", pour combler l'écart avec les meilleurs systèmes de contrôle actuels.

Chine/AsieOpinion
1 source
RADAR : génération de données robotiques en boucle fermée par planification sémantique et réinitialisation causale autonome de l'environnement
953arXiv cs.RO 

RADAR : génération de données robotiques en boucle fermée par planification sémantique et réinitialisation causale autonome de l'environnement

Wandercraft, Exotec, Pollen ou Enchanted Tools ne figurent pas dans cet article, c'est un papier de recherche académique, pas une actualité produit. Voici la traduction-synthèse. Des chercheurs présentent RADAR (Robust Autonomous Data Acquisition for Robotics), un moteur de génération de données robotiques entièrement autonome qui élimine toute intervention humaine du cycle de collecte. Le système s'appuie sur seulement 2 à 5 démonstrations humaines en 3D comme a priori géométriques, puis enchaîne un pipeline en quatre modules : un modèle vision-langage (VLM) génère des tâches pertinentes par ancrage sémantique d'objets et récupération de compétences, un réseau de neurones sur graphes (GNN) traduit ces sous-tâches en actions physiques via de l'apprentissage par imitation en contexte, le VLM évalue ensuite automatiquement la réussite via un pipeline de question-réponse visuelle structuré, et enfin une machine à états finis orchestre la remise à zéro autonome de l'environnement grâce à une planification simultanée avant-arrière selon une séquence causale stricte de type LIFO (dernier entré, premier sorti). En simulation, RADAR atteint jusqu'à 90% de réussite sur des tâches complexes à long horizon, là où les méthodes de référence chutent près de zéro. En conditions réelles, le système exécute des compétences riches en contact comme la manipulation d'objets déformables, en adaptation few-shot et sans fine-tuning spécifique au domaine. L'intérêt pour l'industrie robotique tient au goulot d'étranglement que RADAR cible directement : la collecte de données physiques à grande échelle reste freinée par le coût et le manque de scalabilité des méthodes nécessitant un humain en boucle, notamment pour la remise en configuration manuelle de l'environnement entre chaque essai. En automatisant à la fois la génération de tâches, l'exécution, l'évaluation de succès et surtout la réinitialisation de l'espace de travail, RADAR promet de transformer la collecte en processus auto-suffisant, un argument central pour quiconque cherche à entraîner des politiques VLA (vision-language-action) à l'échelle sans multiplier les téléopérateurs humains. Les chiffres de simulation sont à prendre avec la prudence habituelle pour ce type de benchmark, mais la démonstration en réel sur des tâches de manipulation d'objets déformables, sans fine-tuning dédié, est le signal le plus concret de transférabilité. Ce travail s'inscrit dans la vague de recherche sur la génération de données synthétiques et semi-autonomes pour l'apprentissage robotique, en réaction directe aux limites des approches de téléopération massive utilisées par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2). L'article, disponible sur arXiv sous une version révisée (v2), ne précise pas de plateforme robotique commerciale ni de partenariat industriel : il s'agit d'une contribution méthodologique destinée à la communauté recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration dans des pipelines d'entraînement de politiques VLA plus larges.

RecherchePaper
1 source
Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots
954TechNode 

Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots

Xiaomi a dévoilé mercredi Xiaomi-Robotics-U0, un modèle de fondation multimodal autorégressif de 38 milliards de paramètres conçu pour l'IA incarnée (embodied AI). L'entreprise affirme que ce modèle unifie quatre capacités au sein d'un même framework : la génération de scènes pour robots, le transfert de comportements robotiques, la génération de vidéos d'interaction robot-environnement, et la génération et l'édition d'images à usage général. Concrètement, le système peut créer des environnements exploitables par des robots à partir de simples prompts textuels, adapter des trajectoires robotiques existantes à de nouvelles scènes tout en préservant le mouvement d'origine, produire des vidéos d'interaction à partir d'instructions de tâches, et exploiter des connaissances visuelles à l'échelle d'internet pour des applications d'IA incarnée. L'annonce a été rapportée par TechNode. Cette annonce s'inscrit dans une tendance de fond du secteur robotique : l'utilisation de modèles génératifs pour produire des données d'entraînement synthétiques et combler l'écart entre simulation et réalité, un problème central pour les acteurs du VLA (vision-language-action) comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. Si la promesse de générer des environnements et trajectoires synthétiques à la demande tient ses promesses, elle pourrait réduire le coût de collecte de données réelles, un goulot d'étranglement majeur pour l'entraînement des robots humanoïdes et bras manipulateurs. Toutefois, à ce stade, il s'agit d'une annonce de capacités techniques, sans démonstration publique détaillée ni benchmark comparatif, ni précision sur un déploiement matériel réel. Xiaomi investit depuis plusieurs années dans la robotique, avec son robot quadrupède CyberDog et des incursions dans les véhicules autonomes et l'IA embarquée. Ce modèle de 38 milliards de paramètres le positionne face aux laboratoires spécialisés en IA incarnée tels que Physical Intelligence, Figure AI ou Nvidia, ainsi que face aux géants chinois de la tech comme Baidu ou Alibaba, également actifs sur les modèles fondation pour la robotique. Aucune date de disponibilité, de partenariat industriel ou de déploiement pilote n'a été précisée à ce stade.

Chine/AsieActu
1 source
Contrôleur de politique de diffusion unique pour le poussage de blocs multi-tâches avec transfert simulation-réel sans apprentissage préalable
955arXiv cs.RO 

Contrôleur de politique de diffusion unique pour le poussage de blocs multi-tâches avec transfert simulation-réel sans apprentissage préalable

Voici l'article traduit et résumé : Des chercheurs présentent un contrôleur unique basé sur une politique de diffusion (diffusion policy), entraîné entièrement par apprentissage par renforcement plutôt que par clonage comportemental classique, pour piloter des tâches de poussée de blocs multi-formes en robotique manipulatrice. Contrairement aux approches habituelles qui nécessitent des démonstrations humaines préenregistrées, cette méthode combine une fonction de perte simplifiée (une borne inférieure de vraisemblance repondérée) avec une génération de curriculum inversé et des représentations centrées sur l'objectif pour surmonter la difficulté d'exploration dans un environnement de simulation à récompense éparse. Le système a été testé en transfert zéro-shot vers un dispositif réel de poussée de blocs, en faisant varier les positions cibles, les formes des blocs, leur poids et le frottement de la surface, sans réentraînement spécifique au monde réel. Cette publication s'inscrit dans un débat central du secteur robotique actuel : la capacité réelle des politiques apprises par simulation à franchir le fameux "sim-to-real gap" sans passer par des démonstrations coûteuses à collecter. Alors que des modèles VLA (vision-langage-action) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI misent sur d'immenses corpus de démonstrations téléopérées pour généraliser, cette approche RL-from-scratch propose une voie alternative potentiellement moins gourmande en données humaines annotées, mais elle reste circonscrite à une tâche géométriquement simple (pousser des blocs) et ne démontre pas encore de généralisation vers des manipulations plus complexes en préhension ou en dextérité fine. Pour les intégrateurs industriels, l'intérêt réside surtout dans la preuve de concept méthodologique plutôt que dans une application immédiate déployable. Le travail s'inscrit dans la lignée des politiques de diffusion popularisées en 2023-2024 pour le clonage comportemental (notamment par des équipes du MIT et de Columbia), ici détournées vers un cadre purement RL. Les auteurs ne précisent pas d'affiliation industrielle ni de partenaire de déploiement, ce qui situe ce travail du côté recherche académique plutôt que produit commercialisable. Aucun acteur français ou européen n'est mentionné dans cette publication. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur l'extension à des tâches de manipulation plus riches (préhension, insertion, assemblage) et sur la robustesse face à des perturbations environnementales plus sévères que celles testées ici.

RecherchePaper
1 source
Réponses de robots collaboratifs aux tâches humaines : correction sémantique et physique via modèles vision-langage
956arXiv cs.RO 

Réponses de robots collaboratifs aux tâches humaines : correction sémantique et physique via modèles vision-langage

Ce travail de recherche, publié en version révisée (v2) sur arXiv, s'attaque à un problème central de l'assemblage collaboratif homme-robot : comment un robot doit-il interpréter une instruction corrective ambiguë donnée par un humain, tout en produisant un mouvement physiquement exécutable. Les chercheurs proposent un framework de replanification qui traduit les instructions humaines en candidats "Action Target" (poses de préhension, choix d'outil), combinant deux mécanismes de vérification : un modèle de correction interne, qui valide la cohérence logique avant exécution, et un modèle de correction externe, qui vérifie visuellement le résultat après exécution. Le système intègre un modèle vision-langage (VLM) à de la génération de prise en 6 degrés de liberté et de la planification de trajectoire sans collision. Testé sur un robot humanoïde à buste (upper-body), il atteint 66,7% de réussite en fixation d'objet réelle, 100% en sélection initiale d'outil et 75% en sélection corrective d'outil. L'intérêt de l'étude tient surtout à ce qu'elle révèle sur les limites actuelles des VLM appliqués au contrôle robotique : ces modèles raisonnent bien sémantiquement mais choisissent parfois des cibles logiquement incohérentes ou mal évaluent si une action a réussi. Les ablations en simulation montrent un résultat contre-intuitif : la correction visuelle externe n'aide que lorsque le VLM sous-jacent a une latence faible, et peut au contraire dégrader la performance globale quand elle produit des faux négatifs. Pour les intégrateurs et équipes R&D qui misent sur les architectures VLA (à la manière de GR00T N2, Pi-0 ou Helix) pour piloter des humanoïdes en environnement collaboratif, ce papier illustre concrètement l'écart entre démonstration en simulation et fiabilité terrain, et pointe la vérification de l'état visuel comme le maillon encore faible. L'étude s'inscrit dans la vague de recherche académique cherchant à fiabiliser les architectures vision-langage-action pour la robotique physique, un axe où la plupart des annonces commerciales (Figure, Physical Intelligence, NVIDIA) restent centrées sur la démonstration plutôt que sur le déploiement industriel répété. Les auteurs ne précisent pas de laboratoire ni de suite commerciale ; il s'agit d'une contribution méthodologique destinée à alimenter les futurs travaux sur la replanification interactive et la correction des erreurs de perception dans les tâches collaboratives spatiales et sémantiques.

RecherchePaper
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
957arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur
958arXiv cs.RO 

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur

Des chercheurs présentent VLAFlow (Vision-Language-Action Flow), un framework unifié de flow-matching destiné à comparer objectivement les différents paradigmes d'entraînement des modèles vision-langage-action (VLA) en manipulation robotique. L'étude s'appuie sur OXEMix, un corpus hétérogène d'environ 5 000 heures de données combinant DROID, OpenX-Embodiment, OpenX-Augmented et RoboCOIN. Sous une architecture commune de type pi-0, avec le même backbone VLM, le même action expert et un espace d'action à 14 dimensions, les auteurs évaluent quatre approches strictement comparables : l'entraînement sur les seules actions (MindPI), le co-entraînement supervisé par le langage (MindLPI), l'alignement des représentations latentes futures (MindWPI), et leur combinaison (MindLWPI). Les tests sont menés sur trois bancs d'essai de référence : LIBERO, LIBERO-Plus et SimplerEnv. Pour les équipes qui entraînent des modèles VLA sur des données robotiques hétérogènes, l'apport principal n'est pas un nouveau produit mais une comparaison contrôlée rare dans un champ où architecture, données et protocole d'évaluation varient habituellement d'un papier à l'autre, rendant les résultats difficiles à départager. Les résultats montrent que l'entraînement action seule se dégrade quand les données proviennent de sources trop diverses, un signal utile pour qui envisage de simplement agréger des jeux de données multi-robots sans garde-fou. La supervision par le langage préserve la généralisation vision-langage, et l'alignement latent futur améliore la modélisation des transitions d'état et des relations action-résultat. La combinaison des deux signaux (MindLWPI) offre le transfert le plus stable sur l'ensemble des bancs d'essai, suggérant qu'un espace de méta-action combinant contraintes linguistiques et prédictives rend l'apprentissage par imitation plus robuste au passage à l'échelle. Ce travail s'inscrit dans la lignée des architectures pi-0 popularisées par Physical Intelligence, dans un paysage où Nvidia (GR00T N2), Figure (Helix) ou d'autres laboratoires développent également des modèles généralistes pour la manipulation robotique. Contrairement à des annonces produit, il s'agit ici d'une publication de recherche (preprint arXiv) centrée sur la méthodologie d'entraînement plutôt que sur un déploiement matériel. Les auteurs positionnent VLAFlow comme un socle reproductible pour de futures comparaisons de paradigmes, sans annoncer pour l'instant de calendrier de mise à disposition du code ou des poids du modèle.

RechercheActu
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
959arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »
960arXiv cs.RO 

« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »

Voici l'article traduit et résumé selon les consignes éditoriales : Une équipe de chercheurs en robot learning publie RoboTacDex, un jeu de données de manipulation dextre construit sur le robot humanoïde Unitree G1, accessible publiquement. L'ensemble comprend 6 000 trajectoires couvrant 19 tâches, 23 compétences distinctes et des interactions avec 22 objets différents. Chaque trajectoire embarque des flux RGB et de profondeur multi-vues, un retour tactile et des annotations sémantiques détaillées. Pour garantir la qualité de la collecte, les auteurs ont développé un système de synchronisation multi-caméras capable d'aligner les différentes modalités à la milliseconde près. Le jeu de données cible volontairement des tâches complexes, réalisables uniquement avec deux bras et des mains dextres, pour se rapprocher de la logique opérationnelle humaine. Trois modèles d'apprentissage par imitation ont été testés dessus, avec des résultats jugés positifs et une capacité de généralisation modérée sur l'ensemble des tâches. Le dataset sera open-source prochainement. L'enjeu dépasse la simple publication académique : l'apprentissage par imitation pour la manipulation bimanuelle dextre souffre d'un manque chronique de démonstrations diversifiées et multimodales, la plupart des jeux de données existants se limitant à la vision RGB seule. L'ajout systématique du tactile et d'une synchronisation précise entre capteurs comble un vide identifié par plusieurs laboratoires travaillant sur des modèles vision-langage-action (VLA). Pour les équipes qui entraînent ce type de modèles, disposer de données ouvertes et denses sur une plateforme humanoïde standardisée réduit la dépendance aux jeux de données propriétaires des grands acteurs américains. Le choix du Unitree G1, plateforme humanoïde relativement abordable et largement diffusée dans les laboratoires de recherche, s'inscrit dans une dynamique d'ouverture des données robotiques comparable à des initiatives comme Open X-Embodiment. Ce positionnement contraste avec les approches propriétaires de Physical Intelligence (Pi-0) ou NVIDIA (GR00T), qui restreignent l'accès à leurs corpus d'entraînement. La mise en open source, annoncée mais pas encore effective à la date de publication du prépublication arXiv, déterminera l'impact réel de RoboTacDex sur la communauté.

RecherchePaper
1 source
RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement
961arXiv cs.RO 

RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement

Une équipe de recherche a publié sur arXiv (référence 2606.25123) une architecture de contrôle hybride baptisée RGB, pour "RL Guided whole-body MPPI", destinée aux robots humanoïdes évoluant dans des environnements à contacts complexes. Le framework a été évalué en simulation MuJoCo sur un Unitree G1 à 29 degrés de liberté, avec une fréquence de contrôle moyenne de 280 Hz. Le principe : au lieu d'utiliser une politique d'apprentissage par renforcement (RL) comme contrôleur final, RGB l'emploie comme prior d'échantillonnage pour guider les rollouts d'un algorithme MPPI (Model Predictive Path Integral). Les objectifs de tâche sont définis via des termes de coût modulaires MPPI, qui corrigent en ligne la politique RL pour satisfaire ces objectifs sans nécessiter de réentraînement. Les tests montrent une réduction de la dérive systématique en marche rectiligne et une meilleure capacité à suivre des signaux de référence corps entier supplémentaires, comparé à une politique RL pure sous la même interface de commande. L'intérêt industriel de cette approche réside dans la rigidité structurelle des politiques RL actuelles : une fois entraînée, une politique couple fortement son comportement à l'objectif d'entraînement et à l'interface de commande. Ajouter un nouvel objectif de feedback (correction de trajectoire, contrainte de contact, suivi d'un membre spécifique) exige généralement un réentraînement complet, coûteux et long. RGB court-circuite cette contrainte en déléguant la précision et la modularité au MPPI, qui opère en boucle fermée à haute fréquence. Pour un intégrateur industriel ou un COO qui doit adapter un humanoïde à plusieurs lignes de production, la possibilité de spécifier de nouveaux comportements via des termes de coût, sans retouch au modèle RL sous-jacent, représente un gain de flexibilité concret. La fréquence de 280 Hz en simulation est encourageante, mais les auteurs ne démontrent pas encore le transfert sim-to-real, ce qui reste le saut critique pour toute validation industrielle. Le cadre MPPI est une technique de contrôle prédictif par échantillonnage bien établie en robotique mobile et manipulation, mais son couplage avec une politique RL comme prior pour les humanoïdes corps entier est une direction récente. Unitree, dont le G1 est devenu une plateforme de recherche courante grâce à son accessibilité commerciale (autour de 16 000 dollars), est au coeur de nombreux travaux académiques concurrents, notamment autour des architectures VLA (Vision-Language-Action) de type GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. RGB se positionne dans un créneau distinct : il ne vise pas la généralisation via des données de démonstration, mais l'optimisation en ligne de politiques existantes. La prochaine étape logique sera une validation sur hardware réel, déterminante pour établir si les 280 Hz de simulation se maintiennent face aux incertitudes mécaniques et aux latences capteurs d'un vrai G1.

RecherchePaper
1 source
Bibliothèques de politiques compactes par adaptation de rang faible en apprentissage par renforcement
962arXiv cs.RO 

Bibliothèques de politiques compactes par adaptation de rang faible en apprentissage par renforcement

Des chercheurs ont publié sur arXiv (référence 2606.25700) un article explorant l'application de LoRA (Low-Rank Adaptation) au domaine de la robotique et de l'apprentissage par renforcement (RL). La technique, largement adoptée pour le fine-tuning des grands modèles de langage, est ici appliquée à un algorithme PPO (Proximal Policy Optimization) pour créer des bibliothèques de politiques spécialisées multi-tâches. Les résultats principaux : une réduction mémoire d'un facteur 20 à 160 par rapport au fine-tuning classique de l'ensemble des couches, soit une économie de stockage de 90 à 95 % lors du déploiement d'une bibliothèque de 10 à 50 politiques spécialisées. Point notable : aucune dégradation significative du taux de succès n'est observée entre le fine-tuning complet et la version LoRA sur les tâches testées. L'enjeu concret pour les intégrateurs robotiques est précis : embarquer une bibliothèque complète de politiques spécialisées en RAM ou basculer en swap-memory sur le matériel embarqué représente un seuil opérationnel critique. Sur un robot industriel ou un système d'inspection autonome gérant 20 à 50 tâches distinctes, la différence entre "tout tient en mémoire vive" et "le système pagine" peut conditionner la latence, la fiabilité temps-réel et les coûts matériels. La conservation du taux de succès sans full fine-tuning suggère par ailleurs que les couches basses du réseau de politique encodent déjà des représentations suffisamment généralisables pour être partagées entre tâches, ce qui conforte l'hypothèse d'un transfert de compétences entre politiques spécialisées sans réapprentissage coûteux. LoRA a été formalisée en 2021 par Hu et al. dans le contexte des LLMs, où elle est devenue un standard du fine-tuning sur matériel contraint. Son transfert au RL n'est pas trivial : les dynamiques d'entraînement par essai-erreur diffèrent structurellement de l'apprentissage supervisé sur lequel LoRA a été validée. Ce preprint est une preuve de concept préliminaire, sans institution ni auteurs nommés dans l'abstract, et sans description détaillée des tâches robotiques testées, ce qui limite l'évaluation de la généralisation des résultats. Dans l'écosystème concurrent, des travaux sur la distillation de politiques (policy distillation), la compression de réseaux pour l'embarqué robotique, et les architectures de fondation pour la robotique (pi0 de Physical Intelligence, GR00T N2 de NVIDIA) explorent des pistes parallèles pour réduire l'empreinte computationnelle à l'inférence. La prochaine étape naturelle serait une validation sur des robots physiques avec contraintes mémoire réelles.

RecherchePaper
1 source
STORM : représentation par slots centrée objet et sensible à la tâche pour la manipulation robotique
963arXiv cs.RO 

STORM : représentation par slots centrée objet et sensible à la tâche pour la manipulation robotique

Des chercheurs ont publié STORM (Slot-based Task-aware Object-centric Representation for robotic Manipulation), un module d'adaptation léger conçu pour augmenter les modèles visuels de fondation figés avec des représentations centrées sur les objets. Plutôt que de réentraîner de grands backbones visuels, coûteux en calcul et en données étiquetées, STORM insère un ensemble restreint de "slots", des vecteurs appris qui capturent chaque objet de la scène de manière distincte. L'entraînement se déroule en deux phases : un préentraînement visuo-sémantique qui stabilise les slots via des embeddings de langage, puis une adaptation conjointe avec la politique de manipulation. Les expériences, menées sur des benchmarks de découverte d'objets et des tâches de manipulation simulée, montrent des gains de robustesse face aux distracteurs visuels et une meilleure performance de contrôle par rapport à l'utilisation directe des features figées ou à l'entraînement end-to-end de représentations object-centriques. L'enjeu est structurel pour la robotique de manipulation. Les modèles visuels de fondation comme DINOv2 ou SigLIP fournissent des features perceptuelles puissantes, mais leurs représentations denses traitent la scène comme une grille de pixels sans distinguer explicitement les objets. Pour une tâche du type "saisir la boîte rouge parmi plusieurs objets", cette absence de structure oblige le réseau de politique à apprendre lui-même la décomposition de la scène, ce qui nuit à la généralisation hors distribution. STORM contourne ce problème sans toucher au backbone. Le résultat valide l'hypothèse que l'adaptation multi-phase (stabilisation sémantique d'abord, alignement tâche ensuite) évite la dégénérescence des slots, phénomène où plusieurs slots capturent le même objet ou des régions non pertinentes pour la tâche. La ligne de recherche sur les représentations object-centriques remonte à Slot Attention (Locatello et al., 2020, DeepMind) et à MONet. L'originalité de STORM est d'ancrer ces slots dans la sémantique linguistique et de les greffer sur des fondations pré-entraînées plutôt que de repartir de zéro. Dans un écosystème où les VLA (Vision-Language-Action models) comme pi0 de Physical Intelligence ou OpenVLA cherchent à intégrer langage et action de bout en bout, STORM propose une alternative modulaire et économe. Les résultats restent limités à la simulation, ce qui laisse entière la question du sim-to-real gap. Les prochaines étapes logiques incluent la validation sur robots physiques et le test face à des perturbations visuelles plus agressives que les benchmarks actuels.

RecherchePaper
1 source
Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D
964arXiv cs.RO 

Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D

Des chercheurs ont publié le 19 juin 2026 sur arXiv (référence 2606.19340) un framework zero-shot pour la manipulation dextre à longue séquence, capable d'exécuter des tâches en plusieurs étapes sur des objets inconnus sans entraînement spécifique. Le système prend en entrée des instructions en langage naturel et des images RGB multi-vues calibrées, sans capteur de profondeur, et utilise un modèle vision-langage (VLM) pour générer des points-clés 2D dans un référentiel de vue de référence. Ces points sont ensuite reconstruits en 3D par fusion multi-vues combinant triangulation et une technique de "ray voting" : le système parcourt le rayon optique de la caméra principale pour identifier les candidats géométriquement cohérents dans les vues adjacentes. Les points-clés 3D obtenus supportent deux modes d'exécution : saisie-dépose directe et utilisation d'outils via la récupération d'une trajectoire outil stockée à 6 degrés de liberté (6DoF), alignée sur la configuration de scène courante. Un module bras-main génère ensuite les paires grasping-mouvement faisables. Les expériences réelles montrent que le système surpasse des baselines RGB-D vue unique et des VLA fine-tunés en précision de grounding 3D et en fiabilité d'exécution. L'enjeu central est la flexibilité de déploiement : un système zero-shot qui surpasse des VLA (Vision-Language-Action models) fine-tunés sur données spécifiques remet en question l'hypothèse dominante selon laquelle la manipulation dextre en environnement réel exige obligatoirement de larges datasets annotés et un réentraînement par tâche. Pour les intégrateurs industriels, cela signifie potentiellement des cycles de mise en production raccourcis, sans collecte systématique de démonstrations téléopérées pour chaque nouvel objet ou configuration. La boucle fermée de vérification d'état et de replanification (closed-loop replan) est particulièrement significative : elle distingue ce travail des approches open-loop qui accumulent les erreurs sur des séquences longues, un problème récurrent dans les démos de manipulation non supervisées. L'absence de capteur de profondeur réduit par ailleurs les contraintes matérielles à l'intégration sur des cellules robotiques existantes. Ce travail s'inscrit dans la tension croissante entre deux paradigmes : les VLA de bout-en-bout, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA de Stanford, qui nécessitent supervision et données massives, et les approches modulaires exploitant les capacités de raisonnement de VLM existants sans réentraînement. Depuis 2023, les VLA dominent les benchmarks de manipulation dextre, mais leur coût en données et leur manque de généralisation zero-shot à de nouveaux objets freinent les déploiements industriels à grande échelle. À noter : ce preprint ne mentionne pas d'affiliation institutionnelle dans l'abstract disponible, ce qui limite l'évaluation de la maturité des résultats, et n'a pas encore été soumis à peer review. Aucun acteur européen n'est impliqué. Les suites naturelles seraient une validation sur les benchmarks standardisés DROID ou Open X-Embodiment, et une comparaison formelle avec les versions récentes de Pi-0 et GR00T N2 pour situer précisément les gains annoncés.

RechercheOpinion
1 source
AIR-VLA+ : découplage mouvement-manipulation par décodeurs bi-actions en cascade avec MoE asymétrique pour robots aériens
965arXiv cs.RO 

AIR-VLA+ : découplage mouvement-manipulation par décodeurs bi-actions en cascade avec MoE asymétrique pour robots aériens

Une équipe de chercheurs a publié en juin 2026 AIR-VLA+, une architecture de génération d'actions par flow matching conçue spécifiquement pour la manipulation aérienne, soit des systèmes combinant un drone (UAV) et un bras manipulateur embarqué. L'architecture repose sur deux décodeurs d'action en cascade distincts : l'un dédié à la manipulation du bras, l'autre au déplacement du UAV. Le décodeur de mouvement peut observer l'intention du manipulateur (via un projecteur visuel de saisie implicite), mais l'inverse n'est pas vrai, limitant l'impact du bruit de navigation sur la stabilité du bras. Un module MoE (Mixture of Experts) asymétrique, opérant au niveau des features plutôt qu'au niveau des tokens, permet à différents experts de mouvement de se spécialiser spontanément selon les phases de tâche au cours de l'entraînement. Sur le benchmark standardisé AIR-VLA, AIR-VLA+ obtient un score global de 48,0, soit une progression de 80,2 % par rapport à la politique single-head pi-0.5, surpassant tous les baselines testés. Ce résultat pointe un problème structurel longtemps sous-estimé dans les VLA appliqués à la robotique composite : le couplage de représentation. Un drone et un bras manipulateur diffèrent radicalement en échelle d'action, en dynamique et en objectifs de contrôle. Les architectures end-to-end classiques, en traitant les deux dans le même espace de représentation, génèrent des conflits de gradient qui dégradent la stabilité de la manipulation. AIR-VLA+ démontre qu'un découplage asymétrique explicite -- avec flux d'information unidirectionnel -- permet de résoudre ce conflit sans sacrifier la coordination globale de la tâche. Pour les intégrateurs industriels travaillant sur l'inspection d'infrastructure ou la logistique verticale, c'est un signal que les politiques génériques entraînées sur des robots bipèdes ou mobiles au sol ne sont pas directement transférables. La manipulation aérienne reste un sous-domaine peu industrialisé par rapport aux AMR au sol ou aux bras fixes. Les VLA de référence -- pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), Helix (Figure) -- sont tous conçus pour des plateformes terrestres ou humanoïdes. AIR-VLA+ s'inscrit dans un effort de benchmarking spécifique à ce segment, avec la publication conjointe d'un benchmark dédié (AIR-VLA). Aucun déploiement terrain ni partenaire industriel n'est mentionné dans le preprint, ce qui le positionne clairement comme une contribution de recherche en amont. Les prochaines étapes logiques seraient une validation sim-to-real sur des tâches de saisie en environnement non structuré et une comparaison avec des architectures diffusion-based comme Diffusion Policy.

RechercheOpinion
1 source
Apprentissage par imitation robuste aux distorsions pour le routage autonome de câbles
966arXiv cs.RO 

Apprentissage par imitation robuste aux distorsions pour le routage autonome de câbles

Une équipe de chercheurs a publié en juin 2026 sur arXiv (ref. 2606.11577) un framework d'apprentissage par imitation robuste aux dégradations d'image, appliqué au câblage robotisé. La tâche visée, le routage de câbles, consiste à faire passer et connecter des câbles à travers des cheminements prédéfinis dans un environnement industriel, une opération qui exige à la fois dextérité fine et prise de décision séquentielle sur plusieurs étapes. Le système proposé s'articule autour de trois modules couplés : un module d'évaluation de la qualité d'image (IQA), un mécanisme d'apprentissage pondéré par la confiance, et un module de décision capable de produire aussi bien des actions discrètes (sélection de compétences) que continues (commandes moteur). L'abstract ne communique pas de métriques chiffrées précises, taux de succès, temps de cycle, nombre de démonstrations, ce qui limite l'évaluation indépendante des résultats annoncés. L'intérêt technique réside dans l'identification d'un angle mort réel des systèmes de contrôle intelligent en milieu industriel : les perturbations optiques. Reflets, poussière, vibrations des caméras embarquées ou éclairage variable génèrent couramment des observations dégradées qui faussent l'entraînement des modèles et réduisent leur fiabilité à l'inférence. La contribution centrale est l'intégration d'un score de qualité d'image directement dans la boucle d'apprentissage, via un mécanisme de pondération qui donne priorité aux échantillons difficiles plutôt que de les ignorer ou de les traiter uniformément. C'est une approche pragmatique face au reality gap, plus proche d'un correctif de robustesse que d'une rupture architecturale. Le câblage robotisé reste l'un des derniers bastions de l'assemblage manuel dans l'industrie automobile et électronique, faute de solutions fiables à l'échelle. Des acteurs comme Schunk, Franka Robotics ou des startups spécialisées en manipulation déformable (Cobot, Pollen Robotics côté européen) cherchent des approches généralisables. Ce travail s'inscrit dans le courant de l'imitation learning pour la manipulation, après les avancées de Pi-0 (Physical Intelligence) et des méthodes de type Diffusion Policy. La prochaine étape naturelle serait une validation sur un benchmark standardisé, RoboSuite, DROID ou un dataset industriel, pour confirmer les gains annoncés face aux méthodes de l'état de l'art.

UEPollen Robotics (France) et Franka Robotics (Allemagne) sont cités comme acteurs européens cherchant des solutions au câblage automatisé ; ce travail pourrait informer leurs feuilles de route en manipulation déformable, mais sans validation benchmark, l'impact reste hypothétique.

RecherchePaper
1 source
Automatisation intelligente pour la construction de benchmarks en IA incarnée : pipelines, morphologies, simulateurs et tendances
967arXiv cs.RO 

Automatisation intelligente pour la construction de benchmarks en IA incarnée : pipelines, morphologies, simulateurs et tendances

Un article de synthèse déposé sur arXiv (identifiant 2606.12207) en juin 2026 cartographie les méthodes de construction de benchmarks pour l'intelligence incarnée, un domaine couvrant désormais la navigation, l'assistance domestique, la manipulation robotique, la conduite autonome, les agents aériens et le contrôle par grands modèles multimodaux. Les auteurs structurent leur analyse autour d'un pipeline en cinq étapes : définition des exigences et des tâches, acquisition des données, nettoyage et annotation, génération de la suite d'évaluation avec définition des métriques, puis exécution avec retour diagnostique. Pour chaque étape, l'étude compare la curation manuelle, l'automatisation traditionnelle, l'assistance par modèles de fondation et les workflows en boucle fermée pilotés par agents. Les coûts de construction sont analysés selon six axes : main-d'oeuvre humaine, acquisition de données et d'assets, calcul et simulation, validation et débogage, gouvernance et maintenance, et risque de rework. La conclusion centrale remet en cause l'hypothèse selon laquelle automatiser la construction de benchmarks réduirait mécaniquement les coûts. Les auteurs montrent qu'elle déplace les dépenses vers la validation, l'auditabilité, la gestion de versions et la gouvernance à long terme. Pour les équipes de recherche et les industriels qui s'appuient sur ces benchmarks pour comparer des systèmes (bras manipulateurs, humanoïdes, AMR), cela signifie qu'un benchmark peu coûteux à générer peut devenir onéreux à maintenir. Le risque de rework, souvent sous-estimé, est identifié comme le poste de coût le plus variable selon la stratégie de construction choisie. Ce survey s'inscrit dans un contexte de prolifération rapide des systèmes incarnés où les évaluations sur jeux de données statiques ne suffisent plus à capturer la complexité d'environnements dynamiques réels. La question est directement pertinente pour les VLA (Vision-Language-Action models) en cours de déploiement chez Figure, 1X, Agility ou Physical Intelligence (Pi-0), dont les performances dépendent de benchmarks robustes et maintenables. Le cadre d'analyse proposé s'applique aux initiatives de benchmarking publiées par Google DeepMind, Meta FAIR ou le Stanford HAI. La thèse centrale : les progrès en évaluation robotique dépendront autant de la qualité des pipelines de construction, auditables et actualisables, que de la taille des suites de tests elles-mêmes.

RecherchePaper
1 source
VAIC : contrôle humanoïde agile d'interaction avec des objets par vision et commandes découplées
968arXiv cs.RO 

VAIC : contrôle humanoïde agile d'interaction avec des objets par vision et commandes découplées

Des chercheurs ont publié en juin 2026 sur arXiv (référence 2606.09286) VAIC, un cadre de contrôle unifié pour robots humanoïdes capable d'interagir avec des objets en milieu non structuré. La contribution principale est l'élimination de deux hypothèses restrictives qui limitent la transposition terrain des contrôleurs existants : les trajectoires de référence denses et l'observabilité complète de l'état. VAIC opère exclusivement à partir d'un flux de profondeur embarqué et de la proprioception historique, via une interface de commandes découplées composée de cibles de vitesse multi-axes et d'un indicateur d'interaction par segment corporel. L'apprentissage suit un paradigme de distillation en deux étapes : une politique "enseignant" privilégiée, entraînée avec accès complet à la cinématique des objets et à l'état environnemental exact, transfère ses compétences à une politique "étudiant" déployable qui reconstruit implicitement la dynamique des objets depuis le flux de profondeur brut via un module d'adaptation récurrent. Sur robot humanoïde (non nommé dans le preprint), cette politique unique exécute en conditions réelles trois familles de tâches dynamiques : transport de carton, interaction avec un chariot, et skateboard, surpassant selon les auteurs les approches baseline comparées. Ce résultat, s'il se confirme à plus grande échelle, adresse directement le "deployment gap" qui freine la commercialisation des humanoïdes : la quasi-totalité des démos publiques repose encore sur des systèmes de capture de mouvement externe ou sur des objets instrumentés avec tracking précis. Proposer une politique unique généraliste, sans trajectoires de référence et fonctionnant sur capteurs embarqués bas coût, réduirait significativement la friction d'intégration pour les opérateurs industriels et les intégrateurs robotiques. La distillation enseignant-étudiant avec module d'adaptation récurrent n'est pas une architecture inédite, mais son application à des tâches aussi hétérogènes sur un humanoïde réel constitue un pas mesurable vers la généralisation. À noter que le preprint ne fournit ni métriques de cycle time par tâche, ni taux de succès quantifiés, ni spécification du robot utilisé, ce qui limite l'évaluation indépendante des performances annoncées. Ce travail s'inscrit dans une course aux contrôleurs généralisés qui oppose des équipes académiques (Berkeley, CMU, ETH Zurich) aux acteurs commerciaux : Figure Robotics avec son pipeline VLA sur Figure 02/03, Physical Intelligence et sa politique Pi-0, 1X Technologies et Unitree, tous actifs simultanément sur le sim-to-real et les architectures polyvalentes. L'approche de VAIC, centrée sur la profondeur et la proprioception plutôt que sur les vision-language models à grande échelle, constitue un positionnement différenciant en termes de coût de calcul embarqué et de simplicité sensorielle. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé dans ce preprint : il s'agit à ce stade d'une démonstration de recherche, dont la validation sur plusieurs plateformes robotiques et environnements variés reste entièrement à mener.

RecherchePaper
1 source
Modèle vision-langage-action pour la modélisation du monde, le raisonnement et la synthèse d'actions
969arXiv cs.RO 

Modèle vision-langage-action pour la modélisation du monde, le raisonnement et la synthèse d'actions

Des chercheurs présentent WLA (World-Language-Action), une nouvelle classe de modèles de fondation incarnés pour la robotique, dans un preprint arXiv publié début juin 2026. Le modèle prototype WLA-0, fort de 2 milliards de paramètres actifs, prend en entrée des instructions textuelles, des images et l'état du robot pour générer simultanément des sous-tâches textuelles, des images de sous-objectifs et des commandes motrices. Sur l'NVIDIA RTX 5090, le temps d'inférence est de 40 ms par cycle, ce qui reste dans les plages acceptables pour le contrôle temps réel. Les évaluations atteignent 92,94 % de taux de succès sur le benchmark RoboTwin2.0 Clean et 56,5 % sur RMBench, deux protocoles de référence pour les tâches multi-objets et longue portée. L'intérêt architectural réside dans la fusion de deux paradigmes jusqu'ici distincts : le world modeling, qui consiste à apprendre une représentation prédictive du monde à partir de vidéos égocentrées, et le language reasoning propre aux modèles VLA (Vision-Language-Action) tels que Pi-0 ou OpenVLA. WLA opte pour un backbone Transformer autorégressif plutôt que le Transformer de diffusion bidirectionnel utilisé dans les WAM (World-Action Models), ce qui permet de prédire l'état suivant en deux niveaux complémentaires : intention sémantique textuelle d'un côté, dynamiques physiques fines de l'autre. Un mécanisme de meta-queries rend l'influence du world modeling implicite à l'inférence, mais peut être activé pour du test-time scaling, technique qui améliore le contrôle en allouant davantage de calcul à l'exécution. La capacité annoncée d'apprendre de nouvelles tâches à partir de vidéos cross-embodiment sans annotations d'actions est notable, mais reste à valider sur des robots hétérogènes en dehors d'environnements simulés. WLA s'inscrit dans une course dense à l'unification des modèles robotiques. Face à Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui misent chacun sur des architectures diffusion ou VLA, WLA propose une troisième voie autoregressive combinant génération de sous-objectifs visuels et raisonnement linguistique. L'article reste un preprint non validé par les pairs, sans déploiement industriel annoncé. Les prochaines étapes naturelles seraient une évaluation sur des plateformes physiques variées et des benchmarks réels, les performances simulées étant connues pour surestimer les capacités en conditions d'exploitation. Aucun acteur européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source
Completion at the Boundary (CaB) : commutation déployable avec contrôle par complétion sous calibration limitée
970arXiv cs.RO 

Completion at the Boundary (CaB) : commutation déployable avec contrôle par complétion sous calibration limitée

Des agents vision-langage-action (VLA) peuvent aujourd'hui exécuter des instructions en langage naturel, mais les systèmes déployés butent sur un angle mort critique : savoir quand une instruction est terminée. Des chercheurs décrivent dans l'article arXiv:2606.00145 une méthode baptisée Completion at the Boundary (CaB), conçue pour résoudre ce problème de détection de complétion dans un régime dit "à faible calibration", c'est-à-dire sans réapprentissage à l'inférence et avec une seule règle de commutation calibrée une fois sur le jeu de développement, puis réutilisée telle quelle en test. Le problème est particulièrement aigu sur les instructions composites du type "fais A, puis B" : un passage de relais mal chronométré propage une erreur en cascade sur toutes les étapes suivantes. CaB modélise la complétion comme un objet local à l'événement, sous forme de Boundary-Phase Tokens (trois états : Before, Hit, After), préservant ainsi une preuve bilatérale autour de la frontière de transition plutôt que de la comprimer en un scalaire unique. Le module CaB-When exploite cet objet pour décider quand commuter, tandis que CaB-How le réutilise pour conditionner la génération d'actions et stabiliser le comportement pendant le handoff. Les auteurs évaluent CaB sur un benchmark VLA en vue subjective dans Minecraft, via un protocole E1/E2 tenant compte des interventions, et montrent une amélioration de l'exécution composite et de la qualité des transitions à capacité égale. L'enjeu industriel est réel : la majorité des benchmarks VLA mesurent l'exécution d'une tâche atomique, mais les déploiements réels enchaînent des dizaines d'étapes. Sans mécanisme de complétion robuste, un agent peut dépasser sa cible, réexécuter une action terminée, ou passer au mauvais moment sur l'instruction suivante. Le choix d'un régime à faible calibration est significatif : il contraint la méthode à être directement déployable sans fine-tuning par site, ce qui est exactement ce que demande un intégrateur industriel. Le point faible identifié dans l'approche scalaire classique, la fragilité face aux "polarity shifts" entre tâches hétérogènes, est un problème concret que les praticiens connaissent bien mais rarement formalisent. À noter que les expériences restent sur Minecraft et non sur robot physique : le gap sim-to-real n'est pas adressé ici. CaB s'inscrit dans un courant de recherche dense autour des VLA multi-étapes, porté notamment par pi-0 de Physical Intelligence (qui gère déjà des workflows longue durée), GR00T N2 de NVIDIA, et les travaux d'OpenVLA. Le problème de la détection de fin de tâche est connexe aux travaux sur la segmentation temporelle en imitation learning (skill boundaries, option termination dans les HRL). Minecraft est un benchmark établi pour les agents langage-action (cf. STEVE-1, Voyager), ce qui facilite les comparaisons mais éloigne de la manipulation physique. La suite logique serait une validation sur des manipulateurs réels avec des instructions composites de type pick-and-place, terrain où des acteurs comme Enchanted Tools ou Pollen Robotics en Europe pourraient trouver un intérêt direct à intégrer ce type de module de complétion dans leurs pipelines VLA.

UEDes acteurs européens comme Enchanted Tools et Pollen Robotics pourraient à terme intégrer un module de complétion de type CaB dans leurs pipelines VLA, mais le gap sim-to-real reste entier, les expériences se limitant à Minecraft sans validation sur manipulateur physique.

RechercheOpinion
1 source
Apprentissage d'une politique visuelle par simulation pour l'insertion de cheville dans des trous inconnus en conditions réelles
971arXiv cs.RO 

Apprentissage d'une politique visuelle par simulation pour l'insertion de cheville dans des trous inconnus en conditions réelles

Des chercheurs proposent sur arXiv (2205.04297) un système d'insertion visuelle peg-in-hole capable de s'adapter à des formes de trous inconnues au déploiement, après entraînement exclusivement en simulation. L'architecture combine trois modules en cascade : un réseau de segmentation (SN), un réseau de capteur virtuel (VSN) qui estime la pose de la pièce cible, et un réseau de contrôle (CN) qui pilote l'insertion. Le VSN et le CN sont entraînés une seule fois en simulation sur un ensemble de formes génériques ; seul le SN est affiné lors du passage au monde réel, via quelques centaines d'échantillons collectés en moins d'une minute de démonstration humaine. Appliqué à la recharge automatique de véhicule électrique, le système atteint un taux de réussite de 10/10 en 2 à 3 secondes, validé en configurations eye-to-hand et eye-in-hand. Le principal apport est de réduire drastiquement le coût du transfert sim-to-real pour des tâches de manipulation de précision. Les approches classiques exigent soit une large collecte de données réelles, soit une modélisation CAO de chaque référence cible, deux contraintes rédhibitoires sur les lignes d'assemblage à forte variabilité de références. En découplant la perception de la politique générique, les auteurs montrent qu'il suffit d'adapter un seul module léger par nouvelle forme, ce qui ouvre la voie à des systèmes vision-pour-assemblage déployables sans ingénierie lourde par référence. Le résultat sur la recharge EV reste à nuancer : 10 essais constituent un échantillon statistiquement limité, et les conditions de test (tolérance mécanique, variabilité d'éclairage) ne sont pas précisées. La tâche peg-in-hole est un benchmark classique de la robotique d'assemblage, longtemps dominé par le contrôle en force et la modélisation géométrique. Ce travail s'inscrit dans la vague des politiques visuelles généralisables entraînées en sim, portée notamment par les approches VLA de Physical Intelligence (Pi-0) et les travaux de meta-learning de Chelsea Finn. L'application à la recharge de véhicule électrique est stratégiquement opportune : plusieurs constructeurs européens cherchent à automatiser cette opération sans infrastructure dédiée côté borne. Les suites naturelles attendues sont une validation sur un spectre plus large de tolérances dimensionnelles, des conditions d'éclairage industriel variées, et une comparaison formelle avec les méthodes hybrides force-vision existantes.

UELa méthode de transfert sim-to-real modulaire pourrait intéresser les constructeurs automobiles européens qui cherchent à automatiser la recharge de véhicules électriques sans infrastructure dédiée côté borne.

IA physiquePaper
1 source
Atlas apprend des compétences de football en regardant des images de Coupe du monde
972Interesting Engineering 

Atlas apprend des compétences de football en regardant des images de Coupe du monde

À quelques semaines de la Coupe du Monde 2026, Boston Dynamics a publié une vidéo montrant son robot humanoïde Atlas observer des séquences de matchs passés diffusées sur un grand écran, puis reproduire les gestes des joueurs dans une zone d'entraînement adjacente. Dans les séquences présentées, Atlas déplace son centre de gravité, balance la jambe vers l'avant et guide un ballon au sol avec un contact contrôlé. Le robot enchaîne ensuite une série d'exercices inspirés du football -- passes, pivots, contrôles de balle -- conçus pour travailler l'équilibre, la coordination et le timing des mouvements. La vidéo montre également Atlas lever les bras en signe de célébration après un exercice réussi, puis s'agenouiller pour simuler la réaction à une blessure sur le terrain, des gestes que Hyundai, maison mère de Boston Dynamics, présente comme copiés directement depuis les images de match visionnées. La société a baptisé l'initiative "School of Football" et évoque l'intention de déployer Atlas et le robot quadrupède Spot lors du Mondial 2026, sans préciser leur rôle exact. Cette démonstration s'inscrit dans une séquence de communications rapprochées destinées à montrer qu'Atlas peut acquérir des comportements moteurs complexes sans programmation mouvement-par-mouvement. Techniquement, le pipeline ne repose pas sur une "observation" au sens perceptif : Atlas est entraîné par reinforcement learning en simulation massivement parallèle sur GPU, à partir de trajectoires de référence issues d'animations ou de démonstrations téléopérées. Le robot accumule ce que Boston Dynamics décrit comme des millions d'heures de pratique simulée, en apprenant à maintenir équilibre et prise pendant que des perturbations externes sont introduites. Ce qui distingue Atlas des systèmes vision-only est son recours à la proprioception -- perception interne de la position du corps, de la charge et de l'équilibre -- pour s'adapter en temps réel à des objets instables, comme l'avait illustré une démonstration récente où le robot portait un réfrigérateur de 45 kg tout en conservant l'équilibre. Ces résultats indiquent une progression réelle vers des comportements adaptatifs, même si les conditions des démonstrations restent soigneusement sélectionnées et contrôlées. Boston Dynamics, fondée en 1992 au MIT et rachetée par Hyundai en 2021, a dévoilé la version entièrement électrique d'Atlas en avril 2024, après avoir mis fin au modèle hydraulique. La filiale positionne désormais Atlas comme un "outil polyvalent pour le travail physique", ciblant explicitement les usines, entrepôts et chantiers plutôt que les démonstrations spectaculaires. Dans la course aux humanoïdes industriels, elle fait face à des concurrents directs : Figure AI avec le Figure 03, Tesla avec l'Optimus Gen 3, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, et Agility Robotics avec Digit. L'initiative "School of Football" et l'association au Mondial 2026 ressemblent davantage à une opération de visibilité grand public qu'à une annonce produit structurée -- aucun déploiement commercial, aucun partenaire client, aucune timeline n'ont été communiqués. Les jalons à surveiller restent les annonces de pilotes industriels, l'évolution du partenariat avec Hyundai sur les chaînes de fabrication automobile, et la publication éventuelle de métriques de performance en conditions réelles.

HumanoïdesOpinion
1 source
Le robot humanoïde d'AGIBOT s'illustre par la danse et la calligraphie lors d'un événement culturel
973Interesting Engineering 

Le robot humanoïde d'AGIBOT s'illustre par la danse et la calligraphie lors d'un événement culturel

Le 21 mai 2026, la société chinoise AGIBOT a présenté son humanoïde pleine taille A2 lors d'un événement culturel à Jakarta, organisé en partenariat avec ASIX, accélérateur d'IA indonésien. Devant un public mixte, le robot a participé à une session de calligraphie en binôme avec des artistes humains, traçant la phrase "Tea for Harmony", avant d'enchaîner des performances de danse et des fonctions d'hôte interactif. Abel Deng, directeur régional Moyen-Orient et Asie-Pacifique d'AGIBOT, a qualifié 2026 de "jalon critique" pour atteindre un état de déploiement opérationnel, et a listé les applications industrielles et commerciales ciblées pour l'Indonésie : chargement et déchargement sur lignes de production, tri logistique, guidage en espace public, assistance retail, patrouilles de sécurité, inspections et nettoyage commercial. Aucun volume de déploiement, aucun tarif ni spécification technique détaillée du robot A2 n'ont été communiqués lors de l'événement. Il convient de distinguer nettement ce qui a été montré à Jakarta, une démonstration à visée culturelle et commerciale, de ce qui constitue un déploiement réel. Sur ce dernier point, AGIBOT avait franchi un cap concret plus tôt cette année en intégrant ses robots G2 sur une ligne de fabrication de tablettes active chez Longcheer Technology, l'un des premiers usages documentés d'un humanoïde en production d'électronique grand public. Le showcase jakartan relève davantage du positionnement géographique que de la mise en production. L'implication d'ASIX comme partenaire local signale une approche d'adaptation culturelle que plusieurs intégrateurs régionaux jugent indispensable pour réduire les frictions d'adoption dans des marchés à forte sensibilité sociale, notamment en Asie du Sud-Est où l'automatisation progresse rapidement dans les secteurs industriel et de services. AGIBOT est l'un des constructeurs chinois d'humanoïdes les mieux capitalisés, aux côtés d'Unitree Robotics, de Fourier Intelligence et d'UBTECH. Le segment reste extrêmement concurrentiel à l'échelle mondiale : Figure Robotics (Figure 03), Tesla (Optimus Gen 3), Agility Robotics (Digit, déployé chez Amazon), Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Boston Dynamics (Atlas électrique) définissent chacun leur propre lecture du marché entre dextérité, autonomie cognitive et industrialisation à grande échelle. La présence de l'A2 au Met Gala de New York quelques semaines avant Jakarta illustre la double logique de la stratégie AGIBOT : image de marque globale d'un côté, pénétration B2B régionale de l'autre. Les suites annoncées incluent des pilotes dans les secteurs industriels et de services en Indonésie, sans calendrier précis ni volumes confirmés à ce stade.

UELa percée d'AGIBOT en Asie du Sud-Est illustre la stratégie d'internationalisation des constructeurs chinois d'humanoïdes, renforçant indirectement la pression concurrentielle sur les acteurs industriels et robotiques européens.

Chine/AsieOpinion
1 source
PhysBrain 1.0 : rapport technique
974arXiv cs.RO 

PhysBrain 1.0 : rapport technique

PhysBrain 1.0 (arXiv:2605.15298, mai 2026) est un pipeline VLA (vision-language-action) qui convertit de la vidéo égocentrique humaine à grande échelle en supervision de commonsense physique structuré, avant de transférer ce savoir vers le contrôle robotique. Un moteur de données extrait quatre types d'informations depuis ces vidéos (éléments de scène, dynamiques spatiales, exécution d'actions, relations géométriques tenant compte de la profondeur) et les transforme en paires questions-réponses pour entraîner les VLM PhysBrain. Les priors physiques résultants sont ensuite injectés dans des politiques VLA via un mécanisme d'adaptation qualifié de "capability-preserving et language-sensitive". Évalué sur cinq benchmarks (ERQA, PhysBench, SimplerEnv-WidowX, LIBERO, RoboCasa), le modèle revendique des résultats état de l'art, avec des performances hors domaine particulièrement fortes sur SimplerEnv. L'abstract ne fournit pas de métriques chiffrées; le rapport complet reste nécessaire pour valider ces affirmations. L'argument central est que les trajectoires robot constituent une source de supervision trop étroite pour acquérir une compréhension physique générale: coûteuses à collecter par téléopération et peu diversifiées, elles limitent structurellement la généralisation des VLA. La vidéo égocentrique humaine, disponible en volumes bien supérieurs, couvre une variété d'interactions physiques avec le monde (saisies, contacts, équilibre, textures) que les datasets robot n'atteignent pas. La robustesse hors domaine sur SimplerEnv est le signal le plus intéressant: si elle se confirme à la lecture du rapport complet, cela suggère que cette stratégie atténue le problème de généralisation qui frappe la majorité des VLA entraînés uniquement sur données robot. Pour un intégrateur ou un COO industriel, cela laisse entrevoir une réduction du volume de démonstrations téléopérées nécessaires lors de chaque nouveau déploiement. PhysBrain s'inscrit dans une compétition dense autour des VLA physiques. Physical Intelligence (pi0, pi0.5) capitalise sur de larges datasets de téléopération multi-robot; NVIDIA GR00T N2 cible la compréhension physique via simulation massive; Google DeepMind (RT-2) et le modèle open-source Octo ont posé les bases de la catégorie. L'angle de PhysBrain, passant par un intermédiaire de commonsense structuré en QA plutôt que par un entraînement direct sur trajectoires, rappelle les stratégies de pre-training visuel comme R3M ou MVP, mais va plus loin avec un pipeline d'extraction supervisée à quatre dimensions. Le modèle est pour l'instant validé sur robot WidowX, une plateforme de manipulation accessible; la prochaine étape logique serait de tester le transfert sur des architectures humanoïdes ou à plus haute dextérité, là où la compréhension physique générale apporte le plus de valeur.

💬 Le vrai problème des VLA, c'est qu'ils apprennent à partir de données robot trop étroites et trop chères à collecter. PhysBrain contourne ça en allant chercher le commonsense physique dans des vidéos humaines à grande échelle, et je trouve les perfs hors domaine sur SimplerEnv plus convaincantes que les benchmarks habituels. Testé sur WidowX seulement pour l'instant, donc on attend la suite.

IA physiqueOpinion
1 source
MIMIC-D : imitation multimodale pour la coordination multi-agents par politiques de diffusion décentralisées
975arXiv cs.RO 

MIMIC-D : imitation multimodale pour la coordination multi-agents par politiques de diffusion décentralisées

Des chercheurs ont publié MIMIC-D (Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies), un framework d'apprentissage par imitation destiné à coordonner plusieurs agents robotiques sur des tâches multi-modales, c'est-à-dire admettant plusieurs solutions valides. La troisième révision de ce préprint arXiv (2509.14159v3) présente une architecture d'entraînement conjoint avec exécution décentralisée : chaque agent apprend une politique à partir d'informations locales uniquement, sans planificateur central ni canal de communication explicite entre agents. Les politiques s'appuient sur des réseaux de diffusion, capables de représenter des distributions de trajectoires complexes et multi-modales là où l'apprentissage par imitation classique tend à moyenner les modes ou à n'en sélectionner qu'un seul. Des validations en simulation et sur matériel réel sont rapportées, avec des améliorations annoncées sur les baselines état de l'art, sans que des métriques chiffrées précises ne soient publiées dans le résumé. L'enjeu opérationnel est direct : les frameworks multi-agents existants supposent généralement une communication permanente entre robots ou un orchestrateur global, une hypothèse irréaliste en conditions industrielles où le réseau peut être instable, les équipements hétérogènes, et des opérateurs humains présents dans la boucle. MIMIC-D vise à produire une coordination implicite émergente à l'entraînement, sans échange de messages à l'exécution. Pour les intégrateurs ou les COO de sites logistiques et de fabrication, cette approche ouvre la voie à des fleets hétérogènes capables de gérer des variantes de tâches sans reconfiguration centrale, un problème courant dès que les processus sont peu standardisés. Ce travail prend place dans la dynamique post-diffusion appliquée à la robotique, après les résultats de Pi-0 (Physical Intelligence) et des architectures VLA sur des tâches mono-agent. L'extension au multi-agent reste un chantier ouvert : en production, des systèmes comme ceux d'Exotec ou d'Amazon Robotics s'appuient sur des orchestrateurs centralisés (WMS, MFC), exactement ce que MIMIC-D vise à rendre optionnel. Les approches concurrentes incluent les algorithmes MARL classiques (MAPPO, QMIX) et les travaux récents sur les diffusion policies multi-agents avec communication explicite. Étant un preprint en cours de révision, aucun déploiement industriel n'est annoncé. Les évaluations sur des espaces d'action à plus haute dimensionnalité et en environnement humain réel constituent les prochaines étapes naturelles.

UELes intégrateurs européens de flottes robotiques hétérogènes (logistique, fabrication) pourraient à terme bénéficier d'une coordination décentralisée sans orchestrateur central, mais MIMIC-D reste un preprint de recherche sans métriques publiées ni déploiement industriel annoncé.

IA physiqueOpinion
1 source
Modèle du monde multimodal pour interactions physiques : prédictions visuelles et tactiles simultanées pour une précision accrue
976arXiv cs.RO 

Modèle du monde multimodal pour interactions physiques : prédictions visuelles et tactiles simultanées pour une précision accrue

Des chercheurs ont publié sur arXiv (2304.11193v2) une étude portant sur l'intégration du retour tactile dans les modèles prédictifs de perception pour la manipulation robotique. L'approche, baptisée "visuo-tactile prediction", consiste à entraîner un modèle de monde capable de générer simultanément des prédictions visuelles et tactiles à partir d'observations de poussée d'objets. Pour alimenter ces travaux, deux jeux de données inédits ont été constitués à l'aide d'un capteur tactile à base magnétique : le premier contient des objets visuellement identiques mais aux propriétés physiques différentes (masse, rigidité), isolant explicitement l'ambiguïté physique ; le second reproduit les benchmarks classiques de robot-pushing avec des regroupements d'objets du quotidien. Le code source et les données sont mis à disposition publiquement. Le résultat central de cette recherche remet en question un postulat implicite de nombreux systèmes de world models robotiques : la vision seule ne suffit pas pour prédire fidèlement les interactions physiques dès lors que les objets sont visuellement indiscernables. Dans ces régimes ambigus, l'intégration tactile améliore significativement la précision et la robustesse des prédictions. En revanche, lorsque la dynamique est visuellement déductible, les gains tactiles restent limités. Pour les intégrateurs et équipes de R&D en manipulation, cela signifie que le retour tactile n'est pas un luxe mais une nécessité sélective : son déploiement est justifié précisément là où la vision échoue, typiquement lors de la manipulation d'objets déformables, transparents ou de densité variable. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour dépasser les modèles de monde purement visuels, qui montrent leurs limites dans les tâches de contact. Des travaux concurrents comme ceux de Meta AI (v-jepa), de Google DeepMind (RT-2) ou de Physical Intelligence (Pi-0) explorent également les représentations multimodales, mais restent majoritairement centrés sur la vision et le langage. L'usage d'un capteur magnétique plutôt que optique (comme ceux de GelSight/Digit popularisés par Meta) constitue un choix technique notable, potentiellement plus robuste en conditions industrielles. La mise à disposition des données en accès libre ouvre la voie à des évaluations comparatives plus rigoureuses, un manque criant dans le domaine de la manipulation tactile.

RecherchePaper
1 source
Découverte de modes comportementaux pour l'affinage de politiques génératives multimodales
977arXiv cs.RO 

Découverte de modes comportementaux pour l'affinage de politiques génératives multimodales

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.11387) une méthode pour affiner des politiques génératives pré-entraînées par apprentissage par renforcement (RL) sans sacrifier la diversité comportementale. Le problème ciblé est le "mode collapse" : appliqué à une politique diffusion (un modèle génératif produisant des distributions d'actions multimodales), le RL fait converger les comportements variés vers une unique stratégie maximisant la récompense. La solution proposée est un framework non supervisé qui identifie les modes comportementaux latents au sein de ces politiques, puis utilise l'information mutuelle entre ces modes et les trajectoires générées comme récompense intrinsèque. Ce signal régularise l'entraînement RL, forçant le modèle à conserver plusieurs stratégies d'exécution simultanément. Sur des benchmarks de manipulation robotique, la méthode surpasse les approches classiques en taux de succès tout en préservant des distributions d'actions plus riches. Cette contribution adresse une tension fondamentale dans le déploiement des politiques robotiques apprenantes : le RL améliore les performances moyennes mais réduit la robustesse aux imprévus en homogénéisant les comportements. Pour un intégrateur industriel, la diversité comportementale détermine concrètement si un robot peut adapter sa prise face à une pose objet inattendue ou récupérer d'une perturbation de surface, des situations que les métriques de succès moyen ne capturent pas. En préservant la multimodalité après fine-tuning, la méthode rend les politiques diffusion plus exploitables hors des conditions d'entraînement et suggère qu'optimisation par RL et robustesse opérationnelle, deux objectifs souvent antagonistes, peuvent être conciliés. Les politiques diffusion se sont imposées comme paradigme dominant en manipulation robotique depuis les travaux de Chi et al. (2023) et alimentent aujourd'hui les modèles VLA (Vision-Language-Action) comme pi-0 de Physical Intelligence ou OpenVLA de Berkeley. Le fine-tuning RL de ces architectures est une direction très active, notamment avec DPPO (Diffusion Policy Policy Optimization). La méthode proposée se positionne comme complément générique à ces pipelines, applicable sans annotation supplémentaire. Point de vigilance : les auteurs ne mentionnent pas de validation sur robot physique, un gap récurrent pour les preprints arXiv dont les résultats restent à confirmer hors simulation.

RechercheOpinion
1 source
Suivi de main par vision pour la manipulation robotique via cinématique inverse
978arXiv cs.RO 

Suivi de main par vision pour la manipulation robotique via cinématique inverse

Des chercheurs ont publié sur arXiv (réf. 2603.11383) une pipeline de télé-opération bas coût pour bras manipulateurs, baptisée hand-shadowing : une caméra RGB-D égocentrique montée sur des lunettes imprimées en 3D capte les mains de l'opérateur, MediaPipe Hands en extrait 21 points de repère par main, la profondeur les projette dans l'espace 3D, et un algorithme de cinématique inverse à moindres carrés atténués (damped least-squares IK) génère les commandes articulaires du robot SO-ARM101 (5 degrés de liberté + 1 préhenseur). Les actions sont d'abord validées dans un simulateur physique avant d'être rejouées sur le robot réel. Sur un benchmark structuré pick-and-place (grille 5 cases, 10 saisies par case, 3 runs indépendants), la pipeline atteint un taux de succès de 86,7 % ± 4,2 %, avec une erreur IK moyenne de 36,4 mm et une réduction du jerk de 57 à 68 % grâce à un lissage par moyenne mobile exponentielle (EMA). En environnements non structurés réels (supermarché, pharmacie), ce taux chute à 9,3 %, principalement à cause de l'occultation des mains par les objets environnants. Ce résultat illustre avec brutalité le reality gap qui sépare les conditions de laboratoire du déploiement industriel : une marge de 77 points entre les deux contextes n'est pas un détail d'intégration, c'est un défi de fond pour toute approche marker-free analytique. La comparaison directe avec quatre politiques VLA entraînées sur données leader-follower (ACT, SmolVLA, pi_0.5 de Physical Intelligence et GR00T N1.5 de NVIDIA) est méthodologiquement utile : elle positionne cette approche de retargeting pur face aux modèles appris, et quantifie l'écart sans se limiter à la démonstration sélective. Pour un COO ou un intégrateur, le message est clair : le bas coût matériel (lunettes imprimées, caméra grand public) ne compense pas encore l'insuffisance de robustesse à l'occlusion. La télé-opération reste un goulot d'étranglement majeur pour la collecte de données d'entraînement robotique, et les systèmes leader-follower filaires ou magnétiques restent chers et contraignants. Ce travail s'inscrit dans une vague de recherche qui cherche à démocratiser la capture de démonstrations avec du matériel grand public, aux côtés d'approches comme UMI (Columbia) ou AnyTeleop. Pour contourner la faiblesse de MediaPipe face à l'occlusion, les auteurs intègrent WiLoR comme détecteur alternatif et obtiennent 8 % de gain en taux de détection, une amélioration modeste qui confirme que le problème reste ouvert. La prochaine étape logique serait d'ajouter une gestion multi-vues ou un suivi temporel robuste pour traiter les environnements encombrés, conditions précisément où la télé-opération sans marqueur aurait le plus de valeur.

RecherchePaper
1 source
CapVector : des vecteurs de capacité transférables dans l'espace paramétrique pour les modèles VLA
979arXiv cs.RO 

CapVector : des vecteurs de capacité transférables dans l'espace paramétrique pour les modèles VLA

Des chercheurs ont publié le 15 mai 2026 sur arXiv un article présentant CapVector, une méthode d'adaptation des modèles Vision-Language-Action (VLA) qui réduit les coûts de fine-tuning sans sacrifier les performances. Le principe : entraîner le modèle deux fois sur un petit ensemble de tâches avec deux stratégies distinctes, puis calculer la différence entre les paramètres des deux modèles obtenus. Cette différence constitue un "vecteur de capacité" qui est ensuite fusionné avec les paramètres du modèle préentraîné pour former un méta-modèle enrichi. Une perte de régularisation orthogonale légère, ajoutée lors du fine-tuning standard, suffit à atteindre des performances comparables aux méthodes d'entraînement auxiliaire classiques, avec une empreinte computationnelle significativement réduite. L'enjeu est concret pour les équipes qui déploient des robots manipulateurs ou mobiles basés sur des VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA : le fine-tuning sur de nouvelles tâches ou de nouveaux embodiments reste aujourd'hui coûteux en GPU-heures et en données. Les méthodes à objectifs auxiliaires améliorent la convergence mais multiplient les passes de gradient. CapVector propose une voie médiane : extraire les gains des méthodes avancées sous forme de vecteurs transférables, réutilisables sur d'autres modèles et d'autres environnements sans réentraînement. Les expériences internes et externes rapportées montrent une généralisation à des environnements et des morphologies non vus lors de la construction des vecteurs, ce qui est l'affirmation la plus forte de l'article et qui méritera une vérification indépendante. Les VLA sont devenus le paradigme dominant pour la robotique généraliste depuis la publication de RT-2 par Google DeepMind en 2023 et les releases successives d'OpenVLA, Octo, puis Pi-0 fin 2024. Le goulot d'étranglement s'est déplacé de la capacité du modèle vers l'efficacité de l'adaptation : comment spécialiser un grand modèle généraliste pour une cellule industrielle précise, avec peu de données et peu de calcul ? CapVector s'inscrit dans cette tendance aux "parameter-efficient adaptation" methods, aux côtés de LoRA, DoRA et des approches par model merging. Il s'agit d'un preprint arXiv (v1, pas encore évalué par les pairs) ; aucun déploiement industriel ni partenariat n'est mentionné à ce stade.

RechercheOpinion
1 source
Préhension volumétrique équivariante
980arXiv cs.RO 

Préhension volumétrique équivariante

Des chercheurs ont publié sur arXiv (identifiant 2507.18847, troisième révision) un nouveau modèle de planification de saisie robotique volumétrique intégrant des propriétés d'équivariance aux rotations autour de l'axe vertical. Le modèle repose sur une représentation tri-plan : les caractéristiques 3D de la scène sont projetées sur trois plans canoniques (horizontal, frontal, latéral). Sur le plan horizontal, les features sont équivariantes aux rotations de 90°, tandis que la somme des features issues des deux autres plans reste invariante aux réflexions induites par ces mêmes transformations. Les auteurs ont ensuite développé des adaptations équivariantes de deux planificateurs volumétriques de référence, GIGA et IGD. Pour IGD, ils reformulent le mécanisme d'attention déformable en version équivariante. Ils proposent également un modèle génératif des orientations de saisie basé sur le flow matching, une technique de modélisation générative récente. Les résultats expérimentaux, en simulation et en monde réel, montrent une réduction des coûts computationnels et mémoire, ainsi que des performances supérieures à leurs homologues non-équivariants sous contrainte temps réel. L'apport principal est d'ordre pratique pour les intégrateurs robotiques : l'équivariance permet au modèle de généraliser automatiquement une stratégie de saisie apprise depuis une orientation à toutes les rotations équivalentes, sans qu'il soit nécessaire d'augmenter massivement les données d'entraînement. Cela se traduit directement par une meilleure efficacité d'échantillonnage et une empreinte mémoire réduite, deux contraintes critiques pour le déploiement sur hardware embarqué. Le fait que les gains de performance soient maintenus sous contrainte temps réel -- et non seulement en conditions de laboratoire sans limite de calcul -- est un signal pertinent pour les ingénieurs en robotique manipulation industrielle, souvent contraints par des boucles de contrôle à fréquence fixe. GIGA et IGD représentent l'état de l'art récent en grasping volumétrique ; les intégrer plutôt que de proposer une architecture from scratch renforce la crédibilité comparative des résultats. Le champ de l'équivariance géométrique dans les réseaux de neurones connaît une activité soutenue depuis plusieurs années, notamment autour des groupes SO(3) et SE(3), mais les applications concrètes au grasping temps réel restent peu nombreuses. Ce travail s'inscrit dans une tendance à exploiter les symétries physiques pour réduire le coût d'apprentissage, une direction qui intéresse aussi bien les labos académiques que des acteurs industriels comme Boston Dynamics AI Institute ou Physical Intelligence (Pi). Le code et les vidéos de démonstration sont accessibles publiquement sur la page projet des auteurs.

IA physiquePaper
1 source
HeteroGenManip : manipulation généralisable pour les interactions avec des objets hétérogènes
981arXiv cs.RO 

HeteroGenManip : manipulation généralisable pour les interactions avec des objets hétérogènes

Une équipe de chercheurs a publié en mai 2026 sur arXiv (identifiant 2605.10201) un framework baptisé HeteroGenManip, conçu pour améliorer la manipulation robotique d'objets hétérogènes, c'est-à-dire d'objets appartenant à des catégories morphologiques différentes. L'architecture repose sur deux modules distincts : un module de saisie guidé par correspondance structurelle (Foundation-Correspondence-Guided Grasp) qui localise le point de contact initial, et une politique de diffusion multi-modèles (Multi-Foundation-Model Diffusion Policy, MFMDP) qui planifie la trajectoire d'interaction selon la catégorie de l'objet détecté. Les résultats expérimentaux annoncés font état d'une amélioration moyenne de 31 % en simulation sur un panel large de types d'objets, et d'un gain de 36,7 % sur quatre tâches réelles impliquant des types d'interactions différents. Aucun détail sur les sites de déploiement industriel ou les partenaires terrain n'est mentionné dans la publication. Ce travail s'attaque à un verrou bien identifié dans la manipulation robotique généraliste : les approches bout-en-bout (end-to-end) basées sur des modèles de fondation confondent la localisation du contact et la planification du mouvement, ce qui amplifie les erreurs sur les tâches longues (long-horizon tasks). En routant chaque objet vers un modèle spécialisé par catégorie via un mécanisme de double attention croisée (dual-stream cross-attention), HeteroGenManip tente de réconcilier généralisation inter-catégories et précision géométrique fine. Si les gains annoncés se confirment hors conditions de laboratoire, cela représente un argument sérieux contre l'hypothèse que les VLA (Vision-Language-Action models) end-to-end suffisent pour la diversité réelle du monde industriel. La problématique de la manipulation hétérogène est au coeur des efforts de nombreux groupes de recherche, notamment autour des politiques de diffusion comme Pi-0 de Physical Intelligence ou des travaux sur GR00T N2 chez NVIDIA. HeteroGenManip se positionne comme une alternative structurée en pipeline, s'appuyant sur des priors géométriques plutôt que sur l'apprentissage massif de données de démonstration. La publication reste à ce stade un résultat académique sans annonce de transfert industriel ni de code public répertorié, ce qui invite à attendre une validation reproductible avant toute extrapolation sur les cas d'usage en intégration réelle.

RechercheOpinion
1 source
LoopVLA : l'amélioration itérative par suffisance apprise pour les modèles vision-langage-action (VLA)
982arXiv cs.RO 

LoopVLA : l'amélioration itérative par suffisance apprise pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a déposé en mai 2026 sur arXiv un préprint décrivant LoopVLA, une nouvelle architecture de modèle Vision-Language-Action (VLA) conçue pour la manipulation robotique en boucle fermée. L'idée centrale : les VLA actuels utilisent systématiquement la représentation la plus abstraite de leur backbone vision-langage pour prédire les actions, ce qui se révèle sous-optimal pour les ajustements spatiaux fins et répétitifs qu'implique la manipulation de précision. LoopVLA remplace cette logique par un bloc Transformer partagé appliqué de manière récurrente : à chaque itération, le modèle produit à la fois une action candidate et un score de suffisance estimant si un raffinement supplémentaire est nécessaire. L'apprentissage de ce score, en l'absence de supervision directe, repose sur un objectif d'alignement de distribution auto-supervisé : les scores de confiance intermédiaires sont entraînés à refléter la qualité relative des actions produites à chaque étape de raffinement. Sur les benchmarks LIBERO, LIBERO-Plus et VLA-Arena, LoopVLA réduit le nombre de paramètres de 45 % et améliore le débit d'inférence jusqu'à 1,7 fois, tout en atteignant ou surpassant les baselines de référence sur les taux de réussite aux tâches. Le gain est concret pour les équipes qui déploient des VLA sur matériel embarqué ou sous contraintes de latence : un facteur 1,7x sur le throughput d'inférence peut faire la différence entre un robot capable de répondre en boucle de contrôle serrée et un système trop lent pour la production. L'approche remet également en question un postulat dominant dans le domaine, à savoir que la représentation la plus profonde est toujours la meilleure pour l'action. En montrant qu'une sortie anticipée guidée par un signal appris suffit à maintenir les performances, LoopVLA plaide contre le dogme "plus profond égale meilleur" pour la manipulation de précision, où les indices géométriques bas-niveau (position du préhenseur, orientation d'un objet) sont souvent dégradés par une abstraction excessive. Les VLA sont au coeur d'une compétition intense depuis l'émergence de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et Octo (UC Berkeley). La plupart de ces modèles héritent d'une logique "backbone figé + tête d'action" sans remettre en question la profondeur de représentation utilisée. LoopVLA s'inscrit dans la lignée des travaux sur l'early exit et le calcul adaptatif, comparable aux Mixture of Depths de DeepMind, mais appliqués à la politique robotique. Il n'y a pas de déploiement industriel annoncé : il s'agit d'un résultat de recherche avec évaluations uniquement en simulateur (LIBERO est un benchmark sim). La prochaine étape naturelle serait une validation sur robot réel pour mesurer le sim-to-real gap, en particulier sur des tâches de manipulation fine.

IA physiqueOpinion
1 source
Wavelet Policy : apprentissage par imitation dans le domaine des échelles avec mémoire a priori du monde
983arXiv cs.RO 

Wavelet Policy : apprentissage par imitation dans le domaine des échelles avec mémoire a priori du monde

Une équipe de chercheurs propose Wavelet Policy (arXiv:2504.04991), un framework léger d'apprentissage par imitation pour la manipulation robotique. L'approche combine deux innovations : une mémoire de scène persistante appelée World Prior Memory (WPM), qui encode la structure statique de l'environnement à partir d'images de fond dans des vecteurs compacts, et une modélisation des actions par décomposition en ondelettes (wavelet-domain decomposition). L'architecture résultante, baptisée Single-Encoder Multiple-Decoder (SE2MD), décompose les représentations latentes des actions en sous-bandes temporelles distinctes, reconstruites via transformée inverse avant d'être projetées en séquences d'actions exécutables. Validée sur quatre tâches simulées et six tâches réelles de manipulation robotique, la méthode surpasse les baselines de référence sur l'ensemble des benchmarks. Le code source, les données et les poids du modèle sur tâches simulées sont disponibles publiquement sur GitHub. L'enjeu central est double. D'une part, les politiques visuomotrices classiques (ACT, Diffusion Policy) opèrent entièrement dans le domaine temporel et peinent à maintenir une conscience cohérente de la scène physique sur des horizons longs. D'autre part, les architectures à modèle du monde qui résolvent ce problème imposent un surcoût computationnel significatif, incompatible avec un déploiement embarqué sur robot. Wavelet Policy avance que la décomposition fréquentielle des représentations d'actions latentes suffit à capturer simultanément les composantes rapides (corrections fines) et lentes (planification gestuelle) sans recourir à un modèle du monde explicite. Pour les intégrateurs industriels et les équipes R&D embarquées, cela ouvre la voie à des politiques de manipulation longue-horizon déployables avec des ressources de calcul modestes. Le travail s'inscrit dans une compétition intense sur les politiques visuomotrices généralisées : Physical Intelligence a publié π0 fin 2024 sur des tâches de manipulation complexes, NVIDIA a proposé GR00T N2 avec apprentissage par simulation, et des laboratoires académiques comme Stanford ou Berkeley poussent des variantes de Diffusion Policy et d'imitation par Transformer. Wavelet Policy se positionne comme une alternative légère, sans prétendre au déploiement sur robot humanoïde : les expériences réelles restent au stade du bras manipulateur en environnement contrôlé. Publié en version preprint (v4, avril 2025), le travail n'a pas encore fait l'objet d'une publication dans une conférence de rang A (ICRA, CoRL, RSS), ce qui invite à nuancer la portée des résultats annoncés avant validation par les pairs.

IA physiqueOpinion
1 source
IA incarnée : apprendre de ses essais et erreurs grâce à la planification réflexive à l'inférence
984arXiv cs.RO 

IA incarnée : apprendre de ses essais et erreurs grâce à la planification réflexive à l'inférence

Une équipe de chercheurs a déposé sur arXiv en février 2026 (réf. 2602.21198, v2) un framework baptisé Reflective Test-Time Planning (RTTP), conçu pour résoudre un angle mort structurel de la robotique pilotée par LLM : les agents embarqués traitent chaque essai de façon indépendante, ce qui fait répéter les mêmes erreurs au lieu d'en tirer une expérience cumulative. Le RTTP introduit deux mécanismes : la reflection-in-action, où l'agent génère et évalue plusieurs actions candidates via un scaling à l'inférence avant d'agir, et la reflection-on-action, qui met à jour le modèle de réflexion interne et la politique d'action après exécution via un entraînement à l'inférence. Une troisième composante, la réflexion rétrospective, permet de réévaluer des décisions antérieures pour corriger l'attribution de crédit sur des tâches à long horizon. Les expériences portent sur deux benchmarks : Long-Horizon Household (tâches domestiques séquentielles) et MuJoCo Cupboard Fitting (manipulation en simulation physique), avec généralisation zero-shot vers les environnements HM3D photoréalistes et validation sur bras réel Franka Panda. L'enjeu industriel est direct : le déploiement de robots pilotés par VLA (Vision-Language-Action models) bute sur le demo-to-reality gap, où les modèles performent en laboratoire mais dégradent en conditions variables. RTTP propose une boucle fermée d'adaptation pendant le déploiement, sans fine-tuning offline coûteux. Les ablations confirment que les deux modes de réflexion sont mutuellement dépendants, et que la réflexion rétrospective surpasse le feedback step-wise classique avec un overhead computationnel inférieur, un avantage concret pour les intégrateurs soucieux de maîtriser les coûts d'inférence à l'échelle. Cette contribution s'inscrit dans la vague du test-time scaling, popularisée par les modèles de raisonnement d'OpenAI et Google DeepMind, mais appliquée à l'action robotique incarnée plutôt qu'au raisonnement abstrait. Les auteurs ne mentionnent ni partenariat industriel ni timeline commerciale : c'est un preprint de recherche, pas un produit shipé. Les travaux concurrents dans cette direction incluent les VLAs de Physical Intelligence (pi0), le programme RT-2-X de Google DeepMind et les recherches sur l'apprentissage online menées à Carnegie Mellon et Berkeley. Aucun acteur français ou européen n'est impliqué dans cette publication.

IA physiqueOpinion
1 source
Drifting Field Policy : une politique générative en une étape via le flux de gradient de Wasserstein
985arXiv cs.RO 

Drifting Field Policy : une politique générative en une étape via le flux de gradient de Wasserstein

Une équipe de chercheurs propose le Drifting Field Policy (DFP), une politique générative à inférence en une seule étape pour l'apprentissage de tâches robotiques, publiée sur arXiv (ref. 2605.07727) en mai 2025. Contrairement aux politiques basées sur des équations différentielles ordinaires (ODE) comme les politiques de diffusion ou de flow matching, DFP n'itère pas sur plusieurs pas de débruitage : une seule passe réseau suffit pour générer l'action. Techniquement, la mise à jour de la politique est formulée comme un flux de gradient de Wasserstein-2 en divergence KL inverse vers une politique cible souple, ce qui revient à effectuer un pas de gradient dans l'espace des probabilités. Ce gradient se décompose en deux termes : une montée vers les régions d'actions à haute valeur estimée par un critique, et un score matching avec la politique d'ancrage servant de région de confiance. Pour rendre l'optimisation tractable, les auteurs dérivent un surrogate simplifié, équivalent à du behavior cloning sur les actions top-K sélectionnées par le critique. Évalué sur les benchmarks Robomimic et OGBench, DFP atteint des performances état de l'art sur plusieurs tâches de manipulation, surpassant les politiques ODE-based à nombre de paramètres comparable. L'enjeu principal est la latence d'inférence : les politiques à base de diffusion ou de flow matching, comme Pi-0 de Physical Intelligence ou les variantes de Diffusion Policy de Chi et al. (2023), requièrent typiquement 10 à 100 pas de débruitage, ce qui est prohibitif pour un contrôle robotique en temps réel. DFP atteint des performances comparables ou supérieures avec une seule évaluation du réseau, sans recourir à la distillation (consistency models, DDIM), qui dégrade souvent la qualité des trajectoires générées. Un résultat notable est que le surrogate loss via top-K behavior cloning bénéficie spécifiquement au backbone non-ODE de DFP, les auteurs montrant expérimentalement que cette combinaison n'améliore pas les architectures ODE-based de la même façon, ce qui valide la cohérence architecturale de l'approche. Les politiques de diffusion pour la robotique ont été popularisées par Chi et al. en 2023, puis étendues via le flow matching, paradigme utilisé notamment par Pi-0 et GR00T N2 de NVIDIA. Plusieurs travaux ont cherché à en réduire le coût computationnel par distillation ou quantification, sans parvenir à éviter une dégradation des performances. DFP propose une rupture en changeant le paradigme de génération lui-même plutôt qu'en compressant un modèle existant. Il n'existe à ce stade aucune annonce de déploiement ou de partenariat industriel : il s'agit d'un résultat académique pur. Les suites naturelles seraient une validation sur robots réels en manipulation dextère, une comparaison directe avec les variantes distillées de Diffusion Policy, et une intégration potentielle dans des pipelines VLA (Vision-Language-Action) où la latence d'inférence est un goulot d'étranglement critique.

RechercheOpinion
1 source
CommandSwarm : génération d'arbres de comportement en langage naturel pour essaims robotiques avec contraintes de sécurité
986arXiv cs.RO 

CommandSwarm : génération d'arbres de comportement en langage naturel pour essaims robotiques avec contraintes de sécurité

CommandSwarm est un pipeline qui convertit des commandes en langage naturel, vocales ou textuelles, en arbres de comportement (behavior trees, BT) au format XML pour piloter des essaims de robots. Publiée en mai 2026 sur arXiv (preprint 2605.07764), l'architecture enchaîne traduction multilingue, filtrage de sécurité au niveau commande, prompting contraint, un LLM adapté par LoRA, et un validateur déterministe basé sur une liste blanche de primitives d'essaim autorisées. Onze LLMs open source de 6,7 à 14 milliards de paramètres, tous quantifiés en 4 bits, ont été évalués : Falcon3-Instruct-10B et Mistral-7B-v3 ressortent comme les meilleurs candidats en few-shot prompting, avec des scores BLEU supérieurs à 0,60. Après adaptation LoRA sur un corpus synthétique de 2 063 paires instruction-BT, le Falcon3-Instruct-10B passe d'un BLEU zero-shot de 0,267 à 0,663, d'un ROUGE-L de 0,366 à 0,692, et d'une validité syntaxique acceptée par le parser de 0 % à 72 %. Pour le front-end multilingue, SeamlessM4T v2-large et EuroLLM-9B, initiative européenne, offrent le meilleur compromis qualité-latence. La conclusion opérationnelle centrale de ces travaux est que la qualité de génération seule est insuffisante pour un déploiement autonome : sans parser de validation et filtre de sécurité en sortie, même les meilleurs modèles produisent des plans non exécutables ou potentiellement dangereux. Pour les intégrateurs robotiques et les décideurs industriels, cela confirme que les garde-fous déterministes sont non négociables, quel que soit le score BLEU affiché par un modèle. La progression de 0 % à 72 % de validité syntaxique après fine-tuning souligne également que l'adaptation domaine-spécifique reste indispensable : aucun LLM généraliste, même performant, ne maîtrise spontanément la syntaxe XML des BTs robotiques. Les behavior trees se sont imposés depuis une dizaine d'années comme le paradigme de contrôle dominant en robotique avancée, supplantant les machines à états finis classiques. La commande par langage naturel rejoint une tendance de fond déjà illustrée par ProgPrompt (Microsoft/Stanford, 2022), SayCan (Google, 2022), et les VLAs Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) pour robots individuels. CommandSwarm se positionne sur le créneau des essaims multi-agents, où la coordination collective et les risques d'interférence rendent la validation formelle encore plus critique qu'en robotique unitaire. Ce travail reste à ce stade un preprint de recherche évalué sur scénarios de simulation ; aucun déploiement sur hardware physique n'est annoncé. Les prochaines étapes attendues comprennent des tests sur robots réels, l'évaluation de la latence temps-réel en conditions opérationnelles, et l'extension du corpus d'entraînement au-delà des 2 063 exemples synthétiques actuels.

UEEuroLLM-9B, initiative européenne, ressort comme l'un des meilleurs compromis qualité-latence pour le front-end multilingue, ce qui lui donne un avantage potentiel dans les projets robotiques financés ou réglementés en Europe.

RecherchePaper
1 source
ReActor : apprentissage par renforcement pour le reciblage de mouvement avec physique
987arXiv cs.RO 

ReActor : apprentissage par renforcement pour le reciblage de mouvement avec physique

Une équipe de chercheurs a publié ReActor (arXiv:2605.06593, mai 2026), un cadre d'optimisation bilevel qui résout simultanément le retargeting cinématique et l'entraînement de la politique de suivi par apprentissage par renforcement. Le problème est connu : transposer une séquence de mouvement humaine capturée sur un robot aux articulations différentes génère systématiquement des artefacts physiques rédhibitoires, glissement de pieds, auto-collisions ou trajectoires dynamiquement infaisables, qui dégradent l'imitation learning en aval. ReActor élimine ces pathologies en intégrant directement le retargeting dans la simulation physique, avec un gradient approximé pour le niveau supérieur de l'optimisation et un ensemble sparse de correspondances sémantiques entre corps rigides. Aucun réglage manuel n'est requis. Le framework a été validé en simulation et sur hardware réel, notamment sur un quadrupède, morphologie particulièrement éloignée du référentiel humain. Ce résultat cible un goulet d'étranglement concret dans les pipelines d'imitation learning : la majorité des démonstrations actuelles reposent sur des données de mouvement nettoyées à la main ou des trajectoires synthétiques, deux approches coûteuses qui freinent le passage à l'échelle. En garantissant la cohérence physique dès le retargeting, ReActor produit des données directement exploitables sans post-traitement, réduisant le cycle de production de policies. L'absence de tuning manuel est stratégique pour les intégrateurs : le même framework peut s'appliquer à des morphologies très différentes sans réingénierie spécifique. La validation hardware sur quadrupède renforce la crédibilité face à des travaux restés confinés au sim-to-sim. Ce champ de recherche s'est intensifié avec l'essor des modèles d'action visuels (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui exigent de larges corpus de démonstrations physiquement cohérentes pour généraliser. ReActor se positionne face à des approches comme PHC ou MoCapAct en se distinguant par son couplage natif à la simulation physique plutôt qu'une correction post-hoc. Il s'agit pour l'instant d'un preprint académique sans partenariat industriel annoncé. La prochaine étape logique serait une validation sur robot humanoïde complet, où les contraintes dynamiques et les degrés de liberté supplémentaires rendent le problème encore plus sévère.

RecherchePaper
1 source
Correspondance de flux action-à-action
988arXiv cs.RO 

Correspondance de flux action-à-action

Des chercheurs proposent dans un preprint arXiv (arXiv:2506.07322v2, mis à jour en 2026) une nouvelle architecture de politique robotique baptisée A2A (Action-to-Action Flow Matching), qui remplace le point de départ aléatoire habituel des modèles de diffusion par une initialisation ancrée dans l'action proprioceptive précédente du robot. Concrètement, au lieu de générer une trajectoire d'action à partir d'un bruit gaussien pur, A2A encode une séquence d'états proprioceptifs historiques (positions articulaires, vitesses, couples) dans un espace latent de haute dimension, et utilise ce vecteur comme point de départ du processus de flow matching. Le résultat le plus saillant : A2A produit des actions de haute qualité en une seule étape d'inférence, contre plusieurs dizaines d'étapes pour les politiques par diffusion standard, ce qui réduit drastiquement la latence au moment de l'exécution. Les auteurs rapportent également une meilleure robustesse aux perturbations visuelles (changements d'éclairage, objets parasites) et une généralisation supérieure à des configurations non vues durant l'entraînement. L'enjeu industriel est direct : la latence d'inférence est l'un des principaux verrous à l'adoption des politiques diffusion pour le contrôle temps-réel sur des manipulateurs ou des humanoïdes. Les architectures comme Diffusion Policy (Chi et al., 2023) ou Pi-0 de Physical Intelligence ont démontré une expressivité remarquable, mais leur coût computationnel par pas de contrôle reste prohibitif à haute fréquence. En ramenant l'inférence à un seul pas, A2A ouvre la voie à des boucles de contrôle plus rapides sans sacrifier la qualité des trajectoires, une contrainte particulièrement critique pour les tâches de manipulation dextre ou les robots mobiles en environnement dynamique. Le fait que la méthode tire parti de la continuité temporelle du mouvement, plutôt que de l'ignorer comme une condition statique, représente un changement de paradigme dans la modélisation des politiques robotiques. A2A s'inscrit dans la continuité des travaux sur le flow matching (Lipman et al., 2022), une alternative au processus de diffusion de Langevin qui permet des trajectoires plus droites dans l'espace latent et donc moins d'étapes d'intégration. Les politiques par diffusion pour la robotique ont émergé comme standard de facto entre 2023 et 2025, portées par des travaux comme ACT, Diffusion Policy et plus récemment GR00T N2 de NVIDIA ou Pi-0. A2A se positionne comme une optimisation d'inférence sur ce paradigme plutôt qu'une rupture architecturale. Les auteurs étendent également la méthode à la génération vidéo, suggérant une applicabilité au-delà du contrôle moteur pur. Le projet dispose d'un site public, mais aucun déploiement industriel ni partenariat n'est annoncé à ce stade : il s'agit d'une contribution académique à valider sur des benchmarks plus larges avant toute intégration en production.

RechercheOpinion
1 source
Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde
989arXiv cs.RO 

Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde

Des chercheurs présentent sur arXiv (2605.06222) une méthode d'exécution adaptative pour les World Action Models (WAMs), une famille d'architectures de manipulation robotique qui prédisent simultanément les observations visuelles futures et les séquences d'actions à exécuter. Le problème structurel de ces systèmes est qu'ils exécutent un nombre fixe d'actions prédites après chaque inférence, sans vérifier si le déroulé physique réel correspond à l'état "imaginé" par le modèle. Pour y remédier, les auteurs proposent FFDC (Future Forward Dynamics Causal Attention), un vérificateur léger qui croise en temps réel les actions prédites, la dynamique visuelle anticipée, les observations caméra actuelles et les instructions en langage naturel, pour décider si le plan reste valide ou s'il faut déclencher une nouvelle inférence plus tôt. Ce module est couplé à une stratégie d'entraînement baptisée Mixture-of-Horizon Training, conçue pour améliorer la couverture des trajectoires longues. Sur le benchmark RoboTwin, FFDC réduit le nombre de passes avant du modèle de 69,10 % et le temps d'exécution de 34,02 %, avec un taux de succès en hausse de 2,54 % par rapport à une baseline à chunk court. En conditions réelles, le gain atteint 35 % de succès supplémentaire, bien que le nombre d'essais et les tâches testées ne soient pas précisés dans ce préprint. L'apport principal est de résoudre un compromis structurel qui freine le déploiement industriel des robots manipulateurs : réinférer fréquemment est réactif mais coûteux en calcul, tandis qu'exécuter de longues séquences prédites est efficace mais aveugle aux imprévus. FFDC introduit une troisième voie, où la taille du chunk d'action devient une variable émergente pilotée par la cohérence entre imagination et réalité. Ce mécanisme est particulièrement critique pour les phases de contact riche, où un décalage millimétrique entre état prédit et état réel suffit à faire échouer une saisie, et représente une avancée concrète vers des WAMs opérationnels hors environnement contrôlé. Les WAMs s'inscrivent dans la dynamique plus large des modèles d'actions visuelles et langagières (VLAs), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou RT-2 et ses successeurs chez Google DeepMind. Leur spécificité est d'intégrer explicitement une prédiction de l'état visuel futur pour planifier à plus long horizon. Ce préprint, sans affiliation industrielle déclarée, n'est pas encore évalué par les pairs. La prochaine étape naturelle serait une validation sur des benchmarks standardisés plus larges et des pilotes en environnement industriel non structuré.

IA physiqueOpinion
1 source
AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele
990arXiv cs.RO 

AnyPos : des actions automatisées indépendantes de la tâche pour la manipulation bimanuele

Une équipe de chercheurs a publié sur arXiv (référence 2507.12768) AnyPos, un pipeline d'apprentissage automatisé conçu pour la manipulation bimane généraliste. Le système repose sur un principe de modélisation dite "task-agnostic" : au lieu d'entraîner le robot sur des trajectoires liées à des tâches précises, AnyPos génère à grande échelle des paires image-action indépendantes couvrant l'ensemble de l'espace de travail atteignable. Ces données alimentent un apprentissage par dynamique inverse, combinant un décodeur directionnel et une séparation explicite entre les mouvements du bras et de l'effecteur terminal, pour stabiliser les prédictions en dehors de la distribution d'entraînement. Testée sur cinq tâches domestiques (actionner un micro-ondes, griller du pain, plier des vêtements, arroser des plantes, frotter des assiettes), l'approche améliore les taux de réussite de 30 à 40% par rapport aux baselines de référence, avec un gain de 51% en précision sur les évaluations test. Ce résultat pointe un problème structurel du secteur : la rareté des données de manipulation robotique et leur entanglement avec une plateforme ou une tâche spécifique. La plupart des politiques visuomotrices actuelles, qu'il s'agisse de VLA (vision-language-action models) ou de diffusion policies, nécessitent des données séquentielles coûteuses à collecter et quasiment non transférables entre robots. En découplant la modélisation de l'embodiment de l'apprentissage de politique de haut niveau, AnyPos propose une réutilisation des données d'action cross-tâches et cross-plateformes, sans modèle physique explicite ni simulation intensive. L'argument est directement dirigé contre le "sim-to-real gap" : les représentations sont ici apprises depuis des données réelles générées automatiquement à grande échelle, contournant les biais de simulation. L'approche rejoint une tendance récente consistant à séparer embodiment modeling et politique de haut niveau, visible chez Physical Intelligence (modèle pi0), Figure AI ou 1X Technologies. Elle se distingue par son refus de la télé-opération intensive ou de la simulation massive, préférant une exploration automatisée du workspace réel. Le pipeline est conçu pour se coupler à des modèles de politique existants, le positionnant potentiellement comme une couche de préentraînement réutilisable et échangeable. L'article ne mentionne ni déploiement industriel, ni partenariat commercial : AnyPos reste à ce stade une contribution de recherche académique, sans timeline de mise en production annoncée.

RechercheOpinion
1 source
Paramétrage adaptatif des scans pour l'inspection robotique par plongements vision-langage et calcul hyperdimensionnel
991arXiv cs.RO 

Paramétrage adaptatif des scans pour l'inspection robotique par plongements vision-langage et calcul hyperdimensionnel

Des chercheurs ont publié le 6 mai 2026 (arXiv:2605.03909) ScanHD, un système qui configure automatiquement les paramètres d'un profilomètre laser monté sur robot à partir d'une image RGB pré-scan et d'une instruction en langage naturel. Les cinq paramètres ciblés, à savoir fréquence d'échantillonnage, plage de mesure, temps d'exposition, dynamique du récepteur et illumination, sont aujourd'hui réglés manuellement par essais-erreurs dans l'industrie. Pour évaluer l'approche, les auteurs ont constitué Instruct-Obs2Param, un jeu de données multimodal réel portant sur 16 objets avec variations de pose et d'éclairage multi-vues. ScanHD atteint 92,7 % de précision exacte et 98,1 % de Win@1 sur les cinq paramètres, avec une latence d'inférence compatible avec un déploiement industriel, et surpasse les heuristiques à base de règles ainsi que les grands modèles de langage multimodaux (MLLM). L'enjeu concret dépasse la seule inspection de surface : tout intégrateur déployant des cellules de contrôle dimensionnel automatisées dans l'automobile, l'aéronautique ou l'électronique de précision est exposé aux conséquences d'un mauvais réglage capteur, notamment la saturation, l'écrêtage ou les retours manquants qui ne peuvent pas être corrigés en post-traitement. Que ScanHD surpasse les MLLM sur cette tâche est significatif : le calcul hyperdimensionnel (HDC), qui encode instructions et observations dans des vecteurs binaires de très haute dimension pour un raisonnement associatif compact, semble offrir un avantage structurel sur les tâches de correspondance discrète à faible latence, là où les LLM génératifs tendent à sur-généraliser ou à produire des réponses instables. Le HDC est un paradigme computationnel issu des travaux de Pentti Kanerva dans les années 1980-1990, qui connaît un regain d'intérêt pour les applications embarquées grâce à sa compacité mémoire et son interprétabilité, en contraste avec les architectures transformers. ScanHD s'inscrit dans le courant des modèles vision-langage appliqués à la robotique, un espace aujourd'hui dominé par pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI), mais il se distingue en ciblant la configuration du capteur plutôt que les actions du robot. Aucun partenaire industriel ni calendrier de déploiement ne figurent dans la publication : l'article reste au stade de la validation expérimentale sur banc de test.

UELes intégrateurs européens de cellules de contrôle dimensionnel automatisées (automobile, aéronautique, électronique de précision) sont directement concernés par la problématique du réglage manuel des capteurs laser, mais aucun transfert industriel ni partenariat EU n'est prévu à ce stade.

RecherchePaper
1 source
Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation
992arXiv cs.RO 

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation

Une étude soumise en mai 2025 sur arXiv (référence 2605.00963) présente une analyse par ablation d'un système de manipulation robotique piloté par interaction homme-robot multimodale, appliqué à une tâche de détection et saisie d'objets. Les chercheurs ont ciblé trois modules du pipeline : le modèle de langage chargé d'extraire les actions à partir d'instructions verbales, le système de perception assurant l'ancrage visuel des objets cibles, et le contrôleur gérant l'exécution du mouvement. L'étude compare trois LLM distincts, cinq configurations de perception, et trois contrôleurs, avant de soumettre les meilleures combinaisons à une analyse factorielle croisée en seconde phase. L'objectif déclaré n'est pas de redessiner le pipeline, mais d'isoler la contribution de chaque composant sous un protocole expérimental commun. Cette approche répond à une question directement actionnable pour les intégrateurs et ingénieurs robotiques : quel module optimiser en priorité pour améliorer le taux de succès, et lequel pour réduire le temps d'exécution ? Dans un contexte industriel, ces deux métriques obéissent à des contraintes distinctes selon les postes de travail, et les confondre dans une évaluation globale masque les vrais leviers d'amélioration. La méthodologie par ablation reste encore rare dans les publications de manipulation robotique, où la tendance est d'évaluer un seul composant à la fois, ce qui rend les résultats difficiles à reproduire ou à transposer d'un système à l'autre. Les auteurs précisent que l'analyse vise aussi à orienter les choix d'ingénierie dans les prochaines versions du système. Ce travail s'inscrit dans un effort plus large de la communauté pour rendre opérationnels les pipelines de manipulation guidés par langage hors des environnements contrôlés de laboratoire. Sur le plan concurrentiel, deux écoles s'affrontent actuellement : les modèles unifiés de type VLA (Vision-Language-Action) entraînés à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, et les pipelines modulaires qui préservent la séparabilité des composants pour faciliter le débogage et l'adaptation sectorielle. L'étude n'annonce pas de déploiement industriel et reste pour l'instant au stade de la validation expérimentale. La prochaine étape logique serait de tester si les gains mesurés en laboratoire résistent au sim-to-real gap, qui demeure le principal obstacle à la mise en production des systèmes de manipulation guidés par instructions en langage naturel.

RecherchePaper
1 source
Organisation robotique de bureau : une approche multi-primitive pour manipuler des objets hétérogènes via les contraintes environnementales
993arXiv cs.RO 

Organisation robotique de bureau : une approche multi-primitive pour manipuler des objets hétérogènes via les contraintes environnementales

Une équipe de recherche a déposé sur arXiv (référence 2605.02135, mai 2025) un framework de manipulation pour robots de service dédié à l'organisation de bureaux, capable de traiter simultanément des objets rigides et déformables posés à plat sur une surface. Le système repose sur trois primitives de manipulation exploitant l'environnement physique : un saisissement par contact direct pour les petits objets, un push-grasp assisté par le bord de la table pour les objets rigides plans, et un geste de levering (soulèvement par effet de levier) pour les objets déformables plans comme des feuilles de papier ou des pochettes. Un pipeline de perception géométrique, entraîné sur des datasets augmentés d'objets de bureau peu courants, assure l'estimation de pose et la détection des contraintes physiques disponibles, notamment les arêtes de table. Un planificateur de tâches orchestre ces primitives pour des séquences multi-objets incluant collecte et empilement. Les expériences en conditions réelles démontrent la robustesse de l'approche, et le code source ainsi que les vidéos sont publiés en accès libre. L'intérêt principal de ce travail est l'exploitation systématique des contraintes environnementales comme ressource de manipulation plutôt que comme obstacle, une inversion de perspective qui améliore la robustesse sans nécessiter de hardware dédié tel que ventouses ou pinces spécialisées. La gestion des objets déformables, longtemps considérée comme un verrou pour les robots de service, est ici abordée sans apprentissage end-to-end, ce qui favorise la traçabilité et le débogage en contexte d'intégration industrielle. Pour un intégrateur ou un COO logistique, ce type de framework à primitives explicites est plus directement industrialisable que les approches VLA (Vision-Language-Action) dont la robustesse en déploiement réel à grande échelle reste discutée dans la littérature. Ce travail s'inscrit dans le courant du task-and-motion planning (TAMP), qui cherche à combiner la robustesse des primitives classiques avec la flexibilité perceptive nécessaire aux environnements non structurés, en alternative aux méthodes d'imitation ou de reinforcement learning pur. Il se positionne sans atteindre encore leur généralisabilité sur de larges catalogues d'objets, ce qui constitue la limite principale de l'approche. Les acteurs actifs sur la manipulation fine de bureau incluent Google DeepMind avec ses travaux RT-2 et π0, Physical Intelligence, et côté académique des labos comme ETH Zurich ou CMU ; aucun acteur francophone ou européen n'est directement impliqué dans ce papier. Les suites naturelles seraient d'étendre ces primitives à des objets tridimensionnels non plans et d'évaluer le passage à l'échelle sur des manipulateurs commerciaux comme le Kinova Gen3 ou le Franka Research 3.

RecherchePaper
1 source
CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche
994arXiv cs.RO 

CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche

Une équipe de chercheurs propose CoRAL (Contact-Rich Adaptive LLM-based control), un framework publié en preprint sur arXiv (2605.02600) en mai 2025, conçu pour résoudre l'une des limites persistantes des grands modèles de langage appliqués à la robotique : la manipulation en contact riche, c'est-à-dire les tâches nécessitant des interactions physiques précises et réactives. L'architecture repose sur un découplage strict entre raisonnement de haut niveau et exécution de bas niveau. Contrairement aux approches VLA (Vision-Language-Action) qui emploient le modèle comme contrôleur direct, CoRAL utilise le LLM comme concepteur de fonctions de coût pour un planificateur par échantillonnage (MPPI, Model Predictive Path Integral). Un VLM fournit des priors sémantiques sur les paramètres physiques de l'environnement - masse et friction - affinés en temps réel par identification de système en ligne, tandis qu'une mémoire par récupération permet de réutiliser des stratégies validées sur des tâches récurrentes. Sur des scénarios incluant le retournement d'objets contre des murs via des contacts extrinsèques, CoRAL affiche un taux de succès supérieur de plus de 50 % en moyenne aux baselines VLA testées, sur des tâches jamais vues en entraînement, aussi bien en simulation que sur hardware réel. L'intérêt principal pour les intégrateurs réside dans la résilience au gap sim-to-real : en adaptant dynamiquement sa représentation des paramètres physiques lors des premières interactions, le système corrige en vol ses erreurs stratégiques sans nécessiter de re-entraînement. La séparation raisonnement/exécution garantit en outre une stabilité temps réel, le LLM étant par nature trop lent pour s'insérer dans une boucle de contrôle réactif. C'est un argument concret contre les VLA pures, qui peinent précisément sur les tâches à fort contact car leurs politiques apprises ne s'adaptent pas aux incertitudes physiques non vues. Le gain de 50 % mérite cependant d'être pondéré : les baselines exactes et le périmètre précis des tâches de test ne sont pas détaillés dans le résumé, et ce travail reste un preprint non relu par les pairs. CoRAL s'inscrit dans un champ de recherche actif qui cherche à hybrider planification symbolique et modèles de fondation pour dépasser les limites des VLA comme Pi-0 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA. Ces modèles ont montré des capacités convaincantes sur des tâches de manipulation standards mais buttent sur les contacts complexes et les environnements non vus. Le planificateur MPPI est une méthode stochastique éprouvée en robotique, ce qui ancre CoRAL dans un socle technique solide plutôt que dans une approche purement émergente. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade - la prochaine étape naturelle serait une validation sur un spectre plus large de tâches industrielles, comme l'assemblage ou la manipulation d'objets déformables, pour mesurer la généralisation réelle de l'approche.

RecherchePaper
1 source
Des étiquettes aux ensembles d'actions : repenser la supervision pour l'apprentissage par imitation à partir de retours correctifs
995arXiv cs.RO 

Des étiquettes aux ensembles d'actions : repenser la supervision pour l'apprentissage par imitation à partir de retours correctifs

Le comportement par clonage (behavior cloning, BC) est l'une des méthodes les plus utilisées pour entraîner des politiques robotiques à partir de démonstrations humaines : chaque geste fourni par l'opérateur y est traité comme une étiquette exacte à reproduire. Des chercheurs ont publié en février 2025 (arXiv:2502.07645, version 3 disponible) une alternative baptisée CLIC, Contrastive policy Learning from Interactive Corrections, qui remplace ces étiquettes ponctuelles par des cibles dites à ensemble de valeurs (set-valued action targets). Au lieu d'optimiser la politique vers un seul geste cible, CLIC utilise les corrections humaines en temps réel pour construire et affiner des ensembles d'actions désirées, puis entraîne le modèle à placer de la masse de probabilité sur cet ensemble plutôt que sur un point unique. Cette reformulation adresse un problème connu mais sous-estimé du BC classique : lorsque les démonstrations humaines sont imparfaites, gestes partiels, corrections relatives ("un peu plus à gauche"), ambiguïtés multimodales, forcer la politique à reproduire chaque label à la lettre peut la faire dériver loin du comportement voulu, notamment avec des modèles expressifs tels que les energy-based models (EBMs). Les expériences en simulation et sur robot réel montrent que CLIC reste compétitif avec l'état de l'art quand les données sont propres, et se révèle substantiellement plus robuste sous données bruitées, corrections relatives ou feedback partiel. Pour les équipes de déploiement robotique, c'est une voie concrète pour réduire les coûts de collecte de démonstrations de haute qualité : CLIC tolère des opérateurs moins expérimentés ou des interfaces de téléopération imprécises sans dégradation majeure des performances. Le BC reste une brique fondamentale de l'apprentissage par imitation, popularisé par les travaux de Pieter Abbeel au début des années 2000 et au coeur aujourd'hui des politiques VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou les politiques diffusion-based d'OpenPI. CLIC s'inscrit dans un courant "human-in-the-loop" qui inclut DAgger, HG-DAgger et TAMER, mais se distingue par la formalisation ensembliste des corrections. Le code et les environnements de test sont disponibles publiquement sur clic-webpage.github.io. Les auteurs n'annoncent pas de partenariat industriel ni de déploiement terrain, ce qui positionne ce travail comme une contribution aux fondations méthodologiques de l'imitation learning, avec des implications directes pour les pipelines de téléopération et de fine-tuning de politiques générales.

UEImpact indirect : la méthode CLIC, en réduisant les besoins en démonstrations de haute qualité, pourrait bénéficier aux équipes de R&D robotique européennes travaillant sur des pipelines d'imitation learning et de téléopération, sans lien direct avec un acteur français ou une réglementation UE.

RechercheOpinion
1 source
Modèle VLA GazeVLA : apprendre l'intention humaine pour la manipulation robotique
996arXiv cs.RO 

Modèle VLA GazeVLA : apprendre l'intention humaine pour la manipulation robotique

Une équipe de recherche a publié fin avril 2026 (arXiv:2604.22615) GazeVLA, un framework de manipulation robotique qui exploite le regard humain comme représentation intermédiaire de l'intention. L'approche repose sur un préentraînement du modèle sur un large corpus de vidéos égocentrées humaines, puis un fine-tuning sur un ensemble réduit de données robotiques et humaines combinées. Lors de l'inférence, le modèle adopte un raisonnement en chaîne (Chain-of-Thought) : il prédit d'abord la cible de fixation oculaire, c'est-à-dire l'intention, avant d'exécuter l'action motrice. Les évaluations couvrent des tâches longues-horizon et de manipulation fine-grained, en simulation et en conditions réelles, avec des benchmarks few-shot et de robustesse. Le modèle surpasse les baselines comparées sur l'ensemble des scénarios testés et atteint l'état de l'art annoncé, bien que le papier reste un preprint sans validation industrielle tierce. Le vrai enjeu de GazeVLA est économique autant que technique : collecter des démonstrations robotiques à grande échelle coûte cher et ralentit le déploiement des VLA (Vision-Language-Action models) dans des environnements industriels variés. L'abondance de vidéos égocentrées humaines, corpus comme Ego4D ou EPIC-Kitchens comptent des milliers d'heures, offre une source de données bon marché, mais le "embodiment gap" rendait leur transfert direct peu fiable. En intercalant la prédiction de gaze comme signal d'intention universel, le framework réduit ce gap sans exiger de grands volumes de démonstrations robot-spécifiques. La capacité few-shot est particulièrement pertinente pour des intégrateurs industriels qui ne peuvent pas se permettre des campagnes de collecte coûteuses pour chaque nouvelle tâche ou ligne de production. GazeVLA s'inscrit dans une compétition dense autour des architectures VLA généralisables : Physical Intelligence (pi-0), OpenVLA (UC Berkeley), Octo, et plus récemment GR00T N2 de NVIDIA cherchent tous à réduire la dépendance aux données robotiques propriétaires. L'angle "intention via gaze" n'est pas entièrement nouveau, des travaux antérieurs comme R3M ou DINObot ayant déjà exploré le préentraînement sur vidéos humaines, mais l'explicitation de la fixation oculaire comme étape de raisonnement séquentiel est une contribution distincte. Aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade, et les auteurs ne mentionnent pas d'affiliations avec des acteurs européens. Les prochaines étapes logiques seraient un test à plus grande échelle sur des robots commerciaux (Franka, UR) et une validation sur des tâches industrielles standardisées.

RechercheOpinion
1 source
Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise
997arXiv cs.RO 

Méthode reproductible de sensibilisation à la robotique par interaction LLM : résultats d'un défi d'entreprise

Une équipe de chercheurs a conçu et testé une méthode de sensibilisation à la robotique en milieu industriel réel, en déployant un robot humanoïde contrôlé par un grand modèle de langage (LLM) lors d'un événement interne organisé par AD Ports Group aux Émirats arabes unis. Les employés du groupe portuaire, sans formation préalable en robotique, ont interagi avec le robot via des commandes vocales dans un environnement d'exercice inspiré de la logistique, structuré en équipes avec des rôles attribués. Au terme de l'activité, un questionnaire resté ouvert 16 jours a recueilli 102 réponses. La satisfaction globale atteint 8,46/10, l'intérêt déclaré pour la robotique et l'IA 4,47/5, et la compréhension des nouvelles formes de collaboration homme-robot 4,45/5. Les participants ayant interagi directement avec le robot ont évalué la naturalité de l'échange à 4,37/5 et la progression de la facilité d'interaction à 4,74/5. Les scores concernant la fiabilité et la prédictibilité du robot restent en revanche sensiblement plus bas, ce que les auteurs identifient comme un défi technique à adresser. Ce travail fournit l'une des rares mesures quantitatives issues d'un déploiement en organisation réelle, hors contexte laboratoire, sur l'efficacité des LLM comme interface d'entrée en robotique pour des non-spécialistes. Pour les décideurs industriels et les intégrateurs, il valide un format concret d'onboarding technique : une activité compétitive courte peut suffire à modifier la perception et l'appétence pour la robotique collaborative. La méthode est présentée comme réplicable, ce qui est significatif pour des groupes industriels cherchant à préparer leurs effectifs à des déploiements d'IA incarnée sans passer par une formation longue. L'exploration des LLM comme couche de contrôle en langage naturel pour les robots s'intensifie depuis 2023, portée notamment par des architectures comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), mais les preuves d'usage en conditions industrielles non contrôlées restent rares. AD Ports Group, opérateur de ports et de zones logistiques parmi les plus importants du Moyen-Orient, constitue un terrain d'expérimentation pertinent. L'étude ne précise pas le modèle de robot humanoïde utilisé ni l'architecture LLM sous-jacente, une limite notable pour qui voudrait reproduire l'approche. Les prochaines étapes annoncées portent sur l'amélioration de la fiabilité perçue et la réplication de la méthode dans d'autres contextes opérationnels industriels.

UELa méthodologie réplicable d'onboarding robotique par interaction LLM peut être directement adoptée par des groupes industriels français et européens pour préparer leurs effectifs aux déploiements de robots collaboratifs sans formation longue.

RecherchePaper
1 source
Contrôle d'admittance sensible aux torseurs pour la manipulation de charges utiles inconnues
998arXiv cs.RO 

Contrôle d'admittance sensible aux torseurs pour la manipulation de charges utiles inconnues

En avril 2026, des chercheurs ont présenté sur arXiv (réf. 2604.19469) un framework de contrôle en admittance pour la manipulation robotique d'objets à masse inconnue, validé expérimentalement sur un bras UR5e de Universal Robots. Lorsque le centre de masse d'un objet saisi ne coïncide pas avec le point central outil (TCP), la charge génère un couple parasite au poignet, amplifié par l'inertie de l'objet pendant le déplacement. Sans compensation, ce couple est interprété par le contrôleur comme une force d'interaction extérieure, déclenchant des déviations de trajectoire, des erreurs de suivi et une précision de dépose dégradée. La solution exploite le capteur force-couple du poignet selon deux modes séquentiels : une excitation translationnelle sur trois axes atténue l'effet de la charge en transit sans raidir le robot, puis, après la saisie, le contrôleur estime successivement la masse de l'objet et l'offset de son centre de masse par rapport au TCP en analysant les mesures collectées lors du mouvement. Pour les intégrateurs industriels, ce travail cible un problème récurrent : adapter un cobot à des lignes à références multiples sans recalibration manuelle à chaque changement de produit. Les contrôleurs en admittance sont le standard de fait pour les applications collaboratives (ISO/TS 15066), mais leur sensibilité aux perturbations non modélisées au niveau du capteur de couple les rend fragiles sur des tâches d'empilage ou de palettisation à charges variables. La méthode démontre qu'il est possible de préserver la compliance mécanique, garante de la cohabitation humain-robot, tout en corrigeant activement les biais de charge, sans recours à l'apprentissage par renforcement. Les résultats expérimentaux indiquent des gains en transport et en précision de dépose par rapport à la commande non corrigée, bien que l'abstract ne fournisse pas de métriques quantitatives détaillées permettant d'évaluer l'ampleur réelle des améliorations. Le contrôle en admittance, formalisé par Neville Hogan au MIT dans les années 1980, est aujourd'hui intégré nativement dans les plateformes Universal Robots et Franka Robotics. Ce travail s'inscrit dans un courant concurrent des approches VLA (vision-language-action) portées par Physical Intelligence (pi-0) ou Google DeepMind, qui misent sur l'apprentissage massif plutôt que sur la modélisation analytique de la physique. L'avantage différenciant de cette approche est sa traçabilité pour la certification industrielle et l'absence totale de données d'entraînement. Les extensions naturelles incluent la prise en compte des couples en rotation et la validation sur des architectures multi-bras pour la manipulation coordonnée d'objets asymétriques.

UECette méthode de contrôle en admittance robuste aux charges inconnues est directement applicable aux cobots UR5e (Universal Robots, Danemark) et Franka (Allemagne) largement déployés dans l'industrie européenne, facilitant la conformité ISO/TS 15066 sur les lignes à références multiples sans recalibration manuelle.

RecherchePaper
1 source
Raffinement de démonstrations accélérées par contrôle itératif incrémental pour l'apprentissage par imitation à contact riche
999arXiv cs.RO 

Raffinement de démonstrations accélérées par contrôle itératif incrémental pour l'apprentissage par imitation à contact riche

Une équipe de chercheurs a publié en avril 2026 sur arXiv (arXiv:2604.16850) une méthode baptisée I2RLC (Incremental Iterative Reference Learning Control) pour générer automatiquement des démonstrations robotiques rapides et précises, sans intervention humaine à haute vitesse. Le constat de départ est simple : en apprentissage par imitation (IL), les humains ne peuvent pas démontrer physiquement une tâche à 5x ou 10x leur vitesse naturelle, et accélérer naïvement un enregistrement dégrade la dynamique de contact et crée des erreurs de suivi qui corrompent les données d'entraînement. L'I2RLC résout ce problème en augmentant progressivement la vitesse d'exécution tout en corrigeant itérativement la trajectoire de référence à partir des erreurs observées. La méthode a été validée sur robot réel, sur deux tâches à contact riche : effacement de tableau blanc et insertion cheville-trou (peg-in-hole), en utilisant un système de téleopération composé d'un bras suiveur à contrôle de compliance et d'un leader haptic imprimé en 3D. Les résultats atteignent des démonstrations 10x plus rapides avec réduction des erreurs de suivi, et I2RLC améliore la similarité spatiale aux trajectoires originales de 22,5 % en moyenne par rapport à la version non-incrémentale (IRLC), sur trois tâches et plusieurs vitesses (3x à 10x). Les politiques entraînées sur ces données atteignent 100 % de taux de réussite sur la tâche peg-in-hole, y compris pour des positions non vues à l'entraînement, avec des forces de contact inférieures. Ce résultat adresse un angle mort fréquent dans le développement des politiques d'imitation : la qualité des démonstrations elle-même. La grande majorité des approches IL (Diffusion Policy, ACT, Pi-0) suppose des démos propres et représentatives, sans se préoccuper du fossé entre la vitesse humaine et la vitesse de déploiement réelle. Ici, la généralisation à des positions non vues avec 100 % de succès constitue un signal concret de robustesse, pas simplement une performance en conditions contrôlées. Pour les intégrateurs industriels, l'enjeu est direct : si l'on peut automatiser la génération de trajectoires rapides à partir de démos lentes, le coût de collecte de données pour des tâches d'assemblage ou de manutention chute significativement. L'apprentissage par imitation pour la manipulation à contact riche est un axe de recherche très actif depuis 2022-2023, porté par des travaux comme ACT (Stanford), Diffusion Policy (MIT/Columbia) et les architectures VLA type Pi-0 (Physical Intelligence). Le problème de la "vitesse des démos" reste cependant peu traité dans la littérature. L'I2RLC s'inscrit dans une lignée de méthodes de contrôle itératif (ILC) adaptées à la robotique apprenante. Aucune entreprise commerciale n'est citée dans cette publication académique, mais les applications industrielles naturelles touchent l'assemblage électronique, le câblage, et toute manipulation nécessitant précision et cadence. Les prochaines étapes probables incluent une extension aux politiques diffusives modernes et une validation sur des tâches multi-étapes en environnement non structuré.

RecherchePaper
1 source
COFFAIL : un jeu de données sur les succès et anomalies d'exécution de compétences robotiques pour la préparation du café
1000arXiv cs.RO 

COFFAIL : un jeu de données sur les succès et anomalies d'exécution de compétences robotiques pour la préparation du café

L'équipe derrière COFFAIL a publié sur arXiv (référence 2604.18236) un jeu de données consacré à l'apprentissage de compétences robotiques de manipulation, collecté dans un environnement cuisine avec un robot physique. Le dataset couvre plusieurs types de tâches liées à la préparation de café et se distingue par une caractéristique rare dans la littérature : il regroupe à la fois des épisodes d'exécution réussis et des épisodes anomaux, c'est-à-dire des séquences où quelque chose s'est mal passé. Certains épisodes mobilisent une manipulation bimanuell, impliquant la coordination des deux bras du robot. Les auteurs démontrent l'usage concret du dataset en entraînant une politique robotique par imitation learning (apprentissage par démonstration). Ce qui distingue COFFAIL des datasets de manipulation habituellement disponibles, c'est l'inclusion explicite des échecs et des anomalies. La grande majorité des benchmarks publics ne documentent que les trajectoires réussies, ce qui crée un biais structurel dans l'entraînement des modèles : les robots apprennent à réussir, mais pas à détecter ni à récupérer d'une défaillance. Pour les intégrateurs industriels et les équipes de recherche travaillant sur la robustesse et la détection d'anomalies en manipulation, disposer d'exemples négatifs annotés est une ressource directement exploitable, notamment pour entraîner des modules de supervision ou de re-planification. L'application à l'imitation learning suggère aussi une compatibilité avec les architectures VLA (vision-language-action) actuelles. La préparation de café comme domaine applicatif est un choix délibéré dans la robotique de service : c'est une tâche suffisamment structurée pour être reproductible, mais qui implique des objets déformables, des liquides, et des contraintes temporelles, ce qui en fait un banc de test représentatif pour la manipulation fine. Plusieurs labos et startups ont utilisé des scénarios similaires pour tester leurs pipelines, dont Physical Intelligence (pi0), Everyday Robots (avant sa dissolution chez Google) ou des équipes académiques européennes. COFFAIL reste pour l'instant une contribution de dataset sans benchmarking comparatif avec d'autres méthodes, ce qui limite la portée des conclusions : le papier est court et déclaré comme tel par les auteurs. Les prochaines étapes naturelles seraient une évaluation comparative sur des tâches de détection d'anomalies et une extension du protocole à d'autres domaines de manipulation.

UELes équipes de recherche européennes en manipulation robotique peuvent exploiter ce dataset pour entraîner des modules de détection d'anomalies, mais aucun acteur FR/EU n'est directement impliqué dans sa production.

RecherchePaper
1 source