Aller au contenu principal

Dossier Manipulation robotique

614 articles

La manipulation robotique : pinces dextres, peau électronique, grasping, benchmarks de tâches fines, le goulot d'étranglement principal des humanoïdes.

1arXiv cs.RO RecherchePaper

Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents

Traduction en cours. Ce papier de recherche s'attaque à un problème central de la manipulation robotique : la fragilité d'exécution face à l'incertitude et aux tâches longues, où une petite déviation peut faire échouer toute une séquence d'actions. Les modèles vision-langage-action (VLA) actuels, malgré leurs bonnes capacités de généralisation, manquent de mécanismes explicites pour détecter qu'une exécution dérape et pour s'en remettre. Les auteurs proposent deux contributions complémentaires : des métriques permettant d'évaluer en temps réel la qualité de l'exécution, et un cadre d'apprentissage par renforcement dit "agentique", où une politique de haut niveau observe l'historique récent d'exécution et choisit parmi un petit ensemble de modes d'exécution pour réguler le comportement du robot. Plutôt que de réapprendre directement les actions bas niveau, cette politique déclenche des mécanismes de récupération qui ramènent le robot vers des états nominaux déjà visités, permettant à la tâche de reprendre son cours. Testée sur le benchmark LIBERO, la méthode améliore le taux de réussite jusqu'à 13,7% en conditions standards, et jusqu'à 39,2% en conditions perturbées. L'enjeu dépasse la simple performance chiffrée : c'est une réponse directe à l'écart entre démonstration et réalité qui pénalise l'industrie humanoïde et les intégrateurs. Un modèle VLA capable d'enchaîner des tâches en laboratoire s'effondre souvent dès qu'un objet glisse, qu'un capteur bruite, ou qu'une perturbation externe survient sur une ligne réelle. En ajoutant une couche de supervision qui détecte la dérive et enclenche une correction plutôt que de laisser le modèle bas niveau tenter d'improviser, cette approche s'attaque directement à la robustesse, le principal frein à la mise en production de bras manipulateurs et d'humanoïdes en environnement industriel non contrôlé. Le gain nettement plus marqué en conditions perturbées (39,2%) qu'en conditions standards (13,7%) suggère que le bénéfice réel se manifeste précisément là où les décideurs B2B en ont besoin: en présence d'aléas, pas en démo scriptée. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles VLA généralistes (dans la veine de Pi-0 ou GR00T N2), qui ont démontré une capacité de généralisation impressionnante mais restent critiqués pour leur manque de garanties d'exécution en conditions réelles. En séparant la décision de haut niveau (quel mode d'exécution adopter) de l'apprentissage bas niveau des actions, les auteurs évitent de devoir réentraîner l'ensemble du modèle VLA pour gagner en robustesse, une approche modulaire qui pourrait s'intégrer à des piles existantes plutôt que les remplacer. Reste à voir si cette architecture agentique se transpose au-delà du benchmark simulé LIBERO vers des déploiements physiques réels, où la latence de décision et la diversité des modes de défaillance sont bien plus complexes qu'en simulation.

1 source
2arXiv cs.RO 

Robot industriel d'évaluation de dextérité : une plateforme matérielle et logicielle pour le benchmarking de la manipulation dextre industrielle

La revue arXiv a publié ce 14 juillet un article intitulé "Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation" (référence 2607.14021v1), qui propose un nouveau cadre de test pour l'automatisation industrielle fine. Les auteurs introduisent trois éléments : une série de plateaux de test baptisés Industrial Dexterity Benchmark (IDB), conçus pour reproduire trois scénarios concrets, le câblage de datacenters, les harnais de câbles automobiles et l'assemblage de boîtes de vitesses ; un framework d'apprentissage par imitation nommé DAG-ROS ; et une politique de contrôle basée sur la diffusion, AG-iDP3, qui fusionne images RGB, nuages de points, positions articulaires et données de force au poignet. Les tests se concentrent sur une tâche précise, le nettoyage d'un câble unique sur le plateau datacenter, évaluée sur 48 essais par configuration. La meilleure configuration, une Diffusion Policy multimodale combinant plusieurs caméras RGB via un encodeur R3M, atteint 78% de réussite combinée sur la prise et l'insertion, contre 36% pour la version à caméra unique. Chaque configuration n'a nécessité qu'environ 100 démonstrations téléopérées par phase de tâche. Ce résultat intéresse directement les intégrateurs industriels parce qu'il touche un point resté largement non résolu malgré des décennies de recherche en robotique : le câblage, l'insertion de connecteurs et l'assemblage de précision continuent de dépendre du travail manuel. L'écart de performance entre la version mono-caméra et la version multi-vues suggère que la robustesse des politiques apprises tient autant à la richesse des capteurs qu'à l'algorithme lui-même, un point utile pour quiconque évalue des solutions VLA ou d'apprentissage par imitation pour des lignes à haute disponibilité. Reste que l'échantillon de validation demeure limité, une seule tâche testée sur 48 essais par configuration, ce qui invite à la prudence avant d'extrapoler ces chiffres à d'autres cas d'usage. Ce travail s'inscrit dans une transition plus large observée dans la recherche en robotique industrielle, celle du passage des pipelines modulaires classiques, perception puis planification puis contrôle codés séparément, vers des architectures de bout en bout entraînées par imitation. Les benchmarks IDB visent à combler un manque identifié par les auteurs : l'absence de plateformes standardisées pour comparer objectivement les méthodes de manipulation dextre en environnement industriel. Aucun calendrier de déploiement commercial n'est mentionné à ce stade, l'article reste un travail de recherche publié en prépublication, sans partenariat industriel ni date de mise en production annoncés.

RecherchePaper
1 source
3arXiv cs.RO 

Réduction de récompense dense pour la manipulation robotique via synthèse d'échecs

Voici l'article en français : Des chercheurs présentent DenseReward, un modèle de récompense visio-linguistique conçu pour l'apprentissage par renforcement (RL) appliqué à la manipulation robotique, détaillé dans un article publié sur arXiv (2607.13033v1). Le système répond à deux limites connues des modèles de récompense existants : la difficulté de collecter des trajectoires d'échec à grande échelle et l'absence de signaux fins au-delà d'un simple label de succès ou d'échec en fin de trajectoire. Pour cela, les auteurs ont développé un pipeline automatisé qui synthétise en simulation des trajectoires d'échec physiquement réalistes, sans intervention humaine, couvrant des modes de défaillance variés : collisions, préhensions manquées, chutes d'objets et comportements de récupération. À partir de ces données, DenseReward prédit des scores de récompense image par image, à partir d'observations visuelles et d'instructions en langage naturel, permettant d'estimer la progression d'une tâche tout au long d'un épisode plutôt qu'un simple verdict final. Les expériences montrent que ce modèle surpasse à la fois des VLM généralistes et les modèles de récompense robotiques existants sur la prédiction de récompense dense, en simulation comme en conditions réelles. Cette avancée cible un goulot d'étranglement central du RL en robotique : sans retour dense et fiable, l'optimisation de politiques reste inefficace et dépendante de démonstrations imitées, ce qui limite la capacité des robots à dépasser les performances de leurs données d'entraînement. En automatisant la génération de données d'échec, DenseReward réduit un coût d'annotation humaine qui freinait jusqu'ici le déploiement du RL à grande échelle sur des tâches de manipulation, un enjeu direct pour l'entraînement de politiques VLA robustes destinées à l'industrie. Le travail s'inscrit dans la lignée des efforts récents visant à doter les robots de modèles de récompense appris plutôt que conçus manuellement, un axe où les VLM généralistes servaient jusqu'ici de solution par défaut faute de mieux. Les auteurs annoncent la publication en accès libre du jeu de données, des modèles de récompense entraînés et d'une suite d'évaluation, avec pour objectif de faciliter l'intégration de DenseReward dans des boucles de contrôle prédictif par modèle (MPC) et de RL en aval, ouvrant la voie à des travaux communautaires sur la récompense dense sensible aux échecs.

RecherchePaper
1 source
4arXiv cs.RO 

DECO : transformateur de diffusion multimodal découplé pour la manipulation dextre bimanuelle avec adaptateur tactile enfichable

DECO (Decoupled multimodal Diffusion transformer for bimanual dExterous manipulatiOn) est un nouveau modèle de politique robotique présenté dans un papier arXiv (2602.05513v3) qui sépare explicitement le traitement de la vision, de la proprioception et du tactile via des voies de conditionnement dédiées, plutôt que de fusionner ces signaux en amont comme le font la plupart des architectures existantes. Un adaptateur tactile léger permet d'injecter le signal de toucher de façon paramétrique-efficace, sans réentraîner l'ensemble du réseau. Les auteurs publient aussi DECO-50, un jeu de données de 50 heures et plus de 5 millions de frames, collecté par téléopération sur de vrais robots à deux bras équipés de capteurs tactiles. Sur plus de 2 000 essais réels (pas de simulation), DECO atteint un taux de réussite moyen de 72,25%, soit 21 points de mieux que la meilleure référence testée. L'ajout de l'adaptateur tactile apporte 10,25 points de réussite supplémentaires en moyenne, et jusqu'à 20 points sur les tâches à contact riche, tout en ne réajustant que moins de 10% des paramètres du modèle. Ce résultat compte parce qu'il s'attaque à un point de friction connu des politiques de manipulation bimanuelle: la fusion multimodale brute dégrade souvent les performances quand un des signaux (typiquement le tactile) est bruité ou absent, et le réentraînement complet pour intégrer un nouveau capteur reste coûteux. Découpler les modalités et rendre l'ajout de signaux modulaire via un adaptateur va dans le sens d'une approche plus industrialisable pour les intégrateurs qui veulent équiper des mains ou pinces existantes de tactile sans repartir d'un modèle de zéro. Le volume d'essais réels (2 000+) et le jeu de données ouvert de 50 heures renforcent aussi la crédibilité par rapport aux annonces qui ne reposent que sur quelques démonstrations sélectionnées. Le travail s'inscrit dans la vague des transformeurs de diffusion appliqués aux politiques robotiques (diffusion policy), une famille d'approches également explorée par des modèles vision-langage-action comme Pi-0 ou GR00T N2, mais ici recentrée spécifiquement sur la dextérité bimanuelle et l'intégration tactile plutôt que sur la généralisation multi-tâches à grande échelle. La publication conjointe du dataset DECO-50 laisse présager des comparaisons à venir avec d'autres politiques entraînées sur les mêmes données, un terrain encore rare dans la manipulation dextre où chaque laboratoire collecte ses propres démonstrations.

IA physiqueOpinion
1 source
5arXiv cs.RO 

L'efficacité du fine-tuning LoRA pour les modèles vision-langage-action dans la manipulation robotique industrielle

Voici l'article en français : Une équipe de recherche publie une étude systématique sur l'adaptation à faible rang (LoRA) appliquée à π0, un modèle Vision-Language-Action (VLA) à correspondance de flux, testé sur quatre tâches d'assemblage de précision avec un bras robotique UR5e. Les chercheurs ont balayé des rangs LoRA de 8 à 256, plusieurs stratégies d'allocation des paramètres, et testé le gel sélectif de composants du modèle. Résultat principal : aucune différence statistiquement significative de performance entre le fine-tuning complet (FFT), qui exige des GPU de datacenter, et certaines configurations LoRA. Les performances plafonnent dès un rang de 32, avec une allocation uniforme des paramètres entraînables entre le backbone vision-langage (VLM) et l'expert d'action qui suffit à égaler le FFT. Geler le VLM ou limiter le LoRA au seul encodeur visuel dégrade nettement les résultats. Avec cette configuration optimale (rang 32, encodeur visuel entièrement ajustable), la mémoire VRAM statique de pointe chute de 36,2 à 10,8 Gio, hors mémoire d'activation, sans perte de performance mesurable. Pour l'industrie robotique, ce résultat a une portée pratique directe : il abaisse fortement la barrière matérielle pour spécialiser un modèle VLA préentraîné à un cas d'usage industriel précis, sans avoir besoin d'un cluster GPU dédié à l'entraînement complet. C'est un signal utile pour les intégrateurs et PME qui veulent déployer des politiques de manipulation fine sans les moyens des grands laboratoires. L'étude apporte aussi un contrepoint méthodologique à l'hypothèse selon laquelle seul un réentraînement complet permettrait de combler le "gap d'incarnation" entre un modèle généraliste et un robot physique donné : ici, un ajustement ciblé mais bien réparti sur les couches sémantiques et visuelles suffit. π0 est le modèle VLA développé par Physical Intelligence, l'un des laboratoires de référence sur les politiques de manipulation par apprentissage à grande échelle, aux côtés d'acteurs comme NVIDIA (GR00T N2) ou Figure AI. Cette publication, un preprint arXiv, s'inscrit dans une tendance plus large de recherche sur l'efficacité des VLA plutôt que sur leur seule capacité brute. Aucun acteur français ou européen n'apparaît dans ce travail, mais ses conclusions concernent directement les intégrateurs européens qui évaluent l'adoption de VLA préentraînés sur du matériel limité.

UEAucun acteur français ou européen n'est impliqué dans cette étude, mais ses conclusions offrent une piste concrète pour les intégrateurs et PME européens qui veulent spécialiser des modèles VLA sur du matériel limité sans cluster GPU dédié.

RechercheActu
1 source
RoboLight : un jeu de données à éclairage linéairement composable pour la manipulation robotique
6arXiv cs.RO 

RoboLight : un jeu de données à éclairage linéairement composable pour la manipulation robotique

Voici l'article traduit et résumé. RoboLight, présenté dans un article arXiv, est le premier jeu de données de manipulation robotique capturant des épisodes synchronisés sous des conditions d'éclairage systématiquement variées. Il comprend deux volets : RoboLight-Real, avec 2 800 épisodes réels collectés sur un dispositif calibré baptisé Light Cube, équipé de huit lampes LED RGB programmables et faisant varier trois dimensions indépendantes (couleur, direction, intensité), chaque dimension étant associée à une tâche dédiée impliquant des objets de géométries et matériaux différents pour créer des défis perceptifs ; et RoboLight-Synthetic, qui compte 196 000 épisodes générés par interpolation dans l'espace image HDR de RoboLight-Real, un volume potentiellement extensible à volonté en affinant la granularité d'interpolation. Toutes les images sont enregistrées au format HDR pour préserver la précision radiométrique. Les auteurs valident la qualité du jeu de données via une analyse qualitative et des déploiements de politiques en conditions réelles, en étudiant la difficulté des tâches, la diversité de distribution et l'efficacité des données synthétisées, avec trois cas d'usage représentatifs à l'appui. Pour l'industrie robotique, ce jeu de données cible un angle mort persistant des modèles vision-langage-action (VLA) et des politiques de manipulation apprises : leur fragilité face aux variations d'éclairage, un facteur rarement isolé et contrôlé dans les données d'entraînement existantes. En permettant de faire varier couleur, direction et intensité lumineuse de façon indépendante et reproductible, RoboLight offre un banc d'essai pour mesurer la robustesse réelle des politiques de perception, une question centrale pour tout déploiement industriel où l'éclairage n'est jamais parfaitement contrôlé, entrepôt, ligne de production, environnement extérieur. L'approche par interpolation HDR pour générer des données synthétiques à moindre coût illustre aussi une piste concrète pour réduire la dépendance à la collecte réelle, un goulot d'étranglement connu pour l'entraînement des modèles de manipulation à grande échelle. Le projet s'inscrit dans la lignée des efforts récents visant à combler l'écart entre démonstrations en laboratoire et robustesse en conditions réelles, un problème régulièrement pointé du doigt concernant les modèles VLA générique (dans la veine de Pi-0 ou GR00T N2). Contrairement à des jeux de données généralistes, RoboLight isole spécifiquement la variable lumineuse via un montage matériel dédié, ce qui le distingue des benchmarks existants qui ne contrôlent pas systématiquement ce paramètre. Les auteurs annoncent la publication en open source du jeu de données complet, ainsi que des conceptions logicielle et matérielle du système Light Cube, ce qui laisse présager une adoption possible comme outil de benchmark standard par la communauté robotique si la promesse de reproductibilité est tenue.

RecherchePaper
1 source
D'observateur passif à critique actif : l'apprentissage par renforcement révèle un raisonnement de processus pour la manipulation robotique
7arXiv cs.RO 

D'observateur passif à critique actif : l'apprentissage par renforcement révèle un raisonnement de processus pour la manipulation robotique

Une équipe de recherche propose PRIMO R1 (Process Reasoning Induced Monitoring), un framework de 7 milliards de paramètres qui transforme les modèles vidéo multimodaux (MLLM) en "critiques" actifs capables d'évaluer la progression d'une tâche de manipulation robotique, plutôt qu'en simples "observateurs" qui se contentent de reconnaître les actions en cours. La méthode s'appuie sur de l'apprentissage par renforcement basé sur le résultat final pour inciter le modèle à générer un raisonnement explicite en chaîne de pensée (chain-of-thought) lors de l'estimation de la progression. L'architecture ancre la séquence vidéo entre une image de l'état initial et une image de l'état courant, une construction temporelle structurée soutenue par un nouveau jeu de données et benchmark, le PRIMO Dataset. Les résultats annoncés sont significatifs : une réduction de 50% de l'erreur absolue moyenne par rapport aux meilleures références spécialisées, des gains face à des MLLM généralistes de 72 milliards de paramètres malgré une taille dix fois inférieure, et 67,0% de précision sur le benchmark RoboFail, dépassant le modèle o1 d'OpenAI de 6 points. Cette avancée cible un vrai point de friction du secteur : pour les tâches de manipulation longues, les robots doivent non seulement reconnaître ce qu'ils font, mais estimer où ils en sont par rapport à l'objectif final, une capacité clé pour la détection autonome d'échecs sans supervision humaine. Qu'un modèle de 7B batte des systèmes bien plus lourds, y compris o1, sur ce type de raisonnement suggère que le renforcement orienté résultat peut compenser la taille, un argument important pour un déploiement embarqué sur des robots humanoïdes où latence et coût de calcul comptent. Le travail s'inscrit dans la vague de modèles de raisonnement entraînés par RL appliquée spécifiquement à la robotique, avec des tests validés aussi bien en environnements simulés qu'en scénarios réels sur humanoïdes. Il s'agit à ce stade d'une publication de recherche (preprint arXiv, version révisée) accompagnée d'un dataset et d'un benchmark ouverts, pas d'un produit déployé, mais elle pose une référence explicite face aux modèles généralistes et aux systèmes propriétaires comme o1 sur la détection d'échec robotique.

RecherchePaper
1 source
Tesollo lance le processus d'introduction en bourse tout en développant des mains humanoïdes
8Robotics Business Review 

Tesollo lance le processus d'introduction en bourse tout en développant des mains humanoïdes

Tesollo Inc., société sud-coréenne basée à Incheon spécialisée dans les mains robotiques et effecteurs terminaux, a lancé les préparatifs de son introduction en bourse prévue pour l'an prochain et a bouclé son tour de série B. Les actionnaires existants POSCO Technology Investment, KB Investment et Enlight Ventures ont suivi lors de ce tour, rejoints par des investisseurs industriels stratégiques, Daesung Hi-Tech et HL Mando. Fondée en 2019, l'entreprise revendique des exportations vers 19 pays et affirme que ses ventes à l'international dépassent désormais ses ventes domestiques. Son PDG, Young-Jin Kim, présente l'IPO comme un moyen de crédibiliser l'entreprise auprès de clients internationaux et de renforcer sa capacité de production de masse. Sur le plan produit, Tesollo a présenté en mars le gripper à trois doigts DG-3 lors du salon AW 2026, complétant une gamme allant du parallèle DG-2F à la main à cinq doigts DG-5F. La version DG-5F-S, dotée d'actionneurs propriétaires, pèse moins d'un kilo et serait proposée à environ 60% du coût de son prédécesseur, tout en visant un niveau de précision comparable. L'entreprise a aussi montré ses mains DG-5F-M et DG-5F-S au Robotics Summit & Expo de Boston et à ICRA Vienne, avec des démonstrations de téléopération, de bin picking, de manipulation fine et d'un modèle vision-langage-action (VLA) dédié aux humanoïdes. Cette annonce s'inscrit dans un moment charnière pour la filière des mains robotiques, considérée comme le principal goulot d'étranglement des humanoïdes. La main humaine reste l'organe le plus complexe à répliquer mécaniquement, et les intégrateurs rapportent des taux de casse élevés sur les doigts et articulations en usage industriel. Le pari de Tesollo, la réparabilité modulaire plutôt que la seule performance brute, cible directement ce problème de fiabilité plutôt que la course à la dextérité pure. Pour les décideurs B2B et intégrateurs, la baisse de coût annoncée sur le DG-5F-S est significative si elle se confirme en conditions réelles, la publicité produit restant à vérifier hors démonstrations sélectionnées. Le contexte sectoriel reste dominé par l'absence de standard fiable: aucun fabricant n'a encore atteint un MTBR certifié de 10 000 heures, seuil considéré comme déterminant pour l'adoption industrielle et commerciale des mains robotiques. Une analyse d'ENGtechnica souligne que la densité de points de défaillance, actionneurs, capteurs, câbles tendineux, explique cette difficulté structurelle commune à tous les acteurs du secteur, dont Tesollo elle-même reconnaît avoir conçu ses produits en anticipant ce problème dès l'origine.

Chine/AsieActu
1 source
RoboDojo : un benchmark unifié simulation-réel pour évaluer les politiques de manipulation robotique généralistes
9arXiv cs.RO 

RoboDojo : un benchmark unifié simulation-réel pour évaluer les politiques de manipulation robotique généralistes

Une équipe de chercheurs présente RoboDojo, un banc d'essai unifié combinant simulation et monde réel pour évaluer les politiques génératives de manipulation robotique, celles capables d'exécuter des tâches variées à partir d'instructions en langage naturel. Le système comprend 42 tâches en simulation et 18 tâches en conditions réelles, couvrant des capacités complémentaires. Le volet simulation mesure cinq dimensions : la généralisation, la mémoire, la précision, l'exécution de tâches longues, et la compréhension d'instructions en vocabulaire ouvert. Le volet réel expose les politiques aux difficultés concrètes du déploiement physique. La plateforme s'appuie sur Isaac Sim pour la simulation parallèle à grande échelle, et sur RoboDojo-RealEval, un système d'évaluation réelle accessible à distance via le cloud, avec matériel standardisé, réinitialisation automatisée des scènes et protocole reproductible. Trente politiques ont été intégrées via XPolicyLab et testées sur ce banc d'essai, donnant lieu à un classement public consultable sur robodojo-benchmark.com. L'initiative répond à un problème structurel du secteur : la prolifération de politiques génératives de manipulation (VLA) ces deux dernières années s'est faite sans étalon de mesure commun, chaque laboratoire publiant ses propres métriques sur ses propres tâches. Les évaluations en simulation seule ignorent les aléas physiques du réel (éclairage, frottements, imprécisions de préhension), tandis que les tests réels restent coûteux, lents et rarement reproductibles d'un labo à l'autre. En forçant une comparaison directe entre simulation et déploiement physique sur les mêmes politiques, RoboDojo permet de quantifier l'écart entre performance démontrée et robustesse réelle, un point sensible pour tout intégrateur ou décideur industriel cherchant à choisir une politique de contrôle avant un déploiement en usine ou en entrepôt. Le projet s'inscrit dans une dynamique où plusieurs équipes de recherche ont développé des systèmes de contrôle génératifs concurrents sans cadre d'évaluation partagé. En proposant à la fois l'infrastructure logicielle (XPolicyLab) et le protocole de test standardisé, RoboDojo vise à devenir une référence commune, avec un classement public appelé à s'enrichir au fur et à mesure que de nouvelles politiques y seront soumises.

RecherchePaper
1 source
SoftVTBench : un benchmark visuo-tactile axé sur la sécurité pour la manipulation robotique d'objets déformables sous contraintes physiques
10arXiv cs.RO 

SoftVTBench : un benchmark visuo-tactile axé sur la sécurité pour la manipulation robotique d'objets déformables sous contraintes physiques

Des chercheurs viennent de publier SoftVTBench, un benchmark construit sous Isaac Sim pour évaluer la manipulation robotique d'objets déformables non plus seulement sur la réussite de la tâche, mais sur la sécurité physique de l'interaction. Le système simule les objets déformables par éléments finis (FEM) et combine vues RGB multiples, capteurs tactiles RGB avec suivi de marqueurs, proprioception et instructions en langage naturel. Il définit quatre suites de tâches croisant type d'objet (déformable versus rigide) et axe de variation (objet versus position spatiale), et distingue deux métriques : le Goal Success, qui mesure l'atteinte de l'objectif, et le Safety Success, plus strict, qui exige en plus l'absence de chute et un niveau de déformation maximal sous un seuil calibré par objet, mesuré via les états FEM cachés à la politique. Les auteurs testent des politiques basées sur pi0.5, le modèle vision-langage-action (VLA) de Physical Intelligence, dans ce protocole. Les résultats sont un signal d'alarme pour l'évaluation actuelle des politiques de manipulation : une part importante des trajectoires qui atteignent l'objectif violent en réalité les contraintes physiques de sécurité, ce que les benchmarks classiques, uniquement orientés succès, ne détectent pas. L'ajout du retour tactile change la donne : le Safety Success passe de 21,4% à 35,6% sur les tâches déformables centrées objet, avec une réduction mesurable de la déformation pendant l'exécution, sans dégrader le Goal Success. Pour les intégrateurs et chercheurs en robotique manipulant des objets souples (textile, alimentaire, emballage), cela confirme qu'un capteur tactile n'est pas un simple bonus de précision mais un levier direct de sécurité opérationnelle, et que les métriques de succès seules surestiment la fiabilité réelle d'une politique. SoftVTBench s'inscrit dans une littérature où les benchmarks de manipulation restent très majoritairement centrés sur la réussite de tâche, laissant un angle mort sur le comportement physique pendant l'exécution. En s'appuyant sur pi0.5, déjà positionné comme référence VLA face à des modèles comme GR00T N2 ou Helix, les auteurs proposent un protocole reproductible que d'autres équipes pourront réutiliser pour comparer leurs propres politiques visuo-tactiles sous contrainte physique, plutôt que sur le seul critère du taux de réussite.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines
11arXiv cs.RO 

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines

Wandercraft, Exotec, Pollen et Enchanted Tools ne sont pas mentionnés dans le papier, donc aucune mention forcée. Voici l'article : Une équipe de recherche publie CHORD (Contact Wrench Guidance from Human Demonstration in Robotic Dexterous Manipulation), un framework d'apprentissage par renforcement pour la manipulation dextre à long horizon d'objets rigides et articulés, dans un preprint arXiv daté du 2 juillet 2026 (arXiv:2607.00033v1). L'idée centrale consiste à représenter les mouvements humains et robotiques non pas par des trajectoires articulaires brutes, mais par les forces et couples (wrench) qu'ils induisent sur l'objet manipulé, ce qui permet de comparer directement leur effet plutôt que leur cinématique. Les chercheurs ont construit un benchmark de simulation de 4 739 tâches de manipulation bimanuelle dextre, issu de jeux de données de capture de mouvement et de vidéos reconstruites en interne. Sur 1 831 tâches évaluées, CHORD atteint un taux de réussite moyen de 82,12 %. La méthode se généralise aussi à la manipulation corps entier à partir de démonstrations limitées aux mains ou filmées à la troisième personne, avec 90,77 % de réussite, et les politiques apprises se transfèrent vers le réel en boucle ouverte comme en boucle fermée. L'enjeu dépasse la simple prouesse académique : l'apprentissage par renforcement pour la manipulation riche en contacts est réputé difficile à faire passer à l'échelle, car les démonstrations humaines se transposent mal aux mains robotiques dont la cinématique diffère. En ancrant le signal de guidage dans la physique des forces plutôt que dans les gestes eux-mêmes, CHORD contourne en partie ce fossé d'incarnation. Un benchmark de près de 5 000 tâches, avec transfert vérifié sur robot réel et non seulement en simulation, constitue un test de scalabilité plus rigoureux que la plupart des démonstrations ponctuelles habituelles du secteur. Ce travail s'inscrit dans une tendance plus large exploitant la capture de mouvement et la vidéo humaine pour entraîner des politiques robotiques, en parallèle des approches par imitation ou des modèles vision-langage-action comme Pi-0 ou GR00T N2. Étant un preprint, il reste à valider par relecture par les pairs, avec une portée réelle encore limitée aux conditions de laboratoire décrites.

RecherchePaper
1 source
Combinaison d'échantillonnage contraint et d'apprentissage par renforcement pour la manipulation robotique
12arXiv cs.RO 

Combinaison d'échantillonnage contraint et d'apprentissage par renforcement pour la manipulation robotique

Manipulation robotique non préhensile : des chercheurs de la TU Berlin combinent échantillonnage contraint et apprentissage par renforcement Une équipe de la TU Berlin, associée au laboratoire de Marc Toussaint, publie une nouvelle version de ses travaux sur l'entraînement de politiques de manipulation robotique en environnement riche en contacts (arXiv:2602.08557v2). Le problème visé est la manipulation dite non préhensile, c'est à dire pousser, faire glisser ou réorienter un objet sans le saisir, une tâche où l'apprentissage par renforcement (RL) peine souvent à explorer suffisamment l'espace des stratégies possibles. La méthode proposée combine deux idées existantes mais rarement associées : d'une part des stratégies de réinitialisation qui contrôlent la distribution des états de départ de chaque épisode d'entraînement, et d'autre part un échantillonnage basé modèle sur des variétés contraintes, une technique reconnue pour son efficacité à générer des états physiquement valides. Le nouvel échantillonneur tient explicitement compte de la structure des contacts pour couvrir un large éventail de modes de contact, le tout combiné à une interpolation projetée et à un apprentissage curriculaire progressif. Sur le plan des résultats, l'équipe affirme surpasser à la fois le RL classique sans échantillonnage contraint et les méthodes alternatives de réinitialisation, en entraînant des politiques universelles, non préhensiles et dynamiques. L'intérêt pour le secteur tient moins à un produit qu'à une brique méthodologique : la manipulation en contact riche, aujourd'hui l'un des points durs de la robotique appliquée (tri industriel, réorientation d'objets sur convoyeur, préhension d'objets déformables), reste largement dominée par des politiques apprises en simulation qui échouent à généraliser sur des configurations de contact non vues à l'entraînement. Une méthode qui améliore la couverture des modes de contact pendant l'apprentissage adresse directement ce problème de généralisation, sans dépendre d'un matériel ou d'un actionneur particulier. Il s'agit ici d'une contribution académique, pas d'une annonce produit ni d'un déploiement industriel, du matériel supplémentaire étant disponible sur le site du laboratoire. Le travail s'inscrit dans la continuité des recherches de Toussaint sur la planification géométrico logique et les approches hybrides modèle/apprentissage, un courant de recherche européen qui contraste avec les approches purement data-driven (type VLA) privilégiées par les laboratoires américains sur les plateformes humanoïdes commerciales.

UEContribution de la TU Berlin (laboratoire de Marc Toussaint) qui renforce l'expertise europeenne en manipulation robotique hybride modele/apprentissage, une approche qui se distingue des methodes VLA data-driven privilegiees par les laboratoires americains.

RecherchePaper
1 source
De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
13arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
LDHP : planification hiérarchique pilotée par bibliothèque pour la manipulation dextérique non préhensile
14arXiv cs.RO 

LDHP : planification hiérarchique pilotée par bibliothèque pour la manipulation dextérique non préhensile

LDHP, pour Library-Driven Hierarchical Planning, est un nouveau planificateur pour la manipulation non-préhensile, c'est-à-dire la manutention d'objets fins, larges ou difficiles à saisir avec une prise ferme classique (tissus, plaques, pièces plates). L'architecture proposée fonctionne en deux niveaux : un planificateur de haut niveau, dit "contact-state", propose des trajectoires de pose d'objet via des primitives appelées MoveObject, tandis qu'un planificateur de bas niveau génère des séquences de prise réalisables grâce à des primitives AdjustGrasp. La faisabilité de chaque mouvement est certifiée par des vérifications de collision et des calculs de mécanique quasi-statique, et les segments les plus sensibles au contact sont affinés par une méthode de dichotomie bornée. Les auteurs ont testé leur système sur robot réel, sur deux tâches : le levage d'objets sans mobilité (zero-mobility lifting) et l'insertion dans une fente (slot insertion), avec une exécution jugée cohérente et une robustesse démontrée face aux changements de forme et d'environnement. L'intérêt de ce travail tient à sa position par rapport aux deux grandes familles d'approches existantes. D'un côté, les planificateurs classiques ignorent souvent les contraintes réelles du gripper et produisent des mouvements théoriquement valides mais physiquement inexécutables sur un robot réel, un écueil fréquent derrière les démonstrations qui échouent hors labo. De l'autre, les approches par apprentissage, dont les modèles VLA à la GR00T N2, Pi-0 ou Helix, nécessitent d'immenses volumes de données et peinent à généraliser à des tâches hors distribution. En faisant de l'exécutabilité un critère de conception dès le départ, plutôt qu'une contrainte ajoutée après coup, LDHP découple le mouvement de l'objet de la faisabilité de la prise, ce qui permet à la même pipeline de transférer d'une tâche à l'autre et d'une géométrie d'objet à l'autre sans redéveloppement. Pour les intégrateurs et ingénieurs en robotique industrielle, c'est un signal que des pipelines structurées et certifiables peuvent rivaliser avec les approches data-hungry sur des tâches de manipulation fine, sans les coûts de collecte de données associés. La manipulation non-préhensile reste un problème de recherche ouvert de longue date, distinct du paradigme pick-and-place qui domine encore la robotique industrielle. Le champ s'est historiquement divisé entre méthodes de planification et de recherche formelles d'un côté, et méthodes d'apprentissage entraînées sur de larges jeux de démonstrations de l'autre. LDHP se positionne comme un pont entre les deux : une pipeline de planification structurée et vérifiable, mais conçue pour exposer des points d'accroche permettant d'y greffer, en option, des a priori appris. Publié sur arXiv en version mise à jour (v2), le travail reste à ce stade purement académique, sans produit ni déploiement industriel associé ; les suites logiques concerneraient l'extension à des tâches et des géométries d'objets plus complexes, ainsi qu'une intégration effective de composants appris dans les crochets prévus à cet effet.

RecherchePaper
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
15arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique
16arXiv cs.RO 

Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique

Une équipe de chercheurs publie sur arXiv (réf. 2606.29898) une métrique d'évaluation hors ligne baptisée Critical Interval MSE (CI-MSE), conçue pour combler un angle mort majeur dans le développement des politiques de manipulation robotique. Le problème de départ est bien connu : l'évaluation en conditions réelles reste la seule mesure fiable de la performance d'un modèle, mais elle est coûteuse, difficile à reproduire et trop lente pour comparer itérativement des variantes proches. Le proxy historique, la perte de validation MSE sur des démonstrations d'experts, présente une corrélation trop faible avec les performances en déploiement réel pour être utile en pratique. CI-MSE propose une approche différente : restreindre le calcul d'erreur aux segments temporels jugés critiques pour la tâche, et l'associer à des procédures d'alignement d'actions qui reproduisent mieux le comportement au moment du rollout. Les auteurs mesurent une corrélation de rang de Spearman de -0,87 entre leur métrique et les performances réelles, contre -0,61 pour la MSE brute, sur un large panel de checkpoints de politiques, validés en simulation et en environnement physique. L'enjeu industriel est direct : le goulot d'étranglement de l'itération sur les politiques robotiques n'est pas le calcul, c'est le temps de test physique. Si une métrique hors ligne prédit fiablement laquelle de deux variantes d'un modèle est meilleure, les équipes peuvent filtrer les mauvais candidats avant même de mobiliser un robot. Pour les intégrateurs et les labs qui travaillent sur des politiques de type VLA (Vision-Language-Action), ce gain de cycle de R&D peut se traduire en semaines économisées par itération. Le résultat de -0,87 est notable, mais à nuancer : les auteurs délimitent eux-mêmes des conditions limites d'utilisation, notamment en cas de shifts de distribution à l'évaluation. CI-MSE s'inscrit dans un effort plus large de la communauté pour résoudre le "sim-to-real gap" par des proxies d'évaluation plus fidèles, sans nécessiter de rollouts physiques systématiques. Les travaux sur les métriques comportementales (action chunking, diffusion policies) ont mis en évidence que la MSE brute ne capturait pas les moments décisifs d'une tâche de manipulation. Ce papier formalise cette intuition avec une analyse de sensibilité qui montre la robustesse de CI-MSE sur un large spectre d'hyperparamètres. Le code et les détails sont accessibles sur le site du projet (ci-mse.github.io). Prochaine étape attendue : validation à plus grande échelle sur des benchmarks multi-tâches et des architectures de politiques hétérogènes.

RechercheOpinion
1 source
Ancrage de la généralisation simulation-réel en manipulation robotique : étude empirique avec des modèles VLA
17arXiv cs.RO 

Ancrage de la généralisation simulation-réel en manipulation robotique : étude empirique avec des modèles VLA

Une équipe de chercheurs a publié sur arXiv (référence 2603.22876, version 2 en juin 2026) une étude empirique de grande ampleur sur le transfert simulation-vers-réel dans le domaine de la manipulation robotique, en ciblant spécifiquement les modèles Vision-Language-Action (VLA). L'étude porte sur plus de 10 000 essais réels et analyse quatre variables clés : la randomisation de domaine multi-niveaux, le rendu photoréaliste, la modélisation physique réaliste, et les mises à jour par apprentissage par renforcement (RL). Pour mesurer les performances, les auteurs ont conçu un protocole d'évaluation couvrant les variations de fond, d'éclairage, de distracteurs visuels, de types d'objets et de configurations spatiales. Les données simulées, les plateformes robotiques utilisées et l'intégralité du protocole sont mis à disposition en accès libre pour permettre la reproductibilité indépendante. Ce travail répond à un angle mort persistant dans la recherche robotique : les algorithmes de réduction du Sim-to-Real gap abondent dans la littérature, mais peu ont été validés de façon systématique sur des politiques généralistes comme les VLA, qui apprennent à partir de vastes corpus de données mixtes texte-image-action. En isolant empiriquement les quatre déterminants de la généralisation, l'étude permet aux intégrateurs et aux équipes R&D de prioriser leurs investissements en infrastructure de simulation plutôt que d'empiler des heuristiques non testées. La mise à disposition d'un benchmark standardisé constitue une rupture : le secteur manquait d'une référence commune pour comparer les approches sim-to-real sur des tâches de manipulation représentatives, un vide que cette publication comble directement. Le Sim-to-Real gap est l'un des obstacles structurels au déploiement des robots en environnement non contrôlé, et la montée en puissance des VLA (Pi-0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind, GR00T N2 de NVIDIA) rend la question encore plus urgente : ces modèles sont entraînés massivement sur des données synthétiques, et leur robustesse réelle reste souvent opaque. Plusieurs laboratoires, dont ceux liés à Figure AI, Agility Robotics ou 1X Technologies, investissent dans des moteurs de simulation propriétaires précisément pour réduire ce coût. En publiant protocole et plateformes, les auteurs offrent un socle de comparaison neutre qui devrait accélérer la convergence des pratiques, à condition que des équipes tierces reproduisent et étendent les résultats sur d'autres morphologies robotiques.

IA physiqueOpinion
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
18arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
WatchAct : un benchmark de manipulation robotique fondée sur le comportement
19arXiv cs.RO 

WatchAct : un benchmark de manipulation robotique fondée sur le comportement

Une équipe de chercheurs a publié WatchAct (arXiv:2606.26443), un nouveau benchmark pour la manipulation robotique fondé sur l'observation du comportement humain. Contrairement aux évaluations existantes, qui associent une instruction textuelle à une image statique, WatchAct impose aux systèmes robotiques de raisonner à partir d'une vidéo montrant un humain accomplir une tâche, puis d'en déduire un plan d'action exécutable. Le benchmark comprend 3 000 instances réparties sur 14 tâches dans quatre domaines cognitifs : compréhension des événements (Event Grounding), récupération de la structure procédurale (Procedural Reasoning), inférence d'intentions implicites (Implicit Intent Inference) et suivi des modifications de scène (Episodic Reasoning). Chaque instance couple une vidéo réelle, une instruction en langue naturelle, une scène simulée dans le framework LIBERO et une tâche exécutable sur un robot Franka Research 3. Le meilleur pipeline testé, associant Gemini-3.1-Pro et le modèle π₀.₅ de Physical Intelligence, atteint seulement 16,3 % de taux de réussite en simulation et 14,0 % sur robot réel. Ces chiffres révèlent un fossé considérable entre capacités humaines et systèmes actuels. Sur la seule composante de planification vidéo-vers-plan, Gemini-3.1-Pro obtient 36,8 % de Plan SR, contre 97,1 % pour les humains, soit un écart de plus de 60 points de pourcentage. Même avec un plan oracle fourni directement, sans recours à un VLM, π₀.₅ ne dépasse pas 21,5 % de Task SR, et chute à 10,6 % sur des scénarios hors domaine. Le protocole d'évaluation décomposé de WatchAct, qui mesure séparément le raisonnement VLM, l'exécution de la politique robotique et la performance bout-en-bout, est méthodologiquement précieux : il permet d'identifier précisément où chaque composant échoue, plutôt que d'observer un taux global difficile à interpréter. Pour les intégrateurs et les équipes R&D industrielles, ce résultat indique que ni les grands modèles vision-langage actuels ni les politiques de manipulation ne sont prêts pour des scénarios de collaboration humain-robot en environnement non structuré. WatchAct s'inscrit dans une tendance de fond visant à dépasser les benchmarks « instruction + image unique » qui ne capturent pas la complexité temporelle du travail réel en atelier ou en logistique. Les évaluations existantes comme LIBERO (utilisé ici comme substrat de simulation), RoboSuite ou BridgeData évaluent principalement l'exécution sous contraintes statiques. WatchAct introduit une dimension de video-grounding qui rapproche l'évaluation des conditions réelles, où un robot doit comprendre ce qu'un collègue humain vient de faire pour enchaîner correctement. Le modèle π₀.₅ est développé par Physical Intelligence, l'une des startups VLA les plus suivies du secteur aux côtés de Figure AI, Agility Robotics et 1X Technologies. Aucun acteur européen n'est impliqué dans ce benchmark. Le dataset et le code sont disponibles publiquement ; les prochaines étapes naturelles incluent l'intégration de modèles de raisonnement vidéo plus récents et l'extension à des scénarios multi-agents.

RechercheOpinion
1 source
Amélioration du fine-tuning des modèles VLA par supervision structurée des étapes et des images clés
20arXiv cs.RO 

Amélioration du fine-tuning des modèles VLA par supervision structurée des étapes et des images clés

Des chercheurs ont publié sur arXiv (arXiv:2606.26801, juin 2026) un framework auxiliaire baptisé StaKe, conçu pour améliorer le fine-tuning des modèles Vision-Language-Action (VLA) en manipulation robotique. Le problème ciblé est précis : lors du fine-tuning standard, la supervision sur les actions s'applique uniformément à chaque pas de temps, sans distinguer les phases critiques de manipulation ni anticiper les transitions de préhenseur (gripper events). La quasi-totalité des échecs se concentre autour de ces moments de transition, ouverture ou fermeture du préhenseur. StaKe introduit deux têtes auxiliaires légères entraînées en parallèle du modèle VLA sans modifier son architecture ni sa boucle d'inférence : un classifieur de phase (stage classifier) qui identifie l'étape courante de manipulation, et un prédicteur de keyframe qui estime l'action articulaire cible au prochain événement de préhenseur. Les deux signaux sont extraits automatiquement depuis les états du gripper dans les démonstrations, sans annotation manuelle. Sur tâches bimanual en simulation, StaKe améliore le taux de succès de 14 % en relatif ; sur robot réel Franka à un bras, le gain atteint 56 % en relatif. Les améliorations sont plus marquées sur les tâches long-horizon impliquant de nombreuses transitions. L'enjeu pour l'industrie robotique est direct : les VLA (Pi-0 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA) sont aujourd'hui les modèles de référence pour la généralisation en manipulation, mais leur fine-tuning sur des tâches spécifiques reste fragile dès que les séquences s'allongent. StaKe comble un angle mort structurel de l'entraînement supervisé classique, en pondérant implicitement les moments critiques. Le gain de 56 % mesuré sur robot réel Franka est le résultat le plus significatif : les validations sur hardware réel restent rares dans la littérature VLA, et ce chiffre suggère que l'amélioration ne se limite pas à la simulation. Le fait que le framework soit purement plug-in, sans toucher à l'inférence, facilite son intégration par des équipes qui fine-tunent déjà des backbones existants. Les VLA ont émergé comme paradigme dominant après RT-2 (Google DeepMind, 2023) et se sont accélérés avec Pi-0 (Physical Intelligence, fin 2024) et ses successeurs. Le défi du fine-tuning efficace sur tâches longues est aujourd'hui l'un des principaux points de friction pour le déploiement industriel de bras manipulateurs polyvalents. StaKe se positionne comme contribution générique applicable à tout backbone VLA. Un site projet est annoncé (hi-yuanxu.github.io/StaKe-Web) ; à ce stade, aucun partenariat industriel ni déploiement terrain n'est mentionné. Il s'agit d'une publication académique, pas d'un produit en disponibilité commerciale.

UELes équipes françaises et européennes travaillant sur le fine-tuning de modèles VLA (INRIA, CEA-List, laboratoires universitaires) peuvent intégrer ce framework plug-in directement dans leurs pipelines existants sans modification architecturale.

💬 Les VLA craquaient toujours au même endroit, et tout le monde le savait sans trop savoir quoi faire : les transitions du préhenseur, ouverture et fermeture, concentrent l'essentiel des échecs, mais la supervision standard les traite comme n'importe quel autre pas de temps. StaKe ajoute deux têtes légères qui ciblent exactement ces moments critiques, sans toucher à l'architecture ni à l'inférence. +56% sur robot Franka réel (pas en simulation), c'est le genre de chiffre qui va faire réfléchir les équipes qui fine-tunent Pi-0 ou OpenVLA en ce moment.

IA physiqueOpinion
1 source
Apprentissage de priors d'action pour la manipulation robotique multi-morphologies
21arXiv cs.RO 

Apprentissage de priors d'action pour la manipulation robotique multi-morphologies

Des chercheurs ont soumis le 25 juin 2026 sur arXiv (réf. 2606.26095) un cadre d'entraînement en deux étapes pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique cross-embodiment. Le problème est structurel : dans l'architecture dominante, le module d'action est greffé sur un backbone Vision-Language Model (VLM) et co-optimisé dès le départ, ce qui contraint le modèle à découvrir simultanément la dynamique physique du mouvement et l'alignement visuo-linguistique. Les auteurs proposent de préentraîner d'abord le module d'action sur des trajectoires brutes via un encodeur-décodeur léger basé sur le flow-matching, sans aucune entrée visuelle ni linguistique, puis de transférer ce prior moteur à l'entraînement VLA par réutilisation du décodeur et distillation latente en début d'entraînement. La méthode est évaluée sur 13 tâches cross-embodiment en simulation et sur plateformes réelles. Le bénéfice principal est de découpler deux apprentissages que les VLA actuels co-optimisent de front : la structure temporelle du mouvement et la sémantique visuo-linguistique. Selon les résultats présentés, la méthode accélère la convergence, améliore les taux de succès globaux et génère des gains particulièrement nets sur les tâches à faible volume de données réelles, là où les pipelines existants décrochent. Le module encodeur joue par ailleurs le rôle de compresseur d'historique, résumant l'historique état-action en un unique token de contexte temporel à coût négligeable. Fait notable : augmenter le volume de données d'action en étape 1 améliore directement les performances downstream, sans requérir de nouvelles démonstrations robotiques coûteuses à collecter. Ce travail s'inscrit dans la compétition autour des politiques robotiques généralistes capables d'opérer sur des morphologies hétérogènes : Pi-0 (Physical Intelligence), OpenVLA, Octo (UC Berkeley) et RT-2 (Google DeepMind) constituent les références directes. La rareté des données réelles annotées et le sim-to-real gap restent les freins communs à l'ensemble du secteur, et une meilleure initialisation du prior moteur en offre une réponse partielle. Il s'agit d'un preprint non évalué par les pairs, sans déploiement industriel annoncé ; les suites naturelles seraient une intégration dans des frameworks open-source comme LeRobot (Hugging Face) ou une adoption par des équipes développant des humanoïdes généralistes.

UELa méthode pourrait être intégrée à LeRobot (Hugging Face, Paris), ce qui bénéficierait directement à l'écosystème de robotique open-source français.

RechercheOpinion
1 source
Représentations centrées sur l'objet pour une meilleure généralisation en manipulation robotique
22arXiv cs.RO 

Représentations centrées sur l'objet pour une meilleure généralisation en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.21416v2) une étude comparative sur les représentations visuelles utilisées pour entraîner des politiques de manipulation robotique. Le problème central : les robots peinent à généraliser lorsque les conditions visuelles changent, éclairage, textures ou présence d'objets parasites dans la scène. L'équipe a évalué trois familles de représentations extraites d'encodeurs pré-entraînés : les features globales (image résumée en un seul vecteur agrégé), les features denses (embedding par patch issu de la dernière couche de l'encodeur), et une approche intermédiaire baptisée SBOCR (Slot-Based Object-Centric Representations), qui regroupe ces features denses en un nombre fini d'entités "objet-like" via un mécanisme de slots. Testées sur une batterie de tâches de manipulation en simulation et en conditions réelles, allant de scénarios simples à complexes, les politiques SBOCR surpassent les deux autres familles en termes de généralisation, sans pré-entraînement spécifique à la tâche. Ce résultat intéresse directement les intégrateurs et équipes R&D en robotique : la principale cause d'échec en déploiement n'est pas la commande moteur, mais la robustesse perceptuelle aux conditions non vues à l'entraînement. Les features globales sacrifient le détail spatial ; les features denses transmettent trop d'information non pertinente (fond, reflets, distracteurs), dégradant la politique hors distribution. SBOCR agit comme un filtre structuré : en segmentant implicitement la scène en objets discrets, la représentation réduit le bruit transmis à la politique sans perdre les informations nécessaires à l'exécution de la tâche. C'est un signal significatif pour les architectures VLA (Vision-Language-Action), et cela valide empiriquement que la structure objet-centrique améliore la robustesse aux shifts visuels sans supervision supplémentaire. Ce travail s'inscrit dans la lignée des Slot Attention (Locatello et al., Google Brain, 2020). Dans le paysage concurrent, les politiques VLA majeures comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA) s'appuient majoritairement sur des features denses issues de ViT ou CLIP, sans structuration objet explicite. La question de l'intégration de SBOCR dans des architectures transformer de grande taille reste ouverte, notamment sur le plan du coût computationnel. Il s'agit d'un preprint arXiv sans évaluation par les pairs publiée à ce jour ; la scalabilité à des environnements industriels complexes, multi-objets et à fortes occlusions, reste à confirmer.

💬 Le problème de généralisation en robotique, c'est pas les moteurs, c'est la perception hors distribution. SBOCR montre qu'en structurant la scène en objets discrets plutôt qu'en features brutes, on gagne en robustesse visuelle sans aucun ré-entraînement spécifique. Pi-0 et GR00T N2 s'appuient encore sur des features denses, et si ce résultat tient à plus grande échelle, c'est un angle mort de design qu'il va falloir corriger.

IA physiqueOpinion
1 source
Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D
23arXiv cs.RO 

Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D

Des chercheurs ont publié sur arXiv (arXiv:2606.26048v1) un framework de contrôle hybride baptisé RL-ET-DeePC, combinant apprentissage par renforcement (RL) sans modèle et contrôle prédictif basé sur les données (DeePC) avec déclenchement événementiel, appliqué à un bras souple câblé à trois dimensions. L'approche repose sur une politique RL entraînée à décider dynamiquement quand activer le solveur d'optimisation DeePC, plutôt que de le lancer à chaque pas d'échantillonnage comme le fait le DeePC périodique classique. En simulation, le framework réduit la fréquence d'appel au solveur jusqu'à 66 % sans dégradation mesurable de la précision de suivi de trajectoire. Sur le banc physique, le transfert s'effectue en zero-shot, c'est-à-dire sans réentraînement ni adaptation, avec une réduction de 34 % des appels d'optimisation, une précision de suivi comparable au DeePC périodique, et des performances plus régulières qu'un déclenchement événementiel à seuil statique. L'enjeu est directement industriel : le DeePC standard, qui évite la modélisation explicite en exploitant les trajectoires entrée-sortie mesurées, bute sur le coût computationnel de son optimisation en horizon glissant à chaque cycle. Sur des plateformes embarquées à ressources limitées, ce verrou bloque le déploiement temps réel. En déléguant la décision de déclenchement à une politique RL légère, RL-ET-DeePC rend le contrôle prédictif viable sur matériel contraint, tout en validant un transfert sim-to-real zero-shot sur un système souple, dont les dynamiques non linéaires et variant dans le temps constituent précisément le défi classique du gap simulation-réalité. C'est un résultat notable : les robots souples sont réputés récalcitrants au sim-to-real, et une réduction de 34 % des appels solveur sur hardware sans recalibration ouvre la voie à des architectures plus légères. Le DeePC, introduit autour de 2019 comme alternative data-driven aux MPC classiques, souffre depuis de son coût en ligne. Les travaux sur le déclenchement événementiel (event-triggered control) cherchent depuis plusieurs années à conditionner l'appel au solveur à des critères d'état système, mais les seuils statiques manquent d'adaptabilité. L'usage du RL pour apprendre ce critère de déclenchement constitue la nouveauté architecturale centrale de ce papier. Dans le paysage des robots souples, les approches concurrentes incluent les contrôleurs basés sur des réseaux de neurones récurrents (LSTM, Echo State Networks) et les méthodes Koopman pour la linéarisation. Ce travail positionne RL-ET-DeePC comme une alternative sans modèle et computationnellement frugale, avec des perspectives de déploiement sur des bras chirurgicaux, des grippers adaptatifs, ou des exosquelettes souples où la puissance de calcul embarquée reste contrainte.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
24arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
L'affinage des modèles vision-langage-action (VLA) nécessite moins de couches qu'on ne le pense
25arXiv cs.RO 

L'affinage des modèles vision-langage-action (VLA) nécessite moins de couches qu'on ne le pense

Des chercheurs ont publié le 19 juin 2026 (arXiv:2606.20246) une méthode de compression structurelle pour les modèles VLA (Vision-Language-Action) tels que pi-0 (Physical Intelligence) et GR00T N1.5 (NVIDIA). Le constat de départ : ces architectures de plusieurs milliards de paramètres, pré-entraînées sur de vastes corpus vidéo-robot, imposent des coûts de calcul prohibitifs lors du fine-tuning et de l'inférence temps-réel. La méthode proposée est entièrement sans entraînement (training-free) : un unique passage forward via la Centered Kernel Alignment (CKA) suffit à identifier les couches redondantes du backbone VLM et de la tête de contrôle continu. En supprimant ces "couches jumelles", le pipeline compresse la profondeur du modèle jusqu'à 50 %. Les gains mesurés sont de 40 à 50 % sur le temps de fine-tuning et jusqu'à 30 % sur la vitesse d'inférence, tout en conservant des performances équivalentes ou supérieures au modèle complet. Les validations couvrent trois benchmarks de simulation (LIBERO, RoboCasa, SimplerEnv) et dix tâches de manipulation réelle sur quatre embodiments robotiques distincts. Ce résultat remet en question un présupposé structurant du domaine : la profondeur des VLA serait proportionnelle à leurs capacités. Démontrer qu'une redondance massive existe dans ces architectures malgré un entraînement sur des trajectoires physiques diversifiées est non trivial. Pour les intégrateurs et les équipes MLOps industrielles, l'impact pratique est direct : des cycles de fine-tuning deux fois plus courts réduisent le coût d'adaptation à de nouveaux environnements, nouveaux grippers ou nouvelles tâches, sans matériel supplémentaire. L'absence d'entraînement dans la phase de compression est particulièrement critique : les méthodes concurrentes (distillation, token pruning dynamique) exigent de charger le modèle complet, ce qui reste un goulot d'étranglement sur GPU A100/H100. Les VLA comme pi-0 (Physical Intelligence, fondée en 2023 par d'anciens de Google, DeepMind et Stanford) et GR00T N1.5 (NVIDIA, annoncé en mars 2025) représentent actuellement la frontière technique des politiques de manipulation généraliste. La compression de modèles pour robots est un axe de recherche actif : des travaux récents explorent la distillation (OpenVLA-OFT), la quantification et le pruning à la volée. Cette approche se distingue par sa simplicité opérationnelle : aucun dataset de calibration étendu, aucune phase d'optimisation. Les auteurs ne mentionnent pas de partenaire industriel ni de pipeline de déploiement à l'échelle, ce qui en fait pour l'instant une contribution de recherche prometteuse plutôt qu'un produit prêt à l'intégration.

💬 La moitié des couches de pi-0 ou GR00T seraient redondantes, et une seule passe forward suffit à les identifier : c'est le genre de résultat qui va faire mal aux équipes qui ont commandé des clusters H100 pour du fine-tuning robotique. Sans phase d'entraînement, sans dataset de calibration, juste une analyse de similarité entre couches (la CKA, si tu veux creuser). Reste à voir si ça tient hors benchmarks de simulation, mais l'idée que la profondeur des VLA soit largement du gras plutôt que du muscle, c'est une vraie remise en question du consensus actuel.

IA physiqueActu
1 source
Mem-World : modèles du monde conditionnés par l'action et augmentés par la mémoire pour la manipulation robotique persistante
26arXiv cs.RO 

Mem-World : modèles du monde conditionnés par l'action et augmentés par la mémoire pour la manipulation robotique persistante

Des chercheurs ont publié Mem-World sur arXiv (réf. 2606.18960, juin 2026), un modèle du monde multi-vues augmenté par mémoire pour la manipulation robotique. Le problème adressé est fondamental aux modèles du monde conditionnés par l'action (action-conditioned world models) : lors d'une tâche de manipulation, l'effecteur terminal occulte fréquemment la scène, et les mouvements rapides de la caméra embarquée au poignet rendent l'observation courante insuffisante pour prédire les vues futures, poussant les modèles à halluciner ou oublier des détails observés antérieurement. L'innovation centrale est W-VMem, une mémoire indicée par surfels (éléments de surface 3D) en 4D, centrée sur la vue poignet, qui ancre les observations historiques à des éléments de surface évoluant dans le temps. Cette structure permet une récupération de contexte conditionnée sur les actions futures et consciente de la géométrie de scène, via rendu et scoring basés sur les surfels. Sur les tâches de long horizon, le taux de réussite progresse de 58 % à 72 % grâce à la génération de données synthétiques, et la corrélation de Pearson entre évaluations simulées et performances réelles s'améliore de 14,5 % par rapport à Ctrl-World, le modèle de référence. Ce gain en corrélation est directement actionnable pour les équipes robotique : il indique qu'on peut davantage faire confiance aux rollouts simulés pour prédire le comportement réel d'une politique, réduisant la dépendance aux expérimentations physiques coûteuses. L'hallucination de scène était jusqu'ici un verrou majeur à l'utilisation des world models pour l'entraînement de politiques dextres ; en séparant explicitement quand et où chaque élément a été observé, W-VMem produit un contexte historique non-redondant et pertinent. Il convient toutefois de noter que les scénarios de test et les métriques d'évaluation ne sont pas détaillés dans le résumé disponible, ce qui limite l'interprétation directe des chiffres annoncés. Les world models conditionnés par l'action sont apparus d'abord en jeu vidéo et conduite autonome (DreamerV3, GAIA-1) avant d'être adaptés à la manipulation, domaine plus exigeant en raison des occlusions proches et de la dynamique de caméra embarquée. Ctrl-World est la référence directe contre laquelle Mem-World se positionne. Cette publication reste un preprint, non encore évalué par des pairs, sans partenaire industriel ni timeline de déploiement annoncé. Les suites naturelles incluent une évaluation sur des benchmarks standardisés comme RLBench et une intégration dans des pipelines de modèles Visual Language Action (VLA), où la cohérence temporelle des rollouts est un prérequis à l'entraînement à grande échelle.

RechercheOpinion
1 source
Sanctuary AI valide les performances de son IA physique chez un équipementier automobile de rang 1
27Robotics Business Review 

Sanctuary AI valide les performances de son IA physique chez un équipementier automobile de rang 1

Sanctuary AI (Sanctuary Cognitive Systems Corp.), basée à Vancouver, vient de valider une performance industrielle significative chez un équipementier automobile de rang 1 mondial, non nommé. La tâche consiste en l'insertion d'un connecteur filaire souple dans une cible en mouvement sur un convoyeur actif, un problème classique de manipulation dite "contact-rich" qui résiste depuis longtemps à l'automatisation traditionnelle. Le résultat annoncé est un taux de succès supérieur à 99,5% pour un temps de cycle de 2,54 secondes, aligné sur les cadences de production réelle du client. À noter que les métriques sont présentées sans détail sur la durée de l'essai ni le volume de cycles validés, ce qui invite à traiter ce résultat comme un proof-of-concept industriel plutôt qu'un déploiement en série. La démonstration s'inscrit dans la continuité de la présentation en avril 2026 de capacités de manipulation en zero-shot learning pour la préhension dextère. Ce résultat illustre une tendance de fond dans le secteur : face à l'horizon encore incertain de la commercialisation de masse des robots humanoïdes, certains acteurs pivotent vers une approche hardware-agnostique, en injectant leur couche d'IA physique sur des plateformes industrielles existantes. Pour un intégrateur ou un directeur de production, cela représente un chemin à valeur immédiate sans attendre la maturité mécanique des humanoïdes, tout en capitalisant sur des modèles d'IA qui seront ensuite portables vers les systèmes de prochaine génération. Le vrai verrou que Sanctuary prétend avoir levé est le couplage performance/cycle time : les projets de physical AI échouent souvent non par manque de précision mais par débit insuffisant. Si le taux de 99,5% à 2,54 secondes est confirmé en production continue, c'est un signal crédible que les VLA (vision-language-action models) commencent à franchir le seuil de l'exigence industrielle, pas seulement du laboratoire. Fondée au Canada, Sanctuary AI développe depuis plusieurs années une approche centrée sur l'IA généraliste pour corps robotiques, incluant des mains hydrauliques propriétaires haute dextérité. La société avait jusqu'ici communiqué davantage autour de son robot humanoïde Phoenix, mais le pivot stratégique annoncé aujourd'hui signale un repositionnement vers le déploiement accéléré sur bras industriels standards. Dans l'espace concurrent, Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et 1X (Helix) continuent d'investir massivement dans la voie humanoïde complète. Côté manipulation pure, Festo a testé ce mois-ci son GripperAI et lancé un préhenseur pneumatique léger, tandis que PSYONIC s'est associé à ABB Robotics. Sanctuary semble parier que la voie la plus rapide vers le chiffre d'affaires en manufacturing et logistique passe par l'intégration logicielle sur hardware existant, avant le déploiement des prochains systèmes industriels humanoïdes qu'elle annonce vouloir adresser également.

UEL'équipementier de rang 1 non nommé pourrait être européen (Valeo, Bosch, Continental, Aptiv), auquel cas ce pilote serait directement pertinent pour l'automobile FR/EU, mais l'absence de confirmation maintient l'impact au stade potentiel.

💬 99,5% à 2,54 secondes sur une cible mobile, c'est le genre de résultat qui sort enfin du labo. Le pivot de Sanctuary est net: plutôt que d'attendre que le robot humanoïde soit prêt, ils injectent leur IA sur les bras industriels existants, ce qui ouvre un chemin court vers la valeur pour pas mal d'intégrateurs. Sans durée ni volume de cycles communiqués, on reste sur du pilote, pas du déploiement série.

IA physiqueOpinion
1 source
Rapport technique Qwen-RobotManip : l'alignement permet le passage à l'échelle des modèles fondation pour la manipulation robotique
28arXiv cs.RO 

Rapport technique Qwen-RobotManip : l'alignement permet le passage à l'échelle des modèles fondation pour la manipulation robotique

L'équipe Qwen d'Alibaba a publié le 22 juin 2026 un rapport technique décrivant Qwen-RobotManip, un modèle fondation Vision-Langage-Action (VLA) conçu pour la manipulation robotique généraliste. Construit sur l'architecture Qwen-VL, le modèle introduit un cadre d'alignement unifié couvrant trois dimensions : la représentation sensorielle, le mouvement, et le comportement. Son corpus d'entraînement atteint environ 38 100 heures de données, constitué exclusivement de jeux de données open source et de vidéos en vue subjective des mains humaines, sans aucune collecte propriétaire. Un pipeline de synthèse convertit ces démonstrations égocentrées en trajectoires robot compatibles avec 15 plateformes matérielles différentes, dont AgileX ALOHA, Franka, UR et ARX. Évalué sur six benchmarks out-of-distribution (RoboCasa365, LIBERO-Plus, EBench, RoboTwin-Clean2Rand, RoboTwin-IF, RoboTwin-XE), Qwen-RobotManip surpasse les modèles précédents sur l'ensemble des configurations et remporte la première place du RoboChallenge avec une amélioration relative de 20 % par rapport à l'état de l'art antérieur. Ce résultat est significatif parce qu'il répond directement à une question centrale du secteur : peut-on appliquer aux données de manipulation robotique la même recette de scaling qui a propulsé les grands modèles de langage ? Jusqu'ici, la réponse restait négative, en raison de l'hétérogénéité structurelle des données de manipulation (formats, espaces d'action, embodiments incompatibles), qui rendait l'entraînement multi-sources incohérent plutôt que synergique. Qwen-RobotManip avance que l'alignement préalable des données résout ce problème, permettant l'absorption à grande échelle sans dégradation. Les capacités émergentes documentées (suivi d'instructions zero-shot, récupération d'erreurs réactive, transfert cross-embodiment) constituent, si elles se confirment en conditions industrielles réelles, un changement de paradigme pour les intégrateurs : moins de fine-tuning spécifique par robot, généralisation à de nouvelles tâches sans redéploiement complet du pipeline. Il convient toutefois de noter que les résultats reposent sur des benchmarks académiques et des validations en laboratoire réel ; aucun déploiement industriel n'est encore documenté, et l'écart sim-to-real reste une inconnue à l'échelle. Qwen-RobotManip s'inscrit dans une course serrée autour des VLA pour la manipulation, où Physical Intelligence (pi0 et pi0.5), Google DeepMind (RT-2, pi-0), et Hugging Face (LeRobot) occupent déjà des positions fortes. Le modèle de Qwen se distingue en revendiquant la performance la plus élevée sur les benchmarks OOD publiés à ce jour, et surtout en n'utilisant aucune donnée propriétaire, ce qui ouvre théoriquement la voie à une adoption plus large. La publication est un preprint arXiv (arXiv:2506.17846v1), pas encore soumis à peer review, et aucune date de disponibilité du modèle ni annonce de pilote industriel n'accompagne ce rapport. Les prochaines étapes probables incluent une intégration dans l'écosystème Hugging Face ou ModelScope et des évaluations indépendantes en conditions réelles.

💬 L'obstacle au scaling en robotique, c'était pas le manque de données, c'était leur incohérence structurelle. Qwen le prouve ici : aligner avant de scaler, et les benchmarks OOD s'envolent de 20%. Bon, c'est encore du labo et je ne vois aucun déploiement industriel documenté, mais avec zéro donnée propriétaire dans le corpus, les intégrateurs sur Franka ou UR ont une vraie porte d'entrée.

IA physiqueOpinion
1 source
AnnotateAnything : annotation automatique d'objets 3D pour la manipulation robotique
29arXiv cs.RO 

AnnotateAnything : annotation automatique d'objets 3D pour la manipulation robotique

Des chercheurs ont publié sur arXiv le 17 juin 2026 un framework baptisé AnnotateAnything (arXiv:2606.17446) pour annoter automatiquement des assets 3D bruts et les rendre exploitables dans des pipelines d'entraînement robotique. Le système convertit des modèles 3D passifs en assets "manipulation-ready" enrichis de labels sémantiques, physiques et interactifs sans intervention humaine, en s'appuyant sur deux pipelines complémentaires : un module de raisonnement visio-linguistique (VLM) infère les sémantiques d'objet et les contraintes d'interaction ; un second pipeline de physique, massivement parallèle, ancre ces priors dans la géométrie de chaque asset pour générer automatiquement poses de préhension, contacts dextres, waypoints d'articulation, directions d'insertion, affordances de suspension et cibles de navigation. Un système de collecte de données de simulation asynchrone s'appuie ensuite sur ces annotations pour couvrir objets, tâches et morphologies robotiques variés. L'enjeu est central : les assets 3D bruts ne contenant que de la géométrie, annoter manuellement des bibliothèques à l'échelle reste coûteux et non scalable. AnnotateAnything automatise cette étape en combinant priors sémantiques VLM et optimisation géométrique pour produire des labels physiques exécutables. Les auteurs rapportent des gains en efficacité d'annotation, en efficacité de collecte et en taux de réussite de tâches face aux pipelines existants, des résultats à prendre avec précaution puisque les benchmarks comparatifs sont ceux des auteurs eux-mêmes. Le support natif du VQA robotique et du fine-tuning d'instructions visuelles ouvre une intégration directe dans des pipelines VLA (Vision-Language-Action), paradigme dominant pour l'apprentissage de politiques généralisables à l'échelle. Ce travail s'inscrit dans une vague de recherche sur la scalabilité des données synthétiques, aux côtés de MimicGen (NVIDIA), RoboGen ou UniSim, tous ciblant la réduction du sim-to-real gap par voie simulée. La pénurie d'annotations structurées dans les assets 3D existants est un problème documenté depuis plusieurs années, faute d'alternative viable aux approches manuelles. AnnotateAnything se positionne comme infrastructure de données en amont de tout pipeline de simulation, sans cibler un robot ou un déploiement industriel précis. Les auteurs annoncent la publication du code complet, des annotations et d'un benchmark, un engagement qui, s'il est tenu, pourrait en faire une ressource partagée par la communauté ; aucun partenaire industriel ni déploiement terrain n'est mentionné à ce stade.

RechercheActu
1 source
EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe
30arXiv cs.RO 

EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe

Des chercheurs présentent EAGG (Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning), un modèle de génération de prises robotiques multi-effecteur publié en prépublication sur arXiv (arXiv:2506.18092). L'architecture représente chaque effecteur terminal via un graphe topologique et un espace de contrôle bas-dimensionnel propre à chaque morphologie, qu'il s'agisse de pinces parallèles classiques ou de mains dextères à plusieurs doigts. Un module backbone figé convertit l'état articulé courant en tokens géométriques réutilisables, qui sont rafraîchis de façon itérative tout au long du processus d'échantillonnage via un mécanisme baptisé iterative geometry injection. Sur le benchmark MultiGripperGrasp, EAGG atteint 56,17 % de taux de succès moyen sur six effecteurs d'entraînement, soit un écart de seulement 1,10 point de pourcentage par rapport à des modèles spécialisés entraînés séparément pour chaque préhenseur. L'injection géométrique itérative réduit par ailleurs la distance médiane de contact de 0,239 cm à 0,189 cm. Le code est disponible en open source sur GitHub. Ce résultat s'attaque à l'un des verrous les plus concrets pour les intégrateurs industriels : la nécessité de réentraîner ou d'affiner un modèle de saisie à chaque changement de préhenseur. L'approche dominante consiste aujourd'hui soit à entraîner un modèle par géométrie d'effecteur (coûteux en données et en compute), soit à encoder l'identité de l'effecteur via un descripteur statique, ce qui dégrade le transfert dès que la topologie ou le couplage d'actionnement diverge significativement. EAGG montre qu'encoder explicitement la structure morphologique dans un générateur partagé, plutôt que de masquer les différences inter-effecteurs, améliore à la fois la performance générale et la transférabilité zero-shot vers des préhenseurs non vus lors de l'entraînement. C'est un argument de poids pour les équipes robotiques cherchant à mutualiser les politiques de saisie sur une flotte multi-effecteurs. Ce travail s'inscrit dans la dynamique plus large de politiques robotiques universelles que poursuivent simultanément Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec Helix, tous confrontés au même défi de transfert inter-morphologie. EAGG se concentre sur le sous-problème de la saisie et propose une solution fondée sur les graphes, là où d'autres approches misent sur des encodages continus ou des plongements latents partagés. Il s'agit pour l'instant d'une contribution académique sans déploiement industriel annoncé ni partenariat applicatif déclaré, et les chiffres de performance sont à lire dans le cadre contrôlé du benchmark MultiGripperGrasp, ce qui laisse ouverte la question du sim-to-real gap en conditions réelles.

RechercheActu
1 source
SimTO : un cadre d'optimisation topologique en deux étapes, piloté par simulation, pour pinces robotiques souples sur mesure
31arXiv cs.RO 

SimTO : un cadre d'optimisation topologique en deux étapes, piloté par simulation, pour pinces robotiques souples sur mesure

Des chercheurs présentent SimTO, un cadre en deux étapes pour concevoir automatiquement des grippers souples sur-mesure, publié sur arXiv (2601.19098v2). Les grippers souples existants peinent à manipuler des objets à haute variabilité topologique: engrenages dentés sur lignes d'assemblage automobile, coraux aux excroissances fragiles, brocolis aux ramifications irrégulières. Face à ces géométries sans surface de contact "optimale" évidente, les designs généralistes risquent d'endommager la pièce ou d'échouer la prise. SimTO répond en deux phases: une simulation dynamique riche en contacts extrait automatiquement les cas de charge réalistes générés lors de la préhension, sans spécification manuelle; ces cas alimentent ensuite un algorithme d'optimisation topologique classique qui génère la morphologie finale du gripper. Les expériences physiques confirment que les grippers SimTO atteignent des forces de préhension supérieures aux designs généralistes conventionnels, avec un taux de succès élevé sur des positions variées et une bonne généralisation à des objets non vus durant l'entraînement. L'enjeu industriel réside dans l'automatisation d'un goulot de conception: adapter un gripper à une pièce complexe requiert aujourd'hui une expertise manuelle pour définir les forces de contact, un travail itératif et coûteux. SimTO supprime cette étape en déléguant la caractérisation des charges à la simulation. Pour un intégrateur en automobile ou en agroalimentaire, c'est une piste vers des outillages personnalisés sans expertise spécialisée à chaque nouveau composant. La généralisation aux objets non vus suggère que les grippers produits capturent des propriétés morphologiques larges plutôt que de sur-apprendre une géométrie précise. Nuance importante: les résultats sont entièrement en laboratoire; aucun déploiement industriel ni partenaire industriel ne sont mentionnés dans l'article. L'optimisation topologique est une méthode mature en ingénierie structurelle, qui génère des géométries minimisant la masse sous contraintes de rigidité. Son adaptation aux grippers souples était freinée par l'indétermination des forces de contact, par nature distribuées et dépendantes de la posture de la pièce. Ce travail s'inscrit dans la tendance sim-to-real qui traverse la robotique de manipulation: caractériser le problème physique en simulation avant de concevoir ou d'entraîner. Dans le paysage concurrentiel, les approches rivales incluent les méthodes d'apprentissage par renforcement pour le contrôle adaptatif, les grippers généralistes à morphologie universelle, et les travaux de co-design simulation-fabrication portés par des groupes comme le MIT CSAIL ou l'EPFL. Les prochaines étapes naturelles, non annoncées dans le preprint, seraient une validation sur lignes pilotes industrielles et une intégration dans un pipeline de fabrication additive.

RecherchePaper
1 source
T-Rex : manipulation dextérique à réaction tactile
32arXiv cs.RO 

T-Rex : manipulation dextérique à réaction tactile

Une équipe de chercheurs vient de publier T-Rex (Tactile-Reactive Dexterous Manipulation), un système d'apprentissage robotique qui intègre le retour tactile dans un modèle Vision-Language-Action (VLA) pour la manipulation dextre. Pour entraîner le système, les auteurs ont constitué un dataset de 100 heures de données tactiles à haute fréquence, collectées via une méthode centrée sur des primitives motrices élémentaires afin de maximiser l'efficacité de la collecte. L'architecture proposée, baptisée variable-rate Mixture-of-Transformers (MoT), est couplée à un encodeur tactile temporel de type VQ-VAE qui compresse les signaux tactiles à fréquence élevée sans saturer le flux de traitement du VLA de base. Validé sur 12 tâches de manipulation nécessitant un contrôle de force précis ou la gestion d'objets déformables, T-Rex affiche un taux de succès supérieur de plus de 30 % à celui du meilleur modèle concurrent testé. Ce résultat est significatif parce que les VLA actuels, dont Pi-0 de Physical Intelligence, OpenVLA ou les variantes de GR00T de NVIDIA, ignorent généralement le canal tactile ou se limitent à des encodeurs statiques incapables de capter la dynamique du contact en temps réel. Or, c'est précisément cette réactivité tactile qui distingue la dextérité humaine : ajuster la prise sur un objet glissant, détecter un défaut de surface, moduler la force sur un emballage souple. T-Rex démontre qu'il est possible de greffer un flux tactile à haute fréquence sur un VLA préentraîné sans dégrader ses capacités visuolinguistiques, ce qui ouvre la voie à une intégration progressive dans des pipelines d'apprentissage existants plutôt qu'à une refonte complète de l'architecture. La raison pour laquelle le tactile restait sous-exploité dans les VLA tient à trois obstacles cumulatifs : rareté des données tactiles diversifiées, contraintes architecturales des transformeurs optimisés pour la vision, et absence de benchmarks standardisés. T-Rex s'attaque aux trois simultanément, ce qui distingue ce travail des contributions précédentes comme DIGIT ou GelSight couplées à des politiques RL classiques. Dans le paysage concurrentiel, les acteurs spécialisés en capteurs tactiles (Contactile, Tac Sensing, BioTac) pourraient trouver dans ce framework un argument pour accélérer l'adoption hardware. Le code, le dataset et les poids du modèle ne sont pas encore mentionnés comme publics au moment de la soumission arXiv ; leur disponibilité conditionne la reproductibilité et l'impact réel de ce travail au-delà du laboratoire.

IA physiqueOpinion
1 source
DragMesh-2 : interaction main-objet dextérique physiquement plausible avec des objets articulés
33arXiv cs.RO 

DragMesh-2 : interaction main-objet dextérique physiquement plausible avec des objets articulés

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.15133v1) DragMesh-2, un framework de manipulation dextre d'objets articulés destiné aux mains multi-doigts. L'objectif est de permettre à un robot de manipuler des objets dont une partie est mobile (tiroir, poignée de porte, levier) sans pouvoir l'actionner directement, le mouvement devant émerger exclusivement du contact physique soutenu entre la main et la surface. Le système introduit PICA (Physically Informed Contact-Aware), un mécanisme d'entraînement qui injecte des signaux physiques dans l'apprentissage de politique sans capteur tactile ni retour de force, simplifiant ainsi l'instrumentation matérielle nécessaire. Évalué sur sept objets issus du dataset GAPartNet, DragMesh-2 a été soumis à plusieurs conditions de damping pour mesurer sa robustesse à la variation de charge de contact, sur lesquelles il surpasse les méthodes comparées. La distinction que DragMesh-2 cherche à établir est précise : la plupart des approches existantes en manipulation articulée s'appuient sur une génération centrée objet (object-centric), où les trajectoires sont calculées à partir de la géométrie de la cible. Rejouer ces trajectoires en boucle ouverte (open-loop) ne modélise pas la dynamique de contact nécessaire pour déplacer effectivement la partie articulée. Le problème devient critique quand la charge de contact varie, ce qui arrive fréquemment en conditions réelles : une porte mal alignée, un tiroir dilaté, un levier à résistance variable. PICA adresse ce point sans capteur additionnel, un avantage concret pour les intégrateurs voulant déployer des mains dextres sur des robots humanoïdes en environnement domestique ou assistif, où l'ajout de capteurs de force reste coûteux et fragile. Ce travail s'inscrit dans une tendance plus large qui cherche à dépasser le préhenseur parallèle (parallel-jaw gripper) pour les tâches de manipulation fine en milieu non structuré. GAPartNet, le benchmark utilisé, répertorie des parties articulées standardisées issues de la robotique domestique et constitue la référence commune de ce sous-domaine. La communauté humanoïde, dont les projets de Figure, Agility Robotics ou 1X Technologies, identifie la manipulation d'objets articulés comme un verrou majeur pour les déploiements en cuisine, atelier ou assistance à la personne. DragMesh-2 publie également une ressource en géométrie pure pour la manipulation dextre main-objet, destinée à alimenter les recherches futures en loco-manipulation. Aucun partenariat industriel ni timeline de déploiement n'est mentionné : c'est une contribution académique, pas un produit expédié.

RecherchePaper
1 source
PhysVLA : vers un modèle VLA physiquement ancré pour la manipulation robotique
34arXiv cs.RO 

PhysVLA : vers un modèle VLA physiquement ancré pour la manipulation robotique

Des chercheurs ont publié sur arXiv (arXiv:2606.13886, juin 2026) PhysVLA, un module d'inférence plug-and-play conçu pour corriger en temps réel les actions générées par n'importe quel modèle VLA (Vision-Language-Action) existant, sans rétro-entraînement ni accès aux poids. Le système intercepte les commandes produites par le backbone VLA et applique deux couches de correction successives : une machine à états finis sensible à la phase de la tâche (approche, saisie, transport, dépôt), puis un filtre sélectif basé sur les équations d'Euler-Lagrange qui ne s'active que lorsqu'un oracle de dynamique détecte une incohérence cinodynamique. Le surcoût de calcul est inférieur à 1 ms par pas de contrôle. Évalué sur quatre architectures distinctes (OpenVLA, OpenVLA-OFT, Force-VLA, Generalist-VLA) sur le benchmark LIBERO-Spatial avec un bras Franka Panda 7-DOF, PhysVLA améliore le taux de succès absolu jusqu'à 17 points, la stabilité jusqu'à 19 points, et l'efficacité de trajectoire jusqu'à 15 %, sans régression sur aucune tâche. Sur un sweep cross-simulateur (Robosuite Lift), la robustesse au jerk de trajectoire progresse d'un facteur 10. La validation sur un bras physique Agilex Piper (tâche pick-and-place réelle) confirme le transfert sim-to-real sans rétro-entraînement, avec une amélioration du taux de succès allant jusqu'à 50 %. L'intérêt industriel de cette approche tient à son caractère composable et backbone-agnostique. Les VLA actuels apprennent à imiter des démonstrations comportementales sans contraindre explicitement la physique des corps rigides ni les contacts, ce que les chercheurs nomment un "physics gap". Les correcteurs temporels classiques (temporal smoothing) masquent le problème sans le résoudre, et introduisent leurs propres échecs. PhysVLA propose une solution d'intégration légère pour les équipes qui déploient des VLA existants en production : pas de réentraînement, pas d'accès aux poids, un wrapper autour du modèle gelé. Pour un intégrateur ou un OEM, cela signifie potentiellement améliorer des systèmes déjà en ligne sans toucher aux pipelines de formation, ce qui réduit le risque et le coût de mise à niveau. PhysVLA s'inscrit dans la montée en puissance des approches de contrôle physique fondé pour les VLA généralistes, une problématique que des laboratoires comme Physical Intelligence (avec π0), Stanford (OpenVLA) ou Google DeepMind travaillent activement. Le papier positionne explicitement son framework comme complémentaire à ces backbones plutôt que concurrent. Il reste à ce stade un prototype de recherche validé en laboratoire sur deux plateformes matérielles (Franka Panda et Agilex Piper) ; aucun déploiement industriel ni partenariat commercial n'est annoncé. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges (RoboMimic, DROID) et sur des robots à plus haute cinématique, notamment des humanoïdes où la gestion des contacts et de la dynamique des corps rigides est critique.

UELes équipes R&D et intégrateurs européens déployant des VLA en production peuvent directement tester ce wrapper plug-and-play sans rétro-entraînement, mais aucun acteur ou déploiement européen n'est impliqué dans ce travail de recherche.

RechercheOpinion
1 source
ReactVLA : manipulation robotique rapide et légère par génération d'actions Mean Flow améliorée
35arXiv cs.RO 

ReactVLA : manipulation robotique rapide et légère par génération d'actions Mean Flow améliorée

Des chercheurs ont publié en juin 2026 un préprint arXiv (2606.14255) présentant ReactVLA, un framework VLA (Vision-Language-Action) conçu pour réduire drastiquement la latence d'inférence des politiques de manipulation robotique. Le problème ciblé est précis : les architectures VLA basées sur la diffusion, comme π₀ (Physical Intelligence) ou SmolVLA (HuggingFace/LeRobot), génèrent des distributions d'action expressives mais exigent un échantillonnage itératif coûteux, qui plombe leur utilisabilité en boucle fermée temps-réel. ReactVLA propose deux mécanismes complémentaires pour y remédier : un générateur d'actions iMF (improved Mean Flow) qui ramène la diffusion multi-étapes à une ou quelques passes seulement, et AttnRes (Attention Residuals), un mécanisme de routage dynamique des features par couche d'attention censé mieux préserver les représentations multimodales liées à la tâche. Sur les benchmarks de simulation LIBERO et RoboIMI, ainsi que sur des tâches de manipulation physique, ReactVLA affiche jusqu'à 1,65× de gain en taux de succès sur les tâches de précision et plus de 4× d'accélération à l'inférence par rapport aux VLA de référence de taille comparable. La latence de politique en conditions réelles tombe sous 38,6 ms. Ce seuil de 38,6 ms est le chiffre à retenir pour un intégrateur ou un ingénieur robotique : il passe sous la barre des 40 ms généralement considérée comme nécessaire pour un contrôle réactif crédible en manipulation dynamique, là où les modèles de diffusion standards restent souvent au-delà de 150 à 300 ms. Si les résultats se confirment hors contexte académique, cela répond à l'une des critiques récurrentes contre les VLA pour l'industrie : la qualité d'action est là, mais la cadence ne suit pas. L'approche Mean Flow (accélération de la diffusion par réduction du nombre d'étapes via un flux de probabilité direct) n'est pas nouvelle en vision générative, mais son application aux espaces d'action robotiques avec maintien des performances sur tâches de précision reste un résultat non trivial. Il faut cependant nuancer : il s'agit d'un preprint non relu, les benchmarks LIBERO et RoboIMI sont des environnements académiques standardisés loin des contraintes industrielles réelles, et les vidéos de démonstration présentées sur le site projet ne constituent pas une validation de déploiement. ReactVLA s'inscrit dans une course dense à l'efficacité des VLA depuis 2024. π₀ (Physical Intelligence) reste la référence en qualité d'action sur tâches bimanuelle complexes mais souffre précisément de cette latence. SmolVLA, publié par HuggingFace début 2025, vise la légèreté et l'accessibilité open-source. Côté industriel, GR00T N2 de NVIDIA et Helix (co-développé par Figure et d'autres partenaires) intègrent leurs propres pipelines VLA dans des architectures humanoïdes avec des contraintes de déploiement très différentes. Aucune affiliation institutionnelle ni source de financement n'est mentionnée dans le preprint, ce qui limite l'évaluation du contexte de transfert technologique. Les prochaines étapes naturelles seraient une validation sur des manipulateurs industriels (6-DOF, scénarios de pick-and-place variables) et une soumission en conférence de référence comme CoRL ou ICRA pour validation par les pairs.

UESmolVLA (HuggingFace, entreprise française) est cité comme référence comparative directe, mais ReactVLA est un preprint sans affiliation institutionnelle connue et sans déploiement démontré en Europe, l'impact reste indirect via l'écosystème open-source LeRobot.

IA physiqueOpinion
1 source
ORCA : une plateforme open source pour la recherche en dextérité
36arXiv cs.RO 

ORCA : une plateforme open source pour la recherche en dextérité

Une équipe de chercheurs présente ORCA, une pile logicielle open-source dédiée à la manipulation dextre par mains anthropomorphes, publiée sur arXiv (2606.14561) en juin 2026. La plateforme unifie en une seule interface le contrôle bas niveau, la simulation, la téleopération depuis des dispositifs grand public, et le retargeting de main, c'est-à-dire la conversion des mouvements d'une main humaine vers les actionneurs d'une main robotique. ORCA s'intègre nativement avec LeRobot, le framework de robot learning open-source de Hugging Face devenu référence dans la communauté. Les auteurs ont validé le système sur une tâche de réorientation objet en main (in-hand reorientation), en collectant des démonstrations par téleopération via un casque VR grand public, en entraînant une politique autonome avec LeRobot, puis en évaluant les résultats dans un environnement entièrement reproductible. Aucun chiffre de performance quantifié (taux de succès, temps de cycle) n'est communiqué dans l'abstract. Ce travail s'attaque à un verrou structurel du domaine : les mains dextres restent quasi-absentes des benchmarks de robot learning, non par manque de hardware accessible, mais parce que les couches logicielles, simulation, téleopération, retargeting, sont dispersées dans des dépôts non maintenus, sans connexion aux pipelines de données et d'entraînement standards. Résultat, les chercheurs travaillant sur les pinces parallèles à deux doigts (two-finger grippers) bénéficient d'un écosystème mature, tandis que les équipes mains anthropomorphes repartent de zéro à chaque projet. ORCA propose une fondation partagée pour homogénéiser cet effort, permettant de réutiliser les mêmes datasets, les mêmes recettes d'entraînement et les mêmes protocoles d'évaluation entre plateformes dextres et non-dextres. C'est un pari d'infrastructure communautaire, pas une avancée algorithmique. Le contexte immédiat est la montée en puissance de LeRobot comme socle commun du robot learning open-source, accélérant la demande pour des intégrations matérielles homogènes. La recherche en manipulation dextre reste dominée par quelques labos bien équipés (Stanford, CMU, Berkeley), souvent sur des mains propriétaires comme la Dexterous Hand d'Allegro ou la Shadow Hand. Côté européen, Pollen Robotics (Bordeaux) et Enchanted Tools intègrent des mains polydigitales dans leurs plateformes, et pourraient bénéficier directement d'une couche d'abstraction standardisée comme ORCA. La prochaine étape naturelle serait l'adoption par la communauté LeRobot et l'extension à des tâches multi-objets ou de manipulation bimanuelle, domaines où les grippers classiques atteignent leurs limites mécaniques.

UEPollen Robotics (Bordeaux) et Enchanted Tools pourraient adopter ORCA directement pour accélérer leurs développements sur mains polydigitales, en bénéficiant d'une couche d'abstraction standardisée native avec LeRobot, le framework open-source de HuggingFace (entreprise française).

RecherchePaper
1 source
WEAVER, meilleur, plus rapide, plus long : un modèle du monde efficace pour la manipulation robotique
37arXiv cs.RO 

WEAVER, meilleur, plus rapide, plus long : un modèle du monde efficace pour la manipulation robotique

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.13672) WEAVER (World Estimation Across Views for Embodied Reasoning), une architecture de modèle de monde (world model, WM) dédiée à la manipulation robotique. Le système, multi-vue, est entraîné à prédire des représentations latentes futures et des valeurs de récompense via une perte de flow-matching. Sur robot physique, WEAVER atteint une corrélation ρ = 0,870 entre trajectoires simulées et taux de succès réel en évaluation de politique (policy evaluation). Appliqué à l'amélioration de politique (policy improvement), il produit un gain de 38 % de taux de succès réel au-dessus du modèle de fondation robotique π₀.₅ de Physical Intelligence. En planification à l'inférence (test-time planning), il ajoute 14 % de succès supplémentaires, avec une vitesse de génération 5 à 10 fois supérieure aux WMs précédents. Le code, les modèles et les vidéos sont publiquement accessibles. Les modèles de monde représentent un levier structurant pour la robotique : évaluer ou améliorer des politiques de contrôle, planifier à l'exécution, sans multiplier les interactions coûteuses en environnement réel. Le verrou technique est triple, fidélité (les trajectoires simulées doivent refléter la réalité), cohérence sur longue horizon (les simulations ne doivent pas diverger dans le temps), et efficacité computationnelle. WEAVER satisfait simultanément ces trois critères là où les architectures précédentes échouaient généralement sur au moins l'un d'eux, en particulier sur la cohérence à long horizon pour des tâches de manipulation dynamique complexes. Le gain de 38 % sur π₀.₅ est particulièrement significatif : il démontre qu'un WM peut améliorer un modèle de fondation déjà performant sans collecte de données additionnelles en conditions réelles, réduisant ainsi les coûts de déploiement pour les intégrateurs industriels. Ce travail s'inscrit dans une compétition accélérée autour des world models pour la robotique embodied. Physical Intelligence avec π₀ et π₀.₅, Google DeepMind avec ses variantes RT et RoboDreamer, ainsi que des équipes académiques de Berkeley, CMU et Stanford ont chacun proposé des approches partielles. WEAVER se positionne comme une synthèse architecturale, avec un soin particulier apporté à la gestion de la mémoire et au traitement multi-vue. Aucun partenariat industriel ni calendrier commercial n'est annoncé à ce stade, et la validation reste circonscrite à des environnements de laboratoire contrôlés. La question centrale du sim-to-real gap à l'échelle, dans des environnements industriels non structurés, reste entièrement ouverte.

💬 38 % de gain sur π₀.₅ sans ajouter une seule donnée en conditions réelles, c'est du concret. Ce qui est rare, c'est qu'ils résolvent les trois verrous en même temps : fidélité, cohérence à long horizon, vitesse de génération. Le sim-to-real à l'échelle industrielle reste entier, mais pour l'instant c'est l'architecture la plus sérieuse que j'ai vue sur le sujet.

IA physiqueOpinion
1 source
FTP-1 : une politique fondation généraliste pour la manipulation en contact, compatible tous capteurs tactiles
38arXiv cs.RO 

FTP-1 : une politique fondation généraliste pour la manipulation en contact, compatible tous capteurs tactiles

Des chercheurs ont publié sur arXiv (arXiv:2606.13102) FTP-1, une politique tactile fondatrice généraliste préentraînée sur environ 3 000 heures de données de manipulation tactile agrégées depuis 26 sources distinctes, couvrant des démonstrations humaines et robotiques sur 21 capteurs différents. L'architecture repose sur des encodeurs hétérogènes qui projettent des signaux tactiles de natures variées -- images, tableaux de valeurs, états discrets -- en tokens latents unifiés et conscients de la morphologie, traités ensuite par un Transformer tactile partagé. Lors des expériences de fine-tuning sur 5 configurations matérielles distinctes, FTP-1 améliore les performances en manipulation riche en contacts de +17,2 % sur les capteurs vus à l'entraînement, et atteint un gain de +31 % sur deux configurations de capteurs jamais rencontrées lors du préentraînement. Ces chiffres sont issus d'un preprint académique et n'ont pas encore été soumis à évaluation par les pairs. Le résultat clé ici n'est pas la performance absolue mais la généralisation hors distribution. Depuis plusieurs années, les politiques tactiles restent prisonnières de leur hardware : un modèle entraîné sur un capteur GelSight ne transfère pas sur un capteur BioTac ou un réseau de pression matriciel. FTP-1 casse cette contrainte en proposant un point de départ partagé au niveau modèle, analogue à ce que les grands modèles de vision-langage-action (VLA) comme Pi-0 ou OpenVLA ont fait pour la manipulation visuelle. Pour un intégrateur industriel ou un laboratoire robotique, cela signifie potentiellement réduire le coût de collecte de données par capteur cible, en capitalisant sur un préentraînement généraliste plutôt que de repartir de zéro à chaque changement de gripper ou de skin tactile. Le chantier des politiques tactiles généralisables reste neuf. Les approches précédentes, comme celles développées autour des capteurs DIGIT (Meta) ou des grippers instrumentés de Stanford et MIT, sont restées cantonnées à des benchmarks monosenseurs. FTP-1 s'inscrit dans la tendance plus large des foundation models appliqués à la robotique physique, portée notamment par Physical Intelligence (Pi-0), Google DeepMind (RoboVLMs) et Figure AI. Aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade ; les poids préentraînés, les données et le code d'entraînement sont mis à disposition publiquement sur le site du projet, ce qui pourrait accélérer l'adoption par la communauté académique et les startups robotiques cherchant une base tactile mutualisée.

UELes laboratoires et startups européens travaillant sur la manipulation en contact peuvent exploiter directement les poids, données et code open-source de FTP-1 pour démarrer le développement de politiques tactiles sur leurs propres capteurs sans collecter de données from scratch.

💬 Le +31% sur les capteurs jamais vus pendant l'entraînement, c'est ça le vrai chiffre à retenir. Depuis des années, chaque politique tactile restait coincée sur son hardware, impossible de capitaliser d'un gripper à l'autre sans tout recommencer de zéro. Là on a enfin une base commune open-source pour le toucher, et ça c'est du concret.

IA physiqueOpinion
1 source
Vers une préhension séquentielle fiable d'objets en environnement encombré : solution finaliste du RGMC 2025
39arXiv cs.RO 

Vers une préhension séquentielle fiable d'objets en environnement encombré : solution finaliste du RGMC 2025

Une équipe de chercheurs a présenté à l'ICRA 2025, la principale conférence mondiale en robotique, un système de préhension séquentielle en environnement encombré, décrochant la deuxième place dans la piste "Pick-in-Clutter" de la 10e édition du Robotic Grasping and Manipulation Competition (RGMC 2025). Le système s'évalue sur le Cluttered Environment Picking Benchmark (CEPB), un protocole standardisé conçu pour des scénarios de ramassage séquentiel d'objets hétérogènes entremêlés. La solution combine une pince multifonctionnelle sur mesure, un module de reconnaissance d'objets, des stratégies de désencombrement actif et une approche de préhension multimodale capable de traiter à la fois des pièces rigides et des objets déformables. L'architecture produit une représentation explicite de la distribution spatiale des objets et de leurs relations d'occlusion, permettant au robot de planifier l'ordre de saisie le plus efficace tout en évitant les collisions. Ce résultat est significatif pour les intégrateurs industriels parce qu'il adresse un verrou applicatif précis : non plus saisir un objet isolé avec un taux de succès élevé, mais rechercher et extraire séquentiellement des cibles dans un tas désordonné, cas d'usage courant en picking e-commerce, en tri logistique ou en désassemblage. La gestion des objets déformables (sachets, textiles, pièces souples) reste un différenciateur rare : la plupart des systèmes commerciaux contournent ce cas. Les auteurs distinguent explicitement les "taux de succès élevés sur la saisie unitaire" déjà atteints dans la littérature des "solutions matures pour le tri séquentiel", un écart que ce travail cherche à combler. La validation en conditions de compétition sous contrainte temps, avec des objets non sélectionnés par l'équipe, renforce la crédibilité par rapport aux démonstrations en conditions contrôlées. Le RGMC est organisé annuellement depuis 2011 en marge de l'ICRA et constitue l'une des références de benchmark en manipulation robotique. Sur ce segment, les concurrents directs incluent des systèmes basés sur des grippers adaptatifs (Robotiq, OnRobot) et des solutions de bin-picking comme celles de Photoneo, Mech-Mind ou Roboception, souvent couplées à des pipelines de vision 3D. Aucun acteur européen n'est mentionné dans ce travail. L'article, déposé sur arXiv sous l'identifiant 2606.12954, ne précise pas l'affiliation institutionnelle de l'équipe ni de feuille de route vers une commercialisation. Les prochaines étapes naturelles seraient la mise en open source du benchmark CEPB et une validation sur un spectre plus large d'objets industriels réels.

RecherchePaper
1 source
À l'intérieur de XRZero-G0, un nouveau jeu de données ouvert de 2 000 heures pour la recherche en robotique
40Robotics Business Review 

À l'intérieur de XRZero-G0, un nouveau jeu de données ouvert de 2 000 heures pour la recherche en robotique

X Square Robot a mis en open source XRZero-G0, un système de collecte de données robotiques combinant un casque VR PICO 4 à tracking spatial inside-out, une caméra frontale et deux caméras poignet, ainsi qu'une paire de grippers physiques duals, un gripper en H à actionnement par pression et un gripper en G à entraînement digital. Le dispositif assure une estimation de pose 6-DOF à précision millimétrique et intègre un parsing spatiotemporel embarqué pour synchroniser flux visuels, données de trajectoire et annotations langagières. En parallèle, la société publie le G0-Dataset : 2 000 heures de démonstrations humaines multimodales, disponibles sur HuggingFace avec le code source sur GitHub. Sous conditions expérimentales contrôlées, X Square Robot annonce une réduction des besoins en données réelles pouvant atteindre un facteur 20x : environ 10 épisodes collectés sans robot, combinés à un seul épisode sur robot réel, suffiraient à égaler les performances d'un entraînement purement issu de données robotiques. L'enjeu est direct pour les équipes qui développent des politiques de manipulation dextre : le goulot d'étranglement de l'embodied AI n'est pas le compute, c'est la donnée de qualité à grande échelle. XRZero-G0 formalise ce que le secteur cherche depuis plusieurs années, une pipeline fermée "collecte-inspection-entraînement-évaluation" qui filtre automatiquement les trajectoires invalides via cinématique inverse corps entier avec contraintes de collision et de limites articulaires, et valide par rejeu réel sur robot avant d'intégrer les épisodes à l'entraînement. Si les chiffres de réduction 20x se confirment sur des tâches variées hors conditions de labo, cela change structurellement l'économie de déploiement des VLA (Vision-Language-Action models) : les industriels pourraient composer leurs datasets sans immobiliser de flotte robotique pendant des semaines. Le transfert cross-embodiment revendiqué, démontration humaine transférable à des plateformes non vues à l'entraînement, reste la promesse la plus forte, et la plus à vérifier indépendamment. X Square Robot s'inscrit dans un mouvement plus large de standardisation de la collecte de données robotiques, aux côtés d'initiatives comme Open-X Embodiment (Google DeepMind, 2023), DROID (Berkeley, 2024) ou les efforts de Physical Intelligence autour de pi0. Le positionnement open source du G0-Dataset rappelle la stratégie d'Hugging Face avec LeRobot, visant à créer une infrastructure commune de benchmarking. Aucun concurrent européen direct n'est impliqué ici, bien qu'Enchanted Tools et Wandercraft opèrent sur des segments adjacents (interaction et mobilité bipède) qui pourraient bénéficier de telles ressources de préentraînement. Les prochaines étapes annoncées incluent l'utilisation du dataset pour du préentraînement à grande échelle et des expériences de transfert cross-embodiment, sans timeline commerciale précisée, ce projet reste pour l'instant dans le périmètre recherche.

UELes équipes R&D françaises et européennes (Enchanted Tools, Wandercraft) pourraient exploiter le G0-Dataset open source pour le préentraînement de leurs modèles VLA, réduisant potentiellement leur dépendance à la collecte de données robotiques en flotte, si le facteur 20x se confirme hors conditions contrôlées.

IA physiqueOpinion
1 source
Combler le fossé morphologique : adapter les modèles VLA à la manipulation dextérique par ajustement conditionné par l'intention
41arXiv cs.RO 

Combler le fossé morphologique : adapter les modèles VLA à la manipulation dextérique par ajustement conditionné par l'intention

Des chercheurs ont publié sur arXiv (référence 2506.12109) un travail présentant InDex, un cadre d'adaptation permettant d'appliquer des modèles Vision-Language-Action (VLA) pré-entraînés aux mains dextres multi-doigts à haut degré de liberté (high-DoF), sans recourir à de larges volumes de données de démonstration. Le problème central adressé est le "morphology gap" : les VLA existants comme Pi-0, RT-2 ou OpenVLA sont presque exclusivement entraînés avec des préhenseurs parallèles à faible degré de liberté (1-DoF), alors que les mains dextres industrielles opèrent avec 12 à 24 DoF ou davantage. Adapter directement ces modèles par fine-tuning bout-en-bout sur mains multi-digitales provoque deux problèmes critiques : l'oubli catastrophique du raisonnement spatial acquis lors du pré-entraînement, et un effondrement de l'espace d'action causé par la rareté des données de démonstration. InDex y répond via une architecture découplée en deux étapes : la première aligne efficacement le backbone VLA pour prédire des trajectoires de bras et une intention de préhension scalaire continue ; la seconde fige ce backbone et utilise une tête de débruitage par diffusion, conditionnée sur cette intention, pour décoder les articulations fines des doigts. Tous les résultats présentés sont des benchmarks en simulation sur des tâches multi-étapes à contact riche, où InDex surpasse les baselines monolithiques. Ce travail identifie une limite structurelle des pipelines VLA que l'industrie commence à percevoir concrètement : passer d'un gripper à pince vers une main dextre n'est pas un simple problème de données supplémentaires, c'est une rupture topologique dans l'espace de contrôle. L'approche par héritage sémantique cross-morphologie réutilise le signal de préhension 1-DoF comme proxy macroscopique d'intention plutôt que de le jeter, ce qui préserve les priors spatiaux acquis. Pour un intégrateur ou un responsable R&D, la promesse est celle d'un fine-tuning efficace en données sur des end-effectors complexes sans repartir de zéro. Une réserve s'impose cependant : l'absence totale de résultats sur hardware réel laisse entière la question du sim-to-real transfer pour des contacts précis au niveau des phalanges, un défi encore non résolu dans le domaine. Le contexte dans lequel s'inscrit InDex est celui de la montée en puissance des VLA comme couche universelle de planification motrice. Physical Intelligence avec Pi-0 et Pi-0.5, Google DeepMind avec RT-2, et NVIDIA avec GR00T N2 ont chacun démontré des capacités de généralisation remarquables en manipulation générale, mais systématiquement avec des grippers standards. Côté mains dextres, les fabricants Shadow Robot, Inspire Robots ou Schunk disposent d'hardware performant sans politiques visuomotrices généralisables. Des approches concurrentes tentent l'adaptation par apprentissage par renforcement ou par réseaux de diffusion dédiés, mais InDex parie sur la réutilisation maximale des priors VLA existants. La prochaine étape logique serait une validation sur robot réel avec des benchmarks normalisés comme DEXART ou Bi-DexHands ; en l'état, l'article reste une contribution théoriquement solide en simulation, prometteuse mais non encore validée en conditions industrielles.

IA physiqueOpinion
1 source
Capteur tactile déformable en main avec détection intégrée du glissement, de la vitesse, force/couple et carte de pression
42arXiv cs.RO 

Capteur tactile déformable en main avec détection intégrée du glissement, de la vitesse, force/couple et carte de pression

Une équipe de chercheurs présente sur arXiv (preprint 2606.11952, juin 2026) un capteur tactile compact pour la manipulation en main, capable d'intégrer simultanément trois modalités : mesure de vitesse de glissement, force/couple et cartographie de pression, dans un seul dispositif à surface de contact déformable. Le capteur fonctionne sur des géométries planes et courbées pour une large gamme de matériaux. Sa fabrication combine des circuits imprimés standard (PCB) et du prototypage rapide, visant un coût de production bas. Réunir détection de glissement (slip-aware), force/couple et carte de pression dans une seule structure compliante simplifie l'intégration pour les grippers industriels et les mains humanoïdes, qui recourent aujourd'hui à plusieurs capteurs distincts. Cette consolidation réduit la complexité mécanique, les points de défaillance et le câblage embarqué, trois obstacles courants à la commercialisation des robots manipulateurs. Les auteurs affirment être les premiers à combiner ces modalités dans une structure unique ; cette revendication de priorité, portée par un preprint non encore relu par les pairs, reste à confirmer. Le champ des capteurs tactiles souples est animé depuis une décennie par des travaux comme GelSight (MIT), DIGIT (Meta AI Research) et les solutions commerciales de Xela Robotics ou Touchlab. La détection de glissement reste un défi ouvert, directement lié à la fiabilité des saisies en manipulation dynamique. Ce preprint ne documente pas encore d'intégration sur un robot réel ni de tests en conditions industrielles. Les prochaines étapes naturelles seraient une validation sur gripper ou main humanoïde, suivie d'une soumission en conférence robotique (ICRA, IROS ou RSS).

RecherchePaper
1 source
UniDexTok : un tokeniseur unifié pour mains dextériques à partir de données réelles
43arXiv cs.RO 

UniDexTok : un tokeniseur unifié pour mains dextériques à partir de données réelles

Une équipe de chercheurs a publié mi-juin 2026 sur arXiv (arXiv:2606.10683) un travail intitulé UniDexTok, proposant une représentation unifiée pour les états de mains dextres hétérogènes, humaines et robotiques. Le coeur du système est le Unified Dexterous Hand Model (UDHM), une interface sémantique partagée à 22 degrés de liberté (DoF) qui normalise les états articulaires de n'importe quelle main dans un espace commun. Sur cette base, UniDexTok est un tokenizer d'états appris exclusivement depuis des données réelles, sans recours au retargeting ni à la simulation. Les gains de précision par rapport à la baseline UniHM sont significatifs : l'erreur angulaire moyenne par articulation (MPJAE) chute de 15,63° à 0,16° (réduction de 98,98 %), et l'erreur de position par articulation (MPJPE) passe de 18,51 mm à 0,18 mm (réduction de 99,03 %), ramenant la reconstruction de l'échelle centimétrique à une précision sub-millimétrique. La portée industrielle de ce résultat tient moins aux chiffres absolus qu'à ce qu'ils rendent possible : un entraînement cross-embodiment sans pipeline de retargeting, qui a longtemps constitué un goulot d'étranglement dans la constitution de datasets pour mains dextres. Jusqu'ici, les données capturées sur une Shadow Hand, une Allegro ou une LEAP Hand étaient difficilement réutilisables pour un autre robot, faute de représentation commune. UniDexTok permet de les agréger : les expériences montrent que des données provenant d'autres embodiments améliorent la reconstruction sur l'embodiment cible, validant le principe de transfert cross-morphologie. Le système affiche également des capacités zero-shot et few-shot lors de l'introduction de nouvelles mains, ce qui réduit le coût d'intégration pour les intégrateurs qui déploient plusieurs plateformes en parallèle. La manipulation dextre reste l'un des défis les plus ouverts de la robotique humanoïde, avec une fragmentation des efforts entre labos (Dexterous Manipulation Group chez CMU, OpenAI Dactyl suspendu, Physical Intelligence avec Pi-0) et industriels (Tesla Optimus, Figure, Unitree). Les approches précédentes comme UniHM avaient posé la question de la représentation unifiée mais avec des erreurs de reconstruction trop élevées pour être exploitables en contrôle fin. UniDexTok s'inscrit dans un mouvement plus large vers des politiques robotiques génériques multi-embodiments, analogue à ce que les VLA (Vision-Language-Action models) tentent du côté de la perception. Les auteurs n'annoncent pas de déploiement industriel ni de partenariat ; il s'agit d'une contribution de recherche fondamentale, dont l'intégration dans des pipelines de formation de politiques reste à démontrer en conditions réelles.

RecherchePaper
1 source
UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI
44arXiv cs.RO 

UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI

Une équipe de recherche a déposé le 10 juin 2026 le preprint arXiv 2606.10382 décrivant UMI-Bench 1.0, présenté comme le premier benchmark entièrement dédié à l'évaluation en conditions réelles de politiques de manipulation robotique entraînées via l'Universal Manipulation Interface (UMI). Le benchmark cible la manipulation d'objets sur table (tabletop manipulation) et couvre l'intégralité de la chaîne de validation : collecte de données, réinitialisation de scène entre essais, exécution de politique, journalisation des résultats et analyse par facteurs de tâche. Il opère en mode "local-first", c'est-à-dire que les évaluations tournent directement sur robot réel, sans couche de simulation intermédiaire. L'UMI couple observations depuis une caméra montée au poignet, représentation des actions, collecte de démonstrations humaines et déploiement physique, une architecture dont les performances dépendent de la cohérence de chaque maillon. Ce benchmark répond à un problème structurel de l'apprentissage par imitation : l'absence de protocole standardisé conduit chaque équipe à évaluer ses politiques dans des conditions non comparables, ce qui rend la littérature difficile à arbitrer pour un intégrateur ou un décideur industriel. En rendant le processus reproductible et auditable, UMI-Bench permet de mesurer concrètement dans quelle mesure une politique entraînée sur des démonstrations généralise à des configurations physiques inédites, ce que les chercheurs appellent la sim-to-real (ici demo-to-real) generalization. C'est un enjeu central pour les politiques de diffusion (Diffusion Policy) et les VLA (Vision-Language-Action models), dont les performances en démonstration sélectionnée restent difficiles à quantifier sans infrastructure de test commune. L'UMI a été introduit en 2023-2024 par Cheng Chi et al. (Columbia University) comme interface portable de collecte de démonstrations : un opérateur guide un gripper équipé d'une caméra et d'un module de localisation, et les trajectoires servent directement à entraîner des politiques. Le paysage concurrent des benchmarks comprend LIBERO, DROID et le framework LeRobot de Hugging Face, qui proposent leurs propres protocoles mais sans calibration spécifique pour le pipeline UMI. L'étape logique suivante serait l'intégration de modèles fondationnels comme pi-0 (Physical Intelligence) ou OpenVLA dans ce protocole de référence, et l'extension à des tâches multi-étapes.

RecherchePaper
1 source
Bras robotique inspiré du poulpe : capteurs tactiles distribués pour une préhension adaptative
45Interesting Engineering 

Bras robotique inspiré du poulpe : capteurs tactiles distribués pour une préhension adaptative

Des ingénieurs ont développé un bras robotique souple inspiré de l'architecture sensorielle de la pieuvre, capable de saisir des objets de forme irrégulière sans s'appuyer uniquement sur le retour visuel. Le dispositif intègre des capteurs tactiles distribués sur l'ensemble d'un membre multi-segments en élastomère, capables d'enregistrer simultanément la force de contact, la géométrie de surface et les événements de glissement. Les capteurs fonctionnent comme des transducteurs piézorésistifs ou capacitifs disposés en grille dense sur la surface interne du bras, produisant une cartographie spatiale de la pression mise à jour en continu pendant la préhension. Une couche d'éléments de détection de forme est intégrée en parallèle, fournissant au contrôleur une estimation en temps réel de la configuration du membre, ce qui permet au bras de connaître sa propre géométrie sans retour visuel. Le système reste à ce stade un prototype démontrant la préhension sur une gamme variée de formes d'objets. L'intérêt de cette architecture réside dans le traitement local du signal tactile, avant toute transmission vers un contrôleur centralisé. En réduisant la latence de communication, le bras peut initier des mouvements correctifs, comme un resserrement autour d'un objet qui glisse, plus rapidement qu'un système à traitement centralisé ne le permettrait. Pour les intégrateurs travaillant sur des environnements non structurés, que ce soit en robotique chirurgicale, inspection sous-marine ou automatisation logistique, cela répond à un verrou réel : la géométrie des objets est rarement connue à l'avance, et l'occlusion visuelle est fréquente une fois le contact établi. La compliance seule, sans feedback sensoriel en boucle fermée, s'est révélée insuffisante dans les travaux antérieurs sur les préhenseurs souples. Cette approche distribuée reproduit le traitement ganglionnaire des céphalopodes, où les réponses réflexes naissent au niveau du membre plutôt qu'au niveau du cerveau central. La pieuvre constitue une référence fonctionnelle établie en robotique depuis plusieurs années, chacun de ses huit bras concentrant environ deux tiers des neurones totaux de l'animal. Les équipes travaillant sur la manipulation dextère avaient identifié cette architecture comme un modèle d'efficacité, mais les tentatives de réplication matérielle se heurtaient au compromis récurrent entre compliance et transmission de force. Côté concurrence, des travaux sur les grippers souples ont été menés par des laboratoires comme MIT CSAIL, ETH Zurich ou des acteurs commerciaux tels que Soft Robotics (aujourd'hui absorbé), sans qu'aucun ne résolve complètement la question du feedback tactile distribué à l'échelle industrielle. Les limitations actuelles du prototype sont réelles : les actionneurs pneumatiques ou à tendons introduisent leur propre latence et nécessitent des sources de pression externes, tandis que la durabilité de l'interface capteur-élastomère sous cycles répétés de flexion reste une question ouverte, non résolue par l'équipe à ce stade.

UELes équipes européennes travaillant sur la manipulation dextre en robotique chirurgicale ou logistique (dont ETH Zurich déjà actif sur les grippers souples) peuvent surveiller cette approche, mais le prototype ne cible pas directement le marché EU et n'implique pas d'acteur français.

RecherchePaper
1 source
Festo lance GripperAI, un logiciel pour simplifier la manipulation flexible des robots
46Robotics & Automation News 

Festo lance GripperAI, un logiciel pour simplifier la manipulation flexible des robots

Festo a lancé GripperAI, un logiciel d'intelligence artificielle destiné à simplifier la préhension flexible en robotique industrielle. La solution permet à un robot de saisir des produits mélangés, inconnus ou positionnés aléatoirement sans programmation préalable, sans chargement de gabarits et sans intégration spécialisée de systèmes de vision. Le logiciel identifie automatiquement le point de préhension optimal pour chaque pièce et sélectionne l'effecteur le plus adapté parmi ceux disponibles, sans intervention d'un intégrateur à chaque changement de référence produit. L'enjeu est significatif pour les lignes de conditionnement, logistique et assemblage léger : la reprogrammation manuelle lors des changements de produits représente aujourd'hui l'un des principaux freins à la flexibilité des cellules robotisées. Une solution capable de gérer le bin-picking et le mixed-SKU handling sans expertise vision spécialisée réduit à la fois les coûts d'intégration et les temps d'arrêt lors des transitions de production. À noter toutefois que l'article source ne précise ni les taux de réussite de préhension, ni les temps de cycle, ni les conditions de test, des métriques indispensables pour évaluer la maturité industrielle réelle du produit. Festo, groupe allemand spécialisé en automatisation pneumatique et électrique avec plus de 20 000 employés, intensifie depuis plusieurs années son virage vers les solutions logicielles et l'IA embarquée. Sur ce segment de la préhension intelligente, la concurrence inclut Pickit (Belge, racheté par Intertek), Robovision et plusieurs offres OEM de FANUC, KUKA et Universal Robots. Les prochaines étapes annoncées par Festo restent floues à ce stade, GripperAI n'ayant pas encore de timeline de déploiement commercial communiquée publiquement.

UEFesto (DE), acteur majeur de l'automatisation industrielle européenne, introduit une solution IA de préhension flexible qui pourrait réduire les coûts d'intégration sur les lignes industrielles EU, dans un segment où des concurrents européens comme Pickit (BE) et Robovision sont directement positionnés.

FR/EU ecosystemeActu
1 source
GEAR-VLA : un modèle VLA intégrant la géométrie pour une manipulation robotique généralisable
47arXiv cs.RO 

GEAR-VLA : un modèle VLA intégrant la géométrie pour une manipulation robotique généralisable

Des chercheurs ont publié sur arXiv en juin 2026 (réf. 2606.08530) GEAR-VLA, un framework Vision-Language-Action (VLA) conçu pour généraliser la manipulation robotique à des objets inconnus, des décors visuels changeants et des morphologies hétérogènes. Sur le benchmark LIBERO, le modèle atteint les meilleures performances publiées à ce jour, ainsi que des résultats de pointe sur RoboTwin 2.0 et LIBERO-Plus en zero-shot. Sur un bras AgileX, GEAR-VLA affiche 85,9% de réussite ; sur le LDT-01, une morphologie absente de la phase d'entraînement, il obtient 81,0%. Le test le plus contraignant reste un benchmark de préhension universelle de 6 360 essais impliquant 212 objets inédits, où le modèle atteint 90,1% de succès. Le code et les poids seront mis en open source sur GitHub. Ce résultat s'attaque directement au problème qui freine le déploiement industriel des VLAs : la généralisation cross-embodiment et cross-catégorie d'objets. GEAR-VLA repose sur trois mécanismes distincts : un apprentissage coarse-to-fine avec préentraînement multi-sources, une intégration 3D sémantiquement alignée (backbone spatial 3D entraînable couplé à une voie visuelle VLM gelée), et une canonicalisation d'embodiment qui isole les différences morphologiques à l'interface bas niveau via un expert d'action continu de type DiT découplé en gradient. Les 90,1% obtenus sur 212 objets inédits en conditions réelles constituent une réponse partielle à l'hypothèse selon laquelle les VLAs exigent un fine-tuning spécifique à chaque nouvelle catégorie, même si l'absence d'évaluations sur des tâches longues et multi-étapes laisse la question ouverte pour les intégrateurs industriels. Les VLAs dominent la recherche en manipulation depuis RT-2 de Google DeepMind en 2023, avec des jalons successifs que sont OpenVLA (Berkeley), Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA en 2025. La compétition se joue aujourd'hui précisément sur la généralisation zéro-shot et le transfert cross-embodiment, deux axes sur lesquels GEAR-VLA revendique un avantage différenciant. Les benchmarks retenus, LIBERO et RoboTwin 2.0, sont désormais des références standard du domaine, ce qui rend les comparaisons directement lisibles pour la communauté. Il s'agit d'une publication académique sans partenaire industriel annoncé ni déploiement hors laboratoire confirmé. La mise en open source des poids permettra de valider ces résultats sur des plateformes plus complexes, notamment des configurations multi-bras ou à forte variabilité environnementale.

UELa mise en open source imminente des poids permettra aux laboratoires de robotique européens (INRIA, CEA-List, universités techniques) de benchmarker GEAR-VLA sur leurs propres plateformes sans dépendre d'un fine-tuning propriétaire, réduisant potentiellement la barrière à l'adoption industrielle des VLAs en Europe.

IA physiqueOpinion
1 source
Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts
48arXiv cs.RO 

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts

Des chercheurs ont publié le 9 juin 2026 sur arXiv (arXiv:2606.08737) Dream-Tac, un modèle d'action mondial unifié intégrant la modalité tactile pour la manipulation robotique en contact. L'architecture joint trois dimensions simultanément : la génération d'actions, la prédiction d'observations visuelles futures et la dynamique tactile. Deux contributions techniques structurent le système : une fusion visuotactile à déclenchement par contact ("contact-gated visuotactile fusion"), qui intègre sélectivement les signaux tactiles uniquement lors des phases d'interaction physique effective, et un biais d'attention conscient du contact ("contact-aware attention bias") régulant les échanges cross-modaux. Pour rendre le modèle déployable en temps réel, les auteurs introduisent une stratégie d'accélération à deux niveaux : reformulation du biais lors de l'entraînement pour préserver les chemins d'attention fusionnés, et accélération de la diffusion par cache à l'inférence. Résultat annoncé : entraînement 2,9 fois plus rapide, inférence 1,8 fois plus rapide. Sur six tâches de manipulation en contact riche, Dream-Tac améliore la précision des actions de 31,7 % en moyenne. Le code est publié sur GitHub. Le résultat le plus significatif n'est pas le chiffre brut des 31,7 %, mais ce qu'il révèle sur une limitation structurelle des modèles d'action mondiaux (world action models) actuels : ces architectures, qui héritent la capacité prédictive des world models pour guider la génération d'actions, s'appuient quasi exclusivement sur la vision. Or, la vision seule est insuffisante pour les tâches à fort contact (assemblage de pièces, vissage, insertion de connecteurs, manipulation d'objets souples) où les signaux critiques sont d'ordre haptique. Dream-Tac adresse directement ce "reality gap" tactile, en montrant que l'intégration conditionnelle de la modalité tactile dans le pipeline de diffusion améliore substantiellement la robustesse. Pour les intégrateurs industriels et les équipes robotique travaillant sur des cellules d'assemblage ou de finishing, c'est un signal clair que les VLA (Vision-Language-Action models) ne suffisent pas seuls pour les cas d'usage à contact. Le contexte est celui d'une compétition intense entre laboratoires sur la manipulation dextère. Physical Intelligence (pi0, pi0-FAST), Boston Dynamics, Figure AI et Agility Robotics investissent massivement dans des pipelines de manipulation généralisable, principalement visuels. Côté recherche académique, des travaux comme DexDiffuser ou UniDexGrasp ont posé les bases de la manipulation dextère par diffusion, mais sans intégration tactile unifiée. Dream-Tac s'inscrit dans une tendance émergente visant à enrichir ces pipelines avec des capteurs de contact (GelSight, Digit, BubbleGripper), encore peu intégrés dans les architectures de world models. Il s'agit ici d'un article de recherche arXiv, pas d'un produit ou d'un déploiement industriel : les six tâches de validation sont des benchmarks contrôlés en laboratoire, et la généralisation à des environnements réels non structurés reste à démontrer. Les prochaines étapes naturelles seraient une validation sur des plateformes hardware commerciales (UR, Franka, ou bras dextre humanoïde) et une extension à des gripper tactiles standardisés disponibles sur le marché.

RechercheOpinion
1 source
Modèle de diffusion sensible aux correspondances pour la manipulation robotique en contact étroit (Robot-DIFT)
49arXiv cs.RO 

Modèle de diffusion sensible aux correspondances pour la manipulation robotique en contact étroit (Robot-DIFT)

La manipulation robotique échoue souvent dans les derniers millimètres : un bras peut identifier le bon objet mais rater l'alignement de pose ou le contact précis nécessaire à l'action. Robot-DIFT (arXiv:2602.11934) est une architecture d'encodeur visuel présentée dans un preprint académique pour combler ce manque, en exposant aux politiques de contrôle des features de correspondance sensibles aux variations fines de pose et de géométrie de contact. L'approche repose sur la distillation de variété (Manifold Distillation) : un modèle de diffusion bruit-conditionné sert de Teacher et transfère sa structure de représentation à un Student déterministe à passe unique, compatible avec le contrôle temps réel. Un réseau pyramidal spatial-sémantique (S2-FPN) fusionne ensuite les features multirésolution pour exposer à la politique à la fois contexte global et détail de contact fin. Évalué sur RoboCasa, LIBERO-10 et sur robots physiques, Robot-DIFT dépasse les encodeurs VLA, auto-supervisés, géométriques et diffusion directe sur les tâches sensibles au contact. L'enjeu est structurant pour la robotique de précision et les intégrateurs industriels. Les encodeurs sémantiques qui équipent les VLA modernes, comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, reconnaissent les objets à l'échelle scène mais écrasent les indices de correspondance fine dont le contrôle en boucle fermée a besoin : c'est ce qui bloque l'assemblage de précision, l'insertion et la manipulation en milieu non structuré. Les modèles de diffusion encodent naturellement ces correspondances denses, mais leur stochasticité et leur latence élevée les rendaient inutilisables directement. Robot-DIFT propose une alternative : distiller ces features en un backbone déterministe temps réel sans perdre leur avantage de correspondance. Les travaux sur les features de diffusion en vision 2D (DIFT, Diffusion Hyperfeatures) avaient posé les bases théoriques sans transposition robotique praticable. Robot-DIFT se positionne face aux encodeurs auto-supervisés établis comme R3M, MVP et VC-1, et aux représentations issues des VLA. Aucun acteur européen n'est cité dans ce travail, mais des entreprises comme Enchanted Tools ou Wandercraft, dont les cas d'usage requièrent une précision millimétrique, sont dans le périmètre d'application direct. Les prochaines étapes logiques incluent l'intégration dans des politiques diffusion (Diffusion Policy, ACT) et des évaluations sur benchmarks industriels plus représentatifs que les suites académiques actuelles.

UEDes entreprises françaises comme Enchanted Tools et Wandercraft, dont les cas d'usage requièrent une précision millimétrique, pourraient bénéficier de cette architecture si elle est intégrée dans des politiques de contrôle open-source diffusion ou ACT.

IA physiquePaper
1 source
EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet
50arXiv cs.RO 

EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet

Des chercheurs ont publié en juin 2026 sur arXiv un framework baptisé EgoAERO, capable d'apprendre la manipulation dextre à partir d'une unique démonstration vidéo RGB-D égocentrique humaine, sans recourir à aucun asset 3D de l'objet manipulé. Le pipeline enchaîne trois modules : un tracking et une reconstruction de l'objet sans asset préalable, une compensation du mouvement égocentrique de la caméra, et une optimisation adaptative des contacts main-objet. Les trajectoires cohérentes obtenues sont ensuite converties en politiques robotiques via un apprentissage résiduel en deux étapes. Les auteurs introduisent également un mécanisme d'évaluation de qualité en ligne et publient EgoDex-R, un dataset de 4,3 millions de frames RGB-D pour l'entraînement de politiques dextres. En simulation comme en conditions réelles, EgoAERO atteint des performances proches des reconstructions assistées par modèles CAD sur le benchmark HOI4D, référence standard pour l'interaction main-objet. Le verrou technique levé ici est structurant pour la robotique dextre : jusqu'ici, les méthodes d'imitation à partir de vidéo humaine exigeaient soit des scans 3D préalables des objets, soit plusieurs démonstrations, soit des marqueurs visuels. Or, scanner chaque objet d'un environnement industriel ou domestique est un frein majeur à la scalabilité des systèmes. EgoAERO suggère qu'une caméra RGB-D standard (de type Intel RealSense ou intégrée à des lunettes connectées) et une seule prise vidéo suffisent pour bootstrapper une politique robotique fonctionnelle. C'est un signal fort en faveur d'une démocratisation de la collecte de données dextres, potentiellement réalisable par des opérateurs non spécialisés plutôt que par des sessions de télé-opération coûteuses. Ce travail s'inscrit dans une vague de recherche visant à exploiter les corpus vidéo égocentrique à grande échelle (Ego4D, HOI4D, EPIC-Kitchens), jusqu'ici sous-utilisés pour le robot learning faute de géométrie objet exploitable. Les approches concurrentes en manipulation dextre reposent encore largement sur la télé-opération avec gants haptiques (Physical Intelligence avec pi0, Dexterous Manipulation Lab de CMU) ou sur des assets CAD (DITTO, DexMV). EgoAERO n'est à ce stade qu'un preprint, sans déploiement industriel annoncé ni validation sur une large variété d'objets du monde réel : les expériences rapportées restent sur des scènes contrôlées du benchmark HOI4D, et la robustesse à des objets déformables ou transparents reste à démontrer.

RecherchePaper
1 source