Aller au contenu principal

Dossier Manipulation robotique — page 7

620 articles · page 7 sur 13

La manipulation robotique : pinces dextres, peau électronique, grasping, benchmarks de tâches fines, le goulot d'étranglement principal des humanoïdes.

301arXiv cs.RO RecherchePaper

Affordance-Based : planification de manipulation guidée par du texte et généralisation sim-vers-réel via conversion réel-vers-sim

Des chercheurs présentent un système de planification de manipulation robotique fondé sur la reconnaissance d'affordances (les possibilités d'action qu'offre un objet) et la prédiction des effets des actions. Concrètement, le système génère plusieurs futurs visuels possibles à partir de l'état actuel de la scène, puis sélectionne le plan dont le résultat prédit correspond le mieux à un objectif exprimé en langage naturel au moment de l'exécution, via un module de correspondance objectif-image multimodal. Sa particularité: le suivi de la position des objets nommés dans la consigne reste actif même lorsqu'ils deviennent occlus ou que leur apparence change en cours de tâche, ce qui permet de continuer à planifier là où un système classique perdrait la cible. Les auteurs ajoutent un module de conversion d'image "réel-vers-simulation", qui traduit les images d'un environnement physique, avec des objets de formes et de textures variées, vers une représentation visuelle standardisée proche de celle utilisée en simulation, pour faciliter le transfert vers un robot réel. Le système est évalué module par module puis testé de bout en bout sur des tâches de manipulation jugées difficiles, en simulation et sur banc matériel. L'enjeu dépasse la démonstration technique: c'est une tentative de répondre frontalement au problème du sim-to-real, en normalisant visuellement la scène réelle plutôt qu'en essayant de faire converger deux domaines visuels différents par entraînement. Pour les équipes qui développent des robots pilotables par consigne textuelle, la persistance du suivi d'objet malgré l'occlusion est un point dur classique des pipelines de manipulation, souvent négligé dans les démonstrations en conditions idéales. Le papier ne revendique pas de généralisation zero-shot totale, mais isole méthodiquement les briques (affordances, prédiction, matching texte-image, conversion visuelle) plutôt que de les noyer dans un modèle monolithique de bout en bout, ce qui facilite le diagnostic des points de rupture. Ce travail s'inscrit dans la lignée des systèmes de planification par affordances et des modèles vision-langage-action récents (RT-2, OpenVLA, Pi-0, GR00T N2, Helix), mais s'en distingue par une architecture modulaire plutôt qu'un modèle end-to-end unique. Publié comme preprint arXiv le 14 juillet 2026, sans affiliation ni benchmarks chiffrés détaillés dans le résumé, il reste à ce stade non revu par les pairs; les suites logiques seraient une comparaison directe avec les approches VLA sur des benchmarks standardisés.

1 source
302arXiv cs.RO 

Politique de carte d'action : apprentissage de la manipulation 3D en boucle fermée par classification de pixels

Des chercheurs viennent de publier sur arXiv (2607.10706, 14 juillet 2026) un nouveau cadre baptisé Action Map Policy (AMP), qui reformule l'apprentissage de politiques de manipulation robotique en boucle fermée comme un problème de classification dans l'espace image plutôt que comme une régression continue. L'idée centrale consiste à projeter les actions 3D du bras robotique sur le plan de la caméra et à traiter chaque pixel comme une classe discrète à prédire, ce qui limite l'explosion combinatoire du vocabulaire tout en conservant une précision de l'ordre du millimètre. Contrairement aux approches par diffusion, qui nécessitent un débruitage itératif coûteux en temps de calcul, AMP prédit l'intégralité d'un segment d'actions en une seule passe avant, ce qui accélère nettement l'inférence. Les auteurs rapportent des taux de réussite supérieurs à plusieurs méthodes de référence sur diverses tâches de manipulation, ainsi qu'un raisonnement spatial amélioré. Le choix de la représentation d'action reste l'un des obstacles majeurs des politiques robotiques modernes, notamment pour les modèles vision-langage-action (VLA) qui cherchent à généraliser au-delà des tâches d'entraînement. La classification par pixels s'inspire du succès des modèles génératifs de langage, où la prédiction du prochain token a supplanté les approches par régression directe. En robotique, cette analogie est plus délicate car l'espace d'action est continu et de haute dimension, avec des solutions optimales souvent multimodales. En résolvant le compromis entre discrétisation fine et vocabulaire gérable, AMP répond directement à une limite pratique des politiques par diffusion, jugées précises mais lentes, un frein pour les applications nécessitant un contrôle réactif en temps réel. Il s'agit pour l'instant d'un travail de recherche académique, sans lien annoncé avec un produit commercial ou un déploiement industriel. AMP s'inscrit dans une lignée d'alternatives aux politiques par diffusion (popularisées par Diffusion Policy) et aux approches autorégressives de type VLA (Pi-0, GR00T N2, OpenVLA). Les prochaines étapes attendues incluent une validation sur robots physiques au-delà des expériences en simulation ou banc de test décrites dans l'article, ainsi qu'un examen par les pairs.

RecherchePaper
1 source
303arXiv cs.RO 

SpikeATac : un doigt tactile multimodal à détection dynamique taxélisée pour la manipulation dextérique

Le ROAM Lab présente SpikeATac, un doigt tactile multimodal pour la manipulation robotique dextre, dans une révision (v3) d'un article initialement publié sur arXiv en octobre 2025. Le capteur combine un film PVDF taxelisé, découpé en 16 zones de détection et échantillonné à 4 kHz, qui capte les signaux dynamiques dès l'amorce et la rupture du contact, avec une couche capacitive assurant la mesure statique de la pression, d'où sa réponse en "pics" qui lui donne son nom. Les chercheurs ont caractérisé la sensibilité de chaque modalité et montré que SpikeATac permet d'arrêter une préhension rapidement et délicatement sur des objets fragiles ou déformables. Au-delà de la pince parallèle, l'équipe a intégré le capteur à une main robotique multidoigts dextre, pilotée par une politique affinée via apprentissage par renforcement à partir de retour humain (RLHF) pour moduler la force appliquée. Résultat revendiqué: une manipulation en main d'objets fragiles jamais démontrée jusque-là sur ce type de plateforme. Des vidéos sont disponibles sur roamlab.github.io/spikeatac. Ce travail cible un angle mort connu des mains robotiques: la plupart des capteurs tactiles privilégient soit la résolution statique, soit la réactivité dynamique, rarement les deux, ce qui limite la détection de l'instant où un objet commence à glisser ou se déformer sous la pince. Un retour tactile à 4 kHz couplé à une lecture statique fiable vise directement les cas d'usage où les pinces industrielles classiques échouent ou abîment la charge (fruits, verre, colis, composants électroniques). Le choix du RLHF plutôt qu'une simple fonction de récompense simulée suggère que le réglage fin de la force reste difficile à spécifier automatiquement, un signal utile pour les intégrateurs évaluant des politiques apprises en conditions réelles. SpikeATac se distingue des capteurs à caméra interne comme GelSight ou DIGIT, plus coûteux en calcul et moins réactifs aux événements de contact rapides. L'article, purement académique, ne mentionne ni partenariat industriel ni déploiement hors laboratoire: c'est une preuve de faisabilité, pas un produit commercialisé. Aucun acteur français ou européen n'y figure. Les auteurs évoquent comme suites possibles la miniaturisation du capteur pour des mains commerciales et l'extension du pipeline RLHF à d'autres tâches de manipulation en contact riche.

RecherchePaper
1 source
EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
304arXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%. Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel. Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

RechercheActu
1 source
GeoProp : ancrer l'état du robot dans la vision pour une manipulation généraliste
305arXiv cs.RO 

GeoProp : ancrer l'état du robot dans la vision pour une manipulation généraliste

La proprioception, c'est-à-dire la connaissance par le robot de la position et de la vitesse de ses propres articulations, est généralement injectée dans les politiques de manipulation comme un simple vecteur numérique, sans lien explicite avec les images captées par les caméras. Des chercheurs de l'Alibaba DAMO Academy proposent GeoProp, un module léger et greffable qui corrige ce défaut en projetant géométriquement l'état du robot sur le plan image pour échantillonner les caractéristiques visuelles locales correspondantes, créant un "jeton d'état ancré" dans la scène. Le système injecte ensuite ces informations spatiales dans les caractéristiques visuelles via une modulation FiLM, et anticipe le mouvement en échantillonnant également les caractéristiques à une position future prédite à court terme à partir de la cinématique récente. Testé sur 67 tâches, GeoProp améliore Diffusion Policy de 8,7% sur 63 tâches en simulation, la politique pi0 de 4,0% sur un sous-ensemble RoboTwin, et apporte un gain moyen de 10,6% en conditions réelles sur les deux familles de politiques, pour un coût de seulement 2 à 3% de paramètres supplémentaires. Ce résultat cible un problème connu mais peu résolu du secteur des politiques génératives pour la manipulation robotique: sans ancrage explicite entre kinématique 3D et cartes de caractéristiques 2D, les modèles peinent à situer le bras ou la pince du robot dans la scène, au point de parfois moins bien performer que des politiques n'utilisant que la vision. Pour les intégrateurs qui déploient des politiques de type Vision-Language-Action (VLA) sur des tâches de préhension ou d'assemblage, ce type d'adaptateur plug-and-play est significatif car il s'insère dans des architectures existantes sans réentraînement complet ni changement de backbone, avec un surcoût de calcul marginal. Le problème de fusion proprioception-vision remonte aux premières politiques de manipulation par apprentissage par imitation, où l'état articulaire était généralement simplement concaténé aux caractéristiques visuelles en fin de réseau. L'essor récent des politiques génératives comme Diffusion Policy et des modèles VLA généralistes tels que pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA) a remis cette question au centre des préoccupations, chaque laboratoire cherchant sa propre méthode d'alignement multimodal. Les auteurs positionnent GeoProp comme une brique générique compatible avec plusieurs familles de politiques plutôt qu'une architecture concurrente, et mettent à disposition une page projet dédiée, laissant présager une publication de code pour validation par la communauté.

IA physiqueOpinion
1 source
L'œil mobile : améliore la généralisation spatiale des VLA grâce à une collecte de données hybride et dynamique
306arXiv cs.RO 

L'œil mobile : améliore la généralisation spatiale des VLA grâce à une collecte de données hybride et dynamique

Le fil d'actualité de l'IA, voici l'article traduit et synthétisé. Une équipe de recherche publie sur arXiv (référence 2607.02322v1, soumis début juillet 2026) une étude intitulée "The Moving Eye", consacrée à la généralisation spatiale des modèles Vision-Language-Action (VLA). Le protocole expérimental repose sur une configuration à deux bras robotiques : l'un exécute la tâche de manipulation, l'autre sert de caméra mobile filmant la scène sous des angles variables. Les chercheurs comparent trois stratégies de collecte de données : vue fixe (Fixed), multi-fixe avec plusieurs points de vue statiques (Multi-Fixed), et vue mobile en mouvement continu (Moving Views). Les modèles testés couvrent le spectre actuel des architectures de manipulation robotique : ACT, les modèles à diffusion (Diffusion Policy), ainsi que les VLA Pi-0 et GR00T. Résultat central : une approche hybride, combinant mouvement continu de caméra et diversité de points de vue statiques, surpasse nettement les deux autres méthodes prises isolément. Cette étude s'attaque à un problème connu mais peu quantifié dans le secteur : le "shortcut learning", où un modèle VLA apprend des corrélations superficielles (pose relative fixe entre objets, ou entre caméra et base du robot) plutôt que la géométrie spatiale réelle de la tâche. Concrètement, un modèle entraîné avec des caméras fixes peut sembler performant en test mais échouer dès qu'on change la position de la caméra ou la disposition des objets, un écart démo-réalité que les intégrateurs industriels connaissent bien. L'article démontre que multiplier les points de vue fixes ne suffit pas à corriger ce biais, contrairement à une hypothèse répandue dans le secteur : seul le mouvement de caméra combiné à la diversité des vues réduit efficacement ces corrélations parasites, et ce gain se vérifie sur toutes les architectures testées, pas seulement sur les VLA les plus récents. Cette fragilité spatiale des VLA fait l'objet d'une attention croissante depuis la montée en puissance de modèles comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), présentés comme généralistes mais dont la robustesse hors distribution reste discutée. En proposant une méthode de collecte de données peu coûteuse en matériel (un simple bras robotique reconverti en caméra mobile) plutôt qu'une refonte architecturale, les auteurs ouvrent une piste concrète pour les équipes qui entraînent leurs propres politiques de manipulation, avant d'éventuels essais à plus grande échelle sur des tâches et robots variés.

RechercheActu
1 source
Titre traduit :
307arXiv cs.RO 

Titre traduit :

Une équipe de recherche présente ELMP (Efficient Learning for Motion Planning), une méthode d'apprentissage pour l'adaptation rapide des planificateurs de mouvement neuronaux (Neural Motion Planners, NMP) à de nouveaux environnements. Le problème identifié : recolter de nouvelles trajectoires expertes via des planificateurs globaux classiques pour chaque nouvel environnement coûte cher en calcul. ELMP contourne cette étape en optimisant directement la politique via une couche cinématique différentiable, avec des objectifs denses de collision, d'atteinte de cible et de fluidité, remplaçant ainsi la génération de données expertes par un simple échantillonnage de problèmes. Résultat : le coût d'adaptation par échantillon chute d'environ deux ordres de grandeur. Les auteurs ajoutent un mécanisme encodant explicitement la géométrie des outils via des nuages de points, pour généraliser à des chaînes cinématiques changeantes. Sur des benchmarks comparés à des baselines classiques et neuronales, ELMP atteint un taux de réussite moyen de 84,8%, avec une latence de démarrage à froid inférieure de plusieurs ordres de grandeur aux méthodes classiques. Sur des environnements inédits, le fine-tuning auto-supervisé fait passer le taux de réussite de 57,3% en zero-shot à 89,8%. La latence d'inférence reste de l'ordre de la milliseconde, et la méthode a été validée sur un bras robotique physique Franka Emika Panda. Ce travail s'attaque directement au goulot d'étranglement des planificateurs de mouvement neuronaux : leur dépendance à de vastes jeux de trajectoires expertes, coûteux à générer et à recollecter dès qu'un environnement ou un outil change. En réduisant le coût d'adaptation de deux ordres de grandeur tout en conservant une inférence milliseconde, ELMP rapproche les NMP d'un usage industriel réaliste, où les cellules robotiques changent fréquemment de configuration (nouvel outil, nouvelle disposition d'obstacles, nouvelle chaîne cinématique). Pour les intégrateurs et les équipes R&D en robotique manipulatrice, l'enjeu est concret : pouvoir redéployer un planificateur appris sur une nouvelle tâche sans repasser par des semaines de collecte de données ni par un planificateur global lent en temps réel. La validation sur un bras physique Panda, plutôt qu'uniquement en simulation, renforce la crédibilité du résultat, même si l'écart habituel entre benchmarks contrôlés et conditions industrielles réelles (encombrement, capteurs bruités, cadences de production) reste à vérifier à plus grande échelle. Les planificateurs de mouvement neuronaux se sont imposés ces dernières années comme alternative rapide aux méthodes classiques d'échantillonnage ou d'optimisation (RRT, CHOMP, planificateurs basés sur des solveurs), au prix d'un entraînement gourmand en données expertes générées hors ligne. ELMP s'inscrit dans une lignée de travaux cherchant à rendre ces modèles adaptables sans réentraînement lourd, en s'appuyant sur des gradients de politique analytiques et des couches différentiables plutôt que sur de l'apprentissage par renforcement classique ou de l'imitation pure. La comparaison directe avec des baselines classiques et neuronales situe la contribution dans le sillage des efforts récents pour combiner rapidité d'inférence et robustesse à la généralisation, un axe suivi par plusieurs laboratoires travaillant sur la manipulation robotique généraliste. Les prochaines étapes attendues incluent des tests sur des bras à davantage de degrés de liberté, des scénarios multi-outils plus complexes, et une évaluation en conditions de production réelles au-delà du cadre de laboratoire présenté ici.

RecherchePaper
1 source
Planification séquentielle par points d'ancrage pour la robotique
308arXiv cs.RO 

Planification séquentielle par points d'ancrage pour la robotique

Des chercheurs de la Case Western Reserve University ont publié SPARK (Sequential Planning via Anchored Robotic Keypoints), un système neurosymbolique de manipulation robotique sans entraînement supplémentaire. Sur LIBERO-PRO, benchmark évaluant la robustesse face aux changements de position et de tâche, SPARK atteint 43,7 % sur six configurations, soit plus du double de CaP-Agent0 (18,2 %) et des baselines Vision-Language-Action. L'architecture repose sur deux appels Gemini : le premier génère un arbre de comportement (behavior tree) typé composé de primitives précodées intégrant le contrôle bas niveau (mouvement, préhension, géométrie de profondeur) ; le second propose trois formulations textuelles alternatives par objet, que SAM3 évalue pour retenir la détection la plus confiante. Un mécanisme de récupération relance toute primitive échouée sur des objets re-détectés, sans nouvel appel LLM. Le système a été validé sur trois familles de robots (UR10e, Franka FR3, Franka bimanuels) pour neuf tâches à vingt essais chacune, avec une moyenne de 68 %. Le résultat central est architectural : SPARK identifie la perception comme le principal point de rupture des pipelines de manipulation, non la planification. Les formulations alternatives par objet apportent +27,7 points sur les tâches spatiales et +10,0 sur la suite objet ; la boucle de récupération ajoute +5,0 points globalement. Là où CaP-Agent0 re-interroge un LLM en repartant de zéro à chaque échec, SPARK ne replanifie que la détection, réduisant significativement le coût computationnel. Point stratégique : chaque essai produit automatiquement une trajectoire vérifiée et étiquetée, permettant à un planificateur training-free de générer les données dont les VLAs ont besoin sans téleopération humaine. SPARK s'inscrit dans le débat entre architectures VLA end-to-end (pi-0 de Physical Intelligence, RT-2 de Google DeepMind, OpenVLA de Berkeley) et approches hybrides symboliques. Les VLAs misent sur la généralisation apprise de données massives mais restent fragiles aux distributions non vues à l'entraînement, précisément ce que LIBERO-PRO mesure. SPARK démontre qu'une conception neurosymbolique rigoureuse peut surpasser des modèles foundation sur des configurations difficiles. La validation reste limitée à neuf tâches sur trois plateformes, sans timeline de déploiement industriel annoncée. La modularité du système -- détecteur, planificateur et contrôleur remplaçables indépendamment -- ouvre la voie à des intégrations sur de nouvelles plateformes sans réentraînement.

RecherchePaper
1 source
Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents
309arXiv cs.RO 

Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents

Une équipe de recherche a soumis le 30 juin 2026 sur arXiv (arXiv:2606.29774) un cadre de mémoire structurée pour agents de manipulation robotique à long horizon. Baptisé "analytic concept-centric memory", le système organise l'expérience autour de concepts analytiques : chaque objet est représenté par ses parties sémantiques, des gabarits paramétriques, des poses ancrées dans l'espace, ses affordances et ses états de manipulation. Deux couches supplémentaires complètent l'architecture : une mémoire de transitions enregistrant les effets des actions sur l'état de scène, et une mémoire de compétences (skill memory) stockant des politiques réutilisables ancrées dans ces gabarits. À l'exécution, l'agent effectue une récupération coarse-to-fine pour identifier objets pertinents, états courants et compétences applicables. Les auteurs valident leur approche sur des tâches de manipulation dépendantes de la mémoire, la généralisation à des objets articulés (portes, tiroirs) et une évaluation en environnement réel. La gestion de mémoire reste un goulet d'étranglement critique en manipulation longue durée. Les agents actuels, y compris ceux fondés sur des architectures VLA (Vision-Language-Action), peinent à réutiliser les connaissances acquises lors d'interactions passées, forçant une replanification coûteuse à chaque nouvelle tâche. Ce cadre montre que structurer explicitement la mémoire autour de concepts physiques améliore le taux de complétion de tâches, la précision de récupération, la réidentification d'objets et la généralisation de compétences inter-objets, par rapport aux baselines non structurées et aux représentations vectorielles par embeddings. Pour les intégrateurs industriels, c'est un signal que la réutilisabilité des compétences sans réentraînement complet commence à devenir atteignable, ce qui réduit potentiellement les coûts de déploiement dans des environnements variables. La manipulation robotique à long horizon est un chantier actif chez plusieurs acteurs majeurs : Google DeepMind avec ses architectures RT-2 et SayCan, Physical Intelligence et son modèle Pi-0, Boston Dynamics, ainsi que des laboratoires comme Stanford et ETH Zurich. Ce travail s'inscrit dans une lignée cherchant à concilier planification symbolique structurée et politiques neuronales, deux paradigmes longtemps opposés. Ce preprint n'a pas encore été soumis à revue par les pairs, et les benchmarks restent des environnements de laboratoire contrôlés. La démonstration sur une plateforme industrielle réelle, avec la diversité des objets, le bruit sensoriel et les contraintes temps réel, reste à établir. Les prochaines étapes naturelles incluent l'intégration avec des VLA à grande échelle et l'évaluation sur des manipulateurs ou humanoïdes en contexte de production semi-réelle.

RechercheOpinion
1 source
Fiez-vous à vos instincts : RL à l'inférence guidé par la confiance pour les modèles VLA
310arXiv cs.RO 

Fiez-vous à vos instincts : RL à l'inférence guidé par la confiance pour les modèles VLA

Des chercheurs ont publié le 30 juin 2026 sur arXiv (ref. 2506.29892) un framework d'apprentissage par renforcement baptisé T²VLA (Test-time VLA), conçu pour améliorer les modèles Vision-Language-Action sans recourir à aucun signal de récompense externe. Le principe central repose sur une observation empirique : dans les VLA à actions discrètes, les trajectoires générées avec un niveau de confiance interne plus élevé ont statistiquement une probabilité nettement supérieure de réussir la tâche. T²VLA exploite cette propriété en utilisant la similarité de chaque trajectoire produite avec des démonstrations expertes à haute confiance comme signal de récompense intrinsèque. Le framework intègre un mécanisme appelé Confidence-Driven Dual Expert Bootstrapping, qui arbitre dynamiquement entre un Local Pseudo-Expert (favorisant l'exploration locale) et un Global Expert Pool (garantissant la stabilité de l'entraînement). Les expériences portent sur les benchmarks LIBERO et RoboTwin, deux environnements de référence en manipulation robotique simulée, et couvrent plusieurs architectures VLA dont OpenVLA-OFT et la série pi (pi-0, pi-0.5). L'intérêt pratique de T²VLA est de supprimer le principal frein au déploiement du RL pour les robots incarnés : la nécessité d'instrumenter l'environnement avec des détecteurs de succès ou des fonctions de récompense prédéfinies. En robotique industrielle ou logistique, concevoir ces signaux externes est coûteux, fragile, et souvent impossible hors d'un laboratoire contrôlé. Le fait que le modèle puisse s'auto-améliorer à partir de ses propres évaluations internes représente un changement de paradigme potentiellement significatif pour le sim-to-real : les résultats publiés montrent que T²VLA dépasse les baselines supervisées et s'approche des performances d'un RL oracle (disposant des vraies récompenses), ce qui suggère que le signal intrinsèque capture bien la qualité des trajectoires. Il convient néanmoins de noter que les évaluations restent pour l'instant confinées à des environnements simulés, et l'écart sim-to-real sur du matériel réel n'est pas abordé dans ce papier. T²VLA s'inscrit dans une dynamique plus large autour des VLA généralistes, portée notamment par Physical Intelligence (pi-0), DeepMind (RT-2), et les équipes autour d'OpenVLA. Ces modèles combinent vision, langage et contrôle moteur dans une architecture unifiée, mais leur amélioration post-déploiement butait jusqu'ici sur la nécessité d'un retour environnemental explicite. Le framework proposé est décrit comme agnostique à l'architecture, ce qui facilite théoriquement son intégration sur les VLA existants. Les auteurs ne mentionnent pas de partenaire industriel ni de timeline de déploiement réel, et le travail reste au stade de preuve de concept académique sur simulateurs ; des validations sur robots physiques et en conditions de variabilité industrielle seront déterminantes pour confirmer la portée opérationnelle de l'approche.

IA physiqueOpinion
1 source
ConCent : apprentissage centré sur le contact réel-vers-sim-vers-réel depuis une seule démonstration
311arXiv cs.RO 

ConCent : apprentissage centré sur le contact réel-vers-sim-vers-réel depuis une seule démonstration

Déposé sur arXiv fin juin 2026 (arXiv:2606.30268), ConCent (Contact-Centric Real-to-Sim-to-Real) est un framework d'apprentissage par renforcement conçu pour résoudre le transfert sim-to-real dans les tâches de manipulation robotique riche en contacts. L'approche part d'une seule démonstration réelle : à partir de celle-ci, elle extrait automatiquement la séquence d'événements de contact (quand, où et comment les contacts surviennent), puis optimise en simulation la géométrie des objets, approximés comme des groupes de primitives géométriques, pour que la dynamique locale reproduise fidèlement les transitions d'état observées. Cette séquence de contact devient un signal de récompense structuré qui guide la politique RL vers des régimes de contact physiquement plausibles, l'empêchant d'exploiter des artefacts irréalistes du simulateur. Aucune conception manuelle de fonction de récompense par tâche n'est nécessaire. Le noeud du problème que ConCent attaque est le reality gap sur les tâches à fort couplage mécanique (vissage, assemblage précis, manipulation d'objets déformables), où une légère différence de dynamique de contact suffit à invalider une politique entière. Contrairement aux approches par domain randomization ou aux pipelines nécessitant de larges corpus de données réelles, ConCent impose une contrainte structurelle : la politique ne peut progresser qu'en respectant les séquences de contact validées dans le monde réel. Les résultats présentés montrent une meilleure stabilité et robustesse du transfert face à des baselines RL non contraintes. L'absence de reward engineering par tâche représente un gain opérationnel concret pour les équipes souhaitant déployer de nouvelles tâches sans reconfiguration coûteuse. Le problème du sim-to-real pour la manipulation remonte aux travaux fondateurs sur la domain randomization (OpenAI Dactyl, 2019) et aux pipelines de learning from demonstration. Des approches récentes comme la simulation différentiable (DiffTaichi) ou les VLA de type pi0 (Physical Intelligence) et GR00T N2 (NVIDIA) s'attaquent au même reality gap, mais avec des architectures et des volumes de données très différents. ConCent se distingue en ancrant la dynamique simulée sur une démonstration réelle unique, sans calibration manuelle du simulateur. Il s'agit à ce stade d'un preprint académique sans déploiement industriel annoncé, les résultats étant validés en conditions de laboratoire. La suite logique serait une évaluation sur des cycles d'assemblage industriels réels et une comparaison directe avec des architectures VLA pour quantifier l'avantage de l'approche contact-centric à l'échelle.

RecherchePaper
1 source
StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique
312arXiv cs.RO 

StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique

Des chercheurs ont publié sur arXiv (référence 2512.21970v2) StereoVLA, un modèle Vision-Language-Action (VLA) qui intègre la stéréovision dans les pipelines de manipulation robotique généraliste. L'architecture repose sur un encodeur visuel GeoSem (Geometric-and-Semantic), qui extrait en parallèle des indices géométriques issus des disparités entre vues stéréoscopiques et des représentations sémantiques classiques à partir des pixels RGB. Le modèle intègre deux objectifs de co-entraînement : l'Interaction-Region Depth Estimation, pour affiner le raisonnement spatial lors des saisies, et la Camera Parameter Estimation, pour aligner implicitement les repères de perception et d'action du robot. Entraîné sur des données stéréo synthétiques à grande échelle, StereoVLA atteint un gain absolu de 33,4 points de pourcentage en taux de succès en conditions réelles par rapport aux baselines monoculaires, et démontre une robustesse marquée à des angles de caméra proches de l'hémisphère supérieur. Ce gain de 33,4 % est substantiel dans un domaine où les progrès incrémentaux dominent la littérature. Il confirme une hypothèse structurelle : les encodeurs visuels préentraînés sur lesquels s'appuient les VLA actuels (CLIP, SigLIP) sont optimisés pour l'alignement sémantique, au détriment de la représentation géométrique 3D indispensable à la manipulation fine. Pour un intégrateur ou un COO industriel, cette démonstration repositionne le choix du capteur (stéréo vs monoculaire) comme décision architecturale critique dans toute cellule robotisée guidée par VLA. La robustesse aux angles hémisphériques est également un signal de maturité opérationnelle : en déploiement réel, la posture du bras et les contraintes d'encombrement imposent des perspectives de caméra qui mettent en défaut les VLA classiques. Les VLA (Pi-0 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA) constituent depuis 2024 le nouveau paradigme de contrôle généraliste pour la manipulation, mais reposent tous sur des encodeurs conçus pour la vision sémantique, non géométrique. StereoVLA adresse directement ce goulot d'étranglement en exploitant la stéréovision, technologie éprouvée dans les AMR et les caméras industrielles de profondeur (RealSense, ZED), mais restée jusqu'ici absente des pipelines VLA. L'étude demeure au stade de la recherche académique : aucun déploiement industriel ni partenariat constructeur n'est annoncé. La validité externe du gain de 33,4 % devra être éprouvée sur des bras commerciaux variés (Franka, UR, xArm) et dans des environnements moins contrôlés avant de conclure à une transférabilité industrielle.

IA physiqueOpinion
1 source
DIM-WAM : modélisation monde-action avec mémoire d'événements historiques diversifiés
313arXiv cs.RO 

DIM-WAM : modélisation monde-action avec mémoire d'événements historiques diversifiés

Des chercheurs du CASIA (Institute of Automation de l'Académie des sciences chinoise) ont publié fin juin 2026 sur arXiv un préprint décrivant DiM-WAM, un modèle de type "world-action model" augmenté d'une mémoire multi-échelle conçue pour les tâches de manipulation robotique à longue séquence. Sur le benchmark RMBench, l'architecture fait passer le taux de succès moyen de 28,4 % (baseline LingBot-VA) à 69,8 %, dépassant nettement la baseline à mémoire explicite Mem-0 qui plafonnait à 42,0 %. Sur quatre tâches réelles exécutées sur bras Franka, DiM-WAM améliore le succès par étape de 70,7 % à 91,5 % et le succès complet de tâche de 52,5 % à 80,0 %, soit un gain absolu de 27,5 points. Ce résultat est notable car il attaque directement l'un des points d'échec systématiques des modèles vision-langage-action actuels : l'oubli des événements antérieurs lors de séquences longues. Contrairement aux architectures VLA classiques qui se limitent à un contexte court (quelques frames récentes), DiM-WAM maintient plusieurs banques mémoire mises à jour par fusion basée sur la similarité, et conditionne conjointement la dénoisation vidéo et la génération d'action sur ce contexte historique long. Un signal d'entraînement inédit, la "progress supervision", pousse les tokens mémoire à encoder non seulement les événements passés mais aussi l'étape courante de la tâche et ses implications sur la suite. Pour un intégrateur industriel, cela adresse un prérequis concret : permettre à un robot de reprendre une séquence après une interruption ou de conditionner une action sur un état observé plusieurs secondes plus tôt. Les world-action models constituent une évolution récente des VLA, inspirée des travaux sur la prédiction vidéo (world models) appliqués à la robotique, avec des architectures comme celles de Physical Intelligence (Pi-0) ou DreamerV3 adaptés au contrôle. DiM-WAM se positionne dans ce champ en ajoutant la dimension mémoire longue, un problème que le domaine reconnaît mais peu de travaux ont quantifié en conditions réelles. La validation sur Franka, robot académique standard à 7 DOF, reste modeste en échelle (quatre tâches, environnement contrôlé), et le preprint n'annonce pas de déploiement industriel ni de partenariat commercial. Les prochaines étapes probables incluent une évaluation sur des benchmarks plus larges comme SimplerEnv ou des plateformes humanoïdes, et une ouverture du code source évoquée via la page projet.

💬 28 % à 70 % de taux de succès sur des séquences longues, c'est pas un artefact de benchmark, c'est enfin quelqu'un qui s'attaque au vrai problème : un robot qui oublie ce qu'il vient de faire n'a aucune valeur en contexte industriel réel. La "progress supervision" est l'idée maline du lot, parce qu'elle force la mémoire à encoder non pas juste le passé mais où en est la tâche à l'instant T. Reste à voir si ça tient au-delà du Franka en environnement contrôlé, mais le signal est là.

IA physiqueOpinion
1 source
Web2Grasp : apprendre la préhension fonctionnelle à partir d'images web d'interactions main-objet
314arXiv cs.RO 

Web2Grasp : apprendre la préhension fonctionnelle à partir d'images web d'interactions main-objet

Des chercheurs ont présenté sur arXiv (réf. 2505.05517) Web2Grasp, une méthode qui permet à des mains robotiques multi-doigts d'apprendre des saisies fonctionnelles à partir d'images web montrant des interactions main-objet humaines (HOI, hand-object interaction). Un modèle de reconstruction 3D pré-entraîné extrait des maillages HOI depuis des images RGB brutes ; un filtrage géométrique couplé à une simulation physique dans IsaacGym élimine ensuite les saisies infaisables et ne conserve que celles résistant à une perturbation externe. En simulation, le système atteint 75,8 % de réussite sur des objets tirés du dataset web et généralise à des objets non vus lors de l'entraînement. En conditions réelles, testé sur les mains robotiques LEAP Hand et Inspire Hand, il affiche 77,5 % de réussite sur 12 objets incluant des géométries difficiles : seringue, flacon spray, couteau et pince longue (tongs). L'enjeu dépasse la simple prise en main : le "functional grasping" signifie que le robot saisit l'objet comme un humain l'utiliserait (couteau par le manche, spray par le corps), contrairement aux "power grasps" génériques qui dominent encore la littérature de manipulation robotique. La quasi-totalité des approches existantes nécessite des démonstrations en domaine spécifique, coûteuses à collecter objet par objet ; Web2Grasp court-circuite ce goulot en exploitant les images web comme supervision faible à coût quasi nul. Les 77,5 % en conditions réelles sur des formes atypiques sont encourageants, mais les conditions exactes d'évaluation (orientation initiale, variabilité d'éclairage, nombre d'essais par objet) ne sont pas précisées dans le résumé, ce qui invite à consulter le papier complet avant toute conclusion sur la robustesse industrielle. La préhension fonctionnelle reste un problème ouvert : les datasets annotés manuellement comme DexYCB ou ContactPose sont onéreux à produire à grande échelle. L'exploitation d'interactions "in the wild" s'inscrit dans la tendance des VLA (vision-language-action models) comme Pi-0 ou OpenVLA, qui cherchent à réduire la dépendance aux démonstrations robotiques coûteuses. Web2Grasp s'oppose directement à des approches comme DexGraspNet ou UniDexGrasp, ainsi qu'aux pipelines basés sur la téléopération (travaux Dex-Pilot, Apple Research), en supprimant entièrement le besoin de démonstrations effectuées sur robot. La suite logique serait l'intégration dans des pipelines de manipulation complets (pick-and-place, assemblage orienté tâche) ; le site projet actif à web2grasp.github.io indique que les développements se poursuivent.

RecherchePaper
1 source
General Intuition lève 320 millions de dollars pour entraîner des robots avec des données de jeux vidéo
315Robotics Business Review 

General Intuition lève 320 millions de dollars pour entraîner des robots avec des données de jeux vidéo

General Intuition US Inc. a annoncé cette semaine une levée de fonds de 320 millions de dollars en Série A, portant sa valorisation à 2,3 milliards de dollars et son financement total à 454 millions, après un premier tour de 134 millions en octobre 2025. Le round est mené par General Catalyst et inclut Jeff Bezos, fondateur d'Amazon, et Eric Schmidt, ex-PDG de Google. L'entreprise new-yorkaise, fondée en 2015 par Pim de Witte, développe deux familles de modèles : des action models, qui décident quelle action entreprendre, et des world models, qui prédisent les conséquences de ces actions dans des environnements virtuels ou physiques. La particularité de son approche est la source des données d'entraînement : non pas des vidéos de manipulation robotique ou des simulations synthétiques, mais des milliards de clips de gameplay issus de Medal, une plateforme de partage de moments gaming que de Witte a également cofondée. Ces vidéos sont accompagnées de labels d'action embarqués, qui enregistrent précisément quelle touche le joueur appuie et à quel instant, offrant une supervision dense sur la relation perception-décision-action. L'intérêt de cette approche pour l'IA physique tient à une hypothèse centrale : les modèles entraînés sur du texte décrivent la réalité, ils ne la modélisent pas. Le jeu vidéo, lui, capture un humain qui perçoit un environnement tridimensionnel, anticipe des dynamiques et agit en conséquence, dans des milliers de configurations différentes. Si l'hypothèse tient à l'échelle, cela représenterait un raccourci significatif pour le sim-to-real gap qui plombe la généralisation des politiques robotiques : plutôt que de collecter des téléopérations coûteuses ou de concevoir des environnements simulés ad hoc, General Intuition récupère de la diversité environnementale pour presque rien. La question non résolue reste la transférabilité effective de ces représentations vers des corps physiques avec des dynamiques mécaniques réelles, un point que la société n'a pas encore documenté publiquement avec des benchmarks tiers. General Intuition évolue dans un espace de plus en plus encombré. Des acteurs comme DeepMind avec RT-2 et ses successeurs, Physical Intelligence (pi) avec Pi-0, ou encore Covariant avec RFM-1 misent également sur des fondations visuelles générales pour l'apprentissage de politiques robotiques. La différence revendiquée est l'échelle et la labellisation des données gaming, un corpus que la concurrence ne possède pas. L'entreprise prévoit de rendre son API accessible publiquement à l'été 2026 et d'utiliser le financement pour augmenter sa capacité de calcul et entraîner la prochaine version de son modèle de préentraînement. Aucune annonce de partenariat industriel ou de déploiement sur plateforme robotique physique n'a été communiquée à ce stade : il s'agit d'une phase de précommercialisation axée infrastructure et modèle.

IA physiqueOpinion
1 source
CoStream : combiner des comportements simples pour une manipulation complexe et généralisable
316arXiv cs.RO 

CoStream : combiner des comportements simples pour une manipulation complexe et généralisable

Une équipe de chercheurs propose CoStream (arXiv 2606.26423), un cadre de manipulation robotique conçu pour atteindre simultanément précision millimétrique et généralisation à de nouvelles tâches. L'article cible des opérations d'assemblage à haute contrainte de contact comme l'insertion d'un GPU dans un slot PCIe, où les approches existantes échouent sur au moins l'un des deux critères. Le système a été validé sur 8 tâches réelles couvrant manipulation quotidienne et assemblage de précision, avec récupération robuste après perturbations manuelles en cours d'exécution. L'apport central est de rompre avec deux paradigmes dominants : les pipelines classiques, précis mais rigides et coûteux à adapter à chaque nouvelle tâche, et les politiques end-to-end monolithiques, généralisables mais insuffisamment précises hors-distribution sans réentraînement. CoStream orchestre modèles de fondation et modalités de capteurs variées en trois comportements composables : sémantique (extraction de contraintes spatiales via modèles de fondation), prédictif (estimation de trajectoires par tracking de keypoints dans des vidéos imaginées) et réactif (corrections tactiles et de force haute fréquence). Ces sorties se composent par right-multiplication dans l'espace SE(3), produisant une commande de pose unique à chaque pas de contrôle, exécutée par un contrôleur compliant. Les gains les plus significatifs sont observés sur les tâches d'assemblage avec contact et de transfert d'objets, précisément là où la précision et l'adaptabilité sont le plus difficiles à concilier. CoStream s'inscrit dans la tendance qui cherche à exploiter les modèles de fondation visuels et linguistiques pour la planification robotique, tout en conservant des contrôleurs bas niveau fiables pour l'exécution temps réel. Les approches concurrentes les plus directes sont les VLA monolithiques comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, ainsi que les pipelines hiérarchiques classiques. La décomposition modulaire proposée n'implique pas de réentraînement complet pour chaque nouvelle tâche, ce qui constitue le principal argument de rupture avancé par les auteurs. L'article reste un preprint de recherche sans déploiement industriel annoncé ni partenaire de production mentionné ; les performances à l'échelle et hors environnement de laboratoire contrôlé restent à démontrer.

RecherchePaper
1 source
Tactile-WAM : modèle d'action du monde sensible au toucher avec attention asymétrique tactile
317arXiv cs.RO 

Tactile-WAM : modèle d'action du monde sensible au toucher avec attention asymétrique tactile

Des chercheurs ont publié sur arXiv (référence 2606.26663) un modèle de manipulation robotique intégrant le retour tactile dans le cadre des World Action Models (WAMs), une famille d'architectures qui génèrent simultanément des actions et une prédiction de l'état futur du monde. Baptisé Tactile-WAM, ce système introduit un mécanisme d'attention asymétrique nommé TAAM (Tactile Asymmetric Attention Mechanism) pour combiner flux vidéo et signaux tactiles sans dégradation mutuelle. Sur le benchmark ManiFeel, spécialisé dans les tâches de manipulation au contact, Tactile-WAM améliore le taux de succès moyen de 38,9 % toutes tâches confondues, et de 86 % sur les tâches à fort contact, insertion, assemblage, recherche d'alignement et réorientation, où les caméras seules restent aveugles aux micro-glissements, aux blocages mécaniques (jamming) et aux erreurs d'alignement millimétrique. Le verrou identifié par les auteurs est ce qu'ils nomment la "pollution tactile" : injecter des tokens tactiles dans un modèle de dynamique visuelle force l'architecture à absorber des signaux locaux, épars et événementiels, ce qui perturbe à la fois la prédiction vidéo et la génération d'actions. La solution TAAM sépare les flux via un masque VideoClean, qui bloque l'accès des requêtes vidéo aux tokens tactiles tout en les conservant disponibles pour les requêtes d'action, tandis qu'un biais touch-aware, dérivé des variations tactiles prédites, module dynamiquement l'attention pendant la phase de débruitage. Ce résultat intéresse directement les intégrateurs industriels : il démontre qu'un modèle d'action peut exploiter des capteurs tactiles pour des tâches d'insertion fine en conditions réelles, sans sacrifier les performances visuelles du pipeline. Les WAMs s'inscrivent dans la continuité des modèles VLA (Vision-Language-Action) et des architectures monde telles que Dreamer, mais ciblent le contrôle robotique basse latence. La manipulation tactile est un axe de recherche actif dans plusieurs laboratoires, notamment autour des capteurs visuotactiles GelSight (MIT CSAIL) et des politiques de diffusion appliquées au contrôle fin. Tactile-WAM se distingue en traitant l'intégration multimodale au niveau de l'attention plutôt que par fusion post-hoc des modalités. Il s'agit d'un preprint arXiv non encore évalué par des pairs, sans code publié ni déploiement industriel annoncé : les résultats sur ManiFeel devront être répliqués sur des capteurs et géométries variés pour valider la généralisation en conditions de production réelles.

RechercheOpinion
1 source
RouterVLA : des tests de fumée transformés en supervision pour la sélection de modèles VLA hétérogènes
318arXiv cs.RO 

RouterVLA : des tests de fumée transformés en supervision pour la sélection de modèles VLA hétérogènes

RouterVLA, présenté dans un preprint arXiv déposé en juin 2026 (identifiant 2606.27355), s'attaque à un problème concret souvent ignoré dans le déploiement robotique : comment choisir, parmi plusieurs politiques vision-language-action (VLA) candidates, celle que l'on installe réellement sur le robot. Les équipes robotiques effectuent systématiquement des "smoke tests" - des séries d'essais courts avant déploiement - pour comparer les candidats, puis retiennent un seul vainqueur global. RouterVLA propose de capitaliser sur ces essais déjà réalisés via une technique dite de "cross-fitting à résultats disjoints" : les essais enregistrés construisent un profil de performance pour chaque politique expert gelée, tandis qu'un essai distinct, non inclus dans ce profil, sert à noter l'expert retenu. Évalué sur 34 752 enregistrements de rollouts issus du benchmark LIBERO-Plus, une règle transparente basée sur le taux de succès des probes fait passer le taux de succès hors-échantillon de 0,4686 à 0,6149, soit un gain de 14,64 points de pourcentage. Le résultat le plus saillant n'est pas le gain lui-même, mais ce qui le produit. Sous les profils scalaires étudiés, les scoreurs appris sont statistiquement indiscernables de la simple règle de succès-probe, ce qui implique que la valeur de routage vient du processus de commissionnement - les smoke tests eux-mêmes - et non d'une capacité ML supplémentaire. Ajouter des couches d'apprentissage pour scorer les politiques ne crée donc pas de valeur additionnelle si les profils restent scalaires. Tout aussi important pour l'intégrité des benchmarks : réutiliser le même essai pour sélectionner et évaluer l'expert gonfle artificiellement le gain mesuré par un facteur de 1,87. Ce résultat constitue un avertissement méthodologique direct pour la communauté, car de nombreux papiers comparatifs en robotique pourraient souffrir de ce biais de contamination si la séparation des outcomes n'est pas garantie. LIBERO-Plus est un environnement de simulation pour la manipulation robotique de table, largement utilisé pour évaluer des politiques de généralisation. RouterVLA s'inscrit dans le champ croissant de la sélection hétérogène de politiques VLA, un problème qui devient critique à mesure que les fondations VLA se multiplient : Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), Helix (Figure AI), ou les politiques maison des labs comme Google DeepMind. La question de savoir quel modèle router selon la tâche est un vrai enjeu d'industrialisation, distinct de celui d'entraîner de meilleurs modèles individuels. Ce preprint ne mentionne ni déploiement réel ni partenaire industriel : il s'agit d'une contribution méthodologique évaluée en simulation. Les suites naturelles seraient d'étendre l'analyse à des profils non-scalaires (embeddings, séquences temporelles) et de valider la séparation des outcomes en manipulation physique réelle.

RechercheOpinion
1 source
ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action
319arXiv cs.RO 

ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action

Une équipe de chercheurs publie fin juin 2026 ROAD-VLA (arXiv:2606.25800), un cadre d'adaptation en ligne des modèles VLA (Vision-Language-Action) par auto-distillation guidée par avantage. Les VLA, à l'image de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou RT-2 (Google DeepMind), traduisent directement une entrée visuelle et une instruction en langage naturel en séquences d'actions robotiques. Le problème : affiner un tel modèle pré-entraîné sur de nouvelles tâches via apprentissage par renforcement (RL) génère des récompenses trop éparses pour superviser des politiques autoregressives de haute dimension. ROAD-VLA y répond en construisant un "enseignant proximal" dans l'espace des actions, perturbant les logits des tokens d'action avec des estimations d'avantage calibrées pour convertir des récompenses rares en supervision dense token par token. Évalué sur sept environnements de manipulation robotique, en distribution et hors distribution, le framework surpasse PPO (Proximal Policy Optimization, référence RL standard) dans la quasi-totalité des configurations. La découverte la plus saillante est l'existence d'un "modality gap" : les enseignants textuels conditionnés sur des démonstrations, des expériences récupérées ou des plans de haut niveau s'avèrent systématiquement inefficaces pour adapter les politiques d'action VLA. C'est une contradiction directe avec une hypothèse répandue selon laquelle le guidage symbolique ou langagier peut servir de supervision fiable lors du fine-tuning RL. ROAD-VLA démontre que la supervision doit opérer dans l'espace des actions, pas dans l'espace du langage. Pour un intégrateur déployant des bras manipulateurs basés sur VLA, cela ouvre une voie d'adaptation au domaine sans collecter de nouvelles démonstrations massives : le modèle se corrige via son propre comportement et les signaux de récompense de l'environnement réel. Le paradigme VLA a pris son essor avec RT-2 (Google DeepMind, 2023), puis s'est accéléré via Pi-0 (Physical Intelligence, 2024), GR00T N2 (NVIDIA, 2025) et Helix (Figure AI), accompagnés d'une vague de publications académiques. L'adaptation post-déploiement, soit ajuster un modèle généraliste à une géométrie de préhension spécifique ou à un flux industriel précis sans tout ré-entraîner, est désormais identifiée comme le verrou opérationnel suivant par les équipes terrain. Ce travail reste une annonce académique (arXiv, juin 2026), pas un produit livré ni un déploiement industriel réel, et la validation sur robots physiques en conditions industrielles reste à conduire. Aucun acteur français ou européen n'est impliqué dans cette recherche.

RechercheOpinion
1 source
RARM : modèle de récompenses de progression à seuil de confiance pour l'apprentissage par renforcement en manipulation
320arXiv cs.RO 

RARM : modèle de récompenses de progression à seuil de confiance pour l'apprentissage par renforcement en manipulation

Des chercheurs ont publié sur arXiv (réf. 2606.22027) RARM, pour Reference-Anchored Reward Model, une approche visant à résoudre un verrou central de l'apprentissage par renforcement (RL) en manipulation robotique : la conception des fonctions de récompense. La méthode repose sur un comparateur visuel léger qui, à partir d'une seule démonstration réussie, génère automatiquement un signal de récompense dense et progressif. RARM est pré-entraîné une unique fois sur des vidéos généralistes via un objectif de contraste temporel, sans données robot-spécifiques ni étiquetage manuel. Au déploiement, il compare des extraits de la tentative courante à des clips de référence et ne délivre une récompense que lorsque la correspondance dépasse un seuil de confiance (d'où l'appellation confidence-gated). Évalué sur 9 tâches de manipulation simulées issues des benchmarks LIBERO et MetaWorld ainsi que sur 4 tâches réelles, RARM obtient les meilleurs taux de succès globaux en entraînement RL, avec des gains particulièrement marqués sur des tâches longue durée comme le pliage de tissu. Le verrou qu'attaque RARM est fondamental : les récompenses éparses (succès/échec en fin de séquence) produisent un signal trop faible pour les tâches longues, tandis que les récompenses denses codées manuellement exigent une ingénierie fastidieuse et se généralisent mal d'une tâche à l'autre. Les approches de progression existantes souffraient d'un biais critique : elles attribuaient des récompenses élevées à des états visuellement plausibles mais physiquement incorrects, ce que la porte de confiance de RARM réduit directement. L'implication concrète pour les intégrateurs est qu'une seule vidéo de démonstration humaine suffit désormais à bootstrapper l'entraînement RL sur une nouvelle tâche, sans ré-ingénierie de la fonction de récompense. RARM se positionne en concurrence directe avec EUREKA (OpenAI, génération de récompenses via LLM) et les méthodes d'imitation inverse (IRL), dont il se distingue par sa légèreté et l'absence de données robot-spécifiques. Son objectif de généralisation le rapproche des ambitions des modèles VLA comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA). La publication reste un preprint arXiv, pas encore un produit ni un déploiement industriel ; les prochaines étapes attendues incluent une validation sur des plateformes hardware diversifiées et une intégration dans des pipelines de fine-tuning de modèles fondationnels robotiques.

RecherchePaper
1 source
ForceBand : apprentissage de la manipulation de force par sEMG
321arXiv cs.RO 

ForceBand : apprentissage de la manipulation de force par sEMG

Une équipe de chercheurs a présenté ForceBand, un bracelet sEMG (électromyographie de surface) porté au poignet et conçu pour enrichir les démonstrations humaines destinées à l'apprentissage de politiques de manipulation robotique. Le système capture l'activité musculaire du poignet via des électrodes de surface et, combiné à une IMU, alimente un modèle pré-entraîné baptisé EMG2Force qui prédit les forces exercées par chaque doigt. Pour entraîner ce modèle, les chercheurs ont constitué un jeu de données multimodal de 10 heures combinant vidéo égocentrique, signaux sEMG, données inertielles et mesures de forces au bout des doigts, couvrant des actions et objets variés. Après une courte calibration propre à l'utilisateur, celui-ci peut collecter de nouvelles démonstrations avec seulement le bracelet et une caméra : EMG2Force étiquette automatiquement ces séquences avec les traces de force par doigt. Les expériences rapportent une réduction d'erreur de prédiction de force supérieure à 50 % par rapport aux baselines fondées uniquement sur la vision, et un taux de succès de 87 % sur des tâches de saisie, compression et dépose impliquant des objets de formes, tailles et poids variés. L'apport clé de ForceBand réside dans la résolution d'un angle mort structurel des pipelines d'imitation learning : les sources courantes de démonstrations humaines, capture de mouvement ou vidéos internet, fournissent trajectoire et apparence mais ignorent les forces de contact, pourtant déterminantes pour toute manipulation sensible au toucher. Serrer un emballage souple sans l'écraser, insérer un connecteur, manipuler des objets fragiles ou déformables sont des tâches où le contrôle en effort prime sur le contrôle en position. En rendant ces forces observables à faible coût matériel, le système ouvre la voie à des politiques VLA (vision-language-action) capables de généraliser sur des propriétés mécaniques d'objets non vus, sans capteurs de force onéreux montés sur le robot. Ce travail s'inscrit dans une dynamique active autour de l'augmentation des données de démonstration : plusieurs laboratoires explorent des gants haptiques, des capteurs tactiles intégrés aux mains robotiques ou des méthodes de reconstruction de force par vision stéréo. ForceBand se positionne comme une alternative légère et bon marché, accessible sans infrastructure de motion capture. L'article est pour l'instant un preprint arXiv (2606.26093), non encore soumis à une conférence majeure, et les résultats reposent sur un protocole contrôlé en laboratoire. La robustesse au bruit musculaire inter-sujets, à la fatigue et aux variations de placement du bracelet en conditions industrielles reste à démontrer. Les prochaines étapes naturelles impliqueront des tests sur des robots à mains dextrères (dexterous hands) et une validation sur des tâches d'assemblage réelles, là où la complémentarité avec des plateformes comme les mains Allegro ou Shadow est la plus directe.

RecherchePaper
1 source
IA robuste pour manipuler les tissus grâce au raffinement en temps réel par simulation
322arXiv cs.RO 

IA robuste pour manipuler les tissus grâce au raffinement en temps réel par simulation

Une équipe de recherche a publié le 24 juin 2026 sur arXiv (arXiv:2606.24552) une méthode permettant à un robot de manipuler des textiles souples à partir d'une unique image RGB, sans capteur de profondeur ni données haptiques. L'approche repose sur trois composants : un simulateur d'objets déformables appelé FLASH, conçu pour équilibrer fidélité physique, stabilité numérique et vitesse de rollout ; un module real-to-sim entraîné exclusivement sur données synthétiques, qui convertit une image couleur en état de tissu compatible avec la simulation en fusionnant des features visuelles préentraînées avec des tokens canoniques apprenables ; enfin un planificateur en ligne MPPI (Model Predictive Path Integral) guidé par une politique distillée hors ligne, qui évalue des lots de trajectoires candidates en parallèle dans le simulateur et sélectionne la meilleure action à chaque pas. Les expériences sur robot réel montrent des taux de succès et une robustesse supérieurs aux méthodes de référence, bien que les chiffres précis ne soient pas communiqués dans le résumé public. Ce travail est significatif parce qu'il étend le paradigme "simulator-in-the-loop" aux objets déformables, un verrou majeur en manipulation robotique. Jusqu'ici, cette famille de méthodes était cantonnée aux objets rigides, dont l'état et les contacts restent relativement faciles à modéliser. Le textile pose un problème radicalement plus difficile : l'espace de configuration est continu et de très haute dimension, les contacts sont multiples et transitoires, et le sim-to-real gap explose dès que le simulateur ne capture pas fidèlement les plis. Le fait que la méthode ne nécessite qu'une caméra RGB standard abaisse le coût d'intégration en contexte industriel, notamment pour le pliage de vêtements, la manipulation de sacs flexibles ou les lignes de confection textile. Pour un intégrateur B2B, c'est un signal que le sim-to-real pour déformables commence à sortir du laboratoire, même si les performances annoncées restent à valider sur un spectre large de matières et de géométries. La manipulation de textiles reste l'un des problèmes ouverts les plus cités en robotique d'entrepôt depuis les travaux fondateurs de Maitin-Shepard (2010) sur le pliage de serviettes, et le champ a longtemps stagné faute de simulateurs déformables suffisamment rapides pour un usage en boucle fermée. FLASH s'inscrit dans une vague récente de simulateurs spécialisés (DiffCloth, FleX, CLOTH3D) cherchant ce compromis fidélité/vitesse. Côté concurrence, les approches dominantes pour la manipulation de textiles restent les politiques imitatives par diffusion (comme Pi-0 de Physical Intelligence) ou le transfert pur sim-to-real par domain randomization. L'originalité ici est de placer le simulateur directement dans la boucle d'inférence plutôt qu'uniquement à l'entraînement. La prochaine étape naturelle sera de tester à plus grande échelle de variabilité de tissus et d'intégrer des retours tactiles pour les cas où la vision seule est insuffisante ; l'article ne mentionne pas de partenariats industriels ni de calendrier de déploiement.

RecherchePaper
1 source
Une démonstration vaut mille trajectoires : augmentation vue-action pour les politiques visuomotrices
323arXiv cs.RO 

Une démonstration vaut mille trajectoires : augmentation vue-action pour les politiques visuomotrices

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.19586) un cadre d'augmentation de données baptisé Action-View Augmentation, conçu pour améliorer la robustesse des politiques visuomotrices dans les tâches de manipulation robotique. Le système repose sur un préhenseur parallèle portable équipé d'une unique caméra fisheye montée en configuration eye-in-hand, capable de capturer des démonstrations réelles en milieu non contrôlé. À partir d'une seule démonstration humaine, le framework génère automatiquement des séquences d'images fisheye visuellement réalistes ainsi que des trajectoires d'actions physiquement cohérentes. Pour reconstruire et éditer la scène 3D en y introduisant des objets inédits, les auteurs ont développé une nouvelle formulation de Gaussian Splatting adaptée aux champs de vision larges des optiques fisheye. Une optimisation de trajectoire produit ensuite des chemins fluides, sans collision et compatibles avec le rendu de nouvelles vues caméra. Les expériences menées en simulation et en environnement réel montrent une amélioration du taux de succès sur plusieurs tâches de manipulation, aussi bien dans des scènes identiques qu'en présence d'obstacles requérant un évitement de collision. L'enjeu central est la fragilité des politiques visuomotrices actuelles face aux observations hors-distribution : une légère variation de configuration initiale ou un obstacle imprévu suffit à provoquer un échec d'exécution catastrophique. Collecter suffisamment de données pour couvrir ces variations est coûteux et chronophage, ce qui constitue l'un des principaux freins à l'industrialisation de la manipulation robotique. Le titre du papier résume l'ambition : multiplier artificiellement la valeur d'une seule démonstration réelle pour entraîner des politiques plus robustes. L'adaptation du Gaussian Splatting aux optiques fisheye, jusqu'ici peu traitée dans la littérature robotique, élargit le champ d'application à des setups matériels légers et peu coûteux. Ce type d'approche répond directement au problème du sim-to-real gap en générant des données synthétiques ancrées dans une scène réelle reconstruite, plutôt qu'en simulateurs déconnectés du terrain. Ce travail s'inscrit dans la dynamique des politiques de manipulation end-to-end, où des systèmes comme pi-0 de Physical Intelligence ou les architectures à diffusion (Diffusion Policy, ACT) ont prouvé que l'imitation de démonstrations humaines peut générer des comportements complexes, mais restent gourmands en données. Le Gaussian Splatting, popularisé à partir de 2023, s'est progressivement imposé en robotique grâce à sa capacité à synthétiser des vues nouvelles de haute qualité à partir de captures réelles. L'approche eye-in-hand à caméra fisheye se distingue des setups multi-capteurs fixes, réduisant le matériel embarqué à un seul composant. Aucun déploiement industriel n'est annoncé à ce stade : il s'agit exclusivement d'un résultat académique, sans partenariat industriel déclaré ni timeline commerciale. Les prochaines étapes naturelles concerneraient l'évaluation à plus grande échelle et l'intégration dans des pipelines de fine-tuning pour des politiques de type VLA (Vision-Language-Action).

RecherchePaper
1 source
Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences
324arXiv cs.RO 

Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences

Une équipe de recherche propose FAFM (Frequency-Aware Flow Matching), une méthode de génération d'actions robotiques présentée en préprint arXiv (2606.20135, juin 2026), qui reformule le problème du flow matching pour la manipulation robotique dans le domaine fréquentiel. Le principe : plutôt que de prédire directement des séquences d'actions discrètes (des "chunks"), FAFM applique une transformée en cosinus discrète (DCT) sur ces séquences pour les convertir en coefficients fréquentiels, effectue le flow matching sur ces coefficients, puis reconstruit des actions continues via expansion en base cosinus. Pour garantir la cohérence temporelle, la méthode ajoute une contrainte de type Sobolev sur la dérivée temporelle du premier ordre, ce qui pénalise les changements brusques et atténue les erreurs hautes fréquences. L'approche s'applique sans paramètres réseau supplémentaires, aussi bien aux politiques de flow matching autonomes qu'aux modèles vision-langage-action (VLA). Les résultats sont validés sur les benchmarks LapGym, LIBERO et évitement d'obstacles, ainsi qu'en déploiement réel sur un bras Franka. L'intérêt industriel est direct : la fragmentation des fréquences de contrôle est un problème concret lors de l'agrégation de données de démonstration provenant de robots différents (certains à 10 Hz, d'autres à 50 Hz), et les méthodes actuelles de diffusion policy ou de flow matching standard y sont explicitement vulnérables. Les actions temporellement incohérentes qui en résultent dégradent la stabilité du contrôle en boucle fermée, un facteur bloquant pour le déploiement en production. Le fait que FAFM améliore simultanément le taux de succès, la fluidité du mouvement, la robustesse aux biais mécaniques et la vitesse de convergence sans modifier l'architecture existante est une proposition de valeur claire pour les intégrateurs : pas de refonte du pipeline, pas de surcoût computationnel. La compatibilité avec les VLA est également notable, car ces modèles dominent les annonces récentes (pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) et souffrent précisément de ce type d'artefacts temporels à l'inférence. Le flow matching s'est imposé ces dix-huit derniers mois comme alternative crédible à la diffusion policy (Chi et al., 2023, Columbia), avec des temps d'inférence plus courts et une meilleure expressivité multimodale. Les travaux récents de Physical Intelligence (pi-0, pi-0.5) et de Figure AI ont largement adopté ce paradigme pour leurs politiques générales. FAFM s'inscrit dans une tendance de raffinement de ces fondations plutôt que de rupture : on optimise la stabilité et la généralisation inter-fréquences, deux verrous identifiés lors des premiers déploiements industriels à grande échelle. La validation sur Franka reste modeste en termes de diversité de tâches, et le code est disponible sous revue anonyme, ce qui signifie que la méthode n'est pas encore auditée par la communauté. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes multi-articulées et sur des datasets hétérogènes à grande échelle, là où la question des fréquences mixtes est la plus aiguë.

RecherchePaper
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
325arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
Pré-entraînement contrastif action-image pour le contrôle visuomoteur
326arXiv cs.RO 

Pré-entraînement contrastif action-image pour le contrôle visuomoteur

Des chercheurs ont publié CAIP (Contrastive Action-Image Pre-training), un encodeur visuel pour la robotique qui exploite 32 041 heures de vidéo égocentrique humaine, complétées par seulement 88 heures de données de manipulation robotique. Le principe central consiste à extraire les poses 3D des mains humaines depuis des vidéos filmées en vue subjective, et à les utiliser comme signal de substitution pour les actions d'effecteur terminal, un proxy qui s'aligne naturellement avec les espaces d'action des bras robotiques. Via un objectif d'apprentissage contrastif, CAIP apprend une représentation unifiée liant images et actions. Évalué sur deux mains dextres réelles (Dexmate Vega et Sharpa Wave), le modèle affiche des gains supérieurs à 30% sur des tâches de manipulation précise : pliage de tissu, versage de liquide, et manipulations en dextérité fine. Ce résultat touche directement un verrou bien connu dans la communauté : la pénurie de données robotiques étiquetées freine la pré-formation de grands encodeurs visuels, là où le NLP ou la vision généraliste disposent de milliards d'exemples. CAIP propose une voie de passage scalable sans collecter davantage de trajectoires robot, en exploitant la vidéo humaine disponible à l'échelle d'Internet comme source implicite de signaux d'action. En surpassant DINOv2, SigLIP, MVP et R3M sur des benchmarks en conditions réelles (et non en simulation), l'approche renforce l'hypothèse que le sim-to-real gap peut être partiellement contourné en ancrant la représentation visuelle dans des dynamiques d'action humaine, plutôt qu'en augmentant les données robot brutes. Ce travail s'inscrit dans un courant de recherche actif autour des politiques visuomotrices apprenant depuis la vidéo humaine. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les approches issues d'OpenVLA croisent des signaux similaires, bien que depuis des angles différents. CAIP se distingue en isolant le signal de pose 3D des mains comme modalité intermédiaire explicite, plutôt que d'ingérer du langage ou des représentations d'action latentes. Le code et les modèles ne sont pas encore publiés au moment de la soumission (arXiv:2606.17256, juin 2026). La prochaine étape naturelle serait de tester la généralisation à des morphologies robotiques plus variées et à des tâches bimanuelles, domaine où les pipelines VLA (Vision-Language-Action) peinent encore à démontrer une robustesse hors laboratoire.

RechercheOpinion
1 source
Modèle d'action géométrique pour l'apprentissage de politiques robotiques
327arXiv cs.RO 

Modèle d'action géométrique pour l'apprentissage de politiques robotiques

Des chercheurs ont déposé le 16 juin 2026 sur arXiv (arXiv:2606.17046) le Geometric Action Model (GAM), une politique de manipulation robotique conditionnée par le langage naturel. L'architecture réutilise un modèle fondamental géométrique (GFM) pré-entraîné en le scindant en deux segments : les couches superficielles encodent les observations visuelles, tandis qu'un prédicteur causal inséré à la jonction génère des tokens latents futurs conditionnés sur les instructions textuelles, la proprioception et l'historique d'actions du robot. Les blocs restants du GFM décodent ensuite simultanément la géométrie future de la scène et les actions à exécuter via un backbone unique partagé. Sur une suite de benchmarks en simulation et sur robot réel incluant des tâches de manipulation en contact riche, GAM affiche selon ses auteurs une précision, une robustesse, une vitesse d'inférence et une compacité supérieures aux baselines VLA à large échelle actuellement en référence. Le problème central qu'adresse ce travail est le décalage entre les représentations 2D dominantes dans les VLA (vision-language-action models) et la nature tridimensionnelle des interactions physiques. Des systèmes comme Pi-0 et Pi0.5 (Physical Intelligence), GR00T N2 (NVIDIA) ou les modèles RT-X (Google DeepMind) opèrent principalement sur des espaces latents dérivés d'images 2D, ce qui les handicape pour les tâches de saisie précise, d'assemblage et de dépose sur surfaces contraintes. Ancrer la prédiction d'actions directement dans un espace géométrique 3D, avec une modification minimale du modèle fondamental sous-jacent, constitue le pari architectural de GAM. Si ces résultats résistent à une reproductibilité indépendante, ils valideraient l'hypothèse que des priors géométriques explicites améliorent la généralisation des politiques généralistes face au gap sim-to-real. Cette publication s'inscrit dans une course aux VLA généralistes lancée depuis RT-2 (Google DeepMind, 2023), où la majorité des acteurs industriels, dont Figure (Helix), Agility Robotics, 1X et Physical Intelligence, misent sur des transformers multimodaux sans encodage 3D explicite. En parallèle, plusieurs laboratoires académiques (Berkeley, Stanford, CMU) explorent l'intégration de représentations géométriques comme le Gaussian Splatting dans les politiques robotiques. GAM s'inscrit dans cette seconde tendance avec une proposition architecturale minimaliste. À ce stade, il s'agit d'un preprint arXiv non peer-reviewed, sans déploiement industriel ni partenariat hardware annoncé ; une validation sur des plateformes commerciales standards (UR, Franka) en dehors du laboratoire reste à démontrer.

IA physiqueOpinion
1 source
LaST₀ : raisonnement spatio-temporel latent en chaîne pour les modèles VLA robotiques
328arXiv cs.RO 

LaST₀ : raisonnement spatio-temporel latent en chaîne pour les modèles VLA robotiques

Des chercheurs ont proposé LaST₀ (Latent Spatio-Temporal Chain-of-Thought), un framework pour modèles Vision-Langage-Action (VLA) appliqués à la manipulation robotique, publié en janvier 2026 sur arXiv (2601.05248, v4). Évalué sur 10 tâches réelles couvrant la manipulation sur table, la manipulation sur base mobile et la manipulation dextre, le système améliore le taux de succès moyen de respectivement 13 %, 14 % et 14 % par rapport aux meilleures méthodes VLA actuelles. L'architecture repose sur un design Mixture-of-Transformers dual : un "expert raisonnement" opérant à basse fréquence pour l'inférence latente, et un "expert action" générant des commandes motrices à haute fréquence, les deux modules fonctionnant à des cadences hétérogènes pour permettre un basculement adaptatif. Le raisonnement intermédiaire s'effectue dans un espace latent compact encodant la dynamique visuelle future, la structure 3D de la scène et les états proprioceptifs du robot, sans passer par du texte en langage naturel. L'enjeu central est le compromis latence/raisonnement qui freine le déploiement industriel des VLA. Les approches qui génèrent des traces de raisonnement en langage naturel avant d'agir, comme certaines variantes de Pi-0 (Physical Intelligence) ou OpenVLA, introduisent une latence d'inférence incompatible avec les cycles rapides de la manipulation robotique. LaST₀ court-circuite ce goulot en déplaçant le raisonnement dans un espace latent plus dense informationnellement, plus rapide à générer, et capable de capturer des attributs physiques difficiles à verbaliser comme la friction ou la compliance des objets. Les gains mesurés sur des environnements réels, et non en simulation, constituent un signal notable : le sim-to-real gap n'est pas le seul obstacle, et la représentation interne du raisonnement importe autant que la qualité des données d'entraînement. Les VLA ont émergé comme architecture dominante pour la généralisation en robotique depuis les travaux de Google sur RT-2 (2023), puis se sont accélérés avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI en 2025. Le débat structurant du secteur oppose raisonnement explicite de type LLM et politiques réactives de type diffusion. LaST₀ propose une troisième voie, un système dual à fréquences hétérogènes combinant les deux sans les latences du premier ni les limites de généralisation du second. La publication reste pour l'instant purement académique, sans pilote industriel annoncé, mais l'architecture est directement transposable aux manipulateurs commerciaux et aux plateformes humanoïdes existantes.

IA physiqueOpinion
1 source
AVA-VLA : améliorer les modèles vision-langage-action avec l'attention visuelle active
329arXiv cs.RO 

AVA-VLA : améliorer les modèles vision-langage-action avec l'attention visuelle active

Des chercheurs de LiAuto-DSR, division R&D de Li Auto (constructeur automobile chinois), publient sur arXiv (réf. 2511.18960, quatrième révision) AVA-VLA, un cadre algorithmique ciblant une limite structurelle des modèles Vision-Language-Action (VLA). Le diagnostic central : les VLA existants traitent chaque observation visuelle indépendamment à chaque pas de temps, modélisant la manipulation robotique comme un processus markovien (MDP) alors que la réalité est un processus partiellement observable (POMDP). AVA-VLA introduce un état récurrent servant d'approximation neurale de la croyance de l'agent sur l'historique de la tâche, couplé à un module d'attention visuelle active (AVA) qui réattribue dynamiquement des poids aux tokens visuels selon l'instruction courante et l'historique d'exécution. Les auteurs revendiquent l'état de l'art sur LIBERO et CALVIN, deux benchmarks académiques standards en manipulation robotique simulée, ainsi qu'un transfert vers des tâches de manipulation bimanuelle en conditions réelles, sans que les métriques terrain soient détaillées dans l'abstract. L'apport architectural est notable : les VLA phares actuels, OpenVLA, π0 de Physical Intelligence et GR00T N2 de NVIDIA, traitent l'observation visuelle sans mémoire explicite du contexte passé. Conditionner l'attention visuelle à l'historique d'exécution couvre un angle mort structurel sur les tâches séquentielles longues, là où des actions antérieures modifient la scène sans être immédiatement visibles dans l'image courante. Pour les intégrateurs industriels, cela suggère des bras manipulateurs plus robustes sur des workflows multi-étapes sans remise à zéro du contexte. Réserve : la formulation "transfers effectively" manque de quantification, et LIBERO comme CALVIN restent des environnements largement simulés. Le secteur des VLA s'est considérablement densifié depuis mi-2024 : π0 en octobre 2024, GR00T N2 en mars 2025, et une constellation de variantes académiques (RoboVLMs, OpenVLA-OFT) alimentent la littérature. L'approche récurrente d'AVA-VLA prolonge des travaux classiques sur la résolution de POMDP à base de LSTM, réinterprétés ici dans le paradigme VLA moderne. LiAuto, principalement connu pour ses véhicules hybrides à autonomie étendue, affiche à travers DSR des ambitions en robotique de manipulation. Le code source n'est pas encore publié et aucun déploiement terrain n'est annoncé : il s'agit pour l'instant d'une contribution de recherche académique dont la portée industrielle reste à confirmer hors simulation.

RechercheOpinion
1 source
Entraînement et évaluation des politiques de diffusion avec de longs contextes
330arXiv cs.RO 

Entraînement et évaluation des politiques de diffusion avec de longs contextes

Une équipe de recherche a publié le 20 juin 2026 sur arXiv (arXiv:2606.16447) une étude systématique sur l'impact de la longueur de contexte dans l'apprentissage par imitation pour la manipulation robotique. Les politiques diffusion actuelles, celles qui apprennent des trajectoires motrices à partir d'observations RGB, ne conditionnent généralement les actions du robot que sur une courte fenêtre temporelle d'observations passées. Les auteurs ont construit un benchmark couvrant un spectre de tâches à stabilité locale et à exigences mémoire variables, en faisant varier progressivement la longueur du contexte de courte à longue, et ce dans plusieurs régimes de données. Leur résultat central : avec le bon backbone de débruitage (UNet avec cross-attention), les politiques single-task atteignent des taux de succès élevés même en scalant naïvement le contexte, y compris dans les régimes de données standards. Les chercheurs proposent également un algorithme d'entraînement qui entraîne conjointement les politiques sur plusieurs longueurs de contexte, réduisant ainsi la complexité d'échantillonnage de l'apprentissage à long contexte. Cette étude remet directement en cause un consensus répandu dans la littérature sur les VLA (Vision-Language-Action models) et les diffusion policies : l'idée que l'extension naïve du contexte serait fragile et nécessiterait des solutions architecturales spécifiques. Si ce résultat se confirme sur des benchmarks plus larges, il simplifie considérablement le pipeline de développement pour les intégrateurs robotiques, qui n'auraient plus besoin d'architectures mémoire spécialisées (LSTM, state-space models) pour résoudre des tâches séquentielles longues. C'est aussi un signal que le "memory gap" souvent invoqué pour justifier des approches complexes était peut-être surestimé, au moins dans les régimes de données courants. Les diffusion policies sont devenues un axe central de la robotique de manipulation depuis les travaux de Diffusion Policy (Chi et al., 2023) et leurs déclinaisons comme pi-0 de Physical Intelligence. La question du contexte long était jusqu'ici traitée par des approches ad hoc, recurrence, attention causale, mémoire externe. Cette étude offre la première analyse systématique à ce niveau de granularité, selon les auteurs eux-mêmes. Les prochaines étapes naturelles incluent la validation sur des tâches de manipulation industrielle réelle, la généralisation multi-tâche, et l'évaluation contre des baselines comme ACT ou des variantes de pi-0, dont les benchmarks publics permettraient une comparaison directe.

RecherchePaper
1 source
Politiques VLA auto-améliorantes : lissage d'actions robuste aux artefacts par bruit de diffusion sélectionné
331arXiv cs.RO 

Politiques VLA auto-améliorantes : lissage d'actions robuste aux artefacts par bruit de diffusion sélectionné

Des chercheurs publient sur arXiv (référence 2606.14084) une méthode baptisée SDN (Selected Diffusion Noise), conçue pour améliorer à l'inférence les politiques VLA (Vision-Language-Action) basées sur la diffusion, sans nécessiter de réentraînement. SDN opère dans l'espace du bruit de diffusion en sélectionnant dynamiquement des vecteurs de bruit maximalement séparés d'un ensemble de référence, ce qui réduit la dépendance aux corrélations visuelles parasites, tout en filtrant les candidats produisant des trajectoires d'action plus cohérentes. La méthode a été évaluée sur deux benchmarks de simulation (Google Robot, Widow-X) et deux jeux de données réels, sur plusieurs politiques VLA majeures dont pi0 (Physical Intelligence), Groot-N1.5 et Groot-N1.6 (NVIDIA). Les gains annoncés sont de +8 points de taux de succès en simulation et +10 points en conditions réelles, avec une réduction mesurable du "action jitter", c'est-à-dire l'instabilité des trajectoires articulaires. Ces résultats sont issus d'un preprint non encore évalué par les pairs. L'intérêt pratique tient à l'approche "training-free" : SDN s'applique à l'inférence sans modifier les paramètres du modèle, ce qui permet d'améliorer un système déjà déployé sans refondre le pipeline ML ni supporter les coûts d'un réentraînement. Pour un intégrateur ou un décideur achetant une solution robotique basée sur une politique VLA, ce type de méthode représente un levier de fiabilité à faible coût opérationnel. La robustesse maintenue sous des observations avec occultation partielle (object-masked observations) est également pertinente pour les environnements industriels réels. SDN s'inscrit dans la tendance plus large des techniques d'optimisation test-time appliquées aux modèles génératifs, analogues au best-of-N sampling dans les LLMs. Les politiques VLA basées sur la diffusion, popularisées par Physical Intelligence (pi0, pi0.5) et NVIDIA Isaac (GR00T N1.5, N1.6), sont devenues en 2025-2026 la référence de facto en manipulation robotique généraliste. Elles héritent toutefois d'une sensibilité aux artefacts visuels hors distribution et d'une certaine instabilité d'action, deux problèmes que SDN cible directement. L'abstract ne mentionne ni affiliation institutionnelle ni dépôt de code public, ce qui limite pour l'instant la reproductibilité et les comparaisons indépendantes. Les prochaines étapes naturelles seraient une validation sur plateformes humanoïdes complètes (Figure, 1X, Unitree H1) et des benchmarks de manipulation plus diversifiés que Widow-X ou Google Robot.

UELes intégrateurs européens déployant des solutions robotiques basées sur des politiques VLA (pi_0, GR00T) pourraient bénéficier de cette méthode d'optimisation sans réentraînement, mais aucun acteur FR/EU n'est directement impliqué dans ces travaux.

IA physiqueOpinion
1 source
Démarrage par modèle VLA pour l'apprentissage par renforcement des agents robotiques
332arXiv cs.RO 

Démarrage par modèle VLA pour l'apprentissage par renforcement des agents robotiques

Des chercheurs proposent VLAJS (Vision-Language-Action Jump-Starting), une méthode publiée sur arXiv (réf. 2604.13733v2) visant à accélérer l'apprentissage par renforcement (RL) en manipulation robotique. Le principe repose sur l'utilisation d'un modèle VLA comme guide transitoire en début d'entraînement, sans imitation stricte ni démonstrations humaines. VLAJS augmente l'algorithme PPO (Proximal Policy Optimization) d'une régularisation directionnelle qui aligne progressivement les actions de l'agent RL avec les suggestions du VLA, avant d'annuler cette contrainte à mesure que l'agent gagne en compétence. La méthode a été évaluée sur six tâches simulées (levée d'objet, pick-and-place, réorientation et insertion de cheville, poking, pushing), dont un sous-ensemble validé sur un bras Franka Panda réel. Elle réduit de plus de 50 % le nombre d'interactions d'entraînement nécessaires par rapport à PPO seul ou aux baselines de distillation, et démontre un transfert sim-to-real zero-shot robuste face à des encombrements, variations d'objets et perturbations externes. Ce résultat répond à une tension structurelle bien connue du domaine: les modèles VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) excellent dans le raisonnement à l'échelle de la tâche grâce à leur préentraînement multimodal massif, mais restent trop lents pour le contrôle en boucle fermée à haute fréquence. Inversement, le RL classique assure cette précision mais explore de façon inefficace sur des tâches longues avec récompenses éparses. VLAJS prouve qu'un VLA peut être utile sans être interrogé en continu, réduisant potentiellement les coûts d'entraînement pour des applications de manipulation industrielle et validant l'hypothèse qu'un modèle généraliste peut servir d'amorce dans des pipelines RL orientés production. VLAJS émerge dans un contexte de convergence entre fondations VLA et contrôle temps-réel, où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Google DeepMind (RT-2) s'affrontent sur la généralisation pendant que le RL pur domine en précision. Cette contribution reste académique: validée sur le Franka Panda à 7 degrés de liberté, elle n'est pas encore un produit déployé ni industrialisé, et la réduction de 50 % des interactions porte sur des tâches relativement courtes en simulation. Les suites naturelles incluent l'extension à des morphologies plus complexes (humanoïdes, systèmes bimanuels) et l'intégration dans des frameworks d'entraînement open-source comme Isaac Lab ou ManiSkill.

RechercheOpinion
1 source
Transformer la prévoyance en action : réorientation de l'alignement des représentations dans les modèles action-monde
333arXiv cs.RO 

Transformer la prévoyance en action : réorientation de l'alignement des représentations dans les modèles action-monde

Une équipe de chercheurs a publié sur arXiv (2606.12217) une analyse d'une limitation fondamentale des World Action Models (WAMs), architecture émergente pour la manipulation robotique. Les WAMs combinent un modèle de génération vidéo, chargé de prédire l'évolution future de la scène, avec un décodeur d'actions qui traduit ces prédictions en commandes motrices. Les auteurs constatent empiriquement qu'un modèle produisant des séquences visuelles plausibles ne génère pas nécessairement des actions précises. Par des analyses d'attention sur la tête d'action et des interventions causales, ils identifient un "mismatch" de représentations : les états cachés du modèle de diffusion vidéo sont optimisés pour la reconstruction visuelle, pas pour le contrôle moteur à bas niveau. Le décodeur d'actions peine à se focaliser sur les zones d'interaction pertinentes et reste sensible aux perturbations dans les régions non pertinentes de la scène. En réponse, les auteurs proposent AGRA (Action-Grounded Representation Alignment), un objectif de régularisation qui aligne les features intermédiaires de la diffusion vidéo avec des représentations sémantiques spatialement cohérentes issues d'un encodeur visuel de fondation. Les tests sur des tâches de manipulation réelles montrent une meilleure localisation d'objets, une compréhension accrue des affordances, et une robustesse améliorée face aux perturbations hors distribution. Ce résultat pointe un problème structurel rarement formalisé dans la littérature WAM : le gradient d'entraînement de la génération vidéo ne suffit pas à organiser les représentations internes de façon utile pour le contrôle moteur. C'est une distinction critique pour les équipes R&D investissant dans les architectures VLA (Vision-Language-Action) ou world-model-based, car posséder un bon simulateur interne ne garantit pas une bonne politique. AGRA démontre qu'un alignement explicite entre features du monde et sémantique spatiale améliore simultanément les performances en distribution et la généralisation hors distribution, un double bénéfice difficile à obtenir et précieux pour les déploiements industriels où les variations d'environnement sont inévitables. Les WAMs s'inscrivent dans une lignée de recherches incluant Dreamer (DeepMind) et les architectures world-model appliquées à la navigation et la manipulation. AGRA se distingue en ajoutant un objectif de régularisation à l'interface monde-action sans modifier l'architecture de base, ce qui le rend potentiellement applicable à d'autres variantes de WAMs. Dans l'espace de la manipulation robotique, les approches concurrentes comme Pi-0 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA contournent le problème en n'utilisant pas de génération vidéo explicite, ce qui place AGRA comme une réponse directe aux faiblesses spécifiques des architectures à modèle du monde. Il s'agit à ce stade d'une contribution académique arXiv sans déploiement industriel ni code public annoncé.

IA physiqueOpinion
1 source
TacCoRL : intégration du retour tactile dans les modèles VLA par simulation
334arXiv cs.RO 

TacCoRL : intégration du retour tactile dans les modèles VLA par simulation

Des chercheurs ont publié sur arXiv (2606.11743) TacCoRL, un framework destiné à intégrer le retour tactile dans les modèles vision-langage-action (VLA) pour la manipulation robotique. L'approche combine un co-entraînement simulation-réel et de l'apprentissage par renforcement (RL) en simulation, sans nécessiter de pré-entraînement tactile à grande échelle ni d'exploration extensive sur hardware réel. Évalué sur quatre tâches bimanuelles à riche contact (insertion, assemblage, manipulation d'objets déformables), le système atteint un taux de succès moyen de 72,5 % contre 50,0 % pour la baseline VLA visuelle seule, soit un gain relatif de 45 % sur ces benchmarks spécifiques. L'apport technique central n'est pas simplement d'ajouter la touche comme entrée supplémentaire, mais d'apprendre comment les lectures de contact doivent moduler la réponse motrice dans les états de quasi-échec, états rares dans les démonstrations humaines et risqués à collecter sur robot physique. TacCoRL utilise un simulateur aligné sur le réel comme environnement fermé pour les interactions de contact : des trajectoires mixtes (simulées et réelles) initialisent d'abord les actions conditionnées au tactile dans la politique pré-entraînée, puis le RL avec récompenses vérifiables optimise la politique sur des rollouts simulés, tandis qu'un objectif supervisé sur trajectoires réelles ancre la distribution visuelle, tactile et d'action au domaine de déploiement. Le résultat se transfère directement sur robot réel, sans état simulé privilégié ni RL en ligne. C'est une réponse directe au "demo gap" des VLA actuels : les politiques vision-seule échouent précisément sur les phases de contact que la caméra ne résout pas. Le contexte est celui d'une compétition intense autour des VLA polyvalents : Physical Intelligence avec π0, Google DeepMind avec RT-2 et ses dérivés, ainsi que les efforts de génération suivante (GR00T N2 de NVIDIA, OpenVLA). Tous partagent la même limitation structurelle : l'observation visuelle reste insuffisante pour les tâches à fort contact. La piste tactile est explorée depuis plusieurs années (capteurs GelSight, SynTouch, Digit de Meta), mais son intégration dans des architectures VLA de grande taille restait un verrou de scalabilité. TacCoRL propose une voie pragmatique sans dataset tactile massif, ce qui abaisse la barrière d'adoption pour les laboratoires et intégrateurs. Les prochaines étapes logiques seraient l'extension à des capteurs tactiles commerciaux standardisés et des évaluations sur des tâches industrielles réelles, hors conditions de laboratoire contrôlées.

RechercheOpinion
1 source
Ce qui compte dans l'orchestration des politiques robotiques : étude systématique des agents VLA hiérarchiques
335arXiv cs.RO 

Ce qui compte dans l'orchestration des politiques robotiques : étude systématique des agents VLA hiérarchiques

Une équipe de chercheurs a publié en juin 2026 sur arXiv (réf. 2606.10267) une étude systématique des architectures hiérarchiques VLA, désignées Hi-VLA, pour la manipulation robotique. Ces systèmes couplent un planificateur de haut niveau basé sur un grand modèle vision-langage (VLM) avec un contrôleur bas niveau de type VLA (vision-language-action) : le planificateur décompose une tâche complexe en sous-objectifs formulés en langage naturel, que le contrôleur exécute séquentiellement. Les auteurs unifient plusieurs architectures Hi-VLA existantes sous un cadre commun dit « options-style » et les évaluent sur trois familles de tâches : courte horizon, longue horizon et à forte charge de raisonnement. Les expériences combinent simulation et validation physique sur un robot ALOHA, le manipulateur bimanuel développé initialement par Stanford et repris par Google DeepMind. Ce travail comble un manque réel dans la littérature : jusqu'ici, les systèmes Hi-VLA divergeaient dans leurs choix de planificateurs, de contrôleurs, de mécanismes de transition et de représentation mémoire, sans base de comparaison commune. Les résultats montrent qu'une hiérarchie bien conçue surpasse clairement le contrôle VLA plat (non-hiérarchique) ainsi qu'une hiérarchie naïve, ce qui valide empiriquement l'approche mais souligne que les gains dépendent fortement des interfaces entre niveaux et du choix des modèles. Pour les intégrateurs industriels qui explorent les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), ces principes de conception fournissent un cadre d'arbitrage concret entre flexibilité de planification et précision de contrôle. L'article s'inscrit dans une dynamique de consolidation méthodologique qui suit une période d'expérimentation empirique rapide. Depuis 2023-2024, des systèmes comme SayCan (Google), RoboCat (DeepMind) ou les architectures de Physical Intelligence ont démontré la faisabilité des VLA à grande échelle, mais les recettes de design restaient opaques. Les concurrents directs sur le segment de la planification hiérarchique incluent des travaux comme Code-as-Policies ou Voyager. La prochaine étape naturelle sera l'extension de ces principes à des environnements non structurés hors laboratoire ; le site du projet (jiahenghu.github.io/hi-vla) propose des vidéos de démonstration, mais aucun déploiement industriel n'est annoncé à ce stade.

RechercheOpinion
1 source
Apprentissage en ligne auto-supervisé pour la co-adaptation dans les politiques de diffusion hiérarchiques
336arXiv cs.RO 

Apprentissage en ligne auto-supervisé pour la co-adaptation dans les politiques de diffusion hiérarchiques

Des chercheurs proposent ORCHID, un cadre d'auto-entraînement présenté sur arXiv (2603.05291) qui s'attaque à un problème structurel de la manipulation robotique longue durée : la désynchronisation entre planificateur haut niveau et contrôleur bas niveau au sein des politiques hiérarchiques. Dans ces architectures, un planificateur décompose une instruction en langage naturel en sous-objectifs intermédiaires, que le contrôleur exécute physiquement. La difficulté est que les deux modules, entraînés séparément, opèrent sur des distributions de sous-objectifs incompatibles. ORCHID corrige cela en ligne : le système génère des trajectoires, les filtre selon le feedback de l'environnement (réussite ou échec de la tâche complète), puis distille les trajectoires conjointement réussies dans les deux modules via apprentissage supervisé. Il en résulte une co-adaptation bidirectionnelle : le planificateur ancre ses sous-objectifs dans les capacités réelles du contrôleur, tandis que le contrôleur se spécialise dans les structures de trajectoire que produit le planificateur. Sur le benchmark CALVIN, référence pour la manipulation séquentielle guidée par le langage, un modèle léger entraîné avec ORCHID surpasse les méthodes purement offline, y compris un modèle Vision-Language-Action (VLA) deux fois plus grand en paramètres. L'impact est notable sur deux points. En termes d'efficacité paramétrique, qu'un modèle léger dépasse un VLA deux fois plus lourd remet en question l'hypothèse courante que l'échelle seule suffit pour les tâches complexes. En termes de stabilité d'entraînement, combiner RL hiérarchique et modèles de diffusion est notoirement instable à cause de la propagation des gradients. ORCHID contourne ce problème en substituant la distillation supervisée sur échantillons filtrés au RL gradient classique, une voie potentiellement plus praticable dans les contextes industriels où la reproductibilité de l'entraînement est critique. Le mécanisme de co-adaptation proposé constitue un principe architectural plus général, transférable à d'autres familles de politiques hiérarchiques au-delà des modèles de diffusion. Le travail s'inscrit dans la dynamique actuelle autour des politiques de diffusion pour la robotique, portée par des frameworks comme Diffusion Policy (Chi et al., 2023) et π₀ de Physical Intelligence. ORCHID se distingue en ciblant non l'architecture mais la coordination inter-niveaux, un aspect souvent sous-traité par les approches VLA end-to-end qui fusionnent planification et contrôle dans un seul réseau. Le benchmark CALVIN, développé à l'Université de Freiburg, est la référence principale pour évaluer la généralisation en manipulation séquentielle sur des tâches à horizon long. Les prochaines étapes naturelles incluent une validation sur robots physiques et une extension à des horizons temporels plus longs, deux points que cet article n'aborde pas encore.

RechercheOpinion
1 source
Au-delà de la dextérité : pourquoi le contact pourrait définir la prochaine ère de la robotique
337IEEE Spectrum Robotics 

Au-delà de la dextérité : pourquoi le contact pourrait définir la prochaine ère de la robotique

Lors de l'IEEE International Conference on Robotics and Automation (ICRA 2026) à Vienne, la démonstration ayant le plus mobilisé les visiteurs n'était pas un bras industriel ni un humanoïde en équilibre : c'était une paire de mains robotiques en train de fabriquer un animal en ballon. La société AGILINK y a présenté son système bimain OmniHand 3 Ultra-M réalisant une torsion séquentielle de ballon long format, sans le faire éclater, en gérant en temps réel la déformation de l'objet, la pression interne et la friction de contact. Ce type de tâche, qualifié de "long-horizon contact-rich manipulation", constitue un benchmark reconnu dans la communauté : la légèreté et la déformabilité d'un ballon rendent toute régulation de force particulièrement délicate, et chaque torsion modifie la géométrie et les propriétés mécaniques de l'objet, imposant une adaptation continue du contrôle. Pour entraîner le système, AGILINK a capturé des démonstrations d'artistes professionnels en sculpture sur ballon, les a transposées en politiques de manipulation sur ses mains robotiques, puis a enrichi l'apprentissage par renforcement non seulement avec les séquences réussies, mais aussi avec les interventions correctrices d'opérateurs humains enregistrées chaque fois que l'exécution dérivait vers l'échec. Ce résultat illustre un glissement de paradigme dans la manipulation robotique : après des années centrées sur la dextérité au sens cinématique (nombre de degrés de liberté, précision de positionnement), le vrai verrou se situerait désormais dans la gestion du contact lui-même. La capacité à maintenir une interaction stable avec un objet dont les propriétés évoluent en continu, ce qu'AGILINK désigne par "contact intelligence", reste hors de portée de la plupart des systèmes commerciaux actuels. Pour les intégrateurs industriels et les équipes R&D en manipulation, ce démo signale que les progrès en sensing visuotactile et en politiques d'apprentissage par imitation commencent à produire des résultats reproductibles sur des tâches à la limite du geste humain. La prudence s'impose toutefois : ICRA 2026 est un cadre contrôlé, et les vidéos présentées sélectionnent les exécutions réussies sans données publiées sur le taux de succès systématique ni sur les conditions de répétabilité en dehors du laboratoire. AGILINK, spécialisée dans la manipulation dextre, développe depuis plusieurs années la plateforme OmniHand en combinant sensing visuotactile, contrôle en force et politique bimanuelle. Son positionnement la place en concurrence directe avec Shadow Robot au Royaume-Uni, Dexterous Robotics, et les divisions R&D en main robotique d'ABB et FANUC, ainsi qu'avec des groupes académiques de Stanford et du MIT travaillant sur des architectures similaires. À noter que l'article source est un contenu sponsorisé par AGILINK publié dans le cadre de la couverture ICRA 2026, ce qui en limite l'indépendance éditoriale. Les prochaines étapes annoncées portent sur des extensions vers des tâches industrielles à contact riche, sans qu'un calendrier de déploiement commercial ni des volumes de production aient été précisés.

UELes équipes R&D européennes en manipulation dextre peuvent utiliser cette démonstration présentée à l'ICRA 2026 de Vienne comme signal de convergence entre sensing visuotactile et apprentissage par imitation, notamment pour se positionner face à Shadow Robot (UK) et aux divisions robotique d'ABB.

IA physiquePaper
1 source
Ego-Pi : affinage VLA sur données égocentriques humaines et robotiques
338arXiv cs.RO 

Ego-Pi : affinage VLA sur données égocentriques humaines et robotiques

Une équipe de recherche publie sur arXiv (2606.08107) les résultats d'Ego-Pi, une méthode de fine-tuning de modèle VLA (Vision-Language-Action) conçue pour exploiter des données égocentristes humaines dans l'entraînement de robots manipulateurs. L'étude prend comme fondation le modèle π₀.₅ de Physical Intelligence et cible des robots humanoïdes équipés de mains à cinq doigts dextres. Le résultat central : des données de manipulation filmées du point de vue humain permettent au robot d'apprendre de nouvelles sémantiques de tâches et de composer des compétences existantes en comportements inédits, sans nécessiter de données robot équivalentes pour ces mêmes tâches. Ce résultat adresse directement l'un des verrous les plus cités en robotique : la rareté des données d'entraînement à grande échelle. Contrairement au NLP ou à la vision, il n'existe pas de corpus internet pour la manipulation robotique. La démonstration qu'une capture égocentrique humaine, collectée plus facilement, à moindre coût et à plus grande échelle, peut servir de substitut partiel représente un changement de paradigme potentiel pour les pipelines de données. Cela valide aussi l'hypothèse du transfert inter-embodiment : un VLA peut généraliser entre morphologies humaine et robotique si le point de vue reste cohérent. Physical Intelligence, startup californienne fondée en 2023 et à l'origine des modèles π₀ et π₀.₅, positionne ainsi sa fondation comme un socle cross-embodiment viable. Ses concurrents directs, notamment NVIDIA avec GR00T N2 et Google DeepMind avec RT-2, explorent également l'apprentissage multi-source. Il faut souligner qu'Ego-Pi est un preprint non encore évalué par les pairs, sans benchmark industriel ni déploiement réel annoncé à ce stade.

UERésultats potentiellement utiles aux équipes européennes (CEA-List, INRIA) travaillant sur des VLA, mais aucun acteur ni déploiement européen directement impliqué.

IA physiqueOpinion
1 source
PhysGraph : un graphe de scène 3D intégrant la physique pour la perception et le raisonnement
339arXiv cs.RO 

PhysGraph : un graphe de scène 3D intégrant la physique pour la perception et le raisonnement

Une équipe de recherche a publié PhysGraph en juin 2026 sur arXiv (référence 2606.08655), un cadre algorithmique qui construit des graphes de scène 3D physiquement ancrés à partir d'images RGB-D, caméras couleur couplées à un capteur de profondeur. Là où la plupart des systèmes de perception 3D se limitent à identifier sémantiquement les objets (reconnaissance, segmentation, récupération), PhysGraph modélise simultanément leurs propriétés physiques et cinématiques : masse, matériaux, et articulations (degrés de liberté, points de pivot). Le pipeline décompose chaque objet en parties fonctionnelles distinctes, associe les instances d'objets entre plusieurs prises de vue, puis infère via un raisonnement visuel les propriétés mécaniques de chaque composant. Évalué sur des jeux de données synthétiques et réels, le système revendique des résultats state-of-the-art en segmentation sémantique, en estimation de masse multi-objet, et en prédiction d'articulations. L'enjeu dépasse la taxonomie académique. Pour la manipulation robotique en environnement industriel ou domestique, savoir qu'un objet est « un tiroir » n'est pas suffisant, le robot doit connaître son axe de rotation, la force nécessaire à son ouverture, et la localisation des poignées préhensibles. PhysGraph cible précisément ce gap en produisant des représentations exploitables pour la planification de tâches et la prédiction d'affordances sous contraintes physiques. L'application de transfert réel-vers-simulation (real-to-sim) est stratégiquement critique : convertir automatiquement une scène réelle en environnement simulé fidèle réduit le coût de génération de données d'entraînement pour les robots apprenants. Il convient cependant de nuancer : l'abstract ne précise ni les latences de traitement ni les conditions opérationnelles testées, ce qui rend difficile l'évaluation de la viabilité temps-réel. Ce travail s'inscrit dans un espace de recherche dense autour des graphes de scène 3D ouverts, ConceptGraphs, OpenMask3D, et les travaux sur la manipulation d'objets articulés alimentés par les datasets PartNet et SAPIEN font figure de références directes. La prédiction d'articulations reste l'un des problèmes les plus ouverts de la robotique incarnée, aux côtés du fossé sim-to-real. Aucun partenaire industriel ni déploiement pilote n'est mentionné : PhysGraph en est au stade de contribution de recherche, sans timeline de productisation annoncée. Les prochaines étapes naturelles seraient la validation sur des manipulateurs réels en boucle fermée et la publication du code.

RecherchePaper
1 source
PACT : alignement de sécurité physique auto-évolutif pour les politiques de diffusion en manipulation incarnée
340arXiv cs.RO 

PACT : alignement de sécurité physique auto-évolutif pour les politiques de diffusion en manipulation incarnée

Une équipe de chercheurs publie PACT (Physical safety Alignment for Constrained Trajectories), un cadre d'alignement post-entraînement destiné à rendre les politiques de diffusion robotique conformes à des contraintes physiques strictes, sans accéder aux données de démonstration ni aux récompenses de tâche (arXiv:2606.08414). Les politiques de diffusion, qui génèrent des trajectoires motrices par débruitage itératif, ont connu des succès notables en manipulation robotique mais peinent à satisfaire des contraintes de sécurité fermes en déploiement réel. PACT projette les politiques pré-entraînées dans des régions faisables en distillant des gradients de contrainte via un objectif KL inverse, avec supervision dense à chaque pas de temps du processus de débruitage. Un curriculum progressif resserre graduellement les contraintes tout en maintenant un écart théoriquement borné par rapport à la politique d'origine, limitant l'oubli catastrophique. Sur des benchmarks de manipulation simulée et réelle, PACT réduit les violations de sécurité de 31,0% en moyenne et améliore simultanément le taux de réussite des tâches de 30,7%. Ces résultats interpellent directement les intégrateurs : sécuriser une politique robotique impliquait jusqu'ici soit de contraindre l'entraînement dès le départ, au prix de l'expressivité, soit d'ajouter des garde-fous externes à l'inférence, nuisant à la scalabilité. PACT propose une troisième voie, post-entraînement et sans données supplémentaires, qui permettrait en théorie d'aligner n'importe quelle politique de diffusion existante. Le fait que sécurité et performance progressent conjointement contredit l'hypothèse d'un compromis structurel entre les deux, pourtant largement admise dans le secteur. À noter : l'article ne précise pas les configurations matérielles ni les volumes de données des tests réels, ce qui limite la portée des comparaisons directes. Les politiques de diffusion ont connu une montée en puissance récente, portée notamment par Pi-0 (Physical Intelligence) et d'autres architectures VLA de grands laboratoires. PACT s'inspire des techniques d'alignement post-entraînement développées pour les LLM, de type RLHF, adaptées aux contraintes physiques plutôt qu'aux préférences humaines, et se positionne face aux approches par apprentissage par renforcement contraint et aux filtres CBF (Control Barrier Functions). Aucune affiliation industrielle ni partenariat de déploiement n'est mentionné : il s'agit d'un résultat purement académique, sans pilote industriel annoncé. La validation sur des plateformes humanoïdes complètes et l'intégration dans des pipelines VLA de production restent à démontrer.

RecherchePaper
1 source
LightTact : un capteur tactile-visuel de bout de doigt pour la détection de contact sans déformation
341arXiv cs.RO 

LightTact : un capteur tactile-visuel de bout de doigt pour la détection de contact sans déformation

LightTact est un capteur tactile-visuel de bout de doigt conçu pour détecter les contacts sans déformation mécanique de surface. Là où les capteurs conventionnels (GelSight du MIT, DIGIT de Meta, Tactip) s'appuient sur la déformation d'un élastomère pour inférer un contact, LightTact exploite une configuration optique à blocage de lumière ambiante: seule la lumière diffusée aux points de véritables contacts traverse le système, laissant les pixels non-contactés à une valeur de gris moyenne inférieure à 3 sur 255. Les images brutes produites sont à fort contraste, chaque zone de contact préservant l'apparence naturelle de la surface touchée. La robustesse annoncée couvre les variations de propriétés matérielles, de force de contact, d'apparence de surface et d'éclairage ambiant, sans calibration spécifique au matériau. Ce verrou adresse un angle mort structurant de la manipulation robotique fine: les contacts dits "légers" avec des liquides, semi-liquides ou matériaux ultra-mous ne génèrent pas de déformation macroscopique et restent donc invisibles pour la plupart des capteurs actuels. LightTact démontre des comportements jusque-là difficiles à automatiser: étalement d'eau sur une surface, prélèvement de crème cosmétique, interaction avec des films minces souples. Pour les intégrateurs ciblant la cosmétique, l'agroalimentaire ou la manutention de produits fragiles, c'est un point de blocage technique levé. Fait significatif: les images visuelles et tactiles, spatialement alignées, sont directement interprétables par des vision-language models (VLMs), ce qui abaisse la barrière d'intégration avec les pipelines d'IA multimodaux sans couche de traitement intermédiaire dédiée. Le travail est publié en préprint sur arXiv (référence 2512.20591, troisième version), ce qui le situe au stade de la recherche académique: aucun produit commercial ni déploiement industriel n'est annoncé. Dans le panorama des capteurs tactiles visuels, LightTact occupe une niche distincte de celle de GelSight et ses dérivés, ou des solutions capacitives comme Xela Robotics, qui ciblent des régimes de contact avec déformation mesurable. Du côté européen, Pollen Robotics ou Wandercraft ne proposent pas de capteur tactile propre à ce niveau de spécificité. Les prochaines étapes logiques incluent une validation en boucle fermée sur plateforme robotique réelle et un test de durabilité de la surface optique face à des matériaux agressifs en usage répété.

UEAucun impact direct documenté à ce stade de préprint, mais les acteurs FR/EU ciblant la manipulation fine (Pollen Robotics, intégrateurs agroalimentaire/cosmétique) pourraient bénéficier de cette approche pour des contacts légers avec matériaux mous ou liquides.

RecherchePaper
1 source
DLO-Lab : évaluation de la manipulation d'objets linéaires déformables avec physique différentiable
342arXiv cs.RO 

DLO-Lab : évaluation de la manipulation d'objets linéaires déformables avec physique différentiable

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.04206) DLO-Lab, un cadre de recherche combinant simulateur physique différentiable et suite de benchmarks dédiée à la manipulation robotique d'objets linéaires déformables (DLO), soit concrètement les câbles, cordes et élastiques. Le simulateur modélise explicitement une gamme étendue de propriétés matérielles : extensibilité et inextensibilité, élasticité, plasticité en flexion, ainsi que les interactions complexes entre objets. Sur cette base, les auteurs proposent un ensemble de tâches représentatives qui mettent en évidence deux difficultés centrales de la manipulation DLO : la complexité topologique inhérente aux objets déformables et la sensibilité aux points de saisie. Ils introduisent également un agent spécialisé qui sélectionne des points de préhension stratégiques et décompose les tâches longues en sous-séquences pour maximiser l'autorité de contrôle. L'ensemble est évalué avec plusieurs algorithmes d'apprentissage de politiques, et des expériences de transfert sim-to-real sont conduites pour valider le potentiel applicatif de la plateforme. L'enjeu industriel est direct : la manipulation de câbles et de fils est l'un des derniers verrous majeurs de l'automatisation en électronique, câblage automobile et logistique. Les approches antérieures se heurtaient à un double plafond de verre, étroitesse des tâches supportées et impossibilité pratique de collecter des données réelles suffisamment diversifiées. L'usage d'un simulateur différentiable change l'équation : les gradients physiques peuvent guider directement l'optimisation des politiques, ce qui réduit le besoin en démonstrations humaines et rend l'apprentissage plus transférable. Les expériences sim-to-real présentées dans l'article constituent la mesure critique : elles indiquent si le fossé simulation-réalité est franchissable pour ce type d'objets réputés imprévisibles, bien que les conditions expérimentales précises (matériaux testés, taux de succès chiffrés) restent à examiner dans le détail du papier complet. La manipulation DLO est un problème actif depuis les années 2010, avec des travaux notables du MIT, de Berkeley (notamment autour de l'équipe Pieter Abbeel) et, côté européen, de l'Inria et du DLR. Les benchmarks existants comme RLBench ou ManipulaTHOR ne couvrent pas spécifiquement les propriétés physiques des déformables linéaires, ce qui justifie la niche que vise DLO-Lab. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade : il s'agit d'une contribution académique pré-print, non encore évaluée par les pairs. Les prochaines étapes naturelles seraient une intégration dans des environnements de simulation largement adoptés comme Isaac Sim ou MuJoCo, et une validation sur des cas industriels concrets tels que le câblage de faisceaux dans l'automobile.

UELes équipes européennes (Inria, DLR) sont actives sur la manipulation DLO, et l'industrie automobile européenne, notamment le câblage de faisceaux, constitue l'un des débouchés industriels directs visés par ces travaux de simulation différentiable.

RecherchePaper
1 source
PHASER : rejeu d'expérience sémantique et par phase pour les modèles VLA
343arXiv cs.RO 

PHASER : rejeu d'expérience sémantique et par phase pour les modèles VLA

Des chercheurs ont publié sur arXiv (référence 2606.03598) un framework de continual learning baptisé PHASER (Phase-Aware and Semantic Experience Replay), conçu pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. L'architecture est agnostique au backbone sous-jacent et a été évaluée sur trois modèles VLA distincts dans les suites de benchmarks LIBERO, une référence du domaine. Sur le scénario LIBERO-Goal CL (continual learning), PHASER atteint un taux de succès moyen (Average Success Rate, ASR) de 87,8 % en fin d'entraînement, soit un gain de 31 points de pourcentage par rapport à l'experience replay uniforme standard avec le même budget mémoire. Le problème que PHASER attaque est celui de l'oubli catastrophique : lorsqu'un robot apprend séquentiellement de nouvelles compétences gestuelles, les représentations antérieures se dégradent rapidement dans les poids du modèle. L'experience replay classique échoue parce qu'il échantillonne uniformément, sous-représentant les sous-phases courtes mais critiques d'une trajectoire de manipulation (la saisie, le transfert, la dépose), un phénomène que les auteurs nomment "phase starvation". PHASER corrige cela avec deux mécanismes : une allocation mémoire par phase (capacity allocation) pour garantir une couverture équilibrée de tous les sous-comportements, et un routage dynamique qui priorise les phases historiques à haut risque d'oubli. Un troisième composant, Auto-PC, automatise la détection des frontières temporelles entre sous-phases par analyse non supervisée des signaux d'action, validée ensuite par un VLM, évitant ainsi l'annotation manuelle coûteuse. Les VLA, qui conditionnent les actions du robot sur du langage naturel et des images, sont devenus un axe central de la robotique généraliste, portés notamment par des modèles comme OpenVLA (UC Berkeley), pi0 (Physical Intelligence) ou RT-2 (Google DeepMind). L'un des verrous majeurs à leur déploiement industriel reste précisément la capacité à apprendre de nouvelles tâches sans régression sur les anciennes, prérequis pour tout robot polyvalent en atelier. PHASER reste pour l'instant une contribution de recherche évaluée en simulation, mais son caractère agnostique au backbone en fait un candidat naturel pour une intégration dans des pipelines d'entraînement continuel sur des plateformes hardware comme Figure 02, Unitree G1 ou Boston Dynamics Atlas.

IA physiqueOpinion
1 source
Entraînement de robots par LLM : génération automatisée de données via l'augmentation de démonstrations
344arXiv cs.RO 

Entraînement de robots par LLM : génération automatisée de données via l'augmentation de démonstrations

Des chercheurs de Carnegie Mellon University ont publié LLM Trainer (arXiv:2509.20070v2), un pipeline entièrement automatisé capable de transformer une poignée de démonstrations humaines, aussi peu qu'une seule, en un large jeu de données pour l'apprentissage par imitation robotique. Le système décompose la génération de nouvelles démonstrations en deux étapes : une annotation hors-ligne qui extrait des keyframes, des objets saillants et des relations pose-objet à partir des trajectoires originales, puis un retargeting de keyposes en ligne qui adapte ces keyframes à un nouvel environnement à partir d'une simple observation initiale. Le pipeline déforme ensuite géométriquement la trajectoire originale pour en produire une nouvelle, l'exécute sur le robot, et ne conserve les données que si l'exécution est concluante. Pour optimiser la qualité des annotations, réutilisables d'une scène à l'autre, l'équipe intègre un mécanisme de Thompson sampling qui améliore significativement le taux de succès. Les validations ont été conduites sur un bras Franka Emika Panda. L'enjeu est structurant pour l'imitation learning en robotique industrielle : le goulot d'étranglement reste la collecte coûteuse de démonstrations humaines. LLM Trainer propose de contourner ce problème en mobilisant la connaissance du monde embarquée dans les LLMs pour générer des variantes de scènes plausibles sans intervention humaine supplémentaire. Les résultats montrent que la méthode d'annotation LLM surpasse systématiquement des baselines conçues par des experts humains. L'approche d'ensemble, combinant un plan feed-forward LLM optimisé et un contrôleur par imitation en feedback, ouvre une piste vers des politiques plus robustes à la variabilité des environnements réels, ce qui intéresse directement les intégrateurs confrontés à des lignes de production hétérogènes. Ce travail s'inscrit dans une tendance forte en manipulation robotique : réduire la dépendance aux données humaines via l'augmentation synthétique, après des approches comme RoboAgent, DemoAugment ou les pipelines sim-to-real de Google DeepMind. Carnegie Mellon reste un acteur central de cet espace, aux côtés de Stanford (Mobile ALOHA), Berkeley (RoboVerse) et du MIT. Pour l'heure, LLM Trainer est uniquement validé sur un seul modèle de bras dans des conditions de laboratoire, ce qui laisse ouverte la question du passage à l'échelle vers des robots humanoïdes ou des environnements moins structurés. La version v2 publiée sur arXiv suggère des révisions post-soumission, probablement en vue d'une conférence comme CoRL 2025 ou ICRA 2026.

RecherchePaper
1 source
Tabero : manipulation douce par retour de force en boucle fermée (vision, toucher, langage)
345arXiv cs.RO 

Tabero : manipulation douce par retour de force en boucle fermée (vision, toucher, langage)

Une équipe de recherche a publié sur arXiv (preprint 2605.27886, mai 2026) Tabero, un benchmark et une suite de modèles destinés à doter les robots d'une manipulation douce et contrôlée par retour de force en temps réel. Le système repose sur deux composantes : d'abord un benchmark qui recycle des trajectoires de manipulation robotique open-source pour générer automatiquement des tâches combinant vision, toucher et instructions en langage naturel, sans nécessiter de collecte de données tactiles from scratch ; ensuite Tabero-VTLA, une architecture Vision-Langage-Action (VLA) dotée d'une interface de commande découplée force/position, exécutée par un contrôleur hybride fixe. Résultat clé annoncé : sous instructions de manipulation douce, le modèle réduit la force de préhension moyenne de plus de 70 % tout en maintenant un taux de succès élevé sur les tâches testées. Le code est publié sur GitHub. Il s'agit d'un preprint de recherche, pas d'un produit déployé. Ce résultat s'attaque à une limite connue des VLA actuels : ces modèles, entraînés principalement sur des données visuelles et textuelles, ne disposent pas de mécanismes de rétroaction de force en boucle fermée, ce qui les rend inadaptés à la manipulation d'objets fragiles ou aux interactions physiques avec des humains. La réduction de 70 % de la force de préhension est un chiffre notable, mais il faut le contextualiser : les détails sur la diversité des tâches, les matériaux et les conditions de test restent limités dans ce résumé, et les vidéos de démonstration associées aux preprints de ce type sont souvent sélectionnées pour maximiser l'effet. Le pipeline de génération de données tactiles par revalorisation de trajectoires existantes est en revanche une contribution méthodologique potentiellement réutilisable par d'autres équipes. Les VLA à toucher intégré constituent un chantier ouvert dans la course aux robots polyvalents. Les modèles pi-zero de Physical Intelligence et GR00T N2 de NVIDIA ont popularisé les architectures VLA pour la manipulation généraliste, mais s'appuient quasi exclusivement sur la vision. Du côté du toucher, des capteurs comme GelSight ou DIGIT existent en laboratoire mais restent rarement intégrés dans les pipelines d'entraînement à grande échelle. Tabero tente de combler ce fossé par une approche data-efficient. Les prochaines étapes naturelles seraient une validation sur robot physique dans des conditions industrielles réelles, notamment pour des cas d'usage comme l'assemblage de composants délicats ou la collaboration humain-robot en contexte manufacturier.

IA physiqueOpinion
1 source
Apprentissage par renforcement en boucle fermée pour le contrôle de forme de microfibres déformables par transfert simulation-réel
346arXiv cs.RO 

Apprentissage par renforcement en boucle fermée pour le contrôle de forme de microfibres déformables par transfert simulation-réel

Des chercheurs ont publié sur arXiv (référence 2605.21688) une approche d'apprentissage par renforcement sim-to-real en boucle fermée pour le contrôle de forme de microfibres déformables. Le système cible la micromanipulation de contact, en l'occurrence des microfibres de soie de 50, 80 et 120 µm de diamètre, sur des longueurs manipulées de 10, 15 et 20 mm. La politique de contrôle est entraînée exclusivement dans un simulateur sans frottement, puis transférée directement vers un système physique à double préhenseur tournant à 40 Hz, sans réentraînement ni adaptation de domaine. Sur 24 configurations initiales variées et 9 spécimens couvrant toutes les combinaisons de diamètres et de longueurs, le système atteint une erreur moyenne de forme de 270 ± 80 µm, soit systématiquement sous le millimètre. Ce résultat est significatif parce qu'il démontre que le problème du sim-to-real gap n'exige pas forcément une modélisation fine des interactions de surface à l'échelle microscopique. Le tour de force consiste à ne pas chercher à éliminer le mismatch entre simulation et réalité, mais à le rendre observable et corrigeable via le retour visuel en temps réel. Pour les intégrateurs travaillant sur la microassemblage, le placement de composants biologiques, ou la manipulation de fibres dans des procédés textiles ou médicaux, cela ouvre la voie à des systèmes qui généraliseraient à de nouveaux matériaux sans recalibration systématique. La robustesse démontrée sur des spécimens de géométries variées, sans réglage par spécimen, constitue un signal concret que le pipeline est viable au-delà du cadre lab. La micromanipulation robotique basée sur la vision souffre depuis longtemps d'un manque de méthodes capables de gérer les forces capillaires, adhésives et de frottement à l'échelle sub-millimétrique, que les simulateurs classiques ignorent. Les approches dominantes s'appuyaient sur des modèles physiques analytiques ou du domain randomization intensif, deux stratégies coûteuses à paramétrer. Ce travail positionne l'apprentissage par renforcement avec retour visuel comme une alternative compétitive, potentiellement transférable à d'autres objets déformables (cathéters, fils chirurgicaux, câbles fins). Les prochaines étapes probables incluent la validation sur des matériaux non-soyeux, l'extension à des fibres plus courtes ou plus rigides, et l'intégration dans des pipelines de microassemblage multi-étapes.

RecherchePaper
1 source
RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes
347arXiv cs.RO 

RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes

Une équipe de chercheurs a publié RoboMME (Robotic Multi-Memory Evaluation), un benchmark standardisé à grande échelle destiné à évaluer les modèles VLA (vision-language-action) sur des tâches de manipulation robotique nécessitant de la mémoire à long horizon. Le benchmark comprend 16 tâches construites selon une taxonomie en quatre catégories : mémoire temporelle, spatiale, des objets et procédurale, couvrant des scénarios comme le comptage d'actions répétées ou la manipulation d'objets temporairement occultés. Les auteurs ont également développé 14 variantes de VLA augmentées de mémoire, toutes bâties sur le backbone pi0.5 de Physical Intelligence, et les ont évaluées selon différentes stratégies d'intégration mémorielle. L'absence d'un cadre d'évaluation standardisé était jusqu'ici un frein majeur pour la recherche sur la mémoire dans les VLA généralistes : chaque équipe testait ses mécanismes dans des conditions ad hoc, rendant toute comparaison rigoureuse impossible. RoboMME comble ce vide en permettant, pour la première fois, de mesurer systématiquement comment différentes représentations mémorielles (états cachés récurrents, mémoire externe, fenêtre de contexte longue) se comportent sur un spectre de tâches hétérogènes. La conclusion principale est nuancée : l'efficacité d'une architecture mémoire est fortement dépendante de la tâche, chaque approche présentant des avantages distincts selon la catégorie, ce qui remet en cause l'idée qu'une solution universelle serait à portée à court terme. Pour les intégrateurs et les décideurs B2B, cela signifie concrètement que le choix du mécanisme mémoriel devra rester spécifique au cas d'usage, sans recette générique applicable. Ce benchmark s'inscrit dans la montée en puissance des VLA généralistes, portés par des modèles comme pi0 et pi0.5 de Physical Intelligence (levée de 400 millions de dollars en 2024), OpenVLA, Octo ou RoboVLMs, qui cherchent tous à transférer les capacités des grands modèles de langage à la manipulation physique. D'autres benchmarks comme LIBERO, RoboSuite ou MetaWorld couvrent déjà l'évaluation générale des VLA, mais RoboMME se distingue par son focus explicite sur la mémoire à long horizon, un aspect jusqu'ici systématiquement sous-évalué dans ces environnements. Les prochaines étapes probables incluent l'adoption de RoboMME comme référence communautaire dans les pipelines d'évaluation des grands labs robotiques, et le développement d'architectures mémoire capables de généraliser entre catégories de tâches sans sacrifier les performances spécialisées.

RechercheActu
1 source
Quoi ignorer, quoi traiter : affinage par renforcement des modèles VLA robustes aux distracteurs visuels
348arXiv cs.RO 

Quoi ignorer, quoi traiter : affinage par renforcement des modèles VLA robustes aux distracteurs visuels

Des chercheurs ont publié mi-mai 2026 sur arXiv (2605.13105) PAIR-VLA (Paired Action Invariance & Sensitivity for Visually Robust VLA), un framework de fine-tuning par apprentissage par renforcement (RL) destiné à rendre les modèles Vision-Language-Action (VLA) robustes aux variations visuelles à l'heure du déploiement. La méthode ajoute deux objectifs auxiliaires pendant l'optimisation PPO (Proximal Policy Optimization) : un terme d'invariance qui réduit l'écart entre distributions d'actions pour des paires visuellement distinctes mais dont la tâche reste identique (distracteurs différents en arrière-plan, par exemple), et un terme de sensibilité qui encourage des distributions séparables lorsque le changement visuel modifie effectivement la tâche requise (objet cible en pose différente). Évalué sur le benchmark de simulation ManiSkill3 avec deux architectures VLA représentatives, OpenVLA et π₀.₅ de Physical Intelligence, le framework affiche des gains moyens de 16,62 % sur π₀.₅ et 9,10 % sur OpenVLA face à cinq catégories de shifts visuels hors distribution : distracteurs inédits, changements de texture, variations de pose de l'objet cible, changements de point de vue et variations d'éclairage. Ce résultat adresse un angle mort structurel du déploiement industriel des VLA : les récompenses de tâche standard supervisent le succès d'une manipulation, mais ne distinguent pas entre un changement visuel anodin et un changement qui exige une adaptation comportementale de la part du robot. PAIR-VLA convertit les variantes visuelles en signal comportemental au moment du RL, et non en simple augmentation d'observations. L'aspect le plus saillant est la généralisation croisée relevée en ablations : une guidance d'invariance apprise sur des variantes de distracteurs et de textures se transfère aux shifts de pose et d'éclairage, ce qui suggère que le framework capture quelque chose de structurel dans la distinction pertinent/non-pertinent plutôt qu'un surapprentissage de domaine. Le contexte est celui d'une course intense autour des VLA pour la manipulation robotique. OpenVLA (UC Berkeley, 2024) s'est imposé comme référence open-source ; π₀ et π₀.₅ de Physical Intelligence (San Francisco) visent des applications industrielles à plus grande échelle, tandis que les travaux de Google DeepMind sur RT-2, et les modèles Octo et RoboFlamingo, densifient le paysage concurrent. PAIR-VLA est pour l'instant un preprint sans déploiement annoncé ni validation sur robot physique, ce qui constitue la limite principale à noter. La méthode s'applique en post-training RL au-dessus de checkpoints VLA existants sans réentraînement complet, avantage pratique non négligeable pour les intégrateurs qui s'appuient sur des modèles publics. La confirmation que ces gains en simulation résistent au reality gap reste l'étape décisive à venir.

IA physiqueOpinion
1 source
LaST-R1 : un nouveau paradigme de raisonnement physique atteint 99,9 % de succès sur le benchmark LIBERO
349Pandaily 

LaST-R1 : un nouveau paradigme de raisonnement physique atteint 99,9 % de succès sur le benchmark LIBERO

Une équipe réunissant Zojian Power, l'Université de Pékin et l'Université chinoise de Hong Kong a publié LaST-R1 (Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning), un nouveau paradigme d'entraînement pour robots manipulateurs accepté en Spotlight à ICML 2026 (top 2,2 % des soumissions). Sur le benchmark LIBERO, référence standard d'évaluation de la manipulation robotique, le modèle atteint un taux de succès moyen de 99,9 % avec une seule trajectoire de mise en route, saturant le benchmark au point que les auteurs le considèrent désormais comme un outil discriminant insuffisant. En conditions réelles de saisie et de rotation d'objets, LaST-R1 surpasse pi0.5 de Physical Intelligence de 22,5 points de pourcentage. L'innovation centrale est l'abandon du raisonnement par chaîne de pensée en langage naturel : avant de générer une action, le modèle construit une représentation interne de la structure de la scène, des relations physiques entre objets et des dynamiques futures anticipées dans un espace latent. L'algorithme LAPO (Latent-to-Action Policy Optimization) optimise conjointement ce raisonnement et l'exécution motrice, les retours d'environnement pénalisant non seulement l'échec de l'action mais aussi la qualité du raisonnement physique préalable. Ce résultat s'attaque au verrou le plus persistant des modèles VLA (Vision-Language-Action) : la généralisation. Les architectures comme OpenVLA, pi0 ou pi0.5 tendaient à échouer dès qu'un objet était légèrement déplacé ou que les conditions d'éclairage changeaient, trahissant une fragilité structurelle liée à la mémorisation de trajectoires plutôt qu'à la compréhension des contraintes physiques. En faisant raisonner le robot sur la physique avant d'agir, LaST-R1 améliore la robustesse aux perturbations sans nécessiter de rejeu massif de données, ce qui représente potentiellement une réduction des coûts de reprogrammation lors de changements de références ou de conditions opératoires pour les intégrateurs industriels. Le terrain concurrentiel est aujourd'hui dominé par Physical Intelligence, dont les modèles pi0 et pi0.5 sont issus de la recherche académique californienne et adossés à des levées de fonds conséquentes, ainsi que par OpenVLA, fruit de consortiums universitaires américains. LaST-R1 positionne Zojian Power, startup chinoise, comme un acteur technique crédible en s'appuyant sur des collaborations académiques de premier rang à Pékin et Hong Kong. La sélection en Spotlight à ICML 2026 confère au travail une légitimité internationale, mais les expériences réelles restent limitées à des environnements contrôlés de saisie et de rotation ; aucun déploiement industriel ni feuille de route commerciale n'a été annoncé, ce qui maintient LaST-R1 dans la catégorie résultat de recherche prometteur, pas encore produit déployé.

IA physiqueOpinion
1 source
OmniVLA-RL : modèle vision-langage-action avec compréhension spatiale et apprentissage par renforcement en ligne
350arXiv cs.RO 

OmniVLA-RL : modèle vision-langage-action avec compréhension spatiale et apprentissage par renforcement en ligne

OmniVLA-RL, une nouvelle architecture Vision-Language-Action (VLA), est présentée dans un préprint arXiv (référence 2604.17706) dont les affiliations institutionnelles ne sont pas précisées dans la version disponible. Le modèle repose sur un design Mix-of-Transformers (MoT) qui orchestre trois experts spécialisés : raisonnement général, compréhension spatiale, et génération d'action motrice. Les auteurs introduisent également Flow-GSPO, une méthode qui reformule le flow matching comme un processus d'équations différentielles stochastiques (SDE), couplé à un algorithme d'optimisation de politique segmentée par groupes (GSPO). Les évaluations sont conduites sur les benchmarks LIBERO et LIBERO-Plus, deux suites de référence pour la manipulation robotique en simulation, sur lesquelles OmniVLA-RL affiche des performances annoncées supérieures aux méthodes actuellement considérées comme état de l'art. La contribution adresse trois failles structurelles bien documentées dans la littérature VLA : la perception spatiale imprécise, la fusion multimodale sous-optimale, et l'instabilité de l'entraînement par renforcement en ligne sur des espaces d'action continus. En séparant explicitement raisonnement, spatialisation et planification motrice dans des sous-réseaux distincts, OmniVLA-RL évite la dilution de ces capacités dans un unique transformer généraliste, une critique récurrente faite aux VLA de première génération. Flow-GSPO propose un cadre mathématique plus rigoureux pour stabiliser le RL, un enjeu central dans la course au sim-to-real. Pour les intégrateurs et décideurs industriels, ce type d'avancée a un intérêt indirect mais réel : si la robustesse à l'entraînement en ligne s'améliore, le coût de généralisation des bras manipulateurs à de nouvelles tâches sans retraining complet pourrait baisser significativement. Les VLA sont aujourd'hui au centre d'une compétition intense entre groupes académiques et industriels. Physical Intelligence pousse Pi-0 et Pi-0.5 vers la manipulation dextre ; Google DeepMind fait progresser RT-2 et ses dérivés ; du côté des systèmes embarqués dans des humanoïdes, Figure (Figure 03), Tesla (Optimus Gen 3) et 1X intègrent des architectures comparables. OmniVLA-RL se positionne sur le segment recherche fondamentale, avec des résultats limités à la simulation et aucune démonstration sur robot physique annoncée à ce stade. L'évaluation exclusive sur LIBERO ne permet pas de conclure sur les performances en conditions réelles, et le gap sim-to-real reste entier. La prochaine étape naturelle serait une validation sur plateformes physiques, dans des environnements de manipulation non structurés, pour confirmer si les gains observés en simulation tiennent effectivement sur le terrain.

IA physiqueActu
1 source