Aller au contenu principal
NestDex : apprentissage de politiques imbriquées avec téléopération assistée par copilote pour la manipulation dextérique
IA physiquearXiv cs.RO 

NestDex : apprentissage de politiques imbriquées avec téléopération assistée par copilote pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint publié sur arXiv en août 2026 (arXiv:2608.13362) présente NestDex, un framework de téléopération assistée pour entraîner des politiques de manipulation dextérique. Contrairement à une pince parallèle, une main à plusieurs doigts oblige l'opérateur à coordonner en même temps le mouvement du bras et des gestes fins, riches en contacts, ce qui complique la collecte de démonstrations complètes et cohérentes. Dans NestDex, l'opérateur pilote le bras et active la compétence de main voulue via un simple embrayage à un seul degré de liberté, pendant qu'une politique interne ajuste la main selon l'historique proprioceptif récent et qu'un sélecteur vision-langage choisit automatiquement la bonne compétence à chaque étape de la tâche. Ces démonstrations entraînent ensuite une politique visuomotrice externe distincte, qui pilote seule le bras et la main au moment du déploiement, sans plus recourir aux politiques internes; les commandes de main sont compressées par un autoencodeur variationnel tandis que celles du bras restent dans l'espace articulaire. Des essais réels montrent une collecte de démonstrations plus fiable et plus efficace, avec des vidéos disponibles sur aus.bot/research/nestdex.

La contribution cible directement ce qui freine l'entraînement de mains robotiques à plusieurs doigts à l'échelle industrielle: la téléopération classique, par gants ou exosquelettes, produit des démonstrations lentes et peu fiables dès qu'il faut coordonner plusieurs doigts en même temps que le bras, ce qui limite la taille des jeux de données nécessaires aux politiques vision-langage-action (VLA). En déportant la coordination fine des doigts vers une politique déjà entraînée et en laissant l'humain gérer la stratégie de haut niveau, NestDex promet de réduire le coût et le temps de collecte, un enjeu central pour les intégrateurs qui visent des mains dextériques plutôt que de simples pinces parallèles plus limitées. L'article reste toutefois un travail de recherche présenté sans taux de succès chiffrés ni comparaison directe avec des systèmes commerciaux existants, ce qui invite à la prudence sur la portée réelle des gains annoncés.

Ce travail s'inscrit dans les efforts récents pour rendre la manipulation dextérique aussi simple à entraîner que la manipulation par pince, à mesure que les politiques VLA généralistes se multiplient dans le secteur robotique. Il ne s'agit pas d'un produit commercial ni d'un déploiement client mais d'une publication scientifique, accompagnée de vidéos hébergées sur le site du projet, sans date de disponibilité ni feuille de route de commercialisation communiquée. Les prochaines étapes attendues, bien que non détaillées dans le résumé, porteraient logiquement sur l'extension à davantage de tâches, de mains robotiques et de plateformes, ainsi que sur des comparaisons chiffrées avec les méthodes de téléopération existantes.

À lire aussi

Politique de force : apprentissage d'un contrôle hybride force-position en cadre d'interaction pour la manipulation en contact
1arXiv cs.RO 

Politique de force : apprentissage d'un contrôle hybride force-position en cadre d'interaction pour la manipulation en contact

Des chercheurs ont publié sur arXiv (2602.22088v2) "Force Policy", une architecture de contrôle pour la manipulation robotique en contact prolongé. L'approche repose sur une séparation architecturale nette entre deux régimes d'action : un module global guidé par la vision qui pilote les mouvements en espace libre, et un module local haute fréquence qui prend le relais dès qu'un contact est établi, en exploitant le retour d'effort pour exécuter un contrôle hybride force-position. Le coeur du système est ce que les auteurs appellent un "interaction frame" : un repère local instantané, récupéré automatiquement à partir de démonstrations humaines, qui découple la régulation de force de l'exécution du mouvement. Les expériences en conditions réelles couvrent plusieurs tâches à contact riche (assemblage, insertion, vissage) et démontrent des gains mesurables en stabilité de contact, précision de régulation de force et généralisation à des objets aux géométries et propriétés physiques variées. L'enjeu industriel est direct : la manipulation en contact riche reste le principal goulot d'étranglement des robots de production et d'assemblage. Les politiques d'apprentissage actuelles, qu'il s'agisse de Diffusion Policy, d'ACT ou des approches VLA, sont conçues pour l'espace libre et degradent significativement dès qu'un outil touche une pièce. En injectant le retour d'effort dans une boucle locale haute fréquence distincte de la boucle visuelle, Force Policy adresse structurellement ce découplage plutôt que de le noyer dans un réseau monolithique. La capacité à estimer le repère d'interaction à partir de démonstrations, sans hypothèse sur la structure de la tâche, réduit l'ingénierie manuelle nécessaire au déploiement. Ce travail s'inscrit dans une ligne de recherche active sur le contrôle hybride appris, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur le compliance learning chez CMU et Stanford. Il reste à ce stade une démonstration académique, sans déploiement industriel annoncé ni partenariat constructeur mentionné. L'étape suivante naturelle serait une validation sur des cellules d'assemblage réelles, avec des volumes de cycle et des tolérances conformes aux standards industriels. Le code et les démonstrations vidéo sont disponibles sur force-policy.github.io.

IA physiquePaper
1 source
SSI-Policy : apprentissage d'interfaces de scène structurées pour la manipulation robotique vision-langage
2arXiv cs.RO 

SSI-Policy : apprentissage d'interfaces de scène structurées pour la manipulation robotique vision-langage

Des chercheurs ont déposé SSI-Policy sur arXiv (2606.26800, juin 2026), un framework modulaire pour la manipulation robotique en régime de faibles données. Le système repose sur une représentation intermédiaire appelée Structured Scene Interface (SSI), une couche RGB-only qui encode simultanément des caractéristiques de profondeur monoculaire, des dispositions spatiales d'objets ancrées dans le langage naturel, et des trajectoires 2D conditionnées par instruction. Sur le benchmark LIBERO avec seulement 10 démonstrations par tâche, SSI-Policy dépasse la meilleure méthode concurrente de près de 15 points, et reste compétitif face aux approches à 50 démonstrations recourant au préentraînement externe à large échelle. Les auteurs valident également sur 13 tâches réelles : raisonnement spatial, transfert cross-embodiment et manipulation avec contact. L'apport central est architectural : en découplant la perception du contrôle via l'interface SSI, la politique aval peut apprendre à partir de très peu de démonstrations. Que l'interface soit entraînable sur des vidéos sans annotation d'action est particulièrement précieux pour les intégrateurs industriels qui peinent à collecter des données de téléopération à grande échelle. L'absence de capteur de profondeur, le système fonctionnant en pure RGB, réduit les prérequis matériels et facilite le déploiement sur des bras standards. Le caractère robot-agnostique de SSI cible directement la faiblesse récurrente des VLA (Vision-Language Action models) comme Pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA : leur difficulté à transférer vers de nouveaux embodiments sans réentraînement coûteux. SSI-Policy se positionne face à trois familles de méthodes : les approches vidéo (SuSIE, UniSim), sujettes à dérive géométrique sur les horizons longs ; les méthodes 3D (Act3D, RoboPoint), qui exigent du RGB-D ; et les interfaces de flux optique, sans structure géométrique explicite. SSI-Policy prétend en combiner les avantages, affirmation partiellement étayée par les ablations publiées mais restant à confirmer sur des benchmarks plus larges comme RLBench ou DROID. L'article est un preprint, non soumis à évaluation par les pairs. La suite logique : validation sur plateformes humanoïdes complètes et pilotes industriels réels, deux domaines où la robustesse en faible nombre d'exemples reste le verrou commercial principal.

IA physiqueOpinion
1 source
DeformGen : augmentation topologique basée sur la dynamique pour l'apprentissage de politiques de manipulation d'objets déformables
3arXiv cs.RO 

DeformGen : augmentation topologique basée sur la dynamique pour l'apprentissage de politiques de manipulation d'objets déformables

Une équipe de chercheurs a publié fin juin 2026 DeformGen (arXiv:2606.25939), un framework d'augmentation de données de démonstration conçu pour l'apprentissage de politiques de manipulation d'objets déformables. Face au coût prohibitif de la collecte de données réelles pour ce type de tâche, la méthode génère automatiquement de nouveaux exemples d'entraînement à partir d'un ensemble restreint de démonstrations existantes. L'approche repose sur deux briques techniques distinctes : d'abord, l'application de perturbations physiques localisées suivies d'une simulation de dynamique vers l'avant pour produire des états déformés topologiquement cohérents et physiquement plausibles ; ensuite, un transfert de trajectoires par déformation de champ continu ("deformation-field warping"), qui projette les déplacements par particule en une fonction spatiale continue permettant d'adapter la trajectoire de l'effecteur terminal à la nouvelle géométrie de l'objet. Les expériences menées sur des benchmarks haute fidélité de manipulation déformable montrent des améliorations systématiques par rapport à l'entraînement sur les seules démonstrations d'origine et par rapport aux baselines d'augmentation de style rigide. L'enjeu est de taille pour l'industrie robotique : la manipulation d'objets déformables (textiles, câbles, aliments, composants souples) reste l'un des verrous majeurs du déploiement en production, précisément parce que les méthodes d'augmentation classiques, conçues pour des objets rigides, échouent à générer des configurations valides dans un espace d'états haute dimension soumis aux contraintes physiques. DeformGen identifie et adresse deux problèmes fondamentaux jusque-là non résolus : l'espace d'états valides ne peut pas être couvert par de simples perturbations de pose 6-DOF, et le transfert de trajectoire n'est pas équivariant sous déformation. Si ces résultats se confirment sur des tâches industrielles réelles, ce type d'approche pourrait réduire significativement le coût d'acquisition de données pour les lignes de picking textile, le routage de câbles dans l'électronique ou la manipulation agro-alimentaire. Ce travail s'inscrit dans un courant actif de recherche sur l'augmentation de démonstrations pour l'apprentissage par imitation, domaine où les avancées ont surtout bénéficié jusqu'ici à la manipulation d'objets rigides. Les acteurs qui travaillent sur la manipulation déformable en milieu industriel, comme Pollen Robotics en France ou des équipes universitaires spécialisées en sim-to-real, pourraient trouver dans cette approche une piste pour réduire la dépendance à la téléopération coûteuse. Les auteurs se concentrent pour l'instant sur des benchmarks simulés haute fidélité ; la question du sim-to-real gap sur des matériaux réels reste ouverte et constitue la prochaine étape critique à franchir avant tout déploiement opérationnel.

UEPollen Robotics (France) est explicitement cité comme acteur pouvant bénéficier de cette approche pour réduire le coût de collecte de données en manipulation déformable, mais les travaux restent à valider sur matériaux réels avant tout impact opérationnel.

💬 La manipulation d'objets mous, c'est le vrai verrou du déploiement robotique en production, pas l'actionnement. DeformGen s'attaque au problème par la racine : au lieu de collecter des milliers de démos sur du textile ou des câbles, tu génères des variantes physiquement cohérentes depuis quelques exemples. Reste le fossé sim-réel à franchir, mais si ça tient sur matériaux réels, ça change complètement les calculs économiques pour les lignes de picking souple.

IA physiquePaper
1 source
ProgVLA : apprentissage de compétences de manipulation robotique guidé par la progression
4arXiv cs.RO 

ProgVLA : apprentissage de compétences de manipulation robotique guidé par la progression

Des chercheurs ont publié le 28 mai 2026 sur arXiv (réf. 2605.28231) ProgVLA, un modèle vision-langage-action (VLA) compact de 0,1 milliard de paramètres conçu pour la manipulation robotique sous contraintes strictes de calcul et de mémoire. L'architecture repose sur deux mécanismes principaux : un encodeur multimodal à double étage de rééchantillonnage Perceiver, qui compresse des flux variables d'entrées visuelles, linguistiques et proprioceptives en un ensemble fixe de tokens de contexte prêts au contrôle, et un ensemble de "têtes de progression" auxiliaires entraînées par apprentissage par renforcement hors-ligne sur des cibles normalisées d'horizon restant. Ces têtes fournissent à la politique une estimation interne de l'avancement de la tâche, ce qui permet un apprentissage par imitation via flow-matching pondéré par l'avantage et le succès. Sur deux benchmarks standards de manipulation multi-tâche, ProgVLA atteint des taux de réussite compétitifs avec des modèles pré-entraînés nettement plus grands, et les dépasse sur les niveaux de difficulté élevés et les tâches à horizon long. Le modèle a également été validé dans des environnements réels de type "toy kitchen", une validation limitée mais concrète. L'intérêt principal pour les intégrateurs et les équipes de recherche appliquée réside dans le profil de compromis : 0,1 milliard de paramètres seulement, contre les 7B à 70B typiques des VLA récents comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Ce ratio ouvre la voie à un déploiement sur des plateformes embarquées à budget GPU limité, un obstacle central à la commercialisation des robots manipulateurs au-delà des démonstrateurs de laboratoire. Les ablations publiées sont précises : le rééchantillonneur de contexte appris et le fine-tuning visuel adaptatif à la tâche constituent les deux plus grandes sources de gain, tandis que l'entraînement conscient de la progression apporte un bénéfice supplémentaire ciblé sur les tâches multi-objets et à horizon long. Ce résultat contredit partiellement l'hypothèse selon laquelle seule la taille du modèle détermine la performance sur les tâches complexes. ProgVLA s'inscrit dans une vague de travaux visant à comprimer les VLA sans sacrifier leur capacité de généralisation, une direction prise également par des équipes comme celles qui travaillent sur la distillation de politiques pour des plateformes à faible puissance. Face aux modèles de référence que sont RT-2 (Google DeepMind), OpenVLA (UC Berkeley) et Pi-0, ProgVLA occupe le segment "edge-deployable" encore peu disputé par des solutions validées hors laboratoire. Deux limites sont à noter : le code et les données de benchmark n'étaient pas encore publiés au moment de l'annonce, et la validation réelle se restreint à un environnement toy-kitchen, ce qui rend prématurée toute extrapolation vers des contextes industriels ou des robots commerciaux de type Franka ou UR.

UELes équipes de R&D robotique européennes travaillant sur des plateformes embarquées pourraient surveiller ProgVLA comme alternative légère aux VLA dominants, mais aucun acteur ou programme européen n'est directement impliqué.

IA physiqueOpinion
1 source