Aller au contenu principal
RecherchearXiv cs.RO 

FINGR : apprentissage du contrôle de main dextérique pour résoudre un Rubik's Cube en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs présente FINGR (Future-supervised Interaction Network with Geometric Representations), une politique de contrôle pour main robotique dextre qui résout un Rubik's Cube en manipulation à une seule main. Sur une vraie main dextre, elle atteint 99,0 % de réussite sur 300 tentatives de rotation de face, contre 79,7 % pour la politique de flux (flow policy) de base. Couplée à des modules de saisie et de re-préhension assistée par la table, elle résout dix cubes 2×2×2 mélangés sur dix, avec un temps moyen de système complet d'environ 137 secondes. Il s'agit d'un travail académique publié sur arXiv (version 2), accompagné d'un site de projet, et non d'un produit ou d'un déploiement industriel. Les modèles de main utilisés, le protocole de mélange et les conditions d'essai ne figurent pas dans le résumé.

Techniquement, FINGR exprime la géométrie du cube relativement à chaque bout de doigt. Un encodeur de points partagé agrège les points sans dépendre de l'indexation des cubies, ce qui évite de figer une numérotation des petits cubes. Des « jetons futurs » appris, qui partagent l'encodeur d'observation, sont supervisés pour prédire les variations de force de contact, la progression de la rotation de couche et le déplacement des articulations des doigts, à plusieurs échelles de temps. La représentation obtenue conditionne une politique de flux qui génère directement les actions des doigts.

L'intérêt est double. D'abord, le gain de 79,7 % à 99,0 % suggère que, pour la manipulation riche en contacts, l'ajout d'objectifs auxiliaires de prédiction d'interactions et d'une géométrie centrée sur les doigts améliore nettement la fiabilité d'une politique générative. Ensuite, la fiabilité par tour compte davantage que la vitesse : une séquence de résolution enchaîne des dizaines de rotations, et une erreur non récupérée les fait échouer. Il faut toutefois rester prudent. Le 2×2×2 est nettement plus simple que le 3×3×3, l'échantillon de dix cubes est réduit, et rien n'indique que la méthode dépasse ce cadre de laboratoire ni qu'elle soit transposable à des tâches d'assemblage industrielles.

Le Rubik's Cube reste un banc d'essai classique de la dextérité robotique depuis la démonstration d'OpenAI avec la Shadow Hand, qui reposait sur un entraînement en simulation massif et une randomisation de domaine. Les approches actuelles se tournent plutôt vers les politiques génératives, de type flow matching ou diffusion, dont relèvent les modèles VLA récents comme Pi-0. FINGR se distingue en injectant des signaux de contact et de géométrie propres à la main. Les suites probables sont la montée au 3×3×3, plus exigeant en précision et en durée de séquence, ainsi que des tests sur d'autres mains dextres. Les auteurs ne mentionnent aucun partenaire industriel ni calendrier de transfert.

Dans nos dossiers

À lire aussi

LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles
1arXiv cs.RO 

LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles

Les chercheurs à l'origine de LAMP (Latent Motion Prior-Guided Real-World Learning) proposent une méthode d'apprentissage en trois étapes pour piloter des mains robotiques dexterous directement dans le monde réel, sans passer par la simulation. Le système commence par pré-entraîner un module de "prior de mouvement latent", qui compresse l'historique récent des actions de la main en une représentation compacte et décodable en commandes exécutables à haute dimension. Une politique visuomotrice est ensuite entraînée pour prédire à la fois les commandes natives du bras et des corrections latentes pour la main, avant d'être affinée par apprentissage par renforcement (RL) résiduel en ligne, directement sur le robot physique. Testée sur quatre tâches réelles de manipulation dexterous, la méthode atteint un taux de réussite moyen de 56,25% après la seule phase d'imitation, porté à 98,75% après le RL en ligne, avec 100% de réussite sur trois des quatre tâches et 95% sur la dernière. L'enjeu dépasse la simple performance chiffrée: l'apprentissage de mains robotiques à haute dimensionnalité (nombreux degrés de liberté par doigt) est historiquement instable, car la moindre erreur d'imitation s'amplifie et pousse l'exploration par renforcement à casser le contact avec l'objet manipulé, un risque direct pour du matériel physique coûteux. En contraignant l'exploration RL à rester proche de mouvements démontrés et cohérents en termes de contact, plutôt que de perturber chaque articulation indépendamment, LAMP répond à un vrai goulot d'étranglement pour les intégrateurs qui veulent déployer de la manipulation fine (préhension d'objets fragiles, assemblage) sans multiplier les cycles de simulation coûteux ni les casses de vérins. Le travail s'inscrit dans la lignée des approches hybrides imitation + RL déjà explorées pour la robotique, mais cible spécifiquement l'espace d'action des mains dexterous, comparé ici à des interfaces d'action brutes, linéaires et discrètes, que LAMP surpasse selon les auteurs. Publié sur arXiv début juillet 2026, ce travail reste à ce stade une contribution de recherche académique, sans acteur industriel ni date de commercialisation annoncée; sa validation sur davantage de tâches et de plateformes matérielles reste l'étape logique suivante.

RecherchePaper
1 source
Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique
2arXiv cs.RO 

Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique

Une nouvelle méthode d'apprentissage par renforcement (RL) entraînée directement sur un robot physique, sans simulation préalable ni démonstrations humaines, a été détaillée dans un article publié sur arXiv (2609.14878v1). Le système associe un contrôleur prédictif par échantillonnage (MPC) à un apprenant Soft Actor-Critic hors politique pour piloter une main robotique Allegro à 16 degrés de liberté. Concrètement, 20 trajectoires générées par le MPC sur le matériel réel, collectées en 12 minutes, servent d'abord à préremplir un buffer de rejeu et à pré-entraîner l'acteur et le critique. Pendant la phase en ligne, le MPC continue de guider la collecte de données par intermittence, tandis que le contrôle bascule progressivement vers la politique apprise. Sur une tâche de rotation continue d'objet en main, la politique atteint 100% de réussite en évaluation autonome (5 essais sur 5) après seulement 7 minutes d'apprentissage en ligne, moyennant environ trois chutes d'objet durant l'entraînement. Après 20 minutes, elle tourne plus de cinq fois plus vite que le contrôleur MPC initial et enchaîne 1000 rotations consécutives sur plus de 110 minutes sans lâcher l'objet. Ce résultat s'attaque à l'un des obstacles les plus concrets du RL en robotique: l'exploration initiale aléatoire, lente et destructrice pour le matériel réel. En ancrant l'apprentissage dans l'expérience d'un contrôleur classique plutôt que dans des démonstrations humaines téléopérées, coûteuses à produire en volume, la méthode réduit fortement le temps d'intervention et le nombre d'échecs physiques nécessaires avant d'obtenir une politique fiable. Pour les équipes travaillant sur la manipulation dextre, c'est un indice que l'apprentissage sur robot réel, longtemps jugé trop lent et risqué face au sim-to-real, peut converger en quelques dizaines de minutes sur une tâche à haute dimensionnalité, à condition de structurer l'exploration plutôt que de la laisser libre. Le résultat nuance aussi l'hypothèse selon laquelle des démonstrations humaines seraient indispensables pour amorcer ce type de politique. La démonstration reste toutefois limitée à une tâche de référence en conditions de laboratoire, sans institution ni calendrier de publication du code précisés. Les ablations montrent que le pré-entraînement MPC, la conservation de cette expérience dans le buffer et le guidage MPC en ligne apportent chacun un gain distinct et complémentaire, ce qui distingue l'approche des pipelines purement sim-to-real ou de l'apprentissage par imitation à partir de téléopération, aujourd'hui dominant dans la manipulation dextre humanoïde. Les auteurs rapportent en complément une adaptation rapide à d'autres géométries d'objets et une réorientation conditionnée par objectif, sans annoncer de partenariat industriel ni de déploiement au-delà du résultat de recherche.

RecherchePaper
1 source
Manipulation aérienne en conditions réelles : perception embarquée, apprentissage de politiques et contrôle du corps entier
3arXiv cs.RO 

Manipulation aérienne en conditions réelles : perception embarquée, apprentissage de politiques et contrôle du corps entier

Des chercheurs présentent, dans un article publié sur arXiv (référence 2609.30521, mis en ligne le 28 septembre 2026), un système de manipulation aérienne en extérieur combinant apprentissage par imitation, estimation d'état embarquée et commande prédictive corps entier. Une Diffusion Policy, entraînée à partir de démonstrations, génère les trajectoires souhaitées de l'effecteur terminal à partir des seules observations embarquées, que traduit ensuite un contrôleur MPC "whole-body" coordonnant conjointement la plateforme volante et le bras manipulateur. Pour s'affranchir des systèmes de capture de mouvement externes habituellement requis en intérieur, la localisation repose uniquement sur une odométrie LiDAR-inertielle embarquée. Le framework a été validé sur un manipulateur aérien physique, avec exécution réussie de tâches de manipulation en extérieur, en conditions non contrôlées. Cette démonstration s'attaque à un verrou classique: la plupart des systèmes de manipulation par drone publiés jusqu'ici dépendent de salles équipées de capture de mouvement (type Vicon ou OptiTrack), ce qui cantonne les résultats au laboratoire et limite leur pertinence pour l'inspection d'infrastructures, la maintenance en hauteur ou la préhension en extérieur. En couplant une politique apprise par imitation, dans l'esprit des approches VLA qui gagnent du terrain côté robots terrestres et humanoïdes, à une commande MPC robuste aux perturbations externes comme le vent, les auteurs apportent un indice supplémentaire que l'apprentissage par démonstration peut sortir du cadre contrôlé sans sacrifier la stabilité de vol. Pour les intégrateurs qui envisagent des drones manipulateurs industriels, le travail reste toutefois un prototype de recherche validé sur un nombre limité de tâches, pas un produit commercial. La manipulation aérienne est un champ de recherche actif depuis plusieurs années, mais la quasi-totalité des démonstrations publiées restait jusqu'ici confinée à des environnements intérieurs instrumentés. L'article s'inscrit dans une tendance plus large de transfert des politiques apprises par imitation, popularisées sur des bras fixes et des humanoïdes terrestres, vers des plateformes aériennes mobiles, où l'absence d'infrastructure de localisation et les perturbations externes compliquent fortement le problème. Aucune date de déploiement industriel ni partenariat commercial n'est mentionné: il s'agit d'un travail académique dont les auteurs indiquent vouloir étendre, à l'avenir, le nombre et la diversité des tâches testées en conditions réelles extérieures.

RecherchePaper
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
4arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source