Aller au contenu principal
RecherchearXiv cs.RO 

ReDex : réparer les politiques dextérité sim-vers-réel par une interaction compliante au niveau des doigts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv ReDex, un cadre pour corriger sur matériel réel des politiques de manipulation dextre entraînées en simulation. Le point de départ est une politique de base qui n'utilise que la proprioception. Pendant des déploiements réels, un opérateur humain corrige physiquement les échecs de contact sur certains doigts, sous contrôle en compliance, tandis que la politique de base, gelée, continue de piloter les autres doigts. Chaque essai enregistre trois choses : l'exécution de la politique, les mouvements corrigés par l'humain et les forces mesurées aux bouts des doigts. Les auteurs reconstruisent à partir de ces données des cibles tenant compte des forces. Ils entraînent ensuite par clonage comportemental une politique autonome conditionnée par la force. Les tests portent sur deux tâches riches en contacts, sur matériel réel. Le retournement d'objet passe de 14 % à 86 % de réussite sur deux objets. La rotation de tournevis passe de 26,0 % à 95,3 % de progression moyenne sur trois objets.

L'intérêt tient à la méthode. Le transfert simulation-réalité reste fragile pour la dextérité, surtout à cause du timing des contacts et de la régulation des forces, que les simulateurs modélisent mal. ReDex part du constat que ces politiques gardent une coordination multi-doigts utile et qu'il suffit de réparer localement les contacts défaillants. L'approche évite aussi deux coûts habituels. Elle n'exige pas de simulation tactile, difficile à calibrer. Elle n'exige pas non plus de téléopération complète de la main, lourde et chère en temps opérateur. La correction ciblée d'un ou deux doigts réduit l'effort humain, et la politique finale ajoute un retour de force à un système initialement aveugle au toucher. Pour les équipes qui développent des mains dextres, c'est une piste réaliste pour combler l'écart entre démonstration et fiabilité réelle. Les réserves sont claires. Le résultat repose sur deux tâches, quelques objets, et un seul article non encore évalué par les pairs. Le nombre d'essais et la charge réelle de correction ne sont pas détaillés dans le résumé, et rien n'indique un test hors de ces objets.

Ce travail s'inscrit dans une tendance de fond : la dextérité des mains robotiques progresse surtout par apprentissage en simulation, puis par adaptation au réel. Le retournement d'objet et la rotation de tournevis comptent parmi les benchmarks classiques de la manipulation en main. L'autre voie, concurrente, mise sur l'apprentissage direct à partir de démonstrations téléopérées et sur des capteurs tactiles. Elle demande plus de données humaines et du matériel plus complexe. ReDex se place entre les deux, avec une supervision humaine légère et des mesures de force utilisées seulement en phase de réparation. Les prochaines étapes probables sont des tests sur davantage de tâches et d'objets, puis sur d'autres mains. Il faudra aussi voir si la méthode tient sur des séquences longues. L'article ne mentionne ni partenaire industriel, ni calendrier de déploiement, ni acteur français ou européen.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

RedFlow : corriger les échecs de politique VLA par ajustements au niveau des actions
1arXiv cs.RO 

RedFlow : corriger les échecs de politique VLA par ajustements au niveau des actions

Une équipe de recherche vient de publier RedFlow, une méthode d'apprentissage par renforcement hors ligne conçue pour corriger les politiques VLA (Vision-Language-Action) à correspondance de flux (flow-matching), de plus en plus utilisées pour le contrôle de bras manipulateurs. Ces politiques souffrent d'erreurs qui s'accumulent une fois déployées, à cause d'un décalage entre les données d'entraînement et les situations réelles rencontrées par le robot. Contrairement aux méthodes existantes qui ignorent les échecs ou ne les traitent qu'au niveau de la trajectoire entière, RedFlow agit à l'échelle de l'action individuelle grâce à deux mécanismes: un module de "mise en correspondance corrective contextuelle" qui repère les actions précises à l'origine d'un échec et va chercher, dans des contextes similaires, des alternatives qui ont réussi; et un objectif de "redirection adaptative" qui renforce les bonnes actions, pénalise les mauvaises, et redirige les échecs récupérables vers ces cibles correctives. Testée sur le benchmark LIBERO et sur trois tâches de manipulation en conditions réelles, la méthode fait passer le taux de réussite réel de 56,7% à 74,7%, tout en égalant des méthodes on-policy réputées (PPO, GRPO, DDPO) avec environ dix fois moins d'échantillons d'entraînement. L'enjeu dépasse la simple performance brute: c'est la question de l'écart entre démonstration et réalité qui est visée directement. Les politiques VLA génériques impressionnent en vidéo mais peinent souvent à récupérer proprement d'une erreur en conditions réelles, un point critique pour tout intégrateur industriel qui ne peut pas tolérer un bras robotique bloqué ou erratique sur une chaîne de production. En exploitant aussi bien les trajectoires ratées que réussies comme signal d'apprentissage dense, RedFlow répond à un vrai problème économique du déploiement: collecter des données réelles de rollout coûte cher, donc réduire d'un ordre de grandeur le volume d'échantillons nécessaires change la viabilité du fine-tuning post-déploiement à grande échelle. Ce travail s'inscrit dans la lignée des grandes politiques génératives type Pi-0, GR00T N2 ou Helix, qui ont démontré la capacité des modèles VLA à généraliser des comportements de manipulation, sans pour autant garantir une robustesse suffisante hors des conditions d'entraînement. Les approches précédentes d'apprentissage hors ligne restaient soit aveugles aux échecs, soit trop grossières pour en tirer un signal correctif exploitable; les alternatives on-policy, elles, exigent une interaction massive avec l'environnement, coûteuse à mettre en œuvre sur du matériel réel. RedFlow reste pour l'instant un résultat de recherche publié sur arXiv, sans annonce de pilote industriel ni d'intégration produit à ce stade.

RechercheOpinion
1 source
Le contexte peut-il combler l'écart de réalité ? Transfert simulation-réel des politiques sensibles au contexte
2arXiv cs.RO 

Le contexte peut-il combler l'écart de réalité ? Transfert simulation-réel des politiques sensibles au contexte

Le sim-to-real transfer, c'est-à-dire le passage d'une politique de contrôle entraînée en simulation vers un robot réel, reste l'un des obstacles majeurs de l'apprentissage par renforcement (RL) en robotique. Une équipe de recherche propose dans cet article (arXiv:2511.04249, version révisée) d'intégrer un module d'estimation du contexte, c'est-à-dire une estimation des paramètres dynamiques de l'environnement, directement dans le pipeline d'entraînement basé sur la Domain Randomization (DR). Les chercheurs comparent plusieurs stratégies de supervision de cet estimateur de contexte, considérées comme état de l'art, et évaluent les politiques résultantes sur deux terrains : un benchmark de contrôle standard en simulation, et une tâche réelle de poussée d'objet (pushing) exécutée avec un bras robotique Franka Emika Panda. L'enjeu dépasse la seule prouesse technique : la Domain Randomization, qui consiste à exposer la politique à une large gamme de dynamiques aléatoires pendant l'entraînement pour la rendre robuste, améliore le transfert vers le réel mais dégrade souvent les performances, car la politique doit rester valable pour tous les cas randomisés plutôt que de s'optimiser pour un seul. En conditionnant la politique sur une estimation du contexte plutôt qu'en l'entraînant à l'ignorer, les auteurs cherchent à réconcilier robustesse et performance, un compromis central pour quiconque déploie du RL sur du matériel réel en usine ou en logistique. Les résultats montrent que les politiques context-aware surpassent systématiquement la baseline context-agnostic sur tous les scénarios testés, ce qui confirme l'intérêt de cette approche, mais sans stratégie de supervision universelle : le choix optimal dépend de la tâche. Ce travail s'inscrit dans une lignée de recherches visant à combler l'écart de réalité (reality gap) qui limite le RL appliqué à la robotique depuis plusieurs années, la DR classique restant la référence malgré ses limites connues. En publiant une version révisée sur arXiv, les auteurs affinent une méthode déjà proposée plutôt que d'annoncer un nouveau système. La validation reste à ce stade circonscrite à une tâche de manipulation simple sur un seul bras robotique commercial ; l'étape suivante consisterait à tester la généralisation de cette approche sur des tâches plus complexes et des plateformes variées avant d'envisager une adoption industrielle.

RecherchePaper
1 source
Du jeu à la politique de contrôle : vers une collecte de données robotiques à grande échelle par interaction gamifiée sans robot
3arXiv cs.RO 

Du jeu à la politique de contrôle : vers une collecte de données robotiques à grande échelle par interaction gamifiée sans robot

Une équipe de recherche présente sur arXiv (papier 2609.18650v1, mis en ligne en septembre 2026, soumission apparemment en aveugle sans institution nommée) une méthode de collecte de données pour l'apprentissage de politiques de manipulation robotique baptisée Project Kitchen, couplée à un algorithme nommé Game2Policy. Project Kitchen est une plateforme de collecte de données égocentriques en réalité virtuelle conçue comme une expérience de jeu vidéo plutôt qu'une session classique de téléopération : l'utilisateur manipule des objets virtuels dans un environnement gamifié, sans dépendre d'un robot physique ni d'un matériel spécifique, ce qui rend les données transférables et potentiellement collectables à grande échelle via crowdsourcing. Game2Policy extrait ensuite des indices d'affordance indépendants de la morphologie du robot, notamment les points de contact et les états de sous-objectifs, à partir des trajectoires de jeu ; un modèle d'affordance est pré-entraîné sur ces données puis affiné conjointement avec les politiques robotiques finales à l'aide d'une poignée seulement de démonstrations réelles. Les auteurs rapportent des gains moyens de taux de réussite de 10,0 points en simulation et 18,3 points sur robots réels en configuration few-shot, ainsi qu'une diversité comportementale et un niveau d'engagement supérieurs selon des études utilisateurs. Ce travail cible un goulot d'étranglement central du secteur : l'entraînement de politiques de manipulation généralisables, notamment de type VLA, exige des données massives et variées, mais les démonstrations réelles restent coûteuses et les méthodes existantes sont soit liées à un robot spécifique, ce qui limite le crowdsourcing, soit mal annotées et peu diversifiées. Si l'approche tient à plus grande échelle, elle ouvrirait la voie à une collecte de données quasi illimitée via des joueurs grand public plutôt que des flottes de téléopération dédiées, réduisant potentiellement le coût d'entrée pour les intégrateurs. Les résultats restent toutefois à prendre avec prudence : ils proviennent d'un article de recherche non encore accepté, la « poignée » de démonstrations réelles n'est pas quantifiée précisément, et les gains sont mesurés sur des tâches contrôlées en cuisine simulée. La démarche s'inspire explicitement des mécanismes d'engagement à long terme des jeux vidéo pour résoudre le problème récurrent du sim-to-real et du game-to-real gap. Elle s'inscrit dans la tendance plus large consistant à exploiter des données humaines non robotiques (vidéo, VR, simulation) pour contourner la téléopération coûteuse. Les auteurs annoncent la publication de la plateforme et du code uniquement après acceptation de l'article : il s'agit donc à ce stade d'une annonce de recherche, pas d'un produit ni d'un déploiement réel.

RecherchePaper
1 source
4arXiv cs.RO 

AIM : réseaux de modélisation adaptative des interactions pour la simulation de corps mous du réel vers la simulation

Des chercheurs proposent AIM (Adaptive Interaction Modeling), un cadre de simulation de corps mous « real-to-sim » qui reconstruit à partir d'observations réelles un simulateur capable de prédire la déformation d'un objet soumis à des interactions externes. Le papier, publié sur arXiv (2610.07116), traite la simulation comme un problème de modélisation d'interactions locales et globales. AIM adapte les relations entre particules à partir de l'historique de mouvement et de la géométrie, en combinant les voisins spatiaux courants et des connexions conservées. Une communication globale conditionnée par la géométrie coordonne la réponse de l'objet entier. Une interface unifiée de points de contrôle cinématiques représente différentes configurations de manipulation, et une supervision autorégressive multi-pas entraîne le modèle sur ses propres trajectoires prédites. Sur les bancs d'essai PhysTwin et PGND, les auteurs rapportent une réduction de 20,0 % de l'erreur de suivi en prédiction future par rapport à PhysTwin, et de 22,8 % de l'erreur moyenne de particules à long horizon sur six catégories d'objets par rapport à PGND. L'enjeu touche la manipulation d'objets déformables (pliage de linge, manipulation d'aliments), où le robot doit contrôler la forme autant que la position. Un simulateur prédictif fiable permet de planifier ou d'entraîner des politiques sans multiplier les essais physiques. Le papier cible deux faiblesses connues. D'une part, le voisinage spatial peut mal représenter les dépendances de déformation, et les erreurs locales s'accumulent au fil des prédictions. D'autre part, les modèles ajustés scène par scène généralisent mal aux changements de géométrie ou de conditions de manipulation. Les auteurs affirment un transfert entre actions, instances d'objets et scènes, y compris un transfert zero-shot d'interactions robotiques vers la manipulation humaine, sans ajustement de la dynamique sur le domaine cible. Ces résultats restent des mesures de laboratoire sur des benchmarks de reconstruction. Ils ne disent rien sur un déploiement industriel, sur le coût de calcul ni sur la vitesse d'inférence, et aucun gain n'est chiffré en tâche robotique de bout en bout. AIM se situe dans la lignée des jumeaux numériques physiques appris à partir de vidéo. PhysTwin reconstruit des objets déformables à partir d'observations éparses, tandis que PGND s'appuie sur des dynamiques neuronales fondées sur les particules. Les deux servent ici de références. L'approche répond à la limite des modèles ajustés à une scène unique, qui peinent dès que l'objet ou la manipulation change. Le papier est une prépublication v1, sans relecture par les pairs, et il ne mentionne ni code, ni partenaire industriel, ni calendrier de pilote. La suite logique est une validation sur robot réel en boucle fermée, avec des objets plus variés et des contraintes de temps réel. Ces conditions décideront si ce type de simulateur sert la planification de manipulation ou reste un outil de prédiction hors ligne.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source