Aller au contenu principal
RecherchearXiv cs.RO 

DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25631v1) DynaForge, un framework destiné à générer automatiquement des démonstrations de manipulation dynamique d'objets pour l'entraînement de politiques robotiques par apprentissage par imitation. Le système combine une planification globale à basse fréquence avec une cinématique inverse centrée sur l'objet à haute fréquence, puis applique une politique résiduelle pour corriger les actions au moment critique du contact. Un curriculum implicite regroupe les tentatives par conditions similaires et privilégie les lots à succès mixte, concentrant l'apprentissage par renforcement résiduel sur la frontière de compétence en évolution. Sur les tâches Can et Bottle, DynaForge nécessite 0,73 fois moins d'étapes d'optimisation que l'algorithme GRPO standard pour un budget d'étapes d'environnement identique, avec un taux de succès final supérieur. Sur neuf tâches de simulation, le taux moyen de génération de démonstrations réussies passe de 41,30% avec la seule planification a priori à 78,37% avec DynaForge. Avec 800 démonstrations par tâche, des politiques DP3 entraînées sur ces données atteignent 49,11% de succès moyen, contre 7,07% pour des données générées par la méthode concurrente DOMINO. Sur trois tâches dynamiques réelles, les politiques entraînées avec DynaForge obtiennent entre 30% et 60% de succès, contre 0% à 10% pour celles issues de DOMINO.

La manipulation dynamique, lancer, attraper au vol, gestes exigeant une réaction rapide au contact, reste un point faible des pipelines d'apprentissage par imitation, car les démonstrations générées automatiquement échouent souvent près du contact ou simplifient excessivement l'interaction physique, comme le fait le rejeu à la DOMINO. En améliorant nettement le taux de génération de démonstrations exploitables tout en réduisant le coût de calcul par rapport à des méthodes de renforcement classiques comme GRPO, DynaForge s'attaque directement au goulot d'étranglement des données qui freine l'entraînement de politiques à grande échelle, qu'il s'agisse de politiques de diffusion comme DP3 ou de modèles vision-langage-action plus larges. L'écart de 20 à 50 points de succès observé en conditions réelles suggère que ces démonstrations reflètent mieux la dynamique physique que les méthodes précédentes, un enjeu central pour les intégrateurs qui cherchent à transférer des politiques entraînées en simulation vers du matériel réel sans réentraînement coûteux.

DynaForge se positionne explicitement face à deux familles de méthodes existantes: les approches purement basées sur la planification, sujettes à l'échec au moment du contact, et DOMINO, qui simplifie les interactions dynamiques au prix du réalisme. Le recours à GRPO, algorithme d'optimisation de politique par groupe popularisé dans l'entraînement de modèles de langage, illustre la porosité croissante entre techniques de renforcement issues du traitement du langage et robotique. Le résumé ne précise ni affiliation institutionnelle ni disponibilité du code, et la validation réelle reste limitée à trois tâches sans détail sur le nombre d'essais, ce qui invite à la prudence avant toute extrapolation à un déploiement industriel.

À lire aussi

Auto-apprentissage à partir de démonstrations générées automatiquement pour la manipulation robotique visuelle
1arXiv cs.RO 

Auto-apprentissage à partir de démonstrations générées automatiquement pour la manipulation robotique visuelle

Un preprint publie sur arXiv le 11 aout 2026 (2608.07553) décrit une méthode d'apprentissage auto-supervise pour la manipulation robotique visuelle, dans laquelle le robot génère lui-même ses démonstrations autour d'une pose cible au lieu de dépendre d'une téléopération humaine ou d'un enseignement kinesthésique. Le pipeline, base sur ROS 2 et le simulateur Isaac Sim, produit des paires image-pose étiquetées sans calibration extrinsèque explicite entre camera et robot, avec deux jeux de données distincts, l'un pour l'affinage planaire, l'autre pour l'approche grossière en trois dimensions. Un réseau convolutif régressé la translation et la rotation relatives a partir d'une seule image RGB montee au poignet, et pilote un contrôleur grossier-vers-fin qui approche d'abord l'objet puis affine l'alignement final. Teste en simulation et sur un bras collaboratif réel UR5e équipe d'une pince et d'une camera monoculaire, le système réduit la dispersion planaire finale de 9,69 mm a 5,38 mm en simulation, et atteint en conditions réelles des taux de réussite de préhension de 66,6% et 63,6% sur deux des trois objets testes sans rotation, avec une robustesse partielle en cas de rotation. Cette approche cible un goulot d'étranglement connu de l'industrie: la plupart des pipelines de manipulation exigent une programmation spécifique a l'objet, une annotation manuelle ou une calibration camera-robot précise, ce qui freine le déploiement chez les intégrateurs. En générant ses propres démonstrations en simulation avant transfert vers le réel, la méthode réduit l'effort de mise en place, un argument qui parle directement aux intégrateurs voulant éviter des phases de téléopération couteuses. Les résultats restent toutefois modestes, avec des taux de réussite de 63 a 67% sur seulement trois objets, et les auteurs reconnaissent eux-mêmes des difficultés persistantes en prédiction de profondeur et en généralisation. Le travail se positionne ainsi en contrepoint des modèles de fondation VLA massifs de type GR00T N2 ou Pi-0: une alternative plus légère, ciblée sur une tache étroite, sans la promesse de généralisation zero-shot de ces derniers. Le papier s'inscrit dans une lignée académique de recherches sur le transfert sim-to-real et la génération automatique de données d'entrainement, sans affiliation industrielle mise en avant ni partenariat commercial annonce. Aucun pilote ni calendrier de déploiement n'est mentionne: les auteurs présentent ces travaux comme une preuve de concept, les prochaines étapes évoquées portant sur l'amélioration de l'estimation de profondeur et l'extension a un plus grand nombre d'objets avant d'envisager une application industrielle plus large.

RecherchePaper
1 source
RDGen : génération de démonstrations pour l'apprentissage robotique par renforcement
2arXiv cs.RO 

RDGen : génération de démonstrations pour l'apprentissage robotique par renforcement

Une équipe de chercheurs a publié le 30 mai 2026 sur arXiv (référence 2605.30957) un framework appelé RDGen, pour "Reinforcement Learning Demonstration Generation", destiné à automatiser la collecte de données d'entraînement pour les modèles Vision-Language-Action (VLA). Le système combine trois composants : un module d'analyse de tâches basé sur un modèle de langage visuel (VLM), un localisateur d'objets fondé sur Grounding DINO, et une politique de contrôle entraînée par apprentissage par renforcement (RL) en simulation puis transférée sur un robot réel. Testé sur une tâche de saisie et de dépose, RDGen atteint un taux de succès élevé après transfert sim-to-real, sans que les auteurs ne publient de chiffre précis dans le résumé disponible. Les trajectoires générées sont ensuite réutilisées directement comme données d'entraînement pour affiner des politiques VLA en aval. L'enjeu central est celui du goulot d'étranglement dans la chaîne d'entraînement des robots généralistes : la télé-opération humaine, méthode dominante pour collecter des démonstrations, est lente, coûteuse, et produit des trajectoires variables selon l'opérateur. RDGen propose de substituer cet effort humain par une politique RL, qui génère des trajectoires mécaniquement cohérentes et reproductibles, plus lisses selon les auteurs que ce que produit un opérateur humain, et avec un coût marginal quasi nul en simulation. Cela renforce l'hypothèse que le problème sim-to-real pour des tâches de manipulation simples est largement résolu, et déplace la question vers la scalabilité de la diversité des tâches plutôt que la qualité individuelle des démos. RDGen s'inscrit dans un débat actif sur la meilleure façon d'alimenter les VLA, dont les architectures de référence actuelles incluent pi0 (Physical Intelligence), OpenVLA et les travaux de RT-2/RT-X chez Google DeepMind. La collecte de données reste le principal frein industriel à leur déploiement, ce que tentent aussi d'adresser des approches concurrentes comme la génération vidéo synthétique (ex. travaux UniSim, Genie) ou l'augmentation par world models. La contribution de RDGen est plus modeste et ciblée : un pipeline sim-to-real structuré pour des tâches de manipulation définies, avec réutilisation des rollouts réussis. Il s'agit d'un preprint non encore peer-reviewed ; les expériences restent limitées à pick-and-place, et l'absence de métriques quantitatives précises dans le résumé invite à attendre la version complète avant d'en tirer des conclusions générales sur la scalabilité.

RechercheOpinion
1 source
ActivePusher : apprentissage actif et planification par physique résiduelle pour la manipulation non-préhensile
3arXiv cs.RO 

ActivePusher : apprentissage actif et planification par physique résiduelle pour la manipulation non-préhensile

Une équipe de recherche du laboratoire elpis-lab a publié sur arXiv en juin 2025 (identifiant 2506.04646, désormais à sa quatrième révision) un framework baptisé ActivePusher, dédié à la manipulation non-préhensile, c'est-à-dire le déplacement d'objets par poussée ou roulement, sans saisie. L'approche combine deux blocs techniques : un modèle de dynamique par physique résiduelle, qui superpose un correctif appris par réseau de neurones à un modèle physique analytique de base, et un mécanisme d'apprentissage actif guidé par l'incertitude, qui oriente automatiquement la collecte de données vers les paramètres de compétence les moins bien couverts. Le framework s'intègre avec des planificateurs kinodynamiques à base de modèle, en pondérant l'échantillonnage de commandes selon les zones de faible incertitude du modèle appris. Les auteurs valident l'approche en simulation et sur robot réel, avec des taux de succès de planification supérieurs aux méthodes de référence, à volume de données d'entraînement égal. L'enjeu est significatif pour les intégrateurs et équipes R&D travaillant sur la manipulation en environnement non structuré. La manipulation non-préhensile reste un goulot d'étranglement dans de nombreuses lignes d'assemblage et de tri, précisément parce que les modèles analytiques (friction, contact multipoint) sont difficiles à calibrer et fragiles face aux variations de surface ou de géométrie. ActivePusher attaque ce problème sous deux angles simultanément : réduire le coût de collecte de données en évitant les interactions aléatoires peu informatives, et rendre la planification longue-portée plus fiable en évitant les régions d'incertitude élevée. C'est une réponse directe au "sim-to-real gap" structurel qui plombe les déploiements industriels de bras manipulateurs sur tâches de contact. La manipulation non-préhensile est un axe de recherche actif depuis les travaux fondateurs sur la mécanique du contact des années 1990, mais les approches purement analytiques ont montré leurs limites face à la variabilité du monde réel. Des frameworks comme MPPI (Model Predictive Path Integral) ou les planificateurs kinodynamiques basés sur des modèles appris (travaux de Karol Hausman, Pieter Abbeel) forment le paysage concurrent direct. ActivePusher se distingue par le couplage explicite entre acquisition active et planification, là où la plupart des approches traitent ces deux problèmes séparément. Le code source est disponible publiquement sur GitHub (elpis-lab/ActivePusher), ce qui devrait favoriser la reproductibilité. Aucun partenaire industriel ni timeline de transfert n'est mentionné : il s'agit d'une contribution académique, sans déploiement annoncé à ce stade.

RecherchePaper
1 source
AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique
4arXiv cs.RO 

AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique

Des chercheurs proposent AffordTrajDP, un nouveau framework d'apprentissage par imitation guidé par affordances pour la manipulation robotique, publié en préprint sur arXiv début août 2026. Contrairement aux approches classiques qui figent un point de contact statique entre l'effecteur et l'objet cible, ce système construit une trajectoire d'affordance dynamique : à partir d'une observation RGB-D, un point d'ancrage est propagé dans le temps en suivant la pose SE(3) de l'objet, ce qui donne une guidance cohérente tout au long du geste plutôt qu'une simple instruction figée en début de tâche. Sur le benchmark simulé ManiSkill3, la méthode atteint un taux de réussite moyen de 70,0 %, soit jusqu'à 17,8 points de mieux que les meilleures méthodes concurrentes. Des essais en conditions réelles ont été menés sur des bras robotiques Galaxea A1 et UR7e, sur six tâches de précision (empilement de cubes, prise de gobelet, insertion d'adaptateur, anneau sur tige, dépôt en bol, insertion USB), avec des tests sur objets vus et non vus pour le bras Galaxea A1. L'enjeu dépasse la simple performance chiffrée : les affordances statiques dérivent souvent après le contact initial, surtout dans les tâches de précision ou quand la position de l'objet varie légèrement, un problème classique de fossé entre démonstration en labo et robustesse en conditions réelles. En rendant la guidance sensible à l'état de l'objet plutôt qu'à un point fixe défini à l'avance, AffordTrajDP s'attaque directement à ce goulot d'étranglement, un signal pertinent pour les intégrateurs qui cherchent des politiques visuo-motrices capables de tolérer le désordre réel d'un poste de production ou d'entrepôt, plutôt que des démonstrations calibrées en environnement contrôlé. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation guidées par affordances, qui cherchent à compresser la perception visuelle en contraintes géométriques exploitables pour réduire les besoins en données d'entraînement. Les auteurs présentent des ablations pour isoler la contribution de chaque composant du système. À ce stade, il s'agit d'un résultat de recherche en préprint, non d'un produit commercial ni d'un déploiement industriel annoncé.

RecherchePaper
1 source