Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage par imitation régularisé par l'énergie pour une manipulation robotique sensible à la force et au travail

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sous la référence arXiv:2609.18164v1, intitulé « Energy-Regularized Imitation Learning for Force- and Work-Aware Robotic Manipulation », décrit une méthode pour réduire la dépense énergétique des politiques de manipulation robotique. Les auteurs définissent un indicateur de travail mécanique dans l'espace articulaire, calculé à partir du couple moteur et du déplacement angulaire, puis entraînent un prédicteur différentiable estimant ce travail à partir des états et actions du robot. Ce prédicteur sert de régularisateur pour affiner par imitation la politique RVT-2, testée sur le simulateur RLBench sur douze tâches de manipulation : contact avec des objets, mécanismes articulés, placement, poussée et balayage. Le travail mécanique moyen recule de 208,8 à 204,4 joules, soit -2,1%, tandis que le taux de réussite moyen progresse de 86,2% à 86,9%.

La baisse d'énergie est modeste, mais le principe est exploitable industriellement : pénaliser les mouvements physiquement coûteux, accélérations inutiles ou efforts excessifs, sans construire de modèle de dynamique différentiable complet ni recourir à des simulateurs physiques lourds. Pour les intégrateurs de bras industriels ou de robots mobiles manipulateurs, l'intérêt porte sur l'autonomie en usage réel : moins d'usure mécanique, moins de consommation batterie et de chaleur dissipée sur des cycles répétitifs, sans perte de performance ni surcoût de calcul à l'entraînement. Le fait que le taux de succès progresse en même temps que l'énergie baisse contredit l'idée que l'efficacité énergétique se paierait en performance, un point que les fournisseurs de modèles VLA devront démontrer plutôt que supposer.

Le travail s'inscrit dans la lignée des politiques de manipulation apprises par imitation à partir de modèles pré-entraînés, dont RVT-2 (Robotic View Transformer 2) est une itération récente, évaluée sur RLBench, le benchmark de manipulation développé à l'Imperial College de Londres. Contrairement aux approches qui intègrent un modèle de dynamique différentiable complet, coûteuses et fragiles sur les tâches à contact riche, les auteurs le contournent par une approximation différentiable apprise à partir des seules données de simulation. L'étude reste cantonnée à un environnement simulé et à une seule architecture ; sa transposition à des robots réels, à d'autres modèles VLA comme Pi-0, GR00T N2 ou Helix, ou à des tâches industrielles à cycle long, reste à démontrer.

À lire aussi

Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude
1arXiv cs.RO 

Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude

Une nouvelle version (v2) de l'article arXiv:2410.24035 propose un cadre de politique adaptatif au contexte pour la manipulation robotique, combinant robustesse et réactivité. Les auteurs s'appuient sur l'apprentissage par démonstration (Learning from Demonstration, LfD), et plus précisément sur les approches basées sur des systèmes dynamiques (DS), pour apprendre une politique conditionnée à la fois par l'état du robot et par des paramètres de tâche de basse dimension représentant le contexte environnant. Cette politique est ensuite combinée à des politiques additionnelles sensibles à l'incertitude via une formulation de type mélange d'experts (Mixture of Experts, MoE). Le système est validé sur le jeu de données de référence LASA handwriting, utilisé classiquement pour évaluer l'apprentissage de trajectoires, ainsi que sur un robot réel à 7 degrés de liberté (7-DoF), dans trois scénarios concrets : la saisie conditionnée par la force appliquée, la manipulation d'aliments déformables, et la saisie centrée sur l'objet. L'enjeu technique visé est précis : les approches DS de l'état de l'art excellent généralement en robustesse mais restent rigides face aux variations de contexte, car elles ne modulent pas leur comportement selon des variables dépendantes de la tâche. En articulant fusion de politiques et quantification d'incertitude, ce cadre cherche à améliorer le comportement hors distribution (out-of-distribution) et la convergence des trajectoires générées, deux propriétés critiques pour tout déploiement en environnement réel non contrôlé. Pour les intégrateurs robotiques, l'intérêt pratique tient surtout à la manipulation d'objets déformables, un cas d'usage encore mal résolu dans l'industrie (agroalimentaire, logistique), et à la promesse d'une politique réutilisable sans réentraînement complet à chaque changement de tâche ou d'environnement. Sur le plan du contexte scientifique, le LfD via systèmes dynamiques est un axe de recherche établi depuis plusieurs années pour produire des politiques de contrôle réactives en robotique. Ce travail se positionne comme une extension de recherches antérieures sur la fusion de politiques et l'estimation d'incertitude, plutôt que comme une rupture méthodologique. L'abstract ne mentionne ni laboratoire ni entreprise associée, et il s'agit d'une publication académique (statut « replace », donc une révision d'un article déjà soumis) sans indication de déploiement industriel à ce stade.

RecherchePaper
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
2arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique
3arXiv cs.RO 

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.15560v1) une méthode baptisée ReForce, conçue pour la manipulation dextre par robot à partir de démonstrations humaines. Le problème visé est le suivant: les pipelines de retargeting (transfert des mouvements humains vers un bras ou une main robotique) restent aujourd'hui essentiellement cinématiques, c'est-à-dire qu'ils copient les trajectoires et postures sans tenir compte des forces de contact, alors que ce sont ces forces qui déterminent la réussite ou l'échec d'une prise en main. ReForce ajoute un résidu de force au-dessus du mouvement retargeté classiquement, calculé par un "force tracker" générique entraîné sur un grand volume d'interactions simulées. La méthode fonctionne en deux modes: téléopération en ligne avec retour de force, et traduction hors ligne de jeux de données de démonstration déjà enregistrés. Les tests, menés à la fois en simulation et sur du matériel réel, portent sur des tâches réputées difficiles car riches en contacts fins: la saisie d'un gobelet en papier et la manipulation de pinces (tongs). Les auteurs rapportent une erreur de suivi de force réduite et un engagement multi-doigts plus stable que les approches purement cinématiques. Pour l'industrie robotique, l'enjeu dépasse le simple gain de précision: la collecte de démonstrations humaines à grande échelle est devenue le principal levier pour entraîner des politiques de manipulation dextre, y compris pour les modèles vision-langage-action. Si le retargeting cinématique ignore la force, les données transmises aux modèles encodent des gestes visuellement corrects mais mécaniquement approximatifs, ce qui explique en partie pourquoi certaines démonstrations impressionnantes en vidéo échouent lors d'un déploiement réel sur objets fragiles, déformables ou glissants. En introduisant un modèle de force générique et transférable, ReForce propose une brique technique susceptible d'améliorer la qualité des jeux de données de téléopération en amont, plutôt que de complexifier uniquement le modèle final. Il s'agit d'une contribution académique en preprint, sans entreprise ni produit commercial associé, à distinguer des annonces de Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), qui portent sur des modèles de bout en bout déployés ou pilotés en conditions réelles. ReForce se positionne en amont de ces systèmes, sur la brique de collecte et de conversion de données de démonstration. L'abstract ne mentionne ni publication de code, ni jeu de données ouvert, ni calendrier de déploiement industriel: les deux tâches testées, prise de gobelet et manipulation de pinces, servent de preuve de concept plutôt que de benchmark étendu, la validation à plus grande échelle restant à faire.

RecherchePaper
1 source
IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force
4arXiv cs.RO 

IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force

Une équipe de recherche a publié le 12 juin 2026 sur arXiv (référence 2606.10818) IMPACT, un framework d'apprentissage pour la manipulation robotique dite "forceful", c'est-à-dire impliquant des interactions physiques avec l'environnement : utilisation d'outils de masses variables, transport d'objets lourds, nettoyage de surface par contact prolongé. L'architecture découple le problème en deux blocs distincts : un planificateur de tâche de haut niveau, et un contrôleur prédictif basé sur un modèle interne (internal-model predictive control). Les expériences sont menées à la fois en simulation et sur robot réel, avec évaluation sur des objets non vus lors de l'entraînement. Les auteurs ne publient pas encore les métriques quantitatives précises dans l'abstract arXiv disponible, ce qui limite l'analyse indépendante à ce stade. Le verrou technique adressé est réel et sous-estimé dans les pipelines d'imitation learning actuels. Deux stratégies dominent aujourd'hui : la première laisse les forces émerger implicitement via les erreurs de suivi d'un contrôleur d'impédance, ce qui casse la généralisation dès que la masse de l'objet change ; la seconde commande explicitement les efforts via capteur force/couple ou capteur tactile au poignet, ce qui fonctionne mais alourdit l'intégration matérielle et fragilise les déploiements industriels. IMPACT propose une troisième voie en apprenant un modèle interne de la dynamique de contact, permettant au contrôleur prédictif d'anticiper les forces sans capteur dédié ni dégradation de généralisation. Les gains annoncés en taux de succès, sécurité et efficacité énergétique sont cohérents avec l'approche, mais restent à valider sur des benchmarks standardisés comme DROID ou RoboAgent. Ce travail s'inscrit dans un courant actif qui cherche à marier l'apprentissage par imitation avec les garanties du contrôle prédictif (MPC), après des travaux fondateurs comme ILC, DMP, et plus récemment les architectures VLA de type pi0 (Physical Intelligence) ou RoboDiff. Le problème de la manipulation forcée reste un angle mort des démos grand public, qui privilégient les tâches de pick-and-place sur objets légers. Les concurrents directs incluent les approches sim-to-real de CMU (DexVIP, ACT), d'ETH Zurich (ANYmal) et les travaux de Boston Dynamics Research sur la manipulation lourde. Côté européen, aucun acteur n'est directement cité, mais les travaux de Wandercraft et Enchanted Tools sur la dynamique de contact pourraient bénéficier de ce type de framework. La prochaine étape naturelle serait une validation sur manipulateurs industriels (UR, Franka) en conditions de production réelle.

RecherchePaper
1 source