Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage par décomposition fréquentielle pour l'estimation du torseur d'effort sans capteur lors de contacts robotiques riches en vibrations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2604.12905, deuxième version) le Frequency-aware Decomposition Network (FDN), un réseau de neurones qui estime le torseur d'efforts (forces et couples) d'un robot sans capteur F/T, à partir de sa seule proprioception. Le modèle prédit plusieurs pas à l'avance et vise les contacts riches en vibrations, comme le meulage. Il sépare l'horizon de torseur en deux composantes. Une tendance basse fréquence est estimée par régression ponctuelle. Un résidu haute fréquence est modélisé par une distribution conditionnelle apprise. Des couches « frequency-aware » imposent une décomposition en bandes sur les sorties et amplifient de façon adaptative les amplitudes fréquentielles des entrées. Le système n'exige ni modèle de robot identifié, ni capteur F/T à l'inférence. Testé sur des données réelles de meulage issues d'un manipulateur hydraulique à 6 DOF, FDN réduit l'erreur d'amplitude haute fréquence jusqu'à 47 % face aux références, sous des retards supposés, tout en gardant une précision basse fréquence compétitive. Il estime un horizon de 1 000 ms en 11 ms sur un seul thread CPU.

Les capteurs F/T sont fragiles et coûteux, et les méthodes sans capteur actuelles se comportent comme des filtres passe-bas. Elles conviennent à la saisie ou aux interactions lentes, mais elles perdent les composantes rapides qui caractérisent le meulage, le ponçage ou le martelage. Les résultats suggèrent qu'on peut conserver ces composantes sans matériel supplémentaire. Le gain concerne la robotique de finition, la construction et la manutention lourde, où un capteur au poignet s'use vite. L'estimation multi-pas répond à un problème rarement traité : les retards de communication rendent périodiquement obsolètes les estimations lors du déploiement. Un temps d'inférence de 11 ms sur CPU laisse penser que le calcul embarqué suffit pour une boucle de contrôle. Les limites sont nettes : une seule plateforme hydraulique, des tâches de meulage, et aucune comparaison annoncée avec un capteur F/T commercial en boucle fermée. Le chiffre de 47 % porte sur l'erreur d'amplitude, pas sur la performance de la tâche.

Ces travaux prolongent l'estimation sans capteur fondée sur des modèles dynamiques identifiés ou des observateurs, puis les approches apprises, qui échouent à concilier précision ponctuelle et contenu haute fréquence. Dans une étude exploratoire, les auteurs transfèrent la dynamique de torseur apprise sur un jeu de données ouvert de manipulation quotidienne. L'erreur basse fréquence baisse de 8 %, mais la dynamique haute fréquence semble propre à chaque domaine. Cela limite la promesse d'un modèle de fondation du contact généraliste : la tendance se transfère, pas les vibrations. La suite logique serait de valider le modèle sur d'autres outils, matériaux et robots, puis de l'intégrer à un contrôle en boucle fermée. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel annoncé.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement sensible à la force : estimation hybride sans capteur pour la loco-manipulation de robots à roues et jambes
1arXiv cs.RO 

Apprentissage par renforcement sensible à la force : estimation hybride sans capteur pour la loco-manipulation de robots à roues et jambes

Un article scientifique publié sur arXiv (arXiv:2609.13779, prépublication non encore relue par les pairs) présente une méthode d'apprentissage par renforcement sensible à la force pour des robots à locomotion mixte roues-pattes effectuant simultanément déplacement et manipulation. Le système estime la force exercée par l'effecteur terminal sans capteur de force/couple dédié, en combinant trois briques : une observation du moment généralisé du robot, une projection du torseur des efforts sous contrainte de contact, et un réseau de neurones qui apprend en résiduel les biais liés au mouvement non captés par les modèles physiques. Cette estimation alimente une politique de contrôle « corps entier » conditionnée par mode, dotée d'un sélecteur axe par axe entre position et force, permettant de basculer entre mouvement libre, régulation de force pure et contrôle hybride force/position au sein d'un seul contrôleur. Les auteurs rapportent des gains en simulation sur la précision de l'estimation de force sans capteur et sur les performances de contrôle en force, puis valident l'approche sur un robot à roues-pattes réel lors de quatre tâches : rotation de valve, essuyage en mode hybride, ouverture de porte guidée par la force, et suivi à force nulle lorsqu'un humain guide le bras manuellement. Pour l'industrie, l'intérêt est d'abord économique : supprimer le capteur de force/couple dédié à l'effecteur réduit le coût, la fragilité et la maintenance des bras manipulateurs montés sur plateformes mobiles, un frein connu au déploiement des robots mobiles à bras dans des tâches à contact physique comme les vannes, les portes ou l'essuyage de surfaces. Qu'un seul contrôleur passe de façon fluide entre mouvement libre et régulation de force, sans recalibrage ni bascule manuelle de mode, répond à une limite fréquente des contrôleurs hybrides classiques sur bases flottantes à contacts changeants, typiques des plateformes combinant roues et pattes. Les gains annoncés restent toutefois qualitatifs, sans chiffres de précision ou de temps de cycle publiés dans le résumé, et les essais matériels portent sur un nombre limité de tâches et une seule plateforme, ce qui invite à la prudence avant d'en déduire une généralisation à d'autres robots ou environnements industriels. Le travail prolonge des recherches antérieures sur les observateurs de moment généralisé, déjà utilisés en robotique à pattes pour détecter des forces externes et des contacts, en les associant pour la première fois à un apprentissage par renforcement conditionné par mode sur une base mobile roues-pattes, catégorie intermédiaire entre robots à roues purs et humanoïdes bipèdes, plus rapide que la marche et plus stable que les roues seules sur terrain irrégulier. L'article ne précise ni le laboratoire ni l'industriel à l'origine des travaux, ni le nom du robot utilisé pour les essais, ce qui limite la comparaison directe avec des acteurs identifiés du secteur des plateformes hybrides. Il s'agit à ce stade d'une publication de recherche, sans annonce de produit ni de calendrier de déploiement commercial ; la suite logique évoquée serait une extension à davantage de tâches de manipulation en contact et une comparaison quantitative face à des contrôleurs équipés de capteurs de force réels.

RecherchePaper
1 source
Retargeting d'impédance par décomposition continue de variétés pour l'apprentissage par imitation à contacts riches
2arXiv cs.RO 

Retargeting d'impédance par décomposition continue de variétés pour l'apprentissage par imitation à contacts riches

CMDIR (Continuous Manifold-Decomposed Impedance Retargeting), présentée dans un article publié le 15 septembre 2026 sur arXiv (2609.15716), transforme des démonstrations à impédance fixe en contrôleurs à impédance variable continue destinés à l'apprentissage par imitation dans des tâches manipulatives à contact riche. La méthode s'appuie sur une représentation continue appelée TMIR (Task-Manifold Impedance Representation), qui associe un repère de tâche évolutif à des instructions de contrôle, et sur un module nommé Quality-to-Fast qui compile automatiquement une structure de solveur à partir de trajectoires de développement dans un espace fini prédéfini, puis certifie chaque candidat par évaluation multi-résolution. Sur 225 essais de contrôleurs retargetés répartis sur trois tâches de contact réelles, CMDIR complet améliore la rétention moyenne d'une métrique proxy de tâche et réduit l'écart de pose, les fluctuations de force et la force de pointe par rapport à MDIR discret. Une variante d'optimisation, FastMPO, affiche une accélération de 5,8 à 9,4 fois par rapport à C-MPO pour des résultats en boucle fermée comparables. Pour l'industrie robotique, ce travail s'attaque à un problème concret: la plupart des politiques apprises par imitation peinent sur les tâches de contact où la rigidité du contrôleur doit varier en continu, comme l'insertion de pièces, l'assemblage ou la manipulation d'objets fragiles, faute de quoi les forces générées deviennent instables. En montrant que l'interface complète de supervision TMIR est apprenable, et que les exécutions réussies présentent moins de fluctuations de force et une force de pointe plus faible, l'étude renforce l'idée que le contrôle d'impédance variable peut être intégré nativement dans les pipelines VLA plutôt que traité comme un module ajouté après coup. Les auteurs tempèrent toutefois eux-mêmes leurs résultats: la fiabilité de complétion des tâches reste inégale selon les tâches et environnements testés, un aveu qui tranche avec le ton parfois promotionnel du secteur et rappelle que la robustesse à l'échelle industrielle n'est pas acquise. CMDIR prolonge MDIR (Manifold-Decomposed Impedance Retargeting), dont elle étend le principe des démonstrations discrètes vers un régime continu, une évolution classique en apprentissage par imitation où chaque génération cherche à lisser les contraintes de la précédente. Le résumé ne cite aucune entreprise ni laboratoire nommément et se positionne comme une contribution méthodologique plutôt qu'un produit commercial: il s'agit d'un travail de recherche testé sur des tâches de contact réelles en conditions de laboratoire, pas d'un système déployé en usine. Le gain de vitesse de FastMPO ouvre des pistes pour rendre ces méthodes de retargeting d'impédance praticables à plus grande échelle, mais les suites attendues portent sur l'élargissement des tâches testées, l'amélioration de la fiabilité de complétion et une validation sur des plateformes industrielles avant toute adoption par des intégrateurs.

RecherchePaper
1 source
Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques
3arXiv cs.RO 

Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques

Un preprint publié sur arXiv (arXiv:2608.24741v1, août 2026) présente une méthode de Learning from Demonstration (LfD) qui modélise explicitement les interactions physiques entre un robot et son environnement, notamment la création et la rupture de contact pendant une manipulation. Un contrôleur hybride position-force suit la trajectoire démontrée par un humain jusqu'à ce que les conditions de transition liées au contact, identifiées durant cette démonstration, soient atteintes. La méthode a été validée sur un robot réel via quatre tâches riches en contacts, ouverture de portes et de serrures, prise et vissage de boulons, dégagement d'objets coincés et suivi de contour de surface, chacune apprise à partir d'une seule démonstration et sans connaissance préalable de la tâche. Cette approche tranche avec la tendance dominante de la manipulation robotique, où les modèles vision-langage-action (VLA) à grande échelle exigent des milliers de démonstrations pour généraliser. En rendant explicite la physique du contact plutôt que de la confier à un réseau de neurones opaque, les auteurs visent une interprétabilité rare dans la littérature du LfD, où l'on sait précisément pourquoi et quand le robot change de comportement. Pour des intégrateurs industriels confrontés à des tâches d'assemblage ou de maintenance à forte variabilité géométrique, comme le boulonnage ou le verrouillage, l'intérêt tient à une programmation par démonstration unique, robuste aux variations imprévues et généralisable quand ces variations sont connues à l'avance, ce qui contredit l'idée que seule l'échelle des données garantit une manipulation fiable. Le travail s'inscrit dans un courant du LfD qui, selon les auteurs, néglige généralement la modélisation explicite du contact physique, alors que celui-ci est central dans la plupart des tâches de manipulation réelles. Ils présentent leur contribution comme un moyen de combler cette lacune d'interprétabilité en apprentissage à partir de très peu d'exemples, en détaillant comment robustesse, généralisation et adaptabilité peuvent être implémentées explicitement plutôt que laissées à l'apprentissage statistique. Publié comme preprint non encore évalué par les pairs, sans indication d'institution ni de calendrier de valorisation industrielle, il se positionne comme une contribution méthodologique plutôt qu'un produit, dans un paysage de la manipulation robotique dominé par des modèles fondationnels de type VLA entraînés sur de vastes corpus de démonstrations.

RecherchePaper
1 source
Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques
4arXiv cs.RO 

Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques

Une équipe de recherche propose une nouvelle méthode de tokenisation d'action baptisée BAAT, pour Behavior-Aligned Action Tokenization, décrite dans un preprint publié sur arXiv fin septembre 2026 (identifiant 2609.27513v1). Le travail cible un maillon technique précis des politiques robotiques autorégressives, ces systèmes qui apprennent le contrôle continu en prédisant des tokens d'action discrets à partir des observations visuelles: les tokenizers existants n'imposent aucune supervision explicite de la correspondance comportementale entre démonstrations, si bien que des mouvements similaires exécutés à des rythmes différents finissent par occuper des représentations distinctes. BAAT résout ce problème en utilisant le soft dynamic time warping, ou Soft-DTW, pour identifier des segments d'action correspondants entre tâches et aligner leurs coordonnées quantifiées conjointement avec l'objectif de reconstruction. Un décodeur par diffusion conditionné par l'historique reconstruit ensuite des séquences d'action continues à partir de ces tokens, sur lesquelles une politique autorégressive est entraînée en aval. Évaluée sur des tâches sélectionnées issues de trois benchmarks de simulation et sur deux tâches en robot réel, la méthode atteint un taux de succès moyen d'environ 45,2% en simulation, soit 7,2 points de pourcentage au-dessus de la référence OAT. Dans une ablation contrôlée sur le benchmark LIBERO-All, le taux de succès de la politique passe de 70,2% à 79,0% lorsque l'alignement comportemental est activé, au prix d'une légère baisse du succès de rejeu de trajectoire. Pour les équipes qui conçoivent des politiques de manipulation robotique, ce résultat s'attaque à un goulot d'étranglement souvent sous-estimé des architectures vision-langage-action: la qualité de la tokenisation en amont conditionne directement ce qu'une politique autorégressive peut apprendre en aval, indépendamment de la taille du modèle ou du volume de données. En montrant qu'une supervision explicite de la correspondance entre mouvements améliore le transfert entre tâches sans sacrifier la précision d'exécution, les auteurs apportent un argument empirique en faveur d'une meilleure structuration de l'espace de représentation des actions, plutôt que du seul passage à l'échelle des données ou des paramètres. Le gain de neuf points de succès en ablation contrôlée reste toutefois mesuré sur un seul benchmark, et l'écart de 7,2 points face à OAT en simulation, bien réel, ne dit rien de la généralisation à des environnements physiques variés ni à des embarquements industriels. Le point de comparaison retenu, OAT, sert de référence pour situer BAAT dans la lignée des travaux récents sur les tokenizers d'action pour politiques robotiques, un axe de recherche actif depuis l'essor des modèles VLA de type Pi-0 ou GR00T N2, qui reposent tous sur une étape de discrétisation des actions continues. Le papier reste à ce stade un résultat académique en préimpression, validé sur des sous-ensembles de tâches de trois benchmarks de simulation plus deux essais sur robot réel, sans indication de déploiement industriel, de partenariat ou de mise à disposition de code. Les auteurs présentent leurs résultats comme un argument en faveur de la correspondance comportementale comme signal de supervision pour organiser la structure de mouvement partagée dans les tokenizers d'action, une piste que d'autres laboratoires pourraient chercher à répliquer sur des benchmarks plus larges avant toute validation en conditions réelles.

RecherchePaper
1 source