Aller au contenu principal
Wrench-ACT : améliorer les politiques robotiques pour les tâches riches en contacts grâce au contrôle direct des torseurs d'effort
RecherchearXiv cs.RO 

Wrench-ACT : améliorer les politiques robotiques pour les tâches riches en contacts grâce au contrôle direct des torseurs d'effort

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Wrench-ACT, une politique d'apprentissage par imitation qui prédit des « wrenches » (torseurs effort/couple, soit force et moment) comme unique sortie d'action, transmises directement à un contrôleur de force pur. L'architecture de base est ACT (Action Chunking with Transformers). Les modèles sont entraînés tâche par tâche sur des démonstrations bilatérales de wrenches, puis évalués sur cinq tâches de manipulation riche en contacts. Selon les auteurs, la politique égale ou dépasse les références fondées sur la position sur les cinq tâches, avec des gains variables selon le degré de régulation délibérée de la force que chaque tâche exige. Des ablations croisées indiquent que l'interface de collecte bilatérale et l'espace d'action en wrenches contribuent chacun de façon indépendante à la performance. Plus de 1000 démonstrations en wrenches seront publiées sur un site compagnon à la parution. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Le résumé ne donne ni taux de réussite chiffrés, ni robot utilisé, ni description précise des tâches.

L'enjeu est de sortir du paradigme dominant, où les politiques apprises (ACT, Diffusion Policy, et la plupart des VLA) prédisent des positions ou des poses cibles. Même quand la force est mesurée, elle sert souvent d'observation seule, ou bien elle est prédite puis exécutée par un contrôleur hybride force/position. Ici, la politique pilote directement l'interaction physique. Le résultat le plus utile pour un intégrateur porte sur les données. La qualité de la démonstration dépend de la téléopération à retour d'effort, qui capte la régulation volontaire de la force par l'opérateur. Une téléopération purement cinématique ne la capte pas. Cela pèse sur les cas d'usage industriels comme l'assemblage, l'insertion, le ponçage ou le polissage, où la position seule est fragile. Cela suggère aussi que le goulot d'étranglement se déplace vers l'instrumentation de la collecte, avec des maîtres à retour de force plus coûteux et plus complexes que les manettes ou les exosquelettes courants. Un bémol s'impose : les gains restent modestes sur les tâches qui demandent peu de contrôle de force, et on ne sait pas si l'approche se généralise au-delà de modèles mono-tâche.

Ce travail s'inscrit dans le prolongement d'ACT, popularisé par les plateformes ALOHA, et des efforts pour ajouter le toucher et la force aux politiques visuo-motrices. Il se place face aux approches hybrides et aux VLA généralistes, qui restent surtout centrés sur la position. La diffusion du jeu de données pourra servir de référence commune si sa qualité se confirme. Les prochaines étapes à surveiller sont les tests multi-tâches, l'intégration dans des modèles de fondation et des essais sur des lignes industrielles réelles.

Dans nos dossiers

À lire aussi

TACTIC : comprendre les encodeurs tactiles et le conditionnement pour les politiques de manipulation robotique en contact riche
1arXiv cs.RO 

TACTIC : comprendre les encodeurs tactiles et le conditionnement pour les politiques de manipulation robotique en contact riche

Une équipe de recherche en robotique publie une étude comparative à grande échelle sur les encodeurs tactiles utilisés dans les politiques de manipulation robotique riches en contacts, dans un article intitulé « TACTIC: Understanding Tactile Encoders and Conditioning for Contact-rich Robot Manipulation Policies », mis en ligne sur arXiv sous la référence 2609.30969v1. Les auteurs comparent plusieurs architectures d'encodeurs tactiles fondées sur des capteurs tactiles à vision (des capteurs qui traduisent la déformation au contact en image, permettant de réutiliser directement les encodeurs de vision par ordinateur existants), ainsi que différentes stratégies de fusion entre signal visuel et signal tactile. Pour garantir une comparaison rigoureuse, tous les modèles sont entraînés et évalués avec le même pipeline et le même protocole expérimental, sur plus de 2000 essais réels effectués sur robot, couvrant plusieurs tâches de manipulation impliquant un contact physique important avec l'environnement. Le résultat principal contredit l'idée d'une solution universelle : il n'existe pas de représentation ni de stratégie de fusion optimale de manière générale pour encoder conjointement l'information tactile et visuelle, le meilleur choix d'architecture et de schéma de fusion dépendant fortement de la tâche à accomplir. Pour les intégrateurs et les équipes qui développent des politiques de manipulation fondées sur des modèles vision-langage-action ou de l'apprentissage par imitation, ce constat signifie qu'aucune recette standard ne peut être copiée d'un projet à l'autre : le choix de l'encodeur tactile doit être réévalué selon l'application, qu'il s'agisse d'insertion de précision, de manipulation d'objets déformables ou de préhension en aveugle. L'étude rappelle aussi un point méthodologique pour le secteur : les comparaisons menées uniquement en simulation, fréquentes dans la littérature, ne se transposent pas nécessairement au monde réel, où des évaluations à grande échelle restent nécessaires pour obtenir des statistiques fiables. Ce travail s'inscrit dans un contexte où les capteurs tactiles à vision se sont largement diffusés en recherche robotique, justement parce qu'ils permettent de réutiliser des encodeurs de vision déjà matures, ce qui a entraîné une prolifération d'architectures, de jeux de données d'entraînement et de protocoles d'évaluation différents d'un laboratoire à l'autre, rendant les résultats difficiles à comparer. En proposant un protocole commun et une base de plus de 2000 essais réels, les auteurs visent à établir un point de référence partagé pour le domaine, dans la lignée des efforts récents autour des politiques généralistes de manipulation qui cherchent à combiner vision, langage et désormais toucher. L'article ne mentionne ni calendrier de déploiement ni partenaire industriel : il s'agit d'une contribution de recherche destinée à orienter les choix de conception futurs, pas d'un produit prêt à déployer.

RecherchePaper
1 source
2arXiv cs.RO 

Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques

Une équipe de chercheurs publie sur arXiv (v1, septembre 2026) une méthode baptisée « skill-space shooting », conçue pour permettre à un robot déployé de corriger seul les échecs de sa politique de contrôle, sans que l'humain ait à démontrer chaque correction. Le principe repose sur un modèle de fondation, qui guide l'exploration de corrections à travers des compétences courtes et réutilisables (les « skills »). Ces comportements récurrents d'une tâche à l'autre, comme saisir, pousser ou repositionner un objet, sont choisis par le modèle à partir de la scène observée. Les essais réussis sont ensuite convertis en supervision corrective pour réentraîner la politique. Les auteurs affirment que des expériences en conditions réelles montrent une amélioration répétée de politiques agissant de manière autonome, et que les skills peuvent être partagés entre tâches pour réduire l'effort d'enseignement sur de nouvelles tâches. Le résumé ne donne ni taux de réussite, ni nombre d'essais, ni plateforme robotique, ni gain chiffré. Ces éléments devront être vérifiés dans le papier complet et sur la page de résultats vidéo associée. L'enjeu est un goulot d'étranglement bien connu du déploiement de robots : l'amélioration après mise en service dépend encore largement de téléopérateurs qui produisent des démonstrations correctives. Les systèmes dits agentiques, où un modèle de fondation compose des comportements appris pour finir une tâche, contournent l'humain, mais ne rendent pas la politique elle-même meilleure. Elle échouera de nouveau au même endroit. Le travail cherche à combler cet écart en transformant les succès obtenus par composition de skills en données d'apprentissage. Si le résultat tient à l'échelle, il réduirait le coût marginal de chaque correction, un poste critique pour les intégrateurs qui exploitent des flottes de robots. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, et les vidéos publiées par les auteurs sont généralement sélectionnées. La généralisation entre tâches reste à démontrer sur des cas plus variés que ceux d'un laboratoire. Ce travail s'inscrit dans la course aux politiques vision-langage-action (VLA), comme Pi-0 ou GR00T, qui sont pré-entraînées sur de grands volumes de démonstrations, puis affinées, souvent avec de la téléopération humaine. Il rejoint aussi les recherches sur l'apprentissage par renforcement et l'auto-amélioration en conditions réelles, qui butent sur le coût des essais physiques et sur la conception des récompenses. L'usage de skills comme espace de recherche restreint l'exploration et la rend plus sûre et plus efficace que des actions brutes. La suite dépendra de la publication du code, des comparaisons avec les approches d'amélioration existantes et d'éventuels tests sur des robots industriels. Aucun pilote commercial n'est annoncé à ce stade.

RecherchePaper
1 source
Aucun contrôleur gratuit : un état des lieux des vérificateurs pour politiques robotiques
3arXiv cs.RO 

Aucun contrôleur gratuit : un état des lieux des vérificateurs pour politiques robotiques

Un article de recherche publié sur arXiv le 9 septembre 2026 (référence 2609.09250v1) propose la première synthèse systématique des "verifiers", ces systèmes qui évaluent la qualité d'un comportement exécuté par une politique robotique et lui attribuent un score, utilisé aussi bien pour juger les politiques vision-langage-action (VLA) que pour les entraîner. Les auteurs recensent environ 150 verifiers existants dans la littérature et les comparent selon deux axes. Le premier, la disponibilité, mesure le coût d'un verdict, la rapidité avec laquelle il arrive pendant une exécution, et la fréquence à laquelle on peut le solliciter. Le second, la crédibilité, mesure ce qu'un score élevé indique réellement sur la réussite de la tâche, et diminue à mesure que le jugement devient manipulable ou auto-complaisant. L'étude classe ces verifiers en quatre familles selon la source du jugement : les évaluateurs humains, les vérificateurs à base de règles ou de logique formelle, les modèles appris ou pré-entraînés, et les mécanismes intrinsèques au modèle lui-même. Le constat central, valable pour les quatre familles sans exception, est que la crédibilité chute à mesure que la disponibilité augmente : aucun vérifier ne combine gratuitement rapidité, faible coût et fiabilité du jugement. Pour les équipes qui entraînent des politiques VLA par apprentissage par renforcement ou qui certifient des comportements robotiques avant déploiement, cela signifie que les métriques les moins chères à obtenir, souvent celles utilisées pour accélérer l'itération, sont aussi les plus exposées au reward hacking, où le modèle apprend à tromper le score sans réellement accomplir la tâche. Les auteurs proposent neuf métriques permettant de rendre vérifiable toute affirmation sur la qualité d'un vérifier, un outil utile pour les intégrateurs qui doivent comparer des politiques robotiques sans pouvoir se fier aux seules démonstrations vidéo des fournisseurs. Ce travail s'inscrit dans le contexte d'une industrie robotique qui multiplie les annonces de politiques VLA génériques entraînées sur des données massives, où l'écart entre démonstration filmée et performance réelle en usine reste une préoccupation majeure pour les décideurs B2B. En proposant trois critères de validation déjà présents dans la littérature (accord avec des annotations humaines, performance de la politique entraînée, comportement face au reward hacking), l'étude fournit une grille de lecture pour distinguer les évaluations rigoureuses des simples arguments marketing, et esquisse les verifiers restant à concevoir pour combler les angles morts actuels.

UEAucun acteur ni déploiement franco-européen n'est cité, mais le cadre d'évaluation proposé peut aider les intégrateurs industriels européens à juger les politiques VLA de leurs fournisseurs sans se fier aux seules démonstrations.

RecherchePaper
1 source
Régulateur quadratique linéaire latent pour les tâches de contrôle robotique
4arXiv cs.RO 

Régulateur quadratique linéaire latent pour les tâches de contrôle robotique

Des chercheurs présentent LaLQR (Latent Linear Quadratic Regulator), une méthode de contrôle robotique qui projette l'espace d'états d'un système non-linéaire vers un espace latent dans lequel la dynamique est linéaire et la fonction de coût est quadratique. Cette reformulation permet d'appliquer un LQR classique, résolu analytiquement et peu coûteux en calcul, là où un MPC non-linéaire standard serait requis. Le modèle de projection est appris conjointement par imitation d'un contrôleur MPC de référence. Les expériences sur des tâches de contrôle robotique montrent une meilleure efficacité computationnelle et une meilleure généralisation face aux baselines comparées. L'enjeu est direct pour les équipes de contrôle embarqué : le MPC (Model Predictive Control) reste une référence pour la qualité de trajectoire et la gestion de contraintes, mais son coût computationnel constitue un frein réel sur des plateformes à ressources limitées exigeant des fréquences de boucle élevées. LaLQR propose une alternative apprise qui conserve la structure d'un problème d'optimisation optimal tout en le rendant analytiquement soluble à chaque pas de temps. Si cette approche se confirme à plus grande échelle, elle pourrait réduire la dépendance à des processeurs haute performance dans les applications de manipulation et de locomotion. Cette recherche s'inscrit dans un courant actif combinant apprentissage par imitation et contrôle optimal classique pour contourner le mur computationnel du MPC non-linéaire. Des approches concurrentes incluent les neural MPC avec différentiation automatique et les architectures récurrentes pour la modélisation de dynamiques complexes. LaLQR introduit une piste distincte fondée sur la linéarisation dans l'espace latent, dont l'applicabilité à des systèmes à haute dimensionnalité, comme les manipulateurs multi-DOF ou les humanoïdes, reste à démontrer hors contexte académique. L'article est disponible en version 3 sur arXiv (2407.11107), ce qui suggère des révisions successives mais aucun déploiement industriel annoncé à ce stade.

RecherchePaper
1 source