Aller au contenu principal
RecherchearXiv cs.RO 

TaRL : apprendre des récompenses générales et physiques à partir de démonstrations tactiles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'équipe EmbodiedAI de la NTU (Nanyang Technological University) proposent TaRL (Tactile Reward Learning), un cadre qui apprend des fonctions de récompense à partir de démonstrations tactiles, pour l'apprentissage par renforcement (RL) de tâches de manipulation riches en contacts. Le système prend en entrée une séquence de cartes de déformation tactile et régresse un indice d'avancement de la tâche, en s'entraînant à la fois sur des démonstrations réussies et sur des échecs. Il a été évalué sur quatre tâches en simulation et deux en conditions réelles. Utilisé comme récompense de guidage (reward shaping), il améliore l'efficacité d'échantillonnage et le taux de succès final : sur l'enfilage d'écrou (nut threading), le succès passe de 34 % à 56 % en simulation, et sur le ramassage d'un cube, de 37 % à 97 % sur robot réel. Combiner récompenses tactiles et visuelles améliore encore les résultats. Un modèle entraîné sur le placement de boîtes a aussi été déployé directement sur le placement de canettes, avec un gain notable sur l'apprentissage de cette nouvelle tâche.

L'intérêt tient à un verrou bien connu du RL : les récompenses éparses ralentissent l'apprentissage, et les récompenses denses sont difficiles à spécifier à la main. Les approches par récompense visuelle, apprises à partir de démonstrations sans actions, contournent le problème, mais elles ne voient que les objectifs visibles. Or beaucoup de tâches de manipulation dépendent de ce que la caméra ne capte pas : fermeté d'une prise, direction et intensité des forces appliquées. Le signal tactile décrit l'interaction locale entre robot et objet, ce qui le rend aussi robuste aux changements de disposition de la scène, comme la position de l'objet. Pour les intégrateurs, c'est une piste pour réduire l'ingénierie de récompenses sur des tâches d'assemblage ou d'insertion. Le saut de 37 % à 97 % est frappant, mais il porte sur une tâche simple, un seul cube, et ne dit rien de la tenue sur des pièces industrielles variées. Les résultats restent ceux d'un article préprint, sans validation indépendante ni test en cadence de production.

Ce travail s'inscrit dans la montée des capteurs tactiles à base de déformation (type GelSight) et de l'apprentissage de récompenses à partir de vidéos, où la vision domine encore. Il complète les politiques vision-langage-action (VLA), majoritairement visuelles, qui peinent sur les tâches où la force compte. Le gain en généralisation d'un objet à l'autre reste à confirmer sur des catégories plus éloignées. Les prochaines étapes probables sont des tâches à plus fort contact, des capteurs différents et une intégration avec des modèles de fondation. Le code et la page projet sont annoncés, ce qui permettra à d'autres laboratoires de reproduire les chiffres.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations
1arXiv cs.RO 

Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations

Des chercheurs ont publié fin mai 2026 (arXiv:2605.22123) un framework permettant d'apprendre des fonctions de récompense symboliques invariantes à partir de seulement cinq démonstrations pour des tâches de manipulation robotique. Le système repose sur deux composants couplés : une formulation structurelle de récompense encodant des stratégies de niveau tâche et des contraintes physiques, et une procédure hybride symbolique-numérique qui distille des invariants comportementaux depuis ces démonstrations sans requérir d'interaction en ligne avec l'environnement. La méthode a été évaluée sur huit tâches du benchmark Meta-World et trois tâches de manipulation sur bras Franka, affichant de meilleures capacités d'alignement procédural et de classement de rollouts de politique par rapport aux baselines existantes. Trois expériences réelles out-of-distribution valident une généralisation zero-shot à des variations de position, de point de vue caméra et d'instances d'objets inédites. Le problème adressé est structurel : les modèles de récompense basés sur la vision tendent à mémoriser des distributions de pixels spécifiques et s'effondrent dès que les conditions visuelles changent, qu'il s'agisse d'un objet déplacé, d'un angle de caméra différent ou d'une variante d'objet inconnue. Pour un intégrateur déployant un système de manipulation en milieu industriel, cela impose de recollectecter des démonstrations ou de réentraîner le modèle à chaque variation du contexte opérationnel. Le passage aux invariants symboliques, c'est-à-dire des propriétés comportementales constantes indépendamment de l'apparence visuelle, propose une représentation de récompense réutilisable sur de multiples variantes de tâche sans interaction supplémentaire, ce qui réduit significativement le coût itératif du déploiement en apprentissage par renforcement. Ce travail s'inscrit dans une dynamique de recherche active visant à résoudre le goulot d'étranglement du reward engineering en RL robotique. Les approches récentes fondées sur des embeddings visuels issus de VLMs, comme VIP ou RoboCLIP, ont progressé sur la généralisation visuelle mais restent fragilisées par les variations de distribution en dehors des conditions d'entraînement. La méthode proposée se distingue en substituant aux embeddings bruts une abstraction symbolique de la tâche. Des laboratoires comme Berkeley BAIR, Stanford ou le CMU Robotics Institute travaillent sur des directions similaires d'abstraction pour le RL. La capacité à bootstrapper une récompense généralisable depuis cinq démonstrations seulement ouvre la voie à des pipelines de fine-tuning robotique plus accessibles, potentiellement utilisables par des intégrateurs sans expertise RL avancée.

RecherchePaper
1 source
WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action
2arXiv cs.RO 

WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action

Des chercheurs présentent WALA (arXiv:2607.11397), un framework qui apprend des actions latentes exécutables à partir de deux types de données distincts : des démonstrations robotiques annotées d'actions et de simples vidéos sans annotation d'action. Le problème visé est bien connu du secteur : les démonstrations robotiques étiquetées coûtent cher à collecter et passent mal à l'échelle, alors que les vidéos humaines et robotiques disponibles en masse restent inexploitables faute d'étiquettes d'action exécutables. WALA fonctionne en deux temps. D'abord, un pré-entraînement d'un modèle d'action latente sémantique-géométrique sur des vidéos, en modélisant l'évolution entre l'observation courante et des observations futures échantillonnées de façon éparse. Plutôt que de reconstruire les pixels bruts, le système prédit les deltas futurs dans l'espace de features DINOv3 et dans l'espace de profondeur dense, ce qui conserve la structure sémantique et géométrique utile à la tâche tout en réduisant la sensibilité aux détails d'apparence. Lors de l'entraînement de la politique, l'encodeur pré-entraîné fournit des cibles d'action latente stables, et le décodeur sert de modèle du monde latent entraînable, avec une supervision conjointe par prédiction d'action robotique, correspondance de cible d'action latente et prédiction de dynamique future. Résultat annoncé : un nouveau record sur RoboCasa avec 75,2% de taux de réussite moyen, ainsi que de bonnes performances sur RoboTwin et en manipulation réelle. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la promesse de découplage entre données d'entraînement et coût d'annotation. Si une politique VLA peut effectivement tirer une supervision de dynamique utile de vidéos non annotées, cela ouvre la voie à des jeux de données d'entraînement bien plus vastes sans multiplier les campagnes de téléopération robotique, un goulot d'étranglement connu pour tout intégrateur ou labo qui cherche à généraliser au-delà d'un jeu de tâches restreint. Cela dit, il s'agit d'un résultat de recherche publié sur arXiv, pas d'un produit déployé : les métriques de succès sur RoboCasa et RoboTwin sont des benchmarks de simulation ou semi-contrôlés, et la mention de "manipulation réelle" reste peu détaillée dans l'abstract, sans précision sur le nombre de tâches, le taux de réussite exact en conditions réelles ni le hardware utilisé. Le travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui cherchent à unifier perception, langage et contrôle moteur dans un même backbone, et dans la tendance plus large des "world models" latents pour la robotique, où l'usage de features pré-entraînées (ici DINOv3) remplace la reconstruction pixel pour la supervision. Aucun acteur français ou européen n'est mentionné dans cet abstract. Les suites logiques incluraient une publication complète avec code et poids, ainsi que des tests de généralisation croisée entre familles de robots, un point sur lequel l'abstract reste volontairement vague.

RechercheActu
1 source
Générer des mains robotiques à partir de démonstrations humaines
3arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source
ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines
4arXiv cs.RO 

ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines

Publiée le 24 août 2026 sur arXiv (2608.21355), l'étude ViTacPhys présente un système visuo-tactile qui estime la masse, la classe de frottement et la rigidité continue d'un objet à partir de démonstrations de manipulation humaines. Entraîné sur 60 objets rigides et déformables, le modèle combine modélisation temporelle visuo-tactile, fusion multimodale par cross-attention et a priori sémantique issu d'un modèle vision-langage. Sur des objets déjà vus, il atteint 97,2% de précision pour la masse, 98,8% pour le frottement et une erreur de 5,51% sur la rigidité; sur des objets inédits de catégories connues, ces scores tombent à 87,5%, 97,5% et 9,08%. Transféré vers un bras robotique via peu de données de téléopération, une augmentation vidéo au style robot et des démonstrations humaines aux gestes appariés, il pilote une préhension adaptative qui réussit 95,0% des prises sur objets connus et 83,4% hors distribution, avec des profils de force plus proches de la téléopération humaine que ceux de la référence ACT. La plupart des modèles d'action vision-robot restent appris de bout en bout sans ancrage explicite sur les propriétés physiques de l'objet saisi, limitant l'adaptation de la force de préhension face à un objet glissant, lourd ou fragile. En conditionnant la prise sur masse, frottement et rigidité estimés, ViTacPhys produit des profils de force plus cohérents avec la téléopération humaine qu'une politique par imitation classique comme ACT, un signal utile pour la logistique, le tri de colis ou la manipulation d'objets déformables. Il reste toutefois un travail de recherche en prépublication, évalué en laboratoire sur 60 objets, sans déploiement industriel annoncé. Le travail s'inscrit dans une tendance de la recherche en manipulation robotique visant à exploiter des démonstrations humaines équipées de capteurs tactiles pour amorcer l'apprentissage, en complément des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, plutôt calibrés sur la vision et la proprioception. ViTacPhys ne propose pas un nouveau VLA mais un module d'estimation physique conçu pour s'y greffer. L'abstract ne mentionne ni laboratoire ni entreprise partenaire ni calendrier de pilote: il s'agit d'une preuve de concept académique dont la suite logique serait une validation sur davantage d'objets et hors environnement contrôlé.

RecherchePaper
1 source