Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage continu pour la synthèse de saisies à 6 DOF à partir de l'expérience et de démonstrations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (identifiant 2610.01301) un cadre d'apprentissage continu pour la synthèse de prises 6-DoF avec une pince parallèle, à partir d'une seule vue, dans des scènes encombrées. Leur méthode n'ajuste pas un grand modèle paramétrique. Elle adapte le système par une mémoire située dans un espace d'embedding appris. Les résultats de chaque tentative de saisie modifient les scores des prises futures. Des démonstrations fournies par l'utilisateur, facultatives, sont rappelées puis transférées vers de nouvelles scènes, où elles deviennent des prises candidates supplémentaires. L'évaluation combine simulation et expériences réelles, avec plus de 1500 essais de saisie. Selon les auteurs, le système égale les références 6-DoF existantes avant toute adaptation. Il progresse en ligne sur des objets inconnus, issus de catégories absentes ou sous-représentées à l'entraînement. Il tient un apprentissage continu sur le long terme avec peu d'oubli. Sur plusieurs catégories d'objets difficiles, il dépasse 90 % de réussite après seulement 50 tentatives en ligne. La vidéo et le code sont publiés sur la page du projet.

Ce résultat s'attaque à un point faible de la manutention robotisée. La plupart des systèmes de saisie sont entraînés hors ligne puis figés au déploiement. Leurs performances baissent dès que les conditions s'écartent des données d'entraînement, par exemple avec une référence jamais vue dans un bac de e-commerce ou de logistique. Passer par une mémoire plutôt que par un réglage fin évite de réentraîner un gros modèle sur site. Cela limite le coût de calcul, le risque de régression et l'oubli catastrophique. Pour un intégrateur, 50 essais représentent quelques heures de fonctionnement. Un robot pourrait donc s'améliorer seul sur son assortiment réel, sans cycle de collecte et de réentraînement. Le canal de démonstrations donne aussi à un opérateur non spécialiste un moyen simple de corriger un échec.

Il faut toutefois rester prudent. Il s'agit d'un preprint, pas encore évalué par les pairs. Les chiffres ne couvrent que quelques catégories choisies, sans information dans le résumé sur la diversité des objets, les temps de cycle ou le matériel. Le travail concerne uniquement la saisie par pince parallèle, pas la manipulation dextre ni les humanoïdes. Il s'inscrit dans la lignée des méthodes de saisie 6-DoF apprises, comme Contact-GraspNet et ses successeurs, et des modèles vision-langage-action généralistes. Ceux-ci restent en grande partie figés après l'entraînement. Cette approche à mémoire y ajoute une voie d'adaptation légère. La suite logique serait des essais en conditions industrielles, avec des cadences réelles et des assortiments variés.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SynIL : exploiter la synergie pour l'apprentissage par imitation hors ligne à partir de jeux de démonstrations imparfaites
1arXiv cs.RO 

SynIL : exploiter la synergie pour l'apprentissage par imitation hors ligne à partir de jeux de démonstrations imparfaites

Des chercheurs proposent SynIL (Synergy-based Imitation Learning), un cadre d'apprentissage par imitation hors ligne conçu pour exploiter des jeux de démonstrations imparfaits sans intervention humaine. Le problème visé est connu : les performances de l'imitation se dégradent fortement quand les données contiennent des démonstrations sous-optimales ou bruitées. Les méthodes existantes filtrent ou repondèrent les données, mais elles exigent en général une présélection manuelle de démonstrations expertes de référence, ou des heuristiques propres à chaque tâche. SynIL s'en passe : il évalue automatiquement la qualité de chaque transition, sans étiquette. Il quantifie la « synergie motrice », c'est-à-dire la structure coordonnée et de faible dimension du mouvement, que les neurosciences associent au niveau de maîtrise motrice. À partir de cette mesure, il produit des signaux de récompense denses, au niveau de chaque transition, par régression auto-supervisée. Les tests portent sur les benchmarks de locomotion D4RL et sur des jeux Robomimic de manipulation issus de plusieurs opérateurs humains. Les auteurs rapportent que ces récompenses corrèlent fortement avec les récompenses réelles de l'environnement. SynIL dépasse nettement le clonage comportemental (BC). Il atteint des résultats comparables à ceux de l'apprentissage par renforcement hors ligne entraîné sur les vraies récompenses, et meilleurs en téléopération humaine à récompense éparse. L'enjeu est pratique pour quiconque collecte des données de téléopération à grande échelle. Les jeux de démonstrations réels mélangent opérateurs aguerris et novices, essais hésitants et gestes parasites. Le tri manuel ne passe pas à l'échelle, alors que les politiques généralistes de type VLA dépendent de volumes toujours plus grands. Un score de qualité calculé sans référence experte pourrait réduire le coût de curation et rendre exploitables des données jusque-là écartées. Le résultat sur récompenses éparses est le plus intéressant, puisque c'est le cas habituel de la manipulation réelle, où la récompense se limite souvent à un succès ou un échec en fin d'épisode. Des réserves s'imposent : il s'agit d'un préprint (arXiv, v1) non évalué par des pairs. Les validations se limitent à des benchmarks simulés ou à des jeux de données standard, sans robot physique ni humanoïde. L'hypothèse selon laquelle la synergie reflète la compétence reste à vérifier sur des morphologies et des tâches plus variées. Ces travaux s'inscrivent dans un courant plus large de pondération et de filtrage des données pour l'apprentissage hors ligne, face à la montée des corpus de téléopération agrégés par les laboratoires et les fabricants d'humanoïdes. Le lien avec la biomécanique et les neurosciences motrices est relativement peu exploité dans ce champ. L'article ne mentionne ni code publié, ni calendrier de déploiement, ni partenaire industriel. L'étape suivante logique serait une validation sur robots réels et sur des modèles fondation de grande taille.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Synthèse de démonstrations à partir d'un seul scan par Gaussian Splatting pour l'apprentissage de politiques visuomotrices
2arXiv cs.RO 

Synthèse de démonstrations à partir d'un seul scan par Gaussian Splatting pour l'apprentissage de politiques visuomotrices

GaussianFactory, décrit dans un article déposé sur arXiv le 21 septembre 2026 (arXiv:2609.21112v1), génère des démonstrations d'entraînement pour des politiques robotiques visuomotrices à partir d'un unique scan vidéo, sans moteur physique dans la boucle de génération. Le système reconstruit la scène en réplique 3D Gaussian Splatting éditable, puis planifie de façon purement cinématique les prises et trajectoires pour les tâches de combinaison d'objets qu'elle permet, la formation des prises s'appuyant sur un modèle de contact appris une fois sur un jeu de données d'interactions. Le pipeline complet, du scan au déploiement, a été testé sur une scène simulée et sur un poste réel équipé d'un bras UR10e. Une politique de diffusion entraînée uniquement sur ces démonstrations synthétiques atteint 95,1% de réussite en simulation et 84,2% en conditions réelles. Ce résultat s'attaque au goulot d'étranglement le plus coûteux de l'apprentissage par imitation en robotique : la collecte de démonstrations réelles, qui suppose un opérateur humain et un environnement identique à celui du déploiement. En cantonnant la simulation physique au seul modèle de contact, la méthode évite les approximations coûteuses des simulateurs classiques tout en restant fidèle au moment où la physique compte vraiment, celui du contact. L'écart entre 95,1% en simulation et 84,2% en réel rappelle qu'un fossé demeure entre reconstruction photoréaliste et transfert effectif sur robot physique, sur un nombre de tâches encore limité. Pour les équipes robotique en entreprise, l'approche esquisse une voie pour amorcer l'entraînement de politiques sur un nouveau poste de travail sans campagne de téléopération répétée. Ce travail s'inscrit dans la recherche sur la réduction du coût de la donnée pour les politiques d'apprentissage par imitation, un enjeu central depuis la diffusion des politiques de diffusion et des architectures vision-langage-action en robotique. Les approches concurrentes reposent en général soit sur des simulateurs physiques complets, coûteux et sujets à l'écart sim-to-real, soit sur des démonstrations réelles collectées manuellement, donc difficiles à faire passer à l'échelle. Publié comme nouvelle soumission arXiv sans partenariat industriel annoncé, l'article ouvre la voie à une extension future vers davantage de tâches, de robots et de scènes, avant toute validation par la communauté ou adoption industrielle.

RecherchePaper
1 source
CLAM : modèles d'action latente continue pour l'apprentissage robotique à partir de démonstrations non étiquetées
3arXiv cs.RO 

CLAM : modèles d'action latente continue pour l'apprentissage robotique à partir de démonstrations non étiquetées

Un nouveau papier arXiv (2505.04999v2, version révisée) présente CLAM, pour Continuous Latent Action Models, une méthode d'apprentissage de politiques de contrôle robotique qui se passe des démonstrations à actions étiquetées, coûteuses à collecter en téléopération. Le principe : à partir de simples séquences d'observations (sans étiquette d'action), un modèle infère des actions latentes continues entre deux images consécutives via une prédiction de dynamique auto-supervisée. Pour transformer ces actions latentes en commandes moteur réellement exécutables, les chercheurs entraînent conjointement un décodeur d'actions sur un petit volume de données dites "de jeu" (play data), c'est-à-dire des interactions non ciblées sur une tâche précise mais qui, elles, comportent des actions étiquetées. Les tests couvrent la locomotion sur DMControl, la manipulation sur MetaWorld, et des tâches réelles sur un bras robotique WidowX. Résultat annoncé : un taux de réussite moyen multiplié par 2 à 3 par rapport aux précédentes méthodes à actions latentes, avec des performances qui se rapprochent du behavior cloning entraîné sur des actions expertes complètes, la référence "privilégiée" du domaine. L'enjeu dépasse la seule performance technique : le goulot d'étranglement de l'apprentissage par imitation reste la collecte de démonstrations étiquetées, un processus lent et onéreux en téléopération. Si des politiques efficaces peuvent être apprises depuis de simples vidéos ou séquences d'observations, cela ouvre la voie à des jeux de données bien plus larges et moins chers à constituer, en combinant une masse de démonstrations non étiquetées avec un minimum de données annotées. Il faut toutefois noter que la validation reste majoritairement en simulation, avec un unique bras WidowX pour la partie matérielle réelle : il s'agit d'une preuve de concept académique, pas d'un déploiement industriel à l'échelle. CLAM s'inscrit dans la lignée des travaux sur les modèles d'action latente et de monde pour la robotique, qu'il cherche explicitement à surpasser en tant que base de comparaison. Il se distingue de l'approche dominante des modèles vision-langage-action comme Pi-0 ou GR00T N2, qui reposent sur de vastes corpus d'actions étiquetées. Code et vidéos sont publiés sur clamrobot.github.io, laissant la porte ouverte à des reproductions et extensions par la communauté.

RecherchePaper
1 source
Apprentissage continu de la traversabilité du terrain par l'expérience pour robots quadrupèdes
4arXiv cs.RO 

Apprentissage continu de la traversabilité du terrain par l'expérience pour robots quadrupèdes

Des chercheurs publient sur arXiv (2609.39755v1) un pipeline d'apprentissage continu qui permet à un robot quadrupède d'estimer, avant tout contact, la manière dont un terrain va se comporter sous ses pattes. Le système part d'images prises avant le contact, encodées par un modèle DINOv3 dont les poids restent figés pendant l'entraînement. Ces descripteurs visuels sont convertis en cinq indicateurs proprioceptifs, pondérés selon la fiabilité de leur mesure : glissement plan du pied, force de réaction normale moyenne, indice de traction, coût de transport et taux de charge à l'impact. Un régresseur évidentiel compact fournit ces prédictions avec leurs incertitudes aléatoire et épistémique. Les prédictions et l'incertitude épistémique sont projetées dans une carte locale multicouche, puis fusionnées en un score de traversabilité prudent dont les pondérations se règlent sans réentraînement. L'implémentation ROS2 a été évaluée sur un Unitree Go2, en simulation et sur matériel réel, avec des modèles entraînés séparément dans chaque domaine. Sur un flux séquentiel de trois terrains inédits, le replay avec validation réduit de 23,1 % la dégradation de la log-vraisemblance négative (NLL) sur les données d'ancrage, par rapport à un replay sans validation, pour une adaptation comparable aux nouveaux terrains. L'intérêt tient à ce que la traversabilité est apprise à partir de l'expérience de locomotion. La géométrie et l'apparence visuelle ne disent pas si le robot va glisser, comment ses pieds seront chargés ou combien d'énergie il dépensera. Le mécanisme de validation s'attaque à l'oubli catastrophique : un modèle candidat ne remplace le prédicteur déployé que s'il progresse sur les données récentes sans perdre au-delà d'une tolérance fixée sur les données historiques. Pour un exploitant de robots d'inspection sur site industriel, minier ou extérieur, cela rend envisageable une mise à jour en cours de mission, sans cycle de réentraînement hors ligne. Les limites sont nettes : le gain de 23,1 % est relatif à une variante de la même méthode et non à une référence externe, l'évaluation hardware ne porte que sur trois terrains, et le Go2 est une plateforme de recherche légère. Rien n'indique non plus une validation à grande échelle ou en conditions industrielles. Il s'agit d'un résultat académique, pas d'un produit. Ce travail s'inscrit dans la lignée des approches de navigation par traversabilité auto-supervisée, qui utilisent les signaux proprioceptifs comme étiquettes pour des prédictions visuelles, et de l'essor des modèles de fondation visuels comme DINO utilisés comme encodeurs figés. Le Go2 d'Unitree reste la plateforme de référence des laboratoires, ce qui facilite la reproduction. Il reste à voir si le code sera publié, si la méthode tient sur de plus longues séquences de terrains et sur des robots plus lourds comme ceux d'ANYbotics ou de Boston Dynamics, ou si elle sera intégrée à des politiques de locomotion apprises de bout en bout.

RecherchePaper
1 source