Aller au contenu principal
Apprendre des contraintes inconnues sans données dangereuses grâce à l'optimalité et à la régularisation contrefactuelle
RecherchearXiv cs.RO 

Apprendre des contraintes inconnues sans données dangereuses grâce à l'optimalité et à la régularisation contrefactuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.09350, première version) Counterfactual KKT (CF-KKT), une méthode qui apprend des contraintes inconnues à partir de démonstrations d'experts. Ces démonstrations sont localement optimales et respectent les contraintes. L'apprentissage n'exige aucune donnée dangereuse. La méthode procède en deux temps. Un modèle de dynamique différentiable, appris localement, permet d'imposer aux démonstrations des conditions d'optimalité inspirées de Karush-Kuhn-Tucker (KKT). Le même modèle génère ensuite des comportements contrefactuels, proches des démonstrations, qui améliorent la récompense. Ces trajectoires seraient préférables si la contrainte n'existait pas. Elles servent donc d'exemples synthétiques d'infaisabilité. Si la forme paramétrique de la contrainte est connue, le cadre permet aussi une récupération directe des paramètres, avec une analyse de sensibilité aux erreurs du modèle de dynamique. Sur des tâches de contrôle robotique en haute dimension, les auteurs affirment obtenir des contraintes neuronales plus sûres et plus économes en données que les références d'ICRL hors ligne (inverse constrained reinforcement learning).

L'enjeu est pratique, car les contraintes de sécurité (zones interdites, limites de contact, distances aux opérateurs) sont difficiles à spécifier à la main. Les approches d'ICRL gèrent des contraintes complexes et des dynamiques inconnues, mais elles demandent souvent une exploration en ligne, pendant laquelle des violations peuvent survenir. Les approches de contrôle optimal inverse contraint (CIOC) sont sûres et frugales, mais supposent une dynamique connue et des contraintes structurées. CF-KKT vise à réunir les avantages des deux. Pour un intégrateur, cela ouvrirait la voie à des règles de sécurité déduites de démonstrations téléopérées, sans exposer le matériel. Il faut toutefois rester prudent. Le résumé ne donne ni taux de violation, ni nombre de démonstrations, ni liste des tâches, et ne dit pas si des essais ont eu lieu sur robot réel. La méthode dépend aussi de la qualité du modèle de dynamique local.

Ce travail relève de l'apprentissage par démonstration, où deux courants coexistent : le CIOC, issu du contrôle optimal, et l'ICRL, issu de l'apprentissage par renforcement. Il se positionne face aux méthodes d'ICRL hors ligne. Il s'agit de recherche amont, sans produit, partenaire industriel ni pilote annoncé. Les suites logiques seraient une validation sur matériel réel, des comparaisons chiffrées plus détaillées et une évaluation de la robustesse quand le modèle de dynamique est imparfait.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

ActGaze : apprendre un regard ancré dans l'action via des interventions visuelles contrefactuelles pour une manipulation de haute précision
1arXiv cs.RO 

ActGaze : apprendre un regard ancré dans l'action via des interventions visuelles contrefactuelles pour une manipulation de haute précision

Des chercheurs ont mis en ligne le 25 septembre 2026 sur arXiv (arXiv:2609.28955) une méthode baptisée ActGaze, destinée à améliorer la précision des modèles vision-langage-action (VLA) utilisés en manipulation robotique. Le constat de départ est que les VLA actuels échouent souvent sur les tâches fines parce que leur attention visuelle se disperse sur des zones de l'image sans rapport avec la tâche à accomplir. ActGaze entraîne la politique VLA à concentrer son regard sur les régions pertinentes, à l'image d'un humain qui fixe les indices visuels critiques lors d'un geste précis. Contrairement aux approches antérieures qui s'appuient sur des annotations externes de regard fournies manuellement, ActGaze dérive sa supervision spatiale directement de l'objectif d'action du modèle lui-même, en utilisant des interventions visuelles contrefactuelles pour identifier quelles régions de l'image sont réellement déterminantes dans la prédiction du geste. Les auteurs rapportent des expériences menées sur robot réel, et non en simulation, portant sur quatre tâches de manipulation à haute précision; le résumé ne précise ni payload, ni degrés de liberté, ni temps de cycle des plateformes testées. Pour l'industrie robotique, ce travail s'attaque à un point de friction précis: l'écart entre les démonstrations spectaculaires de VLA généralistes et leur fiabilité réelle sur des gestes fins comme l'insertion de précision ou la préhension d'objets fragiles, un écart souvent pointé par les intégrateurs comme le principal obstacle à la mise en production. En montrant qu'un signal d'attention utile peut être extrait de l'objectif d'action lui-même plutôt que d'annotations humaines coûteuses, ActGaze propose une piste pour fiabiliser les politiques VLA sans alourdir les pipelines de collecte de données, un enjeu direct pour tout acteur cherchant à déployer ces modèles au-delà du laboratoire. Ce papier s'inscrit dans la vague de recherche récente sur les modèles VLA (dans la lignée de familles comme Pi-0 ou GR00T N2, largement discutées dans le secteur), où la robustesse de la perception reste un sujet ouvert malgré les progrès sur l'échelle des données et des modèles. L'article ne mentionne ni partenaire industriel, ni plateforme robotique commerciale précise, ni calendrier de transfert vers un produit: il s'agit d'une contribution méthodologique publiée en preprint, dont la reproductibilité et l'adoption par d'autres équipes de recherche resteront à observer dans les mois suivant sa publication.

RechercheActu
1 source
VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets
2arXiv cs.RO 

VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets

VidAct est un framework « vidéo vers robot » décrit dans un préprint arXiv (2609.36870v1) qui apprend des politiques de manipulation à partir d'une seule vidéo monoculaire par tâche, puis les déploie sur un robot réel en zero-shot. Le système repose sur trois briques. La première reconstruit le maillage des objets et leur mouvement à partir de vidéos quelconques, puis exprime ce mouvement dans le repère statique de l'objet. Cela évite tout retargeting spécifique à l'embodiment (le passage d'une main humaine à une pince) et accepte des points de vue de caméra variés. La deuxième brique, un transfert de trajectoire résiduel, adapte le mouvement reconstruit à de nouvelles configurations d'objets en conservant la forme de la trajectoire. La troisième, au cœur de l'apprentissage, demande à la politique de prédire à chaque image le nuage de points complet de l'objet, fourni en privilège par la simulation, comme tâche auxiliaire. Le déploiement reste en RGB seul. Les expériences couvrent des vidéos humaines, robotiques, générées et issues d'internet. Le résumé ne donne aucun chiffre de taux de réussite, de nombre de tâches ni de plateforme robotique. Pour les intégrateurs et les équipes R&D, l'intérêt tient à la réduction du coût de la donnée. La téléopération reste l'étalon de la collecte de démonstrations, mais elle est chère et peu extensible. Apprendre à partir d'une vidéo par tâche, y compris générée, déplace le goulot d'étranglement de la collecte vers la reconstruction 3D. L'approche traite aussi deux limites connues des méthodes de reconstruction : la dépendance à des caméras contraintes et la déformation des trajectoires face à un nouvel agencement d'objets. La supervision par nuage de points complet par image suggère que la conscience de la géométrie 3D des objets, souvent absente des politiques RGB, améliore la généralisation et le transfert simulation-réel. Ces conclusions restent à confirmer : les auteurs affirment des gains, mais l'abstract ne les quantifie pas. Les résultats viennent de tâches de laboratoire, sans indication de robustesse en environnement industriel ni de comparaison publiée avec des VLA généralistes. Ce travail s'inscrit dans une lignée qui cherche à remplacer la démonstration robotique par de la vidéo, en concurrence avec la collecte téléopérée à grande échelle et les modèles fondation type VLA, qui misent sur le volume de données plutôt que sur la reconstruction explicite. Il s'agit d'un préprint en première version, sans code, produit ni déploiement annoncé à ce stade. Les prochaines étapes à surveiller sont la publication des taux de réussite détaillés, la diffusion du code et, surtout, une validation sur des tâches longues, contraintes ou déformables, où la reconstruction monoculaire est la plus fragile.

RecherchePaper
1 source
Apprentissage par imitation sensible au contact grâce à la factorisation du contact
3arXiv cs.RO 

Apprentissage par imitation sensible au contact grâce à la factorisation du contact

Des chercheurs du laboratoire RCILab de l'université Kyung Hee (Corée du Sud) présentent FACE, un cadre d'apprentissage par imitation « factorisé par le contact », décrit dans un preprint arXiv (2610.09533). Le principe consiste à séparer le comportement de tâche voulu des facteurs de contact propres à l'environnement. Les efforts d'interaction sont exprimés dans des coordonnées normalisées, relatives au contact. Deux estimateurs complètent ce dispositif : un estimateur de normale de contact, appris, et un estimateur de friction en ligne, qui détermine l'échelle de friction effective. À l'exécution, les observations d'effort sont encodées et les sorties de la politique sont décodées en commandes de mouvement et d'effort physiques. L'adaptation se fait donc sans aucune mise à jour des paramètres de la politique. Les essais ont été menés sur robot réel, en manipulation riche en contacts, avec des variations inédites de propriétés de surface et de géométrie. Les auteurs comparent FACE à des variantes qui adaptent des approches antérieures à leur cadre. Le résumé ne chiffre ni taux de réussite, ni nombre d'essais, ni plateforme robotique, et ces éléments restent à vérifier dans l'article complet et sur la page du projet. L'enjeu est un verrou connu de la manipulation de précision, celle de l'essuyage, du ponçage, de l'insertion ou du polissage. Les efforts mesurés varient fortement pour de faibles changements de géométrie, d'orientation ou de friction de la surface. Une politique entraînée sur des mesures brutes de force apprend donc en partie les particularités des démonstrations et se transfère mal. Déplacer cette variabilité dans des estimateurs légers, sans réentraîner la politique, serait précieux pour les intégrateurs. Ils pourraient réutiliser une même politique sur des pièces, des matériaux ou des outillages différents, sans recollecter de démonstrations à chaque changement de référence. Ces résultats restent des essais de laboratoire. La robustesse face à des surfaces courbes, à des frottements non stationnaires ou à des cadences industrielles n'est pas établie, et les comparaisons portent sur des variantes adaptées par les auteurs, non sur des systèmes tiers inchangés. Ce travail s'inscrit dans le virage des politiques visuo-motrices (diffusion, VLA) vers la prise en compte du toucher et de l'effort. Les premières versions de ces modèles, comme Pi-0 ou Helix, s'appuient surtout sur la vision et la proprioception. La commande en force et en impédance, issue de la robotique classique, offre une adaptation fine au contact, mais elle exige des modèles d'environnement qu'il faut régler à la main. FACE vise un compromis : conserver l'apprentissage par imitation et déléguer au contact une partie de la physique, estimée en ligne. La suite logique serait de brancher ce principe sur des politiques généralistes plus grandes et de le valider sur plusieurs plateformes. Le preprint, publié en version 1, n'a pas encore passé de relecture par les pairs.

RecherchePaper
1 source
CMC-Opt : variété contrainte à coins pour l'optimisation sous contraintes d'inégalité
4arXiv cs.RO 

CMC-Opt : variété contrainte à coins pour l'optimisation sous contraintes d'inégalité

Une équipe de chercheurs a publié début mai 2026 sur arXiv (2605.20796) CMC-Opt, un framework d'optimisation sous contraintes pour la robotique reposant sur la géométrie différentielle. L'idée centrale : transformer un problème d'optimisation avec contraintes d'égalité et d'inégalité mélangées en un problème non contraint, résolu directement sur l'espace d'état contraint. Pour cela, les auteurs introduisent la notion de "constraint manifolds with corners" (CMC), une extension des variétés différentielles classiques capable de représenter les régions de l'espace d'état satisfaisant simultanément des contraintes nonlinéaires mixtes. Les algorithmes d'optimisation sur variétés sont ensuite adaptés à cette nouvelle structure topologique. Le framework est validé sur un problème de planification kinodynamique à grande échelle, domaine où les méthodes standards échouent à générer des trajectoires dynamiquement faisables. L'intérêt technique est réel : la planification de trajectoires sous contraintes physiques (limites articulaires, évitement de collisions, dynamique du corps entier) est un verrou central pour les robots humanoïdes et les manipulateurs industriels. Les approches classiques comme SQP ou les méthodes de point intérieur peinent à passer à l'échelle ou à gérer des contraintes d'inégalité actives de façon robuste. CMC-Opt propose une alternative géométrique qui évite la pénalisation ou les variables de relâchement, en restant sur la variété admissible, ce qui peut réduire les oscillations numériques et améliorer la convergence. Ce travail s'inscrit dans une tendance active en planification robotique : l'usage des variétés de contraintes (TSR, Atlas, variétés implicites) popularisé par des groupes comme celui de Dmitry Berenson ou les équipes CMU Robotics. Il reste à ce stade un preprint non soumis à peer review, sans benchmark comparatif exhaustif ni code publié annoncé, ce qui limite l'évaluation indépendante des performances revendiquées.

RecherchePaper
1 source