Aller au contenu principal
Apprentissage d'une variété de trajectoires kinodynamiques pour l'interception souple d'objets rapides avec gestion de l'impact
RecherchearXiv cs.RO 

Apprentissage d'une variété de trajectoires kinodynamiques pour l'interception souple d'objets rapides avec gestion de l'impact

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont déposé sur arXiv (2605.28462) une méthode pour permettre à un bras robotique de rattraper des objets en vol libre à grande vitesse. Le problème cumule trois difficultés : temps de réaction très court, incertitude à l'impact, et contraintes cinédynamiques (cinématiques et dynamiques couplées). L'approche utilise l'apprentissage par renforcement en simulation pour collecter des trajectoires de rattrapage réussies, encodées ensuite dans une variété basse dimension appelée kinodynamic trajectory manifold. À l'exécution, l'état initial estimé de l'objet est mappé directement vers une trajectoire de référence, sans optimisation non linéaire en temps réel. Un contrôle compliant prend le relais près du contact pour absorber les impacts et stabiliser la prise.

L'intérêt principal est computationnel : les méthodes classiques de planification exigent une optimisation non linéaire à chaque cycle, trop lente pour des objets rapides. Remplacer ce calcul par un mapping appris réduit la latence décisionnelle de plusieurs ordres de grandeur. Le contrôle compliant au contact, qui relâche la rigidité du contrôleur au bon moment, s'attaque à un problème bien documenté : les chocs rigides provoquent rebonds, ratés de préhension, et contraintes mécaniques excessives sur les actionneurs.

Ce travail s'inscrit dans la lignée des recherches RL-sim-to-real appliquées à la manipulation dynamique, domaine actif depuis les travaux sur le jonglage robotique (DeepMind) et le rattrapage en chute libre (ETH Zurich). La limite principale de ce preprint est l'absence de validation sur robot physique : les résultats restent simulés, et le gap sim-to-real pour des trajectoires d'impact n'est pas quantifié. Les prochaines étapes attendues incluent une validation expérimentale pour éprouver la robustesse du manifold appris face aux bruits réels de perception.

Dans nos dossiers

À lire aussi

MinInter : minimiser l'interpolation de trajectoire lors de l'augmentation de données pour l'apprentissage par imitation
1arXiv cs.RO 

MinInter : minimiser l'interpolation de trajectoire lors de l'augmentation de données pour l'apprentissage par imitation

Une équipe de chercheurs a publié en juin 2026 sur arXiv (arXiv:2606.24078) une méthode baptisée MinInter (Minimizing Interpolation), destinée à améliorer la qualité des données synthétiques générées lors de l'apprentissage par imitation pour la manipulation robotique. Le principe est ciblé : lorsqu'un pipeline d'augmentation de données recompose des démonstrations d'experts à partir de configurations initiales variées, il doit typiquement intercaler des segments d'interpolation entre les morceaux de trajectoire, segments qui ne correspondent à aucun comportement expert et dégradent la qualité des données générées. MinInter résout ce problème en sélectionnant, pour chaque configuration initiale échantillonnée, la démonstration source qui nécessite le moins d'interpolation pour former une trajectoire complète. Sur le benchmark MimicGen, la méthode a été évaluée sur 12 tâches de manipulation couvrant 26 variantes, et améliore systématiquement à la fois les taux de succès de génération de données et les taux de succès des politiques apprises, avec les gains les plus importants sur les tâches dites contact-rich (en contact physique intensif), long-horizon (longues séquences d'actions) et high-variance (configurations initiales très dispersées). L'intérêt principal de MinInter réside dans sa capacité à améliorer la qualité des données sans modifier l'architecture du pipeline d'augmentation existant : la méthode est compatible avec les frameworks actuels et agit uniquement sur la stratégie de sélection de trajectoire. C'est un levier pratique pour les laboratoires qui cherchent à réduire le coût humain de la collecte de démonstrations tout en maintenant la qualité des politiques apprises. Les résultats sur les tâches contact-rich sont particulièrement notables, car ce type de tâche est historiquement difficile à traiter par augmentation synthétique, les dynamiques de contact étant sensibles aux discontinuités introduites par les segments d'interpolation. La surperformance face à SkillGen, un framework récent et plus complexe, questionne l'utilité d'approches sophistiquées quand une heuristique de sélection bien ciblée suffit. Le contexte est celui de la montée en puissance de l'apprentissage par imitation (IL) comme alternative au reinforcement learning pour la robotique de manipulation, notamment avec des méthodes comme BC (Behavioral Cloning), ACT ou Diffusion Policy. MimicGen, le benchmark utilisé, est devenu une référence du domaine pour comparer les méthodes d'augmentation de trajectoire. MinInter s'inscrit dans la même lignée que SkillGen (2024), mais avec une philosophie de minimalisme algorithmique. La prochaine étape logique serait de valider ces gains sur du matériel réel, où les dynamiques de contact et la variabilité du monde physique dépassent largement ce que les simulateurs capturent, et où le sim-to-real gap reste la principale incertitude non résolue.

UELes laboratoires européens travaillant sur l'apprentissage par imitation (INRIA, CEA-List, universités techniques) peuvent intégrer directement MinInter dans leurs pipelines d'augmentation MimicGen sans modifier leur architecture existante.

RecherchePaper
1 source
OmniRisk : apprentissage omnidirectionnel du risque de trajectoire pour l'évitement dynamique agile de quadrirotors
2arXiv cs.RO 

OmniRisk : apprentissage omnidirectionnel du risque de trajectoire pour l'évitement dynamique agile de quadrirotors

Une équipe de recherche présente OmniRisk, un système de planification omnidirectionnelle permettant à des drones quadrirotors agiles d'éviter des obstacles rapides en mouvement, décrit dans un article publié sur arXiv (référence 2609.18191v1) en septembre 2026, avec code source mis à disposition sur GitHub sous le compte VANdexj. Le système combine dans un même tenseur de dimension fixe des panoramas de portée LiDAR, des masques de détection de mouvement et des vitesses de surface en coordonnées cartésiennes, afin de représenter simultanément la géométrie de l'environnement et la dynamique des obstacles. Il s'appuie sur un champ de risque asymétrique aligné sur le vecteur vitesse de chaque obstacle, qui accentue le danger lors d'une approche et l'atténue lors d'un éloignement. Un réseau à convolution circulaire à deux branches prédit en un seul passage les états limites terminaux et les niveaux de risque dynamique pour un ensemble de trajectoires candidates réparties sur une grille d'ancrage à 360 degrés, avant sélection et reconstruction analytique de la trajectoire retenue. Des essais en vol réel ont démontré des manœuvres d'évitement consécutives à des vitesses de rencontre relative allant jusqu'à 15 m/s, sans réglage fin additionnel du modèle. L'intérêt principal tient au déplacement du calcul de risque vers une phase d'apprentissage hors ligne : l'inférence embarquée devient indépendante du nombre d'obstacles, ce qui règle un point de blocage classique des planificateurs de trajectoire en ligne, soit trop coûteux face à des scènes denses, soit fiables uniquement au prix d'une charge de calcul croissante avec le nombre d'obstacles. Pour les intégrateurs de drones autonomes, cela ouvre la voie à un évitement dynamique temps réel et léger en calcul, sans dépendre de capteurs de profondeur denses. La validation en conditions réelles, à haute vitesse et sans fine-tuning, va aussi à l'encontre d'un écart fréquent entre performances simulées et transfert au monde réel dans ce type d'approche par apprentissage. Ce travail s'inscrit dans la lignée des recherches en navigation réactive pour drones agiles, un champ jusqu'ici partagé entre optimisation de trajectoire en ligne à base de modèles et méthodes d'apprentissage exploitant des capteurs de profondeur ou LiDAR. OmniRisk se distingue par sa couverture omnidirectionnelle plutôt que frontale et par la prise en compte explicite du sens de déplacement relatif des obstacles. Le code étant publié en accès libre, la reproductibilité et l'adoption par d'autres équipes de recherche en robotique aérienne constituent la suite logique attendue.

RecherchePaper
1 source
Apprentissage de trajectoires SE(3) lisses selon des métriques riemanniennes invariantes à gauche
3arXiv cs.RO 

Apprentissage de trajectoires SE(3) lisses selon des métriques riemanniennes invariantes à gauche

Des chercheurs présentent, dans un article publié le 4 août 2026 sur arXiv (2608.01562), une méthode d'apprentissage pour générer des trajectoires lisses sur SE(3), le groupe des déplacements rigides combinant rotation et translation, sous des métriques riemanniennes invariantes à gauche. Le problème classique consiste à minimiser une fonctionnelle d'énergie définie par la métrique choisie, ce qui produit des trajectoires optimales pour un corps rigide en mouvement. Si des solutions analytiques existent pour des cas particuliers (métriques produit, conditions aux limites de repos à repos), le cas général avec états limites arbitraires et couplage rotation-translation exige normalement un solveur numérique de problème aux limites, coûteux en temps de calcul. Les auteurs paramétrisent les trajectoires en torseurs cinématiques (body-twist) par des polynômes d'ordre élevé, où un réseau de neurones apprend un sous-ensemble des coefficients ainsi que la durée du mouvement, le reste des coefficients étant calculé analytiquement pour respecter les conditions aux limites. L'entraînement combine des pertes issues des conditions d'optimalité d'Euler-Lagrange, des objectifs de lissage pondérés par la métrique, et des contraintes de faisabilité. Résultat annoncé : des trajectoires proches des solutions d'optimisation numérique classique, mais calculées en quelques millisecondes. Pour la planification et le contrôle robotique en temps réel, ce goulot d'étranglement du calcul aux limites est justement ce qui empêche aujourd'hui l'usage de trajectoires géométriquement cohérentes dans des boucles de contrôle rapides. Un générateur conditionné par la métrique, capable de s'adapter à différentes structures de métrique et conditions de mouvement sans nouvelle résolution numérique, ouvrirait la voie à une planification de mouvement plus réactive pour des bras manipulateurs, des drones ou tout système dont la cinématique s'exprime naturellement sur SE(3). Les auteurs valident l'approche sur deux applications concrètes : la génération en temps réel de primitives de mouvement avec passage par points de cheminement, et le raffinement de trajectoires de vol pour quadrirotor en conditions dynamiques. Ce travail s'inscrit dans la lignée des méthodes d'optimisation géométrique sur groupes de Lie pour la robotique, où l'apprentissage automatique sert ici à contourner, plutôt qu'à remplacer, les fondements théoriques du problème variationnel classique.

RecherchePaper
1 source
Apprentissage rapide sur robot pour compétences de manipulation dynamique : le jonglage robotique
4arXiv cs.RO 

Apprentissage rapide sur robot pour compétences de manipulation dynamique : le jonglage robotique

Un article publié sur arXiv (2608.26800v1) présente un cadre d'apprentissage en ligne permettant à un robot bimanuel d'apprendre à jongler directement sur du matériel physique, en moins de cinq minutes d'interaction réelle. Équipé de deux bras, de mains multi-doigts et d'une vision embarquée, le robot maîtrise cinq figures classiques de jonglage à trois balles : cascade, tennis, demi-douche, douche et boîte. La méthode, dite d'apprentissage régularisé par mémoire, combine un modèle local construit à partir de l'expérience accumulée sur le robot avec un modèle global préalable qui sert à extrapoler là où les données manquent. Un mécanisme de sécurité, appelé ensemble mutuellement atteignable, garantit que chaque transition entre lancer et rattrapage reste dans les limites articulaires et d'actionneurs des deux bras. Ce résultat s'attaque à l'écart persistant entre simulation et réalité en robotique : plutôt que de chercher à améliorer la fidélité du simulateur, les auteurs montrent qu'un modèle imparfait suffit comme socle à un apprentissage rapide directement sur le robot. Cela contredit l'hypothèse répandue selon laquelle un pré-entraînement massif ou une collecte de données prolongée est nécessaire pour des tâches de manipulation dynamique exigeant une coordination fine entre perception et action en temps réel. Pour les intégrateurs et décideurs industriels, l'approche suggère des robots capables de s'adapter en quelques minutes à une nouvelle tâche sur site plutôt qu'après des semaines de réentraînement hors ligne, ce qui réduirait le coût et les délais de déploiement de systèmes manipulateurs dextres. Le jonglage sert ici de banc d'essai à des compétences de manipulation dynamique et rapide, un registre distinct des tâches quasi statiques comme la préhension ou le tri qui dominent les démonstrations commerciales actuelles. L'abstract ne précise ni l'affiliation des auteurs ni la plateforme robotique utilisée, au-delà de sa description fonctionnelle. Ce travail s'inscrit dans une tendance de recherche visant à dépasser les politiques figées apprises hors ligne, au profit de robots capables d'affiner en continu leur comportement au contact du monde réel. Les auteurs présentent ce résultat comme une preuve de concept, une étape vers des systèmes qui exploitent des connaissances préalables imparfaites tout en s'améliorant continuellement par leur propre expérience physique.

RecherchePaper
1 source