Aller au contenu principal
RecherchearXiv cs.RO 

Un cadre d'apprentissage des collisions guidé par la physique pour la génération de mouvements de robots collaboratifs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv PI-UDF (Physics-Informed Unified Differentiable Framework), un modèle qui prédit directement, à partir des configurations articulaires, la distance de collision entre les corps de deux robots articulés. Il associe une cinématique directe analytique, des embeddings de géométrie apprenables pour chaque lien et un réseau résiduel partagé. L'entraînement repose sur une extraction de données par quotas près de la frontière de collision, et sur une pénalité asymétrique qui sanctionne plus lourdement les faux « sûrs », c'est-à-dire les cas où le modèle annonce une configuration libre alors qu'elle est en collision. Le champ de distance appris sert de terme de dégagement différentiable dans une commande prédictive non linéaire (MPC). La validation porte sur une plateforme réelle à deux bras Franka (14 DoF au total), avec trois scénarios : échange de positions à haute vitesse en proximité étroite, esquive dynamique soutenue d'un seul bras, et planification d'esquive où le bras mobile est gelé, prédit ou change de cible. Un rejeu hors ligne avec Drake et FCL complète les essais.

L'enjeu est celui des cellules multi-bras où les robots partagent un espace restreint. Les vérificateurs géométriques classiques donnent des distances fiables mais s'intègrent mal dans une optimisation par gradient en temps réel. Les modèles de substitution conservateurs, eux, brident les mouvements fortement couplés. En visant explicitement l'erreur la plus dangereuse près de la frontière, la méthode traite le point qui conditionne l'usage en boucle fermée. L'extrait disponible ne chiffre toutefois ni taux d'erreur, ni latence d'inférence, ni fréquence de résolution du MPC. La validation se limite à un seul type de bras, et un modèle appris ne offre pas de garantie formelle de sécurité. Le caractère « adapté » à la planification collaborative reste donc à confirmer sur les données complètes.

Il s'agit d'un préprint non évalué par les pairs, qui relève de la recherche et non d'un produit. Il s'inscrit dans la lignée des champs de distance neuronaux dans l'espace des configurations, face aux approximations par sphères ou capsules et aux bibliothèques de référence comme FCL, ici utilisée pour le rejeu de vérification. Les suites logiques seraient l'extension à d'autres géométries de robots et à plus de deux bras, ainsi que l'ajout de bornes certifiées sur l'erreur de distance. Aucun acteur européen n'est identifié dans l'extrait disponible.

Dans nos dossiers

À lire aussi

ConFlow : apprentissage guidé par contraintes avec appariement de flux pour la génération de mouvement
1arXiv cs.RO 

ConFlow : apprentissage guidé par contraintes avec appariement de flux pour la génération de mouvement

ConFlow, un nouveau framework de génération de mouvement robotique par flow matching intégrant des contraintes dès l'entraînement, a été publié sur arXiv (2607.14424v1). Le flow matching est une méthode de modélisation générative reposant sur un échantillonneur neuronal basé sur des équations différentielles ordinaires (ODE), entraîné en régressant les champs de flux empiriques associés aux trajectoires observées. Le problème que ConFlow cherche à résoudre est simple à énoncer : la plupart des approches actuelles entraînent le modèle de flux sur des données brutes, puis appliquent des contraintes propres à la tâche uniquement au moment de l'inférence, via un guidage externe. Les auteurs proposent à la place d'injecter directement l'information de contrainte dans l'objectif d'entraînement, sous forme de fonctions de barrière ou de coût différentiables. Autre nouveauté technique : la distribution source gaussienne standard du flow matching est remplacée par un processus gaussien conditionnel, ce qui permet d'imposer des spécifications de conception comme la régularité ou les conditions aux limites. Le système exploite aussi des démonstrations infaisables comme supervision négative, sans nécessiter de données expertes supplémentaires. Sur une tâche de navigation impliquant deux robots, ConFlow affiche un taux de collision plus faible et une meilleure qualité de trajectoire que les baselines de flow matching standard, avec ou sans guidage à l'inférence. L'enjeu dépasse la simple performance chiffrée : ce travail questionne une hypothèse répandue dans la génération de mouvement par apprentissage, à savoir que le guidage à l'inférence suffit à faire respecter des contraintes physiques ou de sécurité à un modèle entraîné sans elles. En démontrant qu'intégrer les contraintes pendant l'entraînement referme l'écart entre entraînement et inférence, ConFlow apporte un argument concret pour les équipes qui développent des politiques de mouvement destinées à des robots opérant sous contraintes strictes (évitement de collision, limites articulaires, zones interdites), un enjeu central pour tout déploiement industriel ou multi-robot. Le flow matching s'est imposé ces dernières années comme alternative aux modèles de diffusion pour la génération de trajectoires robotiques, dans la même famille de méthodes que les architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui reposent elles aussi sur des politiques génératives entraînées sur démonstrations. ConFlow se positionne comme une brique méthodologique complémentaire à ces systèmes plutôt qu'un produit concurrent : la validation reste pour l'instant limitée à un scénario de navigation à deux robots, sans indication d'extension à des tâches de manipulation plus complexes ou à un déploiement matériel réel.

RecherchePaper
1 source
LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles
2arXiv cs.RO 

LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles

Les chercheurs à l'origine de LAMP (Latent Motion Prior-Guided Real-World Learning) proposent une méthode d'apprentissage en trois étapes pour piloter des mains robotiques dexterous directement dans le monde réel, sans passer par la simulation. Le système commence par pré-entraîner un module de "prior de mouvement latent", qui compresse l'historique récent des actions de la main en une représentation compacte et décodable en commandes exécutables à haute dimension. Une politique visuomotrice est ensuite entraînée pour prédire à la fois les commandes natives du bras et des corrections latentes pour la main, avant d'être affinée par apprentissage par renforcement (RL) résiduel en ligne, directement sur le robot physique. Testée sur quatre tâches réelles de manipulation dexterous, la méthode atteint un taux de réussite moyen de 56,25% après la seule phase d'imitation, porté à 98,75% après le RL en ligne, avec 100% de réussite sur trois des quatre tâches et 95% sur la dernière. L'enjeu dépasse la simple performance chiffrée: l'apprentissage de mains robotiques à haute dimensionnalité (nombreux degrés de liberté par doigt) est historiquement instable, car la moindre erreur d'imitation s'amplifie et pousse l'exploration par renforcement à casser le contact avec l'objet manipulé, un risque direct pour du matériel physique coûteux. En contraignant l'exploration RL à rester proche de mouvements démontrés et cohérents en termes de contact, plutôt que de perturber chaque articulation indépendamment, LAMP répond à un vrai goulot d'étranglement pour les intégrateurs qui veulent déployer de la manipulation fine (préhension d'objets fragiles, assemblage) sans multiplier les cycles de simulation coûteux ni les casses de vérins. Le travail s'inscrit dans la lignée des approches hybrides imitation + RL déjà explorées pour la robotique, mais cible spécifiquement l'espace d'action des mains dexterous, comparé ici à des interfaces d'action brutes, linéaires et discrètes, que LAMP surpasse selon les auteurs. Publié sur arXiv début juillet 2026, ce travail reste à ce stade une contribution de recherche académique, sans acteur industriel ni date de commercialisation annoncée; sa validation sur davantage de tâches et de plateformes matérielles reste l'étape logique suivante.

RecherchePaper
1 source
M³P-R1 : apprentissage par renforcement guidé par un LLM pour la planification de mouvement multimodale via génération de code MIP
3arXiv cs.RO 

M³P-R1 : apprentissage par renforcement guidé par un LLM pour la planification de mouvement multimodale via génération de code MIP

Des chercheurs publient sur arXiv (article 2609.18669v1, daté du 17 septembre 2026, catégorie "nouveauté") une méthode baptisée M$^3$P-R1, destinée à la planification de mouvement multi-modale (M$^3$P) pour robots devant enchaîner transitions discrètes et dynamiques continues, par exemple un robot bipède qui marche jusqu'à une cible puis utilise ses bras pour saisir un objet. La méthode s'appuie sur l'apprentissage par renforcement pour affiner des grands modèles de langage (LLM) afin qu'ils décomposent une tâche M$^3$P en variables, contraintes et objectifs de programmation en nombres entiers mixtes (Mixed-Integer Programming, MIP). Plutôt que de faire produire directement une réponse au LLM, ce qui expose au risque d'hallucination, M$^3$P-R1 génère du code Python exécutable s'appuyant sur des bibliothèques d'optimisation MIP et des interfaces de contraintes, avec une récompense fondée sur le résultat effectivement retourné par le solveur. L'enjeu est de rendre systématique une étape aujourd'hui largement manuelle et spécifique à chaque domaine: formuler un problème MIP tractable pour des tâches robotiques non convexes, en particulier dans le régime de discrétisation approximative nécessaire à ce type de problème. En couplant génération de code par LLM et vérification par un solveur formel, l'approche vise une garantie de robustesse absente des politiques bout-en-bout de type VLA (vision-langage-action) qui dominent actuellement la communication autour de l'humanoïde. Pour les intégrateurs et équipes de recherche en planification robotique, cela ouvre une piste alternative où le LLM sert d'interface de programmation vers un optimiseur classique plutôt que de policy générative opaque. Le travail s'inscrit dans la lignée des recherches combinant LLM et génération de code comme pont vers des solveurs formels en robotique, en marge des approches d'apprentissage de bout en bout du type Pi-0, GR00T N2 ou Helix. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans partenaire industriel, plateforme robotique ni déploiement cités dans le résumé, et donc sans validation par les pairs ni démonstration matérielle rapportées pour l'instant.

RecherchePaper
1 source
Contrôle de trajectoire par vision pour robots mobiles via un cadre d'apprentissage hiérarchique
4arXiv cs.RO 

Contrôle de trajectoire par vision pour robots mobiles via un cadre d'apprentissage hiérarchique

Une équipe de recherche propose un nouveau cadre hiérarchique pour piloter des robots mobiles lourds vers un objectif de navigation, en combinant localisation visuelle, apprentissage par renforcement et contrôle adaptatif robuste. Le système repose sur quatre couches : une estimation de pose par vision stéréo en temps réel (avec fermeture de boucle, fusion de cartes et relocalisation), un planificateur de mouvement entraîné par apprentissage par renforcement (RL) sous contraintes, un contrôle adaptatif robuste (RAC) au niveau des actionneurs, et une logique de supervision de sécurité avec retour automatique. Le planificateur RL génère des trajectoires lisses et réalisables grâce à une fonction de récompense conçue pour favoriser la progression vers l'objectif tout en respectant les limites mécaniques d'un robot lourd à direction par glissement (skid-steered). Au niveau des roues, un réseau de neurones entraîné par gradient conjugué à échelle variable (SCG) approxime la relation quasi-statique entre vitesse de roue et commande nominale, complétée par un contrôleur adaptatif à barrière logarithmique qui compense les erreurs de modélisation, le glissement et les écarts résiduels. Testé sur un robot de 6000 kg roulant sur asphalte et sol meuble, le système atteint une erreur quadratique moyenne de position finale d'environ 3 à 4 cm, avec un suivi précis des commandes générées par le RL et une récupération autonome réussie après injection de pannes simulées. Ce résultat s'inscrit dans une préoccupation centrale de la robotique mobile industrielle : rendre l'apprentissage par renforcement, réputé difficile à certifier pour un déploiement sûr à grande échelle à cause de sa phase d'exploration, compatible avec des engins lourds où une erreur de trajectoire ou une perte de contrôle peut avoir des conséquences physiques importantes. En couplant le RL à un contrôle adaptatif prouvé mathématiquement stable (convergence exponentielle vers un ensemble résiduel borné, sous incertitude bornée) et à une supervision de sécurité qui bascule automatiquement le robot en mode retour en cas d'anomalie, les auteurs cherchent à combler l'écart entre performance d'apprentissage et garanties de sécurité exigées pour les AMR (robots mobiles autonomes) lourds opérant en extérieur, sur terrain irrégulier. L'article, disponible sur arXiv (identifiant 2601.00610, version de remplacement), s'inscrit dans la lignée des travaux combinant localisation par vision stéréo et contrôle hiérarchique pour la navigation robotique, un domaine où la plupart des démonstrations RL restent cantonnées à la simulation ou à des plateformes légères. La validation sur un engin de 6000 kg, testé en conditions réelles sur deux types de terrain avec injection de pannes, positionne ce travail comme une contribution empirique rare dans le passage du RL du laboratoire vers des applications industrielles à fort enjeu de sécurité.

RecherchePaper
1 source