Aller au contenu principal
RecherchearXiv cs.RO 

Optimisation générative guidée par un modèle et sensible à la géométrie pour la planification de locomotion sous contraintes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.07772) une méthode baptisée 2GO, pour Model-Based Geometry-Aware Generative Optimization, destinée à la planification de locomotion sous contraintes (Constrained Locomotion Planning, CLP) de quadrupèdes et d'humanoïdes. Le robot doit y respecter en même temps l'évitement de collisions, la cohérence des contacts, la faisabilité cinématique et les contraintes de support. 2GO s'appuie sur les approches Model-Based Diffusion (MBD), qui traitent l'optimisation de trajectoire comme un échantillonnage a posteriori. Ces approches utilisent la dynamique connue et des rollouts Monte Carlo pour estimer analytiquement la fonction de score de débruitage, sans apprentissage à partir de démonstrations. Trois mécanismes transforment la géométrie des contraintes actives en opérateurs de débruitage exécutables : une métrique modelée par les normales aux contraintes, un filtrage stochastique dans l'espace tangent et une rétraction fondée sur CFS. 2GO découple aussi le transport génératif de la stochasticité inverse grâce à un calendrier adaptatif qui mêle diffusion et dynamique de type flow. Les essais portent sur la sélection discrète de points d'appui et sur la planification continue de posture. Les auteurs annoncent de meilleurs taux de succès, moins de violations de contraintes et une meilleure compatibilité à l'exécution.

L'intérêt est surtout méthodologique. La planification de locomotion sous contraintes reste un point dur des quadrupèdes et des humanoïdes, car la dynamique est de grande dimension et les environnements sont très non convexes (escaliers, terrains discontinus, appuis rares). 2GO suit une voie différente des politiques apprises par imitation ou par apprentissage par renforcement : elle réutilise le modèle physique et se passe de données de démonstration, ce qui retire un coût de collecte. L'idée centrale est que la géométrie des contraintes actives doit orienter la direction du score et le bruit injecté, au lieu d'être traitée comme une simple pénalité. Pour un intégrateur, la promesse est une planification plus fiable aux contacts, où se concentrent les échecs sur terrain réel.

Il faut toutefois rester prudent. Le résumé ne donne aucun chiffre : ni taux de succès, ni temps de calcul, ni comparaison chiffrée, ni plateforme matérielle. Rien n'indique non plus si les essais ont eu lieu uniquement en simulation, et la question du temps réel, décisive pour un déploiement embarqué, n'est pas abordée. Il s'agit d'un preprint non évalué par les pairs, sans produit ni déploiement associé.

Le travail prolonge les variantes contraintes de MBD, qui intégraient déjà la faisabilité dans les rollouts de score. Les auteurs leur reprochent l'absence de géométrie de contrainte modulée par la tâche et l'usage d'un transport inverse déterministe de type DDPM, sans ordonnancement adaptatif. Il se place face aux approches de diffusion apprise et aux politiques VLA, qui visent plutôt la manipulation et le comportement de haut niveau. Les prochaines étapes à surveiller sont la publication du code, des benchmarks chiffrés et une validation sur robot physique.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Mouvement basé sur la diffusion, guidé par un modèle : optimisation sous contraintes et planification adaptative
1arXiv cs.RO 

Mouvement basé sur la diffusion, guidé par un modèle : optimisation sous contraintes et planification adaptative

Le laboratoire de recherche à l'origine du papier arXiv:2607.14455 (publié le 17 juillet 2026, catégorie "new") présente MD-COAS, une méthode de planification de trajectoire pour robot unique dans des environnements fortement non convexes et contraints. Le système s'appuie sur le Model-Based Diffusion (MBD), une approche récente qui traite la planification comme un tirage d'échantillons dans une distribution a posteriori sur des trajectoires, en utilisant la dynamique connue du robot pour estimer analytiquement la fonction de score à partir de rollouts, sans apprentissage par démonstration. MD-COAS combine deux mécanismes jusqu'ici traités séparément dans la littérature : une méthode de Lagrangien augmenté inexact (iALM), qui agit comme un prior de diffusion "souple" pour la sécurité, et un opérateur de projection "dur" basé sur un ensemble convexe faisable (CFS). L'algorithme ordonnance et co-optimise ces deux mécanismes de façon adaptative, en les couplant à la planification du bruit de diffusion lui-même. Les auteurs le valident sur des benchmarks 2D générés aléatoirement à forte non-convexité et sur une tâche d'évitement d'obstacles pour un bras robotique à 7 degrés de liberté. Pour l'industrie robotique, ce travail s'attaque à un problème concret : garantir des trajectoires sans collision, dynamiquement faisables et respectant des contraintes de tâche, tout en restant calculable en temps raisonnable. Les approches purement "souples" (contraintes ajoutées au coût) échouent parfois à garantir la sécurité, tandis que les projections "dures" peuvent bloquer la convergence ou dégrader la qualité de trajectoire. Unifier les deux, avec un ordonnancement qui s'adapte au fil du débruitage, vise justement ce compromis, pertinent pour les intégrateurs de bras industriels ou de robots mobiles évoluant en environnement encombré. Les auteurs rapportent des taux de sécurité et de succès supérieurs, une convergence plus rapide et des coûts finaux plus bas que les planificateurs de référence, mais ces gains restent mesurés sur des benchmarks contrôlés, pas en conditions industrielles réelles. Le papier s'inscrit dans la lignée des travaux sur le Model-Based Diffusion appliqué à la planification de mouvement sous contraintes, un axe de recherche encore jeune qui rivalise avec les méthodes classiques d'optimisation de trajectoire (MPC, RRT*, CHOMP) et les planificateurs par diffusion appris par démonstration. Les auteurs positionnent MD-COAS comme une réponse aux limites des variantes MBD contraintes précédentes, sans toutefois annoncer de déploiement matériel ni de calendrier de transfert vers un robot physique au-delà du bras 7-DDL testé en simulation ou banc d'essai.

RecherchePaper
1 source
EmoPose : génération de gestes sensibles aux émotions guidée par un modèle vision-langage pour robots humanoïdes
2arXiv cs.RO 

EmoPose : génération de gestes sensibles aux émotions guidée par un modèle vision-langage pour robots humanoïdes

Un article publié sur arXiv (2609.23414v1) présente EmoPose, un système associant un modèle vision-langage (VLM) et un contrôleur robotique déterministe pour générer des gestes porteurs d'émotion chez les robots humanoïdes : à partir d'un texte, d'un historique de dialogue et d'un contexte visuel optionnel, le VLM choisit un plan de gestes ordonné (classe communicative, variante, intensité, point d'ancrage vocal), puisé dans une bibliothèque de mouvements propre au robot qui fournit des cibles articulaires à 14 degrés de liberté (DoF). L'outil Pose Studio génère automatiquement les trajectoires, les prévisualise sous le simulateur MuJoCo et synchronise les nouvelles entrées avec le guide du VLM, tandis que des modules déterministes côté robot valident les plans, construisent les trajectoires et gèrent l'ordonnancement, la mise en file et l'interruption des gestes. Sur le banc d'essai EmoPose-Bench, une planification structurée avec GPT-5.5 atteint 98,25 % (± 0,52) sur le niveau facile et 76,50 % (± 0,54) au global, un score supérieur à un prompting à étiquette directe avec le même modèle. Le système exécute la suite nominale sous MuJoCo et reproduit les 29 variantes de la bibliothèque sur un robot Unitree G1 physique, démontré lors d'une visite de laboratoire en quatre étapes mêlant narration expressive avec interruption, dialogue ancré sur la caméra et navigation. Cette architecture répond à un problème concret pour les intégrateurs : confier le contrôle articulaire brut à un modèle de fondation reste imprévisible, tandis qu'un robot purement scripté manque de flexibilité sociale. En cantonnant le VLM à un rôle de sélection sémantique dans une bibliothèque de mouvements pré-validée et en laissant le contrôle bas niveau à des modules déterministes, EmoPose permet d'étendre le répertoire expressif à de nouveaux contextes sociaux sans modifier l'interface de contrôle ni recertifier la sécurité du mouvement. C'est un argument dans le débat sur le passage à l'échelle des modèles vision-langage-action (VLA) : plutôt que de démontrer qu'un VLA génère directement des trajectoires fiables de bout en bout, les auteurs montrent qu'un VLM peut piloter une bibliothèque de gestes pré-validés, approche plus proche de ce qu'un intégrateur industriel peut auditer et déployer en sécurité. Les chiffres de précision restent néanmoins issus d'un benchmark maison et d'une démonstration en laboratoire contrôlé, pas d'un déploiement en conditions réelles à grande échelle. EmoPose s'inscrit dans la vague de travaux cherchant à combler l'écart entre les modèles vision-langage-action généralistes, tels Pi-0 ou GR00T N2, et le besoin d'un contrôle fiable et spécifique à chaque corps physique ; contrairement à ces approches de génération de mouvement de bout en bout, EmoPose sépare explicitement raisonnement social et exécution motrice. Le choix du Unitree G1, plateforme humanoïde largement utilisée par les laboratoires de recherche pour son coût accessible, souligne la nature académique de la démonstration plutôt qu'un déploiement commercial. Les auteurs ne mentionnent ni partenaire industriel ni calendrier de commercialisation : à ce stade, la publication reste une validation de méthode sur banc d'essai et lors d'une visite de laboratoire, sans pilote client ni déploiement annoncé en environnement réel.

RecherchePaper
1 source
Métriques riemanniennes induites pour la planification de mouvement sous contraintes
3arXiv cs.RO 

Métriques riemanniennes induites pour la planification de mouvement sous contraintes

Publié le 23 septembre 2026 sur arXiv sous la référence 2609.25695v1, un article de recherche en planification de mouvement robotique s'attaque à un problème classique : quand des contraintes de tâche ou de fermeture de boucle cinématique réduisent l'espace de configuration d'un robot à une sous-variété courbe de dimension inférieure, la métrique utilisée pour mesurer la longueur d'un chemin, euclidienne, à coût uniforme dans toutes les directions, ou riemannienne, comme l'énergie cinétique, à coût variable selon la direction et la configuration, donnait jusqu'ici des résultats différents selon que la contrainte était représentée implicitement (comme un ensemble de niveau, associé à la métrique euclidienne) ou explicitement (via une paramétrisation, associée à la métrique du domaine des paramètres). Les auteurs proposent une métrique dite induite, héritée directement de la métrique riemannienne de l'espace de configuration complet, et démontrent que les deux représentations produisent alors exactement la même géométrie, quelle que soit la métrique riemannienne retenue. Ils l'intègrent dans un planificateur par échantillonnage et dans un optimiseur de trajectoire, puis testent l'approche sur un montage de manipulation bimanuelle avec deux bras robotiques Franka (Franka Robotics, entreprise allemande) soumis à des contraintes sur l'effecteur, en comparant métrique euclidienne et métrique d'énergie cinétique. Ce découplage compte pour quiconque conçoit des planificateurs de manipulation contrainte, assemblage bimanuel, tâches à chaîne cinématique fermée, coordination multi-bras, où le choix jusqu'ici arbitraire entre représentation implicite et explicite biaisait silencieusement les trajectoires calculées, indépendamment du comportement physique réel du robot. La garantie théorique de cohérence géométrique permet désormais d'utiliser des métriques physiquement significatives, comme l'énergie cinétique, plutôt que la seule distance euclidienne par défaut, souvent mal adaptée aux robots à forte inertie ou à géométrie complexe, sans changer d'architecture logicielle puisque la méthode s'insère aussi bien dans un planificateur par échantillonnage que dans un optimiseur de trajectoire existant. Il s'agit d'une contribution méthodologique, sans vidéo ni chiffre de taux de succès ou de temps de cycle à l'appui, ce qui limite pour l'instant l'évaluation de son impact pratique concret. Ce travail s'inscrit dans la lignée des recherches sur la planification sur variétés contraintes, un champ où les méthodes d'atlas tangents et les planificateurs de type CBiRRT gèrent depuis longtemps la géométrie de la contrainte mais laissaient jusqu'ici la question de la métrique de côté. Il fait aussi écho aux travaux sur les politiques de mouvement riemanniennes, qui exploitent déjà des métriques non euclidiennes mais dans des espaces non contraints. La validation reste limitée à un seul banc d'essai, deux bras Franka en manipulation bimanuelle, sans portage annoncé vers une bibliothèque de planification largement utilisée comme MoveIt ou OMPL, ni calendrier de suivi précisé par les auteurs.

UELe montage expérimental repose sur des bras robotiques Franka Robotics, fabricant allemand largement utilisé dans les laboratoires de recherche européens en robotique.

RecherchePaper
1 source
Champs de risque sémantique guidés par un modèle fondation et sensibles à la topologie pour la manipulation
4arXiv cs.RO 

Champs de risque sémantique guidés par un modèle fondation et sensibles à la topologie pour la manipulation

Des chercheurs proposent un champ de risque sémantique 3D pour la planification de mouvement en manipulation, publié sur arXiv (2609.36640v1). Le système attribue à chaque paire objet manipulé / objet de la scène six poids de risque directionnels, ainsi qu'une échelle de décroissance spatiale propre à la paire, tous produits par un modèle de fondation. Ces a priori sont fusionnés avec la géométrie 3D voxelisée de la scène par un « shielding » sensible à la topologie (un obstacle protège l'objet sensible) et par une décroissance spatiale géodésique, c'est-à-dire mesurée le long des chemins réellement praticables. Un backend parallélisé sur GPU regroupe les calculs de distance et de risque par objet pour construire un champ 3D dense, utilisable comme terme de coût modulaire par n'importe quel planificateur en aval. L'évaluation porte sur trois scénarios domestiques en simulation, sur le comportement du shielding face à des barrières complètes ou partielles, et sur la comparaison avec une base de référence à a priori sémantiques calculés pixel par pixel. Les auteurs évaluent aussi le coût de calcul et la fiabilité du pipeline. Le résumé ne donne aucun chiffre précis (temps de calcul, taux de réduction d'exposition), et il n'indique ni le modèle de fondation utilisé ni de test sur robot réel. L'enjeu est de dépasser l'évitement de collision, qui traite tous les contacts et toutes les proximités de façon équivalente. Dans un foyer, passer un couteau au-dessus d'un ordinateur portable ou d'une assiette n'a pas le même risque que le passer près d'un mur. Les modèles de fondation peuvent fournir ce jugement contextuel, mais leurs sorties restent difficiles à intégrer dans un planificateur qui exige des garanties géométriques strictes. Ce travail répond à cette tension en séparant les deux niveaux. Les contraintes dures restent géométriques, et le risque sémantique entre comme un coût doux, ce qui préserve la modularité. Pour les intégrateurs, c'est une piste vers des manipulateurs de service plus acceptables en environnement non structuré. Il faut toutefois rester prudent : les résultats sont uniquement simulés, et la mesure principale, une « exposition sémantique » plus faible que celle de trajectoires sans risque sémantique, dépend de la définition choisie par les auteurs. Rien ne prouve encore que les poids produits par le modèle soient fiables ou reproductibles hors simulation. Ce travail s'inscrit dans la vague des approches qui associent modèles vision-langage et planification, comme les champs de valeur 3D de type VoxPoser ou les contraintes spécifiées par langage naturel. La plupart projettent la sémantique en 2D ou l'ignorent dans la topologie de la scène, ce que la base de comparaison pixel par pixel illustre ici. Les prochaines étapes probables sont une validation sur bras réel, un test sur des scènes encombrées et dynamiques, et une intégration avec des politiques VLA (vision-langage-action) de type Pi-0 ou GR00T. Aucun calendrier de déploiement ni partenaire industriel n'est annoncé, et il s'agit d'un préprint non évalué par des pairs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source