Optimisation générative guidée par un modèle et sensible à la géométrie pour la planification de locomotion sous contraintes
Des chercheurs publient sur arXiv (2610.07772) une méthode baptisée 2GO, pour Model-Based Geometry-Aware Generative Optimization, destinée à la planification de locomotion sous contraintes (Constrained Locomotion Planning, CLP) de quadrupèdes et d'humanoïdes. Le robot doit y respecter en même temps l'évitement de collisions, la cohérence des contacts, la faisabilité cinématique et les contraintes de support. 2GO s'appuie sur les approches Model-Based Diffusion (MBD), qui traitent l'optimisation de trajectoire comme un échantillonnage a posteriori. Ces approches utilisent la dynamique connue et des rollouts Monte Carlo pour estimer analytiquement la fonction de score de débruitage, sans apprentissage à partir de démonstrations. Trois mécanismes transforment la géométrie des contraintes actives en opérateurs de débruitage exécutables : une métrique modelée par les normales aux contraintes, un filtrage stochastique dans l'espace tangent et une rétraction fondée sur CFS. 2GO découple aussi le transport génératif de la stochasticité inverse grâce à un calendrier adaptatif qui mêle diffusion et dynamique de type flow. Les essais portent sur la sélection discrète de points d'appui et sur la planification continue de posture. Les auteurs annoncent de meilleurs taux de succès, moins de violations de contraintes et une meilleure compatibilité à l'exécution.
L'intérêt est surtout méthodologique. La planification de locomotion sous contraintes reste un point dur des quadrupèdes et des humanoïdes, car la dynamique est de grande dimension et les environnements sont très non convexes (escaliers, terrains discontinus, appuis rares). 2GO suit une voie différente des politiques apprises par imitation ou par apprentissage par renforcement : elle réutilise le modèle physique et se passe de données de démonstration, ce qui retire un coût de collecte. L'idée centrale est que la géométrie des contraintes actives doit orienter la direction du score et le bruit injecté, au lieu d'être traitée comme une simple pénalité. Pour un intégrateur, la promesse est une planification plus fiable aux contacts, où se concentrent les échecs sur terrain réel.
Il faut toutefois rester prudent. Le résumé ne donne aucun chiffre : ni taux de succès, ni temps de calcul, ni comparaison chiffrée, ni plateforme matérielle. Rien n'indique non plus si les essais ont eu lieu uniquement en simulation, et la question du temps réel, décisive pour un déploiement embarqué, n'est pas abordée. Il s'agit d'un preprint non évalué par les pairs, sans produit ni déploiement associé.
Le travail prolonge les variantes contraintes de MBD, qui intégraient déjà la faisabilité dans les rollouts de score. Les auteurs leur reprochent l'absence de géométrie de contrainte modulée par la tâche et l'usage d'un transport inverse déterministe de type DDPM, sans ordonnancement adaptatif. Il se place face aux approches de diffusion apprise et aux politiques VLA, qui visent plutôt la manipulation et le comportement de haut niveau. Les prochaines étapes à surveiller sont la publication du code, des benchmarks chiffrés et une validation sur robot physique.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




