Aller au contenu principal
RecherchearXiv cs.RO 

Arrêt anticipatif d'un gardien robot par arrêt optimal monotone

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 22 septembre 2026 sur arXiv (arXiv:2609.23976v1) une méthode baptisée "monotone optimal stopping" (MOS), destinée à résoudre un problème classique en robotique dynamique : déterminer le moment optimal pour qu'un robot déclenche un mouvement d'interception avant de connaître avec certitude la trajectoire d'une cible, comme un gardien de but qui doit plonger avant de voir où part réellement le tir. L'équipe applique cette méthode à un robot quadrupède entraîné par apprentissage par renforcement pour effectuer des arrêts de type gardien de but. Le contrôleur de sauvegarde (save controller) reste fixe et en boucle fermée ; c'est MOS qui décide du moment d'activation, en modélisant la décision comme un problème d'arrêt optimal à horizon fini conditionné par la politique. Plutôt que de prédire un instant de déclenchement ou de se fier à un score de confiance, l'algorithme apprend directement, via une récursion de Bellman, l'avantage attendu d'agir immédiatement plutôt que d'attendre une observation supplémentaire, avec une contrainte de monotonie liée à l'urgence physique. En simulation, MOS porte le taux de réussite moyen des arrêts de 67,7% à 74,4% par rapport à une porte de décision apprise à paramètres équivalents, et augmente les arrêts dits "réversal" (changement de direction en cours d'action) de 52,1% à 66,5%. Des essais sur robot réel confirment une interception rapide avec correction de trajectoire après déclenchement, même face à des feintes humaines sur la direction du tir.

L'intérêt pour l'industrie robotique dépasse le seul cas du gardien de but : ce travail s'attaque frontalement au compromis entre réactivité et fiabilité de perception qui limite aujourd'hui les robots dans toute interaction physique rapide avec un agent dont l'intention n'est pas figée, qu'il s'agisse de collaboration homme-robot en usine, de préhension d'objets en mouvement ou de sécurité en environnement partagé. En formalisant le timing de déclenchement comme un problème d'arrêt optimal plutôt que comme une simple heuristique de seuil ou un réseau de confiance, la méthode offre une garantie théorique (erreur d'approximation bornée sous condition de "single-crossing") qui manque généralement aux approches purement apprises, un argument que les intégrateurs cherchant à certifier des comportements robotiques en temps réel jugeront pertinent.

Le papier s'inscrit dans la lignée des travaux combinant apprentissage par renforcement et contrôle optimal pour la locomotion dynamique de robots quadrupèdes, un axe de recherche actif depuis plusieurs années autour de la robustesse des politiques apprises face à l'incertitude perceptive. Contrairement aux démonstrations de plateformes commerciales de robots humanoïdes ou quadrupèdes, il s'agit ici d'une contribution méthodologique publiée en preprint, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement ; les auteurs présentent leurs résultats comme des études de simulation étendues complétées par des expériences physiques limitées, sans préciser de suites commerciales à ce stade.

Dans nos dossiers

À lire aussi

Contrôle optimal d'un robot nageur basé sur le modèle du micronageur de Purcell
1arXiv cs.RO 

Contrôle optimal d'un robot nageur basé sur le modèle du micronageur de Purcell

Des chercheurs ont construit une réalisation robotique a l'échelle macroscopique du nageur de Purcell, un modèle théorique classique de locomotion planaire a bas nombre de Reynolds compose de trois segments rigides relies par deux articulations rotatives actionnées. Le prototype se déplace dans un fluide fortement visqueux qui reproduit le régime hydrodynamique ou l'inertie devient négligeable face aux forces visqueuses, celui dans lequel évoluent les micro-organismes nageurs. L'équipe a modifie le modèle original de Purcell en introduisant des segments non élancés et une sphère rigide centrale représentant la traînée additionnelle du flotteur du robot, puis a calibre les paramètres sur des mesures expérimentales réelles plutôt que sur de la simulation pure. Elle a ensuite applique le principe du maximum de Pontryagin (PMP) pour calculer les allures periodiques des deux angles articulaires qui maximisent le déplacement par cycle sous contrainte d'amplitude angulaire, a l'aide d'une méthode géométrique différentielle qui transforme le problème en intégrale d'aire délimitée par la trajectoire de l'allure dans le plan des angles, permettant une lecture visuelle des changements topologiques des allures optimales. Le même formalisme PMP, applique cette fois a la maximisation du rendement énergétique de Lighthill, produit un problème aux limites résolu via une paramétrisation en série de Fourier tronquée et le solveur GPOPS-II. L'intérêt de ces travaux tient moins a une prouesse d'ingénierie qu'a une validation expérimentale rare : le contrôle optimal de gaits, jusqu'ici surtout étudie en simulation, est ici confronte a un prototype physique calibre, avec une géométrie modifiée pour tenir compte d'un composant réel non prévu par la théorie initiale (le flotteur). Pour la robotique bio-inspirée et les micro-nageurs destines a l'exploration sous-marine ou a l'administration ciblée de médicaments, cela renforce la crédibilité d'une approche de contrôle géométrique déjà ancienne mais encore peu testée hors laboratoire théorique. C'est aussi un rappel que l'écart simulation-réalité, souvent cite pour les systèmes VLA ou les humanoïdes, existe tout autant en micro-robotique de locomotion, ou la calibration expérimentale change concrètement les allures jugées optimales. Le modèle de Purcell remonte a l'article fondateur d'Edward Purcell sur la locomotion a bas nombre de Reynolds, largement repris depuis en théorie du contrôle géométrique applique a la nage articulée. La plupart des études antérieures restaient cantonnées a l'analyse mathématique ou a la simulation numérique ; peu proposaient une réalisation matérielle calibrée servant de banc d'essai au contrôle optimal. L'article, publie en preprint sur arXiv (2608.17455v1), ne mentionne ni partenaire industriel ni feuille de route de déploiement : il s'agit d'un travail de recherche fondamentale, dont la suite logique serait l'extension a des géométries de nageurs a plus de liens ou a des environnements fluides moins idéaux.

RecherchePaper
1 source
Event-Time : commande optimale hybride pour les services de tennis de table par un robot
2arXiv cs.RO 

Event-Time : commande optimale hybride pour les services de tennis de table par un robot

Des chercheurs présentent une nouvelle méthode de contrôle optimal pour générer des services robotises au tennis de table, appliquée et testée sur un bras industriel KUKA Agilus. L'approche, baptisée "évent-time hybrid optimal control", formule le service comme un problème de contrôle optimal (OCP) hybride qui optimise simultanément la vitesse et l'orientation d'impact de la raquette ainsi que les instants du rebond sur la table, du franchissement du filet et de l'atterrissage de la balle, ces instants étant traites comme des variables libres plutôt que des pas de temps fixes. Un second OCP convertit ensuite ces paramètres en une trajectoire de bras complètement réalisable, en respectant les limites de position, de vitesse et de couple articulaires du robot. Compare a une formulation classique a pas de temps fixe avec localisation des racines, la méthode réduit le temps de calcul médian d'un facteur 4,1, tout en conservant une précision d'atterrissage, une précision de spin et un taux de validité des services comparables. Sur robot réel, les essais ont produit des services avec topspin, backspin et effet latéral, pour une erreur moyenne d'atterrissage de 13,1 cm (ecart-type 7,3 cm) et des vitesses de rotation de balle allant jusqu'a 30 tours par seconde. Pour l'industrie robotique, ce travail illustre comment rendre tractable en temps réel un contrôle optimal hybride, c'est-a-dire un contrôle qui gère a la fois une dynamique continue (vol de la balle, mouvement du bras) et des événements discrets contraignants (impact raquette-balle, rebond, franchissement du filet). Diviser par quatre le temps de résolution sans perdre en précision est directement pertinent pour toute application manipulant des contacts et impacts rapides sous contrainte temporelle stricte, au-delà du seul tennis de table. Le fait que la validation ait été menée sur un bras industriel standard, et non sur un actionneur spécialisé de laboratoire, suggère une portabilité plus large de la méthode. Il s'agit toutefois d'un travail de recherche publie en preprint, sans annonce de produit ni de déploiement commercial, et les résultats reposent sur un seul robot et un jeu d'essais limite. Le service au tennis de table est plus complexe qu'un simple échange car il doit satisfaire plusieurs contraintes hybrides combinées, rebond du bon cote, franchissement du filet, zone d'atterrissage cible, ce qui justifie le recours a une optimisation conjointe des temps d'événement plutôt qu'a une simple planification de trajectoire. Cette approche s'inscrit dans la lignée des recherches en contrôle optimal pour la manipulation robotique dynamique, en contraste avec la tendance actuelle vers des modèles vision-langage-action appris de bout en bout. Publie sous la référence arXiv:2608.08157v1, l'article ne mentionne ni partenaire industriel ni calendrier de déploiement ; les prochaines étapes attendues concernent l'extension a des échanges complets au-delà du seul service, ainsi que la validation sur davantage de configurations robotiques.

UELa méthode est validée sur un bras industriel KUKA Agilus, fabricant allemand, mais aucun partenariat ni déploiement européen n'est annoncé.

RecherchePaper
1 source
RoboDreamer : la locomotion humanoïde anticipative par modèles d'état prédictifs
3arXiv cs.RO 

RoboDreamer : la locomotion humanoïde anticipative par modèles d'état prédictifs

Des chercheurs ont mis en ligne une version révisée d'un article arXiv (identifiant 2609.07096v2) intitulé "RoboDreamer: Anticipatory Humanoid Locomotion with Predictive State-Space Models", qui décrit une méthode de contrôle de la marche bipède robuste face à des capteurs imparfaits. Le système s'appuie sur un entraînement en deux temps: un modèle "enseignant" apprend d'abord sur des observations propres et complètes, puis un modèle "élève" est distillé à partir de ce premier en ne recevant que des observations récentes partiellement masquées de façon continue et aléatoire, ce qui force la politique de contrôle à reconstituer l'état manquant à partir de l'historique de mouvement. À l'inférence, cette même interface de masquage sert aussi à affiner les actions en boucle fermée de manière implicite et, en option, à regrouper plusieurs pas d'action consécutifs (action chunking). L'architecture repose sur Mamba, un modèle à espace d'états, comme colonne vertébrale temporelle. Des ablations comparatives menées dans les simulateurs IsaacLab et MuJoCo, puis directement sur un robot humanoïde Unitree G1, montrent un suivi de mouvement robuste malgré le masquage d'observations, avec un déploiement réel réussi en latence temps réel. Pour l'industrie robotique, ce travail cible un verrou concret du déploiement des humanoïdes: la dégradation, le bruit ou les retards de capteurs en conditions réelles, qui font souvent échouer des politiques entraînées sur des observations propres en simulation. En montrant qu'un entraînement par masquage temporel et distillation comble une grande partie de l'écart de robustesse, et que Mamba n'apporte qu'un gain complémentaire de suivi tout en tenant le temps réel, l'étude nuance l'idée que seule l'architecture du réseau (transformer, VLA) explique la performance: la stratégie d'entraînement compte au moins autant. Ce travail s'inscrit dans la lignée des méthodes de distillation enseignant-élève déjà utilisées pour la locomotion des robots à pattes, en y ajoutant un mécanisme inspiré des "world models" prédictifs. Le choix du Unitree G1, plateforme largement adoptée par les laboratoires de recherche pour sa disponibilité et son coût, en fait un banc d'essai courant plutôt qu'un partenariat commercial annoncé. Le statut de "replace" sur arXiv indique une révision d'un article déjà soumis, sans calendrier de commercialisation ni d'industrialisation communiqué à ce stade.

RecherchePaper
1 source
Optimisation par consensus (CBO) : vers une optimalité globale en robotique
4arXiv cs.RO 

Optimisation par consensus (CBO) : vers une optimalité globale en robotique

Une équipe de chercheurs a publié sur arXiv (référence 2602.06868v2) une adaptation de l'optimisation par consensus, CBO, pour Consensus-Based Optimization, aux problèmes de trajectoires et de politiques de contrôle en robotique. Contrairement aux méthodes zéro-ordre dominantes dans le domaine, notamment MPPI (Model Predictive Path Integral), CEM (Cross-Entropy Method) et CMA-ES (Covariance Matrix Adaptation Evolution Strategy), le CBO dispose d'une garantie formelle de convergence vers un optimum global sous des hypothèses dites légères. Les auteurs l'ont évalué sur trois scénarios représentatifs : un problème à horizon long pour un système simple, un problème d'équilibre dynamique pour un système fortement sous-actionné, et un problème à haute dimension avec uniquement un coût terminal. Sur ces trois configurations, CBO obtient des coûts inférieurs à ceux des méthodes existantes. L'enjeu est significatif pour l'ingénierie robotique avancée. Les méthodes zéro-ordre actuelles sont prisées précisément parce qu'elles évitent le calcul de gradients analytiques, coûteux ou impossibles en présence de contacts discontinus. Mais leur défaut structurel est d'estimer ce gradient localement, les rendant vulnérables aux optima locaux dès que le paysage de coût est non convexe. Ce phénomène se manifeste concrètement pour les robots à pattes, les manipulateurs en espaces encombrés, ou tout système à dynamiques hybrides. Un optimiseur offrant une garantie d'optimalité globale pourrait renforcer la robustesse des planificateurs de trajectoires, en particulier dans les boucles MPC (Model Predictive Control) embarquées. Il faut cependant noter que les résultats présentés sont exclusivement issus de simulations : aucune validation sur matériel réel n'est rapportée dans cette version de l'article. Le CBO est issu de la littérature mathématique sur les systèmes de particules en interaction, développé initialement pour l'optimisation en finance et en apprentissage automatique. Son introduction en robotique s'inscrit dans une tendance plus large : après que MPPI a prouvé sa viabilité sur plateformes réelles, notamment en manipulation chez Google DeepMind et en locomotion chez ANYbotics, la communauté cherche des variantes offrant de meilleures garanties de convergence. Les prochaines étapes naturelles concernent l'intégration dans des frameworks MPC temps-réel et la validation sur hardware, conditionnée à la compatibilité des temps de calcul du CBO avec les fréquences de contrôle embarquées, typiquement supérieures à 100 Hz sur les systèmes à pattes.

RecherchePaper
1 source