Aller au contenu principal
RecherchearXiv cs.RO 

Contrôle en temps réel par DDP contraint pour l'équilibre sous-actionné des robots à pattes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ABC-DDP, un framework de "Differential Dynamic Programming" (DDP) sous contraintes de commande, conçu pour le contrôle en temps réel de robots à pattes sous-actionnés. Publié sur arXiv sous la référence 2608.18552, le papier propose une méthode basée sur un gradient projeté accéléré (APG) qui calcule les solutions contraintes et identifie les ensembles actifs sans recourir à des inversions répétées des conditions de Karush-Kuhn-Tucker (KKT), un goulot d'étranglement classique du DDP standard. Une "contrainte virtuelle" est intégrée dans un schéma de tir multiple orienté faisabilité, permettant une optimisation stable même à partir d'initialisations dynamiquement infaisables. En simulation, la méthode pilote un robot quadrupède via un contrôle prédictif de modèle (MPC) à horizon court fonctionnant en temps réel : elle démontre une station debout stable sur deux pattes face à des perturbations externes, ainsi qu'un catwalk lent, une marche verticale et une course à haute vitesse, le tout au sein d'un unique cadre MPC unifié. Les auteurs revendiquent la première démonstration d'une station debout statique sur deux pattes d'un quadrupède obtenue par MPC temps réel à horizon fini.

Le résultat cible un problème concret pour les concepteurs de contrôleurs de robots à pattes : le DDP classique gère mal les contraintes de commande (couple, position articulaire) sans alourdir considérablement le calcul, ce qui limite son usage en boucle temps réel sur des robots humanoïdes ou quadrupèdes. En évitant les inversions KKT répétées, ABC-DDP promet une charge de calcul compatible avec des cadences MPC élevées, même dans des régimes fortement sous-actionnés comme la station debout sur deux membres, un cas extrême d'instabilité pour un quadrupède. Il s'agit toutefois pour l'instant de résultats exclusivement en simulation : aucun déploiement sur robot physique n'est rapporté, et la robustesse aux incertitudes de modèle, au bruit des capteurs ou aux délais matériels réels reste à démontrer avant toute application industrielle.

Le DDP est une technique d'optimisation de trajectoire largement utilisée dans le contrôle prédictif des robots à pattes, mais sa version classique peine historiquement à intégrer des contraintes de commande explicites sans recourir à des solveurs coûteux, ce qui pousse souvent les équipes vers des approximations ou des architectures hybrides. ABC-DDP s'inscrit dans cette lignée de travaux cherchant à fiabiliser le MPC temps réel pour la locomotion dynamique, un axe de recherche partagé par les laboratoires travaillant sur les quadrupèdes et les humanoïdes. Le papier, publié en août 2026 en tant que preprint arXiv, ne mentionne ni entreprise ni plateforme matérielle spécifique : il s'agit d'une contribution académique en optimisation de contrôle. Les suites attendues, non détaillées dans l'article, seraient une validation expérimentale sur robot physique et une extension à des morphologies bipèdes ou humanoïdes, où la sous-actuation pose des défis similaires, voire plus sévères.

Dans nos dossiers

À lire aussi

Contrôle neuronal : l'apprentissage adjoint par contraintes d'équilibre
1arXiv cs.RO 

Contrôle neuronal : l'apprentissage adjoint par contraintes d'équilibre

Une équipe de chercheurs a publié en mai 2026 sur arXiv (référence 2605.03288) un framework de contrôle baptisé "Neural Control", conçu pour piloter des systèmes physiques régis par des contraintes d'équilibre implicite. La cible principale est la manipulation d'objets linéaires déformables (DLO, deformable linear objects) tels que câbles, fils ou tuyaux flexibles. Dans ces systèmes, le robot n'actionne qu'un sous-ensemble de degrés de liberté (DoF de frontière), tandis que les DoF libres restants convergent vers une configuration d'énergie potentielle minimale. La difficulté centrale réside dans la multi-stabilité : pour les mêmes conditions aux limites, un câble peut atteindre plusieurs formes d'équilibre distinctes selon la trajectoire d'actionnement suivie. Neural Control résout ce problème en calculant des gradients proxy à travers les conditions d'équilibre via une formulation adjointe, évitant ainsi le déroulage complet des itérations du solveur et réduisant drastiquement l'empreinte mémoire et calcul. Le schéma est intégré dans un MPC à horizon glissant (receding-horizon MPC) qui ré-ancre l'optimisation à chaque pas sur l'équilibre réellement atteint, limitant les basculements entre bassins d'attraction. Les résultats, évalués en simulation et sur robots physiques, surpassent les méthodes sans gradient comme SPSA (Simultaneous Perturbation Stochastic Approximation) et CEM (Cross-Entropy Method). L'enjeu industriel est direct : la manipulation de câblages et de harnais est l'un des goulots d'étranglement non résolus de l'automatisation en assemblage automobile, électronique et médical. Les approches par apprentissage par renforcement standard buttent sur l'espace d'état combinatoire des DLO, et le sim-to-real reste fragile faute de gradients exploitables. La formulation adjointe proposée ici ouvre une voie différentiable sans le coût mémoire prohibitif du backpropagation à travers les solveurs itératifs, ce qui est un apport méthodologique tangible. Il faut noter que les métriques de performance publiées n'incluent pas de temps de cycle ni de taux de succès quantifiés sur cas industriels réels, les expériences physiques semblant rester au stade de validation en laboratoire. Ce travail s'inscrit dans un mouvement plus large de simulation différentiable appliquée à la robotique, avec des contributions récentes de groupes comme MIT, Stanford et ETH Zurich. Sur le segment DLO, il concurrence des approches comme les politiques visuomotrices apprises par imitation et les modèles d'espace d'état pour objets déformables. Aucun partenaire industriel ni déploiement pilote n'est mentionné dans la prépublication, ce qui situe clairement ce travail au stade recherche fondamentale. Les prochaines étapes probables incluent une validation sur des tâches de câblage plus complexes et une intégration dans des pipelines de planification temps-réel.

RecherchePaper
1 source
Contrôle par échantillonnage en temps réel sous contraintes strictes : l'approche MPPI avec contraintes de variété
2arXiv cs.RO 

Contrôle par échantillonnage en temps réel sous contraintes strictes : l'approche MPPI avec contraintes de variété

Une équipe du RCI Lab publie MC-MPPI (Manifold-Constrained Model Predictive Path Integral), un framework de contrôle temps-réel déposé sur arXiv le 26 mai 2026 (arXiv:2605.24813). La méthode répond à une limitation structurelle du MPPI standard : l'impossibilité de garantir des contraintes d'égalité strictes (hard constraints) lors de tâches de manipulation en chaîne fermée. MC-MPPI sépare le problème en deux niveaux : une planification dans un espace latent de faible dimension, apprise par un VAE (Variational Autoencoder) qui encode la variété de contraintes, suivie d'une correction d'exécution par un contrôleur QP (Quadratic Programming) résolvant en un seul appel l'erreur résiduelle. Sur un système bi-bras à 14 degrés de liberté en chaîne fermée, le framework tourne à 100 Hz aussi bien en simulation qu'en conditions réelles, et surpasse significativement les méthodes de référence en précision de suivi de trajectoire. Le verrou adressé est structurel : les pénalités de coût douces du MPPI standard ne garantissent pas la faisabilité des trajectoires candidates, rendant la méthode inapplicable à la manipulation bimanuelle contrainte, aux systèmes à deux points de contact rigide, ou à toute chaîne cinématique fermée. MC-MPPI conserve le parallélisme massif qui rend MPPI attractif : le VAE génère des trajectoires quasi-faisables sans modification par échantillon, permettant une linéarisation précise des contraintes et réduisant la correction d'exécution à un QP résolu en un seul passage au lieu d'une projection itérative coûteuse. Pour un intégrateur ou un responsable technique industriel, cela ouvre MPPI à des tâches d'assemblage et de manipulation précise jusqu'ici réservées aux solveurs par optimisation itérative comme iLQR ou SQP. MPPI est une méthode de contrôle prédictif par échantillonnage stochastique, introduite par Williams et al. à Georgia Tech en 2016 et depuis adoptée en navigation robotique et pour les systèmes sous-actionnés. Les extensions contraintes existantes recourent à des projections itératives coûteuses ou à des reformulations variationnelles qui dégradent la fréquence de contrôle. MC-MPPI se distingue en apprenant la géométrie de contrainte hors-ligne via le VAE, limitant la charge en ligne au seul QP. Les approches concurrentes incluent les méthodes CBF-QP (Control Barrier Function), le MPC différentiable, et les planificateurs neuronaux pour la manipulation bimanuelle. L'équipe met à disposition vidéos et implémentation à rcilab.github.io/mcmppi ; des validations sur des configurations plus complexes ou des manipulateurs mobiles constitueraient des étapes naturelles.

RecherchePaper
1 source
Estimateur en temps réel du contrôle et de l'état des actionneurs (REACH) sur un robot souple bio-inspiré d'anguille
3arXiv cs.RO 

Estimateur en temps réel du contrôle et de l'état des actionneurs (REACH) sur un robot souple bio-inspiré d'anguille

Une équipe de chercheurs a présenté, dans une prépublication arXiv (2608.14865) mise en ligne à la mi-août 2026, un algorithme nommé REACH (Real-time Estimator of Actuator Control and Health), destiné à estimer en temps réel l'état de santé des actionneurs d'un robot souple nageur inspiré de l'anguille et capable de nage anguilliforme, grâce à un modèle du robot souple, un filtre à points sigma et un test d'hypothèse statistique. En comparant trois types de capteurs, un par actionneur (GPS, centrale inertielle IMU et capteur de flexion), les auteurs montrent que l'IMU et le capteur de flexion sont tous deux des choix adéquats, et que deux IMU suffisent alors que trois capteurs de flexion sont nécessaires pour un diagnostic fiable. Testé sur trois allures de nage (ligne droite, virage large, virage serré), REACH prédit correctement l'état de santé des actionneurs dans les trois cas avec des écarts de performance minimes, et une méthode de validation de filtre confirme sa cohérence statistique dans la détection des dégradations. Des essais menés avec des données réelles de capteurs de flexion issues d'un robot poisson confirment que l'algorithme fonctionne malgré le bruit de mesure et les variations de fabrication entre actionneurs. Cette avancée cible un problème concret de la robotique sous-marine souple : les environnements opérationnels difficiles dégradent rapidement matériaux et actionneurs souples, rendant la détection de pannes indispensable pour qu'un robot mène à bien sa mission ou revienne à sa base en cas de défaillance. Contrairement aux robots rigides, dont les modes de défaillance sont bien caractérisés, les actionneurs souples restent difficiles à diagnostiquer en temps réel du fait de leur comportement non linéaire, ce qui freine leur adoption pour des missions autonomes prolongées d'inspection, de surveillance ou de suivi environnemental. Le fait que deux à trois capteurs bas coût suffisent à un diagnostic fiable constitue une indication utile pour les intégrateurs cherchant à limiter l'encombrement et la consommation énergétique des véhicules sous-marins autonomes biomimétiques. Le travail s'inscrit dans le champ en expansion de la robotique douce bio-inspirée, où la nage anguilliforme est étudiée comme alternative économe en énergie aux propulseurs classiques pour les véhicules sous-marins autonomes. Il s'agit d'une prépublication de recherche, non encore revue par les pairs, sans acteur industriel ni calendrier de commercialisation mentionnés dans le résumé. Les auteurs valident leur approche à la fois en simulation et sur un prototype physique de robot poisson équipé de capteurs de flexion, une étape jugée nécessaire avant d'envisager son intégration dans des plateformes de nage souple destinées à des missions réelles.

RecherchePaper
1 source
CART : adaptation au terrain sensible au contexte par sélection de séquences temporelles pour robots à pattes
4arXiv cs.RO 

CART : adaptation au terrain sensible au contexte par sélection de séquences temporelles pour robots à pattes

Une équipe de chercheurs a publié CART (Context-Aware Terrain Adaptation), un contrôleur de locomotion conçu pour permettre aux robots à pattes de naviguer sur des terrains complexes non structurés. Le système fusionne deux sources d'information embarquées: la proprioception (couples articulaires, accélérations du torse, contacts au sol) et l'extéroception (vision par caméra), via une architecture de sélection de séquences temporelles. Les expériences ont été réalisées sur trois plateformes: le Unitree Go2 et l'ANYmal-C d'ANYbotics en simulation sous NVIDIA IsaacSim, et un Boston Dynamics SPOT pour les essais en conditions réelles. Les gains mesurés sont significatifs: +5 % de taux de traversée réussi par rapport aux méthodes de référence, -41 % d'oscillation de la base du robot en simulation, et -22 % en conditions réelles, sans dégradation du temps de mission. Le problème central que CART adresse est ce que les auteurs nomment le "Visual-Texture Paradox": ce que le capteur visuel détecte peut différer radicalement de ce que le robot ressent lors du contact physique (béton recouvert de sable, herbe sur substrat rocheux, revêtements peints imitant une autre texture). La majorité des systèmes d'adaptation de terrain actuels ne modélisent pas explicitement cette discordance, ce qui se traduit par des chutes ou des récupérations erratiques sur terrains difficiles. En liant l'historique des interactions proprioceptives récentes à l'apparence extéroceptive courante, CART construit une représentation contextuelle du terrain plus fiable que la vision seule. C'est une propriété directement utile pour des déploiements en extérieur: inspection d'infrastructure, logistique sur chantier, robotique minière. La locomotion adaptative pour robots à pattes a connu des avancées majeures depuis les travaux fondateurs d'ETH Zurich sur ANYmal (2016-2022), avec des méthodes d'apprentissage par renforcement en simulation démontrant un transfert sim-to-real robuste. Boston Dynamics SPOT reste la référence commerciale sur terrains difficiles, tandis que le Unitree Go2 s'impose dans la recherche académique grâce à son coût réduit. CART se positionne comme une couche de contrôle agnostique à la plateforme, sans modification matérielle requise. Il s'agit d'un preprint arXiv (identifiant 2604.14344, avril 2026), sans déploiement ni partenaire industriel annoncé à ce stade. La validation sur des conditions météorologiques adverses et des scénarios multi-terrains plus variés constitue la prochaine étape attendue.

UEImpact indirect via ANYbotics (Suisse, hors UE) et l'héritage ETH Zurich sur ANYmal, mais aucun déploiement ni partenaire européen annoncé à ce stade.

RecherchePaper
1 source