Aller au contenu principal
RecherchearXiv cs.RO 

MAP2 : poursuite basée sur un modèle et l'accélération, avec MPC et apprentissage résiduel par processus gaussien pour la course autonome

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent MAP2 (Model- and Acceleration-based Pursuit 2), un contrôleur de poursuite destiné à la course autonome, où le véhicule doit suivre sa trajectoire au plus près des limites d'adhérence tout en gardant une latence de calcul faible. L'algorithme combine une commande prédictive (MPC) cinématique fondée sur la courbure et une correction résiduelle par processus gaussien parcimonieux (Sparse Gaussian Process, SGP). Le MPC optimise les consignes cinématiques sur un horizon de prédiction, puis celles-ci sont converties en ordres de braquage par un modèle de dynamique des pneus, complété par la correction SGP. Les essais sur véhicule réel montrent, par rapport à MAP et à Pure Pursuit (PP), une baisse de l'erreur latérale moyenne de 37,99 % et de 44,65 % respectivement, ainsi qu'un temps au tour moyen réduit d'au moins 1,5 %.

L'intérêt tient au compromis visé. Les contrôleurs géométriques comme Pure Pursuit sont légers en calcul, mais reposent sur la géométrie d'Ackermann, qui cesse d'être valide quand les pneus glissent en limite d'adhérence. À l'inverse, les approches par MPC dynamique complet offrent plus de fidélité, au prix d'une charge de calcul plus lourde. MAP2 cherche une voie médiane : un MPC cinématique reste économe, et l'écart entre le modèle et la réponse réelle du véhicule est absorbé par un apprentissage de résidus, sans modèle dynamique exhaustif. Le gain d'erreur latérale est net, mais le gain de temps au tour est modeste (1,5 % au minimum), ce qui suggère que la précision de suivi progresse plus vite que la performance pure. L'abstract ne précise ni la plateforme, ni la vitesse, ni la fréquence de calcul, ni le nombre de tours : il est donc difficile de juger de la robustesse hors du cadre d'essai.

Le travail prolonge MAP, un contrôleur qui conservait la simplicité du suivi géométrique tout en exploitant un modèle de pneu et une information d'accélération. Les auteurs reconnaissent que MAP reste fondamentalement géométrique, qu'il dépend de la cinématique d'Ackermann, et que son modèle de pneu peut manquer la dynamique réelle du véhicule. MAP2 répond à ces deux limites. Il s'inscrit dans un domaine très actif, celui de la course autonome sur plateformes à l'échelle réelle ou réduite, où la tenue de trajectoire en limite de dynamique reste un verrou. Les comparaisons se limitent ici à MAP et PP, et non à des MPC dynamiques ou à des méthodes apprises de bout en bout. Le papier, publié sur arXiv en première version (v1), n'annonce pas encore de suite précise ni de déploiement.

Dans nos dossiers

À lire aussi

Contrôle prédictif à modèle boîte grise pour tombereaux articulés, via apprentissage du dérapage par processus gaussien
1arXiv cs.RO 

Contrôle prédictif à modèle boîte grise pour tombereaux articulés, via apprentissage du dérapage par processus gaussien

Des chercheurs publient sur arXiv (2609.27597) une méthode de commande prédictive (MPC) en gray-box pour les tombereaux articulés (ADT), utilisés dans l'automatisation minière. L'équipe emploie la régression par processus gaussien (GPR) pour apprendre l'angle de dérapage du véhicule, identifié comme la principale source d'imprécision des modèles cinématiques employés dans les MPC. Cette fonction GPR est intégrée à un modèle cinématique standard pour former un modèle hybride gray-box, capable de prédire le dérapage et la vitesse latérale du véhicule. Comparé en simulation à deux MPC white-box purement cinématiques, le modèle réduit l'erreur maximale de suivi latéral de plus de 2 mètres à 0,56 mètre. Pour l'industrie minière et les intégrateurs de robotique mobile lourde, ce résultat s'attaque à un compromis connu : les modèles dynamiques complets sont précis mais demandent un paramétrage complexe et une recalibration à chaque changement d'environnement (charge, pente, nature du sol), tandis que les modèles cinématiques, plus simples et robustes, perdent en précision de trajectoire lors des virages ou des charges asymétriques. L'approche gray-box promet de combler cet écart sans les coûts de recalibration des modèles dynamiques, ce qui intéresse les fabricants de tombereaux autonomes et les opérateurs de mines à ciel ouvert. Ces résultats restent toutefois valides uniquement en simulation, sans essai mentionné sur tombereau réel, ce qui laisse ouverte la question du transfert simulation vers réalité (sim-to-real) pour ce type de correction data-driven. Cette publication s'inscrit dans une tendance de modélisation hybride, associant physique et apprentissage automatique, pour la commande de véhicules autonomes hors route. L'automatisation des tombereaux miniers reste disputée par de grands équipementiers, Caterpillar avec MineStar, Komatsu avec FrontRunner, ou Hitachi et Volvo Construction Equipment, déjà engagés dans le déploiement de flottes de camions autonomes sur des sites d'extraction. Les auteurs ne mentionnent aucun partenariat industriel ni calendrier de validation terrain ; la suite logique serait une expérimentation sur un ADT physique, afin de vérifier si le gain de précision observé en simulation se maintient face aux conditions réelles de sol meuble et de charge variable propres aux mines à ciel ouvert.

UECette approche gray-box pourrait intéresser des équipementiers européens comme Volvo Construction Equipment, déjà engages sur l'automatisation des tombereaux miniers, mais aucune collaboration ni déploiement européen n'est mentionne dans l'article.

RecherchePaper
1 source
De la sélection de cible au creusement : un cadre par apprentissage pour l'excavation autonome continue
2arXiv cs.RO 

De la sélection de cible au creusement : un cadre par apprentissage pour l'excavation autonome continue

Un article publié en septembre 2026 sur arXiv (2609.29750) présente un système d'excavation autonome continue combinant apprentissage par renforcement et apprentissage par imitation. Une politique RL partagée pilote l'approche guidée par points de passage (waypoints) et le transport de charge, tandis qu'une politique IL, entraînée sur des démonstrations expertes, gère le creusement et le levage à partir de données visuelles. Les cibles de creusement sont extraites de cartes d'élévation LiDAR et converties en trajectoires pour la pointe du godet. Testé sur un excavateur hydraulique à échelle réduite équipé de capteurs multimodaux, le système atteint une charge utile moyenne de 6,52 kg par cycle complet, contre 2,68 kg pour la méthode de référence "Fixed Dig", sur trois séries de cinq pelletées consécutives. Ce travail cible une limite fréquente des démonstrations d'excavation autonome, généralement testées sur un cycle isolé et un tas figé, loin de la réalité d'un chantier où la géométrie du terrain change à chaque pelletée. En séparant la navigation et le transport, confiés au RL plus robuste aux variations, du geste de creusement fin, confié à l'IL plus fidèle au savoir-faire expert, l'approche répond à l'écart classique entre démonstration ponctuelle et usage répété en conditions changeantes. Le gain de charge utile, plus du double de la baseline, constitue un indicateur économique parlant pour les intégrateurs de machines de BTP et de mines, secteurs où la productivité se mesure en tonnes déplacées par heure. Les chiffres restent toutefois issus d'un banc d'essai réduit en laboratoire, pas d'un engin grandeur nature en conditions de chantier réelles. Le projet s'inscrit dans une évolution académique de l'excavation autonome, qui remplace progressivement les commandes scriptées rigides des premiers systèmes par des politiques apprises combinant RL, IL et, plus récemment, des approches vision-langage-action. Il se distingue d'acteurs industriels comme Built Robotics ou SafeAI, qui automatisent des engins de chantier grandeur nature en conditions réelles : ce travail reste au stade de la recherche, validé sur une plateforme réduite en environnement contrôlé. L'article ne mentionne ni partenaire industriel ni calendrier de commercialisation. La suite logique, non précisée dans le résumé, serait un passage à l'échelle sur un excavateur de taille réelle et des essais en conditions de chantier non contrôlées, où la variabilité du sol et des matériaux dépasse largement celle reproduite en laboratoire.

RecherchePaper
1 source
Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne
3arXiv cs.RO 

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne

Des chercheurs ont publié sur arXiv (arXiv:2510.18518v2) un algorithme d'apprentissage par renforcement basé sur un modèle (MBRL) conçu pour contrôler des systèmes robotiques complexes directement dans le monde réel, sans passer par une phase de simulation intensive. L'approche construit un modèle de dynamique à partir des données d'interaction en temps réel, puis effectue des mises à jour de politique guidées par ce modèle appris. Les validations expérimentales ont été conduites sur deux plateformes distinctes : un bras d'excavatrice hydraulique et un bras robot souple. Dans les deux cas, l'algorithme atteint des performances comparables aux méthodes model-free en quelques heures d'entraînement, là où ces dernières réclament habituellement des millions d'interactions simulées. La robustesse de l'adaptation a également été évaluée sous conditions de charge utile (payload) aléatoire, avec des résultats stables malgré le changement de dynamique. L'enjeu principal est la réduction de ce que le secteur appelle le "sim-to-real gap" : l'écart entre les politiques apprises en simulation et leur comportement réel une fois déployées sur du matériel. Les pipelines dominants, adoptés aussi bien par des labos académiques que par des industriels comme Boston Dynamics ou Figure AI, reposent sur des millions de rollouts en simulation avant tout contact avec un robot physique, ce qui introduit un biais systématique difficile à corriger. Cet algorithme court-circuite cette étape en apprenant directement sur données réelles, avec une garantie formelle de progression : les auteurs démontrent des bornes de regret sous-linéaires (sublinear regret bounds) sous hypothèses d'optimisation stochastique en ligne, ce qui est rare dans la littérature MBRL appliquée à la robotique physique. Pour un intégrateur ou un industriel, cela se traduit par une réduction potentielle du temps de mise en service sur des tâches à dynamique variable (variation de charge, usure mécanique, changement de matériau). Ce travail s'inscrit dans un débat structurant du champ : model-based vs model-free RL pour la robotique physique. Les méthodes model-free comme PPO ou SAC dominent les benchmarks simulés mais peinent à s'adapter efficacement en production réelle. Des approches hybrides comme MBPO ou DreamerV3 ont tenté de combler cet écart, mais rarement validées sur des systèmes aussi hétérogènes qu'un bras hydraulique industriel et un manipulateur souple. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou des AMR (autonomous mobile robots) à haute dimension, où les enjeux de sample efficiency sont directement liés aux coûts d'exploitation et à la durée de vie des actionneurs.

RecherchePaper
1 source
4arXiv cs.RO 

La modélisation résiduelle comble l'écart entre politiques de régression et génératives en apprentissage robotique

Des chercheurs proposent une alternative à la diffusion et au flow matching pour entraîner des politiques robotiques à partir de démonstrations (arXiv:2610.12231). Baptisée HT-Policies (heteroscedastic Student-t action régression), la méthode reste une régression directe : elle prédit un « chunk » d'actions en une seule passe avant, sans les étapes itératives de débruitage des modèles génératifs. Les auteurs l'ont évaluée sur quatre benchmarks de simulation et lors de tests sur robot réel. Elle atteint des taux de réussite comparables aux politiques génératives (Flow-Policies), aussi bien entraînée de zéro qu'à partir de modèles vision-langage-action (VLA) et de world-action models préentraînés. L'entraînement et l'inférence sont plus rapides, et le réseau de neurones d'une politique flow matching préentraînée peut être réutilisé comme backbone. Les auteurs ne donnent pas, dans le résumé, de chiffres de vitesse ni de taux de succès précis, ce qui oblige à attendre le papier complet pour juger de l'ampleur réelle du gain. Le travail s'attaque à une explication largement admise : si les politiques de diffusion ou de flow matching surpassent la régression directe par erreur quadratique moyenne (MSE-Policies), ce serait parce que les démonstrations humaines sont multimodales, c'est-à-dire que plusieurs actions valides existent pour une même observation. L'analyse de données de démonstration réelles suggère une autre cause. Les résidus de prédiction d'action ont une échelle qui varie fortement selon l'état, et des queues plus lourdes qu'une gaussienne. Or la MSE alloue davantage de magnitude de gradient aux observations dont les résidus sont les plus grands, ce qui dégrade l'optimisation. Les politiques génératives ne seraient donc pas avantagées surtout par leur capacité à représenter plusieurs modes, mais par un comportement de gradient plus favorable. Si le résultat se confirme à grande échelle, il compte pour les intégrateurs et les équipes de déploiement : une politique mono-passe réduit la latence de contrôle et le coût de calcul embarqué, deux contraintes concrètes sur des robots à haute fréquence ou à ressources limitées. L'article s'inscrit dans le débat sur l'apprentissage par imitation, dominé depuis plusieurs années par Diffusion Policy et les approches flow matching, qui équipent désormais de nombreux VLA de fondation, tels que Pi-0. L'idée proposée reste simple : une loi de Student-t avec échelle prédite en fonction de l'entrée, qui limite l'influence des valeurs extrêmes. Plusieurs réserves s'imposent. Il s'agit d'un préprint non évalué par des pairs, les benchmarks précis ne sont pas détaillés dans le résumé, et « compétitif » ne signifie pas supérieur. Une vérification sur des tâches fortement multimodales ou à long horizon reste nécessaire. Les prochaines étapes dépendront de la reproduction des résultats par d'autres laboratoires et de l'éventuelle adoption de cet objectif dans des VLA de grande taille. Une page de projet est annoncée pour le code et les démonstrations.

RecherchePaper
1 source