Aller au contenu principal
RecherchearXiv cs.RO 

Contrôle prédictif à modèle boîte grise pour tombereaux articulés, via apprentissage du dérapage par processus gaussien

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.27597) une méthode de commande prédictive (MPC) en gray-box pour les tombereaux articulés (ADT), utilisés dans l'automatisation minière. L'équipe emploie la régression par processus gaussien (GPR) pour apprendre l'angle de dérapage du véhicule, identifié comme la principale source d'imprécision des modèles cinématiques employés dans les MPC. Cette fonction GPR est intégrée à un modèle cinématique standard pour former un modèle hybride gray-box, capable de prédire le dérapage et la vitesse latérale du véhicule. Comparé en simulation à deux MPC white-box purement cinématiques, le modèle réduit l'erreur maximale de suivi latéral de plus de 2 mètres à 0,56 mètre.

Pour l'industrie minière et les intégrateurs de robotique mobile lourde, ce résultat s'attaque à un compromis connu : les modèles dynamiques complets sont précis mais demandent un paramétrage complexe et une recalibration à chaque changement d'environnement (charge, pente, nature du sol), tandis que les modèles cinématiques, plus simples et robustes, perdent en précision de trajectoire lors des virages ou des charges asymétriques. L'approche gray-box promet de combler cet écart sans les coûts de recalibration des modèles dynamiques, ce qui intéresse les fabricants de tombereaux autonomes et les opérateurs de mines à ciel ouvert. Ces résultats restent toutefois valides uniquement en simulation, sans essai mentionné sur tombereau réel, ce qui laisse ouverte la question du transfert simulation vers réalité (sim-to-real) pour ce type de correction data-driven.

Cette publication s'inscrit dans une tendance de modélisation hybride, associant physique et apprentissage automatique, pour la commande de véhicules autonomes hors route. L'automatisation des tombereaux miniers reste disputée par de grands équipementiers, Caterpillar avec MineStar, Komatsu avec FrontRunner, ou Hitachi et Volvo Construction Equipment, déjà engagés dans le déploiement de flottes de camions autonomes sur des sites d'extraction. Les auteurs ne mentionnent aucun partenariat industriel ni calendrier de validation terrain ; la suite logique serait une expérimentation sur un ADT physique, afin de vérifier si le gain de précision observé en simulation se maintient face aux conditions réelles de sol meuble et de charge variable propres aux mines à ciel ouvert.

Impact France/UE

Cette approche gray-box pourrait intéresser des équipementiers européens comme Volvo Construction Equipment, déjà engages sur l'automatisation des tombereaux miniers, mais aucune collaboration ni déploiement européen n'est mentionne dans l'article.

Dans nos dossiers

À lire aussi

Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D
1arXiv cs.RO 

Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D

Des chercheurs ont publié sur arXiv (arXiv:2606.26048v1) un framework de contrôle hybride baptisé RL-ET-DeePC, combinant apprentissage par renforcement (RL) sans modèle et contrôle prédictif basé sur les données (DeePC) avec déclenchement événementiel, appliqué à un bras souple câblé à trois dimensions. L'approche repose sur une politique RL entraînée à décider dynamiquement quand activer le solveur d'optimisation DeePC, plutôt que de le lancer à chaque pas d'échantillonnage comme le fait le DeePC périodique classique. En simulation, le framework réduit la fréquence d'appel au solveur jusqu'à 66 % sans dégradation mesurable de la précision de suivi de trajectoire. Sur le banc physique, le transfert s'effectue en zero-shot, c'est-à-dire sans réentraînement ni adaptation, avec une réduction de 34 % des appels d'optimisation, une précision de suivi comparable au DeePC périodique, et des performances plus régulières qu'un déclenchement événementiel à seuil statique. L'enjeu est directement industriel : le DeePC standard, qui évite la modélisation explicite en exploitant les trajectoires entrée-sortie mesurées, bute sur le coût computationnel de son optimisation en horizon glissant à chaque cycle. Sur des plateformes embarquées à ressources limitées, ce verrou bloque le déploiement temps réel. En déléguant la décision de déclenchement à une politique RL légère, RL-ET-DeePC rend le contrôle prédictif viable sur matériel contraint, tout en validant un transfert sim-to-real zero-shot sur un système souple, dont les dynamiques non linéaires et variant dans le temps constituent précisément le défi classique du gap simulation-réalité. C'est un résultat notable : les robots souples sont réputés récalcitrants au sim-to-real, et une réduction de 34 % des appels solveur sur hardware sans recalibration ouvre la voie à des architectures plus légères. Le DeePC, introduit autour de 2019 comme alternative data-driven aux MPC classiques, souffre depuis de son coût en ligne. Les travaux sur le déclenchement événementiel (event-triggered control) cherchent depuis plusieurs années à conditionner l'appel au solveur à des critères d'état système, mais les seuils statiques manquent d'adaptabilité. L'usage du RL pour apprendre ce critère de déclenchement constitue la nouveauté architecturale centrale de ce papier. Dans le paysage des robots souples, les approches concurrentes incluent les contrôleurs basés sur des réseaux de neurones récurrents (LSTM, Echo State Networks) et les méthodes Koopman pour la linéarisation. Ce travail positionne RL-ET-DeePC comme une alternative sans modèle et computationnellement frugale, avec des perspectives de déploiement sur des bras chirurgicaux, des grippers adaptatifs, ou des exosquelettes souples où la puissance de calcul embarquée reste contrainte.

RecherchePaper
1 source
Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides
2arXiv cs.RO 

Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides

Une équipe de chercheurs publie MRO-GWM (Multi Rigid Object Gaussian World Model), un modèle de monde action-conditionnel capable de prédire en 3D les effets des actions d'un robot sur des objets rigides. Déposé sur arXiv (réf. 2606.01950), le travail combine Gaussian splatting et apprentissage de dynamique : chaque objet de la scène est décrit par un ensemble de gaussiennes dans un référentiel canonique propre, son mouvement étant modélisé comme une transformation de corps rigide (rotation et translation). Un transformateur spatio-temporel prédit la trajectoire future des objets à partir de leur historique gaussien et des actions planifiées par le robot. L'architecture gère les occlusions partielles grâce à un entraînement sur reconstructions multi-vues. Les évaluations portent sur des datasets synthétiques d'objets ménagers en interaction avec un effecteur robot, et sur des tâches de manipulation non préhensile (pousser un objet sans le saisir) dans le cadre d'un contrôle prédictif par modèle (MPC), le tout exclusivement en simulation. L'association de modèles de monde action-conditionnels et de Gaussian splatting est pertinente : les premiers permettent de planifier sans essai-erreur coûteux, le second offre une représentation 3D différentiable adaptée à des géométries complexes sans maillage explicite. La décomposition objet-centrique améliore en théorie la généralisation à de nouvelles configurations de scène, contrairement aux encodages holistes. La validation sur manipulation non préhensile est notable car pousser un objet vers une cible est considéré comme un benchmark difficile : les contacts sont instables et mal modélisés par la plupart des simulateurs physiques. Ces résultats restent toutefois entièrement simulés et limités aux objets strictement rigides, sans aucun transfert sim-to-real documenté. Le Gaussian splatting connaît une adoption rapide en robotique depuis la publication de 3DGS (Kerbl et al., 2023), avec des travaux concurrents comme SplatSim, GaussianWorld ou des approches combinant NeRF et planification. MRO-GWM se distingue par son traitement explicite de la dynamique multi-objets avec interactions physiques, un axe moins couvert que la navigation ou la préhension isolée. Le gap sim-to-real demeure le verrou principal : une validation sur bras réel (type Franka ou UR5) constituerait l'étape naturelle, tout comme une extension aux objets articulés ou semi-rigides, aujourd'hui hors périmètre du modèle.

RecherchePaper
1 source
Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne
3arXiv cs.RO 

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne

Des chercheurs ont publié sur arXiv (arXiv:2510.18518v2) un algorithme d'apprentissage par renforcement basé sur un modèle (MBRL) conçu pour contrôler des systèmes robotiques complexes directement dans le monde réel, sans passer par une phase de simulation intensive. L'approche construit un modèle de dynamique à partir des données d'interaction en temps réel, puis effectue des mises à jour de politique guidées par ce modèle appris. Les validations expérimentales ont été conduites sur deux plateformes distinctes : un bras d'excavatrice hydraulique et un bras robot souple. Dans les deux cas, l'algorithme atteint des performances comparables aux méthodes model-free en quelques heures d'entraînement, là où ces dernières réclament habituellement des millions d'interactions simulées. La robustesse de l'adaptation a également été évaluée sous conditions de charge utile (payload) aléatoire, avec des résultats stables malgré le changement de dynamique. L'enjeu principal est la réduction de ce que le secteur appelle le "sim-to-real gap" : l'écart entre les politiques apprises en simulation et leur comportement réel une fois déployées sur du matériel. Les pipelines dominants, adoptés aussi bien par des labos académiques que par des industriels comme Boston Dynamics ou Figure AI, reposent sur des millions de rollouts en simulation avant tout contact avec un robot physique, ce qui introduit un biais systématique difficile à corriger. Cet algorithme court-circuite cette étape en apprenant directement sur données réelles, avec une garantie formelle de progression : les auteurs démontrent des bornes de regret sous-linéaires (sublinear regret bounds) sous hypothèses d'optimisation stochastique en ligne, ce qui est rare dans la littérature MBRL appliquée à la robotique physique. Pour un intégrateur ou un industriel, cela se traduit par une réduction potentielle du temps de mise en service sur des tâches à dynamique variable (variation de charge, usure mécanique, changement de matériau). Ce travail s'inscrit dans un débat structurant du champ : model-based vs model-free RL pour la robotique physique. Les méthodes model-free comme PPO ou SAC dominent les benchmarks simulés mais peinent à s'adapter efficacement en production réelle. Des approches hybrides comme MBPO ou DreamerV3 ont tenté de combler cet écart, mais rarement validées sur des systèmes aussi hétérogènes qu'un bras hydraulique industriel et un manipulateur souple. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou des AMR (autonomous mobile robots) à haute dimension, où les enjeux de sample efficiency sont directement liés aux coûts d'exploitation et à la durée de vie des actionneurs.

RecherchePaper
1 source
Pilotage par contact : un modèle de mouvement à support fini pour robots articulés monopiste
4arXiv cs.RO 

Pilotage par contact : un modèle de mouvement à support fini pour robots articulés monopiste

Une équipe de chercheurs propose, dans un article déposé sur arXiv (référence 2609.23271), un nouveau modèle de prédiction du mouvement pour les robots à voie unique et articulation centrale, c'est-à-dire les véhicules dont le châssis se plie en son centre pour orienter les deux essieux, une architecture répandue en robotique de terrain (engins agricoles, forestiers ou de manutention tout-terrain). Baptisé FSQ (finite-support quadratic model), il ajoute au modèle classique PCK (point-contact kinematic) la prise en compte de la résistance à la rotation répartie sur la surface de contact des roues, plutôt que de réduire chaque contact à un point géométrique comme le fait PCK. En reformulant le coût quadratique du glissement latéral sous forme de moments de contact, les auteurs obtiennent une solution analytique compacte permettant de prédire en temps réel la vitesse latérale et le taux de lacet du véhicule. Le modèle a été testé sur plus de 7 kilomètres de trajets réels, sur asphalte, herbe, glace et parcours mixtes. Pour des horizons de prédiction de cinq secondes, FSQ réduit l'erreur médiane pondérée de translation de 53,5% et l'erreur de lacet de 68,9% par rapport au modèle PCK de référence. Ce gain de précision intéresse directement les intégrateurs de robots mobiles autonomes évoluant hors des environnements structurés, entrepôts extérieurs, chantiers, exploitations agricoles ou sites forestiers, là où un sol meuble ou glissant fait dériver les modèles cinématiques simplifiés. Mieux anticiper le glissement latéral permet une planification de trajectoire plus fiable et un contrôle plus stable, sans capteurs supplémentaires ni réseau de neurones coûteux en calcul, puisque la solution reste une formule fermée compatible avec l'embarqué. Le résultat illustre aussi un point plus général pour le secteur: les gains de robustesse en robotique de terrain ne viennent pas uniquement de l'apprentissage profond ou des politiques bout-en-bout, mais aussi d'une modélisation physique plus fine des interactions roue-sol, un axe moins médiatisé que l'IA générative appliquée à la robotique mais tout aussi déterminant pour la fiabilité des déploiements. Le modèle PCK sert de base à la planification pour les véhicules articulés (chargeuses, tracteurs à châssis brisé, certains robots de reconnaissance) depuis des années, en simplifiant le contact roue-sol à un point unique et en négligeant la résistance rotationnelle qui apparaît sur des surfaces à fort frottement ou irrégulières. FSQ généralise cette formulation en relâchant cette hypothèse tout en conservant un temps de calcul compatible avec le contrôle embarqué. L'article, classé comme nouvelle soumission sur arXiv, ne mentionne ni calendrier de déploiement industriel ni partenariat commercial: il s'agit d'une contribution méthodologique validée expérimentalement, dont l'adoption dépendra de son intégration dans les piles logicielles de navigation existantes.

RecherchePaper
1 source