Aller au contenu principal
RecherchearXiv cs.RO 

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente dans un article publie en preprint sur arXiv (2609.15382) le World-Action Model (WAM), un système de décision pour l'excavation autonome par chargeuse sur pneus. Comme chaque scoop modifie le relief disponible pour l'action suivante, WAM génère plusieurs trajectoires de godet candidates, éliminé celles géométriquement impossibles, prédit conjointement pour chacune le changement de terrain et le volume charge, puis exécuté celle au chargement prédit le plus élevé avant de replanifier depuis le nouveau relief observe. Sur 32 épisodes de test MinSlope a géométries distinctes, ce classement par modèle du monde applique a des propositions générées par diffusion fait chuter le nombre moyen de passes de godet de 651,8 a 540,6 (-17,1%), préservé un taux de réussite de 32/32 et améliore chaque épisode teste individuellement. En comparaison système complet, WAM termine ses 32 épisodes contre 29 sur 32 pour une politique "soft actor-critic" entraînée séparément. L'équipe a aussi valide l'interface sur des données de chargeuse grandeur réelle et déployé la boucle complète perception-proposition-prédiction-sélection-exécution en conditions physiques, via une implémentation ROS2/TensorRT traitant cinq candidats en 72,4 millisecondes sur un module Jetson AGX Orin.

Le résultat vise un problème central du terrassement autonome: chaque action transforme l'environnement de la décision suivante, ce qui rend l'anticipation des conséquences plus déterminante que la seule qualité du mouvement exécuté. En montrant qu'une couche de décision fondée sur un modèle du monde améliore a la fois l'efficacité, moins de passes pour un même résultat, et la fiabilité, taux de complétion supérieur a une politique de renforcement entraînée de bout en bout, l'étude indique que le gain vient du choix explicite entre plusieurs actions possibles plutôt que de la seule politique de mouvement. Pour les intégrateurs et fabricants d'équipements de chantier et de mines, une baisse de 17% du nombre de passes se traduit directement en gains de temps de cycle a l'échelle d'une flotte, même si ces chiffres restent issus de la simulation, l'expérience physique ne démontrant pour l'instant que la faisabilité de la boucle fermée en conditions réelles.

Le travail s'inscrit dans l'automatisation des engins de terrassement, ou les approches existantes reposent soit sur des politiques de mouvement générées par diffusion sans raisonnement explicite sur les conséquences terrain, soit sur de l'apprentissage par renforcement comme le soft actor-critic utilise ici en comparaison. Les auteurs testent également plusieurs représentations d'entrée, étendues spatiales et cinq architectures de réseau afin d'identifier un prédicteur "structure par la physique" a la fois précis et rapide, une contribution méthodologique distincte du résultat applicatif. A ce stade, il s'agit d'un article de recherche en preprint, valide sur chargeuse grandeur réelle en boucle expérimentale mais sans déploiement en flotte ni acteur industriel nomme, ce qui le situe cote recherche amont dans un domaine ou l'automatisation des chargeuses et pelles intéressé autant les laboratoires que les fabricants d'équipements de chantier et de mines.

Dans nos dossiers

À lire aussi

Modèle du monde à action conditionnée : un planificateur d'action généralisable pour la prise de décision
1arXiv cs.RO 

Modèle du monde à action conditionnée : un planificateur d'action généralisable pour la prise de décision

Des chercheurs présentent World Action Planner (WAP), un système de planification robotique combinant un modèle vision-langage (VLM) et un modèle du monde conditionné par les poses et les images, capable de gérer plusieurs tâches. Décrit dans un article arXiv publié fin juillet 2026 (arXiv:2607.27599), le système fonctionne en deux temps : le VLM propose un plan d'action initial à partir d'une consigne, puis ce plan est raffiné de manière itérative par optimisation et recherche, en simulant des trajectoires possibles ("rollouts") dans le modèle du monde avant de les exécuter réellement. Selon les auteurs, WAP surpasse significativement les modèles de bout en bout de référence, à la fois les architectures vision-langage-action (VLA) et les modèles du monde purs (WAM), sur des tâches compositionnelles, des agencements de scène inédits et des scénarios de généralisation zéro-shot. Le projet est documenté sur worldactionplanner.github.io, sans précision sur le matériel robotique utilisé ni sur un calendrier de déploiement. L'enjeu dépasse la performance brute : c'est la capacité de généralisation qui est visée, un point faible connu des politiques par apprentissage par imitation, qui excellent dans leur environnement d'entraînement mais échouent souvent face à une scène ou une tâche nouvelle. En couplant raisonnement symbolique du VLM et vérification physique via simulation interne, WAP s'attaque directement à l'écart entre démonstration contrôlée et robustesse réelle, un sujet central pour les intégrateurs qui cherchent des robots capables de sortir du script préprogrammé. À ce stade, il s'agit toutefois d'un résultat de recherche évalué en simulation ou en environnement contrôlé, pas d'un produit commercial ni d'un déploiement industriel. Ce travail s'inscrit dans la course actuelle autour des modèles VLA (à l'image de Pi-0 ou GR00T N2) et des modèles du monde pour la robotique, deux approches concurrentes pour doter les robots humanoïdes et bras manipulateurs d'une autonomie généralisable. En proposant une architecture hybride qui combine planification par recherche et prédiction du monde plutôt qu'une politique end-to-end unique, les auteurs positionnent WAP comme une alternative aux approches purement VLA, dont les limites de généralisation restent un point de friction reconnu dans le secteur.

RecherchePaper
1 source
TacWAM : un modèle d'action du monde guidé par ancrage, avec prédiction tactile sensible à la mécanique
2arXiv cs.RO 

TacWAM : un modèle d'action du monde guidé par ancrage, avec prédiction tactile sensible à la mécanique

Traduction-résumé de l'article arXiv ci-dessous, format demandé (3 paragraphes, sans titres). --- Des chercheurs présentent TacWAM (Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction), un modèle qui combine prédiction d'état futur et génération d'action pour des robots manipulateurs, en s'appuyant cette fois sur le tactile plutôt que sur la seule vision. Le système repose sur trois briques : un encodeur tactile à fusion spatialement alignée (SAF) qui projette apparence tactile, champs de force denses et flux de déformation dans un espace latent commun, avec reconstruction bilatérale des forces et couples pour préserver l'information de contact globale ; un encodeur d'historique tactile qui donne du contexte temporel à la prédiction future ; et un mécanisme d'attention tri-modal guidé par ancrage (AGT) qui sépare les tokens visuels et tactiles courants, les tokens de prédiction future et les tokens d'action, de façon à ce que la supervision par le tactile futur n'agisse pas comme un raccourci direct pour l'action. Sur quatre tâches réelles de manipulation à contact riche (prise d'objets fragiles, contact de surface soutenu, manipulation dynamique en main), TacWAM atteint un taux de réussite moyen de 75,0 %, soit 37,5 points de plus que la meilleure référence testée. Des ablations montrent une dégradation nette dès que l'historique tactile est retiré ou que l'accès aux cibles de prédiction future est relâché. L'enjeu dépasse la simple mesure de performance : la vision seule peine à fournir un signal utile pour la force, le glissement ou la déformation lors de tâches de contact fin, un angle mort connu des approches de manipulation par apprentissage. En montrant qu'une prédiction tactile future bien conçue, couplée à une architecture qui empêche cette prédiction de devenir une "triche" pour l'action, améliore significativement des tâches réputées difficiles (objets fragiles, contact soutenu), les auteurs apportent un argument concret en faveur de l'intégration native du tactile dans les futurs modèles de type "world action model", au-delà des architectures VLA aujourd'hui dominées par la vision et le langage. Ce travail s'inscrit dans la lignée des World Action Models, qui cherchent à unifier prédiction du monde et politique d'action pour améliorer la robustesse des robots manipulateurs, un axe déjà exploré via la vision par des modèles comme GR00T N2 ou Pi-0. TacWAM reste à ce stade une contribution de recherche publiée sur arXiv, validée sur un nombre restreint de tâches en laboratoire et non un système déployé industriellement ; ses auteurs annoncent vouloir approfondir les ablations et étendre l'évaluation à davantage de scénarios de contact.

RecherchePaper
1 source
TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense
3arXiv cs.RO 

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense

Des chercheurs ont publié sur arXiv (référence 2606.11184) TacForeSight, un framework léger d'anticipation tactile guidée par la force pour la manipulation en contact riche. Le système repose sur deux composants : TacForceWM, un modèle du monde tactile qui prédit les dynamiques latentes tactiles à court horizon à partir de capteurs bi-doigts conditionnés par les signaux de force et de couple au poignet à haute fréquence, et une politique conditionnée par l'anticipation tactile (Predictive Tactile-Conditioned Policy) qui exploite ces prédictions comme priors de contact, modélise l'évolution tactile courante-vers-future via cross-attention, et fusionne les features visuo-tactiles via un module de gating adaptatif. Les expériences portent sur cinq tâches représentatives de manipulation sur robot réel et trois scénarios de perturbation en cours de manipulation, avec des résultats supérieurs aux baselines existantes dans tous les cas, notamment sous perturbations de contact dynamiques. Le code et les datasets seront mis à disposition publiquement sur tacforesight.github.io. L'apport technique central est de modéliser explicitement les rôles asymétriques de la force globale au poignet (basse résolution spatiale, haute fréquence) et du toucher local bi-doigts (haute résolution spatiale, dynamique plus lente), distinction que la plupart des méthodes d'imitation learning actuelles ignorent. En opérant entièrement dans un espace latent compact, le framework permet un raisonnement de contact proactif compatible avec le contrôle haute fréquence, là où les approches réactives échouent sous perturbations imprévues. Pour les intégrateurs industriels et les équipes travaillant sur l'assemblage ou le conditionnement robotisé, c'est une démonstration concrète que la fusion force+tactile dans un world model améliore la robustesse réelle sans alourdir l'inférence en temps réel. Ce travail s'inscrit dans une vague de recherche combinant world models et retour tactile pour la manipulation dextre, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur GR00T N2 de NVIDIA qui intègrent également des politiques tactile-aware. Aucun concurrent français ou européen direct n'est identifié sur ce créneau précis, bien que des acteurs comme Pollen Robotics ou Enchanted Tools s'appuient aussi sur la manipulation fine. Il s'agit ici d'un preprint non encore évalué par les pairs, sans déploiement industriel ni partenaire annoncé : les résultats, bien que prometteurs sur cinq tâches de laboratoire, devront être reproduits sur des géométries et conditions de contact plus variées avant de valider la généralisation à l'échelle industrielle.

UEImpact indirect : le code open-source prévu sur tacforesight.github.io pourrait être exploité par des équipes européennes travaillant sur la manipulation fine, comme Pollen Robotics ou les labos CEA-List, mais aucun acteur FR/EU n'est impliqué dans ce travail.

RecherchePaper
1 source
Modèle du monde pour la navigation sociale de robots guidée par la logique
4arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source