Aller au contenu principal
PileBelief : un état physique persistant pour la modélisation du monde pilotée par l'interaction
RecherchearXiv cs.RO 

PileBelief : un état physique persistant pour la modélisation du monde pilotée par l'interaction

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent PileBelief, un modèle du monde pour l'excavation robotique, dans un article publié le 22 septembre 2026 sur arXiv (2609.22858v1). Le système cible un problème concret: à chaque coup de godet, le terrain change de forme et les observations locales ne suffisent plus à connaître l'état réel du sol, sa résistance ou son support sous la surface visible. PileBelief combine un a priori physique conditionné par l'observation avec une mémoire de déformation indexée dans l'espace et une mémoire de réponse physique, affinées par des lectures alignées sur l'action et des corrections résiduelles ciblées. Une fois les poids figés au déploiement, les interactions réellement exécutées mettent à jour une croyance mesurée sur le sol, tandis que les actions hypothétiques font évoluer un état imaginé distinct. Face à une base de référence limitée à l'observation courante, PileBelief réduit l'erreur de prédiction conjointe à cinq pas de temps de 10,8% et le regret de sélection d'action hors ligne de 65,5%, avec des gains confirmés en simulation physique Newton/MPM et sur des données d'excavation réelle, notamment pour la prédiction du volume de godet.

Pour la robotique de chantier et le BTP autonome, ce travail cible un verrou concret: contrairement à la manipulation d'objets rigides, l'excavation transforme en continu l'environnement, ce qui rend aveugles les modèles du monde classiques limités à l'image courante face à ce qui a été creusé ou déplacé hors champ de vision. En conservant une mémoire persistante de l'état physique plutôt qu'en repartant de zéro à chaque observation, l'approche se rapproche du comportement d'un opérateur expérimenté qui se souvient de ce qu'il a déjà retiré. Le gain de 65,5% sur le regret de sélection d'action est le chiffre le plus parlant pour les intégrateurs, car il montre que le modèle choisit de meilleures actions candidates, pas seulement qu'il prédit mieux visuellement, ce qui alimente un débat plus large sur les modèles du monde en robotique: l'observation instantanée, même bien traitée, ne suffit pas dans les tâches où l'environnement est irréversiblement transformé par l'action du robot.

L'article se positionne face aux modèles du monde instantanés qui dominent la recherche en manipulation robotique, généralement limités à une image ou un nuage de points par prédiction, sans mémoire à long terme sur l'état physique du terrain. En distinguant une croyance mesurée, mise à jour uniquement par des actions réellement exécutées, d'un état imaginé servant à évaluer des actions hypothétiques sans corrompre cette croyance, les auteurs proposent une architecture potentiellement réutilisable pour d'autres tâches de transformation continue de l'environnement, comme le terrassement ou la manutention de matériaux en vrac. Le papier reste au stade de prépublication de recherche, sans mention de déploiement industriel ni de partenaire commercial, et ouvre la voie à des travaux visant à valider l'approche sur davantage de types de sols et sur des engins d'excavation grandeur réelle.

À lire aussi

Modèles du monde nativement physiques : perspective hamiltonienne pour la modélisation générative
1arXiv cs.RO 

Modèles du monde nativement physiques : perspective hamiltonienne pour la modélisation générative

Une équipe de chercheurs a déposé début mai 2026 sur arXiv (référence 2605.00412v1) un article de position proposant un nouveau cadre théorique pour les modèles du monde en IA incarnée : les Hamiltonian World Models. L'idée centrale est d'encoder les observations d'un robot ou d'un agent autonome dans un espace de phase latent structuré, de faire évoluer cet état via une dynamique inspirée du formalisme hamiltonien de la mécanique classique (avec des termes de contrôle, de dissipation et des résidus appris), puis de décoder la trajectoire prédite en observations futures exploitables pour la planification. Il s'agit d'un preprint théorique sans résultats expérimentaux publiés à ce stade. L'argument principal avancé est que le véritable goulot d'étranglement des modèles du monde n'est plus leur capacité à générer des futurs visuellement réalistes, mais à produire des prédictions physiquement cohérentes et exploitables pour la décision sur un horizon long. Les trois courants dominants actuels peinent chacun à garantir cette stabilité physique : les modèles vidéo génératifs 2D (à la Sora ou Genie), les modèles 3D centrés sur la reconstruction de scènes, et les modèles latents prédictifs de type JEPA (portés notamment par Yann LeCun chez Meta) progressent en silo sans répondre aux exigences du contrôle robotique réel. Pour les équipes de reinforcement learning basé sur modèles (MBRL) et les intégrateurs robotiques, cela se traduit concrètement par des politiques qui dérivent lors des rollouts simulés, fragilisant le transfert sim-to-real. Ancrer la dynamique latente dans le formalisme hamiltonien promettrait une meilleure interprétabilité des représentations internes, une moindre consommation de données d'entraînement et une stabilité accrue en inférence longue. Les auteurs reconnaissent eux-mêmes les obstacles pratiques majeurs : friction, contacts discontinus, forces non-conservatives et objets déformables rendent l'application directe du hamiltonien aux scènes robotiques réelles particulièrement complexe. Ce travail s'inscrit dans un renouveau plus large des world models, porté par Dreamer (Google DeepMind), JEPA (Meta), Genie 2 (Google DeepMind) et les travaux de Physical Intelligence sur les Visual-Language-Action models, mais il se distingue par un ancrage explicite en physique analytique plutôt qu'en apprentissage purement statistique. Aucun déploiement ni partenariat industriel n'est annoncé : l'article reste pour l'instant une contribution théorique ouvrant une direction de recherche.

RecherchePaper
1 source
Contact-Persistent Full Actuation pour l'interaction physique aérienne
2arXiv cs.RO 

Contact-Persistent Full Actuation pour l'interaction physique aérienne

Le laboratoire à l'origine de cette étude propose un nouveau cadre théorique pour certifier l'actionnement complet des drones (UAV) lors de contacts physiques prolongés, un point aveugle des méthodes actuelles. Publié sur arXiv le 24 juillet 2026, l'article part d'un constat simple : les drones dits "fully actuated" sont aujourd'hui validés soit par une condition de rang sur leur matrice d'allocation de commande, soit par leurs performances de suivi en vol libre, deux critères insuffisants dès qu'un robot appuie contre une surface. En contact soutenu, une partie du wrench (force et couple combinés) disponible est absorbée par la tâche elle-même, ne laissant qu'un wrench résiduel pour stabiliser l'appareil. Les chercheurs modélisent le corps rigide sur R3×SO(3) et introduisent une cartographie de wrench dépendante de la morphologie, couvrant les architectures à inclinaison fixe, à inclinaison variable, coaxiales et surdimensionnées en rotors. Ils définissent des ensembles de wrench faisables sous contraintes d'actionneurs, des ensembles résiduels sous charge de tâche, et des marges d'autorité résiduelle. Le résultat central : l'actionnement complet persistant au contact équivaut à ce que le wrench de tâche reste strictement à l'intérieur du polytope de wrench faisable contraint, le rayon d'autorité résiduelle correspondant exactement à la distance jusqu'à la frontière de ce polytope. Pour l'industrie de la manipulation aérienne, ce travail comble un vrai décalage entre théorie et pratique. Un hexarotor incliné peut afficher une matrice d'allocation de rang plein, critère habituellement jugé suffisant, tout en étant incapable d'exécuter une tâche de contact de façon stable. C'est un exemple concret du fossé entre démonstration en vol libre et réalité opérationnelle, que les intégrateurs travaillant sur l'inspection par contact, le ponçage aérien ou la manipulation en environnement industriel doivent désormais intégrer dans leurs choix de conception. Les certificats proposés (marge résiduelle signée, allocation maximisant le slack, condition d'implémentabilité robuste) offrent des outils directement exploitables comme filtre de sécurité conscient des marges. Les drones surdimensionnés en rotors ou à inclinaison variable se sont développés ces dernières années comme alternative aux quadrirotors sous-actionnés classiques, précisément pour permettre l'interaction physique aérienne. L'évaluation numérique, menée sur un hexarotor incliné abstrait plutôt que sur un prototype physique, montre que les angles d'inclinaison intermédiaires préservent l'autorité résiduelle en poussée, tandis que des inclinaisons trop faibles ou excessives échouent respectivement par déficience de force latérale ou perte de marge de vol stationnaire. Une validation matérielle reste la prochaine étape logique pour confirmer ces prédictions théoriques.

RecherchePaper
1 source
IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique
3arXiv cs.RO 

IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique

Un article publié sur arXiv (2607.00836) dresse un état des lieux conceptuel des "world models" utilisés en robotique et en simulation générative, un terme dont le périmètre varie fortement selon les communautés de recherche. Les auteurs proposent une définition unifiée : un modèle du monde est un système conditionné par l'action qui prédit l'évolution future des observations ou des états pertinents pour une tâche donnée. Ils distinguent deux grandes familles : les modèles dans l'espace des observations, qui prédisent des images ou vidéos brutes, et les modèles dans l'espace des états, qui travaillent sur des représentations compactes. Chaque approche est comparée selon quatre critères : fidélité visuelle, structuration spatiale, interprétabilité physique et facilité d'usage pour le contrôle. Le papier introduit ensuite les "world action models", qui relient ces prédictions du futur à des actions robotiques exécutables, avec quatre paradigmes identifiés : imaginer puis exécuter, prédiction d'action conditionnée par des features vidéo, modélisation conjointe vidéo-action, et prédiction vidéo auxiliaire pour l'apprentissage de politiques. Cette clarification terminologique a une portée pratique pour les équipes qui développent des politiques robotiques : elle aide à choisir entre un modèle générateur de pixels, coûteux en calcul mais riche visuellement, et un modèle d'état plus léger, plus proche du contrôle temps réel mais moins interprétable. Elle formalise aussi un débat de fond du secteur : les modèles de génération vidéo produisent des démonstrations spectaculaires, mais leur utilité réelle pour piloter un bras ou un humanoïde reste à prouver, faute de garanties physiques strictes, ce qui rejoint les critiques récurrentes sur l'écart entre démo et déploiement réel. En distinguant explicitement l'approche "imaginer puis exécuter" des méthodes qui apprennent directement une politique conjointe vidéo-action, le tutoriel donne aux intégrateurs une grille de lecture pour évaluer les annonces commerciales selon ce qu'elles modélisent vraiment, plutôt que sur la seule qualité de leurs vidéos. Ce travail arrive alors que les world models occupent une place croissante dans la course aux modèles vision-langage-action, portée par des systèmes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui combinent tous, à des degrés divers, prédiction du futur et génération d'actions. Sans analyser directement ces produits commerciaux, la taxonomie proposée offre un cadre académique pour resituer ces systèmes les uns par rapport aux autres, à un moment où la recherche universitaire tente de structurer conceptuellement un domaine dont la vitesse de publication industrielle a largement dépassé la théorie.

RecherchePaper
1 source
Au-delà des emplacements d'instances : des modèles du monde sémantiquement riches pour la planification d'interactions physiques
4arXiv cs.RO 

Au-delà des emplacements d'instances : des modèles du monde sémantiquement riches pour la planification d'interactions physiques

Des chercheurs présentent SR-WM (Semantically Rich World Model), un modèle du monde conditionné par la tâche pour la planification d'interactions physiques en robotique de manipulation, détaillé dans un article publié sur arXiv sous la référence 2608.22294v1. Plutôt que de se limiter à prédire des observations futures ou des caractéristiques latentes, comme le font les modèles du monde classiques, SR-WM structure sa représentation autour de cinq rôles fonctionnels explicites: gripper, cible, but, relation et phase. Un encodeur d'entités visuelles extrait des hypothèses d'entités à partir de caractéristiques de patchs pré-entraînées, les masques de segmentation servant d'indices optionnels plutôt que d'entrées obligatoires. Un module de liaison de rôles associe ensuite ces hypothèses aux rôles spécifiques à la tâche, tandis qu'un modèle de dynamique conditionné par l'action prédit les transitions de rôles ainsi que des éléments fins: contact, établissement de relations entre objets, préservation de ces relations et changement de phase. L'ensemble est évalué sur les quatre suites de simulation LIBERO, avec des tests de transfert inter-suites, des diagnostics de perception et une analyse de sensibilité aux actions. Pour l'industrie de la manipulation robotique et les équipes travaillant sur des architectures vision-langage-action (VLA), ce travail cible un écart précis: un modèle qui prédit correctement des pixels ou des embeddings futurs ne garantit pas qu'il comprenne si une action préserve les relations nécessaires à la réussite d'une tâche, comme ne pas rompre une prise ou déplacer un objet hors de sa zone cible. En rendant explicites des rôles fonctionnels plutôt que de s'appuyer sur des slots d'objets indifférenciés ou un état monolithique, SR-WM propose une interface sémantique reliant dynamique visuelle et décision de planification, utilisée pour générer plusieurs candidats d'action, les reclasser selon l'étape de la tâche, et rechantillonner en cas de violation détectée. C'est une piste concrète pour fiabiliser la sélection d'actions issues de politiques apprises, plutôt que de juger leur qualité sur des démonstrations sélectionnées ou des taux de réussite bruts en simulation. Ce travail s'inscrit dans la lignée des recherches sur les représentations centrées objets pour les modèles du monde, qui cherchent depuis plusieurs années à dépasser les limites des slots d'instances indifférenciés en robotique par apprentissage. LIBERO, le benchmark utilisé pour l'évaluation, est devenu une référence standard pour tester la généralisation des politiques de manipulation entre familles de tâches. L'article ne fait état d'aucun déploiement matériel, partenariat industriel ou test sur robot réel: il s'agit d'une contribution académique évaluée exclusivement en simulation. Les suites naturelles pour ce type d'approche, transfert sim-to-real et intégration à des pipelines VLA existants, ne sont ni annoncées ni datées dans l'article.

RecherchePaper
1 source