Aller au contenu principal
AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage
RecherchearXiv cs.RO 

AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent AeroAct, un modèle "monde-action" (world-action model, WAM) conçu pour piloter des quadricoptères à partir de commandes en langage naturel. Selon les auteurs, il s'agit du premier WAM démontré en vol réel sur drone. Le système adapte un Transformer de diffusion vidéo pré-entraîné pour prédire, à partir de l'historique visuel à la première personne, de la proprioception et d'instructions textuelles, des séquences de trajectoires et d'actions locales. Pendant l'entraînement, le modèle apprend en prédisant les images futures que produirait chaque action, une supervision dense des conséquences visuelles, mais au moment du déploiement il calcule directement les commandes de vol sans générer de vidéo. Pour produire les données d'entraînement, l'équipe a construit un pipeline basé sur DiffAero combinant les moteurs de simulation Isaac Lab et le rendu par 3D Gaussian splatting, complété par un dispositif portatif à bas coût qui couple caméra et estimation de mouvement pour recréer des trajectoires de vol. Une procédure d'auto-guidage améliore la cohérence temporelle entre segments de trajectoire qui se chevauchent. Les tests, en simulation en boucle fermée et sur un quadricoptère physique réel, montrent des gains en suivi de cible et en recherche d'objets.

L'intérêt est de dépasser les limites des méthodes actuelles de navigation aérienne par langage, qui reposent sur des actions discrètes, des points de passage ou des commandes de vitesse instantanées offrant peu d'information sur l'effet des actions sur les observations futures. En ancrant explicitement l'apprentissage dans la prédiction visuelle des conséquences du mouvement, AeroAct cherche à combler l'écart classique entre simulation et réalité pour les modèles vision-langage-action appliqués au vol, un enjeu clé pour les intégrateurs en inspection industrielle, cartographie ou recherche-sauvetage par drone.

Le travail s'inscrit dans la vague plus large des modèles du monde appliqués à la robotique, où l'action est conditionnée par une anticipation visuelle plutôt que par des commandes bas niveau directes. Il reste à ce stade une publication de recherche arXiv, pas un produit commercialisé ni déployé en conditions opérationnelles ; les auteurs présentent des résultats préliminaires en simulation et sur banc de vol réel, sans indication de partenaire industriel ou de calendrier de mise en production.

À lire aussi

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
1arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
2arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides
3arXiv cs.RO 

Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides

Une équipe de chercheurs publie MRO-GWM (Multi Rigid Object Gaussian World Model), un modèle de monde action-conditionnel capable de prédire en 3D les effets des actions d'un robot sur des objets rigides. Déposé sur arXiv (réf. 2606.01950), le travail combine Gaussian splatting et apprentissage de dynamique : chaque objet de la scène est décrit par un ensemble de gaussiennes dans un référentiel canonique propre, son mouvement étant modélisé comme une transformation de corps rigide (rotation et translation). Un transformateur spatio-temporel prédit la trajectoire future des objets à partir de leur historique gaussien et des actions planifiées par le robot. L'architecture gère les occlusions partielles grâce à un entraînement sur reconstructions multi-vues. Les évaluations portent sur des datasets synthétiques d'objets ménagers en interaction avec un effecteur robot, et sur des tâches de manipulation non préhensile (pousser un objet sans le saisir) dans le cadre d'un contrôle prédictif par modèle (MPC), le tout exclusivement en simulation. L'association de modèles de monde action-conditionnels et de Gaussian splatting est pertinente : les premiers permettent de planifier sans essai-erreur coûteux, le second offre une représentation 3D différentiable adaptée à des géométries complexes sans maillage explicite. La décomposition objet-centrique améliore en théorie la généralisation à de nouvelles configurations de scène, contrairement aux encodages holistes. La validation sur manipulation non préhensile est notable car pousser un objet vers une cible est considéré comme un benchmark difficile : les contacts sont instables et mal modélisés par la plupart des simulateurs physiques. Ces résultats restent toutefois entièrement simulés et limités aux objets strictement rigides, sans aucun transfert sim-to-real documenté. Le Gaussian splatting connaît une adoption rapide en robotique depuis la publication de 3DGS (Kerbl et al., 2023), avec des travaux concurrents comme SplatSim, GaussianWorld ou des approches combinant NeRF et planification. MRO-GWM se distingue par son traitement explicite de la dynamique multi-objets avec interactions physiques, un axe moins couvert que la navigation ou la préhension isolée. Le gap sim-to-real demeure le verrou principal : une validation sur bras réel (type Franka ou UR5) constituerait l'étape naturelle, tout comme une extension aux objets articulés ou semi-rigides, aujourd'hui hors périmètre du modèle.

RecherchePaper
1 source
ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action
4arXiv cs.RO 

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action

Une équipe de recherche publie ConfAL-WM, un framework d'apprentissage actif guidé par la confiance pour le post-entraînement de world models conditionnés par l'action, utilisés en robotique pour la prédiction, la planification et la génération de données synthétiques. Décrit dans un preprint arXiv (2608.25572v1) daté d'août 2026, le système s'appuie sur EVAC, un world model existant, auquel les chercheurs greffent une sonde de confiance légère branchée sur les features du décodeur UNet. Cette sonde produit des cartes de confiance denses dans l'espace latent, ensuite agrégées à trois niveaux : tâche, frame et patch. Le pipeline complet fonctionne en trois étapes : réentraînement de la sonde et préchauffage d'EVAC sur un petit sous-ensemble de données du domaine cible, présélection au niveau tâche pour répartir le budget d'échantillonnage, puis réentraînement ciblé avec pondération optionnelle au niveau frame ou patch. Les expériences ont été menées sur le benchmark RoboTwin2.0, avec une page de démonstration visuelle disponible sur ConfAL-WM.github.io. L'intérêt de ce travail tient au problème qu'il cible : dans les world models embarqués, les erreurs de prédiction ne se répartissent pas uniformément mais se concentrent sur des zones précises, bras robotique, objets manipulés, points de contact, zones occluses. Entraîner ou réadapter ces modèles de façon uniforme gaspille donc du calcul et des données d'annotation. Une sélection guidée par la confiance promet de réduire le coût d'adaptation d'un world model à un nouveau domaine ou une nouvelle tâche, un enjeu direct pour les laboratoires qui développent des modèles de type VLA (vision-langage-action) à grande échelle, où le post-entraînement sur données cibles reste coûteux. Les auteurs affirment que leur pondération dense par frame et patch surpasse des méthodes de scoring plus classiques, basées sur une récompense scalaire, une mesure de progrès ou un jugement automatique. Ce travail s'inscrit dans la dynamique plus large des world models conditionnés par l'action comme brique fondamentale pour la planification robotique et la génération de données synthétiques, aux côtés d'approches comme Pi-0 ou GR00T N2. Il ne s'agit toutefois pas d'un produit commercial ni d'un déploiement industriel : c'est une contribution de recherche publiée sur arXiv, sans partenaire industriel ni acteur français ou européen mentionné, dont l'impact réel dépendra de sa reproduction et de son adoption par d'autres laboratoires.

RecherchePaper
1 source