Aller au contenu principal
RecherchearXiv cs.RO 

UWB et Crazyflow : simuler à grande échelle un retour d'information dégradé pour la robotique aérienne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Crazyflow est un simulateur de drones différentiable, construit sur JAX et présenté dans un preprint arXiv (2610.08225). Grâce à la compilation JIT via XLA, la physique et le contrôle sont fusionnés dans un unique graphe de calcul différentiable. Les simulations peuvent ainsi être massivement parallélisées sur accélérateurs (GPU), sans simplifier la modélisation. Les auteurs revendiquent des gains d'un ordre de grandeur par rapport aux simulateurs de référence, et un entraînement en quelques secondes d'agents d'apprentissage par renforcement déployables. Pour montrer la modularité de l'outil, ils y ajoutent un pipeline complet de simulation Ultra-Wideband (UWB, localisation radio par mesure de distance) et de centrale inertielle (IMU), couplé à un filtre de Kalman étendu (EKF) à état complet. Selon eux, l'évaluation parallèle de contrôleurs sous retour d'état dégradé n'affecte presque pas le débit GPU. Le résumé ne donne ni facteur d'accélération chiffré ni nombre d'environnements simultanés, et les gains annoncés n'ont pas encore été vérifiés de façon indépendante.

L'intérêt tient à ce que la plupart des simulateurs de drones entraînent des politiques sur un état parfaitement connu, alors que les vols réels, en intérieur notamment, reposent sur des mesures bruitées, retardées ou intermittentes. Cet écart de fidélité est une cause classique d'échec du transfert sim-to-real. Si le modèle de capteurs et l'estimateur tournent dans le même graphe compilé que la dynamique, les équipes pourront tester la robustesse d'un contrôleur à grande échelle avant tout vol, ce qui réduit les cycles d'essais sur matériel. Pour les intégrateurs de flottes en entrepôt ou en inspection de sites sans GPS, c'est un outil de validation plausible. Reste à confirmer que la fidélité du modèle UWB colle aux mesures réelles, point que le résumé n'établit pas.

Le projet s'inscrit dans la vague des simulateurs accélérés écrits en JAX ou sur GPU, comme MuJoCo MJX, Brax ou Isaac Sim. Ces outils ont rendu l'apprentissage par renforcement massif accessible en robotique, notamment pour les robots à pattes. Le nom évoque la plateforme Crazyflie, nano-quadricoptère très répandu dans la recherche, ce qui suggère un public académique. Les prochaines étapes à surveiller sont la publication du code, des comparaisons chiffrées avec les simulateurs existants et surtout des essais de transfert sur drones réels sous localisation UWB. Ces éléments diront si l'outil dépasse le statut de preprint.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle
1arXiv cs.RO 

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle

Des chercheurs ont présenté AXIS, un moteur de données communautaire et évolutif pour l'apprentissage de la manipulation robotique, décrit dans un article déposé sur arXiv le 24 juillet 2026. Le système permet de collecter des démonstrations à grande échelle via téléopération directement dans le navigateur, sans matériel spécialisé ni opérateurs centralisés, et génère puis valide automatiquement de nouvelles tâches de manipulation. Un pipeline automatisé filtre la qualité des trajectoires, les lisse et applique des augmentations visuelles et physiques pour produire des données prêtes à l'entraînement. Le jeu de données AXIS compte actuellement 207 tâches diverses et plus de 50 000 trajectoires, organisées en "task snapshots" évalués selon un protocole strict à données retenues (held-out). Ce travail cible un goulot d'étranglement bien identifié du secteur : la difficulté à faire grandir les jeux de démonstrations utilisés pour entraîner les politiques vision-langage-action (VLA), jusqu'ici souvent limités par du matériel dédié ou des catalogues de tâches figés. Les auteurs montrent que le pré-entraînement continu sur AXIS améliore le taux de réussite global du modèle π0.5 de 5,8 points, et dépasse de 37,3 points un modèle pré-entraîné sur RoboCasa365, avec des gains qui s'accentuent à mesure que le volume de données augmente. Les progrès les plus nets apparaissent sous perturbations de disposition, de bruit capteur et de point de vue caméra, un signal utile pour les intégrateurs cherchant des politiques robustes hors laboratoire plutôt que de simples démonstrations réussies en conditions idéales. Le projet s'inscrit dans une tendance émergente consistant à traiter la collecte de données robotiques comme un problème d'échelle communautaire, à l'image de ce que le crowdsourcing a permis pour les grands modèles de langage. Il se positionne explicitement face à RoboCasa365, utilisé comme référence de comparaison, et s'appuie sur des politiques VLA existantes telles que π0.5 pour évaluer l'apport réel des données AXIS. Il s'agit à ce stade d'un article de recherche déposé en preprint, dont les résultats n'ont pas encore été validés par relecture par les pairs ni reproduits par des équipes tierces.

RecherchePaper
1 source
I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs
2arXiv cs.RO 

I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs

Chercheurs de l'université de Wuhan (laboratoire i2Nav) ont publié i2Nav-Robot, un jeu de données à grande échelle destiné à la navigation par fusion multi-capteurs pour véhicules terrestres autonomes (UGV), en environnements intérieurs et extérieurs. La plateforme, un véhicule à roues omnidirectionnel, embarque des LiDAR solid-state à vision frontale et à 360 degrés de dernière génération, un radar millimétrique 4D, des caméras stéréo, une centrale inertielle (IMU), un récepteur GNSS et des odomètres à roues, tous synchronisés temporellement via une combinaison de synchronisation matérielle en ligne et de calibration hors ligne. Le jeu de données comprend dix séquences couvrant des scénarios variés (rues extérieures, parkings intérieurs) pour une distance cumulée d'environ 17 060 mètres, avec une vérité terrain de précision centimétrique obtenue par post-traitement de navigation intégrée sur IMU haut de gamme. Quinze méthodes open source de fusion multi-capteurs ont servi à valider la qualité des données. Le tout est accessible sur GitHub (i2Nav-WHU/i2Nav-Robot). Pour la recherche en navigation robotique, ce type de benchmark comble un manque réel: les jeux de données existants pour UGV souffrent souvent de configurations de capteurs limitées, d'une synchronisation imprécise, d'une vérité terrain incomplète ou peu fiable, et d'un manque de diversité de scénarios, ce qui freine le développement et la comparaison rigoureuse des algorithmes SLAM et de fusion de capteurs. Un dataset combinant LiDAR récents, radar 4D et vérité terrain centimétrique dans des environnements mixtes intérieur-extérieur offre aux équipes de recherche et aux intégrateurs un terrain d'évaluation plus représentatif des conditions réelles de déploiement, notamment pour les robots mobiles industriels et logistiques. Ce travail s'inscrit dans la lignée de benchmarks antérieurs comme KITTI ou M2DGR, mais cherche à dépasser leurs limites en matière de synchronisation et de diversité de capteurs, notamment via l'intégration récente du radar millimétrique 4D, technologie de plus en plus utilisée en complément du LiDAR pour la robustesse par mauvaise visibilité. La publication en open source, avec documentation complète sur GitHub, vise à en faire une référence pour les futures évaluations comparatives de méthodes de navigation autonome, un domaine où la disponibilité de données de qualité reste un goulot d'étranglement majeur pour l'industrie.

RecherchePaper
1 source
La diversité est-elle tout ce qu'il faut pour la manipulation robotique à grande échelle ?
3arXiv cs.RO 

La diversité est-elle tout ce qu'il faut pour la manipulation robotique à grande échelle ?

Une équipe de chercheurs publie sur arXiv (référence 2507.06219) une étude systématique sur le rôle de la diversité des données dans l'apprentissage de la manipulation robotique, remettant en cause l'intuition du "plus c'est divers, mieux c'est". Trois dimensions sont examinées indépendamment. La diversité des tâches s'avère plus critique que le volume de démonstrations par tâche pour le transfert vers de nouveaux scénarios. L'entraînement multi-robots (multi-embodiment) n'est pas nécessaire au transfert inter-plateformes : un modèle entraîné sur un seul type de robot avec des données de haute qualité transfère aussi efficacement, avec de meilleures propriétés de scaling au fine-tuning. Enfin, la diversité des experts humains peut nuire à l'apprentissage via la multimodalité des vitesses d'exécution, chaque opérateur ayant ses propres rythmes et préférences gestuelles. Pour corriger ce biais, les auteurs introduisent une méthode de distribution debiasing appliquée à leur modèle GO-1-Pro, qui gagne 15% de performance, l'équivalent de multiplier par 2,5 le volume de pré-entraînement. Ces résultats ont des implications directes pour les équipes qui conçoivent des pipelines de collecte de données. La conclusion sur le multi-embodiment est particulièrement contre-intuitive : constituer un corpus mono-robot de haute qualité avant de fine-tuner est plus efficace qu'accumuler des datasets disparates multi-robots. Pour un intégrateur ou un décideur industriel, cela redéfinit les priorités de curation : couvrir un maximum de tâches prime sur l'accumulation brute de démonstrations, et standardiser les démonstrations expert devient un levier de performance mesurable. La multimodalité des vitesses est désormais un biais identifiable et corrigeable en amont du pipeline, pas une fatalité inhérente à la collecte humaine. Ce travail s'inscrit dans la dynamique portée par Google DeepMind (RT-2), Physical Intelligence (Pi-0) et les équipes de Berkeley (OpenVLA, Octo), qui cherchent à construire des fondations généralistes pour la manipulation depuis 2023. Contrairement au texte ou aux images, les données de démonstration robotique restent coûteuses à produire, ce qui rend les choix de stratégie de scaling particulièrement stratégiques. Les conclusions orientent directement les acteurs comme Figure AI (Figure 03), Agility Robotics ou, en France, Enchanted Tools (Mirokaï), qui investissent dans de larges datasets de manipulation. Ce travail est purement académique : aucun déploiement ni partenariat commercial n'est annoncé.

UEEnchanted Tools (Mirokaï) est explicitement citée comme acteur concerné par ces stratégies de scaling des données de manipulation, rendant les conclusions directement applicables à leur R&D en France.

RecherchePaper
1 source
4arXiv cs.RO 

OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle

Des chercheurs publient OntoPlan, un cadre de planification de tâches robotiques fondé sur une représentation ontologique de la scène, accompagné d'un code ouvert sur GitHub (dépôt namhyeongwoo/OntoPlan). Le système cible un défaut connu de la planification par grands modèles de langage (LLM) : sur les tâches à long horizon dans de vastes environnements, la performance se dégrade. Quand la géométrie de la scène est transmise sous forme de texte, le modèle saisit mal le contexte spatial, et le coût en tokens croît avec la taille de l'environnement. OntoPlan aligne objets, espaces, relations et états dans un vocabulaire symbolique commun. Un cadre agentique interprète l'instruction, récupère de façon sélective les informations utiles, formalise buts et contraintes, puis produit un plan exécutable. Sur 150 tâches générales réparties dans cinq environnements intérieurs et trois échelles de scène, il atteint un taux de réussite moyen de 0,89, contre 0,27 pour la meilleure méthode de référence. Il consomme en moyenne 18,1 k tokens par tâche, soit environ 5,6 fois moins que la référence la plus économe. L'enjeu est double pour les intégrateurs et les équipes qui déploient des robots pilotés par LLM. D'abord, l'écart de 0,89 contre 0,27 suggère que le goulot d'étranglement tient moins à la capacité de raisonnement du modèle qu'à la manière de lui présenter le monde : un LLM qui génère directement des séquences d'actions peine à respecter l'état courant et les préconditions, alors qu'une formalisation symbolique les rend vérifiables. Ensuite, le coût en tokens, rarement discuté dans les démonstrations, détermine la viabilité économique et la latence en exploitation. Les auteurs indiquent que l'avantage persiste quand l'échelle de la scène augmente, alors que les méthodes concurrentes perdent davantage en réussite et restent beaucoup plus coûteuses. Le système demande aussi des précisions face à une instruction ambiguë, ou signale un manque d'information face à une instruction infaisable, au lieu de s'engager dans un plan invalide. C'est un comportement de sécurité utile pour tout déploiement industriel. Plusieurs réserves s'imposent. Il s'agit d'un préprint arXiv (v1), non évalué par les pairs. Les résultats viennent d'un banc d'essai de 150 tâches, sans précision dans le résumé sur la nature des environnements (simulés ou réels) ni sur les méthodes de référence. Les chiffres ne disent donc rien de la robustesse en conditions réelles, où perception bruitée et échecs d'exécution compliquent la construction de l'ontologie. Ce travail s'inscrit dans le courant de la planification neuro-symbolique, qui combine LLM et planificateurs formels (type PDDL) pour pallier les limites des approches où le modèle génère directement les actions. Il se distingue des modèles vision-langage-action de bout en bout, qui traitent le bas niveau. La publication du code permettra une reproduction indépendante, étape décisive pour juger si l'écart de performance tient hors du banc d'essai des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source