Aller au contenu principal
RecherchearXiv cs.RO 

RAGNAROK : alignement normalisé par la gravité assisté par radar pour un SLAM radar-visuel-cinématique-inertiel robuste à base de keyframes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (v1, octobre 2026) RAGNAROK, présenté comme le premier système de SLAM fusionnant radar, vision, cinématique des pattes et centrale inertielle, conçu pour les robots à pattes évoluant dans des environnements dégradés. Le système combine plusieurs briques. Une estimation de vitesse des jambes tient compte du glissement et des contacts roulants. Un facteur radar exploite la cinématique du robot. Un traitement d'image corrige les dégradations visuelles. S'y ajoutent un socle proprioceptif assisté par radar, fondé sur des B-splines, une pondération adaptative des capteurs et une calibration extrinsèque en ligne. Les auteurs annoncent des performances robustes et supérieures à celles des méthodes de référence, sur des jeux de données publics et sur leurs propres collectes. Le code source et le jeu de données sont disponibles sur GitHub (dépôt hanjun815/RAGNAROK). Le résumé ne donne aucune valeur chiffrée, ni erreur de trajectoire, ni liste des méthodes comparées, ni plateforme robotique précise.

L'enjeu est la fiabilité de l'estimation d'état pour les quadrupèdes et autres robots à pattes hors des conditions de laboratoire. Les estimateurs purement proprioceptifs (odométrie des jambes et IMU) se dégradent sur terrain accidenté, là où les pieds glissent ou roulent. Le radar, qui fonctionne dans la fumée, la poussière, le brouillard ou la faible luminosité, apporte une mesure de vitesse indépendante, mais sa faible observabilité du lacet (yaw) provoque une dérive à long terme. Associer le radar à la vision et à la cinématique, avec une fusion qui détecte et pondère les capteurs défaillants, répond à un besoin concret pour l'inspection industrielle, la sécurité civile ou les sites miniers, où les robots doivent tenir sans intervention humaine. Le caractère ouvert du code et des données permet aussi une reproduction indépendante. C'est un point appréciable dans un domaine où les comparaisons restent souvent difficiles à vérifier.

Ce travail s'inscrit dans une série de méthodes récentes qui ont introduit le radar dans l'odométrie des robots à pattes pour compenser les limites de la proprioception. Les auteurs relèvent que la fusion tolérante aux pannes en environnement hostile reste peu explorée, et c'est la lacune qu'ils visent. Il s'agit d'une publication de recherche sous forme de lettre, sans produit commercial ni déploiement annoncé. Les résultats n'ont pas été validés par des pairs à ce stade et les gains revendiqués face à l'état de l'art restent à vérifier sur le code publié. Les prochaines étapes probables sont l'évaluation par d'autres équipes, une éventuelle version révisée avec des métriques détaillées, puis une intégration dans des chaînes de navigation pour quadrupèdes industriels.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DiffusionVS : un cadre génératif pour l'asservissement visuel robuste basé sur la politique de diffusion
1arXiv cs.RO 

DiffusionVS : un cadre génératif pour l'asservissement visuel robuste basé sur la politique de diffusion

DiffusionVS, déposé sur arXiv (2506.19397) en juin 2026, propose un cadre génératif pour le visual servoing robotique fondé sur la Diffusion Policy. Le système prend en entrée les coordonnées normalisées des coins de marqueurs visuels observés par la caméra embarquée, et génère des commandes de vitesse caméra via un processus de débruitage conditionnel. Pour contourner les limitations de généralisation propres aux modèles entraînés sur jeux de données statiques, les auteurs adoptent un paradigme d'entraînement en ligne : le modèle collecte continuellement de nouvelles expériences interactives pour diversifier sa distribution d'apprentissage. Les résultats rapportés atteignent un taux de succès de quasi 100% en simulation et 93% en expériences physiques réelles. Le visual servoing par régression classique souffre de deux problèmes structurels : le jitter de trajectoire causé par des mappings mono-étape sensibles au bruit, et l'accumulation d'erreurs lors de distribution shifts en cours de trajectoire. La Diffusion Policy adresse ces deux points simultanément. En prédisant des séquences d'actions plutôt que des commandes isolées, elle maintient la cohérence temporelle. L'augmentation implicite de données inhérente au processus de débruitage renforce par ailleurs la robustesse aux perturbations. Ce qui est notable, au-delà des performances brutes, c'est la généricité démontrée du module : intégré à des architectures de visual servoing existantes, il améliore systématiquement leurs résultats, sans modification de leur pipeline de base. Cela valide le mécanisme diffusion comme composant réutilisable, pas seulement comme architecture ad hoc. La Diffusion Policy, popularisée par Chi et al. en 2023 (Columbia/MIT), s'est imposée en apprentissage par imitation pour la manipulation, puis adoptée par Physical Intelligence dans pi-0 et d'autres systèmes VLA. Son application au visual servoing, problème classique de robotique de précision, était moins explorée. Les approches concurrentes restent dominées par la régression directe ou les contrôleurs IBVS/PBVS à base de features géométriques. La contribution principale ici est l'entraînement en ligne, qui contourne le problème de covariate shift sans nécessiter un dataset exhaustif pré-collecté, contrainte majeure en déploiement industriel. Les limites actuelles sont notables : le système repose sur des marqueurs visuels structurés (AprilTags), et les expériences physiques ne précisent pas le type de robot ni les conditions d'environnement, ce qui rend difficile l'évaluation de la maturité pour un déploiement réel.

RecherchePaper
1 source
KILVO : odométrie kinématique, inertielle, LiDAR et visuelle avec adaptation multimodale robuste pour robots humanoïdes
2arXiv cs.RO 

KILVO : odométrie kinématique, inertielle, LiDAR et visuelle avec adaptation multimodale robuste pour robots humanoïdes

Des chercheurs publient KILVO (Kinematic-Inertial-LiDAR-Visual Odometry), un système de localisation pour robots humanoïdes qui combine quatre capteurs déjà présents sur ces plateformes : encodeurs articulaires, centrale inertielle (IMU), LiDAR et caméra. L'architecture repose sur un filtre de Kalman itéré à état d'erreur (ESIKF) hybride, à la fois asynchrone et séquentiel. Les données inertielles servent à la prédiction, la cinématique des jambes est traitée de façon asynchrone à haute fréquence pour fournir des contraintes proprioceptives, tandis que les données extéroceptives sont intégrées séquentiellement : d'abord les points LiDAR pour des a priori géométriques, puis la caméra via des erreurs photométriques. Un module compact d'estimation de contact au sol vient compléter l'estimation d'état sans capteur supplémentaire. Le système, conçu pour tolérer la dégradation ou la perte de capteurs grâce à une adaptation multimodale, a été testé sur des jeux de données publics et en conditions réelles, sur plusieurs robots humanoïdes, démarches et scénarios. Le code et les jeux de données sont publiés sur GitHub (arXiv:2608.05647, prépublication non encore évaluée par les pairs). L'odométrie reste un verrou pour l'autonomie des humanoïdes hors laboratoire : contrairement aux robots à roues, la marche bipède introduit glissements, impacts et vibrations qui dégradent vite les estimations purement inertielles ou visuelles. En fusionnant systématiquement quatre modalités déjà embarquées plutôt qu'en ajoutant du matériel, KILVO répond à une contrainte concrète pour les intégrateurs : coût et poids supplémentaires nuls. La robustesse revendiquée face à la dégradation d'un capteur, LiDAR occulté, caméra en contre-jour ou IMU bruitée, touche directement à l'écart entre démonstration en environnement contrôlé et déploiement réel, point sur lequel le secteur reste prudent malgré les annonces répétées de marche omniterrain. Une brique de localisation fiabilisée conditionne ensuite des fonctions en aval comme la navigation, la cartographie ou la manipulation mobile. L'odométrie visuo-inertielle et l'odométrie LiDAR sont des briques matures en robotique mobile classique, mais leur transposition aux humanoïdes reste récente : la marche bipède complique l'exploitation de la cinématique comme source proprioceptive fiable, contrairement aux robots à pattes quadrupèdes, mieux documentés sur ce plan. KILVO s'inscrit dans cette lignée de travaux de fusion capteurs pour la locomotion à pattes, en revendiquant une précision et une cadence de sortie compétitives face aux méthodes de l'état de l'art. La publication du code et des jeux de données sur GitHub vise une adoption par la communauté robotique, dans un contexte où plusieurs laboratoires et fabricants d'humanoïdes cherchent à standardiser leurs piles de perception et de localisation à mesure que les premiers pilotes de déploiement se multiplient.

RecherchePaper
1 source
Alignement de surface par admittance pour l'inspection visuelle robotique supervisée par l'humain
3arXiv cs.RO 

Alignement de surface par admittance pour l'inspection visuelle robotique supervisée par l'humain

Des chercheurs ont publié sur arXiv (référence 2606.18601) un pipeline de contrôle d'orientation en temps réel pour l'inspection visuelle robotique de précision, fondé sur un framework à admittance. Le système, validé sur un manipulateur à 6 degrés de liberté (DOF), combine les commandes d'un opérateur humain et l'alignement de surface piloté par perception. L'architecture modélise l'effecteur terminal comme une sphère virtuelle se déplaçant dans un milieu visqueux, produisant un système masse-amortisseur qui génère un mouvement conforme et synchronisé à partir des erreurs d'orientation et des entrées opérateur. La validation expérimentale atteint une erreur d'orientation finale moyenne de 0,4 degré en suivi de normale de surface, dans des conditions de bruit perceptuel et d'irrégularités géométriques. Ces résultats restent à ce stade des mesures de laboratoire, sans validation en environnement industriel réel documentée dans le papier. L'enjeu est concret pour les secteurs aérospatial, semi-conducteur et médical, où une anomalie de surface non détectée sur une pièce à haute valeur se traduit directement en rebut, retraitement ou défaillance terrain. Le problème central que ce travail adresse est architectural : la planification de trajectoire hors-ligne seule ne tient pas dès qu'un opérateur humain intervient en temps réel via télé-opération ou autonomie partagée, car les ajustements introduits rendent la trajectoire préplanifiée caduque. Le contrôleur proposé absorbe simultanément l'incertitude perceptuelle et les commandes humaines sans dégradation de la précision angulaire, ce qui représente une avancée sur les approches classiques qui traitent ces deux sources d'incertitude séparément. Le contrôle par admittance est un paradigme établi en robotique collaborative, où le robot cède aux forces extérieures de façon contrôlée plutôt que de les résister. Son application à l'inspection visuelle en boucle fermée avec opérateur dans la boucle reste un domaine de recherche actif, sans acteur dominant clairement identifié. Les approches concurrentes s'appuient généralement sur des capteurs de force/couple dédiés ou sur des corrections visuelles en open-loop. Aucun partenaire industriel ni pilote de déploiement n'est mentionné dans la publication, qui constitue une contribution académique orientée vers les intégrateurs systèmes cherchant une alternative aux pipelines d'inspection rigides. Les suites logiques seraient des essais sur surfaces gauches (non-développables) et la couplage avec des systèmes optiques haute résolution tels que profilomètres laser ou caméras de vision industrielle.

RecherchePaper
1 source
YUBI-STAG : alignement riche en contact et en sémantique pour les VLA par ancrage vidéo-langage automatisé
4arXiv cs.RO 

YUBI-STAG : alignement riche en contact et en sémantique pour les VLA par ancrage vidéo-langage automatisé

Des chercheurs ont publié sur arXiv (octobre 2026) YUBI-STAG, un cadre d'annotation spatio-temporelle qui enrichit automatiquement les démonstrations de manipulation avec une sémantique détaillée des interactions. Les jeux de données robotiques actuels ne fournissent le plus souvent que des descriptions grossières de tâche. Ils omettent quel préhenseur agit, quel objet est touché, et comment il est saisi puis déplacé. YUBI-STAG combine une segmentation des objets en contact avec des modèles vision-langage (VLM). Il annote l'identité, les attributs et l'état des objets, les actions par préhenseur, la coordination bimanuelle et les interactions spatialement ancrées. Comme ce pipeline exige des séquences déjà localisées et plusieurs étapes d'inférence VLM, les auteurs l'ont distillé en YUBI-VLM. Ce second modèle reconstruit la structure des actions et les annotations directement à partir de vidéos brutes non segmentées, en peu d'appels d'inférence, et n'utilise que les vues poignet. Les deux systèmes sont évalués sur YUBI-STAG-Bench, qui couvre des tâches d'ancrage temporel, sémantique et spatial. Selon les auteurs, YUBI-VLM conserve l'essentiel de la précision d'annotation de YUBI-STAG, avec moins d'appels et un temps d'exécution plus court, et généralise à des manipulations jamais vues. Le résumé ne donne aucun chiffre sur la précision, le gain de temps ou la taille du benchmark. Ces ordres de grandeur seront à vérifier dans l'article complet. Ce travail reste une prépublication, sans produit commercialisé ni déploiement industriel. L'enjeu touche un point faible des modèles vision-langage-action (VLA). Leur pré-entraînement à grande échelle leur donne des compétences de manipulation étendues, mais les piloter par le langage suppose un alignement fin entre instruction et geste physique. Or les annotations disponibles sont trop pauvres pour cela. Les auteurs affirment qu'un post-entraînement de politiques VLA sur ces annotations automatiques améliore l'exécution et le suivi d'instructions dans des expériences bimanuelles. Le contrôle porte sur l'identité de l'objet, le préhenseur actif, le lieu cible et les relations spatiales, des éléments absents des étiquettes d'origine. Si ces résultats se confirment, ils indiquent que le goulot d'étranglement tient autant à la qualité des annotations qu'à l'architecture des modèles. Un VLM léger fonctionnant sur les seules caméras poignet pourrait aussi enrichir à bas coût des corpus existants, sans réannotation humaine. Les expériences restent toutefois de laboratoire, sur plateformes bimanuelles, et l'on ignore sur quels VLA elles ont été menées. Ce travail s'inscrit dans la tendance du « ré-labelling » automatique des données robotiques par VLM, face à des démonstrations dont le langage est jugé trop pauvre pour les politiques généralistes de type Pi-0, GR00T ou Helix. La distillation vers un modèle opérant sur vidéo brute vise à rendre cette approche praticable sur de gros volumes. Aucun calendrier de publication du code, des données ou du benchmark n'est mentionné dans le résumé. La suite logique serait une validation sur des VLA de référence et des tâches industrielles plus variées.

RecherchePaper
1 source