Aller au contenu principal
RecherchearXiv cs.RO 

SPARSER : projection variable parcimonieuse par exploitation de la structure séparable en perception robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie SPARSER (Sparsity Preserving Analytic Reduction for Separable Robotic Perception), une méthode d'optimisation pour les problèmes de moindres carrés non linéaires qui structurent une grande partie de la perception robotique, SLAM, localisation de réseaux de capteurs (SNL) et reconstruction 3D par vision (SfM). Le préprint, référencé arXiv:2609.24708v1 et soumis en septembre 2026, exploite la séparabilité: des variables comme les points de repère visuels (landmarks) apparaissent linéairement dans les résidus et admettent une solution fermée une fois les poses du robot fixées. La technique de projection de variables (VarPro) élimine analytiquement ces inconnues linéaires, mais restait jusqu'ici limitée en robotique par les symétries de jauge, l'invariance aux translations et rotations globales. SPARSER construit un opérateur de complément de Schur sans matrice explicite pour calculer efficacement coûts réduits, gradients et produits Hessien-vecteur, ce qui lui permet de s'intégrer à des solveurs NLS itératifs classiques. Sur des jeux de données synthétiques et réels de SLAM, SNL et SfM, la méthode est en moyenne 5 à 7 fois plus rapide que les meilleures approches existantes, sur CPU comme sur GPU, avec des gains dépassant 40x sur certains jeux de données. Sur du SLAM multi-robots corrompu par des données aberrantes, sa variante robuste, fondée sur IRLS, est 2 à 16 fois plus rapide qu'un solveur GNC de référence. Le code C++ et l'ensemble des jeux de données sont publiés en open source.

Pour les concepteurs de piles logicielles robotiques, ce gain de vitesse au niveau du solveur d'optimisation, souvent le goulot d'étranglement des systèmes SLAM et de reconstruction 3D embarqués, ouvre la voie à du traitement temps réel sur du matériel plus contraint ou à davantage de robots traités simultanément dans une flotte. Contrairement aux annonces produit du secteur humanoïde, il s'agit ici d'une contribution purement algorithmique et non vérifiée par les pairs: les gains annoncés reposent sur des benchmarks contrôlés par les auteurs eux-mêmes, même si la comparaison porte sur des solveurs état de l'art reconnus plutôt que sur des démonstrations isolées.

VarPro existe depuis des décennies pour la régression non linéaire séparable, mais son usage restait marginal en robotique à cause des symétries de jauge propres aux problèmes de pose et de cartographie. SPARSER se positionne face aux bibliothèques de référence du domaine comme GTSAM, Ceres Solver ou g2o pour l'optimisation SLAM, et face aux solveurs robustes de type GNC pour la gestion des données aberrantes en SLAM multi-robots. La publication conjointe du code et des jeux de données doit permettre à la communauté d'intégrer directement SPARSER dans des pipelines existants, la prochaine étape naturelle étant son adoption ou sa validation indépendante par d'autres équipes de recherche en perception robotique.

Dans nos dossiers

À lire aussi

Identification et exploitation de la structure dans la co-conception de robots
1arXiv cs.RO 

Identification et exploitation de la structure dans la co-conception de robots

Une équipe de recherche publie une nouvelle analyse du co-design robotique, c'est-à-dire l'optimisation conjointe de la morphologie d'un robot et de son système de contrôle, un problème de recherche en haute dimension particulièrement coûteux à résoudre. Les auteurs ont étudié les paysages de co-design de quatre tâches, deux de locomotion en robotique souple et deux de manipulation, et ont identifié trois régularités communes à ces espaces de recherche. D'abord, au sein d'une même région, la qualité des solutions varie principalement le long d'une variété de faible dimension, avec très peu de variation dans les directions orthogonales, ce qui réduit de fait la dimensionnalité effective à explorer. Ensuite, dans les régions de meilleure qualité, cette variance se répartit sur davantage de dimensions, ce qui oblige la recherche à élargir progressivement son périmètre à mesure que la qualité progresse. Enfin, dans ces mêmes régions de haute qualité, les variations dépendent de dimensions conjointes morphologie-contrôle, imposant une exploration couplée des deux paramètres plutôt que séparée. À partir de ces observations, les chercheurs ont conçu un algorithme de co-design qui exploite explicitement cette structure. Les résultats mesurés sont significatifs pour le secteur : l'algorithme proposé produit des co-designs 36 % meilleurs que ceux des méthodes de référence actuelles, et ces méthodes concurrentes nécessitent environ dix fois plus d'évaluations de fonction pour atteindre une qualité comparable. Pour les équipes qui conçoivent des robots souples ou des systèmes de manipulation, cela représente un gain direct en coût de calcul et en temps d'itération, un facteur souvent limitant quand chaque évaluation implique une simulation physique coûteuse. Le travail apporte surtout une preuve que la performance des algorithmes de co-design ne tient pas qu'à la puissance de calcul brute, mais à la capacité à repérer et exploiter la géométrie sous-jacente du problème, un point utile face à l'hypothèse répandue que plus d'évaluations suffit à compenser une recherche non structurée. Le co-design morphologie-contrôle reste un domaine de recherche actif, car les approches historiques traitent souvent la forme du robot et sa commande comme deux problèmes séparés, optimisés en alternance ou séquentiellement, ce qui ignore leurs interactions. Les auteurs situent leur contribution par rapport aux algorithmes de recherche évolutionnaire et bayésienne existants, qu'ils utilisent comme lignes de base, et valident leur approche par une étude d'ablation qui isole l'apport de chacun des trois principes identifiés. La publication, une version révisée déposée sur arXiv, ouvre la voie à des méthodes de co-design applicables à des plateformes robotiques réelles, où la réduction du nombre de simulations nécessaires pourrait accélérer sensiblement les cycles de conception.

RecherchePaper
1 source
Exploration sémantique consciente de la posture par un robot à pattes à perception omnidirectionnelle en environnements confinés inconnus
2arXiv cs.RO 

Exploration sémantique consciente de la posture par un robot à pattes à perception omnidirectionnelle en environnements confinés inconnus

Une équipe de chercheurs présente POSE, un système d'exploration sémantique conscient de la posture pour robots à pattes, décrit dans un preprint arXiv publié le 19 septembre 2026 (arXiv:2609.19460v1). Le système exploite la capacité intrinsèque d'un robot à pattes à incliner son corps en tangage et en roulis, combinée à une perception omnidirectionnelle caméra-LiDAR, pour observer les surfaces supérieures d'objets normalement invisibles depuis un point de vue plan au sol. Un module d'échantillonnage de points de vue sélectionne les postures corporelles selon le gain de couverture attendu à partir de cartes partielles d'objets, tandis qu'une exécution alignée sur la cible limite les réorientations inutiles du corps. Une stratégie d'élagage des points de vue, assistée par un modèle vision-langage (VLM) et des cartes en vue aérienne (bird's-eye-view), réduit les visites d'inspection redondantes en s'appuyant sur l'historique d'observation. En simulation, POSE améliore la couverture finale des surfaces cibles de 8 à 10 points de pourcentage par rapport à une planification planaire classique, tout en réduisant le temps d'exploration de 17 à 32 %, et obtient le meilleur score moyen de couverture d'objets (AUC) parmi les méthodes comparées. Une validation réelle a été menée avec un robot à pattes équipé de la suite caméra-LiDAR omnidirectionnelle dans un atelier d'usinage. Le résultat cible un problème concret pour les intégrateurs de robots à pattes en inspection industrielle : les capteurs montés au niveau du sol ont un champ de vue vertical limité et une distance de recul contrainte, ce qui laisse des zones d'objets non inspectées si le robot reste dans une posture fixe. En montrant qu'exploiter la mobilité corporelle native du robot, plutôt que d'ajouter des capteurs ou des arrêts d'inspection supplémentaires, améliore simultanément couverture et rapidité, les auteurs apportent un argument méthodologique en faveur d'une planification adaptative de posture pour l'exploration sémantique, plutôt que la seule addition de capteurs ou de temps de mission. Le travail se positionne comme une alternative à l'exploration planaire classique utilisée en robotique mobile terrestre, en s'appuyant sur les capacités récentes des VLM pour le raisonnement sémantique embarqué. Il reste toutefois au stade de preprint non revu par les pairs, avec des résultats chiffrés majoritairement issus de simulation et une seule démonstration réelle limitée à un atelier d'usinage. Les auteurs indiquent prévoir de publier le code en open source, sans calendrier précis.

RecherchePaper
1 source
Structure de prédiction latente 4D pour la planification robotique
3arXiv cs.RO 

Structure de prédiction latente 4D pour la planification robotique

Structured 4D Latent Predictive Model : un système de prédiction spatiale en 3D pour la planification robotique Une équipe de recherche publie sur arXiv (identifiant 2607.01166v1) un nouveau modèle baptisé « Structured 4D Latent Predictive Model », conçu pour la planification de tâches robotiques. Contrairement aux modèles prédictifs vidéo classiques, qui travaillent sur des séquences 2D, ce système prédit l'évolution de la structure 3D d'une scène dans un espace latent structuré, à partir d'observations visuelles et d'instructions textuelles. Cette représentation peut être décodée vers plusieurs formats 3D, offrant une compréhension plus complète et géométriquement cohérente de la scène. Le modèle sert de planificateur : il génère des scènes futures qui sont ensuite converties en actions exécutables par un module de dynamique inverse conditionné par l'objectif. Selon les auteurs, les expériences montrent une qualité visuelle élevée et une cohérence 3D et multi-vues nettement supérieure aux meilleurs planificateurs vidéo existants, avec de meilleures performances sur des tâches de manipulation complexes, une bonne généralisation à des conditions visuelles inédites, et une validation sur plateformes robotiques réelles. Un site dédié (structured-4d-model.github.io) présente le projet. L'enjeu dépasse la seule prouesse technique. Les modèles vidéo 2D dominent actuellement l'approche « world model » en robotique, notamment dans les architectures VLA (vision-language-action) qui inspirent des systèmes comme Pi-0 ou GR00T N2. Or ces approches peinent souvent à garantir une cohérence physique et spatiale suffisante pour une manipulation fine. En injectant explicitement une structure 3D dans l'espace latent, ce travail répond directement à une limite identifiée du secteur : le fossé entre démonstrations vidéo impressionnantes et exécution fiable sur du matériel réel, un problème central pour les intégrateurs industriels qui cherchent des systèmes robustes plutôt que des démonstrations sélectionnées. Il s'agit toutefois d'une publication académique à ce stade, sans laboratoire ni entreprise identifiés dans le résumé, et sans date de déploiement annoncée. Elle s'inscrit dans une compétition de recherche intense autour des modèles prédictifs pour la robotique, où plusieurs équipes explorent en parallèle des représentations 3D ou 4D pour dépasser les limites du tout-vidéo. Les prochaines étapes dépendront de la publication du code et de tests indépendants sur des plateformes tierces.

RecherchePaper
1 source
Revisiter la perception des parties articulées en manipulation robotique
4arXiv cs.RO 

Revisiter la perception des parties articulées en manipulation robotique

Des chercheurs ont déposé en juin 2026 (arXiv:2606.08103) une nouvelle approche pour la perception des parties articulées d'objets du quotidien, portes, boîtes et poignées, baptisée GPS (Geometric Primary Structure). Ce cadre représente la géométrie des parties mobiles sous une forme abstraite et générique, collectée via un dispositif de réalité virtuelle portable : l'annotation d'une séquence d'objets prend moins d'une minute, contre plusieurs dizaines de minutes pour les pipelines de labellisation manuelle classiques. Appliqué sur 234 objets répartis en six classes de parties, le système a constitué un corpus de 41 000 frames. Le modèle GPS entraîné accepte en entrée une unique image RGB-D et, sans aucun fine-tuning spécifique au domaine, atteint un taux de réussite de 73 % sur 270 états initiaux couvrant 9 objets en manipulation robotique réelle, à partir d'une politique heuristique basée sur la prédiction GPS. Ce résultat illustre un point clé pour les intégrateurs et les équipes R&D industrielles : la qualité de la représentation perceptive conditionne directement la robustesse de la politique de manipulation. Les deux approches dominantes présentent des compromis défavorables. Les méthodes basées sur la pose nécessitent une annotation intensive et ne passent pas à l'échelle, tandis que les méthodes affordance-based, qui extraient le mouvement futur par point tracking, souffrent de données bruitées ou incomplètes. GPS tente d'occuper le terrain intermédiaire. Un taux de 73 % sans fine-tuning in-domain est une indication sérieuse de généralisation réelle, même si la validation sur 9 objets seulement invite à la prudence avant de conclure que le fossé entre démonstration et déploiement industriel est comblé. Le problème de la manipulation d'objets articulés constitue un verrou reconnu depuis les travaux fondateurs sur WHERE2ACT et les datasets de type OPD (OpenDoors-Dataset). GPS s'inscrit dans un mouvement plus large visant à remplacer les bases de connaissances statiques par des systèmes de perception apprenants et annotables à faible coût. Les auteurs rendent publics le code, les données et l'outil VR (enlighten0707.github.io/gps), ce qui favorise la reproductibilité et l'adoption en recherche. Les extensions naturelles incluent l'intégration avec des politiques de type VLA (Vision-Language-Action), la généralisation à des parties déformables, et la validation sur des objets industriels hors distribution.

RecherchePaper
1 source