Aller au contenu principal
Symétries ici et là, combinées partout : compositions inter-espaces en robotique
RecherchearXiv cs.RO 

Symétries ici et là, combinées partout : compositions inter-espaces en robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont soumis fin mai 2026 sur arXiv (arXiv:2605.22639) un framework baptisé "cross-space symmetry compositions", conçu pour apprendre des politiques robotiques exploitant simultanément plusieurs symétries géométriques. L'approche a été validée sur un robot à deux bras (dual-arm), en simulation et sur hardware réel, sur des tâches de manipulation. Le principe : plutôt que de traiter isolément les symétries de l'espace de configuration (angles articulaires) et celles de l'espace de tâche (position et orientation de l'effecteur), le framework les compose dans un espace de représentation unifié. Les auteurs s'appuient sur la structure différentielle-géométrique de la cinématique directe (forward kinematics map) pour "descendre" des symétries de l'espace de configuration vers l'espace de tâche, ou les "remonter" en sens inverse.

L'enjeu pour les équipes R&D en manipulation robotique est direct : les réseaux de neurones équivariants, qui respectent par construction les symétries du problème, requièrent moins de données d'entraînement et généralisent mieux à des configurations non vues. Jusqu'ici, la plupart des approches exploitaient une seule symétrie à la fois (par exemple la SO(2)-équivariance dans le plan horizontal pour la manipulation en table-top), laissant des gains de généralisation inexploités. Les résultats expérimentaux confirment une amélioration sur les tâches de manipulation testées, bien que les marges précises et les volumes de données requis ne soient pas détaillés dans le résumé public. Les équipes travaillant en imitation learning ou sur des architectures VLA (Vision-Language-Action) sont directement concernées par cette piste.

Ce travail s'inscrit dans un courant actif autour des réseaux équivariants en robotique, adossé aux formalismes de groupes de symétrie en deep learning (SO(2), SE(3), E(n)). La contribution spécifique réside dans la composition inter-espaces plutôt que dans l'équivariance dans un seul espace. Il s'agit à ce stade d'une publication académique sans code public annoncé, et les expériences portent sur un seul système dual-arm dont la plateforme hardware n'est pas précisée. Les suites naturelles seraient une extension aux robots humanoïdes ou aux plateformes commerciales (bras UR, Franka), ainsi que la mise à disposition du code pour permettre la reproductibilité et une adoption plus large dans la communauté de la robotique apprenante.

À lire aussi

Estimer les relations spatiales incertaines en robotique
1arXiv cs.RO 

Estimer les relations spatiales incertaines en robotique

Publié sous la référence arXiv:1304.3111v2 en tant que cross-listing, cet article présente la carte stochastique ("stochastic map"), une représentation mathématique permettant d'estimer les relations spatiales incertaines entre objets dans un environnement robotique. Le texte décrit les procédures nécessaires pour construire cette carte, en extraire l'information et la mettre à jour de façon incrémentale à mesure que de nouvelles observations arrivent. Chaque relation entre objets y est stockée avec son incertitude associée, calculée à partir de l'ensemble des données disponibles. L'apport central tient dans la nature probabiliste des estimations: plutôt que de raisonner en pire cas, approche jugée trop conservatrice dans les travaux antérieurs, la méthode s'appuie sur la théorie de l'estimation d'état et du filtrage, cadre mathématique rigoureux qui ouvre la voie à de nombreuses extensions ultérieures. Ce travail compte parmi les fondations théoriques de la localisation et cartographie simultanées (SLAM), technique aujourd'hui indispensable à toute plateforme mobile autonome, des robots de logistique en entrepôt aux véhicules autonomes et aux humanoïdes équipés de capteurs LiDAR ou de caméras. En posant un cadre probabiliste pour gérer l'incertitude spatiale, la carte stochastique a permis de remplacer des approches rigides et pessimistes par des systèmes capables de fusionner des mesures bruitées en estimations exploitables, une condition nécessaire pour qu'un robot puisse naviguer et manipuler des objets de façon fiable dans un environnement partiellement connu. Le document correspond à un texte fondateur des années 1980, signé dans la lignée des travaux de Randall Smith et Peter Cheeseman sur l'estimation spatiale en robotique, republié sur arXiv pour archivage et accessibilité. Ses concepts ont depuis irrigué des décennies de recherche en SLAM, du filtrage de Kalman étendu jusqu'aux approches modernes par graphes de poses ou par apprentissage profond utilisées dans les piles de navigation actuelles. Sa republication en cross-listing illustre l'intérêt continu de la communauté robotique pour ces fondements mathématiques, alors que les systèmes de perception et de navigation autonomes se complexifient.

RecherchePaper
1 source
CLASP : sélection et composition de compétences robotiques pilotées par le langage avec apprentissage paramétré par la tâche
2arXiv cs.RO 

CLASP : sélection et composition de compétences robotiques pilotées par le langage avec apprentissage paramétré par la tâche

Des chercheurs ont publié sur arXiv (2606.08169) CLASP, une architecture modulaire permettant à un bras manipulateur à 7 degrés de liberté d'exécuter des tâches robotiques à partir de commandes en langage naturel, avec seulement 2 à 5 démonstrations kinesthésiques par compétence. Le système repose sur deux briques : des primitives de mouvement noyau paramétrées par tâche (TP-KMPs), héritées des méthodes d'imitation de données, et un modèle vision-langage (VLM) préentraîné, utilisé sans fine-tuning. Lors de la phase d'apprentissage, le VLM génère des schémas de compétences décrivant les paramètres nécessaires et les préconditions d'exécution. À l'exécution, il sélectionne la compétence adaptée, résout les liaisons de paramètres, et compose des comportements inédits via une pondération par covariance. Lorsqu'aucune compétence existante ne suffit, le système identifie automatiquement la lacune et sollicite une démonstration ciblée. Les taux de succès rapportés vont de 73,3 % à 100 % selon les scénarios testés (sélection, composition, apprentissage actif). Ce résultat est notable parce qu'il attaque un problème structurel du déploiement industriel : les modèles vision-langage-action (VLA) de nouvelle génération, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, atteignent des performances impressionnantes mais exigent des volumes de données d'entraînement massifs, difficilement compatibles avec les contraintes de production réelle. À l'inverse, les méthodes d'imitation efficaces en données, comme les TP-GMMs de Stefan Calinon, restent rigides face à des instructions non anticipées. CLASP propose une voie intermédiaire : déléguer le raisonnement symbolique au VLM sans le ré-entraîner, et garder la motricité dans un espace probabiliste compact. La boucle d'apprentissage actif intégrée est particulièrement pertinente pour les intégrateurs industriels : le robot peut signaler ce qu'il ne sait pas faire plutôt que d'échouer silencieusement. Les primitives de mouvement paramétrées par tâche ont une longue trajectoire académique, popularisées notamment par les travaux de Calinon et Billard depuis les années 2010. CLASP s'inscrit dans la vague actuelle qui cherche à greffer la compréhension du langage sur ces méthodes sans sacrifier leur frugalité en données, une direction également explorée par des équipes comme celles de CMU, ETH Zurich ou l'INRIA en France. La validation reste limitée à un manipulateur en laboratoire, les scénarios présentés sont sélectionnés, et les taux de succès ne sont pas contextualisés par rapport à la complexité des tâches ni à la variabilité environnementale. La prochaine étape évidente serait une évaluation sur des tâches de manipulation non structurées, voire un transfert vers une plateforme mobile ou humanoïde.

UEL'INRIA est cité parmi les équipes explorant des directions similaires (langage sur primitives de mouvement frugales en données), positionnant la France comme contributeur actif à cette vague de recherche, sans impact industriel direct à court terme.

RecherchePaper
1 source
Revisiter la perception des parties articulées en manipulation robotique
3arXiv cs.RO 

Revisiter la perception des parties articulées en manipulation robotique

Des chercheurs ont déposé en juin 2026 (arXiv:2606.08103) une nouvelle approche pour la perception des parties articulées d'objets du quotidien, portes, boîtes et poignées, baptisée GPS (Geometric Primary Structure). Ce cadre représente la géométrie des parties mobiles sous une forme abstraite et générique, collectée via un dispositif de réalité virtuelle portable : l'annotation d'une séquence d'objets prend moins d'une minute, contre plusieurs dizaines de minutes pour les pipelines de labellisation manuelle classiques. Appliqué sur 234 objets répartis en six classes de parties, le système a constitué un corpus de 41 000 frames. Le modèle GPS entraîné accepte en entrée une unique image RGB-D et, sans aucun fine-tuning spécifique au domaine, atteint un taux de réussite de 73 % sur 270 états initiaux couvrant 9 objets en manipulation robotique réelle, à partir d'une politique heuristique basée sur la prédiction GPS. Ce résultat illustre un point clé pour les intégrateurs et les équipes R&D industrielles : la qualité de la représentation perceptive conditionne directement la robustesse de la politique de manipulation. Les deux approches dominantes présentent des compromis défavorables. Les méthodes basées sur la pose nécessitent une annotation intensive et ne passent pas à l'échelle, tandis que les méthodes affordance-based, qui extraient le mouvement futur par point tracking, souffrent de données bruitées ou incomplètes. GPS tente d'occuper le terrain intermédiaire. Un taux de 73 % sans fine-tuning in-domain est une indication sérieuse de généralisation réelle, même si la validation sur 9 objets seulement invite à la prudence avant de conclure que le fossé entre démonstration et déploiement industriel est comblé. Le problème de la manipulation d'objets articulés constitue un verrou reconnu depuis les travaux fondateurs sur WHERE2ACT et les datasets de type OPD (OpenDoors-Dataset). GPS s'inscrit dans un mouvement plus large visant à remplacer les bases de connaissances statiques par des systèmes de perception apprenants et annotables à faible coût. Les auteurs rendent publics le code, les données et l'outil VR (enlighten0707.github.io/gps), ce qui favorise la reproductibilité et l'adoption en recherche. Les extensions naturelles incluent l'intégration avec des politiques de type VLA (Vision-Language-Action), la généralisation à des parties déformables, et la validation sur des objets industriels hors distribution.

RecherchePaper
1 source
Robotique recompositionnelle : une modularité interdomaine, en ensemble ouvert et tout au long de la vie, au-delà de la morphologie
4arXiv cs.RO 

Robotique recompositionnelle : une modularité interdomaine, en ensemble ouvert et tout au long de la vie, au-delà de la morphologie

Des chercheurs proposent de déplacer l'objectif de la robotique modulaire : plutôt que de construire des robots dont la structure change, concevoir des robots dont les capacités fondamentales peuvent évoluer. Publié sur arXiv (2609.37734, première version), le papier définit la « robotique recompositionnelle », une adaptation sur un ensemble hétérogène de modules couvrant le matériel, le logiciel, le calcul et les comportements. Chaque composant y est abstrait par les interfaces qu'il requiert et qu'il fournit, ce qui permet de raisonner sur l'ensemble de manière holistique. Les auteurs introduisent deux mesures : l'« intégration span », qui désigne l'étendue des domaines reconfigurables (cinémato-dynamique, perception, calcul, comportements de coordination de haut niveau), et l'« intégration inertia », qui mesure la résistance à la reconfiguration. Le texte s'appuie sur deux systèmes déployés et sur des travaux de recherche en cours, sans chiffres de performance dans le résumé disponible. Il s'agit d'un cadre conceptuel et d'une liste de questions ouvertes, pas d'un produit ni d'une démonstration commerciale. L'argument vise une limite du champ. Les travaux récents sur les robots modulaires savent changer de morphologie en ligne, choisir la morphologie à adopter et propager ce choix jusqu'à la planification de mouvement et au contrôle. Selon les auteurs, l'inertie d'intégration y est donc faible côté structure, mais reste élevée dans les autres domaines. Un robot reconfigurable dans un seul domaine a une capacité de changement limitée par rapport à un robot reconfigurable sur plusieurs. Pour les intégrateurs et les responsables industriels, cela déplace la question : changer un préhenseur ou un bras suffit rarement si la perception, le logiciel de contrôle et la logique de mission doivent être réécrits à la main. Le papier suggère que la valeur pratique de la modularité dépend des interfaces standardisées entre couches, pas seulement de connecteurs mécaniques. Ce constat rejoint les difficultés bien connues du déploiement, où le coût d'intégration domine souvent celui du matériel. Il s'agit toutefois d'une thèse à valider : aucune preuve d'un gain mesurable n'apparaît dans le résumé. Ce travail prolonge deux décennies de recherche sur les robots modulaires auto-reconfigurables, qui ont surtout optimisé la forme et la locomotion. Il croise aussi des courants actuels, comme les modèles vision-langage-action (VLA) généralistes, qui déplacent la capacité vers le logiciel, et les architectures logicielles à composants du type ROS. Les auteurs ne désignent pas dans ce résumé d'entreprises concurrentes ni d'acteurs européens. La suite est celle d'un programme de recherche : formaliser les interfaces entre modules, définir des critères de comparaison via l'intégration span et l'intégration inertia, puis tester la recomposition en environnement ouvert et sur la durée de vie du robot, dimensions annoncées par le titre (inter-domaines, ensemble ouvert, apprentissage tout au long de la vie).

RecherchePaper
1 source