Aller au contenu principal

Recherche — page 36

2264 articles · page 36 sur 46

Publications scientifiques en robotique : arXiv cs.RO, ICRA, IROS, Humanoids, CoRL — nouveaux algorithmes, benchmarks et datasets.

Jacobien structuré pour l'optimisation du mouvement à dérivées temporelles d'ordre élevé dans les systèmes multi-corps
1751arXiv cs.RO RecherchePaper

Jacobien structuré pour l'optimisation du mouvement à dérivées temporelles d'ordre élevé dans les systèmes multi-corps

Des chercheurs ont publié sur arXiv (réf. 2605.15845) un framework analytique pour le calcul de Jacobiens dans les problèmes d'optimisation du mouvement de systèmes multi-corps articulés, typiquement robots humanoïdes ou modèles cinématiques humains. La contribution porte sur la prise en compte explicite des dérivées temporelles d'ordre élevé dans les fonctions de coût : au-delà de la position, vitesse et accélération, le jerk (dérivée troisième) ou la variation temporelle des forces sont des grandeurs pertinentes pour modéliser la fluidité du mouvement ou des comportements expressifs. Le framework dérive analytiquement les Jacobiens des quantités cinématiques et dynamiques (quantité de mouvement, forces, couples articulaires) par rapport aux coordonnées généralisées et leurs dérivées successives, en s'appuyant sur un formalisme dit de "comprehensive motion computation" qui exploite explicitement la structure en chaîne de la cinématique multi-segments. L'apport concret face aux méthodes dominantes, différentiation numérique ou automatique via JAX, PyTorch ou CasADi, est double : gain en efficacité computationnelle et meilleure stabilité numérique, confirmés par les benchmarks présentés dans l'article. Ces outils génériques ignorent la topologie interne de la chaîne cinématique, ce qui génère du surcoût calculatoire à mesure que l'ordre des dérivées augmente. Par ailleurs, le framework est démontré en optimisation inverse : à partir de données de mouvement observé, il retrouve les poids de la fonction de coût d'origine, une capacité directement exploitable pour l'analyse de compétences motrices, l'imitation du geste humain ou la personnalisation de trajectoires robotiques. Ce travail s'inscrit dans la continuité des efforts pour rendre l'optimisation du mouvement praticable en temps réel sur des architectures articulées complexes. Des bibliothèques comme Pinocchio, développée par l'équipe Gepetto du LAAS-CNRS et de l'INRIA en France, ou Drake du Toyota Research Institute adressent des problématiques voisines mais restent généralement limitées aux dérivées du second ordre. L'extension à des ordres arbitraires ouvre des perspectives pour les contrôleurs de robots expressifs et les systèmes d'imitation gestuelle. Point de vigilance : aucune validation sur robot physique n'est présentée à ce stade, les résultats demeurant purement numériques, et le passage à des applications embarquées temps-réel reste entièrement à démontrer.

UECe framework de Jacobiens analytiques pour dérivées d'ordre élevé pourrait enrichir des bibliothèques comme Pinocchio (LAAS-CNRS/INRIA), renforçant l'écosystème européen de planification de mouvement pour robots humanoïdes.

1 source
Cadre QUBO pour l'optimisation de conception de robots par structure cinématique : étude de cas sur une main robotique
1752arXiv cs.RO 

Cadre QUBO pour l'optimisation de conception de robots par structure cinématique : étude de cas sur une main robotique

Des chercheurs ont publié sur arXiv (2605.15510, mai 2026) un cadre de formulation QUBO, optimisation binaire quadratique sans contraintes, pour automatiser la sélection de structures cinématiques lors de la conception de robots. L'étude de cas retenue est une main robotique : un problème à 27 variables binaires, où chaque doigt est choisi parmi plusieurs variantes cinématiques candidates. Le modèle quadratique unifie quatre composantes : récompenses individuelles de design, interactions de workspace partagé entre doigts adjacents, contraintes one-hot (un seul module sélectionnable par articulation), et pénalités de dépendance structurelle. Les métriques cinématiques sont calculées classiquement en amont via simulation ; le problème combinatoire résultant est ensuite soumis à un recuit simulé, utilisé ici comme baseline classique pour valider la formulation, puis à un recuit quantique. Les résultats montrent que des combinaisons feasibles satisfaisant simultanément contraintes one-hot et contraintes par paires sont bien retrouvées, avec une plage de valeurs objectif qui se resserre lorsque le nombre de lectures augmente. Ce travail adresse un goulot réel dans la conception de robots modulaires : l'espace de design croît exponentiellement avec le nombre de sous-systèmes, rendant la recherche exhaustive ou par gradient impraticable au-delà de quelques dizaines de degrés de liberté. En reformulant le problème en QUBO, les auteurs ouvrent la voie à des solveurs de recuit quantique, disponibles commercialement via D-Wave, pour explorer des espaces de grande dimension. Il s'agit cependant d'une démonstration de faisabilité, pas d'un déploiement industriel : les 27 variables du problème test restent accessibles aux solveurs classiques, et l'article ne benchmarke pas directement les deux approches. Pour les équipes R&D en robotique, l'intérêt est avant tout méthodologique : disposer d'un pipeline structuré pour convertir des critères cinématiques hétérogènes (payload, dextérité, encombrement) en combinatoire standardisé compatible hardware quantique. L'optimisation de design de robots modulaires est un champ actif, porté notamment par des laboratoires comme MIT CSAIL, ETH Zurich, ou l'INRIA côté européen. L'application du calcul quantique à la robotique reste marginale mais progresse : plusieurs équipes explorent le QUBO pour la planification de trajectoires ou l'allocation de tâches multi-robots. Ce papier étend l'approche à la phase de conception elle-même, en amont de la chaîne. La prochaine étape naturelle serait de valider la formulation sur des problèmes à 50 variables ou plus, avec un benchmarking rigoureux contre des solveurs classiques compétitifs comme CPLEX ou Gurobi, exercice que les auteurs n'ont pas encore mené.

RecherchePaper
1 source
Au-delà de l'évitement de collision : priorité de passage entre robots et affordance spatiale en évacuation d'urgence
1753arXiv cs.RO 

Au-delà de l'évitement de collision : priorité de passage entre robots et affordance spatiale en évacuation d'urgence

Une équipe de chercheurs a publié sur arXiv (2605.16115) les résultats d'une étude expérimentale portant sur le comportement des robots de service mobiles lors d'évacuations d'urgence en espace confiné. Cinquante-six participants ont été soumis à un protocole d'expérimentation via un environnement virtuel de type jeu vidéo, simulant des couloirs étroits avec ou sans niches de refuge latérales. Quatre stratégies de cession d'espace ont été comparées : Hide (le robot s'efface dans une niche), LineEscape (il se déplace en ligne pour libérer le couloir), Freeze (immobilisation complète) et ShortestPath (trajectoire optimale sans considération sociale). L'étude mesure les réponses psychologiques individuelles, notamment le confort perçu et le délai cognitif ressenti par les évacués. Les résultats établissent une hiérarchie de préférence nette : Hide > LineEscape > Freeze > ShortestPath. La conclusion centrale est que la cession proactive d'espace surpasse significativement les approches statiques ou purement efficientistes. Plus important encore pour les concepteurs de systèmes, l'étude met en évidence le rôle déterminant des affordances environnementales : lorsqu'une niche est visible mais non utilisée par le robot (stratégie LineEscape), les participants perçoivent un délai cognitif nettement accru, même si leur trajectoire physique reste dégagée. Ce phénomène, qualifié d'"Expectation Violation", signale que la navigation robotique en contexte d'urgence ne peut se limiter à l'optimisation de trajectoire : elle doit intégrer les attentes spatiales implicites des humains. L'étude note également que l'expérience préalable avec des robots améliore la capacité des utilisateurs à interpréter des comportements sociaux complexes. Ce travail s'inscrit dans un débat de fond sur la cohabitation humain-robot dans les espaces publics et industriels, où la densité de déploiement des AMR (robots mobiles autonomes) augmente dans les entrepôts, hôpitaux et gares. Les stratégies de navigation actuelles, principalement héritées des algorithmes d'évitement de collision comme DWA ou RVO, ne modélisent pas les attentes cognitives humaines. Cette recherche pousse vers une navigation dite "sémantiquement consciente", qui intègre la géométrie de l'environnement comme signal social. Les auteurs annoncent une suite centrée sur les interactions entre essaims de robots et foules de piétons, un scénario particulièrement pertinent pour les opérateurs de sites à forte densité humaine.

RecherchePaper
1 source
Cadre d'identification reproductible et physiquement réalisable des paramètres dynamiques pour bras robot à faible coût
1754arXiv cs.RO 

Cadre d'identification reproductible et physiquement réalisable des paramètres dynamiques pour bras robot à faible coût

Des chercheurs ont soumis sur arXiv en mai 2025 (arXiv:2605.15949) un pipeline d'identification des paramètres dynamiques pour le CRANE-X7, bras à 7 degrés de liberté de RT Corporation destiné aux laboratoires à faible budget. Le modèle corps-rigide est réduit de 65 à 39 paramètres de base en supprimant les produits d'inertie là où la symétrie des segments le permet. Quarante trajectoires d'excitation, construites à la main à partir de primitives mono et bi-articulation dans les limites mécaniques de chaque axe, alimentent une chaîne enchaînant moindres carrés ordinaires (OLS), projection par programmation semi-définie positive (SDP) pour rétablir la faisabilité physique, puis raffinement par erreur d'entrée en boucle fermée (CLIE). Un espace d'analyse en composantes principales (PCA) permet de sélectionner le candidat statistiquement central parmi les 40 modèles résultants. Un audit final de définie-positivité de la matrice d'inertie sur toutes les poses articulaires valide le résultat; un step SDP de secours corrige les violations résiduelles si nécessaire. L'enjeu est pratique: les méthodes par moindres carrés standard produisent régulièrement des paramètres physiquement incohérents (matrices d'inertie non définies positives), ce qui rend instables les contrôleurs en couple et les simulations physiques. Pour les intégrateurs et équipes de recherche, un modèle dynamique certifié est un prérequis pour la commande d'impédance, la compensation de gravité, ou l'apprentissage par démonstration. Les résultats expérimentaux montrent une concentration progressive du nuage de paramètres d'OLS vers SDP puis CLIE, avec une bonne précision prédictive conservée sur des trajectoires de validation hors-échantillon. La réduction 65-à-39 paramètres mérite toutefois d'être testée sur d'autres morphologies avant d'être généralisée. Le CRANE-X7 est une plateforme académique japonaise répandue dans les labos universitaires, mais elle manque de données dynamiques calibrées fournies par le constructeur, problème typique des bras à actionneurs modulaires de type Dynamixel. L'identification par SDP pour garantir la faisabilité physique remonte aux travaux d'Atkeson et al. dans les années 1990; son intégration dans un pipeline ouvert et reproductible avec sélection statistique et audit final reste peu documentée. Des approches concurrentes comme l'optimisation non-linéaire directe ou l'identification neuronale offrent moins de garanties de cohérence physique. Des plateformes de segment supérieur telles que le Kinova Gen3 ou le Franka Research 3 bénéficient de spécifications constructeur plus complètes. Une validation croisée sur d'autres robots à faible coût, voire une intégration dans des frameworks open-source comme Drake ou ros2_control, constituerait la suite logique de ces travaux.

UELes laboratoires européens équipés de bras modulaires à actionneurs Dynamixel (CRANE-X7 ou similaires) peuvent appliquer ce pipeline open pour obtenir des modèles dynamiques certifiés physiquement cohérents, prérequis pour la commande d'impédance et l'apprentissage par démonstration.

RecherchePaper
1 source
Apprentissage de politiques ancrées en simulation pour la manipulation bimanuelle de corde à partir de données de téléopération humaine
1755arXiv cs.RO 

Apprentissage de politiques ancrées en simulation pour la manipulation bimanuelle de corde à partir de données de téléopération humaine

Une équipe de recherche publie sur arXiv (ref. 2605.16043) une étude comparative sur la manipulation bimanuelle de cordes par robot, en se concentrant sur la tâche de démêlage de nœuds. Les chercheurs ont entraîné deux politiques de contrôle basées sur le framework ACT (Action Chunking with Transformers) à partir des mêmes données de télé-opération humaine : la première reçoit en entrée deux flux vidéo RGB provenant de caméras montées sur les poignets du robot, la seconde utilise un état 3D particulaire de la corde, extrait par fusion multi-vues puis propagé dans un simulateur xPBD (eXtended Position-Based Dynamics). Évaluée en boucle ouverte sur une configuration de corde inédite, la politique à base d'état réduit l'erreur L1 de 30,8 % sur l'action initiale de saisie et de traction, par rapport à son homologue visuelle. Ce résultat isole une cause souvent sous-estimée des échecs de généralisation en apprentissage par imitation : non pas l'architecture du réseau ni le volume de données, mais l'espace d'observation lui-même. Les objets linéaires déformables (DLO) comme les câbles et les cordes posent un problème d'auto-occultation fréquente sous caméra ego-centrique, rendant la perception purement visuelle peu robuste sur des configurations non vues à l'entraînement. En ancrant la représentation dans un état physique cohérent simulé par xPBD, les chercheurs comblent partiellement ce "gap d'observabilité" entre pixels bruts et état mécanique réel, ouvrant la voie à un apprentissage plus efficace en données depuis un faible nombre de démonstrations humaines. La manipulation de DLOs est un problème ouvert de longue date en robotique, car leur espace de configuration est théoriquement infini-dimensionnel. L'approche par télé-opération bimanuelle est bien établie depuis les travaux sur ACT (Stanford/Berkeley, 2023), mais sa dépendance à de grands volumes de données limite la scalabilité industrielle. Cette étude s'inscrit dans un courant qui cherche à compenser le manque de données par une meilleure structure de représentation, comparable aux travaux sur les VLA (Vision-Language-Action models) mais ici centré sur la physique plutôt que le langage. Les prochaines étapes naturelles incluent la validation en boucle fermée et l'évaluation sur des câbles industriels, contexte où des acteurs comme Cobot Systems ou des labos européens spécialisés câblage automobile pourraient trouver un intérêt direct.

UEImpact indirect : les équipementiers et laboratoires européens spécialisés dans le câblage automobile pourraient exploiter cette approche pour réduire le volume de données de téléopération requis, un goulot d'étranglement réel dans ce secteur.

RecherchePaper
1 source
Apprentissage de la prise-et-dépose dynamique pour un manipulateur à pattes
1756arXiv cs.RO 

Apprentissage de la prise-et-dépose dynamique pour un manipulateur à pattes

Des chercheurs ont publié le 21 mai 2026 sur arXiv (réf. 2605.15713) un framework d'apprentissage par renforcement hiérarchique permettant à un robot quadrupède équipé d'un bras à 6 degrés de liberté (6-DOF) d'effectuer des tâches de pick-and-place dynamiques avec des charges allant jusqu'à 2,3 kg en simulation et 1,3 kg en environnement réel. Le système intègre un module explicite d'estimation de masse qui adapte en temps réel le contrôle whole-body en fonction du poids de l'objet saisi. En simulation, le taux de succès atteint 86,05 %. Sur six scénarios réels combinant variations de taille, de masse et de hauteur de dépôt, le système affiche un taux de succès moyen de 73,3 % dans un espace de travail vertical allant du sol à des surfaces à 1,1 m de hauteur, avec un temps d'exécution moyen de 4,06 secondes par cycle. Ce résultat est notable pour deux raisons techniques. D'abord, le système exécute locomotion et manipulation en simultané, abandonnant l'approche séquentielle (se déplacer, s'arrêter, saisir) qui dominait les travaux antérieurs et limitait la cadence opérationnelle. Ensuite, le module d'estimation de masse compense dynamiquement les variations de charge, ce qui est un prérequis pour tout déploiement industriel réel où les objets ne sont pas homogènes. La chute de performance entre simulation et réel (de 86 % à 73 %) illustre que le sim-to-real gap n'est pas encore résolu, mais reste dans une plage acceptable pour des scénarios semi-contrôlés. Les charges manipulées restent modestes comparées aux bras industriels fixes, et les vidéos de démonstration sélectionnées ne couvrent pas de conditions adverses (surfaces glissantes, occlusions). Le robot quadrupède mobile doté d'un bras manipulateur est un segment en forte croissance, porté par des plateformes commerciales comme le Spot d'Boston Dynamics (avec son bras optionnel), l'ANYmal d'ANYbotics, ou le B2 d'Unitree couplé à des bras tiers. Ce travail de recherche, non affilié à un produit commercial annoncé, s'inscrit dans la lignée des travaux sur les manipulateurs mobiles à pattes publiés ces deux dernières années par ETH Zurich, CMU et des équipes chinoises. La prochaine étape attendue dans ce domaine est la généralisation à des objets non rigides ou à géométrie inconnue, ainsi qu'une intégration de la perception visuelle en boucle fermée pour réduire la dépendance aux modèles d'objet préenregistrés.

RecherchePaper
1 source
Régions circulaires sûres à expansion rapide pour une planification locale de trajectoires efficace
1757arXiv cs.RO 

Régions circulaires sûres à expansion rapide pour une planification locale de trajectoires efficace

Des chercheurs ont publié sur arXiv (2605.16009, mai 2026) une méthode géométrique de navigation locale pour robots mobiles, baptisée FESCR (Fast Expanding Safe Circular Regions). Le principe repose sur le calcul d'une séquence de régions circulaires dérivées d'un scan LiDAR local : ces cercles s'étendent progressivement dans la direction du but tout en restant confinés à l'espace libre détecté. L'algorithme génère ainsi un couloir navigable en temps quasi-réel, sans recourir à un solveur d'optimisation. La méthode a été intégrée dans le framework ROS2 et évaluée dans un environnement simulé. Aucun déploiement sur hardware réel ni chiffres de benchmark précis (temps de calcul en ms, fréquence de replanning) ne sont fournis dans la prépublication. L'intérêt principal de cette approche est sa complexité algorithmique réduite par rapport aux méthodes concurrentes. Le Dynamic Window Approach (DWA) et le Model Predictive Control (MPC) reposent sur des boucles d'optimisation coûteuses, difficiles à tenir en temps réel dans des environnements denses ou changeants. Les Control Barrier Functions (CBF) et les techniques d'apprentissage apportent de la robustesse théorique mais introduisent soit une charge computationnelle élevée soit une dépendance aux données d'entraînement. FESCR contourne ces contraintes par une construction géométrique directe, ce qui, selon les auteurs, permet des horizons de planification plus longs à charge CPU égale. C'est un argument pertinent pour les intégrateurs AMR opérant sur des plateformes embarquées à ressources limitées, même si l'affirmation reste à valider sur des benchmarks standardisés (ex. nav2_benchmark, BARN dataset). La navigation locale est un problème ouvert depuis les travaux fondateurs de Fox et al. sur le DWA (1997). Les approches récentes comme TEB (Timed Elastic Band) ou MPPI (Model Predictive Path Integral) ont progressivement repoussé les limites de performance, mais au prix d'une complexité d'intégration croissante. FESCR s'inscrit dans un mouvement de retour aux méthodes géométriques légères, observable aussi dans des travaux comme les corridor-based planners de Carnegie Mellon ou les méthodes à champ de potentiel revisitées. Les prochaines étapes naturelles sont la validation sur robot réel (terrain irrégulier, obstacles dynamiques) et la comparaison quantitative avec nav2 DWB sur le benchmark BARN, ce que la prépublication ne fournit pas encore.

RecherchePaper
1 source
Héritage lamarckien en environnements dynamiques : comment les variables clés influencent la dynamique évolutive
1758arXiv cs.RO 

Héritage lamarckien en environnements dynamiques : comment les variables clés influencent la dynamique évolutive

Une équipe de chercheurs en robotique évolutionnaire a publié en mai 2025 sur arXiv (2605.15769) une étude clarifiant les conditions dans lesquelles l'héritage lamarckien améliore ou dégrade les performances d'un système de co-optimisation corps-cerveau. L'expérience repose sur des robots mous virtuels dont la morphologie évolue par algorithme évolutionnaire, tandis que le contrôleur est optimisé en cours de vie par apprentissage, soit par optimisation bayésienne, soit par apprentissage par renforcement. L'héritage lamarckien consiste ici à transférer directement les paramètres de contrôle appris par un parent à sa descendance, à la différence de l'héritage darwinien classique qui ne transmet que le génome structurel. Les auteurs font varier deux dimensions de l'environnement dynamique : le niveau de conflit entre les changements environnementaux et le comportement optimal du robot, et la prévisibilité de ces changements pour l'agent. Résultat : l'héritage lamarckien n'est inférieur à l'approche darwinienne que dans le seul cas où les changements sont à la fois conflictuels et imprévisibles. L'ajout d'un capteur permettant de détecter les transitions environnementales restaure les bénéfices lamarckiens même dans les environnements conflictuels, en donnant à l'agent les moyens d'anticiper un changement de comportement nécessaire. Ce résultat réconcilie une littérature jusque-là contradictoire. La théorie évolutionnaire classique considère l'héritage lamarckien comme neutre ou négatif à long terme, tandis que plusieurs travaux récents en robotique évolutionnaire rapportaient des gains de performance. Cette étude suggère que les comparaisons précédentes omettaient de contrôler conjointement la conflictualité et la prévisibilité des perturbations, deux variables qui interagissent de façon non-linéaire. Pour les praticiens du morpho-evolution, domaine qui cherche à co-optimiser forme et contrôle pour des robots adaptatifs industriels ou de terrain, cela pose un cadre d'analyse actionnable : le bon mécanisme d'héritage dépend du profil statistique de l'environnement opérationnel, pas d'un choix dogmatique. La co-optimisation morphologie-contrôleur est un problème ouvert depuis les travaux fondateurs de Karl Sims dans les années 1990, et reste un défi majeur en conception de robots autonomes. La robotique douce (soft robotics) sert ici de banc d'essai car ses espaces morphologiques continus amplifient la sensibilité aux stratégies d'héritage. Ce preprint n'est pas encore évalué par les pairs et les résultats reposent exclusivement sur simulation, le transfert sim-to-real reste à démontrer. Parmi les acteurs qui travaillent sur des approches similaires figurent des laboratoires comme le Vermont Complex Systems Center ou le groupe Kriegman, ainsi que des initiatives industrielles en conception générative de robots. La prochaine étape naturelle est une validation sur morphologies physiques dans des environnements dont les statistiques sont connues et contrôlées.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes
1759arXiv cs.RO 

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes

Une équipe de recherche publie sur arXiv (référence 2605.16056) un modèle VLA (Vision-Language-Action) capable d'adapter son comportement à la dégradation physique d'un robot, une problématique distincte des pannes de tâches habituellement ciblées par la littérature. L'approche repose sur l'injection d'un module "Health Projector" dans l'architecture VLA-Adapter : le modèle reçoit en entrée un vecteur de santé encodant l'amplitude articulaire et le couple disponible pour chaque joint. Entraîné sur 128 épisodes téléopérés collectés dans l'environnement de simulation LIBERO (benchmark Libero-Spatial), il parvient à compléter des tâches de manipulation spatiale avec des configurations de joints dégradés où le modèle de référence VLA-Adapter Libero-Spatial-Pro échoue systématiquement. Le code et le jeu de données seront prochainement disponibles sur GitHub (h-arslan/health-aware-vla). L'intérêt industriel est réel : dans les déploiements terrain, les robots accumulent des dégradations mécaniques progressives (usure articulaire, perte de couple, grippage de préhenseur) sans nécessairement déclencher d'alarme critique. Un contrôleur aveugle à cet état physique maintient ses consignes nominales et accumule les erreurs ; un modèle conditionné à la santé peut recalculer ses trajectoires à la volée. La modification proposée est présentée comme légère, ce qui suggère une intégration possible dans des pipelines VLA existants sans refonte complète. Cependant, les résultats restent limités à la simulation LIBERO avec 128 épisodes seulement, un jeu de données particulièrement restreint, et aucune validation sur robot physique n'est présentée, laissant le gap sim-to-real entièrement ouvert. Ce travail s'inscrit dans l'expansion rapide des VLA depuis 2023, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA ou la famille RoboVLMs. VLA-Adapter, utilisé comme base ici, est une variante qui réduit les coûts de fine-tuning en gelant le backbone visio-langagier pour n'entraîner qu'un adaptateur léger. La résilience robotique est jusqu'ici majoritairement traitée côté contrôle bas niveau (détection de fautes, compensation par redondance articulaire) plutôt qu'au niveau de la politique visuo-langagière, ce qui rend l'angle de cette recherche original. Aucun acteur européen n'est impliqué dans cette publication. La prochaine étape logique serait une validation sur hardware réel avec des dégradations induites mécaniquement et un dataset substantiellement élargi pour crédibiliser le passage à l'échelle.

RechercheOpinion
1 source
Politique de diffusion pour le contrôle coordonné d'une base mobile non-holonome et de deux bras lors du franchissement de portes
1760arXiv cs.RO 

Politique de diffusion pour le contrôle coordonné d'une base mobile non-holonome et de deux bras lors du franchissement de portes

Un groupe de chercheurs a publié sur arXiv (preprint 2605.15352) une politique de contrôle fondée sur la diffusion, capable de faire ouvrir et franchir une porte à loquet auto-fermant par un robot mobile équipé de deux bras. La tâche ciblée, une porte lourde nécessitant une traction, est décomposée en plusieurs phases enchaînées sans intervention manuelle : rotation de la poignée, traction progressive, maintien de l'ouverture, transfert d'appui entre les deux membres, déplacement de la base, puis passage complet. Le robot repose sur une base non-holonome (incapable de se déplacer latéralement sans rotation préalable), ce qui contraint fortement la coordination simultanée entre châssis et manipulateurs. Les auteurs ne communiquent ni le nom du robot utilisé ni de taux de succès chiffré dans l'abstract, ce qui limite l'évaluation indépendante des performances annoncées. L'intérêt technique réside dans l'abandon des automates à états finis classiques, où chaque transition (tirer une fois la poignée tournée, passer une fois l'ouverture suffisante) est programmée manuellement et échoue dès que les conditions réelles dévient du scénario prévu. L'approche par imitation learning, via une diffusion policy (modèle génératif entraîné à reproduire des démonstrations humaines en capturant une distribution de trajectoires plutôt qu'une unique solution), produit une politique unique de bout en bout qui gère l'intégralité de la séquence longue sans découpage explicite. Les auteurs signalent également une robustesse aux perturbations extérieures, comme des poussées appliquées au robot en cours de tâche, résultat difficile à atteindre avec des méthodes classiques. Pour les intégrateurs industriels, les variables clés à valider restent le sim-to-real et la généralisation à la diversité physique des portes réelles. La diffusion policy s'est imposée comme paradigme dominant en manipulation robotique depuis les travaux de Chi et al. (Columbia, 2023) et irrigue aujourd'hui des laboratoires académiques et des start-ups comme Physical Intelligence (Pi-0), 1X Technologies ou Covariant. Ce preprint s'inscrit dans un effort plus large vers la manipulation mobile bimanuelle, segment encore peu couvert commercialement : Boston Dynamics (Spot + bras ARM), Hello Robot (Stretch) ou Kinova opèrent principalement en manipulation unimanuelle ou sur base fixe. Aucune collaboration industrielle ni timeline de déploiement n'est mentionnée, ce qui situe ce travail résolument côté recherche fondamentale, malgré des résultats préliminaires prometteurs sur les longues séquences gestuelles.

RecherchePaper
1 source
Graphes de scène 3D fonctionnels, hiérarchiques et holistiques, à vocabulaire ouvert pour espaces intérieurs
1761arXiv cs.RO 

Graphes de scène 3D fonctionnels, hiérarchiques et holistiques, à vocabulaire ouvert pour espaces intérieurs

Des chercheurs ont publié en mai 2026 sur arXiv (référence 2605.15753) une méthode pour construire des graphes de scènes 3D fonctionnels et hiérarchiques dans des espaces intérieurs, à vocabulaire ouvert. Ces graphes représentent l'environnement sous forme de noeuds objets, d'éléments interactifs et d'arêtes de relations fonctionnelles, permettant à un robot de comprendre non seulement ce qui est présent dans une pièce, mais comment les objets peuvent interagir entre eux. La contribution principale est l'extension des benchmarks existants en y intégrant des objets denses posés sur des surfaces planes (tabletop), ainsi que des relations fonctionnelles multi-niveaux explicites. Le pipeline proposé repose sur un ancrage visuel 2D (visual grounding) couplé à une optimisation de graphes 3D, combinant accumulation d'évidence, régularisation par entropie et lissage temporel pour résoudre l'association entre instances et déterminer les connexions fonctionnelles de chaque noeud. Une étape finale de structuration hiérarchique globale permet de récupérer la structure en niveaux du graphe complet. L'intérêt de cette approche pour la manipulation robotique est concret. Les travaux antérieurs sur les graphes de scènes se concentraient sur les meubles de grande taille, laissant de côté la granularité fine nécessaire pour les tâches impliquant des objets de bureau ou de cuisine. Introduire des objets petits, denses et visuellement similaires (tasses, stylos, boîtes) crée trois défis techniques distincts: confusion entre instances lors de la fusion inter-images, incertitude d'attribution sous des points de vue dynamiques, et absence d'ancrage visuel dans le raisonnement relationnel. Le pipeline open-vocabulary présenté aborde ces trois points sans catégories prédéfinies, ce qui représente un avantage pratique pour des déploiements en environnements variés. Les expériences reportées montrent une inférence fiable sur des scènes réelles exigeantes, bien que le résumé soumis ne détaille pas de métriques quantitatives précises, ce qui rend difficile toute comparaison directe avec l'état de l'art. Les graphes de scènes sémantiques pour la robotique sont étudiés depuis une dizaine d'années, mais leur adoption pratique a été freinée par des benchmarks limités aux grandes structures, peu représentatifs des scénarios de manipulation réelle. Ce travail s'inscrit dans une tendance plus large vers la perception embodied à vocabulaire ouvert, en concurrence directe avec les approches basées sur les champs de radiance neuronaux (NeRF, 3DGS) ou la segmentation 3D ouverte comme OpenMask3D et ConceptFusion. Ce type de représentation est fondamental pour les systèmes de planification de tâches et les robots de service opérant en environnement non structuré. Aucune timeline de déploiement industriel n'est mentionnée: il s'agit d'un preprint de recherche académique, pas d'un produit commercialisé ni d'un partenariat industriel annoncé.

RecherchePaper
1 source
HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines
1762arXiv cs.RO 

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines

Une équipe de chercheurs a publié sur arXiv (arXiv:2603.03243v2) HoMMI, pour Whole-Body Mobile Manipulation Interface, un framework d'apprentissage par imitation permettant à un robot mobile de maîtriser la manipulation bimanuelle et la navigation à partir de démonstrations humaines réalisées sans robot. Le principe : un opérateur humain porte une interface portative héritée du projet UMI (Universal Manipulation Interface), enrichie d'une caméra égocentrique capturant le contexte global de la scène (position dans l'espace, état de l'environnement). Ces données brutes alimentent une politique apprise, transférée ensuite sur un robot à corps entier (bras, torse, base mobile) sans que celui-ci n'ait été présent lors de la collecte. La difficulté centrale que HoMMI cherche à résoudre est l'"embodiment gap" : la différence morphologique et sensorielle entre humain et robot rend le transfert de politique difficile, particulièrement en perception égocentrique où les champs de vue et hauteurs d'oeil divergent fortement. Les auteurs proposent trois briques techniques pour combler cet écart : une représentation visuelle agnostique à l'embodiment, une représentation d'action "head relaxed" qui neutralise les variations de mouvement de tête, et un contrôleur corps entier réalisant les trajectoires main-oeil sous contraintes physiques du robot. Ces choix permettent des tâches longue-séquence mobilisant navigation, perception active et coordination bimanuelle, le type de scénario que les architectures Vision-Language-Action (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA visent également à résoudre. Les résultats, présentés sous forme de vidéos sur hommi-robot.github.io, restent à valider en conditions non contrôlées et sur des benchmarks standardisés. HoMMI s'inscrit dans la continuité directe du projet UMI (Columbia/Stanford, 2024), qui avait popularisé la collecte portable de démonstrations pour la manipulation fixe sur table. L'extension au robot mobile ajoute la dimension navigation, saut de complexité majeur pour le sim-to-real et la généralisation hors laboratoire. Les approches concurrentes incluent Mobile ALOHA (Stanford), les pipelines de distillation de données de Physical Intelligence, et les travaux de manipulation bimanuelle ALOHA/ACT de Berkeley. HoMMI reste à ce stade un preprint arXiv sans déploiement industriel annoncé ni métriques de taux de succès publiées, une limite habituelle des publications en robotique d'apprentissage avant revue par les pairs.

RecherchePaper
1 source
Apprentissage par renforcement contraint par la sécurité avec vérification d'atteignabilité post-entraînement pour la navigation robotique
1763arXiv cs.RO 

Apprentissage par renforcement contraint par la sécurité avec vérification d'atteignabilité post-entraînement pour la navigation robotique

Des chercheurs ont publié sur arXiv (2605.14174) un framework combinant apprentissage par renforcement contraint par le CVaR (Conditional Value-at-Risk) et vérification formelle post-entraînement pour la navigation sûre de robots mobiles en environnement encombré. La politique est entraînée sur un algorithme TD3 off-policy (Twin Delayed Deep Deterministic Policy Gradient) sous contraintes CVaR sur les coûts cumulés, ce qui la rend sensible aux événements rares à haute conséquence plutôt qu'aux seules performances moyennes. Après l'entraînement, des ensembles d'actions atteignables sont calculés sous incertitude d'observation bornée via une analyse par modèles de Taylor, produisant un taux de sécurité formel et quantifiable. Sur dix scénarios de navigation et six baselines concurrents, la méthode atteint 98,3 % de succès et le meilleur taux de vérification formelle parmi toutes les approches évaluées. La validation a été conduite sur un robot physique Clearpath Jackal, confirmant le transfert sim-to-real. Le résultat le plus significatif est une divergence démontrée entre classements par coût moyen et classements par vérification d'atteignabilité : un système jugé performant selon les métriques empiriques classiques peut dissimuler des comportements dangereux dans les queues de distribution. C'est un point critique pour les intégrateurs et les décideurs industriels qui qualifient leurs politiques de navigation sur des benchmarks de coût moyen. Les politiques entraînées avec contraintes CVaR maintiennent des marges de sécurité plus larges face aux obstacles, ce qui les rend structurellement plus compatibles avec la vérification formelle, prérequis pour une certification dans des secteurs réglementés comme la logistique, l'industrie ou la santé. Le CVaR, outil de la finance quantitative pour quantifier le risque de queue, s'impose progressivement dans les systèmes cyber-physiques. Ce travail reste une preprint arXiv, pas encore soumise à peer review. L'espace concurrent rassemble les approches par barrières de contrôle (CBF-QP), le RL lagrangien et les méthodes de Lyapunov. La vérification formelle de réseaux de neurones, portée par des outils comme alpha,beta-CROWN, est un axe en développement rapide. Des plateformes AMR comme celles de Clearpath (utilisée ici en validation) ou, côté français, des acteurs logistiques comme Exotec pourraient directement bénéficier de ce type de pipeline de validation. Les suites naturelles seraient une évaluation en environnements dynamiques avec obstacles mobiles et une soumission à une conférence majeure comme ICRA ou IROS.

UELes acteurs logistiques et industriels européens, dont Exotec en France, pourraient directement intégrer ce type de pipeline de validation formelle pour certifier leurs politiques de navigation AMR dans des secteurs réglementés (logistique, santé, industrie).

RecherchePaper
1 source
Exploration des goulots d'étranglement dans la navigation VLM-LLM : l'impact de la compréhension de scènes 3D sur la navigation sans apprentissage préalable
1764arXiv cs.RO 

Exploration des goulots d'étranglement dans la navigation VLM-LLM : l'impact de la compréhension de scènes 3D sur la navigation sans apprentissage préalable

Des chercheurs ont publié le 20 mai 2026 sur arXiv (arXiv:2605.14801) une étude quantifiant un goulet d'étranglement structurel dans les systèmes de navigation zéro-shot pilotés par VLM-LLM (Vision-Language Model couplé à un Large Language Model). Le paradigme analysé repose sur une architecture à deux étages : un VLM construit des graphes de scène 3D en extrayant objets, relations spatiales et sémantique de l'environnement, tandis qu'un LLM prend les décisions de haut niveau (planification topologique) et pilote un navigateur réactif rapide via coordonnées spatiales et boîtes englobantes. Les auteurs ont modélisé des bornes supérieures statistiques du taux de succès pour ces deux sous-systèmes, les ont validées sur les modèles 3D de l'état de l'art, et ont identifié un phénomène de saturation perceptive : au-delà d'un certain seuil de précision 3D, les gains de navigation deviennent marginaux, voire nuls. Ce résultat remet en cause une hypothèse implicite du secteur : que progresser en perception 3D se traduit mécaniquement en meilleure navigation incarnée. L'étude montre que les modèles de perception actuels optimisent la précision au niveau pixel, ce qui entre directement en conflit avec les contraintes temps-réel d'un robot naviguant dans un environnement dynamique. Pour les intégrateurs et les équipes de R&D robotique, cela signifie que sur-investir en qualité de segmentation ou de reconstruction 3D fine ne se justifie pas pour la navigation autonome : la ressource limitante n'est pas la résolution perceptive, mais la pertinence sémantique des objets détectés et la fiabilité des boîtes englobantes pour l'exécution motrice. C'est un signal fort pour réorienter les efforts vers des vocabulaires visuels navigation-centrés plutôt que vers la précision géométrique exhaustive. La navigation zéro-shot par VLM-LLM est un axe de recherche actif depuis 2022, porté notamment par des travaux sur les agents incarnés dans des simulateurs comme Habitat ou R2R (Room-to-Room). Cette approche vise à s'affranchir des coûts massifs de collecte de données supervisées qui pèsent sur les architectures imitation-learning classiques. Dans le paysage concurrent, des équipes chez Google DeepMind, Meta AI et des laboratoires universitaires (Stanford, CMU) explorent des variantes similaires, certaines intégrant des modèles VLA (Vision-Language-Action) de bout en bout comme Pi-0 ou GR00T N2. Cette étude ne présente pas de déploiement terrain, mais ses bornes analytiques pourraient guider la conception de benchmarks plus pertinents et orienter l'entraînement des prochaines générations de modèles de perception 3D spécialisés navigation.

RechercheOpinion
1 source
Any3D-VLA : améliorer la robustesse des modèles VLA grâce à des nuages de points diversifiés
1765arXiv cs.RO 

Any3D-VLA : améliorer la robustesse des modèles VLA grâce à des nuages de points diversifiés

Les modèles VLA (Vision-Language-Action) qui pilotent aujourd'hui les robots manipulateurs reposent quasi-exclusivement sur des images 2D comme entrée visuelle. Une équipe de chercheurs publie sur arXiv (arXiv:2506.00807v2) Any3D-VLA, une architecture d'entraînement qui intègre explicitement des nuages de points 3D pour améliorer la robustesse spatiale de ces modèles. L'approche fusionne trois sources de nuages de points hétérogènes, données de simulation, capteurs de profondeur réels (LiDAR, RGB-D), et estimation par modèle monoculaire, avec les représentations 2D existantes, dans un pipeline d'entraînement unifié. Les expériences couvrent à la fois des environnements simulés et des déploiements réels, et montrent des gains de performance mesurables sur des tâches de manipulation. L'intérêt technique est double. D'abord, le papier démontre empiriquement que "lever" l'entrée visuelle en nuage de points produit des représentations complémentaires aux features 2D, plutôt que redondantes, ce qui valide une hypothèse souvent discutée dans la communauté VLA. Ensuite, Any3D-VLA s'attaque directement aux deux verrous pratiques qui ont jusqu'ici freiné l'adoption du 3D dans ce domaine : la rareté des données 3D annotées et le domain gap lié aux différences de calibration entre environnements et aux biais d'échelle de profondeur. En traitant ces deux obstacles dans un seul framework, le travail suggère une voie vers des VLA plus robustes au sim-to-real transfer, un problème central pour le déploiement en conditions industrielles réelles. Les VLA sont au cœur d'une course intense depuis la publication de RT-2 (Google DeepMind, 2023) et l'essor de modèles comme Pi-0 (Physical Intelligence), OpenVLA, ou RoboVLMs. La plupart restent limités par leur dépendance aux caméras RGB standard, ce qui crée des angles morts en cas d'occlusion ou de scènes encombrées. Any3D-VLA ne propose pas encore un produit déployé : il s'agit d'une contribution de recherche avec code et page projet publics. La prochaine étape logique serait une intégration dans des pipelines de fine-tuning utilisés par des acteurs comme Physical Intelligence ou les équipes robotique de Figure AI, qui cherchent précisément à réduire le nombre de démonstrations réelles nécessaires grâce à un meilleur transfert depuis la simulation.

RechercheOpinion
1 source
Vers l'intelligence des mains dextériques en robotique : un état de l'art
1766arXiv cs.RO 

Vers l'intelligence des mains dextériques en robotique : un état de l'art

Une équipe de chercheurs a publié en mai 2026 sur arXiv (identifiant 2605.13925) une revue systématique de l'état de l'art des mains robotiques dextres, couvrant l'ensemble de la chaîne de recherche : mécanique et actionnement, perception tactile, méthodes de contrôle et d'apprentissage, jeux de données et protocoles d'évaluation. Le papier structuré en quatre axes examine les compromis fondamentaux entre capacité de force, compliance mécanique, bande passante de contrôle et complexité d'intégration. Il recense les principales architectures de transmission (câbles, tendons, engrenages), les modalités sensorielles embarquées (capteurs de force, peau artificielle, vision tactile type GelSight), et retrace l'évolution chronologique des paradigmes de contrôle : du contrôle impédanciel classique vers les approches par apprentissage par renforcement, imitation, et plus récemment les Visual-Language-Action models (VLA) appliqués à la manipulation en contact riche. L'intérêt principal de cette synthèse pour les équipes R&D et les intégrateurs industriels est qu'elle tente de résoudre un problème structurel du domaine : l'hétérogénéité des hypothèses expérimentales rend les comparaisons entre travaux quasi impossibles. Les auteurs pointent explicitement que les résultats publiés varient selon l'embodiment de la main, la configuration sensorielle, le type de tâche et le protocole d'évaluation retenu, ce qui obscurcit la trajectoire réelle du secteur. En consolidant datasets, pratiques de benchmarking et métriques d'évaluation dans un cadre commun, le survey fournit une grille de lecture pour juger si les progrès annoncés relèvent d'avancées méthodologiques réelles ou d'artefacts de setup. C'est particulièrement utile dans un contexte où les démos vidéo soigneusement sélectionnées et les claims "sim-to-real solved" se multiplient sans validation robuste sur des tâches industrielles répétables. Ce travail s'inscrit dans une vague de consolidation académique portée par l'essor des mains humanoïdes commerciales : Figure (main intégrée sur Figure 02 et 03), Tesla Optimus, Agility Robotics ou encore les systèmes de Sanctuary AI ont tous relancé l'intérêt pour la manipulation dextre après deux décennies de progrès limités post-DLR Hand et Shadow Hand. Côté recherche, les laboratoires Carnegie Mellon, Stanford, ETH Zurich et, en Europe, des acteurs comme Enchanted Tools (France) et des spin-offs universitaires allemands poussent des approches hybrides hardware-learning. Le survey identifie comme chantiers ouverts prioritaires : la généralisation hors distribution (objets inconnus, matériaux déformables), la robustesse sensorielle en conditions industrielles dégradées, et la co-optimisation hardware-software encore trop rare. Aucun calendrier de publication étendue n'est annoncé ; le preprint est disponible en accès libre sur arXiv.

UELe survey cite explicitement Enchanted Tools (France) et des spin-offs universitaires allemands comme acteurs actifs sur la manipulation dextre hybride hardware-learning, en faisant une ressource de référence directement pertinente pour les équipes R&D françaises du secteur.

RecherchePaper
1 source
Permettre aux robots de ressentir le toucher : alignement cortical visuo-tactile pour la résonance miroir incarnée
1767arXiv cs.RO 

Permettre aux robots de ressentir le toucher : alignement cortical visuo-tactile pour la résonance miroir incarnée

Une équipe de chercheurs a publié en mai 2025 sur arXiv (preprint 2605.14571) un travail présentant Mirror Touch Net, une architecture neuronale permettant à une main robotique de prédire des signaux tactiles à partir d'images RGB seules. Le système couvre 1 140 taxels répartis sur la main du robot, avec une résolution de l'ordre du millimètre. L'approche impose un alignement sémantique, distributionnel et géométrique entre représentations visuelles et tactiles via des contraintes multi-niveaux, de façon à rendre la géométrie de l'espace visuel cohérente avec celle du manifold tactile. L'extension du cadre à des observations de mains humaines permet également de déclencher des réponses réflexes lorsque le robot "voit" une main humaine touchée. Le code source est disponible sur GitHub. La valeur technique de ce travail réside dans la transposition d'un principe neuroscientifique, le "mirror touch", cette sensation tactile que l'on éprouve en observant quelqu'un d'autre être touché, en un mécanisme calculable. Pour les intégrateurs et les équipes travaillant sur la manipulation dextre, cela ouvre la voie à une perception tactile anticipatoire : le robot n'attendrait plus le contact physique pour ajuster sa prise, mais prédirait la sensation à partir du flux visuel. L'analyse par manifolds, qui démontre que les contraintes d'alignement simplifient effectivement le mapping cross-modal, constitue un résultat explicable, ce qui est notable dans un domaine où les architectures restent souvent des boîtes noires. Il convient cependant de noter qu'il s'agit d'un preprint non encore évalué par les pairs, et que les performances annoncées restent à reproduire hors des conditions de laboratoire. Ce travail s'inscrit dans un courant actif autour de la perception tactile pour la robotique dextre, où plusieurs groupes tentent de réduire la dépendance aux capteurs de force coûteux et fragiles. Des approches concurrentes incluent les travaux de Meta FAIR sur les capteurs à base de gel (DIGIT), les recherches de MIT CSAIL sur la reconstruction 3D par vision tactile, ou encore les travaux d'Uppsala et ETH Zurich sur la sim-to-real tactile. Mirror Touch Net se distingue par son ancrage neuroscientifique explicite et son extension aux mains humaines, potentiellement utile pour les environnements collaboratifs. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation réelles et une intégration dans des architectures Vision-Language-Action (VLA) de type diffusion policy ou pi-0.

RecherchePaper
1 source
Robometer : mise à l'échelle des modèles de récompense robotique généralistes par comparaison de trajectoires
1768arXiv cs.RO 

Robometer : mise à l'échelle des modèles de récompense robotique généralistes par comparaison de trajectoires

Des chercheurs ont publié Robometer, un cadre de modélisation de récompense (reward model) généraliste pour robots, conçu pour s'entraîner sur de grands datasets incluant des trajectoires échouées et sous-optimales. Le système repose sur un double objectif d'apprentissage : une perte de progression par frame ancrée sur des données expertes, et une perte de comparaison de préférences entre trajectoires imposant des contraintes d'ordonnancement global entre différentes exécutions d'une même tâche. Pour soutenir cette approche à grande échelle, les auteurs ont constitué RBM-1M, un dataset dédié à l'apprentissage de récompenses comprenant plus d'un million de trajectoires couvrant des robots de morphologies et de tâches variées, avec une fraction substantielle de données sous-optimales et d'échecs avérés. Le code, les poids du modèle et des vidéos sont accessibles sur robometer.github.io. L'enjeu est de surmonter la limitation fondamentale des reward models actuels, entraînés à prédire la progression absolue d'une tâche uniquement depuis des démonstrations expertes, ce qui confère une supervision purement locale et se révèle peu scalable face aux vastes datasets robotiques peuplés de trajectoires ratées ou imparfaites. Robometer exploite les comparaisons inter-trajectoires comme signal de supervision global, permettant d'extraire de l'information utile même des séquences d'échec et de lever l'ambiguïté de l'assignation de labels de progression denses. Ce changement de paradigme est significatif pour les praticiens : si les gains annoncés sur benchmarks et évaluations en conditions réelles se confirment indépendamment, les coûts de curation de données pour l'entraînement de politiques robotiques pourraient être substantiellement réduits. La modélisation de récompenses à grande échelle est un problème ouvert depuis plusieurs années dans la communauté robotique, avec des approches comme EUREKA d'NVIDIA ou les variantes robotiques du RLHF (Reinforcement Learning from Human Feedback) qui cherchent toutes à réduire la dépendance à l'annotation humaine dense. Robometer se positionne comme une alternative généraliste et multi-embodiment, sans être lié à une architecture ou un robot spécifique. Les suites naturelles incluent l'intégration dans des pipelines VLA (Vision-Language-Action), où la qualité du signal de récompense conditionne directement la généralisabilité des politiques apprises à l'échelle ; l'ouverture du code et des poids rend désormais possible des validations indépendantes, condition nécessaire pour confirmer les bénéfices au-delà du cadre expérimental des auteurs.

RechercheOpinion
1 source
DSSP : une politique d'état de diffusion avec encodage de l'historique complet
1769arXiv cs.RO 

DSSP : une politique d'état de diffusion avec encodage de l'historique complet

Une équipe de recherche a publié en mai 2026 un préprint sur arXiv (2605.14598) présentant DSSP, Diffusion State Space Policy, une nouvelle architecture de politique robotique pour la manipulation. Le principe central : conditionner la génération d'actions non plus sur une fenêtre courte d'observations récentes, comme le font la majorité des politiques diffusion existantes, mais sur l'intégralité de l'historique d'observations depuis le début de la tâche. L'encodeur d'historique repose sur des State Space Models (SSMs), qui compriment le flux complet d'observations en une représentation contextuelle compacte. Un objectif d'entraînement auxiliaire dit "dynamics-aware" optimise cet encodeur pour préserver les informations pertinentes à l'évolution future de l'état. Ce contexte de haut niveau est ensuite fusionné avec les observations récentes dans un mécanisme de conditionnement hiérarchique, et le backbone diffusion lui-même est également instancié via un SSM pour limiter la mémoire GPU. Les expériences couvrent des benchmarks en simulation et des tâches de manipulation réelles. Le problème que DSSP cherche à résoudre est structurel dans les approches actuelles : les tâches longue durée génèrent des ambiguïtés que seule la mémoire étendue permet de lever. Une pince qui répète la même séquence de sous-tâches ou qui doit adapter son comportement en fonction d'un état vu dix secondes plus tôt ne peut pas le faire si le modèle n'a accès qu'à la dernière frame ou à une fenêtre de deux secondes. Les auteurs rapportent des performances état-de-l'art avec une taille de modèle significativement inférieure aux concurrents, ce qui est un argument industriel non trivial : des modèles plus légers facilitent le déploiement sur du compute embarqué et réduisent les coûts d'inférence. L'utilisation des SSMs plutôt que des Transformers pour l'encodage de séquences longues est cohérente avec des travaux récents (Mamba, Mamba-2) montrant que cette famille d'architectures offre une complexité linéaire en longueur de séquence, là où l'attention quadratique pénalise fortement les historiques longs. Ce travail s'inscrit dans un courant actif depuis la publication de Diffusion Policy (Chi et al., Columbia/MIT, 2023), qui a établi la diffusion comme paradigme dominant pour l'imitation learning en manipulation. Des acteurs comme Physical Intelligence avec pi-0, NVIDIA avec GR00T N2, ou Figure AI avec ses architectures propriétaires ont chacun proposé leurs variantes de politiques diffusion ou VLA (Vision-Language-Action). La question de la mémoire temporelle longue reste ouverte dans l'ensemble de ces systèmes. DSSP est à ce stade un résultat de recherche académique, pas un produit déployé : les expériences réelles décrites sont des validations en laboratoire, non des pilotes industriels. La prochaine étape naturelle serait une intégration dans des frameworks open-source comme Lerobot (HuggingFace) ou une collaboration avec des fabricants pour valider le passage à l'échelle sur des tâches d'assemblage à horizons multiples.

UEImpact indirect potentiel si DSSP est intégré dans Lerobot (HuggingFace, entreprise française basée à Paris), ce qui faciliterait l'adoption par les équipes européennes de recherche en manipulation robotique longue durée.

RechercheOpinion
1 source
Locomotion économe en énergie pour quadrupèdes à pieds souples
1770arXiv cs.RO 

Locomotion économe en énergie pour quadrupèdes à pieds souples

Une équipe de chercheurs publie sur arXiv (preprint 2605.14411) une étude sur l'effet de la compliance des pieds sur l'efficacité énergétique des robots quadrupèdes. Plutôt que d'utiliser des pieds rigides, approche dominante qui simplifie le contrôle mais limite la récupération d'énergie élastique et l'absorption des impacts, les chercheurs ont intégré des pieds à ressort de rigidité variable dans un contrôleur de locomotion par apprentissage par renforcement (RL). Huit politiques ont été entraînées en simulation, chacune correspondant à l'une des huit valeurs de rigidité testées, puis évaluées croisées sur un quadrupède physique développé pour l'occasion. Résultat principal : pour une rigidité intermédiaire, la consommation d'énergie mécanique par mètre parcouru est réduite d'environ 17% par rapport aux ressorts très rigides ou très souples, avec des tendances cohérentes en simulation et sur le robot réel. Ce gain de 17% est notable dans le contexte de la locomotion quadrupède autonome, où l'autonomie énergétique reste un verrou majeur pour les déploiements terrain. Les pieds compliants permettent de stocker puis restituer de l'énergie élastique à chaque cycle de pas, un principe analogue aux tendons dans la biomécanique animale, réduisant le travail net à fournir par les actionneurs. L'étude confirme l'existence d'un optimum de compliance : trop de rigidité annule l'absorption d'impact, trop de souplesse dégrade stabilité et contrôlabilité. Ce résultat valide l'hypothèse que le co-design mécanique et algorithmique peut surpasser les approches purement algorithmiques sur le critère d'efficacité, sans nécessiter d'actionneurs plus puissants ni de refonte de l'architecture de contrôle. Historiquement, les quadrupèdes commerciaux à pieds rigides, tels que Spot de Boston Dynamics, ANYmal d'ANYbotics ou le B2 d'Unitree, ont privilégié cette approche pour simplifier la modélisation des contacts et garantir la stabilité. Des travaux antérieurs sur les actionneurs élastiques en série (SEA), notamment au MIT et au DLR, avaient exploré la compliance côté actionneur, mais rarement au niveau de l'interface pied-sol de manière aussi isolée et quantifiée. Cette étude ouvre la voie à une exploration systématique du co-design compliance/contrôle RL sur terrains variés et irréguliers, domaine où les gains potentiels pourraient être encore plus importants qu'en marche sur surface plane.

RecherchePaper
1 source
RoboLab : benchmark de simulation haute fidélité pour l'analyse des politiques généralistes multi-tâches
1771arXiv cs.RO 

RoboLab : benchmark de simulation haute fidélité pour l'analyse des politiques généralistes multi-tâches

Des chercheurs du Spatial Reasoning Lab de NVIDIA ont publié sur arXiv (papier 2604.09860, version 3, mai 2026) RoboLab, un framework de benchmarking en simulation conçu pour évaluer les politiques robotiques généralistes. Le coeur du système est le benchmark RoboLab-120, qui regroupe 120 tâches réparties selon trois axes de compétences, visuel, procédural, relationnel, et trois niveaux de difficulté. Ce qui distingue RoboLab des benchmarks existants est la capacité à générer des scènes et des tâches de manière programmatique, aussi bien par authoring humain que via un LLM, dans un environnement de simulation haute fidélité conçu pour être agnostique au robot et à la politique évaluée. Le framework tente de répondre à deux questions précises : dans quelle mesure le comportement en simulation prédit-il les performances réelles, et quels facteurs influencent le plus le comportement d'une politique ? L'enjeu est directement lié à un problème structurel du domaine : la saturation rapide des benchmarks actuels. La plupart des évaluations existantes présentent un chevauchement significatif entre les données d'entraînement et les données d'évaluation, ce qui gonfle artificiellement les taux de succès et masque les vraies faiblesses en généralisation. RoboLab introduit des perturbations contrôlées pour mesurer la sensibilité des politiques et expose, selon les auteurs, un écart de performance notable chez les modèles état de l'art actuels. Pour un intégrateur ou un COO industriel, c'est une mise en garde : les chiffres de benchmark publiés par les fondeurs de modèles VLA (Vision-Language-Action) ne reflètent pas nécessairement la robustesse en conditions réelles. Ce travail s'inscrit dans la course aux politiques généralistes qui mobilise toute l'industrie : Physical Intelligence avec pi0, Boston Dynamics et sa roadmap manipulation, Figure AI avec Figure 03, et NVIDIA lui-même avec GR00T N2 comme modèle de référence. Le SRL (Spatial Reasoning Lab) de NVIDIA se positionne ici en fournisseur d'infrastructure d'évaluation plutôt qu'en compétiteur direct sur les politiques, un rôle analogue à celui que joue MLCommons pour l'inférence LLM. Le projet dispose d'un site dédié (research.nvidia.com/labs/srl/projects/robolab/), mais reste pour l'instant un preprint non peer-reviewed : aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RechercheOpinion
1 source
Manipulation dynamique de corde apprise par contrôle itératif au niveau tâche
1772arXiv cs.RO 

Manipulation dynamique de corde apprise par contrôle itératif au niveau tâche

Des chercheurs ont publié une méthode d'apprentissage itératif au niveau tâche (Task-Level Iterative Learning Control, ILC) pour la manipulation dynamique de cordes par bras robotique. La démonstration porte sur le "flying knot", un nœud exécuté en mouvement dans l'espace tridimensionnel, tâche non planaire réputée difficile à automatiser. La méthode combine une unique démonstration humaine et un modèle simplifié de corde, et s'entraîne directement sur matériel réel sans recourir à de larges bases de données ni à de la simulation massive. À chaque itération, l'algorithme inverse un modèle couplé robot-corde en résolvant un programme quadratique (QP) pour propager les erreurs dans l'espace tâche vers des corrections d'action. Sept types de cordes ont été testés: chaîne métallique, tube chirurgical en latex, cordes tressées et toronnées, avec des diamètres de 7 à 25 mm et des densités de 0,013 à 0,5 kg/m. Le système atteint 100 % de réussite en 10 essais ou moins sur l'ensemble des configurations. Le transfert entre types de cordes différents s'effectue en 2 à 5 essais supplémentaires pour la plupart des paires testées. Ce résultat contredit une hypothèse courante dans la manipulation d'objets déformables (DOM): la robustesse ne passe pas nécessairement par des jeux de données massifs ou des milliers d'heures de simulation. Une seule démonstration humaine suffit à amorcer l'apprentissage, et la convergence s'effectue en moins de dix essais réels sur matériel physique, même pour des cordes aussi différentes qu'une chaîne rigide et un tube en latex souple. La capacité de transfert inter-corde en 2 à 5 essais est particulièrement significative: elle indique que le modèle interne capture suffisamment la dynamique pour s'adapter à de nouvelles propriétés mécaniques sans redémarrer l'apprentissage. Pour les intégrateurs travaillant sur du câblage automatisé, de la couture industrielle ou du conditionnement de produits souples, c'est une piste crédible vers des systèmes moins gourmands en données et plus rapidement reconfigurables sur ligne. L'ILC est une technique de contrôle classique, ici adaptée au niveau tâche plutôt qu'au niveau signal bas, ce qui la rend plus générique face à la variabilité des objets déformables. Les approches concurrentes en DOM font généralement appel à des réseaux de neurones entraînés sur simulation ou à l'apprentissage par imitation à grande échelle, deux méthodes coûteuses en données et exposées au reality gap. L'absence totale de simulation dans cette méthode est un choix délibéré qui contourne ce problème au prix d'itérations physiques, un compromis acceptable dès lors que le nombre d'essais reste faible. Les travaux sont disponibles en prépublication sur arXiv (2602.21302) et accompagnés d'un site de démonstration vidéo (flying-knots.github.io). Les suites naturelles incluent l'extension à des nœuds plus complexes, l'intégration sur des manipulateurs industriels multi-DOF, et des validations en environnements non contrôlés.

RecherchePaper
1 source
Avant que le corps ne bouge : apprentissage de l'intention articulaire anticipatoire pour le contrôle d'humanoïdes guidé par le langage
1773arXiv cs.RO 

Avant que le corps ne bouge : apprentissage de l'intention articulaire anticipatoire pour le contrôle d'humanoïdes guidé par le langage

Une équipe de chercheurs a déposé le 14 mai 2026 sur arXiv (arXiv:2605.14417) un framework hiérarchique nommé DAJI (Dynamics-Aligned Joint Intent), destiné au contrôle en continu du corps entier d'humanoïdes via des instructions en langage naturel. L'architecture repose sur deux modules distincts : DAJI-Act, une politique d'action par diffusion déployable, entraînée en distillant un modèle "teacher" conscient du futur via des rollouts guidés par un modèle étudiant ; et DAJI-Flow, qui génère de façon autorégressive des blocs d'"intentions articulaires" futures à partir d'une instruction linguistique et de l'historique d'intentions. Sur le benchmark HumanML3D, DAJI atteint 94,42 % de taux de succès en génération de séquences. Sur BABEL, le framework obtient un FID de sous-séquence de 0,152, une métrique de fidélité cinématique. Le problème que DAJI cherche à résoudre est central dans la commande des humanoïdes : les approches existantes génèrent des références cinématiques que le contrôleur bas niveau doit corriger de manière réactive, ce qui introduit des délais et des instabilités lors des transitions de support (transferts d'appui, changements de contact). DAJI propose à la place une interface d'"intention articulaire anticipatoire" qui encode explicitement les futures transitions de contact, les transferts de poids et les préparations à l'équilibre avant que le corps ne les exécute. Pour les intégrateurs de robots humanoïdes, c'est une piste sérieuse pour réduire le reality gap simulation-déploiement, puisque le pipeline diffusion + anticipation est conçu pour être réellement embarqué, pas seulement simulé. Cela valide aussi l'hypothèse qu'une représentation explicite et interprétable de l'intention mécanique future peut coexister avec un pilotage par langage naturel en streaming. Ce travail s'inscrit dans une compétition académique et industrielle dense sur le contrôle des humanoïdes conditionné par le langage. Des approches comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les politiques VLA de Figure explorent des territoires proches, mais privilégient souvent des représentations latentes dont les sorties n'encodent pas explicitement l'état mécanique futur. DAJI se distingue en faisant de l'"intent" une variable interprétable et structurée. Il faut néanmoins noter que les résultats sont obtenus exclusivement sur des benchmarks de génération de mouvements (HumanML3D, BABEL) et non sur robot physique : il s'agit d'une preuve de concept académique, pas d'un système déployé. La validation sur plateforme réelle, sur un Unitree G1, un Agility Digit ou équivalent, reste la prochaine étape non annoncée.

RechercheOpinion
1 source
Main dans la boucle : améliorer les modèles VLA dextériques via correction interventionnelle transparente
1774arXiv cs.RO 

Main dans la boucle : améliorer les modèles VLA dextériques via correction interventionnelle transparente

Une équipe de chercheurs a publié sur arXiv (réf. 2605.15157) une méthode baptisée Hand-in-the-Loop (HandITL), conçue pour corriger en temps réel les dérives des modèles Vision-Language-Action (VLA) lors de manipulation dextère bimanuelle à haute dimension. Le problème est structurel : dans des espaces d'action à grand nombre de degrés de liberté (DOF), les petites déviations de politique s'amplifient sur des horizons longs jusqu'à provoquer des défaillances en cascade. L'apprentissage par imitation interactive (IIL) permettait déjà d'affiner les politiques via des prises de contrôle humaines, mais son application aux mains robotiques multi-DOF se heurtait à un écart de commande critique : au moment où l'opérateur reprend la main, la configuration courante de la politique et celle de la téléopération divergent, générant des sauts de geste ("gesture jumps") brusques et déstabilisants. HandITL résout ce problème en interpolant de façon fluide l'intention corrective de l'opérateur avec l'exécution autonome en cours. Les chiffres publiés sont nets : réduction de 99,8 % du jitter lors des interventions, 87,5 % de défaillances de préhension en moins, temps moyen de complétion réduit de 19,1 %, et politiques affinées avec les données HandITL surpassant celles issues de la télé-opération standard de 19 % en moyenne sur trois tâches longues horizon. L'enjeu pour les équipes R&D et les intégrateurs est direct. Les VLA représentent aujourd'hui une piste sérieuse pour la généralisation des manipulateurs, mais leur déploiement opérationnel bute précisément sur l'accumulation d'erreurs dans les tâches contact-rich et multi-étapes, phénomène souvent désigné comme le "demo-to-reality gap". En rendant les interventions humaines non perturbantes, HandITL permet de collecter des données correctives de qualité pour le fine-tuning sans interrompre ni dégrader la trajectoire en cours. Cela modifie concrètement le rapport coût-utilité du human-in-the-loop pour des tâches de coordination bimanuelle ou d'utilisation d'outils nécessitant une précision millimétrique. La manipulation dextère à haute DOF reste l'un des défis les plus ouverts de la robotique généraliste. Des systèmes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ont démontré la viabilité des VLA sur des préhenseurs standards, mais les benchmarks sur mains à multiples doigts restent rares. HandITL s'inscrit dans un courant qui vise à étendre ces résultats aux architectures de mains complexes, où les DOF supplémentaires multiplient les capacités mais aussi les modes d'échec. Des approches comme HITL-TAMP ou les travaux sur residual policy correction ont exploré un terrain proche, sans toutefois cibler la manipulation bimanuelle dextère dans sa dimension la plus contrainte. L'article ne mentionne aucun partenaire industriel ni déploiement terrain, ce qui maintient ce travail dans le registre de la preuve de concept académique. Les suites naturelles seraient une validation sur des plateformes commerciales comme l'Allegro Hand ou la LEAP Hand, ainsi qu'une intégration dans des boucles d'entraînement continu pour des tâches d'assemblage de précision.

RechercheOpinion
1 source
WarmPrior : rectification des politiques de flow matching avec des a priori temporels
1775arXiv cs.RO 

WarmPrior : rectification des politiques de flow matching avec des a priori temporels

Une équipe de chercheurs propose WarmPrior (arXiv:2605.13959, mai 2025), une modification de la distribution source dans les politiques génératives pour le contrôle robotique visuomoteur. Ces politiques, fondées sur la diffusion ou le flow matching, sont devenues le paradigme dominant pour apprendre des comportements de manipulation à partir de démonstrations. Plutôt que d'utiliser une distribution gaussienne standard comme point de départ du processus de génération d'actions, WarmPrior construit un prior temporel simple à partir de l'historique récent des actions exécutées par le robot. Appliqué à des tâches de manipulation en behavior cloning, ce remplacement améliore systématiquement les taux de réussite. L'article démontre également des gains en efficacité d'échantillonnage et en performance finale lorsque WarmPrior est utilisé dans un cadre d'apprentissage par renforcement dans l'espace des priors. L'explication de ces gains est géométrique : WarmPrior produit des chemins de probabilité sensiblement plus droits dans l'espace des actions, un effet analogue à celui des couplages de transport optimal dans Rectified Flow. Des trajectoires plus droites réduisent le nombre de pas d'intégration requis à l'inférence, ce qui peut accélérer le contrôle et améliorer la précision des mouvements. Pour les équipes robotique, l'intérêt est immédiatement pratique : WarmPrior est compatible avec les architectures existantes et ne nécessite aucune donnée supplémentaire. Plus fondamentalement, l'article identifie le choix de la distribution source comme un axe de conception structurant et jusqu'ici sous-exploré dans le contrôle génératif, orthogonal aux approches habituelles centrées sur l'architecture réseau ou le volume de données d'entraînement. WarmPrior s'inscrit dans l'accélération des politiques diffusion pour la manipulation, un champ formalisé notamment par Diffusion Policy (Chi et al., 2023, Columbia/MIT) et ses nombreuses variantes. Le paradigme flow matching, popularisé par Rectified Flow et adopté par Physical Intelligence dans pi-0 pour le contrôle de bras et d'humanoïdes, s'est imposé comme référence pour l'inférence à haute fréquence. WarmPrior, applicable sans modification architecturale aux deux familles de méthodes, représente un levier directement intégrable dans des pipelines existants comme ACT, Diffusion Policy ou pi-0. À noter que les résultats présentés restent pour l'instant au niveau des benchmarks de laboratoire ; une validation sur matériel réel et dans des conditions industrielles serait nécessaire pour établir la portée opérationnelle effective de la méthode.

RechercheOpinion
1 source
SoFFT : transformée de Fourier spatiale pour la modélisation des robots souples continus
1776arXiv cs.RO 

SoFFT : transformée de Fourier spatiale pour la modélisation des robots souples continus

Une équipe de chercheurs a proposé SoFFT (Spatial Fourier Transform for Soft Robots), une méthode de modélisation des robots souples continus basée sur l'application de la transformée de Fourier à la courbe centrale du robot, appelée "backbone", décrite comme un signal spatial et temporel. Publiée sur arXiv en février 2025 (identifiant 2502.17347), l'approche s'ancre dans la théorie des tiges de Cosserat, le cadre formel dominant pour modéliser ce type de structure, et a été validée à la fois par simulation numérique et sur un prototype physique réel. Les auteurs rapportent une réduction du nombre de degrés de liberté (DOF) effectifs nécessaires à la représentation fidèle de la déformation, sans toutefois quantifier précisément cette réduction dans le résumé disponible, ce qui rend difficile toute comparaison directe avec les méthodes existantes. L'enjeu central est que les robots souples continus, constitués de matériaux flexibles comme des élastomères ou des tubes en silicone, possèdent théoriquement une infinité de degrés de liberté, rendant leur modélisation et leur contrôle en temps réel computationnellement très coûteux. En traitant le backbone comme un signal, SoFFT ne conserve que ses composantes fréquentielles dominantes, compactant la description sans sacrifier la précision. Autre point notable : la méthode unifie et justifie formellement plusieurs heuristiques de modélisation déjà répandues dans la littérature, leur offrant un fondement théorique solide. Pour les équipes travaillant sur des cathéters robotiques, des bras endoscopiques ou des manipulateurs à actionnement pneumatique, cette réduction de modèle ouvre des perspectives pour des contrôleurs embarqués plus légers, potentiellement compatibles avec des architectures temps réel contraintes. La théorie des tiges de Cosserat s'est imposée dans la robotique souple depuis les années 2010, mais la complexité computationnelle des modèles haute-fidélité reste un frein au déploiement industriel. Plusieurs groupes concurrents, notamment à l'ETH Zurich, au MIT et à l'Université de Bristol, explorent des alternatives comme les réseaux de neurones physiques (physics-informed neural networks) ou les modèles réduits par analyse modale. SoFFT se positionne à l'intersection du formalisme analytique et de l'apprentissage piloté par les données, grâce à sa composante expérimentale permettant d'ajuster le modèle à partir de mesures réelles. Les suites logiques seraient l'intégration dans une boucle de contrôle fermée et la validation sur des architectures multi-segments, configurations courantes dans les applications médicales et d'inspection industrielle.

RecherchePaper
1 source
Slot-MPC : contrôle prédictif par modèle conditionné sur des objectifs avec représentations centrées sur les objets
1777arXiv cs.RO 

Slot-MPC : contrôle prédictif par modèle conditionné sur des objectifs avec représentations centrées sur les objets

Des chercheurs ont publié en mai 2025 Slot-MPC (arXiv:2605.14937), un cadre de modélisation du monde combinant représentations centrées sur les objets et contrôle prédictif par modèle (MPC). L'approche encode chaque objet de la scène dans un "slot" latent distinct, appris par un encodeur visuel, puis utilise ces représentations structurées pour apprendre un modèle de dynamique conditionné sur les actions. Au moment de l'inférence, ce modèle sert de simulateur interne : l'agent planifie ses actions sur un horizon temporel fini, réoptimise à chaque pas de temps, et peut ainsi s'adapter à des situations non rencontrées pendant l'entraînement. Les expériences sont menées sur des tâches de manipulation robotique simulées, dans un cadre hors-ligne (offline) avec couverture limitée des paires état-action. La contribution principale tient à la différentiabilité du modèle appris : contrairement aux approches MPC classiques qui échantillonnent des milliers de trajectoires candidates (méthodes sans gradient, type CEM ou MPPI), Slot-MPC optimise directement les actions par descente de gradient, ce qui est significativement plus efficace en termes de calcul. Dans le cadre offline étudié, cette planification par gradient surpasse les méthodes d'échantillonnage. Les résultats montrent également que les représentations structurées objet par objet constituent un biais inductif fort : les agents Slot-MPC généralisent mieux à des situations nouvelles que les baselines à représentations latentes monolithiques, ce qui est un enjeu central pour les applications robotiques réelles où l'environnement évolue de façon imprévisible. Ce travail s'inscrit dans la lignée des recherches sur les représentations centrées sur les objets (Slot Attention de Locatello et al., 2020 ; SLATE, Dinosaur), appliquées ici au contrôle plutôt qu'à la seule perception. Il entre en compétition directe avec des modèles de monde appris comme DreamerV3 (DeepMind) ou TD-MPC2, qui utilisent des représentations latentes denses non structurées. Limite notable : toutes les expériences restent en simulation, sans transfert sim-to-real ni validation sur robot physique, ce qui est un écart important avant toute application industrielle. Le code source et les résultats complémentaires sont disponibles sur slot-mpc.github.io.

RecherchePaper
1 source
Chrono-Gymnasium : un framework de simulation distribué open source compatible Gymnasium
1778arXiv cs.RO 

Chrono-Gymnasium : un framework de simulation distribué open source compatible Gymnasium

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.14911) les spécifications de Chrono-Gymnasium, un framework open-source de simulation distribuée qui combine le moteur de dynamique multi-corps Project Chrono avec l'interface standardisée Gymnasium d'OpenAI, via le framework de calcul distribué Ray. L'architecture permet de déployer des simulations haute-fidélité sur des clusters de calcul à grande échelle, avec des primitives de synchronisation et de messagerie intégrées pour l'exécution parallèle. Deux études de cas valident l'approche : l'entraînement d'un agent de reinforcement learning (RL) pour la navigation autonome en terrains complexes, et l'optimisation bayésienne des paramètres de conception d'un atterrisseur planétaire pour garantir la stabilité à l'impact. L'enjeu central que résout ce framework est le compromis historique entre fidélité physique et débit de simulation. Les moteurs haute-fidélité comme Project Chrono, qui modélisent précisément les contacts, les déformations et les cinématiques complexes, sont trop lents pour les workflows RL qui exigent des millions de pas d'environnement, ce qui pousse la majorité des équipes vers des simulateurs simplifiés ou des approximations GPU comme Isaac Lab ou MuJoCo. Chrono-Gymnasium propose une troisième voie : distribuer la charge de simulation sur cluster plutôt que sacrifier la précision physique, une approche particulièrement pertinente pour les systèmes où le sim-to-real gap est critique, comme la locomotion sur terrain accidenté ou la conception mécanique avec contraintes dynamiques serrées. La compatibilité native avec l'interface Gymnasium garantit l'interopérabilité avec les bibliothèques ML standard (Stable Baselines3, RLlib) sans couche d'adaptation supplémentaire. Project Chrono est un moteur open-source de dynamique multi-corps développé en collaboration entre l'Université du Wisconsin-Madison et d'autres institutions académiques, reconnu pour sa précision mais rarement utilisé en RL à cause de sa lenteur séquentielle. Sur le terrain concurrentiel, les solutions dominantes restent NVIDIA Isaac Lab (GPU-natif, physique simplifiée) et Genesis (encore en phase de maturité), tandis que MuJoCo demeure la référence pour les robots articulés légers. Chrono-Gymnasium cible un segment distinct : systèmes mécaniques complexes, robots off-road, ou applications spatiales où la fidélité du contact prime sur la vitesse brute. Il s'agit pour l'instant d'un preprint non peer-reviewed ; les benchmarks comparatifs complets et la disponibilité stable du code restent à confirmer.

RecherchePaper
1 source
IntentVLA : modélisation des intentions à court terme pour la manipulation robotique ambiguë
1779arXiv cs.RO 

IntentVLA : modélisation des intentions à court terme pour la manipulation robotique ambiguë

Des chercheurs ont publié le 15 mai 2026 sur arXiv (référence 2605.14712) une nouvelle architecture de politique robotique baptisée IntentVLA, conçue pour résoudre un problème structurel des modèles vision-langage-action (VLA) appliqués à la manipulation : le conflit entre séquences d'actions consécutives. Le cœur du problème est l'ambiguïté des données d'imitation humaine, deux observations visuelles quasi-identiques peuvent légitimement déboucher sur des trajectoires différentes, selon l'intention à court terme du démonstrateur, la phase de la tâche en cours ou le contexte récent. IntentVLA répond à cela en encodant les observations visuelles récentes en une représentation compacte d'intention à court horizon, qui conditionne ensuite la génération du chunk d'actions courant. Les auteurs ont également construit AliasBench, un benchmark de 12 tâches conçu explicitement pour isoler ce phénomène d'aliasing, déployé sur le simulateur RoboTwin2, avec données d'entraînement et environnements d'évaluation appariés. Les résultats montrent une stabilité d'exécution améliorée et des performances supérieures aux baselines VLA de référence sur quatre environnements : AliasBench, SimplerEnv, LIBERO et RoboCasa. L'apport technique central est l'introduction du conditionnement par historique dans les VLA, là où les architectures existantes, dites frame-conditioned, n'exploitent que l'observation courante et l'instruction textuelle. Sous observabilité partielle, condition fréquente en manipulation réelle, ces politiques peuvent rééchantillonner des intentions différentes à chaque étape de replanification, générant des conflits inter-chunks qui se traduisent par des exécutions instables ou des échecs de tâche. IntentVLA formalise ce mécanisme via une représentation d'intention latente, compacte et exploitable à chaque pas de décision. Pour les intégrateurs robotiques et les équipes de recherche en apprentissage par imitation, c'est une validation expérimentale que l'historique visuel proche est un signal utile, distinct de l'instruction langagière, et qu'il peut être encodé de façon efficace sans alourdir le pipeline d'inférence. AliasBench constitue en soi une contribution méthodologique : les benchmarks existants ne distinguaient pas explicitement les situations d'aliasing, rendant difficile l'évaluation ciblée de ce défaut. Le contexte est celui d'une course à la généralisation des politiques de manipulation, portée par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI. Ces architectures VLA de grande taille partagent le même défaut potentiel : inférence chunk par chunk sans mémoire explicite de l'intention récente. IntentVLA s'inscrit dans une ligne de travaux académiques cherchant à corriger ce manque sans abandonner l'architecture transformer sous-jacente. L'absence d'institution identifiée dans le preprint et le fait qu'il ne s'agisse que d'un résultat sur simulateurs, sans déploiement réel annoncé, invitent à la prudence sur la portée immédiate. Les prochaines étapes attendues sont un transfert sim-to-real et une intégration dans des pipelines de fine-tuning de modèles VLA existants.

RechercheOpinion
1 source
MALLVI : un cadre multi-agents pour la manipulation robotique généralisée et intégrée
1780arXiv cs.RO 

MALLVI : un cadre multi-agents pour la manipulation robotique généralisée et intégrée

Une équipe de chercheurs a publié MALLVI (Multi-Agent Large Language and Vision Interface), un framework d'orchestration multi-agents pour la manipulation robotique généraliste, dont la cinquième révision vient d'être déposée sur arXiv (2602.16898). Le système prend en entrée une instruction en langage naturel et une image de la scène, puis génère des actions atomiques exécutables pour un bras manipulateur. L'architecture coordonne quatre agents spécialisés: un Decomposer chargé de découper la tâche en sous-étapes, un Localizer pour la détection et la localisation visuelle, un Thinker pour le raisonnement et la planification de haut niveau, et un Reflector dédié à la détection d'erreurs et à la récupération ciblée. Un cinquième agent optionnel, le Descriptor, maintient une mémoire visuelle de l'état initial de l'environnement. La boucle fermée est pilotée par un modèle de vision-langage (VLM) qui évalue les retours environnementaux après chaque action et décide si l'étape doit être rejouée ou si le robot peut passer à la suivante. Les expériences en simulation et en environnement réel indiquent des gains de taux de réussite sur des tâches de manipulation zero-shot par rapport aux approches classiques en boucle ouverte. Ce que MALLVI cherche à résoudre est un problème structurel bien documenté de la manipulation pilotée par LLM: les systèmes open-loop, qui n'interrogent pas l'état réel du monde après chaque action, accumulent les erreurs sans possibilité de correction en cours d'exécution. L'apport du Reflector est notable sur ce point, puisque plutôt que de déclencher une replanification complète en cas d'échec, il identifie les agents pertinents à réactiver, limitant la latence et la consommation de tokens. Pour les intégrateurs et les équipes R&D, l'intérêt réside dans la capacité zero-shot du système, sans fine-tuning ni prompt engineering spécifique à chaque tâche. Toutefois, les métriques de taux de succès restent difficiles à contextualiser faute d'indications précises sur le nombre de DOF du bras utilisé, la complexité des scènes de test, ou les conditions d'occultation. Le framework s'inscrit dans un courant très actif depuis 2023 autour de l'utilisation des grands modèles pour la planification robotique, avec des travaux fondateurs comme SayCan (Google DeepMind) et Code-as-Policies, et des architectures VLA (Vision-Language-Action) récentes comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La spécificité de MALLVI est son découpage en agents modulaires plutôt qu'un modèle monolithique, une approche qui facilite le débogage et la spécialisation par composant. Le code source est disponible publiquement sur GitHub (iman1234ahmadi/MALLVI). Aucun partenariat industriel ni déploiement commercial n'est annoncé à ce stade, ce qui en fait pour l'instant une contribution académique à suivre davantage qu'un produit opérationnel.

RechercheOpinion
1 source
ActivePusher : apprentissage actif et planification par physique résiduelle pour la manipulation non-préhensile
1781arXiv cs.RO 

ActivePusher : apprentissage actif et planification par physique résiduelle pour la manipulation non-préhensile

Une équipe de recherche du laboratoire elpis-lab a publié sur arXiv en juin 2025 (identifiant 2506.04646, désormais à sa quatrième révision) un framework baptisé ActivePusher, dédié à la manipulation non-préhensile, c'est-à-dire le déplacement d'objets par poussée ou roulement, sans saisie. L'approche combine deux blocs techniques : un modèle de dynamique par physique résiduelle, qui superpose un correctif appris par réseau de neurones à un modèle physique analytique de base, et un mécanisme d'apprentissage actif guidé par l'incertitude, qui oriente automatiquement la collecte de données vers les paramètres de compétence les moins bien couverts. Le framework s'intègre avec des planificateurs kinodynamiques à base de modèle, en pondérant l'échantillonnage de commandes selon les zones de faible incertitude du modèle appris. Les auteurs valident l'approche en simulation et sur robot réel, avec des taux de succès de planification supérieurs aux méthodes de référence, à volume de données d'entraînement égal. L'enjeu est significatif pour les intégrateurs et équipes R&D travaillant sur la manipulation en environnement non structuré. La manipulation non-préhensile reste un goulot d'étranglement dans de nombreuses lignes d'assemblage et de tri, précisément parce que les modèles analytiques (friction, contact multipoint) sont difficiles à calibrer et fragiles face aux variations de surface ou de géométrie. ActivePusher attaque ce problème sous deux angles simultanément : réduire le coût de collecte de données en évitant les interactions aléatoires peu informatives, et rendre la planification longue-portée plus fiable en évitant les régions d'incertitude élevée. C'est une réponse directe au "sim-to-real gap" structurel qui plombe les déploiements industriels de bras manipulateurs sur tâches de contact. La manipulation non-préhensile est un axe de recherche actif depuis les travaux fondateurs sur la mécanique du contact des années 1990, mais les approches purement analytiques ont montré leurs limites face à la variabilité du monde réel. Des frameworks comme MPPI (Model Predictive Path Integral) ou les planificateurs kinodynamiques basés sur des modèles appris (travaux de Karol Hausman, Pieter Abbeel) forment le paysage concurrent direct. ActivePusher se distingue par le couplage explicite entre acquisition active et planification, là où la plupart des approches traitent ces deux problèmes séparément. Le code source est disponible publiquement sur GitHub (elpis-lab/ActivePusher), ce qui devrait favoriser la reproductibilité. Aucun partenaire industriel ni timeline de transfert n'est mentionné : il s'agit d'une contribution académique, sans déploiement annoncé à ce stade.

RecherchePaper
1 source
SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel
1782arXiv cs.RO 

SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel

SR-Platform est un pipeline agentique, publié en preprint arXiv (2605.14700) en mai 2026, qui convertit des descriptions en langage naturel en environnements de simulation MuJoCo exécutables et physiquement valides. Le système décompose la génération de scènes en quatre étapes : un orchestrateur LLM qui structure l'intention utilisateur en plan de scène ; un "asset forge" qui récupère des géométries en cache ou en génère de nouvelles via synthèse LLM-CadQuery ; un "layout architect" qui assigne les poses des objets et vérifie les contraintes spatiales ; et une couche bridge qui assemble le fichier MJCF final en intégrant le modèle de robot cible. Déployé comme stack Docker à neuf services (MinIO pour les meshes, Qdrant pour la récupération sémantique d'assets, Redis pour l'état des jobs, InfluxDB pour la télémétrie), SR-Platform affiche une latence médiane d'environ 50 secondes pour des scènes à cinq objets, tombant à 30-40 secondes avec cache d'assets actif, sur une base de 611 appels LLM réussis en 30 jours de production. Le taux de retry de l'asset forge atteint 11,3 %, avec récupération automatique. Construire manuellement une scène MuJoCo prête à l'entraînement exige une expertise croisée en modélisation 3D, spécification MJCF, gestion des collisions et intégration robot, un processus qui représente typiquement plusieurs heures par scène. Ramener cette étape à moins d'une minute via une invite en langage naturel est un levier direct pour produire des environnements d'entraînement plus variés, facteur clé de la généralisation sim-to-real des politiques robotiques. Pour les équipes de robot learning, cette friction de configuration est réelle et souvent sous-estimée dans les pipelines de données synthétiques. Les métriques publiées portent cependant sur des scènes limitées à cinq objets dans un cadre contrôlé, et la robustesse du pipeline sur des configurations plus complexes ou des descriptions ambiguës reste à démontrer. La génération automatisée d'environnements de simulation est un goulot d'étranglement reconnu dans les pipelines de robot learning, que ce soit pour le reinforcement learning, l'imitation learning ou l'entraînement de modèles vision-langage-action (VLA). MuJoCo, maintenu par DeepMind, est le moteur physique de référence pour ces travaux. NVIDIA Isaac Lab et le framework open-source Genesis couvrent également cet espace ; Physical Intelligence (pi.ai) mise de son côté sur des pipelines d'entraînement à très large échelle. SR-Platform se positionne en amont, sur la génération de scènes plutôt que de politiques, avec un accent sur l'accessibilité via le langage naturel. Son code source n'est pas publié en open-source et le contexte précis du déploiement qualifié de "production" n'est pas explicité dans le preprint.

RecherchePaper
1 source
Planification de mouvements par échantillonnage sur variétés riemanniennes avec conscience géométrique
1783arXiv cs.RO 

Planification de mouvements par échantillonnage sur variétés riemanniennes avec conscience géométrique

Des chercheurs ont publié sur arXiv (arXiv:2602.00992) un cadre de planification de mouvement par échantillonnage opérant directement sur des variétés riemanniennes, adressant une limitation fondamentale des planificateurs classiques : l'usage de distances euclidiennes dans des espaces de configuration à géométrie non euclidienne. La contribution centrale est une approximation par point médian de la distance géodésique riemannienne, dont les auteurs prouvent la convergence au troisième ordre vers la distance réelle. Un planificateur local complète le système en traçant la variété via des rétractions du premier ordre guidées par des gradients naturels riemanniens. Les validations portent sur un bras plan à deux degrés de liberté, un manipulateur Franka à 7-DoF sous métrique d'énergie cinétique, et la planification de corps rigides dans SE(2) avec contraintes non holonomes. Dans chaque cas, l'approche produit des trajectoires de coût inférieur aux planificateurs euclidiens et aux solveurs géodésiques numériques de référence. L'enjeu industriel est direct : pour les bras manipulateurs redondants (6-DoF et plus), les métriques d'énergie cinétique ou de manipulabilité définissent une géométrie non euclidienne que les RRT et RRT standards ignorent, produisant des trajectoires sous-optimales en énergie et en usure des actionneurs. Ce travail comble le fossé entre deux familles de méthodes : les solveurs géodésiques numériques, fidèles géométriquement mais peu scalables en haute dimension, et les planificateurs par échantillonnage, efficaces mais géométriquement naïfs. La preuve de convergence au troisième ordre est un apport théorique solide ; les expériences restent cependant limitées à 2 et 7-DoF, et la tenue à l'échelle sur des systèmes corps entier (20-DoF et plus) n'est pas encore démontrée. La planification géodésique n'est pas une idée nouvelle : CHOMP et les méthodes de Gaussian Process Motion Planning avaient déjà exploité des métriques tâche-espace, mais dans des cadres d'optimisation sans garanties de complétude probabiliste. Ce travail se distingue en intégrant la géométrie riemannienne dans le paradigme par échantillonnage (famille RRT/PRM), ce qui offre des garanties de complétude asymptotique. Les concurrents directs incluent les variantes RRT à métriques personnalisées et les planificateurs sur graphes de visibilité riemanniens. La suite logique serait une validation sur des manipulateurs industriels courants (Universal Robots, KUKA iiwa) et une intégration dans MoveIt 2 ou NVIDIA Isaac/Lula, deux prérequis pour une adoption réelle en production.

RecherchePaper
1 source
DiffPhD : solveur différentiable unifié pour matériaux hétérogènes projectifs en élastodynamique avec accélération GPU multi-contacts
1784arXiv cs.RO 

DiffPhD : solveur différentiable unifié pour matériaux hétérogènes projectifs en élastodynamique avec accélération GPU multi-contacts

DiffPhD est un solveur différentiable GPU-accéléré pour la simulation de corps mous hétérogènes en élastodynamique, publié en prépublication sur arXiv (référence 2605.14526) en mai 2026. Le cadre traite simultanément trois verrous techniques qui bloquaient les approches existantes : les matériaux à forts contrastes de rigidité, les grandes déformations hyperélastiques, et les interactions de contact répétées. Sur des benchmarks combinant ces trois régimes, DiffPhD affiche un gain de vitesse jusqu'à dix fois supérieur aux solveurs différentiables précédents, tout en restant convergent pour des contrastes de rigidité jusqu'à 100x là où les méthodes Projective Dynamics (PD) classiques divergent. Trois innovations architecturales y contribuent : des poids projectifs sensibles à la rigidité pour encoder l'hétérogénéité dans le système global, un filtrage par valeurs propres en région de confiance appliqué à la passe arrière (backward pass) pour stabiliser les gradients hyperélastiques, et un schéma d'Anderson Acceleration de type II à convergence double seuil. Une factorisation creuse unique est réutilisée pour les passes avant, arrière et de contact, avec un amortissement de Rayleigh intégré dans ce même facteur, réduisant le coût récurrent à presque zéro. L'intérêt pour la robotique est direct : DiffPhD rend tractable l'optimisation bout-en-bout par gradient sur des scénarios hybrides auparavant inaccessibles, notamment la manipulation par préhenseur souple (soft gripper) et le transfert Real2Sim pour des assemblages hétérogènes rigide-souple. L'identification de systèmes (system identification) et l'optimisation de trajectoires sur des matériaux composites deviennent numériquement viables là où la fragilité du solveur ou le coût par itération constituaient jusqu'ici un goulot d'étranglement. Pour les équipes travaillant sur la simulation de préhension ou la calibration de modèles déformables, ce type de solveur réduit le gap simulation-réalité sans sacrifier la stabilité de convergence. Il faut toutefois noter que le gain annoncé de "jusqu'à un ordre de grandeur" s'appuie sur des benchmarks synthétiques, sans validation sur matériel physique réel. DiffPhD s'inscrit dans la lignée des Projective Dynamics (Bouaziz et al., 2014), méthode qui a dominé la simulation temps réel de corps mous grâce à son découplage entre contraintes locales et système linéaire global. Son extension différentiable DiffPD avait ouvert l'optimisation par gradient, mais restait fragile face à l'hétérogénéité matérielle et aux contacts répétés. DiffPhD se positionne directement contre DiffPD et contre les approches à éléments finis différentiables comme DiffTaichi ou le framework Warp de NVIDIA. Aucune mise à disposition de code ni annonce de déploiement industriel ne figure dans la prépublication : la contribution reste pour l'instant académique, avec des applications démontrées en animation (créatures composites, personnages mous manipulant des objets rigides) et en robotique de manipulation.

RecherchePaper
1 source
Des correspondances locales aux masques globaux : détection et segmentation d'instances guidées par gabarit en monde ouvert
1785arXiv cs.RO 

Des correspondances locales aux masques globaux : détection et segmentation d'instances guidées par gabarit en monde ouvert

Des chercheurs ont publié sur arXiv (référence 2503.03577v2) L2G-Det, un cadre de détection d'instances par correspondance locale-vers-globale, conçu pour localiser et segmenter des objets spécifiques dans des scènes encombrées et inédites, à partir d'un petit ensemble d'images de référence (templates). L'approche repose sur une mise en correspondance dense au niveau des patches entre les images-templates et l'image requête, sans recourir à la génération explicite de propositions de régions. Les points candidats issus de ces correspondances locales sont filtrés par un module de sélection qui supprime les faux positifs, puis injectés comme tokens d'instance dans une version augmentée du modèle SAM (Segment Anything Model de Meta), afin de reconstruire des masques d'instances complets. Les expériences menées dans des conditions open-world difficiles montrent des performances supérieures aux méthodes à base de propositions. Aucun chiffre précis de gains n'est communiqué dans le résumé, ce qui limite l'évaluation indépendante à ce stade. L'enjeu est significatif pour la perception robotique industrielle : la capacité à identifier et segmenter un objet précis depuis quelques images de référence, sans réentraînement, est un verrou majeur pour les robots de manipulation en environnements non structurés. Les approches à base de propositions (comme Mask R-CNN ou ses dérivés) échouent fréquemment sous occlusion partielle ou en présence de fond complexe, deux conditions omniprésentes en atelier ou en logistique. En contournant ce paradigme, L2G-Det ouvre une voie vers des systèmes de vision zéro-shot plus robustes, directement exploitables dans des scénarios de bin-picking, d'inspection qualité ou de dépalettisation sans calibration intensive. La détection d'instances guidée par template s'inscrit dans un effort plus large de la communauté vision-robotique pour réduire le fossé entre environnements contrôlés et déploiements réels. SAM, publié par Meta en 2023, est devenu une brique de référence pour la segmentation généraliste, et son intégration dans des pipelines spécialisés se multiplie. Les méthodes concurrentes incluent DINOv2-based matchers, OnePose++ pour la pose estimation, et les approches VLA (Vision-Language-Action) qui traitent le problème à un niveau d'abstraction plus élevé. La prochaine étape naturelle pour L2G-Det sera une évaluation quantitative rigoureuse sur des benchmarks standardisés comme BOP Challenge ou YCB-Video, et un test en déploiement réel sur robot.

RecherchePaper
1 source
Distill : comprendre les intentions réelles dans la communication humain-robot
1786arXiv cs.RO 

Distill : comprendre les intentions réelles dans la communication humain-robot

Une équipe de chercheurs présente dans un article déposé sur arXiv en mai 2026 (arXiv:2605.14262) une approche baptisée Distill, conçue pour extraire l'intention réelle d'un utilisateur lorsqu'il formule une tâche à un robot. Le problème de départ est bien documenté : le langage naturel, aussi intuitif soit-il, reste ambigu et imprécis, tandis que la programmation par l'utilisateur final tend à l'inverse à être trop littérale, incapable de capturer la généralité de ce que l'utilisateur souhaite réellement accomplir. Distill opère en trois étapes sur une spécification de tâche fournie par l'utilisateur : il supprime les étapes superflues, généralise le sens derrière chaque étape individuelle, et relâche les contraintes d'ordonnancement entre ces étapes. L'approche a été implémentée sous forme d'interface web et évaluée via une étude crowdsourcée auprès d'utilisateurs réels. L'enjeu pour l'industrie robotique est concret : la distance entre ce qu'un opérateur dit et ce qu'il veut réellement constitue l'un des principaux freins au déploiement de robots autonomes dans des environnements non structurés. Les interfaces à langage naturel prolifèrent, portées par les modèles VLA (Vision-Language-Action) et les LLMs embarqués dans des plateformes comme Figure 02, Spot ou les robots collaboratifs industriels, mais elles buttent systématiquement sur cette ambiguïté sémantique. Une approche capable de distiller l'intention générale derrière une instruction floue ou sur-spécifiée réduirait le besoin de reformulation itérative et abaisserait la barrière d'adoption pour des opérateurs non-experts en programmation. Ce type de raffinement d'intention est également utile pour la génération automatique de programmes comportementaux dans des architectures de type task planning. Ce travail s'inscrit dans une vague de recherches visant à combler le fossé entre langage humain et représentations formelles exploitables par les robots, un champ actif impliquant des laboratoires comme Stanford, MIT CSAIL ou le groupe Human-Robot Interaction de l'Inria en France. Les approches concurrentes incluent la correction de programme par retour utilisateur (LLM Repair), la programmation par démonstration (PbD) et les interfaces de dialogue multi-tours. Distill se distingue par son orientation vers la généralisation automatique plutôt que la simple transcription ou la correction d'erreurs. Les prochaines étapes attendues concernent l'intégration sur des plateformes robotiques physiques et l'évaluation de robustesse face à des tâches à longue séquence ou à contraintes temporelles strictes. Il s'agit pour l'instant d'un preprint non évalué par les pairs, sans déploiement industriel annoncé.

UEL'Inria (groupe Human-Robot Interaction) est cité comme acteur du même champ de recherche, positionnant la France dans les travaux sur l'interprétation d'intention en robotique, sans implication directe dans ce preprint.

RecherchePaper
1 source
Partager la charge : transport autonome de fret par flotte de rovers
1787arXiv cs.RO 

Partager la charge : transport autonome de fret par flotte de rovers

Dans le cadre du programme Artemis de la NASA, des chercheurs canadiens ont publié sur arXiv (arXiv:2510.18766v2) une étude portant sur le transport coopératif de charges lourdes par deux rovers autonomes sur la surface lunaire. Le scénario cible est celui d'un habitat lunaire permanent, où des modules d'assemblage devront être acheminés depuis la zone d'atterrissage jusqu'au site d'habitat, à des distances pouvant atteindre 5 km. Pour répondre à cette contrainte, l'équipe a développé un contrôleur prédictif distribué (MPC distribué) permettant à deux Lunar Utility Vehicles (LUV) de 800 kg chacun de transporter solidairement une charge de 475 kg. Un couplage mécanique sur mesure assure le support intégral de la masse tout en découplant la cinématique de chaque véhicule, leur laissant une liberté de mouvement relative. Lors des tests terrain, les rovers ont maintenu une erreur de séparation relative moyenne de 9,2 cm, avec une erreur maximale de 33,4 cm. Ce résultat est notable pour plusieurs raisons. D'abord, il valide l'approche "teach and repeat" par lidar dans un contexte multi-véhicule : chaque rover conserve individuellement la qualité de suivi de trajectoire propre à cette méthode, sans dégradation due à la coordination. Ensuite, l'architecture MPC distribuée évite un point de défaillance central, ce qui est critique pour des missions où la redondance est une exigence de sécurité non négociable. Enfin, le fait qu'un seul contrôleur puisse gérer des opérations variées (transport, repositionnement, manoeuvres) démontre une généricité utile au-delà du seul transport de fret, ouvrant la voie à des rovers multifonctions pour des missions à longue durée. Le Canada participe activement au programme Artemis via l'Agence spatiale canadienne, notamment à travers le projet de rover lunaire Canadarm3 et les études sur les véhicules utilitaires lunaires. Les LUV étudiés ici s'inscrivent dans cette feuille de route nationale. Sur le plan concurrentiel, la NASA développe en parallèle ses propres rovers de surface (MAPP, MGRU), tandis que des acteurs privés comme Astrobotic ou Intuitive Machines se positionnent sur la logistique de surface. La prochaine étape pour cette architecture sera son intégration dans des simulations de missions complètes et, potentiellement, des tests en environnement analogue lunaire (volcanique ou arctique), avant toute qualification vol.

RecherchePaper
1 source
EARL : un cadre unifié guidé par l'analyse pour le raisonnement d'interaction égocentrique et l'ancrage au pixel
1788arXiv cs.RO 

EARL : un cadre unifié guidé par l'analyse pour le raisonnement d'interaction égocentrique et l'ancrage au pixel

Des chercheurs publient sur arXiv (réf. 2605.14742) EARL, un cadre d'apprentissage par renforcement guidé par analyse pour la compréhension d'interactions humain-environnement en vision égocentrique, c'est-à-dire depuis une caméra portée à la première personne. L'architecture repose sur deux étages séquentiels : une phase d'interprétation globale qui produit une description textuelle structurée des interactions observées, suivie d'une phase de réponse fine qui génère simultanément une réponse textuelle, des boîtes englobantes et un masque de segmentation au niveau pixel. Le lien entre ces deux étages est assuré par un module original, l'Analysis-guided Feature Synthesizer (AFS), qui extrait un descripteur sémantique global et l'injecte comme prior lors du raisonnement orienté requête. La phase de réponse est optimisée par GRPO (Group Relative Policy Optimization), une variante d'apprentissage par renforcement popularisée récemment par les travaux DeepSeek. Sur le benchmark Ego-IRGBench, EARL atteint 65,48 % de cIoU pour le pixel grounding, soit +8,37 points au-dessus des meilleures méthodes RL comparables. Le test de généralisation hors-distribution sur EgoHOS, un benchmark de segmentation mains-objets, confirme une transférabilité satisfaisante sur des scènes non vues à l'entraînement. Ce résultat souligne une limite structurelle des grands modèles multimodaux de langage (MLLMs) actuels : ils décrivent correctement les scènes, mais peinent à localiser avec précision les zones d'interaction au niveau pixel, une granularité pourtant indispensable pour qu'un robot assistif saisisse un objet ou qu'un système embarqué guide un geste en temps réel. EARL démontre qu'injecter un prior sémantique structuré avant la phase de grounding améliore significativement cette précision sans sacrifier la compréhension globale. La robustesse OOD mesurée sur EgoHOS est un signal positif pour des déploiements en conditions variées, même si l'article reste un preprint académique et non un système industriellement déployé, ce qui invite à la prudence sur la portée des métriques annoncées. La vision égocentrique connaît une forte dynamique, portée par des dispositifs comme les lunettes Meta Orion, l'Apple Vision Pro et les casques industriels RealWear, tandis que le dataset Ego4D (Meta/FAIR) reste la référence d'entraînement du domaine. EARL s'inscrit dans une vague de travaux combinant MLLMs et RL pour dépasser les limitations du fine-tuning supervisé classique, aux côtés de systèmes comme SpatialVLM ou EgoVLP. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; les extensions naturelles incluent l'intégration dans des pipelines robotiques temps-réel et l'évaluation sur des environnements industriels ou médicaux, où la précision du grounding pixel conditionne directement la sécurité opérationnelle.

RecherchePaper
1 source
CoCo-InEKF : estimation d'état avec covariances de contact apprises dans des scénarios dynamiques à contacts multiples
1789arXiv cs.RO 

CoCo-InEKF : estimation d'état avec covariances de contact apprises dans des scénarios dynamiques à contacts multiples

Une équipe de recherche vient de déposer sur arXiv (arXiv:2605.15122, mai 2026) CoCo-InEKF, un filtre de Kalman étendu invariant différentiable pour l'estimation d'état des robots à pattes en mouvement dynamique. La contribution centrale consiste à remplacer les états de contact binaires traditionnels (pied au sol ou non) par des covariances continues de vitesse de contact, calculées par un réseau de neurones léger entraîné de bout en bout via une fonction de perte sur l'erreur d'état. Ce réseau prédit des covariances pour des points candidats de contact prédéfinis, sans nécessiter d'étiquettes manuelles de vérité terrain. Une procédure de sélection automatique de ces points est également proposée, et les auteurs montrent que les résultats sont peu sensibles à leur positionnement exact. Les expériences ont été conduites sur un robot bipède, avec des démonstrations de danse et d'interactions complexes avec le sol, aussi bien en simulation qu'en environnement réel. La distinction entre états de contact binaires et covariances continues touche un verrou technique récurrent de la locomotion dynamique. Les filtres classiques peinent à gérer le contact partiel (un pied posé partiellement sur un obstacle) ou le glissement directionnel (la semelle dérape latéralement tout en maintenant une charge normale). En modulant dynamiquement la confiance accordée à chaque point de contact, CoCo-InEKF produit une meilleure estimation de vitesse linéaire et une consistance de filtre améliorée par rapport aux approches de référence, ce qui conditionne directement la robustesse des mouvements sur terrains complexes. L'absence de labels manuels de contact facilite également le portage vers de nouveaux châssis sans recalibrage supervisé. L'InEKF (filtre de Kalman étendu invariant sur groupes de Lie SE(3)) s'est imposé depuis les travaux du MIT sur le contact-aided InEKF (2019) comme cadre de référence pour l'odométrie des robots à pattes, avec des intégrations dans des systèmes comme ANYmal d'ANYbotics. CoCo-InEKF y intègre l'apprentissage machine pour estimer les covariances de contact plutôt que de les fixer heuristiquement, une évolution incrémentale mais utile face aux approches purement géométriques. Les démonstrations restent à ce stade sur un prototype de laboratoire bipède non identifié dans le preprint ; le code n'est pas encore publié, et le transfert vers des plateformes commerciales comme Unitree H1 ou Agility Robotics Digit demandera une validation sur une plus grande diversité de surfaces et de dynamiques.

RecherchePaper
1 source
Imitation ergodique pour une exploration adaptative autour des démonstrations
1790arXiv cs.RO 

Imitation ergodique pour une exploration adaptative autour des démonstrations

Une équipe de recherche vient de publier sur arXiv (référence 2605.13996) une méthode intitulée "Ergodic Imitation", conçue pour rendre les robots capables de s'adapter lorsqu'ils échouent à reproduire fidèlement une démonstration. Le problème ciblé est classique en apprentissage par imitation : une trajectoire apprise sur des démonstrations peut devenir inopérante dès que les conditions de déploiement diffèrent légèrement, qu'il s'agisse d'un changement d'environnement, d'une imprécision de capteur, ou d'une erreur de contrôle. Plutôt que de se bloquer sur la trajectoire nominale, le système proposé construit une distribution cible à partir de la géométrie des démonstrations récupérées, puis génère des trajectoires qui interpolent de façon adaptative entre suivi strict et exploration locale. Le coeur de la contribution est l'extension du contrôle ergodique, une technique jusqu'ici utilisée principalement pour la couverture de zones et la recherche en environnements inconnus, à un cadre de recalage par horizon glissant ancré dans les démonstrations. Le contrôle ergodique garantit que le robot passe du temps dans les régions proportionnellement à leur "importance" selon la distribution cible, ce qui permet d'explorer autour de la démonstration sans s'en éloigner trop. Pour les intégrateurs et les équipes d'automatisation industrielle, cela représente un levier concret contre le "demo-to-deployment gap" : une politique apprise n'a plus besoin d'être réapprise ou ré-annotée chaque fois que les conditions dérivent légèrement par rapport au setup de collecte des données. Le contrôle ergodique en robotique mobile remonte à des travaux des années 2010 (en particulier ceux du groupe de Todd Murphey à Northwestern), mais son application à l'imitation reste rare. Les approches concurrentes dans ce segment incluent DAgger et ses variantes (correction en ligne via un expert), ainsi que les méthodes de diffusion conditionnelle comme Diffusion Policy ou Pi-0 (Physical Intelligence), qui gèrent aussi l'incertitude par exploration stochastique mais nécessitent en général des volumes de données bien supérieurs. Cette publication est un preprint non encore évalué par des pairs, sans benchmark comparatif publié ni déploiement hardware annoncé ; les résultats expérimentaux mentionnés dans l'abstract restent à évaluer dans la version complète du papier.

RecherchePaper
1 source
Contrôle par planification réactive pour robots mobiles en environnements encombrés d'obstacles
1791arXiv cs.RO 

Contrôle par planification réactive pour robots mobiles en environnements encombrés d'obstacles

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.14232v1) une méthode de contrôle de mouvement pour robots mobiles évoluant dans des environnements encombrés d'obstacles. L'approche, baptisée RPCS (Reactive Planning based Control Strategy), s'attaque à un problème classique de la robotique mobile : déplacer un robot d'un point de départ à une cible sans collision, en ne disposant que d'une information partielle sur l'environnement, c'est-à-dire sans carte globale préalable. Le système fonctionne en deux couches combinées : une trajectoire de référence est d'abord tracée en ligne droite entre les deux points, puis un module de planification réactive (RPS) la modifie localement à la volée lorsque des obstacles sont détectés. Un contrôleur de suivi adaptatif (ATCS), basé sur des techniques de discrétisation, assure ensuite l'exécution effective de cette trajectoire potentiellement modifiée. Les résultats présentés s'appuient uniquement sur des simulations numériques, sans validation hardware reportée. L'intérêt de cette architecture réside dans la séparation claire entre planification réactive et contrôle de suivi, ce qui permet théoriquement d'adapter chaque couche indépendamment selon le robot cible. Pour les intégrateurs travaillant sur des AGV ou AMR dans des entrepôts à géométrie variable, la capacité à opérer sans carte globale complète reste un enjeu réel, les approches purement réactives souffrent souvent de blocages locaux, et les approches globales peinent face aux environnements dynamiques. L'ATCS adaptatif suggère une robustesse potentielle aux perturbations de modèle, mais l'absence d'expérimentation physique limite la portée des conclusions à ce stade. Ce travail s'inscrit dans une longue tradition de recherche sur la navigation réactive, depuis les champs de potentiel de Khatib (1986) jusqu'aux approches VFH et DWA largement déployées dans ROS. Les chercheurs ne positionnent pas explicitement leur méthode face aux planificateurs modernes appris (RL, imitation learning) qui commencent à équiper des plateformes commerciales comme Spot de Boston Dynamics ou les AMR de MiR. La prochaine étape naturelle serait une validation sur robot réel en environnement semi-structuré, condition sine qua non pour que la méthode pèse dans le débat industriel.

RecherchePaper
1 source
Un stack d'autonomie unifié : vers un schéma directeur pour l'autonomie robotique généralisable
1792arXiv cs.RO 

Un stack d'autonomie unifié : vers un schéma directeur pour l'autonomie robotique généralisable

Des chercheurs du Norwegian University of Science and Technology (NTNU), au sein de leur Autonomous Robots Lab (ARL), ont publié et mis en open source un framework d'autonomie modulaire baptisé Unified Autonomy Stack (arXiv:2605.12735, mai 2025). L'architecture repose sur trois modules interdépendants : perception multimodale (LiDAR, radar, vision, centrale inertielle), planification multi-comportements, et navigation sécurisée multicouche. La fusion sensorielle s'appuie sur un graphe de facteurs pour la localisation et la cartographie simultanées (SLAM), complétée par une compréhension sémantique de la scène. La planification utilise des techniques d'échantillonnage adaptatif à différentes échelles spatiales, tandis que la sécurité de navigation combine reconstruction de carte en ligne, politiques exoceptives par deep learning et filtres de dernier recours via des fonctions de barrière de contrôle (Control Barrier Functions, CBF). Le système a été validé sur le terrain avec deux classes de robots : aériens (rotorcraft multirotors) et terrestres à pattes, dans des environnements GNSS-dégradés, enfumés, géométriquement complexes et à forte densité d'obstacles. La contribution principale n'est pas un algorithme isolé mais une architecture système complète, validée dans des conditions réellement dégradées, ce qui reste rare dans la littérature académique. La capacité à opérer sans GPS dans des espaces à textures auto-similaires (couloirs industriels, tunnels) ou sous visibilité réduite répond directement aux besoins de l'inspection robotisée en milieux contraints : sites miniers, infrastructures énergétiques, espaces confinés. L'ouverture totale du code source, modules perception, planification et sécurité inclus, abaisse la barrière d'entrée pour les intégrateurs qui ne souhaitent pas reconstruire cette couche d'autonomie de zéro. La portabilité cross-morphologies, le même stack pour un drone et un quadrupède, est une proposition de valeur forte pour les plateformes hybrides. L'NTNU ARL dispose d'un historique solide en navigation autonome en milieux dégradés, notamment à travers sa participation à la DARPA Subterranean Challenge. Ce projet positionne le laboratoire norvégien comme acteur open source dans un espace jusqu'ici dominé par des solutions propriétaires américaines telles que le Nav SDK de Boston Dynamics, la suite Clearpath, ou le système ANYmal d'ANYbotics. Les datasets de validation sont également mis à disposition, signal d'une ambition d'adoption communautaire active. Les extensions naturelles concerneraient l'intégration avec des couches de commande haute performance (MPC, whole-body control) et les flottes multi-robots hétérogènes.

UELe framework open source de l'NTNU offre aux intégrateurs robotiques européens une alternative concrète aux suites propriétaires américaines (Nav SDK Boston Dynamics, ANYbotics) pour déployer de l'autonomie en milieux GNSS-dégradés ou contraints.

RecherchePaper
1 source
Estimation de la vitesse angulaire avec gestion de la saturation : renforcement de la robustesse du SLAM lors de mouvements brusques
1793arXiv cs.RO 

Estimation de la vitesse angulaire avec gestion de la saturation : renforcement de la robustesse du SLAM lors de mouvements brusques

Des chercheurs du Northern Robotics Laboratory (NorLab) de l'Université Laval, au Québec, publient une méthode d'estimation de vitesse angulaire baptisée SAAVE (Saturation-Aware Angular Velocity Estimation) conçue pour maintenir le bon fonctionnement des algorithmes SLAM lorsque les gyroscopes saturent pendant des mouvements brusques. La cause typique : un robot qui chute, bascule, ou descend un escalier à grande vitesse. Dans ces situations, les gyroscopes -- premiers capteurs à atteindre leur plage de mesure maximale -- deviennent inopérants, corrompant la carte que le robot se construit en temps réel. La méthode proposée contourne ce problème en utilisant les accéléromètres pour reconstituer la vitesse angulaire durant ces rotations extrêmes. Sur le jeu de données TIGS (Tumbling-Induced Gyroscope Saturation), constitué d'expériences en extérieur avec un lidar mécanique soumis à des vitesses angulaires quatre fois supérieures aux datasets comparables disponibles, la méthode réduit l'erreur médiane de localisation de 71,5 % en translation et de 65,5 % en rotation, et élimine les échecs de cartographie qui survenaient dans 37,5 % des expériences sans cette correction. L'enjeu dépasse la performance académique : en robotique de terrain, un robot physiquement intact après une chute peut se retrouver incapable de poursuivre sa mission simplement parce que sa représentation de l'environnement est corrompue. C'est un angle mort documenté des pipelines SLAM modernes, qu'ils soient basés sur lidar (LIO-SAM, LOAM, CT-ICP) ou sur vision. La contribution ici n'est pas une refonte du SLAM, mais un module de robustesse qui s'intègre en amont -- ce qui la rend directement exploitable sans remplacer l'ensemble du stack de localisation. Pour les intégrateurs qui déploient des robots d'inspection en milieux non structurés (mines, chantiers, zones sinistrées), c'est une brique concrète, pas un teaser. NorLab est connu pour ses travaux sur la localisation en conditions hivernales et ses librairies open source (libpointmatcher, norlab-icp). Ce papier, initialement soumis en octobre 2023 et mis à jour depuis (v2), s'inscrit dans une tendance de fond : renforcer les SLAM existants face aux défaillances capteurs plutôt que de les remplacer. Le dataset TIGS est disponible publiquement sur GitHub, ce qui facilite la reproductibilité et le benchmark futur. Dans le paysage concurrentiel, les approches comme KISS-ICP ou VILENS adressent la robustesse en mouvement nominal, mais la saturation gyroscopique par chute reste peu couverte -- ce que NorLab comble ici de façon ciblée.

UEAucun acteur français ou européen impliqué, mais la méthode SAAVE est directement intégrable par les intégrateurs européens de robots d'inspection en milieux non structurés (mines, chantiers, zones sinistrées) sans refonte de leur stack SLAM.

RecherchePaper
1 source
Mise en cache adaptative par blocs pour accélérer les politiques de diffusion
1794arXiv cs.RO 

Mise en cache adaptative par blocs pour accélérer les politiques de diffusion

Une équipe de chercheurs a publié sur arXiv (2506.13456) BAC, pour Block-wise Adaptive Caching, une méthode d'accélération de l'inférence pour Diffusion Policy. Le principe : mettre en cache les features d'action intermédiaires générées lors des étapes répétitives de débruitage (denoising), puis les réutiliser sélectivement selon un schéma adaptatif au niveau de chaque bloc du transformeur. Résultat annoncé : jusqu'à 3x de speedup à l'inférence, sans dégradation des performances en génération d'action. BAC est training-free et compatible avec les architectures Diffusion Policy à base de transformeur ainsi qu'avec les modèles vision-language-action (VLA). Les expériences couvrent plusieurs benchmarks robotiques standards, sans déploiement matériel réel annoncé dans ce papier. L'enjeu est direct pour le déploiement industriel : Diffusion Policy est l'une des approches les plus solides pour le contrôle visuomoteur de robots manipulateurs, mais son coût computationnel élevé la rend impraticable en contrôle temps-réel embarqué. Un facteur 3x sans re-training représente un gain opérationnel concret, il suffit d'intégrer BAC sur un modèle existant déjà entraîné. Deux mécanismes y contribuent : un Adaptive Caching Scheduler qui identifie les pas de temps optimaux pour rafraîchir le cache en maximisant la similarité globale des features, et un Bubbling Union Algorithm qui corrige la propagation d'erreurs entre blocs FFN (Feed-Forward Network), principale limite des approches naïves de caching. Diffusion Policy, introduite par Chi et al. en 2023, s'est imposée comme référence pour la manipulation précise, mais son inférence multi-step la pénalise face aux politiques autorégressives ou MLP sur les contraintes de latence. Les techniques d'accélération des modèles de diffusion conçues pour la génération d'images (DDIM, DeepCache) ne se transfèrent pas directement à la robotique en raison de divergences architecturales et de la nature séquentielle des données d'action, c'est précisément le gap que BAC prétend combler. La méthode est compatible avec les VLA récents comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), ce qui lui confère un périmètre d'application large sur l'écosystème actuel. La validation reste cependant limitée aux benchmarks simulés ; une confirmation sur hardware réel en conditions d'inférence embarquée sera nécessaire pour évaluer l'impact opérationnel réel.

RecherchePaper
1 source
QuickLAP : apprentissage rapide des préférences langage-action pour systèmes semi-autonomes
1795arXiv cs.RO 

QuickLAP : apprentissage rapide des préférences langage-action pour systèmes semi-autonomes

Des chercheurs du MIT CLEAR Lab ont publié QuickLAP (Quick Language-Action Preference Learning), un cadre bayésien conçu pour apprendre les préférences d'un utilisateur en combinant deux types de retours : les corrections physiques (gestes, ajustements de trajectoire) et les instructions en langage naturel. L'article, déposé sur arXiv (2511.17855v2), présente des résultats obtenus dans un simulateur de conduite semi-autonome. L'approche utilise un LLM pour extraire, à partir d'énoncés libres, deux signaux distincts : un masque d'attention sur les caractéristiques de la fonction de récompense (quels critères comptent) et un vecteur de déplacement de préférence (dans quelle direction). Ces signaux sont intégrés avec les corrections physiques via une règle de mise à jour en forme fermée, sans nécessiter d'optimisation itérative à chaque cycle. Les résultats quantitatifs sont notables : QuickLAP réduit l'erreur d'apprentissage de la récompense de plus de 70 % par rapport à des baselines utilisant uniquement le retour physique ou des fusions multimodales heuristiques. Une étude utilisateur menée avec 15 participants confirme que le système est perçu comme plus compréhensible et collaboratif, et que le comportement appris est préféré à celui des baselines. Pour les intégrateurs de systèmes semi-autonomes (robotique d'assistance, véhicules autonomes, cobots industriels), cela pointe vers une voie concrète pour réduire la charge de supervision humaine : au lieu d'imposer des interfaces de correction rigides, le système réconcilie des feedbacks ambigus en temps réel. La combinaison LLM + inférence bayésienne contourne l'ambiguïté classique des corrections gestuelles seules. Le problème adressé est bien identifié dans la littérature sur l'apprentissage par renforcement interactif (IRL, RLHF, preference learning). Les approches précédentes traitaient soit le langage (via RLHF ou instruction following), soit le retour physique (DAgger, kinesthetic teaching), rarement les deux de façon cohérente. QuickLAP se positionne dans la lignée des travaux sur les VLAs et les reward models multimodaux, avec un angle applicatif sur les systèmes à supervision humaine partielle. Le code est disponible sur GitHub (MIT-CLEAR-Lab/QuickLAP). Les prochaines étapes naturelles seraient une validation sur robot physique et des expériences dans des domaines au-delà de la conduite, comme la manipulation ou la navigation en entrepôt.

RechercheOpinion
1 source
Self-CriTeach : auto-enseignement et auto-critique d'un LLM pour améliorer la planification robotique
1796arXiv cs.RO 

Self-CriTeach : auto-enseignement et auto-critique d'un LLM pour améliorer la planification robotique

Des chercheurs ont publié en 2025 via arXiv (2509.21543) un cadre baptisé Self-CriTeach, conçu pour améliorer la planification robotique par grands modèles de langage (LLM) sans supervision humaine coûteuse. Le principe central : un LLM génère automatiquement des domaines de planification symbolique au format PDDL, qui servent ensuite à deux fins distinctes. Dans la phase d'auto-enseignement, ces domaines produisent des milliers de paires problème-plan, converties en trajectoires chain-of-thought (CoT) enrichies exploitées en fine-tuning supervisé. Dans la phase d'auto-critique, ces mêmes domaines sont réutilisés comme fonctions de récompense structurées pour l'apprentissage par renforcement (RL), sans ingénierie manuelle des récompenses. Les résultats publiés font état de taux de succès en planification plus élevés, d'une meilleure généralisation inter-tâches, d'une réduction des coûts d'inférence et d'une robustesse accrue aux états logiques imparfaits ou bruités par la perception. L'intérêt de cette approche tient à son autonomie : elle brise deux goulots d'étranglement majeurs de l'outillage LLM pour la robotique. D'une part, la collecte de données CoT pour les LLMs raisonneurs est notorieusement coûteuse en annotation humaine, surtout pour des séquences de manipulation complexes. D'autre part, la conception de fonctions de récompense en RL robotique reste un travail d'ingénierie long et fragile, souvent spécifique à chaque tâche. Self-CriTeach unifie ces deux pipelines autour d'une seule source synthétique générée automatiquement, ouvrant la voie à une spécialisation scalable d'un LLM sur des workflows robotiques sans intervention humaine à chaque étape. Pour un responsable R&D ou un intégrateur, cela représente une réduction potentielle substantielle du coût de personnalisation. Ce travail s'inscrit dans un courant actif cherchant à remplacer la programmation explicite des robots par des LLMs capables de raisonner sur des représentations symboliques. Des approches antérieures comme SayCan (Google) ou CodeAsPolicies (Google DeepMind) ont utilisé des LLMs pour la planification de haut niveau, mais sans exploiter les domaines générés comme source d'entraînement en retour. La contribution de Self-CriTeach est précisément cette boucle fermée entre génération de domaines, supervision CoT et signal de récompense RL. Il s'agit d'une contribution de recherche académique publiée sur arXiv, sans déploiement industriel annoncé à ce stade. Le code et les résultats sont accessibles via la page GitHub du projet.

RecherchePaper
1 source
Quand l'état absolu échoue : évaluation des encodages proprioceptifs pour une manipulation robuste
1797arXiv cs.RO 

Quand l'état absolu échoue : évaluation des encodages proprioceptifs pour une manipulation robuste

Une équipe de chercheurs publie sur arXiv (référence 2605.13067) une étude systématique sur l'encodage de l'état proprioceptif des robots pour améliorer la robustesse des politiques de manipulation de bout en bout. Le constat de départ est précis : les politiques entraînées avec des données en conditions contrôlées échouent fréquemment lors du déploiement réel, notamment lorsque le référentiel du robot change entre l'entraînement et l'inférence. Les auteurs évaluent plusieurs stratégies d'encodage des positions et angles articulaires, depuis les représentations absolues classiques jusqu'à des formulations relatives, et identifient qu'un référentiel relatif défini à l'épisode, c'est-à-dire ancré sur l'état initial des articulations au début de chaque séquence de tâche, offre le meilleur compromis entre performance nominale et généralisation hors distribution. Ces résultats sont validés sur un banc d'essai physique en conditions réalistes, avec des expériences multi-configurations sur robot réel. L'enjeu industriel est concret : les robots à cadre de référence mobile (bras montés sur AMR, robots repositionnables sur ligne, cobots déplacés entre postes) représentent une part croissante des déploiements, mais les politiques end-to-end existantes, y compris les VLA (Vision-Language-Action models) récents comme pi-0 ou GR00T N2, sont généralement entraînées avec des hypothèses de cadre fixe. Cette étude fournit une piste d'implémentation directement exploitable sans modifier l'architecture du modèle ni relancer de collecte de données massive : changer simplement la convention d'encodage proprioceptif suffit à améliorer la robustesse out-of-distribution. C'est un résultat rare dans la littérature VLA, qui tend à préconiser le scaling de données comme seule réponse à la distribution shift. Ce travail s'inscrit dans une tendance de fond : après l'emballement autour des politiques diffusion et des modèles fondation pour la robotique en 2023-2024, la communauté revient sur des questions d'ingénierie bas-niveau souvent négligées. La proprioception, longtemps traitée comme un signal trivial, redevient un sujet de recherche actif face aux exigences du déploiement réel. Aucun partenaire industriel n'est mentionné dans l'abstract, ce qui en fait une contribution académique ouverte, sans timeline de productisation annoncée. Les prochaines étapes logiques seraient des tests avec des architectures VLA complètes et des configurations de bases mobiles plus variées.

RechercheOpinion
1 source
Manipulation robotique par imitation de vidéos générées, sans démonstrations physiques
1798arXiv cs.RO 

Manipulation robotique par imitation de vidéos générées, sans démonstrations physiques

Une équipe de chercheurs a publié sur arXiv (2507.00990) un système baptisé RIGVid (Robots Imitating Generated Videos) permettant à un robot de réaliser des tâches de manipulation complexe, comme verser un liquide, essuyer une surface ou mélanger des ingrédients, en imitant uniquement des vidéos générées par IA, sans aucune démonstration physique ni données d'entraînement spécifiques au robot. Le pipeline fonctionne en trois étapes : à partir d'une commande en langage naturel et d'une image de la scène initiale, un modèle de diffusion vidéo génère des vidéos de démonstration candidates, un VLM (vision-language model) filtre automatiquement celles qui ne correspondent pas à la commande, puis un tracker de pose 6D extrait les trajectoires d'objets. Ces trajectoires sont ensuite retargetées vers le robot de manière agnostique à l'embodiment, c'est-à-dire sans nécessiter de recalibration spécifique à la morphologie du bras utilisé. L'impact est notable pour les intégrateurs et les équipes de recherche en manipulation robotique : supprimer la collecte de démonstrations physiques, étape longue et coûteuse dans les pipelines d'imitation learning, est un verrou industriel majeur. Les évaluations en conditions réelles montrent que les vidéos générées et filtrées atteignent une efficacité équivalente aux démonstrations humaines réelles, et que la performance progresse avec la qualité du modèle génératif utilisé. Le système surpasse également des alternatives plus compactes comme la prédiction de keypoints via VLM, et le tracking 6D de pose s'avère supérieur au tracking dense de points de features. Ces résultats valident expérimentalement l'hypothèse que les générateurs vidéo state-of-the-art constituent une source de supervision viable pour la manipulation robotique, au moins sur des tâches de difficulté modérée. Ce travail s'inscrit dans un champ de recherche en effervescence autour du "learning from video" sans interaction physique, en concurrence directe avec des approches comme les VLA (vision-language-action) de Physical Intelligence (pi-0), les politiques de diffusion type Diffusion Policy, ou encore l'usage de données synthétiques issues de simulateurs. L'approche RIGVid se distingue par son absence totale de données robot et son pipeline entièrement basé sur des modèles généralistes off-the-shelf. À noter que ce papier est une prépublication arXiv (v3, donc ayant déjà subi plusieurs révisions), sans validation par peer-review complet à ce stade, et que les tâches évaluées restent relativement contraintes en termes de variabilité de scène et de généralisation out-of-distribution.

RechercheOpinion
1 source
TinySDP : optimisation semi-définie en temps réel pour une robotique embarquée certifiable et agile
1799arXiv cs.RO 

TinySDP : optimisation semi-définie en temps réel pour une robotique embarquée certifiable et agile

Des chercheurs ont publié sur arXiv (preprint 2605.13748, mai 2025) TinySDP, qu'ils présentent comme le premier solveur de programmation semi-définie (SDP) conçu explicitement pour les systèmes embarqués à ressources contraintes. L'objectif : permettre un contrôle prédictif en temps réel (MPC) sur microcontrôleurs, en intégrant des contraintes d'obstacles non convexes jusqu'ici réservées à des machines de calcul bien plus puissantes. Le solveur associe des projections de cônes semi-définis positifs à un algorithme ADMM (Alternating Direction Method of Multipliers) avec factorisation de Riccati mise en cache. Un certificat de rang 1 a posteriori convertit à chaque pas de temps les solutions relaxées en garanties géométriques explicites. Les expériences portent sur des scénarios d'évitement d'obstacles dynamiques et de cul-de-sac, où les méthodes locales classiques échouent ; TinySDP y produit des trajectoires sans collision et jusqu'à 73 % plus courtes que les baselines de référence. La validation matérielle est conduite sur un quadrirotor Crazyflie, nano-drone de recherche développé par Bitcraze. L'enjeu industriel est réel : les relaxations SDP offrent depuis des années des garanties de certification pour la planification de mouvement, mais leur coût computationnel les confinait aux stations de calcul hors-ligne ou aux serveurs de cloud. Les embarquer sur un microcontrôleur ouvre la voie à des robots autonomes certifiés opérant sans infrastructure réseau : drones d'inspection, AMR en environnement dynamique, bras cobots sans liaison cloud. Le gain de 73 % sur la longueur de chemin dans des scénarios difficiles dépasse ce que la littérature locale obtient habituellement, bien qu'il faille noter que ces benchmarks sont choisis par les auteurs, et que les conditions réelles d'industrialisation restent à établir. La programmation semi-définie est un outil établi en robotique depuis les travaux sur les relaxations de Lasserre et les problèmes de manipulation certifiée, mais aucun solveur embarqué n'en avait rendu le déploiement praticable avant ce travail. Côté concurrents, les solveurs embarqués dominants comme OSQP ou ECOS ciblent les problèmes quadratiques ou coniques de second ordre, sans support natif des contraintes SDP. Le papier reste un preprint non relu par les pairs ; les prochaines étapes naturelles seraient une validation sur des plateformes plus contraintes encore (STM32, Cortex-M) et des scénarios multi-obstacles en environnement non structuré.

UEBitcraze, entreprise suédoise (EU) dont le nano-drone Crazyflie sert de plateforme de validation, bénéficie d'une visibilité accrue ; les équipes R&D européennes travaillant sur des AMR ou cobots embarqués sans connexion cloud pourraient intégrer TinySDP dans leurs pipelines de planification de mouvement certifiable.

RecherchePaper
1 source
Unifier les actions du robot dans le référentiel caméra
1800arXiv cs.RO 

Unifier les actions du robot dans le référentiel caméra

Des chercheurs ont publié sur arXiv (référence 2511.17001v2) une méthode baptisée CalibAll, conçue pour unifier la représentation des actions robotiques en recadrant celles-ci dans le repère de la caméra plutôt que dans celui propre à chaque plateforme. L'approche repose sur l'estimation automatique des paramètres extrinsèques de la caméra (position et orientation dans l'espace) pour des jeux de données existants, puis sur la conversion de chaque action en coordonnées TCP (Tool Center Point) standardisées dans ce repère caméra commun. Le pipeline a été appliqué à 16 jeux de données couvrant 4 plateformes robotiques différentes, bras simple et bras bimanuel inclus, pour produire environ 97 000 épisodes étalonnés. CalibAll fonctionne en deux étapes : une initialisation grossière via un algorithme PnP temporel (Perspective-n-Point), suivie d'un raffinement à haute précision par rendu différentiable. Aucun entraînement préalable ni données spécifiques à un robot n'est requis, ce qui distingue la méthode des approches d'étalonnage classiques. L'enjeu est direct pour les équipes qui travaillent sur des politiques robotiques généralisées de type VLA (Vision-Language-Action). Le problème de fond du cross-embodiment learning, soit le fait d'entraîner un seul modèle sur des robots morphologiquement différents, est que les actions n'ont pas la même sémantique géométrique d'une plateforme à l'autre : un déplacement de 10 cm en coordonnées articulaires n'a pas le même sens sur un UR5 et sur un Franka. Les solutions actuelles, têtes d'action spécifiques à chaque morphologie ou espaces d'action latents appris, contournent le problème sans le résoudre. En ancrant toutes les actions dans le repère caméra, CalibAll impose une sémantique géométrique cohérente indépendante du robot. Les expériences en simulation et sur robot réel montrent que le pré-entraînement cross-embodiment avec ces actions unifiées atteint des performances état de l'art, bien que les benchmarks précis et les taux de succès par tâche ne soient pas détaillés dans l'abstract. Le contexte est celui de la course aux politiques robotiques généralisables, portée par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA. Ces architectures ont besoin de données massives et diversifiées, et la fragmentation des jeux de données existants selon les plateformes constitue un frein majeur à la mise à l'échelle. CalibAll s'attaque précisément à ce goulot d'étranglement en rendant rétrocompatibles des datasets existants sans re-annotation manuelle, ce qui est non négligeable quand on considère le coût de collecte téléopérée. La question ouverte reste la robustesse de l'étalonnage sur des datasets dont les conditions d'acquisition sont hétérogènes, notamment lorsque l'environnement visuel est peu structuré ou que les caméras sont embarquées sur le robot en mouvement. Les suites logiques incluent une intégration dans des pipelines de pré-entraînement ouverts comme Open X-Embodiment, et potentiellement une extension aux robots mobiles manipulateurs où le référentiel caméra change dynamiquement.

RechercheOpinion
1 source