Aller au contenu principal

Dossier arXiv cs.RO — page 39

2609 articles · page 39 sur 53

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

SCAN-Planner : planification locale anticollision pour la navigation guidée longue portée de quadrupèdes
1901arXiv cs.RO RecherchePaper

SCAN-Planner : planification locale anticollision pour la navigation guidée longue portée de quadrupèdes

Des chercheurs ont publié sur arXiv (référence 2606.19555) une lettre décrivant SCAN-Planner, un cadre de planification locale pour robots quadrupèdes destiné à la navigation longue portée en environnements non structurés. Le système s'attaque à trois familles de situations problématiques : les passages étroits, les scènes intérieures encombrées et les terrains 3D complexes à grande échelle. L'innovation centrale est un empreinte bicylindrique sensible au lacet (yaw-aware twin-cylinder footprint) qui modélise le corps allongé du quadrupède, par opposition aux approximations isotropiques classiques qui gonflent le robot comme une sphère ou un cylindre unique. Cette représentation permet une évaluation des collisions sur l'ensemble du corps via des requêtes éparses dans une carte d'occupation 3D gonflée. Le système intègre également une recherche A* projetée sur une surface d'adhérence au sol interpolée, avec suppression de gradient vertical pour contourner les obstacles horizontaux sans compromettre la stabilité verticale. Pour le déploiement à grande échelle, une carte glissante centrée sur le robot avec mécanisme de repli aux frontières assure un contrôle de collision local haute résolution et une récupération des impasses locales. Les expériences combinent simulation et terrain réel : couloirs encombrés, scènes 3D non structurées, franchissement d'escaliers et navigation longue portée. L'intérêt pour les intégrateurs et les équipes robotiques tient à deux points concrets. D'abord, la prise en compte explicite des surplombs et structures tridimensionnelles comble une lacune réelle des planificateurs à carte d'élévation 2.5D, qui échouent dès qu'un obstacle dépasse un plan horizontal unique. Ensuite, le mécanisme de carte glissante adresse le passage à l'échelle (large-scale deployment) sans exploser les besoins mémoire, un problème récurrent dans les déploiements industriels longue distance. L'approche valide aussi empiriquement que la modélisation fine du corps du robot améliore la navigation en espace contraint, là où les planificateurs conservateurs dilatent excessivement les marges de sécurité et bloquent le robot dans des passages praticables. Côté contexte, la planification locale pour quadrupèdes est un terrain dense : les plateformes Boston Dynamics Spot et ANYbotics ANYmal ont popularisé ces robots hors laboratoire, mais leurs planificateurs embarqués restent majoritairement propriétaires. Côté académique, les travaux récents s'appuient sur des représentations comme les cartes de distance euclidienne (ESDF) ou les réseaux de perception, avec des systèmes comme le locomotion controller de ANYmal-D ou les frameworks de navigation de l'ETH Zurich. SCAN-Planner se positionne comme une couche de planification locale agnostique au locomotion controller, compatible avec un guidage de route externe. Aucun déploiement industriel ni partenariat commercial n'est mentionné dans la publication actuelle, qui reste une contribution de recherche en cours d'évaluation par les pairs.

1 source
RoboSSM : apprentissage par imitation contextuel et extensible via les modèles à espace d'états
1902arXiv cs.RO 

RoboSSM : apprentissage par imitation contextuel et extensible via les modèles à espace d'états

Des chercheurs ont publié sur arXiv (réf. 2509.19658v2) RoboSSM, une architecture d'apprentissage par imitation en contexte (ICIL, pour in-context imitation learning) qui remplace les Transformers par des modèles à espace d'état (SSM, state-space models), et plus précisément par Longhorn, un SSM récent présenté comme état de l'art. L'apprentissage par imitation en contexte permet à un robot d'apprendre une nouvelle tâche à partir d'une poignée de démonstrations fournies à l'inférence, sans aucune mise à jour des paramètres du modèle. Les expériences ont été conduites sur le benchmark LIBERO, référence standard pour l'évaluation des politiques robotiques multi-tâches, et montrent que RoboSSM dépasse les méthodes ICIL à base de Transformers sur les tâches non vues à l'entraînement ainsi que sur les tâches à horizon long. L'enjeu est architectural : les Transformers ont une complexité quadratique en fonction de la longueur du contexte, ce qui les pénalise dès que le prompt contient de nombreuses démonstrations ou des séquences longues. Les SSM, eux, offrent une inférence en temps linéaire et une capacité d'extrapolation à des contextes plus longs que ceux vus à l'entraînement, deux propriétés directement utiles pour l'ICIL en conditions réelles, où l'on peut vouloir fournir cinq ou dix démonstrations plutôt qu'une seule. Les auteurs affirment démontrer pour la première fois qu'un SSM peut servir de colonne vertébrale efficace et scalable pour l'ICIL. Les résultats restent toutefois confinés au simulateur LIBERO ; aucun transfert sim-to-real ni déploiement industriel n'est documenté dans ce travail. L'ICIL s'est imposée ces deux dernières années comme alternative aux politiques entraînées tâche par tâche, portée notamment par des travaux comme ICRT ou HPT, tous basés sur des Transformers. RoboSSM s'inscrit dans une tendance plus large de remplacement des Transformers par des SSM (famille Mamba, Longhorn) dans les pipelines séquentiels, tendance déjà observée en NLP et en vision. Le code est publié sur GitHub, ce qui ouvre la voie à une reproduction communautaire. Les prochaines étapes attendues sont une validation sur robot physique et une comparaison à l'échelle avec des VLA (vision-language-action) de plus grande taille.

RecherchePaper
1 source
Coupe robotique robuste et périodique de roche via contrôle par modèle virtuel
1903arXiv cs.RO 

Coupe robotique robuste et périodique de roche via contrôle par modèle virtuel

Une équipe de chercheurs publie sur arXiv (2508.02604, version 3) un contrôleur destiné à la découpe robotique de légumes par mouvement "rock-chop" rythmique, sans trajectoire préprogrammée ni connaissance précise des propriétés mécaniques du matériau. L'approche repose sur un contrôleur à modèle virtuel (VMC) utilisant des mécanismes virtuels commutés : le mouvement émerge de l'interaction entre la dynamique du robot, l'environnement et des forces virtuelles calculées en temps réel. Validé sur un bras Franka Research 3, le système atteint une précision inférieure au millimètre pour des tranches de 1 à 6 mm d'épaisseur sur cinq légumes distincts, à un rythme d'environ une coupe par seconde. Le contrôleur maintient ses performances malgré des variations de forme du couteau et de hauteur de planche à découper, et a été transposé avec succès sur un bras humanoïde différent sans retuning majeur. Ce résultat pointe vers un verrou longtemps ouvert en manipulation robotique de contact : la découpe cumule des forces d'interaction élevées et imprévisibles, des matériaux aux propriétés variables, et des exigences de précision sub-millimétrique que les approches classiques peinent à concilier. Les méthodes habituelles s'appuient soit sur des trajectoires rigides préprogrammées, soit sur des modèles d'apprentissage intensifs en données. Le VMC proposé exploite à la place la physique du système elle-même pour stabiliser un mouvement périodique, dont la convergence est démontrée théoriquement et pas seulement empiriquement. La portabilité sur un second effecteur sans recalibration constitue un signal de généralisation platform-agnostic, qui intéresse directement les intégrateurs industriels souhaitant mutualiser leur contrôleur sur plusieurs modèles de robots. La découpe automatisée reste un verrou industriel, notamment en agroalimentaire, où des acteurs comme Miso Robotics proposent des solutions dédiées mais peu flexibles. Ce preprint (v3, non encore soumis à revue à comité de lecture) ne rapporte que des expériences de laboratoire sur cinq légumes en conditions contrôlées, sans déploiement industriel mentionné. Aucune comparaison avec des approches par apprentissage (imitation learning, VLA) n'est réalisée, ce qui limite la mise en perspective des performances annoncées. Les suites naturelles seraient une validation sur ligne réelle et une soumission à une conférence de référence (ICRA, IROS, CoRL) pour établir la reproductibilité externe.

RecherchePaper
1 source
Graphes de scène 3D : défis ouverts et perspectives futures
1904arXiv cs.RO 

Graphes de scène 3D : défis ouverts et perspectives futures

Un article de synthèse intitulé "3D Scene Graphs: Open Challenges and Future Directions" (arXiv:2606.19383) vient d'être publié, proposant une revue unifiée et critique des graphes de scène 3D (3DSGs) pour l'IA spatiale. Les 3DSGs sont des représentations qui combinent un ancrage géométrique avec des abstractions sémantiques et relationnelles de l'environnement: en clair, une carte structurée où les objets, leurs propriétés et leurs relations spatiales sont encodés dans un graphe hiérarchique. Le survey couvre leurs applications dans la manipulation robotique, la navigation autonome, la planification de tâches et la compréhension de scène. Les auteurs formalisent une définition commune, analysent les choix de modélisation (attributs de noeuds et d'arêtes, structure hiérarchique, représentations dynamiques, extensions tenant compte des affordances), puis examinent les pipelines de construction à partir de données sensorielles brutes et les stratégies d'évaluation, de la qualité intrinsèque du graphe jusqu'aux performances applicatives. Un site compagnon est disponible à https://3dscenegraphs.com/. Ce survey arrive à un moment critique pour la robotique déployée en milieu industriel réel. Le constat central est celui d'une fragmentation dommageable: les différentes communautés (vision par ordinateur, robotique cognitive, planification symbolique) ont développé des formalismes incompatibles, des pipelines de construction distincts et des protocoles d'évaluation hétérogènes, ce qui rend la comparaison des méthodes quasi impossible et freine l'identification des hypothèses communes. Pour un intégrateur ou un décideur B2B, cela signifie concrètement qu'aucune solution 3DSG n'est encore directement transposable d'un système à l'autre sans retravailler la couche de représentation. Le survey ne prétend pas résoudre ce problème, mais pose les bases pour qu'une normalisation émerge, ce qui est un prérequis à un déploiement robuste en production. Les graphes de scène 3D ont gagné en popularité avec l'essor des architectures de type Vision-Language-Action (VLA) et des modèles de fondation pour la robotique, qui nécessitent des représentations du monde à la fois compactes et manipulables symboliquement. Des travaux comme ScanScribe, Hydra (MIT SPARK Lab) ou SceneGraphFusion ont posé des jalons distincts, sans consensus de facto. Les prochaines étapes identifiées par les auteurs incluent la gestion des scènes dynamiques et longue durée, l'évaluation task-level standardisée et l'intégration avec des planificateurs LLM. Le champ est encore exploratoire, mais il constitue un verrou clé pour les systèmes robotiques qui doivent raisonner sur leur environnement au-delà de la simple détection d'objets.

RecherchePaper
1 source
DF-ExpEnse : exploration filtrée par diffusion pour un affinage économe en données
1905arXiv cs.RO 

DF-ExpEnse : exploration filtrée par diffusion pour un affinage économe en données

Des chercheurs présentent DF-ExpEnse, une méthode d'exploration publiée en juin 2026 sur arXiv (preprint 2606.19656) qui vise à améliorer l'efficacité en termes d'échantillons lors du fine-tuning de politiques de contrôle génératives pré-entraînées. La technique s'appuie sur les capacités de modélisation multimodale de la politique générative, typiquement une politique de diffusion, pour construire un ensemble de candidats d'actions expressif et évaluable efficacement. Un ensemble de critiques (ensemble of critics) sélectionne ensuite l'action qui équilibre la qualité d'exécution avec un fort intérêt exploratoire. En contexte de flotte robotique, DF-ExpEnse intègre un mécanisme de communication inter-agents permettant une exploration collaborative distribuée. Les expériences portent sur des tâches de manipulation et de locomotion, et montrent des gains constants en efficacité d'échantillonnage par rapport au fine-tuning par défaut et à d'autres schémas de sélection d'action. L'efficacité en termes d'échantillons est l'un des verrous principaux du fine-tuning par renforcement de politiques robotiques génératives : chaque interaction avec l'environnement réel est coûteuse, lente et potentiellement dangereuse. En améliorant la qualité des données collectées en ligne, DF-ExpEnse réduit le nombre d'épisodes nécessaires pour atteindre un niveau de performance cible, ce qui représente un gain opérationnel concret dans des contextes industriels. L'aspect flotte est particulièrement pertinent pour des déploiements à l'échelle : l'exploration collaborative entre robots permet d'amortir le coût d'exploration sur un parc entier, plutôt que de le répéter agent par agent. La méthode étant compatible avec les stratégies de fine-tuning RL existantes, son intégration dans des pipelines déjà établis reste relativement directe. Ce travail s'inscrit dans un courant de recherche actif autour du fine-tuning de politiques de diffusion robotiques, domaine structuré ces dernières années par des travaux comme Diffusion Policy (Chi et al., 2023), Pi-0 de Physical Intelligence, ou DPPO. Le passage de l'entraînement offline à l'adaptation online en conditions réelles reste l'un des axes les plus disputés de la robotique apprise, avec des groupes à Stanford, Berkeley, CMU, et des entreprises comme Physical Intelligence ou Figure AI actifs sur des variantes de ce problème. DF-ExpEnse est pour l'heure un preprint non encore évalué par les pairs ; son site projet présente des démonstrations expérimentales, mais aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RechercheActu
1 source
TurboMap : cartographie locale accélérée par GPU pour le SLAM visuel
1906arXiv cs.RO 

TurboMap : cartographie locale accélérée par GPU pour le SLAM visuel

Des chercheurs ont publié sur arXiv (arXiv:2511.02036v4) TurboMap, un backend de cartographie locale accéléré par GPU pour les systèmes de SLAM visuel temps réel. Le principal apport est une refonte architecturale du pipeline de cartographie locale : la recherche de correspondances de points-clés est parallélisée sur GPU, la fusion de points de carte est redessinée pour l'exécution parallèle, l'élagage des keyframes redondantes est optimisé côté CPU, et un solveur de Bundle Adjustment local rapide sur GPU est intégré. Pour limiter les coûts de transfert de données entre CPU et GPU, goulot d'étranglement classique de ces architectures hybrides, les auteurs introduisent un stockage persistant des keyframes directement en mémoire GPU. Sur les benchmarks standards EuRoC et TUM-VI, TurboMap atteint des accélérations moyennes de respectivement 1,3x et 1,6x sur la phase de cartographie locale, sans dégradation de la précision du SLAM. Ces gains sont mesurés sur jeux de données de référence en conditions contrôlées : les performances en environnements industriels non structurés restent à valider. Ces gains de latence ont une portée directe pour les intégrateurs de systèmes autonomes. En SLAM visuel, la cartographie locale doit respecter des contraintes temporelles strictes sous peine de dégrader la qualité de la carte et de provoquer des pertes de tracking, un échec critique pour un robot mobile, un drone ou un véhicule autonome. Une accélération de 1,3 à 1,6x sur cette étape permet soit d'opérer à fréquence plus élevée, soit de relâcher les contraintes matérielles pour réduire le coût embarqué. Le travail démontre surtout que la parallélisation GPU efficace du SLAM n'est pas bloquée par la puissance de calcul brute, mais par la synchronisation des états partagés et les transferts mémoire CPU-GPU : un résultat qui oriente les futurs travaux d'optimisation dans ce domaine. Le SLAM visuel est un champ de recherche mature, dominé par des systèmes comme ORB-SLAM3 (Université de Saragosse) et VINS-Mono (HKUST), sur lesquels TurboMap se greffe comme backend amélioré sans rupture architecturale. D'autres approches concurrentes comme GlORIE-SLAM ou GO-SLAM explorent des pipelines entièrement neuronaux, mais avec un coût computationnel souvent incompatible avec l'embarqué contraint. TurboMap se positionne ainsi comme une solution incrémentale et compatible avec les pipelines existants, ce qui facilite l'adoption. La prochaine étape naturelle serait la validation sur matériel embarqué comme la Jetson AGX d'NVIDIA et une intégration dans ROS 2 pour un déploiement industriel : aucune timeline ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe
1907arXiv cs.RO 

EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe

Des chercheurs présentent EAGG (Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning), un modèle de génération de prises robotiques multi-effecteur publié en prépublication sur arXiv (arXiv:2506.18092). L'architecture représente chaque effecteur terminal via un graphe topologique et un espace de contrôle bas-dimensionnel propre à chaque morphologie, qu'il s'agisse de pinces parallèles classiques ou de mains dextères à plusieurs doigts. Un module backbone figé convertit l'état articulé courant en tokens géométriques réutilisables, qui sont rafraîchis de façon itérative tout au long du processus d'échantillonnage via un mécanisme baptisé iterative geometry injection. Sur le benchmark MultiGripperGrasp, EAGG atteint 56,17 % de taux de succès moyen sur six effecteurs d'entraînement, soit un écart de seulement 1,10 point de pourcentage par rapport à des modèles spécialisés entraînés séparément pour chaque préhenseur. L'injection géométrique itérative réduit par ailleurs la distance médiane de contact de 0,239 cm à 0,189 cm. Le code est disponible en open source sur GitHub. Ce résultat s'attaque à l'un des verrous les plus concrets pour les intégrateurs industriels : la nécessité de réentraîner ou d'affiner un modèle de saisie à chaque changement de préhenseur. L'approche dominante consiste aujourd'hui soit à entraîner un modèle par géométrie d'effecteur (coûteux en données et en compute), soit à encoder l'identité de l'effecteur via un descripteur statique, ce qui dégrade le transfert dès que la topologie ou le couplage d'actionnement diverge significativement. EAGG montre qu'encoder explicitement la structure morphologique dans un générateur partagé, plutôt que de masquer les différences inter-effecteurs, améliore à la fois la performance générale et la transférabilité zero-shot vers des préhenseurs non vus lors de l'entraînement. C'est un argument de poids pour les équipes robotiques cherchant à mutualiser les politiques de saisie sur une flotte multi-effecteurs. Ce travail s'inscrit dans la dynamique plus large de politiques robotiques universelles que poursuivent simultanément Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec Helix, tous confrontés au même défi de transfert inter-morphologie. EAGG se concentre sur le sous-problème de la saisie et propose une solution fondée sur les graphes, là où d'autres approches misent sur des encodages continus ou des plongements latents partagés. Il s'agit pour l'instant d'une contribution académique sans déploiement industriel annoncé ni partenariat applicatif déclaré, et les chiffres de performance sont à lire dans le cadre contrôlé du benchmark MultiGripperGrasp, ce qui laisse ouverte la question du sim-to-real gap en conditions réelles.

RechercheActu
1 source
La mémoire flash comme actif périssable : tarification de l'endurance pour les agents incarnés et ses limites
1908arXiv cs.RO 

La mémoire flash comme actif périssable : tarification de l'endurance pour les agents incarnés et ses limites

Une équipe de chercheurs a publié sur arXiv (référence 2606.18144) une analyse formelle d'un problème souvent ignoré dans les systèmes robotiques embarqués : l'usure irréversible de la mémoire flash. Chaque écriture consomme un cycle programme/effacement (P/E) sur un stock fini, environ 1 000 cycles pour les puces QLC ou eMMC que montent les robots bas de gamme, et 3 000 pour les TLC premium. Les auteurs traitent cette mémoire comme un capital qui se déprécie et introduisent un "prix fantôme d'endurance" noté η, qui permet d'optimiser le placement des données à travers une hiérarchie RAM, NVM embarquée et cloud. Sur des logs de robots réels, ils mesurent un coefficient d'association valeur-écriture χ : positif (~+1,0×10⁻³) pour la manipulation récurrente à long horizon, nul pour les tâches à court horizon, et négatif pour la téléopération non récurrente. Résultat contre-intuitif : quand χ > 0, l'optimum déplace les souvenirs les plus précieux vers le cloud plutôt que vers la flash locale. Ce résultat intéresse directement les intégrateurs et les équipes déployant des agents d'IA embarquée à grande échelle. La contrainte d'endurance n'est pas théorique : elle est dormante sur les TLC haut de gamme mais active sur les eMMC et QLC que la majorité des robots industriels low-cost utilisent aujourd'hui. Formaliser ce coût permet d'optimiser la durée de vie des composants sans sacrifier les performances opérationnelles. Les tests montrent qu'un contrôleur appris "wear-aware" rivalise avec le routage basé sur les prix en valeur de tâche, tout en prolongeant la durée de vie du matériel. L'article établit ainsi une distinction utile : durée de vie du dispositif et performance de la tâche peuvent être découplées, ce qui n'avait pas été formalisé jusqu'ici. La gestion de mémoire persistante est un défi ouvert en robotique, aujourd'hui amplifié par la prolifération des plateformes humanoïdes (Figure AI, 1X, Boston Dynamics Atlas) et des modèles VLA (Vision-Language-Action), qui génèrent des fréquences d'écriture structurellement plus élevées. Ce travail s'inscrit dans les courants Lifelong Learning et SLAM à mémoire persistante. Les auteurs signalent deux limites importantes : la valeur de tâche n'est observable que via un proxy, et l'optimum non-monotone, prouvé formellement, n'a pas encore été observé dans les données expérimentales. Les prochaines étapes naturelles incluent la validation sur des déploiements longue durée et l'intégration du cadre dans les pipelines mémoire des agents VLA, où la question du coût réel de chaque écriture devient critique à l'échelle.

RecherchePaper
1 source
GeneralVLA-2 : reconstruction géométrique et mémoire structurée pour la planification robotique
1909arXiv cs.RO 

GeneralVLA-2 : reconstruction géométrique et mémoire structurée pour la planification robotique

Une équipe de recherche affiliée au groupe AIGeeks a publié le 17 juin 2026 sur arXiv (2506.17480) GeneralVLA-2, une version améliorée de son système généraliste vision-langage-action (VLA) pour la planification de trajectoires robotiques. L'architecture de base, GeneralVLA, convertit des instructions en langage naturel et des observations RGB-D en chemins 3D pour l'effecteur terminal d'un robot. GeneralVLA-2 apporte deux contributions distinctes: GeoFuse-MV3D, une branche de reconstruction 3D multi-vues guidée par des a priori géométriques, qui remplace la reconstruction monoculaire SAM3D sujette aux hallucinations de pose; et une refonte du KnowledgeBank en système de mémoire à long terme avec métadonnées explicites de qualité, confiance, cycle de vie et détection de conflits. Sur le benchmark GSO-30, GeoFuse-MV3D réduit la Chamfer Distance de 2,20 % et le LPIPS de 2,02 % par rapport à la baseline MV-SAM3D, tout en améliorant PSNR et SSIM de respectivement 2,36 % et 1,03 %. Le KnowledgeBank gouverné gagne 4,53 points sur Terminal-Bench SR et 3,73 points sur SWE-Bench Verified par rapport à ReasoningBank, tout en réduisant les erreurs d'assertion (AS) de 4,95 % et 5,65 %. Ces améliorations s'attaquent à deux verrous concrets du pipeline VLA industriel: la qualité des représentations 3D d'objets en manipulation, et la fiabilité de la mémoire épisodique pour la réutilisation d'expériences. La reconstruction 3D monoculaire reste un point de défaillance majeur dans les déploiements réels, car une pose hallucinée en amont se propage directement en erreur de préhension. L'approche multi-vues avec fusion géométrique ciblée (visual-hull, raffinement axial, préservation de l'apparence) adresse ce problème de façon plus contrôlée. Les gains restent cependant modestes sur les métriques reportées, et il convient de noter qu'il s'agit d'un preprint sans peer review, avec des évaluations sur benchmarks laboratoire sans validation sur robot physique dans des conditions industrielles. GeneralVLA-1 avait posé l'interface hiérarchique langage-to-trajectory comme abstraction centrale pour les systèmes généralistes; cette version 2 consolide les fondations plutôt que d'étendre le périmètre. Dans l'espace VLA, les travaux concurrents incluent Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), et OpenVLA (Berkeley), qui ciblent eux aussi le sim-to-real et la généralisation multi-tâche. La publication du code sur GitHub suggère une démarche de recherche ouverte, sans annonce de déploiement industriel ni partenariat opérationnel associé. Les prochaines étapes naturelles seraient une validation sur robot réel et des benchmarks de manipulation comparables à ceux de RoboMimic ou LIBERO.

RechercheOpinion
1 source
WAM-RL : apprentissage par renforcement avec modèle du monde, récompenses de reconstruction et SFT vidéo en ligne
1910arXiv cs.RO 

WAM-RL : apprentissage par renforcement avec modèle du monde, récompenses de reconstruction et SFT vidéo en ligne

Des chercheurs ont publié le 17 juin 2026 sur arXiv (2606.17906) WAM-RL, un cadre d'apprentissage par renforcement conçu pour les modèles World-Action (WA), une classe d'architectures qui couplent un modèle de monde (world model, chargé de prédire les états futurs de l'environnement) avec un modèle d'action (actor, chargé de sélectionner les commandes). L'originalité de WAM-RL tient à l'optimisation conjointe et en ligne de ces deux composants via une méthode d'optimisation hiérarchique, complétée par des récompenses de reconstruction et un fine-tuning supervisé sur vidéos en ligne (online video SFT). L'ensemble des expériences a été conduit en interaction réelle avec l'environnement, sans dépendre uniquement de trajectoires d'expert pré-collectées. Ce travail comble une lacune structurelle des modèles WA actuels : entraînés exclusivement sur des démonstrations, ils ne peuvent pas acquérir de compétences de manipulation fines au-delà de la distribution couverte par ces données, ni s'améliorer en continu par l'expérience. L'insight central mis en évidence par les auteurs est particulièrement net : optimiser uniquement l'actor suffit à progresser sur des tâches à horizon court, mais échoue à produire des gains significatifs sur des tâches à horizon long. C'est la co-évolution du world model et de l'actor qui s'avère déterminante pour les scénarios complexes, ce qui implique que les pipelines de fine-tuning RL qui ignorent le world model introduisent un plafond de performance non trivial dans les applications de manipulation séquentielle. WAM-RL s'inscrit dans une tendance plus large qui vise à dépasser les limites du behavioral cloning dans les robots à apprentissage (VLA, diffusion policies, pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) en intégrant des boucles de feedback online. Les travaux connexes comme DreamerV3 ou TD-MPC2 ont montré la puissance du model-based RL, mais leur application aux modèles WA multimodaux restait inexplorée. Il s'agit, selon les auteurs, de la première introduction du RL dans le paradigme World-Action. Il faut noter que l'article est un preprint non encore évalué par les pairs, que les benchmarks et environnements expérimentaux ne sont pas détaillés dans le résumé, et que la transférabilité vers du matériel réel (sim-to-real gap) reste à démontrer.

RechercheOpinion
1 source
Modélisation de la charge cognitive et physique perçue pour la collaboration homme-robot en construction préfabriquée
1911arXiv cs.RO 

Modélisation de la charge cognitive et physique perçue pour la collaboration homme-robot en construction préfabriquée

Une étude déposée sur arXiv (arXiv:2606.15494) propose un cadre de modélisation empirique de l'évolution de la charge cognitive et physique perçue des opérateurs en contexte de collaboration humain-robot (HRC) dans la construction préfabriquée. Les chercheurs ont conduit une expérience contrôlée de cycles travail-repos répétés, mesurant la charge cognitive via l'échelle RSME (Rating Scale for Mental Effort) et l'effort physique via l'indice de Borg RPE (Rating of Perceived Exertion). Les résultats montrent que l'accumulation de la charge cognitive suit une progression linéaire, tandis que la récupération en phase de repos obéit à une décroissance non linéaire de type exponentielle. Un modèle à effets mixtes a été appliqué pour tenir compte des conditions collaboratives, des effets de session et de la variabilité inter-individuelle significative entre opérateurs. Ces résultats ont une portée directe pour la planification des tâches en HRC industrielle. Les approches de scheduling humain-robot reposent encore souvent sur des hypothèses simplifiées : fatigue constante, récupération uniforme, ou seuils de charge binaires. Disposer d'un modèle empiriquement validé qui distingue la dynamique d'accumulation (linéaire) de celle de récupération (non linéaire) permet de concevoir des algorithmes d'allocation de tâches capables d'anticiper l'état cognitif et physique du travailleur au fil des cycles de production. Pour un intégrateur ou un COO déployant des cobots sur ligne d'assemblage préfabriqué, cela ouvre la voie à des plannings adaptatifs qui réduisent le risque d'erreur humaine et de troubles musculo-squelettiques sans sacrifier la cadence. La construction préfabriquée est un secteur cible croissant pour la robotique collaborative, notamment pour des tâches répétitives de manutention lourde, d'assemblage de panneaux et de fixation. Des équipes universitaires en Asie-Pacifique et en Europe travaillent sur l'automatisation partielle de ce segment, mais la grande majorité des déploiements HRC existants ignorent l'état physiologique du travailleur comme variable de planification en temps réel. Cette étude s'inscrit dans la tendance émergente de la HRC "human-state-aware", où le système robotique adapte sa charge de travail à l'état de l'opérateur. Les modèles proposés constituent une brique méthodologique destinée à alimenter de futurs systèmes de scheduling dynamique, potentiellement couplés à des capteurs physiologiques embarqués ou à des outils de suivi biométrique non intrusifs.

UEDes équipes universitaires européennes sont mentionnées comme actives sur l'automatisation en construction préfabriquée, mais aucun acteur français ou européen spécifique n'est impliqué dans cette étude ; l'impact reste indirect pour les intégrateurs HRC en Europe.

RecherchePaper
1 source
DragMesh-2 : interaction main-objet dextérique physiquement plausible avec des objets articulés
1912arXiv cs.RO 

DragMesh-2 : interaction main-objet dextérique physiquement plausible avec des objets articulés

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.15133v1) DragMesh-2, un framework de manipulation dextre d'objets articulés destiné aux mains multi-doigts. L'objectif est de permettre à un robot de manipuler des objets dont une partie est mobile (tiroir, poignée de porte, levier) sans pouvoir l'actionner directement, le mouvement devant émerger exclusivement du contact physique soutenu entre la main et la surface. Le système introduit PICA (Physically Informed Contact-Aware), un mécanisme d'entraînement qui injecte des signaux physiques dans l'apprentissage de politique sans capteur tactile ni retour de force, simplifiant ainsi l'instrumentation matérielle nécessaire. Évalué sur sept objets issus du dataset GAPartNet, DragMesh-2 a été soumis à plusieurs conditions de damping pour mesurer sa robustesse à la variation de charge de contact, sur lesquelles il surpasse les méthodes comparées. La distinction que DragMesh-2 cherche à établir est précise : la plupart des approches existantes en manipulation articulée s'appuient sur une génération centrée objet (object-centric), où les trajectoires sont calculées à partir de la géométrie de la cible. Rejouer ces trajectoires en boucle ouverte (open-loop) ne modélise pas la dynamique de contact nécessaire pour déplacer effectivement la partie articulée. Le problème devient critique quand la charge de contact varie, ce qui arrive fréquemment en conditions réelles : une porte mal alignée, un tiroir dilaté, un levier à résistance variable. PICA adresse ce point sans capteur additionnel, un avantage concret pour les intégrateurs voulant déployer des mains dextres sur des robots humanoïdes en environnement domestique ou assistif, où l'ajout de capteurs de force reste coûteux et fragile. Ce travail s'inscrit dans une tendance plus large qui cherche à dépasser le préhenseur parallèle (parallel-jaw gripper) pour les tâches de manipulation fine en milieu non structuré. GAPartNet, le benchmark utilisé, répertorie des parties articulées standardisées issues de la robotique domestique et constitue la référence commune de ce sous-domaine. La communauté humanoïde, dont les projets de Figure, Agility Robotics ou 1X Technologies, identifie la manipulation d'objets articulés comme un verrou majeur pour les déploiements en cuisine, atelier ou assistance à la personne. DragMesh-2 publie également une ressource en géométrie pure pour la manipulation dextre main-objet, destinée à alimenter les recherches futures en loco-manipulation. Aucun partenariat industriel ni timeline de déploiement n'est mentionné : c'est une contribution académique, pas un produit expédié.

RecherchePaper
1 source
Les modèles causaux peuvent-ils améliorer la navigation des robots ? Adaptation causale en ligne pour robots réels
1913arXiv cs.RO 

Les modèles causaux peuvent-ils améliorer la navigation des robots ? Adaptation causale en ligne pour robots réels

Des chercheurs présentent dans un article publié sur arXiv (2606.15691) une méthode d'intégration de modèles causaux dans des systèmes de navigation robotique réels, testée sur un robot de service physique en patrouille dans des couloirs. L'approche se décline en deux modes : un module d'évaluation hors ligne qui prédit la "compétence" d'une trajectoire enregistrée et la corrèle aux métriques de navigation quantitatives, et un module d'adaptation en ligne qui intervient dynamiquement lorsque la compétence prédite du comportement par défaut tombe en dessous d'un seuil. Les résultats montrent une corrélation positive entre compétence prédite et efficacité du chemin parcouru, et une corrélation négative avec les irrégularités de trajectoire. L'accord avec les annotations humaines atteint un coefficient kappa de Cohen de 0,88, un niveau considéré comme quasi-parfait dans la littérature. Ce travail s'attaque à un angle mort réel du déploiement de modèles causaux : la plupart des recherches restent en simulation ou en évaluation post-hoc, sans boucle fermée sur un robot physique. Ici, le modèle causal fonctionne comme un superviseur en temps réel capable de détecter et de corriger des comportements sous-optimaux dans des scénarios difficiles, virage serré, évitement d'obstacle, sans modifier le stack de navigation sous-jacent. Le gain est sélectif et honnêtement rapporté : dans les scénarios simples où le comportement par défaut est déjà proche de l'optimal, l'adaptation causale n'apporte pas de bénéfice mesurable, ce qui indique que la méthode est complémentaire plutôt que substitutive. La recherche en causalité appliquée à la robotique mobile reste dominée par les approches en simulation (travaux de Schölkopf, Peters et al.) ou par des architectures d'apprentissage causal intégrées dès l'entraînement. L'originalité ici est de greffer un module causal sur un système de navigation existant sans le modifier, ce qui abaisse la barrière à l'intégration pour les opérateurs de flottes AMR ou de robots de service. Les concurrents directs sur ce créneau incluent les approches d'apprentissage par renforcement adaptatif (comme celles explorées chez Boston Dynamics ou dans les labs de navigation de CMU), mais sans le volet interprétatif que le modèle causal offre. La suite logique serait de tester l'approche sur des flottes multi-robots ou dans des environnements dynamiques plus chargés, et de quantifier le surcoût computationnel en conditions réelles d'exploitation.

RecherchePaper
1 source
Apprentissage de Koopman récursif régularisé par covariance pour systèmes non linéaires à dynamique incertaine et variable
1914arXiv cs.RO 

Apprentissage de Koopman récursif régularisé par covariance pour systèmes non linéaires à dynamique incertaine et variable

Des chercheurs ont publié le 16 juin 2026 sur arXiv (arXiv:2606.15317) un framework d'identification de modèle en ligne baptisé CR-RKL (Covariance-Regulated Recursive Koopman Learning), conçu pour maintenir des performances de contrôle stables sur des robots soumis à des dynamiques changeantes et imprévisibles. La méthode repose sur la théorie de l'opérateur de Koopman, qui transforme un système non linéaire en représentation linéaire via des fonctions de relèvement ("lifting"), permettant d'utiliser des outils d'estimation linéaire classiques. Deux mécanismes complémentaires sont introduits : un filtre de zone morte sur l'erreur de prédiction ("error dead-zone gating"), et une normalisation à trace constante de la matrice de covariance ("constant-trace normalization"). Chacun suffit indépendamment à éviter les deux pathologies numériques connues de l'estimation récursive de Koopman : l'explosion de covariance sous faible excitation avec oubli exponentiel, et le gel des paramètres sans oubli. Le framework a été validé sur deux plateformes : un robot différentiel non-holonome soumis à glissement de roues et friction de type Stribeck, et un micro-véhicule aérien à battement d'ailes inspiré du papillon, pesant 26 grammes. Dans les deux cas, CR-RKL est embarqué dans une boucle de commande prédictive (MPC) et maintient un suivi de trajectoire fiable. L'enjeu industriel de ce travail dépasse la robotique académique : les modèles hors-ligne appris en simulation ou en conditions contrôlées se dégradent dès que les conditions réelles s'écartent de la distribution d'entraînement, problème classique du sim-to-real gap. CR-RKL propose une adaptation en temps réel sans retraining complet, ce qui est directement pertinent pour les intégrateurs de robots mobiles en environnement industriel variable (sols glissants, charge variable, usure mécanique). La capacité à préserver la structure géométrique de l'incertitude via la normalisation à trace constante est un argument fort pour les applications de contrôle certifiable, où la qualité de l'estimation de covariance conditionne la robustesse des garanties MPC. La théorie de Koopman connaît depuis 2018-2020 un regain d'intérêt en robotique comme alternative aux réseaux neuronaux dynamiques (LSTM, Neural ODE), notamment parce qu'elle conserve une structure linéaire exploitable analytiquement. Les approches récursives existantes (RLS-Koopman, EDMD adaptatif) souffrent précisément des instabilités numériques que CR-RKL cible. Sur le segment des micro-aéronefs à battement d'ailes (FWMAV), des groupes comme le Harvard Microrobotics Lab ou l'EPFL travaillent sur des dynamiques similaires, rendant ce benchmark particulièrement significatif. La publication est un preprint ; aucun pilote industriel ni partenariat commercial n'est annoncé à ce stade.

RecherchePaper
1 source
Estimation d'état hybride à ordonnancement intelligent (SSH) par EKF-FGO
1915arXiv cs.RO 

Estimation d'état hybride à ordonnancement intelligent (SSH) par EKF-FGO

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.16057) une étude expérimentale portant sur le rôle de la planification des optimisations dans les systèmes hybrides d'estimation d'état pour la robotique. Le framework présenté, appelé SSH EKF-FGO (Smart-Scheduled Hybrid Extended Kalman Filter - Factor Graph Optimization), combine la propagation d'état par filtre de Kalman étendu (EKF), efficace en temps réel, avec des phases d'optimisation par lots déclenchées périodiquement via un graphe de facteurs (FGO). L'originalité de l'approche ne réside pas dans les composants eux-mêmes, mais dans le traitement explicite du calendrier d'optimisation comme variable de conception indépendante, une dimension généralement absente des analyses de la littérature. Les tests ont été conduits en simulation dans un environnement SLAM planaire, avec une structure de solveur et un effort de calcul maintenus constants pour isoler l'effet du seul scheduling. Les résultats montrent que la fréquence d'invocation de l'optimiseur influence fortement la dérive pré-optimisation, le comportement transitoire de l'erreur et le temps de calcul global. La conclusion centrale est pratique : il existe des régimes de fonctionnement où la majorité des gains de cohérence globale apportés par le FGO peut être conservée en n'activant l'optimiseur qu'à une fraction de sa fréquence maximale, réduisant ainsi substantiellement le coût computationnel. Pour un ingénieur systèmes travaillant sur la localisation embarquée (robot mobile, AGV, drone), cela ouvre une marge de manoeuvre concrète : calibrer le scheduling selon les contraintes de processeur disponible sans sacrifier la précision de trajectoire à long terme. L'estimation d'état hybride EKF/FGO est un champ actif depuis une décennie, structuré par des frameworks comme GTSAM et g2o côté optimisation, et des filtres classiques côté temps réel. Des systèmes comme Google Cartographer ou SLAM Toolbox s'appuient sur des logiques similaires sans nécessairement formaliser le scheduling comme levier. Ce papier, issu d'un contexte académique non affilié à un industriel identifié, positionne le SSH EKF-FGO comme banc d'essai contrôlé plutôt que comme solution prête à déployer. Les suites naturelles seraient une validation en environnement 3D réel et une exploration d'heuristiques de scheduling adaptatif, par exemple déclenchées par seuil d'incertitude plutôt que par horloge fixe.

RecherchePaper
1 source
VL2Spike : distillation de modèles vision-langage vers des réseaux à impulsions pour la perception visuelle basse consommation dans l'IA incarnée
1916arXiv cs.RO 

VL2Spike : distillation de modèles vision-langage vers des réseaux à impulsions pour la perception visuelle basse consommation dans l'IA incarnée

Des chercheurs ont publié sur arXiv (référence 2606.15898) VL2Spike, un cadre de distillation de connaissances qui transfère les représentations multi-modales des grands modèles vision-langage (VLM) vers des réseaux de neurones impulsionnels (SNN), spécifiquement des architectures Spikformer. Les résultats annoncés sur trois jeux de données statiques indiquent un gain de précision de 6,81 points de pourcentage, avec une consommation énergétique réduite à 15,7 % de celle d'un modèle de référence classique. Sur la reconnaissance de lieu par vision (VPR), tâche directement applicable à la navigation robotique, le gain atteint 6,63 %. Deux contributions techniques sont mises en avant : une distillation visuo-temporelle (SVS) qui aligne les représentations spatiales et temporelles du VLM avec les tokens impulsionnels du Spikformer, et une distillation linguistique guidée par prototypes (SPL) qui synchronise les prototypes de classes du SNN avec les embeddings textuels du VLM. L'enjeu de ce travail est réel pour la robotique embarquée. Les SNN sont architecturalement attractifs pour les systèmes edge (drones, robots mobiles, exosquelettes) car leur calcul événementiel consomme peu d'énergie, mais leurs performances en classification restaient structurellement inférieures aux transformers classiques, limitant leur adoption dans des pipelines de perception industriels. VL2Spike propose une voie pour combler cet écart sans sacrifier l'efficacité énergétique. La précision du chiffre "15,7 % de consommation" mérite toutefois d'être relativisée : il s'agit d'une estimation théorique en opérations synaptiques, pas d'une mesure sur silicium réel, ce que les auteurs reconnaissent implicitement en parlant de "modèles contraints en ressources". Les réseaux impulsionnels ont connu un regain d'intérêt depuis 2020 avec l'émergence des Spiking Transformers (SpikFormer, Spikingformer, SDT), notamment portés par des groupes à Pékin Jiaotong University et Zhejiang University. Sur le front des VLM utilisés comme "professeurs" en distillation, les approches s'appuient généralement sur CLIP ou ses variantes. Le positionnement concurrentiel direct de VL2Spike se situe face aux méthodes de quantification et de pruning de transformers classiques, qui visent aussi la contrainte énergétique sans les propriétés biologiquement inspirées des SNN. Les suites naturelles incluent des validations sur hardware neuromorphique (Intel Loihi, SpiNNaker) et des tests intégrés dans des boucles de perception robotique complètes.

RecherchePaper
1 source
SemGeoNav : une approche de navigation visuelle guidée par la sécurité, combinant raisonnement sémantique et planification géométrique
1917arXiv cs.RO 

SemGeoNav : une approche de navigation visuelle guidée par la sécurité, combinant raisonnement sémantique et planification géométrique

Des chercheurs ont proposé SemGeoNav, un framework de navigation visuelle hiérarchique publié sur arXiv en juin 2026 (arXiv:2606.16400), conçu pour les robots devant atteindre des cibles définies par des images dans des environnements ouverts. L'architecture combine deux couches distinctes : un module de raisonnement sémantique de haut niveau issu des modèles apprenants end-to-end, et un planificateur géométrique local responsable de la sécurité immédiate. Un mécanisme de lissage temporel de trajectoire vient compléter l'ensemble pour garantir des déplacements continus et stables. Les expériences ont été menées sur un robot quadrupède Unitree Go2 dans des environnements réels, et les résultats indiquent des taux de succès supérieurs ainsi que des temps de navigation plus courts que deux baselines de référence du domaine, ViNT et NoMaD. L'apport principal de SemGeoNav réside dans le traitement d'une tension structurelle bien documentée en robotique autonome : les modèles end-to-end apprenants, en particulier les architectures de type VLA (Vision-Language-Action), excellent dans la compréhension sémantique de haut niveau mais manquent de contraintes géométriques explicites, ce qui génère des comportements imprévisibles face aux obstacles en environnement non structuré. À l'inverse, les planificateurs géométriques classiques (champ de potentiel, DWA) garantissent la sécurité locale mais peinent à interpréter des cibles visuelles haute dimension. L'approche hybride hiérarchique de SemGeoNav apporte une réponse architecturale à ce problème de fiabilité opérationnelle, avec des implications directes pour les intégrateurs déployant des robots mobiles en entrepôt ou en environnement industriel non balisé. ViNT et NoMaD, tous deux issus du Berkeley AI Research Lab, constituent les références dominantes en navigation visuelle généraliste à cible imageante. SemGeoNav se positionne explicitement contre ces deux modèles en revendiquant de meilleures performances terrain. Il s'inscrit dans un courant plus large qui remet en question les architectures purement end-to-end au profit de systèmes hybrides modulaires, une direction également explorée par plusieurs équipes européennes et asiatiques. Ce preprint ne publie pas de métriques standardisées comme le SPL (Success weighted by Path Length) ou les benchmarks HM3D/MP3D, ce qui rend difficile toute comparaison directe avec l'état de l'art; une validation à plus grande échelle et sur des jeux de données partagés constituerait la prochaine étape crédible pour ce travail.

RecherchePaper
1 source
Récupération robuste après chute pour robots bipèdes à roues sans bras par apprentissage guidé par les forces
1918arXiv cs.RO 

Récupération robuste après chute pour robots bipèdes à roues sans bras par apprentissage guidé par les forces

Des chercheurs présentent FTSR (Force-guided Teacher-student framework with Stage-wise Rewards), une méthode d'apprentissage par renforcement pour la récupération après chute des robots bipèdes à roues sans bras, publiée sur arXiv en juin 2026 (arXiv:2606.14270). En simulation, une force auxiliaire externe corrélée en temps réel à la hauteur du robot est formulée comme contrainte optimisable : l'algorithme d'apprentissage contraint pousse la politique à réduire progressivement sa dépendance à cette force tout en relevant le corps. Une architecture teacher-student distille la connaissance privilégiée des dynamiques de récupération, structurée par des récompenses progressives par seuils de hauteur (height-progressive stage-wise rewards). La politique est ensuite déployée sur un robot bipède à roues sans bras physique, testée dans des conditions variées et difficiles, et transfère également à un humanoïde à nombreux degrés de liberté (high-DOF). Sans bras ni pattes supplémentaires pour générer des forces d'appui, un bipède à roues figure parmi les morphologies robotiques les plus contraintes pour la récupération après chute. FTSR contourne ce verrou en injectant une force auxiliaire virtuelle pendant l'entraînement en simulation, puis en la supprimant graduellement via une contrainte optimisable : le robot développe ainsi des stratégies de redressement internes sans jamais dépendre d'un artefact absent en conditions réelles. La validation sim-to-real sur robot physique, combinée à la généralisation à un humanoïde high-DOF sans sur-adaptation à une cinématique spécifique, renforce la crédibilité pratique de l'approche pour les équipes travaillant sur plusieurs plateformes. C'est précisément ce gap entre démonstration en simulation et déploiement physique robuste que FTSR cherche à combler, avec des résultats qui méritent d'être suivis. Les robots bipèdes à roues occupent une niche croissante entre les AMR classiques et les humanoïdes complets : ils combinent mobilité sur terrain plat et capacité partielle à franchir des obstacles, à un coût mécanique inférieur. Sur le problème précis de la récupération après chute, les travaux existants se concentrent sur les humanoïdes avec bras (Boston Dynamics Atlas) et les quadrupèdes multi-pattes (ANYmal d'ANYbotics, Unitree Go2), laissant peu de littérature sur les morphologies intermédiaires sans membres supérieurs. FTSR reste à ce stade un preprint arXiv sans déploiement industriel annoncé et sans plateforme commerciale nommée ; les suites naturelles seraient une évaluation sous perturbations extérieures actives et une intégration dans une stack de navigation autonome complète.

RecherchePaper
1 source
$\mu_0$ : un modèle du monde 3D évolutif par traces d'interaction
1919arXiv cs.RO 

$\mu_0$ : un modèle du monde 3D évolutif par traces d'interaction

Des chercheurs présentent μ₀ (mu-zéro), un modèle mondial 3D à base de traces d'interaction, publié en préprint sur arXiv (2506.13769) en juin 2025. Plutôt que de reconstruire des pixels denses comme les modèles vidéo, ou d'exiger des étiquettes d'action spécifiques à chaque morphologie robotique, μ₀ prédit des trajectoires 3D lisses pour des points saillants : objets, outils, mains et zones de contact, encodées en points de contrôle B-spline. Le système TraceExtract extrait automatiquement cette supervision depuis des vidéos diversifiées, en sélectionnant des points clés, construisant des traces alignées globalement et associant chaque segment à des légendes linguistiques hiérarchiques. L'architecture couple un backbone vision-langage préentraîné à un expert de traces modulaire. Dans les expériences de laboratoire, μ₀ dépasse les baselines en prédiction de traces 2D et 3D, y compris les approches VLM tokenisées. L'enjeu central est l'interopérabilité cross-embodiment : permettre à une politique robotique d'opérer sur différentes morphologies sans données d'action spécifiques. Les VLA comme π₀ de Physical Intelligence ou GR00T N2 de NVIDIA nécessitent des téléopérations coûteuses pour étiqueter les actions, freinant la scalabilité. μ₀ contourne ce verrou en apprenant une représentation intermédiaire agnostique à l'embodiment, couplable ensuite à des experts d'action légers par morphologie cible. Résultat notable : malgré un préentraînement entièrement sans étiquettes d'action, les politiques trace-conditionnées atteignent des performances compétitives avec π₀, un VLA entraîné avec supervision d'action complète. Si cette généralisation se confirme à l'échelle, des politiques de manipulation pourraient être entraînées massivement sur des vidéos génériques, humaines ou issues de la simulation, sans collecte de données robot-spécifiques. La robotique de manipulation cherche depuis des années à s'affranchir des données proprioceptives labellisées, coûteuses à collecter. Deux approches dominent actuellement : les modèles vidéo pixel-dense comme UniSim ou Genie, et les VLA directs comme OpenVLA, π₀ ou GR00T N2, chacun présentant ses propres limites de scalabilité ou de spécificité. μ₀ propose un troisième espace latent, la trace 3D compacte, entraînable sur des vidéos brutes. Les concurrents les plus proches incluent les travaux de point-tracking tels que TAPIR et CoTracker, ainsi que les modèles d'action en espace latent. Le papier reste un préprint de laboratoire sans déploiement industriel annoncé, et la robustesse en environnement réel non contrôlé reste à démontrer. Les prochaines étapes logiques incluent la validation sur des flottes multi-robots hétérogènes et l'intégration dans des pipelines d'imitation learning à grande échelle.

RechercheOpinion
1 source
SplatlessDF : cartographie continue de champ de distance avec des gaussiennes sans splatting
1920arXiv cs.RO 

SplatlessDF : cartographie continue de champ de distance avec des gaussiennes sans splatting

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.13990) SplatlessDF, un cadre de cartographie par champ de distance continu (DF) qui réutilise les primitives gaussiennes non pas pour le rendu visuel, mais pour la représentation spatiale. Contrairement aux méthodes classiques de Gaussian Splatting (GS) optimisées pour la reconstruction photométrique, SplatlessDF paramètre directement des éléments gaussiens anisotropes dans le domaine spatial afin de produire un champ de distance différentiable. Le système supporte deux modes d'utilisation : une formulation autonome centrée uniquement sur le champ de distance, et une formulation conjointe couplée à la méthode 2D Gaussian Splatting (2DGS), qui combine dans un seul pipeline la modélisation DF et le rendu photométrique. Les expériences rapportées montrent que la formulation autonome fournit des requêtes de distance et de gradient précises et efficaces, tandis que la formulation conjointe améliore simultanément la géométrie de rendu et la qualité du champ de distance. L'intérêt pratique est significatif pour la robotique mobile : un champ de distance continu et différentiable permet de requêter directement les distances aux obstacles et leurs gradients, deux grandeurs fondamentales pour la planification de trajectoire, l'évitement de collision, et le contrôle en boucle fermée. En réorientant les Gaussians vers la représentation spatiale plutôt que photométrique, SplatlessDF suggère que le paradigme GS, jusqu'ici cantonné à la reconstruction 3D et la synthèse d'images, peut alimenter des modules de navigation sans nécessiter de représentations hybrides (grilles d'occupation, TSDF, réseaux implicites). Le cadre unifié GS pour DF et rendu pourrait simplifier les pipelines de cartographie embarquée pour robots industriels et mobiles autonomes. Le Gaussian Splatting a été popularisé par les travaux de Kerbl et al. (2023), et la variante 2DGS cible spécifiquement la reconstruction de surface. SplatlessDF s'inscrit dans un courant croissant qui cherche à étendre ces représentations au-delà de la vision, aux côtés d'autres approches comme les champs de distance neuraux basés sur NeRF (iSDF, NeuralBlox) ou les grilles ESDF classiques (Voxblox, FIESTA). Ce preprint ne mentionne pas de déploiement réel ni de partenariat industriel : il s'agit d'une contribution de recherche avec validation expérimentale en environnement contrôlé, sans timeline commerciale annoncée.

RecherchePaper
1 source
AERMANI-PLACE : placement d'objets guidé par le langage avec des manipulateurs aériens
1921arXiv cs.RO 

AERMANI-PLACE : placement d'objets guidé par le langage avec des manipulateurs aériens

Des chercheurs ont publié AERMANI-PLACE, un cadre logiciel permettant à un manipulateur aérien (drone équipé d'un bras robotique) de positionner des objets à partir d'instructions en langage naturel, sans que l'opérateur n'ait à saisir de coordonnées métriques. Le système fonctionne en deux étapes : une image de la scène combinée à une consigne textuelle est transmise à un modèle de génération d'images, qui produit une version modifiée de la scène avec un marqueur visuel indiquant l'emplacement cible. Ce marqueur est ensuite ancré dans l'espace physique via des observations de profondeur, permettant de récupérer un point de placement en coordonnées métriques, à partir duquel une trajectoire est calculée et exécutée par le drone. Sur un jeu de test de 100 tâches, le système affiche un taux de réussite de 87 % pour l'inférence des positions, et de 72 % lors du transfert sur une plateforme réelle de manipulation aérienne. L'article a été déposé sur arXiv (ref. 2606.14531) en juin 2026. L'intérêt principal de cette approche réside dans l'élimination du fossé d'interface entre l'intention humaine et la commande robot. Jusqu'à présent, les systèmes de manipulation aérienne exigeaient que l'utilisateur raisonne explicitement sur les référentiels de coordonnées et la géométrie de la scène, ce qui freinait l'adoption opérationnelle hors laboratoire. AERMANI-PLACE propose une abstraction en langage naturel, plus proche des usages industriels réels où les opérateurs ne sont pas roboticiens. Le transfert sim-to-real reste partiel (écart de 15 points entre simulation et terrain), ce qui signale que les conditions d'éclairage, d'occultation ou de texture peuvent encore dégrader la robustesse, un point à surveiller avant tout déploiement critique. La manipulation aérienne reste un domaine de recherche émergent, situé à l'intersection des UAV industriels et de la robotique de préhension. Les travaux précédents imposaient des interfaces semi-automatisées ou des pipelines de vision-to-pose classiques nécessitant une calibration fine. Dans l'écosystème concurrent, des équipes comme celles de l'ETH Zurich (ETHZ-ASL) ou de l'Université de Séville travaillent sur des plateformes similaires, mais peu ont intégré un grounding linguistique direct. L'approche d'AERMANI-PLACE, centrée sur un modèle d'édition d'image comme interface sémantique, est transposable à d'autres plateformes mobiles ou fixes. Les prochaines étapes naturelles incluent l'extension aux gestes de pointage combinés au langage, tel que mentionné dans la motivation du papier, ainsi qu'une validation sur des tâches à contraintes de précision plus élevées.

UEImpact indirect : des équipes européennes (ETH Zurich-ASL, Université de Séville) travaillent sur des plateformes concurrentes de manipulation aérienne, situant ce préprint dans un paysage de recherche partiellement européen.

IA physiqueOpinion
1 source
Formage de sensibilité pour la modélisation latente
1922arXiv cs.RO 

Formage de sensibilité pour la modélisation latente

Des chercheurs ont soumis en juin 2026 (arXiv:2606.14585) une méthode de régularisation pour les modèles de dynamique génératifs utilisés en planification robotique. La contribution centrale, baptisée "régularisation de sensibilité au contrôle conditionnée par le support", s'attaque à un angle mort dans les systèmes de détection hors-distribution (OOD) actuels. Le problème identifié : lorsqu'un modèle de dynamique appris est localement insensible à certains choix d'action critiques, une commande non supportée peut produire des prédictions latentes qui ressemblent à des transitions déjà vues à l'entraînement, masquant les signaux OOD malgré des erreurs de prédiction réelles importantes. Les expériences couvrent trois scénarios : l'évitement d'obstacles par vision, la manipulation d'objets, et la navigation sur robot réel en boucle fermée. Ce résultat touche directement le déploiement sûr de robots pilotés par apprentissage dans des environnements non contrôlés. La détection OOD est le filet de sécurité qui permet à un contrôleur de signaler qu'il opère hors de sa distribution de compétence, plutôt que d'extrapoler dangereusement. Les méthodes existantes greffent a posteriori des estimateurs de support sur un modèle de dynamique figé, et échouent précisément dans les zones critiques où le modèle est le moins discriminant sur les actions. La méthode proposée intervient pendant l'entraînement : elle pousse le modèle à répondre de manière sensible aux variations de commande dans les régions à fort support empirique, tout en limitant l'extrapolation instable là où les données manquent. C'est une correction intrinsèque au processus d'apprentissage, pas un ajout post-hoc. Le travail s'inscrit dans le courant des modèles du monde latents pour la robotique, une famille qui inclut des architectures comme RSSM (utilisé dans Dreamer), TDMPC ou les représentations sous-jacentes à des systèmes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La fermeture du "demo-to-reality gap" et la fiabilité en boucle fermée restent des obstacles majeurs pour les intégrateurs cherchant à déployer des robots en milieu industriel non structuré. Les résultats reportés montrent une amélioration de la détection OOD sans dégradation notable de la performance nominale du planificateur, bien que les benchmarks restent limités à des tâches de laboratoire. Une validation sur des plateformes AMR ou humanoïdes en conditions réelles constituerait la prochaine étape naturelle pour crédibiliser l'approche à l'échelle industrielle.

RecherchePaper
1 source
AnyGoal : exploration multi-agents guidée par vision-langage pour une navigation permanente sans entraînement
1923arXiv cs.RO 

AnyGoal : exploration multi-agents guidée par vision-langage pour une navigation permanente sans entraînement

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.13878) AnyGoal, une architecture multi-agents de navigation en intérieur conçue pour fonctionner sans entraînement préalable sur les scènes cibles. Le système coordonne plusieurs robots via une carte partagée appelée Bayesian Value Map (BVM), une grille 2D maintenant pour chaque pixel une distribution gaussienne (μ, σ²) représentant la pertinence estimée de l'objectif. Cette carte est mise à jour par fusion pondérée des scores issus d'un modèle vision-langage (VLM), projetés via un masque conique de profondeur, et n'est jamais remise à zéro entre les sous-tâches, permettant une accumulation d'indices dite « lifelong ». Sur le benchmark GOAT-Bench (360 épisodes, 2 669 sous-tâches, configuration physique stricte : pas discrets de 0,25 m, champ de vision horizontal de 42°, sans téléportation), la version bi-agent atteint 52,4 % de taux de réussite par sous-tâche (Subtask SR) pour un SPL de 12,7 %, contre 41,9 % en configuration mono-agent. Ce résultat représente un gain de +27,5 points de pourcentage sur Modular GOAT (24,9 %), le système modulaire de référence précédent, ce qui est substantiel dans un domaine où les progrès se mesurent souvent en quelques points. L'intérêt principal réside dans l'approche sans entraînement : là où la plupart des politiques de navigation end-to-end se dégradent dès qu'elles rencontrent des scènes, des catégories d'objets ou des modalités d'objectif hors distribution, AnyGoal s'appuie sur la généralisation intrinsèque du VLM. L'ablation à quatre variables de perception révèle que l'intégration de détecteurs open-vocabulary déplace le goulot d'étranglement : la cause principale d'échec n'est plus l'exploration, mais la vérification de l'objectif, un déplacement de problème qui oriente clairement les futurs travaux. AnyGoal s'inscrit dans la lignée des travaux tentant de remplacer les pipelines fermés (détection à ensemble d'objets fixe, comme dans Modular GOAT) et les mémoires 3D denses (comme 3D-Mem, coûteuses à maintenir et sensibles au point de vue) par des représentations légères pilotées par le langage. La coordination multi-agents repose ici sur un allocateur glouton avec pénalité de séparation spatiale et hysteresis d'engagement, sans contrôleur centralisé, ce qui simplifie le déploiement. L'architecture reste à ce stade une contribution de recherche publiée sur preprint ; aucun pilote industriel ni déploiement réel n'est annoncé. Les prochaines étapes naturelles concernent la robustesse du VLM à la vérification de but et l'extension à des environnements semi-structurés ou extérieurs, où la généralisation sera encore plus mise à l'épreuve.

RecherchePaper
1 source
Un modèle basé sur l'attention pour la prévision robuste face aux modalités manquantes
1924arXiv cs.RO 

Un modèle basé sur l'attention pour la prévision robuste face aux modalités manquantes

Des chercheurs ont publié le 18 juin 2026 sur arXiv (arXiv:2606.13970) un modèle d'apprentissage multimodal conçu pour fonctionner en présence de données sensorielles incomplètes, une contrainte courante dans les systèmes robotiques réels. L'architecture combine un autoencodeur variationnel conditionnel (CVAE) et un réseau de transformers exploitant des mécanismes d'attention pour produire une représentation vectorielle de dimension fixe, même lorsqu'une ou plusieurs modalités sont absentes, aussi bien en phase d'entraînement qu'à l'inférence. Le modèle a été évalué sur cinq jeux de données multimodaux couvrant deux tâches distinctes : la prédiction de trajectoires humaines et la prévision de manipulations robotiques. Sur l'ensemble de ces benchmarks, il surpasse les approches de fusion multimodale précédemment publiées, selon les métriques rapportées par les auteurs. Ce travail s'attaque à un verrou réel du déploiement robotique : les modèles multimodaux existants supposent quasi-universellement que toutes les modalités (vision, profondeur, proprioception, LiDAR, etc.) sont disponibles simultanément, une hypothèse rarement vérifiée en production. Une caméra obstruée, un capteur de force défaillant ou une latence réseau suffit à faire chuter les performances d'un pipeline classique. En formulant le problème comme un apprentissage conditionnel plutôt qu'une fusion rigide, les auteurs permettent au modèle d'approximer une représentation robuste à partir de l'information partielle disponible, ce qui ouvre la voie à des architectures tolérantes aux pannes sans recourir à des modules de gestion d'exception ad hoc. Pour un intégrateur ou un COO industriel, c'est la promesse de systèmes plus résilients face aux aléas terrain, à condition que les gains en conditions réelles confirment les résultats sur benchmarks. Le problème de la modalité manquante est connu en apprentissage automatique depuis les travaux sur les données tabulaires incomplètes, mais son traitement dans le contexte des robots physiques est resté marginal, la majorité des efforts récents se concentrant sur les architectures VLA (Vision-Language-Action) comme Pi-0 ou GR00T N2, qui présupposent des flux visuels stables. Ce papier s'inscrit dans un courant de recherche plus discret mais potentiellement structurant, aux côtés de travaux sur la robustesse sensorielle et le sim-to-real transfer. L'article est un preprint arXiv non encore évalué par les pairs, et les benchmarks retenus (trajectoires humaines, manipulation) ne couvrent pas des scénarios industriels complexes comme la navigation en entrepôt ou l'assemblage multi-bras. Les prochaines étapes naturelles seraient une validation sur des plateformes physiques réelles et une comparaison avec des approches de type dropout multimodal ou récents travaux sur l'imputation par diffusion.

RecherchePaper
1 source
Apprentissage de réseaux d'oscillateurs visuellement interprétables pour robots souples continus à partir de vidéos
1925arXiv cs.RO 

Apprentissage de réseaux d'oscillateurs visuellement interprétables pour robots souples continus à partir de vidéos

Des chercheurs présentent sur arXiv (arXiv:2511.18322) une méthode entièrement data-driven pour apprendre la dynamique des robots souples continus (soft continuum robots, SCR) depuis la vidéo, sans connaissance a priori du système mécanique. Deux contributions structurent le travail : l'Attention Broadcast Decoder (ABCD), un module enfichable pour auto-encodeurs qui génère des cartes d'attention pixel-précises localisant la contribution de chaque dimension latente tout en filtrant les arrière-plans statiques ; et les Visual Oscillator Networks (VONs), un réseau d'oscillateurs 2D couplé à ces cartes permettant de visualiser directement sur l'image les masses apprises, la rigidité de couplage et les forces. Sur un robot à deux segments, ABCD réduit l'erreur de prédiction multi-pas de 5,8 fois pour les opérateurs de Koopman et de 3,5 fois pour les réseaux d'oscillateurs par rapport aux baselines sans ce module. Les VONs, laissés libres de s'organiser, font émerger de façon autonome une structure en chaîne d'oscillateurs, cohérente avec la topologie physique de l'objet. L'enjeu n'est pas la performance brute mais l'interprétabilité mécanique, un verrou structurel pour le déploiement de modèles deep learning en robotique de précision. Les approches existantes imposent un choix binaire : modèle basé sur la physique, fidèle mais exigeant une conception manuelle et une connaissance a priori des matériaux ; ou modèle purement data-driven, flexible mais opaque. ABCD associé aux VONs rompt ce dilemme en produisant des représentations latentes spatialement ancrées, lisibles par un ingénieur et potentiellement exploitables pour la synthèse de lois de commande. Pour les intégrateurs actifs sur la manipulation douce (chirurgie assistée, assemblage de composants fragiles), disposer d'un modèle dynamique compact et vérifiable sans calibration physique représente un gain opérationnel concret. Les SCR posent un problème de modélisation structurellement difficile : degrés de liberté théoriquement infinis, non-linéarités prononcées des matériaux (silicone, élastomères), et vision souvent seul capteur praticable en environnement non contrôlé. Les travaux antérieurs misaient principalement sur les opérateurs de Koopman pour linéariser la dynamique dans un espace latent, ou sur des réseaux récurrents sans garantie d'interprétabilité. Aucun acteur français ou européen n'est associé à cette publication, mais des équipes comme INRIA Defrost ou Pollen Robotics travaillent sur des problématiques adjacentes en robotique souple. Les auteurs mentionnent explicitement l'intégration en boucle de commande comme prochaine étape, sans annoncer de déploiement ni de timeline industrielle : il s'agit à ce stade d'un résultat de recherche validé en laboratoire, pas d'un produit expédié.

RecherchePaper
1 source
MaskWAM : unification du masquage guidé et de la prédiction pour les modèles monde-action
1926arXiv cs.RO 

MaskWAM : unification du masquage guidé et de la prédiction pour les modèles monde-action

Une équipe de chercheurs a soumis sur arXiv (référence 2606.13515) un modèle baptisé MaskWAM, visant à lever deux verrous structurels des World Action Models (WAMs) pour le contrôle robotique par prédiction vidéo. Les WAMs constituent une approche active : au lieu d'apprendre directement une politique motrice, le modèle prédit des frames vidéo futures conditionnées par les actions du robot et extrait la politique de cette représentation. Le problème identifié est double. Les entrées textuelles génèrent une ambiguïté référentielle dans les scènes encombrées : si deux objets similaires cohabitent dans le champ de la caméra, le texte ne suffit pas à désambiguïser la cible. Par ailleurs, les prédictions RGB brutes manquent d'ancrage sémantique et restent perturbées par des arrière-plans sans lien avec la tâche. MaskWAM intègre des masques de segmentation à la fois comme entrées explicites (premier frame annoté avec la cible) et comme sorties prédites, au sein d'une architecture unifiée Mixture of Transformers (MoT). L'apport central est l'introduction d'une supervision sémantique centrée sur l'objet : en forçant le modèle à prédire les masques futurs en parallèle des frames RGB, les auteurs réduisent l'influence du bruit visuel de fond sur la politique apprise. Évalué sur les benchmarks LIBERO et RoboTwin, ainsi que sur des tâches réelles non précisées en détail, MaskWAM surpasse significativement les baselines existantes en conditions de langage clair comme ambigu. Pour les équipes R&D en manipulation robotique, l'enjeu concret est la robustesse des politiques face aux variations de décor et aux instructions imprécises, deux points de friction récurrents dans le transfert du labo vers la ligne de production. Ces résultats restent toutefois ceux d'une prépublication académique sur benchmarks standardisés : aucun déploiement industriel n'est mentionné, et les conditions exactes des expérimentations réelles ne sont pas détaillées dans le résumé disponible. MaskWAM s'inscrit dans la dynamique des Visual Language Action models et des WAMs apparus depuis 2023, notamment Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa spécificité est l'exploitation systématique des masques de segmentation comme signal de supervision, là où la plupart des approches concurrentes restent ancrées sur du texte libre ou des images de référence non structurées. Les prochaines étapes prévisibles pour ce type de travaux sont l'évaluation sur des manipulations multi-objets en environnement non contrôlé et l'intégration dans des fondations robotiques plus larges. Aucun partenariat industriel ni calendrier de transfert applicatif ne sont mentionnés à ce stade.

IA physiqueOpinion
1 source
Contrôle PI basé sur Lyapunov pour le suivi robuste de trajectoire d'un robot à quatre roues indépendantes : conception et validation expérimentale
1927arXiv cs.RO 

Contrôle PI basé sur Lyapunov pour le suivi robuste de trajectoire d'un robot à quatre roues indépendantes : conception et validation expérimentale

Des chercheurs ont publié sur arXiv (référence 2602.15424v2) une loi de commande de type PI synthétisée par méthode de Lyapunov pour le suivi robuste de trajectoire d'un robot mobile à quatre roues indépendamment motorisées et directrices (4WID-4WIS, pour four-wheel independently driven and steered). Le modèle mathématique du robot est structurellement vérifié, ce qui permet une conception systématique avec des garanties formelles de stabilité, adaptées à l'implémentation temps réel. La loi de commande combine une structure PI classique avec une compensation anticipatrice fondée sur le modèle (feedforward model-based). Elle a été validée expérimentalement sur une plateforme 4WID-4WIS physique dans des conditions d'opération horizontales et verticales, et comparée à un régulateur PI standard ainsi qu'à un contrôleur en mode glissant (SMC, sliding-mode controller). L'apport principal de ces travaux est la combinaison de garanties formelles de stabilité et d'une architecture légère, déployable sur des microcontrôleurs embarqués standard. L'analyse de stabilité pratique augmentée fournit des bornes explicites sur les dynamiques d'erreur de vitesse et d'erreur intégrale, ce qui permet à un intégrateur de dimensionner les marges opérationnelles sans simulation extensive. La loi de commande proposée surpasse le PI classique et l'approche par mode glissant en robustesse face aux dynamiques résiduelles dépendantes de la configuration et aux effets non modélisés. Pour un industriel ou un intégrateur de robots mobiles autonomes (AMR), cela signifie un contrôleur implémentable sur matériel embarqué standard, avec des garanties prouvables et sans la complexité d'ajustement propre au mode glissant. Les robots 4WID-4WIS offrent une maniabilité omnidirectionnelle que les architectures différentielles ou Ackermann n'atteignent pas, mais leur dynamique couplée complique la synthèse de régulateurs performants et stables. Ces travaux s'inscrivent dans un courant visant à rendre rigoureusement prouvables des lois de commande déjà utilisées empiriquement en industrie. Côté positionnement concurrentiel, les contrôleurs en mode glissant garantissent une robustesse comparable mais souffrent du chattering et d'un réglage plus délicat; les approches MPC (Model Predictive Control) offrent une optimalité supérieure au prix d'une charge de calcul souvent incompatible avec les plateformes embarquées légères. Aucun partenaire industriel ni déploiement commercial n'est annoncé dans cette publication purement académique, dont la suite logique serait une validation sur des cycles opérationnels réels en environnement logistique ou de service.

RecherchePaper
1 source
Repenser la régularisation pour un lissage efficace des politiques
1928arXiv cs.RO 

Repenser la régularisation pour un lissage efficace des politiques

Un article soumis sur arXiv (référence 2606.13169) propose une refonte de la régularisation pour le lissage des politiques en apprentissage par renforcement (RL). L'approche cible la continuité de Lipschitz des fonctions de politique : idéalement globale, bornant la variation du comportement sur l'ensemble de l'espace d'états, mais réduite en pratique à une version locale en raison d'un compromis inévitable entre lissage et expressivité du réseau. Les auteurs identifient trois défauts précis dans l'implémentation originale, proposent un correctif pour chacun, et valident la méthode sur plusieurs tâches de contrôle et algorithmes de RL distincts. L'évaluation culminante porte sur un robot quadrupède en transfert sim-to-real, où la politique lissée démontre une robustesse accrue face aux changements brusques de commande de vitesse cible. L'enjeu est concret pour quiconque déploie des robots en environnement opérationnel : les politiques apprises en simulation produisent fréquemment des commandes articulaires saccadées qui, appliquées sur hardware, usent les actionneurs, génèrent des oscillations mécaniques, ou provoquent des chutes au moindre changement de consigne. Le lissage par régularisation Lipschitz constitue une solution théoriquement fondée, mais le fossé entre la formulation mathématique et son implémentation dans des réseaux de neurones profonds a jusqu'ici limité son impact pratique. Ce travail démontre que corriger trois erreurs d'implémentation précises suffit à franchir ce fossé, en obtenant un contrôle à la fois plus fluide et plus performant sans sacrifier la capacité du modèle à représenter des comportements complexes. La régularisation Lipschitz appliquée au RL locomoteur s'inscrit dans une lignée de travaux cherchant à combler le sim-to-real gap sans s'appuyer exclusivement sur la randomisation de domaine. Les approches concurrentes incluent la normalisation spectrale (Miyato et al.), les architectures ICNN (input-convex neural networks), ou encore les curricula de friction utilisés par ETH Zurich sur la plateforme ANYmal. La contribution reste ici méthodologique : les auteurs ne précisent ni le nom ni les spécifications exactes du quadrupède testé, ce qui rend difficile l'évaluation de la portée industrielle immédiate. La prochaine étape naturelle serait d'étendre ce cadre aux architectures de type VLA (vision-language-action), où le lissage des sorties moteur devient critique à mesure que la complexité perceptuelle augmente.

RecherchePaper
1 source
Perception sémantique active
1929arXiv cs.RO 

Perception sémantique active

Des chercheurs ont publié sur arXiv (2510.05430v2) une méthode de perception sémantique active permettant à un robot mobile d'explorer un environnement intérieur en raisonnant sur les zones qu'il n'a pas encore observées. Le système construit un graphe de scène multi-couches et compact, structurant l'environnement à plusieurs niveaux d'abstraction : pièces, objets, murs, fenêtres, avec leur géométrie fine. En s'appuyant sur un grand modèle de langage (LLM), le pipeline génère des graphes de scène plausibles pour les régions inexplorées, en maintenant la cohérence avec les observations partielles déjà accumulées. L'approche calcule ensuite le gain d'information attendu à chaque point de passage candidat, afin de guider la trajectoire d'exploration. Les expériences ont été menées à la fois en simulation sur des appartements 3D réalistes et sur un robot quadrupède Unitree Go 2 en conditions réelles. L'intérêt principal de cette approche réside dans la capacité à exploiter des connaissances sémantiques commonsense pour anticiper la topologie d'une scène non encore visitée. Plutôt que de se limiter à une cartographie géométrique réactive, le robot raisonne sur la probabilité qu'une porte donne sur une cuisine plutôt qu'une chambre selon le contexte observé, un type de raisonnement spatial jusqu'ici difficile à formaliser en robotique mobile. Pour les intégrateurs d'AMR (autonomous mobile robots) et les équipes R&D en navigation intérieure, cette architecture ouvre la voie à des explorations plus efficaces dans des environnements inconnus, avec moins de déplacements redondants. Les résultats quantitatifs montrent une localisation plus rapide et plus précise des informations sémantiques hautes et basses résolutions par rapport aux méthodes existantes, bien que les benchmarks retenus méritent une lecture critique puisqu'ils restent essentiellement contrôlés par les auteurs. Ce travail s'inscrit dans un courant actif combinant graphes de scène hiérarchiques et LLMs pour la navigation sémantique, aux côtés de travaux comme SayPlan (Rana et al.) ou SceneGraph-Nav. Le Unitree Go 2, robot quadrupède à faible coût devenu plateforme standard pour la recherche en mobilité intérieure, sert ici de démonstrateur physique. Les acteurs concurrents incluent les approches par représentations neurales implicites (NeRF sémantiques) et les méthodes de frontier-based exploration enrichies par vision-langage. Le code n'est pas encore publié à la date de soumission, et aucun partenariat industriel ni calendrier de transfert n'est mentionné dans le papier.

RecherchePaper
1 source
Vers une préhension séquentielle fiable d'objets en environnement encombré : solution finaliste du RGMC 2025
1930arXiv cs.RO 

Vers une préhension séquentielle fiable d'objets en environnement encombré : solution finaliste du RGMC 2025

Une équipe de chercheurs a présenté à l'ICRA 2025, la principale conférence mondiale en robotique, un système de préhension séquentielle en environnement encombré, décrochant la deuxième place dans la piste "Pick-in-Clutter" de la 10e édition du Robotic Grasping and Manipulation Competition (RGMC 2025). Le système s'évalue sur le Cluttered Environment Picking Benchmark (CEPB), un protocole standardisé conçu pour des scénarios de ramassage séquentiel d'objets hétérogènes entremêlés. La solution combine une pince multifonctionnelle sur mesure, un module de reconnaissance d'objets, des stratégies de désencombrement actif et une approche de préhension multimodale capable de traiter à la fois des pièces rigides et des objets déformables. L'architecture produit une représentation explicite de la distribution spatiale des objets et de leurs relations d'occlusion, permettant au robot de planifier l'ordre de saisie le plus efficace tout en évitant les collisions. Ce résultat est significatif pour les intégrateurs industriels parce qu'il adresse un verrou applicatif précis : non plus saisir un objet isolé avec un taux de succès élevé, mais rechercher et extraire séquentiellement des cibles dans un tas désordonné, cas d'usage courant en picking e-commerce, en tri logistique ou en désassemblage. La gestion des objets déformables (sachets, textiles, pièces souples) reste un différenciateur rare : la plupart des systèmes commerciaux contournent ce cas. Les auteurs distinguent explicitement les "taux de succès élevés sur la saisie unitaire" déjà atteints dans la littérature des "solutions matures pour le tri séquentiel", un écart que ce travail cherche à combler. La validation en conditions de compétition sous contrainte temps, avec des objets non sélectionnés par l'équipe, renforce la crédibilité par rapport aux démonstrations en conditions contrôlées. Le RGMC est organisé annuellement depuis 2011 en marge de l'ICRA et constitue l'une des références de benchmark en manipulation robotique. Sur ce segment, les concurrents directs incluent des systèmes basés sur des grippers adaptatifs (Robotiq, OnRobot) et des solutions de bin-picking comme celles de Photoneo, Mech-Mind ou Roboception, souvent couplées à des pipelines de vision 3D. Aucun acteur européen n'est mentionné dans ce travail. L'article, déposé sur arXiv sous l'identifiant 2606.12954, ne précise pas l'affiliation institutionnelle de l'équipe ni de feuille de route vers une commercialisation. Les prochaines étapes naturelles seraient la mise en open source du benchmark CEPB et une validation sur un spectre plus large d'objets industriels réels.

RecherchePaper
1 source
Arbres de fibration : une approche unifiée pour la planification de mouvement multi-robots
1931arXiv cs.RO 

Arbres de fibration : une approche unifiée pour la planification de mouvement multi-robots

Une équipe de chercheurs a publié le 11 juin 2026 sur arXiv (2606.12070) un framework mathématique baptisé "fibration trees" visant à unifier les méthodes de planification de mouvement pour des équipes de robots multiples. Le système repose sur une structure en arbre où chaque noeud représente un espace d'états et chaque arête une fibration, c'est-à-dire une projection d'un espace de haute dimension vers un espace simplifié de dimension inférieure. Sur cette base formelle, les chercheurs ont développé un planificateur d'échantillonnage appelé Fibration-RRT (Rapidly-Exploring Random Fibration Trees), validé sur 32 scénarios impliquant des équipes de robots atteignant jusqu'à 96 degrés de liberté (DOF). L'implémentation est publiée en open source, et le planificateur est prouvé probabilistiquement complet. L'enjeu est la fameuse "malédiction de la dimensionnalité" : dès que l'on coordonne plusieurs robots, l'espace de configuration combiné explose exponentiellement, rendant la planification classique intractable. Les approches existantes répondaient à ce problème soit par la priorisation séquentielle (planifier les robots un par un), soit par la décomposition parallèle (sous-espaces indépendants), soit par des projections dans l'espace des tâches, mais sans framework commun capable de combiner ces stratégies. Fibration-RRT généralise à la fois le quotient-space RRT et le discrete RRT sous un formalisme unique, ce qui permet en théorie à un intégrateur de définir sa propre structure d'arbre selon la topologie du problème plutôt que de choisir entre des outils incompatibles. La robustesse sur 96 DOF est un signal technique solide, même si l'article ne fournit pas de comparaison de temps de cycle sur des benchmarks standardisés industrie. La planification de mouvement multi-robot est un domaine mature sur le plan académique, porté depuis la fin des années 1990 par les algorithmes RRT de Steven LaValle et leurs variantes (RRT*, BiRRT, quotient-space RRT de Orthey et al.). Le besoin d'unification se fait sentir à mesure que les déploiements AMR (autonomous mobile robots) et les cellules robotisées industrielles complexifient les interdépendances entre agents. Aucun acteur industriel n'est mentionné dans ce préprint, qui reste pour l'instant une contribution théorique. Les prochaines étapes naturelles seraient une validation sur des plateformes physiques et une intégration dans des middlewares standards comme ROS 2 MoveIt, qui constitue aujourd'hui la référence dans les projets d'intégration multi-bras.

RecherchePaper
1 source
Capteur tactile déformable en main avec détection intégrée du glissement, de la vitesse, force/couple et carte de pression
1932arXiv cs.RO 

Capteur tactile déformable en main avec détection intégrée du glissement, de la vitesse, force/couple et carte de pression

Une équipe de chercheurs présente sur arXiv (preprint 2606.11952, juin 2026) un capteur tactile compact pour la manipulation en main, capable d'intégrer simultanément trois modalités : mesure de vitesse de glissement, force/couple et cartographie de pression, dans un seul dispositif à surface de contact déformable. Le capteur fonctionne sur des géométries planes et courbées pour une large gamme de matériaux. Sa fabrication combine des circuits imprimés standard (PCB) et du prototypage rapide, visant un coût de production bas. Réunir détection de glissement (slip-aware), force/couple et carte de pression dans une seule structure compliante simplifie l'intégration pour les grippers industriels et les mains humanoïdes, qui recourent aujourd'hui à plusieurs capteurs distincts. Cette consolidation réduit la complexité mécanique, les points de défaillance et le câblage embarqué, trois obstacles courants à la commercialisation des robots manipulateurs. Les auteurs affirment être les premiers à combiner ces modalités dans une structure unique ; cette revendication de priorité, portée par un preprint non encore relu par les pairs, reste à confirmer. Le champ des capteurs tactiles souples est animé depuis une décennie par des travaux comme GelSight (MIT), DIGIT (Meta AI Research) et les solutions commerciales de Xela Robotics ou Touchlab. La détection de glissement reste un défi ouvert, directement lié à la fiabilité des saisies en manipulation dynamique. Ce preprint ne documente pas encore d'intégration sur un robot réel ni de tests en conditions industrielles. Les prochaines étapes naturelles seraient une validation sur gripper ou main humanoïde, suivie d'une soumission en conférence robotique (ICRA, IROS ou RSS).

RecherchePaper
1 source
Reconnaissance sémantique des activités de plongeurs pour une collaboration sous-marine humain-robot efficace
1933arXiv cs.RO 

Reconnaissance sémantique des activités de plongeurs pour une collaboration sous-marine humain-robot efficace

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.12374v1) DAR-Net, un framework basé sur des transformers conçu pour reconnaître automatiquement les activités de plongeurs en milieu sous-marin. Le système classifie six catégories d'activités distinctes à partir de séquences vidéo, en combinant un raisonnement temporel global avec une supervision sémantique au niveau pixel. Pour entraîner et évaluer ce modèle, les auteurs ont constitué le premier jeu de données dédié à cette tâche : l'Underwater Diver Activity (UDA) dataset, qui comprend plus de 2 600 images annotées avec des masques de segmentation pixel-level. Les expériences sont réalisées en environnement contrôlé, et DAR-Net surpasse les modèles de référence actuels sur ce benchmark maison. Aucun déploiement opérationnel n'est rapporté à ce stade. L'enjeu industriel est réel : les véhicules sous-marins autonomes (AUV) sont de plus en plus utilisés pour assister les plongeurs dans des opérations à risque élevé, de l'inspection d'infrastructures offshore à la maintenance de câbles sous-marins. Pour qu'un AUV soit un véritable coéquipier et non un simple observateur, il doit interpréter les gestes et postures d'un humain en temps réel, dans des conditions de faible visibilité et de bruit visuel important. L'approche multi-loss de DAR-Net, qui couple la reconnaissance d'activité globale à la compréhension locale des interactions humain-robot via des contraintes de segmentation sémantique, adresse précisément ce gap. C'est une piste prometteuse, mais les validations restent en bassin contrôlé, loin des conditions réelles d'une inspection sous-marine à 30 mètres de profondeur avec turbidité variable. La reconnaissance d'activité humaine sous-marine est un domaine de niche mais en croissance, porté par l'essor des AUV commerciaux de sociétés comme Saab (BlueZone), Kongsberg, ou l'Ifremer en France. L'absence historique de datasets annotés a freiné les approches deep learning dans ce secteur, là où la robotique terrestre bénéficie de corpus massifs. La contribution principale de ce travail est précisément cette ressource de données fondatrice. Les auteurs positionnent explicitement DAR-Net comme une première brique, destinée à servir de baseline pour des travaux futurs sur la collaboration humain-robot en milieu subaquatique. Des extensions vers des environnements non contrôlés et des AUV réels constitueront le vrai test de généralisation du modèle.

UELe dataset UDA et le framework DAR-Net constituent une ressource de référence pour les acteurs européens de l'inspection sous-marine autonome (Ifremer, Kongsberg, Saab BlueZone), mais la validation en conditions réelles reste à démontrer.

RecherchePaper
1 source
Optimisation par consensus (CBO) : vers une optimalité globale en robotique
1934arXiv cs.RO 

Optimisation par consensus (CBO) : vers une optimalité globale en robotique

Une équipe de chercheurs a publié sur arXiv (référence 2602.06868v2) une adaptation de l'optimisation par consensus, CBO, pour Consensus-Based Optimization, aux problèmes de trajectoires et de politiques de contrôle en robotique. Contrairement aux méthodes zéro-ordre dominantes dans le domaine, notamment MPPI (Model Predictive Path Integral), CEM (Cross-Entropy Method) et CMA-ES (Covariance Matrix Adaptation Evolution Strategy), le CBO dispose d'une garantie formelle de convergence vers un optimum global sous des hypothèses dites légères. Les auteurs l'ont évalué sur trois scénarios représentatifs : un problème à horizon long pour un système simple, un problème d'équilibre dynamique pour un système fortement sous-actionné, et un problème à haute dimension avec uniquement un coût terminal. Sur ces trois configurations, CBO obtient des coûts inférieurs à ceux des méthodes existantes. L'enjeu est significatif pour l'ingénierie robotique avancée. Les méthodes zéro-ordre actuelles sont prisées précisément parce qu'elles évitent le calcul de gradients analytiques, coûteux ou impossibles en présence de contacts discontinus. Mais leur défaut structurel est d'estimer ce gradient localement, les rendant vulnérables aux optima locaux dès que le paysage de coût est non convexe. Ce phénomène se manifeste concrètement pour les robots à pattes, les manipulateurs en espaces encombrés, ou tout système à dynamiques hybrides. Un optimiseur offrant une garantie d'optimalité globale pourrait renforcer la robustesse des planificateurs de trajectoires, en particulier dans les boucles MPC (Model Predictive Control) embarquées. Il faut cependant noter que les résultats présentés sont exclusivement issus de simulations : aucune validation sur matériel réel n'est rapportée dans cette version de l'article. Le CBO est issu de la littérature mathématique sur les systèmes de particules en interaction, développé initialement pour l'optimisation en finance et en apprentissage automatique. Son introduction en robotique s'inscrit dans une tendance plus large : après que MPPI a prouvé sa viabilité sur plateformes réelles, notamment en manipulation chez Google DeepMind et en locomotion chez ANYbotics, la communauté cherche des variantes offrant de meilleures garanties de convergence. Les prochaines étapes naturelles concernent l'intégration dans des frameworks MPC temps-réel et la validation sur hardware, conditionnée à la compatibilité des temps de calcul du CBO avec les fréquences de contrôle embarquées, typiquement supérieures à 100 Hz sur les systèmes à pattes.

RecherchePaper
1 source
HiPi : des capteurs piézorésistifs haute fidélité et reproductibles pour la manipulation robotique
1935arXiv cs.RO 

HiPi : des capteurs piézorésistifs haute fidélité et reproductibles pour la manipulation robotique

Une équipe de recherche a publié en juin 2026 sur arXiv (arXiv:2606.11372) HiPi, un système de capteurs tactiles piézorésistifs conçu pour la manipulation robotique. Le dispositif atteint une fréquence d'acquisition de 220 Hz dans une configuration bimanuelles comprenant quatre matrices tactiles denses, soit 2 048 taxels au total. La carte de lecture est compatible avec les services de fabrication et d'assemblage PCB commerciaux, ce qui supprime le soudage manuel, point de friction majeur dans les déploiements laboratoire. Le microcontrôleur retenu est un module STM32 compact et peu coûteux, et les couches conductrices reposent sur des PCB flexibles (FPCB) qui simplifient la fabrication et l'empilement des capteurs. Dans des expériences avec des motifs de contact structurés imprimés en 3D, HiPi améliore l'IoU moyen de 0,428 à 0,797 et le score Dice moyen de 0,539 à 0,886 par rapport à une baseline reproductible de référence. Ces résultats pointent vers un verrou concret dans la robotique dextère: les capteurs tactiles piézorésistifs sont minces, légers et théoriquement scalables, mais les systèmes existants forçaient jusqu'ici un arbitrage entre facilité de reproduction et fidélité de lecture. Un capteur facile à fabriquer livrait des images de contact dégradées; un capteur haute fidélité restait difficile à assembler hors d'un environnement spécialisé. HiPi prétend lever cet arbitrage en standardisant l'ensemble de la pile matérielle autour de composants accessibles. Pour un intégrateur ou un laboratoire voulant instrumenter des mains robotiques bimanuelles ou multidoigts, cela réduit significativement le coût d'entrée et le temps de mise en oeuvre. Le domaine de la perception tactile pour robots est aujourd'hui fragmenté entre approches optiques (GelSight de MIT, Digit de Meta/CMU), capacitives (XELA Robotics, TACTAXIS) et piézorésistives. HiPi se positionne dans cette dernière catégorie en ciblant spécifiquement la scalabilité vers les grandes surfaces et les configurations multi-capteurs. Il convient de souligner qu'il s'agit d'un preprint académique sans déploiement industriel annoncé, et que les métriques de performance ont été mesurées sur des motifs de contact contrôlés en laboratoire. Aucune timeline de commercialisation ni partenaire industriel n'est mentionné. Les prochaines étapes naturelles seraient une validation sur tâches de manipulation réelles et une intégration dans des plateformes humanoïdes ou bimanuelles commerciales comme celles d'Agility, Figure ou Dexterous Robotics.

RecherchePaper
1 source
Manipulation Collaborative de Plis en Fibre de Carbone Guidée par l'Humain
1936arXiv cs.RO 

Manipulation Collaborative de Plis en Fibre de Carbone Guidée par l'Humain

Des chercheurs ont publié sur arXiv (référence 2606.11818) une étude portant sur la co-manipulation humain-robot de plis en fibre de carbone, un processus central dans la fabrication de pièces composites pour l'aéronautique et l'automobile. Le travail évalue plusieurs modalités de contrôle dans un environnement contrôlé : commandes vocales, suivi du poignet opérateur par vision, et contrôle en effort avec compliance mécanique. L'objectif est de permettre à un opérateur humain de guider le robot lors du drapage de matériaux souples, sans avoir à programmer des trajectoires rigides incapables de s'adapter aux déformations imprévisibles du matériau. L'enjeu industriel est réel : la manipulation de matériaux flexibles comme les préimprégnés carbone reste l'un des derniers verrous de l'automatisation en fabrication composite. Contrairement aux pièces rigides, les plis se déforment, glissent, et réagissent différemment selon la température, l'humidité ou la tension appliquée, rendant une automatisation complète économiquement et techniquement difficile à justifier pour les séries courtes ou les géométries complexes. L'approche co-manipulation présentée ici évite ce blocage en conservant le jugement humain dans la boucle, tout en déchargeant l'opérateur des efforts physiques répétitifs. Les auteurs concluent qu'une combinaison multimodale des trois méthodes offre le meilleur compromis entre intuitivité et complétude du contrôle, résultat qui reste toutefois à valider hors du cadre expérimental contrôlé décrit dans le papier. Ce travail s'inscrit dans un champ de recherche actif autour de la fabrication composite automatisée, où des acteurs comme Cevotec (Allemagne), Electroimpact (États-Unis) ou Coriolis Composites (France) développent des solutions de placement automatique de fibres, mais principalement pour des géométries prévisibles en grande série. La co-manipulation humain-robot cible un créneau différent : les petites séries, les pièces à forte valeur ajoutée, et les environnements où la flexibilité prime sur le débit. Le papier ne mentionne pas de partenariat industriel ni de calendrier de déploiement, ce qui le situe clairement au stade de la recherche amont plutôt que d'un produit opérationnel.

UEPertinent pour les acteurs français de la fabrication composite (ex. Coriolis Composites) qui cherchent à automatiser les petites séries, mais la recherche reste au stade amont sans transfert industriel annoncé.

RecherchePaper
1 source
KinematicRL : framework d'apprentissage par renforcement sim-vers-réel pour la navigation sociale à faisabilité cinodynamique
1937arXiv cs.RO 

KinematicRL : framework d'apprentissage par renforcement sim-vers-réel pour la navigation sociale à faisabilité cinodynamique

Des chercheurs ont présenté KinematicRL, un cadre de navigation sociale par apprentissage par renforcement profond (DRL) conçu pour combler l'écart sim-to-real freinant le déploiement des robots mobiles en environnements humains, publié sur arXiv en juin 2026 (arXiv:2606.12042). Ciblant les robots à entraînement différentiel, architecture répandue dans les AGV et robots de service, le framework combine trois composants : un espace d'action DRL au second ordre plutôt qu'au premier ordre habituel, un régulateur LQR itératif stochastique (iLQR) pré-entraînant la politique par minimisation de divergence, et un pipeline de suivi humain fonctionnant uniquement sur LiDAR 2D, sans fusion caméra. Un bloc de gating résiduel non biaisé complète le système pour équilibrer comportements réactifs et mémoriels selon la taille variable des foules détectées, les auteurs rapportant un déploiement sur robot réel avec modifications minimales. L'apport théorique central est la démonstration formelle que l'erreur de suivi entre position simulée et réelle décroît exponentiellement avec l'ordre de contrôle, justifiant rigoureusement l'adoption du second ordre pour les politiques DRL. En pratique, cela renforce le transfert simulation-vers-réel sans calibration complexe. En associant les détections humaines par proximité spatiale et similarité de vitesse, le pipeline LiDAR maintient une estimation de vélocité stable par agrégation temporelle, différenciant fiablement les piétons proches sans recourir à une caméra RGB. Pour les intégrateurs, ces deux choix réduisent sensiblement la dette d'ingénierie liée au déploiement terrain. La navigation sociale reste l'un des problèmes ouverts les plus difficiles de la robotique mobile, face aux méthodes analytiques comme ORCA ou le modèle de force sociale, et aux politiques DRL end-to-end. Les récents travaux en Vision-Language-Action (VLA) ont relancé l'ambition du domaine mais peinent à garantir la faisabilité cinématique en temps réel. KinematicRL adopte une posture plus conservatrice et formellement motivée, mieux adaptée aux déploiements en milieux contraints tels qu'entrepôts, hôpitaux ou aéroports. Les auteurs ne précisent ni le modèle de robot ni les durées de test, ce qui invite à interpréter les résultats avec prudence avant tout passage à l'échelle industrielle.

RecherchePaper
1 source
HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique
1938arXiv cs.RO 

HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique

Une équipe de recherche a déposé sur arXiv (2606.10363v1) HiMem-WAM, un nouveau modèle d'action hiérarchique pour la manipulation robotique. L'architecture s'attaque à une limitation persistante des World Action Models (WAM) existants : leur incapacité à maintenir une mémoire de tâche cohérente sur des séquences longues, typiques des manipulations multi-étapes. HiMem-WAM combine trois mécanismes : des actions latentes centrées sur le mouvement (niveau bas), des latents de compétences de haut niveau, et une porte mémoire déclenchée aux transitions de compétences prédites. Ce verrou mémoire écrit des états compacts à des moments-clés, permettant l'inférence causale sans génération vidéo ni estimation de flux optique au moment du test. Le modèle a été évalué sur les benchmarks LIBERO, LIBERO-PLUS et RMBench, ainsi que sur des tâches en conditions réelles. La contribution principale est d'ordre systémique : la structuration hiérarchique améliore la robustesse sous perturbations lors du déploiement, là où la plupart des architectures VLA actuelles échouent dès qu'un événement imprévu survient en milieu de séquence. Pour un décideur industriel, c'est un signal pertinent : le module mémoire apporte, selon les auteurs, un gain substantiel sur les tâches longues dépendantes de l'historique d'action. Éviter la génération vidéo en temps d'inférence réduit également la latence et la charge computationnelle, deux freins réels au déploiement embarqué. Ces résultats restent toutefois issus d'un preprint non peer-reviewed, et les performances sur benchmarks standardisés ne garantissent pas les mêmes gains en environnement de production non contrôlé. Les World Action Models constituent un paradigme récent qui apprend les dynamiques visuelles pertinentes pour l'action, distinct des architectures VLA classiques comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, lesquelles s'appuient sur des transformers multimodaux de grande taille. La manipulation longue-horizon reste un défi ouvert pour l'ensemble du secteur : ni les diffusion-policies ni les modèles language-conditioned n'ont résolu le maintien du contexte sur des séquences dépassant une dizaine de sous-tâches. HiMem-WAM propose une piste architecturale concrète, mais sans intégration hardware annoncée ni timeline de déploiement, ce qui en fait pour l'instant une contribution de recherche fondamentale.

RechercheOpinion
1 source
Robustesse des tâches par ré-étiquetage des données vision-action pour robots
1939arXiv cs.RO 

Robustesse des tâches par ré-étiquetage des données vision-action pour robots

Une équipe de chercheurs a publié TREAD (Task Robustness via Re-Labelling Vision-Action Robot Data), un framework de ré-annotation automatique des datasets de robotique présenté sur arXiv (arXiv:2606.10918, juin 2026). L'approche exploite un grand modèle vision-langage (VLM) pré-entraîné en trois étapes séquentielles : génération de sous-tâches sémantiques à partir des labels d'instruction originaux et des scènes initiales, segmentation des vidéos de démonstration conditionnée sur ces sous-tâches, puis production d'instructions textuelles diversifiées intégrant les propriétés des objets manipulés. Le résultat : des démonstrations longues décomposées en paires langage-action ancrées dans la scène, enrichies de reformulations linguistiques variées du même objectif. Les évaluations sur le benchmark LIBERO montrent une amélioration des performances sur des tâches et objectifs non vus à l'entraînement, sans collecte de données supplémentaire. Ce travail cible un goulot d'étranglement bien identifié dans la course aux politiques de manipulation généralistes : les datasets de robotique existants manquent de diversité linguistique et de variété dans les séquences d'action, ce qui fait que les politiques de type VLA (Vision-Language-Action) peinent à suivre des instructions paraphrasées ou décomposées différemment. TREAD contourne ce problème en réutilisant la connaissance transférable des VLMs pour synthétiser de la diversité là où la collecte terrain serait coûteuse. L'approche améliore simultanément la généralisation de planification via la décomposition de trajectoires et la généralisation des politiques conditionnées au langage via la diversité des formulations, deux axes que les approches de scaling pur (plus de données, plus de paramètres) n'adressent pas directement. Le contexte est celui de la montée en puissance des politiques généralistes pour la manipulation robotique, incarnée par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Ces architectures héritent des faiblesses de leurs datasets d'entraînement, souvent collectés avec des instructions standardisées et des démonstrations d'une seule séquence. TREAD s'inscrit dans une tendance émergente de data augmentation sémantique, en complémentarité avec les approches de génération synthétique par simulation (sim-to-real) ou de téléopération à grande échelle. LIBERO, le benchmark utilisé pour validation, est largement adopté dans la communauté pour comparer les politiques de manipulation en environnement tabletop. Les prochaines étapes naturelles seraient la validation sur des datasets plus larges comme Open X-Embodiment et des tests en déploiement réel sur plateformes commerciales.

IA physiqueOpinion
1 source
GUIDE : compréhension directionnelle initialisée par l'objectif pour la navigation visuelle de bout en bout
1940arXiv cs.RO 

GUIDE : compréhension directionnelle initialisée par l'objectif pour la navigation visuelle de bout en bout

Des chercheurs ont publié sur arXiv (référence 2606.10832, juin 2026) un framework d'apprentissage par renforcement baptisé GUIDE (Goal-Initialized Directional Understanding for End-to-End), conçu pour la navigation visuelle autonome de robots à pattes. Le principe fondamental est simple : contrairement aux systèmes existants qui alimentent le robot en mises à jour continues de sa cible depuis des modules d'estimation d'état hiérarchiques, GUIDE ne fournit la cible qu'une seule fois, au début de l'épisode. Le robot doit ensuite naviguer en s'appuyant exclusivement sur sa mémoire spatiale interne. Deux composants structurent le système : un prédicteur d'ancre spatiale qui exploite l'historique proprioceptif multi-fréquences pour construire des représentations d'egomouvement, et un flux de profondeur brut pour percevoir la géométrie locale. Les expériences ont été conduites sur un robot quadrupède, en simulation et en environnement réel, dans des scènes encombrées et des labyrinthes structurés, sans carte préalable. L'enjeu pour les intégrateurs est direct : supprimer la dépendance aux modules d'estimation d'état externes simplifie le stack de déploiement et réduit les points de défaillance. Les architectures hiérarchiques actuelles (localisation + cartographie + planification) sont coûteuses à calibrer et fragiles dans des environnements non cartographiés. GUIDE démontre qu'un robot peut maintenir une conscience directionnelle persistante grâce à la mémoire proprioceptive, sans SLAM ni GPS, un résultat qui renforce l'hypothèse que la proprioception peut partiellement suppléer la localisation explicite. La politique étant déployée de bout en bout sans modules séparés à l'inférence, la complexité opérationnelle en production s'en trouve réduite -- un argument concret pour les équipes industrielles. La navigation sans carte pour robots à pattes est un sujet actif : les travaux sur ANYmal (ETH Zurich), les politiques locomotrices de Unitree ou les recherches de CMU s'appuient encore majoritairement sur des représentations géométriques explicites. GUIDE s'inscrit dans la tendance "fully end-to-end" qui cherche à éliminer ces modules intermédiaires, tendance visible également dans les VLA (Vision-Language-Action models) appliqués à la manipulation. Il faut néanmoins rappeler qu'il s'agit d'une publication académique, sans pilote industriel ni déploiement commercial annoncé. Les suites naturelles incluent des tests dans des environnements non structurés à grande échelle et l'intégration avec des modèles de fondation visuels pour la spécification dynamique de la cible.

RecherchePaper
1 source
LieIPM : méthode de point intérieur sur groupes de Lie pour l'optimisation directe de trajectoires de corps rigides
1941arXiv cs.RO 

LieIPM : méthode de point intérieur sur groupes de Lie pour l'optimisation directe de trajectoires de corps rigides

Une équipe de chercheurs a publié en juin 2026 sur arXiv (référence 2606.10579) une nouvelle méthode d'optimisation de trajectoires appelée LieIPM, pour Lie Group Interior Point Method. L'approche traite le problème de la planification de mouvement de corps rigides, c'est-à-dire tout système mécanique dont l'état est décrit par une rotation et une translation dans l'espace, en opérant directement sur les groupes de Lie matriciels plutôt que dans un espace euclidien. Concrètement, les auteurs construisent un cadre de second ordre exploitant la structure géométrique de SO(3) et SE(3), permettant des mises à jour de type Newton tout en préservant la topologie des rotations. Ils y intègrent une méthode de point intérieur avec recherche linéaire (line-search), des intégrateurs variationnels sur groupe de Lie, et des dérivées intrinsèques en forme fermée qui exploitent les symétries de groupe. Les résultats numériques présentés indiquent une robustesse supérieure et une convergence plus rapide par rapport aux solveurs généralistes et aux méthodes de contrôle optimal exploitant déjà la structure. L'enjeu technique central est le suivant : les optimiseurs de trajectoires existants, comme IPOPT ou SNOPT, travaillent en espace euclidien et ignorent la structure de variété des rotations, ce qui produit des singularités (l'équivalent du gimbal lock en paramétrisation d'Euler) et des problèmes mal conditionnés. En traitant la contrainte de manifold par construction plutôt que par pénalisation ou projection a posteriori, LieIPM évite ces pathologies. Pour un intégrateur ou un ingénieur robotique travaillant sur la manipulation, la locomotion bipède, ou la planification pour bras industriels avec contraintes d'orientation strictes, cela signifie potentiellement des pipelines de planification plus fiables sans recourir à des paramétrages ad hoc comme les quaternions avec re-normalisation forcée. Sur le plan académique, LieIPM s'inscrit dans une longue tradition reliant mécanique géométrique et optimisation, initiée notamment par les travaux de Murray, Li et Sastry dans les années 1990. Il se positionne face à des méthodes récentes comme Crocoddyl (LAAS-CNRS/Inria, qui utilise déjà le DDP sur SE(3)) ou ALTRO, en ajoutant la couche point intérieur pour les contraintes générales sur variété. Il s'agit à ce stade d'une contribution de recherche avec validation numérique uniquement, sans déploiement annoncé sur robot physique ni transfert industriel documenté.

UECrocoddyl (LAAS-CNRS/Inria) est cité comme méthode comparable ; si LieIPM est intégré dans des outils open-source, les équipes françaises en planification de mouvement (locomotion bipède, manipulation) en bénéficieraient directement.

RecherchePaper
1 source
Real-IKEA : la fidélité physique est le prérequis d'une manipulation robuste
1942arXiv cs.RO 

Real-IKEA : la fidélité physique est le prérequis d'une manipulation robuste

Une équipe de chercheurs a publié sur arXiv le 9 juin 2026 Real-IKEA, un dataset et un framework de simulation centré sur la précision physique pour l'apprentissage de politiques de manipulation robotique. Le corpus comprend 1 079 configurations d'objets articulés, dérivées de 83 poignées et boutons IKEA authentiques, traités via un pipeline de six étapes visant à reproduire fidèlement leur géométrie de contact et leur comportement mécanique. Pour quantifier la précision des maillages de collision, les auteurs introduisent une métrique originale dite de déviation de surface bidirectionnelle. Sur le plan dynamique, chaque asset est livré avec des configurations résistance-calibrées, où l'amortissement (damping) et le frottement varient selon les mesures relevées sur objets réels. Une politique d'apprentissage par renforcement (RL) entraînée sur ces assets démontre in silico que la fidélité physique permet à l'agent de découvrir des stratégies de "hooking" (crochetage) et de "levering" (effet de levier), par opposition aux approches fragiles par friction-pulling que favorisent les simulateurs appauvris. Ce travail s'attaque directement au "physics gap", l'écart entre simulation simplifiée et résistances du monde réel, qui reste l'un des obstacles structurels au déploiement industriel de la manipulation robotique. Le résultat clé est une preuve de concept que la qualité des assets de simulation conditionne la qualité des stratégies émergentes : un simulateur trop idéalisé oriente l'agent vers des comportements non transférables. Pour un intégrateur ou un responsable production envisageant des bras robotiques sur des tâches d'assemblage ou de service, cela renforce l'argument en faveur d'investissements dans des pipelines de modélisation physique rigoureux avant tout déploiement, plutôt que d'ajustements post-déploiement coûteux. Real-IKEA s'inscrit dans une longue tradition de benchmarks utilisant le mobilier IKEA comme proxy de la complexité du monde réel, notamment les travaux de manipulation non-prehensile des années 2010. Le sim-to-real gap est un sujet de recherche actif, avec des acteurs comme IsaacSim (NVIDIA), MuJoCo (DeepMind) ou PyBullet comme environnements concurrents sur ce terrain. La contribution spécifique de Real-IKEA réside dans la granularité physique de ses assets plutôt que dans un nouvel algorithme. Les auteurs positionnent leur benchmark comme référence pour évaluer des politiques visant la robustesse au niveau humain sur les objets articulés, une ambition dont la validation à l'échelle réelle reste à démontrer.

RecherchePaper
1 source
Estimation dense des forces par capteur tactile optique à événements
1943arXiv cs.RO 

Estimation dense des forces par capteur tactile optique à événements

Des chercheurs ont présenté sur arXiv (arXiv:2606.09451) le premier framework de reconstruction dense de champ de force 3D à partir d'un capteur tactile optique à événements. L'approche combine deux modules complémentaires : un algorithme de suivi de marqueurs basé sur les événements pour estimer les déplacements de cisaillement (axes X et Y), et un réseau de neurones convolutif entraîné sur un jeu de données synchronisées force-déplacement-événements pour prédire les déplacements normaux (axe Z). Ces déplacements de surface sont ensuite convertis en forces via la méthode des éléments finis inverse (iFEM). Les performances mesurées atteignent une erreur absolue moyenne de 0,14 N, 0,10 N et 0,93 N sur des plages de force respectives de 4 N, 4 N et 20 N, avec une fréquence de traitement moyenne de 100 Hz. Ce résultat comble une lacune importante dans la perception tactile robotique. Les capteurs tactiles à base de caméra conventionnelle, comme le GelSight du MIT ou le DIGIT de Meta AI, permettent déjà une estimation dense des forces, mais butent sur les limites de framerate des capteurs CMOS, le flou de mouvement lors de contacts dynamiques rapides, et la bande passante nécessaire au transfert d'images. Les capteurs à événements, d'inspiration neuromorphique, contournent ces contraintes avec une résolution temporelle à la microseconde et un encodage asynchrone des variations de luminosité. Jusqu'ici, leur usage en tactile était restreint à la prédiction de forces nettes scalaires, sans distribution spatiale. Le framework présenté ouvre la voie à un retour de force géométriquement dense à haute fréquence, condition nécessaire pour des boucles de contrôle en préhension dextre réactive. La manipulation dextre reste l'un des problèmes ouverts les plus difficiles de la robotique, précisément parce que le toucher humain exploite simultanément la densité spatiale, la sensibilité à la géométrie de contact et la résolution temporelle fine. Le paysage des capteurs tactiles intelligents s'est structuré autour de deux familles : les capteurs visuels élastomère (GelSight, DIGIT, Finger Vision, Tactip) et les capteurs neuromorphiques à événements, encore peu exploités pour la reconstruction de champ. Ce travail constitue une première étape de preuve de concept ; les auteurs ciblent explicitement l'intégration dans des pipelines de contrôle haute fréquence pour la préhension robotique et la manipulation, sans annoncer de plateforme ou de timeline de déploiement précise.

RecherchePaper
1 source
DIJIT : une tête robotique pour un observateur actif
1944arXiv cs.RO 

DIJIT : une tête robotique pour un observateur actif

Des chercheurs ont présenté DIJIT, une tête robotique binoculaire conçue pour équiper des agents mobiles opérant en tant qu'observateurs actifs. Le système cumule neuf degrés de liberté mécaniques auxquels s'ajoutent quatre degrés de liberté optiques fournis par les caméras et les objectifs, soit 13 DOF au total. La conception mécanique couvre l'ensemble des mouvements nécessaires à la stéréovision convergente : vergence, version et cyclotorsion. DIJIT atteint 85 % de la vitesse de saccade humaine maximale, et la méthode de contrôle développée par l'équipe, basée sur une relation directe entre l'orientation de la caméra et les valeurs moteur, produit des mouvements saccadiques avec une erreur moyenne de 1,17° pour la caméra gauche et 1,14° pour la droite. L'article, publié sur arXiv (2512.07998v2), reste à ce stade un travail académique sans déploiement industriel annoncé. L'intérêt de DIJIT réside dans la rareté des plateformes permettant d'étudier conjointement les mouvements oculaires et tête-cou dans un cadre robotique mobile. La plupart des systèmes de vision active existants traitent ces deux axes séparément ou sacrifient la fidélité biomécanique au profit de la simplicité mécanique. En reproduisant les plages et vitesses comparables à celles de l'humain, DIJIT offre un banc d'essai pour comparer directement les stratégies de perception visuelle humaine aux méthodes de computer vision classiques, ce qui est particulièrement utile pour valider ou invalider des hypothèses sur le sim-to-real gap dans les systèmes de vision embarquée. La vision active robotique connaît un regain d'intérêt depuis que les modèles VLA (Vision-Language-Action) imposent des flux visuels plus riches et dynamiques aux robots humanoïdes. Des laboratoires comme celui de CMU ou des équipes travaillant sur des plateformes telles que Figure 03 ou Digit (Agility Robotics) cherchent à améliorer la perception visuelle active pour des tâches de manipulation en environnement non structuré. DIJIT se positionne comme un outil de recherche fondamentale plutôt que comme un produit commercialisable à court terme. L'absence de partenaire industriel annoncé et le format arXiv suggèrent une phase d'exploration académique ; les prochaines étapes probables concernent l'intégration sur une plateforme mobile complète et la publication de benchmarks comparatifs face aux systèmes de vision fixe.

RecherchePaper
1 source
Découverte guidée de nouveaux comportements par politiques de diffusion
1945arXiv cs.RO 

Découverte guidée de nouveaux comportements par politiques de diffusion

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.08743v1, juin 2026) un cadre algorithmique pour diversifier les comportements générés par les diffusion policies en robotique. Ces politiques basées sur des modèles de diffusion modélisent efficacement des distributions multimodales de trajectoires d'action, mais souffrent d'un biais documenté : avec peu de démonstrations, l'échantillonnage standard reproduit les comportements dominants et ignore les modes rares mais valides. Les auteurs combinent des correcteurs de Feynman-Kac, outil issu des processus stochastiques, avec un potentiel de guidage orientant l'échantillonnage vers des trajectoires prometteuses mais sous-représentées. Ces trajectoires candidates sont ensuite affinées par optimisation par échantillonnage, puis réintégrées dans le jeu d'entraînement pour réentraîner la politique. Les expériences portent sur plusieurs environnements de manipulation en simulation, où la méthode découvre systématiquement de nouveaux comportements exécutables. L'enjeu est concret pour les équipes travaillant sur l'apprentissage par imitation en robotique industrielle ou de service. Un robot entraîné sur peu de données converge vers une seule stratégie même lorsque plusieurs solutions existent : ce cadre propose d'explorer l'espace des comportements sans collecter davantage de démonstrations humaines, ce qui touche directement à l'efficacité des données dans les pipelines de robot learning. Les auteurs positionnent leur approche contre les méthodes de guidage classiques, qui poussent les échantillons vers des régions infaisables, et contre le couplage RL+diffusion, qui peine à sortir des minima locaux. Les résultats restent cependant limités à la simulation de manipulation; aucune validation sur robot réel n'est rapportée dans ce préprint. Les diffusion policies ont connu une adoption rapide depuis les travaux de Chi et al. en 2023, supplantant progressivement les politiques comportementales classiques sur des tâches de manipulation complexes. Le domaine est aujourd'hui concurrentiel, avec Physical Intelligence (pi0), Google DeepMind et plusieurs laboratoires universitaires poussant les limites de ces modèles génératifs. L'approche Feynman-Kac s'inscrit dans une tendance plus large de réutilisation d'outils de la physique statistique pour le contrôle robotique. Les prochaines étapes naturelles seraient une validation sur hardware réel et une extension à des tâches à horizon long, où la diversité des trajectoires est encore plus critique.

UELes laboratoires européens travaillant sur l'apprentissage par imitation (INRIA, CEA-List) pourraient exploiter ce cadre pour réduire leur dépendance aux données de démonstration, mais aucun acteur ou déploiement européen n'est impliqué dans ce préprint.

RecherchePaper
1 source
Exploration multi-robots améliorée par priorisation probabiliste des frontières avec mélanges gaussiens de Dirichlet
1946arXiv cs.RO 

Exploration multi-robots améliorée par priorisation probabiliste des frontières avec mélanges gaussiens de Dirichlet

Des chercheurs ont publié sur arXiv (identifiant 2604.03042) une méthode d'amélioration des algorithmes d'exploration autonome multi-robots, fondée sur une priorisation probabiliste des frontières d'exploration. L'approche repose sur un modèle de mélange gaussien à processus de Dirichlet (DP-GMM), combiné à une formulation probabiliste du gain d'information, pour classer les zones frontières, ces limites entre les régions déjà cartographiées et les espaces encore inconnus. Testée sur deux algorithmes multi-agents de référence dans la littérature, elle affiche des gains moyens de 10 % et 14 % respectivement sur l'ensemble des configurations simulées : environnements à densité d'obstacles variable, contraintes de communication différentes, et équipes de tailles diverses. Un déploiement en conditions réelles avec un système à deux drones a confirmé ces résultats. L'intérêt principal de cette contribution réside dans sa modularité : il ne s'agit pas d'un nouvel algorithme complet, mais d'un module de priorisation greffable sur des pipelines existants. Les méthodes frontier-based classiques évaluent la valeur d'une frontière à partir de critères géométriques simples comme la distance euclidienne ou la taille de zone. La formulation probabiliste proposée estime mieux l'utilité réelle de chaque frontière, ce qui réduit les chevauchements de couverture entre agents sans requérir de bande passante supplémentaire. Pour un intégrateur déployant des flottes de drones ou de robots mobiles autonomes (AMR) en inspection industrielle ou surveillance de sites, un gain de 10 à 14 % en efficacité d'exploration se traduit concrètement par une réduction du temps de mission ou une diminution du nombre d'unités nécessaires. L'exploration par frontières remonte aux travaux fondateurs de Yamauchi en 1997 et reste l'un des paradigmes dominants pour la navigation autonome en environnement inconnu. Son extension aux systèmes multi-agents souffre depuis d'un problème de coordination sous contraintes de communication, que diverses approches ont tenté de résoudre via les marchés d'enchères, les graphes de communication ou l'apprentissage par renforcement distribué. Le DP-GMM se positionne ici comme une couche d'amélioration légère, potentiellement intégrable sans refonte architecturale dans des stacks existants comme ROS 2. La validation sur drones physiques renforce la crédibilité de la méthode dans un domaine où le sim-to-real gap reste une critique systématique. Aucun partenariat industriel ni déploiement commercial n'est annoncé à ce stade : il s'agit d'une contribution académique ouverte.

RecherchePaper
1 source
Planification de mouvements précis pour la manipulation robotique par apprentissage par transfert sans données d'entraînement
1947arXiv cs.RO 

Planification de mouvements précis pour la manipulation robotique par apprentissage par transfert sans données d'entraînement

Des chercheurs ont publié sur arXiv (arXiv:2606.06041) un framework baptisé iCEM+TL, qui combine la méthode évolutionnaire iCEM (improved Cross-Entropy Method) avec du Transfer Learning pour améliorer la planification de mouvement bas-niveau en robotique de manipulation. L'approche transfère directement les paramètres-clés d'iCEM appris sur des tâches simples vers des tâches plus complexes -- empilage d'objets, glissement, placement en étagère -- sans réentraîner depuis zéro. Complétée par une refonte des fonctions de récompense (Reward Redesign) via décomposition de tâche pour les scénarios d'empilage et de placement en étagère, la méthode atteint des gains de taux de succès allant jusqu'à 23 % en simulation. Elle a ensuite été validée sur un robot réel Franka Emika Panda dans un scénario d'empilage, confirmant la transférabilité sim-to-real de l'approche. L'intérêt principal réside dans l'efficacité d'échantillonnage : iCEM+TL contourne le besoin de longues phases d'entraînement en réutilisant explicitement la connaissance déjà acquise sur des tâches amont. Pour les intégrateurs industriels ou les équipes R&D robotique, cela signifie qu'ajouter une nouvelle tâche de manipulation à un bras existant ne nécessite pas un réentraînement complet -- un gain direct en temps et en coût de déploiement. Le fait que le transfert soit qualifié de "zero-shot" dans le titre mérite toutefois une nuance : il s'agit ici d'un transfert de paramètres entre tâches proches dans un même domaine, et non d'une généralisation à des environnements radicalement différents. Les résultats restent majoritairement issus de simulation, avec une validation robotique limitée à un seul scénario d'empilage -- la robustesse à l'échelle industrielle reste à établir. iCEM est un algorithme de planification en temps réel apparu comme alternative légère aux méthodes d'apprentissage par renforcement profond, notamment pour la manipulation sur bras sériels. Le Franka Emika Panda (7 DOF) est devenu un banc de test standard de la communauté académique, utilisé par des dizaines d'équipes dans le monde. Dans ce paysage, iCEM+TL se positionne en dehors des approches VLA (Vision-Language-Action) comme pi0 de Physical Intelligence ou des policies à diffusion qui dominent actuellement les benchmarks de référence tels que RLBench. La suite naturelle serait de tester le framework sur des tâches à horizon plus long, sur d'autres morphologies de robots, et de comparer formellement les gains de temps d'entraînement face aux baselines RL modernes.

RecherchePaper
1 source
Apprentissage de la coordination visuomotrice prédictive
1948arXiv cs.RO 

Apprentissage de la coordination visuomotrice prédictive

Des chercheurs ont publié sur arXiv (référence 2503.23300, version 2, juin 2026) un système de prédiction de la coordination visuomotrice humaine à partir de flux égocentrés. Concrètement, le modèle prend en entrée des images capturées par une caméra portée par l'utilisateur ainsi que des données cinématiques (positions et orientations corporelles), et prédit en sortie la pose de la tête, la direction du regard et les mouvements du haut du corps. L'architecture proposée, baptisée Visuomotor Coordination Representation (VCR), apprend des dépendances temporelles structurées entre ces signaux multimodaux. Elle s'appuie sur un cadre de modélisation du mouvement par diffusion, une famille de modèles génératifs capables de produire des trajectoires cohérentes dans le temps. L'évaluation porte sur EgoExo4D, le jeu de données à grande échelle de Meta combinant vidéos égocentrées et exocentrées d'activités du quotidien, ce qui confère aux résultats une portée de généralisation sur des scénarios variés. L'enjeu pratique est significatif pour la robotique collaborative et les interfaces homme-machine. Anticiper où un opérateur va regarder et comment il va bouger son bras dans la seconde à venir est une brique fondamentale pour des robots industriels capables d'adapter leur trajectoire sans collision, ou pour des exosquelettes qui doivent pré-charger l'assistance musculaire avant le geste. L'approche démontre que la fusion vision-cinématique surpasse les approches unimodales, ce qui valide l'hypothèse que le regard et le mouvement corporel sont couplés de façon prévisible et exploitable par un modèle appris. Pour les technologies d'assistance (aide à la mobilité, interfaces de compensation du handicap), la prédiction de l'intention motrice ouvre des pistes concrètes de réduction de latence. Ce travail s'inscrit dans un courant de recherche en pleine accélération autour de la modélisation du comportement humain en vue première personne, nourri par la montée en puissance de dispositifs portables comme les lunettes AR et les capteurs inertiels embarqués. Les approches concurrentes incluent les modèles de prédiction de gaze sur vidéo statique (Aleatoric, GazeTR) et les frameworks de prédiction de mouvement full-body comme HumanMAC ou MDM, mais peu croisent explicitement regard et cinématique dans un cadre de prédiction temporelle unifiée. La publication ne mentionne pas de calendrier de déploiement industriel ni de partenariat applicatif ; il s'agit pour l'instant d'une contribution académique, avec page projet disponible, dont la suite naturelle serait une intégration dans des pipelines d'imitation learning pour robots humanoïdes ou cobots.

RecherchePaper
1 source
Instant-Fold : apprentissage par imitation en contexte pour la manipulation d'objets déformables
1949arXiv cs.RO 

Instant-Fold : apprentissage par imitation en contexte pour la manipulation d'objets déformables

Des chercheurs présentent Instant-Fold (arXiv:2606.04269, juin 2026), un cadre d'apprentissage par imitation en contexte appliqué à la manipulation d'objets déformables comme le textile. Le principe central : à partir d'une seule démonstration humaine, le système infère et exécute des modes de manipulation variés (pliage avec ordres et variantes spatiales différents) sans aucune mise à jour de gradients ni fine-tuning. L'approche repose sur deux composants : un encodeur visuel pré-entraîné par contrastive learning temporel pour capturer les déformations du matériau, et une politique basée sur un transformer à flow-matching conditionné sur cette démonstration. Le modèle est entraîné entièrement en simulation et revendique un transfert zero-shot vers des environnements réels, sans collecte de données supplémentaire. La manipulation d'objets déformables (DOM) est l'un des problèmes les plus persistants de la robotique de manipulation : l'état d'un tissu est de haute dimension, partiellement observable, et évolue à travers des interactions à long horizon avec des changements de topologie. La promesse d'Instant-Fold est double : une seule démonstration humaine suffit, et aucun réentraînement n'est requis pour chaque nouveau mode de pliage. Pour les intégrateurs en industrie textile ou en logistique e-commerce, l'implication est directe : déployer une nouvelle variante de pliage reviendrait à filmer une démonstration, sans pipeline de réentraînement. La revendication de transfert sim-to-real zero-shot mérite toutefois d'être lue prudemment : les vidéos disponibles sur le site du projet présentent des séquences sélectionnées, et la robustesse face à des matières de textures ou rigidités très variables n'est pas quantifiée dans l'abstract. La manipulation de tissu est un chantier actif depuis des années, longtemps dominé par des approches à base d'états denses et de planification hors ligne. L'émergence des politiques diffusion (ACT, Diffusion Policy) puis des modèles Vision-Language-Action a réorienté le domaine vers des méthodes end-to-end généralisables. Instant-Fold s'inscrit dans cette lignée, mais adopte le flow-matching (plus rapide à l'inférence que la diffusion) et mise sur l'in-context learning plutôt que le fine-tuning par démonstration, une approche encore minoritaire en robotique. Les groupes concurrents actifs sur la DOM incluent des équipes chez Google DeepMind et des labos universitaires ayant publié sur des benchmarks comme SoftGym ou ClothFunnels. La validation sur des évaluations standardisées et en conditions industrielles réelles reste la prochaine étape nécessaire avant tout pilote commercial.

RechercheOpinion
1 source
COP-Q : apprentissage par renforcement axé sur la sécurité pour la commande de robots via projection de Cholesky ordonnée
1950arXiv cs.RO 

COP-Q : apprentissage par renforcement axé sur la sécurité pour la commande de robots via projection de Cholesky ordonnée

Des chercheurs ont publié le 5 juin 2026 sur arXiv (2606.04749) une méthode d'apprentissage par renforcement sûr baptisée COP-Q, pour Cholesky-Ordered Projection Q-learning. L'algorithme s'attaque à un problème central du contrôle robotique : maximiser la performance d'un agent tout en respectant des contraintes de sécurité strictes. Dans les approches off-policy existantes, les valeurs Q de récompense et de sécurité sont estimées par des ensembles de critiques séparés, chaque objectif gérant son incertitude de façon indépendante. COP-Q rompt avec ce traitement cloisonné en intégrant la covariance inter-objectifs dans une estimation vectorielle des Q-valeurs, puis utilise la décomposition de Cholesky pour encoder la priorité des objectifs sous forme séquentielle : la sécurité prime, la récompense s'adapte en conséquence. La méthode a été validée sur des benchmarks de locomotion dans Brax et de navigation sûre dans Safety-Gymnasium, en conditions de contraintes dures et souples. Ce que prouve ce travail, c'est que l'hypothèse d'indépendance entre objectifs de sécurité et de récompense est une source réelle de sous-performance. En modélisant explicitement leur corrélation, COP-Q réduit le conservatisme excessif sur la récompense sans dégrader les garanties de sécurité, ce qui se traduit par une meilleure efficacité d'échantillonnage face aux baselines représentatifs du domaine. Pour un intégrateur ou un équipementier qui cherche à déployer des robots en environnement contraint (entrepôt, ligne d'assemblage, espace partagé avec des opérateurs), cela signifie concrètement des politiques plus performantes à entraînement équivalent, sans sacrifier les garde-fous. L'overhead computationnel est décrit comme minimal, et la méthode est annoncée compatible avec la majorité des frameworks deep Q-learning existants. Le problème du safe RL pour la robotique mobilise une communauté dense depuis plusieurs années, avec des approches comme CPO (Constrained Policy Optimization), PCPO ou SAC-Lagrangian comme points de référence. COP-Q se positionne dans la lignée des méthodes off-policy avec ensembles de critiques, un espace où la gestion de l'incertitude par intervalles de confiance est devenue standard. La décomposition de Cholesky, plus connue en algèbre linéaire numérique, est ici réinterprétée comme un mécanisme de priorisation structurelle des objectifs, une idée potentiellement transférable à d'autres problèmes multi-objectifs en RL. Les prochaines étapes naturelles seraient une validation sur hardware réel et une confrontation aux benchmarks industriels comme ceux proposés par le Robosuite ou le CVPR 2025 Safe Manipulation Track.

RecherchePaper
1 source