Aller au contenu principal

Recherche — page 32

2151 articles · page 32 sur 44

Publications scientifiques en robotique : arXiv cs.RO, ICRA, IROS, Humanoids, CoRL — nouveaux algorithmes, benchmarks et datasets.

RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes
1551arXiv cs.RO RechercheActu

RoboMME : évaluation et compréhension de la mémoire pour les politiques robotiques généralistes

Une équipe de chercheurs a publié RoboMME (Robotic Multi-Memory Evaluation), un benchmark standardisé à grande échelle destiné à évaluer les modèles VLA (vision-language-action) sur des tâches de manipulation robotique nécessitant de la mémoire à long horizon. Le benchmark comprend 16 tâches construites selon une taxonomie en quatre catégories : mémoire temporelle, spatiale, des objets et procédurale, couvrant des scénarios comme le comptage d'actions répétées ou la manipulation d'objets temporairement occultés. Les auteurs ont également développé 14 variantes de VLA augmentées de mémoire, toutes bâties sur le backbone pi0.5 de Physical Intelligence, et les ont évaluées selon différentes stratégies d'intégration mémorielle. L'absence d'un cadre d'évaluation standardisé était jusqu'ici un frein majeur pour la recherche sur la mémoire dans les VLA généralistes : chaque équipe testait ses mécanismes dans des conditions ad hoc, rendant toute comparaison rigoureuse impossible. RoboMME comble ce vide en permettant, pour la première fois, de mesurer systématiquement comment différentes représentations mémorielles (états cachés récurrents, mémoire externe, fenêtre de contexte longue) se comportent sur un spectre de tâches hétérogènes. La conclusion principale est nuancée : l'efficacité d'une architecture mémoire est fortement dépendante de la tâche, chaque approche présentant des avantages distincts selon la catégorie, ce qui remet en cause l'idée qu'une solution universelle serait à portée à court terme. Pour les intégrateurs et les décideurs B2B, cela signifie concrètement que le choix du mécanisme mémoriel devra rester spécifique au cas d'usage, sans recette générique applicable. Ce benchmark s'inscrit dans la montée en puissance des VLA généralistes, portés par des modèles comme pi0 et pi0.5 de Physical Intelligence (levée de 400 millions de dollars en 2024), OpenVLA, Octo ou RoboVLMs, qui cherchent tous à transférer les capacités des grands modèles de langage à la manipulation physique. D'autres benchmarks comme LIBERO, RoboSuite ou MetaWorld couvrent déjà l'évaluation générale des VLA, mais RoboMME se distingue par son focus explicite sur la mémoire à long horizon, un aspect jusqu'ici systématiquement sous-évalué dans ces environnements. Les prochaines étapes probables incluent l'adoption de RoboMME comme référence communautaire dans les pipelines d'évaluation des grands labs robotiques, et le développement d'architectures mémoire capables de généraliser entre catégories de tâches sans sacrifier les performances spécialisées.

1 source
Défense active contre les attaques par injection de fausses données dans les manipulateurs robotiques
1552arXiv cs.RO 

Défense active contre les attaques par injection de fausses données dans les manipulateurs robotiques

Une équipe de chercheurs a publié sur arXiv (réf. 2605.17950) deux mécanismes de défense active contre les attaques par injection de fausses données (FDIA, False Data Injection Attacks) visant les manipulateurs robotiques. Ces attaques corrompent les signaux capteurs transmis au contrôleur d'un bras, permettant à un adversaire de dévier le comportement de l'effecteur final sans déclencher les alarmes classiques. La vulnérabilité exploitée est structurelle : la linéarisation par retour d'état (feedback linearization), méthode de contrôle très répandue, expose les systèmes à une faille dite d'intégrateur sur l'horizon fini d'une tâche. Les deux contre-mesures proposées, baptisées "amortissement virtuel sensible aux anomalies" et "réduction de manipulabilité", s'accompagnent de garanties probabilistes sur l'exécution nominale. Les simulations ont été conduites sur un manipulateur redondant à 7 degrés de liberté (7-DOF). Les résultats montrent que ces défenses réduisent substantiellement l'impact des FDIA par rapport au filtre Chi-carré, référence standard à seuil fixe pour la détection d'anomalies, tout en préservant les performances nominales en l'absence d'attaque. Ce point est décisif pour les intégrateurs industriels : une contre-mesure qui dégrade les cycles normaux ne sera jamais déployée en production. L'apport réel de ce travail réside dans la capacité à neutraliser des attaques furtives, précisément celles qui passent sous le radar d'un Chi-carré classique. La linéarisation par retour d'état étant omniprésente en cobotique, en assemblage industriel et en chirurgie assistée, cette vulnérabilité d'intégrateur a une portée concrète bien au-delà du cadre académique. Les FDIA sont documentées depuis une décennie sur les réseaux électriques, les drones et les véhicules autonomes ; leur application aux manipulateurs robotiques constitue un axe de recherche plus récent, particulièrement critique pour les applications en environnement dangereux ou médical. Sur le plan industriel, les grands fabricants de bras (KUKA, ABB, FANUC, Universal Robots) ne publient pas leurs architectures de contrôle, mais la généralisation des interfaces réseau et des mises à jour OTA élargit mécaniquement leur surface d'attaque. L'étude reste à ce stade une contribution de simulation : la validation sur hardware réel et l'intégration dans des pipelines de contrôle commerciaux constituent les prochaines étapes naturelles avant toute adoption terrain.

UEKUKA (Allemagne) et ABB (Suisse/Suède) figurent parmi les fabricants de bras les plus exposés à cette vulnérabilité structurelle de linéarisation, mais l'étude reste au stade simulation, aucune action directe n'est requise pour les intégrateurs européens avant une validation hardware.

RechercheOpinion
1 source
ESI-Bench : vers une intelligence spatiale incarnée qui boucle la perception et l'action
1553arXiv cs.RO 

ESI-Bench : vers une intelligence spatiale incarnée qui boucle la perception et l'action

Une équipe de chercheurs a publié ESI-Bench, un benchmark dédié à l'intelligence spatiale incarnée (embodied spatial intelligence), conçu pour évaluer la capacité des agents artificiels à fermer la boucle perception-action. Le benchmark, construit sur le simulateur OmniGibson, couvre 10 catégories de tâches et 29 sous-catégories, ancrées dans les systèmes de connaissances fondamentales de la psychologue Elizabeth Spelke (objets, agents, nombre, géométrie). Contrairement aux benchmarks classiques qui fournissent des observations "oracle" figées, ESI-Bench exige que l'agent décide lui-même quelles capacités mobiliser, perception, locomotion, manipulation, et dans quel ordre, pour accumuler activement les informations pertinentes à la tâche. Les expériences menées sur les modèles multimodaux de pointe (MLLMs) révèlent un écart significatif entre exploration active et observation passive : les agents qui choisissent leurs points de vue surpassent nettement leurs homologues passifs. Fait notable, ces agents développent spontanément des stratégies spatiales émergentes sans instruction explicite. En revanche, l'acquisition multi-vues aléatoire dégrade souvent les performances en ajoutant du bruit plutôt que du signal, malgré un volume d'images bien supérieur. L'étude identifie une cause principale d'échec qu'elle nomme "action blindness" : de mauvais choix d'action produisent de mauvaises observations, qui induisent à leur tour des erreurs en cascade. Autre résultat contre-intuitif : une représentation 3D imparfaite se révèle plus nuisible qu'une baseline 2D, car elle distord les relations spatiales au lieu de les clarifier. Les auteurs documentent également un écart métacognitif net par rapport aux humains : là où un opérateur humain cherche activement des angles réfutant son hypothèse et révise ses croyances face à une contradiction, les modèles s'engagent prématurément avec une confiance élevée indépendamment de la qualité des preuves disponibles. ESI-Bench s'inscrit dans une vague de travaux cherchant à dépasser les limites des benchmarks statiques pour robots et agents incarnés, notamment VQA-3D, ScanQA ou EmbodiedScan, qui évaluent la compréhension spatiale sans boucle de rétroaction motrice. La dépendance à OmniGibson implique que les résultats restent pour l'instant confinés à la simulation, et le gap sim-to-real, déjà central dans les débats sur les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), n'est pas adressé ici. Ce benchmark ne teste pas de robots physiques déployés mais des MLLMs dans un environnement simulé. Les prochaines étapes naturelles incluront le transfert vers des plateformes réelles et l'intégration de politiques de manipulation close-loop pour valider si les stratégies émergentes observées en simulation tiennent face aux incertitudes du monde physique.

RecherchePaper
1 source
WorldArena 2.0 : extension du benchmark de modèles du monde incarnés sur les modalités, fonctionnalités et plateformes
1554arXiv cs.RO 

WorldArena 2.0 : extension du benchmark de modèles du monde incarnés sur les modalités, fonctionnalités et plateformes

WorldArena 2.0 est un benchmark pour l'évaluation des "world models incarnés" (embodied world models), présenté dans un preprint arXiv (2605.17912) en mai 2026. Ces modèles prédictifs entraînent des agents à anticiper l'évolution de leur environnement selon leurs propres actions, une capacité fondamentale pour la robotique autonome. Le benchmark étend l'évaluation sur trois axes : la modalité (de la vision seule vers la perception visuotactile, intégrant le toucher), la fonctionnalité (au-delà de la planification, vers l'utilisation du world model comme environnement d'entraînement par renforcement interactif), et la plateforme (depuis les simulateurs vers des robots physiques à morphologies variées). La suite est accessible sur world-arena.ai sous un protocole standardisé mesurant qualité perceptuelle, utilité interactive et performances cross-plateforme. Le principal apport est de combler un angle mort méthodologique : les benchmarks existants pour les world models se limitaient à la prédiction vidéo hors-ligne, dans des simulateurs, sans évaluer leur utilité dans une boucle RL ni leur comportement sur robots réels. Cette restriction rendait presque impossible de trancher si un world model est réellement utile pour un intégrateur : capable de générer des expériences synthétiques fiables pour affiner une politique de contrôle, et robuste face aux imprécisions du contact physique. L'extension visuotactile est particulièrement significative, le retour haptique étant un verrou connu du sim-to-real pour la manipulation. Ce benchmark succède à une première version de WorldArena centrée sur la simulation, et répond à une critique croissante dans la communauté : les métriques de qualité vidéo (FID, PSNR) ne prédisent pas la performance effective d'un agent sur robot physique. Sur le plan concurrentiel, WorldArena 2.0 s'inscrit aux côtés d'initiatives comme RoboVerse ou les suites d'évaluation des VLAs (Vision-Language-Action models) portées par DeepMind et Meta AI. Aucun acteur français ou européen n'est mentionné dans ce preprint, qui reste une contribution académique sans partenariat industriel annoncé. Les étapes suivantes logiques incluent l'extension à des humanoïdes complets et l'intégration de modalités supplémentaires comme la proprioception.

RecherchePaper
1 source
Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure
1555arXiv cs.RO 

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure

Des chercheurs ont publié en mai 2026 (arXiv:2605.17661) Mono-Hydra++, un pipeline temps réel capable de construire des graphes de scène 3D hiérarchiques d'intérieurs en n'utilisant qu'une caméra RGB monoculaire et une IMU, sans capteur de profondeur actif. Le coeur du système repose sur M2H-MX, un modèle multi-tâches fondé sur DINOv3 qui estime simultanément la profondeur et la sémantique des images. Ces estimations alimentent un front-end d'odométrie visuelle-inertielle (VIO) enrichi de contraintes de profondeur prédites creuses, d'un masquage sémantique des zones dynamiques et d'un alignement temporel tenant compte de la pose, avant fusion volumétrique dans le backend Mono-Hydra. Sur le sous-ensemble d'évaluation Go-SLAM/ScanNet, le système affiche 1,6 % d'erreur de trajectoire en moins que le meilleur baseline RGB-D testé ; sur le benchmark calibré 7-Scenes, il réduit l'ATE moyen de 29,8 % par rapport au meilleur concurrent calibré. Le modèle de perception M2H-MX-L, exporté en ONNX/TensorRT FP16, tourne à 25,53 FPS sur un Jetson Orin NX 16 Go, et le pipeline a été validé dans un déploiement réel dans un bâtiment ITC avec une caméra RealSense RGB + IMU. L'impact industriel est direct pour les plateformes à contraintes sévères : drones d'inspection, robots humanoïdes légers et AMR embarquant peu de puissance. Jusqu'ici, la construction de graphes de scène 3D, qui organisent l'espace en objets, pièces et relations spatiales, nécessitait des capteurs actifs (RGB-D ou LiDAR) impraticables dès que le payload ou la consommation électrique sont limités. Mono-Hydra++ démontre qu'il est possible d'atteindre, voire de dépasser, la précision de ces baselines lourds avec une seule caméra et une IMU bas coût. Pour un intégrateur ou un COO industriel, cela signifie une réduction substantielle du coût matériel embarqué et l'ouverture de cas d'usage où le RGB-D n'est pas envisageable. Il convient toutefois de noter que les résultats sont issus de benchmarks académiques standardisés : la robustesse sur des scènes industrielles non contrôlées, avec éclairages difficiles ou textures répétitives, reste à confirmer dans des conditions opérationnelles réelles. Mono-Hydra++ s'inscrit dans la lignée du système Hydra du MIT, qui a posé les bases de la représentation hiérarchique en graphe de scène pour la robotique. L'utilisation de DINOv3 comme backbone de vision fondationnelle est cohérente avec la tendance forte à extraire simultanément géométrie et sémantique depuis des modèles pré-entraînés à grande échelle. Sur ce terrain, les concurrents directs incluent les systèmes basés sur RGB-D comme Go-SLAM, iMAP ou NICE-SLAM, ainsi que des approches VIO-sémantiques récentes, mais peu proposent la combinaison complète cartographie métrique, sémantique et graphe de scène en temps réel sur matériel embarqué contraint. En tant que preprint arXiv non encore évalué par les pairs, les prochaines étapes attendues sont la publication en conférence (IROS, ICRA), des tests sur plateformes aériennes effectives et une éventuelle intégration dans des stacks robotiques open-source comme ROS 2.

UELes constructeurs européens d'AMR légers et de drones d'inspection pourraient à terme réduire leurs coûts matériels embarqués en remplaçant les capteurs RGB-D par une caméra monoculaire, sous réserve de validation dans des conditions industrielles non contrôlées.

RecherchePaper
1 source
Pré-entraînement universel sur les poses pour des politiques VLA généralisables
1556arXiv cs.RO 

Pré-entraînement universel sur les poses pour des politiques VLA généralisables

Des chercheurs ont publié Pose-VLA (arXiv:2602.19710, 2026), un nouveau paradigme d'entraînement pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. L'approche sépare l'entraînement en deux phases distinctes: une phase de pré-entraînement qui extrait des prior spatiaux 3D universels dans un espace centré sur la caméra, puis une phase de post-entraînement pour l'alignement propre à l'embodiment du robot cible. Le mécanisme central repose sur l'introduction de "discrete pose tokens", une représentation intermédiaire universelle qui combine des données de grounding spatial issues de datasets 3D hétérogènes avec des trajectoires géométriques issues de démonstrations robotiques. Sur le benchmark RoboTwin 2.0, Pose-VLA revendique l'état de l'art avec 79,5% de taux de succès moyen, et atteint 96,0% sur LIBERO. En conditions réelles, le modèle généralise à des objets variés avec seulement 100 démonstrations par tâche. Le problème structurel que Pose-VLA cherche à résoudre est bien documenté dans la littérature: les backbones VLM classiques, optimisés pour le Visual Question Answering, excellent à identifier sémantiquement des objets mais restent relativement insensibles aux variations 3D fines qui dictent des stratégies de préhension différentes. Ce phénomène, qualifié de "feature collapse" par les auteurs, dégrade l'efficacité d'entraînement et limite la généralisation inter-tâches. En découplant explicitement la perception spatiale 3D de la supervision d'action, l'approche vise à réduire significativement le nombre de démonstrations nécessaires pour adapter une politique à un nouveau contexte, ce qui représente aujourd'hui l'un des principaux freins à l'industrialisation des VLA. À noter que les tâches réelles testées ne sont pas détaillées dans l'article, et les performances sur benchmarks simulés ne préjugent pas du comportement en environnement industriel non contrôlé. Les VLA sont au coeur d'une compétition de recherche intense depuis RT-2 de Google DeepMind en 2023, et des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA ont chacun tenté d'adresser le sim-to-real gap et la dépendance aux larges corpus de démonstrations. RoboTwin 2.0 et LIBERO sont devenus des références de facto pour comparer ces politiques en manipulation. Pose-VLA s'inscrit dans une tendance plus large de découplage des phases d'entraînement, parallèlement à des approches comme UniSim ou RoboVLMs. Cette publication reste au stade académique: aucun déploiement industriel, partenariat commercial ni timeline de mise en production ne sont mentionnés, et les expériences réelles se limitent à un contexte laboratoire avec des objets courants.

RechercheOpinion
1 source
D'une seule démonstration à une politique générale pour la manipulation avec contact
1557arXiv cs.RO 

D'une seule démonstration à une politique générale pour la manipulation avec contact

Une équipe de recherche publie sur arXiv (réf. 2605.17601, mai 2026) un framework d'apprentissage par démonstration capable de généraliser à partir d'un seul exemple sur des tâches de manipulation impliquant des contacts répétés avec l'environnement. Le système repose sur un pipeline en quatre étapes : abstraction de la démonstration en primitives de contraintes environnementales, exploration autonome pour lever les ambiguïtés, correction ciblée par un opérateur humain pour couvrir les variantes hors-distribution, et enfin récupération en ligne des détails géométriques via interaction compliante. Validé sur sept tâches réelles multi-étapes à contact riche, le framework atteint un taux de succès supérieur à 90 %. Aucune entreprise spécifique ni plateforme robotique n'est mentionnée dans le préprint, qui reste une contribution académique sans déploiement industriel annoncé. Le point central de l'approche est de représenter une tâche non pas comme une trajectoire à imiter, mais comme une séquence de contraintes environnementales à exploiter. Ce changement de paradigme permet au robot de distinguer la structure générale d'une tâche (types de contraintes, transitions entre elles) des détails spécifiques à une instance donnée (poses exactes, géométrie locale). Pour un intégrateur ou un décideur industriel, cela signifie qu'une seule démonstration suffit potentiellement là où les méthodes de behavior cloning classiques en réclament des centaines. Le résultat de 90 %+ sur des tâches à contact riche est notable car ce domaine concentre la majorité des échecs en manipulation robotique réelle, notamment à cause de la sensibilité aux variations de pose et aux dynamiques de contact non modélisées. L'apprentissage par démonstration est un champ très actif depuis une décennie, concurrencé récemment par les politiques de diffusion (Diffusion Policy, Pi-0 de Physical Intelligence), les architectures VLA (RT-2, GR00T N2 de NVIDIA) et les méthodes ACT (Action Chunking with Transformers). L'originalité revendiquée ici est de traiter les contraintes environnementales comme biais inductif plutôt que d'augmenter massivement les données d'entraînement ou la puissance du modèle. La limite principale reste l'absence d'évaluation sur des plateformes humanoïdes ou collaboratives standard, ce qui rend difficile la comparaison directe avec les benchmarks du secteur. Les suites naturelles seraient un passage à des environnements ouverts et une validation sur des robots commerciaux comme le Franka Research 3 ou les bras UR.

RecherchePaper
1 source
DyGRO-VLA : mise à l'échelle inter-tâches des modèles vision-langage-action par optimisation résiduelle groupée dynamique
1558arXiv cs.RO 

DyGRO-VLA : mise à l'échelle inter-tâches des modèles vision-langage-action par optimisation résiduelle groupée dynamique

Des chercheurs ont soumis sur arXiv (réf. 2605.17486) un nouveau framework d'optimisation pour les modèles VLA (Vision-Language-Action), baptisé DyGRO-VLA (Dynamic Grouped Residual Optimization for VLA). L'approche fonctionne en deux étapes : une phase de capture de représentations latentes inter-tâches fondée sur des principes de théorie de l'information, suivie d'un raffinement dynamique de la politique via un mécanisme de "mixture-of-RL-residuals". Les résultats sont évalués sur les benchmarks LIBERO et RoboTwin2, deux références standard en manipulation robotique multi-tâches, et validés sur robot réel. Les gains de performance sont présentés comme consistants face à des baselines solides, y compris sous distribution shift, c'est-à-dire face à des tâches absentes de l'ensemble d'entraînement. Le problème visé est structurel : lorsqu'on affine un modèle VLA généraliste avec du Reinforcement Learning, il finit généralement par ne bien performer que sur un sous-ensemble étroit de tâches, perdant la polyvalence qui le rendait intéressant. La plupart des optimiseurs RL actuels sont conçus pour une tâche unique, ce qui réduit ces modèles, pourtant pensés comme des contrôleurs généralistes, à des politiques spécialisées peu transférables. Pour un intégrateur ou un industriel déployant des robots sur des lignes à forte variabilité de tâches, ce phénomène est un frein opérationnel direct. DyGRO-VLA répond à ce problème en exploitant les représentations latentes partagées entre tâches tout en limitant les interférences lors de l'optimisation. Si ces résultats se confirment dans des conditions plus diversifiées, cela aurait des implications concrètes sur la viabilité du fine-tuning RL pour des modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'essor des modèles VLA, qui combinent vision, langage et action dans un seul réseau de neurones, est l'une des tendances majeures de la robotique depuis 2023. Des acteurs comme Physical Intelligence (Pi-0, Pi-0.5), NVIDIA (GR00T N2), Google DeepMind (RT-2) ou des startups comme Figure AI et 1X Technologies s'appuient sur cette architecture. Le recours au RL pour dépasser les limites de l'imitation pure est une évolution naturelle, mais le maintien des performances sur plusieurs tâches reste un problème ouvert. DyGRO-VLA s'inscrit dans un courant de recherche actif qui inclut des approches comme ReinFT. L'absence de détails sur les conditions expérimentales exactes (nombre de tâches, hardware robot utilisé, comparaisons directes avec les VLA commerciaux) et l'absence de code public au moment de la soumission rendent difficile une évaluation indépendante, une limite fréquente des prépublications arXiv.

RechercheOpinion
1 source
Caméras externes fixes comme cartes de référence communes pour la génération active de graphes de scènes 3D
1559arXiv cs.RO 

Caméras externes fixes comme cartes de référence communes pour la génération active de graphes de scènes 3D

Des chercheurs ont publié sur arXiv (réf. 2605.18184) un framework RGB-only permettant à un robot de construire incrémentalement un graphe de scène 3D (3DSG) en exploitant des caméras fixes extérieures comme cartes a priori communes, désignées sous le terme "Common Prior Maps" (CPMs). Le principe : avant même que le robot ne commence à se déplacer, une ou plusieurs caméras RGB fixes, caméras de surveillance, caméras d'atelier déjà en place, fournissent une vue large de l'environnement qui initialise une représentation sémantique et géométrique de la scène. Le système fusionne ensuite les observations embarquées (caméra du robot) et extérieures dans un pipeline unique, sans modification matérielle, en traitant chaque flux caméra de manière identique via un modèle de reconstruction 3D feed-forward. Résultat mesuré : l'intégration d'une seule caméra externe augmente le rappel initial d'objets de +79 %, et l'exploration active subséquente devient significativement plus efficace grâce à ce contexte enrichi. L'intérêt opérationnel est direct pour les intégrateurs robotiques en environnement industriel ou logistique : l'infrastructure caméra fixe est souvent déjà déployée (sécurité, supervision), et la pouvoir réutiliser comme prior sémantique évite le coût d'un SLAM à froid complet. Le graphe de scène 3D oriente ensuite l'exploration active du robot vers les zones de haute incertitude sémantique, ce qui réduit le temps de cartographie utile. L'approche contredit une hypothèse courante selon laquelle la reconstruction 3D précise exigerait obligatoirement des capteurs de profondeur (LiDAR, RGB-D), ici, RGB seul suffit via un modèle feed-forward, ce qui abaisse le seuil matériel d'entrée. Le gain de +79 % en rappel initial est notable, mais il convient de noter que ce chiffre est mesuré en début d'exploration : l'article ne détaille pas les conditions exactes des scènes de test ni la diversité des configurations d'occlusion. Cette recherche s'inscrit dans une dynamique active autour des graphes de scène pour la robotique autonome, après des travaux fondateurs comme 3DSG (MIT, 2020) et les approches Hydra (MIT SPARK Lab). Elle se distingue des méthodes classiques de cartographie sémantique en exploitant des informations a priori déjà disponibles dans de nombreux déploiements industriels, plans BIM, images de télédétection, flux caméra fixes, plutôt que de partir d'une page blanche. Aucune collaboration industrielle ni timeline de transfert n'est mentionnée dans la publication ; le travail reste pour l'instant au stade de la démonstration académique. Les prochaines étapes naturelles seraient l'évaluation sur des scènes dynamiques peuplées d'humains ou d'AMR, et l'intégration avec des pipelines de planification de tâches en aval.

RecherchePaper
1 source
Stretch-ICP : un algorithme de recalage et de désynchronisation à trajectoire continue pour mouvements agressifs
1560arXiv cs.RO 

Stretch-ICP : un algorithme de recalage et de désynchronisation à trajectoire continue pour mouvements agressifs

Des chercheurs ont publié sur arXiv (réf. 2605.17264) un algorithme de recalage de trajectoire et de correction de distorsion LiDAR baptisé Stretch-ICP, conçu pour les scénarios de mouvements violents -- chutes, glissades, terrains extrêmes -- où les capteurs inertiels atteignent leurs limites physiques. Pour valider leurs travaux, l'équipe a constitué le dataset TIGS (Tumbling-Induced Gyroscope Saturation): un LiDAR mécanique et une centrale inertielle (IMU) ont été précipités le long d'une pente, générant des vitesses angulaires jusqu'à quatre fois supérieures à celles des jeux de données existants comparables. Ce dataset est publié en accès libre. Deux contributions sont proposées: SAAVE (Saturation-Aware Angular Velocity Estimation), qui reconstruit les vitesses angulaires lorsque le gyroscope sature, réduisant l'erreur d'estimation de 83,4 %; et Stretch-ICP lui-même, qui réduit les erreurs de vitesse linéaire et angulaire aux jonctions de scans respectivement de 95,2 % et 94,8 %, permettant des trajectoires 6-DOF plus lisses qu'avec un ICP classique. Ces résultats s'attaquent à un angle mort bien connu des stacks SLAM embarquées: la saturation gyroscopique, qui est rarement documentée dans les benchmarks mais survient régulièrement sur des robots de recherche et sauvetage, des drones en crash contrôlé, ou des robots d'inspection en environnement non structuré. L'approche "continuous-time" de Stretch-ICP -- qui modélise la trajectoire entre deux scans comme une courbe continue plutôt qu'une interpolation linéaire -- améliore directement la qualité du deskewing (la correction des distorsions LiDAR induites par le mouvement du robot pendant l'acquisition). Pour un intégrateur ou un COO industriel, le gain concret est une localisation qui ne diverge plus lors des perturbations mécaniques imprévues, condition nécessaire pour des déploiements autonomes en dehors de l'environnement contrôlé. Le problème du recalage point-à-point (ICP, introduit par Besl et McKay en 1992) a généré des dizaines de variantes: KISS-ICP pour la robustesse, CT-ICP pour le temps continu, NDT pour les environnements structurés. Stretch-ICP se positionne dans la lignée des approches continuous-time, en y ajoutant la gestion explicite de la saturation sensorielle -- un cas limite ignoré par la majorité des algorithmes concurrents. L'équipe ne mentionne pas de partenariat industriel ni de timeline de commercialisation; la contribution est avant tout académique, avec la mise à disposition du dataset TIGS comme levier pour que la communauté SLAM puisse benchmarker ses propres algorithmes sur des conditions réellement adversariales.

RecherchePaper
1 source
Un modèle de représentation universel pour la manipulation dextérique unifiée
1561arXiv cs.RO 

Un modèle de représentation universel pour la manipulation dextérique unifiée

Une équipe de chercheurs propose OHRA (One Hand to Rule Them All), un cadre de représentation canonique paramétrisée visant à unifier les politiques de manipulation dextère sur des mains robotiques de morphologies très différentes. Constat de départ : les politiques d'apprentissage actuelles supposent une architecture de main fixe et ne se transfèrent pas sans réentraînement complet. Le système combine un espace de paramètres unifié capturant les variations cinématiques et morphologiques essentielles, et un format URDF canonique standardisant l'espace d'action tout en préservant les propriétés dynamiques de chaque main d'origine. Un VAE (Variational Autoencoder) est entraîné sur cet espace pour produire un plongement latent compact et sémantiquement cohérent. Résultat clé : la politique de préhension conditionnée sur cette représentation atteint 81,9 % de succès en transfert zéro-shot sur une LEAP Hand à 3 doigts, morphologie non vue pendant l'entraînement, validée en simulation et sur tâches réelles. L'enjeu est directement industriel : la fragmentation des designs de mains, Shadow Robotics, LEAP, Allegro, Ability Hand, rend les politiques non portables d'un hardware à l'autre. Un cadre partagé permettrait à un intégrateur de réentraîner une politique existante sur un nouveau manipulateur sans repartir de zéro, comprimant les coûts de déploiement. Le score de 81,9 % en zéro-shot sur une configuration inédite est un signal mesurable que le "morphology gap", l'analogue du sim-to-real gap appliqué aux architectures de mains, commence à être adressé. Le fait que les interpolations dans l'espace latent produisent des transitions morphologiques physiquement cohérentes indique que le VAE capture une géométrie fonctionnelle, pas seulement statistique. Ce travail s'inscrit dans la dynamique plus large de l'apprentissage cross-embodiment, aux côtés de travaux comme UniDexGrasp, DexGraspNet ou les approches fondées sur des VLA (Vision-Language-Action models). Sur le plan concurrentiel, Google DeepMind, Physical Intelligence (Pi-0) et Unitree investissent dans des politiques généralisables, mais l'angle "unification par représentation canonique de la morphologie de main" reste peu exploré industriellement. Les suites naturelles incluent l'extension à la manipulation bimanuelle, aux mains à plus de 5 doigts, et l'intégration dans des pipelines de téléopération. Aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
Modélisation dynamique par données d'un robot continu à actionnement tendineux
1562arXiv cs.RO 

Modélisation dynamique par données d'un robot continu à actionnement tendineux

Des chercheurs associés au CERN publient sur arXiv (arXiv:2605.18720, mai 2025) une étude comparative de méthodes d'identification de systèmes par apprentissage automatique appliquées à un robot continu à actionnement par tendons équipé de joints roulants. Trois approches ont été évaluées : N4SID (identification par sous-espaces), ARX (modèle autorégressif à entrées exogènes) et SINDYc (identification parcimonieuse de dynamiques non linéaires avec contrôle). Le résultat central : malgré le nombre élevé de joints du robot, un modèle dynamique à seulement deux degrés de liberté (2-DDL) suffit à capturer fidèlement le comportement du système, grâce aux fortes dépendances cinématiques entre les joints. Les modèles obtenus ont été validés sur données expérimentales, puis intégrés dans un contrôleur prédictif (MPC) opérant en temps réel. L'enjeu est réel pour quiconque travaille sur le contrôle de robots continus : leur dynamique est réputée difficile à modéliser, dominée par la friction, hautement non linéaire et de dimension élevée. Démontrer qu'un modèle 2-DDL issu de données expérimentales suffit pour piloter un MPC réduit considérablement la complexité d'intégration. Cela ouvre la voie à des boucles de contrôle plus rapides sans requérir de modèles analytiques complets, souvent inaccessibles pour les structures souples. Le robot en question est développé au CERN, probablement pour des applications d'inspection ou de maintenance dans des environnements confinés, domaine où les robots continus rivalisent avec des solutions de Festo Robotics ou des laboratoires comme le BioRobotics Institute de Pise. L'article reste un preprint non encore évalué par les pairs, et les performances du MPC en conditions opérationnelles réelles restent à confirmer.

UELe CERN étant une institution paneuropéenne (Genève, FR/CH), les méthodes présentées, modèle 2-DDL data-driven couplé à un MPC temps réel, intéressent directement les équipes R&D européennes travaillant sur l'inspection robotisée en environnements confinés (nucléaire, ITER, maintenance industrielle).

RecherchePaper
1 source
Nori Bot : un manipulateur mobile sol-comptoir à moins de 1 000 dollars
1563arXiv cs.RO 

Nori Bot : un manipulateur mobile sol-comptoir à moins de 1 000 dollars

Des chercheurs ont mis en ligne en mai 2026 sur arXiv (2605.16537) les spécifications de Nori Bot, un manipulateur mobile bimanuel à 17 degrés de liberté (DOF) proposé à 947 dollars, soit environ 3% du coût des plateformes commerciales comparables. La plateforme cible trois limitations partagées par tous les systèmes open-source à moins de 1 000 dollars, dont XLeRobot (660 dollars), actuellement le moins cher disponible : un espace de travail figé en hauteur, un contrôle purement réactif, et la destruction des servomoteurs Feetech par blocage mécanique (stall burn-out). Nori Bot répond à ces trois points par un axe Z motorisé de 600 mm intégré sur le bus servo existant, par un Raspberry Pi 4 en client léger couplé au runtime agent proactif OpenClaw permettant de déclencher des tâches physiques via cron jobs et hooks, et par une pile logicielle de sécurité estimant la force de préhension à partir du courant moteur sur des doigts TPU souples, sans capteur dédié. Le code, les fichiers CAD et le manifeste de compétences sont annoncés comme prochainement publiés en open-source. La résolution simultanée de ces trois verrous sous le seuil des 1 000 dollars constitue un signal concret pour les équipes R&D et les intégrateurs en robotique de service. La plage verticale de 600 mm est un prérequis fonctionnel pour la quasi-totalité des tâches réelles de manipulation, ce qui rendait les plateformes économiques existantes peu utilisables hors contexte académique. L'agent proactif OpenClaw marque un décrochage conceptuel par rapport aux robots éducatifs à exécution commandée : le dispositif peut planifier et enchaîner des séquences autonomes, ouvrant la voie à des usages logistiques légers non supervisés. La détection de blocage par lecture de courant moteur, sans accéléromètre ni capteur de force externe, réduit par ailleurs le coût et la complexité de maintenance, premier frein au déploiement de matériel économique en production. La plateforme s'inscrit dans une dynamique plus large qui exploite les composants servo grand public (Feetech, Dynamixel) pour démocratiser la manipulation bimaire, dans la continuité de Low Cost Robot (2023) et XLeRobot (2025). Du côté commercial, les plateformes bi-bras sur base mobile comme celles de Figure, Agility Robotics ou Hello Robot Stretch opèrent à des ordres de grandeur de prix incomparables. Il convient de rappeler que cette publication est un preprint arXiv sans évaluation par les pairs, qu'aucun benchmark standardisé ni déploiement terrain n'est documenté à ce stade, et que les performances réelles dépendront de la mise en ligne du code et des fichiers CAD annoncée pour permettre une validation indépendante.

RecherchePaper
1 source
FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques
1564arXiv cs.RO 

FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques

Une équipe de chercheurs a publié sur arXiv (référence 2605.18047) FUSE, un cadre logiciel pour l'estimation d'état unifiée dans les systèmes SLAM robotiques. Le problème adressé est structurel : les architectures SLAM à couplage serré lient dans un même bloc monolithique le traitement temporel, l'association géométrique locale, la formulation de l'estimateur et la politique de mise à jour de carte, rendant toute modification d'un composant coûteuse. FUSE propose quatre interfaces standardisées (ingestion d'observations, propagation, mise à jour, requête d'état) pour séparer ces responsabilités. L'instanciation LiDAR-IMU a été évaluée sur une séquence corridor bouclée de 418 m et produit une erreur de trajectoire de 1,626 m bout en bout, soit une réduction relative de 7,9 % par rapport à Faster-LIO, meilleure référence sur cette séquence. Le gain de 7,9 % reste modeste, mais l'intérêt principal de FUSE est architectural. Découpler proprement les choix de conception dans un pipeline SLAM permet de changer l'estimateur, adapter la cadence de mise à jour ou intégrer un nouveau type de capteur sans réarchitecturer l'ensemble du système. Pour les intégrateurs d'AMR ou les équipes de navigation industrielle, cela réduit significativement le coût de portage entre plateformes. La gestion explicite de la dégénérescence directionnelle constitue un point technique concret : en environnement corridor, le LiDAR ne perçoit pas de contraintes suffisantes dans l'axe latéral, rendant l'estimation instable. FUSE intègre un mécanisme de correction adaptatif ciblant ces directions faiblement observables, un problème rarement traité proprement dans les frameworks publics existants. Le SLAM LiDAR-IMU est un domaine très concurrentiel. Les références académiques dominantes incluent FAST-LIO2 et Faster-LIO (équipe Cai, HKUST) ainsi que LIO-SAM (Shan et al., MIT). Dans l'industrie, des fournisseurs comme Exotec (France) ou MiR intègrent des stacks de localisation dérivées de ces travaux dans leurs flottes d'AMR. FUSE ne cherche pas à battre ces systèmes sur les benchmarks de performance pure, mais à proposer une abstraction permettant de composer des composants algorithmiques de façon indépendante. Il s'agit d'une prépublication arXiv sans code public annoncé à ce stade, ce qui en fait pour l'instant une contribution académique à valider plutôt qu'un outil industriel prêt à l'emploi. La suite logique serait une mise à disposition open-source permettant de tester des instanciations alternatives, radar ou RGB-D, à travers les mêmes interfaces standardisées.

UEExotec (France) est cité comme exemple d'intégrateur AMR susceptible de bénéficier de l'abstraction architecturale proposée ; une mise à disposition open-source de FUSE réduirait le coût de portage SLAM pour les équipes de navigation industrielle européennes.

RecherchePaper
1 source
REACT : Architecture adaptative pour la navigation en formation continue de robots mobiles à roues
1565arXiv cs.RO 

REACT : Architecture adaptative pour la navigation en formation continue de robots mobiles à roues

Des chercheurs ont déposé sur arXiv (réf. 2605.18441, mai 2026) un article décrivant REACT (Real-time Environment-Adaptive architecture for Continuous formation navigaTion), une architecture hiérarchique pour la navigation en formation de robots mobiles à roues (WMR). L'architecture se divise en deux couches : une couche supérieure qui génère des formations adaptées à l'environnement en temps réel et calcule des affectations robot-cible sans conflits via l'algorithme TCF-R2T (Trajectory-Conflict-Free Robot-to-Target assignment), dont la complexité est garantie polynomiale ; et une couche inférieure où chaque robot exécute JSTP (Joint Spatio-Temporal trajectory Planning), une méthode qui optimise simultanément positions spatiales et durées temporelles pour maintenir la formation en continu. L'ensemble a été validé en simulation et lors d'expériences en conditions réelles, dont les séquences vidéo sont publiées sur le site du projet. La contribution principale de REACT face à l'existant est son adaptabilité dynamique : la grande majorité des travaux publiés sur la navigation en formation impose des configurations prédéfinies, incapables de réagir aux obstacles dynamiques ou à des environnements non balisés. Pour les applications industrielles visées (logistique de transport, surveillance environnementale, opérations de secours), cette rigidité constitue le principal frein au déploiement réel. La garantie polynomiale de TCF-R2T est particulièrement significative sur le plan de la scalabilité : elle indique que le calcul des affectations reste tractable à mesure que la taille de la flotte augmente, contrairement aux approches combinatoires qui deviennent rapidement inextricables. La coordination spatio-temporelle de JSTP réduit par ailleurs les risques de collisions inter-agents lors des transitions de formation, un point de friction classique dans les systèmes multi-robots. La commande de formation de robots mobiles est un champ de recherche actif depuis les années 2000, avec des approches classiques basées sur le suivi de leader, les structures virtuelles ou les champs de potentiel. REACT s'inscrit dans une tendance plus récente vers des architectures hybrides centralisé/distribué, une direction explorée tant dans les milieux académiques que par des éditeurs de flottes AMR tels qu'Exotec ou Balyo côté européen. L'article reste toutefois au stade de la preuve de concept : aucune entreprise partenaire ni timeline de commercialisation n'est mentionnée, et la taille des flottes testées en conditions réelles n'est pas précisée dans le résumé. La prochaine étape logique serait un pilote à plus grande échelle en entrepôt ou en environnement de secours structuré, pour valider le passage à des flottes de taille industrielle.

UELes acteurs européens de flottes AMR comme Exotec et Balyo pourraient bénéficier de cette architecture adaptative si elle est validée à l'échelle industrielle, réduisant un frein clé au déploiement réel de flottes multi-robots.

RecherchePaper
1 source
Génération de graphes de scène 3D actifs à partir de caméras RGB pour robots mobiles d'intérieur
1566arXiv cs.RO 

Génération de graphes de scène 3D actifs à partir de caméras RGB pour robots mobiles d'intérieur

Des chercheurs ont publié le 26 mai 2026 sur arXiv (ref. 2605.18197) un framework permettant de construire des graphes de scène 3D en temps réel à partir de caméras RGB standard uniquement, sans capteur de profondeur dédié (LiDAR ou caméra RGB-D). Le système fonctionne de manière active et incrémentale : le robot sélectionne ses prochains points de vue en fonction de l'état courant du graphe partiellement construit, plutôt que de parcourir une trajectoire prédéfinie. Les expériences menées sur le dataset Replica montrent que le pipeline RGB-only atteint une parité de F1-score avec les baselines utilisant une profondeur ground-truth. Sur ReplicaCAD, l'exploration sémantique active détecte plus du double d'objets qu'une baseline frontier-based géométrique classique, à budget d'exploration identique. Le framework intègre également des caméras fixes externes, permettant d'amorcer le graphe de scène sans coût d'exploration supplémentaire pour le robot. Ce résultat est techniquement significatif parce qu'il décorrèle la construction de représentations métriques 3D riches de la nécessité d'un hardware spécialisé. Jusqu'ici, les scène graphs 3D étaient réservés aux plateformes équipées de capteurs profondeur (Boston Dynamics Spot avec lidar, plateformes AMR comme celles de Locus ou 6 River Systems). Ouvrir ces représentations à des caméras RGB banales abaisse le coût d'entrée et permet d'exploiter des flux vidéo d'infrastructure fixe (CCTV, caméras d'entrepôt) comme source de données complémentaires. La sélection active de viewpoints basée sur la sémantique du graphe, et non sur la géométrie seule, suggère que les VLA (Vision-Language-Action models) embarqués pourraient bénéficier directement de représentations environnementales plus denses et mieux informées. La génération de scene graphs 3D pour la robotique mobile s'appuie sur des travaux antérieurs comme 3D-SGG (CVPR 2020) et les pipelines SLAM-sémantique (SemanticFusion, Hydra de MIT SPARK Lab). La contrainte RGB-only rapproche ce travail des approches monoculaires comme MonoDepth ou DPT, désormais suffisamment robustes pour estimer la géométrie à l'échelle métrique. Les concurrents directs incluent les pipelines basés Open3D-SLAMgraph et les frameworks de mapping neuronaux (NeRF-based mapping). Ce papier est pour l'instant un preprint non peer-reviewed ; aucun déploiement industriel ni partenariat n'est annoncé, et les benchmarks restent sur des environnements simulés, ce qui laisse ouverte la question du sim-to-real gap sur des scènes encombrées réelles.

RecherchePaper
1 source
Insertion robuste d'objets par robot souple à contact adaptatif et récupération d'erreur
1567arXiv cs.RO 

Insertion robuste d'objets par robot souple à contact adaptatif et récupération d'erreur

Des chercheurs d'Omron-SINICX ont publié sur arXiv (réf. 2509.17666) une méthode d'insertion robotique robuste combinant un poignet souple à compliance passive et un modèle vision-langage (VLM) pré-entraîné pour la récupération automatique des échecs. La tâche est structurée en formations de contact séquentielles : chaque étape contraint progressivement les degrés de liberté de la pièce insérée en exploitant la déformation mécanique du poignet pour absorber les chocs, sans capteur de force ni boucle de contrôle haute fréquence. Le VLM analyse les images et poses terminales après chaque tentative, identifie le mode d'échec et sélectionne une stratégie de récupération, la compliance passive rendant les relances répétées intrinsèquement sûres. En simulation, la méthode atteint 83 % de succès face à des incertitudes de préhension jusqu'à 5°, des erreurs de positionnement du logement jusqu'à 20 mm, une friction multipliée par cinq, et des géométries de tenons inédites (carré, rectangulaire). L'approche a aussi été validée sur robot réel, sans métriques chiffrées publiées pour cette phase. L'enjeu opérationnel est direct : l'insertion peg-in-hole reste l'une des tâches de manipulation les plus sensibles aux variations de pose et de friction, exigeant aujourd'hui soit un outillage mécanique dédié (gabarits, guides), soit des capteurs force-couple onéreux avec tuning manuel par référence pièce. La compliance passive supprime le besoin de capteur de force, tandis que le VLM élimine le réentraînement du contrôleur à chaque nouvelle géométrie. Ce couplage mécanique-raisonnement visuel réduit le coût de mise en oeuvre et augmente la résilience aux variations de contexte. Le taux de 83 % en simulation reste néanmoins un indicateur partiel, et l'absence de chiffres publiés pour le robot réel limite les conclusions industrielles directes. Omron est un acteur historique de l'automatisation industrielle japonaise, fabricant de PLCs, capteurs et robots collaboratifs. Son laboratoire SINICX travaille sur la robotique apprenante depuis plusieurs années. La tâche d'insertion est étudiée en robotique depuis les années 1980, mais sa robustesse aux variations de contexte reste un sujet de recherche actif. Les approches concurrentes s'appuient sur le contrôle en force (ABB, FANUC, Universal Robots) ou sur des méthodes d'imitation learning et de modèles VLA. La page projet est accessible publiquement ; aucun pilote industriel ni déploiement commercial n'est annoncé à ce stade.

UELes intégrateurs et équipementiers européens (automobile, électronique) confrontés aux limites des insertions peg-in-hole pourraient à terme bénéficier de cette approche pour réduire le coût de mise en œuvre, mais aucun déploiement ni partenariat européen n'est annoncé.

RecherchePaper
1 source
ManiSoft : vers la manipulation vision-langage pour la robotique souple à continuum
1568arXiv cs.RO 

ManiSoft : vers la manipulation vision-langage pour la robotique souple à continuum

Des chercheurs du laboratoire CoLa de l'université BUAA (Beijing University of Aeronautics and Astronautics) ont publié ManiSoft, un benchmark conçu pour évaluer la manipulation vision-langage sur des bras robotiques souples à continuum. Le jeu de données comprend 6 300 scènes générées automatiquement avec leurs trajectoires expertes correspondantes, réparties en quatre tâches progressives allant de la coordination basique de l'effecteur terminal jusqu'à l'évitement d'obstacles dans des environnements encombrés. Le simulateur développé pour l'occasion couple une dynamique de corps déformables réaliste avec des interactions riches en contact, grâce à une contrainte de force élastique. Le pipeline de génération de trajectoires fonctionne en deux étages : un planificateur de haut niveau décompose chaque tâche en séquences de waypoints, puis une politique d'apprentissage par renforcement de bas niveau génère les commandes de couple pour suivre ces waypoints. ManiSoft s'attaque à un angle mort réel de la recherche en manipulation robotique : la quasi-totalité des travaux sur les modèles vision-langage (VLA) cible des bras rigides à morphologie fixe, qui montrent leurs limites dans les espaces confinés ou encombrés. Les bras souples offrent une déformabilité naturellement adaptée à ces contextes, mais ils posent deux problèmes fondamentaux que le benchmark met en évidence : la proprioception peu fiable (le robot ne sait pas précisément où se trouve son propre corps) et l'actuation distribuée à bas niveau, incompatible avec les abstractions classiques des VLA. Les trois architectures de politiques évaluées obtiennent des résultats corrects en scènes propres, mais accusent une chute de performance significative dès que la randomisation des scènes augmente, ce qui souligne que le sim-to-real gap reste ouvert pour cette catégorie de robots. La robotique souple à continuum reste un domaine de recherche académique, loin des déploiements industriels à grande échelle qu'occupent les bras rigides de Fanuc, KUKA ou Universal Robots. Du côté des acteurs émergents, des startups comme Festo (avec ses bionics) ou des laboratoires européens explorent ces morphologies pour des applications chirurgicales et d'inspection en milieux contraints. ManiSoft ne vise pas pour l'instant à combler directement ce fossé industriel, mais à fournir une base d'évaluation reproductible pour comparer les approches. Le code et les données sont disponibles publiquement, ce qui devrait faciliter l'adoption par la communauté académique. Les prochaines étapes logiques seraient un transfert sim-to-real sur hardware physique et l'intégration de retour haptique pour corriger les dérives proprioceptives identifiées.

RechercheActu
1 source
EgoKit : vers une collecte de données égocentriques unifiée et économique avec des dispositifs hétérogènes
1569arXiv cs.RO 

EgoKit : vers une collecte de données égocentriques unifiée et économique avec des dispositifs hétérogènes

Une équipe de chercheurs a publié en mai 2026 sur arXiv (2605.16797) EgoKit, un kit de collecte de données égocentrées conçu pour fonctionner de manière unifiée sur six types d'appareils hétérogènes : smartphones Android, iPhone, iPad, lunettes connectées et casques de réalité étendue (XR). L'outil expose un workflow d'enregistrement identique sur toutes ces plateformes et produit des vidéos stockées localement dans un format de log uniforme. Sur les casques XR, il enregistre en plus la pose de la tête et un suivi de la main à 26 degrés de liberté (DOF), conforme au standard OpenXR, synchronisé avec les flux vidéo. Des accessoires compagnons, deux caméras de poignet avec supports, un bandeau crânien et un hub USB-C, permettent d'ajouter une vue « wrist-view » à n'importe quel appareil supporté, sans fabrication de matériel sur mesure. La collecte de données égocentrées à grande échelle est devenue un verrou central dans l'apprentissage par imitation et l'entraînement de modèles vision-langage-action (VLA), qui alimentent aujourd'hui les robots humanoïdes et les systèmes d'IA incarnée. Jusqu'ici, chaque plateforme matérielle exposait son propre SDK, ses propres contraintes d'accès à la caméra brute et ses propres limites sur les périphériques USB, forçant les équipes à s'enfermer dans un seul écosystème propriétaire ou à développer des rigs ad hoc non transférables. EgoKit propose une couche d'abstraction commune, ce qui devrait permettre de constituer des datasets plus larges, plus diversifiés et moins biaisés par les contraintes matérielles d'une seule plateforme. La démarche s'inscrit dans un mouvement plus large porté par des projets comme Ego4D (Meta/CMU) ou EPIC-Kitchens, qui ont démontré la valeur des données égocentrées pour la compréhension d'activités et la manipulation. L'enjeu du sim-to-real gap pousse les labos à privilégier les données réelles capturées en conditions naturelles, et EgoKit vise à réduire le coût de cette collecte. Le projet, disponible à l'adresse egokit.chuange.org, en est pour l'instant au stade de publication académique ; aucun partenariat industriel ni déploiement à grande échelle n'est annoncé. La prochaine étape logique serait une validation sur des pipelines d'imitation learning existants pour quantifier l'impact concret de la diversité multi-dispositifs sur la qualité des politiques apprises.

RechercheOpinion
1 source
Suppression rapide des vibrations et suivi de trajectoire d'un manipulateur sériel à liaisons flexibles multiples
1570arXiv cs.RO 

Suppression rapide des vibrations et suivi de trajectoire d'un manipulateur sériel à liaisons flexibles multiples

Des chercheurs ont publié le 22 mai 2026 sur arXiv (référence 2605.17477) un article présentant une nouvelle approche de contrôle pour les manipulateurs robotiques à liaisons flexibles multiples, une classe de bras articulés légers aux avantages structurels réels mais difficiles à stabiliser. Le framework proposé combine une commande par backstepping en sortie (output-feedback) avec un opérateur neuronal DeepONet pour supprimer rapidement les vibrations et maintenir le suivi de trajectoire de l'effecteur terminal. Chaque segment du bras est modélisé comme une poutre de Timoshenko couplée à une équation différentielle ordinaire, transformée en un système PDE hyperbolique canonique avec dynamique aux frontières. Un contrôleur de frontière basé sur le backstepping injecte de l'amortissement distribué le long de la poutre, en n'utilisant que des mesures disponibles aux extrémités. Les expériences ont été conduites sur un manipulateur à deux liaisons flexibles, démontrant une suppression des vibrations et une convergence de l'effecteur significativement plus rapides qu'un régulateur quadratique linéaire (LQR) avec compensation feedforward. L'enjeu industriel derrière ce type de recherche est concret : les manipulateurs flexibles permettent de réduire la masse embarquée et d'augmenter l'espace de travail, deux paramètres critiques pour la robotique collaborative, les bras montés sur mobile, ou les applications spatiales. Leur principal défaut, les oscillations résiduelles en fin de mouvement, pénalise directement les temps de cycle et la précision de placement. L'introduction de DeepONet pour approximer les noyaux de backstepping est la contribution pratique clé : elle réduit drastiquement le coût de calcul en ligne, rendant ce type de commande avancée compatible avec des contrôleurs embarqués à ressources limitées et capable de s'adapter en temps réel aux changements de configuration. Le backstepping pour systèmes distribués (PDEs) est un domaine de contrôle théorique actif depuis une quinzaine d'années, porté notamment par les travaux de Miroslav Krstic (UC San Diego). L'usage des opérateurs neuronaux de type DeepONet pour accélérer ce type de calculs constitue une tendance émergente à l'intersection du machine learning et du contrôle optimal. Sur le plan concurrentiel, les grandes maisons de robotique industrielle (FANUC, KUKA, ABB) gèrent la flexibilité structurelle par du surdimensionnement mécanique ou des vitesses d'opération conservatrices ; des startups comme Machina Labs ou des acteurs de la manipulation légère pourraient bénéficier directement de ce type d'avancée. La prochaine étape logique serait une validation sur un bras à n > 2 liaisons en conditions industrielles réelles, condition nécessaire avant toute intégration produit.

RecherchePaper
1 source
SCAR : apprentissage auto-supervisé de représentations d'actions continues
1571arXiv cs.RO 

SCAR : apprentissage auto-supervisé de représentations d'actions continues

Une équipe de chercheurs a publié début mai 2026 sur arXiv (référence 2605.16412) un framework baptisé SCAR, pour Self-Supervised Continuous Action Representation Learning, visant à apprendre des représentations d'actions unifiées et transférables entre différents robots à partir de simples transitions visuelles. L'architecture repose sur un backbone génératif préentraîné, couplé à deux modules complémentaires : un modèle de dynamique inverse (IDM) qui infère des actions latentes à partir de paires d'observations, et un modèle de dynamique directe (FDM) qui prédit les états futurs conditionnés sur ces actions latentes. Pour éviter que l'espace latent ne devienne un simple goulot d'étranglement visuel générique, les auteurs régularisent la distribution postérieure des actions vers un prior gaussien standard, et introduisent une contrainte d'invariance adversariale pour supprimer les facteurs propres à chaque morphologie de robot ou à chaque environnement. Les expériences sont conduites sur les benchmarks Procgen et Robotwin, et montrent que SCAR surpasse les actions brutes spécifiques à chaque embodiment comme interface de conditionnement pour les world models, notamment en régimes de faibles données. L'enjeu industriel est significatif : l'un des verrous les plus coûteux du déploiement robotique est précisément le besoin de recollecte massive de données à chaque changement de plateforme matérielle. Si une représentation d'action partagée peut effectivement abstraire le "changement contrôlable" indépendamment de l'actuation physique, les intégrateurs pourraient réutiliser des world models pré-entraînés sur un robot pour en adapter un autre avec beaucoup moins d'exemples. SCAR apporte un argument empirique au débat sur la transférabilité des VLA (Vision-Language-Action models) : là où des architectures comme pi-0 ou GR00T N2 s'appuient sur des actions en espace proprioceptif brut, l'approche latente supervisée de façon auto-cohérente pourrait constituer une interface de conditionnement plus robuste. Le contexte est celui d'une compétition intense autour des world models pour la robotique, portée côté industrie par des acteurs comme Physical Intelligence (pi-0), NVIDIA (GR00T), et Figure AI, et côté académique par des travaux sur les modèles d'espace d'état et les représentations de politique. SCAR se distingue en traitant l'action non comme un signal de contrôle auxiliaire mais comme un facteur représentationnel à part entière, ce qui est une position théorique distincte des approches VLA classiques. Les auteurs ne mentionnent pas de code public ni de partenariat industriel dans la prépublication, et les résultats restent à confirmer sur des benchmarks physiques réels, Procgen et Robotwin étant deux environnements de simulation. L'absence de métriques sur du matériel réel est à garder à l'esprit avant toute extrapolation vers des cas industriels.

UESi validé sur matériel physique, ce framework de représentation d'actions transférables pourrait réduire les coûts de ré-entraînement pour les intégrateurs robotiques européens lors du changement de plateforme matérielle.

RechercheOpinion
1 source
Capteurs optiques bidirectionnels pour le suivi des actionneurs (BOAT) dans les systèmes à treillis souples
1572arXiv cs.RO 

Capteurs optiques bidirectionnels pour le suivi des actionneurs (BOAT) dans les systèmes à treillis souples

Des chercheurs ont déposé sur arXiv (ref. 2605.18482) la description d'un capteur optique intégrable dans des structures robotiques souples à base de treillis (lattice), un segment en croissance rapide en soft robotics. Le dispositif, nommé BOAT (Bidirectional Optical sensor for Actuation Tracking), repose sur deux guides d'ondes photoniques à surface texturée arrangés en géométrie ellipsoïdale, co-imprimés directement avec la structure lattice lors de la fabrication. L'actionnement est assuré par un muscle pneumatique artificiel (PAM) intégré ; lors de l'élongation ou de la contraction du PAM, la flexion des guides d'ondes produit des variations de signal optique permettant de distinguer les états de compression et d'extension. Les performances ont été caractérisées sur 100 cycles de pression consécutifs balayant de +50 kPa à -40 kPa, avec une réponse décrite comme hautement répétable. Le retour capteur est exploité pour implémenter un jumeau numérique (digital shadow), assurant une synchronisation continue entre l'unité physique sensorisée et son homologue virtuel. Le défi que résout BOAT est structurel : dans les architectures lattice souples, la déformation globale est distribuée et non localisée, ce qui rend les capteurs ponctuels classiques (jauges de contrainte, encodeurs) peu adaptés. Distinguer compression et extension en temps réel est une condition nécessaire au contrôle en boucle fermée de ces actionneurs. La co-impression élimine les problèmes d'adhésion et de délocalisation des capteurs rapportés. Pour les équipes travaillant sur des organes de préhension, des exosquelettes ou des robots à morphologie variable, ce type de solution proprioceptive embarquée évite l'ajout de composants rigides externes. L'instrumentation optique des structures souples, initialement centrée sur les fibres FBG (Fiber Bragg Grating), évolue vers des approches co-fabricables par impression 3D multi-matériaux, et ce preprint s'inscrit dans cette tendance. Il s'agit d'un prototype de laboratoire validé en conditions contrôlées, pas d'un produit disponible : aucun partenaire industriel ni calendrier de transfert ne sont mentionnés. Les perspectives déclarées portent sur la généralisation à des géométries lattice 3D plus complexes et l'intégration dans des boucles de contrôle complètes. Le domaine compte des acteurs comme Festo (bionic cobot arms), Soft Robotics Inc. ou des laboratoires comme le Wyss Institute, mais aucun concurrent direct n'est cité dans le preprint.

RecherchePaper
1 source
Comment instruire un robot : les annotations linguistiques denses améliorent l'apprentissage de politiques
1573arXiv cs.RO 

Comment instruire un robot : les annotations linguistiques denses améliorent l'apprentissage de politiques

Des chercheurs publient DeMiAn (Dense Multi-aspect Annotation), une méthode en deux étapes pour améliorer l'apprentissage de politiques robotiques sans collecter de nouvelles démonstrations. Elle ré-annote automatiquement des segments existants via un modèle vision-langage selon quatre axes complémentaires : mouvement physique, composition de la scène, posture du bras et raisonnement. Un module « instructeur » traduit ensuite, à chaque déploiement, une description de tâche et un instantané de scène initiale vers l'annotation la plus adaptée, de façon asynchrone afin de masquer la latence de génération derrière l'exécution de la politique. Évaluée sur plus d'un million de clips de manipulation robotique et 50 000 vidéos égocentrées humaines issues d'EgoVerse, la méthode améliore à la fois une politique vision-langage-action (VLA) classique et un world-action model vidéo. Sur le benchmark RoboCasa, l'instructeur gagne cinq points de taux de succès sur une baseline limitée à la description de tâche seule, et reste à trois points d'un oracle disposant d'annotations parfaites par tâche. Le principal frein au scaling en robotique manipulatrice n'est pas le compute mais le coût de collecte de démonstrations physiques. DeMiAn inverse la contrainte : ré-annoter un corpus existant avec du langage dense revient nettement moins cher que rejouer des trajectoires en environnement réel. La méthode améliore également les performances sur les tâches composites et en distribution de test hors domaine, là précisément où les politiques VLA échouent le plus fréquemment en déploiement. Résultat non trivial : aucun des quatre axes d'annotation ne domine systématiquement l'ensemble des tâches, ce qui fait du choix de la description dense un problème de recherche à part entière. Les gains sont de surcroît calculés en intégrant le coût de génération des annotations en FLOPs, garantissant des comparaisons compute-performance honnêtes, une rigueur peu fréquente dans ce segment. Ce travail s'inscrit dans la valorisation croissante des datasets égocentrés humains (EgoVerse, EPIC-Kitchens) comme ressources pour pré-entraîner des politiques de manipulation, en alternative aux pipelines de simulation massive de type IsaacLab. Du côté compétitif, Physical Intelligence avec Pi-0 et Google DeepMind avec RT-X misent également sur la supervision langage-action à grande échelle. DeMiAn se distingue par son caractère post-hoc : aucune modification du protocole de collecte n'est requise, ce qui le rend directement applicable à des corpus robotiques institutionnels existants. Le papier (arXiv 2605.17077, mai 2025) reste un preprint sans validation hardware end-to-end au-delà des benchmarks simulés, laissant ouverte la question du sim-to-real gap sur les gains annoncés.

RechercheOpinion
1 source
Cadre d'apprentissage par tranches pour l'identification en ligne des perturbations dans le contrôle d'attitude SO(3) d'un quadrotor
1574arXiv cs.RO 

Cadre d'apprentissage par tranches pour l'identification en ligne des perturbations dans le contrôle d'attitude SO(3) d'un quadrotor

Des chercheurs ont publié sur arXiv (identifiant 2508.14422, version 4) un framework d'apprentissage géométrique appelé "Sliced Learning", conçu pour l'identification en ligne de perturbations dans le contrôle d'attitude des quadrotors selon le groupe de rotations SO(3). Le coeur du système est le module SANM (Sliced Adaptive-Neuro Mapping), qui décompose le problème d'identification de haute dimension en plusieurs sous-mappings de faible dimension, chacun traité par un réseau de neurones peu profond combiné à des lois adaptatives. Ces composants sont mis à jour en ligne via une adaptation basée sur les fonctions de Lyapunov, à une fréquence de 400 Hz, sur des microcontrôleurs à ressources limitées de type STM32. La convergence exponentielle du système est démontrée mathématiquement malgré des perturbations variables dans le temps et des incertitudes sur les moments d'inertie, et les résultats sont validés par des expériences en conditions réelles. L'intérêt principal de ce travail réside dans la capacité d'adaptation neuronale en temps réel à 400 Hz sur un MCU embarqué classique, un seuil rarement atteint dans la littérature sur le contrôle adaptatif des drones. Contrairement aux approches conventionnelles qui apprennent à partir des états du système, la stratégie "learning-from-error" exploite la représentation d'erreur en algèbre de Lie, ce qui préserve la structure géométrique intrinsèque de SO(3) et autorise une décomposition axiale du problème. Pour les intégrateurs de systèmes drones et les équipes de contrôle embarqué, cela représente un module d'identification de perturbations à la fois léger, interprétable et certifiable sur le plan de la stabilité, trois critères déterminants pour des applications industrielles ou de défense. Le contrôle d'attitude géométrique des quadrotors sur SO(3) est un domaine actif depuis les années 2010, avec des travaux fondateurs de Lee, Leok et McClamroch qui ont formalisé des contrôleurs évitant les singularités des angles d'Euler. L'identification de perturbations en ligne reste un verrou face aux vents, variations de charge et dérives d'inertie, et les approches neuronales existantes sont généralement trop lourdes pour tenir sur MCU embarqué, forçant le recours à des calculateurs plus puissants. Ce travail se positionne dans cet espace de contrainte, avec une validation hardware sur STM32, mais sans annoncer de déploiement commercial ni de partenariat industriel à ce stade, ce qui le situe clairement au niveau de la preuve de concept académique.

RecherchePaper
1 source
Au-delà de la géométrie : navigation topologique efficace dans des environnements 3D complexes
1575arXiv cs.RO 

Au-delà de la géométrie : navigation topologique efficace dans des environnements 3D complexes

Des chercheurs ont publié sur arXiv (réf. 2605.17302) un framework de planification de trajectoire pour robots mobiles terrestres opérant dans des environnements intérieurs 3D complexes. Le système extrait automatiquement depuis un nuage de points 3D un espace d'états réduit composé uniquement des positions physiquement atteignables par le robot, en appliquant trois contraintes successives : support au sol vérifié, dégagement vertical suffisant pour la hauteur du robot, et connectivité sémantique via propagation par graine (seed-based). Évalué sur cinq scènes issues du dataset Matterport3D et trois scènes du benchmark PCT, le framework atteint une réduction de l'espace d'états supérieure à 80 % par rapport au voxel space brut, avec des temps de recherche A* inférieurs à la milliseconde sur les scènes Matterport3D. Le taux de succès de planification est de 100 % sur 300 requêtes testées. L'enjeu technique central que ce travail adresse est l'ambiguïté géométrique : dans un environnement intérieur dense, les surfaces de meubles (tables, étagères) partagent localement les mêmes propriétés géométriques que le sol navigable. Les approches purement géométriques confondent fréquemment ces surfaces, générant des trajectoires invalides ou des blocages de planification. En imposant une contrainte topologique explicite plutôt que de s'appuyer uniquement sur la courbure ou la normale de surface, le framework sépare structurellement le sol du reste. Pour les intégrateurs de flottes AMR ou AGV en entrepôt ou milieu hospitalier, cette distinction fiable entre navigable et non-navigable sans calibrage manuel représente un gain opérationnel direct, en particulier dans des espaces reconfigurés fréquemment. Ce type d'approche s'inscrit dans un mouvement plus large visant à dépasser les représentations voxel denses, trop coûteuses pour la planification temps-réel embarquée. Des travaux concurrents explorent les champs de distance neuronaux (NeRF-based planning), les graphes de visibilité sur maillages 3D, ou les approches d'apprentissage par renforcement simulé (sim-to-real). Le recours à des datasets standardisés comme Matterport3D et PCT facilite la comparaison reproductible, même si les scènes testées restent des environnements statiques sans agents dynamiques. Les auteurs n'annoncent pas de déploiement matériel, ce qui positionne ce travail comme une contribution algorithmique amont, dont l'intégration dans des stacks robotiques industriels (ROS 2, Nav2) reste à démontrer sur robot physique.

RecherchePaper
1 source
PLATO Hand : des ongles pour affiner le comportement de contact et améliorer la précision de la saisie
1576arXiv cs.RO 

PLATO Hand : des ongles pour affiner le comportement de contact et améliorer la précision de la saisie

La PLATO Hand, présentée dans un article de recherche en prépublication sur arXiv (février 2026), est une main robotique dextère dont le bout de doigt hybride combine trois composants mécaniques : un ongle rigide, une phalange distale intégrée et une pulpe souple. Cette architecture organise la manière dont le contact est initié, soutenu et transmis lors de la manipulation, sans capteurs tactiles externes. Pour dimensionner ce bout de doigt, les auteurs ont développé un modèle basé sur l'énergie de déformation (bending-indentation model) reliant la rigidité des matériaux à la répartition des déformations au point de contact. En validation expérimentale, la main a exécuté avec succès trois tâches de manipulation fine sensibles aux arêtes : la singulation de feuilles de papier (séparer une feuille d'une pile), le ramassage de cartes à jouer et l'épluchage d'une orange. Les résultats montrent une meilleure stabilité en pince (pinch stability), une meilleure transmission des forces de contact en configuration dorsale via l'ongle, et une observabilité proprioceptive améliorée, c'est-à-dire une meilleure capacité à déduire les forces de contact à partir des retours articulaires internes. Ces résultats intéressent directement les concepteurs de systèmes de manipulation industrielle, car ils indiquent qu'une couche de conception mécanique au niveau du contact peut améliorer la robustesse de la manipulation fine sans multiplier les capteurs. L'observabilité proprioceptive améliorée est particulièrement notable : estimer les forces de contact depuis les actionneurs existants réduit la dépendance aux capteurs tactiles distribués, coûteux et fragiles en environnement de production. La démonstration sur des tâches comme l'épluchage d'orange ou la singulation de papier cible explicitement le fossé entre démonstration robotique en laboratoire et applicabilité industrielle réelle, un des verrous les plus cités dans le secteur. La PLATO Hand s'inscrit dans un courant de recherche sur les mains dextères hybrides, à mi-chemin entre les approches entièrement rigides (Shadow Hand, Allegro Hand, LEAP Hand) et les mains entièrement souples. Ces mains existantes n'intègrent pas de structuration spécifique de la surface de contact au niveau distal ; la PLATO Hand y ajoute une couche inspirée de la morphologie humaine. Le travail reste à ce stade une démonstration de laboratoire en prépublication (version v2), sans annonce de commercialisation ni de partenariat industriel confirmé. Les suites naturelles incluent l'intégration sur un bras complet et des tests de durabilité en conditions réelles, deux étapes indispensables avant toute validation industrielle.

RecherchePaper
1 source
MORN : régulation métacognitive des objectifs pour une navigation à long horizon économe en ressources
1577arXiv cs.RO 

MORN : régulation métacognitive des objectifs pour une navigation à long horizon économe en ressources

Des chercheurs ont publié MORN (Metacognitive Object-goal Regulation Navigation) sur arXiv (2605.16932), une architecture de contrôle exécutif conçue pour les robots autonomes chargés de missions longues et séquentielles dans des environnements non structurés. Le scénario typique visé : un robot doit localiser successivement une tasse, une chaise, puis une imprimante dans un bâtiment inconnu, avec des contraintes strictes de temps et d'énergie. Évalué sur le dataset HM3D (Habitat-Matterport 3D), MORN améliore le taux de complétion des objectifs (Goal Completion Rate) de 0,23 à 0,30, soit une progression de 30 %, tout en réduisant la fraction de pas gaspillés (Wasted Step Fraction) de 0,90 à 0,70. L'architecture s'intègre sans modification des backbones de navigation existants, ce qu'elle augmente via un meta-contrôleur plug-in. Le problème adressé est concret et sous-estimé dans la littérature robotique : les agents ObjectNav modernes basés sur des VLMs (Vision-Language Models) sont purement réactifs. Ils localisent des cibles sémantiques efficacement, mais ignorent totalement l'état global de la mission. Résultat : ils s'acharnent sur des sous-objectifs devenus inatteignables, épuisant batterie et temps sur ce que les auteurs appellent des "zombie goals". Pour les intégrateurs et COOs qui évaluent des flottes de robots mobiles en entrepôt ou en milieu hospitalier, c'est un vrai point de friction opérationnel. MORN propose d'y remédier via trois états neuro-cognitifs formalisés : le Potentiality Index (estimation de la faisabilité d'un sous-objectif), le Persistence Gating (décision d'abandon anticipé), et l'Evidence Accumulation (agrégation perceptuelle pour réduire l'incertitude). Ce mécanisme est présenté comme une neutralisation du biais du coût irrécupérable ("Sunk Cost Fallacy"), appliqué à la planification robotique. L'inspiration théorique est explicitement la Dual-Process Theory issue des sciences cognitives, popularisée par Kahneman : System 1 (locomotion réactive, rapide) supervisé par un System 2 (méta-raisonnement, lent et global). Ce cadre conceptuel est mobilisé dans la robotique depuis quelques années, notamment dans les travaux sur les agents LLM incarnés, mais son application formalisée à la gestion de ressources en ObjectNav reste peu explorée. Le champ concurrent direct inclut les architectures VLM-as-planner (SQA3D, EmbodiedScan, ESC) et les méthodes end-to-end de navigation zéro-shot. Aucun déploiement industriel n'est annoncé à ce stade : il s'agit d'une contribution de recherche académique, avec des résultats sur simulateur uniquement. La question du transfert sim-to-real sur hardware physique reste ouverte, ce qui est le principal écart à surveiller avant toute considération d'intégration.

RecherchePaper
1 source
PH-Dreamer : un modèle du monde piloté par la physique via la dynamique générative port-hamiltonienne
1578arXiv cs.RO 

PH-Dreamer : un modèle du monde piloté par la physique via la dynamique générative port-hamiltonienne

Des chercheurs ont publié PH-Dreamer (arXiv:2605.18303, mai 2026), une architecture de modèle du monde intégrant un cadre Port-Hamiltonien dans les réseaux récurrents à espace d'état utilisés en apprentissage par renforcement basé sur des modèles. L'approche combine trois mécanismes couplés : des priors physiques dans les transitions latentes via un routage d'énergie contrôlé par flux et dissipation, un modèle d'énergie estimant le Hamiltonien et le bilan de puissance à partir d'observations proprioceptives, et un Actor-Critic guidé par énergie avec multiplicateurs de Lagrange pour régulariser l'optimisation de politique. Evaluée sur des benchmarks de contrôle visuel, l'architecture réduit le volume de l'espace de phase latent de 4,18 à 8,41 %, la consommation d'énergie simulée jusqu'à 7,80 %, et le jerk quadratique moyen (mesure de la brutalité des transitions de commande) jusqu'à 9,38 %, tout en améliorant les rendements asymptotiques. L'enjeu central est la fidélité physique des simulateurs internes : les modèles du monde conventionnels opèrent dans un espace latent non contraint, produisant des trajectoires qui violent la conservation d'énergie et les principes dissipatifs. Pour un ingénieur de contrôle ou un intégrateur robotique, un simulateur interne mieux calibré réduit l'écart sim-to-real et améliore la robustesse au transfert vers des systèmes physiques. La réduction de jerk est mécaniquement pertinente : des commandes plus lisses diminuent l'usure des actionneurs sur des robots réels. Le résultat le plus significatif reste la réduction de variance entre récompenses imaginées et réelles, indicateur de calibration du modèle plutôt que simple gain de tâche, ce qui constitue une contribution exploitable concrètement pour le transfert sim-to-real en robotique de manipulation. PH-Dreamer s'inscrit dans la lignée des travaux Dreamer de Google DeepMind (Hafner et al.), référence en RL basé sur modèle pour le contrôle visuel à faible nombre d'échantillons. L'intégration du formalisme Port-Hamiltonien dans les réseaux de neurones est un champ actif depuis les Hamiltonian Neural Networks de Greydanus et al. (2019) et les réseaux lagrangiens neuronaux. PH-Dreamer étend cette logique aux modèles récurrents génératifs complets, là où les travaux précédents se limitaient à des systèmes plus simples. Il s'agit d'un preprint de recherche fondamentale sans déploiement industriel annoncé. Les prochaines étapes naturelles incluent des validations sur robots physiques avec proprioception réelle et des comparaisons directes avec DreamerV3 et TD-MPC2 en conditions de transfert réel.

RecherchePaper
1 source
TACO : optimisation par consensus temporel pour la cartographie neurale continue
1579arXiv cs.RO 

TACO : optimisation par consensus temporel pour la cartographie neurale continue

Une équipe de recherche propose TACO (TemporAl Consensus Optimization), un framework de cartographie neurale continue publié sur arXiv (arXiv:2602.04516v3). L'idée centrale consiste à reformuler la construction de cartes comme un problème d'optimisation par consensus temporel : au lieu de stocker et rejouer des observations passées, TACO traite les versions antérieures du modèle de carte lui-même comme des "voisins temporels". Concrètement, la mise à jour de la carte courante est contrainte par un consensus pondéré avec ces instantanés historiques, ce qui permet aux zones géométriquement fiables du passé de guider l'optimisation, tout en laissant les régions obsolètes se réviser librement face aux nouvelles observations. Les auteurs valident l'approche sur des expériences simulées et en environnement réel, où TACO surpasse les baselines de continual learning existantes. L'enjeu industriel est direct : les systèmes de cartographie neurale implicite (de type NeRF ou occupancy networks) offrent des représentations denses et différentiables attractives pour la navigation robotique, mais leur déploiement réel bute sur deux contraintes dures. Premièrement, les environnements changent, un entrepôt, un chantier ou un hôpital n'est jamais statique. Deuxièmement, les méthodes actuelles supposent des scènes fixes ou exigent des buffers de replay coûteux en mémoire, incompatibles avec les contraintes embarquées des robots mobiles. TACO adresse les deux en supprimant le replay : la mémoire requise ne croît pas avec le nombre d'observations, et le modèle s'adapte aux changements sans oublier catégoriquement les structures stables. C'est un avantage mesurable pour les intégrateurs qui dimensionnent du matériel edge ou qui déploient sur des flottes à ressources limitées. La cartographie neurale continue est un problème ouvert depuis que les représentations implicites (iMap, NICE-SLAM, puis leurs successeurs) ont montré leur supériorité sur les cartes voxéliques classiques pour la précision et la compacité. Le verrou du "catastrophic forgetting" en continual learning est connu depuis les années 1990, mais son application aux cartes 3D temps-réel est récente. Les approches concurrentes s'appuient principalement sur la distillation de connaissances, les regularizers de type EWC (Elastic Weight Consolidation), ou des buffers de replay explicites. TACO se distingue en exploitant l'historique du modèle lui-même comme source de régularisation, sans données stockées. Les prochaines étapes naturelles incluent l'intégration dans des pipelines SLAM complets et des tests à plus longue durée dans des environnements fortement dynamiques.

RecherchePaper
1 source
Priorité aux gestes, voix assistée par LLM : téléopération 'Puppeteer' via un double virtuel en réalité augmentée
1580arXiv cs.RO 

Priorité aux gestes, voix assistée par LLM : téléopération 'Puppeteer' via un double virtuel en réalité augmentée

Une équipe de chercheurs a publié sur arXiv (2506.13189) une étude comparative portant sur la téléopération de robots via réalité augmentée. Leur système, baptisé "puppeteer", utilise un casque Meta Quest 3 pour permettre à un opérateur de piloter un robot physique en interagissant avec son jumeau virtuel superposé dans l'espace réel. Deux modalités ont été testées en protocole intra-sujet avec 42 participants : geste seul (GO) et combinaison voix assistée par grand modèle de langage (LLM) plus geste (VG), sur une tâche de pick-and-place avec correspondance de motifs. Dans la condition VG, la voix gérait la navigation de haut niveau tandis que le geste assurait la manipulation fine, selon une allocation séquentielle des rôles et non une interaction simultanée. Les résultats montrent que la modalité geste seul offre actuellement un contrôle plus fiable et plus efficace pour les tâches à contrainte temporelle forte. L'ajout de commandes vocales via LLM introduit de la flexibilité mais génère une latence supplémentaire et des erreurs de reconnaissance qui augmentent la charge cognitive de l'opérateur. Ce constat nuance une hypothèse courante dans la communauté HRI (human-robot interaction) : l'accumulation de modalités n'est pas universellement bénéfique. Pour les intégrateurs et décideurs industriels, cela signifie que la multimodalité doit être traitée comme une stratégie adaptative, calibrée au profil de l'utilisateur et à la nature de la tâche. L'étude révèle par ailleurs que l'expertise robotique préalable des participants différencie significativement les performances et l'expérience utilisateur selon les conditions. La téléopération par réalité augmentée s'inscrit dans un effort plus large visant à abaisser la barrière d'entrée au pilotage de robots pour des opérateurs non spécialisés. Des approches concurrentes incluent la téléopération en vue subjective (first-person), les interfaces haptiques et les méthodes d'apprentissage par démonstration directe. La métaphore "puppeteer" se distingue par l'usage d'un double virtuel colocalisé, distinct des flux vidéo classiques. Les auteurs formalisent leurs conclusions en un ensemble de directives de conception pour ce type d'interface, insistant sur la nécessité d'adapter dynamiquement les modalités disponibles au contexte d'usage. Les prochaines étapes naturelles concerneront des tests sur des robots à degrés de liberté (DOF) plus élevés et des environnements industriels réels, au-delà du cadre contrôlé de laboratoire.

RecherchePaper
1 source
Apprentissage par renforcement visuel avec politique primitive séparée pour l'assemblage par emboîtement
1581arXiv cs.RO 

Apprentissage par renforcement visuel avec politique primitive séparée pour l'assemblage par emboîtement

Des chercheurs ont publié sur arXiv (référence 2504.14820) une approche de reinforcement learning visuel baptisée Separate Primitive Policy (S2P), conçue pour automatiser les tâches d'assemblage par insertion cheville-trou (peg-in-hole). La méthode s'inspire du comportement humain en vision binoculaire : un opérateur localise d'abord visuellement la cheville au-dessus de la surface cible, puis exécute l'insertion. S2P décompose ce processus en deux primitives apprises simultanément, la localisation et l'insertion, dans un cadre de reinforcement learning sans modèle (model-free). Les auteurs ont développé dix tâches d'insertion distinctes utilisant des formes polygonales variées comme banc d'essai standardisé, ont conduit des expériences en simulation avec contraintes de force, puis validé l'approche sur robot réel. L'intérêt principal de S2P réside dans son gain de sample efficiency, c'est-à-dire la capacité à apprendre une politique efficace avec moins d'interactions avec l'environnement, combiné à une amélioration du taux de succès même lorsque des contraintes de force sont imposées. Pour les intégrateurs industriels, c'est un signal concret : l'assemblage fin, encore largement opéré par des systèmes rigides à programmation manuelle, devient plus accessible à l'apprentissage automatique en présence de retour visuel. La compatibilité affichée avec n'importe quel algorithme RL model-free élargit le spectre d'application, même si les performances absolues restent à confirmer hors des conditions de laboratoire présentées dans le papier. Le peg-in-hole est un benchmark historique en manipulation robotique, standardisé notamment dans le cadre des compétitions NIST Assembly Task Board. Des approches concurrentes combinent typiquement vision et retour d'effort (force-torque control), ou s'appuient sur des politiques d'imitation comme les VLA (Vision-Language-Action models) de Physical Intelligence (Pi-0) ou les travaux de simulation massive de NVIDIA Isaac Lab. S2P se positionne dans un espace différent, celui du RL visuel pur avec décomposition de primitives, une direction que des équipes comme celles de DeepMind et CMU explorent également. Les prochaines étapes naturelles concernent la robustesse aux variations d'éclairage, aux tolérances mécaniques réelles, et la généralisation à des géométries non vues en entraînement.

UEImpact indirect : les équipes R&D et intégrateurs industriels européens travaillant sur l'assemblage automatisé peuvent intégrer S2P dans leur veille sur le RL visuel pour la manipulation fine, sans déploiement ni acteur européen directement impliqué.

RecherchePaper
1 source
Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes
1582arXiv cs.RO 

Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes

Une équipe de chercheurs a publié sur arXiv (référence 2507.16481, troisième version) une méthode d'apprentissage par renforcement guidé destinée à permettre aux robots quadrupèdes d'effectuer des sauts omnidirectionnels en trois dimensions. L'approche combine des courbes de Bézier, classiquement utilisées pour la planification de trajectoires lissées, avec un modèle de mouvement rectiligne uniformément accéléré (UARM), qui encode une intuition physique du saut directement dans la boucle d'entraînement. Les résultats sont validés en simulation et sur robot réel, mais le résumé ne précise ni la plateforme matérielle utilisée ni les métriques chiffrées de performance, ce qui limite l'évaluation indépendante de la contribution. L'intérêt principal de ce travail réside dans l'adresse simultanée de deux limitations majeures des approches existantes. Les méthodes d'optimisation classiques (MPC, trajectory optimization) produisent des sauts contrôlables mais exigent une connaissance fine des paramètres du robot et du terrain, ce qui fragilise leur robustesse en conditions réelles. À l'inverse, l'apprentissage par renforcement bout-en-bout souffre d'une complexité d'échantillonnage élevée, de millions de simulations nécessaires, et d'une imprévisibilité des trajectoires qui complique la certification de sécurité, un prérequis non négociable pour les déploiements industriels. En injectant une structure physique dans la boucle d'entraînement, les auteurs visent à réduire le coût d'apprentissage tout en produisant des mouvements explicables, dont la logique peut être auditée et certifiée. Le saut dynamique pour robots quadrupèdes est un problème ouvert depuis plusieurs années, car il concentre les défis du transfert sim-to-réel : contacts impulsionnels, rigidité des actionneurs, imprécision des estimations d'état. Le Robotics Systems Lab d'ETH Zurich (ANYmal) et les équipes de l'UC Berkeley ont déjà démontré des sauts via RL pur, tandis que Boston Dynamics et Unitree intègrent ces capacités dans leurs plateformes commerciales. Ce papier s'inscrit dans la tendance des approches hybrides modèle-apprentissage, qui cherchent à concilier la robustesse du RL avec la prévisibilité des méthodes analytiques, une direction que poursuivent également des équipes européennes comme le LAAS-CNRS ou l'INRIA.

UEDes équipes européennes comme le LAAS-CNRS et l'INRIA travaillent sur des approches hybrides modèle-apprentissage similaires pour la locomotion quadrupède, ce travail s'inscrit dans un domaine de recherche où l'Europe est présente mais sans impact direct immédiat.

RecherchePaper
1 source
AffordVLA : intégration de représentations d'affordance dans les modèles vision-langage-action (VLA) par alignement implicite de caractéristiques
1583arXiv cs.RO 

AffordVLA : intégration de représentations d'affordance dans les modèles vision-langage-action (VLA) par alignement implicite de caractéristiques

Des chercheurs ont déposé en mai 2026 sur arXiv (arXiv:2605.17517) un papier présentant AffordVLA, un framework qui améliore la précision des modèles Vision-Langage-Action (VLA) en robotique de manipulation. Le problème central: les VLA actuels encodent l'apparence globale des objets mais peinent à localiser les zones d'interaction fonctionnelle, les affordances, telles que le point de préhension ou la surface de contact optimale. AffordVLA injecte ces représentations d'affordance directement dans les couches visuelles intermédiaires du VLA via un alignement implicite, sans annotation supplémentaire ni module de perception externe. Un "teacher" d'affordance zero-shot extrait des cartes fonctionnelles conditionnées par l'instruction en langage naturel, puis les aligne avec les représentations internes du modèle pendant l'entraînement. Les expériences en simulation et en environnement réel rapportent des performances supérieures aux baselines, avec un taux de succès en manipulation amélioré, sans que l'abstract ne publie de métriques absolues chiffrées. Ce gap entre apparence globale et localisation fonctionnelle est l'un des facteurs limitants du sim-to-real gap en manipulation non structurée: les systèmes réussissent en laboratoire contrôlé mais échouent dès que l'éclairage, le fond ou la pose de l'objet varient. En internalisant la perception d'affordance dans le VLA lui-même, AffordVLA évite les erreurs en cascade des architectures hybrides couplant un VLA à un module de segmentation externe, et n'alourdit pas le temps d'inférence, un critère déterminant pour les déploiements industriels en temps réel. La suppression de la dépendance aux masques annotés réduit également le coût de mise en données pour les intégrateurs, ce qui élargit la portée pratique de l'approche. AffordVLA s'inscrit dans l'accélération des travaux académiques autour des VLA depuis RT-2 (Google DeepMind, 2023), dans un secteur aujourd'hui dominé par des systèmes propriétaires comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure AI). Ce courant cherche à améliorer le grounding spatial sans refonte architecturale complète, une approche plus accessible pour les laboratoires sans les moyens de Physical Intelligence ou de Figure. Le papier reste un preprint non peer-reviewed; aucun partenariat industriel ni déploiement terrain n'est mentionné. La suite logique serait une validation sur des benchmarks standardisés comme BridgeV2 ou OpenX-Embodiment, et une intégration dans des pipelines open-source comme LeRobot ou OpenVLA.

RechercheOpinion
1 source
Asservissement visuel à événements bio-inspiré pour robots terrestres
1584arXiv cs.RO 

Asservissement visuel à événements bio-inspiré pour robots terrestres

Des chercheurs ont publié sur arXiv (référence 2603.23672v2) un framework de servoing visuel événementiel 1D pour robots terrestres évoluant en environnements structurés. L'approche repose sur un capteur de vision dynamique (DVS), une caméra bio-inspirée qui ne génère des signaux, appelés "événements", qu'en réponse à des variations locales de luminance logarithmique, contrairement aux caméras classiques à trame fixe. En appliquant un noyau spatial fixe au flux d'événements asynchrones produit par des motifs d'intensité structurés, les auteurs montrent analytiquement que le flux d'événements net isole des combinaisons spécifiques d'états cinématiques : un profil spatial linéaire extrait la vitesse du robot, un profil quadratique extrait le produit position-vitesse. En combinant plusieurs motifs simultanément, le système synthétise directement un terme de retour d'état non linéaire, sans passer par une estimation d'état traditionnelle (pas de filtre de Kalman, pas d'odométrie). Pour contourner la perte d'observabilité linéaire à l'équilibre, problème inhérent aux capteurs événementiels qui cessent de générer des signaux en l'absence de mouvement, les auteurs proposent un contrôleur en cycle limite actif, directement inspiré des comportements de fixation oculaire observés chez les animaux. Le tout a été validé expérimentalement sur un véhicule autonome à l'échelle 1/10. L'intérêt principal de ce travail réside dans l'élimination de l'estimation d'état explicite du pipeline de contrôle, ce qui réduit structurellement la latence et la charge computationnelle, deux contraintes critiques pour les robots mobiles rapides ou embarqués sur matériel contraint. Le fait que la séparation des états cinématiques soit obtenue analytiquement, et non par apprentissage, constitue un avantage de robustesse : le comportement est prédictible et formellement borné. L'approche adresse aussi un angle mort connu des capteurs DVS : leur insensibilité à l'état statique, qui rend le contrôle à l'équilibre difficile avec des méthodes classiques. Le cycle limite bio-inspiré contourne ce problème sans injection de bruit artificiel. Les capteurs DVS (commercialisés notamment par Prophesee en France et iniVation en Suisse) suscitent un intérêt croissant en robotique mobile depuis une décennie, portés par leur latence sub-milliseconde et leur dynamique de 120 dB, mais leur intégration dans des boucles de contrôle fermées reste un défi algorithmique non trivial. Ce papier s'inscrit dans un courant de recherche actif sur le "event-based control" qui tente de dépasser le stade de la démonstration perceptive pour atteindre le contrôle en boucle fermée robuste. Les concurrents conceptuels incluent les approches par flot optique événementiel (groupes de Davide Scaramuzza à Zurich, Tobi Delbruck à ETH) et les méthodes de servoing visuel classique accélérées par GPU. La validation sur véhicule 1/10 reste modeste en échelle ; les prochaines étapes naturelles seraient une extension à la navigation 2D et des tests sur plateformes de taille réelle en conditions non structurées.

UEProphesee (France) et iniVation (Suisse), principaux fabricants commerciaux de capteurs DVS, bénéficient directement de l'intérêt croissant pour ces architectures de contrôle événementiel en boucle fermée, consolidant la position de l'écosystème EU dans la chaîne de valeur de la robotique mobile embarquée.

RecherchePaper
1 source
Robo-Cortex : un agent à base d'IA incarnée auto-évolutif grâce à la mémoire cognitive à double granularité et l'induction autonome de connaissances
1585arXiv cs.RO 

Robo-Cortex : un agent à base d'IA incarnée auto-évolutif grâce à la mémoire cognitive à double granularité et l'induction autonome de connaissances

Publié mi-mai 2026 sur arXiv (2605.18729), Robo-Cortex est un framework d'agent incarné à auto-évolution conçu pour la navigation robotique en environnements inconnus. L'architecture combine trois briques : un mécanisme d'Induction Autonome de Connaissances (AKI) distillant trajectoires et expériences en heuristiques formulées en langage naturel ; une Mémoire Cognitive à Double Grain, avec mémoire réflexive à court terme (SRM) pour l'analyse locale en temps réel et mémoire de principes à long terme (LPM) pour les règles réutilisables ; et une boucle "Imaginer-puis-Vérifier" où un modèle du monde simule les résultats potentiels avant qu'un évaluateur VLM valide chaque plan d'action. Sur les benchmarks IGNav, AR et AEQA, le système surpasse les meilleures méthodes existantes de +4,16% de SPL (Success weighted by Path Length) et de +15,30% de SPL en scénario de transfert de heuristiques vers des environnements totalement inédits. L'enjeu central adressé est l'"amnésie expérientielle" : les agents actuels, pilotés par imitation-learning ou politiques réactives, échouent à capitaliser sur leurs interactions passées pour construire des stratégies généralisables. La mémoire LPM/SRM de Robo-Cortex n'est pas un replay-buffer de données brutes mais une base de connaissances symboliques et linguistiques : un robot déployé dans un nouvel entrepôt pourrait potentiellement améliorer ses performances de navigation de façon autonome, sans nouveau cycle d'annotation ni fine-tuning, en rupture avec les pipelines sim-to-real classiques. Des expériences préliminaires en environnement physique réel sont mentionnées, mais restent peu détaillées dans la publication. Ce travail s'inscrit dans la concurrence directe avec les approches VLA comme Pi-0 de Physical Intelligence ou les architectures à mémoire développées chez DeepMind et Carnegie Mellon, avec une distinction clé : l'accent mis sur la réflexion post-hoc et l'induction de règles symboliques plutôt que sur l'apprentissage end-to-end. La publication reste un preprint non revu par les pairs, et les performances annoncées sont à reproduire indépendamment avant toute conclusion industrielle. Les prochaines étapes naturelles seraient une validation sur des benchmarks physiques standardisés comme RoboCasa ou Open-X Embodiment, et une soumission à une conférence majeure de type ICRA ou CoRL.

RechercheOpinion
1 source
Pince dextérique et souple à actionnement hydraulique doux pour la manipulation en microgravité
1586arXiv cs.RO 

Pince dextérique et souple à actionnement hydraulique doux pour la manipulation en microgravité

Des chercheurs ont présenté DexCoHand, un préhenseur à deux doigts et six degrés de liberté (DOF) à actionnement hydraulique souple, conçu pour étendre les capacités de manipulation d'Astrobee, le robot volant libre de la NASA présent à bord de la Station spatiale internationale (ISS). Le gripper actuel d'Astrobee est limité à un seul DOF sous-actionné, suffisant pour s'accrocher aux rampes de la station mais inadapté à des tâches de manipulation continue. DexCoHand, décrit dans un preprint arXiv publié en mai 2026 (arXiv:2605.17851), a été évalué dans le simulateur MuJoCo sur la séquence d'accrochage standard incluant l'approche, le perchage, puis des mouvements de panoramique et d'inclinaison. Des expériences matérielles ont également été conduites sur Terre. Aucun test en orbite n'est rapporté à ce stade. La difficulté centrale de la manipulation en microgravité est que toute force de contact exercée par l'effecteur se répercute directement dans le mouvement de la base flottante, rendant les tâches précises particulièrement instables avec un système rigide ou à faible DOF. Les résultats de simulation montrent que DexCoHand préserve les mouvements commandés en panoramique et inclinaison tout en réduisant les perturbations non voulues sur les axes transversaux de la base, comparé au gripper d'origine. L'actionnement hydraulique souple offre une compliance passive qui absorbe une partie de l'énergie de contact, un avantage documenté en robotique terrestre mais encore peu exploré pour les systèmes orbitaux. Ces résultats sont pertinents pour la conception de robots d'entretien autonomes de stations spatiales, un segment où la manipulation dextère reste un verrou technologique non résolu. Astrobee a été déployé sur l'ISS en 2019 par le NASA Ames Research Center pour assister les astronautes dans des tâches de surveillance et de logistique. Sa plateforme ouverte a favorisé une série de travaux académiques sur l'extension de ses capacités. Dans le domaine des manipulateurs spatiaux opérationnels, les systèmes actifs incluent le Canadarm2 de la NASA, le bras JEMRMS de la JAXA et le projet CAESAR de l'ESA. DexCoHand s'inscrit dans un courant de robotique souple appliquée à l'espace, où la tolérance aux chocs et la légèreté sont critiques. Les prochaines étapes naturelles seraient des tests en micropesanteur simulée, via vols paraboliques ou bassin neutre, avant toute qualification orbitale.

UEImpact indirect : l'ESA développe en parallèle le projet CAESAR sur les manipulateurs spatiaux, domaine où ces travaux sur la compliance hydraulique en microgravité pourraient alimenter la réflexion, mais aucune entité française ou européenne n'est impliquée dans cette recherche.

RecherchePaper
1 source
LiPS : segmentation panoptique légère pour la robotique aux ressources limitées
1587arXiv cs.RO 

LiPS : segmentation panoptique légère pour la robotique aux ressources limitées

Une équipe de recherche publie sur arXiv (identifiant 2604.00634, version révisée) LiPS, une architecture de segmentation panoptique conçue spécifiquement pour les plateformes robotiques embarquées à ressources limitées. La segmentation panoptique est une tâche de perception qui combine la segmentation sémantique (classifier chaque pixel selon sa catégorie) et la segmentation d'instances (distinguer chaque objet individuel), offrant ainsi une compréhension unifiée de la scène. LiPS conserve l'approche par décodeur à requêtes (query-based decoding), héritée des architectures transformeurs comme Mask2Former, mais introduit un pipeline allégé d'extraction et de fusion de features. Sur les benchmarks standards, LiPS atteint un débit jusqu'à 4,5 fois supérieur en images par seconde et nécessite 6,8 fois moins d'opérations de calcul que les modèles lourds de référence, avec une précision comparable. L'enjeu est réel pour les intégrateurs en robotique mobile. Les modèles d'état de l'art en perception (Mask2Former, OneFormer, Panoptic-DeepLab) atteignent des performances élevées sur des GPU de datacenter, mais leur déploiement sur des plateformes AMR, des robots d'inspection ou des bras collaboratifs équipés de GPU embarqués modestes (Jetson Orin, Hailo, NPU intégrés) reste bloqué par la bande passante mémoire et la latence d'inférence. Un facteur 4,5x sur le débit signifie concrètement la différence entre un pipeline temps réel à 30 FPS et un pipeline batch inutilisable en navigation autonome. Il convient toutefois de souligner que les benchmarks cités ne précisent pas le matériel cible exact ni les conditions d'évaluation, ce qui limite la comparabilité directe avec des contraintes industrielles spécifiques. La segmentation panoptique légère s'inscrit dans une tendance de fond : après l'explosion des grands modèles de vision (SAM, DINOv2, GroundedSAM), la communauté cherche à distiller ces capacités vers l'edge. Des travaux concurrents comme EfficientPS ou RT-DETRv2 adaptés à la segmentation visent des compromis similaires. LiPS se distingue par le maintien du décodeur à requêtes, généralement sacrifié dans les approches légères au profit de têtes plus simples. Aucun partenariat industriel ni déploiement pilote n'est mentionné dans l'article, qui reste pour l'instant une contribution académique sans timeline commerciale annoncée.

UEContribution académique sans lien direct France/UE ; les intégrateurs européens de robots mobiles (AMR, inspection) pourraient en bénéficier si le code est publié, mais aucun déploiement ni partenariat européen n'est annoncé.

RecherchePaper
1 source
Génération automatique d'arbres de comportement par VLM pour le transfert réel-vers-simulation via perception active
1588arXiv cs.RO 

Génération automatique d'arbres de comportement par VLM pour le transfert réel-vers-simulation via perception active

Une équipe de chercheurs propose dans un article arXiv (2601.08454) un pipeline Real2Sim piloté par l'intention, qui automatise la construction d'environnements de simulation physiquement précis à partir d'une instruction en langage naturel. Un modèle vision-langage (VLM) analyse une observation visuelle et une description de simulation incomplète pour identifier le sous-ensemble minimal de paramètres physiques manquants (masse des objets, géométrie de surface, friction), puis génère automatiquement un arbre de comportement (Behavior Tree, BT) composé de primitives motrices et sensorielles atomiques pour les acquérir par interaction physique avec l'environnement. Les expériences ont été conduites sur un bras Franka Emika Panda à contrôle en couple (7 DOF), manipulateur standard en recherche robotique. Les résultats indiquent des gains d'efficacité opérationnelle significatifs par rapport aux méthodes d'exploration exhaustive, validés par des études d'ablation sur plusieurs VLMs de référence, mais les chiffres précis de performance ne sont pas fournis dans l'abstract, ce qui limite la comparabilité externe. L'apport principal est le remplacement de pipelines d'identification système manuels par une stratégie sémantique : au lieu d'explorer exhaustivement l'environnement, le système ne collecte que les données pertinentes pour la tâche demandée, réduisant les interactions redondantes. Pour les équipes travaillant sur des jumeaux numériques industriels, cela représente un gain potentiel en temps de calibration avant déploiement. Le BT joue également un rôle de filtre de sécurité déterministe : sa hiérarchie réactive intercepte les hallucinations du VLM et prévient les anomalies physiques dangereuses, ce qui est non-négligeable pour une application en conditions réelles. Cette combinaison, intelligence sémantique du VLM associée à la robustesse déterministe du BT, constitue l'aspect architectural le plus notable du travail. La construction de simulations fidèles au réel est un verrou classique du déploiement robotique : un jumeau numérique mal calibré amplifie le sim-to-real gap qui dégrade les politiques apprises en simulation, problème central pour les VLA (Vision-Language-Action) actuels. Côté concurrence, Physical Intelligence (pi0), Google DeepMind (successeurs de RT-2) et des projets open-source comme LeRobot de Hugging Face investissent tous dans des pipelines sim-to-real plus robustes. L'utilisation des BT comme couche d'interprétabilité face aux modèles génératifs s'inscrit dans une tendance plus large visant à rendre les LLM/VLM compatibles avec des contraintes de sécurité industrielle. Les prochaines étapes logiques seraient d'étendre le pipeline à des robots mobiles ou des plateformes humanoïdes, et de publier des benchmarks complets permettant une comparaison rigoureuse avec les méthodes d'identification système existantes.

RecherchePaper
1 source
FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole
1589arXiv cs.RO 

FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole

Une équipe de chercheurs a publié en mars 2025 sur arXiv (référence 2503.16492, troisième révision) FAM-HRI, un framework multimodal d'interaction humain-robot combinant le suivi du regard et la parole via des modèles de fondation. Le système s'appuie sur les lunettes Meta ARIA, un dispositif de recherche léger, pour capturer en temps réel les signaux visuels et vocaux de l'utilisateur. Ces données sont fusionnées par un grand modèle de langage (LLM) qui interprète l'intention de l'utilisateur en la croisant avec le contexte visuel de la scène, permettant au robot d'identifier et manipuler des objets désignés par le regard. Un algorithme dédié détermine l'intervalle temporel de fixation oculaire afin de filtrer le bruit inhérent aux mouvements naturels des yeux. Les auteurs rapportent un "taux de succès élevé" et un "temps d'interaction faible" lors des évaluations expérimentales, sans publier de métriques chiffrées précises dans le résumé, ce qui limitera la comparabilité directe avec d'autres systèmes. L'enjeu de FAM-HRI dépasse la performance brute : le système cible explicitement les utilisateurs souffrant de handicaps moteurs ou de mobilité réduite, une population pour laquelle les interfaces gestuelles classiques sont inutilisables et les commandes vocales seules insuffisamment précises pour la manipulation spatiale. En fusionnant regard et parole au niveau sémantique via un LLM, l'architecture évite les ambiguïtés typiques des commandes monocanal, comme "prends l'objet" sans désignation claire. C'est un pas concret vers des robots d'assistance utilisables en conditions réelles, où la robustesse à l'imprécision humaine prime sur la performance en environnement contrôlé. La combinaison regard-parole pour le contrôle robotique n'est pas nouvelle, mais l'intégration de LLMs pour la fusion contextuelle représente une évolution récente, rendue possible par la réduction des coûts d'inférence. Les lunettes Meta ARIA, conçues initialement pour la recherche en réalité augmentée, trouvent ici une application robotique directe. Les concurrents dans l'espace HRI multimodal incluent des travaux issus de CMU, ETH Zurich et d'équipes japonaises comme Preferred Networks et l'AIST. L'ensemble du code et des algorithmes est publié en open source sur GitHub, ce qui facilitera la reproductibilité. Les prochaines étapes naturelles seraient une validation en conditions cliniques ou à domicile, et une extension à des plateformes mobiles au-delà de la manipulation fixe.

RecherchePaper
1 source
Vertus du chaos ordonné : planification par actions de renversement pour la réorganisation de piles sur table
1590arXiv cs.RO 

Vertus du chaos ordonné : planification par actions de renversement pour la réorganisation de piles sur table

Publiée sur arXiv (2605.17815) en mai 2026, une étude propose d'enrichir les planificateurs de manipulation robotique avec des actions non-préhensiles dites "agrégantes", en particulier le basculement d'objets (topple). Au lieu de déplacer un à un les éléments d'une pile sur un plan de travail, le robot peut renverser tout ou partie de la pile d'un seul mouvement avant de saisir les objets dans l'ordre souhaité. Les chercheurs formalisent cet espace de planification hybride pick-and-place + topple via un gadget graphique directionnel original, réduisant le calcul du plan à une variante du problème des galets en mouvement (pebble motion problem) : chaque objet est traité comme un galet se déplaçant sur un graphe selon des contraintes de non-collision. Les benchmarks conduits en simulation physique sur NVIDIA IsaacSim montrent une réduction significative du temps d'exécution par rapport à une stratégie purement pick-and-place. L'enjeu industriel est concret pour la manipulation en entrepôt, le kitting ou le tri de bacs. Réorganiser une pile de n pièces nécessite classiquement O(n) opérations de saisie-dépose ; une action topple peut en remplacer plusieurs, réduisant le temps de cycle et la sollicitation mécanique des actionneurs. L'article pointe ainsi un angle mort fréquent en robotique de production : les planificateurs de tâches restent majoritairement construits autour de la saisie, alors que les actions non-préhensiles offrent des gains de débit substantiels dès lors qu'elles sont correctement abstraites. Limite notable : les gains sont mesurés en simulation seulement, et le passage sim-to-real pour des actions dynamiques comme le topple reste une question ouverte. Les auteurs s'inscrivent dans la continuité des recherches sur la manipulation non-préhensile, actives depuis les années 1990 mais rarement intégrées au niveau de la planification symbolique de tâches. La formalisation est volontairement généraliste : une action de type "scoop" (raclage) peut être modélisée par la même abstraction graphique, ouvrant la voie à un cadre unifié pour plusieurs familles d'actions agrégantes. Face aux approches concurrentes basées sur l'apprentissage par renforcement ou les planificateurs géométriques, cette méthode symbolique-graphique offre lisibilité et garanties de complétude sur les instances modélisées. Aucun déploiement n'est annoncé ; les auteurs qualifient eux-mêmes leurs résultats de "preliminary indication", laissant la validation en environnement physique réel pour de futurs travaux.

RecherchePaper
1 source
LACE : représentation visuelle latente pour l'apprentissage multi-robots
1591arXiv cs.RO 

LACE : représentation visuelle latente pour l'apprentissage multi-robots

Une équipe de chercheurs a publié en mai 2026 sur arXiv (référence 2605.16743) un cadre d'apprentissage appelé LACE (Latent Visual Representation for Cross-Embodiment Learning), conçu pour réduire le fossé visuel entre démonstrations humaines et politiques robotiques. Les backbones d'apprentissage auto-supervisé (SSL) comme DINOv2 encodent une riche sémantique d'objets généraux, mais échouent à établir des correspondances spatiales entre mains humaines et mains robotiques. LACE aligne les représentations visuelles des deux embodiments dans l'espace latent de ces backbones, en utilisant comme supervision clairsemée les correspondances entre parties corporelles partagées, obtenues automatiquement par cinématique directe (forward kinematics). Une seule démonstration robot suffit à entraîner le modèle. L'évaluation rapporte un gain de 65 % en transfert zéro-shot pour LACE-DINO face à DINO seul, avec des améliorations consistantes en régimes de faibles données et en environnements hors-distribution. Ce résultat touche l'un des goulets d'étranglement les plus concrets du déploiement robotique: la pénurie de démonstrations robot. Collecter des trajectoires téléopérées coûte cher et ralentit l'itération. Si l'alignement inter-embodiment de LACE tient à l'échelle, les intégrateurs pourraient tirer parti de corpus vidéo humains existants (YouTube, Ego4D, etc.) pour initialiser des politiques sans investissement lourd en données robot. Le gain annoncé de 65 % mérite toutefois d'être contextualisé: le preprint ne détaille pas le nombre de tâches évaluées ni la complexité des scènes, deux facteurs déterminants pour juger de la généralisabilité réelle. LACE s'inscrit dans une vague de travaux sur le transfert cross-embodiment qui a pris de l'ampleur depuis 2023 avec des méthodes comme AnyPoint et les politiques de Physical Intelligence (Pi-0). L'approche dominante consiste à entraîner des VLA (Vision-Language-Action models) à grande échelle sur des données mixtes humain-robot, stratégie portée par DeepMind, Stanford (ALOHA/ACT) et Berkeley (OpenVLA). LACE propose une alternative plus frugale, centrée sur l'alignement de représentations plutôt que sur le volume de données. Aucun pilote industriel ni calendrier de déploiement n'est mentionné; l'article reste au stade de preprint non soumis à révision par les pairs.

RecherchePaper
1 source
TacSE3 : estimation SE(3) équivariante sur images visuotactiles à faible texture pour suivi et compensation en préhension
1592arXiv cs.RO 

TacSE3 : estimation SE(3) équivariante sur images visuotactiles à faible texture pour suivi et compensation en préhension

Des chercheurs ont publié sur arXiv (identifiant 2605.17929) TacSE3, un pipeline d'estimation de mouvement tactile conçu pour le suivi d'objets en prise de robot. Le système prend en entrée des images visuotactiles à faible texture, les convertit en un champ de force tridimensionnel découplé, puis estime le mouvement rigide incrémental dans SE(3), c'est-à-dire le groupe euclidien spécial à six degrés de liberté combinant trois axes de translation et trois axes de rotation. L'architecture dérive la translation planaire depuis le déplacement du centroïde de contact, et estime la rotation principalement à partir des réponses tactiles de cisaillement (shear). Les expériences s'appuient sur une paire de capteurs visuotactiles DM-Tac montés en configuration bidigitale, sans autre précision sur le matériel robotique hôte ni sur les benchmarks comparatifs utilisés. L'intérêt industriel réside dans deux propriétés rarement combinées : l'interprétabilité physique du signal et l'absence de ré-entraînement de la politique de base. En manipulation in-hand, l'occlusion visuelle fréquente prive les approches classiques de correspondances stables entre images, qu'il s'agisse de matching géométrique ou de flux optique. TacSE3 contourne ce problème en exploitant uniquement le retour tactile, lequel reste disponible même lorsque la caméra extéroceptive est aveugle. La configuration à deux capteurs réduit l'ambiguïté translation-rotation inhérente à un capteur unique et permet le suivi en rotation sur plusieurs axes et géométries d'objets. Le signal de compensation reste léger et s'intègre en surcouche d'une politique existante, ce qui simplifie l'industrialisation : pas besoin de reprendre l'apprentissage pour améliorer la tolérance aux perturbations. La manipulation tactile en prise est un axe de recherche actif, porté notamment par les travaux autour des capteurs GelSight (MIT) et des approches vision-language-action (VLA) qui peinent encore sur la finesse des contacts. TacSE3 s'inscrit dans la tendance à enrichir ces pipelines avec un retour proprioceptif interprétable plutôt que de tout déléguer au visuel. Côté concurrence, des équipes comme celles derrière Digit (Meta/GelSight Technologies) ou Soft Robotics travaillent sur des capteurs tactiles embarqués, mais peu proposent une estimation SE(3) sans texture. La preprint ne mentionne pas de partenaire industriel ni de calendrier de déploiement ; les résultats restent à confirmer hors laboratoire, en conditions d'encombrement et de bruit réels.

RecherchePaper
1 source
COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion
1593arXiv cs.RO 

COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion

Des chercheurs proposent COLSON (Controllable Learning-based Social Navigation), une méthode de navigation sociale pour robots mobiles autonomes (AMR) en milieux piétons, fondée sur l'apprentissage par renforcement couplé à des modèles de diffusion. Publiée sur arXiv (2503.13934v2), cette étude traite d'un verrou persistant pour les robots de service : naviguer de façon fluide et socialement cohérente parmi des piétons dynamiques, sans violer leurs espaces de proximité ni générer de comportements erratiques. Les approches à base de règles telles qu'ORCA ou DWA montrent leurs limites dans les environnements denses, tandis que les méthodes de deep RL conventionnelles reposent sur des distributions gaussiennes qui contraignent la variété des trajectoires produites. COLSON contourne cette limitation en exploitant les distributions d'actions plus riches offertes par les modèles de diffusion appliqués au RL, capables de représenter des comportements multimodaux (hésiter, contourner à gauche ou à droite) que les politiques gaussiennes tendent à lisser. L'apport central de la méthode est sa capacité de généralisation à des scénarios inédits sans ré-entraînement. Dans les démonstrations présentées, le robot adapte son comportement à des obstacles statiques absents du jeu d'entraînement, ou change d'objectif pour accompagner un piéton cible tout en évitant les autres passants. Pour les intégrateurs d'AMR en milieux hospitaliers, aéroportuaires ou logistiques, cette propriété de contrôlabilité zero-shot est stratégiquement importante : elle réduit le coût de re-paramétrage à chaque nouveau site de déploiement. Elle valide aussi partiellement l'hypothèse que les diffusion models peuvent atténuer le sim-to-real gap en navigation sociale, en générant des distributions d'actions plus robustes face à l'imprévu. Le champ de la social navigation par deep RL est actif depuis une décennie, avec des travaux fondateurs comme CADRL (2017), SARL et CrowdNav. L'application des modèles de diffusion au RL dans la robotique est plus récente, s'appuyant notamment sur Diffusion Policy (Columbia/MIT, 2023) dans le domaine de la manipulation. COLSON transfère cette logique vers la planification de mouvement en espace ouvert. Il s'agit à ce stade d'un preprint académique avec validation uniquement en simulation ; aucun déploiement sur robot réel ni partenariat industriel n'est mentionné, ce qui invite à tempérer les conclusions. Les éditeurs actifs sur la navigation sociale autonome incluent Boston Dynamics, ANYbotics et Clearpath Robotics, et côté européen Enchanted Tools (France) ou PAL Robotics (Espagne) pour les robots de service. Les prochaines étapes naturelles seraient une validation en environnement réel et un benchmarking sur les datasets standardisés ETH/UCY.

UELes intégrateurs AMR européens (dont Enchanted Tools en France, PAL Robotics en Espagne) pourraient à terme bénéficier de la contrôlabilité zero-shot de COLSON pour réduire les coûts de redéploiement multi-sites, mais la méthode reste validée uniquement en simulation sans partenariat industriel déclaré.

RecherchePaper
1 source
CompassAD : localisation d'affordance 3D guidée par l'intention parmi des objets fonctionnellement concurrents
1594arXiv cs.RO 

CompassAD : localisation d'affordance 3D guidée par l'intention parmi des objets fonctionnellement concurrents

Des chercheurs proposent CompassAD, un benchmark et une architecture (CompassNet) pour adresser un angle mort des systèmes robotiques actuels : choisir le bon objet parmi plusieurs qui partagent la même affordance. Le cas prototype est simple : face à l'instruction "coupe le gâteau", un robot doit identifier le couteau plutôt que des ciseaux posés à côté, bien que les deux permettent de couper. Le benchmark comprend 30 paires d'objets confusables, 16 types d'affordances, 6 422 compositions de scènes et plus de 88 000 paires requête-réponse. CompassNet repose sur deux modules : l'Instance-bounded Cross Injection (ICI), qui confine l'alignement langage-géométrie aux limites de chaque instance d'objet pour éviter toute fuite sémantique entre objets voisins, et le Bi-level Contrastive Refinement (BCR), qui renforce la discrimination entre surfaces cibles et confusables à deux niveaux de granularité. Le système produit un masque d'affordance point-par-point sur le bon objet dans un nuage de points multi-objets, conditionné par une instruction en langage naturel implicite. Une validation sur bras manipulateur réel est présentée comme preuve de transfert physique. L'intérêt est que la quasi-totalité des méthodes d'affordance 3D existantes évaluent des objets isolés avec le nom de catégorie fourni explicitement dans la requête. CompassAD impose une contrainte plus proche du déploiement réel : une intention formulée en langage naturel, sans étiquette d'objet prédéfinie. Pour un intégrateur ou un décideur industriel, cela vise des systèmes capables de raisonner sur le contexte de tâche sans pipeline de labellisation rigide. La nuance s'impose cependant : 30 paires d'objets et un environnement de laboratoire constituent une base étroite. La robustesse en scènes industrielles denses, avec occlusions et objets multiples non contrôlés, reste à démontrer. L'affordance grounding en robotique s'est structuré autour de travaux comme Where2Act (2021) ou LASO, qui opèrent sur objets isolés avec requêtes explicites. Les architectures vision-langage-action (VLA) des grands labos comme DeepMind, Meta ou Stanford intègrent progressivement la résolution d'ambiguïtés contextuelles, mais sans benchmark dédié aux scènes multi-objets confusables. CompassAD comble en partie ce vide méthodologique. La publication, déposée sur arXiv (2604.02060v2) en version révisée, n'implique pas d'acteur industriel ou FR/EU visible. Les prochaines étapes logiques seraient une extension à des scènes plus denses et une évaluation sur plateformes mobiles manipulatrices, au-delà du bras fixe utilisé dans les expériences publiées.

RecherchePaper
1 source
Planification optimale de frappe-et-saisie pour des blocs serrés sur table avec pinces parallèles
1595arXiv cs.RO 

Planification optimale de frappe-et-saisie pour des blocs serrés sur table avec pinces parallèles

Des chercheurs ont publié en mai 2025 sur arXiv (réf. 2605.17800) un algorithme de planification optimale pour manipuler des blocs densément rangés sur une surface plane avec des pinces parallèles standard. Le problème est classique en robotique de préhension : ces pinces à deux mâchoires rigides exigent une clearance latérale autour de l'objet cible avant toute saisie, ce qui devient infaisable en configuration serrée. Les auteurs formalisent ce défi sous le nom de "knock-pick planning" en introduisant une primitive directionnelle de frappe (knock) qui pousse un bloc voisin pour libérer l'espace nécessaire. Le plan optimal, minimisant le nombre total d'actions (frappes puis saisies), est calculé par un algorithme de couplage parfait à poids maximum (maximum-weight perfect matching) appliqué à une abstraction graphique du problème, avec une complexité polynomiale garantie. La validation a été conduite sur des configurations de grille de taille croissante en simulation synthétique, puis dans IsaacSim, le simulateur robotique d'NVIDIA. La contribution principale est la garantie d'une complexité polynomiale pour un problème traité jusqu'ici de manière heuristique ou par recherche combinatoire coûteuse. En production, les systèmes pick-and-place contournent le problème de densité par l'espacement forcé des bacs, des effecteurs à ventouses tolérants au désordre, ou des mains robotiques dextres nettement plus onéreuses. Un planificateur polynomial opérant avec des pinces standard pourrait réduire sensiblement le coût d'intégration de lignes de tri dense en e-commerce et en pharmacie. L'algorithme montre aussi que l'entrelacement d'actions préhensiles (saisie) et non-préhensiles (poussée) peut être géré de façon rigoureuse et optimale, contredisant l'hypothèse répandue selon laquelle ce mixage requiert une planification intractable. Ce travail s'inscrit dans la tradition de la manipulation non-préhensile formalisée par Mason et Erdmann dès les années 1980-1990, dont les résultats théoriques restaient difficiles à opérationnaliser dans des délais utiles. Les approches concurrentes actuelles, qu'il s'agisse de MCTS, A* ou d'apprentissage par renforcement, offrent une flexibilité sur des géométries variées mais sans garantie d'optimalité ni complexité bornée. La validation demeure pour l'instant limitée à la simulation, aucun déploiement sur robot physique n'étant annoncé. Les auteurs qualifient eux-mêmes ce travail de "stepping stone" : les extensions naturelles portent sur des objets non uniformes, des dispositions non-régulières, et une validation sur banc physique réel.

RecherchePaper
1 source
Sculpture visuelle : représentations de planification alignées visuellement pour la modélisation d'argile robotique sur de longues séquences
1596arXiv cs.RO 

Sculpture visuelle : représentations de planification alignées visuellement pour la modélisation d'argile robotique sur de longues séquences

Des chercheurs ont publié sur arXiv (référence 2605.17556, mai 2025) une méthode de sculpture robotisée de l'argile reposant sur une planification à long horizon dans un espace de représentation visuellement aligné. Le système, baptisé Visual Sculpting, formule la tâche comme un problème de correspondance entre formes : à partir d'une forme cible, le robot calcule une séquence de plus de 100 actions de poussée paramétrées avec un seul effecteur pour déformer progressivement la matière. La méthode a été validée sur trois matériaux déformables distincts et avec plusieurs types d'effecteurs. Les sculptures obtenues sont des reliefs en argile réalisés en boucle fermée, sans intervention humaine entre les passes. La contribution centrale est un modèle de dynamique des matériaux déformables opérant dans un espace de représentation qui encode non seulement la géométrie, mais aussi la texture et l'éclairage de la surface, contrairement aux approches précédentes fondées sur des nuages de points épars. Cette différence est notable pour la manipulation de matières molles, où l'apparence visuelle conditionne la précision des estimations d'état. Les auteurs rapportent des performances comparables à l'état de l'art sur les métriques géométriques classiques, avec l'avantage supplémentaire d'une compatibilité native avec les planificateurs visuels, ouvrant la voie à une intégration plus directe avec des politiques de type VLA (Vision-Language-Action). L'article reconnaît cependant que planifier directement dans cet espace visuel reste plus difficile que dans un espace 3D structuré, un point de friction technique qui devra être résolu avant toute application industrielle. Les travaux sur la manipulation d'objets déformables connaissent une accélération depuis 2022-2023, portés notamment par les progrès des modèles de dynamique neuronaux et l'essor des robots à manipulation dextre. La limite principale des systèmes précédents était la nécessité de réentraîner une politique par objectif, ce que cette approche cherche à contourner via une représentation généraliste. Aucune entreprise ni déploiement industriel n'est associé à ces travaux pour l'instant : il s'agit d'un preprint académique sans validation terrain. Les prochaines étapes probables incluent l'extension à des tâches de déformation bidirectionnelle et le test sur des bras industriels standards comme le Franka ou l'UR10.

RecherchePaper
1 source
Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles
1597arXiv cs.RO 

Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles

Des chercheurs présentent dans un preprint arXiv (2605.17593) un cadre de planification baptisé "motion-uncertainty-aware next-best-view" (NBV), destiné à reconstruire en 3D des objets rigides en mouvement planaire avec un robot mobile équipé d'un capteur de profondeur. Le problème central est le délai entre la sélection d'un viewpoint et son exécution : au moment où le robot atteint la position choisie, l'objet a déjà bougé, rendant caduc tout plan basé sur une pose prédite unique. Pour y répondre, chaque viewpoint candidat est évalué non pas sur une position fixe, mais sur l'ensemble des états futurs plausibles de l'objet, modélisés par un lisseur à processus gaussien à fenêtre glissante (fixed-lag Gaussian Process smoother) alimenté par des mesures de position bruitées. Les expériences, menées en simulation et en conditions réelles, montrent une complétude de reconstruction supérieure à celle des planificateurs NBV non-prédictifs et des méthodes de tracking-seul. Ce résultat comble un angle mort documenté de la robotique perceptive : les planificateurs NBV classiques optimisent la couverture de surface en supposant des objets statiques, tandis que les méthodes de perception active orientées mouvement favorisent le suivi au détriment de la qualité de reconstruction. La combinaison des deux dans un seul cadre probabiliste est directement applicable à l'inspection automatisée de pièces sur convoyeur, au contrôle qualité en ligne ou à la génération de jumeaux numériques en environnement dynamique. Traiter le futur comme une distribution d'états plutôt qu'une estimation ponctuelle améliore la robustesse aux perturbations capteurs et aux variations de dynamique que les approches déterministes ne gèrent pas. La planification NBV est un problème actif depuis les années 1990 en robotique perceptive, mais son extension aux objets en mouvement reste peu traitée dans la littérature. L'usage de processus gaussiens pour la prédiction de trajectoire est éprouvé dans d'autres domaines, rarement couplé jusqu'ici à des scores de couverture de surface en contexte NBV. Il s'agit d'un preprint sans évaluation par les pairs à ce stade, sans partenaire industriel ni déploiement annoncé. Les métriques de complétude avancées restent à confirmer sur des dynamiques plus complexes : les expériences actuelles se limitent au mouvement planaire et aux objets rigides. Les extensions naturelles incluent le mouvement 3D non-planaire, les objets déformables et les configurations multi-cibles. Aucun acteur français ou européen n'est impliqué dans cette publication.

RecherchePaper
1 source
MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte
1598arXiv cs.RO 

MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte

Une équipe de chercheurs présente MR-SLAM, un système de supervision en réalité mixte permettant à un opérateur unique de téléopérer simultanément une flotte de robots en cours de cartographie. L'opérateur porte un casque Meta Quest 3 et visualise, via la vue passthrough superposée au monde physique, trois TurtleBot3 simulés naviguer dans l'espace, pendant que des panneaux de tableau de bord ancrés spatialement affichent en temps réel l'état de la cartographie de chaque robot. Côté serveur, chaque robot exécute une instance indépendante de SLAM Toolbox sous ROS 2 (Robot Operating System 2), et leurs grilles d'occupation sont fusionnées en continu. Sur cinq sessions d'évaluation de neuf minutes, le système a maintenu un débit de 8,83 plus ou moins 0,16 Hz, cartographié 17,9 plus ou moins 0,8 m² fusionnés et atteint 94,7 plus ou moins 0,5 % de cohérence inter-instances. Une session additionnelle a enregistré une gigue médiane de transformation de 6,3 ms et une couverture de 26,7 m² sur un espace de référence de 41 m². Il s'agit d'une prépublication arXiv (2605.16432), conduite sur robots simulés en environnement contrôlé, et non d'un produit commercialisé. La contribution adresse un vrai goulet d'étranglement opérationnel : à mesure que les flottes robotiques grandissent, les interfaces 2D classiques imposent une charge cognitive croissante à l'opérateur, contraint de reconstruire mentalement la géométrie de l'espace à partir de plusieurs fenêtres de cartes planaires. La réalité mixte avec ancrage spatial délègue cette reconstruction à la perception naturelle humaine. Le taux de cohérence de 94,7 % est encourageant pour la fusion multi-robots, mais les chiffres restent à nuancer : environnement contrôlé de moins de 30 m², trois robots seulement, et couverture incomplète (65 % de la grille de référence atteinte dans la session additionnelle). Pour les intégrateurs industriels et les décideurs B2B, le signal utile est la validité de principe sur matériel grand public (Meta Quest 3, environ 500 euros), ce qui ouvre une voie à des solutions de supervision moins coûteuses que des postes de contrôle dédiés. Le problème de la supervision spatiale de flottes multi-robots est un chantier actif depuis l'essor des AMR dans la logistique et l'inspection industrielle. Les approches dominantes reposent sur des interfaces RVIZ ou des tableaux de bord web 2D, sans restitution de profondeur ni de contexte spatial. Les stacks concurrentes en SLAM multi-robots incluent Cartographer de Google et Nav2 sous ROS 2 ; côté supervision en réalité mixte, les travaux antérieurs ciblaient surtout les bras manipulateurs plutôt que les flottes mobiles. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé. Les prochaines étapes naturelles sont la validation sur robots physiques réels, à plus grande échelle et dans des espaces industriels non contrôlés.

UEImpact indirect et lointain : les intégrateurs européens d'AMR en logistique pourraient à terme bénéficier d'interfaces de supervision moins coûteuses basées sur du matériel grand public, mais aucun acteur FR/EU n'est impliqué et le système reste au stade de préprint sur robots simulés.

RecherchePaper
1 source
OrbiSim : des modèles du monde comme moteurs physiques différentiables pour l'IA incarnée
1599arXiv cs.RO 

OrbiSim : des modèles du monde comme moteurs physiques différentiables pour l'IA incarnée

Une équipe de chercheurs a déposé sur arXiv en mai 2026 (réf. 2605.16395) un article présentant OrbiSim, un nouveau paradigme de simulation robotique qui repositionne les modèles du monde (world models) comme des moteurs physiques entièrement différentiables. Là où les world models existants, tels que DreamerV3 ou TD-MPC2, opèrent dans des espaces latents ou visuels sans contraintes physiques explicites, OrbiSim construit une chaîne unifiée et physiquement ancrée reliant trois composantes : des actifs de scène structurés, une dynamique neurale apprise, et l'entraînement par renforcement en aval. L'architecture garantit une différentiabilité de bout en bout sur l'ensemble de la boucle de simulation, depuis les transitions d'état explicites jusqu'à la génération d'observations visuelles. Cette propriété permet des tâches jusqu'ici peu tractables pour les simulateurs classiques : modélisation différentiable des contacts, optimisation de politique par gradient sous récompenses éparses, et inférence physique intuitive. Les auteurs affirment qu'OrbiSim surpasse significativement les world models de l'état de l'art en fidélité prédictive et en performance de contrôle, sans toutefois publier de métriques chiffrées dans l'abstract. L'enjeu industriel est réel : le fossé sim-to-real reste l'un des principaux freins au déploiement de robots en environnement non contrôlé. Les simulateurs classiques comme MuJoCo, Isaac Sim (NVIDIA) ou PyBullet ne sont pas différentiables au niveau des contacts, ce qui bloque l'optimisation par gradient lors des phases de manipulation ou de locomotion complexe. Les world models neuronaux offrent la flexibilité, mais au prix de la cohérence physique. OrbiSim propose une synthèse des deux approches. Si les résultats se confirment à plus grande échelle, la capacité à optimiser des politiques par gradient sous récompenses éparses pourrait réduire significativement les temps de convergence en apprentissage par renforcement, un gain direct pour les équipes développant des robots manipulateurs ou bimanes destinés à l'industrie. Il faut souligner qu'il s'agit d'un preprint non encore soumis à peer review, sans affiliation industrielle explicite ni validation sur hardware physique annoncée. Le domaine de la simulation différentiable est activement disputé : DiffTaichi, Warp (NVIDIA) et Brax (Google DeepMind) couvrent déjà certains aspects de la physique différentiable, mais sans intégrer la génération visuelle neurale. OrbiSim se positionne dans un espace hybride encore peu occupé. Les prochaines étapes crédibles seraient une validation sur benchmarks standardisés comme RoboSuite ou IsaacLab, et surtout des expériences de transfert sim-to-real sur robot physique, dont aucune n'est annoncée à ce stade.

RecherchePaper
1 source
Pliage dynamique de tissu par robot grâce au contrôle prédictif basé sur l'opérateur de Koopman
1600arXiv cs.RO 

Pliage dynamique de tissu par robot grâce au contrôle prédictif basé sur l'opérateur de Koopman

Une équipe de chercheurs a soumis sur arXiv en mai 2026 (arXiv:2605.18373) une approche de contrôle prédictif par modèle (MPC) pour le pliage dynamique de tissu par bras robotique. Le système repose sur la régression par noyau de l'opérateur de Koopman, une technique d'identification de systèmes non linéaires, pour construire un modèle linéaire de substitution du comportement du tissu. Ce modèle surrogate est entraîné à partir de données issues d'un simulateur physique haute-fidélité, puis intégré dans l'algorithme MPC à la place du modèle non linéaire coûteux, permettant de générer des trajectoires de pliage rapide. Les expériences couvrent des environnements simulés et un robot réel, démontrant la capacité à atteindre des configurations de pliage non vues à l'entraînement sans dégradation mesurée de la précision. L'enjeu est structurant pour la manipulation d'objets déformables : le pliage dynamique de tissu, qui exploite l'inertie du textile via des mouvements rapides, bute depuis des années sur un compromis persistant entre vitesse et précision, les systèmes existants nécessitant plusieurs tentatives ou se limitant à des pièces rigides et petites. Le transfert sim-to-real est également un obstacle majeur avec les modèles physiques non linéaires du tissu, dont l'inférence haute-fidélité est prohibitive en temps réel. En linéarisant la dynamique du tissu via l'opérateur de Koopman, les auteurs allègent drastiquement la charge computationnelle du MPC, ouvrant la voie à un contrôle quasi-temps-réel pour des applications textiles industrielles (blanchisseries, e-commerce, confection). Il convient toutefois de signaler que les expériences en conditions réelles restent limitées en portée à ce stade de preprint, sans validation sur une grande diversité de matières ou de formats de vêtements. L'opérateur de Koopman connaît depuis 2020-2021 un intérêt croissant en robotique comme alternative aux modèles neuronaux pour la linéarisation de systèmes non linéaires, notamment dans la locomotion et la manipulation. Dans le domaine du cloth manipulation, des travaux récents de Columbia, MIT ou de l'équipe derrière UniGarmentManip ont exploré les politiques par apprentissage par renforcement ou par diffusion, mais sans combiner la structure MPC avec l'identification Koopman. Aucune entreprise ni spin-off n'est associée à cette publication. Les suites logiques incluent une validation sur une plus grande variété de tissus (matières, tailles, rigidités variables) et l'intégration dans un pipeline complet combinant perception de l'état du tissu et planification de préhension, deux briques que le preprint ne couvre pas encore.

RecherchePaper
1 source