Aller au contenu principal

Dossier arXiv cs.RO — page 43

2609 articles · page 43 sur 53

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

UniTac : modèle multimodal unifié pour la compréhension et la génération tactiles multi-capteurs
2101arXiv cs.RO RecherchePaper

UniTac : modèle multimodal unifié pour la compréhension et la génération tactiles multi-capteurs

Une équipe de recherche présente UniTac, décrit comme le premier modèle multimodal unifié (UMM) conçu spécifiquement pour la compréhension et la génération de données tactiles, dans un article publié sur arXiv (2606.31451v1). Le système modélise le processus tactile comme une transition entre l'absence de contact et le contact, via une représentation à deux niveaux qui encode à la fois les attributs du capteur utilisé et ceux de l'objet touché. Pour la compréhension, UniTac introduit deux tâches inédites : la description des propriétés physiques d'un objet et l'identification du capteur à l'origine du signal. Pour la génération, les auteurs proposent un entraînement en deux étapes, reconstruction puis alignement, complété par une stratégie d'échantillonnage basée sur les caractéristiques propres à chaque capteur afin de simuler des contacts réalistes. Entraîné sur des jeux de données tactiles multi-capteurs à grande échelle, le modèle revendique des performances état de l'art en compréhension tactile et une capacité à générer des signaux tactiles crédibles quel que soit le capteur d'origine. L'enjeu principal touche à la fragmentation du capteur tactile en robotique : les technologies existantes (capteurs optiques type GelSight ou DIGIT, capteurs magnétiques comme ReSkin, etc.) produisent des signaux de formats incompatibles, ce qui oblige généralement à ré-entraîner un modèle par type de capteur. Un modèle unifié capable à la fois d'interpréter et de générer du signal tactile à travers différents capteurs ouvrirait la voie à un transfert d'apprentissage sans recollecte massive de données, et à une augmentation synthétique des jeux de données tactiles pour l'entraînement de politiques de manipulation. C'est un pas potentiel vers l'intégration du toucher dans les modèles vision-langage-action (VLA) qui structurent aujourd'hui la robotique humanoïde, où la perception reste très majoritairement centrée sur la vision. Ce travail s'inscrit dans la continuité des modèles multimodaux unifiés développés pour l'image et le texte, ici transposés au domaine tactile encore largement sous-exploré selon les auteurs. Il ne s'agit à ce stade que d'une publication de recherche, sans capteur commercial ni intégration robotique annoncée : l'article ne précise ni partenariat industriel, ni calendrier de déploiement, ce qui en fait une contribution méthodologique plutôt qu'un produit prêt à l'emploi.

1 source
Modélisation structurelle-hydrodynamique unifiée des mécanismes sous-actionnés sous-marins et des robots souples
2102arXiv cs.RO 

Modélisation structurelle-hydrodynamique unifiée des mécanismes sous-actionnés sous-marins et des robots souples

Sous-marins et souples, des robots sans actionneurs excédentaires posent un problème classique en robotique : comment modéliser précisément un système dont on ne connaît ni les paramètres structurels (raideur, amortissement) ni les forces hydrodynamiques qui s'exercent dessus. Une équipe de recherche propose une réponse dans un article mis à jour sur arXiv (2603.07939v2) : un cadre d'optimisation globale piloté par trajectoire, inspiré de la stratégie d'évolution CMA-ES (Covariance Matrix Adaptation Evolution Strategy), capable d'identifier simultanément les paramètres élastiques, d'amortissement et hydrodynamiques distribués d'un système multi-corps sous-marin. La méthode fonctionne en comparant, trajectoire par trajectoire, un mouvement simulé à un mouvement observé expérimentalement, et ne nécessite qu'un simple enregistrement vidéo pour calibrer le modèle. Sur un mécanisme sous-actionné articulé testé en configuration active-passive et passive pure, l'erreur de position normalisée de l'effecteur reste sous les 5 % quelles que soient la trajectoire et les conditions initiales. La méthode a ensuite été validée sur un bras souple asymétrique inspiré de la pieuvre, puis sur un système complet de huit bras assemblés en un robot pieuvre nageur, où le même jeu de paramètres reproduit un comportement corporel réaliste sans recalibrage supplémentaire. L'enjeu dépasse la simple prouesse académique : les mécanismes sous-actionnés et les robots souples sont privilégiés en environnement sous-marin car réduire le nombre d'actionneurs limite les risques de fuite au niveau des moteurs, tout en offrant une compliance mécanique utile pour manipuler des objets fragiles ou s'adapter aux courants. Le principal frein à leur adoption reste la difficulté de modéliser des systèmes à la fois élastiques et soumis à une hydrodynamique complexe, ce qui limite le contrôle précis et le transfert simulation-vers-réel. Un cadre unifié qui identifie structure et hydrodynamique conjointement, et qui se généralise d'un bras isolé à un assemblage complet sans retuning, réduirait significativement le travail d'ingénierie nécessaire avant tout déploiement en exploration océanique ou manipulation sous-marine. Ce travail s'inscrit dans une lignée de recherches sur l'identification de paramètres pour robots souples et sous-actionnés, où les approches précédentes traitaient généralement séparément la caractérisation structurelle et l'estimation hydrodynamique, ou nécessitaient des bancs d'essai instrumentés lourds. En s'appuyant sur une simple vidéo et une optimisation de type CMA-ES, les auteurs visent une méthode moins coûteuse à mettre en œuvre. Les prochaines étapes annoncées concernent l'extension à des géométries plus complexes et des essais en conditions océaniques réelles, au-delà des validations en bassin présentées ici.

RecherchePaper
1 source
Motion planning dans des espaces de représentation compressée
2103arXiv cs.RO 

Motion planning dans des espaces de représentation compressée

Ce n'est pas de la démonstration produit ni de déploiement industriel, mais un article de recherche qui touche directement au coeur du "VLA qui marche à l'échelle" : je rédige l'article en respectant le format demandé. Des chercheurs proposent une nouvelle méthode de planification de mouvement combinant apprentissage profond et recherche algorithmique classique, dans un article publié sur arXiv le 30 juin 2026 (arXiv:2606.30940). Le principe repose sur un autoencodeur entraîné à fort taux de compression, dont l'espace latent est organisé en tokens discrets hiérarchisés, du grossier au fin. Plutôt que de générer des trajectoires directement, le système effectue une recherche dans cet espace latent compressé pour construire des plans de mouvement, en optimisant des fonctions objectif définies au moment du test, sans entraînement spécifique à la tâche. La méthode a été évaluée sur deux jeux de données de référence en conduite autonome, nuPlan et le Waymo Open Motion Dataset, sur des tâches de planification de mouvement en boucle fermée et de synthèse de scénarios multi-agents guidés. L'enjeu pour l'industrie robotique et la conduite autonome est de taille : les approches par apprentissage profond capturent bien la complexité des comportements réels mais restent rigides une fois entraînées sur un objectif fixe, tandis que les méthodes de recherche et d'optimisation classiques offrent flexibilité et contrôle explicite au prix d'un manque de réalisme. En permettant de rechercher directement dans un espace latent compressé et hiérarchisé, les auteurs affirment obtenir le meilleur des deux mondes, un espace de solutions réduit et structuré qui garde le réalisme générique de l'autoencodeur, tout en acceptant n'importe quel objectif spécifié à la volée. Si les résultats se confirment à plus grande échelle, cela ouvrirait la voie à des planificateurs capables de s'adapter à de nouvelles contraintes (sécurité, confort, interaction multi-agents) sans réentraînement coûteux, un point critique pour les intégrateurs qui doivent déployer des systèmes de navigation sur des flottes hétérogènes de véhicules ou de robots mobiles. Ce travail s'inscrit dans une lignée de recherches cherchant à réconcilier planification model-based et modèles génératifs appris, un débat qui traverse aussi bien la conduite autonome que la robotique manipulatrice, où des architectures VLA comme Pi-0 ou GR00T N2 tentent une intégration différente entre perception, langage et action. La méthode se distingue en misant sur la compression et la structure discrète hiérarchique de l'espace latent plutôt que sur des politiques bout-en-bout continues. Les auteurs ne mentionnent pas de partenariat industriel ni de déploiement au-delà des benchmarks nuPlan et Waymo ; l'article reste donc à ce stade une contribution de recherche, sans calendrier de transfert vers un produit commercial ou un pilote terrain.

RecherchePaper
1 source
ActiveVital : surveillance des signes vitaux intégrant la géométrie corporelle pour robots de soins à domicile
2104arXiv cs.RO 

ActiveVital : surveillance des signes vitaux intégrant la géométrie corporelle pour robots de soins à domicile

Des chercheurs présentent dans un preprint arXiv (référence 2606.30275, juin 2026) un système baptisé ActiveVital, conçu pour surveiller en continu les signes vitaux, fréquence respiratoire et rythme cardiaque, sans contact physique, à bord d'un robot domestique équipé d'un radar à ondes millimétriques (mmWave). Le problème physique de départ est précis : un radar mmWave ne mesure que la composante radiale du mouvement. Lorsque le robot n'est pas positionné face à la cage thoracique du patient, l'alignement angulaire se dégrade, rendant le signal inutilisable. Résultat avant correction : une erreur d'intervalle respiratoire de 0,87 seconde et une erreur de fréquence cardiaque de 13,59 bpm. Après activation d'ActiveVital, ces chiffres tombent à 0,14 seconde et 2,22 bpm, soit des performances comparables à celles obtenues dans des conditions de mesure statique et contrôlée. La contribution centrale n'est pas algorithmique au sens habituel : elle recadre le problème de la détection passive en régulation géométrique active. Le système détecte la position du thorax par points clés visuels, convertit l'erreur d'alignement en commandes de déplacement, et oriente dynamiquement le radar vers une incidence quasi-normale à la surface thoracique. Un module de rehaussement différentiel de phase stabilise ensuite l'extraction du signal pendant les mouvements résiduels. Pour un COO de EHPAD ou un intégrateur de robots de compagnie, cela signifie concrètement qu'un robot en patrouille libre peut surveiller les constantes d'un résident sans balise portée, sans caméra RVB dédiée aux signes vitaux, et sans immobilité imposée. Le monitoring non-contact par radar mmWave est un axe de recherche actif depuis au moins 2018, mais les travaux antérieurs supposaient des configurations statiques ou semi-contrôlées. Les acteurs industriels positionnés sur la robotique de soin incluent des plateformes comme Labrador Systems ou les robots de compagnie de Softbank, et côté capteur, des puces mmWave de Texas Instruments ou Infineon. ActiveVital reste à ce stade un prototype académique non affilié à un déploiement industriel annoncé ; aucun essai terrain ni partenariat industriel n'est mentionné dans le preprint. La prochaine étape naturelle sera la validation sur robot mobile réel dans des environnements non supervisés, puis l'évaluation sur des populations âgées avec comorbidités respiratoires.

RecherchePaper
1 source
FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
2105arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source
MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques
2106arXiv cs.RO 

MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques

Une équipe de recherche publie en préimpression sur arXiv (2606.29237) une méthode baptisée MoPe (Motion Permanence) qui vise à corriger un défaut structurel des systèmes de cartographie par Gaussian Splatting monoculaire en environnements dynamiques. Le problème ciblé est précis : les approches actuelles de SLAM avec Gaussian Splatting traitent chaque image de manière indépendante pour décider si une région est dynamique ou statique. Résultat, quand un piéton ralentit, s'arrête ou réapparaît après une occultation, la trame courante semble statique et le système intègre ce contenu mobile dans la carte permanente, générant des artefacts de type "fantôme" (ghosting). MoPe repose sur un principe qu'il nomme Motion Permanence : l'identité dynamique d'un objet doit persister dans le temps plutôt qu'être réévaluée à chaque image. Concrètement, la méthode propage le posterior dynamique historique via un warping géométriquement cohérent en SE(3), puis le fusionne avec les observations de la trame courante par mises à jour bayésiennes en log-odds bornées. Ce posterior persistant pilote le suivi, la cartographie, l'insertion sélective de gaussiennes et un post-nettoyage par gaussienne individuelle. Les auteurs évaluent MoPe sur trois benchmarks publics (Wild-SLAM, Bonn, TUM) et rapportent des gains de robustesse en tracking et une réduction des ghosting, avec les améliorations les plus marquées sur les séquences à humains dynamiques. L'enjeu pour les intégrateurs et les équipes de navigation autonome est direct : un SLAM qui "hallucine" des obstacles statiques là où un piéton s'était simplement immobilisé dégrade la planification de trajectoire et la prise de décision en aval. En introduisant une mémoire temporelle au niveau de la représentation de scène elle-même, MoPe traite le problème à la racine plutôt qu'en post-filtrage. La méthode prouve qu'un filtre d'incertitude à mémoire, relativement léger à implémenter, suffit à franchir une partie du fossé entre les démos en laboratoire et les déploiements réels en environnements peuplés, sans recourir à une caméra stéréo ou à un LiDAR. Le Gaussian Splatting appliqué au SLAM est un domaine en effervescence depuis 2023, porté par des travaux comme SplaTAM, MonoGS et GaussianSLAM, qui ont démontré la faisabilité d'une cartographie haute-fidélité en temps réel à partir d'une seule caméra. MoPe s'inscrit dans la vague des méthodes qui cherchent à rendre ces représentations exploitables hors des environnements contrôlés, aux côtés d'approches concurrentes comme RobustSplat ou les variantes uncertainty-aware de MonoGS. Il s'agit pour l'instant d'une préimpression non revue par les pairs, sans code publié ni validation sur robot réel annoncée, ce qui invite à tempérer les conclusions : les gains mesurés sur séquences vidéo ne garantissent pas un comportement équivalent sur plateforme embarquée avec contraintes temps-réel. Les prochaines étapes naturelles seront l'intégration dans un pipeline de navigation complet et la validation sur datasets intérieurs type HM3D ou ScanNet avec scènes plus peuplées.

RecherchePaper
1 source
CAR : adaptation cinédynamique inter-véhicules par représentation de la mobilité
2107arXiv cs.RO 

CAR : adaptation cinédynamique inter-véhicules par représentation de la mobilité

Des chercheurs proposent sur arXiv (arXiv:2603.06866) un cadre algorithmique baptisé CAR, pour Cross-vehicle kinodynamics Adaptation via mobility Representation, conçu pour transférer rapidement les modèles de comportement dynamique d'un robot mobile à un autre sans recollecte massive de données. Le système exploite un encodeur Transformer avec normalisation de couche adaptative (Adaptive Layer Normalization) pour projeter trajectoires et configurations physiques de véhicules dans un espace latent commun dit "espace de mobilité partagé". CAR identifie ensuite les voisins les plus proches dans cet espace pour extraire les comportements communs et les adapter à une nouvelle plateforme. Évalué sur le simulateur Verti-Bench, construit sur le moteur multi-physique Chrono, et validé sur quatre configurations distinctes de la plateforme Verti-4-Wheeler, le framework atteint une réduction de l'erreur de prédiction de 67,2 % par rapport à un transfert direct entre plateformes similaires, avec seulement une minute de nouvelles données de trajectoire. Ce résultat adresse un verrou opérationnel réel pour les déployeurs de flottes hétérogènes : adapter un système de navigation autonome à un nouveau châssis exige aujourd'hui soit des campagnes d'acquisition de données coûteuses et spécifiques à chaque plateforme, soit des modèles simplifiés (unicycle, bicyclette) qui ignorent la kinodynamique réelle du robot. Ces abstractions montrent rapidement leurs limites sur terrain accidenté ou en conditions industrielles. CAR propose un transfert de connaissances inter-plateformes à faible coût de calibration. Pour un intégrateur déployant des AMR avec plusieurs types de châssis, réduire à une minute la fenêtre d'adaptation représente un levier opérationnel concret, même si ces conditions de benchmark restent à reproduire en environnements de production réels. L'article s'inscrit dans un courant actif de la recherche en robotique de terrain visant à briser la dépendance aux modèles plateforme-spécifiques. La plateforme Verti-4-Wheeler, reconfigurable mécaniquement, et le simulateur Verti-Bench offrent un banc d'essai modulaire bien adapté à ce type d'étude. Les approches concurrentes incluent les méthodes de méta-apprentissage (MAML et dérivés) et les modèles à dynamiques latentes (Dreamer, RSSM) appliqués à la locomotion. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné : il s'agit d'un résultat académique en cours de révision (v3 sur arXiv), dont la validation à grande échelle reste à démontrer.

RecherchePaper
1 source
Évaluation en temps réel de la sécurité des opérations du bras humain via un IMU au poignet avec système PSM
2108arXiv cs.RO 

Évaluation en temps réel de la sécurité des opérations du bras humain via un IMU au poignet avec système PSM

Des chercheurs publient sur arXiv (2502.09241) un système de surveillance de sécurité en temps réel pour environnements de fabrication collaboratifs homme-robot, basé sur une unité de mesure inertielle (IMU) portée au poignet et couplée à un modèle de sécurité prédictif (PSM, Predictive Safety Model). Le coeur du dispositif repose sur un modèle masse-ressort-amortisseur adapté aux mouvements du poignet, qui effectue une évaluation probabiliste du risque par calcul d'impédance mécanique. L'approche a été validée expérimentalement sur trois tâches manufacturières représentatives : manipulation d'outils, inspection visuelle et opérations de pick-and-place. Les auteurs démontrent la tenue en temps réel du système grâce à une sélection optimisée des paramètres, sans préciser les fréquences d'échantillonnage ni les latences mesurées dans le preprint. La pertinence industrielle tient à un problème structurel des cobots : comment évaluer dynamiquement le risque d'un opérateur sans interrompre le cycle productif. Les méthodes classiques de surveillance reposent soit sur des capteurs de force intégrés au robot (coûteux, limités à la zone d'interaction directe), soit sur des systèmes de vision 3D (sensibles aux occlusions, gourmands en calcul). Un IMU porté au poignet offre une alternative légère et portable, indépendante de l'infrastructure fixe. L'analyse en domaine fréquentiel pour établir des seuils quantitatifs de sécurité constitue une contribution méthodologique, mais elle reste à confronter aux exigences normatives ISO/TS 15066 qui régissent la vitesse et la puissance des robots collaboratifs en Europe et en Amérique du Nord. Le PSM dont s'inspire ce travail appartient à une lignée de modèles prédictifs développés en robotique collaborative, parallèlement aux travaux du DLR sur l'évaluation de risque biomécanique et aux implémentations commerciales comme SafeMove (ABB) ou les fonctions Speed&Separation Monitoring. Aucune entreprise partenaire ni timeline de déploiement n'est mentionnée dans le preprint : il s'agit d'une contribution académique en phase de validation expérimentale, sans prototype industriel annoncé. Les suites évoquées concernent l'évaluation adaptative du risque en temps réel, ce qui suggère une poursuite en laboratoire avant toute perspective de déploiement terrain.

UELa norme ISO/TS 15066, référence réglementaire pour les cobots en Europe, est citée comme horizon de validation obligatoire, mais l'absence de partenaire industriel européen et de métriques publiées (latence, fréquence d'échantillonnage) maintient ce travail au stade académique sans impact opérationnel immédiat sur le marché EU.

RecherchePaper
1 source
Planification de mouvement adaptative aux événements avec un modèle vision-langage distillé en situations critiques
2109arXiv cs.RO 

Planification de mouvement adaptative aux événements avec un modèle vision-langage distillé en situations critiques

Une équipe de chercheurs a déposé le 25 juin 2026 sur arXiv (réf. 2606.25629) un cadre algorithmique baptisé EAMP (Event-Adaptive Motion Planning) pour la navigation robotique en environnements logistiques à criticité sécurité. Le système repose sur trois modules imbriqués : un déclencheur sémantique configurable par prompt, le PC-SET, qui surveille en continu de courtes séquences vidéo pour détecter des anomalies comportementales ; un modèle vision-langage allégé, le SemNav-VLM, activé uniquement lors d'une anomalie avérée, qui produit des décisions stratégiques discrètes ; et un module de contrôle prédictif sémantique (SMPC) qui traduit ces décisions en reconfiguration des objectifs d'optimisation et des références géométriques du planificateur bas niveau. Le SemNav-VLM est obtenu par distillation d'un grand modèle vision-langage (VLM), guidée par des vérifications de cohérence physique, ce qui préserve le raisonnement de bon sens du modèle parent tout en réduisant drastiquement la latence d'inférence. Les expériences sont menées dans des scénarios logistiques simulés. L'enjeu adressé est structurel pour la robotique mobile industrielle : dans les entrepôts et environnements mixtes, la majorité des collisions ne provient pas d'obstacles statiques inédits, mais du comportement imprévisible d'agents dynamiques, opérateurs humains, chariots élévateurs, autres robots autonomes. Les VLMs, capables d'un raisonnement contextuel robuste sur ces situations, sont jusqu'ici incompatibles avec la boucle de contrôle temps-réel en raison de leur latence computationnelle, qui déstabilise l'exécution physique. EAMP résout cette contradiction par déclenchement conditionnel : le modèle allégé n'est invoqué qu'en présence d'une anomalie, préservant l'efficacité temps-réel sans sacrifier la capacité de raisonnement sémantique. Les résultats indiquent une amélioration significative des marges de sécurité dynamiques par rapport aux baselines existantes. Il s'agit néanmoins d'une démonstration en simulation ; aucune validation sur robot physique réel n'est rapportée dans cette version du preprint. Ce travail s'inscrit dans une tendance de fond de 2025-2026 : intégrer les capacités de raisonnement des grands modèles dans des architectures de planification classiques (MPC, RRT) sans sacrifier la réactivité temps-réel. Les approches concurrentes incluent les modèles VLA (Vision-Language-Action) de bout en bout comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui fusionnent différemment raisonnement et action à l'échelle. La distillation supervisée par contraintes physiques est une direction active pour compresser ces modèles sans dégradation critique. Côté déploiement, des acteurs comme Exotec (France, système Skypod) opèrent déjà dans des entrepôts mixtes humains-robots où la problématique des agents dynamiques est centrale ; un cadre comme EAMP pourrait constituer une brique de planification adaptative pour ces systèmes, à condition d'une validation physique que les auteurs n'ont pas encore fournie.

UEExotec (France, système Skypod) est explicitement cité comme cas d'usage potentiel pour ce cadre de planification adaptative, mais l'absence de validation sur robot physique réel reporte tout impact industriel concret.

RecherchePaper
1 source
SurveilNav : navigation collaborative vers des objets cibles avec robot et système de surveillance
2110arXiv cs.RO 

SurveilNav : navigation collaborative vers des objets cibles avec robot et système de surveillance

Une équipe de chercheurs propose SurveilNav, un système de navigation collaborative couplant un robot mobile à un réseau de caméras de surveillance fixes pour localiser des objets dans des espaces intérieurs de grande surface. Présenté sous forme de preprint arXiv (arXiv:2606.25119, juin 2026), le travail introduit un jeu de données inédit construit sur le simulateur Habitat-Sim, comportant 206 caméras réparties sur 74 étages. Le framework s'articule autour de quatre composants : un ordonnanceur de caméras actives, une cartographie conjointe 2D/3D, une estimation de valeur fondée sur un VLM (Vision-Language Model), et une vérification collaborative de la cible détectée. Évalué sur le benchmark HM3D (Habitat-Matterport 3D), SurveilNav atteint des résultats état de l'art en efficacité d'exploration et en taux de succès de navigation par rapport aux méthodes mono-agent existantes. L'intérêt technique tient à la complémentarité des deux types de perception : un robot mobile dispose d'une vue dynamique locale mais limitée par sa portée et ses angles morts, tandis qu'un réseau de caméras fixes offre une couverture globale statique, incomplète par construction. SurveilNav fusionne ces deux sources en temps réel via cartographie 3D partagée et estimation sémantique par VLM, permettant de prioriser les zones à explorer sans balayage exhaustif. Pour les intégrateurs industriels opérant dans des entrepôts ou usines déjà équipés d'infrastructure vidéo, la proposition est directement pertinente : elle exploite un actif existant (le réseau CCTV) pour augmenter les capacités des AMR sans modifier le matériel. L'usage du VLM pour l'estimation de valeur sémantique reste néanmoins un point à surveiller, les auteurs ne précisant pas la latence d'inférence ni sa compatibilité avec une navigation temps réel en conditions réelles. Le champ de l'Object Goal Navigation (OGN) s'est principalement construit sur des architectures mono-agent et des environnements simulés (Habitat, AI2-THOR, Gibson). L'extension vers un réseau de capteurs fixes hétérogènes représente une direction logique vers des scénarios industriels réels, où bâtiments tertiaires et usines sont massivement équipés de systèmes CCTV. Les travaux concurrents sur la navigation multi-robot, comme MultiON ou CoNav, restent centrés sur la coopération entre agents mobiles homogènes et ne tirent pas parti de l'infrastructure fixe existante. Aucun acteur européen n'est impliqué selon le résumé disponible. Les débouchés envisagés, dont la recherche en zone sinistrée (search-and-rescue) et la domotique, restent au stade de la validation en simulation : aucun déploiement terrain ni partenariat industriel n'est annoncé.

RecherchePaper
1 source
MIL-LC : architecture robuste de localisation multimodale par fusion magnétomètre-inertiel-LiDAR
2111arXiv cs.RO 

MIL-LC : architecture robuste de localisation multimodale par fusion magnétomètre-inertiel-LiDAR

Une équipe de recherche publie sur arXiv (identifiant 2606.25796, juin 2026) un framework de localisation multimodale baptisé MIL-LC, qui fusionne trois sources de données : un magnétomètre, une centrale inertielle (IMU) et un LiDAR, montés sur une suite de capteurs conçue spécifiquement pour les robots mobiles autonomes (AMR). Le système cible les environnements où le GPS est absent et où les méthodes classiques échouent : parkings souterrains, hôtels, open-spaces à géométrie répétitive ou sans texture distinctive. MIL-LC est conçu pour maintenir une localisation fiable dans deux scénarios critiques : la dégénérescence géométrique du LiDAR (tunnels, couloirs uniformes), et l'évolution de la carte magnétique au fil du temps lors de déploiements longue durée. Les résultats présentés couvrent des tests en simulation et en environnement réel, sans chiffres de précision publiés dans le résumé disponible. L'intérêt industriel réside dans la promesse d'un déploiement sans infrastructure supplémentaire. Les solutions actuelles de localisation indoor pour AMR s'appuient soit sur des features géométriques ou visuelles (fragiles en environnement répétitif), soit sur des balises UWB, Wi-Fi ou QR (coût d'installation, maintenance, rigidité de déploiement). Le champ magnétique ambiant (AMF), lui, est omniprésent et ne nécessite aucun équipement terrain. L'apport de MIL-LC est de transposer cette idée, jusqu'ici explorée uniquement en contexte piéton avec des smartphones, à un AMR équipé d'une suite capteurs dédiée. Pour un intégrateur ou un COO industriel, cela signifie potentiellement réduire les prérequis d'installation dans des bâtiments complexes, un frein récurrent à l'adoption. La fusion magnétomètre-IMU pour la localisation piétonne a été explorée depuis plusieurs années par des laboratoires de robotique (notamment en Chine, en Europe et au Japon), mais son application aux AMR industriels restait largement ouverte. Les alternatives dominantes sur le marché AMR indoor incluent le SLAM LiDAR pur (Sick, Hokuyo, Livox), la vision (Boston Dynamics, Locus Robotics), et les systèmes hybrides LiDAR+vision. Côté français, des acteurs comme Exotec (logistique) ou Balyo déploient des AMR en entrepôts structurés, moins exposés aux environnements dégradés ciblés ici. MIL-LC reste pour l'instant une contribution académique en preprint, sans annonce de déploiement ni de partenariat industriel. Une soumission vers une conférence de référence (ICRA ou IROS) constituerait la prochaine étape naturelle avant toute validation à l'échelle.

UEImpact indirect pour les déployeurs français d'AMR (Exotec, Balyo) qui opèrent majoritairement en entrepôts structurés ; la contribution reste un preprint sans métriques publiées ni validation industrielle, à suivre si soumis à ICRA/IROS.

RecherchePaper
1 source
MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique
2112arXiv cs.RO 

MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique

Des chercheurs présentent MAPL (Multi-Objective AI-Informed Preference Learning), un cadre d'apprentissage par renforcement pour la locomotion quadrupède qui remplace les fonctions de récompense manuelles par des préférences générées par LLM. Publié sur arXiv (réf. 2606.25398) en juin 2025, le système soumet des paires de trajectoires à un grand modèle de langage, qui les évalue selon plusieurs critères sémantiques distincts, formulés en langage naturel générique et invariants selon le terrain. Ces préférences par objectif alimentent un modèle de scoring à plusieurs têtes, dont les sorties sont agrégées en récompense scalaire pour l'optimisation de politique. Sur quatre environnements de simulation quadrupède, les auteurs rapportent des performances comparables ou supérieures à des récompenses conçues par des experts du domaine. L'intérêt de MAPL tient à sa décomposition structurée des objectifs, là où les méthodes LLM existantes se limitent à un jugement global entre comportements. En robotique industrielle, la conception de fonctions de récompense reste un goulot d'étranglement reconnu, exigeant de longues itérations entre ingénieurs RL et spécialistes métier. Substituer ce travail par des descriptions en langage naturel, réutilisables sans réécriture d'équations, réduirait le coût d'adaptation à de nouvelles tâches. La décomposition en critères distincts offre aussi une meilleure interprétabilité : il devient possible d'identifier quels objectifs sont en tension, ce qui facilite le débogage comportemental. MAPL s'inscrit dans la vague d'automatisation de la conception de récompenses via LLM, initiée notamment par EUREKA (NVIDIA, 2023), qui générait directement du code de récompense via GPT-4, et par RL-VLM-F, qui exploite des modèles vision-langage pour évaluer les comportements. La locomotion quadrupède est un benchmark standard utilisé par des projets comme ANYmal (ETH Zurich) et les plateformes Unitree. Plusieurs limites méritent d'être signalées : l'article reste un preprint non relu par les pairs, les expériences sont menées uniquement en simulation sans validation physique, et le LLM utilisé pour générer les préférences n'est pas spécifié, ce qui complique la reproductibilité. Les extensions naturelles concernent la validation sur robot réel et l'application à des morphologies plus complexes, comme les humanoïdes, où l'ingénierie de récompense est particulièrement coûteuse.

RecherchePaper
1 source
GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots
2113arXiv cs.RO 

GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots

GROVE (Grounded Robot-Oriented Vehicle Environment), présenté dans un preprint arXiv (2606.25504) déposé fin juin 2026, est un framework de simulation de piétons piloté par langage naturel, conçu pour entraîner et évaluer des robots de navigation sociale. Le système accepte des instructions textuelles pour générer des scénarios de simulation: trois presets préconfigurés couvrent les situations d'urgence, de file d'attente et de déplacement ordinaire, mais l'utilisateur peut aussi saisir un prompt libre pour obtenir un scénario entièrement personnalisé. Trois modules distincts gèrent respectivement le comportement humain à long horizon (trajectoires et intentions globales), la navigation piétonne à moyen horizon (évitement, flots de foule), et les interactions sociales à court horizon entre robot et individus. GROVE s'intègre nativement dans Isaac Sim (NVIDIA), Gazebo et RViz. Les scènes de validation couvrent des environnements résidentiels, hospitaliers et de bureau. Le principal verrou que GROVE cherche à lever est le coût de génération manuelle de données de simulation: aujourd'hui, produire un scénario crédible (couloir d'hôpital en heure de pointe, évacuation d'urgence) exige un travail de paramétrage fastidieux, répété à chaque variante. Déléguer cette configuration au langage naturel réduit la friction pour les équipes non-spécialistes et accélère la diversification des données d'entraînement. La sélection dynamique des algorithmes de l'état de l'art par module vise explicitement à comprimer le sim-to-real gap, défaillance structurelle qui pénalise le transfert des politiques apprises en simulation vers des robots déployés en milieu réel. Sur le papier, l'architecture modulaire permet aussi de mettre à jour chaque couche indépendamment quand un nouvel algorithme de navigation ou de prédiction de trajectoire devient disponible. La navigation sociale robotique est un champ actif depuis plus d'une décennie, avec des modèles fondateurs comme le Social Force Model et des outils de simulation existants (PedSim, pedsim\_ros, SEAN) qui imposaient des paramétrages rigides et manuels. GROVE s'inscrit dans une tendance plus large d'utilisation des LLM comme interface de configuration pour les pipelines de simulation, une direction explorée parallèlement dans la génération procédurale de scènes 3D. Important à noter: la validation présentée est uniquement qualitative, sans benchmark quantitatif sur des métriques standardisées comme celles de trajnet++ ou BARN. Les affirmations sur la "haute fidélité" de simulation restent donc à vérifier sur robot réel. Le preprint ne mentionne ni déploiement en production ni partenariat industriel.

RecherchePaper
1 source
Emcar : contrôleur incarné pour l'animation de robots
2114arXiv cs.RO 

Emcar : contrôleur incarné pour l'animation de robots

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2506.26008) la description d'EMCAR, un outil logiciel de programmation de mouvements robotiques basé sur des métaphores artistiques comme la marionnette et le dessin. La plateforme, présentée dans le cadre de la recherche en interaction humain-robot (HRI), adopte une approche no-code : aucune ligne de code n'est requise pour concevoir, tester et déployer des comportements sur des robots collaboratifs. L'article ne précise pas de plateformes matérielles cibles ni de métriques de performance (temps de programmation, taux d'erreur), ce qui limite l'évaluation des gains réels. L'enjeu central est celui de l'accessibilité : la programmation de cobots reste aujourd'hui l'apanage d'ingénieurs formés en robotique ou en ROS, ce qui freine le déploiement dans des environnements non-industriels (médiation culturelle, thérapie, spectacle vivant). En ouvrant l'outil à des artistes et à des profils sans bagage technique, EMCAR vise à élargir le spectre des cas d'usage HRI et à alimenter la recherche participative. Si la démonstration tient à l'échelle, cela confirmerait que l'abstraction par le geste et le mouvement peut substituer efficacement les interfaces de programmation classiques pour des tâches expressives. Ce type d'approche s'inscrit dans un courant établi : Choreograph de SoftBank Robotics pour Pepper et NAO, les interfaces de programmation par démonstration de Universal Robots, ou encore les environnements visuels Scratch-for-robots développés en milieu académique. Des acteurs français comme Enchanted Tools (Miroki) explorent également des paradigmes d'interaction expressifs pour les cobots. La suite dépendra de l'ouverture du code et des validations expérimentales avec des utilisateurs non-techniques, non encore publiées.

UESi EMCAR publie son code en open-source avec validation expérimentale, des acteurs français comme Enchanted Tools (Miroki) pourraient accélérer leurs interfaces de programmation expressive pour cobots dans des secteurs non-industriels (médiation culturelle, thérapie).

RecherchePaper
1 source
MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action
2115arXiv cs.RO 

MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.24815) un framework nommé MANGO, pour Multi-Agent test oracle GENeration for Vision-Language-Action models. Les modèles VLA constituent la nouvelle génération de systèmes de contrôle robotique : ils intègrent dans une architecture unifiée la perception visuelle, la compréhension du langage naturel et la génération d'actions motrices. L'approche dominante pour les tester repose sur des oracles symboliques écrits manuellement, des fonctions qui évaluent si un robot a accompli sa tâche à partir de l'état final de l'environnement. MANGO automatise cette étape via un pipeline de trois agents LLM collaboratifs : un Generator qui produit une bibliothèque d'actions atomiques réutilisables, un Assessor qui ancre ces définitions dans le simulateur, et un Judge qui arbitre et affine les artefacts par feedback itératif. Le système a été évalué sur les benchmarks LIBERO_10 et RoboCasa Humanoid Tabletop. L'intérêt principal est de supprimer le goulot d'étranglement humain dans la qualification des robots VLA. Les oracles symboliques actuels exigent une expertise domaine significative et restent couplés à une tâche précise, ce qui limite fortement leur réutilisation dès qu'on change de scénario ou de cellule de travail. MANGO génère des oracles à grain fin capables d'évaluer des étapes intermédiaires, pas seulement l'état final, ce qui améliore la localisation des pannes : au lieu de constater qu'un robot a échoué, on identifie quelle action atomique a dévié. Les résultats montrent une détection de défauts comparable aux oracles symboliques manuels avec une couverture diagnostique plus riche, un levier direct pour les équipes QA qui valident des flottes de robots VLA en production. Les modèles VLA ont connu une accélération marquée depuis 2024 avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI et plusieurs variantes issues des laboratoires académiques. Tous partagent le même point faible : leur validation reste artisanale, peu reproductible, et difficile à passer à l'échelle. MANGO s'inscrit dans un effort croissant pour combler le fossé entre démos en laboratoire et déploiement industriel, en dotant les pipelines CI/CD robotiques d'outils d'évaluation automatisés. L'article demeure un preprint non relu par les pairs et le code n'est pas encore publié, ce qui invite à nuancer les résultats avant toute adoption. La prochaine étape naturelle serait une validation sur environnements physiques réels, au-delà des scénarios de manipulation sur table couverts par les benchmarks actuels.

RechercheOpinion
1 source
ArtiTwinSplat : reconstruction de jumeaux numériques interactifs par Gaussian Splatting à partir de vidéos RGB-D
2116arXiv cs.RO 

ArtiTwinSplat : reconstruction de jumeaux numériques interactifs par Gaussian Splatting à partir de vidéos RGB-D

ArtiTwinSplat, présenté dans un preprint arXiv (arXiv:2606.24628) daté du 30 juin 2026, est un framework de reconstruction automatique de jumeaux numériques articulés depuis des vidéos RGB-D, sans modèles CAO, assets de simulation ni annotations manuelles. La méthode combine le 3D Gaussian Splatting (3DGS), une représentation 3D par primitives gaussiennes reconnue pour sa fidélité géométrique et son rendu temps réel, avec un pipeline non supervisé de détection d'articulations qui infère la structure en parties et la cinématique des joints (axes de rotation, translations) depuis le mouvement observé seul. Les jumeaux numériques produits supportent rendu interactif, contrôle de point de vue et manipulation temps réel, et sont conçus pour être directement consommables par des systèmes de planification et d'apprentissage robotiques en aval. L'enjeu est direct pour les intégrateurs : modéliser des objets articulés (portes, tiroirs, outils industriels) reste un goulot d'étranglement coûteux dans le déploiement de systèmes robotiques. Les approches classiques exigent des modèles CAO fournis par le fabricant ou des sessions de capture très structurées en environnement contrôlé. Un pipeline vidéo RGB-D non supervisé réduit drastiquement ce coût d'onboarding. En opérant sur des observations réelles plutôt que des données synthétiques, ArtiTwinSplat vise à réduire le sim-to-real gap dans les pipelines de manipulation, une promesse importante si elle se confirme à l'évaluation sur des scènes industrielles variées. La méthode s'inscrit dans la vague post-2023 du 3DGS, décliné en variantes articulées comme PARIS (CMU/MIT, 2023) ou REACTO. La revendication d'ArtiTwinSplat est d'être le premier pipeline entièrement non supervisé opérant sur vidéos réelles dans ce registre. Le preprint ne mentionne ni affiliation institutionnelle explicite, ni benchmark chiffré sur des datasets standards comme PartNet-Mobility, ni partenariat industriel : c'est une contribution académique à valider, pas un produit déployé. Des équipes comme Physical Intelligence, Anybotics ou des groupes de Stanford et CMU travaillent sur des problématiques adjacentes de manipulation généraliste en monde ouvert, ce qui situe ArtiTwinSplat dans un champ très compétitif.

IA physiquePaper
1 source
NoContactNoWorries : estimation du contact par vision et proprioception pour la manipulation dextérique en main
2117arXiv cs.RO 

NoContactNoWorries : estimation du contact par vision et proprioception pour la manipulation dextérique en main

Une équipe de chercheurs présente NoContactNoWorries, un cadre multimodal basé sur des transformers qui fusionne la vision RGB-D et la proprioception du robot pour estimer des états de contact binaires pendant la manipulation en main. Publié en prépublication sur arXiv (référence 2506.24450), le système entraîne un unique modèle de prédiction de contact sur plusieurs objets distincts et valide l'approche à la fois en simulation et sur un robot physique. Le signal de contact inféré sert d'entrée pseudo-tactile pour des agents d'apprentissage par renforcement chargés de la réorientation d'objets tenus en main, avec généralisation démontrée sur des objets non vus durant l'entraînement. L'intérêt pour les intégrateurs robotiques est direct : les capteurs tactiles dédiés, qu'il s'agisse de solutions de type GelSight, DIGIT ou de nappes piézorésistives, se heurtent à trois obstacles récurrents en environnement industriel, à savoir le coût unitaire élevé, la fragilité mécanique et la complexité d'intégration sur des mains multi-doigts. NoContactNoWorries contourne ces contraintes en exploitant uniquement des caméras RGB-D et les données proprioceptives déjà disponibles sur la grande majorité des bras et mains robotiques commerciaux. La limitation reste substantielle : la détection est purement binaire (contact ou absence de contact), sans estimation de force ni de distribution de pression, ce qui restreint l'applicabilité aux tâches nécessitant un retour haptique fin, comme l'assemblage de composants fragiles ou la manipulation de textiles. L'approche s'inscrit dans une tendance plus large de la manipulation dextre cherchant à éliminer les capteurs spécialisés au profit de modalités perceptuelles génériques, dans la continuité des travaux sur les politiques visuomotrices à grande échelle (VLA). Le domaine du toucher artificiel reste actif, avec des acteurs comme Contactile (Australie), Touchlab (Écosse) ou les équipes du MIT CSAIL qui développent des capteurs embarqués haute résolution. À ce stade, NoContactNoWorries est un résultat académique en prépublication, non encore soumis à révision par les pairs, et les auteurs n'annoncent aucun calendrier de transfert industriel.

RecherchePaper
1 source
RoBoSR : représentations structurées de scènes pour le raisonnement des robots incarnés
2118arXiv cs.RO 

RoBoSR : représentations structurées de scènes pour le raisonnement des robots incarnés

Une équipe de chercheurs a publié fin juin 2026 un preprint arXiv (2606.24338) présentant RoBoSR, un cadre de représentation intermédiaire structurée pour la manipulation robotique en monde ouvert. L'approche modélise chaque tâche comme une séquence de transitions d'états sur des graphes de scène orientés objet, sémantiquement ancrés. Concrètement, le système segmente l'environnement perçu en entités discrètes (objets, relations spatiales, états) avant de raisonner sur les préconditions et effets de chaque sous-tâche. Pour entraîner ce raisonnement, les auteurs publient simultanément Manip-Cognition-1.6M, un jeu de données de 1,6 million d'exemples couvrant la compréhension de scène, l'interprétation d'instructions et la planification de sous-tâches sur des manipulations variées. Sur plusieurs benchmarks et démonstrations réelles, RoBoSR revendique des performances supérieures aux méthodes par prompting et aux pipelines TAMP classiques (Task and Motion Planning), notamment en généralisation zéro-shot et sur des tâches longue-portée. Ce que pointe cette publication, c'est l'une des frictions centrales des architectures VLA (Vision-Language-Action) actuelles : leur biais séquentiel issu des données de démonstration les rend fragiles dès que la tâche sort du scénario d'entraînement. En intercalant une représentation graphique explicite entre la perception brute et l'action, RoBoSR tente de rendre le raisonnement causal modulaire et réutilisable, ce qui améliore théoriquement la robustesse aux variations d'environnement. Pour un intégrateur industriel, c'est le problème du "demo-to-reality gap" qui est visé : un robot qui comprend les dépendances entre sous-tâches peut récupérer d'un échec partiel sans replanifier depuis zéro. Le dataset Manip-Cognition-1.6M, s'il est effectivement rendu public, constitue également une ressource d'entraînement non négligeable pour la communauté. RoBoSR s'inscrit dans une vague de recherches cherchant à dépasser les limites des modèles d'imitation pure, dans un secteur où Physical Intelligence (pi0), Google DeepMind (GR00T N2) et Figure AI travaillent sur des architectures hybrides mêlant apprentissage et planification symbolique. Le papier reste un preprint non évalué par les pairs, et les résultats en "démonstrations réelles" ne sont pas détaillés quantitativement dans le résumé disponible. Les prochaines étapes naturelles seraient une soumission en conférence (CoRL, ICRA) et la mise à disposition publique du dataset annoncé.

IA physiquePaper
1 source
CoLI : une plateforme reproductible pour l'apprentissage des robots continuum par impression 3D monolithique et téléopération isomorphe
2119arXiv cs.RO 

CoLI : une plateforme reproductible pour l'apprentissage des robots continuum par impression 3D monolithique et téléopération isomorphe

Une équipe de chercheurs a publié sur arXiv (preprint arXiv:2606.20389, juin 2026) la plateforme CoLI, un robot continu open-source conçu pour abaisser les barrières à la recherche en robotique souple. L'architecture repose sur une fabrication par impression 3D multi-matériaux qui produit le bras comme une structure monolithique conforme, éliminant les étapes d'assemblage complexes qui freinaient jusqu'ici la reproductibilité des expériences. Le contrôle s'effectue via une interface de télé-opération isomorphe établissant une correspondance directe au niveau des actionneurs, ce qui supprime le besoin de modélisation cinématique explicite et garantit un mapping sans singularité. La plateforme intègre également la prise en charge de l'apprentissage par imitation pour le contrôle autonome. Les auteurs ont validé le système sur des tâches de manipulation, dont les résultats sont présentés dans le preprint. Le problème central que CoLI attaque est celui de la reproductibilité : dans la littérature sur les robots continus, les designs sont souvent trop spécifiques au laboratoire d'origine pour être dupliqués, ce qui rend la comparaison algorithmique quasiment impossible. En produisant le bras en une seule pièce imprimée et en éliminant la modélisation cinématique au profit d'un mapping actionneurs-actionneurs, la plateforme devient accessible aux équipes ML qui ne sont pas spécialistes de la mécanique des structures souples. C'est un changement de posture : au lieu d'exiger que les chercheurs maîtrisent la mécanique des continuums avant d'entraîner le moindre modèle, CoLI met la couche matérielle au service du pipeline d'apprentissage. La portée reste cependant à confirmer : le preprint ne fournit pas de métriques de cycle time ni de payload sous charge réelle, et les tâches de manipulation évaluées ne sont pas détaillées dans l'abstract. Les robots continus suscitent un intérêt croissant pour des applications en espaces confinés (chirurgie, inspection), mais le champ souffre d'un déficit de benchmarks communs comparable à ce que ImageNet a représenté pour la vision. CoLI s'inscrit dans une tendance plus large de plateformes open-source reproductibles, dans la lignée de projets comme Lerobot (Hugging Face) ou UFactory xArm pour les bras rigides. Côté positionnement, les robots continus n'ont pas encore de concurrent direct sur le segment "reproductible et learning-ready" : les acteurs industriels comme Festo (bionic cobot) ou Continuum Robotics Laboratory (Toronto) travaillent sur des designs propriétaires. Les prochaines étapes naturelles seraient la mise à disposition des fichiers de fabrication, la constitution d'un benchmark de tâches standardisées, et l'intégration avec des frameworks comme Lerobot ou ROS 2 pour accélérer l'adoption communautaire.

RecherchePaper
1 source
Localisation relative d'une équipe de robots mobiles sans infrastructure ni contrôle centralisé, par mesures de distance
2120arXiv cs.RO 

Localisation relative d'une équipe de robots mobiles sans infrastructure ni contrôle centralisé, par mesures de distance

Une équipe de chercheurs publie sur arXiv (2606.20365) un algorithme décentralisé de localisation relative pour flottilles de robots mobiles, conçu pour fonctionner sans infrastructure fixe et sans contrainte imposée sur les trajectoires. La méthode repose uniquement sur l'odométrie locale de chaque agent, des mesures de distance inter-robots (ranging UWB ou radio) et une communication courte portée, trois capacités déjà disponibles sur la quasi-totalité des plateformes AMR commerciales. Le coeur de l'approche est un cadre bayésien multi-hypothèses qui maintient simultanément l'ensemble des configurations spatiales compatibles avec les observations, assurant la robustesse dans les phases où le système est transitoirement non-observable. Ce qui distingue cette contribution de la majorité des solutions existantes est l'abandon de la contrainte d'observabilité par contrôle de mouvement. La plupart des algorithmes de localisation coopérative exigent que les robots exécutent des trajectoires spécifiques pour lever l'ambiguïté sur leurs positions relatives, une hypothèse incompatible avec des missions opérationnelles réelles où chaque robot suit son propre planning. Ici, les agents se déplacent librement et l'algorithme maintient la cohérence des estimées grâce au partage d'information entre voisins, y compris dans des topologies de communication partiellement connectées. Pour un intégrateur de flottilles en entrepôt ou en milieu non structuré, cela signifie aucune balise UWB à déployer, aucun protocole de mouvement contraint, et une mise en service réduite à la configuration logicielle. La localisation coopérative sans ancre fixe est un problème ouvert depuis plusieurs décennies, généralement traité soit par des systèmes centralisés avec beacons (solutions Pozyx, Sewio en contexte industriel), soit par des approches décentralisées nécessitant une coordination des déplacements. Ce travail s'inscrit dans la lignée des recherches sur les swarms décentralisés, avec un positionnement explicitement orienté déploiement rapide en environnements non équipés. Il faut noter que l'article reste à ce stade un preprint arXiv sans validation expérimentale détaillée publiée : les performances réelles sur des flottilles physiques en conditions de terrain, notamment la précision des estimées et le comportement en cas de perte de communication prolongée, restent à démontrer indépendamment.

RecherchePaper
1 source
Tutorat bidirectionnel pour l'apprentissage moteur développemental en robotique : dynamiques co-développées et stabilité
2121arXiv cs.RO 

Tutorat bidirectionnel pour l'apprentissage moteur développemental en robotique : dynamiques co-développées et stabilité

Une équipe de chercheurs a publié sur arXiv (référence 2606.19728, juin 2026) une étude portant sur l'apprentissage moteur développemental des robots, inspirée de la manière dont les nourrissons acquièrent leurs compétences motrices via l'interaction avec leurs aidants. L'expérience centrale implique un robot humanoïde physique chargé d'une tâche de manipulation d'objets, soumis à deux protocoles distincts : d'abord une interaction humain-robot en temps réel, puis un tuteur IA doté d'un mécanisme d'intervention adaptatif conçu pour reproduire la même dynamique bidirectionnelle dans des conditions plus contrôlées. Le système d'apprentissage repose sur un réseau de neurones fondé sur le principe de l'énergie libre (free-energy principle, FEP), étendu par un mécanisme de rejeu génératif (generative replay) permettant un apprentissage stable séquence par séquence à partir d'épisodes tutorés uniques. L'hypothèse centrale, vérifiée dans les deux configurations, est que le tutorat bidirectionnel produit des comportements plus cohérents et une généralisation par étapes (stage-wise generalization), le robot requérant progressivement moins de guidage externe. Cela tranche avec le paradigme dominant de l'apprentissage par démonstration (learning from demonstration, LfD), où le robot reçoit passivement des flux de téléopération sans que ses expériences passées contraignent la dynamique d'interaction. Pour les intégrateurs et ingénieurs roboticiens, l'implication est concrète : les stratégies d'entraînement actuelles, largement fondées sur des démonstrations unidirectionnelles comme celles utilisées par Figure, Tesla Optimus ou Physical Intelligence, pourraient négliger un levier important de cohérence comportementale et de robustesse à la distribution. Ce travail s'inscrit dans la tradition de la robotique développementale, un champ qui emprunte aux sciences cognitives du développement pour concevoir des agents capables d'apprentissage progressif et socialement ancré. Il faut toutefois nuancer : il s'agit d'un preprint arXiv non encore évalué par les pairs, réalisé sur un robot unique dans des conditions expérimentales contrôlées, sans déploiement industriel ni partenariat commercial annoncé. La prochaine étape naturelle serait de tester la scalabilité du protocole sur plusieurs morphologies de robots et sur des tâches plus complexes, afin d'évaluer si la dynamique bidirectionnelle conserve ses avantages au-delà de la manipulation d'objets simples.

RecherchePaper
1 source
pdSTL : logique temporelle de signal probabiliste et différentiable pour les systèmes stochastiques
2122arXiv cs.RO 

pdSTL : logique temporelle de signal probabiliste et différentiable pour les systèmes stochastiques

Des chercheurs ont déposé en juin 2026 sur arXiv pdSTL (probabilistic differentiable Signal Temporal Logic), un cadre formel pour robots autonomes opérant dans des environnements stochastiques. Le système étend la Signal Temporal Logic (STL), formalisme standard pour spécifier des propriétés de sécurité et temporelles dans les systèmes dynamiques, en combinant deux capacités jusqu'ici dissociées : la différentiabilité permettant l'optimisation de trajectoires par gradient, et la sémantique probabiliste appliquée aux trajectoires de croyances (belief trajectories), c'est-à-dire la distribution d'états estimée à partir de capteurs bruités. pdSTL calcule des bornes de satisfaction conservatrices via des sémantiques à intervalles propagées compositionnellement, et formule l'évaluation de la robustesse temporelle comme un dépliage récurrent de style LSTM pour une surveillance en temps linéaire. Les expériences couvrent des scénarios simulés d'évitement d'obstacles et de changement de voie, ainsi que des vols réels avec le nano-drone Crazyflie de Bitcraze soumis à des perturbations aérodynamiques. L'apport central est de résoudre simultanément deux lacunes concurrentes des approches existantes. La STL différentiable déterministe (dSTL) permettait l'optimisation par gradient mais supposait des états connus avec certitude, ignorant le bruit de capteur et la dynamique stochastique. Les extensions probabilistes de la STL existantes offraient des garanties formelles mais sacrifiaient la différentiabilité, les rendant incompatibles avec les pipelines d'apprentissage modernes. pdSTL unifie les deux, et les auteurs rapportent qu'il surpasse significativement dSTL pour le maintien des marges de sécurité sous incertitude réelle. Pour un ingénieur robotique ou un intégrateur travaillant sur la navigation autonome, cette combinaison de garanties probabilistes formelles et d'optimisabilité par gradient constitue une brique potentielle pour des spécifications de sécurité certifiables en conditions opérationnelles. La STL est un outil standard de la vérification formelle de systèmes cyber-physiques depuis les années 2010, et ses extensions différentiables avaient déjà intéressé la communauté robotique pour l'optimisation de trajectoires. Le Crazyflie, drone open-source de la société suédoise Bitcraze, est une plateforme académique de référence appréciée pour sa dynamique instable, qui en fait un test exigeant pour toute approche de contrôle robuste. Ce travail est pour l'instant un preprint non relu par les pairs, sans code public annoncé et sans métriques quantitatives précises dans le résumé, ce qui invite à la prudence face aux affirmations de surperformance. Les équipes de motion planning sous incertitude dans les secteurs drones, véhicule autonome et manipulation industrielle sont les premières concernées par une éventuelle implémentation.

UEBitcraze (Suède, UE) fournit la plateforme drone de validation matérielle, ce qui ancre marginalement ce travail académique dans l'écosystème européen, mais sans impact opérationnel direct à ce stade de preprint non relu.

RecherchePaper
1 source
Belt-Finger : une pince souple à courroie abordable pour la manipulation dextérique en main
2123arXiv cs.RO 

Belt-Finger : une pince souple à courroie abordable pour la manipulation dextérique en main

Des chercheurs présentent Belt-Finger, un module de doigt à double courroie souple conçu comme une extension directe des préhenseurs parallèles standards. Le mécanisme ajoute trois degrés de liberté (DDL) en prise, soit translation, tangage (pitch) et roulis (roll), tout en conservant l'ouverture et la fermeture classiques du préhenseur. Couplé à un bras robotique, l'ensemble atteint 10 DDL contrôlables simultanément via une interface de télé-opération à matériel réduit. Les auteurs ont validé l'approche sur une batterie de tâches difficiles à travers trois pipelines distincts : un contrôleur prédictif par modèle (MPC) pour objets connus, un système de télé-opération temps réel, et des politiques entraînées par apprentissage. La conception est délibérément épurée, orientée vers la fabrication bon marché et l'intégration directe sur les cellules robotiques existantes. La preprint est disponible sur arXiv (2606.20193) et n'a pas encore subi de revue par les pairs. L'apport industriel est concret : les préhenseurs parallèles dominent le marché automatisé parce qu'ils sont simples, robustes et peu coûteux, mais leur incapacité à manipuler un objet en prise oblige le robot à effectuer de larges mouvements bras pour repositionner une pièce, ce qui consomme du temps de cycle et exclut les espaces confinés. Belt-Finger attaque ce verrou sans forcer une refonte d'installation. Pour un intégrateur, cela signifie potentiellement réduire les étapes de manipulation et les fixations auxiliaires dans une cellule sans changer de robot ni de contrôleur. La démonstration que des politiques entraînées fonctionnent avec ce mécanisme suggère également une compatibilité avec les pipelines d'apprentissage par imitation (Learning from Demonstration) en plein essor dans la recherche. Le problème de la dextérité en prise est central en robotique depuis des décennies. Les préhenseurs multi-doigts à haute DDL, comme ceux de Shadow Robotics, SCHUNK ou Robotiq, offrent plus de capacités mais restent coûteux, complexes à contrôler et fragiles en environnement industriel. Belt-Finger se positionne explicitement comme une voie intermédiaire : un upgrade, pas un remplacement. Le résumé ne mentionne ni institution, ni partenaire industriel, ni financement, ni timeline de commercialisation. Les prochaines étapes naturelles seraient une validation sur cycles répétés en conditions réelles et une comparaison quantitative de temps de cycle face à un préhenseur standard sur des tâches représentatives.

UEImpact indirect limité : SCHUNK (Allemagne) figure parmi les acteurs établis dans le segment des préhenseurs avancés que Belt-Finger vise à concurrencer à moindre coût, mais aucun déploiement ou partenariat européen n'est mentionné à ce stade.

RecherchePaper
1 source
Plateforme d'IA incarnée évolutive pour le transfert réel-sim-réel de tâches de manipulation mobile domestique
2124arXiv cs.RO 

Plateforme d'IA incarnée évolutive pour le transfert réel-sim-réel de tâches de manipulation mobile domestique

Une équipe de chercheurs a publié sur arXiv (référence 2606.18646v1) les travaux autour de BestMan, une plateforme logicielle conçue pour boucler le cycle real-to-sim-to-real dans le domaine de la manipulation mobile en environnements domestiques. Le système s'articule autour de trois composants : un module de génération automatique de scènes (ASG) qui reconstruit des environnements simulés à partir d'observations réelles, une architecture d'apprentissage de compétences hybrides évaluable à grande échelle en simulation, et un middleware unifié baptisé HUM (Hardware-agnostic and Unified Middleware) assurant le déploiement sur des manipulateurs mobiles hétérogènes. Il s'agit d'une contribution académique sous forme de preprint, pas d'un produit commercialisé ni d'un déploiement industriel annoncé. L'enjeu central que traite BestMan est le fossé sim-to-real, l'un des verrous les plus persistants de la robotique d'intérieur. La manipulation mobile en environnement non-structuré, c'est-à-dire sur des surfaces encombrées, dans des cuisines ou des entrepôts domestiques sans balisage préalable, reste hors de portée des approches qui nécessitent une reconstruction manuelle et coûteuse des scènes de simulation. Le module ASG automatise cette étape, ce qui réduit le coût d'entrée pour les chercheurs souhaitant tester des stratégies de contrôle. Le middleware HUM, s'il tient ses promesses d'agnosticisme matériel, simplifierait le travail des intégrateurs qui opèrent des flottes de robots hétérogènes : une seule pipeline de simulation pour plusieurs plateformes physiques. L'article revendique des benchmarks standardisés, ce qui manquait cruellement dans le champ de la manipulation mobile, mais les métriques précises de performance (taux de succès, temps de cycle, généralisation à des objets inconnus) ne sont pas détaillées dans l'abstract. BestMan s'inscrit dans une vague de plateformes d'intelligence incarnée visant à industrialiser le pipeline simulation-réel : on pense à Isaac Sim de NVIDIA, à Genesis (plateforme de simulation physique open-source), ou encore aux travaux de Physical Intelligence (pi) autour de Pi-0 qui misent sur les VLA (vision-language-action models) pour généraliser sans retraining massif. Côté européen, des acteurs comme Enchanted Tools (Miroki) ou Wandercraft (Atalante) traitent des problèmes adjacents de transfert sim-réel mais sur des morphologies très différentes. L'équipe derrière BestMan ne précise pas de partenariats industriels ni de calendrier de mise à disposition publique de la plateforme : la prochaine étape logique serait une validation sur plusieurs familles de robots et une ouverture du code pour permettre des benchmarks communautaires comparables.

UEImpact indirect potentiel pour les acteurs européens comme Enchanted Tools ou Wandercraft si la plateforme est rendue publique, mais aucun déploiement ou partenariat européen documenté à ce stade.

RecherchePaper
1 source
Adaptation mutuelle dans le co-transport humain-robot avec incertitude sur les préférences humaines
2125arXiv cs.RO 

Adaptation mutuelle dans le co-transport humain-robot avec incertitude sur les préférences humaines

Une équipe de chercheurs a publié en mars 2025 sur arXiv (référence 2503.08895) un cadre unifié de co-transport humain-robot fondé sur l'adaptation mutuelle, visant à résoudre un problème central de la robotique collaborative physique : comment un robot peut-il s'adapter en temps réel à un partenaire humain dont les préférences de trajectoire sont incertaines, et réciproquement ? L'article propose trois contributions distinctes. Plutôt que de fixer a priori les paramètres comportementaux du partenaire, les auteurs modélisent une distribution de probabilité sur l'ensemble des préférences possibles. Ils introduisent ensuite une mesure d'obstination (stubbornness) variant dans le temps, qui détermine dynamiquement si le robot doit mener la trajectoire ou céder la direction à l'humain lorsque celui-ci manifeste une préférence forte et persistante au-delà d'un seuil défini. Enfin, une stratégie d'optimisation de posture s'applique au niveau du contrôle bas-niveau pour compenser les comportements imprévisibles quand l'humain prend les commandes. Le cadre a été validé auprès de vingt participants, complété par des simulations comparatives. Ce travail adresse un verrou technique majeur pour les robots collaboratifs physiques en logistique, industrie et assistance à la personne : l'écart entre les modèles humains supposés et la variabilité réelle des opérateurs. En introduisant une modélisation probabiliste plutôt que déterministe des préférences, le framework évite le blocage classique des systèmes à paramètres fixes qui échouent dès que l'humain dévie du comportement anticipé. Pour un intégrateur ou un COO industriel, le signal concret est que des robots de co-manutention pourraient s'adapter à différents opérateurs sans reprogrammation, réduisant les coûts de déploiement multi-site. La bascule dynamique entre modes "robot meneur" et "humain meneur" offre par ailleurs une flexibilité opérationnelle utile dans des contextes où l'ergonomie ou la sécurité prime sur l'optimisation de trajectoire. Le co-transport physique humain-robot reste peu industrialisé comparé aux AMR ou aux cobots de type Universal Robots et FANUC CRX. Les approches antérieures à impédance variable ou fondées sur des modèles de jeu de Stackelberg avaient posé des bases théoriques, mais butaient sur la rigidité des hypothèses comportementales. Ce papier s'inscrit dans une tendance plus large à intégrer l'incertitude humaine dans la boucle de contrôle, direction explorée notamment par le MIT CSAIL et, en France, par l'INRIA au travers de travaux sur la planification collaborative. Les prochaines étapes probables incluent des validations en environnement industriel réel et l'extension à des tâches multi-étapes, où la gestion de l'obstination sur des horizons temporels plus longs constituera un défi supplémentaire.

UEL'INRIA mène des travaux sur la planification collaborative dans la même direction, positionnant la recherche française pour contribuer à des solutions de co-manutention adaptatives qui pourraient bénéficier aux intégrateurs industriels européens à moyen terme.

RecherchePaper
1 source
ReSiReg : vers une sémantique spatialement cohérente pour les tâches robotiques guidées par le langage
2126arXiv cs.RO 

ReSiReg : vers une sémantique spatialement cohérente pour les tâches robotiques guidées par le langage

Des chercheurs ont déposé sur arXiv (2606.19088) ReSiReg, une méthode de reconstruction de features visant à corriger l'incohérence spatiale des embeddings denses produits par les Vision-Language Models (VLM) utilisés en robotique. Le constat de départ est documenté : les VLM de type ViT-B produisent des représentations sémantiques bruitées et spatialement incohérentes, ce qui compromet la localisation d'objets dans un espace 3D à partir d'instructions en langage naturel. ReSiReg regroupe les activations intermédiaires en prototypes visuels, dérive pour chacun des descripteurs linguistiques, puis reconstruit chaque patch comme un mélange pondéré de ces embeddings prototype. L'évaluation porte sur des benchmarks de segmentation sémantique ouverte (OVSS) et de cartographie 3D sur plusieurs backbones, complétée par des tests qualitatifs sur des scènes de manipulation réelle ; les auteurs proposent également un modèle compact à 25 millions de paramètres, contre 86M pour un ViT-B standard, avec des performances déclarées compétitives. Ce problème d'incohérence spatiale est un frein concret pour les intégrateurs : les pipelines VLA (Vision-Language-Action) doivent actuellement empiler des composants supplémentaires comme SAM, des filtres de profondeur et des post-traitements pour stabiliser les activations avant de les transmettre au contrôleur. Corriger le problème au niveau du feature lui-même simplifie cette chaîne, et le modèle 25M constitue un argument direct pour le déploiement embarqué sur hardware contraint. Nuance importante : les résultats qualitatifs illustrent des "activations plus cohérentes spatialement", mais sans métriques systématiques chiffrées permettant une comparaison directe avec l'existant. ReSiReg s'inscrit dans un effort plus large d'adaptation des VLM généralistes au contexte robotique, après des travaux comme LERF ou CLIP-Fields qui ancrent les embeddings linguistiques dans des représentations 3D. La méthode opère en amont, sur la représentation 2D dense, et se veut agnostique au backbone, à la différence de solutions comme OpenMask3D ou les approches Distilled Feature Fields. L'article est à l'état de preprint non révisé par les pairs ; le code est annoncé sur resireg.github.io. Les suites naturelles incluent une évaluation sur des benchmarks de manipulation de référence (RLBench, LIBERO) et une intégration dans des architectures VLA de bout en bout telles que Pi-0 ou OpenVLA.

IA physiqueOpinion
1 source
LAGO Policy : diffusion asynchrone sensible à la latence et planification sans collision pour une manipulation fluide
2127arXiv cs.RO 

LAGO Policy : diffusion asynchrone sensible à la latence et planification sans collision pour une manipulation fluide

Une équipe de chercheurs a publié sur arXiv (référence 2606.17982, juin 2026) un cadre algorithmique baptisé LAGO Policy, acronyme de Latency-Aware asynchronous Goal-directed Optimization, destiné à résoudre deux limitations structurelles des politiques visuomotrices à diffusion en manipulation robotique : les discontinuités entre blocs d'actions lors de l'inférence asynchrone, et l'absence de mécanisme natif d'évitement d'obstacles. Le système repose sur trois composantes intégrées : un guidage sans classifieur (classifier-free guidance, CFG) conditionné sur les actions futures pour assurer la cohérence entre segments d'exécution consécutifs ; une prédiction automatique de point d'interaction cible extraite des démonstrations pour orienter la planification ; et une optimisation spatio-temporelle des trajectoires garantissant des mouvements à faible à-coup (low-jerk) et physiquement réalisables. Les auteurs rapportent des expériences en conditions réelles sur des tâches de manipulation présentées comme complexes, avec un taux de succès élevé, bien que l'abstract ne détaille ni les objets testés ni les métriques quantitatives précises. Ce travail s'attaque à un problème concret qui freine le déploiement industriel des politiques à diffusion : ces modèles génèrent des actions de haute qualité, mais leur temps de calcul est incompatible avec une boucle de contrôle synchrone. Les approches asynchrones existantes contournent la latence en découplant inférence et exécution, mais introduisent précisément les à-coups et ruptures de trajectoire que LAGO cherche à corriger. L'intégration de la planification d'évitement d'obstacles directement dans le pipeline de la politique, sans module externe de type MPC ou RRT, représente un changement d'architecture notable pour les intégrateurs qui empilent aujourd'hui ces briques séparément. Les politiques à diffusion pour la manipulation ont été popularisées notamment par les travaux de Shuran Song (Columbia/Stanford) puis par Physical Intelligence avec Pi-0, architecture qui sert de référence dans le domaine. LAGO s'inscrit dans une tendance plus large où la frontière entre apprentissage par imitation et planification classique se réduit, visible aussi dans GR00T N2 de NVIDIA ou les variantes d'ACT développées dans plusieurs laboratoires académiques. Il s'agit pour l'instant d'un preprint sans déploiement commercial annoncé ni partenaire industriel identifié ; la page projet associée (lago-policy.github.io) laisse entendre que des vidéos et du code seront publiés, mais aucune timeline n'est précisée.

RechercheOpinion
1 source
OpenTie : système de ligature séquentielle d'armatures à vocabulaire ouvert
2128arXiv cs.RO 

OpenTie : système de ligature séquentielle d'armatures à vocabulaire ouvert

Des chercheurs ont publié OpenTie, un système robotique de ligaturage de ferraillage qui n'exige aucun entraînement préalable sur des données spécifiques au chantier. Présenté sur arXiv (référence 2509.00064v2), le système associe un bras robotique équipé d'une caméra binoculaire, une conversion RGB vers nuage de points 3D, et une détection d'objets à vocabulaire ouvert pilotée par prompts textuels. La chaîne de traitement intègre une étape de post-traitement des images avant la reconstruction 3D, afin d'améliorer la précision de la localisation des barres d'acier. Les tests en conditions réelles couvrent des configurations horizontales et verticales de ligaturage séquentiel, et les auteurs indiquent surpasser les méthodes basées sur YOLO sur ce protocole. Aucun chiffre de temps de cycle, de cadence ou de taux d'erreur n'est fourni dans l'abstract, ce qui limite la portée comparative de l'affirmation. L'absence totale de phase d'entraînement est le point structurellement important. La quasi-totalité des systèmes robotiques de construction exige des jeux de données labellisés volumineux et des cycles de fine-tuning coûteux, barrière à l'entrée rédhibitoire pour les intégrateurs BTP. En s'appuyant sur des modèles de détection à vocabulaire ouvert (zero-shot, pilotés par des prompts), OpenTie contourne cette contrainte et permet une flexibilité face aux variations de chantier sans re-entraînement. Cela s'inscrit dans la tendance plus large des VLA (vision-language-action models) capables de réduire le sim-to-real gap sans données propriétaires massives. Si les performances se confirment sur des benchmarks indépendants, l'approche pourrait modifier sérieusement le calcul coût/bénéfice pour l'automatisation du ferraillage. Le ligaturage de rebar reste l'une des tâches les plus répétitives et pénibles du BTP, et plusieurs acteurs y travaillent depuis quelques années : Shimizu Corporation et Tokyo Kikai au Japon, ainsi que des startups américaines comme Dusty Robotics ou Canvas, qui couvrent d'autres sous-tâches de chantier. OpenTie est aujourd'hui un prototype de recherche académique, pas un produit shipé : les auteurs évoquent une "possibilité de commercialisation" sans calendrier ni partenaire industriel annoncé. Aucun acteur français ou européen n'est impliqué dans cette publication, mais le sujet est directement pertinent pour les grands groupes BTP comme Vinci Construction ou Bouygues, qui investissent activement dans la robotisation de chantier.

UEPotentiellement pertinent pour les grands groupes BTP français (Vinci Construction, Bouygues) si l'approche est commercialisée, mais aucun acteur européen n'est impliqué dans cette publication et le système reste un prototype académique sans métriques vérifiables.

IndustrielPaper
1 source
Réorganisation personnalisée d'objets : assistance LLM guidée par l'incertitude avec capacité d'abstention
2129arXiv cs.RO 

Réorganisation personnalisée d'objets : assistance LLM guidée par l'incertitude avec capacité d'abstention

Des chercheurs publient APOLLO, un cadre hybride pour le rangement personnalisé d'objets ménagers par robot, soumis le 17 juin 2026 sur arXiv. Le système couple un modèle d'embedding personnalisé (PEM), léger, entièrement sur CPU, entraîné par paire utilisateur-environnement à partir d'une poignée de démonstrations, à un LLM activé sélectivement uniquement quand le PEM signale une incertitude élevée. APOLLO introduit l'abstention comme comportement de premier ordre : le robot peut décider de ne pas déplacer un objet faute d'information suffisante, une capacité absente de la plupart des approches actuelles. Pour évaluer ce comportement, les auteurs publient également APOR, un dataset synthétique généré par LLM couvrant des environnements multi-meubles, des profils organisationnels variés, des cas d'abstention explicites et des scènes partiellement bruitées. Sur les benchmarks PARSEC et APOR, APOLLO améliore les performances par rapport aux baselines LLM pures tout en réduisant substantiellement le nombre d'appels au modèle. Le code est disponible sur GitHub (PaInt-Lab/APOLLO). Les résultats restent à ce stade préliminaires, les auteurs eux-mêmes parlant de "preuves initiales" en environnement simulé, sans validation sur hardware réel. Ce résultat pointe un angle mort systématique : les méthodes existantes supposent des observations propres et une actionabilité complète, deux hypothèses rarement vérifiées dans un vrai foyer encombré. L'architecture hybride répond aussi à des contraintes de déploiement concret : le PEM sur CPU préserve la vie privée et réduit la latence, le LLM étant réservé aux décisions vraiment ambiguës. C'est une direction pragmatique pour des assistants domestiques embarqués sur du matériel non-spécialisé, où le recours systématique au cloud n'est ni acceptable ni viable à l'échelle. APOLLO s'inscrit dans un effort plus large pour rendre les politiques VLA (Vision-Language-Action) robustes à l'incertitude et aux données partielles, un problème central du déploiement hors environnements contrôlés. Les travaux concurrents de Physical Intelligence (π0), des équipes RT-2 ou OpenVLA s'attaquent à la généralisation en scènes non structurées, mais l'abstention explicite reste rare dans la littérature. Aucun acteur français ou européen n'est directement impliqué dans cette publication. Les prochaines étapes naturelles incluent une validation sur hardware réel et une évaluation avec de vrais utilisateurs sur la pertinence des décisions de non-action.

RecherchePaper
1 source
Augmentation de l'environnement orientée tâche pour une navigation fiable via diffusion conditionnelle protégée
2130arXiv cs.RO 

Augmentation de l'environnement orientée tâche pour une navigation fiable via diffusion conditionnelle protégée

Une équipe de chercheurs présente SCoDA (Shielded Conditional Diffusion for Environment Augmentation), publiée sur arXiv (2606.15154) en juin 2026, qui inverse la logique classique de la navigation robotique sous observabilité partielle. Plutôt que d'améliorer le robot via de meilleurs capteurs ou la planification dans l'espace des croyances, SCoDA optimise le placement de marqueurs fiduciels visuels dans l'environnement pour que le robot puisse exécuter une trajectoire planifiée de manière fiable. Le système prend en entrée une carte de l'environnement, une trajectoire de tâche et un budget limité de marqueurs, puis détermine où les poser pour éviter l'accumulation d'erreur de localisation aux points critiques de la trajectoire. Sur des benchmarks simulés et des déploiements matériels réels, SCoDA améliore la fiabilité d'exécution et le temps de complétion par rapport aux baselines comparées, sans que les marges exactes soient détaillées dans le préprint. L'intérêt industriel est concret : dans un entrepôt ou une usine où les systèmes AMR (autonomous mobile robots) peinent dans des zones pauvres en repères visuels, quelques marqueurs bien placés peuvent valoir plus qu'un upgrade capteur. SCoDA modélise ce problème via un modèle de diffusion conditionnel, entraîné à apprendre la distribution des configurations de marqueurs performantes en fonction de la trajectoire, des perturbations attendues et du profil d'exécution souhaité. Son "shielded sampler" identifie les points de la trajectoire où une correction de pose est indispensable pour ne pas compromettre le contrôle, et oriente la génération vers des agencements respectant le budget de marqueurs. Cela évite la propagation coûteuse d'incertitude typique du belief-space planning, souvent fragile dans les zones mal couvertes par les capteurs embarqués. SCoDA s'inscrit dans une tendance qui applique les modèles de diffusion à la planification et à la configuration robotique, aux côtés des Visual Language Action models (VLA) et des techniques de localisation active. Sa particularité est de cibler le côté infrastructure plutôt que l'embarqué, une direction peu explorée face aux acteurs dominants centrés sur le SLAM, la fusion capteurs ou l'active localization onboard. Le code, les modèles et le dataset sont disponibles sur scoda-diffusion.github.io. Aucune timeline de déploiement industriel n'est annoncée, et le travail reste à ce stade un préprint non soumis à peer review.

UELes flottes AMR déployées dans les entrepôts et usines européens pourraient bénéficier indirectement de cette approche, qui améliore la fiabilité de navigation sans mise à niveau capteur coûteuse, mais aucun partenaire ou déploiement européen n'est mentionné.

RecherchePaper
1 source
Repenser la représentation spatiale implicite dans l'apprentissage des politiques visuomotrices
2131arXiv cs.RO 

Repenser la représentation spatiale implicite dans l'apprentissage des politiques visuomotrices

Une équipe de chercheurs a publié en juin 2026 un préprint arXiv (2606.15232) proposant PRISM, un encodeur visuel destiné aux politiques visuomotrices pour la manipulation robotique. Le travail repart d'une brique très répandue dans ce domaine : le pooling spatial softmax, qui transforme les cartes de caractéristiques d'un réseau de neurones en un ensemble compact de coordonnées 2D représentant les points saillants d'une scène. Les auteurs montrent, par une série d'expériences comparatives, que cette représentation implicite produit des features plus stables et plus compactes que les représentations feature-value classiques, même avec un espace dimensionnel nettement réduit. Cependant, ils identifient un goulot d'étranglement : les opérations successives de sous-échantillonnage dans les encodeurs visuels courants dégradent l'information spatiale fine avant qu'elle ne parvienne au module générateur d'actions, problème particulièrement aigu en basse résolution. PRISM répond à ce déficit en fusionnant des représentations multiscalaires via une attention croisée top-down. Sur la tâche ToolHang, référence de précision en basse résolution, le taux de succès moyen passe de 5,0 % à 13,4 %, pour seulement 15,4 % de paramètres supplémentaires. Ce résultat a une portée directe pour les intégrateurs qui déploient des politiques d'imitation générative (Diffusion Policy, ACT, et dérivés) sur des robots industriels équipés de caméras embarquées à résolution modeste. Il confirme que le "sim-to-real gap" n'est pas uniquement lié aux données ou aux architectures d'action, mais aussi à la qualité des représentations visuelles intermédiaires. La démonstration que des gains substantiels sont atteignables sans revoir l'architecture d'action ni exploser le coût computationnel est un signal utile pour les équipes qui cherchent à améliorer la robustesse de leurs pipelines sans refonte complète. Ce travail s'inscrit dans la vague actuelle d'apprentissage par imitation basé sur des modèles génératifs, popularisée par Chi et al. (Diffusion Policy, 2023) et les travaux de Physical Intelligence (pi0) ou de Google DeepMind. Il n'implique pas d'acteur français ou européen identifiable. Le papier est un préprint, non encore évalué par les pairs, et les benchmarks restent limités à des tâches de table-top manipulation simulées et réelles ; une validation sur plateformes humanoïdes ou en environnement industriel reste à venir. Les prochaines étapes naturelles seraient une intégration dans des pipelines VLA (Vision-Language-Action) à grande échelle, où la précision spatiale est également un point de friction documenté.

IA physiquePaper
1 source
Imiter ce qui fonctionne : apprentissage de politiques modulaires filtré par simulation depuis des vidéos humaines
2132arXiv cs.RO 

Imiter ce qui fonctionne : apprentissage de politiques modulaires filtré par simulation depuis des vidéos humaines

Des chercheurs publient sur arXiv (2602.13197v2) un cadre d'apprentissage baptisé PSI (Perceive-Simulate-Imitate), conçu pour entraîner un robot à des tâches de manipulation à partir de vidéos humaines, sans aucune donnée robot. La cible est la manipulation préhensile, c'est-à-dire les tâches combinant une phase de saisie d'objet et des mouvements post-saisie (vissage, transfert, assemblage). PSI adopte une architecture modulaire : un générateur de saisies dédiées produit des prises stables, tandis que la composante imitation extrait les trajectoires post-saisie directement depuis les vidéos. Entre les deux s'intercale une étape de filtrage en simulation, qui attribue à chaque saisie candidate un label de compatibilité avec la tâche aval, permettant d'entraîner via apprentissage supervisé un module de saisie orienté vers l'objectif final. Les expériences en conditions réelles confirment des performances significativement plus robustes que l'usage naïf d'un générateur de saisies standard, sans que des métriques chiffrées précises (taux de succès, nombre d'objets testés) ne soient détaillées dans l'abstract. L'enjeu est structurant pour l'industrie : les vidéos humaines représentent un gisement de données quasi-illimité comparé aux démonstrations téléopérées, coûteuses à collecter à grande échelle. Le problème identifié par les auteurs est que les saisies arbitrairement stables ne sont pas forcément compatibles avec la tâche en aval, un robot peut tenir correctement un outil tout en l'orientant de façon à rendre impossible l'opération suivante. PSI tranche ce nœud en injectant du jugement simulé avant l'imitation, ce qui le distingue des pipelines naïfs de transfert vidéo-vers-robot. Pour un intégrateur ou une équipe R&D souhaitant élargir le catalogue de tâches d'un robot sans multiplier les sessions de téléopération, la proposition est directement lisible. Ce travail s'inscrit dans le courant de l'imitation depuis des vidéos in-the-wild (dans la lignée de Vid2Robot, DIME ou des travaux récents sur les Visual Language Actions), qui cherche à contourner le goulot d'étranglement de la collecte de données robotiques. La spécificité de PSI tient à son découplage explicite entre qualité de saisie et qualité de trajectoire, médiatisé par la simulation. Côté concurrent, des approches comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent davantage sur des architectures unifiées entraînées sur des corpus massifs mixtes. Aucun partenaire industriel ni déploiement n'est annoncé : il s'agit d'un résultat académique dont la généralisation à un large éventail d'objets et de morphologies de mains reste à démontrer.

IA physiquePaper
1 source
DIFF-IPPO : planification de trajectoires informatives par diffusion avec cartes de croyance en vocabulaire ouvert
2133arXiv cs.RO 

DIFF-IPPO : planification de trajectoires informatives par diffusion avec cartes de croyance en vocabulaire ouvert

Des chercheurs ont publié sur arXiv (référence 2606.16780) DIFF-IPPO, une pipeline combinant un générateur de cartes de croyance à vocabulaire ouvert avec un planificateur basé sur la diffusion, pour orchestrer des trajectoires globales de drones en exploration autonome. Le système produit des trajectoires qui concentrent la couverture sensorielle sur les zones à haute probabilité d'intérêt, atteignant des scores de détection normalisés entre 81,49 % et 86,55 % selon les scénarios de dataset testés. La validation s'appuie sur un scénario simulé de recherche et sauvetage : une flotte de cinq drones, en mode de génération de trajectoires conditionnée par les cartes de croyance en batch, localise un bâtiment en feu parmi plusieurs candidats en 3,5 minutes en moyenne. L'apport principal de DIFF-IPPO est d'appliquer les modèles de diffusion à la planification de trajectoires informatives (IPP) conditionnée sur des distributions non-gaussiennes et multimodales. La planification IPP classique repose typiquement sur des processus gaussiens, inadaptés aux cartes de croyance complexes produites par la perception sémantique à vocabulaire ouvert, du type de celles issues de modèles vision-langage comme CLIP. En permettant un conditionnement direct sur ces représentations riches, l'approche ouvre des perspectives pour les missions d'inspection industrielle, la surveillance environnementale continue, ou la recherche et sauvetage, en réduisant le temps de détection sans exiger une couverture exhaustive de la zone. Pour un intégrateur de systèmes multi-drones, c'est un signal intéressant : la génération de trajectoires globales en batch, plutôt que la planification myope, devient praticable avec des perceptions à vocabulaire libre. L'IPP est un axe de recherche actif où robots et drones doivent planifier des trajectoires maximisant le gain d'information ou la probabilité de détection. Les méthodes traditionnelles peinent face aux distributions multimodales ; les planificateurs par diffusion, déjà adoptés en robotique mobile et manipulation (DiffusionPolicy, Diffuser), n'avaient pas encore été appliqués à l'IPP global sur cartes sémantiques. DIFF-IPPO comble ce manque, mais la validation reste entièrement en simulation, un gap sim-to-real non encore résolu. Les scénarios multi-agents à cinq drones demandent à être confirmés sur plateforme physique, et la robustesse face à des cartes de croyance bruitées ou incomplètes reste une question ouverte pour les prochaines étapes expérimentales.

RecherchePaper
1 source
CrossMaps : cartographie sémantique à vocabulaire ouvert avec estimation de confiance pour la navigation de rovers
2134arXiv cs.RO 

CrossMaps : cartographie sémantique à vocabulaire ouvert avec estimation de confiance pour la navigation de rovers

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (identifiant 2606.16935) les travaux relatifs à CrossMaps, un pipeline de cartographie sémantique en temps réel conçu pour la navigation de rovers autonomes. Le système exploite des données RGB-D pour construire des cartes interrogeables en langage naturel, en s'appuyant sur des embeddings CLIP multi-échelles fusionnés avec un mécanisme de pondération par confiance. L'architecture repose sur une mémoire duale : une mémoire court terme (STM) qui agrège les observations visuelles bruitées en combinant des métriques de confiance géométrique, sémantique et temporelle, et une mémoire long terme (LTM) dans laquelle sont promus les points d'intérêt stables et cohérents, constituant ainsi des repères sémantiques persistants. Le système est dimensionné pour fonctionner sur un UGV équipé d'un module Jetson Orin de NVIDIA, couplé à un pipeline SLAM, et génère des cartes de chaleur sémantiques interrogeables par requêtes en langage naturel. L'intérêt de CrossMaps réside dans sa gestion explicite de la qualité perceptive, fiabilité du capteur de profondeur, artefacts d'éclairage, densité des données, directement intégrée dans la représentation spatiale, un aspect souvent traité de façon ad hoc dans les systèmes concurrents. En distinguant observations transitoires et connaissances consolidées via la dualité STM/LTM, l'architecture vise à réduire le gap sim-to-real classique des systèmes de navigation sémantique déployés en conditions dégradées. Pour un intégrateur ou un responsable de flotte robotique, cela signifie potentiellement une navigation plus robuste dans des environnements industriels non-structurés sans nécessiter un réentraînement des modèles pour chaque nouveau vocabulaire d'objets. CrossMaps s'inscrit dans la lignée directe des VLMaps (travaux de Huang et al., 2023), qui ont popularisé la fusion de caractéristiques CLIP dans des cartes spatiales 3D pour la navigation en langage naturel. La différence revendiquée ici est la couche de gestion de la confiance et la séparation mémoire court/long terme, absentes dans VLMaps. L'article reste un preprint non encore évalué par les pairs, et les performances réelles sur un UGV physique en dehors de conditions contrôlées ne sont pas détaillées dans l'abstract, un point à vérifier dans le corps du papier avant toute extrapolation industrielle. Les suites naturelles incluent une comparaison quantitative face à ConceptFusion ou LERF, et un déploiement en environnements extérieurs non-structurés.

RecherchePaper
1 source
Quand un robot doit-il replaner ? Planification mise à jour guidée par le regret dans les MDP à variation temporelle
2135arXiv cs.RO 

Quand un robot doit-il replaner ? Planification mise à jour guidée par le regret dans les MDP à variation temporelle

Des chercheurs publient sur arXiv (réf. 2606.16972, juin 2026) un cadre formel pour décider quand, et non comment, un robot doit recalculer sa politique de navigation dans un environnement à dynamiques changeantes. La contrainte centrale est le budget embarqué : énergie et calcul sont finis, chaque cycle de ré-estimation d'état suivi d'une replanification coûte des ressources. Les auteurs modélisent le problème comme un processus de décision markovien à dynamiques variables (TVMDP) avec une borne connue sur le taux de dérive des transitions, puis proposent un schéma dit "skip-update" : à des instants choisis, le robot estime le noyau de transition par maximum de vraisemblance et recalcule une politique finie ; entre ces mises à jour, il propage son estimation d'état et réutilise la politique courante. La règle de déclenchement est guidée par le regret dynamique accumulé, quantifiant l'écart entre politique actuelle et politique optimale. Validé sur un rover simulé sur Mars (dynamiques de glissement variables) et un quadrotor Crazyflie en environnement intérieur (champs d'obstacles), l'allocation adaptative surpasse les stratégies à intervalle fixe dans les deux cas. La contribution principale n'est pas algorithmique mais posturale : la littérature en planification robotique s'attarde principalement sur la façon de replanner efficacement, rarement sur le moment où ce coût computationnel se justifie. Disposer d'une règle traçable et fondée théoriquement pour déclencher les mises à jour a des implications directes pour les robots déployés en conditions réelles : AMR industriels sur sol contaminé ou à trafic variable, drones d'inspection en vol prolongé, sondes spatiales où les cycles CPU et la batterie constituent des ressources critiques non renouvelables. L'approche permet de délester le calculateur embarqué sans sacrifier les performances de navigation dans des environnements non-stationnaires, ce qui répond à un compromis jusqu'ici géré de façon heuristique dans la majorité des implémentations terrain. Le sim-to-real et la robustesse aux dynamiques changeantes figurent parmi les défis ouverts de la robotique de terrain depuis plusieurs années, en lien direct avec les travaux sur le contrôle adaptatif et le MPC (model predictive control). L'utilisation du Crazyflie, plateforme quadrotor open-source standard dans la recherche académique (ETH Zurich, CMU), et d'une simulation Mars-rover constitue des benchmarks reconnus, sans déploiement industriel annoncé ni partenaire commercial mentionné. Les auteurs ne fournissent ni timeline produit ni métriques de performance absolues sur du matériel embarqué réel, ce qui limite la portée immédiate des résultats. Les suites logiques incluent l'extension multi-robots et la validation sur calculateurs embarqués contraints, terrains où des acteurs comme l'ESA ou des équipes françaises spécialisées telles que le LAAS-CNRS (Toulouse) pourraient trouver des applications directes dans leurs programmes de robotique spatiale et de terrain.

UELe LAAS-CNRS (Toulouse) et l'ESA sont identifiés comme bénéficiaires potentiels naturels pour leurs programmes de robotique spatiale et de terrain autonome, sans implication directe à ce stade.

RecherchePaper
1 source
BIM-Loc : localisation intérieure par LiDAR intégrée au BIM et sensible aux écarts
2136arXiv cs.RO 

BIM-Loc : localisation intérieure par LiDAR intégrée au BIM et sensible aux écarts

Une équipe de chercheurs publie BIM-Loc sur arXiv (identifiant 2606.14237), une méthode de localisation LiDAR pour robots de service et d'inspection en intérieur qui exploite directement les maquettes numériques BIM (Building Information Model) issues de la phase de conception des bâtiments, sans nécessiter la création préalable d'une carte dédiée. Le système estime en temps réel la trajectoire du robot dans le repère de coordonnées BIM et détecte simultanément les écarts entre l'environnement réel et la maquette as-designed. Trois contributions techniques structurent l'approche : un algorithme de lancer de rayons multi-impact pour associer les points LiDAR aux surfaces BIM et projeter les observations 3D dans un espace de texture 2D ; un cadre d'optimisation par graphe de poses intégrant des facteurs BIM pour garantir la cohérence entre l'odométrie, les scans successifs et la géométrie du bâtiment ; et un module d'inférence bayésienne hiérarchique qui met à jour de façon incrémentale une représentation surfacique 2D continue, en propageant les détections du pixel jusqu'au niveau structurel. L'enjeu central est la localisation dans les environnements intérieurs peu distinctifs, couloirs d'hôpitaux, open spaces, entrepôts, où les systèmes SLAM classiques échouent faute de repères géométriques saillants. BIM-Loc contourne ce problème en utilisant une source de données déjà présente dans la majorité des bâtiments modernes : le fichier BIM produit lors de la conception. Pour les intégrateurs de robots de service, cela supprime l'étape coûteuse de cartographie préalable et permet un déploiement rapide. La capacité de détection des écarts apporte également une valeur concrète pour les missions d'inspection de conformité, en signalant automatiquement les modifications non documentées d'un bâtiment. Selon les auteurs, BIM-Loc surpasse significativement les méthodes map-based de l'état de l'art en précision et en robustesse, bien que les métriques précises (RMSE, ATE) ne soient pas détaillées dans l'abstract. La localisation en intérieur reste un problème ouvert depuis les premières générations de robots mobiles. Les approches dominantes, SLAM 2D/3D, localisation Monte Carlo, NDT matching, reposent sur des cartes issues de relevés terrain, ce qui pose des problèmes de maintenance dans les environnements changeants. L'utilisation des BIM comme prior a été explorée dans des travaux antérieurs en réalité augmentée pour le BTP, mais leur intégration dans un pipeline de localisation temps réel avec détection de discordances constitue une contribution distincte. Dans l'espace concurrent, des systèmes comme Cartographer (Google) ou les solutions propriétaires de MiR opèrent principalement avec des grilles d'occupation 2D. Aucun partenariat industriel ni calendrier de transfert technologique n'est mentionné dans ce preprint ; la prochaine étape naturelle serait une validation dans des environnements à forte densité de personnes en mouvement.

UEL'adoption du BIM étant réglementairement encouragée dans les marchés publics européens, la méthode pourrait faciliter le déploiement de robots de service dans des bâtiments déjà dotés de maquettes numériques, mais aucune entreprise ou institution française ou européenne n'est impliquée dans ces travaux.

RecherchePaper
1 source
SyLink Hand : main anthropomorphe à mécanisme de bielles inspiré des synergies pour une dextérité humaine
2137arXiv cs.RO 

SyLink Hand : main anthropomorphe à mécanisme de bielles inspiré des synergies pour une dextérité humaine

Une équipe de chercheurs a publié en juin 2026 sur arXiv (preprint 2606.14250) les spécifications techniques de la SyLink Hand, une main robotique anthropomorphe de 520 grammes conçue pour reproduire la cinématique de la main humaine avec un budget de fabrication d'environ 400 dollars. La conception repose sur deux principes combinés : les synergies biomécaniques de la main humaine, identifiées grâce à des gants de capture de mouvement qui révèlent de fortes corrélations entre articulations voisines, et des mécanismes de liaisons rigides (linkages) qui coordonnent plusieurs joints à partir d'un seul actionneur. Résultat : 19 articulations pilotées par seulement 11 actionneurs. L'équipe introduit également une liaison à quatre barres sphérique originale permettant de découpler indépendamment la flexion/extension et l'abduction/adduction à l'articulation métacarpophalangienne (MCP), dans un encombrement compact. Ce rapport de 11 actionneurs pour 19 degrés de liberté est le point saillant de ce travail. Dans la plupart des mains dextres existantes, la multiplication des actionneurs fait exploser masse, coût et complexité de contrôle. En s'appuyant sur les synergies naturelles de la main (le fait que les doigts bougent rarement de façon totalement indépendante), les auteurs réduisent le problème sans sacrifier l'anthropomorphisme cinématique. Un coût de fabrication de 400 dollars positionne la SyLink Hand très en dessous des références académiques comme la Shadow Hand (plusieurs dizaines de milliers d'euros) ou l'Allegro Hand (Wonik Robotics, environ 4 000 dollars). Cela ouvre un couloir d'accessibilité pour la robotique de service, les plateformes de recherche ou l'intégration dans des humanoïdes à budget contraint. Reste à noter que les évaluations présentées sont expérimentales et issues d'un prototype de laboratoire : aucun déploiement industriel ni partenariat industriel n'est annoncé. Cette publication s'inscrit dans une compétition académique et industrielle dense autour des mains robotiques dextres. Shadow Robot (UK) domine le segment haute performance avec la Dexterous Hand, tandis que des projets open-source comme LEAP Hand (Carnegie Mellon, 2023) ou la main de Dexterous Robotics ciblent également le compromis coût/performance. Côté humanoïdes, Figure (Figure 03), Tesla (Optimus Gen 3) et Agility Robotics développent leurs propres solutions de préhension intégrées. En Europe, des acteurs comme Enchanted Tools (France) conçoivent des mains orientées interaction sociale. La SyLink Hand, en tant que preprint sans partenaire industriel déclaré, reste pour l'instant une contribution académique prometteuse. Les suites dépendront de sa capacité à passer des tests de lab aux conditions réelles d'utilisation, notamment en durabilité des liaisons mécaniques sous cycles répétés.

RecherchePaper
1 source
Segmentation de pièces fondée sur l'occupation pour les graphes de scène 3D hiérarchiques
2138arXiv cs.RO 

Segmentation de pièces fondée sur l'occupation pour les graphes de scène 3D hiérarchiques

Une équipe de recherche a publié sur arXiv (réf. 2606.13727, juin 2026) un pipeline baptisé OccuSG, conçu pour construire des graphes de scènes 3D hiérarchiques (3DSG) pour robots d'intérieur en ancrant la couche « pièce » à des régions de libre espace extraites d'une décomposition d'occupancy. Contrairement aux approches existantes qui s'appuient sur des clusters de lieux, des plans de murs ou des sorties de segmentation directe (sans critère géométrique commun permettant de comparer leurs résultats), OccuSG attribue à chaque nœud-pièce un contour polygonal explicite. Le pipeline a été évalué sur 12 scènes du jeu de données Matterport3D, en faisant correspondre les polygones prédits aux instances de pièces annotées, et comparé à Hydra, méthode de référence fondée sur la connectivité par lieux. Les graphes de scènes 3D hiérarchiques constituent une couche d'abstraction critique pour les robots naviguant en environnement résidentiel ou tertiaire : ils relient la perception au niveau objet (détection, segmentation) au raisonnement à l'échelle d'une pièce (navigation sémantique, planification de tâches). OccuSG affiche un rappel nettement supérieur à Hydra (davantage d'instances de pièces correctement retrouvées), mais au prix d'une précision plus faible, se traduisant en pratique par des pièces fantômes ou mal délimitées. Pour un intégrateur robotique ou un développeur AMR, le compromis est net : meilleure couverture sémantique, fidélité géométrique moindre. Les deux méthodes échouent par ailleurs à restituer des frontières de pièces précises au niveau des murs, un problème ouvert que les auteurs reconnaissent explicitement. La recherche sur les 3DSG pour robots d'intérieur est dominée depuis plusieurs années par Kimera et Hydra, développés au MIT dans le groupe de Luca Carlone, références académiques incontournables du domaine. OccuSG adopte une voie différente en privilégiant la géométrie d'occupancy plutôt que la topologie de connectivité pour représenter la pièce. Il s'agit d'un preprint arXiv et non d'un produit déployé : les expériences sont limitées à Matterport3D, un corpus de scans intérieurs statiques qui ne reflète pas les conditions dynamiques d'un robot réel. Le code est publié sur GitHub (crcz25/OccuSG), facilitant la reproduction indépendante. Les prolongements naturels incluent des évaluations sur flux temps réel et l'intégration dans des pipelines robotiques complets comme Hydra ou Kimera.

RecherchePaper
1 source
Y-BotFrame : un cadre extensible d'agents incarnés pour robots quadrupèdes assistants
2139arXiv cs.RO 

Y-BotFrame : un cadre extensible d'agents incarnés pour robots quadrupèdes assistants

Des chercheurs du groupe XDEI ont publié en juin 2026, via arXiv (2606.13049), les spécifications de Y-BotFrame, un framework open-source conçu pour transformer un robot quadrupède générique en assistant mobile autonome piloté par le langage naturel. L'architecture intègre trois modalités de perception en parallèle, microphone (commandes vocales), caméra RGB-D (vision) et LiDAR (cartographie 3D), et repose sur un grand modèle de langage (LLM) comme noyau cognitif central. Ce LLM prend en charge la compréhension de l'environnement, le raisonnement contextuel et la planification de tâches, puis convertit les instructions en langage naturel en unités d'action exécutables par le robot. Le système supprime le besoin d'une télécommande physique, remplacée par une interface voix et un retour visuel temps réel. Il s'agit pour l'instant d'une annonce académique accompagnée d'une vidéo de démonstration, pas d'un produit commercialisé. L'intérêt industriel de Y-BotFrame réside dans son architecture modulaire dite "plug-and-play" : chaque sous-système (navigation, perception, interaction) peut être remplacé ou mis à niveau indépendamment, ce qui abaisse le coût d'intégration pour des déploiements sectoriels spécifiques (inspection, logistique d'entrepôt, assistance en environnement structuré). La chaîne voix-vers-action sans contrôleur dédié réduit la barrière de qualification opérateur, un argument concret pour les déployeurs B2B. Reste que les métriques de performance concrètes, latence de la boucle LLM, robustesse en conditions dégradées, autonomie, sont absentes du résumé publié, ce qui est typique des papiers arXiv en phase préliminaire. Les robots quadrupèdes à LLM embarqué forment un segment en effervescence : Unitree (Go2, H1) et Boston Dynamics (Spot) dominent le hardware, tandis que des frameworks comme LeRobot (HuggingFace), Open-X Embodiment ou π₀ (Physical Intelligence) se disputent la couche logicielle d'apprentissage généraliste. Y-BotFrame se positionne non pas comme un modèle VLA entraîné, mais comme une couche d'orchestration système, plus proche de ROS 2 avec un LLM que d'un modèle de politique end-to-end. La prochaine étape logique pour l'équipe XDEI sera de publier des benchmarks sur un hardware cible identifié et des résultats de déploiement réel hors laboratoire.

RecherchePaper
1 source
Génération de designs de robots diversifiés et fonctionnels par paramétrisation superquadrique et diversité-qualité
2140arXiv cs.RO 

Génération de designs de robots diversifiés et fonctionnels par paramétrisation superquadrique et diversité-qualité

Une équipe de recherche propose, dans un preprint déposé sur arXiv (arXiv:2606.11037), une méthode de conception générative de robots combinant une représentation par superquadrics (SQs) avec l'algorithme de quality-diversity MAP-Elites. Les superquadrics sont des formulations mathématiques compactes et interprétables de formes géométriques 3D, paramétrables pour s'adapter à différents espaces de design. Les chercheurs les comparent aux CPPN (Compositional Pattern Producing Networks) comme générateurs de morphologies, en les couplant à des algorithmes évolutionnaires (EAs) classiques et à MAP-Elites. Sur deux environnements de test distincts, la combinaison SQs avec MAP-Elites atteint le score QD (quality-diversity) le plus élevé dans les deux cas, maximisant simultanément la diversité des formes générées et la performance fonctionnelle des robots obtenus. Le résultat adresse un verrou récurrent en co-évolution morphologie/contrôle : la convergence prématurée des EAs vers un petit ensemble de designs sous-optimaux. Dans un contexte où la robotique physique diversifiée gagne du terrain, notamment pour des tâches industrielles hétérogènes, la capacité à explorer automatiquement de larges espaces de configurations morphologiques sans intervention humaine est un enjeu concret pour les équipes R&D. La compacité des SQs réduit la dimensionnalité du problème d'optimisation, tandis que MAP-Elites maintient une archive explicite de solutions qualitativement différentes, évitant l'effondrement de la diversité populationnelle. Les résultats suggèrent qu'une représentation géométrique interprétable est plus efficace qu'une représentation neuronale implicite (CPPN) quand on cherche à explorer un espace de design morphologique complexe. MAP-Elites est une méthode QD développée initialement par Mouret et Clune (2015), largement utilisée en évolution de morphologies et en robotique adaptative. Les CPPN, introduits par Stanley et collaborateurs dans les années 2000, restent une référence concurrente pour l'encodage indirect de morphologies. Ce travail s'inscrit dans une tradition académique active autour du design automatisé de robots, qui inclut des équipes comme le lab Cheney/Clune (Vermont/Wyoming) ou le groupe Mouret à l'INRIA Paris. Il s'agit à ce stade d'un preprint sans validation par les pairs, avec des évaluations limitées à deux environnements simulés, sans validation hardware ni transfert sim-to-real rapporté. La prochaine étape naturelle serait une validation sur robot physique.

UELa méthode s'appuie sur MAP-Elites, algorithme développé par Mouret au sein de l'INRIA Paris, confirmant l'expertise française en évolution de morphologies robotiques, sans transfert industriel immédiat.

RecherchePaper
1 source
QDepth-VLA : prédiction de profondeur quantifiée comme supervision auxiliaire pour les modèles vision-langage-action (VLA)
2141arXiv cs.RO 

QDepth-VLA : prédiction de profondeur quantifiée comme supervision auxiliaire pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (identifiant 2510.14836, troisième révision) QDepth-VLA, un cadre d'apprentissage qui augmente les modèles Vision-Language-Action (VLA) avec une tâche auxiliaire de prédiction de profondeur. Le principe : un module spécialisé, baptisé "depth expert", apprend à prédire des tokens latents quantifiés de cartes de profondeur, générés par un encodeur VQ-VAE (Vector Quantized Variational Autoencoder). Ces tokens sont intégrés au pipeline VLA comme supervision auxiliaire durant l'entraînement, sans modifier l'architecture de base du modèle. L'approche est validée sur des benchmarks de simulation et sur des tâches réelles de manipulation robotique, avec des résultats décrits par les auteurs comme "compétitifs", formulation prudente qui suggère des gains réels mais pas nécessairement un état de l'art incontestable. L'enjeu fondamental que traite QDepth-VLA est le déficit de perception 3D des VLA actuels. Des modèles comme OpenVLA, Pi-0 ou les variantes de RT-2 traitent les images comme des entrées 2D et peinent à raisonner sur la géométrie de la scène (distance d'un objet, orientation, profondeur d'emprise), ce qui limite leur précision sur des tâches de manipulation fine : assemblage, insertion de connecteurs, saisie d'objets transparents ou réfléchissants. En forçant le modèle à reconstruire une structure de profondeur quantifiée, QDepth-VLA injecte des indices géométriques explicites dans les représentations apprises, sans nécessiter de capteur de profondeur supplémentaire à l'inférence. C'est un argument concret pour les intégrateurs déployant des robots sur des cellules équipées uniquement de caméras RGB standard. QDepth-VLA s'inscrit dans une tendance plus large d'augmentation des VLA par des tâches auxiliaires : prédiction de flux optique chez Physical Intelligence avec Pi-0, estimation de pose 3D dans les travaux Google DeepMind, ou représentations implicites de scène. Les concurrents directs incluent SpatialVLA et plusieurs variantes de RoboVLMs intégrant des indices 3D explicites. Un point de vigilance : les auteurs ne précisent ni le robot utilisé pour les expériences réelles, ni les conditions expérimentales détaillées, ce qui rend difficile la comparaison directe avec d'autres approches. La prochaine étape pour positionner objectivement QDepth-VLA dans le paysage sera une évaluation sur des benchmarks standardisés comme LIBERO ou Open X-Embodiment, qui font aujourd'hui référence dans la communauté VLA.

IA physiqueOpinion
1 source
VGP-Nav : perception géométrique visuelle adaptée aux métriques pour la navigation robotique
2142arXiv cs.RO 

VGP-Nav : perception géométrique visuelle adaptée aux métriques pour la navigation robotique

Une équipe de chercheurs a présenté en juin 2026 VGP-Nav (arXiv:2606.09268), un cadre unifié permettant à un robot mobile de se localiser avec précision et de détecter des obstacles avec cohérence métrique en n'utilisant qu'une seule caméra RGB monoculaire standard. Contrairement aux systèmes de navigation conventionnels qui combinent caméras et capteurs actifs comme le LiDAR pour obtenir des mesures métriques fiables, VGP-Nav s'appuie exclusivement sur la vision monoculaire. L'architecture ancre la géométrie visuelle à des contraintes d'échelle physiquement significatives extraites de la géométrie du plan sol, ce qui permet de résoudre en ligne l'ambiguïté d'échelle inhérente à tout système monoculaire. Les expériences présentées couvrent des environnements variés et incluent un déploiement validé sur des robots mobiles réels. L'ambiguïté d'échelle est l'un des obstacles fondamentaux à la navigation monoculaire : une caméra seule ne peut pas distinguer un objet proche et petit d'un objet lointain et grand sans référence externe. Les approches classiques contournent ce problème avec du LiDAR (coûteux, encombrant, nécessitant une calibration spatio-temporelle complexe entre capteurs) ou des centrales inertielles, ce qui augmente le coût et la complexité des déploiements, notamment pour les flottes d'AMR en logistique ou en industrie. Si VGP-Nav tient ses promesses à l'échelle, il ouvre la voie à des robots mobiles autonomes basse consommation capables de naviguer en sécurité dans des environnements non structurés sans infrastructure sensorielle lourde, un enjeu critique pour les intégrateurs cherchant à réduire le coût total de possession. La navigation purement visuelle fait l'objet d'intenses recherches depuis la première génération de systèmes SLAM monoculaires comme ORB-SLAM (2015), mais la cohérence métrique restait leur talon d'Achille face au LiDAR. Des approches récentes basées sur la profondeur monoculaire apprise, Depth Anything, UniDepth, ou des architectures de localisation neuronale cherchent à combler cet écart, tandis que des acteurs comme Nvidia (Isaac Perceptor), Clearpath Robotics ou Slamtec intègrent progressivement davantage de vision dans leurs pipelines de navigation pour AMR. VGP-Nav reste à ce stade une contribution de recherche en pré-print : sa validité industrielle n'est pas encore confirmée par des benchmarks tiers indépendants sur des datasets standardisés comme nuScenes ou ScanNet, et aucun partenariat commercial ni calendrier de transfert technologique n'est annoncé.

UEPotentiel indirect pour les intégrateurs AMR européens si la technologie est validée industriellement, aucun partenariat commercial ni transfert vers l'Europe n'est annoncé à ce stade.

RecherchePaper
1 source
GraspFoM : vers une préhension robotique guidée par la reconstruction et les modèles fondation 3D
2143arXiv cs.RO 

GraspFoM : vers une préhension robotique guidée par la reconstruction et les modèles fondation 3D

Une équipe de chercheurs a publié le 10 juin 2026 sur arXiv (référence 2606.08440) GraspFoM, un framework unifié de saisie robotique qui exploite des fondations 3D pré-entraînées, plus précisément SAM3D, pour construire une représentation latente 3D partagée entre deux tâches simultanées : la reconstruction géométrique de l'objet et la prédiction de poses de préhension. L'architecture centrale repose sur un diffuseur de raisonnement de pose tronqué à initialisation par ancres, qui génère des poses continues et multimodales sans dépendre de candidats discrets préétablis, une distinction technique importante par rapport aux pipelines classiques. GraspFoM produit en sortie à la fois des poses de saisie et des reconstructions 3D haute fidélité au format maillage polygonal et 3D Gaussian Splatting (3DGS). Les auteurs rapportent des résultats de pointe sur les benchmarks de reconstruction et de saisie, avec un surcoût en paramètres entraînables qualifié de "limité" mais sans chiffre précis publié. Ce travail adresse un verrou réel dans la manipulation robotique : la saisie sous observation partielle, c'est-à-dire quand la caméra ne voit qu'une fraction de l'objet. Les approches existantes utilisent la géométrie 3D comme étape intermédiaire jetable, sans la capitaliser comme prior réutilisable. GraspFoM rompt avec cette logique en faisant co-évoluer reconstruction et grasping dans un espace latent commun : la reconstruction ancre la géométrie, la supervision de saisie affine ce latent vers les zones de prise pertinentes. Le scorer reconstruction-aware et le residual latent updater formalisent cette rétroaction mutuelle. Pour les intégrateurs en manipulation industrielle ou logistique, cela suggère une meilleure robustesse sur des objets partiellement occultés, sans multiplication des modules ou des paramètres, ce qui est un argument d'efficacité réelle si les expériences réelles confirment les benchmarks. Les fondations 3D comme SAM3D s'inscrivent dans une vague de transferts de connaissances entre vision 2D et représentations 3D, parallèle à l'essor des VLA (Vision-Language-Action models) pour la manipulation généraliste. GraspFoM se positionne différemment des approches purement end-to-end comme pi0 de Physical Intelligence ou GR00T N2 de NVIDIA : il mise sur la reconstruction explicite plutôt que sur l'imitation à grande échelle. Les concurrents académiques proches incluent GraspNeRF, Contact-GraspNet et des travaux récents combinant diffusion et géométrie 3D. À ce stade, GraspFoM reste un preprint non validé en conditions réelles, les expériences rapportées étant réalisées sur simulateur ou bancs de test contrôlés. Aucun partenaire industriel ni déploiement pilote n'est mentionné, et aucune timeline de commercialisation n'est communiquée.

RecherchePaper
1 source
ProbeAct : récupération des échecs sans entraînement guidée par sonde dans les modèles vision-langage-action
2144arXiv cs.RO 

ProbeAct : récupération des échecs sans entraînement guidée par sonde dans les modèles vision-langage-action

Une équipe de recherche a publié sur arXiv (arXiv:2606.09740) ProbeAct, un framework d'intervention à l'exécution conçu pour détecter et corriger les échecs de saisie et de placement dans les modèles Vision-Language-Action (VLA) pré-entraînés, sans modifier leurs poids ni nécessiter de démonstrations supplémentaires. Le système repose sur trois composants couplés : une sonde légère sur les états cachés du modèle qui prédit les positions 3D des objets pertinents à partir des features intermédiaires du VLA (avec suivi d'identité par algorithme hongrois pour les scènes multi-objets) ; une machine à états cinématiques agnostique à l'objet qui détecte les défaillances de saisie, de transport et de placement via les signaux internes du préhenseur et la cinématique de l'effecteur terminal ; enfin, un filtre hiérarchique par Control Barrier Function (CBF) qui encode les zones d'échecs répétés comme contraintes soft sur l'ensemble de sécurité, corrigeant minimalement les actions du VLA sans altérer son comportement nominal. Évalué sur le benchmark LIBERO-plus, ProbeAct améliore le taux de succès d'OpenVLA-OFT de 69,6 % à 74,1 %. Un gain de 4,5 points de taux de succès peut sembler modeste, mais il intervient sur un problème structurel bien identifié des VLA : leur fragilité hors distribution. Ces modèles échouent régulièrement face à des variations de luminosité, des changements de point de vue caméra, ou de légères variations d'état initial, autant de conditions triviales dans un déploiement industriel réel. L'intérêt de ProbeAct est précisément d'être plug-and-play, orthogonal aux pipelines d'entraînement existants, et applicable aussi bien aux modèles de base qu'aux versions fine-tunées. Pour un intégrateur, cela signifie un filet de sécurité superposable sur n'importe quel VLA sans coût de ré-entraînement, ce qui réduit concrètement le gap entre performance en benchmark et robustesse terrain. Les VLA ont connu une accélération notable depuis 2023 avec des modèles comme RT-2 (Google DeepMind), OpenVLA (UC Berkeley) ou pi-0 (Physical Intelligence), mais leur fragilité aux perturbations reste un frein reconnu à la commercialisation. Les approches existantes pour y remédier passent généralement par de l'augmentation de données ou du fine-tuning ciblé, coûteux en temps et en annotations. ProbeAct s'inscrit dans une alternative émergente : la correction à l'inférence, sans toucher au modèle. Il s'agit pour l'instant d'un preprint arXiv, sans déploiement annoncé ni partenaire industriel mentionné ; les prochaines étapes naturelles seraient une validation sur hardware réel hors benchmark simulé.

RechercheOpinion
1 source
Planification neuro-symbolique à base d'agents et mise en service pour la robotique industrielle avec humain dans la boucle et jumeaux numériques
2145arXiv cs.RO 

Planification neuro-symbolique à base d'agents et mise en service pour la robotique industrielle avec humain dans la boucle et jumeaux numériques

Une équipe de chercheurs publie sur arXiv (2606.08214) un cadre neuro-symbolique agentique pour la robotique industrielle avec supervision humaine en boucle. Le système hybride confie aux grands modèles de langage (LLM) uniquement les tâches de compréhension du langage naturel et de raisonnement contextuel, tandis que la vérification des contraintes physiques, le séquençage des actions et l'exécution restent entièrement déterministes. L'architecture, baptisée Specifier-Designer-Inspector (SDI), adapte le patron logiciel Planner-Generator-Evaluator (PGE) à la robotique industrielle et s'appuie sur LangGraph pour le routage dynamique en cas d'échec. Un mécanisme de récupération à deux niveaux distingue les échecs structurels (replanification contextuelle) des échecs géométriques à l'exécution (primitives déterministes de correction). Un jumeau numérique sous Unity3D permet à l'opérateur d'inspecter, modifier et valider le plan avant tout déploiement physique. Testé sur des commandes en langage naturel face à dix systèmes de référence, le framework SDI obtient le meilleur taux de réussite sur l'ensemble des niveaux de difficulté évalués. L'intérêt industriel de cette approche tient à son pragmatisme architectural : plutôt que de confier aux LLM la garantie de faisabilité physique d'une trajectoire, le système délègue cette responsabilité à des composants symboliques vérifiables et auditables. C'est une réponse directe au "demo-to-reality gap" qui fragilise de nombreux projets fondés sur des VLA (Vision-Language-Action models) ou des politiques neurales pures. Pour les intégrateurs et les COO industriels, la présence du jumeau numérique comme étape obligatoire de validation avant exécution réduit concrètement le risque opérationnel lors du commissionnement de nouvelles cellules robotiques, en donnant à l'opérateur un droit de regard explicite sur chaque plan généré. Ce travail prolonge une tradition de planification neuro-symbolique héritée de STRIPS et des HTN (Hierarchical Task Networks), en y intégrant les LLM pour l'interprétation des intentions opérateur. Il se positionne en contrepied des approches end-to-end actuellement dominantes, notamment pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou Helix de Figure AI, qui misent sur des politiques entraînées en imitation ou en renforcement sans couche symbolique intermédiaire. La publication reste un preprint non encore évalué par les pairs, ce qui invite à la prudence sur les benchmarks annoncés : aucune métrique de temps de cycle en conditions industrielles réelles n'est fournie, et les commandes testées restent dans un cadre expérimental contrôlé. Aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
IA physique : le middleware robotique comme couche d'intégration
2146arXiv cs.RO 

IA physique : le middleware robotique comme couche d'intégration

Un article de recherche déposé sur arXiv le 9 juin 2026 (arXiv:2606.09416) propose de redéfinir formellement le rôle du middleware robotique à l'ère de l'IA physique. Les auteurs partent d'un constat : les politiques apprises, les planificateurs et les modèles vision-langage-action (VLA) sont désormais des participants causaux sur le chemin de contrôle des robots déployés, mais la couche logicielle qui les intègre n'a jamais reçu de nom précis dans la littérature robotique. Ils empruntent le terme "harness" à la communauté des agents LLM, où il désigne le système externe qui orchestre les outils, gère l'état, borne les ressources et enregistre l'exécution, et soutiennent que le middleware robotique est exactement ce harness. La différence avec un harness logiciel classique est structurelle : un modèle VLA ne franchit pas une seule frontière, il en traverse trois simultanément, ses commandes modifient la trajectoire (contrôle), son temps d'inférence perturbe l'ordonnancement (calcul), et son volume de données sollicite la bande passante réseau (communication). L'enjeu pour les intégrateurs et les décideurs industriels est concret. Aujourd'hui, les trois fonctions d'enforcement manquantes, que les auteurs nomment Projection (filtrage de chaque sortie du modèle à l'émission), Isolation (encadrement du slot d'exécution et de transmission), et Transfer (repli sur une baseline vérifiée en cas d'échec), existent déjà dans les systèmes déployés, mais sous forme de code applicatif artisanal, reconstruit à chaque projet. Cette fragmentation augmente les coûts d'intégration et crée des surfaces de défaillance non standardisées. Le papier ne présente pas de benchmark de performance ni de déploiement validé en production : c'est un cadre conceptuel et une proposition de standardisation, pas un produit livré. La proposition concrète est un "ROS 2 Harness Profile", un artefact de déploiement qui encapsule la région de sortie déclarée d'un modèle IA, son budget d'inférence et son régime opérationnel, tandis que le middleware (ROS 2, DDS, Zenoh) en assure l'application. Cette démarche s'inscrit dans un mouvement plus large de formalisation des couches d'intégration pour les systèmes robotiques apprenants, auquel contribuent aussi des travaux autour de ROS 2 Nav2, de micro-ROS pour les systèmes embarqués, et des frameworks d'évaluation de robustesse comme ceux proposés par des acteurs tels qu'Intrinsic (filiale Alphabet) ou des laboratoires académiques travaillant sur le sim-to-real. La prochaine étape logique serait une implémentation de référence et une validation sur un système physique, ce que les auteurs n'ont pas encore publié.

RecherchePaper
1 source
Assistance robotique proactive et personnalisée par raisonnement LLM guidé par l'incertitude
2147arXiv cs.RO 

Assistance robotique proactive et personnalisée par raisonnement LLM guidé par l'incertitude

Des chercheurs ont publié le 9 juin 2026 sur arXiv (2606.08458) GLOBE, un framework léger pour l'assistance robotique proactive en environnement domestique. Le principe : combiner des modèles de Markov n-grammes, qui capturent les patterns comportementaux temporels d'un utilisateur, avec un raisonnement par grand modèle de langage (LLM) déclenché uniquement lorsque la confiance du modèle prédictif passe sous un seuil. Ce mécanisme d'invocation sélective réduit la charge computationnelle par rapport aux architectures spatio-temporelles classiques. L'équipe introduit également HOMER-Noise, une extension bruitée du dataset HOMER+, qui simule des perturbations structurées réalistes : déplacements d'objets causés par des humains, des animaux domestiques ou des jeunes enfants. Le framework est validé en preuve de concept sur un manipulateur mobile Stretch 3 de Hello Robot, dans des scénarios d'interaction humain-robot à domicile. L'intérêt principal de GLOBE réside dans son positionnement hybride : plutôt que de faire tourner un LLM en continu sur chaque prédiction d'activité, le système n'y fait appel que sur les cas ambigus, ce qui le rend potentiellement déployable sur du matériel embarqué à ressources limitées. Les résultats annoncés montrent des performances compétitives face aux méthodes état de l'art, y compris en conditions bruitées, là où les approches purement neuronales se dégradent. Cette robustesse aux perturbations environnementales non contrôlées est un verrou connu pour le déploiement domestique réel. Il faut toutefois noter qu'il s'agit d'un preprint arXiv sans peer review, et que la validation sur Stretch 3 reste au stade de démonstration de concept, pas d'un déploiement opérationnel. GLOBE s'inscrit dans un courant de recherche qui cherche à réconcilier les LLMs, puissants mais coûteux, avec les contraintes temps réel de la robotique embarquée. Des approches similaires existent chez des équipes travaillant sur les VLAs (Vision-Language-Action models), comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, mais celles-ci ciblent surtout la manipulation industrielle plutôt que l'assistance cognitive à domicile. Le dataset HOMER-Noise comble un manque réel dans l'évaluation de la robustesse des systèmes d'anticipation d'activités. Les prochaines étapes logiques seraient une évaluation sur des déploiements multi-utilisateurs prolongés et une comparaison directe avec des baselines LLM-only pour quantifier précisément le gain computationnel revendiqué.

RecherchePaper
1 source
IA incarnée : traduire les actions en images de mouvement et de contact pour les modèles du monde
2148arXiv cs.RO 

IA incarnée : traduire les actions en images de mouvement et de contact pour les modèles du monde

Des chercheurs proposent iMaC (Image as Action Control), un paradigme de contrôle robotique publié en juin 2026 sur arXiv (2606.09813), qui substitue aux vecteurs d'action structurés de faible dimension - angles articulaires et poses d'effecteur terminal - des images visuelles brutes comme représentation native des actions dans les modèles de monde incarnés. L'architecture comprend deux branches : un encodeur image-action qui compresse des images cibles en embeddings d'action compacts, et un prédicteur de monde dynamique conditionné sur ces tokens visuels pour prédire les états futurs et assurer le contrôle en boucle fermée. Des expériences sur des benchmarks publics de manipulation incarnée et des scénarios réels montrent qu'iMaC dépasse les baselines vectorielles en précision de prédiction, taux de succès et généralisation inter-scènes. L'enjeu central est la généralisation inter-embodiment, l'un des verrous majeurs de la robotique incarnée. Les approches conventionnelles encodent des espaces d'action définis manuellement - cinématique propre à chaque plateforme - ce qui bride la portabilité entre bras industriels, manipulateurs mobiles et humanoïdes. En traitant l'image comme token d'action, iMaC encapsule implicitement les intentions de mouvement spatial, les contraintes géométriques et les dynamiques physiques, sans redéfinir l'espace d'action pour chaque robot. Pour les intégrateurs et les équipes R&D, cela ouvre la perspective d'un contrôleur unique déployable sur des flottes hétérogènes - bras Franka, UR, humanoïdes - sans reconfiguration. Nuance importante : l'article valide la méthode sur des "real-world robotic scenarios" sans préciser les plateformes ni les métriques de déploiement, ce qui invite à une lecture prudente des gains annoncés. iMaC s'inscrit dans la vague des modèles de monde incarnés et des architectures VLA (Vision-Language-Action) qui structurent la recherche robotique depuis 2023-2024, aux côtés de pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). Sa singularité tient à l'abandon des encodages cinématiques explicites au profit d'une représentation visuelle continue, une piste explorée différemment via les action-chunking transformers dans des travaux académiques récents. À ce stade, iMaC demeure une préimpression arXiv, sans déploiement industriel ni partenariat avec un constructeur de robots. Les prochaines étapes naturelles passeraient par une validation sur des plateformes standardisées comme ALOHA ou BridgeData V2, et une confrontation sur les benchmarks RLBench ou MetaWorld pour objectiver les gains de généralisation revendiqués.

RechercheOpinion
1 source
Sécurité des interactions dans le contrôle multitâche d'exosquelettes : un cadre à impédance variable entraîné en simulation
2149arXiv cs.RO 

Sécurité des interactions dans le contrôle multitâche d'exosquelettes : un cadre à impédance variable entraîné en simulation

Des chercheurs ont publié le 6 juin 2026 sur arXiv (référence 2606.06370) un framework de contrôle à impédance variable entraîné en simulation pour exosquelettes portables, capable de gérer neuf tâches motrices distinctes tout en garantissant mathématiquement la sécurité d'interaction. Le système repose sur un pipeline de génération de données simulation humain-exosquelette utilisant l'algorithme Proximal Policy Optimization (PPO) pour synthétiser les activations musculaires humaines, pendant que l'exosquelette compense directement les couples biologiques des articulations. Ces données alimentent ensuite une politique bimodale qui fusionne des instructions sémantiques (commandes en langage naturel décrivant la tâche) et un historique proprioceptif, pour prédire simultanément des trajectoires de référence et des gains d'impédance variables. La contrainte clé : les sorties du réseau de neurones sont bornées par un critère de stabilité dérivé de la théorie de Lyapunov, garantissant la stabilité asymptotique du système couplé humain-machine. Les expériences en conditions réelles montrent une réduction du coût métabolique par rapport aux méthodes baseline standards, les auteurs ne quantifient pas ce gain en pourcentage dans l'abstract. Ce travail s'attaque à l'un des obstacles principaux à la commercialisation des exosquelettes industriels et médicaux : le compromis entre adaptabilité multi-tâches et sécurité d'interaction garantie. En embarquant la garantie de stabilité directement dans les contraintes du réseau via Lyapunov, plutôt qu'en post-traitement, les chercheurs proposent une architecture où la sécurité est structurellement imposée plutôt qu'espérée. La fusion sémantique-proprioceptive suggère une interface utilisateur potentiellement plus intuitive pour les opérateurs industriels, sans reconfiguration manuelle entre tâches, ce qui représente un avantage opérationnel concret pour les déploiements en logistique ou en réhabilitation. Le contrôle d'impédance variable pour exosquelettes est un axe de recherche actif depuis une décennie, avec des contributions majeures des laboratoires MIT, ETH Zurich et du groupe de Wandercraft en France, ce dernier étant l'un des rares acteurs européens à avoir atteint un dispositif médical commercialisé (Atalante X). Du côté industriel, des acteurs comme SuitX (Ottobock), Ekso Bionics et Sarcos positionnent des exosquelettes sur les marchés logistique et manufacturing. Ce framework reste à ce stade une preuve de concept académique : l'article ne mentionne ni volume de déploiement, ni partenaire industriel, ni timeline de transfert vers un produit. Les prochaines étapes naturelles seraient une validation sur une population d'utilisateurs élargie et une évaluation des performances hors distribution de tâches.

UELes acteurs européens comme Wandercraft (France, Atalante X) pourraient s'appuyer sur ce type de framework à sécurité garantie pour accélérer la certification médicale et industrielle de nouveaux exosquelettes sur le marché européen.

ExosquelettesPaper
1 source
Affordance2Action : ancrage des affordances guidé par la tâche pour la manipulation en temps réel
2150arXiv cs.RO 

Affordance2Action : ancrage des affordances guidé par la tâche pour la manipulation en temps réel

Une équipe de chercheurs publie sur arXiv (identifiant 2606.04172) le framework Affordance2Action (A2A), centré sur un problème concret de la manipulation robotique : identifier en temps réel quelle partie précise d'un objet est fonctionnellement exploitable pour accomplir une tâche donnée, dans une scène encombrée et ambigüe. Le coeur du travail est A2A-Bench, un benchmark de manipulation couvrant à la fois les correspondances instruction-région unique et multi-région, c'est-à-dire les cas où un seul verbe d'action peut pointer vers une ou plusieurs zones fonctionnelles selon la disposition de la scène. Pour construire ce dataset à grande échelle, les auteurs ont développé A2A-AffordGen, un pipeline assisté par agents qui enchaîne filtrage par modèle de langage, segmentation interactive de parties, raffinement par masquage d'instance, génération d'instructions de raisonnement et vérification humaine. Le code et les datasets seront rendus publics. Ce travail expose une lacune structurelle des benchmarks existants en affordance : la plupart se concentrent sur la préhension d'objet isolé, s'appuient sur des scènes synthétiques, ou supposent une correspondance univoque entre instruction et région. A2A révèle des écarts significatifs dans trois catégories de baseline (segmentation générique, grounding fondé sur des VLMs et distillation d'affordance) sur des scènes réelles et multi-objets. Pour un intégrateur ou un responsable d'automatisation, ce résultat indique que les approches actuelles basées sur des VLMs généralistes (type CLIP ou LLaVA) sous-performent dès que la scène sort des cas standards. La capacité à localiser des régions fonctionnelles ambigües en temps réel reste un verrou non résolu pour le déploiement de bras manipulateurs en environnement non structuré. L'affordance grounding en robotique s'inscrit dans une longue tradition de recherche remontant aux travaux de Gibson sur les affordances écologiques, réinterprétés pour la manipulation depuis les années 2010. Les approches concurrentes incluent des méthodes de grounding fondées sur des modèles de vision-langage (CLIP, SAM couplé à LLM) et des politiques de type VLA (Vision-Language-Action), comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui nécessitent elles aussi une localisation précise des régions d'interaction. A2A se positionne comme un cadre d'évaluation et de supervision plutôt que comme une politique de contrôle complète. La prochaine étape logique serait une validation sur robots physiques à plus grande échelle : le papier démontre des résultats en manipulation conditionnée par les affordances, mais la portée reste expérimentale à ce stade de preprint.

RecherchePaper
1 source