Aller au contenu principal

Dossier arXiv cs.RO — page 34

2504 articles · page 34 sur 51

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

IA incarnée : LIME apprend à percevoir les mouvements de caméra intentionnels à partir de vidéos égocentriques
1651arXiv cs.RO RecherchePaper

IA incarnée : LIME apprend à percevoir les mouvements de caméra intentionnels à partir de vidéos égocentriques

Un article de recherche publié sur arXiv (2607.02417) présente LIME, un système qui apprend à un robot autonome où déplacer sa caméra à partir de simples instructions en langage naturel. Le problème posé est précis : à partir d'une image RGB de la scène et d'une intention exprimée en texte libre ("regarde derrière la boîte", "inspecte l'objet"), le modèle doit prédire la pose cible relative de la caméra en SE(3) pour la prochaine observation. Les chercheurs ont construit leur jeu d'entraînement en minant des vidéos égocentriques humaines, associant intentions plausibles et descriptions du gain d'observation à des poses de caméra relatives. L'architecture combine deux briques : une sortie auto-régressive qui décrit ce que la prochaine vue doit révéler, et une tête de pose entraînée par flow-matching continu, capable de représenter plusieurs hypothèses de cible. Ce travail s'attaque à un angle mort du secteur : la navigation vision-langage traduit des instructions en déplacements de base, et les politiques vision-langage-action (VLA) les traduisent en gestes de manipulation, mais le contrôle du regard lui-même, c'est-à-dire où pointer la caméra avant d'agir, reste peu formalisé comme action à part entière. Pour un intégrateur ou un roboticien, cela touche un besoin concret : un robot qui doit inspecter une pièce industrielle, vérifier une zone occluse, ou s'orienter selon une consigne orale a besoin d'une perception active pilotée par le langage, et non d'une caméra fixe ou d'un balayage aveugle. Si les résultats se confirment à plus grande échelle, cela ouvrirait une voie pour entraîner ce type de comportement sans capture de données robotiques coûteuse, en réutilisant de la vidéo humaine ordinaire. Il s'agit à ce stade d'un article de recherche avec expériences et tâches robotiques en aval, pas d'un produit déployé ni d'un système embarqué chez un intégrateur. Le papier se positionne dans la lignée des travaux récents sur les politiques VLA à grande échelle (Pi-0, GR00T N2, Helix) mais en creusant une brique en amont, la perception active intentionnelle, plutôt que la génération d'actions de manipulation elle-même. Les auteurs annoncent des résultats sur des tâches robotiques en aval, mais sans préciser à ce stade de partenaire industriel ni de calendrier de transfert vers un système commercial.

1 source
Trajectoires de navigation apprises par graphes pour robots sociaux
1652arXiv cs.RO 

Trajectoires de navigation apprises par graphes pour robots sociaux

Des chercheurs proposent un nouveau framework d'apprentissage par imitation pour la navigation robotique en environnement social, décrit dans un article publié sur arXiv (2607.00028v1). L'approche combine deux briques : un réseau auxiliaire basé sur des graphes qui encode l'état de la foule en modélisant les interactions entre le robot et chaque piéton via un mécanisme d'attention, et un module de navigation qui capture la dynamique temporelle des trajectoires. Ce module intègre des prédictions d'état encodées et s'appuie sur un objectif d'apprentissage au niveau de la trajectoire complète, plutôt qu'étape par étape, pour limiter l'accumulation d'erreurs typique des méthodes d'imitation classiques. Les auteurs indiquent que leur framework surpasse les référentiels existants à la fois en simulation et sur un jeu de données réel, selon plusieurs métriques sociales (respect de l'espace personnel, fluidité des trajectoires, réactivité aux mouvements piétons). L'enjeu pour l'industrie de la robotique mobile autonome est concret : les robots de livraison, d'accueil ou d'assistance déployés en environnement humain doivent naviguer sans perturber les piétons, un problème encore mal résolu. Les méthodes par apprentissage par renforcement exigent des fonctions de récompense conçues à la main, qui réduisent le comportement social à des critères statiques et peinent à reproduire les nuances du comportement piéton réel. À l'inverse, l'apprentissage par imitation pur entraîne directement sur des données réelles mais ignore généralement la dimension interactionnelle et souffre de dérive cumulative des erreurs sur des trajectoires longues. En combinant représentation par graphe et objectif temporel, ce travail cherche à réconcilier fidélité aux données réelles et modélisation explicite des interactions sociales. Ce travail s'inscrit dans une littérature de recherche active sur la navigation socialement compliante, où RL et IL sont traditionnellement opposés faute de méthode combinant leurs forces respectives. Il s'agit d'un article de recherche déposé sur arXiv, sans mention d'implémentation industrielle, de partenaire ou de calendrier de déploiement : la validation reste limitée à des benchmarks de simulation et un jeu de données réel, sans démonstration sur robot physique en conditions opérationnelles.

RecherchePaper
1 source
KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques
1653arXiv cs.RO 

KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques

Des chercheurs présentent KungfuBot, un cadre de contrôle corps-entier pour robots humanoïdes basé sur la physique, capable d'imiter des mouvements humains hautement dynamiques comme le kungfu ou la danse, là où les algorithmes existants ne parviennent à suivre que des mouvements lents et fluides malgré un travail soigné sur les récompenses et le curriculum d'apprentissage. Le système repose sur un pipeline de traitement du mouvement qui extrait, filtre, corrige et retargete les captures de mouvement humain tout en respectant au maximum les contraintes physiques du robot. Pour l'imitation, les auteurs formulent un problème d'optimisation à deux niveaux qui ajuste dynamiquement la tolérance de précision de suivi selon l'erreur courante, créant un mécanisme de curriculum adaptatif, complété par une architecture acteur-critique asymétrique pour l'entraînement des politiques. Déployé sur le robot Unitree G1, le système atteint des erreurs de suivi nettement inférieures aux approches existantes et produit des comportements stables et expressifs. Le projet est documenté sur kungfubot.github.io. L'enjeu dépasse la simple prouesse technique : la capacité à reproduire des mouvements rapides et dynamiques est un point de blocage connu du contrôle corps-entier par imitation, où le compromis entre stabilité physique et fidélité au mouvement source devient critique à haute vitesse. En démontrant qu'un curriculum adaptatif basé sur l'erreur de suivi permet de dépasser ce plafond, KungfuBot apporte une preuve de concept utile pour toute l'industrie humanoïde, où l'expressivité et la robustesse des mouvements dynamiques sont devenues un argument de démonstration autant qu'un vrai défi d'ingénierie. Reste que les vidéos de démonstration, comme souvent dans ce type de publication, présentent probablement une sélection de résultats plutôt qu'un comportement systématique et généralisable. Ce travail s'inscrit dans la lignée des recherches sur l'imitation de mouvement par apprentissage par renforcement physique, un domaine où le retargeting de capture de mouvement humain vers des morphologies robotiques reste une difficulté majeure. Le fait qu'il s'agisse d'une troisième version révisée sur arXiv suggère un travail affiné après retours de la communauté. Le choix du Unitree G1, plateforme largement utilisée dans la recherche académique en robotique humanoïde, positionne ces résultats comme reproductibles par d'autres laboratoires, dans un secteur où Unitree, Figure ou Boston Dynamics rivalisent sur la démonstration de comportements dynamiques et expressifs.

RecherchePaper
1 source
ASPIRE : découverte de compétences à base d'agents pour la robotique
1654arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines
1655arXiv cs.RO 

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines

Wandercraft, Exotec, Pollen et Enchanted Tools ne sont pas mentionnés dans le papier, donc aucune mention forcée. Voici l'article : Une équipe de recherche publie CHORD (Contact Wrench Guidance from Human Demonstration in Robotic Dexterous Manipulation), un framework d'apprentissage par renforcement pour la manipulation dextre à long horizon d'objets rigides et articulés, dans un preprint arXiv daté du 2 juillet 2026 (arXiv:2607.00033v1). L'idée centrale consiste à représenter les mouvements humains et robotiques non pas par des trajectoires articulaires brutes, mais par les forces et couples (wrench) qu'ils induisent sur l'objet manipulé, ce qui permet de comparer directement leur effet plutôt que leur cinématique. Les chercheurs ont construit un benchmark de simulation de 4 739 tâches de manipulation bimanuelle dextre, issu de jeux de données de capture de mouvement et de vidéos reconstruites en interne. Sur 1 831 tâches évaluées, CHORD atteint un taux de réussite moyen de 82,12 %. La méthode se généralise aussi à la manipulation corps entier à partir de démonstrations limitées aux mains ou filmées à la troisième personne, avec 90,77 % de réussite, et les politiques apprises se transfèrent vers le réel en boucle ouverte comme en boucle fermée. L'enjeu dépasse la simple prouesse académique : l'apprentissage par renforcement pour la manipulation riche en contacts est réputé difficile à faire passer à l'échelle, car les démonstrations humaines se transposent mal aux mains robotiques dont la cinématique diffère. En ancrant le signal de guidage dans la physique des forces plutôt que dans les gestes eux-mêmes, CHORD contourne en partie ce fossé d'incarnation. Un benchmark de près de 5 000 tâches, avec transfert vérifié sur robot réel et non seulement en simulation, constitue un test de scalabilité plus rigoureux que la plupart des démonstrations ponctuelles habituelles du secteur. Ce travail s'inscrit dans une tendance plus large exploitant la capture de mouvement et la vidéo humaine pour entraîner des politiques robotiques, en parallèle des approches par imitation ou des modèles vision-langage-action comme Pi-0 ou GR00T N2. Étant un preprint, il reste à valider par relecture par les pairs, avec une portée réelle encore limitée aux conditions de laboratoire décrites.

RecherchePaper
1 source
Traduction du monde des demonstrations spatio-temporelles pour systèmes d'Euler-Lagrange inconnus, apprentissage à partir de démonstrations via tubes spatio-temporels
1656arXiv cs.RO 

Traduction du monde des demonstrations spatio-temporelles pour systèmes d'Euler-Lagrange inconnus, apprentissage à partir de démonstrations via tubes spatio-temporels

Voici l'article traduit et résumé en français : Des chercheurs présentent STT-LfD, un nouveau cadre d'apprentissage par démonstration (Learning from Demonstration) qui unifie l'apprentissage du mouvement et le contrôle pour des systèmes Euler-Lagrange dont la dynamique reste inconnue, c'est-à-dire la plupart des robots mobiles et manipulateurs industriels réels. Publié sur arXiv (2607.00534) début juillet 2026, l'article décrit une méthode qui s'appuie sur des processus gaussiens hétéroscédastiques pour apprendre des tubes spatio-temporels, une enveloppe qui encode les exigences de précision variables dans le temps d'une tâche démontrée. Un contrôleur en boucle fermée, à forme close, applique ensuite ces contraintes tout en respectant les limites physiques des actionneurs, sans passer par une identification explicite du système. Les auteurs valident l'approche sur deux plateformes matérielles : un robot mobile et un bras manipulateur à 7 degrés de liberté (DOF), et rapportent de meilleures performances que les méthodes de référence en robustesse face aux perturbations et en vitesse de calcul. L'enjeu dépasse la seule prouesse technique. Les approches classiques d'apprentissage par démonstration découplent généralement la planification de mouvement du contrôle : elles apprennent une trajectoire de référence fixe, puis la suivent avec un contrôleur classique, quitte à perdre en robustesse dès qu'une perturbation survient. STT-LfD renverse la logique en traitant la démonstration elle-même comme une spécification de sécurité pilotée par les données, plutôt que comme une cible rigide à reproduire. Pour les intégrateurs industriels, l'intérêt pratique est de pouvoir déployer un contrôleur performant sans phase coûteuse d'identification dynamique du système, un frein courant au déploiement rapide de bras manipulateurs ou de robots mobiles sur des lignes hétérogènes. Cela va dans le sens d'une tendance plus large en robotique : réduire la dépendance à des modèles physiques précis au profit de méthodes data-driven plus rapides à mettre en œuvre. Le travail s'inscrit dans la lignée des recherches sur les tubes de sécurité et le contrôle par barrières (funnel control), déjà explorées pour garantir des performances sous incertitude, mais appliquées ici spécifiquement au cadre de l'apprentissage par démonstration. Il reste à ce stade un résultat de recherche académique, publié en prépublication sans revue par les pairs, testé sur un nombre limité de plateformes matérielles en laboratoire. Les prochaines étapes attendues concernent l'extension à des tâches de manipulation plus complexes et la comparaison directe avec des architectures d'apprentissage de politiques plus récentes, du type transformeurs vision-langage-action, sur des benchmarks communs.

RecherchePaper
1 source
RoboWorld : des simulateurs neuronaux rapides et fiables pour évaluer les politiques robotiques génériques
1657arXiv cs.RO 

RoboWorld : des simulateurs neuronaux rapides et fiables pour évaluer les politiques robotiques génériques

Une équipe de recherche a publié sur arXiv (2607.01060) RoboWorld, un pipeline automatisé d'évaluation pour les politiques robotiques génon-généralistes fondé sur des modèles de monde vidéo. Le système combine un modèle de monde vidéo autorégressif rapide avec un scoring assuré par un modèle vision-langage sensible à la progression de la tâche. Pour fiabiliser les simulations sur de longs horizons temporels, les auteurs introduisent une technique baptisée Step Forcing, qui mélange des contextes ancrés et des contextes auto-propagés en un seul pas afin de réduire l'écart entre entraînement et inférence, tout en préservant la cohérence entre actions et observations générées. Résultat annoncé : une corrélation quasi parfaite avec les évaluations réelles de robots physiques, avec un coefficient de Pearson de 0,989 et un coefficient de Spearman de 0,970, mesurés sur plusieurs tâches et environnements. L'enjeu dépasse la seule prouesse technique. Évaluer une politique robotique généraliste sur du matériel réel coûte cher et prend du temps : il faut multiplier les essais physiques, gérer l'usure du matériel et l'imprévisibilité de l'environnement. Les modèles de monde vidéo promettent de contourner cette contrainte en simulant les conséquences des actions d'un robot directement à partir de flux vidéo, sans passeser par un moteur physique classique. Le problème jusqu'ici restait la fiabilité : les erreurs cumulées du modèle de monde rendent les simulations longues peu crédibles, et l'inférence lente limite le nombre d'évaluations possibles à grande échelle. En démontrant une corrélation aussi forte avec la réalité tout en visant la rapidité, RoboWorld s'attaque frontalement à ce goulot d'étranglement, ce qui intéresse directement les laboratoires qui entraînent des politiques de type VLA (vision-langage-action) et cherchent à les valider avant tout déploiement physique coûteux. Ce travail s'inscrit dans une tendance plus large de la recherche en robotique où les modèles de monde vidéo remplacent progressivement les simulateurs physiques traditionnels pour l'évaluation de politiques, notamment à mesure que les modèles génératifs vidéo gagnent en fidélité. La difficulté classique de ces approches, le décalage entre les rollouts générés en entraînement et ceux produits en inférence, est justement ce que vise à corriger la méthode Step Forcing. L'article ne précise pas de partenariat industriel ni de déploiement en conditions réelles : il s'agit à ce stade d'un travail de recherche évalué sur des benchmarks internes, dont la reproductibilité et la généralisation à d'autres familles de robots restent à confirmer par la communauté.

RecherchePaper
1 source
Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique
1658arXiv cs.RO 

Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique

Les auteurs de cette étude publient H-Tac, un jeu de données tactile-action à grande échelle constitué de 160 heures de vidéos humaines à la première personne, couvrant plus de 300 tâches et totalisant 135 000 épisodes. À partir de cette base, ils proposent Transferable Tactile Pre-Training (TTP), un système de pré-entraînement fondé sur le sens tactile humain, destiné à transférer des compétences de manipulation fine vers des robots. La méthode s'appuie sur des espaces tactiles et d'action unifiés, maintenus identiques pendant les phases de pré-entraînement et de post-entraînement, afin de préserver les connaissances acquises lors du passage de l'humain au robot. Un module expert dédié prédit l'évolution future du signal tactile, ce qui permet de modéliser explicitement la dynamique de contact et les interactions physiques fines. Les auteurs rapportent des performances supérieures aux approches existantes, en simulation comme sur robots réels, avec une bonne capacité de généralisation. Ce travail cible un verrou connu du secteur robotique: le toucher reste la modalité la moins exploitée dans les modèles Vision-Language-Action, alors qu'il est indispensable pour les tâches riches en contact où la vision seule ne suffit pas à estimer une force appliquée. Les jeux de données tactiles existants restent petits et couvrent peu de types de contacts, ce qui limite le plafond de performance des modèles VLA tactiles, dont le post-entraînement reste largement indifférent à la dynamique physique. En s'appuyant sur des vidéos humaines plutôt que sur de la téléopération robotique coûteuse à collecter, H-Tac vise à lever ce goulot d'étranglement de données, une stratégie déjà explorée pour le pré-entraînement d'actions mais rarement appliquée au tactile à cette échelle. Si les résultats se confirment sur d'autres plateformes, cela pourrait rapprocher les robots manipulateurs dextres de tâches fines comme l'insertion de précision ou la manipulation d'objets déformables, au-delà des démonstrations scénarisées. L'article s'inscrit dans la lignée des modèles VLA récents (Pi-0, GR00T N2, Helix) qui combinent perception visuelle et langage mais négligent généralement le retour tactile faute de données adaptées. Publié sur arXiv (2607.01067v1) début juillet 2026, ce travail reste au stade de la recherche académique: aucun partenariat industriel ni déploiement commercial n'est mentionné, et les auteurs présentent TTP comme une preuve de concept ouvrant la voie à un pré-entraînement tactile transférable et passant à l'échelle, plutôt que comme un produit prêt à l'emploi.

RecherchePaper
1 source
FAR : retentative sensible aux échecs pour la récupération en cours de test et l'amélioration continue des politiques
1659arXiv cs.RO 

FAR : retentative sensible aux échecs pour la récupération en cours de test et l'amélioration continue des politiques

Les chercheurs à l'origine de ce papier arXiv (référence 2607.01111v1) présentent FAR (Failure-Aware Retry), un framework qui permet à un robot manipulateur d'apprendre de ses propres échecs directement au moment du test, sans intervention humaine, pour finir par accomplir la tâche de façon autonome. Le système combine deux mécanismes: la Failure-Contrastive Preference Adaptation, qui transforme chaque échec en donnée de préférence pour écarter la politique des comportements déjà ratés, et des perturbations d'action légères appliquées lors des tentatives suivantes pour favoriser une exploration locale ciblée autour du point d'échec. Les trajectoires de récupération qui réussissent sont ensuite réinjectées dans une boucle d'entraînement, ce qui permet une amélioration continue de la politique. Testé en simulation et sur des tâches de manipulation réelles, FAR améliore le taux de réussite de 17,6% en moyenne par rapport à une politique de diffusion standard en simulation, et de 11,7% en conditions réelles. Ce travail s'attaque à un problème concret pour l'industrie: la plupart des politiques de manipulation actuelles, notamment celles basées sur la diffusion, échouent silencieusement en réel et se contentent de répéter la même erreur lors d'un nouvel essai, faute de mécanisme pour comprendre pourquoi elles ont échoué. Les méthodes de récupération existantes s'appuient généralement sur un opérateur humain pour réinitialiser ou corriger le robot, ce qui limite le déploiement autonome à grande échelle et alourdit le coût des essais réels. En démontrant qu'un robot peut exploiter ses propres échecs comme signal d'apprentissage plutôt que comme simple bruit à ignorer, FAR va dans le sens d'une meilleure robustesse des politiques VLA et de diffusion en environnement non contrôlé, un enjeu central pour les intégrateurs qui cherchent à réduire la supervision humaine sur des lignes de manipulation. FAR s'inscrit dans la lignée des travaux récents sur les politiques de diffusion et l'apprentissage par imitation appliqués à la manipulation robotique, où la question du "reset" et du "budget de pas de temps" pendant l'entraînement continu reste un goulot d'étranglement pratique. Les auteurs montrent justement que leur méthode améliore l'efficacité des données sous ces deux contraintes de budget, en exploitant préférentiellement les cas d'échec les plus informatifs. Le papier, classé comme nouvelle soumission sur arXiv, ouvre la voie à des extensions vers d'autres familles de politiques et vers des déploiements réels prolongés, sans que des pilotes industriels concrets ne soient encore annoncés à ce stade.

RecherchePaper
1 source
FastBridge : combler l'écart de réalisation entre modèle et réel dans les filtres de sécurité, basé sur le splatting gaussien 3D pour un vol rapide de quadrirotor
1660arXiv cs.RO 

FastBridge : combler l'écart de réalisation entre modèle et réel dans les filtres de sécurité, basé sur le splatting gaussien 3D pour un vol rapide de quadrirotor

Des chercheurs présentent FastBridge, un nouveau filtre de sécurité pour le vol rapide de quadricoptères combiné à la représentation de scène 3D Gaussian Splatting (3DGS), détaillé dans un article publié sur arXiv (2607.01200). Le système s'appuie sur la dynamique complète du drone plutôt que sur des modèles simplifiés à intégrateur simple ou double, jusqu'ici standards dans les filtres de sécurité 3DGS mais qui ignorent les limites des actionneurs et supposent une exécution instantanée des accélérations commandées. Les auteurs dérivent une fonction barrière de contrôle exponentielle à cône de collision et à haut degré relatif, ainsi qu'une "backup CBF" qui préserve la faisabilité du programme quadratique sous contraintes d'entrée grâce à une politique de secours simulée à l'avance. Comparé à l'état de l'art des filtres de sécurité 3DGS, FastBridge réduit le jerk de trajectoire de 47% et s'exécute 2,25 fois plus vite. La méthode a été validée en simulation et sur banc matériel réel, en environnement encombré reconstruit par perception. L'enjeu dépasse la seule performance technique: les filtres de sécurité existants créent un écart entre modèle et réalité, car ils supposent que le drone peut instantanément réaliser n'importe quelle commande, une hypothèse qui s'effondre en vol rapide dans un environnement dense. En intégrant explicitement les contraintes d'actionneurs, FastBridge comble ce fossé et rend l'évitement d'obstacles plus fiable à haute vitesse, un point critique pour les applications d'inspection, de logistique ou de sécurité civile où les drones doivent naviguer vite et sous contraintes de calcul embarqué strictes. Le travail s'inscrit dans la continuité d'une barrière de collision analytique déjà développée pour 3DGS, que les auteurs étendent ici à un cadre non linéaire et conscient des actionneurs. Il se positionne face aux approches à modèles réduits utilisées par la génération précédente de filtres de sécurité basés sur 3DGS, en visant un compromis plus favorable entre robustesse, fluidité de trajectoire et charge de calcul embarquée, sans toutefois préciser à ce stade de calendrier de déploiement au-delà des tests en laboratoire.

RecherchePaper
1 source
AutoSpeed : apprentissage sans annotation de la vitesse de mouvement adapté aux étapes pour la manipulation robotique
1661arXiv cs.RO 

AutoSpeed : apprentissage sans annotation de la vitesse de mouvement adapté aux étapes pour la manipulation robotique

Un nouveau papier arXiv (2607.01051v1) présente AutoSpeed, une méthode qui permet aux politiques visuomotrices par apprentissage par imitation (IL) de moduler automatiquement leur vitesse d'exécution selon la difficulté de chaque étape d'une tâche de manipulation, sans aucune annotation de vitesse ou de segmentation d'étapes. Le problème visé est simple à énoncer: les politiques IL actuelles reproduisent la cadence des démonstrations expertes et opèrent avec un horizon de prédiction temporel fixe, quelle que soit la complexité du geste en cours. AutoSpeed traite plusieurs trajectoires futures à des vitesses candidates comme autant de cibles d'optimisation, les évalue via un coût composite qui arbitre entre erreur de prédiction et longueur de l'horizon, puis entraîne la politique vers le candidat le moins coûteux. La modulation de vitesse est implémentée dans le domaine fréquentiel via une transformée en cosinus discrète (DCT), ce qui autorise un changement d'échelle temporel continu, non entier, tout en préservant la fluidité du mouvement. L'intérêt pour l'industrie robotique tient au fait que la méthode est annoncée comme model-agnostic: elle se greffe sur des politiques visuomotrices existantes sans changer leur architecture ni exiger un travail d'étiquetage supplémentaire, ce qui abaisse le coût d'intégration pour qui veut déjà. Les auteurs rapportent une réduction substantielle du temps d'exécution des tâches couplée à une amélioration du taux de réussite, avec des vitesses inférées qui correspondent bien aux étapes réelles de la tâche, un signal encourageant sur la capacité du modèle à distinguer implicitement les phases faciles des phases délicates. Pour des intégrateurs qui cherchent à augmenter le débit de cellules robotisées sans sacrifier la fiabilité, ce type d'approche répond à une limite concrète des pipelines IL actuels, où la vitesse fixe impose un compromis rigide entre rapidité et précision. Le travail s'inscrit dans la lignée des politiques par apprentissage par imitation avec horizon de prédiction fixe, dont plusieurs limites de flexibilité ont déjà été pointées dans la littérature récente sur la manipulation robotique. À ce stade, il s'agit d'un résultat de recherche évalué en simulation et/ou benchmarks académiques, sans indication de déploiement industriel ni de partenaire matériel identifié; les prochaines étapes attendues seraient une validation sur plateformes physiques variées et une comparaison directe avec d'autres méthodes de contrôle de vitesse adaptatif.

RecherchePaper
1 source
Coordination multirobot pour la planification sous incertitude contextuelle
1662arXiv cs.RO 

Coordination multirobot pour la planification sous incertitude contextuelle

Un article de recherche publié sur arXiv (2603.13748v3, version révisée) s'attaque à un problème central pour les flottes de robots mobiles : comment agir efficacement quand la priorité des objectifs dépend d'un contexte opérationnel inconnu au départ. Les auteurs formalisent ce problème sous le nom de MR-CUSSP (Multi-Robot Context-Uncertain Stochastic Shortest Path), un cadre qui modélise la collecte d'informations contextuelles via des observations conjointes prises à des états repères ("landmark states"). Leur solution se décompose en deux étages : CIMOP (Coordinated Inference for Multi-Objective Planning), qui calcule des plans guidant les robots vers ces points informatifs pour inférer rapidement le contexte réel, puis LCBS (Lexicographic Conflict-Based Search), un planificateur multi-robot sans collision qui hiérarchise les objectifs selon l'ordre de préférence induit par ce contexte. L'équipe valide son approche sur trois domaines simulés, puis sur un déploiement physique impliquant cinq robots mobiles dans un scénario appelé "salp domain". L'enjeu pratique est réel pour tout opérateur de flottes robotiques évoluant dans des environnements où les règles du jeu changent selon la situation : un robot logistique en entrepôt, un AMR en usine ou un essaim d'exploration peut avoir des priorités radicalement différentes selon un contexte non observable directement (urgence, présence humaine, type de charge). Agir sur la base d'une hypothèse de contexte erronée peut produire un comportement mal aligné, voire dangereux. Ce travail illustre une tendance de fond en planification multi-robot : coupler explicitement l'inférence active (où aller pour lever l'incertitude) et l'optimisation lexicographique des tâches, plutôt que de traiter ces deux problèmes séparément. C'est un signal utile pour les équipes de recherche en coordination multi-agents, même si la validation physique reste limitée à cinq unités et un scénario contrôlé, loin d'un déploiement industriel à grande échelle. Ce travail s'inscrit dans la lignée des recherches sur la planification de chemins multi-robot sous contrainte (le "Conflict-Based Search" est une famille d'algorithmes bien établie dans ce domaine) et sur la prise de décision séquentielle dans l'incertitude (les Stochastic Shortest Path problems). La contribution spécifique ici est l'ajout d'une dimension de préférences lexicographiques dépendantes du contexte, une brique qui pourrait intéresser des acteurs académiques et industriels travaillant sur des flottes hétérogènes en environnement partiellement observable. Le fait qu'il s'agisse d'une version "replace" sur arXiv suggère un article déjà en révision, potentiellement en vue d'une soumission à une conférence de robotique majeure, sans qu'aucune date de publication définitive ne soit précisée.

RecherchePaper
1 source
Labimus : simulation et référentiel pour la manipulation dextérique humanoïde en laboratoire de chimie
1663arXiv cs.RO 

Labimus : simulation et référentiel pour la manipulation dextérique humanoïde en laboratoire de chimie

Des chercheurs ont présenté Labimus, premier benchmark évaluant la manipulation dextre de robots humanoïdes dans un laboratoire de chimie organique, selon un article publié sur arXiv (2606.31037v1). Le système reconstruit plus de 30 éléments fidèles fonctionnellement à partir de postes de travail réels de chimie organique, via une modélisation dite "real-to-sim", couvrant les opérations centrales des expériences de routine en laboratoire. Labimus intègre des instruments articulés, une physique de poudre basée sur des particules, et des mesures en boucle fermée reliant manipulation et lecture d'instruments. Le benchmark définit six opérations atomiques et un protocole en sept étapes pour la pesée de solides, directement dérivé de procédures opératoires standard utilisées en laboratoire réel. Les auteurs y associent un protocole d'évaluation "precision-aware", mesurant conjointement la réussite de la tâche, la précision expérimentale et l'exécution sur des horizons longs. Trois politiques de contrôle représentatives ont été testées sous des dispositions procédurales variables et des perturbations environnementales. Le résultat central est ce que les auteurs nomment un "gap de précision" : des politiques capables de mener une tâche à terme échouent malgré tout à respecter les tolérances quantitatives exigées par les protocoles expérimentaux réels. C'est un signal important pour l'écosystème robotique humanoïde, où la plupart des démonstrations publiques (Figure 03, Optimus, GR00T N2, Helix) se concentrent sur la réussite visible d'une tâche plutôt que sur sa validité métrologique. Labimus démontre que "terminer la tâche" et "produire un résultat scientifiquement exploitable" sont deux critères distincts, ce qui questionne la pertinence des benchmarks actuels pour des applications à forte exigence de précision comme l'automatisation de laboratoire. Le travail s'inscrit dans la dynamique plus large d'automatisation scientifique par IA, où les plateformes robotiques et le raisonnement scientifique assisté par IA ont progressé rapidement, mais où des opérations comme le transfert solide-solide restent difficiles à standardiser en raison de leur caractère dynamique. Contrairement aux benchmarks de manipulation généralistes existants, Labimus cible spécifiquement ce contexte de précision critique, ouvrant la voie à des travaux futurs de développement de robots humanoïdes fiables pour les laboratoires scientifiques, un segment encore largement inexploré par les acteurs commerciaux du secteur.

RecherchePaper
1 source
Terrain robotisé pour un rover planétaire à suspension activement articulée
1664arXiv cs.RO 

Terrain robotisé pour un rover planétaire à suspension activement articulée

Traduction terminée. Rédaction de l'article de synthèse. Un article de recherche déposé sur arXiv (version révisée, v2) présente ERNEST, un concept de rover planétaire à quatre roues doté d'une suspension à cardan actif à deux degrés de liberté combinant rotation en lacet et en roulis. Ce dispositif permet de reconfigurer l'orientation des roues, de participer au pilotage et de redistribuer activement la charge sur le châssis. Un unique réseau de neurones contrôle l'ensemble du système, entraîné par apprentissage par renforcement dans le simulateur haute fidélité DARTS, qui associe dynamique de contact rigide et modèle terramécanique de Bekker-Wong pour reproduire le comportement des sols meubles. Les chercheurs ont développé une stratégie de consolidation de politiques qui fusionne l'expérience de plusieurs agents spécialisés par type de terrain en un seul contrôleur unifié, supprimant le besoin de classification explicite du terrain. Le système combine retours proprioceptifs et extéroceptifs (élévation du terrain par stéréovision éparse, assiette du châssis, états des articulations, mesures de force-couple) et transfère en zero-shot vers le rover physique grâce à la randomisation de domaine et à l'identification modèle-réel. Les essais couvrent champs de rochers, obstacle de type "Bickler trap", marche de la hauteur d'une roue, ondulations de sable et pentes sableuses. Sur une pente sableuse à 20 degrés, le contrôleur réduit le coût de transport de 37 % sur sable sec malgré l'actionnement supplémentaire, et surpasse nettement la suspension passive sur sable humide, où celle-ci s'immobilise complètement. Ce résultat intéresse directement les concepteurs de rovers d'exploration lunaire ou martienne, historiquement équipés de suspensions passives type rocker-bogie (Curiosity, Perseverance) incapables de s'adapter activement au terrain. La démonstration qu'un contrôleur unique, sans commutation ni classification de terrain, généralise à des sols hétérogènes en conditions réelles constitue une validation supplémentaire de l'apprentissage par renforcement pour la locomotion tout-terrain, au-delà des cas déjà documentés sur robots à pattes ou véhicules terrestres. Le simulateur DARTS, développé au JPL, est un outil de référence pour la modélisation dynamique de véhicules spatiaux et rovers, ce qui situe ce travail dans la continuité des recherches sur la mobilité planétaire de la NASA. Le passage d'une suspension purement passive à une architecture activement articulée s'inscrit dans une tendance plus large vers des châssis reconfigurables pour l'exploration de terrains difficiles, comme les pentes sableuses ou les zones à forte densité de blocs rocheux. Les auteurs fournissent une vidéo de démonstration des essais physiques, mais le texte ne précise pas de calendrier de mission ni de partenaire industriel pour une intégration au-delà du stade de démonstrateur.

RecherchePaper
1 source
De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
1665arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
Robot de sécurité pour l'inspection industrielle : un benchmark multimodal
1666arXiv cs.RO 

Robot de sécurité pour l'inspection industrielle : un benchmark multimodal

Un consortium de recherche a publié InspecSafe-V1, présenté comme le premier benchmark multimodal dédié à l'évaluation de la sécurité pour l'inspection industrielle construit à partir de données réelles plutôt que simulées. Le jeu de données a été collecté auprès de 41 robots d'inspection, à roues ou montés sur rail, opérant sur 2 239 sites d'inspection valides, pour un total de 5 013 instances d'inspection. Cinq environnements industriels sont couverts : tunnels, installations électriques, équipements de frittage, sites pétrochimiques et gaziers, et convoyeurs à charbon sur chevalets. Chaque instance comprend une annotation de segmentation au pixel près des objets clés dans les images en lumière visible, une description sémantique de la scène, ainsi qu'un label de niveau de sécurité correspondant à des tâches d'inspection réelles. Le dataset intègre en outre sept modalités de capteurs synchronisées : vidéo infrarouge, audio, nuages de points de profondeur, nuages de points radar, mesures de gaz, température et humidité. Pour l'industrie de la maintenance prédictive et de l'inspection autonome, ce type de ressource comble un manque documenté : la plupart des jeux de données publics existants reposent sur des environnements simulés ou une seule modalité de capture, ce qui limite l'entraînement de modèles capables de raisonner de façon robuste sur des scènes industrielles complexes et dynamiques. En fournissant des annotations fines multi-capteurs issues de conditions opérationnelles réelles, InspecSafe-V1 vise à permettre l'entraînement et l'évaluation de modèles de fondation appliqués à l'industrie, avec des tâches de reconnaissance d'anomalies multimodale et de fusion cross-modale, un enjeu clé pour les intégrateurs qui cherchent à fiabiliser des systèmes de perception déployés sur des sites à risque (tunnels, sites pétrochimiques) où l'erreur de détection a un coût opérationnel élevé. Cette publication correspond à une nouvelle version (replace) d'un article déjà déposé sur arXiv, signe d'un travail de consolidation méthodologique plutôt que d'une annonce inédite. Le texte ne précise pas l'organisme ou l'entreprise à l'origine du déploiement des robots, ni si le dataset et son code seront rendus publics, deux éléments qui conditionneront son adoption effective par la communauté robotique et vision industrielle.

RecherchePaper
1 source
Gouvernance de mission agentique vérifiée pour systèmes industriels multi-robots intelligents
1667arXiv cs.RO 

Gouvernance de mission agentique vérifiée pour systèmes industriels multi-robots intelligents

Une équipe de recherche propose dans un article publié sur arXiv (2606.31339) un cadre de gouvernance baptisé « verification-gated agentic mission-state governance », conçu pour encadrer les systèmes multi-robots industriels pilotés par de l'IA agentique. Le framework repose sur deux structures d'état synchronisées : une forêt de tâches évolutive qui conserve la hiérarchie des missions, le rattachement différé des sous-tâches et les branches réparables, et un tableau noir (blackboard) gouverné qui centralise en temps réel les traces des robots, les verrous de ressources, les croyances sur l'environnement, les propositions d'action et les enregistrements de vérification. À partir de chaque instantané combiné de ces deux structures, le système extrait une topologie de couplage d'exécution qui révèle les dépendances entre branches de tâches, permettant de vérifier les propositions, d'autoriser des validations parallèles et de borner les réparations. Les auteurs ont testé leur approche sur un scénario d'usine intérieure multi-robots, des benchmarks de stress sur chantier de construction à distance avec 30 graines aléatoires, des ablations structurelles et des tests de montée en charge, avec des résultats montrant moins d'engagements invalides, de conflits de verrous, d'affectations dupliquées, de nœuds abandonnés et de réparations perturbatrices. L'enjeu dépasse la simple prouesse académique : à mesure que les modules agentiques (heuristiques, optimisation ou raisonnement par LLM) génèrent des plans d'action pour des flottes de robots industriels, rien ne garantit par défaut que ces propositions respectent les dépendances de tâches, la propriété des ressources ou les consignes de sécurité sur des missions de longue durée. Pour les intégrateurs et décideurs B2B qui envisagent de déployer des couches de planification agentique dans des entrepôts ou usines multi-robots, ce travail répond directement à une inquiétude centrale : éviter que l'IA générative devienne une autorité d'exécution incontrôlée. En imposant une vérification déterministe et un commit atomique avant toute mise à jour de l'état de mission, les auteurs positionnent explicitement l'IA agentique comme une couche de proposition inspectable et auditable, plutôt que comme un décideur autonome. Ce travail s'inscrit dans la vague plus large de recherches cherchant à combler l'écart entre les capacités de planification démontrées par les modèles agentiques et LLM et les exigences de fiabilité de l'industrie, un enjeu déjà soulevé autour des modèles vision-langage-action pour la robotique physique. Contrairement aux annonces produits de fabricants de robots humanoïdes, il s'agit ici d'une contribution méthodologique testée en simulation et sur bancs de stress, sans déploiement industriel réel annoncé à ce stade ; la suite logique consisterait en une validation sur des flottes physiques réelles et une comparaison directe avec d'autres architectures de gouvernance multi-agents.

RecherchePaper
1 source
MVP-Nav : navigateur planificateur avec carte de valeur multicouche
1668arXiv cs.RO 

MVP-Nav : navigateur planificateur avec carte de valeur multicouche

Une équipe de recherche présente MVP-Nav, un système de navigation qui permet à un robot de trouver un objet cible dans un environnement inconnu en utilisant uniquement une caméra RGB, sans capteur de profondeur dédié (lidar ou caméra stéréo). Le problème visé est le "Zero-shot Object Goal Navigation" : un agent doit localiser un objet qu'il n'a jamais rencontré, dans un lieu qu'il découvre en temps réel. Sans mesure directe de la profondeur, les méthodes existantes souffrent soit d'un raisonnement sémantique de haut niveau déconnecté de la géométrie réelle, soit de politiques de bout en bout sans contrainte physique explicite, ce qui produit des trajectoires plausibles sur le papier mais dangereuses en pratique (collisions, chemins irréalisables). MVP-Nav répond à ce problème en reconstruisant une occupation physique explicite à partir d'images monoculaires : des modèles de fondation 3D projettent les instances sémantiques détectées en 2D vers des boîtes englobantes orientées en 3D, formant une carte spatiale globale. Une "Multi-layer Value Map" combine ensuite ces priorités sémantiques avec la géométrie reconstruite dans un espace de coût unique, permettant une planification à la fois sémantiquement pertinente et physiquement viable. L'intérêt pour le secteur de la robotique mobile et des agents embarqués (embodied AI) est direct : la dépendance à des capteurs de profondeur coûteux (lidar, stéréo, temps de vol) reste un frein majeur au déploiement à grande échelle de robots autonomes, notamment mobiles ou humanoïdes évoluant dans des environnements non cartographiés. Un système capable d'atteindre l'état de l'art sur les benchmarks de navigation zero-shot avec une simple caméra RGB représenterait une réduction significative du coût matériel et de la complexité d'intégration, tout en comblant l'écart classique entre "démo qui a l'air de marcher" et comportement réellement sûr sur le terrain, un problème récurrent dans les approches purement sémantiques ou apprises de bout en bout. Ces travaux s'inscrivent dans la lignée des approches combinant modèles de fondation visuels et planification robotique, où l'essor des modèles 3D pré-entraînés (reconstruction monoculaire, détection d'objets orientés) ouvre la voie à des architectures hybrides entre perception sémantique et contraintes physiques classiques. Il est important de noter que ce travail, publié sur arXiv, reste à ce stade une contribution de recherche validée sur des benchmarks de simulation standards pour la navigation d'objectif, sans mention de déploiement sur robot physique réel ni de partenaire industriel. Les prochaines étapes attendues pour ce type d'approche seraient sa validation en conditions réelles, hors simulateur, et son intégration éventuelle dans des piles de navigation de robots mobiles commerciaux.

RecherchePaper
1 source
ChronoFlow-Policy : unifier le flux d'interaction passé-présent-futur dans l'apprentissage de politiques visuomotrices
1669arXiv cs.RO 

ChronoFlow-Policy : unifier le flux d'interaction passé-présent-futur dans l'apprentissage de politiques visuomotrices

Une équipe de recherche présente ChronoFlow-Policy, une nouvelle politique visuomotrice pour la manipulation robotique, décrite dans un article publié sur arXiv (2606.31493). Le système repose sur une représentation baptisée ChronoFlow, qui capture simultanément les dynamiques d'interaction passées, présentes et futures entre un objet et la pince du robot, sous forme de points-clés 3D épars. Contrairement aux approches existantes qui modélisent séparément soit le contexte historique, soit les prédictions futures, ChronoFlow unifie ces deux dimensions temporelles dans une seule représentation. Cette dernière est apprise conjointement avec les séquences d'actions via une politique basée sur la diffusion, entraînée selon un objectif de co-apprentissage. Les auteurs ont testé leur méthode sur 14 tâches simulées et 5 tâches de manipulation en conditions réelles, montrant des performances systématiquement supérieures à celles de politiques de diffusion de référence considérées comme robustes dans le domaine. L'intérêt de ce travail pour l'industrie de la robotique tient à un problème récurrent dans l'apprentissage par imitation appliqué à la manipulation : les politiques actuelles peinent souvent sur les tâches à long horizon ou non-markoviennes, c'est-à-dire celles où l'action optimale dépend d'un historique d'interactions et pas seulement de l'état instantané. En améliorant la robustesse sur ce type de scénarios, ChronoFlow-Policy s'attaque directement à l'un des points faibles des architectures de type VLA (vision-langage-action) et des politiques de diffusion utilisées pour le contrôle de bras manipulateurs et de mains robotiques. Pour les intégrateurs, cela pourrait se traduire par des politiques moins fragiles face aux séquences d'actions complexes, un enjeu central pour le déploiement en usine ou en logistique. Ce travail s'inscrit dans la lignée des politiques de diffusion pour la manipulation robotique, un courant de recherche actif depuis plusieurs années et largement adopté par les laboratoires travaillant sur les VLA génériques. L'article ne précise pas d'affiliation industrielle ni de partenaire de déploiement identifié ; il s'agit à ce stade d'une contribution académique, validée en simulation et sur un nombre limité de tâches réelles, sans indication de mise à l'échelle industrielle ou de licence commerciale annoncée.

RecherchePaper
1 source
GaussLite : cartographie robotique en temps réel par 3D Gaussian Splatting conditionnée par tâche
1670arXiv cs.RO 

GaussLite : cartographie robotique en temps réel par 3D Gaussian Splatting conditionnée par tâche

Des chercheurs présentent GaussLite, un système de cartographie 3D par Gaussian Splatting (3DGS) conditionné par la tâche, décrit dans un article publié sur arXiv (arXiv:2606.30809v1). Contrairement aux systèmes 3DGS classiques qui répartissent uniformément leur capacité de représentation sur toute une scène, GaussLite concentre le calcul embarqué sur les zones pertinentes pour une tâche donnée, exprimée en langage naturel comme "se préparer à saisir l'objet sur le bureau". Le système combine un parseur LLM en une passe pour extraire les objets cibles et de référence, un détecteur en vocabulaire ouvert pour les localiser image par image, et une segmentation produisant des masques de pertinence par pixel en temps réel. La densité de semis des gaussiennes, le flux de gradient et la mise à l'échelle sont ensuite alloués selon cette pertinence. À budget de gaussiennes équivalent et en cartographie temps réel à 4 Hz sur du matériel aux ressources limitées, GaussLite surpasse les méthodes de référence de 2,72 dB en moyenne sur le PSNR de la région d'intérêt (ROI) sur le jeu de données Replica, et de 2,23 dB lors de démonstrations sur matériel réel en intérieur et extérieur. Cette approche répond à un goulot d'étranglement concret pour la robotique embarquée : les plateformes mobiles ou manipulateurs disposent d'une puissance de calcul limitée, et gaspiller des cycles à reconstruire finement des murs ou du mobilier hors sujet pénalise directement la précision là où elle compte, sur l'objet à saisir ou l'obstacle à éviter. En priorisant explicitement la scène par la tâche plutôt que par la géométrie brute, GaussLite s'attaque à un problème récurrent des pipelines de perception pour la manipulation et la navigation autonome : l'écart entre fidélité de reconstruction globale et utilité réelle pour la décision robotique. L'équipe démontre aussi qu'il est possible de fusionner en temps réel les cartes de deux agents spécialisés sur des tâches différentes, via un vote par voxel sur le nombre d'optimisations actives, avec un gain de 3,42 dB par rapport à une simple concaténation, tout en ne partageant que 7,08% de la carte en moyenne, un résultat qui intéresse directement les scénarios multi-robots ou essaims. GaussLite s'inscrit dans la lignée des travaux récents combinant 3D Gaussian Splatting et robotique, un domaine en forte expansion depuis l'adoption de cette technique de rendu comme alternative aux NeRF pour la cartographie en temps réel. La contribution se distingue des systèmes 3DGS génériques en intégrant directement un module de compréhension du langage et de détection ouverte pour piloter l'allocation de ressources, plutôt que de traiter la sémantique comme une étape séparée en aval. Les auteurs ne précisent pas de plan de déploiement industriel ni de partenariat commercial ; il s'agit à ce stade d'un travail de recherche évalué sur Replica et sur un banc de test matériel propre à l'équipe, sans comparaison publiée face à des architectures commerciales de cartographie temps réel.

RecherchePaper
1 source
FastDSAC : améliorer la plasticité des politiques par exploration contrainte pour la locomotion humanoïde évolutive
1671arXiv cs.RO 

FastDSAC : améliorer la plasticité des politiques par exploration contrainte pour la locomotion humanoïde évolutive

FastDSAC, un nouvel algorithme d'apprentissage par renforcement développé par des chercheurs pour l'entraînement de robots humanoïdes, vient d'être présenté sur arXiv (référence 2606.31691). Cette variante rapide de l'architecture Distributional Actor-Critic cible spécifiquement les configurations d'entraînement à haut débit, où de nombreux environnements simulés tournent en parallèle pour accélérer l'apprentissage des politiques de locomotion. Le problème identifié par les auteurs est que cette vitesse a un coût : plus le volume de données et la fréquence de mise à jour augmentent, plus les méthodes basées sur la valeur deviennent instables et plus les réseaux de politique perdent leur capacité d'adaptation, un phénomène connu sous le nom de perte de plasticité. Pour y remédier, FastDSAC introduit une distribution gaussienne tronquée qui approxime la politique apprise, écartant les actions hors distribution qui faussent l'estimation de la valeur cible tout en conservant la part d'aléa nécessaire à l'exploration. Les tests ont été menés sur les bancs d'essai MuJoCo Playground et HumanoidBench, deux environnements de référence pour la locomotion robotique simulée. Sur le plan pratique, ce travail s'attaque à un vrai goulot d'étranglement du secteur : entraîner des politiques de contrôle pour robots humanoïdes reste coûteux en temps de calcul, et les architectures d'échantillonnage massif censées accélérer ce processus introduisent en pratique de l'instabilité qui annule une partie du gain. Si les résultats annoncés (convergence plus rapide, meilleure performance asymptotique) se confirment au-delà des benchmarks simulés, cela intéresserait directement les équipes de recherche qui développent des contrôleurs pour humanoïdes, en réduisant le temps et le coût de calcul nécessaires avant tout transfert vers du matériel réel. Il faut toutefois noter que l'étude reste purement académique et simulée : aucun déploiement sur robot physique n'est mentionné, et les gains restent à valider en dehors des environnements MuJoCo. FastDSAC s'inscrit dans la lignée des méthodes actor-critic distributionnelles dérivées de SAC (Soft Actor-Critic), en se distinguant des approches rapides précédentes qui s'appuyaient sur des distributions de valeur discrètes plutôt que sur une représentation gaussienne continue à variance adaptative. Les auteurs positionnent leur méthode comme une alternative aux algorithmes de référence actuels pour l'entraînement parallèle à grande échelle, sans toutefois nommer d'acteur industriel ni de plateforme robotique spécifique. La suite logique, non abordée dans l'article, serait une validation sur du matériel humanoïde réel.

RecherchePaper
1 source
Robot mobile autonome basé sur l'apprentissage par renforcement multi-objectif coordonné et guidé par échantillonnage
1672arXiv cs.RO 

Robot mobile autonome basé sur l'apprentissage par renforcement multi-objectif coordonné et guidé par échantillonnage

Des chercheurs présentent CIMORL (Coordination-Informed Multi-Objective Reinforcement Learning), un nouveau cadre d'apprentissage par renforcement multi-agents destiné aux systèmes multi-robots devant optimiser plusieurs objectifs simultanément tout en gardant un comportement coordonné. Décrit dans un article arXiv (2606.30893v1), le framework combine un mécanisme de prédiction de poids distribué, une stratégie d'entraînement par "expert privilégié" (l'agent accède à des informations globales pendant l'entraînement mais est déployé de façon totalement décentralisée) et des garanties théoriques de convergence vers des solutions Pareto-optimales. Les auteurs proposent aussi deux variantes basées sur l'échantillonnage : CIMORL-TS, qui s'appuie sur une recherche arborescente (tree search), et CIMORL-MPPI, basée sur du Model Predictive Path Integral. Les tests, menés dans des scénarios coopératifs et adversariaux, montrent une amélioration de 21,2% de l'hypervolume (une métrique standard d'évaluation multi-objectifs) et une meilleure stabilité des politiques que les méthodes de référence de l'état de l'art. Le framework a également été validé sur des drones Crazyflie réels, dans des tâches d'allocation de ressources et des scénarios multi-attaquants/multi-défenseurs en observabilité partielle. L'intérêt principal ici est méthodologique plus qu'industriel immédiat : la plupart des approches multi-agents actuelles reposent sur une coordination fixe ou centralisée, ce qui limite leur adaptabilité et viole les contraintes de déploiement distribué réel. En démontrant qu'un entraînement avec information privilégiée peut se traduire par une exécution purement décentralisée et robuste, CIMORL s'attaque à un problème central pour les flottes de robots autonomes (essaims de drones, robots logistiques en entrepôt, systèmes de défense coordonnés) où la communication entre agents est limitée ou coûteuse. Les chiffres de gain restent toutefois mesurés sur les propres baselines des auteurs, un biais classique en recherche RL qu'il convient de garder en tête avant d'extrapoler à des déploiements industriels. Le travail s'inscrit dans la lignée des recherches sur le RL multi-agents multi-objectifs, un champ qui cherche depuis plusieurs années à concilier optimisation de Pareto et contraintes de décentralisation, notamment pour la robotique en essaim. La validation sur drones Crazyflie, plateforme standard en laboratoire pour ce type d'expérimentation, reste à échelle réduite ; les prochaines étapes attendues seraient des essais sur des flottes plus nombreuses et des environnements moins contrôlés, condition nécessaire avant tout transfert vers des applications commerciales de coordination multi-robots.

RecherchePaper
1 source
IA incarnée : DVG-WM génère des vidéos découplées pour un modèle du monde efficace en manipulation robotique
1673arXiv cs.RO 

IA incarnée : DVG-WM génère des vidéos découplées pour un modèle du monde efficace en manipulation robotique

Le laboratoire à l'origine de ces travaux (non précisé dans le résumé, arXiv:2506.32028) présente DVG-WM (Disentangled Video Generation World Model), un modèle du monde vidéo destiné à la manipulation robotique. Le problème ciblé est un compromis connu dans les "world models" embodied: modéliser précisément la dynamique physique nécessite un raisonnement temporel fin image par image, alors que produire des vidéos haute résolution exige une synthèse visuelle coûteuse pilotée par la sémantique globale. Jusqu'ici, les deux étaient entremêlés dans un seul réseau, forçant un choix entre inférence rapide et prédictions grossières, ou rendu détaillé mais trop lent pour de la planification itérative. DVG-WM sépare explicitement les deux tâches: à partir d'une observation initiale et d'une instruction en langage naturel, le modèle génère d'abord une séquence d'états visuels intermédiaires prévisualisant l'interaction physique, puis les raffine en vidéos haute fidélité. Le mécanisme clé est un cascading efficace où le flow matching relie directement la dynamique aux latents vidéo, complété par un mécanisme de dégradation latente qui régénère les détails riches en contacts (préhension, collisions). Testé sur le benchmark LIBERO et sur plateformes réelles, DVG-WM améliore la qualité vidéo tout en accélérant l'inférence jusqu'à 3,97 fois. Pour l'industrie robotique, ce résultat s'attaque directement à un goulot d'étranglement connu des architectures VLA (vision-langage-action) basées sur la prédiction vidéo: la latence d'inférence, rédhibitoire pour du contrôle en boucle fermée temps réel. Un gain de facteur 4 sur la vitesse, sans sacrifier la précision des interactions de contact, rapproche ces world models vidéo d'un usage réellement embarqué plutôt que d'une simple démonstration hors ligne, un point sensible pour les intégrateurs qui évaluent la viabilité de ces approches face aux politiques d'action plus directes. Ce travail s'inscrit dans la lignée des world models vidéo pour la robotique (dans la continuité d'approches type UniPi, iVideoGPT ou GR00T-Dreams), dont la promesse est d'apprendre la physique à partir de vidéo brute plutôt que de simulateurs coûteux à construire. La contribution spécifique de DVG-WM, la désentanglement dynamique/synthèse, ouvre la voie à des variantes combinant d'autres backbones de génération vidéo ou à une extension vers des tâches multi-étapes plus longues, une direction que les auteurs identifient comme suite naturelle de ces travaux.

RecherchePaper
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
1674arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
SCREP : génération de trajectoires perceptuelles par régression de coordonnées de scène et apprentissage évidentiel
1675arXiv cs.RO 

SCREP : génération de trajectoires perceptuelles par régression de coordonnées de scène et apprentissage évidentiel

Des chercheurs ont publié sur arXiv (référence 2507.07467v3) SCREP, un planificateur de trajectoire dit "perception-aware" conçu pour les drones autonomes évoluant en intérieur sans signal GPS. Le système repose sur la régression de coordonnées de scène (SCR, ou Scene Coordinate Regression) couplée à un apprentissage évidentiel : au lieu d'effectuer une reconstruction de carte 3D par appariement de features (approche classique mais coûteuse en calcul et en stockage), le réseau prédit directement les coordonnées 3D associées à chaque pixel de l'image embarquée, ce qui permet une estimation de pose absolue en temps réel. Un optimiseur de trajectoire à horizon glissant (receding-horizon) oriente activement la caméra vers les zones de la scène présentant la plus faible incertitude de localisation. Un lisseur à retard fixe (fixed-lag smoother) fusionne ensuite les estimations de pose SCR, de basse fréquence, avec les données IMU haute fréquence pour produire une estimation de pose continue et de haute qualité. En simulation, SCREP réduit l'erreur quadratique moyenne (RMSE) de translation d'au moins 4,9 % et celle de rotation d'au moins 30,8 % par rapport aux méthodes de référence. Des expériences hardware-in-the-loop valident la faisabilité dans des conditions proches du déploiement réel. L'intérêt industriel de cette approche tient à deux tensions classiques dans la navigation autonome en intérieur : la scalabilité des cartes de localisation visuelle et le coût de calcul embarqué. Les méthodes par appariement de features (comme celles utilisées dans ORB-SLAM ou HLoc) imposent une reconstruction préalable de la carte et souffrent d'une explosion mémoire dans les grands environnements entrepôts ou industriels. La SCR résout ce problème par un réseau compact appris offline, directement exploitable onboard sur un calculateur de drone. L'apport d'SCREP va plus loin : en intégrant l'incertitude estimée dans la boucle de planification de trajectoire, le système évite activement les zones visuellement ambiguës plutôt que de subir leur dégradation localement. C'est un changement de paradigme notable par rapport aux planificateurs classiques qui traitent la localisation comme une boîte noire externe. Pour un intégrateur ou un décideur industriel déployant des drones d'inspection ou d'inventaire, cela réduit le risque de dérive de pose dans les couloirs peu texturés ou les allées sombres. La navigation en environnement GPS-denied est un verrou technique persistant pour les drones d'intérieur autonomes, avec une communauté de recherche active depuis une décennie autour de VIO (Visual-Inertial Odometry), SLAM et, plus récemment, des méthodes apprises comme NeRF ou les champs de scène implicites. La SCR elle-même est une alternative proposée initialement par la communauté relocalisation visuelle (travaux pionniers Microsoft Research, DSAC++), mais son application dans une boucle de planification proactive reste peu explorée. SCREP se positionne comme une contribution de recherche académique, présentée sous forme de preprint arXiv sans affiliation industrielle identifiée ni annonce de déploiement commercial. Les résultats hardware-in-the-loop sont encourageants mais ne constituent pas une validation terrain à grande échelle. Les concurrents directs incluent les approches VIO+planification certifiée (ETH Zurich, MIT CSAIL), ainsi que des acteurs industriels comme Skydio ou Exotec pour la navigation autonome en entrepôt. Les prochaines étapes attendues seraient une évaluation sur des environnements réels de grande dimension et une comparaison avec des champs de scène neuraux récents comme l'iNeRF ou les Gaussian Splats.

UEImpact indirect sur Exotec (France) et autres opérateurs européens de drones d'entrepôt : si l'approche SCR+planification proactive se confirme à l'échelle terrain, elle pourrait réduire le coût des cartes de localisation visuelle dans les grands entrepôts logistiques européens.

RecherchePaper
1 source
HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive
1676arXiv cs.RO 

HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive

Des chercheurs ont publié sur arXiv (arXiv:2606.30404, juin 2026) un système baptisé HUMEMBR, Human-Centered Memory for Embodied Robots, conçu pour permettre à un robot incarné de modéliser, mémoriser et exploiter les routines comportementales des individus qu'il côtoie. Le système répond à des requêtes telles que « où se trouve probablement cette personne en ce moment » ou « à quelle heure quitte-t-elle habituellement le bâtiment », en s'appuyant sur un historique d'observations accumulé sur le long terme. HUMEMBR couple une construction mémoire continue à un mécanisme de récupération et d'interrogation parallèle, produisant des représentations structurées des routines humaines interrogeables à la demande. Le système a été validé sur un robot physique déployé dans deux environnements distincts, sans que le papier précise le modèle de plateforme, le nombre de DOF ni les conditions exactes des essais terrain. L'intérêt principal de HUMEMBR réside dans son efficacité computationnelle par rapport aux approches naïves à base de LLM en plein contexte : les auteurs rapportent de meilleures performances sur le raisonnement à long horizon tout en consommant significativement moins de tokens. Pour les intégrateurs de robots de service ou les déployeurs en environnement tertiaire (hôpitaux, entrepôts, bureaux), cela ouvre la voie à des robots capables d'anticiper la position d'un opérateur sans requête GPS ni tag actif, en inférant simplement depuis des patterns observés. C'est un pas vers la résolution du « routine gap », la difficulté à faire raisonner un robot sur des comportements récurrents et non étiquetés, au-delà de la navigation réactive classique. La navigation incarnée guidée par le langage (VLA, NavLLM) est un champ très actif depuis 2023, avec des travaux comme NavGPT, SayNav ou EmbodiedGPT qui explorent l'usage des LLMs comme planificateurs de trajectoire. HUMEMBR se différencie en ciblant explicitement la modélisation comportementale humaine sur la durée, plutôt que la seule compréhension d'instructions à la volée. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné dans l'abstract, il s'agit d'une contribution académique, pas d'un produit annoncé. Les prochaines étapes naturelles seraient de tester la robustesse face à des changements de routine imprévus et de quantifier les performances sur des métriques standardisées comme HM3D ou R2R.

RecherchePaper
1 source
RetrDex : récupération efficace d'objets dans des environnements encombrés avec une main dextérique
1677arXiv cs.RO 

RetrDex : récupération efficace d'objets dans des environnements encombrés avec une main dextérique

RetrDex est un framework de recherche publié sur arXiv (référence 2502.18423, troisième révision) dont l'objectif est d'apprendre à un système bras-main dextre à récupérer des objets enfouis sous un empilement d'autres objets. L'approche repose sur du reinforcement learning (RL) parallèle à grande échelle conduit en simulation, couplé à une représentation spatiale qui encode les patterns d'occlusion ainsi que les relations géométriques entre la cible, la main multi-doigts et les objets alentour. La politique résultante développe un répertoire de gestes, poussée, agitation et piquage (poking), pour dégager activement les obstacles avant ou pendant la saisie. Évalué sur 16 objets ménagers courants dans des configurations variées, le système affiche de bonnes performances sur des cibles vues en entraînement comme sur des cibles inédites. Un transfert zero-shot vers un robot réel multi-doigts est revendiqué, sans fine-tuning supplémentaire. La récupération d'objets en scène encombrée est un problème ouvert en manipulation robotique : les approches classiques décomposent la tâche en étapes séquentielles indépendantes (retirer les objets qui gênent un par un, puis saisir), ce qui génère des séquences longues et peu robustes aux variations. RetrDex intègre ces interactions physiques directement dans la politique de récupération, réduisant potentiellement le nombre de mouvements nécessaires. La revendication la plus notable reste le zero-shot sim-to-real sur une main dextre : ce type de transfert est notoirement difficile à cause de la complexité des contacts multi-doigts et du gap dynamique entre simulation et réalité physique. Si les résultats tiennent à l'examen approfondi, cela renforce la thèse que le RL massivement parallèle en simulation peut généraliser sur du matériel réel pour des tâches de manipulation en espace contraint, sans données réelles supplémentaires. Le papier s'inscrit dans une tendance forte : utiliser le RL en simulation à très grande échelle pour entraîner des politiques de manipulation dextre, une direction explorée par des équipes de Berkeley (DexGraspNet), Stanford et, côté industriel, par des acteurs comme Unitree ou Agility Robotics sur leurs propres mains multi-doigts. Les méthodes concurrentes récentes, graphes de relations de support ou planification séquentielle avec contraintes géométriques, adoptent des stratégies que RetrDex cherche à dépasser en termes d'efficacité. Soumis initialement en février 2025 et révisé jusqu'en 2026, le travail n'annonce pas de code open-source dans son résumé, ce qui limite les possibilités de réplication à court terme. Les suites naturelles seraient des tests sur objets déformables, une extension à des charges utiles plus importantes et une intégration dans une chaîne logistique ou un poste d'assemblage industriel réel.

RecherchePaper
1 source
Optimisation de trajectoire sans collision pour la fabrication additive multi-axes par projection de gradient contraint
1678arXiv cs.RO 

Optimisation de trajectoire sans collision pour la fabrication additive multi-axes par projection de gradient contraint

Une équipe de recherche vient de publier sur arXiv (2606.29766) un cadre de calcul pour optimiser les trajectoires de bras robotisés redondants utilisés en fabrication additive multi-axes (MAAM). Le système a été validé sur une plateforme à 8 degrés de liberté (DOF), exécutant des chemins d'outils longs, sans structure de support et conformes à la géométrie des pièces. Les résultats annoncés sont précis : erreur moyenne de position de la buse inférieure à 10 micromètres, réduction du jerk articulaire maximal jusqu'à 77,6 %, élimination de toutes les violations de collision et d'orientation détectées lors des tests. Par rapport à la méthode de référence SQP (programmation quadratique séquentielle), le gain de vitesse de convergence atteint 10,2x. Des impressions physiques de géométries complexes ont été réalisées, avec moins d'artefacts de dépôt visibles. L'intérêt technique réside dans la combinaison de deux contraintes difficiles à réconcilier dans la MAAM : maintenir la position exacte de la buse (contrainte d'égalité stricte au niveau de chaque waypoint) tout en évitant les collisions avec une pièce dont la géométrie évolue au fil du dépôt. Les auteurs formulent la cinématique relative buse-pièce via un Jacobien relatif, et modélisent les collisions avec une SDF (signed distance function) différentiable, ce qui permet de propager les gradients d'optimisation même lorsque la géométrie de fabrication change. La projection itérative sur la variété de self-motion du robot permet de respecter les contraintes de position sans compromettre l'évitement de collision. Pour un intégrateur ou un décideur industriel, c'est une avancée concrète : la MAAM redondante devient planifiable de manière robuste sur des trajectoires longues, ce qui ouvre la voie à des pièces aérospatiales ou médicales sans support imprimées directement sur robot 6+ axes. La fabrication additive multi-axes robotisée reste un domaine de niche, dominé par des travaux académiques issus de groupes en Europe, Asie et Amérique du Nord, sans acteur commercial dominant à ce jour. Les approches classiques d'optimisation (SQP, méthodes à points intérieurs) souffrent de temps de calcul prohibitifs sur des chemins longs, ce qui a freiné l'industrialisation. Ce travail s'inscrit dans une tendance plus large qui combine planification de mouvement différentiable et représentations géométriques implicites, une direction que partagent aussi des groupes travaillant sur la soudure robotisée et l'impression béton. L'article est un preprint non encore évalué par les pairs, et les conditions exactes des essais physiques (matériau, géométries testées, répétabilité sur série) mériteraient d'être détaillées avant toute adoption industrielle.

UERésultats potentiellement exploitables par les laboratoires européens actifs en fabrication additive multi-axes robotisée, sans impact identifié sur des acteurs industriels français à ce stade.

RecherchePaper
1 source
SPACE : champs de phéromones pour l'exploration adaptative d'essaims sans collision
1679arXiv cs.RO 

SPACE : champs de phéromones pour l'exploration adaptative d'essaims sans collision

Des chercheurs ont présenté SPACE (Swarm Pheromone Fields for Adaptive Collision-Aware Exploration), un algorithme de coordination décentralisée pour essaims robotiques à grande échelle, publié en juin 2026 sur arXiv. Inspiré des phéromones de fourmis, le système guide des groupes allant jusqu'à 256 robots dans des environnements intérieurs inconnus via un champ environnemental partagé à trois couches : phéromones attractives vers les zones frontières inexplorées, phéromones répulsives marquant les zones déjà visitées, et champ de densité robotique calculé en temps réel. Les évaluations portent sur des données de bâtiments réels : seize plans de maisons issus du dataset HouseExpo et huit étages de campus du dataset KTH de Stockholm. Résultat central : SPACE réduit les contacts inter-robots de 4 à 17 fois par rapport à un planificateur glouton de type nearest-frontier classique, tout en maintenant le temps de couverture à moins de 2 % du planificateur quasi-optimal en temps. Le résultat le plus instructif n'est pas la performance brute, mais la conclusion qui l'accompagne : à grande échelle, la coordination améliore avant tout la sécurité, pas la vitesse d'exploration. Ce constat remet en question l'hypothèse répandue selon laquelle ajouter des robots accélère proportionnellement la couverture. Au-delà d'un certain seuil, les goulets d'étranglement, couloirs, portes, créent de la congestion, et chaque robot supplémentaire génère davantage de risques de collision qu'il n'apporte de gain de vitesse. SPACE se positionne sur la frontière de Pareto empirique : meilleure sécurité à chaque taille d'essaim congestionnée, sans sacrifier significativement la rapidité. Pour les intégrateurs de flottes AMR (robots mobiles autonomes) en entrepôt ou en logistique, ce travail fournit une base algorithmique solide pour arbitrer entre densité de déploiement et sécurité opérationnelle lors du passage à l'échelle industrielle. La navigation en essaim s'appuie sur la stigmergie, principe emprunté à l'entomologie : les individus se coordonnent non par communication directe, mais en modifiant un environnement partagé. Les approches nearest-frontier classiques sont efficaces pour de petits groupes mais génèrent des embouteillages à haute densité. Face aux méthodes centralisées, coûteuses en calcul à 256 unités, et aux systèmes à communication directe, fragiles sans réseau fiable, SPACE reste purement décentralisé via le champ partagé. Ce préprint arXiv n'a pas encore été évalué par les pairs et les expériences sont conduites en simulation sur floorplans réels : une validation sur robots physiques reste à établir. Les suites logiques incluent des tests sur hardware réel et l'intégration dans des middlewares standards comme ROS 2.

UELes intégrateurs européens de flottes AMR en logistique pourraient exploiter cette base algorithmique pour arbitrer densité de déploiement et sécurité à l'échelle, mais aucun acteur ou institution européen n'est directement impliqué dans ces travaux.

RecherchePaper
1 source
Apprentissage résiduel multi-échelle et adaptation en ligne pour manipulateurs aériens
1680arXiv cs.RO 

Apprentissage résiduel multi-échelle et adaptation en ligne pour manipulateurs aériens

Des chercheurs présentent, dans un preprint arXiv (2603.11638v2, juin 2026), un cadre de modélisation adaptative en temps réel pour les manipulateurs aériens autonomes (AAMs), c'est-à-dire des drones équipés de bras robotiques destinés à l'inspection, la saisie ou l'assemblage en environnements difficiles d'accès. L'architecture repose sur deux modules : le Factorized Dynamics Transformer (FDT), qui traite chaque variable physique comme un token indépendant et sépare explicitement les effets inertiels à court terme des effets aérodynamiques à long horizon, et le Latent Residual Adapter (LRA), qui adapte les résidus de dynamique en temps réel dans l'espace latent via les Moindres Carrés Récursifs (RLS). Les expériences en conditions réelles, avec des charges utiles inédites non vues à l'entraînement, montrent une meilleure fidélité de prédiction, une atténuation des perturbations plus rapide et une précision de suivi en boucle fermée supérieure aux baselines de l'état de l'art, tout en respectant la contrainte temps réel. Ce travail adresse un verrou central de la manipulation aérienne : la dynamique d'un AAM change brutalement lors de la reconfiguration du bras ou d'une variation de charge, ce que ni les modèles analytiques à paramètres fixes ni les modèles ML statiques ne gèrent correctement. En factorisant explicitement les couplages inter-variables et en adaptant les résidus sans ré-entraînement complet, le framework réduit le coût computationnel tout en préservant la représentation non-linéaire apprise hors-ligne. Pour les intégrateurs industriels, c'est un signal que le gap sim-to-real des AAMs peut être partiellement comblé par adaptation en ligne, évitant des cycles coûteux de re-collecte de données sur site. Les AAMs font l'objet de recherches actives depuis le milieu des années 2010, avec des débouchés visés dans l'inspection d'infrastructures électriques, la construction et la logistique verticale. Les approches concurrentes misent sur le MPC robuste ou les réseaux récurrents pour la compensation de dynamiques résiduelles. Ce preprint n'est pas encore évalué par les pairs, et les résultats constituent des validations en laboratoire sur charges limitées, pas un déploiement industriel. Les prochaines étapes naturelles incluent des tests sur des configurations de bras plus complexes, des amplitudes de payload plus importantes, et une validation sur sites opérationnels réels.

RecherchePaper
1 source
AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés
1681arXiv cs.RO 

AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés

Des chercheurs ont publié sur arXiv (référence 2603.15097) AeroGrab, un pipeline intégré pour la saisie aérienne en environnements encombrés. Le système prend en entrée une scène et une instruction en langage naturel, identifie l'objet cible, puis pilote un drone pour l'explorer activement afin d'obtenir de meilleures perspectives. Durant cette exploration, un réseau de génération de prises prédit plusieurs candidats de saisie à 6 degrés de liberté (6-DOF) par point de vue. Chaque candidat est évalué par un module de faisabilité tenant compte des collisions potentielles ; la meilleure prise globale est sélectionnée et exécutée via des méthodes standard de génération de trajectoire. Des expériences en conditions réelles encombrées démontrent une exécution robuste des saisies dans des scénarios non contrôlés. L'apport principal réside dans l'intégration d'éléments jusqu'ici traités séparément : spécification de tâche par langage naturel, exploration active et sélection de prise tenant compte des collisions. Les pipelines de manipulation aérienne existants s'appuient généralement sur une saisie centroïde, approximation grossière qui échoue dès qu'un objet est partiellement occlus ou que l'environnement est dense. L'absence d'un système de bout en bout complet constituait un frein au déploiement opérationnel des drones manipulateurs, notamment en logistique, maintenance d'infrastructure ou intervention en zone difficile d'accès. AeroGrab représente une étape vers la fermeture du gap démo-terrain, sans que les métriques de robustesse soient détaillées dans l'abstract. La manipulation aérienne est un champ de recherche actif, porté notamment par l'ETH Zurich, l'Université de Naples Federico II ou le LAAS-CNRS côté français, qui explore depuis plusieurs années les drones à bras articulés. La tendance est à l'intégration de modèles vision-langage (VLA) dans la boucle de contrôle, pour passer d'une programmation par coordonnées à une spécification sémantique. Les verrous industriels restent importants : robustesse aux perturbations dynamiques, charge utile réduite et certification réglementaire pour les vols en espace intérieur. La publication sur arXiv indique un stade de recherche ; aucun déploiement commercial ni partenariat industriel n'est annoncé.

UELe LAAS-CNRS, laboratoire français reconnu dans la manipulation aérienne, évolue dans le même écosystème de recherche qu'AeroGrab, mais aucune implication directe d'institutions européennes n'est rapportée dans ce travail.

RecherchePaper
1 source
PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste
1682arXiv cs.RO 

PA-BiCoop : un cadre coopératif principal-auxiliaire pour la manipulation bimanuelle généraliste

Des chercheurs ont publié le 29 juin 2026 sur arXiv (arXiv:2606.28192) PA-BiCoop, un framework de manipulation bimanualle à modèle unique reposant sur une différenciation dynamique des rôles "primaire-auxiliaire". L'architecture déploie un encodeur de caractéristiques global partagé alimentant deux décodeurs spécialisés : le décodeur primaire génère la pose du bras principal en coordonnées absolues ainsi que des heatmaps d'affordance pour la tâche centrale, tandis que le décodeur auxiliaire produit la pose relative du bras de support dans le repère du bras primaire. Un module d'assignation dynamique des rôles détermine automatiquement quel bras (gauche ou droit) prend la position primaire ou auxiliaire à chaque étape de la tâche, sans pré-définition manuelle. Les benchmarks rapportés indiquent une progression de 48 % en moyenne sur les tâches de simulation RLBench2 par rapport aux meilleures baselines existantes, et de plus de 50 % sur des tâches en environnement réel. Ces résultats, s'ils se confirment à l'échelle, adressent un verrou bien identifié dans la manipulation bimanualle : la quasi-totalité des approches actuelles traitent les deux bras comme des agents symétriques et interchangeables, ce qui force des synchronisations coûteuses et empêche l'émergence d'une division du travail naturelle. L'asymétrie primaire-auxiliaire est au contraire la norme dans la manipulation humaine, que ce soit pour visser un couvercle, positionner une pièce ou assembler un connecteur. Un gain de 50 % sur des tâches réelles est une affirmation forte : les benchmarks RLBench2 sont réputés pour permettre des optimisations d'artefacts de simulation, et les auteurs ne précisent pas le nombre de tâches réelles testées ni les conditions d'évaluation, deux points qui mériteront une vérification indépendante avant toute intégration industrielle. La manipulation bimanualle mobilise actuellement plusieurs équipes de premier plan : Physical Intelligence (pi) avec Pi-0, Figure AI avec le modèle embarqué sur Figure 02 et 03, et les équipes de recherche de Boston Dynamics, Toyota Research Institute et NVIDIA (GR00T N2) travaillent toutes sur des politiques bimanuelles généralisables. PA-BiCoop se distingue par son approche à modèle unique, là où des concurrents recourent à des architectures hiérarchiques séparées ou à du reinforcement learning multi-agent. Il s'agit pour l'instant d'une publication de recherche sans déploiement annoncé, ni code public ni partenaire industriel identifié ; la prochaine étape logique serait une validation sur des manipulateurs commerciaux type Franka, UR ou Kinova dans un contexte de production réelle.

IA physiquePaper
1 source
DexCompose : réutiliser des politiques dextériques pour la manipulation multi-tâche avec une seule main
1683arXiv cs.RO 

DexCompose : réutiliser des politiques dextériques pour la manipulation multi-tâche avec une seule main

DexCompose est un framework de composition de politiques robotiques présenté dans une prépublication arXiv (identifiant 2606.28323) en juin 2026. Son objectif : permettre à une main robotique dextère d'enchaîner plusieurs tâches sans réentraîner les politiques existantes depuis zéro. Le système atteint un taux de succès composite moyen de 77,4 % sur 16 tâches combinées, construites en croisant quatre compétences de rétention d'objet avec quatre interactions aval. L'ensemble de l'évaluation est conduit en simulation ; aucune validation sur hardware réel n'est présentée dans ce papier. Le problème central que DexCompose attaque est celui de l'interférence destructive entre politiques : lorsqu'une main doit simultanément maintenir une prise (tâche 1) et exécuter une nouvelle action (tâche 2), les deux politiques se disputent le contrôle des mêmes doigts, avec des conflits de modes de contact qui dégradent les deux. La réponse proposée est une notion de propriété d'action au niveau du doigt (finger-level action ownership) : le système identifie d'abord quels doigts sont nécessaires au maintien du résultat de la première compétence via des tests de relâche sur des masques candidats, puis entraîne deux modules résiduels asymétriques. Un stabilisateur résiduel borné préserve la tâche en cours ; un résiduel contextuel n'adapte la politique aval que dans le sous-espace d'action assigné à la nouvelle tâche. Pour les ingénieurs en manipulation, cela réduit potentiellement le coût de réentraînement à chaque nouvelle combinaison de tâches, sans toucher aux politiques de base préentraînées. La manipulation dextère multi-tâches avec une seule main est un problème ouvert depuis des années, les approches classiques de chaînage de politiques (policy chaining) échouant précisément sur ces conflits de contact. Des groupes chez Stanford, CMU ou Google DeepMind travaillent sur des architectures voisines, et des mains commerciales comme la Shadow Hand ou l'Allegro Hand constituent les bancs de test habituels du domaine. DexCompose se positionne comme une alternative structurée au fine-tuning complet ou aux hiérarchies de contrôleurs. Le gap sim-to-real sur la manipulation dextère reste cependant le défi non résolu de la discipline, et ce papier, encore en prépublication, n'y répond pas : une validation physique sur hardware réel constituerait l'étape déterminante avant toute considération industrielle.

RecherchePaper
1 source
Apprendre à lancer : livraison agile et précise de charge utile suspendue par câble avec un quadrirotor
1684arXiv cs.RO 

Apprendre à lancer : livraison agile et précise de charge utile suspendue par câble avec un quadrirotor

Des chercheurs présentent dans un preprint arXiv (2606.27603) une méthode permettant à un quadrirotor de lancer avec précision des charges utiles suspendues par câble vers des cibles prédéfinies, une capacité critique pour la livraison médicale d'urgence et les missions de recherche et sauvetage. La solution repose sur un environnement de simulation hybride : un modèle analytique haute-fidélité du quadrirotor est couplé à un solveur physique dédié aux interactions corde-charge, les forces étant échangées entre les deux domaines à chaque pas de temps. Une politique de contrôle est ensuite entraînée par apprentissage par renforcement profond (deep RL) dans cet environnement. Déployée sans adaptation sur matériel réel (zero-shot), elle réduit l'erreur d'atterrissage jusqu'à 50 % et la durée du lancer jusqu'à 30 % par rapport à la référence model-based. Une variante utilisant uniquement des observations visuelles, sans estimateur d'état explicite, atteint une précision comparable à la politique basée sur l'état. Le simulateur sera mis en open source à l'acceptation de l'article. Le verrou technique adressé est la modélisation du relâché dynamique, la phase de libération agressive d'une charge en fin de vol, jusqu'ici largement ignorée au profit des phases de transport et de traversée. Les approches model-based classiques (optimisation de trajectoire, commande prédictive MPC) se heurtent à la difficulté de modéliser analytiquement les cordes flexibles, ce qui impose des contraintes de faisabilité conservatrices et dégrade l'agilité effective du système. La contribution clé est de démontrer qu'un simulateur hybride bien couplé suffit à fermer le gap sim-to-real pour des dynamiques aussi non-linéaires : le transfert zero-shot tient sur matériel réel sans fine-tuning. C'est un argument concret pour les équipes de livraison par drone qui envisagent de remplacer leur pipeline de contrôle analytique par des politiques apprises, en particulier dans des contextes où la rapidité de livraison est contrainte. Le transport de charges suspendues par drone est un sujet de recherche actif depuis plus d'une décennie, mais les travaux existants se concentraient sur la stabilisation et la planification de trajectoires, pas sur la balistique du relâché. Cette publication s'inscrit dans une vague plus large de politiques RL pour la manipulation aérienne agile, parallèle aux recherches sur le vol acrobatique menées notamment à l'ETH Zurich et à Carnegie Mellon. Aucun partenaire industriel ni acteur français ou européen n'est mentionné dans le preprint. Les prochaines étapes annoncées se limitent à la mise en open source du simulateur, qui pourrait abaisser la barrière d'entrée pour la communauté travaillant sur la manipulation aérienne dynamique. Les applications visées, livraison médicale et missions SAR, restent au stade de la démonstration académique : aucun déploiement opérationnel n'est annoncé à ce stade.

RecherchePaper
1 source
VibeAct : la vibration comme signal pour la dextérité réactive des robots en contact
1685arXiv cs.RO 

VibeAct : la vibration comme signal pour la dextérité réactive des robots en contact

Des chercheurs ont présenté VibeAct, un cadre de manipulation dextère publié sur arXiv en juin 2026, qui intègre des microphones piézoélectriques miniatures dans les doigts d'une main robotique pour détecter les événements de contact et de glissement. La méthode repose sur trois étapes : collecter des données vibro-acoustiques par téléopération, rejouer ces enregistrements dans un jumeau numérique calibré pour étiqueter automatiquement le contact et l'amplitude de glissement par doigt, puis entraîner un estimateur tactile sur les signaux microphone réels. En parallèle, les politiques de manipulation sont entraînées en simulation sur cette même représentation abstraite, et non sur l'audio brut. Le système a été évalué sur cinq tâches riches en contact : re-saisie, réorientation en main et insertion. L'enjeu central est le fossé simulation-réalité qui frappe la manipulation dextère : les événements de contact sont rapides, locaux et souvent masqués visuellement, ce qui rend leur simulation acoustique fidèle quasiment impossible. En découplant l'estimateur tactile, entraîné sur des données réelles, de la politique de contrôle, entraînée en simulation sur la représentation abstraite, le cadre contourne ce verrou sans avoir à modéliser l'audio. Le canal de glissement continu s'avère l'observation la plus informative pour le contrôle réactif soutenu. Sur les cinq tâches, VibeAct surpasse une baseline proprioception et nuage de points, avec les gains les plus nets sur les tâches nécessitant un ajustement continu de la prise. Les politiques apprises se transfèrent à une plateforme physique bras-main dextère, avec une amélioration mesurable des taux de succès. Ce travail s'inscrit dans une compétition dense entre modalités tactiles. Les capteurs à base de caméra comme GelSight ou DIGIT, développé par Meta, offrent une richesse spatiale supérieure mais restent encombrants et coûteux ; les microphones piézoélectriques sont compacts, bon marché et à haute bande passante, mais leur signal est difficile à simuler, d'où l'intérêt du découplage proposé. D'autres travaux exploitent la randomisation de domaine ou des simulations acoustiques approximatives pour tenter de franchir ce seuil. Aucun partenaire industriel ni déploiement commercial n'est annoncé : il s'agit à ce stade de recherche académique. Les prochaines étapes naturelles concernent la généralisation à des objets hors distribution et l'extension à des mains avec davantage de degrés de liberté.

RecherchePaper
1 source
PressMimic : capture et contrôle de mouvement guidés par pression pour l'imitation par robot humanoïde
1686arXiv cs.RO 

PressMimic : capture et contrôle de mouvement guidés par pression pour l'imitation par robot humanoïde

Des chercheurs ont publié le 26 juin 2026 sur arXiv (2606.26741) un framework baptisé PressMimic, conçu pour améliorer l'imitation de mouvements humains par les robots humanoïdes en intégrant la pression plantaire comme modalité de perception et de contrôle. Le pipeline combine trois briques : FRAPPE++, un modèle multimodal fusionnant RGB et données de pression pour estimer la pose 3D et la trajectoire globale d'un humain ; une politique d'apprentissage par renforcement supervisée par pression (PSP, Pressure-Supervised Policy) pour la reproduction sur le robot ; et MotionPRO, un jeu de données à grande échelle avec captures RGB, pression et motion capture synchronisées. Les résultats expérimentaux montrent des gains sur l'estimation de mouvement, la cohérence de trajectoire et la stabilité d'exécution, sans que les chiffres précis ne soient détaillés dans l'abstract, ils figurent dans l'article complet. Ce travail s'attaque à un problème concret et bien documenté en robotique humanoïde : les pipelines actuels reposant uniquement sur la vision produisent des artefacts physiquement incohérents, glissement des pieds, pénétration du sol, comportements instables à l'appui. En introduisant la pression comme signal d'ancrage physique (physical grounding), PressMimic impose des contraintes de contact explicites à la fois en perception et en contrôle, ce qui réduit l'ambiguïté inhérente à la seule estimation visuelle. Pour les équipes travaillant sur le sim-to-real et sur les politiques de locomotion, c'est un argument en faveur d'architectures multimodales intégrant des capteurs de force ou de pression dès la capture de données, pas seulement à l'exécution. L'imitation de mouvement humanoïde est un champ très actif : Boston Dynamics, Figure AI, Agility Robotics et des laboratoires académiques comme Stanford et CMU explorent des approches VLA (Vision-Language-Action) et RL pour la manipulation et la locomotion. PressMimic se distingue en ciblant explicitement la cohérence des contacts plutôt que la précision gestuelle seule, un angle complémentaire aux travaux sur les politiques diffuses (Pi-0 de Physical Intelligence) ou les politiques génératives. Il reste à ce stade une contribution de recherche académique sans déploiement industriel annoncé ; la publication du dataset MotionPRO pourrait néanmoins accélérer la reproductibilité et l'adoption par d'autres équipes.

HumanoïdesPaper
1 source
Suivi de l'essor de l'IHR sociale-physique (spHRI) : revue systématique augmentée par de petits modèles de langage
1687arXiv cs.RO 

Suivi de l'essor de l'IHR sociale-physique (spHRI) : revue systématique augmentée par de petits modèles de langage

Des chercheurs ont publié sur arXiv (2606.26382) une étude méthodologique sur l'utilisation de petits modèles de langage (SLMs, moins de 1,5 milliard de paramètres) pour accélérer les revues systématiques dans le domaine de l'interaction humain-robot sociale et physique (spHRI). L'équipe a évalué la capacité de ces modèles à effectuer le tri préliminaire de titres et de résumés dans le cadre d'une large revue de littérature spHRI. Aucun SLM testé individuellement n'a atteint le niveau de performance des relecteurs humains. En revanche, un ensemble de SLMs combinés a identifié 39 articles que les experts avaient manqués, soit 10,29 % du corpus final de documents pertinents. Ces modèles ont effectué le tri à une vitesse plusieurs ordres de grandeur supérieure à celle des relecteurs humains, en fonctionnant intégralement en local sur les machines des chercheurs. Le résultat clé est que les SLMs peuvent augmenter le travail des experts sans les remplacer. Dans un domaine comme la spHRI, qui recupe la robotique, l'interaction humain-ordinateur et l'haptique, la terminologie est fragmentée et les méthodologies inconsistantes, ce qui rend toute synthèse systématique difficile. Utiliser un ensemble de SLMs comme filet de sécurité permet de récupérer environ 10 % des articles pertinents qu'une révision humaine seule aurait manqués. Le déploiement local de ces modèles, contrairement aux APIs cloud, préserve la confidentialité des données de recherche, élimine les coûts d'inférence et rend les revues systématiques à grande échelle accessibles pour des équipes académiques aux ressources limitées. Cette étude s'inscrit dans une tendance plus large d'utilisation des LLMs pour accélérer la recherche scientifique, notamment pour le screening bibliographique, tâche chronophage et répétitive. Le choix délibéré de modèles inférieurs à 1,5B paramètres contraste avec le recours à des APIs comme GPT-4 ou Claude, qui offrent de meilleures performances individuelles mais imposent coûts et dépendances cloud. Les résultats valident un pipeline hybride humain + SLM local: les modèles effectuent un premier tri rapide, les experts valident. Pour les laboratoires gérant des revues de plusieurs milliers de papiers, ce type de pipeline pourrait réduire significativement la charge de travail sans sacrifier la rigueur méthodologique, et ouvrir la voie à des revues systématiques continues plutôt qu'épisodiques.

RecherchePaper
1 source
Estimateur de pose inter-robot à 4 DoF en forme fermée par mesures angulaires seules
1688arXiv cs.RO 

Estimateur de pose inter-robot à 4 DoF en forme fermée par mesures angulaires seules

Des chercheurs ont publié sur arXiv (identifiant 2606.26616) un estimateur analytique de pose inter-robot à 4 degrés de liberté (4-DOF) reposant exclusivement sur des mesures de relèvement (bearing-only), sans infrastructure externe ni GPS. La méthode fusionne l'angle d'observation entre robots pairs et les données d'odométrie embarquée pour estimer les positions relatives en temps réel. Contrairement aux approches 6-DOF existantes, l'estimateur résout le problème en forme fermée, supprimant toute optimisation itérative coûteuse en calcul. L'article identifie deux configurations critiques pour l'observabilité du système : les formations colinéaires (robots alignés sur un même axe) et les formations à forme préservée (déplacement en bloc rigide). Pour y répondre, un module de test d'observabilité autonome détermine dynamiquement l'instant optimal d'estimation, remplaçant la fenêtre glissante de longueur fixe utilisée classiquement. Ce travail intéresse directement les équipes déployant des flottes d'AMR, des essaims de drones et tout système multi-robot opérant en milieu GNSS-dégradé (entrepôts, souterrains, zones urbaines denses). La solution analytique réduit significativement le coût de calcul, la rendant déployable sur des plateformes embarquées à ressources limitées. Le choix du 4-DOF plutôt que 6 est délibéré : dans la plupart des contextes industriels au sol, les deux degrés résiduels sont mécaniquement contraints, et relâcher ces contraintes améliore la robustesse sans perte pratique de précision. Simulations et expériences réelles confirment que la méthode surpasse les approches concurrentes en précision tout en réduisant l'intervalle de collecte de données nécessaire à l'estimation. La localisation coopérative sans infrastructure est un axe de recherche actif depuis une décennie, porté par les limites du SLAM centralisé et l'essor des flottes autonomes. Les approches bearing-only précédentes souffraient systématiquement de la dégénérescence d'observabilité sous certains schémas de mouvement, rendant les estimations instables dans des configurations pourtant courantes. L'approche 4-DOF proposée réduit les exigences d'excitation du mouvement nécessaires à l'observabilité, élargissant ainsi l'enveloppe opérationnelle effective. À noter : les auteurs ne mentionnent ni partenaire industriel ni déploiement commercial, il s'agit d'une contribution académique préprint, pas d'un produit livré. Les extensions naturelles incluent le passage au 6-DOF complet pour les robots aériens, et l'intégration dans des middlewares standards comme ROS 2.

UEImpact indirect pour les équipes R&D européennes déployant des flottes d'AMR en environnements GNSS-dégradés (entrepôts, usines), mais aucune institution ou entreprise française/européenne impliquée dans ce preprint.

RecherchePaper
1 source
Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D
1689arXiv cs.RO 

Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D

Des chercheurs ont publié sur arXiv (arXiv:2606.26048v1) un framework de contrôle hybride baptisé RL-ET-DeePC, combinant apprentissage par renforcement (RL) sans modèle et contrôle prédictif basé sur les données (DeePC) avec déclenchement événementiel, appliqué à un bras souple câblé à trois dimensions. L'approche repose sur une politique RL entraînée à décider dynamiquement quand activer le solveur d'optimisation DeePC, plutôt que de le lancer à chaque pas d'échantillonnage comme le fait le DeePC périodique classique. En simulation, le framework réduit la fréquence d'appel au solveur jusqu'à 66 % sans dégradation mesurable de la précision de suivi de trajectoire. Sur le banc physique, le transfert s'effectue en zero-shot, c'est-à-dire sans réentraînement ni adaptation, avec une réduction de 34 % des appels d'optimisation, une précision de suivi comparable au DeePC périodique, et des performances plus régulières qu'un déclenchement événementiel à seuil statique. L'enjeu est directement industriel : le DeePC standard, qui évite la modélisation explicite en exploitant les trajectoires entrée-sortie mesurées, bute sur le coût computationnel de son optimisation en horizon glissant à chaque cycle. Sur des plateformes embarquées à ressources limitées, ce verrou bloque le déploiement temps réel. En déléguant la décision de déclenchement à une politique RL légère, RL-ET-DeePC rend le contrôle prédictif viable sur matériel contraint, tout en validant un transfert sim-to-real zero-shot sur un système souple, dont les dynamiques non linéaires et variant dans le temps constituent précisément le défi classique du gap simulation-réalité. C'est un résultat notable : les robots souples sont réputés récalcitrants au sim-to-real, et une réduction de 34 % des appels solveur sur hardware sans recalibration ouvre la voie à des architectures plus légères. Le DeePC, introduit autour de 2019 comme alternative data-driven aux MPC classiques, souffre depuis de son coût en ligne. Les travaux sur le déclenchement événementiel (event-triggered control) cherchent depuis plusieurs années à conditionner l'appel au solveur à des critères d'état système, mais les seuils statiques manquent d'adaptabilité. L'usage du RL pour apprendre ce critère de déclenchement constitue la nouveauté architecturale centrale de ce papier. Dans le paysage des robots souples, les approches concurrentes incluent les contrôleurs basés sur des réseaux de neurones récurrents (LSTM, Echo State Networks) et les méthodes Koopman pour la linéarisation. Ce travail positionne RL-ET-DeePC comme une alternative sans modèle et computationnellement frugale, avec des perspectives de déploiement sur des bras chirurgicaux, des grippers adaptatifs, ou des exosquelettes souples où la puissance de calcul embarquée reste contrainte.

RecherchePaper
1 source
RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement
1690arXiv cs.RO 

RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement

Une équipe de recherche a publié sur arXiv (référence 2606.25123) une architecture de contrôle hybride baptisée RGB, pour "RL Guided whole-body MPPI", destinée aux robots humanoïdes évoluant dans des environnements à contacts complexes. Le framework a été évalué en simulation MuJoCo sur un Unitree G1 à 29 degrés de liberté, avec une fréquence de contrôle moyenne de 280 Hz. Le principe : au lieu d'utiliser une politique d'apprentissage par renforcement (RL) comme contrôleur final, RGB l'emploie comme prior d'échantillonnage pour guider les rollouts d'un algorithme MPPI (Model Predictive Path Integral). Les objectifs de tâche sont définis via des termes de coût modulaires MPPI, qui corrigent en ligne la politique RL pour satisfaire ces objectifs sans nécessiter de réentraînement. Les tests montrent une réduction de la dérive systématique en marche rectiligne et une meilleure capacité à suivre des signaux de référence corps entier supplémentaires, comparé à une politique RL pure sous la même interface de commande. L'intérêt industriel de cette approche réside dans la rigidité structurelle des politiques RL actuelles : une fois entraînée, une politique couple fortement son comportement à l'objectif d'entraînement et à l'interface de commande. Ajouter un nouvel objectif de feedback (correction de trajectoire, contrainte de contact, suivi d'un membre spécifique) exige généralement un réentraînement complet, coûteux et long. RGB court-circuite cette contrainte en déléguant la précision et la modularité au MPPI, qui opère en boucle fermée à haute fréquence. Pour un intégrateur industriel ou un COO qui doit adapter un humanoïde à plusieurs lignes de production, la possibilité de spécifier de nouveaux comportements via des termes de coût, sans retouch au modèle RL sous-jacent, représente un gain de flexibilité concret. La fréquence de 280 Hz en simulation est encourageante, mais les auteurs ne démontrent pas encore le transfert sim-to-real, ce qui reste le saut critique pour toute validation industrielle. Le cadre MPPI est une technique de contrôle prédictif par échantillonnage bien établie en robotique mobile et manipulation, mais son couplage avec une politique RL comme prior pour les humanoïdes corps entier est une direction récente. Unitree, dont le G1 est devenu une plateforme de recherche courante grâce à son accessibilité commerciale (autour de 16 000 dollars), est au coeur de nombreux travaux académiques concurrents, notamment autour des architectures VLA (Vision-Language-Action) de type GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. RGB se positionne dans un créneau distinct : il ne vise pas la généralisation via des données de démonstration, mais l'optimisation en ligne de politiques existantes. La prochaine étape logique sera une validation sur hardware réel, déterminante pour établir si les 280 Hz de simulation se maintiennent face aux incertitudes mécaniques et aux latences capteurs d'un vrai G1.

RecherchePaper
1 source
RigPI : identification des paramètres dynamiques d'un corps rigide par simulation différentiable guidée par VLM
1691arXiv cs.RO 

RigPI : identification des paramètres dynamiques d'un corps rigide par simulation différentiable guidée par VLM

Des chercheurs présentent RigPI (arXiv:2606.25212, juin 2026), un framework d'identification des paramètres dynamiques d'objets rigides manipulés par un bras robotique, sans connaissance préalable de leurs propriétés physiques. Le système fusionne trois sources : un modèle vision-langage (VLM) qui initialise sémantiquement les estimations à partir de l'apparence de l'objet, des capteurs force-couple pour capturer les interactions réelles, et un simulateur physique différentiable qui affine les paramètres par descente de gradient. RigPI couvre les objets libres non contraints et les corps multi-articulés à joints rotoïdes ou prismatiques. Une optimisation en deux étapes atténue la sensibilité au bruit et évite les solutions physiquement aberrantes. Des expériences en conditions réelles valident que le robot reproduit fidèlement les trajectoires de manipulation en utilisant les paramètres identifiés. L'enjeu pour l'industrie est direct : construire des jumeaux numériques fiables exige de connaître les propriétés inertielles et frictionnelles d'un objet inconnu, pas seulement sa géométrie. Les pipelines classiques d'identification de système déraillent face au bruit capteur, aux erreurs de modèle et à l'absence de prior. RigPI innove sur deux fronts : l'usage d'un VLM comme oracle physique pour contraindre l'espace de recherche avant optimisation numérique, réduisant le risque de minima locaux incohérents ; et l'exploitation de la simulation différentiable pour propager des gradients analytiques plutôt que de procéder par essais-erreurs. Pour un intégrateur ou un responsable de production, cela signifie qu'une cellule de manipulation peut s'auto-calibrer sur un nouvel objet sans intervention humaine, comprimant les délais de mise en service. Ce travail prend place dans un effort de recherche dense autour de la simulation différentiable en robotique, où des groupes de MIT, Stanford et de laboratoires comme DeepMind publient des approches parallèles. Le sim-to-real sur les paramètres physiques reste un problème ouvert : la majorité des pipelines actuels supposent des masses et frictions connues, ou les approximent grossièrement. RigPI est à ce stade un prototype académique, preprint non encore peer-reviewé, sans partenaire industriel annoncé. Les prolongements logiques incluent l'intégration avec des politiques VLA (vision-language-action) pour fermer la boucle perception-identification-contrôle, et l'extension aux matériaux déformables ou aux contacts multi-points.

RecherchePaper
1 source
fARfetch : collaboration homme-robot en réalité augmentée colocalisée dans des environnements visuellement hétérogènes, avec adaptation de contenu par VLM
1692arXiv cs.RO 

fARfetch : collaboration homme-robot en réalité augmentée colocalisée dans des environnements visuellement hétérogènes, avec adaptation de contenu par VLM

Des chercheurs ont publié sur arXiv (juin 2026) les résultats de fARfetch, un système de collaboration humain-robot en réalité augmentée conçu pour les environnements extérieurs vastes et visuellement hétérogènes. Le dispositif combine un casque Meta Quest 3 et un robot quadrupède Unitree Go2, et repose sur trois mécanismes : une cartographie sémantique partagée entre le casque et le robot qui visualise des repères de l'environnement pour émettre des commandes de navigation par désignation, une représentation miniaturisée de l'espace (world-in-miniature) pour composer des trajectoires précises, et un module d'adaptation visuelle piloté par un VLM (vision-language model) qui ajuste en temps réel la couleur, la taille et l'orientation des éléments AR afin de maintenir leur lisibilité quelle que soit l'arrière-plan. L'évaluation a été conduite en conditions réelles sur une tâche d'inspection extérieure d'environ 30,5 mètres avec 13 participants en protocole intra-sujets. Par rapport à une baseline sans AR, fARfetch réduit le temps d'exécution de 66 %, la charge mentale de 43 %, la pression temporelle de 34 % et le niveau de frustration de 66 %. Ces résultats sont significatifs pour les intégrateurs de robotique mobile en milieux industriels ouverts (sites de construction, inspection d'infrastructure, logistique extérieure) où la téléopération classique bute sur la désorientation spatiale de l'opérateur et la perte de ligne de vue. L'usage d'un VLM pour l'adaptation du rendu AR constitue une avancée méthodologique : plutôt que de coder des règles statiques de contraste, le système raisonne sur le contexte visuel capturé. Cela suggère que la grille sim-to-real ne se limite plus aux actionneurs physiques mais s'étend à la couche d'interaction humain-machine. L'étude reste toutefois limitée : N=13 est un échantillon restreint, la tâche couvre 30,5 mètres en extérieur contrôlé, et aucune métrique de robustesse en conditions adverses (pluie, contre-jour fort, foule) n'est rapportée. fARfetch s'inscrit dans un champ de recherche actif sur l'AR comme interface de supervision de robots mobiles, aux côtés de travaux portant sur les drones et les AMR en entrepôt. Côté hardware, le Unitree Go2 est un quadrupède grand public à moins de 10 000 dollars, ce qui ancre l'expérimentation dans des configurations accessibles, contrairement aux plateformes à six chiffres de Boston Dynamics. Aucun acteur français ou européen n'est impliqué dans cette étude. Les auteurs n'annoncent pas de pilote industriel ni de timeline de déploiement : il s'agit d'un prototype académique dont les prochaines étapes naturelles seraient des évaluations sur des périmètres plus étendus, avec des opérateurs non entraînés et des robots à mobilité différente (bras, AMR sur roues).

RecherchePaper
1 source
PDS Joint : une articulation à double spirale paramétrique pour mains dextériques
1693arXiv cs.RO 

PDS Joint : une articulation à double spirale paramétrique pour mains dextériques

Des chercheurs ont publié sur arXiv (référence 2606.24377) la conception d'une articulation souple dite PDS (Parametric Double-Spiral), destinée aux mains robotiques dextères. L'articulation repose sur deux gabarits de spirales imbriquées, Archimédienne et logarithmique, qui permettent de façonner de manière indépendante la rigidité directionnelle selon trois modes de déformation : flexion/extension, abduction/adduction et pronation/supination. Un paramètre d'asymétrie ajustable contrôle la distribution de rigidité pour équilibrer stabilité de préhension et résistance à l'hyperextension. Le joint embarque également une proprioception inductive et un pipeline de calibration par apprentissage : un réseau MLP, entraîné à partir du suivi de marqueurs ArUco, réduit l'erreur d'estimation angulaire de 41,6 % par rapport aux méthodes classiques d'interpolation de courbes, en particulier sur le mouvement d'abduction/adduction, le plus difficile à instrumenter. La main open-source intégrant ces articulations a été validée sur neuf objets du quotidien et des interactions en contact direct avec des humains. Cette contribution s'attaque à un verrou bien identifié de la robotique de manipulation : la rigidité de la main doit être à la fois adaptable selon la direction pour saisir sans casser, et mesurable en temps réel pour fermer la boucle de commande. Les articulations rigides classiques ne permettent pas cette compliance directionnelle ; les solutions souples existantes peinent à combiner grande amplitude de mouvement, rigidité anisotrope calibrée et proprioception fiable. La réduction de 41,6 % de l'erreur via MLP est un résultat concret qui valide l'approche apprentissage pour la calibration de capteurs inductifs non linéaires sous grande déformation, un problème récurrent dans les mains à câbles ou tendons. La recherche sur les mains dextères a connu une accélération notable depuis 2023, tirée par la demande en manipulation fine pour les robots humanoïdes (Unitree, Figure, Agility) et les manipulateurs fixes. Des mains de référence comme la Shadow Dexterous Hand (Shadow Robot) ou la LEAP Hand (Carnegie Mellon) imposent la barre sur le nombre de degrés de liberté, mais leur proprioception reste souvent externe ou peu précise sous déformation. L'approche PDS, paramétrique et open-source, se positionne comme brique de recherche reproductible plutôt que produit commercial. Les prochaines étapes probables sont l'intégration dans un pipeline de contrôle par imitation ou par VLA (Vision-Language-Action), où la qualité de la proprioception articulaire conditionne directement les performances en manipulation contact-riche.

RecherchePaper
1 source
SlipSense : détection du glissement en temps réel pour robots à pattes par capteurs multimodaux
1694arXiv cs.RO 

SlipSense : détection du glissement en temps réel pour robots à pattes par capteurs multimodaux

Des chercheurs ont publié SlipSense, un système de détection de glissement en ligne pour robots à pattes, présenté le 24 juin 2026 sur arXiv (2606.24350). Le cadre repose sur un pied sensorisé léger et personnalisé monté sur un quadrupède Unitree Go1, couplé à un modèle LSTM qui infère les forces de réaction au sol en temps réel. Le système détecte les glissements en phase initiale -- avant toute instabilité irréversible -- avec un déplacement moyen de 24,1 ± 6,4 mm, pour une précision globale de 85,9 %. Comparé à la baseline cinématique standard (vitesse du pied estimée par odométrie d'état), SlipSense offre une résolution de détection 3,3 fois plus fine et une amélioration relative de 24 % en précision. Les tests ont été réalisés sur terrains glissants en mode aveugle, c'est-à-dire sans caméra ni information extéroceptive. L'intérêt opérationnel est clair : les méthodes proprioceptives classiques ratent les micro-glissements précoces parce qu'elles mesurent des effets cinématiques qui n'apparaissent qu'une fois le glissement déjà engagé. SlipSense anticipe ce seuil en exploitant directement les forces d'interaction sol-pied, ce qui ouvre la voie à une adaptation de démarche en temps réel -- ajustement des contraintes du contrôleur, estimation du coefficient de friction local, modification de la posture avant la chute. Pour les intégrateurs qui déploient des quadrupèdes sur sols industriels humides ou extérieurs enneigés, c'est un signal précurseur exploitable là où les encodeurs seuls échouent. Le Unitree Go1 est l'un des quadrupèdes les plus accessibles du marché, ce qui confère à cette publication une portée pratique au-delà du laboratoire. Les approches concurrentes en détection de glissement s'appuient majoritairement sur des IMU, des modèles de contact analytiques ou des réseaux entraînés sur simulation -- le sim-to-real restant un obstacle connu. SlipSense fait le pari opposé : capteur physique dédié et entraînement sur données réelles. Les auteurs positionnent explicitement ces travaux comme fondation pour des contrôleurs adaptatifs force-aware à venir, avec comme prochaine étape naturelle l'estimation en ligne de la friction et l'intégration dans une boucle de commande locomotion complète.

RecherchePaper
1 source
RTFF : politique de mise à plat de tissu aléatoire vers cible avec manipulateur bi-bras
1695arXiv cs.RO 

RTFF : politique de mise à plat de tissu aléatoire vers cible avec manipulateur bi-bras

Des chercheurs ont publié sur arXiv (réf. 2510.00814v2) une méthode robotique pour aplatir automatiquement un tissu froissé et le repositionner dans une pose cible arbitraire définie par l'utilisateur, à l'aide d'un manipulateur bi-bras. La tâche, baptisée RTFF (Random-to-Target Fabric Flattening), va au-delà du simple froissage-défroissage : le système doit simultanément éliminer les faux plis et aligner le tissu sur une configuration précise, deux objectifs structurellement antagonistes puisque tout aplatissement déplace la pose, et tout réalignement tend à réintroduire des plis. L'approche repose sur l'ancrage de l'état courant et de l'état cible du tissu à un même maillage de référence (template mesh), ce qui permet une évaluation directe au niveau des sommets (vertex-level) sans recalage préalable. Sur cette représentation, les auteurs ont développé une politique hybride combinant imitation learning et visual servoing (IL-VS), avec un composant clé baptisé MACT (Mesh Action Chunking Transformer) : ce transformeur exploite la structure du maillage pour réaliser un alignement grossier conditionné par l'objectif à partir d'un petit nombre de démonstrations, avant qu'un étage de visual servoing assure la convergence précise vers la cible. Les expériences sont menées sur un vrai système bi-bras à téléopération, avec généralisation à des poses cibles, des types de tissus et des échelles non vus pendant l'entraînement. Ce résultat est notable pour la manipulation d'objets déformables (DOM), un sous-domaine où le sim-to-real gap reste structurellement élevé en raison de la variabilité infinie des états du tissu et des occlusions causées par les plis. L'architecture MACT est intéressante car elle extrait de l'information structurée (maillage) plutôt que des images brutes, ce qui réduit l'ambiguïté de représentation typique des approches vision-seule. Le fait que la politique généralise à des tissus non vus à partir d'un ensemble compact de démonstrations suggère une efficacité de données supérieure aux pipelines RL purs, souvent gourmands en interactions simulées. Pour les intégrateurs industriels ciblant la manipulation textile (confection, logistique, blanchisserie), c'est un signal que les approches hybrides IL+VS méritent attention ; la limite reste la validation sur un seul système de téléopération en laboratoire, sans métriques de cycle time ni de robustesse sur longue durée. La manipulation de textiles en robotique est un problème ouvert depuis plusieurs décennies, historiquement traité par des méthodes analytiques, de la vision par ordinateur classique, ou plus récemment par du reinforcement learning en simulation. Des travaux récents comme pi0 de Physical Intelligence et les approches VLA (Vision-Language-Action) ont renouvelé l'intérêt pour les politiques généralisables sur objets déformables, mais sans cibler spécifiquement le repositionnement joint. Du côté des acteurs industriels, des startups comme Apptronik, 1X ou Kepler explorent la manipulation de tissus dans des contextes de logistique ou d'assistance, mais restent sur des tâches de saisie-dépose. Aucun acteur européen ou français n'est mentionné dans ce travail académique. La prochaine étape naturelle serait l'intégration dans un pipeline plus autonome avec perception RGB-D sans marqueurs, et des tests de robustesse sur des cycles répétés en environnement non contrôlé.

RecherchePaper
1 source
CTS-MoE : adaptation implicite au terrain par mélange d'experts pour la locomotion perceptive
1696arXiv cs.RO 

CTS-MoE : adaptation implicite au terrain par mélange d'experts pour la locomotion perceptive

Une équipe de recherche a publié en juin 2026 sur arXiv (ref. 2606.19633) une architecture baptisée CTS-MoE, conçue pour permettre à des robots quadrupèdes de traverser des terrains discontinus -- escaliers, trouées, obstacles -- sans recourir à un classifieur de terrain explicite. Le système repose sur un acteur à mélange dense d'experts (Mixture-of-Experts, MoE) dont le routage est piloté par la perception sensorielle, couplé à un multi-critique avec têtes de valeur spécifiques à chaque tâche pour éviter les interférences lors de l'entraînement. L'apprentissage s'effectue en bout-en-bout via un schéma enseignant-étudiant concurrent en une seule étape, sans distillation séquentielle, et les étiquettes de tâche ne sont utilisées qu'à l'entraînement. Les expériences ont été conduites sur un Unitree Go1 en simulation et sur matériel réel, sur des terrains vus et inédits. Ce travail s'attaque à une tension fondamentale du reinforcement learning multi-tâche appliqué à la locomotion : partager les comportements communs tout en évitant que des récompenses conflictuelles n'effacent la spécialisation acquise. Les approches monolithiques classiques sacrifient la spécialisation par terrain, tandis que les hiérarchies de sous-politiques peinent à généraliser lors des transitions entre environnements. CTS-MoE contourne les deux écueils en composant dynamiquement des experts partagés au runtime, guidé uniquement par la perception, sans sélecteur de haut niveau. Les résultats montrent une réduction de l'erreur de suivi de trajectoire et des taux de succès supérieurs aux baselines monolithiques -- bien que, s'agissant d'un preprint non encore évalué par les pairs, ces métriques restent à confirmer sur des benchmarks indépendants. La locomotion perceptive sur terrain complexe est un sous-domaine actif depuis les travaux d'ETH Zurich sur ANYmal (2020-2023) et ceux de CMU et Berkeley sur les quadrupèdes Unitree. L'usage des architectures MoE en robotique reste marginal par rapport à leur adoption massive en LLM (DeepSeek-MoE, Mixtral), et CTS-MoE est l'une des premières applications directes à la politique de locomotion avec validation hardware. Unitree, fabricant chinois du Go1, propose cette plateforme comme référence académique à moins de 3 500 USD, ce qui élargit la reproductibilité. Les concurrents directs en navigation sur terrain difficile incluent Boston Dynamics (Spot), ANYbotics et les laboratoires universitaires équipés d'ANYmal. Un site projet est disponible à cts-moe.github.io ; aucune timeline de déploiement industriel n'est annoncée.

RecherchePaper
1 source
TASC : contrôle partagé adapté à la tâche pour la télémanipulation relationnelle
1697arXiv cs.RO 

TASC : contrôle partagé adapté à la tâche pour la télémanipulation relationnelle

Des chercheurs ont présenté TASC (Task-Aware Shared Control), un cadre de contrôle partagé pour la télémanipulation relationnelle, publié en preprint sur arXiv (arXiv:2509.10416v2, soumis initialement en septembre 2025). Le système assiste un opérateur humain pilotant un bras robotique à distance lors de tâches impliquant des relations spatiales entre objets : insérer une fiche dans une prise, poser un objet sur un support, aligner des composants. TASC infère l'intention de l'utilisateur au niveau de la tâche à partir des seules commandes de mouvement brutes, sans templates de tâches prédéfinis. Il construit dynamiquement un graphe d'interactions à vocabulaire ouvert depuis l'entrée visuelle, puis utilise un modèle de vision-langage (VLM) pour prédire les contraintes spatiales guidant l'assistance durant la saisie et l'interaction avec les objets. Des expériences en simulation et en environnement réel montrent une meilleure efficacité des tâches et un effort opérateur réduit par rapport aux méthodes existantes. Le code est disponible en open source sur GitHub. Le résultat le plus significatif est la généralisation zéro-shot : TASC fonctionne sur des objets et des tâches jamais vus à l'entraînement, là où les frameworks concurrents reposent typiquement sur des templates figés ou des bases d'objets préenregistrées. En inférant l'intention depuis le mouvement seul, sans capteurs de force ni signaux d'intention explicites, le système abaisse la barrière d'intégration pour les applications industrielles et médicales où l'instrumentation supplémentaire est coûteuse ou impraticable. L'usage d'un VLM pour le raisonnement sur les contraintes spatiales s'inscrit dans la lignée des architectures VLA émergentes, en ciblant spécifiquement la couche de compréhension de scène sans requérir un pipeline de génération d'actions end-to-end complet. Le contrôle partagé pour la téléopération robotique est un champ actif depuis les années 1990, mais la généralisation à des tâches relationnelles ouvertes reste un problème non résolu. Les approches concurrentes s'appuient sur des affordances prédéfinies ou sur l'imitation par apprentissage profond, notamment dans les travaux des groupes de Chelsea Finn et Sergey Levine. TASC demeure une contribution académique sans partenariat industriel ni déploiement terrain annoncé. Les marchés cibles naturels incluent la chirurgie robotisée, l'assemblage de précision en microfabrication, et la téléopération en environnements dangereux. La validation logique suivante serait une évaluation sur des plateformes commerciales comme les bras Universal Robots ou Franka, avec des opérateurs réels hors contexte laboratoire.

RecherchePaper
1 source
VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts
1698arXiv cs.RO 

VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts

Des chercheurs du ROAM Lab présentent VibeCheck, un préhenseur de robot équipé de deux doigts piézoélectriques : l'un émet une vibration acoustique à travers l'objet saisi, l'autre la reçoit. Cette configuration de captation acoustique active permet d'extraire, en temps réel, des informations sur l'état de l'objet, ses propriétés matérielles, la position de saisie, la pose de structures internes, et la nature des contacts extrinsèques que l'objet entretient avec son environnement. Le système a été validé sur un bras UR5, en prenant le retour acoustique comme unique feedback sensoriel, sur la tâche d'insertion de goupille (peg insertion), un benchmark classique de manipulation dite contact-riche. Les travaux sont disponibles sur arXiv (2504.15535v2). L'intérêt principal de cette approche est d'offrir une modalité sensorielle tactile qui ne repose ni sur la vision (contrairement à GelSight ou DIGIT), ni sur un capteur force-couple classique, souvent coûteux et fragile. Le fait d'inférer le type de contact extrinsèque uniquement par signature acoustique, et d'en dériver une politique d'imitation learning robuste aux prédictions imparfaites du classificateur, suggère une voie sérieuse vers des manipulateurs capables de réagir à des contacts non planifiés sans percevoir explicitement la scène. La résilience de la politique à l'imperfection du signal est un point notable : elle a été entraînée sur un modèle de transition simulé calibré sur les performances réelles du capteur, ce qui réduit partiellement le sim-to-real gap habituel dans ce type de pipelines. L'acoustique active en robotique n'est pas nouvelle, des travaux comme SonicSense ou les approches vibrotactiles en exploration de matériaux existent depuis plusieurs années, mais son intégration dans un préhenseur commercialement plausible (doigts piézoélectriques standard) pour des tâches longue-durée reste rare. Côté concurrence, les capteurs vision-based (GelSight de MIT, DIGIT de Meta/CMU) dominent la recherche en tactile, tandis que des startups comme Touchlab ou Xela Robotics misent sur d'autres modalités. VibeCheck se distingue par sa capacité à fonctionner à travers l'objet, pas seulement à sa surface. Les prochaines étapes probables incluent l'extension à des géométries d'objets variées et l'intégration à des systèmes multi-modaux combinant acoustique et vision.

RecherchePaper
1 source
Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D
1699arXiv cs.RO 

Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D

Des chercheurs ont publié le 19 juin 2026 sur arXiv (référence 2606.19340) un framework zero-shot pour la manipulation dextre à longue séquence, capable d'exécuter des tâches en plusieurs étapes sur des objets inconnus sans entraînement spécifique. Le système prend en entrée des instructions en langage naturel et des images RGB multi-vues calibrées, sans capteur de profondeur, et utilise un modèle vision-langage (VLM) pour générer des points-clés 2D dans un référentiel de vue de référence. Ces points sont ensuite reconstruits en 3D par fusion multi-vues combinant triangulation et une technique de "ray voting" : le système parcourt le rayon optique de la caméra principale pour identifier les candidats géométriquement cohérents dans les vues adjacentes. Les points-clés 3D obtenus supportent deux modes d'exécution : saisie-dépose directe et utilisation d'outils via la récupération d'une trajectoire outil stockée à 6 degrés de liberté (6DoF), alignée sur la configuration de scène courante. Un module bras-main génère ensuite les paires grasping-mouvement faisables. Les expériences réelles montrent que le système surpasse des baselines RGB-D vue unique et des VLA fine-tunés en précision de grounding 3D et en fiabilité d'exécution. L'enjeu central est la flexibilité de déploiement : un système zero-shot qui surpasse des VLA (Vision-Language-Action models) fine-tunés sur données spécifiques remet en question l'hypothèse dominante selon laquelle la manipulation dextre en environnement réel exige obligatoirement de larges datasets annotés et un réentraînement par tâche. Pour les intégrateurs industriels, cela signifie potentiellement des cycles de mise en production raccourcis, sans collecte systématique de démonstrations téléopérées pour chaque nouvel objet ou configuration. La boucle fermée de vérification d'état et de replanification (closed-loop replan) est particulièrement significative : elle distingue ce travail des approches open-loop qui accumulent les erreurs sur des séquences longues, un problème récurrent dans les démos de manipulation non supervisées. L'absence de capteur de profondeur réduit par ailleurs les contraintes matérielles à l'intégration sur des cellules robotiques existantes. Ce travail s'inscrit dans la tension croissante entre deux paradigmes : les VLA de bout-en-bout, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA de Stanford, qui nécessitent supervision et données massives, et les approches modulaires exploitant les capacités de raisonnement de VLM existants sans réentraînement. Depuis 2023, les VLA dominent les benchmarks de manipulation dextre, mais leur coût en données et leur manque de généralisation zero-shot à de nouveaux objets freinent les déploiements industriels à grande échelle. À noter : ce preprint ne mentionne pas d'affiliation institutionnelle dans l'abstract disponible, ce qui limite l'évaluation de la maturité des résultats, et n'a pas encore été soumis à peer review. Aucun acteur européen n'est impliqué. Les suites naturelles seraient une validation sur les benchmarks standardisés DROID ou Open X-Embodiment, et une comparaison formelle avec les versions récentes de Pi-0 et GR00T N2 pour situer précisément les gains annoncés.

RechercheOpinion
1 source
Un modèle graphique connectomique du cerveau entier permet le contrôle locomoteur chez la drosophile
1700arXiv cs.RO 

Un modèle graphique connectomique du cerveau entier permet le contrôle locomoteur chez la drosophile

Des chercheurs ont développé le Fly-connectomic Graph Model (FcGM), un contrôleur neuronal qui instancie directement le connectome complet du cerveau d'une drosophile adulte comme réseau de neurones graphique pour piloter un modèle biomécanique simulé de l'insecte via apprentissage par renforcement profond. Présenté dans un preprint arXiv (identifiant 2602.17997, version 3), le travail exploite la cartographie synaptique neurone-par-neurone du cerveau entier de Drosophila melanogaster pour en faire un prior architectural structuré. Le contrôleur produit des mouvements locomoteurs stables sur une gamme variée de tâches, et affiche une meilleure efficacité d'échantillonnage par rapport à des baselines classiques, graphiques ou non. Les résultats restent entièrement dans un environnement de simulation physique : aucun transfert sur robot ou drosophile réelle n'est rapporté à ce stade. L'intérêt principal est de démontrer qu'une topologie cérébrale biologique réelle peut remplacer avantageusement des architectures de réseau définies à la main, tout en améliorant l'interprétabilité via le suivi du flux d'information dynamique entre populations neuronales. Pour les équipes travaillant sur des contrôleurs de locomotion à plusieurs membres (robots hexapodes, exosquelettes), ce résultat suggère que les données connectomiques pourraient constituer des priors de contrôle plus robustes que les topologies ad hoc habituelles. La question centrale du sim-to-real gap reste entièrement ouverte : le modèle biomécanique utilisé est une approximation, et les auteurs ne quantifient pas l'écart potentiel avec un déploiement physique. Ce travail s'inscrit dans la lignée de plusieurs avancées récentes : la publication du connectome de la drosophile par le consortium FlyWire en 2023, soit environ 140 000 neurones et 50 millions de synapses cartographiés, a rendu possible ce type d'expérimentation à l'échelle du cerveau entier, là où les travaux antérieurs se limitaient à des sous-graphes simplifiés comme les Neural Circuit Policies (NCP) de Hasani et Lechner ou les 302 neurones de C. elegans dans le projet OpenWorm. Les prochaines étapes naturelles seraient l'extension à des tâches plus complexes (manipulation, navigation), le test sur des plateformes robotiques physiques, et à plus long terme l'application à des connectomes de mammifères.

RecherchePaper
1 source