Aller au contenu principal

Dossier arXiv cs.RO — page 3

2842 articles · page 3 sur 57

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

Le contexte peut-il combler l'écart de réalité ? Transfert simulation-réel des politiques sensibles au contexte
101arXiv cs.RO RecherchePaper

Le contexte peut-il combler l'écart de réalité ? Transfert simulation-réel des politiques sensibles au contexte

Le sim-to-real transfer, c'est-à-dire le passage d'une politique de contrôle entraînée en simulation vers un robot réel, reste l'un des obstacles majeurs de l'apprentissage par renforcement (RL) en robotique. Une équipe de recherche propose dans cet article (arXiv:2511.04249, version révisée) d'intégrer un module d'estimation du contexte, c'est-à-dire une estimation des paramètres dynamiques de l'environnement, directement dans le pipeline d'entraînement basé sur la Domain Randomization (DR). Les chercheurs comparent plusieurs stratégies de supervision de cet estimateur de contexte, considérées comme état de l'art, et évaluent les politiques résultantes sur deux terrains : un benchmark de contrôle standard en simulation, et une tâche réelle de poussée d'objet (pushing) exécutée avec un bras robotique Franka Emika Panda. L'enjeu dépasse la seule prouesse technique : la Domain Randomization, qui consiste à exposer la politique à une large gamme de dynamiques aléatoires pendant l'entraînement pour la rendre robuste, améliore le transfert vers le réel mais dégrade souvent les performances, car la politique doit rester valable pour tous les cas randomisés plutôt que de s'optimiser pour un seul. En conditionnant la politique sur une estimation du contexte plutôt qu'en l'entraînant à l'ignorer, les auteurs cherchent à réconcilier robustesse et performance, un compromis central pour quiconque déploie du RL sur du matériel réel en usine ou en logistique. Les résultats montrent que les politiques context-aware surpassent systématiquement la baseline context-agnostic sur tous les scénarios testés, ce qui confirme l'intérêt de cette approche, mais sans stratégie de supervision universelle : le choix optimal dépend de la tâche. Ce travail s'inscrit dans une lignée de recherches visant à combler l'écart de réalité (reality gap) qui limite le RL appliqué à la robotique depuis plusieurs années, la DR classique restant la référence malgré ses limites connues. En publiant une version révisée sur arXiv, les auteurs affinent une méthode déjà proposée plutôt que d'annoncer un nouveau système. La validation reste à ce stade circonscrite à une tâche de manipulation simple sur un seul bras robotique commercial ; l'étape suivante consisterait à tester la généralisation de cette approche sur des tâches plus complexes et des plateformes variées avant d'envisager une adoption industrielle.

1 source
UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert
102arXiv cs.RO 

UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert

Un nouveau benchmark baptisé UAV-ON vise à évaluer la capacité de drones autonomes à localiser des objets dans de vastes environnements ouverts, sans dépendre d'instructions linguistiques détaillées. Publié sur arXiv (2508.00288v5), le jeu de données couvre 14 environnements haute fidélité construits sous Unreal Engine, mêlant zones urbaines, milieux naturels et espaces mixtes, avec des agencements spatiaux complexes. Il définit 1270 objets cibles annotés individuellement, chacun décrit par une instruction de niveau instance précisant la catégorie, l'emprise physique et des descripteurs visuels, permettant un raisonnement ancré dans la scène. Les chercheurs ont aussi implémenté plusieurs méthodes de référence, dont Aerial ObjectNav Agent (AOA), une politique modulaire combinant sémantique de l'instruction et observations égocentriques pour une exploration orientée objectif sur de longs horizons. Résultat: tous les modèles testés peinent à accomplir la tâche, ce qui souligne la difficulté cumulée de la navigation aérienne et de l'ancrage sémantique des objectifs. Ce benchmark marque une rupture avec le paradigme dominant de la navigation vision-langage (VLN), qui repose sur des séquences d'instructions pas à pas et limite de fait l'autonomie et le passage à l'échelle des agents. En proposant une tâche d'Object Goal Navigation où l'agent ne reçoit qu'un objectif sémantique de haut niveau, UAV-ON teste une compétence plus proche des besoins réels d'inspection, de surveillance ou de cartographie par drone. L'échec généralisé des baselines confirme que le passage d'instructions détaillées à des objectifs sémantiques abstraits reste un verrou majeur, loin d'être résolu malgré les progrès des modèles vision-langage-action sur d'autres plateformes robotiques. La navigation aérienne embarquée demeure sous-explorée comparée à la navigation terrestre, où les benchmarks VLN se sont multipliés ces dernières années. UAV-ON s'inscrit dans cette lignée en l'adaptant aux contraintes spécifiques du vol: grande échelle, environnements non structurés, absence de repères au sol. Les auteurs positionnent ce travail comme une fondation pour de futures recherches sur l'autonomie UAV pilotée par des descriptions sémantiques, ouvrant la voie à des méthodes capables de généraliser au-delà des scénarios scriptés actuels.

RecherchePaper
1 source
Mémoire pour attention : re-perception conditionnée par le langage avec une carte vision-langage-mouvement
103arXiv cs.RO 

Mémoire pour attention : re-perception conditionnée par le langage avec une carte vision-langage-mouvement

Des chercheurs testent une carte persistante annotée par comportements, la Vision-Language-Motion Map (VLMM), sur deux questions de planification robotique. Sur 28 scènes du simulateur AI2-THOR, un planificateur exploitant les coûts comportementaux de la VLMM réduit l'objectif de planification d'environ 35% par rapport à une approche classique. Mais en exécution réelle en boucle fermée, ce gain fond à environ 4%, et un modèle vision-langage (VLM) interrogé à la demande fait quasiment aussi bien. Sur la seconde question, celle de savoir quoi ré-observer en priorité quand le budget de perception est limité, la mémoire de la carte, historique des changements ou simple date de dernière observation, produit le meilleur calendrier de re-perception, équivalent à un oracle, là où un VLM sans mémoire se révèle médiocre. Le bénéfice se concentre sur les objets importants (facteur d'environ 1,6 fois la moyenne), et une tâche de récupération d'objet confirme moins de trajets inutiles. Le gain croît avec l'hétérogénéité des scènes selon une borne de Cauchy-Schwarz, égale à la variance de la racine de la volatilité. Avec un vrai prior CLIP sur des objets rendus, l'avantage atteint +21 à 26%. Quand la tâche est conditionnée par le langage, la VLMM identifie les objets pertinents en vocabulaire ouvert et suit leurs changements, dépassant une base récence-pertinence de +2,5% et un VLM à la demande de +8,9%. Ce résultat nuance l'idée répandue qu'une carte sémantique persistante améliore mécaniquement la navigation: pour "comment contourner une pièce", la mémoire est un luxe dont l'intérêt s'évapore à l'exécution, un VLM interrogé au vol suffisant. En revanche, pour décider quoi re-observer sans tout rescanner, cruciale pour un robot mobile ou humanoïde à budget de calcul et de caméra limité, la mémoire change la donne. Pour les intégrateurs, la leçon est concrète: pas besoin de carte comportementale complexe pour le déplacement, mais un vrai gain à prioriser les re-vérifications sur les objets qui comptent, avec économie de calcul et de temps de cycle. Ni le langage seul ni la dynamique seule ne suffisent, seule leur combinaison produit l'avantage. Les cartes sémantiques enrichies par VLM se sont multipliées avec la montée des modèles vision-langage-action, généralement validés en simulation avant tout déploiement réel. Ce travail se positionne en creux face à cette tendance en exposant l'écart entre gains de planification hors ligne et performance réelle en boucle fermée, un avertissement utile pendant que le secteur multiplie les annonces de cartes cognitives pour robots humanoïdes et logistiques. Les auteurs comparent leur approche aux VLM à la demande, sans mémoire mais coûteux en calcul, et aux baselines de récence pondérée. Travail de recherche publié sur arXiv, sans partenaire industriel annoncé, ses suites naturelles porteraient sur une validation hors simulateur et sur des plateformes robotiques réelles, où l'arbitrage calcul-mémoire-perception est plus contraint.

RecherchePaper
1 source
Vue-Langage-Action : agir, réfléchir ou s'abstenir selon la complexité perçue
104arXiv cs.RO 

Vue-Langage-Action : agir, réfléchir ou s'abstenir selon la complexité perçue

Une équipe de recherche propose un mécanisme d'inférence adaptative pour les modèles Vision-Language-Action (VLA), publié sur arXiv (2603.05147v2). Le principe: au lieu d'appliquer systématiquement un raisonnement coûteux à chaque tâche, le système classe la complexité de la situation perçue et choisit entre trois modes, Act (exécution immédiate pour les tâches connues), Think (raisonnement approfondi pour les cas ambigus) et Abstain (arrêt préventif face à une anomalie physique ou sémantique). La méthode transforme le backbone vision-langage du VLA en détecteur actif, en projetant ses embeddings latents dans des estimateurs paramétriques et non paramétriques. Testé sur les benchmarks LIBERO et LIBERO-PRO ainsi que sur un robot réel, le modèle combinant un Gaussian Mixture Model appliqué aux embeddings fusionnés vision-langage-instruction obtient jusqu'à 87,5% de F1-score sur deux backbones VLA différents, SmolVLA et π0, et conserve 83% de performance avec seulement 5% des données d'entraînement, dépassant les détecteurs d'échec de l'état de l'art. Pour l'industrie robotique, ce travail s'attaque à deux problèmes concrets qui freinent le déploiement des VLA en production: le coût de calcul du raisonnement systématique, qui pénalise le temps de cycle et l'autonomie embarquée sur des tâches triviales, et l'absence de garde-fou fiable face aux scénarios hors distribution, source de défaillances catastrophiques en environnement réel. En donnant au modèle une estimation d'incertitude native plutôt qu'un raisonnement en force brute partout, l'approche vise un compromis entre latence et sécurité que les intégrateurs réclament pour justifier un passage du laboratoire à l'usine ou à l'entrepôt. Le fait que la robustesse se maintienne avec 5% des données seulement suggère aussi une piste pour réduire le coût d'entraînement spécifique à chaque nouvelle tâche. Le travail s'inscrit dans la lignée des VLA généralistes comme π0 (Physical Intelligence) et des modèles compacts comme SmolVLA, dont la généralisation reposait jusqu'ici surtout sur l'ajout de modules de raisonnement, au prix de la latence. En s'appuyant sur les benchmarks de simulation LIBERO et sa variante durcie LIBERO-PRO, complétés par une validation sur robot physique, les auteurs positionnent leur détecteur de complexité comme une alternative aux approches existantes de détection d'échec. Les prochaines étapes attendues concernent l'extension à d'autres familles de VLA et une validation à plus grande échelle en conditions industrielles réelles.

RechercheActu
1 source
CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur
105arXiv cs.RO 

CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur

Cette avancée en recherche fournit une méthode de bout en bout pour permettre à un robot humanoïde de marcher sur des terrains complexes en utilisant seulement une caméra de profondeur, sans passer par une carte 3D intermédiaire du terrain. Baptisée CReF (Cross-modal and Recurrent Fusion), l'approche fusionne directement les données de profondeur brutes captées à l'avant du robot avec les signaux de proprioception (l'état interne des articulations et du corps), via un mécanisme d'attention croisée piloté par la proprioception. Cette fusion passe ensuite par un bloc résiduel à porte, puis par une unité récurrente GRU dotée d'une porte de sortie de type "highway", qui pondère dynamiquement la contribution des informations récurrentes et instantanées selon le contexte. Les chercheurs ajoutent une récompense d'appui au sol qui identifie, à partir de nuages de points sous les pieds, les zones porteuses les plus proches et incite le robot à y poser le pied. Testée en simulation puis sur un humanoïde physique, la méthode montre un transfert zero-shot réussi vers des environnements réels variés : mains courantes, palettes ajourées, surfaces fortement réfléchissantes et terrains extérieurs encombrés visuellement. L'intérêt pour l'industrie tient à la simplification radicale du pipeline perception-vers-contrôle. Les méthodes précédentes s'appuyaient souvent sur des représentations de terrain 2.5D centrées sur le robot ou sur des objectifs géométriques auxiliaires pendant l'apprentissage, ce qui imposait des étapes de construction de carte ou des transferts de compétences en plusieurs stades. En évitant ces intermédiaires géométriques explicites, CReF réduit la latence et la complexité d'intégration, un enjeu direct pour les intégrateurs qui cherchent à déployer des humanoïdes en environnement logistique ou industriel réel plutôt qu'en démonstration contrôlée. Le succès du transfert zero-shot sur des surfaces réfléchissantes et des structures ajourées, deux cas connus pour perturber les capteurs de profondeur, est une preuve empirique concrète que l'apprentissage bout-en-bout depth-vers-contrôle peut tenir la route hors laboratoire, un point encore débattu dans le secteur. Ce travail s'inscrit dans la lignée des recherches sur la locomotion perceptive des humanoïdes, où la tension entre robustesse et simplicité d'architecture reste un problème ouvert, à côté des approches concurrentes utilisant des cartes d'élévation ou des skills pré-entraînés séparément. L'article, disponible sur arXiv, en est à sa troisième version révisée, signe d'itérations après retours de relecture. Les auteurs ne précisent pas de plateforme commerciale ni de partenaire industriel associé à ces travaux, qui relèvent pour l'instant de la recherche académique plutôt que d'un produit déployé ; la prochaine étape naturelle serait une validation sur davantage de plateformes humanoïdes et en conditions de production prolongées.

RecherchePaper
1 source
N₀-VTLA : passage à l'échelle du modèle vision-tactile-langage-action grâce à des tokens tactiles latents
106arXiv cs.RO 

N₀-VTLA : passage à l'échelle du modèle vision-tactile-langage-action grâce à des tokens tactiles latents

Voici l'article : Une équipe de recherche présente N0-VTLA, un modèle fondation vision-tactile-langage-action (VTLA) conçu pour la manipulation fine en contact avec des objets, combinant perception tactile et contrôle par retour tactile. Décrit dans un article publié sur arXiv (2607.23782), le système repose sur trois étapes d'entraînement : un pré-entraînement visuo-tactile sur NeoData, un vaste jeu de données robotiques propriétaire combinant vision et toucher, une intégration progressive d'un canal tactile dédié, puis une amélioration de politique hors ligne baptisée ALTER. Les auteurs revendiquent le premier modèle VTLA pré-entraîné sur des données tactiles à cette échelle. Sur les neuf tâches du benchmark réel NeoReal, N0-VTLA l'emporte face à toutes les méthodes concurrentes testées. Sur une suite de vingt tâches en simulation, il atteint 63,8% de réussite moyenne, contre 44,0% pour la meilleure référence. Les politiques entraînées avec ALTER atteignent 75 à 95% de réussite sur trois tâches réelles à horizon long. Ces résultats ciblent un point de friction connu de la robotique manipulatrice : les modèles vision-langage-action actuels gèrent mal les tâches nécessitant un contact fin et continu, comme la manipulation d'objets déformables, faute d'un signal tactile correctement intégré. En démontrant qu'un canal tactile prédictif, distillé à partir de priors appris à grande échelle, améliore significativement la réussite sur des tâches de préhension délicate, l'étude apporte un argument concret pour l'intégration systématique du toucher dans les futures architectures VLA, un sujet jusqu'ici moins mature que la seule perception visuelle. La méthode ALTER, qui transforme des comparaisons de progression et d'événements de trajectoire en étiquettes d'avantage binaires, offre aussi une piste pour exploiter des corpus de déploiement déjà collectés sans reconstruire un pipeline de reward complexe. Le travail s'inscrit dans la vague récente de modèles VLA génériques (Pi-0, GR00T N2, Helix) qui cherchent à généraliser la manipulation robotique au-delà de tâches scriptées, mais reste à ce stade une contribution académique évaluée sur des benchmarks internes aux auteurs plutôt qu'un produit ou un déploiement industriel documenté. Aucune date de disponibilité, aucun partenariat commercial ni acteur français ou européen n'est mentionné dans l'article ; les prochaines étapes annoncées concernent l'extension du jeu de données NeoData et l'application d'ALTER à d'autres familles de tâches de manipulation contact-riches.

RechercheActu
1 source
FloAff-Kitchen : relier navigation et manipulation par apprentissage canonique et progressif de l'affordance du sol
107arXiv cs.RO 

FloAff-Kitchen : relier navigation et manipulation par apprentissage canonique et progressif de l'affordance du sol

Des chercheurs du HERO Lab (Central South University, Chine) ont publié fin juillet 2026 sur arXiv "FloAff-Kitchen", un système qui apprend aux robots mobiles à choisir où poser leur base au sol non pas seulement pour atteindre une cible de navigation, mais pour maximiser la réussite d'une tâche de manipulation qui suit. Le cœur technique repose sur deux briques : une représentation canonique de l'affordance au sol (CFAR), qui isole la géométrie d'interaction utile en supprimant les variations de position et d'orientation des objets sans rapport avec le placement du robot, et un apprentissage progressif (PFAL), qui transfère des priors appris sur une tâche de manipulation de référence vers un éventail de compétences hétérogènes en aval. Pour évaluer l'approche, l'équipe a construit le premier benchmark multi-scènes et multi-points de vue dédié à cette problématique, FloAff-Kitchen, couvrant différentes compétences de manipulation, agencements de pièces, styles de mobilier et angles de caméra. Sur trois configurations de test, la méthode dépasse systématiquement les approches de référence, et des études d'ablation confirment l'apport de chaque composant proposé. La contribution cible un angle mort classique de la manipulation mobile : la plupart des systèmes de navigation évaluent uniquement si une position est atteignable, sans tenir compte de si elle permet réellement de réussir la préhension ou la manipulation qui suit. Distinguer une perception conditionnée par la navigation d'une perception conditionnée par la tâche est précisément ce qui bloque souvent le passage de la démonstration en environnement contrôlé au déploiement en cuisine ou en environnement domestique réel, où l'orientation des objets et l'encombrement varient. Pour les intégrateurs travaillant sur des robots mobiles manipulateurs ou des humanoïdes destinés à des tâches ménagères ou de service, ce travail illustre une tendance de fond de la recherche actuelle : combler l'écart entre modules de navigation et de manipulation plutôt que les traiter comme deux problèmes séparés, une des limites régulièrement citées pour expliquer l'écart entre vidéos de démonstration et fiabilité en conditions réelles. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage d'affordances spatiales pour la robotique, un domaine qui s'est étendu des affordances de préhension d'objets aux affordances de placement du robot lui-même, en écho aux efforts de modèles VLA comme Pi-0 ou GR00T N2 qui cherchent à unifier perception et action dans un même modèle. Contrairement aux approches génériques de navigation qui ignorent l'objectif de manipulation final, FloAff-Kitchen propose un cadre pensé spécifiquement pour l'environnement cuisine, un cas d'usage central pour les startups de robots domestiques. L'équipe met à disposition le benchmark et la page du projet publiquement, ce qui devrait permettre des comparaisons directes avec de futures méthodes sur ce sous-problème encore peu standardisé de la manipulation mobile.

RecherchePaper
1 source
NEO : NeRF Une Fois, Éditer Plusieurs Fois pour la Manipulation Continue d'Objets
108arXiv cs.RO 

NEO : NeRF Une Fois, Éditer Plusieurs Fois pour la Manipulation Continue d'Objets

Des chercheurs présentent NEO (NeRF It Once, Edit It Many Times), un framework unifié qui permet d'éditer des champs de radiance neuronaux (NeRF) guidés par le langage pour la manipulation robotique. Le système repose sur trois apports techniques : une méthode de suppression d'objets guidée par texte combinant un rééchantillonnage du champ neuronal avec un inpainting progressif cohérent sur plusieurs vues, une technique d'édition directe des poids du NeRF par distillation de connaissances qui compose le champ original et le champ édité via un modèle enseignant-élève, permettant de modéliser à l'avance l'état futur d'une scène avant qu'un robot n'exécute une action, et NEO-Dataset, présenté comme le premier benchmark dédié à l'évaluation quantitative des méthodes d'édition de scènes NeRF appliquées à la manipulation robotique. Selon les auteurs, l'approche surpasse les méthodes de référence de l'état de l'art sur des tâches d'édition de scène, incluant la suppression d'objets et des expériences robotiques de type pick-and-place, avec des résultats visuellement cohérents et géométriquement consistants, réduisant les artefacts habituellement générés par les approches concurrentes. Pour les équipes qui travaillent sur la perception et la planification robotique, l'intérêt de NEO tient à sa capacité à anticiper l'état d'une scène après une action, sans reconstruire un NeRF complet à chaque itération : c'est un gain potentiel en temps de calcul et en robustesse pour les pipelines de saisie et de manipulation basés sur des représentations 3D implicites. La réduction des artefacts est un point concret pour les intégrateurs, car les distorsions géométriques issues d'un NeRF édité de façon incohérente peuvent fausser la planification de préhension ou la détection de collision. L'existence d'un benchmark dédié, NEO-Dataset, comble aussi un manque : jusqu'ici, l'évaluation des méthodes d'édition de scène NeRF pour la robotique manquait de protocole standardisé, ce qui rendait les comparaisons entre approches peu fiables. Ce travail s'inscrit dans une tendance de recherche plus large visant à exploiter les NeRF, initialement conçus pour le rendu de vues nouvelles, comme représentations exploitables pour la planification robotique et la simulation de scènes futures. Les méthodes antérieures d'édition de NeRF souffraient soit d'un coût de réentraînement prohibitif, soit d'artefacts visuels limitant leur usage en boucle fermée avec un robot. En proposant une édition directe des poids par distillation plutôt qu'un réentraînement complet, NEO se positionne comme une alternative plus légère aux approches existantes. Le papier, publié sur arXiv, ne précise pas encore de déploiement matériel à grande échelle ; il s'agit à ce stade d'une contribution méthodologique et d'un benchmark, dont l'adoption par d'autres équipes de recherche en manipulation robotique reste à confirmer.

RecherchePaper
1 source
IA incarnée : représentations polynomiales pour le contrôle moteur structuré par l'interaction
109arXiv cs.RO 

IA incarnée : représentations polynomiales pour le contrôle moteur structuré par l'interaction

Voici la traduction/résumé de l'article, en respectant les consignes éditoriales : Des chercheurs présentent PRISM (Polynomial Representations for Interaction-Structured Motor Control), une nouvelle architecture pour les politiques de contrôle robotique, décrite dans un preprint arXiv publié fin juillet 2026. Le constat de départ : la quasi-totalité des politiques robotiques reposent aujourd'hui sur des MLP (perceptrons multicouches) qui associent observations et actions de façon linéaire couche par couche, alors que des phénomènes physiques clés (puissance, effets inertiels, contact, glissement, compliance) dépendent en réalité de produits entre variables observées, pas de leur simple somme pondérée. PRISM introduit un module polynomial factorisé qui expose ces interactions d'ordre supérieur sans énumérer tous les termes polynomiaux possibles, ce qui le rend compact et entraînable de bout en bout. En apprentissage par renforcement, le module s'ajoute après un backbone MLP standard via une fonction polynomiale élément par élément activée progressivement ; en apprentissage par imitation, il remplace le conditionnement proprioceptif linéaire de Diffusion Policy par une couche polynomiale. Sur des tâches de locomotion humanoïde et de manipulation à contacts riches, PRISM surpasse les MLP classiques, y compris des MLP plus larges à capacité équivalente, et produit un comportement compliant sans capteur de force, de couple, tactile, ni étiquette de contact ou contrôle en admittance. Pour l'industrie robotique, le résultat central est que la structure des interactions ne se remplace pas simplement par davantage de paramètres, un argument qui s'oppose à la tendance actuelle consistant à gonfler la taille des modèles VLA (Pi-0, GR00T N2, Helix) pour gagner en performance. La compliance sans capteur intéresse particulièrement les intégrateurs, car elle réduit le coût et la complexité du câblage tactile sur les mains et pinces. PRISM se positionne comme une brique architecturale plutôt qu'un produit : c'est un preprint non encore relu par les pairs, testé en simulation sur des benchmarks académiques, avec code et vidéos disponibles sur la page du projet. La comparaison directe avec Diffusion Policy, référence largement utilisée en apprentissage par imitation, suggère une piste d'intégration dans les têtes d'action des futurs modèles VLA plutôt qu'un remplacement complet des architectures existantes.

RecherchePaper
1 source
Object SLAM sémantique semi-incrémental sans association de données
110arXiv cs.RO 

Object SLAM sémantique semi-incrémental sans association de données

Une équipe de recherche publie sur arXiv (identifiant 2607.23384) un nouveau framework de SLAM baptisé "Semantic Semi-Incremental Data-Association-Free Object SLAM", conçu pour résoudre conjointement quatre problèmes habituellement traités séparément : l'association des mesures aux bons landmarks, l'estimation de la trajectoire du robot, la position des objets repérés dans l'environnement, et leur sémantique. Le système exploite à la fois des mesures de position classiques et des informations sémantiques issues de réseaux de détection d'objets (labels de classe) ou de modèles de fondation visuels (vecteurs de features), qu'il combine avec les données odométriques du robot. La méthode adopte un schéma d'estimation semi-incrémental, un compromis entre les approches purement incrémentales et par lots, pensé pour améliorer la précision tout en maîtrisant le coût de calcul. Les auteurs fournissent également des heuristiques et une justification théorique pour estimer automatiquement le nombre de landmarks présents dans une scène, un paramètre souvent fixé arbitrairement dans les systèmes existants. Le framework est validé sur des jeux de données synthétiques et réels, avec deux types d'information sémantique testés, et affiche des performances supérieures à des baselines jugées solides par les auteurs. L'enjeu dépasse la seule prouesse académique. L'association de données reste l'un des goulots d'étranglement historiques du SLAM : une erreur d'appariement entre une mesure et un landmark peut faire diverger toute la carte construite par un robot mobile ou un AMR en environnement encombré. En intégrant la sémantique directement dans le calcul d'association plutôt qu'en l'utilisant comme simple filtre a posteriori, cette approche s'inscrit dans une tendance de fond où les systèmes de perception cessent de traiter géométrie et sémantique comme deux couches indépendantes. Pour les intégrateurs travaillant sur la navigation autonome en entrepôt ou en environnement industriel, cela laisse entrevoir des cartes plus robustes aux occlusions et aux environnements dynamiques, où les repères géométriques seuls sont souvent ambigus. Ce travail s'inscrit dans la lignée des systèmes "SLAM sémantique" et "SLAM sans association explicite" qui se sont multipliés depuis l'essor des détecteurs d'objets profonds et des modèles de fondation visuels type CLIP ou DINO. Contrairement aux approches qui traitent l'association de données comme un problème résolu en amont par un simple seuillage de similarité, les auteurs la formulent comme une variable à estimer conjointement avec le reste du système, ce qui la rapproche des travaux récents en SLAM bayésien multi-hypothèses. La publication ne mentionne pas de déploiement sur robot réel en conditions industrielles ; il s'agit à ce stade d'une contribution méthodologique évaluée en benchmark, dont l'adoption pratique dépendra de sa capacité à tourner en temps réel embarqué.

RecherchePaper
1 source
IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde
111arXiv cs.RO 

IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde

Des chercheurs proposent SOWL-MPC, une méthode de contrôle prédictif sûr conçue pour un nouveau scénario baptisé "ego-world robotic framework": un robot ego doit naviguer aux côtés d'un autre robot ("world robot") dont la politique de contrôle est totalement inconnue. Plutôt que de supposer un comportement prévisible chez l'autre agent, comme le font la plupart des méthodes existantes, l'approche combine un mécanisme d'apprentissage en ligne basé sur des processus gaussiens variationnels épars (SVGP) avec un schéma de contrôle à horizon glissant. À partir de simples mesures d'état bruitées, le système infère une distribution postérieure sur la politique latente du robot tiers, mise à jour en continu via un conditionnement variationnel en ligne (OVC), puis propagée dans la dynamique non linéaire du système via un schéma approché de propagation des moments, avant d'alimenter un contrôleur prédictif (MPC) sensible à l'incertitude. La méthode a été testée lors de campagnes Monte Carlo en simulation sous ROS 2, puis validée sur du matériel robotique réel dans une arène intérieure. Il s'agit d'un article de recherche déposé sur arXiv (2607.22225v1), pas d'un produit commercialisé. L'enjeu dépasse l'exercice académique: dans les entrepôts, les usines ou les espaces partagés où circulent plusieurs robots mobiles (AMR) ou humanoïdes issus de flottes ou de fabricants différents, un robot ne connaît généralement pas la politique de contrôle exacte des autres agents évoluant autour de lui. Les méthodes de navigation sûre reposent le plus souvent sur des hypothèses simplificatrices, modèles cinématiques fixes, comportements connus à l'avance, qui s'effondrent dès que l'environnement devient hétérogène. Une approche capable d'apprendre en ligne le comportement d'un agent inconnu tout en garantissant des marges de sécurité formelles répond directement à ce point de friction, potentiellement utile pour l'intégration de flottes multi-fournisseurs. Le travail s'inscrit dans la lignée des recherches combinant processus gaussiens et contrôle prédictif pour la navigation sûre, un axe actif depuis plusieurs années en robotique mobile et en interaction homme-robot. La validation reste toutefois limitée à une arène intérieure contrôlée: le passage à des environnements réels plus complexes, avec davantage d'agents ou des dynamiques plus rapides, constitue la prochaine étape logique avant tout usage industriel.

RecherchePaper
1 source
Milo, un chien-guide robotique entièrement autonome pour intérieur et extérieur
112arXiv cs.RO 

Milo, un chien-guide robotique entièrement autonome pour intérieur et extérieur

Milo est un chien-guide robotique entièrement autonome, présenté dans une prépublication arXiv (arXiv:2607.19530v1), et développé pour un coût matériel d'environ 2 000 dollars, contre près de 50 000 dollars pour l'acquisition et l'entretien d'un chien-guide vivant. La plateforme repose sur un robot quadrupède Unitree Go2 modifié, équipé d'une poignée pour le harnais humain, de capteurs et de tout le calcul embarqué nécessaire, sans dépendance à un serveur externe. Son architecture logicielle combine une pile de perception, cartographie voxel, détection du sol, des obstacles et des piétons, et une pile de navigation fondée sur une politique d'évitement d'obstacles entraînée dans un simulateur vue de dessus (bird's-eye-view) développé en interne. Les auteurs ont testé Milo sur des parcours d'obstacles réels, en intérieur et en extérieur, et l'ont comparé à une approche de référence basée sur une costmap classique, observant une navigation plus fluide et moins de collisions avec le porteur du harnais. L'ensemble, matériel et logiciel, est publié en open source. L'enjeu dépasse la simple démonstration technique. Les chiens-guides robotiques sont envisagés depuis plusieurs années comme alternative aux chiens vivants pour les personnes aveugles ou malvoyantes, mais les prototypes existants butaient sur un problème récurrent: ils nécessitaient un scan 3D préalable de l'environnement ou un calcul déporté, les rendant inutilisables hors d'un cadre contrôlé. En démontrant une autonomie complète, sans connaissance a priori des lieux et sans calcul externe, Milo répond directement à cet écart entre démonstration en laboratoire et déploiement réel, un problème classique en robotique mobile assistive. Le choix de l'open source, à la fois hardware et software, vise explicitement à abaisser la barrière d'accès pour la communauté BLV (blind and low-vision) et pour les chercheurs qui voudraient reproduire ou améliorer la plateforme, plutôt que de verrouiller la technologie derrière un produit commercial fermé. Le projet s'inscrit dans la lignée des travaux académiques sur la navigation collaborative homme-robot utilisant des plateformes quadrupèdes commerciales comme base matérielle, une stratégie déjà explorée par d'autres équipes universitaires mais généralement limitée par l'autonomie de perception. En misant sur un simulateur maison pour l'entraînement de la politique de navigation plutôt que sur des données réelles coûteuses à collecter, les auteurs ouvrent la voie à des itérations rapides. La publication complète du code et des instructions de fabrication laisse présager des reproductions et extensions par la communauté robotique et accessibilité dans les mois à venir.

RecherchePaper
1 source
RAPT : détection de dérive et diagnostic de défaillance par prédiction de modèle pour le déploiement sim-vers-réel d'humanoïdes
113arXiv cs.RO 

RAPT : détection de dérive et diagnostic de défaillance par prédiction de modèle pour le déploiement sim-vers-réel d'humanoïdes

Des chercheurs présentent RAPT (Recurrent Anomaly Probabilistic Trajectory Model), un moniteur de déploiement léger et auto-supervisé fonctionnant à 50 Hz, conçu pour détecter en temps réel les états hors distribution (OOD) lorsqu'une politique de contrôle apprise en simulation est transférée sur un robot humanoïde réel. Le système apprend le comportement d'exécution nominal à partir de données de simulation à grande échelle, puis produit en ligne des signaux de déviation prédictive calibrés, dimension par dimension, permettant de localiser précisément quand et où l'exécution réelle s'écarte du comportement attendu. Pour le diagnostic post-hoc, RAPT combine saillance temporelle, résumés cinématiques articulaires et raisonnement sémantique par LLM afin de classifier les causes probables d'échec en mode zero-shot. En simulation, sur quatre tâches Isaac Lab, RAPT améliore le taux de vrais positifs (TPR) de 37% par rapport à la meilleure référence existante, à un taux de faux positifs au niveau épisode limité à 0,5%. Sur matériel réel, il atteint 89% de TPR sur 78 essais, avec moins de faux positifs que les approches concurrentes compatibles haute fréquence, et 75% de précision de diagnostic sémantique sur 21 catégories d'échecs, sur un sous-ensemble de cas OOD jugés difficiles. L'enjeu dépasse la simple détection d'anomalie: c'est le problème du "silent failure" après transfert sim-to-real qui est visé, ces politiques qui semblent robustes en simulation mais entrent en territoire inconnu sur le robot réel sans que rien ne le signale, avec un risque direct de casse matérielle. Pour les intégrateurs et équipes R&D qui déploient des politiques VLA ou apprises par renforcement sur humanoïdes ou bras robotiques, un moniteur capable de tenir la cadence du contrôle temps réel tout en gardant un taux de fausses alertes très bas comble un manque concret entre recherche en simulation et fiabilité opérationnelle sur le terrain. RAPT s'inscrit dans la lignée des travaux sur la détection d'anomalies pour systèmes robotiques appris, un domaine où la plupart des détecteurs existants échouent soit sur la fréquence de fonctionnement, soit sur le taux de faux positifs, soit sur l'interprétabilité du diagnostic. Le papier, publié sur arXiv en version 2, met à disposition code, site projet et vidéos de démonstration, ouvrant la voie à une adoption par d'autres équipes travaillant sur le déploiement sécurisé de politiques apprises en simulation.

RecherchePaper
1 source
Reasoning à double tranchant : architecture et robustesse inter-étapes des modèles vision-langage-action
114arXiv cs.RO 

Reasoning à double tranchant : architecture et robustesse inter-étapes des modèles vision-langage-action

Voici l'article traduit et résumé. Une équipe de recherche publie sur arXiv (arXiv:2607.17786, 24 juillet 2026) une étude testant si le raisonnement améliore la robustesse des modèles Vision-Language-Action (VLA) face aux perturbations. Trois architectures couvrant le spectre du raisonnement ont été comparées : un modèle sans raisonnement, un modèle à chaîne de raisonnement textuelle (chain-of-thought), et un modèle à boucle itérative latente. Chaque architecture a été soumise à des perturbations aux étages vision, raisonnement et action, sur deux bancs d'essai standards de la robotique manipulatrice, LIBERO et SimplerEnv. Résultat central : le modèle à raisonnement latent itératif s'effondre en taux de réussite sous bruit stochastique comme sous attaque adversariale en boîte blanche, alors que les deux autres architectures tiennent. Les chercheurs montrent que cette fragilité est structurelle et non cumulative, puisque faire varier la profondeur de raisonnement à l'inférence ne change presque rien au problème. Ils testent également des sondes de sécurité censées lire le raisonnement en temps réel pour détecter une anomalie : une sonde de cohérence plan-action, qui semblait quasi parfaite sous évaluation naïve, retombe au niveau du hasard sous attaque adaptative. Ce résultat va à contre-courant d'une hypothèse répandue dans la robotique embarquée par IA, à savoir que faire "réfléchir" un modèle avant d'agir le rend mécaniquement plus fiable face à des entrées bruitées ou adverses, comme un capteur dégradé ou une caméra masquée sur un robot humanoïde ou un AMR en usine. Pour les intégrateurs et décideurs B2B qui évaluent des architectures de type Pi-0, GR00T N2 ou Helix pour du déploiement industriel, l'étude suggère que le choix d'un module de raisonnement latent, souvent présenté comme plus performant sur les tâches complexes, peut introduire un point de défaillance critique en environnement réel non contrôlé. Elle contredit aussi l'idée que le monitoring du raisonnement interne suffirait à sécuriser ces systèmes : les auteurs montrent que combiner une sonde de cohérence avec une sonde d'anomalie sur l'action, même calibrée à taux de fausses alertes constant, ne permet jamais de dépasser les performances d'un système non défendu. Cette publication s'inscrit dans un courant de recherche en sécurité IA appliquée à la robotique qui cherche à quantifier le "reality gap" entre démonstrations et déploiements réels des modèles VLA, une question centrale alors que des acteurs comme Figure, Physical Intelligence ou NVIDIA multiplient les annonces de modèles généralistes pour bras robotiques et humanoïdes. Les auteurs cadrent explicitement leurs résultats comme un préalable : toute défense crédible contre les perturbations en boîte blanche à l'étage vision devra d'abord franchir ce plafond de performance avant de prétendre sécuriser des déploiements réels, ce qui laisse ouverte la question des architectures et protocoles de test à concevoir pour la suite.

RecherchePaper
1 source
RoboTTT : mise à l'échelle du contexte pour les politiques robotiques
115arXiv cs.RO 

RoboTTT : mise à l'échelle du contexte pour les politiques robotiques

NVIDIA, via son laboratoire de recherche GEAR (research.nvidia.com/labs/gear), publie RoboTTT (Test-Time-Training Robot Policies), un modèle et une recette d'entraînement qui étendent le contexte visuomoteur des politiques robotiques à 8 000 pas de temps, soit trois ordres de grandeur au-delà des modèles de référence actuels qui opèrent en une seule étape ou sur un historique court, sans augmenter la latence d'inférence. Sur des tâches réelles de manipulation robotique, RoboTTT améliore les performances globales de 87% par rapport à une base à contexte unique et parvient à compléter intégralement une tâche d'assemblage de cinq minutes en dix étapes, ce qu'aucun modèle de référence testé n'accomplit. La version entraînée avec un contexte de 8 000 pas de temps surpasse de 62% la même architecture pré-entraînée avec seulement 1 000 pas de temps. Le mécanisme repose sur l'intégration du Test-Time Training dans des politiques Vision-Language-Action: l'état récurrent du modèle est constitué de "fast weights", des paramètres mis à jour par descente de gradient pendant l'entraînement et l'inférence, qui compressent l'historique en poids plutôt qu'en tokens de contexte classiques. Cette approche déplace un verrou connu du secteur: jusqu'ici, allonger le contexte des politiques robotiques se heurtait au coût de calcul en inférence. RoboTTT découple les deux, ouvrant la voie à des capacités nouvelles pour les intégrateurs: imitation en contexte à partir d'une seule démonstration vidéo humaine sans réentraînement, amélioration de la politique à la volée, et meilleure robustesse aux perturbations sur des tâches longues et multi-étapes. Les auteurs notent, pour la première fois selon eux, une progression régulière des performances en boucle fermée à mesure que le contexte de pré-entraînement augmente, ce qui positionne la longueur de contexte comme un nouvel axe de scaling pour les modèles fondation robotiques, au même titre que la taille des paramètres ou le volume de données. RoboTTT s'inscrit dans la lignée des politiques VLA telles que Pi-0 ou GR00T N2, dont l'entraînement combine ici le "sequence action forcing" et la rétropropagation tronquée dans le temps pour gérer un contexte aussi long. Il s'agit à ce stade d'un article de recherche (arXiv, preprint) accompagné de vidéos de démonstration, sans indication de déploiement industriel ni de calendrier de commercialisation.

IA physiqueActu
1 source
DECO : transformateur de diffusion multimodal découplé pour la manipulation dextre bimanuelle avec adaptateur tactile enfichable
116arXiv cs.RO 

DECO : transformateur de diffusion multimodal découplé pour la manipulation dextre bimanuelle avec adaptateur tactile enfichable

DECO (Decoupled multimodal Diffusion transformer for bimanual dExterous manipulatiOn) est un nouveau modèle de politique robotique présenté dans un papier arXiv (2602.05513v3) qui sépare explicitement le traitement de la vision, de la proprioception et du tactile via des voies de conditionnement dédiées, plutôt que de fusionner ces signaux en amont comme le font la plupart des architectures existantes. Un adaptateur tactile léger permet d'injecter le signal de toucher de façon paramétrique-efficace, sans réentraîner l'ensemble du réseau. Les auteurs publient aussi DECO-50, un jeu de données de 50 heures et plus de 5 millions de frames, collecté par téléopération sur de vrais robots à deux bras équipés de capteurs tactiles. Sur plus de 2 000 essais réels (pas de simulation), DECO atteint un taux de réussite moyen de 72,25%, soit 21 points de mieux que la meilleure référence testée. L'ajout de l'adaptateur tactile apporte 10,25 points de réussite supplémentaires en moyenne, et jusqu'à 20 points sur les tâches à contact riche, tout en ne réajustant que moins de 10% des paramètres du modèle. Ce résultat compte parce qu'il s'attaque à un point de friction connu des politiques de manipulation bimanuelle: la fusion multimodale brute dégrade souvent les performances quand un des signaux (typiquement le tactile) est bruité ou absent, et le réentraînement complet pour intégrer un nouveau capteur reste coûteux. Découpler les modalités et rendre l'ajout de signaux modulaire via un adaptateur va dans le sens d'une approche plus industrialisable pour les intégrateurs qui veulent équiper des mains ou pinces existantes de tactile sans repartir d'un modèle de zéro. Le volume d'essais réels (2 000+) et le jeu de données ouvert de 50 heures renforcent aussi la crédibilité par rapport aux annonces qui ne reposent que sur quelques démonstrations sélectionnées. Le travail s'inscrit dans la vague des transformeurs de diffusion appliqués aux politiques robotiques (diffusion policy), une famille d'approches également explorée par des modèles vision-langage-action comme Pi-0 ou GR00T N2, mais ici recentrée spécifiquement sur la dextérité bimanuelle et l'intégration tactile plutôt que sur la généralisation multi-tâches à grande échelle. La publication conjointe du dataset DECO-50 laisse présager des comparaisons à venir avec d'autres politiques entraînées sur les mêmes données, un terrain encore rare dans la manipulation dextre où chaque laboratoire collecte ses propres démonstrations.

IA physiqueOpinion
1 source
Effets du toucher robotique sur des personnes âgées guidées à la marche par un robot humanoïde
117arXiv cs.RO 

Effets du toucher robotique sur des personnes âgées guidées à la marche par un robot humanoïde

Une étude publiée sur arXiv (arXiv:2607.09323, 13 juillet 2026) évalue comment des personnes âgées perçoivent le contact physique avec un robot d'assistance à la marche. Vingt-quatre participants âgés de 68 à 88 ans ont parcouru à quatre reprises une trajectoire de dix mètres guidés par le robot humanoïde TIAGo Pro (PAL Robotics), selon quatre modalités de contact : aucun contact physique (NC), prise de poignet main dans main (HH), bras liés comme en accompagnement humain (LA), et appui de l'avant-bras contre l'avant-bras du robot (FC). Les chercheurs ont combiné mesures physiologiques (électrocardiogramme, activité électrodermale), force de contact, distance interpersonnelle au robot et questionnaires subjectifs pour caractériser la réponse des participants à chaque mode d'interaction. Les résultats montrent une légère hausse du stress physiologique lors du contact avec le robot, mais une acceptation globale confirmée par les mesures comportementales et déclaratives. Les deux conditions impliquant les forces d'interaction les plus élevées, HH et FC, sont associées à une distance plus réduite entre le participant et le robot, signe d'une confiance et d'un confort accrus, un résultat corroboré par les questionnaires où sécurité perçue, confiance et confort ressortent plus fortement pour ces deux modalités. Pour l'industrie de la robotique de service et d'assistance gériatrique, ce travail apporte une donnée concrète rare dans un domaine où les démonstrations dépassent souvent la validation clinique : un contact ferme et stable est préféré à l'absence de contact chez les seniors, ce qui oriente directement les choix d'actionneurs, de préhenseurs et de stratégies de contrôle en force pour les robots d'accompagnement. Ce travail s'inscrit dans un contexte de pénurie de personnel soignant qui pousse les établissements gériatriques à envisager l'assistance robotique comme complément, notamment pour la mobilité, domaine où les capacités de navigation déclinent avec l'âge. Le choix du TIAGo Pro, plateforme mobile à bras déjà utilisée dans plusieurs projets de recherche en robotique d'assistance, illustre la maturité relative de cette catégorie de robots pour des essais avec humains fragiles. Les auteurs présentent leurs résultats comme une base de conception pour de futurs systèmes de guidage à la marche, sans toutefois évoquer de déploiement en établissement ni de calendrier de commercialisation.

UEPAL Robotics, entreprise espagnole, fournit la plateforme TIAGo Pro utilisee dans cette etude, illustrant l'expertise europeenne en robotique d'assistance geriatrique et orientant les choix de conception (actionneurs, prehenseurs) pour de futurs robots d'accompagnement en UE.

RecherchePaper
1 source
DemoBridge : une boîte à outils de simulation en boucle pour le retargeting de démonstrations humaines en vue unique
118arXiv cs.RO 

DemoBridge : une boîte à outils de simulation en boucle pour le retargeting de démonstrations humaines en vue unique

Une équipe de l'université KU Leuven (Belgique) publie DemoBridge, un outil qui transforme un enregistrement vidéo unique, en stéréo RGB, d'une démonstration manuelle humaine en une trajectoire de bras robotique exécutable et validée par simulation physique. Décrit dans un preprint arXiv daté du 13 juillet 2026 (arXiv:2607.09519), le système repose sur un planificateur unique conscient des collisions qui optimise la trajectoire articulaire complète en une seule passe, en tenant compte simultanément des poses de préhension alternatives, des collisions du bras et de l'objet saisi, et de la fidélité au geste démontré. Un simulateur physique tourne en boucle pendant la génération, valide chaque phase et revient en arrière en cas d'échec plutôt que d'abandonner la démonstration : le geste est replanifié, pas jeté. Le timing de la prise est déduit automatiquement, et les modules de perception, le modèle de robot et les étapes du pipeline sont interchangeables par configuration. L'équipe a testé l'ensemble du pipeline sur trois tâches réelles et évalué le planificateur seul sur un benchmark synthétique contrôlé. Le code est disponible sur le GitLab de KU Leuven. L'enjeu visé est le fossé d'incarnation ("embodiment gap") : un bras robotique, avec ses longs segments articulés, occupe bien plus de volume de collision qu'une main humaine, si bien que la cinématique inverse appliquée telle quelle à une pose de préhension démontrée n'a souvent aucune solution sans collision. Ce verrou freine l'apprentissage par démonstration à bas coût, où une simple vidéo caméra unique remplacerait la téléopération coûteuse utilisée pour collecter des données d'entraînement de modèles vision-langage-action comme Pi-0 ou GR00T N2. En doublant chaque démonstration retargetée d'un rollout de simulation exploitable pour l'apprentissage de politiques, DemoBridge s'inscrit directement dans la course à des données de manipulation moins chères à générer. Il s'agit d'un travail académique préliminaire, non d'un produit commercialisé : l'évaluation reste limitée à trois tâches réelles et un benchmark synthétique, sans déploiement industriel annoncé. Le choix d'une vue unique plutôt qu'un rig multi-caméras vise justement l'accessibilité, un axe que suivent aussi des laboratoires concurrents cherchant à réduire le coût de collecte de données d'imitation face aux approches par téléopération dominantes chez les acteurs américains du secteur.

UEUne équipe universitaire belge (KU Leuven) publie en open-source un outil de retargeting de démonstrations, réduisant potentiellement le coût de collecte de données d'apprentissage par imitation pour les laboratoires robotiques européens.

FR/EU ecosystemePaper
1 source
Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels
119arXiv cs.RO 

Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels

Des chercheurs ont publié sur arXiv (2508.12435) une étude démontrant qu'un robot industriel peut reconnaître des gestes tactiles humains en exploitant uniquement ses capteurs articulaires intégrés, sans aucun capteur externe. Implémentée sur un bras Franka Emika Research (7 DOF), l'approche s'appuie sur des architectures CNN évaluées sur un dataset collecté spécifiquement pour l'expérience. Deux méthodes ont atteint plus de 95 % de précision en détection de contact et classification de gestes : STFT2DCNN, qui applique une transformée de Fourier à court terme pour générer des spectrogrammes 2D, et STT3DCNN, qui exploite des représentations temps-fréquence tridimensionnelles. La variable déterminante n'est pas le choix d'architecture CNN mais la représentation des données : passer des séries temporelles brutes aux spectrogrammes fait bondir les performances de façon significative. L'implication industrielle est directe. Équiper un robot d'une peau tactile ou de caméras supplémentaires pour détecter l'intention humaine coûte cher, complexifie l'intégration et fragilise la maintenance. Prouver que les couples et positions articulaires déjà remontés par le contrôleur suffisent à atteindre 95 % de précision ouvre une voie de déploiement à coût quasi nul pour la collaboration homme-robot dans les cellules existantes. Les modèles spectraux montrent également une meilleure généralisation à de nouvelles configurations articulaires, ce qui est un signal positif pour des applications où le robot change fréquemment de posture de travail. Cela dit, les performances sont mesurées en laboratoire sur un seul modèle de robot et un dataset maison dont la taille et la diversité ne sont pas précisées dans l'abstract, ce qui invite à la prudence avant de conclure à une généralisation industrielle immédiate. La reconnaissance tactile sans peau robotique est un chantier actif depuis plusieurs années, notamment dans les labos qui travaillent sur la conformance mécanique (robots cobots comme le Franka, UR, ou le Kinova). Des approches concurrentes s'appuient sur des capteurs de force-couple au poignet (ATI, Robotiq FT300), des peaux à électrodes capacitives, ou la vision RGB-D pour inférer l'intention de contact, chacune avec un surcoût matériel substantiel. Ce travail positionne les signaux proprioceptifs comme une alternative viable et souligne que le verrou n'est pas hardware mais algorithmique. Les prochaines étapes probables : validation sur d'autres plateformes (UR10, KUKA iiwa), extension à des gestes plus complexes, et tests en conditions industrielles réelles avec bruit vibratoire ambiant.

UELa validation s'appuie sur un bras Franka Emika (plateforme allemande dominante dans les labos et cellules cobots européens) : si confirmée sur d'autres plateformes, cette approche offrirait aux intégrateurs EU une voie de déploiement HRI à coût quasi nul sans capteurs supplémentaires.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle
120arXiv cs.RO 

Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle

Des chercheurs ont publié sur arXiv (preprint 2606.30456) une évaluation du transfert de modèles VLA (Vision-Language-Action) vers un bras manipulateur UR5e d'Universal Robots en conditions réelles. Deux modèles ont été mis à l'épreuve : OpenVLA et sa variante OpenVLA-OFT, fine-tunés sur des données collectées directement sur le robot physique et converties au format RLDS (Robot Learning Dataset Specification), un standard de facto dans la communauté robotique. L'équipe a construit une chaîne complète comprenant l'acquisition de données sur robot réel, un workflow de conversion de dataset compatible RLDS, une infrastructure de fine-tuning et d'inférence, ainsi qu'un protocole de validation systématique des représentations d'actions et des interfaces de contrôle. Le résultat central contredit une hypothèse répandue dans la recherche VLA : des métriques offline prometteuses ne se traduisent pas nécessairement en comportement stable en boucle fermée sur le système physique. Cet écart entre indicateurs de validation et exécution réelle n'est pas principalement imputable à la capacité intrinsèque des modèles. Il est fortement conditionné par la sémantique des actions (comment sont encodées les commandes moteur), les conventions de référentiels de coordonnées, l'alignement temporel entre la vision et les sorties de contrôle, la cohérence du prétraitement d'image, et la couverture du dataset d'entraînement. La conclusion opérationnelle est directe : pour des intégrateurs industriels, augmenter la taille du modèle VLA n'est pas le levier prioritaire ; c'est la maîtrise du pipeline données-modèle-contrôle dans son ensemble qui détermine la fiabilité du déploiement, un déplacement de paradigme du problème de modèle vers un problème de système. Ce travail s'inscrit dans un contexte d'accélération marquée autour des VLA, portée par des modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) ou encore ACT et Diffusion Policy, qui promettent une généralisation des politiques de manipulation via des architectures multimodales entraînées à large échelle. La plupart des démonstrations publiées restent toutefois en environnement contrôlé, et les conditions précises du passage au déploiement réel sont rarement documentées avec rigueur. En s'appuyant sur une plateforme reproductible et des formats ouverts (UR5e, RLDS), cette étude fournit un cadre méthodologique directement transférable, utile pour les équipes cherchant à qualifier leurs pipelines VLA avant mise en production, y compris côté européen où des acteurs comme Enchanted Tools travaillent sur des approches similaires de généralisation de politiques de manipulation.

UELe cadre méthodologique open-source (UR5e + RLDS) est directement réutilisable par les équipes européennes qualifiant leurs pipelines VLA avant production, notamment pour des acteurs comme Enchanted Tools travaillant sur la généralisation des politiques de manipulation.

💬 Ce que montrent ces chercheurs, c'est qu'en robotique VLA, le problème n'est pas le modèle. Des métriques offline prometteuses ne prédisent pas le comportement en boucle fermée sur le vrai robot, et ce qui change tout c'est le pipeline complet (encodage des actions, conventions de coordonnées, alignement temporel). Reste à voir combien d'équipes industrielles vont enfin arrêter de chercher un modèle plus gros et commencer par auditer leur dataset.

IA physiqueOpinion
1 source
Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées
121arXiv cs.RO 

Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées

Des chercheurs ont déposé fin juin 2026 sur arXiv (réf. 2606.28529) une étude qui remet en question une hypothèse centrale de l'optimisation des modèles robotiques de fondation : supposer qu'une latence d'inférence réduite par pas d'action améliore mécaniquement les performances à l'échelle de la tâche. Le papier introduit TISED (Task-level Inference Speedup Effect Decomposition), un cadre analytique unifiant les techniques "avec perte" couramment appliquées aux modèles embarqués, notamment la quantization, l'élagage (pruning) et l'inférence asynchrone. L'étude documente trois paradoxes sur deux familles de tâches : sur les tâches statiques, l'optimisation peut allonger le temps d'exécution total même quand la latence par action diminue ; sur les tâches dynamiques, une compression modérée peut faire monter le taux de succès au-dessus de la ligne de base non-optimisée ; et l'emplacement du point d'équilibre optimal dépend de la configuration matérielle du robot. Ce résultat interroge directement les équipes déployant des VLA (Vision-Language-Action) en production, qu'il s'agisse de bras manipulateurs en usine ou de robots humanoïdes en entrepôt. L'industrie a massivement adopté la quantization et le pruning en supposant un arbitrage simple : un peu de qualité d'action contre une réduction de latence et de coût de calcul. TISED montre que ce compromis est trompeur. Sur les tâches statiques à longues séquences, la dégradation par pas s'accumule et peut effacer le gain de vitesse global. Sur les tâches dynamiques, la boucle fermée propre à l'exécution robotique crée des dynamiques que les benchmarks statiques ne capturent pas, ce qui explique pourquoi un modèle légèrement compressé peut paradoxalement mieux performer en répondant plus fréquemment à l'environnement. Ce travail s'inscrit dans la course à l'inférence rapide portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous contraints à tourner sur du matériel embarqué limité. L'enjeu est particulièrement critique pour les acteurs qui visent un déploiement à grande échelle, comme Figure AI dans ses usines BMW, ou les plateformes AMR européennes comme Exotec. TISED reste à ce stade un preprint non évalué par les pairs, sans validation publiée sur du matériel physique ; les prochaines étapes naturelles seraient une confrontation avec des benchmarks standard comme RoboMimic ou Calvin, et des tests sur des plateformes réelles comme Unitree ou Franka.

UELes plateformes AMR européennes comme Exotec, qui déploient ou évaluent des systèmes VLA embarqués, devront réévaluer leurs hypothèses d'optimisation d'inférence (quantization, pruning) à la lumière des paradoxes documentés par TISED avant tout déploiement à grande échelle.

RechercheOpinion
1 source
WatchAct : un benchmark de manipulation robotique fondée sur le comportement
122arXiv cs.RO 

WatchAct : un benchmark de manipulation robotique fondée sur le comportement

Une équipe de chercheurs a publié WatchAct (arXiv:2606.26443), un nouveau benchmark pour la manipulation robotique fondé sur l'observation du comportement humain. Contrairement aux évaluations existantes, qui associent une instruction textuelle à une image statique, WatchAct impose aux systèmes robotiques de raisonner à partir d'une vidéo montrant un humain accomplir une tâche, puis d'en déduire un plan d'action exécutable. Le benchmark comprend 3 000 instances réparties sur 14 tâches dans quatre domaines cognitifs : compréhension des événements (Event Grounding), récupération de la structure procédurale (Procedural Reasoning), inférence d'intentions implicites (Implicit Intent Inference) et suivi des modifications de scène (Episodic Reasoning). Chaque instance couple une vidéo réelle, une instruction en langue naturelle, une scène simulée dans le framework LIBERO et une tâche exécutable sur un robot Franka Research 3. Le meilleur pipeline testé, associant Gemini-3.1-Pro et le modèle π₀.₅ de Physical Intelligence, atteint seulement 16,3 % de taux de réussite en simulation et 14,0 % sur robot réel. Ces chiffres révèlent un fossé considérable entre capacités humaines et systèmes actuels. Sur la seule composante de planification vidéo-vers-plan, Gemini-3.1-Pro obtient 36,8 % de Plan SR, contre 97,1 % pour les humains, soit un écart de plus de 60 points de pourcentage. Même avec un plan oracle fourni directement, sans recours à un VLM, π₀.₅ ne dépasse pas 21,5 % de Task SR, et chute à 10,6 % sur des scénarios hors domaine. Le protocole d'évaluation décomposé de WatchAct, qui mesure séparément le raisonnement VLM, l'exécution de la politique robotique et la performance bout-en-bout, est méthodologiquement précieux : il permet d'identifier précisément où chaque composant échoue, plutôt que d'observer un taux global difficile à interpréter. Pour les intégrateurs et les équipes R&D industrielles, ce résultat indique que ni les grands modèles vision-langage actuels ni les politiques de manipulation ne sont prêts pour des scénarios de collaboration humain-robot en environnement non structuré. WatchAct s'inscrit dans une tendance de fond visant à dépasser les benchmarks « instruction + image unique » qui ne capturent pas la complexité temporelle du travail réel en atelier ou en logistique. Les évaluations existantes comme LIBERO (utilisé ici comme substrat de simulation), RoboSuite ou BridgeData évaluent principalement l'exécution sous contraintes statiques. WatchAct introduit une dimension de video-grounding qui rapproche l'évaluation des conditions réelles, où un robot doit comprendre ce qu'un collègue humain vient de faire pour enchaîner correctement. Le modèle π₀.₅ est développé par Physical Intelligence, l'une des startups VLA les plus suivies du secteur aux côtés de Figure AI, Agility Robotics et 1X Technologies. Aucun acteur européen n'est impliqué dans ce benchmark. Le dataset et le code sont disponibles publiquement ; les prochaines étapes naturelles incluent l'intégration de modèles de raisonnement vidéo plus récents et l'extension à des scénarios multi-agents.

RechercheOpinion
1 source
Action ControlNet : un adaptateur léger sensible aux délais pour un contrôle asynchrone fluide dans les modèles VLA
123arXiv cs.RO 

Action ControlNet : un adaptateur léger sensible aux délais pour un contrôle asynchrone fluide dans les modèles VLA

Des chercheurs ont mis en ligne le 25 juin 2026 sur arXiv (réf. 2606.25985) Action ControlNet (ACNet), un adaptateur léger pour modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. Le problème ciblé : les VLA génèrent des actions par blocs ("chunks"), mais leur latence d'inférence impose une exécution asynchrone, c'est-à-dire que le robot continue à bouger pendant que le modèle calcule le chunk suivant. La jonction entre deux chunks produit alors des discontinuités (jitter d'action, ruptures de trajectoire) qui dégradent les performances, particulièrement dans les tâches en contact (assemblage, insertion). ACNet insère un module adaptateur qui conditionne la prédiction du prochain chunk sur le "motion suffix" déjà exécuté, permettant une transition cohérente avec l'état réel du robot au moment du handoff. Le backbone préentraîné reste figé ; seul l'adaptateur est entraîné, avec peu de paramètres supplémentaires. La méthode est compatible avec les têtes d'action de type diffusion et flow matching. Les évaluations couvrent les simulateurs Kinetix et Meta-World MT50 (50 tâches variées) ainsi qu'un bras réel SO-ARM101 ; ACNet surpasse le chunk stitching direct en fluidité et robustesse sous délai d'inférence, et reste plus léger qu'un réentraînement complet "delay-conditioned". Ce résultat intéresse directement les équipes de déploiement robotique : il propose une correction modulaire de l'asynchronisme sans toucher aux modèles de base. Les VLA de grande taille, notamment Pi-0 (Physical Intelligence), OpenVLA et Octo, souffrent tous du même problème ; une solution par adaptateur plug-in réduit sensiblement le coût d'adaptation. La compatibilité déclarée avec les têtes diffusion et flow matching couvre la majorité des architectures VLA actuelles, ce qui élargit la portée pratique. Nuance à retenir : les tests réels se limitent à un seul bras manipulateur à effecteur unique ; la généralisation à des configurations multi-bras ou à charge variable en environnement industriel reste à démontrer, et les benchmarks simulés ne reproduisent pas la complexité des lignes de production. Le problème de latence d'inférence dans les VLA est documenté depuis RT-2 (Google DeepMind, 2023) et a motivé des travaux comme Diffusion Policy et ACT (Action Chunking with Transformers). Les solutions existantes exigeaient soit un réentraînement complet du modèle avec conditionnement sur le délai, soit une logique de runtime spécifique à chaque architecture, deux contraintes qui freinent l'adoption industrielle. ACNet se positionne comme une alternative plus légère et plus générique. Dans l'écosystème concurrent, Physical Intelligence, Figure AI (Figure 03), 1X Technologies et Agility Robotics travaillent tous sur des pipelines VLA haut débit pour leurs plateformes humanoïdes et manipulateurs ; une intégration dans des frameworks open-source comme Lerobot (Hugging Face) pourrait accélérer le passage de la démonstration au déploiement réel. Ce preprint ne mentionne ni partenariat industriel ni timeline commercial.

UEUne intégration potentielle dans Lerobot (Hugging Face, Paris) pourrait permettre aux équipes R&D robotique européennes d'adopter cette correction d'asynchronisme sans réentraîner leurs modèles VLA de base.

💬 Le jitter entre chunks dans les VLA, tout le monde le subit depuis RT-2, et les fixes existants exigeaient de réentraîner le modèle complet. ACNet contourne ça avec un adaptateur qui conditionne le chunk suivant sur ce que le bras a déjà bougé, sans toucher le backbone. Un seul bras testé en vrai, donc l'industrie attendra, mais si ça rentre dans Lerobot, c'est une correction plug-in que les équipes vont adopter vite.

IA physiqueActu
1 source
EquiDexFlow : un modèle génératif de préhension habile équivariant SE(3) ancré dans le contact
124arXiv cs.RO 

EquiDexFlow : un modèle génératif de préhension habile équivariant SE(3) ancré dans le contact

Une équipe de chercheurs publie EquiDexFlow, un modèle génératif de préhension dextère intégrant les contraintes physiques de contact directement dans l'architecture, sans étape de vérification séparée. Publié sur arXiv en juin 2026, il exploite le flow-matching avec équivariance SE(3) pour prédire simultanément la pose du poignet, les angles articulaires, les contacts du bout des doigts, les normales de surface et les forces de contact à partir d'un nuage de points de l'objet. Contrairement aux générateurs classiques qui traitent les forces comme un filtre a posteriori, EquiDexFlow projette les contacts sur la surface de l'objet et les forces dans le cône de friction de Coulomb par construction, sans terme de pénalité dans la fonction de perte. Entraîné sur 8 100 saisies en fermeture de force sur 81 objets pour la main Allegro à 16 degrés de liberté (DDL), il atteint zéro violation de frottement et le plus faible résidu de torseur parmi toutes les variantes d'ablation, avec une équivariance SE(3) vérifiée sur 200 rotations et des résidus de poignet inférieurs à 0,04 degré. Retransposé vers une main LEAP à 16 DDL par cinématique inverse doigt par doigt, le modèle réussit en boucle ouverte sur six objets physiques, y compris des objets asymétriques à la pose canonique et après une co-rotation de 120 degrés. Le verrou adressé est structurel : dans la plupart des pipelines de préhension dextère appris, un générateur produit une pose cinématiquement valide qu'un module aval filtre selon des critères physiques, laissant potentiellement passer des saisies plausibles mais instables au contact réel. En intégrant le cône de Coulomb dans l'architecture même, EquiDexFlow élimine cette classe d'erreurs par construction plutôt que par filtrage, ce qui réduit le taux de rejet et simplifie le pipeline de déploiement pour les intégrateurs industriels. Le retargeting réussi de la main Allegro vers la main LEAP suggère en outre une généralisation de la représentation des contacts au-delà de la main d'entraînement, propriété encore rare dans les systèmes de préhension dextère actuels, même si l'évaluation sur six objets reste un périmètre de test limité. La préhension dextère multi-doigt demeure un verrou central de la manipulation généraliste en robotique. Des travaux récents comme DexGraspNet ou UniGrasp ont progressé sur la génération de poses, mais la modélisation explicite des forces dans la boucle générative reste peu courante. Le flow-matching, popularisé dans les modèles VLA (Vision-Language-Action), est ici appliqué avec une contrainte d'équivariance formellement démontrée, ce qui constitue une contribution méthodologique distincte. Code, checkpoints et vidéos sont disponibles sur equidexflow.github.io. Des acteurs comme Enchanted Tools ou Wandercraft, qui développent des systèmes de manipulation à actionnement avancé, pourraient s'appuyer sur ce formalisme pour leurs propres pipelines de préhension.

UEEnchanted Tools et Wandercraft, acteurs français de la manipulation avancée, pourraient directement intégrer ce formalisme de préhension physique (cône de Coulomb dans la boucle générative) dans leurs pipelines R&D, le code et les checkpoints étant publiquement disponibles.

RecherchePaper
1 source
Efficacité remarquable des mélanges de processus gaussiens en temps discret pour l'apprentissage de politiques robotiques
125arXiv cs.RO 

Efficacité remarquable des mélanges de processus gaussiens en temps discret pour l'apprentissage de politiques robotiques

MiDiGap (Mixture of Discrete-time Gaussian Processes) est une méthode d'apprentissage par imitation pour la manipulation robotique, publiée en mai 2025 en preprint arXiv (2505.03296v2) par des chercheurs de l'Université de Fribourg-en-Brisgau. Elle apprend des politiques de contrôle à partir de seulement cinq démonstrations, en utilisant uniquement des observations caméra, et converge en moins d'une minute sur CPU standard. Le spectre de tâches couvert est large: comportements à longue horizon comme préparer un café, mouvements très contraints comme ouvrir une porte, actions dynamiques comme manier une spatule, et tâches multimodales comme accrocher une tasse. Sur le benchmark simulé RLBench, la méthode affiche un gain de 76 points de pourcentage de succès sur les tâches contraintes, réduit le coût de trajectoire de 67%, et progresse de 48 points sur les tâches multimodales avec une efficacité d'échantillonnage multipliée par 20. En transfert cross-embodiment, c'est-à-dire l'adaptation d'une politique à un robot de morphologie différente sans réentraînement complet, le taux de succès est plus que doublé. Le code est publié en open-source. L'enjeu principal est le coût d'entrée à l'apprentissage par imitation. Les architectures actuellement dominantes, Diffusion Policy (Columbia), ACT (Stanford/Berkeley) ou les VLA comme Pi-0 de Physical Intelligence, nécessitent des milliers de démonstrations et des ressources GPU conséquentes. Une méthode compétitive opérant sur CPU en moins d'une minute élargit concrètement l'accès aux intégrateurs et PME robotiques sans infrastructure ML dédiée. La fonctionnalité de pilotage à l'inférence (inference-time steering) est aussi notable: en injectant des signaux de collision ou des contraintes cinématiques du robot directement à l'inférence, sans réentraînement, MiDiGap permet une adaptation dynamique aux contraintes physiques réelles, propriété rare dans les méthodes actuelles et potentiellement précieuse pour les déploiements industriels. L'Université de Fribourg-en-Brisgau s'impose ici comme un acteur européen de poids dans l'apprentissage robotique, aux côtés d'ETH Zurich et du DLR. MiDiGap entre en concurrence directe avec Diffusion Policy, ACT, mais aussi avec les fondations propriétaires comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). Un bémol important: toutes les métriques annoncées proviennent de RLBench, un benchmark entièrement en simulation. La robustesse sim-to-real, c'est-à-dire le maintien des performances sur des robots réels dans des conditions non contrôlées, reste à démontrer. La mise en open-source sur midigap.cs.uni-freiburg.de devrait permettre une évaluation indépendante et une validation sur plateformes réelles dans les prochains mois.

UEL'Université de Fribourg-en-Brisgau (Allemagne) produit un concurrent open-source direct aux fondations propriétaires américaines (Pi-0, GR00T N2), accessible sans GPU aux intégrateurs et PME robotiques européens, renforçant la capacité européenne en apprentissage robotique face aux acteurs US.

RecherchePaper
1 source
Démontage de batteries lithium-ion 18650 en fin de vie par robot humanoïde à deux bras guidé par vision
126arXiv cs.RO 

Démontage de batteries lithium-ion 18650 en fin de vie par robot humanoïde à deux bras guidé par vision

Une équipe de recherche a publié sur arXiv (référence 2606.08152) un pipeline robotique bi-bras guidé par vision pour le démontage automatisé de blocs de batteries lithium-ion 18650 en fin de vie. Le système cible des packs de 21 cellules cylindriques, caractéristiques des véhicules électriques et de l'électronique grand public, et les désassemble depuis une pose initiale quelconque, sans fixation externe ni outillage spécialisé. L'architecture repose sur des pinces à mâchoires parallèles standard, une caméra RGB-D au poignet et un détecteur de préhension pré-entraîné. Les résultats mesurés sur banc : 8 démontages complets réussis sur 10 tentatives, une erreur quadratique moyenne de localisation cellule de 2,4 mm, et un temps de cycle moyen de 6,0 minutes par pack. Un mécanisme de transfert de support entre les deux bras en cours de tâche permet d'étendre l'espace de travail effectif sans ancrage externe. La contribution technique centrale est la gestion de l'incertitude de pose : une pile perception "learn-and-filter" couplée à des corrections look-and-move par caméra au poignet absorbe les variations d'orientation du pack à l'entrée du cycle. C'est précisément ce verrou, pose inconnue et absence de gabarit, que les systèmes robotiques existants ne résolvent pas : ils présupposent des packs positionnés et calés. Pour un intégrateur ou un opérateur de centre de recyclage, cela change le profil d'investissement : supprimer les convoyeurs de présentation et les gabarits rigides réduit les coûts de ligne et ouvre la voie à des formats de packs hétérogènes. À noter que 8/10 de succès et 6 minutes par pack restent des performances de laboratoire, insuffisantes pour une cadence industrielle sans amélioration substantielle du taux de cycle et de la robustesse. La pression réglementaire européenne est le moteur structurel de ce segment : le règlement européen sur les batteries de 2023 impose des seuils de contenu recyclé en cobalt, nickel et lithium à horizon 2030, ce qui rend l'automatisation du démontage cellule par cellule économiquement stratégique. Des acteurs comme SNAM en France ou Accurec en Allemagne industrialisent déjà la filière, mais s'appuient encore majoritairement sur des procédés thermiques ou hydromécaniques de masse, peu sélectifs. Ce travail, publié en preprint arXiv sans validation industrielle annoncée, illustre une approche robotique généraliste en concurrence avec les bras dédiés à outillage spécialisé développés par des groupes comme ABB ou des startups comme Agilox côté manutention. Les prochaines étapes logiques seraient l'extension à des géométries de packs prismatiques et pouch cells, majoritaires dans le parc VE européen, et un test de durabilité sur plusieurs centaines de cycles.

UELe règlement européen sur les batteries de 2023 imposant des seuils de contenu recyclé en cobalt, nickel et lithium d'ici 2030 rend cette approche directement stratégique pour des acteurs français comme SNAM qui industrialisent le démantèlement de batteries mais s'appuient encore sur des procédés peu sélectifs.

FR/EU ecosystemePaper
1 source
VLAMotor : amélioration guidée par tests des modèles VLA via la synthèse de données à base d'agents
127arXiv cs.RO 

VLAMotor : amélioration guidée par tests des modèles VLA via la synthèse de données à base d'agents

Des chercheurs ont publié le 31 mai 2026 (arXiv:2606.00053) VLAMotor, un cadre d'analyse et d'amélioration des modèles Vision-Langage-Action (VLA) pour la manipulation robotique. Ces modèles, dont Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA, sont entraînés sur de grandes bases de données de trajectoires et apprennent à relier instructions en langage naturel, perception visuelle et commandes motrices. Le problème documenté par l'équipe : dès le déploiement, les VLA échouent sur des configurations hors distribution, c'est-à-dire des scènes ou orientations d'objets absentes des données d'entraînement. VLAMotor répond à cela en deux phases. Premièrement, il sélectionne des cas de test en mesurant la distance entre chaque entrée candidate et les échantillons d'entraînement, puis applique une élimination de redondance pour construire un jeu de test compact mais diversifié. Résultat : 92,33 % des cas générés déclenchent effectivement un échec du modèle testé, et la couverture de test dépasse de 18,93 % l'outil de l'état de l'art. Deuxièmement, les trajectoires d'échec sont abstraites en représentations sémantiques structurées, planifiées comme séquences de compétences paramétrées, puis converties en trajectoires exécutables via cinématique inverse. Ces trajectoires réussies sont étiquetées automatiquement et servent à affiner le modèle original, améliorant son taux de succès global de 49,25 %. L'impact industriel est direct : le sim-to-real gap, longtemps cité comme obstacle principal au déploiement des VLA en production, est ici réduit de façon mesurable sans collecte de données humaines coûteuses. Sur matériel réel, les modèles affinés en simulation affichent +57,50 % de succès par rapport aux modèles de base, ce qui valide un pipeline entièrement automatisé de découverte de défauts et de correction. Pour un intégrateur industriel ou un OEM robotique, cela signifie qu'un VLA pré-entraîné peut être spécialisé pour une cellule de travail donnée à moindre coût, sans intervention humaine à chaque étape de labellisation. VLAMotor s'inscrit dans un mouvement plus large de test logiciel appliqué aux systèmes d'apprentissage machine : les travaux de mutation testing et de falsification formelle migrent vers la robotique incarnée, où les enjeux de fiabilité sont physiques. Côté concurrence, Physical Intelligence travaille sur l'adaptation rapide de Pi-0, NVIDIA pousse GR00T N2 avec des pipelines sim-to-real propriétaires, et des acteurs européens comme Enchanted Tools ou Wandercraft investissent dans des boucles de finetune ciblées pour leurs marchés verticaux. VLAMotor, issu du monde académique, propose une direction ouverte et low-cost qui pourrait être adoptée comme couche de validation standard avant tout déploiement VLA en cellule réelle. Les prochaines étapes probables incluent l'extension à des tâches de locomotion et à des VLA multimodaux de plus grande taille.

UEEnchanted Tools et Wandercraft pourraient adopter VLAMotor comme couche de validation bas coût pour spécialiser leurs VLA sur des cellules industrielles sans collecte manuelle de données.

IA physiqueOpinion
1 source
FATE-VLA : génération de tests orientée détection de défaillances pour les modèles vision-langage-action
128arXiv cs.RO 

FATE-VLA : génération de tests orientée détection de défaillances pour les modèles vision-langage-action

Des chercheurs ont publié le 2 juin 2026 FATE-VLA (arXiv:2606.02307), une méthode active de génération de tests pour évaluer les modèles VLA (Vision-Language-Action), ces politiques robotiques généralisées qui combinent perception visuelle, compréhension linguistique et commande motrice. Plutôt que de tester ces modèles sur des benchmarks statiques à échantillonnage aléatoire, FATE-VLA reformule l'évaluation comme un problème de découverte active de défaillances : un algorithme couple exploration guidée par la diversité et modèles surrogate appris sur les exécutions observées, afin d'orienter les tests vers les régions de scène à haut risque. Appliqué à quatre modèles VLA de référence, dont GR00T-N1.6 de NVIDIA, le système identifie jusqu'à 29,7 % de défaillances supplémentaires par rapport aux baselines retenus et expose des modes d'échec plus variés. Sur GR00T-N1.6 spécifiquement, le taux de succès chute de 64,4 % à 34,7 % lorsque les scènes de test ciblent les zones problématiques de l'espace de configuration. Ce résultat soulève une question directe pour quiconque envisage de déployer des VLA en production industrielle : les performances communiquées par les fabricants sont mesurées sur des benchmarks à tirage aléatoire qui, par construction, sous-représentent les configurations critiques. Si les défaillances sont rares mais concentrées dans certaines régions de l'espace de tâche, ce que FATE-VLA confirme empiriquement, un benchmark classique peut afficher 64 % de succès là où un intégrateur confronté à ces configurations limites observera des performances nettement inférieures. Le paradigme proposé s'inspire du fuzzing et du test adversarial déjà standards en sécurité logicielle, deux pratiques absentes des protocoles de validation robotique actuels. Les modèles VLA ont connu une accélération marquée depuis 2023-2024, avec des architectures comme pi-zero (Physical Intelligence), GR00T N1/N1.6 (NVIDIA), OpenVLA et Octo. Leur évaluation s'appuie encore sur des benchmarks fixes comme LIBERO, Calvin ou MetaWorld, tous vulnérables au biais d'échantillonnage décrit ici. FATE-VLA s'inscrit dans une tendance plus large de stress-testing adaptatif des modèles de fondation robotiques, en parallèle des travaux sur la robustesse sim-to-real et le domain randomization. Il s'agit d'un preprint arXiv sans déploiement ni pilote industriel annoncé, mais ses recommandations ciblent directement les équipes de validation chez les fabricants de bras manipulateurs et les intégrateurs qui ne disposent pas encore de standards formels pour certifier des politiques neuronales généralisables avant mise en production.

UELes intégrateurs et fabricants européens évaluant ou déployant des modèles VLA en production industrielle sont directement concernés : les benchmarks standards sur lesquels reposent les performances annoncées (dont celles de GR00T-N1.6 de NVIDIA) sous-représentent par construction les configurations critiques, exposant ces équipes à des taux de défaillance réels nettement supérieurs aux chiffres publiés.

RechercheOpinion
1 source
AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux
129arXiv cs.RO 

AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux

Des chercheurs du laboratoire be2rlab publient sur arXiv (arXiv:2605.25901) AgentGrounder, un système de localisation visuelle 3D zéro-shot opérant directement sur des nuages de points colorés, sans entraînement spécifique à la tâche. L'architecture repose sur deux étapes : une phase hors ligne construit une table de correspondance d'objets (Object Lookup Table, OLT) regroupant identifiants d'instances, labels sémantiques et boîtes englobantes 3D ; une phase en ligne déploie un agent qui décompose chaque requête en langage naturel, récupère les candidats pertinents dans l'OLT, effectue un scoring géométrique, puis déclenche un rendu d'image à la demande lorsque des indices visuels supplémentaires (couleur, texture, angle de vue) sont nécessaires. Évalué sur les benchmarks ScanRefer et Nr3D en configuration zéro-shot, AgentGrounder surpasse SeeGround de +2,5 % en précision Acc@0.5 sur ScanRefer et de +6,3 % sur Nr3D, dont un gain de +6,3 % sur les requêtes indépendantes du point de vue. Le code est publié sur GitHub. Ce résultat est directement pertinent pour les équipes travaillant sur la manipulation robotique et la navigation en environnements intérieurs non structurés. L'absence d'entraînement dédié abaisse la barrière d'intégration : un robot équipé d'un LiDAR ou d'une caméra de profondeur pourrait répondre à des commandes en langage naturel sans fine-tuning sur l'environnement cible, ce qui simplifie les déploiements dans des entrepôts ou des espaces de service variables. Le mécanisme de récupération sélective dans l'OLT réduit les erreurs en cascade typiques des pipelines d'ancrage-cible fixes, qui saturent la fenêtre de contexte des modèles de langage avec des objets non pertinents. L'inspection visuelle adaptative évite par ailleurs de solliciter inutilement les capacités multimodales coûteuses lorsque la géométrie seule suffit à discriminer. La localisation visuelle 3D est un domaine de recherche structuré autour de benchmarks comme ScanRefer (2020) et Nr3D, qui évaluent la capacité à identifier un objet précis dans une scène intérieure 3D à partir d'une description textuelle ambiguë. Les méthodes zéro-shot antérieures supposaient souvent des ensembles d'images multi-vues préexistants et peinaient face aux limites sémantiques des outils de segmentation 3D standards, SeeGround représentant jusqu'ici l'état de l'art sur ces benchmarks. Côté industrie, NVIDIA intègre des capacités de grounding 3D dans son framework GR00T pour la manipulation robotique, tandis qu'Enchanted Tools en France et les équipes embodied AI de Meta FAIR travaillent sur des modules similaires de compréhension spatiale ouverte. AgentGrounder, encore au stade de preprint non évalué par les pairs, devra confirmer ses performances hors contexte académique avant toute adoption en conditions réelles.

UEEnchanted Tools (France), explicitement citée comme travaillant sur des modules similaires de compréhension spatiale ouverte, peut utiliser AgentGrounder comme référence zéro-shot pour réduire les coûts de fine-tuning dans ses déploiements robotiques.

RechercheOpinion
1 source
IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques
130arXiv cs.RO 

IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques

Des chercheurs ont publié sur arXiv (2604.07833) un cadre architectural pour la gouvernance d'exécution des agents incarnés, ces systèmes IA capables d'agir sur des robots, outils ou environnements physiques. La proposition centrale est une couche de gouvernance dédiée, externe à la boucle d'inférence de l'agent, chargée de cinq fonctions : vérification de politiques, admission de capacités, surveillance d'exécution, gestion des rollbacks et déclenchement d'override humain. Cette architecture formalise une frontière de contrôle entre l'agent incarné, des modules de capacité baptisés ECMs (Embodied Capability Modules) et la couche de gouvernance runtime. Les auteurs ont validé l'approche sur 1 000 essais de simulation randomisés couvrant trois dimensions de gouvernance : taux d'interception des actions non autorisées à 96,2 %, réduction des continuations non sécurisées de 100 % à 22,2 % en cas de dérive d'exécution, et 91,4 % de récupération avec conformité totale aux politiques, tous significativement supérieurs aux baselines testés (p<0,001). L'enjeu dépasse la robotique académique. À mesure que des agents IA obtiennent une autorité d'exécution réelle sur des bras industriels, des AMR (Autonomous Mobile Robots) ou des systèmes cyber-physiques, leur contrôlabilité devient un problème d'ingénierie système critique. L'approche dominante actuelle consiste à enfouir la logique de sécurité à l'intérieur de la boucle agent, ce qui rend l'audit difficile et la standardisation quasi impossible dans des environnements réglementés (santé, industrie critique). En externalisant la gouvernance dans une couche séparée, les auteurs proposent un modèle où la politique d'usage peut être modifiée ou vérifiée sans toucher aux poids du modèle, répondant à un besoin concret des intégrateurs industriels qui composent avec plusieurs fournisseurs et des référentiels de sécurité imposés par leurs clients. Ce papier s'inscrit dans un mouvement plus large de "safety at deployment", distinct de l'alignment par entraînement (RLHF, Constitutional AI). Il dialogue avec les architectures de contrôle comme ROS 2 et les travaux sur les systèmes multi-agents à responsabilité distribuée. Le contexte concurrentiel est direct : OpenAI, Google DeepMind, Figure AI, Physical Intelligence et Sanctuary AI développent tous des agents incarnés à capacité d'exécution croissante, mais la gouvernance runtime reste un angle mort industriel. Une telle architecture trouverait une application prioritaire dans les déploiements d'humanoïdes en environnement contrôlé, entrepôts ou lignes d'assemblage, où les opérateurs exigent des garanties d'auditabilité que les architectures end-to-end ne fournissent pas encore.

UEL'architecture de gouvernance externe proposée répond directement aux exigences d'auditabilité et de traçabilité de l'AI Act pour les systèmes d'IA à haut risque, offrant aux intégrateurs robotiques européens un cadre de référence concret pour démontrer la conformité de leurs agents incarnés sans modifier les poids des modèles.

RechercheOpinion
1 source
RoboJailBench : évaluation des attaques et défenses adversariales dans les agents robotiques incarnés
131arXiv cs.RO 

RoboJailBench : évaluation des attaques et défenses adversariales dans les agents robotiques incarnés

Des chercheurs du PurSec Lab ont publié RoboJailBench, un benchmark standardisé pour évaluer les attaques adversariales de type "jailbreak" et leurs contre-mesures dans les systèmes d'IA embarquée. Présenté sur arXiv (2605.19328), ce framework cible les agents robotiques et véhicules autonomes qui s'appuient sur des Vision-Language Models (VLMs) pour interpréter l'environnement visuel et exécuter des commandes en langage naturel. Il repose sur trois composantes: une taxonomie de sécurité dérivée des normes ISO et d'incidents documentés, couvrant 18 catégories de violations; un pipeline de données "intent contrast" associant à chaque exemple un objectif adversarial et un objectif bénin, afin de mesurer conjointement sécurité et utilité; et un dépôt évolutif de métriques standardisées. Les auteurs ont construit un dataset taxonomique, enrichi cinq datasets existants, intégré quatre types d'attaques et deux défenses, puis évalué l'ensemble sur les principaux VLMs embarqués actuels. Un leaderboard public est maintenu sur purseclab.github.io. L'enjeu dépasse la recherche académique. Un robot compromis par un jailbreak n'affiche pas une réponse textuelle inappropriée: il exécute une action physique potentiellement dangereuse. Les benchmarks existants ciblaient soit les LLMs conversationnels, soit la sécurité non-adversariale des agents incarnés, sans jamais capturer le triptyque risques adversariaux, conséquences physiques et arbitrage sécurité-utilité. Quantifier explicitement ce compromis est une contribution méthodologique significative: un système trop défensif bloque des commandes légitimes et devient inutilisable en production. Pour les intégrateurs industriels, une grille d'évaluation ancrée dans les normes ISO simplifie la qualification réglementaire avant tout déploiement réel. La montée en puissance des VLMs dans la robotique physique, illustrée par pi0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures de Figure AI, a considérablement élargi la surface d'attaque des systèmes autonomes. Des travaux antérieurs avaient documenté la vulnérabilité des agents embarqués aux jailbreaks visuels ou textuels, mais sans cadre d'évaluation reproductible. Alors que des fabricants comme Boston Dynamics, Unitree ou, côté européen, Enchanted Tools intègrent des VLMs en production, la robustesse adversariale est appelée à devenir une exigence réglementaire dans les secteurs logistique, manufacturier et médical. RoboJailBench pose une base commune sur laquelle industriels et académiques peuvent s'appuyer pour standardiser ces tests avant mise en service.

UELe benchmark RoboJailBench, ancré dans les normes ISO, fournit aux intégrateurs européens, dont Enchanted Tools (France) qui déploie des VLMs en production, un cadre standardisé pour qualifier la robustesse adversariale avant mise en service sous les exigences de l'AI Act.

Societe/EthiqueOpinion
1 source
IA incarnée multi-agents : la dégradation du consentement en chaîne, un pont entre gouvernance des agents et éthique robotique
132arXiv cs.RO 

IA incarnée multi-agents : la dégradation du consentement en chaîne, un pont entre gouvernance des agents et éthique robotique

Un article académique publié sur arXiv (référence 2605.16300) formule un problème de gouvernance que les cadres réglementaires actuels n'adressent pas : lorsqu'un robot physique délègue une tâche à un autre robot qui en délègue une partie à un troisième, le consentement initial donné par l'humain se dilue à chaque maillon de la chaîne. Les auteurs nomment ce phénomène "Consent Chain Degradation" (CCD) et proposent un cadre conceptuel pour le quantifier, accompagné d'une architecture de supervision en trois couches baptisée CoRVE (Consent Runtime Verification Framework for Embodied Agents). CoRVE intègre un modèle de portée du consentement, un suivi des chaînes de délégation et une évaluation de l'irréversibilité physique des actions. Trois scénarios illustrent le mécanisme : robotique médicale, assistance à domicile et environnement industriel, dont un exemple numérique détaillé. L'enjeu dépasse la théorie. Dans un atelier où un AMR (robot mobile autonome) confie une tâche de manipulation à un bras collaboratif, lui-même supervisé par un système de vision tiers, le consentement opérateur formulé en amont peut ne plus couvrir les actions finales, notamment si elles sont physiquement irréversibles (déplacement d'un patient, coupe d'un matériau, accès à un espace privé). Les auteurs montrent que ni la communauté de l'éthique de l'IA (centrée sur les agents logiciels) ni la communauté HRI (Human-Robot Interaction, focalisée sur les interactions dyadiques humain-robot) n'ont produit de cadre adapté aux écosystèmes multi-robots physiques. C'est un angle mort documenté pour la première fois de façon structurée. L'analyse réglementaire conduite dans le papier révèle que quatre textes européens majeurs, l'AI Act, le RGPD, le Règlement Machines révisé et la Directive révisée sur la responsabilité du fait des produits, laissent tous la dimension CCD sans réponse. Aucun n'impose de traçabilité de la délégation inter-robots ni de vérification dynamique du périmètre de consentement. Ce constat arrive alors que des déploiements multi-agents incarnés commencent à sortir du laboratoire, entrepôts Amazon Robotics, hôpitaux pilotes avec Diligent Robotics, sites industriels Exotec. La prochaine étape naturelle serait une implémentation de référence de CoRVE et une proposition d'amendement aux textes européens, que les auteurs n'ont pas encore publiée.

UELes quatre textes réglementaires européens analysés (AI Act, RGPD, Règlement Machines révisé, Directive responsabilité produits) ne couvrent aucun le phénomène de dégradation du consentement inter-robots, un vide juridique qui affectera directement les déploiements multi-agents incarnés en Europe, y compris chez des acteurs français comme Exotec.

RegulationOpinion
1 source
Surmonter l'aveuglement aux dynamiques : correction de vitesse et de trajectoire sans entraînement pour les modèles VLA
133arXiv cs.RO 

Surmonter l'aveuglement aux dynamiques : correction de vitesse et de trajectoire sans entraînement pour les modèles VLA

Des chercheurs ont publié mi-mai 2026 sur arXiv (référence 2605.11459) une méthode baptisée "Pace-and-Path Correction" pour corriger un angle mort structurel des modèles VLA (Vision-Language-Action). Ces modèles, socle technique des bras manipulateurs de nouvelle génération, sont entraînés sur des observations à image unique (single-frame), ce qui les rend incapables de percevoir les dynamiques temporelles lors de l'exécution d'une séquence planifiée. En pratique, dès qu'un objet bouge pendant que le robot exécute un "action chunk", les performances chutent sévèrement, même après fine-tuning sur des datasets dynamiques. L'opérateur proposé s'applique à l'inférence sans ré-entraînement, comme une couche wrapper autour de tout VLA à action chunking, et se décompose en deux canaux orthogonaux issus d'une minimisation de coût quadratique unique : un canal "pace" compressant l'exécution le long de la trajectoire prévue, et un canal "path" appliquant un décalage spatial orthogonal pour absorber les perturbations dynamiques dans la fenêtre temporelle du chunk. Évalué sur MoveBench, un benchmark conçu pour isoler le mouvement comme seule variable contrôlée, la méthode améliore le taux de succès de 28,8 points de pourcentage en environnement purement dynamique et de 25,9 points en contexte mixte statique-dynamique, surpassant les VLAs de base ainsi que les approches dynamiques-adaptatives existantes. L'enjeu est directement opérationnel : les VLAs actuels comme pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de Nvidia peinent dès qu'un convoyeur avance ou qu'un opérateur interfère avec la scène, soit le cas standard en environnement industriel réel. Corriger ce "dynamics gap" exigeait jusqu'ici un ré-entraînement coûteux, souvent rédhibitoire pour un intégrateur sans infrastructure ML dédiée. Le caractère training-free de Pace-and-Path Correction signifie qu'elle peut s'intégrer sur un modèle déjà déployé sans modifier les poids ni la pipeline d'apprentissage, abaissant drastiquement la barrière d'adoption pour des déploiements en conditions réelles. La "dynamics-blindness" des VLAs est une critique récurrente depuis l'émergence de pi-0 et OpenVLA en 2024-2025, la majorité des démonstrations publiques ayant lieu sur scènes statiques et laissant ouvert le demo-to-reality gap dès que les conditions industrielles se compliquent. Ce travail s'inscrit dans la course à la manipulation robuste que se livrent Nvidia, Figure (Figure 03), Boston Dynamics et 1X Technologies. Aucun acteur français n'est directement cité, mais les conclusions intéressent des intégrateurs comme Exotec et des équipes de recherche comme le LAAS-CNRS travaillant sur la manipulation en environnement non-structuré. La prochaine étape logique est une validation sur hardware réel - le papier reste à ce stade un benchmark simulé - et une intégration dans des stacks open-source comme LeRobot de Hugging Face.

UELes équipes LAAS-CNRS travaillant sur la manipulation non-structurée et des intégrateurs comme Exotec pourraient adopter cette correction sans ré-entraînement pour améliorer la robustesse de déploiements VLA en environnement industriel dynamique, sans infrastructure ML dédiée.

💬 Le dynamics gap des VLAs, on le connaissait depuis l'émergence de pi-0 : dès qu'un objet bouge pendant l'exécution d'un chunk, c'est la déroute. Ce qui change ici, c'est que la correction s'applique à l'inférence sans toucher aux poids, comme une couche qu'on pose par-dessus n'importe quel modèle déjà déployé. +28 points sur MoveBench, training-free : si ça tient sur hardware réel, les intégrateurs n'ont plus d'excuse pour rester sur des scènes statiques.

IA physiqueOpinion
1 source
Hallucination d'action dans les modèles vision-langage-action (VLA) génératifs
134arXiv cs.RO 

Hallucination d'action dans les modèles vision-langage-action (VLA) génératifs

Des chercheurs ont publié sur arXiv (référence 2602.06339, version 2, février 2026) une analyse théorique des hallucinations d'action dans les modèles VLA (Vision-Language-Action), ces architectures de fondation qui promettent une généralisation large pour le contrôle robotique de bout en bout. L'étude, centrée sur les politiques génératives à variables latentes, identifie trois catégories de barrières structurelles qui provoquent des hallucinations, c'est-à-dire des actions générées violant des contraintes physiques du monde réel : une barrière topologique (liée à la topologie de l'espace d'action), une barrière de précision (résolution insuffisante pour les tâches fines), et une barrière d'horizon (dégradation des performances sur les séquences longues). Ces barrières ne sont pas des artefacts d'implémentation corrigeables à la marge, mais des inadéquations structurelles entre l'espace des comportements robots physiquement réalisables et les architectures de modèles courantes. La portée de ce travail dépasse le cadre académique : il fournit des explications mécanistes aux échecs empiriques régulièrement rapportés lors du déploiement de politiques VLA en conditions réelles, et remet en question une hypothèse dominante du secteur selon laquelle les modèles de fondation généralistes résoudraient intrinsèquement le problème de génération d'action en robotique incarnée. Pour les intégrateurs et les équipes R&D industrielles, cela signifie que des phénomènes observés en déploiement, comme des mouvements incohérents, des échecs sur des tâches longues ou des erreurs de précision fine, ont une origine architecturale identifiable, et non pas seulement un déficit de données d'entraînement. Les auteurs soulignent que ces limitations imposent des compromis inévitables, et non des problèmes résolubles uniquement par le scaling ou l'augmentation des datasets. Le champ des VLAs s'est considérablement densifié depuis 2023 avec des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA (open-source) ou encore RT-2 de Google DeepMind, qui font tous le pari d'une politique robotique unifiée entraînée sur des données massives. Cette étude apporte une perspective critique et formalisée dans un domaine encore largement dominé par des démonstrations en environnements contrôlés, souvent sans publication des métriques d'échec. Les auteurs ne proposent pas d'abandonner l'approche générative, mais tracent des directions pour améliorer fiabilité et robustesse sans sacrifier la puissance expressive de ces architectures, un prérequis non négociable pour franchir le seuil du déploiement industriel réel.

UELes équipes R&D françaises et européennes travaillant sur des politiques robotiques VLA (INRIA, CEA-List, startups robotiques) peuvent réévaluer leurs choix architecturaux et ne plus imputer uniquement à un déficit de données les échecs de déploiement observés en conditions réelles.

💬 On sait depuis un moment que les VLAs galèrent en conditions réelles, mais tout le monde imputait ça à des données insuffisantes. Ces chercheurs identifient trois barrières structurelles (topologie, précision, horizon) que le scaling seul ne résoudra pas. Pour les équipes qui pariaient sur "encore plus de données pour y arriver", c'est un mur.

IA physiqueOpinion
1 source
OpenSGA : alignement efficace de graphes de scènes 3D en monde ouvert
135arXiv cs.RO 

OpenSGA : alignement efficace de graphes de scènes 3D en monde ouvert

Une équipe du laboratoire Autonomous Robots (Pays-Bas) a publié OpenSGA en mai 2026, un framework d'alignement de graphes de scènes 3D en monde ouvert, disponible en preprint sur arXiv (2605.10484). Le système établit des correspondances d'objets entre deux graphes construits à partir d'observations partiellement chevauchantes, en fusionnant des caractéristiques vision-langage, textuelles et géométriques. OpenSGA gère deux modes : le frame-to-scan (F2S), qui met en correspondance une image unique avec une carte existante, et le subscan-to-subscan (S2S), qui fusionne deux sous-cartes partielles. Son architecture combine un encodeur d'attention spatiale à porte de distance, un allocateur par flot de coût minimal et un générateur d'embedding global de scène. Les auteurs publient également ScanNet-SG, un dataset de plus de 700 000 échantillons couvrant 509 catégories issues de ScanNet et plus de 3 000 catégories générées via GPT-4o, soit un saut d'échelle substantiel par rapport aux benchmarks existants, limités à quelques milliers d'exemples. L'intérêt applicatif est direct pour les robots à longue autonomie : relocaliser un objet précis lors d'une revisite de lieu, ou fusionner des cartes entre plusieurs agents mobiles, sont des verrous non résolus en logistique, inspection industrielle et robotique de service. En adoptant une approche open-set fondée sur des embeddings vision-langage de type CLIP, OpenSGA reconnaît des catégories non vues à l'entraînement, dépassant les pipelines fermés qui exigent une annotation préalable de chaque classe. Les expériences publiées indiquent que le framework surpasse significativement les méthodes existantes sur les deux tâches, bien que l'abstract ne détaille pas les écarts chiffrés précis, un point à vérifier dans le papier complet. Les méthodes précédentes comme SceneGraphFusion ou les approches basées sur PointNet se limitaient au mode S2S avec des caractéristiques purement géométriques, sur des datasets restreints. L'intégration de GPT-4o pour l'étiquetage automatique et la construction massive du dataset marque une inflexion méthodologique notable. Côté concurrentiel, OpenSGA s'inscrit face à ConceptGraphs (MIT), Hydra (MIT SPARK Lab) et aux représentations sémantiques développées à ETH Zurich. Aucun équivalent direct n'a été publié côté français ou européen à ce stade. Le code et le dataset sont disponibles en open-source sur autonomousrobots.nl, ce qui facilite l'adoption par la communauté de recherche en SLAM sémantique.

UEUn laboratoire européen (Pays-Bas) publie en open-source un framework SLAM sémantique surpassant l'état de l'art, renforçant la compétitivité de la recherche UE face au MIT ; ETH Zurich figure parmi les acteurs concurrents cités.

RecherchePaper
1 source
ATAAT : cadre adversarial adaptatif et conscient des menaces contre les attaques par porte dérobée sur les modèles VLA
136arXiv cs.RO 

ATAAT : cadre adversarial adaptatif et conscient des menaces contre les attaques par porte dérobée sur les modèles VLA

Des chercheurs ont déposé sur arXiv (référence 2605.08612) un cadre d'attaque par porte dérobée ciblant les modèles Vision-Language-Action (VLA), architectures qui connectent perception visuelle, compréhension du langage naturel et génération de commandes motrices pour robots. Le framework proposé, baptisé ATAAT (Adaptive Threat-Aware Adversarial Tuning), exploite la voie visuelle des VLA pour y injecter des déclencheurs adversariaux, et atteint un taux de succès d'attaque ciblée (TASR) supérieur à 80% avec un taux d'empoisonnement de seulement 5% des données d'entraînement. L'étude identifie un phénomène clé baptisé "interférence de gradient" : un échec d'optimisation qui survient lorsque les stratégies de rétropropagation entrent en conflit durant l'entraînement bout-en-bout, ce qui explique l'échec des attaques traditionnelles sur les VLA. ATAAT contourne cet obstacle via un mécanisme de "cartographie adaptative menace-méthode" qui sélectionne dynamiquement la stratégie de découplage de gradient selon les capacités supposées de l'attaquant. Ce travail soulève des questions de sécurité concrètes pour les équipes intégrant des VLA en contexte industriel. Un taux d'empoisonnement de 5% signifie qu'une contamination limitée de la pipeline de données d'entraînement suffit à implanter un comportement malveillant quasi indétectable lors des audits standards. Dans un bras robotique ou un système d'assistance physique, une porte dérobée activée par un déclencheur visuel discret, un objet dans le champ caméra ou une variation de couleur subtile, pourrait provoquer une action non désirée aux conséquences physiques réelles. Les auteurs revendiquent, pour la première fois dans ce contexte, des "attaques découplées implicites" en scénario d'empoisonnement de données, sans modification directe des poids du modèle, ce qui complique toute détection post-entraînement. Les VLA ont connu une montée en puissance rapide depuis 2023, portés par Pi-0 (Physical Intelligence), OpenVLA (Stanford), GR00T N2 (NVIDIA) et Helix (Figure AI), tous basés sur un encodeur visuel couplé à un grand modèle de langage et une tête de prédiction d'actions. Les recherches sur les portes dérobées dans les réseaux de neurones remontent aux travaux fondateurs BadNets et TrojanNN (2017-2018), mais leur adaptation aux VLA restait peu explorée, précisément en raison de la complexité de l'entraînement conjoint. Ce papier de recherche fournit une base théorique pour de futurs mécanismes défensifs sans proposer de contre-mesure opérationnelle immédiate. Pour les intégrateurs planifiant des déploiements VLA en production, il rappelle que la sécurité de la chaîne de données d'entraînement est aussi critique que celle de l'inférence elle-même.

UELes équipes R&D et intégrateurs européens déployant des VLA en contexte industriel doivent renforcer la sécurité de leur pipeline de données d'entraînement, ce vecteur d'attaque étant désormais formalisé avec des métriques concrètes.

RechercheActu
1 source
Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)
137arXiv cs.RO 

Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv le 12 mai 2026 (référence 2605.09005) GuardVLA, premier cadre de vérification de propriété intellectuelle basé sur les backdoors pour les modèles Vision-Language-Action (VLA). Ces modèles permettent un contrôle robotique généraliste en convertissant des entrées multimodales (vision, langage, données proprioceptives) directement en séquences d'actions motrices. GuardVLA intègre un filigrane cryptographique lors de l'entraînement : un message secret est injecté dans les données visuelles du modèle sans altérer ses performances nominales sur les tâches cibles. La vérification post-déploiement s'effectue via un mécanisme baptisé "swap-and-detect" : un projecteur de déclenchement combiné à une tête de classification externe active et détecte le backdoor intégré à partir des probabilités de prédiction du modèle. Les expériences valident l'approche sur plusieurs architectures, jeux de données et scénarios d'adaptation. L'enjeu est direct pour les intégrateurs et éditeurs de modèles robotiques. Des VLA open-source comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) font déjà l'objet de fine-tuning intensif par des tiers. GuardVLA démontre que le filigrane résiste à ces adaptations post-release, ce qui contredit l'hypothèse courante selon laquelle le fine-tuning suffit à effacer toute traçabilité. Pour un éditeur cherchant à protéger un modèle robotique commercial ou à prouver sa propriété en cas de litige, c'est une voie technique crédible sans recours à des mécanismes de DRM contraignants. La capacité à certifier l'origine d'un modèle devient stratégique à l'heure où les VLA s'imposent comme actifs industriels à part entière. Le watermarking de modèles IA existe déjà pour les LLM et les modèles de diffusion d'images, mais les VLA posent une contrainte supplémentaire : leur sortie est une séquence d'actions motrices et non un texte ou une image, ce qui rend la détection de backdoor structurellement différente. Ce travail reste un preprint non évalué par les pairs, sans déploiement industriel annoncé à ce stade. Les approches concurrentes, hachage de poids ou licensing cryptographique, ne ciblent pas spécifiquement la modalité action des VLA. La soumission en conférence, probablement CoRL 2026 ou ICRA 2027, constituera la prochaine validation formelle. L'adoption à grande échelle dépendra aussi de l'intégration aux outils de distribution existants, notamment Hugging Face, où la majorité des VLA généralisés sont aujourd'hui hébergés et redistribués.

UELes éditeurs et chercheurs européens distribuant des modèles VLA via Hugging Face (entreprise française, principal hub de redistribution cité) pourraient adopter GuardVLA pour défendre leur propriété intellectuelle face aux fine-tunings non autorisés.

RechercheOpinion
1 source
AR-VLA : un expert d'action autorégressif pour les modèles vision-langage-action
138arXiv cs.RO 

AR-VLA : un expert d'action autorégressif pour les modèles vision-langage-action

Des chercheurs de l'INSAIT (Institute for Computer Science, Artificial Intelligence and Technology, Sofia, Bulgarie) ont publié début 2026 AR-VLA, une architecture de politique robotique qui remplace les têtes d'action à base de blocs (chunk-based) par un expert d'action autorégressif autonome. Contrairement aux modèles VLA existants, qu'ils soient réactifs ou basés sur la diffusion, qui réinitialisent leur contexte temporel à chaque nouvelle observation, AR-VLA maintient une mémoire longue durée et génère les actions comme une séquence causale continue. Le système intègre un mécanisme de re-ancrage (re-anchoring) pour synchroniser les modalités asynchrones vision-langage-action, compensant mathématiquement le délai entre une perception lente (quelques Hz) et un contrôle moteur rapide (centaines de Hz). Les expériences couvrent des tâches de manipulation en simulation et sur robots réels, où AR-VLA atteint ou dépasse les taux de succès des VLA réactifs de l'état de l'art tout en produisant des trajectoires sensiblement plus lisses. L'enjeu central est le découplage entre raisonnement perceptif lent et contrôle moteur rapide, un problème structurel des architectures VLA actuelles. En traitant les actions comme une séquence autorégressive avec historique persistant plutôt que comme un bloc prédit à chaque nouvelle trame, AR-VLA rend la politique intrinsèquement consciente du contexte : elle sait ce qu'elle vient d'exécuter, pas seulement ce qu'elle observe à l'instant T. Pour les équipes robotiques et les intégrateurs, cette architecture autorise un préentraînement modulaire de la syntaxe cinématique indépendamment du backbone de perception, réduisant potentiellement les coûts de développement de politiques spécialistes ou généralistes. La cohérence spatio-temporelle accrue réduit également les oscillations et les reprises de mouvement, deux facteurs critiques en déploiement industriel. L'INSAIT, fondé en 2022 à Sofia avec le soutien de Google, Microsoft et de l'EPFL, s'est imposé rapidement comme un pôle de recherche en IA en Europe centrale. AR-VLA s'inscrit dans une compétition ouverte sur l'architecture des politiques robot-généralistes, où Physical Intelligence (pi-0, pi-0.5), NVIDIA (GR00T N2), Google DeepMind et des startups comme Figure (Helix) ou 1X défendent des approches concurrentes. L'approche par diffusion, popularisée notamment par pi-0 et Diffusion Policy, constitue l'alternative dominante aux VLA réactifs ; AR-VLA la défie directement en montrant qu'un modèle autorégressif pur peut produire des trajectoires plus cohérentes sans recourir à des processus de débruitage itératifs. AR-VLA demeure pour l'instant un preprint arXiv (2603.10126v2), sans annonce de déploiement industriel ni de commercialisation. Le code et les vidéos de démonstration sont disponibles sur arvla.insait.ai.

UEL'INSAIT (Sofia, Bulgarie), soutenu par Google, Microsoft et l'EPFL, positionne l'UE comme acteur de recherche crédible dans la course aux architectures VLA généralistes ; le code est disponible et testable par les équipes robotiques européennes.

FR/EU ecosystemeOpinion
1 source
Livraison multi-agents avec correspondances multiples
139arXiv cs.RO 

Livraison multi-agents avec correspondances multiples

Des chercheurs ont publié sur arXiv (référence 2605.07835) un algorithme baptisé M2M (Many-to-Many Multi-Agent Pickup and Delivery) pour optimiser la coordination de flottes de robots dans des entrepôts automatisés. La majorité des travaux antérieurs sur le problème MAPD (Multi-Agent Pickup and Delivery) supposent qu'une tâche a un unique point de collecte et un unique point de dépôt, le paradigme dit "one-to-one". M2M s'attaque à la variante "many-to-many" : dans un entrepôt réel, un article identifié par son SKU (Stock Keeping Unit) peut être prélevé ou stocké à plusieurs emplacements, ce qui génère un problème d'affectation à quatre dimensions classé NP-difficile. L'équipe propose deux variantes : M2M, qui minimise la durée estimée de chaque tâche, et M2M-wSKU, qui intègre en plus la distribution physique des SKUs dans la fonction objectif. En simulation sur des opérations de 8 heures, M2M complète jusqu'à 22 000 tâches supplémentaires en moyenne par rapport aux meilleures méthodes existantes, selon les configurations d'environnement et la densité d'inventaire. Le gain de 22 000 tâches sur une journée simulée de 8 heures représente un saut de throughput significatif pour un entrepôt à forte rotation. Pour un intégrateur ou un COO industriel, cela se traduit directement en capacité de traitement d'ordres supplémentaires sans augmenter le parc de robots. L'enjeu théorique est tout aussi notable : la transition du paradigme one-to-one vers many-to-many reflète fidèlement la réalité des entrepôts modernes, où la redondance d'emplacements est un mécanisme délibéré de résilience logistique. Une limite mérite d'être soulignée : les simulations sur 8 heures ne capturent pas les pannes matérielles, la variabilité des temps de manipulation, ni les interactions humaines en zones mixtes. Sur le plan académique toutefois, M2M établit une nouvelle référence sur ce sous-problème MAPD jusqu'ici peu traité. Le MAPD est un champ de recherche actif depuis une quinzaine d'années, porté par l'essor des entrepôts automatisés et des systèmes AMR (Autonomous Mobile Robots). Les algorithmes classiques ciblaient des scénarios one-to-one correspondant aux premières architectures d'entrepôts, mais les systèmes industriels modernes opèrent quasi universellement en many-to-many. L'entreprise française Exotec, avec son système Skypod déployé chez plus de 400 clients dans 15 pays, incarne précisément cette réalité multi-emplacements, aux côtés d'acteurs comme Amazon Robotics, Geek+ ou AutoStore. La publication de M2M sur arXiv ouvre la voie à son intégration dans des frameworks open-source de planification multi-robots. Les prochaines étapes attendues incluent une validation sur environnements physiques et la prise en compte de contraintes temporelles réelles, telles que les fenêtres de livraison ou les priorités dynamiques de commande.

UEL'algorithme M2M pourrait être directement intégré dans des systèmes comme le Skypod d'Exotec, permettant d'augmenter le débit des entrepôts automatisés européens sans extension du parc de robots.

IndustrielPaper
1 source
Gaze4HRI : benchmark zero-shot des réseaux de neurones pour l'estimation du regard en interaction humain-robot
140arXiv cs.RO 

Gaze4HRI : benchmark zero-shot des réseaux de neurones pour l'estimation du regard en interaction humain-robot

Une équipe de chercheurs a publié en mai 2026 Gaze4HRI (arXiv:2605.04770), un benchmark à grande échelle conçu pour évaluer les réseaux de neurones d'estimation du regard dans les conditions réelles de l'interaction humain-robot (HRI). Le jeu de données regroupe plus de 50 sujets, 3 000 vidéos et 600 000 images annotées, couvrant quatre variables critiques identifiées comme sous-représentées dans les évaluations existantes : les variations d'éclairage, les conflits entre direction de la tête et direction du regard, la mobilité de la caméra embarquée sur le robot, et le déplacement de la cible visuelle. L'approche retenue est celle de l'estimation 3D du regard dite "zero-shot" : les modèles apprennent à projeter directement une image RGB en vecteur de regard, sans calibration individuelle, ce qui réduit considérablement les coûts de déploiement en contexte opérationnel. Les résultats du benchmark remettent en question plusieurs hypothèses dominantes dans la littérature. Chacune des méthodes évaluées échoue sur au moins une condition testée, et le regard fortement orienté vers le bas ("steeply-downward gaze") constitue un point d'échec universel pour l'ensemble des architectures, y compris les modèles spatio-temporels complexes et les approches basées sur des Transformers. Ces architectures récentes, pourtant très citées, n'affichent pas de supériorité systématique en conditions non contrôlées. Seul PureGaze, entraîné sur le dataset ETH-X-Gaze, maintient une robustesse satisfaisante sur l'ensemble des autres conditions. La conclusion centrale est que la diversité des données d'entraînement constitue le premier levier de robustesse zero-shot, devant la complexité architecturale, tandis que des mécanismes comme la self-adversarial loss de PureGaze pour la purification des features de regard apportent un gain additionnel significatif. L'estimation du regard est une compétence fondamentale pour les robots sociaux et collaboratifs : elle conditionne la détection d'attention, la coordination tour-par-tour, et la sécurité en environnement partagé. Les benchmarks existants souffrent d'un "complexity gap" structurel, les méthodes étant entraînées sur des corpus variés mais évaluées sur des ensembles beaucoup plus petits et homogènes, ce qui surestime leur robustesse réelle. Gaze4HRI vise à corriger ce biais. Sur le plan concurrentiel, le dataset ETH-X-Gaze (ETH Zurich) s'impose ici comme la référence en termes de diversité, tandis que des benchmarks HRI spécialisés comme GAZE360 ou MPIIFaceGaze ne capturent pas les conditions de mouvement propres aux plateformes robotiques. Le dataset et le code sont disponibles publiquement sur gazeforhri.github.io, ce qui devrait faciliter l'adoption par les équipes travaillant sur des robots humanoïdes ou des AMR équipés de systèmes de perception sociale.

UELe benchmark Gaze4HRI et son dataset public (600 000 images annotées, code ouvert) pourraient accélérer les travaux des équipes européennes comme l'INRIA ou le CEA-List sur la perception sociale des robots collaboratifs et humanoïdes.

RecherchePaper
1 source
AhaRobot : un manipulateur mobile bimanuel open source à faible coût pour l'IA incarnée
141arXiv cs.RO 

AhaRobot : un manipulateur mobile bimanuel open source à faible coût pour l'IA incarnée

Une équipe de recherche a publié en mars 2025 sur arXiv les spécifications complètes d'AhaRobot, un manipulateur mobile bimanuel open-source dont le coût matériel total s'élève à 1 000 dollars. Le système repose sur une architecture à deux bras de type SCARA, conçue pour réduire les couples moteurs nécessaires tout en maintenant un large espace de travail vertical. La précision annoncée est de 0,7 mm en répétabilité, obtenue grâce à une compensation de jeu mécanique par double moteur et à une technique de dithering pour neutraliser le frottement statique. L'interface de téléopération associée, RoboPilot, intègre une poignée marqueur à 26 faces qui réduit l'erreur de suivi de 80 % par rapport à une poignée à 6 faces et améliore l'efficacité de collecte de données de 30 %. L'ensemble du code, des fichiers CAO et de la documentation est mis à disposition en accès libre sur aha-robot.github.io. L'enjeu central est l'entraînement des modèles VLA (Vision-Language-Action), tels que pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui exigent des volumes massifs de données de manipulation réelles et diversifiées. Les plates-formes commerciales équivalentes coûtent généralement entre 20 000 et 100 000 dollars, ce qui limite mécaniquement l'échelle de collecte. À 1 000 dollars par unité, AhaRobot rend théoriquement possible le déploiement de flottes de collecte à faible coût. Les auteurs affirment que la qualité des données est comparable à celle produite par des systèmes de téléopération VR haute gamme, une assertion non encore validée sur des benchmarks standardisés indépendants. La précision de 0,7 mm reste cependant un chiffre solide pour ce niveau de coût. Le projet s'inscrit dans un mouvement plus large de démocratisation du hardware robotique open-source, aux côtés de LeRobot, l'initiative de la société française HuggingFace, et du Low Cost Robot d'Alexander Koch. La conception SCARA bimanuelle fait un compromis délibéré entre dextérité et coût, en abaissant les exigences en couple pour utiliser des actionneurs moins chers. À ce stade, il s'agit d'un preprint de recherche sans déploiement industriel ni pilote commercial annoncé : la prochaine étape naturelle serait une reprise par des laboratoires académiques pour valider l'imitation learning sur des tâches bimanuelles complexes en conditions réelles, et mesurer si l'avantage coût se maintient à l'échelle.

UELa démocratisation du hardware robotique open-source profite aux laboratoires académiques européens aux budgets contraints, dans la continuité de l'initiative LeRobot portée par HuggingFace, entreprise française, qui milite pour les mêmes standards ouverts de collecte de données pour les modèles VLA.

RecherchePaper
1 source
OGPO : un affinage complet et efficace des politiques de contrôle génératives
142arXiv cs.RO 

OGPO : un affinage complet et efficace des politiques de contrôle génératives

Un preprint arXiv de mai 2026 (2605.03065) présente OGPO, Off-policy Generative Policy Optimization, un algorithme de fine-tuning par renforcement pour les politiques génératives de contrôle (GCPs) basées sur la diffusion ou le flow matching, paradigme central de modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). OGPO propage les gradients à travers l'intégralité du processus génératif via un objectif PPO modifié et maintient des réseaux critiques off-policy pour maximiser la réutilisation des données. Évalué sur des tâches de manipulation multi-tâches, d'insertion haute précision et de contrôle dextère, l'algorithme revendique un état de l'art et serait, selon les auteurs, le premier à fine-tuner des politiques de behavior cloning mal initialisées jusqu'au succès complet sans données expertes dans le replay buffer en ligne. Quatre stabilisateurs pratiques sont introduits : success-buffer regularization, conservative advantages, régularisation χ², et réduction de la Q-variance. Le fine-tuning RL des politiques génératives est l'un des principaux verrous pour le déploiement industriel de la robotique. Le behavior cloning pré-entraîne des modèles polyvalents sur de larges corpus de démonstrations, mais plafonne en deçà des taux de succès requis pour l'assemblage de précision ou la manipulation de pièces complexes. L'absence de données expertes dans le replay buffer est stratégiquement importante : un intégrateur adaptant un modèle fondation à une cellule de production spécifique n'a pas à collecter de nouvelles démonstrations coûteuses. Les stabilisateurs introduits adressent directement la sur-exploitation des critiques, mode d'échec documenté qui rendait les approches précédentes instables sur des observations en pixels. Les politiques diffusion pour la robotique ont émergé en 2023 avec Chi et al. (Diffusion Policy), avant d'être étendues au flow matching avec Pi-0 de Physical Intelligence et la famille GR00T de NVIDIA. Le fine-tuning RL de ces architectures avait été tenté avec des méthodes comme DPPO, mais restait limité aux politiques bien initialisées et nécessitait souvent des données expertes. OGPO se positionne comme une approche généraliste applicable à toute GCP. En compétition académique, les laboratoires de Berkeley, CMU et Stanford travaillent sur des problématiques proches. Côté industriel, Physical Intelligence, Boston Dynamics et Figure AI intègrent ce type d'optimisation dans leurs pipelines, et des acteurs européens comme Enchanted Tools (France) opèrent dans cet espace. La suite logique est une validation à plus grande échelle sur hardware réel et une extension aux architectures VLA (Vision-Language-Action) multimodales.

UEEnchanted Tools (France) opère sur des architectures similaires et pourrait intégrer OGPO pour affiner ses politiques de contrôle sans collecte de démonstrations expertes supplémentaires.

💬 Le vrai verrou, c'était ça : fine-tuner sans avoir à collecter de nouvelles démos expertes, parce que personne n'a le budget pour ça quand on adapte un modèle fondation à une cellule de prod spécifique. OGPO le fait, sur des politiques diffusion comme Pi-0 ou GR00T, avec des stabilisateurs intégrés pour que ça ne s'effondre pas en cours de training sur des observations en pixels. Reste à tenir sur du hardware réel à grande échelle, mais comme porte d'entrée vers la robotique de précision sans données expertes, c'est le genre de papier qu'on attendait.

IA physiqueOpinion
1 source
Sécurité de l'IA incarnée : panorama des risques, attaques et défenses
143arXiv cs.RO 

Sécurité de l'IA incarnée : panorama des risques, attaques et défenses

Une équipe de chercheurs a publié fin avril 2026 sur arXiv (identifiant 2605.02900) une revue systématique de la sécurité dans l'IA incarnée (embodied AI), couvrant plus de 400 articles académiques. Le périmètre s'étend à l'ensemble du pipeline d'un agent physique : perception sensorielle, cognition, planification, exécution d'actions et interactions humain-robot. La taxonomie proposée organise les menaces en quatre grandes familles d'attaques (adversariales, backdoor, jailbreak, matérielles) et trois axes de défense (détection d'attaques, entraînement robuste, inférence sûre). Les domaines d'application ciblés incluent la conduite autonome, la robotique industrielle et d'assistance, ainsi que les applications médicales, tous caractérisés par des conséquences physiques directes en cas de défaillance. Ce travail pointe trois angles morts particulièrement préoccupants pour les intégrateurs et les équipes produit. D'abord, la fragilité de la fusion multimodale : combiner vision, LiDAR et langage amplifie les surfaces d'attaque plutôt que de les réduire, contrairement à l'hypothèse dominante de redondance. Ensuite, l'instabilité de la planification sous attaque jailbreak : les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2, de plus en plus déployés dans des systèmes humanoïdes, restent vulnérables à des injections de prompt qui court-circuitent les contraintes de sécurité définies au niveau applicatif. Enfin, la confiance dans les interactions en monde ouvert demeure non résolue dès que le scénario sort des conditions de laboratoire, ce qui est précisément le cas des déploiements industriels réels. Le contexte est celui d'une accélération brutale du déploiement d'agents physiques autonomes depuis 2024, portée par des acteurs comme Figure AI, Boston Dynamics, 1X Technologies, Apptronik et des labos publics (Stanford, CMU, ETH Zurich). L'absence d'un cadre de sécurité unifié est jusqu'ici restée dans l'angle mort de la course aux performances : les benchmarks sectoriels mesurent la dextérité et le sim-to-real transfer, rarement la robustesse face à un adversaire actif. Ce survey constitue un premier référentiel structuré ; il ne propose pas de solution clé en main mais identifie les briques manquantes, notamment les protocoles d'évaluation standardisés pour les attaques sur hardware embarqué et les mécanismes de contrôle d'intégrité des VLA en production.

UELes acteurs européens déployant des VLA (dont ETH Zurich, contributeur cité) et soumis à l'AI Act, qui classe les applications médicales et industrielles en systèmes à haut risque, devront intégrer les protocoles d'évaluation de robustesse adversariale identifiés comme manquants par ce survey.

RechercheOpinion
1 source
Sentinel-VLA : modèle VLA métacognitif à surveillance active pour le raisonnement dynamique et la récupération d'erreurs
144arXiv cs.RO 

Sentinel-VLA : modèle VLA métacognitif à surveillance active pour le raisonnement dynamique et la récupération d'erreurs

Une équipe de recherche publie sur arXiv (arXiv:2605.01191, mai 2026) Sentinel-VLA, un modèle de type vision-language-action (VLA) doté d'un module de surveillance active baptisé "sentinel". Contrairement aux VLA classiques qui exécutent des plans fixes, Sentinel-VLA déclenche un raisonnement approfondi uniquement lorsque c'est nécessaire : lors de la planification initiale d'une tâche, ou lorsque le module sentinel détecte une erreur d'exécution en temps réel. L'ensemble des données d'entraînement, couvrant 44 tâches et plus de 2,6 millions de transitions, a été généré et annoté automatiquement via un pipeline dédié. Le modèle intègre également l'algorithme SECL (Self-Evolving Continual Learning), qui lui permet d'identifier ses propres limites de compétence et de collecter automatiquement de nouvelles données pour les repousser, combiné à un adaptateur OC-Adapter (Orthogonal Continual Adapter) qui contraint les mises à jour de paramètres dans un espace orthogonal pour éviter l'oubli catastrophique. En conditions réelles (les détails des configurations expérimentales ne sont pas encore disponibles dans cette prépublication), les auteurs rapportent un gain de plus de 30 % de taux de succès par rapport à PI0, le modèle de Physical Intelligence actuellement considéré comme état de l'art. Le code, les poids et le pipeline de génération de données seront publiés en open source. Ces résultats, si confirmés par la communauté, adressent un blocage majeur dans le déploiement industriel des robots manipulateurs : l'incapacité à se corriger face à une perturbation imprévue. Les VLA existants, qu'il s'agisse de PI0, d'OpenVLA ou des dérivés de RT-2, produisent des plans d'action relativement rigides et échouent dès lors qu'une pièce est mal positionnée ou qu'un objet glisse. Le mécanisme "sentinel" propose une réponse architecturale à ce problème en dissociant l'exécution routinière (peu coûteuse en calcul) du raisonnement correctif (déclenché à la demande), ce qui est pertinent pour un déploiement sur du matériel embarqué à puissance de calcul limitée. L'approche SECL, qui combine auto-évaluation des capacités et apprentissage continu sans oubli, représente également une piste sérieuse pour les intégrateurs qui cherchent à étendre progressivement le répertoire de tâches d'un robot sans retraining complet. Il convient néanmoins de noter que le +30 % annoncé est issu d'expériences en laboratoire dont le protocole exact reste à préciser, et que les vidéos de démonstration n'ont pas encore été rendues publiques au moment de cette prépublication. Sentinel-VLA s'inscrit dans une vague de travaux cherchant à rendre les VLA robustes hors environnement contrôlé, une problématique que Physical Intelligence avait mise en lumière avec PI0 (lancé fin 2024) et que des acteurs comme Figure AI (Figure 03), Boston Dynamics ou 1X Technologies tentent également d'adresser côté hardware. Du côté recherche, les laboratoires de Carnegie Mellon, Stanford et Berkeley publient régulièrement des variantes de VLA avec des stratégies de correction différentes (chain-of-thought embarqué, boucles de feedback visuelles). La particularité de Sentinel-VLA est de traiter la correction non comme un post-processing, mais comme une composante native de l'architecture. L'open-source annoncé, code, poids et pipeline de données, pourrait accélérer l'adoption de cette approche dans la communauté académique et chez les constructeurs de robots à budget R&D contraint. Aucune date de release ni partenariat industriel n'est mentionné dans cette version préliminaire.

UELa publication open-source prévue (code, poids, pipeline de données) pourrait bénéficier aux laboratoires de robotique européens travaillant sur les VLA manipulateurs, mais aucun acteur français ou européen n'est directement impliqué dans cette prépublication.

💬 Ce qui m'intéresse ici, c'est pas le +30% (les configs restent floues, faut attendre les vidéos), c'est que la correction d'erreur est dans l'archi, pas greffée dessus après coup. Sur du matériel embarqué avec peu de calcul disponible, c'est le genre de truc qu'on attendait depuis un moment. Reste à voir si ça tient hors labo, mais l'open source annoncé va vite mettre ça à l'épreuve.

IA physiqueOpinion
1 source
AnchorD : ancrage métrique de la profondeur monoculaire par graphes de facteurs
145arXiv cs.RO 

AnchorD : ancrage métrique de la profondeur monoculaire par graphes de facteurs

Des chercheurs de l'université de Fribourg-en-Brisgau ont publié AnchorD, un framework d'estimation de profondeur présenté comme entraînement-libre (training-free), capable d'ancrer les prédictions métriques de modèles monoculaires dans des mesures de capteurs réels via une optimisation par graphes de facteurs (factor graphs). La méthode réalise un alignement affine par patches, ce qui permet de recaler localement les estimations monoculaires sur une profondeur métrique réelle tout en préservant les discontinuités géométriques fines. Pour valider l'approche dans des conditions difficiles, l'équipe introduit également un nouveau jeu de données de référence avec vérité terrain dense sur des scènes complètes contenant des objets non-lambertiens (transparents, spéculaires, métalliques), obtenue en combinant une peinture mate réfléchissante en spray sur les surfaces problématiques et une fusion multi-caméras, contournant ainsi la dépendance aux annotations CAD par objet des benchmarks existants. Le code et les données sont publiés en accès libre. L'enjeu pratique est réel pour les intégrateurs de manipulation robotique et de préhension : les capteurs de profondeur structurés (Time-of-Flight, stéréo, LiDAR) décrochent systématiquement sur les surfaces transparentes comme le verre ou spéculaires comme l'inox, des matériaux omniprésents en milieu industriel. Les grands modèles de profondeur monoculaire, Depth Anything V2, UniDepth, ZoeDepth, produisent des priors structurels excellents mais souffrent d'ambiguïté d'échelle métrique, ce qui les rend inutilisables directement pour la planification de trajectoire ou le calcul de prise. AnchorD propose de fusionner les deux sources d'information sans réentraînement, ce qui le rend déployable sur du matériel existant avec n'importe quel modèle fondation de profondeur en entrée. Les auteurs rapportent des améliorations constantes sur des capteurs et domaines variés, sans communiquer de métriques numériques précises dans le résumé, les chiffres restent à consulter dans le papier complet. Ce travail s'inscrit dans un axe actif de recherche qui tente de "métrifier" les modèles de vision de fondation pour les rendre directement exploitables en robotique, sans passer par des pipelines de calibration coûteux. L'université de Fribourg (groupe Robotics and Embedded Systems, liens avec le DFKI) est un acteur reconnu en perception robotique, notamment sur les terrains non structurés. Dans l'espace concurrent, des approches comme Metric3D v2 (Tianjin/Baidu) ou ScaleDepth cherchent le même objectif par voie paramétrique ou de fine-tuning; AnchorD se distingue par son absence totale de phase d'entraînement. L'article est un preprint arXiv (2605.02667, mai 2026), non encore évalué par les pairs: les résultats présentés devront être confirmés lors d'une revue formelle.

UEContribution d'un laboratoire européen (Fribourg/DFKI) publiée en open-source et sans réentraînement, directement exploitable par les intégrateurs EU pour la manipulation d'objets industriels à surfaces transparentes ou spéculaires.

RecherchePaper
1 source
Revue complète des modèles du monde pour l'apprentissage robotique
146arXiv cs.RO 

Revue complète des modèles du monde pour l'apprentissage robotique

Un groupe de chercheurs a publié début mai 2026 une revue systématique sur les modèles de monde appliqués à l'apprentissage robotique (arXiv:2605.00080). Ces modèles sont des représentations prédictives qui modélisent l'évolution d'un environnement en réponse aux actions d'un agent. Utilisés dans six fonctions distinctes, policy learning, planification, simulation, évaluation, génération de données et entraînement à l'échelle fondation, ils sont devenus un composant central des architectures robotiques modernes. Le survey couvre les grandes familles d'architectures, leurs rôles fonctionnels et leurs applications dans l'embodied AI, en s'étendant à la navigation mobile et à la conduite autonome. Les auteurs inventorient également les benchmarks et protocoles d'évaluation disponibles dans le domaine, et maintiennent un dépôt GitHub mis à jour en continu pour intégrer les travaux émergents. L'intérêt de cette synthèse réside dans la fragmentation actuelle du domaine : les architectures de modèles de monde se développent en silos, reinforcement learning, génération vidéo, VLA (Vision-Language-Action models), avec peu de recoupement méthodologique. Le survey clarifie comment ces modèles s'articulent avec les politiques robotiques, comment ils servent de simulateurs appris pour le RL, et comment les modèles de monde vidéo ont évolué de la génération par imagination vers des formulations contrôlables à l'échelle fondation. Pour les équipes R&D et les intégrateurs industriels, cette cartographie facilite le choix architectural et réduit le risque de duplication des efforts. L'accélération récente du domaine est en partie portée par la montée en puissance des foundation models et de la génération vidéo large-scale depuis 2023. Les modèles de monde en robotique s'enracinent dans les travaux de Schmidhuber dans les années 1990 et ont connu un regain majeur avec DreamerV3 (Google DeepMind, 2023), UniSim, et les VLA récents intégrant une prédiction d'état futur comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les acteurs dominants restent américains et chinois, DeepMind, NVIDIA, Physical Intelligence, Figure AI, avec des contributions académiques majeures de Stanford, MIT et Berkeley. En Europe, les contributions restent moins visibles à l'échelle internationale, bien que des acteurs comme Pollen Robotics (France) et l'INRIA travaillent sur des approches connexes. Le principal défi identifié est de combler le sim-to-real gap via des modèles suffisamment fidèles pour substituer partiellement les environnements physiques dans la boucle d'entraînement.

UEPollen Robotics et l'INRIA sont mentionnés comme acteurs connexes mais restent en retrait international ; cette cartographie peut aider les équipes européennes à identifier les lacunes à combler face à la domination américaine et chinoise.

RecherchePaper
1 source
Navigation omnidirectionnelle par vision : apprentissage par distillation enseignant-élève avec estimation de profondeur monoculaire
147arXiv cs.RO 

Navigation omnidirectionnelle par vision : apprentissage par distillation enseignant-élève avec estimation de profondeur monoculaire

Des chercheurs ont publié sur arXiv (2603.01999) un système de navigation omnidirectionnelle pour robots mobiles industriels fonctionnant sans LiDAR, en s'appuyant sur quatre caméras RGB et un modèle de profondeur monoculaire. L'architecture dite "enseignant-étudiant" entraîne d'abord une politique "enseignant" par renforcement (PPO) dans NVIDIA Isaac Lab, avec des observations LiDAR 2D privilégiées couvrant l'empreinte complète du robot. Cette politique distille ensuite son comportement vers une politique "étudiant" qui ne perçoit l'environnement qu'à travers des cartes de profondeur générées par une version fine-tunée de Depth Anything V2. L'ensemble du pipeline (estimation de profondeur, exécution de la politique, contrôle moteur) tourne entièrement sur un NVIDIA Jetson Orin AGX embarqué sur un DJI RoboMaster, sans aucun calcul externe. En simulation, l'étudiant atteint 82 à 96,5 % de taux de succès, contre 50 à 89 % pour l'enseignant LiDAR. Sur terrain réel, il le surpasse également face à des obstacles à géométrie complexe : structures en surplomb et objets ras-du-sol qui échappent au plan de balayage unique d'un capteur 2D. Ce résultat remet en cause un postulat industriel courant : que la navigation robuste en entrepôt ou en atelier nécessite obligatoirement un LiDAR 3D ou une caméra de profondeur dédiée. Le LiDAR 2D, standard des AMR déployés aujourd'hui chez MiR, Fetch ou Locus Robotics, ne capture qu'une tranche horizontale de l'environnement et ignore les rebords en surplomb, les jambes de table et les obstacles ras du sol. En montrant qu'une politique visuelle apprise surpasse son propre enseignant LiDAR sur ces cas critiques, les auteurs valident un transfert sim-to-real fonctionnel et ouvrent la voie à des plateformes AMR significativement moins coûteuses. L'inférence entièrement embarquée supprime par ailleurs toute dépendance cloud, point critique pour les intégrateurs industriels soumis à des contraintes de latence ou de connectivité. L'approche s'appuie sur Depth Anything V2, modèle fondational d'estimation de profondeur monoculaire publié en 2024 par ByteDance Research, et sur NVIDIA Isaac Lab, lancé la même année comme successeur d'Isaac Gym. La plateforme DJI RoboMaster, initialement conçue pour la compétition étudiante, sert ici de banc de test de recherche pour sa robustesse mécanique. Les travaux s'inscrivent dans la tendance de policy distillation explorée notamment par ETH Zurich (projet ANYmal) pour la locomotion quadrupède. Le gap entre ces résultats expérimentaux et un déploiement industriel certifié reste à combler : les expériences réelles présentées restent limitées en durée et en diversité d'environnements, et aucun pilote en conditions de production n'est annoncé à ce stade.

UELes intégrateurs AMR européens s'appuyant sur des plateformes LiDAR 2D, dont MiR (danois), peuvent anticiper une réduction potentielle des coûts capteurs grâce à cette approche vision-only embarquée, mais aucun déploiement en conditions industrielles réelles n'est encore annoncé.

IndustrielPaper
1 source
Coordination par relais pour la collecte et livraison multi-robots économe en énergie
148arXiv cs.RO 

Coordination par relais pour la collecte et livraison multi-robots économe en énergie

Une équipe de chercheurs a publié sur arXiv (identifiant 2509.14127, version 2, septembre 2025) un cadre de planification baptisé VCST-RCP (Voronoi-Constrained Steiner Tree Relay Coordination Planning), conçu pour coordonner des flottes homogènes de robots mobiles dans des missions de livraison multi-colis depuis un dépôt unique vers des destinations dispersées. L'algorithme opère en deux phases: la construction d'un réseau de relais sparse combinant des interfaces d'échange dérivées de diagrammes de Voronoï à une optimisation par arbre de Steiner, puis la génération des plannings de collecte, relais et livraison sous contraintes de capacité de charge et de temps de service. Sur des expériences menées à plusieurs échelles, VCST-RCP réduit la distance totale parcourue par la flotte de 31% en moyenne, avec des pics proches de 50%, par rapport à l'algorithme d'affectation Hungarian assignment, et surpasse significativement OR-Tools CVRP, le solveur de référence de Google. La significativité statistique est établie à p inférieur à 10^-3, et le gain d'efficacité de livraison, mesuré en colis par kilomètre parcouru, dépasse 50%. Ces résultats intéressent directement les opérateurs de flottes AMR (robots mobiles autonomes) en intralogistique et en livraison de dernier kilomètre, où la distance parcourue est directement corrélée au coût énergétique et à l'usure matérielle. L'étude d'ablation incluse dans les travaux est particulièrement instructive: elle démontre que l'optimisation du placement des points de relais génère des gains substantiellement supérieurs à ceux obtenus par simple repartitionnement spatial, établissant le design des relais comme levier dominant de la performance système. Cela remet en question l'hypothèse implicite répandue chez les intégrateurs, selon laquelle le transport direct source-destination constitue la référence optimale par défaut. La scalabilité démontrée à différentes tailles de flotte est un argument supplémentaire pour une adoption industrielle. Le problème MRPD (Multi-Robot Pickup and Delivery) est un classique de l'optimisation combinatoire en robotique, mais les architectures relay-based à grande échelle restent peu explorées. Hungarian assignment et OR-Tools CVRP, les deux références battues dans cette étude, sont précisément les solveurs utilisés par les éditeurs de WMS et les intégrateurs de flottes dans des environnements comme ceux d'Exotec (Roubaix), 6 River Systems ou Locus Robotics. Ce travail reste cependant un preprint arXiv, sans validation sur plateforme réelle annoncée: les gains en simulation sont solides, mais la transition sim-to-real, notamment face à la congestion dynamique et aux pannes robot en cours de mission, reste à prouver. Les extensions naturelles incluent des flottes hétérogènes et des dépôts multiples.

UEL'algorithme VCST-RCP, s'il est validé en environnement réel, pourrait réduire de ~30% les coûts énergétiques des flottes AMR d'acteurs européens comme Exotec (Roubaix) qui utilisent actuellement Hungarian assignment ou OR-Tools CVRP comme solveurs de référence.

RecherchePaper
1 source
Fausse faisabilité dans le MPC à impédance variable pour la locomotion sur pattes
149arXiv cs.RO 

Fausse faisabilité dans le MPC à impédance variable pour la locomotion sur pattes

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.22251) une analyse formelle d'une erreur de formulation dans les contrôleurs prédictifs à impédance variable (variable impedance MPC) pour la locomotion des robots à pattes. Le problème identifié : traiter la raideur articulaire comme une variable de décision instantanée génère un ensemble faisable (Fparam) strictement plus large que l'ensemble physiquement réalisable (Freal) sous dynamiques d'actionneur du premier ordre. Les auteurs formalisent cette distinction via le paramètre sans dimension α = ωs·T (bande passante de l'actionneur multipliée par l'échelle temporelle de la tâche). Sur un monopède sauteur 1D, ils prouvent l'existence d'un seuil analytique αcrit en dessous duquel aucune commande de raideur admissible ne réalise la prédiction du modèle. Un second seuil αinfeas < αcrit établit un régime où même restreindre la plage de raideur admissible ne corrige pas la faisabilité. La validation numérique sur dix combinaisons de paramètres montre une déviation monotone croissante à mesure qu'α diminue (R² = 0,99 en log-log). Le transfert sur un pendule inversé à ressort (SLIP) planaire confirme que les déviations de centre de masse et de chronométrage d'appui sont les conséquences primaires. Ce résultat a des implications directes pour les intégrateurs déployant des MPC sur robots à pattes. Les formulations existantes peuvent paraître faisables numériquement tout en étant irréalisables physiquement, ce qui explique en partie le sim-to-real gap persistant dans les locomotions dynamiques. L'étude contredit l'hypothèse qu'un réglage conservateur des plages de raideur suffit à garantir la réalisabilité : en dessous d'α_infeas, cette approche est structurellement inopérante, quelle que soit la marge de sécurité appliquée. La commande à impédance variable s'est imposée en robotique à pattes pour adapter dynamiquement la compliance articulaire, notamment dans les plateformes d'ANYbotics (ANYmal), Boston Dynamics et Agility Robotics. La correction proposée par les auteurs est directe : augmenter l'état de prédiction du MPC avec la raideur courante ferme le décalage par construction. Aucune validation expérimentale sur hardware n'est encore annoncée, et la généralisation à des architectures multi-DOF reste à démontrer, ce qui limite pour l'instant la portée pratique immédiate du résultat.

UEANYbotics (Suisse/UE), dont la plateforme ANYmal est citée comme directement concernée, expose les équipes R&D européennes travaillant sur la locomotion dynamique à un risque de sim-to-real gap structurel lié à ce défaut de formulation MPC.

RecherchePaper
1 source
Planification hybride tâche-mouvement et gestion réactive des collisions pour le démontage multi-robots de batteries VE
150arXiv cs.RO 

Planification hybride tâche-mouvement et gestion réactive des collisions pour le démontage multi-robots de batteries VE

Des chercheurs ont publié, dans un article arXiv (2509.21020v2), un cadre de planification tâche-et-mouvement (TAMP) appliqué au démontage de batteries de véhicules électriques par deux bras robotiques travaillant en parallèle. Le système intègre une décomposition et une allocation dynamique des tâches, un planificateur de trajectoire basé sur RRT enrichi par un modèle de mélanges gaussiens (GMM), et une couche de sécurité hybride combinant un jumeau numérique MoveIt/FCL pour la détection prédictive de collisions avec un module d'évitement réactif par vision. Contrairement à une planification en boucle ouverte, le système opère en boucle fermée : il rescanne la scène en continu et met à jour la séquence de tâches restante selon l'état d'achèvement réel. Sur des expériences physiques de démontage de batteries EV, comparé à l'algorithme de référence RRTConnect, le framework réduit la longueur cumulée des trajectoires d'effecteur de 48,8 m à 17,9 m (soit -63,3 %), améliore le temps global de cycle (makespan) de 467,9 s à 429,8 s (-8,1 %), et diminue les volumes balayés par chaque robot (R1 : de 0,583 à 0,139 m³ ; R2 : de 0,696 à 0,252 m³), ainsi que leur chevauchement (de 0,064 à 0,034 m³). Ces résultats sont significatifs pour les intégrateurs industriels qui travaillent sur des lignes de démantèlement de batteries en fin de vie, un marché en forte croissance avec la montée en volume des VE. La combinaison planification prédictive et évitement réactif -- sans recours à une trajectoire figée -- est ce qui distingue l'approche : le système peut gérer des obstacles dynamiques et des imprévus de perception sans replanification globale coûteuse. La réduction de 63 % des distances parcourues réduit mécaniquement l'usure, le temps d'exposition aux risques de collision et l'énergie consommée, trois facteurs critiques pour un passage à l'échelle industrielle. Il faut noter que les expériences sont réelles (pas uniquement en simulation), ce qui renforce la crédibilité des métriques, même si les conditions exactes de test (variété des modules de batteries, taux d'échec de perception) ne sont pas détaillées dans le résumé. Le problème de démontage de batteries VE est devenu un axe de recherche prioritaire avec les objectifs européens de recyclage fixés par le règlement batteries 2023. Des équipes académiques et industrielles comme celles gravitant autour de MoveIt (OSRF), ainsi que des acteurs français tels que Pollen Robotics ou des intégrateurs proches du CEA-List, explorent des pistes similaires. Ce travail s'inscrit dans une tendance plus large : dépasser le sim-to-real gap en déployant des planificateurs hybrides sur du matériel réel, et adresser des tâches séquentielles complexes à contraintes d'ordre strict (précédence de dévissage, fragilité des cellules). La prochaine étape logique serait de tester la robustesse sur une gamme élargie de modèles de batteries et d'intégrer un retour haptique pour les phases de contact délicat.

UECe cadre TAMP répond directement aux objectifs de recyclage fixés par le règlement batteries UE 2023, en rendant le démantèlement automatisé de batteries VE en fin de vie plus efficace et scalable pour les intégrateurs industriels européens.

💬 63 % de réduction de trajectoires sur de vrais robots, pas en simulation, c'est rare dans les papiers arXiv et ça change vraiment la crédibilité du truc. La boucle fermée (rescan continu, réallocation dynamique) c'est exactement ce qu'il faut pour tenir en conditions industrielles, où une batterie mal positionnée ou un module abîmé peuvent faire dérailler toute la séquence. Reste à voir si ça tient sur une gamme large de modèles de batteries, parce que les conditions exactes de test ne sont pas détaillées, mais le règlement UE 2023 va créer la demande, et là il commence à y avoir des outils à la hauteur.

IndustrielPaper
1 source