Aller au contenu principal

Dossier arXiv cs.RO — page 7

2437 articles · page 7 sur 49

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines
301arXiv cs.RO RecherchePaper

Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines

Des chercheurs viennent de publier sur arXiv (arXiv:2607.08341, 10 juillet 2026) une nouvelle méthode baptisée AnyDexRT, conçue pour le retargeting cinématique des mains robotiques dextres en téléopération. Le retargeting consiste à traduire les mouvements de la main d'un opérateur humain en mouvements réalisables par une main robotique, une étape cruciale pour la téléopération et pour la collecte de démonstrations utilisées en apprentissage par imitation. Contrairement aux approches existantes, qui reposent souvent sur des objectifs conçus manuellement, un calibrage précis ou un appariement global des formes entre la main humaine et la main robotique, AnyDexRT ne nécessite aucune calibration préalable. La méthode combine un apprentissage auto-supervisé des correspondances entre le bout des doigts humains et robotiques avec un guidage humain en few-shot, c'est-à-dire à partir de très peu d'exemples, pour ancrer la correspondance dans les zones pertinentes pour la tâche. Un classificateur de contact affine ensuite spécifiquement les poses de préhension en pince. Cette approche répond à un problème concret et sous-estimé du secteur : la fragilité des pipelines de téléopération dès qu'on change de main robotique ou d'opérateur, ce qui limite la scalabilité de la collecte de données pour l'apprentissage par imitation, un goulot d'étranglement identifié dans le développement des modèles VLA (vision-langage-action) comme Pi-0 ou GR00T N2. En supprimant la calibration manuelle, AnyDexRT pourrait accélérer la production de démonstrations de qualité pour l'entraînement de politiques robotiques, un enjeu central pour les intégrateurs et laboratoires qui cherchent à faire passer leurs mains dextres de la démonstration en laboratoire à des déploiements plus robustes. Les auteurs rapportent des gains en qualité de retargeting et une réduction du réglage manuel sur des mains dextres variées et des tâches de téléopération réelles, sans toutefois préciser de métriques chiffrées vérifiables dans le résumé. Le travail s'inscrit dans la lignée des recherches sur le retargeting cross-embodiment, un axe actif face à la multiplication des mains robotiques commerciales aux morphologies différentes. Un site de projet accompagne la publication, mais aucun code, benchmark comparatif détaillé ni partenariat industriel n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit prêt à déployer.

1 source
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
302arXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

Voici l'article en français, sans titres ni séparateurs : Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR). Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA). Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

RecherchePaper
1 source
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
303arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
HiMoE-VLA : mélange hiérarchique d'experts pour des politiques VLA généralistes
304arXiv cs.RO 

HiMoE-VLA : mélange hiérarchique d'experts pour des politiques VLA généralistes

Des chercheurs ont publié début décembre 2025 sur arXiv une nouvelle architecture baptisée HiMoE-VLA (Hierarchical Mixture-of-Experts for generalist Vision-Language-Action policies), avec code et modèles en accès libre sur GitHub (ZhiyingDu/HiMoE-VLA). Le problème visé : les politiques VLA généralistes sont entraînées sur des mélanges hétérogènes de démonstrations robotiques couvrant des embodiments, espaces d'action et configurations de capteurs différents, ce qui provoque un "transfert négatif" quand un module d'action dense unique doit absorber cette diversité. HiMoE-VLA répond avec un module d'action hiérarchique à mélange d'experts : des couches Action-Space MoE en entrée/sortie spécialisent le calcul par espace d'action, des couches Heterogeneity-Balancing MoE dans les couches voisines absorbent les variations résiduelles de scènes et d'embodiments, et des blocs Transformer denses au centre intègrent les représentations partagées. Deux objectifs auxiliaires guident l'entraînement : une régularisation contrastive par espace d'action pour la spécialisation aux frontières, et un objectif d'équilibrage de charge entre experts. Sur les bancs d'essai, le modèle atteint un score de 3,98 sur CALVIN, 98,0 % de réussite sur LIBERO, et respectivement 75,0 % et 63,7 % de succès moyen sur des tâches réelles avec un bras xArm7 et une plateforme ALOHA. Le résultat le plus significatif tient moins aux scores bruts qu'à la démonstration, en co-entraînement hétérogène contrôlé, que HiMoE-VLA transforme en transfert positif ce qui reste un transfert négatif chez des bases de référence pourtant robustes. C'est un signal notable pour le secteur : l'un des obstacles récurrents à l'entraînement de politiques VLA "généralistes" est justement la difficulté à mélanger des jeux de données robotiques disparates, bras différents, capteurs différents, espaces d'action différents, sans dégrader les performances par rapport à des modèles spécialisés par plateforme. Pour les équipes qui construisent des fondations robotiques multi-embodiment, à l'image de ce que visent Physical Intelligence avec pi-0, NVIDIA avec GR00T N2 ou Figure avec Helix, la capacité à absorber l'hétérogénéité des données sans coût de performance est un enjeu direct de scalabilité : moins de collecte de données spécifiques par plateforme pour chaque nouveau déploiement industriel. HiMoE-VLA s'inscrit dans la lignée des architectures Vision-Language-Action apparues ces deux dernières années pour doter les robots de politiques de contrôle génériques, entraînées comme des modèles de fondation plutôt que comme des contrôleurs tâche par tâche. Le recours aux mélanges d'experts, déjà répandu dans les grands modèles de langage pour augmenter la capacité sans exploser le coût de calcul, est ici adapté spécifiquement au problème de l'hétérogénéité des données robotiques, via une hiérarchie à trois niveaux plutôt qu'un simple routage plat. Le papier, référencé arXiv:2512.05693, est une version révisée d'un travail antérieur, et les auteurs s'appuient sur CALVIN, LIBERO ainsi que des essais réels sur xArm7 et ALOHA comme bancs de test. Code et modèles étant publiés en open source, la validation indépendante par la communauté robotique déterminera si les gains observés se généralisent au-delà des bancs d'essai contrôlés vers des déploiements industriels réels.

RechercheActu
1 source
Robots miniatures modulaires : des graphes de synchronisation programmables pour plus d'adaptabilité et de tolérance aux pannes
305arXiv cs.RO 

Robots miniatures modulaires : des graphes de synchronisation programmables pour plus d'adaptabilité et de tolérance aux pannes

Des chercheurs publient sur arXiv (arXiv:2607.07281v1) un nouveau cadre appelé "programmable synchronization graphs" pour coordonner des essaims de robots miniatures modulaires, chaque module associant un actionneur et un capteur. Le principe : représenter chaque paire actionneur-capteur comme un nœud de réseau, et encoder la coordination locomotrice via un couplage de graphe plutôt que via un leader central ou un gabarit de démarche fixe. Des liens fixes à l'intérieur de sous-groupes synchronisent des groupes hétérogènes d'actionneurs, tandis qu'un petit nombre de liens signés entre sous-groupes programme les relations de phase. Sur des collectifs physiques allant jusqu'à neuf modules, les chercheurs montrent l'émergence de la synchronisation, un contrôle du déphasage entre mouvement en phase et en opposition de phase, et des allures de type galop ou trot sur un assemblage de cinq modules au sol. Remplacer un couplage dense (tous les modules connectés entre eux) par des topologies creuses "d-régulières" préserve la synchronisation tout en réduisant la charge de communication. Un algorithme d'apprentissage par sélection de liens (upper-confidence-bound) permet en outre au système d'apprendre en ligne les connexions nécessaires pour atteindre un état de phase cible. L'intérêt pratique tient surtout à la tolérance aux pannes : plus le degré du graphe de couplage est élevé, plus le système supporte de désactivations de modules avant de perdre la synchronisation. Sur un test de désactivation, ce contrôleur distribué évite le mode de défaillance typique du contrôle centralisé leader-suiveur, où la perte du module leader fait s'effondrer toute la coordination, et réduit l'erreur de phase dans le pire cas d'un facteur d'environ trois. Pour l'industrie des robots modulaires et essaims miniatures, c'est une piste concrète pour des systèmes robustes sans point de défaillance unique, un enjeu classique en robotique en essaim et en inspection dans des environnements confinés. Ce travail s'inscrit dans une problématique ancienne de la robotique modulaire : comment coordonner de nombreux modules imparfaits, à calcul et communication limités, sans dépendre d'une hiérarchie rigide. Les approches concurrentes reposent typiquement sur des architectures leader-suiveur ou des gabarits de démarche prédéfinis, moins robustes à la perte d'unités. Le papier ne précise pas de calendrier de déploiement industriel ; il s'agit à ce stade d'une démonstration en laboratoire sur des collectifs à petite échelle (jusqu'à neuf modules), dont la généralisation à des essaims plus grands reste à établir.

RecherchePaper
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
306arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source
Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels
307arXiv cs.RO 

Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels

Une équipe de recherche propose une nouvelle architecture pour piloter des robots de morphologies très différentes avec un seul contrôleur, dans un article intitulé "Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control" (arXiv:2506.08630, version 3, republiée en cross-listing début juillet 2026). Le système repose sur une architecture transformer combinée à une récurrence modulaire partagée entre les composants du robot (bras, jambes, articulations), conçue pour reconstruire des informations contextuelles sur les propriétés physiques d'un robot même quand ces données ne sont que partiellement disponibles au départ. Les chercheurs l'ont testé sur un large ensemble de robots simulés dans MuJoCo, le moteur physique open source largement utilisé en apprentissage par renforcement, à travers quatre environnements distincts. Résultat clé: le modèle affiche un gain net en généralisation zero-shot, c'est-à-dire sa capacité à piloter correctement des robots aux dynamiques, cinématiques et topologies jamais rencontrées pendant l'entraînement, sans réglage additionnel. Cette avancée s'inscrit dans un enjeu central pour l'industrie robotique: réduire le coût d'entraînement et de déploiement de contrôleurs spécifiques à chaque morphologie de robot. Un contrôleur universel capable de généraliser à de nouveaux designs mécaniques réduirait drastiquement les besoins en données et en calcul pour chaque nouveau modèle de robot, un problème que rencontrent aujourd'hui les fabricants de robots humanoïdes et de bras manipulateurs multiples. C'est aussi une contribution au débat sur la viabilité des architectures de type VLA (vision-language-action) et des politiques génériques à grande échelle: ici, la généralisation ne vient pas d'un volume massif de données mais d'une architecture qui exploite explicitement la structure modulaire du robot. L'approche s'inscrit dans une lignée de travaux en RL contextuel et en contrôle multi-robots qui exploitent déjà des informations sur la morphologie pour entraîner des agents partagés, mais qui peinaient jusqu'ici à généraliser à des morphologies fortement dissimilaires. Le fait que cet article soit republié en tant que "replace-cross" sur arXiv suggère une révision après retours de la communauté, un signe que le sujet suscite un intérêt actif en apprentissage par renforcement appliqué à la robotique. Les prochaines étapes attendues concernent une validation sur robots physiques réels, au-delà des simulations MuJoCo, pour confirmer le transfert sim-to-real.

RecherchePaper
1 source
Multi-agent : contrôle robotique par modèles vision-langage embarqués
308arXiv cs.RO 

Multi-agent : contrôle robotique par modèles vision-langage embarqués

Une équipe de recherche présente, dans un article publié sur arXiv (arXiv:2607.07403v1), une architecture multi-agents (MAS) pour le contrôle robotique conçue pour fonctionner entièrement en local, sans dépendre d'une infrastructure de calcul externe. Le système pilote un manipulateur mobile autonome polyvalent dans un entrepôt industriel simulé, où il exécute cinq catégories de tâches : inspection de sécurité, maintenance de l'entrepôt, recherche d'objets, vérification de la qualité des colis, et réponse aux demandes humaines. L'architecture s'appuie sur des modèles vision-langage (VLM) compacts, entre 3 et 20 milliards de paramètres, avec un fine-tuning appliqué spécifiquement pour améliorer la précision de l'inspection des colis. Un agent d'orchestration baptisé "Megamind" a été conçu pour limiter les pertes de contexte que subissent les petits modèles sur des tâches de planification à long horizon. Le système a été validé en configuration hardware-in-the-loop, sur un mini PC AMD Ryzen AI, combinant simulation et matériel embarqué réel. Ce travail s'attaque à trois limites récurrentes des VLM et des modèles vision-langage-action (VLA) appliqués à la robotique : l'explicabilité, la généralisation et les besoins en calcul. En s'appuyant sur des modèles compacts exécutés localement plutôt que sur des VLA massifs hébergés dans le cloud, l'approche promet une réduction des coûts d'infrastructure et une latence moindre, deux critères déterminants pour les intégrateurs industriels qui veulent déployer des robots autonomes sans dépendre d'une connectivité permanente. Les auteurs présentent leurs résultats comme une preuve qu'une architecture multi-agents entièrement embarquée constitue une alternative viable et économique aux déploiements dépendants du cloud, avec un potentiel de transfert vers le réel. Ces résultats restent toutefois obtenus en environnement simulé ; le passage à un robot physique en conditions réelles d'entrepôt demeure l'étape déterminante pour confirmer la promesse. L'essor de VLA comme Pi-0, GR00T N2 ou Helix a mis en évidence la dépendance de nombreux systèmes robotiques à des clusters de calcul distants, un frein pour les déploiements industriels à grande échelle. En misant sur des modèles plus petits orchestrés collectivement plutôt que sur un modèle monolithique unique, cette recherche se distingue des approches dominantes centrées sur des VLA de grande taille. Les chercheurs ont publié l'environnement de simulation en open source sous licence Apache 2.0, ouvrant la voie à des extensions et comparaisons par la communauté robotique. Les prochaines étapes attendues concernent la validation sur robot physique en entrepôt réel ainsi que l'élargissement des catégories de tâches couvertes par le système.

RecherchePaper
1 source
MPPI avec clustering intégré : éviter les échecs par moyennage, sélectionner les clusters pour obstacles dynamiques
309arXiv cs.RO 

MPPI avec clustering intégré : éviter les échecs par moyennage, sélectionner les clusters pour obstacles dynamiques

Une équipe de recherche présente CE-MPPI (Clustering-Embedded Model Predictive Path Integral Control), une nouvelle variante de l'algorithme MPPI utilisé pour la planification de trajectoire par échantillonnage sur systèmes non linéaires. Le papier, publié sur arXiv (2607.06499v1), s'attaque à un défaut connu du MPPI classique : quand plusieurs trajectoires évitant un obstacle sont possibles (contourner par la gauche ou par la droite), l'algorithme moyenne ces solutions incompatibles au lieu d'en choisir une, ce qui provoque une hésitation, voire une collision frontale. CE-MPPI ajoute une étape de clustering basée sur DBSCAN (density-based spatial clustering of applications with noise), couplée à une nouvelle caractéristique géométrique de direction extraite des points de référence issus des collisions, pour isoler les modes de trajectoires réalisables plutôt que de les fusionner. Une logique de sélection choisit ensuite le cluster de coût minimal en environnement statique, et privilégie la direction opposée au flux de l'obstacle en environnement dynamique. Testé en simulation 2D accélérée par JAX, puis sur un bras manipulateur réel UR5e à 6 degrés de liberté avec des rollouts calculés en parallèle sur GPU via Isaac Gym, le système réduit de 48% le temps pour atteindre l'objectif et de 12% la longueur du chemin de l'effecteur, par rapport au MPPI standard. Ce travail s'attaque à un problème très concret pour tout robot mobile ou manipulateur opérant en environnement encombré ou partagé avec des humains : l'hésitation face à un obstacle, aussi appelée "freezing robot problem" dans la littérature sur la navigation sociale. Pour les intégrateurs de robots mobiles autonomes (AMR) et de bras manipulateurs collaboratifs, une meilleure gestion des obstacles dynamiques sans ralentissement excessif touche directement la productivité en environnement industriel ou logistique. Les gains chiffrés (48% et 12%) restent toutefois mesurés en conditions contrôlées, sur un scénario de test spécifique, et ne préjugent pas d'une généralisation à des environnements de production plus complexes. MPPI est une méthode de contrôle prédictif par échantillonnage largement adoptée en robotique mobile et en conduite autonome, précisément pour sa capacité à gérer des dynamiques non linéaires sans modèle analytique complet. Son talon d'Achille, l'échec par moyennage en environnement non convexe, freinait son usage en zones encombrées. CE-MPPI s'inscrit dans une lignée de travaux cherchant à structurer l'espace des trajectoires échantillonnées plutôt que de le traiter comme un nuage homogène, une piste que d'autres équipes explorent aussi via des approches de clustering ou de sélection de modes. Aucun acteur français ou européen n'est mentionné dans cette publication.

RecherchePaper
1 source
InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle
310arXiv cs.RO 

InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle

Des chercheurs presentent InternVLA-A1.5, un modele unifie de manipulation robotique qui embarque a la fois les capacites semantiques d'un VLM preentraine et une prevision physique du futur, le tout dans une seule politique de controle. L'architecture conserve un backbone VLM natif qui continue de s'entrainer sur des taches de question-reponse visuelle et de prediction de sous-taches, auquel est attache un expert leger dedie a la generation continue d'actions. L'innovation cle porte sur la prevision du futur, reformulee comme un probleme de "latent-querying": un petit ensemble de jetons de prevision apprenables condense les elements du futur pertinents pour la tache en un code latent compact, sous la supervision d'un modele de generation video preentraine et gele, sans jamais apprendre de generation au niveau du pixel. La branche video est abandonnee au moment de l'inference, ce qui preserve le controle en temps reel. Preentraine sur 1,2 million d'episodes robotiques et 3 millions d'echantillons multimodaux, InternVLA-A1.5 obtient les meilleurs resultats globaux sur six benchmarks de simulation, et affiche en conditions reelles la generalisation compositionnelle la plus solide sur des combinaisons d'instructions inedites. Ce travail s'attaque a un probleme recurrent des modeles VLA unifies: entrainer conjointement comprehension semantique et prediction d'action tend a degrader les priors du VLM d'origine, cree des interferences entre objectifs heterogenes, et oblige souvent a reapprendre la prevision visuelle depuis zero en espace pixel, sans exploiter les modeles de generation video deja entraines. En evitant cette derniere etape couteuse tout en gardant un controle temps reel, l'approche laisse entrevoir, pour les integrateurs et les equipes de recherche en robotique, une voie pour combiner raisonnement de haut niveau et dynamique physique sans sacrifier la vitesse d'execution ni la robustesse face a des consignes formulees differemment de celles vues a l'entrainement, un point sensible pour tout deploiement commercial au-dela de la demo. Le papier s'inscrit dans la vague des modeles vision-langage-action generalistes portee ces deux dernieres annees par des acteurs comme Physical Intelligence avec pi-0, Nvidia avec GR00T N2, ou Figure AI avec Helix, tous confrontes au meme arbitrage entre semantique preservee et dynamique apprise. InternVLA-A1.5 reste pour l'instant une contribution de recherche publiee sur arXiv, evaluee sur benchmarks de simulation et experiences reelles limitees, et non un produit deploye a grande echelle; la suite logique serait une validation sur des plateformes robotiques tierces et des taches manufacturieres plus complexes pour confirmer que les gains de generalisation tiennent hors laboratoire.

IA physiqueActu
1 source
De l'arrivée en zone à l'ancrage au niveau de l'instance en navigation vision-langage
311arXiv cs.RO 

De l'arrivée en zone à l'ancrage au niveau de l'instance en navigation vision-langage

Une équipe de recherche vient de publier sur arXiv un article identifiant une faille méthodologique dans l'évaluation des agents de navigation vision-langage (VLN), ces systèmes qui suivent des instructions en langage naturel pour se déplacer et localiser des objets dans un environnement. Les protocoles actuels valident une navigation comme réussie dès que l'agent s'arrête dans un rayon de 3 mètres de la cible, sans vérifier son orientation finale ni si l'objet est réellement visible depuis sa position d'arrêt. Les auteurs baptisent ce problème le "Last-3-Meter Grounding Gap" et introduisent trois métriques inédites pour le quantifier : précision de proximité, visibilité de la cible et qualité du cadrage final. Pour y remédier, ils proposent REALM (Region-to-Entity Alignment for Last-3-Meter Navigation), un module de raffinement plug-and-play compatible avec n'importe quelle architecture existante, qui sépare la navigation longue distance de l'approche fine du dernier tronçon et intègre une stratégie d'arrêt sensible à la visibilité pour éviter les arrêts prématurés. Un nouveau jeu de données, REVERIE-AIM, apporte 180 000 exemples d'entraînement courte distance avec des objectifs définis à l'échelle de l'instance d'objet, et non plus seulement de la région. Cette distinction entre "arriver dans la bonne zone" et "voir réellement l'objet visé" touche directement la fiabilité des robots mobiles et humanoïdes appelés à manipuler des objets précis en environnement réel, où un mètre d'erreur ou un mauvais angle de vue peut rendre l'action suivante impossible. Le travail illustre un écart classique entre métriques de démonstration favorables et performance réellement exploitable en production, un point sensible pour les intégrateurs qui évaluent des piles de navigation avant déploiement industriel. Testé sur quatre architectures VLN différentes, REALM améliore systématiquement la précision de proximité et le taux de succès de l'ancrage visuel, ce qui suggère une adoption possible comme brique additionnelle plutôt que comme refonte complète des systèmes existants, sans calendrier de déploiement commercial annoncé à ce stade.

RecherchePaper
1 source
GaP : un système multi-agents auto-apprenant à graphe-politique pour l'automatisation variationnelle
312arXiv cs.RO 

GaP : un système multi-agents auto-apprenant à graphe-politique pour l'automatisation variationnelle

Une équipe de recherche publie sur arXiv (référence 2607.05369, version 1) un système baptisé GaP, pour Graph-as-Policy, destiné à un type de tâches qu'elle définit sous le terme d'"automatisation variationnelle" (VA) : des opérations industrielles où la géométrie et la position des objets varient davantage que dans l'automatisation fixe classique, mais sans atteindre la complexité totale d'un environnement ouvert. Concrètement, GaP est un harnais multi-agents qui génère automatiquement des graphes de calcul dirigés combinant des nœuds de perception, de planification et de contrôle, puisés dans une bibliothèque modulable de compétences robotiques ouverte baptisée MORSL. Le système crée ensuite un environnement de simulation interne pour rejouer en parallèle différentes variantes de graphes sur une même tâche, affinant progressivement leur structure et leurs paramètres afin d'améliorer le taux de réussite et le débit. Les auteurs annoncent des résultats sur huit nouveaux bancs d'essai qu'ils ont eux-mêmes conçus, quatre en simulation et quatre en conditions réelles, avec des performances qui surpasseraient nettement les méthodes de référence, sans toutefois préciser lesquelles ni détailler l'écart chiffré, un point qui mérite prudence tant que les données ne sont pas vérifiées indépendamment. L'intérêt de l'approche tient à sa tentative de réconcilier deux écoles longtemps opposées dans la robotique industrielle : la programmation interprétable héritée du Task and Motion Planning et de ROS, et l'adaptabilité des politiques apprises sans modèle, du type de celles qui alimentent les modèles VLA récents. Pour les intégrateurs et décideurs industriels, la promesse est celle d'une fiabilité d'exécution proche de l'automatisation fixe, tout en gérant les variations de pose et de géométrie que les lignes rigides ne tolèrent pas, sans dépendre entièrement d'une politique de bout en bout dont le comportement reste difficile à auditer. Le travail s'inscrit dans la continuité des recherches sur le TAMP et l'écosystème ROS, en réponse implicite aux limites de fiabilité observées chez les politiques génératives pures. Code, données et bancs d'essai sont publiés en accès libre sur graph-robots.github.io/gap, ce qui ouvre la voie à des comparaisons indépendantes avec d'autres architectures avant toute adoption industrielle.

RecherchePaper
1 source
RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné
313arXiv cs.RO 

RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné

La robotique humanoide et manipulatrice s'appuie de plus en plus sur une architecture a deux niveaux: un "System 1" qui gere le controle moteur bas niveau et un "System 2", le cerveau incarne, charge du raisonnement et de la prise de decision. Un article mis a jour sur arXiv presente RoboBench, un benchmark concu pour evaluer specifiquement ce cerveau incarne lorsqu'il est implemente par un modele multimodal de grande taille (MLLM). Le benchmark couvre cinq dimensions: comprehension des instructions, raisonnement perceptif, planification generalisee, prediction d'affordances et analyse d'echecs, reparties en 14 capacites, 25 taches et 6 092 paires question reponse. Les donnees combinent des jeux de donnees robotiques reels a grande echelle et des collectes internes couvrant plusieurs types de robots, des objets aux attributs varies, des scenes multi vues et des taches de navigation dependantes de la memoire. Dix huit MLLMs de pointe ont ete testes sur ce benchmark. L'enjeu depasse la simple mesure de performance: la plupart des benchmarks existants evaluent surtout le succes final d'execution, sans isoler la qualite du raisonnement de haut niveau qui precede l'action, ni la realite des taches proposees. RoboBench cherche a combler cet ecart en testant directement si un modele comprend une consigne implicite, raisonne correctement sur l'espace et le temps, ou diagnostique un echec, independamment de la couche de controle moteur. Les resultats montrent des limites persistantes sur la comprehension d'instructions implicites, le raisonnement spatio-temporel, la planification inter scenarios, la comprehension fine des affordances et le diagnostic d'echecs, ce qui questionne la maturite reelle des MLLMs actuels comme cerveaux de robots, au dela des demonstrations souvent mises en avant par les laboratoires. Pour l'evaluation de la planification, les auteurs introduisent un cadre inedit dit "MLLM comme simulateur du monde", qui verifie si un plan predit peut effectivement produire les changements d'etat critiques d'un objet sous contraintes physiques et visuelles, plutot que de se contenter d'un simple appariement symbolique avec un plan de reference. Cette approche vise une evaluation plus fidele du raisonnement a long horizon. Les chercheurs analysent egalement le lien entre ces capacites cognitives incarnees et la performance reelle en controle robotique, positionnant RoboBench comme un outil de reference pour orienter la prochaine generation de MLLMs vers une intelligence robotique plus robuste.

RecherchePaper
1 source
Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré
314arXiv cs.RO 

Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré

VulcanVoxel, un nouveau système de perception robotique présenté dans un article publié le 2 juillet sur arXiv (2607.02549), résout un problème concret de la logistique automatisée : comment une lame robotique doit-elle balayer des articles entassés dans des bacs en tissu pour créer un espace d'insertion, lors des opérations de stowing (rangement) en entrepôt. Plutôt que de prédire une pose unique pour la lame comme le font les approches classiques, le système reconstruit un champ d'occupation 3D voxel par voxel via un autoencodeur masqué, conditionné sur la géométrie de la scène. Entraîné sur 10 000 épisodes réels de rangement en entrepôt sans aucune annotation humaine, VulcanVoxel atteint un taux de couverture top-5 de 0,89, contre 0,71 pour la meilleure référence basée sur des poses SE(3). Une version distillée du modèle permet une inférence directe RGB vers voxel en seulement 30 millisecondes, contre 1,4 seconde pour l'approche voxel-à-voxel complète. Les chercheurs ont aussi publié un jeu de données d'épisodes réels d'insertion de lame, avec observations RGB-D et trajectoires de pose, disponible sur armbench.com. L'intérêt de ce travail dépasse le cas d'usage de la lame de stowing : il pointe une limite structurelle des méthodes actuelles d'apprentissage d'affordances, y compris les objectifs génératifs récents comme le flow matching. Ces méthodes, entraînées sur des données produites par une seule politique d'exécution, n'apprennent qu'une distribution unimodale et ne peuvent pas récupérer les alternatives géométriques équivalentes qui existent réellement dans une scène encombrée. En reformulant le problème dans l'espace plutôt que dans l'espace des poses, VulcanVoxel capture nativement cette multimodalité. Pour les intégrateurs et responsables d'automatisation d'entrepôt, le gain de vitesse (times 45 environ) est ce qui rend l'approche déployable en cadence de production réelle, là où le calcul voxel-à-voxel complet resterait trop lent. Le contexte de cette recherche est celui des systèmes de stowing en production qui génèrent, selon les auteurs, des millions d'épisodes de manipulation, un volume caractéristique des opérations d'automatisation logistique à grande échelle, comme celles qu'on associe généralement au jeu de données ArmBench. L'article positionne explicitement son approche contre les méthodes de pose SE(3) et les modèles génératifs unimodaux dominants dans le secteur, et la publication du jeu de données d'insertion de lame ouvre la voie à des comparaisons futures sur ce type de tâche de manipulation par affordances de volume libre, un sous-problème encore peu étudié comparé à la préhension classique.

RecherchePaper
1 source
Rapport technique RhinoVLA
315arXiv cs.RO 

Rapport technique RhinoVLA

HuixiAI a publié un rapport technique sur RhinoVLA, un modèle vision-langage-action (VLA) conçu spécifiquement pour tourner en temps réel sur du matériel embarqué, en co-conception avec le SoC edge Huixi R1. Le modèle s'appuie sur un backbone Qwen3-VL optimisé pour limiter le nombre de tokens visuels et contextuels traités, identifiés par les auteurs comme le principal goulot d'étranglement en latence des VLA sur puce embarquée : dans les opérateurs de projection dominés par le calcul matriciel (GEMM), le coût croît linéairement avec le nombre de tokens en entrée. RhinoVLA associe ce backbone allégé à un Action Expert à sortie continue, ainsi qu'à une interface unifiée combinant un registre de vues (View Registry), un espace d'état-action physique à 72 dimensions et des adaptateurs LoRA propres à chaque instance de robot, pour aligner des observations et schémas d'action hétérogènes sous une politique commune. Résultat annoncé : des performances comparables à π0.5 à taille de paramètres équivalente, avec une inférence de bout en bout à 11,69 Hz sur le Huixi R1, au-dessus du seuil de 10 Hz jugé nécessaire pour un contrôle en boucle fermée temps réel. L'enjeu dépasse la simple performance brute : la plupart des VLA démontrés en laboratoire (π0, GR00T N2, Helix) tournent sur GPU serveur ou desktop, loin des contraintes de puissance et de latence d'un robot mobile ou d'un bras industriel autonome. En optimisant simultanément l'architecture du modèle et la compilation matérielle (précision mixte, encodage visuel parallélisé), RhinoVLA s'attaque directement au fossé entre démonstration et déploiement réel, un point sensible pour les intégrateurs qui évaluent la viabilité commerciale des VLA en usine ou en logistique plutôt qu'en simple preuve de concept. Le projet doit être publié en open source sur GitHub (HuixiAI/RhinoVLA), une démarche qui s'inscrit dans la compétition croissante autour des architectures VLA généralistes multi-robots, aux côtés des travaux de Physical Intelligence (π0, π0.5) et NVIDIA (GR00T). Le document constitue une version révisée (v2) d'un rapport déjà déposé sur arXiv, sans calendrier de déploiement industriel précisé à ce stade.

IA physiqueActu
1 source
Combinaison d'échantillonnage contraint et d'apprentissage par renforcement pour la manipulation robotique
316arXiv cs.RO 

Combinaison d'échantillonnage contraint et d'apprentissage par renforcement pour la manipulation robotique

Manipulation robotique non préhensile : des chercheurs de la TU Berlin combinent échantillonnage contraint et apprentissage par renforcement Une équipe de la TU Berlin, associée au laboratoire de Marc Toussaint, publie une nouvelle version de ses travaux sur l'entraînement de politiques de manipulation robotique en environnement riche en contacts (arXiv:2602.08557v2). Le problème visé est la manipulation dite non préhensile, c'est à dire pousser, faire glisser ou réorienter un objet sans le saisir, une tâche où l'apprentissage par renforcement (RL) peine souvent à explorer suffisamment l'espace des stratégies possibles. La méthode proposée combine deux idées existantes mais rarement associées : d'une part des stratégies de réinitialisation qui contrôlent la distribution des états de départ de chaque épisode d'entraînement, et d'autre part un échantillonnage basé modèle sur des variétés contraintes, une technique reconnue pour son efficacité à générer des états physiquement valides. Le nouvel échantillonneur tient explicitement compte de la structure des contacts pour couvrir un large éventail de modes de contact, le tout combiné à une interpolation projetée et à un apprentissage curriculaire progressif. Sur le plan des résultats, l'équipe affirme surpasser à la fois le RL classique sans échantillonnage contraint et les méthodes alternatives de réinitialisation, en entraînant des politiques universelles, non préhensiles et dynamiques. L'intérêt pour le secteur tient moins à un produit qu'à une brique méthodologique : la manipulation en contact riche, aujourd'hui l'un des points durs de la robotique appliquée (tri industriel, réorientation d'objets sur convoyeur, préhension d'objets déformables), reste largement dominée par des politiques apprises en simulation qui échouent à généraliser sur des configurations de contact non vues à l'entraînement. Une méthode qui améliore la couverture des modes de contact pendant l'apprentissage adresse directement ce problème de généralisation, sans dépendre d'un matériel ou d'un actionneur particulier. Il s'agit ici d'une contribution académique, pas d'une annonce produit ni d'un déploiement industriel, du matériel supplémentaire étant disponible sur le site du laboratoire. Le travail s'inscrit dans la continuité des recherches de Toussaint sur la planification géométrico logique et les approches hybrides modèle/apprentissage, un courant de recherche européen qui contraste avec les approches purement data-driven (type VLA) privilégiées par les laboratoires américains sur les plateformes humanoïdes commerciales.

UEContribution de la TU Berlin (laboratoire de Marc Toussaint) qui renforce l'expertise europeenne en manipulation robotique hybride modele/apprentissage, une approche qui se distingue des methodes VLA data-driven privilegiees par les laboratoires americains.

RecherchePaper
1 source
Robot humanoïde : transfert de mouvement corporel complet à grande échelle via un recalage cinéodynamique implicite
317arXiv cs.RO 

Robot humanoïde : transfert de mouvement corporel complet à grande échelle via un recalage cinéodynamique implicite

Des chercheurs présentent IKMR (Implicit Kinodynamic Motion Retargeting), un pipeline neuronal conçu pour transférer des mouvements humains complets vers des robots humanoïdes à très grande échelle. Le système repose sur un autoencodeur double à convolution de graphes basé sur le squelette, qui projette les configurations cinématiques humaines et robotiques, structurellement différentes, dans un espace latent topologique commun. Une phase de raffinement physique vient ensuite corriger les trajectoires grâce à un retour de suivi physique simulé, garantissant leur viabilité mécanique. Résultat clé : un débit de conversion de données dépassant 5000 images par seconde, un ordre de grandeur inatteignable avec les méthodes classiques d'optimisation numérique image par image. Les auteurs rapportent aussi des déploiements réels de contrôle corps entier sur robot humanoïde pour valider l'approche au-delà de la simulation. L'enjeu dépasse la prouesse technique. L'apprentissage par imitation humain-vers-humanoïde est vu comme une des voies les plus prometteuses pour contourner la pénurie de données d'entraînement en robotique, en exploitant les vastes corpus de mouvement humain déjà disponibles (vidéos, capture de mouvement, modèles génératifs). Mais ces données brutes sont bruitées, saccadées, sujettes au scintillement image par image, des défauts qui, une fois amplifiés par le retargeting classique, peuvent produire des mouvements physiquement dangereux pour le matériel. En traitant le nettoyage du bruit comme un sous-produit implicite de l'apprentissage plutôt qu'une étape séparée, et en déplaçant le coût de calcul vers l'inférence hors ligne, IKMR lève un goulot d'étranglement pratique pour quiconque veut synthétiser des jeux de données massifs de mouvements humanoïdes exploitables sans validation manuelle intensive. Ce travail, publié en version révisée sur arXiv, s'inscrit dans une dynamique de recherche plus large où plusieurs laboratoires cherchent à automatiser et industrialiser la conversion de données de mouvement humain en données d'entraînement robotique, un préalable identifié pour faire progresser les politiques de contrôle corps entier de type VLA (vision-language-action) utilisées par les plateformes humanoïdes actuelles. Les auteurs ne précisent pas de partenariat industriel ni de plateforme robotique commerciale associée à cette publication.

RecherchePaper
1 source
Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel
318arXiv cs.RO 

Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel

Des chercheurs ont soumis sur arXiv (arXiv:2606.28805, juin 2026) un ensemble de modèles physiques haute-fidélité destinés à améliorer le sim-to-real transfer en robotique, appliqués au tennis de table de niveau professionnel. À des vitesses et effets compétitifs, une balle de ping-pong suit des trajectoires complexes et contre-intuitives que le robot doit anticiper en une fraction de seconde. Les modèles proposés couvrent trois domaines : la dynamique aérodynamique du vol de balle, avec les coefficients de traînée et de force de Magnus modélisés en fonction du nombre de Reynolds et du rapport de rotation ; le contact balle-table, intégrant les effets de déformation (buckling) de la balle sur le coefficient de restitution ainsi que des termes résiduels ; et le contact balle-raquette, via un réseau de neurones résiduel combiné à des coefficients de restitution normale et tangentielle et un amortissement torsionnel. Ces modèles ont servi à entraîner des politiques par apprentissage par renforcement (RL), aboutissant à ce que les auteurs décrivent comme le premier agent robotique capable d'affronter des joueurs professionnels en conditions réelles. L'intérêt technique dépasse le cadre sportif. La nature adversariale du tennis de table impose une contrainte rarement aussi explicite ailleurs : toute zone où la simulation diverge de la réalité devient exploitable par l'adversaire, forçant une précision de modélisation sans concession. Les travaux antérieurs en robotique ping-pong se cantonnaient à des plages étroites de vitesses et d'effets, insuffisantes pour reproduire les comportements balistiques du jeu professionnel. Que ce pipeline simulation-vers-réalité soit suffisamment fidèle pour approcher ce niveau valide l'approche pour des tâches de manipulation rapide en milieu industriel, où les essais réels restent coûteux ou dangereux, et renforce l'hypothèse que le sim-to-real gap est soluble par la précision physique plutôt que par l'accumulation de données réelles. Ce travail s'inscrit dans la continuité directe des recherches publiées par Google DeepMind en 2024, qui avaient démontré qu'un robot pouvait battre des joueurs amateurs confirmés en conditions réelles. Ce nouveau papier documente les fondations physiques qui rendent possible le saut qualitatif vers le niveau professionnel. Plusieurs équipes concurrentes utilisent le ping-pong comme benchmark de robotique agile, mais peu ont publié des modèles de contact aussi détaillés pour les phases raquette-balle et balle-table. La revendication de compétitivité face à des professionnels reste à confirmer par des évaluations indépendantes, le papier étant une prépublication non encore évaluée par les pairs. Les suites logiques incluent la généralisation de ces modèles de contact résiduels à d'autres objets déformables et leur transposition à des tâches industrielles de manipulation précise à haute cadence.

RecherchePaper
1 source
Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste
319arXiv cs.RO 

Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste

Des chercheurs ont publié sur arXiv (référence 2606.29384) Event-VLA, un framework combinant des caméras événementielles avec des modèles Vision-Language-Action (VLA) pour rendre la manipulation robotique robuste dans des conditions d'éclairage dégradées. L'approche repose sur l'intégration de flux d'événements, une modalité de capteur neuromorphique qui encode les variations de luminosité pixel par pixel avec une résolution temporelle de l'ordre de la microseconde, contrairement aux caméras RGB classiques qui acquièrent des images complètes à fréquence fixe. L'architecture introduit un mécanisme de routage par requêtes d'action : des requêtes apprenantes extraient la sémantique pertinente à la tâche depuis le raisonnement VLA, puis agrègent sélectivement les tokens événementiels via une cross-attention à portes (gated cross-attention), produisant des représentations d'action sensibles aux conditions lumineuses. Les expériences couvrent des scénarios de simulation et de déploiement réel en faible luminosité, voire en quasi-obscurité. Ce travail s'attaque à une faille structurelle des VLA actuels, Pi-0, OpenVLA, GR00T N2 ou Helix inclus, qui sont entraînés et évalués quasi-exclusivement dans des environnements d'intérieur bien éclairés et stables. Le sim-to-real gap se double ici d'un lighting-to-real gap rarement quantifié dans les benchmarks publiés. Event-VLA démontre qu'on peut greffer une modalité événementielle sans détruire les priors sémantiques RGB-langage préentraînés, ce qui est non trivial : la plupart des fusions multimodales naïves dégradent la performance en conditions normales pour gagner en robustesse marginale. Le fait que le gain soit mesuré sans régression sur éclairage standard constitue le résultat le plus solide à retenir pour les intégrateurs industriels envisageant des déploiements en entrepôt, en extérieur ou en environnement à éclairage variable. Les caméras événementielles (Prophesee, inivation, Sony IMX636) restent onéreuses et peu présentes dans les pipelines robotiques commerciaux, ce qui limite la portée immédiate du framework. Le travail s'inscrit dans un mouvement plus large d'hybridation sensorielle pour les VLA, en parallèle d'approches tactiles (GelSight) ou proprioceptives. Côté concurrent, Boston Dynamics, Figure et Agility travaillent sur la robustesse des politiques en conditions réelles mais publient peu sur la gestion de l'éclairage. Aucun acteur européen n'est mentionné dans ce papier. Les auteurs ne précisent pas de pipeline de déploiement à l'échelle ni de timeline industrielle : il s'agit d'un résultat de recherche, pas d'un produit shipé.

UEProphesee, fabricant français de caméras événementielles, est explicitement cité comme fournisseur matériel clé, ce qui positionne l'écosystème européen du capteur neuromorphique comme brique potentielle des futurs pipelines VLA industriels robustes.

IA physiqueActu
1 source
Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence
320arXiv cs.RO 

Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence

Des chercheurs ont publié fin juin 2026 sur arXiv une méthode appelée MoRE (Mode Redirection) pour corriger un défaut structurel de l'apprentissage par imitation robotique (behavior cloning) : les politiques entraînées sur des jeux de démonstrations hétérogènes capturent simultanément des comportements désirés et indésirables, y compris dangereux. L'exemple retenu par les auteurs est parlant : un robot entraîné à des transferts d'objets peut apprendre à passer un couteau lame en premier. MoRE introduit une courte étape d'«uncloning» qui distille un signal de redirection, généré par un classificateur de modes temporaire, directement dans les poids de la politique. Une loss de rétention préserve la compétence sur les modes corrects. Sur huit tâches simulées et réelles, MoRE améliore le taux de succès moyen de 44 points de pourcentage par rapport à la politique multi-modes initiale, et approche les performances du réentraînement sur données filtrées, considéré comme la référence. La méthode est compatible avec Diffusion Policy et Pi0.5, le modèle VLA (Vision-Language-Action) de Physical Intelligence. L'intérêt industriel de MoRE tient à deux absences : pas d'accès requis aux démonstrations originales, et aucun surcoût à l'inférence. Les solutions existantes butaient sur l'une ou l'autre contrainte : la curation de données impose un réentraînement complet depuis les données sources ; le steering à l'inférence (guidage externe durant l'exécution) ajoute une latence incompatible avec les cycles robotiques en temps réel. MoRE contourne les deux en modifiant les poids une seule fois, en aval de l'entraînement initial. Pour un intégrateur ou un COO industriel, c'est une piste crédible pour corriger une politique déjà déployée sans repartir de zéro. La compatibilité confirmée avec Pi0.5 est un signal fort : si la méthode tient sur un VLA large-scale, elle couvre un spectre large de déploiements réels. L'apprentissage par imitation reste l'une des méthodes d'entraînement les plus accessibles, mais sa sensibilité aux données hétérogènes est un problème structurel documenté depuis des années. Les VLA récents comme Pi0 et Pi0.5 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA) ont étendu les capacités générales des politiques sans régler ce problème de modes indésirables. MoRE s'inscrit dans un courant émergent de post-training alignment appliqué à la robotique, analogue aux techniques DPO/RLHF utilisées pour aligner les LLM après préentraînement. Les approches concurrentes incluent le filtrage par classificateur externe et la curation de données assistée par modèle. Ce travail est à ce stade un preprint de recherche, sans partenariat industriel annoncé ni timeline de commercialisation ; aucun acteur européen n'est impliqué parmi les auteurs identifiés.

💬 Le robot qui apprend à passer un couteau lame en premier, c'est pas un bug de code, c'est un bug de données, et les meilleures politiques multi-modes n'y échappent pas. MoRE fait pour la robotique ce que DPO a fait pour les LLM : corriger les modes indésirables directement dans les poids, après coup, sans données sources et sans latence ajoutée. Bon, c'est un preprint pour l'instant, mais la compatibilité confirmée avec Pi0.5 dit quelque chose de sérieux sur la portée de la méthode.

IA physiqueOpinion
1 source
Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique
321arXiv cs.RO 

Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique

Une équipe de chercheurs présente RoboTracer, un modèle de vision-langage (VLM) 3D permettant aux robots de tracer des trajectoires dans l'espace physique en raisonnant sur des mesures métriques concrètes. Publié en version 3 sur arXiv (2512.13660, décembre 2025), le système combine référencement spatial 3D et mesure de distance via un encodeur universel et un décodeur à supervision par régression, affiné d'abord en apprentissage supervisé (SFT) puis par renforcement (RFT) avec des récompenses intermédiaires sensibles aux métriques. Le dataset d'entraînement TraceSpatial regroupe 30 millions de paires question-réponse sur scènes intérieures, extérieures et de manipulation, avec des chaînes de raisonnement atteignant 9 étapes. Sur le benchmark TraceSpatial-Bench introduit par les auteurs, RoboTracer atteint 79,1 % de taux de succès moyen et dépasse Gemini-2.5-Pro de 36 points de précision. Le système a été validé sur bras UR5 (Universal Robots) et humanoïde G1 (Unitree) dans des scènes réelles encombrées. La contribution principale tient dans le raisonnement métrique, une capacité absente des VLM classiques : décrire une scène en langage naturel ne suffit pas pour estimer qu'un obstacle se trouve à 0,47 m à gauche, information nécessaire à toute trajectoire exécutable. L'approche RFT avec récompenses de processus supervise les étapes perceptuelles intermédiaires et non uniquement le résultat final, ce qui réduit concrètement l'écart entre compréhension sémantique et exécution physique (le demo-to-reality gap). Pour un intégrateur ou un COO industriel, cela signifie un robot capable d'opérer dans des espaces non cartographiés à l'avance. L'avance de 36 % sur Gemini-2.5-Pro est notable, même si ce modèle n'est pas conçu pour la robotique embarquée. RoboTracer s'inscrit dans la compétition autour des modèles VLA (Vision-Language-Action), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA, qui cherchent tous à unifier perception, raisonnement et action dans un modèle unique. Sa spécificité est l'accent sur la conscience métrique plutôt que sur le contrôle moteur fin, niche où Pi-0 reste dominant. Le choix des plateformes UR5 (bras industriel 6 axes, référence en intégration industrielle) et G1 (humanoïde Unitree, 43 degrés de liberté, environ 35 000 $) renforce la crédibilité de la généralisation multi-robots. À ce stade, il s'agit d'un résultat de recherche sans déploiement commercial annoncé ; la publication du dataset TraceSpatial et du benchmark ouvert constitue en revanche une infrastructure réutilisable directement par la communauté robotique.

UELe dataset TraceSpatial et le benchmark ouvert sont librement accessibles aux laboratoires européens de robotique, mais aucun acteur ou déploiement européen n'est impliqué dans cette contribution.

IA physiqueOpinion
1 source
SimFoundry : génération modulaire et automatisée de scènes pour l'apprentissage et l'évaluation de politiques
322arXiv cs.RO 

SimFoundry : génération modulaire et automatisée de scènes pour l'apprentissage et l'évaluation de politiques

Des chercheurs du laboratoire GEAR de NVIDIA ont publié SimFoundry sur arXiv (identifiant 2606.28276), un pipeline modulaire et automatisé permettant de reconstruire des scènes de simulation directement depuis une vidéo du monde réel, sans annotation manuelle. Le système génère des jumeaux numériques sim-ready, puis en dérive automatiquement des "cousins numériques": des variantes de la scène originale qui préservent les affordances manipulatoires tout en modifiant objets, arrangements ou tâches. Testé sur sept tâches de manipulation (multi-étapes, objets articulés, bimane) et cinq architectures de policies distinctes, SimFoundry atteint une corrélation de Pearson de 0,911 entre évaluation en simulation et performance réelle, avec un mean maximum ranking violation de 0,018. En transfert zéro-shot vers le monde réel, les cousins d'objets apportent +17% de taux de succès, les cousins de scènes +21%, et les cousins de tâches +40%. Ces résultats s'attaquent directement au sim-to-real gap, l'écart structurel qui rend les benchmarks de simulation peu fiables pour prédire les performances physiques. Avec une corrélation de 0,911, les équipes R&D peuvent comparer des architectures de policies en simulation sans mobiliser de temps robot, ce qui réduit significativement le coût d'évaluation. Le concept de cousins numériques va plus loin que l'augmentation de données classique: en préservant les affordances, les variantes restent exploitables pour l'apprentissage sans dériver vers des distributions hors domaine. Pour un intégrateur de cellules robotiques ou un décideur industriel, le gain concret est une accélération du cycle développement-évaluation, à condition que la reconstruction vidéo reste robuste hors des environnements contrôlés présentés dans le papier. SimFoundry s'inscrit dans la stratégie robotique large de NVIDIA, qui développe en parallèle la plateforme Isaac Sim et le modèle de fondation humanoïde GR00T N2. Le laboratoire GEAR, dédié à la généralisation des policies d'agents incarnés, positionne cette approche sim-centric face aux alternatives data-centric: Physical Intelligence (Pi-0, issu des travaux de Sergey Levine) mise sur des volumes massifs de démonstrations réelles, tandis que Google DeepMind avance avec ses propres pipelines de simulation. Dans l'écosystème des simulateurs robotiques (Sapien, RoboSuite, Genesis), SimFoundry se distingue par son entrée vidéo sans annotation. Le papier, disponible en prépublication sur arXiv, ne précise pas de calendrier de mise à disposition du code ni d'intégration dans un produit commercial.

UELes laboratoires de robotique européens (CEA-List, INRIA) pourraient bénéficier de cette infrastructure de simulation pour évaluer leurs policies sans mobiliser de temps robot, mais aucun acteur FR/EU n'est impliqué et le code n'est pas encore disponible.

RecherchePaper
1 source
SceneBot : suivi corps entier d'humanoïde généraliste guidé par contacts avec l'environnement
323arXiv cs.RO 

SceneBot : suivi corps entier d'humanoïde généraliste guidé par contacts avec l'environnement

SceneBot est un cadre de contrôle pour robots humanoïdes déposé le 29 juin 2026 sur arXiv (référence 2606.27581), dont le code et les données seront entièrement publiés en open source. Le système entraîne une politique unique de reinforcement learning sur 7,5 heures de données de mouvement annotées en contacts, reconstituées depuis la motion capture humaine. SceneBot conditionne cette politique à la fois sur des mouvements de référence et sur des étiquettes de contact par segment corporel (per-link contact labels), définissant explicitement les interactions physiques attendues avec l'environnement. Le résultat est un agent humanoïde capable d'enchaîner locomotion en espace libre, franchissement de terrain irrégulier et manipulation corps entier, illustré par une tâche de référence : porter une boîte en montant un escalier. Ce que SceneBot résout est un verrou technique bien documenté : les politiques RL de locomotion humanoïde fonctionnent bien en espace libre mais échouent dès qu'un contact physique avec un objet ou une surface irrégulière est requis, car le tracking cinématique pur ne peut pas résoudre les ambiguïtés physiques de ces situations. En introduisant le "contact conditioning" comme interface de contrôle, les chercheurs montrent que 7,5 heures de données suffisent à généraliser à des mouvements et environnements non vus à l'entraînement. Pour les intégrateurs B2B et les décideurs industriels, cela suggère qu'une politique unifiée peut couvrir navigation et manipulation sans modules spécialisés distincts, et constitue une réponse partielle au "demo-to-reality gap" qui fragilise la crédibilité des annonces humanoïdes depuis plusieurs années. La contribution technique centrale est une méthode appelée "hindsight scene reconstruction" : à partir de mouvements humains retargeted, les auteurs reconstruisent après coup les graphes d'interaction avec la scène pour inférer les contacts, évitant l'annotation manuelle qui freine habituellement la constitution de tels datasets. Ce positionnement académique a des implications directes pour les développeurs de plateformes humanoïdes confrontés au même obstacle, notamment Figure AI, Agility Robotics, Unitree et Apptronik. Aucun déploiement industriel n'est annoncé à ce stade : SceneBot est une publication de recherche dont les résultats n'ont pas encore été validés sur hardware en conditions réelles, et les métriques présentées s'appuient sur des simulations et des démonstrations sélectionnées.

HumanoïdesPaper
1 source
Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?
324arXiv cs.RO 

Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?

Une équipe de chercheurs a publié fin juin 2026 une étude (arXiv:2606.27755) examinant la redondance architecturale des modèles Vision-Language-Action (VLA), ces modèles de contrôle robotique qui combinent un backbone de langage préentraîné avec des modules vision et action. Le protocole, baptisé Drop-Then-Recovery (DTR), consiste à supprimer des blocs transformer sélectionnés d'un VLA préentraîné, puis à le fine-tuner pour mesurer si la capacité retirée était réellement nécessaire au contrôle en boucle fermée. Pour prioriser quels blocs supprimer, les auteurs introduisent GateProbe, une métrique de sensibilité en un seul passage (one-shot) qui classe les blocs selon leur contribution à la perte d'action en aval. Les expériences couvrent plusieurs architectures VLA, des benchmarks de manipulation standard (dont LIBERO) et des scénarios industriels sur robot réel. Résultat chiffré marquant : supprimer la moitié des blocs LLM d'OpenVLA-OFT fait passer le score LIBERO de 95,0 % à 98,3 %, et ne conserver que deux blocs de langage suffit à retrouver les performances de référence. Ce résultat remet en question un postulat implicite du domaine : que la profondeur des backbones de langage hérités des grands modèles (LLM) est nécessaire à la compréhension d'instructions robotiques. Les instructions typiques en manipulation sont courtes et peu compositionnelles ; le surcapacité linguistique ne sert pas le contrôle et peut même nuire via du bruit de gradient ou une compétition de capacité. En revanche, les voies vision et action se révèlent nettement moins tolérantes à la suppression, ce qui oriente clairement les priorités d'allocation pour les futures architectures VLA. Pour les intégrateurs industriels, cela ouvre la voie à des modèles plus légers, moins coûteux à inférer et à fine-tuner, sans dégradation de performance sur les tâches réelles. Les VLA ont émergé comme paradigme dominant du contrôle robotique généraliste depuis les travaux fondateurs sur RT-2 (Google DeepMind, 2023) et OpenVLA (Berkeley, 2024), qui ont montré qu'un backbone VLM préentraîné pouvait être réutilisé pour la manipulation. OpenVLA-OFT, utilisé comme modèle de référence dans cette étude, est une variante fine-tunable publiée par l'Université de Stanford. Parmi les concurrents directs sur ce terrain architectural : Physical Intelligence avec pi0 (basé sur un flow matching), qui a déjà opté pour une architecture plus légère côté langage, et les travaux de pruning de transformers en NLP (SparseGPT, Sheared LLaMA) dont DTR s'inspire méthodologiquement. Le code est disponible sur GitHub (s1ghhh/VLADrop). Les prochaines étapes logiques seraient de tester DTR sur des modèles plus récents (GR00T N2 de NVIDIA, Helix de Figure) et sur des tâches à instructions longues ou hiérarchiques, où la profondeur linguistique pourrait enfin devenir un facteur limitant.

RechercheOpinion
1 source
FailSafe : raisonnement et récupération face aux défaillances dans les modèles VLA
325arXiv cs.RO 

FailSafe : raisonnement et récupération face aux défaillances dans les modèles VLA

Une équipe de chercheurs a publié FailSafe, un système de génération automatique de scénarios d'échec et d'actions de récupération pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. Présenté dans un preprint arXiv (v3, 2026), le système s'appuie sur LLaVA-OneVision-7B, un modèle de 7 milliards de paramètres affiné pour détecter des pannes en cours de tâche et produire des actions correctives exécutables, donnant naissance à FailSafe-VLM. Les évaluations conduites dans le simulateur ManiSkill montrent que cette couche de récupération améliore en moyenne jusqu'à 22,6% les performances de trois architectures VLA de référence : Pi-0-FAST (Physical Intelligence), OpenVLA et OpenVLA-OFT. Le système se généralise à différentes configurations spatiales, angles de caméra, objets manipulés et morphologies de bras robotiques. L'enjeu est structurel : les datasets de manipulation robotique existants, simulés ou réels, se limitent presque exclusivement à des trajectoires correctes. Un robot entraîné sur ces données ne dispose d'aucun mécanisme pour se remettre d'une prise ratée, d'un objet déplacé ou d'une perturbation imprévue. FailSafe comble ce vide en générant automatiquement, à partir de tâches existantes et d'un planificateur de mouvement, des paires (échec, action de récupération) annotées et directement exploitables en fine-tuning. Pour les équipes R&D et les intégrateurs, c'est une brique scalable sans collecte de données humaines supplémentaire. Le gain de 22,6% reste toutefois un delta relatif sur plusieurs tâches en simulation, et les auteurs ne rapportent aucun test en conditions physiques réelles : le sim-to-real gap pour les scénarios d'échec eux-mêmes reste une question ouverte. Les VLA représentent la convergence des grands modèles de vision-langage avec la commande motrice basse-fréquence, un axe de recherche en forte croissance depuis 2023. Pi-0 de Physical Intelligence, OpenVLA développé par Berkeley et Stanford, et leurs variantes constituent aujourd'hui le benchmark dominant dans ce domaine. FailSafe se positionne non comme un nouveau modèle de base, mais comme une surcouche de robustesse greffable sur ces architectures existantes, une approche pragmatique qui évite de repartir de zéro. Les quelques datasets existants traitant de la détection d'échec se limitaient à des explications textuelles difficilement exploitables directement par un VLA, ce que FailSafe résout en produisant des actions exécutables. La prochaine étape logique sera une validation hors simulateur, notamment sur des manipulateurs industriels réels, pour confirmer si les scénarios synthétiques d'échec transfèrent effectivement au monde physique.

💬 Entraîner les VLA uniquement sur des trajectoires réussies crée un angle mort structurel : le modèle n'a jamais appris à se planter ni à se rattraper. FailSafe résout ça sans collecte humaine supplémentaire, et c'est là la vraie valeur ajoutée. Le +22,6% en simulateur, c'est encourageant, mais le sim-to-real sur des scénarios d'échec reste entier.

IA physiqueOpinion
1 source
Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs
326arXiv cs.RO 

Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs

Des chercheurs ont publié le 29 juin 2026 sur arXiv (2606.28237) un pipeline nommé Uni-Mo, capable de générer automatiquement des mouvements expressifs pour robots quadrupèdes sans recourir à des animaux réels comme source de données. Le système enchaîne trois étapes : un LLM produit des descriptions textuelles de mouvements, un modèle de diffusion vidéo synthétise les comportements correspondants sous forme de séquences visuelles, puis ces vidéos sont converties en trajectoires 3D servant à entraîner des politiques de suivi déployées sur un Unitree Go2. Pour stabiliser les générations vidéo naturellement instables sur la durée, les auteurs introduisent une "Identity Consistency Loss" qui impose une cohérence d'apparence du robot entre les frames. Le jeu de données résultant, Quad-Imaginarium (disponible en open source sur GitHub), regroupe 7 488 séquences de mouvements annotées en langage naturel, couvrant 18,5 heures de comportements acrobatiques et expressifs. Sur 392 mouvements tirés aléatoirement et testés physiquement sur un Go2 réel, le taux de succès de déploiement atteint 96,7 %, contre 97,6 % en simulation sur l'ensemble du dataset. Ce résultat est notable parce qu'il contourne une hypothèse tacite qui plombait les approches précédentes : faire passer les données de mouvement par un corps animal réel, ce qui rendait la collecte dépendante d'animaux coopératifs, la reconstruction fragile selon les espèces, et le retargeting mal posé face aux incompatibilités morphologiques. En traitant la rareté des données comme un problème de génération plutôt que de capture, Uni-Mo démontre qu'un pipeline entièrement synthétique peut atteindre un taux sim-to-real supérieur à 96 %, ce qui valide empiriquement l'hypothèse que la diffusion vidéo peut servir de simulateur comportemental crédible pour la robotique quadrupède. Pour les intégrateurs et décideurs B2B, cela signifie potentiellement une voie vers des robots compagnons ou d'inspection aux comportements riches, sans infrastructure de motion capture animale. Le champ du mouvement quadrupède expressif est dominé par des approches d'imitation sur données réelles (Boston Dynamics, ANYbotics, Unitree lui-même) ou de retargeting depuis des séquences canines capturées en laboratoire. Uni-Mo s'inscrit dans une tendance émergente qui mobilise les générateurs vidéo comme oracles de physique approximative, après des travaux similaires dans le domaine humanoïde (notamment autour de Pi-0 de Physical Intelligence et des pipelines VLA). L'Unitree Go2, robot grand public à moins de 3 000 dollars, est ici utilisé comme plateforme de validation, ce qui renforce la reproductibilité de l'approche. Les prochaines étapes probables incluent l'extension à des morphologies différentes et l'intégration de retours proprioceptifs pour fermer la boucle en temps réel.

💬 Le gros truc ici, c'est qu'ils ont retourné le problème : au lieu de capturer des mouvements sur de vrais animaux, ils les génèrent entièrement par diffusion vidéo. 96,7% de succès sur robot physique, c'est pas de la simulation flatteuse, ça valide empiriquement qu'un modèle vidéo peut servir d'oracle comportemental crédible pour la robotique quadrupède. Si tu vois ça se confirmer sur d'autres morphologies, la capture motion animale commence sérieusement à sentir la dette technique.

IA physiqueOpinion
1 source
LocalNav : distillation de VLMs frontière et RL incarné pour la navigation embarquée vers un objet cible
327arXiv cs.RO 

LocalNav : distillation de VLMs frontière et RL incarné pour la navigation embarquée vers un objet cible

Une équipe de chercheurs a publié LocalNav (arXiv 2506.27871), une méthode de distillation permettant d'exécuter des modèles de vision-langage (VLM) directement sur robots embarqués, sans recourir au cloud. Le pipeline de référence s'appuie sur Claude Sonnet 4.6 couplé à un graphe de scène et atteint un taux de succès (SR) de 39,7% sur le benchmark HM3D OVON, qui évalue la navigation vers des objets désignés en langage naturel dans des environnements intérieurs simulés (tâche ObjectNav). Qwen3.5-4B, un modèle de 4 milliards de paramètres, est ensuite fine-tuné sur seulement 500 traces de raisonnement issues de ce pipeline frontier : il obtient un SR de 34,5%, réduisant significativement l'écart avec le modèle cloud de référence. Pour le déploiement physique sur Jetson Orin (NVIDIA), les auteurs introduisent E-RLVR avec régularisation Token Generation (TG), qui comprime les séquences de sortie. Combinée à la quantification, cette optimisation réduit la latence globale d'inférence de 82,8% (71,8% sur la latence brute, 72,1% sur la génération de tokens), sans perte de performance jugée significative par les auteurs. L'enjeu industriel est direct : la dépendance au cloud représente un frein opérationnel réel pour les robots mobiles déployés en entrepôt, en usine ou en extérieur, où la connectivité est intermittente et où chaque dizaine de millisecondes pèse sur les décisions de navigation. Le fait que 500 traces de distillation suffisent à approcher les performances d'un grand modèle frontier valide une hypothèse clé du domaine : la supervision synthétique depuis des LLMs propriétaires peut compenser l'absence de larges jeux de données annotés manuellement. La réduction de 82,8% de latence franchit un seuil opérationnel critique pour un déploiement synchrone avec le mouvement physique du robot, ce que les architectures cloud ne peuvent pas garantir en conditions réelles. Ce travail s'inscrit dans une tendance de compression des VLMs pour la robotique edge, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui cherchent tous à réduire leur empreinte computationnelle pour le déploiement à grande échelle. La distillation depuis Claude vers Qwen positionne ce pipeline à l'intersection de deux écosystèmes : modèles frontier propriétaires comme source de supervision, modèles open-weights comme cible d'optimisation. À noter que l'ensemble des résultats présentés reste pour l'instant simulé sur HM3D ; les prochaines étapes naturelles incluent une validation sur déploiement physique réel et un passage à l'échelle des traces de distillation au-delà des 500 exemples actuels, pour cartographier la courbe d'amélioration.

💬 500 traces de distillation. C'est le chiffre qui devrait retenir l'attention : en partant des raisonnements de Claude, un modèle de 4 milliards de paramètres tourne sur Jetson Orin et atteint 87% des performances cloud. Ce pipeline frontier→edge valide que la supervision synthétique depuis des LLMs propriétaires peut remplacer des milliers d'annotations humaines, bon, sur des benchmarks simulés pour l'instant, mais la réduction de latence de 82% donne enfin un argument solide aux équipes qui veulent déployer ça en entrepôt sans réseau.

IA physiqueOpinion
1 source
OctoSense : apprentissage auto-supervisé pour la perception multimodale des robots
328arXiv cs.RO 

OctoSense : apprentissage auto-supervisé pour la perception multimodale des robots

Une équipe de recherche a publié sur arXiv (arXiv:2606.17317) OctoSense, une plateforme matérielle open-source de perception multimodale accompagnée d'un dataset de 59 heures de données embarquées synchronisées. Le rig intègre une paire de caméras RGB stéréo, une caméra à événements, un LiDAR, une caméra thermique, une centrale inertielle (IMU), un GPS RTK et des données de proprioception issues d'un bus CAN automobile et d'un robot quadrupède. Les données ont été collectées dans des environnements variés, à différentes heures du jour et de la nuit, y compris en conditions de dégradation sensorielle sévère. Sur ce dataset, les auteurs démontrent une architecture de foundation model baptisée "late-fusion masked autoencoder" : des tokeniseurs spécifiques par modalité gèrent les différences de résolution spatiotemporelle, de fréquence et de latence entre capteurs, puis les tokens sont mis en cache à l'inférence pour traiter les nouvelles mesures au fil de leur arrivée. Le temps de calcul de représentation atteint 6,68 ms sur GPU NVIDIA RTX 5090 et 112 ms sur module embarqué Jetson Orin NX. Ce résultat est notable pour les intégrateurs robotiques car il démontre qu'un modèle auto-supervisé entraîné sur des données réelles hétérogènes surpasse les foundation models vision-only (entraînés sur images seules) sur quatre tâches critiques : estimation du flot optique, reconstruction de profondeur, segmentation sémantique et estimation de l'ego-motion (translation, rotation, angle de braquage). L'absence de labels supervisés dans le pipeline d'entraînement réduit significativement le coût de constitution des datasets pour les équipes qui déploient sur des plateformes mobiles. La robustesse nocturne et en conditions dégradées adresse directement un point de friction récurrent dans les déploiements AMR en entrepôts logistiques et en robotique outdoor. OctoSense s'inscrit dans la tendance des foundation models perceptifs pour la robotique, un espace très actif depuis les travaux de type CLIP/DINOv2 et plus récemment les VLA (Vision-Language-Action models) poussés par Physical Intelligence (Pi-0) et NVIDIA (GR00T). Contrairement à ces approches centrées sur la manipulation ou la navigation en langage naturel, OctoSense cible la représentation sensorielle bas-niveau sur plateforme embarquée contrainte. Le projet est entièrement open-source (code, dataset et vidéos supplémentaires disponibles), ce qui le distingue des stacks propriétaires des acteurs commerciaux. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade ; il s'agit d'un preprint de recherche sans validation externe. La prochaine étape naturelle serait une évaluation sur des benchmarks robotiques standardisés (OpenX-Embodiment, CARLA) pour confirmer la généralisation hors-distribution.

RecherchePaper
1 source
Optimisation non linéaire à grande échelle : de nombreux problèmes, un seul GPU
329arXiv cs.RO 

Optimisation non linéaire à grande échelle : de nombreux problèmes, un seul GPU

Des chercheurs ont publié fin juin 2026 sur arXiv jaxipm, présenté comme le premier solveur de programmes non linéaires (NLP) capable de traiter des lots de problèmes simultanément sur GPU. Construit sur la base algorithmique d'IPOPT, le solveur de référence dans les pipelines de planification en robotique, et implémenté en JAX, jaxipm atteint jusqu'à 32,85 fois le débit d'IPOPT classique sur des benchmarks de contrôle prédictif non linéaire (NMPC) pour drones quadrotors. Les scénarios testés couvrent le suivi de trajectoire en présence d'obstacles, la navigation multi-drones sans collision, et l'évitement en environnement encombré. Le code est disponible en open source sur GitHub (johnviljoen/jaxipm). L'enjeu est structurel : les solveurs NLP matures comme IPOPT offrent des garanties de satisfaction de contraintes et d'optimalité locale introuvables dans les méthodes par apprentissage par renforcement (RL) ou MPPI, mais ils sont mono-thread et CPU-bound, incompatibles avec les pipelines GPU-batched qui dominent la recherche robotique moderne. Cette incompatibilité a creusé un fossé entre deux familles d'approches : les solveurs à gradients, précis mais séquentiels, et les méthodes d'échantillonnage, parallélisables mais sans garanties formelles. jaxipm comble ce fossé via deux innovations : la "heterogeneous iteration fusion", qui supprime le branchement conditionnel dans la boucle interne d'IPOPT, et l'"iteration level batching", qui minimise les temps morts du GPU lors du traitement simultané de N instances indépendantes. Pour les équipes de motion planning souhaitant coupler planification contrainte et apprentissage dans une boucle unifiée, ce type de solveur change le régime de ce qui est calculable en temps quasi-réel. IPOPT, développé à partir des années 2000 à Argonne National Laboratory, est le standard de facto en robotique pour la planification de trajectoires, la cinématique inverse, et la gestion de contacts. Son intégration dans des frameworks modernes comme MuJoCo MPC ou les pipelines Pinocchio reste cependant bridée par sa nature séquentielle. Face à l'essor des simulateurs GPU-batched comme IsaacLab (NVIDIA) ou MJX (Google DeepMind), capables de générer des millions de rollouts par seconde, l'absence d'un solveur NLP au même format représentait un goulot d'étranglement pour les approches hybrides. jaxipm est pour l'instant validé uniquement sur des benchmarks drones quadrotors, ce qui appelle une évaluation sur configurations manipulateurs ou robots humanoïdes avant de pouvoir généraliser les gains annoncés à l'ensemble du spectre robotique.

RecherchePaper
1 source
Un corps, deux esprits : approche à autonomie variable pour une main robotique à contrôle partagé
330arXiv cs.RO 

Un corps, deux esprits : approche à autonomie variable pour une main robotique à contrôle partagé

Des chercheurs ont publié le 25 juin 2026 sur arXiv (2606.25575) une étude portant sur une main robotique portable à autonomie variable, conçue selon un paradigme qu'ils appellent "co-embodiment" : humain et robot partagent un seul corps physique et alternent les niveaux de contrôle selon la phase de la tâche. Le système intègre une politique visuomotrice de diffusion apprise par démonstration (learning-from-demonstration), qui prend en charge la saisie autonome d'objets connus dès que l'utilisateur positionne sa main à proximité. Une fois l'objet saisi, un signal indique à l'utilisateur de reprendre la main ; il commande alors l'outil (perceuse, spray, thermomètre infrarouge, briquet ou cuillère à glace) via des gestes de la tête sans contact physique. L'utilisateur conserve à tout moment un droit de veto par un geste de relâchement. Une étude avec 44 participants effectuant cinq tâches bimanuelles a donné des résultats mesurés : réduction du temps d'exécution de 23,3 % entre le premier et le dernier essai (p inférieur à 0,001, Cohen d = 0,94), taux de succès atteignant 93,6 % pour la meilleure variante de politique, et scores d'acceptabilité de 5,70/7 pour l'impression globale et 5,52/7 pour la volonté d'usage quotidien. Ce travail répond à un problème structurel des systèmes d'assistance robotique : les solutions entièrement autonomes retirent à l'utilisateur son agentivité, tandis que les systèmes entièrement pilotés à la main imposent une charge cognitive permanente. L'approche proposée tranche différemment des architectures de "shared autonomy" classiques, où le contrôle est continuellement négocié entre humain et robot dans des corps séparés : ici, le passage entre autonomie totale du robot et contrôle total de l'humain est discret et lié à la phase de la tâche, ce qui simplifie l'interface mentale pour l'utilisateur. La rapidité d'adaptation des participants (amélioration significative dès les premières répétitions) et les scores d'acceptabilité élevés plaident pour une viabilité clinique réelle, notamment dans des contextes de rééducation ou d'assistance aux personnes avec déficiences motrices unilatérales. L'intégration d'une politique de diffusion visuomotrice performante dans un dispositif portable constitue également un signal fort sur la maturité des politiques d'imitation pour des applications embarquées hors lab. Sur le plan académique, ce travail s'inscrit dans un courant actif de recherche sur les prothèses et orthèses à contrôle partagé, aux côtés de travaux comme ceux des équipes Imperial College London sur les mains myoélectriques intelligentes ou des approches "supernumerary robotic limbs" du MIT. La différence revendiquée ici est l'alternance franche d'autonomie plutôt que la fusion continue des commandes. Les concurrents industriels dans l'espace des exosquelettes de main (Bioservo, Hocoma, ou côté français Wandercraft sur les membres inférieurs) n'adressent pas encore cette logique de délégation contextuelle. L'étude reste pour l'instant un prototype de laboratoire validé en conditions contrôlées ; les prochaines étapes naturelles seraient des essais sur des populations cibles (AVC, lésions médullaires partielles) et une miniaturisation du système de détection pour réduire l'encombrement du dispositif porté.

UECe travail fournit une référence méthodologique directement applicable aux acteurs européens de l'exosquelette (Bioservo en Suède, Wandercraft en France sur les membres inférieurs) qui n'ont pas encore intégré cette logique de délégation contextuelle dans leurs dispositifs médicaux.

ExosquelettesPaper
1 source
DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles
331arXiv cs.RO 

DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles

Des chercheurs du laboratoire AUBVRL ont publié sur arXiv le 25 juin 2026 DSP-SLAM++, une extension du système DSP-SLAM conçue pour cartographier simultanément plusieurs classes d'objets en temps réel avec une fidélité géométrique élevée. Le système repose sur un pipeline de cartographie asynchrone, où le thread de mapping tourne indépendamment du thread de suivi, ce qui permet de traiter des séquences multi-classes à 25 Hz sans bloquer l'ensemble du pipeline. Couplé à une suite sensorielle fisheye monoculaire et LiDAR, DSP-SLAM++ réduit la latence maximale de traitement des objets jusqu'à 70 % par rapport à la baseline DSP-SLAM d'origine, tout en produisant des reconstructions 3D géométriquement complètes pour chaque objet détecté. Le code est disponible en open source sur GitHub (AUBVRL/DSP-SLAMpp). Ce résultat compte parce que le trilemme classique du SLAM orienté objets, choisir entre temps réel, support multi-classes et fidélité des modèles 3D, restait non résolu dans les systèmes existants. Un gain de 70 % sur la latence maximale (et non sur une latence moyenne, détail important) signifie que les cas extrêmes, ceux qui gelaient le thread de cartographie sur des scènes denses, sont maîtrisés. Pour un intégrateur qui équipe un véhicule autonome ou un bras de manipulation, c'est la différence entre un système testé en labo et un système opérationnel sur plateforme embarquée réelle. L'adaptation fisheye-LiDAR est également stratégique : ce binôme est devenu la configuration standard en robotique terrain et en conduite autonome niveau 2-3, là où les caméras rectilignes coûtent en champ de vue. DSP-SLAM, le prédécesseur direct, était lui-même une extension de SuperPoint SLAM publiée autour de 2021-2022 et avait démontré la viabilité des représentations implicites par réseaux de formes (DeepSDF-style) pour le SLAM objet, mais butait sur les performances en environnements multi-classes et multi-capteurs. Dans l'espace concurrent, on trouve EAO-SLAM, OrcVIO ou encore les approches NeRF-SLAM (iMAP, NICE-SLAM), qui privilégient la reconstruction de scènes complètes au détriment de la sémantique par objet. DSP-SLAM++ se positionne donc sur le créneau précis de la granularité objet à haute fidélité en temps réel, créneau directement utile pour la manipulation robotique (pick-and-place avec modèle 3D précis) et la détection d'obstacles typés en conduite autonome. Les prochaines étapes logiques incluent l'extension à des classes ouvertes via des fondations visuelles (SAM, DINO) et les tests sur plateformes embarquées contraintes comme Jetson Orin.

UELe code open source disponible sur GitHub est directement exploitable par les intégrateurs européens en robotique terrain et conduite autonome, sans dépendance commerciale envers un fournisseur tiers.

RecherchePaper
1 source
Commerge : fusion de cartes LiDAR économe, robuste et rapide pour la coordination multi-robots sous contraintes
332arXiv cs.RO 

Commerge : fusion de cartes LiDAR économe, robuste et rapide pour la coordination multi-robots sous contraintes

Une équipe du SPARO Lab publie Commerge (arXiv:2606.25386), un framework de fusion de cartes LiDAR conçu pour des essaims de robots opérant dans des environnements à bande passante limitée, capable de réduire le volume de données échangées entre robots jusqu'à 5 000 fois sans dégradation notable de la précision d'alignement. Sur le jeu de données HeLiPR, le volume transmis passe de 7 000 Mo à 1,3 Mo, soit une réduction de 99,98%. L'architecture repose sur une optimisation cascadée en trois étapes appliquée à un graphe d'échange, où les sommets représentent les keyframes de chaque robot et les arêtes les boucles inter-robots candidates. Ce pipeline identifie le sous-ensemble minimal de scans LiDAR, séquentiellement chevauchants et géométriquement pertinents, qui préserve la cohérence globale de la carte tout en minimisant le coût de transmission. L'évaluation porte sur neuf jeux de données (cinq publics, quatre propriétaires) couvrant des environnements de grotte, d'analogues planétaires, intérieurs et de campus extérieurs, sur des plateformes allant de l'embarqué au poste de travail. Le goulot d'étranglement communicationnel est l'obstacle central au déploiement de flottes de robots mobiles en environnement dégradé : sous-sol minier, tunnels, exploration spatiale ou entrepôts à couverture WiFi partielle. Les approches existantes imposaient un choix binaire entre transmettre l'intégralité des scans (échelle GB, infaisable sur lien bas débit) et un sous-échantillonnage naïf qui détériore la précision d'alignement. Commerge invalide ce compromis en montrant qu'un sous-ensemble sélectionné par théorie des graphes suffit à maintenir la qualité de fusion. Pour un intégrateur ou un COO industriel, cela ouvre la voie à des flottes d'AMR LiDAR capables de construire une carte globale cohérente sur des réseaux contraints (4G dégradé, radio maillée, liaison satellitaire) sans surcharge d'infrastructure. La fusion de cartes LiDAR multi-robots s'inscrit dans le champ du SLAM collaboratif, domaine actif depuis une décennie mais historiquement conditionné à des hypothèses de connectivité peu réalistes, que des travaux comme COVINS, DiSCo-SLAM et Swarm-SLAM ont progressivement atténuées sans résoudre la contrainte de bande passante. Commerge comble directement cet angle mort, avec du code et des matériaux disponibles sur sparolab.github.io/research/commerge. Les prochaines étapes naturelles incluront la validation dans des déploiements réels souterrains ou extraterrestres, contextes où Boston Dynamics, Clearpath Robotics et le programme DARPA SubT ont identifié la communication comme verrou systémique.

RecherchePaper
1 source
G³VLA : biais inductif géométrique pour les modèles vision-langage-action (VLA)
333arXiv cs.RO 

G³VLA : biais inductif géométrique pour les modèles vision-langage-action (VLA)

Un preprint arXiv déposé fin juin 2026 présente G³VLA, un module géométrique plug-in pour les modèles VLA (Vision-Language-Action), conçu pour corriger un angle mort structurel de ces architectures : leurs tokens visuels sont encodés en coordonnées image 2D, sans exploiter la géométrie calibrée des caméras du robot. Dans les configurations multi-caméras, où intrinsèques et extrinsèques sont pourtant parfaitement connus, les vues sont traitées comme des images indépendantes, effaçant toute information de profondeur et de position relative. G³VLA injecte cette géométrie calibrée via trois composantes : des ray embeddings conditionnés sur les paramètres intrinsèques, un encodage positionnel projectif baptisé PRoPE, et une fusion cross-view bidirectionnelle. Aucun capteur de profondeur n'est requis : la supervision géométrique s'appuie soit sur des point maps ground-truth, soit sur des prédictions du modèle π³X filtrées par seuil de confiance. Le module a été instancié sur π₀ (Physical Intelligence) puis validé sur π₀.₅ et GR00T 1.5 de NVIDIA, avec des évaluations sur les suites LIBERO, RoboCasa24, RoboTwin2.0 et sur robot réel. Les gains obtenus sont réguliers sur l'ensemble des benchmarks, les améliorations les plus prononcées concernant les tâches dites spatialement sensibles : manipulation d'objets proches, désambiguïsation de positions relatives, réponse à des instructions impliquant des relations 3D précises. Pour un intégrateur ou un décideur industriel, le point central est la compatibilité : G³VLA s'ajoute sans modifier l'espace d'action ni l'objectif d'imitation du VLA hôte, le rendant portable vers des systèmes existants sans réentraînement complet. L'analyse comparative sur GR00T 1.5 livre un enseignement architectural : le transfert de géométrie est maximal quand les tokens géométriques ont accès direct au pathway de génération d'actions, et non positionnés en périphérie du flux. G³VLA s'inscrit dans la recherche post-RT-2 autour des VLA généralistes, portée par Physical Intelligence avec π₀ (2024) et NVIDIA avec la famille GR00T (N1, N2, 1.5). Ces modèles ont prouvé une généralisation hors distribution convaincante, mais leur faiblesse reconnue reste la précision spatiale fine, là où les réseaux end-to-end apprennent des heuristiques visuelles sans véritable compréhension 3D. Des travaux concurrents comme SpatialVLA (2025) explorent des voies similaires d'injection de géométrie. Du côté européen, des acteurs spécialisés dans la manipulation de précision, comme Enchanted Tools ou Wandercraft, pourraient tirer parti de ce type de module si intégré dans des VLAs open-source. Le code source n'est pas encore disponible, mais une page projet en ligne laisse anticiper une publication prochaine.

UEDes équipes françaises spécialisées en manipulation de précision, comme Enchanted Tools ou Wandercraft, pourraient intégrer ce module géométrique dans leurs pipelines VLA open-source pour améliorer la précision spatiale fine de leurs robots, dès la publication du code source.

💬 Les VLA passent à côté d'informations géométriques que les caméras calibrées donnent pourtant gratuitement, et ça se paie en précision spatiale. G³VLA corrige ça en plug-in, sans modifier l'espace d'action ni forcer un réentraînement, ce qui le rend applicable à des systèmes déjà en production. Reste à voir si Enchanted Tools ou Wandercraft suivent dès que le code sort.

IA physiqueOpinion
1 source
TEXEDO : mise à l'échelle à l'inférence pour la génération de mouvements humanoïdes guidée par le langage et le contrôleur
334arXiv cs.RO 

TEXEDO : mise à l'échelle à l'inférence pour la génération de mouvements humanoïdes guidée par le langage et le contrôleur

Des chercheurs ont publié TEXEDO, un cadre d'inférence pour améliorer la génération de mouvements de robots humanoïdes guidée par texte, sans réentraîner le modèle sous-jacent. Présenté sur arXiv (2606.22998) et validé en déploiement réel sur un Unitree G1, le système génère plusieurs mouvements candidats à partir d'un prompt textuel, puis sélectionne le meilleur via un modèle de récompense à deux composantes : un vérificateur de faisabilité dynamique, distillé depuis des simulations de contrôleurs whole-body pour prédire l'exécutabilité physique, et un vérificateur d'alignement sémantique dans un espace d'embedding partagé texte-mouvement. La faisabilité physique est imposée comme contrainte dure ; l'alignement sémantique sert d'objectif de sélection parmi les candidats valides. Les résultats montrent des améliorations en fidélité de tracking et en cohérence textuelle, en simulation comme sur le G1 en conditions réelles. Ce travail adresse une limite structurelle des générateurs actuels : entraînés sur des données de mouvements humains re-ciblés vers des morphologies robotiques, ils ignorent les contraintes propres aux contrôleurs physiques réels, équilibre, dynamiques de contact, limites d'actuation, modes de défaillance spécifiques à chaque plateforme. Des mouvements "sémantiquement plausibles" s'avèrent ainsi souvent inexécutables sur le matériel, un écart bien documenté dans la communauté robotique. TEXEDO applique à la génération de mouvements le principe de "test-time compute scaling" popularisé par les LLMs de type o1 ou o3 : allouer du calcul supplémentaire à l'inférence plutôt qu'au réentraînement. Pour un intégrateur ou un ingénieur robotique, cela signifie qu'un générateur existant peut être amélioré en déploiement sans pipeline de fine-tuning coûteux, ce qui est un argument pratique solide. TEXEDO s'inscrit dans la compétition autour de la programmation des robots par langage naturel, face à des approches VLA (Vision-Language-Action) end-to-end comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La distinction clé est que TEXEDO cible exclusivement la couche de génération de mouvements, en amont du contrôleur, sans chercher à unifier perception, langage et action dans un seul modèle. Le Unitree G1, humanoïde commercial répandu dans les labos de recherche autour de 16 000 dollars, sert ici de banc de test réel, ce qui renforce la portée des résultats par rapport à des évaluations purement simulées. La suite logique serait d'étendre le cadre à d'autres plateformes humanoïdes et d'autres familles de générateurs préentraînés.

💬 Le test-time compute scaling arrive en robotique physique, et c'est une direction que j'attendais : tu peux améliorer un générateur de mouvements existant à l'inférence, sans pipeline de fine-tuning, ce que les approches VLA end-to-end comme pi-0 ne proposent pas. Validé sur un vrai G1, pas en sim. Reste à voir si ça généralise à d'autres plateformes.

IA physiqueOpinion
1 source
Le coût d'évaluation de la spécialisation des tâches dans les systèmes multi-robots évolutionnaires
335arXiv cs.RO 

Le coût d'évaluation de la spécialisation des tâches dans les systèmes multi-robots évolutionnaires

Une équipe de chercheurs publie sur arXiv (réf. 2606.24191, juin 2026) une analyse coût-bénéfice de l'optimisation évolutionnaire appliquée aux systèmes multi-robots (MRS). Le scénario de référence est le "foraging", une tâche de collecte distribuée simulée dans un environnement physique numérique. Le problème central tient à la répartition du budget d'évaluation : faire émerger des contrôleurs spécialisés par sous-tâche oblige à fragmenter les itérations de simulation, tandis qu'un contrôleur généraliste bénéficie de la totalité du budget pour s'optimiser. Les chercheurs mesurent à partir de quelle taille de flotte les spécialistes finissent par surpasser les généralistes malgré ce handicap budgétaire. Résultat principal : plus la flotte est grande, plus le budget total nécessaire pour que la spécialisation devienne avantageuse diminue, ce qui plaide pour des architectures différenciées dans les grands déploiements. Cette conclusion a une portée concrète pour les intégrateurs de solutions multi-robots en logistique, agriculture ou industrie manufacturière, où les flottes comptent couramment plusieurs dizaines voire centaines d'unités. Elle quantifie formellement un arbitrage jusqu'ici guidé par l'intuition : la division du travail robotique devient économiquement justifiée à l'échelle, et les coûts de simulation pour concevoir des agents spécialisés se réduisent à mesure que la flotte grandit. Le résultat nuance aussi un dogme dominant du swarm robotics, qui favorise l'homogénéité pour des raisons de résilience et de maintenabilité. À noter que la publication ne fournit pas encore de seuil de taille de flotte chiffré précis ni de comparaison quantitative entre architectures, réserves habituelles d'un preprint arXiv en attente de peer review. La spécialisation par évolution computationnelle dans les MRS s'appuie sur deux décennies de recherche en systèmes bio-inspirés, des travaux fondateurs de Marco Dorigo sur les essaims jusqu'aux approches modernes couplant algorithmes génétiques et apprentissage par renforcement. En parallèle, les acteurs industriels comme Exotec (AMR d'entrepôt, France) ou 6 River Systems allouent des rôles différenciés à leurs flottes par règles expertes ou RL centralisé, sans recourir à l'évolution simulée. Ce travail renforce la légitimité de l'approche évolutionnaire pour les grandes flottes hétérogènes et apporte un cadre analytique là où les ingénieurs arbitrent aujourd'hui à l'intuition. Les suites attendues incluent une validation sur robots physiques, l'extension à des architectures de tâches plus complexes que le foraging binaire, et une évaluation sur des flottes de taille industrielle réelle.

UELes intégrateurs européens de flottes multi-robots (logistique, industrie manufacturière) disposent d'un cadre analytique formel pour justifier une architecture spécialisée à grande échelle, Exotec, acteur français des AMR d'entrepôt, étant cité comme exemple industriel directement concerné.

RecherchePaper
1 source
Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique
336arXiv cs.RO 

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique

Des chercheurs ont publié le 24 juin 2026 sur arXiv (référence 2606.24208) une méthode visant à corriger un angle mort des politiques robotiques génératives : les sorties produites par les modèles de diffusion peuvent être statistiquement valides mais physiquement infaisables. En pratique, un modèle génératif de haute qualité peut planifier une saisie (grasp), un waypoint ou une trajectoire qui viole des contraintes d'atteignabilité (reachability), d'évitement de collision ou d'exécutabilité en boucle fermée, rendant le déploiement direct sur robot impossible. Les auteurs proposent un cadre d'optimisation à l'inférence qui formule le guidage diffusionnel comme un problème d'optimisation sous contraintes. La clé : remplacer la perturbation d'échantillonnage dans le processus de débruitage (backward process) par une correction optimisée, ce qui permet d'imposer des contraintes dures ou souples lors du sampling sans ré-entraîner le modèle. Évalué sur la synthèse de saisies dextères avec contraintes de reachability et d'évitement de collision, et sur la manipulation dynamique avec contraintes de suivi au niveau contrôleur, la méthode améliore le taux de succès jusqu'à 20 points de pourcentage sur la saisie dextère et 23 points de pourcentage sur la manipulation visuomotrice par rapport à la meilleure baseline testée. L'enjeu est ce que les auteurs nomment l'"embodiment gap" : une politique entraînée dans un espace de tâches générique peut produire des comportements conceptuellement transférables, mais leur exécution sur un corps physique spécifique échoue faute de contraintes cinématiques ou dynamiques respectées. Pour les intégrateurs et les OEM robotiques, cela signifie que les modèles généralistes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne peuvent pas être déployés tels quels sur n'importe quel bras ou manipulateur sans couche d'adaptation. L'approche proposée ici opère uniquement en temps d'inférence, sans modification des poids du modèle, ce qui réduit drastiquement le coût d'adaptation à un nouvel embodiment et la rend potentiellement intégrable dans des pipelines existants sans refonte de l'architecture. Le travail s'inscrit dans la dynamique des politiques de diffusion en robotique, initiée notamment par Diffusion Policy (Chi et al., 2023) et prolongée par les architectures VLA de nouvelle génération. Les méthodes concurrentes de guidage par gradient (gradient guidance) et de projection constituent les baselines, et la méthode proposée les surpasse en préservant mieux la qualité des saisies tout en augmentant l'exécutabilité au niveau contrôleur. Dans un secteur où Physical Intelligence, Covariant ou 1X Technologies misent sur des politiques génératives à grande échelle pour atteindre la généralisation inter-robots, cette approche d'optimisation à l'inférence offre un levier d'adaptation pragmatique sans nécessiter de nouvelles données d'entraînement ni de fine-tuning coûteux.

RechercheActu
1 source
Tri-Info : prédiction d'échec généralisable et interprétable pour les modèles VLA par la théorie de l'information
337arXiv cs.RO 

Tri-Info : prédiction d'échec généralisable et interprétable pour les modèles VLA par la théorie de l'information

Une équipe de chercheurs a publié en juin 2026, via arXiv (arXiv:2606.19998), une méthode appelée Tri-Info (Triple Information-theoretic signals) pour détecter automatiquement les défaillances des modèles VLA (Vision-Language-Action) avant qu'ils ne causent des dommages irréversibles dans des environnements physiques. Testée sur six modèles VLA distincts et trois environnements de benchmark, Tri-Info atteint 83 % de précision sur des tâches en conditions réelles, là où les détecteurs existants s'effondrent au niveau du hasard. La méthode repose sur trois signaux dérivés de la théorie de l'information : la diversité des actions générées par le modèle, leur cohérence temporelle, et leur couplage aux transitions d'état observées dans l'environnement. Cruciale pour les déploiements industriels, Tri-Info ne nécessite aucun réentraînement pour fonctionner sur de nouvelles architectures ou dans de nouveaux environnements, y compris lors du passage simulation-vers-réel (sim-to-real). Ce résultat est directement pertinent pour les intégrateurs qui déploient des robots manipulateurs ou humanoïdes pilotés par des VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). L'opacité de ces modèles constitue un risque opérationnel concret : un VLA peut échouer silencieusement, entraînant une collision, une chute d'objet ou l'interruption d'un cycle de production. Tri-Info ajoute une couche de supervision interprétable capable de distinguer trois classes de défaillances (manque de diversité, incohérence temporelle, découplage état-action), ce qui facilite le diagnostic post-incident. Sa transférabilité sans réentraînement est stratégiquement importante : elle permet d'intégrer la détection sur des systèmes déjà déployés sans modifier le pipeline existant. Ce travail s'inscrit dans une course à l'industrialisation des VLA accélérée depuis fin 2024 avec les sorties de Pi-0 et d'OpenVLA, et les travaux de Google DeepMind sur RT-2 et ses successeurs. Le sim-to-real gap reste l'un des principaux freins à leur généralisation, la plupart des systèmes de détection entraînés en simulation perdant leur efficacité en conditions réelles. Tri-Info est à ce stade un preprint non encore revu par les pairs, et ses performances n'ont pas été reproduites de manière indépendante. Si elles se confirment, la méthode pourrait s'imposer comme une brique de sécurité standard dans les pipelines de déploiement robotique fondés sur des VLA.

RechercheOpinion
1 source
Bien partir pour bien arriver : exécution asynchrone par sélection du bruit initial
338arXiv cs.RO 

Bien partir pour bien arriver : exécution asynchrone par sélection du bruit initial

Des chercheurs ont publié sur arXiv (2606.19774) une méthode baptisée PAINT, destinée à éliminer les discontinuités de mouvement dans les robots contrôlés par des politiques basées sur le flow matching. Le problème ciblé est l'exécution asynchrone dans le cadre de l'action chunking : pendant qu'un robot exécute une séquence d'actions prédéfinie (le "chunk" courant), la politique génère le chunk suivant ; si cette génération prend trop de temps, les deux séquences se raccordent mal, créant des à-coups visibles. PAINT résout ce problème non pas en corrigeant la trajectoire de génération en cours, mais en sélectionnant le bruit initial optimal avant que la génération commence, requalifiant ainsi le problème de guidage de trajectoire en problème de sélection de bruit. La méthode utilise une inversion d'Euler backward pour identifier ce bruit de départ, puis applique une règle de "repainting" pour construire le chunk final cohérent avec le préfixe déjà exécuté. Aucun gradient, aucun réentraînement ni modification de la politique existante ne sont requis. Les auteurs rapportent des améliorations sur 12 benchmarks simulés et 6 tâches de manipulation réelles, couvrant des bras simples, des systèmes bimanaux et des robots humanoïdes. L'enjeu pour les équipes robotique est concret : une méthode training-free s'applique directement à n'importe quelle politique flow-based déjà entraînée, sans coût de réentraînement. Pour les déploiements industriels, où l'action chunking est prisé précisément parce qu'il améliore la cohérence temporelle des mouvements, les discontinuités aux frontières de chunks sont un frein réel à la cadence de production. PAINT adresse ce goulot sans toucher à l'architecture ni aux poids du modèle. La validation sur des embodiments variés, du bras simple à l'humanoïde, renforce la généralité revendiquée, même si les 12 benchmarks simulés restent des conditions contrôlées dont la portée terrain reste à confirmer sur des lignes de production réelles. L'action chunking a été popularisé par ACT (Zhao et al., 2023) et le Diffusion Policy (Chi et al., 2023), avant d'être adopté dans des modèles VLA plus récents comme π0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les méthodes concurrentes pour gérer la latence asynchrone s'appuient sur un guidage ou recadrage de la trajectoire de génération, approches qui nécessitent des gradients ou des modifications du modèle. PAINT se positionne comme une alternative légère dans cet espace. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé ; la publication reste au stade de la recherche académique, avec un site de démonstration accessible.

RecherchePaper
1 source
Les modèles VLA maîtrisent-ils les bases ? Évaluation de la rétention du sens commun et des connaissances du monde
339arXiv cs.RO 

Les modèles VLA maîtrisent-ils les bases ? Évaluation de la rétention du sens commun et des connaissances du monde

Une équipe de recherche a publié sur arXiv (arXiv:2606.19297) un protocole d'évaluation baptisé Act2Answer, conçu pour mesurer objectivement combien de connaissances de sens commun et de savoirs factuels les modèles Vision-Language-Action (VLA) conservent après leur fine-tuning sur des données robotiques. Le protocole transforme les benchmarks classiques d'évaluation de modèles de langage visuels (VLM) en épisodes tabulaires courts : l'agent doit répondre à une question en plaçant physiquement un objet parmi plusieurs candidats sur une surface, ce qui ancre l'évaluation dans une action réelle plutôt que dans un output textuel. L'étude couvre 7 modèles VLA et 9 modèles VLM de référence, testés sur une suite de scénarios couvrant plusieurs catégories de connaissances. À cela s'ajoute une technique de sondage couche par couche (layerwise intent probing) pour localiser où l'information pertinente à la réponse est encodée dans le backbone VLM et la tête d'action. Les résultats révèlent une dégradation systématique, mais inégale, des connaissances après adaptation robotique. Les VLA maintiennent des performances solides sur les concepts simples, mais accusent des écarts significatifs sur les catégories sémantiquement plus riches par rapport à leurs VLM d'origine. Autrement dit, le fine-tuning robotique érode préférentiellement les représentations de haut niveau, celles qui portent le raisonnement nuancé. Le probing couche par couche montre que les signaux pertinents culminent dans les couches intermédiaires du réseau, puis s'atténuent dans les couches supérieures, ce qui suggère que la tête d'action interfère avec la propagation des connaissances sémantiques. Fait notable : l'entraînement conjoint avec des données VQA (Visual Question Answering) est associé à une meilleure rétention des connaissances, ouvrant une piste concrète pour les architectures futures. L'outil résout aussi un problème méthodologique persistant : il devient difficile de distinguer un échec dû à une connaissance absente d'un échec de contrôle moteur de bas niveau. Act2Answer s'inscrit dans un débat plus large sur le sim-to-real gap et la robustesse des VLA en déploiement industriel. Les modèles VLA actuels, comme Pi-0 (Physical Intelligence), OpenVLA, ou les architectures dérivées de modèles comme LLaVA et Qwen-VL, héritent de VLMs préentraînés sur des corpus massifs, puis sont spécialisés sur des datasets robotiques relativement restreints. La question de la rétention des connaissances est directement pertinente pour les intégrateurs qui misent sur ces modèles pour des tâches impliquant une compréhension contextuelle du monde réel, au-delà du simple pick-and-place. Aucun acteur européen n'est mentionné dans l'étude. Le code et les environnements Act2Answer sont disponibles publiquement, ce qui permettra à d'autres équipes de compléter les comparaisons avec d'autres architectures et de tester l'impact de stratégies d'entraînement alternatives.

UELes équipes de recherche et les intégrateurs européens travaillant sur les VLA peuvent exploiter le benchmark Act2Answer (code public) pour évaluer la rétention de connaissances de leurs modèles et tester la stratégie d'entraînement conjoint VQA.

RechercheOpinion
1 source
DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent
340arXiv cs.RO 

DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent

DREAM-Chunk (arXiv:2606.18589, juin 2026) est une méthode d'inférence conçue pour corriger une fragilité structurelle des modèles vision-language-action (VLA) : l'exécution en boucle ouverte lors de l'action chunking. Ce paradigme, devenu standard dans les VLA actuels, consiste à inférer à basse fréquence un bloc d'actions (un "chunk") que le robot exécute séquentiellement à haute fréquence, sans rétroaction intermédiaire. Dès qu'un chunk est lancé, le robot le suit à l'aveugle, vulnérable aux perturbations dynamiques, aux erreurs matérielles et à l'observabilité partielle. DREAM-Chunk adresse ce problème sans modifier ni réentraîner la politique sous-jacente : à l'inférence, il génère plusieurs chunks candidats, simule leurs trajectoires dans un espace latent via un world model léger, et sélectionne celui dont l'état prédit correspond le mieux à l'observation réelle. La méthode est validée sur le benchmark Kinetix et sur quatre tâches de manipulation couvrant deux plateformes robotiques et deux architectures VLA distinctes. L'intérêt pratique est direct pour les intégrateurs industriels qui déploient des VLA pré-entraînés sans accès au pipeline d'entraînement : DREAM-Chunk s'insère comme une couche plug-and-play, sans fine-tuning requis. La méthode s'inscrit dans la tendance du test-time compute scaling, bien établie côté LLM mais encore naissante en robotique physique, où dépenser davantage de calcul à l'inférence peut compenser les limites d'un modèle sans passer par un nouveau cycle d'entraînement coûteux. Les résultats montrent que les gains augmentent avec le nombre de chunks candidats échantillonnés, et que l'avantage est particulièrement marqué lorsque les démonstrations contiennent des comportements correctifs, ce qui soulève une question pratique sur la composition des datasets de démo. Les world models latents en robotique ont une longue tradition (DREAMER, TD-MPC2, DreamerV3), mais leur couplage avec des VLA basés sur le chunking reste récent. Physical Intelligence avec pi-0, Figure AI et des équipes de Stanford, CMU et Berkeley explorent simultanément comment améliorer la robustesse en déploiement sans réentraînement complet. DREAM-Chunk se distingue par son caractère agnostique au modèle sous-jacent, ce qui facilite son adoption sur des architectures hétérogènes. La prochaine étape logique serait une validation sur des plateformes commerciales à manipulation dextre (Fourier GR1, Unitree G1) et des tâches à dynamiques hautement stochastiques comme l'assemblage de précision. Le papier ne mentionne ni partenaires industriels ni pilotes commerciaux annoncés.

💬 Le test-time compute scaling arrive enfin en robotique physique, et DREAM-Chunk en est un premier signal propre : générer des trajectoires candidates, simuler dans un espace latent, choisir la meilleure, sans toucher au modèle sous-jacent. Le chunking en boucle ouverte, c'est le point faible silencieux de tous les VLA actuels (ça marche dans 80% des cas, alors on n'en parle pas trop). Pour les intégrateurs qui déploient sans accès au pipeline d'entraînement, une couche qui corrige à l'inférence sans réentraîner, c'est la pièce manquante.

IA physiqueOpinion
1 source
L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien
341arXiv cs.RO 

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien

Des chercheurs ont mis en ligne sur arXiv en juin 2026 un algorithme nommé DO AS I DO, conçu pour extraire automatiquement des trajectoires de manipulation dextère à partir de vidéos RGB monoculaires filmant des mains humaines en action. Le pipeline reconstruit les interactions main-objet depuis des vidéos égocentriques (caméra portée par l'opérateur) ou exocentriques (caméra tierce), captées en conditions réelles et sans capteurs de profondeur ni marqueurs, puis effectue un retargeting de ces estimations vers des mains robotiques multi-doigts pour produire des séquences d'actions directement exécutables sur robot physique. Selon les évaluations conduites sur plusieurs jeux de données annotés ainsi que sur des clips collectés en ligne, DO AS I DO dépasse l'état de l'art précédent en précision d'estimation des interactions main-objet et en qualité des trajectoires extraites. L'enjeu est structurel : la collecte de données de manipulation reste le principal goulot d'étranglement pour entraîner des robots dextères. La téléopération est lente et coûteuse, la simulation difficile à transférer en conditions réelles sur des mains à 16 DOF ou plus, un phénomène connu sous le nom de sim-to-real gap. DO AS I DO propose une troisième voie en exploitant des vidéos déjà disponibles en ligne comme source de supervision passive, sans infrastructure dédiée. Pour les équipes R&D travaillant sur des manipulateurs multi-doigts, cela pourrait réduire significativement le coût de collecte de démonstrations. Les auteurs publient également un "efficacy playbook", soit un ensemble de recommandations pratiques destinées aux équipes terrain. Le point critique reste la fidélité du retargeting : le fossé cinématique entre les 21 degrés de liberté d'une main humaine et l'anatomie d'un effecteur robotique introduit des approximations que le papier reconnaît sans les quantifier de façon exhaustive. La manipulation dextère demeure l'un des problèmes les moins résolus de la robotique humanoïde commerciale. Physical Intelligence avec Pi-0, Figure AI avec Figure 03 et NVIDIA avec GR00T N2 investissent massivement dans des pipelines de données alternatifs, notamment la génération en simulation via DexMimicGen ou la téléopération structurée à grande échelle comme DROID et ALOHA 2. DO AS I DO se distingue en ciblant directement l'embodiment gap sans recourir à de l'infrastructure de capture spécialisée, en valorisant des vidéos grand public. Ce preprint ne mentionne aucun déploiement industriel ni partenariat commercial ; il s'agit d'une contribution académique, pas d'un produit prêt à l'emploi. L'étape naturelle sera de mesurer si ces trajectoires retargetées alimentent efficacement l'entraînement de modèles VLA à l'échelle, la question ouverte centrale de la robotique de manipulation en 2026.

RecherchePaper
1 source
RSLCPP : simulations déterministes avec ROS 2
342arXiv cs.RO 

RSLCPP : simulations déterministes avec ROS 2

Une équipe de l'Université Technique de Munich (TUM) publie RSLCPP, une bibliothèque open-source en C++ conçue pour rendre les simulations robotiques sous ROS 2 entièrement déterministes. La contribution, présentée dans un article révisé sur arXiv (arXiv:2601.07052v2), s'attaque à un problème structurel de ROS : son architecture asynchrone et multi-processus rend les résultats de simulation non reproductibles d'une machine à l'autre, voire d'une exécution à l'autre sur le même matériel. L'équipe démontre que RSLCPP produit des résultats bit-à-bit identiques sur plusieurs architectures CPU, validés sur un benchmark synthétique et sur un système robotique réel. La bibliothèque est disponible en open-source sur GitHub (TUMFTM/rslcpp). Le problème que résout RSLCPP est fondamental pour quiconque utilise ROS 2 en simulation : lorsque les temps de calcul et les latences de communication varient, l'ordre d'exécution des callbacks n'est pas garanti, ce qui compromet la reproductibilité des résultats. Pour le benchmarking scientifique et l'intégration continue (CI/CD), où la répétabilité est essentielle, cela constitue un frein réel. RSLCPP impose un ordonnancement déterministe des callbacks en combinant les nœuds ROS existants dans une routine de simulation séquentielle, sans nécessiter de modification du code source. Ce dernier point est décisif : les équipes peuvent instrumenter leurs stacks ROS existantes sans refactoring, ce qui abaisse significativement le coût d'adoption. ROS 2, maintenu par Open Robotics, est devenu le standard de facto en robotique académique et industrielle. La non-reproductibilité des simulations est un problème connu depuis des années dans la communauté, que des simulateurs comme Gazebo ou Isaac Sim de NVIDIA ont partiellement adressé via leurs propres mécanismes internes. RSLCPP se distingue en opérant directement au niveau de l'exécuteur ROS 2, rendant l'approche indépendante du simulateur physique sous-jacent et donc plus portable. La prochaine étape logique serait l'intégration dans des pipelines CI robotiques pour valider des comportements algorithmiques sans variabilité matérielle, un besoin croissant à mesure que les équipes industrielles adoptent des pratiques DevOps pour le développement robotique.

UELes équipes de R&D robotique européennes utilisant ROS 2 bénéficient d'un outil open-source issu de TUM (Allemagne) pour fiabiliser leurs pipelines CI/CD de simulation sans refactoring de code existant.

InfrastructureOpinion
1 source
HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique
343arXiv cs.RO 

HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique

Une équipe de chercheurs a publié HT-Bench, un benchmark à grande échelle destiné à évaluer les représentations tactiles main entière dans la manipulation robotique dextre, avec un dataset de 10 millions de trames RGB et 7,8 millions de trames tactiles collectées sur 226 tâches distinctes. La publication (arXiv:2606.19161, juin 2026) propose une approche centrée sur la vision égocentrique couplée à des capteurs tactiles couvrant l'intégralité de la main robotique. Le benchmark structure l'évaluation autour de quatre tâches : récupération de similarité tactile fine, inpainting de trames masquées, synthèse vision-vers-tactile, et prédiction multimodale de trames tactiles. En parallèle, les auteurs introduisent HandTouch, un encodeur vision-tactile à quantification vectorielle (VQ), entraîné selon trois phases progressives : spatiale, cross-modale et temporelle. Les gains quantitatifs de HandTouch sur HT-Bench sont nets : le Recall@5 en récupération de similarité tactile passe de 74,65 % à 85,23 %, l'erreur quadratique moyenne (RMSE) en inpainting chute de 0,022 à 0,010, et le score cIoU hors-distribution (OOD) en synthèse vision-tactile progresse de 0,628 à 0,705. Pour l'industrie robotique, cela valide une hypothèse structurante : coupler vision égocentrique et retour tactile main entière constitue une base d'apprentissage généralisable, sans exiger des capteurs ou des embodiments standardisés. C'est un signal concret pour les intégrateurs et équipes R&D travaillant sur la manipulation dextre en environnements non structurés, où percevoir l'état d'une prise sans vision directe reste un verrou majeur. Le domaine du tactile en robotique souffre depuis longtemps d'une fragmentation des formats de capteurs et des protocoles, rendant les comparaisons entre travaux difficiles. HT-Bench s'inscrit dans une dynamique de benchmarking qui émerge en 2025-2026, aux côtés d'initiatives comme RoboSet, DROID ou LIBERO pour la manipulation généraliste. Des laboratoires comme le CMU Robotics Institute et le MIT CSAIL, ainsi que des entreprises comme Sanctuary AI, explorent des approches similaires de fusion tactile-visuelle. Aucun acteur européen n'est directement cité dans ce travail, mais des startups comme Enchanted Tools ou Wandercraft, actives sur la manipulation avancée, pourraient tirer parti d'un tel benchmark pour standardiser leurs évaluations internes. L'étape suivante logique serait l'intégration de HandTouch dans des pipelines VLA (Vision-Language-Action), où le retour tactile reste aujourd'hui largement absent.

RecherchePaper
1 source
Bench-Push : benchmark pour la navigation et la manipulation par poussée des robots mobiles
344arXiv cs.RO 

Bench-Push : benchmark pour la navigation et la manipulation par poussée des robots mobiles

Une équipe de chercheurs a publié Bench-Push (arXiv:2512.11736), le premier benchmark unifié dédié à l'évaluation des robots mobiles capables de pousser et de manipuler des objets dans leur environnement immédiat. La suite comprend quatre environnements de simulation aux niveaux de complexité variables : navigation en labyrinthe avec obstacles mobiles, navigation autonome de navire en eaux glacées, livraison de caisses, et nettoyage de zones encombrées. Bench-Push intègre également un jeu de métriques originales conçues pour mesurer l'efficacité, l'effort d'interaction mécanique et la complétion partielle des tâches, ainsi que des démonstrations de baselines établies. La bibliothèque est open-source, distribuée sous Python avec une architecture modulaire, et disponible sur GitHub (IvanIZ/BenchNPIN). L'absence de référentiel commun dans ce domaine constitue un frein réel : jusqu'ici, chaque équipe évaluait ses approches sur des configurations ad hoc, rendant toute comparaison inter-laboratoires impossible et la reproductibilité aléatoire. Or la question est loin d'être académique. Les robots mobiles autonomes (AMR) déployés en logistique, en entrepôt ou en milieu industriel se retrouvent régulièrement dans des espaces encombrés d'objets déplaçables que les algorithmes classiques d'évitement d'obstacles ne savent tout simplement pas gérer. Les stratégies de poussée (pushing, nudging) constituent une compétence clé pour ces environnements réels, et Bench-Push offre désormais un terrain de comparaison structuré pour les évaluer. La métrique de complétion partielle est notamment utile pour les décideurs B2B, qui ont besoin de quantifier la dégradation progressive des performances plutôt qu'un simple succès ou échec binaire. Le champ dit NAMO (Navigation Among Movable Obstacles) connaît une croissance soutenue, mais restait fragmenté faute d'outil fédérateur. Bench-Push s'inscrit dans la continuité des efforts de standardisation observés ailleurs en robotique, à l'image de ce que RoboSuite ou Isaac Gym ont apporté à la manipulation. L'inclusion d'un scénario de navigation en eaux glacées témoigne d'une ambition d'élargissement au-delà de la robotique d'entrepôt stricte, vers des domaines comme la navigation maritime autonome. Il n'existe à ce stade aucune annonce de déploiement industriel : Bench-Push est un outil de recherche, mais sa conception modulaire et son accessibilité via pip en font un candidat sérieux à une adoption rapide par les équipes travaillant sur la planification en environnements dynamiques.

RecherchePaper
1 source
Panorama des représentations de mémoire spatiale pour la navigation robotique efficace
345arXiv cs.RO 

Panorama des représentations de mémoire spatiale pour la navigation robotique efficace

Une étude publiée sur arXiv (2604.16482) recense 88 travaux couvrant 52 systèmes de navigation robotique entre 1989 et 2025, des grilles d'occupation classiques jusqu'aux représentations neurales implicites. Le problème central : à mesure qu'un robot explore de grands espaces, sa mémoire spatiale croît sans borne, épuisant les ressources des plateformes embarquées typiques (8 à 16 Go de mémoire partagée, moins de 30 W de consommation). Les auteurs introduisent un coefficient α, défini comme le rapport entre la mémoire RAM ou GPU consommée en opération (Mpeak) et la taille de la carte sauvegardée sur disque (Mmap). Un profilage indépendant sur GPU NVIDIA A100 révèle que α varie de deux ordres de grandeur selon les méthodes neurales seules : Point-SLAM affiche α = 2,3, tandis que NICE-SLAM atteint α = 215, sa carte de 47 Mo réclamant 10 Go à l'exécution. Les méthodes 3DGS (Gaussian Splatting 3D) obtiennent la meilleure précision absolue pour des cartes de 90 à 254 Mo sur le benchmark Replica, et les graphes de scènes offrent une abstraction sémantique à coût prévisible. Ce résultat remet en cause une hypothèse courante dans la communauté SLAM : la taille de la carte publiée dans un papier n'est pas un indicateur fiable de la faisabilité réelle sur matériel cible. Un système qui semble léger au sens du checkpoint disque peut exiger des ressources mémoire prohibitives au runtime, rendant son déploiement impossible sur une unité de calcul edge standard. L'absence de métrique unifiée sur la consommation mémoire dynamique explique en partie pourquoi des méthodes prometteuses en laboratoire peinent à franchir le seuil de la mise en production industrielle, notamment sur les robots mobiles autonomes (AMR) ou les manipulateurs avec vision embarquée. L'étude propose un protocole standardisé articulé autour du taux de croissance mémoire, de la latence de requête, des courbes mémoire-complétude et de la dégradation du débit, quatre indicateurs absents des benchmarks actuels. Le champ de la mémoire spatiale pour la navigation autonome a connu une accélération avec l'arrivée des représentations neurales implicites (NeRF, 3DGS) autour de 2020-2022, qui ont amélioré la qualité de reconstruction mais ignoré la contrainte mémoire runtime. Des acteurs comme iSLAM, Point-SLAM ou NICE-SLAM ont publié des cartes compactes sans fournir de mesures de consommation dynamique, créant un angle mort dans l'évaluation comparative. Sur le plan concurrentiel, les intégrateurs industriels qui évaluent des solutions SLAM pour des environnements larges (entrepôts, usines) devront désormais exiger le coefficient α comme critère de qualification, en plus du RMSE de localisation. La prochaine étape logique annoncée par les auteurs est un algorithme de budgétisation α-aware permettant d'évaluer la faisabilité de déploiement sur hardware cible avant toute implémentation, un outil directement actionnable pour les équipes d'intégration.

RecherchePaper
1 source
Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)
346arXiv cs.RO 

Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)

Des chercheurs ont publié le 21 avril 2026 un article sur arXiv (2604.14732) présentant le modèle WAV (World-Value-Action), une architecture unifiée destinée à améliorer les capacités de planification des systèmes Vision-Language-Action (VLA). Les VLA sont des modèles qui ancrent la perception visuelle et les instructions en langage naturel dans des commandes motrices directes, une approche devenue centrale dans la robotique généraliste ces deux dernières années. Le problème ciblé par WAV est précis : la majorité des VLA actuels prédisent les actions de manière directe (un état visuel + une instruction = une action), sans modéliser les conséquences à long terme de leurs décisions. Le modèle WAV introduit à la place une représentation latente structurée des trajectoires futures, conditionnée sur les observations visuelles et les instructions. Un modèle de monde (world model) prédit les états futurs, tandis qu'une fonction de valeur de trajectoire (trajectory value function) évalue leur utilité à horizon long. La génération d'action est ensuite formulée comme une inférence dans cet espace latent, où le modèle concentre progressivement la masse de probabilité sur les trajectoires à haute valeur et dynamiquement réalisables. L'apport théorique central est démontré formellement : planifier directement dans l'espace des actions entraîne une décroissance exponentielle de la probabilité de trajectoires réalisables à mesure que l'horizon s'allonge, un obstacle fondamental pour toute tâche nécessitant plusieurs étapes enchaînées. L'inférence dans l'espace latent restructure la distribution de recherche vers des régions réalisables, ce qui rend la planification à long horizon tractable. En pratique, WAV surpasse les méthodes de l'état de l'art en simulation et dans des expériences réelles, avec des gains mesurables sur le taux de succès des tâches, la capacité de généralisation et la robustesse, notamment dans les scénarios compositionnels et à horizon long. Pour les intégrateurs industriels et les équipes de robotique, cela signifie potentiellement un meilleur comportement dans les tâches en plusieurs étapes, assemblage, manipulation séquentielle, sans avoir à pré-programmer des graphes de tâches explicites. Les VLA ont connu une accélération notable depuis fin 2023, avec des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA (Berkeley) qui ont validé l'approche d'un modèle fondationnel pour la manipulation robotique. La plupart de ces architectures partagent le défaut que WAV cherche à corriger : l'absence de raisonnement causal sur les conséquences des actions. Des approches concurrentes comme SWIM (Sequential World Inference Models) ou les travaux de Dreamer appliqués à la robotique explorent des pistes similaires via des world models explicites, mais WAV tente d'intégrer planning implicite et génération d'action dans un seul cadre d'entraînement. Le code est disponible publiquement sur GitHub (Win-commit/WAV). Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article, il s'agit pour l'instant d'une publication académique, sans produit shipped ni pilote annoncé.

RechercheActu
1 source
Vers un MAPF réaliste : SMART, un banc de test multi-agents extensible pour le monde réel
347arXiv cs.RO 

Vers un MAPF réaliste : SMART, un banc de test multi-agents extensible pour le monde réel

Une équipe de chercheurs a publié SMART (Scalable Multi-Agent Realistic Testbed), un environnement de simulation open-source destiné à l'évaluation des algorithmes MAPF (Multi-Agent Path Finding), c'est-à-dire la planification de trajectoires sans collision pour des flottes de robots. Le papier, référencé arXiv:2503.04798, présente un outil capable de simuler jusqu'à plusieurs milliers de robots simultanément, en intégrant un moteur physique complet qui modélise la kinodynamique des robots et les incertitudes d'exécution réelles. SMART s'appuie sur un cadre de supervision d'exécution basé sur l'Action Dependency Graph (ADG), ce qui permet une intégration modulaire avec différents planificateurs MAPF et modèles de robots. Le code est disponible publiquement sur GitHub, accompagné d'un service de démonstration en ligne. L'enjeu industriel est direct : les meilleurs planificateurs MAPF actuels sont capables de calculer des trajectoires pour des centaines de robots en quelques secondes, mais ils reposent presque tous sur des modèles de robots simplifiés, ignorant la dynamique réelle, les glissements, les délais de démarrage ou les imprécisions de positionnement. Ce fossé entre simulation idéalisée et comportement terrain est un frein majeur au déploiement en entrepôt ou en atelier. SMART propose de combler ce gap en permettant aux intégrateurs et aux équipes R&D de tester leurs algorithmes dans des conditions proches de la réalité sans avoir besoin de dizaines ou de centaines de robots physiques, ressource quasi-inaccessible en laboratoire. Pour un COO industriel qui évalue des solutions AMR (Autonomous Mobile Robots), disposer d'un simulateur crédible et open-source réduit significativement le risque d'un déploiement raté. Le problème du sim-to-real gap dans le MAPF est documenté depuis plusieurs années, et des acteurs comme Amazon Robotics, Geek+ ou Exotec en Europe ont développé leurs propres outils internes. SMART vise à démocratiser cet accès, notamment pour les équipes académiques et les intégrateurs de taille intermédiaire. Le framework ADG n'est pas nouveau, il était déjà central dans les travaux antérieurs sur l'exécution robuste de MAPF, mais son intégration dans un simulateur à physique réaliste et passant à l'échelle représente une avancée méthodologique. Les prochaines étapes probables incluent la validation sur des cas industriels concrets et l'ajout de modèles de robots commerciaux comme les AMR à différentiel ou les AGV à guidage magnétique.

UEExotec, acteur français des AMR d'entrepôt, est cité parmi les rares industriels disposant d'outils internes similaires ; SMART pourrait réduire la barrière à l'entrée pour les équipes R&D et intégrateurs européens de taille intermédiaire souhaitant valider des algorithmes MAPF sans flotte physique.

RecherchePaper
1 source
CLAW : génération de mouvements corps entier composables et annotés en langage naturel
348arXiv cs.RO 

CLAW : génération de mouvements corps entier composables et annotés en langage naturel

Une équipe de chercheurs a publié CLAW (Composable Language-Annotated Whole-body Motion Generation), un pipeline open source conçu pour générer à grande échelle des données de mouvement annoté en langage naturel pour robots humanoïdes, appliqué ici au Unitree G1. Le système compose des primitives de mouvement paramétrées par six variables, type de déplacement, cap, vitesse, hauteur du bassin (pelvis height) et durée, et les exécute dans le simulateur MuJoCo pour produire des trajectoires physiquement cohérentes. Deux interfaces navigateur sont proposées : un mode clavier en temps réel pour l'exploration, et un éditeur de séquences en timeline pour la collecte de données en batch. En parallèle, un moteur de génération d'annotations basé sur des templates produit des descriptions en langage naturel à deux niveaux de granularité : segment individuel et trajectoire complète. Le code est disponible publiquement sur GitHub sous la référence arXiv:2604.11251. L'enjeu central est le goulot d'étranglement des données pour entraîner des contrôleurs whole-body conditionnés au langage (VLA, Vision-Language-Action). La capture de mouvement réelle est coûteuse, peu scalable et limitée en diversité ; les modèles génératifs text-to-motion existants produisent des sorties purement cinématiques, sans garantie de faisabilité physique, un écueil critique pour le déploiement réel. CLAW apporte une réponse intermédiaire : la simulation MuJoCo ancre les trajectoires dans la physique, tandis que la composition modulaire de primitives permet une diversité combinatoire élevée. C'est une approche sim-to-real pragmatique qui vise à réduire le fossé entre données d'entraînement et comportement robot en conditions réelles, sans le coût d'un studio de mocap. Le Unitree G1, robot humanoïde chinois positionné sur le segment accessible (prix catalogue autour de 16 000 USD), est une plateforme de recherche de plus en plus utilisée dans la communauté académique, notamment face aux plateformes fermées comme Figure 02 ou Apptronik Apollo. CLAW s'inscrit dans une dynamique plus large de démocratisation des pipelines de données pour la robotique humanoïde, aux côtés de travaux comme le dataset HumanoidBench ou les approches de Physical Animation de Berkeley. La mise à disposition publique du système est son principal atout différenciant : elle permet aux laboratoires sans ressources de mocap de constituer des jeux de données whole-body annotés pour leurs propres expériences de contrôle en langage. Les prochaines étapes attendues, non annoncées dans ce papier, concernent le transfert réel sur G1 et la validation des politiques entraînées sur ces données synthétiques.

UELes laboratoires européens de recherche en robotique humanoïde peuvent exploiter ce pipeline open source pour constituer des jeux de données whole-body annotés sans infrastructure de mocap coûteuse.

IA physiqueOpinion
1 source
Modèles fondation en robotique : revue complète des méthodes, modèles, jeux de données, défis et perspectives
349arXiv cs.RO 

Modèles fondation en robotique : revue complète des méthodes, modèles, jeux de données, défis et perspectives

Une revue systématique publiée sur arXiv (2604.15395) recense l'état de l'art des modèles de fondation appliqués à la robotique, couvrant l'ensemble du spectre allant des grands modèles de langage (LLM) aux architectures vision-langage-action (VLA). Les auteurs structurent leur analyse en cinq phases historiques distinctes, depuis les premières intégrations de modèles NLP et vision par ordinateur jusqu'aux déploiements multi-sensoriels en environnement réel. La taxonomie proposée examine six axes : les types de modèles employés (LLM, VFM, VLM, VLA), les architectures de réseaux de neurones sous-jacentes, les paradigmes d'apprentissage, les stades d'incorporation des connaissances, les tâches robotiques ciblées, et les domaines applicatifs industriels. L'étude recense également les datasets publics utilisés pour l'entraînement et l'évaluation sur ces différentes tâches. L'intérêt de ce travail pour les intégrateurs et les décideurs industriels réside dans sa cartographie des capacités réelles versus annoncées des VLA en déploiement. Le passage d'agents mono-tâche et spécialisés vers des agents adaptatifs multi-fonctions à usage général constitue le fil directeur de l'analyse. Les auteurs traitent explicitement du gap simulation-réalité (sim-to-real), de la généralisation inter-embodiment (cross-embodiment), et de la planification à horizon long, trois verrous techniques qui conditionnent la commercialisation à grande échelle. La revue identifie aussi les défis ouverts et les directions de recherche prometteuses, utiles pour orienter des feuilles de route R&D. Ce survey s'inscrit dans une accélération documentée depuis 2022, portée par des laboratoires comme Google DeepMind (RT-2, π0), Physical Intelligence, Figure AI, et Unitree, qui ont tous misé sur les VLA comme colonne vertébrale de leurs systèmes. Côté européen, des acteurs comme Enchanted Tools ou Wandercraft n'apparaissent pas dans ce corpus, ce qui reflète un déséquilibre de publication favorable aux équipes nord-américaines et asiatiques. La revue ne constitue pas un benchmark expérimental indépendant mais une synthèse bibliographique, ce qui en fait un point d'entrée solide pour un ingénieur robotique cherchant à situer une technologie ou comparer des approches, sans remplacer une évaluation terrain des solutions commerciales disponibles.

UELe déséquilibre de publication constaté, acteurs FR/EU (Enchanted Tools, Wandercraft) absents du corpus, souligne un déficit de visibilité des équipes européennes dans la recherche VLA, ce qui peut biaiser les benchmarks de référence utilisés par les industriels pour orienter leurs feuilles de route R&D.

RecherchePaper
1 source
Calibration main-oeil en continu pour la manipulation robotique en environnement ouvert
350arXiv cs.RO 

Calibration main-oeil en continu pour la manipulation robotique en environnement ouvert

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.15814) un framework d'étalonnage main-oeil continu (continual hand-eye calibration) destiné aux robots manipulateurs déployés dans des environnements ouverts et changeants. Le problème adressé est précis : les modèles de calibration basés sur le deep learning perdent leur précision sur les scènes précédemment apprises dès qu'ils s'adaptent à un nouvel environnement, un phénomène connu sous le nom d'oubli catastrophique (catastrophic forgetting). Le framework proposé repose sur deux composants distincts. Le premier, SARS (Spatial-Aware Replay Strategy), construit un buffer de rejeu géométriquement uniforme qui couvre l'espace de poses de chaque scène sans redondance, en sélectionnant les points de vue les plus informatifs plutôt que les frames adjacentes. Le second, SPDD (Structure-Preserving Dual Distillation), décompose la connaissance de localisation en deux niveaux, la structure grossière de la scène et la précision fine de pose, puis applique une distillation séparée pour préserver les deux dimensions lors des adaptations successives. Les expériences sur plusieurs datasets publics confirment que le modèle maintient la précision sur les scènes passées tout en s'adaptant aux nouvelles. L'enjeu industriel est réel : un bras manipulateur recalibré pour une nouvelle cellule de production ne devrait pas perdre sa précision sur les postes précédents. C'est le problème quotidien des intégrateurs qui déploient des robots dans des lignes flexibles ou multi-produits. La plupart des approches actuelles imposent soit un recalibrage complet à chaque changement de scène, soit acceptent une dégradation progressive des performances sur les configurations antérieures. Ce travail propose une voie intermédiaire via l'apprentissage continu structuré, sans recourir à un replay naïf qui ne suffit pas à enrayer l'oubli. L'approche par distillation duale est notamment pertinente car elle distingue deux types d'erreur, positionnement global et précision locale, ce que les méthodes monolithiques ne font pas. Ce travail s'inscrit dans un champ de recherche en forte activité depuis 2022, où la robustesse de la calibration visuelle en conditions réelles est identifiée comme l'un des goulots d'étranglement pour le passage à l'échelle des manipulateurs autonomes. La localisation visuelle pour la calibration main-oeil emprunte aux techniques de Visual Place Recognition (VPR) et de relocalisation utilisées en navigation mobile, mais les contraintes de précision sous-millimétrique propres à la manipulation y ajoutent une difficulté spécifique. Parmi les acteurs qui travaillent sur des problèmes adjacents figurent des équipes comme Physical Intelligence (pi) avec Pi-0, ou des laboratoires comme le Stanford AI Lab et ETH Zurich sur la sim-to-real calibration. En France, des acteurs comme Enchanted Tools et Pollen Robotics, qui développent des plateformes d'interaction physique, sont directement concernés par ce type de verrou. La prochaine étape naturelle pour ce framework serait une validation sur des données industrielles réelles et une intégration dans des pipelines de déploiement multi-cellules, que les auteurs n'ont pas encore annoncée.

UEEnchanted Tools et Pollen Robotics, qui développent des plateformes de manipulation physique en France, sont directement concernés par ce verrou de calibration continue, susceptible de réduire les coûts de redéploiement en production flexible.

RecherchePaper
1 source