Aller au contenu principal

Dossier arXiv cs.RO — page 28

2609 articles · page 28 sur 53

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

1351arXiv cs.RO RechercheActu

Réduction de la redondance temporelle pour une inférence VLA efficace

Des chercheurs publient sur arXiv (arXiv:2607.12287v1) une méthode d'accélération pour les modèles Vision-Language-Action (VLA), utilisés en manipulation robotique, dont la latence d'inférence freine aujourd'hui le déploiement en temps réel. Ils identifient deux sources de redondance temporelle dans les pipelines VLA existants : le réencodage visuel complet de trames vidéo consécutives quasi identiques, et l'échantillonnage itératif multi-étapes propre aux politiques d'action basées sur la diffusion. Leur réponse combine deux optimisations système. Côté perception, seuls les tokens correspondant aux régions dynamiques de la scène sont mis à jour de façon incrémentale, au lieu de réencoder l'image entière à chaque frame. Côté génération d'action, le calendrier de diffusion est compressé à seulement deux étapes grâce à un entraînement spécifiquement optimisé pour l'efficacité, sans sacrifier la précision des gestes. Testée sur les bancs d'essai simulés Libero et RobotWin ainsi que sur des plateformes robotiques réelles, la méthode obtient un gain de vitesse supérieur à 2x, avec un taux de réussite allant jusqu'à 98% sur des benchmarks de manipulation générale. Le code doit être publié sur GitHub, mais n'est pas encore disponible : il s'agit pour l'instant d'un preprint académique, pas d'un produit livré. Pour les intégrateurs et les équipes robotique, ce travail s'attaque à un goulot d'étranglement bien réel : les politiques de diffusion, très précises, restent lentes à cause du débruitage itératif, ce qui complique leur usage sur du matériel embarqué à budget de calcul limité. Réduire ce coût sans perte de performance rapproche les VLA d'un fonctionnement temps réel sur GPU embarqué plutôt que sur infrastructure cloud dédiée, un enjeu central pour la commercialisation des bras manipulateurs et des humanoïdes. Cette publication s'inscrit dans une vague plus large de travaux visant l'efficacité d'inférence des VLA, alors que des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) ont démontré de fortes capacités de généralisation mais souffrent des mêmes limites de latence. La méthode reste pour l'instant validée en simulation et sur bancs de test restreints ; sa robustesse à grande échelle, en environnement industriel réel, reste à démontrer une fois le code effectivement publié.

1 source
1352arXiv cs.RO 

ChunkFlow : vers un apprentissage de politique par segments cohérents en continuité

Les tetes d'action par blocs ("chunks") sont devenues un standard pour les modeles vision-langage-action (VLA) qui doivent respecter des contraintes temps reel, mais elles souffrent d'un defaut connu: le "boundary jitter", des predictions incoherentes dans les zones de chevauchement entre deux chunks consecutifs, ce qui degrade la fluidite des mouvements et le taux de reussite des taches. Un article publie sur arXiv (2607.12992) presente ChunkFlow, un framework d'entrainement et d'execution qui s'attaque directement a ce probleme. La methode decoupe chaque chunk en trois zones, gelee, editable et future, applique un melange deterministe des chevauchements au moment de l'execution, et entraine les predictions brutes avec des fonctions de perte de continuite de premier et second ordre, plus une perte specifique de "couture" entre segments. Une corruption controlee de l'historique et un echantillonnage programme renforcent la robustesse face aux erreurs deja executees, et une phase de fine-tuning par AWAC adapte ensuite la politique sans effacer ces contraintes structurelles. Les auteurs montrent, sous hypotheses de regularite, que l'ecart de couture avant melange decroit mathematiquement quand le chevauchement augmente. Pour les integrateurs et ingenieurs travaillant sur des politiques robotiques, ce travail cible un angle mort frequent des VLA a chunks: les methodes existantes de melange a l'inference se contentent de reponderer des propositions divergentes sans corriger l'erreur sous-jacente, ce qui accumule le bruit au fil de l'execution. Si les resultats se confirment au-dela des benchmarks academiques, ChunkFlow offrirait un moyen de gagner en stabilite temporelle sans sacrifier la latence, un compromis central pour tout deploiement en boucle fermee sur du materiel reel. L'evaluation reste toutefois principalement academique: elle s'appuie sur les benchmarks simules CALVIN et LIBERO, completes par des tests sur robots reels dont l'ampleur n'est pas precisee dans le resume. Aucune entreprise commerciale n'est nommee, la page projet est hebergee sous un compte "cytoderm-ai" sans affiliation explicite. La problematique rejoint neanmoins les enjeux des architectures a chunks deja deployees par des acteurs comme Pi-0, GR00T N2 ou Helix, qui devront a terme arbitrer entre reactivite temps reel et coherence des trajectoires.

RechercheActu
1 source
1353arXiv cs.RO 

Adaptation planificateur : apprentissage adaptatif des paramètres par modèle vision-langage-action

Article sur l'apprentissage adaptatif de paramètres de planification pour la navigation robotique. Des chercheurs ont présenté APPLV (Adaptive Planner Parameter Learning from Vision-Language-Action Model), une méthode qui utilise un modèle vision-langage pré-entraîné doté d'une tête de régression pour prédire les paramètres de configuration de planificateurs classiques de navigation, plutôt que de générer directement des actions comme le font les modèles VLA traditionnels. Deux stratégies d'entraînement ont été développées : un apprentissage supervisé à partir de trajectoires de navigation collectées, puis un affinage par apprentissage par renforcement pour optimiser davantage les performances. L'équipe a évalué APPLV sur plusieurs planificateurs de mouvement via le jeu de données simulé BARN (Benchmark Autonomous Robot Navigation), ainsi que lors d'expériences sur robot physique. Les résultats montrent qu'APPLV surpasse les méthodes existantes à la fois en performance de navigation et en capacité de généralisation à des environnements non vus durant l'entraînement. Cette avancée s'attaque à un problème concret pour les intégrateurs de robotique mobile : la navigation dans des espaces fortement contraints. Les approches classiques de navigation, bien que sûres, nécessitent un réglage manuel et fastidieux des paramètres pour chaque nouvel environnement, tandis que l'apprentissage de bout en bout contourne ce réglage mais échoue souvent sur le contrôle précis requis en espace confiné. APPLV se positionne dans une troisième voie déjà explorée par des travaux récents en robot learning, qui automatisent le réglage des paramètres tout en conservant les garanties de sécurité des systèmes classiques, mais qui peinaient jusqu'ici à généraliser à des environnements inédits. En s'appuyant sur les capacités de compréhension de scène des modèles fondation, APPLV cherche aussi à répondre aux limites connues des VLA appliqués à la navigation : latence d'inférence et manque de précision dans le contrôle, deux obstacles qui freinent leur déploiement industriel réel. Le travail s'inscrit dans la lignée des recherches sur les modèles Vision-Language-Action (VLA) appliqués à la robotique mobile, un domaine où la promesse de généralisation via les modèles fondation se heurte régulièrement à la réalité du contrôle bas niveau. En choisissant de faire prédire des paramètres de planificateur plutôt que des actions brutes, les auteurs combinent l'interprétabilité et la sécurité des planificateurs classiques avec la capacité d'adaptation contextuelle des modèles vision-langage. Le papier, une version révisée (v2) déposée sur arXiv, ne précise pas d'acteur industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, dont la portée pratique dépendra de futurs travaux de validation sur des flottes robotiques réelles et de comparaisons plus larges avec d'autres architectures de navigation apprise.

RechercheOpinion
1 source
1354arXiv cs.RO 

Trajectoire et certification pour bras robotiques à 3 degrés de liberté par élimination réelle de quantificateurs sur bases de Gröbner comprehensives

Cet été, une équipe de recherche en calcul formel publie sur arXiv un algorithme de planification de trajectoire et de certification pour bras manipulateurs à 3 degrés de liberté (DOF), fondé sur l'élimination réelle de quantificateurs appliquée à des systèmes de Gröbner complets, méthode désignée CGS-QE. Concrètement, pour chaque point de la trajectoire de l'effecteur terminal, le problème de cinématique inverse est habituellement résolu en recalculant une base de Gröbner, une opération coûteuse en temps de calcul répétée à chaque étape. Les auteurs évitent ce recalcul systématique en construisant un système de Gröbner complet paramétrique, où les coordonnées de l'effecteur terminal sont traitées comme des paramètres plutôt que recalculées point par point. La méthode va plus loin : elle certifie mathématiquement qu'une solution de cinématique inverse existe en tout point d'une trajectoire donnée, y compris pour des trajectoires composées de segments de droite et de splines cubiques naturelles. L'algorithme a été implémenté dans le système de calcul formel Risa/Asir. L'intérêt pour l'industrie robotique tient moins à une démonstration spectaculaire qu'à un changement de nature de la garantie apportée. Les approches numériques ou par échantillonnage, largement utilisées pour valider la faisabilité d'une trajectoire, ne prouvent l'existence d'une solution qu'aux points testés, laissant planer un doute entre les échantillons. Une certification formelle, dérivée de l'algèbre symbolique plutôt que de simulations, offre une garantie continue sur toute la trajectoire, un atout pour les intégrateurs de bras robotiques dans des contextes où la sécurité ou la fiabilité du mouvement doit être prouvée et non simplement observée en test. Le gain d'efficacité annoncé par les auteurs reste toutefois à confirmer sur des cas industriels réels, l'article se limitant à des manipulateurs à 3 DOF, en deçà de la complexité des bras à 6 ou 7 DOF couramment déployés en production. Cette approche s'inscrit dans une lignée de recherche en calcul formel qui applique les bases de Gröbner et l'élimination de quantificateurs à la cinématique des robots, un domaine historiquement dominé par les méthodes numériques itératives. Le choix de Risa/Asir, système de calcul formel japonais utilisé en recherche académique, situe ce travail du côté théorique plutôt que produit. Les auteurs évoquent une extension possible à des trajectoires plus complexes, sans calendrier ni partenariat industriel annoncé à ce stade.

RecherchePaper
1 source
1355arXiv cs.RO 

Synthèse automatisée de mécanismes faciaux pour robots animatroniques conversationnels

Le laboratoire de recherche à l'origine de ce travail (affilié à un article arXiv publié le 14 juillet 2026, référence 2607.11688) propose un système d'automatisation de la conception mécanique des visages animatroniques. Aujourd'hui, chaque robot conversationnel à visage expressif nécessite une refonte mécanique manuelle complète adaptée à sa géométrie faciale, un processus lent et coûteux qui bloque toute personnalisation à grande échelle. Les chercheurs introduisent un template mécanique paramétrique à liaisons (linkage-driven), dont la topologie et la disposition des actionneurs sont explicitement paramétrées pour s'adapter à des morphologies faciales très différentes. Leur algorithme hiérarchique part d'un simple portrait 2D en entrée, reconstruit un visage cible en 3D, puis génère automatiquement un mécanisme interne sans collision et manufacturable, en combinant des volumes de mouvement anatomiquement contraints, des objectifs d'expressivité dérivés des Action Units (le système de codage des mouvements musculaires faciaux) et une boucle de raffinement pilotée par la détection de collisions. Le système inclut aussi un module de synthèse de mouvement facial conversationnel, capable de modéliser à la fois les comportements de locuteur et d'auditeur à partir de l'audio, pour produire des animations 3D temporellement cohérentes et exécutables en temps réel sur le matériel physique. Cette approche s'attaque à un goulot d'étranglement industriel réel: la fabrication de têtes animatroniques reste aujourd'hui un métier d'artisan, où chaque nouveau visage (mascotte, avatar de service client, robot de recherche en interaction sociale) exige des semaines de conception mécanique sur mesure. Automatiser la génération du mécanisme à partir d'une simple photo change la donne pour les intégrateurs qui veulent déployer des robots à visage humain à plus grande échelle, sans multiplier les coûts d'ingénierie par le nombre de morphologies souhaitées. Le second apport, le passage d'un visage qui parle ou écoute passivement à un système bidirectionnel capable de gérer un dialogue multi-tours, répond à une limite connue des robots sociaux actuels: la plupart affichent des expressions scriptées ou réactives, mais peinent à maintenir une cohérence temporelle crédible sur un échange complet. Les auteurs eux-mêmes cadrent cela comme une évolution nécessaire vers des visages mécaniques déployés en volume, et non comme une simple démonstration technique isolée. Le travail se positionne dans la lignée des recherches en robotique sociale et en animatronique, un domaine historiquement dominé par des réalisations artisanales (parcs à thème, prototypes académiques comme les têtes expressives développées dans plusieurs laboratoires universitaires) plutôt que par des méthodes de conception généralisables. Les auteurs valident leur système par des expériences quantitatives sur la synthèse automatique de mécanismes pour des géométries faciales variées, des comparaisons directes contre la conception manuelle classique, des benchmarks de synthèse de mouvement conversationnel avec déploiement temps réel, et des études utilisateur perceptuelles évaluant la crédibilité des expressions générées. L'article ne précise pas de partenaire industriel ni de calendrier de commercialisation, ce qui le situe pour l'instant au stade de la recherche méthodologique plutôt que du produit prêt à déployer. Aucun acteur français ou européen n'est mentionné dans ce travail.

RecherchePaper
1 source
1356arXiv cs.RO 

CR-Solver : solveur cinématique accéléré par GPU pour robots continuum à câbles tendineux

Une équipe de recherche présente CR-Solver, un solveur cinématique en deux étapes destiné à la génération de mouvement pour les robots à structure continue actionnés par câbles (tendon-driven continuum robots). Publié sur arXiv le 14 juillet 2026, l'outil repose sur une optimisation non linéaire contrainte qui unifie en un seul cadre la cinématique inverse, le suivi de trajectoire et la planification de chemin. Sa particularité technique est l'accélération GPU du calcul parallèle, qui permet de résoudre ces problèmes d'optimisation nettement plus vite que les solveurs CPU classiques. Testé sur trois tâches de validation, CR-Solver atteint un taux de réussite supérieur à 95% avec une précision de l'ordre du millimètre. L'implémentation est entièrement écrite en Python, un choix assumé par les auteurs pour abaisser la barrière technique à l'adoption plutôt que viser la performance brute d'un langage compilé. L'enjeu dépasse la simple prouesse algorithmique. Les robots continus, souples et hautement dexterous, sont de plus en plus utilisés pour la navigation et la manipulation en environnements confinés ou non structurés, par exemple en chirurgie mini-invasive ou en inspection industrielle. Or la quasi-totalité des bibliothèques de planification de mouvement existantes reposent sur des hypothèses de corps rigides, inadaptées à la déformation continue de ces manipulateurs. CR-Solver comble ce vide en offrant un outil pratique, rapide et open à la communauté, ce qui pourrait accélérer le déploiement de ces robots hors du seul cadre du laboratoire, là où le manque d'outils logiciels robustes freinait jusqu'ici leur industrialisation. Le papier s'inscrit dans une dynamique de recherche plus large sur la robotique molle et les systèmes hyper-redondants, où le calcul en temps réel de la cinématique inverse reste un verrou majeur faute de modèles analytiques simples. En misant sur le GPU plutôt que sur des solveurs CPU traditionnels ou des approximations analytiques, les auteurs positionnent leur approche comme une alternative extensible aux méthodes existantes, sans toutefois préciser de calendrier de mise à disposition publique du code ni de partenariat industriel à ce stade.

RecherchePaper
1 source
D-CLIPSE : localisation par consensus distribué avec écoute passive sur échange d'état partagé
1357arXiv cs.RO 

D-CLIPSE : localisation par consensus distribué avec écoute passive sur échange d'état partagé

Le nom complet du papier est D-CLIPSE, pour "Distributed Consensus-based Localization with Passive Listening on Shared State Exchange" (arXiv:2607.07995v1). Il s'agit d'un nouveau cadre de filtrage distribué pour la localisation multi-robots, conçu pour rester cohérent (au sens statistique du terme) tout en limitant la charge de communication entre robots. Le principe: chaque robot embarque son propre filtre et estime à la fois son état et celui de ses voisins, en échangeant de l'odométrie préintégrée ainsi que des états partagés pertinents via communication inter-robot. Contrairement à une architecture centralisée qui fusionnerait de façon optimale toutes les mesures de capteurs de l'équipe mais qui reste rarement viable en pratique (contraintes matérielles, de bande passante et de puissance de calcul), D-CLIPSE cherche à s'en approcher sans passer par un nœud central. Les auteurs valident leur méthode à la fois en simulation et lors d'expériences réelles, avec des résultats de précision et surtout de cohérence proches d'une solution centralisée. L'enjeu dépasse la simple prouesse académique: la localisation multi-robots est un prérequis direct pour la planification de trajectoire et le contrôle dans toute flotte coordonnée, qu'il s'agisse d'AMR en entrepôt, d'essaims de drones ou de robots d'inspection travaillant en équipe. Le problème classique des filtres décentralisés est la sous-estimation de l'incertitude quand les mêmes informations sont comptées plusieurs fois dans le réseau, ce qui rend les estimations de position trop confiantes et potentiellement dangereuses pour la prise de décision en aval. En visant explicitement la cohérence statistique en plus de la précision, et en réduisant le volume de données échangées entre robots, D-CLIPSE s'attaque directement à ce qui limite aujourd'hui le déploiement de flottes robotiques réellement décentralisées à grande échelle, sans dépendre d'une infrastructure de calcul centrale fragile ou coûteuse en latence. Le papier se positionne explicitement contre l'état de l'art actuel des approches décentralisées, dont il revendique dépasser les performances en cohérence tout en restant efficace en communication, un compromis que la littérature peine généralement à tenir simultanément. Les approches distribuées existantes s'appuient typiquement sur des variantes de filtres de Kalman étendus ou des méthodes d'intersection de covariance pour éviter le double comptage d'information, souvent au prix d'une dégradation de précision ou d'un surcoût de calcul. En publiant à la fois des résultats simulés et expérimentaux, les auteurs cherchent à démontrer une applicabilité concrète plutôt qu'un simple gain théorique, ouvrant la voie à des tests sur des flottes physiques plus larges et à une intégration potentielle dans des piles de navigation multi-robots existantes.

RecherchePaper
1 source
Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus
1358arXiv cs.RO 

Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus

Des chercheurs présentent HumoSlope, un framework d'apprentissage par renforcement en deux étapes conçu pour la locomotion humanoïde sur pentes raides, détaillé dans un article publié sur arXiv (référence 2607.07830v1). Le constat de départ : avec des formulations de récompense génériques, les politiques de RL convergent souvent vers des démarches lentes et prudentes, en position accroupie et centre de masse abaissé, pour compenser le biais gravitationnel constant imposé par un terrain incliné. La première étape du framework introduit un régularisateur ZMP (Zero Moment Point) adapté à la pente, évalué directement sur le plan de support incliné local plutôt que sur une référence horizontale globale, ce qui établit un a priori d'équilibre cohérent avec le terrain. La seconde étape, baptisée Biomechanical Slope Gait Adapter (BSGA), exploite des descripteurs macroscopiques du terrain comme signaux privilégiés, disponibles uniquement à l'entraînement, pour moduler dynamiquement la hauteur du centre de masse et la coordination des membres inférieurs selon la géométrie de pente estimée, favorisant une propulsion dominée par la hanche en montée et un freinage piloté par le genou en descente. Point notable : l'acteur finalement déployé reste entièrement proprioceptif, sans capteur extéroceptif embarqué. Les essais sim-to-real ont permis une traversée aveugle et continue de pentes herbeuses extérieures atteignant 62,7 % d'inclinaison, soit 32,1 degrés. L'intérêt principal tient à la démonstration qu'un contrôle purement proprioceptif, sans vision ni LiDAR embarqués, peut gérer des pentes extrêmes en conditions réelles extérieures, réduisant la dépendance à une perception embarquée coûteuse et fragile hors environnement contrôlé. Le résultat contredit aussi l'idée qu'un RL générique suffit : sans priors physiques et biomécaniques explicites, les politiques dégénèrent vers des démarches accroupies sous-optimales. Pour les acteurs de l'humanoïde, dont la plupart des déploiements actuels restent cantonnés aux sols plats d'usine ou d'entrepôt, ce travail pointe une voie concrète pour élargir la robustesse en terrain extérieur non structuré, une faiblesse encore largement non résolue du secteur. La locomotion humanoïde par apprentissage par renforcement a fortement progressé ces dernières années sur terrains plats ou discrets, marches et escaliers notamment, mais les pentes raides restent un axe peu exploré comparé à d'autres défis comme les obstacles ou les terrains accidentés. Aucune plateforme robotique commerciale n'est nommée dans l'article, qui reste à ce stade une contribution de recherche validée en simulation puis en conditions réelles. Les suites naturelles évoquées incluent l'intégration à des piles de contrôle plus larges et des tests sur d'autres surfaces comme la neige, le gravier ou la boue.

RecherchePaper
1 source
Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense
1359arXiv cs.RO 

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense

Des chercheurs ont publié une nouvelle version (v2) de l'article arXiv 2407.09016, qui présente OVExp, un framework d'exploration en vocabulaire ouvert pour la navigation robotique vers des objets-cibles non catégorisés au préalable. Le système s'appuie sur des modèles Dense CLIP pour généraliser la cartographie sémantique, sans recourir à l'inférence coûteuse de grands modèles de langage (LLM) ni à un entraînement intensif par apprentissage par renforcement (RL) de bout en bout. L'innovation centrale est une stratégie de transfert cross-modal sur cartographie sémantique : le réseau apprend d'abord uniquement à partir de texte, puis transfère ces représentations, au moment du test, vers une cartographie multimodale combinant localisation spatiale précise des objets et représentations visuelles généralisables. Les auteurs annoncent une généralisation robuste vers des objets-cibles inédits, validée sur les benchmarks établis d'ObjectNav, malgré un entraînement reposant sur des mises en page textuelles limitées en nombre d'objets. Pour l'industrie robotique et les intégrateurs, ce travail cible un problème concret de coût et de latence : les approches actuelles de navigation en vocabulaire ouvert, qui appellent un LLM à chaque décision ou nécessitent des heures d'entraînement RL par environnement, restent difficiles à déployer à grande échelle sur des robots mobiles autonomes (AMR) ou des plateformes d'inspection. En montrant qu'un réseau de prédiction d'objectifs basé sur une carte sémantique peut généraliser sans réentraînement lourd ni appel LLM en boucle, OVExp propose une alternative aux architectures VLA gourmandes en ressources, ce qui intéresse directement tout acteur cherchant à doter des robots de capacités de recherche d'objets flexibles sans exploser les coûts d'inférence en production. Ce travail s'inscrit dans la lignée des recherches sur ObjectNav, la tâche de navigation vers un objet-cible désigné par catégorie ou par image dans un environnement inconnu, un benchmark phare de la navigation embarquée depuis plusieurs années. Il se positionne face à deux familles de méthodes concurrentes : celles qui exploitent des LLM sans entraînement supplémentaire pour raisonner sur la scène, coûteuses en inférence, et celles qui affinent des politiques par RL de bout en bout, limitées en généralisation hors distribution. En s'appuyant sur CLIP, déjà largement utilisé pour l'ancrage vision-langage, et sur un entraînement texte-seul transférable au moment du test, les auteurs proposent une voie plus économe en ressources. Publié en v2 sur arXiv, l'article reste à ce stade une contribution académique évaluée en simulation, sans annonce de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source
StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast
1360arXiv cs.RO 

StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast

Chercheurs présentent StreamVLN, un framework de navigation vision-langage (VLN) conçu pour fonctionner en flux continu plutôt que sur des séquences vidéo pré-découpées. Publié sur arXiv (version 2, remplaçant une première mouture du 05/07/2025 sous la référence 2507.05240), le système repose sur une architecture dite "slow-fast" : un contexte de dialogue rapide gère une fenêtre glissante d'échanges multi-tours pour générer des actions avec une latence minimale, tandis qu'une mémoire à mise à jour lente compresse l'historique visuel via une stratégie d'élagage de tokens tenant compte de la géométrie 3D de la scène. Grâce à la réutilisation du cache KV, StreamVLN maintient des dialogues en temps réel sur des flux vidéo longs, avec une taille de contexte et un coût d'inférence bornés, quelle que soit la durée du flux. Sur les benchmarks VLN-CE, référence du domaine pour évaluer la navigation guidée par instructions en environnement continu, les auteurs revendiquent des performances état de l'art combinées à une faible latence. L'enjeu dépasse la simple performance sur benchmark : les modèles vidéo-LLM appliqués à la navigation robotique butent généralement sur un compromis entre compréhension visuelle fine, mémorisation du contexte long terme et coût de calcul, un compromis qui freine leur déploiement embarqué sur robots mobiles ou humanoïdes à ressources limitées. En bornant le coût d'inférence indépendamment de la longueur du flux vidéo, StreamVLN répond directement à un obstacle pratique du secteur : faire tourner un agent VLA (vision-language-action) en continu, sans dérive de latence ni explosion mémoire, condition nécessaire pour une navigation autonome réactive en environnement réel plutôt qu'en simulation contrôlée ou sur clips vidéo courts. Le travail s'inscrit dans la lignée des approches VLN basées sur des Video-LLM apparues ces deux dernières années, qui cherchaient à exploiter les capacités de raisonnement multimodal de ces modèles pour l'instruction-following robotique, au prix jusqu'ici d'architectures gourmandes en contexte. La publication d'une version 2 sur arXiv indique une itération après retours ou revue, sans changement de statut : il s'agit toujours d'un travail de recherche, avec code et démonstrations disponibles sur la page projet (streamvln.github.io), et non d'un produit ou d'un déploiement industriel annoncé. La suite logique pour ce type d'approche reste son intégration et sa validation sur plateformes robotiques physiques, au-delà des benchmarks simulés VLN-CE.

RechercheActu
1 source
Adaptation de la planification avec pensées vision-langage entrelacées
1361arXiv cs.RO 

Adaptation de la planification avec pensées vision-langage entrelacées

Une équipe de recherche présente APIVOT (Adaptive Planning with Interleaved Vision-Language Thoughts), un planificateur pour robots basé sur un modèle vision-langage (VLM), détaillé dans un article publié sur arXiv le 8 juillet 2026 (référence 2607.08024v1). Le système cible la planification à long horizon, c'est-à-dire des tâches robotiques composées de plusieurs étapes successives, comme des scénarios de cuisine impliquant la manipulation d'objets dans un espace contraint. Sa particularité est d'alterner de façon adaptative entre deux types de raisonnement: du texte pour décomposer les objectifs, sélectionner les objets pertinents et séquencer les actions, et des représentations visuelles générées pour imaginer les états futurs de la scène et vérifier en interne si un plan est géométriquement réalisable, notamment en cas d'espace libre limité ou de risque de collision entre objets. Sur des tâches de cuisine à long horizon, APIVOT surpasse à la fois des VLM généralistes et les frameworks de planification existants, avec l'écart de performance le plus marqué dans les environnements les plus contraints spatialement. Ce résultat s'inscrit dans un débat central pour l'industrie robotique: les modèles vision-langage-action (VLA) et les grands VLM généralistes savent-ils vraiment raisonner sur la géométrie d'une scène, ou se contentent-ils d'un raisonnement sémantique de surface qui échoue dès que l'espace se complique. En montrant qu'un module de vérification visuelle interne améliore concrètement le taux de succès et l'efficacité du raisonnement, APIVOT apporte un argument en faveur d'architectures hybrides plutôt que de VLM purement textuels pour la planification robotique, un enjeu direct pour les intégrateurs qui déploient des bras ou robots mobiles autonomes dans des environnements encombrés. L'article se positionne explicitement par rapport aux VLM généralistes et aux frameworks de planification antérieurs, utilisés comme lignes de base de comparaison, sans toutefois nommer de plateforme robotique commerciale précise ni d'acteur industriel. Il s'agit à ce stade d'une contribution de recherche évaluée en simulation ou en environnement contrôlé de cuisine, sans indication de déploiement produit ni de partenariat industriel annoncé; les auteurs présentent le "modality selection" adaptatif comme la piste principale à explorer pour les futurs systèmes de planification robotique.

RecherchePaper
1 source
LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré
1362arXiv cs.RO 

LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré

Des chercheurs présentent LHM-Humanoid, un système de contrôle physique pour humanoïdes simulés capable d'enchaîner en continu des cycles complets de collecte, transport et dépôt d'objets, sans réinitialisation entre chaque cycle. L'approche a été testée sur 350 configurations de pièces encombrées, réparties en quatre types d'environnements. Elle repose sur deux contrôleurs conditionnés par objectif : le premier exécute le cycle « aller chercher, porter, déposer » et apprend un comportement de relâchement et de retrait pour terminer dans un état récupérable ; le second prend ensuite le relais depuis cette distribution d'états. Les deux sont régularisés par un a priori de mouvement adversarial, puis distillés en une seule politique capable d'exécuter toute la séquence en un unique passage continu, sans reset. Les travaux, publiés sur arXiv (2508.16943v3, version révisée), montrent des performances nettement supérieures à celles du RL de bout en bout, du RL hiérarchique et des méthodes antérieures d'interaction humain-scène. Le problème central n'est pas la marche, le levage ou le dépôt pris isolément, ces briques sont déjà bien maîtrisées en simulation, mais la transition entre cycles : chaque dépôt laisse le personnage dans une posture déséquilibrée non canonique, où l'apprentissage par renforcement de bout en bout échoue généralement. En traitant ce passage de relais comme un problème de récupérabilité à double contrainte, préserver l'objet tout juste posé tout en atterrissant dans un état permettant une reprise équilibrée, l'équipe s'attaque à un angle mort classique du secteur : la plupart des démonstrations de robotique humanoïde restent des clips courts réinitialisés entre chaque prise, loin des scénarios de production continue visés en logistique ou en usine. Pour les chercheurs et intégrateurs, ce résultat éclaire un vrai obstacle vers l'autonomie longue durée, plutôt qu'une simple performance ponctuelle sur une tâche isolée. Ces travaux s'inscrivent dans le champ du contrôle de mouvement humain basé sur la physique, orienté simulation et réalisme biomécanique, à distinguer des approches VLA appliquées à du matériel réel comme Pi-0 ou GR00T N2, qui elles ciblent le transfert sim-to-real sur robot physique. LHM-Humanoid demeure pour l'instant un résultat purement simulé, validé sur scènes connues et inédites, sans mention de déploiement sur plateforme réelle. La suite logique consisterait à transposer cette stratégie de transition récupérable vers des humanoïdes physiques, à l'image de ceux développés par Figure, Tesla ou Boston Dynamics, où l'enchaînement sans interruption de tâches de manutention reste aujourd'hui un défi ouvert pour l'industrie.

RecherchePaper
1 source
UniLM-Nav : un cadre unifié pour la navigation zero-shot du dernier kilomètre
1363arXiv cs.RO 

UniLM-Nav : un cadre unifié pour la navigation zero-shot du dernier kilomètre

Des chercheurs presentent UniLM-Nav, un framework unifie pour la navigation dite du dernier metre en manipulation mobile, capable de fonctionner en zero-shot sur du vocabulaire ouvert. Le probleme vise: un robot peut atteindre les abords d'un objet ou d'un meuble cible sans que sa position finale permette reellement de le manipuler. UniLM-Nav decompose la tache en trois etapes traitees par un seul modele multimodal de langage (MLLM): selection de la vue de reference parmi les observations recemment collectees, identification du point d'affordance pertinent pour la tache dans cette vue puis projection dans le repere du robot, et calcul d'une pose de base compatible avec sa geometrie. Sur le benchmark OVMM, la methode depasse l'etat de l'art precedent, MoTo, de 3,13 points de pourcentage. Les auteurs ont aussi teste le systeme sur un robot reel, un quadrupede Unitree B2 equipe d'un bras manipulateur Unitree Z1 a 6 degres de liberte (DoF), validant l'approche au-dela de la simulation. Ce travail s'attaque a un maillon souvent neglige de la manipulation mobile: s'approcher d'une cible ne suffit pas si la pose finale rend la prise instable ou impossible. Les methodes existantes reglaient ce probleme via une annotation manuelle des poses ou un entrainement specifique a chaque tache, deux approches couteuses qui passent mal a l'echelle en vocabulaire ouvert. En s'appuyant sur un MLLM partage pour resoudre selection de vue, ancrage d'affordance et raisonnement geometrique, UniLM-Nav illustre une tendance de fond: les grands modeles multimodaux remplacent progressivement des modules geometriques specialises construits a la main. Les auteurs notent que le choix du MLLM sous-jacent a un effet substantiel sur la performance, un point a surveiller pour tout integrateur voulant reproduire l'approche. Le passage de la simulation a un robot physique reduit un peu l'ecart persistant entre demonstrations en laboratoire et deploiement reel qui marque encore la recherche en robotique mobile. Le probleme du dernier metre est identifie de longue date dans la litterature sur la manipulation mobile, la plupart des pipelines de navigation s'arretant a une proximite grossiere de la cible sans garantir une pose exploitable pour le bras. La comparaison avec MoTo, presente comme la reference precedente sur OVMM (Open Vocabulary Mobile Manipulation), situe UniLM-Nav dans une lignee de travaux visant a generaliser la manipulation mobile a des objets et environnements non vus a l'entrainement. Le choix du materiel de validation, un quadrupede associe a un bras a 6 DoF, s'inscrit dans une tendance plus large a coupler locomotion a pattes et manipulation pour des environnements non structures. Publie sur arXiv (2607.06537), l'article ne mentionne aucun calendrier de commercialisation: il s'agit a ce stade d'une contribution de recherche, dont la reproduction sur d'autres plateformes testera sa robustesse au-dela du benchmark.

RecherchePaper
1 source
WristMimic : contrôle corps entier de l'humanoïde par manipulation guidée au poignet
1364arXiv cs.RO 

WristMimic : contrôle corps entier de l'humanoïde par manipulation guidée au poignet

Publié en juillet 2026 sur arXiv, WristMimic est un framework de contrôle corps entier pour robots humanoïdes qui transfère des démonstrations humaines de manipulation vers une simulation physique. Plutôt que de suivre intégralement la pose de la main, la méthode sépare le corps et le poignet, guidés cinématiquement, des doigts, qui apprennent leurs gestes de préhension à partir du suivi de l'objet et du résultat des contacts. Le poignet sert de charnière entre les deux régimes : peu soumis aux forces de contact, il reste suivable fidèlement tout en plaçant la main dans une configuration de prise atteignable. Des contraintes de réinitialisation et une priorisation des récompenses au poignet fiabilisent ce positionnement ; les auteurs annoncent des performances égales ou supérieures aux méthodes à supervision complète des doigts, avec un retargeting indépendant de la morphologie de la main. Le problème ciblé est connu en contrôle humanoïde : une trajectoire de main en position seule ne renseigne pas les forces de contact nécessaires à une prise réussie, et imposer un suivi complet des doigts tend à surcontraindre des comportements qui doivent rester riches en contacts, ce qui fragilise la manipulation fine. En découplant mouvement libre et manipulation, WristMimic s'inscrit dans la recherche sur l'imitation à grande échelle pour l'IA incarnée, sans dépendre d'une capture de main parfaite. Pour l'industrie, l'argument concret est qu'une approche agnostique à la morphologie de la main pourrait réduire le travail d'adaptation quand un intégrateur change de main dextérisée, un problème récurrent tant les architectures varient d'un fabricant humanoïde à l'autre. Ce travail s'inscrit dans la lignée des méthodes de contrôle guidé par la cinématique humaine pour humanoïdes, qui cherchent depuis deux ans à rapprocher téléopération et apprentissage par renforcement. L'abstract ne mentionne aucun déploiement sur robot réel ni partenariat industriel : il s'agit pour l'instant d'une validation en simulation, une contribution de recherche plutôt qu'un produit. Les suites logiques seraient une validation sur plateforme humanoïde physique et une comparaison avec les pipelines de téléopération des acteurs du secteur, qu'il s'agisse des humanoïdes commerciaux ou des modèles VLA généralistes comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
FORGE : généraliser l'utilisation fonctionnelle d'outils par raisonnement sur trajectoires de points clés
1365arXiv cs.RO 

FORGE : généraliser l'utilisation fonctionnelle d'outils par raisonnement sur trajectoires de points clés

Une équipe de recherche publie sur arXiv (arXiv:2607.05780) un système baptisé FORGE, conçu pour résoudre un problème concret de la robotique manipulatrice : un robot entraîné à utiliser un outil précis échoue généralement à transférer cette compétence à un objet différent partageant pourtant la même fonction, par exemple utiliser une pierre ou une chaussure pour planter un clou comme le ferait un humain. Les chercheurs ont testé plusieurs représentations intermédiaires (images d'affordance, vidéos de démonstration humaine, trajectoires de points-clés en 2D) et retiennent les trajectoires de points-clés comme le meilleur compromis entre expressivité fonctionnelle et capacité à être traduites en actions robotiques. FORGE fonctionne en deux étapes distinctes : d'abord prédire des trajectoires de points-clés génériques à partir de données sans action associée, puis les ancrer en commandes motrices concrètes grâce à un nombre limité de démonstrations. Sur un banc d'essai de sept outils dédié à une tâche de type "frapper pour enfoncer", la méthode dépasse les approches de référence sur des outils jamais vus, en simulation comme en conditions réelles, avec plus du double du taux de réussite moyen. Cette avancée cible un verrou connu des politiques d'apprentissage par imitation et des modèles vision-langage-action (VLA) : la plupart généralisent mal dès qu'un outil change de forme, même si sa fonction reste identique. Pour les intégrateurs qui envisagent des robots humanoïdes ou des bras manipulateurs en environnement non structuré, où l'outil disponible n'est pas toujours celui prévu, cette capacité d'improvisation fonctionnelle est un prérequis pour sortir de la démonstration contrôlée et aller vers un déploiement réel. FORGE s'inscrit dans une tendance de recherche plus large visant à découpler le raisonnement de haut niveau de l'exécution motrice, une logique que l'on retrouve dans des systèmes comme GR00T N2, Pi-0 ou Helix, qui cherchent tous à réduire la dépendance à des démonstrations robotiques coûteuses en s'appuyant sur des données vidéo ou des données sans action. Il s'agit ici d'un travail académique publié en préprint, sans partenaire industriel identifié ni déploiement annoncé : la prochaine étape logique serait d'étendre la validation au-delà de ce banc d'essai de sept outils vers des tâches de manipulation plus variées.

RecherchePaper
1 source
Accélération sans entraînement des modèles VLA par mise en cache et raffinement d'actions
1366arXiv cs.RO 

Accélération sans entraînement des modèles VLA par mise en cache et raffinement d'actions

Une équipe de recherche propose ActionCache, une méthode d'accélération sans réentraînement pour les modèles Vision-Language-Action (VLA) reposant sur le flow matching, publiée le 8 juillet 2026 sur arXiv (2607.06370). Ces modèles génèrent des séquences d'actions robotiques précises via un processus de débruitage itératif, mais cette étape constitue un goulot d'étranglement computationnel majeur pour un déploiement en temps réel. ActionCache fonctionne comme un cache externe "plug-and-play" qui réutilise des actions intermédiaires déjà calculées lors d'épisodes passés, en les indexant avec des clés multimodales compactes, pour amorcer la génération à proximité de l'action cible plutôt que de repartir de zéro. Les tests, menés en simulation et en conditions réelles, montrent que la méthode conserve des taux de réussite élevés tout en réduisant fortement la latence: jusqu'à 11,75 fois plus rapide sur le modèle $\pi{0.5}$ et 34,43 fois sur GR00T-N1.6. Pour l'industrie robotique, ce résultat s'attaque directement à l'un des freins les plus concrets à l'adoption des VLA en production: la latence d'inférence, qui limite aujourd'hui leur usage aux démonstrations plutôt qu'aux lignes de production ou à la manipulation en temps réel. Le fait que la technique soit sans réentraînement et compatible avec des architectures existantes (elle a été validée sur deux familles de modèles distinctes, $\pi{0.5}$ et GR00T-N1.6) la rend potentiellement intégrable rapidement par les équipes qui déploient déjà ces modèles, sans coût de calcul supplémentaire lié à un nouvel entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B suivant de près l'écart entre les capacités démontrées en laboratoire et la viabilité opérationnelle des VLA. Ce travail s'inscrit dans la montée en puissance des modèles VLA basés sur le flow matching, une famille popularisée par $\pi0$ et ses variantes chez Physical Intelligence, et concurrencée par GR00T de NVIDIA sur le terrain des modèles fondation pour la robotique généraliste. La comparaison directe entre $\pi{0.5}$ et GR00T-N1.6 positionne implicitement ActionCache comme une brique d'optimisation transversale plutôt que liée à un acteur unique. Publié en preprint, l'article ne précise pas encore de calendrier d'intégration industrielle ni de partenariat annoncé, mais ouvre la voie à des tests sur d'autres architectures VLA à mesure que ces modèles se rapprochent du déploiement en usine ou en entrepôt.

RechercheActu
1 source
IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM
1367arXiv cs.RO 

IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM

Un article de recherche arXiv (2603.20182v4) présente IndoorR2X, un benchmark et un framework de simulation pour la planification multi-robots pilotée par des grands modèles de langage (LLM), avec perception et communication de type "Robot-to-Everything" (R2X) en environnement intérieur. Le système combine les observations de robots mobiles avec celles de capteurs IoT statiques déjà présents dans de nombreux bâtiments, comme des caméras, pour construire un état sémantique global de la scène. Cette architecture permet une compréhension de l'environnement à l'échelle du bâtiment, dépassant ce qu'un seul robot ou même une flotte en communication robot-à-robot (R2R) peut percevoir. Le framework propose des environnements de simulation configurables, des dispositions de capteurs, des compositions d'équipes robotiques et des suites de tâches, afin d'évaluer systématiquement différentes stratégies de coordination sémantique via planification LLM. L'enjeu principal que cible IndoorR2X est un problème connu de la robotique multi-agents : la communication R2R seule ne résout pas l'observabilité partielle sans exploration coûteuse ou sans multiplier le nombre de robots déployés. En exploitant des capteurs IoT déjà installés (caméras de bâtiment notamment), l'approche réduit l'exploration redondante et améliore l'efficacité et la fiabilité de la coordination, selon les auteurs. Pour les intégrateurs et opérateurs de flottes AMR en entrepôt ou en environnement industriel, cela ouvre une piste concrète pour réduire les coûts d'infrastructure robotique en réutilisant l'instrumentation IoT existante plutôt que de multiplier les capteurs embarqués. Ce travail s'inscrit dans la vague de recherche récente combinant LLM et planification robotique multi-agents, où la coordination sémantique de haut niveau reste un défi ouvert face aux limites de perception embarquée. Il s'agit ici d'un outil de recherche et de benchmarking, pas d'un système commercial déployé : les auteurs eux-mêmes documentent les modes d'échec observés dans leurs expériences, signe que la coordination LLM-robots-IoT reste à un stade exploratoire. Le projet, dont le code et les détails sont disponibles sur une page dédiée, vise à devenir une référence pour comparer les futures stratégies de coordination sémantique entre robots et capteurs ambiants.

RecherchePaper
1 source
Réassignation de castes dans des essaims hétérogènes : protocole à confiance asymétrique et contresignature auditée
1368arXiv cs.RO 

Réassignation de castes dans des essaims hétérogènes : protocole à confiance asymétrique et contresignature auditée

Une équipe de recherche propose un protocole de gouvernance pour la réaffectation de rôles ("caste reassignment") au sein d'essaims de robots hétérogènes, décrit dans un article publié sur arXiv début juillet. Le principe : quand un robot change de capacité opérationnelle sous l'effet de la batterie, de la charge utile ou d'une priorité de mission, ce changement peut soit réduire ses privilèges (admis automatiquement), soit les élever (ce qui nécessite alors une contre-signature d'un opérateur humain, dans la limite d'un budget défini par axe). Chaque transition génère une chaîne de causalité signée, inscrite dans un journal d'audit structuré en Merkle et vérifiable hors ligne. Les chercheurs ont testé une implémentation de référence avec de vraies signatures Ed25519 sur des essaims allant jusqu'à 100 robots : les reclassements vers le bas s'exécutent en quelques millisecondes à basse dizaine de millisecondes, et le protocole bloque par construction quatre types d'attaques (usurpation de caste, escalade par relaxations répétées, usurpation d'identité d'opérateur, falsification de la chaîne de causalité). Un journal d'audit distribué, répliqué sur autant de nœuds que de membres de l'essaim avec ordre total par quorum, a aussi été validé en conditions réelles sur 100 processus distincts reliés par TCP, résistant à un nœud byzantin sans qu'aucune fourche ne se produise dans le journal. L'enjeu dépasse l'exercice académique : à mesure que les essaims de robots (logistique, inspection, défense civile) entrent dans des contextes réglementés, la question de savoir qui autorise un robot à gagner en autonomie ou en capacité devient un point de conformité, pas seulement d'ingénierie. Ce travail formalise une frontière claire entre décisions locales automatisées et décisions nécessitant une supervision humaine traçable, un sujet que les intégrateurs et responsables de flottes devront de plus en plus documenter face aux régulateurs. Le protocole généralise une approche déjà proposée pour la gouvernance d'un agent unique (mutation de persona) au niveau d'un essaim entier, en s'appuyant sur des briques classiques des systèmes distribués tolérants aux pannes byzantines. Les auteurs annoncent avoir isolé, via une base partiellement gouvernée, quel mécanisme de contrôle arrête quelle attaque précisément, ouvrant la voie à des audits de sécurité plus ciblés sur ce type d'architecture.

RecherchePaper
1 source
Manipulation robotique multi-incarnations via un espace d'action unifié pour la main
1369arXiv cs.RO 

Manipulation robotique multi-incarnations via un espace d'action unifié pour la main

Des chercheurs proposent l'Unified Hand Action Space (UHAS), une représentation d'action unifiée pour piloter des mains robotiques dexteres de morphologies différentes à partir d'un seul espace de commande. Le principe consiste à représenter les mouvements de la main comme des déformations géométriques d'une sphère canonique, puis à utiliser un algorithme baptisé Cascade Inverse Kinematics (CIK) pour convertir cette représentation abstraite en configurations articulaires propres à chaque main. Les auteurs entraînent des politiques de manipulation par apprentissage par renforcement directement dans cet espace, sur une tâche de réorientation de cube en main. Le système est évalué en simulation et en conditions réelles sur quatre mains robotiques aux architectures distinctes: l'Allegro Hand (Wonik Robotics), la LEAP Hand (design open source), la Shadow Hand (Shadow Robot) et le modèle de main humaine MANO. Les résultats montrent un transfert zero-shot vers des mains non vues à l'entraînement et un réajustement rapide lors du passage d'une morphologie à l'autre. Le papier est publié en preprint sur arXiv, sans relecture par les pairs, et les chiffres de succès du "déploiement réel" ne sont pas détaillés dans le résumé, ce qui appelle à la prudence sur l'ampleur réelle des résultats. L'enjeu dépassé ici est celui du cross-embodiment, un des principaux verrous de l'apprentissage robotique: une politique de manipulation entraînée pour une main à quatre doigts ne se transfère généralement pas à une main à cinq doigts ou à un nombre d'articulations différent, obligeant à tout réentraîner à chaque nouveau design de préhenseur. Si l'approche tient ses promesses au-delà du cas d'usage testé, cela réduirait le coût de portage des politiques de manipulation dexterese entre fabricants de mains robotiques, un sujet clé pour les intégrateurs qui évaluent aujourd'hui des modèles VLA génériques cens

RecherchePaper
1 source
Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable
1370arXiv cs.RO 

Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable

Un nouvel article publié sur arXiv (référence 2607.03163v1) propose une méthode pour améliorer la manipulation robotique generalisable en dotant les nuages de points 3D d'une compréhension sémantique stable des parties fonctionnelles d'un objet, poignées, têtes d'outils, ouvertures, zones de préhension. Les nuages de points bruts capturent la géométrie mais pas la sémantique, et l'échantillonnage varie selon le point de vue, le capteur ou l'instance d'objet observée. Les auteurs introduisent un champ sémantique continu et centré sur l'objet, entraîné à partir de modèles d'objets annotés par parties, qui associe à toute position 3D interrogée un embedding sémantique conscient de la fonction de la partie concernée. Une fois entraîné, ce champ est figé et sert à générer des nuages de points sémantiques utilisés comme conditionnement au niveau de l'objet pour des politiques de manipulation. Les tests, menés sur les tâches de simulation RoboTwin ainsi que sur de la manipulation bimanuelle réelle, montrent une amélioration des performances par rapport aux approches de référence: nuage de points brut, lifting de features 2D vers la 3D, et features ponctuelles 3D discrètes. L'enjeu dépasse le simple gain de précision. Pour l'industrie de la manipulation robotique et les concepteurs de politiques de type VLA (vision-language-action), le vrai problème n'est pas de reconnaître un objet mais de savoir où et comment le saisir de façon fiable, quel que soit l'angle de vue ou l'exemplaire précis rencontré. En rendant la sémantique indépendante de l'échantillonnage observé, cette approche s'attaque directement à un point faible connu des pipelines actuels: la fragilité des indices sémantiques ponctuels quand la scène ou le capteur changent. C'est un argument de plus dans le débat sur la généralisation réelle des politiques de manipulation, un enjeu central alors que le secteur cherche à dépasser les démonstrations en environnement contrôlé. Ce travail s'inscrit dans la lignée des efforts pour enrichir la perception 3D en robotique, après les méthodes de projection de features 2D issues de modèles de vision-langage et les représentations ponctuelles 3D discrètes, deux approches dont l'article démontre les limites en comparaison directe. RoboTwin, la plateforme de simulation utilisée, sert de banc d'essai standard pour ce type d'évaluation comparative dans la communauté. Les auteurs mettent à disposition une page projet dédiée, laissant présager la publication du code et des modèles pour permettre une réplication et une adoption plus large par la communauté de recherche en manipulation robotique.

RecherchePaper
1 source
IndustryNav : explorer le raisonnement spatial des agents incarnés dans la navigation industrielle dynamique
1371arXiv cs.RO 

IndustryNav : explorer le raisonnement spatial des agents incarnés dans la navigation industrielle dynamique

Des chercheurs ont publié IndustryNav, premier benchmark de navigation industrielle dynamique conçu pour évaluer le raisonnement spatial des agents visuels et langagiers (VLLM) en conditions actives. Le dispositif s'appuie sur douze scénarios d'entrepôt haute fidélité créés sous Unity, intégrant objets mobiles et déplacements humains simulés. Les auteurs proposent un pipeline de navigation PointGoal en zero-shot, combinant vision égocentrique et odométrie globale pour tester la planification à la fois locale et globale. Deux métriques originales, le taux de collision et le taux d'alerte, mesurent spécifiquement les comportements orientés sécurité. Quatorze modèles de pointe ont été testés, dont GPT-5.2, Claude-4.6 et Gemini-3, sur cet ensemble de tâches de navigation dynamique. Les résultats montrent que les modèles propriétaires conservent un avantage constant sur les modèles ouverts, mais qu'aucun agent, quel qu'il soit, ne maîtrise réellement l'évitement d'obstacles, la planification de trajectoire robuste ou l'exploration active. C'est un signal important pour les intégrateurs et décideurs qui envisagent de déployer des agents pilotés par VLLM dans des entrepôts ou des lignes de production: la performance impressionnante de ces modèles sur des benchmarks domestiques statiques ne se transfère pas automatiquement à des environnements industriels dynamiques et peuplés d'humains. Le papier vient ainsi nuancer le discours ambiant sur la maturité des agents incarnés génériques, en montrant que la perception passive ne suffit pas là où la sécurité active est requise. Cette étude comble un vide identifié dans la littérature existante: la quasi-totalité des benchmarks d'agents incarnés se limite à des environnements domestiques passifs et statiques, et évalue des capacités isolées plutôt qu'une performance holistique. IndustryNav se positionne comme le premier effort ciblant spécifiquement le domaine industriel avec complexité dynamique. Publié sur arXiv (version révisée du texte initial), le travail appelle la recherche en robotique incarnée à dépasser la simple perception pour développer des comportements stables, exploratoires et sûrs en environnement réel mouvant, une orientation qui concerne directement les futurs déploiements d'AMR et de robots mobiles en logistique.

RecherchePaper
1 source
Un robot autonome, conscient des normes sociales, franchit des portes et livre une charge utile en urgence
1372arXiv cs.RO 

Un robot autonome, conscient des normes sociales, franchit des portes et livre une charge utile en urgence

Les chercheurs à l'origine de ce papier arXiv (2607.05315v1) ont testé un système d'assistance robotique à l'évacuation d'urgence sur le Toyota Human Support Robot (HSR), une plateforme mobile équipée d'un bras manipulateur. Le robot doit remplir deux missions simultanées lors d'une évacuation : ouvrir les portes sur le chemin des personnes évacuées en repérant et actionnant les boutons d'accès conformes aux normes ADA, et récupérer du matériel de secours pour le livrer aux intervenants d'urgence. L'équipe a bâti l'architecture de décision autour d'un arbre de comportement (behavior tree), une structure capable de sélectionner des tâches de haut niveau selon des déclencheurs environnementaux et de s'étendre à de nouvelles situations. Le système a été évalué sur 105 essais, répartis entre cinq scénarios matériels réels et trois scénarios en simulation, avec un taux de réussite de 97 sur 105, soit environ 92%. Ce résultat compte parce qu'il s'attaque à un problème rarement traité dans la littérature robotique : la prise de décision sociale en contexte d'urgence, où le robot doit arbitrer en temps réel entre céder le passage à une personne, franchir une porte qu'un humain tient déjà ouverte, ou aller chercher un équipement avant de traverser. C'est un cas concret où la robotique d'assistance dépasse la simple exécution de tâches pour intégrer une conscience de l'environnement humain, un enjeu clé pour les intégrateurs qui envisagent des déploiements en environnements partagés avec des personnes, secteur hospitalier, logistique de secours ou sites industriels évacuables. Le choix de l'arbre de comportement plutôt qu'un contrôleur monolithique ou un modèle end-to-end répond à un besoin d'extensibilité et de traçabilité des décisions, un critère souvent recherché dans les systèmes destinés à des usages critiques. Les auteurs ont publié le code et des démonstrations vidéo sur GitHub (AndrewSnowdy/hsrmmcontrol), ouvrant la voie à des reproductions et extensions vers d'autres tâches de réponse d'urgence.

RecherchePaper
1 source
AnchorDream : réorienter la diffusion vidéo pour la synthèse de données robotiques sensibles à l'incarnation
1373arXiv cs.RO 

AnchorDream : réorienter la diffusion vidéo pour la synthèse de données robotiques sensibles à l'incarnation

Des chercheurs présentent AnchorDream, un modèle génératif qui détourne des modèles de diffusion vidéo pré-entraînés pour synthétiser des données de démonstration robotique. Publié sur arXiv (2512.11797v2, version révisée), le système conditionne le processus de diffusion sur des rendus du mouvement du robot, ce qui ancre la cohérence de l'embodiment (la géométrie et la cinématique du bras ou de l'humanoïde) pendant que le modèle génère de nouveaux objets et environnements. À partir d'une poignée de démonstrations en téléopération humaine seulement, la méthode permet de démultiplier ces exemples en jeux de données massifs et variés, sans modélisation explicite de l'environnement. Les résultats annoncés font état d'un gain relatif de 36,4% sur des benchmarks en simulateur, et d'une performance quasiment doublée lors d'essais en conditions réelles pour l'apprentissage de politiques par imitation. Cette avancée s'attaque directement au goulot d'étranglement le plus critique de l'apprentissage par imitation en robotique: la collecte de données réelles est coûteuse et lente, tandis que les simulateurs souffrent d'un écart de fidélité persistant avec le monde réel, le fameux sim-to-real gap. Les méthodes génératives existantes se contentaient souvent de modifier l'apparence visuelle des scènes sans produire de nouveaux comportements, ou généraient des mouvements physiquement incohérents avec l'embodiment du robot. En prouvant qu'un modèle de diffusion vidéo peut être ancré au mouvement réel du robot pour générer des données exploitables à grande échelle, AnchorDream ouvre une voie concrète pour les intégrateurs et laboratoires qui cherchent à entraîner des politiques VLA sans dépendre uniquement de flottes de téléopération ou de simulateurs coûteux à construire. Ce travail s'inscrit dans la vague récente des world models appliqués à la robotique, où plusieurs équipes explorent la génération vidéo comme substitut ou complément à la simulation physique classique. Contrairement à des approches purement visuelles, AnchorDream mise sur l'ancrage cinématique explicite pour éviter les hallucinations de mouvement, un problème récurrent des générateurs vidéo appliqués aux robots. À ce stade, il s'agit d'un résultat de recherche publié sur arXiv, sans déploiement produit ni partenariat industriel annoncé, mais l'ampleur des gains rapportés en fait une piste à suivre pour la prochaine génération de pipelines de données robotiques.

RecherchePaper
1 source
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
1374arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source
MorphQuad : un quadrirotor transformable pour une manœuvrabilité, manipulation et résilience surhumaines
1375arXiv cs.RO 

MorphQuad : un quadrirotor transformable pour une manœuvrabilité, manipulation et résilience surhumaines

Des chercheurs présentent MorphQuad, un quadricoptère morphable capable d'un vol omnidirectionnel et d'une manipulation avec une force proche de celle d'une main humaine, selon un article publié le 2 juillet 2026 sur arXiv (2607.02764v1). Contrairement aux drones classiques limités par leur structure rigide, MorphQuad articule indépendamment chacun de ses quatre rotors via des cardans à deux axes, ce qui permet de vectoriser la poussée maximale dans n'importe quelle direction tout en conservant une stabilité globale sur toutes les orientations. Grâce à un système de contrôle allouant l'énergie de façon optimale, entièrement embarqué et autonome, l'appareil a démontré des rotations multi-tours en translation ou en vol stationnaire pour l'inspection de tuyauteries et le suivi de cibles, l'ouverture de vannes, le perchage, ainsi que la poussée et la pression d'objets avec une force comparable à celle d'un humain, tout en résistant à des perturbations de vent venant de n'importe quelle direction, y compris concentrées sur un seul rotor. Cette avancée s'attaque directement à une limite structurelle connue des drones à usage industriel: la plupart des quadricoptères actuels ne peuvent ni vectoriser leur poussée dans toutes les directions, ni garantir une stabilité de contrôle sur l'ensemble des orientations possibles, ce qui restreint leur usage aux tâches de survol et de captation d'images plutôt qu'à la manipulation physique de force. Pour les intégrateurs de maintenance d'infrastructures, l'inspection par contact et la réponse d'urgence, un aéronef capable d'appliquer des forces de contact précises tout en résistant aux effets de sol et au vent ouvre la voie à des interventions aujourd'hui réservées aux opérateurs humains ou aux robots au sol, dans des zones difficiles d'accès comme les pipelines, les structures en hauteur ou les sites accidentés. Le papier illustre ainsi un solveur potentiel du fossé classique entre démonstration en laboratoire et robustesse en conditions réelles, un point sur lequel de nombreuses annonces robotiques restent généralement vagues. Le projet part d'un constat des auteurs: aucun véhicule aérien existant ne combine simultanément vectorisation de poussée maximale, stabilité globale et conception compacte dérivée des plateformes quadrotor standards, faute de co-conception matérielle et logicielle adaptée. MorphQuad répond à cette lacune par une approche hybride associant cardans motorisés et algorithme d'allocation de poussée empêchant les interférences de flux d'air entre rotors et le blocage de cardan. L'article ne mentionne pas de partenaire industriel ni de calendrier de commercialisation, ce qui situe la publication au stade de la recherche académique plutôt que du produit prêt à déployer; les prochaines étapes attendues porteraient vraisemblablement sur des essais en conditions réelles hors laboratoire et une possible collaboration avec des acteurs de l'inspection industrielle ou de la robotique aérienne, un secteur où les laboratoires américains dominent actuellement la publication mais où des acteurs européens en drones industriels pourraient s'inspirer de cette architecture.

RecherchePaper
1 source
Recherche paresseuse basée sur les conflits pour une planification rapide multi-manipulateurs
1376arXiv cs.RO 

Recherche paresseuse basée sur les conflits pour une planification rapide multi-manipulateurs

Une équipe de chercheurs propose un nouvel algorithme baptisé Conflict-Based Lazy Search (CBLS), conçu pour planifier en temps réel les mouvements simultanés de plusieurs bras manipulateurs robotiques dans un espace de travail encombré. L'algorithme s'appuie sur Conflict-Based Search (CBS), une méthode de pathfinding multiagent qui a déjà démontré des gains de vitesse d'un ordre de grandeur par rapport aux approches précédentes. CBS fonctionne en résolvant une série de problèmes de recherche de chemin pour un seul agent à la fois, ce qui signifie que sa performance globale dépend directement de l'efficacité de cet algorithme de base. Les auteurs y ajoutent deux innovations: un graphe précalculé à évaluation paresseuse et sparsité contrôlée pour un manipulateur unique, et un nouvel algorithme de recherche appelé Lazy Edge-based A (LEA), qui réduit le nombre d'évaluations d'arêtes, considéré comme le principal goulot d'étranglement computationnel dans la planification de bras robotiques. Cette avancée cible un problème très concret pour l'industrie: dans une cellule robotique où plusieurs bras manipulateurs opèrent côte à côte, chaque calcul de trajectoire doit vérifier les collisions potentielles entre pièces mobiles, ce qui devient rapidement coûteux en temps de calcul à mesure que le nombre de bras augmente. En réduisant drastiquement ces évaluations grâce à la recherche paresseuse, CBLS ouvre la voie à une planification plus rapide et davantage exploitable en temps réel, un enjeu direct pour les intégrateurs qui déploient des cellules multi-bras dans des usines ou des entrepôts, où la vitesse de replanification conditionne le débit de production. Le travail s'inscrit dans la lignée du MAPF (multiagent pathfinding), un champ de recherche né notamment des besoins de coordination en entrepôt et en logistique autonome, que les auteurs transposent ici aux manipulateurs industriels. Les chercheurs comparent directement CBLS à l'algorithme CBS original ainsi qu'à RRT-Connect, une méthode de planification par échantillonnage largement utilisée en robotique, et affirment obtenir des performances supérieures sur des problèmes de planification multi-manipulateurs. L'article, encore au stade de prépublication arXiv, ne précise pas de tests sur du matériel réel ni de partenariat industriel, ce qui en fait pour l'instant une contribution algorithmique plutôt qu'une solution déployée en production.

RecherchePaper
1 source
Fils invisibles : les principes de la marionnette et leurs liens cachés avec le comportement des robots
1377arXiv cs.RO 

Fils invisibles : les principes de la marionnette et leurs liens cachés avec le comportement des robots

Des chercheurs en interaction homme-robot proposent une nouvelle source d'inspiration pour concevoir le comportement non verbal des robots : la marionnette. Publié le 3 juillet sur arXiv, ce travail part d'un constat simple : depuis des années, la conception des gestes et postures des robots sociaux s'appuie largement sur les Principes d'Animation de Disney, popularisés par Thomas et Johnston dans les années 1980 pour donner vie aux personnages de dessin animé. Les auteurs ont mené des entretiens avec des marionnettistes professionnels et analysé des ouvrages de référence sur cet art pour en extraire un ensemble de principes de conception directement transposables à la robotique, couvrant la morphologie du corps, la dynamique du mouvement et les modalités d'interaction avec un public ou un partenaire humain. L'intérêt pour les concepteurs de robots est concret : contrairement à l'animation, qui s'affranchit des lois physiques et se limite souvent à des règles de mécanique de bas niveau (timing, exagération, anticipation), la marionnette a toujours composé avec des contraintes matérielles réelles proches de celles d'un robot physique, comme le poids, l'inertie ou les degrés de liberté limités d'une structure articulée. Elle a aussi, depuis des siècles, développé des savoir-faire sur l'interaction incarnée avec un public, un terrain que l'animation ne couvre pas puisqu'un dessin animé ne partage jamais l'espace physique avec son spectateur. Pour les équipes qui conçoivent des robots sociaux ou collaboratifs, ce corpus offre donc des pistes de conception à plus haut niveau que les principes d'animation, potentiellement plus directement actionnables pour des systèmes contraints par le monde réel. Ce travail s'inscrit dans un courant de recherche en robotique sociale qui puise depuis longtemps dans les arts du spectacle : théâtre, danse et animation ont déjà été mobilisés pour informer le design comportemental des robots. La marionnette restait jusqu'ici un angle mort de cette littérature, malgré une histoire longue de plusieurs siècles d'exploration de la forme, du mouvement et de l'interaction de personnages incarnés. Les auteurs positionnent leurs principes comme complémentaires, et non substituables, à ces apports antérieurs, ouvrant la voie à des travaux futurs testant leur application concrète sur des plateformes robotiques.

RecherchePaper
1 source
Athena-WBC : experts de politique alignés sur les capacités pour le contrôle corporel complet des humanoïdes en longue traîne
1378arXiv cs.RO 

Athena-WBC : experts de politique alignés sur les capacités pour le contrôle corporel complet des humanoïdes en longue traîne

Les chercheurs à l'origine du système Athena-WBC s'attaquent à un problème persistant du contrôle corps-entier des robots humanoïdes : même les meilleurs contrôleurs de suivi de mouvement à grande échelle échouent sur un sous-ensemble récalcitrant de mouvements, en particulier les transitions à haute dynamique et les gestes critiques pour l'équilibre, et ce même quand ces clips sont réentraînés de façon ciblée. L'équipe montre que la cause n'est pas seulement un manque d'exposition à ces mouvements rares, mais un décalage entre les exigences du mouvement et la capacité effective que produit la recette d'entraînement par défaut. Leur réponse est un pipeline compact de type enseignant-élève combinant des "experts" alignés sur la capacité requise : des experts dynamiques, entraînés avec un objectif de suivi allégé des pénalités conservatrices et temporelles tout en conservant les contraintes physiques de faisabilité, et des experts d'équilibre, formés via un curriculum de gravité progressif pour améliorer la survie en début d'apprentissage. Ces enseignants privilégiés sont ensuite routés par mouvement pour une distillation DAgger, puis compressés en un contrôleur unique utilisant des observations déployables, affiné par apprentissage par renforcement. Sur un humanoïde grandeur nature, la méthode améliore la récupération des mouvements rares de l'ensemble d'entraînement et le suivi sur des mouvements non vus, par rapport à une base solide utilisant la recette SONIC, avec seulement un petit nombre d'experts. Ce travail cible directement l'un des goulots d'étranglement les plus sensibles de la robotique humanoïde actuelle : le fameux "long tail" des mouvements difficiles, qui sépare les démonstrations en vidéo soigneusement sélectionnées des déploiements réellement robustes en usine ou en environnement non contrôlé. Pour les intégrateurs et décideurs industriels, la promesse n'est pas un nouveau matériel mais une méthode d'entraînement plus efficace en données et en nombre d'experts, ce qui réduit le coût d'ingénierie nécessaire pour couvrir les cas extrêmes de chute, de rattrapage d'équilibre ou de transition rapide entre postures, souvent le vrai facteur limitant avant la mise en production de humanoïdes. Le papier s'inscrit dans la lignée des architectures enseignant-élève par distillation DAgger désormais standard pour le contrôle de mouvement humanoïde, et se positionne explicitement contre la recette SONIC, une référence récente du domaine, en cherchant à la dépasser sur les cas rares sans multiplier le nombre d'experts spécialisés. Publié sur arXiv le 7 juillet 2026, le travail ouvre la voie à des comparaisons futures avec d'autres pipelines de contrôle corps-entier utilisés par les acteurs commerciaux du secteur, sans toutefois préciser à ce stade de calendrier de transfert vers un produit industriel.

RecherchePaper
1 source
ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle
1379arXiv cs.RO 

ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle

Les modèles Vision-Language-Action (VLA), qui pilotent la nouvelle génération de bras robotiques et d'humanoïdes, souffrent d'un défaut connu quand on y ajoute du tactile : le signal visuel, beaucoup plus riche en données, écrase systématiquement les informations de contact, un phénomène que les chercheurs appellent "l'effondrement de modalité". Une équipe propose ResTacVLA, une architecture publiée le 3 juillet 2026 sur arXiv (2607.03387), qui s'inspire du codage prédictif, un mécanisme neuronal par lequel le cerveau ignore ce qui est prévisible pour se concentrer sur l'inattendu. Au lieu d'injecter les données tactiles brutes dans le modèle, ResTacVLA calcule une "représentation tactile résiduelle" : l'écart entre ce que la vision laissait prévoir et ce que le capteur de contact ressent réellement. Ce résidu est ensuite compressé via un goulot d'étranglement à quantification vectorielle (VQ) en "primitives de contact latentes", puis injecté de façon adaptative dans le modèle, avec un gain renforcé précisément lorsque la vision devient incertaine ou obstruée. L'enjeu dépasse la prouesse technique. Pour les intégrateurs qui visent des tâches à fort contact physique, insertion de précision, assemblage, manipulation d'objets déformables ou glissants, le tactile est le signal qui distingue une démonstration en laboratoire d'un geste fiable en production. Or la plupart des VLA actuels traitent le tactile comme un flux secondaire noyé par la caméra. En démontrant qu'un filtrage inspiré de la neuroscience permet de rendre ce signal rare mais décisif exploitable sans le diluer, les auteurs répondent directement à l'un des angles morts récurrents des architectures multimodales pour la robotique manipulatrice, où l'ajout de capteurs supplémentaires improve rarement les performances sans repenser la fusion des modalités. Le travail reste à ce stade un article de recherche, sans affiliation industrielle citée dans le résumé ni déploiement annoncé : il s'agit d'un préprint arXiv, testé sur un ensemble de tâches de manipulation en contact selon les auteurs, avec une page de projet dédiée mais pas encore de publication en conférence confirmée. Il s'inscrit dans une dynamique plus large de recherche sur l'intégration tactile en apprentissage robotique, un axe que plusieurs laboratoires explorent en parallèle pour combler l'écart entre robots qui voient et robots qui, littéralement, sentent ce qu'ils touchent.

RecherchePaper
1 source
ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement
1380arXiv cs.RO 

ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement

Le laboratoire à l'origine de ce papier arXiv (identifiant 2603.28545, version 2, soumission de type remplacement) présente ManipArena, un cadre d'évaluation standardisé pour la manipulation robotique en conditions réelles. Le benchmark couvre 20 tâches distinctes, s'appuie sur 10 812 trajectoires expertes et 13,5 millions d'images, pour un total d'environ 188 heures de fonctionnement robotique cumulées sur des scénarios de manipulation de table et de manipulation mobile. Le protocole combine variation de tâches définie par schéma, essais stratifiés en distribution, en décalage visuel et hors distribution sémantique, notation par crédit partiel au niveau des sous-tâches, annotations linguistiques à trois niveaux de granularité, signaux moteurs bas niveau, et environnements simulés jumeaux reconstruits à partir de scènes physiques réelles. Les chercheurs ont utilisé ce dispositif pour évaluer sept configurations de manipulation de table, couvrant à la fois des modèles vision-langage-action (VLA) et des modèles dits world-action. L'enjeu dépasse la simple création d'un nouveau jeu de tests. Les benchmarks en simulateur, bien que reproductibles et faciles à mettre à l'échelle, ne capturent pas fidèlement l'écart entre simulation et réel, ce dernier étant causé par le bruit de perception, la dynamique de contact, la latence et les erreurs de calibration. À l'inverse, les évaluations sur robots physiques existantes sont dispersées entre plateformes, scènes et règles de notation différentes, ce qui rend toute comparaison rigoureuse quasi impossible. Résultat clé de l'étude: les performances mesurées sur robot réel ne dépendent pas seulement de l'architecture du modèle, mais aussi de sa provenance, du régime de fine-tuning, de l'échantillonnage des données d'entraînement et de la granularité des annotations. Pour les intégrateurs et décideurs industriels, ce constat invite à relativiser fortement les annonces de performance basées uniquement sur des démonstrations vidéo ou des scores en simulation. Ce travail s'inscrit dans la course actuelle autour des modèles généralistes de contrôle robotique (VLA et world-action), un domaine où les affirmations de généralisation restent difficiles à vérifier faute de méthodologie commune. En proposant un référentiel reproductible avec attribution fine des échecs, ManipArena vise à devenir un outil diagnostique de référence pour mesurer les véritables limites de capacité de ces modèles, plutôt qu'un simple classement de plus.

RecherchePaper
1 source
Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux
1381arXiv cs.RO 

Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux

Des chercheurs publient le 2 juillet 2026 (arXiv:2607.02092) Guided Action Flow, une méthode d'inférence qui améliore les politiques robotiques vision-langage-action (VLA) à flow matching sans réentraîner le modèle de base. La politique préentraînée SmolVLA reste gelée : un critique appris sur des trajectoires réelles de succès et d'échec guide l'échantillonnage en temps inverse via des gradients d'action, avec un conditionnement possible sur la description de tâche issue du canal langage de SmolVLA. Sur le benchmark de manipulation LIBERO, un critique spécifique à une tâche fait passer le taux de succès de 68,0% à 82,0% sur une fenêtre de seed, puis de 82,0% à 86,0% sur une autre. Un critique multi-famille, entraîné sur plusieurs types de tâches, améliore le succès en validation de 46,0% à 56,0%, mais le gain sur le jeu de test verrouillé reste plus modeste, de 65,0% à 67,5%. Pour les intégrateurs qui déploient des politiques VLA figées en production, l'approche offre un gain de performance à l'inférence sans le coût d'un réentraînement complet, en transposant aux politiques d'action robotiques un guidage par critique déjà courant en génération d'image et en apprentissage par renforcement. L'écart entre le gain en validation (+10 points) et celui observé sur données verrouillées (+2,5 points) est le résultat le plus significatif de l'étude : il révèle une généralisation limitée du critique au-delà de sa distribution d'entraînement. La méthode est donc prometteuse pour affiner des politiques déjà déployées, mais son bénéfice réel sur des tâches totalement inédites reste contraint tant que la généralisation du critique et un guidage sensible à l'incertitude ne sont pas résolus, ce que les auteurs identifient eux-mêmes comme le verrou central de l'approche. SmolVLA, la politique de base utilisée, est un modèle VLA compact pensé pour du matériel limité, positionné face à des politiques plus lourdes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. LIBERO, le benchmark d'évaluation, est une suite standard de tâches de manipulation conçue pour tester l'apprentissage continu en robotique, et le choix du flow matching comme mécanisme de génération d'action reflète une bascule plus large du secteur vers des schémas de transport plus rapides à échantillonner que la diffusion classique. Guided Action Flow se positionne comme une brique complémentaire aux efforts de réentraînement à grande échelle, offrant un moyen peu coûteux d'améliorer des politiques déjà déployées plutôt que de concurrencer les gros modèles généralistes. Les auteurs annoncent vouloir approfondir la généralisation du critique et intégrer une notion d'incertitude dans le guidage, sans donner de calendrier précis pour ces prochaines étapes.

RechercheActu
1 source
VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire
1382arXiv cs.RO 

VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire

Des chercheurs universitaires publient une architecture baptisée AEGIS, décrite dans un article arXiv (identifiant 2512.11891, version 2) consacré aux modèles vision-langage-action (VLA), ces systèmes qui permettent à un robot de traduire une instruction en langage naturel et une image en mouvement physique. AEGIS ajoute une couche de contrainte de sécurité "plug-and-play", construite à partir de fonctions de barrière de contrôle (control barrier functions), que l'on peut greffer sur un modèle VLA existant sans le réentraîner ni dégrader ses performances d'origine. Pour évaluer l'approche, les auteurs ont conçu un benchmark dédié, SafeLIBERO, qui multiplie les scénarios de manipulation avec des obstacles et des niveaux de complexité spatiale variables. Résultat annoncé: plus de 50% d'amélioration du taux d'évitement d'obstacles et près de 10% de hausse du taux de réussite des tâches, comparé aux meilleures méthodes existantes. Code et données sont publiés en accès libre. L'enjeu dépasse la prouesse technique isolée. Les modèles VLA généralistes, popularisés par des architectures comme Pi-0, GR00T N2 ou Helix, excellent à généraliser des instructions à de nouvelles tâches de manipulation, mais leur talon d'Achille reste la sécurité physique: rien ne garantit qu'un bras robotique évite une collision en environnement non structuré, un frein majeur au déploiement en usine ou en logistique. En proposant une couche de sécurité modulaire avec garanties théoriques plutôt qu'un simple filtrage heuristique, AEGIS répond directement à ce point de blocage identifié par les intégrateurs, sans nécessiter de repenser chaque modèle VLA au cas par cas. Ce travail s'inscrit dans la vague de recherche qui a suivi l'essor des VLA depuis RT-2 et OpenVLA, où l'accent s'est progressivement déplacé de la généralisation pure vers la fiabilité et la certifiabilité. Il faut toutefois noter que ces résultats proviennent d'un benchmark de simulation dérivé de LIBERO, pas d'un déploiement industriel réel: le passage à l'échelle sur du matériel physique et dans des environnements réellement non structurés reste l'étape suivante à observer, comme pour la plupart des publications de ce type avant adoption commerciale.

RechercheActu
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
1383arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source
Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée
1384arXiv cs.RO 

Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée

Un article mis à jour sur arXiv (version 2, référence 2606.22982) présente CLS-DP, un cadre décentralisé pour la manipulation multi-bras par des agents robotiques. Le système répond à un problème concret : les approches centralisées de coordination multi-agents passent mal à l'échelle quand le nombre de bras augmente, car elles exigent une vue globale partagée et des échanges d'état constants. CLS-DP suit le paradigme CTDE (entraînement centralisé, exécution décentralisée) : pendant l'entraînement, il distille dans un espace latent les dynamiques privilégiées de coordination multi-agents ; au déploiement, chaque bras infère ce "latent collaboratif" à partir de sa seule observation RGB locale et d'une instruction de tâche partagée, puis conditionne dessus son processus de débruitage par diffusion, sans communication inter-agents ni état global explicite. Sur six tâches du benchmark RoboFactory impliquant de deux à quatre agents, CLS-DP atteint un taux de réussite moyen de 38%, contre 20% pour la meilleure référence centralisée testée et seulement 9% pour une version décentralisée privée du latent collaboratif. Ce résultat contredit une hypothèse répandue en robotique multi-bras : qu'une coordination fine nécessite forcément une communication explicite ou une vue centralisée de la scène. En montrant qu'un latent appris peut encoder implicitement les dynamiques collaboratives à partir d'une simple image locale, CLS-DP ouvre la voie à des cellules multi-robots qui passent à l'échelle sans coût de communication croissant, un enjeu direct pour les intégrateurs qui déploient des postes de manipulation coopérative en usine. Les cartes d'attribution des auteurs montrent que chaque agent, conditionné sur ce latent, porte une attention élevée non seulement sur ses propres articulations et sa pince, mais aussi sur celles de ses coéquipiers pendant toute l'exécution, preuve que l'information de coordination circule réellement dans la représentation apprise. Pour qui évalue des architectures VLA (vision-language-action) en environnement multi-agent, le travail suggère qu'on peut réduire le coût de calcul par agent tout en égalant, voire en dépassant, des références centralisées plus lourdes. Ce travail s'inscrit dans la lignée des politiques de manipulation par diffusion, devenues une alternative courante au clonage comportemental classique, et s'appuie sur RoboFactory comme benchmark commun pour l'évaluation multi-agents. Le choix du paradigme CTDE rapproche aussi cette recherche des méthodes d'apprentissage par renforcement multi-agents, où entraînement centralisé et exécution décentralisée sont devenus un standard pour équilibrer performance et scalabilité. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de bras robotiques : il s'agit pour l'instant d'un résultat validé en simulation, sans calendrier annoncé de transfert vers du matériel réel. L'étape logique suivante serait une validation sim-to-réel sur des cellules physiques à deux ou trois bras, véritable épreuve pour une méthode qui promet de faire tenir la coordination fine dans une seule caméra RGB par agent.

RecherchePaper
1 source
Apprendre à bouger avant d'agir : pré-entraînement générique pour les VLA
1385arXiv cs.RO 

Apprendre à bouger avant d'agir : pré-entraînement générique pour les VLA

Une équipe de recherche publie sur arXiv (2607.02466v1) un nouveau framework baptisé TAP (Task-Agnostic Pretraining), conçu pour entraîner des modèles Vision-Language-Action (VLA) avec beaucoup moins de démonstrations expertes que les approches classiques. Le constat de départ : la rareté des données étiquetées (observations, instructions et actions) freine le développement des VLA, car les méthodes actuelles mélangent deux apprentissages distincts, la compétence physique (comment bouger) et l'alignement sémantique (quoi faire), alors que seul le second nécessite une supervision par le langage. TAP sépare les deux en deux étapes : une première phase apprend des a priori moteurs transférables à partir de données d'interaction non étiquetées et bon marché, y compris des trajectoires hors tâche généralement écartées et du jeu autonome de robots, via un objectif auto-supervisé de dynamique inverse. Une seconde phase, légère, ancre ensuite ces a priori dans le langage à l'aide d'un minimum de données expertes. Sur le benchmark SIMPLER, TAP égale des modèles entraînés sur plus d'un million de trajectoires expertes tout en utilisant des ordres de grandeur de données étiquetées en moins, avec un gain absolu de 10% sur le behavior cloning standard. Sur une plateforme réelle WidowX, TAP conserve un taux de réussite de 25% face à des perturbations de caméra, là où les baselines entraînées à l'échelle internet chutent à 0%. Ce résultat s'attaque directement à l'un des goulots d'étranglement les plus cités du secteur robotique : le coût de collecte de démonstrations expertes à grande échelle, souvent invoqué pour justifier des besoins massifs en téléopération ou en données simulées coûteuses. En montrant qu'un pré-entraînement task-agnostic sur des données bon marché (trajectoires ratées, jeu robotique non supervisé) peut produire des représentations physiques robustes et transférables, TAP suggère une voie de scalabilité alternative à l'empilement pur de données expertes, un enjeu direct pour les intégrateurs et laboratoires qui cherchent à réduire le coût par déploiement de politiques VLA. Le travail s'inscrit dans la lignée des architectures VLA récentes comme Pi-0 ou GR00T N2, qui cherchent toutes à généraliser au-delà des tâches vues à l'entraînement. La robustesse démontrée face aux perturbations caméra, un scénario classique de dégradation en conditions réelles, en fait un signal notable pour la suite : reste à voir si l'approche se généralise à des plateformes bras-mobiles ou humanoïdes plus complexes que le bras WidowX utilisé ici pour la validation.

RechercheActu
1 source
Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres
1386arXiv cs.RO 

Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres

Une équipe de chercheurs propose NeHMO, une méthode d'apprentissage par réseau de neurones basée sur la réductibilité de Hamilton-Jacobi (HJR) pour la planification de mouvement multi-bras en sécurité et de façon décentralisée. Le papier, publié sur arXiv (arXiv:2507.13940, version 2), s'attaque au problème de la coordination de plusieurs bras robotiques évoluant dans un espace de configuration couplé et de haute dimension. Plutôt que de s'appuyer sur un planificateur centralisé qui coordonne tous les bras mais peine à passer à l'échelle en temps réel, ou sur des méthodes décentralisées existantes qui supposent un comportement prévisible des autres bras, les auteurs entraînent une fonction de valeur de sécurité qui capture les contraintes de collision inter-bras dans le pire des cas. Cette représentation apprise alimente ensuite un module d'optimisation de trajectoire décentralisé, exécutable en temps réel sur chaque bras indépendamment. L'enjeu dépasse l'exercice académique: la planification multi-bras sûre est un goulot d'étranglement concret pour les cellules de fabrication et les postes d'assemblage où plusieurs manipulateurs partagent un espace de travail restreint. Les approches centralisées classiques deviennent impraticables dès que le nombre de bras augmente, tandis que les méthodes décentralisées à base d'apprentissage profond échouent dès qu'un bras voisin dévie d'un comportement anticipé, c'est à dire exactement le scénario que redoutent les intégrateurs industriels en environnement non coopératif. En garantissant une sécurité dans le pire des cas plutôt qu'une prédiction probable de comportement, NeHMO répond à une limite reconnue des architectures actuelles: la fragilité face à l'imprévisibilité, sans sacrifier le passage à l'échelle. La réductibilité de Hamilton-Jacobi est un outil classique de la théorie du contrôle pour la vérification formelle de sécurité, historiquement trop coûteux en calcul pour des systèmes multi-bras à haute dimension. L'apport ici est de le rendre tractable via une approximation neuronale, généralisable à différentes configurations de manipulateurs sans réentraînement complet. Selon les auteurs, la méthode surpasse les références de l'état de l'art sur des tâches de planification multi-bras jugées difficiles. Il s'agit toutefois d'un résultat de recherche publié en preprint, sans partenaire industriel ni déploiement annoncé à ce stade.

RecherchePaper
1 source
Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP
1387arXiv cs.RO 

Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP

Une équipe de recherche présente VolumeDP, une nouvelle architecture pour l'apprentissage par imitation en robotique manipulatrice, décrite dans une version révisée d'un article arXiv (2603.17720v2). Le problème visé est concret : la plupart des méthodes actuelles font correspondre directement des observations d'images 2D à des sorties d'action 3D, un décalage géométrique qui nuit au raisonnement spatial et fragilise la robustesse des politiques apprises. VolumeDP corrige ce défaut en raisonnant explicitement en trois dimensions : les features issues des images sont d'abord projetées dans une représentation volumétrique via un mécanisme d'attention croisée, puis un module apprenable sélectionne les voxels pertinents pour la tâche et les convertit en un ensemble compact de tokens spatiaux, ce qui réduit fortement le calcul sans perdre la géométrie utile à l'action. Un décodeur multi-tokens exploite ensuite l'ensemble de ces tokens pour prédire les actions, évitant l'agrégation destructrice qui réduit plusieurs indices spatiaux à un seul descripteur. Résultat chiffré : 88,8% de taux de réussite moyen sur le benchmark de simulation LIBERO, soit 14,8 points de mieux que la meilleure méthode concurrente, avec des gains également marqués sur ManiSkill et LIBERO-Plus. Des essais en conditions réelles confirment la généralisation à de nouvelles dispositions spatiales, de nouveaux points de vue caméra et de nouveaux environnements. Pour les équipes qui développent des politiques de manipulation robotique, ce travail illustre une limite structurelle des architectures VLA qui traitent la 3D comme un simple sous-produit d'un flux d'images : sans représentation spatiale explicite, la robustesse aux changements de caméra ou de décor s'effondre, un problème récurrent dès qu'on sort du laboratoire. VolumeDP montre qu'ajouter un raisonnement volumétrique explicite, plutôt que de compter uniquement sur l'échelle des données ou du modèle, améliore sensiblement la généralisation, ce qui nuance l'idée reçue selon laquelle scaler les VLA suffirait à résoudre le problème spatial. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation ayant précédemment tenté d'intégrer une composante 3D, comme les approches de type Diffusion Policy en 3D, mais en visant une représentation volumétrique plus efficiente en calcul. Il s'agit à ce stade d'une contribution académique, publiée sur arXiv avec code et vidéos disponibles sur une page projet dédiée, et non d'un produit ou d'un système déployé commercialement. Les benchmarks utilisés (LIBERO, ManiSkill) restent des environnements de recherche standard, ce qui laissera aux prochaines étapes le soin de confirmer la tenue de ces résultats sur des tâches industrielles plus complexes.

RecherchePaper
1 source
Robots évitant les collisions en temps réel dans des environnements dynamiques
1388arXiv cs.RO 

Robots évitant les collisions en temps réel dans des environnements dynamiques

Des chercheurs publient une méthode qui convertit n'importe quel chemin géométrique, c'est-à-dire une simple séquence d'états produite par un planificateur de mouvement quelconque (échantillonné comme RRT ou PRM, ou basé sur la recherche comme ARA*), en une trajectoire réellement exécutable par un robot : cinématiquement faisable et à jerk limité. L'algorithme génère une suite de splines quintiques ou quartiques, discrétisées à une fréquence de contrôle choisie par l'utilisateur, puis diffusées directement vers le contrôleur bas niveau. Il peut être réinvoqué à tout instant pour recalculer une nouvelle trajectoire depuis l'état courant du robot vers une cible ou une séquence de cibles, avec adaptation en temps réel aux changements de l'environnement. Sous l'hypothèse que la vitesse des obstacles reste bornée, la méthode offre des garanties conditionnelles d'arrêt sécurisé sur un intervalle de temps fini, tout en tolérant une déviation géométrique limitée par rapport au chemin d'origine. Les contraintes cinématiques, jerk compris, sont traitées explicitement. En simulation comparative face à une méthode concurrente, les auteurs rapportent un meilleur lissage, un temps de calcul plus faible et de meilleures performances temps réel, en particulier lors de changements fréquents de cible, jusqu'à 1 kHz. Des expériences sur robot réel valident l'approche, y compris dans des scénarios où un humain fait office d'obstacle. Pour les intégrateurs, ce travail cible un problème très concret : la plupart des planificateurs de mouvement produisent des chemins géométriques, pas des trajectoires exécutables respectant les limites physiques du robot en vitesse, accélération et jerk. Combler ce fossé en temps réel, avec des garanties de sécurité formelles même quand des obstacles se déplacent, fait défaut à de nombreuses piles de navigation actuelles destinées aux environnements partagés avec des humains, entrepôts, usines ou bras collaboratifs. La capacité à replanifier jusqu'à 1 kHz sans dégrader la fluidité du mouvement représente un vrai gain pour les systèmes confrontés à des changements rapides de l'environnement, sans imposer le compromis habituel entre réactivité et stabilité. Le domaine de la planification de mouvement reste tiraillé entre planificateurs globaux, qui trouvent un chemin, et méthodes locales, chargées de le rendre exécutable en douceur : les chemins issus d'échantillonnage sont typiquement irréguliers et nécessitent un post-traitement. Les approches existantes de lissage gèrent souvent mal les obstacles dynamiques ou la replanification à haute fréquence, ce qui constitue la référence à laquelle ce travail se compare. La méthode s'appuie sur la génération de trajectoires par splines, technique classique en robotique pour le mouvement à jerk limité, en y ajoutant une gestion explicite des obstacles dynamiques et des garanties formelles d'arrêt sécurisé. Publiée en version révisée sur arXiv, elle ouvre la voie à des validations plus larges sur d'autres plateformes robotiques.

RecherchePaper
1 source
Robustesse de la manipulation robotique : fondations et perspectives
1389arXiv cs.RO 

Robustesse de la manipulation robotique : fondations et perspectives

Résumé pour l'article "Robustness of Robotic Manipulation: Foundations and Frontiers" : Une équipe de chercheurs publie sur arXiv une étude systématique consacrée à la robustesse de la manipulation robotique, un chantier resté jusqu'ici fragmenté entre sous-domaines qui n'utilisaient pas les mêmes définitions. Les auteurs proposent d'abord une définition formelle : la robustesse mesure la capacité d'un système de manipulation à atteindre son objectif malgré l'incertitude et la variation des conditions. Ils en dérivent ensuite deux formulations générales, l'une probabiliste, l'autre issue de la théorie du contrôle, avant de cartographier les mécanismes concrets qui produisent de la robustesse à chaque étage de la pile robotique : perception, planification, contrôle, apprentissage de politiques (policy learning) et conception matérielle. Chaque mécanisme est illustré par des travaux de référence, des fondations historiques aux publications récentes. Le papier revient aussi sur les métriques et protocoles d'évaluation existants, souvent hétérogènes, et se conclut par une liste de problèmes ouverts vers une robustesse comparable à celle des humains. L'enjeu dépasse l'exercice académique. Depuis deux ans, une génération de modèles VLA (vision-language-action) comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, Helix de Figure ou Optimus de Tesla revendique des capacités de manipulation généralistes, mais les annonces s'appuient sur des démonstrations et des métriques propres à chaque acteur, difficiles à comparer entre elles. Pour les intégrateurs et décideurs B2B qui doivent choisir une solution pour de la logistique ou de l'assemblage, disposer d'un cadre commun pour distinguer un modèle réellement robuste d'une démonstration soigneusement sélectionnée devient central, surtout face à l'écart bien documenté entre performance en vidéo et performance en déploiement réel. Cette synthèse s'inscrit dans une lignée qui remonte au contrôle robuste classique des années 1980-1990, avant que l'apprentissage par renforcement puis les politiques end-to-end n'ouvrent de nouvelles pistes dans les années 2010-2020, jusqu'au boom actuel des modèles fondation pour la robotique portés par des laboratoires comme Physical Intelligence, Nvidia, Google DeepMind ou Figure. En posant un vocabulaire et des critères communs, les auteurs cherchent moins à trancher un débat qu'à donner aux chercheurs et industriels un langage partagé pour comparer leurs approches, une étape jugée nécessaire avant toute standardisation sectorielle des tests de robustesse.

RecherchePaper
1 source
TacEvo : découverte d'architectures auto-évolutives pour la perception tactile robotique via une recherche qualité-diversité pilotée par LLM
1390arXiv cs.RO 

TacEvo : découverte d'architectures auto-évolutives pour la perception tactile robotique via une recherche qualité-diversité pilotée par LLM

Une équipe de chercheurs publie TacEvo (arXiv:2606.30109), un framework de découverte autonome d'architectures neuronales pour la perception tactile robotique. Les capteurs tactiles visuels comme le ViTacTip convertissent les déformations de surface en images pour inférer des forces de contact et des textures fines inaccessibles à la vision conventionnelle, mais les architectures réseau efficaces restent hautement spécifiques au capteur et à la physique du contact, imposant une itération manuelle intensive par des experts. TacEvo utilise un LLM pour générer des mutations et croisements au niveau du code, couplé à une boucle MAP-Elites (algorithme de qualité-diversité) qui maintient une population d'architectures élites diversifiées tout en privilégiant les prompts ayant produit les meilleures améliorations. Deux descripteurs comportementaux guident l'exploration : Architectural Diversity et Efficiency Ratio. Sur le ViTacTip, en régression de force et classification de réseaux de rainures, TacEvo atteint un taux de génération d'architectures entraînables de 96,0 % et 94,5 %, et améliore la fitness de validation de 56,1 % et 96,1 % sur 20 générations. Dans une évaluation haute-fidélité à 20 seeds, le framework atteint la parité avec la baseline expert en prédiction de force et la surpasse en classification fine de textures. Le résultat le plus significatif est la fiabilité de la génération autonome à plus de 94 %, prérequis non trivial pour industrialiser l'approche. Pour les équipes R&D travaillant sur des capteurs tactiles propriétaires comme Digit, GelSight ou XELA, la promesse est d'automatiser la phase d'exploration architecturale sans définir à l'avance un espace de recherche restreint, là où les NAS classiques comme DARTS ou ENAS restent contraints par leurs primitives prédéfinies. TacEvo s'inscrit dans un courant de NAS guidé par LLM initié notamment par FunSearch (DeepMind) et EvoPrompting, qui cherche à remplacer les espaces de recherche hand-crafted par une exploration ouverte au niveau du code. Le capteur ViTacTip utilisé comme banc d'essai est développé à l'Université de Bristol, acteur académique européen central sur la tactilité robotique. L'article est un preprint non encore soumis à peer-review, et les résultats restent à confirmer sur des capteurs et tâches variés ; les prochaines étapes naturelles seraient un benchmark multi-capteurs et une intégration dans des pipelines de manipulation dextre.

UELes équipes R&D européennes spécialisées en capteurs tactiles pourraient bénéficier du framework TacEvo pour automatiser l'exploration architecturale, le capteur de référence ViTacTip étant développé à l'Université de Bristol (UK).

RecherchePaper
1 source
ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme
1391arXiv cs.RO 

ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme

Des chercheurs ont publié le 30 juin 2026 un article de préprint (arXiv:2606.28804) présentant ViPSim, un framework de simulation destiné à entraîner et évaluer des systèmes Vision-Langage-Action (VLA) sans risque pour le matériel réel. Le problème central qu'adresse ViPSim est le "representation gap" : les modèles de monde incarné (Embodied World Models, EWMs) doivent traduire des actions en basse dimension (positions articulaires, vitesses) en vidéos haute résolution cohérentes sur de longues séquences. Sans correctif, cette asymétrie produit une dérive de trajectoire cumulée et des interactions robot-objet incohérentes dès qu'on dépasse quelques pas de simulation. Pour y remédier, ViPSim combine deux espaces complémentaires : un Visual Space qui fournit des ancrages géométriques explicites (projections pixel-alignées de la pose de l'effecteur, perspectives caméra, géométrie de scène assistée par la profondeur, masques morphologiques du robot) et un Parameter Space qui injecte les séquences d'action brutes et les matrices caméra pour guider précisément le mouvement. Les expériences rapportées montrent que l'approche est backbone-agnostic, c'est-à-dire indépendante de l'architecture de génération vidéo sous-jacente. L'enjeu industriel est direct : le principal frein à l'utilisation des EWMs comme bancs de test pour les VLA est précisément leur manque de fidélité géométrique sur des horizons longs, ce qui rend leurs évaluations peu fiables pour des tâches de manipulation complexe. ViPSim prétend résoudre ce verrou, et les résultats préliminaires indiquent une capacité émergente sur des objets déformables, notamment le pliage de tissu, un cas d'usage notoire pour mettre en échec les simulateurs rigides classiques. Le framework conserverait également des performances robustes dans des scénarios hors-distribution et en cross-embodiment, c'est-à-dire appliqué à des morphologies robotiques non vues à l'entraînement. Pour un intégrateur ou un équipementier cherchant à réduire les coûts de collecte de données réelles, un simulateur de ce type permettrait d'accélérer le cycle de validation des politiques VLA avant déploiement terrain. Il convient toutefois de nuancer : il s'agit d'un preprint académique sans validation industrielle publiée, et les vidéos de démonstration sélectionnées ne constituent pas une preuve de performance en production. Le contexte est celui d'une course effrénée à la simulation haute-fidélité pour robots incarnés, portée par la montée en puissance des architectures VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Ces modèles nécessitent des volumes massifs de données de démonstration, et la génération synthétique en est le principal levier de scalabilité. Des frameworks concurrents comme UniSim, IRASim ou Genesis s'attaquent au même problème avec des approches différentes, certains privilégiant la physique explicite, d'autres la génération neuronale pure. ViPSim se positionne sur la cohérence géométrique longue durée plutôt que sur le réalisme visuel brut, une niche encore peu couverte. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication actuelle : il s'agit pour l'instant d'une contribution de recherche ouverte, sans implémentation publique annoncée.

RechercheOpinion
1 source
Apprentissage de dynamiques transférables : des modèles d'action aux modèles du monde
1392arXiv cs.RO 

Apprentissage de dynamiques transférables : des modèles d'action aux modèles du monde

Des chercheurs ont publié en juin 2026 un préprint arXiv (2606.29501) décrivant A2World, un modèle de monde diffusion multi-vues conditionné par les actions, pré-entraîné sur de larges volumes de données de manipulation robotique avec annotations d'actions réelles. L'idée centrale est que prédire comment une action modifie visuellement une scène, plutôt que simplement générer des vidéos plausibles, force le modèle à capturer des dynamiques d'interaction réutilisables. Ce pré-entraînement produit ce que les auteurs appellent des "priors de dynamiques transférables". À partir des mêmes poids pré-entraînés, deux variantes sont dérivées : A2World-sim, adapté en simulateur spécialisé par tâche ou environnement, et A2World-policy, un modèle de prédiction jointe vidéo-action conditionné par des instructions visuelles. Les expériences sont validées sur des benchmarks de simulation et en conditions réelles, sans que les auteurs ne publient de métriques quantitatives précises dans le résumé. L'enjeu concret pour les équipes de robotique industrielle est le coût des données de rollout réel : A2World-sim vise à remplacer les passages physiques sur robot par des déroulements dans le modèle de monde, permettant une évaluation de politique à grande échelle et des analyses contrefactuelles ("que se passerait-il si...") sans mobiliser de hardware. C'est le noeud dur du problème sim-to-real : les simulateurs classiques (Isaac Sim, MuJoCo) échouent sur la fidélité visuelle et de contact, tandis qu'un modèle de monde appris sur des données réelles devrait, en théorie, hériter de la physique implicite du monde réel. A2World-policy s'inscrit dans la lignée des VLA (Vision-Language-Action models) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, en conditionnant la prédiction d'action sur le flux visuel et des instructions en langage naturel. Il s'agit toutefois d'un préprint non revu par les pairs, et les métriques présentées (benchmarks de simulation) restent à confirmer sur des déploiements réels à l'échelle. Ce travail s'inscrit dans une dynamique de recherche active sur les modèles de monde pour la robotique, portée depuis 2023-2024 par des approches comme UniSim (Google), RoboDreamer, ou Genie, qui toutes cherchent à découpler l'apprentissage de politique du coût de la collecte de données physiques. Physical Intelligence (pi-0, pi-0.5), Figure AI (Figure 02/03) et 1X Technologies misent sur des architectures VLA similaires pour la généralisation multi-tâches. La contribution spécifique d'A2World est de partager les poids pré-entraînés entre le simulateur et le modèle de politique, plutôt que de les traiter comme deux systèmes distincts. Les prochaines étapes attendues dans ce type de travaux sont la publication de benchmarks ouverts, une comparaison directe contre des rollouts réels, et, pour les acteurs industriels, la question de savoir si ces approches tiennent sur des environnements non structurés hors laboratoire.

IA physiqueOpinion
1 source
Modèles vision-langage pour la navigation de robots sociaux déployables : relier le raisonnement sémantique et le contrôle de bas niveau
1393arXiv cs.RO 

Modèles vision-langage pour la navigation de robots sociaux déployables : relier le raisonnement sémantique et le contrôle de bas niveau

Des chercheurs ont publié fin juin 2026 une étude de synthèse (arXiv:2606.28760) consacrée à l'intégration des modèles vision-langage (VLM) dans les systèmes de navigation sociale pour robots mobiles. Le papier, qui recense l'état de l'art dans ce domaine encore fragmenté, structure les approches existantes autour de trois composantes interdépendantes : le raisonnement de haut niveau assuré par le VLM, les modules de planification et de contrôle bas niveau, et les mécanismes intermédiaires qui assurent la traduction entre les deux couches. Les auteurs proposent en parallèle une feuille de route structurée couvrant l'ancrage spatial, les représentations intermédiaires, les évaluateurs sémantiques et les modules de contrôle, avec une revue des jeux de données et plateformes d'évaluation disponibles pour la navigation sociale. L'enjeu mis en évidence est précisément celui qui bloque le passage en production de nombreux robots de service : les méthodes classiques de navigation (SLAM, planification métrique, évitement d'obstacles) sont fiables mais aveugles aux normes sociales, aux intentions humaines et au contexte situationnel. Un robot qui calcule la trajectoire optimale dans un couloir d'hôpital ne sait pas, sans couche sémantique, qu'il coupe la route à un soignant pressé ou s'arrête trop près d'un patient. Les VLMs apportent ce raisonnement commun et la compréhension du langage naturel, mais leur latence et leur non-déterminisme les rendent difficiles à coupler directement à des boucles de contrôle temps-réel et safety-critical. L'article argumente que des architectures hybrides, VLM pour le raisonnement, contrôleurs classiques pour l'exécution, sont aujourd'hui la seule voie viable vers le déploiement. Ce travail s'inscrit dans un mouvement plus large d'hybridation entre fondation models et robotique embarquée, porté ces deux dernières années par des papiers comme RT-2 (Google DeepMind), SayCan (Everyday Robots) et les travaux de navigation sémantique de CMU et Stanford. Côté industriel, les plateformes de robots de service (Keenon, Pudu, Bear Robotics côté asie-pacifique ; Enchanted Tools en France avec Miroki) cherchent précisément à résoudre ce passage de l'interaction naturelle au mouvement contraint. Le survey ne décrit pas un système déployé mais un cadre de référence académique, à lire comme une cartographie des briques disponibles plutôt que comme une validation terrain.

UEEnchanted Tools (Miroki, France) est directement concerné par cette feuille de route : le survey valide l'approche hybride VLM + contrôle classique comme voie viable pour les robots de service sociaux, fournissant un cadre de référence utilisable par les équipes R&D européennes travaillant sur le déploiement en milieux contraints.

IA physiqueOpinion
1 source
AeroPlace-Flow : placement d'objets guidé par le langage pour manipulateurs aériens via prévision visuelle et flux d'objets
1394arXiv cs.RO 

AeroPlace-Flow : placement d'objets guidé par le langage pour manipulateurs aériens via prévision visuelle et flux d'objets

Des chercheurs ont publié sur arXiv (arXiv:2603.07744) AeroPlace-Flow, un framework de placement d'objets par langage naturel pour manipulateurs aériens, des drones équipés de bras robotiques. Le système prend en entrée des observations RGB-D de l'objet saisi et de la scène cible, ainsi qu'une instruction en langue naturelle, pour produire une trajectoire de placement exécutable sans coordonnées prédéfinies. Concrètement, AeroPlace-Flow génère d'abord une image objectif synthétique ("goal image") via un modèle d'édition d'images qui visualise la configuration finale souhaitée, puis ancre cette image dans l'espace métrique 3D par alignement de profondeur et raisonnement centré sur l'objet. Il en déduit un "object flow", un champ de déplacement 3D tenant compte des collisions, qui guide le manipulateur vers une pose de pose cohérente avec l'instruction et les contraintes de contact. Les expériences menées en simulation et en conditions réelles affichent un taux de succès moyen de 75% sur plateforme matérielle, sur des scénarios de placement variés. L'intérêt principal de cette approche réside dans son caractère "training-free" : contrairement aux pipelines classiques de manipulation aérienne qui nécessitent soit des coordonnées cibles codées en dur, soit un entraînement spécifique à chaque tâche, AeroPlace-Flow ne requiert aucune donnée d'apprentissage dédiée au placement. Pour un intégrateur ou un OEM développant des drones industriels à capacité de manipulation, cela réduit considérablement le coût de mise en service sur de nouveaux environnements. La combinaison de la prévoyance visuelle (foresight) et du raisonnement géométrique explicite représente également une alternative aux architectures VLA (Vision-Language-Action) entièrement end-to-end, dont le transfert sim-to-real reste problématique à grande échelle. La manipulation aérienne reste un domaine de recherche émergent, largement dominé par les travaux sur la saisie (grasping) et le contrôle en vol, le placement précis d'objets étant jusqu'ici peu étudié dans ce contexte. Des acteurs comme Aeroarms, LAAS-CNRS ou des équipes de ETH Zurich travaillent sur des architectures concurrentes, généralement contraintes à des poses cibles explicites. AeroPlace-Flow se positionne comme une couche de raisonnement sémantique au-dessus des pipelines de contrôle existants, compatibles avec un suivi de trajectoire standard. Il s'agit à ce stade d'un résultat de recherche avec validation expérimentale, sans déploiement industriel annoncé ni partenaire commercial identifié.

UEDes équipes européennes actives sur la manipulation aérienne, notamment LAAS-CNRS en France, pourraient s'appuyer sur cette approche sans entraînement pour accélérer leurs propres travaux sur le placement sémantique d'objets par drone.

IA physiquePaper
1 source
TACO : un cadre de test et vérification pour l'optimisation robuste de graphe de poses
1395arXiv cs.RO 

TACO : un cadre de test et vérification pour l'optimisation robuste de graphe de poses

Des chercheurs ont publié TACO (Test And Check Optimization), un framework open-source dédié à la robustification de l'optimisation de graphes de poses (PGO), pierre angulaire des systèmes SLAM (Simultaneous Localization and Mapping). Présenté dans un preprint arXiv (2606.29851), le système adresse un problème concret : les mesures aberrantes (outliers) issues d'associations incorrectes de reconnaissance de lieux, phénomène classique en environnements répétitifs (couloirs, entrepôts). TACO repose sur deux composants complémentaires. Le premier, IPC (Incremental Probabilistic Consensus), évalue en ligne la cohérence de chaque fermeture de boucle entrant dans le graphe. Le second, Switchable Outlier Sanitization, s'appuie sur les Switchable Constraints existantes pour purger périodiquement les mesures incohérentes qu'IPC aurait à tort intégrées. Sur des benchmarks 2D et 3D, TACO atteint un taux de succès supérieur à 90 % en 2D et 83 % en 3D, même avec un taux d'outliers pouvant atteindre 50 %, avec des temps de convergence moyens de 45 ms en 2D et 100 ms en 3D. Ces performances positionnent TACO comme une alternative crédible aux méthodes offline état de l'art, tout en restant déployable en temps réel, ce qui est rare dans ce segment. Pour les intégrateurs de robots mobiles (AMR, AGV) et les équipes SLAM embarqué, c'est un signal important : un pipeline PGO robuste aux outliers avec une latence inférieure à 100 ms ouvre la voie à des localisations fiables dans des environnements industriels mal contraints, sans nécessiter de post-traitement offline coûteux. Le fait que la robustesse soit atteinte sans modélisation explicite inlier/outlier simplifie aussi le tuning en production. Le PGO robuste est un champ actif depuis plus d'une décennie, avec des approches comme DCS (Dynamic Covariance Scaling), les Switchable Constraints de Sünderhauf, ou encore les méthodes basées M-estimateurs. TACO s'inscrit dans cette lignée en combinant une évaluation incrémentale probabiliste à une sanitisation rétrospective, là où la plupart des méthodes temps réel font l'un ou l'autre. Les concurrents directs incluent ROBIN, Graduated Non-Convexity (GNC) et ORB-SLAM3 pour le SLAM visuel 3D. Le code est publié en open source, ce qui facilitera l'intégration dans des stacks ROS existants et permettra à la communauté de valider les performances sur des jeux de données propriétaires.

UEFramework open-source intégrable dans les stacks ROS des intégrateurs AMR/AGV européens, sans impact institutionnel direct sur la France/UE.

RecherchePaper
1 source
Puis-je vous aider ? La proactivité dans la collaboration humain-robot en groupe
1396arXiv cs.RO 

Puis-je vous aider ? La proactivité dans la collaboration humain-robot en groupe

Des chercheurs ont publié sur arXiv (référence 2606.28469) une étude expérimentale portant sur le rôle de l'initiative robotique dans la collaboration humain-robot à plusieurs participants. Le protocole place des binômes humains en situation de résolution collaborative de puzzles, à l'intérieur d'un escape room instrumenté, en présence d'un robot humanoïde opérant selon deux modalités distinctes : un modèle réactif, où le robot ne répond que lorsqu'il est directement interpellé, et un modèle proactif, où il écoute en continu, contribue de façon autonome et relance l'interaction de sa propre initiative. Les résultats sont mesurés selon trois axes : performance de résolution de puzzles, fréquence des interactions, et évaluations subjectives via les échelles standardisées Godspeed et RoSAS. Le modèle proactif génère mécaniquement plus d'échanges, mais c'est le modèle réactif qui affiche le taux de complétion le plus élevé : 92,86 % contre 71,42 %. Ce résultat contre-intuitif est central pour quiconque déploie des robots collaboratifs dans un contexte industriel ou de service. L'intuition commune voudrait qu'un robot qui anticipe et prend des initiatives améliore la performance collective ; l'étude montre que ce n'est pas systématiquement le cas, et que la proactivité peut fragmenter l'attention, perturber la prise de tour de parole et dégrader la coordination du groupe. Plus significatif encore : l'effet de la modalité d'interaction dépend fortement du profil de l'utilisateur. Les participants ayant une expérience préalable des LLM résolvent les premiers puzzles plus vite en mode réactif ; ceux ayant déjà travaillé avec des robots, ou se déclarant introvertis, modifient leur évaluation des deux modèles de façon distincte. Pour un intégrateur ou un COO, cela signifie qu'il n'existe pas de configuration universellement optimale : le bon niveau d'initiative robotique dépend du profil des opérateurs et de la structure cognitive de la tâche. L'étude s'inscrit dans un corpus croissant de recherches en interaction humain-robot multi-parties (HRI), un champ qui prend de l'importance à mesure que les robots collaboratifs quittent les cellules isolées pour des environnements partagés et non structurés. L'escape room comme banc d'essai contrôlé pour l'HRI est une approche émergente qui permet de tester des dynamiques de groupe réalistes sans infrastructure industrielle lourde. Sur le plan concurrentiel, les questions d'initiative robotique concernent directement les plateformes de cobots sociaux (Boston Dynamics Spot, Furhat Robotics, mais aussi des acteurs européens comme Enchanted Tools avec Miroka) et les systèmes de guidage adaptatif dans la logistique. L'étude ne donne pas de suite opérationnelle immédiate, mais ses données suggèrent qu'une personalisation du niveau de proactivité selon le profil utilisateur, plutôt qu'un réglage global unique, constitue la piste de conception la plus prometteuse.

UELes résultats sur la proactivité robotique concernent directement des acteurs européens comme Enchanted Tools (Miroka) et les intégrateurs de cobots déployant des robots en environnements partagés non structurés.

RecherchePaper
1 source
Détection multi-classe d'humains et d'objets sur des bras robotiques par capteurs proprioceptifs
1397arXiv cs.RO 

Détection multi-classe d'humains et d'objets sur des bras robotiques par capteurs proprioceptifs

Une équipe de recherche a publié sur arXiv (référence 2508.02425) une étude portant sur la détection multi-classe de contacts en collaboration physique humain-robot (pHRC), testée sur le manipulateur Franka Emika Panda, l'un des cobots de référence pour la recherche académique. L'objectif : identifier en temps réel si le robot entre en contact avec un humain, un objet mou ou un objet dur, en utilisant uniquement la perception proprioceptive (couples articulaires, positions, vitesses) sans aucun capteur visuel externe. Un dataset dédié a été constitué sur ce bras à 7 degrés de liberté, puis trois architectures de réseaux de neurones ont été entraînées et comparées : LSTM, GRU et Transformers. Le meilleur modèle atteint 91,11 % de précision en test temps réel, avec une approche de prétraitement par fenêtre glissante identifiée comme optimale pour cette analyse de séries temporelles. Ce résultat marque une progression significative par rapport aux classifieurs binaires (humain/non-humain ou mou/dur) qui constituaient jusqu'ici l'état de l'art dans ce domaine. Passer à trois classes augmente la granularité de l'analyse de contact, ce qui est directement utile pour des applications industrielles : un robot qui distingue un opérateur d'un outil ou d'une pièce peut adapter sa réponse (arrêt d'urgence, réduction de vitesse, reconfiguration de trajectoire) de façon bien plus fine. L'approche purement proprioceptive est également un avantage pratique majeur : elle ne nécessite ni caméra supplémentaire ni calibration visuelle, ce qui simplifie l'intégration sur des cellules robotisées existantes. La précision de 91 % en conditions temps réel reste toutefois à valider sur des scénarios industriels variés au-delà du protocole de collecte de données décrit. Le Franka Emika Panda, désormais commercialisé sous la marque Franka Robotics après le rachat par Agile Robots, est une plateforme quasi-standard pour la recherche en pHRC grâce à son contrôle en couple natif. Ce travail s'inscrit dans un axe de recherche actif qui cherche à rivaliser avec les approches par vision (détection de contact par caméra RGB-D ou tactile) en misant sur la richesse des signaux internes du robot. Les concurrents directs incluent des travaux utilisant des peaux tactiles (BioTac, iCub) ou des réseaux de neurones appliqués aux données de force/couple de robots Universal Robots ou Kuka. La prochaine étape naturelle serait l'extension à des environnements moins contrôlés et à des robots à payload plus élevé pour valider le transfert sim-to-real de ces modèles.

UEFranka Robotics, entreprise européenne éditrice du Panda (plateforme quasi-standard des labos EU), est l'hôte direct de ces travaux, ce qui facilite un transfert technologique vers les intégrateurs et chercheurs européens en sécurité cobot sans capteurs additionnels.

RecherchePaper
1 source
MPC-Injection : orienter le RL de locomotion hors-politique vers les bassins d'attraction du contrôleur
1398arXiv cs.RO 

MPC-Injection : orienter le RL de locomotion hors-politique vers les bassins d'attraction du contrôleur

Des chercheurs ont publié en juin 2026 sur arXiv une méthode baptisée MPC-Injection, conçue pour résoudre un problème récurrent dans l'entraînement par renforcement appliqué à la locomotion robotique : la convergence vers des comportements localement optimaux mais inutilisables en production, comme des membres qui vibrent en place ou un robot qui progresse en se traînant sur son torse. La technique consiste à injecter dans le replay buffer, la mémoire d'expériences utilisée par les algorithmes off-policy, des transitions générées par un contrôleur MPC (Model Predictive Control) résolvant le même problème de décision séquentielle. Le comportement préféré du concepteur est ainsi transféré à la politique apprise, non par une modification de la récompense, mais uniquement par le biais de la distribution des états explorés. Les auteurs valident l'approche sur un marcheur 2D en simulation, puis en transfert sim-to-real sur le quadrupède Go2 de Unitree Robotics, un robot commercialement disponible. L'intérêt principal est la simplicité du surcoût. Là où le reward shaping classique exige jusqu'à vingt et un termes de récompense soigneusement ajustés, MPC-Injection produit des allures qualitativement comparables avec une récompense à un ou deux termes seulement. Contrairement à l'adversarial motion prior (AMP) et aux méthodes d'imitation adversariale, la méthode ne nécessite ni discriminateur, ni retargeting cinématique, ni objectif auxiliaire. C'est un résultat notable : il suggère que la distribution des états du replay buffer est un levier de guidage aussi puissant que la forme de récompense ou l'imitation explicite, ce qui simplifie considérablement le pipeline d'ingénierie pour les équipes qui déploient des robots sur du matériel réel. La méthode s'inscrit dans un effort plus large de la communauté pour réduire le sim-to-real gap sans multiplier les hypothèses sur la dynamique du robot. Le Go2 de Unitree est devenu un banc de test de référence pour ces travaux, utilisé notamment dans des recherches concurrentes sur les VLA (Vision-Language-Action models) et les politiques de locomotion neuronales. Les alternatives directes, reward shaping multi-termes, AMP de Berkeley, méthodes de retargeting par mocap, ont toutes un coût d'implémentation ou de collecte de données plus élevé. MPC-Injection se positionne comme un pont pragmatique entre contrôle classique et apprentissage, particulièrement pertinent pour les équipes disposant déjà d'un contrôleur MPC opérationnel et souhaitant affiner une politique RL sans repartir de zéro sur la définition de récompense.

RecherchePaper
1 source
RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes
1399arXiv cs.RO 

RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes

Des chercheurs ont déposé en juin 2026 sur arXiv (référence 2606.27036) RelAfford6D, un framework sans entraînement pour la manipulation robotique d'objets articulés. Le système s'appuie sur un graphe d'affordances 6D relationnel : à partir d'une consigne en langage naturel, il déduit une topologie sémantique reliant la partie principale d'interaction d'un objet à son ancre physique. Ces noeuds topologiques sont ensuite convertis en poses métriques précises dans l'espace SE(3), soit six degrés de liberté complets en position et orientation, via des modèles de vision fondamentaux pré-entraînés. L'exécution est formulée comme un problème de satisfaction de contraintes cinématiques : le robot génère des trajectoires continues en suivant des variétés physiques strictement définies, qu'il s'agisse d'orbites rotoïdes (rotation) ou prismatiques (translation). Un mécanisme de suivi en boucle fermée assure la replanification en temps réel face aux perturbations. L'approche tranche avec la majorité des politiques data-driven actuelles, comme les VLA basés sur l'imitation ou les méthodes à affordances latentes, qui extraient des points de contact isolés sans contraintes cinématiques explicites. En formulant la manipulation comme satisfaction de contraintes, RelAfford6D obtient des taux de succès zero-shot supérieurs aux baselines data-driven testées, avec une généralisation inter-catégories documentée sur des objets articulés variés (tiroirs, portes, manettes) aussi bien en simulation que dans des environnements physiques réels. Pour les intégrateurs industriels, l'absence d'entraînement spécifique à la tâche est significative : le framework peut s'adapter à de nouveaux mécanismes sans collecter de données de démonstration supplémentaires. La manipulation d'objets articulés en open-world reste l'un des verrous majeurs de la robotique de service et industrielle. Les approches récentes à base de VLA ont progressé sur la flexibilité sémantique mais peinent à garantir la précision géométrique requise pour des mécanismes contraints comme des vannes, portes ou tiroirs industriels. RelAfford6D s'inscrit dans une tendance émergente combinant fondations visuelles pré-entraînées et raisonnement géométrique analytique, sans fine-tuning coûteux. Parmi les travaux concurrents figurent CabiNet, les méthodes à affordance implicite comme GNFactor ou F3RM, et les approches VLA récentes telles que Pi-0. Ce preprint constitue une démonstration académique validée sur banc réel, sans partenariat industriel ni timeline de déploiement annoncé à ce stade.

RecherchePaper
1 source
Agents omnimodaux incarnés : des compétences isolées à l'autonomie physique du quotidien
1400arXiv cs.RO 

Agents omnimodaux incarnés : des compétences isolées à l'autonomie physique du quotidien

OmniAct est un framework de recherche publié le 26 juin 2026 sur arXiv (2606.27251) qui propose une architecture pour agents robotiques capables d'opérer de façon persistante sur des tâches longues dans des environnements non structurés. Le système repose sur trois couches hiérarchiques asynchrones : un planificateur sémantique multimodal qui route les actions entre domaines cyber (APIs, IoT) et physiques (manipulation, navigation), un module de mémoire adaptatif à compression événementielle garantissant une croissance sous-linéaire du contexte, et un moteur de préemption visuelle asynchrone qui referme la boucle sémantique pendant l'exécution physique. Évalué sur 40 tâches réelles à long horizon sur deux plateformes robotiques coordonnant quatre dispositifs IoT, OmniAct maintient une consommation de tokens quasi-stable en deçà de 100 000 tokens accumulés et élève des modèles open-weight à un niveau de performance comparable aux modèles propriétaires. Ce résultat adresse trois défaillances structurelles bien connues dans le domaine : les planificateurs VLM (Vision-Language Model) manquent d'un espace d'action cyber-physique unifié, les frameworks d'agents existants accumulent du contexte de façon non bornée jusqu'à dégrader la cohérence temporelle sur les longues sessions, et les politiques VLA (Vision-Language-Action) s'exécutent classiquement en boucle ouverte sans détecter leurs propres défaillances. La préemption visuelle asynchrone est l'apport le plus différenciant : le robot peut interrompre et reconfigurer une séquence en cours sans attendre sa terminaison, ce qui est précisément le comportement requis dans un déploiement industriel réel. Pour un intégrateur ou un COO industriel, la démonstration qu'une architecture bien conçue suffit à hisser des modèles open-weight au niveau propriétaire modifie le calcul économique du déploiement : moins de dépendance aux fondations coûteuses de GPT-4o ou Gemini. Ce travail s'inscrit dans une compétition dense autour des architectures pour agents embodied à long horizon. Des frameworks concurrents comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) ciblent également la généralisation physique, mais restent principalement centrés sur la manipulation. OmniAct se distingue en intégrant explicitement le domaine cyber dans la boucle d'action, rapprochant l'architecture des besoins industriels où un robot interagit aussi avec des systèmes d'information et des capteurs IoT. Nuance importante : il s'agit d'un preprint arXiv, non encore évalué par les pairs, sans déploiement commercial annoncé ni divulgation des deux plateformes robotiques utilisées, ce qui limite la reproductibilité des résultats à ce stade.

UELes intégrateurs robotiques européens pourraient réduire leur dépendance aux fondations propriétaires américaines (GPT-4o, Gemini) si l'architecture OmniAct se confirme après révision par les pairs.

IA physiqueOpinion
1 source