Aller au contenu principal

Actualités robotique — page 33

4 468 articles au fil, du plus récent au plus ancien.

RIPA : attaques par injection de prompt via vecteur sensoriel sur robots ROS 2 pilotés par LLM
1601arXiv cs.RO 

RIPA : attaques par injection de prompt via vecteur sensoriel sur robots ROS 2 pilotés par LLM

Des chercheurs ont publié en juin 2026 RIPA, première étude empirique systématique des attaques par injection de prompt délivrées via le pipeline sensoriel de robots pilotés par LLM sous ROS 2. Le protocole couvre 100 exécutions indépendantes par variante sur cinq modèles appartenant à quatre familles : DeepSeek-V4-Flash, Llama-3-8B-Instruct-Lite, Llama-3.3-70B-Instruct-Turbo, Qwen 2.5-7B-Instruct-Turbo et Gemma-3n-E4B, couvrant une plage de 4 à 284 milliards de paramètres. Trois canaux d'injection sensorielle ont été testés : vision par OCR, audio via Whisper STT, et empoisonnement de contexte LiDAR injecté directement au niveau du system prompt du LLM. Ce troisième canal, qui fabrique des données d'obstacles fictifs dans la représentation d'état de l'environnement, atteint un taux de succès d'attaque (ASR) de 100 % sur DeepSeek-V4-Flash. Le résultat le plus contre-intuitif concerne la hiérarchie des modèles : Llama-3.3-70B affiche 100 % d'ASR toutes variantes confondues, tandis que Llama-3-8B et Qwen 2.5-7B résistent aux injections directes (0 % d'ASR), et que Gemma-3n-E4B à seulement 4 milliards de paramètres présente le même profil de vulnérabilité que le modèle 70B. Pour les intégrateurs et décideurs qui déploient des robots autonomes sous LLM, ce travail invalide un présupposé structurant : la taille du modèle n'est pas un indicateur fiable de robustesse face aux attaques adversariales. Un 70B peut être plus exposé qu'un 7B. Plus préoccupant pour les systèmes industriels à navigation LiDAR ou les robots mobiles autonomes (AMR), le canal 3 démontre qu'un attaquant peut détourner le comportement du robot en corrompant uniquement les données capteurs, sans jamais toucher aux entrées textuelles directes. La surface d'attaque réelle dépasse donc largement ce qu'anticipent les architectures de sécurité actuellement déployées en production. Les auteurs proposent un pare-feu sémantique hybride ramenant l'ASR à 0 % contre les patterns d'injection connus, sans faux positif sur un ensemble bénin préliminaire de 20 commandes, mais qui cède à un taux de contournement de 10,2 % face aux attaques obfusquées (58 essais sur 570, sur 19 payloads répartis en 5 catégories), révélant un écart critique entre défenses basées sur des règles et couche sémantique. ROS 2 est le middleware de référence des robots industriels et de service, et la montée en puissance des architectures VLA (Vision-Language-Action) pour piloter manipulateurs et AMR rend ces vecteurs directement opérationnels à court terme. Le code, les données et les résultats sont disponibles publiquement, abaissant mécaniquement le seuil d'exploitation. Les prochaines étapes logiques portent sur des contre-mesures au niveau middleware ROS 2 et des évaluations sur des VLA déployés en conditions réelles.

Societe/EthiqueActu
1 source
Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose
1602arXiv cs.RO 

Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose

Une équipe de chercheurs publie sur arXiv (référence 2506.05808v2) une étude expérimentale portant sur le comportement oculaire des opérateurs humains lors de sessions de téleopération robotique, dans le cadre spécifique de tâches de saisie et de dépose (pick-and-place). Le protocole expérimental compare plusieurs dispositifs de démonstration, des interfaces qui émulent l'incarnation et les conditions visuelles d'un robot, et mesure précisément où le regard humain se fixe pendant l'exécution. Les résultats montrent que certaines propriétés des dispositifs provoquent un déplacement systématique de l'attention visuelle : l'opérateur cesse de regarder les indices liés à l'objectif de la tâche (les objets à manipuler) pour se concentrer sur les indices de supervision du contrôle (l'effecteur terminal, c'est-à-dire la pince ou le bras du robot). Ce n'est pas un effet marginal, il est suffisamment prononcé pour mesurer son impact en aval sur les modèles d'apprentissage. L'enjeu pour les équipes qui construisent des pipelines d'imitation learning est direct. L'apprentissage par imitation, qui fonde une part croissante des architectures VLA (Vision-Language-Action) comme Pi-0, GR00T N2 ou OpenVLA, repose sur des volumes massifs de données de démonstration humaine, dont le coût de collecte est élevé. Une hypothèse structurante du domaine est que le regard humain encode des informations cognitives de haut niveau, priorité aux objets, anticipation de la trajectoire, que les modèles peuvent exploiter pour généraliser. Or cette étude montre que, selon le dispositif utilisé, ce signal se dégrade au point de faire chuter les performances des modèles gaze-based en dessous des baselines sans information oculaire. En d'autres termes, le choix du matériel de collecte de données n'est pas neutre : il peut silencieusement empoisonner le signal superviseur. Ce travail s'inscrit dans un débat actif autour de la qualité versus la quantité des données de démonstration, dans un secteur où Physical Intelligence, Hugging Face (LeRobot) et des laboratoires comme Stanford (ALOHA) ou Berkeley (DROID) investissent massivement dans des infrastructures de collecte standardisées. La question de quel dispositif utiliser, manette, bras maître, interface VR, exosquelette, n'avait jusqu'ici été abordée que sous l'angle ergonomique ou de la fidélité de contrôle. Cette étude introduit une nouvelle dimension : l'effet du dispositif sur la qualité du signal cognitif implicite, avec des implications directes pour la conception des futures campagnes de collecte de données à grande échelle.

RechercheOpinion
1 source
Audit des robots sociaux pilotés par des LLM selon des gradients moraux culturels
1603arXiv cs.RO 

Audit des robots sociaux pilotés par des LLM selon des gradients moraux culturels

Des chercheurs ont publié sur arXiv (réf. 2606.28345) un cadre d'audit en gradient pour évaluer le comportement moral des LLMs embarqués dans des robots sociaux selon les cultures. L'étude porte sur quatre modèles de langage testés dans quatre paires pays-langue, sous quatre régimes de prompting différents, soit 57 600 décisions analysées. Les scénarios, dérivés de neuf revues de littérature en robotique sociale couvrant plus de 8 000 articles, transposent la logique du Moral Machine Experiment, originellement centré sur "qui épargner", vers des dilemmes d'assistance prioritaire : qui aider en premier, entre un groupe nombreux et un petit, entre une personne âgée et une jeune, entre statut élevé et statut bas. Ces scénarios couvrent les domaines des soins, de l'éducation et des services, avec des identités contrôlées pour isoler l'effet culturel. Les résultats révèlent des biais systématiques et asymétriques : la calibration des modèles est presque deux fois plus précise pour les décisions en langues occidentales que pour le chinois ou le japonais. Les LLMs tendent vers un déterminisme élevé sur les dilemmes "majorité d'abord", effaçant de fait les nuances culturelles transversales. La sensibilité partielle aux normes d'âge et de statut risque concrètement d'exclure des minorités de l'accès à l'assistance robotique. Ce n'est pas un problème de prompting : seuls les prompts avec exemples contrastifs améliorent consistamment le suivi des gradients culturels, tandis que les prompts "raisonnement seul" peuvent aggraver les écarts. Les auteurs concluent que les facteurs architecturaux du modèle constituent un levier plus robuste que l'ingénierie de prompt pour corriger ces dérives. L'enjeu est de taille alors que les robots sociaux pilotés par LLM entrent en déploiement dans des contextes de soins aux personnes âgées, d'accueil hospitalier ou d'éducation, en Asie comme en Europe. Cette recherche s'inscrit dans la continuité du Moral Machine Experiment du MIT, dont elle étend la méthodologie aux contextes incarnés et multilingues, territoire largement inexploré par les audits existants, quasi exclusivement anglophones. Les auteurs plaident pour que ces audits plurilingues et pluralistes deviennent une étape obligatoire avant tout déploiement de robot LLM-gouverné, au même titre que les tests de sécurité physique.

RechercheActu
1 source
Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques
1604arXiv cs.RO 

Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques

Une équipe du CIIRC (Czech Institute of Informatics, Robotics and Cybernetics, Prague) publie sur arXiv un framework appelé See & Switch, qui étend la programmation par démonstration (PbD) aux tâches robotiques conditionnelles basées sur la vision. Le système représente une tâche comme un graphe de segments de compétence reliés par des états de décision : lors de l'exécution, un module appelé Switcher analyse les images d'une caméra embarquée dans la main (eye-in-hand) pour sélectionner la branche à suivre ou signaler une situation inconnue nécessitant une nouvelle démonstration. En cas d'erreur ou de cas imprévu, l'opérateur peut intervenir via enseignement kinesthésique, joystick ou gestes manuels. Le système a été évalué sur trois tâches de manipulation dextère impliquant 8 utilisateurs novices, pour un total d'environ 900 séquences d'exécution sur robot réel. Les résultats mesurés sur des fenêtres temporelles définies par l'utilisateur atteignent 90,6 % de précision dans la sélection de branche, et une détection d'anomalies supérieure à 90 % dans 47 des 79 états de décision testés. Ces résultats sont pertinents pour les intégrateurs industriels qui cherchent à déployer la PbD dans des environnements variables sans passer par la programmation explicite de chaque variante. Le principal verrou du secteur est que les systèmes PbD classiques supposent un environnement fixe : un changement de disposition, d'orientation de pièce ou de contexte casse le programme. See & Switch traite ce problème au niveau du graphe de tâche plutôt qu'au niveau du modèle de perception, ce qui le rend modulaire et extensible sans réentraîner un réseau complet. La nuance importante : les performances de branchement sont évaluées en mode offline sur des fenêtres déjà identifiées, ce qui isole le classificateur visuel des erreurs de timing réelles, les chiffres de 90 % ne reflètent donc pas directement la robustesse end-to-end en déploiement non supervisé. La PbD a connu un regain d'intérêt fort depuis 2022 avec les approches VLA (Vision-Language-Action) portées par des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou ACT (Action Chunking with Transformers). See & Switch se positionne différemment : il n'utilise pas de grand modèle pré-entraîné mais une architecture légère et interprétable, orientée vers l'enseignement interactif sur site par du personnel non expert. Les travaux proviennent du groupe ImitRob au CIIRC, qui publie régulièrement sur la PbD depuis plusieurs années. Le code et les données sont disponibles publiquement. La prochaine étape logique serait de coupler ce graphe de décision avec un backbone de perception plus robuste, ou de tester la scalabilité sur des cellules industrielles multi-postes.

FR/EU ecosystemePaper
1 source
Chronos : cadre à historique complet guidé par la physique pour la manipulation non markovienne à long horizon
1605arXiv cs.RO 

Chronos : cadre à historique complet guidé par la physique pour la manipulation non markovienne à long horizon

Une équipe de recherche a publié fin juin 2026 sur arXiv (2606.30318) un framework appelé Chronos pour résoudre un problème fondamental des politiques de manipulation robotique : leur incapacité à mémoriser l'historique d'exécution d'une tâche. Chronos traite chaque observation passée, capteur proprioceptif et image, comme un token temporel aligné sur le pas de contrôle physique, et propage cet historique complet via un modèle d'espace d'états sélectif (SSM). Ce contexte causal conditionne un prior d'action multimodal appris par IMLE (implicit maximum likelihood estimation), raffiné par un pont de Schrödinger du second ordre qui prédit des champs d'accélération pour des trajectoires plus lisses. Sur RMBench, benchmark qui exige la mémorisation de la phase courante de la tâche, Chronos atteint 73,6 % de succès moyen contre 11,2 % pour pi0.5 de Physical Intelligence, soit +62,4 points et un facteur 6,6x, avec dix fois moins de paramètres. Il dépasse également le VLA à mémoire explicite Mem-0 de 22,8 points en utilisant 30x moins de paramètres. En conditions réelles, sur quatre tâches bras-droit/bras-gauche avec une unique caméra RGB, Chronos obtient 78 % de succès global et 72 % sur les sous-tâches mémoire-dépendantes, là où pi0.5 plafonne à 7 % global et 0 % sur ce sous-ensemble. Ces résultats remettent en cause une hypothèse courante dans les politiques d'imitation généralisées : que l'observation courante, complétée d'une courte fenêtre temporelle, suffit à conditionner l'action correcte. Pour des tâches à horizon long avec dépendance d'état, comme l'assemblage séquentiel ou le pick-and-place conditionnel, cette approximation markovienne génère des ambiguïtés résolues à tort. Chronos montre qu'élever l'historique complet au rang d'état latent de la politique améliore substantiellement la robustesse sim-to-real. La compacité du modèle est également un avantage concret pour les équipes qui déploient des politiques embarquées sur calculateurs edge. Ce travail s'inscrit dans une vague remettant en question l'architecture VLA post-RT-2, face à des modèles comme pi0.5 de Physical Intelligence et GR00T N2 de NVIDIA, qui dominent les benchmarks de manipulation générale avec des fenêtres d'attention bornées sans mémoire d'état explicite. L'approche SSM de Chronos se rapproche des architectures récurrentes linéaires de type Mamba appliquées au contrôle robotique. Les auteurs évaluent sur 16 tâches simulées et 4 tâches réelles, mais ne précisent ni plateforme matérielle cible ni calendrier de déploiement industriel, ce qui classe ce travail dans la catégorie recherche publiée et non produit disponible.

IA physiqueOpinion
1 source
Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle
1606arXiv cs.RO 

Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle

Des chercheurs ont publié sur arXiv (preprint 2606.30456) une évaluation du transfert de modèles VLA (Vision-Language-Action) vers un bras manipulateur UR5e d'Universal Robots en conditions réelles. Deux modèles ont été mis à l'épreuve : OpenVLA et sa variante OpenVLA-OFT, fine-tunés sur des données collectées directement sur le robot physique et converties au format RLDS (Robot Learning Dataset Specification), un standard de facto dans la communauté robotique. L'équipe a construit une chaîne complète comprenant l'acquisition de données sur robot réel, un workflow de conversion de dataset compatible RLDS, une infrastructure de fine-tuning et d'inférence, ainsi qu'un protocole de validation systématique des représentations d'actions et des interfaces de contrôle. Le résultat central contredit une hypothèse répandue dans la recherche VLA : des métriques offline prometteuses ne se traduisent pas nécessairement en comportement stable en boucle fermée sur le système physique. Cet écart entre indicateurs de validation et exécution réelle n'est pas principalement imputable à la capacité intrinsèque des modèles. Il est fortement conditionné par la sémantique des actions (comment sont encodées les commandes moteur), les conventions de référentiels de coordonnées, l'alignement temporel entre la vision et les sorties de contrôle, la cohérence du prétraitement d'image, et la couverture du dataset d'entraînement. La conclusion opérationnelle est directe : pour des intégrateurs industriels, augmenter la taille du modèle VLA n'est pas le levier prioritaire ; c'est la maîtrise du pipeline données-modèle-contrôle dans son ensemble qui détermine la fiabilité du déploiement, un déplacement de paradigme du problème de modèle vers un problème de système. Ce travail s'inscrit dans un contexte d'accélération marquée autour des VLA, portée par des modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) ou encore ACT et Diffusion Policy, qui promettent une généralisation des politiques de manipulation via des architectures multimodales entraînées à large échelle. La plupart des démonstrations publiées restent toutefois en environnement contrôlé, et les conditions précises du passage au déploiement réel sont rarement documentées avec rigueur. En s'appuyant sur une plateforme reproductible et des formats ouverts (UR5e, RLDS), cette étude fournit un cadre méthodologique directement transférable, utile pour les équipes cherchant à qualifier leurs pipelines VLA avant mise en production, y compris côté européen où des acteurs comme Enchanted Tools travaillent sur des approches similaires de généralisation de politiques de manipulation.

IA physiqueOpinion
1 source
Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels
1607arXiv cs.RO 

Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels

Des chercheurs ont publié sur arXiv (2508.12435) une étude démontrant qu'un robot industriel peut reconnaître des gestes tactiles humains en exploitant uniquement ses capteurs articulaires intégrés, sans aucun capteur externe. Implémentée sur un bras Franka Emika Research (7 DOF), l'approche s'appuie sur des architectures CNN évaluées sur un dataset collecté spécifiquement pour l'expérience. Deux méthodes ont atteint plus de 95 % de précision en détection de contact et classification de gestes : STFT2DCNN, qui applique une transformée de Fourier à court terme pour générer des spectrogrammes 2D, et STT3DCNN, qui exploite des représentations temps-fréquence tridimensionnelles. La variable déterminante n'est pas le choix d'architecture CNN mais la représentation des données : passer des séries temporelles brutes aux spectrogrammes fait bondir les performances de façon significative. L'implication industrielle est directe. Équiper un robot d'une peau tactile ou de caméras supplémentaires pour détecter l'intention humaine coûte cher, complexifie l'intégration et fragilise la maintenance. Prouver que les couples et positions articulaires déjà remontés par le contrôleur suffisent à atteindre 95 % de précision ouvre une voie de déploiement à coût quasi nul pour la collaboration homme-robot dans les cellules existantes. Les modèles spectraux montrent également une meilleure généralisation à de nouvelles configurations articulaires, ce qui est un signal positif pour des applications où le robot change fréquemment de posture de travail. Cela dit, les performances sont mesurées en laboratoire sur un seul modèle de robot et un dataset maison dont la taille et la diversité ne sont pas précisées dans l'abstract, ce qui invite à la prudence avant de conclure à une généralisation industrielle immédiate. La reconnaissance tactile sans peau robotique est un chantier actif depuis plusieurs années, notamment dans les labos qui travaillent sur la conformance mécanique (robots cobots comme le Franka, UR, ou le Kinova). Des approches concurrentes s'appuient sur des capteurs de force-couple au poignet (ATI, Robotiq FT300), des peaux à électrodes capacitives, ou la vision RGB-D pour inférer l'intention de contact, chacune avec un surcoût matériel substantiel. Ce travail positionne les signaux proprioceptifs comme une alternative viable et souligne que le verrou n'est pas hardware mais algorithmique. Les prochaines étapes probables : validation sur d'autres plateformes (UR10, KUKA iiwa), extension à des gestes plus complexes, et tests en conditions industrielles réelles avec bruit vibratoire ambiant.

RecherchePaper
1 source
Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées
1608arXiv cs.RO 

Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées

Des chercheurs ont déposé fin juin 2026 sur arXiv (réf. 2606.28529) une étude qui remet en question une hypothèse centrale de l'optimisation des modèles robotiques de fondation : supposer qu'une latence d'inférence réduite par pas d'action améliore mécaniquement les performances à l'échelle de la tâche. Le papier introduit TISED (Task-level Inference Speedup Effect Decomposition), un cadre analytique unifiant les techniques "avec perte" couramment appliquées aux modèles embarqués, notamment la quantization, l'élagage (pruning) et l'inférence asynchrone. L'étude documente trois paradoxes sur deux familles de tâches : sur les tâches statiques, l'optimisation peut allonger le temps d'exécution total même quand la latence par action diminue ; sur les tâches dynamiques, une compression modérée peut faire monter le taux de succès au-dessus de la ligne de base non-optimisée ; et l'emplacement du point d'équilibre optimal dépend de la configuration matérielle du robot. Ce résultat interroge directement les équipes déployant des VLA (Vision-Language-Action) en production, qu'il s'agisse de bras manipulateurs en usine ou de robots humanoïdes en entrepôt. L'industrie a massivement adopté la quantization et le pruning en supposant un arbitrage simple : un peu de qualité d'action contre une réduction de latence et de coût de calcul. TISED montre que ce compromis est trompeur. Sur les tâches statiques à longues séquences, la dégradation par pas s'accumule et peut effacer le gain de vitesse global. Sur les tâches dynamiques, la boucle fermée propre à l'exécution robotique crée des dynamiques que les benchmarks statiques ne capturent pas, ce qui explique pourquoi un modèle légèrement compressé peut paradoxalement mieux performer en répondant plus fréquemment à l'environnement. Ce travail s'inscrit dans la course à l'inférence rapide portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous contraints à tourner sur du matériel embarqué limité. L'enjeu est particulièrement critique pour les acteurs qui visent un déploiement à grande échelle, comme Figure AI dans ses usines BMW, ou les plateformes AMR européennes comme Exotec. TISED reste à ce stade un preprint non évalué par les pairs, sans validation publiée sur du matériel physique ; les prochaines étapes naturelles seraient une confrontation avec des benchmarks standard comme RoboMimic ou Calvin, et des tests sur des plateformes réelles comme Unitree ou Franka.

RechercheOpinion
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
1609arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires
1610arXiv cs.RO 

AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires

Des chercheurs ont publié le 30 juin 2026 AnyBody (arXiv:2606.29209), un contrôleur unitaire pour humanoïdes capables de piloter l'ensemble du corps à partir d'un sous-ensemble arbitraire de keypoints (points de repère anatomiques) défini au moment du déploiement. La méthode articule trois briques : un tracker "enseignant" entraîné sur un large corpus de mouvements humains non structurés, distillé vers un student encodeur-décodeur déterministe dont l'espace latent est une sphère unitaire, puis un encodeur transformer par keypoints exploitant le masked self-attention pour accepter n'importe quelle combinaison de marqueurs corporels. Un correcteur résiduel léger dans l'espace latent permet ensuite d'adapter le décodeur figé à des tâches aval spécifiques. Les expériences couvrent le suivi de mouvements humains à grande échelle depuis des keypoints partiels, la télé-opération flexible, la locomotion, l'écriture dans les airs et l'atteinte d'obstacles. Ce travail s'attaque à deux verrous majeurs du contrôle physique des humanoïdes. Les pipelines classiques de retargeting depuis la capture plein corps (full-body mocap) sont coûteux et sujets aux erreurs, ce qui freine la collecte de données à l'échelle nécessaire à l'apprentissage par renforcement. Les architectures hiérarchiques qui dissocient contrôle du haut et du bas du corps sacrifient quant à elles la coordination globale indispensable à la loco-manipulation, c'est-à-dire la capacité à marcher et manipuler simultanément. AnyBody résout les deux en apprenant une représentation latente unique interrogeable par n'importe quel sous-ensemble de keypoints, sans retraining. Pour les intégrateurs, cela ouvre la voie à une télé-opération allégée (quelques marqueurs suffisent) et à des interfaces variées : vision monoculaire, IMU ou exosquelette partiel. Le contrôle physique des humanoïdes se partage aujourd'hui entre approches simulation-retargeting (PHC, OmniH2O, HOVER) et modèles vision-langage-action (VLA). AnyBody s'inscrit dans la première famille mais supprime la contrainte du mocap complet, convergeant vers des travaux comme HumanVid qui exploitent des supervisions partielles. Cette publication académique n'implique pas directement d'acteur commercial, mais ses enjeux concernent Figure AI (Figure 03), Agility Robotics (Digit), Boston Dynamics (Atlas), Apptronik (Apollo), et côté français Wandercraft, dont le contrôle de marche assistée repose précisément sur ce type de coordination corps entier. La validation sur hardware réel à grande échelle reste la prochaine étape critique avant tout transfert industriel.

IA physiquePaper
1 source
Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique
1611arXiv cs.RO 

Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique

Une équipe de chercheurs présente RoboTracer, un modèle de vision-langage (VLM) 3D permettant aux robots de tracer des trajectoires dans l'espace physique en raisonnant sur des mesures métriques concrètes. Publié en version 3 sur arXiv (2512.13660, décembre 2025), le système combine référencement spatial 3D et mesure de distance via un encodeur universel et un décodeur à supervision par régression, affiné d'abord en apprentissage supervisé (SFT) puis par renforcement (RFT) avec des récompenses intermédiaires sensibles aux métriques. Le dataset d'entraînement TraceSpatial regroupe 30 millions de paires question-réponse sur scènes intérieures, extérieures et de manipulation, avec des chaînes de raisonnement atteignant 9 étapes. Sur le benchmark TraceSpatial-Bench introduit par les auteurs, RoboTracer atteint 79,1 % de taux de succès moyen et dépasse Gemini-2.5-Pro de 36 points de précision. Le système a été validé sur bras UR5 (Universal Robots) et humanoïde G1 (Unitree) dans des scènes réelles encombrées. La contribution principale tient dans le raisonnement métrique, une capacité absente des VLM classiques : décrire une scène en langage naturel ne suffit pas pour estimer qu'un obstacle se trouve à 0,47 m à gauche, information nécessaire à toute trajectoire exécutable. L'approche RFT avec récompenses de processus supervise les étapes perceptuelles intermédiaires et non uniquement le résultat final, ce qui réduit concrètement l'écart entre compréhension sémantique et exécution physique (le demo-to-reality gap). Pour un intégrateur ou un COO industriel, cela signifie un robot capable d'opérer dans des espaces non cartographiés à l'avance. L'avance de 36 % sur Gemini-2.5-Pro est notable, même si ce modèle n'est pas conçu pour la robotique embarquée. RoboTracer s'inscrit dans la compétition autour des modèles VLA (Vision-Language-Action), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA, qui cherchent tous à unifier perception, raisonnement et action dans un modèle unique. Sa spécificité est l'accent sur la conscience métrique plutôt que sur le contrôle moteur fin, niche où Pi-0 reste dominant. Le choix des plateformes UR5 (bras industriel 6 axes, référence en intégration industrielle) et G1 (humanoïde Unitree, 43 degrés de liberté, environ 35 000 $) renforce la crédibilité de la généralisation multi-robots. À ce stade, il s'agit d'un résultat de recherche sans déploiement commercial annoncé ; la publication du dataset TraceSpatial et du benchmark ouvert constitue en revanche une infrastructure réutilisable directement par la communauté robotique.

IA physiqueOpinion
1 source
Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste
1612arXiv cs.RO 

Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste

Des chercheurs ont publié sur arXiv (référence 2606.29384) Event-VLA, un framework combinant des caméras événementielles avec des modèles Vision-Language-Action (VLA) pour rendre la manipulation robotique robuste dans des conditions d'éclairage dégradées. L'approche repose sur l'intégration de flux d'événements, une modalité de capteur neuromorphique qui encode les variations de luminosité pixel par pixel avec une résolution temporelle de l'ordre de la microseconde, contrairement aux caméras RGB classiques qui acquièrent des images complètes à fréquence fixe. L'architecture introduit un mécanisme de routage par requêtes d'action : des requêtes apprenantes extraient la sémantique pertinente à la tâche depuis le raisonnement VLA, puis agrègent sélectivement les tokens événementiels via une cross-attention à portes (gated cross-attention), produisant des représentations d'action sensibles aux conditions lumineuses. Les expériences couvrent des scénarios de simulation et de déploiement réel en faible luminosité, voire en quasi-obscurité. Ce travail s'attaque à une faille structurelle des VLA actuels, Pi-0, OpenVLA, GR00T N2 ou Helix inclus, qui sont entraînés et évalués quasi-exclusivement dans des environnements d'intérieur bien éclairés et stables. Le sim-to-real gap se double ici d'un lighting-to-real gap rarement quantifié dans les benchmarks publiés. Event-VLA démontre qu'on peut greffer une modalité événementielle sans détruire les priors sémantiques RGB-langage préentraînés, ce qui est non trivial : la plupart des fusions multimodales naïves dégradent la performance en conditions normales pour gagner en robustesse marginale. Le fait que le gain soit mesuré sans régression sur éclairage standard constitue le résultat le plus solide à retenir pour les intégrateurs industriels envisageant des déploiements en entrepôt, en extérieur ou en environnement à éclairage variable. Les caméras événementielles (Prophesee, inivation, Sony IMX636) restent onéreuses et peu présentes dans les pipelines robotiques commerciaux, ce qui limite la portée immédiate du framework. Le travail s'inscrit dans un mouvement plus large d'hybridation sensorielle pour les VLA, en parallèle d'approches tactiles (GelSight) ou proprioceptives. Côté concurrent, Boston Dynamics, Figure et Agility travaillent sur la robustesse des politiques en conditions réelles mais publient peu sur la gestion de l'éclairage. Aucun acteur européen n'est mentionné dans ce papier. Les auteurs ne précisent pas de pipeline de déploiement à l'échelle ni de timeline industrielle : il s'agit d'un résultat de recherche, pas d'un produit shipé.

IA physiqueActu
1 source
SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon
1613arXiv cs.RO 

SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon

Une équipe de chercheurs a publié SWITCH (arXiv:2511.17649), un benchmark conçu pour évaluer la capacité des agents IA à interagir avec ce que les auteurs appellent des interfaces de contrôle tangibles (TCIs) : panneaux d'appareils électroménagers, télécommandes, ascenseurs, interfaces graphiques embarquées. Le jeu de données comprend 1 170 vidéos temporellement interactives, annotées de manière structurée avec instructions, actions, transitions d'état, résultats et comportements de récupération en cas d'erreur. La spécificité de SWITCH est d'évaluer le raisonnement en boucle fermée : l'agent doit percevoir, agir, vérifier le résultat, et corriger si nécessaire, dans une séquence continue. Le benchmark inclut également une évaluation des modèles de génération vidéo sur des tâches centrées sur l'interaction, combinant jugement automatique par LLM et évaluation humaine. L'intérêt de SWITCH réside dans ce qu'il révèle : les modèles multimodaux de frontier, propriétaires comme open source, présentent des faiblesses persistantes en perception visuo-temporelle fine, en vérification des résultats et en récupération d'erreur. La plupart des benchmarks existants se limitent à la perception en boucle ouverte ou à l'exécution d'une seule action, ce qui masque précisément les défaillances qui apparaissent dans des scénarios d'horizon long, là où l'agent doit maintenir un état interne et détecter un échec non anticipé. Pour les équipes travaillant sur des robots de service ou des agents embarqués destinés à des environnements industriels ou domestiques, ce constat est directement opérationnel : les modèles actuels ne sont pas encore fiables dès qu'une interaction nécessite un retour d'état et une correction. SWITCH s'inscrit dans un effort plus large de la communauté embodied AI pour combler le fossé entre les capacités de perception statique et l'agentivité réelle en environnement physique. Les benchmarks précédents comme SQA3D, EmbodiedScan ou OpenEQA avaient posé des jalons en compréhension 3D et en questions-réponses situées, mais sans capturer la dimension corrective de l'interaction. SWITCH adresse explicitement ce manque via des scénarios égocentrés. L'étude ne mentionne pas de partenariat industriel ni de déploiement applicatif immédiat : il s'agit d'un outil académique, non d'un produit. Les suites probables concernent l'intégration du benchmark dans les pipelines d'entraînement de VLA (Vision-Language-Action models) et l'extension à des environnements 3D interactifs.

RecherchePaper
1 source
Entraîner des modèles vision-langage-action (VLA) avec une supervision dense par chaîne de pensée incarnée
1614arXiv cs.RO 

Entraîner des modèles vision-langage-action (VLA) avec une supervision dense par chaîne de pensée incarnée

Une équipe du laboratoire RUCKBReasoning (Université Renmin de Chine) a publié le 30 juin 2026 ZR-0, un modèle VLA (vision-language-action) de 2,6 milliards de paramètres entraîné avec une supervision dense par chaîne de raisonnement incarnée, ou ECoT (Embodied Chain-of-Thought). Le modèle repose sur une architecture dual-stream : un VLM pré-entraîné (baptisé System 2) génère des annotations de raisonnement structuré pendant l'entraînement, tandis qu'un expert d'action basé sur un Diffusion Transformer (System 1) produit des séquences d'actions continues par flow matching. Les deux composants sont couplés via cross-attention, avec un masque d'attention qui permet de court-circuiter entièrement la génération ECoT à l'inférence sans perte de performance mesurée. Le modèle a été pré-entraîné sur ProcCorpus-60M, un corpus de 60 millions de frames (environ 1 000 heures) issus de plus de 400 000 trajectoires, avec des annotations ECoT couvrant 96,8 % des frames. Les évaluations couvrent trois benchmarks de simulation, LIBERO (bras unique), RoboTwin 2.0 (bras bimanuels) et RoboCasa GR-1 Tabletop (humanoïde), ainsi que des expériences réelles sur plateforme xArm. L'enjeu central est le transfert cross-embodiment : les espaces d'états et d'actions diffèrent fondamentalement d'un robot à l'autre, ce qui rend la généralisation difficile pour les modèles end-to-end. L'hypothèse de ZR-0 est que les processus cognitifs de haut niveau, perception de scène, identification d'objets, planification, décomposition de sous-tâches, sont partagés entre embodiments, même si les commandes moteur ne le sont pas. En ancrant l'alignement des représentations dans ce niveau d'abstraction, les auteurs contournent la nécessité d'adapter le modèle à chaque cinématique robot. Pour les intégrateurs industriels, le gain potentiel est concret : un seul modèle entraînable sur données hétérogènes, déployable sur plusieurs plateformes sans fine-tuning spécifique à chaque bras. Cette approche s'inscrit dans une vague de modèles VLA généralistes qui cherchent à résoudre le sim-to-real gap par des architectures raisonnantes. Les concurrents directs incluent Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et OpenVLA, qui explorent des stratégies similaires de pré-entraînement multi-robot. ZR-0 se distingue par son dispositif ECoT dédié à l'entraînement et neutralisable à l'inférence, ce qui préserve la vitesse d'exécution. Le code et les checkpoints sont publiés en open source sur GitHub. Aucun déploiement industriel ni partenaire B2B n'est annoncé à ce stade, il s'agit d'une contribution de recherche académique, pas d'un produit shipé.

IA physiqueActu
1 source
Contrôle robotique sans démonstration via des agents LLM
1615arXiv cs.RO 

Contrôle robotique sans démonstration via des agents LLM

Des chercheurs ont publié FAEA (Frontier Agent as Embodied Agent), un framework qui applique directement aux manipulateurs robotiques les architectures d'agents LLM conçues pour le génie logiciel, sans démonstrations spécifiques à la tâche ni fine-tuning. Évalué sur trois benchmarks de référence en simulation avec accès privilégié à l'état de l'environnement (positions des objets fournies directement, sans perception visuelle brute), FAEA atteint des taux de succès de 84,9 % sur LIBERO, 85,7 % sur ManiSkill3, et 96 % sur MetaWorld, en utilisant le Claude Agent SDK d'Anthropic comme modèle frontier non modifié. Une itération optionnelle de feedback humain porte le score LIBERO à 88,2 %. Ces résultats se rapprochent des performances des modèles VLA (Vision-Language-Action) entraînés sur moins de 100 démonstrations par tâche, seuil qui représente aujourd'hui le plancher de coût pour la collecte de données en robotique incarnée. L'implication centrale est notable : pour les tâches de manipulation dominées par la planification délibérative à haut niveau, un agent généraliste non spécialisé peut suffire, sans pipeline de données propriétaire. FAEA peut en outre explorer de façon autonome des scénarios inédits en simulation et générer des trajectoires réussies pour augmenter les datasets d'entraînement, court-circuitant ainsi le goulot de la collecte humaine. Nuance critique : tous les tests restent en simulation avec état privilégié ; aucun transfert sim-to-real n'est validé dans ce travail, ce qui limite la portée des conclusions pour un déploiement industriel réel. Les modèles VLA entraînés bout-en-bout, pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA, dominent la recherche en manipulation depuis 2023 mais restent contraints par des pipelines de collecte de données coûteux et spécifiques à chaque domaine. FAEA s'inscrit dans un courant alternatif qui cherche à exploiter l'infrastructure d'agents software directement en robotique : la même boucle plan-act-observe-debug qui pilote les agents de coding est ici transférée sans modification au contrôle de manipulateurs. Ce positionnement implique un bénéfice passif : toute amélioration des modèles frontier se répercute directement sur les capacités robotiques sans retraining. Le préprint est disponible sur arXiv (2601.20334v2) et le code sur GitHub ; aucun déploiement industriel n'est annoncé à ce stade.

IA physiquePaper
1 source
TacGen : le toucher comme dimension essentielle de la représentation physique, avec alignement vision-tactile et génération de données
1616arXiv cs.RO 

TacGen : le toucher comme dimension essentielle de la représentation physique, avec alignement vision-tactile et génération de données

Des chercheurs ont publié sur arXiv (arXiv:2606.29173, juin 2026) TacGen, un système de représentation multimodale vision-toucher conçu pour pallier la rareté des données tactiles dans l'apprentissage automatique appliqué à la robotique. Le système combine un alignement contrastif vision+toucher (V+T) avec un générateur résiduel MLP en espace latent qui synthétise des représentations tactiles directement depuis des images RGB. Entraîné sur le backbone DINOv2, TacGen surpasse les approches vision seule sur l'estimation de masse (ΔR²=+0,570), de densité (Δacc=+0,067), de dureté (+0,117) et d'étiquettes de force (ΔR²=+0,281). Sur la tâche de manipulation TACTO, les performances passent de 0,246 à 0,979 ; le scaling du modèle vision seul n'explique que 4,5 % de cet écart, le canal tactile en représentant 95,5 %. Ce résultat remet en cause une hypothèse dominante du domaine : que la vision, suffisamment mise à l'échelle, peut approximer les propriétés physiques de contact. TacGen montre que la compliance, la texture et la masse nécessitent un canal sensoriel dédié, que les auteurs qualifient de dimension "nécessaire" de la représentation du monde physique. Pour les équipes déployant des manipulateurs industriels, cela justifie l'investissement dans les capteurs tactiles (peaux électroniques, capteurs force/couple en bout de bras) plutôt qu'une dépendance exclusive à la vision embarquée. Le générateur de latents tactiles atteint un score cross-seed de +0,589, les données synthétiques étant statistiquement équivalentes aux données réelles sur l'entraînement aval. La rareté des données tactiles est structurelle : collecter des images RGB est trivial, instrumenter un objet pour mesurer forces et déformations reste coûteux et peu scalable. TacGen s'inscrit dans une lignée de travaux qui comprend DIGIT (Meta AI Research), GelSight (MIT) et les recherches de Lerrel Pinto (NYU) sur l'apprentissage visuotactile. La validation repose sur cinq seeds reproductibles (benchmarks SSVTP/TVL), un transfert YCB-Sight, trois vérifications de backbone et des contrôles de permutation, ce qui constitue une rigueur expérimentale supérieure à la moyenne des prépublications arXiv dans ce domaine. Le travail reste cantonné à la simulation TACTO ; sa généralisation à des robots réels en environnement non contrôlé constitue l'étape critique non encore franchie.

IA physiquePaper
1 source
Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence
1617arXiv cs.RO 

Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence

Des chercheurs ont publié fin juin 2026 sur arXiv une méthode appelée MoRE (Mode Redirection) pour corriger un défaut structurel de l'apprentissage par imitation robotique (behavior cloning) : les politiques entraînées sur des jeux de démonstrations hétérogènes capturent simultanément des comportements désirés et indésirables, y compris dangereux. L'exemple retenu par les auteurs est parlant : un robot entraîné à des transferts d'objets peut apprendre à passer un couteau lame en premier. MoRE introduit une courte étape d'«uncloning» qui distille un signal de redirection, généré par un classificateur de modes temporaire, directement dans les poids de la politique. Une loss de rétention préserve la compétence sur les modes corrects. Sur huit tâches simulées et réelles, MoRE améliore le taux de succès moyen de 44 points de pourcentage par rapport à la politique multi-modes initiale, et approche les performances du réentraînement sur données filtrées, considéré comme la référence. La méthode est compatible avec Diffusion Policy et Pi0.5, le modèle VLA (Vision-Language-Action) de Physical Intelligence. L'intérêt industriel de MoRE tient à deux absences : pas d'accès requis aux démonstrations originales, et aucun surcoût à l'inférence. Les solutions existantes butaient sur l'une ou l'autre contrainte : la curation de données impose un réentraînement complet depuis les données sources ; le steering à l'inférence (guidage externe durant l'exécution) ajoute une latence incompatible avec les cycles robotiques en temps réel. MoRE contourne les deux en modifiant les poids une seule fois, en aval de l'entraînement initial. Pour un intégrateur ou un COO industriel, c'est une piste crédible pour corriger une politique déjà déployée sans repartir de zéro. La compatibilité confirmée avec Pi0.5 est un signal fort : si la méthode tient sur un VLA large-scale, elle couvre un spectre large de déploiements réels. L'apprentissage par imitation reste l'une des méthodes d'entraînement les plus accessibles, mais sa sensibilité aux données hétérogènes est un problème structurel documenté depuis des années. Les VLA récents comme Pi0 et Pi0.5 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA) ont étendu les capacités générales des politiques sans régler ce problème de modes indésirables. MoRE s'inscrit dans un courant émergent de post-training alignment appliqué à la robotique, analogue aux techniques DPO/RLHF utilisées pour aligner les LLM après préentraînement. Les approches concurrentes incluent le filtrage par classificateur externe et la curation de données assistée par modèle. Ce travail est à ce stade un preprint de recherche, sans partenariat industriel annoncé ni timeline de commercialisation ; aucun acteur européen n'est impliqué parmi les auteurs identifiés.

IA physiqueOpinion
1 source
Ancrage de la généralisation simulation-réel en manipulation robotique : étude empirique avec des modèles VLA
1618arXiv cs.RO 

Ancrage de la généralisation simulation-réel en manipulation robotique : étude empirique avec des modèles VLA

Une équipe de chercheurs a publié sur arXiv (référence 2603.22876, version 2 en juin 2026) une étude empirique de grande ampleur sur le transfert simulation-vers-réel dans le domaine de la manipulation robotique, en ciblant spécifiquement les modèles Vision-Language-Action (VLA). L'étude porte sur plus de 10 000 essais réels et analyse quatre variables clés : la randomisation de domaine multi-niveaux, le rendu photoréaliste, la modélisation physique réaliste, et les mises à jour par apprentissage par renforcement (RL). Pour mesurer les performances, les auteurs ont conçu un protocole d'évaluation couvrant les variations de fond, d'éclairage, de distracteurs visuels, de types d'objets et de configurations spatiales. Les données simulées, les plateformes robotiques utilisées et l'intégralité du protocole sont mis à disposition en accès libre pour permettre la reproductibilité indépendante. Ce travail répond à un angle mort persistant dans la recherche robotique : les algorithmes de réduction du Sim-to-Real gap abondent dans la littérature, mais peu ont été validés de façon systématique sur des politiques généralistes comme les VLA, qui apprennent à partir de vastes corpus de données mixtes texte-image-action. En isolant empiriquement les quatre déterminants de la généralisation, l'étude permet aux intégrateurs et aux équipes R&D de prioriser leurs investissements en infrastructure de simulation plutôt que d'empiler des heuristiques non testées. La mise à disposition d'un benchmark standardisé constitue une rupture : le secteur manquait d'une référence commune pour comparer les approches sim-to-real sur des tâches de manipulation représentatives, un vide que cette publication comble directement. Le Sim-to-Real gap est l'un des obstacles structurels au déploiement des robots en environnement non contrôlé, et la montée en puissance des VLA (Pi-0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind, GR00T N2 de NVIDIA) rend la question encore plus urgente : ces modèles sont entraînés massivement sur des données synthétiques, et leur robustesse réelle reste souvent opaque. Plusieurs laboratoires, dont ceux liés à Figure AI, Agility Robotics ou 1X Technologies, investissent dans des moteurs de simulation propriétaires précisément pour réduire ce coût. En publiant protocole et plateformes, les auteurs offrent un socle de comparaison neutre qui devrait accélérer la convergence des pratiques, à condition que des équipes tierces reproduisent et étendent les résultats sur d'autres morphologies robotiques.

IA physiqueOpinion
1 source
Politique de guidage comportemental : des démonstrations comme invites pour la manipulation
1619arXiv cs.RO 

Politique de guidage comportemental : des démonstrations comme invites pour la manipulation

Une équipe de chercheurs publie sur arXiv (preprint 2606.30457, juin 2026) une architecture baptisée Behavior Prompting Policy (BPP), conçue pour permettre à un robot de réaliser une tâche de manipulation inédite à partir d'une seule démonstration humaine, sans aucun fine-tuning. Le principe, qu'ils nomment "behavior prompting", s'inspire directement de l'apprentissage en contexte (in-context learning) des grands modèles de langage : la démonstration joue le rôle de "prompt" et le modèle visuomoteur génère les actions correspondantes à partir de l'observation courante. En parallèle, les auteurs introduisent iPhUMI, une interface de manipulation tenue à la main qui permet de collecter des données d'entraînement diversifiées à moindre coût, ainsi que deux benchmarks d'évaluation inédits : DrawAnything (tâches de dessin sur robot) et LIBERO-Gen (manipulation de surface avec généralisation zero-shot). Le résultat le plus structurant de cette recherche est l'identification de la diversité des tâches d'entraînement comme facteur déterminant de la capacité de prompting, davantage que le volume de données ou la taille du modèle. Cela change le calcul pour les intégrateurs et les équipes robotique : plutôt que d'accumuler des milliers de démonstrations par tâche pour fine-tuner, une politique généraliste entraînée sur un corpus très varié suffit, et l'opérateur la re-configure via une unique démonstration manuelle. Sur le plan industriel, c'est une piste sérieuse pour réduire le coût de déploiement de robots de manipulation dans des environnements à SKUs variables, problème central en logistique et en assemblage flexible. Cette approche s'inscrit dans une famille de travaux sur les Visual Language Action models (VLA) et les politiques généralisées, dont les représentants les plus connus sont π₀ (Physical Intelligence), OpenVLA (UC Berkeley) et RT-2 (Google DeepMind). iPhUMI se positionne comme une alternative légère aux exosquelettes ou gants haptiques pour la collecte de données. Il s'agit pour l'instant d'un preprint non peer-reviewed, et les expériences restent limitées à des environnements de laboratoire ; la question du sim-to-real et de la robustesse à la variabilité de l'éclairage ou de l'objet n'est pas traitée. Un site projet est disponible, mais aucun code ni dataset n'est encore publié.

IA physiqueOpinion
1 source
SA-VLA : un tokeniseur conscient de l'état pour améliorer les performances des modèles VLA
1620arXiv cs.RO 

SA-VLA : un tokeniseur conscient de l'état pour améliorer les performances des modèles VLA

Des chercheurs ont publié le 30 juin 2026 sur arXiv (arXiv:2606.30113) une méthode baptisée SA-VLA, pour State-Aware Vision-Language-Action model, qui s'attaque à un défaut fondamental des politiques de contrôle robotique basées sur les grands modèles de langage. Dans les architectures VLA actuelles, les actions continues du robot sont compressées en codes discrets via une quantification vectorielle (VQ) : chaque token d'action est ensuite décodé vers un prototype continu fixe, indépendamment de la configuration articulaire réelle du robot, de la pose des objets ou des conditions de contact. SA-VLA introduit un tokenizer conditionné sur l'état proprioceptif courant, via deux mécanismes testés en parallèle : une attention croisée entre les features d'état et les features d'action, et un adaptateur léger qui prédit des facteurs de modulation par action pour reconstruire des commandes continues adaptées à l'état. Sur 12 tâches de manipulation du benchmark RoboTwin, le taux de succès moyen passe de 0,29 à 0,56 par rapport au meilleur tokenizer de référence. En transfert sim-to-real zéro-shot sur trois tâches réelles, il grimpe de 0,15 à 0,33, soit un doublement dans les deux cas. Ce résultat est notable parce qu'il cible le "compression gap", c'est-à-dire la perte de précision introduite par la discrétisation des actions continues, un problème longtemps identifié comme le talon d'Achille des VLA autorégessifs. Que le même token discret corresponde à des commandes articulaires radicalement différentes selon la posture du bras est trivial en robotique, mais les architectures de tokenization l'ignoraient jusqu'ici. L'approche par adaptateur est particulièrement intéressante pour les intégrateurs : elle étend la capacité expressive d'un codebook de taille fixe sans en changer la structure, et reste compatible avec le décodage autorégressif comme parallèle, ce qui préserve la compatibilité avec les pipelines LLM existants. Le doublement du taux de succès en transfert zéro-shot sim-to-real est le signal le plus fort : il suggère que le gap de généralisation observé dans de nombreux déploiements VLA n'est pas entièrement dû aux domaines visuels, mais aussi à ce mismatch entre token discret et commande continue. Les VLA sont devenus le paradigme dominant dans la robotique de manipulation depuis les travaux de Physical Intelligence (Pi-0, pi0.5), d'Embodied Intelligence (OpenVLA) et de Google DeepMind (RT-2, puis les variantes Gemini Robotics). Le benchmark RoboTwin, utilisé ici comme référence, est un environnement de simulation standardisé pour la manipulation bi-manuelle apparu fin 2024. SA-VLA s'insère dans l'écosystème des VLA à décodage discret, en compétition directe avec des tokenizers comme FSQ ou les approches diffusion-based qui contournent le problème autrement. L'absence d'affiliation institutionnelle clairement identifiable dans le titre limite la lisibilité du positionnement concurrentiel, mais la méthode est décrite comme intégrable à tout backbone LLM-VLA standard. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges (LIBERO, BridgeData v2) et une intégration dans des pipelines de déploiement industriel, où la robustesse aux variations de configuration est précisément le facteur limitant.

IA physiqueOpinion
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
1621arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

RecherchePaper
1 source
CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle
1622arXiv cs.RO 

CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle

Une équipe de chercheurs a publié sur arXiv (réf. 2606.29222) un planificateur de navigation autonome baptisé CORE (Contextual-memory Oriented Reinforcement-learning), conçu pour guider un robot dans des environnements inconnus sans carte préalable. L'architecture combine un graphe de visibilité sparse pour la représentation structurée de l'espace, un réseau Transformer pour la compréhension globale de l'environnement, et un mécanisme de mémoire contextuelle pour éviter les optima locaux dans les grandes scènes. Testé face au planificateur traditionnel FAR Planner et à plusieurs baselines d'apprentissage par renforcement, CORE réduit la distance de déplacement de 13 % par rapport à FAR Planner et jusqu'à 48 % face aux meilleures méthodes d'apprentissage, avec des gains qui s'accentuent dans les environnements complexes. Fait notable : le modèle réalise un transfert sim-to-real en zéro-shot, sans fine-tuning sur données réelles, après entraînement exclusif sur des environnements simulés basés sur l'image. Le code est disponible en accès libre sur GitHub. Ce résultat s'attaque à un verrou persistant de la navigation mobile : la dégradation des performances lors du passage du simulateur au monde réel. La plupart des méthodes d'apprentissage par renforcement nécessitent soit une domain randomization poussée, soit un fine-tuning coûteux sur données terrain. Ici, le zéro-shot sim-to-real est démontré en environnement physique sans intervention humaine, résultat significatif si les conditions expérimentales sont généralisables. Pour les intégrateurs et équipes R&D, l'enjeu concret est double : réduction de la distance parcourue (efficacité énergétique, temps de cycle) et capacité à opérer dans des espaces non cartographiés, scénario courant en logistique, BTP ou exploration. La navigation en environnements inconnus s'appuie historiquement sur le SLAM, avec des contributions majeures d'ETH Zurich, Carnegie Mellon ou l'INRIA côté européen. FAR Planner (CMU), utilisé ici comme référence de comparaison, reste une baseline solide mais à règles fixes. Sur le plan industriel, Boston Dynamics, ANYbotics ou Exotec intègrent des planificateurs propriétaires dans leurs flottes de robots mobiles. CORE se positionne comme une alternative légère, entraînable sur image seule, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La robustesse face aux obstacles dynamiques, non testée dans cette version, constituera l'étape critique pour une éventuelle industrialisation.

RecherchePaper
1 source
Human2Any : transfert humain-robot via planification compositionnelle avec contraintes
1623arXiv cs.RO 

Human2Any : transfert humain-robot via planification compositionnelle avec contraintes

Une équipe de chercheurs a publié en juin 2026 Human2Any, un framework d'apprentissage conçu pour transférer des démonstrations humaines vers des robots sans nécessiter de données d'entraînement collectées directement sur le robot cible. Le principe central repose sur l'extraction de priors d'interaction centrés sur les objets à partir de vidéos de mains humaines, en représentant la manipulation non pas par les mouvements du bras, mais par la relation cinématique entre objets, ce qui change dans la scène, indépendamment de qui ou quoi produit ce changement. Ces priors sont ensuite composés avec un module de raisonnement de faisabilité côté robot et un planificateur de mouvement, permettant l'adaptation à différentes morphologies robotiques, géométries de scène et configurations de tâches. Les expériences réelles ont été menées sur deux plateformes distinctes : un bras Franka Emika en configuration tabletop, et un robot humanoïde mobile RBY-1, tous deux opérant sur des tâches de manipulation sans avoir reçu d'exemples robot dans le contexte cible. Ce résultat est significatif parce qu'il attaque directement le goulot d'étranglement le plus coûteux du pipeline robotique actuel : la collecte de données de démonstration sur le robot réel. Les approches VLA (Vision-Language-Action) dominantes, comme celles de Physical Intelligence (pi0) ou de Google DeepMind, s'appuient sur des téléopérations massives ou des simulations intensives pour construire des datasets robot-specific. Human2Any propose une voie alternative : lever l'hypothèse que les priors doivent être ancrés dans l'embodiment. La capacité démontrée à transférer vers un humanoïde mobile comme le RBY-1, dont la cinématique et les degrés de liberté diffèrent radicalement d'un bras fixe, suggère une généralisation inter-embodiment qui, si elle se confirme à plus grande échelle, réduirait les barrières à l'entrée pour les intégrateurs sans accès à des flottes de robots pour la collecte. Sur le plan académique, Human2Any s'inscrit dans un courant de recherche en plein essor autour du retargeting humain-robot, aux côtés de travaux comme UMI (Universal Manipulation Interface) de Stanford ou OKAMI et HumanPlus de Berkeley, qui exploitent tous la vidéo humaine comme signal de supervision bon marché. La distinction revendiquée ici est l'abstraction complète de l'embodiment via la représentation objet-objet, plutôt qu'un retargeting cinématique direct. Le projet est disponible sur human2any.github.io. La prochaine étape logique sera de mesurer si ces priors tiennent face à une plus grande diversité d'objets, de saisies, et de configurations de scène non vues à l'entraînement.

RecherchePaper
1 source
Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique
1624arXiv cs.RO 

Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique

Une équipe de chercheurs publie sur arXiv (réf. 2606.29898) une métrique d'évaluation hors ligne baptisée Critical Interval MSE (CI-MSE), conçue pour combler un angle mort majeur dans le développement des politiques de manipulation robotique. Le problème de départ est bien connu : l'évaluation en conditions réelles reste la seule mesure fiable de la performance d'un modèle, mais elle est coûteuse, difficile à reproduire et trop lente pour comparer itérativement des variantes proches. Le proxy historique, la perte de validation MSE sur des démonstrations d'experts, présente une corrélation trop faible avec les performances en déploiement réel pour être utile en pratique. CI-MSE propose une approche différente : restreindre le calcul d'erreur aux segments temporels jugés critiques pour la tâche, et l'associer à des procédures d'alignement d'actions qui reproduisent mieux le comportement au moment du rollout. Les auteurs mesurent une corrélation de rang de Spearman de -0,87 entre leur métrique et les performances réelles, contre -0,61 pour la MSE brute, sur un large panel de checkpoints de politiques, validés en simulation et en environnement physique. L'enjeu industriel est direct : le goulot d'étranglement de l'itération sur les politiques robotiques n'est pas le calcul, c'est le temps de test physique. Si une métrique hors ligne prédit fiablement laquelle de deux variantes d'un modèle est meilleure, les équipes peuvent filtrer les mauvais candidats avant même de mobiliser un robot. Pour les intégrateurs et les labs qui travaillent sur des politiques de type VLA (Vision-Language-Action), ce gain de cycle de R&D peut se traduire en semaines économisées par itération. Le résultat de -0,87 est notable, mais à nuancer : les auteurs délimitent eux-mêmes des conditions limites d'utilisation, notamment en cas de shifts de distribution à l'évaluation. CI-MSE s'inscrit dans un effort plus large de la communauté pour résoudre le "sim-to-real gap" par des proxies d'évaluation plus fidèles, sans nécessiter de rollouts physiques systématiques. Les travaux sur les métriques comportementales (action chunking, diffusion policies) ont mis en évidence que la MSE brute ne capturait pas les moments décisifs d'une tâche de manipulation. Ce papier formalise cette intuition avec une analyse de sensibilité qui montre la robustesse de CI-MSE sur un large spectre d'hyperparamètres. Le code et les détails sont accessibles sur le site du projet (ci-mse.github.io). Prochaine étape attendue : validation à plus grande échelle sur des benchmarks multi-tâches et des architectures de politiques hétérogènes.

RechercheOpinion
1 source
Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel
1625arXiv cs.RO 

Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel

Des chercheurs ont soumis sur arXiv (arXiv:2606.28805, juin 2026) un ensemble de modèles physiques haute-fidélité destinés à améliorer le sim-to-real transfer en robotique, appliqués au tennis de table de niveau professionnel. À des vitesses et effets compétitifs, une balle de ping-pong suit des trajectoires complexes et contre-intuitives que le robot doit anticiper en une fraction de seconde. Les modèles proposés couvrent trois domaines : la dynamique aérodynamique du vol de balle, avec les coefficients de traînée et de force de Magnus modélisés en fonction du nombre de Reynolds et du rapport de rotation ; le contact balle-table, intégrant les effets de déformation (buckling) de la balle sur le coefficient de restitution ainsi que des termes résiduels ; et le contact balle-raquette, via un réseau de neurones résiduel combiné à des coefficients de restitution normale et tangentielle et un amortissement torsionnel. Ces modèles ont servi à entraîner des politiques par apprentissage par renforcement (RL), aboutissant à ce que les auteurs décrivent comme le premier agent robotique capable d'affronter des joueurs professionnels en conditions réelles. L'intérêt technique dépasse le cadre sportif. La nature adversariale du tennis de table impose une contrainte rarement aussi explicite ailleurs : toute zone où la simulation diverge de la réalité devient exploitable par l'adversaire, forçant une précision de modélisation sans concession. Les travaux antérieurs en robotique ping-pong se cantonnaient à des plages étroites de vitesses et d'effets, insuffisantes pour reproduire les comportements balistiques du jeu professionnel. Que ce pipeline simulation-vers-réalité soit suffisamment fidèle pour approcher ce niveau valide l'approche pour des tâches de manipulation rapide en milieu industriel, où les essais réels restent coûteux ou dangereux, et renforce l'hypothèse que le sim-to-real gap est soluble par la précision physique plutôt que par l'accumulation de données réelles. Ce travail s'inscrit dans la continuité directe des recherches publiées par Google DeepMind en 2024, qui avaient démontré qu'un robot pouvait battre des joueurs amateurs confirmés en conditions réelles. Ce nouveau papier documente les fondations physiques qui rendent possible le saut qualitatif vers le niveau professionnel. Plusieurs équipes concurrentes utilisent le ping-pong comme benchmark de robotique agile, mais peu ont publié des modèles de contact aussi détaillés pour les phases raquette-balle et balle-table. La revendication de compétitivité face à des professionnels reste à confirmer par des évaluations indépendantes, le papier étant une prépublication non encore évaluée par les pairs. Les suites logiques incluent la généralisation de ces modèles de contact résiduels à d'autres objets déformables et leur transposition à des tâches industrielles de manipulation précise à haute cadence.

RecherchePaper
1 source
VLK : apprentissage de la loco-manipulation humanoïde à partir d'interactions synthétiques dans des scènes reconstruites
1626arXiv cs.RO 

VLK : apprentissage de la loco-manipulation humanoïde à partir d'interactions synthétiques dans des scènes reconstruites

Des chercheurs ont publié fin juin 2026, via arXiv (2606.30645), une méthode baptisée VLK (Vision-Language-Kinematics) permettant à un humanoïde d'apprendre à se déplacer et à manipuler des objets à partir d'observations égocentriques, sans aucune annotation humaine. Le pipeline génère automatiquement 48 000 trajectoires supervisées en reconstruisant des environnements intérieurs en 3D grâce à la technique de 3D Gaussian Splatting, puis en synthétisant des trajectoires de navigation et d'interaction avec des objets en exploitant les données de scène privilégiées, et enfin en rendant les images égocentriques correspondantes après coup. Une politique VLK est ensuite entraînée à prédire des trajectoires cinématiques corps entier à court horizon, converties en commandes physiques par un tracker corps entier. Les expériences physiques ont été réalisées sur le robot humanoïde Unitree G1, sur des tâches de navigation et de transport d'un objet unique dans des scènes reconstruites. L'intérêt technique de cette approche est de répondre à un verrou de données structurel : aucune source existante ne fournit à grande échelle le triplet complet (images égocentriques synchronisées, instructions en langage naturel, trajectoires cinématiques compatibles avec un humanoïde). VLK résout ce problème par génération synthétique totale, sans capture de mouvement, sans télé-opération, sans annotation. Cela positionne la méthode comme un levier de scalabilité réel pour les politiques VLA (Vision-Language-Action) appliquées aux humanoïdes, à condition que le rendu synthétique soit suffisamment fidèle pour passer le sim-to-real, ce que les auteurs revendiquent mais sur un périmètre de tâches encore limité (transport mono-objet, scènes intérieures). Le contexte situe ce travail dans la vague des politiques génératives pour humanoïdes, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (Nvidia) ou des approches diffusion-based de Figure. Le Unitree G1, plateforme abordable à environ 16 000 dollars, est devenu un banc de test standard dans la communauté académique, ce qui facilite la reproductibilité. La reconstruction par Gaussian Splatting, popularisée depuis 2023, permet ici de créer des environnements d'entraînement photoréalistes à partir de scans de quelques minutes. Les prochaines étapes naturelles seront d'étendre la méthode à la manipulation bi-manuelle, à des scènes plus dynamiques et à des horizons de prédiction plus longs, où la dérive cinématique reste un problème ouvert.

IA physiqueActu
1 source
TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)
1627arXiv cs.RO 

TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2606.29089) une méthode appelée TAP-VLA (Tactile Annotation Prompting for Vision-Language-Action models) visant à doter les modèles vision-langage-action du sens du toucher sans modifier leur architecture. Sur quatre tâches de manipulation à contacts complexes (vissage, insertion, assemblage de précision), TAP-VLA atteint un taux de succès de 78 %, contre moins de 50 % pour un fine-tuning purement visuel et pour les approches alternatives de fusion tactile, certaines de ces baselines ne faisant pas mieux qu'un résultat aléatoire. Le principe repose sur des capteurs visuo-tactiles capables de mesurer les champs de cisaillement (shear fields) à la surface de contact ; ces champs sont ensuite superposés sous forme de vecteurs spatialement alignés directement sur les images RGB multi-vues que le modèle consomme déjà, sans ajouter de modalité d'entrée distincte. L'enjeu est réel : les VLAs de génération actuelle, comme π0 de Physical Intelligence, OpenVLA ou RT-2 de Google DeepMind, offrent un raisonnement robuste sur les variations visuelles, sémantiques et spatiales grâce à leur pré-entraînement à grande échelle, mais restent aveugles aux forces de contact, pourtant centrales dans toute manipulation industrielle sérieuse (emboîtement de précision, vissage, gestion d'objets déformables). Intégrer le toucher comme nouvelle modalité d'entrée détériore précisément ce pré-entraînement, car les données tactiles sont absentes des corpus à grande échelle sur lesquels ces modèles sont construits, un problème de distribution shift bien documenté dans la littérature. TAP-VLA contourne l'obstacle en restant dans l'espace d'observation natif du modèle : pas de modification architecturale, pas de pré-entraînement tactile spécifique, surcoût computationnel négligeable. Ce travail s'inscrit dans une course active autour de l'embodied AI pour la manipulation de précision, où Physical Intelligence (π0, π0-FAST), Figure AI ou Apptronik cherchent à étendre les capacités de leurs humanoïdes et bras industriels au-delà du pick-and-place visuel. La question du sim-to-real pour les contacts reste l'un des derniers verrous majeurs avant un déploiement industriel à l'échelle. En évitant la refonte architecturale, TAP-VLA propose une voie d'intégration compatible avec les VLAs existants, ce qui simplifie son adoption par des équipes qui travaillent à partir de modèles déjà entraînés. La publication sur arXiv sans conférence associée indique que ce travail est encore en cours d'évaluation par les pairs ; aucun déploiement réel ou pilote industriel n'est annoncé à ce stade.

IA physiqueOpinion
1 source
Planification séquentielle par points d'ancrage pour la robotique
1628arXiv cs.RO 

Planification séquentielle par points d'ancrage pour la robotique

Des chercheurs de la Case Western Reserve University ont publié SPARK (Sequential Planning via Anchored Robotic Keypoints), un système neurosymbolique de manipulation robotique sans entraînement supplémentaire. Sur LIBERO-PRO, benchmark évaluant la robustesse face aux changements de position et de tâche, SPARK atteint 43,7 % sur six configurations, soit plus du double de CaP-Agent0 (18,2 %) et des baselines Vision-Language-Action. L'architecture repose sur deux appels Gemini : le premier génère un arbre de comportement (behavior tree) typé composé de primitives précodées intégrant le contrôle bas niveau (mouvement, préhension, géométrie de profondeur) ; le second propose trois formulations textuelles alternatives par objet, que SAM3 évalue pour retenir la détection la plus confiante. Un mécanisme de récupération relance toute primitive échouée sur des objets re-détectés, sans nouvel appel LLM. Le système a été validé sur trois familles de robots (UR10e, Franka FR3, Franka bimanuels) pour neuf tâches à vingt essais chacune, avec une moyenne de 68 %. Le résultat central est architectural : SPARK identifie la perception comme le principal point de rupture des pipelines de manipulation, non la planification. Les formulations alternatives par objet apportent +27,7 points sur les tâches spatiales et +10,0 sur la suite objet ; la boucle de récupération ajoute +5,0 points globalement. Là où CaP-Agent0 re-interroge un LLM en repartant de zéro à chaque échec, SPARK ne replanifie que la détection, réduisant significativement le coût computationnel. Point stratégique : chaque essai produit automatiquement une trajectoire vérifiée et étiquetée, permettant à un planificateur training-free de générer les données dont les VLAs ont besoin sans téleopération humaine. SPARK s'inscrit dans le débat entre architectures VLA end-to-end (pi-0 de Physical Intelligence, RT-2 de Google DeepMind, OpenVLA de Berkeley) et approches hybrides symboliques. Les VLAs misent sur la généralisation apprise de données massives mais restent fragiles aux distributions non vues à l'entraînement, précisément ce que LIBERO-PRO mesure. SPARK démontre qu'une conception neurosymbolique rigoureuse peut surpasser des modèles foundation sur des configurations difficiles. La validation reste limitée à neuf tâches sur trois plateformes, sans timeline de déploiement industriel annoncée. La modularité du système -- détecteur, planificateur et contrôleur remplaçables indépendamment -- ouvre la voie à des intégrations sur de nouvelles plateformes sans réentraînement.

RecherchePaper
1 source
WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement
1629arXiv cs.RO 

WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement

Des chercheurs ont publié sur arXiv (référence 2602.13977v2) un framework nommé WoVR, conçu pour entraîner via du reinforcement learning (RL) des politiques de type Vision-Language-Action (VLA) sans recourir à des milliers d'heures d'interaction physique réelle. Le principe : substituer le robot réel par un modèle du monde appris, c'est-à-dire un modèle vidéo conditionné par les actions qui prédit le comportement de l'environnement. WoVR articule trois mécanismes distincts : un modèle vidéo action-conditionné à stabilité contrôlée, une stratégie baptisée Keyframe-Initialized Rollouts qui réinitialise les trajectoires imaginées à partir d'images-clés pour limiter l'accumulation d'erreurs sur l'horizon, et une co-évolution conjointe du modèle du monde et de la politique pour maintenir leur cohérence dans le temps. Les expériences rapportées montrent des gains sur le benchmark LIBERO et des améliorations mesurées sur plusieurs plateformes robotiques physiques. Ce travail s'attaque à un verrou central du post-entraînement des VLA : le RL promet d'aller au-delà de l'imitation learning, mais ses besoins en données d'interaction rendent son application directe sur robot physique quasi prohibitive. La contribution de WoVR est de montrer qu'un modèle du monde imparfait peut néanmoins servir de simulateur RL fiable, à condition de contrôler explicitement ses hallucinations plutôt que de les ignorer. C'est un signal positif pour la thèse que le sim-to-real, appliqué non au niveau du rendu physique mais au niveau de la prédiction vidéo apprise, peut débloquer l'optimisation de politiques à grande échelle. La nuance importante : les résultats sont publiés sous forme de papier de recherche, les démonstrations sont disponibles sur wovr-corl.github.io, mais aucun déploiement industriel n'est revendiqué. WoVR s'inscrit dans une vague de recherche qui cherche à reproduire pour la robotique ce que le RL a accompli pour les grands modèles de langage. Les VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA ont montré des capacités impressionnantes en imitation, mais leur amélioration par RL reste un problème ouvert. D'autres approches concurrentes misent sur des simulateurs physiques classiques (Isaac Lab, MuJoCo) ou sur du RL directement en conditions réelles, avec des cycles de collecte longs et coûteux. WoVR propose une troisième voie via les world models vidéo, dans la lignée des travaux de type DIAMOND ou DreamerV3 appliqués à la robotique. La soumission cible CORL, conférence de référence du domaine, ce qui suggère une prochaine validation par les pairs et potentiellement une intégration dans les pipelines d'entraînement open-source des équipes académiques et industrielles dès 2026.

RechercheOpinion
1 source
ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes
1630arXiv cs.RO 

ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes

Des chercheurs ont publié le 30 juin 2026 sur arXiv (identifiant 2606.30362) les travaux ReactiveBFM, un framework de planification-contrôle en boucle fermée temps réel pour humanoïdes, validé sur le robot Unitree G1. L'approche atteint un taux de succès de 93,1 % lors de benchmarks sim-to-sim soumis à des perturbations sévères, surpassant de 28,6 points les baselines en boucle ouverte classiques. Le système permet notamment la poursuite de cibles mobiles en zero-shot, c'est-à-dire sans avoir été entraîné explicitement sur cette tâche, en mobilisant une coordination corps entier fluide et une replanification à la volée. Le verrou technique adressé est le problème dit d'exposition bias : quand un modèle génératif de planification de mouvement est naïvement chaîné avec un contrôleur d'exécution, les écarts de suivi s'accumulent jusqu'à provoquer des effondrements comportementaux. ReactiveBFM répond à cela via un curriculum d'échantillonnage par préfixe planifié (scheduled prefix sampling), qui force le planificateur à apprendre des comportements de récupération d'erreur à partir d'états physiques imparfaits plutôt que de trajectoires de référence idéales. Un second mécanisme d'asynchronisme découple la replanification autorégressive, lente, du tracking haute fréquence, tandis qu'un chunking de trajectoire assure la cohérence spatio-temporelle sans jitter physique. Pour les intégrateurs industriels et les équipes de recherche en contrôle humanoïde, cela valide une piste concrète pour rendre les Behavior Foundation Models (BFMs) exploitables hors conditions laboratoire. Les BFMs sont une classe émergente de modèles pré-entraînés qui fournissent des priors de contrôle pour humanoïdes, analogues aux LLMs pour le texte. Jusqu'ici, leur limitation majeure était l'exécution figée de mouvements pré-définis, sans adaptation à l'environnement. Le Unitree G1, humanoïde chinois à 16 000 dollars commercialisé depuis 2024, s'est imposé comme banc de test standard dans la recherche académique. Les concurrents directs sur le plan scientifique incluent les travaux autour de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les architectures VLA embarquées chez Figure et Agility Robotics. Ce papier reste à ce stade un preprint non évalué par les pairs : les résultats sim-to-sim sont prometteurs mais aucun déploiement industriel ni transfert sim-to-real robuste n'est encore démontré.

RechercheOpinion
1 source
SIR : représentations d'images structurées pour un apprentissage robotique explicable
1631arXiv cs.RO 

SIR : représentations d'images structurées pour un apprentissage robotique explicable

Des chercheurs du laboratoire Intuitive Robots publient SIR (Structured Image Representations, arXiv:2606.30101), une méthode visant à corriger l'un des angles morts persistants des politiques robotiques basées sur l'apprentissage profond : leur opacité. Le pipeline repose sur les Scene Graphs (graphes de scènes) comme couche intermédiaire entre la perception et l'action. À partir d'une image d'entrée, le système construit d'abord un graphe complet dont les noeuds sont initialisés avec des features visuelles extraites. Un second module apprend ensuite, de bout en bout, à réduire (sparsifier) ce graphe pour n'en conserver que le sous-graphe pertinent à la tâche courante, avant de le transmettre au générateur d'actions. Évalué sur RoboCasa, un benchmark de manipulation en environnement domestique simulé, SIR atteint un taux de succès moyen de 19,5 % contre 14,81 % pour les baselines à embeddings visuels directs, soit un gain relatif d'environ 30 %. L'intérêt ne se limite pas à ce delta de performance, en soi modeste en valeur absolue. Ce qui distingue SIR, c'est que le sous-graphe creux appris constitue une représentation lisible et auditable : il devient possible d'inspecter sur quels objets et quelles relations le modèle fonde ses décisions pour une tâche donnée. Lorsque ce sous-graphe s'écarte des attentes humaines, qu'il intègre des noeuds distracteurs sans rapport avec la tâche ou qu'il omet des objets pourtant centraux, les auteurs montrent que cela révèle systématiquement des biais dans le dataset d'entraînement, notamment des corrélations spurieuses et des biais positionnels. Pour des intégrateurs industriels ou des équipes soumises à des exigences de validation et de certification, cette capacité d'audit intrinsèque est un argument autrement plus fort qu'une amélioration marginale du taux de réussite. Ce travail s'inscrit dans un débat de fond au sein de la communauté robotique : les représentations visuelles latentes des architectures de type VLA (Vision-Language-Action) ou des politiques par diffusion sont puissantes mais pratiquement impossibles à déboguer. Les approches concurrentes pour l'explicabilité passent généralement par des méthodes post-hoc, cartes de saillance ou visualisation d'attention dans les Transformers, qui n'interviennent pas dans la boucle d'inférence. SIR propose à l'inverse une explicabilité structurelle native. Le code est disponible sur GitHub (intuitive-robots/SIR\_Model) et les auteurs évaluent pour l'instant uniquement en simulation ; la généralisation à des robots physiques dans des environnements non contrôlés reste la prochaine étape critique pour valider le sim-to-real transfer de cette approche.

RecherchePaper
1 source
AsyncMDE : estimation de profondeur monoculaire en temps réel via mémoire spatiale asynchrone
1632arXiv cs.RO 

AsyncMDE : estimation de profondeur monoculaire en temps réel via mémoire spatiale asynchrone

Des chercheurs ont publié sur arXiv (arXiv:2603.10438v2) AsyncMDE, un système de perception de profondeur monoculaire asynchrone conçu pour permettre un déploiement temps-réel sur plateformes embarquées. L'architecture dissocie deux chemins d'exécution : un modèle fondation "slow path" de 97,5 millions de paramètres, figé, qui génère périodiquement des représentations spatiales de haute qualité en arrière-plan ; et un "fast path" léger de seulement 3,83 millions de paramètres entraînables, qui tourne en parallèle en réutilisant ces features via une fusion complémentaire avec l'observation courante et une mise à jour autorégressive de la mémoire. Sur GPU RTX 4090, le fast path atteint 237 FPS. Sur Jetson AGX Orin optimisé TensorRT, la cible embarquée réaliste pour la robotique mobile, il tourne à 161 FPS tout en récupérant 77 % de l'écart de précision par rapport au modèle fondation complet. L'enjeu industriel est direct : l'estimation de profondeur monoculaire à base de modèles fondation constitue une alternative crédible aux capteurs actifs (LiDAR, ToF), mais leur coût computationnel les rendait jusqu'ici incompatibles avec les contraintes temps-réel des robots mobiles et des AMR. AsyncMDE répond à ce verrou en amortissant le coût du modèle lourd sur plusieurs frames consécutives, en exploitant la redondance spatiale naturelle des déplacements continus d'un robot. La dégradation de précision est bornée et prédictible sur trois benchmarks couvrant des scènes statiques, dynamiques et des mouvements extrêmes synthétiques, ce qui est plus rassurant que des métriques moyennes masquant les cas limites. La profondeur monoculaire est un champ de recherche en forte accélération depuis que les architectures Vision Transformer et les modèles fondation (DPT, Depth Anything, UniDepth) ont montré des généralisations zero-shot solides, mais le goulot computationnel restait le principal obstacle à l'embarquement. AsyncMDE s'inscrit dans une tendance plus large d'inférence asynchrone et de caching de features, similaire aux approches utilisées en détection vidéo temps-réel. Les concurrents directs incluent les méthodes de distillation de modèles fondation (par exemple MobileDepth, FastDepth) et les pipelines LiDAR-caméra fusion légère. La prochaine étape naturelle sera de valider ces chiffres sur des robots réels en navigation autonome, où la latence bout-en-bout, et non le seul débit du réseau, détermine l'utilisabilité.

RecherchePaper
1 source
OGM-CBF : contrôle sûr de robot mobile avec carte d'occupation et mémoire des obstacles hors de vue
1633arXiv cs.RO 

OGM-CBF : contrôle sûr de robot mobile avec carte d'occupation et mémoire des obstacles hors de vue

Une équipe de chercheurs publie sur arXiv (identifiant 2405.10703, quatrième révision) une méthode baptisée OGM-CBF qui couple les fonctions de barrière de contrôle (CBF) à une carte d'occupation en grille (occupancy grid map) construite dynamiquement pendant l'opération du robot. Le problème adressé est précis : les approches CBF existantes ne considèrent que les obstacles présents dans le champ de vision instantané (FoV) du robot. Dès qu'un objet quitte ce champ, occultation, portée capteur dépassée, angle mort, la garantie de sécurité formelle disparaît. OGM-CBF mémorise les obstacles préalablement observés, de forme arbitraire, et les intègre dans le calcul de la barrière même après leur sortie du FoV. Pour résoudre la dégénérescence du gradient de la Signed Distance Function (SDF) en face-à-face avec un obstacle (ce qui annule l'autorité de braquage), les auteurs introduisent une pyramide d'images sur la SDF, produisant un CBF multi-niveaux. La méthode est validée dans le simulateur CARLA, puis déployée sur matériel réel : un robot d'entrepôt compact et un chargeur à roues articulé de grande taille, à direction de châssis. L'enjeu pratique est direct pour les intégrateurs AMR et opérateurs d'engins autonomes : en environnement industriel, un palettier, une machine ou un opérateur en mouvement peuvent masquer momentanément un obstacle critique. Sans mémoire d'environnement, le robot agit comme s'il évoluait dans un espace vide dès la sortie du FoV. OGM-CBF apporte une garantie formelle continue sans exiger de carte préchargée ni de reconstruction 3D explicite, ce qui limite le coût computationnel embarqué. La validation sur un chargeur articulé, véhicule lourd à cinématique non-holonome, typique des chantiers et ports, est particulièrement significative : elle démontre que les garanties CBF tiennent au-delà des plateformes holonomes de laboratoire, ouvrant une voie vers l'automatisation sécurisée en BTP, logistique portuaire et extraction minière. Les CBF constituent un axe de recherche actif depuis une décennie, en concurrence avec les champs de potentiel artificiel et les planificateurs à base de sampling pour la navigation sûre. OGM-CBF se distingue des approches GP-CBF (modélisation probabiliste de l'incertitude) et des CBF couplés à du SLAM complet, en exploitant directement la grille d'occupation sans étape de reconstruction explicite. La publication en est à sa quatrième révision, signe d'un travail itéré par la communauté. Aucun partenaire industriel ni horizon de commercialisation n'est mentionné : il s'agit d'une contribution de recherche fondamentale avec preuves de concept réelles, pas d'une annonce produit.

RecherchePaper
1 source
STEAM : modélisation de l'avantage par ensemble temporel auto-supervisé pour l'apprentissage robotique réel
1634arXiv cs.RO 

STEAM : modélisation de l'avantage par ensemble temporel auto-supervisé pour l'apprentissage robotique réel

Des chercheurs ont publié le 30 juin 2026 sur arXiv (référence 2606.29834) une méthode baptisée STEAM, pour Self-Supervised Temporal Ensemble Advantage Modeling, visant à améliorer l'apprentissage de politiques robotiques à partir de données hétérogènes. Le problème traité est concret : les jeux de données d'entraînement mélangent inévitablement des démonstrations de qualité avec des séquences de blocage, des corrections maladroites ou des comportements sous-optimaux. STEAM attribue à chaque paire de frames un score d'avantage sans nécessiter d'annotation humaine. Le système entraîne un ensemble de prédicteurs décalés temporellement sur des trajectoires expertes, chaque prédicteur estimant le décalage temporel normalisé entre deux frames pour produire un scalaire d'avantage. Le score final retenu est le minimum de l'ensemble, ce qui confère une posture conservative face aux données ambiguës. Combiné à CFGRL (Classifier-Free Guidance Reinforcement Learning), STEAM a été évalué sur quatre tâches physiques réelles : pliage bimanuel de serviettes, passage de chips en caisse, réassort de canettes de cola, et pick-and-place à un bras. Les gains de taux de succès observés sont respectivement de 59 %, 54,3 %, 23 % et 16,2 % par rapport aux baselines. L'intérêt pour les intégrateurs et les équipes de recherche appliquée est double. D'abord, STEAM est entièrement label-free : il n'exige pas d'annotation manuelle des frames "bonnes" ou "mauvaises", ce qui réduit drastiquement le coût de curation des datasets. Ensuite, les gains mesurés sur des tâches réelles de manipulation, notamment sur le pliage de tissu qui reste un benchmark difficile en robotique souple, suggèrent que la méthode tient face au reality gap, une hypothèse longtemps débattue dans le domaine sim-to-real. La discrimination automatique entre progression utile et stall ou régression est un verrou central pour l'apprentissage à partir de données d'opérateurs humains en environnement industriel, où la qualité des démonstrations est rarement homogène. STEAM s'inscrit dans une vague de méthodes cherchant à rendre le Reinforcement Learning from Demonstrations (RLfD) moins dépendant de données propres et annotées. Des approches voisines comme GAIL, IRL ou les méthodes basées sur des modèles de récompense appris se heurtent toutes à la question de la supervision implicite de la qualité. STEAM tente d'y répondre via une hypothèse simple : la proximité temporelle dans une trajectoire experte est un proxy fiable de la progression. Les auteurs ne mentionnent pas d'affiliations industrielles explicites ni de déploiement prévu à date, et les résultats restent à confirmer sur des environnements plus bruités ou des horizons temporels plus longs. Les prochaines étapes naturelles porteront sur la généralisation à des politiques de type VLA (Vision-Language-Action) et à des configurations multi-robots.

RecherchePaper
1 source
Transformateur tactile hétérogène
1635arXiv cs.RO 

Transformateur tactile hétérogène

Des chercheurs ont déposé le 30 juin 2026 sur arXiv (référence 2606.29948) le Heterogeneous Tactile Transformer (HTT), un framework visant à résoudre un verrou fondamental du toucher artificiel : l'hétérogénéité des capteurs tactiles. Un modèle entraîné sur un capteur visuotactile de type GelSight ne peut aujourd'hui pas être réutilisé sur un capteur matriciel résistif sans réentraînement complet, ce qui empêche toute mutualisation des données à grande échelle. HTT propose une architecture composée d'encodeurs spécifiques à chaque capteur couplés à un tronc transformer partagé, pré-entraîné par reconstruction masquée par modalité et alignement cross-modal entre paires de capteurs. Ce pré-entraînement s'appuie sur un nouveau dataset baptisé Heterogeneous Paired Tactile (HPT), compilant 1,6 million de frames synchronisées issues de quatre capteurs : deux visuels (vision-based) et deux matriciels (array-based). Les expériences montrent que HTT produit des représentations transférables à de nouvelles tâches et à des capteurs jamais vus à l'entraînement. Ce verrou est réel et coûteux pour les équipes robotique. Contrairement à la vision, où des modèles pré-entraînés comme ViT ou CLIP se transfèrent facilement d'une caméra à une autre, le tactile est resté un silo par capteur, forçant chaque projet à recollecte ses propres données de contact. Si HTT généralise correctement, cela ouvre la voie à des datasets tactiles fédérés, analogue à ce qu'Open X-Embodiment a réalisé pour la manipulation visuo-motrice, et potentiellement à des politiques contact-rich entraînées sur des données hétérogènes issues de plusieurs fournisseurs. Pour un intégrateur ou un COO industriel, l'enjeu est concret : pouvoir changer de capteur tactile sans tout réentraîner représente un gain de temps et de coût significatif sur les lignes d'assemblage précis. Ce travail succède à des approches comme T3 (Transferable Tactile Transformers, 2024) et UniTouch, qui avaient amorcé la représentation cross-capteur mais restaient limitées à une ou deux modalités. Sur le marché, GelSight et ses dérivés (DIGIT, GelSight Mini) dominent la recherche académique, tandis qu'Xela Robotics et Contactile misent davantage sur les grilles résistives ou piézoélectriques. L'article est présenté comme preprint et n'a pas encore été soumis à revue par les pairs ; le code, les poids de modèle et le dataset HPT seront publiés à la parution définitive, ce qui permettra une évaluation indépendante des performances revendiquées. L'étape suivante naturelle sera l'intégration de HTT dans des pipelines VLA (Vision-Language-Action) pour doter les mains humanoïdes d'un retour haptique fiable et généralisable à l'échelle.

RecherchePaper
1 source
Génération de concepts spatiaux de haut niveau intégrant l'incertitude dans des graphes de scènes 3D factorisés par GNN
1636arXiv cs.RO 

Génération de concepts spatiaux de haut niveau intégrant l'incertitude dans des graphes de scènes 3D factorisés par GNN

Des chercheurs ont publié fin 2024 (arXiv:2409.11972, version 4) une méthode d'apprentissage automatique permettant à un robot de découvrir de manière autonome des concepts spatiaux de haut niveau, pièces, murs, couloirs, à partir de simples observations géométriques primitives telles que des surfaces planes verticales. L'approche s'appuie sur un réseau de neurones de graphe (GNN) qui infère ces concepts en ligne, puis les injecte comme facteurs optimisables dans un backend de SLAM (Simultaneous Localization and Mapping) reposant sur des Factorized 3D Scene Graphs. Ces graphes de scène 3D organisent la représentation de l'environnement de façon hiérarchique et métrico-sémantique, de l'obstacle ponctuel jusqu'à la pièce entière. Les gains mesurés sont significatifs : en environnements simulés à agencements complexes, la détection de pièces progresse de 20,7 % et l'estimation de trajectoire de 19,2 %. Sur des chantiers de construction réels, la détection de pièces s'améliore de 5,3 % et la précision du recalage cartographique de 3,8 %. L'intérêt de ce travail réside dans la suppression d'un goulot d'étranglement persistant dans la robotique d'intérieur : jusqu'ici, la génération de concepts spatiaux et la spécification des covariances associées reposaient sur des heuristiques conçues à la main, concept par concept. Cette dépendance limitait la généralisation à de nouveaux types d'environnements et rendait coûteuse l'extension à de nouvelles classes sémantiques. En automatisant à la fois la génération des facteurs et la calibration de leur incertitude, la méthode rend le pipeline SLAM plus robuste et potentiellement déployable sans expertise de réglage fin, ce qui intéresse directement les intégrateurs de robots mobiles autonomes (AMR) opérant dans des bâtiments industriels ou des chantiers évolutifs. Les 3D Scene Graphs, popularisés notamment par les travaux du MIT et de l'université Carnegie Mellon sur Hydra et ses successeurs, constituent depuis plusieurs années un cadre de référence pour la cartographie sémantique hiérarchique. La variante "factorisée" utilisée ici, qui encode les concepts comme contraintes d'optimisation dans le graphe de poses, est une direction active de la communauté graph-SLAM. Les concurrents directs incluent les approches basées sur des segmentations panoptiques 2D projetées en 3D (SegMap, Kimera) ainsi que les méthodes neuronales implicites de type NeRF-SLAM. La prochaine étape naturelle sera d'étendre la méthode à des concepts au-delà des pièces, zones fonctionnelles, étages, bâtiments, et de la valider à plus grande échelle sur des flottes robotiques opérant en continu.

RecherchePaper
1 source
IA incarnée et environnement : vers des robots de soins physiques sûrs et sensibles au contexte
1637arXiv cs.RO 

IA incarnée et environnement : vers des robots de soins physiques sûrs et sensibles au contexte

Des chercheurs du laboratoire EMPRISE de l'université Cornell ont publié E²-CARE (arXiv:2606.28592), un cadre de contrôle pour robots d'assistance physique capables de s'adapter à la fois aux environnements variables et aux différentes morphologies robotiques sans reprogrammation. L'architecture représente l'espace de soins dans un graphe de scène 3D dynamique unifié qui modélise explicitement l'environnement, le robot et l'humain assisté. Ce graphe sert à synthétiser des contraintes spécifiques à chaque tâche, injectées en temps réel pour piloter l'exécution de gabarits d'interaction (interaction templates) prédéfinis. Le système a été évalué sur quatre activités de la vie quotidienne (ADL) dans des centaines d'environnements domestiques simulés, puis validé par des études utilisateurs portant sur deux tâches de soin avec deux robots distincts dans des environnements réels. La démonstration centrale d'E²-CARE est que les mêmes primitives de mouvement peuvent être réutilisées en zero-shot sur des robots de morphologies différentes et dans des environnements non vus à l'entraînement, sans dégradation de sécurité. C'est une réponse directe à l'un des verrous majeurs du secteur : le couplage fort entre un système de soin et son environnement ou son hardware d'origine. La contrainte de sécurité autour des humains, souvent absente des démonstrateurs existants, est ici modélisée comme une couche de contraintes d'exécution. Pour un intégrateur ou un acheteur B2B dans l'aide à la personne, c'est un argument de fond : un pipeline logiciel unique potentiellement déployable sur plusieurs plateformes matérielles, ce qui réduit substantiellement le coût d'intégration multi-hardware. EMPRISE (Enabling Manipulation and Physical Robot Interaction with Sensing and Embodiment) travaille depuis plusieurs années sur les robots d'assistance physique en contexte de vie quotidienne. Ce domaine reste très fragmenté : Diligent Robotics (Moxi, logistique hospitalière), 1X Technologies, et les plateformes académiques comme PR2 ou HSR de Toyota traitent chacun des sous-espaces étroits. E²-CARE n'est pas un produit commercial annoncé : il s'agit d'une contribution académique, sans prototype industriel ni timeline de commercialisation. Les étapes suivantes logiques impliquent des évaluations sur un plus grand nombre de morphologies physiques réelles et des scénarios d'interaction plus complexes, notamment avec des utilisateurs à mobilité fortement réduite ou en situation de dépendance avancée.

RecherchePaper
1 source
Odométrie proprioceptive à ancrage de contact pour robots à pattes et roues-pattes
1638arXiv cs.RO 

Odométrie proprioceptive à ancrage de contact pour robots à pattes et roues-pattes

Des chercheurs présentent dans un preprint arXiv (2602.17393, v3) un estimateur d'état proprioceptif pour robots à pattes qui n'utilise ni caméra, ni LiDAR, uniquement IMU et encodeurs moteurs. Le système calcule la pose et la vitesse du corps avec une formulation unifiée couvrant quadrupèdes et robots roue-patte (wheel-legged), validée sur quatre plateformes quadrupèdes distinctes. Le principe central est l'ancrage cinématique par contact : l'estimation des forces d'appui via le couple articulaire sélectionne les pieds en stance, dont les empreintes au sol fournissent des contraintes intermittentes dans le repère monde qui limitent la dérive cumulative de l'IMU. Un algorithme de clustering de hauteur avec décroissance temporelle corrige la dérive en élévation lors de longues traversées en recalant les nouvelles empreintes sur les plans d'appui précédemment observés. Pour les plateformes roue-patte, le contact enregistré est propagé par déplacement de roulement effectif avec compensation du mouvement de jambe et correction de direction sur pente. Cette approche répond à un verrou concret de la robotique mobile : les robots à pattes déployés en environnements visuellement dégradés (poussière, fumée, obscurité, souterrains) ne peuvent pas se fier à la vision ou au LiDAR. Les méthodes purement inertielles accumulent une dérive de cap et de position incompatible avec une navigation autonome prolongée. En ancrant l'estimation sur des contacts validés par couple, la méthode s'affranchit partiellement de la qualité des encodeurs de vitesse, sujets à quantification. Un filtre de Kalman cubature (UKF) par cinématique inverse est proposé en module optionnel pour améliorer les observations de vitesse pied sans alourdir l'architecture principale. La cohérence géométrique multi-contacts est injectée comme prior souple de cap plutôt que comme reset brutal de l'attitude, préservant la continuité de l'état estimé. L'odométrie proprioceptive pour robots à pattes est un terrain actif depuis les travaux Contact-Aided Invariant EKF (Hartley, University of Michigan) et les plateformes ANYmal développées à l'ETH Zurich. Les grandes solutions commerciales actuelles comme Boston Dynamics Spot ou Unitree B2 combinent odométrie visuelle et inertielle en production, ce qui signale l'intérêt industriel pour des alternatives sans capteurs exogènes dans des conditions adverses. La méthode est présentée comme extensible aux bipèdes, morphologie centrale dans la course aux humanoïdes industriels. À sa troisième révision sur arXiv, le papier cible probablement une conférence de robotique de premier rang (IROS, ICRA), sans calendrier de soumission annoncé.

RecherchePaper
1 source
Fiez-vous à vos instincts : RL à l'inférence guidé par la confiance pour les modèles VLA
1639arXiv cs.RO 

Fiez-vous à vos instincts : RL à l'inférence guidé par la confiance pour les modèles VLA

Des chercheurs ont publié le 30 juin 2026 sur arXiv (ref. 2506.29892) un framework d'apprentissage par renforcement baptisé T²VLA (Test-time VLA), conçu pour améliorer les modèles Vision-Language-Action sans recourir à aucun signal de récompense externe. Le principe central repose sur une observation empirique : dans les VLA à actions discrètes, les trajectoires générées avec un niveau de confiance interne plus élevé ont statistiquement une probabilité nettement supérieure de réussir la tâche. T²VLA exploite cette propriété en utilisant la similarité de chaque trajectoire produite avec des démonstrations expertes à haute confiance comme signal de récompense intrinsèque. Le framework intègre un mécanisme appelé Confidence-Driven Dual Expert Bootstrapping, qui arbitre dynamiquement entre un Local Pseudo-Expert (favorisant l'exploration locale) et un Global Expert Pool (garantissant la stabilité de l'entraînement). Les expériences portent sur les benchmarks LIBERO et RoboTwin, deux environnements de référence en manipulation robotique simulée, et couvrent plusieurs architectures VLA dont OpenVLA-OFT et la série pi (pi-0, pi-0.5). L'intérêt pratique de T²VLA est de supprimer le principal frein au déploiement du RL pour les robots incarnés : la nécessité d'instrumenter l'environnement avec des détecteurs de succès ou des fonctions de récompense prédéfinies. En robotique industrielle ou logistique, concevoir ces signaux externes est coûteux, fragile, et souvent impossible hors d'un laboratoire contrôlé. Le fait que le modèle puisse s'auto-améliorer à partir de ses propres évaluations internes représente un changement de paradigme potentiellement significatif pour le sim-to-real : les résultats publiés montrent que T²VLA dépasse les baselines supervisées et s'approche des performances d'un RL oracle (disposant des vraies récompenses), ce qui suggère que le signal intrinsèque capture bien la qualité des trajectoires. Il convient néanmoins de noter que les évaluations restent pour l'instant confinées à des environnements simulés, et l'écart sim-to-real sur du matériel réel n'est pas abordé dans ce papier. T²VLA s'inscrit dans une dynamique plus large autour des VLA généralistes, portée notamment par Physical Intelligence (pi-0), DeepMind (RT-2), et les équipes autour d'OpenVLA. Ces modèles combinent vision, langage et contrôle moteur dans une architecture unifiée, mais leur amélioration post-déploiement butait jusqu'ici sur la nécessité d'un retour environnemental explicite. Le framework proposé est décrit comme agnostique à l'architecture, ce qui facilite théoriquement son intégration sur les VLA existants. Les auteurs ne mentionnent pas de partenaire industriel ni de timeline de déploiement réel, et le travail reste au stade de preuve de concept académique sur simulateurs ; des validations sur robots physiques et en conditions de variabilité industrielle seront déterminantes pour confirmer la portée opérationnelle de l'approche.

IA physiqueOpinion
1 source
Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents
1640arXiv cs.RO 

Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents

Une équipe de recherche a soumis le 30 juin 2026 sur arXiv (arXiv:2606.29774) un cadre de mémoire structurée pour agents de manipulation robotique à long horizon. Baptisé "analytic concept-centric memory", le système organise l'expérience autour de concepts analytiques : chaque objet est représenté par ses parties sémantiques, des gabarits paramétriques, des poses ancrées dans l'espace, ses affordances et ses états de manipulation. Deux couches supplémentaires complètent l'architecture : une mémoire de transitions enregistrant les effets des actions sur l'état de scène, et une mémoire de compétences (skill memory) stockant des politiques réutilisables ancrées dans ces gabarits. À l'exécution, l'agent effectue une récupération coarse-to-fine pour identifier objets pertinents, états courants et compétences applicables. Les auteurs valident leur approche sur des tâches de manipulation dépendantes de la mémoire, la généralisation à des objets articulés (portes, tiroirs) et une évaluation en environnement réel. La gestion de mémoire reste un goulet d'étranglement critique en manipulation longue durée. Les agents actuels, y compris ceux fondés sur des architectures VLA (Vision-Language-Action), peinent à réutiliser les connaissances acquises lors d'interactions passées, forçant une replanification coûteuse à chaque nouvelle tâche. Ce cadre montre que structurer explicitement la mémoire autour de concepts physiques améliore le taux de complétion de tâches, la précision de récupération, la réidentification d'objets et la généralisation de compétences inter-objets, par rapport aux baselines non structurées et aux représentations vectorielles par embeddings. Pour les intégrateurs industriels, c'est un signal que la réutilisabilité des compétences sans réentraînement complet commence à devenir atteignable, ce qui réduit potentiellement les coûts de déploiement dans des environnements variables. La manipulation robotique à long horizon est un chantier actif chez plusieurs acteurs majeurs : Google DeepMind avec ses architectures RT-2 et SayCan, Physical Intelligence et son modèle Pi-0, Boston Dynamics, ainsi que des laboratoires comme Stanford et ETH Zurich. Ce travail s'inscrit dans une lignée cherchant à concilier planification symbolique structurée et politiques neuronales, deux paradigmes longtemps opposés. Ce preprint n'a pas encore été soumis à revue par les pairs, et les benchmarks restent des environnements de laboratoire contrôlés. La démonstration sur une plateforme industrielle réelle, avec la diversité des objets, le bruit sensoriel et les contraintes temps réel, reste à établir. Les prochaines étapes naturelles incluent l'intégration avec des VLA à grande échelle et l'évaluation sur des manipulateurs ou humanoïdes en contexte de production semi-réelle.

RechercheOpinion
1 source
GROW² : ancrage du choix d'outil et de sa position pour la manipulation robotique
1641arXiv cs.RO 

GROW² : ancrage du choix d'outil et de sa position pour la manipulation robotique

Des chercheurs ont publié le 30 juin 2026 un système baptisé GROW² (GROunding Which and Where), conçu pour permettre à un robot d'utiliser des objets du quotidien comme outils de substitution lorsque l'outil nominal est absent. L'exemple canonique : couper un gâteau avec une assiette faute de couteau. Le problème technique sous-jacent est ce que les auteurs nomment l'« open-world affordance grounding », identifier quel objet peut remplir la fonction d'un outil et localiser précisément la zone d'action sur cet objet, sans avoir été entraîné spécifiquement sur cette combinaison. GROW² décompose ce problème en deux niveaux hiérarchiques : un niveau sémantique, qui mobilise des Vision-Language Models (VLMs) pour interpréter une instruction en langage naturel, sélectionner l'objet-outil et identifier les parties pertinentes ; et un niveau géométrique, qui utilise des modèles de vision fondamentaux pour ancrer ces parties dans des régions 3D précises à partir d'une seule image RGB-D. L'intérêt industriel est réel : les pipelines robotiques actuels supposent que les outils sont prédéfinis et présents. Dès qu'un objet manque ou qu'une tâche sort du périmètre nominal, le robot s'arrête. GROW² ouvre la voie à une flexibilité opérationnelle sans retraining coûteux, ce qui est directement pertinent pour les intégrateurs en logistique, chirurgie assistée ou fabrication flexible. Les résultats reportés montrent des performances supérieures aux baselines sur les benchmarks d'affordance prediction et une généralisation zero-shot sur des catégories d'objets ouvertes, en simulation comme en conditions réelles. Un point de nuance : l'article ne communique pas de métriques de temps de cycle ni de taux de succès chiffrés en déploiement réel, ce qui rend difficile l'évaluation de la robustesse opérationnelle hors labo. GROW² s'inscrit dans la dynamique des architectures VLA (Vision-Language-Action) qui tentent de résoudre le « sim-to-real gap » en exploitant des modèles fondamentaux pré-entraînés plutôt que de collecter massivement des données robotiques spécifiques. Sur ce créneau, les travaux concurrents incluent notamment π₀ (Physical Intelligence), RT-2 (Google DeepMind) et les recherches autour de SayCan (Google). L'approche de GROW² se distingue par sa modularité hiérarchique et l'absence de fine-tuning bout-en-bout, un choix architectural qui réduit les besoins en données mais dont la robustesse à grande échelle reste à démontrer. La prochaine étape naturelle serait des tests sur des plateformes humanoïdes ou des bras industriels en environnement semi-structuré.

IA physiqueOpinion
1 source
ConCent : apprentissage centré sur le contact réel-vers-sim-vers-réel depuis une seule démonstration
1642arXiv cs.RO 

ConCent : apprentissage centré sur le contact réel-vers-sim-vers-réel depuis une seule démonstration

Déposé sur arXiv fin juin 2026 (arXiv:2606.30268), ConCent (Contact-Centric Real-to-Sim-to-Real) est un framework d'apprentissage par renforcement conçu pour résoudre le transfert sim-to-real dans les tâches de manipulation robotique riche en contacts. L'approche part d'une seule démonstration réelle : à partir de celle-ci, elle extrait automatiquement la séquence d'événements de contact (quand, où et comment les contacts surviennent), puis optimise en simulation la géométrie des objets, approximés comme des groupes de primitives géométriques, pour que la dynamique locale reproduise fidèlement les transitions d'état observées. Cette séquence de contact devient un signal de récompense structuré qui guide la politique RL vers des régimes de contact physiquement plausibles, l'empêchant d'exploiter des artefacts irréalistes du simulateur. Aucune conception manuelle de fonction de récompense par tâche n'est nécessaire. Le noeud du problème que ConCent attaque est le reality gap sur les tâches à fort couplage mécanique (vissage, assemblage précis, manipulation d'objets déformables), où une légère différence de dynamique de contact suffit à invalider une politique entière. Contrairement aux approches par domain randomization ou aux pipelines nécessitant de larges corpus de données réelles, ConCent impose une contrainte structurelle : la politique ne peut progresser qu'en respectant les séquences de contact validées dans le monde réel. Les résultats présentés montrent une meilleure stabilité et robustesse du transfert face à des baselines RL non contraintes. L'absence de reward engineering par tâche représente un gain opérationnel concret pour les équipes souhaitant déployer de nouvelles tâches sans reconfiguration coûteuse. Le problème du sim-to-real pour la manipulation remonte aux travaux fondateurs sur la domain randomization (OpenAI Dactyl, 2019) et aux pipelines de learning from demonstration. Des approches récentes comme la simulation différentiable (DiffTaichi) ou les VLA de type pi0 (Physical Intelligence) et GR00T N2 (NVIDIA) s'attaquent au même reality gap, mais avec des architectures et des volumes de données très différents. ConCent se distingue en ancrant la dynamique simulée sur une démonstration réelle unique, sans calibration manuelle du simulateur. Il s'agit à ce stade d'un preprint académique sans déploiement industriel annoncé, les résultats étant validés en conditions de laboratoire. La suite logique serait une évaluation sur des cycles d'assemblage industriels réels et une comparaison directe avec des architectures VLA pour quantifier l'avantage de l'approche contact-centric à l'échelle.

RecherchePaper
1 source
CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique
1643arXiv cs.RO 

CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique

Des chercheurs ont publié fin juin 2026 CORE (Common Outcome Regularities from Action-Free Visual Demonstrations), un cadre d'apprentissage de politique robotique conçu pour exploiter des vidéos humaines sans annotations de mouvements, afin d'entraîner des robots manipulateurs. La méthode s'appuie sur une observation clé : bien que les trajectoires menant à une même tâche varient, leurs états terminaux partagent des configurations d'objets stables, des relations spatiales et des contraintes de contact reproductibles. CORE entraîne d'abord un encodeur d'état terminal par apprentissage contrastif et objectifs temporels auxiliaires, agrège ensuite les embeddings terminaux réussis en prototypes visuels de but (visual goal prototypes), puis injecte ces prototypes comme conditions globales dans la politique de contrôle du robot. Les gains de taux de succès mesurés sur les benchmarks de référence sont de +3,9 points de pourcentage sur Meta-World, +11,1 pp sur RoboTwin 2.0, et jusqu'à +17,0 pp en manipulation réelle. L'enjeu est direct pour les intégrateurs : collecter des démonstrations robotiques est coûteux en équipement, en opérateurs et en temps de setup, tandis que des millions d'heures de vidéos humaines d'assemblage, de logistique ou de cuisine existent déjà. L'écart morphologique entre la main humaine et un préhenseur robotique a jusqu'ici rendu ces vidéos inutilisables pour l'apprentissage par imitation direct. CORE contourne le problème en ne cherchant pas à transférer les actions elles-mêmes, mais uniquement les régularités des états finaux. Le gain de +17 pp en conditions réelles est particulièrement notable car il indique une réduction du fossé sim-to-real sans contrainte sur la morphologie du robot. En surpassant les variantes conditionnées par texte (architecture VLA classique), CORE suggère que les prototypes visuels de but apportent des contraintes géométriques et physiques plus exploitables que les instructions en langage naturel, une nuance importante pour la calibration de politiques multi-tâches. L'apprentissage par imitation depuis des vidéos humaines est un axe de recherche actif, porté notamment par Google DeepMind avec RT-2, Physical Intelligence avec pi-0, et Meta FAIR. Des méthodes comme R3M ou VIP apprennent des représentations visuelles transférables depuis des vidéos humaines, mais CORE cible spécifiquement les états terminaux plutôt que les représentations d'observation générales, ce qui constitue sa distinction architecturale principale. Les benchmarks retenus, Meta-World et RoboTwin 2.0, sont reconnus sans être universellement adoptés, ce qui limite les comparaisons directes avec les résultats concurrents. Aucun partenariat industriel ni déploiement commercial n'est mentionné : il s'agit d'un preprint arXiv, dont les suites dépendront de réplications indépendantes et d'extensions vers des tâches plus complexes, notamment la manipulation en chaîne longue ou en environnements non structurés.

RechercheOpinion
1 source
FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde
1644arXiv cs.RO 

FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde

Des chercheurs du LECAR Lab (Learning, Computing and Autonomous Robots) ont publié le 30 juin 2026 sur arXiv (référence 2506.28476) un préprint décrivant FADA, un cadre d'adaptation en quelques exemples pour le contrôle de robots humanoïdes. L'architecture, baptisée Planner-IDM (Planner, Inverse Dynamics Model), fonctionne en trois étapes : entraînement d'une politique oracle avec accès à des informations privilégiées (état complet du simulateur), distillation de ce comportement dans un modèle étudiant déployable via DAgger, puis fine-tuning ciblé du seul module IDM à partir d'environ deux minutes de données collectées dans l'environnement réel. La supervision ne requiert ni démonstrations expertes ni signal de récompense : uniquement les paires (actions, observations) enregistrées lors de ces brefs rollouts. Les expériences montrent que FADA surpasse les baselines d'adaptation in-context et d'adaptation end-to-end sur des tâches whole-body à haute précision exécutées sur robot physique. L'enjeu pratique est réel : le "dynamics mismatch", écart entre les dynamiques simulées et celles du domaine cible dues aux variations de terrain, de charge utile ou de réponse actionneur, reste l'un des principaux freins au déploiement industriel des humanoïdes. Les approches actuelles forcent un compromis inconfortable entre la randomisation de domaine (zero-shot, mais sous-spécialisée) et le recalibrage complet du modèle ou le ré-entraînement de politique (précis, mais coûteux en données et en temps). Deux minutes de rollouts pour aligner un IDM représentent un point d'équilibre opérationnellement crédible pour des intégrateurs qui ne peuvent pas interrompre une ligne de production plusieurs heures. Cela dit, les vidéos hardware présentées sur le site du projet sont sélectionnées par les auteurs ; aucune évaluation statistique robuste sur variété de terrains ou charges n'est encore disponible dans ce préprint non relu par les pairs. Le sim-to-real gap est un problème structurel que l'ensemble de l'écosystème humanoïde, Figure (02/03), Tesla Optimus, Boston Dynamics Atlas, Physical Intelligence (pi-zero), tente de résoudre, principalement par randomisation massive en simulation ou par apprentissage en contexte (in-context RL). FADA s'inscrit dans une troisième voie, plus proche des travaux sur l'adaptation rapide de politiques (MAML, RMA) mais appliquée à l'architecture Planner-IDM. Le LECAR Lab, affilié à l'Université de Californie San Diego, capitalise ici sur des travaux antérieurs en locomotion et manipulation whole-body. Prochaine étape attendue : validation sur une plus large variété de dynamiques et de morphologies robotiques, ainsi qu'une soumission à conférence (ICRA ou CoRL) pour passer le filtre de la revue par les pairs.

RecherchePaper
1 source
ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme
1645arXiv cs.RO 

ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme

Des chercheurs ont publié le 30 juin 2026 un article de préprint (arXiv:2606.28804) présentant ViPSim, un framework de simulation destiné à entraîner et évaluer des systèmes Vision-Langage-Action (VLA) sans risque pour le matériel réel. Le problème central qu'adresse ViPSim est le "representation gap" : les modèles de monde incarné (Embodied World Models, EWMs) doivent traduire des actions en basse dimension (positions articulaires, vitesses) en vidéos haute résolution cohérentes sur de longues séquences. Sans correctif, cette asymétrie produit une dérive de trajectoire cumulée et des interactions robot-objet incohérentes dès qu'on dépasse quelques pas de simulation. Pour y remédier, ViPSim combine deux espaces complémentaires : un Visual Space qui fournit des ancrages géométriques explicites (projections pixel-alignées de la pose de l'effecteur, perspectives caméra, géométrie de scène assistée par la profondeur, masques morphologiques du robot) et un Parameter Space qui injecte les séquences d'action brutes et les matrices caméra pour guider précisément le mouvement. Les expériences rapportées montrent que l'approche est backbone-agnostic, c'est-à-dire indépendante de l'architecture de génération vidéo sous-jacente. L'enjeu industriel est direct : le principal frein à l'utilisation des EWMs comme bancs de test pour les VLA est précisément leur manque de fidélité géométrique sur des horizons longs, ce qui rend leurs évaluations peu fiables pour des tâches de manipulation complexe. ViPSim prétend résoudre ce verrou, et les résultats préliminaires indiquent une capacité émergente sur des objets déformables, notamment le pliage de tissu, un cas d'usage notoire pour mettre en échec les simulateurs rigides classiques. Le framework conserverait également des performances robustes dans des scénarios hors-distribution et en cross-embodiment, c'est-à-dire appliqué à des morphologies robotiques non vues à l'entraînement. Pour un intégrateur ou un équipementier cherchant à réduire les coûts de collecte de données réelles, un simulateur de ce type permettrait d'accélérer le cycle de validation des politiques VLA avant déploiement terrain. Il convient toutefois de nuancer : il s'agit d'un preprint académique sans validation industrielle publiée, et les vidéos de démonstration sélectionnées ne constituent pas une preuve de performance en production. Le contexte est celui d'une course effrénée à la simulation haute-fidélité pour robots incarnés, portée par la montée en puissance des architectures VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Ces modèles nécessitent des volumes massifs de données de démonstration, et la génération synthétique en est le principal levier de scalabilité. Des frameworks concurrents comme UniSim, IRASim ou Genesis s'attaquent au même problème avec des approches différentes, certains privilégiant la physique explicite, d'autres la génération neuronale pure. ViPSim se positionne sur la cohérence géométrique longue durée plutôt que sur le réalisme visuel brut, une niche encore peu couverte. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication actuelle : il s'agit pour l'instant d'une contribution de recherche ouverte, sans implémentation publique annoncée.

RechercheOpinion
1 source
Apprentissage de dynamiques transférables : des modèles d'action aux modèles du monde
1646arXiv cs.RO 

Apprentissage de dynamiques transférables : des modèles d'action aux modèles du monde

Des chercheurs ont publié en juin 2026 un préprint arXiv (2606.29501) décrivant A2World, un modèle de monde diffusion multi-vues conditionné par les actions, pré-entraîné sur de larges volumes de données de manipulation robotique avec annotations d'actions réelles. L'idée centrale est que prédire comment une action modifie visuellement une scène, plutôt que simplement générer des vidéos plausibles, force le modèle à capturer des dynamiques d'interaction réutilisables. Ce pré-entraînement produit ce que les auteurs appellent des "priors de dynamiques transférables". À partir des mêmes poids pré-entraînés, deux variantes sont dérivées : A2World-sim, adapté en simulateur spécialisé par tâche ou environnement, et A2World-policy, un modèle de prédiction jointe vidéo-action conditionné par des instructions visuelles. Les expériences sont validées sur des benchmarks de simulation et en conditions réelles, sans que les auteurs ne publient de métriques quantitatives précises dans le résumé. L'enjeu concret pour les équipes de robotique industrielle est le coût des données de rollout réel : A2World-sim vise à remplacer les passages physiques sur robot par des déroulements dans le modèle de monde, permettant une évaluation de politique à grande échelle et des analyses contrefactuelles ("que se passerait-il si...") sans mobiliser de hardware. C'est le noeud dur du problème sim-to-real : les simulateurs classiques (Isaac Sim, MuJoCo) échouent sur la fidélité visuelle et de contact, tandis qu'un modèle de monde appris sur des données réelles devrait, en théorie, hériter de la physique implicite du monde réel. A2World-policy s'inscrit dans la lignée des VLA (Vision-Language-Action models) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, en conditionnant la prédiction d'action sur le flux visuel et des instructions en langage naturel. Il s'agit toutefois d'un préprint non revu par les pairs, et les métriques présentées (benchmarks de simulation) restent à confirmer sur des déploiements réels à l'échelle. Ce travail s'inscrit dans une dynamique de recherche active sur les modèles de monde pour la robotique, portée depuis 2023-2024 par des approches comme UniSim (Google), RoboDreamer, ou Genie, qui toutes cherchent à découpler l'apprentissage de politique du coût de la collecte de données physiques. Physical Intelligence (pi-0, pi-0.5), Figure AI (Figure 02/03) et 1X Technologies misent sur des architectures VLA similaires pour la généralisation multi-tâches. La contribution spécifique d'A2World est de partager les poids pré-entraînés entre le simulateur et le modèle de politique, plutôt que de les traiter comme deux systèmes distincts. Les prochaines étapes attendues dans ce type de travaux sont la publication de benchmarks ouverts, une comparaison directe contre des rollouts réels, et, pour les acteurs industriels, la question de savoir si ces approches tiennent sur des environnements non structurés hors laboratoire.

IA physiqueOpinion
1 source
Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage
1647arXiv cs.RO 

Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage

Des chercheurs ont publié sur arXiv (référence 2606.22471) une approche systématique pour générer automatiquement, via apprentissage par renforcement (RL), des données d'entraînement synthétiques destinées à la manipulation bimane et dextre conditionnée par le langage. Le pipeline proposé combine trois briques : une conception de récompenses généralisables (non spécifiques à une tâche), une randomisation de domaine pour combler l'écart simulation-réel (sim-to-real gap), et des annotations de tâches exprimées en langage naturel. Les expériences portent sur trois tâches de manipulation représentatives ; les auteurs concluent à une amélioration significative de la généralisation par rapport aux baselines, sans toutefois publier de métriques quantitatives précises dans le résumé disponible. Le principal verrou qu'adresse ce travail est le manque de données massives et de qualité pour entraîner des politiques généralistes sur des manipulateurs bimanes à haute dextérité. La télé-opération humaine, standard actuel pour collecter des démonstrations (méthode utilisée par des projets comme ACT, Diffusion Policy, ou les datasets de Aloha), souffre de limitations structurelles : faible diversité de tâches, inadéquation morphologique entre la main humaine et l'effecteur robot, et absence des actions robot dans les vidéos brutes. Le RL surmonte ces obstacles mais exige traditionnellement des fonctions de récompense artisanales, tâche par tâche. En proposant une conception de récompenses généralisables, les auteurs visent à rendre le pipeline scalable sans surcoût d'ingénierie par tâche, ce qui est le vrai défi industriel pour quiconque cherche à déployer des politiques multi-tâches sur des lignes d'assemblage ou de conditionnement. Ce travail s'inscrit dans une tendance de fond : face à la rareté des données robotiques réelles, la synthèse en simulation devient une voie centrale, portée par des frameworks comme Isaac Lab (NVIDIA), MuJoCo Playground, ou Genesis. Il dialogue directement avec des approches comme RoboGen, RoboCasa ou GROOT, qui cherchent également à automatiser la génération de tâches et de données. Les politiques VLA (Vision-Language-Action) telles que pi0 de Physical Intelligence ou OpenVLA nécessitent des corpus variés que la télé-opération seule ne peut pas alimenter à l'échelle requise. Les prochaines étapes naturelles seront la validation sur hardware réel et la comparaison quantitative avec des datasets de référence comme RoboSet ou Open X-Embodiment.

RecherchePaper
1 source
Modèles vision-langage pour la navigation de robots sociaux déployables : relier le raisonnement sémantique et le contrôle de bas niveau
1648arXiv cs.RO 

Modèles vision-langage pour la navigation de robots sociaux déployables : relier le raisonnement sémantique et le contrôle de bas niveau

Des chercheurs ont publié fin juin 2026 une étude de synthèse (arXiv:2606.28760) consacrée à l'intégration des modèles vision-langage (VLM) dans les systèmes de navigation sociale pour robots mobiles. Le papier, qui recense l'état de l'art dans ce domaine encore fragmenté, structure les approches existantes autour de trois composantes interdépendantes : le raisonnement de haut niveau assuré par le VLM, les modules de planification et de contrôle bas niveau, et les mécanismes intermédiaires qui assurent la traduction entre les deux couches. Les auteurs proposent en parallèle une feuille de route structurée couvrant l'ancrage spatial, les représentations intermédiaires, les évaluateurs sémantiques et les modules de contrôle, avec une revue des jeux de données et plateformes d'évaluation disponibles pour la navigation sociale. L'enjeu mis en évidence est précisément celui qui bloque le passage en production de nombreux robots de service : les méthodes classiques de navigation (SLAM, planification métrique, évitement d'obstacles) sont fiables mais aveugles aux normes sociales, aux intentions humaines et au contexte situationnel. Un robot qui calcule la trajectoire optimale dans un couloir d'hôpital ne sait pas, sans couche sémantique, qu'il coupe la route à un soignant pressé ou s'arrête trop près d'un patient. Les VLMs apportent ce raisonnement commun et la compréhension du langage naturel, mais leur latence et leur non-déterminisme les rendent difficiles à coupler directement à des boucles de contrôle temps-réel et safety-critical. L'article argumente que des architectures hybrides, VLM pour le raisonnement, contrôleurs classiques pour l'exécution, sont aujourd'hui la seule voie viable vers le déploiement. Ce travail s'inscrit dans un mouvement plus large d'hybridation entre fondation models et robotique embarquée, porté ces deux dernières années par des papiers comme RT-2 (Google DeepMind), SayCan (Everyday Robots) et les travaux de navigation sémantique de CMU et Stanford. Côté industriel, les plateformes de robots de service (Keenon, Pudu, Bear Robotics côté asie-pacifique ; Enchanted Tools en France avec Miroki) cherchent précisément à résoudre ce passage de l'interaction naturelle au mouvement contraint. Le survey ne décrit pas un système déployé mais un cadre de référence académique, à lire comme une cartographie des briques disponibles plutôt que comme une validation terrain.

IA physiqueOpinion
1 source
CSAR : architecture système conteneurisée pour la robotique
1649arXiv cs.RO 

CSAR : architecture système conteneurisée pour la robotique

Des chercheurs ont publié en juin 2026 CSAR (Containerized System Architecture for Robotics), un cadre architectural décrit dans un preprint arXiv (identifiant 2606.30293). L'architecture s'appuie sur la conteneurisation système via LXC/LXD, la communication inter-processus ROS 2/DDS, et une infrastructure edge organisée en trois couches : Infrastructure Core, Platform and Multi-User Orchestration, et Compute and Acceleration. Ces couches visent à créer des environnements d'exécution persistants et "hardware-affines", découplés des charges expérimentales volatiles. CSAR a été déployé et évalué dans un laboratoire de robotique académique à travers deux cas d'usage représentatifs : du SLAM 3D déporté sur serveur edge et de la cartographie sémantique accélérée par GPU. Les templates de déploiement, fichiers de configuration et documentation sont publiés en open source sur GitHub (goyoambrosio/CSAR). L'intégration logicielle en robotique distribuée souffre depuis des années de frictions récurrentes : isolation des dépendances défaillante, incompatibilités entre environnements embarqués et cloud, partage inefficace des GPU dans les équipes multi-utilisateurs. CSAR apporte une réponse structurée en séparant explicitement les couches d'infrastructure stables des workloads expérimentaux. Selon les auteurs, les résultats observés incluent une meilleure utilisation des ressources partagées, une intégration logicielle simplifiée et un prototypage plus sûr. Pour un intégrateur ou un responsable R&D, l'enjeu est concret : réduire le phénomène "works on my machine" et raccourcir le cycle test-déploiement sur des architectures edge hétérogènes, un problème chronique dans les labo multi-robots ou multi-chercheurs. L'adoption de Docker et Kubernetes en robotique s'est faite de manière ad hoc, sans tenir compte des contraintes spécifiques du secteur : latence temps-réel, accès direct au matériel (GPU, capteurs), et partage de ressources entre utilisateurs concurrents. CSAR s'inscrit dans un courant de travaux "devops for robotics" qui inclut AWS RoboMaker, les environnements CI Gazebo, ou encore des projets académiques sur la robotics cloud infrastructure. Il faut noter que CSAR reste pour l'instant une contribution de recherche avec un déploiement en labo académique, sans adoption industrielle annoncée. Les suites naturelles seraient une validation à plus grande échelle, sur des architectures multi-sites, ou une intégration dans des pipelines de déploiement de flottes robotiques réelles.

InfrastructureOpinion
1 source
Détection multi-classe d'humains et d'objets sur des bras robotiques par capteurs proprioceptifs
1650arXiv cs.RO 

Détection multi-classe d'humains et d'objets sur des bras robotiques par capteurs proprioceptifs

Une équipe de recherche a publié sur arXiv (référence 2508.02425) une étude portant sur la détection multi-classe de contacts en collaboration physique humain-robot (pHRC), testée sur le manipulateur Franka Emika Panda, l'un des cobots de référence pour la recherche académique. L'objectif : identifier en temps réel si le robot entre en contact avec un humain, un objet mou ou un objet dur, en utilisant uniquement la perception proprioceptive (couples articulaires, positions, vitesses) sans aucun capteur visuel externe. Un dataset dédié a été constitué sur ce bras à 7 degrés de liberté, puis trois architectures de réseaux de neurones ont été entraînées et comparées : LSTM, GRU et Transformers. Le meilleur modèle atteint 91,11 % de précision en test temps réel, avec une approche de prétraitement par fenêtre glissante identifiée comme optimale pour cette analyse de séries temporelles. Ce résultat marque une progression significative par rapport aux classifieurs binaires (humain/non-humain ou mou/dur) qui constituaient jusqu'ici l'état de l'art dans ce domaine. Passer à trois classes augmente la granularité de l'analyse de contact, ce qui est directement utile pour des applications industrielles : un robot qui distingue un opérateur d'un outil ou d'une pièce peut adapter sa réponse (arrêt d'urgence, réduction de vitesse, reconfiguration de trajectoire) de façon bien plus fine. L'approche purement proprioceptive est également un avantage pratique majeur : elle ne nécessite ni caméra supplémentaire ni calibration visuelle, ce qui simplifie l'intégration sur des cellules robotisées existantes. La précision de 91 % en conditions temps réel reste toutefois à valider sur des scénarios industriels variés au-delà du protocole de collecte de données décrit. Le Franka Emika Panda, désormais commercialisé sous la marque Franka Robotics après le rachat par Agile Robots, est une plateforme quasi-standard pour la recherche en pHRC grâce à son contrôle en couple natif. Ce travail s'inscrit dans un axe de recherche actif qui cherche à rivaliser avec les approches par vision (détection de contact par caméra RGB-D ou tactile) en misant sur la richesse des signaux internes du robot. Les concurrents directs incluent des travaux utilisant des peaux tactiles (BioTac, iCub) ou des réseaux de neurones appliqués aux données de force/couple de robots Universal Robots ou Kuka. La prochaine étape naturelle serait l'extension à des environnements moins contrôlés et à des robots à payload plus élevé pour valider le transfert sim-to-real de ces modèles.

RecherchePaper
1 source