Aller au contenu principal
Voici la traduction :
RecherchearXiv cs.RO 

Voici la traduction :

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose sur arXiv (référence 2608.04765) une nouvelle architecture pour les modèles vision-langage-action (VLA), conçue pour améliorer la planification sur des tâches longues et complexes. Le système repose sur un module de mémoire linguistique explicite qui convertit les observations visuelles successives en une séquence textuelle cohérente, dotée d'une logique temporelle. L'architecture est hiérarchique et découplée en deux niveaux : un modèle vision-langage (VLM) de haut niveau, entraîné selon un paradigme de question-réponse visuelle, effectue le raisonnement sémantique et met à jour récursivement la mémoire ainsi que les sous-instructions ; un modèle VLA de bas niveau exécute ensuite le contrôle continu et précis à partir de ces sous-instructions et des observations visuelles. Les auteurs ont évalué la méthode dans plusieurs environnements de simulation, puis mené des expériences de transfert sim-to-real sur une plateforme robotique réelle, sans préciser dans le résumé le type de bras, le payload utilisé, ni le nom de l'institution.

L'enjeu dépasse l'amélioration incrémentale : les modèles VLA actuels butent sur les tâches longues car ils sont conditionnés uniquement par l'observation courante, ce qui les rend de fait non-markoviens et sujets à une dérive, les erreurs d'exécution s'accumulant faute de correction en boucle fermée. C'est précisément le fossé entre démonstration et réalité que pointent les critiques des vidéos humanoïdes : enchaîner plusieurs sous-tâches de façon fiable, sans réinitialisation entre chaque étape. En rendant la mémoire du système explicite et interprétable (sous forme de texte plutôt que de vecteurs latents opaques), l'approche offre aussi une traçabilité utile pour le débogage industriel, un point sensible pour des intégrateurs qui doivent comprendre pourquoi un robot échoue en cours de tâche plutôt que se contenter d'un taux de succès global.

Ce travail s'inscrit dans une lignée de recherches cherchant à corriger les limites du contrôle bout en bout pur, où le fine-tuning sur l'action tend à dégrader les représentations sémantiques héritées des VLM, un problème documenté sur des familles de modèles comme RT-2, OpenVLA, Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. D'autres équipes explorent des pistes voisines, mémoire épisodique, planification hiérarchique, modèles du monde, pour traiter le même problème d'horizon long. Publié en août 2026 sous forme de preprint, sans code ni benchmark comparatif détaillé dans le résumé, ce travail reste à ce stade une contribution académique : il faudra des évaluations sur des suites de référence partagées et des tests au-delà du laboratoire pour juger si la mémoire linguistique explicite tient sa promesse de robustesse en conditions réelles.

À lire aussi

Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée
1arXiv cs.RO 

Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée

Des chercheurs présentent Uni-LaViRA (Language-Vision-Robot Actions Translation), une architecture de navigation incarnée publiée le 28 mai 2026 sur arXiv (2605.27582), capable de piloter quatre types de robots distincts, robots à roues, quadrupèdes, humanoïdes et un drone à voilure fixe construit sur mesure, sans aucun entraînement spécifique sur des trajectoires robot. Le système s'appuie sur des grands modèles multimodaux de langage préentraînés (MLLMs) pour décomposer la navigation en deux types de commandes : une commande directionnelle sémantique en langage naturel, et une cible visuelle au niveau pixel. En mode zéro-shot, Uni-LaViRA atteint 60,7 % de taux de succès sur VLN-CE R2R, 51,3 % sur VLN-CE RxR, 77,7 % sur HM3D-v2, 60,0 % sur HM3D-OVON, 54,7 % sur MP3D-EQA et 40,0 % sur OpenUAV. Deux mécanismes structurent la boucle d'agent : le TODO List Memory (TDM), qui maintient une liste de sous-objectifs mise à jour à chaque pas et réinjectée dans la fenêtre d'attention du modèle, et le Second Chance Backtrack (SCB), qui ramène le robot à son état précédant une erreur et force le replanning à partir de la sous-trajectoire échouée. Ce résultat interpelle directement le paradigme dominant des VLA à grande échelle, qui réclame des millions de trajectoires et des milliers d'heures GPU pour atteindre des niveaux de performance comparables. Si les chiffres se confirment en environnements non contrôlés, Uni-LaViRA suggère qu'une partie du problème de généralisation en navigation peut être résolue structurellement, via un raisonnement sur la géométrie de l'action, plutôt que par accumulation de données. Pour les intégrateurs robotiques, cela réduit potentiellement le coût d'adaptation à de nouveaux sites ou morphologies de robots, deux points de friction majeurs dans les déploiements industriels. La capacité à unifier wheeled AMR, quadrupèdes et humanoïdes sous une même architecture sans fine-tuning est particulièrement notable. L'article s'inscrit dans un contexte de compétition intense autour des architectures VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches OpenVLA ou RoboFlamingo ont chacun nécessité des pipelines de collecte de données coûteux. Uni-LaViRA ne cherche pas à remplacer ces modèles sur des tâches de manipulation précise, mais positionne le raisonnement structuré comme alternative crédible pour la navigation. Les benchmarks utilisés (HM3D, MP3D, R2R) sont des standards académiques en simulation ; la validation sur robots réels reste limitée aux quatre plateformes de l'étude, et les performances en conditions industrielles non contrôlées restent à démontrer. Aucune timeline de déploiement ni partenariat industriel n'est mentionné.

RechercheOpinion
1 source
Le Fil IA n'a pas besoin d'audit ni de skill ici, c'est une simple traduction de titre
2arXiv cs.RO 

Le Fil IA n'a pas besoin d'audit ni de skill ici, c'est une simple traduction de titre

Une équipe de recherche a testé en conditions réelles une tête robotique humanoïde interactive dans trois lieux publics allemands : un office de tourisme, une bibliothèque municipale et l'accueil d'une administration du bâtiment (Bauamt). Le robot y a fonctionné en continu pendant plusieurs jours, engageant la conversation avec les visiteurs dans leur propre langue grâce à un pipeline de traitement du langage naturel couplé à un moteur de simulation émotionnelle, qui génère des réponses verbales multimodales enrichies d'expressions faciales. Les chercheurs ont mesuré l'acceptation des usagers via le questionnaire TAM2 (Technology Acceptance Model), un outil standard évaluant l'utilité perçue et la facilité d'usage. Résultat global : les utilisateurs se sont montrés motivés à interagir avec le robot et l'ont jugé plutôt utile et facile à prendre en main, quel que soit le site. Mais un usager sur cinq a trouvé le temps de réponse du système trop lent, ce qui nuisait à la fluidité du dialogue. L'enseignement principal dépasse la simple démonstration technique : l'acceptation d'un robot humanoïde conversationnel dépend fortement du contexte d'usage, pas seulement de ses capacités. L'office de tourisme et la bibliothèque, lieux où l'interaction est perçue comme légitime et sans enjeu, se sont révélés bien plus favorables que l'accueil administratif, où la volonté d'engager la conversation était nettement plus faible. Pour les intégrateurs et décideurs qui envisagent de déployer des robots d'accueil ou d'assistance multilingue, ce résultat suggère de prioriser les environnements à faible friction sociale plutôt que les guichets administratifs, et de traiter la latence de réponse comme un frein d'adoption aussi critique que la précision linguistique elle-même. Ce travail s'inscrit dans la lignée des recherches en interaction homme-robot social, où l'acceptation en conditions réelles reste plus rarement documentée que les démonstrations en laboratoire. Contrairement aux plateformes humanoïdes orientées tâches industrielles ou logistiques, ce projet cible l'accueil du public et la médiation linguistique. Les auteurs identifient la réduction du temps de réponse comme priorité pour les développements futurs, condition jugée nécessaire avant d'envisager un déploiement plus large de ce type de tête robotique interactive dans d'autres services publics.

UEL'étude a été menée dans des lieux publics allemands (office de tourisme, bibliothèque, administration du bâtiment), fournissant des enseignements directement applicables au déploiement de robots d'accueil dans les services publics européens.

RecherchePaper
1 source
Attaques par redirection de trajectoire sur les modèles vision-langage-action (VLA)
3arXiv cs.RO 

Attaques par redirection de trajectoire sur les modèles vision-langage-action (VLA)

Des chercheurs ont publié le 12 juin 2026 un article (arXiv:2606.12978) introduisant une nouvelle classe d'attaques adversariales sur les politiques robotiques de type VLA (Vision-Language-Action), ces architectures qui combinent un modèle de langage, une vision par caméra et un contrôleur moteur pour exécuter des tâches de manipulation à partir d'instructions textuelles. L'attaque baptisée "command-preserving trajectory redirection" (redirection de trajectoire préservant la commande) consiste à modifier subtilement le prompt d'entrée de façon à ce qu'il reste visuellement et sémantiquement proche de l'instruction légitime, mais provoque un résultat physique entièrement différent. Le modèle de menace est strict : l'attaquant ne modifie ni les poids du modèle, ni l'environnement, il choisit un seul prompt avant l'épisode, et ce prompt reste dans la norme syntaxique de la commande originale, sans mots-cibles ni langage correctif. Les auteurs proposent une méthode de recherche "on-policy" qui exploite des rollouts réels du robot pour identifier les perturbations textuelles dont le comportement en boucle fermée dévie vers une tâche cible. Les expériences sont conduites en simulation et sur robot physique, confirmant le transfert de l'attaque au monde réel. Ce résultat est significatif pour les intégrateurs et les décideurs industriels qui évaluent l'adoption des VLA en production, notamment dans les contextes de manipulation collaborative ou d'assemblage. La vulnérabilité exploite une propriété structurelle des VLA en boucle fermée : le même prompt est réappliqué à chaque étape de re-planification, et chaque action conditionnée modifie les observations futures sur lesquelles la politique agit. Un prompt malveillant peut donc cumuler ses effets sur toute une trajectoire, là où les attaques précédentes se limitaient à des perturbations action-par-action ou à la persistance d'actions basses. Cela contredit implicitement l'hypothèse que la robustesse visuelle d'un VLA suffit à garantir son intégrité comportementale, et soulève des questions concrètes sur la validation de sécurité avant déploiement. Les modèles VLA sont au coeur de plusieurs développements récents : pi0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind, ou encore les politiques embarquées sur les humanoïdes Figure et 1X. La recherche en sécurité adversariale sur ces architectures était jusqu'ici dominée par des attaques sur les observations visuelles ou sur les actions individuelles ; ce travail ouvre formellement le champ des attaques au niveau de l'instruction textuelle à horizon long. Les auteurs n'annoncent pas de correctif ni de contre-mesure validée, ce qui laisse ouverte la question de la robustification des pipelines VLA. Les prochaines étapes attendues dans la communauté concerneront vraisemblablement la détection de prompts adversariaux à la volée et l'évaluation de ce vecteur d'attaque sur des modèles déployés commercialement. Le site projet est accessible à l'adresse indiquée dans le papier.

RechercheOpinion
1 source
Traduction événementielle de la téléopération haut du corps d'un humanoïde en conditions d'éclairage difficiles
4arXiv cs.RO 

Traduction événementielle de la téléopération haut du corps d'un humanoïde en conditions d'éclairage difficiles

Des chercheurs présentent un système de téléopération temps réel du haut du corps d'un robot humanoïde, piloté par une caméra événementielle neuromorphique plutôt qu'une caméra RGB classique. Le dispositif repose sur la Prophesee EVK4, qui fonctionne de façon asynchrone avec une résolution temporelle élevée et une plage dynamique supérieure à 120 dB, permettant un suivi stable en contre-jour sévère ou dans des environnements descendant sous 5 lux. L'architecture combine un module de perception à faible latence, utilisant une accumulation d'événements optimisée et une fusion inertielle alignée sur la gravité, avec un module de mouvement causal baptisé TWIST, chargé du retargeting cinématique en ligne. Le système a été validé sur une plateforme embarquée NVIDIA Booster T1 couplée à un buste humanoïde à 18 degrés de liberté, avec une latence photon-action de bout en bout mesurée entre 23 et 34 millisecondes, meilleure que les pipelines RGB classiques testés dans les mêmes conditions. L'intérêt pratique dépasse la simple prouesse technique. La téléopération humanoïde bute aujourd'hui sur un problème concret d'imitation de mouvement en environnement industriel réel: éclairage variable, contre-jour dans les entrepôts, ateliers mal éclairés, mouvements rapides des opérateurs. Les caméras RGB classiques, à temps d'intégration fixe, décrochent précisément dans ces conditions, ce qui limite le déploiement de la téléopération hors laboratoire contrôlé. En montrant qu'une caméra événementielle conserve une latence de suivi de l'ordre de la trentaine de millisecondes là où le RGB se dégrade, l'étude apporte un argument concret en faveur des capteurs neuromorphiques pour les cas d'usage exigeants en dynamique ou en éclairage difficile, un segment jusqu'ici resté marginal face à la domination du RGB et du LiDAR dans les stacks de perception robotique. Les auteurs restent toutefois mesurés: en scène statique et bien éclairée, le RGB ou une approche hybride RGB-événements reste préférable, ce qui positionne la vision événementielle comme un complément ciblé plutôt qu'un remplacement généralisé. Ce travail s'inscrit dans la course actuelle à l'amélioration des interfaces de téléopération humanoïde, un maillon clé pour la collecte de données d'apprentissage par imitation utilisées par des architectures VLA comme TWIST elle-même, Pi-0 ou GR00T N2. Il ne s'agit pas d'un produit commercial mais d'une publication de recherche (arXiv, juillet 2026), sans annonce de partenariat industriel ni de calendrier de déploiement. La piste ouverte, hybrider capteurs événementiels et RGB selon les conditions de luminosité, dessine une prochaine étape logique pour fiabiliser la téléopération humanoïde hors des conditions de laboratoire.

UELe capteur événementiel utilisé, le Prophesee EVK4, est développé par une entreprise française, illustrant le rôle de l'écosystème européen de la vision neuromorphique dans la recherche en téléopération humanoïde.

RecherchePaper
1 source