Aller au contenu principal
RecherchearXiv cs.RO 

SocialVLA : une passerelle de perception sociale pour détecter et corriger les échecs de manipulation VLA à partir des réactions humaines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient SocialVLA, une passerelle de perception sociale locale et indépendante de la politique de contrôle, qui transforme les réactions spontanées d'un humain en signaux d'interruption pour les politiques vision-langage-action (VLA) de manipulation. Le système combine quatre briques : détection paralinguistique causale dans l'audio (cris, soupirs, exclamations), reconnaissance de réactions visuelles, détection de phrases d'arrêt explicites et estimation de la pertinence robot, qui vérifie que la réaction concerne bien le robot. Une fusion asynchrone « premier événement » déclenche une pause du VLA dès le premier signal assez fiable. Un canal vocal distinct recueille les corrections verbales pour reprendre, relancer ou réviser l'instruction. L'évaluation a eu lieu sur un Unitree G1 physique avec 15 participants : 238 épisodes annotés justifiant une intervention et 1,038 heure de comportement sans intervention. En rejeu hors ligne figé, le système atteint 54,6 % de rappel et 69,5 % de précision, la fusion audio-vidéo non filtrée montant à 64,3 % de rappel. Sur un 16e participant inédit, en déploiement prospectif, il obtient 59,5 % de rappel et 91,7 % de précision. La latence médiane détecteur-fusion est de 47,9 ms, celle entre la porte VLA et l'arrêt physique de 336 ms, et celle entre le début de la réaction et l'arrêt de 1,021 s.

L'intérêt est de traiter un angle mort des VLA : ces politiques échouent souvent sans reconnaître leurs propres erreurs, et les détecteurs d'échec internes restent peu fiables hors distribution. Utiliser l'humain présent comme capteur d'anomalie, sans micro-gestes ni interface dédiée, ouvre une voie de supervision peu coûteuse pour les cellules collaboratives et les robots de service. Le filtre de pertinence est le résultat le plus concret : il fait passer les épisodes de faux arrêts de 100 à 57 et la précision de 60,5 % à 69,8 %. Pour un exploitant, c'est ce qui sépare un robot qui s'arrête au moindre éclat de voix d'un robot utilisable. Les limites sont nettes. Avec un rappel d'environ 55 à 60 %, plus de 40 % des épisodes à risque échappent au système. Une latence d'environ une seconde entre la réaction et l'arrêt reste longue pour des objets lourds ou tranchants. Les 91,7 % de précision reposent sur un seul participant, ce qui n'a pas de valeur statistique. Ce n'est donc pas une fonction de sécurité, mais une couche de supervision complémentaire.

Le travail s'inscrit dans l'essor des politiques VLA généralistes (Pi-0, GR00T, Helix) et de leurs variantes de détection d'échec et de récupération. Il se place aussi dans la lignée de l'interaction humain-robot, qui exploite depuis longtemps les signaux sociaux implicites. Le choix d'un fonctionnement entièrement local, sans cloud, répond aux contraintes de latence et de confidentialité des déploiements en milieu humain. La plateforme G1 d'Unitree, peu coûteuse, en fait un banc d'essai reproductible. Le système est indépendant de la politique, donc testable en principe sur d'autres VLA. L'étape suivante serait de le valider sur plus de participants, des tâches plus variées et des environnements bruyants, puis de mesurer s'il améliore réellement le taux de réussite des tâches, point que les résultats annoncés ne tranchent pas.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique
1arXiv cs.RO 

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique

Des chercheurs proposent UVTA, un cadre qui exploite des démonstrations humaines enregistrées avec retour tactile pour améliorer les politiques de manipulation dextre des robots. L'équipe a d'abord construit un système de capture de mouvement tactile, qui enregistre de façon synchrone les images, les signaux tactiles et les mouvements de la main. Avec cet outil, elle a constitué le jeu de données UVTA, qui couvre cinq tâches riches en contacts. Il comprend 1 000 démonstrations humaines et 150 démonstrations robot par tâche. Le modèle associé, un Unified Visual-Tactile-Action Model, projette l'humain et le robot dans des représentations tactiles et d'action alignées. Il prédit conjointement les trajectoires futures d'action et de toucher. Les démonstrations humaines supervisent ainsi l'apprentissage de représentations sensibles au contact, et seules les actions du robot sont exécutées au déploiement. Lors d'évaluations sur robot réel, sur les cinq tâches, la méthode atteint 70 % de réussite moyenne. La meilleure base de comparaison visuo-tactile plafonne à 29 %, et une ablation d'architecture à 42 %. L'enjeu tient au goulot d'étranglement des données tactiles. La téléopération de mains dextres ne renvoie à l'opérateur qu'un retour tactile limité, ce qui rend les démonstrations robot riches en toucher difficiles à collecter à grande échelle. Les auteurs contournent le problème avec l'hypothèse que la main change mais que la physique de l'interaction reste la même. Les données humaines deviennent alors une source de supervision plus abondante et plus variée. Les performances progressent avec le nombre de démonstrations humaines et ne saturent pas à 1 000 par tâche. Cela suggère qu'une montée en volume pourrait encore améliorer les résultats, sans que le papier le démontre au-delà. Pour les intégrateurs et les équipes qui développent des politiques de préhension fine, l'idée est de déplacer l'effort de collecte du robot vers l'humain, moins coûteux. Elle vise les tâches où la vision seule échoue, comme l'insertion, la manipulation en occlusion ou le contrôle de force. Il s'agit d'un travail académique, pas d'un produit, et il faut lire les chiffres avec prudence. Le score de 70 % porte sur seulement cinq tâches, avec 150 démonstrations robot par tâche, dans un cadre de laboratoire. Le résumé ne précise ni la main utilisée, ni les capteurs tactiles, ni le nombre d'essais, ni la nature exacte des tâches. L'écart avec les bases de comparaison (29 % et 42 %) est net, mais il dépend de choix de baselines que seul le texte complet permet d'apprécier. Le papier s'inscrit dans un courant de recherche qui cherche à apprendre la manipulation à partir de vidéos et de gants de capture humains, pour dépasser la téléopération. Il ajoute ici la modalité tactile, encore peu présente dans les grands modèles vision-langage-action (VLA). La version 2 de l'article sur arXiv et une page projet (uni-vta.github.io) sont disponibles. Aucun déploiement industriel ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets
2arXiv cs.RO 

VidAct : apprendre la manipulation à partir de vidéos réelles grâce à une perception 3D centrée sur les objets

VidAct est un framework « vidéo vers robot » décrit dans un préprint arXiv (2609.36870v1) qui apprend des politiques de manipulation à partir d'une seule vidéo monoculaire par tâche, puis les déploie sur un robot réel en zero-shot. Le système repose sur trois briques. La première reconstruit le maillage des objets et leur mouvement à partir de vidéos quelconques, puis exprime ce mouvement dans le repère statique de l'objet. Cela évite tout retargeting spécifique à l'embodiment (le passage d'une main humaine à une pince) et accepte des points de vue de caméra variés. La deuxième brique, un transfert de trajectoire résiduel, adapte le mouvement reconstruit à de nouvelles configurations d'objets en conservant la forme de la trajectoire. La troisième, au cœur de l'apprentissage, demande à la politique de prédire à chaque image le nuage de points complet de l'objet, fourni en privilège par la simulation, comme tâche auxiliaire. Le déploiement reste en RGB seul. Les expériences couvrent des vidéos humaines, robotiques, générées et issues d'internet. Le résumé ne donne aucun chiffre de taux de réussite, de nombre de tâches ni de plateforme robotique. Pour les intégrateurs et les équipes R&D, l'intérêt tient à la réduction du coût de la donnée. La téléopération reste l'étalon de la collecte de démonstrations, mais elle est chère et peu extensible. Apprendre à partir d'une vidéo par tâche, y compris générée, déplace le goulot d'étranglement de la collecte vers la reconstruction 3D. L'approche traite aussi deux limites connues des méthodes de reconstruction : la dépendance à des caméras contraintes et la déformation des trajectoires face à un nouvel agencement d'objets. La supervision par nuage de points complet par image suggère que la conscience de la géométrie 3D des objets, souvent absente des politiques RGB, améliore la généralisation et le transfert simulation-réel. Ces conclusions restent à confirmer : les auteurs affirment des gains, mais l'abstract ne les quantifie pas. Les résultats viennent de tâches de laboratoire, sans indication de robustesse en environnement industriel ni de comparaison publiée avec des VLA généralistes. Ce travail s'inscrit dans une lignée qui cherche à remplacer la démonstration robotique par de la vidéo, en concurrence avec la collecte téléopérée à grande échelle et les modèles fondation type VLA, qui misent sur le volume de données plutôt que sur la reconstruction explicite. Il s'agit d'un préprint en première version, sans code, produit ni déploiement annoncé à ce stade. Les prochaines étapes à surveiller sont la publication des taux de réussite détaillés, la diffusion du code et, surtout, une validation sur des tâches longues, contraintes ou déformables, où la reconstruction monoculaire est la plus fragile.

RecherchePaper
1 source
SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
3arXiv cs.RO 

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon

Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée. L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier. SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique
4arXiv cs.RO 

Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique

Des chercheurs présentent Safe-Night VLA, un framework de manipulation robotique qui ajoute la perception thermique infrarouge longue longueur d'onde à un modèle vision-langage-action (VLA) pré-entraîné, publié en version corrigée sur arXiv (2603.05754v2). Contrairement aux VLA classiques qui reposent uniquement sur des caméras RGB, ce système fait remonter un raisonnement sémantique fondé sur les propriétés thermodynamiques des objets et des surfaces, ce qui lui permet de percevoir des signaux invisibles pour une caméra couleur standard. Pour limiter la fragilité connue des politiques génératives face à des scénarios hors distribution d'entraînement, les auteurs ajoutent un filtre de sécurité basé sur des fonctions de barrière de contrôle (control barrier functions), garantissant un respect déterministe des contraintes de l'espace de travail pendant l'exécution. Les tests ont été menés sur un bras manipulateur Franka, avec un protocole d'évaluation inédit combinant manipulation conditionnée par la température, localisation de cibles sous une surface opaque, et désambiguïsation de reflets visuels. Résultat annoncé: le système surpasse les baselines RGB seules sur ces trois tâches, tout en maintenant l'exécution sous contrainte de sécurité. L'intérêt pour l'industrie tient moins à la démo qu'au principe qu'elle teste: peut-on faire dire à un modèle fondation pré-entraîné sur du RGB des choses pertinentes sur une modalité physique qu'il n'a jamais vue à l'entraînement, simplement en injectant un flux thermique dans son backbone vision-langage. Si ce principe se généralise, cela ouvre la voie à des VLA capables de manipuler dans le noir, de détecter des objets chauds ou cachés sous une surface, ou de distinguer un vrai objet d'un reflet trompeur, des cas d'usage utiles en logistique nocturne, en environnements industriels à faible visibilité ou en inspection. L'ajout d'un filtre de sécurité formel plutôt que purement appris répond aussi à une critique récurrente des politiques VLA end-to-end: l'absence de garanties dures sur les collisions ou les dépassements de zone de travail, un point sensible pour tout déploiement en environnement partagé avec des humains. Le travail s'inscrit dans la vague actuelle des VLA généralistes (type GR00T N2, Pi-0, Helix) qui cherchent à étendre la perception au-delà du RGB pour combler l'écart entre démonstrations en laboratoire et robustesse réelle. Il reste à ce stade une validation académique sur un seul bras fixe en conditions contrôlées, sans indication de déploiement industriel ni de partenaire commercial, et les auteurs eux-mêmes ne revendiquent qu'une preuve de concept sur l'exploitation de modalités physiques non visibles.

RecherchePaper
1 source