Aller au contenu principal
TacForcing : génération d'actions en flux continu avec retour tactile à l'exécution
RecherchearXiv cs.RO 

TacForcing : génération d'actions en flux continu avec retour tactile à l'exécution

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente TacForcing, un framework de génération d'actions en flux continu pour la manipulation robotique riche en contacts, publié sur arXiv (arXiv:2608.25798v1). Il remplace l'expert d'action standard des modèles vision-langage-action (VLA) par un « streaming action expert » qui génère les actions en se conditionnant sur des retours tactiles captés pendant l'exécution, et non plus sur des observations figées antérieures au mouvement. Un mécanisme associé, Execution-Aware Tactile Attention (EATA), restreint ce conditionnement tactile aux actions proches de leur exécution réelle, réduisant le décalage entre capture tactile et mouvement. Sur six tâches simulées du benchmark UniVTAC et trois tâches réelles de manipulation riche en contacts, TacForcing atteint des taux de réussite moyens de 65% et 69% respectivement, devant les références existantes.

Le problème visé est connu des intégrateurs en préhension fine et assemblage: les VLA à base de blocs d'actions (« chunks ») prédisent un mouvement complet à partir d'observations pré-exécution, rendant le conditionnement tactile obsolète dès que l'état de contact change (glissement, résistance, déformation). Les approches tactiles réactives existantes compensent avec un contrôleur haute fréquence séparé, ce qui alourdit l'architecture et l'entraînement. En intégrant le retour tactile directement dans le flux de génération, sans contrôleur additionnel, TacForcing simplifie cette chaîne et illustre qu'un VLA peut devenir réactif au contact sans architecture parallèle, un enjeu concret pour les tâches d'assemblage, d'insertion ou de manipulation d'objets déformables en environnement industriel.

Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui a suivi des systèmes comme Pi-0, GR00T N2 ou Helix, où l'ajout de modalités sensorielles au-delà de la vision vise à combler l'écart entre démonstrations et robustesse réelle. Il s'agit d'une publication académique, sans acteur industriel ni déploiement commercial associé, évaluée sur le benchmark UniVTAC et seulement trois tâches réelles, ce qui invite à la prudence sur la généralisation des taux annoncés avant validation indépendante à plus grande échelle.

À lire aussi

ProAct : génération de mouvement en flux continu et raisonnement à base d'agents pour l'interaction sociale incarnée en temps réel
1arXiv cs.RO 

ProAct : génération de mouvement en flux continu et raisonnement à base d'agents pour l'interaction sociale incarnée en temps réel

Une preprint arXiv révisée (2602.14048v2) présente ProAct, un framework a double système pour l'interaction sociale incarnée en temps réel, déployé sur un robot humanoïde. L'architecture associe un « Systeme Comportemental » a faible latence, qui génère en continu parole, gestes et mouvements, a un « Systeme Cognitif » plus lent, dote d'une mémoire et d'un module de prédiction de la motivation de l'utilisateur, qui analyse dialogue et contexte visuel pour décider quand prendre l'initiative plutôt que réagir. Le mouvement est produit par un modèle en flow-matching conditionne par l'intention, avec une branche ControlNet découplée qui traduit les décisions cognitives en gestes non verbaux sans casser la fluidité de l'interaction. Le framework a été valide par des études utilisateurs réelles, des benchmarks de mouvement et un nouveau benchmark dédié, ProActBench, mais le résume ne fournit aucun chiffre de performance précis. L'enjeu dépasse la démonstration : la plupart des agents conversationnels et robots sociaux restent réactifs, incapables de décider seuls du bon moment pour intervenir, ce qui limite leur naturel pour l'assistance a domicile, l'accueil ou le service client. En couplant raisonnement lent et génération de mouvement rapide, ProAct rejoint une tendance déjà visible chez d'autres acteurs de la robotique incarnée, comme les architectures a deux systèmes de Figure (Helix) ou de NVIDIA (GR00T N1). La validation sur robot physique et utilisateurs réels, plutôt qu'en simulation, va dans le sens d'un rapprochement entre démonstration et usage concret, même si l'absence de métriques chiffrées invite a la prudence sur l'ampleur réelle des gains. Le papier s'inscrit dans un mouvement de recherche plus large sur les architectures cognition-action a deux vitesses, popularisées par les modèles vision-langage-action récents comme Pi-0 ou GR00T N2, ici transposées de la manipulation d'objets vers l'interaction sociale. Aucune entreprise ni laboratoire n'est nomme dans le résume, et aucun calendrier de commercialisation n'est mentionne : il s'agit d'une contribution académique publiée sur arXiv, dont l'apport tient autant au framework ProAct qu'a la création de ProActBench, appelé a devenir une référence pour comparer la proactivité des futurs agents sociaux. Les prochaines étapes attendues relèvent donc de l'adoption par la communauté de recherche plutôt que d'un déploiement commercial immédiat.

RecherchePaper
1 source
Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle
2arXiv cs.RO 

Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle

Hydra-0, un nouveau modèle du monde généraliste pour la robotique, a été présenté dans un preprint publié sur arXiv le 19 août 2026 (arXiv:2608.18077). Le système repose sur un concept baptisé "action flow" : les actions du robot y sont représentées comme un flux de mouvement de pixels plutôt que comme des commandes articulaires classiques, ce qui crée une interface visuelle commune permettant d'apprendre les conséquences des actions à travers différents robots, tâches, environnements et architectures de génération vidéo. Dans sa meilleure configuration, Hydra-0 réduit l'erreur de mouvement du robot de 90,4% et l'erreur de mouvement des objets de 60,2% par rapport à une base de référence conditionnée par l'action classique. Sur le benchmark RoboLab, le modèle atteint une corrélation de Pearson de r=0,96 entre les taux de réussite rejoués en simulation et les taux de réussite de référence, un signal de fidélité élevé pour l'évaluation de politiques en boucle ouverte. Les auteurs décrivent aussi un mode inverse émergent : le modèle peut prédire un mouvement robotique compatible à partir d'un flux d'objet désiré transféré depuis une démonstration humaine, une "tête d'action" entraînée convertissant ensuite ces représentations latentes en actions exécutables sans démonstration robotique experte spécifique à la tâche. Pour l'industrie robotique, ce travail s'attaque directement à deux goulots d'étranglement connus des approches vision-language-action (VLA) : la dépendance à des démonstrations robotiques coûteuses par tâche, et la difficulté à faire généraliser un modèle entre embodiments et environnements hétérogènes. En transformant l'action en un signal visuel partagé, l'approche promet une adaptation plus économe en données et une composition zero-shot de comportements, deux propriétés recherchées par les intégrateurs qui veulent déployer un même modèle sur plusieurs plateformes matérielles sans réentraînement lourd. Il faut toutefois noter qu'il s'agit d'un résultat de recherche publié en preprint, évalué sur un benchmark interne (RoboLab) et non d'un système déployé en production ou en usine ; les gains annoncés restent à confirmer par une évaluation indépendante et par des essais sur robots physiques réels au-delà du cadre expérimental décrit. Ce travail s'inscrit dans la vague plus large des modèles du monde et des architectures VLA développés ces dernières années pour unifier perception, prédiction et contrôle robotique, un axe de recherche où plusieurs laboratoires cherchent à résoudre le fossé entre démonstrations en simulation et transfert vers le réel. La piste ouverte par le mode inverse d'Hydra-0, apprendre le contrôle à partir de vidéos humaines sans démonstration robotique dédiée, pourrait, si elle se confirme à plus grande échelle, réduire significativement le coût de collecte de données pour l'entraînement de politiques robotiques généralistes. L'article ne précise pas de calendrier de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source
Politique en escalier : inférence en flux continu pour les modèles monde-action à grands blocs d'actions
3arXiv cs.RO 

Politique en escalier : inférence en flux continu pour les modèles monde-action à grands blocs d'actions

Des chercheurs proposent Staircase Policy, un cadre d'inférence et d'entraînement en flux continu (streaming) qui transforme une politique VLA (vision-langage-action) à flow matching en un « World-Action Model » (WAM) de type JEPA. L'article, publié sur arXiv (2609.36471v1), découpe un grand bloc d'actions (action chunk) en sous-blocs placés à des stades de débruitage décalés. Les actions les plus proches sont exécutées dès qu'elles sont disponibles, pendant que les suivantes continuent d'être affinées. À chaque frontière de sous-bloc, l'état latent futur est re-prédit à partir de la dernière observation et sert à mettre à jour toutes les actions non exécutées, sans relancer une inférence complète. Le modèle, nommé S-WAM, atteint 97,7 % sur LIBERO et 87,9 % sur LIBERO-Plus. Il produit 292,7 actions exécutées par seconde, soit 3,62 fois le débit d'une exécution conventionnelle à précision comparable, et ramène le délai avant la première action de 123,6 à 73,3 ms. Avec des optimisations d'inférence supplémentaires, le débit monte à 642,9 actions par seconde. Les auteurs revendiquent aussi des gains sur plusieurs architectures de politiques et sur des tâches en robot réel, sans que le résumé en précise le nombre, la nature ni les taux de réussite. L'enjeu est d'abord économique. Les WAM, qui conditionnent la génération d'actions sur des observations futures prédites, améliorent la manipulation, mais ajoutent un coût de calcul à une génération d'actions déjà itérative et coûteuse. L'action chunking amortit ce coût, au prix d'une dégradation sur les longs horizons, car les dernières actions du bloc reposent sur des observations périmées. Staircase Policy vise à lever ce compromis entre latence et réactivité, ce qui compte pour les intégrateurs qui veulent embarquer de gros modèles sur des robots à budget de calcul limité. L'erreur de prédiction du futur peut en outre servir de signal pour un chunking adaptatif, c'est-à-dire une confiance mesurable dans le plan en cours. Ces résultats restent toutefois des benchmarks en simulation. LIBERO est proche de la saturation, et un débit en actions par seconde ne dit rien de la robustesse en production. Les mesures en robot réel devront être détaillées pour juger du transfert. Ce travail s'inscrit dans la montée des modèles fondations de robotique fondés sur des VLA à flow matching, dans la lignée de Pi-0, et dans l'intérêt croissant pour les architectures prédictives de type JEPA, qui prédisent dans un espace latent plutôt qu'en pixels. Les WAM concurrencent les VLA purs en injectant une anticipation du monde, mais leur latence freine leur déploiement. D'autres approches d'exécution asynchrone ou de chunking en temps réel traitent le même problème, sans forcément coupler prédiction du futur et débruitage échelonné. La suite dépendra de la publication du code, de validations indépendantes et de tests sur des plateformes industrielles, aucun pilote n'étant annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
D'une seule démonstration à une politique générale pour la manipulation avec contact
4arXiv cs.RO 

D'une seule démonstration à une politique générale pour la manipulation avec contact

Une équipe de recherche publie sur arXiv (réf. 2605.17601, mai 2026) un framework d'apprentissage par démonstration capable de généraliser à partir d'un seul exemple sur des tâches de manipulation impliquant des contacts répétés avec l'environnement. Le système repose sur un pipeline en quatre étapes : abstraction de la démonstration en primitives de contraintes environnementales, exploration autonome pour lever les ambiguïtés, correction ciblée par un opérateur humain pour couvrir les variantes hors-distribution, et enfin récupération en ligne des détails géométriques via interaction compliante. Validé sur sept tâches réelles multi-étapes à contact riche, le framework atteint un taux de succès supérieur à 90 %. Aucune entreprise spécifique ni plateforme robotique n'est mentionnée dans le préprint, qui reste une contribution académique sans déploiement industriel annoncé. Le point central de l'approche est de représenter une tâche non pas comme une trajectoire à imiter, mais comme une séquence de contraintes environnementales à exploiter. Ce changement de paradigme permet au robot de distinguer la structure générale d'une tâche (types de contraintes, transitions entre elles) des détails spécifiques à une instance donnée (poses exactes, géométrie locale). Pour un intégrateur ou un décideur industriel, cela signifie qu'une seule démonstration suffit potentiellement là où les méthodes de behavior cloning classiques en réclament des centaines. Le résultat de 90 %+ sur des tâches à contact riche est notable car ce domaine concentre la majorité des échecs en manipulation robotique réelle, notamment à cause de la sensibilité aux variations de pose et aux dynamiques de contact non modélisées. L'apprentissage par démonstration est un champ très actif depuis une décennie, concurrencé récemment par les politiques de diffusion (Diffusion Policy, Pi-0 de Physical Intelligence), les architectures VLA (RT-2, GR00T N2 de NVIDIA) et les méthodes ACT (Action Chunking with Transformers). L'originalité revendiquée ici est de traiter les contraintes environnementales comme biais inductif plutôt que d'augmenter massivement les données d'entraînement ou la puissance du modèle. La limite principale reste l'absence d'évaluation sur des plateformes humanoïdes ou collaboratives standard, ce qui rend difficile la comparaison directe avec les benchmarks du secteur. Les suites naturelles seraient un passage à des environnements ouverts et une validation sur des robots commerciaux comme le Franka Research 3 ou les bras UR.

RecherchePaper
1 source