Aller au contenu principal
Apprentissage de séquences d'actions continues haute fréquence dans l'espace latent
RecherchearXiv cs.RO 

Apprentissage de séquences d'actions continues haute fréquence dans l'espace latent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de TARS Robotics ont publié sur arXiv (2605.24931) une méthode de contrôle robotique haute fréquence baptisée RTR (Reuse-then-Refine), visant à résoudre un problème identifié dans les politiques d'action chunking actuelles. À 60 Hz, les systèmes qui exécutent des séquences pré-calculées de commandes motrices génèrent des mouvements saccadés et spatialement incohérents, ce que les politiques standard ne parviennent pas à corriger. L'approche RTR déplace l'apprentissage depuis l'espace d'action direct vers un espace latent encodé par un auto-encodeur variationnel (VAE), ce qui améliore significativement la consistance temporelle et spatiale. Elle intègre également une stratégie de raffinement par chunk permettant une transition fluide entre séquences adjacentes lors d'une inférence asynchrone. Les auteurs valident la méthode sur trois tâches réelles à contact riche, avec une exécution continue et moins de pauses involontaires. Le code et les données sont publiés en open source sur GitHub (tars-robotics/RTR).

Le passage de 10-30 Hz à 60 Hz représente une frontière critique pour la manipulation robotique : à basse fréquence, le robot doit compenser sa lenteur par des pauses de recalcul, limitant son utilité en production industrielle. Les politiques de type VLA (Vision-Language-Action) ou diffusion policy, actuellement dominantes en imitation learning, fonctionnent généralement en dessous de 30 Hz. En montrant qu'un encodage latent peut absorber la variance temporelle sans sacrifier la précision spatiale, RTR apporte une réponse concrète au problème de "jerkiness" qui freine le déploiement des robots manipulateurs en conditions réelles. Pour un intégrateur ou un décideur B2B, c'est une voie vers des systèmes capables d'assurer une cadence de travail continue sans interruption de flux de production.

L'action chunking a été popularisé par ACT (Action Chunking with Transformers, Zhao et al., 2023) et les travaux sur Diffusion Policy, tous deux conçus pour des fréquences modérées. TARS Robotics se positionne dans un espace concurrentiel qui inclut Physical Intelligence avec pi0-FAST (ciblant 50-200 Hz via flow-matching) et les efforts de Figure AI, Agility Robotics et Boston Dynamics sur le contrôle haute cadence. RTR se distingue de pi0-FAST en proposant un raffinement incrémental du chunk existant plutôt qu'une régénération complète, ce qui réduit la charge computationnelle par inférence. Il s'agit pour l'instant d'une contribution de recherche validée en laboratoire sur robot réel, sans timeline de déploiement industriel ni partenariat annoncé.

À lire aussi

Apprentissage de transitions de compétences hautement dynamiques pour le saut de quadrupèdes en espace contraint
1arXiv cs.RO 

Apprentissage de transitions de compétences hautement dynamiques pour le saut de quadrupèdes en espace contraint

Un pipeline d'apprentissage par renforcement hiérarchique, décrit dans un article publié sur arXiv (référence 2608.19977), permet à un robot quadrupède de franchir dynamiquement un espace contraint, en l'occurrence une porte étroite, en reproduisant les mouvements explosifs observés chez les animaux à quatre pattes. Le système combine deux niveaux : une politique bas niveau, entraînée par apprentissage par imitation à partir de comportements animaux réels, qui constitue un répertoire varié de compétences motrices, et un contrôleur haut niveau qui détecte l'ouverture par vision et sélectionne la manœuvre ainsi que la trajectoire sans collision adaptées pour la traverser en mouvement dynamique. Les auteurs indiquent avoir aussi vérifié que ce cadre se généralise à d'autres tâches hautement dynamiques au-delà du franchissement de porte. L'enjeu dépasse la simple démonstration acrobatique. Les quadrupèdes commerciaux savent aujourd'hui marcher, courir ou monter des escaliers, mais peinent encore à associer perception en temps réel et locomotion agile pour franchir des ouvertures étroites ou des obstacles dynamiques, une capacité pourtant utile pour des interventions en usines, sites sinistrés ou chantiers encombrés. En couplant une bibliothèque de compétences apprises par imitation à un planificateur piloté par la vision, les auteurs proposent une alternative à la trajectoire programmée à la main pour un obstacle unique, une piste vers une composition de compétences plus généralisable. Il s'agit néanmoins d'un travail de recherche fraîchement publié, sans partenaire industriel ni plateforme commerciale citée : la validation reste celle d'un prototype de laboratoire. Ce travail s'inscrit dans un courant de recherche actif sur l'agilité dynamique des robots à pattes, porté ces dernières années par des laboratoires comme l'ETH Zurich et le MIT ou par des fabricants comme Unitree et Boston Dynamics, déjà connus pour leurs démonstrations de sauts et de déplacements sur terrains accidentés. La spécificité revendiquée ici est de cibler le franchissement aérien et autonome d'une ouverture précise, présenté par les auteurs comme l'une des premières démonstrations de ce type sur un robot marchant au sol. L'article ne précise ni prochaine étape de validation ni calendrier vers une plateforme commerciale : il s'agit pour l'instant d'une preuve de concept destinée à la communauté de recherche en robotique.

RecherchePaper
1 source
Apprentissage de la perception tactile à partir d'une détection mono-point haute fréquence
2arXiv cs.RO 

Apprentissage de la perception tactile à partir d'une détection mono-point haute fréquence

Un nouveau preprint mis en ligne sur arXiv en septembre 2026 (identifiant 2609.24621) présente SpectRobot, un framework qui convertit des signaux tactiles issus d'un capteur unique en spectrogrammes temps-fréquence compacts, sous forme d'images de taille fixe exploitables par des encodeurs de vision standards. Contrairement aux approches dominantes qui misent sur des réseaux de capteurs tactiles répartis spatialement sur la surface de contact, SpectRobot exploite la richesse dynamique d'une mesure ponctuelle à haute bande passante, avec des fréquences d'échantillonnage allant jusqu'à 100 kHz. Dans l'implémentation testée, les capteurs sont montés à distance de la surface de contact tout en restant couplés mécaniquement à elle, ce qui limite leur exposition directe à l'usure. Les auteurs rapportent trois résultats : un robot parvient à résoudre une tâche de manipulation visuellement occultée en s'appuyant uniquement sur des signaux de vibration ponctuels ; la profondeur de l'historique temporel utilisé influence fortement la performance de la politique apprise, tandis que la bande passante du capteur détermine l'information spectrale disponible ; et la même représentation en spectrogramme fonctionne indifféremment avec des capteurs mesurant l'accélération, la force ou la déformation. L'équipe précise avoir reproduit ces résultats avec du matériel disponible dans le commerce, sans instrumentation de laboratoire spécialisée. Ce travail répond à une limite concrète du secteur : les réseaux de capteurs tactiles denses restent coûteux, fragiles et difficiles à industrialiser sur des mains ou pinces robotiques destinées à un usage prolongé. En montrant qu'un unique point de mesure à haute fréquence, converti en image spectrale exploitable par les architectures de vision déjà utilisées dans les pipelines d'apprentissage de type VLA (vision-language-action), peut remplacer ou compléter la densité spatiale, SpectRobot ouvre une voie potentiellement moins chère et plus robuste pour intégrer le retour de contact dans des systèmes de manipulation appris de bout en bout. Pour les intégrateurs et les équipes R&D en robotique dextre, l'intérêt est double : le capteur, éloigné de la zone de friction, dure plus longtemps en environnement industriel exigeant, et la représentation en spectrogramme s'insère directement dans des pipelines de perception déjà construits pour la vision. Le résultat le plus significatif reste la démonstration qu'une tâche masquée visuellement peut être résolue par le seul canal tactile haute fréquence, ce qui appuie l'idée que la fusion de capteurs, plutôt que la seule vision, sera nécessaire pour la manipulation fine en conditions réelles. La démarche s'inscrit dans une tendance plus large de l'apprentissage robotique, où le tactile est de plus en plus intégré aux pipelines de manipulation, mais où la plupart des capteurs employés jusqu'ici privilégient la densité spatiale au détriment de la bande passante temporelle. SpectRobot prend le contrepied de cette course à la résolution spatiale, une direction que les auteurs présentent comme complémentaire, et non substitutive, aux approches à haute densité de capteurs. Le document reste à ce stade un preprint arXiv fraîchement publié, sans validation industrielle ni partenariat annoncé avec un fabricant de robots ou de mains manipulatrices, et sans calendrier de transfert vers un produit commercial. La suite évoquée par les auteurs consiste à étendre l'approche à davantage de tâches de manipulation dextre et à d'autres modalités de capteurs mediées par l'accélération, la force ou la déformation, afin de rendre le tactile haute fréquence accessible sans recourir à une instrumentation de recherche coûteuse.

RecherchePaper
1 source
Ce qui compte pour les actions latentes dans l'apprentissage robotique
3arXiv cs.RO 

Ce qui compte pour les actions latentes dans l'apprentissage robotique

Des chercheurs publient sur arXiv (2608.19613v1, article inédit non encore évalué par les pairs) la première étude empirique systématique consacrée aux Latent Action Models (LAM), une famille de modèles qui permet à l'apprentissage robotique d'exploiter de grands volumes de vidéos non étiquetées en les traduisant en actions latentes, des substituts compacts aux commandes physiques réelles. Les auteurs unifient les méthodes LAM existantes dans un cadre autoencodeur commun, puis testent systématiquement 41 choix de conception répartis en trois axes : les paradigmes de modélisation des actions latentes, les objectifs d'apprentissage et méthodes de régularisation associées, et les stratégies d'intégration de ces actions latentes dans les politiques de contrôle robotique. Ils évaluent également quatre métriques proxy censées juger la qualité des actions latentes, en vérifiant si elles prédisent effectivement la performance en manipulation. Les expériences couvrent trois benchmarks standards du domaine, avec une validation complémentaire sur des tâches de manipulation exécutées par un robot réel. Le résultat principal, le fine-tuning du backbone d'un modèle vision-langage (VLM) avec des actions latentes offre une meilleure initialisation pour l'apprentissage de politiques robotiques en aval qu'une simple utilisation figée du VLM, apporte une base empirique à un pan de recherche jusqu'ici dispersé. Pour les équipes qui développent des modèles VLA (vision-langage-action), ce travail répond à un problème concret : la rareté et le coût des données d'action étiquetées poussent le secteur à préentraîner sur des vidéos non annotées, mais chaque laboratoire testait ses propres choix d'architecture dans des conditions expérimentales différentes, rendant les comparaisons peu fiables. Cette étude fournit des repères de conception réels plutôt que des affirmations marketing sur le préentraînement vidéo. Le contexte est celui d'un champ de recherche fragmenté : les méthodes LAM se sont multipliées ces dernières années sans cadre d'évaluation commun, chaque publication isolant une variable différente. En proposant un cadre unifié et une comparaison à grande échelle de 41 configurations, les auteurs cherchent à combler ce vide méthodologique. Il s'agit d'un travail académique de type ablation étude, pas d'un produit ni d'un déploiement commercial : les suites attendues concernent l'adoption de ces recommandations de conception par les équipes développant des modèles VLA préentraînés sur vidéo à plus grande échelle.

RecherchePaper
1 source
SCAR : apprentissage auto-supervisé de représentations d'actions continues
4arXiv cs.RO 

SCAR : apprentissage auto-supervisé de représentations d'actions continues

Une équipe de chercheurs a publié début mai 2026 sur arXiv (référence 2605.16412) un framework baptisé SCAR, pour Self-Supervised Continuous Action Representation Learning, visant à apprendre des représentations d'actions unifiées et transférables entre différents robots à partir de simples transitions visuelles. L'architecture repose sur un backbone génératif préentraîné, couplé à deux modules complémentaires : un modèle de dynamique inverse (IDM) qui infère des actions latentes à partir de paires d'observations, et un modèle de dynamique directe (FDM) qui prédit les états futurs conditionnés sur ces actions latentes. Pour éviter que l'espace latent ne devienne un simple goulot d'étranglement visuel générique, les auteurs régularisent la distribution postérieure des actions vers un prior gaussien standard, et introduisent une contrainte d'invariance adversariale pour supprimer les facteurs propres à chaque morphologie de robot ou à chaque environnement. Les expériences sont conduites sur les benchmarks Procgen et Robotwin, et montrent que SCAR surpasse les actions brutes spécifiques à chaque embodiment comme interface de conditionnement pour les world models, notamment en régimes de faibles données. L'enjeu industriel est significatif : l'un des verrous les plus coûteux du déploiement robotique est précisément le besoin de recollecte massive de données à chaque changement de plateforme matérielle. Si une représentation d'action partagée peut effectivement abstraire le "changement contrôlable" indépendamment de l'actuation physique, les intégrateurs pourraient réutiliser des world models pré-entraînés sur un robot pour en adapter un autre avec beaucoup moins d'exemples. SCAR apporte un argument empirique au débat sur la transférabilité des VLA (Vision-Language-Action models) : là où des architectures comme pi-0 ou GR00T N2 s'appuient sur des actions en espace proprioceptif brut, l'approche latente supervisée de façon auto-cohérente pourrait constituer une interface de conditionnement plus robuste. Le contexte est celui d'une compétition intense autour des world models pour la robotique, portée côté industrie par des acteurs comme Physical Intelligence (pi-0), NVIDIA (GR00T), et Figure AI, et côté académique par des travaux sur les modèles d'espace d'état et les représentations de politique. SCAR se distingue en traitant l'action non comme un signal de contrôle auxiliaire mais comme un facteur représentationnel à part entière, ce qui est une position théorique distincte des approches VLA classiques. Les auteurs ne mentionnent pas de code public ni de partenariat industriel dans la prépublication, et les résultats restent à confirmer sur des benchmarks physiques réels, Procgen et Robotwin étant deux environnements de simulation. L'absence de métriques sur du matériel réel est à garder à l'esprit avant toute extrapolation vers des cas industriels.

UESi validé sur matériel physique, ce framework de représentation d'actions transférables pourrait réduire les coûts de ré-entraînement pour les intégrateurs robotiques européens lors du changement de plateforme matérielle.

RechercheOpinion
1 source