Aller au contenu principal
Apprentissage de séquences d'actions continues haute fréquence dans l'espace latent
RecherchearXiv cs.RO 

Apprentissage de séquences d'actions continues haute fréquence dans l'espace latent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de TARS Robotics ont publié sur arXiv (2605.24931) une méthode de contrôle robotique haute fréquence baptisée RTR (Reuse-then-Refine), visant à résoudre un problème identifié dans les politiques d'action chunking actuelles. À 60 Hz, les systèmes qui exécutent des séquences pré-calculées de commandes motrices génèrent des mouvements saccadés et spatialement incohérents, ce que les politiques standard ne parviennent pas à corriger. L'approche RTR déplace l'apprentissage depuis l'espace d'action direct vers un espace latent encodé par un auto-encodeur variationnel (VAE), ce qui améliore significativement la consistance temporelle et spatiale. Elle intègre également une stratégie de raffinement par chunk permettant une transition fluide entre séquences adjacentes lors d'une inférence asynchrone. Les auteurs valident la méthode sur trois tâches réelles à contact riche, avec une exécution continue et moins de pauses involontaires. Le code et les données sont publiés en open source sur GitHub (tars-robotics/RTR).

Le passage de 10-30 Hz à 60 Hz représente une frontière critique pour la manipulation robotique : à basse fréquence, le robot doit compenser sa lenteur par des pauses de recalcul, limitant son utilité en production industrielle. Les politiques de type VLA (Vision-Language-Action) ou diffusion policy, actuellement dominantes en imitation learning, fonctionnent généralement en dessous de 30 Hz. En montrant qu'un encodage latent peut absorber la variance temporelle sans sacrifier la précision spatiale, RTR apporte une réponse concrète au problème de "jerkiness" qui freine le déploiement des robots manipulateurs en conditions réelles. Pour un intégrateur ou un décideur B2B, c'est une voie vers des systèmes capables d'assurer une cadence de travail continue sans interruption de flux de production.

L'action chunking a été popularisé par ACT (Action Chunking with Transformers, Zhao et al., 2023) et les travaux sur Diffusion Policy, tous deux conçus pour des fréquences modérées. TARS Robotics se positionne dans un espace concurrentiel qui inclut Physical Intelligence avec pi0-FAST (ciblant 50-200 Hz via flow-matching) et les efforts de Figure AI, Agility Robotics et Boston Dynamics sur le contrôle haute cadence. RTR se distingue de pi0-FAST en proposant un raffinement incrémental du chunk existant plutôt qu'une régénération complète, ce qui réduit la charge computationnelle par inférence. Il s'agit pour l'instant d'une contribution de recherche validée en laboratoire sur robot réel, sans timeline de déploiement industriel ni partenariat annoncé.

À lire aussi

Apprentissage de transitions de compétences hautement dynamiques pour le saut de quadrupèdes en espace contraint
1arXiv cs.RO 

Apprentissage de transitions de compétences hautement dynamiques pour le saut de quadrupèdes en espace contraint

Un pipeline d'apprentissage par renforcement hiérarchique, décrit dans un article publié sur arXiv (référence 2608.19977), permet à un robot quadrupède de franchir dynamiquement un espace contraint, en l'occurrence une porte étroite, en reproduisant les mouvements explosifs observés chez les animaux à quatre pattes. Le système combine deux niveaux : une politique bas niveau, entraînée par apprentissage par imitation à partir de comportements animaux réels, qui constitue un répertoire varié de compétences motrices, et un contrôleur haut niveau qui détecte l'ouverture par vision et sélectionne la manœuvre ainsi que la trajectoire sans collision adaptées pour la traverser en mouvement dynamique. Les auteurs indiquent avoir aussi vérifié que ce cadre se généralise à d'autres tâches hautement dynamiques au-delà du franchissement de porte. L'enjeu dépasse la simple démonstration acrobatique. Les quadrupèdes commerciaux savent aujourd'hui marcher, courir ou monter des escaliers, mais peinent encore à associer perception en temps réel et locomotion agile pour franchir des ouvertures étroites ou des obstacles dynamiques, une capacité pourtant utile pour des interventions en usines, sites sinistrés ou chantiers encombrés. En couplant une bibliothèque de compétences apprises par imitation à un planificateur piloté par la vision, les auteurs proposent une alternative à la trajectoire programmée à la main pour un obstacle unique, une piste vers une composition de compétences plus généralisable. Il s'agit néanmoins d'un travail de recherche fraîchement publié, sans partenaire industriel ni plateforme commerciale citée : la validation reste celle d'un prototype de laboratoire. Ce travail s'inscrit dans un courant de recherche actif sur l'agilité dynamique des robots à pattes, porté ces dernières années par des laboratoires comme l'ETH Zurich et le MIT ou par des fabricants comme Unitree et Boston Dynamics, déjà connus pour leurs démonstrations de sauts et de déplacements sur terrains accidentés. La spécificité revendiquée ici est de cibler le franchissement aérien et autonome d'une ouverture précise, présenté par les auteurs comme l'une des premières démonstrations de ce type sur un robot marchant au sol. L'article ne précise ni prochaine étape de validation ni calendrier vers une plateforme commerciale : il s'agit pour l'instant d'une preuve de concept destinée à la communauté de recherche en robotique.

RecherchePaper
1 source
Ce qui compte pour les actions latentes dans l'apprentissage robotique
2arXiv cs.RO 

Ce qui compte pour les actions latentes dans l'apprentissage robotique

Des chercheurs publient sur arXiv (2608.19613v1, article inédit non encore évalué par les pairs) la première étude empirique systématique consacrée aux Latent Action Models (LAM), une famille de modèles qui permet à l'apprentissage robotique d'exploiter de grands volumes de vidéos non étiquetées en les traduisant en actions latentes, des substituts compacts aux commandes physiques réelles. Les auteurs unifient les méthodes LAM existantes dans un cadre autoencodeur commun, puis testent systématiquement 41 choix de conception répartis en trois axes : les paradigmes de modélisation des actions latentes, les objectifs d'apprentissage et méthodes de régularisation associées, et les stratégies d'intégration de ces actions latentes dans les politiques de contrôle robotique. Ils évaluent également quatre métriques proxy censées juger la qualité des actions latentes, en vérifiant si elles prédisent effectivement la performance en manipulation. Les expériences couvrent trois benchmarks standards du domaine, avec une validation complémentaire sur des tâches de manipulation exécutées par un robot réel. Le résultat principal, le fine-tuning du backbone d'un modèle vision-langage (VLM) avec des actions latentes offre une meilleure initialisation pour l'apprentissage de politiques robotiques en aval qu'une simple utilisation figée du VLM, apporte une base empirique à un pan de recherche jusqu'ici dispersé. Pour les équipes qui développent des modèles VLA (vision-langage-action), ce travail répond à un problème concret : la rareté et le coût des données d'action étiquetées poussent le secteur à préentraîner sur des vidéos non annotées, mais chaque laboratoire testait ses propres choix d'architecture dans des conditions expérimentales différentes, rendant les comparaisons peu fiables. Cette étude fournit des repères de conception réels plutôt que des affirmations marketing sur le préentraînement vidéo. Le contexte est celui d'un champ de recherche fragmenté : les méthodes LAM se sont multipliées ces dernières années sans cadre d'évaluation commun, chaque publication isolant une variable différente. En proposant un cadre unifié et une comparaison à grande échelle de 41 configurations, les auteurs cherchent à combler ce vide méthodologique. Il s'agit d'un travail académique de type ablation étude, pas d'un produit ni d'un déploiement commercial : les suites attendues concernent l'adoption de ces recommandations de conception par les équipes développant des modèles VLA préentraînés sur vidéo à plus grande échelle.

RecherchePaper
1 source
SCAR : apprentissage auto-supervisé de représentations d'actions continues
3arXiv cs.RO 

SCAR : apprentissage auto-supervisé de représentations d'actions continues

Une équipe de chercheurs a publié début mai 2026 sur arXiv (référence 2605.16412) un framework baptisé SCAR, pour Self-Supervised Continuous Action Representation Learning, visant à apprendre des représentations d'actions unifiées et transférables entre différents robots à partir de simples transitions visuelles. L'architecture repose sur un backbone génératif préentraîné, couplé à deux modules complémentaires : un modèle de dynamique inverse (IDM) qui infère des actions latentes à partir de paires d'observations, et un modèle de dynamique directe (FDM) qui prédit les états futurs conditionnés sur ces actions latentes. Pour éviter que l'espace latent ne devienne un simple goulot d'étranglement visuel générique, les auteurs régularisent la distribution postérieure des actions vers un prior gaussien standard, et introduisent une contrainte d'invariance adversariale pour supprimer les facteurs propres à chaque morphologie de robot ou à chaque environnement. Les expériences sont conduites sur les benchmarks Procgen et Robotwin, et montrent que SCAR surpasse les actions brutes spécifiques à chaque embodiment comme interface de conditionnement pour les world models, notamment en régimes de faibles données. L'enjeu industriel est significatif : l'un des verrous les plus coûteux du déploiement robotique est précisément le besoin de recollecte massive de données à chaque changement de plateforme matérielle. Si une représentation d'action partagée peut effectivement abstraire le "changement contrôlable" indépendamment de l'actuation physique, les intégrateurs pourraient réutiliser des world models pré-entraînés sur un robot pour en adapter un autre avec beaucoup moins d'exemples. SCAR apporte un argument empirique au débat sur la transférabilité des VLA (Vision-Language-Action models) : là où des architectures comme pi-0 ou GR00T N2 s'appuient sur des actions en espace proprioceptif brut, l'approche latente supervisée de façon auto-cohérente pourrait constituer une interface de conditionnement plus robuste. Le contexte est celui d'une compétition intense autour des world models pour la robotique, portée côté industrie par des acteurs comme Physical Intelligence (pi-0), NVIDIA (GR00T), et Figure AI, et côté académique par des travaux sur les modèles d'espace d'état et les représentations de politique. SCAR se distingue en traitant l'action non comme un signal de contrôle auxiliaire mais comme un facteur représentationnel à part entière, ce qui est une position théorique distincte des approches VLA classiques. Les auteurs ne mentionnent pas de code public ni de partenariat industriel dans la prépublication, et les résultats restent à confirmer sur des benchmarks physiques réels, Procgen et Robotwin étant deux environnements de simulation. L'absence de métriques sur du matériel réel est à garder à l'esprit avant toute extrapolation vers des cas industriels.

UESi validé sur matériel physique, ce framework de représentation d'actions transférables pourrait réduire les coûts de ré-entraînement pour les intégrateurs robotiques européens lors du changement de plateforme matérielle.

RechercheOpinion
1 source
L'apprentissage conjoint de prédicats et d'actions permet la composition zéro-shot de compétences
4arXiv cs.RO 

L'apprentissage conjoint de prédicats et d'actions permet la composition zéro-shot de compétences

Des chercheurs ont publié le 21 mai 2026 sur arXiv un préprint intitulé "Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition", introduisant PACTS (Predicate Action Skills), une nouvelle classe de politiques visuomotrices en boucle fermée pour la robotique. Le problème posé est précis : les approches actuelles d'apprentissage par démonstration (LfD) permettent à un robot d'acquérir des compétences isolées, mais échouent à les recombiner de façon inédite sans réentraînement. PACTS y répond en modélisant chaque compétence comme un processus génératif joint sur deux flux simultanés : les trajectoires d'action et les trajectoires de croyance prédicative, c'est-à-dire des représentations symboliques de l'état du monde induites par chaque action. Un seul modèle produit ainsi des séquences action-résultat cohérentes, sans pipeline séparé. L'enjeu est structurel pour la robotique industrielle et de service : la capacité de composition zéro-shot signifie qu'un robot formé sur des briques de base peut enchaîner des tâches nouvelles sans nouvelle collecte de données ni réentraînement, ce qui est un verrou majeur dans le déploiement à grande échelle. Les politiques génératives modernes, notamment les VLA (Vision-Language-Action models) comme pi-0 de Physical Intelligence ou les modèles de diffusion appliqués aux trajectoires, ne modélisent que la distribution des actions, sans raisonnement explicite sur les états symboliques intermédiaires. PACTS utilise les prédictions de prédicats en ligne comme interface symbolique pour séquencer les compétences et surveiller leur exécution, s'approchant ainsi d'une forme de planification symbolique intégrée. Les auteurs montrent que la génération jointe améliore à la fois la qualité des actions produites et la classification des prédicats, deux métriques qui se renforçaient rarement dans les approches précédentes. Ce travail s'inscrit dans un débat actif entre approches purement neuronales (end-to-end) et approches hybrides neuro-symboliques pour la manipulation robotique. Les méthodes de Task and Motion Planning (TAMP) classiques atteignent une bonne compositionnalité mais nécessitent des modèles symboliques prédéfinis ; les politiques d'imitation modernes générealisent mal sans représentation intermédiaire explicite. PACTS tente de combler les deux, en apprenant les symboles depuis les données de démonstration plutôt qu'en les codant manuellement. Le code et les expériences sont annoncés sur le site du projet (planpacts.github.io), mais le préprint n'est pas encore évalué par des pairs, et aucun résultat de déploiement terrain ni partenaire industriel n'est mentionné à ce stade.

RechercheOpinion
1 source