Aller au contenu principal
RecherchearXiv cs.RO 

ChunkTrust : adapter les horizons d'exécution des politiques robotiques grâce aux indices de l'expert en actions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les politiques robotiques de type « foundation model » prédisent des séquences d'actions (action chunks), mais le nombre d'actions à exécuter avant de replanifier reste généralement un hyperparamètre fixe. Une équipe académique, dont le projet est hébergé sur Hugging Face, publie sur arXiv ChunkTrust, un cadre qui traite cet horizon d'exécution comme une variable latente, inférée à partir des signaux internes de l'action expert. Son composant central, l'Action-aware Horizon Selector (AHS), ne demande aucun entraînement. Il combine la stabilité spectrale intra-chunk des traces de génération avec la continuité inter-chunk entre l'historique exécuté et les actions prédites. Un posterior Beta en ligne, avec oubli par noyau, suit les préférences d'horizon d'une replanification à l'autre. Un module optionnel léger, le Query-based Horizon Adapter (QHA), apprend un a priori dense conditionné par le contexte, tandis que la politique de base reste gelée. Sur RoboTwin2.0 (50 tâches), l'AHS gagne 6,80 points de succès sur π0.5. Sur RoboCasa GR1 Tabletop, il gagne 9,67 points sur Qwen3GR00T. Avec QHA, le gain monte à 9,44 points sur un sous-ensemble de huit tâches avec π0.5. Sur quatre tâches domestiques réelles, le score de processus normalisé moyen passe de 50,4 % à 57,5 %.

L'intérêt pratique tient à ce que le réglage de l'horizon d'exécution est souvent traité comme un détail de déploiement, alors qu'il pèse directement sur la réussite. Un horizon long donne des mouvements fluides, mais il réagit mal aux perturbations. Un horizon court est plus réactif, mais plus saccadé et plus coûteux en calcul. Obtenir un gain sans réentraîner ni modifier le modèle de base est précieux pour les intégrateurs, qui peuvent amender des politiques existantes sans repasser par la collecte de données. Le gain mesuré en conditions réelles est plus modeste que celui des simulateurs, avec +7,1 points sur un score de processus. Cet écart rappelle que les benchmarks simulés surestiment souvent les progrès transférables. Seules quatre tâches réelles sont évaluées, et l'article ne détaille ni la taille des essais ni la variance. Ces résultats restent donc des indications, pas une validation à l'échelle.

Ce travail s'inscrit dans la lignée des méthodes de découpage d'actions (action chunking) et de commande à horizon glissant, popularisées par ACT et les politiques de diffusion, puis reprises par les modèles VLA comme π0.5 de Physical Intelligence et la famille GR00T de NVIDIA. Il rejoint d'autres travaux sur l'exécution asynchrone et le lissage des transitions entre chunks, qui visent à réduire les à-coups lors de la replanification. Aucun déploiement industriel ni calendrier de pilote n'est annoncé, il s'agit d'une prépublication v1 non évaluée par les pairs. La suite logique consisterait à valider l'approche sur davantage de plateformes, de tâches longues et de politiques à architectures variées, ainsi qu'à mesurer le surcoût de latence de l'AHS et du QHA en boucle fermée.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Prédiction d'horizon d'exécution dynamique pour les politiques robotiques par segments
1arXiv cs.RO 

Prédiction d'horizon d'exécution dynamique pour les politiques robotiques par segments

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.11408) une méthode baptisée DEHP, Dynamic Execution Horizon Prediction, conçue pour résoudre un goulot d'étranglement structurel des politiques robotiques modernes : l'horizon d'exécution fixe. Dans les architectures à "action chunking" aujourd'hui omniprésentes, politiques de diffusion, politiques de flux, modèles vision-langage-action (VLA) comme pi-0 ou OpenVLA, le robot prédit un bloc de N actions et les exécute en boucle ouverte, sans percevoir l'environnement à chaque pas. Cet horizon N est actuellement choisi par tuning empirique, tâche par tâche. DEHP entraîne une branche légère de prédiction d'horizon via du reinforcement learning en ligne, tout en gardant la politique chunk sous-jacente entièrement gelée, ce qui la rend compatible avec n'importe quelle politique existante traitée comme boîte noire. Sur des tâches de manipulation haute précision et longue durée, les auteurs rapportent une amélioration "significative" du taux de succès, sans chiffres absolus précis dans l'abstract, un point à vérifier dans les résultats complets. L'enjeu est concret pour quiconque déploie des bras manipulateurs en production : la boucle ouverte est efficace sur les mouvements de transit (déplacements dans l'espace libre), mais devient un frein sur les phases fines, insertion, saisie d'objet délicat, assemblage à tolérance serrée. DEHP adapte dynamiquement l'horizon : court pendant les phases critiques (comportement proche d'un contrôle pas-à-pas), long pendant les phases de déplacement libre. Cela revient à réconcilier l'efficacité computationnelle du chunking avec la réactivité du contrôle fermé, sans réentraîner le modèle de base. Pour les intégrateurs industriels, cela signifie potentiellement récupérer de la robustesse sur des cellules existantes sans toucher au pipeline d'entraînement. L'action chunking a été popularisée par ACT (Action Chunked Transformer, Stanford 2023), puis repris dans les diffusion policies de Chi et al. et intégré dans des VLA comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). La tension entre horizon long (efficacité) et horizon court (réactivité) est un problème ouvert bien identifié dans la communauté. Plusieurs travaux concurrents explorent le receding horizon ou le replanning conditionnel, mais DEHP se distingue par sa compatibilité boîte noire et son entraînement RL en ligne. La page projet est accessible sur dehp-chunking.github.io ; aucune timeline de déploiement industriel n'est annoncée à ce stade.

RecherchePaper
1 source
2arXiv cs.RO 

SplineWAM : des horizons d'action adaptatifs pour les modèles du monde et d'action grâce aux B-splines

Des chercheurs publient SplineWAM (arXiv 2609.39873), une méthode qui change la façon dont les « world action models » (WAM) découpent leurs actions dans le temps. Un WAM est une grande politique robotique qui prédit conjointement la vidéo future et les actions à exécuter, et renvoie à chaque appel d'inférence un segment d'actions de longueur fixe (action chunk). SplineWAM compresse au contraire la trajectoire dans une fenêtre de taille fixe de paramètres de B-splines cubiques, dont les instants de nœuds s'ajustent aux caractéristiques du mouvement. Un même budget de paramètres peut ainsi se décoder en segments de résolution et de durée variables, et la durée exécutée comme l'intervalle avant le prochain appel découlent de la prédiction elle-même. La supervision vidéo est alignée sur les nœuds ajustés de la démonstration plutôt que sur une grille uniforme, ce qui concentre les images supervisées là où la trajectoire est complexe. Pour l'exécution asynchrone, les auteurs introduisent JP-RTC (Jacobian-Pullback Real-Time Chunking), qui impose la continuité sur les actions brutes exécutées par le robot, et non sur les paramètres de la spline. Les paramètres sont corrigés via le décodeur pour que le début du segment coïncide avec les actions déjà engagées. Sur LIBERO-Plus et RoboCasa, le taux de réussite gagne 8,2 et 4,4 points face à un WAM à action chunking classique, avec 22 % et 26 % d'appels de politique en moins par épisode. Sur trois tâches bimanuelles réelles en mode asynchrone, SplineWAM fait mieux ou égale la référence tout en décodant 1,2 à 1,6 fois plus de mouvement exécuté par appel. L'enjeu est surtout économique et opérationnel. Un WAM uniforme dépense autant de calcul sur un déplacement en espace libre que sur une insertion riche en contacts, ce qui plafonne le débit lorsque la politique tourne dans le cloud, où chaque appel coûte de la latence et du GPU. Moins d'appels pour un succès égal ou supérieur laisse envisager de servir davantage de robots par accélérateur, ou de tolérer des liaisons plus lentes. Le résultat nuance aussi l'idée qu'un horizon d'action fixe est un détail d'implémentation neutre : le choisir de façon adaptative semble améliorer à la fois la qualité et l'efficacité. Des réserves s'imposent toutefois. Les gains en simulation sont modestes, et les résultats réels, limités à trois tâches, indiquent « mène ou égale » la référence, ce qui n'est pas une victoire nette. Le papier ne donne pas, dans son résumé, de mesure de latence de bout en bout ni de coût par tâche. Le contexte est celui de la montée des WAM, qui prolongent les VLA (vision-langage-action) en ajoutant la prédiction vidéo pour mieux ancrer la physique des tâches. Le problème de la continuité entre segments successifs a été traité jusqu'ici par le real-time chunking, que JP-RTC reprend en l'adaptant à une représentation paramétrique. Les B-splines, courantes en planification de trajectoire, entrent ainsi dans la conception des politiques apprises. Les benchmarks utilisés, LIBERO-Plus et RoboCasa, sont des environnements de simulation de référence, mais leur transfert à des cellules industrielles reste à démontrer. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé : il s'agit d'une préversion de recherche, dont la validité dépendra d'une réplication sur d'autres plateformes et d'une mesure du gain réel en coût de service cloud.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Attention spatiale : adapter les horizons d'exécution des politiques de diffusion via la sensibilité à l'observation
3arXiv cs.RO 

Attention spatiale : adapter les horizons d'exécution des politiques de diffusion via la sensibilité à l'observation

Les chercheurs à l'origine de ce papier arXiv (2607.04739v1) s'attaquent à un problème central des politiques robotiques par imitation basées sur des modèles génératifs : l'échantillonnage de blocs d'actions ("action chunks") via diffusion. Ces méthodes, aujourd'hui largement utilisées pour l'apprentissage par démonstration, exécutent généralement chaque bloc d'actions pendant un horizon fixe, ce qui oblige à choisir entre réactivité et coût de calcul. Les auteurs proposent une métrique baptisée "Spatial Attention", définie comme la norme carrée attendue du gradient de la log-vraisemblance de l'action par rapport à l'observation. Elle mesure la sensibilité de la distribution d'actions de la politique aux variations de l'observation. Leur résultat théorique montre que, à budget d'échantillonnage fixe, l'horizon d'exécution qui minimise la perte de vraisemblance cumulée causée par des perturbations diminue quand la Spatial Attention augmente. En prévoyant les valeurs futures de cette métrique en parallèle du bloc d'actions, le système ajuste dynamiquement l'horizon : plus court dans les phases sensibles, plus long dans les phases stables. Des tests en simulation et sur robot réel, sur tâches standards et perturbées, montrent une amélioration significative des taux de succès par rapport aux méthodes à horizon fixe, à horizon moyen d'exécution comparable. Pour l'industrie robotique, ce travail cible un compromis très concret rencontré par les architectures VLA et de type Diffusion Policy (ACT, Pi-0, RT-2 et consorts) : plus un bloc d'actions est long, moins le système coûte cher en inférence, mais plus il devient vulnérable aux imprévus entre deux replanifications. Une adaptation automatique de cet horizon, sans capteur supplémentaire ni coût de calcul additionnel notable, pourrait rendre les politiques de diffusion plus robustes en environnement réel, un enjeu clé pour tout déploiement en usine ou en logistique où les perturbations sont fréquentes. Ce papier s'inscrit dans la lignée des travaux sur les Diffusion Policies et l'apprentissage par imitation à base de modèles génératifs, un courant de recherche en forte expansion depuis l'introduction de l'action chunking comme alternative aux politiques réactives image-par-image. L'abstract ne précise ni l'institution ni la plateforme robotique utilisée pour les essais réels, et reste pour l'instant au stade de contribution méthodologique validée expérimentalement, sans annonce de déploiement industriel.

RecherchePaper
1 source
Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon
4arXiv cs.RO 

Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon

Des chercheurs proposent ActMem-VLA, une architecture qui ajoute une mémoire de l'historique des actions à un modèle vision-langage-action (VLA) déjà entraîné, sans le ré-entraîner. Le système greffe sur une politique de base figée (fine-tunée puis gelée) un plugin composé d'un module mémoire basé sur Mamba, un modèle à espace d'états, et d'un expert léger baptisé PreAction Expert (PAE). Mamba encode les actions déjà exécutées, et cette mémoire conditionne le PAE avec le contexte courant. Pendant les premières étapes de débruitage, à fort bruit, le PAE oriente la progression de la tâche. Il transmet ensuite l'action partiellement débruitée à l'Action Expert (AE) figé, qui affine les détails sur les étapes restantes à faible bruit. Seuls Mamba et le PAE sont optimisés. Sur le benchmark LIBERO-Mem, ActMem-VLA atteint 80,8 % de réussite moyenne sur les dix tâches, contre 65,2 % pour π0.5 et 49,5 % pour MemoryVLA, pour seulement 3,45 % de paramètres supplémentaires. Sur quatre tâches réelles, le gain moyen sur π0.5 est de 28,8 %. L'article ne précise pas s'il s'agit de points de pourcentage ou d'un gain relatif. L'enjeu est le « perceptual aliasing » : à deux étapes différentes d'une tâche longue, l'observation et l'état du robot peuvent être quasi identiques, alors que l'action correcte diffère. Sans accès à l'historique, la politique hésite ou répète une étape déjà faite. Le résultat compte pour les intégrateurs, car la mémoire est ici un module ajouté à un VLA existant, sans repartir d'un entraînement complet. Un modèle de base validé en production pourrait ainsi gagner en fiabilité sur les séquences longues (assemblage multi-étapes, kitting, tri) pour un surcoût de calcul modeste. Le score de 80,8 % montre aussi qu'il reste près d'une tentative sur cinq en échec. LIBERO-Mem est de plus un benchmark de simulation conçu pour tester la mémoire, et l'évaluation réelle ne porte que sur quatre tâches, sans détail public dans le résumé sur le nombre d'essais. Le travail s'inscrit dans une série de méthodes qui injectent des indices temporels ou de progression dans les VLA, par conditionnement de features, modification de l'a priori d'action ou guidage de l'échantillonnage. MemoryVLA, comparé ici, fait partie de cette famille. Le coût de ces approches, qui entraînent conjointement la mémoire et le VLA de base, motive la séparation choisie par les auteurs entre pilotage conditionné par l'historique et raffinement par la politique figée. Le point de comparaison principal reste π0.5 de Physical Intelligence. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Aucun déploiement industriel ni code n'est mentionné dans le résumé, et les prochaines étapes probables sont une validation sur d'autres bases VLA et sur des tâches réelles plus longues.

RecherchePaper
1 source