ChunkTrust : adapter les horizons d'exécution des politiques robotiques grâce aux indices de l'expert en actions
Les politiques robotiques de type « foundation model » prédisent des séquences d'actions (action chunks), mais le nombre d'actions à exécuter avant de replanifier reste généralement un hyperparamètre fixe. Une équipe académique, dont le projet est hébergé sur Hugging Face, publie sur arXiv ChunkTrust, un cadre qui traite cet horizon d'exécution comme une variable latente, inférée à partir des signaux internes de l'action expert. Son composant central, l'Action-aware Horizon Selector (AHS), ne demande aucun entraînement. Il combine la stabilité spectrale intra-chunk des traces de génération avec la continuité inter-chunk entre l'historique exécuté et les actions prédites. Un posterior Beta en ligne, avec oubli par noyau, suit les préférences d'horizon d'une replanification à l'autre. Un module optionnel léger, le Query-based Horizon Adapter (QHA), apprend un a priori dense conditionné par le contexte, tandis que la politique de base reste gelée. Sur RoboTwin2.0 (50 tâches), l'AHS gagne 6,80 points de succès sur π0.5. Sur RoboCasa GR1 Tabletop, il gagne 9,67 points sur Qwen3GR00T. Avec QHA, le gain monte à 9,44 points sur un sous-ensemble de huit tâches avec π0.5. Sur quatre tâches domestiques réelles, le score de processus normalisé moyen passe de 50,4 % à 57,5 %.
L'intérêt pratique tient à ce que le réglage de l'horizon d'exécution est souvent traité comme un détail de déploiement, alors qu'il pèse directement sur la réussite. Un horizon long donne des mouvements fluides, mais il réagit mal aux perturbations. Un horizon court est plus réactif, mais plus saccadé et plus coûteux en calcul. Obtenir un gain sans réentraîner ni modifier le modèle de base est précieux pour les intégrateurs, qui peuvent amender des politiques existantes sans repasser par la collecte de données. Le gain mesuré en conditions réelles est plus modeste que celui des simulateurs, avec +7,1 points sur un score de processus. Cet écart rappelle que les benchmarks simulés surestiment souvent les progrès transférables. Seules quatre tâches réelles sont évaluées, et l'article ne détaille ni la taille des essais ni la variance. Ces résultats restent donc des indications, pas une validation à l'échelle.
Ce travail s'inscrit dans la lignée des méthodes de découpage d'actions (action chunking) et de commande à horizon glissant, popularisées par ACT et les politiques de diffusion, puis reprises par les modèles VLA comme π0.5 de Physical Intelligence et la famille GR00T de NVIDIA. Il rejoint d'autres travaux sur l'exécution asynchrone et le lissage des transitions entre chunks, qui visent à réduire les à-coups lors de la replanification. Aucun déploiement industriel ni calendrier de pilote n'est annoncé, il s'agit d'une prépublication v1 non évaluée par les pairs. La suite logique consisterait à valider l'approche sur davantage de plateformes, de tâches longues et de politiques à architectures variées, ainsi qu'à mesurer le surcoût de latence de l'AHS et du QHA en boucle fermée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



