SMILE : un mouvement fluide pour améliorer l'exécution VLA sur les tâches longues
Une équipe de recherche publie sur arXiv (papier 2608.29432v1, catégorie "new") un travail intitulé SMILE, pour Smooth Motion for Improved Long-Horizon VLA Execution. Les modèles vision-langage-action (VLA) réduisent le coût d'inférence en exécutant plusieurs actions par appel du modèle, mais les chunks d'actions bruts contiennent du jitter et des valeurs aberrantes qui dégradent la précision sur les horizons longs. SMILE propose une interface qui préserve l'architecture existante : elle fait prédire au modèle des coefficients de spline B-spline, ensuite décodés en séquences d'actions lissées, sans toucher au backbone ni à la taille du modèle. Les auteurs l'appliquent à quatre modèles de référence, SmolVLA, Evo1, VPP et DAWN, et les testent sur les bancs d'essai LIBERO et CALVIN ainsi qu'en conditions réelles sur un bras robotique xArm. Les chiffres rapportés : SMILE-Evo1 atteint 98,0% de réussite sur LIBERO avec une accélération d'inférence de 1,1x ; SMILE-VPP atteint une longueur moyenne de tâche de 4,42 sur CALVIN avec un gain de 1,5x ; à horizon d'exécution égal (10), SMILE-SmolVLA réduit l'accélération hors limites de 78,6% et le taux de changement de signe de la vitesse de 42,3%. Sur xArm, les tests réels montrent plus de succès, moins de chutes d'objets et moins de contacts non désirés.
L'intérêt pour l'industrie robotique tient au fait que SMILE ne propose pas un nouveau modèle fondation mais une simple représentation d'action alternative, réutilisable sur des politiques VLA existantes sans réentraînement complet ni changement d'échelle. Cela s'attaque directement à un compromis central pour le déploiement industriel des VLA : exécuter plusieurs actions par inférence fait gagner en vitesse mais coûte en précision, un problème critique pour tout intégrateur cherchant à faire tourner ces modèles en production plutôt qu'en démonstration contrôlée. Le gain simultané en efficacité et en fiabilité, avec moins de chutes et de contacts en conditions réelles, va dans le sens d'une meilleure exploitabilité concrète des politiques génératives à long horizon, un point encore fragile dans le secteur.
Il s'agit toutefois d'un article de recherche académique déposé sur arXiv, pas d'un produit commercialisé ni d'un déploiement industriel annoncé. Les modèles de comparaison utilisés (SmolVLA, Evo1, VPP, DAWN) sont des bases de recherche open, pas les grands modèles VLA propriétaires du secteur. Les auteurs mettent à disposition une page projet (jongwoopark7978.github.io/smilevla), signe d'une volonté de reproductibilité, mais aucun calendrier de pilote industriel ni de partenariat n'est mentionné à ce stade.
Dans nos dossiers




