CLIFT : transformer Gemini Robotics On-Device en spécialistes humanoïdes via un réglage fin itératif en boucle fermée non invasif
Des chercheurs viennent de publier une étude (arXiv:2607.29172v1) testant les limites de Gemini Robotics On-Device (GROD), le modèle fondation robotique de Google DeepMind, dans son mode d'accès le plus restreint : l'API de fine-tuning supervisé managé, où l'utilisateur envoie des données d'entraînement et récupère une politique ajustée sans jamais toucher aux poids, aux gradients ni aux mécanismes internes du modèle. Sur un humanoïde réel confronté à des tâches de manipulation agiles et riches en contacts, les auteurs montrent qu'un simple fine-tuning supervisé via cette API surpasse nettement un VLA open-weight de référence entraîné sur les mêmes démonstrations, mais reste en deçà du niveau de fiabilité attendu en déploiement. Pour combler cet écart, l'équipe introduit CLIFT (Closed-Loop Iterative Fine-Tuning), une méthode qui transforme les signaux de récompense observés au moment du déploiement en données d'entraînement compatibles avec l'API, permettant une amélioration en boucle fermée sans accès aux poids, gradients, vraisemblances ni fonctions de perte. Résultat annoncé : un taux de succès quasi parfait après seulement deux cycles de ce "flywheel".
L'enjeu dépasse le cas GROD. Les fournisseurs de modèles fondation robotiques les plus performants suivent le même chemin que les grands labos de LLM : garder les poids fermés et ne proposer qu'une API de fine-tuning. Cela prive les intégrateurs et équipes robotique de l'apprentissage par renforcement classique, pourtant jugé nécessaire pour les tâches de contact fin où l'écart entre sortie de politique et comportement réel reste large. CLIFT propose une voie pour retrouver une partie de ce bénéfice sans que le fournisseur du modèle n'ouvre sa boîte noire, ce qui intéresse directement les acteurs qui devront un jour adapter des modèles propriétaires à leurs propres robots et environnements de production.
Le travail s'inscrit dans la lignée de Gemini Robotics, la famille de modèles annoncée par Google DeepMind en 2025, et fait écho aux pratiques déjà en place chez OpenAI ou Anthropic pour le fine-tuning managé des LLM. Il se positionne en creux face aux modèles ouverts comme Pi-0 ou GR00T, qui autorisent un réglage plus profond mais restent en retrait de GROD en performance brute selon cette étude, ouvrant la question de la généralisation de CLIFT à d'autres embodiments et tâches.
Dans nos dossiers




