Aller au contenu principal
RecherchearXiv cs.RO 

CLIFT : transformer Gemini Robotics On-Device en spécialistes humanoïdes via un réglage fin itératif en boucle fermée non invasif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs viennent de publier une étude (arXiv:2607.29172v1) testant les limites de Gemini Robotics On-Device (GROD), le modèle fondation robotique de Google DeepMind, dans son mode d'accès le plus restreint : l'API de fine-tuning supervisé managé, où l'utilisateur envoie des données d'entraînement et récupère une politique ajustée sans jamais toucher aux poids, aux gradients ni aux mécanismes internes du modèle. Sur un humanoïde réel confronté à des tâches de manipulation agiles et riches en contacts, les auteurs montrent qu'un simple fine-tuning supervisé via cette API surpasse nettement un VLA open-weight de référence entraîné sur les mêmes démonstrations, mais reste en deçà du niveau de fiabilité attendu en déploiement. Pour combler cet écart, l'équipe introduit CLIFT (Closed-Loop Iterative Fine-Tuning), une méthode qui transforme les signaux de récompense observés au moment du déploiement en données d'entraînement compatibles avec l'API, permettant une amélioration en boucle fermée sans accès aux poids, gradients, vraisemblances ni fonctions de perte. Résultat annoncé : un taux de succès quasi parfait après seulement deux cycles de ce "flywheel".

L'enjeu dépasse le cas GROD. Les fournisseurs de modèles fondation robotiques les plus performants suivent le même chemin que les grands labos de LLM : garder les poids fermés et ne proposer qu'une API de fine-tuning. Cela prive les intégrateurs et équipes robotique de l'apprentissage par renforcement classique, pourtant jugé nécessaire pour les tâches de contact fin où l'écart entre sortie de politique et comportement réel reste large. CLIFT propose une voie pour retrouver une partie de ce bénéfice sans que le fournisseur du modèle n'ouvre sa boîte noire, ce qui intéresse directement les acteurs qui devront un jour adapter des modèles propriétaires à leurs propres robots et environnements de production.

Le travail s'inscrit dans la lignée de Gemini Robotics, la famille de modèles annoncée par Google DeepMind en 2025, et fait écho aux pratiques déjà en place chez OpenAI ou Anthropic pour le fine-tuning managé des LLM. Il se positionne en creux face aux modèles ouverts comme Pi-0 ou GR00T, qui autorisent un réglage plus profond mais restent en retrait de GROD en performance brute selon cette étude, ouvrant la question de la généralisation de CLIFT à d'autres embodiments et tâches.

À lire aussi

Transformer des modèles vidéo en politiques robotiques généralistes
1arXiv cs.RO 

Transformer des modèles vidéo en politiques robotiques généralistes

Des chercheurs du MIT CSAIL ont publié fin mai 2026 un preprint (arXiv:2605.27817) présentant VERA, pour Video-to-Embodied Robot Action Model, une architecture qui transforme des modèles vidéo génératifs en politiques robotiques généralisables. L'idée centrale est de découpler deux composants qui, dans les approches récentes, sont souvent entraînés conjointement : un planificateur vidéo, qui prédit des séquences d'images représentant la complétion d'une tâche, et un modèle de dynamique inverse (IDM, Inverse Dynamics Model) spécifique à l'effecteur, qui traduit ces images en commandes motrices concrètes. L'IDM est conçu à partir du Jacobien cinématique du robot, ce qui le rend à la fois efficient en données et extensible aux espaces d'action de haute dimension. L'équipe démontre VERA sur deux configurations : manipulation zero-shot d'un bras Panda 7-DOF et réorientation de cube en dextérité avec une main Allegro à 16 degrés de liberté, sur des benchmarks simulés et réels. Ce découplage constitue une alternative architecturale directe aux fondations robotiques qui co-entraînent prédiction d'observations et prédiction d'actions sur des données étiquetées (action-labeled), comme le proposent Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. L'avantage opérationnel est concret : le planificateur vidéo reste agnostique à l'effecteur et peut être partagé entre plusieurs robots en changeant uniquement l'IDM associé, sans réentraîner le backbone vidéo. L'IDM peut lui-même être entraîné sur des données de self-play facilement disponibles, ce qui réduit la dépendance aux démonstrations humaines coûteuses. Les résultats zero-shot sur des tâches de manipulation réelle renforcent la thèse que le gap sim-to-real peut être atténué par une modélisation géométrique rigoureuse de l'effecteur. La course aux VLA (Vision-Language-Action models) et aux politiques cross-embodiment est aujourd'hui dominée par des laboratoires bien capitalisés : Physical Intelligence avec Pi-0 et Pi-0.5, NVIDIA avec GR00T N2, Figure AI avec Helix, et 1X Technologies. VERA positionne le MIT CSAIL dans ce paysage avec une approche plus modulaire que les architectures monolithiques en vogue. Il s'agit pour l'instant d'un preprint de recherche, sans déploiement industriel annoncé ni partenariat hardware mentionné. Les résultats sont disponibles sur vera.csail.mit.edu, et la prochaine étape naturelle serait une évaluation sur des effecteurs plus variés ou des environnements non structurés pour valider la généralisation à plus grande échelle.

RechercheOpinion
1 source
GE-Sim 2.0 : une feuille de route vers des simulateurs vidéo en boucle fermée pour la manipulation robotique
2arXiv cs.RO 

GE-Sim 2.0 : une feuille de route vers des simulateurs vidéo en boucle fermée pour la manipulation robotique

Une équipe de recherche a publié sur arXiv (arXiv:2605.27491) GE-Sim 2.0, un simulateur vidéo en boucle fermée conçu pour l'entraînement et l'évaluation de politiques de manipulation robotique. Le système, Genie Envisioner World Simulator 2.0, prolonge l'architecture de génération vidéo conditionnée par l'action de son prédécesseur et a été ré-entraîné sur des milliers d'heures de données robotiques réelles couvrant la télé-opération, les interactions contact-rich et le déploiement de politiques embarquées. Trois nouveaux modules ferment la boucle simulation-apprentissage : un "state expert" qui décode l'état proprioceptif depuis les latents vidéo pour alimenter les politiques VLA (Vision-Language-Action) en prédiction de trajectoire ; un "world judge" qui évalue automatiquement les rollouts générés face aux instructions de tâche, produisant des signaux de réussite vérifiables sans inspection manuelle ; et un framework d'accélération capable de générer un rollout de 25 frames en 2,3 secondes sur un seul GPU H100, avec jusqu'à 4x de frame skipping à l'inférence pour les scénarios longue-portée. Avec seulement 2 milliards de paramètres, le modèle domine le classement public WorldArena, devançant à la fois des world models robotiques dédiés et des générateurs vidéo généralistes en source fermée. L'enjeu central est le sim-to-real gap, la difficulté chronique à transférer des politiques entraînées en simulation vers des robots réels. GE-Sim 2.0 tente d'y répondre sur deux fronts : en générant des données synthétiques crédibles sur lesquelles entraîner des politiques VLA, avec des gains mesurables en conditions réelles selon les auteurs, et en automatisant l'évaluation des rollouts via le world judge, un goulot d'étranglement qui nécessitait jusqu'ici infrastructure physique ou inspection humaine. Pour les équipes travaillant à l'échelle sur des politiques de manipulation, l'équation coût-délai d'itération pourrait évoluer sensiblement. La performance au benchmark WorldArena avec 2B paramètres seulement suggère une efficacité paramétrique notable, même si les benchmarks de simulation ne garantissent pas directement des performances terrain. GE-Sim 2.0 s'inscrit dans la continuité directe de Genie Envisioner, framework de génération vidéo conditionné par l'action publié par la même équipe. Le marché des world models pour la robotique s'est densifié rapidement, avec notamment UniSim et des travaux issus de Google DeepMind, IRASim, ainsi que les simulateurs développés par Physical Intelligence autour de pi_zero. Dans l'espace VLA, Lerobot (Hugging Face) et plusieurs groupes académiques de MIT et Stanford investissent des directions parallèles. Ce résultat reste une pré-publication arXiv sans révision par les pairs ; les "gains mesurables en conditions réelles" annoncés ne sont pas quantifiés précisément dans l'abstract, ce qui limite l'interprétation des performances de transfert. La prochaine étape logique serait une validation externe sur des benchmarks physiques standardisés.

RechercheOpinion
1 source
Une couche d'interaction mécanique virtuelle permet des transferts d'objets humain-robot fiables
3arXiv cs.RO 

Une couche d'interaction mécanique virtuelle permet des transferts d'objets humain-robot fiables

Des chercheurs ont publié sur arXiv (preprint 2511.19543v2) une approche visant à rendre les transferts d'objets entre humains et robots plus robustes face aux imprévus. Le coeur de la contribution est une couche d'interaction basée sur le Virtual Model Control (VMC), une technique de contrôle qui simule des ressorts et amortisseurs virtuels autour de l'effecteur pour absorber les variations dynamiques de pose de l'objet lors du passage de main. En complément, les auteurs intègrent la réalité augmentée (AR) pour établir une communication bidirectionnelle en temps réel entre l'opérateur humain et le robot, permettant à chaque partie d'anticiper l'intention de l'autre. Les performances du contrôleur ont été évaluées sur une série d'expériences couvrant différentes sources d'incertitude, puis validées par une étude utilisateur impliquant 16 participants testant plusieurs profils de contrôle et visualisations AR. La problématique du transfert d'objet humain-robot (H2R handover) est un verrou bien identifié en robotique collaborative : une légère désorientation de la pièce, un geste hésitant, et le robot échoue ou force l'objet, ce qui rend ce scénario incompatible avec un déploiement industriel fiable. L'approche VMC est intéressante parce qu'elle ne dépend pas d'une trajectoire rigide pré-planifiée mais s'adapte en continu, ce qui réduit la sensibilité au sim-to-real gap souvent fatal aux méthodes basées sur l'apprentissage. L'ajout de la boucle AR pour synchroniser les intentions est également prometteur pour les environnements d'assemblage où la communication verbale est difficile. L'étude utilisateur montre une préférence générale pour l'approche proposée, même si 16 participants reste un panel modeste pour généraliser les conclusions. Le problème H2R est un domaine actif depuis plusieurs années, avec des approches concurrentes allant du contrôle en impédance classique aux méthodes VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou les travaux sur GR00T N2 de NVIDIA. Le VMC s'inscrit dans la tradition du contrôle à base de modèle, plus explicable mais moins généraliste que les approches end-to-end. L'article est à ce stade un preprint sans affiliation industrielle identifiée ni déploiement annoncé, ce qui le place clairement dans la catégorie recherche fondamentale. Les prochaines étapes probables incluent une soumission en conférence (ICRA ou IROS) et des tests sur une plus large cohorte ou sur un robot commercial tel qu'un UR ou Franka.

RecherchePaper
1 source
RADAR : génération de données robotiques en boucle fermée par planification sémantique et réinitialisation causale autonome de l'environnement
4arXiv cs.RO 

RADAR : génération de données robotiques en boucle fermée par planification sémantique et réinitialisation causale autonome de l'environnement

Wandercraft, Exotec, Pollen ou Enchanted Tools ne figurent pas dans cet article, c'est un papier de recherche académique, pas une actualité produit. Voici la traduction-synthèse. Des chercheurs présentent RADAR (Robust Autonomous Data Acquisition for Robotics), un moteur de génération de données robotiques entièrement autonome qui élimine toute intervention humaine du cycle de collecte. Le système s'appuie sur seulement 2 à 5 démonstrations humaines en 3D comme a priori géométriques, puis enchaîne un pipeline en quatre modules : un modèle vision-langage (VLM) génère des tâches pertinentes par ancrage sémantique d'objets et récupération de compétences, un réseau de neurones sur graphes (GNN) traduit ces sous-tâches en actions physiques via de l'apprentissage par imitation en contexte, le VLM évalue ensuite automatiquement la réussite via un pipeline de question-réponse visuelle structuré, et enfin une machine à états finis orchestre la remise à zéro autonome de l'environnement grâce à une planification simultanée avant-arrière selon une séquence causale stricte de type LIFO (dernier entré, premier sorti). En simulation, RADAR atteint jusqu'à 90% de réussite sur des tâches complexes à long horizon, là où les méthodes de référence chutent près de zéro. En conditions réelles, le système exécute des compétences riches en contact comme la manipulation d'objets déformables, en adaptation few-shot et sans fine-tuning spécifique au domaine. L'intérêt pour l'industrie robotique tient au goulot d'étranglement que RADAR cible directement : la collecte de données physiques à grande échelle reste freinée par le coût et le manque de scalabilité des méthodes nécessitant un humain en boucle, notamment pour la remise en configuration manuelle de l'environnement entre chaque essai. En automatisant à la fois la génération de tâches, l'exécution, l'évaluation de succès et surtout la réinitialisation de l'espace de travail, RADAR promet de transformer la collecte en processus auto-suffisant, un argument central pour quiconque cherche à entraîner des politiques VLA (vision-language-action) à l'échelle sans multiplier les téléopérateurs humains. Les chiffres de simulation sont à prendre avec la prudence habituelle pour ce type de benchmark, mais la démonstration en réel sur des tâches de manipulation d'objets déformables, sans fine-tuning dédié, est le signal le plus concret de transférabilité. Ce travail s'inscrit dans la vague de recherche sur la génération de données synthétiques et semi-autonomes pour l'apprentissage robotique, en réaction directe aux limites des approches de téléopération massive utilisées par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2). L'article, disponible sur arXiv sous une version révisée (v2), ne précise pas de plateforme robotique commerciale ni de partenariat industriel : il s'agit d'une contribution méthodologique destinée à la communauté recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration dans des pipelines d'entraînement de politiques VLA plus larges.

RecherchePaper
1 source