Gemini Robotics 2, selon Google DeepMind, permet un contrôle complet du corps
DeepMind a dévoilé la semaine dernière Gemini Robotics 2, la nouvelle version de son modèle vision-langage-action (VLA), avec pour ajout principal le contrôle du corps entier des robots humanoïdes, là où la version précédente se limitait au haut du corps pour des tâches sur table. Sur le robot Apollo 2 d'Apptronik, le modèle traduit une instruction en langage naturel, comme « mettre l'arrosoir dans le bac vert de l'étagère du bas », en une séquence complète : le robot marche jusqu'à la table, saisit l'objet, se déplace vers l'étagère et le pose précisément à l'endroit demandé. Côté préhension fine, Gemini Robotics 2 pilote la main SharpaWave à cinq doigts et 22 degrés de liberté (DOF) montée sur Apollo 2, capable de nouer une corde ou de fermer un sachet zippé, ainsi que des pinces parallèles à deux doigts standard sur une plateforme Franka Duo pour des tâches d'emballage dense. DeepMind publie en parallèle deux modèles complémentaires : Gemini Robotics ER 2, un modèle de raisonnement incarné (VLM) qui sert de « cerveau » de haut niveau, communique avec les humains, observe l'environnement et coordonne des tâches multi-étapes de plusieurs minutes, y compris entre plusieurs robots ; et Gemini Robotics On-Device 2, une version optimisée pour tourner localement sur les robots et s'adapter à un nouveau corps robotique en quelques heures de données seulement, selon DeepMind. ER 2 est disponible sur Google AI Studio et en accès anticipé privé sur la plateforme Gemini Enterprise Agent, tandis que le VLA et la version on-device restent réservés à des partenaires triés sur le volet.
Cette annonce marque une étape notable dans la course aux robots humanoïdes généralistes, dominée jusqu'ici par des démonstrations spectaculaires mais rarement suivies de déploiements réels. En unifiant navigation, manipulation bimanuelle et dextérité fine sous un seul modèle capable de s'adapter à différents corps robotiques (Apollo 2, Franka Duo) en quelques heures plutôt qu'en mois de réentraînement, DeepMind s'attaque directement à l'un des goulots d'étranglement du secteur : le fossé entre une démo réussie en labo et un système fiable en environnement réel. Le fait que Gemini Robotics ER 2 gère l'auto-correction en cas d'échec d'une étape et la généralisation à des situations nouvelles répond à une critique récurrente des VLA actuels, souvent fragiles dès qu'ils sortent de leur distribution d'entraînement. DeepMind reconnaît toutefois que la vitesse de mouvement reste un axe de progrès, une nuance qui tempère l'enthousiasme habituel des communiqués du secteur et rappelle que la robustesse à l'échelle industrielle n'est pas encore acquise.
Le premier Gemini Robotics, lancé plus tôt dans l'année, avait déjà démontré la capacité du modèle multimodal de Google à piloter une action physique réelle, mais restait cantonné à des manipulations de table. Cette itération s'inscrit dans une compétition de plus en plus dense entre modèles VLA généralistes, face notamment à Figure avec Helix, Physical Intelligence avec Pi-0, ou NVIDIA avec GR00T N2, chacun cherchant à prouver qu'un seul modèle peut piloter des corps robotiques variés sans réentraînement spécifique par tâche. L'accès restreint aux early-access partners suggère que DeepMind privilégie pour l'instant une validation contrôlée avant une ouverture plus large, sans calendrier de déploiement commercial annoncé à ce stade.




