
Exploration systématique des capacités de GPT-6 Astra comme politiques incarnées
Une équipe de chercheurs publie sur arXiv (2609.38537) une évaluation systématique de GPT-6 Astra utilisé non plus seulement comme planificateur de haut niveau, mais comme politique embarquée générant directement des actions robotiques numériques. Six domaines sont testés, en contrôle direct, en coopération avec des politiques apprises et en adaptation par retour d'information. En manipulation à pince, le contrôle hybride avec π0.5 atteint 48 % de réussite sur un sous-ensemble de RoboDojo. En manipulation dextre, il atteint 50 % sur dix essais DexJoCo guidés par l'expérience, tandis que le contrôle direct des doigts peine à coordonner les contacts. En manipulation mobile, il atteint 38,7 % sur RoboCasa365. En navigation, Astra mène les comparaisons locales avec 92 % sur RxR et 82 % sur la recherche d'objets HM3D, au prix de détours importants. En locomotion, aucune des cinq tentatives successives sur un parcours d'obstacles n'atteint l'arrivée. En loco-manipulation humanoïde, Astra dépasse les méthodes de référence sur 13 des 30 tâches HumanoidBench, avec des contrôleurs corps entier pré-entraînés.
L'intérêt tient à la mesure d'un écart que les démonstrations masquent souvent : un modèle généraliste prend de bonnes décisions de tâche, mais n'en fait pas pour autant un contrôleur physique fiable. Le résultat plaide pour des architectures hiérarchiques, où le grand modèle corrige les cibles, prépare les contacts et délègue l'exécution fine à une politique spécialisée. Pour un intégrateur ou un COO industriel, le coût est un frein concret : 624,8 millions de tokens pour le mode assisté contre 1,132 milliard en contrôle direct, sur 50 instances par condition. Une course de locomotion de 30 secondes exige 250 appels, d'environ 39,86 secondes chacun, avec la physique mise en pause pendant l'inférence. Le temps réel reste donc hors de portée.
Ces travaux s'inscrivent dans la tendance des modèles de fondation « cerveau » associés à des contrôleurs bas niveau, déjà visible dans les architectures à deux systèmes de type Helix ou GR00T et dans les politiques VLA comme π0.5 de Physical Intelligence, ici utilisée comme partenaire. Il s'agit d'une étude académique, avec des sous-ensembles de benchmarks et des comparaisons locales, et non d'un produit livré ni d'un déploiement réel. Les taux de succès modestes en manipulation dextre et mobile en témoignent. Les prochaines étapes probables concernent la réduction de la latence, des modèles plus légers pour la boucle de contrôle et une meilleure génération de références de mouvement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




