ARC : une méthode de raisonnement pour les modèles fondation en robotique
Des chercheurs proposent ARC, une méthode de raisonnement qui améliore sensiblement les performances « zero-shot » de modèles de fondation robotiques (RFM) existants, sans nouvelles démonstrations robot ni entraînement à grande échelle. Elle repose sur trois éléments. Le premier est une trace de raisonnement ancrée dans la prochaine action du robot, qui explique pourquoi l'action est appropriée et quel effet elle doit produire. Le deuxième est un pipeline d'étiquetage automatique, qui a permis de construire ARC-Trace-DROID à partir du jeu de données DROID existant, sans collecte de données robot supplémentaire. Le troisième est une stratégie d'adaptation propre à chaque architecture. Les auteurs l'appliquent au VLA π0.5 et au WAM (modèle d'action-monde) Cosmos3-Nano-Policy, avec un fine-tuning et une inférence ajustés à chacun. Les modèles adaptés établissent un nouvel état de l'art sur RoboLab-120 et MolmoSpaces, avec jusqu'à 50 points de pourcentage de gain sur RoboLab-Reasoning-50. Sur robots réels, le taux de succès de π0.5 progresse de 82,2 points de pourcentage.
Ces résultats remettent en cause l'idée dominante selon laquelle la performance des RFM ne progresse qu'avec des modèles plus gros, davantage de démonstrations téléopérées et des budgets d'entraînement élevés. Si les chiffres tiennent, le raisonnement devient un levier complémentaire et bon marché pour les équipes qui disposent déjà d'un VLA, car il réutilise des données existantes au lieu d'en collecter de nouvelles. C'est un argument fort pour les intégrateurs et les décideurs B2B, pour qui le coût de la donnée robot reste le principal frein au passage à l'échelle. L'approche touche aussi un point faible des VLA actuels, leur faible généralisation à des tâches nouvelles décrites en langage. Quelques précautions s'imposent. Le gain de 82,2 points sur robots réels est mesuré sur la base de départ de π0.5, et l'article ne détaille pas ici le nombre de tâches, de plateformes ni d'essais. Le terme « sans précédent » vient des auteurs eux-mêmes. Le gain de 50 points concerne un benchmark de raisonnement conçu pour ce type d'évaluation, donc probablement favorable à la méthode. Enfin, on ne sait pas encore ce que la génération de traces ajoute en latence d'inférence, un paramètre décisif pour le contrôle en boucle fermée.
ARC s'inscrit dans la tendance des VLA « avec raisonnement », qui font générer au modèle des étapes intermédiaires (sous-tâches, trajectoires, texte) avant d'agir. Elle prolonge les travaux autour de π0.5 de Physical Intelligence, entraîné sur de larges corpus hétérogènes, et du jeu de données DROID, devenu une base de référence en manipulation. L'usage d'un modèle d'action-monde comme Cosmos3-Nano-Policy, issu de l'écosystème Cosmos de NVIDIA, montre que la méthode vise plusieurs familles d'architectures et pas un seul modèle. Elle se positionne face aux approches qui misent sur l'échelle de données, comme GR00T chez NVIDIA ou Helix chez Figure. Il s'agit d'un travail académique publié sur arXiv (2610.12386v1), accompagné d'un site de projet. Il ne s'agit ni d'un produit ni d'un déploiement industriel. La suite logique serait une réplication indépendante, une évaluation sur d'autres robots et tâches longues, puis une mesure du coût en temps de calcul avant toute intégration dans des piles commerciales.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



