PhysEvo : Astra sait agir, laissez-la faire
PhysEvo, un cadre de travail publié sur arXiv (2610.08995), applique l'auto-amélioration récursive à la manipulation robotique physique, autour d'un seul modèle figé, Astra, dont les poids ne sont jamais mis à jour. Un agent de tâche exécute les missions du robot. Un méta-agent exploite les trajectoires obtenues pour diagnostiquer les échecs, réviser les outils et les compétences, puis tester les corrections. Il peut aussi améliorer ses propres outils de diagnostic, de sorte que les révisions retenues servent à la fois l'action suivante et l'auto-amélioration suivante. Le processus fait émerger un contrôle au niveau des articulations, une observation qui cherche activement des preuves et des compétences de manipulation réutilisables, sans politique d'action entraînée à part. Sur 42 tâches du banc RoboDojo, avec des agencements de scène jamais vus, les versions de déploiement retenues atteignent un score moyen de 68,14/100 (cinq dimensions) et 62,00 % de réussite. L'agent Astra en un seul essai de RoboDawn, la meilleure référence publiée de la comparaison, plafonne à 47,17 %. Sur huit tâches difficiles pour Astra utilisé directement, PhysEvo monte à 55,00 % de réussite contre 1,25 %. Le harnais, évolué en simulation puis déployé sur un bras AgileX PiPER avec poursuite de la révision des compétences, obtient 90,60/100 et 84,00 % de réussite sur 25 essais répartis sur cinq tâches réelles.
L'intérêt tient au déplacement du levier d'amélioration. Au lieu de réentraîner un modèle de fondation ou de collecter des démonstrations pour une politique dédiée, les auteurs montrent que la couche logicielle qui entoure un modèle figé (outils, compétences, observation) concentre une grande part de la fiabilité. L'écart de 1,25 % à 55 % sur les tâches difficiles suggère que les échecs de l'agent direct viennent surtout de son interface avec le monde. Pour les intégrateurs, cela ouvre une voie où l'adaptation à un site passe par des révisions de code et de compétences, plus inspectables et versionnables que des poids. Les réserves sont nettes : les scores sont des moyennes de versions « retenues » par tâche, donc sélectionnées après coup. L'échantillon réel est mince (25 essais, cinq tâches, un seul bras), et les 84 % incluent une révision continue sur le matériel, ce qui n'est pas un transfert direct de la simulation. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel.
Le travail s'inscrit dans la vague des agents à base de modèles de fondation qui écrivent du code pour piloter des robots, et dans l'intérêt croissant pour l'auto-amélioration récursive, jusqu'ici surtout appliquée au logiciel pur. Sa référence principale, RoboDawn, repose sur un agent Astra en un seul essai, sans boucle de révision. Les approches concurrentes passent par des politiques vision-langage-action (VLA) entraînées, qui exigent données et calcul. PhysEvo mise sur l'évolution après déploiement d'un système autour d'un modèle gelé. Les prochaines étapes à surveiller sont la validation sur davantage de plateformes et de tâches réelles, des mesures de coût en essais et en appels de modèle, et la comparaison directe avec des VLA entraînés dans des conditions équivalentes.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




