Aller au contenu principal
RecherchearXiv cs.RO 

Moins de jetons, meilleure action : les agents robotiques GPT-6 Astra gagnent 14 % de réussite avec 65 % de jetons en moins

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (identifiant 2610.01939v1) PyRUA-Lean, un cadre d'exécution de code interactif pour piloter des robots avec un agent VLM (modèle vision-langage). Ici, le planificateur est GPT-6 Astra. L'agent compose des primitives robotiques classiques et des politiques VLA (vision-language-action) apprises dans des cellules Python. Ces cellules effectuent des vérifications conditionnelles et des tentatives locales de reprise. Elles ne renvoient au modèle que les images et les retours d'état demandés explicitement, pour permettre le replanning. L'évaluation porte sur 700 instances de tâches simulées issues de LIBERO-PRO, RoboTwin 2.0 et RoboCasa365. La référence est un agent à appels d'outils (tool-calling) qui utilise le même planificateur et les mêmes primitives. À budget d'appels LLM égal, le taux de réussite global passe de 63,1 % à 71,7 %, soit 8,6 points de plus (environ 14 % en relatif). Sur les instances résolues par les deux agents, PyRUA-Lean utilise 49 % d'appels LLM en moins et 65 % de tokens d'entrée en moins.

Le résultat touche un coût d'exploitation souvent absent des démonstrations : le nombre d'appels au modèle et le volume d'observations qu'il ingère à chaque pas. Dans une boucle classique, chaque action déclenche un appel au planificateur et le renvoi d'images, ce qui pèse sur la latence et la facture. Déléguer les vérifications et les reprises à du code exécuté localement déplace une partie du contrôle vers des routines déterministes. Pour un intégrateur, cela suggère qu'une partie du gain vient de l'architecture de l'agent, pas seulement d'un meilleur modèle. L'approche rapproche aussi les VLA, utilisés comme primitives, d'un orchestrateur de plus haut niveau. Il faut toutefois rester prudent. Tous les chiffres viennent de la simulation, le papier est un preprint non évalué par des pairs, et la comparaison porte sur un seul type de baseline. Le gap sim-to-real n'est pas traité dans le résumé, et la réduction de 49 % et 65 % ne vaut que sur les tâches réussies par les deux agents, ce qui exclut les cas où l'agent de référence échoue.

Ce travail s'inscrit dans la tendance des agents « code-as-policy », où un LLM écrit du code qui appelle des modules de perception et de contrôle, désormais associés à des politiques VLA comme Pi-0 ou GR00T. Les benchmarks retenus (LIBERO-PRO, RoboTwin 2.0, RoboCasa365) couvrent la manipulation tabletop, le bimanuel et les tâches domestiques en cuisine simulée. Ils sont courants, mais ils restent éloignés des contraintes d'un site industriel. Le résumé ne cite ni acteur européen, ni partenaire industriel, ni calendrier de déploiement. Les suites logiques seraient une validation sur robot physique, une comparaison avec d'autres architectures d'agents et une mesure du coût en euros par tâche plutôt qu'en tokens. Tant que ces tests n'existent pas, PyRUA-Lean reste un résultat de recherche et non un produit disponible.

Dans nos dossiers

À lire aussi

Apprentissage robotique en contexte avec des agents VLM
1arXiv cs.RO 

Apprentissage robotique en contexte avec des agents VLM

Un article publié sur arXiv (référence 2609.19138v1) présente GPT-Policy, un cadre logiciel qui permet à un robot d'apprendre au moment du déploiement, sans réentraînement préalable pour chaque tâche. L'architecture combine un « context compiler » qui conserve les transitions visuelles utiles à la tâche, un modèle vision-langage (VLM) grand public comme GPT-6 Astra chargé de proposer des actions robot-outil, et un contrôleur contraint qui vérifie, exécute et rapporte le résultat de chaque action. Sur robot réel, des démonstrations vidéo humaines améliorent le taux de réussite même sans étiquetage des actions robotiques correspondantes, et des références d'actions alignées apportent un gain supplémentaire sur les tâches sensibles au contact. Aucun chiffre de charge utile, de degrés de liberté ou de temps de cycle n'est communiqué : il s'agit d'une étude de recherche évaluée sur des métriques de réussite et d'efficacité, pas d'un produit commercialisé. Le problème visé est central pour l'industrie : aucun jeu de démonstrations fini ne peut couvrir toutes les tâches et situations qu'un robot rencontrera en usage réel, ce qui limite la généralisation des politiques actuelles entraînées par imitation. En s'appuyant sur l'apprentissage en contexte, déjà courant chez les grands modèles de langage pour le texte ou le code, mais sans mise à jour de gradient ni modification persistante des paramètres, l'approche suggère qu'un VLM généraliste pourrait s'adapter à une situation nouvelle à partir de quelques exemples fournis au moment de l'exécution. Si elle se confirme à plus grande échelle, cette piste remettrait en question l'idée selon laquelle seuls des modèles vision-langage-action spécialement entraînés sur des données robotiques peuvent piloter un robot, un enjeu direct pour les intégrateurs cherchant à réduire le coût de collecte de données par tâche. Ce travail s'inscrit dans la vague des modèles fondation appliqués à la robotique, aux côtés de familles VLA comme Pi-0, GR00T N2 ou Helix, qui misent à l'inverse sur un entraînement massif de bout en bout sur des données robotiques. Les auteurs présentent eux-mêmes leurs résultats comme une étape vers l'apprentissage en contexte plutôt que comme une solution aboutie, reconnaissant que des défis subsistent avant un déploiement fiable. Aucun acteur français ou européen, aucun site de déploiement industriel ni calendrier de commercialisation ne figurent dans cette publication, qui reste une contribution académique destinée à poser des fondations empiriques plutôt qu'un produit prêt à l'emploi.

UEAucun acteur ni déploiement européen n'est mentionné, mais la piste de l'apprentissage en contexte pourrait à terme intéresser les intégrateurs robotiques européens en réduisant le coût de collecte de données par tâche.

RecherchePaper
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
2arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
Agents de codage avec harnais conscient des obstacles pour une manipulation robotique sûre
3arXiv cs.RO 

Agents de codage avec harnais conscient des obstacles pour une manipulation robotique sûre

Une étude publiée sur arXiv (2609.20822, 18 septembre 2026) évalue la sécurité des "coding agents", ces systèmes où un modèle de langage écrit directement le code du contrôleur robotique, sans entraînement spécifique au robot. Testés sur des tâches associant un objectif de manipulation à un obstacle interdit de contact, ces agents le heurtent dans la majorité des cas, alors même que leurs traces de raisonnement mentionnent l'obstacle et que le prompt en interdit explicitement le contact: ni la perception ni la consigne ne sont en cause, c'est la planification qui échoue à prioriser la contrainte de sécurité. En décomposant la manipulation en une phase de trajet et un moment de contact, les auteurs identifient deux manques: aucune notion de route dégagée ni de replanification pendant le trajet, aucune prise en compte de la contrainte pendant le geste de contact lui-même. Leur solution, SafeHarness, ajoute une planification de trajet par boîtes englobantes et séquences de points de passage vérifiées avant exécution, plus un choix de position de contact évitant l'obstacle. Résultat: 71,9% de réussite de tâche et 87,5% d'évitement de collision, soit respectivement 6,5 et 27,0 points de plus que le précédent état de l'art, et 2,3 et 1,5 fois les scores du même agent sans ces harnais. Ce résultat nuance l'idée qu'un modèle capable de verbaliser une contrainte de sécurité et de recevoir une consigne explicite s'y conforme automatiquement lors de l'exécution, une hypothèse implicite chez les promoteurs des coding agents comme voie rapide vers des robots généralistes sans données spécifiques. Pour les intégrateurs et décideurs qui envisagent de déployer des agents pilotés par LLM en environnement partagé avec des humains, l'étude montre qu'un bon prompt ne suffit pas: il faut séparer explicitement planification de trajectoire et exécution du contact dans l'architecture. Elle rappelle aussi qu'un taux de réussite de tâche élevé peut masquer un comportement dangereux tant que le taux de collision n'est pas mesuré séparément. Ces travaux s'inscrivent dans la lignée des approches "code as policy", où un LLM génère un programme de contrôle plutôt que d'être entraîné de bout en bout sur des données robotiques, une piste prisée car elle évite la collecte de données propre à chaque robot. SafeHarness se positionne face à un état de l'art antérieur non nommé dans le résumé, qu'il dépasse nettement sur les deux métriques de sécurité et de performance. Publiée le 18 septembre 2026, l'étude reste un travail de recherche évalué sur des tâches de benchmark, sans plateforme robotique commerciale ni déploiement pilote mentionnés, ni calendrier annoncé pour une éventuelle mise en œuvre au-delà du laboratoire.

RecherchePaper
1 source
Un future, tous les robots : prédiction de l'état collectif avec JEPA décentralisé, efficace en étiquetage
4arXiv cs.RO 

Un future, tous les robots : prédiction de l'état collectif avec JEPA décentralisé, efficace en étiquetage

Traduction et résumé en français : Des chercheurs présentent CS-JEPA (Collective-State JEPA), une architecture récurrente d'apprentissage par embeddings partagés permettant à chaque robot d'un essaim de prédire un même état collectif futur à partir de ses seules observations locales et de messages limités en bande passante, décrite dans arXiv:2607.28443v1. Au déploiement, chaque robot ne s'appuie que sur un historique local de 16 frames et un message récurrent de 64 flottants par lien dirigé, sans pooling global, sans encodeur cible, sans horloge d'épisode ni action future enregistrée. Après un pré-entraînement sans étiquettes collectives, les représentations gelées sont évaluées via des sondes ridge entraînées sur seulement 6, 12 ou 24 épisodes étiquetés. Face à une baseline de reconstruction directe du futur dotée de 9607 paramètres supplémentaires à l'entraînement, une étude pré-enregistrée à cinq graines montre CS-JEPA meilleur dans 5 cas sur 5, sur des topologies en anneau, en k-plus-proches-voisins mutuels et sur des tailles d'essaim inédites allant jusqu'à 108 robots. Une seconde étude scellée à huit graines, où les robots évaluent des plans à quatre pas avant de produire leurs prédictions, montre une réduction de 45,5% de l'erreur sur la valeur des branches et un gain de 0,1291 de corrélation de Pearson sur le score des candidats, avec un effet favorable dans les 8 graines, y compris pour une taille inédite de 32 robots. Ce résultat cible un problème central de la robotique en essaim décentralisée: faire converger plusieurs agents autonomes vers la même estimation d'état collectif futur sans communication centralisée ni supervision massive. En battant une reconstruction directe du futur à capacité de déploiement égale, l'étude apporte un argument concret en faveur des cibles JEPA comme primitive efficace en étiquettes pour la prédiction distribuée, y compris quand la topologie du réseau ou la taille de l'essaim change au moment du déploiement. Pour les concepteurs de flottes de drones, de robots mobiles ou de systèmes multi-agents, cela ouvre une voie pour réduire le coût d'étiquetage tout en conservant une robustesse au changement d'échelle, un problème récurrent dès qu'un essaim réel dépasse les configurations testées en simulation. Le gain observé sur l'estimation de valeur conditionnée par un plan renforce aussi l'intérêt de l'approche pour la planification distribuée, où chaque robot doit juger des candidats d'action sans vue globale du système. CS-JEPA s'inscrit dans la lignée des architectures de prédiction par embeddings partagés, déjà utilisées en apprentissage de représentations pour éviter la reconstruction pixel par pixel, ici transposées au cas multi-agent décentralisé. Les auteurs comparent volontairement leur méthode à une baseline plus riche en paramètres d'entraînement pour écarter l'hypothèse d'un avantage lié à la seule capacité du modèle, et testent la généralisation sur plusieurs topologies et tailles d'essaim non vues à l'entraînement. Le travail reste pour l'instant limité à des simulations évaluées par sondes linéaires; la validation sur essaim physique et la comparaison à d'autres primitives de prédiction distribuée constituent les suites logiques.

RecherchePaper
1 source