Aller au contenu principal
RecherchearXiv cs.RO 

PhysEvo : Astra sait agir, laissez-la faire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PhysEvo, un cadre de travail publié sur arXiv (2610.08995), applique l'auto-amélioration récursive à la manipulation robotique physique, autour d'un seul modèle figé, Astra, dont les poids ne sont jamais mis à jour. Un agent de tâche exécute les missions du robot. Un méta-agent exploite les trajectoires obtenues pour diagnostiquer les échecs, réviser les outils et les compétences, puis tester les corrections. Il peut aussi améliorer ses propres outils de diagnostic, de sorte que les révisions retenues servent à la fois l'action suivante et l'auto-amélioration suivante. Le processus fait émerger un contrôle au niveau des articulations, une observation qui cherche activement des preuves et des compétences de manipulation réutilisables, sans politique d'action entraînée à part. Sur 42 tâches du banc RoboDojo, avec des agencements de scène jamais vus, les versions de déploiement retenues atteignent un score moyen de 68,14/100 (cinq dimensions) et 62,00 % de réussite. L'agent Astra en un seul essai de RoboDawn, la meilleure référence publiée de la comparaison, plafonne à 47,17 %. Sur huit tâches difficiles pour Astra utilisé directement, PhysEvo monte à 55,00 % de réussite contre 1,25 %. Le harnais, évolué en simulation puis déployé sur un bras AgileX PiPER avec poursuite de la révision des compétences, obtient 90,60/100 et 84,00 % de réussite sur 25 essais répartis sur cinq tâches réelles.

L'intérêt tient au déplacement du levier d'amélioration. Au lieu de réentraîner un modèle de fondation ou de collecter des démonstrations pour une politique dédiée, les auteurs montrent que la couche logicielle qui entoure un modèle figé (outils, compétences, observation) concentre une grande part de la fiabilité. L'écart de 1,25 % à 55 % sur les tâches difficiles suggère que les échecs de l'agent direct viennent surtout de son interface avec le monde. Pour les intégrateurs, cela ouvre une voie où l'adaptation à un site passe par des révisions de code et de compétences, plus inspectables et versionnables que des poids. Les réserves sont nettes : les scores sont des moyennes de versions « retenues » par tâche, donc sélectionnées après coup. L'échantillon réel est mince (25 essais, cinq tâches, un seul bras), et les 84 % incluent une révision continue sur le matériel, ce qui n'est pas un transfert direct de la simulation. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel.

Le travail s'inscrit dans la vague des agents à base de modèles de fondation qui écrivent du code pour piloter des robots, et dans l'intérêt croissant pour l'auto-amélioration récursive, jusqu'ici surtout appliquée au logiciel pur. Sa référence principale, RoboDawn, repose sur un agent Astra en un seul essai, sans boucle de révision. Les approches concurrentes passent par des politiques vision-langage-action (VLA) entraînées, qui exigent données et calcul. PhysEvo mise sur l'évolution après déploiement d'un système autour d'un modèle gelé. Les prochaines étapes à surveiller sont la validation sur davantage de plateformes et de tâches réelles, des mesures de coût en essais et en appels de modèle, et la comparaison directe avec des VLA entraînés dans des conditions équivalentes.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Apprentissage continu pour la synthèse de saisies à 6 DOF à partir de l'expérience et de démonstrations
1arXiv cs.RO 

Apprentissage continu pour la synthèse de saisies à 6 DOF à partir de l'expérience et de démonstrations

Des chercheurs publient sur arXiv (identifiant 2610.01301) un cadre d'apprentissage continu pour la synthèse de prises 6-DoF avec une pince parallèle, à partir d'une seule vue, dans des scènes encombrées. Leur méthode n'ajuste pas un grand modèle paramétrique. Elle adapte le système par une mémoire située dans un espace d'embedding appris. Les résultats de chaque tentative de saisie modifient les scores des prises futures. Des démonstrations fournies par l'utilisateur, facultatives, sont rappelées puis transférées vers de nouvelles scènes, où elles deviennent des prises candidates supplémentaires. L'évaluation combine simulation et expériences réelles, avec plus de 1500 essais de saisie. Selon les auteurs, le système égale les références 6-DoF existantes avant toute adaptation. Il progresse en ligne sur des objets inconnus, issus de catégories absentes ou sous-représentées à l'entraînement. Il tient un apprentissage continu sur le long terme avec peu d'oubli. Sur plusieurs catégories d'objets difficiles, il dépasse 90 % de réussite après seulement 50 tentatives en ligne. La vidéo et le code sont publiés sur la page du projet. Ce résultat s'attaque à un point faible de la manutention robotisée. La plupart des systèmes de saisie sont entraînés hors ligne puis figés au déploiement. Leurs performances baissent dès que les conditions s'écartent des données d'entraînement, par exemple avec une référence jamais vue dans un bac de e-commerce ou de logistique. Passer par une mémoire plutôt que par un réglage fin évite de réentraîner un gros modèle sur site. Cela limite le coût de calcul, le risque de régression et l'oubli catastrophique. Pour un intégrateur, 50 essais représentent quelques heures de fonctionnement. Un robot pourrait donc s'améliorer seul sur son assortiment réel, sans cycle de collecte et de réentraînement. Le canal de démonstrations donne aussi à un opérateur non spécialiste un moyen simple de corriger un échec. Il faut toutefois rester prudent. Il s'agit d'un preprint, pas encore évalué par les pairs. Les chiffres ne couvrent que quelques catégories choisies, sans information dans le résumé sur la diversité des objets, les temps de cycle ou le matériel. Le travail concerne uniquement la saisie par pince parallèle, pas la manipulation dextre ni les humanoïdes. Il s'inscrit dans la lignée des méthodes de saisie 6-DoF apprises, comme Contact-GraspNet et ses successeurs, et des modèles vision-langage-action généralistes. Ceux-ci restent en grande partie figés après l'entraînement. Cette approche à mémoire y ajoute une voie d'adaptation légère. La suite logique serait des essais en conditions industrielles, avec des cadences réelles et des assortiments variés.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
LA4VLA : apprendre à agir sans vision par pré-entraînement langage-action
2arXiv cs.RO 

LA4VLA : apprendre à agir sans vision par pré-entraînement langage-action

Des chercheurs ont publié sur arXiv (2606.27295, juin 2026) un cadre de pré-entraînement baptisé LA4VLA qui s'attaque à un défaut structurel des modèles Vision-Langage-Action (VLA) : en supervision conjointe visuelle et textuelle, le signal visuel écrase le signal langage, poussant les politiques de contrôle à exploiter des raccourcis visuels spécifiques à une scène plutôt qu'à exécuter des instructions généralisables. LA4VLA introduit une phase de pré-entraînement sans images : les trajectoires de démonstration existantes sont découpées en segments atomiques, chacun associé à une description textuelle bas-niveau, produisant LA4-33K, un dataset de 33 000 épisodes Langage-Action construits entièrement à partir de données existantes sans collecte robotique supplémentaire. Le modèle LA4VLA-1B (1 milliard de paramètres) est évalué selon trois paradigmes : pré-entraînement LA seul, séquentiel LA puis VLA, et mixte LA+VLA. Le pré-entraînement mixte améliore le taux de succès moyen de 17,8 points de pourcentage en simulation et de 45 points sur tâches réelles par rapport à l'absence de pré-entraînement. Ces résultats ont une portée directe pour les développeurs de politiques robotiques polyvalentes. Le problème des raccourcis visuels est bien documenté dans la littérature : les robots apprennent à reconnaître un arrangement de scène particulier plutôt qu'à interpréter une instruction générique, ce qui fragilise les politiques dès que l'environnement varie légèrement. Le gain de 45 points sur les tâches réelles, contre 17,8 en simulation, est particulièrement notable : il suggère que l'approche atténue précisément le sim-to-real gap, principal obstacle aux déploiements industriels. Pour les intégrateurs, la méthode permet de valoriser des datasets de démonstrations existants sans mobiliser de ressources robotiques supplémentaires, réduisant substantiellement le coût d'entrée vers des politiques plus robustes. Les modèles VLA ont connu une forte accélération depuis 2023, portée par des travaux comme RT-2 (Google DeepMind), OpenVLA ou π0 de Physical Intelligence, qui s'appuient tous sur un pré-entraînement visuel massif suivi d'un fine-tuning robotique. LA4VLA propose une direction complémentaire et orthogonale : renforcer le conditionnement langage indépendamment du flux visuel, en exploitant la structure sémantique des trajectoires plutôt que leur apparence. L'abstract ne mentionne ni affiliations institutionnelles précises ni partenaires industriels ; il s'agit d'une contribution académique validée en laboratoire, sans pilote commercial annoncé. La suite logique serait une évaluation sur des benchmarks standardisés comme LIBERO ou CALVIN, ainsi qu'une intégration dans des pipelines humanoïdes à manipulation complexe où la généralisation au langage est particulièrement critique.

RechercheOpinion
1 source
Reconstruire, s'entraîner, passer au réel : l'auto-amélioration guidée des agents incarnés
3arXiv cs.RO 

Reconstruire, s'entraîner, passer au réel : l'auto-amélioration guidée des agents incarnés

Des chercheurs proposent Reconstruct, Practice, Go Real (RPG), un cadre d'amélioration autonome des systèmes d'exécution robotique qui ne touche à aucun poids de modèle. À partir d'un jeu de données hors ligne, RPG identifie les capacités de manipulation présentes et construit en simulation des tâches d'entraînement apparentées. Pendant cette phase de pratique, le système exploite les retours d'exécution, l'état privilégié du simulateur et les vidéos disponibles du jeu de données pour diagnostiquer les échecs. Il en tire de nouvelles compétences symboliques réutilisables, affine les compétences existantes et réécrit le prompt système. Chaque modification candidate, seule ou fusionnée avec d'autres, est testée sur plusieurs tâches avant d'être conservée. Au déploiement, un LLM multimodal s'appuie sur ce prompt et cette bibliothèque de compétences pour coordonner perception et contrôle. Sur 22 tâches de manipulation, avec des initialisations non vues, le taux de réussite passe de 28,6 % après le premier cycle de pratique à 95,0 % après 15 cycles. Les références testées sont dépassées : ASPIRE atteint 75,5 % et CaP-Agent0, piloté par GPT-6 Astra Pro, 60,0 %. Après une calibration et une adaptation matérielle communes, le système figé réussit les 30 essais physiques, soit dix essais sur chacune de trois tâches. L'intérêt tient à l'approche : l'amélioration passe par du code, des compétences et des prompts, pas par du réentraînement. Pour un intégrateur, cela rend le processus plus auditable et plus facile à versionner, puisque chaque compétence ajoutée est lisible et validée en simulation avant d'être retenue. Cela s'attaque directement au coût humain de la mise au point des compétences, des fonctions de récompense et de l'intégration perception-contrôle. La progression de 28,6 % à 95,0 % suggère aussi que le goulot d'étranglement des agents pilotés par LLM se situe moins dans le modèle que dans la qualité des compétences et des instructions qui l'entourent. Il faut toutefois relativiser. Les 30 essais réels, sur trois tâches seulement, forment un échantillon très mince comparé aux 22 tâches simulées. Ils interviennent après une phase de calibration et d'adaptation matérielle dont le coût n'est pas détaillé dans le résumé. Le transfert sim-to-real reste donc plus plausible que démontré à l'échelle. Ces travaux s'inscrivent dans la lignée des approches « code as policies », où un LLM compose des primitives de contrôle, et des méthodes d'auto-amélioration par bibliothèque de compétences, dont ASPIRE est ici le meilleur concurrent évalué. Ils se distinguent des modèles vision-langage-action (VLA) de type Pi-0 ou GR00T, qui font évoluer l'ensemble par réentraînement de poids. Les auteurs n'annoncent ni produit ni partenaire industriel. Les prochaines étapes à surveiller sont une validation sur davantage de tâches physiques, sur des manipulations plus riches et sur d'autres plateformes. La comparaison avec des VLA entraînés sur les mêmes données serait aussi utile. Le site du projet, rpg-robot.github.io, sert de point d'entrée pour vérifier les résultats.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
La pratique fait la politique : construire et consolider des capacités robotiques sans démonstration humaine
4arXiv cs.RO 

La pratique fait la politique : construire et consolider des capacités robotiques sans démonstration humaine

HERO (Heuristic-Exemplar-Reflexive Orchestration) est un cadre robotique proposé dans un article arXiv publié fin juillet 2026, conçu pour permettre à un bras ou un robot manipulateur d'apprendre des tâches de manipulation sans aucune démonstration humaine préalable. Le système combine trois mécanismes dans une architecture hiérarchique unifiée : un raisonnement heuristique pour explorer et amorcer de nouvelles tâches, une réutilisation d'exemplaires pour transférer rapidement des comportements déjà appris à des situations similaires, et une exécution réflexive qui corrige les erreurs en temps réel pendant l'interaction physique. L'idée centrale est que le robot collecte lui-même ses données d'entraînement en agissant dans l'environnement, puis consolide progressivement les interactions récurrentes en politiques visuomotrices en boucle fermée, c'est-à-dire des comportements appris directement à partir des flux caméra et capteurs, sans supervision humaine continue. Les auteurs rapportent, via des expériences étendues, une réduction substantielle de l'intervention humaine lors de la collecte de données, avec une manipulation jugée robuste sur des tâches variées. L'intérêt pour l'industrie tient au problème que HERO cherche à résoudre : la plupart des systèmes de manipulation robotique actuels apprennent des compétences figées, calibrées pour une tâche ou un environnement précis, et ne s'améliorent pas de façon autonome au fil de l'usage réel. Un mécanisme qui transforme l'expérience accumulée en capacités réutilisables, sans démonstrations humaines coûteuses à collecter, s'attaque directement au goulot d'étranglement des données qui freine le déploiement à grande échelle des politiques de type VLA (vision-language-action) chez les intégrateurs et fabricants de robots généralistes. Ce travail s'inscrit dans une lignée de recherche plus large sur l'auto-amélioration des agents incarnés, où plusieurs laboratoires explorent des boucles fermées entre collecte de données, entraînement de politiques et exécution. Il s'agit ici d'une publication de recherche, pas d'un produit commercialisé ni d'un déploiement industriel documenté : les résultats proviennent d'expériences en laboratoire, et l'article ne précise ni le matériel utilisé ni de comparaison chiffrée avec des systèmes concurrents nommés.

RecherchePaper
1 source