Aller au contenu principal
RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution
RecherchearXiv cs.RO 

RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Agentic Real-to-Sim-to-Real (Agentic RSR), un cadre qui relie dans une même boucle la reconstruction de scène, le développement de politique et l'exécution sur robot réel, à partir d'une seule tâche de manipulation. L'entrée se limite à une vidéo de l'espace de travail, une description de la tâche et le modèle connu du robot. Un agent récupère l'échelle métrique, affine la scène par retours visuels successifs et vérifie dans MuJoCo que les interactions pertinentes pour la tâche sont bien préservées. Un agent de codage écrit ensuite une politique exécutable, en progressant des poses d'objets privilégiées vers des observations visuelles, puis vers une simulation randomisée. La politique peut enchaîner plusieurs observations et actions au sein d'un même appel, et l'agent exploite les retours d'exécution pour poursuivre, réessayer ou revoir son approche. Sur 18 scènes reconstruites impliquant deux robots, l'erreur absolue moyenne de profondeur sur quatre vues, mesurée par rapport à des estimations de référence, atteint 0,1057 m. Le ΔE76 moyen en espace Lab est de 11,04 et le SSIM moyen en niveaux de gris de 0,6990. Sur robot réel, le taux de réussite agrégé atteint 80 % de celui obtenu en simulation.

Le point notable tient à l'architecture plus qu'à une performance isolée. La reconstruction de scène et le développement de politique sont habituellement traités séparément, ce qui produit des jumeaux numériques jolis mais inutiles pour la tâche, ou des politiques entraînées sur des observations que le robot réel ne verra jamais. Ici, la scène est jugée sur sa capacité à préserver les interactions utiles, et la politique n'utilise que des observations disponibles sur le matériel. Un taux de rétention de 80 % suggère que le fossé sim-to-real peut se réduire sans entraînement massif par apprentissage par renforcement, en s'appuyant sur du code généré par un agent et corrigé par ses retours d'exécution. Pour les intégrateurs, la perspective est de déployer plus vite sur une cellule inédite à partir d'une simple vidéo. Les métriques de reconstruction restent toutefois modestes : une erreur de profondeur d'environ 10 cm et un SSIM proche de 0,70 indiquent une fidélité visuelle limitée. Le ratio de 80 % est relatif à la simulation, et le taux de réussite absolu, la diversité des tâches et le nombre d'essais ne sont pas précisés dans le résumé.

Ces travaux s'inscrivent dans la montée des approches « real-to-sim » et des agents de codage appliqués à la robotique, qui concurrencent les VLA entraînés de bout en bout, plus gourmands en données de téléopération. Ils reposent sur MuJoCo, simulateur désormais standard, et sur des modèles de perception pour la profondeur et la géométrie. L'article, publié sur arXiv (2610.10479v1), annonce que le code et les données de scènes reconstruites seront rendus publics, sans calendrier précisé. Leur diffusion permettra de vérifier si la méthode tient hors du cadre de laboratoire, sur des tâches plus longues et des environnements encombrés, ainsi que de la comparer aux politiques apprises de bout en bout.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

Politiques de scène à base d'agents

Des chercheurs du laboratoire Robotics and Embodied AI de Montréal (Mila, page projet montrealrobotics.ca) publient la deuxième version d'Agentic Scene Policies (ASP), un cadre de contrôle robotique qui vise la généralisation zéro-shot, c'est-à-dire l'exécution d'instructions en langage naturel sur des objets jamais vus, sans entraînement spécifique. ASP unifie, dans un seul espace d'actions « agentique », la localisation des objets et les compétences du robot, via une interface d'outils exposée à un agent. La représentation de la scène en 3D repose sur un modèle vision-langage (VLM), et les compétences s'appuient sur des affordances au niveau des parties d'objets, comme la poignée d'un tiroir ou la fiche d'un chargeur. Cela permet des interactions zéro-shot telles que débrancher un chargeur ou ouvrir un tiroir. Les auteurs affirment que ASP surpasse systématiquement les principaux modèles VLA (vision-langage-action) en zéro-shot lors d'expériences réelles, et présentent une version mobile du cadre pour répondre à des requêtes à l'échelle d'une pièce. Le résumé ne donne ni chiffres de taux de réussite, ni noms des VLA comparés, ni détails sur le robot utilisé. Ces éléments sont à chercher dans le papier complet. L'intérêt tient au débat entre deux architectures. Les VLA détournent un VLM pour produire des actions de bout en bout, mais leur généralisation à de nouvelles instructions et à de nouveaux objets reste fragile. Les politiques modulaires, qui combinent représentation de scène, planification de mouvement et VLM, sont plus interprétables et donnent de bons résultats zéro-shot. Elles souffrent toutefois de deux faiblesses : une recherche d'objets purement sémantique, sans raisonnement spatial explicite, et des compétences limitées à la saisie et à la navigation de base. ASP s'attaque aux deux. Si l'avantage sur les VLA se confirme sur des protocoles indépendants, cela plaide pour des architectures hybrides, où un agent de langage orchestre des primitives géométriques robustes plutôt que de tout apprendre de bout en bout. Pour les intégrateurs, l'attrait est concret : un système modulaire se diagnostique, se corrige et s'étend en ajoutant des outils, sans réentraîner un modèle de plusieurs milliards de paramètres. Il faut cependant rester prudent. Il s'agit d'un travail académique, non d'un produit, et la comparaison dépend du choix des VLA de référence, de leur réglage et des tâches retenues. Les cadences, la fiabilité sur de longues séries et les modes de défaillance ne sont pas documentés dans le résumé. Ce travail s'inscrit dans la lignée des approches qui font piloter des robots par des VLM et des LLM, avec des cartes sémantiques 3D et des outils de saisie issus de la vision. En face, les VLA généralistes tels que Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure ont gagné en visibilité, avec une promesse de généralisation encore peu vérifiée hors des environnements d'entraînement. La publication de cette version 2 (une révision d'un papier d'abord soumis en septembre 2025) suggère un travail affiné après relecture. Les prochaines étapes probables sont des tests sur davantage d'objets et de scènes, des comparaisons plus larges avec les VLA récents et une extension de la version mobile à des tâches de longue durée.

RecherchePaper
1 source
2arXiv cs.RO 

Au-delà de la reconstruction : qu'est-ce qui compte dans la tokenisation d'actions pour les politiques robotiques ?

Les politiques robotiques autorégressives, dont les modèles vision-langage-action (VLA), convertissent des séquences de tokens discrets en commandes continues grâce à un « tokenizer » d'actions. Une équipe de chercheurs publie sur arXiv (2610.09170) ProAct, pour Predictable and Robust Action Tokenization, une méthode d'entraînement de ces tokenizers. Elle ne dépend d'aucune politique particulière et n'utilise que des jeux de données d'actions. Testée sur les benchmarks Robomimic, LIBERO et RoboTwin, avec plusieurs architectures de tokenizers, elle améliore le taux de réussite en rollout de 11,3 points de pourcentage en moyenne. Le gain atteint 21,8 points sur des VLA et 36,7 points en manipulation robotique réelle. Les résumés de ce type ne précisent pas toujours les tâches, les robots ou le nombre d'essais physiques. Il faudra donc lire l'article complet pour juger de la robustesse de ces chiffres. La plupart des tokenizers apprennent la correspondance entre tokens et actions par un objectif de reconstruction. Les auteurs montrent qu'une reconstruction suffisamment fidèle ne garantit pas une bonne politique. Deux autres propriétés comptent. La politique doit prédire les bons tokens face à des observations nouvelles. Et les tokens qu'elle prédit sans les avoir vus à l'entraînement doivent quand même se décoder en actions plausibles. Ni l'une ni l'autre n'est favorisée par la seule reconstruction. ProAct complète donc celle-ci pour améliorer la prévisibilité et la robustesse. Pour les équipes qui construisent des VLA, le message est concret : le tokenizer n'est pas un simple module de compression. C'est une interface de conception à part entière, qui doit équilibrer fidélité, prévisibilité et robustesse. Le gain le plus marqué en conditions réelles suggère aussi qu'une partie de l'écart entre démonstration et déploiement pourrait venir de ce maillon, et pas seulement de la taille des modèles ou du volume de données. Ce travail s'inscrit dans le courant des politiques qui discrétisent les actions pour réutiliser les architectures de modèles de langage, comme l'approche de tokenisation par compression popularisée avec les modèles de type Pi-0-FAST. Il rejoint les critiques sur les méthodes qui jugent un tokenizer à sa seule erreur de reconstruction. Le fait que ProAct soit indépendant de la politique et n'utilise que des données d'actions facilite son intégration dans des pipelines existants, sans réentraîner l'ensemble de la pile. Les concurrents sont les approches continues, notamment par diffusion ou flow matching, qui évitent la tokenisation. Aucun pilote industriel ni calendrier de publication de code n'est mentionné dans le résumé. Il s'agit pour l'instant d'une preuve de concept académique, dont l'adoption dépendra de la reproductibilité des résultats par d'autres laboratoires.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Mesurer les effets de la reconstruction des objets et des scènes dans l'évaluation de robots en réel-vers-simulation
3arXiv cs.RO 

Mesurer les effets de la reconstruction des objets et des scènes dans l'évaluation de robots en réel-vers-simulation

Des chercheurs publient sur arXiv (2610.00731) une étude qui mesure l'effet de la qualité de reconstruction des objets et de la scène sur la fidélité de l'évaluation robotique en simulation. L'équipe a bâti deux versions simulées d'une même cellule bimanuelle à partir des mêmes photos d'objets et de la même vidéo de scène. La version « authored » combine une géométrie d'objet à l'échelle métrique estimée, des textures projetées, des paramètres physiques définis manuellement et un splat de scène maison. La version de référence, dite « default », suit la recette open source courante : un maillage généré à partir d'une seule image, une physique par défaut du moteur et une scène en Gaussian splatting. Deux politiques ont été testées sur cinq tâches, soit dix paires tâche-politique. Chacune a été jouée vingt fois dans chaque reconstruction, tous les autres réglages étant figés, puis comparée aux mêmes essais réels notés par un évaluateur tiers. La corrélation de Pearson entre moyennes simulées et réelles atteint r = 0,90 pour la version authored, contre 0,51 pour la version default. L'erreur moyenne de score passe de 17,54 à 6,97 points de pourcentage, soit 10,56 points de moins. Ces chiffres touchent à une question centrale pour les équipes qui déploient des politiques VLA ou d'imitation : jusqu'où la simulation peut remplacer des essais réels, coûteux et peu répétables. Une corrélation de 0,51 ne permet guère de classer des politiques de façon fiable, alors que 0,90 commence à le permettre. Le résultat indique que l'écart sim-to-real dépend en grande partie de choix de reconstruction (échelle métrique, physique, fidélité visuelle) et pas seulement du simulateur. Pour un intégrateur ou un responsable de R&D, cela plaide pour investir dans la qualité des actifs avant de multiplier les runs simulés. Les limites sont nettes : un seul robot et une seule cellule, deux politiques, cinq tâches, dix points de comparaison seulement, ce qui rend l'intervalle de confiance de la corrélation large. Le travail de modélisation manuelle représente aussi un coût que l'étude ne chiffre pas, et l'amélioration vient d'un paquet de changements dont chaque composante n'est pas isolée. L'évaluation en simulation gagne du terrain à mesure que les politiques généralistes se multiplient et que l'évaluation sur robot réel devient le goulot d'étranglement. Les pipelines « real-to-sim » reposent de plus en plus sur le Gaussian splatting et sur des modèles génératifs image-vers-3D, dont les maillages sont rapides à produire mais souvent mal mis à l'échelle et physiquement approximatifs, ce que ce travail met en évidence. Les auteurs publient le harnais d'évaluation, les scores par essai, la configuration de chaque run ainsi que les actifs et scènes des deux reconstructions, ce qui permet à d'autres équipes de reproduire et d'étendre la comparaison. Les prochaines étapes naturelles seraient d'autres robots, davantage de politiques et une décomposition des gains par composante. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Assemblage robotique à contacts multiples dans la construction par politique de diffusion
4arXiv cs.RO 

Assemblage robotique à contacts multiples dans la construction par politique de diffusion

Des chercheurs ont publié sur arXiv (arXiv:2511.17774, version 3) une étude portant sur l'application de l'apprentissage par diffusion à l'assemblage robotique dans le secteur de la construction. Le cas d'usage retenu est l'assemblage tenon-mortaise en bois, une jonction à contact riche soumise à des contraintes de friction et de géométrie strictes, avec des jeux inférieurs au millimètre. Les politiques de diffusion sensori-motrices ont été entraînées à partir de démonstrations téléopérées collectées sur un poste de travail robotique industriel équipé de capteurs force/couple. L'évaluation s'est déroulée en deux phases : une baseline en conditions nominales et un test de robustesse avec des perturbations positionnelles aléatoires allant jusqu'à 10 mm, soit un ordre de grandeur au-delà de la tolérance d'assemblage. La politique la plus performante atteint 100 % de taux de succès en conditions nominales et 75 % en moyenne sous perturbation. Ce résultat est notable car il adresse directement un verrou industriel structurel : l'accumulation de tolérances dans la construction empêche depuis longtemps l'automatisation fiable des tâches d'assemblage à contact. Le fait qu'une politique diffusion parvienne à compenser des désalignements de 10 mm pour des jeux sub-millimétriques suggère que ces architectures apprennent implicitement une stratégie de compliance active via le retour d'effort, sans modélisation géométrique explicite. Pour un intégrateur industriel ou un bureau de méthodes, cela signifie que le sim-to-real gap sur des tâches de précision en construction pourrait être en partie résorbé par l'apprentissage par imitation couplé à la force/couple, sans recalibration manuelle systématique. L'assemblage tenon-mortaise n'est pas un choix anodin : cette technique millénaire est revenue en force dans la construction bois massive (CLT, charpente lamellée-croisée), un segment en forte croissance en Europe avec des acteurs comme Sœur Bois ou Blumer-Lehmann. Les politiques de diffusion appliquées à la robotique manipulatrice ont été popularisées par des travaux comme le Diffusion Policy de Chi et al. (2023, Columbia/Toyota) et sont désormais explorées par des labos comme Physical Intelligence (pi) avec Pi-0, ou par Boston Dynamics Research. Cette étude se distingue en ciblant explicitement la construction industrielle plutôt que la cuisine ou la logistique. La prochaine étape logique serait un déploiement en conditions chantier réelles, avec variation de matériaux et de géométries, ce que les auteurs n'ont pas encore testé.

UELe segment construction bois massive (CLT, charpente lamellée-croisée) est en forte croissance en Europe avec des acteurs comme Sœur Bois ou Blumer-Lehmann ; une automatisation fiable des assemblages à contact ouvrirait une voie d'industrialisation directement applicable sur les chantiers européens.

RecherchePaper
1 source