Aller au contenu principal
RecherchearXiv cs.RO 

BiGym 2.0 : évaluation de politiques apprises et développées par des agents pour la manipulation domestique humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

BiGym 2.0, publié sur arXiv (2610.07594) par l'équipe derrière le dépôt swirl-uk/BiGym2, adapte le benchmark de manipulation bimanuelle BiGym au robot humanoïde Unitree G1. La suite couvre 20 tâches domestiques, toutes pilotées par un contrôleur whole-body unifié, utilisé aussi bien pour la collecte de démonstrations que pour l'évaluation. Chaque tâche fournit 60 démonstrations humaines natives, enregistrées en réalité virtuelle, avec vues multi-caméras synchronisées et traces d'exécution du corps entier. Quatre familles de méthodes sont comparées, avec les mêmes vues embarquées, la même proprioception et le même contrôleur : fine-tuning de modèles vision-langage-action (VLA), apprentissage par imitation, apprentissage par renforcement guidé par démonstrations, et agents de codage partant de zéro, auxquels on accorde le budget d'interactions d'un apprentissage par renforcement en ligne. Environnements, démonstrations et traces d'évaluation sont publiés en open source.

Sur la moyenne de neuf tâches retenues pour la comparaison, le fine-tuning de VLA obtient le meilleur score. Les programmes écrits par des agents de codage dépassent toutefois toutes les bases de référence d'apprentissage par renforcement guidé par démonstrations sur cette même moyenne, et dominent sur l'atteinte bimanuelle. Les limites restent nettes : l'empilement entre espaces de travail distincts n'est pas résolu, π0.5 reste faible sur la tâche pick-box, et le transport multi-objets pénalise l'imitation, le renforcement guidé et les agents de codage.

L'intérêt est double pour les intégrateurs et les équipes de recherche. D'une part, le résultat tempère l'idée d'une manipulation domestique humanoïde déjà acquise : quand le bras doit agir pendant que le corps s'équilibre, fait un pas ou change de posture, les tâches longues et à plusieurs objets restent hors de portée des méthodes actuelles, y compris des VLA. D'autre part, la performance des programmes générés par agents, sans démonstrations, suggère une voie concurrente de l'apprentissage de politiques, à surveiller. Le fait que toutes les méthodes partagent observations et contrôleur rend la comparaison plus lisible que les démonstrations isolées, mais il s'agit de simulation : le transfert vers le matériel réel n'est pas évalué ici, et les scores détaillés ne figurent pas dans le résumé.

BiGym, introduit initialement pour la manipulation mobile bimanuelle sur un robot à base roulante, sert de référence aux travaux sur les VLA et l'imitation. Le passage au G1, plateforme humanoïde accessible largement diffusée en recherche, rapproche le benchmark des modèles de la famille π0.5 de Physical Intelligence, déjà évalués ici. Les suites possibles tiennent à l'ouverture des données : d'autres laboratoires pourront y confronter leurs VLA ou leurs agents de codage, et l'écart sur l'empilement et le transport multi-objets servira de cible aux prochains travaux.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
1arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
FetchMan : politiques de loco-manipulation humanoïde visuelle apprises par simulation
2arXiv cs.RO 

FetchMan : politiques de loco-manipulation humanoïde visuelle apprises par simulation

Une équipe de chercheurs publie sur arXiv (2608.17027v1, août 2026) FetchMan, un système d'apprentissage de politiques de loco-manipulation humanoïde entraîné entièrement en simulation avant transfert vers le réel. Le pipeline combine plus de 150 000 scènes simulées, un clonage comportemental initial suivi d'un affinage par apprentissage par renforcement via une méthode appelée Flow-GRPO, appliquée sur une récompense unique et éparse. Les chercheurs déploient la politique en zero-shot, sans aucune donnée réelle, sur un robot humanoïde Unitree G1 : la tâche consiste à marcher vers un objet cible puis à le saisir dans des scènes jamais vues à l'entraînement, avec un taux de réussite de 73,3% sur des scénarios à objet unique. L'équipe publie également FetchMan-Bench, un benchmark de simulation destiné à évaluer ce type de politiques, et présente une première extension vers l'entraînement multi-objets. Le résultat le plus significatif pour le secteur n'est pas le taux de succès en lui-même, mais le constat méthodologique : le clonage de démonstrations synthétiques, quelle que soit la quantité de données injectée, plafonne à des performances limitées et ne peut être compensé par plus de volume. Seul l'ajout d'apprentissage par renforcement permet de dépasser ce plafond. Cette observation nuance l'hypothèse largement répandue chez les fournisseurs de politiques génératives type VLA (vision-langage-action) selon laquelle la mise à l'échelle des données de démonstration suffit à elle seule à améliorer la généralisation. Pour les intégrateurs et décideurs qui évaluent des piles logicielles pour humanoïdes, cela suggère qu'une phase de fine-tuning par renforcement en simulation, et non uniquement plus de données d'imitation, reste nécessaire pour atteindre une manipulation robuste face à des scènes inédites. Le sim-to-real est déjà la norme pour la locomotion humanoïde, mais son extension à la manipulation mobile combinant marche, équilibre et préhension restait un point de friction, faute de données réelles suffisantes pour ces séquences complexes. FetchMan s'inscrit dans un paysage concurrentiel où plusieurs laboratoires développent des politiques génératives concurrentes, dont Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, généralement entraînées avec des volumes massifs de démonstrations réelles ou synthétiques. En choisissant le Unitree G1 comme plateforme de test et en publiant son benchmark, l'équipe pose une première étape vers des politiques généralistes de loco-manipulation capables de gérer plusieurs objets, avec pour prochaine étape annoncée l'élargissement de l'entraînement multi-objets à plus grande échelle.

RecherchePaper
1 source
Diagnostic et atténuation des a priori de la main induits par la politique dans la manipulation humanoïde à deux bras
3arXiv cs.RO 

Diagnostic et atténuation des a priori de la main induits par la politique dans la manipulation humanoïde à deux bras

Une équipe de recherche publie sur arXiv (2608.11769v1, août 2026) un diagnostic du comportement des politiques vision-langage-action (VLA) pilotant des humanoïdes à deux bras. Le travail isole un biais jusque-là peu quantifié : le choix de la main utilisée pour saisir un objet dépend fortement de la posture initiale des bras, un effet baptisé "policy-induced hand prior" et mesuré via trois métriques inédites (HandPriorScore, biais résiduel de main, réactivité à la cible). Testé sur plusieurs politiques et 17 configurations initiales, le protocole montre qu'une même pose produit des taux de réussite très variables selon la politique, et qu'une même politique fluctue fortement selon la pose ; les caméras de poignet influencent aussi ce choix. Élargir la couverture des poses à l'entraînement améliore nettement la robustesse. Cette étude compte parce qu'elle fragilise une hypothèse centrale du secteur : qu'un score de réussite agrégé suffit à attester la robustesse d'une politique VLA face aux variations de posture initiale. Les auteurs montrent que ce chiffre global masque des échecs localisés et des choix de main inappropriés, invisibles dans les benchmarks usuels. Pour les intégrateurs qui évaluent des politiques de manipulation avant déploiement industriel, le message est direct : auditer le comportement pose par pose, pas seulement la moyenne. L'étude isole aussi un levier concret et corrigeable, la configuration initiale des bras, ouvrant la voie à un entraînement ciblé plutôt qu'à un simple ajout massif de données. Ce travail s'inscrit dans la vague actuelle de recherche sur les politiques généralistes de manipulation pour humanoïdes, domaine où l'écart entre démonstrations médiatisées et fiabilité reproductible reste une critique récurrente adressée aux laboratoires du secteur. Plutôt qu'un nouveau modèle, les auteurs livrent un cadre d'audit réutilisable et une piste d'atténuation, l'élargissement ciblé de la couverture des poses initiales. Ils précisent aussi que l'apport de données réelles ou auxiliaires n'est pas systématiquement bénéfique : son effet dépend de la couverture des poses, de la part de simulation et de la disponibilité des observations visuelles. Les évaluations restant majoritairement simulées, la question du transfert vers des déploiements réels demeure ouverte.

RechercheActu
1 source
LTLDiff : génération de données et politiques de diffusion guidées par la LTL finie pour la manipulation multi-agents
4arXiv cs.RO 

LTLDiff : génération de données et politiques de diffusion guidées par la LTL finie pour la manipulation multi-agents

LTLDiff, un cadre combinant logique temporelle linéaire finie (LTLf) et politiques de diffusion pour la manipulation robotique multi-agents, a été présenté dans un article déposé sur arXiv (arXiv:2609.11043v1). Pour chaque tâche, une formule LTLf est apprise à partir d'instructions en langage naturel via un grand modèle de langage, puis convertie en arbre syntaxique abstrait afin de produire un vecteur d'embedding de dimension fixe. Cet embedding conditionne à la fois la génération de démonstrations et l'entraînement de la politique de diffusion, dans le but de forcer des trajectoires respectant l'ordre et la coordination attendus entre agents. Les auteurs rapportent des taux de réussite supérieurs à une base de référence sur leurs tâches de test, sans préciser de chiffres exacts, de nombre de robots impliqués, ni s'il s'agit de simulation ou de matériel réel. L'intérêt tient au problème visé : les politiques de diffusion, efficaces pour imiter des démonstrations isolées, se désynchronisent souvent, inversent l'ordre des actions ou échouent à coordonner plusieurs agents dès qu'une tâche exige une interaction simultanée ou séquentielle stricte. En ajoutant une couche de spécification logique et symbolique à l'apprentissage génératif, LTLDiff s'attaque à une faiblesse connue des approches de bout en bout de type VLA, qui peinent à garantir un séquencement fiable. Pour les intégrateurs qui envisagent des cellules multi-bras ou de la manipulation collaborative en logistique, ce travail illustre un retour des méthodes formelles pour combler les lacunes de fiabilité des modèles purement appris, plutôt que de tout miser sur l'échelle des données. LTLDiff s'inscrit dans une recherche académique qui marie logique temporelle et apprentissage de politiques, à distance de la course commerciale des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, tous fondés sur l'échelle des données plutôt que sur des contraintes symboliques explicites. Contrairement à ces annonces produits, LTLDiff reste une publication scientifique sans partenaire industriel ni déploiement annoncé, et ses résultats se limitent à des comparaisons internes avec une base de référence sur des tâches définies par les auteurs eux-mêmes. Aucun acteur français ou européen n'apparaît dans cette étude. Les suites attendues pour ce type de travaux incluent l'extension à un plus grand nombre d'agents et une validation sur du matériel réel.

RecherchePaper
1 source