Aller au contenu principal
FetchMan : politiques de loco-manipulation humanoïde visuelle apprises par simulation
RecherchearXiv cs.RO 

FetchMan : politiques de loco-manipulation humanoïde visuelle apprises par simulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2608.17027v1, août 2026) FetchMan, un système d'apprentissage de politiques de loco-manipulation humanoïde entraîné entièrement en simulation avant transfert vers le réel. Le pipeline combine plus de 150 000 scènes simulées, un clonage comportemental initial suivi d'un affinage par apprentissage par renforcement via une méthode appelée Flow-GRPO, appliquée sur une récompense unique et éparse. Les chercheurs déploient la politique en zero-shot, sans aucune donnée réelle, sur un robot humanoïde Unitree G1 : la tâche consiste à marcher vers un objet cible puis à le saisir dans des scènes jamais vues à l'entraînement, avec un taux de réussite de 73,3% sur des scénarios à objet unique. L'équipe publie également FetchMan-Bench, un benchmark de simulation destiné à évaluer ce type de politiques, et présente une première extension vers l'entraînement multi-objets.

Le résultat le plus significatif pour le secteur n'est pas le taux de succès en lui-même, mais le constat méthodologique : le clonage de démonstrations synthétiques, quelle que soit la quantité de données injectée, plafonne à des performances limitées et ne peut être compensé par plus de volume. Seul l'ajout d'apprentissage par renforcement permet de dépasser ce plafond. Cette observation nuance l'hypothèse largement répandue chez les fournisseurs de politiques génératives type VLA (vision-langage-action) selon laquelle la mise à l'échelle des données de démonstration suffit à elle seule à améliorer la généralisation. Pour les intégrateurs et décideurs qui évaluent des piles logicielles pour humanoïdes, cela suggère qu'une phase de fine-tuning par renforcement en simulation, et non uniquement plus de données d'imitation, reste nécessaire pour atteindre une manipulation robuste face à des scènes inédites.

Le sim-to-real est déjà la norme pour la locomotion humanoïde, mais son extension à la manipulation mobile combinant marche, équilibre et préhension restait un point de friction, faute de données réelles suffisantes pour ces séquences complexes. FetchMan s'inscrit dans un paysage concurrentiel où plusieurs laboratoires développent des politiques génératives concurrentes, dont Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, généralement entraînées avec des volumes massifs de démonstrations réelles ou synthétiques. En choisissant le Unitree G1 comme plateforme de test et en publiant son benchmark, l'équipe pose une première étape vers des politiques généralistes de loco-manipulation capables de gérer plusieurs objets, avec pour prochaine étape annoncée l'élargissement de l'entraînement multi-objets à plus grande échelle.

À lire aussi

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
1arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
2arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Dex-X : manipulation dextérique visuo-tactile apprise à partir de vidéos humaines par interaction simulée
3arXiv cs.RO 

Dex-X : manipulation dextérique visuo-tactile apprise à partir de vidéos humaines par interaction simulée

Un article publié sur arXiv (arXiv:2609.07747v2) présente Dex-X, un framework qui entraîne des politiques de manipulation dextre visuo-tactile à partir de simples vidéos humaines monoculaires, sans collecte de données sur robot réel. Le système reconstruit en simulation les interactions main-objet filmées pour générer une supervision tactile physiquement cohérente, absente des vidéos d'origine, puis entraîne une politique "enseignante" distillée en une politique déployable utilisant nuages de points et capteurs tactiles. Sur une plateforme main-bras dextre, le transfert simulation-réel s'effectue en zero-shot sur des tâches de préhension et de manipulation d'outils à contact riche. La politique enseignante atteint 65,9% de réussite moyenne sur six catégories de tâches en simulation ; une fois distillée, elle affiche 93% de réussite en prise de cube réelle mais seulement 53% sur la tâche plus complexe de nettoyage de table, avec une généralisation zero-shot constatée sur des objets de géométries inédites. Le travail répond à une question clé pour le secteur : peut-on entraîner des politiques de manipulation dextre déployables à partir des vidéos humaines disponibles à l'échelle d'Internet, sans téléopération coûteuse pour collecter des données robot. Ces vidéos manquent justement du retour tactile indispensable aux tâches à contact riche, d'où l'idée de la simulation comme "moteur de complétion tactile", susceptible de réduire la dépendance des laboratoires aux campagnes de collecte coûteuses. L'écart entre 93% sur une tâche simple et 53% sur une tâche complexe rappelle toutefois que le sim-to-real reste loin d'être résolu à mesure que la manipulation se complexifie, une nuance qui vaut aussi pour les discours entourant les modèles visuo-langage-action génériques comme Pi-0 ou GR00T N2. La manipulation dextre multi-degrés-de-liberté reste un point dur de la robotique, plus exigeante en retour tactile que la préhension par pince industrielle classique, et les approches existantes reposent surtout sur la téléopération ou sur une simulation pure limitée par l'écart de réalisme physique avec le monde réel. Dex-X se positionne comme une voie intermédiaire, exploitant les vidéos humaines disponibles en masse plutôt que des démonstrations robot dédiées. L'article reste à ce stade une contribution académique publiée en version 2 sur arXiv, sans plateforme commerciale ni calendrier de déploiement annoncé, les auteurs indiquant vouloir étendre l'évaluation à davantage de tâches et de géométries d'objets.

RecherchePaper
1 source
OASIS : de la collecte de données en simulation à la loco-manipulation humanoïde en conditions réelles
4arXiv cs.RO 

OASIS : de la collecte de données en simulation à la loco-manipulation humanoïde en conditions réelles

Une équipe de chercheurs publie sur arXiv (juin 2026) le framework OASIS, une approche pour entraîner des robots humanoïdes à des tâches de loco-manipulation, combinaison de locomotion et de manipulation d'objets, en s'appuyant exclusivement sur des données de simulation. Le système reconstruit automatiquement des assets 3D réalistes à partir d'images du monde réel via un modèle génératif, puis collecte des trajectoires par télé-opération dans ce simulateur. Ces trajectoires sont ensuite augmentées par randomisation de domaine : variations d'éclairage, de textures et de configuration environnementale. Une politique visuomotrice hiérarchique, entraînée sur ces données simulées, est déployée en zero-shot sur un robot humanoïde physique, sans fine-tuning sur données réelles. Les résultats publiés indiquent que cette politique dépasse, sur la majorité des tâches testées, les performances d'une politique entraînée sur des données de télé-opération réelle. Ce résultat, à prendre avec prudence, le preprint n'étant pas encore soumis à peer review, va à contre-courant d'une hypothèse largement répandue : que la qualité des données terrain serait irremplaçable pour la manipulation fine. Le principal facteur explicatif avancé par les auteurs est la couverture plus large des variations d'éclairage et d'environnement dans le rendu simulé, que la collecte physique peine à égaler à grande échelle. Si le résultat se confirme, il soulage considérablement le goulot d'étranglement de la collecte terrain, qui implique aujourd'hui des resets manuels coûteux et une infrastructure dédiée par tâche. La loco-manipulation reste l'un des défis les plus complexes en robotique humanoïde, car elle exige une coordination simultanée du contrôle de marche et de la manipulation d'objets. Des plateformes comme Figure 03, l'Optimus Gen 3 de Tesla ou l'Atlas de Boston Dynamics cherchent des solutions via des approches diverses : imitation learning sur données réelles (pi-0 de Physical Intelligence), politiques VLA (GR00T N2 de Nvidia) ou RL massivement simulé (Unitree). OASIS positionne la simulation augmentée comme alternative crédible à la télé-opération physique, ce qui pourrait accélérer le bootstrapping de nouvelles tâches sans mobiliser de cellules robotiques dédiées. Les prochaines étapes attendues sont une évaluation sur un spectre plus large de tâches industrielles et une soumission à une conférence avec évaluation par les pairs.

RechercheOpinion
1 source