Aller au contenu principal
Un nouveau système d'IA aide les robots à transférer leur entraînement virtuel vers des tâches réelles
RechercheInteresting Engineering 

Un nouveau système d'IA aide les robots à transférer leur entraînement virtuel vers des tâches réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'Aston University et de l'University of Birmingham ont publié dans Scientific Reports une méthode d'entraînement robotique visant à réduire le "sim-to-real gap", ce fossé persistant entre les performances d'un robot en simulation et son comportement réel. L'approche, développée dans le cadre du projet REBELION financé par UK Research and Innovation, utilise un générateur de variations d'environnement piloté par IA : pendant la phase de simulation, le système introduit automatiquement des perturbations (bruit capteur, variabilité des matériaux, forces inattendues) pour entraîner le robot à des conditions plus proches du terrain. La validation expérimentale porte sur des tâches de manipulation et de découpe impliquant une interaction physique avec des matériaux, puis un ajustement avec un volume minimal de données réelles. Le cas d'usage mis en avant est le recyclage de batteries lithium-ion, où les robots doivent opérer autour de cellules endommagées ou potentiellement dangereuses, rendant les cycles de test physiques coûteux et risqués.

L'intérêt industriel est direct : la dépendance à de longs cycles de test en environnement réel est l'un des principaux freins au déploiement rapide de robots dans des lignes de production ou des ateliers de recyclage. En permettant de compresser l'essentiel de l'apprentissage en simulation tout en garantissant un transfert fiable avec peu de données réelles, cette approche pourrait raccourcir significativement les timelines d'intégration et réduire les coûts opérationnels pour les industriels. Elle valide aussi une hypothèse qui fait débat dans le secteur depuis plusieurs années : que le sim-to-real gap n'est pas une fatalité, mais un problème d'exposition à la variance pendant l'entraînement. La vision formulée par le Dr. Alireza Rastegarpanah, assistant professor en applied AI and robotics à Aston University, est celle de systèmes robotiques "plug-and-play", entraînés une fois en simulation et redéployés rapidement dans un nouveau contexte sans reconfiguration lourde. C'est une promesse ambitieuse, et les résultats publiés restent limités à un périmètre de tâches contrôlées ; aucun chiffre de performance comparative (taux de succès, cycles de recalibration) n'est rendu public dans la version relayée.

Le sim-to-real gap est un problème structurel documenté depuis les premières applications de reinforcement learning en robotique. Des acteurs comme Boston Dynamics, Agility Robotics ou encore Wandercraft (France, exosquelettes) utilisent des combinaisons de domain randomization et de transfert par imitation pour y répondre, avec des niveaux de maturité variables selon les tâches. Le projet REBELION s'inscrit dans un effort européen plus large sur l'automatisation du recyclage de batteries, filière en forte croissance avec l'essor des véhicules électriques. Les prochaines étapes annoncées par l'équipe visent à élargir la méthode à des environnements industriels plus incertains et à des applications en manufacturing avancé et opérations autonomes, sans calendrier précis communiqué.

Impact France/UE

La méthode du projet REBELION (financé UKRI, inscrit dans un effort européen) pourrait accélérer le déploiement de robots dans les filières EU de recyclage de batteries lithium-ion, secteur stratégique pour la transition électrique.

À lire aussi

Nouveau système robotique aide les humanoïdes à maîtriser l'acrobatie sans entraîner chaque mouvement
1Interesting Engineering 

Nouveau système robotique aide les humanoïdes à maîtriser l'acrobatie sans entraîner chaque mouvement

Des chercheurs ont présenté BeyondMimic, un système d'apprentissage en deux étapes permettant à des robots humanoïdes d'exécuter des mouvements agiles inspirés de l'humain, sans entraînement dédié à chaque geste. La première étape utilise de l'apprentissage par renforcement pour apprendre au robot à suivre une large gamme de mouvements humains, à partir d'environ 2,5 heures de données de capture de mouvement, avec une seule formulation de suivi, une structure de récompense commune et des hyperparamètres partagés plutôt qu'un réglage spécifique par mouvement. Le robot a ainsi appris des centaines de compétences : marche, course, équilibre sur une jambe, sauts, danse, gestes inspirés des arts martiaux, coups de pied retournés et roues. Vingt et un mouvements représentatifs ont ensuite été transférés avec succès sur un robot humanoïde physique. Lors d'une roue aérienne, le robot a atteint une accélération de pointe de 31 m/s² et une vitesse angulaire du bassin de 15,7 rad/s, des valeurs comparables à celles observées chez des athlètes humains entraînés. Une étude auprès de 77 participants a par ailleurs montré une préférence pour les mouvements générés par BeyondMimic par rapport à ceux du robot sans ce système. L'apport principal tient à la seconde étape : un modèle de diffusion latente, entraîné via un autoencodeur variationnel, apprend la distribution sous-jacente des trajectoires état-action plutôt que de simplement rejouer des séquences mémorisées. Un guidage par classifieur à l'inférence permet ensuite d'orienter le robot vers des objectifs non vus à l'entraînement, comme suivre une commande de joystick, naviguer vers des points de passage ou éviter des obstacles, sans réentraîner ni ajuster la politique de base. Cette capacité répond à une limite connue des systèmes de contrôle humanoïde actuels, souvent contraints à des fonctions de récompense spécifiques par tâche et à des transitions rigides entre compétences. Le résultat renforce l'hypothèse selon laquelle un transfert simulation-vers-réel robuste, combiné à une génération de mouvement compositionnelle, peut réduire la dépendance à un réglage manuel massif, un enjeu central pour les intégrateurs qui cherchent à déployer des humanoïdes polyvalents plutôt que des machines à gestes figés. BeyondMimic s'inscrit dans une compétition croissante autour des modèles de contrôle et des architectures vision-langage-action pour humanoïdes, aux côtés d'approches comme GR00T N2 de NVIDIA, Pi-0 de Physical Intelligence, Helix de Figure AI ou les itérations successives d'Optimus chez Tesla. Il s'agit à ce stade d'un résultat de recherche démontré en laboratoire sur un nombre limité de clips, et non d'un produit commercialisé ni d'un déploiement industriel ; aucun calendrier de transfert vers une plateforme commerciale n'est communiqué.

RecherchePaper
1 source
IA agents créent des terrains de jeu virtuels pour entraîner les robots
2Robohub 

IA agents créent des terrains de jeu virtuels pour entraîner les robots

Des chercheurs du MIT CSAIL et du Toyota Research Institute ont conçu SceneSmith, un système qui génère des scènes 3D réalistes pour entraîner des robots en simulation. Trois agents IA, tous pilotés par le même modèle vision-langage GPT-5.2, se répartissent le travail : un agent "designer" place les objets et l'agencement de la pièce, un agent "critique" évalue le réalisme du résultat, et un "orchestrateur" décide quand la scène est terminée avant de la charger dans un moteur physique. L'équipe, menée par le doctorant Nicholas Pfaff sous la direction de Russ Tedrake (chaire Toyota, CSAIL), a produit plus de 1300 scènes de restaurants, chambres, hôtels et garages, avec jusqu'à six fois plus d'objets par pièce que les méthodes précédentes. Cent espaces additionnels ont servi à tester automatiquement, via un agent VLM juge, la fiabilité de politiques de contrôle de robots pour des tâches comme poser un verre dans un évier ou déplacer une canette d'une étagère à une table. Le principal frein de la robotique généraliste reste la donnée : entraîner un robot physique à de nouvelles tâches en conditions réelles coûte cher en temps et en supervision. SceneSmith automatise la création de mondes virtuels assez variés pour que les compétences apprises en simulation se transfèrent au réel, un défi connu sous le nom de sim-to-real. Pour les intégrateurs, l'intérêt est direct : tester des politiques de contrôle dans des scènes générées automatiquement plutôt que construites pièce par pièce à la main, avant tout essai physique. Le résultat illustre aussi une tendance plus large : des modèles vision-langage entraînés sur des corpus internet encodent assez de connaissance spatiale pour composer des environnements crédibles sans règles d'agencement écrites à la main, signe que les VLM à grande échelle deviennent des briques réutilisables au-delà de la perception ou du langage. À nuancer : il s'agit d'un système testé en simulation, sans robot physique déployé, et la créativité des arrangements, saluée par les auteurs, reste une appréciation qualitative plutôt qu'une métrique chiffrée. Ces travaux prolongent les recherches du laboratoire de Russ Tedrake au CSAIL sur la génération procédurale de scènes, un axe où les moteurs physiques ont progressé plus vite que le contenu réaliste à y faire tourner. Le partenariat avec le Toyota Research Institute s'inscrit dans les efforts du constructeur pour accélérer l'apprentissage de robots domestiques et industriels sans multiplier les essais physiques coûteux. SceneSmith rejoint la vague d'outils de génération de données synthétiques et de jumeaux numériques que les laboratoires de robotique développent pour combler l'écart entre simulation et réalité. Aucun calendrier de déploiement sur un robot commercial n'est annoncé : l'outil reste un système de recherche en simulation, dont la prochaine étape logique serait de vérifier que les politiques entraînées sur ces scènes se transfèrent bien à des robots physiques.

RecherchePaper
1 source
Le nouveau système de Galbot aide les robots humanoïdes à bouger naturellement pendant une conversation
3Interesting Engineering 

Le nouveau système de Galbot aide les robots humanoïdes à bouger naturellement pendant une conversation

Galbot, entreprise chinoise de robotique, a dévoilé RoboGesture, un framework destiné à générer en temps réel des gestes synchronisés avec la parole pour les robots humanoïdes. Développé avec des chercheurs de l'université Tsinghua, de l'université de Pékin, du Beijing Institute of Technology, du Harbin Institute of Technology et du Shanghai Qi Zhi Institute, le système sera présenté à l'European Conference on Computer Vision (ECCV) 2026. Annoncé le 5 septembre 2026 sur le compte X de Galbot, RoboGesture ferme la boucle écoute-réponse-geste en environ deux secondes. Le système convertit la parole entrante en tokens audio via le codec Mimi, puis analyse le signal à plusieurs niveaux : les caractéristiques de bas niveau captent le rythme et les variations de ton, tandis que les couches plus profondes extraient le sens sémantique. La composante sémantique a été entraînée sur 300 catégories de gestes. Les signaux sont ensuite transmis à un modèle de génération de mouvement fondé sur un transformer à diffusion, qui produit des trajectoires dans un espace de mouvement continu plutôt que des commandes fixes, permettant un enchaînement fluide des gestes. Cette annonce vise une limite récurrente des robots humanoïdes commerciaux : des mouvements souvent perçus comme mécaniques, répétitifs ou déconnectés du discours, un défaut qui nuit à l'acceptation des robots dans des rôles d'accueil, de guide ou d'assistance sociale. Les chercheurs affirment s'attaquer à trois obstacles concrets : le manque de données d'entraînement, la difficulté à relier la parole au mouvement approprié, et les risques de sécurité lorsque des gestes générés par IA sont transférés à un robot physique. Ils identifient également un problème baptisé « éclipse de modalité », où le modèle se met à répéter des gestes issus de ses mouvements précédents au lieu de réagir à la nouvelle parole ; une méthode de guidage nommée Anti-Inertia classifier-free guidance masking est présentée comme correctif. Ces travaux restent toutefois au stade de la recherche académique : la démonstration diffusée sur X ne constitue pas une validation indépendante, et aucun chiffre de déploiement, de coût ou de robustesse en conditions réelles n'est fourni, ce qui invite à la prudence sur la portée réelle du système hors laboratoire. Galbot s'inscrit dans la vague des start-up chinoises de robotique généraliste qui, comme leurs homologues américaines telles que Figure avec son modèle Figure 03, Tesla avec Optimus, ou les initiatives fondées sur des modèles VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, cherchent à doter les humanoïdes de capacités de manipulation et de perception avancées. RoboGesture se distingue en ciblant spécifiquement la communication non verbale plutôt que la manipulation ou la locomotion, un axe encore peu exploré par une concurrence surtout focalisée sur les tâches industrielles ou logistiques. La présentation prévue à l'ECCV 2026, conférence académique de référence en vision par ordinateur, signale une publication scientifique plutôt qu'un lancement commercial : l'article ne mentionne ni pilote annoncé, ni calendrier de déploiement, ni partenaire industriel identifié à ce stade.

RecherchePaper
1 source
Les agents IA créent des terrains de jeu virtuels pour fournir aux robots des données d'entraînement essentielles
4MIT News Robotics 

Les agents IA créent des terrains de jeu virtuels pour fournir aux robots des données d'entraînement essentielles

Des chercheurs du MIT CSAIL et du Toyota Research Institute ont présenté SceneSmith, un système qui génère des environnements 3D synthétiques pour entraîner des robots en simulation. L'outil s'appuie sur trois agents IA reposant chacun sur GPT-5.2, un modèle vision-langage (VLM) entraîné sur du texte et des images à grande échelle : un agent "designer" génère les éléments de la scène (murs, objets, mobilier), un agent "critique" évalue le réalisme du résultat, et un "orchestrateur" gère les allers-retours entre les deux jusqu'à validation finale. Les chercheurs ont produit plus de 1300 scènes de ce type, couvrant des restaurants, chambres, hôtels et garages, avec jusqu'à six fois plus d'objets par scène que les méthodes précédentes. Sur simple requête textuelle ("un garage avec une voiture, un établi, des pneus empilés dans un coin et une échelle contre le mur"), le système produit une scène directement chargeable dans un moteur de simulation physique. Nicholas Pfaff, doctorant au MIT EECS et auteur principal de l'étude aux côtés de Russ Tedrake, professeur au MIT et chercheur principal au CSAIL, note que le système a improvisé des arrangements créatifs sans instruction explicite en ce sens. Dans une phase de test, les chercheurs ont généré 100 environnements uniques pour évaluer des politiques d'action robotiques (des plans de tâches comme déposer une tasse dans l'évier ou déplacer une canette d'une étagère à une table). Un agent VLM a jugé chaque tentative, et ses verdicts ont concordé avec l'avis humain dans plus de 99% des cas. L'enjeu principal reste le goulot d'étranglement des données pour l'apprentissage robotique : entraîner physiquement un robot à chaque tâche, dans chaque environnement, est coûteux en temps et en main d'œuvre. La simulation est identifiée depuis des années comme solution potentielle, mais butait jusqu'ici sur la pauvreth et le manque de diversité du contenu généré, loin de la richesse du monde réel. Si les résultats de validation à 99% se confirment sur d'autres benchmarks, SceneSmith apporterait un début de réponse concrète à ce problème en permettant de tester et filtrer les politiques robotiques en simulation avant tout déploiement physique, réduisant d'autant les essais-erreurs coûteux sur du matériel réel. Pour les intégrateurs et équipes de R&D robotique, cela ouvre la possibilité de valider un plus grand nombre de comportements avant la mise en service, un enjeu classique de l'écart entre démonstration et réalité opérationnelle. Le projet s'inscrit dans la continuité des travaux du laboratoire de Russ Tedrake au CSAIL sur la simulation physique et l'apprentissage robotique, en partenariat avec le Toyota Research Institute, acteur historiquement actif sur la robotique domestique et industrielle. La question de la validité de ces mondes virtuels, à savoir dans quelle mesure leur réalisme se traduit effectivement par un transfert réussi vers le monde physique (le fameux problème du "sim-to-real"), reste ouverte : les chercheurs indiquent avoir engagé des vérifications supplémentaires sur ce point, sans que les détails de cette validation ne soient encore précisés.

RecherchePaper
1 source