Aller au contenu principal
Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement
FR/EU ecosystemeInteresting Engineering 

Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement
▶ Voir sur YouTube

Mimic Robotics, société suisse de robotique physique, a dévoilé FLUX-mimic, un modèle vidéo-action de nouvelle génération développé avec Black Forest Labs, capable d'enseigner à des robots industriels des tâches de manipulation fine à partir de simples démonstrations vidéo. Le système s'appuie sur FLUX 3, le modèle de génération vidéo de Black Forest Labs, associé à un décodeur d'actions qui traduit les prédictions visuelles en mouvements robotiques exécutables. Selon Mimic Robotics, FLUX-mimic peut être affiné pour certaines tâches avec seulement 30 minutes de démonstrations robotiques, contre 30 heures ou plus pour les pipelines d'apprentissage conventionnels, un écart présenté par l'entreprise elle-même et donc à prendre avec la prudence habituelle réservée aux chiffres communiqués par le fournisseur. La technologie est actuellement déployée chez le constructeur automobile Audi, dans le cadre d'une évaluation portant sur l'automatisation de tâches à haute dextérité impliquant des matériaux flexibles et une manipulation fine.

Cette annonce s'inscrit dans un débat plus large sur la viabilité des modèles vidéo-action (VAM) face aux modèles vision-langage-action (VLA) désormais dominants, à l'image de Pi-0 ou GR00T N2. Contrairement à ces derniers, pré-entraînés sur des paires image-texte statiques et devant apprendre la physique quasi exclusivement via des démonstrations robotiques coûteuses, FLUX-mimic part d'un modèle vidéo déjà entraîné à grande échelle sur la dynamique des objets et des mouvements, ce qui réduirait drastiquement le volume de données spécifiques à collecter. Si la promesse se vérifie en production, elle répond directement à l'un des principaux obstacles à la commercialisation de la robotique industrielle par apprentissage: le coût et la lenteur de la collecte de démonstrations pour chaque nouvelle tâche. Une réduction du cycle de déploiement de plusieurs mois à quelques semaines, telle qu'annoncée, changerait significativement le calcul économique pour les intégrateurs face à des tâches variables et peu standardisées, typiquement délaissées par l'automatisation classique programmée manuellement.

FLUX-mimic prolonge les travaux antérieurs de Mimic Robotics sur les modèles vidéo-action, avec une architecture désormais pensée spécifiquement pour l'IA physique en environnement industriel. Le partenariat avec Audi, dont les usines affichent déjà un fort taux d'automatisation, sert de banc d'essai pour mesurer si ces systèmes d'apprentissage tiennent la route hors laboratoire, un test que beaucoup d'approches VLA ou VAM concurrentes n'ont pas encore passé à cette échelle. Les deux partenaires évoquent des perspectives d'extension à d'autres opérations de fabrication et de logistique, sans toutefois communiquer de calendrier précis ni de métriques de performance en production, ce qui place pour l'instant cette collaboration au stade du pilote d'évaluation plutôt que du déploiement industriel validé.

Impact France/UE

Audi teste FLUX-mimic dans ses usines allemandes pour automatiser des tâches de manipulation fine, un cas concret d'adoption industrielle en Europe qui pourrait influencer d'autres constructeurs automobiles de l'UE si le pilote se confirme.

À lire aussi

Des robots différents peuvent apprendre à effectuer des tâches sans nouveau code
1New Atlas Robotics 

Des robots différents peuvent apprendre à effectuer des tâches sans nouveau code

Des chercheurs de l'EPFL ont développé une méthode permettant à des robots de morphologies différentes d'apprendre des tâches les uns des autres sans réécriture de code. L'approche exploite une représentation abstraite de la tâche, dissociée de la cinématique propre à chaque plateforme, ce qui permet à un robot à bras articulé d'acquérir un comportement démontré par un robot quadrupède ou à base mobile, par exemple. Aucune date de publication ni de chiffres de performance (taux de succès, degrés de liberté, temps d'entraînement) ne sont disponibles dans la communication initiale. L'enjeu industriel est significatif : aujourd'hui, chaque déploiement d'un nouveau robot dans une cellule automatisée implique un cycle complet de programmation ou de fine-tuning, ce qui représente des semaines d'intégration et un coût élevé. Si une telle méthode de transfert inter-embodiment se confirme à l'échelle, elle réduirait drastiquement le temps de mise en production, notamment dans les environnements multi-robots hétérogènes comme les entrepôts ou les lignes d'assemblage flexibles. Cela rejoint les travaux récents sur les politiques cross-embodiment portés par des modèles comme pi-0 (Physical Intelligence) ou RT-X (Google DeepMind), qui cherchent eux aussi à généraliser au-delà d'une seule plateforme. L'EPFL abrite plusieurs laboratoires actifs en apprentissage robotique, dont le Biorobotics Lab et le Computational Robot Design & Fabrication Lab. Cette annonce s'inscrit dans une tendance plus large où la recherche européenne cherche à rivaliser avec les efforts américains et chinois sur l'apprentissage par imitation et le transfert de politiques. L'article source reste un teaser sans accès au papier complet ni aux benchmarks, ce qui rend toute évaluation des performances prématurée.

UEL'EPFL positionne la recherche européenne sur le transfert inter-embodiment face aux initiatives américaines (pi-0, RT-X), mais sans papier ni benchmark publiés, l'impact industriel reste à confirmer.

FR/EU ecosystemePaper
1 source
Vidéo : Hugging Face dévoile un minirobot en forme de canard capable de marcher, apprendre et patiner
2Interesting Engineering 

Vidéo : Hugging Face dévoile un minirobot en forme de canard capable de marcher, apprendre et patiner

Hugging Face a présenté Microduck, un petit robot bipède open source en forme de canard, développé avec l'entreprise française Pollen Robotics. Vendu 399 dollars, l'appareil doit commencer à être livré avant Noël 2026. Haut de 25 centimètres pour un poids inférieur à 800 grammes, Microduck embarque 15 moteurs, une caméra, un petit capteur de profondeur et deux centrales inertielles (IMU). Son bec articulé lui permet de saisir des objets, combinant locomotion et manipulation simple. Le robot sait marcher, s'asseoir, s'accroupir, se relever après une chute et même faire du roller skate. Il est livré avec des comportements pré-entraînés utilisables via une manette de jeu ou en suivant un point laser, mais ceux-ci ne sont qu'un point de départ : le logiciel complet (contrôle, simulation, apprentissage par renforcement, transfert sim-to-real) est publié en open source via deux dépôts distincts, l'un pour le SDK et le pilotage du robot, l'autre dédié à l'entraînement par renforcement. Ce lancement illustre une approche différente de la course aux humanoïdes dominée par des acteurs comme Figure, Tesla (Optimus) ou Physical Intelligence (Pi-0) : plutôt que viser des déploiements industriels à grande échelle, Hugging Face et Pollen Robotics misent sur l'accessibilité pour démocratiser l'expérimentation en IA physique. La taille réduite et la légèreté de Microduck rendent l'apprentissage par renforcement praticable sur un bureau ou en salle de classe, un processus coûteux et risqué sur des robots de taille humaine. La capacité de récupération après chute réduit aussi le besoin d'intervention manuelle entre deux essais, un point pratique souvent sous-estimé dans les démonstrations de recherche. Pour les intégrateurs et chercheurs, l'intérêt réside moins dans les prouesses physiques du robot que dans l'accès à une pile logicielle complète et ouverte pour tester le transfert simulation-vers-réel, un défi toujours non résolu de façon fiable en robotique malgré les progrès des modèles VLA à grande échelle. Ce lancement s'inscrit dans l'expansion des efforts robotiques de Hugging Face, qui cherche à étendre son modèle open source au-delà du logiciel vers le matériel physique, après d'autres initiatives de plateformes robotiques low-cost. Pollen Robotics, société française déjà connue pour ses travaux en robotique open source, apporte son expertise en conception matérielle et logicielle à ce projet. Microduck se positionne aussi comme un outil pour l'expérimentation multi-robots, avec des scénarios évoqués comme des courses ou du football entre plusieurs unités, permettant d'étudier la robotique multi-agents sans recourir à des robots humanoïdes coûteux. Le produit reste pour l'instant au stade de l'annonce, avec une commercialisation effective attendue d'ici la fin de l'année, et son adoption réelle par la communauté des développeurs et chercheurs déterminera si cette approche accessible peut réellement accélérer la recherche en apprentissage physique.

UEPollen Robotics, entreprise française, co-développe le matériel et le logiciel de Microduck avec Hugging Face, renforçant la place de la France dans la robotique open source accessible.

FR/EU ecosystemeActu
1 source
Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs
3arXiv cs.RO 

Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs

Des chercheurs ont publié en juin 2026 (arXiv:2606.18747) un système permettant au robot humanoïde Pepper de générer des gestes co-verbaux naturels à l'exécution, sans recours à des animations préprogrammées. L'architecture combine ChatGPT pour la génération de code gestuel en langage naturel, couplée à un pipeline d'apprentissage par renforcement à partir de retours humains (RLHF) appliqué de manière itérative. Des utilisateurs évaluent les gestes produits par Pepper lors d'une étude comparative, ces préférences servant de signal de récompense pour affiner le modèle de langage. Résultat annoncé : des mouvements jugés plus expressifs, pertinents et fluides qu'avec le seul pipeline LLM de base. L'enjeu est significatif pour les intégrateurs de robots sociaux. Aujourd'hui, la quasi-totalité des comportements gestuels déployés en production repose sur des bibliothèques d'animations conçues à la main par des experts, ce qui rend les robots rigides face à des contextes conversationnels imprévus. Les approches par apprentissage automatique peinent à capturer la naturalité perçue, un critère subjectif qui se dégrade à mesure que le nombre de degrés de liberté augmente. Ce travail propose une alternative concrète : utiliser un LLM comme générateur de comportements moteurs au runtime, puis le corriger via RLHF pour coller aux préférences réelles des utilisateurs. C'est une transposition directe de la méthode qui a rendu ChatGPT lui-même plus utile, appliquée ici au domaine de la communication non verbale humain-robot. Les résultats restent néanmoins issus d'une étude utilisateur contrôlée, pas d'un déploiement à grande échelle. Pepper est le robot social d'Aldebaran Robotics, société française rachetée par SoftBank en 2012, aujourd'hui commercialisé dans les secteurs retail, accueil et éducation. Après une phase de déception commerciale liée précisément à la rigidité comportementale du robot, plusieurs équipes académiques cherchent à relancer son potentiel via des couches IA génératives. Sur ce terrain, Pepper fait face à une concurrence croissante des agents conversationnels incarnés (avatars AR/VR) et de nouvelles plateformes comme Enchanted Tools (France) avec son robot Miroki, conçu dès l'origine pour une expressivité naturelle. La prochaine étape logique serait un déploiement en contexte réel pour mesurer le gap entre l'évaluation en laboratoire et l'acceptation en environnement ouvert, une question que les auteurs n'adressent pas encore.

UEDes travaux académiques sur Pepper (Aldebaran, origine française rachetée par SoftBank) appliquant l'RLHF à la gestualité co-verbale ouvrent une voie concrète pour réhabiliter cette plateforme en production, dans un contexte où Enchanted Tools (France) cherche à s'imposer sur le segment des robots sociaux expressifs avec Miroki.

FR/EU ecosystemePaper
1 source
Mimic Robotics déploie ses « modèles vision-action de pointe » sur la chaîne de production Audi
4Robotics & Automation News 

Mimic Robotics déploie ses « modèles vision-action de pointe » sur la chaîne de production Audi

Robots industriels apprenant des tâches complexes chez Audi ? Voici le résumé factuel de 200-250 mots, sans invention de chiffres absents du communiqué. --- mimic robotics, entreprise suisse de « physical AI » spécialisée dans les Video-Action Models (VAM) pour l'automatisation industrielle, présente FLUX-mimic, un nouveau modèle développé avec Black Forest Labs, le laboratoire allemand connu pour ses modèles de génération d'image FLUX. Le système est censé permettre à des bras robotiques d'apprendre et d'exécuter des tâches de manipulation complexes directement en environnement d'usine, avec une mise en avant explicite d'un déploiement chez Audi. Le communiqué de mimic reste toutefois vague sur les aspects techniques concrets : aucun chiffre communiqué sur le payload, les degrés de liberté, le temps de cycle ou le nombre de sites équipés, ce qui invite à la prudence tant qu'aucune démonstration indépendante n'est disponible. Si la promesse se confirme, l'enjeu dépasse la simple vitrine technologique : faire fonctionner un modèle vision-langage-action dans une usine automobile, environnement réputé exigeant en précision et en fiabilité, constituerait un signal fort pour les intégrateurs industriels cherchant à dépasser le stade de la démonstration en laboratoire. Cela toucherait directement au débat sur l'écart entre annonces spectaculaires et réalité opérationnelle qui traverse le secteur de la robotique dexterous. mimic robotics développe depuis plusieurs années des modèles de manipulation robotique par apprentissage, et ce partenariat avec Black Forest Labs, davantage connu pour la génération d'images que pour la robotique, marque une diversification notable. FLUX-mimic vient ainsi s'ajouter à une compétition déjà dense sur les modèles d'action généralistes, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Le communiqué ne précise pas de calendrier pour un déploiement élargi au-delà d'Audi.

UELe déploiement implique Audi et Black Forest Labs, deux entreprises allemandes, ce qui illustre une adoption concrète de modèles vision-action dans l'industrie automobile européenne, bien qu'aucune métrique vérifiable ne confirme l'ampleur réelle du déploiement.

FR/EU ecosystemeActu
1 source