Aller au contenu principal
Clonage comportemental à grande échelle : données ouvertes, entraînement et évaluation
IA physiquearXiv cs.RO 

Clonage comportemental à grande échelle : données ouvertes, entraînement et évaluation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UEPourquoi ça compte

Une équipe de chercheurs a publié fin juin 2026 ABC, une infrastructure entièrement open-source dédiée à la manipulation robotique par behavior cloning. La pièce centrale est ABC-130K, actuellement le plus grand jeu de données de téléopération en accès libre : 3 500 heures de données réparties sur plus de 130 000 épisodes couvrant 195 tâches distinctes. En complément, les auteurs publient un setup matériel accessible, une infrastructure d'entraînement, un pipeline de simulation, et 400 heures supplémentaires de données de téléopération simulée. Les politiques entraînées sur ce corpus exécutent des tâches de dextérité fine comme le pliage de boîtes cartonnées ou l'extraction de cartes de crédit depuis un portefeuille.

L'enjeu principal est celui de la reproductibilité et de l'équité dans la recherche en apprentissage par imitation. Jusqu'ici, les grandes équipes bénéficiaient d'un accès privilégié à des datasets propriétaires massifs, creusant l'écart avec les laboratoires académiques plus modestes. ABC propose une recette de co-entraînement simulation/réel corrélée qui permet de comparer les choix architecturaux (DiT, Diffusion Transformer, ou VLA, Vision-Language-Action) avant toute évaluation réelle coûteuse, ce qui représente un gain de temps et de budget substantiel pour les intégrateurs. La corrélation sim-to-real est cependant validée sur un périmètre limité de tâches de table-top et non sur des scénarios industriels complexes : les auteurs proposent un proxy fiable, pas une solution universelle.

Le behavior cloning, qui consiste à apprendre une politique directement à partir de démonstrations humaines sans modéliser de fonction de récompense, a connu un regain d'intérêt depuis les travaux de Stanford sur Diffusion Policy en 2023 et l'émergence des architectures VLA comme pi0 de Physical Intelligence ou OpenVLA. Dans cet espace concurrentiel, où Physical Intelligence, Google DeepMind et 1X Technologies publient des datasets propriétaires ou des modèles partiellement ouverts, ABC se positionne comme une alternative entièrement libre visant à démocratiser la recherche en manipulation. Les suites naturelles incluent l'extension à des morphologies robotiques variées et à des tâches bi-manuelles, qui restent hors du périmètre actuel de la plateforme.

Impact France/UE

Les laboratoires académiques européens (INRIA, CEA-List) et start-ups de manipulation peuvent exploiter directement ABC-130K et son pipeline sim-to-real open-source pour réduire l'écart de données avec les grandes équipes disposant de datasets propriétaires.

💬 Le point de vue du dev

130 000 épisodes de téléopération en open source, c'est le genre de ressource qu'on attendait depuis que Physical Intelligence a commencé à verrouiller ses données. L'écart entre les grandes équipes et les labos académiques en manipulation robotique, c'était un écart de données avant d'être un écart d'algorithmes, et ABC s'attaque frontalement à ça. La corrélation sim-to-real tient sur du tabletop, pas sur de l'industriel complexe, mais c'est déjà un proxy solide pour choisir son archi avant de dépenser sur du vrai matériel.

À lire aussi

Phone2Act : système de téléopération économique et universel pour la collecte de données VLA à grande échelle
1arXiv cs.RO 

Phone2Act : système de téléopération économique et universel pour la collecte de données VLA à grande échelle

Phone2Act est un framework de téleopération publié sur arXiv (2605.01948) qui transforme un smartphone grand public en contrôleur de robot à 6 degrés de liberté (DoF) via Google ARCore. Développé sur une architecture ROS 2 modulaire, le système découple la logique de contrôle des spécificités matérielles grâce à des noeuds bridge interchangeables, ce qui permet de passer d'un cobot industriel à un bras bimanuel bas coût sans modification de code. Un composant baptisé Universal Recorder synchronise des flux RGB multi-caméras avec le retour d'état du robot, puis exporte les démonstrations directement au format LeRobot, supprimant toute étape de post-traitement. Le framework a été validé en affinant le modèle VLA GR00T-N1.5 de NVIDIA sur 130 épisodes collectés, atteignant un taux de succès de 90 % sur une tâche réelle de pick-and-place multi-étapes déployée sur un Dobot CR5 physique. Ce résultat interpelle à plusieurs titres. La collecte de données de manipulation reste l'un des goulets d'étranglement les plus coûteux du pipeline d'entraînement VLA (Vision-Language-Action) : les frameworks existants supposent du matériel spécialisé, exosquelettes, gants haptiques, SpaceMouse, représentant souvent plusieurs milliers d'euros par poste. Phone2Act abaisse ce seuil à la possession d'un smartphone compatible ARCore. Les 90 % de succès sur tâche physique réelle, obtenus avec seulement 130 épisodes, suggèrent que la qualité des données collectées est suffisante pour le fine-tuning de modèles de fondation actuels. Pour un intégrateur ou un laboratoire à budget contraint, le facteur limitant n'est plus le matériel de collecte, mais le temps opérateur. Il faut toutefois noter que les vidéos de démonstration ne couvrent qu'une seule tâche, et que 130 épisodes représente un volume très limité pour tirer des conclusions généralisables. La problématique du coût de la donnée robotique est centrale depuis l'essor des modèles VLA fin 2023. Des initiatives comme Open X-Embodiment (Google DeepMind) ou LeRobot (HuggingFace, 2024) ont standardisé les formats de datasets sans résoudre l'acquisition terrain à bas coût. Phone2Act s'inscrit dans cette continuité en ciblant le format LeRobot comme sortie native. Face à lui, des systèmes comme ALOHA 2 (Google DeepMind/Stanford) ou les kits SO-100/SO-101 (The Robot Company) restent liés à des plateformes matérielles spécifiques. Le Dobot CR5 retenu pour les tests est un cobot industriel d'entrée de gamme, aux alentours de 15 000 euros, ce qui délimite le périmètre cible. Le code source et les données collectées n'étaient pas encore publics au moment de la soumission arXiv.

UEImpact indirect pour les laboratoires européens utilisant le format LeRobot (HuggingFace) ; aucune institution française ou européenne n'est directement impliquée dans le développement du framework.

IA physiqueOpinion
1 source
Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle
2Interesting Engineering 

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle

Genesis AI a présenté GENE-26.5, un modèle de fondation robotique conçu pour doter les robots de capacités de manipulation au niveau humain. La vidéo de démonstration publiée par l'entreprise montre des robots accomplissant une séquence culinaire de 20 étapes (couper des tomates, casser un oeuf d'une seule main, coordonner les deux bras pendant la cuisson), ainsi que la préparation d'un smoothie avec service en l'air, des tâches de laboratoire (pipettage, transfert de liquides), du câblage pour assemblage électronique, la résolution d'un Rubik's Cube en manipulation aérienne continue, et l'interprétation d'une pièce de piano rapide. Pour alimenter l'entraînement du modèle, l'entreprise a développé un gant haptique équipé d'une peau électronique à capteurs tactiles, établissant une correspondance 1:1:1 entre la main humaine, le gant et la main robotique. Genesis revendique un coût matériel cent fois inférieur aux solutions de télé-opération conventionnelles, et une efficacité de collecte de données cinq fois supérieure. Le moteur de données associé intègre également des vidéos égocentriques issues de caméras portables et des vidéos publiques centrées sur l'activité humaine. Ces résultats, s'ils se confirment en environnement réel non contrôlé, représentent une avancée potentiellement significative sur l'un des verrous les plus tenaces de la robotique : l'écart d'incarnation (embodiment gap) entre les mains humaines et robotiques, qui limite depuis des années la transférabilité des données d'entraînement. La cartographie 1:1 glove-to-robot est une approche déjà explorée par des acteurs comme Physical Intelligence (pi-0) et plusieurs laboratoires académiques, mais Genesis revendique une démonstration à une échelle et une polyvalence inédites. Pour les intégrateurs industriels et les décideurs cherchant à automatiser des tâches non structurées (assemblage fin, préparation culinaire en volume, logistique d'entrepôt), la promesse d'un système généraliste capable d'apprendre directement des gestes humains quotidiens, sans retraining extensif, représenterait un changement de paradigme. Il faut toutefois noter que les démonstrations sont des vidéos éditées, sans données indépendantes sur le taux d'échec, les conditions d'éclairage, ou la reproductibilité en cycle de production continu. Genesis AI s'inscrit dans un segment en forte concurrence avec Physical Intelligence (pi-0, Berkeley), Figure AI (Figure 03, déployé avec BMW), Tesla (Optimus Gen 3), NVIDIA (GR00T N2) et Apptronik (Apollo). L'approche par gant haptique à bas coût rappelle les travaux d'Enchanted Tools, acteur français du service robotique, qui mise également sur la capture de mouvement humain pour réduire le coût d'entraînement. Genesis n'a pas encore annoncé de déploiements industriels confirmés ni de partenariats nominatifs : GENE-26.5 reste à ce stade une annonce de produit accompagnée d'une démonstration vidéo, pas un système disponible commercialement. L'entreprise indique prévoir le déploiement de ses gants en milieu de travail réel via des partenariats industriels, avec pour objectif de constituer une bibliothèque de compétences humaines à grande échelle pour l'entraînement robotique.

IA physiqueActu
1 source
Politique de guidage comportemental : des démonstrations comme invites pour la manipulation
3arXiv cs.RO 

Politique de guidage comportemental : des démonstrations comme invites pour la manipulation

Une équipe de chercheurs publie sur arXiv (preprint 2606.30457, juin 2026) une architecture baptisée Behavior Prompting Policy (BPP), conçue pour permettre à un robot de réaliser une tâche de manipulation inédite à partir d'une seule démonstration humaine, sans aucun fine-tuning. Le principe, qu'ils nomment "behavior prompting", s'inspire directement de l'apprentissage en contexte (in-context learning) des grands modèles de langage : la démonstration joue le rôle de "prompt" et le modèle visuomoteur génère les actions correspondantes à partir de l'observation courante. En parallèle, les auteurs introduisent iPhUMI, une interface de manipulation tenue à la main qui permet de collecter des données d'entraînement diversifiées à moindre coût, ainsi que deux benchmarks d'évaluation inédits : DrawAnything (tâches de dessin sur robot) et LIBERO-Gen (manipulation de surface avec généralisation zero-shot). Le résultat le plus structurant de cette recherche est l'identification de la diversité des tâches d'entraînement comme facteur déterminant de la capacité de prompting, davantage que le volume de données ou la taille du modèle. Cela change le calcul pour les intégrateurs et les équipes robotique : plutôt que d'accumuler des milliers de démonstrations par tâche pour fine-tuner, une politique généraliste entraînée sur un corpus très varié suffit, et l'opérateur la re-configure via une unique démonstration manuelle. Sur le plan industriel, c'est une piste sérieuse pour réduire le coût de déploiement de robots de manipulation dans des environnements à SKUs variables, problème central en logistique et en assemblage flexible. Cette approche s'inscrit dans une famille de travaux sur les Visual Language Action models (VLA) et les politiques généralisées, dont les représentants les plus connus sont π₀ (Physical Intelligence), OpenVLA (UC Berkeley) et RT-2 (Google DeepMind). iPhUMI se positionne comme une alternative légère aux exosquelettes ou gants haptiques pour la collecte de données. Il s'agit pour l'instant d'un preprint non peer-reviewed, et les expériences restent limitées à des environnements de laboratoire ; la question du sim-to-real et de la robustesse à la variabilité de l'éclairage ou de l'objet n'est pas traitée. Un site projet est disponible, mais aucun code ni dataset n'est encore publié.

UELes équipes R&D européennes en robotique de manipulation peuvent tirer un enseignement opérationnel direct : privilégier la diversité des tâches d'entraînement plutôt que le volume de données par tâche, ce qui réduit le coût de déploiement en logistique et assemblage flexible, secteurs où plusieurs intégrateurs européens sont actifs.

IA physiqueOpinion
1 source
La stratégie du passage à l'échelle : apprendre la généralisation compositionnelle par une évaluation et une collecte de données sensibles aux biais pour la manipulation robotique
4arXiv cs.RO 

La stratégie du passage à l'échelle : apprendre la généralisation compositionnelle par une évaluation et une collecte de données sensibles aux biais pour la manipulation robotique

Une équipe de recherche en robotique publie un article (arXiv:2607.21582v1) qui diagnostique un défaut majeur des politiques de manipulation robotique entraînées sur des instructions en langage naturel : le raccourci sémantique. Les auteurs introduisent un cadre diagnostique qui décompose chaque instruction en facteurs réutilisables, couleur, verbe, objet, taille et attribut spatial, puis mesurent avec deux métriques, le Factor Dominance Rate (FDR) et le Factor Dominance Hierarchy (FDH), lequel de ces facteurs la politique utilise réellement pour agir plutôt que de véritablement comprendre l'instruction. Testé sur six politiques fondation, le classement obtenu est constant : la couleur domine largement, suivie de l'objet, de l'attribut spatial, du verbe, et enfin de la taille, la moins bien ancrée dans la compréhension du modèle. Sur cette base, l'équipe propose une stratégie de collecte de données consciente du biais, qui réalloue un budget de démonstrations fixe vers les facteurs sous-représentés. Résultat : en simulation comme sur robot réel, cette approche dépasse les méthodes de référence tout en utilisant deux fois moins de démonstrations. L'enjeu dépasse le simple exercice académique. Les politiques génératives de type VLA (vision-language-action), déployées ou en cours de commercialisation chez plusieurs acteurs du secteur, sont souvent présentées comme comprenant le langage naturel de façon générale. Ce travail montre qu'en réalité, beaucoup s'appuient sur des indices visuels saillants, la couleur d'un objet par exemple, plutôt que sur une véritable compréhension linguistique compositionnelle, un phénomène classique de raccourci d'apprentissage. Pour les équipes qui entraînent ou déploient ces modèles, la démonstration téléopérée reste le goulot d'étranglement coûteux ; une méthode capable de diviser par deux le volume de données nécessaires en ciblant intelligemment les facteurs sous-appris représente un gain économique concret. Ce travail s'inscrit dans la lignée des efforts de benchmarking de la généralisation compositionnelle en robotique, un sujet devenu central depuis l'essor des politiques fondation entraînées sur de larges corpus de démonstrations multi-tâches. Les auteurs positionnent leur diagnostic comme actionnable et non purement descriptif, ouvrant la voie à des pipelines de collecte de données plus ciblés pour les futures générations de modèles VLA.

IA physiqueActu
1 source