Aller au contenu principal
IA physiquearXiv cs.RO 

Apprendre au-delà de ce que l'humain peut démontrer

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en septembre 2026 sur arXiv (2609.24996) un article présentant GLIDE (Guardrails for Learning from Infeasible Demonstrations Efficiently), un framework destiné aux tâches de manipulation robotique où le clonage comportemental classique échoue faute de démonstrations humaines exploitables. Le constat de départ est que certaines tâches exigeant une stabilité dynamique, un timing de contact précis ou une coordination dextre sont difficiles, voire impossibles, à téléopérer correctement par un opérateur humain. GLIDE prend en entrée une description de la tâche et le code de téléopération associé, puis génère automatiquement des garde-fous qui filtrent les commandes de téléopération et de politique en fonction de l'état du système, contraignent les actions à risque d'échec, et s'améliorent de façon itérative à partir du retour des trajectoires collectées. Testé sur trois tâches (transfert d'une assiette de tomates, prise et pose d'un marqueur, service de vin), le framework fait passer le taux de succès de la collecte de données de 0 à 10% jusqu'à 70 à 90% après raffinement. Les politiques entraînées sur des données mixtes atteignent ensuite 70%, 60% et 60% de réussite sur ces trois tâches respectivement.

Ce résultat s'attaque à un goulot d'étranglement connu de l'apprentissage par imitation en robotique : la qualité et la faisabilité des démonstrations humaines plafonnent la performance des politiques, quel que soit le volume de données collecté. Pour les équipes qui entraînent des modèles VLA sur des données de téléopération, GLIDE suggère qu'il est possible d'étendre le périmètre des tâches automatisables au-delà de ce qu'un humain peut physiquement démontrer, en injectant une connaissance structurée des modes d'échec dans le pipeline de collecte plutôt que dans la seule politique finale. Fait notable, les garde-fous générés automatiquement dépassent en efficacité ceux écrits à la main par des experts du domaine, ce qui suggère qu'une partie de l'ingénierie de contrainte comportementale, jusqu'ici artisanale, peut être partiellement automatisée et affinée par itération.

GLIDE s'inscrit dans la lignée des travaux sur l'apprentissage par imitation pour la manipulation dextre, où la téléopération en réalité virtuelle sert de méthode de référence malgré ses limites pour les tâches dynamiques. Les auteurs comparent explicitement leur approche à deux références, la téléopération VR sans contrainte et les garde-fous codés en dur par des experts, GLIDE surpassant les deux. Le projet est documenté sur un site dédié (guardrail-policy.github.io), mais l'article ne précise ni les auteurs, ni leur affiliation, ni de calendrier de déploiement au-delà de la validation sur ces trois tâches. Il s'agit à ce stade d'une contribution de recherche publiée en preprint, sans annonce de produit ni de partenariat industriel.

À lire aussi

Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine
1arXiv cs.RO 

Apprendre une politique robotique généralisable à partir de vidéos de démonstration humaine

Des chercheurs présentent dans un preprint arXiv (2505.20795, soumis en mai 2025) un framework en deux étapes permettant à un robot d'apprendre une nouvelle tâche de manipulation en regardant simplement une vidéo de démonstration humaine, sans collecter de données de téléopération ni effectuer de fine-tuning du modèle. Le système repose d'abord sur un modèle de génération vidéo entraîné par cross-prediction sur un dataset mixte humain-robot, pour construire une représentation latente commune aux deux modalités. Ensuite, une perte contrastive prototypique ("prototypical contrastive loss") aligne cet espace de représentation avec un espace d'action partagé entre humain et robot. À l'inférence, une vidéo de démonstration humaine sert directement de prompt : le robot exécute la tâche correspondante sans aucune adaptation. Les validations portent sur des tâches de manipulation dextre en environnement réel. L'enjeu industriel est direct : la collecte de données de téléopération reste le goulot d'étranglement majeur du robot learning, coûteuse, lente, dépendante d'opérateurs qualifiés. Si l'approche tient à l'échelle, elle réduirait drastiquement le coût d'onboarding d'une nouvelle tâche, passant de plusieurs heures de collecte à quelques secondes de vidéo. C'est précisément le type de capacité qui intéresse les intégrateurs industriels et les startups d'AMR cherchant à déployer des politiques généralisables sans retraining continu. Cela dit, le papier reste un preprint académique : les résultats portent sur un nombre limité de tâches de manipulation, et l'absence de métriques comparatives détaillées (nombre de démonstrations, taux de succès absolu, diversité des saisies) rend l'évaluation de la robustesse difficile à ce stade. La question du "demonstration gap" humain-robot est travaillée depuis plusieurs années, notamment via les travaux sur les video-language-action models (VLA) et des approches comme ACT ou Diffusion Policy chez des labos comme Stanford, CMU, ou encore Physical Intelligence (Pi-0). L'originalité ici réside dans le découplage explicite entre représentation et action via la cross-prediction, plutôt que l'alignement direct de trajectoires. Des acteurs comme 1X, Sanctuary AI ou Figure (avec son modèle Helix) explorent des pistes similaires côté industriel. La prochaine étape logique pour cette ligne de recherche est la généralisation à des objets non vus et à des scènes plus encombrées, deux conditions qui font souvent échouer les approches zero-shot en déploiement réel.

IA physiqueOpinion
1 source
OLogic explique comment les robots peuvent apprendre par démonstration humaine à RoboBusiness
2Robotics Business Review 

OLogic explique comment les robots peuvent apprendre par démonstration humaine à RoboBusiness

OLogic, société californienne de recherche et développement en systèmes embarqués, annonce que son cofondateur et PDG Ted Larson animera une session intitulée « Egocentric Robot Learning: Teaching Robots Through Human Experience » lors de RoboBusiness 2026, qui se tiendra les 20 et 21 octobre à Santa Clara, en Californie. L'intervention est programmée le deuxième jour du salon, à 10h45. Larson y présentera les fondements de l'apprentissage égocentrique, une méthode consistant à entraîner des robots à partir de démonstrations humaines filmées à la première personne, captées via caméras portables, systèmes de téléopération ou plateformes d'IA incarnée. OLogic met en avant les plus de 25 ans d'expérience de Larson en robotique et électronique grand public, et a par le passé contribué à des robots commerciaux tels que l'AMR de Bear Robotics, l'AMR de Locus Robotics, le robot social KiKi de Zoetic, le robot d'inventaire Tally de Simbe Robotics et le robot personnel de Misty Robotics. Diplômé de Cal Poly en informatique, Larson a aussi travaillé avec Google, Hasbro, Savioke et Panasonic, et intervient régulièrement à RoboBusiness depuis plusieurs éditions. L'enjeu dépasse le simple créneau de conférence : l'apprentissage par imitation à partir de données égocentriques s'impose comme une réponse à la pénurie de main-d'œuvre, à la demande croissante de personnalisation et à la complexité opérationnelle qui freinent l'automatisation dans la fabrication, la logistique, la santé et la robotique de service. Elle promet, en théorie, de réduire le temps, le coût et l'expertise nécessaires pour déployer un robot, en le faisant apprendre du comportement humain plutôt que par programmation manuelle. Pour les intégrateurs et décideurs B2B, cette session confirme que la bascule vers des modèles de fondation appliqués à la robotique, portée par des acteurs comme NVIDIA, Google DeepMind et Meta, continue de structurer les feuilles de route au-delà des seuls laboratoires de recherche. Il faut toutefois noter que l'article ne fournit aucun résultat chiffré, ni taux de réussite, ni volume de déploiement : il s'agit d'une annonce de conférence promouvant une intervention à venir, pas d'un lancement produit ni d'un déploiement documenté. Ce mouvement s'inscrit dans une dynamique où l'apprentissage égocentrique gagne du terrain depuis les travaux publiés par de grands laboratoires sur la collecte de données multimodales et les modèles de fondation pour la robotique, entraînant dans leur sillage un écosystème croissant de startups spécialisées en imitation learning et en intelligence incarnée. OLogic se positionne comme prestataire de R&D embarquée plutôt que fabricant de robots propriétaire, bâtissant sa légitimité sur des collaborations répétées avec des acteurs variés du secteur, de Bear Robotics à Misty Robotics en passant par Simbe Robotics et Zoetic. RoboBusiness reste l'un des rendez-vous de référence pour les développeurs de robotique commerciale, avec keynotes, sessions techniques et espaces de réseautage ; les inscriptions sont ouvertes, avec des tarifs réduits pour le monde académique, les associations et les groupes d'entreprises. Aucun pilote client ni calendrier de déploiement lié spécifiquement à cette présentation n'est annoncé pour l'instant, au-delà de l'intervention elle-même.

IA physiqueActu
1 source
Comment Generalist utilise des données de démonstration humaine pour l'apprentissage robotique
3The Robot Report 

Comment Generalist utilise des données de démonstration humaine pour l'apprentissage robotique

Generalist, startup robotique valorisée à 2 milliards de dollars, construit ses modèles sur les travaux de recherche "Universal Manipulation Interface" (UMI), publiés par le Toyota Research Institute (TRI), l'université Columbia et l'université Stanford. Cette plateforme de collecte de données s'appuie sur des effecteurs terminaux de type marionnette, maniés par des opérateurs humains et filmés par des caméras GoPro, pour capturer des tâches réelles comme la vaisselle ou la préhension d'objets ; ces démonstrations deviennent ensuite des données d'entraînement pour des modèles fondation destinés aux cobots. En juin 2026, lors du salon Automate au McCormick Center de Chicago, Generalist a montré en direct des bras Universal Robots (UR) pliant et assemblant des boîtes en carton, ainsi que des bras Flexiv réparant des aspirateurs robots. Environ un mois plus tard, l'entreprise publiait un billet de blog intitulé "Towards Machines with a Thousand Hands", détaillant l'usage d'une variété de pinces et d'outils, dont des spatules, sur différents systèmes robotiques. Samantha Castellanos, ingénieure mécanique fondatrice de Generalist, précise que le préhenseur maison ne compte qu'un seul degré de liberté (1 DoF), un choix assumé de simplicité mécanique plutôt que de complexité articulaire. Cette approche interroge l'hypothèse dominante du secteur selon laquelle la performance des modèles VLA (vision-language-action) dépend avant tout de la sophistication du hardware. En misant sur une pince minimaliste et sur le volume de données plutôt que sur la complexité mécanique, Generalist parie que le modèle, plus que la main, constitue l'avantage concurrentiel durable : selon Castellanos, le modèle est "le moat qui va nous différencier des autres." Pour les intégrateurs, la démonstration d'Automate montre qu'un même modèle peut piloter des bras de fournisseurs différents (UR, Flexiv) sur des tâches distinctes, assemblage de cartons d'un côté, réparation d'aspirateurs de l'autre, ce qui suggère une portabilité inter-marques rare en automatisation classique. Ces démonstrations restent toutefois des vitrines de salon en conditions contrôlées, non des déploiements en production : la capacité de récupération en temps réel vantée sur les réseaux sociaux n'a pas été vérifiée indépendamment, et aucun chiffre de temps de cycle, taux de réussite ou volume déployé n'a été communiqué. L'étude UMI, cosignée par des chercheurs de TRI, Columbia et Stanford, avait montré qu'il était possible d'entraîner des cobots à l'autonomie à partir de démonstrations humaines captées hors laboratoire, sans robot physique présent lors de la collecte ; cette recherche académique a rapidement servi de socle à la création de Generalist. L'entreprise évolue dans un secteur de l'IA robotique déjà très capitalisé, plus de 4 milliards de dollars levés cumulativement par ses concurrents : Skild AI (2 milliards), Physical Intelligence (1 milliard), Field AI (300 millions) et RLWRLD (41 millions). Face à cette concurrence, Generalist mise sur la diversité des effecteurs plutôt que sur un bras ou une pince unique, stratégie résumée dans son billet de blog par la formule "des machines aux mille mains." L'entreprise n'a communiqué ni calendrier de déploiement commercial ni client pilote nommé : à ce stade, les démonstrations de juin et juillet 2026 relèvent de la vitrine technologique plutôt que d'un produit livré en série.

IA physiqueOpinion
1 source
Apprentissage de la navigation au dernier mètre par catégorie à partir de démonstrations RGB d'une instance unique
4arXiv cs.RO 

Apprentissage de la navigation au dernier mètre par catégorie à partir de démonstrations RGB d'une instance unique

Des chercheurs du RPM Lab de l'Université du Minnesota présentent dans un preprint arXiv (2512.11173v3) un framework d'imitation learning pour la navigation au "dernier mètre" d'un robot manipulateur mobile quadrupède. L'enjeu : positionner la base du robot à quelques centimètres de l'objet cible avant toute action de manipulation, une phase où les systèmes RGB existants échouent, ne garantissant qu'une précision métrique insuffisante. Le système n'utilise que des caméras RGB embarquées et fonctionne avec trois entrées : des images objectif, des observations RGB multi-vues, et un prompt texte nommant l'objet cible. Un module de segmentation guidé par le langage et un décodeur de matrice de score spatial gèrent l'ancrage de l'objet et le raisonnement en pose relative. Entraîné sur une seule instance physique par catégorie, le système atteint 74,58 % de succès en edge-alignment (évaluation sur l'orientation réelle) et 89,42 % en object-alignment sur des instances et environnements inédits, y compris avec des conditions d'éclairage et de fond difficiles. Ce résultat comble un angle mort structurel de la manipulation mobile : les politiques de manipulation sont entraînées sur des configurations précises, et un positionnement approximatif suffit à les faire sortir de leur distribution d'entraînement, causant des échecs en chaîne à l'exécution. Supprimer LiDAR, capteurs de profondeur et cartes préalables tout en conservant une précision centimétrique rend le pipeline nettement plus déployable sur des plateformes sans capteurs premium. La généralisation catégorielle (une seule démonstration réelle, des dizaines d'instances inconnues) réduit massivement le coût de collecte de données, un verrou majeur pour la manipulation hors environnement contrôlé. Ce travail s'inscrit dans la dynamique des VLA (Vision-Language-Action) qui cherchent à unifier perception, langage et action dans des politiques généralisables. Les acteurs dominants sur la manipulation mobile incluent Physical Intelligence (Pi-0), Figure AI et les équipes académiques de Stanford et CMU, qui investissent massivement dans la collecte de données téléopérées à grande échelle. L'approche ici contraste délibérément : une seule démonstration par catégorie plutôt que des milliers d'épisodes. Ce résultat reste un démonstrateur académique sans déploiement industriel annoncé ni partenaire B2B identifié, mais une page projet avec des démonstrations visuelles est disponible en ligne.

IA physiqueActu
1 source