Aller au contenu principal
RecherchearXiv cs.RO 

Zeva-Ego : pré-entraînement égocentrique par apprentissage causal en contexte pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Zeva-Ego, un framework qui transforme la vidéo égocentrique humaine en données exploitables pour l'entraînement de modèles vision-langage-action (VLA) dédiés à la manipulation robotique. Le système combine deux composants : un Action-Centric Encoder (ACE), qui convertit les transitions visuelles de vidéos à la première personne en supervision centrée sur l'action pour le mid-training des VLA, et un module d'In-Context Causal Learning (ICCL), qui permet une adaptation sans mise à jour de paramètres à partir du retour action-effet observé au moment du déploiement. Sur le benchmark de manipulation bimanuelle RoboTwin, faire passer le volume de vidéo égocentrique à 10 000 heures fait grimper le taux de succès de 63,8% à 75,3%, un niveau comparable aux 74,7% obtenus avec 2 000 heures de démonstrations robotiques réelles, soit un ratio empirique d'environ 4 à 5 heures de vidéo humaine pour une heure de démonstration robot. Avec l'ICCL, le taux de succès progresse par ailleurs de 58% à 89% en seulement quatre tentatives, sans aucun réentraînement du modèle. Le travail est publié en preprint sur arXiv (2609.24411).

Ces résultats ciblent un goulot d'étranglement connu de l'apprentissage robotique : le coût et la rareté des démonstrations téléopérées, mode dominant de collecte de données pour les VLA. En chiffrant un ratio de substitution entre heures de vidéo humaine et heures de démonstration robot, Zeva-Ego donne aux équipes R&D un argument concret pour réorienter leurs budgets de collecte vers des sources bien plus abondantes que la téléopération. La capacité de l'ICCL à améliorer les performances sans réentraînement ouvre aussi une piste pour le déploiement en usine ou en logistique, où un robot affinerait son comportement au fil de ses propres tentatives sans cycle d'ingénierie dédié. Si ces résultats se confirment au-delà de la simulation, ils nourrissent le débat sur la possibilité de faire monter en échelle les VLA grâce à des données non robotiques. Il faut toutefois noter que les chiffres proviennent d'un seul benchmark simulé et n'ont pas été validés sur matériel physique en conditions industrielles.

Zeva-Ego s'inscrit dans une lignée de recherche qui cherche à exploiter la vidéo humaine comme substitut aux démonstrations robotiques coûteuses, un axe suivi par plusieurs laboratoires travaillant sur les modèles vision-langage-action. L'abstract ne mentionne aucune affiliation industrielle ni partenaire de déploiement, ce qui situe ce travail au stade de la recherche académique plutôt que du produit commercialisé. Aucune date de conférence, aucun code source public ni feuille de route ne sont précisés dans le résumé disponible. Les auteurs présentent leur approche comme complémentaire aux méthodes existantes de pré-entraînement sur données robotiques, avec pour horizon une intelligence incarnée apprenant en continu de sa propre expérience d'interaction. Les prochaines étapes attendues pour ce type de travaux passent généralement par une validation sur robot physique hors simulation, puis par une comparaison directe avec les VLA propriétaires déjà déployés par les acteurs commerciaux du secteur.

À lire aussi

Zeva : apprentissage causal en contexte pour une manipulation robotique généralisable
1arXiv cs.RO 

Zeva : apprentissage causal en contexte pour une manipulation robotique généralisable

Zeva, présenté dans un article arXiv (identifiant 2608.30880v1) publié fin août 2026, est un nouveau framework de recherche pour la manipulation robotique généralisable. Son principe central: pendant le déploiement réel, le robot apprend directement de ses propres interactions physiques, sans jamais mettre à jour les poids de son modèle de politique (policy model), qui reste gelé. Un composant appelé Causal Interaction Extractor encode chaque action exécutée et le changement d'état qu'elle provoque en un signal d'interaction causale, stocké dans une mémoire causale à double échelle temporelle. Pour chaque nouvelle action, les signaux pertinents sont récupérés dans cette mémoire et injectés comme contexte dans le modèle figé, une forme d'apprentissage en contexte (in-context learning) appliquée pour la première fois, selon les auteurs, à l'expérience physique d'un robot. Les tests couvrent à la fois la simulation et la manipulation en conditions réelles, comparés à des VLA (vision-language-action) et des WAM de référence, sans que l'article précise de noms de robots, de sites de déploiement ou de chiffres de payload et de temps de cycle. Pour l'industrie robotique, l'intérêt de Zeva tient à une promesse précise: un taux de succès qui continue de progresser au fil du déploiement, sans réentraînement ni gradient, et une expérience d'interaction qui se généralise d'une tâche à l'autre. C'est une réponse directe à un problème connu des intégrateurs et des VLA actuels, à savoir l'écart entre performance en pré-entraînement et robustesse face à des conditions physiques imprévues sur le terrain. Si les résultats se confirment au-delà du cadre expérimental de l'article, cela ouvrirait la voie à des robots capables de s'adapter en usine sans cycle coûteux de collecte de données et de fine-tuning, un argument fort pour les décideurs B2B qui évaluent le coût total d'exploitation des humanoïdes et bras manipulateurs. Il convient toutefois de noter que l'affirmation d'être le "premier" framework de ce type, ainsi que le qualificatif de performance "meilleure parmi les VLA et WAM comparés", reste à valider par la communauté, l'article ne détaillant pas la méthodologie de sélection des tâches ni des vidéos de démonstration. Zeva s'inscrit dans la lignée des travaux récents sur les architectures VLA comme Pi-0 ou GR00T N2, qui cherchent à combiner généralisation par pré-entraînement massif et adaptabilité en ligne. Contrairement à ces approches qui misent sur des mises à jour de poids ou du fine-tuning post-déploiement, Zeva mise sur une mémoire externe consultée à l'inférence, une piste plus proche des techniques de récupération augmentée utilisées en traitement du langage. L'article ne mentionne aucun acteur français ou européen, ni de partenariat industriel ni de calendrier de pilotes commerciaux, ce qui situe cette publication au stade de la recherche académique plutôt que du produit prêt au déploiement.

RecherchePaper
1 source
CLAMP : préentraînement par apprentissage contrastif multi-vues 3D pour la manipulation robotique conditionnée par l'action
2arXiv cs.RO 

CLAMP : préentraînement par apprentissage contrastif multi-vues 3D pour la manipulation robotique conditionnée par l'action

Des chercheurs ont publié en 2026 sur arXiv (référence 2502.00937v2) un nouveau framework de pré-entraînement 3D pour la manipulation robotique, baptisé CLAMP, pour Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining. Le principe : fusionner des images RGB-D avec les paramètres extrinsèques des caméras pour reconstruire un nuage de points 3D unifié, puis re-rendre des observations multi-vues à quatre canaux (RGB, profondeur, coordonnées 3D), incluant une vue dynamique au niveau du poignet du robot. Un encodeur est pré-entraîné par apprentissage contrastif sur de larges jeux de trajectoires simulées, en associant la géométrie spatiale des objets aux séquences d'actions du robot. Simultanément, une Diffusion Policy est pré-entraînée pour initialiser les poids lors du fine-tuning, avant d'être affinée sur un nombre limité de démonstrations réelles. CLAMP surpasse les baselines état de l'art sur six tâches en simulation et cinq tâches en environnement réel. La valeur opérationnelle de CLAMP tient principalement à son impact sur l'efficacité d'apprentissage. Les approches standards de behavior cloning s'appuient sur des représentations 2D pré-entraînées (ViT, ResNet), qui ignorent la profondeur et la géométrie spatiale, critiques pour les tâches de manipulation de précision. En injectant cette information 3D dès le pré-entraînement, CLAMP réduit le nombre de démonstrations humaines nécessaires pour atteindre des performances satisfaisantes sur de nouvelles tâches, ce qui est un levier concret pour les intégrateurs industriels. L'architecture hybride contrastive plus Diffusion Policy est potentiellement transférable. Prudence toutefois : les résultats en conditions réelles portent sur cinq tâches seulement, et le preprint ne détaille pas les protocoles de sélection des vidéos, ce qui invite à nuancer la portée des résultats. CLAMP s'inscrit dans un champ de recherche actif visant à dépasser les limites des politiques purement 2D et des VLA (Vision-Language-Action models) pour la manipulation. Il dialogue directement avec des travaux comme R3M, MVP, DP3 (Diffusion Policy 3D) ou SpatialVLA. La principale originalité est le conditionnement par les actions dans l'apprentissage contrastif 3D, combinaison peu explorée jusqu'ici. Le code et les vidéos sont disponibles sur clamp3d.github.io. Aucun déploiement industriel ni partenariat n'est annoncé ; il s'agit d'un résultat académique. La suite logique serait une évaluation à plus grande échelle, avec davantage de robots et de scénarios hors distribution, pour confirmer la généralisation sim-to-real à l'échelle.

RecherchePaper
1 source
Combinaison d'échantillonnage contraint et d'apprentissage par renforcement pour la manipulation robotique
3arXiv cs.RO 

Combinaison d'échantillonnage contraint et d'apprentissage par renforcement pour la manipulation robotique

Manipulation robotique non préhensile : des chercheurs de la TU Berlin combinent échantillonnage contraint et apprentissage par renforcement Une équipe de la TU Berlin, associée au laboratoire de Marc Toussaint, publie une nouvelle version de ses travaux sur l'entraînement de politiques de manipulation robotique en environnement riche en contacts (arXiv:2602.08557v2). Le problème visé est la manipulation dite non préhensile, c'est à dire pousser, faire glisser ou réorienter un objet sans le saisir, une tâche où l'apprentissage par renforcement (RL) peine souvent à explorer suffisamment l'espace des stratégies possibles. La méthode proposée combine deux idées existantes mais rarement associées : d'une part des stratégies de réinitialisation qui contrôlent la distribution des états de départ de chaque épisode d'entraînement, et d'autre part un échantillonnage basé modèle sur des variétés contraintes, une technique reconnue pour son efficacité à générer des états physiquement valides. Le nouvel échantillonneur tient explicitement compte de la structure des contacts pour couvrir un large éventail de modes de contact, le tout combiné à une interpolation projetée et à un apprentissage curriculaire progressif. Sur le plan des résultats, l'équipe affirme surpasser à la fois le RL classique sans échantillonnage contraint et les méthodes alternatives de réinitialisation, en entraînant des politiques universelles, non préhensiles et dynamiques. L'intérêt pour le secteur tient moins à un produit qu'à une brique méthodologique : la manipulation en contact riche, aujourd'hui l'un des points durs de la robotique appliquée (tri industriel, réorientation d'objets sur convoyeur, préhension d'objets déformables), reste largement dominée par des politiques apprises en simulation qui échouent à généraliser sur des configurations de contact non vues à l'entraînement. Une méthode qui améliore la couverture des modes de contact pendant l'apprentissage adresse directement ce problème de généralisation, sans dépendre d'un matériel ou d'un actionneur particulier. Il s'agit ici d'une contribution académique, pas d'une annonce produit ni d'un déploiement industriel, du matériel supplémentaire étant disponible sur le site du laboratoire. Le travail s'inscrit dans la continuité des recherches de Toussaint sur la planification géométrico logique et les approches hybrides modèle/apprentissage, un courant de recherche européen qui contraste avec les approches purement data-driven (type VLA) privilégiées par les laboratoires américains sur les plateformes humanoïdes commerciales.

UEContribution de la TU Berlin (laboratoire de Marc Toussaint) qui renforce l'expertise européenne en manipulation robotique hybride modèle/apprentissage, une approche qui se distingue des méthodes VLA data-driven privilégiées par les laboratoires américains.

RecherchePaper
1 source
Planification de mouvements précis pour la manipulation robotique par apprentissage par transfert sans données d'entraînement
4arXiv cs.RO 

Planification de mouvements précis pour la manipulation robotique par apprentissage par transfert sans données d'entraînement

Des chercheurs ont publié sur arXiv (arXiv:2606.06041) un framework baptisé iCEM+TL, qui combine la méthode évolutionnaire iCEM (improved Cross-Entropy Method) avec du Transfer Learning pour améliorer la planification de mouvement bas-niveau en robotique de manipulation. L'approche transfère directement les paramètres-clés d'iCEM appris sur des tâches simples vers des tâches plus complexes -- empilage d'objets, glissement, placement en étagère -- sans réentraîner depuis zéro. Complétée par une refonte des fonctions de récompense (Reward Redesign) via décomposition de tâche pour les scénarios d'empilage et de placement en étagère, la méthode atteint des gains de taux de succès allant jusqu'à 23 % en simulation. Elle a ensuite été validée sur un robot réel Franka Emika Panda dans un scénario d'empilage, confirmant la transférabilité sim-to-real de l'approche. L'intérêt principal réside dans l'efficacité d'échantillonnage : iCEM+TL contourne le besoin de longues phases d'entraînement en réutilisant explicitement la connaissance déjà acquise sur des tâches amont. Pour les intégrateurs industriels ou les équipes R&D robotique, cela signifie qu'ajouter une nouvelle tâche de manipulation à un bras existant ne nécessite pas un réentraînement complet -- un gain direct en temps et en coût de déploiement. Le fait que le transfert soit qualifié de "zero-shot" dans le titre mérite toutefois une nuance : il s'agit ici d'un transfert de paramètres entre tâches proches dans un même domaine, et non d'une généralisation à des environnements radicalement différents. Les résultats restent majoritairement issus de simulation, avec une validation robotique limitée à un seul scénario d'empilage -- la robustesse à l'échelle industrielle reste à établir. iCEM est un algorithme de planification en temps réel apparu comme alternative légère aux méthodes d'apprentissage par renforcement profond, notamment pour la manipulation sur bras sériels. Le Franka Emika Panda (7 DOF) est devenu un banc de test standard de la communauté académique, utilisé par des dizaines d'équipes dans le monde. Dans ce paysage, iCEM+TL se positionne en dehors des approches VLA (Vision-Language-Action) comme pi0 de Physical Intelligence ou des policies à diffusion qui dominent actuellement les benchmarks de référence tels que RLBench. La suite naturelle serait de tester le framework sur des tâches à horizon plus long, sur d'autres morphologies de robots, et de comparer formellement les gains de temps d'entraînement face aux baselines RL modernes.

RecherchePaper
1 source