Aller au contenu principal
Génération et intégration guidées par représentation de programmes exécutables pour la manipulation robotique
RecherchearXiv cs.RO 

Génération et intégration guidées par représentation de programmes exécutables pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent RIVET (Representation-guided Integration of VLM-generated Executable Task programs), un framework qui utilise un modèle vision-langage pour générer automatiquement l'ensemble d'un système de manipulation robotique, perception, rendu, inférence de relations et planification, autour d'une représentation partagée combinant des poses 6D par objet et un graphe de relations entre objets. Décrit dans un papier arXiv (2609.31337v1), le système a été testé sur trois tâches, l'empilement de cubes, le réarrangement de tangram et l'assemblage tridimensionnel, à la fois en simulation et sur un robot physique réel. Les programmes générés une seule fois pour un domaine de manipulation donné sont ensuite réutilisés tels quels sur des configurations de départ et d'objectif jamais vues, sans nouvelle génération de code. En conditions réelles, les auteurs rapportent un taux de réussite global de 83 % en réutilisant des systèmes générés hors ligne.

L'intérêt pour l'industrie robotique tient au problème que RIVET cible directement : quand un VLM génère séparément les modules de perception, de planification et de contrôle, ceux-ci opèrent souvent sur des représentations géométriques incompatibles, ce qui casse le pipeline complet. En imposant une représentation commune à tous les modules générés, l'approche évite cette fragmentation typique des pipelines "code généré par IA" en robotique. Pour les intégrateurs, l'argument clé est économique autant que technique : le code n'est produit qu'une fois par domaine puis réemployé sans réinvoquer le VLM à chaque nouvelle configuration, ce qui limite le coût d'inférence en déploiement. Un taux de succès réel de 83 % reste notable dans un domaine où l'écart entre simulation et monde réel demeure un obstacle documenté, même s'il s'agit ici de résultats de laboratoire sur un nombre restreint de tâches, à ne pas confondre avec une validation à l'échelle industrielle.

RIVET s'inscrit dans un courant de recherche qui explore la génération de code exécutable par VLM comme alternative aux politiques vision-langage-action entraînées de bout en bout, du type de celles popularisées par des modèles comme Pi-0 ou GR00T N2, qui apprennent une correspondance directe perception-action sans passer par du code interprétable. Ce travail reste à ce stade un résultat académique, validé en simulation et sur un seul bras robotique en conditions de laboratoire, sans partenaire industriel ni calendrier de déploiement annoncé, une nuance qui le distingue nettement d'une annonce produit.

À lire aussi

AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM
1arXiv cs.RO 

AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM

AntiGrounding, un framework de sélection visuelle d'actions pour la manipulation robotique guidée par des modèles vision-langage, est détaille dans une version mise a jour d'un article arXiv (2506.12374v3). Chaque trajectoire courte retenue après filtrage de faisabilité sert a la fois de plan de mouvement exécutable et de prompt visuel rendu, évalué par un question-réponse visuel multi-vues qui note sécurité, alignement avec la tache, efficacité et plausibilité physique. Ces scores, agrégés par fusion pondérée des vues, guident les propositions de trajectoire suivantes; des contrôles séparés gèrent orientation et pince, et un jumeau numérique valide les segments choisis avant exécution par le robot réel. Sur huit taches de manipulation en conditions réelles, AntiGrounding associe a un seul évaluateur, désigne GPT-6 Astra, atteint 71,25% de réussite, contre 50,00% pour le modèle pi0.5 et 47,50% pour une base de référence de type PIVOT évaluée avec le même VLM. L'intérêt pour le secteur tient a l'alternative proposee aux modèles VLA généralistes entraines de bout en bout, comme pi0.5, GR00T N2 ou Helix, qui associent directement instruction et action: ici le VLM sert d'évaluateur dans une boucle de recherche et de notation de trajectoires géométriques, approche plus auditable pour la sécurité avant un déploiement industriel. L'écart avec pi0.5 (50,00%) sur les mêmes huit taches rappelle que les politiques VLA généralistes restent en dessous des attentes en conditions réelles, nuançant l'idée d'un sim-to-real déjà résolu a grande échelle. Les auteurs précisent toutefois que la performance reste bornée par la fidélité du jumeau numérique et par les aléa de l'interaction physique: il s'agit d'un travail de recherche publie sur arXiv, non d'un produit commercialise ni déployé en usine. Le travail s'inscrit dans la lignée des recherches combinant grands modèles vision-langage et planification robotique, aux cotes de politiques VLA comme pi0 et pi0.5 de Physical Intelligence ou GR00T N2 de NVIDIA, et se distingue de la méthode concurrente PIVOT en confiant au VLM un rôle de juge plutôt que de générateur direct d'action. Aucun acteur français ou européen, tel Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools, n'apparait dans ces travaux, qui restent pour l'instant un résultat de laboratoire sur huit taches, sans calendrier de pilote industriel annonce.

RechercheActu
1 source
Génération et adaptation dynamique pour manipulation robotique par imitation d'exemples inédits
2arXiv cs.RO 

Génération et adaptation dynamique pour manipulation robotique par imitation d'exemples inédits

Cette annonce technique concerne DAMI (Dynamics-Aware Meta-Imitation), un nouveau framework de recherche pour l'apprentissage par imitation en robotique, publié le 20 juillet 2026 sur arXiv (référence 2607.15880v1). L'apprentissage par imitation permet aux robots d'acquérir des compétences à partir de démonstrations, mais souffre traditionnellement d'un manque de données et de difficultés à généraliser à de nouvelles tâches non vues à l'entraînement. Pour résoudre ce problème, les chercheurs combinent le meta-learning avec plusieurs modules techniques : un module Visual-Motor Trajectory (VMT) qui capture les dynamiques spatio-temporelles complexes dans l'espace latent de la tâche, un bloc Unpaired Unified Task (U2T) qui fusionne des observations multimodales non structurées, et un mécanisme de Task-Conditioned Feature Modulation (TCFM) qui module les caractéristiques 3D de bas niveau. Le système apprend la logique sous-jacente d'une tâche à partir d'une seule démonstration de référence complète, plutôt que de mémoriser des indices statiques figés. Des expériences en simulation et en conditions réelles montrent que DAMI surpasse les approches de référence existantes, aussi bien en inférence directe sur des tâches connues qu'en adaptation à des tâches inédites via du few-shot fine-tuning. L'enjeu ici dépasse la simple performance sur benchmark : c'est le fossé entre démonstration et généralisation réelle qui reste le principal obstacle à la commercialisation des robots manipulateurs et humanoïdes. La plupart des systèmes actuels performent bien sur les tâches pour lesquelles ils ont été entraînés, mais s'effondrent dès qu'un intégrateur change légèrement l'environnement, l'objet ou la disposition de la cellule de production. Si les résultats de généralisation few-shot se confirment au-delà du papier, cela réduirait le coût de redéploiement d'un robot manipulateur sur une nouvelle tâche industrielle, un frein économique majeur actuellement pour les intégrateurs et les décideurs B2B qui hésitent à investir dans des cellules robotisées rigides. Ce travail s'inscrit dans la lignée des architectures VLA (Vision-Language-Action) et des approches de meta-learning déjà explorées par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), qui cherchent tous à résoudre le même problème de transfert sim-to-real et de généralisation inter-tâches. Contrairement à ces produits commerciaux, DAMI reste à ce stade une contribution académique publiée sur arXiv, sans indication de partenaire industriel ni de déploiement prévu. Les prochaines étapes attendues seraient une validation sur des plateformes robotiques tierces et une comparaison directe avec les frameworks VLA propriétaires pour juger de sa maturité réelle.

RecherchePaper
1 source
LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique
3arXiv cs.RO 

LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique

Des chercheurs présentent LaGEA (Language Guided Embodied Agents), une architecture combinant un modèle vision-langage (VLM) et l'apprentissage par renforcement (RL) pour la manipulation robotique, décrite dans une version mise a jour (v3) d'un article arXiv (2509.23155). Apres chaque tentative, le système résume l'épisode en langage naturel, localise les instants décisifs de la trajectoire, aligne ce retour avec l'état visuel dans une représentation partagée, puis transforme la progression vers l'objectif en récompenses bornées appliquées pas a pas. Un coefficient adaptatif, sensible aux échecs, rend ce signal dense en début d'exploration puis l'atténué avec la montée en compétence de l'agent. Sur les bancs d'essai simules Meta-World MT10 (dix taches de manipulation) et Robotic Fetch, LaGEA améliore le taux de réussite moyen de 9,0% sur des objectifs aléatoires, 5,3% sur des objectifs fixes et 17% sur les taches Fetch par rapport aux méthodes de référence, avec une convergence plus rapide. Le travail s'attaque a un problème classique du RL, la conception manuelle des fonctions de récompense, souvent couteuse et peu généralisable a de nouvelles taches. En montrant qu'un retour en langage naturel, structure et ancre temporellement, peut remplacer une partie de cette ingénierie, LaGEA nuance le narratif dominant autour des modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix, conçus pour piloter directement une politique de bout en bout : ici, le langage sert de superviseur d'apprentissage plutôt que de commande directe. Les gains rapportes restent obtenus en simulation, non sur du matériel réel, et demandent une confirmation sur des taches de manipulation physique. LaGEA prolonge les travaux exploitant les grands modèles vision-langage comme source de récompense ou de critique pour le RL, un axe de recherche actif depuis l'essor des modèles de fondation capables de décrire des objectifs et d'évaluer des trajectoires. Meta-World MT10 et Robotic Fetch sont des bancs d'essai standards de la communauté robotique, ce qui permet une comparaison directe avec l'état de l'art. S'agissant d'une version corrigée d'un article déjà publie, la contribution reste académique : aucun partenaire industriel, date de déploiement ou intégration produit n'est annonce a ce stade, la prochaine étape logique étant une validation sim-to-real sur robot physique.

RecherchePaper
1 source
AffordSim : un générateur de données évolutif et un benchmark pour la manipulation robotique guidée par les affordances
4arXiv cs.RO 

AffordSim : un générateur de données évolutif et un benchmark pour la manipulation robotique guidée par les affordances

AffordSim est un générateur de données simulées et benchmark pour la manipulation robotique consciente des affordances, publié en preprint sur arXiv en mai 2026 (référence 2604.11674). Le système répond à un problème structurel : les estimateurs de préhension génériques optimisent la stabilité sans logique de tâche et sélectionnent souvent la mauvaise zone fonctionnelle de l'objet, tandis que les annotations manuelles de contact doivent être réécrites pour chaque nouvel objet et chaque nouvelle tâche. AffordSim intègre la prédiction d'affordances 3D à vocabulaire ouvert dans un pipeline de simulation : à partir d'une instruction en langage naturel, il synthétise la scène, localise les régions fonctionnelles pertinentes sur les surfaces d'objets (la poignée d'une casserole, le bouton d'un tiroir), échantillonne des prises conditionnées à ces régions, puis sélectionne les trajectoires exécutables par planification de mouvement. La randomisation de pose, texture, éclairage et bruit d'image est intégrée pour favoriser le transfert sim-to-real. Le benchmark couvre 50 tâches, cinq embodiments robotiques distincts et plus de 500 objets rigides et articulés. Les politiques VLA (Vision-Language-Action) entraînées sur ces données transfèrent zéro-shot vers un Franka FR3 réel avec 24 % de succès moyen, sans aucun fine-tuning sur données physiques. La zone fonctionnelle d'un objet, l'affordance, est précisément le point de défaillance ignoré par les benchmarks de manipulation génériques : saisir le mauvais endroit rend l'action aval impossible quel que soit le planificateur. AffordSim atteint 93 % du taux de succès des annotations manuelles sur les tâches critiques d'affordance, et 89 % sur les tâches composites difficiles, ce qui valide l'annotation automatisée comme substitut crédible à l'annotation humaine à grande échelle. Pour les équipes développant des modèles de fondation robotique ou des politiques VLA, cela réduit drastiquement le coût de génération de données diversifiées. Le score de 24 % en zero-shot reste modeste, mais il constitue une preuve de principe importante : un pipeline entièrement simulé peut produire des politiques opérationnelles sur matériel réel, condition nécessaire à un déploiement industriel scalable. AffordSim s'inscrit dans la vague des générateurs de données synthétiques pour la manipulation, aux côtés de RoboGen, GenSim et des pipelines Nvidia Isaac. Le Franka FR3, bras académique de référence vendu autour de 15 000 euros, est l'unique plateforme réelle testée, ce qui limite la portée des conclusions hors de ce contexte de laboratoire. Les modèles de fondation robotique comme pi0 (Physical Intelligence) ou OpenVLA constituent le terrain applicatif naturel de cet outil. En Europe, des équipes comme le LAAS-CNRS à Toulouse et des startups comme Enchanted Tools (Paris, robots manipulateurs expressifs) pourraient exploiter ce type de générateur pour réduire leur dépendance aux plateformes de données propriétaires américaines. Ce travail restant un preprint non encore évalué par les pairs, les métriques avancées devront être confirmées lors d'une soumission en conférence (CoRL, RSS ou ICRA).

UELes équipes européennes comme le LAAS-CNRS (Toulouse) et Enchanted Tools (Paris) pourraient exploiter AffordSim pour réduire leur dépendance aux plateformes de données propriétaires américaines dans le développement de politiques VLA.

RechercheOpinion
1 source