Aller au contenu principal
CoFreeVLA : manipulation à deux bras sans collision par modèle vision-langage-action et estimation du risque
RecherchearXiv cs.RO 

CoFreeVLA : manipulation à deux bras sans collision par modèle vision-langage-action et estimation du risque

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié une nouvelle version (v3) de CoFreeVLA, un framework qui ajoute aux modèles Vision-Language-Action (VLA) un estimateur léger de risque de collision pour bras robotiques doubles, décrit dans le papier arXiv 2601.21712. Le module prédit la probabilité de collision entre les deux bras ou avec l'objet saisi à partir de l'état proprioceptif, des embeddings visuels et des actions candidates, puis bloque les commandes risquées, génère une trajectoire de repli sûre et réoriente l'entraînement de la politique. L'entraînement combine un pré-entraînement sur des collisions synthétiques et un post-entraînement sur des trajectoires réelles. Sur cinq tâches bimanuelles, six backbones VLA et 30 essais par variante, le taux de collision moyen tombe de 0,54 à 0,23 et le taux de réussite grimpe de 0,45 à 0,61.

L'enjeu dépasse la simple démonstration : la plupart des politiques VLA bout-en-bout ont été validées sur bras unique, où l'auto-collision n'existe pas, alors qu'elle devient un frein direct dès que deux bras coordonnés manipulent une charge commune. Pour les intégrateurs, la preuve qu'un tel garde-fou de sécurité se greffe sur six architectures existantes sans réentraînement complet abaisse le coût d'adoption d'une couche de sécurité indépendante du backbone. L'échantillon reste toutefois modeste, 30 essais par variante sur cinq tâches, ce qui invite à la prudence avant d'extrapoler ces gains de taux de collision à des lignes de production réelles.

CoFreeVLA s'inscrit dans la généralisation des modèles VLA, dans la lignée de Pi-0, RT-2, OpenVLA ou GR00T N2, comme couche de contrôle générique pour la manipulation instruite, un paradigme éprouvé jusqu'ici surtout sur des bras uniques. La multiplication des humanoïdes et des cellules industrielles à deux bras rend ce manque de modélisation des auto-collisions de plus en plus pressant à mesure que ces systèmes quittent le laboratoire. Le travail reste pour l'instant une contribution académique publiée sur arXiv, sans partenaire industriel ni déploiement annoncé, dont la portée devra être confirmée sur davantage de plateformes et de tâches.

À lire aussi

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue
1arXiv cs.RO 

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue

Une équipe de chercheurs publie sur arXiv (référence 2607.06706, mise en ligne le 7 juillet 2026) une revue de littérature consacrée aux modèles Vision-Language-Action (VLA), ces architectures qui unifient perception visuelle, compréhension du langage naturel et génération d'actions dans un seul modèle de fondation. L'objectif : permettre à un robot d'exécuter une instruction du type "plie la serviette" ou "vole vers le bâtiment rouge" directement à partir d'images caméra, sans étape de programmation intermédiaire. Le travail passe en revue 183 contributions publiées entre 2017 et 2026, organisées selon sept axes : les architectures VLA, les recettes d'entraînement, les représentations d'actions, la coordination bimanuelle (2022-2026), la navigation et le contrôle de drones (2017-2026), l'ancrage du langage dans la perception, et des enjeux transverses comme la mémoire et les modèles du monde. Les auteurs identifient au passage quatorze directions de recherche encore ouvertes dans ces deux domaines. L'intérêt de cette synthèse tient au rapprochement qu'elle opère entre deux champs jusqu'ici traités séparément. La manipulation bimanuelle, où deux bras à 7 degrés de liberté chacun doivent coordonner leurs mouvements pour plier, assembler ou réorienter un objet, sert de banc d'essai le plus exigeant pour les VLA appliqués à la manipulation. Or les auteurs montrent que les stratégies de coordination, les recettes d'entraînement et les représentations d'actions conçues pour ces bras robotiques se transfèrent directement aux drones, confrontés à un défi structurellement similaire : coordonner poussée, attitude et, de plus en plus, commandes de préhenseur à partir d'observations visuelles, sous des contraintes strictes de latence et de charge utile (payload). Pour les intégrateurs et décideurs du secteur robotique, cela suggère qu'un socle technique commun pourrait émerger entre robotique aérienne et manipulation au sol, plutôt que deux écosystèmes cloisonnés. Cette revue s'inscrit dans la montée en puissance des VLA comme cadre dominant de l'apprentissage robotique, portée par leur capacité à hériter des connaissances générales acquises lors d'un pré-entraînement à l'échelle d'Internet, un atout que les approches de contrôle classiques n'offrent pas. En couvrant neuf ans de littérature sur la manipulation bimanuelle et la navigation de drones dans un même cadre d'analyse, le travail offre une cartographie utile pour situer les futures publications et les futurs produits commerciaux dans ce paysage encore mouvant, sans toutefois lui-même annoncer de déploiement ou de système opérationnel nouveau.

RecherchePaper
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
2arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
Force-based memory pour les modèles vision-langage-action dans la manipulation à contacts riches
3arXiv cs.RO 

Force-based memory pour les modèles vision-langage-action dans la manipulation à contacts riches

Une équipe de recherche propose FM-VLA, un modèle vision-langage-action (VLA) doté d'une mémoire basée sur la force plutôt que sur l'image, décrit dans un article publié sur arXiv (référence 2607.18231v1) daté de juillet 2026. Le système encode l'historique des forces de contact captées par le robot dans des tokens de mémoire compacts, générés par un autoencodeur variationnel (VAE) pré-entraîné à reconstruire des séries temporelles de force. Ces représentations latentes sont ensuite injectées, avec un court historique d'état, comme tokens de conditionnement supplémentaires dans le module d'action du VLA. L'équipe a testé FM-VLA sur trois tâches nécessitant une mémoire temporelle : retrouver un bloc caché, appuyer plusieurs fois sur un bouton, et essuyer une vaisselle un nombre précis de fois. Résultat annoncé : plus de 80% de taux de réussite, avec un surcoût de calcul à l'inférence jugé minime, et des performances nettement supérieures aux approches de référence. L'enjeu dépassé le simple gain de précision : les VLA actuels reposent souvent sur une hypothèse markovienne, où l'action ne dépend que de l'observation présente, ce qui les rend aveugles à des événements répétitifs difficiles à distinguer visuellement, comme plusieurs pressions rapides sur un même bouton. Les approches existantes de mémoire visuelle, qui rééchantillonnent des images passées, sont coûteuses en calcul et échouent justement sur ces cas ambigus. En s'appuyant sur le signal de force, disponible nativement sur la plupart des bras manipulateurs équipés de capteurs, FM-VLA offre une alternative légère pour la manipulation en contact riche, un domaine clé pour l'assemblage industriel, l'insertion de pièces ou la manipulation fine où la vision seule ne suffit pas à lever l'ambiguïté temporelle. Ce travail s'inscrit dans la lignée des modèles VLA généralistes comme Pi-0 ou GR00T N2, qui ont démontré la capacité de ces architectures à généraliser sur des tâches de manipulation variées, mais peinent encore sur les scénarios non markoviens. FM-VLA se positionne comme une brique modulaire plutôt qu'un système complet, testée pour l'instant en conditions contrôlées sur un nombre restreint de tâches. Les auteurs mettent à disposition une page de projet dédiée pour les détails techniques et démonstrations, sans annoncer pour l'instant de déploiement industriel ou de partenariat commercial.

RechercheActu
1 source
Mag-VLA : modèle vision-langage-action pour la manipulation bimanuelle de microrobots à actionnement magnétique
4arXiv cs.RO 

Mag-VLA : modèle vision-langage-action pour la manipulation bimanuelle de microrobots à actionnement magnétique

Des chercheurs proposent Mag-VLA, un modèle vision-langage-action (VLA) conçu pour piloter des microrobots à actionnement magnétique via deux bras robotiques équipés d'aimants permanents. Le système adapte le backbone Qwen2.5-VL-7B par fine-tuning LoRA pour traiter des observations visuelles et des instructions en langage naturel, puis générer des trajectoires coordonnées pour les deux bras simultanément dans un espace de travail partagé. Pour structurer le contrôle multi-étapes, l'architecture intègre un classificateur de phase sensible au mouvement et un décodeur ACT (Action Chunking Transformer) conditionné par cette phase. L'équipe a constitué un jeu de données de manipulation téléopérée couvrant trois configurations de difficulté croissante. En expérimentation réelle, Mag-VLA atteint 90 % de taux de succès à l'approche toutes tâches confondues, et des taux de transport de 80 %, 70 % et 50 % selon la complexité de la tâche. Ce résultat compte parce que les microrobots magnétiques sont des candidats sérieux pour la chirurgie mini-invasive, délivrance ciblée de médicaments, navigation vasculaire, ophtalmologie, mais leur pilotage reste difficile en raison de l'actionnement indirect, des capteurs limités et des interactions magnétiques non linéaires. Mag-VLA montre que le paradigme VLA, jusqu'ici évalué principalement sur des bras industriels ou des humanoïdes à l'échelle centimétrique, peut s'étendre au microscale. La coordination bimanuelle permet notamment la réorientation du microrobot, une opération difficilement réalisable avec un seul actionneur magnétique. Les études d'ablation du papier confirment que le décodeur ACT surpasse significativement les têtes d'action génératives alternatives, ce qui valide les choix architecturaux. Le contrôle de microrobots magnétiques est un axe de recherche actif depuis une quinzaine d'années, porté notamment par des groupes à l'ETH Zurich et au Max Planck Institute for Intelligent Systems, via des contrôleurs classiques ou de l'apprentissage par renforcement spécialisé, sans généralisation par langage naturel. L'essor des VLA macroscopiques comme pi0 de Physical Intelligence ou OpenVLA ouvre une voie transférable que Mag-VLA tente de valider à l'échelle micrométrique. Il s'agit pour l'instant d'un preprint académique (arXiv 2605.28486), sans partenaire industriel ni horizon de déploiement clinique annoncé. Les prochaines étapes logiques incluent des tests en milieu fluidique in vitro, la réduction de la latence du décodeur pour un contrôle temps réel, et la généralisation à un éventail plus large de géométries de microrobots.

UELe Max Planck Institute für Intelligente Systeme (Allemagne) est un acteur historique du contrôle de microrobots magnétiques ; une validation clinique de Mag-VLA renforcerait à terme la compétitivité européenne en chirurgie robotique mini-invasive, mais aucun déploiement ni partenaire industriel EU n'est annoncé à ce stade.

RechercheOpinion
1 source