Aller au contenu principal
RecherchearXiv cs.RO 

TAPESIM : simulation efficace du déroulement de ruban adhésif pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié le 25 septembre 2026 sur arXiv (2609.28766) présente TapeSim, un simulateur physique pour la manipulation robotique de ruban adhésif, utilisé pour sécuriser des faisceaux de câbles ou sceller des emballages ; les auteurs annoncent la publication du code source. Simuler chaque couche adhésive d'une bobine ralentit les solveurs et peut bloquer la rotation du rouleau aux tolérances numériques courantes, alors qu'un rouleau rigide ne libère jamais de matière. TapeSim concentre la déformation près de la zone de déroulement : un amas rigide représente la bobine, un collier déformable avance pour libérer le ruban, et des liaisons adhésives optionnelles simplifient le collage. À 32 tours, l'approche accélère le calcul de 3,2 à 3,4 fois, jusqu'à 8,4 fois pour un mouvement comparable, réduit de 23 à 29% l'erreur de suivi visuel sur cinq rejeux réels, et fait passer, sur 100 essais de décollement, la précision de 50% (hasard) à 72,9-76,3%.

Cette avancée cible un angle mort de la simulation robotique : les objets déformables qui collent et décollent, fréquents en logistique et en assemblage industriel, forcent les moteurs physiques à choisir entre rigidité artificielle et coût de calcul prohibitif. En rendant ces interactions rapides et fidèles au réel, comme le montre le bond de précision de 50% à plus de 72% sur la détection du décollement, TapeSim ouvre la voie à un entraînement et une évaluation reproductibles des politiques robotiques sur des tâches jusqu'ici trop coûteuses à simuler, un pas vers la réduction de l'écart persistant entre simulation et déploiement réel.

Le travail s'inscrit dans une littérature croissante sur la simulation d'objets déformables et cohésifs, où les approches à couches adhésives complètes, utilisées ici comme référence, restent la norme malgré leur coût de calcul élevé. TapeSim s'en distingue par une architecture hybride rigide/déformable localisée, validée sur des tests synthétiques de balancement et de décollement, et sur une séquence de scellage de boîte en téléopération combinant fixation, déroulement, coupe et scellage. Les auteurs ne précisent ni institution ni calendrier de déploiement au-delà de la publication du code, ce qui situe ce travail au stade de la recherche reproductible plutôt que du produit prêt à l'emploi.

À lire aussi

Modèle de diffusion adaptatif pour la manipulation robotique efficace (VADF)
1arXiv cs.RO 

Modèle de diffusion adaptatif pour la manipulation robotique efficace (VADF)

Une équipe de chercheurs a publié sur arXiv (référence 2604.15938) une proposition architecturale baptisée VADF (Vision-Adaptive Diffusion Policy Framework), visant à corriger deux défauts structurels des politiques de diffusion appliquées à la manipulation robotique. Le premier défaut est le déséquilibre de classe dû à l'échantillonnage uniforme lors de l'entraînement : le modèle traite indistinctement les exemples faciles et difficiles, ce qui ralentit la convergence. Le second est le taux d'échec à l'inférence par dépassement de délai, un problème opérationnel concret dès qu'on sort du laboratoire. VADF intègre deux composants : l'ALN (Adaptive Loss Network), un MLP léger qui prédit en temps réel la difficulté de chaque pas d'entraînement et applique un suréchantillonnage des régions à forte perte via du hard negative mining ; et l'HVTS (Hierarchical Vision Task Segmenter), qui décompose une instruction de haut niveau en sous-tâches visuellement guidées, en assignant des schedules de bruit courts aux actions simples et des schedules longs aux actions complexes, réduisant ainsi la charge computationnelle à l'inférence. L'architecture est conçue model-agnostic, c'est-à-dire intégrable à n'importe quelle implémentation existante de politique de diffusion. L'intérêt pour un intégrateur ou un responsable R&D est avant tout pratique : les politiques de diffusion souffrent de coûts d'entraînement élevés et d'une fiabilité insuffisante en déploiement réel, ce qui freine leur adoption industrielle. Si les gains annoncés par VADF se confirment sur des benchmarks indépendants, la réduction des étapes de convergence représenterait un levier significatif sur les coûts GPU, et la diminution des timeouts à l'inférence améliorerait directement la cadence opérationnelle. Il faut toutefois noter que ce travail est un preprint non évalué par des pairs, sans chiffres de performance comparatifs publiés dans l'article lui-même. Les politiques de diffusion ont émergé comme méthode de choix pour l'imitation comportementale en robotique depuis les travaux de Chi et al. en 2023 (Diffusion Policy, Columbia), avant d'être intégrées dans des architectures plus larges comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La principale tension du domaine reste le sim-to-real gap et la robustesse à l'inférence en conditions réelles, terrain sur lequel VADF prétend apporter une contribution. Les prochaines étapes logiques seraient une validation sur des benchmarks standard (RLBench, LIBERO) et une comparaison directe avec ACT ou Diffusion Policy de référence.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
2arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
DUET-DINO : modélisation simultanée du monde multi-vue pour la planification latente en manipulation robotique
3arXiv cs.RO 

DUET-DINO : modélisation simultanée du monde multi-vue pour la planification latente en manipulation robotique

Des chercheurs affiliés au laboratoire UTN-AIR publient DUET-DINO, un modèle de monde latent conditionné par l'action, décrit dans une prépublication arXiv du 10 septembre 2026 (arXiv:2609.10506). Le système apprend simultanément à partir de deux flux vidéo, une caméra statique de scène et une caméra montée sur le poignet du bras robotique, en les faisant se conditionner mutuellement, pour prédire les conséquences visuelles d'une action sur l'ensemble des 7 degrés de liberté (DOF) d'un effecteur terminal. Entraîné à partir de zéro sur les jeux de données DROID et RoboArena, il atteint 92% de réussite sur des tâches d'atteinte spatiale (reach), 72,5% sur des tâches d'atteinte avec orientation fine (angled-reach) et 60,0% sur des tâches de préhension et levage d'objet (grasp-and-lift), surpassant des versions à vue unique ou à double vue non couplée. Les auteurs comparent aussi deux briques de vision : les prédictions du modèle V-JEPA 2 sur la vue poignet sous-estiment la dynamique visuelle induite par des actions fines, tandis que DINOv3 capture mieux ces changements et améliore la planification en aval. Le code et les poids seront publiés en open source, mais ne le sont pas encore à ce stade. L'enjeu technique visé est concret : les modèles de monde latents existants échouent souvent sur les actions spatiales et rotationnelles fines, ce qui limite leur usage pour un contrôle précis en 7 DOF, indispensable à des tâches d'insertion, de saisie orientée ou de manipulation fine en usine. En couplant vue globale de scène et vue centrée sur la pince, DUET-DINO cherche à combler cet écart pour permettre une planification zero-shot conditionnée par objectif, sans réentraînement spécifique à chaque tâche. Pour les intégrateurs et décideurs robotique, le résultat le plus utile n'est pas tant les scores de réussite, encore modestes sur des tâches de préhension complexes, que l'indication empirique que le choix du backbone visuel (DINOv3 plutôt que V-JEPA 2) conditionne directement la qualité de la planification en aval, un signal utile pour quiconque construit des architectures VLA ou de modèles de monde. Ce travail s'inscrit dans la lignée des modèles de monde auto-supervisés type V-JEPA de Meta et des familles DINOv2/DINOv3, plutôt que dans celle des politiques VLA de bout en bout comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent directement une politique d'action plutôt qu'un modèle prédictif séparé. DUET-DINO reste à ce stade une publication de recherche évaluée sur des bancs d'essai contrôlés, sans déploiement industriel annoncé ; les auteurs promettent la publication du code et des checkpoints ainsi qu'une page projet dédiée, mais aucun calendrier de mise à disposition n'est précisé.

RecherchePaper
1 source
Un système robotique de perception-manipulation pour la découpe alimentaire
4arXiv cs.RO 

Un système robotique de perception-manipulation pour la découpe alimentaire

Une équipe de recherche publie sur arXiv (juillet 2026) un système de perception et manipulation robotique dédié à la découpe alimentaire, l'une des tâches les plus délicates pour les robots de cuisine. Le système combine deux modules : un premier de sélection du couteau, qui s'appuie sur les données de force capturées lors d'une coupe d'essai fixe pour identifier automatiquement l'outil adapté à l'aliment présenté, et un second de découpe adaptative piloté par apprentissage par renforcement (RL), qui ajuste en continu la trajectoire pour équilibrer vitesse de coupe et consommation d'énergie. Dans les expériences menées par les auteurs, le module de sélection de couteau atteint un taux de réussite de 100% sur des aliments jamais vus à l'entraînement, et les chercheurs comparent trois approches, une politique fixe préprogrammée, la politique RL, et des opérateurs humains, sur les mêmes tâches de découpe. L'enjeu dépasse la simple démonstration technique. La découpe alimentaire est réputée difficile à automatiser car les propriétés mécaniques des aliments, texture, dureté, élasticité, varient énormément d'un ingrédient à l'autre, ce qui oblige souvent à changer d'outil et de stratégie de coupe en cours de préparation. En obtenant des performances comparables à celles d'opérateurs humains, tout en automatisant le choix de l'outil via un simple test de force, cette approche adresse un goulot d'étranglement concret pour les robots de cuisine commerciaux, qu'il s'agisse de restauration automatisée, de traitement agroalimentaire ou de cuisine domestique assistée. Ce travail s'inscrit dans un courant de recherche plus large sur les robots de cuisine, un segment encore largement expérimental où la plupart des démonstrations restent limitées à des gestes simples ou répétitifs. Contrairement à une annonce produit, il s'agit ici d'un article de recherche, sans mention de partenaire industriel ni de calendrier de commercialisation. Les auteurs eux-mêmes cadrent leurs résultats comme une preuve de concept, ouvrant la voie à des tests sur une gamme plus large d'aliments et, potentiellement, à une intégration future dans des systèmes robotiques de cuisine plus complets.

RecherchePaper
1 source