Aller au contenu principal
Système autonome TCAM pour la manipulation déformable : le système champion RMC2 à la WBCD 2026 Track 4
RecherchearXiv cs.RO 

Système autonome TCAM pour la manipulation déformable : le système champion RMC2 à la WBCD 2026 Track 4

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

L'équipe RMC2 a remporté la première place du Track 4 « Deformable Manipulation Challenge » de la compétition WBCD 2026 : un robot devait prélever un T-shirt dans une pile, le charger sur une palette d'impression, aligner le col sur une zone cible, puis lisser la surface d'impression. Le système TCAM (TermiBrain Causal Action Model) tourne sur une plateforme bibras ARX X5 équipée d'une pince imprimée en 3D conçue pour la séparation monocouche de tissu, et perçoit la scène via quatre caméras montées au poignet : des fisheye supérieures pour le contexte global de la tâche, des RGB inférieures pour observer de près le contact pince-tissu. Entraîné sur un mélange de démonstrations portables de type UMI et de démonstrations réelles collectées sur le robot de déploiement, un backbone VLA multi-vues produit des chunks d'action de 30 pas en delta-pose de l'effecteur. En finale, le système a chargé 25 T-shirts en environ 23 secondes par tentative en moyenne, 22 atteignant le niveau de lissage de surface requis.

Ce résultat illustre une approche qui répartit la difficulté entre matériel, perception et données plutôt que de tout confier à la politique d'apprentissage : une boucle analyse chaque trajectoire pour identifier les causes physiques d'échec et cible ensuite la recollecte de données et le fine-tuning. Pour les intégrateurs textiles, logistiques ou d'impression sur vêtement, un taux de réussite de 88% (22 sur 25) et un temps de cycle moyen de 23 secondes donnent une mesure concrète de ce qu'une architecture VLA multi-vues peut accomplir sur une tâche à fort contact, plutôt qu'une démonstration isolée. Le résultat reste néanmoins obtenu dans le cadre contrôlé d'une compétition, sans déploiement industriel annoncé, ce qui laisse ouverte la question de la robustesse en production.

TCAM s'inscrit dans la vague des frameworks vision-language-action pour la manipulation généraliste, aux côtés de modèles comme Pi-0, GR00T N2 ou Helix, mais insiste sur la co-conception matériel-perception-données plutôt que sur la seule échelle du modèle. Le choix de la base ouverte ARX X5 et le recours à des démonstrations portables UMI reflètent une stratégie de données mixte, combinant priors génériques et dynamique spécifique au déploiement. Publié sur arXiv en août 2026, le rapport technique de RMC2 ne mentionne aucun calendrier de commercialisation ni de site de déploiement industriel, la compétition WBCD servant pour l'instant de validation académique plutôt que de vitrine produit.

Dans nos dossiers

À lire aussi

DSWAM : un modèle fondation à double système pour la manipulation robotique fine
1arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source
Du déploiement à la réinitialisation : un système d'évaluation par graphe pour la manipulation autonome à long horizon
2arXiv cs.RO 

Du déploiement à la réinitialisation : un système d'évaluation par graphe pour la manipulation autonome à long horizon

Publié sur arXiv (2609.19413v1) le 18 septembre 2026, l'article présente HALTER, un système qui automatise l'évaluation de politiques de manipulation robotique sur des tâches longues, en particulier la remise à zéro de la scène entre essais, jusqu'ici confiée à un opérateur humain. Testé sur un bras Franka pour quatre tâches longues, HALTER restaure correctement la scène dans 76% des épisodes, contre 52% pour AutoEval et 65% pour un reset par planification de mouvement classique. Il estime juste la fraction de compétences accomplies dans 90% des cas, contre 76% pour AutoEval, et son verdict de vérification du reset est correct dans 91% des épisodes contre 78%. Le système réduit aussi de 72% le temps d'opérateur d'une campagne d'évaluation par rapport à un reset manuel, et sur trois tâches inédites testant la généralisation compositionnelle, il réussit le reset dans 74,7% des épisodes contre seulement 1,3% pour une politique de reset entraînée tâche par tâche. Cette avancée cible un vrai goulot d'étranglement de la recherche en robotique: l'évaluation sur robot réel reste la référence des progrès en manipulation, mais reset la scène à la main coûte du temps et laisse la distribution des états initiaux mal définie, ce qui nuit à la reproductibilité des résultats. En automatisant reset et notation pour des tâches multi-étapes sans images de succès annotées, HALTER change l'économie des campagnes de test: le coût de démonstration croît avec la taille d'une bibliothèque de compétences de reset réutilisables, et non plus avec le nombre combinatoire d'états terminaux possibles. Pour les équipes qui entraînent des modèles vision-langage-action à grande échelle, cela ouvre la voie à des benchmarks continus moins gourmands en supervision humaine, dans un secteur qui cherche justement à distinguer démonstrations triées et performance réellement mesurée. HALTER prolonge AutoEval, système antérieur capable d'automatiser reset et notation mais seulement pour des tâches à une étape, un essai long pouvant se terminer dans un nombre combinatoirement grand de configurations qu'aucune politique de reset apprise ne couvre seule. La solution construit en ligne un graphe de scène à partir de nuages de points et de modèles de vision, qu'un grand modèle de langage utilise pour noter la tâche, planifier le reset via une bibliothèque de compétences atomiques, et vérifier sa réussite. Les auteurs ont aussi testé différentes représentations de la scène et fréquences de mise à jour du graphe, sans annoncer de calendrier de déploiement au-delà de ce cadre expérimental sur bras Franka.

RecherchePaper
1 source
Triplet2Track : un système hiérarchique à représentations centrées objets pour une manipulation fiable à long horizon
3arXiv cs.RO 

Triplet2Track : un système hiérarchique à représentations centrées objets pour une manipulation fiable à long horizon

Des chercheurs publient le Triplet-to-Track System (TTS), décrit dans un article déposé sur arXiv sous la référence 2608.22800v1 fin août 2026. Il s'agit d'un système hiérarchique en boucle fermée pour l'apprentissage par imitation appliqué à la manipulation robotique à long horizon, conçu pour s'appuyer sur des vidéos humaines plutôt que sur des données collectées directement par des robots. TTS représente les sous-objectifs de haut niveau sous forme de triplets ancrés dans les instances d'objets présents dans la scène, les traduit en « track priors », des trajectoires de référence continues guidant l'exécution bas niveau, puis surveille en permanence la progression de la tâche à partir des observations pour déclencher une replanification en ligne si nécessaire. Sur un ensemble diversifié de tâches réelles à long horizon, le système atteint un taux de réussite moyen de 74,8 % et démontre une capacité de généralisation à la fois au niveau des objets et de manière compositionnelle, c'est-à-dire sur des combinaisons de sous-tâches non vues à l'entraînement. Ce résultat s'attaque à une fracture bien connue du secteur robotique entre la démonstration impressionnante et la fiabilité réelle en usage prolongé. Les modèles VLA (vision-language-action) end-to-end restent gourmands en données et largement opaques, rendant le diagnostic d'échec quasi impossible, tandis que les pipelines hiérarchiques classiques, plus interprétables, produisent souvent des plans mal ancrés dans les observations et déconnectés des actions bas niveau, ce qui provoque des comportements en boucle ouverte et des erreurs de planification proches de l'hallucination. En combinant représentation orientée objet, trajectoires continues et boucle de feedback en ligne, TTS cherche à réconcilier interprétabilité et robustesse. Pour les intégrateurs et décideurs industriels, l'apport le plus concret est la réduction de la dépendance à des flottes de téléopération coûteuses au profit de vidéos humaines, une source de données bien plus facile à faire monter en échelle. TTS s'inscrit dans un débat de recherche non tranché entre modèles VLA généralistes et architectures hiérarchiques à base de plans, sans qu'aucune des deux écoles n'ait résolu seule le compromis entre lisibilité des décisions et fiabilité en boucle fermée. L'article ne précise ni le laboratoire d'origine ni une intégration prévue sur une plateforme commerciale existante ; il s'agit à ce stade d'une contribution académique, et le taux de 74,8 %, mesuré sur des tâches choisies par les auteurs, reste à confirmer sur des benchmarks indépendants avant toute extrapolation à des déploiements industriels réels.

RecherchePaper
1 source
Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables
4arXiv cs.RO 

Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables

Des chercheurs ont publié le 29 mai 2026 un article (arXiv:2605.29407) présentant un système robotique capable de manipuler des objets déformables, comme des vêtements, avec une récupération autonome en cas d'échec. Le système, baptisé PHASER, repose sur une architecture hiérarchique en boucle fermée : un encodeur ACT (Action Chunking with Transformers) conditionné via FiLM (Feature-wise Linear Modulation) adapte l'extraction de features selon la phase courante de la tâche, permettant à une politique unifiée de produire des comportements distincts à chaque étape sans dupliquer les modèles. Un prédicteur de phase multimodal fusionne retour visuel, force et pose en temps réel pour estimer l'état courant et détecter les échecs de contact invisibles à la caméra. Un contrôleur d'impédance hybride assure l'exécution compliante. Validé sur la tâche d'accrochage et de retrait d'un T-shirt en manipulation bimanuelle, le système fait passer le taux de succès de 56 % à 87 % grâce à la récupération autonome des erreurs. Ce résultat est notable car la manipulation d'objets déformables reste un des verrous les plus résistants de la robotique industrielle et domestique : les propriétés mécaniques imprévisibles du tissu rendent caduques les approches rigides classiques. Le problème de state aliasing, où des observations visuellement similaires exigent des actions contradictoires selon la phase, sabote les politiques d'imitation standard en inférence markovienne. En conditionnant la politique sur la phase estimée plutôt que sur l'observation brute, et en intégrant le retour de force comme signal de détection d'anomalie, les auteurs montrent qu'il est possible de construire un pipeline sim-to-real sans oracle externe. Les études d'ablation confirment que le conditionnement FiLM surpasse significativement les baselines non conditionnées et celles à token-level, et l'analyse t-SNE valide que les représentations apprises sont bien séparées par phase. L'approche s'inscrit dans la lignée des travaux sur l'imitation learning pour la manipulation dextre, notamment ACT (Chi et al., 2023) et les Diffusion Policies, qui peinent sur les objets non rigides. Elle se distingue des frameworks VLA (Vision-Language-Action) à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la généralisation par préentraînement massif plutôt que sur la structure de la tâche. PHASER adopte une stratégie inverse : contrainte forte sur la structure de phase, données limitées, récupération explicite. Les auteurs publient le code et les vidéos en open access. Les prochaines étapes naturelles incluent l'extension à d'autres classes de vêtements et la réduction de la dépendance à l'interface de télé-opération haptique pour la collecte de données d'entraînement.

RecherchePaper
1 source