Aller au contenu principal
RecherchearXiv cs.RO 

Système autonome TCAM pour la manipulation déformable : le système champion RMC2 à la WBCD 2026 Track 4

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

L'équipe RMC2 a remporté la première place du Track 4 « Deformable Manipulation Challenge » de la compétition WBCD 2026 : un robot devait prélever un T-shirt dans une pile, le charger sur une palette d'impression, aligner le col sur une zone cible, puis lisser la surface d'impression. Le système TCAM (TermiBrain Causal Action Model) tourne sur une plateforme bibras ARX X5 équipée d'une pince imprimée en 3D conçue pour la séparation monocouche de tissu, et perçoit la scène via quatre caméras montées au poignet : des fisheye supérieures pour le contexte global de la tâche, des RGB inférieures pour observer de près le contact pince-tissu. Entraîné sur un mélange de démonstrations portables de type UMI et de démonstrations réelles collectées sur le robot de déploiement, un backbone VLA multi-vues produit des chunks d'action de 30 pas en delta-pose de l'effecteur. En finale, le système a chargé 25 T-shirts en environ 23 secondes par tentative en moyenne, 22 atteignant le niveau de lissage de surface requis.

Ce résultat illustre une approche qui répartit la difficulté entre matériel, perception et données plutôt que de tout confier à la politique d'apprentissage : une boucle analyse chaque trajectoire pour identifier les causes physiques d'échec et cible ensuite la recollecte de données et le fine-tuning. Pour les intégrateurs textiles, logistiques ou d'impression sur vêtement, un taux de réussite de 88% (22 sur 25) et un temps de cycle moyen de 23 secondes donnent une mesure concrète de ce qu'une architecture VLA multi-vues peut accomplir sur une tâche à fort contact, plutôt qu'une démonstration isolée. Le résultat reste néanmoins obtenu dans le cadre contrôlé d'une compétition, sans déploiement industriel annoncé, ce qui laisse ouverte la question de la robustesse en production.

TCAM s'inscrit dans la vague des frameworks vision-language-action pour la manipulation généraliste, aux côtés de modèles comme Pi-0, GR00T N2 ou Helix, mais insiste sur la co-conception matériel-perception-données plutôt que sur la seule échelle du modèle. Le choix de la base ouverte ARX X5 et le recours à des démonstrations portables UMI reflètent une stratégie de données mixte, combinant priors génériques et dynamique spécifique au déploiement. Publié sur arXiv en août 2026, le rapport technique de RMC2 ne mentionne aucun calendrier de commercialisation ni de site de déploiement industriel, la compétition WBCD servant pour l'instant de validation académique plutôt que de vitrine produit.

Dans nos dossiers

À lire aussi

DSWAM : un modèle fondation à double système pour la manipulation robotique fine
1arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source
Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables
2arXiv cs.RO 

Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables

Des chercheurs ont publié le 29 mai 2026 un article (arXiv:2605.29407) présentant un système robotique capable de manipuler des objets déformables, comme des vêtements, avec une récupération autonome en cas d'échec. Le système, baptisé PHASER, repose sur une architecture hiérarchique en boucle fermée : un encodeur ACT (Action Chunking with Transformers) conditionné via FiLM (Feature-wise Linear Modulation) adapte l'extraction de features selon la phase courante de la tâche, permettant à une politique unifiée de produire des comportements distincts à chaque étape sans dupliquer les modèles. Un prédicteur de phase multimodal fusionne retour visuel, force et pose en temps réel pour estimer l'état courant et détecter les échecs de contact invisibles à la caméra. Un contrôleur d'impédance hybride assure l'exécution compliante. Validé sur la tâche d'accrochage et de retrait d'un T-shirt en manipulation bimanuelle, le système fait passer le taux de succès de 56 % à 87 % grâce à la récupération autonome des erreurs. Ce résultat est notable car la manipulation d'objets déformables reste un des verrous les plus résistants de la robotique industrielle et domestique : les propriétés mécaniques imprévisibles du tissu rendent caduques les approches rigides classiques. Le problème de state aliasing, où des observations visuellement similaires exigent des actions contradictoires selon la phase, sabote les politiques d'imitation standard en inférence markovienne. En conditionnant la politique sur la phase estimée plutôt que sur l'observation brute, et en intégrant le retour de force comme signal de détection d'anomalie, les auteurs montrent qu'il est possible de construire un pipeline sim-to-real sans oracle externe. Les études d'ablation confirment que le conditionnement FiLM surpasse significativement les baselines non conditionnées et celles à token-level, et l'analyse t-SNE valide que les représentations apprises sont bien séparées par phase. L'approche s'inscrit dans la lignée des travaux sur l'imitation learning pour la manipulation dextre, notamment ACT (Chi et al., 2023) et les Diffusion Policies, qui peinent sur les objets non rigides. Elle se distingue des frameworks VLA (Vision-Language-Action) à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la généralisation par préentraînement massif plutôt que sur la structure de la tâche. PHASER adopte une stratégie inverse : contrainte forte sur la structure de phase, données limitées, récupération explicite. Les auteurs publient le code et les vidéos en open access. Les prochaines étapes naturelles incluent l'extension à d'autres classes de vêtements et la réduction de la dépendance à l'interface de télé-opération haptique pour la collecte de données d'entraînement.

RecherchePaper
1 source
ROBOCYCLE : manipulation et coordination robotiques autonomes à deux bras pour le recyclage
3arXiv cs.RO 

ROBOCYCLE : manipulation et coordination robotiques autonomes à deux bras pour le recyclage

Des chercheurs présentent ROBOCYCLE, une plateforme robotique autonome à deux bras conçue pour le tri des déchets recyclables, calibrée pour répondre aux normes de recyclage de la métropole de Tokyo. Le système combine une perception RGB-D multi-vues, une segmentation d'instances basée sur le transformeur RF-DETR, et une planification de prise à 6 degrés de liberté (DoF) via le SDK Anygrasp. En traitant des nuages de points segmentés, la plateforme génère des poses de préhension robustes pour des objets irréguliers, déformables ou encombrés (bouteilles en PET froissées, emballages transparents, déchets mélangés). Les résultats annoncés font état d'un taux de réussite de préhension de 90,3% et d'un taux de réussite global des tâches de 84,3%, incluant des opérations coordonnées complexes comme le dévissage de bouchons de bouteilles PET avant tri. Le tri des déchets reste l'un des angles morts de la robotique industrielle : les objets transparents, déformables ou empilés de façon chaotique mettent en échec la plupart des systèmes de vision et de préhension actuels, ce qui oblige encore de nombreux centres de tri à s'appuyer sur du personnel humain malgré des pénuries de main-d'œuvre croissantes dans ce secteur. Un taux de réussite de tâche proche de 85% sur ce type de matériaux, si confirmé en conditions réelles et pas seulement en environnement contrôlé de laboratoire, marquerait une avancée notable par rapport aux pilotes existants, généralement limités à des flux de déchets homogènes ou pré-triés. Pour les opérateurs de centres de tri, les intégrateurs de systèmes et les décideurs municipaux, ROBOCYCLE montre comment l'association de modèles de segmentation récents et de SDK de préhension commerciaux comme Anygrasp permet de construire rapidement des démonstrateurs crédibles, sans développer une pile de perception et de manipulation entièrement propriétaire. ROBOCYCLE s'inscrit dans une vague de recherche académique visant à automatiser le tri sélectif face à la hausse des volumes de déchets urbains, un problème documenté de longue date au Japon, où les normes de recyclage, notamment à Tokyo, comptent parmi les plus strictes au monde. Le projet assemble des briques technologiques existantes plutôt que de proposer un nouveau modèle de bout en bout : RF-DETR pour la segmentation d'instances et Anygrasp pour la planification de prise, deux outils déjà exploités dans d'autres travaux de manipulation robotique en entrepôt. Publié comme article de recherche sur arXiv, ROBOCYCLE reste à ce stade un prototype académique dont les résultats n'ont pas encore été validés par un déploiement commercial ou industriel ; les auteurs ne précisent aucun calendrier de transfert vers un site de tri réel ni d'accord avec un opérateur de gestion des déchets.

RecherchePaper
1 source
Un système robotique de perception-manipulation pour la découpe alimentaire
4arXiv cs.RO 

Un système robotique de perception-manipulation pour la découpe alimentaire

Une équipe de recherche publie sur arXiv (juillet 2026) un système de perception et manipulation robotique dédié à la découpe alimentaire, l'une des tâches les plus délicates pour les robots de cuisine. Le système combine deux modules : un premier de sélection du couteau, qui s'appuie sur les données de force capturées lors d'une coupe d'essai fixe pour identifier automatiquement l'outil adapté à l'aliment présenté, et un second de découpe adaptative piloté par apprentissage par renforcement (RL), qui ajuste en continu la trajectoire pour équilibrer vitesse de coupe et consommation d'énergie. Dans les expériences menées par les auteurs, le module de sélection de couteau atteint un taux de réussite de 100% sur des aliments jamais vus à l'entraînement, et les chercheurs comparent trois approches, une politique fixe préprogrammée, la politique RL, et des opérateurs humains, sur les mêmes tâches de découpe. L'enjeu dépasse la simple démonstration technique. La découpe alimentaire est réputée difficile à automatiser car les propriétés mécaniques des aliments, texture, dureté, élasticité, varient énormément d'un ingrédient à l'autre, ce qui oblige souvent à changer d'outil et de stratégie de coupe en cours de préparation. En obtenant des performances comparables à celles d'opérateurs humains, tout en automatisant le choix de l'outil via un simple test de force, cette approche adresse un goulot d'étranglement concret pour les robots de cuisine commerciaux, qu'il s'agisse de restauration automatisée, de traitement agroalimentaire ou de cuisine domestique assistée. Ce travail s'inscrit dans un courant de recherche plus large sur les robots de cuisine, un segment encore largement expérimental où la plupart des démonstrations restent limitées à des gestes simples ou répétitifs. Contrairement à une annonce produit, il s'agit ici d'un article de recherche, sans mention de partenaire industriel ni de calendrier de commercialisation. Les auteurs eux-mêmes cadrent leurs résultats comme une preuve de concept, ouvrant la voie à des tests sur une gamme plus large d'aliments et, potentiellement, à une intégration future dans des systèmes robotiques de cuisine plus complets.

RecherchePaper
1 source