Aller au contenu principal
BrickCraft : composition de compétences visuomotrices avec guidage manuel pour l'assemblage de briques emboîtables à long horizon
RecherchearXiv cs.RO 

BrickCraft : composition de compétences visuomotrices avec guidage manuel pour l'assemblage de briques emboîtables à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'Intelligent Control Lab ont déposé sur arXiv en mai 2026 (réf. 2605.07605) BrickCraft, un framework compositionnel pour l'assemblage autonome de briques emboîtables par bras robotique. L'approche repose sur une formulation relative : chaque étape est ancrée à une brique de référence dans la structure partielle, ce qui décompose toute séquence longue en un ensemble fini de compétences primitives réutilisables. Pour piloter l'exécution physique, le système introduit les "situated manuals", des guides spatiaux projetés en temps réel dans les observations du robot, permettant à des politiques visuomotrices apprises de recevoir un ancrage spatial précis sans avoir à reprogrammer chaque primitive pour chaque nouvelle structure. L'abstract ne précise ni le robot utilisé, ni les métriques chiffrées (taux de succès, temps de cycle), des informations attendues dans la version complète de l'article.

L'assemblage de briques emboîtables constitue un banc d'essai redoutable pour la manipulation fine : les tolérances d'emboîtement sont de l'ordre du dixième de millimètre, les séquences dépassent fréquemment plusieurs dizaines d'étapes, et une erreur de positionnement en amont propage des défauts irréversibles. BrickCraft s'attaque simultanément aux trois verrous classiques du domaine, à savoir le raisonnement sur horizon long, l'ancrage spatial (spatial grounding) et la manipulation fine, là où les approches end-to-end actuelles peinent à généraliser. La capacité à transférer des compétences apprises sur un nombre limité de démonstrations vers des structures inédites est particulièrement notable : elle indique que les primitives ne sont pas surajustées à une topologie spécifique, un écueil fréquent des méthodes par imitation en robotique d'assemblage.

Du côté de la compétition académique et industrielle, l'assemblage de briques LEGO a déjà mobilisé le MIT CSAIL, l'ETH Zurich via des approches de planification de tâches et mouvements (TAMP), et plus récemment des équipes exploitant des Vision-Language-Action models (VLA) comme Pi-0 d'Embodied Intelligence ou GR00T N2 de NVIDIA pour la manipulation généraliste. BrickCraft choisit un inductive bias différent : exploiter la structure hiérarchique et répétitive propre aux assemblages par emboîtement plutôt que viser une généralité totale, un parti pris qui peut s'avérer payant pour des applications industrielles ciblées comme le montage de kits, le prototypage ou les lignes de petites séries. Le projet dispose d'un site dédié, mais aucun partenariat industriel ni timeline de déploiement n'est annoncé à ce stade.

Dans nos dossiers

À lire aussi

BrickCraft-Duo : apprentissage et raffinement efficaces de compétences bi-bras pour l'assemblage compositionnel long horizon
1arXiv cs.RO 

BrickCraft-Duo : apprentissage et raffinement efficaces de compétences bi-bras pour l'assemblage compositionnel long horizon

L'équipe de recherche à l'origine du projet BrickCraft-Duo, dont le site est hébergé sous le compte GitHub de Jichuan Yu, présente un système d'apprentissage de compétences pour l'assemblage collaboratif de briques encastrables par deux bras robotiques. Le framework, modulaire, apprend des compétences réutilisables à bras unique et à bras double à partir de démonstrations, en exploitant un alignement de symétrie bilatérale qui permet de partager les compétences entre bras symétriques et entre rôles d'assemblage et de support. Un module de raisonnement tenant compte de la stabilité mécanique compose ensuite ces compétences hétérogènes pour exécuter de façon autonome des séquences longues, et une boucle de correction humaine permet d'affiner les compétences ciblées. Sur cinq tâches réelles impliquant des configurations partiellement soutenues et des séquences allant jusqu'à neuf étapes, le système atteint un taux de réussite d'au moins 60% sur l'ensemble de la tâche et un taux de complétion d'au moins 95% au niveau de chaque étape individuelle. Ce résultat s'inscrit dans un débat central de la robotique de manipulation: faut-il viser des modèles génériques de type vision-langage-action (VLA) entraînés bout en bout, ou des architectures modulaires composant des compétences spécialisées et réutilisables. En misant sur la composition de compétences plutôt que sur un apprentissage massif end-to-end, BrickCraft-Duo cherche à limiter le volume de données nécessaire tout en gardant une exécution robuste sur des tâches à tolérances d'insertion serrées et fortes dépendances inter-étapes, un défi typique de l'assemblage industriel de précision. Pour les intégrateurs et équipes R&D en manipulation bimanuelle, l'écart persistant entre le taux de réussite sur la tâche complète (60%) et le taux de complétion par étape (95%) illustre concrètement le problème de propagation d'erreurs dans les séquences longues, même quand chaque geste élémentaire est fiable. L'assemblage de briques encastrables sert ici de banc d'essai représentatif car il combine interactions mécaniques complexes, dépendances structurelles entre étapes et tolérances géométriques strictes, des propriétés transposables à l'assemblage industriel réel. L'approche se distingue des modèles VLA généralistes à grande échelle (à la Pi-0 ou GR00T) en misant sur une décomposition explicite des tâches et sur l'intervention humaine ciblée pour corriger les échecs, plutôt que sur une politique unique apprise de bout en bout. Le papier, référencé sur arXiv sous l'identifiant 2609.28281, ne précise pas de calendrier de mise à disposition du code ni de partenariat industriel; le site du projet est présenté comme point d'accès aux démonstrations et résultats détaillés.

RecherchePaper
1 source
FurnitureVLA : un modèle vision-langage-action pour l'assemblage de meubles bimanuel à long horizon
2arXiv cs.RO 

FurnitureVLA : un modèle vision-langage-action pour l'assemblage de meubles bimanuel à long horizon

Une équipe de recherche présente FurnitureVLA, décrite comme la première étude systématique de l'assemblage de meubles en bimanipulation à échelle réelle pilotée par un modèle vision-langage-action (VLA). Jusqu'ici, les travaux sur l'assemblage robotique de meubles se limitaient à des maquettes miniatures ou à des bras uniques. Les chercheurs ont construit un pipeline de simulation scalable pour générer des données expertes et évaluer les performances, ainsi qu'un système de téléopération en réalité virtuelle permettant à un seul opérateur de contrôler les deux bras simultanément pour collecter des démonstrations réelles de haute qualité. Pour gérer des tâches extrêmement longues, jusqu'à 7 sous-tâches et 1550 pas de contrôle, ils proposent un VLA "progress-enhanced", affiné sur des sous-tâches sémantiquement définies, qui prédit à la fois les actions et un signal de progression continu, permettant des transitions automatiques entre sous-tâches et limitant l'accumulation d'erreurs. En simulation, FurnitureVLA fait passer le taux de succès moyen de 48% à 80% par rapport aux méthodes de référence, sur trois types de meubles différents, avec un gain supplémentaire de 21% obtenu grâce à l'étude de facteurs de conception liés à la perception et au contrôle. Sur un bras robotique réel Kinova Gen3, la dégradation de performance reste limitée à 16% sur la tâche la plus difficile. Ce résultat s'attaque à un angle mort connu du secteur : la plupart des démonstrations de VLA généralistes (type GR00T, Pi-0 ou Helix) portent sur des tâches de manipulation courtes et à un seul bras, alors que l'assemblage de meubles exige coordination bimanuelle, précision millimétrique et enchaînement de dizaines d'étapes sans dérive cumulative. En prouvant qu'un signal de progression appris permet de tenir un horizon de plus de 1500 pas de contrôle avec une perte de performance contenue lors du transfert simulation-vers-réel, les auteurs apportent un argument concret en faveur de la viabilité des VLA pour des tâches industrielles longues, un enjeu clé pour les intégrateurs qui cherchent à automatiser des lignes d'assemblage complexes plutôt que du pick-and-place simple. Le travail s'inscrit dans la vague actuelle de recherche sur les modèles VLA appliqués à la manipulation fine, où la difficulté principale reste le passage de l'échelle jouet à l'échelle réelle et du bras unique à la bimanipulation coordonnée. En publiant à la fois le pipeline de simulation, le système de téléopération VR et les résultats de transfert vers un robot physique, les auteurs posent une base méthodologique reproductible que d'autres laboratoires pourront reprendre pour étendre l'assemblage long-horizon à d'autres catégories de produits.

RechercheActu
1 source
Extension de la mémoire à court terme des politiques visuomotrices pour les tâches à long horizon
3arXiv cs.RO 

Extension de la mémoire à court terme des politiques visuomotrices pour les tâches à long horizon

Des chercheurs ont soumis le 16 juin 2026 sur arXiv (2606.16178) une architecture transformer nommée PRISM, conçue pour doter les politiques visuomotrices entraînées par imitation learning d'une mémoire à court terme effective. Le système combine deux mécanismes : une attention filtrée (gated attention) qui supprime les corrélations parasites entre l'historique sensoriel et la prédiction d'action, et une architecture hiérarchique qui compresse les informations locales en tokens compacts pour capturer des dépendances temporelles étendues. PRISM maintient ainsi une mémoire opérationnelle sur environ deux minutes. Ses performances : 5 à 12 % de gains absolus sur les baselines les plus solides, et 11 à 15 % de mieux que sa variante sans mémoire sur RoboCasa et LIBERO, dépassant des modèles VLA fine-tunés comme GR00T-N1-3B (NVIDIA) et OpenVLA, sans aucun pré-entraînement à grande échelle. Les auteurs publient aussi ReMemBench, un benchmark de huit tâches de manipulation domestique couvrant quatre catégories mémorielles. La quasi-totalité des politiques visuomotrices actuelles n'exploitent que l'entrée sensorielle instantanée, les rendant incapables de gérer des tâches impliquant des objets temporairement occultés ou des actions à déclencher après un délai défini. PRISM démontre qu'une architecture mémoire soigneusement conçue peut surpasser des VLA massivement pré-entraînés, remettant en question l'hypothèse dominante selon laquelle la taille du corpus de pré-entraînement prime sur les choix architecturaux. Pour les intégrateurs et les décideurs industriels, ce résultat ouvre la voie à des politiques de manipulation longue séquence plus accessibles en calcul. PRISM s'inscrit dans un débat actif entre approches récurrentes (LSTM, Mamba) et architectures transformer pour les politiques de manipulation robotique. Les benchmarks RoboCasa et LIBERO font référence en simulation pour ce type de tâches, et des modèles comme GR00T-N1 de NVIDIA (3B paramètres) ou OpenVLA ont misé sur un pré-entraînement multimodal massif pour y performer. PRISM se positionne comme une alternative architecturale plus légère et sans pré-entraînement. Il faut toutefois souligner que tous les résultats sont obtenus en simulation : aucun transfert sim-to-real ni déploiement physique n'est annoncé, laissant ouverte la question de la robustesse sur robot réel.

RechercheOpinion
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
4arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source