Aller au contenu principal
Manipulation d'objets par un système de treillis à topologie variable
RecherchearXiv cs.RO 

Manipulation d'objets par un système de treillis à topologie variable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en mai 2025 sur arXiv (référence 2605.13086) une stratégie de manipulation d'objets pour le Variable Topology Truss (VTT), un robot truss composé de membres actionnés reliés entre eux par des joints sphériques passifs dont la topologie structurale peut être reconfigurée à la demande. Jusqu'ici, cette classe de robot était démontrée pour ses capacités cinématiques, sans méthode formalisée pour saisir ou déplacer des objets. Les auteurs proposent un cadre de contrôle hybride qui régule simultanément position et force, sans découplage explicite entre les deux objectifs. Au niveau de chaque actionneur, un contrôleur à rétroaction de force par capteur génère les forces axiales souhaitées malgré une friction mécanique élevée, problème récurrent dans ces mécanismes. Au niveau de la tâche, les forces appliquées aux noeuds effecteurs sont calculées à partir d'un modèle statique du VTT. Les expériences portent sur un module unitaire puis sur le système complet dans deux configurations de manipulation représentatives, avec évaluation quantitative du suivi combiné position-force.

Cette contribution comble un écart méthodologique structurant: les robots truss avaient été identifiés comme des manipulateurs à déploiement rapide, notamment pour des environnements contraints (robotique spatiale, intervention d'urgence, infrastructure adaptative), mais l'absence de stratégie de manipulation fiable les maintenait au stade de démonstrateurs cinématiques. Traiter explicitement la friction élevée des actionneurs via la rétroaction de force rapproche la démarche des contraintes d'un déploiement réel. La validation expérimentale quantitative, plutôt qu'une démonstration vidéo qualitative, renforce la crédibilité des résultats. Il convient toutefois de noter que la publication reste un preprint, non encore soumis à évaluation par les pairs.

Les robots truss reconfigurables constituent une voie distincte des manipulateurs sériels classiques (bras 6-DOF type KUKA, UR) et des architectures parallèles (Delta, Stewart): leur avantage théorique réside dans une reconfiguration structurale à la volée, potentiellement utile pour des tâches à géométrie variable. Le VTT s'inscrit dans une lignée de travaux sur les treillis actifs explorés depuis les années 1990 principalement pour la robotique spatiale et les structures adaptatives. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans l'article; les suites naturelles porteraient sur la généralisation à des topologies plus complexes, des charges utiles plus importantes et une validation en environnement non structuré.

Dans nos dossiers

À lire aussi

ArtManip : manipulation en main d'objets articulés par catégorie
1arXiv cs.RO 

ArtManip : manipulation en main d'objets articulés par catégorie

Des chercheurs ont présenté ArtManip, une méthode d'apprentissage décrite comme la première à réaliser la manipulation en main d'objets articulés au niveau de la catégorie, avec généralisation aux instances inédites et aux prises initiales variées, pour des mains robotiques dextres. L'article, publié sur arXiv sous la référence 2609.12498, détaille un pipeline automatisé qui génère de manière procédurale des objets articulés variés et synthétise des prises fonctionnelles orientées tâche, évitant la collecte manuelle jusque-là nécessaire pour constituer des jeux de modèles d'objets et de démonstrations de saisie. La politique de contrôle est entraînée en deux étapes, combinant randomisation de la physique des articulations, curriculum de récompense progressif et distillation de représentations latentes pour gérer les contacts complexes et la dynamique des jointures. Les tests couvrent quatre catégories d'objets articulés en simulation, avec un transfert zero-shot réussi vers 12 objets réels aux formes et mécanismes de jointure variés, sans réentraînement spécifique. Le travail s'attaque à un verrou connu de la manipulation dextre: contrôler les degrés de liberté internes d'un objet articulé, comme une charnière, un tiroir ou un mécanisme à ciseaux, tout en maintenant une prise stable sur une base flottante, un couplage que la plupart des méthodes existantes contournent en se limitant à des objets rigides ou à des instances déjà vues à l'entraînement. Pour les laboratoires et intégrateurs travaillant sur la dextérité robotique, une généralisation inter-instances et inter-configurations, plutôt qu'un simple transfert sim-to-real sur un objet isolé, constitue un signal notable: elle suggère que l'écart entre simulation et monde réel peut se réduire même sur des tâches à haute dimensionnalité de contrôle. Le résultat reste néanmoins circonscrit à 12 objets réels et quatre catégories, loin d'un système déployé en production ou intégré à un produit commercial. Cette recherche s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement en simulation physique haute-fidélité appliqué à la dextérité robotique, un axe qui coexiste avec les approches fondées sur des modèles vision-langage-action généralistes à politique unique multi-tâche. ArtManip se distingue en ciblant la généralisation au niveau de la catégorie d'objet plutôt que la polyvalence des tâches, et en misant sur une génération automatisée des données d'entraînement pour contourner le coût de collecte manuelle de prises fonctionnelles, identifié par les auteurs comme un frein majeur au passage à l'échelle. Aucun plan de déploiement industriel ni partenariat matériel n'est mentionné à ce stade: la publication demeure un résultat de recherche, dont l'extension à davantage de catégories d'objets et de plateformes physiques constitue la suite logique annoncée.

RecherchePaper
1 source
DSWAM : un modèle fondation à double système pour la manipulation robotique fine
2arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source
Triplet2Track : un système hiérarchique à représentations centrées objets pour une manipulation fiable à long horizon
3arXiv cs.RO 

Triplet2Track : un système hiérarchique à représentations centrées objets pour une manipulation fiable à long horizon

Des chercheurs publient le Triplet-to-Track System (TTS), décrit dans un article déposé sur arXiv sous la référence 2608.22800v1 fin août 2026. Il s'agit d'un système hiérarchique en boucle fermée pour l'apprentissage par imitation appliqué à la manipulation robotique à long horizon, conçu pour s'appuyer sur des vidéos humaines plutôt que sur des données collectées directement par des robots. TTS représente les sous-objectifs de haut niveau sous forme de triplets ancrés dans les instances d'objets présents dans la scène, les traduit en « track priors », des trajectoires de référence continues guidant l'exécution bas niveau, puis surveille en permanence la progression de la tâche à partir des observations pour déclencher une replanification en ligne si nécessaire. Sur un ensemble diversifié de tâches réelles à long horizon, le système atteint un taux de réussite moyen de 74,8 % et démontre une capacité de généralisation à la fois au niveau des objets et de manière compositionnelle, c'est-à-dire sur des combinaisons de sous-tâches non vues à l'entraînement. Ce résultat s'attaque à une fracture bien connue du secteur robotique entre la démonstration impressionnante et la fiabilité réelle en usage prolongé. Les modèles VLA (vision-language-action) end-to-end restent gourmands en données et largement opaques, rendant le diagnostic d'échec quasi impossible, tandis que les pipelines hiérarchiques classiques, plus interprétables, produisent souvent des plans mal ancrés dans les observations et déconnectés des actions bas niveau, ce qui provoque des comportements en boucle ouverte et des erreurs de planification proches de l'hallucination. En combinant représentation orientée objet, trajectoires continues et boucle de feedback en ligne, TTS cherche à réconcilier interprétabilité et robustesse. Pour les intégrateurs et décideurs industriels, l'apport le plus concret est la réduction de la dépendance à des flottes de téléopération coûteuses au profit de vidéos humaines, une source de données bien plus facile à faire monter en échelle. TTS s'inscrit dans un débat de recherche non tranché entre modèles VLA généralistes et architectures hiérarchiques à base de plans, sans qu'aucune des deux écoles n'ait résolu seule le compromis entre lisibilité des décisions et fiabilité en boucle fermée. L'article ne précise ni le laboratoire d'origine ni une intégration prévue sur une plateforme commerciale existante ; il s'agit à ce stade d'une contribution académique, et le taux de 74,8 %, mesuré sur des tâches choisies par les auteurs, reste à confirmer sur des benchmarks indépendants avant toute extrapolation à des déploiements industriels réels.

RecherchePaper
1 source
TiPToP : un système modulaire de manipulation robotique en vocabulaire ouvert, capable de planifier
4arXiv cs.RO 

TiPToP : un système modulaire de manipulation robotique en vocabulaire ouvert, capable de planifier

TiPToP, un système modulaire de manipulation robotique présenté dans un article arXiv (2603.09971), combine des modèles de fondation pré-entraînés avec un planificateur de tâches et de mouvements (TAMP) accéléré par GPU pour exécuter des consignes directement à partir d'images RGB et de langage naturel, sans aucune donnée d'entraînement robotique spécifique. Le système se déploie sur une configuration DROID standard en moins d'une heure et s'adapte à de nouvelles morphologies de robot avec un effort minimal. Les chercheurs l'ont comparé à Pi-0.5-DROID, un modèle vision-langage-action (VLA) affiné sur 350 heures de démonstrations, sur deux installations DROID réelles (dont une opérée par une équipe externe) ainsi qu'en simulation. TiPToP y obtient un taux de réussite moyen supérieur et un temps d'exécution plus rapide. Sur le benchmark MolmoSpaces, il se classe premier sur les tâches de préhension simple et de préhension-et-placement parmi les méthodes n'ayant pas été entraînées sur des données de la même distribution. Le code et le site du projet sont disponibles en libre accès (tiptop-robot.github.io). Ce résultat pèse dans un débat central du secteur : celui de l'approche VLA de bout en bout, gourmande en démonstrations réelles, face à des architectures modulaires combinant perception, planification et exécution séparées. En battant un VLA entraîné sur 350 heures de téléopération sans utiliser de données robot du tout, TiPToP suggère que la planification symbolique appuyée sur des modèles de fondation généralistes peut rivaliser, voire dépasser, l'apprentissage bout-en-bout sur des tâches de manipulation courantes. Pour les intégrateurs et équipes de recherche en robotique, l'argument de déploiement en moins d'une heure sur du matériel standard, sans collecte de données propriétaire, change potentiellement le calcul coût/bénéfice face aux VLA qui nécessitent des semaines de téléopération avant le moindre test. L'atout de traçabilité des échecs par composant, propre à la modularité, est aussi un argument pratique pour le débogage industriel, souvent absent des architectures VLA monolithiques. Le projet s'inscrit dans la lignée des travaux combinant TAMP classique et modèles de fondation, à mesure que des benchmarks comme MolmoSpaces et le protocole DROID (plateforme de collecte et d'évaluation partagée entre laboratoires) se standardisent pour comparer objectivement les approches. Les résultats restent toutefois auto-rapportés par les auteurs, sur un nombre limité de configurations matérielles, et demandent confirmation par des équipes tierces indépendantes à plus grande échelle avant de trancher définitivement le débat modulaire contre bout-en-bout.

RecherchePaper
1 source