Aller au contenu principal
TiPToP : un système modulaire de manipulation robotique en vocabulaire ouvert, capable de planifier
RecherchearXiv cs.RO 

TiPToP : un système modulaire de manipulation robotique en vocabulaire ouvert, capable de planifier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

TiPToP, un système modulaire de manipulation robotique présenté dans un article arXiv (2603.09971), combine des modèles de fondation pré-entraînés avec un planificateur de tâches et de mouvements (TAMP) accéléré par GPU pour exécuter des consignes directement à partir d'images RGB et de langage naturel, sans aucune donnée d'entraînement robotique spécifique. Le système se déploie sur une configuration DROID standard en moins d'une heure et s'adapte à de nouvelles morphologies de robot avec un effort minimal. Les chercheurs l'ont comparé à Pi-0.5-DROID, un modèle vision-langage-action (VLA) affiné sur 350 heures de démonstrations, sur deux installations DROID réelles (dont une opérée par une équipe externe) ainsi qu'en simulation. TiPToP y obtient un taux de réussite moyen supérieur et un temps d'exécution plus rapide. Sur le benchmark MolmoSpaces, il se classe premier sur les tâches de préhension simple et de préhension-et-placement parmi les méthodes n'ayant pas été entraînées sur des données de la même distribution. Le code et le site du projet sont disponibles en libre accès (tiptop-robot.github.io).

Ce résultat pèse dans un débat central du secteur : celui de l'approche VLA de bout en bout, gourmande en démonstrations réelles, face à des architectures modulaires combinant perception, planification et exécution séparées. En battant un VLA entraîné sur 350 heures de téléopération sans utiliser de données robot du tout, TiPToP suggère que la planification symbolique appuyée sur des modèles de fondation généralistes peut rivaliser, voire dépasser, l'apprentissage bout-en-bout sur des tâches de manipulation courantes. Pour les intégrateurs et équipes de recherche en robotique, l'argument de déploiement en moins d'une heure sur du matériel standard, sans collecte de données propriétaire, change potentiellement le calcul coût/bénéfice face aux VLA qui nécessitent des semaines de téléopération avant le moindre test. L'atout de traçabilité des échecs par composant, propre à la modularité, est aussi un argument pratique pour le débogage industriel, souvent absent des architectures VLA monolithiques.

Le projet s'inscrit dans la lignée des travaux combinant TAMP classique et modèles de fondation, à mesure que des benchmarks comme MolmoSpaces et le protocole DROID (plateforme de collecte et d'évaluation partagée entre laboratoires) se standardisent pour comparer objectivement les approches. Les résultats restent toutefois auto-rapportés par les auteurs, sur un nombre limité de configurations matérielles, et demandent confirmation par des équipes tierces indépendantes à plus grande échelle avant de trancher définitivement le débat modulaire contre bout-en-bout.

À lire aussi

De la perception à l'assistance : autonomie partagée à vocabulaire ouvert pour la manipulation robotique
1arXiv cs.RO 

De la perception à l'assistance : autonomie partagée à vocabulaire ouvert pour la manipulation robotique

Des chercheurs présentent un système d'autonomie partagée pour la téléopération de bras manipulateurs en environnement industriel, publié le 24 juillet 2026 sur arXiv (référence 2607.17323). Le dispositif repose sur une seule caméra RGB-D qui capture les mouvements du bras et les gestes de la main de l'opérateur, sans combinaison connectée, marqueur fiduciaire ni étape de calibration préalable. La cible à saisir est désignée par une simple consigne textuelle en langage libre, interprétée par un modèle vision-langage via la caméra embarquée sur le préhenseur, puis suivie en continu par un modèle de segmentation vidéo promptable sur les caméras du robot, ce qui isole en permanence un repère de saisie de la carte des obstacles. Un contrôleur prédictif (MPC) accéléré par GPU exécute chaque commande tout en évitant les collisions avec l'environnement et avec le robot lui même, grâce à une reconstruction volumétrique calculée en temps réel, pendant qu'un champ de potentiel corrige la trajectoire de l'opérateur lors de l'approche finale. Testé sur un manipulateur mobile quadrupède, le système atteint une précision de positionnement de 59 mm d'erreur quadratique moyenne par rapport à une référence de capture de mouvement, et maintient le bras à au moins 18 cm des obstacles même lorsque l'opérateur tente délibérément une collision de 6 cm. Sur une tâche de manipulation de vanne industrielle et une tâche de prise dépose, le framework complet réussit tous les essais, tandis que le mode entièrement autonome, déclenché par geste, réussit quatre essais sur cinq par tâche. L'intérêt pour l'industrie robotique tient au problème visé: en téléopération classique, aligner précisément un effecteur avec une cible en environnement encombré, avec une perception de profondeur limitée par caméra, reste une source d'erreurs et de collisions coûteuses. En retirant marqueurs et calibration tout en gardant l'opérateur dans la boucle de décision, le système promet un déploiement plus rapide sur des cellules industrielles existantes. Le fait que retirer soit le module de collision, soit le module d'assistance provoque des échecs par des mécanismes différents montre que les deux briques sont complémentaires et non redondantes, un signal utile pour les intégrateurs qui évaluent la robustesse réelle de ces architectures avant tout achat. Le travail s'inscrit dans la convergence actuelle entre modèles vision-langage et téléopération assistée, où l'ancrage d'instructions textuelles dans la perception robotique gagne du terrain face aux interfaces manuelles pures. Les auteurs positionnent leur contribution comme une alternative légère aux pipelines nécessitant équipement dédié ou calibration lourde, et annoncent la possibilité de basculer vers une exécution autonome sur la même cible sans pipeline de perception séparé, ouvrant la voie à des essais plus poussés sur d'autres plateformes et tâches industrielles.

RecherchePaper
1 source
DSWAM : un modèle fondation à double système pour la manipulation robotique fine
2arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source
Un système robotique de perception-manipulation pour la découpe alimentaire
3arXiv cs.RO 

Un système robotique de perception-manipulation pour la découpe alimentaire

Une équipe de recherche publie sur arXiv (juillet 2026) un système de perception et manipulation robotique dédié à la découpe alimentaire, l'une des tâches les plus délicates pour les robots de cuisine. Le système combine deux modules : un premier de sélection du couteau, qui s'appuie sur les données de force capturées lors d'une coupe d'essai fixe pour identifier automatiquement l'outil adapté à l'aliment présenté, et un second de découpe adaptative piloté par apprentissage par renforcement (RL), qui ajuste en continu la trajectoire pour équilibrer vitesse de coupe et consommation d'énergie. Dans les expériences menées par les auteurs, le module de sélection de couteau atteint un taux de réussite de 100% sur des aliments jamais vus à l'entraînement, et les chercheurs comparent trois approches, une politique fixe préprogrammée, la politique RL, et des opérateurs humains, sur les mêmes tâches de découpe. L'enjeu dépasse la simple démonstration technique. La découpe alimentaire est réputée difficile à automatiser car les propriétés mécaniques des aliments, texture, dureté, élasticité, varient énormément d'un ingrédient à l'autre, ce qui oblige souvent à changer d'outil et de stratégie de coupe en cours de préparation. En obtenant des performances comparables à celles d'opérateurs humains, tout en automatisant le choix de l'outil via un simple test de force, cette approche adresse un goulot d'étranglement concret pour les robots de cuisine commerciaux, qu'il s'agisse de restauration automatisée, de traitement agroalimentaire ou de cuisine domestique assistée. Ce travail s'inscrit dans un courant de recherche plus large sur les robots de cuisine, un segment encore largement expérimental où la plupart des démonstrations restent limitées à des gestes simples ou répétitifs. Contrairement à une annonce produit, il s'agit ici d'un article de recherche, sans mention de partenaire industriel ni de calendrier de commercialisation. Les auteurs eux-mêmes cadrent leurs résultats comme une preuve de concept, ouvrant la voie à des tests sur une gamme plus large d'aliments et, potentiellement, à une intégration future dans des systèmes robotiques de cuisine plus complets.

RecherchePaper
1 source
Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action
4arXiv cs.RO 

Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action

Voici l'article en français : Une équipe de recherche présente un système modulaire conçu pour le CMU Vision-Language-Action (VLA) Challenge, une compétition universitaire visant à faire exécuter des instructions en langage naturel par un agent robotique autonome évoluant en intérieur. L'architecture repose sur deux pipelines parallèles. Le premier, dédié à la perception, construit en temps réel une carte voxel sémantique de l'environnement à partir de flux caméra, en s'appuyant sur des embeddings issus du modèle OwlViT. Le second traite le langage : il classifie les commandes utilisateur grâce à un modèle vision-langage (VLM). La cartographie est bornée dans le temps, avec une limite d'exploration fixée à 500 secondes, au-delà de laquelle le système continue d'opérer avec une carte partielle plutôt que d'attendre une couverture complète. La requête classifiée est ensuite ancrée dans le contexte géométrique et sémantique de cette carte pour générer un prompt détaillé soumis au VLM, produisant en sortie une action exploitable par le robot. L'intérêt de ce travail dépasse le cadre du concours : il illustre concrètement comment combler l'écart entre instruction en langage naturel et action robotique physique, un défi central pour toute la famille des modèles VLA actuellement en déploiement industriel, de Pi-0 à GR00T N2 en passant par Helix. En imposant une contrainte de temps stricte sur la cartographie, les auteurs mettent en lumière un problème rarement traité frontalement dans les démonstrations commerciales : la robustesse face à une perception incomplète, plus représentative des conditions réelles que des environnements soigneusement scannés en amont. Le CMU VLA Challenge s'inscrit dans une vague de benchmarks académiques cherchant à standardiser l'évaluation des architectures VLA modulaires, en concurrence avec les approches end-to-end privilégiées par les laboratoires industriels. Les prochaines étapes attendues concernent la publication des résultats comparatifs de la compétition et l'éventuelle extension de cette architecture voxel-plus-VLM à des plateformes robotiques réelles au-delà du cadre expérimental du challenge.

RecherchePaper
1 source