Aller au contenu principal
RecherchearXiv cs.RO 

TONAV : navigation orientée tâche et apprentissage de blocs action-vitesse pour la manipulation mobile quadrupède d'objets articulés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié en août 2026 sur arXiv un article présentant TONAV, un framework unifié de manipulation mobile quadrupède pour objets articulés comme portes, tiroirs ou vannes. Le système associe une téléopération couplant position et vitesse pour produire des démonstrations lisses et cohérentes, une navigation orientée tâche qui utilise le raisonnement vision-langage pour découper une instruction en sous-objectifs et amener la base du robot en posture prête à manipuler, et un apprentissage de chunks action-vitesse modélisant conjointement positions articulaires et transitions temporelles. Les auteurs rapportent des tests réels avec des taux de réussite supérieurs à l'existant, mais sans chiffres précis ni détails sur la plateforme utilisée. Code et vidéos figurent sur haochen611.github.io/TONAV.

Cette publication cible un problème concret de la manipulation mobile : la plupart des systèmes arrêtent la navigation près de la cible sans garantir un positionnement exploitable, et peinent à maintenir un contact stable lors d'interactions prolongées, à cause du jitter, du retard de suivi et de l'instabilité de contact. Pour les intégrateurs envisageant des quadrupèdes en usine ou en logistique pour ouvrir des portes ou actionner des vannes, ces deux failles sont précisément ce qui bloque le passage de la démonstration scriptée au déploiement répété. TONAV illustre aussi l'extension des architectures vision-langage-action, popularisées côté humanoïdes par des modèles comme Pi-0 ou GR00T N2, aux plateformes quadrupèdes.

Le travail s'inscrit dans la lignée des recherches sur la manipulation mobile, où les quadrupèdes, chez des acteurs comme Unitree, Boston Dynamics avec Spot ou Deep Robotics, se sont d'abord concentrés sur la locomotion et l'inspection avant d'y ajouter des bras pour l'interaction physique. TONAV se positionne comme une réponse à la fracture entre atteignabilité et disponibilité pour la manipulation identifiée dans des travaux antérieurs. Les auteurs ouvrent une page projet avec du contenu vidéo, mais aucun calendrier de transfert industriel ni pilote commercial n'est mentionné : il s'agit à ce stade d'une contribution de recherche, pas d'un produit ni d'un déploiement.

À lire aussi

Apprentissage de politiques de loco-manipulation quadrupède avec perception tactile
1arXiv cs.RO 

Apprentissage de politiques de loco-manipulation quadrupède avec perception tactile

Une équipe de chercheurs a publié en avril 2026 sur arXiv (2604.27224) un pipeline hiérarchique de loco-manipulation pour robots quadrupèdes intégrant le retour tactile. Le système combine une politique visuotactile de haut niveau, entraînée sur des démonstrations humaines réelles, qui prédit simultanément les trajectoires de l'effecteur terminal et les signaux tactiles attendus caractérisant l'évolution du contact, avec une politique corps-entier entraînée par reinforcement learning à grande échelle en simulation et transférée zero-shot sur robot physique. Évalué sur trois tâches à contact riche (réorientation en main avec insertion, serrage de vanne, manipulation d'objets fragiles), le système affiche un gain moyen de 28,54 % par rapport aux baselines vision seule et visuotactile sans prédiction tactile. L'apport principal est de démontrer que vision et proprioception restent insuffisantes pour résoudre des contacts incertains et évolutifs, et que le retour tactile fournit une observabilité directe que les autres modalités ne peuvent pas suppléer. La mise à l'échelle de l'apprentissage tactile à un système complet de loco-manipulation quadrupède est une contribution distinctive : la littérature récente s'était concentrée sur les bras fixes et les mains dextres, laissant les plateformes mobiles en dehors du périmètre. Le transfert zero-shot sim-to-real de la politique multimodale corps-entier valide par ailleurs qu'il est possible de combler le gap simulation-réalité sur des politiques sensorielles complexes sans fine-tuning sur robot physique, un résultat concret pour les déploiements industriels. La manipulation par quadrupèdes s'est accélérée depuis 2023 avec Spot (Boston Dynamics) et ANYmal (ANYbotics, ETH Zurich), qui s'appuient cependant essentiellement sur la vision et la proprioception. L'intégration d'une couche tactile hiérarchique sur des systèmes mobiles reste une extension non triviale, absente des plateformes Unitree B2/Z1 ou des travaux sur MIT Cheetah. La suite logique inclut l'extension à des capteurs haute densité (GelSight, capacitif distribué) et à des chaînes de manipulation multi-étapes en milieu industriel réel. Ce travail est un preprint non encore évalué par les pairs, ce qui invite à la prudence sur la généralisabilité des résultats au-delà du protocole expérimental décrit.

UELes résultats sur le transfert zero-shot sim-to-real et la manipulation tactile quadrupède sont directement pertinents pour ANYbotics (spin-off ETH Zurich) et ses déploiements d'inspection industrielle en Europe, où ANYmal constitue la plateforme de référence.

RecherchePaper
1 source
Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage
2arXiv cs.RO 

Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage

Des chercheurs présentent VOP-Nav, un système de navigation pour robots quadrupèdes conçu pour évoluer dans des environnements denses et dynamiques, où l'occlusion des capteurs et l'imprévisibilité des déplacements humains posent des défis majeurs. Le cœur du système est un réseau baptisé VOP-Net, qui traite des données LiDAR multi-frames captées en local pour encoder implicitement les contraintes dynamiques de l'environnement et prédire une zone de vitesse sûre, dérivée de la théorie des Velocity Obstacles (VO). Fait notable, cette prédiction VO sert un double rôle : elle alimente la politique de navigation en inférence, et sert de signal de récompense pendant l'entraînement pour favoriser des trajectoires sûres. Le système a été évalué dans le simulateur Isaac Gym, puis déployé en conditions réelles sur un robot quadrupède Unitree Go2, en intérieur comme en extérieur, sans pipeline explicite de détection et de suivi d'obstacles. L'enjeu dépassé ici est un compromis classique en robotique mobile : les méthodes à base de modèle comme les Velocity Obstacles garantissent la sécurité en théorie, mais s'effondrent en environnement dense car elles dépendent d'estimations précises du mouvement des obstacles, difficiles à obtenir dans une foule. À l'inverse, les approches d'apprentissage de bout en bout sont plus robustes mais manquent de capacité de prédiction, ce qui produit soit des collisions, soit des comportements trop prudents. En hybridant les deux, VOP-Nav vise directement le goulot d'étranglement qui freine le déploiement de quadrupèdes et, plus largement, de plateformes mobiles autonomes dans des espaces partagés avec des humains, entrepôts, hôpitaux, bureaux, un enjeu suivi de près par les intégrateurs travaillant avec des plateformes comme Go2 ou Spot. Le papier s'inscrit dans la lignée des travaux sur la navigation sociale et l'évitement d'obstacles dynamiques, où les méthodes géométriques classiques (VO, ORCA) et l'apprentissage par renforcement coexistent sans avoir jusqu'ici bien fusionné. Publié comme preprint arXiv (2607.15036), le travail n'a pas encore fait l'objet de revue par les pairs ; les auteurs revendiquent des taux de réussite supérieurs à leurs bases de comparaison en simulation, sans toutefois préciser de chiffres exacts ni le protocole complet d'évaluation, un point à surveiller avant toute extrapolation vers un déploiement industriel à grande échelle.

RecherchePaper
1 source
Deux par deux : apprentissage multi-tâches de l'assemblage d'objets appariés pour une manipulation robotique généralisable
3arXiv cs.RO 

Deux par deux : apprentissage multi-tâches de l'assemblage d'objets appariés pour une manipulation robotique généralisable

Des chercheurs publient 2BY2, un jeu de données annoté à grande échelle pour l'assemblage d'objets appariés du quotidien, décrit dans une version révisée d'un article arXiv (2504.06961v2). Il couvre 18 tâches fines inspirées de gestes réels comme brancher une prise, disposer des fleurs dans un vase ou insérer du pain dans un grille-pain, avec 1034 instances et 517 paires d'objets annotées en pose et en symétrie. Les auteurs proposent une méthode d'estimation de pose SE(3) en deux étapes, basée sur des caractéristiques équivariantes, qui atteint des performances état de l'art sur les 18 tâches du benchmark. Des expériences robotiques réelles confirment la fiabilité et la capacité de généralisation de cette méthode sur des tâches d'assemblage 3D complexes. Ce travail comble un vide méthodologique pour la robotique domestique : la plupart des benchmarks d'assemblage existants portent sur des fragments géométriques abstraits ou des pièces industrielles standardisées, loin des interactions fonctionnelles et asymétriques des objets du quotidien. En ciblant explicitement les futurs robots d'assistance à domicile, 2BY2 offre un terrain d'évaluation plus représentatif que les jeux de données orientés usine. Le transfert réussi de la méthode du benchmark simulé vers des essais robotiques physiques est un signal notable, suggérant que les approches de pose SE(3) équivariante peuvent réduire l'écart simulation-réel sur des tâches de manipulation fine, un problème persistant pour les politiques de manipulation généralistes. Les résultats « état de l'art » restent toutefois mesurés sur le benchmark propre des auteurs, une limite à garder en tête avant toute extrapolation. L'article, référencé 2504.06961 sur arXiv et republié en version 2, s'inscrit dans la lignée des travaux de « shape assembly » qui se concentraient jusqu'ici sur des fragments cassés ou des composants industriels aux formes régulières. 2BY2 étend le problème à des objets paires à forte composante fonctionnelle, des gestes triviaux pour un humain mais qui exigent une compréhension conjointe de la géométrie et de l'usage. Les auteurs comparent leur méthode aux approches antérieures de shape assembly sur l'ensemble des 18 tâches et revendiquent une supériorité systématique. La publication de ce dataset annoté pose une base de comparaison pour de futurs travaux, sans qu'un calendrier de mise à disposition du code ou de partenariat industriel ne soit précisé à ce stade.

RecherchePaper
1 source
Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés
4arXiv cs.RO 

Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés

Des chercheurs présentent KAI (Kinematic-Aware Articulation Interface), une nouvelle représentation intermédiaire structurée conçue pour l'apprentissage de politiques de manipulation d'objets articulés par des robots, comme des tiroirs, des portes ou des charnières. Contrairement aux approches qui tentent d'apprendre la structure cinématique uniquement à partir de démonstrations robotiques, KAI intègre directement des a priori géométriques et cinématiques interprétables dans le processus d'apprentissage. Testée sur six tâches de simulation, la méthode atteint un taux de réussite moyen de 82,9%, égalant voire dépassant les performances des méthodes de référence tout en n'utilisant que la moitié des données de démonstration nécessaires. Le système, entraîné dans un environnement unique et non encombré, démontre également une capacité de généralisation vers des arrière-plans inédits et des scènes réelles encombrées de distracteurs visuels. En combinant l'entraînement avec des vidéos d'interactions humaines, grâce à sa conception indépendante de l'action ("action-agnostic"), le taux de réussite moyen dépasse 70% même face à des perturbations visuelles diverses. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement bien identifié: l'apprentissage par démonstration coûte cher en temps d'annotation et de téléopération, en particulier pour les objets articulés dont la cinématique varie fortement d'un instance à l'autre. Diviser par deux le volume de démonstrations nécessaires, si le résultat se confirme au-delà de la simulation, représenterait un gain d'efficacité concret pour les intégrateurs travaillant sur la manipulation domestique ou industrielle (portes d'armoires, électroménager, machines-outils). La possibilité de co-entraîner avec des vidéos humaines, sans capture de données robotiques dédiées, ouvre aussi une piste pour réduire davantage le coût de collecte, un enjeu central alors que les approches VLA (vision-language-action) peinent encore à passer l'échelle sans volumes massifs de données. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans nom d'institution ni de laboratoire précisé dans le résumé, et les résultats restent principalement validés en simulation, avec un transfert vers le réel limité à des scènes encombrées plutôt qu'à un déploiement en conditions industrielles. Le travail s'inscrit dans un courant de recherche plus large visant à injecter des priors structurels explicites dans les politiques d'apprentissage, en contraste avec les approches purement end-to-end de type GR00T N2 ou Pi-0, et pourrait alimenter les futures générations de modèles de manipulation généralistes si sa robustesse se confirme sur du matériel physique.

RecherchePaper
1 source