Aller au contenu principal
TONAV : navigation orientée tâche et apprentissage de blocs action-vitesse pour la manipulation mobile quadrupède d'objets articulés
RecherchearXiv cs.RO 

TONAV : navigation orientée tâche et apprentissage de blocs action-vitesse pour la manipulation mobile quadrupède d'objets articulés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié en août 2026 sur arXiv un article présentant TONAV, un framework unifié de manipulation mobile quadrupède pour objets articulés comme portes, tiroirs ou vannes. Le système associe une téléopération couplant position et vitesse pour produire des démonstrations lisses et cohérentes, une navigation orientée tâche qui utilise le raisonnement vision-langage pour découper une instruction en sous-objectifs et amener la base du robot en posture prête à manipuler, et un apprentissage de chunks action-vitesse modélisant conjointement positions articulaires et transitions temporelles. Les auteurs rapportent des tests réels avec des taux de réussite supérieurs à l'existant, mais sans chiffres précis ni détails sur la plateforme utilisée. Code et vidéos figurent sur haochen611.github.io/TONAV.

Cette publication cible un problème concret de la manipulation mobile : la plupart des systèmes arrêtent la navigation près de la cible sans garantir un positionnement exploitable, et peinent à maintenir un contact stable lors d'interactions prolongées, à cause du jitter, du retard de suivi et de l'instabilité de contact. Pour les intégrateurs envisageant des quadrupèdes en usine ou en logistique pour ouvrir des portes ou actionner des vannes, ces deux failles sont précisément ce qui bloque le passage de la démonstration scriptée au déploiement répété. TONAV illustre aussi l'extension des architectures vision-langage-action, popularisées côté humanoïdes par des modèles comme Pi-0 ou GR00T N2, aux plateformes quadrupèdes.

Le travail s'inscrit dans la lignée des recherches sur la manipulation mobile, où les quadrupèdes, chez des acteurs comme Unitree, Boston Dynamics avec Spot ou Deep Robotics, se sont d'abord concentrés sur la locomotion et l'inspection avant d'y ajouter des bras pour l'interaction physique. TONAV se positionne comme une réponse à la fracture entre atteignabilité et disponibilité pour la manipulation identifiée dans des travaux antérieurs. Les auteurs ouvrent une page projet avec du contenu vidéo, mais aucun calendrier de transfert industriel ni pilote commercial n'est mentionné : il s'agit à ce stade d'une contribution de recherche, pas d'un produit ni d'un déploiement.

À lire aussi

Apprentissage de politiques de loco-manipulation quadrupède avec perception tactile
1arXiv cs.RO 

Apprentissage de politiques de loco-manipulation quadrupède avec perception tactile

Une équipe de chercheurs a publié en avril 2026 sur arXiv (2604.27224) un pipeline hiérarchique de loco-manipulation pour robots quadrupèdes intégrant le retour tactile. Le système combine une politique visuotactile de haut niveau, entraînée sur des démonstrations humaines réelles, qui prédit simultanément les trajectoires de l'effecteur terminal et les signaux tactiles attendus caractérisant l'évolution du contact, avec une politique corps-entier entraînée par reinforcement learning à grande échelle en simulation et transférée zero-shot sur robot physique. Évalué sur trois tâches à contact riche (réorientation en main avec insertion, serrage de vanne, manipulation d'objets fragiles), le système affiche un gain moyen de 28,54 % par rapport aux baselines vision seule et visuotactile sans prédiction tactile. L'apport principal est de démontrer que vision et proprioception restent insuffisantes pour résoudre des contacts incertains et évolutifs, et que le retour tactile fournit une observabilité directe que les autres modalités ne peuvent pas suppléer. La mise à l'échelle de l'apprentissage tactile à un système complet de loco-manipulation quadrupède est une contribution distinctive : la littérature récente s'était concentrée sur les bras fixes et les mains dextres, laissant les plateformes mobiles en dehors du périmètre. Le transfert zero-shot sim-to-real de la politique multimodale corps-entier valide par ailleurs qu'il est possible de combler le gap simulation-réalité sur des politiques sensorielles complexes sans fine-tuning sur robot physique, un résultat concret pour les déploiements industriels. La manipulation par quadrupèdes s'est accélérée depuis 2023 avec Spot (Boston Dynamics) et ANYmal (ANYbotics, ETH Zurich), qui s'appuient cependant essentiellement sur la vision et la proprioception. L'intégration d'une couche tactile hiérarchique sur des systèmes mobiles reste une extension non triviale, absente des plateformes Unitree B2/Z1 ou des travaux sur MIT Cheetah. La suite logique inclut l'extension à des capteurs haute densité (GelSight, capacitif distribué) et à des chaînes de manipulation multi-étapes en milieu industriel réel. Ce travail est un preprint non encore évalué par les pairs, ce qui invite à la prudence sur la généralisabilité des résultats au-delà du protocole expérimental décrit.

UELes résultats sur le transfert zero-shot sim-to-real et la manipulation tactile quadrupède sont directement pertinents pour ANYbotics (spin-off ETH Zurich) et ses déploiements d'inspection industrielle en Europe, où ANYmal constitue la plateforme de référence.

RecherchePaper
1 source
Apprentissage de la loco-manipulation globale du corps entier avec un manipulateur mobile bipède
2arXiv cs.RO 

Apprentissage de la loco-manipulation globale du corps entier avec un manipulateur mobile bipède

Des chercheurs publient sur arXiv (référence 2609.18930v1, septembre 2026) un contrôleur unifié de corps entier pour un robot bipède manipulateur mobile, entraîné par apprentissage par renforcement. Le système prend en entrée une seule cible d'effecteur terminal en 6 degrés de liberté (position et orientation) et produit directement les actions coordonnées de la base bipède et du bras, sans qu'aucune commande explicite de vitesse de base ou de placement de pas ne soit fournie séparément. L'entraînement repose sur une stratégie de "reward-gating" qui arbitre dynamiquement entre suivi de trajectoire de l'effecteur, locomotion et maintien de l'équilibre. Un module d'estimation de contexte temporel, combinant un encodeur Transformer à fenêtre glissante, une mémoire récurrente GRU et une prédiction auxiliaire de dynamique, extrait des informations pertinentes de l'historique d'observation pour affiner le contrôle. Sur robot réel, les auteurs montrent que ce même contrôleur exécute des tâches d'atteinte, d'adaptation posturale et de pas sous trois types de commandes différentes : téléopération en réalité virtuelle, une politique de diffusion apprise, et des trajectoires scriptées. L'intérêt pour l'industrie robotique tient à la simplification de l'architecture de contrôle: au lieu de piloter séparément la locomotion et la manipulation, ou de dépendre de commandes de pas explicites, une seule interface d'effecteur terminal suffit à coordonner l'ensemble du corps. Cela facilite en théorie le branchement de politiques de haut niveau (VLA, diffusion, téléopération) sur un même contrôleur bas niveau, sans réentraînement spécifique à chaque source de commande. C'est un signal pertinent pour les équipes qui travaillent sur l'intégration de piles de manipulation sur plateformes humanoïdes ou bipèdes mobiles, dans la lignée des efforts sectoriels pour découpler la couche de décision de la couche de contrôle moteur. Le travail s'inscrit dans la recherche académique sur la loco-manipulation bipède, un problème identifié de longue date car il étend la portée effective des bras au-delà de leur espace de travail nominal en mobilisant les jambes. L'abstract ne précise ni l'identité des auteurs, ni la plateforme robotique utilisée, ni un calendrier de déploiement commercial: il s'agit d'un preprint de recherche avec validation expérimentale en laboratoire, pas d'un produit ou d'un pilote industriel annoncé.

RecherchePaper
1 source
Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage
3arXiv cs.RO 

Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage

Des chercheurs présentent VOP-Nav, un système de navigation pour robots quadrupèdes conçu pour évoluer dans des environnements denses et dynamiques, où l'occlusion des capteurs et l'imprévisibilité des déplacements humains posent des défis majeurs. Le cœur du système est un réseau baptisé VOP-Net, qui traite des données LiDAR multi-frames captées en local pour encoder implicitement les contraintes dynamiques de l'environnement et prédire une zone de vitesse sûre, dérivée de la théorie des Velocity Obstacles (VO). Fait notable, cette prédiction VO sert un double rôle : elle alimente la politique de navigation en inférence, et sert de signal de récompense pendant l'entraînement pour favoriser des trajectoires sûres. Le système a été évalué dans le simulateur Isaac Gym, puis déployé en conditions réelles sur un robot quadrupède Unitree Go2, en intérieur comme en extérieur, sans pipeline explicite de détection et de suivi d'obstacles. L'enjeu dépassé ici est un compromis classique en robotique mobile : les méthodes à base de modèle comme les Velocity Obstacles garantissent la sécurité en théorie, mais s'effondrent en environnement dense car elles dépendent d'estimations précises du mouvement des obstacles, difficiles à obtenir dans une foule. À l'inverse, les approches d'apprentissage de bout en bout sont plus robustes mais manquent de capacité de prédiction, ce qui produit soit des collisions, soit des comportements trop prudents. En hybridant les deux, VOP-Nav vise directement le goulot d'étranglement qui freine le déploiement de quadrupèdes et, plus largement, de plateformes mobiles autonomes dans des espaces partagés avec des humains, entrepôts, hôpitaux, bureaux, un enjeu suivi de près par les intégrateurs travaillant avec des plateformes comme Go2 ou Spot. Le papier s'inscrit dans la lignée des travaux sur la navigation sociale et l'évitement d'obstacles dynamiques, où les méthodes géométriques classiques (VO, ORCA) et l'apprentissage par renforcement coexistent sans avoir jusqu'ici bien fusionné. Publié comme preprint arXiv (2607.15036), le travail n'a pas encore fait l'objet de revue par les pairs ; les auteurs revendiquent des taux de réussite supérieurs à leurs bases de comparaison en simulation, sans toutefois préciser de chiffres exacts ni le protocole complet d'évaluation, un point à surveiller avant toute extrapolation vers un déploiement industriel à grande échelle.

RecherchePaper
1 source
Deux par deux : apprentissage multi-tâches de l'assemblage d'objets appariés pour une manipulation robotique généralisable
4arXiv cs.RO 

Deux par deux : apprentissage multi-tâches de l'assemblage d'objets appariés pour une manipulation robotique généralisable

Des chercheurs publient 2BY2, un jeu de données annoté à grande échelle pour l'assemblage d'objets appariés du quotidien, décrit dans une version révisée d'un article arXiv (2504.06961v2). Il couvre 18 tâches fines inspirées de gestes réels comme brancher une prise, disposer des fleurs dans un vase ou insérer du pain dans un grille-pain, avec 1034 instances et 517 paires d'objets annotées en pose et en symétrie. Les auteurs proposent une méthode d'estimation de pose SE(3) en deux étapes, basée sur des caractéristiques équivariantes, qui atteint des performances état de l'art sur les 18 tâches du benchmark. Des expériences robotiques réelles confirment la fiabilité et la capacité de généralisation de cette méthode sur des tâches d'assemblage 3D complexes. Ce travail comble un vide méthodologique pour la robotique domestique : la plupart des benchmarks d'assemblage existants portent sur des fragments géométriques abstraits ou des pièces industrielles standardisées, loin des interactions fonctionnelles et asymétriques des objets du quotidien. En ciblant explicitement les futurs robots d'assistance à domicile, 2BY2 offre un terrain d'évaluation plus représentatif que les jeux de données orientés usine. Le transfert réussi de la méthode du benchmark simulé vers des essais robotiques physiques est un signal notable, suggérant que les approches de pose SE(3) équivariante peuvent réduire l'écart simulation-réel sur des tâches de manipulation fine, un problème persistant pour les politiques de manipulation généralistes. Les résultats « état de l'art » restent toutefois mesurés sur le benchmark propre des auteurs, une limite à garder en tête avant toute extrapolation. L'article, référencé 2504.06961 sur arXiv et republié en version 2, s'inscrit dans la lignée des travaux de « shape assembly » qui se concentraient jusqu'ici sur des fragments cassés ou des composants industriels aux formes régulières. 2BY2 étend le problème à des objets paires à forte composante fonctionnelle, des gestes triviaux pour un humain mais qui exigent une compréhension conjointe de la géométrie et de l'usage. Les auteurs comparent leur méthode aux approches antérieures de shape assembly sur l'ensemble des 18 tâches et revendiquent une supériorité systématique. La publication de ce dataset annoté pose une base de comparaison pour de futurs travaux, sans qu'un calendrier de mise à disposition du code ou de partenariat industriel ne soit précisé à ce stade.

RecherchePaper
1 source