Aller au contenu principal
WiXus : un robot à roues et pattes utilisant des câbles pour combiner mobilité et manipulation
RecherchearXiv cs.RO 

WiXus : un robot à roues et pattes utilisant des câbles pour combiner mobilité et manipulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs japonais ont publié sur arXiv (arXiv:2505.20932, mai 2025) les travaux décrivant WiXus, un robot à roues et pattes qui intègre un mécanisme de traction par câbles fixés à l'environnement extérieur. L'architecture combine un châssis à locomotion hybride roues-pattes, configuration classique permettant déplacement rapide sur sol plan, avec des câbles motorisés que le robot ancre sur des structures environnantes (murs, arêtes, supports). En phase de démonstration, WiXus effectue une mobilité tridimensionnelle incluant l'escalade de falaises en coordonnant entraînement par câbles et actionnement roues-pattes. Plus distinctif : une fois son corps suspendu par les câbles, le robot libère ses membres inférieurs de toute fonction locomotrice et les repurpose en bras manipulateurs. Les tâches démontrées restent à l'échelle prototype, saisir une peluche (simulation de sauvetage) et couper une fausse pomme avec un sécateur. Aucun chiffre de charge utile, de degrés de liberté (DOF) précis ou de temps de cycle n'est fourni dans l'abstract publié.

Le principe architectural est notable pour les intégrateurs robotiques : découpler locomotion et manipulation par un support externe résout une contrainte fondamentale des plateformes à pattes, qui doivent traditionnellement arbitrer entre stabilité posturale et liberté d'effecteur. En suspendant le corps via l'environnement, WiXus contourne cette contrainte sans ajouter de bras dédiés, ce qui réduit la masse embarquée et la complexité mécanique. Pour les décideurs industriels, la question critique reste la fiabilité de l'ancrage câble en environnement non préparé, un point que les démonstrations actuelles, conduites en conditions de laboratoire contrôlées, ne permettent pas encore de valider.

WiXus s'inscrit dans une dynamique académique large autour des robots à mobilité hybride. Des plateformes comme ANYmal (ANYbotics), Spot (Boston Dynamics) ou Unitree B2 dominent le marché des robots à pattes, mais restent dédiés à la locomotion avec manipulation optionnelle par bras additionnel. L'approche câble-environnement rappelle des travaux sur les robots grimpeurs (ex. ETH Zurich, IIT Gênes) et les AMR avec bras intégré. WiXus reste au stade de prototype de recherche ; aucun partenaire industriel ni calendrier de commercialisation ne sont mentionnés.

À lire aussi

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes
1arXiv cs.RO 

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes

Des chercheurs présentent DECOWAM (Decoupled Whole-Body World-Action Model), un modèle monde-action conçu pour la manipulation mobile sur robots à pattes équipés d'un bras, décrit dans une prépublication arXiv (2608.20114v1) mise en ligne fin août 2026. Le système part d'un backbone FastWAM adapté et gelé, sur lequel sont entraînés uniquement des adaptateurs résiduels, soit 25,95 millions de paramètres entraînables. L'architecture ajoute un goulot d'étranglement futur équivalent-action distillé à partir d'observations privilégiées, des représentations latentes de la base et du bras séparées de manière adversariale, ainsi qu'un conditionnement par la vitesse de la base pour la prédiction vidéo. Les auteurs introduisent également ARMDOG, un nouveau jeu de données collecté sur robot réel qui synchronise vidéo, état corps entier, actions et instructions en langage naturel. Sur un protocole de rejeu fixe, DECOWAM réduit l'erreur quadratique moyenne de prédiction d'action de 21,7% par rapport à FastWAM. Sur 79 essais en boucle fermée par méthode, il obtient la meilleure coordination corps entier et la meilleure robustesse au déplacement de la base parmi les systèmes comparés, tandis que le taux de complétion des tâches reste comparable au meilleur système de référence, sans amélioration nette sur ce critère précis. L'apport principal tient à la séparation explicite du mouvement propre de la caméra (lié au déplacement de la base) des actions du bras, un problème que les modèles monde-action existants, conçus pour des plateformes à base fixe, ignorent largement. Pour les intégrateurs travaillant sur des robots mobiles à bras (quadrupèdes ou plateformes à roues), cela suggère qu'un modèle de prédiction vidéo pré-entraîné peut être adapté à moindre coût, via peu de paramètres, plutôt que réentraîné intégralement pour gérer un point de vue mobile. Le résultat reste toutefois nuancé: les gains portent sur la coordination et la robustesse mesurées en simulation de rejeu, pas sur un saut de performance en complétion de tâche réelle. Le travail se positionne comme une extension aux plateformes mobiles des modèles monde-action initialement développés pour bras fixes, sans nommer de backbone concurrent autre que FastWAM ni d'entreprise partenaire. Il s'agit d'une contribution académique publiée en prépublication, sans annonce de déploiement commercial ni de calendrier de mise en production; le jeu de données ARMDOG pourrait toutefois servir de futur benchmark pour la manipulation mobile corps entier.

RecherchePaper
1 source
Kitchen Robotic Manipulation utilisant des modèles fondation
2arXiv cs.RO 

Kitchen Robotic Manipulation utilisant des modèles fondation

Un pipeline de perception modulaire pour la manipulation robotique en cuisine, dédié notamment au tri de la vaisselle, vient d'être détaillé dans un article publié sur arXiv (2608.04042) par l'équipe RAIVLab. Le système enchaîne détection d'objets en vocabulaire ouvert, segmentation multi-vues, reconstruction 3D par instance, puis fusion de caractéristiques 2D-3D pour l'estimation de pose en 6D et la planification de préhension. Sa conception modulaire permet de substituer librement les modèles de fondation visuels et géométriques utilisés à chaque étage. Après une évaluation extensive, la combinaison la plus performante identifiée associe LLMDet pour la détection, SAMv2 pour la segmentation, DINOv2 pour l'extraction de caractéristiques et GeoTransformer pour le recalage géométrique. Sur un benchmark maison de 20 scènes de cuisine encombrées et partiellement occultées, cette configuration atteint un score ADI de 89,12%. Les auteurs ont aussi testé le système sur un robot physique, avec deux tâches concrètes : le transfert de vaisselle de l'évier au lave-vaisselle et l'empilement de tasses, sans réentraînement spécifique à l'environnement testé. Pour l'industrie robotique, l'intérêt tient moins à la performance brute, mesurée sur un benchmark propriétaire donc non directement comparable à d'autres travaux, qu'à la démonstration qu'un assemblage de modèles de fondation "sur étagère" peut généraliser sans réentraînement à un nouvel environnement domestique encombré. C'est un point sensible pour les intégrateurs qui cherchent à déployer des robots de service en cuisine ou en restauration collective : la robustesse à l'occlusion et au désordre reste l'un des principaux obstacles entre démonstration en laboratoire et usage réel. En proposant une architecture modulaire plutôt qu'une politique bout en bout, l'équipe offre aussi une méthodologie réutilisable pour comparer objectivement les modèles de vision et de géométrie disponibles, un exercice rarement mené de façon aussi systématique. Ce travail s'inscrit dans la vague plus large des modèles de fondation appliqués à la robotique, où des architectures comme SAM ou DINO, conçues au départ pour la vision générique, sont réutilisées comme briques de perception dans des pipelines de manipulation, en complément des politiques de bout en bout de type VLA telles que Pi-0 ou GR00T N2. Contrairement à ces dernières, qui apprennent directement une politique d'action, cette approche se concentre sur la perception et l'estimation de pose en amont de la préhension. Publié en preprint sans mention de partenariat industriel, le projet met à disposition son code et ses données sur GitHub, une étape qui devra être suivie d'une validation sur un éventail plus large de tâches et d'environnements avant d'envisager un usage industriel.

RecherchePaper
1 source
CoStream : combiner des comportements simples pour une manipulation complexe et généralisable
3arXiv cs.RO 

CoStream : combiner des comportements simples pour une manipulation complexe et généralisable

Une équipe de chercheurs propose CoStream (arXiv 2606.26423), un cadre de manipulation robotique conçu pour atteindre simultanément précision millimétrique et généralisation à de nouvelles tâches. L'article cible des opérations d'assemblage à haute contrainte de contact comme l'insertion d'un GPU dans un slot PCIe, où les approches existantes échouent sur au moins l'un des deux critères. Le système a été validé sur 8 tâches réelles couvrant manipulation quotidienne et assemblage de précision, avec récupération robuste après perturbations manuelles en cours d'exécution. L'apport central est de rompre avec deux paradigmes dominants : les pipelines classiques, précis mais rigides et coûteux à adapter à chaque nouvelle tâche, et les politiques end-to-end monolithiques, généralisables mais insuffisamment précises hors-distribution sans réentraînement. CoStream orchestre modèles de fondation et modalités de capteurs variées en trois comportements composables : sémantique (extraction de contraintes spatiales via modèles de fondation), prédictif (estimation de trajectoires par tracking de keypoints dans des vidéos imaginées) et réactif (corrections tactiles et de force haute fréquence). Ces sorties se composent par right-multiplication dans l'espace SE(3), produisant une commande de pose unique à chaque pas de contrôle, exécutée par un contrôleur compliant. Les gains les plus significatifs sont observés sur les tâches d'assemblage avec contact et de transfert d'objets, précisément là où la précision et l'adaptabilité sont le plus difficiles à concilier. CoStream s'inscrit dans la tendance qui cherche à exploiter les modèles de fondation visuels et linguistiques pour la planification robotique, tout en conservant des contrôleurs bas niveau fiables pour l'exécution temps réel. Les approches concurrentes les plus directes sont les VLA monolithiques comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, ainsi que les pipelines hiérarchiques classiques. La décomposition modulaire proposée n'implique pas de réentraînement complet pour chaque nouvelle tâche, ce qui constitue le principal argument de rupture avancé par les auteurs. L'article reste un preprint de recherche sans déploiement industriel annoncé ni partenaire de production mentionné ; les performances à l'échelle et hors environnement de laboratoire contrôlé restent à démontrer.

RecherchePaper
1 source
Bench-Push : benchmark pour la navigation et la manipulation par poussée des robots mobiles
4arXiv cs.RO 

Bench-Push : benchmark pour la navigation et la manipulation par poussée des robots mobiles

Une équipe de chercheurs a publié Bench-Push (arXiv:2512.11736), le premier benchmark unifié dédié à l'évaluation des robots mobiles capables de pousser et de manipuler des objets dans leur environnement immédiat. La suite comprend quatre environnements de simulation aux niveaux de complexité variables : navigation en labyrinthe avec obstacles mobiles, navigation autonome de navire en eaux glacées, livraison de caisses, et nettoyage de zones encombrées. Bench-Push intègre également un jeu de métriques originales conçues pour mesurer l'efficacité, l'effort d'interaction mécanique et la complétion partielle des tâches, ainsi que des démonstrations de baselines établies. La bibliothèque est open-source, distribuée sous Python avec une architecture modulaire, et disponible sur GitHub (IvanIZ/BenchNPIN). L'absence de référentiel commun dans ce domaine constitue un frein réel : jusqu'ici, chaque équipe évaluait ses approches sur des configurations ad hoc, rendant toute comparaison inter-laboratoires impossible et la reproductibilité aléatoire. Or la question est loin d'être académique. Les robots mobiles autonomes (AMR) déployés en logistique, en entrepôt ou en milieu industriel se retrouvent régulièrement dans des espaces encombrés d'objets déplaçables que les algorithmes classiques d'évitement d'obstacles ne savent tout simplement pas gérer. Les stratégies de poussée (pushing, nudging) constituent une compétence clé pour ces environnements réels, et Bench-Push offre désormais un terrain de comparaison structuré pour les évaluer. La métrique de complétion partielle est notamment utile pour les décideurs B2B, qui ont besoin de quantifier la dégradation progressive des performances plutôt qu'un simple succès ou échec binaire. Le champ dit NAMO (Navigation Among Movable Obstacles) connaît une croissance soutenue, mais restait fragmenté faute d'outil fédérateur. Bench-Push s'inscrit dans la continuité des efforts de standardisation observés ailleurs en robotique, à l'image de ce que RoboSuite ou Isaac Gym ont apporté à la manipulation. L'inclusion d'un scénario de navigation en eaux glacées témoigne d'une ambition d'élargissement au-delà de la robotique d'entrepôt stricte, vers des domaines comme la navigation maritime autonome. Il n'existe à ce stade aucune annonce de déploiement industriel : Bench-Push est un outil de recherche, mais sa conception modulaire et son accessibilité via pip en font un candidat sérieux à une adoption rapide par les équipes travaillant sur la planification en environnements dynamiques.

RecherchePaper
1 source