Aller au contenu principal
Dark Horse Muka Robotics défie WorldArena avec seulement 32 GPU Zhenwu 810E : le modèle du monde LJM décroche la deuxième place mondiale, redéfinissant la percée de la qualité vidéo à la logique physique
RecherchePandaily 

Dark Horse Muka Robotics défie WorldArena avec seulement 32 GPU Zhenwu 810E : le modèle du monde LJM décroche la deuxième place mondiale, redéfinissant la percée de la qualité vidéo à la logique physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Muka Robotics, une startup fondée il y a seulement quatre mois, s'est hissée à la deuxième place mondiale du classement WorldArena grâce à son modèle LJM, entraîné et testé sur seulement 32 GPU Zhenwu 810E, soit une fraction du calcul mobilisé par des concurrents mieux dotés en infrastructure. Sur le benchmark de manipulation LIBERO, LJM obtient un score de 89,17 en qualité de mouvement, 92,60 en précision 3D et 85,93 en contrôlabilité. Détail notable, la soumission a été déposée de façon anonyme sous le pseudonyme SisyphusWorld, une pratique qui mérite d'être signalée puisqu'elle empêche toute vérification indépendante immédiate des conditions de test avant la levée d'anonymat. L'équipe est dirigée par Chi Xiaowei et rassemble des chercheurs issus du MMLab, de Tsinghua et de l'université de Pékin (PKU).

Le résultat intéresse le secteur parce qu'il attaque un problème structurel des modèles du monde utilisés pour la robotique : les modèles de diffusion vidéo classiques optimisent la texture des pixels au détriment de la compréhension physique du point de contact entre la pince et l'objet manipulé, soit 1 % de l'image mais l'information la plus critique pour l'action. LJM introduit une architecture à deux experts : un expert de raisonnement latent, basé sur Qwen3-VL-2B, qui simule dans un espace continu ce qui se produit lorsque la pince se referme et déplace l'objet, à partir des instructions, de l'historique visuel et de la séquence d'actions prévue ; un expert de rendu, basé sur Wan2.2-TI2V-5B, qui traduit ensuite ce raisonnement en images vidéo réalistes. Chaque token de raisonnement doit prédire simultanément trois grandeurs dérivées des données d'entraînement réelles, la position 3D de l'effecteur terminal, les changements d'état visuel de la scène et le flux optique par pixel, ce qui contraint le modèle à ne pas halluciner de résultats physiquement impossibles. Les deux experts communiquent en continu via une attention partagée de type Mixture-of-Transformers, plutôt que par un simple passage séquentiel d'information.

Cette approche illustre une dynamique plus large dans l'écosystème chinois de l'IA, où les contraintes d'accès aux GPU les plus puissants poussent certaines équipes à privilégier l'innovation architecturale plutôt que la seule puissance de calcul brute. Elle s'inscrit dans la lignée des travaux sur les modèles monde pour la manipulation robotique, aux côtés d'acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2). Il faut toutefois garder à l'esprit qu'il s'agit à ce stade d'un résultat de classement sur benchmark et de simulation, pas d'un déploiement sur robot physique en conditions réelles : la validation en environnement industriel reste l'étape suivante à surveiller.

À lire aussi

RoboAlign-R1 : alignement multimodal des récompenses pour les modèles du monde vidéo robotique
1arXiv cs.RO 

RoboAlign-R1 : alignement multimodal des récompenses pour les modèles du monde vidéo robotique

Des chercheurs ont publié le 6 mai 2026 sur arXiv (arXiv:2605.03821) un framework baptisé RoboAlign-R1, conçu pour améliorer l'alignement des modèles vidéo du monde robotique avec les objectifs réels de prise de décision. Le coeur du travail repose sur un benchmark inédit, RobotWorldBench, qui rassemble 10 000 paires vidéo-instruction annotées issues de quatre sources de données robotiques, et sur un juge multimodal, RoboAlign-Judge, capable d'évaluer les vidéos générées selon six dimensions distinctes (instruction following, manipulation accuracy, plausibilité physique, entre autres). Ce juge enseignant est ensuite distillé en un modèle récompense léger pour un post-entraînement par renforcement. En parallèle, les auteurs introduisent une stratégie d'inférence sans entraînement supplémentaire, le Sliding Window Re-encoding (SWR), qui rafraichit périodiquement le contexte de génération pour limiter la dérive lors des prédictions à long horizon. Les gains mesurés sont de 10,1 % sur le score agrégé à six dimensions par rapport au meilleur baseline, dont 7,5 % en précision de manipulation et 4,6 % en suivi d'instructions. Le SWR apporte quant à lui une réduction de 9,8 % en LPIPS et une hausse de 2,8 % en SSIM, avec seulement environ 1 % de latence additionnelle. Ce travail pointe un problème structurel rarement nommé aussi clairement dans la littérature : les modèles vidéo robotiques sont généralement optimisés pour des métriques visuelles basses (reconstruction pixel, SSIM) qui ne corrèlent pas avec la performance réelle en manipulation ou en suivi d'instructions. Autrement dit, un modèle peut produire des vidéos visuellement cohérentes tout en étant inutilisable pour le contrôle d'un bras robotique. En transposant la logique du post-entraînement par récompense, inspirée du RLHF appliqué aux LLM, aux world models vidéo, RoboAlign-R1 propose une voie pour aligner simulation et tâche réelle. Pour les équipes qui utilisent ces modèles comme simulateurs de planification ou générateurs de données synthétiques, l'évaluation multi-dimensionnelle de RoboAlign-Judge pourrait devenir un protocole de référence, à condition que le benchmark soit publié et reproductible. Cette publication s'inscrit dans une dynamique plus large d'application des techniques d'alignement (post-training, distillation, RL) à la robotique incarnée, un domaine où des travaux comme UniSim, GROOT de NVIDIA ou IRASim ont posé les bases des world models vidéo. Le code et les données ne sont pas encore disponibles publiquement au moment de la publication, ce qui limite l'évaluation indépendante des résultats. La prochaine étape naturelle serait une validation sur robot physique en dehors du protocole in-domain utilisé ici, car les gains mesurés en simulation n'impliquent pas directement un transfert sim-to-real amélioré.

RechercheOpinion
1 source
Argus, le nouveau robot à 20 pattes, redéfinit la robotique avec son système de déplacement omnidirectionnel
2Interesting Engineering 

Argus, le nouveau robot à 20 pattes, redéfinit la robotique avec son système de déplacement omnidirectionnel

Des chercheurs de l'université Duke ont présenté Argus, un robot à 20 pattes modulaires et télescopiques disposées radialement autour d'un noyau central, sans avant ni arrière définis. Chaque patte intègre une caméra de profondeur, l'ensemble formant une géométrie dodécaédrique régulière à 12 faces pentagonales qui distribue uniformément la force et le champ de vision dans toutes les directions. L'équipe a simulé plus de 1 500 configurations morphologiques avant d'aboutir à ce design, qui atteint un score de 0,91 sur leur métrique d'isotropie dynamique, contre moins de 0,6 pour la quasi-totalité des robots actuels, quadrupèdes, humanoïdes et drones compris. Sur le campus de Duke, Argus a été testé sur sable, sentiers forestiers, herbe, béton et surfaces mouillées : il franchit des obstacles de 12 cm quelle que soit son orientation, transporte une charge utile de 4,5 kg à vitesse quasi maximale, continue de se déplacer après la mise hors service de trois pattes, et peut escalader des parois verticales en alternant groupes de pattes d'appui et de poussée. Ces comportements ont été appris entièrement en simulation avant transfert en environnement réel. L'intérêt de ce travail pour l'industrie robotique ne réside pas dans les performances brutes d'Argus, mais dans le cadre mathématique sous-jacent. L'isotropie dynamique fournit une méthode unifiée pour scorer, comparer et concevoir des systèmes robotiques selon leur uniformité de mouvement, applicable aux plateformes existantes. Pour un intégrateur ou un décideur industriel, cela signifie disposer d'un critère objectif pour évaluer la pertinence d'une architecture face à des tâches omnidirectionnelles, navigation en entrepôt dense, inspection en espace confiné, assistance en milieu non structuré. Le fait que les compétences d'Argus soient issues de sim-to-real pur, sans apprentissage en milieu réel, renforce la thèse que le design lui-même simplifie le problème d'apprentissage : un robot isotrope est plus facile à généraliser. Il faut néanmoins nuancer : les vidéos publiées montrent des conditions de test relativement contrôlées, et aucune métrique de temps de cycle industriel ou de coût de fabrication n'est communiquée. Duke s'inscrit dans un courant de recherche qui questionne le paradigme biomimétique dominant, où Boston Dynamics, Figure, Agility Robotics et Tesla Optimus misent sur la forme humanoïde ou quadrupède pour justifier une utilisation en environnement conçu pour l'humain. Argus représente une direction alternative, déjà explorée en partie par des robots sphériques ou hexapodes, mais formalisée ici avec une rigueur mathématique nouvelle. L'équipe a publié l'ensemble des 1 500 morphologies simulées pour permettre à d'autres groupes d'explorer l'espace de design. Aucun partenaire industriel ni timeline de commercialisation n'est annoncé, et Argus reste à ce stade un démonstrateur académique. La prochaine étape logique serait de valider le cadre d'isotropie dynamique sur des plateformes commerciales existantes, ou de voir si des acteurs comme Enchanted Tools ou Wandercraft en France intègrent ce type de métrique dans leurs cycles de conception.

RecherchePaper
1 source
Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action
3arXiv cs.RO 

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action

Le laboratoire de recherche en robotique derrière l'étude "Foresight Residual RL" a publié le 24 juillet 2026 sur arXiv (2607.16506v1) une méthode visant à corriger un défaut connu des politiques Vision-Language-Action (VLA) sur les tâches d'assemblage complexes. Le problème identifié est concret : sur une tâche en trois phases (saisie, déplacement-insertion, rotation) simulant le serrage d'un écrou avec une clé dans l'environnement Isaac Gym, les méthodes classiques de reinforcement learning résiduel appliquées à une politique VLA gelée échouent à enchaîner les sous-tâches correctement, même quand chaque sous-tâche individuelle réussit. La solution proposée, baptisée Foresight Residual RL, entraîne un prédicteur visuel qui estime, à partir d'une image de l'état terminal d'une sous-tâche, la probabilité de succès des sous-tâches suivantes, et utilise cette estimation comme multiplicateur de récompense pour orienter l'apprentissage. Sur la tâche testée, la méthode atteint 85,6% de réussite sur l'ensemble de la séquence, contre 54,5% pour le RL résiduel standard et des résultats inférieurs pour les politiques VLA de base seules. Ce résultat pointe un angle mort largement sous-estimé dans le déploiement industriel des politiques génératives pour la manipulation robotique : optimiser chaque geste isolément ne garantit pas un enchaînement fiable des tâches. Pour les intégrateurs qui envisagent des lignes d'assemblage à tolérances serrées, contact-riche, type ligne électronique ou mécanique de précision, la démonstration confirme un écart persistant entre la performance en démonstration isolée et la performance en séquence réelle, un des points de vigilance recurrents pointés par les acteurs du secteur, sceptiques face aux vidéos promotionnelles de robots humanoïdes. Le fait que le succès par sous-tâche reste inchangé alors que le succès global bondit change la manière de penser l'entraînement : il ne s'agit plus seulement de maximiser un taux de réussite par étape, mais de façonner l'état terminal produit à chaque étape pour qu'il reste exploitable par l'étape suivante, une nuance directement pertinente pour les équipes qui construisent des pipelines d'apprentissage par renforcement sur des bases VLA préentraînées comme Pi-0 ou GR00T. Cette approche s'inscrit dans la lignée des travaux récents combinant politiques VLA préentraînées et affinage par RL résiduel, une stratégie de plus en plus utilisée pour adapter des modèles de manipulation généralistes à des tâches industrielles spécifiques sans réentraîner l'ensemble du modèle. La méthode a été validée uniquement en simulation, sur une tâche mécanique unique et relativement contrainte ; aucune date de transfert vers un robot physique ni de partenariat industriel n'est mentionnée dans l'article. Les auteurs positionnent leurs travaux comme une réponse méthodologique générale au problème d'attribution de crédit sur des horizons longs, un défi que partagent les principaux laboratoires travaillant sur les politiques génératives pour bras robotiques et humanoïdes, de Physical Intelligence à NVIDIA, sans qu'aucun acteur français ou européen ne soit cité dans cette publication.

RecherchePaper
1 source
Modèle du monde pour la navigation sociale de robots guidée par la logique
4arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source