Aller au contenu principal
LaST-R1 : un nouveau paradigme de raisonnement physique atteint 99,9 % de succès sur le benchmark LIBERO
IA physiquePandaily 

LaST-R1 : un nouveau paradigme de raisonnement physique atteint 99,9 % de succès sur le benchmark LIBERO

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe réunissant Zojian Power, l'Université de Pékin et l'Université chinoise de Hong Kong a publié LaST-R1 (Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning), un nouveau paradigme d'entraînement pour robots manipulateurs accepté en Spotlight à ICML 2026 (top 2,2 % des soumissions). Sur le benchmark LIBERO, référence standard d'évaluation de la manipulation robotique, le modèle atteint un taux de succès moyen de 99,9 % avec une seule trajectoire de mise en route, saturant le benchmark au point que les auteurs le considèrent désormais comme un outil discriminant insuffisant. En conditions réelles de saisie et de rotation d'objets, LaST-R1 surpasse pi0.5 de Physical Intelligence de 22,5 points de pourcentage. L'innovation centrale est l'abandon du raisonnement par chaîne de pensée en langage naturel : avant de générer une action, le modèle construit une représentation interne de la structure de la scène, des relations physiques entre objets et des dynamiques futures anticipées dans un espace latent. L'algorithme LAPO (Latent-to-Action Policy Optimization) optimise conjointement ce raisonnement et l'exécution motrice, les retours d'environnement pénalisant non seulement l'échec de l'action mais aussi la qualité du raisonnement physique préalable.

Ce résultat s'attaque au verrou le plus persistant des modèles VLA (Vision-Language-Action) : la généralisation. Les architectures comme OpenVLA, pi0 ou pi0.5 tendaient à échouer dès qu'un objet était légèrement déplacé ou que les conditions d'éclairage changeaient, trahissant une fragilité structurelle liée à la mémorisation de trajectoires plutôt qu'à la compréhension des contraintes physiques. En faisant raisonner le robot sur la physique avant d'agir, LaST-R1 améliore la robustesse aux perturbations sans nécessiter de rejeu massif de données, ce qui représente potentiellement une réduction des coûts de reprogrammation lors de changements de références ou de conditions opératoires pour les intégrateurs industriels.

Le terrain concurrentiel est aujourd'hui dominé par Physical Intelligence, dont les modèles pi0 et pi0.5 sont issus de la recherche académique californienne et adossés à des levées de fonds conséquentes, ainsi que par OpenVLA, fruit de consortiums universitaires américains. LaST-R1 positionne Zojian Power, startup chinoise, comme un acteur technique crédible en s'appuyant sur des collaborations académiques de premier rang à Pékin et Hong Kong. La sélection en Spotlight à ICML 2026 confère au travail une légitimité internationale, mais les expériences réelles restent limitées à des environnements contrôlés de saisie et de rotation ; aucun déploiement industriel ni feuille de route commerciale n'a été annoncé, ce qui maintient LaST-R1 dans la catégorie résultat de recherche prometteur, pas encore produit déployé.

À lire aussi

LaST-R1 : renforcement de l'action par raisonnement latent physique adaptatif pour les modèles VLA
1arXiv cs.RO 

LaST-R1 : renforcement de l'action par raisonnement latent physique adaptatif pour les modèles VLA

Des chercheurs ont publié le 29 avril 2026 sur arXiv (2604.28192) un nouveau cadre pour les modèles Vision-Langage-Action (VLA) baptisé LaST-R1, accompagné d'un algorithme d'apprentissage par renforcement inédit appelé LAPO (Latent-to-Action Policy Optimization). Le système atteint un taux de succès moyen de 99,8 % sur le benchmark de manipulation robotique LIBERO, après un unique épisode d'imitation supervisée en guise d'amorçage. En déploiement réel sur quatre tâches complexes, dont des configurations monobranche et bras-double, LAPO améliore les performances de 44 % par rapport à la politique issue de cet amorçage initial. L'apport central de LaST-R1 est de relier explicitement le raisonnement sur la physique à la génération d'actions, là où les approches existantes traitaient ces deux étapes séparément. Les VLA actuels raisonnent soit en langage naturel (coûteux en latence et discret), soit dans un espace latent continu, mais dans les deux cas par imitation statique, sans capacité d'adaptation par essais-erreurs. LAPO co-optimise simultanément le processus de raisonnement latent et la production d'actions via du renforcement en ligne, ce qui améliore la modélisation du monde physique et la robustesse en environnement interactif. Un mécanisme de "latent Chain-of-Thought adaptatif" permet en outre au modèle d'ajuster dynamiquement son horizon de raisonnement selon la complexité de la situation, sans coût fixe à chaque pas. Il s'agit d'une annonce académique sous forme de preprint, pas encore d'un produit embarqué sur robot commercial. Ce travail s'inscrit dans la course à la généralisation des VLA, portée ces derniers mois par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA. L'un des verrous récurrents du secteur est l'écart simulation-réalité (sim-to-real gap) et la difficulté à faire converger rapidement un modèle en conditions réelles sans millions d'épisodes supervisés. LaST-R1 revendique une convergence significativement accélérée grâce à l'optimisation jointe du raisonnement latent, une piste que suivent aussi des équipes européennes travaillant sur l'apprentissage par renforcement pour la manipulation, notamment dans l'orbite des laboratoires universitaires français. Les prochaines étapes naturelles seront la validation sur des benchmarks plus diversifiés (AgiBot World, RLBench) et l'intégration dans des plateformes matérielles commerciales.

UELes laboratoires français et européens travaillant sur la manipulation robotique par apprentissage par renforcement peuvent s'appuyer sur l'approche LAPO pour réduire leur dépendance aux grandes quantités de données supervisées, accélérant potentiellement leurs cycles de recherche.

IA physiqueOpinion
1 source
Benchmark COIN : quand le raisonnement rencontre l'interaction incarnée
2arXiv cs.RO 

Benchmark COIN : quand le raisonnement rencontre l'interaction incarnée

Une équipe de chercheurs a publié sur arXiv (2604.16886) COIN, pour Chain Of Interaction Benchmark, un nouveau protocole d'évaluation conçu pour mesurer la capacité des agents robotiques généralistes à raisonner et agir de manière interactive sur des tâches à horizon long. Le benchmark se structure en trois sous-ensembles : COIN-50, qui regroupe 50 tâches en environnement quotidien réaliste ; COIN-Primitive, consacré aux primitives d'action causalement dépendantes ; et COIN-Composition, de complexité intermédiaire, ciblant l'apprentissage et la généralisation de compétences. Pour constituer les données d'entraînement, les auteurs ont développé un système de télé-opération mobile en réalité augmentée à faible coût, permettant de collecter 1 000 démonstrations, 50 par tâche primitive. Trois familles d'approches ont été évaluées : CodeAsPolicy (génération de code exécutable par LLM), VLA (Vision-Language-Action models), et H-VLA (VLA hiérarchiques conditionnés au langage). Les résultats révèlent des lacunes critiques dans l'état de l'art actuel. Tous les modèles testés échouent significativement sur les tâches nécessitant un raisonnement interactif séquentiel, par exemple, ouvrir plusieurs tiroirs successifs avant de localiser et saisir un objet sous observabilité partielle. Le fossé constaté ne se situe pas tant dans la compréhension visuelle que dans le passage à l'exécution motrice : les modèles peinent à mettre à jour leurs plans en temps réel en fonction des nouvelles informations acquises à chaque étape. Ce résultat pèse directement sur les prétentions des VLA à opérer en autonomie dans des environnements non contrôlés, un signal d'alarme pour les intégrateurs qui anticipent des déploiements industriels à court terme. COIN s'inscrit dans une vague de benchmarks d'embodied AI cherchant à combler le manque de protocoles standardisés au-delà des tâches statiques de pick-and-place. Des travaux comme LIBERO, RLBench ou BEHAVIOR-1K ont posé des bases, mais aucun n'adressait explicitement la chaîne causale d'interactions sous observabilité partielle à cette granularité. La publication intervient alors que les laboratoires industriels, Physical Intelligence (pi) avec Pi-0, Google DeepMind avec RT-2 ou GR00T N2 de NVIDIA, multiplient les annonces sur la généralisation des VLA. COIN fournit un outil de comparaison indépendant, encore académique, dont l'adoption comme standard de facto dépendra de sa capacité à attirer des soumissions extérieures et à être intégré dans les pipelines d'évaluation des acteurs commerciaux.

IA physiqueActu
1 source
DeepCybo PhysBrain 1.5 obtient un score de 72,5 sur 28 benchmarks en tant que modèle fondation physique ouvert
3Pandaily 

DeepCybo PhysBrain 1.5 obtient un score de 72,5 sur 28 benchmarks en tant que modèle fondation physique ouvert

DeepCybo a publié PhysBrain 1.5, un modèle de fondation physique qui unifie compréhension incarnée, génération d'actions et prédiction d'états futurs dans une seule architecture autorégressive bâtie sur une base Qwen3-VL, enrichie de tokens d'action et d'état visuel. Le checkpoint de 8 milliards de paramètres affiche un score global de 72,5 sur 28 benchmarks publics d'IA incarnée, ce que DeepCybo revendique comme une première parmi les modèles open source, à environ un point des références propriétaires GPT-6 Astra (73,3) et Gemini 3.6 Flash (73,0), selon le tableau publié par l'entreprise. PhysBrain 1.5-8B se classe premier sur 14 des 28 benchmarks et deuxième sur 10 parmi les modèles open source, couvrant perception spatiale, raisonnement multi-vues, planification incarnée, ancrage des affordances et traces visuelles. Une version plus légère, PhysBrain 1.5-2B, obtient 66,6 sur la même suite et vise le déploiement plutôt que le classement. Les poids des deux versions, un rapport technique et un kit d'évaluation sont publics sur Hugging Face et GitHub sous le projet DeepCybo/PhysBrain 1.5. L'entraînement suit une boucle fermée: observer, raisonner et ancrer, agir, puis prédire l'évolution du monde. Réponses en langage naturel, structures spatiales, trajectoires d'effecteur via des tokens ActionPiece, et images futures alignées en RGB, profondeur et masque du robot partagent un seul objectif de prédiction du token suivant, sans têtes de tâche séparées. La supervision de pré-entraînement vient de vidéos d'interaction humaine (égocentriques, ego-exocentriques, panoramiques), et le fine-tuning mélange démonstrations humaines, trajectoires réelles de robots et simulation via le pont d'action "Human-as-Humanoid" de DeepCybo. Cette sortie confirme la montée des modèles VLA unifiés comme architecture de référence pour la robotique incarnée et la vitesse à laquelle les acteurs open source chinois cherchent à réduire l'écart avec les références propriétaires américaines sur les benchmarks publics. Pour les intégrateurs et décideurs B2B, la publication des poids et d'un kit d'évaluation change la donne par rapport à de simples vidéos de démonstration: elle permet de tester directement le transfert vers du matériel réel. Mais un score proche de GPT-6 Astra ou Gemini 3.6 Flash sur un agrégat de benchmarks ne garantit pas une manipulation plug-and-play: ces suites mesurent surtout perception, raisonnement spatial et planification, pas la robustesse en production. DeepCybo invite d'ailleurs les équipes à rejouer le pack d'évaluation et à vérifier le transfert des tokens ActionPiece sur leurs propres bras robotiques, signe que le score de 72,5 doit être lu comme un point de départ plutôt qu'une preuve de parité fonctionnelle avec les systèmes propriétaires. PhysBrain 1.5 s'ajoute à une vague de modèles de fondation incarnée open source déjà en circulation en Chine, aux côtés d'Intern W0, Motus2 et Cog-WM, dans une course où chaque acteur publie ses propres tableaux pour revendiquer un leadership partiel. Contrairement à une démonstration de politique pour un seul robot, DeepCybo positionne PhysBrain 1.5 comme un modèle de fondation généraliste, adaptable à différentes plateformes via le pont Human-as-Humanoid reliant données humaines et données robotiques. Aucun calendrier de pilote ni partenariat matériel n'est mentionné: à ce stade, il s'agit d'une sortie de modèle et de poids, pas d'un déploiement en production chez un intégrateur. Les prochaines étapes attendues sont la reproduction indépendante des scores par des équipes tierces et l'évaluation du transfert réel sur des bras et plateformes variés, seul test permettant de distinguer un score de benchmark d'une capacité de manipulation effective sur le terrain.

IA physiqueOpinion
1 source
Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique
4arXiv cs.RO 

Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique

Une équipe de chercheurs présente RoboTracer, un modèle de vision-langage (VLM) 3D permettant aux robots de tracer des trajectoires dans l'espace physique en raisonnant sur des mesures métriques concrètes. Publié en version 3 sur arXiv (2512.13660, décembre 2025), le système combine référencement spatial 3D et mesure de distance via un encodeur universel et un décodeur à supervision par régression, affiné d'abord en apprentissage supervisé (SFT) puis par renforcement (RFT) avec des récompenses intermédiaires sensibles aux métriques. Le dataset d'entraînement TraceSpatial regroupe 30 millions de paires question-réponse sur scènes intérieures, extérieures et de manipulation, avec des chaînes de raisonnement atteignant 9 étapes. Sur le benchmark TraceSpatial-Bench introduit par les auteurs, RoboTracer atteint 79,1 % de taux de succès moyen et dépasse Gemini-2.5-Pro de 36 points de précision. Le système a été validé sur bras UR5 (Universal Robots) et humanoïde G1 (Unitree) dans des scènes réelles encombrées. La contribution principale tient dans le raisonnement métrique, une capacité absente des VLM classiques : décrire une scène en langage naturel ne suffit pas pour estimer qu'un obstacle se trouve à 0,47 m à gauche, information nécessaire à toute trajectoire exécutable. L'approche RFT avec récompenses de processus supervise les étapes perceptuelles intermédiaires et non uniquement le résultat final, ce qui réduit concrètement l'écart entre compréhension sémantique et exécution physique (le demo-to-reality gap). Pour un intégrateur ou un COO industriel, cela signifie un robot capable d'opérer dans des espaces non cartographiés à l'avance. L'avance de 36 % sur Gemini-2.5-Pro est notable, même si ce modèle n'est pas conçu pour la robotique embarquée. RoboTracer s'inscrit dans la compétition autour des modèles VLA (Vision-Language-Action), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA, qui cherchent tous à unifier perception, raisonnement et action dans un modèle unique. Sa spécificité est l'accent sur la conscience métrique plutôt que sur le contrôle moteur fin, niche où Pi-0 reste dominant. Le choix des plateformes UR5 (bras industriel 6 axes, référence en intégration industrielle) et G1 (humanoïde Unitree, 43 degrés de liberté, environ 35 000 $) renforce la crédibilité de la généralisation multi-robots. À ce stade, il s'agit d'un résultat de recherche sans déploiement commercial annoncé ; la publication du dataset TraceSpatial et du benchmark ouvert constitue en revanche une infrastructure réutilisable directement par la communauté robotique.

UELe dataset TraceSpatial et le benchmark ouvert sont librement accessibles aux laboratoires européens de robotique, mais aucun acteur ou déploiement européen n'est impliqué dans cette contribution.

IA physiqueOpinion
1 source