Aller au contenu principal
RecherchearXiv cs.RO 

Test-Time Scaling pour les modèles d'action du monde via évaluation géométrique zéro-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le 24 juillet 2026 des chercheurs ont publié sur arXiv (2607.17454) une méthode d'allocation de calcul au moment de l'inférence pour les World Action Models (WAM), ces modèles robotiques qui prédisent à la fois un segment d'actions et les observations futures qui en découlent. La technique, sans entraînement supplémentaire, sélectionne la meilleure parmi plusieurs trajectoires générées (Best-of-N, avec N=8) en évaluant la cohérence géométrique des observations futures prédites entre plusieurs points de vue, grâce à un modèle de fondation géométrique figé qui vérifie la reprojection de profondeur. Une seconde version ajoute une porte de déclenchement légère qui ne lance cet échantillonnage supplémentaire que si la trajectoire initiale semble incohérente. Testée sur cinq combinaisons de benchmarks et de modèles (RoboCasa, LIBERO Long et RoboTwin 2.0), la méthode à budget fixe améliore le taux de réussite dans tous les cas, faisant passer la moyenne du groupe RoboCasa de 66,3% à 68,4% avec Cosmos Policy, et de 80,8% à 82,5% avec X-WAM. La version avec porte de déclenchement conserve en moyenne 74,8% du gain obtenu par la version systématique, tout en ne déclenchant un échantillonnage additionnel que sur 26,2% des décisions.

L'enjeu dépasse le simple gain de score: la méthode traite un problème concret pour le déploiement de robots pilotés par des modèles vision-langage-action (VLA), celui de décider en temps réel si dépenser plus de calcul avant d'exécuter un geste vaut le coût en latence. Contrairement aux approches classiques de test-time scaling qui nécessitent un signal de récompense ou une étiquette de tâche, ce sélecteur fonctionne sans supervision, uniquement à partir de la cohérence géométrique des futurs prédits. C'est un signal utile pour les intégrateurs qui cherchent à fiabiliser des politiques VLA en production sans réentraînement, et une preuve que l'écart entre démonstration et fiabilité réelle peut être réduit par du calcul additionnel bien ciblé plutôt que par un modèle plus gros.

Les auteurs situent leur travail dans la lignée des World Models robotiques récents, qui couplent prédiction du futur visuel et génération d'actions, à l'image de Cosmos Policy ou X-WAM utilisés ici comme architectures de base. L'article documente aussi un mode d'échec: certaines trajectoires reçoivent un score de cohérence faussement bas, ce qui explique pourquoi les gains de performance plafonnent, voire se dégradent, quand on augmente excessivement le nombre de trajectoires échantillonnées N. Cette limite ouvre la voie à des travaux futurs sur des métriques de sélection plus robustes.

À lire aussi

GEM-4D : modèles du monde vidéo enrichis par la géométrie pour la manipulation robotique
1arXiv cs.RO 

GEM-4D : modèles du monde vidéo enrichis par la géométrie pour la manipulation robotique

Une équipe en soumission anonyme (probablement ICCV ou NeurIPS 2025) publie GEM-4D sur arXiv, un modèle mondial vidéo ancré géométriquement pour la manipulation robotique. Le constat de départ est bien documenté : les VWM (Video World Models) génèrent des séquences futures visuellement plausibles à partir d'une instruction, mais ne maintiennent pas la cohérence du mouvement au niveau des points entre les images, ce qui les rend inutilisables pour l'exécution d'actions physiques fiables. GEM-4D résout cette limitation en injectant, pendant l'entraînement, une supervision de correspondances 4D denses distillée depuis un modèle de fondation géométrique pré-entraîné dans le backbone génératif vidéo, tout en conservant une architecture single-stream sans surcoût à l'inférence. Un module de dynamique inverse convertit ensuite les rollouts vidéo cohérents en trajectoires exécutables, déployables en simulation comme en réel. Sur la combinaison prédiction vidéo et cohérence géométrique, GEM-4D atteint l'état de l'art, et le taux de succès en manipulation réelle progresse de 61 % à 81 %, soit un gain de 20 points. Ce gain de 20 points sur des tâches réelles est le chiffre central : il valide l'hypothèse que la supervision géométrique suffit à combler le gap entre apparence visuelle et ancrage physique. Pour les intégrateurs et décideurs industriels, l'architecture single-stream représente un avantage concret, sans module géométrique séparé à maintenir en opération. Cela positionne les VWM comme une alternative sérieuse aux approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, jusque-là perçues comme plus directement actionnables. La réserve habituelle s'applique : la soumission reste anonyme, les vidéos de la page projet ne permettent pas encore d'évaluation indépendante, et le protocole de test en environnement réel n'est pas détaillé dans le résumé disponible. Les VWM appliqués à la robotique constituent un axe de recherche actif depuis 2023, avec des travaux précurseurs comme UniSim (OpenAI) ou IRASim. GEM-4D s'y distingue en apportant la cohérence géométrique 3D+temporelle qui faisait défaut, en s'appuyant sur des modèles de fondation pour la reconstruction dense, domaine où l'INRIA Paris (à l'origine de DUSt3R et MASt3R) est un acteur européen de référence. La chaîne supervision géométrique → génération vidéo → action robotique apparaît ainsi viable à l'échelle d'un déploiement réel. Les prochaines étapes naturelles seront une validation sur des benchmarks standardisés comme RLBench ou LIBERO, et des tests hors des environnements de laboratoire contrôlés.

UELes modèles géométriques de fondation de l'INRIA Paris (DUSt3R, MASt3R) constituent la base de la supervision géométrique de GEM-4D, positionnant la recherche européenne en reconstruction dense comme un maillon clé de la prochaine génération de modèles de manipulation robotique.

RechercheOpinion
1 source
Évaluation de l'adaptation zéro-shot et one-shot des petits modèles de langage pour l'interaction leader-suiveur
2arXiv cs.RO 

Évaluation de l'adaptation zéro-shot et one-shot des petits modèles de langage pour l'interaction leader-suiveur

Une équipe de chercheurs a publié une évaluation comparative de petits modèles de langage (SLMs) pour la classification de rôles en interaction humain-robot, avec un focus sur le paradigme leader-suiveur. L'étude, diffusée sur arXiv (2602.23312v3), porte sur Qwen2.5-0.5B, un modèle de seulement 500 millions de paramètres. Les chercheurs ont construit un benchmark original à partir d'une base de données existante, enrichie d'échantillons synthétiques pour capturer les dynamiques propres aux échanges leader-suiveur. Deux stratégies d'adaptation ont été testées, prompt engineering et fine-tuning, évaluées en modes zero-shot et one-shot, comparées à un modèle non entraîné. Le résultat le plus notable : le fine-tuning zero-shot atteint 86,66 % de précision en classification, avec une latence de 22,2 ms par échantillon. En revanche, les modes one-shot dégradent les performances, la longueur de contexte accrue dépassant la capacité architecturale du modèle. Ces résultats ont une portée directe pour les intégrateurs de robots mobiles et assistifs fonctionnant à la périphérie du réseau, là où le déploiement de LLMs complets (70B+) est hors de portée en raison des contraintes de mémoire, de puissance et de latence. La démonstration qu'un SLM fine-tuné peut assigner des rôles conversationnels en temps réel avec moins de 25 ms de délai est un argument concret contre le réflexe "plus grand est meilleur". Elle valide aussi l'approche par fine-tuning ciblé plutôt que par ingénierie de prompt pour des tâches de classification embarquées, ce qui simplifie le pipeline de déploiement sans dépendre d'un serveur distant. Le paradigme leader-suiveur est fondamental dans les applications HRI : robots de guidage, assistance à la mobilité, plateformes collaboratives. Les LLMs comme LLaMA ou Mistral ont démontré des capacités de dialogue naturel, mais leur taille les confine au cloud. L'essor des SLMs optimisés, Qwen2.5, Phi-3, Gemma-2B, ouvre une nouvelle piste pour l'embarqué. L'étude identifie cependant une limite critique : la gestion du contexte long reste un goulot d'étranglement pour les modèles sous le milliard de paramètres, ce qui restreint les interactions multi-tours. Les prochaines étapes naturelles sont l'évaluation sur matériel embarqué réel (Jetson, Raspberry Pi 5) et l'extension à des architectures légèrement plus larges pour tester si le compromis contexte-précision se déplace.

RecherchePaper
1 source
Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence
3arXiv cs.RO 

Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence

Des chercheurs publient MECo-WAM (Multi-Expert Co-Training World Action Model), une nouvelle architecture de "World Action Model" (WAM) concue pour la manipulation robotique, decrite dans un papier reference arXiv:2607.05468v1. L'idee est d'injecter des a priori geometriques 4D dans les representations video-action pendant l'entrainement, sans alourdir le graphe d'inference au moment du deploiement. Le systeme combine trois experts durant l'entrainement : un expert video, un expert action, et un expert 4D leger supervise par des cibles relationnelles issues d'un encodeur VGGT gele. Une visibilite asymetrique entre experts empeche les raccourcis non causaux entre geometrie auxiliaire et generation d'actions. Deux mecanismes assurent le transfert des connaissances geometriques vers le chemin video-action reellement deploye : une attention a masque de lecture 4D a decroissance progressive, qui fournit un guidage geometrique restreint en debut d'entrainement puis le retire par etapes, et une distillation geometrique temporelle orientee action, qui aligne les relations geometriques intra-image et leur evolution en priorisant les zones visuelles pertinentes pour l'action du robot. Au deploiement, tous les composants 4D auxiliaires sont supprimes. Sur les benchmarks LIBERO et RoboTwin 2.0, le modele atteint respectivement 98,2% et 92,6% de reussite, avec des gains confirmes sur des taches de manipulation reelles. Ce travail cible une limite connue des WAMs actuels : l'entrainement conjoint video-action optimise generalement des latents orientes apparence, qui capturent mal la geometrie evolutive necessaire a une manipulation precise. En montrant qu'un gain de precision est possible sans surcout d'inference, MECo-WAM repond a une tension centrale pour les integrateurs et les equipes de recherche appliquee : les modeles VLA (vision-language-action) les plus performants deviennent souvent trop lourds pour un deploiement temps reel embarque. La methode illustre une tendance de fond dans la recherche en manipulation robotique, celle de deporter la complexite geometrique et multimodale vers la phase d'entrainement pour ne conserver au runtime qu'un pipeline leger, une piste directement pertinente pour les fabricants de bras robotiques et de systemes AMR qui cherchent a industrialiser des politiques apprises. MECo-WAM s'inscrit dans la lignee des World Action Models qui cherchent a unifier prediction video future et generation de sequences d'actions executables, une approche deja explorée par des architectures VLA comme Pi-0 ou GR00T N2. La reference a VGGT, encodeur de geometrie 4D reconnu en vision par ordinateur, situe le papier a l'intersection de la reconstruction 3D/4D et de l'apprentissage de politiques robotiques. Les auteurs evaluent leur approche sur deux benchmarks de simulation standards, LIBERO et RoboTwin 2.0, ainsi que sur des taches reelles, mais ne donnent pour l'instant aucun calendrier de deploiement industriel ni de partenariat avec des integrateurs : le travail reste, a ce stade, une contribution de recherche publiee sur arXiv.

RecherchePaper
1 source
RoboTrustBench : évaluation de la fiabilité des modèles du monde vidéo pour la manipulation robotique
4arXiv cs.RO 

RoboTrustBench : évaluation de la fiabilité des modèles du monde vidéo pour la manipulation robotique

Une équipe de recherche a publié en juin 2026 RoboTrustBench (arXiv:2606.01600), un benchmark conçu spécifiquement pour évaluer la fiabilité des modèles vidéo du monde (video world models) appliqués à la manipulation robotique. Le jeu d'évaluation repose sur des épisodes réels issus du dataset DROID et comprend 1 207 paires instruction-image validées par des experts. Les modèles sont soumis à quatre scénarios progressivement contraignants : Normal (instructions valides et réalisables), Constraint-Sensitive (contraintes environnementales ou physiques), Counterfactual (états initiaux impossibles ou contradictoires) et Adversarial (instructions non sûres ou malveillantes). Le protocole d'évaluation s'articule autour de six dimensions et 13 critères fins, et mobilise à la fois des annotateurs humains et des MLLM (multimodal large language models) comme juges. Sept modèles vidéo représentatifs ont été évalués dans ce cadre. Les résultats révèlent une dissociation nette entre qualité visuelle et fiabilité opérationnelle : les modèles produisent des vidéos cohérentes en apparence, mais échouent sur le raisonnement sous contrainte, l'ancrage contrefactuel, les interactions physiques plausibles et, fait plus préoccupant, la suppression d'instructions non sûres. Pour les intégrateurs et les équipes robotique qui utilisent ces modèles comme simulateurs de planification ou comme oracles de vérification, cela signifie qu'une métrique de qualité vidéo seule ne peut pas servir de proxy de confiance. La capacité à rejeter une instruction dangereuse ou physiquement impossible est un prérequis de déploiement industriel que les architectures actuelles ne satisfont pas. Les video world models ont pris une place croissante dans la recherche en robotique depuis 2024, avec des travaux comme UniSim, DIAMOND ou Genie, qui les positionnent comme substituts légers de simulateurs physiques pour l'entraînement et la planification. DROID, le dataset sous-jacent de RoboTrustBench, est l'une des collections de trajectoires de manipulation réelles les plus utilisées en recherche académique. L'absence de benchmark centré sur la robustesse adversariale et les cas limites physiques était identifiée comme un angle mort du domaine. RoboTrustBench comble ce manque, mais la publication ne présente pas de modèle amélioré ni de solution : elle caractérise le problème et fournit l'infrastructure d'évaluation pour orienter les prochains travaux de fine-tuning ou d'alignement de ces modèles sur des critères de sûreté.

RecherchePaper
1 source