Aller au contenu principal
RecherchearXiv cs.RO 

SteerQuant : orienter l'erreur de quantification par une mise à l'échelle guidée par les actions dans les modèles monde-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient SteerQuant, un cadre de quantification 4 bits conçu pour les « world-action models » (WAMs), ces modèles qui génèrent conjointement des états futurs du monde et des actions par débruitage itératif. Un même jeu de poids traite des flux hétérogènes (tokens vidéo, proprioceptifs et d'action). Le système associe une cartographie de l'effet des erreurs de quantification de chaque flux sur l'action finale à un calibrage du scaling des canaux partagés, puis ajuste le scaling des activations par flux et par étape de débruitage. Il s'accompagne de Rudder, un moteur d'inférence 4 bits qui fusionne scaling et compensation de sortie dans les kernels bas débit. En W4A8 et W4A4, le taux de succès moyen sur LIBERO reste à 0,8 point de pourcentage du modèle pleine précision, avec jusqu'à 2,23 fois d'accélération du débruitage face au BF16 sur trois WAMs, et une mémoire GPU de pointe réduite. Sur un robot réel à deux bras, le déploiement W4A8 offre un gain de 1,35 fois en inférence de bout en bout, à succès moyen constant par rapport au BF16.

L'enjeu tient à un constat simple : en contrôle, la précision numérique ne suffit pas comme critère. Une même erreur de quantification n'a pas le même effet selon le flux où elle survient, et une erreur sur un token vidéo peut compter bien moins qu'une erreur sur un token d'action. En orientant l'erreur vers les calculs qui pèsent peu sur l'action finale, sans dupliquer les poids ni monter la précision de certains flux, la méthode évite les compromis habituels de la quantification mixte. Pour les intégrateurs, c'est une piste concrète pour embarquer des WAMs, jusqu'ici lourds à cause du débruitage itératif, sur des GPU embarqués limités en mémoire et en latence. Le chiffre réel mérite toutefois lecture attentive : 1,35 fois en bout en bout contre 2,23 fois sur le seul débruitage montre que le gain se dilue dès que l'on mesure la chaîne complète. LIBERO reste de plus un benchmark de simulation, et l'essai réel se limite à un robot à deux bras dont le détail des tâches n'est pas donné ici.

Ces travaux s'inscrivent dans la montée des modèles qui prédisent à la fois le monde et l'action, en complément des VLA (vision-langage-action) comme Pi-0 ou GR00T. Ces modèles sont coûteux en calcul, ce qui freine leur passage en production. La quantification 4 bits était déjà éprouvée sur les LLM et sur certains VLA, mais peu adaptée à ces architectures multi-flux. Il s'agit d'une prépublication arXiv, non évaluée par des pairs, sans annonce de produit ni de pilote industriel. La suite logique serait une validation sur davantage de plateformes, de tâches longues et de matériels embarqués, ainsi qu'une éventuelle ouverture du code de Rudder.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

IMPACT : l'attention comme carte des interactions pour entraîner à grande échelle des modèles du monde qui les intègrent
1arXiv cs.RO 

IMPACT : l'attention comme carte des interactions pour entraîner à grande échelle des modèles du monde qui les intègrent

Des chercheurs présentent IMPACT, une méthode d'entraînement pour les world models utilisés par les agents robotiques, détaillée dans un article publié le 2 septembre 2026 sur arXiv (2609.00161v1). Ces modèles prédisent l'évolution future d'une scène à partir d'une action donnée, mais peinent à générer des interactions physiquement plausibles entre un bras ou une main et les objets manipulés. Les approches existantes corrigent ce défaut en injectant des représentations externes de mouvement, géométrie ou sémantique, obtenues via des estimateurs auxiliaires ou des annotations manuelles, ce qui limite le passage à l'échelle. Les auteurs identifient plutôt un défaut structurel dans l'objectif d'entraînement standard, l'erreur quadratique moyenne globale, qui privilégie le contenu statique dominant de la scène au détriment des rares régions dynamiques où se joue l'interaction. IMPACT exploite les cartes d'attention croisée déjà associées aux tokens de l'objet manipulé comme indice spatiotemporel interne, échantillonne les régions candidates, les recalibre avec les erreurs de prédiction locales, puis reprend cette carte d'interaction pour repondérer la supervision du débruitage, sans représentation externe ni modification au moment de l'inférence. Testée sur des tâches de manipulation par bras robotique et par main humaine, avec plusieurs modalités de contrôle et backbones DiT, la méthode surpasse systématiquement les bases entraînées en MSE classique sur la fidélité des interactions, la plausibilité physique et la qualité visuelle. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement bien identifié dans l'entraînement des world models et des politiques VLA à grande échelle: la difficulté à faire tenir la promesse du "sim-to-real" ou de la génération vidéo conditionnée par action lorsque les moments qui comptent, le contact, la préhension, le déplacement d'un objet, ne représentent qu'une fraction des pixels d'une séquence. En évitant de dépendre d'annotateurs externes ou de pipelines de labellisation coûteux, IMPACT propose une voie de passage à l'échelle compatible avec les volumes de données nécessaires à l'entraînement de modèles génératifs pour la robotique, un enjeu direct pour les laboratoires qui alimentent des architectures de type GR00T N2, Pi-0 ou Helix en données synthétiques ou en simulateurs de monde. Ce travail s'inscrit dans la lignée des recherches récentes sur les world models conditionnés par action, où plusieurs équipes ont cherché à contraindre la génération avec des représentations de mouvement ou de géométrie pour éviter les artefacts physiquement incohérents, une limite régulièrement pointée dans les démonstrations vidéo de modèles de manipulation. IMPACT se positionne comme une alternative purement algorithmique à ces approches basées sur des représentations externes, testée sur plusieurs backbones DiT et modalités de contrôle, sans toutefois préciser de déploiement industriel ni de partenaire robotique à ce stade: il s'agit d'une contribution de recherche publiée sur arXiv, dont l'adoption par des acteurs commerciaux de la robotique reste à confirmer dans les prochains mois.

RecherchePaper
1 source
SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
2arXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet. L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle. Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

RechercheOpinion
1 source
ProbeAct : récupération des échecs sans entraînement guidée par sonde dans les modèles vision-langage-action
3arXiv cs.RO 

ProbeAct : récupération des échecs sans entraînement guidée par sonde dans les modèles vision-langage-action

Une équipe de recherche a publié sur arXiv (arXiv:2606.09740) ProbeAct, un framework d'intervention à l'exécution conçu pour détecter et corriger les échecs de saisie et de placement dans les modèles Vision-Language-Action (VLA) pré-entraînés, sans modifier leurs poids ni nécessiter de démonstrations supplémentaires. Le système repose sur trois composants couplés : une sonde légère sur les états cachés du modèle qui prédit les positions 3D des objets pertinents à partir des features intermédiaires du VLA (avec suivi d'identité par algorithme hongrois pour les scènes multi-objets) ; une machine à états cinématiques agnostique à l'objet qui détecte les défaillances de saisie, de transport et de placement via les signaux internes du préhenseur et la cinématique de l'effecteur terminal ; enfin, un filtre hiérarchique par Control Barrier Function (CBF) qui encode les zones d'échecs répétés comme contraintes soft sur l'ensemble de sécurité, corrigeant minimalement les actions du VLA sans altérer son comportement nominal. Évalué sur le benchmark LIBERO-plus, ProbeAct améliore le taux de succès d'OpenVLA-OFT de 69,6 % à 74,1 %. Un gain de 4,5 points de taux de succès peut sembler modeste, mais il intervient sur un problème structurel bien identifié des VLA : leur fragilité hors distribution. Ces modèles échouent régulièrement face à des variations de luminosité, des changements de point de vue caméra, ou de légères variations d'état initial, autant de conditions triviales dans un déploiement industriel réel. L'intérêt de ProbeAct est précisément d'être plug-and-play, orthogonal aux pipelines d'entraînement existants, et applicable aussi bien aux modèles de base qu'aux versions fine-tunées. Pour un intégrateur, cela signifie un filet de sécurité superposable sur n'importe quel VLA sans coût de ré-entraînement, ce qui réduit concrètement le gap entre performance en benchmark et robustesse terrain. Les VLA ont connu une accélération notable depuis 2023 avec des modèles comme RT-2 (Google DeepMind), OpenVLA (UC Berkeley) ou pi-0 (Physical Intelligence), mais leur fragilité aux perturbations reste un frein reconnu à la commercialisation. Les approches existantes pour y remédier passent généralement par de l'augmentation de données ou du fine-tuning ciblé, coûteux en temps et en annotations. ProbeAct s'inscrit dans une alternative émergente : la correction à l'inférence, sans toucher au modèle. Il s'agit pour l'instant d'un preprint arXiv, sans déploiement annoncé ni partenaire industriel mentionné ; les prochaines étapes naturelles seraient une validation sur hardware réel hors benchmark simulé.

RechercheOpinion
1 source
Mise à l'échelle en temps de test par historique causal pour la récupération après échec dans les modèles autorégressifs monde-action
4arXiv cs.RO 

Mise à l'échelle en temps de test par historique causal pour la récupération après échec dans les modèles autorégressifs monde-action

Des chercheurs publient sur arXiv (papier 2609.18016v1, soumis le 17 septembre 2026) un framework de récupération d'échec pour les "world-action models" (WAM), ces systèmes qui modélisent conjointement la dynamique visuelle future et les actions du robot pour la manipulation. Le problème identifié est précis : ces modèles sont entraînés quasi exclusivement sur des trajectoires réussies, si bien qu'ils échouent dès que l'exécution réelle s'écarte de la dynamique apprise, et dans les WAM autorégressifs, chaque erreur d'exécution s'inscrit dans l'historique causal et contamine les prédictions suivantes. La méthode proposée, qualifiée de "training-free" (pas de réentraînement nécessaire), reformule la récupération d'échec comme un scaling au moment de l'inférence sur l'historique causal, en trois étapes couplées : un déclencheur qui détecte la non-progression persistante et n'intervient que si l'état d'exécution le permet, un module qui identifie le suffixe d'historique non fiable, retrouve une ancre historique correspondant à l'état physique courant et reconstruit l'état causal (KV) à partir du préfixe retenu, et enfin une vérification d'hypothèses qui compare les continuations générées à partir de l'historique complet, du préfixe récupéré et d'une réinitialisation totale, avant de retenir la meilleure. Les expériences, menées en simulation et sur banc réel, montrent une amélioration constante du taux de succès des tâches, et les ablations confirment l'apport de chacune des trois étapes. L'enjeu dépasse le papier lui-même : il touche au point faible connu des modèles vision-langage-action (VLA) et WAM déployés en usine, à savoir l'écart entre démonstrations soignées et robustesse en conditions réelles bruitées. Un mécanisme de récupération générique, applicable sans réentraînement à des modèles existants, intéresse directement les intégrateurs qui cherchent à fiabiliser des pipelines de manipulation basés sur des architectures autorégressives, un défi partagé par l'ensemble des modèles de type Pi-0, GR00T N2 ou Helix. Ce travail reste à ce stade un preprint arXiv, non encore validé par relecture par les pairs ni testé à grande échelle industrielle ; l'abstract ne précise ni les auteurs ni leur affiliation. Il s'inscrit dans un effort de recherche plus large visant à combler l'absence de mécanismes natifs de correction d'erreur dans les modèles génératifs de robotique, un axe que plusieurs laboratoires explorent en parallèle à mesure que ces modèles passent du stade démonstratif au déploiement réel.

RecherchePaper
1 source