Aller au contenu principal
RecherchearXiv cs.RO 

AnyviewMeter : adapter les modèles de récompense robotiques via la géométrie caméra et l'attention multi-vue

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent AnyviewMeter, un framework d'adaptation pour les modèles de récompense robotiques utilisés pour évaluer visuellement la progression d'une tâche. Le problème identifié : ces modèles, une fois entraînés, voient leurs prédictions varier selon le point de vue de la caméra ou les occlusions, même quand l'état réel de la tâche n'a pas changé. AnyviewMeter combine un fine-tuning à faible rang avec des rayons de Plücker alignés sur les tokens, qui encodent la géométrie de la caméra directement dans les caractéristiques visuelles et dans les mécanismes d'attention, ainsi qu'une attention par blocs synchronisée qui fusionne plusieurs vues à l'intérieur du décodeur préentraîné. Le système s'appuie sur le modèle Robometer et fonctionne en configuration mono-vue comme en évaluation conjointe multi-vues. Sur la tâche simulée PickCube, l'adaptation mono-vue améliore la prédiction de progression pour chaque groupe de caméras et réduit l'erreur absolue moyenne d'environ 21% par rapport à un simple fine-tuning RGB lorsque le champ de vision change. Sur un ensemble plus large de tâches de manipulation simulées, la prédiction conjointe multi-vues réduit l'erreur de progression de 41 à 69% par rapport à une moyenne de prédictions mono-vues RGB, et améliore l'ordonnancement temporel dans environ 88% des combinaisons tâche-caméra. Sur des tâches réelles utilisant des caméras fixes et montées sur poignet, l'erreur absolue moyenne baisse d'environ 21%.

Ces résultats visent un angle mort concret de la robotique par apprentissage : les modèles de récompense entraînés en simulation ou sur un jeu de caméras donné généralisent mal dès que la configuration physique change, un frein direct au déploiement chez des intégrateurs qui n'utilisent jamais exactement le même rig caméra que le laboratoire d'origine. En conditionnant explicitement le modèle sur la géométrie de la caméra plutôt qu'en espérant une généralisation implicite, AnyviewMeter propose une voie d'adaptation paramétrique légère, sans réentraînement complet, ce qui compte pour des équipes cherchant à réutiliser des modèles de récompense préentraînés sur des cellules robotiques hétérogènes. Cela nuance aussi l'idée que les VLA et modèles de supervision associés soient déjà robustes au changement de viewpoint dès la sortie du laboratoire.

Le travail s'inscrit dans la lignée des modèles de récompense visuels type Robometer, dont il constitue une extension géométrique plutôt qu'une refonte, et se positionne dans le champ plus large des méthodes de supervision pour l'apprentissage par renforcement en robotique, aux côtés des approches VLA génériques (Pi-0, GR00T N2). Les auteurs ne mentionnent pas de déploiement industriel ni de partenaire commercial: il s'agit d'un résultat de recherche évalué en simulation et sur un nombre limité de tâches réelles, sans indication de calendrier vers une intégration produit.

Dans nos dossiers

À lire aussi

ARGUS : alignement de la géométrie de scène robotique face aux changements de point de vue, avec de grands modèles de vision 3D
1arXiv cs.RO 

ARGUS : alignement de la géométrie de scène robotique face aux changements de point de vue, avec de grands modèles de vision 3D

Un article publié sur arXiv (2608.05579v1) présente ARGUS, un pipeline de pré-traitement pour les politiques visuomotrices de manipulation robotique. Le problème identifié : ces modèles confondent souvent la géométrie de la scène avec le point de vue de la caméra, apprenant où se trouve un objet dans l'image plutôt que dans l'espace de la tâche, ce qui limite leur généralisation sur des jeux de données multi-vues comme DROID ou BridgeV2. ARGUS s'appuie sur des modèles de vision 3D à grande échelle pour reprojeter les observations issues de caméras placées arbitrairement vers un point de vue canonique unique, avant de les transmettre à la politique en aval. Testé sur des configurations allant de multi-caméras fixes à des placements très variés, ARGUS surpasse les approches précédentes et converge vers des taux de réussite élevés 4 à 6 fois plus vite. Pour l'industrie robotique, ce travail cible un frein connu des intégrateurs : un modèle entraîné avec une caméra fixe généralise mal dès que l'angle ou la hauteur de montage change lors du déploiement sur une autre cellule. En montrant qu'une étape de canonicalisation géométrique en amont accélère l'apprentissage et améliore la performance sur des données hétérogènes, ARGUS alimente une hypothèse discutée en recherche VLA (vision-language-action) : décharger une partie du fardeau d'apprentissage vers des modules de perception 3D dédiés plutôt que tout confier à l'échelle des données. Pour des décideurs qui évaluent le coût de ré-entraînement face aux changements matériels, la promesse est claire : moins de données nécessaires pour généraliser. Ce travail s'inscrit dans la lignée des jeux de données ouverts DROID et BridgeV2, constitués pour agréger des démonstrations sur des configurations de caméras variées afin de démocratiser l'entraînement de politiques généralistes, une diversité qui s'est révélée être une limite plutôt qu'un atout tant que le point de vue n'était pas abstrait par le modèle. ARGUS se présente comme une brique de pré-traitement générique, indépendante de l'architecture de politique utilisée en aval, mais l'article ne précise pas sa compatibilité avec les grands modèles VLA propriétaires comme Pi-0, GR00T ou Helix qui dominent actuellement le secteur. Publié en preprint, sans code source ni test sur robot physique mentionné au-delà des jeux de données benchmark cités, sa validation en conditions réelles de déploiement reste à confirmer.

RecherchePaper
1 source
OC-VLA++ : cohérence multi-vue guidée par géométrie monoculaire pour une manipulation robotique robuste au point de vue
2arXiv cs.RO 

OC-VLA++ : cohérence multi-vue guidée par géométrie monoculaire pour une manipulation robotique robuste au point de vue

Le laboratoire à l'origine d'OC-VLA publie une extension baptisée OC-VLA++, qui vise à corriger un angle mort connu des modèles vision-langage-action (VLA) pour la manipulation robotique : la généralisation à des points de vue caméra non vus pendant l'entraînement. La méthode originale, OC-VLA, ancrait déjà les prédictions d'action dans le repère de la caméra plutôt que dans le repère robot, pour aligner la supervision avec l'observation visuelle. Mais les auteurs montrent que cet ancrage seul reste sujet au surapprentissage lorsque peu de points de vue sont couverts à l'entraînement. OC-VLA++ ajoute deux mécanismes : une supervision par paires de vues guidée par la géométrie, et un objectif explicite d'équivariance d'action inter-vues. Concrètement, le modèle reçoit des paires d'observations d'une même scène de manipulation, prises sous des angles géométriquement reliés, et apprend à produire des prédictions dans l'espace caméra qui correspondent à la même action une fois ramenées au repère du robot. Le papier, publié en preprint sur arXiv (2608.01066v1), rapporte des gains « substantiels » en généralisation à des vues inédites sous couverture caméra limitée, avec une dégradation plus progressive à mesure que le déplacement de caméra augmente, sans toutefois fournir de chiffres précis de taux de réussite dans le résumé, ce qui invite à rester prudent avant validation indépendante. Pour les intégrateurs et les équipes robotique, le sujet touche à un problème très concret : la plupart des déploiements industriels utilisent un nombre restreint de caméras fixes, et un modèle VLA entraîné sur ces angles précis échoue souvent dès qu'une caméra est repositionnée, remplacée ou que la cellule de travail change de configuration. Si l'équivariance d'action inter-vues tient ses promesses au-delà du cadre expérimental du papier, elle pourrait réduire le besoin de collecter des données massives multi-caméras pour chaque nouvelle installation, un poste de coût important dans le déploiement des VLA à grande échelle. Cela s'inscrit dans un débat plus large du secteur sur l'écart entre démonstrations en laboratoire et robustesse réelle : beaucoup de modèles VLA impressionnent sur les vues d'entraînement mais généralisent mal dès que l'environnement visuel bouge, un des obstacles cités au passage à l'échelle des humanoïdes et bras manipulateurs. Le travail se situe dans la lignée directe d'OC-VLA, dont il corrige une limite identifiée par ses propres auteurs plutôt que de proposer une architecture radicalement nouvelle. Le papier ne mentionne pas de comparaison directe avec les autres familles de VLA du moment comme Pi-0, GR00T N2 ou Helix, et ne précise pas si les expériences ont été menées en simulation, sur robot réel, ou les deux, une information qu'on aimerait voir clarifiée avant de juger de la portée réelle des résultats. Les auteurs présentent ces résultats comme un argument en faveur de l'équivariance d'action inter-vues comme complément à l'ancrage centré sur l'observation, en vue d'un déploiement robuste en conditions réelles, mais aucun calendrier de test terrain ni partenariat industriel n'est annoncé à ce stade. Le texte reste, pour l'instant, une contribution de recherche publiée en preprint, sans revue par les pairs ni suite commerciale connue.

RechercheActu
1 source
GaussianWAM : distiller la géométrie et la sémantique des champs gaussiens 3D en modèles monde-action
3arXiv cs.RO 

GaussianWAM : distiller la géométrie et la sémantique des champs gaussiens 3D en modèles monde-action

Un article publié sur arXiv (2608.24714) présente GaussianWAM, une méthode d'entraînement qui renforce les World-Action Models (WAM), des architectures qui apprennent conjointement à prédire les images futures et à générer des actions robotiques à partir de la dynamique vidéo. À partir d'observations multi-vues synchronisées, des modèles de fondation gelés fournissent profondeur, paramètres de caméra et caractéristiques sémantiques denses, reliés à des primitives de champ Gaussien 3D communes puis distillés dans les représentations du WAM ; tous les composants auxiliaires sont retirés après l'entraînement, sans changement du chemin d'inférence. Sur le benchmark LIBERO-Plus, GaussianWAM fait passer le taux de réussite de FastWAM de 52,05% à 71,29%, et celui de Cosmos Policy de 71,52% à 77,30%. Une base combinant distillation CLIP et VGGT atteint déjà 69,37%, portée à 71,29% par l'unification via champ Gaussien. Des gains sont aussi rapportés sur LIBERO standard, avec des tendances de transfert positives sur RoboTwin et en manipulation réelle. Ce résultat cible une limite connue des WAM : leurs représentations vidéo, optimisées pour la prédiction visuelle, ne captent pas explicitement la structure géométrique inter-vues ni la sémantique localisée des objets manipulés, ce qui plafonne la précision en manipulation fine. Un gain de près de 20 points sur FastWAM sans modifier l'architecture de déploiement ni ajouter de calcul à l'inférence suggère que l'écart entre politiques généralistes de type VLA et politiques spécialisées peut se combler par un enrichissement de la supervision à l'entraînement plutôt que par des modèles plus lourds au runtime, un point clé pour les intégrateurs évaluant des systèmes comme Pi-0, GR00T N2 ou Helix sur des tâches industrielles à budget de calcul limité. GaussianWAM s'inscrit dans les travaux récents combinant modèles de fondation en vision (CLIP, VGGT) et représentations 3D explicites pour améliorer l'apprentissage de politiques robotiques, face aux World-Action Models comme Cosmos et aux architectures FastWAM utilisées ici comme références. L'évaluation combine des benchmarks de simulation établis (LIBERO, LIBERO-Plus, RoboTwin) avec de premiers essais en manipulation réelle, une combinaison encore rare dans la littérature que les auteurs avancent pour appuyer la généralité de la méthode au-delà de la simulation. Le papier ne mentionne aucun partenariat industriel ni plan de commercialisation : il s'agit à ce stade d'une contribution de recherche, sans indication de code source ouvert ni de calendrier de suite.

RecherchePaper
1 source
RoboAlign-R1 : alignement multimodal des récompenses pour les modèles du monde vidéo robotique
4arXiv cs.RO 

RoboAlign-R1 : alignement multimodal des récompenses pour les modèles du monde vidéo robotique

Des chercheurs ont publié le 6 mai 2026 sur arXiv (arXiv:2605.03821) un framework baptisé RoboAlign-R1, conçu pour améliorer l'alignement des modèles vidéo du monde robotique avec les objectifs réels de prise de décision. Le coeur du travail repose sur un benchmark inédit, RobotWorldBench, qui rassemble 10 000 paires vidéo-instruction annotées issues de quatre sources de données robotiques, et sur un juge multimodal, RoboAlign-Judge, capable d'évaluer les vidéos générées selon six dimensions distinctes (instruction following, manipulation accuracy, plausibilité physique, entre autres). Ce juge enseignant est ensuite distillé en un modèle récompense léger pour un post-entraînement par renforcement. En parallèle, les auteurs introduisent une stratégie d'inférence sans entraînement supplémentaire, le Sliding Window Re-encoding (SWR), qui rafraichit périodiquement le contexte de génération pour limiter la dérive lors des prédictions à long horizon. Les gains mesurés sont de 10,1 % sur le score agrégé à six dimensions par rapport au meilleur baseline, dont 7,5 % en précision de manipulation et 4,6 % en suivi d'instructions. Le SWR apporte quant à lui une réduction de 9,8 % en LPIPS et une hausse de 2,8 % en SSIM, avec seulement environ 1 % de latence additionnelle. Ce travail pointe un problème structurel rarement nommé aussi clairement dans la littérature : les modèles vidéo robotiques sont généralement optimisés pour des métriques visuelles basses (reconstruction pixel, SSIM) qui ne corrèlent pas avec la performance réelle en manipulation ou en suivi d'instructions. Autrement dit, un modèle peut produire des vidéos visuellement cohérentes tout en étant inutilisable pour le contrôle d'un bras robotique. En transposant la logique du post-entraînement par récompense, inspirée du RLHF appliqué aux LLM, aux world models vidéo, RoboAlign-R1 propose une voie pour aligner simulation et tâche réelle. Pour les équipes qui utilisent ces modèles comme simulateurs de planification ou générateurs de données synthétiques, l'évaluation multi-dimensionnelle de RoboAlign-Judge pourrait devenir un protocole de référence, à condition que le benchmark soit publié et reproductible. Cette publication s'inscrit dans une dynamique plus large d'application des techniques d'alignement (post-training, distillation, RL) à la robotique incarnée, un domaine où des travaux comme UniSim, GROOT de NVIDIA ou IRASim ont posé les bases des world models vidéo. Le code et les données ne sont pas encore disponibles publiquement au moment de la publication, ce qui limite l'évaluation indépendante des résultats. La prochaine étape naturelle serait une validation sur robot physique en dehors du protocole in-domain utilisé ici, car les gains mesurés en simulation n'impliquent pas directement un transfert sim-to-real amélioré.

RechercheOpinion
1 source