Aller au contenu principal
RoboIRS : orientation des représentations internes à l'inférence pour les politiques robotiques généralistes
RecherchearXiv cs.RO 

RoboIRS : orientation des représentations internes à l'inférence pour les politiques robotiques généralistes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie RoboIRS, une méthode de pilotage des représentations internes appliquée à l'inférence. Elle vise les politiques robotiques généralistes de type vision-langage-action (VLA) et les modèles monde-action (WAM). L'équipe collecte des déroulés réussis et échoués, puis entraîne des classifieurs linéaires pour repérer les emplacements du réseau liés au résultat. Elle en déduit, pour chaque tâche, une direction de pilotage injectée dans les activations, sans mise à jour des poids. Sur 15 tâches simulées avec une politique π0.5 gelée, le taux de succès moyen passe de 44,4 % à 66,2 %. La méthode dépasse d'autres interventions à l'inférence, pour un surcoût de calcul que les auteurs qualifient de faible sans le chiffrer dans le résumé. Ils ajoutent une validation en manipulation réelle avec le même π0.5. Ils l'appliquent aussi à Cosmos Policy, un WAM, dont le taux moyen passe de 35,4 % à 55,4 %.

Les VLA se dégradent souvent dès que la tâche s'écarte de la distribution d'entraînement, alors qu'ils conservent une partie de leur capacité. Ces résultats suggèrent qu'une part de cette compétence reste présente dans les représentations internes et peut être réactivée sans fine-tuning. Pour un intégrateur, cela évite de collecter de nouvelles démonstrations et de réentraîner le modèle à chaque variation de site ou de pièce. Le gain, environ 20 points sur les deux familles de modèles, est net. Il faut toutefois le lire avec prudence. Un taux de 66 % ou de 55 % reste loin d'un seuil de production. La direction de pilotage est propre à chaque tâche et exige des rollouts étiquetés succès ou échec, donc une supervision de résultat. Le résumé ne donne pas de chiffres pour les essais réels. Il s'agit enfin d'un preprint, dont les résultats n'ont pas été évalués par des pairs.

π0.5 est la politique généraliste de Physical Intelligence. Elle côtoie Helix de Figure et la famille GR00T de NVIDIA parmi les références du secteur. L'adaptation à de nouvelles conditions passe aujourd'hui surtout par le fine-tuning, l'apprentissage par renforcement ou l'accumulation de données. RoboIRS transpose à la robotique l'idée de « steering » d'activations, déjà explorée sur les grands modèles de langage. La suite logique serait de la tester sur davantage de plateformes et de tâches longues, et de mesurer le surcoût de latence dans des conditions de déploiement. Aucun pilote industriel ni calendrier n'est annoncé. Un site de projet accompagne la publication.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Orienter les politiques génératives de robots avec des préférences lexicographiques
1arXiv cs.RO 

Orienter les politiques génératives de robots avec des préférences lexicographiques

Des chercheurs présentent, dans un article publié sur arXiv (2609.15014v1), une méthode pour piloter, au moment de l'inférence et sans modifier leurs poids, des politiques robotiques génératives préentraînées basées sur des modèles de diffusion ou de flow matching, afin qu'elles respectent des préférences de déploiement classées par ordre de priorité lexicographique, par exemple des contraintes de faisabilité liées au robot avant des préférences propres à l'utilisateur. La méthode modifie l'échantillonneur de deux façons: un guidage par barrière dynamique empêche les mises à jour de priorité inférieure de dégrader les coûts de priorité supérieure, et une sélection en cascade filtre les échantillons candidats niveau par niveau. Sur un benchmark de navigation, elle améliore le taux de succès, la traversabilité et la conformité aux préférences par rapport à la politique gelée seule, et dépasse nettement des références à somme pondérée pourtant réglées manuellement. Transférée à une politique de manipulation en flow matching sur le benchmark simulé LIBERO, elle améliore la conformité sans réduire le taux de réussite des tâches, et une étude contrôlée montre qu'elle égale la meilleure performance des poids fixes sur une plage de réglages beaucoup plus large. Cette approche cible un problème concret de déploiement des politiques robotiques génératives de type VLA: un modèle entraîné sur des données générales n'intègre pas nécessairement l'ordre de priorité exigé sur le terrain, où sécurité et faisabilité doivent souvent primer sur les préférences d'un opérateur ou d'un client. Plutôt que de ré-entraîner ou d'affiner le modèle pour chaque cas d'usage, la méthode agit uniquement à l'inférence sur un modèle figé, ce qui intéresse directement les intégrateurs cherchant à adapter une politique généraliste à des contraintes site par site sans cycle de fine-tuning. Elle met aussi en évidence les limites des combinaisons pondérées de coûts, pratique courante mais fragile car elle exige un réglage manuel à chaque nouveau déploiement. Les résultats restent toutefois limités à des benchmarks simulés, navigation et LIBERO, sans validation sur robot physique ni chiffres de déploiement réel. Le travail s'inscrit dans une recherche plus large sur le guidage de modèles génératifs appliqué à la prise de décision sous contraintes, à mesure que diffusion et flow matching remplacent les politiques d'apprentissage par renforcement classiques dans la robotique généraliste. LIBERO, utilisé pour la partie manipulation, est un benchmark de référence pour évaluer les politiques d'imitation et les modèles vision-langage-action en simulation, et le choix de tester les deux familles de modèles reflète leur coexistence actuelle dans le secteur, sans qu'aucun modèle commercial ni entreprise partenaire ne soit cité. Aucun acteur français ou européen n'apparaît dans les travaux. Classé comme nouvelle soumission arXiv, l'article ne précise ni calendrier de suite ni test annoncé sur robot réel, et se présente comme une contribution méthodologique destinée à d'autres équipes de recherche plutôt qu'à un produit ou un pilote commercial.

RecherchePaper
1 source
KeyGen : représentations centrées sur l'objet à points clés non supervisés pour généraliser des politiques par catégorie
2arXiv cs.RO 

KeyGen : représentations centrées sur l'objet à points clés non supervisés pour généraliser des politiques par catégorie

Le laboratoire à l'origine de KeyGen a publié fin septembre 2026 sur arXiv (référence 2609.28818) un framework d'apprentissage de représentations 3D pour la manipulation robotique. La méthode apprend, sans supervision, des points-clés sémantiques 3D canonicalisés à partir de nuages de points, qui servent de représentation structurée et centrée sur l'objet. Une politique visuomotrice par diffusion se conditionne sur ces points-clés et sur la géométrie de l'objet pour prédire des trajectoires de manipulation complètes, en maintenant une correspondance géométrique cohérente entre différentes instances d'un même type d'objet. Pour évaluer la généralisation au niveau catégorie, les auteurs ont construit un banc d'essai de simulation photoréaliste couvrant trois tâches de manipulation, associé à un pipeline de génération de données piloté par planification capable de produire des trajectoires expertes sur des objets aux formes, tailles et poses variées. Les résultats rapportés montrent que KeyGen surpasse nettement les méthodes antérieures, sur des objets déjà vus comme inédits, sous variation de pose, qu'il continue de progresser avec davantage de démonstrations par objet, qu'il reste robuste face aux changements d'échelle, et qu'il obtient de bonnes performances aussi bien en simulation qu'en manipulation réelle. L'enjeu visé est un défaut connu du clonage comportemental classique: les politiques apprises surajustent souvent la géométrie et l'apparence propres à chaque instance d'objet, ce qui limite fortement le transfert vers des objets jamais vus. En imposant une correspondance géométrique explicite via des points-clés canonicalisés, KeyGen s'attaque directement à l'écart entre démonstrations en laboratoire et généralisation réelle sur des familles d'objets hétérogènes, un problème central pour tout intégrateur cherchant à déployer une politique unique sur toute une catégorie de produits plutôt que sur des références individuelles. Si les résultats se confirment à plus grande échelle, l'approche pourrait réduire le volume de démonstrations nécessaire par objet, un critère économique clé pour l'industrialisation de la manipulation robotique. Le travail s'inscrit dans la lignée des représentations centrées-objet, une alternative aux politiques bout-en-bout conditionnées uniquement sur des pixels ou des nuages de points bruts, à distinguer des approches vision-langage-action (VLA) qui misent surtout sur le volume de données pour généraliser. KeyGen reste à ce stade une contribution de recherche évaluée sur un banc d'essai simulé propriétaire et des tests réels limités à trois tâches, sans déploiement industriel ni partenariat annoncés. Les suites logiques évoquées par les auteurs concernent l'extension à davantage de catégories d'objets et de tâches plus complexes, ainsi qu'une comparaison directe avec des politiques VLA génériques entraînées à grande échelle.

RecherchePaper
1 source
Les politiques robotiques compactes exigent des représentations visuelles fines
3arXiv cs.RO 

Les politiques robotiques compactes exigent des représentations visuelles fines

Des chercheurs proposent CoRP (Compressed Representation Policy), une politique de manipulation multi-tâches volontairement compacte: 48,9 millions de paramètres, sans modèle vision-langage ni prior génératif vidéo. Elle sépare un extracteur de représentation d'un générateur d'actions par flow matching. Elle atteint 97,0 % de réussite sur LIBERO et 75,78 % (Clean) et 73,36 % (Randomized) sur RoboTwin 2.0, soit des scores comparables à ceux de systèmes 40,9 à 163,6 fois plus gros. Il s'agit de résultats de benchmarks en simulation, publiés sous forme de préprint arXiv, sans déploiement réel annoncé. Les auteurs fixent ensuite le générateur d'actions et font varier une seule propriété de l'extracteur à la fois. Un ViT-S/14 initialisé aléatoirement tombe à 78,1 % sur LIBERO, un ResNet-34 pré-entraîné sur ImageNet à 74,5 %, et geler l'encodeur coûte 19,8 points. Rééchantillonner chaque vue à 48 tokens bat le passage de tous les tokens de patchs (97,0 % contre 83,2 %). Le résultat remet en cause une lecture courante du secteur: les gains des VLA (vision-language-action) viendraient surtout de l'échelle ou des priors génératifs. Faute de comparaisons contrôlées, les publications mélangent architecture, taille et pré-entraînement, et ne permettent pas d'isoler ce qui compte. Ici, la représentation visuelle serait le facteur dominant: pré-entraînée, adaptée à la tâche et compressée. Pour un intégrateur ou un décideur, la portée est pratique: une politique de moins de 50 M de paramètres peut tourner sur du matériel embarqué modeste, avec une latence et un coût d'inférence bien plus faibles que des modèles de plusieurs milliards de paramètres. Deux résultats nuancent toutefois cette idée. Un goulot d'information variationnel est pire qu'un budget dur de tokens: il fait chuter LIBERO-Goal de 95,8 % à 33,0 %, car il supprime la sélection de tokens dépendante de l'instruction. Le langage n'aide que si l'observation laisse le but ambigu (LIBERO-Goal passe de 9,2 % à 95,8 %), alors que sur RoboTwin 2.0 sa suppression améliore légèrement le succès. Ce travail s'inscrit dans la course aux grands VLA (Pi-0, GR00T, Helix, entre autres), qui misent sur des backbones vision-langage massifs ou des priors vidéo. CoRP défend la voie inverse, celle de la politique frugale, et ajoute un argument d'ablation à un débat encore ouvert. Les limites sont claires: LIBERO est déjà proche de la saturation, RoboTwin 2.0 reste simulé, et rien ne dit que ces conclusions tiennent sur des tâches longues, du matériel varié ou des environnements industriels non structurés. La suite logique est une validation sur robots réels et la comparaison avec des modèles de grande taille dans les mêmes conditions. Une page projet est disponible à l'adresse corp-policy.github.io.

UEUne politique de manipulation de moins de 50 M de paramètres, validée uniquement en simulation, pourrait à terme permettre aux intégrateurs européens de robots industriels (KUKA, ABB, Universal Robots, Festo) d'embarquer l'IA sur du matériel modeste avec un coût d'inférence réduit, mais sans déploiement réel annoncé l'impact reste prospectif.

RecherchePaper
1 source
Une mémoire simple à base d'agents pour les politiques robotiques généralistes
4arXiv cs.RO 

Une mémoire simple à base d'agents pour les politiques robotiques généralistes

Des chercheurs proposent SimpleARM (Simple Agentic Robot Memory), une couche de mémoire sans entraînement pour politiques robotiques généralistes gelées, décrite dans un preprint arXiv (v1). Le système fonctionne en quatre temps : à partir de l'instruction de la tâche, il détermine ce qu'il faut surveiller ; des outils perceptifs gelés maintiennent en ligne un état compact et typé ; un accès structuré ne récupère cet état que lorsqu'un sous-objectif proposé dépend de l'historique ; enfin, un ancrage dans la vue courante résout les entités rappelées avant l'exécution. L'évaluation porte sur RoboMME, un benchmark de 16 tâches de manipulation dont la réussite exige des informations qui ne sont plus visibles dans l'observation actuelle. Sur les 16 tâches et trois graines de politique, SimpleARM atteint 67,17 % de réussite moyenne, contre 44,51 % pour la meilleure base de comparaison non oracle. Des ablations appariées montrent que retirer l'état de relation, de référence, de progression ou d'itinéraire provoque de fortes chutes là où cet état est mobilisé, et épargne largement les autres tâches. L'enjeu dépasse le gain chiffré, soit environ 22,7 points. Les systèmes de mémoire visuelle actuels conservent ou compressent des observations passées, en supposant que l'historique utile se retrouve dans les images. Or le contrôle robotique dépend aussi d'un état issu de l'interaction, qu'aucune image ne représente explicitement : quel objet est lequel après avoir été déplacé, où en est la tâche, dans quel ordre exécuter une procédure. Les résultats plaident pour une mémoire conçue comme un état compact et pertinent pour la tâche, plutôt que comme un historique visuel étendu. Pour les intégrateurs et les équipes qui déploient des politiques VLA gelées, l'intérêt pratique est réel : la couche s'ajoute sans réentraînement, donc sans coût de collecte de données ni de fine-tuning. La spécificité des ablations renforce la crédibilité du mécanisme. Des réserves s'imposent toutefois : les résultats proviennent d'un benchmark, avec des tâches vraisemblablement simulées, sans preuve de déploiement réel, et l'écart avec les approches plus complexes reste à vérifier hors de RoboMME. Ce travail s'inscrit dans la montée des modèles généralistes gelés, de type VLA, qui excellent en réactivité mais restent faibles sur les tâches à longue portée dépendant du passé. Les approches concurrentes se répartissent entre conservation brute de trames, compression de contexte visuel et mémoires apprises de bout en bout, toutes exposées au même défaut : ne pas capter l'état implicite. SimpleARM adopte une orientation « agentique », où des outils spécialisés remplissent l'état plutôt que la politique elle-même. Les suites logiques seraient des tests sur robot physique, d'autres benchmarks de mémoire et une comparaison avec des politiques entraînées avec mémoire native. Le preprint n'annonce ni code, ni pilote, ni calendrier, et n'a pas encore été évalué par des pairs.

RecherchePaper
1 source