Aller au contenu principal
RecherchearXiv cs.RO 

La modélisation résiduelle comble l'écart entre politiques de régression et génératives en apprentissage robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une alternative à la diffusion et au flow matching pour entraîner des politiques robotiques à partir de démonstrations (arXiv:2610.12231). Baptisée HT-Policies (heteroscedastic Student-t action régression), la méthode reste une régression directe : elle prédit un « chunk » d'actions en une seule passe avant, sans les étapes itératives de débruitage des modèles génératifs. Les auteurs l'ont évaluée sur quatre benchmarks de simulation et lors de tests sur robot réel. Elle atteint des taux de réussite comparables aux politiques génératives (Flow-Policies), aussi bien entraînée de zéro qu'à partir de modèles vision-langage-action (VLA) et de world-action models préentraînés. L'entraînement et l'inférence sont plus rapides, et le réseau de neurones d'une politique flow matching préentraînée peut être réutilisé comme backbone. Les auteurs ne donnent pas, dans le résumé, de chiffres de vitesse ni de taux de succès précis, ce qui oblige à attendre le papier complet pour juger de l'ampleur réelle du gain.

Le travail s'attaque à une explication largement admise : si les politiques de diffusion ou de flow matching surpassent la régression directe par erreur quadratique moyenne (MSE-Policies), ce serait parce que les démonstrations humaines sont multimodales, c'est-à-dire que plusieurs actions valides existent pour une même observation. L'analyse de données de démonstration réelles suggère une autre cause. Les résidus de prédiction d'action ont une échelle qui varie fortement selon l'état, et des queues plus lourdes qu'une gaussienne. Or la MSE alloue davantage de magnitude de gradient aux observations dont les résidus sont les plus grands, ce qui dégrade l'optimisation. Les politiques génératives ne seraient donc pas avantagées surtout par leur capacité à représenter plusieurs modes, mais par un comportement de gradient plus favorable. Si le résultat se confirme à grande échelle, il compte pour les intégrateurs et les équipes de déploiement : une politique mono-passe réduit la latence de contrôle et le coût de calcul embarqué, deux contraintes concrètes sur des robots à haute fréquence ou à ressources limitées.

L'article s'inscrit dans le débat sur l'apprentissage par imitation, dominé depuis plusieurs années par Diffusion Policy et les approches flow matching, qui équipent désormais de nombreux VLA de fondation, tels que Pi-0. L'idée proposée reste simple : une loi de Student-t avec échelle prédite en fonction de l'entrée, qui limite l'influence des valeurs extrêmes. Plusieurs réserves s'imposent. Il s'agit d'un préprint non évalué par des pairs, les benchmarks précis ne sont pas détaillés dans le résumé, et « compétitif » ne signifie pas supérieur. Une vérification sur des tâches fortement multimodales ou à long horizon reste nécessaire. Les prochaines étapes dépendront de la reproduction des résultats par d'autres laboratoires et de l'éventuelle adoption de cet objectif dans des VLA de grande taille. Une page de projet est annoncée pour le code et les démonstrations.

À lire aussi

Modélisation de récompense de progression pour l'apprentissage robotique : une étude complète
1arXiv cs.RO 

Modélisation de récompense de progression pour l'apprentissage robotique : une étude complète

Une étude publiée sur arXiv (arXiv:2607.21655v1) propose la première synthèse structurée de la littérature sur le "progress reward modeling" en apprentissage robotique, soit les signaux de récompense qui mesurent l'avancement d'une tâche pendant son exécution, et non plus seulement à son terme. Le constat de départ est simple: un signal de succès terminal indique si la tâche est accomplie, mais ne dit rien sur le fait qu'un robot progresse, stagne ou régresse dans son comportement en cours de route. Face à la profusion de méthodes récentes exploitant ce type de retour intermédiaire, les auteurs organisent le champ en trois axes reliés: l'interface du modèle (quelles observations et spécifications d'objectif il reçoit, quel signal de progression il produit), les mécanismes internes de construction de ce signal, puis les données et protocoles d'évaluation qui servent à le valider. L'étude recense aussi les limites actuelles des approches existantes et esquisse des pistes de recherche futures. L'enjeu dépasse la seule taxonomie académique. En apprentissage par renforcement ou par imitation, la récompense terminale rare reste un goulot d'étranglement majeur pour les tâches longues de manipulation ou de locomotion: sans retour intermédiaire, l'agent ne sait pas s'il se rapproche de l'objectif. Des signaux de progression denses, exploitables par des politiques vision-langage-action comme GR00T ou Pi-0, promettent un apprentissage plus efficace en échantillons. Mais les auteurs pointent surtout l'absence de cadre commun: espaces d'observation, formats de signal, sources de supervision et protocoles d'évaluation diffèrent d'un papier à l'autre, rendant les comparaisons de résultats entre laboratoires largement invalides en l'état. Ce travail s'inscrit dans la lignée des modèles de récompense apparus avec le RLHF pour les grands modèles de langage, transposés ici au monde incarné, après des années de récompenses denses conçues à la main ou de signaux terminaux trop pauvres pour guider l'apprentissage. Les approches récentes s'appuient sur des fonctions de valeur apprises à partir de vidéos, des modèles vision-langage utilisés comme juges, ou de l'apprentissage contrastif contre des démonstrations. Sans annoncer de nouveaux résultats expérimentaux, cette synthèse vise avant tout à poser les bases de benchmarks standardisés pour ce sous-domaine en pleine expansion.

RecherchePaper
1 source
2arXiv cs.RO 

Unifier l'apprentissage de politiques et la prédiction d'états grâce à la modélisation spatiale du langage

Des chercheurs proposent, dans un preprint arXiv (2610.12172), le « Spatial Language Modeling », une approche qui fait apprendre à un seul Transformer autorégressif à la fois la génération d'actions et la prédiction des états futurs d'une scène. Le principe consiste à représenter les contours de la scène, les objectifs, les cibles d'action et les états futurs avec un vocabulaire commun de coordonnées discrètes et de tokens sémantiques. Une grammaire propre à chaque tâche organise ces éléments en séquences spatiales, de sorte qu'un même objectif de prédiction du token suivant couvre le contrôle et la modélisation de l'état. Le modèle est entraîné de zéro en deux temps : un pré-entraînement sur des transitions issues de jeu aléatoire, puis un entraînement conjoint actions et états sur des démonstrations expertes. Pendant le pré-entraînement, les coordonnées d'action enregistrées servent de condition aux prédictions d'état suivantes, mais sont exclues de la perte. En phase de contrôle, le modèle ne décode que les cibles d'action exécutables et met à jour son historique avec les états réellement observés. L'évaluation porte sur la tâche Push-T, en simulation et sur un robot réel. Les auteurs annoncent des performances compétitives en simulation, et un taux de réussite ainsi qu'une couverture de la cible supérieurs à ceux des politiques de référence testées sur robot réel. Pour les équipes qui travaillent sur les politiques de manipulation, l'intérêt tient à la supervision complémentaire apportée par l'apprentissage des effets géométriques des actions. Les ablations indiquent que l'entraînement sur des séquences conjointes action-état améliore le contrôle, et que le pré-entraînement sur du jeu aléatoire apporte un gain supplémentaire. Ce dernier point est pertinent en pratique : ces données sont bon marché à collecter, sans téléopérateur expert. Le même modèle, alimenté avec des trajectoires d'actions fournies, prédit aussi les états successifs de la scène et reproduit les effets du poussage. Il joue donc à la fois le rôle de politique et de modèle du monde léger. Il faut toutefois rester prudent sur la portée de ces résultats. Push-T est un benchmark de poussage planaire d'un objet en forme de T, relativement simple, et le texte ne chiffre pas, dans son résumé, l'écart avec les baselines ni la taille de l'échantillon d'essais réels. La généralisation à des tâches à contacts riches, à de la 3D ou à des préhenseurs multi-doigts reste à démontrer, de même que le passage à l'échelle d'un vocabulaire de coordonnées discrètes. Ce travail s'inscrit dans un mouvement plus large visant à unifier perception, action et prédiction dans des architectures de type langage. Il se distingue des approches VLA (vision-langage-action) dominantes, qui reposent sur de grands modèles pré-entraînés, par un entraînement de zéro, sans pré-entraînement web, et par une représentation entièrement spatiale. Parmi les références habituelles de Push-T figurent les politiques de diffusion, qui servent souvent de base de comparaison, ainsi que les modèles du monde appris pour la planification. Le résumé ne précise ni l'équipe, ni le code, ni d'éventuelles extensions annoncées. Il s'agit à ce stade d'un preprint non évalué par des pairs, sans déploiement industriel associé. La suite logique sera de tester la méthode sur des tâches plus longues, sur des scènes 3D et sur des manipulations avec contacts complexes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ReShoot : randomisation visuelle générative du domaine pour l'apprentissage de politiques visuomotrices
3arXiv cs.RO 

ReShoot : randomisation visuelle générative du domaine pour l'apprentissage de politiques visuomotrices

Un article publié sur arXiv sous la référence 2609.19661 présente ReShoot, une méthode qui produit de la diversité visuelle en re-rendant des démonstrations robotiques déjà enregistrées, plutôt que d'en recollecter de nouvelles pour chaque changement d'apparence. Un modèle vision-langage décrit la scène et modifie un attribut ciblé, comme le fond, la couleur d'un objet ou un matériau, puis un générateur vidéo conditionné par les contours re-rend les deux vues caméra en conséquence ; l'instruction textuelle associée est mise à jour, mais la séquence d'actions et la trajectoire proprioceptive sont conservées à l'identique, sans réétiquetage. Sur le benchmark LIBERO, une politique entraînée à parts égales sur données réelles et re-générées obtient un taux de réussite quasi identique à un entraînement uniquement sur données réelles (96,5% contre 96,9%) et améliore la robustesse aux perturbations de scène sur LIBERO-Plus (85,5% contre 82,3%). Sur deux plateformes robotiques physiques, avec seulement 43 et 100 démonstrations pré-collectées, le taux de réussite sur des objets recolorés passe de 0% à respectivement 42,9% et 47,5%, sans dégradation des performances sur l'apparence d'origine. Ce résultat vise un point faible connu des politiques visuomotrices apprises par imitation : elles restent souvent collées aux conditions visuelles précises de leurs démonstrations d'entraînement, si bien qu'un simple changement de couleur ou de décor fait chuter drastiquement leurs performances. La parade habituelle, recollecter des démonstrations pour chaque nouveau contexte visuel, mobilise à chaque fois un robot, un environnement contrôlé et un opérateur humain, ce qui freine le déploiement à grande échelle en usine ou en entrepôt. En déplaçant l'effort de la collecte vers la génération, ReShoot suggère qu'une part significative de la robustesse visuelle recherchée par les intégrateurs peut s'obtenir sans temps robot supplémentaire ni simulation photoréaliste coûteuse à construire. Cette approche s'inscrit dans la lignée des travaux sur la randomisation de domaine et l'augmentation de données par génération, qui cherchent depuis plusieurs années à combler l'écart entre les démonstrations limitées disponibles et la diversité des conditions réelles d'exploitation. Sa particularité est de conserver intégralement les labels d'action et de proprioception du geste original, évitant le risque de réétiquetage erroné propre à d'autres pipelines génératifs. Le résumé ne précise ni les plateformes robotiques utilisées ni un calendrier de publication du code, ce qui place pour l'instant ReShoot au stade de publication de recherche plutôt que d'outil disponible pour les intégrateurs.

RecherchePaper
1 source
Le filtrage physique favorise la généralisation de l'apprentissage robotique
4arXiv cs.RO 

Le filtrage physique favorise la généralisation de l'apprentissage robotique

Des chercheurs publient un article intitulé « Physics Filtering Favors the Generalization of Robot Learning » (arXiv:2608.22701v1, fin août 2026). Ils présentent PhyFilter, un module de rétroaction léger et agnostique au modèle qui corrige les sorties d'un système d'apprentissage grâce à des résidus filtrés par la physique. Ses paramètres s'optimisent automatiquement via un algorithme d'auto-apprentissage, sans réglage manuel, ce qui permet une intégration directe avec des politiques robotiques variées. L'équipe valide PhyFilter sur quatre systèmes robotiques : des robots quadrupèdes, qui généralisent à des terrains inconnus, des variations de charge utile et des plages de vitesse inédites ; des drones, capables de voler sous des perturbations de vent jamais rencontrées ; des manipulateurs aériens, atteignant une précision de capture en vol de l'ordre du centimètre malgré des incertitudes de vent et de masse ; et des différentiateurs d'accélération, robustes face aux changements de distribution des données. L'apport principal tient au contraste affiché avec la stratégie dominante du secteur, celle qui améliore la généralisation en multipliant les données d'entraînement, approche jugée coûteuse et lente en robotique où collecter des démonstrations réelles à l'échelle des grands modèles de langage reste prohibitif. Les auteurs montrent qu'un robot peut généraliser efficacement face aux incertitudes dynamiques même avec un jeu de données limité, dès lors qu'une couche de correction physique compense le manque de volume. Pour les intégrateurs et décideurs du secteur, ce résultat interroge l'hypothèse selon laquelle la performance des politiques VLA (vision langage action) dépendrait avant tout du volume de données collectées, à la manière des approches type GR00T N2 ou Pi-0, et suggère une voie moins capitalistique pour déployer des robots robustes sans multiplier les flottes de collecte. L'article s'inscrit dans le débat opposant deux écoles de la robotique d'apprentissage : le scaling massif de données façon modèles de fondation (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure) et les approches hybrides combinant modèles physiques et apprentissage, dont PhyFilter est un représentant. En le présentant comme « model-agnostic », l'équipe vise une intégration dans des piles logicielles existantes plutôt qu'un remplacement des politiques déjà déployées. À ce stade, la contribution reste une publication de recherche testée en environnements contrôlés sur quatre plateformes matérielles, sans partenariat industriel, déploiement commercial ni pilote annoncé, ce qui la distingue nettement des annonces produits qui rythment habituellement l'actualité de l'humanoïde.

RecherchePaper
1 source