Aller au contenu principal
RecherchearXiv cs.RO 

InfiNoVA : augmentation infinie de vues nouvelles pour des politiques robotiques invariantes au point de vue

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs en robotique ont présenté InfiNoVA (Infinite Novel View Augmentation), une méthode d'augmentation de données pour les politiques Vision-Language-Action (VLA), détaillée dans un preprint publié sur arXiv le 24 septembre 2026 sous la référence 2609.27734v1. Le problème visé : ces politiques restent dépendantes des angles de caméra utilisés à l'entraînement et perdent en performance face à un nouveau point de vue, un défaut que la seule multiplication de démonstrations physiques ne corrige que partiellement, à coût élevé. InfiNoVA reconstruit chaque trajectoire de manipulation, filmée par plusieurs caméras synchronisées, en une représentation 3D Gaussienne variable dans le temps, puis génère des vues synthétiques depuis des poses caméra échantillonnées, en conservant la correspondance état-action d'origine. Sur quatre tâches de manipulation réelles, les politiques entraînées avec cette méthode obtiennent un taux de réussite moyen 5,4 fois supérieur à celui de l'augmentation VISTA ou d'une politique non augmentée face à des points de vue inédits, et 1,7 fois supérieur à un entraînement direct sur les cinq caméras physiques disponibles.

Ce travail cible un frein concret à l'industrialisation des politiques VLA : l'écart de performance qui apparaît dès qu'un intégrateur installe une caméra à une hauteur ou un angle différent de ceux du laboratoire d'origine, un obstacle direct à des déploiements sur des cellules robotiques hétérogènes. En s'appuyant sur une représentation 3D explicite plutôt que sur une synthèse générative par diffusion, InfiNoVA limite aussi les hallucinations visuelles qui nuisent à l'exécution de la tâche, un défaut connu de ces méthodes génératives. Pour un décideur robotique, l'enseignement clé est que la robustesse au point de vue s'obtient ici par un traitement des données d'entraînement, sans modifier l'architecture de la politique.

InfiNoVA s'inscrit dans les efforts pour combler l'écart de généralisation visuelle des politiques VLA. Sa comparaison directe avec VISTA, une méthode antérieure d'augmentation de vues, la positionne comme une alternative aux approches génératives par diffusion. Le travail reste une contribution de recherche en preprint, validée sur quatre tâches de laboratoire, sans partenariat industriel annoncé, présentée par ses auteurs comme une voie vers des politiques robustes aux caméras et vers des tests à plus grande échelle.

Dans nos dossiers

À lire aussi

Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations
1arXiv cs.RO 

Au-delà des pixels : apprendre des récompenses invariantes pour la robotique réelle à partir de quelques démonstrations

Des chercheurs ont publié fin mai 2026 (arXiv:2605.22123) un framework permettant d'apprendre des fonctions de récompense symboliques invariantes à partir de seulement cinq démonstrations pour des tâches de manipulation robotique. Le système repose sur deux composants couplés : une formulation structurelle de récompense encodant des stratégies de niveau tâche et des contraintes physiques, et une procédure hybride symbolique-numérique qui distille des invariants comportementaux depuis ces démonstrations sans requérir d'interaction en ligne avec l'environnement. La méthode a été évaluée sur huit tâches du benchmark Meta-World et trois tâches de manipulation sur bras Franka, affichant de meilleures capacités d'alignement procédural et de classement de rollouts de politique par rapport aux baselines existantes. Trois expériences réelles out-of-distribution valident une généralisation zero-shot à des variations de position, de point de vue caméra et d'instances d'objets inédites. Le problème adressé est structurel : les modèles de récompense basés sur la vision tendent à mémoriser des distributions de pixels spécifiques et s'effondrent dès que les conditions visuelles changent, qu'il s'agisse d'un objet déplacé, d'un angle de caméra différent ou d'une variante d'objet inconnue. Pour un intégrateur déployant un système de manipulation en milieu industriel, cela impose de recollectecter des démonstrations ou de réentraîner le modèle à chaque variation du contexte opérationnel. Le passage aux invariants symboliques, c'est-à-dire des propriétés comportementales constantes indépendamment de l'apparence visuelle, propose une représentation de récompense réutilisable sur de multiples variantes de tâche sans interaction supplémentaire, ce qui réduit significativement le coût itératif du déploiement en apprentissage par renforcement. Ce travail s'inscrit dans une dynamique de recherche active visant à résoudre le goulot d'étranglement du reward engineering en RL robotique. Les approches récentes fondées sur des embeddings visuels issus de VLMs, comme VIP ou RoboCLIP, ont progressé sur la généralisation visuelle mais restent fragilisées par les variations de distribution en dehors des conditions d'entraînement. La méthode proposée se distingue en substituant aux embeddings bruts une abstraction symbolique de la tâche. Des laboratoires comme Berkeley BAIR, Stanford ou le CMU Robotics Institute travaillent sur des directions similaires d'abstraction pour le RL. La capacité à bootstrapper une récompense généralisable depuis cinq démonstrations seulement ouvre la voie à des pipelines de fine-tuning robotique plus accessibles, potentiellement utilisables par des intégrateurs sans expertise RL avancée.

RecherchePaper
1 source
Apprentissage continu de politiques robotiques via des dynamiques neuronales variationnelles
2arXiv cs.RO 

Apprentissage continu de politiques robotiques via des dynamiques neuronales variationnelles

Des chercheurs ont publié en juin 2026 (arXiv:2606.27353) un framework d'apprentissage continu permettant à un robot de s'adapter en temps réel à des dynamiques changeantes et non observées, sans nécessiter de réentraînement complet. Le système combine un modèle de dynamique analytique (prior physique) avec un résidu neuronal entraîné à capturer les effets non modélisés. Un encodeur récurrent infère en ligne la "condition cachée" courante du robot, c'est-à-dire l'état du système non directement mesurable (charge utile variable, usure mécanique, perturbations aérologiques), à partir des trajectoires état-action récentes. Cette condition estimée pilote à la fois le modèle résiduel et la politique de contrôle. Lors de l'apprentissage, la politique est optimisée par simulation différentiable en échantillonnant un ensemble de dynamiques plausibles issues du modèle latent. Sur un quadrotor réel soumis à des vents récurrents, le système récupère une perturbation connue en environ 1 seconde, soit cinq fois plus rapidement qu'un réentraînement résiduel en ligne classique, et réduit les erreurs de vol stationnaire et de suivi de trajectoire respectivement de 65,7 % et 53,3 % par rapport aux approches d'adaptation en ligne de l'état de l'art. L'enjeu industriel est direct : la quasi-totalité des contrôleurs appris actuels sont entraînés une fois, puis déployés statiquement, comme si la dynamique du robot restait constante. En pratique, batteries qui se déchargent, charges qui changent de mission en mission, surfaces de contact qui évoluent, conditions météo variables, tout cela dégrade les performances sans mécanisme de correction. L'originalité de cette approche tient à la distinction entre "reconnaissance" et "réadaptation" : plutôt que de réajuster un modèle depuis zéro à chaque perturbation rencontrée (coûteux en données et en temps), le système reconnaît une dynamique déjà vue et l'applique immédiatement via l'encodeur récurrent. Ce paradigme est particulièrement pertinent pour les intégrateurs de drones industriels, de robots manipulateurs en logistique ou de plateformes mobiles en environnement extérieur, où les cycles de déploiement sont longs et les recalibrages manuels coûteux. Les résultats valident aussi une hypothèse clé du champ sim-to-real : qu'un prior physique structuré couplé à un résidu neuronal permet de généraliser à des conditions non vues lors de l'entraînement, à condition que ces conditions aient été préalablement "vécues" lors d'autres déploiements. Ce travail s'inscrit dans une lignée de recherches sur l'adaptation dynamique de politiques robotiques incluant la randomisation de domaine (popularisée par OpenAI Robotics dès 2018), les approches méta-learning type MAML, et les méthodes d'adaptation en ligne par processus gaussiens. Le réentraînement résiduel en ligne, utilisé comme baseline de comparaison, est une technique établie mais limitée par sa latence de convergence, problème central que ce framework adresse directement par la reconnaissance latente. L'article est à ce stade un preprint non relu par les pairs, et les expériences réelles restent limitées au quadrotor ; la généralisation à des robots à pattes ou à des bras manipulateurs industriels reste à démontrer. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné. Les prochaines étapes probables incluent des tests sur des plateformes à dynamiques plus complexes et une validation sur des dynamiques à distribution plus large.

RecherchePaper
1 source
Pix2Act : politiques de manipulation dans l'espace image avec augmentation équivariante
3arXiv cs.RO 

Pix2Act : politiques de manipulation dans l'espace image avec augmentation équivariante

Pix2Act, une nouvelle méthode d'apprentissage par imitation pour la manipulation robotique, reformule le contrôle 3D des bras robotiques en un problème de prédiction 2D dans le plan de la caméra. Concrètement, au lieu de prédire directement des poses de préhenseur en trois dimensions, le système génère des trajectoires continues de points clés dans l'image de chaque caméra, puis reconstruit sans perte d'information les poses de l'effecteur final par triangulation entre plusieurs vues. Cette approche aligne observations et actions dans le même espace de coordonnées, ce qui permet d'appliquer des transformations équivariantes: faire pivoter conjointement les images de chaque caméra et les trajectoires d'action correspondantes. Les chercheurs ont conçu une architecture réseau capable de fusionner plusieurs points de vue caméra tout en respectant les rotations propres à chacun. Testée sur un ensemble de tâches de manipulation, à la fois en simulation et en conditions réelles, Pix2Act dépasse les performances des méthodes de référence actuelles et conserve sa robustesse même en cas de perturbations de la position des caméras. L'enjeu dépasse la simple performance brute sur un benchmark. Le goulot d'étranglement classique de l'apprentissage par imitation en robotique reste la faible quantité de données de démonstration disponibles: chaque trajectoire enregistrée coûte cher à collecter. En transformant l'augmentation de données géométrique (rotation) en une opération mathématiquement cohérente sur les images et les actions simultanément, Pix2Act élargit artificiellement la diversité des données d'entraînement sans démonstrations supplémentaires. Pour les équipes qui développent des politiques de manipulation vision-action (VLA), c'est un argument concret contre l'idée reçue que la précision de bras robotiques en 3D nécessite obligatoirement des architectures de contrôle lourdes ou des capteurs de profondeur dédiés: une reformulation en 2D bien pensée, combinée à la triangulation multi-caméra, peut suffire à atteindre une précision comparable, avec en prime une meilleure tolérance au bruit de calibration caméra, un problème fréquent en déploiement réel. Cette publication s'inscrit dans une lignée de recherches récentes sur les politiques de manipulation basées vision, où des approches comme les modèles génératifs de trajectoires ou les architectures de diffusion pour la robotique cherchent à résoudre le même arbitrage entre expressivité du contrôle et efficacité d'apprentissage. La démonstration se limite pour l'instant à des tâches de manipulation en laboratoire, sans indication de partenariat industriel ou de déploiement à plus grande échelle; les auteurs annoncent la publication de leur code et de leurs résultats détaillés pour permettre à la communauté de reproduire et d'étendre ces travaux à d'autres familles de tâches robotiques.

RecherchePaper
1 source
Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique
4arXiv cs.RO 

Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique

Un preprint publié sur arXiv (2608.05999v1) présente HiRoC (Hierarchical Robotic Control), un cadre de post-entraînement hiérarchique pour les modèles vision-langage-action (VLA) en manipulation robotique. Le principe : séparer la planification de haut niveau de l'exécution des actions. Un module planificateur décompose une tâche complexe en sous-objectifs exécutables, tandis qu'un module exécuteur affine en continu la génération d'actions conditionnées à ces sous-objectifs par apprentissage par renforcement (RL). Avant cette phase de RL, les auteurs alignent d'abord l'exécuteur sur les sous-objectifs du planificateur, pour corriger le désalignement de distribution qui apparaît habituellement entre planification et exécution. Testé sur plusieurs benchmarks de manipulation, HiRoC surpasse de façon constante les méthodes de référence. Le problème est concret : la plupart des méthodes de post-entraînement traitent les VLA comme des politiques plates, ce qui limite la modélisation de la progression d'une tâche et la robustesse sur des manipulations à long horizon. Les approches hiérarchiques existantes reposaient surtout sur de l'apprentissage supervisé à partir de démonstrations hors ligne, sans capacité à s'améliorer par interaction en ligne. En combinant hiérarchie et RL, HiRoC permet au comportement du robot de continuer à s'affiner après l'entraînement initial plutôt que de rester figé aux données de démonstration. Pour les équipes de recherche et les intégrateurs, cela touche une question centrale du secteur : la capacité réelle des VLA à tenir des tâches multi-étapes sans dérive, point faible connu des politiques de bout en bout entraînées uniquement par imitation. Ce travail s'inscrit dans la vague des modèles VLA qui s'appuient sur des modèles vision-langage pré-entraînés pour piloter des bras ou des robots, une approche qui a gagné du terrain ces deux dernières années face aux politiques de contrôle entraînées de zéro. L'article ne mentionne ni déploiement sur robot physique hors simulation, ni partenariat industriel, ni concurrent commercial nommé : il s'agit d'une contribution méthodologique côté recherche. La suite logique passe généralement, pour ce type de méthode, par une validation sur des plateformes robotiques réelles et une comparaison directe avec les cadres hiérarchiques concurrents déjà publiés, un exercice que ce préprint ne couvre pas encore.

RechercheOpinion
1 source