Aller au contenu principal
RecherchearXiv cs.RO 

CARF : appariement de flux guidé par les échecs avec attraction-répulsion contrastive

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (référence 2609.21982v1, mise en ligne le 21 septembre 2026) CARF, pour Contrastive Attraction Repulsion of Failure-guided Flow Matching, un cadre d'apprentissage conçu pour exploiter les trajectoires ratées produites lors de la collecte de démonstrations robotiques, en plus des démonstrations réussies. Le système s'appuie sur un scoreur d'importance fondé sur la progression, entraîné uniquement sur des démonstrations expertes réussies et leurs versions perturbées, qui évalue la contribution de chaque étape vers l'accomplissement de la tâche et repère ainsi les segments informatifs dans les trajectoires échouées. Ce score alimente un objectif unique de flow matching qui attire la politique vers les comportements progressifs tout en la repoussant des comportements jugés critiques pour l'échec, en écartant les segments ambigus. Les auteurs annoncent des gains constants face à des méthodes concurrentes, sur des expériences menées en simulation et sur robot réel, couvrant plusieurs scénarios d'échec, avec des ablations censées confirmer l'apport du scoring et du mécanisme d'attraction-répulsion. Le projet dispose d'un site dédié mais reste à ce stade une publication de recherche, sans produit ni déploiement annoncé, et les résultats chiffrés restent auto-rapportés sans comparaison indépendante.

Pour les équipes qui entraînent des politiques d'action par imitation, comme celles bâties sur des architectures vision-langage-action de type flow matching ou diffusion, la collecte de démonstrations propres reste le principal poste de coût: chaque trajectoire ratée en téléopération est habituellement jetée. En proposant de distinguer explicitement les segments à imiter des segments à éviter au sein même des échecs, CARF vise à augmenter le rendement des jeux de données existants sans collecte supplémentaire, un enjeu direct pour les intégrateurs et laboratoires qui alimentent des modèles génératifs de contrôle à grande échelle.

Cette approche s'inscrit dans la lignée des politiques par flow matching et diffusion, popularisées par des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, où l'essentiel des progrès récents vient de l'échelle et de la qualité des données d'entraînement plutôt que de l'architecture. Les méthodes antérieures se limitaient à extraire les portions encore utiles d'une trajectoire échouée; CARF ajoute la dimension inverse, la répulsion active. Aucune date de publication de code ni pilote industriel n'est annoncé à ce stade, le travail restant expérimental.

À lire aussi

ConFlow : apprentissage guidé par contraintes avec appariement de flux pour la génération de mouvement
1arXiv cs.RO 

ConFlow : apprentissage guidé par contraintes avec appariement de flux pour la génération de mouvement

ConFlow, un nouveau framework de génération de mouvement robotique par flow matching intégrant des contraintes dès l'entraînement, a été publié sur arXiv (2607.14424v1). Le flow matching est une méthode de modélisation générative reposant sur un échantillonneur neuronal basé sur des équations différentielles ordinaires (ODE), entraîné en régressant les champs de flux empiriques associés aux trajectoires observées. Le problème que ConFlow cherche à résoudre est simple à énoncer : la plupart des approches actuelles entraînent le modèle de flux sur des données brutes, puis appliquent des contraintes propres à la tâche uniquement au moment de l'inférence, via un guidage externe. Les auteurs proposent à la place d'injecter directement l'information de contrainte dans l'objectif d'entraînement, sous forme de fonctions de barrière ou de coût différentiables. Autre nouveauté technique : la distribution source gaussienne standard du flow matching est remplacée par un processus gaussien conditionnel, ce qui permet d'imposer des spécifications de conception comme la régularité ou les conditions aux limites. Le système exploite aussi des démonstrations infaisables comme supervision négative, sans nécessiter de données expertes supplémentaires. Sur une tâche de navigation impliquant deux robots, ConFlow affiche un taux de collision plus faible et une meilleure qualité de trajectoire que les baselines de flow matching standard, avec ou sans guidage à l'inférence. L'enjeu dépasse la simple performance chiffrée : ce travail questionne une hypothèse répandue dans la génération de mouvement par apprentissage, à savoir que le guidage à l'inférence suffit à faire respecter des contraintes physiques ou de sécurité à un modèle entraîné sans elles. En démontrant qu'intégrer les contraintes pendant l'entraînement referme l'écart entre entraînement et inférence, ConFlow apporte un argument concret pour les équipes qui développent des politiques de mouvement destinées à des robots opérant sous contraintes strictes (évitement de collision, limites articulaires, zones interdites), un enjeu central pour tout déploiement industriel ou multi-robot. Le flow matching s'est imposé ces dernières années comme alternative aux modèles de diffusion pour la génération de trajectoires robotiques, dans la même famille de méthodes que les architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui reposent elles aussi sur des politiques génératives entraînées sur démonstrations. ConFlow se positionne comme une brique méthodologique complémentaire à ces systèmes plutôt qu'un produit concurrent : la validation reste pour l'instant limitée à un scénario de navigation à deux robots, sans indication d'extension à des tâches de manipulation plus complexes ou à un déploiement matériel réel.

RecherchePaper
1 source
Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux
2arXiv cs.RO 

Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux

Des chercheurs publient le 2 juillet 2026 (arXiv:2607.02092) Guided Action Flow, une méthode d'inférence qui améliore les politiques robotiques vision-langage-action (VLA) à flow matching sans réentraîner le modèle de base. La politique préentraînée SmolVLA reste gelée : un critique appris sur des trajectoires réelles de succès et d'échec guide l'échantillonnage en temps inverse via des gradients d'action, avec un conditionnement possible sur la description de tâche issue du canal langage de SmolVLA. Sur le benchmark de manipulation LIBERO, un critique spécifique à une tâche fait passer le taux de succès de 68,0% à 82,0% sur une fenêtre de seed, puis de 82,0% à 86,0% sur une autre. Un critique multi-famille, entraîné sur plusieurs types de tâches, améliore le succès en validation de 46,0% à 56,0%, mais le gain sur le jeu de test verrouillé reste plus modeste, de 65,0% à 67,5%. Pour les intégrateurs qui déploient des politiques VLA figées en production, l'approche offre un gain de performance à l'inférence sans le coût d'un réentraînement complet, en transposant aux politiques d'action robotiques un guidage par critique déjà courant en génération d'image et en apprentissage par renforcement. L'écart entre le gain en validation (+10 points) et celui observé sur données verrouillées (+2,5 points) est le résultat le plus significatif de l'étude : il révèle une généralisation limitée du critique au-delà de sa distribution d'entraînement. La méthode est donc prometteuse pour affiner des politiques déjà déployées, mais son bénéfice réel sur des tâches totalement inédites reste contraint tant que la généralisation du critique et un guidage sensible à l'incertitude ne sont pas résolus, ce que les auteurs identifient eux-mêmes comme le verrou central de l'approche. SmolVLA, la politique de base utilisée, est un modèle VLA compact pensé pour du matériel limité, positionné face à des politiques plus lourdes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. LIBERO, le benchmark d'évaluation, est une suite standard de tâches de manipulation conçue pour tester l'apprentissage continu en robotique, et le choix du flow matching comme mécanisme de génération d'action reflète une bascule plus large du secteur vers des schémas de transport plus rapides à échantillonner que la diffusion classique. Guided Action Flow se positionne comme une brique complémentaire aux efforts de réentraînement à grande échelle, offrant un moyen peu coûteux d'améliorer des politiques déjà déployées plutôt que de concurrencer les gros modèles généralistes. Les auteurs annoncent vouloir approfondir la généralisation du critique et intégrer une notion d'incertitude dans le guidage, sans donner de calendrier précis pour ces prochaines étapes.

RechercheActu
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
3arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source
ProbeAct : récupération des échecs sans entraînement guidée par sonde dans les modèles vision-langage-action
4arXiv cs.RO 

ProbeAct : récupération des échecs sans entraînement guidée par sonde dans les modèles vision-langage-action

Une équipe de recherche a publié sur arXiv (arXiv:2606.09740) ProbeAct, un framework d'intervention à l'exécution conçu pour détecter et corriger les échecs de saisie et de placement dans les modèles Vision-Language-Action (VLA) pré-entraînés, sans modifier leurs poids ni nécessiter de démonstrations supplémentaires. Le système repose sur trois composants couplés : une sonde légère sur les états cachés du modèle qui prédit les positions 3D des objets pertinents à partir des features intermédiaires du VLA (avec suivi d'identité par algorithme hongrois pour les scènes multi-objets) ; une machine à états cinématiques agnostique à l'objet qui détecte les défaillances de saisie, de transport et de placement via les signaux internes du préhenseur et la cinématique de l'effecteur terminal ; enfin, un filtre hiérarchique par Control Barrier Function (CBF) qui encode les zones d'échecs répétés comme contraintes soft sur l'ensemble de sécurité, corrigeant minimalement les actions du VLA sans altérer son comportement nominal. Évalué sur le benchmark LIBERO-plus, ProbeAct améliore le taux de succès d'OpenVLA-OFT de 69,6 % à 74,1 %. Un gain de 4,5 points de taux de succès peut sembler modeste, mais il intervient sur un problème structurel bien identifié des VLA : leur fragilité hors distribution. Ces modèles échouent régulièrement face à des variations de luminosité, des changements de point de vue caméra, ou de légères variations d'état initial, autant de conditions triviales dans un déploiement industriel réel. L'intérêt de ProbeAct est précisément d'être plug-and-play, orthogonal aux pipelines d'entraînement existants, et applicable aussi bien aux modèles de base qu'aux versions fine-tunées. Pour un intégrateur, cela signifie un filet de sécurité superposable sur n'importe quel VLA sans coût de ré-entraînement, ce qui réduit concrètement le gap entre performance en benchmark et robustesse terrain. Les VLA ont connu une accélération notable depuis 2023 avec des modèles comme RT-2 (Google DeepMind), OpenVLA (UC Berkeley) ou pi-0 (Physical Intelligence), mais leur fragilité aux perturbations reste un frein reconnu à la commercialisation. Les approches existantes pour y remédier passent généralement par de l'augmentation de données ou du fine-tuning ciblé, coûteux en temps et en annotations. ProbeAct s'inscrit dans une alternative émergente : la correction à l'inférence, sans toucher au modèle. Il s'agit pour l'instant d'un preprint arXiv, sans déploiement annoncé ni partenaire industriel mentionné ; les prochaines étapes naturelles seraient une validation sur hardware réel hors benchmark simulé.

RechercheOpinion
1 source