Aller au contenu principal
RecherchearXiv cs.RO 

Au-delà de la prédiction du futur : le débruitage comme adaptation générative pour le contrôle des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2609.28339v1) une méthode baptisée NowWAM pour entraîner des politiques de contrôle robotique à partir de Diffusion Transformers (DiT) pré-entraînés sur de la génération d'images et de vidéos. Plutôt que de prédire des images futures pour transférer ce prior génératif vers le contrôle, comme le font la plupart des approches existantes, NowWAM débruite l'observation courante et prédit les actions du robot à partir du même flux visuel, sans cible visuelle future séparée. Sur le benchmark de simulation LIBERO-Plus, avec un backbone FLUX2-Klein, la méthode atteint 87,7 % de réussite, soit 6,1 points de plus qu'une base entraînée avec prédiction du futur, tout en divisant par deux le nombre de tokens visuels d'entraînement (784 à 392) et en réduisant le temps par étape de 2,85 à 1,63 seconde, un gain de vitesse de 1,8x. Avec un backbone texte-vers-image pur, Z-Image, sans capacité de génération vidéo ni d'édition d'image, NowWAM atteint 87,8 %.

Le résultat central du papier est que restreindre l'entraînement au seul point d'arrivée débruité dégrade nettement la robustesse, alors que remplacer la cible future par la cible présente ne change quasiment rien aux performances. Cela suggère que ce n'est pas la prédiction du futur en tant que telle qui rend utile le prior génératif des DiT pour le contrôle, mais la trajectoire de débruitage elle-même, utilisée comme interface d'apprentissage. Pour le secteur des politiques robotiques de type VLA (vision-language-action), bâties sur des bases génératives comparables à celles derrière Pi-0 ou GR00T N2, ce travail remet en cause l'hypothèse répandue selon laquelle un module de prédiction vidéo du futur serait nécessaire pour exploiter un prior génératif. Il ouvre aussi une piste d'efficacité concrète: moitié moins de tokens visuels et un temps de calcul par étape quasi divisé par deux, un enjeu direct pour le contrôle temps réel embarqué.

Ce travail s'inscrit dans la tendance à construire des politiques de contrôle sur des DiT pré-entraînés à grande échelle, une lignée qui inclut des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, généralement adaptés via prédiction visuelle du futur. NowWAM se positionne comme une alternative de co-entraînement plus économe, comparée sous conditions contrôlées à une base "future prédiction" sur LIBERO-Plus, un environnement de simulation standard pour la manipulation, et non un déploiement sur robot réel. Les auteurs montrent que l'adaptation au contrôle ne dépend pas d'un backbone spécialisé en vidéo ou en édition d'image, élargissant les bases génératives exploitables en robotique. Publié en preprint, l'article ne mentionne aucun déploiement industriel ni partenariat commercial; ses conclusions restent à confirmer au-delà du benchmark simulé.

À lire aussi

Génération itérative et compositionnelle de données pour le contrôle de robots
1arXiv cs.RO 

Génération itérative et compositionnelle de données pour le contrôle de robots

Une équipe de chercheurs propose, dans un article arXiv (2512.10891, cinquième révision), un modèle génératif appelé "semantic compositional diffusion transformer" pour produire des données d'entraînement en manipulation robotique. Le principe central consiste à décomposer chaque transition dans l'espace d'état en quatre composantes distinctes, propres au robot, aux objets manipulés, aux obstacles, et à l'objectif de la tâche, dont les interactions sont apprises via des mécanismes d'attention. Entraîné sur un sous-ensemble limité de combinaisons de tâches, le modèle génère en inférence zéro-shot des transitions synthétiques de haute qualité pour des configurations jamais vues : nouveaux objets, nouveaux environnements, nouvelles associations robot-tâche. Un processus d'auto-amélioration itératif complète l'approche : les données synthétiques générées sont validées par apprentissage par renforcement hors-ligne (offline RL), puis réintégrées dans les rounds d'entraînement suivants. Au terme de ce cycle, le système résout la quasi-totalité des tâches de test non vues lors de l'entraînement. L'enjeu industriel est direct : collecter des démonstrations robotiques réelles pour couvrir l'espace combinatoire de toutes les tâches possibles en environnement multi-objets, multi-robots, multi-sites est économiquement prohibitif. Ce travail démontre qu'une structure compositionnelle apprise permet de briser cette malédiction combinatoire, sans démonstrations exhaustives. La boucle génération-validation-réentraînement est particulièrement notable : elle réduit le risque classique de drift sim-to-real en filtrant les transitions synthétiques non viables avant qu'elles ne contaminent le pipeline de policy learning. Les résultats surpassent significativement les baselines monolithiques et les approches compositionnelles à règles fixes (hard-coded), ce qui suggère que la structure compositionnelle émergente est réellement capturée par les représentations apprises, et non artificiellement injectée. Ce travail s'inscrit dans une dynamique de recherche qui cherche à contourner le goulot d'étranglement des données en robotique, aux côtés d'approches comme Diffusion Policy (Chi et al., CMU) ou les Visual Language Action models (VLA) tels que Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). Là où ces derniers misent sur des fondations visuolinguistiques massives, cette contribution cible la généralisation compositionnelle avec des données d'entraînement réduites. La première soumission datant de décembre 2025 et le papier en étant à sa cinquième révision, les auteurs ont visiblement consolidé leurs expériences au fil des retours communautaires. Les prochaines étapes naturelles seraient une validation sur hardware réel et une extension aux chaînes de manipulation longue-horizon, domaine où l'absence de compositionnalité reste le principal point de rupture des approches actuelles.

RecherchePaper
1 source
PointAction : les points 3D comme représentation universelle des actions pour le contrôle robotique
2arXiv cs.RO 

PointAction : les points 3D comme représentation universelle des actions pour le contrôle robotique

Des chercheurs ont publié le 3 juin 2026 PointAction (arXiv:2506.03943), un cadre de contrôle robotique qui fait le pont entre les Video-Action Models (VAMs) et les commandes exécutables sur bras physique. Le constat de départ est précis : les modèles vidéo entraînés uniquement sur du RGB ne permettent pas de contraindre la géométrie de contact 3D ni les marges spatiales métriques nécessaires à la manipulation, rendant le grounding des actions ambigu. PointAction répond à ce problème en affinant un modèle de génération vidéo de fondation pour prédire simultanément des frames RGB futurs et des pointmaps 3D dynamiques, produisant une représentation 4D (3D + temps) cohérente de la scène. Ces cartes de points servent d'interface structurée et embodiment-agnostic entre prédiction vidéo et contrôle moteur, qu'un décodeur d'actions basé sur la diffusion traduit ensuite en commandes exécutables. Les résultats publiés indiquent une qualité de génération 4D état de l'art sur scènes robotiques, une supériorité sur les baselines existantes en simulation, et une généralisation à deux bras robotiques absents du préentraînement. L'enjeu pour les intégrateurs est concret. Les VAMs peinent depuis plusieurs années à franchir le fossé entre rollout vidéo convaincant et action physique fiable : le RGB seul ne transmet ni la profondeur métrique, ni l'orientation des surfaces de contact, ni les tolérances de précision requises. En intercalant une couche intermédiaire explicite, les pointmaps 3D dynamiques, PointAction décompose le problème et réduit structurellement l'ambiguïté d'ancrage. L'interface embodiment-agnostic réduit aussi le coût de supervision nécessaire pour adapter un modèle à une nouvelle plateforme, argument concret pour les intégrateurs multi-robots. La généralisation à des bras non vus en préentraînement contredit partiellement l'hypothèse dominante selon laquelle les architectures VLA (Vision-Language-Action) exigent des volumes massifs de données spécifiques par embodiment, bien qu'aucun chiffre de transfert à l'échelle industrielle ne soit publié. PointAction s'inscrit dans une vague de recherche exploitant les modèles de diffusion vidéo pour la robotique, dans le sillage de pi-0 de Physical Intelligence, de GR00T N2 de NVIDIA et d'OpenVLA. La représentation en points 3D fait écho à des travaux antérieurs comme Tracking Any Point (TAP) ou 3D-DiffuserActor, mais PointAction les intègre dans la boucle de génération plutôt qu'en post-traitement. Le papier reste à l'étape pré-print arXiv, sans validation indépendante ni déploiement industriel annoncé ; les prochaines étapes probables incluent une extension à des manipulateurs à plus haut degré de liberté et à des configurations mobiles, ainsi qu'une intégration avec des pipelines VLA existants.

RechercheOpinion
1 source
Le jeu de l'imitateur : évaluer la capacité d'imitation des robots au-delà de la prédiction d'action
3arXiv cs.RO 

Le jeu de l'imitateur : évaluer la capacité d'imitation des robots au-delà de la prédiction d'action

Un benchmark baptisé « The Imitator Game » évalue en quatre niveaux (L0 à L3) la capacité d'un robot à imiter l'intention d'une démonstration humaine, et non son simple mouvement, en écartant progressivement la scène du robot de celle de la démonstration. L'étude s'appuie sur IG-10K, le plus grand jeu de données humain-robot appairé et aligné par environnement à ce jour : plus de 20 000 épisodes couvrant 50 tâches et 6 domaines, en réel comme en simulation. Les auteurs publient aussi Imitator Arena, une plateforme ouverte d'évaluation humaine en aveugle par comparaison A/B. Sur neuf modèles vision-langage-action testés, les performances restent stables de L0 à L2 puis s'effondrent à L3 : aucun ne dépasse 13% de réussite en zero-shot sur des tâches inédites, malgré des gains nets après un fine-tuning sur seulement 10 démonstrations appariées. Le point de rupture identifié est la « substitution fonctionnelle » : atteindre le même objectif via un objet ou un outil différent de celui vu en démonstration, plus déterminante dans l'effondrement des scores que la simple variation visuelle du décor. Pour les intégrateurs et équipes robotique, le résultat tempère l'idée que les politiques vision-langage-action actuelles comprennent réellement une tâche : elles semblent surtout rejouer des trajectoires proches de ce qu'elles ont observé, sans transfert vers une affordance différente. Le plafond de 13% en zero-shot confirme l'écart persistant entre démonstrations soignées et généralisation réelle ; le protocole d'évaluation en aveugle d'Imitator Arena vise à limiter les biais de sélection des vidéos de démonstration, une critique récurrente adressée aux annonces du secteur. Ce travail s'inscrit dans la vague des modèles vision-langage-action qui apprennent des tâches robotiques à partir de vidéos humaines plutôt que de téléopération coûteuse, une piste suivie par plusieurs laboratoires de robotique généraliste. En décomposant l'évaluation en quatre niveaux plutôt qu'en un score global agrégé, les auteurs cherchent précisément à localiser où l'apprentissage par imitation cesse de fonctionner. Le site du projet et l'accès à Imitator Arena sont ouverts sur imitator-game.github.io, pour que la communauté y soumette et compare ses propres modèles. Ce gain rapide avec un minimum de données ouvre une piste concrète pour de futurs déploiements : combiner pré-entraînement à grande échelle sur données appariées et calibration légère sur site.

RecherchePaper
1 source
Échantillonnage génératif par blocs d'actions pour un contrôle adaptatif de la rigidité en collaboration homme-robot physique
4arXiv cs.RO 

Échantillonnage génératif par blocs d'actions pour un contrôle adaptatif de la rigidité en collaboration homme-robot physique

Une équipe de recherche a publié sur arXiv (2608.25284, août 2026) une méthode de contrôle adaptatif de raideur articulaire pour la collaboration physique homme-robot, basée sur l'échantillonnage génératif de séquences d'actions. À partir d'une image RGB et d'estimations de couple externe aux articulations, la politique générative tire plusieurs séquences d'actions futures ; leur variance pilote en continu la raideur et l'amortissement du robot, une forte dispersion le rendant plus compliant, une faible dispersion plus ferme. Sur une tâche réelle de transport collaboratif à quatre directions possibles, la méthode atteint un taux de réussite de 0,95, contre 0,83 pour une raideur fixe et 0,69 pour une politique déterministe, la variance grimpant précisément quand la direction voulue par l'humain reste ambiguë. Le résultat s'adresse aux intégrateurs de cobots, bras d'assistance et exosquelettes confrontés à l'arbitrage entre un robot trop rigide, qui impose sa trajectoire, et un robot trop compliant, sans assistance utile. Utiliser la dispersion d'un modèle génératif comme proxy d'incertitude sur l'intention humaine, sans reconnaissance de geste explicite, offre un signal de contrôle peu coûteux ; l'écart avec la politique déterministe (0,95 contre 0,69) confirme l'intérêt d'une modélisation stochastique de l'action, alors que le secteur cherche à rendre les politiques VLA exploitables au-delà du laboratoire. Le résultat reste toutefois obtenu sur une seule tâche à quatre directions, avec un volume d'essais limité typique d'un preprint, et sa transposition à des manipulations plus complexes n'est pas démontrée. Ce travail prolonge les recherches sur le contrôle d'impédance variable en interaction physique homme-robot, en détournant l'échantillonnage de séquences d'actions, technique popularisée par les politiques récentes de type action chunking (dans la veine des approches diffusion policy ou des modèles VLA comme Pi-0 ou GR00T N2), pour en extraire un signal d'incertitude plutôt qu'une action à exécuter. La comparaison se limite à deux références internes, raideur fixe et politique déterministe, sans confrontation à un système commercial : une contribution académique en preprint, non un produit ou un pilote industriel. Aucune entreprise ni calendrier de déploiement n'est mentionné dans l'article ; les suites évoquées porteraient sur des tâches de manipulation plus riches et une validation auprès de davantage de participants.

RecherchePaper
1 source