Aller au contenu principal
ISS Policy : une politique de diffusion évolutive avec supervision implicite de la scène
RecherchearXiv cs.RO 

ISS Policy : une politique de diffusion évolutive avec supervision implicite de la scène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient une troisième version de leur article sur arXiv, présentant ISS Policy (Implicit Scene Supervision Policy), une politique de diffusion visuomotrice 3D pour la manipulation robotique. Le système repose sur une architecture DiT (Diffusion Transformer) et prédit des séquences d'actions continues à partir d'observations en nuages de points plutôt que d'images 2D classiques. Sa particularité est d'ajouter, pendant l'entraînement, un prédicteur de mouvement du robot qui relie les actions générées et l'état du robot au mouvement de l'effecteur, puis combine ce mouvement prédit avec l'intention de la pince pour anticiper l'évolution future du nuage de points de la scène. Les auteurs ajoutent un routage de gradient asymétrique séparant la régression directe du mouvement de la supervision au niveau de la scène, ainsi qu'un objectif d'équilibrage des changements pour compenser les variations d'amplitude entre scènes. Ces mécanismes n'introduisent aucune annotation supplémentaire ni module auxiliaire au moment de l'inférence. L'équipe rapporte des performances état de l'art sur les tâches de manipulation à bras unique de la suite MetaWorld et sur les tâches de manipulation dextre de la suite Adroit, complétées par des expériences réelles sur un robot à deux bras. Code et vidéos sont annoncés pour une publication future, non encore disponibles.

Pour les chercheurs en apprentissage par imitation et les intégrateurs robotiques, ISS Policy cible une faiblesse connue des politiques de diffusion entraînées par simple imitation d'actions : elles ignorent souvent les conséquences géométriques réelles des gestes du robot sur la scène, ce qui nuit à la généralisation hors des démonstrations vues. En forçant le modèle à apprendre explicitement la transition entre action, mouvement et changement de scène pendant l'entraînement, sans alourdir l'inférence, les auteurs montrent qu'il est possible d'améliorer la robustesse avec seulement des démonstrations expertes, sans capteur ni annotation additionnelle. C'est un signal pertinent dans le débat sur l'écart entre démonstrations de laboratoire et déploiement réel, avec une piste purement technique plutôt que dépendante de plus de données. Il s'agit toutefois d'un preprint académique sans partenaire industriel ni site de déploiement annoncé, et les résultats « état de l'art » restent bornés aux benchmarks simulés MetaWorld et Adroit, complétés par des essais réels limités en configuration bi-bras, sans chiffres précis rendus publics dans le résumé.

Ce travail s'inscrit dans la lignée des « diffusion policies », famille d'approches apparue pour générer des trajectoires robotiques via des modèles de diffusion plutôt que des réseaux de régression classiques, désormais souvent associée aux backbones transformeurs de type DiT issus de la génération d'images et de vidéo. L'usage de nuages de points en entrée, plutôt que d'images RGB, rapproche ISS Policy des travaux en manipulation 3D centrés sur la compréhension géométrique de la scène, un axe distinct des architectures vision-langage-action qui dominent la communication grand public sur les robots humanoïdes. Aucun acteur commercial ni site industriel n'est cité : la contribution reste académique, en version 3 remplaçant une publication antérieure, avec promesse de code et de vidéos sans calendrier précis. Les suites attendues sont la publication effective du code, une extension possible à des tâches plus complexes ou d'autres plateformes, et une comparaison directe avec les approches VLA généralistes qui occupent aujourd'hui l'essentiel des annonces du secteur.

À lire aussi

SeedPolicy : passage à l'échelle par politique de diffusion auto-évolutive pour la manipulation robotique
1arXiv cs.RO 

SeedPolicy : passage à l'échelle par politique de diffusion auto-évolutive pour la manipulation robotique

Une équipe de chercheurs publie SeedPolicy, une nouvelle méthode d'apprentissage par imitation (IL) pour la manipulation robotique, dans un preprint arXiv (2503.05117). L'innovation centrale est SEGA (Self-Evolving Gated Attention), un module temporel qui maintient un état latent évolutif via de l'attention à porte (gated attention), permettant des mises à jour récurrentes qui accumulent le contexte à long terme tout en filtrant les informations temporelles non pertinentes. Intégré à la Diffusion Policy (DP), le modèle résultant, SeedPolicy, est évalué sur le benchmark RoboTwin 2.0 avec 50 tâches de manipulation distinctes. Les résultats, moyennés sur des backbones CNN et Transformer : +36,8 % d'amélioration relative par rapport à la DP standard en conditions propres, et +169 % en conditions aléatoires et perturbées. Face à RDT, un modèle vision-langage-action (VLA) de 1,2 milliard de paramètres, SeedPolicy obtient de meilleures performances en conditions propres avec un à deux ordres de grandeur de moins en taille de modèle. Le problème de la manipulation à long horizon, enchaîner des séquences d'actions sur des périodes étendues, constitue un goulot d'étranglement persistant en IL. La Diffusion Policy standard se dégrade lorsqu'on empile davantage d'horizons d'observation, perdant la capacité à maintenir le contexte temporel. SEGA règle ce problème sans le coût computationnel des grands VLAs. Le +169 % en conditions perturbées (contre +36,8 % en conditions propres) est le chiffre le plus significatif : il indique une meilleure généralisation sous perturbation, critique pour tout déploiement réel. L'argument d'efficacité paramétrique conteste directement l'hypothèse selon laquelle la mise à l'échelle serait nécessaire pour la manipulation complexe. La Diffusion Policy est issue des travaux de Columbia University (Chi et al., 2023) et constitue aujourd'hui une baseline de référence en robot learning. Le domaine s'est depuis bifurqué : un camp mise sur les modèles de fondation et les VLAs (RDT, Pi-0 de Physical Intelligence, OpenVLA, Octo), l'autre sur la modélisation temporelle efficiente à moindre coût. SeedPolicy s'inscrit résolument dans le second. À noter : l'ensemble des résultats est obtenu en simulation sur RoboTwin 2.0, sans démonstration de transfert sim-to-réel, ce qui reste l'épreuve déterminante pour les intégrateurs industriels. Le code est disponible sous dépôt anonyme, ce qui suggère un article en cours de révision par les pairs. Aucun déploiement industriel ni calendrier commercial n'est annoncé.

RechercheOpinion
1 source
DSSP : une politique d'état de diffusion avec encodage de l'historique complet
2arXiv cs.RO 

DSSP : une politique d'état de diffusion avec encodage de l'historique complet

Une équipe de recherche a publié en mai 2026 un préprint sur arXiv (2605.14598) présentant DSSP, Diffusion State Space Policy, une nouvelle architecture de politique robotique pour la manipulation. Le principe central : conditionner la génération d'actions non plus sur une fenêtre courte d'observations récentes, comme le font la majorité des politiques diffusion existantes, mais sur l'intégralité de l'historique d'observations depuis le début de la tâche. L'encodeur d'historique repose sur des State Space Models (SSMs), qui compriment le flux complet d'observations en une représentation contextuelle compacte. Un objectif d'entraînement auxiliaire dit "dynamics-aware" optimise cet encodeur pour préserver les informations pertinentes à l'évolution future de l'état. Ce contexte de haut niveau est ensuite fusionné avec les observations récentes dans un mécanisme de conditionnement hiérarchique, et le backbone diffusion lui-même est également instancié via un SSM pour limiter la mémoire GPU. Les expériences couvrent des benchmarks en simulation et des tâches de manipulation réelles. Le problème que DSSP cherche à résoudre est structurel dans les approches actuelles : les tâches longue durée génèrent des ambiguïtés que seule la mémoire étendue permet de lever. Une pince qui répète la même séquence de sous-tâches ou qui doit adapter son comportement en fonction d'un état vu dix secondes plus tôt ne peut pas le faire si le modèle n'a accès qu'à la dernière frame ou à une fenêtre de deux secondes. Les auteurs rapportent des performances état-de-l'art avec une taille de modèle significativement inférieure aux concurrents, ce qui est un argument industriel non trivial : des modèles plus légers facilitent le déploiement sur du compute embarqué et réduisent les coûts d'inférence. L'utilisation des SSMs plutôt que des Transformers pour l'encodage de séquences longues est cohérente avec des travaux récents (Mamba, Mamba-2) montrant que cette famille d'architectures offre une complexité linéaire en longueur de séquence, là où l'attention quadratique pénalise fortement les historiques longs. Ce travail s'inscrit dans un courant actif depuis la publication de Diffusion Policy (Chi et al., Columbia/MIT, 2023), qui a établi la diffusion comme paradigme dominant pour l'imitation learning en manipulation. Des acteurs comme Physical Intelligence avec pi-0, NVIDIA avec GR00T N2, ou Figure AI avec ses architectures propriétaires ont chacun proposé leurs variantes de politiques diffusion ou VLA (Vision-Language-Action). La question de la mémoire temporelle longue reste ouverte dans l'ensemble de ces systèmes. DSSP est à ce stade un résultat de recherche académique, pas un produit déployé : les expériences réelles décrites sont des validations en laboratoire, non des pilotes industriels. La prochaine étape naturelle serait une intégration dans des frameworks open-source comme Lerobot (HuggingFace) ou une collaboration avec des fabricants pour valider le passage à l'échelle sur des tâches d'assemblage à horizons multiples.

UEImpact indirect potentiel si DSSP est intégré dans Lerobot (HuggingFace, entreprise française basée à Paris), ce qui faciliterait l'adoption par les équipes européennes de recherche en manipulation robotique longue durée.

RechercheOpinion
1 source
Attention-DP3 : politique de diffusion 3D avec conditionnement attentionnel aligné sur la géométrie
3arXiv cs.RO 

Attention-DP3 : politique de diffusion 3D avec conditionnement attentionnel aligné sur la géométrie

Attention-DP3, présenté dans un article publié sur arXiv (2609.13318v1), conserve telle quelle l'architecture de diffusion de DP3 (3D Diffusion Policy), une référence pour l'apprentissage par imitation à partir de nuages de points, et lui ajoute un conditionnement attentionnel objet-centré. Le pipeline segmente d'abord les images RGB en vocabulaire ouvert, projette les masques obtenus en 3D via la géométrie de caméra calibrée pour produire des indices géométriques propres à l'objet visé, puis les injecte via un conditionnement dit "tri-champ" combinant trois cartes: un champ de ciblage pour localiser l'objet, un champ de saillance intra-cible pour isoler sa géométrie utile à la tâche, et un champ d'arrière-plan pour supprimer distracteurs et encombrement. La méthode est testée sur les bancs d'essai simulés Adroit, DexArt et MetaWorld ainsi que sur un bras robotique réel SO101, plateforme low-cost associée à l'écosystème open-source LeRobot. Elle dépasse systématiquement DP3 et atteint l'état de l'art sur l'ensemble des benchmarks, avec un écart grimpant jusqu'à 31% en scène fortement encombrée, là où DP3 voit ses performances chuter nettement dès que le nombre de distracteurs augmente. Le code est publié en accès libre sur GitHub (zhangzhongbo2213/Attention-DP3). Le travail s'attaque à une faiblesse connue des politiques de diffusion 3D: un nuage de points reste ambigu dès qu'un objet est partiellement occlus ou mêlé à des distracteurs visuellement proches, une situation courante en bin picking ou en kitting industriel, loin des scènes épurées des démonstrations académiques. Pour les équipes déjà construites autour de DP3, l'intérêt tient au fait que le gain de robustesse provient d'un module ajouté en amont, sans changer le backbone ni exiger de données d'entraînement supplémentaires, ce qui en ferait une mise à niveau relativement peu coûteuse. Le résultat nuance aussi le narratif dominant autour des modèles VLA en image 2D comme Pi-0 ou GR00T N2, en montrant qu'un ancrage géométrique explicite peut traiter une partie du problème de généralisation en environnement encombré, plutôt que la seule mise à l'échelle des données. La validation reste toutefois académique, limitée à trois simulateurs et un seul bras réel low-cost, sans déploiement industriel annoncé. DP3 s'est imposé ces dernières années comme une base de référence pour l'apprentissage de politiques visuomotrices à partir de nuages de points, en parallèle des modèles VLA fondés sur l'image RGB comme Pi-0, GR00T N2 ou Helix, qui concentrent l'essentiel de l'attention médiatique dans la course humanoïde. Attention-DP3 s'inscrit dans une lignée de travaux cherchant à combler l'écart entre la richesse sémantique de la perception 2D et la pauvreté contextuelle de la géométrie 3D brute, en s'appuyant sur la segmentation ouverte pour ancrer les priors géométriques. Aucun partenaire industriel ni pilote commercial n'est annoncé: les auteurs se limitent à publier le code sur GitHub, laissant aux équipes de recherche et aux intégrateurs le soin de reproduire les résultats et de les valider sur d'autres plateformes que le bras SO101 utilisé pour la démonstration réelle.

RecherchePaper
1 source
DADP : politique de diffusion adaptative au domaine
4arXiv cs.RO 

DADP : politique de diffusion adaptative au domaine

Des chercheurs ont publié le 19 juin 2026 la troisième version de DADP (Domain Adaptive Diffusion Policy), un framework de contrôle robotique conçu pour généraliser à des dynamiques physiques inconnues sans nécessiter de réentraînement. Le problème central adressé est la capacité d'une politique apprise en simulation ou dans un environnement donné à fonctionner dans un autre contexte aux propriétés mécaniques différentes, friction, masse, compliance des articulations, ce que l'on appelle l'adaptation zéro-shot. Les auteurs identifient un défaut structurel dans les approches existantes de domain representation learning : lorsqu'un modèle extrait sa représentation du domaine à partir d'un contexte temporel adjacent à l'étape courante, il mélange involontairement des informations statiques (les constantes du domaine physique) avec des propriétés dynamiques transitoires (la vitesse ou la posture instantanée). DADP répond par deux contributions techniques : d'abord le Lagged Context Dynamical Prediction, qui conditionne l'estimation d'état futur sur un contexte historique décalé dans le temps, augmenter ce délai force le modèle à filtrer les propriétés transitoires et à extraire uniquement les invariants du domaine, sans supervision explicite. Ensuite, les représentations de domaine ainsi disentangled sont injectées directement dans le processus génératif du diffusion model, en biaisant la distribution a priori et en reformulant la cible de diffusion. Les résultats sur des benchmarks de locomotion et de manipulation dépassent les méthodes antérieures sur ces axes combinés. L'intérêt pour les intégrateurs robotiques et les équipes R&D est double. Premièrement, DADP aborde directement le sim-to-real gap en proposant une séparation non supervisée entre ce qui appartient à la physique du robot (masse, friction) et ce qui relève de la trajectoire en cours, une distinction que les approches précédentes laissaient au réseau à résoudre implicitement, avec des résultats fragiles. Deuxièmement, l'injection de la représentation domaine dans le processus de diffusion plutôt qu'en simple conditionnement de politique représente un changement architectural notable : cela signifie que la politique génère des actions dont la distribution est intrinsèquement calibrée sur le domaine courant, et non pas simplement corrigée a posteriori. Pour les équipes travaillant sur des déploiements multi-sites ou sur des flottes hétérogènes de manipulateurs industriels, cela ouvre une voie pour réduire le coût de calibration par site. Il convient de nuancer : les benchmarks présentés restent des environnements simulés standardisés (MuJoCo-type), et aucune validation hardware sur un robot physique n'est revendiquée dans l'abstract, un gap classique entre publication académique et déploiement terrain. DADP s'inscrit dans un courant de recherche actif qui cherche à combiner les diffusion policies, popularisées par les travaux de Chi et al. (2023) sur le Diffusion Policy et désormais intégrées dans des systèmes comme pi-zéro de Physical Intelligence ou les pipelines GR00T de NVIDIA, avec des mécanismes d'adaptation contextuelle au domaine physique. Les approches concurrentes incluent les méthodes de domain randomization (entraînement sur une large distribution de dynamiques) et les architectures méta-RL comme PEARL ou MAML, qui supposent un accès à quelques épisodes d'adaptation. DADP se positionne en zéro-shot sans rollouts d'adaptation, ce qui est une contrainte opérationnelle réaliste pour des déploiements industriels où le temps de mise en service est limité. La présence d'un site de visualisation dédié (outsider86.github.io/DomainAdaptiveDiffusionPolicy) et l'itération en version 3 suggèrent une réponse active à la communauté ; une validation expérimentale sur hardware physique constituerait la prochaine étape logique pour ancrer ces résultats dans la réalité industrielle.

RecherchePaper
1 source