
ISS Policy : une politique de diffusion évolutive avec supervision implicite de la scène
Des chercheurs publient une troisième version de leur article sur arXiv, présentant ISS Policy (Implicit Scene Supervision Policy), une politique de diffusion visuomotrice 3D pour la manipulation robotique. Le système repose sur une architecture DiT (Diffusion Transformer) et prédit des séquences d'actions continues à partir d'observations en nuages de points plutôt que d'images 2D classiques. Sa particularité est d'ajouter, pendant l'entraînement, un prédicteur de mouvement du robot qui relie les actions générées et l'état du robot au mouvement de l'effecteur, puis combine ce mouvement prédit avec l'intention de la pince pour anticiper l'évolution future du nuage de points de la scène. Les auteurs ajoutent un routage de gradient asymétrique séparant la régression directe du mouvement de la supervision au niveau de la scène, ainsi qu'un objectif d'équilibrage des changements pour compenser les variations d'amplitude entre scènes. Ces mécanismes n'introduisent aucune annotation supplémentaire ni module auxiliaire au moment de l'inférence. L'équipe rapporte des performances état de l'art sur les tâches de manipulation à bras unique de la suite MetaWorld et sur les tâches de manipulation dextre de la suite Adroit, complétées par des expériences réelles sur un robot à deux bras. Code et vidéos sont annoncés pour une publication future, non encore disponibles.
Pour les chercheurs en apprentissage par imitation et les intégrateurs robotiques, ISS Policy cible une faiblesse connue des politiques de diffusion entraînées par simple imitation d'actions : elles ignorent souvent les conséquences géométriques réelles des gestes du robot sur la scène, ce qui nuit à la généralisation hors des démonstrations vues. En forçant le modèle à apprendre explicitement la transition entre action, mouvement et changement de scène pendant l'entraînement, sans alourdir l'inférence, les auteurs montrent qu'il est possible d'améliorer la robustesse avec seulement des démonstrations expertes, sans capteur ni annotation additionnelle. C'est un signal pertinent dans le débat sur l'écart entre démonstrations de laboratoire et déploiement réel, avec une piste purement technique plutôt que dépendante de plus de données. Il s'agit toutefois d'un preprint académique sans partenaire industriel ni site de déploiement annoncé, et les résultats « état de l'art » restent bornés aux benchmarks simulés MetaWorld et Adroit, complétés par des essais réels limités en configuration bi-bras, sans chiffres précis rendus publics dans le résumé.
Ce travail s'inscrit dans la lignée des « diffusion policies », famille d'approches apparue pour générer des trajectoires robotiques via des modèles de diffusion plutôt que des réseaux de régression classiques, désormais souvent associée aux backbones transformeurs de type DiT issus de la génération d'images et de vidéo. L'usage de nuages de points en entrée, plutôt que d'images RGB, rapproche ISS Policy des travaux en manipulation 3D centrés sur la compréhension géométrique de la scène, un axe distinct des architectures vision-langage-action qui dominent la communication grand public sur les robots humanoïdes. Aucun acteur commercial ni site industriel n'est cité : la contribution reste académique, en version 3 remplaçant une publication antérieure, avec promesse de code et de vidéos sans calendrier précis. Les suites attendues sont la publication effective du code, une extension possible à des tâches plus complexes ou d'autres plateformes, et une comparaison directe avec les approches VLA généralistes qui occupent aujourd'hui l'essentiel des annonces du secteur.
Dans nos dossiers




