IA de bout en bout par diffusion visuo-force avec apprentissage structurel lent-rapide : ImplicitRDP
Des chercheurs ont publié une nouvelle version d'ImplicitRDP, une politique de diffusion visuo-force de bout en bout destinée à la manipulation robotique en contact riche, sur arXiv (article remplacé, version 2, décembre 2025). Le système fusionne dans un seul réseau la planification visuelle et le contrôle réactif par retour de force, deux modalités dont les fréquences diffèrent fortement : la vision offre un contexte spatial riche mais mis à jour lentement, tandis que les capteurs de force captent la dynamique de contact à haute fréquence. Pour concilier ces deux flux, les auteurs introduisent le "Structural Slow-Fast Learning", un mécanisme d'attention causale qui traite simultanément des tokens visuels et des tokens de force asynchrones, permettant au robot d'exécuter un contrôle de force rapide au rythme de l'action tout en conservant la cohérence temporelle des blocs d'actions générés par diffusion. Un second apport, la "Virtual-target-based Representation Regularization", vise à corriger un défaut classique des modèles bout en bout appelé "modality collapse", où le réseau finit par ignorer une des deux modalités lors de l'apprentissage des poids ; la méthode projette le retour de force dans le même espace que l'action, ce qui fournit un signal d'apprentissage ancré dans la physique plutôt qu'une simple prédiction brute de force.
Cette avancée s'attaque à un problème central pour l'industrie de la manipulation robotique fine : la difficulté de faire coopérer vision et toucher dans un même modèle sans que l'un écrase l'autre à l'entraînement. Pour les intégrateurs travaillant sur des tâches d'assemblage, d'insertion ou de préhension délicate, où le simple retour visuel ne suffit pas à détecter un contact ou un glissement, une politique unifiée capable de réagir à l'échelle de la force tout en gardant une planification visuelle cohérente représente un gain direct en robustesse, sans複exifier l'architecture avec des modules hiérarchiques séparés. Les auteurs affirment que leur approche surpasse à la fois les baselines "vision seule" et les architectures hiérarchiques classiques sur des tâches de manipulation en contact riche, avec un pipeline d'entraînement simplifié, ce qui, si confirmé au-delà des benchmarks internes, appuierait l'idée que les modèles de type VLA (vision-language-action) peuvent intégrer nativement des modalités hétérogènes sans passer par un empilement de contrôleurs spécialisés.
Le travail s'inscrit dans la lignée des politiques de diffusion pour la manipulation robotique, une famille de méthodes qui a gagné en popularité ces dernières années comme alternative aux politiques par apprentissage par renforcement classique, en modélisant directement des séquences d'actions à partir d'observations multimodales. Le défi de la fusion vision-force n'est pas nouveau et plusieurs équipes de recherche en robotique explorent des architectures hiérarchiques séparant planification lente et contrôle rapide ; ImplicitRDP se positionne explicitement contre cette approche en misant sur un réseau unique de bout en bout. Le code et les vidéos de démonstration sont mis à disposition par les auteurs sur un site dédié, ce qui permettra une évaluation indépendante des résultats revendiqués. À ce stade, il s'agit d'un travail de recherche académique avec validation expérimentale interne, et non d'un système déployé industriellement.
Dans nos dossiers



