
ObstaDiff : apprentissage généralisable de politiques de diffusion via des représentations conscientes des obstacles
ObstaDiff est une politique de diffusion pour la manipulation robotique conçue pour les scènes encombrées d'obstacles non structurés, point faible connu des approches d'imitation learning classiques, qui supposent généralement des arrière-plans dégagés. Le système s'appuie sur un encodeur visuel léger, dit obstacle-aware, qui décompose la scène en trois éléments, la cible, les obstacles et l'arrière-plan, avant de transmettre cette représentation structurée à une politique d'alignement générant la trajectoire de l'effecteur terminal jusqu'à une pose intermédiaire centrée sur la cible, en évitant les obstacles environnants. Testé sur robot réel en serre agricole, à raison de 61 essais par méthode comparée, soit 366 exécutions au total, ObstaDiff atteint un taux de réussite moyen de 75,41% et un taux de collision de 8,20%, des résultats supérieurs aux politiques d'imitation learning de référence évaluées dans les mêmes conditions. Le travail est publié en prépublication sur arXiv sous la référence 2609.10918v1.
Ce résultat s'attaque à l'un des écarts les plus documentés du secteur, celui qui sépare les démonstrations en laboratoire sur fond neutre du déploiement réel où les obstacles imprévisibles sont la norme. Pour les intégrateurs visant l'automatisation de tâches de manipulation en agriculture, en entrepôt ou en industrie légère, la capacité d'une politique à raisonner explicitement sur les obstacles, plutôt qu'à les ignorer, conditionne directement la fiabilité et la viabilité économique d'un déploiement. Un taux de collision de 8,20% reste loin de zéro et ne prouve pas une robustesse totale, mais la comparaison favorable aux baselines suggère qu'une représentation structurée cible-obstacle-arrière-plan est une piste concrète pour réduire l'écart entre démonstration et réalité, plutôt qu'une simple optimisation marginale des politiques de diffusion existantes.
ObstaDiff s'inscrit dans la lignée des politiques de diffusion appliquées à la manipulation robotique, une famille de méthodes étudiée pour générer des trajectoires continues à partir de démonstrations mais qui bute généralement sur la généralisation à des scènes visuellement différentes de l'entraînement. Il s'agit ici d'un travail de recherche en prépublication, non d'une annonce produit ni d'un déploiement commercial, évalué sur un nombre d'essais réels modeste mais transparent, sans partenaire industriel ni calendrier de commercialisation mentionné. Le choix d'une serre agricole comme terrain d'essai, où cultures et structures encombrent en permanence l'espace de travail, illustre un cas d'obstruction difficile à simuler ; la suite logique passe par l'extension à d'autres tâches et environnements, ainsi qu'une comparaison plus large face aux politiques vision-langage-action qui dominent aujourd'hui les débats sur la généralisation en robotique.
Dans nos dossiers




