FloAff-Kitchen : relier navigation et manipulation par apprentissage canonique et progressif de l'affordance du sol
Des chercheurs du HERO Lab (Central South University, Chine) ont publié fin juillet 2026 sur arXiv "FloAff-Kitchen", un système qui apprend aux robots mobiles à choisir où poser leur base au sol non pas seulement pour atteindre une cible de navigation, mais pour maximiser la réussite d'une tâche de manipulation qui suit. Le cœur technique repose sur deux briques : une représentation canonique de l'affordance au sol (CFAR), qui isole la géométrie d'interaction utile en supprimant les variations de position et d'orientation des objets sans rapport avec le placement du robot, et un apprentissage progressif (PFAL), qui transfère des priors appris sur une tâche de manipulation de référence vers un éventail de compétences hétérogènes en aval. Pour évaluer l'approche, l'équipe a construit le premier benchmark multi-scènes et multi-points de vue dédié à cette problématique, FloAff-Kitchen, couvrant différentes compétences de manipulation, agencements de pièces, styles de mobilier et angles de caméra. Sur trois configurations de test, la méthode dépasse systématiquement les approches de référence, et des études d'ablation confirment l'apport de chaque composant proposé.
La contribution cible un angle mort classique de la manipulation mobile : la plupart des systèmes de navigation évaluent uniquement si une position est atteignable, sans tenir compte de si elle permet réellement de réussir la préhension ou la manipulation qui suit. Distinguer une perception conditionnée par la navigation d'une perception conditionnée par la tâche est précisément ce qui bloque souvent le passage de la démonstration en environnement contrôlé au déploiement en cuisine ou en environnement domestique réel, où l'orientation des objets et l'encombrement varient. Pour les intégrateurs travaillant sur des robots mobiles manipulateurs ou des humanoïdes destinés à des tâches ménagères ou de service, ce travail illustre une tendance de fond de la recherche actuelle : combler l'écart entre modules de navigation et de manipulation plutôt que les traiter comme deux problèmes séparés, une des limites régulièrement citées pour expliquer l'écart entre vidéos de démonstration et fiabilité en conditions réelles.
Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage d'affordances spatiales pour la robotique, un domaine qui s'est étendu des affordances de préhension d'objets aux affordances de placement du robot lui-même, en écho aux efforts de modèles VLA comme Pi-0 ou GR00T N2 qui cherchent à unifier perception et action dans un même modèle. Contrairement aux approches génériques de navigation qui ignorent l'objectif de manipulation final, FloAff-Kitchen propose un cadre pensé spécifiquement pour l'environnement cuisine, un cas d'usage central pour les startups de robots domestiques. L'équipe met à disposition le benchmark et la page du projet publiquement, ce qui devrait permettre des comparaisons directes avec de futures méthodes sur ce sous-problème encore peu standardisé de la manipulation mobile.
Dans nos dossiers




