Aller au contenu principal
FUSE : ancrage actif de l'affordance fonctionnelle par acquisition adaptative de preuves sémantiques et géométriques
RecherchearXiv cs.RO 

FUSE : ancrage actif de l'affordance fonctionnelle par acquisition adaptative de preuves sémantiques et géométriques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint publié sur arXiv (2608.12683v1) introduit une nouvelle tâche baptisée « Active Functional Affordance Grounding » : un agent doit explorer activement une scène pour localiser un objet répondant à une fonction demandée, par exemple un objet pour verser un liquide, plutôt qu'à une simple étiquette d'identité. Les auteurs proposent FUSE, un framework d'acquisition de preuves sémantiques et géométriques combinant une exploration pilotée par une mesure explicite d'incertitude et un planificateur amorti appris qui choisit les points de vue les plus informatifs quand les indices fonctionnels sont occultés ou incomplets. Ils publient aussi un benchmark bâti sur le simulateur Habitat pour évaluer cette tâche. Selon les expériences rapportées, FUSE atteint la meilleure performance de localisation non-oracle observée parmi les méthodes comparées, réduit le calcul de 1,33 fois par rapport à une exploration entièrement explicite, et reste efficace avec plusieurs sources de connaissances sur les affordances.

Ce travail cible un angle mort des systèmes de perception embarquée actuels : la plupart des méthodes de affordance grounding opèrent depuis un point de vue fixe et échouent dès qu'un indice fonctionnel est masqué ou invisible sous un seul angle. Pour des intégrateurs qui cherchent à faire raisonner un robot sur ce à quoi sert un objet plutôt que sur ce qu'il est, ce mécanisme d'exploration active pilotée par l'incertitude constitue un prérequis en amont de toute manipulation. Le résultat rappelle aussi qu'un grand modèle vision-langage ne suffit pas à lui seul si l'agent ne sait pas décider où regarder ensuite pour lever une ambiguïté fonctionnelle ; le gain de calcul de 1,33x reste toutefois mesuré uniquement en simulation, sans validation rapportée sur robot physique.

Le papier combine deux lignées de recherche jusque-là largement séparées, l'affordance grounding sémantique qui associe langage et régions de scène, et la perception active centrée sur le choix du prochain meilleur point de vue. Le résumé ne précise ni l'affiliation des auteurs ni de calendrier de suite, et l'évaluation se limite pour l'instant au benchmark Habitat introduit par les auteurs eux-mêmes, sans comparaison sur un jeu de données tiers ni déploiement sur une plateforme réelle. La suite logique, non annoncée dans ce résumé, serait un transfert vers un robot physique et une comparaison face à des méthodes d'exploration active plus générales.

Dans nos dossiers

À lire aussi

Découplage de la sémantique et de l'ancrage géométrique : prompts visuels spatiaux pour l'apprentissage par imitation guidé par le langage
1arXiv cs.RO 

Découplage de la sémantique et de l'ancrage géométrique : prompts visuels spatiaux pour l'apprentissage par imitation guidé par le langage

Une équipe de chercheurs présente SVP-IL dans un préprint publié sur arXiv le 25 juin 2026 (arXiv:2606.25360), une architecture destinée à l'apprentissage par imitation conditionné par le langage naturel en robotique de manipulation. Le constat de départ est précis : les modèles Vision-Language-Action (VLA) de bout en bout actuels couplent dans un même réseau le raisonnement sémantique et le contrôle spatial, ce qui génère un goulot d'étranglement d'alignement quand les données d'entraînement sont rares. SVP-IL découple ces deux fonctions : un modèle fondation vision-langage analyse les instructions textuelles pour produire des masques géométriques zero-shot, traduits en "Spatial Visual Prompts" (SVP), qui sont ensuite injectés dans un générateur d'actions continu via une fusion légère au niveau des features. Résultats sur des tâches à ambiguïté linguistique élevée : avec seulement 50 à 100 démonstrations, le taux de succès moyen passe de 24,0 % à 39,5 %, et atteint 67,8 % sur les benchmarks standards. Des expériences en environnement physique non structuré ont validé la robustesse de l'approche hors laboratoire. L'enjeu industriel de ce résultat est le coût de collecte de données. Les VLA monolithiques comme RT-2, OpenVLA ou π0 (Physical Intelligence) exigent des milliers à des dizaines de milliers de démonstrations pour généraliser à de nouvelles tâches ou de nouveaux environnements, ce qui rend leur déploiement chez les intégrateurs robotiques coûteux et lent. SVP-IL ramène ce seuil à 50-100 démos, soit une réduction d'un ou deux ordres de grandeur, tout en surpassant l'état de l'art sur les tâches à désambiguïsation difficile. Pour un COO industriel ou un intégrateur, cela signifie un temps de mise en service radicalement plus court pour chaque nouvelle cellule de travail. L'approche valide aussi l'hypothèse que le couplage sémantique-spatial n'est pas une nécessité architecturale mais un choix de conception contournable. Les architectures VLA ont émergé à partir de 2022-2023 avec les travaux de Google DeepMind (RT-2), avant d'être popularisées par des modèles open-source et des acteurs comme Physical Intelligence avec π0 ou l'initiative GR00T N2 de NVIDIA. La tendance dominante reste le paradigme monolithique de bout en bout, considéré comme plus simple à scaler. SVP-IL conteste cette hypothèse en montrant qu'un découplage explicite donne de meilleurs résultats en régime de faibles données, sans compromis sur la généralisation. Le préprint ne mentionne pas de partenaire industriel ni de calendrier de déploiement, ce qui en fait pour l'instant une contribution académique ouverte, sans produit shipé associé. Les prochaines étapes naturelles seraient une validation sur des robots commerciaux multi-DOF (bras industriels 6-7 axes, manipulateurs mobiles) et une intégration avec des pipelines de collecte de données synthétiques pour réduire encore davantage le besoin en démonstrations humaines.

RechercheOpinion
1 source
Adaptation des politiques génériques de robots par apprentissage par renforcement sémantique
2arXiv cs.RO 

Adaptation des politiques génériques de robots par apprentissage par renforcement sémantique

Les auteurs de ce nouvel article arXiv (2606.31958v1) présentent SARL, pour Semantic Action Reinforcement Learning, une méthode d'apprentissage par renforcement pour adapter des politiques robotiques généralistes déjà pré-entraînées, c'est-à-dire des modèles vision-langage-action (VLA) capables d'un large répertoire de comportements. Au lieu d'optimiser directement l'espace des actions du robot, comme le font les approches RL classiques, SARL agit sur l'espace des prompts en langage naturel envoyés au modèle. Concrètement, l'algorithme apprend en ligne, par interaction avec l'environnement, à moduler les instructions textuelles données à la politique pour faire émerger et combiner des compétences déjà présentes dans son répertoire, plutôt que d'apprendre de nouveaux comportements depuis zéro. Les auteurs rapportent des validations à la fois en conditions réelles et sur des bancs d'essai simulés, avec des performances supérieures aux méthodes existantes d'amélioration de comportement en déploiement. L'intérêt de cette approche tient au problème qu'elle cherche à résoudre : les méthodes RL usuelles appliquées à un modèle généraliste supposent que sa distribution d'actions de départ est déjà proche d'une politique performante, une hypothèse qui s'effondre dès que la tâche est longue, complexe ou sort de la distribution d'entraînement initiale. En déplaçant l'optimisation vers l'espace sémantique des prompts, SARL rend l'exploration plus structurée et l'apprentissage en ligne beaucoup plus efficace en données, un enjeu central pour l'industrie robotique où le fine-tuning par interaction réelle reste coûteux et lent. Si les résultats se confirment à plus grande échelle, cela ouvrirait la voie à une adaptation rapide de robots généralistes à des tâches spécifiques d'un site industriel sans réentraînement lourd. Ce travail s'inscrit dans la lignée des politiques robotiques généralistes de type VLA, entraînées sur de larges corpus de démonstrations, dont l'adaptation post-déploiement est devenue un axe de recherche actif face aux limites du simple zéro-shot. Il rejoint d'autres tentatives d'affinage par renforcement de ces modèles, en proposant une alternative à l'optimisation directe des actions. Les auteurs annoncent vouloir approfondir les validations sur des tâches réelles à horizon plus long, sans toutefois préciser de calendrier de déploiement industriel.

RechercheActu
1 source
CompassAD : localisation d'affordance 3D guidée par l'intention parmi des objets fonctionnellement concurrents
3arXiv cs.RO 

CompassAD : localisation d'affordance 3D guidée par l'intention parmi des objets fonctionnellement concurrents

Des chercheurs proposent CompassAD, un benchmark et une architecture (CompassNet) pour adresser un angle mort des systèmes robotiques actuels : choisir le bon objet parmi plusieurs qui partagent la même affordance. Le cas prototype est simple : face à l'instruction "coupe le gâteau", un robot doit identifier le couteau plutôt que des ciseaux posés à côté, bien que les deux permettent de couper. Le benchmark comprend 30 paires d'objets confusables, 16 types d'affordances, 6 422 compositions de scènes et plus de 88 000 paires requête-réponse. CompassNet repose sur deux modules : l'Instance-bounded Cross Injection (ICI), qui confine l'alignement langage-géométrie aux limites de chaque instance d'objet pour éviter toute fuite sémantique entre objets voisins, et le Bi-level Contrastive Refinement (BCR), qui renforce la discrimination entre surfaces cibles et confusables à deux niveaux de granularité. Le système produit un masque d'affordance point-par-point sur le bon objet dans un nuage de points multi-objets, conditionné par une instruction en langage naturel implicite. Une validation sur bras manipulateur réel est présentée comme preuve de transfert physique. L'intérêt est que la quasi-totalité des méthodes d'affordance 3D existantes évaluent des objets isolés avec le nom de catégorie fourni explicitement dans la requête. CompassAD impose une contrainte plus proche du déploiement réel : une intention formulée en langage naturel, sans étiquette d'objet prédéfinie. Pour un intégrateur ou un décideur industriel, cela vise des systèmes capables de raisonner sur le contexte de tâche sans pipeline de labellisation rigide. La nuance s'impose cependant : 30 paires d'objets et un environnement de laboratoire constituent une base étroite. La robustesse en scènes industrielles denses, avec occlusions et objets multiples non contrôlés, reste à démontrer. L'affordance grounding en robotique s'est structuré autour de travaux comme Where2Act (2021) ou LASO, qui opèrent sur objets isolés avec requêtes explicites. Les architectures vision-langage-action (VLA) des grands labos comme DeepMind, Meta ou Stanford intègrent progressivement la résolution d'ambiguïtés contextuelles, mais sans benchmark dédié aux scènes multi-objets confusables. CompassAD comble en partie ce vide méthodologique. La publication, déposée sur arXiv (2604.02060v2) en version révisée, n'implique pas d'acteur industriel ou FR/EU visible. Les prochaines étapes logiques seraient une extension à des scènes plus denses et une évaluation sur plateformes mobiles manipulatrices, au-delà du bras fixe utilisé dans les expériences publiées.

RecherchePaper
1 source
Ancrage des parties, pas connaissance de l'action : le goulot d'étranglement des VLM en prédiction d'affordance
4arXiv cs.RO 

Ancrage des parties, pas connaissance de l'action : le goulot d'étranglement des VLM en prédiction d'affordance

Une étude arXiv (2609.13225, septembre 2026) sépare deux étapes que les benchmarks d'affordance robotique confondent : localiser la partie d'un objet à actionner, et savoir quelle action lui appliquer. Sur 19 objets articulés, huit modèles vision-langage issus de trois développeurs devaient indiquer le mouvement qu'un robot devait exécuter. En consigne ouverte, l'action « pousser », pourtant correcte pour 8 des 19 objets, n'a été produite qu'une fois sur 64 cas où elle était juste : les modèles décrivaient souvent une autre partie de l'objet, par exemple comment saisir une caméra plutôt que presser son bouton. En nommant explicitement la partie cible, la précision grimpe de 0,32 à 0,63 point selon les modèles, passant de 0,158-0,474 à 0,684-0,947, et le rappel de « pousser » bondit de 0-1/8 à 7-8/8. Ce résultat déplace le diagnostic habituel sur les VLM appliqués à la manipulation : l'échec ne viendrait pas d'une mauvaise connaissance de la mécanique des objets mais d'un déficit de repérage visuel, un constat stable sur les trois familles testées et qui ne s'atténue pas avec des modèles plus puissants. Sous consigne ouverte, aucun des huit modèles ne bat une réponse constante ignorant totalement l'image ; une fois la partie nommée, les huit la battent tous. Pour les intégrateurs qui misent sur des VLM génériques pour piloter la préhension d'objets articulés comme des boutons, poignées ou tiroirs, la conclusion est concrète : améliorer le raisonnement ne suffira pas, mieux vaut renforcer la segmentation des parties en amont. Sur des photos réelles, seuls trois modèles sur huit localisent mieux les points de préhension qu'une base constante, et aucun n'y parvient sur des objets en rendu 3D. Les auteurs nuancent eux-mêmes leur résultat : nommer la partie fournit seulement la variable de repérage manquante et ne démontre pas une compréhension générale de la mécanique des objets. L'étude documente aussi, avec transparence, deux erreurs de mesure commises dans son propre protocole, un seuil laissant une réponse constante atteindre 0,929 et une règle d'étiquetage erronée sur 4 des 19 objets, repérées seulement en comparant systématiquement les résultats à des références triviales. Ce travail porte sur des VLM généralistes utilisés en amont de la perception, et non sur des systèmes VLA comme Pi-0, GR00T N2 ou Helix, mais ses conclusions questionnent directement les architectures qui s'appuient sur ces modèles pour générer des affordances sans module de segmentation dédié.

RecherchePaper
1 source