ROMA : un système LLM pour la perception active multisensorielle centrée sur les objets en conditions réelles
Des chercheurs publient sur arXiv (2610.06955v1) ROMA, un système à base de grand modèle de langage (LLM) pour la perception active multi-sensorielle centrée sur l'objet, testé en conditions réelles. Il intègre la vision, l'audio, le tactile et la force dans une boucle raisonnement, interaction, retour sensoriel. Le modèle repère les preuves manquantes, puis choisit l'objet cible, l'interaction et la modalité à utiliser. Une interface physique exécute l'action et renvoie les mesures. Pour l'entraîner, l'équipe a construit ROMI-2K, un jeu de données d'interactions réelles couvrant près de 2 000 objets et 6 interactions atomiques, avec un retour sensoriel synchronisé. L'entraînement se fait en deux étapes : alignement des modalités, puis apprentissage de trois compétences. Ces compétences sont évaluer si les preuves suffisent, sélectionner les interactions les plus informatives et raisonner sur le retour multi-sensoriel. Les auteurs définissent aussi des « chaînes de perception », où chaque preuve acquise guide l'interaction suivante. Ils proposent ROMA Bench, qui évalue trois cas : un seul attribut, plusieurs attributs sur un long horizon, et une perception guidée par l'intention. L'abstract ne donne ni chiffres de performance, ni noms des modèles comparés, ni détail sur le matériel robotique.
L'intérêt tient au déplacement du problème. La plupart des systèmes multi-sensoriels fusionnent des entrées déjà disponibles. ROMA traite la perception comme une décision : quelle information manque, comment l'obtenir, quand s'arrêter. C'est utile pour les tâches où la vision seule ne suffit pas, comme estimer la masse, la rigidité, le contenu d'un contenant ou la matière d'une surface. Le travail suggère aussi qu'un LLM peut servir de planificateur d'interactions informatives, pas seulement d'exécutant de commandes. Reste une réserve : le papier ne précise pas ici le taux de réussite, le temps par chaîne de perception ni la robustesse hors des objets du jeu de données. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel annoncé.
Ce travail s'inscrit dans la montée des modèles vision-langage-action (VLA) et des modèles de fondation pour la manipulation. Ceux-ci restent surtout dominés par la vision et le langage, et le tactile, la force et l'audio y sont encore peu exploités. ROMI-2K et ROMA Bench pourraient servir de références communes, à condition d'être publiés et reproductibles. Aucun pilote ni calendrier n'est annoncé. La prochaine étape logique est de brancher cette perception sur des agents incarnés capables d'agir sur les objets identifiés, ce que les auteurs présentent comme une « base perceptuelle ». Un intégrateur devra surtout vérifier si ces gains tiennent sur des pièces industrielles, en cadence réelle, avec des capteurs tactiles et de force du commerce.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




