HEARTH : un jeu de données RGB-thermique-3D centré sur l'objet pour la manipulation robotique sensible à la température
Le dataset HEARTH, présenté dans un article publié sur arXiv (2609.23418), regroupe des captures RGB, thermiques et 3D de 90 objets physiques répartis en 18 catégories du quotidien, pour un total de 145 états d'objets enregistrés. Le pipeline associé projette les températures de surface apparentes, mesurées par caméra thermique, directement sur des maillages 3D reconstruits, grâce à une calibration caméra et un transfert de pose. Chaque objet du dataset est ainsi livré avec ses mesures de température brutes, les paramètres de la caméra, un maillage texturé en RGB et une texture thermique exploitable en simulation. Les auteurs ont ensuite construit trois tâches de manipulation dérivées du benchmark LIBERO et collecté 1200 démonstrations pour affiner un modèle vision-langage-action (VLA) préentraîné, π_0.5. Résultat de l'étude d'ablation : le taux de réussite sur des tâches de sélection d'objets dépendant de la température passe de 35,0% avec une observation RGB seule à 75,0% lorsque le canal thermique est ajouté.
Ce résultat met en évidence une limite concrète des modèles VLA actuels, entraînés quasi exclusivement sur des images visibles : ils échouent à raisonner sur des propriétés physiques invisibles à l'œil, comme la chaleur d'une tasse ou d'une plaque de cuisson, alors même que ce type de discrimination est critique en environnement domestique ou industriel pour la sécurité et la manipulation fine. Pour les intégrateurs robotiques, l'enseignement principal n'est pas architectural mais lié aux données : ajouter un canal thermique low-cost à un pipeline d'apprentissage existant peut plus que doubler le taux de succès sans modifier le modèle lui-même, ce qui relance la question des modalités manquantes dans les VLA génériques déployés à grande échelle.
HEARTH comble un vide identifié par les auteurs : l'absence de datasets robotiques associant température mesurée, apparence et géométrie d'objets, alors que les benchmarks de manipulation comme LIBERO servent de référence commune au secteur. Le choix de π_0.5 comme base, une évolution du modèle généraliste pi-0 développé par Physical Intelligence, positionne ce travail dans la lignée des VLA foundation models concurrents des approches type GR00T N2 (NVIDIA) ou Helix (Figure), qui reposent aujourd'hui sur des entrées essentiellement visuelles. L'article ne mentionne pas d'extension prévue au-delà des trois tâches testées, mais ouvre la voie à l'intégration systématique de capteurs thermiques dans les pipelines d'entraînement VLA.




