
Évaluation comparative de modèles génératifs de trajectoires pour le contrôle par inférence active
Des chercheurs publient sur arXiv (2610.05692, deuxième version) GenAIF, un cadre de commande par inférence active générative. Un seul modèle génératif de trajectoires, entraîné sur des démonstrations et des interventions d'action mesurées, fournit deux éléments. Le premier est une politique conditionnée par un objectif. Le second est une correspondance probabiliste entre états et observations. Les auteurs en tirent trois exigences pour le modèle: des propositions d'actions utiles, une prédiction fidèle sous actions imposées, et une évidence d'observation probabiliste pour la mise à jour des croyances et le calcul du gain d'information attendu. Ils comparent quatre familles (diffusion, Transformers autorégressifs, autoencodeurs variationnels conditionnels ou CVAE, et flow matching) sur une tâche de manipulation MuJoCo avec plusieurs conditions physiques. La diffusion donne le meilleur contrôle sur toutes les dynamiques testées. Le CVAE offre une prédiction à court horizon comparable pour une inférence nettement plus rapide. Après un changement d'inclinaison non annoncé, la diffusion préentraînée met à jour sa croyance le plus vite parmi les modèles d'origine. Un fine-tuning sur des démonstrations de récupération accélère encore l'identification et maintient un suivi précis.
Pour les équipes qui construisent des politiques apprises, le résultat chiffre un arbitrage concret entre qualité de contrôle et coût d'inférence. La diffusion est la plus performante mais la plus lourde, le CVAE est un compromis crédible quand la latence compte, et la réutilisation de trajectoires réduit le calcul. L'intérêt tient aussi à la capacité d'adaptation. Un modèle capable de dire quand ses observations contredisent ses prédictions peut détecter un changement physique, comme une charge ou une pente modifiée, sans modèle dynamique explicite. Les limites sont nettes: tout reste en simulation, sur une seule tâche, et le résumé ne donne aucun chiffre de taux de réussite ni de temps de calcul. L'écart simulation-réel n'est donc pas abordé, et il s'agit d'un travail académique, pas d'un produit.
Le travail se situe au croisement de deux courants. Les politiques génératives dominent la manipulation apprise: Diffusion Policy, ACT (basé sur un CVAE) et Pi-0 (flow matching) en sont les références. L'inférence active, issue des neurosciences computationnelles, peine à s'imposer en robotique appliquée faute de modèles de dynamique exploitables. GenAIF propose de combler ce manque avec des modèles appris sur démonstrations. La suite logique passe par une validation sur robots physiques, davantage de tâches et des comparaisons directes avec les politiques de type VLA déjà déployées.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




