NovaPlan : manipulation à long horizon sans apprentissage préalable par planification vidéo-langage en boucle fermée
NovaPlan est un cadre de planification hiérarchique pour la manipulation robotique longue durée, décrit dans un preprint arXiv (2602.20119, version 2). Il fonctionne en « zero-shot », c'est-à-dire sans démonstration ni entraînement propre à chaque tâche. Au niveau supérieur, un modèle vision-langage (VLM) décompose la tâche en sous-étapes. Il génère plusieurs scénarios vidéo candidats pour chacune, puis écarte ceux dont la dynamique est physiquement incohérente. Pour convertir ces futurs imaginés en actions, le système choisit de façon adaptative entre deux représentations géométriques : le flux centré sur l'objet (object-centric flow) et le flux de la main humaine (hand flow). Enfin, une boucle fermée surveille l'exécution, vérifie les résultats et, en cas d'échec, synthétise des corrections locales sans préhension, comme pousser ou « poker » un objet du bout du doigt. Les auteurs affirment que NovaPlan surpasse nettement les systèmes zero-shot antérieurs sur des tâches multi-étapes variées, avec des assemblages complexes et des récupérations d'erreur dextres. Le résumé ne donne ni chiffres de taux de réussite, ni nombre d'essais, ni robot utilisé. Ces éléments figurent sur le site du projet et dans le texte complet.
L'intérêt tient à la manière dont le travail s'attaque à un point faible connu des approches « VLM plus génération vidéo » : les hallucinations physiques du générateur vidéo et les incohérences géométriques du VLM s'accumulent sur des horizons longs, ce qui bloque l'exécution réelle. NovaPlan répond par une logique de proposition, vérification et réparation, plutôt que par un modèle plus grand ou davantage de données. Si les résultats tiennent hors du laboratoire, cela suggère qu'on peut obtenir de la fiabilité sur des séquences longues sans collecter de démonstrations par tâche. Ce coût de collecte reste le principal frein économique du déploiement pour les intégrateurs. L'usage du flux de la main humaine comme représentation intermédiaire est aussi notable : il permet d'exploiter les vidéos générées de mains pour guider des manipulations fines. Il faut toutefois rester prudent. Il s'agit d'un preprint académique sans déploiement industriel, les temps de cycle et la robustesse sur de longues séries ne sont pas documentés dans le résumé, et les comparaisons dépendent des baselines retenues par les auteurs.
Ce travail s'inscrit dans la lignée de la planification par vidéo générative (les approches « vidéo language planning ») et des modèles vision-langage-action (VLA) comme Pi-0 ou GR00T, qui apprennent plutôt la politique de bout en bout à partir de grandes quantités de démonstrations. NovaPlan fait le pari inverse : réutiliser des modèles de fondation existants, sans réentraînement, et ajouter autour d'eux une couche de vérification. La version 2 du preprint indique un travail en cours de consolidation, mais aucune date de transfert vers un produit n'est annoncée. La suite logique est une validation sur davantage de plateformes et de tâches, avec des métriques de latence. La boucle de vérification et de génération de vidéos candidates est coûteuse en calcul, et c'est probablement la vraie question pour une cadence de production.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




