
DualManip : manipulation dynamique à base d'agents par raisonnement sémantique à double voie et adaptation géométrique
Des chercheurs ont publié le 28 septembre 2026 sur arXiv un preprint (2609.31112v1, non encore relu par les pairs) présentant DualManip, un framework de manipulation robotique à deux voies parallèles. Une voie sémantique, peu fréquente, décompose la tâche et identifie les points de prise via un module de résolution de contraintes ; une voie géométrique, continue, recale en temps réel un modèle de référence sur l'observation RGB-D grâce à un réseau adaptatif de forme, permettant de reconstruire la prise quand l'objet bouge ou se déforme. Un module d'interaction relie les deux voies, initialise les prises depuis le raisonnement sémantique et déclenche une replanification en cas d'échec géométrique. Sur six tâches réelles (déformation non rigide, objets articulés, mouvement rigide, assemblage de précision) et trois configurations allant du statique au changement continu, le système atteint une adaptation géométrique environ 46 fois plus rapide qu'une replanification sémantique complète.
L'enjeu vise la latence d'inférence des modèles vision-langage, qui freine leur réactivité quand une scène change, alors que la géométrie d'un objet évolue souvent sans changer l'intention de la tâche. En séparant un raisonnement lourd et rare d'une adaptation géométrique légère et continue, DualManip s'attaque à un verrou concret pour sortir la manipulation robotique des démos contrôlées et l'exposer à des objets qui bougent ou se déforment réellement. Cette architecture à deux vitesses rejoint une tendance déjà visible dans le secteur et apporte une preuve supplémentaire que cette séparation améliore la robustesse sans sacrifier la vitesse, un enjeu clé pour des intégrateurs confrontés au réel plutôt qu'à des séquences filmées et sélectionnées.
Le travail rejoint le débat sur les architectures vision-langage-action à deux échelles temporelles, déjà illustré par Helix de Figure AI (raisonnement lent «System 2» couplé à un contrôleur rapide «System 1»), ou par Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA. DualManip reste une contribution académique, sans entreprise, financement ni déploiement industriel cité, et le gain de 46x est mesuré face à une baseline interne plutôt qu'à un étalon du secteur. Une page de projet propose des vidéos des six tâches, mais aucun calendrier de transfert vers un robot commercial n'est annoncé.
Dans nos dossiers




