
UniReflex : contrôle de force plug-and-play pour politiques génératives préentraînées via réflexe rapide-lent
UniReflex, décrit dans un preprint arXiv publié mi-août 2026 (2608.17432v1), ajoute un contrôle de force en boucle fermée à des politiques d'imitation générative déjà entraînées, sans réentraîner leur réseau principal. En interceptant les représentations latentes de la tête d'action, il pilote un réseau réflexe rapide qui sépare l'exercice actif de force de la réponse aux interactions externes, prédit des directions de rigidité anisotrope pour un contrôle d'impédance variable (VIC) directionnel, et bascule via un gating adaptatif entre planification en position et exécution en force. Sur des essais réels bimanuels, la méthode améliore la stabilité de contact et le taux de réussite tout en préservant la précision de position, avec une latence de rétropropagation par pas 25 à 66 fois plus faible que l'entraînement conjoint.
L'enjeu est concret : les politiques génératives récentes, de type diffusion ou VLA, planifient bien les trajectoires mais ne régulent pas la force de contact, un manque critique pour l'assemblage, l'insertion ou la manipulation d'objets déformables. Jusqu'ici, ajouter cette modalité imposait de redesigner ou réentraîner tout le réseau, opération coûteuse et incompatible avec la logique des modèles fondation préentraînés à grande échelle. En figeant le backbone et en ne branchant qu'un module réflexe léger, UniReflex ouvre une voie pour équiper des politiques déjà entraînées d'un contrôle de force sans casser leur compatibilité, un point de friction réel pour les intégrateurs visant l'industrialisation de la manipulation en contact ; les résultats restent toutefois des démonstrations de laboratoire, et le gain de latence n'est vérifié que sur les backbones testés par les auteurs.
Ce travail s'inscrit dans une tendance où les modèles VLA et les politiques par diffusion dominent désormais la manipulation robotique, au détriment du contrôle d'impédance classique de la robotique industrielle, plus précis en force mais moins généraliste. Les approches concurrentes exigent généralement de reconcevoir l'architecture ou de réentraîner tout le backbone pour intégrer la force ; UniReflex se distingue en se déclarant compatible avec tout backbone génératif figé, testé sur plusieurs architectures en configuration bimanuelle. Simple preprint non encore relu par les pairs, le travail devra être validé sur davantage de plateformes et comparé aux références établies du contrôle de force en dehors des benchmarks internes des auteurs.
Dans nos dossiers




