
RobotAPO : optimisation adversariale des préférences physiques pour la génération de vidéos de manipulation robotique
Des chercheurs proposent RobotAPO, un cadre d'optimisation par préférences physiques adversariales destiné aux modèles de génération vidéo de manipulation robotique, accompagné d'un jeu de données baptisé AgiBot-PhysPref (preprint arXiv 2610.09454, première version). Ce jeu compte 10 000 échantillons de préférences soigneusement sélectionnés. Il isole des violations physiques à conditions égales, comme l'interpénétration d'objets ou le mouvement prématuré d'un objet à la frontière d'interaction. RobotAPO opère directement dans l'espace de débruitage continu du flow-matching. Un « proposeur contrefactuel » adversarial léger apprend, pour chaque condition, une direction de l'espace de débruitage biaisée vers l'échec physique. Le modèle est ainsi poussé à explorer cette frontière et à la respecter, au lieu de mémoriser des échecs statiques. À l'inférence, l'interface reste un simple couple prompt et image de référence, sans conditionnement structurel externe. Sur des conditions AgiBot mises de côté pour le test, RobotAPO dépasse la meilleure base de comparaison interne contrôlée de 6,8 % en score de cohérence physique « dur » et de 10,0 % en score « souple ». En rejeu sur robot réel, le taux de réussite des tâches progresse de 37,4 % en relatif face à cette même référence.
Ces résultats visent un point faible des vidéos utilisées comme plans visuels pour des agents incarnés. Une vidéo qui paraît plausible peut contenir une erreur de contact de quelques images, et cette erreur fausse le timing et la pose que l'on déduit ensuite pour l'exécution. Le fine-tuning supervisé classique n'exerce aucune pression directe sur ces défauts localisés. Les auteurs montrent qu'une correction ciblée de la physique d'interaction se traduit en gain mesurable sur matériel, ce qui est l'argument le plus utile pour les équipes qui misent sur des modèles du monde génératifs comme couche de planification. Il faut toutefois lire les chiffres avec prudence. La référence est interne, et le gain de 37,4 % est relatif : sans le taux de réussite absolu, le nombre d'essais et la diversité des tâches, on ne peut pas juger de sa portée pratique. Le « rejeu » sur robot réel d'une vidéo générée ne dit rien non plus de la robustesse hors distribution. Ce n'est pas un produit, mais un résultat de recherche.
Le travail s'inscrit dans la montée des approches « vidéo comme politique » ou « vidéo comme plan », où un générateur produit la trajectoire visuelle et un module d'inversion la convertit en actions. L'alignement par préférences, déjà courant pour les LLM et la génération d'images, est ici transposé à la physique du contact. Le choix d'AgiBot comme base de données montre que les grands corpus de manipulation issus des acteurs chinois servent désormais de terrain d'évaluation central. Ces travaux concurrencent des pistes voisines, comme les modèles de monde conditionnés par la structure, ou les politiques VLA directes de type Pi-0 et GR00T, qui évitent l'étape vidéo. Les auteurs ne mentionnent ni code ni modèle publiés dans ce résumé. La suite logique serait une validation sur d'autres plateformes et sur des tâches plus longues, avec des taux de réussite absolus publiés.
Dans nos dossiers




