Dis au robot ce qu'il ne doit pas faire : la compréhension de la négation
Des chercheurs proposent NegaAlign, un cadre « plug-and-play » qui apprend aux modèles vision-langage-action (VLA) à respecter des instructions négatives, du type « range les objets, mais pas la tasse rouge ». L'approche insère des couches de transformation de la négation (Negation Transformation Layers) dans certaines couches du backbone vision-langage afin de remodeler les représentations intermédiaires de l'instruction. Un mécanisme d'alignement guidé par un « enseignant » transfère ensuite l'ancrage visuel utile à l'action depuis des instructions qui satisfont la contrainte négative. L'entraînement s'appuie sur une supervision construite à partir de démonstrations existantes, avec une simple supervision image-langage. Seules les couches insérées sont mises à jour, soit 11,6 millions de paramètres, et tous les poids pré-entraînés restent gelés, générateur d'actions compris. Les auteurs publient aussi NegaBench, un benchmark en simulation de 10 scénarios dans cinq domaines. Testé sur GR00T, π0 et π0.5, NegaAlign améliore les résultats de façon constante. Pour π0.5, le taux de réussite sur instructions négatives passe de 2,60 % à 88,45 % sur NegaBench, et de 12,4 % à 88,8 % sur des tâches réelles, sans perte de performance sur les instructions affirmatives.
Ce travail met en évidence une faiblesse structurelle des VLA actuels. Avec 2,6 % de réussite sur NegaBench, π0.5 est loin du hasard informé : le modèle ignore la négation et exécute l'objet cité dans la phrase, comme si « ne touche pas à X » signifiait « va vers X ». Pour un intégrateur ou un responsable d'exploitation, c'est un risque concret. Les contraintes d'exclusion (zones interdites, pièces à ne pas manipuler, objets fragiles) sont au cœur des consignes en atelier, en logistique ou en assistance à domicile, et un modèle qui les inverse silencieusement n'est pas déployable en environnement partagé. Le résultat suggère aussi que la lacune ne vient pas de l'action elle-même : corriger uniquement la couche de représentation du langage suffit à la combler, sans réentraîner le générateur d'actions ni collecter de nouvelles démonstrations téléopérées. C'est un coût d'adaptation faible, compatible avec des modèles déjà déployés. Deux réserves s'imposent toutefois. L'évaluation principale est simulée, et les 88,8 % en conditions réelles portent sur un nombre de tâches que le résumé ne précise pas, ce qui appelle à la prudence sur la généralisation à d'autres négations, plus compositionnelles.
L'étude s'inscrit dans la vague de VLA généralistes issus des modèles vision-langage : π0 et π0.5 de Physical Intelligence, et GR00T de NVIDIA, tous deux largement utilisés comme bases de référence académiques. Jusqu'ici, l'essentiel des travaux portait sur la généralisation à de nouveaux objets, environnements ou embodiments, plus que sur la compréhension logique des consignes. La négation rejoint ainsi d'autres limites connues des modèles de langage, comme le raisonnement compositionnel. Les auteurs proposent une méthode légère greffable sur ces modèles, plutôt qu'un nouveau modèle de fondation. Il s'agit d'un preprint arXiv (v1), non évalué par les pairs, et aucun calendrier de diffusion du code ou de NegaBench n'est évoqué dans le résumé. La suite logique serait de tester NegaAlign sur des instructions plus complexes (exclusions multiples, conditions temporelles) et sur des robots en production, avant que les éditeurs de VLA n'intègrent éventuellement ce type de supervision directement à leur pré-entraînement.
Dans nos dossiers




