Aller au contenu principal
RecherchearXiv cs.RO 

Dis au robot ce qu'il ne doit pas faire : la compréhension de la négation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent NegaAlign, un cadre « plug-and-play » qui apprend aux modèles vision-langage-action (VLA) à respecter des instructions négatives, du type « range les objets, mais pas la tasse rouge ». L'approche insère des couches de transformation de la négation (Negation Transformation Layers) dans certaines couches du backbone vision-langage afin de remodeler les représentations intermédiaires de l'instruction. Un mécanisme d'alignement guidé par un « enseignant » transfère ensuite l'ancrage visuel utile à l'action depuis des instructions qui satisfont la contrainte négative. L'entraînement s'appuie sur une supervision construite à partir de démonstrations existantes, avec une simple supervision image-langage. Seules les couches insérées sont mises à jour, soit 11,6 millions de paramètres, et tous les poids pré-entraînés restent gelés, générateur d'actions compris. Les auteurs publient aussi NegaBench, un benchmark en simulation de 10 scénarios dans cinq domaines. Testé sur GR00T, π0 et π0.5, NegaAlign améliore les résultats de façon constante. Pour π0.5, le taux de réussite sur instructions négatives passe de 2,60 % à 88,45 % sur NegaBench, et de 12,4 % à 88,8 % sur des tâches réelles, sans perte de performance sur les instructions affirmatives.

Ce travail met en évidence une faiblesse structurelle des VLA actuels. Avec 2,6 % de réussite sur NegaBench, π0.5 est loin du hasard informé : le modèle ignore la négation et exécute l'objet cité dans la phrase, comme si « ne touche pas à X » signifiait « va vers X ». Pour un intégrateur ou un responsable d'exploitation, c'est un risque concret. Les contraintes d'exclusion (zones interdites, pièces à ne pas manipuler, objets fragiles) sont au cœur des consignes en atelier, en logistique ou en assistance à domicile, et un modèle qui les inverse silencieusement n'est pas déployable en environnement partagé. Le résultat suggère aussi que la lacune ne vient pas de l'action elle-même : corriger uniquement la couche de représentation du langage suffit à la combler, sans réentraîner le générateur d'actions ni collecter de nouvelles démonstrations téléopérées. C'est un coût d'adaptation faible, compatible avec des modèles déjà déployés. Deux réserves s'imposent toutefois. L'évaluation principale est simulée, et les 88,8 % en conditions réelles portent sur un nombre de tâches que le résumé ne précise pas, ce qui appelle à la prudence sur la généralisation à d'autres négations, plus compositionnelles.

L'étude s'inscrit dans la vague de VLA généralistes issus des modèles vision-langage : π0 et π0.5 de Physical Intelligence, et GR00T de NVIDIA, tous deux largement utilisés comme bases de référence académiques. Jusqu'ici, l'essentiel des travaux portait sur la généralisation à de nouveaux objets, environnements ou embodiments, plus que sur la compréhension logique des consignes. La négation rejoint ainsi d'autres limites connues des modèles de langage, comme le raisonnement compositionnel. Les auteurs proposent une méthode légère greffable sur ces modèles, plutôt qu'un nouveau modèle de fondation. Il s'agit d'un preprint arXiv (v1), non évalué par les pairs, et aucun calendrier de diffusion du code ou de NegaBench n'est évoqué dans le résumé. La suite logique serait de tester NegaAlign sur des instructions plus complexes (exclusions multiples, conditions temporelles) et sur des robots en production, avant que les éditeurs de VLA n'intègrent éventuellement ce type de supervision directement à leur pré-entraînement.

À lire aussi

Vers une compréhension unifiée de la manipulation robotique : une étude complète
1arXiv cs.RO 

Vers une compréhension unifiée de la manipulation robotique : une étude complète

Une équipe de chercheurs publie une version mise à jour (v2) d'un vaste état de l'art sur la manipulation robotique, référencé arXiv:2510.10903, avec l'ensemble des ressources associées (papiers de recherche, jeux de données open source, projets) centralisées sur un dépôt GitHub dédié, BaiShuanghao/Awesome-Robotics-Manipulation. Le document couvre les fondements du domaine, les benchmarks et jeux de données organisés par tâche, ainsi qu'une taxonomie unifiée des méthodes existantes. Il étend la distinction classique entre planification de haut niveau et contrôle de bas niveau : la planification haut niveau englobe désormais le langage, le code, le mouvement, l'affordance et les représentations 3D, tandis que le contrôle bas niveau appris est reclassé selon trois paradigmes d'entraînement, le modelage d'entrée (input modeling), l'apprentissage latent et l'apprentissage de politique (policy learning), une catégorie qui recouvre notamment les approches vision-langage-action (VLA). Les auteurs proposent aussi la première taxonomie dédiée aux verrous du domaine, articulée autour de la collecte de données, de leur exploitation et de la généralisation, avant de conclure par une revue des applications en conditions réelles. Pour les chercheurs et intégrateurs, ce travail répond à un problème concret : la manipulation robotique reste un champ éclaté, où chaque laboratoire publie sa propre méthode sans cadre commun pour comparer les approches. En pointant la collecte, l'exploitation des données et la généralisation comme les trois verrous structurants, la survey confirme un constat déjà largement partagé dans le secteur, à savoir que le goulot d'étranglement n'est plus tant l'architecture des modèles que la disponibilité et la qualité des données d'entraînement, ainsi que la capacité des politiques apprises à transférer d'un environnement à un autre. C'est un signal utile pour les décideurs B2B qui évaluent quelle famille de méthodes, symbolique, fondée sur les affordances, ou bout-en-bout par politique apprise, mérite un investissement au-delà de la simple démonstration. Cette synthèse s'inscrit dans l'essor de l'intelligence incarnée (embodied intelligence), porté ces dernières années par les progrès de la vision par ordinateur, du traitement du langage naturel et la montée des modèles multimodaux à grande échelle. Les auteurs revendiquent une couverture plus large et une analyse plus approfondie que les études antérieures sur le sujet, positionnant leur travail à la fois comme point d'entrée accessible pour les nouveaux venus et comme référence structurée pour les chercheurs déjà établis dans le domaine.

RecherchePaper
1 source
ActiveArena : benchmarking et compréhension de la perception active en manipulation robotique
2arXiv cs.RO 

ActiveArena : benchmarking et compréhension de la perception active en manipulation robotique

Un nouveau papier de recherche publié sur arXiv (référence 2609.24124v1, soumission de type "new") présente ActiveArena, un ensemble d'outils pour évaluer la perception active en manipulation robotique. Il se compose de trois briques : ActiveArena-Sim, un simulateur à points de vue contrôlables et grands espaces de travail ; ActiveArena-Bench, un benchmark de 35 tâches réparties en 5 catégories couvrant l'exploration visuelle et l'acquisition interactive d'informations, chaque tâche étant conçue pour être insoluble à partir d'une seule observation passive et exigeant plusieurs cycles de collecte de preuves et un raisonnement fondé sur la mémoire ; et ActiveArena-VLA, une suite modulaire de 13 configurations vision-langage-action permettant d'isoler l'effet de l'écriture en mémoire, de la capacité mémoire, des entrées proprioceptives, de la supervision de sous-tâches et de la planification de haut niveau. Le benchmark fournit aussi des annotations de mémoire détaillées, des données d'entraînement standardisées et des protocoles distinguant distribution connue (ID) et hors distribution (OOD), avec scènes disjointes, distracteurs inédits et arrière-plans nouveaux. Les résultats rapportés montrent un écart de performance important entre ID et OOD, confirmant que les systèmes vision-langage-action actuels généralisent mal dès qu'ils sortent des scènes d'entraînement, un doute déjà répandu dans le secteur sur la robustesse réelle des VLA. Le papier identifie toutefois des leviers concrets : un échantillonnage mémoire uniforme, une capacité mémoire accrue couplée à des politiques d'écriture fiables, l'ajout d'entrées proprioceptives et la supervision de sous-tâches améliorent la généralisation OOD, tandis qu'une gestion de la mémoire pilotée par un planificateur permet d'approcher les performances des meilleures configurations avec une mémoire beaucoup plus éparse, donc moins coûteuse en calcul. Pour les équipes qui développent des manipulateurs devant opérer dans des environnements changeants ou partiellement occlus, ce travail fournit un cadre de comparaison objectif, plutôt qu'une nouvelle démonstration isolée. Ce travail s'inscrit dans une évolution plus large des benchmarks de manipulation robotique, qui se déplacent des tests de saisie statique vers des scénarios exigeant exploration active et mémoire persistante, alors que les architectures vision-langage-action se généralisent comme approche de contrôle robotique. Aucune affiliation institutionnelle, aucun partenaire industriel ni date de mise à disposition du code ne sont précisés dans l'annonce : il s'agit d'une contribution académique en amont de tout déploiement, dont l'utilité dépendra de son adoption par la communauté de recherche comme référence pour évaluer les futurs modèles.

RecherchePaper
1 source
Ce que la carte d'élévation ne voit pas : locomotion sémantique et navigation tenant compte de l'exécution pour robot humanoïde
3arXiv cs.RO 

Ce que la carte d'élévation ne voit pas : locomotion sémantique et navigation tenant compte de l'exécution pour robot humanoïde

Des chercheurs proposent un nouveau benchmark de simulation pour la navigation des robots humanoïdes, accompagné d'un cadre de contrôle en boucle fermée associant navigation visuelle guidée par le langage (VLN) et politique de locomotion. Le travail, publié sur arXiv (2610.07396), part d'un constat : les benchmarks VLN existants produisent certes des déplacements physiquement exécutables, mais reposent sur deux hypothèses jugées irréalistes. La première est que tous les dangers sont visibles dans une carte d'élévation. La seconde est que les mouvements réalisés correspondent fidèlement aux mouvements commandés. Le nouveau benchmark modélise à la fois des obstacles « subtils en élévation » (une bouteille tombée, ambiguë sur une carte de hauteur, ou la difficulté de distinguer un téléphone d'une flaque d'eau) et des écarts d'exécution. Le cadre proposé réaligne en continu la navigation de haut niveau sur l'état réel du robot. L'évaluation est menée en simulation, et la politique de locomotion est validée sur un humanoïde Unitree G1 réel. Les résultats indiquent que l'entrée sémantique réduit les contacts avec les dangers mal représentés par les cartes d'élévation, et que le mécanisme anti-déviation améliore le taux de réussite de navigation. L'extrait disponible ne fournit ni taux de réussite chiffrés, ni taille du benchmark, ni nombre d'essais sur le matériel. L'intérêt tient à ce que ce travail s'attaque à un angle mort des évaluations actuelles. Quand la locomotion esquive un danger, le robot s'écarte du chemin voulu par la politique de navigation, et cet écart se cumule jusqu'à conduire la machine vers un endroit non prévu. Pour les intégrateurs et les responsables d'exploitation qui envisagent des humanoïdes dans des environnements encombrés (entrepôts, ateliers, commerces), le message est clair : mesurer seulement l'achèvement du trajet, ou seulement l'évitement d'obstacles, donne une image trompeuse. Les auteurs plaident pour une évaluation conjointe des deux. Cela relativise aussi les démonstrations où la carte d'élévation suffit à tout : un liquide au sol ou un objet plat échappe à la géométrie pure, et la perception sémantique devient nécessaire. Il faut toutefois rester prudent : il s'agit d'un benchmark simulé, et la validation physique porte sur la locomotion, pas sur la chaîne complète de navigation. Ce travail s'inscrit dans la montée en puissance des approches VLN et des politiques de locomotion apprises pour humanoïdes, où le G1 d'Unitree est devenu une plateforme de recherche courante grâce à son coût relativement abordable. Les évaluations sur matériel à grande échelle restent coûteuses et risquées, ce qui explique le recours aux benchmarks de simulation, au prix d'un écart sim-to-real que ce papier ne referme pas entièrement. La suite logique serait une validation de bout en bout sur robot physique, avec davantage de scénarios et de types de dangers. Aucun calendrier ni partenaire industriel n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Exploration des espaces de préhension robotique tenant compte de la connectivité
4arXiv cs.RO 

Exploration des espaces de préhension robotique tenant compte de la connectivité

Des chercheurs publient sur arXiv (arXiv:2609.22983v1, prépublication non encore évaluée par les pairs) une étude sur la structure spatiale des prises robotiques réussies dans l'espace SE(3), c'est-à-dire l'ensemble à six degrés de liberté des positions et orientations possibles d'un préhenseur. Plutôt que de traiter chaque pose de saisie comme un problème binaire isolé (valide ou non), les auteurs s'intéressent à la façon dont les prises réussies s'organisent entre elles au sein de cet espace. En exploitant un jeu de données de saisie à grande échelle, ils montrent que les ensembles de prises valides forment, pour un objet donné, une structure de connectivité hétérogène mais reproductible d'un objet à l'autre. Ils introduisent ensuite une stratégie d'échantillonnage dite « connectivity-aware », qui explore de façon incrémentale l'espace de prise observé en priorisant quatre types de candidats : les ponts potentiels entre composantes déconnectées, les frontières structurelles, les extensions de bordure et la nouveauté géométrique. Dans des expériences de reconstruction contrôlées, cette méthode retrouve la topologie des ensembles de prises réussies nettement plus vite que les deux références standard du domaine, l'échantillonnage aléatoire et le farthest-point sampling. Pour l'industrie de la manipulation robotique, bin-picking, pick-and-place industriel, l'enjeu est la réduction du nombre d'essais physiques ou simulés nécessaires pour cartographier les prises viables d'un nouvel objet, un poste de coût récurrent pour les intégrateurs. Les auteurs testent aussi si la structure de connectivité apprise sous viabilité partiellement masquée accélère la découverte de nouvelles prises, et si l'expérience structurelle acquise sur des objets déjà explorés se transfère à des objets inédits, une piste pertinente pour généraliser sans réentraîner à chaque nouvelle référence produit. Il s'agit toutefois de résultats de recherche en environnement contrôlé, pas d'un système déployé en usine. Ce travail s'inscrit dans la lignée des détecteurs de prise par apprentissage et des planificateurs par échantillonnage, qui évaluent traditionnellement des poses candidates indépendamment les unes des autres sans modéliser leur organisation géométrique collective. En pointant une structure exploitable au-delà de la viabilité individuelle de chaque pose, l'étude ouvre la voie à des méthodes d'exploration sensibles à la géométrie de l'espace d'action, avec des travaux futurs attendus sur le passage à des objets réels et des scènes de manipulation plus complexes.

RecherchePaper
1 source