Aller au contenu principal
RecherchearXiv cs.RO 

SharedKV-BT : des décisions typées locales aux nœuds pour les agents à arbre de comportement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent dans un préprint arXiv (2610.07327v1) SharedKV-BT, une architecture qui confie les décisions d'un agent à un arbre de comportement (behavior tree, BT) et à un modèle autorégressif. Chaque nœud actif de l'arbre expose des champs et des candidats propres à son étape. Un mécanisme de cache clé-valeur partagé (Shared-KV) note tous les candidats en parallèle à partir d'un même contexte encodé. La décision retenue est ensuite transmise à un système d'exécution distinct. L'approche a été testée sur trois tâches : manipulation robotique, navigation mobile et utilisation d'un ordinateur. Les décisions typées sont produites 2,36 à 4,15 fois plus vite qu'avec un décodage autorégressif utilisant le même prompt. Sur la manipulation, la précision de décision conjointe passe de 75 % à 94 % et le succès en boucle fermée de 0 % à 60 %.

L'intérêt est de traiter un frein connu des agents pilotés par modèle de langage : la latence de génération token par token, qui pèse sur les enchaînements de décisions interdépendantes. Les méthodes à préfixe partagé existantes accélèrent le calcul, mais ne modélisent pas les dépendances entre décisions et ne vérifient pas l'exécution. Ici, un filtrage par étape empêche les actions hors séquence, et des postconditions externes empêchent de déclarer une tâche terminée trop tôt. Ces résultats viennent d'un rejeu de politique à scores fixes. Il faut aussi relativiser le chiffre principal : 60 % de succès en boucle fermée, sur une seule tâche de manipulation, reste loin d'un seuil industriel. Le résumé ne précise ni le matériel, ni la simulation, ni la taille des échantillons, et il ne s'agit d'aucun déploiement réel.

Ce travail prolonge l'idée de séparer la décision de haut niveau de l'exécution. Les behavior trees sont déjà très répandus en robotique de manipulation et de navigation pour structurer des missions, et les modèles vision-langage-action (VLA) généralistes tentent plutôt d'absorber cette logique dans un seul réseau. SharedKV-BT adopte la position inverse : un modèle contraint par la structure de l'arbre et vérifié par des conditions externes. Les auteurs ne mentionnent ni pilote industriel ni calendrier de mise en production. La suite logique serait une validation sur robot physique et une comparaison directe avec des politiques VLA de bout en bout.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Explications contrefactuelles temporelles des décisions d'arbres de comportement
1arXiv cs.RO 

Explications contrefactuelles temporelles des décisions d'arbres de comportement

Une équipe de chercheurs a publié sur arXiv (référence 2509.07674, version 2) une méthode automatisée de génération d'explications contrefactuelles temporelles pour les robots pilotés par des arbres de comportement (behaviour trees, BT). Le système répond en temps réel aux questions de type "pourquoi le robot a-t-il fait X plutôt que Y ?" en construisant automatiquement un modèle causal à partir de la structure du BT et de la connaissance du domaine applicatif, puis en interrogeant ce modèle pour produire un ensemble d'explications contrefactuelles diversifiées. Les auteurs affirment surpasser les méthodes existantes, qui soit ne répondent pas aux questions contrastives avec des explications causales, soit ne garantissent pas la cohérence et la précision des réponses sur une large gamme de structures de BT et d'états système. Les arbres de comportement sont largement utilisés dans les systèmes robotiques industriels et de service pour piloter la prise de décision, des manipulateurs aux robots mobiles autonomes (AMR) en passant par les plateformes humanoïdes. La question de l'explicabilité (XAI) y est critique pour les intégrateurs et les équipes de sécurité fonctionnelle : comprendre pourquoi un robot a choisi une séquence d'actions plutôt qu'une autre est indispensable pour la certification, la maintenance et l'acceptation par les opérateurs. Cette méthode propose le premier mécanisme de causalité contrefactuelle automatique dédié aux BT, comblant un angle mort identifié dans la littérature XAI robotique. Les arbres de comportement ont progressivement remplacé les automates finis (FSM) dans de nombreux systèmes robotiques depuis le milieu des années 2010, grâce à leur modularité et leur lisibilité. Les travaux antérieurs sur l'explicabilité des BT se limitaient à des justifications post-hoc non causales ou à des méthodes génériques issues de LIME, SHAP ou des réseaux causaux structuraux (SCM). La validation présentée repose sur des structures de BT synthétiques et des états variés, sans déploiement industriel annoncé à ce stade. Les prochaines étapes naturelles incluent la validation en environnement réel et l'intégration dans des interfaces opérateur, un enjeu croissant en Europe avec l'AI Act et les normes cobotiques (ISO 10218) qui renforcent les exigences de traçabilité des décisions autonomes.

UELes exigences de traçabilité de l'AI Act et des normes cobotiques (ISO 10218) rendent cette méthode d'explicabilité causale directement pertinente pour les intégrateurs robotiques européens soumis à certification.

RecherchePaper
1 source
Behaviora : une architecture conceptuelle pour le comportement externe et interne des robots et agents
2arXiv cs.RO 

Behaviora : une architecture conceptuelle pour le comportement externe et interne des robots et agents

Une nouvelle architecture conceptuelle baptisée Behaviora propose de représenter de façon adressable le comportement, externe et interne, des robots et agents artificiels. Publiée sur arXiv (arXiv:2609.27536v1, catégorie "new"), la proposition définit un système où un robot ou agent exécute des "Behavior Episodes" composées d'éléments dérivés de taxonomies comportementales (BTax), chacun recevant un identifiant persistant appelé adresse IoB, pour Internet of Behaviors. Un "Style Profile" (SP) spécifie la manière dont un comportement est exprime, tandis qu'un "Experience Profile" (EP) modélise un état interne pertinent qui module l'exécution de l'épisode. Un "Behavior Compiler" traduit ensuite ces représentations abstraites en actions concrètes propres a chaque plateforme matérielle. Les auteurs illustrent ces mécanismes a l'aide d'un modèle primitif de bras articule effectuant un mouvement de contact, et notent que le comportement interne peut se matérialiser sous forme de discours intérieur génère par le système. Aucun chiffre de performance, de déploiement ou de produit commercial n'accompagne cette publication, s'agissant explicitement d'une architecture "préliminaire". L'intérêt de ce travail est structurel plutôt qu'opérationnel: en séparant le "quoi" (l'épisode) du "comment" (le style) et de l'"état interne" (l'expérience), Behaviora propose un cadre potentiellement standardise pour rendre les comportements robotiques adressables et interopérables entre plateformes, un peu comme l'IoT adresse des objets connectes. Pour les intégrateurs et chercheurs travaillant sur des approches VLA (vision-langage-action) comme GR00T N2 ou Pi-0, ce cadre reste orthogonal: il ne resout pas le sim-to-real ni l'exécution physique, mais propose une couche de représentation et de personnalisation comportementale au-dessus de ces moteurs d'action. Le papier s'inscrit dans la lignée des taxonomies comportementales utilisées en interaction homme-robot, mais sans rattachement a une entreprise ou un laboratoire identifie dans le résume. Les auteurs précisent que la perception, la détection de contexte et les taches complexes ne sont pas encore intégrées dans l'implémentation actuelle, une place conceptuelle leur étant simplement réservée pour des travaux futurs.

RecherchePaper
1 source
PLATO Hand : des ongles pour affiner le comportement de contact et améliorer la précision de la saisie
3arXiv cs.RO 

PLATO Hand : des ongles pour affiner le comportement de contact et améliorer la précision de la saisie

La PLATO Hand, présentée dans un article de recherche en prépublication sur arXiv (février 2026), est une main robotique dextère dont le bout de doigt hybride combine trois composants mécaniques : un ongle rigide, une phalange distale intégrée et une pulpe souple. Cette architecture organise la manière dont le contact est initié, soutenu et transmis lors de la manipulation, sans capteurs tactiles externes. Pour dimensionner ce bout de doigt, les auteurs ont développé un modèle basé sur l'énergie de déformation (bending-indentation model) reliant la rigidité des matériaux à la répartition des déformations au point de contact. En validation expérimentale, la main a exécuté avec succès trois tâches de manipulation fine sensibles aux arêtes : la singulation de feuilles de papier (séparer une feuille d'une pile), le ramassage de cartes à jouer et l'épluchage d'une orange. Les résultats montrent une meilleure stabilité en pince (pinch stability), une meilleure transmission des forces de contact en configuration dorsale via l'ongle, et une observabilité proprioceptive améliorée, c'est-à-dire une meilleure capacité à déduire les forces de contact à partir des retours articulaires internes. Ces résultats intéressent directement les concepteurs de systèmes de manipulation industrielle, car ils indiquent qu'une couche de conception mécanique au niveau du contact peut améliorer la robustesse de la manipulation fine sans multiplier les capteurs. L'observabilité proprioceptive améliorée est particulièrement notable : estimer les forces de contact depuis les actionneurs existants réduit la dépendance aux capteurs tactiles distribués, coûteux et fragiles en environnement de production. La démonstration sur des tâches comme l'épluchage d'orange ou la singulation de papier cible explicitement le fossé entre démonstration robotique en laboratoire et applicabilité industrielle réelle, un des verrous les plus cités dans le secteur. La PLATO Hand s'inscrit dans un courant de recherche sur les mains dextères hybrides, à mi-chemin entre les approches entièrement rigides (Shadow Hand, Allegro Hand, LEAP Hand) et les mains entièrement souples. Ces mains existantes n'intègrent pas de structuration spécifique de la surface de contact au niveau distal ; la PLATO Hand y ajoute une couche inspirée de la morphologie humaine. Le travail reste à ce stade une démonstration de laboratoire en prépublication (version v2), sans annonce de commercialisation ni de partenariat industriel confirmé. Les suites naturelles incluent l'intégration sur un bras complet et des tests de durabilité en conditions réelles, deux étapes indispensables avant toute validation industrielle.

RecherchePaper
1 source
Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques
4arXiv cs.RO 

Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques

Une équipe de recherche propose une nouvelle méthode de tokenisation d'action baptisée BAAT, pour Behavior-Aligned Action Tokenization, décrite dans un preprint publié sur arXiv fin septembre 2026 (identifiant 2609.27513v1). Le travail cible un maillon technique précis des politiques robotiques autorégressives, ces systèmes qui apprennent le contrôle continu en prédisant des tokens d'action discrets à partir des observations visuelles: les tokenizers existants n'imposent aucune supervision explicite de la correspondance comportementale entre démonstrations, si bien que des mouvements similaires exécutés à des rythmes différents finissent par occuper des représentations distinctes. BAAT résout ce problème en utilisant le soft dynamic time warping, ou Soft-DTW, pour identifier des segments d'action correspondants entre tâches et aligner leurs coordonnées quantifiées conjointement avec l'objectif de reconstruction. Un décodeur par diffusion conditionné par l'historique reconstruit ensuite des séquences d'action continues à partir de ces tokens, sur lesquelles une politique autorégressive est entraînée en aval. Évaluée sur des tâches sélectionnées issues de trois benchmarks de simulation et sur deux tâches en robot réel, la méthode atteint un taux de succès moyen d'environ 45,2% en simulation, soit 7,2 points de pourcentage au-dessus de la référence OAT. Dans une ablation contrôlée sur le benchmark LIBERO-All, le taux de succès de la politique passe de 70,2% à 79,0% lorsque l'alignement comportemental est activé, au prix d'une légère baisse du succès de rejeu de trajectoire. Pour les équipes qui conçoivent des politiques de manipulation robotique, ce résultat s'attaque à un goulot d'étranglement souvent sous-estimé des architectures vision-langage-action: la qualité de la tokenisation en amont conditionne directement ce qu'une politique autorégressive peut apprendre en aval, indépendamment de la taille du modèle ou du volume de données. En montrant qu'une supervision explicite de la correspondance entre mouvements améliore le transfert entre tâches sans sacrifier la précision d'exécution, les auteurs apportent un argument empirique en faveur d'une meilleure structuration de l'espace de représentation des actions, plutôt que du seul passage à l'échelle des données ou des paramètres. Le gain de neuf points de succès en ablation contrôlée reste toutefois mesuré sur un seul benchmark, et l'écart de 7,2 points face à OAT en simulation, bien réel, ne dit rien de la généralisation à des environnements physiques variés ni à des embarquements industriels. Le point de comparaison retenu, OAT, sert de référence pour situer BAAT dans la lignée des travaux récents sur les tokenizers d'action pour politiques robotiques, un axe de recherche actif depuis l'essor des modèles VLA de type Pi-0 ou GR00T N2, qui reposent tous sur une étape de discrétisation des actions continues. Le papier reste à ce stade un résultat académique en préimpression, validé sur des sous-ensembles de tâches de trois benchmarks de simulation plus deux essais sur robot réel, sans indication de déploiement industriel, de partenariat ou de mise à disposition de code. Les auteurs présentent leurs résultats comme un argument en faveur de la correspondance comportementale comme signal de supervision pour organiser la structure de mouvement partagée dans les tokenizers d'action, une piste que d'autres laboratoires pourraient chercher à répliquer sur des benchmarks plus larges avant toute validation en conditions réelles.

RecherchePaper
1 source