Aller au contenu principal
RecherchearXiv cs.RO 

Behaviora : une architecture conceptuelle pour le comportement externe et interne des robots et agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une nouvelle architecture conceptuelle baptisée Behaviora propose de représenter de façon adressable le comportement, externe et interne, des robots et agents artificiels. Publiée sur arXiv (arXiv:2609.27536v1, catégorie "new"), la proposition définit un système où un robot ou agent exécute des "Behavior Episodes" composées d'éléments dérivés de taxonomies comportementales (BTax), chacun recevant un identifiant persistant appelé adresse IoB, pour Internet of Behaviors. Un "Style Profile" (SP) spécifie la manière dont un comportement est exprime, tandis qu'un "Experience Profile" (EP) modélise un état interne pertinent qui module l'exécution de l'épisode. Un "Behavior Compiler" traduit ensuite ces représentations abstraites en actions concrètes propres a chaque plateforme matérielle. Les auteurs illustrent ces mécanismes a l'aide d'un modèle primitif de bras articule effectuant un mouvement de contact, et notent que le comportement interne peut se matérialiser sous forme de discours intérieur génère par le système. Aucun chiffre de performance, de déploiement ou de produit commercial n'accompagne cette publication, s'agissant explicitement d'une architecture "préliminaire".

L'intérêt de ce travail est structurel plutôt qu'opérationnel: en séparant le "quoi" (l'épisode) du "comment" (le style) et de l'"état interne" (l'expérience), Behaviora propose un cadre potentiellement standardise pour rendre les comportements robotiques adressables et interopérables entre plateformes, un peu comme l'IoT adresse des objets connectes. Pour les intégrateurs et chercheurs travaillant sur des approches VLA (vision-langage-action) comme GR00T N2 ou Pi-0, ce cadre reste orthogonal: il ne resout pas le sim-to-real ni l'exécution physique, mais propose une couche de représentation et de personnalisation comportementale au-dessus de ces moteurs d'action.

Le papier s'inscrit dans la lignée des taxonomies comportementales utilisées en interaction homme-robot, mais sans rattachement a une entreprise ou un laboratoire identifie dans le résume. Les auteurs précisent que la perception, la détection de contexte et les taches complexes ne sont pas encore intégrées dans l'implémentation actuelle, une place conceptuelle leur étant simplement réservée pour des travaux futurs.

À lire aussi

Enseigner et grandir : une architecture centrée agent pour l'apprentissage général des robots
1arXiv cs.RO 

Enseigner et grandir : une architecture centrée agent pour l'apprentissage général des robots

Des chercheurs ont publié sur arXiv (référence 2608.17209v1) une architecture baptisée Teach-and-Grow Learning (TGL), conçue pour l'apprentissage général de robots. Le système repose sur un agent multimodal qui transforme quelques démonstrations réussies en « Skill Blocks », des comportements en boucle fermée couvrant des sous-objectifs précis, stockés dans une Skill Library. Une Experience Memory structurée conserve en parallèle les succès, les échecs et les corrections associées. Face à une nouvelle scène, l'agent sélectionne et combine ces blocs, choisit des outils appris ou géométriques, observe le résultat physique de son action, puis ajuste sa trajectoire si l'exécution s'écarte de l'intention initiale. Sur le benchmark de simulation LIBERO, largement utilisé pour évaluer les politiques robotiques, TGL revendique des résultats à l'état de l'art, avec des études contrôlées montrant l'induction de nouvelles compétences, leur réutilisation persistante et une adaptation pilotée par l'agent, sans réentraînement de politique spécifique à chaque tâche. L'enjeu vise directement ce que les auteurs nomment la « taxe de réentraînement » : dans les modèles VLA (vision-language-action) et les modèles monde-action classiques, dès qu'un objet, un capteur, une morphologie ou un type de contact sort du périmètre validé, corriger l'échec exige de nouvelles données robotiques, une mise à jour de politique et une campagne de tests de non-régression, un cycle coûteux puisque, contrairement au texte, les données robotiques doivent le plus souvent être générées en opérant physiquement des machines. En proposant d'acquérir de nouvelles tâches par composition de compétences réutilisables plutôt que par réentraînement, TGL questionne l'hypothèse dominante selon laquelle la généralisation passe uniquement par des modèles VLA toujours plus gros nourris de plus de données. C'est un signal utile pour les intégrateurs et décideurs qui évaluent le coût réel de déploiement de politiques robotiques. Il faut néanmoins noter que la validation reste cantonnée au benchmark simulé LIBERO, sans déploiement documenté sur robot physique à ce stade. Ce travail s'inscrit dans la vague plus large des modèles fondation pour la robotique, qui inclut des approches VLA de bout en bout comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, conçues pour généraliser directement à partir de données massives sans couche agentique intermédiaire. TGL se positionne en alternative complémentaire, misant sur un agent explicite plutôt que sur l'échelle brute du modèle. Les auteurs avancent aussi une hypothèse de loi d'échelle propre : à mesure que le volume d'expérience réutilisable augmente, l'erreur sur les tâches futures et l'effort d'enseignement nécessaire devraient décroître selon une loi de puissance vers un plancher irréductible, traitant le déploiement comme une période d'apprentissage continu où chaque tâche accomplie facilite la suivante. Aucune date de disponibilité, partenariat industriel ou pilote n'est mentionné, ce travail restant une contribution de recherche publiée en preprint.

RecherchePaper
1 source
IA à Base d'Agents Physiques : une Architecture pour Orchestrer une Équipe de Robots avec des LLM
2arXiv cs.RO 

IA à Base d'Agents Physiques : une Architecture pour Orchestrer une Équipe de Robots avec des LLM

Un article publié sur arXiv le 25 août 2026 (arXiv:2608.22657v1) présente Physical Agentic AI, une architecture pour orchestrer des équipes de robots hétérogènes pilotées par des modèles de fondation. Chaque robot y expose une bibliothèque typée de compétences exécutables ; un planificateur découpe une mission en phases et assigne chacune à un couple robot-compétence ; un orchestrateur déterministe valide et autorise ensuite chaque compétence une par une avant actuation, séparant la planification sémantique, non-actuante, de l'exécution physique. L'architecture a été testée sur une mission de recherche et dispatch impliquant un drone et un robot terrestre non habité, entièrement exécutée en simulation Gazebo, ainsi que sur une tâche de transport combinant un humanoïde et un quadrupède, avec deux essais physiques réels sur un Unitree G1 et un Go2. Chiffres clés : l'ajout d'un mécanisme de récupération d'information fait passer le taux d'ancrage correct des compétences de 51% à 96%, mais même un planificateur bien informé envoie encore 23 à 29% des étapes défectueuses vers l'exécution. La vérification systématique à chaque dispatch ramène ce taux de faux positifs à 0%, sans blocage abusif. Sur huit défauts injectés délibérément, les huit ont franchi la barrière d'orchestration sans cette vérification, et six ont déclenché un mouvement réel du robot ; avec elle activée, les huit ont été refusés avant tout mouvement. Ce travail pointe un angle mort des démonstrations de robots pilotés par LLM : un plan sémantiquement riche n'empêche pas des actions physiquement infaisables ou dangereuses. Pour les intégrateurs de flottes multi-robots, le message est net, un planificateur mieux informé réduit les erreurs de raisonnement mais ne sécurise pas l'exécution ; seule une couche de vérification déterministe, indépendante du plan, empêche le passage à l'acte d'une instruction fautive. L'ablation isolant l'effet de cette porte de validation renforce l'idée que le "meilleur prompting" seul ne suffit pas à sécuriser un déploiement physique, un signal utile face à l'écart persistant entre démo et réalité opérationnelle. Le papier s'inscrit dans la recherche reliant grands modèles de langage et orchestration robotique, terrain souvent dominé par des approches de bout en bout type vision-langage-action (Pi-0, GR00T N2) plutôt que par une couche de contrôle explicite. C'est une contribution académique tout juste postée sur arXiv, sans affiliation industrielle ni plan de déploiement commercial précisés, validée en simulation et sur un nombre limité d'essais matériels, à traiter comme une preuve de concept en attente de revue par les pairs plutôt que comme un produit prêt à industrialiser.

RecherchePaper
1 source
VIA : agent d'interface visuelle pour le contrôle de robots
3arXiv cs.RO 

VIA : agent d'interface visuelle pour le contrôle de robots

Le laboratoire d'IA publie sur arXiv (référence 2607.11119v1) un framework baptisé VIA, pour Visual Interface Agent, qui aborde le contrôle robotique sous un angle radicalement différent des approches dominantes. Plutôt que d'entraîner un modèle vision-langage-action (VLA) spécialisé sur des données robotiques, VIA fait piloter un bras manipulateur par un agent génériste (Claude Code ou Codex) via une interface 3D dans un navigateur : l'agent prend des captures d'écran, envoie des commandes simples, observe le résultat et ajuste sa trajectoire en boucle fermée. Aucun fine-tuning spécifique au robot, aucun accès à des données d'état privilégiées : seulement de la perception visuelle et un petit ensemble d'outils génériques. Avec le modèle le plus performant testé, Fable 5, VIA atteint 96,7% de réussite sur trois tâches de la suite LIBERO-Goal et 100% sur une tâche complexe d'assemblage séquentiel ("rainbow assembly"). L'enjeu dépasse la simple prouesse technique. Les modèles VLA actuels (dérivés de familles comme pi-0 ou GR00T N2) restent des ordres de grandeur plus petits que les modèles généralistes de pointe, faute de données et de calcul disponibles pour le fine-tuning robotique, ce qui plafonne mécaniquement leurs capacités de raisonnement. VIA suggère au contraire que les capacités générales des agents de codage ou d'usage d'ordinateur se transfèrent directement au contrôle physique, à condition de leur fournir la bonne interface. Autre signal notable : la performance de VIA progresse avec l'échelle et la puissance du modèle sous-jacent, ce qui laisserait entrevoir des gains automatiques à mesure que les modèles génériques s'améliorent, sans réentraînement robotique dédié. Pour les intégrateurs et décideurs du secteur, cela questionne la nécessité de collecter des données robotiques coûteuses pour chaque nouvelle tâche. Le travail s'inscrit dans la vague de recherche sur les VLA (RT-2, OpenVLA, Helix et consorts), qui reste aujourd'hui le paradigme dominant pour la robotique généraliste. VIA en propose une alternative agentique, sans fine-tuning, testée pour l'instant uniquement sur des tâches de manipulation de table en environnement contrôlé. Il s'agit d'un préprint arXiv, non encore validé par les pairs, et les auteurs eux-mêmes présentent leurs résultats comme des indices de transférabilité plutôt que comme une solution de déploiement industriel : les prochaines étapes attendues porteront sur l'élargissement à des tâches plus diverses et des environnements réels au-delà du tabletop.

RechercheActu
1 source
Architecture hybride intelligente à base de LLM pour l'ordonnancement des tâches robotiques
4arXiv cs.RO 

Architecture hybride intelligente à base de LLM pour l'ordonnancement des tâches robotiques

Une équipe de chercheurs a publié sur arXiv (arXiv:2605.15486, mai 2026) un framework hybride exploitant des grands modèles de langage (LLM) pour orchestrer la planification de tâches de robots de chantier. L'architecture repose sur deux agents LLM fonctionnant en parallèle : un agent générateur basé sur GPT-4 (OpenAI) chargé de produire les séquences de tâches, et un agent superviseur interchangeable parmi Gemma 3 (Google DeepMind), Llama 4 (Meta) ou Mistral 7b, chargé de valider et corriger les plannings générés. Le système intègre une interface en langage naturel (NLP) permettant aux professionnels du bâtiment de communiquer directement leurs contraintes opérationnelles, et peut s'adapter en temps réel à des conditions imprévues sur site. Les résultats sont évalués sur un scénario simplifié avec des métriques quantitatives d'efficacité temporelle et d'utilisation des ressources. L'intérêt principal de cette approche réside dans la combinaison d'un modèle de raisonnement puissant (GPT-4) avec un modèle superviseur plus léger et remplaçable, ce qui réduit potentiellement le coût d'inférence tout en maintenant une validation en boucle fermée. Pour les intégrateurs de robotique dans le BTP, la couche NLP représente une piste concrète pour réduire la dépendance à des opérateurs spécialisés en programmation robot. Cela dit, l'évaluation reste limitée à un scénario dit "straightforward", ce qui ne permet pas de conclure sur la robustesse en conditions réelles de chantier, où la multiplicité des aléas (retards livraison, obstacles, météo) constitue le vrai défi. La validité industrielle de la méthode reste à démontrer à plus grande échelle. La planification automatisée de tâches multi-robots dans la construction est un axe actif depuis plusieurs années, notamment avec les travaux sur les systèmes BIM-to-robot et les AMR (autonomous mobile robots) de chantier. Des acteurs comme Boston Dynamics (avec Spot en inspection), Hilti (robots d'ancrage) ou NLink explorent déjà des formes de programmation par intention. En Europe, des initiatives comme Versatile (projet H2020) ont tracé des pistes similaires. Ce preprint s'inscrit dans une tendance plus large d'utilisation des VLA (Vision-Language-Action models) et des LLM comme couche de planification symbolique au-dessus de robots exécutants, une approche que des laboratoires comme Stanford (Mobile ALOHA) et CMU poussent en parallèle. Les prochaines étapes attendues seraient une validation sur chantier réel et une comparaison formelle entre les différents agents superviseurs testés.

UEApproche potentiellement exploitable par des intégrateurs robotiques européens actifs dans le BTP (Versatile/H2020), mais sans validation sur chantier réel ni déploiement en Europe à ce stade.

RechercheOpinion
1 source