Aller au contenu principal
InfrastructurearXiv cs.RO 

Planification à base d'agents en lots pour le service de politiques robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du Georgia Tech (laboratoire RL2) publient un article intitulé "Action Chunk Scheduling for Batched Robot Policy Serving" (arXiv:2608.00337v1), qui pose un problème encore peu formalisé dans la robotique : comment servir un même modèle de politique robotique, hébergé sur un GPU distant, à plusieurs robots simultanément. Les auteurs présentent Armory, un système de service ("serving") conçu pour cet usage et validé à la fois sur des flottes de robots simulés et sur des robots réels. Leurs expériences montrent que les heuristiques de scheduling classiques (les méthodes de batching habituelles en inférence LLM) fonctionnent correctement tant que tous les robots de la flotte sont identiques et consomment les actions au même rythme. Mais dès que les robots consomment leurs "action chunks" (blocs d'actions produits par les modèles Vision-Language-Action) à des vitesses différentes, ces heuristiques échouent : elles ne tiennent pas compte des contraintes en boucle fermée ("closed-loop") propres à l'exécution de politiques robotiques. Pour corriger ce défaut, l'équipe propose un nouvel algorithme de scheduling qui intègre cette hétérogénéité de rythme entre robots, avec un gain de débit système mesuré jusqu'à 18 % lors d'essais réels. Le code et les détails sont disponibles sur gatech-rl2.github.io/actionchunkscheduling.

Le résultat touche un point aveugle du déploiement à grande échelle des modèles fondation pour la robotique (VLA type Pi-0, GR00T N2, Helix ou autres) : le calcul embarqué est limité en puissance et en encombrement, ce qui pousse naturellement vers une inférence déportée sur GPU distant, mutualisée entre plusieurs robots pour amortir les coûts. Or les architectures de batching héritées du monde LLM, pensées pour du texte asynchrone, ignorent la contrainte physique du temps réel robotique : un robot qui épuise son buffer d'actions avant d'être resservi s'arrête ou dégrade sa trajectoire. Ce papier démontre empiriquement que cette mécanique de service compte autant que la qualité du modèle lui-même pour faire fonctionner une flotte hétérogène en production, un enjeu direct pour les intégrateurs qui veulent mutualiser l'inférence entre robots de générations ou de tâches différentes plutôt que de multiplier les cartes embarquées.

Ce travail s'inscrit dans la vague récente de modèles VLA génériques (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure) qui cherchent à démontrer un contrôle robotique à l'échelle d'une flotte plutôt qu'à l'unité, un terrain où l'infrastructure de service devient aussi critique que l'entraînement. En formalisant le problème comme un scheduling explicite et en le testant sur du matériel réel plutôt que seulement en simulation, les auteurs positionnent Armory comme une brique d'infrastructure réutilisable, potentiellement comparable aux serveurs d'inférence LLM (type vLLM) mais adaptée aux contraintes temps réel de la robotique. L'article ne précise pas de partenariat industriel ni de déploiement commercial annoncé ; il s'agit pour l'instant d'un résultat de recherche académique, avec du code ouvert, plutôt que d'un produit prêt à l'emploi.

À lire aussi

Robot low-cost, banc de test ArmnetBench v0.1 pour évaluer des politiques de manipulation en parallèle
1arXiv cs.RO 

Robot low-cost, banc de test ArmnetBench v0.1 pour évaluer des politiques de manipulation en parallèle

Des chercheurs ont publié ArmnetBench v0.1, un benchmark d'évaluation en conditions réelles pour les politiques de manipulation robotique, exécuté sur une flotte de bras low-cost SO-101 sous supervision humaine légère sur site. Cette première version compare 7 politiques sur 12 tâches, en configuration bras unique et bimanuelle. Chaque politique est entraînée ou affinée sur 50 démonstrations par tâche. Le benchmark comptabilise 2 518 rollouts de politiques et 600 démonstrations de référence, soit 3 118 épisodes au total, chacun annoté selon une échelle à trois niveaux (réussite, sous-optimal, échec). Les rollouts sont notés manuellement, tandis que les démonstrations sont par construction considérées comme réussies. L'ensemble des 3 118 épisodes est publié en deux formats standards, LeRobot v3.0 et RoboMeter, pour faciliter la réutilisation par la communauté. L'évaluation en conditions réelles reste le principal goulot d'étranglement du développement de politiques de manipulation généralistes : chaque rollout nécessite du matériel physique et un opérateur pour installer, réinitialiser et noter la tentative, ce qui limite fortement le volume de tests réalisables face aux simulateurs. En s'appuyant sur des bras SO-101 peu coûteux et une supervision réduite, ArmnetBench propose un compromis entre le coût d'un banc d'essai physique et la scalabilité recherchée pour comparer des politiques à grande échelle. Au-delà du classement, la valeur du jeu de données tient surtout à son étiquetage qualité par épisode : ces trajectoires annotées peuvent nourrir l'entraînement de modèles de récompense, de modèles du monde prédictifs, ou de politiques apprises sur des données de qualité mixte, un axe distinct de la simple mesure de performance. Ce travail s'inscrit dans la lignée des efforts communautaires autour de l'écosystème LeRobot et des bras robotiques abordables comme le SO-101, popularisés notamment par Hugging Face pour démocratiser la recherche en manipulation hors des laboratoires équipés de bras industriels coûteux. Il fait écho aux benchmarks existants bâtis en simulation ou sur du matériel plus onéreux, en offrant une alternative reproductible à bas coût. Les auteurs présentent ce classement initial comme un point de départ sous budget partagé plutôt qu'une évaluation définitive, cette v0.1 servant avant tout à valider l'infrastructure de la ferme de bras de bout en bout. Les suites attendues incluent l'élargissement du nombre de tâches et de politiques comparées, ainsi que l'exploitation des données mixtes pour entraîner de nouveaux modèles.

InfrastructureActu
1 source
EVA-Client : framework unifié de collecte, d'inférence et de déploiement pour politiques incarnées sur robots réels
2arXiv cs.RO 

EVA-Client : framework unifié de collecte, d'inférence et de déploiement pour politiques incarnées sur robots réels

Un nouveau framework open-source baptisé EVA-Client vient formaliser une brique jusqu'ici bricolée maison par chaque laboratoire de robotique manipulatrice : le pont entre un serveur d'inférence de politique et le robot physique. Publié sur arXiv début juillet 2026, l'outil unifie en un seul code base les trois étapes critiques de la boucle d'itération sur robot réel, déploiement, collecte de données et évaluation. Son architecture découple explicitement trois couches orthogonales, les backends robots, les stratégies d'inférence et les middlewares de transport, de sorte qu'ajouter un nouveau bras ou un nouvel algorithme ne touche qu'une seule couche du système. EVA-Client propose aussi trois modes d'exécution inspectables, Debug, Collect et Eval, allant de la simulation en boucle ouverte au contrôle temps réel continu. Surtout, chaque run d'évaluation enregistre automatiquement des rollouts complets au format prêt pour l'entraînement, avec logs exhaustifs et un visualiseur de comparaison côte à côte, transformant chaque test en donnée réutilisable plutôt qu'en simple observation perdue. Le framework consolide enfin les principales stratégies d'inférence temps réel du secteur, exécution synchrone et asynchrone, lissage temporel façon ACT, Real-Time Chunking, et une base asynchrone naïve servant de référence, derrière une seule interface de configuration. Pour les équipes qui entraînent des politiques d'imitation ou des modèles VLA (vision-language-action), ce type d'infrastructure comble un angle mort réel : la littérature regorge de nouvelles architectures de politiques, mais la mise en production sur robot réel reste souvent un patchwork non reproductible, ce qui complique les comparaisons équitables entre méthodes et ralentit le passage du prototype au déploiement en série. En traitant chaque évaluation comme une collecte de données, EVA-Client attaque directement le problème du volume de données réelles, goulot d'étranglement classique face aux modèles génératifs entraînés sur des corpus web massifs. Ce travail s'inscrit dans une vague plus large d'outillage d'infrastructure pour l'IA incarnée, à mesure que des modèles fondation comme Pi-0, GR00T N2 ou Helix gagnent en maturité et que le goulot se déplace de l'algorithme vers l'ingénierie de déploiement. Contrairement aux piles propriétaires fermées de certains acteurs commerciaux, une approche ouverte et modulaire pourrait faciliter les comparaisons inter-laboratoires et accélérer l'adoption par des équipes académiques ou industrielles ne disposant pas de stack maison.

InfrastructureOpinion
1 source
PLanAR : raisonnement à base d'agents ancré dans la planification et le langage pour la manipulation robotique
3arXiv cs.RO 

PLanAR : raisonnement à base d'agents ancré dans la planification et le langage pour la manipulation robotique

Des chercheurs ont présenté PLanAR (Planning-Language-Grounded Agentic Reasoning), un framework agent pour la manipulation robotique long-horizon en environnements ouverts, publié sous forme de préprint arXiv (2602.01662v4). Le système utilise des modèles vision-langage (VLMs) comme moteur de raisonnement, mais les contraint via une interface de planification symbolique structurée en trois composants : des prédicats d'objets encodant l'état de la scène, des schémas d'action définissant les compétences du robot avec leurs préconditions et effets attendus, et des plans symboliques servant de représentations intermédiaires exécutables. Après chaque action, PLanAR vérifie si les effets symboliques attendus ont été atteints via les observations embarquées, ce qui lui permet de détecter les échecs et de replanifier en cas de déviation. Les évaluations couvrent plusieurs morphologies de robots et backends VLM sur des tâches allant de l'empilement d'objets à la résolution de mots croisés, en passant par des séquences cuisine long-horizon. La manipulation long-horizon reste un défi majeur de la robotique incarnée : les architectures VLA (Vision-Language-Action) pures, comme Pi-0 (Physical Intelligence) ou OpenVLA, échouent souvent lorsque les séquences s'allongent et que les conditions d'exécution changent. PLanAR adresse ce problème en introduisant une boucle de vérification étape par étape qui sépare explicitement raisonnement et exécution, une propriété absente des approches end-to-end. Cette architecture hybride neurosymbolique est directement pertinente pour les intégrateurs industriels travaillant en environnements non contrôlés, car elle permet au robot de détecter et corriger ses propres erreurs sans intervention humaine. Les auteurs reconnaissent eux-mêmes que PLanAR révèle des limitations importantes dans le raisonnement incarné des VLMs actuels, une posture analytique rare dans la littérature récente. PLanAR s'inscrit dans une longue tradition d'approches TAMP (Task and Motion Planning) cherchant à combiner planification symbolique et exécution motrice, aux côtés de SayCan (Google DeepMind, 2022), Code as Policies (2023) et GR00T N2 (NVIDIA, 2025) qui intègre également un module de raisonnement symbolique. La distinction clé réside dans l'interface de planification formelle imposée au VLM, qui réduit l'espace de recherche au prix d'une expressivité moindre. Le preprint ne mentionne ni partenariat industriel ni timeline de déploiement, et les expériences restent en laboratoire : le passage à l'échelle en conditions réelles demeure la question ouverte centrale pour valider l'approche au-delà du benchmark académique.

IA physiqueOpinion
1 source
EtherCAT pour le contrôle des articulations de robots : les explications de GigaDevice
4Pandaily 

EtherCAT pour le contrôle des articulations de robots : les explications de GigaDevice

GigaDevice a organisé un webinaire intitulé "Secure Robotics in Motion" pour exposer la direction prise par les systèmes de contrôle robotique modernes, avec un focus sur EtherCAT, le protocole de communication temps réel déterministe qui s'impose dans la synchronisation des articulations multi-axes. Une main dextre de robot humanoïde intègre typiquement 10 à 20 degrés de liberté (DOF), chacun adossé à un moteur, une suite de capteurs, un algorithme de contrôle et un lien de communication devant délivrer les données à la microseconde près. EtherCAT répond à ce défi via une architecture maître-esclave où chaque nœud traite les données à la volée, atteignant des temps de cycle de 20 à 250 microsecondes avec une gigue inférieure à 1 microseconde. Les horloges distribuées garantissent une référence temporelle commune à tous les axes, évitant les désynchronisations qui rendraient tout mouvement coordonné impossible. Pour adresser ce marché directement, GigaDevice a présenté sa série GD32H75E : un microcontrôleur Cortex-M7 cadencé jusqu'à 600 MHz, avec DSP, FPU double précision et MPU, intégrant un contrôleur esclave EtherCAT plus deux PHYs sur un même die. Le chip embarque également une unité mathématique trigonométrique (TMU), des filtres FIR/IIR, un filtre numérique haute performance (HPDF), une sortie de division de fréquence d'encodeur (EDOUT), et un ensemble de fonctions sécurité : AES, SHA, HMAC, EFUSE, TRNG et démarrage sécurisé. L'intégration du contrôleur EtherCAT directement dans le MCU réduit le nombre de composants externes, simplifie le routage des cartes et abaisse la consommation système, ce qui représente un avantage mesurable pour les intégrateurs qui conçoivent des articulations compactes. Plus structurellement, la présence de fonctions de sécurité matérielles signale un changement dans la perception du marché : les robots ne sont plus des systèmes isolés mais des noeuds réseau exposés dans des usines, entrepôts et environnements domestiques. Le fait qu'un fournisseur de microcontrôleurs grand public comme GigaDevice propose désormais un SoC dédié à ce cas d'usage indique que la demande en volume commence à justifier du silicium spécialisé, au-delà des solutions FPGA ou des stacks logiciels ajoutés sur des MCUs génériques. GigaDevice, fondé en 2005 à Pékin et coté à Shanghai, s'est imposé sur le marché des microcontrôleurs GD32 en concurrence directe avec STMicroelectronics, NXP, Renesas et Texas Instruments. EtherCAT a été développé par Beckhoff Automation dans les années 2000 et reste géré par l'ETG (EtherCAT Technology Group), qui compte aujourd'hui plus de 7 500 membres. Dans l'espace des contrôleurs EtherCAT dédiés, GigaDevice se positionne face à Hilscher, Microchip (LAN9252) et Beckhoff lui-même. Le webinaire ne s'accompagne pas d'annonces de déploiements clients ni de volumes de production, ce qui en fait davantage une communication de positionnement produit qu'un retour terrain. La prochaine étape observable sera la présence de la série GD32H75E dans des kits d'articulations humanoïdes ou des drives de servomoteurs commerciaux.

UELa montée en puissance de GigaDevice sur le segment des MCUs robotiques représente une pression concurrentielle directe sur STMicroelectronics, acteur franco-italien explicitement cité comme concurrent direct dans ce marché des microcontrôleurs industriels.

InfrastructureActu
1 source