Aller au contenu principal
RecherchearXiv cs.RO 

Langage Silicon : un cadre d'échange de connaissances natif pour robots hétérogènes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs chinois publient sur arXiv (2610.07650) « Silicon Language », un cadre d'échange de connaissances conçu pour que des robots hétérogènes se transmettent des capacités sans réingénierie humaine. Le principe : un robot qui veut une compétence encode sa propre expérience en « paquets de connaissances », les publie, récupère ceux de ses pairs, les traduit pour ses propres capteurs et actionneurs, puis les valide par un essai local indépendant. L'architecture repose sur trois couches : un agent embarqué (edge), un protocole baptisé Silicon Transfer Protocol (STP) et un hub de connaissances, le tout organisé selon une pile de capacités inspirée du système de publication scientifique humain. Un procédé d'évaluation côté récepteur permet à chaque robot de juger l'utilité d'un paquet externe, avec un mélange progressif et un retour arrière automatique pour limiter le transfert négatif. Le déploiement de preuve de concept a duré 30 jours dans un laboratoire de mine simulée en surface à Yulin, avec des essais de suivi sur une route de sable en extérieur et dans une usine en intérieur. Deux robots hétérogènes ont encodé et traduit trois capacités d'un support à l'autre. Les essais côté source du comportement de suivi « dust-locked » ont été enregistrés sur le robot Taurus.

Pour les intégrateurs, le coût caché de la robotique reste l'adaptation : chaque transfert de compétence d'une plateforme à une autre implique de refaire les interfaces, de réajuster les paramètres et de revalider la sécurité. Les auteurs indiquent que le temps d'adaptation par capacité serait passé de plusieurs jours à quelques heures. Ce chiffre vient des relevés du projet et non d'une mesure contrôlée, et les auteurs le précisent eux-mêmes. Il n'existe pas de comparaison avec/sans paquet, et le nombre de capacités (trois) et de robots (deux) est très faible. Surtout, les échanges se sont faits par copies de fichiers assistées par un opérateur, ce qui veut dire que la boucle autonome décrite n'a pas été démontrée. Le travail est donc une preuve initiale de faisabilité pour le transfert inter-embodiment, pas une validation à l'échelle d'une flotte. Il vaut surtout pour la question qu'il pose : la validation locale côté récepteur, plutôt que la certification centralisée, comme garde-fou du partage de compétences.

Ce travail s'inscrit dans la recherche sur la généralisation entre morphologies, où les modèles VLA (vision-langage-action) généralistes comme Pi-0 ou GR00T misent sur de grands jeux de données pour couvrir plusieurs robots. Silicon Language prend une voie différente, plus proche d'un registre de paquets pour robots, où chaque machine reste responsable de ce qu'elle adopte. Le contexte minier de Yulin reflète aussi l'intérêt chinois pour l'automatisation des environnements poussiéreux et dangereux. Les auteurs renvoient à des travaux futurs l'évolution autonome à l'échelle d'une flotte et les comparaisons contrôlées. Aucun calendrier de pilote industriel n'est annoncé.

À lire aussi

SwarmCoDe : cadre de co-conception évolutif pour essaims de robots hétérogènes par spéciation dynamique
1arXiv cs.RO 

SwarmCoDe : cadre de co-conception évolutif pour essaims de robots hétérogènes par spéciation dynamique

SwarmCoDe est un algorithme de co-évolution collaborative (CCEA) présenté dans un preprint arXiv (2603.26240v2) qui vise à automatiser la co-conception d'essaims de robots hétérogènes à grande échelle. La méthode centrale, dite "spéciation dynamique", fait émerger automatiquement des espèces de robots distinctes en fonction de la complexité de la tâche, sans les définir a priori. L'algorithme optimise simultanément la planification de tâches et la morphologie physique des robots, sous contrainte de budget de fabrication. Il intègre un "gène de dominance" qui dicte la composition de l'essaim, et des "tags génétiques" inspirés de mécanismes biologiques de coopération inter-espèces, permettant aux agents d'identifier des partenaires bénéfiques sans frontières prédéfinies. Les expériences rapportées, toutes simulées, montrent des essaims pouvant atteindre 200 agents, soit quatre fois la taille de la population évolutionnaire utilisée pour les générer. Le problème que SwarmCoDe cherche à résoudre est structurel : dans les approches classiques, la co-conception d'un essaim devient rapidement intractable à mesure que le nombre d'agents augmente, l'espace de design croissant exponentiellement. Le gène de dominance découple la taille physique de l'essaim de la population évolutionnaire, ce qui constitue la contribution technique principale : elle rend le calcul viable pour de grands systèmes sans explosion des ressources computationnelles. Pour les intégrateurs industriels et les équipes R&D déployant des flottes de robots, cela ouvre la perspective d'une optimisation automatique de la diversité matérielle, plutôt qu'une définition manuelle du mix robotique. Les améliorations marginales sur chaque unité se composent à l'échelle, ce qui explique pourquoi le co-design est stratégique dès qu'on parle de dizaines ou centaines d'agents en déploiement réel. La co-conception robotique est un domaine actif depuis une décennie, mais généralement appliquée à des robots unitaires ou de petits groupes homogènes. SwarmCoDe s'inscrit dans la continuité des travaux sur l'évolution morphologique (NEAT, neuroévolution) et des recherches sur les essaims hétérogènes, notamment des groupes comme celui de Josh Bongard à l'Université du Vermont. Les approches concurrentes incluent l'optimisation multi-objectif classique et les frameworks de co-design par gradient. Point critique à noter : l'article ne présente aucune validation sur robots physiques, toutes les métriques étant issues de simulation. Le fossé sim-to-real reste un verrou non adressé dans ce travail, et constituera l'épreuve décisive pour une adoption en contexte industriel.

RecherchePaper
1 source
Scale-Plan : planification de tâches par le langage pour équipes multi-robots hétérogènes, à grande échelle
2arXiv cs.RO 

Scale-Plan : planification de tâches par le langage pour équipes multi-robots hétérogènes, à grande échelle

Le Honda Research Institute a publié sur arXiv une version révisée (v2, arXiv:2603.08814) de Scale-Plan, un système de planification de tâches à long horizon pour des équipes de robots hétérogènes. Face aux planificateurs symboliques classiques, qui exigent des spécifications construites à la main, et aux approches par grands modèles de langage, sujettes aux hallucinations et à un mauvais ancrage dans des environnements riches en objets, la méthode filtre l'information perceptuelle avant de planifier. À partir d'une spécification de domaine au format PDDL, Scale-Plan construit un graphe d'actions représentant la structure du domaine, puis utilise un raisonnement LLM volontairement superficiel pour guider une recherche structurée qui isole le sous-ensemble minimal d'actions et d'objets pertinents pour l'instruction donnée en langage naturel. Les auteurs introduisent aussi MAT2-THOR, un benchmark nettoyé bâti sur le simulateur AI2-THOR, destiné à évaluer de façon fiable les systèmes de planification multi-robot. L'enjeu est concret pour les intégrateurs de flottes hétérogènes : plus le nombre d'objets et d'agents croît, plus les planificateurs symboliques deviennent lourds à construire manuellement, tandis que les approches purement LLM perdent en fiabilité en inventant des actions ou des objets absents de l'environnement réel. En réduisant le problème à un sous-graphe minimal avant la décomposition des tâches, l'allocation entre robots et la génération de plans longs, Scale-Plan vise à combiner la robustesse du raisonnement symbolique et la flexibilité du langage naturel. Sur des tâches multi-agents complexes, la méthode dépasse les bases purement LLM et les approches hybrides LLM-PDDL sur l'ensemble des métriques rapportées, ce qui suggère que le goulot d'étranglement des architectures associant LLM et robotique tient moins à la puissance du modèle de langage qu'au volume de contexte non pertinent qu'on lui soumet. Il s'agit à ce stade d'une publication de recherche et non d'un produit déployé : aucun robot physique, aucune charge utile, degré de liberté ou temps de cycle n'est mentionné, le travail portant sur la couche de planification de tâches plutôt que sur le contrôle bas niveau, à la différence de politiques de manipulation comme Pi-0 ou GR00T N2. Le code est publié sur le dépôt GitHub honda-research-institute/Scale_Plan, permettant une reproduction indépendante des résultats. L'article ne précise ni partenaire industriel ni calendrier de déploiement ; les auteurs indiquent vouloir étendre le benchmark MAT2-THOR et valider l'approche sur des tâches multi-robots encore plus complexes.

RecherchePaper
1 source
Modélisation unifiée mouvement-action pour l'apprentissage sur robots hétérogènes
3arXiv cs.RO 

Modélisation unifiée mouvement-action pour l'apprentissage sur robots hétérogènes

Des chercheurs ont déposé sur arXiv (arXiv:2606.16917, juin 2026) le modèle UMA (Unified Motion-Action), une architecture d'apprentissage robotique qui place les trajectoires 3D de mouvement d'objets comme interface commune entre contrôle visuomoteur et modélisation de dynamiques. Plutôt que de traiter séparément les actions du robot et l'évolution de l'environnement, UMA les co-modélise sous un objectif génératif masqué, inspiré des architectures MAE (Masked Autoencoders): le motif de masquage détermine à la fois le régime de supervision pendant le pré-entraînement et le mode d'inférence au déploiement. Le modèle est pré-entraîné sur un mélange de démonstrations robotiques, de vidéos humaines et de données simulées, sans annotations manuelles d'instructions de tâches. Un objectif contrastif dissocie l'intention de tâche de la géométrie de scène. Au déploiement, les mêmes paramètres pré-entraînés supportent trois modes distincts: contrôle visuomoteur conditionné par le mouvement, modélisation dynamique, et adaptation few-shot à de nouvelles tâches. Les auteurs rapportent des performances supérieures aux baselines spécialisées sur chacun de ces modes. L'apport principal est de résoudre le problème structurel de l'hétérogénéité des données robotiques. Combiner démonstrations d'un bras industriel, vidéos de mains humaines et scènes simulées dans un entraînement multi-tâche exige habituellement des annotations coûteuses ou des têtes de sortie spécialisées par domaine. UMA contourne cela: les trajectoires 3D d'objets fonctionnent comme un "lingua franca" représentationnel, indépendant de la morphologie du robot ou de la source des données. La technique de "hindsight relabeling" permet d'annoter rétrospectivement des contextes de mouvement depuis les données brutes, sans intervention humaine. Pour un intégrateur ou un COO industriel, c'est concret: adapter un modèle généraliste à une nouvelle ligne en quelques démonstrations réduit sensiblement les coûts de déploiement. Nuance à souligner: il s'agit d'un preprint sans revue par les pairs, et les benchmarks présentés mériteraient une validation indépendante sur plateformes physiques réelles. Cette publication s'inscrit dans la compétition autour des modèles Vision-Langage-Action (VLA) généralisables. Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Figure AI (Helix, déployé sur le Figure 03) cherchent tous à entraîner des politiques robotiques sur des données hétérogènes à grande échelle, avec le même défi partagé: comment exploiter des vidéos humaines non labellisées ou des données simulées sans annotation prohibitive. UMA propose une réponse architecturale via le mouvement 3D d'objets comme superviseur implicite universel, un angle distinct des approches VLA qui s'appuient sur le langage comme pivot sémantique. La validation sur benchmarks ouverts tels que LIBERO ou Open-X Embodiment, absente du preprint, sera déterminante pour évaluer la généralisation réelle de l'approche.

RechercheOpinion
1 source
Champs de distance de faisabilité pour contraintes hétérogènes dans l'espace des configurations d'un robot
4arXiv cs.RO 

Champs de distance de faisabilité pour contraintes hétérogènes dans l'espace des configurations d'un robot

Des chercheurs en robotique ont publié fin septembre 2026 sur arXiv (référence 2609.24632) une méthode baptisée feasibility distance field (FDF), qui définit une distance unique, sous une métrique fixe et positive définie dans l'espace des articulations, séparant une configuration de robot de l'ensemble des configurations interdites. La théorie classique de la distance à un ensemble garantit une continuité 1-Lipschitz, une différentiabilité presque partout et une norme de gradient unitaire lorsque la projection la plus proche est unique. La contribution proprement robotique tient dans une analyse d'admissibilité montrant à quelles conditions des contraintes concrètes, collision externe et auto-collision, limites articulaires, dextérité, compliance cartésienne ou projetée sur la tâche, couple articulaire sous charge utile, manipulabilité dynamique, définissent des ensembles fermés non vides exploitables par cette distance commune. Les auteurs génèrent des étiquettes par projection et entraînent des réseaux de neurones à approximer ces champs avec une perte de distance et une pénalité Eikonal. En simulation sur un bras UR5e et une cellule bi-bras, sept champs sont évalués sur 8 000 configurations : le ratio sécant du côté faisable atteint au maximum 0,920, les normes de gradient apprises se situent entre 0,994 et 0,998, et les résidus de projection entre 0,011 et 0,034 radian. Sur 24 trajectoires d'obstacles mobiles générées aléatoirement, les champs de collision externe et composé réussissent respectivement à 90,4% et 91,6% avec une marge de 3 cm, pour un taux d'erreur de signe inférieur à 2%. L'intérêt pour un intégrateur ou un ingénieur en planification de mouvement est de disposer, pour la première fois de façon unifiée, d'une marge de sécurité exprimée dans une seule et même unité pour des contraintes hétérogènes qui, jusqu'ici, se mesuraient dans des échelles incomparables. Parce que tous les champs partagent la même métrique, ils se combinent par un simple minimum ponctuel, ce qui simplifie la fusion de contraintes multiples, et les configurations multi-robots produisent des gradients creux par blocs indiquant précisément quel bras doit réagir à une menace de collision, un atout pour les cellules bi-bras ou les flottes coopératives. L'approximation par réseau de neurones laisse entrevoir un calcul de marge en temps réel, moins coûteux que des méthodes d'optimisation par projection répétée, utile pour du contrôle réactif embarqué. Il s'agit toutefois d'un travail de nature théorique validé uniquement en simulation sur un seul bras et une cellule à deux bras, sans démonstration sur robot physique ni en environnement industriel réel. Le travail part d'un constat opérationnel : les indicateurs spécifiques à chaque contrainte (collision, couple, manipulabilité) utilisent des unités et des échelles de gradient différentes, empêchant toute mesure commune de la marge de mouvement restante avant violation. Les auteurs s'appuient sur la théorie classique de la distance à un ensemble et la rapprochent des champs de distance signée déjà utilisés en robotique pour la collision, en l'étendant à des contraintes de dextérité, de compliance et de dynamique jusqu'ici traitées séparément. Les limites reconnues portent sur les erreurs d'approximation près des axes médians et des zones de frontière peu échantillonnées, des points où la projection cesse d'être unique. Les suites logiques annoncées par les auteurs concernent l'extension à des scènes plus complexes et, à terme, une validation sur robot réel, condition nécessaire avant toute adoption par des intégrateurs industriels.

RecherchePaper
1 source