Aller au contenu principal
RecherchearXiv cs.RO 

Co-conception des réseaux neuronal et musculaire via une représentation en perceptron incarné

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2608.16555v1, mis en ligne le 18 août 2026) un article intitulé "Co-design of Neural and Muscle Network based on Embodied Perceptron Representation", qui introduit un cadre théorique baptisé Embodied Perceptron. L'idée consiste à modéliser le corps physique d'un robot comme un perceptron : les paramètres mécaniques jouent le rôle des poids synaptiques, et les non-linéarités physiques (élasticité, frottements, contraintes articulaires) celui des fonctions d'activation. Appliqué à un robot musculosquelettique, ce cadre permet de co-optimiser simultanément la configuration des muscles et la politique de contrôle neuronal. Résultat marquant : le système obtenu affiche une stabilité intrinsèque, une meilleure efficacité d'apprentissage, et une réduction drastique de la taille du modèle de contrôle, jusqu'à fonctionner avec un contrôleur à un seul neurone. L'article ne cite aucun robot commercial, aucun site de déploiement ni volume de production : il s'agit d'une contribution théorique et expérimentale de laboratoire.

Cette approche s'inscrit dans le courant de la robotique incarnée et de la computation morphologique, qui postule que le corps peut assumer une partie du travail normalement dévolu au réseau de contrôle. Pour les concepteurs de robots à actionnement musculaire ou souple, la promesse est double : réduire la charge de calcul embarquée et améliorer la robustesse aux perturbations, sans dépendre uniquement de politiques massives type VLA entraînées sur d'énormes volumes de données. Le résultat va à contre-courant de l'hypothèse dominante selon laquelle la performance repose avant tout sur la taille du réseau de contrôle : ici, un design mécanique bien choisi suffit à produire une intelligence incarnée avec un contrôleur minimal. La validation reste toutefois limitée à un seul type de robot, sans comparaison chiffrée face aux architectures de contrôle établies ni test sur des tâches industrielles réelles.

Le travail s'appuie sur des recherches antérieures en robotique incarnée montrant que des corps bien conçus peuvent remplacer une partie du calcul grâce aux interactions physique-environnement, une conception qui reposait jusqu'ici surtout sur l'intuition d'experts plutôt que sur une méthode systématique. Les auteurs présentent l'Embodied Perceptron comme un pont théorique entre le monde informationnel des réseaux de neurones et le monde physique des systèmes mécaniques, avec l'ambition de fournir une méthode reproductible de co-conception corps-contrôleur, potentiellement transposable à des exosquelettes ou à des mains robotiques compliantes. L'article ne précise ni laboratoire d'origine ni calendrier de suite, et aucun acteur commercial de l'humanoïde, de l'AMR ou de la robotique molle n'y figure comme partenaire ou concurrent : il s'agit pour l'instant d'une publication de recherche fondamentale destinée à la communauté académique.

Dans nos dossiers

À lire aussi

KING : réseau neuronal de graphe cinématique tenant compte de l'incarnation pour une représentation unifiée du mouvement des robots à pattes et à roues
1arXiv cs.RO 

KING : réseau neuronal de graphe cinématique tenant compte de l'incarnation pour une représentation unifiée du mouvement des robots à pattes et à roues

Des chercheurs de l'AIST (National Institute of Advanced Industrial Science and Technology, Japon) publient KING, un modèle cinématique basé sur un réseau de neurones à graphes (GNN) capable d'estimer l'odométrie de robots à roues comme à pattes avec un seul et même réseau. Le système, décrit dans un preprint arXiv publié début août 2026, représente l'embodiment du robot (nombre d'articulations, points de contact au sol, roues ou pieds) sous forme de graphe commun, unifiant ainsi des cinématiques jusqu'ici traitées séparément. KING s'appuie uniquement sur une description du robot au format URDF et sur la proprioception embarquée (encodeurs et IMU), sans capteurs extéroceptifs. Entraîné sur des jeux de données couvrant plusieurs types de robots, il peut ensuite s'adapter à un nouvel embodiment via un apprentissage few-shot ne nécessitant qu'une minute de données, plutôt qu'un réentraînement complet. Les auteurs mettent en avant une précision d'odométrie supérieure aux méthodes cinématiques classiques dans des environnements réels. L'enjeu dépasse la seule performance technique. L'odométrie par capteurs extéroceptifs (caméras, lidars) se dégrade dans les environnements sans repères visuels, et l'intégration IMU seule dérive rapidement ; les modèles cinématiques restent donc une brique essentielle de la localisation robotique. Jusqu'ici, chaque nouvel embodiment imposait de réentraîner un modèle dédié, un frein concret pour les intégrateurs opérant des flottes hétérogènes mêlant AMR à roues et robots à pattes. Un modèle généraliste adaptable en quelques minutes de données réduirait significativement ce coût d'ingénierie, un argument qui parlera aux fabricants de robots quadrupèdes ou humanoïdes cherchant à mutualiser leur stack logicielle avec des plateformes à roues. Le travail s'inscrit dans une tendance plus large de représentations unifiées pour la robotique, portée notamment par les modèles vision-langage-action (VLA) qui cherchent eux aussi à généraliser au-delà d'un seul robot. KING reste à ce stade une publication de recherche, sans déploiement industriel annoncé ; une page projet est disponible en ligne, mais aucun partenaire matériel ni calendrier de commercialisation n'est mentionné.

RecherchePaper
1 source
SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif
2arXiv cs.RO 

SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif

Des chercheurs présentent SplatCtrl, un système qui combine reconstruction 3D en temps réel et contrôle réactif de bras robotique pour éviter les collisions dans des environnements inconnus et changeants. Le framework s'appuie sur le 3D Gaussian Splatting, une technique de représentation de scène par nuages de gaussiennes 3D, et introduit une méthode hybride de filtrage voxel combinée à une relocalisation dynamique des gaussiennes, permettant de reconstruire la scène à partir de flux RGB-D tout en s'adaptant aux changements de l'environnement en continu. Pour le contrôle, les auteurs dérivent des fonctions de distance signée continues directement depuis les gaussiennes isotropes, ce qui fournit des estimations de probabilité de collision stables et différentiables, faisant le pont entre les champs de distance classiques et les représentations implicites modernes. Ces métriques sont ensuite injectées dans des fonctions de barrière de contrôle (control barrier functions), aboutissant à un couplage perception-action unifié capable de générer des mouvements fluides en réaction aux changements de scène. Le système a été validé en simulation, sur un robot physique réel, et dans un espace de travail partagé humain-robot. L'intérêt pour l'industrie tient à la promesse centrale du papier: rendre les bras manipulateurs, aujourd'hui performants surtout en environnement structuré et statique, capables d'opérer en sécurité dans des contextes dynamiques et partagés avec des humains, sans reprogrammation manuelle des trajectoires. Si les résultats se confirment à plus grande échelle, cela toucherait directement les intégrateurs industriels et logistiques confrontés à des cellules de travail non figées, ainsi que les applications de cobotique où la coexistence humain-robot impose une réactivité aux obstacles imprévus. C'est aussi un signal supplémentaire que le 3D Gaussian Splatting, initialement pensé pour le rendu photoréaliste, s'impose progressivement comme brique de perception robotique. Le travail s'inscrit dans une lignée de recherches récentes cherchant à exploiter le 3D-GS pour la robotique, au-delà de son usage d'origine en vision par ordinateur et rendu de scènes. L'article ne précise pas d'affiliation industrielle ni de partenaire de déploiement identifié: il s'agit d'une contribution de recherche académique publiée sur arXiv, sans indication de commercialisation ni de calendrier de transfert vers un produit. Les prochaines étapes attendues concernent le passage à l'échelle sur des scènes plus complexes et des tests prolongés en conditions réelles d'usine ou d'entrepôt.

RecherchePaper
1 source
Développer des compétences combinées de manipulation et de locomotion via une représentation d'interaction et une composition de compétences
3arXiv cs.RO 

Développer des compétences combinées de manipulation et de locomotion via une représentation d'interaction et une composition de compétences

Des chercheurs présentent une méthode pour apprendre à un robot humanoïde à combiner préhension et locomotion à partir de principes développementaux, dans un article déposé sur arXiv (2608.00208v1). La première brique est une politique de saisie corps entier inspirée de l'analyse harmonique : des harmoniques cubiques servent de poids pour représenter la relation spatiale main objet via une convolution spatiale, et un curriculum de découplage des articulations des doigts, appliqué au sein même de chaque épisode d'apprentissage, permet au robot d'apprendre à saisir sans dataset externe ni modèle pré-entraîné. La seconde brique combine cette politique de saisie avec une politique de lever et de marche apprise séparément, en s'appuyant sur des scores d'interaction main objet pour décider, à chaque instant, quelle politique pilote quelles articulations. Résultat : 93% de réussite en zero shot sur des objets jamais vus, et entre 96 et 100% de réussite pour se relever tout en tenant l'objet saisi. L'intérêt pratique dépasse la simple prouesse technique : la plupart des démonstrations de manipulation mobile chez les humanoïdes empilent des compétences apprises isolément, avec un risque élevé d'interférence entre politiques au moment de les enchaîner. Ici, la généralisation zero shot à des objets inconnus, sans recourir à un modèle vision langage action massif comme Pi-0, GR00T N2 ou Helix, tranche avec la tendance dominante du secteur, qui mise sur l'échelle des données plutôt que sur des curricula développementaux. L'enseignement le plus transférable pour des ingénieurs robotique ou des intégrateurs concerne la composition de compétences : elle ne fonctionne de façon fiable que si chaque politique est entraînée sur le corps entier du robot, y compris des parties a priori inutiles à la tâche, comme garder les doigts actifs pendant l'apprentissage de la marche. Le travail s'inscrit dans la course plus large à la manipulation mobile chez les humanoïdes, un problème que des acteurs commerciaux comme Figure, Agility ou plusieurs plateformes chinoises tentent aussi de résoudre, le plus souvent via des modèles VLA pré-entraînés à grande échelle plutôt que par apprentissage développemental from scratch. L'abstract ne mentionne ni déploiement réel ni acteur français ou européen, et les résultats restent issus d'environnements contrôlés de simulation ou de laboratoire ; reste à voir si l'approche passe l'échelle vers des comportements plus complexes ou vers d'autres plateformes matérielles.

RecherchePaper
1 source
Politique de patch : contrôle incarné efficace par représentations visuelles denses
4arXiv cs.RO 

Politique de patch : contrôle incarné efficace par représentations visuelles denses

Une équipe de recherche en robotique publie Patch Policy, une extension architecturale pour les politiques de contrôle robotique basées sur des transformeurs, décrite dans un article déposé sur arXiv (2607.18236). Le constat de départ est que les politiques robotiques actuelles compressent chaque observation visuelle en un unique token global, ou entraînent leur backbone visuel à partir de zéro, ce qui sacrifie soit le détail spatial fin, soit les bénéfices du pré-entraînement visuel à grande échelle sur des Vision Transformers (ViT). Patch Policy résout ce compromis grâce à un masque d'attention block-causal qui préserve la causalité temporelle des politiques standards tout en permettant au modèle d'exploiter de nombreux tokens de patchs denses par observation, en complément des autres informations d'état. Testée sur quatre suites d'environnements simulés et trois suites en conditions réelles, la méthode affiche une amélioration relative de 40% par rapport aux politiques utilisant des représentations globales poolées de pointe, et dépasse de 18% les performances d'OpenVLA-OFT affiné, tout en ne mobilisant qu'environ 0,7% de ses paramètres. Ce résultat s'attaque directement à un point de friction connu du secteur : les grands modèles vision-langage-action (VLA) exploitent bien des features denses, mais héritent du coût de calcul complet d'un VLM à plusieurs milliards de paramètres, rendant leur usage difficile pour du contrôle réactif à haute fréquence. En démontrant qu'une politique légère peut surpasser un VLA lourd fine-tuné avec une fraction infime des paramètres, Patch Policy contredit l'hypothèse selon laquelle la performance en contrôle embarqué exige nécessairement des backbones massifs. Pour les intégrateurs et équipes R&D robotique, cela ouvre une voie pour exploiter les progrès continus de l'apprentissage de représentations visuelles sans les coûts d'inférence et d'entraînement associés aux VLA géants. Ce travail s'inscrit dans la lignée des efforts récents pour rapprocher robotique et vision par transformeurs pré-entraînés, dans un paysage dominé par des modèles VLA de référence comme OpenVLA, Pi-0 ou GR00T N2. Contrairement à ces architectures conçues pour la généralisation à grande échelle, Patch Policy vise l'efficacité et la vitesse d'inférence, positionnant l'approche comme un pipeline pratique plutôt qu'un nouveau foundation model. Les auteurs mettent à disposition des vidéos de démonstration sur patch-policy.github.io, sans toutefois préciser de calendrier de déploiement industriel ou de partenariat commercial à ce stade.

RecherchePaper
1 source