Aller au contenu principal
RecherchearXiv cs.RO 

ScaleMPA : repenser l'accélération de RRT* à grande échelle avec une représentation native en grille

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ScaleMPA est un accélérateur matériel dédié à la planification de mouvement en robotique, décrit dans un preprint mis en ligne sur arXiv sous la référence 2609.24497v1 (soumission classée "new", ce qui situe sa publication autour de septembre 2026). Le système repense l'algorithme RRT* (Rapidly-exploring Random Tree Star), largement utilisé pour calculer des trajectoires sans collision dans des environnements complexes et à haute dimension. Alors que les accélérateurs précédents organisaient l'espace de recherche autour d'une structure arborescente hiérarchique, ScaleMPA adopte une représentation "grid-native" : un accès direct à une grille remplace la traversée d'arbre, ce qui raccourcit le chemin critique du planificateur. Pour que cette approche reste viable dans des espaces à haute dimension et à faible densité de points, les auteurs y ajoutent un moteur de recherche en grille multi-résolution et un système de mémoire de type "hash-grid". Gravé en technologie CMOS 28 nanomètres, le circuit atteint une latence de planification de l'ordre de la milliseconde, avec une accélération revendiquée de 4,7 à 44,4 fois par rapport aux meilleurs accélérateurs de planification de mouvement publiés jusqu'ici.

Pour les concepteurs de robots manipulateurs, de bras à nombreux degrés de liberté ou de robots mobiles autonomes, la planification de trajectoire en temps réel reste un goulot d'étranglement classique : les implémentations logicielles de RRT* peinent à tenir les contraintes de cadence dans des environnements encombrés, et même les accélérateurs matériels existants conservaient une complexité superlinéaire de bout en bout à cause des dépendances structurelles imposées par l'arbre. En supprimant cette dépendance, ScaleMPA vise à débloquer un parallélisme plus fin, ce qui pourrait profiter à des applications embarquées où la puissance de calcul et l'énergie sont contraintes. Ces gains restent toutefois auto-déclarés par les auteurs, sans détail public sur la méthodologie de comparaison ni sur les charges de travail testées, ce qui invite à la prudence avant toute extrapolation vers un produit industriel.

Ce travail s'inscrit dans une tendance de fond vers des puces dédiées à des tâches robotiques spécifiques (perception, SLAM, planification), les architectures généralistes CPU/GPU étant jugées insuffisantes pour du RRT* temps réel à grande échelle. L'abstract ne précise ni les auteurs, ni le laboratoire ou l'entreprise à l'origine du projet, ni les accélérateurs concurrents utilisés comme référence de comparaison, ni un calendrier de déploiement industriel. Il s'agit d'une contribution de recherche architecturale publiée en preprint, non encore validée par relecture par les pairs, sans pilote commercial ni partenaire annoncé à ce stade. Aucun acteur français ou européen du secteur robotique n'apparaît dans cette publication.

Dans nos dossiers

À lire aussi

Représentation visuelle 3D consciente de la dynamique pour l'apprentissage robotique à grande échelle
1arXiv cs.RO 

Représentation visuelle 3D consciente de la dynamique pour l'apprentissage robotique à grande échelle

Un article arXiv (identifiant 2512.00074, quatrième révision, type "replace") présente AFRO, un framework d'apprentissage auto-supervisé de représentations visuelles 3D destiné à la robotique. Contrairement aux méthodes de pré-entraînement 3D classiques, performantes en reconnaissance et segmentation d'images mais souvent inefficaces pour la manipulation robotique, AFRO n'utilise ni supervision par action ni reconstruction géométrique explicite du monde observé. Le système traite la prédiction d'état comme un processus de diffusion génératif et apprend simultanément la dynamique directe et inverse dans un espace latent partagé, afin de capturer la structure causale des transitions état-action-état. Pour éviter les fuites d'information entre représentation visuelle et apprentissage de l'action, les auteurs introduisent une différenciation de caractéristiques (feature differencing) et une supervision de cohérence inverse. Combiné à une politique de type Diffusion Policy, AFRO est testé sur 16 tâches de manipulation en simulation et 4 tâches en conditions réelles, avec des gains substantiels de taux de réussite face aux approches de pré-entraînement existantes. Une page projet dédiée (kolakivy.github.io/AFRO) accompagne la publication. Ce travail cible un point de friction bien identifié dans la recherche en apprentissage robotique: les représentations visuelles pré-entraînées sur des tâches de vision classique ne capturent pas la dynamique physique nécessaire à la manipulation fine, et la reconstruction géométrique explicite, coûteuse en calcul, s'avère largement redondante pour cet usage. En démontrant qu'un pré-entraînement centré sur la dynamique état-action-état, sans supervision par action ni reconstruction, surpasse les approches existantes et passe mieux à l'échelle avec le volume de données et la complexité des tâches, AFRO apporte un argument concret dans le débat sur la conception des architectures de pré-entraînement pour les politiques robotiques, notamment celles reposant sur des modèles de diffusion. L'article s'inscrit dans la lignée des travaux sur les représentations 3D auto-supervisées pour la robotique, un axe de recherche actif face aux limites constatées des méthodes héritées de la vision par ordinateur classique. La publication d'une quatrième révision suggère un article retravaillé après retours de la communauté, sans qu'aucun calendrier de déploiement industriel ne soit mentionné: il s'agit à ce stade d'une contribution de recherche évaluée en simulation et sur un nombre restreint de tâches réelles, non d'un produit ou d'un pilote commercial.

RecherchePaper
1 source
2arXiv cs.RO 

Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes

Une équipe de recherche publie sur arXiv (référence 2609.24682) une méthode qui ajoute un terme d'alignement de représentations à l'entraînement classique des modèles Vision-Language-Action (VLA), ces réseaux qui associent perception et langage à des actions robotiques. Un world model figé est passé une seule fois sur les images d'entraînement, ses caractéristiques internes sont mises en cache, puis le modèle VLA « étudiant » apprend à s'aligner sur ce cache pendant l'entraînement. Le world model n'est jamais chargé lors du déploiement et le module de projection est jeté après l'entraînement, si bien que la politique finale reste identique au modèle VLA non distillé, tant en taille qu'en calcul. Résultat mesuré : un étudiant de 0,8 milliard de paramètres tourne en 32 millisecondes et consomme 1,86 Go de mémoire sur une carte grand public RTX 5090, atteint 97,9 % de réussite sur le benchmark de manipulation LIBERO, et progresse de 48,2 % à 50,5 % sur RoboCasa-GR1, un banc d'essai de manipulation humanoïde en simulation. Le gain se vérifie aussi sur du matériel réel, sur une plateforme à bras unique et sur une plateforme bimanuelle. L'intérêt pour l'industrie robotique tient à la séparation qu'établit ce travail entre deux familles de modèles jusque-là difficiles à concilier : les VLA, rapides mais dépourvus d'objectif qui tienne compte de la réaction du monde à une action, et les world models, physiquement mieux fondés mais trop lents pour piloter un robot en temps réel puisqu'ils doivent projeter le futur seconde par seconde. En montrant que la connaissance physique d'un world model peut être injectée dans une politique légère sans alourdir le calcul au moment de l'exécution, l'étude suggère qu'on peut améliorer la robustesse des VLA sans ajouter de données, de paramètres ni de calcul supplémentaire au déploiement, un point qui intéresse directement les intégrateurs contraints par la latence et la puissance embarquée. Ce résultat s'inscrit dans un débat actuel de la recherche en robotique entre approches VLA et approches par world models, sans qu'aucun partenaire industriel ni déploiement commercial ne soit mentionné à ce stade. La méthode a été testée en faisant varier la taille de l'étudiant, l'architecture de base, la couche d'alignement et le world model utilisé comme enseignant, un signal que l'effet observé relève d'un principe général plutôt que d'un couplage fragile entre deux réseaux précis. Les auteurs publient les détails sur une page projet dédiée, mais le travail reste à ce jour un résultat de recherche évalué en simulation et en laboratoire, sans calendrier annoncé vers une industrialisation.

RecherchePaper
1 source
De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
3arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle
4arXiv cs.RO 

ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle

Les modèles Vision-Language-Action (VLA), qui pilotent la nouvelle génération de bras robotiques et d'humanoïdes, souffrent d'un défaut connu quand on y ajoute du tactile : le signal visuel, beaucoup plus riche en données, écrase systématiquement les informations de contact, un phénomène que les chercheurs appellent "l'effondrement de modalité". Une équipe propose ResTacVLA, une architecture publiée le 3 juillet 2026 sur arXiv (2607.03387), qui s'inspire du codage prédictif, un mécanisme neuronal par lequel le cerveau ignore ce qui est prévisible pour se concentrer sur l'inattendu. Au lieu d'injecter les données tactiles brutes dans le modèle, ResTacVLA calcule une "représentation tactile résiduelle" : l'écart entre ce que la vision laissait prévoir et ce que le capteur de contact ressent réellement. Ce résidu est ensuite compressé via un goulot d'étranglement à quantification vectorielle (VQ) en "primitives de contact latentes", puis injecté de façon adaptative dans le modèle, avec un gain renforcé précisément lorsque la vision devient incertaine ou obstruée. L'enjeu dépasse la prouesse technique. Pour les intégrateurs qui visent des tâches à fort contact physique, insertion de précision, assemblage, manipulation d'objets déformables ou glissants, le tactile est le signal qui distingue une démonstration en laboratoire d'un geste fiable en production. Or la plupart des VLA actuels traitent le tactile comme un flux secondaire noyé par la caméra. En démontrant qu'un filtrage inspiré de la neuroscience permet de rendre ce signal rare mais décisif exploitable sans le diluer, les auteurs répondent directement à l'un des angles morts récurrents des architectures multimodales pour la robotique manipulatrice, où l'ajout de capteurs supplémentaires improve rarement les performances sans repenser la fusion des modalités. Le travail reste à ce stade un article de recherche, sans affiliation industrielle citée dans le résumé ni déploiement annoncé : il s'agit d'un préprint arXiv, testé sur un ensemble de tâches de manipulation en contact selon les auteurs, avec une page de projet dédiée mais pas encore de publication en conférence confirmée. Il s'inscrit dans une dynamique plus large de recherche sur l'intégration tactile en apprentissage robotique, un axe que plusieurs laboratoires explorent en parallèle pour combler l'écart entre robots qui voient et robots qui, littéralement, sentent ce qu'ils touchent.

RecherchePaper
1 source