Aller au contenu principal
La puce 6 mW du MIT permet aux mini-drones de voir et cartographier leur environnement en temps réel
RechercheInteresting Engineering 

La puce 6 mW du MIT permet aux mini-drones de voir et cartographier leur environnement en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du MIT ont présenté à l'IEEE VLSI Symposium un système-sur-puce baptisé Gleanmer, capable de construire des cartes 3D détaillées de l'environnement en temps réel avec une consommation d'environ 6 milliwatts. La puce cible les plateformes à très faible autonomie énergétique : micro-drones, robots embarqués, et potentiellement casques de réalité augmentée légers. Ses applications directes incluent la navigation en milieux confinés, systèmes de ventilation industriels, entrepôts, tunnels, où l'évitement d'obstacles est critique et où embarquer un GPU classique est hors de question. L'équipe, conduite par Vivienne Sze (professeure de génie électrique et informatique au MIT) et les co-premiers auteurs Peter Zhi Xuan Li et Zih-Sing Fu, a couplé le silicium à un algorithme de cartographie maison nommé GMMap. Plutôt que de recourir aux représentations voxel classiques (des millions de petits cubes), GMMap modélise l'espace avec des ellipsoïdes gaussiens flexibles qui encodent les surfaces courbes et les espaces ouverts en consommant nettement moins de mémoire. L'algorithme traite chaque image de profondeur en un seul passage et peut fusionner les gaussiennes redondantes, celles générées quand le robot observe le même objet sous plusieurs angles, sans avoir à relire les données brutes. Résultat : seuls quelques pixels doivent résider en mémoire à tout instant, et la majeure partie des données actives tient dans la SRAM on-chip rapide, évitant les accès coûteux à une mémoire externe.

Ce niveau de frugalité est significatif pour le secteur. Gleanmer consomme environ 2,5 % de l'énergie exigée par la meilleure puce de cartographie existante selon les benchmarks publiés par l'équipe, et réduit la consommation de la planification de trajectoire sans collision à environ 20 % de la référence habituelle. Pour les intégrateurs qui travaillent sur des plateformes à budget énergétique serré (nano-drones de 50 g, robots d'inspection en tube, wearables industriels), la différence entre 250 mW et 6 mW n'est pas marginale : elle conditionne la durée de mission et le dimensionnement de la batterie. La puce a également démontré sa capacité à reconstruire des obstacles et espaces libres en direct à partir du flux vidéo d'une caméra iPhone, ce qui ouvre une voie vers des prototypes rapides sans matériel dédié.

Le MIT n'est pas seul sur ce terrain. Intel Labs, Qualcomm et plusieurs startups spécialisées en edge AI (Syntiant, Perceive) travaillent à réduire l'empreinte des pipelines de perception embarquée. Mais l'angle co-design algorithme-hardware du groupe de Vivienne Sze, déjà connu pour des travaux similaires sur les accélérateurs de réseaux de neurones, distingue Gleanmer d'une approche purement matérielle. Les chercheurs envisagent de rapprocher davantage les ressources de calcul des capteurs pour gagner encore en efficacité lors des prochaines itérations, et explorent si les représentations gaussiennes pourraient aussi accélérer le traitement de plans techniques et de schémas complexes, au-delà du seul domaine robotique. Aucun calendrier de commercialisation ni partenaire industriel n'ont été annoncés à ce stade.

À lire aussi

Capteur cutané conforme pour la cartographie en temps réel de la forme
1arXiv cs.RO 

Capteur cutané conforme pour la cartographie en temps réel de la forme

Des chercheurs ont présenté sur arXiv (preprint 2605.01170, mai 2025) un capteur souple et conforme capable de reconstruire en temps réel la déformation tridimensionnelle d'une surface flexible, sans recourir à la vision. Le dispositif intègre un réseau 2D de jauges de contrainte imprimées à base d'indium-gallium eutectique oxydé (o-EGaIn), emboîtées en miroir dans un film élastomère. Un réseau de 5x5 capteurs espacés de 12 mm mesure les contraintes hors axe neutre, et un modèle d'observation informé par la mécanique des matériaux, couplé à une routine d'optimisation rapide, estime simultanément la courbure locale, l'élongation, le décalage et l'orientation. Le système atteint une erreur moyenne de reconstruction de surface de 0,62 mm avec une latence de 100 ms, testée sur des scénarios combinant étirement, flexion et indentation. Les démonstrations incluent le suivi de gestes de la paume, l'indentation par un doigt, et la déformation d'un ballon sous contact. Ce résultat est notable parce qu'il adresse une limitation structurelle des approches visuelles existantes : la nécessité d'une ligne de visée et d'une instrumentation complexe, incompatibles avec les environnements occultés ou à espace contraint, notamment la chirurgie mini-invasive, les prothèses ou les doigts de préhension robotique. La précision sub-millimétrique à 10 Hz ouvre un espace d'utilisation pour le suivi épidermique du mouvement, l'interaction haptique à retour de forme, et la surveillance peropératoire en temps réel, sans nécessiter de marqueurs externes ni de caméras. Il s'agit cependant d'un preprint académique : aucun produit n'est annoncé ni commercialisé. Les capteurs à base d'EGaIn liquide-métal sont étudiés depuis une décennie pour leur déformabilité et leur conductivité, mais la reconstruction 3D continue à partir de mesures de contraintes distribuées reste un problème ouvert. Les approches concurrentes incluent les capteurs à fibre optique (FBG), plus précis mais rigides et coûteux, et les peaux tactiles matricielles à base de matériaux piézorésistifs ou capacitifs. Ce travail se distingue par la combinaison d'une fabrication par impression, d'un modèle mécanique intégré et d'une latence compatible avec le contrôle en boucle fermée. Les prochaines étapes naturelles sont l'intégration sur un effecteur robotique souple ou un instrument chirurgical, et la tenue à l'autoclave pour la stérilisation.

RecherchePaper
1 source
Une nouvelle puce pourrait aider les petits robots à traverser des environnements complexes
2MIT News Robotics 

Une nouvelle puce pourrait aider les petits robots à traverser des environnements complexes

Des chercheurs du MIT ont conçu un système-sur-puce baptisé Gleanmer, capable de générer des cartes 3D en temps réel à partir d'un flux de caméra de profondeur, avec une consommation d'environ 6 milliwatts, soit l'équivalent d'une LED. Cette performance s'obtient grâce à une co-conception algorithme-matériel : l'équipe, menée par la professeure Vivienne Sze (EECS/RLE) et le professeur Sertac Karaman (aéronautique, directeur du LIDS), a couplé leur algorithme de cartographie GMMap à un accélérateur matériel dédié. Les co-premiers auteurs Zih-Sing Fu et Peter Zhi Xuan Li ont présenté ces travaux à l'IEEE Very Large-Scale Integrated Circuits Symposium. L'application cible annoncée : de petits UAVs à batterie limitée, comme ceux qui pourraient inspecter des conduits HVAC industriels pour détecter des fuites de gaz en naviguant dans des espaces confinés avec évitement d'obstacles. La différence technique réside dans la représentation géométrique. Là où les approches classiques modélisent l'espace en voxels, des cubes 3D qui demandent de charger et retraiter chaque image de profondeur plusieurs fois, Gleanmer utilise des gaussiennes, des ellipsoïdes dont la taille, la forme et l'orientation s'adaptent librement à la géométrie des objets. Un seul ellipsoïde allongé peut remplacer des dizaines de voxels pour représenter une surface courbe, ce qui réduit drastiquement l'empreinte mémoire. L'innovation clé est une technique de génération de gaussiennes en un seul passage sur l'image de profondeur : une fois traitée, l'image est effacée et n'a pas besoin d'être stockée. Résultat : des cartes denses incluant obstacles et espace libre, suffisantes pour planifier un chemin sans collision, générées sans le GPU ni la mémoire vive que requièrent habituellement les pipelines de cartographie dense. Pour un intégrateur robotique, cela signifie qu'il devient envisageable d'embarquer de la navigation autonome sur des plateformes où la contrainte énergétique était jusqu'ici rédhibitoire. Ce travail s'inscrit dans un effort plus large de miniaturisation des capacités de cartographie et de localisation simultanées (SLAM). Les systèmes embarqués actuels capables de cartographie 3D dense en temps réel, qu'il s'agisse de solutions comme Intel RealSense couplées à des SBC, ou des implémentations GPU embarquées type Nvidia Jetson, consomment plusieurs watts à quelques dizaines de watts, plusieurs ordres de grandeur au-dessus des 6 mW de Gleanmer. Les auteurs mentionnent aussi un second débouché : les casques de réalité augmentée légers, pour des applications médicales ou de maintenance industrielle, où l'autonomie de la batterie conditionne l'usage prolongé. Le composant n'est pour l'instant qu'un prototype de recherche présenté en symposium ; aucun partenariat industriel ni calendrier de productisation n'a été annoncé. Les prochaines étapes naturelles seraient une validation sur plateforme réelle en vol, et une intégration dans une chaîne SLAM complète incluant localisation, pas seulement cartographie.

RecherchePaper
1 source
PRISM : cartographie multimodale de terrain pour la navigation d'un rover en environnement non structuré
3arXiv cs.RO 

PRISM : cartographie multimodale de terrain pour la navigation d'un rover en environnement non structuré

Des chercheurs présentent PRISM, un système de perception multimodale destiné à la cartographie de terrain pour la navigation de rovers en environnements non structurés, dans un article publié sur arXiv (2607.16366v1). Le système s'appuie sur une suite de capteurs personnalisée capturant simultanément des images RGB, de profondeur et thermiques alignées, format noté RGB-D-T. Son cœur algorithmique, baptisé OmniUnet, est un réseau basé sur les vision transformers, conçu spécifiquement pour la segmentation sémantique multimodale de terrain. Les auteurs ont validé leur approche sur deux jeux de données inédits, BASEPROD et LAENTIEC, annotés pour l'occasion, puis testé le système lors d'expériences de terrain réelles. Point notable, PRISM tourne sur un calculateur embarqué aux ressources limitées et génère des cartes de franchissabilité directement exploitables par le sous-système de guidage, navigation et contrôle (GNC) du rover. L'intérêt principal de ces travaux réside dans l'ajout de l'imagerie thermique aux capteurs optiques et de profondeur classiques, une combinaison qui améliore la différenciation des types de terrain, notamment dans des conditions où la seule vision RGB-D peine (faible luminosité, ombres, poussière, végétation ambiguë). Pour l'industrie de la robotique de terrain, planétaire ou tout-terrain, cela répond à un vrai point de friction : la fiabilité de la cartographie de franchissabilité conditionne directement la sécurité de navigation autonome sur pentes raides ou sols rocheux. Le fait que le pipeline complet, capteurs, réseau de segmentation et génération de carte, fonctionne sur du matériel embarqué contraint constitue une démonstration concrète de faisabilité, plutôt qu'une simple preuve de concept en simulation, ce qui distingue ce travail d'approches purement académiques limitées au laboratoire. Ce papier s'inscrit dans une tendance plus large de fusion de capteurs pour la perception robotique en extérieur, où les systèmes purement RGB-D montrent des limites face à la diversité des textures et éclairages du terrain naturel. Contrairement à des annonces de robots humanoïdes très médiatisées, il s'agit ici d'une contribution académique (preprint arXiv, non encore relu par les pairs) centrée sur les rovers et véhicules autonomes tout-terrain, un segment où les acteurs de référence restent les programmes d'exploration planétaire et la robotique de défense ou agricole. Les prochaines étapes attendues concernent l'extension des jeux de données et des essais terrain supplémentaires pour confirmer la robustesse du système dans des conditions plus variées.

RecherchePaper
1 source
MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques
4arXiv cs.RO 

MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques

Une équipe de recherche publie en préimpression sur arXiv (2606.29237) une méthode baptisée MoPe (Motion Permanence) qui vise à corriger un défaut structurel des systèmes de cartographie par Gaussian Splatting monoculaire en environnements dynamiques. Le problème ciblé est précis : les approches actuelles de SLAM avec Gaussian Splatting traitent chaque image de manière indépendante pour décider si une région est dynamique ou statique. Résultat, quand un piéton ralentit, s'arrête ou réapparaît après une occultation, la trame courante semble statique et le système intègre ce contenu mobile dans la carte permanente, générant des artefacts de type "fantôme" (ghosting). MoPe repose sur un principe qu'il nomme Motion Permanence : l'identité dynamique d'un objet doit persister dans le temps plutôt qu'être réévaluée à chaque image. Concrètement, la méthode propage le posterior dynamique historique via un warping géométriquement cohérent en SE(3), puis le fusionne avec les observations de la trame courante par mises à jour bayésiennes en log-odds bornées. Ce posterior persistant pilote le suivi, la cartographie, l'insertion sélective de gaussiennes et un post-nettoyage par gaussienne individuelle. Les auteurs évaluent MoPe sur trois benchmarks publics (Wild-SLAM, Bonn, TUM) et rapportent des gains de robustesse en tracking et une réduction des ghosting, avec les améliorations les plus marquées sur les séquences à humains dynamiques. L'enjeu pour les intégrateurs et les équipes de navigation autonome est direct : un SLAM qui "hallucine" des obstacles statiques là où un piéton s'était simplement immobilisé dégrade la planification de trajectoire et la prise de décision en aval. En introduisant une mémoire temporelle au niveau de la représentation de scène elle-même, MoPe traite le problème à la racine plutôt qu'en post-filtrage. La méthode prouve qu'un filtre d'incertitude à mémoire, relativement léger à implémenter, suffit à franchir une partie du fossé entre les démos en laboratoire et les déploiements réels en environnements peuplés, sans recourir à une caméra stéréo ou à un LiDAR. Le Gaussian Splatting appliqué au SLAM est un domaine en effervescence depuis 2023, porté par des travaux comme SplaTAM, MonoGS et GaussianSLAM, qui ont démontré la faisabilité d'une cartographie haute-fidélité en temps réel à partir d'une seule caméra. MoPe s'inscrit dans la vague des méthodes qui cherchent à rendre ces représentations exploitables hors des environnements contrôlés, aux côtés d'approches concurrentes comme RobustSplat ou les variantes uncertainty-aware de MonoGS. Il s'agit pour l'instant d'une préimpression non revue par les pairs, sans code publié ni validation sur robot réel annoncée, ce qui invite à tempérer les conclusions : les gains mesurés sur séquences vidéo ne garantissent pas un comportement équivalent sur plateforme embarquée avec contraintes temps-réel. Les prochaines étapes naturelles seront l'intégration dans un pipeline de navigation complet et la validation sur datasets intérieurs type HM3D ou ScanNet avec scènes plus peuplées.

RecherchePaper
1 source