{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T00:06:37Z","timestamp":1781222797411,"version":"3.54.1"},"reference-count":73,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T00:00:00Z","timestamp":1778803200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc\/4.0\/"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Systems Architecture"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.sysarc.2026.103832","type":"journal-article","created":{"date-parts":[[2026,5,12]],"date-time":"2026-05-12T16:19:00Z","timestamp":1778602740000},"page":"103832","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["InterStellar 2.0: Fine-grained stream\u2013guided HW\/SW co-design for multi-channel DRAM performance steering"],"prefix":"10.1016","volume":"177","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6391-9960","authenticated-orcid":false,"given":"Abdelrhman Mohamed","family":"Abotaleb","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1272-4589","authenticated-orcid":false,"given":"Maziar","family":"Goudarzi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-3294-6198","authenticated-orcid":false,"given":"Tomasz","family":"Czajkowski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-6000-8997","authenticated-orcid":false,"given":"Reza","family":"Azimi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5926-5861","authenticated-orcid":false,"given":"Mohamed","family":"Hassan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.sysarc.2026.103832_b1","doi-asserted-by":"crossref","unstructured":"A. Bakshi, J.-L. Gaudiot, W.-Y. Lin, M. Makhija, V.K. Prasanna, W. Ro, C. Shin, Memory Latency: to tolerate or to reduce, in: 12th Symposium on Computer Architecture and High Performance Computing, SBAC-PAD, 2000.","DOI":"10.5753\/sbac-pad.2000.41199"},{"key":"10.1016\/j.sysarc.2026.103832_b2","unstructured":"C. Carvalho, The gap between processor and memory speeds, in: IEEE International Conference on Control and Automation, ICCA, 2002."},{"key":"10.1016\/j.sysarc.2026.103832_b3","series-title":"IEEE International Symposium on Performance Analysis of Systems and Software","article-title":"DRAM bandwidth and latency stacks: Visualizing DRAM bottlenecks","author":"Eyerman","year":"2022"},{"key":"10.1016\/j.sysarc.2026.103832_b4","series-title":"7th International Symposium on Computing and Networking","article-title":"Data-transfer-bottleneck-less architecture for FPGA-based quantum annealing simulation","author":"Liu","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103832_b5","series-title":"ACM\/IEEE 19th International Symposium on High-Performance Computer Architecture","article-title":"Tiered-latency DRAM: A low latency and low cost DRAM architecture","author":"Lee","year":"2013"},{"key":"10.1016\/j.sysarc.2026.103832_b6","article-title":"Research problems and opportunities in memory systems","author":"Mutlu","year":"2014","journal-title":"Supercomput. Front. Innov."},{"key":"10.1016\/j.sysarc.2026.103832_b7","series-title":"ACM\/IEEE 47th Annual International Symposium on Computer Architecture","article-title":"CLR-DRAM: A low-cost DRAM architecture enabling dynamic capacity-latency trade-off","author":"Luo","year":"2020"},{"key":"10.1016\/j.sysarc.2026.103832_b8","series-title":"IEEE 46th Annual International Symposium on Computer Architecture","article-title":"CROW: A low-cost substrate for improving DRAM performance, energy efficiency, and reliability","author":"Hassan","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103832_b9","series-title":"JESD79-4A: DDR4 SDRAM","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b10","series-title":"DDR5 SDRAM (JESD79-5c.01_v1.31)","author":"JEDEC Solid State Technology Association","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103832_b11","series-title":"JESD79-3D: DDR3 SDRAM","year":"2012"},{"key":"10.1016\/j.sysarc.2026.103832_b12","series-title":"Why DDR5 matters for servers: Is it worth the switch?","author":"ATP Electronics","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103832_b13","series-title":"Scaling DRAM technology to meet future demands","author":"Rambus Inc","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103832_b14","series-title":"High-bandwidth memory (HBM) overview","author":"Emergent Mind","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103832_b15","series-title":"DDR5 memory standard: An introduction to the next generation of dram module technology","author":"Technology","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103832_b16","series-title":"Memory controllers: The brain behind RAM management","author":"Bhiksha","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103832_b17","doi-asserted-by":"crossref","DOI":"10.1186\/s40537-019-0215-2","article-title":"Evaluation of distributed stream processing frameworks for IoT applications in smart cities","volume":"6","author":"Nasiri","year":"2019","journal-title":"J. Big Data"},{"key":"10.1016\/j.sysarc.2026.103832_b18","series-title":"ACM\/IEEE 46th International Symposium on Computer Architecture","article-title":"Stream-based memory access specialization for general purpose processors","author":"Wang","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103832_b19","series-title":"ACM\/IEEE 48th Annual International Symposium on Computer Architecture","article-title":"Unlimited vector extension with data streaming support","author":"Domingos","year":"2021"},{"issue":"2","key":"10.1016\/j.sysarc.2026.103832_b20","article-title":"Stream semantic registers: A lightweight risc-v isa extension achieving full compute utilization in single-issue cores","volume":"70","author":"Schuiki","year":"2020","journal-title":"IEEE Trans. Comput. (TC)"},{"key":"10.1016\/j.sysarc.2026.103832_b21","series-title":"ACM\/IEEE International Symposium on High-Performance Computer Architecture","article-title":"Stream floating: Enabling proactive and decentralized cache optimizations","author":"Wang","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b22","series-title":"International Symposium on High-Performance Computer Architecture","article-title":"Prodigy: Improving the memory latency of data-indirect irregular workloads using hardware-software co-design","author":"Talati","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b23","series-title":"IEEE International Symposium on High-Performance Computer Architecture","article-title":"Near-stream computing: General and transparent near-cache acceleration","author":"Wang","year":"2022"},{"key":"10.1016\/j.sysarc.2026.103832_b24","series-title":"28th ACM International Conference on Architectural Support for Programming Languages and Operating Systems","article-title":"Infinity stream: Portable and programmer-friendly in-\/near-memory fusion","author":"Wang","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103832_b25","article-title":"Optimization and performance modeling of stencil computations on modern microprocessors","author":"Datta","year":"2009","journal-title":"Soc. Ind. Appl. Math. (SIAM)"},{"key":"10.1016\/j.sysarc.2026.103832_b26","series-title":"2020 IEEE International Parallel and Distributed Processing Symposium Workshops","article-title":"Communication avoiding 2d stencil implementations over parsec task-based runtime","author":"Pei","year":"2020"},{"key":"10.1016\/j.sysarc.2026.103832_b27","series-title":"Proceedings of the 53rd International Conference on Parallel Processing","first-page":"679","article-title":"Optimizing stencil computation on multi-core DSPs","author":"Zhu","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103832_b28","series-title":"ACM\/IEEE 43rd Annual International Symposium on Microarchitecture","article-title":"Thread cluster memory scheduling: Exploiting differences in memory access behavior","author":"Kim","year":"2010"},{"key":"10.1016\/j.sysarc.2026.103832_b29","series-title":"IEEE 32nd International Conference on Computer Design","article-title":"The blacklisting memory scheduler: Achieving high performance and fairness at low cost","author":"Subramanian","year":"2014"},{"issue":"1","key":"10.1016\/j.sysarc.2026.103832_b30","doi-asserted-by":"crossref","DOI":"10.1109\/MM.2009.12","article-title":"Parallelism-aware batch scheduling enabling high-performance, fair shared memory controllers","volume":"29","author":"Mutlu","year":"2009","journal-title":"IEEE Micro"},{"key":"10.1016\/j.sysarc.2026.103832_b31","series-title":"ACM\/IEEE 16th International Symposium on High-Performance Computer Architecture","article-title":"ATLAS: A scalable and high-performance scheduling algorithm for multiple memory controllers","author":"Kim","year":"2010"},{"key":"10.1016\/j.sysarc.2026.103832_b32","series-title":"ACM\/IEEE 19th International Symposium on High Performance Computer Architecture","article-title":"MISE: Providing performance predictability and improving fairness in shared main memory systems","author":"Subramanian","year":"2013"},{"key":"10.1016\/j.sysarc.2026.103832_b33","doi-asserted-by":"crossref","DOI":"10.1145\/2847255","article-title":"DASH: Deadline-aware high-performance memory scheduler for heterogeneous systems with hardware accelerators","author":"Usui","year":"2016","journal-title":"ACM Trans. Archit. Code Optim. (TACO)"},{"key":"10.1016\/j.sysarc.2026.103832_b34","series-title":"ACM\/IEEE International Symposium on Computer Architecture","article-title":"Self-optimizing memory controllers: A reinforcement learning approach","author":"Ipek","year":"2008"},{"key":"10.1016\/j.sysarc.2026.103832_b35","series-title":"ACM\/IEEE 45th Annual International Symposium on Computer Architecture","article-title":"A case for richer cross-layer abstractions: Bridging the semantic gap with expressive memory","author":"Vijaykumar","year":"2018"},{"key":"10.1016\/j.sysarc.2026.103832_b36","doi-asserted-by":"crossref","DOI":"10.1145\/3505250","article-title":"MetaSys: A practical open-source metadata management system to implement and evaluate cross-layer optimizations","author":"Vijaykumar","year":"2022","journal-title":"ACM Trans. Archit. Code Optim. (TACO)"},{"key":"10.1016\/j.sysarc.2026.103832_b37","doi-asserted-by":"crossref","unstructured":"A. Abotaleb, M. Goudarzi, T. Czajkowski, R. Azimi, M. Hassan, Stream-Aware Intelligent Memory Controller through HW\/SW Co-Design, in: Proceedings of the International Symposium on Memory Systems, MEMSYS \u201925, (16) NY, USA, 2025, pp. 121\u2013136, http:\/\/dx.doi.org\/10.1145\/3767110.3767122, MEMSYS \u201925.","DOI":"10.1145\/3767110.3767122"},{"key":"10.1016\/j.sysarc.2026.103832_b38","series-title":"PolyBench\/C 4.2.1","author":"Pouchet","year":"2016"},{"key":"10.1016\/j.sysarc.2026.103832_b39","series-title":"IEEE International Symposium on Workload Characterization","article-title":"Rodinia: A benchmark suite for heterogeneous computing","author":"Che","year":"2009"},{"issue":"01","key":"10.1016\/j.sysarc.2026.103832_b40","doi-asserted-by":"crossref","DOI":"10.1093\/nsr\/nwv084","article-title":"A new metric for ranking high performance computing systems","volume":"3","author":"Dongarra","year":"2016","journal-title":"Natl. Sci. Rev."},{"key":"10.1016\/j.sysarc.2026.103832_b41","series-title":"Parboil: A revised benchmark suite for scientific and commercial throughput computing","author":"Stratton","year":"2012"},{"key":"10.1016\/j.sysarc.2026.103832_b42","series-title":"Adaptive Page Management","author":"Dodd","year":"2006"},{"key":"10.1016\/j.sysarc.2026.103832_b43","series-title":"Everything you always wanted to know about SDRAM (memory): But were afraid to ask","author":"Gill","year":"2010"},{"key":"10.1016\/j.sysarc.2026.103832_b44","series-title":"Intel xeon processor X5650 12M cache 2.66 GHz 6.40 GTs intel QPI product specifications","year":"2010"},{"key":"10.1016\/j.sysarc.2026.103832_b45","series-title":"ACM\/IEEE 21st Real-Time and Embedded Technology and Applications Symposium","article-title":"Reverse-engineering embedded memory controllers through latency-based analysis","author":"Hassan","year":"2015"},{"issue":"5","key":"10.1016\/j.sysarc.2026.103832_b46","article-title":"Exposing implementation details of embedded DRAM memory controllers through latency-based analysis","volume":"17","author":"Hassan","year":"2018","journal-title":"ACM Trans. Embed. Comput. Syst. (TECS)"},{"key":"10.1016\/j.sysarc.2026.103832_b47","doi-asserted-by":"crossref","unstructured":"M. Ghasempour, A. Jaleel, J.D. Garside, M. Luj\u00e1n, HAPPY: Hybrid Address-Based Page Policy in DRAMs, in: ACM\/IEEE 2nd International Symposium on Memory Systems, MEMSYS \u201916, NY, USA, ISBN: 9781450343053, 2016, http:\/\/dx.doi.org\/10.1145\/2989081.2989101, MEMSYS \u201916.","DOI":"10.1145\/2989081.2989101"},{"key":"10.1016\/j.sysarc.2026.103832_b48","series-title":"Proceedings of the 46th International Symposium on Computer Architecture","article-title":"Stream-based memory access specialization for general purpose processors","author":"Wang","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103832_b49","series-title":"ACM\/IEEE 48th Annual International Symposium on Microarchitecture","article-title":"IMP: Indirect memory prefetcher","author":"Yu","year":"2015"},{"key":"10.1016\/j.sysarc.2026.103832_b50","series-title":"44th Annual International Symposium on Computer Architecture","article-title":"Stream-dataflow acceleration","author":"Nowatzki","year":"2017"},{"key":"10.1016\/j.sysarc.2026.103832_b51","series-title":"27th ACM International Conference on Architectural Support for Programming Languages and Operating Systems","article-title":"Sparsecore: stream isa and processor specialization for sparse computation","author":"Rao","year":"2022"},{"key":"10.1016\/j.sysarc.2026.103832_b52","series-title":"7th International Congress on Information and Communication Technology","article-title":"Secured supercomputer technologies in Russia: Functional computing units based on multithread-stream cores with specialized accelerators","author":"Molyakov","year":"2022"},{"key":"10.1016\/j.sysarc.2026.103832_b53","series-title":"The RISC-V Instruction Set Manual, Volume II: Privileged Architecture","author":"Waterman","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b54","series-title":"ACM\/IEEE 47th Annual International Symposium on Computer Architecture","article-title":"Perforated page: Supporting fragmented memory allocation for large pages","author":"Park","year":"2020"},{"key":"10.1016\/j.sysarc.2026.103832_b55","doi-asserted-by":"crossref","unstructured":"R.D. Kadhao, R.K. Siddharth, Y.B. Nithin Kumar, M.H. Vasantha, D. Dwivedi, A 2.5 GHz, 1-Kb SRAM with Auxiliary Circuit Assisted Sense Amplifier in 65-nm CMOS Process, in: 36th International Conference on VLSI Design and 22nd International Conference on Embedded Systems, VLSID, http:\/\/dx.doi.org\/10.1109\/VLSID57277.2023.00036.","DOI":"10.1109\/VLSID57277.2023.00036"},{"issue":"2","key":"10.1016\/j.sysarc.2026.103832_b56","article-title":"The gem5 simulator","volume":"39","author":"Binkert","year":"2011","journal-title":"ACM SIGARCH Comp. Arch. News"},{"key":"10.1016\/j.sysarc.2026.103832_b57","series-title":"IEEE Hot Chips 33 Symposium","article-title":"Arm neoverse N2: Arm\u2019s 2nd generation high performance infrastructure CPUs and system IPs","author":"Pellegrini","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b58","series-title":"ACM\/IEEE 57th International Symposium on Microarchitecture","article-title":"A mess of memory system benchmarking, simulation and application profiling","author":"Esmaili-Dokht","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103832_b59","series-title":"ACM\/IEEE 35th International Symposium on Computer Architecture","article-title":"Parallelism-aware batch-scheduling: Enhancing both performance and fairness of shared DRAM systems","author":"Mutlu","year":"2008"},{"key":"10.1016\/j.sysarc.2026.103832_b60","series-title":"ACM\/IEEE International Symposium on High-Performance Computer Architecture","article-title":"Best-offset hardware prefetching","author":"Michaud","year":"2016"},{"key":"10.1016\/j.sysarc.2026.103832_b61","series-title":"The 2nd Data Prefetching Championship","article-title":"Towards bandwidth-efficient prefetching with slim ampm","author":"Young","year":"2015"},{"key":"10.1016\/j.sysarc.2026.103832_b62","series-title":"ACM\/IEEE 49th Annual International Symposium on Microarchitecture","article-title":"Path confidence based lookahead prefetching","author":"Kim","year":"2016"},{"key":"10.1016\/j.sysarc.2026.103832_b63","series-title":"HPL 2.0 \u2013 a portable implementation of the high-performance linpack benchmark for distributed-memory computers","author":"Petitet","year":"2008"},{"key":"10.1016\/j.sysarc.2026.103832_b64","series-title":"LAPACK (linear algebra package) users\u2019 guide","author":"Anderson","year":"1999"},{"key":"10.1016\/j.sysarc.2026.103832_b65","series-title":"DRAMPower: Open-source DRAM power & energy estimation tool","author":"Chandrasekar","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103832_b66","doi-asserted-by":"crossref","DOI":"10.1145\/3762647","article-title":"The case for HW\/SW harmony in real-time systems: Tightening memory latency of streaming applications","author":"Abotaleb","year":"2025","journal-title":"ACM Trans. Embed. Comput. Syst."},{"key":"10.1016\/j.sysarc.2026.103832_b67","series-title":"2021 IEEE\/ACM International Conference on Computer Aided Design","first-page":"1","article-title":"Demystifying the characteristics of high bandwidth memory for real-time systems","author":"Asifuzzaman","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b68","series-title":"2024 54th Annual IEEE\/IFIP International Conference on Dependable Systems and Networks","first-page":"75","article-title":"Read disturbance in high bandwidth memory: A detailed experimental study on HBM2 DRAM chips","author":"Olgun","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103832_b69","series-title":"2024 29th Asia and South Pacific Design Automation Conference","first-page":"454","article-title":"Hardware-software co-design of a collaborative DNN accelerator for 3D stacked memories with multi-channel data","author":"Glint","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103832_b70","doi-asserted-by":"crossref","unstructured":"B.C. Schwedock, P. Yoovidhya, J. Seibert, N. Beckmann, T\u00e4k\u014d: A Polymorphic Cache Hierarchy for General-Purpose Optimization of Data Movement, in: ACM\/IEEE 49th Annual International Symposium on Computer Architecture, ISCA, NY, USA, ISBN: 9781450386104, 2022, http:\/\/dx.doi.org\/10.1145\/3470496.3527379.","DOI":"10.1145\/3470496.3527379"},{"key":"10.1016\/j.sysarc.2026.103832_b71","series-title":"Design, Automation and Test in Europe Conference","article-title":"Intelligent architectures for intelligent computing systems","author":"Mutlu","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103832_b72","series-title":"ACM 40th Annual International Symposium on Microarchitecture","article-title":"Stall-time fair memory access scheduling for chip multiprocessors","author":"Mutlu","year":"2007"},{"key":"10.1016\/j.sysarc.2026.103832_b73","series-title":"ACM\/IEEE 39th Annual International Symposium on Computer Architecture","article-title":"Staged memory scheduling: Achieving high performance and scalability in heterogeneous systems","author":"Ausavarungnirun","year":"2012"}],"container-title":["Journal of Systems Architecture"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1383762126001505?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1383762126001505?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T23:38:34Z","timestamp":1781221114000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1383762126001505"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":73,"alternative-id":["S1383762126001505"],"URL":"https:\/\/doi.org\/10.1016\/j.sysarc.2026.103832","relation":{},"ISSN":["1383-7621"],"issn-type":[{"value":"1383-7621","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"InterStellar 2.0: Fine-grained stream\u2013guided HW\/SW co-design for multi-channel DRAM performance steering","name":"articletitle","label":"Article Title"},{"value":"Journal of Systems Architecture","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.sysarc.2026.103832","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"103832"}}