{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T18:26:02Z","timestamp":1785954362305,"version":"3.56.0"},"publisher-location":"New York, NY, USA","reference-count":100,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,8,12]],"date-time":"2024-08-12T00:00:00Z","timestamp":1723420800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100006374","name":"NSF (National Science Foundation)","doi-asserted-by":"publisher","award":["2235276, 2349144, 2349143, 2349582, and 2349141"],"award-info":[{"award-number":["2235276, 2349144, 2349143, 2349582, and 2349141"]}],"id":[{"id":"10.13039\/501100006374","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006374","name":"ACCESS - AI Chip Center for Emerging Smart Systems, sponsored by InnoHK funding","doi-asserted-by":"publisher","award":["N\/A"],"award-info":[{"award-number":["N\/A"]}],"id":[{"id":"10.13039\/501100006374","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006374","name":"The JC STEM Lab of Intelligent Design Automation, funded by The Hong Kong Jockey Club Charities Trust","doi-asserted-by":"publisher","award":["N\/A"],"award-info":[{"award-number":["N\/A"]}],"id":[{"id":"10.13039\/501100006374","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000781","name":"European Research Council","doi-asserted-by":"publisher","award":["101001318"],"award-info":[{"award-number":["101001318"]}],"id":[{"id":"10.13039\/501100000781","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Munich Quantum Valley (supported by the Bavarian state government with funds from the Hightech Agenda Bayern Plus)","award":["N\/A"],"award-info":[{"award-number":["N\/A"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,8,12]]},"DOI":"10.1145\/3673038.3673073","type":"proceedings-article","created":{"date-parts":[[2024,8,8]],"date-time":"2024-08-08T18:29:01Z","timestamp":1723141741000},"page":"388-399","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":15,"title":["FlatDD: A High-Performance Quantum Circuit Simulator using Decision Diagram and Flat Array"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0718-1003","authenticated-orcid":false,"given":"Shui","family":"Jiang","sequence":"first","affiliation":[{"name":"The Chinese University of Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3744-2083","authenticated-orcid":false,"given":"Rongliang","family":"Fu","sequence":"additional","affiliation":[{"name":"The Chinese University of Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4699-1316","authenticated-orcid":false,"given":"Lukas","family":"Burgholzer","sequence":"additional","affiliation":[{"name":"Technical University of Munich, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4993-7860","authenticated-orcid":false,"given":"Robert","family":"Wille","sequence":"additional","affiliation":[{"name":"Technical University of Munich, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7348-5625","authenticated-orcid":false,"given":"Tsung-Yi","family":"Ho","sequence":"additional","affiliation":[{"name":"The Chinese University of Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9768-3378","authenticated-orcid":false,"given":"Tsung-Wei","family":"Huang","sequence":"additional","affiliation":[{"name":"University of Wisconsin-Madison, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,8,12]]},"reference":[{"key":"e_1_3_2_2_1_1","unstructured":"[n. d.]. Cirq. https:\/\/quantumai.google\/cirq"},{"key":"e_1_3_2_2_2_1","unstructured":"[n. d.]. Multiply\u2013accumulate operation. https:\/\/en.wikipedia.org\/wiki\/Multiply%E2%80%93accumulate_operation"},{"key":"e_1_3_2_2_3_1","volume-title":"d.]","unstructured":"[n. d.]. OpenMP. https:\/\/www.openmp.org\/"},{"key":"e_1_3_2_2_4_1","unstructured":"[n. d.]. Qiskit. https:\/\/qiskit.org\/"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","unstructured":"2020. qsim. https:\/\/doi.org\/10.5281\/zenodo.4023103","DOI":"10.5281\/zenodo.4023103"},{"key":"e_1_3_2_2_6_1","unstructured":"2024. mqt-ddsim. https:\/\/github.com\/cda-tum\/mqt-ddsim"},{"key":"e_1_3_2_2_7_1","volume-title":"Quantum supremacy using a programmable superconducting processor. Nature 574, 7779","author":"Arute Frank","year":"2019","unstructured":"Frank Arute, Kunal Arya, Ryan Babbush, Dave Bacon, Joseph\u00a0C Bardin, Rami Barends, Rupak Biswas, Sergio Boixo, Fernando\u00a0GSL Brandao, David\u00a0A Buell, 2019. Quantum supremacy using a programmable superconducting processor. Nature 574, 7779 (2019), 505\u2013510."},{"key":"e_1_3_2_2_8_1","volume-title":"InnerSP: A memory efficient sparse matrix multiplication accelerator with locality-aware inner product processing","author":"Baek Daehyeon","unstructured":"Daehyeon Baek, Soojin Hwang, Taekyung Heo, Daehoon Kim, and Jaehyuk Huh. 2021. InnerSP: A memory efficient sparse matrix multiplication accelerator with locality-aware inner product processing. In PACT. IEEE, 116\u2013128."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1021\/acs.chemrev.9b00829"},{"key":"e_1_3_2_2_10_1","volume-title":"Training deep quantum neural networks. Nature communications 11, 1","author":"Beer Kerstin","year":"2020","unstructured":"Kerstin Beer, Dmytro Bondarenko, Terry Farrelly, Tobias\u00a0J Osborne, Robert Salzmann, Daniel Scheiermann, and Ramona Wolf. 2020. Training deep quantum neural networks. Nature communications 11, 1 (2020), 808."},{"key":"e_1_3_2_2_11_1","first-page":"1810","article-title":"Advanced equivalence checking for quantum circuits","volume":"40","author":"Burgholzer Lukas","year":"2020","unstructured":"Lukas Burgholzer and Robert Wille. 2020. Advanced equivalence checking for quantum circuits. IEEE TCAD 40, 9 (2020), 1810\u20131824.","journal-title":"IEEE TCAD"},{"key":"e_1_3_2_2_12_1","volume-title":"Ink: Efficient Incremental k-Critical Path Generation","author":"Chang Che","year":"2024","unstructured":"Che Chang, Tsung-Wei Huang, Dian-Lun Lin, Guannan Guo, and Shiju Lin. 2024. Ink: Efficient Incremental k-Critical Path Generation. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_13_1","volume-title":"uSAP: An Ultra-Fast Stochastic Graph Partitioner","author":"Chang Chih-Chun","unstructured":"Chih-Chun Chang and Tsung-Wei Huang. 2023. uSAP: An Ultra-Fast Stochastic Graph Partitioner. In IEEE HPEC."},{"key":"e_1_3_2_2_14_1","unstructured":"Cheng-Hsiang Chiu and Tsung-Wei Huang. 2022. Composing Pipeline Parallelism using Control Taskflow Graph. In ACM HPDC."},{"key":"e_1_3_2_2_15_1","volume-title":"Efficient Timing Propagation with Simultaneous Structural and Pipeline Parallelisms","author":"Chiu Cheng-Hsiang","unstructured":"Cheng-Hsiang Chiu and Tsung-Wei Huang. 2022. Efficient Timing Propagation with Simultaneous Structural and Pipeline Parallelisms. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_16_1","unstructured":"Cheng-Hsiang Chiu Dian-Lun Lin and Tsung-Wei Huang. 2021. An Experimental Study of SYCL Task Graph Parallelism for Large-Scale Machine Learning Workloads. In AMTE."},{"key":"e_1_3_2_2_17_1","volume-title":"Programming Dynamic Task Parallelism for Heterogeneous EDA Algorithms","author":"Chiu Cheng-Hsiang","unstructured":"Cheng-Hsiang Chiu, Dian-Lun Lin, and Tsung-Wei Huang. 2023. Programming Dynamic Task Parallelism for Heterogeneous EDA Algorithms. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW59300.2023.00150"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0208073"},{"key":"e_1_3_2_2_20_1","volume-title":"Quantum cryptography. Reviews of modern physics 74, 1","author":"Gisin Nicolas","year":"2002","unstructured":"Nicolas Gisin, Gr\u00e9goire Ribordy, Wolfgang Tittel, and Hugo Zbinden. 2002. Quantum cryptography. Reviews of modern physics 74, 1 (2002), 145."},{"key":"e_1_3_2_2_21_1","volume-title":"Arrays vs. decision diagrams: A case study on quantum circuit simulators","author":"Grurl Thomas","unstructured":"Thomas Grurl, J\u00fcrgen Fu\u00df, Stefan Hillmich, Lukas Burgholzer, and Robert Wille. 2020. Arrays vs. decision diagrams: A case study on quantum circuit simulators. In IEEE ISMVL. 176\u2013181."},{"key":"e_1_3_2_2_22_1","first-page":"860","article-title":"Noise-aware quantum circuit simulation with decision diagrams","volume":"42","author":"Grurl Thomas","year":"2022","unstructured":"Thomas Grurl, J\u00fcrgen Fu\u00df, and Robert Wille. 2022. Noise-aware quantum circuit simulation with decision diagrams. TCAD 42, 3 (2022), 860\u2013873.","journal-title":"TCAD"},{"key":"e_1_3_2_2_23_1","unstructured":"Ga\u00ebl Guennebaud Beno\u00eet Jacob 2010. Eigen. http:\/\/eigen.tuxfamily.org."},{"key":"e_1_3_2_2_24_1","volume-title":"An Efficient Critical Path Generation Algorithm Considering Extensive Path Constraints","author":"Guo Guannan","unstructured":"Guannan Guo, Tsung-Wei Huang, Chun-Xun Lin, and Martin Wong. 2020. An Efficient Critical Path Generation Algorithm Considering Extensive Path Constraints. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2023.3272274"},{"key":"e_1_3_2_2_26_1","volume-title":"GPU-accelerated Critical Path Generation with Path Constraints","author":"Guo Guannan","unstructured":"Guannan Guo, Tsung-Wei Huang, Yibo Lin, and Martin Wong. 2021. GPU-accelerated Critical Path Generation with Path Constraints. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_27_1","volume-title":"GPU-accelerated Path-based Timing Analysis","author":"Guo Guannan","unstructured":"Guannan Guo, Tsung-Wei Huang, Yibo Lin, and Martin Wong. 2021. GPU-accelerated Path-based Timing Analysis. In IEEE\/ACM DAC."},{"key":"e_1_3_2_2_28_1","volume-title":"\u00a0F. Wong","author":"Guo Guannan","year":"2023","unstructured":"Guannan Guo, Tsung-Wei Huang, and Martin D.\u00a0F. Wong. 2023. Fast STA Graph Partitioning Framework for Multi-GPU Acceleration. In IEEE\/ACM DATE."},{"key":"e_1_3_2_2_29_1","volume-title":"A Provably Good and Practically Efficient Algorithm for Common Path Pessimism Removal in Large Designs","author":"Guo Zizheng","unstructured":"Zizheng Guo, Tsung-Wei Huang, and Yibo Lin. 2020. A Provably Good and Practically Efficient Algorithm for Common Path Pessimism Removal in Large Designs. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_30_1","volume-title":"A Provably Good and Practically Efficient Algorithm for Common Path Pessimism Removal in Large Designs","author":"Guo Zizheng","unstructured":"Zizheng Guo, Tsung-Wei Huang, and Yibo Lin. 2021. A Provably Good and Practically Efficient Algorithm for Common Path Pessimism Removal in Large Designs. In IEEE\/ACM DAC."},{"key":"e_1_3_2_2_31_1","volume-title":"HeteroCPPR: Accelerating Common Path Pessimism Removal with Heterogeneous CPU-GPU Parallelism","author":"Guo Zizheng","unstructured":"Zizheng Guo, Tsung-Wei Huang, and Yibo Lin. 2021. HeteroCPPR: Accelerating Common Path Pessimism Removal with Heterogeneous CPU-GPU Parallelism. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2023.3286261"},{"key":"e_1_3_2_2_33_1","volume-title":"Heterogeneous Static Timing Analysis with Advanced Delay Calculator","author":"Guo Zizheng","unstructured":"Zizheng Guo, Tsung-Wei Huang, Jin Zhou, Cheng Zhuo, Yibo Lin, Runsheng Wang, and Ru Huang. 2024. Heterogeneous Static Timing Analysis with Advanced Delay Calculator. In IEEE\/ACM DATE."},{"key":"e_1_3_2_2_34_1","volume-title":"High performance emulation of quantum circuits","author":"H\u00e4ner Thomas","unstructured":"Thomas H\u00e4ner, Damian\u00a0S Steiger, Mikhail Smelyanskiy, and Matthias Troyer. 2016. High performance emulation of quantum circuits. In SC. IEEE, 866\u2013874."},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1038\/s42254-023-00603-1"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"crossref","unstructured":"Stefan Hillmich Igor\u00a0L. Markov and Robert Wille. 2020. Just Like the Real Thing: Fast Weak Simulation of Quantum Computation. In DAC. 1\u20136.","DOI":"10.1109\/DAC18072.2020.9218555"},{"key":"e_1_3_2_2_37_1","volume-title":"Concurrency in DD-based quantum circuit simulation","author":"Hillmich Stefan","unstructured":"Stefan Hillmich, Alwin Zulehner, and Robert Wille. 2020. Concurrency in DD-based quantum circuit simulation. In IEEE ASP-DAC. 115\u2013120."},{"key":"e_1_3_2_2_38_1","volume-title":"A General-purpose Parallel and Heterogeneous Task Programming System for VLSI CAD","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang. 2020. A General-purpose Parallel and Heterogeneous Task Programming System for VLSI CAD. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_39_1","volume-title":"TFProf: Profiling Large Taskflow Programs with Modern D3 and C++","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang. 2021. TFProf: Profiling Large Taskflow Programs with Modern D3 and C++. In IEEE ProTools."},{"key":"e_1_3_2_2_40_1","volume-title":"Enhancing the Performance Portability of Heterogeneous Circuit Analysis Programs","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang. 2022. Enhancing the Performance Portability of Heterogeneous Circuit Analysis Programs. In IEEE HPEC."},{"key":"e_1_3_2_2_41_1","volume-title":"qTask: Task-parallel Quantum Circuit Simulation with Incrementality","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang. 2023. qTask: Task-parallel Quantum Circuit Simulation with Incrementality. In IEEE IPDPS."},{"key":"e_1_3_2_2_42_1","volume-title":"\u00a0F. Wong","author":"Huang Tsung-Wei","year":"2021","unstructured":"Tsung-Wei Huang, Guannan Guo, Chun-Xun Lin, and Martin D.\u00a0F. Wong. 2021. OpenTimer v2: A New Parallel Incremental Timing Analysis Engine. IEEE TCAD (2021)."},{"key":"e_1_3_2_2_43_1","volume-title":"Task-parallel Programming with Constrained Parallelism","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang and Leslie Hwang. 2022. Task-parallel Programming with Constrained Parallelism. In IEEE HPEC."},{"key":"e_1_3_2_2_44_1","volume-title":"Distributed Timing Analysis at Scale","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang, Chun-Xun Lin, , and Martin Wong. 2019. Distributed Timing Analysis at Scale. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3243654"},{"key":"e_1_3_2_2_46_1","volume-title":"Cpp-Taskflow: Fast Task-based Parallel Programming using Modern C++","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang, Chun-Xun Lin, Guannan Guo, and Martin Wong. 2019. Cpp-Taskflow: Fast Task-based Parallel Programming using Modern C++. In IEEE IPDPS."},{"key":"e_1_3_2_2_47_1","volume-title":"Essential Building Blocks for Creating an Open-source EDA Project","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang, Chun-Xun Lin, Guannan Guo, and Martin Wong. 2019. Essential Building Blocks for Creating an Open-source EDA Project. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_48_1","volume-title":"DtCraft: A Distributed Execution Engine for Compute-intensive Applications","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang, Chun-Xun Lin, and Martin Wong. 2017. DtCraft: A Distributed Execution Engine for Compute-intensive Applications. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_49_1","volume-title":"DtCraft: A High-performance Distributed Execution Engine at Scale","author":"Huang Tsung-Wei","year":"2019","unstructured":"Tsung-Wei Huang, Chun-Xun Lin, and Martin Wong. 2019. DtCraft: A High-performance Distributed Execution Engine at Scale. IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD) (2019)."},{"key":"e_1_3_2_2_50_1","volume-title":"OpenTimer v2: A Parallel Incremental Timing Analysis Engine","author":"Huang Tsung-Wei","year":"2021","unstructured":"Tsung-Wei Huang, Chun-Xun Lin, and Martin Wong. 2021. OpenTimer v2: A Parallel Incremental Timing Analysis Engine. IEEE Design and Test (DAT) (2021)."},{"key":"e_1_3_2_2_51_1","volume-title":"Taskflow: A Lightweight Parallel and Heterogeneous Task Graph Computing System","author":"Huang Tsung-Wei","year":"2022","unstructured":"Tsung-Wei Huang, Dian-Lun Lin, Chun-Xun Lin, and Yibo Lin. 2022. Taskflow: A Lightweight Parallel and Heterogeneous Task Graph Computing System. IEEE TPDS (2022)."},{"key":"e_1_3_2_2_52_1","volume-title":"Concurrent CPU-GPU Task Programming using Modern C++","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang and Yibo Lin. 2022. Concurrent CPU-GPU Task Programming using Modern C++. In IEEE HIPS."},{"key":"e_1_3_2_2_53_1","volume-title":"OpenTimer: A High-Performance Timing Analysis Tool","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang and Martin Wong. 2015. OpenTimer: A High-Performance Timing Analysis Tool. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_54_1","volume-title":"An Ultra-Fast Path-Based Timing Analysis Algorithm for CPPR","author":"Huang Tsung-Wei","year":"2016","unstructured":"Tsung-Wei Huang and Martin Wong. 2016. UI-Timer 1.0: An Ultra-Fast Path-Based Timing Analysis Algorithm for CPPR. IEEE TCAD (2016)."},{"key":"e_1_3_2_2_55_1","doi-asserted-by":"crossref","unstructured":"Tsung-Wei Huang Martin Wong D. Sinha K. Kalafala and N. Venkateswaran. 2016. A Distributed Timing Analysis Framework for Large Designs. In IEEE\/ACM DAC.","DOI":"10.1145\/2897937.2897959"},{"key":"e_1_3_2_2_56_1","volume-title":"Fast Path-Based Timing Analysis for CPPR","author":"Huang Tsung-Wei","unstructured":"Tsung-Wei Huang, P.-C. Wu, and Martin Wong. 2014. Fast Path-Based Timing Analysis for CPPR. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_57_1","volume-title":"\u00a0F. Wong","author":"Huang Tsung-Wei","year":"2014","unstructured":"Tsung-Wei Huang, Pei-Ci Wu, and Martin D.\u00a0F. Wong. 2014. UI-Timer: An ultra-fast clock network pessimism removal algorithm. In IEEE\/ACM ICCAD."},{"key":"e_1_3_2_2_58_1","doi-asserted-by":"crossref","unstructured":"Tsung-Wei Huang Boyang Zhang Dian-Lun Lin and Cheng-Hsiang Chiu. 2024. Parallel and Heterogeneous Timing Analysis: Partition Algorithm and System. In ACM ISPD.","DOI":"10.1145\/3626184.3635278"},{"key":"e_1_3_2_2_59_1","doi-asserted-by":"publisher","DOI":"10.1080\/00224065.1986.11979014"},{"key":"e_1_3_2_2_60_1","unstructured":"Intel. [n. d.]. AVX2. https:\/\/www.intel.com\/content\/www\/us\/en\/docs\/cpp-compiler\/developer-guide-reference\/2021-8\/intrinsics-for-avx2.html"},{"key":"e_1_3_2_2_61_1","volume-title":"GLARE: Accelerating Sparse DNN Inference Kernels with Global Memory Access Reduction","author":"Jiang Shui","year":"2023","unstructured":"Shui Jiang, Tsung-Wei Huang, and Tsung-Yi Ho. 2023. GLARE: Accelerating Sparse DNN Inference Kernels with Global Memory Access Reduction. In IEEE HPEC."},{"key":"e_1_3_2_2_62_1","volume-title":"SNICIT: Accelerating Sparse Neural Network Inference via Compression at Inference Time on GPU. In ACM ICPP.","author":"Jiang Shui","year":"2023","unstructured":"Shui Jiang, Tsung-Wei Huang, and Tsung-Yi Ho. 2023. SNICIT: Accelerating Sparse Neural Network Inference via Compression at Inference Time on GPU. In ACM ICPP."},{"key":"e_1_3_2_2_63_1","doi-asserted-by":"crossref","unstructured":"Chenyang Jiao Weihua Zhang and Li Shen. 2023. Communication Optimizations for State-vector Quantum Simulator on CPU+ GPU Clusters. In ICPP. 203\u2013212.","DOI":"10.1145\/3605573.3605631"},{"key":"e_1_3_2_2_64_1","volume-title":"A General Cache Framework for Efficient Generation of Timing Critical Paths","author":"Lai Kuan-Ming","unstructured":"Kuan-Ming Lai, Tsung-Wei Huang, and Tsung-Yi Ho. 2019. A General Cache Framework for Efficient Generation of Timing Critical Paths. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_65_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394885.3431578"},{"key":"e_1_3_2_2_66_1","doi-asserted-by":"publisher","DOI":"10.1145\/3061639.3062274"},{"key":"e_1_3_2_2_67_1","volume-title":"G-kway: Multilevel GPU-Accelerated k-way Graph Partitioner","author":"Lee Wan\u00a0Luan","year":"2024","unstructured":"Wan\u00a0Luan Lee, Dian-Lun Lin, Tsung-Wei Huang, Shui Jiang, Tsung-Yi Ho, Yibo Lin, and Bei Yu. 2024. G-kway: Multilevel GPU-Accelerated k-way Graph Partitioner. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_68_1","doi-asserted-by":"crossref","unstructured":"Ang Li Bo Fang Christopher Granade Guen Prawiroatmodjo Bettina Heim Martin Roetteler and Sriram Krishnamoorthy. 2021. SV-Sim: scalable PGAS-based state vector simulation of quantum circuits. In SC. 1\u201314.","DOI":"10.1145\/3458817.3476169"},{"key":"e_1_3_2_2_69_1","first-page":"1","article-title":"Qasmbench: A low-level quantum benchmark suite for nisq evaluation and simulation","volume":"4","author":"Li Ang","year":"2023","unstructured":"Ang Li, Samuel Stein, Sriram Krishnamoorthy, and James Ang. 2023. Qasmbench: A low-level quantum benchmark suite for nisq evaluation and simulation. ACM TQC 4, 2 (2023), 1\u201326.","journal-title":"ACM TQC"},{"key":"e_1_3_2_2_70_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350537"},{"key":"e_1_3_2_2_71_1","volume-title":"An Efficient and Composable Parallel Task Programming Library","author":"Lin Chun-Xun","unstructured":"Chun-Xun Lin, Tsung-Wei Huang, Guannan Guo, and Martin Wong. 2019. An Efficient and Composable Parallel Task Programming Library. In IEEE HPEC."},{"key":"e_1_3_2_2_72_1","volume-title":"An Efficient Work-Stealing Scheduler for Task Dependency Graph","author":"Lin Chun-Xun","unstructured":"Chun-Xun Lin, Tsung-Wei Huang, and Martin Wong. 2020. An Efficient Work-Stealing Scheduler for Task Dependency Graph. In IEEE ICPADS."},{"key":"e_1_3_2_2_73_1","unstructured":"Chun-Xun Lin Tsung-Wei Huang Ting Yu and Martin Wong. 2018. A Distributed Power Grid Analysis Framework from Sequential Stream Graph. In ACM GLSVLSI."},{"key":"e_1_3_2_2_74_1","volume-title":"A Novel Inference Algorithm for Large Sparse Neural Network using Task Graph Parallelism","author":"Lin Dian-Lun","unstructured":"Dian-Lun Lin and Tsung-Wei Huang. 2020. A Novel Inference Algorithm for Large Sparse Neural Network using Task Graph Parallelism. In IEEE HPEC. 1\u20137."},{"key":"e_1_3_2_2_75_1","unstructured":"Dian-Lun Lin and Tsung-Wei Huang. 2021. Efficient GPU Computation using Task Graph Parallelism. In Euro-Par."},{"key":"e_1_3_2_2_76_1","volume-title":"Accelerating Large Sparse Neural Network Inference using GPU Task Graph Parallelism","author":"Lin Dian-Lun","year":"2022","unstructured":"Dian-Lun Lin and Tsung-Wei Huang. 2022. Accelerating Large Sparse Neural Network Inference using GPU Task Graph Parallelism. IEEE TPDS (2022)."},{"key":"e_1_3_2_2_77_1","unstructured":"Dian-Lun Lin Tsung-Wei Huang Joshua\u00a0San Miguel and Umit Ogras. 2024. TaroRTL: Accelerating RTL Simulation using Coroutine-based Heterogeneous Task Graph Scheduling. In Euro-Par."},{"key":"e_1_3_2_2_78_1","unstructured":"Dian-Lun Lin Haoxing Ren Yanqing Zhang Brucek Khailany and Tsung-Wei Huang. 2022. From RTL to CUDA: A GPU Acceleration Flow for RTL Simulation with Batch Stimulus. In ACM ICPP."},{"key":"e_1_3_2_2_79_1","volume-title":"GenFuzz: GPU-accelerated Hardware Fuzzing using Genetic Algorithm with Multiple Inputs","author":"Lin Dian-Lun","unstructured":"Dian-Lun Lin, Yanqing Zhang, Haoxing Ren, Shih-Hsin Wang, Brucek Khailany, and Tsung-Wei Huang. 2023. GenFuzz: GPU-accelerated Hardware Fuzzing using Genetic Algorithm with Multiple Inputs. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_80_1","volume-title":"G-PASTA: GPU Accelerated Partitioning Algorithm for Static Timing Analysis","author":"Lin Shiju","unstructured":"Shiju Lin, Guannan Guo, Tsung-Wei Huang, Weihua Sheng, Evangeline Young, and Martin Wong. 2024. G-PASTA: GPU Accelerated Partitioning Algorithm for Static Timing Analysis. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_81_1","doi-asserted-by":"crossref","unstructured":"Ji Liu Luciano Bello and Huiyang Zhou. 2021. Relaxed Peephole Optimization: A Novel Compiler Optimization for Quantum Circuits. In CGO. 301\u2013314.","DOI":"10.1109\/CGO51591.2021.9370310"},{"key":"e_1_3_2_2_82_1","volume-title":"Qubit mapping and routing via MaxSAT","author":"Molavi Abtin","unstructured":"Abtin Molavi, Amanda Xu, Martin Diges, Lauren Pick, Swamit Tannu, and Aws Albarghouthi. 2022. Qubit mapping and routing via MaxSAT. In MICRO. IEEE, 1078\u20131091."},{"key":"e_1_3_2_2_83_1","volume-title":"A Resource-efficient Task Scheduling System using Reinforcement Learning","author":"Morchdi Chedi","unstructured":"Chedi Morchdi, Cheng-Hsiang Chiu, Yi Zhou, and Tsung-Wei Huang. 2024. A Resource-efficient Task Scheduling System using Reinforcement Learning. In IEEE\/ACM ASPDAC."},{"key":"e_1_3_2_2_84_1","volume-title":"Taskflow-San: Sanitizing Erroneous Control Flow in Taskflow Programs","author":"Mower McKay","unstructured":"McKay Mower, Luke Majors, and Tsung-Wei Huang. 2021. Taskflow-San: Sanitizing Erroneous Control Flow in Taskflow Programs. In IEEE ESPM2."},{"key":"e_1_3_2_2_85_1","volume-title":"Flexagon: A multi-dataflow sparse-sparse matrix multiplication accelerator for efficient dnn processing. In ASPLOS. 252\u2013265.","author":"Mu\u00f1oz-Mart\u00ednez Francisco","year":"2023","unstructured":"Francisco Mu\u00f1oz-Mart\u00ednez, Raveesh Garg, Michael Pellauer, Jos\u00e9\u00a0L Abell\u00e1n, Manuel\u00a0E Acacio, and Tushar Krishna. 2023. Flexagon: A multi-dataflow sparse-sparse matrix multiplication accelerator for efficient dnn processing. In ASPLOS. 252\u2013265."},{"key":"e_1_3_2_2_86_1","first-page":"86","article-title":"QMDDs: Efficient quantum function representation and manipulation","volume":"35","author":"Niemann Philipp","year":"2015","unstructured":"Philipp Niemann, Robert Wille, David\u00a0Michael Miller, Mitchell\u00a0A Thornton, and Rolf Drechsler. 2015. QMDDs: Efficient quantum function representation and manipulation. IEEE TCAD 35, 1 (2015), 86\u201399.","journal-title":"IEEE TCAD"},{"key":"e_1_3_2_2_87_1","unstructured":"[87] qpp. 2024. https:\/\/github.com\/softwareQinc\/qpp"},{"key":"e_1_3_2_2_88_1","doi-asserted-by":"publisher","DOI":"10.22331\/q-2023-07-20-1062"},{"key":"e_1_3_2_2_89_1","volume-title":"qHiPSTER: The quantum high performance software testing environment. arXiv preprint arXiv:1601.07195","author":"Smelyanskiy Mikhail","year":"2016","unstructured":"Mikhail Smelyanskiy, Nicolas\u00a0PD Sawaya, and Al\u00e1n Aspuru-Guzik. 2016. qHiPSTER: The quantum high performance software testing environment. arXiv preprint arXiv:1601.07195 (2016)."},{"key":"e_1_3_2_2_90_1","doi-asserted-by":"crossref","unstructured":"Jiyuan Wang Qian Zhang Guoqing\u00a0Harry Xu and Miryung Kim. 2021. QDiff: Differential Testing of Quantum Software Stacks. In ASE. 692\u2013704.","DOI":"10.1109\/ASE51524.2021.9678792"},{"key":"e_1_3_2_2_91_1","doi-asserted-by":"crossref","unstructured":"Xin-Chuan Wu Sheng Di Emma\u00a0Maitreyee Dasgupta Franck Cappello Hal Finkel Yuri Alexeev and Frederic\u00a0T Chong. 2019. Full-state quantum circuit simulation by using data compression. In SC. 1\u201324.","DOI":"10.1145\/3295500.3356155"},{"key":"e_1_3_2_2_92_1","volume-title":"A High-Performance Heterogeneous Critical Path Analysis Framework","author":"Zamani Yasin","unstructured":"Yasin Zamani and Tsung-Wei Huang. 2021. A High-Performance Heterogeneous Critical Path Analysis Framework. In IEEE HPEC."},{"key":"e_1_3_2_2_93_1","volume-title":"G-PASTA: GPU Accelerated Partitioning Algorithm for Static Timing Analysis","author":"Zhang Boyang","unstructured":"Boyang Zhang, Dian-Lun Lin, Che Chang, Cheng-Hsiang Chiu, Bojue Wang, Wan\u00a0Luan Lee, Chih-Chun Chang, Donghao Fang, and Tsung-Wei Huang. 2024. G-PASTA: GPU Accelerated Partitioning Algorithm for Static Timing Analysis. In ACM\/IEEE DAC."},{"key":"e_1_3_2_2_94_1","doi-asserted-by":"crossref","unstructured":"Chen Zhang Zeyu Song Haojie Wang Kaiyuan Rong and Jidong Zhai. 2021. HyQuas: hybrid partitioner based quantum circuit simulation system on GPU. In ICS. 443\u2013454.","DOI":"10.1145\/3447818.3460357"},{"key":"e_1_3_2_2_95_1","volume-title":"Quantum computational advantage using photons. Science 370, 6523","author":"Zhong Han-Sen","year":"2020","unstructured":"Han-Sen Zhong, Hui Wang, Yu-Hao Deng, Ming-Cheng Chen, Li-Chao Peng, Yi-Han Luo, Jian Qin, Dian Wu, Xing Ding, Yi Hu, 2020. Quantum computational advantage using photons. Science 370, 6523 (2020), 1460\u20131463."},{"key":"e_1_3_2_2_96_1","volume-title":"Efficient Critical Paths Search Algorithm using Mergeable Heap","author":"Zhou Kexing","unstructured":"Kexing Zhou, Zizheng Guo, Tsung-Wei Huang, and Yibo Lin. 2022. Efficient Critical Paths Search Algorithm using Mergeable Heap. In IEEE\/ACM ASPDAC."},{"key":"e_1_3_2_2_97_1","volume-title":"Approximation of quantum states using decision diagrams","author":"Zulehner Alwin","unstructured":"Alwin Zulehner, Stefan Hillmich, Igor\u00a0L Markov, and Robert Wille. 2020. Approximation of quantum states using decision diagrams. In ASP-DAC. IEEE, 121\u2013126."},{"key":"e_1_3_2_2_98_1","volume-title":"How to efficiently handle complex values? Implementing decision diagrams for quantum computing","author":"Zulehner Alwin","unstructured":"Alwin Zulehner, Stefan Hillmich, and Robert Wille. 2019. How to efficiently handle complex values? Implementing decision diagrams for quantum computing. In IEEE ICCAD. 1\u20137."},{"key":"e_1_3_2_2_99_1","first-page":"848","article-title":"Advanced simulation of quantum computations","volume":"38","author":"Zulehner Alwin","year":"2018","unstructured":"Alwin Zulehner and Robert Wille. 2018. Advanced simulation of quantum computations. IEEE TCAD 38, 5 (2018), 848\u2013859.","journal-title":"IEEE TCAD"},{"key":"e_1_3_2_2_100_1","volume-title":"Matrix-vector vs. matrix-matrix multiplication: Potential in DD-based simulation of quantum computations","author":"Zulehner Alwin","unstructured":"Alwin Zulehner and Robert Wille. 2019. Matrix-vector vs. matrix-matrix multiplication: Potential in DD-based simulation of quantum computations. In IEEE DATE. 90\u201395."}],"event":{"name":"ICPP '24: the 53rd International Conference on Parallel Processing","location":"Gotland Sweden","acronym":"ICPP '24"},"container-title":["Proceedings of the 53rd International Conference on Parallel Processing"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3673038.3673073","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3673038.3673073","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,23]],"date-time":"2025-09-23T17:32:43Z","timestamp":1758648763000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3673038.3673073"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,8,12]]},"references-count":100,"alternative-id":["10.1145\/3673038.3673073","10.1145\/3673038"],"URL":"https:\/\/doi.org\/10.1145\/3673038.3673073","relation":{},"subject":[],"published":{"date-parts":[[2024,8,12]]},"assertion":[{"value":"2024-08-12","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}