{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T19:09:32Z","timestamp":1757617772630,"version":"3.44.0"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T00:00:00Z","timestamp":1744848000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T00:00:00Z","timestamp":1744848000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["CCF Trans. HPC"],"published-print":{"date-parts":[[2025,8]]},"DOI":"10.1007\/s42514-025-00231-4","type":"journal-article","created":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T08:46:31Z","timestamp":1744879591000},"page":"323-335","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["A high-performance matrix transposition for a new MIMD architecture processor PEZY-SC3s"],"prefix":"10.1007","volume":"7","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-1207-2170","authenticated-orcid":false,"given":"Yaling","family":"Liang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qinglin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shun","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rui","family":"Xia","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weihao","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jie","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,17]]},"reference":[{"key":"231_CR1","doi-asserted-by":"crossref","unstructured":"Alves, J.N., Russo, L.M., Francisco, A.P., et al.: A novel triangular space-filling curve for cache-oblivious in-place transposition of square matrices. In: 2023 IEEE International Parallel and Distributed Processing Symposium (IPDPS), IEEE, pp 368\u2013378 (2023)","DOI":"10.1109\/IPDPS54959.2023.00045"},{"issue":"4","key":"231_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3555353","volume":"48","author":"JNF Alves","year":"2022","unstructured":"Alves, J.N.F., Russo, L.M.S., Francisco, A.: Cache-oblivious hilbert curve-based blocking scheme for matrix transposition. ACM Trans. Math. Softw. 48(4), 1\u201328 (2022)","journal-title":"ACM Trans. Math. Softw."},{"key":"231_CR3","doi-asserted-by":"publisher","first-page":"1418","DOI":"10.1016\/j.procs.2016.05.457","volume":"80","author":"T Aoyama","year":"2016","unstructured":"Aoyama, T., Ishikawa, K.I., Kimura, Y., et al.: First application of lattice qcd to pezy-sc processor. Proc. Comput. Sci. 80, 1418\u20131427 (2016)","journal-title":"Proc. Comput. Sci."},{"issue":"8","key":"231_CR4","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1145\/2692916.2555253","volume":"49","author":"B Catanzaro","year":"2014","unstructured":"Catanzaro, B., Keller, A., Garland, M.: A decomposition for in-place matrix transposition. ACM SIGPLAN Notices 49(8), 193\u2013206 (2014)","journal-title":"ACM SIGPLAN Notices"},{"key":"231_CR5","doi-asserted-by":"crossref","unstructured":"Chatterjee, S., Sen, S.: Cache-efficient matrix transposition. In: Proceedings Sixth International Symposium on High-Performance Computer Architecture. HPCA-6 (Cat. No. PR00550), IEEE, pp 195\u2013205 (2000)","DOI":"10.1109\/HPCA.2000.824350"},{"issue":"7","key":"231_CR6","doi-asserted-by":"publisher","first-page":"9456","DOI":"10.1007\/s11227-021-04282-6","volume":"78","author":"Z Chen","year":"2022","unstructured":"Chen, Z., Wang, D., Yu, Q., et al.: Amt: asynchronous in-place matrix transpose mechanism for sunway many-core processor. J. Supercomput. 78(7), 9456\u20139474 (2022)","journal-title":"J. Supercomput."},{"key":"231_CR7","unstructured":"Conference, I.S.: Green500 list - november 2019. https:\/\/www.top500.org\/lists\/green500\/list\/2019\/11\/, accessed: 2024-9-25 (2019)"},{"key":"231_CR8","unstructured":"Conference, I.S.: Green500 list - november 2021. https:\/\/www.top500.org\/lists\/green500\/list\/2021\/11\/, accessed: 2024-9-25 (2021)"},{"key":"231_CR9","unstructured":"Conference, I.S.: Green500 list - june 2022. https:\/\/www.top500.org\/lists\/green500\/list\/2022\/06\/, accessed: 2024-9-25 (2022)"},{"issue":"3","key":"231_CR10","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1007\/s10915-024-02636-9","volume":"100","author":"C Garner","year":"2024","unstructured":"Garner, C., Lerman, G., Zhang, S.: Spectrally constrained optimization. J. Sci. Comput. 100(3), 89 (2024)","journal-title":"J. Sci. Comput."},{"key":"231_CR11","doi-asserted-by":"crossref","unstructured":"Gatlin, K.S., Carter, L.: Memory hierarchy considerations for fast transpose and bit-reversals. In: Proceedings Fifth International Symposium on High-Performance Computer Architecture, IEEE, pp 33\u201342 (1999)","DOI":"10.1109\/HPCA.1999.744320"},{"issue":"11","key":"231_CR12","doi-asserted-by":"publisher","first-page":"1942","DOI":"10.1109\/TC.2020.3030592","volume":"70","author":"P Godard","year":"2020","unstructured":"Godard, P., Loechner, V., Bastoul, C.: Efficient out-of-core and out-of-place rectangular matrix transposition and rotation. IEEE Trans. Comput. 70(11), 1942\u20131948 (2020)","journal-title":"IEEE Trans. Comput."},{"issue":"3","key":"231_CR13","doi-asserted-by":"publisher","first-page":"776","DOI":"10.1109\/TPDS.2015.2412549","volume":"27","author":"J Gomez-Luna","year":"2015","unstructured":"Gomez-Luna, J., Sung, I.J., Chang, L.W., et al.: In-place matrix transposition on gpus. IEEE Trans. Parallel Distributed Syst. 27(3), 776\u2013788 (2015)","journal-title":"IEEE Trans. Parallel Distributed Syst."},{"issue":"3","key":"231_CR14","doi-asserted-by":"publisher","DOI":"10.1103\/PRXQuantum.3.030334","volume":"3","author":"MH Gordon","year":"2022","unstructured":"Gordon, M.H., Cerezo, M., Cincio, L., et al.: Covariance matrix preparation for quantum principal component analysis. PRX Quantum 3(3), 030334 (2022)","journal-title":"PRX Quantum"},{"key":"231_CR15","doi-asserted-by":"crossref","unstructured":"Guo, J., Liu, J., Wang, Q., et al.: Optimizing csr-based spmv on a new mimd architecture pezy-sc3s. In: International Conference on Algorithms and Architectures for Parallel Processing, Springer, pp 22\u201339 (2023)","DOI":"10.1007\/978-981-97-0801-7_2"},{"key":"231_CR16","unstructured":"Hatta, N., Tsunoda, S., Uchida, K., et al.: Pezy-sc3: A mimd many-core processor for energy-efficient computing. arXiv preprint arXiv:2301.07510 (2022)"},{"key":"231_CR17","doi-asserted-by":"crossref","unstructured":"Henriksson, M., Gustafsson, O.: Streaming matrix transposition on fpgas using distributed memories. In: 2023 IEEE Nordic Circuits and Systems Conference (NorCAS), IEEE, pp 1\u20136 (2023)","DOI":"10.1109\/NorCAS58970.2023.10305472"},{"issue":"3","key":"231_CR18","doi-asserted-by":"publisher","first-page":"28","DOI":"10.1145\/3529113.3529122","volume":"49","author":"X Huang","year":"2022","unstructured":"Huang, X., Wang, Q., Lu, S., et al.: Evaluating fft-based algorithms for strided convolutions on armv8 architectures? ACM SIGMETRICS Performance Eval. Rev. 49(3), 28\u201329 (2022)","journal-title":"ACM SIGMETRICS Performance Eval. Rev."},{"key":"231_CR19","unstructured":"Hynninen, A.P., Lyakh, D.I.: cutt: A high-performance tensor transpose library for cuda compatible gpus. arXiv preprint arXiv:1705.01598 (2017)"},{"key":"231_CR20","doi-asserted-by":"crossref","unstructured":"Jun, H., Cho, J., Lee, K., et al.: Hbm (high bandwidth memory) dram technology and architecture. In: 2017 IEEE International Memory Workshop (IMW), IEEE, pp 1\u20134 (2017)","DOI":"10.1109\/IMW.2017.7939084"},{"key":"231_CR21","unstructured":"Khronos Group (2008) OpenCL: The open standard for parallel programming of heterogeneous systems. https:\/\/www.khronos.org\/opencl\/"},{"issue":"6","key":"231_CR22","doi-asserted-by":"publisher","first-page":"1035","DOI":"10.4218\/etrij.2022-0297","volume":"45","author":"J Lee","year":"2023","unstructured":"Lee, J., Kim, D.: Large-scale 3d fast fourier transform computation on a gpu. ETRI J. 45(6), 1035\u20131045 (2023)","journal-title":"ETRI J."},{"key":"231_CR23","unstructured":"Lei, K., Ge, W.: Design and implementation of matrix transpose based on smp system. In: IET Conference Proceedings, The Institution of Engineering & Technology (2015)"},{"issue":"1","key":"231_CR24","doi-asserted-by":"publisher","first-page":"7608","DOI":"10.1038\/s41598-024-58175-8","volume":"14","author":"R Li","year":"2024","unstructured":"Li, R., Li, Q., Yang, S., et al.: An efficient and accurate 2d human pose estimation method using vttranspose network. Sci. Rep. 14(1), 7608 (2024)","journal-title":"Sci. Rep."},{"issue":"1\u20132","key":"231_CR25","doi-asserted-by":"publisher","first-page":"101","DOI":"10.1016\/S0043-1648(00)00427-0","volume":"243","author":"S Liu","year":"2000","unstructured":"Liu, S., Wang, Q., Liu, G.: A versatile method of discrete convolution and fft (dc-fft) for contact analyses. Wear 243(1\u20132), 101\u2013111 (2000)","journal-title":"Wear"},{"key":"231_CR26","unstructured":"Liu, Y., Yi-Zhuang, X., Xing-Bin, H.: Implementation of parallel interface and matrix transpose for sar imaging based on virtex6 fpga. In: IET Conference Proceedings, The Institution of Engineering & Technology (2013)"},{"issue":"1","key":"231_CR27","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevA.75.014304","volume":"75","author":"Z Ma","year":"2007","unstructured":"Ma, Z., Wang, X.: Matrix realignment and partial-transpose approach to entangling power of quantum evolutions. Phys. Rev. A-Atomic, Mol. Opt. Phys. 75(1), 014304 (2007)","journal-title":"Phys. Rev. A-Atomic, Mol. Opt. Phys."},{"key":"231_CR28","doi-asserted-by":"publisher","first-page":"57514","DOI":"10.1109\/ACCESS.2023.3283312","volume":"11","author":"M Mannino","year":"2023","unstructured":"Mannino, M., Peccerillo, B., Mondelli, A., et al.: Analysis and optimization of direct convolution execution on multi-core processors. IEEE Access 11, 57514\u201357528 (2023)","journal-title":"IEEE Access"},{"key":"231_CR29","doi-asserted-by":"crossref","unstructured":"Matsufuru, H., Sumiyoshi, K.: Acceleration of boltzmann equation for core-collapse supernova simulations on pezy-sc processors. In: Computational Science and Its Applications\u2013ICCSA 2020: 20th International Conference, Cagliari, Italy, July 1\u20134, 2020, Proceedings, Part V 20, Springer, pp 177\u2013192 (2020)","DOI":"10.1007\/978-3-030-58814-4_13"},{"key":"231_CR30","unstructured":"McCalpin, J.D.: Stream: Sustainable memory bandwidth in high performance computers. University of Virginia, (1991\u20132013) http:\/\/www.cs.virginia.edu\/stream\/"},{"key":"231_CR31","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2023.119260","volume":"643","author":"F Ming","year":"2023","unstructured":"Ming, F., Gong, W., Li, S., et al.: Handling constrained many-objective optimization problems via determinantal point processes. Inform. Sci. 643, 119260 (2023)","journal-title":"Inform. Sci."},{"key":"231_CR32","doi-asserted-by":"crossref","unstructured":"Mitsuishi, T., Kaneda, T., Torii, S., et al.: Implementing breadth-first search on a compact supercomputer suiren. In: 2016 Fourth International Symposium on Computing and Networking (CANDAR), IEEE, pp 395\u2013401 (2016)","DOI":"10.1109\/CANDAR.2016.0075"},{"issue":"1","key":"231_CR33","first-page":"57","volume":"45","author":"X Pei","year":"2023","unstructured":"Pei, X., Wang, Q., Liao, L., et al.: Optimizing parallel matrix transpose algorithm on multi-core digital signal processors. J. Natl. Univ. Defense Technol. 45(1), 57\u201366 (2023)","journal-title":"J. Natl. Univ. Defense Technol."},{"issue":"2","key":"231_CR34","doi-asserted-by":"publisher","first-page":"128","DOI":"10.1145\/342001.339668","volume":"28","author":"S Rixner","year":"2000","unstructured":"Rixner, S., Dally, W.J., Kapasi, U.J., et al.: Memory access scheduling. ACM SIGARCH Comput. Architec. News 28(2), 128\u2013138 (2000)","journal-title":"ACM SIGARCH Comput. Architec. News"},{"key":"231_CR35","doi-asserted-by":"crossref","unstructured":"Springer, P., Su, T., Bientinesi, P.: Hptt: a high-performance tensor transposition c++ library. In: Proceedings of the 4th ACM SIGPLAN International Workshop on Libraries, Languages, and Compilers for Array Programming, pp 56\u201362 (2017)","DOI":"10.1145\/3091966.3091968"},{"key":"231_CR36","unstructured":"Vaswani, N., Narayanamurthy, P.: Static and dynamic robust pca via low-rank+ sparse matrix decomposition: A review. arXiv preprint arXiv:1803.00651 (2018)"},{"key":"231_CR37","doi-asserted-by":"crossref","unstructured":"Vince, J., Vince.: Quaternions for computer graphics. Springer, Lodon (2011)","DOI":"10.1007\/978-0-85729-760-0"},{"issue":"1","key":"231_CR38","doi-asserted-by":"publisher","first-page":"155","DOI":"10.1177\/1094342017710705","volume":"33","author":"T Yamazaki","year":"2019","unstructured":"Yamazaki, T., Igarashi, J., Makino, J., et al.: Real-time simulation of a cat-scale artificial cerebellum on pezy-sc processors. Int. J.High Performance Comput. Appl. 33(1), 155\u2013168 (2019)","journal-title":"Int. J.High Performance Comput. Appl."},{"issue":"21","key":"231_CR39","doi-asserted-by":"publisher","first-page":"3550","DOI":"10.3390\/electronics11213550","volume":"11","author":"X Yang","year":"2022","unstructured":"Yang, X., Su, T.: Efa-trans: an efficient and flexible acceleration architecture for transformers. Electronics 11(21), 3550 (2022)","journal-title":"Electronics"},{"key":"231_CR40","doi-asserted-by":"crossref","unstructured":"Yoshifuji, N., Sakamoto, R., Nitadori, K., et al.: Implementation and evaluation of data-compression algorithms for irregular-grid iterative methods on the pezy-sc processor (2016)","DOI":"10.1109\/IA3.2016.015"},{"key":"231_CR41","doi-asserted-by":"crossref","unstructured":"Zekri, A.S.: Enhancing the matrix transpose operation using intel avx instruction set extension. AIRCC\u2019s International Journal of Computer Science and Information Technology pp 67\u201378 (2014)","DOI":"10.5121\/ijcsit.2014.6305"}],"container-title":["CCF Transactions on High Performance Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s42514-025-00231-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s42514-025-00231-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s42514-025-00231-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T11:40:15Z","timestamp":1757158815000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s42514-025-00231-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,17]]},"references-count":41,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2025,8]]}},"alternative-id":["231"],"URL":"https:\/\/doi.org\/10.1007\/s42514-025-00231-4","relation":{},"ISSN":["2524-4922","2524-4930"],"issn-type":[{"type":"print","value":"2524-4922"},{"type":"electronic","value":"2524-4930"}],"subject":[],"published":{"date-parts":[[2025,4,17]]},"assertion":[{"value":"25 October 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 March 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 April 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"On behalf of all authors, the corresponding author states that there is no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}