{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T00:05:10Z","timestamp":1755907510674,"version":"3.44.0"},"publisher-location":"Cham","reference-count":26,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031998560","type":"print"},{"value":"9783031998577","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T00:00:00Z","timestamp":1755907200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T00:00:00Z","timestamp":1755907200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-031-99857-7_5","type":"book-chapter","created":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T05:17:36Z","timestamp":1755839856000},"page":"60-74","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["CoQMoE: Co-Designed Quantization and\u00a0Computation Orchestration for\u00a0Mixture-of-Experts Vision Transformer on\u00a0FPGA"],"prefix":"10.1007","author":[{"given":"Jiale","family":"Dong","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zihao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2240-6672","authenticated-orcid":false,"given":"Wenqi","family":"Lou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhendong","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Gong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9403-5575","authenticated-orcid":false,"given":"Chao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuehai","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,8,23]]},"reference":[{"key":"5_CR1","doi-asserted-by":"crossref","unstructured":"Chen et al.: Dearkd: data-efficient early knowledge distillation for vision transformers. In: CVPR, pp. 12052\u201312062 (2022)","DOI":"10.1109\/CVPR52688.2022.01174"},{"key":"5_CR2","doi-asserted-by":"crossref","unstructured":"Chen et al.: Adamv-moe: adaptive multi-task vision mixture-of-experts. In: ICCV, pp. 17346\u201317357 (2023)","DOI":"10.1109\/ICCV51070.2023.01591"},{"key":"5_CR3","doi-asserted-by":"crossref","unstructured":"Deng et al.: Imagenet: a large-scale hierarchical image database. In: CVPR, pp. 248\u2013255. IEEE (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"5_CR4","doi-asserted-by":"crossref","unstructured":"Dong J., et\u00a0al.: Ubimoe: A ubiquitous mixture-of-experts vision transformer accelerator with hybrid computation pattern on fpga. In: Proceedings of ISCAS, pp.\u00a01\u20135. IEEE (2025)","DOI":"10.1109\/ISCAS56072.2025.11043956"},{"key":"5_CR5","doi-asserted-by":"crossref","unstructured":"Dong et al.: Heatvit: hardware-efficient adaptive token pruning for vision transformers. In: HPCA, pp. 442\u2013455. IEEE (2023)","DOI":"10.1109\/HPCA56546.2023.10071047"},{"key":"5_CR6","doi-asserted-by":"crossref","unstructured":"Dong et al.: Swat: An efficient swin transformer accelerator based on fpga. In: ASP-DAC, pp. 515\u2013520. IEEE (2024)","DOI":"10.1109\/ASP-DAC58780.2024.10473931"},{"key":"5_CR7","unstructured":"Dosovitskiy et al.: An image is worth 16x16 words: transformers for image recognition at scale. arXiv (2020)"},{"key":"5_CR8","unstructured":"Fan et al.: M$$^3$$vit: mixture-of-experts vision transformer for efficient multi-task learning with model-accelerator co-design. NeurIPS 35, 28441\u201328457 (2022)"},{"key":"5_CR9","doi-asserted-by":"crossref","unstructured":"Guo et al.: Hg-pipe: vision transformer acceleration with hybrid-grained pipeline. arXiv (2024)","DOI":"10.1145\/3676536.3676681"},{"key":"5_CR10","doi-asserted-by":"crossref","unstructured":"Kim et al.: Monde: mixture of near-data experts for large-scale sparse models. In: DAC, pp.\u00a01\u20136 (2024)","DOI":"10.1145\/3649329.3655951"},{"key":"5_CR11","doi-asserted-by":"crossref","unstructured":"Li et al.: Repq-vit: scale reparameterization for post-training quantization of vision transformers. In: ICCV, pp. 17227\u201317236 (2023)","DOI":"10.1109\/ICCV51070.2023.01580"},{"key":"5_CR12","doi-asserted-by":"crossref","unstructured":"Lin et al.: Fq-vit: post-training quantization for fully quantized vision transformer. In: IJCAI, pp. 1173\u20131179 (2022)","DOI":"10.24963\/ijcai.2022\/164"},{"key":"5_CR13","unstructured":"Liu et al.: Post-training quantization for vision transformer. NeurIPS 34, 28092\u201328103 (2021)"},{"key":"5_CR14","doi-asserted-by":"crossref","unstructured":"Liu et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV, pp. 10012\u201310022 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"5_CR15","doi-asserted-by":"crossref","unstructured":"Lou et al.: Octcnn: a high throughput fpga accelerator for cnns using octave convolution algorithm. TC 71(8), 1847\u20131859 (2021)","DOI":"10.1109\/TC.2021.3110413"},{"key":"5_CR16","doi-asserted-by":"crossref","unstructured":"Qin et al.: Enhancing long sequence input processing in fpga-based transformer accelerators through attention fusion. In: GVLSI, pp. 599\u2013603 (2024)","DOI":"10.1145\/3649476.3658810"},{"key":"5_CR17","unstructured":"Riquelme et al.: Scaling vision with sparse mixture of experts. Adv. Neural. Inf. Process. Syst. 34, 8583\u20138595 (2021)"},{"key":"5_CR18","doi-asserted-by":"crossref","unstructured":"Sarkar et al.: Edge-moe: memory-efficient multi-task vision transformer architecture with task-level sparsity via mixture-of-experts. In: ICCAD, pp. 01\u201309. IEEE (2023)","DOI":"10.1109\/ICCAD57390.2023.10323651"},{"key":"5_CR19","doi-asserted-by":"crossref","unstructured":"Shi et al.: P$$^2$$-vit: power-of-two post-training quantization and acceleration for fully quantized vision transformer. In: TVLSI (2024)","DOI":"10.1109\/TVLSI.2024.3422684"},{"key":"5_CR20","doi-asserted-by":"crossref","unstructured":"Tai et al.: Tsptq-vit: two-scaled post-training quantization for vision transformer. In: ICASSP, pp.\u00a01\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10096817"},{"key":"5_CR21","doi-asserted-by":"crossref","unstructured":"Touvron et al.: Training data-efficient image transformers & distillation through attention. In: International Conference on Machine Learning, pp. 10347\u201310357 (2021)","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"5_CR22","doi-asserted-by":"crossref","unstructured":"Wang et al.: Via: a novel vision-transformer accelerator based on fpga. TCAD 41(11), 4088\u20134099 (2022)","DOI":"10.1109\/TCAD.2022.3197489"},{"key":"5_CR23","unstructured":"Xiao et al.: Smoothquant: accurate and efficient post-training quantization for large language models. In: ICML, pp. 38087\u201338099. PMLR (2023)"},{"key":"5_CR24","doi-asserted-by":"crossref","unstructured":"Xue et al.: Go wider instead of deeper. In: AAAI, vol.\u00a036, pp. 8779\u20138787 (2022)","DOI":"10.1609\/aaai.v36i8.20858"},{"key":"5_CR25","doi-asserted-by":"crossref","unstructured":"Ye et al.: Accelerating attention mechanism on fpgas based on efficient reconfigurable systolic array. TECS 22(6), 1\u201322 (2023)","DOI":"10.1145\/3549937"},{"key":"5_CR26","doi-asserted-by":"crossref","unstructured":"Yun et al.: Shvit: single-head vision transformer with memory efficient macro design. In: CVPR, pp. 5756\u20135767 (2024)","DOI":"10.1109\/CVPR52733.2024.00550"}],"container-title":["Lecture Notes in Computer Science","Euro-Par 2025: Parallel Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-99857-7_5","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T05:17:51Z","timestamp":1755839871000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-99857-7_5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8,23]]},"ISBN":["9783031998560","9783031998577"],"references-count":26,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-99857-7_5","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8,23]]},"assertion":[{"value":"23 August 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"The authors have no competing interests to declare that are relevant to the content of this article.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Disclosure of Interests"}},{"value":"Euro-Par","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Parallel Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Dresden","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"25 April 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 April 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"31","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"europar2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/2025.euro-par.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}