{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T20:21:56Z","timestamp":1782937316663,"version":"3.54.5"},"reference-count":65,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Science and Technology Council","award":["112-2628-E-002-026"],"award-info":[{"award-number":["112-2628-E-002-026"]}]},{"name":"National Science and Technology Council","award":["110-2223-E-002-007-MY3"],"award-info":[{"award-number":["110-2223-E-002-007-MY3"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2024]]},"DOI":"10.1109\/taslp.2024.3451977","type":"journal-article","created":{"date-parts":[[2024,9,12]],"date-time":"2024-09-12T18:02:04Z","timestamp":1726164124000},"page":"4121-4133","source":"Crossref","is-referenced-by-count":2,"title":["Improving Non-Autoregressive Translation Quality With Pretrained Language Model, Embedding Distillation and Upsampling Strategy for CTC"],"prefix":"10.1109","volume":"32","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-5307-3572","authenticated-orcid":false,"given":"Shen-sian","family":"Syu","sequence":"first","affiliation":[{"name":"National Taiwan University, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-6292-0585","authenticated-orcid":false,"given":"Juncheng","family":"Xie","sequence":"additional","affiliation":[{"name":"National Taiwan University, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9654-5747","authenticated-orcid":false,"given":"Hung-yi","family":"Lee","sequence":"additional","affiliation":[{"name":"National Taiwan University, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-343"},{"key":"ref2","article-title":"Neural machine translation by jointly learning to align and translate","volume":"abs\/1409.0473","author":"Bahdanau","year":"2014","journal-title":"CoRR"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref4","first-page":"1","article-title":"Non-autoregressive neural machine translation","volume-title":"Proc. 6th Int. Conf. Learn. Representations","author":"Gu","year":"2018"},{"key":"ref5","first-page":"5976","article-title":"Insertion transformer: Flexible sequence generation via insertion operations","volume-title":"Proc. 36th Int. Conf. Mach. Learn.","author":"Stern","year":"2019"},{"key":"ref6","first-page":"11179","article-title":"Levenshtein transformer","volume-title":"Proc. 32nd Annu. Conf. Neural Inf. Process. Syst.","author":"Gu","year":"2019"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6413"},{"key":"ref8","first-page":"3016","article-title":"End-to-end non-autoregressive neural machine translation with connectionist temporal classification","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Libovick","year":"2018"},{"key":"ref9","first-page":"1098","article-title":"Non-autoregressive machine translation with latent alignments","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Saharia","year":"2020"},{"key":"ref10","first-page":"120","article-title":"Fully non-autoregressive neural machine translation: Tricks of the trade","volume-title":"Proc. Assoc. Comput. Linguistics","author":"Gu","year":"2021"},{"key":"ref11","first-page":"3779","article-title":"One reference is not enough: Diverse distillation with reference selection for non-autoregressive translation","volume-title":"Proc. Conf. North Amer. Chapter Assoc. Comput. Linguistics- Hum. Lang. Technol.","author":"Shao","year":"2022"},{"key":"ref12","first-page":"8159","article-title":"Non-monotonic latent alignments for CTC-based non-autoregressive machine translation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Shao","year":"2022"},{"key":"ref13","first-page":"6934","article-title":"XLM-D: Decorate cross-lingual pre-training model as non-autoregressive neural machine translation","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Wang","year":"2022"},{"key":"ref14","first-page":"2883","article-title":"Dynamic and efficient inference for text generation via BERT family","volume-title":"Proc. 61st Annu. Meeting Assoc. Comput. Linguistics","author":"Liang","year":"2023"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143891"},{"key":"ref16","article-title":"Understanding knowledge distillation in non-autoregressive machine translation","author":"Zhou","year":"2021"},{"key":"ref17","first-page":"1317","article-title":"Sequence-level knowledge distillation","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Kim","year":"2016"},{"key":"ref18","first-page":"1173","article-title":"Deterministic non-autoregressive neural sequence modeling by iterative refinement","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Lee","year":"2018"},{"key":"ref19","first-page":"6112","article-title":"Mask-predict: Parallel decoding of conditional masked language models","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process. 9th Int. Joint Conf. Natural Lang. Process.","author":"Ghazvininejad","year":"2019"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i11.26615"},{"key":"ref21","article-title":"Cross-lingual language model pretraining","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"32","author":"Conneau","year":"2019"},{"key":"ref22","first-page":"6486","article-title":"MaSS: A large and clean multilingual corpus of sentence-aligned spoken utterances extracted from the Bible","volume-title":"Proc. 12th Lang. Res. Eval. Conf.","author":"Boito","year":"2020"},{"key":"ref23","first-page":"726","article-title":"Multilingual denoising pre-training for neural machine translation","volume-title":"Trans. Assoc. Comput. Linguistics","volume":"8","author":"Liu","year":"2020"},{"key":"ref24","first-page":"483","article-title":"mT5: A massively multilingual pre-trained text-to-text transformer","volume-title":"Proc. Conf. North Amer. Chapter Assoc. Comput. Linguistics- Hum. Lang. Technol.","author":"Xue","year":"2021"},{"key":"ref25","first-page":"6379","article-title":"Universal conditional masked language pre-training for neural machine translation","volume-title":"Proc. 60th Annu. Meeting Assoc. Comput. Linguistics","author":"Li","year":"2022"},{"key":"ref26","first-page":"264","article-title":"Leveraging pre-trained checkpoints for sequence generation tasks","volume-title":"Trans. Assoc. Comput. Linguistics","volume":"8","author":"Rothe","year":"2020"},{"key":"ref27","article-title":"Incorporating bert into neural machine translation","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhu","year":"2020"},{"key":"ref28","article-title":"Incorporating bert into parallel sequence decoding with adapters","volume-title":"Proc. 34th Int. Conf. Neural Inf. Process. Syst.","author":"Guo","year":"2020"},{"key":"ref29","first-page":"234","article-title":"Non-autoregressive text generation with pre-trained language models","volume-title":"Proc. 16th Conf. Eur. Chapter Assoc. Comput. Linguistics","author":"Su","year":"2021"},{"key":"ref30","first-page":"5998","article-title":"Attention is all you need","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Vaswani","year":"2017"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3277122"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143891"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638947"},{"key":"ref34","doi-asserted-by":"crossref","first-page":"1304","DOI":"10.18653\/v1\/P19-1125","article-title":"Imitation learning for non-autoregressive neural machine translation","volume-title":"Proc. 57th Annu. Meeting Assoc. Comput. Linguistics","author":"Wei","year":"2019"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143891"},{"key":"ref36","first-page":"1403","article-title":"Imputer: Sequence modelling via imputation and dynamic programming","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chan","year":"2020"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1002\/nav.3800020109"},{"key":"ref38","first-page":"2849","article-title":"Order-agnostic cross entropy for non-autoregressive machine translation","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","author":"Du","year":"2021"},{"key":"ref39","first-page":"6663","volume-title":"Proc. 2021 Conf. Empirical Methods Natural Lang. Process.","author":"Xu","year":"2021"},{"key":"ref40","first-page":"2","article-title":"Report on the 11th IWSLT evaluation campaign","volume-title":"Proc. 11th Int. Workshop Spoken Lang. Transl., Eval. Campaign","author":"Cettolo","year":"2014"},{"key":"ref41","first-page":"131","article-title":"Findings of the 2016 conference on machine translation","volume-title":"Proc. 1st Conf. Mach. Transl.","author":"Bojar","year":"2016"},{"key":"ref42","doi-asserted-by":"crossref","first-page":"12","DOI":"10.3115\/v1\/W14-3302","article-title":"Findings of the 2014 workshop on statistical machine translation","volume-title":"Proc. 9th Workshop Statist. Mach. Transl.","author":"Bojar","year":"2014"},{"key":"ref43","first-page":"584","article-title":"Language models not just for pre-training: Fast online neural noisy channel modeling","volume-title":"Proc. 5th Conf. Mach. Transl.","author":"Bhosale","year":"2020"},{"key":"ref44","first-page":"4171","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","volume-title":"Proc. Conf. North Amer. Chapter Assoc. Comput. Linguistics- Hum. Lang. Technol.","author":"Devlin","year":"2019"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-4009"},{"key":"ref46","first-page":"38","article-title":"Transformers: State-of-the-art natural language processing","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process. Syst. Demonstrations","author":"Wolf","year":"2020"},{"key":"ref47","first-page":"311","article-title":"Bleu: A method for automatic evaluation of machine translation","volume-title":"Proc. 40th Annu. Meeting Assoc. Comput. Linguistics","author":"Papineni","year":"2002"},{"key":"ref48","first-page":"187","article-title":"KenLM: Faster and smaller language model queries","volume-title":"Proc. 6th Workshop Statist. Mach. Transl.","author":"Heafield","year":"2011"},{"key":"ref49","doi-asserted-by":"crossref","first-page":"376","DOI":"10.18653\/v1\/2020.acl-main.36","article-title":"Jointly masked sequence-to-sequence model for non-autoregressive neural machine translation","volume-title":"Proc. 58th Annu. Meeting Assoc. Comput. Linguistics","author":"Guo","year":"2020"},{"key":"ref50","article-title":"Improving non-autoregressive translation models without distillation","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Huang","year":"2021"},{"key":"ref51","first-page":"1993","article-title":"Glancing transformer for non-autoregressive neural machine translation","volume-title":"Proc. 59th Annu. Meeting Assoc. Comput. Linguistics 11th Int. Joint Conf. Natural Lang. Process.","author":"Qian","year":"2021"},{"key":"ref52","article-title":"LAVA NAT: A7 non-autoregressive translation model with look-around decoding and vocabulary attention","author":"Li","year":"2020"},{"key":"ref53","article-title":"Incorporating bert into neural machine translation","author":"Zhu","year":"2020"},{"key":"ref54","article-title":"Parallel machine translation with disentangled context transformer","author":"Kasai","year":"2000"},{"key":"ref55","first-page":"3297","article-title":"Learning to rewrite for non-autoregressive neural machine translation","volume-title":"Proc. 2021 Conf. Empirical Methods Natural Lang. Process.","author":"Geng","year":"2021"},{"key":"ref56","first-page":"9410","article-title":"Directed acyclic transformer for non-autoregressive machine translation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Huang","year":"2022"},{"key":"ref57","first-page":"5377","article-title":"Non-autoregressive machine translation with auxiliary regularization","volume-title":"Proc. AAAI Conf. Artif. Intell.","author":"Wang","year":"2019"},{"key":"ref58","first-page":"3016","article-title":"Fast structured decoding for sequence models","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Sun","year":"2019"},{"key":"ref59","first-page":"1","article-title":"AligNART: Non-autoregressive neural machine translation by jointly learning to estimate alignment and translate","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Song","year":"2021"},{"key":"ref60","article-title":"Levenshtein transformer","volume-title":"Proc. Neural Inf. Process. Syst.","author":"Gu","year":"2019"},{"key":"ref61","first-page":"597","article-title":"On the computational complexity of self-attention","volume-title":"Int. Conf. Algorithmic Learn. Theory","author":"Keles","year":"2022"},{"key":"ref62","first-page":"325","article-title":"A shortest augmenting path algorithm for dense and sparse linear assignment problems","volume-title":"Computing","volume":"38","author":"Jonker","year":"1987"},{"key":"ref63","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","author":"Raffel","year":"2019"},{"key":"ref64","first-page":"20989","article-title":"Sparse and continuous attention mechanisms","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Martins","year":"2020"},{"key":"ref65","doi-asserted-by":"crossref","first-page":"35","DOI":"10.18653\/v1\/2022.acl-demo.4","article-title":"TextPruner: A model pruning toolkit for pre-trained language models","volume-title":"Proc. 60th Annu. Meeting Assoc. Comput. Linguistics Syst. Demonstrations","author":"Yang","year":"2022"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6570655\/10304349\/10679261.pdf?arnumber=10679261","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,22]],"date-time":"2024-09-22T04:03:59Z","timestamp":1726977839000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10679261\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"references-count":65,"URL":"https:\/\/doi.org\/10.1109\/taslp.2024.3451977","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024]]}}}