{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T16:57:16Z","timestamp":1779382636995,"version":"3.53.1"},"reference-count":33,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,4]]},"DOI":"10.1109\/icassp.2018.8462105","type":"proceedings-article","created":{"date-parts":[[2018,9,21]],"date-time":"2018-09-21T22:24:48Z","timestamp":1537568688000},"page":"4774-4778","source":"Crossref","is-referenced-by-count":633,"title":["State-of-the-Art Speech Recognition with Sequence-to-Sequence Models"],"prefix":"10.1109","author":[{"given":"Chung-Cheng","family":"Chiu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tara N.","family":"Sainath","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yonghui","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rohit","family":"Prabhavalkar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Patrick","family":"Nguyen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhifeng","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Anjuli","family":"Kannan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ron J.","family":"Weiss","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kanishka","family":"Rao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ekaterina","family":"Gonina","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Navdeep","family":"Jaitly","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bo","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jan","family":"Chorowski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Michiel","family":"Bacchiani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref33","article-title":"Improving the Performance of Online Neural Transducer models","author":"sainath","year":"2018","journal-title":"Proceedings of ICASSP (accepted)"},{"key":"ref32","author":"abadi","year":"2015","journal-title":"Tensorflow Large-scale machine learning on heterogeneous distributed systems"},{"key":"ref31","article-title":"Neural Machine Translation by Jointly Learning to Align and Translate","author":"bahdanau","year":"2015","journal-title":"Proc ICLR"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/78.650093"},{"key":"ref10","article-title":"Attention Is All You Need","volume":"abs 1706 3762","author":"vaswani","year":"2017","journal-title":"CoRR"},{"key":"ref11","article-title":"Lattice-Based Optimization of Sequence Classification Criteria for Neural-Network Acoustic Modeling","author":"kingsbury","year":"2009","journal-title":"Proc ICASSP"},{"key":"ref12","article-title":"Minimum Word Error Rate Training for Attention-based Sequence-to-sequence Models","author":"prabhavalkar","year":"2018","journal-title":"Proceedings of ICASSP (accepted)"},{"key":"ref13","first-page":"1171","article-title":"Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks","author":"bengio","year":"2015","journal-title":"Proc NIPS"},{"key":"ref14","article-title":"Rethinking the inception architecture for computer vision","author":"szegedy","year":"2016","journal-title":"Proc of the IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"ref15","article-title":"Attention-Based Models for Speech Recognition","author":"chorowski","year":"2015","journal-title":"Proc NIPS"},{"key":"ref16","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2017-343","article-title":"Towards Better Decoding and Language Model Integration in Sequence to Sequence Models","author":"chorowski","year":"2017","journal-title":"Proc INTERSPEECH"},{"key":"ref17","article-title":"Large Scale Distributed Deep Networks","author":"dean","year":"2012","journal-title":"Proc NIPS"},{"key":"ref18","article-title":"Accurate, large minibatch SGD: training imagenet in 1 hour","volume":"abs 1706 2677","author":"goyal","year":"2017","journal-title":"CoRR"},{"key":"ref19","article-title":"No need for a lexicon? evaluating the value of the pronunciation lexica in end-to-end models","author":"sainath","year":"2018","journal-title":"Proceedings of ICASSP (accepted)"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-275"},{"key":"ref4","article-title":"On-line and Linear-Time Attention by Enforcing Monotonic Alignments","author":"raffel","year":"2017","journal-title":"Proc ICML"},{"key":"ref27","article-title":"Fast and Accurate Recurrent Neural Network Acoustic Models for Speech Recognition","author":"sak","year":"2015","journal-title":"Proc INTERSPEECH"},{"key":"ref3","article-title":"An Online Sequence-to-sequence Model Using Partial Conditioning","author":"jaitly","year":"2016","journal-title":"Proc NIPS"},{"key":"ref6","article-title":"A Comparison of Sequence-to-sequence Models for Speech Recognition","author":"prabhavalkar","year":"2017","journal-title":"Proc INTERSPEECH"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref5","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2017-1705","article-title":"Recurrent Neural Aligner: An Encoder-Decoder Neural Network Model for Sequence to Sequence Mapping","author":"sak","year":"2017","journal-title":"Proc INTERSPEECH"},{"key":"ref8","article-title":"Exploring Architectures, Data and Units for Streaming End-to-End Speech Recognition with RNN-Transducer","author":"rao","year":"2017","journal-title":"Proc ASRU"},{"key":"ref7","article-title":"Google's neural machine translation system: Bridging the gap between human and machine translation","volume":"abs 1609 8144","author":"wu","year":"2016","journal-title":"CoRR"},{"key":"ref2","article-title":"Listen, attend and spell","volume":"abs 1508 1211","author":"chan","year":"2015","journal-title":"CoRR"},{"key":"ref9","article-title":"Latent Sequence Decompositions","author":"chan","year":"2017","journal-title":"ICLRE"},{"key":"ref1","article-title":"Sequence transduction with recurrent neural networks","volume":"abs 1211 3711","author":"graves","year":"2012","journal-title":"CoRR"},{"key":"ref20","article-title":"An Analysis of Incorporating an External Language Model into a Sequence-to-Sequence Model","author":"kannan","year":"2018","journal-title":"Proceedings of ICASSP (accepted)"},{"key":"ref22","article-title":"End-to-End Attention-based Large Vocabulary Speech Recognition","author":"bahdanau","year":"2016","journal-title":"Proc ICASSP"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6289079"},{"key":"ref24","first-page":"1","article-title":"Minimum phone error and I-smoothing for improved discriminative training","volume":"1","author":"povey","year":"2002","journal-title":"Proc ICASSP IEEE"},{"key":"ref23","article-title":"Sequence level training with recurrent neural networks","author":"ranzato","year":"2016","journal-title":"Proc ICLR"},{"key":"ref26","article-title":"Bayesian language model interpolation for mobile speech input","author":"allauzen","year":"2011","journal-title":"InterSpeech"},{"key":"ref25","article-title":"Sequence to sequence learning with neural networks","author":"sutskever","year":"2014","journal-title":"Proc NIPS"}],"event":{"name":"ICASSP 2018 - 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Calgary, AB","start":{"date-parts":[[2018,4,15]]},"end":{"date-parts":[[2018,4,20]]}},"container-title":["2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8450881\/8461260\/08462105.pdf?arnumber=8462105","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,24]],"date-time":"2020-08-24T05:33:46Z","timestamp":1598247226000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8462105\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,4]]},"references-count":33,"URL":"https:\/\/doi.org\/10.1109\/icassp.2018.8462105","relation":{},"subject":[],"published":{"date-parts":[[2018,4]]}}}