{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,24]],"date-time":"2026-02-24T17:05:25Z","timestamp":1771952725259,"version":"3.50.1"},"reference-count":37,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,12]]},"DOI":"10.1109\/slt.2018.8639664","type":"proceedings-article","created":{"date-parts":[[2019,2,14]],"date-time":"2019-02-14T18:36:34Z","timestamp":1550169394000},"page":"397-404","source":"Crossref","is-referenced-by-count":7,"title":["Acoustic-to-Word Recognition with Sequence-to-Sequence Models"],"prefix":"10.1109","author":[{"given":"Shruti","family":"Palaskar","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Florian","family":"Metze","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","article-title":"On using monolingual corpora in neural machine translation","author":"gulcehre","year":"2015","journal-title":"arXiv preprint arXiv 1503"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2017.2763455"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953075"},{"key":"ref30","article-title":"Adadelta: an adaptive learning rate method","author":"zeiler","year":"2012","journal-title":"arXiv preprint arXiv 1212 5701"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-1118"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-1683"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953069"},{"key":"ref34","article-title":"Deep speech: Scaling up end-to-end speech recognition","author":"hannun","year":"2014","journal-title":"arXiv preprint arXiv 1412 5567"},{"key":"ref10","article-title":"Neural speech recognizer: Acoustic-to-word lstm model for large vocabulary speech recognition","author":"soltau","year":"2016","journal-title":"arXiv preprint arXiv 1610 09975"},{"key":"ref11","article-title":"Subword and crossword units for ctc acoustic models","author":"zenkel","year":"2017","journal-title":"arXiv preprint arXiv 1712 06855"},{"key":"ref12","article-title":"State-of-the-art speech recognition with sequence-to-sequence models","author":"chiu","year":"2017","journal-title":"arXiv preprint arXiv 1712 01769"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472641"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461361"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462576"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2018-1616"},{"key":"ref17","article-title":"Neural machine translation of rare words with subword units","author":"sennrich","year":"2015","journal-title":"arXiv preprint arXiv 1508 07909"},{"key":"ref18","article-title":"Latent sequence decompositions","author":"chan","year":"2016","journal-title":"arXiv preprint arXiv 1610 01292"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2018-2341"},{"key":"ref28","first-page":"23","article-title":"A new algorithm for data compression","volume":"12","author":"gage","year":"1994","journal-title":"C\/C++ Users J"},{"key":"ref4","article-title":"Sequence to sequence learning with neural networks","author":"sutskever","year":"2014","journal-title":"Proc NIPS"},{"key":"ref27","doi-asserted-by":"crossref","first-page":"517","DOI":"10.1109\/ICASSP.1992.225858","article-title":"Switchboard: Telephone speech corpus for research and development","volume":"1","author":"godfrey","year":"1992","journal-title":"Acoustics Speech and Signal Processing 1992 ICASSP-92 1992 IEEE International Conference on"},{"key":"ref3","article-title":"Towards end-to-end speech recognition with recurrent neural networks","author":"graves","year":"2014","journal-title":"Proc ICML"},{"key":"ref6","first-page":"6000","article-title":"Attention is all you need","author":"vaswani","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref29","first-page":"69","article-title":"The fisher corpus: a resource for the next generations of speech-to-text","volume":"4","author":"cieri","year":"2004","journal-title":"LREC"},{"key":"ref5","article-title":"End-to-end continuous speech recognition using attention-based recurrent NN: First results","author":"chorowski","year":"2014","journal-title":"arXiv preprint arXiv 1412 1602"},{"key":"ref8","article-title":"Direct acoustics-to-word models for english conversational speech recognition","author":"audhkhasi","year":"2017","journal-title":"arXiv preprint arXiv 1703 06870"},{"key":"ref7","doi-asserted-by":"crossref","first-page":"193","DOI":"10.1109\/ASRU.2017.8268935","article-title":"Exploring architectures, data and units for streaming end-to-end speech recognition with rnn-transducer","author":"rao","year":"2017","journal-title":"IEEE Workshop on Automatic Speech Recognition and Understanding (ASRU)"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143891"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462017"},{"key":"ref1","article-title":"Building competitive direct acoustics-to-word models for english conversational speech recognition","author":"audhkhasi","year":"2017","journal-title":"arXiv preprint arXiv 1712 03133"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472619"},{"key":"ref22","article-title":"Word embeddings for speech recognition","author":"bengio","year":"2014","journal-title":"Fifteenth Annual Conference of the International Speech Communication Association"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2015.7404800"},{"key":"ref24","first-page":"577","article-title":"Attention-based models for speech recognition","author":"chorowski","year":"2015","journal-title":"Advances in neural information processing systems"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472621"},{"key":"ref26","article-title":"Towards better decoding and language model integration in sequence to sequence models","author":"chorowski","year":"2016","journal-title":"arXiv preprint arXiv 1612 02695"},{"key":"ref25","article-title":"Regularizing neural networks by penalizing confident output distributions","author":"pereyra","year":"2017","journal-title":"arXiv preprint arXiv 1701 00295"}],"event":{"name":"2018 IEEE Spoken Language Technology Workshop (SLT)","location":"Athens, Greece","start":{"date-parts":[[2018,12,18]]},"end":{"date-parts":[[2018,12,21]]}},"container-title":["2018 IEEE Spoken Language Technology Workshop (SLT)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8632666\/8639030\/08639664.pdf?arnumber=8639664","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,3,18]],"date-time":"2019-03-18T21:28:22Z","timestamp":1552944502000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8639664\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,12]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/slt.2018.8639664","relation":{},"subject":[],"published":{"date-parts":[[2018,12]]}}}