{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T10:28:12Z","timestamp":1777544892436,"version":"3.51.4"},"reference-count":37,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017,3]]},"DOI":"10.1109\/icassp.2017.7953248","type":"proceedings-article","created":{"date-parts":[[2017,6,20]],"date-time":"2017-06-20T21:35:36Z","timestamp":1497994536000},"page":"5700-5704","source":"Crossref","is-referenced-by-count":18,"title":["Sequence-to-sequence models for punctuated transcription combining lexical and acoustic features"],"prefix":"10.1109","author":[{"given":"Ondrej","family":"Klejch","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Peter","family":"Bell","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steve","family":"Renals","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","article-title":"Blocks and fuel: Frameworks for deep learning","author":"van merri\u00ebnboer","year":"2015","journal-title":"ar Xiv preprint arXiv 1506 07310"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2015.7404863"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/P14-1068"},{"key":"ref30","first-page":"1929","article-title":"Dropout: a simple way to prevent neural networks from overfitting","volume":"15","author":"srivastava","year":"2014","journal-title":"Journal of Machine Learning Research"},{"key":"ref37","article-title":"Statistical significance tests for machine translation evaluation","author":"koehn","year":"2004","journal-title":"EMNLP"},{"key":"ref36","article-title":"The Kaldi speech recognition toolkit","author":"povey","year":"2011","journal-title":"ASRU"},{"key":"ref35","article-title":"ADADELTA: an adaptive learning rate method","author":"zeiler","year":"2012","journal-title":"arXiv preprint arXiv 1212 5701"},{"key":"ref34","article-title":"Gated feedback recurrent neural networks","author":"chung","year":"2015","journal-title":"ar Xiv p rep rint arXiv 1502 02367"},{"key":"ref10","article-title":"Punctuation annotation using statistical prosody models","author":"christensen","year":"2001","journal-title":"ISCA Workshop on Prosody in Speech Recognition and Understanding"},{"key":"ref11","article-title":"Maximum entropy model for punctuation annotation from speech","author":"huang","year":"2002","journal-title":"InterSpeech"},{"key":"ref12","article-title":"Automatic punctuation annotation in Czech broadcast news speech","author":"kol\u00e1?","year":"2004","journal-title":"SPECOM"},{"key":"ref13","article-title":"Development and evaluation of automatic punctuation for French and English speech-to-text","author":"kol\u00e1?","year":"2012","journal-title":"InterSpeech"},{"key":"ref14","article-title":"Better punctuation prediction with dynamic conditional random fields","author":"lu","year":"2010","journal-title":"EMNLP"},{"key":"ref15","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2013-675","article-title":"Improved models for automatic punctuation prediction for spoken and written text","author":"ueffing","year":"2013","journal-title":"InterSpeech"},{"key":"ref16","article-title":"Combination of NN and CRF models for joint detection of punctuation and disfiuencies","author":"cho","year":"2015","journal-title":"InterSpeech"},{"key":"ref17","article-title":"LSTM for punctuation restoration in speech transcripts","author":"tilk","year":"2015","journal-title":"InterSpeech"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-1517"},{"key":"ref19","article-title":"Modeling punctuation prediction as machine translation","author":"peitz","year":"2011","journal-title":"IWSLT"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W16-2209"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607773"},{"key":"ref27","article-title":"Neural machine translation by jointly learning to align and translate","author":"bahdanau","year":"2014","journal-title":"arXiv preprint arXiv 1409 0473"},{"key":"ref3","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.9883","article-title":"Building end-to-end dialogue systems using generative hierarchical neural network models","author":"serban","year":"2016","journal-title":"AAAI"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1998.675358"},{"key":"ref29","article-title":"Character-based neural machine translation","author":"ling","year":"2015","journal-title":"arXiv preprint arXiv 1511 05271"},{"key":"ref5","article-title":"Automatic detection of sentence boundaries and disfiuencies based on recognized words","author":"stolcke","year":"1998","journal-title":"ICSLP"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4960690"},{"key":"ref7","article-title":"The use of prosody in a combined system for punctuation generation and speech recognition","author":"kim","year":"2001","journal-title":"InterSpeech"},{"key":"ref2","article-title":"Sequence to sequence learning with neural networks","author":"sutskever","year":"2014","journal-title":"NIPS"},{"key":"ref9","article-title":"Sentence boundary detection in broadcast speech transcripts","author":"gotoh","year":"2000"},{"key":"ref1","author":"klejch","year":"2016","journal-title":"SLT"},{"key":"ref20","article-title":"Segmentation and punctuation prediction in speech language translation using a monolingual translation system","author":"cho","year":"2012","journal-title":"IWSLT"},{"key":"ref22","article-title":"Noise-matched training of CRF based sentence end detection models","author":"hasan","year":"2015","journal-title":"InterSpeech"},{"key":"ref21","article-title":"Automated production of true-cased punctuated subtitles for weather and news broadcasts","author":"driesen","year":"2014","journal-title":"InterSpeech"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N16-1004"},{"key":"ref23","doi-asserted-by":"crossref","DOI":"10.1109\/LSP.2014.2325781","article-title":"Convolutional neural networks for distant speech recognition","author":"swietojanski","year":"2014","journal-title":"Signal Processing Letters"},{"key":"ref26","article-title":"Multi-task sequence to sequence learning","author":"luong","year":"2015","journal-title":"arXiv preprint arXiv 1511 05271"},{"key":"ref25","article-title":"Multi-language image description with neural sequence models","author":"elliott","year":"2015","journal-title":"ar Xiv preprint arXiv 1510 04709"}],"event":{"name":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"New Orleans, LA","start":{"date-parts":[[2017,3,5]]},"end":{"date-parts":[[2017,3,9]]}},"container-title":["2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7943262\/7951776\/07953248.pdf?arnumber=7953248","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T20:58:14Z","timestamp":1750366694000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7953248\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,3]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/icassp.2017.7953248","relation":{},"subject":[],"published":{"date-parts":[[2017,3]]}}}