{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T15:28:05Z","timestamp":1775230085290,"version":"3.50.1"},"reference-count":25,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,4]]},"DOI":"10.1109\/icassp.2018.8461893","type":"proceedings-article","created":{"date-parts":[[2018,9,21]],"date-time":"2018-09-21T22:24:48Z","timestamp":1537568688000},"page":"4819-4823","source":"Crossref","is-referenced-by-count":40,"title":["End-to-End Multi-Speaker Speech Recognition"],"prefix":"10.1109","author":[{"given":"Shane","family":"Settle","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jonathan Le","family":"Roux","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Takaaki","family":"Hori","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shinji","family":"Watanabe","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"John R.","family":"Hershey","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2008.11.001"},{"key":"ref11","article-title":"Learning Spectral Clustering, with Application to Speech Separation","volume":"7","author":"bach","year":"2006","journal-title":"The Journal of Machine Learning Research"},{"key":"ref12","author":"wang","year":"2006","journal-title":"Computational Auditory Scene Analysis Principles Algorithms and Applications"},{"key":"ref13","author":"yu","year":"2017","journal-title":"Rec-ognizing multi-talker speech with permutation invariant training"},{"key":"ref14","article-title":"Alternative Objective Functions for Deep Clustering","author":"wang","year":"2018","journal-title":"Proc IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2017.2726762"},{"key":"ref16","article-title":"Phase-Sensitive and Recognition-Boosted Speech Separation using Deep Recurrent Neural Networks","author":"erdogan","year":"2015","journal-title":"Proc IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref17","article-title":"Deep Clustering and Conventional Networks for Music Separation: Stronger Together","author":"luo","year":"2017","journal-title":"Proc IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref18","article-title":"Joint ctc-attention based end-to-end speech recognition using multi-task learning","author":"kim","year":"2017","journal-title":"IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref19","article-title":"Joint CTC\/attention decoding for end-to-end speech recognition","author":"hori","year":"0","journal-title":"Association for Computational Linguistics (ACL) 2017"},{"key":"ref4","author":"chorowski","year":"2016","journal-title":"Towards better decoding and language model integration in sequence to sequence models"},{"key":"ref3","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2017-1296","article-title":"Advances in joint CTC-attention based end-to-end speech recognition with a deep CNN encoder and RNN-LM","author":"hori","year":"2017","journal-title":"Proc INTERSPEECH"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-1176"},{"key":"ref5","article-title":"Deep Clustering: Discriminative Embeddings for Segmentation and Separation","author":"hershey","year":"2016","journal-title":"Proc IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref8","author":"chen","year":"2017","journal-title":"Speaker-independent speech separation with deep attractor network"},{"key":"ref7","article-title":"Deep Attractor Network for Single-Microphone Speaker Separation","author":"chen","year":"2017","journal-title":"Proc IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref2","author":"soltau","year":"2016","journal-title":"Neural speech recognizer Acoustic-to-word lstm model for large vocabulary speech recognition"},{"key":"ref9","article-title":"Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech Separation","author":"yu","year":"2017","journal-title":"Proc IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref1","author":"amodei","year":"2015","journal-title":"Deep speech 2 End-to-end speech recognition in english and mandarin"},{"key":"ref20","doi-asserted-by":"crossref","DOI":"10.1145\/1143844.1143891","article-title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","author":"graves","year":"2006","journal-title":"International Conference on Machine Learning (ICML)"},{"key":"ref22","article-title":"Chainer: a next-generation open source framework for deep learning","author":"tokui","year":"2015","journal-title":"Proceedings of Workshop on Machine Learning Systems (LearningSys) in NIPS"},{"key":"ref21","article-title":"Attention-based models for speech recognition","author":"chorowski","year":"0","journal-title":"Advances in Neural Information Processing Systems (NIPS) 2015"},{"key":"ref24","author":"zeiler","year":"2012","journal-title":"ADADELTA An Adaptive Learning Rate Method"},{"key":"ref23","author":"kingma","year":"2014","journal-title":"Adam A method for stochastic optimization"},{"key":"ref25","article-title":"Sequence to sequence learning with neural networks","author":"sutskever","year":"0","journal-title":"Advances in Neural Information Processing Systems (NIPS) 2014"}],"event":{"name":"ICASSP 2018 - 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Calgary, AB","start":{"date-parts":[[2018,4,15]]},"end":{"date-parts":[[2018,4,20]]}},"container-title":["2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8450881\/8461260\/08461893.pdf?arnumber=8461893","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,9,2]],"date-time":"2022-09-02T10:50:16Z","timestamp":1662115816000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8461893\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,4]]},"references-count":25,"URL":"https:\/\/doi.org\/10.1109\/icassp.2018.8461893","relation":{},"subject":[],"published":{"date-parts":[[2018,4]]}}}