{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,30]],"date-time":"2025-10-30T06:22:32Z","timestamp":1761805352834},"publisher-location":"Cham","reference-count":14,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319700953"},{"type":"electronic","value":"9783319700960"}],"license":[{"start":{"date-parts":[[2017,1,1]],"date-time":"2017-01-01T00:00:00Z","timestamp":1483228800000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017]]},"DOI":"10.1007\/978-3-319-70096-0_7","type":"book-chapter","created":{"date-parts":[[2017,10,25]],"date-time":"2017-10-25T01:33:18Z","timestamp":1508895198000},"page":"64-72","source":"Crossref","is-referenced-by-count":1,"title":["Two-Stage Temporal Multimodal Learning for Speaker and Speech Recognition"],"prefix":"10.1007","author":[{"given":"Qianli","family":"Ma","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lifeng","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruishi","family":"Su","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jieyu","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,10,26]]},"reference":[{"key":"7_CR1","doi-asserted-by":"crossref","unstructured":"Amer, M.R., Siddiquie, B., Khan, S., Divakaran, A., Sawhney, H.: Multimodal fusion using dynamic hybrid models. In: IEEE Winter Conference on Applications of Computer Vision, pp. 556\u2013563, March 2014","DOI":"10.1109\/WACV.2014.6836053"},{"key":"7_CR2","doi-asserted-by":"crossref","unstructured":"Bauml, M., Tapaswi, M., Stiefelhagen, R.: Semi-supervised learning with constraints for person identification in multimedia data. In: The IEEE Conference on Computer Vision and Pattern Recognition (CVPR), June 2013","DOI":"10.1109\/CVPR.2013.462"},{"issue":"7","key":"7_CR3","doi-asserted-by":"crossref","first-page":"1527","DOI":"10.1162\/neco.2006.18.7.1527","volume":"18","author":"GE Hinton","year":"2006","unstructured":"Hinton, G.E., Osindero, S., Teh, Y.W.: A fast learning algorithm for deep belief nets. Neural Comput. 18(7), 1527\u20131554 (2006)","journal-title":"Neural Comput."},{"issue":"8","key":"7_CR4","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"issue":"12","key":"7_CR5","doi-asserted-by":"crossref","first-page":"5659","DOI":"10.1109\/TIP.2015.2487860","volume":"24","author":"C Hong","year":"2015","unstructured":"Hong, C., Yu, J., Wan, J., Tao, D., Wang, M.: Multimodal deep autoencoder for human pose recovery. IEEE Trans. Image Process. 24(12), 5659\u20135670 (2015)","journal-title":"IEEE Trans. Image Process."},{"key":"7_CR6","doi-asserted-by":"crossref","unstructured":"Hu, D., Li, X., Lu, X.: Temporal multimodal learning in audiovisual speech recognition. In: The IEEE Conference on Computer Vision and Pattern Recognition (CVPR), June 2016","DOI":"10.1109\/CVPR.2016.389"},{"key":"7_CR7","doi-asserted-by":"publisher","unstructured":"Hu, Y., Ren, J.S., Dai, J., Yuan, C., Xu, L., Wang, W.: Deep multimodal speaker naming. In: Proceedings of the 23rd ACM International Conference on Multimedia, MM 2015, NY, USA, pp. 1107\u20131110 (2015). doi: 10.1145\/2733373.2806293","DOI":"10.1145\/2733373.2806293"},{"key":"7_CR8","doi-asserted-by":"crossref","unstructured":"Huang, J., Kingsbury, B.: Audio-visual deep learning for noise robust speech recognition. In: IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 7596\u20137599 (2013)","DOI":"10.1109\/ICASSP.2013.6639140"},{"key":"7_CR9","unstructured":"Jamil, M., Rahman, G.R.S.: Speaker identification using Mel frequency cepstral coefficients (2004)"},{"key":"7_CR10","unstructured":"Ngiam, J., Khosla, A., Kim, M., Nam, J., Lee, H., Ng, A.Y.: Multimodal deep learning. In: International Conference on Machine Learning, ICML 2011, Bellevue, Washington, USA, June 28\u2013July 2, pp. 689\u2013696 (2011)"},{"key":"7_CR11","doi-asserted-by":"crossref","unstructured":"Ren, J., Hu, Y., Tai, Y.W., Wang, C., Xu, L., Sun, W., Yan, Q.: Look, listen and learn \u2013 a multimodal LSTM for speaker identification. In: Proceedings of the Thirtieth AAAI Conference on Artificial Intelligence, AAAI 2016, pp. 3581\u20133587. AAAI Press (2016)","DOI":"10.1609\/aaai.v30i1.10471"},{"key":"7_CR12","unstructured":"Sohn, K., Shang, W., Lee, H.: Improved multimodal deep learning with variation of information. In: International Conference on Neural Information Processing Systems, pp. 2141\u20132149 (2014)"},{"key":"7_CR13","first-page":"2949","volume":"15","author":"N Srivastava","year":"2014","unstructured":"Srivastava, N., Salakhutdinov, R.: Multimodal learning with deep boltzmann machines. J. Mach. Learn. Res. 15, 2949\u20132980 (2014). http:\/\/jmlr.org\/papers\/v15\/srivastava14b.html","journal-title":"J. Mach. Learn. Res."},{"key":"7_CR14","unstructured":"Stiefelhagen, R.: \u201cKnock! knock! who is it?\u201d probabilistic person identification in TV-series. In: Proceedings of the 2012 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), CVPR 2012, pp. 2658\u20132665 (2012). http:\/\/dl.acm.org\/citation.cfm?id=2354409.2354974"}],"container-title":["Lecture Notes in Computer Science","Neural Information Processing"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-70096-0_7","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,5]],"date-time":"2022-08-05T07:26:16Z","timestamp":1659684376000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-70096-0_7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017]]},"ISBN":["9783319700953","9783319700960"],"references-count":14,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-70096-0_7","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2017]]}}}