{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T18:42:10Z","timestamp":1776883330186,"version":"3.51.2"},"publisher-location":"Cham","reference-count":25,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783319573502","type":"print"},{"value":"9783319573519","type":"electronic"}],"license":[{"start":{"date-parts":[[2017,1,1]],"date-time":"2017-01-01T00:00:00Z","timestamp":1483228800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017]]},"DOI":"10.1007\/978-3-319-57351-9_30","type":"book-chapter","created":{"date-parts":[[2017,4,10]],"date-time":"2017-04-10T15:08:53Z","timestamp":1491836933000},"page":"260-271","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":25,"title":["Speech Intention Classification with Multimodal Deep Learning"],"prefix":"10.1007","author":[{"given":"Yue","family":"Gu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinyu","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuhong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianyu","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ivan","family":"Marsic","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,4,11]]},"reference":[{"key":"30_CR1","unstructured":"De Ruiter, J.P., Cummins, C.: A model of intentional communication: AIRBUS (asymmetric intention recognition with Bayesian updating of signals). In: Proceedings of SemDial 2012, pp. 149\u2013150 (2012)"},{"key":"30_CR2","unstructured":"Mikolov, T., Sutskever, I., Chen, K., Corrado, G.S., Dean, J.: Distributed representations of words and phrases and their compositionality. In: Advances in Neural Information Processing Systems, pp. 3111\u20133119 (2013)"},{"key":"30_CR3","doi-asserted-by":"publisher","first-page":"1533","DOI":"10.1109\/TASLP.2014.2339736","volume":"22","author":"O Abdel-Hamid","year":"2014","unstructured":"Abdel-Hamid, O., Mohamed, A.-R., Jiang, H., Deng, L., Penn, G., Yu, D.: Convolutional neural networks for speech recognition. IEEE\/ACM Trans. Audio Speech Lang. Process. 22, 1533\u20131545 (2014)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"30_CR4","doi-asserted-by":"crossref","unstructured":"Kim, Y.: Convolutional neural networks for sentence classification. In: Proceedings of 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP) (2014)","DOI":"10.3115\/v1\/D14-1181"},{"key":"30_CR5","doi-asserted-by":"publisher","first-page":"16","DOI":"10.1109\/MSP.2005.1511821","volume":"22","author":"Y-Y Wang","year":"2005","unstructured":"Wang, Y.-Y., Deng, L., Acero, A.: Spoken language understanding. IEEE Sig. Process. Mag. 22, 16\u201331 (2005)","journal-title":"IEEE Sig. Process. Mag."},{"key":"30_CR6","doi-asserted-by":"crossref","unstructured":"Tur, G., Mori, R.D.: Introduction. In: Spoken Language Understanding. pp. 1\u20137 (2011)","DOI":"10.1002\/9781119992691.ch1"},{"key":"30_CR7","doi-asserted-by":"crossref","unstructured":"Williams, J.D., Kamal, E., Ashour, M., Amr, H., Miller, J., Zweig, G.: Fast and easy language understanding for dialog systems with Microsoft language understanding intelligent service (LUIS). In: Proceedings of 16th Annual Meeting of the Special Interest Group on Discourse and Dialogue (2015)","DOI":"10.18653\/v1\/W15-4622"},{"key":"30_CR8","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1561\/1500000011","volume":"2","author":"B Pang","year":"2008","unstructured":"Pang, B., Lee, L.: Opinion mining and sentiment analysis. Found. Trends\u00ae Inf. Retr. 2, 1\u2013135 (2008)","journal-title":"Found. Trends\u00ae Inf. Retr."},{"key":"30_CR9","doi-asserted-by":"publisher","first-page":"572","DOI":"10.1016\/j.patcog.2010.09.020","volume":"44","author":"ME Ayadi","year":"2011","unstructured":"Ayadi, M.E., Kamel, M.S., Karray, F.: Survey on speech emotion recognition: features, classification schemes, and databases. Pattern Recogn. 44, 572\u2013587 (2011)","journal-title":"Pattern Recogn."},{"key":"30_CR10","doi-asserted-by":"publisher","first-page":"109","DOI":"10.1007\/s10772-009-9023-y","volume":"10","author":"W Minker","year":"2007","unstructured":"Minker, W., Pittermann, J., Pittermann, A., Strau\u00df, P.-M., B\u00fchler, D.: Challenges in speech-based human\u2013computer interfaces. Int. J. Speech Technol. 10, 109\u2013119 (2007)","journal-title":"Int. J. Speech Technol."},{"issue":"2","key":"30_CR11","first-page":"45","volume":"9","author":"ZJ Chuang","year":"2004","unstructured":"Chuang, Z.J., Wu, C.H.: Multi-modal emotion recognition from speech and text. Comput. Linguist. Chin. Lang. Process. 9(2), 45\u201362 (2004)","journal-title":"Comput. Linguist. Chin. Lang. Process."},{"key":"30_CR12","doi-asserted-by":"publisher","first-page":"50","DOI":"10.1016\/j.neucom.2015.01.095","volume":"174","author":"S Poria","year":"2016","unstructured":"Poria, S., Cambria, E., Howard, N., Huang, G.-B., Hussain, A.: Fusing audio, visual and textual clues for sentiment analysis from multimodal content. Neurocomputing 174, 50\u201359 (2016)","journal-title":"Neurocomputing"},{"key":"30_CR13","doi-asserted-by":"crossref","unstructured":"Poria, S., Iti, C., Erik, C., Amir, H.: Convolutional MKL based multimodal emotion recognition and sentiment analysis. In: ICDM (2016)","DOI":"10.1109\/ICDM.2016.0055"},{"key":"30_CR14","doi-asserted-by":"crossref","unstructured":"Poria, S., Cambria, E., Gelbukh, A.: Deep convolutional neural network textual features and multiple kernel learning for utterance-level multimodal sentiment analysis. In: Proceedings of 2015 Conference on Empirical Methods in Natural Language Processing (2015)","DOI":"10.18653\/v1\/D15-1303"},{"key":"30_CR15","doi-asserted-by":"crossref","unstructured":"Tang, D., Qin, B., Liu, T.: Document modeling with gated recurrent neural network for sentiment classification. In: Proceedings of 2015 Conference on Empirical Methods in Natural Language Processing (2015)","DOI":"10.18653\/v1\/D15-1167"},{"key":"30_CR16","doi-asserted-by":"crossref","unstructured":"Socher, R., Perelygin, A., Wu, J.Y., Chuang, J., Manning, C.D., Ng, A.Y., Potts, C.: Recursive deep models for semantic compositionality over a sentiment TreeBank. In: Proceedings of Conference on Empirical Methods in Natural Language Processing (EMNLP). vol. 1631, p. 1642 (2013)","DOI":"10.18653\/v1\/D13-1170"},{"key":"30_CR17","doi-asserted-by":"crossref","unstructured":"Li, X., Zhang, Y., Li, M., Chen, S., Austin, F.R., Marsic, I., Burd, R.S.: Online process phase detection using multimodal deep learning. In: 2016 IEEE 7th Annual Ubiquitous Computing, Electronics and Mobile Communication Conference (UEMCON) (2016)","DOI":"10.1109\/UEMCON.2016.7777912"},{"key":"30_CR18","unstructured":"Abadi, M., Agarwal, A., Barham, P., Brevdo, E., Chen, Z., Citro, C., Corrado G.S.: Tensorflow: large-scale machine learning on heterogeneous distributed systems (2016). arXiv preprint arXiv:1603.04467"},{"key":"30_CR19","doi-asserted-by":"publisher","first-page":"582","DOI":"10.1109\/TASL.2008.2009578","volume":"17","author":"C Busso","year":"2009","unstructured":"Busso, C., Lee, S., Narayanan, S.: Analysis of emotionally salient aspects of fundamental frequency for emotion detection. IEEE Trans. Audio Speech Lang. Process. 17, 582\u2013596 (2009)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"30_CR20","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1109\/79.911197","volume":"18","author":"R Cowie","year":"2001","unstructured":"Cowie, R., Douglas-Cowie, E., Tsapatsoulis, N., Votsis, G., Kollias, S., Fellenz, W., Taylor, J.: Emotion recognition in human-computer interaction. IEEE Sig. Process. Mag. 18, 32\u201380 (2001)","journal-title":"IEEE Sig. Process. Mag."},{"key":"30_CR21","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1007\/s10772-012-9127-7","volume":"15","author":"M Kotti","year":"2012","unstructured":"Kotti, M., Patern\u00f2, F.: Speaker-independent emotion recognition exploiting a psychologically-inspired binary cascade classification schema. Int. J. Speech Technol. 15, 131\u2013150 (2012)","journal-title":"Int. J. Speech Technol."},{"issue":"1","key":"30_CR22","doi-asserted-by":"publisher","first-page":"69","DOI":"10.1109\/TAFFC.2015.2392101","volume":"6","author":"K Wang","year":"2015","unstructured":"Wang, K., An, N., Li, B.N., Zhang, Y., Li, L.: Speech emotion recognition using Fourier parameters. IEEE Trans. Affect. Comput. 6(1), 69\u201375 (2015)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"30_CR23","doi-asserted-by":"publisher","first-page":"357","DOI":"10.1109\/TASSP.1980.1163420","volume":"28","author":"S Davis","year":"1980","unstructured":"Davis, S., Mermelstein, P.: Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans. Acoust. Speech Sig. Process. 28, 357\u2013366 (1980)","journal-title":"IEEE Trans. Acoust. Speech Sig. Process."},{"key":"30_CR24","doi-asserted-by":"publisher","first-page":"5115","DOI":"10.1016\/j.eswa.2011.11.028","volume":"39","author":"N Kamaruddin","year":"2012","unstructured":"Kamaruddin, N., Wahab, A., Quek, C.: Cultural dependency analysis for understanding speech emotion. Expert Syst. Appl. 39, 5115\u20135133 (2012)","journal-title":"Expert Syst. Appl."},{"key":"30_CR25","doi-asserted-by":"crossref","unstructured":"Tai, K.S., Socher, R., Manning, C.D.: Improved semantic representations from tree-structured long short-term memory networks. In: Proceedings of 53rd Annual Meeting of the Association for Computational Linguistics and 7th International Joint Conference on Natural Language Processing, vol. 1: Long Papers (2015)","DOI":"10.3115\/v1\/P15-1150"}],"container-title":["Lecture Notes in Computer Science","Advances in Artificial Intelligence"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-57351-9_30","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:43:20Z","timestamp":1750196600000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-57351-9_30"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017]]},"ISBN":["9783319573502","9783319573519"],"references-count":25,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-57351-9_30","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017]]},"assertion":[{"value":"11 April 2017","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"Canadian AI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Canadian Conference on Artificial Intelligence","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Edmonton","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Canada","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2017","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16 May 2017","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 May 2017","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"30","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"canadianai2017","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/aigicrv.org\/2017\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}