{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T15:52:34Z","timestamp":1774453954118,"version":"3.50.1"},"reference-count":16,"publisher":"Springer Science and Business Media LLC","issue":"29","license":[{"start":{"date-parts":[[2021,8,6]],"date-time":"2021-08-06T00:00:00Z","timestamp":1628208000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,8,6]],"date-time":"2021-08-06T00:00:00Z","timestamp":1628208000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100007129","name":"Natural Science Foundation of Shandong Province","doi-asserted-by":"publisher","award":["ZR202103020833"],"award-info":[{"award-number":["ZR202103020833"]}],"id":[{"id":"10.13039\/501100007129","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Social Science Planning Research Project of Shandong Province","award":["18CLYJ50"],"award-info":[{"award-number":["18CLYJ50"]}]},{"name":"Shandong Soft Science Research Program","award":["2018RKB01144"],"award-info":[{"award-number":["2018RKB01144"]}]},{"name":"Shandong Province Higher Educational Science and Technology Program","award":["J15LN15"],"award-info":[{"award-number":["J15LN15"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,12]]},"DOI":"10.1007\/s11042-021-11260-w","type":"journal-article","created":{"date-parts":[[2021,8,6]],"date-time":"2021-08-06T19:26:11Z","timestamp":1628277971000},"page":"41677-41695","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["A multi-modal emotion fusion classification method combined expression and speech based on attention mechanism"],"prefix":"10.1007","volume":"81","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0374-0085","authenticated-orcid":false,"given":"Dong","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Longxi","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lifeng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,8,6]]},"reference":[{"key":"11260_CR1","doi-asserted-by":"crossref","unstructured":"Angrick M, Herff C, Johnson G et al (2019) Interpretation of convolutional neural networks for speech spectrogram regression from intracranial recordings [J]. Neurocomputing 342(21):145\u2013151","DOI":"10.1016\/j.neucom.2018.10.080"},{"key":"11260_CR2","doi-asserted-by":"crossref","unstructured":"Aytar Y, Vondrick C, Torralba A (2016) Soundnet: Learning sound representations from unlabeled video [C]. In Proc Adv Neural Inf Process Syst 892\u2013900","DOI":"10.1109\/CVPR.2016.18"},{"key":"11260_CR3","doi-asserted-by":"crossref","unstructured":"Bodla N, Zheng J, Xu H et al (2017) Deep heterogeneous feature fusion for template-based face recognition[C]. In Proc IEEE Winter Conf Appl Comput Vis 586\u2013595","DOI":"10.1109\/WACV.2017.71"},{"issue":"1","key":"11260_CR4","doi-asserted-by":"publisher","first-page":"58","DOI":"10.1016\/j.jalgor.2003.12.001","volume":"55","author":"G Cormode","year":"2005","unstructured":"Cormode G, Muthukrishnan S (2005) An improved data stream summary: the count-min sketch and its applications[J]. J Algorithm 55(1):58\u201375","journal-title":"Journal of Algorithms"},{"key":"11260_CR5","doi-asserted-by":"crossref","unstructured":"Fukui A, Park DH, Yang D et al (2016) Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding [C]. In Proc Conf Empir Methods Nat Lang Process 457\u2013468","DOI":"10.18653\/v1\/D16-1044"},{"key":"11260_CR6","unstructured":"Guanjun S, Shudong Z, Feigao W (2020) Research on Audio-Visual Dual-Modal Emotion Recognition Fusion Framework [J]. Comput Eng Appl\u00a056(6):140\u2013146"},{"issue":"6","key":"11260_CR7","doi-asserted-by":"publisher","first-page":"95","DOI":"10.26438\/ijcse\/v6si6.9598","volume":"06","author":"CV Haritha","year":"2018","unstructured":"Haritha CV, Thulasidharan PP (2018) Multimodal Emotion Recognition using Deep Neural Network- A Survey [J]. Int J Comput Sci Eng 06(6):95\u201398","journal-title":"International Journal of Computer Sciences & Engineering"},{"key":"11260_CR8","doi-asserted-by":"crossref","unstructured":"Hu Y, Ren JS, Dai J et al (2015) Deep Multimodal Speaker Naming [C]. In Proc ACM Int Conf Multimed\u00a01107\u20131110","DOI":"10.1145\/2733373.2806293"},{"issue":"3","key":"11260_CR9","doi-asserted-by":"publisher","first-page":"11817","DOI":"10.1007\/s00500-018-03735-0","volume":"23","author":"W Li","year":"2019","unstructured":"Li W, Chu M, Qiao J (2019) Design of a hierarchy modular neural network and its application in multimodal emotion recognition [J]. Soft Comput 23(3):11817\u201311828. https:\/\/doi.org\/10.1007\/s00500-018-03735-0","journal-title":"Soft Comput"},{"key":"11260_CR10","doi-asserted-by":"crossref","unstructured":"Lubis N, Lestari D, Sakti S et al (2018) Construction of Spontaneous Emotion Corpus from Indonesian TV Talk Shows and Its Application on Multimodal Emotion Recognition [J]. IEICE Trans Inf Syst E101.D(8):2092\u20132100","DOI":"10.1587\/transinf.2017EDP7362"},{"issue":"1","key":"11260_CR11","first-page":"143","volume":"46","author":"J Ma","year":"2019","unstructured":"Ma J, Sun Y, Zhang X (2019) Multimodal emotion recognition for the fusion of speech and EEG signals [J]. Xian Dianzi Keji Daxue Xuebao\/J Xidian Univ 46(1):143\u2013150","journal-title":"Xian Dianzi Keji Daxue Xuebao\/journal of Xidian University"},{"issue":"1","key":"11260_CR12","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1109\/TAFFC.2017.2713783","volume":"10","author":"F Noroozi","year":"2019","unstructured":"Noroozi F, Marjanovic M, Njegus A et al (2019) Audio-Visual Emotion Recognition in Video Clips [J]. Affective Computing, IEEE Trans Affect Comput 10(1):60\u201375","journal-title":"Affective Computing, IEEE Transactions on"},{"key":"11260_CR13","doi-asserted-by":"crossref","unstructured":"Ren J, Hu Y, Tai Y W et al (2016) Look, listen and learn---a multimodal LSTM for speaker identification [C]. In Proc Thirtieth AAAI Conf Artif Intell\u00a03581\u20133587","DOI":"10.1609\/aaai.v30i1.10471"},{"key":"11260_CR14","doi-asserted-by":"publisher","unstructured":"Song KS, Nho YH, Seo JH, Kwon DS (2018) Decision-Level Fusion Method for Emotion Recognition using Multimodal Emotion Recognition Information [C].\u00a02018 15th International Conference on Ubiquitous Robots (UR), Honolulu, HI 472\u2013476.\u00a0https:\/\/doi.org\/10.1109\/URAI.2018.8441795","DOI":"10.1109\/URAI.2018.8441795"},{"key":"11260_CR15","doi-asserted-by":"crossref","unstructured":"Sun B, Xu Q, He J et al (2016) Audio-Video Based Multimodal Emotion Recognition Using SVMs and Deep Learning [C]. Chinese Conf Pattern Recognit  621\u2013631.\u00a0Springer, Singapore","DOI":"10.1007\/978-981-10-3005-5_51"},{"key":"11260_CR16","doi-asserted-by":"crossref","unstructured":"Wen Y, Zhang K, Li Z et al (2016) A discriminative feature learning approach for deep face recognition [C]. In Proc Eur Conf Comput Vis 499\u2013515","DOI":"10.1007\/978-3-319-46478-7_31"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11260-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-021-11260-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11260-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,26]],"date-time":"2022-11-26T22:41:09Z","timestamp":1669502469000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-021-11260-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,8,6]]},"references-count":16,"journal-issue":{"issue":"29","published-print":{"date-parts":[[2022,12]]}},"alternative-id":["11260"],"URL":"https:\/\/doi.org\/10.1007\/s11042-021-11260-w","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,8,6]]},"assertion":[{"value":"18 December 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 May 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 July 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 August 2021","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}