{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,18]],"date-time":"2026-03-18T15:58:26Z","timestamp":1773849506016,"version":"3.50.1"},"reference-count":51,"publisher":"Springer Science and Business Media LLC","issue":"14","license":[{"start":{"date-parts":[[2021,7,23]],"date-time":"2021-07-23T00:00:00Z","timestamp":1626998400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,7,23]],"date-time":"2021-07-23T00:00:00Z","timestamp":1626998400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,6]]},"DOI":"10.1007\/s11042-021-11234-y","type":"journal-article","created":{"date-parts":[[2021,7,23]],"date-time":"2021-07-23T21:02:30Z","timestamp":1627074150000},"page":"19415-19428","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":13,"title":["Multimodal sentiment analysis with asymmetric window multi-attentions"],"prefix":"10.1007","volume":"81","author":[{"given":"Helang","family":"Lai","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xueming","family":"Yan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,7,23]]},"reference":[{"issue":"5","key":"11234_CR1","doi-asserted-by":"publisher","first-page":"2507","DOI":"10.1007\/s11042-015-2646-x","volume":"75","author":"C Baecchi","year":"2016","unstructured":"Baecchi C, Uricchio T, Bertini M, Del Bimbo A (2016) A multimodal feature learning approach for sentiment analysis of social network multimedia. Multimed Tools Appl 75(5):2507\u20132525","journal-title":"Multimed Tools Appl"},{"issue":"2","key":"11234_CR2","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis T, Ahuja C, Morency L-P (2018) Multimodal machine learning: A survey and taxonomy. IEEE Trans Pattern Anal Mach Intell 41(2):423\u2013443","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"11234_CR3","doi-asserted-by":"crossref","unstructured":"Cavallari S, Zheng VW, Cai H, Chang C-CK, Cambria E (2017) Learning community embedding with community detection and node embedding on graphs. In: Proceedings of the 2017 ACM on conference on information and knowledge management. ACM, pp 377\u2013386","DOI":"10.1145\/3132847.3132925"},{"key":"11234_CR4","doi-asserted-by":"crossref","unstructured":"Cho K, Van Merri\u00ebnboer B, Gulcehre C, Bahdanau D, Bougares F, Schwenk H, Bengio Y (2014) Learning phrase representations using rnn encoder-decoder for statistical machine translation. arXiv:1406.1078","DOI":"10.3115\/v1\/D14-1179"},{"key":"11234_CR5","doi-asserted-by":"crossref","unstructured":"Datcu D, Rothkrantz LJM (2014) Semantic audio-visual data fusion for automatic emotion recognition. Emotion recognition: a pattern analysis approach 411\u2013435","DOI":"10.1002\/9781118910566.ch16"},{"key":"11234_CR6","doi-asserted-by":"crossref","unstructured":"Degottex G, Kane J, Drugman T, Raitio T, Scherer S (2014) Covarep\u2014a collaborative voice analysis repository for speech technologies. In: 2014 Ieee international conference on acoustics, speech and signal processing (icassp). IEEE, pp 960\u2013964","DOI":"10.1109\/ICASSP.2014.6853739"},{"issue":"5","key":"11234_CR7","doi-asserted-by":"publisher","first-page":"70","DOI":"10.1109\/MIS.2017.3711649","volume":"32","author":"M Ebrahimi","year":"2017","unstructured":"Ebrahimi M, Hossein Yazdavar A, Sheth A (2017) Challenges of sentiment analysis for dynamic events. IEEE Intell Syst 32(5):70\u201375","journal-title":"IEEE Intell Syst"},{"key":"11234_CR8","doi-asserted-by":"crossref","unstructured":"Fukui A, Park DH, Yang D, Rohrbach A, Darrell T, Rohrbach M (2016) Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv:1606.01847","DOI":"10.18653\/v1\/D16-1044"},{"issue":"4","key":"11234_CR9","doi-asserted-by":"publisher","first-page":"1334","DOI":"10.1016\/j.jnca.2006.09.007","volume":"30","author":"H Gunes","year":"2007","unstructured":"Gunes H, Piccardi M (2007) Bi-modal emotion recognition from expressive face and body gestures. J Netw Comput Appl 30(4):1334\u20131345","journal-title":"J Netw Comput Appl"},{"issue":"8","key":"11234_CR10","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Computat 9(8):1735\u20131780","journal-title":"Neural Computat"},{"key":"11234_CR11","doi-asserted-by":"publisher","first-page":"104","DOI":"10.1016\/j.neunet.2014.10.005","volume":"63","author":"A Hussain","year":"2015","unstructured":"Hussain A, Huang G-B (2015) Towards an intelligent framework for multimodal affective data analysis. Neural Netw 63:104\u2013116","journal-title":"Neural Netw"},{"issue":"8","key":"11234_CR12","doi-asserted-by":"publisher","first-page":"724","DOI":"10.1016\/j.ijhcs.2007.02.003","volume":"65","author":"A Kapoor","year":"2007","unstructured":"Kapoor A, Burleson W, Picard WR (2007) Automatic prediction of frustration. Int J Human-Comput Stud 65(8):724\u2013736","journal-title":"Int J Human-Comput Stud"},{"key":"11234_CR13","doi-asserted-by":"crossref","unstructured":"Liu Z, Shen Y, Lakshminarasimhan VB, Liang PP, Zadeh A, Morency L-P (2018) Efficient low-rank multimodal fusion with modality-specific factors. In: Proceedings of the 56th annual meeting of the association for computational linguistics, pp 2247\u20132256","DOI":"10.18653\/v1\/P18-1209"},{"key":"11234_CR14","doi-asserted-by":"publisher","first-page":"124","DOI":"10.1016\/j.knosys.2018.07.041","volume":"161","author":"N Majumder","year":"2018","unstructured":"Majumder N, Hazarika D, Gelbukh A, Cambria E, Poria S (2018) Multimodal sentiment analysis using hierarchical fusion with context modeling. Knowl-Based Syst 161:124\u2013133","journal-title":"Knowl-Based Syst"},{"issue":"2","key":"11234_CR15","doi-asserted-by":"publisher","first-page":"353","DOI":"10.1007\/s11042-011-0842-x","volume":"61","author":"D Mekhaldi","year":"2012","unstructured":"Mekhaldi D, Lalanne D, Ingold R (2012) A multimodal alignment framework for spoken documents. Multimed Tools Appl 61(2):353\u2013388","journal-title":"Multimed Tools Appl"},{"key":"11234_CR16","doi-asserted-by":"crossref","unstructured":"Mittal T, Bhattacharya U, Chandra R, Bera A, Manocha D (2020) M3er Multiplicative multimodal emotion recognition using facial, textual, and speech cues. In: Proceedings of the AAAI conference on artificial intelligence, vol 34, pp 1359\u20131367","DOI":"10.1609\/aaai.v34i02.5492"},{"key":"11234_CR17","doi-asserted-by":"crossref","unstructured":"Morency L-P, Mihalcea R, Doshi P (2011) Towards multimodal sentiment analysis: Harvesting opinions from the web. In: Proceedings of the 13th international conference on multimodal interfaces. ACM, pp 169\u2013176","DOI":"10.1145\/2070481.2070509"},{"key":"11234_CR18","doi-asserted-by":"crossref","unstructured":"Nojavanasghari B, Gopinath D, Koushik J, Baltru\u0161aitis T, Morency L-P (2016) Deep multimodal fusion for persuasiveness prediction. In: Proceedings of the 18th ACM international conference on multimodal interaction. ACM, pp 284\u2013288","DOI":"10.1145\/2993148.2993176"},{"issue":"2","key":"11234_CR19","doi-asserted-by":"publisher","first-page":"2887","DOI":"10.1007\/s11042-020-08836-3","volume":"80","author":"YR Pandeya","year":"2021","unstructured":"Pandeya YR, Lee J (2021) Deep learning-based late fusion of multimodal information for emotion classification of music video. Multimed Tools Appl 80(2):2887\u20132905","journal-title":"Multimed Tools Appl"},{"key":"11234_CR20","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning DC (2014) Glove Global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"11234_CR21","unstructured":"P\u00e9rez-Rosas V, Mihalcea R, Morency L-P (2013) Utterance-level multimodal sentiment analysis. In: Proceedings of the 51st annual meeting of the association for computational linguistics (Volume 1: Long Papers), pp 973\u2013982"},{"key":"11234_CR22","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1016\/j.inffus.2017.02.003","volume":"37","author":"S Poria","year":"2017","unstructured":"Poria S, Cambria E, Bajpai R, Hussain A (2017) A review of affective computing: From unimodal analysis to multimodal fusion. Inform Fusion 37:98\u2013125","journal-title":"Inform Fusion"},{"key":"11234_CR23","doi-asserted-by":"crossref","unstructured":"Poria S, Cambria E, Gelbukh A (2015) Deep convolutional neural network textual features and multiple kernel learning for utterance-level multimodal sentiment analysis. In: Proceedings of the 2015 conference on empirical methods in natural language processing, pp 2539\u20132544","DOI":"10.18653\/v1\/D15-1303"},{"key":"11234_CR24","doi-asserted-by":"publisher","first-page":"50","DOI":"10.1016\/j.neucom.2015.01.095","volume":"174","author":"S Poria","year":"2016","unstructured":"Poria S, Cambria E, Howard N, Huang G-B, Hussain A (2016) Fusing audio, visual and textual clues for sentiment analysis from multimodal content. Neurocomputing 174:50\u201359","journal-title":"Neurocomputing"},{"key":"11234_CR25","doi-asserted-by":"crossref","unstructured":"Poria S, Chaturvedi I, Cambria E, Hussain A (2016) Convolutional mkl based multimodal emotion recognition and sentiment analysis. In: 2016 IEEE 16Th international conference on data mining (ICDM). IEEE, pp 439\u2013448","DOI":"10.1109\/ICDM.2016.0055"},{"issue":"2","key":"11234_CR26","doi-asserted-by":"publisher","first-page":"210","DOI":"10.1109\/TNSRE.2006.875544","volume":"14","author":"T Pun","year":"2006","unstructured":"Pun T, Alecu TI, Chanel G, Kronegg J, Voloshynovskiy S (2006) Brain-computer interaction research at the computer vision and multimedia laboratory, University of Geneva. IEEE Trans Neural Syst Rehabilit Eng 14(2):210\u2013213","journal-title":"IEEE Trans Neural Syst Rehabilit Eng"},{"key":"11234_CR27","doi-asserted-by":"crossref","unstructured":"Rajagopalan SS, Morency L-P, Baltrusaitis T, Goecke R (2016) Extending long short-term memory for multi-view structured learning. In: European conference on computer vision. Springer, pp 338\u2013353","DOI":"10.1007\/978-3-319-46478-7_21"},{"key":"11234_CR28","doi-asserted-by":"crossref","unstructured":"Ren J, Hu Y, Tai Y-W, Wang C, Xu L, Sun W, Yan Q (2016) Look, listen and learn\u2014a multimodal lstm for speaker identification. In: Proceedings of the AAAI conference on artificial intelligence, vol 30","DOI":"10.1609\/aaai.v30i1.10471"},{"key":"11234_CR29","doi-asserted-by":"crossref","unstructured":"Shan C, Gong S, McOwan PW (2007) Beyond facial expressions: Learning human emotion from body gestures. In: BMVC, pp 1\u201310","DOI":"10.5244\/C.21.43"},{"key":"11234_CR30","doi-asserted-by":"publisher","first-page":"107648","DOI":"10.1016\/j.patcog.2020.107648","volume":"110","author":"F Sohrab","year":"2021","unstructured":"Sohrab F, Raitoharju J, Iosifidis A, Gabbouj M (2021) Multimodal subspace support vector data description. Pattern Recogn 110:107648","journal-title":"Pattern Recogn"},{"key":"11234_CR31","doi-asserted-by":"crossref","unstructured":"Song Y, Morency L-P, Davis R (2012) Multi-view latent variable discriminative models for action recognition. In: 2012 IEEE Conference on computer vision and pattern recognition. IEEE, pp 2120\u20132127","DOI":"10.1109\/CVPR.2012.6247918"},{"key":"11234_CR32","doi-asserted-by":"crossref","unstructured":"Song Y, Morency L-P, Davis R (2013) Action recognition by hierarchical sequence summarization. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3562\u20133569","DOI":"10.1109\/CVPR.2013.457"},{"key":"11234_CR33","unstructured":"Tsai HY-H, Liang PP, Zadeh A, Morency L-P, Salakhutdinov R (2018) Learning factorized multimodal representations. arXiv:1806.06176"},{"key":"11234_CR34","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show, Tell A neural image caption generator. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"11234_CR35","unstructured":"Wang W, Arora R, Livescu K, Bilmes J (2015) On deep multi-view representation learning. In: International conference on machine learning. PMLR, pp 1083\u20131092"},{"key":"11234_CR36","doi-asserted-by":"crossref","unstructured":"Wang H, Meghawat A, Morency L-P, Xing EP (2017) Select-additive learning: Improving generalization in multimodal sentiment analysis. In: 2017 IEEE International conference on multimedia and expo (ICME). IEEE, pp 949\u2013954","DOI":"10.1109\/ICME.2017.8019301"},{"key":"11234_CR37","doi-asserted-by":"crossref","unstructured":"W\u00f6rtwein T, Scherer S (2017) What really matters\u2014an information gain analysis of questions and reactions in automated ptsd screenings. In: 2017 Seventh international conference on affective computing and intelligent interaction (ACII). IEEE, pp 15\u201320","DOI":"10.1109\/ACII.2017.8273573"},{"issue":"1","key":"11234_CR38","doi-asserted-by":"publisher","first-page":"49","DOI":"10.1007\/s10462-017-9588-9","volume":"50","author":"FZ Xing","year":"2018","unstructured":"Xing FZ, Cambria E, Welsch RE (2018) Natural language based financial forecasting: A survey. Artif Intell Rev 50(1):49\u201373","journal-title":"Artif Intell Rev"},{"key":"11234_CR39","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, Attend and tell neural image caption generation with visual attention. In: International conference on machine learning. PMLR, pp 2048\u20132057"},{"key":"11234_CR40","unstructured":"Xu J, Gavves E, Fernando B, Tuytelaars T (2015) Guiding the long-short term memory model for image caption generation. In: Proceedings of the IEEE international conference on computer vision, pp 2407\u20132415"},{"key":"11234_CR41","unstructured":"Xu C, Tao D, Xu C (2013) A survey on multi-view learning. arXiv:1304.5634"},{"key":"11234_CR42","doi-asserted-by":"crossref","unstructured":"Young T, Cambria E, Chaturvedi I, Zhou H, Biswas S, Huang M (2018) Augmenting end-to-end dialogue systems with commonsense knowledge. In: Thirty-second AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v32i1.11923"},{"key":"11234_CR43","doi-asserted-by":"crossref","unstructured":"Yu W, Zeiler S, Kolossa D (2021) Multimodal integration for large-vocabulary audio-visual speech recognition. In: 2020 28Th european signal processing conference (EUSIPCO). IEEE, pp 341\u2013 345","DOI":"10.23919\/Eusipco47968.2020.9287841"},{"issue":"5","key":"11234_CR44","doi-asserted-by":"publisher","first-page":"3878","DOI":"10.1121\/1.2935783","volume":"123","author":"J Yuan","year":"2008","unstructured":"Yuan J, Liberman M (2008) Speaker identification on the scotus corpus. J Acoust Soc Am 123(5):3878","journal-title":"J Acoust Soc Am"},{"key":"11234_CR45","doi-asserted-by":"crossref","unstructured":"Zadeh A, Chen M, Poria S, Cambria E, Morency L-P (2017) Tensor fusion network for multimodal sentiment analysis. arXiv:1707.07250","DOI":"10.18653\/v1\/D17-1115"},{"key":"11234_CR46","doi-asserted-by":"crossref","unstructured":"Zadeh A, Liang PP, Mazumder N, Poria S, Cambria E, Morency L-P (2018) Memory fusion network for multi-view sequential learning. In: Thirty-second AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v32i1.12021"},{"key":"11234_CR47","doi-asserted-by":"crossref","unstructured":"Zadeh A, Liang PP, Poria S, Vij P, Cambria E, Morency L-P (2018) Multi-attention recurrent network for human communication comprehension. In: Thirty-second AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v32i1.12024"},{"key":"11234_CR48","unstructured":"Zadeh A, Zellers R, Pincus E, Morency L-P (2016) Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos. arXiv:1606.06259"},{"issue":"6","key":"11234_CR49","doi-asserted-by":"publisher","first-page":"82","DOI":"10.1109\/MIS.2016.94","volume":"31","author":"A Zadeh","year":"2016","unstructured":"Zadeh A, Zellers R, Pincus E, Morency L-P (2016) Multimodal sentiment intensity analysis in videos: Facial gestures and verbal messages. IEEE Intell Syst 31(6):82\u201388","journal-title":"IEEE Intell Syst"},{"issue":"2","key":"11234_CR50","doi-asserted-by":"publisher","first-page":"424","DOI":"10.1109\/TMM.2006.886310","volume":"9","author":"Z Zeng","year":"2007","unstructured":"Zeng Z, Tu J, Liu M, Huang TS, Pianfetti B, Roth D, Levinson S (2007) Audio-visual affect recognition. IEEE Trans Multimed 9(2):424\u2013428","journal-title":"IEEE Trans Multimed"},{"key":"11234_CR51","unstructured":"Zhu Q, Yeh M-C, Cheng K-T, Avidan S (2006) Fast human detection using a cascade of histograms of oriented gradients. In: 2006 IEEE Computer society conference on computer vision and pattern recognition (CVPR\u201906), vol 2. IEEE, pp 1491\u20131498"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11234-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-021-11234-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11234-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,5]],"date-time":"2023-01-05T10:14:41Z","timestamp":1672913681000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-021-11234-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,7,23]]},"references-count":51,"journal-issue":{"issue":"14","published-print":{"date-parts":[[2022,6]]}},"alternative-id":["11234"],"URL":"https:\/\/doi.org\/10.1007\/s11042-021-11234-y","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,7,23]]},"assertion":[{"value":"18 June 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 July 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 July 2021","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}