{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T15:04:18Z","timestamp":1783955058729,"version":"3.55.0"},"reference-count":35,"publisher":"Springer Science and Business Media LLC","issue":"21","license":[{"start":{"date-parts":[[2024,1,4]],"date-time":"2024-01-04T00:00:00Z","timestamp":1704326400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,4]],"date-time":"2024-01-04T00:00:00Z","timestamp":1704326400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-023-17685-9","type":"journal-article","created":{"date-parts":[[2024,1,4]],"date-time":"2024-01-04T08:02:31Z","timestamp":1704355351000},"page":"60171-60187","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":9,"title":["Multi-layer cross-modality attention fusion network for multimodal sentiment analysis"],"prefix":"10.1007","volume":"83","author":[{"given":"Zihao","family":"Yin","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6867-2063","authenticated-orcid":false,"given":"Yongping","family":"Du","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuxin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,1,4]]},"reference":[{"key":"17685_CR1","doi-asserted-by":"publisher","unstructured":"Borth D, Ji R, Chen T, Breuel T, Chang S-F (2013) Large-scale visual sentiment ontology and detectors using adjective noun pairs. 223\u2013232. https:\/\/doi.org\/10.1145\/2502081.2502282","DOI":"10.1145\/2502081.2502282"},{"key":"17685_CR2","doi-asserted-by":"publisher","unstructured":"Lu D, Neves L, Carvalho V, Zhang N, Ji H (2018) Visual attention model for name tagging in multimodal social media. 1990\u20131999. https:\/\/doi.org\/10.18653\/v1\/P18-1185","DOI":"10.18653\/v1\/P18-1185"},{"key":"17685_CR3","doi-asserted-by":"publisher","unstructured":"Sun L, Wang J, Su Y, Weng F, Sun Y, Zheng Z, Chen Y (2020) RIVA: A pre-trained tweet multimodal model based on text-image relation for multimodal NER. 1852\u20131862. https:\/\/doi.org\/10.18653\/v1\/2020.coling-main.168","DOI":"10.18653\/v1\/2020.coling-main.168"},{"key":"17685_CR4","doi-asserted-by":"publisher","unstructured":"Xu N, Mao W (2017) Multisentinet: A deep semantic network for multimodal sentiment analysis. 2399\u20132402. https:\/\/doi.org\/10.1145\/3132847.3133142","DOI":"10.1145\/3132847.3133142"},{"key":"17685_CR5","doi-asserted-by":"publisher","unstructured":"Xu N, Mao W, Chen G (2018) A co-memory network for multimodal sentiment analysis. 929\u2013932. https:\/\/doi.org\/10.1145\/3209978.3210093","DOI":"10.1145\/3209978.3210093"},{"key":"17685_CR6","doi-asserted-by":"publisher","unstructured":"Yu Y, Lin H, Meng J, Zhao Z (2016) Visual and textual sentiment analysis of a microblog using deep convolutional neural networks. Algorithms 9(2). https:\/\/doi.org\/10.3390\/a9020041","DOI":"10.3390\/a9020041"},{"key":"17685_CR7","doi-asserted-by":"publisher","unstructured":"Truong Q, Lauw HW (2019) Vistanet: Visual aspect attention network for multimodal sentiment analysis. 305\u2013312. https:\/\/doi.org\/10.1609\/aaai.v33i01.3301305","DOI":"10.1609\/aaai.v33i01.3301305"},{"key":"17685_CR8","doi-asserted-by":"publisher","unstructured":"Gu Y, Yang K, Fu S, Chen S, Li X, Marsic I (2018) Multimodal affective analysis using hierarchical attention strategy with word-level alignment. 2225\u20132235. https:\/\/doi.org\/10.18653\/v1\/P18-1207","DOI":"10.18653\/v1\/P18-1207"},{"key":"17685_CR9","doi-asserted-by":"publisher","unstructured":"Pham H, Liang\u00a0Pu P, Manzini T, Morency L-P, P\u00f3czos B (2019) Found in translation: Learning robust joint representations by cyclic translations between modalities. 6892\u20136899. https:\/\/doi.org\/10.1609\/aaai.v33i01.33016892","DOI":"10.1609\/aaai.v33i01.33016892"},{"key":"17685_CR10","unstructured":"Zhang J, Yu Y, Tang S, Wu J, Li W (2021) Variational autoencoder with CCA for audio-visual cross-modal retrieval. CoRR abs\/2112.02601. arXiv:2112.02601"},{"key":"17685_CR11","doi-asserted-by":"publisher","unstructured":"Tsai Y-HH, Bai S, Liang PP, Kolter JZ, Morency L-P, Salakhutdinov R (2019) Multimodal transformer for unaligned multimodal language sequences. 6558\u20136569. https:\/\/doi.org\/10.18653\/v1\/P19-1656","DOI":"10.18653\/v1\/P19-1656"},{"key":"17685_CR12","doi-asserted-by":"publisher","first-page":"264","DOI":"10.1016\/j.patrec.2019.04.024","volume":"125","author":"I Chaturvedi","year":"2019","unstructured":"Chaturvedi I, Satapathy R, Cavallari S, Cambria E (2019) Fuzzy commonsense reasoning for multimodal sentiment analysis. Pattern Recognit Lett 125:264\u2013270. https:\/\/doi.org\/10.1016\/j.patrec.2019.04.024","journal-title":"Pattern Recognit Lett"},{"key":"17685_CR13","doi-asserted-by":"publisher","unstructured":"Yang X, Feng S, Zhang Y, Wang D (2021) Multimodal sentiment detection based on multi-channel graph neural networks. 328\u2013339. https:\/\/doi.org\/10.18653\/v1\/2021.acl-long.28","DOI":"10.18653\/v1\/2021.acl-long.28"},{"key":"17685_CR14","doi-asserted-by":"publisher","unstructured":"Xu N, Mao W, Chen G (2019) Multi-interactive memory network for aspect based multimodal sentiment analysis. 371\u2013378. https:\/\/doi.org\/10.1609\/aaai.v33i01.3301371","DOI":"10.1609\/aaai.v33i01.3301371"},{"key":"17685_CR15","doi-asserted-by":"publisher","unstructured":"Yu J, Jiang J, Yang L, Xia R (2020) Improving multimodal named entity recognition via entity span detection with unified multimodal transformer. 3342\u20133352. https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.306","DOI":"10.18653\/v1\/2020.acl-main.306"},{"key":"17685_CR16","doi-asserted-by":"publisher","unstructured":"Shangipour\u00a0ataei T, Javdan S, Minaei-Bidgoli B (2020) Applying transformers and aspect-based sentiment analysis approaches on sarcasm detection. 67\u201371. https:\/\/doi.org\/10.18653\/v1\/2020.figlang-1.9","DOI":"10.18653\/v1\/2020.figlang-1.9"},{"key":"17685_CR17","doi-asserted-by":"publisher","unstructured":"Plepi J, Flek L (2021) Perceived and intended sarcasm detection with graph attention networks. 4746\u20134753. https:\/\/doi.org\/10.18653\/v1\/2021.findings-emnlp.408","DOI":"10.18653\/v1\/2021.findings-emnlp.408"},{"key":"17685_CR18","doi-asserted-by":"publisher","unstructured":"Srivastava H, Varshney V, Kumari S, Srivastava S (2020) A novel hierarchical BERT architecture for sarcasm detection. 93\u201397. https:\/\/doi.org\/10.18653\/v1\/2020.figlang-1.14","DOI":"10.18653\/v1\/2020.figlang-1.14"},{"key":"17685_CR19","doi-asserted-by":"publisher","unstructured":"Xu N, Zeng Z, Mao W (2020) Reasoning with multimodal sarcastic tweets via modeling cross-modality contrast and semantic association. 3777\u20133786. https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.349","DOI":"10.18653\/v1\/2020.acl-main.349"},{"key":"17685_CR20","doi-asserted-by":"publisher","unstructured":"Chauhan DS, S\u00a0R D, Ekbal A, Bhattacharyya P (2020) Sentiment and emotion help sarcasm? a multi-task learning framework for multi-modal sarcasm, sentiment and emotion analysis. 4351\u20134360. https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.401","DOI":"10.18653\/v1\/2020.acl-main.401"},{"issue":"1","key":"17685_CR21","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K, Kravitz J, Chen S, Kalantidis Y, Li L, Shamma DA, Bernstein MS, Fei-Fei L (2017) Visual genome: Connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis 123(1):32\u201373. https:\/\/doi.org\/10.1007\/s11263-016-0981-7","journal-title":"Int J Comput Vis"},{"key":"17685_CR22","unstructured":"Wu Y, Schuster M, Chen Z, Le QV, Norouzi M, Macherey W, Krikun M, Cao Y, Gao Q, Macherey K, Klingner J, Shah A, Johnson M, Liu X, Kaiser L, Gouws S, Kato Y, Kudo T, Kazawa H, Stevens K, Kurian G, Patil N, Wang W, Young C, Smith J, Riesa J, Rudnick A, Vinyals O, Corrado G, Hughes M, Dean J (2016) Google\u2019s neural machine translation system: Bridging the gap between human and machine translation. CoRR abs\/1609.08144. arXiv:1609.08144"},{"key":"17685_CR23","unstructured":"Kingma DP, Ba J (2015) Adam: A method for stochastic optimization"},{"key":"17685_CR24","doi-asserted-by":"publisher","unstructured":"Niu T, Zhu S, Pang L, El\u00a0Saddik A (2016) Sentiment analysis on multi-view social data. 15\u201327. https:\/\/doi.org\/10.1007\/978-3-319-27674-8_2","DOI":"10.1007\/978-3-319-27674-8_2"},{"key":"17685_CR25","doi-asserted-by":"publisher","unstructured":"Cai Y, Cai H, Wan X (2019) Multi-modal sarcasm detection in Twitter with hierarchical fusion model. 2506\u20132515. https:\/\/doi.org\/10.18653\/v1\/P19-1239","DOI":"10.18653\/v1\/P19-1239"},{"key":"17685_CR26","doi-asserted-by":"publisher","unstructured":"Kim Y (2014) Convolutional neural networks for sentence classification. 1746\u20131751. https:\/\/doi.org\/10.3115\/v1\/D14-1181","DOI":"10.3115\/v1\/D14-1181"},{"key":"17685_CR27","doi-asserted-by":"publisher","unstructured":"Zhou P, Shi W, Tian J, Qi Z, Li B, Hao H, Xu B (2016) Attention-based bidirectional long short-term memory networks for relation classification. 207\u2013212. https:\/\/doi.org\/10.18653\/v1\/P16-2034","DOI":"10.18653\/v1\/P16-2034"},{"key":"17685_CR28","doi-asserted-by":"publisher","unstructured":"Devlin J, Chang M-W, Lee K, Toutanova K (2019) BERT: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). Association for Computational Linguistics, Minneapolis, Minnesota, pp. 4171\u20134186. https:\/\/doi.org\/10.18653\/v1\/N19-1423","DOI":"10.18653\/v1\/N19-1423"},{"key":"17685_CR29","unstructured":"Simonyan K, Zisserman A (2015) Very deep convolutional networks for large-scale image recognition. In: Bengio Y, LeCun Y (eds.) 3rd International Conference on Learning Representations, ICLR 2015, San Diego, CA, USA, May 7-9, 2015, Conference Track Proceedings. arXiv:1409.1556"},{"key":"17685_CR30","doi-asserted-by":"publisher","unstructured":"Szegedy C, Vanhoucke V, Ioffe S, Shlens J, Wojna Z (2016) Rethinking the inception architecture for computer vision, 2818\u20132826. https:\/\/doi.org\/10.1109\/CVPR.2016.308","DOI":"10.1109\/CVPR.2016.308"},{"key":"17685_CR31","doi-asserted-by":"publisher","unstructured":"Vadicamo L, Carrara F, Cimino A, Cresci S, Dell\u2019Orletta F, Falchi F, Tesconi M (2017) Cross-media learning for image sentiment analysis in the wild. 308\u2013317. https:\/\/doi.org\/10.1109\/ICCVW.2017.45","DOI":"10.1109\/ICCVW.2017.45"},{"key":"17685_CR32","doi-asserted-by":"publisher","first-page":"35276","DOI":"10.1109\/ACCESS.2020.2975036","volume":"8","author":"K Zhang","year":"2020","unstructured":"Zhang K, Zhu Y, Zhang W, Zhang W, Zhu Y (2020) Transfer correlation between textual content to images for sentiment analysis IEEE. Access 8:35276\u201335289. https:\/\/doi.org\/10.1109\/ACCESS.2020.2975036","journal-title":"Access"},{"key":"17685_CR33","doi-asserted-by":"publisher","unstructured":"Huang F, Wei K, Weng J, Li Z (2020) Attention-based modality-gated networks for image-text sentiment analysis. ACM Trans Multimedia Comput Commun Appl 16(3). https:\/\/doi.org\/10.1145\/3388861","DOI":"10.1145\/3388861"},{"key":"17685_CR34","doi-asserted-by":"publisher","unstructured":"Li C, Hu Z (2022) Multimodal sentiment analysis of social media based on top-layer fusion. In: 2022 IEEE International Conference on Computer and Communications (ICCC), pp. 1\u20136. https:\/\/doi.org\/10.1109\/ICCC56324.2022.10065604","DOI":"10.1109\/ICCC56324.2022.10065604"},{"key":"17685_CR35","doi-asserted-by":"publisher","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. 770\u2013778. https:\/\/doi.org\/10.1109\/CVPR.2016.90","DOI":"10.1109\/CVPR.2016.90"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17685-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-023-17685-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17685-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,4]],"date-time":"2024-06-04T04:16:24Z","timestamp":1717474584000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-023-17685-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,1,4]]},"references-count":35,"journal-issue":{"issue":"21","published-online":{"date-parts":[[2024,6]]}},"alternative-id":["17685"],"URL":"https:\/\/doi.org\/10.1007\/s11042-023-17685-9","relation":{},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,1,4]]},"assertion":[{"value":"17 December 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 October 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 November 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 January 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of competing interests"}}]}}