{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T03:51:27Z","timestamp":1783741887357,"version":"3.55.0"},"reference-count":45,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Knowledge-Based Systems"],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.1016\/j.knosys.2026.115654","type":"journal-article","created":{"date-parts":[[2026,2,28]],"date-time":"2026-02-28T23:09:53Z","timestamp":1772320193000},"page":"115654","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["TQ-CHAFN: Triple-query cross-modal hierarchical adaptive fusion network for multimodal sentiment analysis"],"prefix":"10.1016","volume":"339","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-6743-8616","authenticated-orcid":false,"given":"Chenyu","family":"Gao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0013-6499","authenticated-orcid":false,"given":"Jianhua","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-0311-8289","authenticated-orcid":false,"given":"Jiacan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7408-9958","authenticated-orcid":false,"given":"Linying","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.knosys.2026.115654_bib0001","doi-asserted-by":"crossref","unstructured":"R. Grewal, S. Gupta, R. Hamilton, Marketing insights from multimedia data: text, image, audio, and video. J. Mark. Res. 58(6) (2021) 1025\u20131033. 10.1177\/00222437211054601.","DOI":"10.1177\/00222437211054601"},{"key":"10.1016\/j.knosys.2026.115654_bib0002","series-title":"Proceedings of the Conference. Association for Computational Linguistics. Meeting","first-page":"6558","article-title":"Multimodal transformer for unaligned multimodal language sequences","volume":"2019","author":"Tsai","year":"2019"},{"issue":"3","key":"10.1016\/j.knosys.2026.115654_bib0003","doi-asserted-by":"crossref","first-page":"688","DOI":"10.1109\/TETC.2022.3231746","article-title":"Affective region recognition and fusion network for target-level multimodal sentiment classification","volume":"12","author":"Jia","year":"2023","journal-title":"IEEE Trans. Emerg. Top. Comput."},{"key":"10.1016\/j.knosys.2026.115654_bib0004","doi-asserted-by":"crossref","first-page":"172948","DOI":"10.1109\/ACCESS.2019.2955637","article-title":"A hybrid latent space data fusion method for multimodal emotion recognition","volume":"7","author":"Nemati","year":"2019","journal-title":"IEEE Access"},{"key":"10.1016\/j.knosys.2026.115654_bib0005","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2021.107676","article-title":"Video sentiment analysis with bimodal information-augmented multi-head attention","volume":"235","author":"Wu","year":"2022","journal-title":"Knowl. Based Syst."},{"key":"10.1016\/j.knosys.2026.115654_bib0006","series-title":"Proceedings of the 28th ACM International Conference on Multimedia","first-page":"1122","article-title":"MISA: modality-invariant and-specific representations for multimodal sentiment analysis","author":"Hazarika","year":"2020"},{"key":"10.1016\/j.knosys.2026.115654_bib0007","unstructured":"J. Hu, Y. Liu, J. Zhao, Q. Jin, MMGCN: multimodal fusion via deep graph convolution network for emotion recognition in conversation,(2021). arXiv preprint arXiv: 2107.06779."},{"key":"10.1016\/j.knosys.2026.115654_bib0008","doi-asserted-by":"crossref","first-page":"4014","DOI":"10.1109\/TMM.2020.3035277","article-title":"Image-text multimodal emotion classification via multi-view attentional network","volume":"23","author":"Yang","year":"2020","journal-title":"IEEE Trans. Multimed."},{"issue":"10","key":"10.1016\/j.knosys.2026.115654_bib0009","doi-asserted-by":"crossref","first-page":"7956","DOI":"10.1109\/TNNLS.2022.3147546","article-title":"Learning disentangled representation for multimodal cross-domain sentiment analysis","volume":"34","author":"Zhang","year":"2022","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.knosys.2026.115654_bib0010","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.125822","article-title":"A twin disentanglement transformer network with hierarchical-level feature reconstruction for robust multimodal emotion recognition","volume":"264","author":"Li","year":"2025","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.knosys.2026.115654_bib0011","doi-asserted-by":"crossref","unstructured":"A. Zadeh, M. Chen, S. Poria, E. Cambria, L.-P. Morency, Tensor fusion network for multimodal sentiment analysis,(2017). arXiv preprint arXiv: 1707.07250.","DOI":"10.18653\/v1\/D17-1115"},{"key":"10.1016\/j.knosys.2026.115654_bib0012","first-page":"164","article-title":"Modality to modality translation: an adversarial representation learning and graph fusion network for multimodal fusion","volume":"34","author":"Mai","year":"2020","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"key":"10.1016\/j.knosys.2026.115654_bib0013","doi-asserted-by":"crossref","first-page":"3771","DOI":"10.1109\/TASLP.2023.3316458","article-title":"TDFNet: transformer-based deep-scale fusion network for multimodal emotion recognition","volume":"31","author":"Zhao","year":"2023","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.knosys.2026.115654_bib0014","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.126649","article-title":"A multimodal fusion emotion recognition method based on multitask learning and attention mechanism","volume":"556","author":"Xie","year":"2023","journal-title":"Neurocomputing"},{"issue":"4","key":"10.1016\/j.knosys.2026.115654_bib0015","doi-asserted-by":"crossref","first-page":"206","DOI":"10.1109\/T-AFFC.2011.12","article-title":"Exploring fusion methods for multimodal emotion recognition with missing data","volume":"2","author":"Wagner","year":"2011","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.knosys.2026.115654_bib0016","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Exploiting modality-invariant feature for robust multimodal emotion recognition with missing modalities","author":"Zuo","year":"2023"},{"issue":"4","key":"10.1016\/j.knosys.2026.115654_bib0017","doi-asserted-by":"crossref","first-page":"1856","DOI":"10.1109\/TAFFC.2024.3378570","article-title":"Contrastive learning based modality-invariant feature acquisition for robust multimodal emotion recognition with missing modalities","volume":"15","author":"Liu","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.knosys.2026.115654_bib0018","series-title":"2022 IEEE International Conference on Multimedia and Expo (ICME)","first-page":"1","article-title":"NHFNET: a non-homogeneous fusion network for multimodal sentiment analysis","author":"Fu","year":"2022"},{"key":"10.1016\/j.knosys.2026.115654_bib0019","doi-asserted-by":"crossref","unstructured":"H. Zhang, Y. Wang, G. Yin, K. Liu, Y. Liu, T. Yu, Learning language-guided adaptive hyper-modality representation for multimodal sentiment analysis, (2023). arXiv preprint arXiv: 2310.05804.","DOI":"10.18653\/v1\/2023.emnlp-main.49"},{"key":"10.1016\/j.knosys.2026.115654_bib0020","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2023.110502","article-title":"TeFNA: text-centered fusion network with crossmodal attention for multimodal sentiment analysis","volume":"269","author":"Huang","year":"2023","journal-title":"Knowl. Based Syst."},{"key":"10.1016\/j.knosys.2026.115654_bib0021","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112220","article-title":"TCHFN: multimodal sentiment analysis based on text-centric hierarchical fusion network","volume":"300","author":"Hou","year":"2024","journal-title":"Knowl. Based Syst."},{"key":"10.1016\/j.knosys.2026.115654_bib0022","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.109259","article-title":"TETFN: a text enhanced transformer fusion network for multimodal sentiment analysis","volume":"136","author":"Wang","year":"2023","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.knosys.2026.115654_bib0023","first-page":"10790","article-title":"Learning modality-specific representations with self-supervised multi-task learning for multimodal sentiment analysis","volume":"35","author":"Yu","year":"2021","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"issue":"8","key":"10.1016\/j.knosys.2026.115654_bib0024","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","article-title":"Long short-term memory","volume":"9","author":"Hochreiter","year":"1997","journal-title":"Neural Comput."},{"issue":"1","key":"10.1016\/j.knosys.2026.115654_bib0025","first-page":"3942","article-title":"Film: visual reasoning with a general conditioning layer","volume":"32","author":"Perez","year":"2018","journal-title":"Proc. AAAI Conf. C. Artif. Intell."},{"key":"10.1016\/j.knosys.2026.115654_bib0026","series-title":"In Proceedings of the 32nd AAAI Conference on Artificial Intelligence (AAAI-18), Article 691. AAAI Press","article-title":"Memory fusion network for multi-view sequential learning","author":"Zadeh","year":"2018"},{"key":"10.1016\/j.knosys.2026.115654_bib0027","unstructured":"Y.-H. H. Tsai, P.P. Liang, A. Zadeh, L.-P. Morency, R. Salakhutdinov, Learning factorized multimodal representations,(2018). arXiv preprint arXiv: 1806.06176."},{"issue":"6","key":"10.1016\/j.knosys.2026.115654_bib0028","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1109\/MIS.2016.94","article-title":"Multimodal sentiment intensity analysis in videos: facial gestures and verbal messages","volume":"31","author":"Zadeh","year":"2016","journal-title":"IEEE Intell. Syst."},{"key":"10.1016\/j.knosys.2026.115654_bib0029","series-title":"Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"2236","article-title":"Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph","author":"Zadeh","year":"2018"},{"key":"10.1016\/j.knosys.2026.115654_bib0030","series-title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics","first-page":"3718","article-title":"CH-SIMS: a Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality","author":"Yu","year":"2020"},{"issue":"4","key":"10.1016\/j.knosys.2026.115654_bib0031","doi-asserted-by":"crossref","first-page":"1966","DOI":"10.1109\/TCSVT.2022.3218018","article-title":"BAFN: bi-direction attention based fusion network for multimodal sentiment analysis","volume":"33","author":"Tang","year":"2022","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.knosys.2026.115654_bib0032","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"2117","article-title":"Feature pyramid networks for object detection","author":"Lin","year":"2017"},{"key":"10.1016\/j.knosys.2026.115654_bib0033","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part I 16","first-page":"775","article-title":"Semantic flow for fast and accurate scene parsing","author":"Li","year":"2020"},{"key":"10.1016\/j.knosys.2026.115654_bib0034","doi-asserted-by":"crossref","first-page":"3592","DOI":"10.1109\/TASLP.2021.3129331","article-title":"Multimodal emotion recognition with temporal and semantic consistency","volume":"29","author":"Chen","year":"2021","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.knosys.2026.115654_bib0035","unstructured":"A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A.N. Gomez, \u0141. Kaiser, I. Polosukhin, Attention is all you need, In: Proceedings of the 31st International Conference on Neural Information Processing Systems (NIPS 2017), (2017) 6000\u20136010."},{"key":"10.1016\/j.knosys.2026.115654_bib0036","unstructured":"T.N. Kipf, M. Welling, Semi-supervised classification with graph convolutional networks,(2016). arXiv preprint arXiv: 1609.02907."},{"key":"10.1016\/j.knosys.2026.115654_bib0037","series-title":"International Conference on Machine Learning","first-page":"1050","article-title":"Dropout as a bayesian approximation: representing model uncertainty in deep learning","author":"Gal","year":"2016"},{"key":"10.1016\/j.knosys.2026.115654_bib0038","unstructured":"S. Serrano, N.A. Smith, Is attention interpretable?,(2019). arXiv preprint arXiv: 1906.03731."},{"key":"10.1016\/j.knosys.2026.115654_bib0039","unstructured":"Z. Liu, Y. Shen, V.B. Lakshminarasimhan, P.P. Liang, A. Zadeh, L.-P. Morency, Efficient low-rank multimodal fusion with modality-specific factors,(2018). arXiv preprint arXiv: 1806.00064."},{"key":"10.1016\/j.knosys.2026.115654_bib0040","series-title":"ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"4477","article-title":"Gated mechanism for attention based multi modal sentiment analysis","author":"Kumar","year":"2020"},{"key":"10.1016\/j.knosys.2026.115654_bib0041","series-title":"Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021","first-page":"4730","article-title":"A text-centered shared-private framework via cross-modal prediction for multimodal sentiment analysis","author":"Wu","year":"2021"},{"key":"10.1016\/j.knosys.2026.115654_bib0042","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2023.119125","article-title":"Learning discriminative multi-relation representations for multimodal sentiment analysis","volume":"641","author":"Tang","year":"2023","journal-title":"Inf. Sci."},{"key":"10.1016\/j.knosys.2026.115654_bib0043","series-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"7617","article-title":"ConFEDE: contrastive feature decomposition for multimodal sentiment analysis","author":"Yang","year":"2023"},{"key":"10.1016\/j.knosys.2026.115654_bib0044","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.127201","article-title":"Hybrid cross-modal interaction learning for multimodal sentiment analysis","volume":"571","author":"Fu","year":"2024","journal-title":"Neurocomputing"},{"issue":"10","key":"10.1016\/j.knosys.2026.115654_bib0045","doi-asserted-by":"crossref","first-page":"17941","DOI":"10.1109\/TNNLS.2025.3578618","article-title":"DashFusion: dual-stream alignment with hierarchical bottleneck fusion for multimodal sentiment analysis","volume":"36","author":"Wen","year":"2025","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."}],"container-title":["Knowledge-Based Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126003941?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126003941?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,3,19]],"date-time":"2026-03-19T21:35:22Z","timestamp":1773956122000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0950705126003941"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4]]},"references-count":45,"alternative-id":["S0950705126003941"],"URL":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115654","relation":{},"ISSN":["0950-7051"],"issn-type":[{"value":"0950-7051","type":"print"}],"subject":[],"published":{"date-parts":[[2026,4]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"TQ-CHAFN: Triple-query cross-modal hierarchical adaptive fusion network for multimodal sentiment analysis","name":"articletitle","label":"Article Title"},{"value":"Knowledge-Based Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115654","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"115654"}}