{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:17:08Z","timestamp":1783055828709,"version":"3.54.6"},"reference-count":39,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T00:00:00Z","timestamp":1780531200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003819","name":"Hubei Province Natural Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003819","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100020725","name":"Hubei Key Laboratory of Intelligent Geo-Information Processing","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100020725","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.inffus.2026.104530","type":"journal-article","created":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T23:54:38Z","timestamp":1780617278000},"page":"104530","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Hinting the unknown: Effective open-set multimodal emotion recognition with a hierarchical cross-modal emotion-interactive prompting approach"],"prefix":"10.1016","volume":"136","author":[{"given":"Yuanyuan","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuyang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-8410-1698","authenticated-orcid":false,"given":"Jiahao","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ke","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chang","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dapeng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5004-8975","authenticated-orcid":false,"given":"Zhe","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0608-065X","authenticated-orcid":false,"given":"Wei","family":"Xiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.inffus.2026.104530_bib0001","article-title":"Multimodal emotion recognition with deep learning: advancements, challenges, and future directions","volume":"105","author":"Geetha","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104530_bib0002","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"646","article-title":"Open-set facial expression recognition","volume":"vol. 38","author":"Zhang","year":"2024"},{"key":"10.1016\/j.inffus.2026.104530_bib0003","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"5722","article-title":"Open-set video-based facial expression recognition with human expression-sensitive prompting","author":"Liu","year":"2024"},{"key":"10.1016\/j.inffus.2026.104530_bib0004","doi-asserted-by":"crossref","first-page":"103","DOI":"10.1016\/j.inffus.2020.01.011","article-title":"Emotion recognition using multi-modal data and machine learning techniques: a tutorial and review","volume":"59","author":"Zhang","year":"2020","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104530_bib0005","series-title":"Proceedings of the 31st ACM International Conference on Multimedia","first-page":"862","article-title":"Variance-aware Bi-attention expression transformer for open-set facial expression recognition in the wild","author":"Zhu","year":"2023"},{"key":"10.1016\/j.inffus.2026.104530_bib0006","doi-asserted-by":"crossref","unstructured":"O. Schr\u00fcfer, M. Milling, F. Burkhardt, F. Eyben, B. Schuller, Are you sure? Analysing uncertainty quantification approaches for real-world speech emotion recognition, arXiv preprint arXiv: 2407.01143(2024).","DOI":"10.21437\/Interspeech.2024-977"},{"key":"10.1016\/j.inffus.2026.104530_bib0007","first-page":"12449","article-title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","volume":"33","author":"Baevski","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104530_bib0008","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.inffus.2026.104530_bib0009","doi-asserted-by":"crossref","first-page":"46491","DOI":"10.52202\/075280-2016","article-title":"LMC: large model collaboration with cross-assessment for training-free open-set object recognition","volume":"36","author":"Qu","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"11","key":"10.1016\/j.inffus.2026.104530_bib0010","doi-asserted-by":"crossref","first-page":"39","DOI":"10.1145\/219717.219748","article-title":"WordNet: a lexical database for English","volume":"38","author":"Miller","year":"1995","journal-title":"Commun. ACM"},{"key":"10.1016\/j.inffus.2026.104530_bib0011","series-title":"International Conference on Machine Learning","first-page":"8821","article-title":"Zero-shot text-to-image generation","author":"Ramesh","year":"2021"},{"key":"10.1016\/j.inffus.2026.104530_bib0012","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"9650","article-title":"Emerging properties in self-supervised vision transformers","author":"Caron","year":"2021"},{"issue":"2","key":"10.1016\/j.inffus.2026.104530_bib0013","doi-asserted-by":"crossref","first-page":"1355","DOI":"10.1007\/s11760-023-02843-1","article-title":"OpenFE: feature-extended openmax for open set facial expression recognition","volume":"18","author":"Shao","year":"2024","journal-title":"Signal Image Video Process."},{"issue":"9","key":"10.1016\/j.inffus.2026.104530_bib0014","first-page":"1","article-title":"Pre-train, prompt, and predict: a systematic survey of prompting methods in natural language processing","volume":"55","author":"Liu","year":"2023","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.inffus.2026.104530_bib0015","unstructured":"A. Jha, In the era of prompt learning with vision-language models, arXiv preprint arXiv: 2411.04892(2024)."},{"key":"10.1016\/j.inffus.2026.104530_bib0016","doi-asserted-by":"crossref","first-page":"3766","DOI":"10.1109\/TMM.2025.3535292","article-title":"Emotion-oriented cross-modal prompting and alignment for human-centric emotional video captioning","volume":"27","author":"Wang","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.inffus.2026.104530_bib0017","series-title":"2024 IEEE International Conference on Multimedia and Expo (ICME)","first-page":"1","article-title":"PA-SAM: prompt adapter sam for high-quality image segmentation","author":"Xie","year":"2024"},{"key":"10.1016\/j.inffus.2026.104530_bib0018","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"4015","article-title":"Segment anything","author":"Kirillov","year":"2023"},{"key":"10.1016\/j.inffus.2026.104530_bib0019","series-title":"Proceedings of the 31st ACM International Conference on Multimedia","first-page":"5339","article-title":"Seeing in flowing: adapting clip for action recognition with motion prompts learning","author":"Wang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104530_bib0020","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"5656","article-title":"Multitask vision-language prompt tuning","author":"Shen","year":"2024"},{"key":"10.1016\/j.inffus.2026.104530_bib0021","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102590","article-title":"Adversarial alignment and graph fusion via information bottleneck for multimodal emotion recognition in conversations","volume":"112","author":"Shou","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104530_bib0022","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2021.107676","article-title":"Video sentiment analysis with bimodal information-augmented multi-head attention","volume":"235","author":"Wu","year":"2022","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.inffus.2026.104530_bib0023","series-title":"Proceedings of the 31st ACM International Conference on Multimedia","first-page":"5994","article-title":"Multimodal prompt transformer with hybrid contrastive learning for emotion recognition in conversation","author":"Zou","year":"2023"},{"key":"10.1016\/j.inffus.2026.104530_bib0024","series-title":"2024 5th International Seminar on Artificial Intelligence, Networking and Information Technology (AINIT)","first-page":"814","article-title":"Multimodal emotion recognition algorithm based on graph attention network","author":"Chen","year":"2024"},{"issue":"11","key":"10.1016\/j.inffus.2026.104530_bib0025","first-page":"8065","article-title":"Adversarial reciprocal points learning for open set recognition","volume":"44","author":"Chen","year":"2021","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104530_bib0026","series-title":"Proceedings of the 30th ACM International Conference on Multimedia","first-page":"24","article-title":"MAFW: a large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild","author":"Liu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104530_bib0027","series-title":"Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"2236","article-title":"Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph","author":"Zadeh","year":"2018"},{"key":"10.1016\/j.inffus.2026.104530_bib0028","series-title":"Forty-second International Conference on Machine Learning","article-title":"OV-MER: towards open-vocabulary multimodal emotion recognition","author":"Lian","year":"2025"},{"key":"10.1016\/j.inffus.2026.104530_bib0029","series-title":"Proceedings of the European Conference on Computer Vision (ECCV)","first-page":"613","article-title":"Open set learning with counterfactual images","author":"Neal","year":"2018"},{"key":"10.1016\/j.inffus.2026.104530_bib0030","doi-asserted-by":"crossref","first-page":"44102","DOI":"10.52202\/079017-1400","article-title":"A closer look at auroc and auprc under class imbalance","volume":"37","author":"McDermott","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104530_bib0031","article-title":"Reducing network agnostophobia","volume":"31","author":"Dhamija","year":"2018","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"4","key":"10.1016\/j.inffus.2026.104530_bib0032","first-page":"4214","article-title":"Class-specific semantic reconstruction for open set recognition","volume":"45","author":"Huang","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104530_bib0033","series-title":"International Conference on Machine Learning","first-page":"36978","article-title":"Open-VCLIP: transforming CLIP to an open-vocabulary video model via interpolated weight optimization","author":"Weng","year":"2023"},{"issue":"5","key":"10.1016\/j.inffus.2026.104530_bib0034","doi-asserted-by":"crossref","first-page":"870","DOI":"10.1007\/s11633-024-1514-4","article-title":"Unified classification and rejection: a one-versus-all framework","volume":"21","author":"Cheng","year":"2024","journal-title":"Mach. Intell. Res."},{"issue":"6","key":"10.1016\/j.inffus.2026.104530_bib0035","doi-asserted-by":"crossref","DOI":"10.1007\/s11432-023-3924-x","article-title":"Logit prototype learning with active multimodal representation for robust open-set recognition","volume":"67","author":"Fu","year":"2024","journal-title":"Sci. China Inf. Sci."},{"key":"10.1016\/j.inffus.2026.104530_bib0036","unstructured":"B. Zhu, B. Lin, M. Ning, Y. Yan, J. Cui, H. Wang, Y. Pang, W. Jiang, J. Zhang, Z. Li, et al., LanguageBind: extending video-language pretraining to n-modality by language-based semantic alignment, arXiv preprint arXiv: 2310.01852(2023)."},{"key":"10.1016\/j.inffus.2026.104530_bib0037","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"15180","article-title":"ImageBind: one embedding space to bind them all","author":"Girdhar","year":"2023"},{"key":"10.1016\/j.inffus.2026.104530_bib0038","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"438","article-title":"Leveraging knowledge of modality experts for incomplete multimodal learning","author":"Xu","year":"2024"},{"key":"10.1016\/j.inffus.2026.104530_bib0039","doi-asserted-by":"crossref","DOI":"10.1109\/TNNLS.2026.3658485","article-title":"Recent advances of multimodal continual learning: a comprehensive survey","author":"Yu","year":"2026","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526004094?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526004094?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T04:23:02Z","timestamp":1783052582000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1566253526004094"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":39,"alternative-id":["S1566253526004094"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104530","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Hinting the unknown: Effective open-set multimodal emotion recognition with a hierarchical cross-modal emotion-interactive prompting approach","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104530","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"104530"}}