{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,25]],"date-time":"2026-08-25T21:56:40Z","timestamp":1787695000999,"version":"build-2784847793"},"reference-count":50,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472067"],"award-info":[{"award-number":["62472067"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004767","name":"University of Science and Technology Liaoning","doi-asserted-by":"publisher","award":["2024JH2\/102600091"],"award-info":[{"award-number":["2024JH2\/102600091"]}],"id":[{"id":"10.13039\/501100004767","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.inffus.2026.104455","type":"journal-article","created":{"date-parts":[[2026,5,5]],"date-time":"2026-05-05T07:12:51Z","timestamp":1777965171000},"page":"104455","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["BiSSM-CL: Enhanced multimodal emotion recognition in conversation with bidirectional state space model and collaborative learning"],"prefix":"10.1016","volume":"135","author":[{"given":"Fenglin","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mengyin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-6171-698X","authenticated-orcid":false,"given":"Yanping","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-3921-4926","authenticated-orcid":false,"given":"Fan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhaofeng","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7530-3343","authenticated-orcid":false,"given":"Houjie","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.inffus.2026.104455_sbref0001","article-title":"Multimodal emotion recognition with deep learning: advancements, challenges, and future directions","volume":"105","author":"Geetha","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104455_sbref0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.102963","article-title":"A survey of large language models for healthcare: from data, technology, and applications to accountability and ethics","volume":"118","author":"He","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104455_sbref0003","series-title":"WWW","first-page":"2872","article-title":"Towards multimodal empathetic response generation: a rich text-speech-vision avatar-based benchmark","author":"Zhang","year":"2025"},{"key":"10.1016\/j.inffus.2026.104455_sbref0004","series-title":"ACL","first-page":"873","article-title":"Context-dependent sentiment analysis in user-generated videos","author":"Poria","year":"2017"},{"key":"10.1016\/j.inffus.2026.104455_sbref0005","series-title":"NAACL","first-page":"2122","article-title":"Conversational memory network for emotion recognition in dyadic dialogue videos","author":"Hazarika","year":"2018"},{"key":"10.1016\/j.inffus.2026.104455_sbref0006","series-title":"EMNLP-IJCNLP","first-page":"154","article-title":"DialogueGCN: a graph convolutional neural network for emotion recognition in conversation","author":"Ghosal","year":"2019"},{"issue":"4","key":"10.1016\/j.inffus.2026.104455_sbref0007","doi-asserted-by":"crossref","first-page":"39","DOI":"10.1007\/s13735-024-00347-3","article-title":"Multi-modal emotion recognition using tensor decomposition fusion and self-supervised multi-tasking","volume":"13","author":"Wang","year":"2024","journal-title":"Int. J. Multimed. Inf. Retr."},{"issue":"4","key":"10.1016\/j.inffus.2026.104455_sbref0008","doi-asserted-by":"crossref","first-page":"1504","DOI":"10.1007\/s12559-024-10287-z","article-title":"A review of key technologies for emotion analysis using multimodal information","volume":"16","author":"Zhu","year":"2024","journal-title":"Cognit. Comput."},{"key":"10.1016\/j.inffus.2026.104455_bib0009","doi-asserted-by":"crossref","unstructured":"C. Wu, Y. Cai, Y. Liu, P. Zhu, Y. Xue, Z. Gong, J. Hirschberg, B. Ma, Multimodal emotion recognition in conversations: a survey of methods, trends, challenges and prospects, CoRRabs\/2505.20511(2025). https:\/\/doi.org\/10.48550\/arXiv.2505.20511.","DOI":"10.18653\/v1\/2025.findings-emnlp.332"},{"key":"10.1016\/j.inffus.2026.104455_bib0010","unstructured":"H. Agarwal, K. Bansal, A. Joshi, A. Modi, Shapes of emotions: multimodal emotion recognition in conversations via emotion shifts, CoRRabs\/2112.01938(2021). https:\/\/arxiv.org\/abs\/2112.01938."},{"issue":"4","key":"10.1016\/j.inffus.2026.104455_sbref0011","doi-asserted-by":"crossref","first-page":"1919","DOI":"10.1109\/TAFFC.2024.3389453","article-title":"CFN-ESA: a cross-modal fusion network with emotion-shift awareness for dialogue emotion recognition","volume":"15","author":"Li","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.inffus.2026.104455_sbref0012","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111969","article-title":"Speaker-aware cognitive network with cross-modal attention for multimodal emotion recognition in conversation","volume":"296","author":"Guo","year":"2024","journal-title":"Knowl. Based Syst."},{"key":"10.1016\/j.inffus.2026.104455_sbref0013","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2024.106764","article-title":"HiMul-LGG: a hierarchical decision fusion-based local-global graph neural network for multimodal emotion recognition in conversation","volume":"181","author":"Fu","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.inffus.2026.104455_sbref0014","series-title":"CVPR","first-page":"14314","article-title":"EMOE: modality-specific enhanced dynamic emotion experts","author":"Fang","year":"2025"},{"issue":"8","key":"10.1016\/j.inffus.2026.104455_sbref0015","doi-asserted-by":"crossref","DOI":"10.1007\/s11432-023-3908-6","article-title":"EmotionIC: emotional inertia and contagion-driven dependency modeling for emotion recognition in conversation","volume":"67","author":"Liu","year":"2024","journal-title":"Sci. China Inf. Sci."},{"key":"10.1016\/j.inffus.2026.104455_sbref0016","series-title":"EMNLP","first-page":"9170","article-title":"DetectiveNN: imitating human emotional reasoning with a recall-detect-predict framework for emotion recognition in conversations","author":"Hong","year":"2024"},{"key":"10.1016\/j.inffus.2026.104455_sbref0017","doi-asserted-by":"crossref","first-page":"776","DOI":"10.1109\/TMM.2023.3271019","article-title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations","volume":"26","author":"Ma","year":"2024","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.inffus.2026.104455_bib0018","doi-asserted-by":"crossref","unstructured":"X. Zhu, J. Cheng, Z. Yang, Z. Chen, Q. Wang, J. Yao, CMATH: cross-modality augmented transformer with hierarchical variational distillation for multimodal emotion recognition in conversation, arXiv preprint arXiv: 2411.10060(2024). https:\/\/doi.org\/10.48550\/arXiv.2411.10060.","DOI":"10.2139\/ssrn.5943520"},{"key":"10.1016\/j.inffus.2026.104455_sbref0019","series-title":"ACL","first-page":"13099","article-title":"A cross-modality context fusion and semantic refinement network for emotion recognition in conversation","author":"Zhang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104455_sbref0020","series-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020, Seattle, WA, USA, June 13-19, 2020","first-page":"12692","article-title":"What makes training multi-modal classification networks hard?","author":"Wang","year":"2020"},{"key":"10.1016\/j.inffus.2026.104455_sbref0021","series-title":"NAACL","first-page":"82","article-title":"TelME: teacher-leading multimodal fusion network for emotion recognition in conversation","author":"Yun","year":"2024"},{"key":"10.1016\/j.inffus.2026.104455_sbref0022","series-title":"AAAI","first-page":"6818","article-title":"DialogueRNN: an attentive RNN for emotion detection in conversations","author":"Majumder","year":"2019"},{"key":"10.1016\/j.inffus.2026.104455_sbref0023","series-title":"ACL-IJCNLP","first-page":"5666","article-title":"MMGCN: multimodal fusion via deep graph convolution network for emotion recognition in conversation","author":"Hu","year":"2021"},{"key":"10.1016\/j.inffus.2026.104455_sbref0024","series-title":"EMNLP","first-page":"2694","article-title":"DialogueTRM: exploring multi-modal emotional dynamics in a conversation","author":"Mao","year":"2021"},{"key":"10.1016\/j.inffus.2026.104455_sbref0025","series-title":"The Tenth International Conference on Learning Representations, ICLR 2022, Virtual Event, April 25-29, 2022","article-title":"Efficiently modeling long sequences with structured state spaces","author":"Gu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104455_bib0026","unstructured":"A. Gu, T. Dao, Mamba: linear-time sequence modeling with selective state spaces, CoRRabs\/2312.00752(2023). https:\/\/doi.org\/10.48550\/arXiv.2312.00752."},{"key":"10.1016\/j.inffus.2026.104455_sbref0027","series-title":"ICML","article-title":"Transformers are SSMs: generalized models and efficient algorithms through structured state space duality","author":"Dao","year":"2024"},{"key":"10.1016\/j.inffus.2026.104455_sbref0028","article-title":"CIME: contextual interaction-based multimodal emotion analysis with enhanced semantic information","author":"Wang","year":"2025","journal-title":"IEEE Trans. Comput. Soc. Syst."},{"key":"10.1016\/j.inffus.2026.104455_bib0029","unstructured":"G.E. Hinton, O. Vinyals, J. Dean, Distilling the knowledge in a neural network, CoRRabs\/1503.02531(2015). http:\/\/arxiv.org\/abs\/1503.02531."},{"key":"10.1016\/j.inffus.2026.104455_bib0030","unstructured":"F.N. Iandola, M.W. Moskewicz, S. Karayev, R.B. Girshick, T. Darrell, K. Keutzer, DenseNet: implementing efficient ConvNet descriptor pyramids, CoRRabs\/1404.1869(2014). https:\/\/doi.org\/10.48550\/arXiv.1404.1869."},{"key":"10.1016\/j.inffus.2026.104455_sbref0031","series-title":"ICML","first-page":"279","article-title":"Training deep networks for facial expression recognition with crowd-sourced label distribution","author":"Barsoum","year":"2016"},{"key":"10.1016\/j.inffus.2026.104455_sbref0032","series-title":"MM","first-page":"1459","article-title":"Opensmile: the munich versatile and fast open-source audio feature extractor","author":"Eyben","year":"2010"},{"key":"10.1016\/j.inffus.2026.104455_sbref0033","series-title":"EMNLP","first-page":"2470","article-title":"COSMIC: commonsense knowledge for emotion identification in conversations","author":"Ghosal","year":"2020"},{"key":"10.1016\/j.inffus.2026.104455_sbref0034","article-title":"RoBERTa: a robustly optimized BERT pretraining approach","volume":"abs\/1907.11692","author":"Liu","year":"2019","journal-title":"CoRR"},{"issue":"1","key":"10.1016\/j.inffus.2026.104455_sbref0035","doi-asserted-by":"crossref","first-page":"130","DOI":"10.1109\/TAFFC.2023.3261279","article-title":"GA2MIF: graph and attention based two-stage multi-source information fusion for conversational emotion detection","volume":"15","author":"Li","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.inffus.2026.104455_sbref0036","series-title":"CVPR","first-page":"10761","article-title":"Multivariate, multi-frequency and multimodal: rethinking graph neural networks for emotion recognition in conversation","author":"Chen","year":"2023"},{"key":"10.1016\/j.inffus.2026.104455_sbref0037","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102590","article-title":"Adversarial alignment and graph fusion via information bottleneck for multimodal emotion recognition in conversations","volume":"112","author":"Shou","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104455_sbref0038","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102272","article-title":"Bi-stream graph learning based multimodal fusion for emotion recognition in conversation","volume":"106","author":"Lu","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104455_sbref0039","series-title":"ICASSP","first-page":"1","article-title":"Effective context modeling framework for emotion recognition in conversations","author":"Tran","year":"2025"},{"key":"10.1016\/j.inffus.2026.104455_sbref0040","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112900","article-title":"LECM: a model leveraging emotion cause to improve real-time emotion recognition in conversations","volume":"309","author":"Lu","year":"2025","journal-title":"Knowl. Based Syst."},{"key":"10.1016\/j.inffus.2026.104455_sbref0041","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2024.121393","article-title":"Multimodal graph learning with framelet-based stochastic configuration networks for emotion recognition in conversation","volume":"686","author":"Shi","year":"2025","journal-title":"Inf. Sci."},{"key":"10.1016\/j.inffus.2026.104455_sbref0042","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112876","article-title":"Feature-enhanced multimodal interaction model for emotion recognition in conversation","volume":"309","author":"Fu","year":"2025","journal-title":"Knowl. Based Syst."},{"issue":"4","key":"10.1016\/j.inffus.2026.104455_sbref0043","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","article-title":"IEMOCAP: interactive emotional dyadic motion capture database [dataset]","volume":"42","author":"Busso","year":"2008","journal-title":"Lang. Resour. Eval."},{"key":"10.1016\/j.inffus.2026.104455_sbref0044","series-title":"ACL","first-page":"527","article-title":"MELD: a multimodal multi-party dataset for emotion recognition in conversations [dataset]","author":"Poria","year":"2019"},{"issue":"3-4","key":"10.1016\/j.inffus.2026.104455_sbref0045","doi-asserted-by":"crossref","first-page":"169","DOI":"10.1080\/02699939208411068","article-title":"An argument for basic emotions","volume":"6","author":"Ekman","year":"1992","journal-title":"Cogn. Emot."},{"key":"10.1016\/j.inffus.2026.104455_bib0046","unstructured":"K.D.P.B.J. Adam, et al., A method for stochastic optimization, arXiv preprint arXiv: 1412.6980 1412 (6) (2014). https:\/\/doi.org\/10.48550\/arXiv.1412.6980."},{"key":"10.1016\/j.inffus.2026.104455_sbref0047","doi-asserted-by":"crossref","DOI":"10.1016\/j.cmpb.2024.108564","article-title":"A client\u2013server based recognition system: non-contact single\/multiple emotional and behavioral state assessment methods","volume":"260","author":"Zhu","year":"2025","journal-title":"Comput. Methods Programs Biomed."},{"key":"10.1016\/j.inffus.2026.104455_sbref0048","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103268","article-title":"RMER-DT: robust multimodal emotion recognition in conversational contexts based on diffusion and transformers","volume":"123","author":"Zhu","year":"2025","journal-title":"Inf. Fusion"},{"issue":"5","key":"10.1016\/j.inffus.2026.104455_sbref0049","doi-asserted-by":"crossref","first-page":"62","DOI":"10.1109\/MIS.2025.3597120","article-title":"A generative random modality dropout framework for robust multimodal emotion recognition","volume":"40","author":"Zhang","year":"2025","journal-title":"IEEE Intell. Syst."},{"key":"10.1016\/j.inffus.2026.104455_sbref0050","article-title":"Integrating audio\u2013visual text generation with contrastive learning for enhanced multimodal emotion analysis","author":"Xiang","year":"2025","journal-title":"Inf. Fusion"}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526003350?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526003350?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T03:36:12Z","timestamp":1783049772000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1566253526003350"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":50,"alternative-id":["S1566253526003350"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104455","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"BiSSM-CL: Enhanced multimodal emotion recognition in conversation with bidirectional state space model and collaborative learning","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104455","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"104455"}}