{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,25]],"date-time":"2025-04-25T19:10:08Z","timestamp":1745608208946,"version":"3.40.4"},"publisher-location":"Singapore","reference-count":26,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819658145","type":"print"},{"value":"9789819658152","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-5815-2_12","type":"book-chapter","created":{"date-parts":[[2025,4,25]],"date-time":"2025-04-25T18:43:38Z","timestamp":1745606618000},"page":"221-243","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["IML-CMM - A Multimodal Sentiment Analysis Framework Integrating Intra-modal Learning and\u00a0Cross-Modal Mixup Enhancement"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-5017-615X","authenticated-orcid":false,"given":"Zheng","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-0020-7787","authenticated-orcid":false,"given":"RuiQing","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"ChuanLei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,26]]},"reference":[{"key":"12_CR1","doi-asserted-by":"crossref","unstructured":"Baltru\u0161aitis, T., Ahuja, C., Morency, L.P.: Multimodal machine learning: a survey and taxonomy, vol.\u00a041, pp. 423\u2013443. IEEE (2018)","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"12_CR2","doi-asserted-by":"crossref","unstructured":"Chen, R., Zhou, W., Hu, H., Fei, Z., Fei, M., Zhou, H.: Disentangled variational auto-encoder for multimodal fusion performance analysis in multimodal sentiment analysis, vol.\u00a0301, p. 112372. Elsevier (2024)","DOI":"10.1016\/j.knosys.2024.112372"},{"key":"12_CR3","unstructured":"Devlin, J.: Bert: pre-training of deep bidirectional transformers for language understanding (2018)"},{"key":"12_CR4","doi-asserted-by":"crossref","unstructured":"Fu, P., Wang, J., Zhang, X., Zhang, L., Gao, R.X.: Dynamic routing-based multimodal neural network for multi-sensory fault diagnosis of induction motor, vol.\u00a055, pp. 264\u2013272. Elsevier (2020)","DOI":"10.1016\/j.jmsy.2020.04.009"},{"key":"12_CR5","unstructured":"Gu, X., Liang, P.P., Morency, L.P.: Multimodal sentiment analysis using deep learning. In: Proceedings of the AAAI Conference on Artificial Intelligence (2020)"},{"key":"12_CR6","doi-asserted-by":"crossref","unstructured":"Han, W., Chen, H., Poria, S.: Improving multimodal fusion with hierarchical mutual information maximization for multimodal sentiment analysis. arXiv preprint arXiv:2109.00412 (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.723"},{"key":"12_CR7","doi-asserted-by":"publisher","unstructured":"Hazarika, D., Zimmermann, R., Poria, S.: MISA: modality-invariant and \u2013specific representations for multimodal sentiment analysis. In: Proceedings of the 28th ACM International Conference on Multimedia, MM \u201920, pp. 1122\u20131131. Association for Computing Machinery, New York (2020). https:\/\/doi.org\/10.1145\/3394171.3413678","DOI":"10.1145\/3394171.3413678"},{"key":"12_CR8","unstructured":"Jin, X., et\u00a0al.: A survey on mixup augmentations and beyond (2024). https:\/\/arxiv.org\/abs\/2409.05202"},{"key":"12_CR9","doi-asserted-by":"crossref","unstructured":"Kim, K., Park, S.: AOBERT: all-modalities-in-one BERT for multimodal sentiment analysis. Inform. Fus. (2023)","DOI":"10.2139\/ssrn.4172043"},{"key":"12_CR10","doi-asserted-by":"publisher","unstructured":"Liu, Y., et\u00a0al.: Make acoustic and visual cues matter: CH-SIMS v2.0 dataset and AV-Mixup consistent module. In: Proceedings of the 2022 International Conference on Multimodal Interaction, pp. 247\u2013258. ICMI \u201922, Association for Computing Machinery, New York, NY, USA (2022). https:\/\/doi.org\/10.1145\/3536221.3556630","DOI":"10.1145\/3536221.3556630"},{"key":"12_CR11","doi-asserted-by":"crossref","unstructured":"Liu, Z., Shen, Y., Lakshminarasimhan, V.B., Liang, P.P., Zadeh, A., Morency, L.P.: Efficient low-rank multimodal fusion with modality-specific factors (2018)","DOI":"10.18653\/v1\/P18-1209"},{"key":"12_CR12","doi-asserted-by":"crossref","unstructured":"Ma, F., Zhang, Y., Sun, X.: Multimodal sentiment analysis with preferential fusion and distance-aware contrastive learning. In: 2023 IEEE International Conference on Multimedia and Expo (ICME), pp. 1367\u20131372. IEEE (2023)","DOI":"10.1109\/ICME55011.2023.00237"},{"key":"12_CR13","unstructured":"Mai, S., Hu, H., Xing, S.: Hierarchical feature fusion for multimodal sentiment analysis. In: Proceedings of ACL Conference (2019)"},{"key":"12_CR14","doi-asserted-by":"crossref","unstructured":"McFee, B., et\u00a0al.: librosa: audio and music signal analysis in python. In: SciPy, pp. 18\u201324 (2015)","DOI":"10.25080\/Majora-7b98e3ed-003"},{"key":"12_CR15","doi-asserted-by":"crossref","unstructured":"Pham, H., Liang, P.P., Morency, L.P.: Found in translation: learning robust joint representations by cyclic translations between modalities. In: AAAI Conference on Artificial Intelligence (2019)","DOI":"10.1609\/aaai.v33i01.33016892"},{"key":"12_CR16","doi-asserted-by":"crossref","unstructured":"Rahman, W., et\u00a0al.: Integrating multimodal information in large pretrained transformers. In: Proceedings of the Conference Association for Computational Linguistics Meeting, vol.\u00a02020, p.\u00a02359. NIH Public Access (2020)","DOI":"10.18653\/v1\/2020.acl-main.214"},{"key":"12_CR17","doi-asserted-by":"crossref","unstructured":"Sun, Z., Sarma, P., Sethares, W., Liang, Y.: Learning relationships between text, audio, and video via deep canonical correlation for multimodal language analysis. In: AAAI Conference on Artificial Intelligence (2020)","DOI":"10.1609\/aaai.v34i05.6431"},{"key":"12_CR18","doi-asserted-by":"crossref","unstructured":"Tsai, Y.H., Liang, P.P., Zadeh, A., Morency, L.P., Salakhutdinov, R.: Multimodal transformer for unaligned multimodal language sequences. In: Proceedings of the ACL Conference (2019)","DOI":"10.18653\/v1\/P19-1656"},{"key":"12_CR19","doi-asserted-by":"crossref","unstructured":"Tsai, Y.H.H., Bai, S., Liang, P.P., Kolter, J.Z., Morency, L.P., Salakhutdinov, R.: Multimodal transformer for unaligned multimodal language sequences. In: Proceedings of the Conference Association for Computational Linguistics Meeting vol.\u00a02019, p.\u00a06558. NIH Public Access (2019)","DOI":"10.18653\/v1\/P19-1656"},{"key":"12_CR20","unstructured":"Vaswani, A., et\u00a0al.: Attention is all you need. In: Proceedings of the 31st International Conference on Neural Information Processing Systems, p. 6000-6010. NIPS\u201917, Curran Associates Inc., Red Hook, NY, USA (2017)"},{"key":"12_CR21","doi-asserted-by":"crossref","unstructured":"Wang, Y., Shen, Y., Liu, Z., Liang, P.P., Zadeh, A., Morency, L.P.: TEDT: transformer-based encoding-decoding translation network for multimodal sentiment analysis. Cognitive Computation (2021)","DOI":"10.1007\/s12559-022-10073-9"},{"key":"12_CR22","doi-asserted-by":"crossref","unstructured":"Yu, W., Xu, H., Yuan, Z., Wu, J.: Learning modality-specific representations with self-supervised multi-task learning for multimodal sentiment analysis. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a035, pp. 10790\u201310797 (2021)","DOI":"10.1609\/aaai.v35i12.17289"},{"key":"12_CR23","doi-asserted-by":"crossref","unstructured":"Zadeh, A., Chen, M., Poria, S., Cambria, E., Morency, L.P.: Tensor fusion network for multimodal sentiment analysis (2017)","DOI":"10.18653\/v1\/D17-1115"},{"key":"12_CR24","doi-asserted-by":"crossref","unstructured":"Zadeh, A., Liang, P.P., Poria, S., Cambria, E., Morency, L.P.: Tensor fusion network for multimodal sentiment analysis. In: Proceedings of EMNLP (2017)","DOI":"10.18653\/v1\/D17-1115"},{"key":"12_CR25","doi-asserted-by":"publisher","unstructured":"Zhang, H., Wang, Y., Yin, G., Liu, K., Liu, Y., Yu, T.: Learning language-guided adaptive hyper-modality representation for multimodal sentiment analysis. In: Bouamor, H., Pino, J., Bali, K. (eds.) Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pp. 756\u2013767. Association for Computational Linguistics, Singapore (December 2023). https:\/\/doi.org\/10.18653\/v1\/2023.emnlp-main.49, https:\/\/aclanthology.org\/2023.emnlp-main.49","DOI":"10.18653\/v1\/2023.emnlp-main.49"},{"issue":"12","key":"12_CR26","doi-asserted-by":"publisher","first-page":"2010","DOI":"10.3390\/sym12122010","volume":"12","author":"K Zhang","year":"2020","unstructured":"Zhang, K., Geng, Y., Zhao, J., Liu, J., Li, W.: Sentiment analysis of social media via multimodal feature fusion. Symmetry 12(12), 2010 (2020). https:\/\/doi.org\/10.3390\/sym12122010","journal-title":"Symmetry"}],"container-title":["Lecture Notes in Computer Science","Computational Visual Media"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-5815-2_12","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,25]],"date-time":"2025-04-25T18:43:53Z","timestamp":1745606633000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-5815-2_12"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819658145","9789819658152"],"references-count":26,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-5815-2_12","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"26 April 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"CVM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Computational Visual Media","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hong Kong SAR","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 April 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 April 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"13","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"cvm2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/iccvm.org\/2025\/index.htm","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}