{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,9]],"date-time":"2025-11-09T18:52:44Z","timestamp":1762714364514,"version":"build-2065373602"},"publisher-location":"Singapore","reference-count":54,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819525652","type":"print"},{"value":"9789819525669","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,11,10]],"date-time":"2025-11-10T00:00:00Z","timestamp":1762732800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,10]],"date-time":"2025-11-10T00:00:00Z","timestamp":1762732800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-2566-9_15","type":"book-chapter","created":{"date-parts":[[2025,11,9]],"date-time":"2025-11-09T18:47:42Z","timestamp":1762714062000},"page":"214-233","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["MreNet: Multimodal Regularization Ensemble Network for\u00a0Hierarchical Paper Classification"],"prefix":"10.1007","author":[{"given":"Tan","family":"Yue","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuzhao","family":"Shi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuo","family":"Zhan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zilong","family":"Song","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zonghai","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,11,10]]},"reference":[{"key":"15_CR1","unstructured":"Achiam, J., et\u00a0al.: Gpt-4 technical report. arXiv preprint arXiv:2303.08774 (2023)"},{"key":"15_CR2","doi-asserted-by":"crossref","unstructured":"Adhikari, A., Ram, A., Tang, R., Lin, J.: Rethinking complex neural network architectures for document classification. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), pp. 4046\u20134051 (2019)","DOI":"10.18653\/v1\/N19-1408"},{"key":"15_CR3","doi-asserted-by":"crossref","unstructured":"Cadene, R., Ben-younes, H., Cord, M., Thome, N.: Murel: multimodal relational reasoning for visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00209"},{"key":"15_CR4","doi-asserted-by":"crossref","unstructured":"Cai, Y., Cai, H., Wan, X.: Multi-modal sarcasm detection in twitter with hierarchical fusion model. In: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pp. 2506\u20132515 (2019)","DOI":"10.18653\/v1\/P19-1239"},{"key":"15_CR5","doi-asserted-by":"crossref","unstructured":"Chen, Y., Xu, L., Liu, K., Zeng, D., Zhao, J.: Event extraction via dynamic multi-pooling convolutional neural networks. In: Proceedings of the 53rd Annual Meeting of the Association for Computational Linguistics and the 7th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 167\u2013176 (2015)","DOI":"10.3115\/v1\/P15-1017"},{"key":"15_CR6","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018)"},{"key":"15_CR7","unstructured":"Dosovitskiy, A., et al.: An image is worth 16x16 words: transformers for image recognition at scale. ICLR (2021)"},{"key":"15_CR8","doi-asserted-by":"crossref","unstructured":"Gallo, I., Calefati, A., Nawaz, S.: Multimodal classification fusion in real-world scenarios. In: 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR), vol.\u00a05, pp. 36\u201341. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.326"},{"key":"15_CR9","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"15_CR10","doi-asserted-by":"publisher","unstructured":"Heidarivincheh, F., et al.: Multimodal classification of Parkinson\u2019s disease in home environments with resiliency to missing modalities. Sensors 21(12) (2021). https:\/\/doi.org\/10.3390\/s21124133. https:\/\/www.mdpi.com\/1424-8220\/21\/12\/4133","DOI":"10.3390\/s21124133"},{"key":"15_CR11","doi-asserted-by":"crossref","unstructured":"Howard, A., et\u00a0al.: Searching for mobilenetv3. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 1314\u20131324 (2019)","DOI":"10.1109\/ICCV.2019.00140"},{"key":"15_CR12","doi-asserted-by":"crossref","unstructured":"Howard, J., Ruder, S.: Universal language model fine-tuning for text classification. arXiv preprint arXiv:1801.06146 (2018)","DOI":"10.18653\/v1\/P18-1031"},{"key":"15_CR13","doi-asserted-by":"crossref","unstructured":"Huang, G., Liu, Z., Van Der\u00a0Maaten, L., Weinberger, K.Q.: Densely connected convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4700\u20134708 (2017)","DOI":"10.1109\/CVPR.2017.243"},{"key":"15_CR14","doi-asserted-by":"crossref","unstructured":"Johnson, R., Zhang, T.: Effective use of word order for text categorization with convolutional neural networks. arXiv preprint arXiv:1412.1058 (2014)","DOI":"10.3115\/v1\/N15-1011"},{"key":"15_CR15","unstructured":"Kenton, J.D.M.W.C., Toutanova, L.K.: Bert: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of NAACL-HLT, pp. 4171\u20134186 (2019)"},{"key":"15_CR16","unstructured":"Kim, W., Son, B., Kim, I.: Vilt: vision-and-language transformer without convolution or region supervision (2021)"},{"key":"15_CR17","doi-asserted-by":"crossref","unstructured":"Kim, Y.: Convolutional neural networks for sentence classification (2014)","DOI":"10.3115\/v1\/D14-1181"},{"key":"15_CR18","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization (2017)"},{"key":"15_CR19","unstructured":"Kipf, T.N., Welling, M.: Semi-supervised classification with graph convolutional networks. In: International Conference on Learning Representations (ICLR) (2017)"},{"key":"15_CR20","unstructured":"Kuka\u010dka, J., Golkov, V., Cremers, D.: Regularization for deep learning: a taxonomy. arXiv preprint arXiv:1710.10686 (2017)"},{"key":"15_CR21","unstructured":"Lan, Z., Chen, M., Goodman, S., Gimpel, K., Sharma, P., Soricut, R.: Albert: a lite BERT for self-supervised learning of language representations. arXiv preprint arXiv:1909.11942 (2020)"},{"key":"15_CR22","doi-asserted-by":"crossref","unstructured":"Liang, B., Lou, C., Li, X., Gui, L., Yang, M., Xu, R.: Multi-modal sarcasm detection with interactive in-modal and cross-modal graphs. In: Proceedings of the 29th ACM International Conference on Multimedia, pp. 4707\u20134715 (2021)","DOI":"10.1145\/3474085.3475190"},{"key":"15_CR23","doi-asserted-by":"crossref","unstructured":"Liang, B., et al.: Multi-modal sarcasm detection via cross-modal graph convolutional network. In: Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 1767\u20131777 (2022)","DOI":"10.18653\/v1\/2022.acl-long.124"},{"key":"15_CR24","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2024.102353","volume":"108","author":"H Liu","year":"2024","unstructured":"Liu, H., Wei, R., Tu, G., Lin, J., Liu, C., Jiang, D.: Sarcasm driven by sentiment: a sentiment-aware hierarchical fusion network for multimodal sarcasm detection. Inf. Fusion 108, 102353 (2024)","journal-title":"Inf. Fusion"},{"key":"15_CR25","doi-asserted-by":"crossref","unstructured":"Liu, J., Chang, W.C., Wu, Y., Yang, Y.: Deep learning for extreme multi-label text classification. In: Proceedings of the 40th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 115\u2013124 (2017)","DOI":"10.1145\/3077136.3080834"},{"key":"15_CR26","unstructured":"Liu, Y., et al.: Roberta: a robustly optimized BERT pretraining approach (2019)"},{"key":"15_CR27","doi-asserted-by":"crossref","unstructured":"Liu, Z., Mao, H., Wu, C.Y., Feichtenhofer, C., Darrell, T., Xie, S.: A convnet for the 2020s. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"15_CR28","doi-asserted-by":"publisher","unstructured":"Ma, X., Wang, R.: Personalized scientific paper recommendation based on heterogeneous graph representation. IEEE Access 7, 79887\u201379894 (2019). https:\/\/doi.org\/10.1109\/ACCESS.2019.2923293","DOI":"10.1109\/ACCESS.2019.2923293"},{"key":"15_CR29","doi-asserted-by":"crossref","unstructured":"Malik, M., Tom\u00e1s, D., Rosso, P.: How challenging is multimodal irony detection? In: International Conference on Applications of Natural Language to Information Systems, pp. 18\u201332. Springer (2023)","DOI":"10.1007\/978-3-031-35320-8_2"},{"key":"15_CR30","doi-asserted-by":"crossref","unstructured":"Morvant, E., Habrard, A., Ayache, S.: Majority vote of diverse classifiers for late fusion. In: Joint IAPR International Workshops on Statistical Techniques in Pattern Recognition (SPR) and Structural and Syntactic Pattern Recognition (SSPR), pp. 153\u2013162. Springer (2014)","DOI":"10.1007\/978-3-662-44415-3_16"},{"key":"15_CR31","doi-asserted-by":"crossref","unstructured":"Pan, H., Lin, Z., Fu, P., Qi, Y., Wang, W.: Modeling intra and inter-modality incongruity for multi-modal sarcasm detection. In: Findings of the Association for Computational Linguistics: EMNLP 2020, pp. 1383\u20131392 (2020)","DOI":"10.18653\/v1\/2020.findings-emnlp.124"},{"key":"15_CR32","unstructured":"Peters, M.E., et al.: Deep contextualized word representations. arXiv preprint arXiv:1802.05365 (2018)"},{"key":"15_CR33","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision (2021)"},{"key":"15_CR34","doi-asserted-by":"publisher","unstructured":"Schifanella, R., de\u00a0Juan, P., Tetreault, J., Cao, L.: Detecting sarcasm in multimodal social platforms. In: Proceedings of the 24th ACM International Conference on Multimedia. p. 1136\u20131145. MM \u201916, Association for Computing Machinery, New York, NY, USA (2016). https:\/\/doi.org\/10.1145\/2964284.2964321","DOI":"10.1145\/2964284.2964321"},{"issue":"4","key":"15_CR35","doi-asserted-by":"publisher","first-page":"3007","DOI":"10.1007\/s40747-021-00321-0","volume":"8","author":"MI Sharif","year":"2022","unstructured":"Sharif, M.I., Khan, M.A., Alhussein, M., Aurangzeb, K., Raza, M.: A decision support system for multimodal brain tumor classification using deep learning. Complex Intell. Syst. 8(4), 3007\u20133020 (2022)","journal-title":"Complex Intell. Syst."},{"key":"15_CR36","doi-asserted-by":"publisher","unstructured":"Shi, C., Quan, J., Li, M.: Information extraction for computer science academic rankings system. In: 2013 International Conference on Cloud and Service Computing, pp. 69\u201376 (2013). https:\/\/doi.org\/10.1109\/CSC.2013.19","DOI":"10.1109\/CSC.2013.19"},{"key":"15_CR37","doi-asserted-by":"crossref","unstructured":"Son\u00a0Chung, J., Senior, A., Vinyals, O., Zisserman, A.: Lip reading sentences in the wild. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.367"},{"issue":"6","key":"15_CR38","doi-asserted-by":"publisher","first-page":"7399","DOI":"10.1007\/s12652-022-04447-y","volume":"14","author":"D Tom\u00e1s","year":"2023","unstructured":"Tom\u00e1s, D., Ortega-Bueno, R., Zhang, G., Rosso, P., Schifanella, R.: Transformer-based models for multimodal irony detection. J. Ambient. Intell. Humaniz. Comput. 14(6), 7399\u20137410 (2023)","journal-title":"J. Ambient. Intell. Humaniz. Comput."},{"key":"15_CR39","unstructured":"Wang, H., Yue, T., Ye, X., He, Z., Li, B., Li, Y.: Revisit finetuning strategy for few-shot learning to transfer the emdeddings. In: The Eleventh International Conference on Learning Representations (2022)"},{"key":"15_CR40","unstructured":"Wang, P., et\u00a0al.: Qwen2-VL: enhancing vision-language model\u2019s perception of the world at any resolution. arXiv preprint arXiv:2409.12191 (2024)"},{"key":"15_CR41","doi-asserted-by":"crossref","unstructured":"Wang, X., Sun, X., Yang, T., Wang, H.: Building a bridge: a method for image-text sarcasm detection without pretraining on image-text data. In: Proceedings of the First International Workshop on Natural Language Processing Beyond Text, pp. 19\u201329 (2020)","DOI":"10.18653\/v1\/2020.nlpbt-1.3"},{"issue":"8","key":"15_CR42","doi-asserted-by":"publisher","first-page":"3748","DOI":"10.1109\/TIP.2016.2639438","volume":"26","author":"Y Xia","year":"2017","unstructured":"Xia, Y., Zhang, L., Liu, Z., Nie, L., Li, X.: Weakly supervised multimodal kernel for categorizing aerial photographs. IEEE Trans. Image Process. 26(8), 3748\u20133758 (2017). https:\/\/doi.org\/10.1109\/TIP.2016.2639438","journal-title":"IEEE Trans. Image Process."},{"key":"15_CR43","doi-asserted-by":"crossref","unstructured":"Xiong, T., Zhang, P., Zhu, H., Yang, Y.: Sarcasm detection with self-matching networks and low-rank bilinear pooling. In: The World Wide Web Conference, pp. 2115\u20132124 (2019)","DOI":"10.1145\/3308558.3313735"},{"key":"15_CR44","doi-asserted-by":"crossref","unstructured":"Xu, N., Zeng, Z., Mao, W.: Reasoning with multimodal sarcastic tweets via modeling cross-modality contrast and semantic association. In: Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 3777\u20133786 (2020)","DOI":"10.18653\/v1\/2020.acl-main.349"},{"key":"15_CR45","unstructured":"Yang, A., et\u00a0al.: Qwen2. 5 technical report. arXiv preprint arXiv:2412.15115 (2024)"},{"key":"15_CR46","unstructured":"Yang, P., Sun, X., Li, W., Ma, S., Wu, W., Wang, H.: SGM: sequence generation model for multi-label classification. In: Proceedings of the 27th International Conference on Computational Linguistics, pp. 3915\u20133926 (2018)"},{"key":"15_CR47","doi-asserted-by":"crossref","unstructured":"Yang, Z., Yang, D., Dyer, C., He, X., Smola, A., Hovy, E.: Hierarchical attention networks for document classification. In: Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 1480\u20131489 (2016)","DOI":"10.18653\/v1\/N16-1174"},{"key":"15_CR48","doi-asserted-by":"crossref","unstructured":"Yu, F., et al.: Ernie-vil: knowledge enhanced vision-language representations through scene graphs. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a035, pp. 3208\u20133216 (2021)","DOI":"10.1609\/aaai.v35i4.16431"},{"issue":"5","key":"15_CR49","first-page":"5709","volume":"43","author":"T Yue","year":"2022","unstructured":"Yue, T., He, Z., Li, C., Hu, Z., Li, Y.: Lightweight fine-grained classification for scientific paper. J. Intell. Fuzzy Syst. 43(5), 5709\u20135719 (2022)","journal-title":"J. Intell. Fuzzy Syst."},{"issue":"9","key":"15_CR50","doi-asserted-by":"publisher","first-page":"4554","DOI":"10.3390\/app12094554","volume":"12","author":"T Yue","year":"2022","unstructured":"Yue, T., Li, Y., Shi, X., Qin, J., Fan, Z., Hu, Z.: Papernet: a dataset and benchmark for fine-grained paper classification. Appl. Sci. 12(9), 4554 (2022)","journal-title":"Appl. Sci."},{"key":"15_CR51","doi-asserted-by":"publisher","unstructured":"Yue, T., Mao, R., Wang, H., Hu, Z., Cambria, E.: KnowleNet: knowledge fusion network for multimodal sarcasm detection. Inf. Fusion 100, 101921 (2023). https:\/\/doi.org\/10.1016\/j.inffus.2023.101921","DOI":"10.1016\/j.inffus.2023.101921"},{"key":"15_CR52","unstructured":"Yue, T., Shi, X., Mao, R., Hu, Z., Cambria, E.: Sarcnet: a multilingual multimodal sarcasm detection dataset. Image 1, 0"},{"issue":"4","key":"15_CR53","doi-asserted-by":"publisher","first-page":"63","DOI":"10.1007\/s00138-023-01411-4","volume":"34","author":"J Zhao","year":"2023","unstructured":"Zhao, J., Ye, X., Yue, T., Li, Y.: CLDM: convolutional layer dropout module. Mach. Vis. Appl. 34(4), 63 (2023)","journal-title":"Mach. Vis. Appl."},{"key":"15_CR54","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Zhu, M., Liu, N., Xu, Z., Peng, Y.: Llava-phi: efficient multi-modal assistant with small language model. In: Proceedings of the 1st International Workshop on Efficient Multimedia Computing under Limited, pp. 18\u201322 (2024)","DOI":"10.1145\/3688863.3689575"}],"container-title":["Communications in Computer and Information Science","Data Science"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-2566-9_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,9]],"date-time":"2025-11-09T18:47:47Z","timestamp":1762714067000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-2566-9_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,10]]},"ISBN":["9789819525652","9789819525669"],"references-count":54,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-2566-9_15","relation":{},"ISSN":["1865-0929","1865-0937"],"issn-type":[{"value":"1865-0929","type":"print"},{"value":"1865-0937","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,11,10]]},"assertion":[{"value":"10 November 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"The authors have no competing interests to declare that are relevant to the content of this article.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Disclosure of Interests"}},{"value":"ICPCSEE","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference of Pioneering Computer Scientists, Engineers and Educators","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hiroshima","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Japan","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"11","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpcsee2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/2025.icpcsee.org","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}