{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T08:12:56Z","timestamp":1782288776723,"version":"3.54.5"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2025,7,24]],"date-time":"2025-07-24T00:00:00Z","timestamp":1753315200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,7,24]],"date-time":"2025-07-24T00:00:00Z","timestamp":1753315200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["IJDAR"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s10032-025-00546-6","type":"journal-article","created":{"date-parts":[[2025,7,24]],"date-time":"2025-07-24T09:34:28Z","timestamp":1753349668000},"page":"267-288","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Leveraging multimodal fusion for emotion detection in comics: integrating text and visual cues with RoBERTa and vision transformers"],"prefix":"10.1007","volume":"29","author":[{"family":"Rishu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vinay","family":"Kukreja","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,7,24]]},"reference":[{"key":"546_CR1","doi-asserted-by":"crossref","unstructured":"Matsubara, M., Augereau, O., Kise, K., Sanches, C. L.: Emotional arousal estimation while reading comics based on physiological signal analysis. In: Proceedings of the 1st International Workshop on comics Analysis, Processing and Understanding, pp. 1\u20134 (2016)","DOI":"10.1145\/3011549.3011556"},{"key":"546_CR2","doi-asserted-by":"crossref","unstructured":"Matsumiya, S., Sakti, S., Neubig, G., Toda, T., Nakamura, S.: Data-driven generation of text balloons based on linguistic and acoustic features of a comics-anime corpus. In: Proceedings of the Fifteenth Annual Conference of the International Speech Communication Association, pp. 1801\u20131805 (2014)","DOI":"10.21437\/Interspeech.2014-410"},{"key":"546_CR3","doi-asserted-by":"crossref","unstructured":"Nguyen, Nhu-Van, Vu, X.-S., Rigaud, C., Jiang, L., Burie, J.-C.: Competition on multimodal emotion recognition on comics scenes. In: Proceedings of the International Conference on Document Analysis and Recognition (ICDAR), pp. 767\u2013782 (2021)","DOI":"10.1007\/978-3-030-86337-1_51"},{"issue":"2","key":"546_CR4","doi-asserted-by":"publisher","first-page":"46","DOI":"10.1145\/3440053","volume":"17","author":"X Yang","year":"2021","unstructured":"Yang, X., et al.: Automatic comic generation with stylistic multi-page layouts and emotion-driven text balloon generation. ACM Trans. Multimed. Comput. Commun. Appl. 17(2), 46\u201352 (2021)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"issue":"1","key":"546_CR5","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.110261","volume":"150","author":"A Dutta","year":"2024","unstructured":"Dutta, A., Biswas, S., Das, A.K.: EmoComicNet: a multi-task model for comic emotion recognition. Pattern Recognit. 150(1), 110261 (2024)","journal-title":"Pattern Recognit."},{"key":"546_CR6","doi-asserted-by":"crossref","unstructured":"Rishu, Kukreja, V., Kumar, A.: Analyzing emotional impact of speech balloons on comic characters: a study of arousal levels. In: Proceedings of the International Conference on Computational Intelligence and Sustainable Engineering Solutions (CISES), pp. 211\u2013215 (2023)","DOI":"10.1109\/CISES58720.2023.10183595"},{"key":"546_CR7","doi-asserted-by":"crossref","unstructured":"Aoki, T., Chujo, R., Matsui, K., Choi, S., Hautasaari, A.: EmoBalloon\u2014conveying emotional arousal in text chats with speech balloons. In: Proceedings of the 2022 CHI Conference on Human Factors in Computing Systems, pp. 1\u201316 (2022)","DOI":"10.1145\/3491102.3501920"},{"issue":"5","key":"546_CR8","first-page":"610","volume":"10","author":"TV Artemyeva","year":"2015","unstructured":"Artemyeva, T.V.: Child concept of comic content analysis. Soc. Sci. 10(5), 610\u2013614 (2015)","journal-title":"Soc. Sci."},{"issue":"1","key":"546_CR9","doi-asserted-by":"publisher","first-page":"944","DOI":"10.1109\/TVCG.2021.3114849","volume":"28","author":"Z Wang","year":"2022","unstructured":"Wang, Z., Romat, H., Chevalier, F., Riche, N.H., Murray-Rust, D., Bach, B.: Interactive data comics. IEEE Trans. Vis. Comput. Graph. 28(1), 944\u2013954 (2022)","journal-title":"IEEE Trans. Vis. Comput. Graph."},{"issue":"4","key":"546_CR10","first-page":"238","volume":"5","author":"S Ranjini","year":"2013","unstructured":"Ranjini, S., Sundaresan, M.: Extraction and recognition of text from digital English comic image using median filter. Int. J. Comput. Sci. Eng. 5(4), 238\u2013244 (2013)","journal-title":"Int. J. Comput. Sci. Eng."},{"issue":"2","key":"546_CR11","first-page":"1","volume":"3","author":"R Yamanishi","year":"2017","unstructured":"Yamanishi, R., Tanaka, H., Nishihara, Y., Fukumoto, J.: Speech-balloon shapes estimation for emotional text communication. Inf. Eng. Express 3(2), 1\u201310 (2017)","journal-title":"Inf. Eng. Express"},{"issue":"6","key":"546_CR12","first-page":"669","volume":"4","author":"K Arai","year":"2011","unstructured":"Arai, K., Tolle, H.: Method for real time text extraction of digital manga comic. Int. J. Image Process. 4(6), 669\u2013676 (2011)","journal-title":"Int. J. Image Process."},{"issue":"3","key":"546_CR13","doi-asserted-by":"publisher","first-page":"1495","DOI":"10.1007\/s10462-017-9599-6","volume":"52","author":"F Hemmatian","year":"2019","unstructured":"Hemmatian, F., Sohrabi, M.K.: A survey on classification techniques for opinion mining and sentiment analysis. Artif. Intell. Rev. 52(3), 1495\u20131545 (2019)","journal-title":"Artif. Intell. Rev."},{"issue":"1","key":"546_CR14","doi-asserted-by":"publisher","first-page":"707","DOI":"10.1016\/j.procs.2019.11.174","volume":"161","author":"Z Drus","year":"2019","unstructured":"Drus, Z., Khalid, H.: Sentiment analysis in social media and its application: Systematic literature review. Procedia Comput. Sci. 161(1), 707\u2013714 (2019). https:\/\/doi.org\/10.1016\/j.procs.2019.11.174","journal-title":"Procedia Comput. Sci."},{"key":"546_CR15","doi-asserted-by":"crossref","unstructured":"Su, C. Y., Chang, R. I., Liu, J. C.: Recognizing text elements for SVG comic compression and its novel applications. In: Proceedings of the International Conference on Document Analysis and Recognition (ICDAR), pp. 1329\u20131333 (2011)","DOI":"10.1109\/ICDAR.2011.267"},{"issue":"1","key":"546_CR16","doi-asserted-by":"publisher","DOI":"10.1016\/j.engappai.2023.107715","volume":"131","author":"R Sharma","year":"2024","unstructured":"Sharma, R., Kukreja, V.: Image segmentation, classification and recognition methods for comics: A decade systematic literature review. Eng. Appl. Artif. Intell. 131(1), 107715 (2024)","journal-title":"Eng. Appl. Artif. Intell."},{"issue":"3","key":"546_CR17","doi-asserted-by":"publisher","first-page":"37","DOI":"10.4018\/IJAMC.2017070103","volume":"8","author":"R-I Chang","year":"2017","unstructured":"Chang, R.-I., Su, C.-Y., Lin, T.-H.: Machine learning for texture segmentation and classification of comic image in SVG compression. Int. J. Appl. Metaheuristic Comput. 8(3), 37\u201352 (2017)","journal-title":"Int. J. Appl. Metaheuristic Comput."},{"key":"546_CR18","doi-asserted-by":"crossref","unstructured":"L. Li, Y. Wang, Z. Tang, X. Lu, and L. Gao, \u201cUnsupervised speech text localization in comic images,\u201d in 2013 12th International Conference on Document Analysis and Recognition, 2013, pp. 1190\u20131194.","DOI":"10.1109\/ICDAR.2013.241"},{"key":"546_CR19","doi-asserted-by":"publisher","DOI":"10.1016\/j.cmpb.2024.108564","volume":"260","author":"X Zhu","year":"2025","unstructured":"Zhu, X., et al.: A client\u2013server based recognition system: Non-contact single\/multiple emotional and behavioral state assessment methods. Comput. Methods Programs Biomed. 260, 108564 (2025)","journal-title":"Comput. Methods Programs Biomed."},{"key":"546_CR20","doi-asserted-by":"crossref","unstructured":"Dutta, A., Biswas, S.: CNN based extraction of panels\/characters from Bengali comic book page images. In Proceedings of the International Conference on Document Analysis and Recognition Workshops (ICDARW), pp. 38\u201343 (2019)","DOI":"10.1109\/ICDARW.2019.00012"},{"key":"546_CR21","doi-asserted-by":"crossref","unstructured":"Nguyen, N.-V., Rigaud, C., Burie, J.-C.: Multi-task model for comic book image analysis. In: MultiMedia Modeling: 25th International Conference, MMM 2019, Thessaloniki, Greece, January 8\u201311, 2019, Proceedings, Part II 25, Springer International Publishing, pp. 637\u2013649 (2019)","DOI":"10.1007\/978-3-030-05716-9_57"},{"issue":"7","key":"546_CR22","doi-asserted-by":"publisher","first-page":"89","DOI":"10.3390\/jimaging4070089","volume":"4","author":"N Van Nguyen","year":"2018","unstructured":"Van Nguyen, N., Rigaud, C., Burie, J.-C.: Digital comics image indexing based on deep learning. J. Imag. 4(7), 89 (2018)","journal-title":"J. Imag."},{"key":"546_CR23","doi-asserted-by":"crossref","unstructured":"Ueno, M., Suenaga, T., Mori, N., Isahara, H.: Estimation of structure of four-scene comics by convolutional neural networks. In: Proceedings of the 1st International Workshop on comics ANalysis, Processing and Understanding, pp. 1\u20136 (2016)","DOI":"10.1145\/3011549.3011558"},{"issue":"10","key":"546_CR24","doi-asserted-by":"publisher","first-page":"828","DOI":"10.1587\/comex.2021XBL0142","volume":"10","author":"H Ono","year":"2021","unstructured":"Ono, H., Mutsumi, S., Kameyama, W.: Comic readers\u2019 emotion estimation using bio-signals by supervised and unsupervised learnings. IEICE Commun. Express 10(10), 828\u2013833 (2021)","journal-title":"IEICE Commun. Express"},{"key":"546_CR25","doi-asserted-by":"crossref","unstructured":"Van Nguyen, N., Rigaud, C., Burie, J. C.: Comic characters detection using deep learning. In: Proceedings of the International conference on document analysis and recognition (ICDAR), pp. 41\u201346 (2018)","DOI":"10.1109\/ICDAR.2017.290"},{"issue":"3","key":"546_CR26","doi-asserted-by":"publisher","first-page":"275","DOI":"10.26599\/TST.2019.9010035","volume":"26","author":"Q Cao","year":"2020","unstructured":"Cao, Q., Zhang, W., Zhu, Y.: Deep learning-based classification of the polar emotions of\u201d moe\u201d-style cartoon pictures. Tsinghua Sci. Technol. 26(3), 275\u2013286 (2020)","journal-title":"Tsinghua Sci. Technol."},{"key":"546_CR27","doi-asserted-by":"crossref","unstructured":"Sun, W., Burie, J.-C., Ogier, J.-M., Kise K.: Specific comic character detection using local feature matching. In: Proceedings of the International Conference on Document Analysis and Recognition (ICDAR), pp. 275\u2013279 (2013)","DOI":"10.1109\/ICDAR.2013.62"},{"issue":"4","key":"546_CR28","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1007\/s13735-024-00347-3","volume":"13","author":"R Wang","year":"2024","unstructured":"Wang, R., Zhu, J., Wang, S., Wang, T., Huang, J., Zhu, X.: Multi-modal emotion recognition using tensor decomposition fusion and self-supervised multi-tasking. Int. J. Multimed. Inf. Retr. 13(4), 39 (2024)","journal-title":"Int. J. Multimed. Inf. Retr."},{"issue":"8","key":"546_CR29","doi-asserted-by":"publisher","first-page":"5575","DOI":"10.1007\/s00371-023-03123-2","volume":"40","author":"Q Jia","year":"2024","unstructured":"Jia, Q., Chen, X., Wang, Y., Fan, X., Ling, H., Latecki, L.J.: A rotation robust shape transformer for cartoon character recognition. Vis. Comput. 40(8), 5575\u20135588 (2024)","journal-title":"Vis. Comput."},{"issue":"4","key":"546_CR30","doi-asserted-by":"publisher","first-page":"1504","DOI":"10.1007\/s12559-024-10287-z","volume":"16","author":"X Zhu","year":"2024","unstructured":"Zhu, X., et al.: A review of key technologies for emotion analysis using multimodal information. Cognit. Comput. 16(4), 1504\u20131530 (2024)","journal-title":"Cognit. Comput."},{"issue":"1","key":"546_CR31","first-page":"1023","volume":"13","author":"D Lenadora","year":"2020","unstructured":"Lenadora, D., RakhithaRanathunge, C., Samarawickrama, Y.D.S., Perera, I., Welivita, A.: Extraction of semantic content and styles in comic books. Int. J. Adv. ICT Emerg. Reg. 13(1), 1023\u20131056 (2020)","journal-title":"Int. J. Adv. ICT Emerg. Reg."},{"key":"546_CR32","doi-asserted-by":"crossref","unstructured":"Chen, Y.-C., Chen, L.-H., Shibata, H., Takama, Y.: Styled comic portrait synthesis based on GAN. In: Annual Conference of the Japanese Society for Artificial Intelligence, pp. 69\u201380 (2021)","DOI":"10.1007\/978-3-030-96451-1_7"},{"issue":"18","key":"546_CR33","doi-asserted-by":"publisher","first-page":"56039","DOI":"10.1007\/s11042-023-17347-w","volume":"83","author":"X Zhu","year":"2024","unstructured":"Zhu, X., Huang, Y., Wang, X., Wang, R.: Emotion recognition based on brain-like multimodal hierarchical perception. Multimed. Tools Appl. 83(18), 56039\u201356057 (2024)","journal-title":"Multimed. Tools Appl."},{"issue":"1","key":"546_CR34","first-page":"1990","volume":"23","author":"H Kim","year":"2020","unstructured":"Kim, H., Lee, E.-C., Seo, Y., Im, D.-H., Lee, I.-K.: Character detection in animated movies using multi-style adaptation and visual attention. IEEE Trans. Multimed. 23(1), 1990\u20132004 (2020)","journal-title":"IEEE Trans. Multimed."},{"issue":"1","key":"546_CR35","first-page":"1","volume":"21","author":"A Garadi","year":"2021","unstructured":"Garadi, A., et al.: Text classification models for the automatic detection of nonmedical prescription medication use from social media. BMC Med. Inform. Decis. Mak. 21(1), 1\u201313 (2021)","journal-title":"BMC Med. Inform. Decis. Mak."},{"key":"546_CR36","doi-asserted-by":"crossref","unstructured":"Th\u00e9odose, R., Burie, J. C.: VisEmoComic: visual emotion recognition in comics image. In: Proceedings of the International Conference on Pattern Recognition, pp. 281\u2013296 (2025)","DOI":"10.1007\/978-3-031-78495-8_18"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-025-00546-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10032-025-00546-6","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-025-00546-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T07:06:54Z","timestamp":1781939214000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10032-025-00546-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,24]]},"references-count":36,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["546"],"URL":"https:\/\/doi.org\/10.1007\/s10032-025-00546-6","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7,24]]},"assertion":[{"value":"10 November 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 July 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 July 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest. The authors declare that there are no potential conflicts of interest (financial or non-financial).","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}