{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T03:12:03Z","timestamp":1779333123722,"version":"3.51.4"},"reference-count":34,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2024,1,6]],"date-time":"2024-01-06T00:00:00Z","timestamp":1704499200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,6]],"date-time":"2024-01-06T00:00:00Z","timestamp":1704499200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Intell Inf Syst"],"published-print":{"date-parts":[[2024,8]]},"DOI":"10.1007\/s10844-023-00836-7","type":"journal-article","created":{"date-parts":[[2024,1,6]],"date-time":"2024-01-06T08:02:25Z","timestamp":1704528145000},"page":"1021-1043","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["Movie tag prediction: An extreme multi-label multi-modal transformer-based solution with explanation"],"prefix":"10.1007","volume":"62","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7711-9833","authenticated-orcid":false,"given":"Massimo","family":"Guarascio","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9641-8916","authenticated-orcid":false,"given":"Marco","family":"Minici","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2922-0835","authenticated-orcid":false,"given":"Francesco Sergio","family":"Pisani","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Erika","family":"De Francesco","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pasquale","family":"Lambardi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,1,6]]},"reference":[{"key":"836_CR1","doi-asserted-by":"publisher","unstructured":"Abavisani, M., Wu, L., Hu, S., et\u00a0al. (2020). Multimodal categorization of crisis events in social media. In: 2020 IEEE\/CVF conf. on computer vision and pattern recognition, CVPR 2020. Computer Vision Foundation\/IEEE, pp 14,667\u201314,677, https:\/\/doi.org\/10.1109\/CVPR42600.2020.01469","DOI":"10.1109\/CVPR42600.2020.01469"},{"key":"836_CR2","unstructured":"Arevalo, J., Solorio, T., Montes-y G\u00f3mez, M., et\u00a0al. (2017). Gated multimodal units for information fusion. arXiv:1702.01992"},{"key":"836_CR3","doi-asserted-by":"publisher","first-page":"427","DOI":"10.1007\/978-3-030-43823-4_35","volume-title":"Machine Learning and Knowledge Discovery in Databases: International Workshops of ECML PKDD 2019, W\u00fcrzburg, Germany, September 16\u201320, 2019, Proceedings","author":"N Audebert","year":"2020","unstructured":"Audebert, N., Herold, C., Slimani, K., et al. (2020). Multimodal deep networks for text and image-based document classification. In I. Part (Ed.), Machine Learning and Knowledge Discovery in Databases: International Workshops of ECML PKDD 2019, W\u00fcrzburg, Germany, September 16\u201320, 2019, Proceedings (pp. 427\u2013443). Springer."},{"key":"836_CR4","doi-asserted-by":"publisher","first-page":"259","DOI":"10.1016\/j.inffus.2019.02.010","volume":"51","author":"JH Choi","year":"2019","unstructured":"Choi, J. H., & Lee, J. S. (2019). Embracenet: A robust deep learning architecture for multimodal classification. Information Fusion, 51, 259\u2013270. https:\/\/doi.org\/10.1016\/j.inffus.2019.02.010","journal-title":"Information Fusion"},{"key":"836_CR5","doi-asserted-by":"publisher","unstructured":"Cui, Y., Jia, M., Lin, T.Y., et\u00a0al. (2019). Class-balanced loss based on effective number of samples. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 9268\u20139277, https:\/\/doi.org\/10.1109\/CVPR.2019.00949","DOI":"10.1109\/CVPR.2019.00949"},{"key":"836_CR6","doi-asserted-by":"publisher","unstructured":"Devlin, J., Chang, M.W., Lee, K., et\u00a0al. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. In: NAACL-HLT. Association for computational linguistics, pp 4171\u20134186, https:\/\/doi.org\/10.18653\/v1\/N19-1423","DOI":"10.18653\/v1\/N19-1423"},{"key":"836_CR7","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., et\u00a0al. (2020). An image is worth 16x16 words: Transformers for image recognition at scale. In: Intl conf on learning representations"},{"key":"836_CR8","doi-asserted-by":"crossref","unstructured":"Fish, E., Weinbren, J., Gilbert, A. (2020). Rethinking movie genre classification with fine-grained semantic clustering. arXiv:2012.02639","DOI":"10.1109\/ICIP42928.2021.9506751"},{"key":"836_CR9","doi-asserted-by":"publisher","unstructured":"Gao, Y., Gu, S., Jiang, J., et\u00a0al. (2022). Going beyond xai: A systematic survey for explanation-guided learning. https:\/\/doi.org\/10.48550\/ARXIV.2212.03954arXiv:2212.03954","DOI":"10.48550\/ARXIV.2212.03954"},{"key":"836_CR10","doi-asserted-by":"publisher","first-page":"634","DOI":"10.1016\/B978-0-12-809633-8.20352-X","volume":"1\u20133","author":"M Guarascio","year":"2018","unstructured":"Guarascio, M., Manco, G., & Ritacco, E. (2018). Deep learning. Encyclopedia of Bioinformatics and Computational Biology: ABC of Bioinformatics, 1\u20133, 634\u2013647. https:\/\/doi.org\/10.1016\/B978-0-12-809633-8.20352-X","journal-title":"Encyclopedia of Bioinformatics and Computational Biology: ABC of Bioinformatics"},{"key":"836_CR11","unstructured":"Hermans, A., Beyer, L., Leibe, B. (2017). In defense of the triplet loss for person re-identification. arXiv:1703.07737"},{"key":"836_CR12","doi-asserted-by":"publisher","first-page":"1929","DOI":"10.5555\/2627435.2670313","volume":"15","author":"GE Hinton","year":"2014","unstructured":"Hinton, G. E., Srivastava, N., Krizhevsky, A., et al. (2014). Dropout: A simple way to prevent neural networks from overfitting. Journal of Machine Learning Research, 15, 1929\u20131958. https:\/\/doi.org\/10.5555\/2627435.2670313","journal-title":"Journal of Machine Learning Research"},{"key":"836_CR13","unstructured":"Ioffe, S., Szegedy, C. (2015). Batch normalization: Accelerating deep network training by reducing internal covariate shift. In: Proc. of the 32Nd Int. Conf. on Machine Learning - Volume 37, ICML\u201915, pp 448\u2013456"},{"key":"836_CR14","unstructured":"Kar, S., Maharjan, S., L\u00f3pez-Monroy, A. P., et al. (2018a). Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC 2018). In chair) NCC, K. Choukri, C. Cieri, et al. (Eds.), MPST: A corpus of movie plot synopses with tags. Paris, France: European Language Resources Association (ELRA)."},{"key":"836_CR15","unstructured":"Kar, S., Maharjan, S., Solorio, T. (2018b). Folksonomication: Predicting tags for movies from plot synopses using emotion flow encoded neural network. In: Proc of the 27th Intl Conf on computational linguistics, pp 2879\u20132891"},{"key":"836_CR16","doi-asserted-by":"publisher","unstructured":"Kaya, M., & Bilge, H. S. (2019). Deep metric learning: A survey. Symmetry, 11(9). https:\/\/doi.org\/10.3390\/sym11091066","DOI":"10.3390\/sym11091066"},{"key":"836_CR17","doi-asserted-by":"publisher","first-page":"6071","DOI":"10.1109\/ACCESS.2019.2963535","volume":"8","author":"UA Khan","year":"2020","unstructured":"Khan, U. A., Mart\u00ednez-del-Amor, M. A., Altowaijri, S. M., et al. (2020). Movie tags prediction and segmentation using deep learning. IEEE Access, 8, 6071\u20136086. https:\/\/doi.org\/10.1109\/ACCESS.2019.2963535","journal-title":"IEEE Access"},{"issue":"7553","key":"836_CR18","doi-asserted-by":"publisher","first-page":"436","DOI":"10.1038\/nature14539","volume":"521","author":"Y Le Cun","year":"2015","unstructured":"Le Cun, Y., Bengio, Y., & Hinton, G. (2015). Deep learning. Nature, 521(7553), 436\u2013444. https:\/\/doi.org\/10.1038\/nature14539","journal-title":"Nature"},{"key":"836_CR19","doi-asserted-by":"publisher","first-page":"2357","DOI":"10.1145\/3442381.3450082","volume":"2021","author":"M Luggen","year":"2021","unstructured":"Luggen, M., Audiffren, J., Difallah, D., et al. (2021). Wiki2prop: A multimodal approach for predicting wikidata properties from wikipedia. Proceedings of the Web Conference, 2021, 2357\u20132366. https:\/\/doi.org\/10.1145\/3442381.3450082","journal-title":"Proceedings of the Web Conference"},{"key":"836_CR20","doi-asserted-by":"publisher","unstructured":"Luo, Z., Tang, G., Wang, C., et\u00a0al. (2021). Generating high-quality movie tags from social reviews: A learning-driven approach. In: 2021 IEEE international conferences on internet of things (iThings) and IEEE green computing & communications (GreenCom) and IEEE cyber, physical & social computing (CPSCom) and IEEE smart data (SmartData) and IEEE congress on cybermatics (Cybermatics), pp 182\u2013189,https:\/\/doi.org\/10.1109\/iThings-GreenCom-CPSCom-SmartData-Cybermatics53846.2021.00040","DOI":"10.1109\/iThings-GreenCom-CPSCom-SmartData-Cybermatics53846.2021.00040"},{"key":"836_CR21","doi-asserted-by":"publisher","unstructured":"Minici, M., Pisani, F.S., Guarascio, M., et\u00a0al. (2022). Learning and explanation of extreme multi-label deep classification models for media content. In: Foundations of intelligent systems. Springer International Publishing, Cham, pp 138\u2013148, https:\/\/doi.org\/10.1007\/978-3-031-16564-1_14","DOI":"10.1007\/978-3-031-16564-1_14"},{"key":"836_CR22","unstructured":"Nair, V., Hinton, G.E. (2010). Rectified linear units improve restricted boltzmann machines. In: Proceedings of the 27th int. conf. on machine learning, ICML\u201910, pp 807\u2013814"},{"key":"836_CR23","doi-asserted-by":"publisher","first-page":"2887","DOI":"10.1007\/S11042-020-08836-3","volume":"80","author":"YR Pandeya","year":"2021","unstructured":"Pandeya, Y. R., & Lee, J. (2021). Deep learning-based late fusion of multimodal information for emotion classification of music video. Multimedia Tools and Applications, 80, 2887\u20132905. https:\/\/doi.org\/10.1007\/S11042-020-08836-3","journal-title":"Multimedia Tools and Applications"},{"key":"836_CR24","doi-asserted-by":"publisher","unstructured":"Rahman, M.M., Malik, S., Islam, M.S., et\u00a0al. (2022). An efficient approach to automatic tag prediction from movie plot synopses using transformer-based language model. In: 2022 25th International conference on computer and information technology (ICCIT), pp 501\u2013505, https:\/\/doi.org\/10.1109\/ICCIT57492.2022.10055349","DOI":"10.1109\/ICCIT57492.2022.10055349"},{"key":"836_CR25","doi-asserted-by":"publisher","unstructured":"Ren, P., Xiao, Y., Chang, X., et al. (2021). A survey of deep active learning. ACM Comput Surv, 54(9). https:\/\/doi.org\/10.1145\/3472291","DOI":"10.1145\/3472291"},{"key":"836_CR26","doi-asserted-by":"publisher","unstructured":"Ribeiro, M.T., Singh, S., Guestrin, C. (2016). \"why should i trust you?\" explaining the predictions of any classifier. In: Proc of the 22nd ACM SIGKDD intl conf on knowledge discovery and data mining, pp 1135\u20131144, https:\/\/doi.org\/10.1145\/2939672.2939778","DOI":"10.1145\/2939672.2939778"},{"key":"836_CR27","doi-asserted-by":"crossref","unstructured":"Schroff, F., Kalenichenko, D., Philbin, J. (2015). Facenet: A unified embedding for face recognition and clustering. In: 2015 IEEE conf on computer vision and pattern recognition (CVPR), pp 815\u2013823, 10.1109\/CVPR.2015.7298682","DOI":"10.1109\/CVPR.2015.7298682"},{"key":"836_CR28","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., et\u00a0al. (2017). Attention is All You Need. In: Proc of the 31st intl conf on neural information processing systems, pp 6000\u20136010"},{"key":"836_CR29","doi-asserted-by":"crossref","unstructured":"Wang, W., Tran, D., Feiszli, M. (2020). What makes training multi-modal classification networks hard? In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 12,695\u201312,705","DOI":"10.1109\/CVPR42600.2020.01271"},{"key":"836_CR30","doi-asserted-by":"publisher","first-page":"973","DOI":"10.1016\/j.asoc.2017.08.029","volume":"61","author":"J Wehrmann","year":"2017","unstructured":"Wehrmann, J., & Barros, R. C. (2017). Movie genre classification: A multi-label approach based on convolutions through time. Applied Soft Computing, 61, 973\u2013982. https:\/\/doi.org\/10.1016\/j.asoc.2017.08.029","journal-title":"Applied Soft Computing"},{"issue":"17","key":"836_CR31","doi-asserted-by":"publisher","first-page":"11399","DOI":"10.1007\/s11042-019-08513-0","volume":"79","author":"C Wu","year":"2020","unstructured":"Wu, C., Wang, C., Zhou, Y., et al. (2020). Exploiting user reviews for automatic movie tagging. Multimedia Tools and Applications, 79(17), 11399\u201311419. https:\/\/doi.org\/10.1007\/s11042-019-08513-0","journal-title":"Multimedia Tools and Applications"},{"key":"836_CR32","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3275156","author":"P Xu","year":"2023","unstructured":"Xu, P., Zhu, X., & Clifton, D. A. (2023). Multimodal learning with transformers: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. https:\/\/doi.org\/10.1109\/TPAMI.2023.3275156","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"836_CR33","doi-asserted-by":"crossref","unstructured":"Zhang, H., Patel, V.M., Chellappa, R. (2017). Hierarchical multimodal metric learning for multimodal classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3057\u20133065","DOI":"10.1109\/CVPR.2017.312"},{"key":"836_CR34","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Gu, Y., Plummer B.A., et\u00a0al. (2024). Movie genre classification by language augmentation and shot sampling. In: IEEE Winter conference on applications of computer vision (WACV)","DOI":"10.1109\/WACV57701.2024.00711"}],"container-title":["Journal of Intelligent Information Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10844-023-00836-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10844-023-00836-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10844-023-00836-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,5]],"date-time":"2024-09-05T08:12:10Z","timestamp":1725523930000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10844-023-00836-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,1,6]]},"references-count":34,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2024,8]]}},"alternative-id":["836"],"URL":"https:\/\/doi.org\/10.1007\/s10844-023-00836-7","relation":{},"ISSN":["0925-9902","1573-7675"],"issn-type":[{"value":"0925-9902","type":"print"},{"value":"1573-7675","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,1,6]]},"assertion":[{"value":"29 June 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 November 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 December 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 January 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}