{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,8]],"date-time":"2026-01-08T00:29:19Z","timestamp":1767832159393,"version":"3.49.0"},"publisher-location":"Cham","reference-count":28,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031784941","type":"print"},{"value":"9783031784958","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T00:00:00Z","timestamp":1733270400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T00:00:00Z","timestamp":1733270400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-78495-8_3","type":"book-chapter","created":{"date-parts":[[2024,12,3]],"date-time":"2024-12-03T09:45:25Z","timestamp":1733219125000},"page":"37-52","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Facet-Aware Multimodal Summarization via\u00a0Cross-Modal Alignment"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0787-550X","authenticated-orcid":false,"given":"Yu","family":"Weng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-8860-9674","authenticated-orcid":false,"given":"Xuming","family":"Ye","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-0259-6553","authenticated-orcid":false,"given":"Tianjiao","family":"Xing","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8522-565X","authenticated-orcid":false,"given":"Zheng","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2736-3878","authenticated-orcid":false,"family":"Chaomurilige","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5064-6526","authenticated-orcid":false,"given":"Xuan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,4]]},"reference":[{"key":"3_CR1","doi-asserted-by":"crossref","unstructured":"Cao, B., Araujo, A., Sim, J.: Unifying deep local and global features for image search. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, 23\u201328 August 2020, Proceedings, Part XX 16, pp. 726\u2013743. Springer (2020)","DOI":"10.1007\/978-3-030-58565-5_43"},{"key":"3_CR2","doi-asserted-by":"publisher","unstructured":"Chen, J., Zhuge, H.: Extractive text-image summarization using multi-modal RNN. In: 14th International Conference on Semantics, Knowledge and Grids, SKG 2018, Guangzhou, China, 12-14 September 2018, pp. 245\u2013248. IEEE (2018). https:\/\/doi.org\/10.1109\/SKG.2018.00033","DOI":"10.1109\/SKG.2018.00033"},{"key":"3_CR3","doi-asserted-by":"crossref","unstructured":"Cui, C., Liang, X., Wu, S., Li, Z.: Align vision-language semantics by multi-task learning for multi-modal summarization. Neural Comput. Appl. 1\u201314 (2024)","DOI":"10.1007\/s00521-024-09908-3"},{"key":"3_CR4","doi-asserted-by":"publisher","unstructured":"Devlin, J., Chang, M., Lee, K., Toutanova, K.: BERT: pre-training of deep bidirectional transformers for language understanding. In: Burstein, J., Doran, C., Solorio, T. (eds.) Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, NAACL-HLT 2019, Minneapolis, MN, USA, 2-7 June 2019, Volume 1 (Long and Short Papers), pp. 4171\u20134186. Association for Computational Linguistics (2019). https:\/\/doi.org\/10.18653\/v1\/n19-1423","DOI":"10.18653\/v1\/n19-1423"},{"key":"3_CR5","doi-asserted-by":"publisher","unstructured":"Ding, C., et al.: Learning aligned audiovisual representations for multimodal sentiment analysis. In: Ghosh, S., Dhall, A., Kollias, D., Goecke, R., Gedeon, T. (eds.) Proceedings of the 1st International Workshop on Multimodal and Responsible Affective Computing, MRAC 2023, Ottawa, ON, Canada, 29 October 2023, pp. 21\u201328. ACM (2023). https:\/\/doi.org\/10.1145\/3607865.3613184","DOI":"10.1145\/3607865.3613184"},{"issue":"7","key":"3_CR6","doi-asserted-by":"publisher","first-page":"1553","DOI":"10.1109\/TMM.2013.2267205","volume":"15","author":"G Evangelopoulos","year":"2013","unstructured":"Evangelopoulos, G., et al.: Multimodal saliency and fusion for movie summarization based on aural, visual, and textual attention. IEEE Trans. Multim. 15(7), 1553\u20131568 (2013). https:\/\/doi.org\/10.1109\/TMM.2013.2267205","journal-title":"IEEE Trans. Multim."},{"issue":"1","key":"3_CR7","first-page":"33","volume":"23","author":"MA Hearst","year":"1997","unstructured":"Hearst, M.A.: Text tiling: segmenting text into multi-paragraph subtopic passages. Comput. Linguist. 23(1), 33\u201364 (1997)","journal-title":"Comput. Linguist."},{"key":"3_CR8","doi-asserted-by":"publisher","unstructured":"La, T., Tran, Q., Tran, T., Tran, A., Dang-Nguyen, D., Dao, M.: Multimodal cheapfakes detection by utilizing image captioning for global context. In: Dao, M., Dang-Nguyen, D., Riegler, M. (eds.) ICDAR@ICMR 2022: Proceedings of the 3rd ACM Workshop on Intelligent Cross-Data Analysis and Retrieval, Newark, NJ, USA, 27\u201330 June 2022, pp. 9\u201316. ACM (2022). https:\/\/doi.org\/10.1145\/3512731.3534210","DOI":"10.1145\/3512731.3534210"},{"key":"3_CR9","doi-asserted-by":"publisher","unstructured":"Lewis, M., Liu, Y., Goyal, N., Ghazvininejad, M., Mohamed, A., Levy, O., Stoyanov, V., Zettlemoyer, L.: BART: denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension. In: Jurafsky, D., Chai, J., Schluter, N., Tetreault, J.R. (eds.) Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, ACL 2020, Online, 5\u201310 July 2020, pp. 7871\u20137880. Association for Computational Linguistics (2020). https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.703","DOI":"10.18653\/v1\/2020.acl-main.703"},{"key":"3_CR10","doi-asserted-by":"publisher","unstructured":"Li, H., Zhu, J., Ma, C., Zhang, J., Zong, C.: Multi-modal summarization for asynchronous collection of text, image, audio and video. In: Palmer, M., Hwa, R., Riedel, S. (eds.) Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, EMNLP 2017, Copenhagen, Denmark, 9\u201311 September 2017, pp. 1092\u20131102. Association for Computational Linguistics (2017). https:\/\/doi.org\/10.18653\/v1\/d17-1114","DOI":"10.18653\/v1\/d17-1114"},{"issue":"5","key":"3_CR11","doi-asserted-by":"publisher","first-page":"996","DOI":"10.1109\/TKDE.2018.2848260","volume":"31","author":"H Li","year":"2019","unstructured":"Li, H., Zhu, J., Ma, C., Zhang, J., Zong, C.: Read, watch, listen, and summarize: multi-modal summarization for asynchronous text, image, audio and video. IEEE Trans. Knowl. Data Eng. 31(5), 996\u20131009 (2019). https:\/\/doi.org\/10.1109\/TKDE.2018.2848260","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"3_CR12","unstructured":"Li, J., Li, D., Xiong, C., Hoi, S.C.H.: BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation. In: Chaudhuri, K., Jegelka, S., Song, L., Szepesv\u00e1ri, C., Niu, G., Sabato, S. (eds.) International Conference on Machine Learning, ICML 2022, 17\u201323 July 2022, Baltimore, Maryland, USA. Proceedings of Machine Learning Research, vol.\u00a0162, pp. 12888\u201312900. PMLR (2022)"},{"key":"3_CR13","unstructured":"Liang, X., Li, J., Wu, S., Zeng, J., Jiang, Y., Li, M., Li, Z.: An efficient coarse-to-fine facet-aware unsupervised summarization framework based on semantic blocks. In: Calzolari, N. (eds.) Proceedings of the 29th International Conference on Computational Linguistics, COLING 2022, Gyeongju, Republic of Korea, 12\u201317 October 2022, pp. 6415\u20136425. International Committee on Computational Linguistics (2022)"},{"key":"3_CR14","doi-asserted-by":"crossref","unstructured":"Liang, Y., Meng, F., Wang, J., Xu, J., Chen, Y., Zhou, J.: D$${^2}$$tv: dual knowledge distillation and target-oriented vision modeling for many-to-many multimodal summarization. In: Bouamor, H., Pino, J., Bali, K. (eds.) Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, 6\u201310 December 2023, pp. 14910\u201314922. Association for Computational Linguistics (2023)","DOI":"10.18653\/v1\/2023.findings-emnlp.994"},{"key":"3_CR15","doi-asserted-by":"publisher","unstructured":"Liu, Y., Lapata, M.: Text summarization with pretrained encoders. In: Inui, K., Jiang, J., Ng, V., Wan, X. (eds.) Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing, EMNLP-IJCNLP 2019, Hong Kong, China, 3\u20137 November 2019, pp. 3728\u20133738. Association for Computational Linguistics (2019). https:\/\/doi.org\/10.18653\/v1\/D19-1387","DOI":"10.18653\/v1\/D19-1387"},{"issue":"1","key":"3_CR16","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TBDATA.2022.3158431","volume":"9","author":"A Pal","year":"2023","unstructured":"Pal, A., Wang, J., Wu, Y., Kant, K., Liu, Z., Sato, K.: Social media driven big data analysis for disaster situation awareness: a tutorial. IEEE Trans. Big Data 9(1), 1\u201321 (2023). https:\/\/doi.org\/10.1109\/TBDATA.2022.3158431","journal-title":"IEEE Trans. Big Data"},{"key":"3_CR17","doi-asserted-by":"publisher","unstructured":"Palaskar, S., Libovick\u00fd, J., Gella, S., Metze, F.: Multimodal abstractive summarization for how2 videos. In: Korhonen, A., Traum, D.R., M\u00e0rquez, L. (eds.) Proceedings of the 57th Conference of the Association for Computational Linguistics, ACL 2019, Florence, Italy, July 28- August 2, 2019, Volume 1: Long Papers, pp. 6587\u20136596. Association for Computational Linguistics (2019). https:\/\/doi.org\/10.18653\/v1\/p19-1659","DOI":"10.18653\/v1\/p19-1659"},{"key":"3_CR18","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. In: Meila, M., Zhang, T. (eds.) Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18\u201324 July 2021, Virtual Event. Proceedings of Machine Learning Research, vol.\u00a0139, pp. 8748\u20138763. PMLR (2021)"},{"key":"3_CR19","doi-asserted-by":"publisher","unstructured":"Ruan, Q., Ostendorff, M., Rehm, G.: Histruct+: Improving extractive text summarization with hierarchical structure information. In: Muresan, S., Nakov, P., Villavicencio, A. (eds.) Findings of the Association for Computational Linguistics: ACL 2022, Dublin, Ireland, 22\u201327 May 2022, pp. 1292\u20131308. Association for Computational Linguistics (2022). https:\/\/doi.org\/10.18653\/V1\/2022.FINDINGS-ACL.102","DOI":"10.18653\/V1\/2022.FINDINGS-ACL.102"},{"key":"3_CR20","doi-asserted-by":"publisher","unstructured":"Thuma, B.S., de\u00a0Vargas, P.S., Garcia, C.M., de\u00a0Souza Britto\u00a0Jr., A., Barddal, J.P.: Benchmarking feature extraction techniques for textual data stream classification. In: International Joint Conference on Neural Networks, IJCNN 2023, Gold Coast, Australia, 18\u201323 June 2023, pp.\u00a01\u20138. IEEE (2023). https:\/\/doi.org\/10.1109\/IJCNN54540.2023.10191369","DOI":"10.1109\/IJCNN54540.2023.10191369"},{"issue":"6","key":"3_CR21","doi-asserted-by":"publisher","first-page":"1367","DOI":"10.1109\/TPAMI.2017.2708709","volume":"40","author":"Q Wu","year":"2018","unstructured":"Wu, Q., Shen, C., Wang, P., Dick, A.R., van den Hengel, A.: Image captioning and visual question answering based on attributes and external knowledge. IEEE Trans. Pattern Anal. Mach. Intell. 40(6), 1367\u20131381 (2018). https:\/\/doi.org\/10.1109\/TPAMI.2017.2708709","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3_CR22","doi-asserted-by":"publisher","unstructured":"Yang, H., Zhao, Y., Qin, B.: Face-sensitive image-to-emotional-text cross-modal translation for multimodal aspect-based sentiment analysis. In: Goldberg, Y., Kozareva, Z., Zhang, Y. (eds.) Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, EMNLP 2022, Abu Dhabi, United Arab Emirates, 7\u201311 December 2022, pp. 3324\u20133335. Association for Computational Linguistics (2022). https:\/\/doi.org\/10.18653\/V1\/2022.EMNLP-MAIN.219","DOI":"10.18653\/V1\/2022.EMNLP-MAIN.219"},{"key":"3_CR23","doi-asserted-by":"publisher","unstructured":"Zhang, C., Zhang, Z., Li, J., Liu, Q., Zhu, H.: Ctnr: compress-then-reconstruct approach for multimodal abstractive summarization. In: International Joint Conference on Neural Networks, IJCNN 2021, Shenzhen, China, 18\u201322 July 2021, pp.\u00a01\u20138. IEEE (2021). https:\/\/doi.org\/10.1109\/IJCNN52387.2021.9534082","DOI":"10.1109\/IJCNN52387.2021.9534082"},{"key":"3_CR24","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Meng, X., Wang, Y., Jiang, X., Liu, Q., Yang, Z.: Unims: a unified framework for multimodal summarization with knowledge distillation. In: Thirty-Sixth AAAI Conference on Artificial Intelligence, AAAI 2022, 1 March 2022, pp. 11757\u201311764. AAAI Press (2022)","DOI":"10.1609\/aaai.v36i10.21431"},{"key":"3_CR25","doi-asserted-by":"publisher","unstructured":"Zhang, Z., Shu, C., Chen, Y., Xiao, J., Zhang, Q., Lu, Z.: ICAF: iterative contrastive alignment framework for multimodal abstractive summarization. In: International Joint Conference on Neural Networks, IJCNN 2022, Padua, Italy, 18\u201323 July 2022, pp.\u00a01\u20138. IEEE (2022). https:\/\/doi.org\/10.1109\/IJCNN55064.2022.9892884","DOI":"10.1109\/IJCNN55064.2022.9892884"},{"key":"3_CR26","doi-asserted-by":"publisher","unstructured":"Zheng, H., Lapata, M.: Sentence centrality revisited for unsupervised summarization. In: Korhonen, A., Traum, D.R., M\u00e0rquez, L. (eds.) Proceedings of the 57th Conference of the Association for Computational Linguistics, ACL 2019, Florence, Italy, July 28- August 2, 2019, Volume 1: Long Papers, pp. 6236\u20136247. Association for Computational Linguistics (2019). https:\/\/doi.org\/10.18653\/v1\/p19-1628","DOI":"10.18653\/v1\/p19-1628"},{"key":"3_CR27","doi-asserted-by":"publisher","unstructured":"Zhu, J., Li, H., Liu, T., Zhou, Y., Zhang, J., Zong, C.: MSMO: multimodal summarization with multimodal output. In: Riloff, E., Chiang, D., Hockenmaier, J., Tsujii, J. (eds.) Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, Brussels, Belgium, October 31 - November 4, 2018, pp. 4154\u20134164. Association for Computational Linguistics (2018). https:\/\/doi.org\/10.18653\/v1\/d18-1448","DOI":"10.18653\/v1\/d18-1448"},{"key":"3_CR28","doi-asserted-by":"crossref","unstructured":"Zhu, J., Zhou, Y., Zhang, J., Li, H., Zong, C., Li, C.: Multimodal summarization with guidance of multimodal reference. In: The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, New York, NY, USA, 7\u201312 February 2020, pp. 9749\u20139756. AAAI Press (2020)","DOI":"10.1609\/aaai.v34i05.6525"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-78495-8_3","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,3]],"date-time":"2024-12-03T10:23:30Z","timestamp":1733221410000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-78495-8_3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,4]]},"ISBN":["9783031784941","9783031784958"],"references-count":28,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-78495-8_3","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,4]]},"assertion":[{"value":"4 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kolkata","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"1 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2024.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}