{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T16:27:30Z","timestamp":1785601650773,"version":"3.56.0"},"publisher-location":"Singapore","reference-count":21,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819794423","type":"print"},{"value":"9789819794430","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,1]],"date-time":"2024-11-01T00:00:00Z","timestamp":1730419200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,1]],"date-time":"2024-11-01T00:00:00Z","timestamp":1730419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-97-9443-0_42","type":"book-chapter","created":{"date-parts":[[2024,10,31]],"date-time":"2024-10-31T16:29:30Z","timestamp":1730392170000},"page":"471-483","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Multilingual Temporal Answer Grounding in\u00a0Video Corpus with\u00a0Enhanced Visual-Textual Integration"],"prefix":"10.1007","author":[{"given":"Tianxing","family":"Ma","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yueyue","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuang","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhenhao","family":"Yin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tianning","family":"Zang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,11,1]]},"reference":[{"key":"42_CR1","doi-asserted-by":"publisher","first-page":"33","DOI":"10.1007\/s41095-021-0247-3","volume":"8","author":"X Yifan","year":"2022","unstructured":"Yifan, X., et al.: Transformers in computational visual media: a survey. Comput. Visual Media 8, 33\u201362 (2022)","journal-title":"Comput. Visual Media"},{"issue":"1","key":"42_CR2","doi-asserted-by":"publisher","first-page":"165","DOI":"10.1108\/INTR-06-2018-0270","volume":"30","author":"M T\u00f6rh\u00f6nen","year":"2020","unstructured":"T\u00f6rh\u00f6nen, M., Sj\u00f6blom, M., Hassan, L., Hamari, J.: Fame and fortune, or just fun? a study on why people create content on video platforms. Internet Res. 30(1), 165\u2013190 (2020)","journal-title":"Internet Res."},{"key":"42_CR3","unstructured":"Colas, A., Kim, S., Dernoncourt, F., Gupte, S., Wang, D.Z., Kim. D.S.: Tutorialvqa: Question answering dataset for tutorial videos. arXiv preprint arXiv:1912.01046 (2019)"},{"key":"42_CR4","doi-asserted-by":"crossref","unstructured":"Buch, S., Eyzaguirre, C., Gaidon, A., Wu, J., Fei-Fei, L., Niebles, J.C.: Revisiting the video in video-language understanding. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2917\u20132927 (2022)","DOI":"10.1109\/CVPR52688.2022.00293"},{"issue":"12","key":"42_CR5","doi-asserted-by":"publisher","first-page":"10028","DOI":"10.1109\/TNNLS.2022.3163771","volume":"34","author":"Q Song","year":"2022","unstructured":"Song, Q., Sun, B., Li, S.: Multimodal sparse transformer network for audio-visual speech recognition. IEEE Trans. Neural Netw. Learni. Syst. 34(12), 10028\u201310038 (2022)","journal-title":"IEEE Trans. Neural Netw. Learni. Syst."},{"key":"42_CR6","doi-asserted-by":"crossref","unstructured":"Gao, J., Sun, X., Xu, M., Zhou, X., Ghanem, B.: Relation-aware video reading comprehension for temporal language grounding. In Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, pp. 3978\u20133988 (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.324"},{"key":"42_CR7","doi-asserted-by":"crossref","unstructured":"Li, S., Li, B., Sun, B., Weng, Y.: Towards visual-prompt temporal answer grounding in instructional video. IEEE Trans. Patt. Anal. Mach. Intell. 1\u201318 (2024)","DOI":"10.1109\/TPAMI.2024.3411045"},{"key":"42_CR8","doi-asserted-by":"crossref","unstructured":"Weng, Y., Li, B.: Visual answer localization with cross-modal mutual knowledge transfer. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10095026"},{"key":"42_CR9","doi-asserted-by":"crossref","unstructured":"Zhang, H.: Video corpus moment retrieval with contrastive learning. In Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 685\u2013695 (2021)","DOI":"10.1145\/3404835.3462874"},{"key":"42_CR10","doi-asserted-by":"crossref","unstructured":"Li, B., Weng, Y., Sun, B., Li, S.: Learning to locate visual answer in video corpus using question. In ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 1\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10096391"},{"key":"42_CR11","unstructured":"Sou\u010dek, T., Loko\u010d, J.: Transnet v2: An effective deep network architecture for fast shot transition detection. arXiv preprint arXiv:2008.04838, 2020"},{"key":"42_CR12","doi-asserted-by":"crossref","unstructured":"Wan, J., et al.: Omniparser: a unified framework for text spotting key information extraction and table recognition. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15641\u201315653 (2024)","DOI":"10.1109\/CVPR52733.2024.01481"},{"key":"42_CR13","unstructured":"Robinson, J., Chuang, C.Y., Sra, S., Jegelka, S.: Contrastive learning with hard negative samples. arXiv preprint arXiv:2010.04592 (2020)"},{"key":"42_CR14","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? A new model and the kinetics dataset. In proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6299\u20136308 (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"42_CR15","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018)"},{"key":"42_CR16","doi-asserted-by":"crossref","unstructured":"Zhang, H., Sun, A., Jing, W., Zhou, J.T.: Span-based localizing network for natural language video localization. arXiv preprint arXiv:2004.13931 (2020)","DOI":"10.18653\/v1\/2020.acl-main.585"},{"key":"42_CR17","doi-asserted-by":"publisher","first-page":"127063","DOI":"10.1016\/j.neucom.2023.127063","volume":"568","author":"S Jianlin","year":"2024","unstructured":"Jianlin, S., Murtadha Ahmed, Y.L., Pan, S., Bo, W., Liu, Y.: Roformer: enhanced transformer with rotary position embedding. Neurocomputing 568, 127063 (2024)","journal-title":"Neurocomputing"},{"key":"42_CR18","doi-asserted-by":"crossref","unstructured":"Zhang, H., Sun, A., Jing, W., Zhen, L., Zhou, J.T., Goh, R.S.M.: Natural language video localization: a revisit in span-based question answering framework. IEEE Trans. Patt. Anal. Mach. Intell. 44(8), 4252\u20134266 (2021)","DOI":"10.1109\/TPAMI.2021.3060449"},{"issue":"1","key":"42_CR19","doi-asserted-by":"publisher","first-page":"158","DOI":"10.1038\/s41597-023-02036-y","volume":"10","author":"D Gupta","year":"2023","unstructured":"Gupta, D., Attal, K., Demner-Fushman, D.: A dataset for medical instructional video classification and question answering. Sci. Data 10(1), 158 (2023)","journal-title":"Sci. Data"},{"key":"42_CR20","doi-asserted-by":"publisher","unstructured":"Li, B., et\u00a0al.: Overview of the NLPCC 2023 shared task: chinese medical instructional video question answering. In: CCF International Conference on Natural Language Processing and Chinese Computing, pp. 233\u2013242. Springer (2023). https:\/\/doi.org\/10.1007\/978-3-031-44699-3_21","DOI":"10.1007\/978-3-031-44699-3_21"},{"key":"42_CR21","doi-asserted-by":"publisher","unstructured":"Cheng, S., Zhou, Z., Liu, J., Ye, J., Luo, H., Gu, Y.: A unified framework for optimizing video corpus retrieval and temporal answer grounding: fine-grained modality alignment and local-global optimization. In CCF International Conference on Natural Language Processing and Chinese Computing, pp. 199\u2013210. Springer (2023). https:\/\/doi.org\/10.1007\/978-3-031-44699-3_18","DOI":"10.1007\/978-3-031-44699-3_18"}],"container-title":["Lecture Notes in Computer Science","Natural Language Processing and Chinese Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-97-9443-0_42","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,31]],"date-time":"2024-10-31T16:36:53Z","timestamp":1730392613000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-97-9443-0_42"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,1]]},"ISBN":["9789819794423","9789819794430"],"references-count":21,"URL":"https:\/\/doi.org\/10.1007\/978-981-97-9443-0_42","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,1]]},"assertion":[{"value":"1 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"NLPCC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"CCF International Conference on Natural Language Processing and Chinese Computing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hangzhou","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2 November 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 November 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"13","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"nlpcc2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/tcci.ccf.org.cn\/conference\/2024\/index.php","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}