{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T05:19:13Z","timestamp":1783142353984,"version":"3.54.6"},"publisher-location":"Cham","reference-count":51,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030687892","type":"print"},{"value":"9783030687908","type":"electronic"}],"license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021]]},"DOI":"10.1007\/978-3-030-68790-8_27","type":"book-chapter","created":{"date-parts":[[2021,2,22]],"date-time":"2021-02-22T13:13:24Z","timestamp":1613999604000},"page":"339-356","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":14,"title":["Recent Advances in Video Question Answering: A Review of Datasets and Methods"],"prefix":"10.1007","author":[{"given":"Devshree","family":"Patel","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ratnam","family":"Parikh","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yesha","family":"Shastri","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,2,23]]},"reference":[{"issue":"2","key":"27_CR1","doi-asserted-by":"publisher","first-page":"42","DOI":"10.1109\/MMUL.2014.29","volume":"21","author":"K Tu","year":"2014","unstructured":"Tu, K., et al.: Joint video and text parsing for understanding events and answering queries. IEEE MultiMed. 21(2), 42\u201370 (2014)","journal-title":"IEEE MultiMed."},{"key":"27_CR2","doi-asserted-by":"crossref","unstructured":"Yu, Y., et al.: End-to-end concept word detection for video captioning, retrieval, and question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2017)","DOI":"10.1109\/CVPR.2017.347"},{"issue":"3","key":"27_CR3","doi-asserted-by":"publisher","first-page":"409","DOI":"10.1007\/s11263-017-1033-7","volume":"124","author":"L Zhu","year":"2017","unstructured":"Zhu, L., et al.: Uncovering the temporal context for video question answering. Int. J. Comput. Vis. 124(3), 409\u2013421 (2017)","journal-title":"Int. J. Comput. Vis."},{"key":"27_CR4","doi-asserted-by":"crossref","unstructured":"Zeng, K., et al.: Leveraging video descriptions to learn video question answering. In: Thirty-First AAAI Conference on Artificial Intelligence (2017)","DOI":"10.1609\/aaai.v31i1.11238"},{"key":"27_CR5","doi-asserted-by":"crossref","unstructured":"Ye, Y., et al.: Video question answering via attribute-augmented attention network learning. In: Proceedings of the 40th International ACM SIGIR conference on Research and Development in Information Retrieval (2017)","DOI":"10.1145\/3077136.3080655"},{"key":"27_CR6","doi-asserted-by":"crossref","unstructured":"Zhao, Z., et al.: Video question answering via hierarchical spatio-temporal attention networks. In: IJCAI (2017)","DOI":"10.24963\/ijcai.2017\/492"},{"key":"27_CR7","doi-asserted-by":"crossref","unstructured":"Xu, D., et al.: Video question answering via gradually refined attention over appearance and motion. In: Proceedings of the 25th ACM International Conference on Multimedia (2017)","DOI":"10.1145\/3123266.3123427"},{"key":"27_CR8","doi-asserted-by":"crossref","unstructured":"Kim, K., et al.: Deepstory: Video story qa by deep embedded memory networks. arXiv preprint arXiv:1707.00836 (2017)","DOI":"10.24963\/ijcai.2017\/280"},{"key":"27_CR9","doi-asserted-by":"crossref","unstructured":"Zhao, Z., et al.: Video question answering via hierarchical dual-level attention network learning. In: Proceedings of the 25th ACM International Conference on Multimedia (2017)","DOI":"10.1145\/3123266.3123364"},{"key":"27_CR10","doi-asserted-by":"crossref","unstructured":"Gao, J., et al.: Motion-appearance co-memory networks for video question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2018)","DOI":"10.1109\/CVPR.2018.00688"},{"key":"27_CR11","doi-asserted-by":"crossref","unstructured":"Zhao, Z., et al.: Open-ended long-form video question answering via adaptive hierarchical reinforced networks. In: IJCAI (2018)","DOI":"10.24963\/ijcai.2018\/512"},{"key":"27_CR12","doi-asserted-by":"crossref","unstructured":"Kim, K., et al.: Multimodal dual attention memory for video story question answering. In: Proceedings of the European Conference on Computer Vision (ECCV) (2018)","DOI":"10.1007\/978-3-030-01267-0_41"},{"key":"27_CR13","doi-asserted-by":"crossref","unstructured":"Fan, C., et al.: Heterogeneous memory enhanced multimodal attention model for video question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2019)","DOI":"10.1109\/CVPR.2019.00210"},{"key":"27_CR14","doi-asserted-by":"crossref","unstructured":"Chao, G., et al.: Learning question-guided video representation for multi-turn video question answering. arXiv:1907.13280 (2019)","DOI":"10.18653\/v1\/W19-5926"},{"issue":"4","key":"27_CR15","doi-asserted-by":"publisher","first-page":"1032","DOI":"10.1109\/TMM.2019.2935678","volume":"22","author":"W Zhang","year":"2019","unstructured":"Zhang, W., et al.: Frame augmented alternating attention network for video question answering. IEEE Trans. Multimed. 22(4), 1032\u20131041 (2019)","journal-title":"IEEE Trans. Multimed."},{"key":"27_CR16","doi-asserted-by":"crossref","unstructured":"Li, X., et al.: Beyond rnns: positional self-attention with co-attention for video question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33 (2019)","DOI":"10.1609\/aaai.v33i01.33018658"},{"key":"27_CR17","doi-asserted-by":"crossref","unstructured":"Yang, T., et al.: Question-aware tube-switch network for video question answering. In: Proceedings of the 27th ACM International Conference on Multimedia (2019)","DOI":"10.1145\/3343031.3350969"},{"key":"27_CR18","doi-asserted-by":"crossref","unstructured":"Gao, L., et al.: Structured two-stream attention network for video question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33 (2019)","DOI":"10.1609\/aaai.v33i01.33016391"},{"key":"27_CR19","doi-asserted-by":"crossref","unstructured":"Jin, W., et al.: Multi-interaction network with object relation for video question answering. In: Proceedings of the 27th ACM International Conference on Multimedia (2019)","DOI":"10.1145\/3343031.3351065"},{"key":"27_CR20","doi-asserted-by":"crossref","unstructured":"Kim, J., et al.: Progressive attention memory network for movie story question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2019)","DOI":"10.1109\/CVPR.2019.00853"},{"key":"27_CR21","doi-asserted-by":"crossref","unstructured":"Huang, D., et al.: Location-aware graph convolutional networks for video question answering. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6737"},{"key":"27_CR22","doi-asserted-by":"publisher","first-page":"1204","DOI":"10.1109\/TIP.2019.2940677","volume":"29","author":"T Yu","year":"2019","unstructured":"Yu, T., et al.: Compositional attention networks with two-stream fusion for video question answering. IEEE Trans. Image Process. 29, 1204\u20131218 (2019)","journal-title":"IEEE Trans. Image Process."},{"issue":"2","key":"27_CR23","first-page":"42","volume":"21","author":"Z Yuan","year":"2020","unstructured":"Yuan, Z., et al.: Adversarial multimodal network for movie story question answering. IEEE Trans. Multimed. 21(2), 42\u201370 (2020)","journal-title":"IEEE Trans. Multimed."},{"key":"27_CR24","doi-asserted-by":"publisher","first-page":"3859","DOI":"10.1109\/TIP.2020.2963950","volume":"29","author":"Z Zhao","year":"2020","unstructured":"Zhao, Z., et al.: Open-ended video question answering via multi-modal conditional adversarial networks. IEEE Trans. Image Proces. 29, 3859\u20133870 (2020)","journal-title":"IEEE Trans. Image Proces."},{"issue":"1","key":"27_CR25","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3374760","volume":"16","author":"Y Zhuang","year":"2020","unstructured":"Zhuang, Y., et al.: Multichannel attention refinement for video question answering. ACM Trans. Multimed. Comput. Commun. Appl. 16(1), 1\u201323 (2020)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"key":"27_CR26","doi-asserted-by":"crossref","unstructured":"Lei, C., et al.: Multi-question learning for visual question answering. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6794"},{"key":"27_CR27","doi-asserted-by":"crossref","unstructured":"Yang, Z., et al.: BERT representations for video question answering. In: The IEEE Winter Conference on Applications of Computer Vision (2020)","DOI":"10.1109\/WACV45572.2020.9093596"},{"key":"27_CR28","doi-asserted-by":"crossref","unstructured":"Jiang, Jianwen, et al. \u201cDivide and Conquer: Question-Guided Spatio-Temporal Contextual Attention for Video Question Answering.\u201d AAAI. 2020","DOI":"10.1609\/aaai.v34i07.6766"},{"key":"27_CR29","doi-asserted-by":"crossref","unstructured":"Le, T.M., et al.: Hierarchical conditional relation networks for video question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (2020)","DOI":"10.1109\/CVPR42600.2020.00999"},{"key":"27_CR30","doi-asserted-by":"crossref","unstructured":"Yu, T., et al.: Long-term video question answering via multimodal hierarchical memory attentive networks. IEEE Trans. Circuits Syst. Video Technol. (2020)","DOI":"10.1109\/TCSVT.2020.2995959"},{"key":"27_CR31","doi-asserted-by":"crossref","unstructured":"Jiang, P., Yahong, H.: Reasoning with heterogeneous graph alignment for video question answering. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6767"},{"issue":"6","key":"27_CR32","doi-asserted-by":"publisher","first-page":"63","DOI":"10.1109\/MSP.2017.2739826","volume":"34","author":"D Teney","year":"2017","unstructured":"Teney, D., et al.: Visual question answering: a tutorial. IEEE Signal Process. Magaz. 34(6), 63\u201375 (2017)","journal-title":"IEEE Signal Process. Magaz."},{"key":"27_CR33","unstructured":"Castro, S., et al.: LifeQA: a real-life dataset for video question answering. In: Proceedings of the 12th Language Resources and Evaluation Conference (2020)"},{"key":"27_CR34","doi-asserted-by":"crossref","unstructured":"Fan, C.: EgoVQA-an egocentric video question answering benchmark dataset. In: Proceedings of the IEEE International Conference on Computer Vision Workshops (2019)","DOI":"10.1109\/ICCVW.2019.00536"},{"key":"27_CR35","doi-asserted-by":"crossref","unstructured":"Yu, Z., et al.: Activitynet-QA: A dataset for understanding complex web videos via question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33 (2019)","DOI":"10.1609\/aaai.v33i01.33019127"},{"key":"27_CR36","doi-asserted-by":"crossref","unstructured":"Tapaswi, M., et al.: Movieqa: understanding stories in movies through question-answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2016)","DOI":"10.1109\/CVPR.2016.501"},{"key":"27_CR37","doi-asserted-by":"crossref","unstructured":"Mun, J., et al.: Marioqa: answering questions by watching gameplay videos. In: Proceedings of the IEEE International Conference on Computer Vision (2017)","DOI":"10.1109\/ICCV.2017.312"},{"key":"27_CR38","doi-asserted-by":"crossref","unstructured":"Zadeh, A., et al.: Social-iq: a question answering benchmark for artificial social intelligence. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2019)","DOI":"10.1109\/CVPR.2019.00901"},{"key":"27_CR39","doi-asserted-by":"crossref","unstructured":"Garcia, N., et al.: KnowIT VQA: answering knowledge-based questions about videos. arXiv preprint arXiv:1910.10706 (2019)","DOI":"10.1609\/aaai.v34i07.6713"},{"key":"27_CR40","doi-asserted-by":"crossref","unstructured":"Lei, J., et al.: Tvqa: localized, compositional video question answering. arXiv preprint arXiv:1809.01696 (2018)","DOI":"10.18653\/v1\/D18-1167"},{"key":"27_CR41","doi-asserted-by":"crossref","unstructured":"Lei, J., et al.: Tvqa+: spatio-temporal grounding for video question answering. arXiv preprint arXiv:1904.11574 (2019)","DOI":"10.18653\/v1\/2020.acl-main.730"},{"key":"27_CR42","doi-asserted-by":"crossref","unstructured":"Maharaj, T., et al.: A dataset and exploration of models for understanding video data through fill-in-the-blank question-answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2017)","DOI":"10.1109\/CVPR.2017.778"},{"key":"27_CR43","unstructured":"Choi, S., et al.: DramaQA: character-centered video story understanding with hierarchical QA. arXiv preprint arXiv:2005.03356 (2020)"},{"key":"27_CR44","doi-asserted-by":"crossref","unstructured":"Jang, Y., et al.: Tgif-qa: toward spatio-temporal reasoning in visual question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2017)","DOI":"10.1109\/CVPR.2017.149"},{"key":"27_CR45","doi-asserted-by":"crossref","unstructured":"Xu, J., et al.: Msr-vtt: a large video description dataset for bridging video and language. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2016)","DOI":"10.1109\/CVPR.2016.571"},{"key":"27_CR46","unstructured":"Alamri, H., et al.: Audio visual scene-aware dialog (avsd) challenge at dstc7. arXiv preprint arXiv:1806.00525 (2018)"},{"key":"27_CR47","doi-asserted-by":"crossref","unstructured":"Rohrbach, A., et al.: A dataset for movie description. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2015)","DOI":"10.1109\/CVPR.2015.7298940"},{"key":"27_CR48","doi-asserted-by":"crossref","unstructured":"Guadarrama, S., et al.: Youtube2text: recognizing and describing arbitrary activities using semantic hierarchies and zero-shot recognition. In: Proceedings of the IEEE International Conference On Computer Vision (2013)","DOI":"10.1109\/ICCV.2013.337"},{"key":"27_CR49","unstructured":"Chen, D., William B.D.: Collecting highly parallel data for paraphrase evaluation. In: Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies (2011)"},{"key":"27_CR50","unstructured":"Caba, H.F., et al.: Activitynet: a large-scale video benchmark for human activity understanding. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2015)"},{"key":"27_CR51","doi-asserted-by":"crossref","unstructured":"Li, Y., et al.: TGIF: a new dataset and benchmark on animated GIF description. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2016)","DOI":"10.1109\/CVPR.2016.502"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition. ICPR International Workshops and Challenges"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-68790-8_27","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,18]],"date-time":"2022-12-18T14:11:59Z","timestamp":1671372719000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-030-68790-8_27"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"ISBN":["9783030687892","9783030687908"],"references-count":51,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-68790-8_27","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]},"assertion":[{"value":"23 February 2021","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2021","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"10 January 2021","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"11 January 2021","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ICPR2020","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.icpr2020.it\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}