{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:25:46Z","timestamp":1777656346471,"version":"3.51.4"},"reference-count":67,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2019,6,18]],"date-time":"2019-06-18T00:00:00Z","timestamp":1560816000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2019,6,18]],"date-time":"2019-06-18T00:00:00Z","timestamp":1560816000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100010418","name":"IITP","doi-asserted-by":"crossref","award":["2017-0-01772"],"award-info":[{"award-number":["2017-0-01772"]}],"id":[{"id":"10.13039\/501100010418","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Yahoo Research","award":["Academic Research Program"],"award-info":[{"award-number":["Academic Research Program"]}]},{"DOI":"10.13039\/501100002551","name":"Seoul National University","doi-asserted-by":"publisher","award":["Creative-Pioneering Researchers Program"],"award-info":[{"award-number":["Creative-Pioneering Researchers Program"]}],"id":[{"id":"10.13039\/501100002551","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2019,10]]},"DOI":"10.1007\/s11263-019-01189-x","type":"journal-article","created":{"date-parts":[[2019,6,18]],"date-time":"2019-06-18T06:22:05Z","timestamp":1560838925000},"page":"1385-1412","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":42,"title":["Video Question Answering with Spatio-Temporal Reasoning"],"prefix":"10.1007","volume":"127","author":[{"given":"Yunseok","family":"Jang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yale","family":"Song","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chris Dongjoo","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Youngjae","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Youngjin","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9543-7453","authenticated-orcid":false,"given":"Gunhee","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,6,18]]},"reference":[{"key":"1189_CR1","doi-asserted-by":"crossref","unstructured":"Agrawal, A., Batra, D., Parikh, D., & Kembhavi, A. (2018). Don\u2019t just assume; look and answer: Overcoming priors for visual question answering. In: CVPR","DOI":"10.1109\/CVPR.2018.00522"},{"key":"1189_CR2","doi-asserted-by":"crossref","unstructured":"Andreas, J., Rohrbach, M., Darrel, T., & Klein, D. (2016a). Learning to compose neural networks for question answering. In: NAACL","DOI":"10.18653\/v1\/N16-1181"},{"key":"1189_CR3","doi-asserted-by":"crossref","unstructured":"Andreas, J., Rohrbach, M., Darrell, T., & Klein, D. (2016b). Neural module networks. In: CVPR","DOI":"10.1109\/CVPR.2016.12"},{"key":"1189_CR4","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., & Parikh, D. (2015). VQA: Visual question answering. In: ICCV","DOI":"10.1109\/ICCV.2015.279"},{"key":"1189_CR5","unstructured":"Ba, J.L., Kiros, J.R., & Hinton, G.E. (2016). Layer normalization. In: \n                    arXiv:1607.06450"},{"key":"1189_CR6","unstructured":"Bahdanau, D., Cho, K., & Bengio, Y. (2015). Neural machine translation by jointly learning to align and translate. In: ICLR"},{"key":"1189_CR7","doi-asserted-by":"crossref","unstructured":"Bakhshi, S., Shamma, D.A., Kennedy, L., Song, Y., de\u00a0Juan, P., & Kaye, J.J. (2016). Fast, Cheap, and Good\u2014Why animated GIFs engage us. In: CHI","DOI":"10.1145\/2858036.2858532"},{"key":"1189_CR8","unstructured":"Chomsky, N. (1971). Conditions on transformations. In: Indiana University Linguistics Club"},{"key":"1189_CR9","doi-asserted-by":"crossref","unstructured":"Daiber, J., Jakob, M., Hokamp, C., & Mendes, P.N. (2013). Improving efficiency and accuracy in multilingual entity extraction. In: I-Semantics","DOI":"10.1145\/2506182.2506198"},{"key":"1189_CR10","doi-asserted-by":"crossref","unstructured":"Das, A., Kottur, S., Gupta, K., Singh, A., Yadav, D., Moura, J.M.F., Parikh, D., & Batra, D. (2017). Visual dialog. In: CVPR","DOI":"10.1109\/CVPR.2017.121"},{"key":"1189_CR11","doi-asserted-by":"publisher","first-page":"92","DOI":"10.1145\/2701413","volume":"58","author":"E Davis","year":"2015","unstructured":"Davis, E., & Marcus, G. (2015). Commonsense reasoning and commonsense knowledge in artificial intelligence. CACM, 58, 92\u2013103.","journal-title":"CACM"},{"key":"1189_CR12","unstructured":"Denkowski, M., & Lavie, A. (2011). Meteor universal: Language specific translation evaluation for any target language. In: EMNLP"},{"key":"1189_CR13","doi-asserted-by":"crossref","unstructured":"Farneback, G. (2003). Two-frame motion estimation based on polynomial expansion. In: SCIA","DOI":"10.1007\/3-540-45103-X_50"},{"key":"1189_CR14","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/7287.001.0001","volume-title":"WordNet: An electronic lexical database","author":"C Fellbaum","year":"1998","unstructured":"Fellbaum, C. (1998). WordNet: An electronic lexical database. Cambridge: MIT Press."},{"key":"1189_CR15","doi-asserted-by":"crossref","unstructured":"Fukui, A., Park, D.H., Yang, D., Rohrbach, A., Darrell, T., & Rohrbach, M. (2016). Multimodal compact bilinear pooling for visual question answering and visual grounding. In: EMNLP","DOI":"10.18653\/v1\/D16-1044"},{"key":"1189_CR16","doi-asserted-by":"crossref","unstructured":"Gao, J., & Ge, R. (2018). Motion-appearance co-memory networks for video question answering. In: CVPR","DOI":"10.1109\/CVPR.2018.00688"},{"key":"1189_CR17","unstructured":"Gao, H., Mao, J., Zhou, J., Huang, Z., Wang, L., & Xu, W. (2015). Are you talking to a machine? Dataset and methods for multilingual image question answering. In: NIPS"},{"key":"1189_CR18","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., & Parikh, D. (2017). Making the V in VQA matter: Elevating the role of image understanding in visual question answering. In: CVPR","DOI":"10.1109\/CVPR.2017.670"},{"key":"1189_CR19","doi-asserted-by":"crossref","unstructured":"Gygli, M., Song, Y., & Cao, L. (2016). Video2GIF: Automatic generation of animated GIFs from video. In: CVPR","DOI":"10.1109\/CVPR.2016.114"},{"key":"1189_CR20","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In: CVPR","DOI":"10.1109\/CVPR.2016.90"},{"key":"1189_CR21","doi-asserted-by":"crossref","unstructured":"Isola, P., Lim, J.J., & Adelson, E.H. (2015). Discovering states and transformations in image collections. In: CVPR","DOI":"10.1109\/CVPR.2015.7298744"},{"key":"1189_CR22","doi-asserted-by":"crossref","unstructured":"Jang, Y., Song, Y., Yu, Y., Kim, Y., & Kim, G. (2017). TGIF-QA: Toward spatio-temporal reasoning in visual question answering. In: CVPR","DOI":"10.1109\/CVPR.2017.149"},{"key":"1189_CR23","doi-asserted-by":"crossref","unstructured":"Johnson, J., Hariharan, B., van\u00a0der Maaten, L., Fei-Fei, L., Zitnick, C.L., & Girshick, R. (2017). CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning. In: CVPR","DOI":"10.1109\/CVPR.2017.215"},{"key":"1189_CR24","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., & Li, F.F. (2014). Large-scale video classification with convolutional neural networks. In: CVPR","DOI":"10.1109\/CVPR.2014.223"},{"key":"1189_CR25","doi-asserted-by":"crossref","unstructured":"Kim, K., Heo, M., Choi, S., & Zhang, B. (2017). DeepStory: Video story QA by deep embedded memory networks. In: IJCAI","DOI":"10.24963\/ijcai.2017\/280"},{"key":"1189_CR26","unstructured":"Kim, J.H., Lee, S.W,, Kwak, D.H., Heo, M.O., Kim, J., Ha, J.W., & Zhang, B.T. (2016). Multimodal residual learning for visual QA. In: NIPS"},{"key":"1189_CR27","unstructured":"Kingma, D.P., & Ba, J.L. (2015). ADAM: A method for stochastic optimization. In: ICLR"},{"key":"1189_CR28","unstructured":"Kipper-Schuler, K. (2005). VerbNet: A broad-coverage, comprehensive verb lexicon. PhD thesis, UPenn CIS"},{"key":"1189_CR29","unstructured":"Kiros, J.R., Zhu, Y., Salakhutdinov, R., Zemel, R.S., Torralba, A., Urtasun, R., & Fidler, S. (2015). Skip-thought vectors. In: NIPS"},{"key":"1189_CR30","doi-asserted-by":"crossref","unstructured":"Lei, J., Yu, L., Bansal, M., & Berg, T. (2018). TVQA: Localized, compositional video question answering. In: EMNLP","DOI":"10.18653\/v1\/D18-1167"},{"key":"1189_CR31","doi-asserted-by":"crossref","unstructured":"Levi, G., & Hassner, T. (2015). Emotion recognition in the wild via convolutional neural networks and mapped binary patterns. In: ICMI","DOI":"10.1145\/2818346.2830587"},{"key":"1189_CR32","doi-asserted-by":"crossref","unstructured":"Levy, O., & Wolf, L. (2015). Live repetition counting. In: ICCV","DOI":"10.1109\/ICCV.2015.346"},{"key":"1189_CR33","doi-asserted-by":"crossref","unstructured":"Li, Y., Song, Y., Cao, L., Tetreault, J., Goldberg, L., Jaimes, A., & Luo, J. (2016). TGIF: A new dataset and benchmark on animated GIF description. In: CVPR","DOI":"10.1109\/CVPR.2016.502"},{"key":"1189_CR34","doi-asserted-by":"crossref","unstructured":"Lin, X., & Parikh, D. (2015). Don\u2019t just listen, use your imagination: Leveraging visual common sense for non-visual tasks. In: CVPR","DOI":"10.1109\/CVPR.2015.7298917"},{"key":"1189_CR35","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Maire, M., Belongie, S.J., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C.L. (2014). Microsoft COCO\u2014common objects in context. In: ECCV","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1189_CR36","doi-asserted-by":"crossref","unstructured":"Maharaj, T., Ballas, N., Rohrbach, A., Courville, A., & Pal, C. (2017). A dataset and exploration of models for understanding video data through fill-in-the-blank question-answering. In: CVPR","DOI":"10.1109\/CVPR.2017.778"},{"key":"1189_CR37","unstructured":"Malinowski, M., & Fritz, M. (2014). A multi-world approach to question answering about real-world scenes based on uncertain input. In: NIPS"},{"key":"1189_CR38","doi-asserted-by":"crossref","unstructured":"Malinowski, M., Rohrbach, M., & Fritz, M. (2015). Ask your neurons: A neural-based approach to answering questions about images. In: ICCV","DOI":"10.1109\/ICCV.2015.9"},{"key":"1189_CR39","doi-asserted-by":"crossref","unstructured":"Manning, C.D., Surdeanu, M., Bauer, J., Finkel, J., Bethard, S.J., & McClosky, D. (2014). The Stanford CoreNLP natural language processing toolkit. In: ACL","DOI":"10.3115\/v1\/P14-5010"},{"key":"1189_CR40","doi-asserted-by":"crossref","unstructured":"Mun, J., Seo, P.H., Jung, I., & Han, B. (2017). MarioQA: Answering questions by watching gameplay videos. In: ICCV","DOI":"10.1109\/ICCV.2017.312"},{"key":"1189_CR41","doi-asserted-by":"crossref","unstructured":"Na, S., Lee, S., Kim, J., & Kim, G. (2018). A read-write memory network for movie story understanding. In: ICCV","DOI":"10.1109\/ICCV.2017.80"},{"key":"1189_CR42","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., & Zhu, W.J. (2002). Bleu: A method for automatic evaluation of machine translation. In: ACL","DOI":"10.3115\/1073083.1073135"},{"key":"1189_CR43","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., & Manning, C.D. (2014). Glove\u2014Global vectors for word representation. In: EMNLP","DOI":"10.3115\/v1\/D14-1162"},{"key":"1189_CR44","doi-asserted-by":"crossref","unstructured":"Pham, V., Bluche, T., Kermorvant, C., & Louradour, J. (2014). Dropout improves recurrent neural networks for handwriting recognition. In: ICFHR","DOI":"10.1109\/ICFHR.2014.55"},{"key":"1189_CR45","doi-asserted-by":"crossref","unstructured":"Piotr\u00a0Bojanwoski, E.G., & Armand\u00a0Joulin, T.M. (2017). Enriching word vectors with subword information. In: TACL","DOI":"10.1162\/tacl_a_00051"},{"key":"1189_CR46","unstructured":"Ren, M., Kiros, R., & Zemel, R. (2015). Exploring models and data for image question answering. In: NIPS"},{"key":"1189_CR47","doi-asserted-by":"publisher","first-page":"94","DOI":"10.1007\/s11263-016-0987-1","volume":"123","author":"A Rohrbach","year":"2017","unstructured":"Rohrbach, A., Torabi, A., Rohrbach, M., Tandon, N., Pal, C., Larochelle, H., et al. (2017). Movie description. IJCV, 123, 94\u2013120.","journal-title":"IJCV"},{"key":"1189_CR48","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., et al. (2015). ImageNet large scale visual recognition challenge. IJCV, 115, 211\u2013252.","journal-title":"IJCV"},{"key":"1189_CR49","unstructured":"Soomro, K., Zamir, A.R., & Shah, M. (2012). UCF101: A dataset of 101 human actions classes from videos in the wild. In: CRCV-TR-12-01"},{"key":"1189_CR50","unstructured":"Srivastava, N., Mansimov, E., & Salakhutdinov, R. (2015). Unsupervised learning of video representations using LSTMs. In: ICML"},{"key":"1189_CR51","unstructured":"Sutskever, I., Vinyals, O., & Le, Q. (2014). Sequence to sequence learning with neural networks. In: NIPS"},{"key":"1189_CR52","doi-asserted-by":"crossref","unstructured":"Tapaswi, M., Zhu, Y., Stiefelhagen, R., Torralba, A., Urtasun, R., & Fidler, S. (2016). MovieQA: Understanding stories in movies through question-answering. In: CVPR","DOI":"10.1109\/CVPR.2016.501"},{"key":"1189_CR53","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L.D., Fergus, R., Torresani, L., & Paluri, M. (2015). Learning spatiotemporal features with 3D convolutional networks. In: ICCV","DOI":"10.1109\/ICCV.2015.510"},{"key":"1189_CR54","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, l., Gomez, A., Kaiser, L., & Polosukhin, I. (2017). Attention is all you need. In: NIPS"},{"key":"1189_CR55","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Rohrbach, M., Donahue, J., Mooney, R., Darrell, T., & Saenko, K. (2015). Sequence to sequence\u2014video to text. In: ICCV","DOI":"10.1109\/ICCV.2015.515"},{"key":"1189_CR56","doi-asserted-by":"crossref","unstructured":"Wu, Q., Shen, C., Liu, L., Dick, A., & van\u00a0den Hengel, A. (2016). What value do explicit high level concepts have in vision to language problems? In: CVPR","DOI":"10.1109\/CVPR.2016.29"},{"key":"1189_CR57","unstructured":"Xie, S., Chen, S., Huang, J., Tu, Z., & Murphy, K. (2018). Rethinking spatiotemporal feature learning for video understanding. In: ECCV"},{"key":"1189_CR58","unstructured":"Xu, K., Ba, J., Kiros, R., Cho, K., Courville, A., Salakhutdinov, R., Zemel, R., & Bengio, Y. (2015). Show, attend and tell: Neural image caption generation with visual attention. In: ICML"},{"key":"1189_CR59","doi-asserted-by":"crossref","unstructured":"Yang, Z., Xiadong, H., Jianfeng, G., Li, D., & Smola, A.J. (2015). Stacked attention networks for image question answering. In: CVPR","DOI":"10.1109\/CVPR.2016.10"},{"key":"1189_CR60","doi-asserted-by":"crossref","unstructured":"You, Q., Jin, H., Wang, Z., Fang, C., & Luo, J. (2016). Image captioning with semantic attention. In: CVPR","DOI":"10.1109\/CVPR.2016.503"},{"key":"1189_CR61","doi-asserted-by":"crossref","unstructured":"Yu, Y., Ko, H., Choi, J., & Kim, G. (2017). End-to-end concept word detection for video captioning, retrieval, and question answering. In: CVPR","DOI":"10.1109\/CVPR.2017.347"},{"key":"1189_CR62","doi-asserted-by":"crossref","unstructured":"Yu, L., Park, E., Berg, A.C., & Berg, T.L. (2015). Visual madlibs: Fill in the blank description generation and question answering. In: ICCV","DOI":"10.1109\/ICCV.2015.283"},{"key":"1189_CR63","doi-asserted-by":"crossref","unstructured":"Zhao, Z., Yang, Q., Cai, D., He, X., & Zhuang, Y. (2017). Video question answering via hierarchical spatio-temporal attention networks. In: IJCAI","DOI":"10.24963\/ijcai.2017\/492"},{"key":"1189_CR64","unstructured":"Zhou, B., Lapedriza, A., Xiao, J., Torralba, A., & Oliva, A. (2014). Learning deep features for scene recognition using places database. In: NIPS"},{"key":"1189_CR65","doi-asserted-by":"publisher","first-page":"409","DOI":"10.1007\/s11263-017-1033-7","volume":"124","author":"L Zhu","year":"2017","unstructured":"Zhu, L., Xu, Z., Yang, Y., & Hauptmann, A. (2017). Uncovering temporal context for video question answering. IJCV, 124, 409\u2013421.","journal-title":"IJCV"},{"key":"1189_CR66","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Groth, O., Bernstein, M., & Fei-Fei, L. (2016). Visual7W: Grounded question answering in images. In: CVPR","DOI":"10.1109\/CVPR.2016.540"},{"key":"1189_CR67","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Kiros, R., Zemel, R., Salakhutdinov, R., Urtasun, R., Torralba, A., & Fidler, S. (2015). Aligning books and movies: Towards story-like visual explanations by watching movies and reading books. In: ICCV","DOI":"10.1109\/ICCV.2015.11"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01189-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-019-01189-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01189-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,6,16]],"date-time":"2020-06-16T23:15:07Z","timestamp":1592349307000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-019-01189-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,6,18]]},"references-count":67,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2019,10]]}},"alternative-id":["1189"],"URL":"https:\/\/doi.org\/10.1007\/s11263-019-01189-x","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,6,18]]},"assertion":[{"value":"24 May 2018","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 June 2019","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2019","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}