{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T14:56:37Z","timestamp":1784300197001,"version":"3.55.0"},"reference-count":64,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61836002"],"award-info":[{"award-number":["61836002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1611461"],"award-info":[{"award-number":["U1611461"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61751209"],"award-info":[{"award-number":["61751209"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004731","name":"Zhejiang Natural Science Foundation","doi-asserted-by":"publisher","award":["LR19F020006"],"award-info":[{"award-number":["LR19F020006"]}],"id":[{"id":"10.13039\/501100004731","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2018AAA0100603"],"award-info":[{"award-number":["2018AAA0100603"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["2020QNA5024"],"award-info":[{"award-number":["2020QNA5024"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2021]]},"DOI":"10.1109\/tip.2021.3076556","type":"journal-article","created":{"date-parts":[[2021,5,5]],"date-time":"2021-05-05T21:40:42Z","timestamp":1620250842000},"page":"5477-5489","source":"Crossref","is-referenced-by-count":35,"title":["Adaptive Spatio-Temporal Graph Enhanced Vision-Language Representation for Video QA"],"prefix":"10.1109","volume":"30","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3132-5567","authenticated-orcid":false,"given":"Weike","family":"Jin","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6121-0384","authenticated-orcid":false,"given":"Zhou","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7141-708X","authenticated-orcid":false,"given":"Xiaochun","family":"Cao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jieming","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiuqiang","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yueting","family":"Zhuang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00209"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.446"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00877"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00990"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00272"},{"key":"ref37","first-page":"289","article-title":"Hierarchical question-image co-attention for visual question answering","author":"lu","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46478-7_28"},{"key":"ref35","first-page":"1378","article-title":"Ask me anything: Dynamic memory networks for natural language processing","author":"kumar","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1044"},{"key":"ref60","article-title":"VSE++: Improving visual-semantic embeddings with hard negatives","author":"faghri","year":"2017","journal-title":"arXiv 1707 05612"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2832602"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1145\/3206025.3206064"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00957"},{"key":"ref28","article-title":"Contrastive bidirectional transformer for temporal representation learning","author":"sun","year":"2019","journal-title":"arXiv 1906 05743"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01065"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00756"},{"key":"ref29","article-title":"Unified vision-language pre-training for image captioning and VQA","author":"zhou","year":"2019","journal-title":"arXiv 1909 11059"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2852750"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2015.2400461"},{"key":"ref22","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"radford","year":"2019","journal-title":"OpenAIRE blog"},{"key":"ref21","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"2018","journal-title":"arXiv 1810 04805"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1514"},{"key":"ref23","article-title":"ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","author":"lu","year":"2019","journal-title":"arXiv 1908 02265"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6795"},{"key":"ref25","article-title":"VisualBERT: A simple and performant baseline for vision and language","author":"li","year":"2019","journal-title":"arXiv 1908 03557"},{"key":"ref50","doi-asserted-by":"crossref","first-page":"11101","DOI":"10.1609\/aaai.v34i07.6766","article-title":"Divide and conquer: Question-guided spatio-temporal contextual attention for video question answering","author":"jiang","year":"2020","journal-title":"Proc AAAI"},{"key":"ref51","first-page":"9972","article-title":"Hierarchical conditional relation networks for video question answering","author":"le","year":"2020","journal-title":"Proc IEEE\/CVF Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref58","first-page":"91","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","author":"ren","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.347"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"ref54","article-title":"VL-BERT: Pre-training of generic visual-linguistic representations","author":"su","year":"2019","journal-title":"arXiv 1908 08530"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00852"},{"key":"ref52","article-title":"Semi-supervised classification with graph convolutional networks","author":"kipf","year":"2016","journal-title":"arXiv 1609 02907"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/122"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123427"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00680"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3265987.3265996"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00210"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.149"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00729"},{"key":"ref16","first-page":"361","article-title":"Multimodal residual learning for visual QA","author":"kim","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref17","first-page":"2440","article-title":"End-to-end memory networks","author":"sukhbaatar","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref18","first-page":"2397","article-title":"Dynamic memory networks for visual and textual question answering","author":"xiong","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref19","first-page":"1","article-title":"Leveraging video descriptions to learn video question answering","volume":"31","author":"zeng","year":"2017","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00688"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.121"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01331-0"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00387"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"ref7","article-title":"Regularized two-branch proposal networks for weakly-supervised moment retrieval in videos","author":"zhang","year":"2020","journal-title":"arXiv 2008 08257"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01012"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33016391"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00642"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3351065"},{"key":"ref47","first-page":"11109","article-title":"Reasoning with heterogeneous graph alignment for video question answering","volume":"34","author":"jiang","year":"2020","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.80"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.501"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1167"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00688"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/83\/9263394\/09424429.pdf?arnumber=9424429","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T14:50:05Z","timestamp":1652194205000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9424429\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"references-count":64,"URL":"https:\/\/doi.org\/10.1109\/tip.2021.3076556","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]}}}