{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T11:19:34Z","timestamp":1780053574436,"version":"3.54.0"},"reference-count":70,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"12","license":[{"start":{"date-parts":[[2020,12,1]],"date-time":"2020-12-01T00:00:00Z","timestamp":1606780800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,12,1]],"date-time":"2020-12-01T00:00:00Z","timestamp":1606780800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,12,1]],"date-time":"2020-12-01T00:00:00Z","timestamp":1606780800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2017YFB0803301"],"award-info":[{"award-number":["2017YFB0803301"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2020,12]]},"DOI":"10.1109\/tmm.2020.2972830","type":"journal-article","created":{"date-parts":[[2020,2,11]],"date-time":"2020-02-11T02:02:42Z","timestamp":1581386562000},"page":"3196-3209","source":"Crossref","is-referenced-by-count":87,"title":["Reasoning on the Relation: Enhancing Visual Representation for Visual Question Answering and Cross-Modal Retrieval"],"prefix":"10.1109","volume":"22","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3966-511X","authenticated-orcid":false,"given":"Jing","family":"Yu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0280-2336","authenticated-orcid":false,"given":"Weifeng","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuhang","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zengchang","family":"Qin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yue","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianlong","family":"Tan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3631-256X","authenticated-orcid":false,"given":"Qi","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00587"},{"key":"ref39","article-title":"Deep reason: A strong baseline for real-world visual reasoning","author":"wu","year":"2019","journal-title":"arXiv 1905 10226"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2817340"},{"key":"ref33","first-page":"251","article-title":"A new approach to cross-modal multimedia retrieval","author":"nikhil","year":"2010","journal-title":"Proc ACMMM"},{"key":"ref32","first-page":"3942","article-title":"FILM: Visual reasoning with a general conditioning layer","author":"perez","year":"2018","journal-title":"Proc Assoc Advance Artif Intell"},{"key":"ref31","first-page":"30","article-title":"Image question answering using convolutional neural network with dynamic parameter prediction","author":"hyeonwoo","year":"2016","journal-title":"Proc Conf Comput Vis and Pattern Recog"},{"key":"ref30","article-title":"Hadamard product for low-rank bilinear pooling","author":"kim","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref37","first-page":"1482","article-title":"Bilinear classifiers for visual recognition","author":"pirsiavash","year":"2009","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"ref35","first-page":"169","article-title":"Finding linear structure in large datasets with scalable canonical correlation analysis","author":"ma","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref34","first-page":"4094","article-title":"Multi-label cross-modal retrieval","author":"viresh","year":"2015","journal-title":"Proc IEEE Int Conf Comput Vision"},{"key":"ref60","article-title":"VSE++: Improved visual-semantic embeddings with hard negatives","author":"faghri","year":"0","journal-title":"Proc Brit Mach Vision Conf"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.301"},{"key":"ref61","article-title":"Order-embeddings of images and language","author":"vendrov","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref63","first-page":"1899","article-title":"Hierarchical multimodal lstm for dense visual-visual embedding","author":"niu","year":"2017","journal-title":"Proc Int Conf Comput Vision"},{"key":"ref28","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","author":"xu","year":"2015","journal-title":"Proc 37th Int Conf Mach Learn"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.541"},{"key":"ref27","first-page":"5998","article-title":"Attention is all you need","author":"vaswani","year":"2017","journal-title":"Conf Neural Inf Process Syst"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.767"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2797921"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1044"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299073"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_17"},{"key":"ref69","first-page":"707","article-title":"Deep cross-modal projection learning for image-text matching","author":"zhang","year":"2018","journal-title":"Proc Eur Conf Comput Vision"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2895511"},{"key":"ref1","first-page":"1372","article-title":"Enhancing the quality of image tagging using a visio-textual knowledge base","volume":"20","author":"chaudhary","year":"2018","journal-title":"IEEE Trans Multimedia"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00637"},{"key":"ref22","first-page":"4967","article-title":"A simple neural network module for relational reasoning","author":"santoro","year":"2017","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.232"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.416"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.215"},{"key":"ref26","article-title":"Structured attention networks","author":"kim","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref25","article-title":"Neural machine translation by jointly learning to align and translate","author":"bahdanau","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.202"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00118"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"ref58","first-page":"740","article-title":"Microsoft COCO: Common objects in context","author":"lin","year":"2014","journal-title":"Proc Eur Conf Comput Vision"},{"key":"ref57","first-page":"2940","article-title":"Learning aligned cross-modal representations from weakly aligned data","author":"lluis","year":"2016","journal-title":"Proc Conf Comput Vis and Pattern Recog"},{"key":"ref56","article-title":"Compositional attention networks for machine reasoning","author":"husdon","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.93"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.325"},{"key":"ref53","doi-asserted-by":"crossref","first-page":"24","DOI":"10.1016\/j.cviu.2019.05.001","article-title":"DRAU: Dual recurrent attention units for visual question answering","volume":"185","author":"ahmed","year":"2019","journal-title":"Comput Vision Image Understanding"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00757"},{"key":"ref10","article-title":"TVQA+: Spatio-temporal grounding for video question answering","author":"lei","year":"2019","journal-title":"arxiv 1904 11574"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3351065"},{"key":"ref40","article-title":"An empirical evaluation of generic convolutional and recurrent networks for sequence modeling","author":"bai","year":"2018","journal-title":"arXiv 1803 01271"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/609"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2902106"},{"key":"ref14","first-page":"223","article-title":"Modeling text with graph convolutional network for cross-modal information retrieval","author":"yu","year":"0","journal-title":"Proc Pacific Rim Conf Multimedia"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.541"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.209"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2796248"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3331184.3331235"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"ref4","article-title":"Simple baseline for visual question answering","author":"zhou","year":"2015","journal-title":"arXiv 1512 02167"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/s11063-017-9753-9"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1167"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00642"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2890628"},{"key":"ref46","first-page":"1097","article-title":"ImageNet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref45","first-page":"740","article-title":"Microsoft COCO: Common objects in context","author":"lin","year":"2014","journal-title":"Proc Eur Conf Comput Vision"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref47","article-title":"Very deep convolutional networks for large scale image recognition","author":"simonyan","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref42","first-page":"91","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","author":"ren","year":"2015","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref41","article-title":"Multi-scale context aggregation by dilated convolutions","author":"fisher","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"ref43","first-page":"5385","article-title":"Learning local image descriptors with deep siamese and triplet convolutional networks by minimizing global loss functions","author":"vijaya","year":"2016","journal-title":"Proc Conf Comput Vis and Pattern Recog"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6046\/9263048\/08988148.pdf?arnumber=8988148","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,27]],"date-time":"2022-04-27T15:57:39Z","timestamp":1651075059000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8988148\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,12]]},"references-count":70,"journal-issue":{"issue":"12"},"URL":"https:\/\/doi.org\/10.1109\/tmm.2020.2972830","relation":{},"ISSN":["1520-9210","1941-0077"],"issn-type":[{"value":"1520-9210","type":"print"},{"value":"1941-0077","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,12]]}}}