{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T21:43:08Z","timestamp":1781732588832,"version":"3.54.5"},"reference-count":53,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2019,4,1]],"date-time":"2019-04-01T00:00:00Z","timestamp":1554076800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,4,1]],"date-time":"2019-04-01T00:00:00Z","timestamp":1554076800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,4,1]],"date-time":"2019-04-01T00:00:00Z","timestamp":1554076800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100004826","name":"Natural Science Foundation of Beijing Municipality","doi-asserted-by":"publisher","award":["4182037"],"award-info":[{"award-number":["4182037"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1636210"],"award-info":[{"award-number":["U1636210"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1636211"],"award-info":[{"award-number":["U1636211"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011347","name":"State Key Laboratory of Software Development Environment","doi-asserted-by":"publisher","award":["SKLSDE-2017ZX-19"],"award-info":[{"award-number":["SKLSDE-2017ZX-19"]}],"id":[{"id":"10.13039\/501100011347","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2019,4]]},"DOI":"10.1109\/tip.2018.2882225","type":"journal-article","created":{"date-parts":[[2018,11,19]],"date-time":"2018-11-19T19:34:17Z","timestamp":1542656057000},"page":"2008-2020","source":"Crossref","is-referenced-by-count":92,"title":["Bi-Directional Spatial-Semantic Attention Networks for Image-Text Matching"],"prefix":"10.1109","volume":"28","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4294-0212","authenticated-orcid":false,"given":"Feiran","family":"Huang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6662-4102","authenticated-orcid":false,"given":"Xiaoming","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhonghua","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhoujun","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","article-title":"Fisher vectors derived from hybrid Gaussian&#x2013;Laplacian mixture models for image annotation","author":"klein","year":"2014","journal-title":"CoRR"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553391"},{"key":"ref33","first-page":"2953","article-title":"Exploring models and data for image question answering","author":"ren","year":"2015","journal-title":"Proc 28th Adv Neural Inf Process Syst"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D15-1166"},{"key":"ref31","article-title":"Neural machine translation by jointly learning to align and translate","author":"bahdanau","year":"2014","journal-title":"CoRR"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.219"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2007.1037"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1145\/2983323.2983818"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3206025.3206035"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2746267"},{"key":"ref28","first-page":"842","article-title":"The application of two-level attention models in deep convolutional neural network for fine-grained image classification","author":"xiao","year":"2015","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2774041"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"ref1","article-title":"Deep captioning with multimodal recurrent neural networks (m-RNN)","author":"mao","year":"2014","journal-title":"CoRR"},{"key":"ref20","first-page":"2764","article-title":"WSABIE: Scaling up to large vocabulary image annotation","author":"weston","year":"2011","journal-title":"Proc Intern Joint Conf Artificial Intel (IJCAI)"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.301"},{"key":"ref21","first-page":"2121","article-title":"DeViSE: A deep visual-semantic embedding model","author":"frome","year":"2013","journal-title":"Proc 26th Adv Neural Inf Process Syst"},{"key":"ref24","first-page":"451","article-title":"Ask, attend and answer: Exploring question-guided spatial attention for visual question answering","volume":"9911","author":"xu","year":"2016","journal-title":"Proc Eur Conf Comput Vis (ECCV)"},{"key":"ref23","first-page":"4133","article-title":"Image caption with global-local attention","author":"li","year":"2017","journal-title":"Proc 31st AAAI Conf Artif Intell"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1092"},{"key":"ref25","first-page":"289","article-title":"Hierarchical question-image co-attention for visual question answering","author":"lu","year":"2016","journal-title":"Proc 29th Adv Neural Inf Process Syst"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0275-4"},{"key":"ref53","first-page":"448","article-title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","volume":"37","author":"ioffe","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1162"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2015.2389624"},{"key":"ref11","article-title":"Dual attention networks for multimodal reasoning and matching","author":"nam","year":"2016","journal-title":"CoRR"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.541"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2592800"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2016.06.047"},{"key":"ref14","article-title":"Deep variational canonical correlation analysis","author":"wang","year":"2016","journal-title":"CoRR"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1162\/0899766042321814"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-013-0658-4"},{"key":"ref17","first-page":"1247","article-title":"Deep canonical correlation analysis","volume":"28","author":"andrew","year":"2013","journal-title":"Proc Int Conf Mach Learn (ICML)"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298966"},{"key":"ref19","first-page":"169","article-title":"Finding linear structure in large datasets with scalable canonical correlation analysis","volume":"37","author":"ma","year":"2015","journal-title":"Proc Int Conf Mach Learn (ICML)"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.503"},{"key":"ref3","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","volume":"37","author":"xu","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2628585"},{"key":"ref5","article-title":"Areas of attention for image captioning","author":"pedersoli","year":"2016","journal-title":"CoRR"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2012.2202676"},{"key":"ref7","first-page":"241","article-title":"Deep image retrieval: Learning global representations for image search","volume":"9910","author":"gordo","year":"2016","journal-title":"Proc Eur Conf Comput Vis (ECCV)"},{"key":"ref49","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2014","journal-title":"CoRR"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2014.2305072"},{"key":"ref46","first-page":"740","article-title":"Microsoft COCO: Common objects in context","volume":"8693","author":"lin","year":"2014","journal-title":"Proc Eur Conf Comp Vis (ECCV)"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00166"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.201"},{"key":"ref42","first-page":"3846","article-title":"Cross-media shared representation by hierarchical learning with multiple deep networks","author":"peng","year":"2016","journal-title":"Proc Intern Joint Conf Artificial Intel (IJCAI)"},{"key":"ref41","first-page":"1889","article-title":"Deep fragment embeddings for bidirectional image sentence mapping","author":"karpathy","year":"2014","journal-title":"Proc 27th Annu Conf Adv Neural Inf Process Syst"},{"key":"ref44","article-title":"Unifying visual-semantic embeddings with multimodal neural language models","author":"kiros","year":"2014","journal-title":"CoRR"},{"key":"ref43","first-page":"91","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","author":"ren","year":"2015","journal-title":"Proc 28th Annu Conf Neural Inf Process Syst (NIPS)"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/83\/8548629\/08540429.pdf?arnumber=8540429","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,13]],"date-time":"2022-07-13T21:13:29Z","timestamp":1657746809000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8540429\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,4]]},"references-count":53,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tip.2018.2882225","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,4]]}}}