{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T01:34:11Z","timestamp":1772674451673,"version":"3.50.1"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2022,12,22]],"date-time":"2022-12-22T00:00:00Z","timestamp":1671667200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,12,22]],"date-time":"2022-12-22T00:00:00Z","timestamp":1671667200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62176178"],"award-info":[{"award-number":["62176178"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Process Lett"],"published-print":{"date-parts":[[2023,10]]},"DOI":"10.1007\/s11063-022-11121-z","type":"journal-article","created":{"date-parts":[[2022,12,22]],"date-time":"2022-12-22T08:04:26Z","timestamp":1671696266000},"page":"5959-5978","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["COREN: Multi-Modal Co-Occurrence Transformer Reasoning Network for Image-Text Retrieval"],"prefix":"10.1007","volume":"55","author":[{"given":"Yaodong","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2197-3739","authenticated-orcid":false,"given":"Zhong","family":"Ji","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kexin","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanwei","family":"Pang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhongfei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,12,22]]},"reference":[{"issue":"2","key":"11121_CR1","doi-asserted-by":"publisher","first-page":"1435","DOI":"10.1007\/s11063-021-10689-2","volume":"54","author":"Y Miao","year":"2022","unstructured":"Miao Y, Cheng W, He S, Jiang H (2022) Research on visual question answering based on gat relational reasoning. Neural Process Lett 54(2):1435\u20131448","journal-title":"Neural Process Lett"},{"issue":"1","key":"11121_CR2","doi-asserted-by":"publisher","first-page":"709","DOI":"10.1007\/s11063-021-10655-y","volume":"54","author":"H Sharma","year":"2022","unstructured":"Sharma H, Jalal AS (2022) An improved attention and hybrid optimization technique for visual question answering. Neural Process Lett 54(1):709\u2013730","journal-title":"Neural Process Lett"},{"key":"11121_CR3","doi-asserted-by":"crossref","unstructured":"Zellers R, Bisk Y, Farhadi A, Choi Y (2019) From recognition to cognition: visual commonsense reasoning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6720\u20136731","DOI":"10.1109\/CVPR.2019.00688"},{"key":"11121_CR4","doi-asserted-by":"publisher","first-page":"51","DOI":"10.1016\/j.neucom.2020.06.091","volume":"413","author":"F Lyu","year":"2020","unstructured":"Lyu F, Feng W, Wang S (2020) vtgraphnet: learning weakly-supervised scene graph for complex visual grounding. Neurocomputing 413:51\u201360","journal-title":"Neurocomputing"},{"issue":"3","key":"11121_CR5","doi-asserted-by":"publisher","first-page":"1863","DOI":"10.1007\/s11063-020-10205-y","volume":"52","author":"Z Yu","year":"2020","unstructured":"Yu Z, Song Y, Yu J, Wang M, Huang Q (2020) Intra-and inter-modal multilinear pooling with multitask learning for video grounding. Neural Process Lett 52(3):1863\u20131879","journal-title":"Neural Process Lett"},{"key":"11121_CR6","doi-asserted-by":"crossref","unstructured":"Xiao F, Xue W, Shen Y, Gao X (2022) A new attention-based lstm for image captioning. Neural Process Lett, 1\u201315","DOI":"10.1007\/s11063-022-10759-z"},{"key":"11121_CR7","doi-asserted-by":"crossref","unstructured":"Li P, Zhang M, Lin P, Wan J, Jiang M (2022) Conditional embedding pre-training language model for image captioning. Neural Process. Lett 1\u201317","DOI":"10.1007\/s11063-022-10844-3"},{"issue":"2","key":"11121_CR8","doi-asserted-by":"publisher","first-page":"1101","DOI":"10.1007\/s11063-021-10431-y","volume":"53","author":"H Zhu","year":"2021","unstructured":"Zhu H, Wang R, Zhang X (2021) Image captioning with dense fusion connection and improved stacked attention module. Neural Process Lett 53(2):1101\u20131118","journal-title":"Neural Process Lett"},{"key":"11121_CR9","first-page":"2121","volume":"26","author":"A Frome","year":"2013","unstructured":"Frome A, Corrado GS, Shlens J, Bengio S, Dean J, Ranzato M, Mikolov T (2013) Devise: a deep visual-semantic embedding model. Adv Neural Inf Process Syst 26:2121\u20132129","journal-title":"Adv Neural Inf Process Syst"},{"key":"11121_CR10","doi-asserted-by":"crossref","unstructured":"Ma L, Lu Z, Shang L et al (2015) Multimodal convolutional neural networks for matching image and sentence. In: Proceedings of the IEEE International Conference on Computer Vision pp 2623\u20132631","DOI":"10.1109\/ICCV.2015.301"},{"key":"11121_CR11","unstructured":"Kiros R, Salakhutdinov R, Zemel RS (2014) Unifying visual-semantic embeddings with multimodal neural language models. CoRR arXiv:1411.2539"},{"key":"11121_CR12","doi-asserted-by":"crossref","unstructured":"Lee K-H, Chen X, Hua G, Hu H, He X (2018) Stacked cross attention for image-text matching. In: Proceedings of the European Conference on Computer Vision pp 201\u2013216","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"11121_CR13","doi-asserted-by":"crossref","unstructured":"Wei X, Zhang T, Li Y et al (2020) Multi-modality cross attention network for image and sentence matching. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition pp 10941\u201310950","DOI":"10.1109\/CVPR42600.2020.01095"},{"key":"11121_CR14","doi-asserted-by":"crossref","unstructured":"Nam H, Ha J-W, Kim J (2017) Dual attention networks for multimodal reasoning and matching. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition pp 299\u2013307","DOI":"10.1109\/CVPR.2017.232"},{"key":"11121_CR15","unstructured":"Zhang Y, Li K, Li K et al (2019) Visual semantic reasoning for image-text matching. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision pp 4654\u20134662"},{"key":"11121_CR16","unstructured":"Faghri F, Fleet DJ, Kiros JR, Fidler S (2018) VSE++: improving visual-semantic embeddings with hard negatives. In: British Machine Vision Conference p 12"},{"issue":"2","key":"11121_CR17","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3383184","volume":"16","author":"Z Zheng","year":"2020","unstructured":"Zheng Z, Zheng L, Garrett M et al (2020) Dual-path convolutional image-text embeddings with instance loss. ACM Trans Multim Comput Commun Appl 16(2):1\u201323","journal-title":"ACM Trans Multim Comput Commun Appl"},{"key":"11121_CR18","doi-asserted-by":"crossref","unstructured":"Wang B, Yang Y, Xu X, Hanjalic A, Shen HT (2017) Adversarial cross-modal retrieval. In: Proceedings of the 25th ACM International Conference on Multimedia, pp 154\u2013162","DOI":"10.1145\/3123266.3123326"},{"key":"11121_CR19","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.knosys.2019.05.017","volume":"180","author":"P Hu","year":"2019","unstructured":"Hu P, Peng D, Wang X, Xiang Y (2019) Multimodal adversarial network for cross-modal retrieval. Knowl Based Syst 180:38\u201350","journal-title":"Knowl Based Syst"},{"key":"11121_CR20","doi-asserted-by":"crossref","unstructured":"Karpathy A, Fei-Fei L (2015) Deep visual-semantic alignments for generating image descriptions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition pp 3128\u20133137","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"11121_CR21","doi-asserted-by":"crossref","unstructured":"Zhang Q, Lei Z, Zhang Z, Li SZ (2020) Context-aware attention network for image-text retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition pp 3536\u20133545","DOI":"10.1109\/CVPR42600.2020.00359"},{"key":"11121_CR22","doi-asserted-by":"crossref","unstructured":"Ji Z, Chen K, Wang H (2021) Step-wise hierarchical alignment network for image-text matching. In: Proceedings of the International Joint Conference on Artificial Intelligence pp 765\u2013771","DOI":"10.24963\/ijcai.2021\/106"},{"key":"11121_CR23","doi-asserted-by":"crossref","unstructured":"Liu C, Mao Z, Zhang T et al (2020) Graph structured network for image-text matching. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition pp 10921\u201310930","DOI":"10.1109\/CVPR42600.2020.01093"},{"issue":"172104","key":"11121_CR24","first-page":"1","volume":"65","author":"Z Ji","year":"2022","unstructured":"Ji Z, Chen K, He Y, Pang Y, Li X (2022) Heterogeneous memory enhanced graph reasoning network for cross-modal retrieval. Inf Sci 65(172104):1\u2013172104","journal-title":"Inf Sci"},{"key":"11121_CR25","first-page":"11336","volume":"34","author":"G Li","year":"2020","unstructured":"Li G, Duan N, Fang Y, Gong M, Jiang D (2020) Unicoder-vl: a universal encoder for vision and language by cross-modal pre-training. Proc AAAI Conf Artif Intell 34:11336\u201311344","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"11121_CR26","unstructured":"Lu J, Batra D, Parikh D, Lee S (2019) Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. arXiv preprint arXiv:1908.02265"},{"key":"11121_CR27","unstructured":"Su W, Zhu X, Cao Y, Li B, Lu L, Wei F, Dai J (2019) Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530"},{"key":"11121_CR28","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser \u0141, Polosukhin I (2017) Attention is all you need. Adv Neural Inf Process Syst 5998\u20136008"},{"issue":"2","key":"11121_CR29","doi-asserted-by":"publisher","first-page":"394","DOI":"10.1109\/TPAMI.2018.2797921","volume":"41","author":"L Wang","year":"2018","unstructured":"Wang L, Li Y, Huang J, Lazebnik S (2018) Learning two-branch neural networks for image-text matching tasks. IEEE Trans Pattern Anal Mach Intell 41(2):394\u2013407","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"11121_CR30","doi-asserted-by":"crossref","unstructured":"Sarafianos N, Xu X, Kakadiaris IA (2019) Adversarial representation learning for text-to-image matching. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision pp 5814\u20135824","DOI":"10.1109\/ICCV.2019.00591"},{"issue":"2","key":"11121_CR31","doi-asserted-by":"publisher","first-page":"1086","DOI":"10.1109\/TCYB.2020.2985716","volume":"52","author":"Z Ji","year":"2022","unstructured":"Ji Z, Wang H, Han J, Pang Y (2022) Sman: stacked multimodal attention network for cross-modal image-text retrieval. IEEE Trans Cybern 52(2):1086\u20131097","journal-title":"IEEE Trans Cybern"},{"key":"11121_CR32","doi-asserted-by":"crossref","unstructured":"Wang Z, Liu X, Li H et al (2019) Camp: Cross-modal adaptive message passing for text-image retrieval. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision pp 5764\u20135773","DOI":"10.1109\/ICCV.2019.00586"},{"key":"11121_CR33","doi-asserted-by":"crossref","unstructured":"Wang Y, Yang H, Qian X et al (2019) Position focused attention network for image-text matching. In: Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence pp 3792\u20133798","DOI":"10.24963\/ijcai.2019\/526"},{"key":"11121_CR34","doi-asserted-by":"crossref","unstructured":"Wu Y, Wang S, Song G, et al (2019) Learning fragment self-attention embeddings for image-text matching. In: Proceedings of the 27th ACM International Conference on Multimedia, pp 2088\u20132096","DOI":"10.1145\/3343031.3350940"},{"key":"11121_CR35","doi-asserted-by":"crossref","unstructured":"Chen H, Ding G, Liu X et al (2020) Imram: Iterative matching with recurrent attention memory for cross-modal image-text retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition pp 12655\u201312663","DOI":"10.1109\/CVPR42600.2020.01267"},{"key":"11121_CR36","doi-asserted-by":"crossref","unstructured":"Wang Y, Zhang T, Zhang X, Cui Z, Huang Y, Shen P, Li S, Yang J (2021) Wasserstein coupled graph learning for cross-modal retrieval. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision pp 1813\u20131822","DOI":"10.1109\/ICCV48922.2021.00183"},{"issue":"4","key":"11121_CR37","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3451390","volume":"17","author":"N Messina","year":"2021","unstructured":"Messina N, Amato G, Esuli A, Falchi F, Gennaro C, Marchand-Maillet S (2021) Fine-grained visual textual alignment for cross-modal retrieval using transformer encoders. ACM Trans Multim Comput Commun Appl 17(4):1\u201323","journal-title":"ACM Trans Multim Comput Commun Appl"},{"key":"11121_CR38","doi-asserted-by":"crossref","unstructured":"Qu L, Liu M, Cao D, Nie L, Tian Q (2020) Context-aware multi-view summarization network for image-text matching. In: Proceedings of the 28th ACM International Conference on Multimedia, pp 1047\u20131055","DOI":"10.1145\/3394171.3413961"},{"key":"11121_CR39","doi-asserted-by":"publisher","first-page":"9193","DOI":"10.1109\/TIP.2021.3123553","volume":"30","author":"J Li","year":"2021","unstructured":"Li J, Liu L, Niu L, Zhang L (2021) Memorize, associate and match: embedding enhancement via fine-grained alignment for image-text retrieval. IEEE Trans Image Process 30:9193\u20139207","journal-title":"IEEE Trans Image Process"},{"key":"11121_CR40","first-page":"1218","volume":"35","author":"H Diao","year":"2021","unstructured":"Diao H, Zhang Y, Ma L, Lu H (2021) Similarity reasoning and filtration for image-text matching. Proc AAAI Conf Artif Intell 35:1218\u20131226","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"11121_CR41","doi-asserted-by":"crossref","unstructured":"Messina N, Falchi F, Esuli A, Amato G (2021) Transformer reasoning network for image-text matching and retrieval. In: 25th International Conference on Pattern Recognition, pp 5222\u20135229","DOI":"10.1109\/ICPR48806.2021.9413172"},{"key":"11121_CR42","doi-asserted-by":"crossref","unstructured":"Huang Y, Wu Q, Song C et al (2018) Learning semantic concepts and order for image and sentence matching. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition pp 6163\u20136171","DOI":"10.1109\/CVPR.2018.00645"}],"container-title":["Neural Processing Letters"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-022-11121-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11063-022-11121-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-022-11121-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,29]],"date-time":"2023-09-29T16:14:15Z","timestamp":1696004055000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11063-022-11121-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,12,22]]},"references-count":42,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2023,10]]}},"alternative-id":["11121"],"URL":"https:\/\/doi.org\/10.1007\/s11063-022-11121-z","relation":{},"ISSN":["1370-4621","1573-773X"],"issn-type":[{"value":"1370-4621","type":"print"},{"value":"1573-773X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,12,22]]},"assertion":[{"value":"10 December 2022","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 December 2022","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}