{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,14]],"date-time":"2026-02-14T10:31:11Z","timestamp":1771065071203,"version":"3.50.1"},"reference-count":37,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,1,10]],"date-time":"2021-01-10T00:00:00Z","timestamp":1610236800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,1,10]],"date-time":"2021-01-10T00:00:00Z","timestamp":1610236800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,1,10]],"date-time":"2021-01-10T00:00:00Z","timestamp":1610236800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,1,10]]},"DOI":"10.1109\/icpr48806.2021.9413172","type":"proceedings-article","created":{"date-parts":[[2021,5,6]],"date-time":"2021-05-06T02:15:54Z","timestamp":1620267354000},"page":"5222-5229","source":"Crossref","is-referenced-by-count":47,"title":["Transformer Reasoning Network for Image- Text Matching and Retrieval"],"prefix":"10.1109","author":[{"given":"Nicola","family":"Messina","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fabrizio","family":"Falchi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Andrea","family":"Esuli","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Giuseppe","family":"Amato","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","article-title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","volume":"abs 1602 7332","author":"krishna","year":"2016","journal-title":"CoRR"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref31","first-page":"91","article-title":"Faster R-CNN: towards real-time object detection with region proposal networks","author":"ren","year":"2015","journal-title":"Advances in Neural IInformation Processing Systems"},{"key":"ref30","article-title":"Learning visual relation priors for image-text matching and image captioning with neural scene graph generators","volume":"abs 1909 9953","author":"lee","year":"2019","journal-title":"CoRR"},{"key":"ref37","first-page":"740","article-title":"Microsoft COCO: common objects in context","volume":"8693","author":"lin","year":"2014","journal-title":"ECCV 2014 ser Lecture Notes in Computer Science"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"ref35","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","author":"lin","year":"2004","journal-title":"Text Summarization Branches Out Barcelona Spain Association for Computational Linguistics"},{"key":"ref34","article-title":"Efficient estimation of word representations in vector space","author":"mikolov","year":"2013","journal-title":"1st International Conference on Learning Representations ICLR 2013"},{"key":"ref10","article-title":"Order-embeddings of images and language","author":"vendrov","year":"2016","journal-title":"4th International Conference on Learning Representations ICLR 2016 San Juan Puerto Rico May 2&#x2013;4 2016 Conference Track Proceedings"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_17"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.767"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.201"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.442"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00750"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00645"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.298"},{"key":"ref18","article-title":"Bottom-up and top-down attention for image captioning and VQA","volume":"abs 1707 7998","author":"anderson","year":"2017","journal-title":"CoRR"},{"key":"ref19","first-page":"4171","article-title":"BERT: pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"2019","journal-title":"NAACL-HLT 2019 Association for Computational Linguistics"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_41"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2896516"},{"key":"ref3","first-page":"13","article-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","author":"lu","year":"2019","journal-title":"NeurIPS 2019"},{"key":"ref6","article-title":"Imagebert: Cross-modal pre-training with large-scale weak-supervised image-text data","volume":"abs 2001 7966","author":"qi","year":"2020","journal-title":"CoRR"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_21"},{"key":"ref5","first-page":"212","article-title":"Stacked cross attention for image-text matching","volume":"11208","author":"lee","year":"2018","journal-title":"ECCV 2018 ser Lecture Notes in Computer Science"},{"key":"ref8","first-page":"5998","article-title":"Attention is all you need","author":"vaswani","year":"2017","journal-title":"NeurIPS"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00475"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/s10791-017-9318-6"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299073"},{"key":"ref1","first-page":"12","article-title":"VSE++: improving visual-semantic embeddings with hard negatives","author":"faghri","year":"2018","journal-title":"BMVC 2018"},{"key":"ref20","first-page":"4967","article-title":"A simple neural network module for relational reasoning","author":"santoro","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref22","first-page":"486","article-title":"Learning relationship-aware visual features","volume":"11132","author":"messina","year":"2018","journal-title":"ECCV 2018 ser Lecture Notes in Computer Science"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/s13735-019-00178-7"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.325"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.93"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01094"},{"key":"ref25","first-page":"711","article-title":"Exploring visual relationship for image captioning","volume":"11218","author":"yao","year":"2018","journal-title":"ECCV 2018 ser Lecture Notes in Computer Science"}],"event":{"name":"2020 25th International Conference on Pattern Recognition (ICPR)","location":"Milan, Italy","start":{"date-parts":[[2021,1,10]]},"end":{"date-parts":[[2021,1,15]]}},"container-title":["2020 25th International Conference on Pattern Recognition (ICPR)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9411940\/9411911\/09413172.pdf?arnumber=9413172","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T15:40:41Z","timestamp":1652197241000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9413172\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,1,10]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/icpr48806.2021.9413172","relation":{},"subject":[],"published":{"date-parts":[[2021,1,10]]}}}