{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T18:04:08Z","timestamp":1776881048469,"version":"3.51.2"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"23","license":[{"start":{"date-parts":[[2022,7,27]],"date-time":"2022-07-27T00:00:00Z","timestamp":1658880000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,7,27]],"date-time":"2022-07-27T00:00:00Z","timestamp":1658880000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61872143"],"award-info":[{"award-number":["61872143"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Comput &amp; Applic"],"published-print":{"date-parts":[[2022,12]]},"DOI":"10.1007\/s00521-022-07617-3","type":"journal-article","created":{"date-parts":[[2022,7,27]],"date-time":"2022-07-27T22:17:03Z","timestamp":1658960223000},"page":"21387-21401","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["GA-SRN: graph attention based text-image semantic reasoning network for fine-grained image classification and retrieval"],"prefix":"10.1007","volume":"34","author":[{"given":"Wenhao","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongqing","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Suyi","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pengyu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Han","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,7,27]]},"reference":[{"key":"7617_CR1","doi-asserted-by":"publisher","first-page":"14613","DOI":"10.1007\/s00521-020-05148-3","volume":"32","author":"W Wenyong","year":"2020","unstructured":"Wenyong W, Yongcheng C, Guangshun L, Chuntao J, Song D (2020) A self-attention-based destruction and construction learning fine-grained image classification method for retail product recognition. Neural Comput Appl 32:14613\u201314622","journal-title":"Neural Comput Appl"},{"key":"7617_CR2","doi-asserted-by":"publisher","first-page":"4683","DOI":"10.1109\/TIP.2020.2973812","volume":"29","author":"D Chang","year":"2020","unstructured":"Chang D, Ding Y, Xie J, Bhunia AK, Li X, Ma Z, Wu M, Guo J, Song YZ (2020) The devil is in the channels: mutual-channel loss for fine-grained image classification. IEEE Trans Image Process 29:4683\u20134695","journal-title":"IEEE Trans Image Process"},{"key":"7617_CR3","doi-asserted-by":"crossref","unstructured":"Huang Z, Duan X, Zhao B, L\u00fc J, Zhang B (2021) Interpretable attention guided network for fine-grained visual classification. arXiv preprint arXiv:2103.04701","DOI":"10.1007\/978-3-030-68799-1_4"},{"key":"7617_CR4","doi-asserted-by":"crossref","unstructured":"Mafla A, Dey S, Biten AF, Gomez L, Karatzas D (2020) Fine-grained image classification and retrieval by combining visual and locally pooled textual features. In: Proceedings of the IEEE winter conference on applications of computer vision, pp 2950\u20132959","DOI":"10.1109\/WACV45572.2020.9093373"},{"issue":"1","key":"7617_CR5","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg M, Simonyan K, Vedaldi A, Zisserman A (2016) Reading text in the wild with convolutional neural networks. Int J Comput Vis 116(1):1\u201320","journal-title":"Int J Comput Vis"},{"key":"7617_CR6","doi-asserted-by":"crossref","unstructured":"Movshovitz-Attias Y, Yu Q, Stumpe MC, Shet V, Arnoud S, Yatziv L (2015) Ontological supervision for fine grained classification of street view storefronts. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1693\u20131702","DOI":"10.1109\/CVPR.2015.7298778"},{"key":"7617_CR7","doi-asserted-by":"publisher","first-page":"66322","DOI":"10.1109\/ACCESS.2018.2878899","volume":"6","author":"X Bai","year":"2018","unstructured":"Bai X, Yang M, Lyu P, Xu Y, Luo J (2018) Integrating scene text and visual appearance for fine-grained image classification. IEEE Access 6:66322\u201366335","journal-title":"IEEE Access"},{"key":"7617_CR8","doi-asserted-by":"crossref","unstructured":"Mafla A, Dey S, Biten AF, Gomez L, Karatzas D (2021) Multi-modal reasoning graph for scene-text based fine-grained image classification and retrieval. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4023\u20134033","DOI":"10.1109\/WACV48630.2021.00407"},{"key":"7617_CR9","unstructured":"Veli\u010dkovi\u0107 P, Cucurull G, Casanova A, Romero A, Lio P, Bengio Y (2017) Graph attention networks. arXiv preprint arXiv:1710.10903"},{"key":"7617_CR10","doi-asserted-by":"crossref","unstructured":"Wei XS, Song YZ, Mac\u00a0Aodha O, Wu J, Peng Y, Tang J, Yang J, Belongie S (2021) Fine-grained image analysis with deep learning: a survey. IEEE Trans Pattern Anal Mach Intell","DOI":"10.1109\/TPAMI.2021.3126648"},{"issue":"1","key":"7617_CR11","doi-asserted-by":"publisher","first-page":"141","DOI":"10.1587\/transinf.2021EDP7094","volume":"105","author":"K Sun","year":"2022","unstructured":"Sun K, Zhu J (2022) Searching and learning discriminative regions for fine-grained image retrieval and classification. IEICE Trans Inf Syst 105(1):141\u2013149","journal-title":"IEICE Trans Inf Syst"},{"key":"7617_CR12","doi-asserted-by":"crossref","unstructured":"Zhang L, Huang S, Liu W (2021) Intra-class part swapping for fine-grained image classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3209\u20133218","DOI":"10.1109\/WACV48630.2021.00325"},{"key":"7617_CR13","doi-asserted-by":"crossref","unstructured":"He X, Peng Y (2017) Fine-graind image classification via combining vision and language. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 7332\u20137340","DOI":"10.1109\/CVPR.2017.775"},{"issue":"5","key":"7617_CR14","doi-asserted-by":"publisher","first-page":"1063","DOI":"10.1109\/TMM.2016.2638622","volume":"19","author":"S Karaoglu","year":"2016","unstructured":"Karaoglu S, Tao R, Gevers T, Smeulders AW (2016) Words matter: scene text for image classification and retrieval. IEEE Trans Multimed 19(5):1063\u20131076","journal-title":"IEEE Trans Multimed"},{"key":"7617_CR15","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster R-CNN: towards real-time object detection with region proposal networks. arXiv preprint arXiv:1506.01497"},{"key":"7617_CR16","doi-asserted-by":"crossref","unstructured":"Borisyuk F, Gordo A, Sivakumar V (2018) Rosetta: large scale system for text detection and recognition in images. In: Proceedings of the 24th ACM SIGKDD international conference on knowledge discovery & data mining, pp 71\u201379","DOI":"10.1145\/3219819.3219861"},{"key":"7617_CR17","doi-asserted-by":"crossref","unstructured":"He T, Tian Z, Huang W, Shen C, Qiao Y, Sun C (2018) An end-to-end textspotter with explicit alignment and attention. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 5020\u20135029","DOI":"10.1109\/CVPR.2018.00527"},{"issue":"8","key":"7617_CR18","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"7617_CR19","doi-asserted-by":"crossref","unstructured":"Zhang Y, Nie S, Liu W, Xu X, Zhang D, Shen HT (2019) Sequence-to-sequence domain adaptation network for robust text image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2740\u20132749","DOI":"10.1109\/CVPR.2019.00285"},{"key":"7617_CR20","doi-asserted-by":"crossref","unstructured":"Dey R, Salem FM (2017) Gate-variants of gated recurrent unit GRU neural networks. In: 2017 IEEE 60th international midwest symposium on circuits and systems, pp 1597\u20131600","DOI":"10.1109\/MWSCAS.2017.8053243"},{"issue":"12","key":"7617_CR21","doi-asserted-by":"publisher","first-page":"2552","DOI":"10.1109\/TPAMI.2014.2339814","volume":"36","author":"J Almaz\u00e1n","year":"2014","unstructured":"Almaz\u00e1n J, Gordo A, Forn\u00e9s A, Valveny E (2014) Word spotting and recognition with embedded attributes. IEEE Trans Pattern Anal Mach Intell 36(12):2552\u20132566","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"7617_CR22","doi-asserted-by":"crossref","unstructured":"G\u00f3mez L, Mafla A, Rusinol M, Karatzas D (2018) Single shot scene text retrieval. In: Proceedings of the European conference on computer vision, pp 700\u2013715","DOI":"10.1007\/978-3-030-01264-9_43"},{"issue":"1","key":"7617_CR23","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1109\/TNN.2008.2005605","volume":"20","author":"F Scarselli","year":"2008","unstructured":"Scarselli F, Gori M, Tsoi AC, Hagenbuchner M, Monfardini G (2008) The graph neural network model. IEEE Trans Neural Netw 20(1):61\u201380","journal-title":"IEEE Trans Neural Netw"},{"key":"7617_CR24","doi-asserted-by":"crossref","unstructured":"Gao D, Li K, Wang R, Shan S, Chen X (2020) Multi-modal graph neural network for joint reasoning on vision and scene text. In: Proceedings of the ieee conference on computer vision and pattern recognition, pp 12746\u201312756","DOI":"10.1109\/CVPR42600.2020.01276"},{"key":"7617_CR25","doi-asserted-by":"crossref","unstructured":"Li K, Zhang Y, Li K, Li Y, Fu Y (2019a) Visual semantic reasoning for image-text matching. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4654\u20134662","DOI":"10.1109\/ICCV.2019.00475"},{"key":"7617_CR26","doi-asserted-by":"crossref","unstructured":"Li L, Gan Z, Cheng Y, Liu J (2019b) Relation-aware graph attention network for visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 10313\u201310322","DOI":"10.1109\/ICCV.2019.01041"},{"key":"7617_CR27","doi-asserted-by":"crossref","unstructured":"Wen K, Gu X, Cheng Q (2020) Learning dual semantic relations with graph attention for image-text matching. IEEE Trans Circuits Syst Video Technol","DOI":"10.1109\/IJCNN48605.2020.9206782"},{"key":"7617_CR28","doi-asserted-by":"publisher","first-page":"214","DOI":"10.1016\/j.neucom.2021.06.040","volume":"457","author":"J Zeng","year":"2021","unstructured":"Zeng J, Liu T, Jia W, Zhou J (2021) Fine-grained question-answer sentiment classification with hierarchical graph attention network. Neurocomputing 457:214\u2013224","journal-title":"Neurocomputing"},{"key":"7617_CR29","doi-asserted-by":"crossref","unstructured":"Chen S, Zhao Y, Jin Q, Wu Q (2020) Fine-grained video-text retrieval with hierarchical graph reasoning. In: Proceedings of the IEEE Conference on computer vision and pattern recognition, pp 10638\u201310647","DOI":"10.1109\/CVPR42600.2020.01065"},{"key":"7617_CR30","unstructured":"Kim JH, On KW, Lim W, Kim J, Ha JW, Zhang BT (2016) Hadamard product for low-rank bilinear pooling. arXiv preprint arXiv:1610.04325"},{"key":"7617_CR31","first-page":"8102","volume":"33","author":"H Ben-Younes","year":"2019","unstructured":"Ben-Younes H, Cadene R, Thome N, Cord M (2019) Block: bilinear superdiagonal fusion for visual question answering and visual relationship detection. Proc AAAI Conf Artif Intell 33:8102\u20138109","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"7617_CR32","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, Teney D, Johnson M, Gould S, Zhang L (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"7617_CR33","unstructured":"Kazemi V, Elqursh A (2017) Show, ask, attend, and answer: a strong baseline for visual question answering. arXiv preprint arXiv:1704.03162"},{"key":"7617_CR34","doi-asserted-by":"crossref","unstructured":"Zellers R, Bisk Y, Farhadi A, Choi Y (2019) From recognition to cognition: visual commonsense reasoning. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6720\u20136731","DOI":"10.1109\/CVPR.2019.00688"},{"issue":"1","key":"7617_CR35","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K, Kravitz J, Chen S, Kalantidis Y, Li LJ, Shamma DA et al (2017) Visual genome: connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis 123(1):32\u201373","journal-title":"Int J Comput Vis"},{"key":"7617_CR36","doi-asserted-by":"crossref","unstructured":"Wang Y, Yang H, Qian X, Ma L, Lu J, Li B, Fan X (2019) Position focused attention network for image-text matching. arXiv preprint arXiv:1907.09748","DOI":"10.24963\/ijcai.2019\/526"},{"key":"7617_CR37","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1162\/tacl_a_00051","volume":"5","author":"P Bojanowski","year":"2017","unstructured":"Bojanowski P, Grave E, Joulin A, Mikolov T (2017) Enriching word vectors with subword information. Trans Assoc Comput Linguist 5:135\u2013146","journal-title":"Trans Assoc Comput Linguist"},{"key":"7617_CR38","doi-asserted-by":"crossref","unstructured":"Karaoglu S, van Gemert JC, Gevers T (2013) Con-text: Text detection using background connectivity for fine-grained object classification. In: Proceedings of the ACM international conference on multimedia, pp 757\u2013760","DOI":"10.1145\/2502081.2502197"},{"key":"7617_CR39","doi-asserted-by":"publisher","first-page":"4683","DOI":"10.1109\/TIP.2020.2973812","volume":"29","author":"D Chang","year":"2020","unstructured":"Chang D, Ding Y, Xie J, Bhunia AK, Li X, Ma Z, Wu M, Guo J, Song YZ (2020) The devil is in the channels: mutual-channel loss for fine-grained image classification. IEEE Trans Image Process 29:4683\u20134695","journal-title":"IEEE Trans Image Process"},{"key":"7617_CR40","doi-asserted-by":"publisher","first-page":"1545","DOI":"10.1109\/LSP.2020.3020227","volume":"27","author":"W Luo","year":"2020","unstructured":"Luo W, Zhang H, Li J, Wei XS (2020) Learning semantically enhanced feature for fine-grained image classification. IEEE Signal Process Lett 27:1545\u20131549","journal-title":"IEEE Signal Process Lett"},{"key":"7617_CR41","doi-asserted-by":"crossref","unstructured":"Teh EW, DeVries T, Taylor GW (2020) Proxynca++: revisiting and revitalizing proxy neighborhood component analysis. In: European conference on computer vision, pp 448\u2013464","DOI":"10.1007\/978-3-030-58586-0_27"},{"key":"7617_CR42","unstructured":"Zeng Z, Wang J, Chen B, Dai T, Xia ST (2021) Pyramid hybrid pooling quantization for efficient fine-grained image retrieval. arXiv preprint arXiv:2109.05206"}],"container-title":["Neural Computing and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-022-07617-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00521-022-07617-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-022-07617-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,7]],"date-time":"2022-11-07T23:33:25Z","timestamp":1667864005000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00521-022-07617-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,7,27]]},"references-count":42,"journal-issue":{"issue":"23","published-print":{"date-parts":[[2022,12]]}},"alternative-id":["7617"],"URL":"https:\/\/doi.org\/10.1007\/s00521-022-07617-3","relation":{},"ISSN":["0941-0643","1433-3058"],"issn-type":[{"value":"0941-0643","type":"print"},{"value":"1433-3058","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,7,27]]},"assertion":[{"value":"22 December 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 July 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 July 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of Interest"}}]}}