{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,25]],"date-time":"2026-07-25T01:45:23Z","timestamp":1784943923923,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":38,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819787043","type":"print"},{"value":"9789819787050","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-97-8705-0_27","type":"book-chapter","created":{"date-parts":[[2025,2,7]],"date-time":"2025-02-07T14:38:30Z","timestamp":1738939110000},"page":"391-405","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Shared Vision Transformer Helps Scene Text Retrieval"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-9829-6203","authenticated-orcid":false,"given":"Hailong","family":"Luo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8766-0647","authenticated-orcid":false,"given":"Mayire","family":"Ibrayim","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2321-308X","authenticated-orcid":false,"given":"Askar","family":"Hamdulla","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-5232-0176","authenticated-orcid":false,"given":"Qilin","family":"Deng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,2,8]]},"reference":[{"key":"27_CR1","doi-asserted-by":"crossref","unstructured":"Aldavert, D., Rusinol, M., Toledo, R., Llad\u00f3s, J.: Integrating visual and textual cues for query-by-string word spotting. In: 2013 12th International Conference on Document Analysis and Recognition, pp. 511\u2013515. IEEE (2013)","DOI":"10.1109\/ICDAR.2013.108"},{"issue":"12","key":"27_CR2","doi-asserted-by":"publisher","first-page":"2552","DOI":"10.1109\/TPAMI.2014.2339814","volume":"36","author":"J Almaz\u00e1n","year":"2014","unstructured":"Almaz\u00e1n, J., Gordo, A., Forn\u00e9s, A., Valveny, E.: Word spotting and recognition with embedded attributes. IEEE Trans. Pattern Anal. Mach. Intell. 36(12), 2552\u20132566 (2014)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"27_CR3","doi-asserted-by":"crossref","unstructured":"Bautista, D., Atienza, R.: Scene text recognition with permuted autoregressive sequence models. In: European Conference on Computer Vision, pp. 178\u2013196. Springer (2022)","DOI":"10.1007\/978-3-031-19815-1_11"},{"key":"27_CR4","doi-asserted-by":"crossref","unstructured":"Ch\u2019ng, C.K., Chan, C.S.: Total-text: a comprehensive dataset for scene text detection and recognition. In: 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR), vol.\u00a01, pp. 935\u2013942. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.157"},{"key":"27_CR5","unstructured":"Chung, J., Gulcehre, C., Cho, K., Bengio, Y.: Empirical evaluation of gated recurrent neural networks on sequence modeling. arXiv preprint arXiv:1412.3555 (2014)"},{"key":"27_CR6","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16$$\\times $$16 words: transformers for image recognition at scale. arxiv 2020. arXiv preprint arXiv:2010.11929 (2010)"},{"key":"27_CR7","doi-asserted-by":"crossref","unstructured":"Ghosh, S.K., Gomez, L., Karatzas, D., Valveny, E.: Efficient indexing for query by string text retrieval. In: 2015 13th International Conference on Document Analysis and Recognition (ICDAR), pp. 1236\u20131240. IEEE (2015)","DOI":"10.1109\/ICDAR.2015.7333961"},{"key":"27_CR8","doi-asserted-by":"crossref","unstructured":"G\u00f3mez, L., Mafla, A., Rusinol, M., Karatzas, D.: Single shot scene text retrieval. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 700\u2013715 (2018)","DOI":"10.1007\/978-3-030-01264-9_43"},{"key":"27_CR9","doi-asserted-by":"crossref","unstructured":"G\u00f3mez, L., Rusinol, M., Karatzas, D.: LSDE: Levenshtein space deep embedding for query-by-string word spotting. In: 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR), vol.\u00a01, pp. 499\u2013504. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.88"},{"key":"27_CR10","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., Girshick, R.: Mask R-CNN. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2961\u20132969 (2017)","DOI":"10.1109\/ICCV.2017.322"},{"key":"27_CR11","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"27_CR12","doi-asserted-by":"crossref","unstructured":"He, T., Tian, Z., Huang, W., Shen, C., Qiao, Y., Sun, C.: An end-to-end textspotter with explicit alignment and attention. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5020\u20135029 (2018)","DOI":"10.1109\/CVPR.2018.00527"},{"key":"27_CR13","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132\u20137141 (2018)","DOI":"10.1109\/CVPR.2018.00745"},{"key":"27_CR14","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., Zisserman, A.: Reading text in the wild with convolutional neural networks. Int. J. Comput. Vision 116, 1\u201320 (2016)","journal-title":"Int. J. Comput. Vision"},{"key":"27_CR15","unstructured":"Levenshtein, V.I., et\u00a0al.: Binary codes capable of correcting deletions, insertions, and reversals. In: Soviet Physics Doklady, vol.\u00a010, pp. 707\u2013710. Soviet Union (1966)"},{"key":"27_CR16","doi-asserted-by":"crossref","unstructured":"Liao, M., Pang, G., Huang, J., Hassner, T., Bai, X.: Mask TextSpotter v3: segmentation proposal network for robust scene text spotting. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Part XI, Glasgow, UK, 23\u201328 August 2020, pp. 706\u2013722. Springer (2020)","DOI":"10.1007\/978-3-030-58621-8_41"},{"key":"27_CR17","doi-asserted-by":"crossref","unstructured":"Liao, M., Zhu, Z., Shi, B., Xia, G.s., Bai, X.: Rotation-sensitive regression for oriented scene text detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5909\u20135918 (2018)","DOI":"10.1109\/CVPR.2018.00619"},{"key":"27_CR18","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Doll\u00e1r, P., Girshick, R., He, K., Hariharan, B., Belongie, S.: Feature pyramid networks for object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2117\u20132125 (2017)","DOI":"10.1109\/CVPR.2017.106"},{"key":"27_CR19","doi-asserted-by":"crossref","unstructured":"Liu, X., Liang, D., Yan, S., Chen, D., Qiao, Y., Yan, J.: FOTS: fast oriented text spotting with a unified network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5676\u20135685 (2018)","DOI":"10.1109\/CVPR.2018.00595"},{"key":"27_CR20","doi-asserted-by":"crossref","unstructured":"Liu, Y., Chen, H., Shen, C., He, T., Jin, L., Wang, L.: ABCNet: real-time scene text spotting with adaptive Bezier-curve network. In: proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9809\u20139818 (2020)","DOI":"10.1109\/CVPR42600.2020.00983"},{"key":"27_CR21","unstructured":"Loshchilov, I., Hutter, F.: Fixing weight decay regularization in Adam (2018)"},{"key":"27_CR22","doi-asserted-by":"crossref","unstructured":"Mafla, A., et al.: Real-time lexicon-free scene text retrieval. Pattern Recogn. 110, 107656 (2021)","DOI":"10.1016\/j.patcog.2020.107656"},{"key":"27_CR23","doi-asserted-by":"crossref","unstructured":"Mishra, A., Alahari, K., Jawahar, C.: Image retrieval using textual cues. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 3040\u20133047 (2013)","DOI":"10.1109\/ICCV.2013.378"},{"key":"27_CR24","doi-asserted-by":"crossref","unstructured":"Na, B., Kim, Y., Park, S.: Multi-modal text recognition networks: interactive enhancements between visual and semantic features. In: European Conference on Computer Vision, pp. 446\u2013463. Springer (2022)","DOI":"10.1007\/978-3-031-19815-1_26"},{"key":"27_CR25","doi-asserted-by":"crossref","unstructured":"Nayef, N., et\u00a0al.: ICDAR2019 robust reading challenge on multi-lingual scene text detection and recognition-RRC-MLT-2019. In: 2019 International conference on document analysis and recognition (ICDAR), pp. 1582\u20131587. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00254"},{"key":"27_CR26","doi-asserted-by":"crossref","unstructured":"Qiao, Z., Zhou, Y., Yang, D., Zhou, Y., Wang, W.: SEED: semantics enhanced encoder-decoder framework for scene text recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13528\u201313537 (2020)","DOI":"10.1109\/CVPR42600.2020.01354"},{"key":"27_CR27","doi-asserted-by":"crossref","unstructured":"Redmon, J., Farhadi, A.: YOLO9000: better, faster, stronger. In: Proceedings of the IEEE conference on Computer Vision and Pattern Recognition, pp. 7263\u20137271 (2017)","DOI":"10.1109\/CVPR.2017.690"},{"key":"27_CR28","doi-asserted-by":"crossref","unstructured":"Song, H., Wang, H., Huang, S., Xu, P., Huang, S., Ju, Q.: Text Siamese network for video textual keyframe detection. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 442\u2013447. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00077"},{"key":"27_CR29","doi-asserted-by":"crossref","unstructured":"Sudholt, S., Fink, G.A.: PhocNet: a deep convolutional neural network for word spotting in handwritten documents. In: 2016 15th International Conference on Frontiers in Handwriting Recognition (ICFHR), pp. 277\u2013282. IEEE (2016)","DOI":"10.1109\/ICFHR.2016.0060"},{"key":"27_CR30","doi-asserted-by":"crossref","unstructured":"Tian, Z., Shen, C., Chen, H., He, T.: Fcos: Fully convolutional one-stage object detection. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 9627\u20139636 (2019)","DOI":"10.1109\/ICCV.2019.00972"},{"key":"27_CR31","unstructured":"Veit, A., Matera, T., Neumann, L., Matas, J., Belongie, S.: COCO-text: dataset and benchmark for text detection and recognition in natural images. arxiv 2016. arXiv preprint arXiv:1601.07140"},{"key":"27_CR32","doi-asserted-by":"crossref","unstructured":"Wang, H., Bai, X., Yang, M., Zhu, S., Wang, J., Liu, W.: Scene text retrieval via joint text detection and similarity learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4558\u20134567 (2021)","DOI":"10.1109\/CVPR46437.2021.00453"},{"key":"27_CR33","unstructured":"Wang, K., Babenko, B., Belongie, S.: End-to-end scene text recognition. In: 2011 International Conference on Computer Vision, pp. 1457\u20131464. IEEE (2011)"},{"key":"27_CR34","doi-asserted-by":"crossref","unstructured":"Wen, L., Wang, Y., Zhang, D., Chen, G.: Visual matching is enough for scene text retrieval. In: Proceedings of the Sixteenth ACM International Conference on Web Search and Data Mining, pp. 447\u2013455 (2023)","DOI":"10.1145\/3539597.3570428"},{"key":"27_CR35","doi-asserted-by":"crossref","unstructured":"Wilkinson, T., Brun, A.: Semantic and verbatim word spotting using deep neural networks. In: 2016 15th International Conference on Frontiers in Handwriting Recognition (ICFHR), pp. 307\u2013312. IEEE (2016)","DOI":"10.1109\/ICFHR.2016.0065"},{"key":"27_CR36","doi-asserted-by":"crossref","unstructured":"Yang, X., et al.: Smart library: identifying books on library shelves using supervised deep learning for scene text reading. In: 2017 ACM\/IEEE Joint Conference on Digital Libraries (JCDL), pp.\u00a01\u20134. IEEE (2017)","DOI":"10.1109\/JCDL.2017.7991581"},{"key":"27_CR37","doi-asserted-by":"crossref","unstructured":"Zhan, F., Lu, S.: ESIR: end-to-end scene text recognition via iterative image rectification. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2059\u20132068 (2019)","DOI":"10.1109\/CVPR.2019.00216"},{"issue":"3","key":"27_CR38","doi-asserted-by":"publisher","first-page":"280","DOI":"10.1007\/s41019-021-00162-4","volume":"6","author":"M Zhu","year":"2021","unstructured":"Zhu, M., Shen, D., Xu, L., Wang, X.: Scalable multi-grained cross-modal similarity query with interpretability. Data Sci. Eng. 6(3), 280\u2013293 (2021)","journal-title":"Data Sci. Eng."}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition and Artificial Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-97-8705-0_27","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,7]],"date-time":"2025-02-07T14:38:59Z","timestamp":1738939139000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-97-8705-0_27"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819787043","9789819787050"],"references-count":38,"URL":"https:\/\/doi.org\/10.1007\/978-981-97-8705-0_27","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"8 February 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPRAI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition and Artificial Intelligence","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Jeju Island","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Korea (Republic of)","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18 June 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 June 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icprai2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/brain.korea.ac.kr\/icprai2024\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}