{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T18:03:14Z","timestamp":1784916194727,"version":"3.55.0"},"reference-count":56,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2022,3,8]],"date-time":"2022-03-08T00:00:00Z","timestamp":1646697600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,3,8]],"date-time":"2022-03-08T00:00:00Z","timestamp":1646697600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61772108"],"award-info":[{"award-number":["61772108"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61932020"],"award-info":[{"award-number":["61932020"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2022,8]]},"DOI":"10.1007\/s00530-022-00899-6","type":"journal-article","created":{"date-parts":[[2022,3,8]],"date-time":"2022-03-08T13:02:33Z","timestamp":1646744553000},"page":"1515-1528","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["From coarse to fine: multi-level feature fusion network for fine-grained image retrieval"],"prefix":"10.1007","volume":"28","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7254-4715","authenticated-orcid":false,"given":"Shijie","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhihui","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ning","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haojie","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,3,8]]},"reference":[{"key":"899_CR1","doi-asserted-by":"publisher","unstructured":"Bell, S., Bala, K.: Learning visual similarity for product design with convolutional neural networks. ACM Trans. Graph. 34(4), 98:1\u201398:10 (2015). https:\/\/doi.org\/10.1145\/2766959","DOI":"10.1145\/2766959"},{"issue":"3\u20132","key":"899_CR2","doi-asserted-by":"publisher","first-page":"734","DOI":"10.1109\/TMM.2011.2181343","volume":"14","author":"P Daras","year":"2012","unstructured":"Daras, P., Manolopoulou, S., Axenopoulos, A.: Search and retrieval of rich media objects supporting multiple multimodal queries. IEEE Trans. Multimed. 14(3\u20132), 734\u2013746 (2012)","journal-title":"IEEE Trans. Multimed."},{"key":"899_CR3","doi-asserted-by":"publisher","unstructured":"Deng, J., Dong, W., Socher, R., Li, L., Li, K., Li, F.: Imagenet: A large-scale hierarchical image database. In: 2009 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2009), 20\u201325 June 2009, Miami, Florida, USA, pp. 248\u2013255 (2009). https:\/\/doi.org\/10.1109\/CVPRW.2009.5206848","DOI":"10.1109\/CVPRW.2009.5206848"},{"key":"899_CR4","unstructured":"Fu, C., Liu, W., Ranga, A., Tyagi, A., Berg, A.C.: DSSD: Deconvolutional single shot detector. CoRR abs\/1701.06659 (2017). http:\/\/arxiv.org\/abs\/1701.06659"},{"key":"899_CR5","doi-asserted-by":"publisher","unstructured":"Fu, J., Zheng, H., Mei, T.: Look closer to see better: Recurrent attention convolutional neural network for fine-grained image recognition. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21\u201326, 2017, pp. 4476\u20134484 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.476","DOI":"10.1109\/CVPR.2017.476"},{"key":"899_CR6","doi-asserted-by":"crossref","unstructured":"Gao, S., Tsang, I.W., Ma, Y.: Learning category-specific dictionary and shared dictionary for fine-grained image categorization. IEEE Trans. Image Process. 23(2), 623\u2013634 (2014)","DOI":"10.1109\/TIP.2013.2290593"},{"key":"899_CR7","doi-asserted-by":"publisher","unstructured":"Girshick, R.B., Donahue, J., Darrell, T., Malik, J.: Rich feature hierarchies for accurate object detection and semantic segmentation. In: 2014 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2014, Columbus, OH, USA, June 23\u201328, 2014, pp. 580\u2013587 (2014). https:\/\/doi.org\/10.1109\/CVPR.2014.81","DOI":"10.1109\/CVPR.2014.81"},{"key":"899_CR8","doi-asserted-by":"publisher","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: 2016 IEEE conference on computer vision and pattern recognition, CVPR 2016, Las Vegas, NV, USA, June 27-30, 2016, pp. 770\u2013778 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.90","DOI":"10.1109\/CVPR.2016.90"},{"key":"899_CR9","unstructured":"He, X., Peng, Y.: Weakly supervised learning of part selection model with spatial constraints for fine-grained image classification. In: Proceedings of the thirty-first AAAI conference on artificial intelligence, February 4\u20139, 2017, San Francisco, California, USA., pp. 4075\u20134081 (2017). http:\/\/aaai.org\/ocs\/index.php\/AAAI\/AAAI17\/paper\/view\/14629"},{"key":"899_CR10","doi-asserted-by":"publisher","first-page":"504","DOI":"10.1126\/science.1127647","volume":"313","author":"GE Hinton","year":"2006","unstructured":"Hinton, G.E., Salakhutdinov, R.R.: Reducing the dimensionality of data with neural networks. Science 313, 504\u2013507 (2006)","journal-title":"Science"},{"key":"899_CR11","unstructured":"Huang, C., Loy, C.C., Tang, X.: Local similarity-aware deep feature embedding. In: Advances in Neural Information Processing Systems 29: Annual Conference on Neural Information Processing Systems 2016, December 5\u201310, 2016, Barcelona, Spain, pp. 1262\u20131270 (2016). http:\/\/papers.nips.cc\/paper\/6368-local-similarity-aware-deep-feature-embedding"},{"key":"899_CR12","doi-asserted-by":"publisher","unstructured":"Jia, Y., Shelhamer, E., Donahue, J., Karayev, S., Long, J., Girshick, R.B., Guadarrama, S., Darrell, T.: Caffe: Convolutional architecture for fast feature embedding. In: Proceedings of the ACM International Conference on Multimedia, MM \u201914, Orlando, FL, USA, November 03 - 07, 2014, pp. 675\u2013678 (2014). https:\/\/doi.org\/10.1145\/2647868.2654889","DOI":"10.1145\/2647868.2654889"},{"key":"899_CR13","doi-asserted-by":"publisher","unstructured":"Kalantidis, Y., Mellina, C., Osindero, S.: Cross-dimensional weighting for aggregated deep convolutional features. In: Computer Vision - ECCV 2016 Workshops - Amsterdam, The Netherlands, October 8-10 and 15-16, 2016, Proceedings, Part I, pp. 685\u2013701 (2016). https:\/\/doi.org\/10.1007\/978-3-319-46604-0_48","DOI":"10.1007\/978-3-319-46604-0_48"},{"key":"899_CR14","doi-asserted-by":"publisher","unstructured":"Krause, J., Jin, H., Yang, J., Li, F.: Fine-grained recognition without part annotations. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2015, Boston, MA, USA, June 7-12, 2015, pp. 5546\u20135555 (2015). https:\/\/doi.org\/10.1109\/CVPR.2015.7299194","DOI":"10.1109\/CVPR.2015.7299194"},{"key":"899_CR15","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems 25: 26th Annual Conference on Neural Information Processing Systems 2012. Proceedings of a meeting held December 3-6, 2012, Lake Tahoe, Nevada, United States., pp. 1106\u20131114 (2012). http:\/\/papers.nips.cc\/paper\/4824-imagenet-classification-with-deep-convolutional-neural-networks"},{"key":"899_CR16","doi-asserted-by":"crossref","unstructured":"Li, K., Zou, C., Bu, S., Liang, Y., Zhang, J., Gong, M.: Multi-modal feature fusion for geographic image annotation. Pattern Recognit. 73, 1\u201314 (2018)","DOI":"10.1016\/j.patcog.2017.06.036"},{"key":"899_CR17","doi-asserted-by":"publisher","unstructured":"Lin, T., Roy Chowdhury, A., Maji, S.: Bilinear CNN models for fine-grained visual recognition. In: 2015 IEEE International Conference on Computer Vision, ICCV 2015, Santiago, Chile, December 7-13, 2015, pp. 1449\u20131457 (2015). https:\/\/doi.org\/10.1109\/ICCV.2015.170","DOI":"10.1109\/ICCV.2015.170"},{"key":"899_CR18","doi-asserted-by":"publisher","unstructured":"Liu, G., Xiao, L., Xiong, C.: Image classification with deep belief networks and improved gradient descent. In: 2017 IEEE International Conference on Computational Science and Engineering, CSE 2017, and IEEE International Conference on Embedded and Ubiquitous Computing, EUC 2017, Guangzhou, China, July 21\u201324, 2017, Volume 1, pp. 375\u2013380 (2017). https:\/\/doi.org\/10.1109\/CSE-EUC.2017.74","DOI":"10.1109\/CSE-EUC.2017.74"},{"key":"899_CR19","doi-asserted-by":"publisher","unstructured":"Liu, W., Anguelov, D., Erhan, D., Szegedy, C., Reed, S.E., Fu, C., Berg, A.C.: SSD: single shot multibox detector. In: Computer Vision - ECCV 2016 - 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part I, pp. 21\u201337 (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_2","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"899_CR20","doi-asserted-by":"crossref","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vis. 60(2), 91\u2013110 (2004)","DOI":"10.1023\/B:VISI.0000029664.99615.94"},{"key":"899_CR21","doi-asserted-by":"publisher","unstructured":"Manmatha, R., Wu, C., Smola, A.J., Kr\u00e4henb\u00fchl, P.: Sampling matters in deep embedding learning. In: IEEE International Conference on Computer Vision, ICCV 2017, Venice, Italy, October 22-29, 2017, pp. 2859\u20132867. IEEE Computer Society (2017). https:\/\/doi.org\/10.1109\/ICCV.2017.309","DOI":"10.1109\/ICCV.2017.309"},{"key":"899_CR22","doi-asserted-by":"crossref","unstructured":"Ng, J.Y., Yang, F., Davis, L.S.: Exploiting local features from deep networks for image retrieval. In: 2015 IEEE Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops 2015, Boston, MA, USA, June 7\u201312, 2015","DOI":"10.1109\/CVPRW.2015.7301272"},{"key":"899_CR23","doi-asserted-by":"crossref","unstructured":"Peng, Y., He, X., Zhao, J.: Object-part attention model for fine-grained image classification. IEEE Trans. Image Process. 27(3), 1487\u20131500 (2018)","DOI":"10.1109\/TIP.2017.2774041"},{"key":"899_CR24","unstructured":"Peng, Y., Huang, X., Qi, J.: Cross-media shared representation by hierarchical learning with multiple deep networks. In: Proceedings of the Twenty-Fifth International Joint Conference on Artificial Intelligence, IJCAI 2016, New York, NY, USA, 9\u201315 July 2016, pp. 3846\u20133853 (2016). http:\/\/www.ijcai.org\/Abstract\/16\/541"},{"key":"899_CR25","doi-asserted-by":"publisher","unstructured":"Perazzi, F., Kr\u00e4henb\u00fchl, P., Pritch, Y., Hornung, A.: Saliency filters: Contrast based filtering for salient region detection. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition, Providence, RI, USA, June 16\u201321, 2012, pp. 733\u2013740 (2012). https:\/\/doi.org\/10.1109\/CVPR.2012.6247743","DOI":"10.1109\/CVPR.2012.6247743"},{"key":"899_CR26","doi-asserted-by":"publisher","unstructured":"Rasiwasia, N., Pereira, J.C., Coviello, E., Doyle, G., Lanckriet, G.R.G., Levy, R., Vasconcelos, N.: A new approach to cross-modal multimedia retrieval. In: Proceedings of the 18th International Conference on Multimedia 2010, Firenze, Italy, October 25\u201329, 2010, pp. 251\u2013260 (2010). https:\/\/doi.org\/10.1145\/1873951.1873987","DOI":"10.1145\/1873951.1873987"},{"key":"899_CR27","doi-asserted-by":"publisher","unstructured":"Redmon, J., Divvala, S.K., Girshick, R.B., Farhadi, A.: You only look once: Unified, real-time object detection. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27\u201330, 2016, pp. 779\u2013788 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.91","DOI":"10.1109\/CVPR.2016.91"},{"key":"899_CR28","doi-asserted-by":"publisher","unstructured":"Redmon, J., Farhadi, A.: YOLO9000: better, faster, stronger. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21\u201326, 2017, pp. 6517\u20136525 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.690","DOI":"10.1109\/CVPR.2017.690"},{"key":"899_CR29","doi-asserted-by":"publisher","unstructured":"Ren, J.S.J., Chen, X., Liu, J., Sun, W., Pang, J., Yan, Q., Tai, Y., Xu, L.: Accurate single stage detector using recurrent rolling convolution. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21\u201326, 2017, pp. 752\u2013760 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.87","DOI":"10.1109\/CVPR.2017.87"},{"key":"899_CR30","doi-asserted-by":"crossref","unstructured":"Ren, S., He, K., Girshick, R.B., Sun, J.: Faster R-CNN: towards real-time object detection with region proposal networks. IEEE Trans. Pattern Anal. Mach. Intell. 39(6), 1137\u20131149 (2017)","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"899_CR31","doi-asserted-by":"publisher","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D.: Grad-cam: Visual explanations from deep networks via gradient-based localization. In: IEEE International Conference on Computer Vision, ICCV 2017, Venice, Italy, October 22\u201329, 2017, pp. 618\u2013626 (2017). https:\/\/doi.org\/10.1109\/ICCV.2017.74","DOI":"10.1109\/ICCV.2017.74"},{"key":"899_CR32","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. In: 3rd International Conference on Learning Representations, ICLR 2015, San Diego, CA, USA, May 7-9, 2015, Conference Track Proceedings (2015). http:\/\/arxiv.org\/abs\/1409.1556"},{"key":"899_CR33","doi-asserted-by":"publisher","unstructured":"Song, H.O., Xiang, Y., Jegelka, S., Savarese, S.: Deep metric learning via lifted structured feature embedding. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27\u201330, 2016, pp. 4004\u20134012 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.434","DOI":"10.1109\/CVPR.2016.434"},{"key":"899_CR34","doi-asserted-by":"publisher","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S.E., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A.: Going deeper with convolutions. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2015, Boston, MA, USA, June 7\u201312, 2015, pp. 1\u20139 (2015). https:\/\/doi.org\/10.1109\/CVPR.2015.7298594","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"899_CR35","unstructured":"Tolias, G., Sicre, R., J\u00e9gou, H.: Particular object retrieval with integral max-pooling of CNN activations. In: 4th International Conference on Learning Representations, ICLR 2016, San Juan, Puerto Rico, May 2-4, 2016, Conference Track Proceedings (2016). http:\/\/arxiv.org\/abs\/1511.05879"},{"key":"899_CR36","unstructured":"Ustinova, E., Lempitsky, V.S.: Learning deep embeddings with histogram loss. In: Advances in Neural Information Processing Systems 29: Annual Conference on Neural Information Processing Systems 2016, December 5-10, 2016, Barcelona, Spain, pp. 4170\u20134178 (2016). http:\/\/papers.nips.cc\/paper\/6464-learning-deep-embeddings-with-histogram-loss"},{"key":"899_CR37","unstructured":"Wah, C., Branson, S., Welinder, P., Perona, P., Belongie, S.: The Caltech-UCSD Birds-200-2011 Dataset. Tech. Rep. CNS-TR-2011-001, California Institute of Technology (2011)"},{"key":"899_CR38","doi-asserted-by":"crossref","unstructured":"Wang, D., Cui, P., Ou, M., Zhu, W.: Learning compact hash codes for multimodal representations using orthogonal deep structure. IEEE Trans. Multimed. 17(9), 1404\u20131416 (2015)","DOI":"10.1109\/TMM.2015.2455415"},{"key":"899_CR39","doi-asserted-by":"publisher","unstructured":"Wang, J., Song, Y., Leung, T., Rosenberg, C., Wang, J., Philbin, J., Chen, B., Wu, Y.: Learning fine-grained image similarity with deep ranking. In: 2014 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2014, Columbus, OH, USA, June 23\u201328, 2014, pp. 1386\u20131393 (2014). https:\/\/doi.org\/10.1109\/CVPR.2014.180","DOI":"10.1109\/CVPR.2014.180"},{"key":"899_CR40","doi-asserted-by":"publisher","unstructured":"Wang, X., Han, X., Huang, W., Dong, D., Scott, M.R.: Multi-similarity loss with general pair weighting for deep metric learning. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16-20, 2019, pp. 5022\u20135030. Computer Vision Foundation \/ IEEE (2019). https:\/\/doi.org\/10.1109\/CVPR.2019.00516. http:\/\/openaccess.thecvf.com\/content_CVPR_2019\/html\/Wang_Multi-Similarity_Loss_With_General_Pair_Weighting_for_Deep_Metric_Learning_CVPR_2019_paper.html","DOI":"10.1109\/CVPR.2019.00516"},{"key":"899_CR41","doi-asserted-by":"publisher","unstructured":"Wang, Z., Li, Z., Sun, J., Xu, Y.: Selective convolutional features based generalized-mean pooling for fine-grained image retrieval. In: IEEE Visual Communications and Image Processing, VCIP 2018, Taichung, Taiwan, December 9-12, 2018, pp. 1\u20134 (2018). https:\/\/doi.org\/10.1109\/VCIP.2018.8698729","DOI":"10.1109\/VCIP.2018.8698729"},{"key":"899_CR42","doi-asserted-by":"crossref","unstructured":"Wei, X., Luo, J., Wu, J., Zhou, Z.: Selective convolutional descriptor aggregation for fine-grained image retrieval. IEEE Trans. Image Process. 26(6), 2868\u20132881 (2017)","DOI":"10.1109\/TIP.2017.2688133"},{"key":"899_CR43","doi-asserted-by":"publisher","unstructured":"Xiao, T., Xu, Y., Yang, K., Zhang, J., Peng, Y., Zhang, Z.: The application of two-level attention models in deep convolutional neural network for fine-grained image classification. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2015, Boston, MA, USA, June 7-12, 2015, pp. 842\u2013850 (2015). https:\/\/doi.org\/10.1109\/CVPR.2015.7298685","DOI":"10.1109\/CVPR.2015.7298685"},{"key":"899_CR44","doi-asserted-by":"crossref","unstructured":"Xie, L., Tian, Q., Wang, M., Zhang, B.: Spatial pooling of heterogeneous features for image classification. IEEE Trans. Image Process. 23(5), 1994\u20132008 (2014)","DOI":"10.1109\/TIP.2014.2310117"},{"key":"899_CR45","doi-asserted-by":"crossref","unstructured":"Xie, L., Wang, J., Zhang, B., Tian, Q.: Fine-grained image search. IEEE Trans. Multimed. 17(5), 636\u2013647 (2015)","DOI":"10.1109\/TMM.2015.2408566"},{"key":"899_CR46","doi-asserted-by":"crossref","unstructured":"Zhang, L., Ma, B., Li, G., Huang, Q., Tian, Q.: Cross-modal retrieval using multiordered discriminative structured subspace learning. IEEE Trans. Multimed. 19(6), 1220\u20131233 (2017)","DOI":"10.1109\/TMM.2016.2646219"},{"key":"899_CR47","doi-asserted-by":"publisher","unstructured":"Zhang, N., Donahue, J., Girshick, R.B., Darrell, T.: Part-based r-cnns for fine-grained category detection. In: Computer Vision - ECCV 2014 - 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part I, pp. 834\u2013849 (2014). https:\/\/doi.org\/10.1007\/978-3-319-10590-1_54","DOI":"10.1007\/978-3-319-10590-1_54"},{"key":"899_CR48","doi-asserted-by":"publisher","unstructured":"Zhang, X., Xiong, H., Zhou, W., Lin, W., Tian, Q.: Picking deep filter responses for fine-grained image recognition. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27\u201330, 2016, pp. 1134\u20131142 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.128","DOI":"10.1109\/CVPR.2016.128"},{"key":"899_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Wei, X., Wu, J., Cai, J., Lu, J., Nguyen, V.A., Do, M.N.: Weakly supervised fine-grained categorization with part-based image representation. IEEE Trans. Image Process. 25(4), 1713\u20131725 (2016)","DOI":"10.1109\/TIP.2016.2531289"},{"key":"899_CR50","doi-asserted-by":"publisher","unstructured":"Zheng, H., Fu, J., Mei, T., Luo, J.: Learning multi-attention convolutional neural network for fine-grained image recognition. In: IEEE International Conference on Computer Vision, ICCV 2017, Venice, Italy, October 22\u201329, 2017, pp. 5219\u20135227 (2017). https:\/\/doi.org\/10.1109\/ICCV.2017.557","DOI":"10.1109\/ICCV.2017.557"},{"key":"899_CR51","doi-asserted-by":"crossref","unstructured":"Zheng, W., Lu, J., Zhou, J.: Hardness-aware deep metric learning. IEEE Trans. Pattern Anal. Mach. Intell. 43(9), 3214\u20133228 (2021)","DOI":"10.1109\/TPAMI.2020.2980231"},{"key":"899_CR52","doi-asserted-by":"crossref","unstructured":"Zheng, W., Wang, C., Lu, J., Zhou, J.: Deep compositional metric learning. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2021, virtual, June 19-25, 2021, pp. 9320\u20139329. Computer Vision Foundation \/ IEEE (2021). https:\/\/openaccess.thecvf.com\/content\/CVPR2021\/html\/Zheng_Deep_Compositional_Metric_Learning_CVPR_2021_paper.html","DOI":"10.1109\/CVPR46437.2021.00920"},{"key":"899_CR53","doi-asserted-by":"publisher","unstructured":"Zheng, X., Ji, R., Sun, X., Wu, Y., Huang, F., Yang, Y.: Centralized ranking loss with weakly supervised localization for fine-grained object retrieval. In: J.\u00a0Lang (ed.) Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence, IJCAI 2018, July 13\u201319, 2018, Stockholm, Sweden, pp. 1226\u20131233. ijcai.org (2018). https:\/\/doi.org\/10.24963\/ijcai.2018\/171","DOI":"10.24963\/ijcai.2018\/171"},{"key":"899_CR54","doi-asserted-by":"publisher","unstructured":"Zheng, X., Ji, R., Sun, X., Zhang, B., Wu, Y., Huang, F.: Towards optimal fine grained retrieval via decorrelated centralized loss with normalize-scale layer. In: The Thirty-Third AAAI Conference on Artificial Intelligence, AAAI 2019, The Thirty-First Innovative Applications of Artificial Intelligence Conference, IAAI 2019, The Ninth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2019, Honolulu, Hawaii, USA, January 27\u2013February 1, 2019, pp. 9291\u20139298. AAAI Press (2019). https:\/\/doi.org\/10.1609\/aaai.v33i01.33019291","DOI":"10.1609\/aaai.v33i01.33019291"},{"key":"899_CR55","doi-asserted-by":"publisher","unstructured":"Zhou, B., Khosla, A., Lapedriza, \u00c0., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27\u201330, 2016, pp. 2921\u20132929 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.319","DOI":"10.1109\/CVPR.2016.319"},{"key":"899_CR56","doi-asserted-by":"publisher","unstructured":"Zhu, Y., Bai, Y., Wei, Y.: Spherical feature transform for deep metric learning. In: A.\u00a0Vedaldi, H.\u00a0Bischof, T.\u00a0Brox, J.\u00a0Frahm (eds.) Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XIX, Lecture Notes in Computer Science, vol. 12364, pp. 420\u2013436. Springer (2020). https:\/\/doi.org\/10.1007\/978-3-030-58529-7_25","DOI":"10.1007\/978-3-030-58529-7_25"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-00899-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-022-00899-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-00899-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,28]],"date-time":"2022-07-28T21:28:17Z","timestamp":1659043697000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-022-00899-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,3,8]]},"references-count":56,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2022,8]]}},"alternative-id":["899"],"URL":"https:\/\/doi.org\/10.1007\/s00530-022-00899-6","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,3,8]]},"assertion":[{"value":"8 May 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 January 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 March 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}