{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T21:42:56Z","timestamp":1781818976045,"version":"3.54.5"},"reference-count":61,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2022,1,29]],"date-time":"2022-01-29T00:00:00Z","timestamp":1643414400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,29]],"date-time":"2022-01-29T00:00:00Z","timestamp":1643414400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,3]]},"DOI":"10.1007\/s11042-021-11818-8","type":"journal-article","created":{"date-parts":[[2022,1,29]],"date-time":"2022-01-29T09:02:52Z","timestamp":1643446972000},"page":"7917-7940","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":14,"title":["Multi-label image recognition with attentive transformer-localizer module"],"prefix":"10.1007","volume":"81","author":[{"given":"Lin","family":"Nie","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5848-5624","authenticated-orcid":false,"given":"Tianshui","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhouxia","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenxiong","family":"Kang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liang","family":"Lin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,1,29]]},"reference":[{"key":"11818_CR1","doi-asserted-by":"crossref","unstructured":"Chatfield K, Simonyan K, Vedaldi A, Zisserman A (2014) Return of the devil in the details: Delving deep into convolutional nets. In: Proceedings of the british machine vision conference","DOI":"10.5244\/C.28.6"},{"key":"11818_CR2","doi-asserted-by":"publisher","unstructured":"Chen L, Wang R, Yang J, Xue L, Hu M (2019) Multi-label image classification with recurrently learning semantic dependencies. Vis Comput 35. https:\/\/doi.org\/10.1007\/s00371-018-01615-0","DOI":"10.1007\/s00371-018-01615-0"},{"key":"11818_CR3","unstructured":"Chen Q, Song Z, Hua Y, Huang Z, Yan S (2012) Hierarchical matching with side information for image classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3426\u20133433"},{"key":"11818_CR4","unstructured":"Chen T, Lin L, Hui X, Chen R, Wu H (2020) Knowledge-guided multi-label few-shot learning for general image recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"11818_CR5","unstructured":"Chen T, Pu T, Wu H, Xie Y, Lin L (2021) Structured semantic transfer for multi-label recognition with partial labels. arXiv:2112.10941"},{"key":"11818_CR6","doi-asserted-by":"crossref","unstructured":"Chen T, Pu T, Wu H, Xie Y, Liu L, Lin L (2021) Cross-domain facial expression recognition: a unified evaluation benchmark and adversarial graph learning. IEEE transactions on pattern analysis and machine intelligence","DOI":"10.1109\/TPAMI.2021.3131222"},{"key":"11818_CR7","doi-asserted-by":"crossref","unstructured":"Chen T, Xu M, Hui X, Wu H, Lin L (2019) Learning semantic-specific graph representation for multi-label image recognition. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 522\u2013531","DOI":"10.1109\/ICCV.2019.00061"},{"issue":"11","key":"11818_CR8","doi-asserted-by":"publisher","first-page":"1875","DOI":"10.1109\/TMM.2015.2477044","volume":"17","author":"K Cho","year":"2015","unstructured":"Cho K, Courville A, Bengio Y (2015) Describing multimedia content using attention-based encoder-decoder networks. IEEE Transactions on Multimedia 17(11):1875\u20131886","journal-title":"IEEE Transactions on Multimedia"},{"key":"11818_CR9","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B (2005) Histograms of oriented gradients for human detection. In: IEEE computer society conference on computer vision and pattern recognition, 2005. CVPR 2005. vol 1, IEEE, pp 886\u2013893","DOI":"10.1109\/CVPR.2005.177"},{"key":"11818_CR10","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li LJ, Li K, Fei-Fei L (2009) Imagenet: a large-scale hierarchical image database. In: IEEE conference on computer vision and pattern recognition, 2009. CVPR 2009. IEEE, pp 248\u2013255","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"11818_CR11","doi-asserted-by":"crossref","unstructured":"Dong J, Xia W, Chen Q, Feng J, Huang Z, Yan S (2013) Subcategory-aware object classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 827\u2013834","DOI":"10.1109\/CVPR.2013.112"},{"issue":"2","key":"11818_CR12","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham M, Van Gool L, Williams CK, Winn J, Zisserman A (2010) The pascal visual object classes (voc) challenge. Int J Comput Vis 88 (2):303\u2013338","journal-title":"Int J Comput Vis"},{"key":"11818_CR13","doi-asserted-by":"crossref","unstructured":"Ghamrawi N, McCallum A (2005) Collective multi-label classification. In: Proceedings of the 14th ACM international conference on Information and knowledge management, ACM, pp 195\u2013200","DOI":"10.1145\/1099554.1099591"},{"key":"11818_CR14","doi-asserted-by":"crossref","unstructured":"Girshick R, Donahue J, Darrell T, Malik J (2014) Rich feature hierarchies for accurate object detection and semantic segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 580\u2013587","DOI":"10.1109\/CVPR.2014.81"},{"key":"11818_CR15","unstructured":"Glorot X, Bengio Y (2010) Understanding the difficulty of training deep feedforward neural networks. In: Aistats, vol 9, pp 249\u2013256"},{"key":"11818_CR16","unstructured":"Gong Y, Jia Y, Leung T, Toshev A, Ioffe S (2013) Deep convolutional ranking for multilabel image annotation. arXiv:1312.4894"},{"key":"11818_CR17","unstructured":"Guo Y, Gu S (2011) Multi-label classification using conditional dependency networks. In: IJCAI Proceedings-international joint conference on artificial intelligence, pp 1300"},{"key":"11818_CR18","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2015) Delving deep into rectifiers: Surpassing human-level performance on imagenet classification. In: Proceedings of the IEEE international conference on computer vision, pp 1026\u20131034","DOI":"10.1109\/ICCV.2015.123"},{"key":"11818_CR19","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"11818_CR20","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"11818_CR21","unstructured":"Jaderberg M, Simonyan K, Zisserman A et al (2015) Spatial transformer networks. In: Advances in neural information processing systems, pp 2017\u20132025"},{"key":"11818_CR22","doi-asserted-by":"crossref","unstructured":"Jia Y, Shelhamer E, Donahue J, Karayev S, Long J, Girshick R, Guadarrama S, Darrell T (2014) Caffe: Convolutional architecture for fast feature embedding. In: Proceedings of ACM international conference on Multimedia, pp 675\u2013678","DOI":"10.1145\/2647868.2654889"},{"key":"11818_CR23","unstructured":"Kingma D, Ba J (2014) Adam: A method for stochastic optimization. arXiv:1412.6980"},{"key":"11818_CR24","unstructured":"Krizhevsky A (2009) Learning multiple layers of features from tiny images. Computer Science Department University of Toronto"},{"key":"11818_CR25","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Advances in neural information processing systems, pp 1097\u20131105"},{"key":"11818_CR26","doi-asserted-by":"crossref","unstructured":"Kuen J, Wang Z, Wang G (2016) Recurrent attentional networks for saliency detection. In: 2016 IEEE Conference on computer vision and pattern recognition (CVPR), IEEE, pp 3668\u20133677","DOI":"10.1109\/CVPR.2016.399"},{"key":"11818_CR27","unstructured":"LeCun Y, Boser BE, Denker JS, Henderson D, Howard RE, Hubbard WE, Jackel LD (1990) Handwritten digit recognition with a back-propagation network. In: Advances in neural information processing systems, pp 396\u2013404"},{"issue":"3","key":"11818_CR28","doi-asserted-by":"publisher","first-page":"726","DOI":"10.1109\/TMM.2017.2751140","volume":"20","author":"L Li","year":"2017","unstructured":"Li L, Tang S, Zhang Y, Deng L, Tian Q (2017) Gla: Global\u2013local attention for image description. IEEE Transactions on Multimedia 20(3):726\u2013737","journal-title":"IEEE Transactions on Multimedia"},{"key":"11818_CR29","doi-asserted-by":"publisher","unstructured":"Li Z, Lu W, Sun Z, Xing W (2018) Improving multi-label classification using scene cues. Multimedia Tools and Applications, pp 77. https:\/\/doi.org\/10.1007\/s11042-017-4517-0","DOI":"10.1007\/s11042-017-4517-0"},{"key":"11818_CR30","doi-asserted-by":"crossref","unstructured":"Lin TY, Goyal P, Girshick R, He K, Dollar P (2017) Focal loss for dense object detection. In: 2017 IEEE International conference on computer vision (ICCV), IEEE, pp 2999\u20133007","DOI":"10.1109\/ICCV.2017.324"},{"key":"11818_CR31","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P., Zitnick CL (2014) Microsoft coco: Common objects in context. In: European conference on computer vision, Springer, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"11818_CR32","doi-asserted-by":"crossref","unstructured":"Liu W, Anguelov D, Erhan D, Szegedy C, Reed S, Fu CY, Berg AC (2016) Ssd: Single shot multibox detector. In: European conference on computer vision, Springer, pp 21\u201337","DOI":"10.1007\/978-3-319-46448-0_2"},{"issue":"2","key":"11818_CR33","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe DG (2004) Distinctive image features from scale-invariant keypoints. Int J Comput Vis 60(2):91\u2013110","journal-title":"Int J Comput Vis"},{"key":"11818_CR34","doi-asserted-by":"publisher","unstructured":"Lyu F, Hu F, Sheng V, Wu Z, Fu Q, Fu B (2018) Coarse to fine: Multi-label image classification with global\/local attention. pp 1\u20137. https:\/\/doi.org\/10.1109\/ISC2.2018.8656664","DOI":"10.1109\/ISC2.2018.8656664"},{"key":"11818_CR35","unstructured":"Mnih V, Heess N, Graves A et al (2014) Recurrent models of visual attention. In: Advances in neural information processing systems, pp 2204\u20132212"},{"key":"11818_CR36","unstructured":"Nair V, Hinton GE (2010) Rectified linear units improve restricted boltzmann machines. In: Proceedings of the 27th international conference on machine learning (ICML-10), pp 807\u2013814"},{"key":"11818_CR37","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala S, Girshick R, Farhadi A (2016) You only look once: Unified, real-time object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 779\u2013788","DOI":"10.1109\/CVPR.2016.91"},{"key":"11818_CR38","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster r-cnn: Towards real-time object detection with region proposal networks. In: Advances in neural information processing systems, pp 91\u201399"},{"issue":"3","key":"11818_CR39","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky O, Deng J, Su H, Krause J, Satheesh S, Ma S, Huang Z, Karpathy A, Khosla A, Bernstein M et al (2015) Imagenet large scale visual recognition challenge. Int J Comput Vis 115(3):211\u2013252","journal-title":"Int J Comput Vis"},{"key":"11818_CR40","doi-asserted-by":"crossref","unstructured":"Sharif Razavian A, Azizpour H, Sullivan J, Carlsson S (2014) Cnn features off-the-shelf: an astounding baseline for recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition workshops, pp 806\u2013813","DOI":"10.1109\/CVPRW.2014.131"},{"key":"11818_CR41","unstructured":"Simonyan K, Zisserman A (2015) Very deep convolutional networks for large-scale image recognition. In: Proceedings of international conference on learning representations"},{"key":"11818_CR42","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y, Sermanet P, Reed S, Anguelov D, Erhan D, Vanhoucke V, Rabinovich A, Rick Chang JH et al (2015) Going deeper with convolutions. In: The IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2015.7298594"},{"issue":"9","key":"11818_CR43","doi-asserted-by":"publisher","first-page":"2105","DOI":"10.1109\/TMM.2017.2729786","volume":"19","author":"S Tang","year":"2017","unstructured":"Tang S, Li Y, Deng L, Zhang Y (2017) Object localization based on proposal fusion. IEEE Transactions on Multimedia 19(9):2105\u20132116","journal-title":"IEEE Transactions on Multimedia"},{"key":"11818_CR44","doi-asserted-by":"crossref","unstructured":"Uijlings JR, Van De Sande KE, Gevers T, Smeulders AW (2013) Selective search for object recognition. Int J Comput Vis 104(2):154\u2013171","DOI":"10.1007\/s11263-013-0620-5"},{"key":"11818_CR45","doi-asserted-by":"crossref","unstructured":"Wang J, Yang Y, Mao J, Huang Z, Huang C, Xu W (2016) Cnn-rnn: a unified framework for multi-label image classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2285\u20132294","DOI":"10.1109\/CVPR.2016.251"},{"issue":"12","key":"11818_CR46","doi-asserted-by":"publisher","first-page":"5678","DOI":"10.1109\/TIP.2016.2612829","volume":"25","author":"M Wang","year":"2016","unstructured":"Wang M, Luo C, Hong R, Tang J, Feng J (2016) Beyond object proposals: random crop pooling for multi-label image recognition. IEEE Trans Image Process 25(12):5678\u20135688","journal-title":"IEEE Trans Image Process"},{"key":"11818_CR47","doi-asserted-by":"crossref","unstructured":"Wang Z, Chen T, Li G, Xu R, Lin L (2017) Multi-label image recognition by recurrently discovering attentional regions. In: Proceedings of the IEEE international conference on computer vision, pp 464\u2013472","DOI":"10.1109\/ICCV.2017.58"},{"key":"11818_CR48","doi-asserted-by":"publisher","unstructured":"Wang Z, Fang Z, Li D, Yang H, Du W (2021) Semantic supplementary network with prior information for multi-label image classification. IEEE Trans Circuits Syst Vid Technol, pp 1\u20131. https:\/\/doi.org\/10.1109\/TCSVT.2021.3083978","DOI":"10.1109\/TCSVT.2021.3083978"},{"issue":"9","key":"11818_CR49","doi-asserted-by":"publisher","first-page":"1901","DOI":"10.1109\/TPAMI.2015.2491929","volume":"38","author":"Y Wei","year":"2016","unstructured":"Wei Y, Xia W, Lin M, Huang J, Ni B, Dong J, Zhao Y, Yan S (2016) Hcp: a flexible cnn framework for multi-label image classification. IEEE Trans Pattern Anal Mach Intell 38(9):1901\u20131907","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"3-4","key":"11818_CR50","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1007\/BF00992696","volume":"8","author":"RJ Williams","year":"1992","unstructured":"Williams RJ (1992) Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn 8(3-4):229\u2013256","journal-title":"Mach Learn"},{"key":"11818_CR51","unstructured":"Xiao T, Xu Y, Yang K, Zhang J, Peng Y, Zhang Z (2015) The application of two-level attention models in deep convolutional neural network for fine-grained image classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 842\u2013850"},{"key":"11818_CR52","unstructured":"Xiong C, Merity S, Socher R (2016) Dynamic memory networks for visual and textual question answering. In: Proceedings of The 33rd international conference on machine learning, pp 2397\u20132406"},{"key":"11818_CR53","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: Neural image caption generation with visual attention. In: International conference on machine learning, pp 2048\u20132057"},{"key":"11818_CR54","unstructured":"Xue X, Zhang W, Zhang J, Wu B, Fan J, Lu Y (2011) Correlative multi-label multi-instance image annotation. In: 2011 International conference on computer vision, IEEE, pp 651\u2013658"},{"key":"11818_CR55","doi-asserted-by":"crossref","unstructured":"Yang H, Tianyi Zhou J, Zhang Y, Gao BB, Wu J, Cai J (2016) Exploit bounding box annotations for multi-label object recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 280\u2013288","DOI":"10.1109\/CVPR.2016.37"},{"key":"11818_CR56","doi-asserted-by":"crossref","unstructured":"Zhang J, Wu Q, Shen C, Zhang J, Lu J (2018) Multi-label image classification with regional latent semantic dependencies. IEEE Transactions on Multimedia","DOI":"10.1109\/TMM.2018.2812605"},{"issue":"6","key":"11818_CR57","doi-asserted-by":"publisher","first-page":"1303","DOI":"10.1109\/TCSVT.2017.2654543","volume":"28","author":"K Zhang","year":"2018","unstructured":"Zhang K, Sun M, Han TX, Yuan X, Guo L, Liu T (2018) Residual networks of residual networks: multilevel residual networks. IEEE Trans Circuits Syst Video Techn 28(6):1303\u20131314","journal-title":"IEEE Trans Circuits Syst Video Techn"},{"issue":"1-4","key":"11818_CR58","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1007\/s13042-010-0001-0","volume":"1","author":"Y Zhang","year":"2010","unstructured":"Zhang Y, Jin R, Zhou ZH (2010) Understanding bag-of-words model: a statistical framework. Int J Mach Learn Cybern 1(1-4):43\u201352","journal-title":"Int J Mach Learn Cybern"},{"issue":"6","key":"11818_CR59","doi-asserted-by":"publisher","first-page":"1245","DOI":"10.1109\/TMM.2017.2648498","volume":"19","author":"B Zhao","year":"2017","unstructured":"Zhao B, Wu X, Feng J, Peng Q, Yan S (2017) Diversified visual attention networks for fine-grained object classification. IEEE Transactions on Multimedia 19(6):1245\u20131256","journal-title":"IEEE Transactions on Multimedia"},{"key":"11818_CR60","doi-asserted-by":"crossref","unstructured":"Zhu F, Li H, Ouyang W, Yu N, Wang X (2017) Learning spatial regularization with image-level supervisions for multi-label image classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2017.219"},{"key":"11818_CR61","doi-asserted-by":"crossref","unstructured":"Zitnick CL, Doll\u00e1r P (2014) Edge boxes: Locating object proposals from edges. In: European conference on computer vision, Springer, pp 391\u2013405","DOI":"10.1007\/978-3-319-10602-1_26"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11818-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-021-11818-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11818-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,3,3]],"date-time":"2022-03-03T05:19:20Z","timestamp":1646284760000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-021-11818-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,1,29]]},"references-count":61,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2022,3]]}},"alternative-id":["11818"],"URL":"https:\/\/doi.org\/10.1007\/s11042-021-11818-8","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,1,29]]},"assertion":[{"value":"30 April 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 September 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 December 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 January 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}