{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,30]],"date-time":"2026-03-30T20:24:11Z","timestamp":1774902251045,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":40,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Natural Science Foundation of China","award":["61802029, 61801448, 61802022"],"award-info":[{"award-number":["61802029, 61801448, 61802022"]}]},{"name":"Open Project Funding of CAS-NDST Lab","award":["CASNDST202005"],"award-info":[{"award-number":["CASNDST202005"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413883","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T13:10:18Z","timestamp":1602508218000},"page":"601-609","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":8,"title":["Beyond the Attention: Distinguish the Discriminative and Confusable Features For Fine-grained Image Classification"],"prefix":"10.1145","author":[{"given":"Xiruo","family":"Shi","sequence":"first","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liutong","family":"Xu","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pengfei","family":"Wang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuanyuan","family":"Gao","sequence":"additional","affiliation":[{"name":"Information Sciences Academy of China Electronics Technology Group Corporation, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haifang","family":"Jian","sequence":"additional","affiliation":[{"name":"Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wu","family":"Liu","sequence":"additional","affiliation":[{"name":"AI Research of JD.com, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Tiny Transfer Learning: Towards Memory-Efficient On-Device Learning. CoRR abs\/2007.11622","author":"Cai Han","year":"2020","unstructured":"Han Cai , Chuang Gan , Ligeng Zhu , and Song Han . 2020. Tiny Transfer Learning: Towards Memory-Efficient On-Device Learning. CoRR abs\/2007.11622 ( 2020 ). Han Cai, Chuang Gan, Ligeng Zhu, and Song Han. 2020. Tiny Transfer Learning: Towards Memory-Efficient On-Device Learning. CoRR abs\/2007.11622 (2020)."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Yue Chen Yalong Bai Wei Zhang and Tao Mei. 2019. Destruction and Construction Learning for Fine-Grained Image Recognition. In CVPR. 5157--5166.  Yue Chen Yalong Bai Wei Zhang and Tao Mei. 2019. Destruction and Construction Learning for Fine-Grained Image Recognition. In CVPR. 5157--5166.","DOI":"10.1109\/CVPR.2019.00530"},{"key":"e_1_3_2_1_3_1","volume-title":"Belongie","author":"Cui Yin","year":"2018","unstructured":"Yin Cui , Yang Song , Chen Sun , Andrew Howard , and Serge J . Belongie . 2018 . Large Scale Fine-Grained Categorization and Domain-Specific Transfer Learning. In CVPR. 4109--4118. Yin Cui, Yang Song, Chen Sun, Andrew Howard, and Serge J. Belongie. 2018. Large Scale Fine-Grained Categorization and Domain-Specific Transfer Learning. In CVPR. 4109--4118."},{"key":"e_1_3_2_1_4_1","volume-title":"Belongie","author":"Cui Yin","year":"2017","unstructured":"Yin Cui , Feng Zhou , Jiang Wang , Xiao Liu , Yuanqing Lin , and Serge J . Belongie . 2017 . Kernel Pooling for Convolutional Neural Networks. In CVPR. 3049--3058. Yin Cui, Feng Zhou, Jiang Wang, Xiao Liu, Yuanqing Lin, and Serge J. Belongie. 2017. Kernel Pooling for Convolutional Neural Networks. In CVPR. 3049--3058."},{"key":"e_1_3_2_1_5_1","unstructured":"Jianlong Fu Heliang Zheng and Tao Mei. 2017. Look Closer to See Better: Recurrent Attention Convolutional Neural Network for Fine-Grained Image Recognition. In CVPR. 4476--4484.  Jianlong Fu Heliang Zheng and Tao Mei. 2017. Look Closer to See Better: Recurrent Attention Convolutional Neural Network for Fine-Grained Image Recognition. In CVPR. 4476--4484."},{"key":"e_1_3_2_1_6_1","unstructured":"Chuang Gan Tianbao Yang and Boqing Gong. 2016. Learning Attributes Equals Multi-Source Domain Generalization. In CVPR. 87--97.  Chuang Gan Tianbao Yang and Boqing Gong. 2016. Learning Attributes Equals Multi-Source Domain Generalization. In CVPR. 87--97."},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Yu Gao Xintong Han XunWang Weilin Huang and Matthew Scott. 2020. Channel Interaction Networks for Fine-Grained Image Categorization. In AAAI. 10818--10825.  Yu Gao Xintong Han XunWang Weilin Huang and Matthew Scott. 2020. Channel Interaction Networks for Fine-Grained Image Categorization. In AAAI. 10818--10825.","DOI":"10.1609\/aaai.v34i07.6712"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"crossref","unstructured":"Ross B. Girshick Jeff Donahue Trevor Darrell and Jitendra Malik. 2014. Rich Feature Hierarchies for Accurate Object Detection and Semantic Segmentation. In CVPR. 580--587.  Ross B. Girshick Jeff Donahue Trevor Darrell and Jitendra Malik. 2014. Rich Feature Hierarchies for Accurate Object Detection and Semantic Segmentation. In CVPR. 580--587.","DOI":"10.1109\/CVPR.2014.81"},{"key":"e_1_3_2_1_9_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778.  Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Jie Hu Li Shen and Gang Sun. 2018. Squeeze-and-Excitation Networks. In CVPR. 7132--7141.  Jie Hu Li Shen and Gang Sun. 2018. Squeeze-and-Excitation Networks. In CVPR. 7132--7141.","DOI":"10.1109\/CVPR.2018.00745"},{"key":"e_1_3_2_1_11_1","volume-title":"See Better Before Looking Closer: Weakly Supervised Data Augmentation Network for Fine-Grained Visual Classification. CoRR abs\/1901.09891","author":"Hu Tao","year":"2019","unstructured":"Tao Hu and Honggang Qi. 2019. See Better Before Looking Closer: Weakly Supervised Data Augmentation Network for Fine-Grained Visual Classification. CoRR abs\/1901.09891 ( 2019 ). Tao Hu and Honggang Qi. 2019. See Better Before Looking Closer: Weakly Supervised Data Augmentation Network for Fine-Grained Visual Classification. CoRR abs\/1901.09891 (2019)."},{"key":"e_1_3_2_1_12_1","unstructured":"Aditya Khosla Nityananda Jayadevaprakash Bangpeng Yao and Li Fei-Fei. 2011. Novel Dataset for Fine-Grained Image Categorization. In CVPR.  Aditya Khosla Nityananda Jayadevaprakash Bangpeng Yao and Li Fei-Fei. 2011. Novel Dataset for Fine-Grained Image Categorization. In CVPR."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Jonathan Krause Hailin Jin Jianchao Yang and Fei-Fei Li. 2015. Fine-grained recognition without part annotations. In CVPR. 5546--5555.  Jonathan Krause Hailin Jin Jianchao Yang and Fei-Fei Li. 2015. Fine-grained recognition without part annotations. In CVPR. 5546--5555.","DOI":"10.1109\/CVPR.2015.7299194"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Jonathan Krause Michael Stark Jia Deng and Li Fei-Fei. 2013. 3D Object Representations for Fine-Grained Categorization. In ICCV. 554--561.  Jonathan Krause Michael Stark Jia Deng and Li Fei-Fei. 2013. 3D Object Representations for Fine-Grained Categorization. In ICCV. 554--561.","DOI":"10.1109\/ICCVW.2013.77"},{"key":"e_1_3_2_1_15_1","volume-title":"Hinton","author":"Krizhevsky Alex","year":"2012","unstructured":"Alex Krizhevsky , Ilya Sutskever , and Geoffrey E . Hinton . 2012 . ImageNet Classification with Deep Convolutional Neural Networks. In Commun. ACM. 1106--1114. Alex Krizhevsky, Ilya Sutskever, and Geoffrey E. Hinton. 2012. ImageNet Classification with Deep Convolutional Neural Networks. In Commun. ACM. 1106--1114."},{"key":"e_1_3_2_1_16_1","volume-title":"andWei Xu","author":"Li Zhichao","year":"2017","unstructured":"Zhichao Li , Yi Yang , Xiao Liu , Feng Zhou , ShileiWen , andWei Xu . 2017 . Dynamic Computational Time for Visual Attention. In ICCV. 1199--1209. Zhichao Li, Yi Yang, Xiao Liu, Feng Zhou, ShileiWen, andWei Xu. 2017. Dynamic Computational Time for Visual Attention. In ICCV. 1199--1209."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Di Lin Xiaoyong Shen Cewu Lu and Jiaya Jia. 2015. Deep LAC: Deep localization alignment and classification for fine-grained recognition. In CVPR. 1666--1674.  Di Lin Xiaoyong Shen Cewu Lu and Jiaya Jia. 2015. Deep LAC: Deep localization alignment and classification for fine-grained recognition. In CVPR. 1666--1674.","DOI":"10.1109\/CVPR.2015.7298775"},{"key":"e_1_3_2_1_18_1","volume-title":"Aruni Roy Chowdhury, and Subhransu Maji","author":"Lin Tsung-Yu","year":"2015","unstructured":"Tsung-Yu Lin , Aruni Roy Chowdhury, and Subhransu Maji . 2015 . Bilinear CNN Models for Fine-Grained Visual Recognition. In ICCV. 1449--1457. Tsung-Yu Lin, Aruni Roy Chowdhury, and Subhransu Maji. 2015. Bilinear CNN Models for Fine-Grained Visual Recognition. In ICCV. 1449--1457."},{"key":"e_1_3_2_1_19_1","volume-title":"Fully Convolutional Attention Localization Networks: Efficient Attention Localization for Fine-Grained Recognition. CoRR abs\/1603.06765","author":"Liu Xiao","year":"2016","unstructured":"Xiao Liu , Tian Xia , Jiang Wang , and Yuanqing Lin . 2016. Fully Convolutional Attention Localization Networks: Efficient Attention Localization for Fine-Grained Recognition. CoRR abs\/1603.06765 ( 2016 ). Xiao Liu, Tian Xia, Jiang Wang, and Yuanqing Lin. 2016. Fully Convolutional Attention Localization Networks: Efficient Attention Localization for Fine-Grained Recognition. CoRR abs\/1603.06765 (2016)."},{"key":"e_1_3_2_1_20_1","volume-title":"Attention Clusters: Purely Attention Based Local Feature Integration for Video Classification. In CVPR. 7834--7843.","author":"Long Xiang","year":"2018","unstructured":"Xiang Long , Chuang Gan , Gerard de Melo , Jiajun Wu , Xiao Liu , and Shilei Wen . 2018 . Attention Clusters: Purely Attention Based Local Feature Integration for Video Classification. In CVPR. 7834--7843. Xiang Long, Chuang Gan, Gerard de Melo, Jiajun Wu, Xiao Liu, and Shilei Wen. 2018. Attention Clusters: Purely Attention Based Local Feature Integration for Video Classification. In CVPR. 7834--7843."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Wei Luo Xitong Yang Xianjie Mo Yuheng Lu Larry Davis Jun Li Jian Yang and Ser-Nam Lim. 2019. Cross-X Learning for Fine-Grained Visual Categorization. In ICCV. 8241--8250.  Wei Luo Xitong Yang Xianjie Mo Yuheng Lu Larry Davis Jun Li Jian Yang and Ser-Nam Lim. 2019. Cross-X Learning for Fine-Grained Visual Categorization. In ICCV. 8241--8250.","DOI":"10.1109\/ICCV.2019.00833"},{"key":"e_1_3_2_1_22_1","unstructured":"Jinna Lv Wu Liu Meng Zhang He Gong Bin Wu and Huadong Ma. 2017. Multi-feature Fusion for Predicting Social Media Popularity. In ACM Multimedia. 1883--1888.  Jinna Lv Wu Liu Meng Zhang He Gong Bin Wu and Huadong Ma. 2017. Multi-feature Fusion for Predicting Social Media Popularity. In ACM Multimedia. 1883--1888."},{"key":"e_1_3_2_1_23_1","volume-title":"Fine-Grained Visual Classification of Aircraft. CoRR abs\/1306.5151","author":"Maji Subhransu","year":"2013","unstructured":"Subhransu Maji , Esa Rahtu , Juho Kannala , Matthew B. Blaschko , and Andrea Vedaldi . 2013. Fine-Grained Visual Classification of Aircraft. CoRR abs\/1306.5151 ( 2013 ). Subhransu Maji, Esa Rahtu, Juho Kannala, Matthew B. Blaschko, and Andrea Vedaldi. 2013. Fine-Grained Visual Classification of Aircraft. CoRR abs\/1306.5151 (2013)."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"crossref","unstructured":"Amir Rosenfeld and Shimon Ullman. 2016. Visual Concept Recognition and Localization via Iterative Introspection. In ACCV. 264--279.  Amir Rosenfeld and Shimon Ullman. 2016. Visual Concept Recognition and Localization via Iterative Introspection. In ACCV. 264--279.","DOI":"10.1007\/978-3-319-54193-8_17"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Marcel Simon and Erik Rodner. 2015. Neural Activation Constellations: Unsupervised Part Model Discovery with Convolutional Networks. In ICCV. 1143--1151.  Marcel Simon and Erik Rodner. 2015. Neural Activation Constellations: Unsupervised Part Model Discovery with Convolutional Networks. In ICCV. 1143--1151.","DOI":"10.1109\/ICCV.2015.136"},{"key":"e_1_3_2_1_26_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR.  Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2011.2172937"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Ming Sun Yuchen Yuan Feng Zhou and Errui Ding. 2018. Multi-Attention Multi-Class Constraint for Fine-grained Image Recognition. In ECCV. 834--850.  Ming Sun Yuchen Yuan Feng Zhou and Errui Ding. 2018. Multi-Attention Multi-Class Constraint for Fine-grained Image Recognition. In ECCV. 834--850.","DOI":"10.1007\/978-3-030-01270-0_49"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Yu Sun Yun Ye Wu Liu Wenpeng Gao Yili Fu and Tao Mei. 2019. Human Mesh Recovery From Monocular Images via a Skeleton-Disentangled Representation. In ICCV. 5348--5357.  Yu Sun Yun Ye Wu Liu Wenpeng Gao Yili Fu and Tao Mei. 2019. Human Mesh Recovery From Monocular Images via a Skeleton-Disentangled Representation. In ICCV. 5348--5357.","DOI":"10.1109\/ICCV.2019.00545"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Christian Szegedy Wei Liu Yangqing Jia Pierre Sermanet Scott E. Reed Dragomir Anguelov Dumitru Erhan Vincent Vanhoucke and Andrew Rabinovich. 2015. Going deeper with convolutions. In CVPR. 1--9.  Christian Szegedy Wei Liu Yangqing Jia Pierre Sermanet Scott E. Reed Dragomir Anguelov Dumitru Erhan Vincent Vanhoucke and Andrew Rabinovich. 2015. Going deeper with convolutions. In CVPR. 1--9.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"e_1_3_2_1_31_1","unstructured":"C. Wah S. Branson P. Welinder P. Perona and S. Belongie. 2011. The Caltech- UCSD Birds-200--2011 Dataset. Technical Report.  C. Wah S. Branson P. Welinder P. Perona and S. Belongie. 2011. The Caltech- UCSD Birds-200--2011 Dataset. Technical Report."},{"key":"e_1_3_2_1_32_1","volume-title":"Davis","author":"Wang Yaming","year":"2018","unstructured":"Yaming Wang , Vlad I. Morariu , and Larry S . Davis . 2018 . Learning a Discriminative Filter Bank Within a CNN for Fine-Grained Recognition. In CVPR. 4148--4157. Yaming Wang, Vlad I. Morariu, and Larry S. Davis. 2018. Learning a Discriminative Filter Bank Within a CNN for Fine-Grained Recognition. In CVPR. 4148--4157."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Zhihui Wang Shijie Wang Pengbo Zhang Haojie Li Wei Zhong and Jianjun Li. 2019. Weakly Supervised Fine-grained Image Classification via Correlationguided Discriminative Learning. In ACM Multimedia. 1851--1860.  Zhihui Wang Shijie Wang Pengbo Zhang Haojie Li Wei Zhong and Jianjun Li. 2019. Weakly Supervised Fine-grained Image Classification via Correlationguided Discriminative Learning. In ACM Multimedia. 1851--1860.","DOI":"10.1145\/3343031.3350976"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2017.10.002"},{"key":"e_1_3_2_1_35_1","unstructured":"Lingxi Xie Qi Tian Richang Hong Shuicheng Yan and Bo Zhang. 2013. Hierarchical Part Matching for Fine-Grained Visual Categorization. In ICCV. 1641--1648.  Lingxi Xie Qi Tian Richang Hong Shuicheng Yan and Bo Zhang. 2013. Hierarchical Part Matching for Fine-Grained Visual Categorization. In ICCV. 1641--1648."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2941820"},{"key":"e_1_3_2_1_37_1","volume-title":"Shapiro","author":"Yang Shulin","year":"2012","unstructured":"Shulin Yang , Liefeng Bo , Jue Wang , and Linda G . Shapiro . 2012 . Unsupervised Template Learning for Fine-Grained Object Recognition. In NIPS. 3131--3139. Shulin Yang, Liefeng Bo, Jue Wang, and Linda G. Shapiro. 2012. Unsupervised Template Learning for Fine-Grained Object Recognition. In NIPS. 3131--3139."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"crossref","unstructured":"Ze Yang Tiange Luo Dong Wang Zhiqiang Hu Jun Gao and Liwei Wang. 2018. Learning to Navigate for Fine-Grained Classification. In ECCV. 438--454.  Ze Yang Tiange Luo Dong Wang Zhiqiang Hu Jun Gao and Liwei Wang. 2018. Learning to Navigate for Fine-Grained Classification. In ECCV. 438--454.","DOI":"10.1007\/978-3-030-01264-9_26"},{"key":"e_1_3_2_1_39_1","volume-title":"Metaxas","author":"Zhang Han","year":"2016","unstructured":"Han Zhang , Tao Xu , Mohamed Elhoseiny , Xiaolei Huang , Shaoting Zhang , Ahmed M. Elgammal , and Dimitris N . Metaxas . 2016 . SPDA-CNN: Unifying Semantic Part Detection and Abstraction for Fine-Grained Recognition. In CVPR. 1143--1152. Han Zhang, Tao Xu, Mohamed Elhoseiny, Xiaolei Huang, Shaoting Zhang, Ahmed M. Elgammal, and Dimitris N. Metaxas. 2016. SPDA-CNN: Unifying Semantic Part Detection and Abstraction for Fine-Grained Recognition. In CVPR. 1143--1152."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"crossref","unstructured":"Ning Zhang Jeff Donahue Ross B. Girshick and Trevor Darrell. 2014. Part-Based R-CNNs for Fine-Grained Category Detection. In ECCV. 834--849.  Ning Zhang Jeff Donahue Ross B. Girshick and Trevor Darrell. 2014. Part-Based R-CNNs for Fine-Grained Category Detection. In ECCV. 834--849.","DOI":"10.1007\/978-3-319-10590-1_54"}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413883","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413883","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:32:06Z","timestamp":1750195926000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413883"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":40,"alternative-id":["10.1145\/3394171.3413883","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413883","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}