{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,21]],"date-time":"2026-01-21T12:03:25Z","timestamp":1768997005807,"version":"3.49.0"},"publisher-location":"New York, NY, USA","reference-count":55,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2021YFC3300200"],"award-info":[{"award-number":["2021YFC3300200"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Research Foundation Singapore and DSO National Laboratories under the AI Singapore Programme","award":["AISG2-GC-2023-006"],"award-info":[{"award-number":["AISG2-GC-2023-006"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62276195, 62141112, 62225113"],"award-info":[{"award-number":["62276195, 62141112, 62225113"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Special Fund of Hubei Luojia Laboratory","award":["220100014"],"award-info":[{"award-number":["220100014"]}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["2042023kf1033"],"award-info":[{"award-number":["2042023kf1033"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3611959","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:40Z","timestamp":1698391660000},"page":"5484-5494","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":8,"title":["Rethinking the Localization in Weakly Supervised Object Localization"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0737-5214","authenticated-orcid":false,"given":"Rui","family":"Xu","sequence":"first","affiliation":[{"name":"Wuhan University, Wuhan, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2296-6370","authenticated-orcid":false,"given":"Yong","family":"Luo","sequence":"additional","affiliation":[{"name":"Wuhan University &amp; Hubei Luojia Laboratory, Wuhan, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7532-0496","authenticated-orcid":false,"given":"Han","family":"Hu","sequence":"additional","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0059-8458","authenticated-orcid":false,"given":"Bo","family":"Du","sequence":"additional","affiliation":[{"name":"Wuhan University &amp; Hubei Luojia Laboratory, Wuhan, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4560-8509","authenticated-orcid":false,"given":"Jialie","family":"Shen","sequence":"additional","affiliation":[{"name":"City, University of London, London, United Kingdom"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2751-5114","authenticated-orcid":false,"given":"Yonggang","family":"Wen","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Kyungjune Baek Minhyun Lee and Hyunjung Shim. 2020. PsyNet: Self-Supervised Approach to Object Localization Using Point Symmetric Transformation. In AAAI. 10451--10459.","DOI":"10.1609\/aaai.v34i07.6615"},{"key":"e_1_3_2_1_2_1","unstructured":"David Berthelot Nicholas Carlini Ian J. Goodfellow Nicolas Papernot Avital Oliver and Colin Raffel. 2019. MixMatch: A Holistic Approach to Semi-Supervised Learning. In NIPS. 5050--5060."},{"key":"e_1_3_2_1_3_1","first-page":"213","article-title":"End-to-End Object Detection with Transformers","volume":"12346","author":"Carion Nicolas","year":"2020","unstructured":"Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, and Sergey Zagoruyko. 2020. End-to-End Object Detection with Transformers. In ECCV, Vol. 12346. 213--229.","journal-title":"ECCV"},{"key":"e_1_3_2_1_4_1","unstructured":"Micka\u00ebl Chen Thierry Arti\u00e8res and Ludovic Denoyer. 2019. Unsupervised Object Segmentation by Redrawing. In NIPS. 12705--12716."},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Minsu Cho Suha Kwak Cordelia Schmid and Jean Ponce. 2015. Unsupervised object discovery and localization in the wild: Part-based matching with bottom-up region proposals. In CVPR. 1201--1210.","DOI":"10.1109\/CVPR.2015.7298724"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Junsuk Choe and Hyunjung Shim. 2019. Attention-Based Dropout Layer for Weakly Supervised Object Localization. In CVPR. 2219--2228.","DOI":"10.1109\/CVPR.2019.00232"},{"key":"e_1_3_2_1_7_1","volume-title":"Dynamic DETR: End-to-End Object Detection with Dynamic Attention","author":"Dai Xiyang","unstructured":"Xiyang Dai, Yinpeng Chen, Jianwei Yang, Pengchuan Zhang, Lu Yuan, and Lei Zhang. 2021. Dynamic DETR: End-to-End Object Detection with Dynamic Attention. In ICCV. IEEE, 2968--2977."},{"key":"e_1_3_2_1_8_1","unstructured":"Guneet Singh Dhillon Pratik Chaudhari Avinash Ravichandran and Stefano Soatto. 2020. A Baseline for Few-Shot Image Classification. In ICLR."},{"key":"e_1_3_2_1_9_1","unstructured":"Yves Grandvalet and Yoshua Bengio. 2004. Semi-supervised Learning by Entropy Minimization. In NIPS. 529--536."},{"key":"e_1_3_2_1_10_1","unstructured":"Guangyu Guo Junwei Han Fang Wan and Dingwen Zhang. 2021. Strengthen Learning Tolerance for Weakly Supervised Object Localization. In CVPR. 7403--7412."},{"key":"e_1_3_2_1_11_1","volume-title":"Girshick","author":"He Kaiming","year":"2020","unstructured":"Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, and Ross B. Girshick. 2020. Momentum Contrast for Unsupervised Visual Representation Learning. In CVPR. 9726--9735."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_1_13_1","volume-title":"Weinberger","author":"Huang Gao","year":"2017","unstructured":"Gao Huang, Zhuang Liu, Laurens van der Maaten, and Kilian Q. Weinberger. 2017. Densely Connected Convolutional Networks. In CVPR. 2261--2269."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.3002345"},{"key":"e_1_3_2_1_15_1","first-page":"765","article-title":"CornerNet: Detecting Objects as Paired Keypoints","volume":"11218","author":"Law Hei","year":"2018","unstructured":"Hei Law and Jia Deng. 2018. CornerNet: Detecting Objects as Paired Keypoints. In ECCV, Vol. 11218. 765--781.","journal-title":"ECCV"},{"key":"e_1_3_2_1_16_1","first-page":"8602","article-title":"Source Data-Absent Unsupervised Domain Adaptation Through Hypothesis Transfer and Labeling Transfer","volume":"44","author":"Liang Jian","year":"2022","unstructured":"Jian Liang, Dapeng Hu, Yunbo Wang, Ran He, and Jiashi Feng. 2022. Source Data-Absent Unsupervised Domain Adaptation Through Hypothesis Transfer and Labeling Transfer. IEEE Trans. Pattern Anal. Mach. Intell., Vol. 44, 11 (2022), 8602--8617.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_2_1_17_1","unstructured":"Tsung-Yi Lin Priya Goyal Ross B. Girshick Kaiming He and Piotr Doll\u00e1r. 2017. Focal Loss for Dense Object Detection. In ICCV. 2999--3007."},{"key":"e_1_3_2_1_18_1","unstructured":"Yen-Cheng Liu Chih-Yao Ma Zijian He Chia-Wen Kuo Kan Chen Peizhao Zhang Bichen Wu Zsolt Kira and Peter Vajda. 2021. Unbiased Teacher for Semi-Supervised Object Detection. In ICLR."},{"key":"e_1_3_2_1_19_1","first-page":"481","article-title":"Geometry Constrained Weakly Supervised Object Localization","volume":"12371","author":"Lu Weizeng","year":"2020","unstructured":"Weizeng Lu, Xi Jia, Weicheng Xie, Linlin Shen, Yicong Zhou, and Jinming Duan. 2020. Geometry Constrained Weakly Supervised Object Localization. In ECCV, Vol. 12371. 481--496.","journal-title":"ECCV"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"crossref","unstructured":"Meng Meng Tianzhu Zhang Qi Tian Yongdong Zhang and Feng Wu. 2021. Foreground Activation Maps for Weakly Supervised Object Localization. In ICCV. 3365--3375.","DOI":"10.1109\/ICCV48922.2021.00337"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.2981890"},{"key":"e_1_3_2_1_22_1","unstructured":"Xingjia Pan Yingguo Gao Zhiwen Lin Fan Tang Weiming Dong Haolei Yuan Feiyue Huang and Changsheng Xu. 2021. Unveiling the Potential of Structure Preserving for Weakly Supervised Object Localization. In CVPR. 11642--11651."},{"key":"e_1_3_2_1_23_1","unstructured":"Shaoqing Ren Kaiming He Ross B. Girshick and Jian Sun. 2015. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. In NIPS. 91--99."},{"key":"e_1_3_2_1_24_1","unstructured":"Byungseok Roh Jaewoong Shin Wuhyun Shin and Saehoon Kim. 2022. Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity. In ICLR."},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"e_1_3_2_1_26_1","unstructured":"Pierre Sermanet David Eigen Xiang Zhang Micha\u00ebl Mathieu Rob Fergus and Yann LeCun. 2014. OverFeat: Integrated Recognition Localization and Detection using Convolutional Networks. In ICLR."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1002\/j.1538-7305.1948.tb01338.x"},{"key":"e_1_3_2_1_28_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR."},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Yukun Su Guosheng Lin Yun Hao Yiwen Cao Wenjun Wang and Qingyao Wu. 2022. Self-Supervised Object Localization with Joint Graph Partition. In AAAI. 2289--2297.","DOI":"10.1609\/aaai.v36i2.20127"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Peize Sun Rufeng Zhang Yi Jiang Tao Kong Chenfeng Xu Wei Zhan Masayoshi Tomizuka Lei Li Zehuan Yuan Changhu Wang and Ping Luo. 2021. Sparse R-CNN: End-to-End Object Detection With Learnable Proposals. In CVPR. 14454--14463.","DOI":"10.1109\/CVPR46437.2021.01422"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"crossref","unstructured":"Christian Szegedy Wei Liu Yangqing Jia Pierre Sermanet Scott E. Reed Dragomir Anguelov Dumitru Erhan Vincent Vanhoucke and Andrew Rabinovich. 2015. Going deeper with convolutions. In CVPR. 1--9.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Christian Szegedy Vincent Vanhoucke Sergey Ioffe Jonathon Shlens and Zbigniew Wojna. 2016. Rethinking the Inception Architecture for Computer Vision. In CVPR. 2818--2826.","DOI":"10.1109\/CVPR.2016.308"},{"key":"e_1_3_2_1_33_1","first-page":"6105","article-title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","volume":"97","author":"Tan Mingxing","year":"2019","unstructured":"Mingxing Tan and Quoc V. Le. 2019. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks. In ICML, Vol. 97. 6105--6114.","journal-title":"ICML"},{"key":"e_1_3_2_1_34_1","volume-title":"FCOS: Fully Convolutional One-Stage Object Detection. In ICCV. 9626--9635.","author":"Tian Zhi","year":"2019","unstructured":"Zhi Tian, Chunhua Shen, Hao Chen, and Tong He. 2019. FCOS: Fully Convolutional One-Stage Object Detection. In ICCV. 9626--9635."},{"key":"e_1_3_2_1_35_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NIPS. 5998--6008."},{"key":"e_1_3_2_1_36_1","volume-title":"Technical Report CNS-TR-2011-001. California Institute of Technology.","author":"Wah C.","year":"2011","unstructured":"C. Wah, S. Branson, P. Welinder, P. Perona, and S. Belongie. 2011. The Caltech-UCSD Birds-200-2011 Dataset. Technical Report CNS-TR-2011-001. California Institute of Technology."},{"key":"e_1_3_2_1_37_1","volume-title":"Tent: Fully Test-Time Adaptation by Entropy Minimization. In ICLR.","author":"Wang Dequan","year":"2021","unstructured":"Dequan Wang, Evan Shelhamer, Shaoteng Liu, Bruno A. Olshausen, and Trevor Darrell. 2021a. Tent: Fully Test-Time Adaptation by Entropy Minimization. In ICLR."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"crossref","unstructured":"Yunke Wang Chang Xu and Bo Du. 2021b. Robust Adversarial Imitation Learning via Adaptively-Selected Demonstrations. In IJCAI. 3155--3161.","DOI":"10.24963\/ijcai.2021\/434"},{"key":"e_1_3_2_1_39_1","volume-title":"Detecting Everything in the Open World: Towards Universal Object Detection. CoRR","author":"Wang Zhenyu","year":"2023","unstructured":"Zhenyu Wang, Yali Li, Xi Chen, Ser-Nam Lim, Antonio Torralba, Hengshuang Zhao, and Shengjin Wang. 2023. Detecting Everything in the Open World: Towards Universal Object Detection. CoRR, Vol. abs\/2303.11749 (2023)."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2688133"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2018.10.022"},{"key":"e_1_3_2_1_42_1","unstructured":"Pingyu Wu Wei Zhai and Yang Cao. 2022. Background Activation Suppression for Weakly Supervised Object Localization. In CVPR. 14228--14237."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"crossref","unstructured":"Jinheng Xie Cheng Luo Xiangping Zhu Ziqi Jin Weizeng Lu and Linlin Shen. 2021. Online Refinement of Low-level Feature Based Activation Map for Weakly Supervised Object Localization. In ICCV. 132--141.","DOI":"10.1109\/ICCV48922.2021.00020"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Jinheng Xie Jianfeng Xiang Junliang Chen Xianxu Hou Xiaodong Zhao and Linlin Shen. 2022. C(2) AM: Contrastive learning of Class-agnostic Activation Map for Weakly Supervised Object Localization and Semantic Segmentation. In CVPR. 979--988.","DOI":"10.1109\/CVPR52688.2022.00106"},{"key":"e_1_3_2_1_45_1","unstructured":"Chang Xu Dacheng Tao and Chao Xu. 2015. Multi-view Self-Paced Learning for Clustering. In IJCAI. 3974--3980."},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Jingyuan Xu Hongtao Xie Chuanbin Liu and Yongdong Zhang. 2022b. Proxy Probing Decoder for Weakly Supervised Object Localization: A Baseline Investigation. In ACM MM. 4185--4193.","DOI":"10.1145\/3503161.3547945"},{"key":"e_1_3_2_1_47_1","first-page":"664","article-title":"LSSANet: A Long Short Slice-Aware Network for Pulmonary Nodule Detection","volume":"13431","author":"Xu Rui","year":"2022","unstructured":"Rui Xu, Yong Luo, Bo Du, Kaiming Kuang, and Jiancheng Yang. 2022a. LSSANet: A Long Short Slice-Aware Network for Pulmonary Nodule Detection. In MICCAI, Vol. 13431. 664--674.","journal-title":"MICCAI"},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Chen-Lin Zhang Yun-Hao Cao and Jianxin Wu. 2020a. Rethinking the Route Towards Weakly Supervised Object Localization. In CVPR. 13457--13466.","DOI":"10.1109\/CVPR42600.2020.01347"},{"key":"e_1_3_2_1_49_1","volume-title":"Hartley","author":"Zhang Jing","year":"2018","unstructured":"Jing Zhang, Tong Zhang, Yuchao Dai, Mehrtash Harandi, and Richard I. Hartley. 2018. Deep Unsupervised Saliency Detection: A Multiple Noisy Labeling Perspective. In CVPR. 9029--9038."},{"key":"e_1_3_2_1_50_1","volume-title":"Mining Objects: Fully Unsupervised Object Discovery and Localization From a Single Image. CoRR","author":"Zhang Runsheng","year":"2019","unstructured":"Runsheng Zhang, Yaping Huang, Mengyang Pu, Qingji Guan, Jian Zhang, and Qi Zou. 2019. Mining Objects: Fully Unsupervised Object Discovery and Localization From a Single Image. CoRR, Vol. abs\/1902.09968 (2019)."},{"key":"e_1_3_2_1_51_1","volume-title":"Li","author":"Zhang Shifeng","year":"2020","unstructured":"Shifeng Zhang, Cheng Chi, Yongqiang Yao, Zhen Lei, and Stan Z. Li. 2020b. Bridging the Gap Between Anchor-Based and Anchor-Free Detection via Adaptive Training Sample Selection. In CVPR. 9756--9765."},{"key":"e_1_3_2_1_52_1","first-page":"271","article-title":"Inter-Image Communication for Weakly Supervised Localization","volume":"12364","author":"Zhang Xiaolin","year":"2020","unstructured":"Xiaolin Zhang, Yunchao Wei, and Yi Yang. 2020c. Inter-Image Communication for Weakly Supervised Localization. In ECCV, Vol. 12364. 271--287.","journal-title":"ECCV"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"crossref","unstructured":"Nanxuan Zhao Zhirong Wu Rynson W. H. Lau and Stephen Lin. 2021. Distilling Localization for Self-Supervised Representation Learning. In AAAI. 10990--10998.","DOI":"10.1609\/aaai.v35i12.17312"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"crossref","unstructured":"Bolei Zhou Aditya Khosla \u00c0gata Lapedriza Aude Oliva and Antonio Torralba. 2016. Learning Deep Features for Discriminative Localization. In CVPR. 2921--2929.","DOI":"10.1109\/CVPR.2016.319"},{"key":"e_1_3_2_1_55_1","unstructured":"Xizhou Zhu Weijie Su Lewei Lu Bin Li Xiaogang Wang and Jifeng Dai. 2021. Deformable DETR: Deformable Transformers for End-to-End Object Detection. In ICLR."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","location":"Ottawa ON Canada","acronym":"MM '23","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611959","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3611959","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:07:29Z","timestamp":1755821249000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611959"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":55,"alternative-id":["10.1145\/3581783.3611959","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3611959","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}