{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,6]],"date-time":"2026-08-06T19:07:30Z","timestamp":1786043250199,"version":"3.56.0"},"reference-count":55,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62471405"],"award-info":[{"award-number":["62471405"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62301451"],"award-info":[{"award-number":["62301451"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62331003"],"award-info":[{"award-number":["62331003"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006683","name":"Xi\u2019an Jiaotong-Liverpool University","doi-asserted-by":"publisher","award":["REF-22-01-010"],"award-info":[{"award-number":["REF-22-01-010"]}],"id":[{"id":"10.13039\/501100006683","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.patcog.2026.113454","type":"journal-article","created":{"date-parts":[[2026,3,10]],"date-time":"2026-03-10T16:43:09Z","timestamp":1773160989000},"page":"113454","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["Unleashing the power of optimal head in CLIP and DINO for weakly supervised semantic segmentation"],"prefix":"10.1016","volume":"178","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-2261-0524","authenticated-orcid":false,"given":"Xianglin","family":"Qiu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-6749-4318","authenticated-orcid":false,"given":"Siyue","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5751-2873","authenticated-orcid":false,"given":"Bingfeng","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-2916-0442","authenticated-orcid":false,"given":"Zhen","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5782-644X","authenticated-orcid":false,"given":"Tammam","family":"Tillo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9416-2486","authenticated-orcid":false,"given":"Jimin","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113454_bib0001","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111540","article-title":"Dynamic feature regularized loss for weakly supervised semantic segmentation","volume":"164","author":"Zhang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113454_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111067","article-title":"Class agnostic and specific consistency learning for weakly-supervised point cloud semantic segmentation","volume":"158","author":"Wu","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113454_bib0003","series-title":"CVPR","article-title":"Box-driven class-wise region masking and filling rate guided loss for weakly supervised semantic segmentation","author":"Song","year":"2019"},{"key":"10.1016\/j.patcog.2026.113454_bib0004","series-title":"CVPR","article-title":"Tree energy loss: towards sparsely annotated semantic segmentation","author":"Liang","year":"2022"},{"issue":"5","key":"10.1016\/j.patcog.2026.113454_bib0005","doi-asserted-by":"crossref","first-page":"4198","DOI":"10.1109\/TPAMI.2025.3543191","article-title":"Frozen CLIP-DINO: a strong backbone for weakly supervised semantic segmentation","volume":"47","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113454_bib0006","series-title":"CVPR","article-title":"Clip is also an efficient segmenter: a text-driven approach for weakly supervised semantic segmentation","author":"Lin","year":"2023"},{"key":"10.1016\/j.patcog.2026.113454_bib0007","series-title":"CVPR","article-title":"Frozen CLIP: a strong backbone for weakly supervised semantic segmentation","author":"Zhang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0008","series-title":"AAAI","article-title":"Multi-view consistent 3D panoptic scene understanding","author":"Liu","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0009","series-title":"CVPR","article-title":"Separate and conquer: decoupling co-occurrence via decomposition and representation for weakly supervised semantic segmentation","author":"Yang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0010","series-title":"ICML","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.113454_bib0011","series-title":"ICCV","article-title":"Emerging properties in self-supervised vision transformers","author":"Caron","year":"2021"},{"key":"10.1016\/j.patcog.2026.113454_bib0012","unstructured":"M. Oquab, T. Darcet, T. Moutakanni, H. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haziza, F. Massa, A. El-Nouby, et al., Dinov2: Learning robust visual features without supervision, (2023). arXiv preprint arXiv: 2304.07193."},{"issue":"8","key":"10.1016\/j.patcog.2026.113454_bib0013","doi-asserted-by":"crossref","first-page":"5398","DOI":"10.1109\/TPAMI.2024.3367952","article-title":"Cross-image pixel contrasting for semantic segmentation","volume":"46","author":"Zhou","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113454_bib0014","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.124023","article-title":"Context-based local-global fusion network for 3D point cloud classification and segmentation","volume":"251","author":"Wu","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.patcog.2026.113454_bib0015","series-title":"CVPR","article-title":"Hunting sparsity: density-guided contrastive learning for semi-supervised semantic segmentation","author":"Wang","year":"2023"},{"key":"10.1016\/j.patcog.2026.113454_bib0016","doi-asserted-by":"crossref","first-page":"6449","DOI":"10.1109\/TMM.2025.3586111","article-title":"Semi-supervised semantic segmentation with multi-constraint consistency learning","volume":"27","author":"Yin","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113454_bib0017","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.120973","article-title":"Semi-supervised semantic segmentation with multi-reliability and multi-level feature augmentation","volume":"233","author":"Yin","year":"2023","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.patcog.2026.113454_bib0018","series-title":"CVPR Workshop","article-title":"Prompt categories cluster for weakly supervised semantic segmentation","author":"Wu","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0019","series-title":"ECCV","article-title":"Knowledge transfer with simulated inter-image erasing for weakly supervised semantic segmentation","author":"Chen","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0020","series-title":"NIPS","article-title":"GMMSeg: Gaussian mixture based generative semantic segmentation models","author":"Liang","year":"2022"},{"key":"10.1016\/j.patcog.2026.113454_bib0021","series-title":"CVPR","article-title":"Multi-class token transformer for weakly supervised semantic segmentation","author":"Xu","year":"2022"},{"key":"10.1016\/j.patcog.2026.113454_bib0022","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111566","article-title":"Class activation map guided level sets for weakly supervised semantic segmentation","volume":"165","author":"Wang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113454_bib0023","series-title":"ICCV","article-title":"Bias-resilient weakly supervised semantic segmentation using normalizing flows","author":"Qiu","year":"2025"},{"issue":"3","key":"10.1016\/j.patcog.2026.113454_bib0024","doi-asserted-by":"crossref","first-page":"1306","DOI":"10.1007\/s11263-024-02244-y","article-title":"2D semantic-guided semantic scene completion","volume":"133","author":"Liu","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113454_bib0025","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110787","article-title":"Enhanced online CAM: single-stage weakly supervised semantic segmentation via collaborative guidance","volume":"156","author":"Zhang","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113454_bib0026","doi-asserted-by":"crossref","first-page":"9111","DOI":"10.1109\/TMM.2025.3613165","article-title":"Tackling ambiguity from perspectives of uncertainty inference and affinity diversification for weakly supervised semantic segmentation","volume":"27","author":"Yang","year":"2025","journal-title":"IEEE Trans. Multimed."},{"issue":"3","key":"10.1016\/j.patcog.2026.113454_bib0027","doi-asserted-by":"crossref","first-page":"1085","DOI":"10.1007\/s11263-024-02224-2","article-title":"WeakCLIP: adapting clip for weakly-supervised semantic segmentation","volume":"133","author":"Zhu","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113454_bib0028","series-title":"ACM MM","article-title":"DINO Is also a semantic guider: exploiting class-aware affinity for weakly supervised semantic segmentation","author":"Wu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0029","series-title":"ECCV","article-title":"SCLIP: rethinking self-attention for dense vision-language inference","author":"Wang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0030","unstructured":"J. Zhou, J. Jiang, Z. Zhu, Improving visual discriminability of CLIP for training-free open-vocabulary semantic segmentation, (2025). arXiv preprint arXiv: 2510.23894."},{"key":"10.1016\/j.patcog.2026.113454_bib0031","series-title":"ICCV","article-title":"Talking to DINO: bridging self-supervised vision backbones with language for open-vocabulary segmentation","author":"Barsellotti","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0032","series-title":"CVPR","article-title":"CorrCLIP: reconstructing patch correlations in clip for open-vocabulary semantic segmentation","author":"Zhang","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0033","doi-asserted-by":"crossref","first-page":"11850","DOI":"10.1109\/TITS.2025.3573781","article-title":"A deep reinforcement learning method for autonomous driving integrating multi-modal fusion","volume":"26.8","author":"Xu","year":"2025","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"issue":"2","key":"10.1016\/j.patcog.2026.113454_bib0034","doi-asserted-by":"crossref","first-page":"1832","DOI":"10.1109\/TITS.2023.3312453","article-title":"Goal-guided transformer-enabled reinforcement learning for efficient autonomous navigation","volume":"25","author":"Huang","year":"2023","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.patcog.2026.113454_bib0035","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2026.131090","article-title":"Frequency-aware and lifting-based efficient transformer for person search","volume":"308","author":"Shu","year":"2026","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.patcog.2026.113454_bib0036","doi-asserted-by":"crossref","first-page":"915","DOI":"10.1109\/TIP.2026.3654373","article-title":"Reliable pseudo-supervision for unsupervised domain adaptive person search","volume":"35","author":"Zhang","year":"2026","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113454_bib0037","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103314","article-title":"Dynamic frequency selection and spatial interaction fusion for robust person search","volume":"124","author":"Zhang","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.patcog.2026.113454_bib0038","series-title":"ICCV","article-title":"Grad-CAM: visual explanations from deep networks via gradient-based localization","author":"Selvaraju","year":"2017"},{"key":"10.1016\/j.patcog.2026.113454_bib0039","series-title":"CVPR","article-title":"Learning affinity from attention: end-to-end weakly-supervised semantic segmentation with transformers","author":"Ru","year":"2022"},{"key":"10.1016\/j.patcog.2026.113454_bib0040","series-title":"CVPR","article-title":"Momentum contrast for unsupervised visual representation learning","author":"He","year":"2020"},{"key":"10.1016\/j.patcog.2026.113454_bib0041","doi-asserted-by":"crossref","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","article-title":"The pascal visual object classes (VOC) challenge","volume":"88","author":"Everingham","year":"2010","journal-title":"IJCV"},{"key":"10.1016\/j.patcog.2026.113454_bib0042","series-title":"ECCV","article-title":"Microsoft COCO: common objects in context","author":"Lin","year":"2014"},{"key":"10.1016\/j.patcog.2026.113454_bib0043","series-title":"CVPR","article-title":"Self-supervised image-specific prototype exploration for weakly supervised semantic segmentation","author":"Chen","year":"2022"},{"key":"10.1016\/j.patcog.2026.113454_bib0044","series-title":"ICCV","article-title":"USAGE: a unified seed area generation paradigm for weakly supervised semantic segmentation","author":"Peng","year":"2023"},{"key":"10.1016\/j.patcog.2026.113454_bib0045","series-title":"CVPR","article-title":"CLIMS: Cross language image matching for weakly supervised semantic segmentation","author":"Xie","year":"2022"},{"key":"10.1016\/j.patcog.2026.113454_bib0046","series-title":"CVPR","article-title":"Hunting attributes: context prototype-aware learning for weakly supervised semantic segmentation","author":"Tang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0047","series-title":"CVPR","article-title":"From sam to cams: exploring segment anything model for weakly supervised semantic segmentation","author":"Kweon","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0048","series-title":"ICCV","article-title":"Segment anything","author":"Kirillov","year":"2023"},{"key":"10.1016\/j.patcog.2026.113454_bib0049","series-title":"CVPR","article-title":"POT: Prototypical optimal transport for weakly supervised semantic segmentation","author":"Wang","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0050","series-title":"AAAI","article-title":"Toward modality gap: vision prototype learning for weakly-supervised semantic segmentation with clip","author":"Xu","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0051","series-title":"AAAI","article-title":"Token contrast for weakly-supervised semantic segmentation","author":"Ru","year":"2023"},{"key":"10.1016\/j.patcog.2026.113454_bib0052","series-title":"CVPR","article-title":"DuPL: dual student with trustworthy progressive learning for robust weakly supervised semantic segmentation","author":"Wu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0053","series-title":"ECCV","article-title":"DIAL: dense image-text ALignment for weakly supervised semantic segmentation","author":"Jang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113454_bib0054","series-title":"CVPR","article-title":"Exploring CLIP\u2019s dense knowledge for weakly supervised semantic segmentation","author":"Yang","year":"2025"},{"key":"10.1016\/j.patcog.2026.113454_bib0055","series-title":"CVPR","article-title":"Your large vision-language model only needs a few attention heads for visual grounding","author":"Kang","year":"2025"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326004206?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326004206?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T16:54:33Z","timestamp":1779382473000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326004206"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":55,"alternative-id":["S0031320326004206"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113454","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Unleashing the power of optimal head in CLIP and DINO for weakly supervised semantic segmentation","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113454","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113454"}}