{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T17:23:03Z","timestamp":1781198583835,"version":"3.54.1"},"reference-count":99,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"1","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100005089","name":"Beijing Natural Science Foundation","doi-asserted-by":"publisher","award":["JQ23014"],"award-info":[{"award-number":["JQ23014"]}],"id":[{"id":"10.13039\/501100005089","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100009950","name":"Science and Disruptive Technology Program, Aerospace Information Research Institute Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["E2Z218020F"],"award-info":[{"award-number":["E2Z218020F"]}],"id":[{"id":"10.13039\/501100009950","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62271074"],"award-info":[{"award-number":["62271074"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62071157"],"award-info":[{"award-number":["62071157"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62302052"],"award-info":[{"award-number":["62302052"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62171321"],"award-info":[{"award-number":["62171321"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62162044"],"award-info":[{"award-number":["62162044"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2025,1]]},"DOI":"10.1109\/tcsvt.2024.3454227","type":"journal-article","created":{"date-parts":[[2024,9,4]],"date-time":"2024-09-04T18:32:43Z","timestamp":1725474763000},"page":"520-533","source":"Crossref","is-referenced-by-count":7,"title":["Generalization Boosted Adapter for Open-Vocabulary Segmentation"],"prefix":"10.1109","volume":"35","author":[{"given":"Wenhao","family":"Xu","sequence":"first","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8259-7717","authenticated-orcid":false,"given":"Changwei","family":"Wang","sequence":"additional","affiliation":[{"name":"Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xuxiang","family":"Feng","sequence":"additional","affiliation":[{"name":"Chinese Academy of Sciences, Aerospace Information Research Institute, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4619-9679","authenticated-orcid":false,"given":"Rongtao","family":"Xu","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Longzhao","family":"Huang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zherui","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9723-3294","authenticated-orcid":false,"given":"Li","family":"Guo","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4037-9900","authenticated-orcid":false,"given":"Shibiao","family":"Xu","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i3.25408"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3267891"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/jbhi.2024.3417247"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2024.3380196"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2023.3306572"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2024.102493"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3260240"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-87193-2_48"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3267127"},{"key":"ref11","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","volume":"139","author":"Jia"},{"key":"ref12","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","volume":"139","author":"Radford"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00324"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.346"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00514"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28456"},{"key":"ref17","article-title":"Tip-adapter: Training-free CLIP-adapter for better vision-language modeling","author":"Zhang","year":"2021","journal-title":"arXiv:2111.03930"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-023-01891-x"},{"issue":"9","key":"ref19","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3245584"},{"key":"ref21","first-page":"6171","article-title":"Learning style-invariant robust representation for generalizable visual instance retrieval","volume-title":"Proc. 31st ACM Int. Conf. Multimedia","author":"Chang"},{"key":"ref22","first-page":"43579","article-title":"FD-align: Feature discrimination alignment for fine-tuning pre-trained models in few-shot learning","volume-title":"Proc. NeurIPS","author":"Song"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_7"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"ref25","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref26","article-title":"An image is worth 16 \u00d7 16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv:2010.11929"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00858"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.079"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1145\/3583780.3615075"},{"key":"ref30","article-title":"VisualBERT: A simple and performant baseline for vision and language","author":"Harold Li","year":"2019","journal-title":"arXiv:1908.03557"},{"issue":"8","key":"ref31","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI Blog"},{"key":"ref32","article-title":"REALM: Retrieval-augmented language model pre-training","author":"Guu","year":"2020","journal-title":"arXiv:2002.08909"},{"key":"ref33","first-page":"16795","article-title":"Conditional prompt learning for vision-language models","volume-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","author":"Zhou"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-023-01891-x"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW60793.2023.00361"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00288"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/j.engappai.2022.104739"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3169331"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2024.102344"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3282956"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2020.3015866"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2023.3238648"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1016\/j.engappai.2023.106402"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICME57554.2024.10687431"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00076"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3236432"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2020.3010293"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01129"},{"key":"ref49","first-page":"736","article-title":"A simple baseline for zero-shot semantic segmentation with pre-trained vision-language model","volume-title":"Proc. ECCV","author":"Xu"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00845"},{"key":"ref51","first-page":"468","article-title":"Zero-shot semantic segmentation","volume-title":"Proc. NeurIPS","author":"Bucher"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00303"},{"key":"ref53","first-page":"1","article-title":"Language-driven semantic segmentation","volume-title":"Proc. ICLR","author":"Li"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00689"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00682"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19815-1_40"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19818-2_42"},{"key":"ref58","article-title":"Open-vocabulary universal image segmentation with MaskCLIP","author":"Ding","year":"2022","journal-title":"arXiv:2208.08984"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00289"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01863"},{"key":"ref61","article-title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional CLIP","author":"Yu","year":"2023","journal-title":"arXiv:2308.02487"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.322"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00963"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"ref65","article-title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","author":"Ioffe","year":"2015","journal-title":"arXiv:1502.03167"},{"key":"ref66","article-title":"Layer normalization","author":"Lei Ba","year":"2016","journal-title":"arXiv:1607.06450"},{"key":"ref67","article-title":"Instance normalization: The missing ingredient for fast stylization","author":"Ulyanov","year":"2016","journal-title":"arXiv:1607.08022"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00321"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_29"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00051"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01133"},{"key":"ref72","first-page":"4124","article-title":"FFM: Injecting out-of-domain knowledge via factorized frequency modification","volume-title":"Proc. IEEE\/CVF Winter Conf. Appl. Comput. Vis. (WACV)","author":"Wang"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20053-3_1"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLC.2005.1527751"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/ICIEA.2009.5138708"},{"key":"ref76","first-page":"25278","article-title":"LAION-5B: An open large-scale dataset for training next generation image-text models","volume-title":"Proc. NeurIPS","author":"Schuhmann"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_31"},{"key":"ref78","article-title":"Adam: A method for stochastic optimization","volume-title":"Proc. ICLR","author":"Kingma"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.544"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0275-4"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00305"},{"key":"ref83","article-title":"Unsupervised universal image segmentation","author":"Niu","year":"2023","journal-title":"arXiv:2312.17243"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01760"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01074"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00287"},{"key":"ref87","first-page":"23033","article-title":"SegCLIP: Patch aggregation with learnable centers for open-vocabulary semantic segmentation","volume-title":"Proc. ICML","author":"Luo"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00513"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00116"},{"key":"ref90","article-title":"SAM-CLIP: Merging vision foundation models towards semantic and spatial understanding","author":"Wang","year":"2023","journal-title":"arXiv:2310.15308"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01451"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00100"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.119"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01075"},{"key":"ref95","first-page":"8090","article-title":"Open-vocabulary universal image segmentation with MaskCLIP","volume-title":"Proc. ICML","author":"Ding"},{"key":"ref96","article-title":"What a MESS: Multi-domain evaluation of zero-shot semantic segmentation","author":"Blumenstiel","year":"2023","journal-title":"arXiv:2306.15521"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00271"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2022.06.008"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2020.05.009"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/76\/10857816\/10664543.pdf?arnumber=10664543","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,30]],"date-time":"2025-01-30T19:25:13Z","timestamp":1738265113000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10664543\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1]]},"references-count":99,"journal-issue":{"issue":"1"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2024.3454227","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1]]}}}