{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T17:03:32Z","timestamp":1784567012660,"version":"3.55.0"},"reference-count":64,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T00:00:00Z","timestamp":1779321600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T00:00:00Z","timestamp":1779321600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s11263-026-02844-w","type":"journal-article","created":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T13:51:14Z","timestamp":1779371474000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Open-Tag: A Generative Framework for Open-World Multimodal Tagging"],"prefix":"10.1007","volume":"134","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5937-183X","authenticated-orcid":false,"given":"Ziqi","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zongyang","family":"Ma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Peijin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bing","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chunfeng","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weiming","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,5,21]]},"reference":[{"key":"2844_CR1","unstructured":"Bai, S., Chen, K., Liu, X., Wang, J., Ge, W., Song, S., Dang, K., Wang, P., Wang, S., Tang, J., et\u00a0al. (2025). Qwen2. 5-vl technical report. arXiv:2502.13923."},{"key":"2844_CR2","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. In: 16th European Conference Computer Vision, pp. 213\u2013229.","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"2844_CR3","doi-asserted-by":"crossref","unstructured":"Chen, S.-F., Chen, Y.-C., Yeh, C.-K., & Wang, Y.-C.F. (2018). Order-free rnn with visual attention for multi-label classification. In: Thirty-Second AAAI Conference on Artificial Intelligence.","DOI":"10.1609\/aaai.v32i1.12230"},{"key":"2844_CR4","doi-asserted-by":"crossref","unstructured":"Chen, W., Hu, H., Chen, X., Verga, P., & Cohen, W.W. (2022). Murag: Multimodal retrieval-augmented generator for open question answering over images and text. In: Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, pp. 5558\u20135570.","DOI":"10.18653\/v1\/2022.emnlp-main.375"},{"key":"2844_CR5","doi-asserted-by":"crossref","unstructured":"Chen, Y., Hu, H., Luan, Y., Sun, H., Changpinyo, S., Ritter, A., & Chang, M. (2023). Can pre-trained vision and language models answer visual information-seeking questions? In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pp. 14948\u201314968.","DOI":"10.18653\/v1\/2023.emnlp-main.925"},{"key":"2844_CR6","doi-asserted-by":"crossref","unstructured":"Chen, T., Xu, M., Hui, X., Wu, H., & Lin, L. (2019). Learning semantic-specific graph representation for multi-label image recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 522\u2013531.","DOI":"10.1109\/ICCV.2019.00061"},{"key":"2844_CR7","doi-asserted-by":"crossref","unstructured":"Chen, T., Xu, M., Hui, X., Wu, H., & Lin, L. (2019). Learning semantic-specific graph representation for multi-label image recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 522\u2013531.","DOI":"10.1109\/ICCV.2019.00061"},{"key":"2844_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, X., Lin, H., Wu, X., Yang, F., Shen, D., Wang, Z., Shi, N., & Liu, H. (2021). Mltr: Multi-label classification with transformer. arXiv:2106.06195.","DOI":"10.1109\/ICME52920.2022.9860016"},{"key":"2844_CR9","doi-asserted-by":"crossref","unstructured":"Chua, T.-S., Tang, J., Hong, R., Li, H., Luo, Z., & Zheng, Y. (2009). Nus-wide: a real-world web image database from national university of singapore. In: Proceedings of the ACM International Conference on Image and Video Retrieval, pp. 1\u20139.","DOI":"10.1145\/1646396.1646452"},{"key":"2844_CR10","unstructured":"Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2018). Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv:1810.04805."},{"key":"2844_CR11","unstructured":"Guu, K., Lee, K., Tung, Z., Pasupat, P., & Chang, M. (2020). REALM: retrieval-augmented language model pre-training. CoRR abs\/2002.08909."},{"key":"2844_CR12","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"2844_CR13","doi-asserted-by":"crossref","unstructured":"Heilbron, F.C., Escorcia, V., Ghanem, B., & Niebles, J.C. (2015). Activitynet: A large-scale video benchmark for human activity understanding. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 961\u2013970.","DOI":"10.1109\/CVPR.2015.7298698"},{"issue":"8","key":"2844_CR14","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Comput., 9(8), 1735\u20131780.","journal-title":"Neural Comput."},{"key":"2844_CR15","unstructured":"Huang, T., Chu, J., & Wei, F. (2022). Unsupervised prompt learning for vision-language models. arXiv:2204.03649."},{"key":"2844_CR16","unstructured":"Huang, X., Huang, Y.-J., Zhang, Y., Tian, W., Feng, R., Zhang, Y., Xie, Y., Li, Y., & Zhang, L. (2023). Open-set image tagging with multi-grained text supervision. arXiv:2310.15200."},{"key":"2844_CR17","unstructured":"Huang, X., Zhang, Y., Ma, J., Tian, W., Feng, R., Zhang, Y., Li, Y., Guo, Y., & Zhang, L. (2024). Tag2text: Guiding vision-language model via image tagging. In: The Twelfth International Conference on Learning Representations, ICLR."},{"key":"2844_CR18","doi-asserted-by":"crossref","unstructured":"Izacard, G., & Grave, E. (2021). Leveraging passage retrieval with generative models for open domain question answering. In: Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics, pp. 874\u2013880.","DOI":"10.18653\/v1\/2021.eacl-main.74"},{"key":"2844_CR19","unstructured":"Jia, C., Yang, Y., Xia, Y., Chen, Y.-T., Parekh, Z., Pham, H., Le, Q., Sung, Y.-H., Li, Z., & Duerig, T. (2021). Scaling up visual and vision-language representation learning with noisy text supervision. In: International Conference on Machine Learning, pp. 4904\u20134916."},{"key":"2844_CR20","unstructured":"Jiang, Y.-G., Liu, J., Zamir, A.R., Toderici, G., Laptev, I., Shah, M., & Sukthankar, R. (2014). THUMOS challenge: Action recognition with a large number of classes."},{"key":"2844_CR21","doi-asserted-by":"crossref","unstructured":"Jin, J., & Nakayama, H. (2016). Annotation order matters: Recurrent image annotator for arbitrary length image tagging. In: 2016 23rd International Conference on Pattern Recognition (ICPR), pp. 2452\u20132457.","DOI":"10.1109\/ICPR.2016.7900004"},{"key":"2844_CR22","doi-asserted-by":"crossref","unstructured":"Karpukhin, V., Oguz, B., Min, S., Lewis, P.S.H., Wu, L., Edunov, S., Chen, D., & Yih, W. (2020). Dense passage retrieval for open-domain question answering. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing, pp. 6769\u20136781","DOI":"10.18653\/v1\/2020.emnlp-main.550"},{"key":"2844_CR23","unstructured":"Kipf, T. N., & Welling, M. (2017). Semi-supervised classification with graph convolutional networks. In: International Conference on Learning Representations (ICLR)."},{"key":"2844_CR24","unstructured":"Kuznetsova, A., Rom, H., Alldrin, N., Uijlings, J.R.R., Krasin, I., Pont-Tuset, J., Kamali, S., Popov, S., Malloci, M., Duerig, T., & Ferrari, V. (2018). The open images dataset V4: unified image classification, object detection, and visual relationship detection at scale. CoRR arXiv:1811.00982."},{"key":"2844_CR25","doi-asserted-by":"crossref","unstructured":"Lanchantin, J., Wang, T., Ordonez, V., & Qi, Y. (2021). General multi-label image classification with transformers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 16478\u201316488.","DOI":"10.1109\/CVPR46437.2021.01621"},{"key":"2844_CR26","doi-asserted-by":"crossref","unstructured":"Lee, K., Chang, M., & Toutanova, K. (2019). Latent retrieval for weakly supervised open domain question answering. In: Proceedings of the 57th Conference of the Association for Computational Linguistics, pp. 6086\u20136096.","DOI":"10.18653\/v1\/P19-1612"},{"key":"2844_CR27","unstructured":"Lewis, P.S.H., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., K\u00fcttler, H., Lewis, M., Yih, W., Rockt\u00e4schel, T., Riedel, S., & Kiela, D. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. In: Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems."},{"key":"2844_CR28","doi-asserted-by":"crossref","unstructured":"Li, Y., Huang, C., Loy, C.C., & Tang, X. (2016). Human attribute recognition by deep hierarchical contexts. In: 14th European Conference Computer Vision, pp. 684\u2013700.","DOI":"10.1007\/978-3-319-46466-4_41"},{"key":"2844_CR29","unstructured":"Li, B., Zhang, Y., Guo, D., Zhang, R., Li, F., Zhang, H., Zhang, K., Zhang, P., Li, Y., Liu, Z., et\u00a0al. (2024). Llava-onevision: Easy visual task transfer. arXiv:2408.03326."},{"key":"2844_CR30","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C.L. (2014). Microsoft coco: Common objects in context. In: 13th European Conference Computer Vision, pp. 740\u2013755.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2844_CR31","doi-asserted-by":"crossref","unstructured":"Liu, F., Xiang, T., Hospedales, T.M., Yang, W., & Sun, C. (2017). Semantic regularisation for recurrent image annotation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2872\u20132880.","DOI":"10.1109\/CVPR.2017.443"},{"key":"2844_CR32","unstructured":"Liu, S., Zhang, L., Yang, X., Su, H., & Zhu, J. (2021). Query2Label: A Simple Transformer Way to Multi-Label Classification."},{"key":"2844_CR33","doi-asserted-by":"crossref","unstructured":"Liu, X., Zhao, H., Tian, M., Sheng, L., Shao, J., Yi, S., Yan, J., & Wang, X. (2017). Hydraplus-net: Attentive deep features for pedestrian analysis. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 350\u2013359.","DOI":"10.1109\/ICCV.2017.46"},{"key":"2844_CR34","unstructured":"Loshchilov, I., & Hutter, F. (2017). Decoupled weight decay regularization. arXiv:1711.05101."},{"key":"2844_CR35","doi-asserted-by":"crossref","unstructured":"Lu, H., Fei, N., Huo, Y., Gao, Y., Lu, Z., & Wen, J.-R. (2022). Cots: Collaborative two-stream vision-language pre-training model for cross-modal retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15692\u201315701 .","DOI":"10.1109\/CVPR52688.2022.01524"},{"key":"2844_CR36","doi-asserted-by":"crossref","unstructured":"Ma, Z., Zhang, Z., Chen, Y., Qi, Z., Luo, Y., Li, Z., Yuan, C., Li, B., Qie, X., Shan, Y., & Hu, W. (2023). Order-prompted tag sequence generation for video tagging. In: IEEE\/CVF International Conference on Computer Vision, pp. 15635\u201315644.","DOI":"10.1109\/ICCV51070.2023.01437"},{"key":"2844_CR37","unstructured":"Oord, A.v.d., Li, Y., & Vinyals, O. (2018). Representation learning with contrastive predictive coding. arXiv:1807.03748."},{"key":"2844_CR38","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et\u00a0al. (2021). Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp. 8748\u20138763."},{"key":"2844_CR39","doi-asserted-by":"crossref","unstructured":"Ramos, R., Elliott, D., & Martins, B. (2023). Retrieval-augmented image captioning. In: Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics, pp. 3648\u20133663.","DOI":"10.18653\/v1\/2023.eacl-main.266"},{"key":"2844_CR40","doi-asserted-by":"crossref","unstructured":"Ramos, R., Martins, B., Elliott, D., & Kementchedjhieva, Y. (2023). Smallcap: Lightweight image captioning prompted with retrieval augmentation. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2840\u20132849.","DOI":"10.1109\/CVPR52729.2023.00278"},{"key":"2844_CR41","unstructured":"Read, J., & Perez-Cruz, F. (2014). Deep learning for multi-label classification. arXiv:1502.05988."},{"key":"2844_CR42","doi-asserted-by":"crossref","unstructured":"Ridnik, T., Ben-Baruch, E., Zamir, N., Noy, A., Friedman, I., Protter, M., & Zelnik-Manor, L. (2021). Asymmetric loss for multi-label classification. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 82\u201391.","DOI":"10.1109\/ICCV48922.2021.00015"},{"key":"2844_CR43","doi-asserted-by":"crossref","unstructured":"Ridnik, T., Sharir, G., Ben-Cohen, A., Baruch, E.B., & Noy, A. (2023). Ml-decoder: Scalable and versatile classification head. In: IEEE\/CVF Winter Conference on Applications of Computer Vision, WACV 2023, Waikoloa, HI, USA, January 2-7, 2023, pp. 32\u201341.","DOI":"10.1109\/WACV56688.2023.00012"},{"key":"2844_CR44","doi-asserted-by":"crossref","unstructured":"Singh, I. P., Ghorbel, E., Oyedotun, O. K., & Aouada, D. (2024). Multi-label image classification using adaptive graph convolutional networks: From a single domain to multiple domains. Comput. Vis. Image Underst.,247, Article 104062.","DOI":"10.1016\/j.cviu.2024.104062"},{"issue":"1","key":"2844_CR45","first-page":"25","volume":"18","author":"MS Sorower","year":"2010","unstructured":"Sorower, M. S. (2010). A literature survey on algorithms for multi-label learning. Oregon State University, Corvallis, 18(1), 25.","journal-title":"Oregon State University, Corvallis"},{"key":"2844_CR46","unstructured":"Sun, Q., Fang, Y., Wu, L., Wang, X., & Cao, Y. (2023). Eva-clip: Improved training techniques for clip at scale. arXiv:2303.15389."},{"key":"2844_CR47","unstructured":"Sun, Q., Wang, J., Yu, Q., Cui, Y., Zhang, F., Zhang, X., & Wang, X. (2023). Eva-clip-18b: Scaling clip to 18 billion parameters. arXiv:2402.04252."},{"key":"2844_CR48","unstructured":"Tschannen, M., Gritsenko, A., Wang, X., Naeem, M.F., Alabdulmohsin, I., Parthasarathy, N., Evans, T., Beyer, L., Xia, Y., Mustafa, B., H\u00e9naff, O., Harmsen, J., Steiner, A., & Zhai, X. (2025). Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features. arXiv:2502.14786."},{"key":"2844_CR49","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need. Advances in neural information processing systems30."},{"key":"2844_CR50","doi-asserted-by":"crossref","unstructured":"Wang, X., Wu, J., Chen, J., Li, L., Wang, Y.-F., & Wang, W.Y. (2019). Vatex: A large-scale, high-quality multilingual dataset for video-and-language research. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2019.00468"},{"key":"2844_CR51","doi-asserted-by":"crossref","unstructured":"Wang, J., Yang, Y., Mao, J., Huang, Z., Huang, C., & Xu, W. (2016). Cnn-rnn: A unified framework for multi-label image classification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2285\u20132294.","DOI":"10.1109\/CVPR.2016.251"},{"key":"2844_CR52","doi-asserted-by":"crossref","unstructured":"Xu, J., Mei, T., Yao, T., & Rui, Y. (2016). Msr-vtt: A large video description dataset for bridging video and language. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5288\u20135296.","DOI":"10.1109\/CVPR.2016.571"},{"key":"2844_CR53","doi-asserted-by":"crossref","unstructured":"Yang, Z., Ping, W., Liu, Z., Korthikanti, V., Nie, W., Huang, D., Fan, L., Yu, Z., Lan, S., Li, B., Shoeybi, M., Liu, M., Zhu, Y., Catanzaro, B., Xiao, C., & Anandkumar, A. (2023). Re-vilm: Retrieval-augmented visual language model for zero and few-shot image captioning. In: Findings of the Association for Computational Linguistics: EMNLP, pp. 11844\u201311857.","DOI":"10.18653\/v1\/2023.findings-emnlp.793"},{"key":"2844_CR54","unstructured":"Yao, L., Huang, R., Hou, L., Lu, G., Niu, M., Xu, H., Liang, X., Li, Z., Jiang, X., & Xu, C. (2021). Filip: Fine-grained interactive language-image pre-training. In: International Conference on Learning Representations."},{"key":"2844_CR55","unstructured":"Yazici, V.O., Gonzalez-Garcia, A., Ramisa, A., Twardowski, B., & Weijer, J.v.d. (2020). Orderless recurrent models for multi-label classification. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13440\u201313449."},{"key":"2844_CR56","doi-asserted-by":"crossref","unstructured":"Zhai, X., Mustafa, B., Kolesnikov, A., & Beyer, L. (2023). Sigmoid loss for language image pre-training. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 11975\u201311986.","DOI":"10.1109\/ICCV51070.2023.01100"},{"key":"2844_CR57","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Huang, X., Ma, J., Li, Z., Luo, Z., Xie, Y., Qin, Y., Luo, T., Li, Y., Liu, S., Guo, Y., & Zhang, L. (2024). Recognize anything: A strong image tagging model. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024 - Workshops, Seattle, WA, USA, June 17-18, 2024, pp. 1724\u20131732.","DOI":"10.1109\/CVPRW63382.2024.00179"},{"key":"2844_CR58","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Qi, Z., Yuan, C., Shan, Y., Li, B., Deng, Y., & Hu, W. (2021). Open-book video captioning with retrieve-copy-generate network. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9837\u20139846.","DOI":"10.1109\/CVPR46437.2021.00971"},{"issue":"7","key":"2844_CR59","doi-asserted-by":"publisher","first-page":"5192","DOI":"10.1109\/TPAMI.2024.3365739","volume":"46","author":"Z Zhang","year":"2024","unstructured":"Zhang, Z., Ma, Z., Yuan, C., Chen, Y., Wang, P., Qi, Z., Hao, C., Li, B., Shan, Y., Hu, W., & Maybank, S. J. (2024). Chinese title generation for short videos: Dataset, metric and algorithm. IEEE Trans. Pattern Anal. Mach. Intell., 46(7), 5192\u20135208.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"10","key":"2844_CR60","doi-asserted-by":"publisher","first-page":"2801","DOI":"10.1109\/TMM.2018.2812605","volume":"20","author":"J Zhang","year":"2018","unstructured":"Zhang, J., Wu, Q., Shen, C., Zhang, J., & Lu, J. (2018). Multilabel image classification with regional latent semantic dependencies. IEEE Transactions on Multimedia, 20(10), 2801\u20132813.","journal-title":"IEEE Transactions on Multimedia"},{"issue":"8","key":"2844_CR61","doi-asserted-by":"publisher","first-page":"1819","DOI":"10.1109\/TKDE.2013.39","volume":"26","author":"M-L Zhang","year":"2013","unstructured":"Zhang, M.-L., & Zhou, Z.-H. (2013). A review on multi-label learning algorithms. IEEE Transactions on knowledge and Data Engineering, 26(8), 1819\u20131837.","journal-title":"IEEE Transactions on knowledge and Data Engineering"},{"key":"2844_CR62","doi-asserted-by":"crossref","unstructured":"Zhao, J., Yan, K., Zhao, Y., Guo, X., Huang, F., & Li, J. (2021). Transformer-based dual relation graph for multi-label image recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 163\u2013172.","DOI":"10.1109\/ICCV48922.2021.00023"},{"key":"2844_CR63","doi-asserted-by":"crossref","unstructured":"Zhao, J., Zhao, Y., & Li, J. (2021). M3tr: Multi-modal multi-label recognition with transformer. In: Proceedings of the 29th ACM International Conference on Multimedia, pp. 469\u2013477.","DOI":"10.1145\/3474085.3475191"},{"key":"2844_CR64","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C.C., & Liu, Z. (2022). Conditional prompt learning for vision-language models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 16816\u201316825.","DOI":"10.1109\/CVPR52688.2022.01631"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02844-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-026-02844-w","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02844-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T16:16:53Z","timestamp":1784564213000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-026-02844-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5,21]]},"references-count":64,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["2844"],"URL":"https:\/\/doi.org\/10.1007\/s11263-026-02844-w","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5,21]]},"assertion":[{"value":"1 August 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 April 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 May 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"282"}}