{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:09:54Z","timestamp":1765008594123,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":51,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,12,9]]},"DOI":"10.1145\/3743093.3770958","type":"proceedings-article","created":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:06:16Z","timestamp":1765008376000},"page":"1-8","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Test-time Filtering Boosts Training-free Zero-shot Composed Image Retrieval"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-1960-5584","authenticated-orcid":false,"given":"Haoyue","family":"Chong","sequence":"first","affiliation":[{"name":"Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0834-2075","authenticated-orcid":false,"given":"Lunbo","family":"Li","sequence":"additional","affiliation":[{"name":"Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4039-7618","authenticated-orcid":false,"given":"Haofeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,6]]},"reference":[{"key":"e_1_3_3_2_2_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i19.30080"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/BIBE.2007.4375699"},{"key":"e_1_3_3_2_4_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00583"},{"key":"e_1_3_3_2_5_2","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang et\u00a0al. 2025. Qwen2. 5-VL Technical Report. arXiv e-prints (2025) arXiv\u20132502."},{"key":"e_1_3_3_2_6_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01407"},{"key":"e_1_3_3_2_7_2","unstructured":"Maxime Bucher Tuan-Hung Vu Matthieu Cord and Patrick P\u00e9rez. 2019. Zero-shot semantic segmentation. Advances in Neural Information Processing Systems 32 (2019)."},{"key":"e_1_3_3_2_8_2","doi-asserted-by":"crossref","unstructured":"Yupeng Chang Xu Wang Jindong Wang Yuan Wu Linyi Yang Kaijie Zhu Hao Chen Xiaoyuan Yi Cunxiang Wang Yidong Wang et\u00a0al. 2024. A survey on evaluation of large language models. ACM transactions on intelligent systems and technology 15 3 (2024) 1\u201345.","DOI":"10.1145\/3641289"},{"key":"e_1_3_3_2_9_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"e_1_3_3_2_10_2","unstructured":"Xiaokang Chen Zhiyu Wu Xingchao Liu Zizheng Pan Wen Liu Zhenda Xie Xingkai Yu and Chong Ruan. 2025. Janus-pro: Unified multimodal understanding and generation with data and model scaling. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2501.17811 (2025)."},{"key":"e_1_3_3_2_11_2","volume-title":"ICLR","author":"Chen Yiyang","year":"2024","unstructured":"Yiyang Chen, Zhedong Zheng, Wei Ji, Leigang Qu, and Tat-Seng Chua. 2024. Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization. In ICLR."},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00276"},{"key":"e_1_3_3_2_13_2","doi-asserted-by":"crossref","unstructured":"Florinel-Alin Croitoru Vlad Hondru Radu\u00a0Tudor Ionescu and Mubarak Shah. 2023. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence 45 9 (2023) 10850\u201310869.","DOI":"10.1109\/TPAMI.2023.3261988"},{"key":"e_1_3_3_2_14_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00269"},{"key":"e_1_3_3_2_15_2","unstructured":"Longye Du Shuaiyu Deng Ying Li Jun Li and Qi Tian. 2025. A Survey on Composed Image Retrieval. ACM Transactions on Multimedia Computing Communications and Applications (2025)."},{"key":"e_1_3_3_2_16_2","unstructured":"Tongtong Fang Nan Lu Gang Niu and Masashi Sugiyama. 2020. Rethinking importance weighting for deep learning under distribution shift. Advances in neural information processing systems 33 (2020) 11996\u201312007."},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612599"},{"key":"e_1_3_3_2_18_2","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3680808"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"crossref","unstructured":"Louie Giray. 2023. Prompt engineering with ChatGPT: a guide for academic writers. Annals of biomedical engineering 51 12 (2023) 2629\u20132633.","DOI":"10.1007\/s10439-023-03272-4"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2006.100"},{"key":"e_1_3_3_2_21_2","doi-asserted-by":"crossref","unstructured":"MD\u00a0Zakir Hossain Ferdous Sohel Mohd\u00a0Fairuz Shiratuddin and Hamid Laga. 2019. A comprehensive survey of deep learning for image captioning. ACM Computing Surveys (CsUR) 51 6 (2019) 1\u201336.","DOI":"10.1145\/3295748"},{"key":"e_1_3_3_2_22_2","first-page":"239","volume-title":"European Conference on Computer Vision","author":"Jang Young\u00a0Kyun","year":"2024","unstructured":"Young\u00a0Kyun Jang, Dat Huynh, Ashish Shah, Wen-Kai Chen, and Ser-Nam Lim. 2024. Spherical Linear Interpolation and Text-Anchoring for Zero-Shot Composed Image Retrieval. In European Conference on Computer Vision. 239\u2013254."},{"key":"e_1_3_3_2_23_2","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN60899.2024.10650863"},{"key":"e_1_3_3_2_24_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01343"},{"key":"e_1_3_3_2_25_2","volume-title":"ICLR","author":"Karthik Shyamgopal","year":"2024","unstructured":"Shyamgopal Karthik, Karsten Roth, Massimiliano Mancini, and Zeynep Akata. 2024. Vision-by-Language for Training-Free Compositional Image Retrieval. In ICLR."},{"key":"e_1_3_3_2_26_2","doi-asserted-by":"crossref","unstructured":"Zhaoqi Li and Yongping Xie. 2024. Bcra: bidirectional cross-modal implicit relation reasoning and aligning for text-to-image person retrieval. Multimedia Systems 30 4 (2024) 177.","DOI":"10.1007\/s00530-024-01372-2"},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657831"},{"key":"e_1_3_3_2_28_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00213"},{"key":"e_1_3_3_2_29_2","doi-asserted-by":"crossref","unstructured":"Carlo Meghini Fabrizio Sebastiani and Umberto Straccia. 2001. A model of multimedia information retrieval. Journal of the ACM (JACM) 48 5 (2001) 909\u2013970.","DOI":"10.1145\/502102.502103"},{"key":"e_1_3_3_2_30_2","doi-asserted-by":"crossref","unstructured":"Bertalan Mesk\u00f3. 2023. Prompt engineering as an important emerging skill for medical professionals: tutorial. Journal of medical Internet research 25 (2023) e50638.","DOI":"10.2196\/50638"},{"key":"e_1_3_3_2_31_2","unstructured":"Adam Paszke Sam Gross Francisco Massa Adam Lerer James Bradbury Gregory Chanan Trevor Killeen Zeming Lin Natalia Gimelshein Luca Antiga et\u00a0al. 2019. Pytorch: An imperative style high-performance deep learning library. Advances in neural information processing systems 32 (2019)."},{"key":"e_1_3_3_2_32_2","unstructured":"Mihir Prabhudesai Tsung-Wei Ke Alex Li Deepak Pathak and Katerina Fragkiadaki. 2023. Diffusion-tta: Test-time adaptation of discriminative models via generative feedback. Advances in Neural Information Processing Systems 36 (2023) 17567\u201317583."},{"key":"e_1_3_3_2_33_2","first-page":"8748","volume-title":"International conference on machine learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748\u20138763."},{"key":"e_1_3_3_2_34_2","first-page":"5389","volume-title":"International conference on machine learning","author":"Recht Benjamin","year":"2019","unstructured":"Benjamin Recht, Rebecca Roelofs, Ludwig Schmidt, and Vaishaal Shankar. 2019. Do imagenet classifiers generalize to imagenet?. In International conference on machine learning. PMLR, 5389\u20135400."},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01850"},{"key":"e_1_3_3_2_36_2","unstructured":"Manli Shu Weili Nie De-An Huang Zhiding Yu Tom Goldstein Anima Anandkumar and Chaowei Xiao. 2022. Test-time prompt tuning for zero-shot generalization in vision-language models. Advances in Neural Information Processing Systems 35 (2022) 14274\u201314289."},{"key":"e_1_3_3_2_37_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00950"},{"key":"e_1_3_3_2_38_2","unstructured":"Amit Singhal et\u00a0al. 2001. Modern information retrieval: A brief overview. IEEE Data Eng. Bull. 24 4 (2001) 35\u201343."},{"key":"e_1_3_3_2_39_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1644"},{"key":"e_1_3_3_2_40_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28324"},{"key":"e_1_3_3_2_41_2","unstructured":"Rohan Taori Achal Dave Vaishaal Shankar Nicholas Carlini Benjamin Recht and Ludwig Schmidt. 2020. Measuring robustness to natural distribution shifts in image classification. Advances in Neural Information Processing Systems 33 (2020) 18583\u201318599."},{"key":"e_1_3_3_2_42_2","doi-asserted-by":"crossref","unstructured":"Yoad Tewel Omri Kaduri Rinon Gal Yoni Kasten Lior Wolf Gal Chechik and Yuval Atzmon. 2024. Training-free consistent text-to-image generation. ACM Transactions on Graphics (TOG) 43 4 (2024) 1\u201318.","DOI":"10.1145\/3658157"},{"key":"e_1_3_3_2_43_2","doi-asserted-by":"crossref","unstructured":"Yongquan Wan Guobing Zou and Bofeng Zhang. 2025. Composed image retrieval: a survey on recent research and development. Applied Intelligence 55 6 (2025) 482.","DOI":"10.1007\/s10489-025-06372-x"},{"key":"e_1_3_3_2_44_2","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657727"},{"key":"e_1_3_3_2_45_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01115"},{"key":"e_1_3_3_2_46_2","first-page":"77","volume-title":"International Conference on Technologies and Applications of Artificial Intelligence","author":"Wu Ren-Di","year":"2024","unstructured":"Ren-Di Wu, Yu-Yen Lin, and Huei-Fang Yang. 2024. Training-free Zero-shot Composed Image Retrieval via Weighted Modality Fusion and Similarity. In International Conference on Technologies and Applications of Artificial Intelligence. Springer, 77\u201390."},{"key":"e_1_3_3_2_47_2","unstructured":"An Yang Baosong Yang Beichen Zhang Binyuan Hui Bo Zheng Bowen Yu Chengyuan Li Dayiheng Liu Fei Huang Haoran Wei et\u00a0al. 2024. Qwen2. 5 Technical Report. arXiv e-prints (2024) arXiv\u20132412."},{"key":"e_1_3_3_2_48_2","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657740"},{"key":"e_1_3_3_2_49_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01528"},{"key":"e_1_3_3_2_50_2","doi-asserted-by":"crossref","unstructured":"Duzhen Zhang Yahan Yu Chenxing Li Jiahua Dong Dan Su Chenhui Chu and Dong Yu. 2024. MM-LLMs: Recent Advances in MultiModal Large Language Models. CoRR (2024).","DOI":"10.18653\/v1\/2024.findings-acl.738"},{"key":"e_1_3_3_2_51_2","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475659"},{"key":"e_1_3_3_2_52_2","doi-asserted-by":"crossref","unstructured":"Jingyi Zhang Jiaxing Huang Sheng Jin and Shijian Lu. 2024. Vision-language models for vision tasks: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence (2024).","DOI":"10.1109\/TPAMI.2024.3369699"}],"event":{"name":"MMAsia '25: ACM Multimedia Asia","location":"Kuala Lumpur Malaysia","acronym":"MMAsia '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 7th ACM International Conference on Multimedia in Asia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3743093.3770958","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:07:28Z","timestamp":1765008448000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3743093.3770958"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,6]]},"references-count":51,"alternative-id":["10.1145\/3743093.3770958","10.1145\/3743093"],"URL":"https:\/\/doi.org\/10.1145\/3743093.3770958","relation":{},"subject":[],"published":{"date-parts":[[2025,12,6]]},"assertion":[{"value":"2025-12-06","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}