{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,3]],"date-time":"2025-12-03T17:24:10Z","timestamp":1764782650442,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":76,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,12,7]]},"DOI":"10.1145\/3767695.3769474","type":"proceedings-article","created":{"date-parts":[[2025,12,3]],"date-time":"2025-12-03T17:14:58Z","timestamp":1764782098000},"page":"281-291","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["A Combination-based Framework for Generative Text-image Retrieval: Dual Identifiers and Hybrid Retrieval Strategies"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-4406-2956","authenticated-orcid":false,"given":"Kaipeng","family":"Li","sequence":"first","affiliation":[{"name":"Graduate School of Comprehensive Human Sciences, University of Tsukuba, Tsukuba, Ibaraki, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1569-8507","authenticated-orcid":false,"given":"Haitao","family":"Yu","sequence":"additional","affiliation":[{"name":"Institute of Library, Information and Media Science, University of Tsukuba, Tsukuba, Ibaraki, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-2864-0251","authenticated-orcid":false,"given":"Yubo","family":"Fang","sequence":"additional","affiliation":[{"name":"Graduate School of Comprehensive Human Sciences, University of Tsukuba, Tsukuba, Ibaraki, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-4319-4078","authenticated-orcid":false,"given":"Chao","family":"Lei","sequence":"additional","affiliation":[{"name":"Graduate School of Comprehensive Human Sciences, University of Tsukuba, Tsukuba, Ibaraki, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,6]]},"reference":[{"key":"e_1_3_2_1_1_1","first-page":"31668","article-title":"Autoregressive search engines: Generating substrings as document identifiers","volume":"35","author":"Bevilacqua Michele","year":"2022","unstructured":"Michele Bevilacqua, Giuseppe Ottaviano, Patrick Lewis, Scott Yih, Sebastian Riedel, and Fabio Petroni. 2022. Autoregressive search engines: Generating substrings as document identifiers. Advances in Neural Information Processing Systems, Vol. 35 (2022), 31668-31683.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_2_1","first-page":"193","article-title":"Learning to Rank with Nonsmooth Cost Functions","author":"Burges Christopher J C","year":"2006","unstructured":"Christopher J C Burges, Robert Ragno, and Quoc Viet Le. 2006. Learning to Rank with Nonsmooth Cost Functions. In Proceedings of NeurIPS. 193-200.","journal-title":"Proceedings of NeurIPS."},{"key":"e_1_3_2_1_3_1","first-page":"5410","volume-title":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence, IJCAI-22","author":"Cao Min","year":"2022","unstructured":"Min Cao, Shiping Li, Juntao Li, Liqiang Nie, and Min Zhang. 2022. Image-text Retrieval: A Survey on Recent Research and Development. In Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence, IJCAI-22. International Joint Conferences on Artificial Intelligence Organization, 5410-5417. Survey Track."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01553"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1145\/3583780.3614821"},{"key":"e_1_3_2_1_6_1","volume-title":"Proceedings of the 22nd SIGKDD Conference. 785-794","author":"Chen Tianqi","year":"2016","unstructured":"Tianqi Chen and Carlos Guestrin. 2016. XGBoost: A Scalable Tree Boosting System. In Proceedings of the 22nd SIGKDD Conference. 785-794."},{"key":"e_1_3_2_1_7_1","first-page":"10701","volume-title":"Understanding Differential Search Index for Text Retrieval. In Findings of the Association for Computational Linguistics: ACL","author":"Chen Xiaoyang","year":"2023","unstructured":"Xiaoyang Chen, Yanjiang Liu, Ben He, Le Sun, and Yingfei Sun. 2023a. Understanding Differential Search Index for Text Retrieval. In Findings of the Association for Computational Linguistics: ACL 2023. Association for Computational Linguistics, Toronto, Canada, 10701-10717."},{"key":"e_1_3_2_1_8_1","volume-title":"Training vision transformers for image retrieval. arXiv preprint arXiv:2102.05644","author":"El-Nouby Alaaeldin","year":"2021","unstructured":"Alaaeldin El-Nouby, Natalia Neverova, Ivan Laptev, and Herv\u00e9 J\u00e9gou. 2021. Training vision transformers for image retrieval. arXiv preprint arXiv:2102.05644 (2021)."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19784-0_6"},{"key":"e_1_3_2_1_10_1","first-page":"529","volume-title":"Zurich","author":"Gong Yunchao","year":"2014","unstructured":"Yunchao Gong, Liwei Wang, Micah Hodosh, Julia Hockenmaier, and Svetlana Lazebnik. 2014. Improving image-sentence embeddings using large weakly annotated photo collections. In Computer Vision-ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part IV 13. Springer, 529-545."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_1_12_1","volume-title":"European Conference on Information Retrieval. Springer, 68-85","author":"Hendriksen Mariya","year":"2023","unstructured":"Mariya Hendriksen, Svitlana Vakulenko, Ernst Kuiper, and Maarten de Rijke. 2023. Scene-centric vs. object-centric image-text cross-modal retrieval: a reproducibility study. In European Conference on Information Retrieval. Springer, 68-85."},{"key":"e_1_3_2_1_13_1","volume-title":"Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 3183-3193","author":"Hendriksen Mariya","year":"2025","unstructured":"Mariya Hendriksen, Shuo Zhang, Ridho Reinanda, Mohamed Yahya, Edgar Meij, and Maarten de Rijke. 2025. Benchmark Granularity and Model Robustness for Image-Text Retrieval: A Reproducibility Study. In Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 3183-3193."},{"key":"e_1_3_2_1_14_1","first-page":"980","volume-title":"Proceedings of the AAAI conference on artificial intelligence","volume":"37","author":"Jang Jiho","year":"2023","unstructured":"Jiho Jang, Chaerin Kong, Donghyeon Jeon, Seonhoon Kim, and Nojun Kwak. 2023. Unifying vision-language representation space with single-tower transformer. In Proceedings of the AAAI conference on artificial intelligence, Vol. 37. 980-988."},{"key":"e_1_3_2_1_15_1","volume-title":"Combination of multiple global descriptors for image retrieval. arXiv preprint arXiv:1903.10663","author":"Jun HeeJae","year":"2019","unstructured":"HeeJae Jun, Byungsoo Ko, Youngjoon Kim, Insik Kim, and Jongtack Kim. 2019. Combination of multiple global descriptors for image retrieval. arXiv preprint arXiv:1903.10663 (2019)."},{"key":"e_1_3_2_1_16_1","first-page":"3149","article-title":"LightGBM: A Highly Efficient Gradient Boosting Decision Tree","author":"Ke Guolin","year":"2017","unstructured":"Guolin Ke, Qi Meng, Thomas Finley, Taifeng Wang, Wei Chen, Weidong Ma, Qiwei Ye, and Tie-Yan Liu. 2017. LightGBM: A Highly Efficient Gradient Boosting Decision Tree. In NIPS. 3149-3157.","journal-title":"NIPS."},{"key":"e_1_3_2_1_17_1","first-page":"39","article-title":"ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT","author":"Khattab Omar","year":"2020","unstructured":"Omar Khattab and Matei Zaharia. 2020. ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. In Proceedings of SIGIR. 39-48.","journal-title":"Proceedings of SIGIR."},{"key":"e_1_3_2_1_18_1","volume-title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics, 13616-13633","author":"Kim Chaeeun","year":"2024","unstructured":"Chaeeun Kim, Soyoung Yoon, Hyunji Lee, Joel Jang, Sohee Yang, and Minjoon Seo. 2024. Exploring the Practicality of Generative Retrieval on Dynamic Corpora. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics, 13616-13633."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02243"},{"key":"e_1_3_2_1_20_1","volume-title":"Proceedings of the Computer Vision and Pattern Recognition Conference. 19659-19669","author":"Kim Sungyeon","year":"2025","unstructured":"Sungyeon Kim, Xinliang Zhu, Xiaofan Lin, Muhammet Bastan, Douglas Gray, and Suha Kwak. 2025. GENIUS: A generative framework for universal multimodal search. In Proceedings of the Computer Vision and Pattern Recognition Conference. 19659-19669."},{"key":"e_1_3_2_1_21_1","volume-title":"Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980","author":"Kingma Diederik P","year":"2014","unstructured":"Diederik P Kingma and Jimmy Ba. 2014. Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1145\/3065386"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01123"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"e_1_3_2_1_25_1","volume-title":"SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs. arXiv preprint arXiv:2504.13172","author":"Li Haoxuan","year":"2025","unstructured":"Haoxuan Li, Yi Bin, Yunshan Ma, Guoqing Wang, Yang Yang, See-Kiong Ng, and Tat-Seng Chua. 2025a. SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs. arXiv preprint arXiv:2504.13172 (2025)."},{"key":"e_1_3_2_1_26_1","volume-title":"International conference on machine learning. PMLR, 12888-12900","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In International conference on machine learning. PMLR, 12888-12900."},{"key":"e_1_3_2_1_27_1","volume-title":"Align before fuse: Vision and language representation learning with momentum distillation. Advances in neural information processing systems","author":"Li Junnan","year":"2021","unstructured":"Junnan Li, Ramprasaath Selvaraju, Akhilesh Gotmare, Shafiq Joty, Caiming Xiong, and Steven Chu Hong Hoi. 2021. Align before fuse: Vision and language representation learning with momentum distillation. Advances in neural information processing systems, Vol. 34 (2021), 9694-9705."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00475"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1145\/3722552"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/3726302.3730077"},{"key":"e_1_3_2_1_31_1","volume-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Association for Computational Linguistics, 11851-11861","author":"Li Yongqi","year":"2024","unstructured":"Yongqi Li, Wenjie Wang, Leigang Qu, Liqiang Nie, Wenjie Li, and Tat-Seng Chua. 2024a. Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Association for Computational Linguistics, 11851-11861."},{"key":"e_1_3_2_1_32_1","volume-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Association for Computational Linguistics, 6636-6648","author":"Li Yongqi","year":"2023","unstructured":"Yongqi Li, Nan Yang, Liang Wang, Furu Wei, and Wenjie Li. 2023. Multiview Identifiers Enhanced Generative Retrieval. In Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Association for Computational Linguistics, 6636-6648."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i8.28717"},{"key":"e_1_3_2_1_34_1","volume-title":"The Thirteenth International Conference on Learning Representations","author":"Lin Sheng-Chieh","year":"2025","unstructured":"Sheng-Chieh Lin, Chankyu Lee, Mohammad Shoeybi, Jimmy Lin, Bryan Catanzaro, and Wei Ping. 2025. Mm-embed: Universal multimodal retrieval with multimodal llms. The Thirteenth International Conference on Learning Representations (2025)."},{"key":"e_1_3_2_1_35_1","first-page":"740","volume-title":"Switzerland","author":"Lin Tsung-Yi","year":"2014","unstructured":"Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll\u00e1r, and C Lawrence Zitnick. 2014. Microsoft coco: Common objects in context. In Computer vision-ECCV 2014: 13th European conference, zurich, Switzerland, September 6-12, 2014, proceedings, part v 13. Springer, 740-755."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350869"},{"key":"e_1_3_2_1_37_1","volume-title":"Updating transformer memory with new documents. arXiv preprint arXiv:2212.09744","author":"Mehta Sanket Vaibhav","year":"2022","unstructured":"Sanket Vaibhav Mehta, Jai Gupta, Yi Tay, Mostafa Dehghani, Vinh Q Tran, Jinfeng Rao, Marc Najork, Emma Strubell, and Donald Metzler. 2022. DSI++: Updating transformer memory with new documents. arXiv preprint arXiv:2212.09744 (2022)."},{"key":"e_1_3_2_1_38_1","volume-title":"Proceedings of SIGIR","author":"Mekonnen Kidist Amde","year":"2025","unstructured":"Kidist Amde Mekonnen, Yubao Tang, and Maarten de Rijke. 2025. Lightweight and Direct Document Relevance Optimization for Generative Information Retrieval. Proceedings of SIGIR (2025)."},{"key":"e_1_3_2_1_39_1","volume-title":"Acm sigir forum","author":"Metzler Donald","unstructured":"Donald Metzler, Yi Tay, Dara Bahri, and Marc Najork. 2021. Rethinking search: making domain experts out of dilettantes. In Acm sigir forum, Vol. 55. ACM New York, NY, USA, 1-27."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_30"},{"key":"e_1_3_2_1_41_1","volume-title":"Proceedings of the 29th ACM International Conference on Information & Knowledge Management. 2161-2164","author":"Muramoto Naoki","year":"2020","unstructured":"Naoki Muramoto and Hai-Tao Yu. 2020. Deep Metric Learning Based on Rank-sensitive Optimization of Top-k Precision. In Proceedings of the 29th ACM International Conference on Information & Knowledge Management. 2161-2164."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.232"},{"key":"e_1_3_2_1_43_1","volume-title":"Passage Re-ranking with BERT. arXiv:1901.04085v4","author":"Nogueira Rodrigo","year":"2019","unstructured":"Rodrigo Nogueira and Kyunghyun Cho. 2019. Passage Re-ranking with BERT. arXiv:1901.04085v4 (2019)."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","first-page":"1305","DOI":"10.18653\/v1\/2023.emnlp-main.83","volume-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics","author":"Pradeep Ronak","year":"2023","unstructured":"Ronak Pradeep, Kai Hui, Jai Gupta, Adam Lelkes, Honglei Zhuang, Jimmy Lin, Donald Metzler, and Vinh Tran. 2023. How Does Generative Retrieval Scale to Millions of Passages?. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics, Singapore, 1305-1321."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.638"},{"key":"e_1_3_2_1_46_1","volume-title":"The Thirteenth International Conference on Learning Representations.","author":"Qu Leigang","year":"2025","unstructured":"Leigang Qu, Haochuan Li, Tan Wang, Wenjie Wang, Yongqi Li, Liqiang Nie, and Tat-Seng Chua. 2025. Tiger: Unifying text-to-image generation and retrieval with large multimodal models. In The Thirteenth International Conference on Learning Representations."},{"key":"e_1_3_2_1_47_1","volume-title":"International conference on machine learning. PmLR, 8748-8763","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al., 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748-8763."},{"key":"e_1_3_2_1_48_1","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel Colin","year":"2020","unstructured":"Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J Liu. 2020. Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of machine learning research, Vol. 21, 140 (2020), 1-67.","journal-title":"Journal of machine learning research"},{"key":"e_1_3_2_1_49_1","volume-title":"Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125","author":"Ramesh Aditya","year":"2022","unstructured":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen. 2022. Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125, Vol. 1, 2 (2022), 3."},{"key":"e_1_3_2_1_50_1","volume-title":"Proceedings of TREC.","author":"Robertson Stephen E","year":"1994","unstructured":"Stephen E Robertson, Steve Walker, Susan Jones, Micheline Hancock-Beaulieu, and Mike Gatford. 1994. Okapi at TREC-3. In Proceedings of TREC."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"publisher","DOI":"10.1145\/3673791.3698408"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01519"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.1108\/eb026526"},{"key":"e_1_3_2_1_54_1","first-page":"46345","article-title":"Learning to tokenize for generative retrieval","volume":"36","author":"Sun Weiwei","year":"2023","unstructured":"Weiwei Sun, Lingyong Yan, Zheng Chen, Shuaiqiang Wang, Haichao Zhu, Pengjie Ren, Zhumin Chen, Dawei Yin, Maarten Rijke, and Zhaochun Ren. 2023. Learning to tokenize for generative retrieval. Advances in Neural Information Processing Systems, Vol. 36 (2023), 46345-46361.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.1145\/3690624.3709435"},{"key":"e_1_3_2_1_56_1","first-page":"72790","article-title":"Generative retrieval meets multi-graded relevance","volume":"37","author":"Tang Yubao","year":"2024","unstructured":"Yubao Tang, Ruqing Zhang, Jiafeng Guo, Maarten Rijke, Wei Chen, and Xueqi Cheng. 2024. Generative retrieval meets multi-graded relevance. Advances in Neural Information Processing Systems, Vol. 37 (2024), 72790-72817.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_57_1","first-page":"21831","article-title":"Transformer memory as a differentiable search index","volume":"35","author":"Tay Yi","year":"2022","unstructured":"Yi Tay, Vinh Tran, Mostafa Dehghani, Jianmo Ni, Dara Bahri, Harsh Mehta, Zhen Qin, Kai Hui, Zhe Zhao, Jai Gupta, et al., 2022. Transformer memory as a differentiable search index. Advances in Neural Information Processing Systems, Vol. 35 (2022), 21831-21843.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_58_1","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. 5109-5118","author":"Teichmann Marvin","year":"2019","unstructured":"Marvin Teichmann, Andre Araujo, Menglong Zhu, and Jack Sim. 2019. Detect-to-retrieve: Efficient regional aggregation for image search. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. 5109-5118."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01059"},{"key":"e_1_3_2_1_60_1","unstructured":"Aaron Van Den Oord Oriol Vinyals et al. 2017. Neural discrete representation learning. Advances in neural information processing systems Vol. 30 (2017)."},{"key":"e_1_3_2_1_61_1","first-page":"25600","article-title":"A neural corpus indexer for document retrieval","volume":"35","author":"Wang Yujing","year":"2022","unstructured":"Yujing Wang, Yingyan Hou, Haonan Wang, Ziming Miao, Shibin Wu, Qi Chen, Yuqing Xia, Chengmin Chi, Guoshuai Zhao, Zheng Liu, et al., 2022. A neural corpus indexer for document retrieval. Advances in Neural Information Processing Systems, Vol. 35 (2022), 25600-25614.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","DOI":"10.1145\/3583780.3614993"},{"key":"e_1_3_2_1_63_1","volume-title":"European Conference on Computer Vision. Springer, 387-404","author":"Wei Cong","year":"2024","unstructured":"Cong Wei, Yang Chen, Haonan Chen, Hexiang Hu, Ge Zhang, Jie Fu, Alan Ritter, and Wenhu Chen. 2024. Uniir: Training and benchmarking universal multimodal information retrievers. In European Conference on Computer Vision. Springer, 387-404."},{"key":"e_1_3_2_1_64_1","volume-title":"Proceedings of the 19th ACM international conference on Multimedia. 1437-1440","author":"Wengert Christian","year":"2011","unstructured":"Christian Wengert, Matthijs Douze, and Herv\u00e9 J\u00e9gou. 2011. Bag-of-colors for improved image search. In Proceedings of the 19th ACM international conference on Multimedia. 1437-1440."},{"key":"e_1_3_2_1_65_1","volume-title":"Proceedings of SIGIR","author":"Wu Shiguang","year":"2025","unstructured":"Shiguang Wu, Zhaochun Ren, Xin Xin, Jiyuan Yang, Mengqi Zhang, Zhumin Chen, Maarten de Rijke, and Pengjie Ren. 2025. Constrained Auto-Regressive Decoding Constrains Generative Retrieval. Proceedings of SIGIR (2025)."},{"key":"e_1_3_2_1_66_1","volume-title":"Xlnet: Generalized autoregressive pretraining for language understanding. Advances in neural information processing systems","author":"Yang Zhilin","year":"2019","unstructured":"Zhilin Yang, Zihang Dai, Yiming Yang, Jaime Carbonell, Russ R Salakhutdinov, and Quoc V Le. 2019. Xlnet: Generalized autoregressive pretraining for language understanding. Advances in neural information processing systems, Vol. 32 (2019)."},{"key":"e_1_3_2_1_67_1","volume-title":"Filip: Fine-grained interactive language-image pre-training. arXiv preprint arXiv:2111.07783","author":"Yao Lewei","year":"2021","unstructured":"Lewei Yao, Runhui Huang, Lu Hou, Guansong Lu, Minzhe Niu, Hang Xu, Xiaodan Liang, Zhenguo Li, Xin Jiang, and Chunjing Xu. 2021. Filip: Fine-grained interactive language-image pre-training. arXiv preprint arXiv:2111.07783 (2021)."},{"key":"e_1_3_2_1_68_1","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00166"},{"key":"e_1_3_2_1_69_1","volume-title":"CoCa: Contrastive Captioners are Image-Text Foundation Models. Transactions on Machine Learning Research","author":"Yu Jiahui","year":"2022","unstructured":"Jiahui Yu, Zirui Wang, Vijay Vasudevan, Legg Yeung, Mojtaba Seyedhosseini, and Yonghui Wu. 2022a. CoCa: Contrastive Captioners are Image-Text Foundation Models. Transactions on Machine Learning Research (2022). https:\/\/openreview.net\/forum?id=Ee277P3AYC"},{"key":"e_1_3_2_1_70_1","volume-title":"Thang Luong, Gunjan Baid, Zirui Wang, Vijay Vasudevan, Alexander Ku, Yinfei Yang, Burcu Karagol Ayan, et al.","author":"Yu Jiahui","year":"2022","unstructured":"Jiahui Yu, Yuanzhong Xu, Jing Yu Koh, Thang Luong, Gunjan Baid, Zirui Wang, Vijay Vasudevan, Alexander Ku, Yinfei Yang, Burcu Karagol Ayan, et al., 2022b. Scaling autoregressive models for content-rich text-to-image generation. arXiv preprint arXiv:2206.10789, Vol. 2, 3 (2022), 5."},{"key":"e_1_3_2_1_71_1","doi-asserted-by":"publisher","DOI":"10.1145\/3589334.3645477"},{"key":"e_1_3_2_1_72_1","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657746"},{"key":"e_1_3_2_1_73_1","volume-title":"European Conference on Computer Vision. Springer, 21-41","author":"Zhang Yidan","year":"2024","unstructured":"Yidan Zhang, Ting Zhang, Dong Chen, Yujing Wang, Qi Chen, Xing Xie, Hao Sun, Weiwei Deng, Qi Zhang, Fan Yang, et al., 2024. Irgen: Generative modeling for image retrieval. In European Conference on Computer Vision. Springer, 21-41."},{"key":"e_1_3_2_1_74_1","volume-title":"Proceedings of SIGIR","author":"Zhang Zhen","year":"2025","unstructured":"Zhen Zhang, Xinyu Ma, Weiwei Sun, Pengjie Ren, Zhumin Chen, Shuaiqiang Wang, Dawei Yin, Maarten de Rijke, and Zhaochun Ren. 2025. Replication and Exploration of Generative Retrieval over Dynamic Corpora. Proceedings of SIGIR (2025)."},{"key":"e_1_3_2_1_75_1","doi-asserted-by":"publisher","DOI":"10.1145\/3383184"},{"key":"e_1_3_2_1_76_1","volume-title":"Bridging the gap between indexing and retrieval for differentiable search index with query generation. arXiv preprint arXiv:2206.10128","author":"Zhuang Shengyao","year":"2022","unstructured":"Shengyao Zhuang, Houxing Ren, Linjun Shou, Jian Pei, Ming Gong, Guido Zuccon, and Daxin Jiang. 2022. Bridging the gap between indexing and retrieval for differentiable search index with query generation. arXiv preprint arXiv:2206.10128 (2022)."}],"event":{"name":"SIGIR-AP 2025:Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region","location":"Xi'an China","sponsor":["SIGIR ACM Special Interest Group on Information Retrieval"]},"container-title":["Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region"],"original-title":[],"deposited":{"date-parts":[[2025,12,3]],"date-time":"2025-12-03T17:18:46Z","timestamp":1764782326000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3767695.3769474"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,6]]},"references-count":76,"alternative-id":["10.1145\/3767695.3769474","10.1145\/3767695"],"URL":"https:\/\/doi.org\/10.1145\/3767695.3769474","relation":{},"subject":[],"published":{"date-parts":[[2025,12,6]]},"assertion":[{"value":"2025-12-06","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}