{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,8]],"date-time":"2025-09-08T05:52:27Z","timestamp":1757310747299,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":68,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,5,13]],"date-time":"2024-05-13T00:00:00Z","timestamp":1715558400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,5,13]]},"DOI":"10.1145\/3589335.3641248","type":"proceedings-article","created":{"date-parts":[[2024,5,12]],"date-time":"2024-05-12T18:41:21Z","timestamp":1715539281000},"page":"1272-1275","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["Multimodal Pretraining and Generation for Recommendation: A Tutorial"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5666-8320","authenticated-orcid":false,"given":"Jieming","family":"Zhu","sequence":"first","affiliation":[{"name":"Huawei Noah's Ark Lab, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0948-8033","authenticated-orcid":false,"given":"Xin","family":"Zhou","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5730-8792","authenticated-orcid":false,"given":"Chuhan","family":"Wu","sequence":"additional","affiliation":[{"name":"Huawei Noah's Ark Lab, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8132-6250","authenticated-orcid":false,"given":"Rui","family":"Zhang","sequence":"additional","affiliation":[{"name":"www.ruizhang.info, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2231-4663","authenticated-orcid":false,"given":"Zhenhua","family":"Dong","sequence":"additional","affiliation":[{"name":"Huawei Noah's Ark Lab, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,5,13]]},"reference":[{"key":"e_1_3_2_2_1_1","unstructured":"Jean-Baptiste Alayrac Jeff Donahue Pauline Luc Antoine Miech Iain Barr Yana Hasson Karel Lenc Arthur Mensch Katherine Millican Malcolm Reynolds Roman Ring Eliza Rutherford Serkan Cabi Tengda Han Zhitao Gong Sina Samangooei Marianne Monteiro Jacob L. Menick Sebastian Borgeaud and et al. 2022. Flamingo: a Visual Language Model for Few-Shot Learning. In NeurIPS."},{"key":"e_1_3_2_2_2_1","article-title":"Put Your Voice on Stage","volume":"18","author":"Ao Xiang","year":"2023","unstructured":"Xiang Ao, Ling Luo, Xiting Wang, Zhao Yang, Jiun-Hung Chen, Ying Qiao, Qing He, and Xing Xie. 2023. Put Your Voice on Stage: Personalized Headline Generation for News Articles. TKDD, Vol. 18, 3 (2023).","journal-title":"Personalized Headline Generation for News Articles. TKDD"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.7"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1145\/3534678.3539170"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.183"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1145\/3077136.3080797"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"crossref","unstructured":"Ke Chen Beici Liang Xiaoshuan Ma and Minwei Gu. 2021. Learning Audio Embeddings with User Listening Data for Content-Based Music Recommendation. In ICASSP. 3015--3019.","DOI":"10.1109\/ICASSP39728.2021.9414458"},{"key":"e_1_3_2_2_8_1","unstructured":"Touvron et al. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. CoRR Vol. abs\/2307.09288 (2023)."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3611929"},{"key":"e_1_3_2_2_10_1","volume-title":"Image Matters: Visually Modeling User Behaviors Using Advanced Model Server. In CIKM. 2087--2095.","author":"Ge Tiezheng","year":"2018","unstructured":"Tiezheng Ge, Liqin Zhao, Guorui Zhou, Keyu Chen, Shuying Liu, Huiming Yi, Zelin Hu, Bochao Liu, Peng Sun, Haoyu Liu, Pengtao Yi, Sui Huang, Zhiqiang Zhang, Xiaoqiang Zhu, Yu Zhang, and Kun Gai. 2018. Image Matters: Visually Modeling User Behaviors Using Advanced Model Server. In CIKM. 2087--2095."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"crossref","unstructured":"Shijie Geng Shuchang Liu Zuohui Fu Yingqiang Ge and Yongfeng Zhang. 2022. Recommendation as Language Processing (RLP): A Unified Pretrain Personalized Prompt & Predict Paradigm (P5). In RecSys. 299--315.","DOI":"10.1145\/3523227.3546767"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"crossref","unstructured":"Shijie Geng Juntao Tan Shuchang Liu Zuohui Fu and Yongfeng Zhang. 2023. VIP5: Towards Multimodal Foundation Models for Recommendation. CoRR.","DOI":"10.18653\/v1\/2023.findings-emnlp.644"},{"key":"e_1_3_2_2_13_1","volume-title":"Armand Joulin, and Ishan Misra.","author":"Girdhar Rohit","year":"2023","unstructured":"Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, and Ishan Misra. 2023. ImageBind: One Embedding Space to Bind Them All. In CVPR. 15180--15190."},{"key":"e_1_3_2_2_14_1","volume-title":"Torr","author":"Gu Jindong","year":"2023","unstructured":"Jindong Gu, Zhen Han, Shuo Chen, Ahmad Beirami, Bailan He, Gengyuan Zhang, Ruotong Liao, Yao Qin, Volker Tresp, and Philip H. S. Torr. 2023. A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models. CoRR , Vol. abs\/2307.12980 (2023)."},{"key":"e_1_3_2_2_15_1","volume-title":"Generating Representative Headlines for News Stories. In The Web Conference 2020 (WWW). 1773--1784","author":"Gu Xiaotao","year":"2020","unstructured":"Xiaotao Gu, Yuning Mao, Jiawei Han, Jialu Liu, You Wu, Cong Yu, Daniel Finnie, Hongkun Yu, Jiaqi Zhai, and Nicholas Zukoski. 2020. Generating Representative Headlines for News Stories. In The Web Conference 2020 (WWW). 1773--1784."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.9973"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/3206025.3210497"},{"key":"e_1_3_2_2_18_1","volume-title":"Yaliang Li, Bolin Ding, and Ji-Rong Wen.","author":"Hou Yupeng","year":"2022","unstructured":"Yupeng Hou, Shanlei Mu, Wayne Xin Zhao, Yaliang Li, Bolin Ding, and Ji-Rong Wen. 2022. Towards Universal Sequence Representation Learning for Recommender Systems. In KDD. 585--593."},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"crossref","unstructured":"HsiaoYuan Hsu Xiangteng He Yuxin Peng Hao Kong and Qing Zhang. 2023. PosterLayout: A New Benchmark and Approach for Content-Aware Visual-Textual Presentation Layout. In CVPR. 6018--6026.","DOI":"10.1109\/CVPR52729.2023.00583"},{"key":"e_1_3_2_2_20_1","volume-title":"MALA: Cross-Domain Dialogue Generation with Action Learning. In AAAI. 7977--7984.","author":"Huang Xinting","year":"2020","unstructured":"Xinting Huang, Jianzhong Qi, Yu Sun, and Rui Zhang. 2020. MALA: Cross-Domain Dialogue Generation with Action Learning. In AAAI. 7977--7984."},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"crossref","unstructured":"Yanhua Huang Weikun Wang Lei Zhang and Ruiwen Xu. 2021. Sliding Spectrum Decomposition for Diversified Recommendation. In KDD. 3041--3049.","DOI":"10.1145\/3447548.3467108"},{"volume-title":"ACM Web Conference (WWW).","author":"Le Trung-Hoang","key":"e_1_3_2_2_22_1","unstructured":"Trung-Hoang Le, Quoc-Tuan Truong, Aghiles Salah, and Hady W. Lauw. 2023. Multi-Modal Recommender Systems: Towards Addressing Sparsity, Comparability, and Explainability. In ACM Web Conference (WWW)."},{"key":"e_1_3_2_2_23_1","volume-title":"2023 c. Automatic Prompt Rewriting for Personalized Text Generation. CoRR","author":"Li Cheng","year":"2023","unstructured":"Cheng Li, Mingyang Zhang, Qiaozhu Mei, Weize Kong, and Michael Bendersky. 2023 c. Automatic Prompt Rewriting for Personalized Text Generation. CoRR , Vol. abs\/2310.00152 (2023)."},{"key":"e_1_3_2_2_24_1","volume-title":"Yi Liang, and Michael Bendersky. 2023 d. Teach LLMs to Personalize - An Approach inspired by Writing Education. CoRR","author":"Li Cheng","year":"2023","unstructured":"Cheng Li, Mingyang Zhang, Qiaozhu Mei, Yaqing Wang, Spurthi Amba Hombaiah, Yi Liang, and Michael Bendersky. 2023 d. Teach LLMs to Personalize - An Approach inspired by Writing Education. CoRR , Vol. abs\/2308.07968 (2023)."},{"key":"e_1_3_2_2_25_1","first-page":"19730","article-title":"a. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","volume":"202","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven C. H. Hoi. 2023 a. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. In ICML, Vol. 202. 19730--19742.","journal-title":"ICML"},{"volume-title":"Proceedings of KDD. 1258--1267","author":"Li Jiacheng","key":"e_1_3_2_2_26_1","unstructured":"Jiacheng Li, Ming Wang, Jin Li, Jinmiao Fu, Xin Shen, Jingbo Shang, and Julian J. McAuley. 2023 b. Text Is All You Need: Learning Language Representations for Sequential Recommendation. In Proceedings of KDD. 1258--1267."},{"key":"e_1_3_2_2_27_1","volume-title":"MINER: Multi-Interest Matching Network for News Recommendation. In Findings of ACL. 343--352.","author":"Li Jian","year":"2022","unstructured":"Jian Li, Jieming Zhu, Qiwei Bi, Guohao Cai, Lifeng Shang, Zhenhua Dong, Xin Jiang, and Qun Liu. 2022. MINER: Multi-Interest Matching Network for News Recommendation. In Findings of ACL. 343--352."},{"volume-title":"Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning. CoRR","author":"Lialin Vladislav","key":"e_1_3_2_2_28_1","unstructured":"Vladislav Lialin, Vijeta Deshpande, and Anna Rumshisky. 2023. Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning. CoRR , Vol. abs\/2303.15647."},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"publisher","DOI":"10.1145\/3610661.3617602"},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"crossref","unstructured":"Jinpeng Lin Min Zhou Ye Ma Yifan Gao Chenxi Fei Yangjian Chen Zhang Yu and Tiezheng Ge. 2023. AutoPoster: A Highly Automatic and Content-aware Design System for Advertising Poster Generation. In ACM MM. 1250--1260.","DOI":"10.1145\/3581783.3611930"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3403319"},{"key":"e_1_3_2_2_32_1","volume-title":"Proceedings of COLING. 2823--2833","author":"Liu Qijiong","year":"2022","unstructured":"Qijiong Liu, Jieming Zhu, Quanyu Dai, and Xiaoming Wu. 2022. Boosting Deep CTR Prediction with a Plug-and-Play Pre-trainer for News Recommendation. In Proceedings of COLING. 2823--2833."},{"key":"e_1_3_2_2_33_1","first-page":"857","article-title":"Self-Supervised Learning: Generative or Contrastive","volume":"35","author":"Liu Xiao","year":"2023","unstructured":"Xiao Liu, Fanjin Zhang, Zhenyu Hou, Li Mian, Zhaoyu Wang, Jing Zhang, and Jie Tang. 2023. Self-Supervised Learning: Generative or Contrastive. IEEE Trans. Knowl. Data Eng. , Vol. 35, 1 (2023), 857--876.","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"crossref","unstructured":"Yong Liu Susen Yang Chenyi Lei Guoxin Wang Haihong Tang Juyong Zhang Aixin Sun and Chunyan Miao. 2021. Pre-training Graph Transformer with Multimodal Side Information for Recommendation. In ACM MM. 2853--2861.","DOI":"10.1145\/3474085.3475709"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.402"},{"key":"e_1_3_2_2_36_1","unstructured":"OpenAI. 2023. GPT-4 Technical Report. CoRR Vol. abs\/2303.08774 (2023)."},{"key":"e_1_3_2_2_37_1","first-page":"8748","article-title":"Learning Transferable Visual Models From Natural Language Supervision","volume":"139","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In Proceedings of ICML, Vol. 139. 8748--8763.","journal-title":"Proceedings of ICML"},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"crossref","unstructured":"Nataniel Ruiz Yuanzhen Li Varun Jampani Yael Pritch Michael Rubinstein and Kfir Aberman. 2023. DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation. In CVPR. 22500--22510.","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"e_1_3_2_2_39_1","volume-title":"LaMP: When Large Language Models Meet Personalization. CoRR","author":"Salemi Alireza","year":"2023","unstructured":"Alireza Salemi, Sheshera Mysore, Michael Bendersky, and Hamed Zamani. 2023. LaMP: When Large Language Models Meet Personalization. CoRR (2023)."},{"key":"e_1_3_2_2_40_1","volume-title":"Multimedia Recommendation. In ACM Multimedia Conference (MM). 1535","author":"Shen Jialie","year":"2012","unstructured":"Jialie Shen, Meng Wang, Shuicheng Yan, and Peng Cui. 2012. Multimedia Recommendation. In ACM Multimedia Conference (MM). 1535."},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"crossref","unstructured":"Jialie Shen Meng Wang Shuicheng Yan and Peng Cui. 2013. Multimedia recommendation: technology and techniques. In SIGIR. 1131.","DOI":"10.1145\/2484028.2484194"},{"key":"e_1_3_2_2_42_1","volume-title":"PMG: Personalized Multimodal Generation with Large Language Models. In WWW.","author":"Shen Xiaoteng","year":"2024","unstructured":"Xiaoteng Shen, Rui Zhang, Xiaoyan Zhao, Jieming Zhu, and Xi Xiao. 2024. PMG: Personalized Multimodal Generation with Large Language Models. In WWW."},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","DOI":"10.1145\/3357384.3357895"},{"key":"e_1_3_2_2_44_1","volume-title":"Lauw","author":"Truong Quoc-Tuan","year":"2021","unstructured":"Quoc-Tuan Truong, Aghiles Salah, and Hady W. Lauw. 2021. Multi-Modal Recommender Systems: Hands-On Exploration. In RecSys. 834--837."},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3611967"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"crossref","unstructured":"Wei Wei Chao Huang Lianghao Xia and Chuxu Zhang. 2023. Multi-Modal Self-Supervised Learning for Recommendation. In WWW. 790--800.","DOI":"10.1145\/3543507.3583206"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"crossref","unstructured":"Zhoufutu Wen Xinyu Zhao Zhipeng Jin Yi Yang Wei Jia Xiaodong Chen Shuanglong Li and Lin Liu. 2023. Enhancing Dynamic Image Advertising with Vision-Language Pre-training. In SIGIR. 3310--3314.","DOI":"10.1145\/3539618.3591844"},{"key":"e_1_3_2_2_48_1","doi-asserted-by":"crossref","unstructured":"Chuhan Wu Fangzhao Wu Tao Qi and Yongfeng Huang. 2022. UserBERT: Pre-training User Model with Contrastive Self-supervision. In SIGIR. 2087--2092.","DOI":"10.1145\/3477495.3531810"},{"key":"e_1_3_2_2_49_1","doi-asserted-by":"crossref","unstructured":"Fangxiong Xiao Lixi Deng Jingjing Chen Houye Ji Xiaorui Yang Zhuoye Ding and Bo Long. 2022. From Abstract to Details: A Generative Multimodal Fusion Framework for Recommendation. In ACM MM. 258--267.","DOI":"10.1145\/3503161.3548366"},{"key":"e_1_3_2_2_50_1","volume-title":"Controllable Textual Inversion for Personalized Text-to-Image Generation. CoRR","author":"Yang Jianan","year":"2023","unstructured":"Jianan Yang, Haobo Wang, Ruixuan Xiao, Sai Wu, Gang Chen, and Junbo Zhao. 2023. Controllable Textual Inversion for Personalized Text-to-Image Generation. CoRR , Vol. abs\/2304.05265 (2023)."},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"crossref","unstructured":"Shiquan Yang Rui Zhang Sarah M. Erfani and Jey Han Lau. 2022. An Interpretable Neuro-Symbolic Reasoning Framework for Task-Oriented Dialogue Generation. In ACL. 4918--4935.","DOI":"10.18653\/v1\/2022.acl-long.338"},{"key":"e_1_3_2_2_52_1","volume-title":"Contrastive Learning with Positive-Negative Frame Mask for Music Representation. In The ACM Web Conference 2022 (WWW). 2906--2915","author":"Yao Dong","year":"2022","unstructured":"Dong Yao, Zhou Zhao, Shengyu Zhang, Jieming Zhu, Yudong Zhu, Rui Zhang, and Xiuqiang He. 2022. Contrastive Learning with Positive-Negative Frame Mask for Music Representation. In The ACM Web Conference 2022 (WWW). 2906--2915."},{"key":"e_1_3_2_2_53_1","volume-title":"MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer. In WWW.","author":"Yao Dong","year":"2024","unstructured":"Dong Yao, Jieming Zhu, Jiahao Xun, Shengyu Zhang, Zhou Zhao, Liqun Deng, Wenqiao Zhang, Zhenhua Dong, and Xin Jiang. 2024. MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer. In WWW."},{"key":"e_1_3_2_2_54_1","volume-title":"Felix X. Yu, Ting Chen, Aditya Krishna Menon, Lichan Hong, Ed H. Chi, Steve Tjoa, Jieqi (Jay) Kang, and Evan Ettinger.","author":"Yao Tiansheng","year":"2021","unstructured":"Tiansheng Yao, Xinyang Yi, Derek Zhiyuan Cheng, Felix X. Yu, Ting Chen, Aditya Krishna Menon, Lichan Hong, Ed H. Chi, Steve Tjoa, Jieqi (Jay) Kang, and Evan Ettinger. 2021. Self-supervised Learning for Large-scale Item Recommendations. In CIKM. 4321--4330."},{"key":"e_1_3_2_2_55_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3613915"},{"key":"e_1_3_2_2_56_1","doi-asserted-by":"publisher","DOI":"10.1109\/BigData55660.2022.10020786"},{"key":"e_1_3_2_2_57_1","doi-asserted-by":"crossref","unstructured":"Yi Yu Kiyoharu Aizawa Toshihiko Yamasaki and Roger Zimmermann. 2014. Emerging Topics on Personalized and Localized Multimedia Information Systems. In ACM MM. 1233--1234.","DOI":"10.1145\/2647868.2654850"},{"key":"e_1_3_2_2_58_1","doi-asserted-by":"publisher","DOI":"10.1145\/3397271.3401156"},{"key":"e_1_3_2_2_59_1","volume-title":"Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning. CoRR","author":"Zhang Lingzi","year":"2023","unstructured":"Lingzi Zhang, Xin Zhou, and Zhiqi Shen. 2023. Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning. CoRR (2023)."},{"key":"e_1_3_2_2_60_1","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2021\/462"},{"key":"e_1_3_2_2_61_1","volume-title":"Enhancing Dyadic Relations with Homogeneous Graphs for Multimodal Recommendation. In ECAI","author":"Zhou Hongyu","year":"2023","unstructured":"Hongyu Zhou, Xin Zhou, and Zhiqi Shen. 2023 a. Enhancing Dyadic Relations with Homogeneous Graphs for Multimodal Recommendation. In ECAI 2023. 3123--3130."},{"key":"e_1_3_2_2_62_1","volume-title":"2023 c. A Comprehensive Survey on Multimodal Recommender Systems: Taxonomy, Evaluation, and Future Directions. CoRR","author":"Zhou Hongyu","year":"2023","unstructured":"Hongyu Zhou, Xin Zhou, Zhiwei Zeng, Lingzi Zhang, and Zhiqi Shen. 2023 c. A Comprehensive Survey on Multimodal Recommender Systems: Taxonomy, Evaluation, and Future Directions. CoRR , Vol. abs\/2302.04473 (2023)."},{"key":"e_1_3_2_2_63_1","volume-title":"Yutao Zhu, Sirui Wang, Fuzheng Zhang, Zhongyuan Wang, and Ji-Rong Wen.","author":"Zhou Kun","year":"2020","unstructured":"Kun Zhou, Hui Wang, Wayne Xin Zhao, Yutao Zhu, Sirui Wang, Fuzheng Zhang, Zhongyuan Wang, and Ji-Rong Wen. 2020. S3-Rec: Self-Supervised Learning for Sequential Recommendation with Mutual Information Maximization. In CIKM. 1893--1902."},{"key":"e_1_3_2_2_64_1","doi-asserted-by":"crossref","unstructured":"Xin Zhou and Zhiqi Shen. 2023. A tale of two graphs: Freezing and denoising graph structures for multimodal recommendation. In ACM MM. 935--943.","DOI":"10.1145\/3581783.3611943"},{"key":"e_1_3_2_2_65_1","doi-asserted-by":"publisher","DOI":"10.1145\/3543507.3583251"},{"key":"e_1_3_2_2_66_1","volume-title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. CoRR","author":"Zhu Deyao","year":"2023","unstructured":"Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny. 2023. MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. CoRR , Vol. abs\/2304.10592 (2023)."},{"key":"e_1_3_2_2_67_1","doi-asserted-by":"crossref","unstructured":"Hongyuan Zhu Ye Niu Di Fu and Hao Wang. 2021. MusicBERT: A Self-supervised Learning of Music Representation. In ACM MM. 3955--3963.","DOI":"10.1145\/3474085.3475576"},{"key":"e_1_3_2_2_68_1","doi-asserted-by":"publisher","DOI":"10.1145\/3477495.3531723"}],"event":{"name":"WWW '24: The ACM Web Conference 2024","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"],"location":"Singapore Singapore","acronym":"WWW '24"},"container-title":["Companion Proceedings of the ACM Web Conference 2024"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3589335.3641248","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3589335.3641248","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:37:59Z","timestamp":1755823079000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3589335.3641248"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5,13]]},"references-count":68,"alternative-id":["10.1145\/3589335.3641248","10.1145\/3589335"],"URL":"https:\/\/doi.org\/10.1145\/3589335.3641248","relation":{},"subject":[],"published":{"date-parts":[[2024,5,13]]},"assertion":[{"value":"2024-05-13","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}