{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T01:55:55Z","timestamp":1784426155030,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":38,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,28]],"date-time":"2024-10-28T00:00:00Z","timestamp":1730073600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,28]]},"DOI":"10.1145\/3664647.3681498","type":"proceedings-article","created":{"date-parts":[[2024,10,26]],"date-time":"2024-10-26T06:59:33Z","timestamp":1729925973000},"page":"7591-7599","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":91,"title":["DiffMM: Multi-Modal Diffusion Model for Recommendation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-3936-1703","authenticated-orcid":false,"given":"Yangqin","family":"Jiang","sequence":"first","affiliation":[{"name":"University of Hong Kong, Hong Kong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0725-2211","authenticated-orcid":false,"given":"Lianghao","family":"Xia","sequence":"additional","affiliation":[{"name":"University of Hong Kong, Hong Kong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6653-3788","authenticated-orcid":false,"given":"Wei","family":"Wei","sequence":"additional","affiliation":[{"name":"University of Hong Kong, Hong Kong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1183-8354","authenticated-orcid":false,"given":"Da","family":"Luo","sequence":"additional","affiliation":[{"name":"Wechat, Tencent, Guang Zhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6259-392X","authenticated-orcid":false,"given":"Kangyi","family":"Lin","sequence":"additional","affiliation":[{"name":"Wechat, Tencent, Guang Zhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2062-1512","authenticated-orcid":false,"given":"Chao","family":"Huang","sequence":"additional","affiliation":[{"name":"University of Hong Kong, Hong Kong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,10,28]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Xianshuai Cao Yuliang Shi Jihu Wang Han Yu Xinjun Wang and Zhongmin Yan. 2022. Cross-modal knowledge graph contrastive learning for machine learning method recommendation. In MM. 3694--3702."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Jingyuan Chen Hanwang Zhang Xiangnan He Liqiang Nie Wei Liu and Tat Seng Chua. 2017. Attentive collaborative filtering: Multimedia recommendation with item-and component-level attention. In SIGIR. 335--344.","DOI":"10.1145\/3077136.3080797"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Xu Chen Hanxiong Chen Hongteng Xu Yongfeng Zhang Yixin Cao Zheng Qin and Hongyuan Zha. 2019. Personalized fashion recommendation with visual explanations based on multimodal attention network: Towards visually explainable recommendation. In SIGIR. 765--774.","DOI":"10.1145\/3331184.3331254"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Yongjun Chen Zhiwei Liu Jia Li Julian McAuley and Caiming Xiong.2022. Intent contrastive learning for sequential recommendation. In WWW. 2172--2182.","DOI":"10.1145\/3485447.3512090"},{"key":"e_1_3_2_1_5_1","volume-title":"Radu Tudor Ionescu, and Mubarak Shah","author":"Croitoru Florinel-Alin","year":"2023","unstructured":"Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu, and Mubarak Shah. 2023. Diffusion models in vision: A survey. Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2023)."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2020.09.013"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.9973"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1145\/3397271.3401063"},{"key":"e_1_3_2_1_9_1","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho Jonathan","year":"2020","unstructured":"Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. In NeurIPS, Vol. 33. 6840--6851.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Yangqin Jiang Chao Huang and Lianghao Huang. 2023. Adaptive graph con trastive learning for recommendation. In KDD. 4252--4261.","DOI":"10.1145\/3580305.3599768"},{"key":"e_1_3_2_1_11_1","volume-title":"DiffKG: Knowl edgeGraph Diffusion Model for Recommendation. arXivpreprintarXiv:2312.16890","author":"Jiang Yangqin","year":"2023","unstructured":"Yangqin Jiang, Yuhao Yang, Lianghao Xia, and Chao Huang. 2023. DiffKG: Knowl edgeGraph Diffusion Model for Recommendation. arXivpreprintarXiv:2312.16890 (2023)."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Dawen Liang Rahul G Krishnan Matthew D Hoffman and Tony Jebara. 2018. Variational autoencoders for collaborative filtering. In WWW. 689--698.","DOI":"10.1145\/3178876.3186150"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Zihan Lin Changxin Tian Yupeng Hou and Wayne Xin Zhao. 2022. Improving graph collaborative filtering with neighborhood-enriched contrastive learning. In WWW.2320--2329.","DOI":"10.1145\/3485447.3512104"},{"key":"e_1_3_2_1_14_1","volume-title":"Disentangled multimodal representation learning for recommendation. Transactions on Multimedia (TMM)","author":"Liu Fan","year":"2022","unstructured":"Fan Liu, Huilin Chen, Zhiyong Cheng, Anan Liu, Liqiang Nie, and Mohan Kankan halli. 2022. Disentangled multimodal representation learning for recommendation. Transactions on Multimedia (TMM) (2022)."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Qidong Liu Fan Yan Xiangyu Zhao Zhaocheng Du Huifeng Guo Ruiming Tang and Feng Tian. 2023. Diffusion Augmentation for Sequential Recommendation. In CIKM. 1576--1586.","DOI":"10.1145\/3583780.3615134"},{"key":"e_1_3_2_1_16_1","volume-title":"NeurIPS","volume":"32","author":"Ma Jianxin","year":"2019","unstructured":"Jianxin Ma, Chang Zhou, Peng Cui, Hongxia Yang, and Wenwu Zhu. 2019. Learn ing disentangled representations for recommendation. In NeurIPS, Vol. 32."},{"key":"e_1_3_2_1_17_1","volume-title":"Causalrec: Causal inference for visual debiasing in visually-aware recommendation. In MM. 3844--3852.","author":"Qiu Ruihong","year":"2021","unstructured":"Ruihong Qiu, Sen Wang, Zhi Chen, Hongzhi Yin, and Zi Huang. 2021. Causalrec: Causal inference for visual debiasing in visually-aware recommendation. In MM. 3844--3852."},{"key":"e_1_3_2_1_18_1","volume-title":"BPR: Bayesian personalized ranking from implicit feedback. In UAI. 452 461.","author":"Rendle Stefen","year":"2009","unstructured":"Stefen Rendle, Christoph Freudenthaler, Zeno Gantner, and Lars Schmidt-Thieme. 2009. BPR: Bayesian personalized ranking from implicit feedback. In UAI. 452 461."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6rn Ommer. 2022. High-resolution image synthesis with latent diffusion models. In CVPR. 10684--10695.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_20_1","volume-title":"Self-supervised learning for multimedia recommendation. Transactions on Multimedia (TMM)","author":"Tao Zhulin","year":"2022","unstructured":"Zhulin Tao, Xiaohao Liu, Yewei Xia, Xiang Wang, Lifang Yang, Xianglin Huang, and Tat-Seng Chua. 2022. Self-supervised learning for multimedia recommendation. Transactions on Multimedia (TMM) (2022)."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Di Wang Quan Wang Yaqiang An Xinbo Gao and Yumin Tian. 2020. Online collective matrix factorization hashing for large-scale cross-media retrieval. In SIGIR. 1409--1418.","DOI":"10.1145\/3397271.3401132"},{"key":"e_1_3_2_1_22_1","volume-title":"Diffusion Recommender Model. arXiv preprint arXiv:2304.04971","author":"Wang Wenjie","year":"2023","unstructured":"Wenjie Wang, Yiyan Xu, Fuli Feng, Xinyu Lin, Xiangnan He, and Tat-Seng Chua. 2023. Diffusion Recommender Model. arXiv preprint arXiv:2304.04971 (2023)."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Xiang Wang Xiangnan He Meng Wang Fuli Feng and Tat-Seng Chua. 2019. Neural graph collaborative filtering. In SIGIR. 165--174.","DOI":"10.1145\/3331184.3331267"},{"key":"e_1_3_2_1_24_1","volume-title":"Conditional Denois ing Diffusion for Sequential Recommendation. arXiv preprint arXiv:2304.11433","author":"Wang Yu","year":"2023","unstructured":"Yu Wang, Zhiwei Liu, Liangwei Yang, and Philip S Yu. 2023. Conditional Denois ing Diffusion for Sequential Recommendation. arXiv preprint arXiv:2304.11433 (2023)."},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Wei Wei Chao Huang Lianghao Xia and Chuxu Zhang. 2023. Multi-Modal Self-Supervised Learning for Recommendation. In WWW. 790--800.","DOI":"10.1145\/3543507.3583206"},{"key":"e_1_3_2_1_26_1","volume-title":"PromptMM: Multi-Modal Knowledge Distillation for Recommendation with Prompt-Tuning. arXiv preprint arXiv:2402.17188","author":"Wei Wei","year":"2024","unstructured":"Wei Wei, Jiabin Tang, Yangqin Jiang, Lianghao Xia, and Chao Huang. 2024. PromptMM: Multi-Modal Knowledge Distillation for Recommendation with Prompt-Tuning. arXiv preprint arXiv:2402.17188 (2024)."},{"key":"e_1_3_2_1_27_1","volume-title":"Lightgt: A light graph transformer for multimedia recommendation. In SIGIR. 1508--1517.","author":"Wei Yinwei","year":"2023","unstructured":"Yinwei Wei, Wenqi Liu, Fan Liu, Xiang Wang, Liqiang Nie, and Tat-Seng Chua. 2023. Lightgt: A light graph transformer for multimedia recommendation. In SIGIR. 1508--1517."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3088307"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Yinwei Wei Xiang Wang Qi Li Liqiang Nie Yan Li Xuanping Li and Tat-Seng Chua. 2021. Contrastive learning for cold-start recommendation. In MM. 5382 5390.","DOI":"10.1145\/3474085.3475665"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Yinwei Wei Xiang Wang Liqiang Nie Xiangnan He and Tat-Seng Chua. 2020. Graph-refined convolutional network for multimedia recommendation with implicit feedback. In MM. 3541--3549.","DOI":"10.1145\/3394171.3413556"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3351034"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Jiancan Wu Xiang Wang Fuli Feng Xiangnan He Liang Chen Jianxun Lian and Xing Xie. 2021. Self-supervised graph learning for recommendation. In SIGIR. 726--735.","DOI":"10.1145\/3404835.3462862"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Lianghao Xia Chao Huang Yong Xu Jiashu Zhao Dawei Yin and Jimmy Huang. 2022. Hypergraph contrastive collaborative filtering. In SIGIR. 70--79.","DOI":"10.1145\/3477495.3532058"},{"key":"e_1_3_2_1_34_1","volume-title":"Contrastive learning for sequential recommendation","author":"Xie Xu","unstructured":"Xu Xie, Fei Sun, Zhaoyang Liu, Shiwen Wu, Jinyang Gao, Jiandong Zhang, Bolin Ding, and Bin Cui. 2022. Contrastive learning for sequential recommendation. In ICDE. IEEE, 1259--1273."},{"key":"e_1_3_2_1_35_1","unstructured":"Zixuan Yi Xi Wang Iadh Ounis and Craig Macdonald. 2022. Multi-modal graph contrastive learning for micro-video recommendation. In SIGIR. 1807--1811."},{"key":"e_1_3_2_1_36_1","volume-title":"Nguyen Quoc Viet Hung, and Xiangliang Zhang","author":"Yu Junliang","year":"2021","unstructured":"Junliang Yu, Hongzhi Yin, Jundong Li, Qinyong Wang, Nguyen Quoc Viet Hung, and Xiangliang Zhang. 2021. Self-supervised multi-channel hypergraph convolutional network for social recommendation. In WWW. 413--424."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"Jinghao Zhang Yanqiao Zhu Qiang Liu Shu Wu Shuhui Wang and Liang Wang. 2021. Mining latent structures for multimedia recommendation. In MM. 3872--3880.","DOI":"10.1145\/3474085.3475259"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"crossref","unstructured":"Xin Zhou Hongyu Zhou Yong Liu Zhiwei Zeng Chunyan Miao Pengwei Wang Yuan You and Feijun Jiang. 2023. Bootstrap latent representations for multi modal recommendation. In WWW. 845--854","DOI":"10.1145\/3543507.3583251"}],"event":{"name":"MM '24: The 32nd ACM International Conference on Multimedia","location":"Melbourne VIC Australia","acronym":"MM '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 32nd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3681498","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3664647.3681498","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T00:57:48Z","timestamp":1750294668000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3681498"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,28]]},"references-count":38,"alternative-id":["10.1145\/3664647.3681498","10.1145\/3664647"],"URL":"https:\/\/doi.org\/10.1145\/3664647.3681498","relation":{},"subject":[],"published":{"date-parts":[[2024,10,28]]},"assertion":[{"value":"2024-10-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}