{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,15]],"date-time":"2026-04-15T18:17:57Z","timestamp":1776277077476,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":56,"publisher":"ACM","funder":[{"name":"National Natural Science Foundation of China","award":["62272437"],"award-info":[{"award-number":["62272437"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755051","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T05:56:43Z","timestamp":1761371803000},"page":"9667-9676","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["DRC: Enhancing Personalized Image Generation via Disentangled Representation Composition"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5937-7289","authenticated-orcid":false,"given":"Yiyan","family":"Xu","sequence":"first","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-2021-9906","authenticated-orcid":false,"given":"Wuqiang","family":"Zheng","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5199-1428","authenticated-orcid":false,"given":"Wenjie","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6776-2040","authenticated-orcid":false,"given":"Fengbin","family":"Zhu","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-5803-530X","authenticated-orcid":false,"given":"Xinting","family":"Hu","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7863-5183","authenticated-orcid":false,"given":"Yang","family":"Zhang","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5828-9842","authenticated-orcid":false,"given":"Fuli","family":"Feng","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6097-7807","authenticated-orcid":false,"given":"Tat-Seng","family":"Chua","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling. arXiv:2501.17811","author":"Chen Xiaokang","year":"2025","unstructured":"Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, and Chong Ruan. 2025. Janus-pro: Unified multimodal understanding and generation with data and model scaling. arXiv:2501.17811 (2025)."},{"key":"e_1_3_2_1_2_1","first-page":"7727","article-title":"Tailored visions: Enhancing text-to-image generation with personalized prompt rewriting","author":"Chen Zijie","year":"2024","unstructured":"Zijie Chen, Lichao Zhang, Fangsheng Weng, Lili Pan, and Zhenzhong Lan. 2024. Tailored visions: Enhancing text-to-image generation with personalized prompt rewriting. In CVPR. 7727-7736.","journal-title":"CVPR."},{"key":"e_1_3_2_1_3_1","unstructured":"Chaorui Deng Deyao Zhu Kunchang Li Chenhui Gou Feng Li Zeyu Wang Shu Zhong Weihao Yu Xiaonan Nie Ziang Song et al. 2025. Emerging properties in unified multimodal pretraining. arXiv:2505.14683 (2025)."},{"key":"e_1_3_2_1_4_1","first-page":"5154","article-title":"Disentangled and controllable face image generation via 3d imitative-contrastive learning","author":"Deng Yu","year":"2020","unstructured":"Yu Deng, Jiaolong Yang, Dong Chen, Fang Wen, and Xin Tong. 2020. Disentangled and controllable face image generation via 3d imitative-contrastive learning. In CVPR. 5154-5163.","journal-title":"CVPR."},{"key":"e_1_3_2_1_5_1","unstructured":"Runpei Dong Chunrui Han Yuang Peng Zekun Qi Zheng Ge Jinrong Yang Liang Zhao Jianjian Sun Hongyu Zhou Haoran Wei Xiangwen Kong Xiangyu Zhang Kaisheng Ma and Li Yi. 2024. DreamLLM: Synergistic Multimodal Comprehension and Creation. In ICLR."},{"key":"e_1_3_2_1_6_1","unstructured":"Patrick Esser Sumith Kulal Andreas Blattmann Rahim Entezari Jonas M\u00fcller Harry Saini Yam Levi Dominik Lorenz Axel Sauer Frederic Boesel et al. 2024. Scaling rectified flow transformers for high-resolution image synthesis. In ICML."},{"key":"e_1_3_2_1_7_1","volume-title":"Gal Chechik, and Daniel Cohen-or.","author":"Gal Rinon","year":"2023","unstructured":"Rinon Gal, Yuval Alaluf, Yuval Atzmon, Or Patashnik, Amit Haim Bermano, Gal Chechik, and Daniel Cohen-or. 2023. An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion. In ICLR."},{"key":"e_1_3_2_1_8_1","volume-title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation. arXiv:2404.14396","author":"Ge Yuying","year":"2024","unstructured":"Yuying Ge, Sijie Zhao, Jinguo Zhu, Yixiao Ge, Kun Yi, Lin Song, Chen Li, Xiaohan Ding, and Ying Shan. 2024. Seed-x: Multimodal models with unified multi-granularity comprehension and generation. arXiv:2404.14396 (2024)."},{"key":"e_1_3_2_1_9_1","unstructured":"Aaron Grattafiori Abhimanyu Dubey Abhinav Jauhri Abhinav Pandey Abhishek Kadian Ahmad Al-Dahle Aiesha Letman Akhil Mathur Alan Schelten Alex Vaughan et al. 2024. The llama 3 herd of models. arXiv:2407.21783 (2024)."},{"key":"e_1_3_2_1_10_1","unstructured":"Daya Guo Dejian Yang Haowei Zhang Junxiao Song Ruoyu Zhang Runxin Xu Qihao Zhu Shirong Ma Peiyi Wang Xiao Bi et al. 2025. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv:2501.12948 (2025)."},{"key":"e_1_3_2_1_11_1","first-page":"15315","article-title":"Learning attention as disentangler for compositional zero-shot learning","author":"Hao Shaozhe","year":"2023","unstructured":"Shaozhe Hao, Kai Han, and Kwan-Yee K Wong. 2023. Learning attention as disentangler for compositional zero-shot learning. In CVPR. 15315-15324.","journal-title":"CVPR."},{"key":"e_1_3_2_1_12_1","first-page":"7797","article-title":"Learning disentangled identifiers for action-customized text-to-image generation","author":"Huang Siteng","year":"2024","unstructured":"Siteng Huang, Biao Gong, Yutong Feng, Xi Chen, Yuqian Fu, Yu Liu, and Donglin Wang. 2024. Learning disentangled identifiers for action-customized text-to-image generation. In CVPR. 7797-7806.","journal-title":"CVPR."},{"key":"e_1_3_2_1_13_1","first-page":"1501","article-title":"Arbitrary style transfer in real-time with adaptive instance normalization","author":"Huang Xun","year":"2017","unstructured":"Xun Huang and Serge Belongie. 2017. Arbitrary style transfer in real-time with adaptive instance normalization. In ICCV. 1501-1510.","journal-title":"ICCV."},{"key":"e_1_3_2_1_14_1","unstructured":"Yang Jin Kun Xu Kun Xu Liwei Chen Chao Liao Jianchao Tan Yadong Mu et al. 2024. Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization. In ICLR."},{"key":"e_1_3_2_1_15_1","volume-title":"Min Jin Chong, and Xin Lu","author":"Kang Hao","year":"2025","unstructured":"Hao Kang, Stathi Fotiadis, Liming Jiang, Qing Yan, Yumin Jia, Zichuan Liu, Min Jin Chong, and Xin Lu. 2025. Flux Already Knows-Activating Subject-Driven Image Generation without Training. arXiv:2504.11478 (2025)."},{"key":"e_1_3_2_1_16_1","first-page":"19730","article-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In ICML. PMLR, 19730-19742.","journal-title":"ICML. PMLR"},{"key":"e_1_3_2_1_17_1","volume-title":"Style-talker: Finetuning audio language model and style-based text-to-speech model for fast spoken dialogue generation. arXiv:2408.11849","author":"Li Yinghao Aaron","year":"2024","unstructured":"Yinghao Aaron Li, Xilin Jiang, Jordan Darefsky, Ge Zhu, and Nima Mesgarani. 2024. Style-talker: Finetuning audio language model and style-based text-to-speech model for fast spoken dialogue generation. arXiv:2408.11849 (2024)."},{"key":"e_1_3_2_1_18_1","volume-title":"VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning. arXiv:2504.07960","author":"Li Zhong-Yu","year":"2025","unstructured":"Zhong-Yu Li, Ruoyi Du, Juncheng Yan, Le Zhuo, Zhen Li, Peng Gao, Zhanyu Ma, and Ming-Ming Cheng. 2025. VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning. arXiv:2504.07960 (2025)."},{"key":"e_1_3_2_1_19_1","volume-title":"Make-your-3d: Fast and consistent subject-driven 3d content generation","author":"Liu Fangfu","unstructured":"Fangfu Liu, Hanyang Wang, Weiliang Chen, Haowen Sun, and Yueqi Duan. 2024. Make-your-3d: Fast and consistent subject-driven 3d content generation. In ECCV. Springer, 389-406."},{"key":"e_1_3_2_1_20_1","first-page":"34892","article-title":"Visual instruction tuning","volume":"36","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2023. Visual instruction tuning. NeurIPS, Vol. 36 (2023), 34892-34916.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_21_1","first-page":"99","article-title":"Disentangled person image generation","author":"Ma Liqian","year":"2018","unstructured":"Liqian Ma, Qianru Sun, Stamatios Georgoulis, Luc Van Gool, Bernt Schiele, and Mario Fritz. 2018. Disentangled person image generation. In CVPR. 99-108.","journal-title":"CVPR."},{"key":"e_1_3_2_1_22_1","unstructured":"Thao Nguyen Haotian Liu Yuheng Li Mu Cai Utkarsh Ojha and Yong Jae Lee. 2024. Yo'LLaVA: Your Personalized Language and Vision Assistant. In NeurIPS."},{"key":"e_1_3_2_1_23_1","unstructured":"OpenAI. 2024. GPT-4o Image Generation System Card Addendum. https:\/\/openai.com\/index\/gpt-4o-image-generation-system-card-addendum\/."},{"key":"e_1_3_2_1_24_1","unstructured":"Maxime Oquab Timoth\u00e9e Darcet Th\u00e9o Moutakanni Huy Vo Marc Szafraniec Vasil Khalidov Pierre Fernandez Daniel Haziza Francisco Massa Alaaeldin El-Nouby et al. 2023. Dinov2: Learning robust visual features without supervision. arXiv:2304.07193 (2023)."},{"key":"e_1_3_2_1_25_1","volume-title":"Personalized Large Vision-Language Models. arXiv:2412.17610","author":"Pham Chau","year":"2024","unstructured":"Chau Pham, Hoang Phan, David Doermann, and Yunjie Tian. 2024. Personalized Large Vision-Language Models. arXiv:2412.17610 (2024)."},{"key":"e_1_3_2_1_26_1","first-page":"1081","article-title":"Investigating personalization methods in text to music generation","author":"Plitsis Manos","year":"2024","unstructured":"Manos Plitsis, Theodoros Kouzelis, Georgios Paraskevopoulos, Vassilis Katsouros, and Yannis Panagakis. 2024. Investigating personalization methods in text to music generation. In ICASSP. IEEE, 1081-1085.","journal-title":"ICASSP. IEEE"},{"key":"e_1_3_2_1_27_1","volume-title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis. In ICLR.","author":"Podell Dustin","year":"2024","unstructured":"Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas M\u00fcller, Joe Penna, and Robin Rombach. 2024. SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis. In ICLR."},{"key":"e_1_3_2_1_28_1","first-page":"8693","article-title":"Deadiff: An efficient stylization diffusion model with disentangled representations","author":"Qi Tianhao","year":"2024","unstructured":"Tianhao Qi, Shancheng Fang, Yanze Wu, Hongtao Xie, Jiawei Liu, Lang Chen, Qian He, and Yongdong Zhang. 2024. Deadiff: An efficient stylization diffusion model with disentangled representations. In CVPR. 8693-8702.","journal-title":"CVPR."},{"key":"e_1_3_2_1_29_1","volume-title":"Measuring What Makes You Unique: Difference-Aware User Modeling for Enhancing LLM Personalization. arXiv:2503.02450","author":"Qiu Yilun","year":"2025","unstructured":"Yilun Qiu, Xiaoyan Zhao, Yang Zhang, Yimeng Bai, Wenjie Wang, Hong Cheng, Fuli Feng, and Tat-Seng Chua. 2025. Measuring What Makes You Unique: Difference-Aware User Modeling for Enhancing LLM Personalization. arXiv:2503.02450 (2025)."},{"key":"e_1_3_2_1_30_1","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al., 2021. Learning transferable visual models from natural language supervision. In ICML. PmLR, 8748-8763.","journal-title":"ICML. PmLR"},{"key":"e_1_3_2_1_31_1","first-page":"2349","article-title":"Dreambooth3d: Subject-driven text-to-3d generation","author":"Raj Amit","year":"2023","unstructured":"Amit Raj, Srinivas Kaza, Ben Poole, Michael Niemeyer, Nataniel Ruiz, Ben Mildenhall, Shiran Zada, Kfir Aberman, Michael Rubinstein, Jonathan Barron, et al., 2023. Dreambooth3d: Subject-driven text-to-3d generation. In CVPR. 2349-2359.","journal-title":"CVPR."},{"key":"e_1_3_2_1_32_1","first-page":"22500","article-title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","author":"Ruiz Nataniel","year":"2023","unstructured":"Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, and Kfir Aberman. 2023. Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation. In CVPR. 22500-22510.","journal-title":"CVPR."},{"key":"e_1_3_2_1_33_1","volume-title":"LaMP: When Large Language Models Meet Personalization. In ACL. ACL.","author":"Salemi Alireza","year":"2024","unstructured":"Alireza Salemi, Sheshera Mysore, Michael Bendersky, and Hamed Zamani. 2024. LaMP: When Large Language Models Meet Personalization. In ACL. ACL."},{"key":"e_1_3_2_1_34_1","first-page":"3833","article-title":"Pmg: Personalized multimodal generation with large language models","author":"Shen Xiaoteng","year":"2024","unstructured":"Xiaoteng Shen, Rui Zhang, Xiaoyan Zhao, Jieming Zhu, and Xi Xiao. 2024. Pmg: Personalized multimodal generation with large language models. In WWW. 3833-3843.","journal-title":"WWW."},{"key":"e_1_3_2_1_35_1","volume-title":"Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556","author":"Simonyan Karen","year":"2014","unstructured":"Karen Simonyan and Andrew Zisserman. 2014. Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556 (2014)."},{"key":"e_1_3_2_1_36_1","volume-title":"Measuring style similarity in diffusion models. arXiv:2404.01292","author":"Somepalli Gowthami","year":"2024","unstructured":"Gowthami Somepalli, Anubhav Gupta, Kamal Gupta, Shramay Palta, Micah Goldblum, Jonas Geiping, Abhinav Shrivastava, and Tom Goldstein. 2024. Measuring style similarity in diffusion models. arXiv:2404.01292 (2024)."},{"key":"e_1_3_2_1_37_1","volume-title":"Chameleon: Mixed-modal early-fusion foundation models. arXiv:2405.09818","author":"Team Chameleon","year":"2024","unstructured":"Chameleon Team. 2024. Chameleon: Mixed-modal early-fusion foundation models. arXiv:2405.09818 (2024)."},{"key":"e_1_3_2_1_38_1","first-page":"5825","article-title":"Chaining text-to-image and large language model: A novel approach for generating personalized e-commerce banners","author":"Vashishtha Shanu","year":"2024","unstructured":"Shanu Vashishtha, Abhinav Prakash, Lalitesh Morishetti, Kaushiki Nag, Yokila Arora, Sushant Kumar, and Kannan Achan. 2024. Chaining text-to-image and large language model: A novel approach for generating personalized e-commerce banners. In KDD. 5825-5835.","journal-title":"KDD."},{"key":"e_1_3_2_1_39_1","first-page":"9326","article-title":"Disco: Disentangled control for realistic human dance generation","author":"Wang Tan","year":"2024","unstructured":"Tan Wang, Linjie Li, Kevin Lin, Yuanhao Zhai, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, and Lijuan Wang. 2024a. Disco: Disentangled control for realistic human dance generation. In CVPR. 9326-9336.","journal-title":"CVPR."},{"key":"e_1_3_2_1_40_1","first-page":"21303","article-title":"I-AM-G","author":"Wang Xianquan","year":"2024","unstructured":"Xianquan Wang, Likang Wu, Shukang Yin, Zhi Li, Yanjiang Chen, Hufeng Hufeng, Yu Su, and Qi Liu. 2024b. I-AM-G: Interest Augmented Multimodal Generator for Item Personalization. In EMNLP. 21303-21317.","journal-title":"Interest Augmented Multimodal Generator for Item Personalization. In EMNLP."},{"key":"e_1_3_2_1_41_1","volume-title":"Masterweaver: Taming editability and face identity for personalized text-to-image generation","author":"Wei Yuxiang","year":"2024","unstructured":"Yuxiang Wei, Zhilong Ji, Jinfeng Bai, Hongzhi Zhang, Lei Zhang, and Wangmeng Zuo. 2024a. Masterweaver: Taming editability and face identity for personalized text-to-image generation. In ECCV. Springer, 252-271."},{"key":"e_1_3_2_1_42_1","first-page":"6537","article-title":"Dreamvideo: Composing your dream videos with customized subject and motion","author":"Wei Yujie","year":"2024","unstructured":"Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, and Hongming Shan. 2024b. Dreamvideo: Composing your dream videos with customized subject and motion. In CVPR. 6537-6549.","journal-title":"CVPR."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i8.32904"},{"key":"e_1_3_2_1_44_1","volume-title":"Videomaker: Zero-shot customized video generation with the inherent force of video diffusion models. arXiv:2412.19645","author":"Wu Tao","year":"2024","unstructured":"Tao Wu, Yong Zhang, Xiaodong Cun, Zhongang Qi, Junfu Pu, Huanzhang Dou, Guangcong Zheng, Ying Shan, and Xi Li. 2024. Videomaker: Zero-shot customized video generation with the inherent force of video diffusion models. arXiv:2412.19645 (2024)."},{"key":"e_1_3_2_1_45_1","first-page":"13294","article-title":"Omnigen: Unified image generation","author":"Xiao Shitao","year":"2025","unstructured":"Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan, Xingrun Xing, Ruiran Yan, Chaofan Li, Shuting Wang, Tiejun Huang, and Zheng Liu. 2025. Omnigen: Unified image generation. In CVPR. 13294-13304.","journal-title":"CVPR."},{"key":"e_1_3_2_1_46_1","volume-title":"Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, and Mike Zheng Shou.","author":"Xie Jinheng","year":"2025","unstructured":"Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, and Mike Zheng Shou. 2025. Show-o: One Single Transformer to Unify Multimodal Understanding and Generation. In ICLR."},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3345180"},{"key":"e_1_3_2_1_48_1","first-page":"1350","article-title":"Diffusion models for generative outfit recommendation","author":"Xu Yiyan","year":"2024","unstructured":"Yiyan Xu, Wenjie Wang, Fuli Feng, Yunshan Ma, Jizhi Zhang, and Xiangnan He. 2024b. Diffusion models for generative outfit recommendation. In SIGIR. 1350-1359.","journal-title":"SIGIR."},{"key":"e_1_3_2_1_49_1","volume-title":"Personalized Image Generation with Large Multimodal Models. arXiv:2410.14170","author":"Xu Yiyan","year":"2024","unstructured":"Yiyan Xu, Wenjie Wang, Yang Zhang, Biao Tang, Peng Yan, Fuli Feng, and Xiangnan He. 2024c. Personalized Image Generation with Large Multimodal Models. arXiv:2410.14170 (2024)."},{"key":"e_1_3_2_1_50_1","volume-title":"Sgdm: an adaptive style-guided diffusion model for personalized text to image generation. TMM","author":"Xu Yifei","year":"2024","unstructured":"Yifei Xu, Xiaolong Xu, Honghao Gao, and Fu Xiao. 2024d. Sgdm: an adaptive style-guided diffusion model for personalized text to image generation. TMM (2024)."},{"key":"e_1_3_2_1_51_1","volume-title":"Personalized Generation In Large Model Era: A Survey. arXiv:2503.02614","author":"Xu Yiyan","year":"2025","unstructured":"Yiyan Xu, Jinghao Zhang, Alireza Salemi, Xinting Hu, Wenjie Wang, Fuli Feng, Hamed Zamani, Xiangnan He, and Tat-Seng Chua. 2025. Personalized Generation In Large Model Era: A Survey. arXiv:2503.02614 (2025)."},{"key":"e_1_3_2_1_52_1","unstructured":"An Yang Baosong Yang Beichen Zhang Binyuan Hui Bo Zheng Bowen Yu Chengyuan Li Dayiheng Liu Fei Huang Haoran Wei et al. 2024a. Qwen2.5 technical report. arXiv:2412.15115 (2024)."},{"key":"e_1_3_2_1_53_1","first-page":"180","article-title":"A New Creative Generation Pipeline for Click-Through Rate with Stable Diffusion Model","author":"Yang Hao","year":"2024","unstructured":"Hao Yang, Jianxin Yuan, Shuai Yang, Linhe Xu, Shuo Yuan, and Yifan Zeng. 2024b. A New Creative Generation Pipeline for Click-Through Rate with Stable Diffusion Model. In WWW. 180-189.","journal-title":"WWW."},{"key":"e_1_3_2_1_54_1","first-page":"586","article-title":"The unreasonable effectiveness of deep features as a perceptual metric","author":"Zhang Richard","year":"2018","unstructured":"Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, and Oliver Wang. 2018. The unreasonable effectiveness of deep features as a perceptual metric. In CVPR. 586-595.","journal-title":"CVPR."},{"key":"e_1_3_2_1_55_1","volume-title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model. In ICLR.","author":"Zhou Chunting","year":"2025","unstructured":"Chunting Zhou, LILI YU, Arun Babu, Kushal Tirumala, Michihiro Yasunaga, Leonid Shamis, Jacob Kahn, Xuezhe Ma, Luke Zettlemoyer, and Omer Levy. 2025. Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model. In ICLR."},{"key":"e_1_3_2_1_56_1","unstructured":"Deyao Zhu Jun Chen Xiaoqian Shen Xiang Li and Mohamed Elhoseiny. 2024. MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. In ICLR."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755051","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:07:51Z","timestamp":1765339671000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755051"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":56,"alternative-id":["10.1145\/3746027.3755051","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755051","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}