{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T20:11:52Z","timestamp":1776888712325,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":29,"publisher":"ACM","funder":[{"name":"Beijing Natural Science Foundation","award":["JQ24019"],"award-info":[{"award-number":["JQ24019"]}]},{"name":"the Open Project Program of State Key Laboratory of CNS\/ATM","award":["No.2024B31"],"award-info":[{"award-number":["No.2024B31"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,12,9]]},"DOI":"10.1145\/3743093.3771055","type":"proceedings-article","created":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:08:11Z","timestamp":1765008491000},"page":"1-7","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Stance-Driven Multimodal Controlled Statement Generation: New Task and Dataset"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-6354-657X","authenticated-orcid":false,"given":"Bingqian","family":"Wang","sequence":"first","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4190-1529","authenticated-orcid":false,"given":"Quan","family":"Fang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-3992-9345","authenticated-orcid":false,"given":"Xiaoxiao","family":"Ma","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,6]]},"reference":[{"key":"e_1_3_3_2_2_2","unstructured":"Jinze Bai Shuai Bai Shusheng Yang Shijie Wang Sinan Tan Peng Wang Junyang Lin Chang Zhou and Jingren Zhou. 2023. Qwen-VL: A Versatile Vision-Language Model for Understanding Localization Text Reading and Beyond. arxiv:https:\/\/arXiv.org\/abs\/2308.12966\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2308.12966"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"crossref","unstructured":"Jacob Cohen. 1960. A coefficient of agreement for nominal scales. Educational and psychological measurement 20 1 (1960) 37\u201346.","DOI":"10.1177\/001316446002000104"},{"key":"e_1_3_3_2_4_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.157"},{"key":"e_1_3_3_2_5_2","unstructured":"DeepSeek-AI Aixin Liu Bei Feng Bing Xue Bingxuan Wang and et al.2024. DeepSeek-V3 Technical Report. CoRR abs\/2412.19437 (2024)."},{"key":"e_1_3_3_2_6_2","unstructured":"Abhimanyu Dubey Abhinav Jauhri Abhinav Pandey Abhishek Kadian Ahmad Al-Dahle Aiesha Letman Akhil Mathur Alan Schelten Amy Yang Angela Fan et\u00a0al. 2024. The llama 3 herd of models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.21783 (2024)."},{"key":"e_1_3_3_2_7_2","unstructured":"Edward\u00a0J Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2021. Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2106.09685 (2021)."},{"key":"e_1_3_3_2_8_2","unstructured":"Aaron Hurst Adam Lerer Adam\u00a0P. Goucher Adam Perelman Aditya Ramesh Aidan Clark and et al.2024. GPT-4o System Card. CoRR abs\/2410.21276 (2024)."},{"key":"e_1_3_3_2_9_2","doi-asserted-by":"crossref","unstructured":"Dilek K\u00fc\u00e7\u00fck and Fazli Can. 2021. Stance Detection: A Survey. ACM Comput. Surv. 53 1 (2021) 12:1\u201312:37.","DOI":"10.1145\/3369026"},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"crossref","unstructured":"J\u00a0Richard Landis and Gary\u00a0G Koch. 1977. The measurement of observer agreement for categorical data. biometrics 159-174. (1977).","DOI":"10.2307\/2529310"},{"key":"e_1_3_3_2_11_2","unstructured":"Ming Li Jiuhai Chen Lichang Chen and Tianyi Zhou. 2024. Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements. arxiv:https:\/\/arXiv.org\/abs\/2402.10614\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2402.10614"},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.findings-acl.208"},{"key":"e_1_3_3_2_13_2","doi-asserted-by":"crossref","unstructured":"Bin Liang Ang Li Jingqian Zhao Lin Gui Min Yang Yue Yu Kam-Fai Wong and Ruifeng Xu. 2024. Multi-modal Stance Detection: New Datasets and Model. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.14298 (2024).","DOI":"10.18653\/v1\/2024.findings-acl.736"},{"key":"e_1_3_3_2_14_2","doi-asserted-by":"crossref","unstructured":"Xun Liang Hanyu Wang Shichao Song Mengting Hu Xunzhi Wang Zhiyu Li Feiyu Xiong and Bo Tang. 2024. Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.11218 (2024).","DOI":"10.18653\/v1\/2024.findings-acl.345"},{"key":"e_1_3_3_2_15_2","unstructured":"Xun Liang Hanyu Wang Shichao Song Mengting Hu Xunzhi Wang Zhiyu Li Feiyu Xiong and Bo Tang. 2024. Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs. arxiv:https:\/\/arXiv.org\/abs\/2402.11218\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2402.11218"},{"key":"e_1_3_3_2_16_2","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong\u00a0Jae Lee. 2023. Visual instruction tuning. Advances in neural information processing systems 36 (2023) 34892\u201334916."},{"key":"e_1_3_3_2_17_2","unstructured":"Yi Liu Xiangyu Liu Xiangrong Zhu and Wei Hu. 2024. Multi-Aspect Controllable Text Generation with Disentangled Counterfactual Augmentation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2405.19958 (2024)."},{"key":"e_1_3_3_2_18_2","unstructured":"Yinhan Liu Myle Ott Naman Goyal Jingfei Du Mandar Joshi Danqi Chen Omer Levy Mike Lewis Luke Zettlemoyer and Veselin Stoyanov. 2019. RoBERTa: A Robustly Optimized BERT Pretraining Approach. arxiv:https:\/\/arXiv.org\/abs\/1907.11692\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1907.11692"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","DOI":"10.5555\/2002472.2002491"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/S16-1003"},{"key":"e_1_3_3_2_21_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-acl.229"},{"key":"e_1_3_3_2_22_2","first-page":"8748","volume-title":"International conference on machine learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PMLR, 8748\u20138763."},{"key":"e_1_3_3_2_23_2","first-page":"1","volume-title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis","author":"Rajbhandari Samyam","year":"2020","unstructured":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He. 2020. ZeRO: Memory optimizations toward training trillion parameter models. In Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis. 1\u201316."},{"key":"e_1_3_3_2_24_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.naacl-main.34"},{"key":"e_1_3_3_2_25_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D13-1170"},{"key":"e_1_3_3_2_26_2","unstructured":"Qwen Team. 2024. Qwen2.5 technical report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2412.15115 (2024)."},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657878"},{"key":"e_1_3_3_2_28_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.naacl-main.276"},{"key":"e_1_3_3_2_29_2","unstructured":"Zhian Yang Hao Jiang Aobo Deng and Yang Li. 2024. Topic-Oriented Controlled Text Generation for Social Networks. Journal of Signal Processing Systems (2024) 1\u201321."},{"key":"e_1_3_3_2_30_2","unstructured":"Bowen Zhang Genan Dai Fuqiang Niu Nan Yin Xiaomao Fan and Hu Huang. 2024. A Survey of Stance Detection on Social Media: New Directions and Perspectives. CoRR abs\/2409.15690 (2024)."}],"event":{"name":"MMAsia '25: ACM Multimedia Asia","location":"Kuala Lumpur Malaysia","acronym":"MMAsia '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 7th ACM International Conference on Multimedia in Asia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3743093.3771055","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:08:54Z","timestamp":1765008534000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3743093.3771055"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,6]]},"references-count":29,"alternative-id":["10.1145\/3743093.3771055","10.1145\/3743093"],"URL":"https:\/\/doi.org\/10.1145\/3743093.3771055","relation":{},"subject":[],"published":{"date-parts":[[2025,12,6]]},"assertion":[{"value":"2025-12-06","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}