{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T16:38:38Z","timestamp":1782405518519,"version":"3.54.5"},"reference-count":57,"publisher":"Association for Computing Machinery (ACM)","issue":"9","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["52274160 and 51874300"],"award-info":[{"award-number":["52274160 and 51874300"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Jiangsu Distinguished Professor project in Jiangsu Province","award":["140923070"],"award-info":[{"award-number":["140923070"]}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"crossref","award":["2023QN1079"],"award-info":[{"award-number":["2023QN1079"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Joint Funds of the National Natural Science Foundation of China and the Shanxi Provincial People\u2019s Government for the \u201cCoal Base and Low Carbon Development\u201d project","award":["U1510115"],"award-info":[{"award-number":["U1510115"]}]},{"name":"Jiangsu Graduate Student Research Innovation Program","award":["KYCX25_3057"],"award-info":[{"award-number":["KYCX25_3057"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Trans. Multimedia Comput. Commun. Appl."],"published-print":{"date-parts":[[2025,9,30]]},"abstract":"<jats:p>In the context of the digital age, utilizing cutting-edge technology for the digitization and creative expansion of ancient murals is crucial, aimed at preserving and passing on cultural heritage. Existing image outpainting techniques suffer from a lack of semantic guidance. This article introduces MuralAgent, a multimodal model based on Retrieval-Augmented Generation (RAG) technology. It precisely extracts key information from mural images and integrates it with a constructed ancient texts knowledge base to ensure the cultural and semantic consistency of the expanded images. Moreover, fine-tuning the Stable Diffusion model ensures the fidelity of the generated image styles. Specifically, this study involves constructing an ancient texts knowledge base for accurate matching, designing specific prompts for GPT-4V(ision) to extract key information, and innovatively expanding artworks through Stable Diffusion, providing a novel way for the public to reinterpret ancient murals.<\/jats:p>","DOI":"10.1145\/3743679","type":"journal-article","created":{"date-parts":[[2025,8,26]],"date-time":"2025-08-26T15:44:43Z","timestamp":1756223083000},"page":"1-17","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["MuralAgent: Enhancing Ancient Mural Outpainting with RAG-Based Texts and Multimodal Integration"],"prefix":"10.1145","volume":"21","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-5671-216X","authenticated-orcid":false,"given":"Zishan","family":"Xu","sequence":"first","affiliation":[{"name":"China University of Mining and Technology, Xuzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7185-4682","authenticated-orcid":false,"given":"Xiaofeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-7325-7981","authenticated-orcid":false,"given":"Yuqing","family":"Yang","sequence":"additional","affiliation":[{"name":"China University of Mining and Technology, Xuzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7663-278X","authenticated-orcid":false,"given":"Wei","family":"Chen","sequence":"additional","affiliation":[{"name":"China University of Mining and Technology, Xuzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-2986-2605","authenticated-orcid":false,"given":"Jueting","family":"Liu","sequence":"additional","affiliation":[{"name":"China University of Mining and Technology, Xuzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-1187-8157","authenticated-orcid":false,"given":"Tingting","family":"Xu","sequence":"additional","affiliation":[{"name":"China University of Mining and Technology, Xuzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9040-847X","authenticated-orcid":false,"given":"Zehua","family":"Wang","sequence":"additional","affiliation":[{"name":"China University of Mining and Technology, Xuzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7690-8547","authenticated-orcid":false,"given":"Abdulmotaleb","family":"El Saddik","sequence":"additional","affiliation":[{"name":"University of Ottawa, Ottawa, Ontario, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,9,10]]},"reference":[{"key":"e_1_3_1_2_2","unstructured":"Jinze Bai Shuai Bai Shusheng Yang Shijie Wang Sinan Tan Peng Wang Junyang Lin Chang Zhou and Jingren Zhou. 2023. Qwen-VL: A frontier large vision-language model with versatile abilities. arXiv:2308.12966. Retrieved from https:\/\/arxiv.org\/abs\/2308.12966"},{"key":"e_1_3_1_3_2","doi-asserted-by":"publisher","DOI":"10.1145\/3617597"},{"key":"e_1_3_1_4_2","unstructured":"Wei-Ge Chen Irina Spiridonova Jianwei Yang Jianfeng Gao and Chunyuan Li. 2023. LLaVA-interactive: An all-in-one demo for image chat segmentation generation and editing. arXiv:2311.00571. Retrieved from https:\/\/arxiv.org\/abs\/2311.00571"},{"issue":"5","key":"e_1_3_1_5_2","first-page":"787","article-title":"Inpainting algorithm for Dunhuang mural based on improved curvature-driven diffusion model","volume":"32","author":"Chen Yong","year":"2020","unstructured":"Yong Chen, Yapeng Ai, and Hongguang Guo. 2020. Inpainting algorithm for Dunhuang mural based on improved curvature-driven diffusion model. Journal of Computer-Aided Design & Computer Graphics 32, 5 (2020), 787\u2013796.","journal-title":"Journal of Computer-Aided Design & Computer Graphics"},{"issue":"20","key":"e_1_3_1_6_2","article-title":"Dunhuang mural inpainting algorithm based on sequential similarity detection and cuckoo optimization","volume":"57","author":"Chen Y.","year":"2020","unstructured":"Y. Chen, J. Chen, Y. P. Ai, and M. Tao. 2020. Dunhuang mural inpainting algorithm based on sequential similarity detection and cuckoo optimization. Laser & Optoelectronics Progress 57, 20 (2020), 201020.","journal-title":"Laser & Optoelectronics Progress"},{"key":"e_1_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01114"},{"key":"e_1_3_1_8_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01268"},{"key":"e_1_3_1_9_2","doi-asserted-by":"publisher","DOI":"10.1145\/3580501"},{"key":"e_1_3_1_10_2","doi-asserted-by":"publisher","DOI":"10.1109\/WACVW60836.2024.00102"},{"key":"e_1_3_1_11_2","unstructured":"Difei Gao Lei Ji Luowei Zhou Kevin Qinghong Lin Joya Chen Zihan Fan and Mike Zheng Shou. 2023. AssistGPT: A general multi-modal assistant that can plan execute inspect and learn. arXiv:2306.08640. Retrieved from https:\/\/arxiv.org\/abs\/2306.08640"},{"key":"e_1_3_1_12_2","first-page":"23802","volume-title":"Proceedings of the AAAI Conference on Artificial Intelligence","volume":"38","author":"Huang Rongjie","year":"2024","unstructured":"Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, et al. 2024. AudioGPT: Understanding and generating speech, music, sound, and talking head. In Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 38, 23802\u201323804."},{"key":"e_1_3_1_13_2","doi-asserted-by":"publisher","DOI":"10.1145\/3545572"},{"key":"e_1_3_1_14_2","first-page":"119","article-title":"Wutai Mountain mural inpainting based on improved block matching algorithm","volume":"31","author":"Jiao L. J.","year":"2019","unstructured":"L. J. Jiao, W. J. Wang, B. J. Li, and Q. S. Zhao. 2019. Wutai Mountain mural inpainting based on improved block matching algorithm. J Comput Aid Design Comput Graph 31 (2019), 119\u2013125.","journal-title":"J Comput Aid Design Comput Graph"},{"issue":"11","key":"e_1_3_1_15_2","first-page":"1826","article-title":"Tang dynasty tomb murals inpainting algorithm of MCA decomposition","volume":"11","author":"Shen Jingni","year":"2017","unstructured":"Jingni Shen, Huiqin Wang, Meng Wu, and Wenzong Yang. 2017. Tang dynasty tomb murals inpainting algorithm of MCA decomposition. Journal of Frontiers of Computer Science & Technology 11, 11 (2017), 1826.","journal-title":"Journal of Frontiers of Computer Science & Technology"},{"key":"e_1_3_1_16_2","unstructured":"Sunjae Lee Junyoung Choi Jungjae Lee Munim Hasan Wasi Hojun Choi Steven Y. Ko Sangeun Oh and Insik Shin. 2023. Explore select derive and recall: Augmenting LLM with human-like memory for mobile task automation. arXiv:2312.03003. Retrieved from https:\/\/arxiv.org\/abs\/2312.03003"},{"key":"e_1_3_1_17_2","first-page":"19730","volume-title":"Proceedings of the International Conference on Machine Learning","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023. BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In Proceedings of the International Conference on Machine Learning. PMLR, 19730\u201319742."},{"key":"e_1_3_1_18_2","first-page":"12888","volume-title":"Proceedings of the International Conference on Machine Learning","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In Proceedings of the International Conference on Machine Learning. PMLR, 12888\u201312900."},{"key":"e_1_3_1_19_2","first-page":"9694","article-title":"Align before fuse: Vision and language representation learning with momentum distillation","volume":"34","author":"Li Junnan","year":"2021","unstructured":"Junnan Li, Ramprasaath Selvaraju, Akhilesh Gotmare, Shafiq Joty, Caiming Xiong, and Steven Chu Hong Hoi. 2021. Align before fuse: Vision and language representation learning with momentum distillation. In Proceedings of the Advances in Neural Information Processing Systems, Vol. 34, 9694\u20139705.","journal-title":"Proceedings of the Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_20_2","doi-asserted-by":"publisher","DOI":"10.1145\/3587251"},{"key":"e_1_3_1_21_2","unstructured":"Xiang Lorraine Li Adhiguna Kuncoro Jordan Hoffmann. Cyprien de Masson d\u2019Autume Phil Blunsom and Aida Nematzadeh. 2021. A systematic investigation of commonsense knowledge in large language models. arXiv:2111.00607. Retrieved from https:\/\/arxiv.org\/abs\/2111.00607"},{"key":"e_1_3_1_22_2","article-title":"Visual instruction tuning","volume":"36","author":"Liu Haotian","year":"2024","unstructured":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2024. Visual instruction tuning. In Proceedings of the Advances in Neural Information Processing Systems, Vol. 36.","journal-title":"Proceedings of the Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_23_2","first-page":"17380","volume-title":"Proceedings of the 2024 IEEE International Conference on Robotics and Automation (ICRA)","author":"Long Yuxing","year":"2024","unstructured":"Yuxing Long, Xiaoqi Li, Wenzhe Cai, and Hao Dong. 2024. Discuss before moving: Visual language navigation via multi-expert discussions. In Proceedings of the 2024 IEEE International Conference on Robotics and Automation (ICRA). IEEE, 17380\u201317387."},{"key":"e_1_3_1_24_2","article-title":"Chameleon: Plug-and-play compositional reasoning with large language models","volume":"36","author":"Lu Pan","year":"2024","unstructured":"Pan Lu, Baolin Peng, Hao Cheng, Michel Galley, Kai-Wei Chang, Ying Nian Wu, Song-Chun Zhu, and Jianfeng Gao. 2024. Chameleon: Plug-and-play compositional reasoning with large language models. In Proceedings of the Advances in Neural Information Processing Systems, Vol. 36.","journal-title":"Proceedings of the Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_25_2","unstructured":"Muhammad Maaz Hanoona Rasheed Salman Khan and Fahad Shahbaz Khan. 2023. Video-ChatGPT: Towards detailed video understanding via large vision and language models. arXiv:2306.05424. Retrieved from https:\/\/arxiv.org\/abs\/2306.05424"},{"key":"e_1_3_1_26_2","first-page":"310","article-title":"Digital protection and restoration of Dunhuang mural","volume":"3","author":"Pan Y. H.","year":"2003","unstructured":"Y. H. Pan and D. M. Lu. 2003. Digital protection and restoration of Dunhuang mural. Acta Simulata Systematica Sinica 3 (2003), 310\u2013314.","journal-title":"Acta Simulata Systematica Sinica"},{"key":"e_1_3_1_27_2","unstructured":"Yujia Qin Shihao Liang Yining Ye Kunlun Zhu Lan Yan Yaxi Lu Yankai Lin Xin Cong Xiangru Tang Bill Qian et al. 2023. ToolLLM: Facilitating large language models to master 16000+ real-world APIs. arXiv:2307.16789. Retrieved from https:\/\/arxiv.org\/abs\/2307.16789"},{"key":"e_1_3_1_28_2","first-page":"16307","volume-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Qin Yiran","year":"2024","unstructured":"Yiran Qin, Enshen Zhou, Qichang Liu, Zhenfei Yin, Lu Sheng, Ruimao Zhang, Yu Qiao, and Jing Shao. 2024. MP5: A multi-modal open-ended embodied system in Minecraft via active perception. In Proceedings of the 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, 16307\u201316316."},{"key":"e_1_3_1_29_2","first-page":"8748","volume-title":"Proceedings of the International Conference on Machine Learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In Proceedings of the International Conference on Machine Learning. PMLR, 8748\u20138763."},{"key":"e_1_3_1_30_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_1_31_2","unstructured":"Mark Sabini and Gili Rusak. 2018. Painting outside the box: Image outpainting with GANs. arXiv:1808.08483. Retrieved from https:\/\/arxiv.org\/abs\/1808.08483"},{"key":"e_1_3_1_32_2","article-title":"Toolformer: Language models can teach themselves to use tools","volume":"36","author":"Schick Timo","year":"2024","unstructured":"Timo Schick, Jane Dwivedi-Yu, Roberto Dess\u00ec, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, and Thomas Scialom. 2024. Toolformer: Language models can teach themselves to use tools. In Proceedings of the Advances in Neural Information Processing Systems, Vol. 36.","journal-title":"Proceedings of the Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_33_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01092"},{"key":"e_1_3_1_34_2","unstructured":"Basile Van Hoorick. 2019. Image outpainting and harmonization using generative adversarial networks. arXiv:1912.10960. Retrieved from https:\/\/arxiv.org\/abs\/1912.10960"},{"key":"e_1_3_1_35_2","unstructured":"Junke Wang Dongdong Chen Chong Luo Xiyang Dai Lu Yuan Zuxuan Wu and Yu-Gang Jiang. 2023. ChatVideo: A tracklet-centric multimodal and versatile video understanding system. arXiv:2304.14407. Retrieved from https:\/\/arxiv.org\/abs\/2304.14407"},{"key":"e_1_3_1_36_2","unstructured":"Weihan Wang Qingsong Lv Wenmeng Yu Wenyi Hong Ji Qi Yan Wang Junhui Ji Zhuoyi Yang Lei Zhao Xixuan Song et al. 2023. CogVLM: Visual expert for pretrained language models. arXiv:2311.03079. Retrieved from https:\/\/arxiv.org\/abs\/2311.03079"},{"key":"e_1_3_1_37_2","doi-asserted-by":"publisher","DOI":"10.1145\/3674838"},{"key":"e_1_3_1_38_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00149"},{"key":"e_1_3_1_39_2","unstructured":"He Sicheng Wang Yuxin and Sun Qingxuan. 2023. M3E: Moka Massive Mixed Embedding Model. Retrieved from https:\/\/huggingface.co\/moka-ai\/m3e-base"},{"key":"e_1_3_1_40_2","unstructured":"Chenfei Wu Shengming Yin Weizhen Qi Xiaodong Wang Zecheng Tang and Nan Duan. 2023. Visual ChatGPT: Talking drawing and editing with visual foundation models. arXiv:2303.04671. Retrieved from https:\/\/arxiv.org\/abs\/2303.04671"},{"key":"e_1_3_1_41_2","unstructured":"Yue Wu Xuan Tang Tom M. Mitchell and Yuanzhi Li. 2023. SmartPlay: A benchmark for LLMs as intelligent agents. arXiv:2310.01557. Retrieved from https:\/\/arxiv.org\/abs\/2310.01557"},{"key":"e_1_3_1_42_2","first-page":"217","article-title":"Digital mural inpainting method based on feature perception","volume":"49","author":"Xu H.","year":"2022","unstructured":"H. Xu, Jm Kang, and Jw Zhang. 2022. Digital mural inpainting method based on feature perception. Computer Science 49 (2022), 217\u2013223.","journal-title":"Computer Science"},{"key":"e_1_3_1_43_2","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-022-14108-z"},{"issue":"1","key":"e_1_3_1_44_2","doi-asserted-by":"crossref","first-page":"955","DOI":"10.1038\/s41597-024-03785-0","article-title":"A comprehensive dataset for digital restoration of Dunhuang murals","volume":"11","author":"Xu Zishan","year":"2024","unstructured":"Zishan Xu, Yuqing Yang, Qianzhen Fang, Wei Chen, Tingting Xu, Jueting Liu, and Zehua Wang. 2024. A comprehensive dataset for digital restoration of Dunhuang murals. Scientific Data 11, 1 (2024), 955.","journal-title":"Scientific Data"},{"key":"e_1_3_1_45_2","unstructured":"Linyi Yang Shuibai Zhang Zhuohao Yu Guangsheng Bao Yidong Wang Jindong Wang Ruochen Xu Wei Ye Xing Xie Weizhu Chen et al. 2023. Supervised knowledge makes large language models better in-context learners. arXiv:2312.15918. Retrieved from https:\/\/arxiv.org\/abs\/2312.15918"},{"issue":"2","key":"e_1_3_1_46_2","first-page":"284","article-title":"Dunhuang mural inpainting in intricate disrepaired region based on improvement of priority algorithm","volume":"23","author":"Yang Xiaoping","year":"2011","unstructured":"Xiaoping Yang and Shuwen Wang. 2011. Dunhuang mural inpainting in intricate disrepaired region based on improvement of priority algorithm. Journal of Computer-Aided Design & Computer Graphics 23, 2 (2011), 284\u2013289.","journal-title":"Journal of Computer-Aided Design & Computer Graphics"},{"key":"e_1_3_1_47_2","unstructured":"Zongxin Yang Guikun Chen Xiaodi Li Wenguan Wang and Yi Yang. 2024. DoraemonGPT: Toward understanding dynamic scenes with large language models. arXiv:2401.08392. Retrieved from https:\/\/arxiv.org\/abs\/2401.08392"},{"key":"e_1_3_1_48_2","unstructured":"Zhengyuan Yang Linjie Li Jianfeng Wang Kevin Lin Ehsan Azarnasab Faisal Ahmed Zicheng Liu Ce Liu Michael Zeng and Lijuan Wang. 2023. MM-REACT: Prompting ChatGPT for multimodal reasoning and action. arXiv:2303.11381. Retrieved from https:\/\/arxiv.org\/abs\/2303.11381"},{"key":"e_1_3_1_49_2","unstructured":"Jiabo Ye Anwen Hu Haiyang Xu Qinghao Ye Ming Yan Yuhao Dan Chenlin Zhao Guohai Xu Chenliang Li Junfeng Tian et al. 2023. mPLUG-DocOwl: Modularized multimodal large language model for document understanding. arXiv:2307.02499. Retrieved from https:\/\/arxiv.org\/abs\/2307.02499"},{"issue":"12","key":"e_1_3_1_50_2","doi-asserted-by":"crossref","first-page":"nwae403","DOI":"10.1093\/nsr\/nwae403","article-title":"A survey on multimodal large language models","volume":"11","author":"Yin Shukang","year":"2024","unstructured":"Shukang Yin, Chaoyou Fu, Sirui Zhao, Ke Li, Xing Sun, Tong Xu, and Enhong Chen. 2024. A survey on multimodal large language models. National Science Review 11, 12 (2024), nwae403.","journal-title":"National Science Review"},{"key":"e_1_3_1_51_2","unstructured":"Dingyao Yu Kaitao Song Peiling Lu Tianyu He Xu Tan Wei Ye Shikun Zhang and Jiang Bian. 2023. MusicAgent: An AI agent for music understanding and generation with large language models. arXiv:2310.11954. Retrieved from https:\/\/arxiv.org\/abs\/2310.11954"},{"key":"e_1_3_1_52_2","unstructured":"Chi Zhang Zhao Yang Jiaxuan Liu Yucheng Han Xin Chen Zebiao Huang Bin Fu and Gang Yu. 2023. AppAgent: Multimodal agents as smartphone users. arXiv:2312.13771. Retrieved from https:\/\/arxiv.org\/abs\/2312.13771"},{"key":"e_1_3_1_53_2","doi-asserted-by":"crossref","unstructured":"Hang Zhang Xin Li and Lidong Bing. 2023. Video-LLaMA: An instruction-tuned audio-visual language model for video understanding. arXiv:2306.02858. Retrieved from https:\/\/arxiv.org\/abs\/2306.02858","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"e_1_3_1_54_2","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2020.3019705"},{"key":"e_1_3_1_55_2","unstructured":"Yixiao Zhang Akira Maezawa Gus Xia Kazuhiko Yamamoto and Simon Dixon. 2023. Loop Copilot: Conducting AI ensembles for music generation and iterative editing. arXiv:2310.12404. Retrieved from https:\/\/arxiv.org\/abs\/2310.12404"},{"issue":"8","key":"e_1_3_1_56_2","first-page":"2495","article-title":"Research on disease extraction and inpainting algorithm of digital grotto murals","volume":"38","author":"Zhang Z.","year":"2021","unstructured":"Z. Zhang, W. Shui, M. Zhou, B. Xu, and H. Zhou. 2021. Research on disease extraction and inpainting algorithm of digital grotto murals. Applied Soft Computing 38, 8 (2021), 2495\u201324982504.","journal-title":"Applied Soft Computing"},{"issue":"7","key":"e_1_3_1_57_2","first-page":"1524","article-title":"Research on inpainting algorithm of digital murals based on enhanced structural information","volume":"34","author":"Zhang Ziying","year":"2022","unstructured":"Ziying Zhang and Hua Zhou. 2022. Research on inpainting algorithm of digital murals based on enhanced structural information. Journal of System Simulation 34, 7 (2022), 1524\u20131531.","journal-title":"Journal of System Simulation"},{"key":"e_1_3_1_58_2","first-page":"195","volume-title":"Proceedings of the European Conference on Computer Vision","author":"Zhuang Junhao","year":"2025","unstructured":"Junhao Zhuang, Yanhong Zeng, Wenran Liu, Chun Yuan, and Kai Chen. 2025. A task is worth one word: Learning with task prompts for high-quality versatile image inpainting. In Proceedings of the European Conference on Computer Vision. Springer, 195\u2013211."}],"container-title":["ACM Transactions on Multimedia Computing, Communications, and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3743679","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,10]],"date-time":"2025-09-10T16:01:23Z","timestamp":1757520083000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3743679"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,10]]},"references-count":57,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2025,9,30]]}},"alternative-id":["10.1145\/3743679"],"URL":"https:\/\/doi.org\/10.1145\/3743679","relation":{},"ISSN":["1551-6857","1551-6865"],"issn-type":[{"value":"1551-6857","type":"print"},{"value":"1551-6865","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,10]]},"assertion":[{"value":"2024-11-28","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2025-06-02","order":2,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2025-09-10","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}