{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,20]],"date-time":"2026-02-20T16:16:07Z","timestamp":1771604167149,"version":"3.50.1"},"reference-count":97,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2025,12,24]],"date-time":"2025-12-24T00:00:00Z","timestamp":1766534400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,12,24]],"date-time":"2025-12-24T00:00:00Z","timestamp":1766534400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,1]]},"DOI":"10.1007\/s11263-025-02640-y","type":"journal-article","created":{"date-parts":[[2025,12,24]],"date-time":"2025-12-24T12:00:27Z","timestamp":1766577627000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Audio-Guided Video Scene Editing"],"prefix":"10.1007","volume":"134","author":[{"given":"Kaixin","family":"Shen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruijie","family":"Quan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4093-7557","authenticated-orcid":false,"given":"Linchao","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dong","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jun","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,12,24]]},"reference":[{"key":"2640_CR1","doi-asserted-by":"crossref","unstructured":"Bai. J., He, T., Wang, Y., Guo, J., Hu, H., Liu, Z., & Bian, J. (2024). Uniedit: A unified tuning-free framework for video motion and appearance editing. arXiv:2402.13185","DOI":"10.1145\/3746027.3755462"},{"key":"2640_CR2","unstructured":"Biner, BC., Sofian, F.M., Karaka\u015f, U.B., Ceylan, D., Erdem, E., & Erdem, A. (2024). Sonicdiffusion: Audio-driven image generation and editing with pretrained diffusion models. arXiv:2405.00878"},{"key":"2640_CR3","doi-asserted-by":"crossref","unstructured":"Chai, W., Guo, X., Wang, G., & Lu, Y. (2023). Stablevideo: Text-driven consistency-aware diffusion video editing. ICCV","DOI":"10.1109\/ICCV51070.2023.02106"},{"key":"2640_CR4","unstructured":"Chang, S.Y., Chen, H.T., & Liu, T.L. (2023). Diffusionatlas: High-fidelity consistent diffusion video editing. arXiv:2312.03772"},{"key":"2640_CR5","unstructured":"Chen, H., Wang, X., Zeng, G., Zhang, Y., Zhou, Y., Han, F., & Zhu, W. (2023a). Videodreamer: Customized multi-subject text-to-video generation with disen-mix finetuning. arXiv:2311.00990"},{"key":"2640_CR6","unstructured":"Chen, W., Wu, J., Xie, P., Wu, H., Li, J., Xia, X., Xiao, X., & Lin, L. (2023b). Control-a-video: Controllable text-to-video generation with diffusion models. arXiv:2305.13840"},{"key":"2640_CR7","doi-asserted-by":"crossref","unstructured":"Chen, X., Huang, L., Liu, Y., Shen, Y., Zhao, D., & Zhao, H. (2023c). Anydoor: Zero-shot object-level image customization. arXiv:2307.09481","DOI":"10.1109\/CVPR52733.2024.00630"},{"key":"2640_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, H.K., & Schwing, A.G. (2022). Xmem: Long-term video object segmentation with an atkinson-shiffrin memory model. ECCV","DOI":"10.1007\/978-3-031-19815-1_37"},{"key":"2640_CR9","unstructured":"Cong, Y., Xu, M., Simon, C., Chen, S., Ren, J., Xie, Y., Perez-Rua, J.M., Rosenhahn, B., Xiang, T., & He, S. (2024). Flatten: optical flow-guided attention for consistent text-to-video editing. ICLR"},{"key":"2640_CR10","unstructured":"Couairon, P., Rambour, C., Haugeard, JE., & Thome, N. (2023). Videdit: Zero-shot and spatially aware text-driven video editing. Transactions on Machine Learning Research"},{"key":"2640_CR11","doi-asserted-by":"crossref","unstructured":"Deng, Y., Wang, R., Zhang, Y., Tai, Y.W., & Tang, C.K. (2023). Dragvideo: Interactive drag-style video editing. arXiv:2312.02216","DOI":"10.1007\/978-3-031-72992-8_11"},{"key":"2640_CR12","doi-asserted-by":"crossref","unstructured":"Esser, P., Chiu, J., Atighehchian, P., Granskog, J., & Germanidis, A. (2023). Structure and content-guided video synthesis with diffusion models. ICCV.","DOI":"10.1109\/ICCV51070.2023.00675"},{"key":"2640_CR13","doi-asserted-by":"crossref","unstructured":"Fried, O., Tewari, A., Zollh\u00f6fer, M., Finkelstein, A., Shechtman, E., Goldman, DB., Genova, K., Jin, Z., Theobalt, C., & Agrawala, M. (2019). Text-based editing of talking-head video. ACM TOG","DOI":"10.1145\/3306346.3323028"},{"key":"2640_CR14","doi-asserted-by":"crossref","unstructured":"Gemmeke, J.F., Ellis, D.P., Freedman, D., Jansen, A., Lawrence, W., Moore, R.C., Plakal, M., & Ritter, M. (2017). Audio set: An ontology and human-labeled dataset for audio events. ICASSP","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"2640_CR15","unstructured":"Geyer, M., Bar-Tal, O., Bagon, S., & Dekel, T. (2024). Tokenflow: Consistent diffusion features for consistent video editing. ICLR"},{"key":"2640_CR16","doi-asserted-by":"crossref","unstructured":"Girdhar, R., El-Nouby, A., Liu, Z., Singh, M., Alwala, K.V., Joulin, A., & Misra, I. (2023). Imagebind: One embedding space to bind them all. CVPR","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"2640_CR17","doi-asserted-by":"crossref","unstructured":"Gong, Y., Chung, Y.A., & Glass, J. (2021). Ast: Audio spectrogram transformer. Interspeech","DOI":"10.21437\/Interspeech.2021-698"},{"key":"2640_CR18","doi-asserted-by":"crossref","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., & Bengio,Y. (2020). Generative adversarial networks. Communications of the ACM","DOI":"10.1145\/3422622"},{"key":"2640_CR19","doi-asserted-by":"crossref","unstructured":"Guan, J., Liu, Y., Zhu, Q., Zheng, T., Han, J., & Wang, W. (2023). Time-weighted frequency domain audio representation with gmm estimator for anomalous sound detection. ICASSP","DOI":"10.1109\/ICASSP49357.2023.10096356"},{"key":"2640_CR20","doi-asserted-by":"crossref","unstructured":"Guo, X., Zhao, Y., & Li, J. (2021). Danceit: Music-inspired dancing video synthesis. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2021.3086082"},{"key":"2640_CR21","unstructured":"Hertz, A., Mokady, R., Tenenbaum, J., Aberman, K., Pritch, Y., & Cohen-Or, D. (2023). Prompt-to-prompt image editing with cross attention control. ICLR"},{"key":"2640_CR22","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. NeurIPS"},{"key":"2640_CR23","unstructured":"Hu, L. (2024). Animate anyone: Consistent and controllable image-to-video synthesis for character animation. CVPR"},{"key":"2640_CR24","doi-asserted-by":"crossref","unstructured":"Huang, N., Zhang, Y., & Dong, W. (2023). Style-a-video: Agile diffusion for arbitrary text-based video style transfer. arXiv:2305.05464","DOI":"10.1109\/LSP.2024.3398538"},{"key":"2640_CR25","doi-asserted-by":"crossref","unstructured":"Hyun, S., Lew, J., Chung, J., Kim, E., & Heo, J.P. (2023) .Frequency-based motion representation for video generative adversarial networks. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2023.3293767"},{"key":"2640_CR26","doi-asserted-by":"crossref","unstructured":"Jeong, H., Park, G.Y., & Ye, J.C. (2023) Vmc: Video motion customization using temporal attention adaption for text-to-video diffusion models. arXiv:2312.00845","DOI":"10.1109\/CVPR52733.2024.00880"},{"key":"2640_CR27","doi-asserted-by":"crossref","unstructured":"Jin, D., Lei, J., Peng, B., Pan, Z., Li, L., & Ling, N. (2023). Learned video compression with efficient temporal context learning. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2023.3276333"},{"key":"2640_CR28","doi-asserted-by":"crossref","unstructured":"Kara, O., Kurtkaya, B., Yesiltepe, H., Rehg, J.M., & Yanardag, P. (2024). Rave: Randomized noise shuffling for fast and consistent video editing with diffusion models. CVPR","DOI":"10.1109\/CVPR52733.2024.00622"},{"key":"2640_CR29","doi-asserted-by":"crossref","unstructured":"Karras, T., Laine, S., Aittala, M., Hellsten, J., Lehtinen, J., & Aila, T. (2020). Analyzing and improving the image quality of stylegan. CVPR","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"2640_CR30","doi-asserted-by":"crossref","unstructured":"Kasten, Y., Ofri, D., Wang, O., & Dekel, T. (2021). Layered neural atlases for consistent video editing. TOG","DOI":"10.1145\/3478513.3480546"},{"key":"2640_CR31","doi-asserted-by":"crossref","unstructured":"Khachatryan, L., Movsisyan, A., Tadevosyan, V., Henschel, R., Wang, Z., Navasardyan, S., & Shi, H. (2023). Text2video-zero: Text-to-image diffusion models are zero-shot video generators. ICCV","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"2640_CR32","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, WY., et\u00a0al. (2023). Segment anything. ICCV","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"2640_CR33","doi-asserted-by":"crossref","unstructured":"Lee ,C.C., Lin, W.Y., Shih, Y.T., Kuo, P.Y., & Su, L. (2020). Crossing you in style: Cross-modal style transfer from music to visual arts. ACM ICMM","DOI":"10.1145\/3394171.3413624"},{"key":"2640_CR34","unstructured":"Lee, S., Kong, C., Jeon, D., & Kwak, N. (2023a). Aadiff: Audio-aligned video synthesis with text-to-image diffusion. CVPR2023 workshop"},{"key":"2640_CR35","doi-asserted-by":"crossref","unstructured":"Lee, S.H., Oh, G., Byeon, W., Kim, C., Ryoo, W.J., Yoon, S.H., Cho, H., Bae, J., Kim, J., & Kim, S. (2022a). Sound-guided semantic video generation. ECCV","DOI":"10.1007\/978-3-031-19790-1_3"},{"key":"2640_CR36","doi-asserted-by":"crossref","unstructured":"Lee, S.H., Roh, W., Byeon, W., Yoon, S.H., Kim, C., Kim, J., & Kim, S. (2022b). Sound-guided semantic image manipulation. CVPR","DOI":"10.2139\/ssrn.4437061"},{"key":"2640_CR37","unstructured":"Lee, S.H., Kim, S., Yoo, I., Yang, F., Cho, D., Kim, Y., Chang, H., Kim, J., & Kim, S. (2023b). Soundini: Sound-guided diffusion for natural video editing. arXiv:2304.06818"},{"key":"2640_CR38","doi-asserted-by":"crossref","unstructured":"Lee, T., Kang, J., Kim, H., & Kim, T. (2022c). Generating realistic images from in-the-wild sounds. ICCV","DOI":"10.1109\/ICCV51070.2023.00658"},{"key":"2640_CR39","unstructured":"Liew, J.H., Yan, H., Zhang, J., Xu, Z., & Feng, J. (2023). Magicedit: High-fidelity and temporally coherent video editing. arXiv:2308.14746"},{"key":"2640_CR40","doi-asserted-by":"crossref","unstructured":"Lin, J., Chen, J., Peng, K., He, X., Li, Z., Stiefelhagen, R., & Yang, K. (2024). Echotrack: Auditory referring multi-object tracking for autonomous driving. arXiv:2402.18302","DOI":"10.1109\/TITS.2024.3437645"},{"key":"2640_CR41","doi-asserted-by":"crossref","unstructured":"Liu, S., Zeng, Z., Ren, T., Li, F., Zhang, H., Yang, J., Li, C., Yang, J., Su, H., Zhu, J., et\u00a0al. (2023). Grounding dino: Marrying dino with grounded pre-training for open-set object detection. arXiv:2303.05499","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"2640_CR42","doi-asserted-by":"crossref","unstructured":"Liu, S., Zhang, Y., Li, W., Lin, Z., & Jia, J. (2024). Video-p2p: Video editing with cross-attention control. CVPR","DOI":"10.1109\/CVPR52733.2024.00821"},{"key":"2640_CR43","doi-asserted-by":"crossref","unstructured":"Lu, Y., Zhang, M., Ma, A.J., Xie, X., & Lai, J.H. (2024). Coarse-to-fine latent diffusion for pose-guided person image synthesis. arXiv:2402.18078","DOI":"10.1109\/CVPR52733.2024.00614"},{"key":"2640_CR44","doi-asserted-by":"crossref","unstructured":"Lugmayr, A., Danelljan, M., Romero, A., Yu, F., Timofte, R., & Gool, L.V. (2022). Repaint: Inpainting using denoising diffusion probabilistic models. CVPR","DOI":"10.1109\/CVPR52688.2022.01117"},{"key":"2640_CR45","doi-asserted-by":"crossref","unstructured":"Mao, Q., Tseng, H.Y., Lee, H.Y., Huang, J.B., Ma, S., & Yang, M.H. (2022). Continuous and diverse image-to-image translation via signed attribute vectors. International Journal of Computer Vision","DOI":"10.1007\/s11263-021-01557-6"},{"key":"2640_CR46","unstructured":"Materzynska, J., Sivic, J., Shechtman, E., Torralba, A., Zhang, R., & Russell, B. (2023). Customizing motion in text-to-video diffusion models. arXiv:2312.04966"},{"key":"2640_CR47","unstructured":"Molad, E., Horwitz, E., Valevski, D., Acha, A.R., Matias, Y., Pritch, Y., Leviathan, Y., & Hoshen, Y. (2023). Dreamix: Video diffusion models are general video editors. arXiv:2302.01329"},{"key":"2640_CR48","unstructured":"Nichol, A., Dhariwal, P., Ramesh, A., Shyam, P., Mishkin, P., McGrew, B., Sutskever, I., & Chen, M. (2021). Glide: Towards photorealistic image generation and editing with text-guided diffusion models. arXiv:2112.10741"},{"key":"2640_CR49","unstructured":"Nichol, A.Q., & Dhariwal, P. (2021). Improved denoising diffusion probabilistic models. ICML"},{"key":"2640_CR50","unstructured":"Omri, A., Dani, L., & Fried, O. (2022). Blended diffusion for text-driven editing of natural images. CVPR"},{"key":"2640_CR51","doi-asserted-by":"crossref","unstructured":"Ouyang, H., Wang, Q., Xiao, Y., Bai, Q., Zhang, J., Zheng, K., Zhou, X., Chen, Q., & Shen, Y. (2024). Codef: Content deformation fields for temporally consistent video processing. CVPR","DOI":"10.1109\/CVPR52733.2024.00773"},{"key":"2640_CR52","doi-asserted-by":"crossref","unstructured":"Piczak, K.J. (2015). Esc: Dataset for environmental sound classification. ACM MM","DOI":"10.1145\/2733373.2806390"},{"key":"2640_CR53","unstructured":"Podell, D., English, Z., Lacey, K., Blattmann, A., Dockhorn, T., M\u00fcller, J., Penna, J., & Rombach, R. (2023). Sdxl: Improving latent diffusion models for high-resolution image synthesis. arXiv:2307.01952"},{"key":"2640_CR54","unstructured":"Pont-Tuset, J., Perazzi, F., Caelles, S., Arbel\u00e1ez, P., Sorkine-Hornung, A., & Van\u00a0Gool, L. (2017). The 2017 davis challenge on video object segmentation. arXiv:1704.00675"},{"key":"2640_CR55","doi-asserted-by":"crossref","unstructured":"Qi, C., Cun, X., Zhang, Y., Lei, C., Wang, X., Shan, Y., & Chen, Q. (2023). Fatezero: Fusing attentions for zero-shot text-based video editing. ICCV","DOI":"10.1109\/ICCV51070.2023.01460"},{"key":"2640_CR56","doi-asserted-by":"crossref","unstructured":"Qin, B., Li, J., Tang, S., Chua, T.S., & Zhuang, Y. (2023). Instructvid2vid: Controllable video editing with natural language instructions. arXiv:2305.12328","DOI":"10.1109\/ICME57554.2024.10687529"},{"key":"2640_CR57","unstructured":"Qin, J., Wu, J., Chen, W., Ren, Y., Li, H., Wu, H., Xiao, X., Wang, R., & Wen, S. (2024). Diffusiongpt: Llm-driven text-to-image generation system. arXiv:2401.10061"},{"key":"2640_CR58","doi-asserted-by":"crossref","unstructured":"Qiu, H., Chen, Z., Jiang, Y., Zhou, H., Fan, X., Yang, L., Wu, W., & Liu, Z. (2024). Relitalk: Relightable talking portrait generation from a single video. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02007-9"},{"key":"2640_CR59","doi-asserted-by":"crossref","unstructured":"Quan, R., Wang, W., Tian, Z., Ma, F., & Yang, Y. (2024a). Psychometry: An omnifit model for image reconstruction from human brain activity. CVPR","DOI":"10.1109\/CVPR52733.2024.00030"},{"key":"2640_CR60","doi-asserted-by":"crossref","unstructured":"Quan, W., Chen, J., Liu, Y., Yan, D.M., & Wonka, P. (2024b). Deep learning-based image and video inpainting: A survey. International Journal of Computer Vision","DOI":"10.1007\/s11263-023-01977-6"},{"key":"2640_CR61","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et\u00a0al. (2021). Learning transferable visual models from natural language supervision. ICML"},{"key":"2640_CR62","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen, M. (2022). Hierarchical text-conditional image generation with clip latents. arXiv:2204.06125"},{"key":"2640_CR63","doi-asserted-by":"crossref","unstructured":"Ren, Y., Wu, J., Zhang, P., Zhang, M., Xiao, X., He, Q., Wang, R., Zheng, M., & Pan, X. (2023). Ugc: Unified gan compression for efficient image-to-image translation. arXiv:2309.09310","DOI":"10.1109\/ICCV51070.2023.01585"},{"key":"2640_CR64","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. CVPR","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2640_CR65","doi-asserted-by":"crossref","unstructured":"Sanguineti, V., Morerio, P., Del\u00a0Bue, A., & Murino, V. (2022). Unsupervised synthetic acoustic image generation for audio-visual scene understanding. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2022.3219228"},{"key":"2640_CR66","unstructured":"Shin, C., Kim, H., Lee, C.H., Lee, S.g., & Yoon, S. (2023). Edit-a-video: Single video editing with object-aware consistency. ACML"},{"key":"2640_CR67","unstructured":"Song, Y., Sohl-Dickstein, J., Kingma, D.P., Kumar, A., Ermon, S., & Poole, B. (2021). Score-based generative modeling through stochastic differential equations. ICLR"},{"key":"2640_CR68","doi-asserted-by":"crossref","unstructured":"Tian, Z., Quan, R., Ma, F., Zhan, K., & Yang, Y. (2025). Brainguard: Privacy-preserving multisubject image reconstructions from brain activities. AAAI","DOI":"10.1609\/aaai.v39i13.33579"},{"key":"2640_CR69","doi-asserted-by":"crossref","unstructured":"Wang, H., Lin, G., del Molino, A.G., Wang, A., Feng, J., & Shen, Z. (2024a). Maniclip: Multi-attribute face manipulation from text. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02088-6"},{"key":"2640_CR70","doi-asserted-by":"crossref","unstructured":"Wang, S., Saharia, C., Montgomery, C., Pont-Tuset, J., Noy, S., Pellegrini, S., Onoe, Y., Laszlo, S., Fleet, D.J., Soricut, R., Baldridge, J., Norouzi, M., Anderson, P., & Chan, W. (2023a). Imagen editor and editbench: Advancing and evaluating text-guided image inpainting. TPAMI","DOI":"10.1109\/CVPR52729.2023.01761"},{"key":"2640_CR71","unstructured":"Wang, W., Jiang, Y., Xie, K., Liu, Z., Chen, H., Cao, Y., Wang, X., & Shen, C. (2023b). Zero-shot video editing using off-the-shelf image diffusion models. arXiv:2303.17599"},{"key":"2640_CR72","doi-asserted-by":"crossref","unstructured":"Wang, Y., Ma, X., Chen, X., Chen, C., Dantcheva, A., Dai, B., & Qiao, Y. (2024b). Leo: Generative latent image animator for human video synthesis. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02231-3"},{"key":"2640_CR73","unstructured":"Wang, Z., Bovik, A.C., Sheikh, H.R., & Simoncelli, E.P. (2004). Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing"},{"key":"2640_CR74","doi-asserted-by":"crossref","unstructured":"Wang, Z., Wang, X., Xie, L., Qi, Z., Shan, Y., Wang, W., & Luo, P. (2024c). Styleadapter: A unified stylized image generation model. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02253-x"},{"key":"2640_CR75","doi-asserted-by":"crossref","unstructured":"Wu, J.Z., Ge, Y., Wang, X., Lei, S.W., Gu, Y., Shi, Y., Hsu, W., Shan, Y., Qie, X., & Shou, M.Z. (2023a). Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation. ICCV","DOI":"10.1109\/ICCV51070.2023.00701"},{"key":"2640_CR76","doi-asserted-by":"crossref","unstructured":"Wu, T., Si, C., Jiang, Y., Huang, Z., & Liu, Z. (2023b). Freeinit: Bridging initialization gap in video diffusion models. arXiv:2312.07537","DOI":"10.1007\/978-3-031-72646-0_22"},{"key":"2640_CR77","doi-asserted-by":"crossref","unstructured":"Wu, X., Zhang, Q., Wu, Y., Wang, H., Li, S., Sun, L., & Li, X. (2021). F$$^3$$a-gan: Facial flow for face animation with generative adversarial networks. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2021.3112059"},{"key":"2640_CR78","doi-asserted-by":"crossref","unstructured":"Xiao, G., Yin, T., Freeman, W.T., Durand, F., & Han, S. (2024). Fastcomposer: Tuning-free multi-subject image generation with localized attention. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02227-z"},{"key":"2640_CR79","doi-asserted-by":"crossref","unstructured":"Xie, S., Zhang, Z., Lin, Z., Hinz, T., & Zhang, K. (2023a). Smartbrush: Text and shape guided object inpainting with diffusion model.CVPR","DOI":"10.1109\/CVPR52729.2023.02148"},{"key":"2640_CR80","unstructured":"Xie, S., Zhao, Y., Xiao, Z., Chan, K.C., Li, Y., Xu, Y., Zhang, K., & Hou, T. (2023b). Dreaminpainter: Text-guided subject-driven image inpainting with diffusion models. arXiv:2312.03771"},{"key":"2640_CR81","doi-asserted-by":"crossref","unstructured":"Xuan, H., Luo, L., Zhang, Z., Yang, J., & Yan, Y. (2021). Discriminative cross-modality attention network for temporal inconsistent audio-visual event localization. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2021.3106814"},{"key":"2640_CR82","doi-asserted-by":"crossref","unstructured":"Yang, B., Gu, S., Zhang, B., Zhang, T., Chen, X., Sun, X., Chen, D., & Wen, D. (2023a). Paint by example: Exemplar-based image editing with diffusion models. CVPR","DOI":"10.1109\/CVPR52729.2023.01763"},{"key":"2640_CR83","doi-asserted-by":"crossref","unstructured":"Yang, C., Shen, Y., & Zhou, B. (2021). Semantic hierarchy emerges in deep generative representations for scene synthesis. International Journal of Computer Vision","DOI":"10.1007\/s11263-020-01429-5"},{"key":"2640_CR84","doi-asserted-by":"crossref","unstructured":"Yang, S., Zhou, Y., Liu, Z., & Loy, C.C. (2023b). Rerender a video: Zero-shot text-guided video-to-video translation. SIGGRAPH Asia","DOI":"10.1145\/3610548.3618160"},{"key":"2640_CR85","doi-asserted-by":"crossref","unstructured":"Yariv, G., Gat, I., Wolf, L., Adi, Y., & Schwartz, I. (2023). Audiotoken: Adaptation of text-conditioned diffusion models for audio-to-image generation. INTERSPEECH 2023","DOI":"10.21437\/Interspeech.2023-852"},{"key":"2640_CR86","doi-asserted-by":"crossref","unstructured":"Yariv, G., Gat, I., Benaim, S., Wolf, L., Schwartz, I., & Adi, Y. (2024). Diverse and aligned audio-to-video generation via text-to-video model adaptation. AAAI","DOI":"10.1609\/aaai.v38i7.28486"},{"key":"2640_CR87","doi-asserted-by":"crossref","unstructured":"Yi, Z., Chen, Z., Cai, H., Mao, W., Gong, M., & Zhang, H. (2020). Bsd-gan: Branched generative adversarial network for scale-disentangled representation learning and image synthesis. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2020.3014608"},{"key":"2640_CR88","unstructured":"Yildirim, A.B., Baday, V., Erdem, E., Erdem, A., & Dundar, A. (2023). Inst-inpaint: Instructing to remove objects with diffusion models. arXiv:2304.03246"},{"key":"2640_CR89","doi-asserted-by":"crossref","unstructured":"Yildirim, A.B., Pehlivan, H., & Dundar, A. (2024). Warping the residuals for image editing with stylegan. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02301-6"},{"key":"2640_CR90","doi-asserted-by":"crossref","unstructured":"Yu, S., Han, H., Shan, S., & Chen, X. (2022a). Cmos-gan: Semi-supervised generative adversarial model for cross-modality face image synthesis. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2022.3226413"},{"key":"2640_CR91","doi-asserted-by":"crossref","unstructured":"Yu, W., Zhu, M., Wang, N., Wang, X., & Gao, X. (2022b). An efficient transformer based on global and local self-attention for face photo-sketch synthesis. IEEE Transactions on Image Processing","DOI":"10.1109\/TIP.2022.3229614"},{"key":"2640_CR92","doi-asserted-by":"crossref","unstructured":"Zhang, D.J., Wu, J.Z., Liu, J.W., Zhao, R., Ran, L., Gu, Y., Gao, D., & Shou, M.Z. (2024a). Show-1: Marrying pixel and latent diffusion models for text-to-video generation. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02271-9"},{"key":"2640_CR93","doi-asserted-by":"crossref","unstructured":"Zhang, K., Sun, M., Sun, J., Zhang, K., Sun, Z., & Tan, T. (2024b). Open-vocabulary text-driven human image generation. International Journal of Computer Vision","DOI":"10.1007\/s11263-024-02079-7"},{"key":"2640_CR94","doi-asserted-by":"crossref","unstructured":"Zhang, L., Rao, A., & Agrawala, M. (2023). Adding conditional control to text-to-image diffusion models. ICCV","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"2640_CR95","unstructured":"Zhang, Y., Wei, Y., Jiang, D., Zhang, X., Zuo, W., & Tian, Q. (2024c). Controlvideo: Training-free controllable text-to-video generation. ICLR"},{"key":"2640_CR96","doi-asserted-by":"crossref","unstructured":"Zhao, R., Gu, Y., Wu, J.Z., Zhang, D.J., Liu, J., Wu, W., Keppo, J., & Shou, M.Z. (2023a). Motiondirector: Motion customization of text-to-video diffusion models. arXiv:2310.08465","DOI":"10.1007\/978-3-031-72992-8_16"},{"key":"2640_CR97","unstructured":"Zhao, Y., Xie, E., Hong, L., Li, Z., & Lee, G.H. (2023b). Make-a-protagonist: Generic video editing with an ensemble of experts. arXiv:2305.08850"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02640-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02640-y","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02640-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,20]],"date-time":"2026-02-20T15:39:29Z","timestamp":1771601969000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02640-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,24]]},"references-count":97,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2026,1]]}},"alternative-id":["2640"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02640-y","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,12,24]]},"assertion":[{"value":"15 April 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 October 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 December 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of Interest"}}],"article-number":"12"}}