{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T00:49:57Z","timestamp":1778806197169,"version":"3.51.4"},"reference-count":94,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2025,2,24]],"date-time":"2025-02-24T00:00:00Z","timestamp":1740355200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,2,24]],"date-time":"2025-02-24T00:00:00Z","timestamp":1740355200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1007\/s11263-025-02349-y","type":"journal-article","created":{"date-parts":[[2025,2,24]],"date-time":"2025-02-24T10:55:27Z","timestamp":1740394527000},"page":"4177-4195","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":28,"title":["Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation"],"prefix":"10.1007","volume":"133","author":[{"given":"Wenjing","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8612-0702","authenticated-orcid":false,"given":"Huan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zixi","family":"Tuo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huiguo","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junchen","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianlong","family":"Fu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiaying","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,2,24]]},"reference":[{"key":"2349_CR1","unstructured":"An, J., Zhang, S., Yang, H., Gupta, S., Huang, J. B., Luo, J., & Yin, X. (2023). Latent-Shift: Latent diffusion with temporal shift for efficient text-to-video generation. arXiv."},{"key":"2349_CR2","doi-asserted-by":"crossref","unstructured":"Baek, Y., Lee, B., Han, D., Yun, S., & Lee, H. (2019). Character region awareness for text detection. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2019.00959"},{"key":"2349_CR3","doi-asserted-by":"crossref","unstructured":"Bain, M., Nagrani, A., Varol, G., & Zisserman, A. (2021). Frozen in time: A joint video and image encoder for end-to-end retrieval. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"2349_CR4","unstructured":"Betker, J., Goh. G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Zhuang, J., Lee, J., Guo, Y., Manassra, W., Dhariwal. P., Chu, C., Jiao, Y., & Ramesh, A. (2022). eDiff-I: Text-to-image diffusion models with an ensemble of expert denoisers. arXiv."},{"key":"2349_CR5","unstructured":"Bertasius, G., Wang, H., & Torresani, L. (2021). Is space-time attention all you need for video understanding?"},{"key":"2349_CR6","unstructured":"Betker, J., Goh, G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Zhuang, J., Lee, J., Guo, Y., Manassra, W., Dhariwal, P., Chu, C., Jiao, Y., & Ramesh, A. (2023). Improving image generation with better captions."},{"key":"2349_CR7","unstructured":"Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y., English, Z., Voleti, V., Letts, A., Jampani, V., & Rombach, R. (2023a). Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv."},{"key":"2349_CR8","doi-asserted-by":"crossref","unstructured":"Blattmann, A., Rombach, R., Ling, H., Dockhorn, T., Kim, S. W., Fidler, S., & Kreis, K. (2023b). Align your latents: High-resolution video synthesis with latent diffusion models. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52729.2023.02161"},{"key":"2349_CR9","unstructured":"Chen, D. L., & Dolan, W. B. (2011). Collecting highly parallel data for paraphrase evaluation. In Annual Meeting of the Association for Computational Linguistics."},{"key":"2349_CR10","doi-asserted-by":"crossref","unstructured":"Chen, T. S., Siarohin, A., Menapace, W., Deyneka, E., Chao, H. W., Jeon, B. E., Fang, Y., Lee, H. Y., Ren, J., Yang, M. H., & Tulyakov, S. (2024). Panda-70m: Captioning 70m videos with multiple cross-modality teachers. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52733.2024.01265"},{"key":"2349_CR11","unstructured":"Dhariwal, P., & Nichol, A. (2021). Diffusion models beat GANs on image synthesis. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR12","unstructured":"Ding, M., Yang, Z., Hong, W., Zheng, W., Zhou, C., Yin, D., Lin, J., Zou, X., Shao, Z., Yang, H., & Tang, J. (2021). CogView: Mastering text-to-image generation via transformers. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR13","unstructured":"Ding, M., Zheng, W., Hong, W., & Tang, J. (2022). CogView2: Faster and better text-to-image generation via hierarchical transformers. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR14","doi-asserted-by":"crossref","unstructured":"Esser, P., Chiu, J., Atighehchian, P., et\u00a0al. (2023). Structure and content-guided video synthesis with diffusion models. arXiv.","DOI":"10.1109\/ICCV51070.2023.00675"},{"key":"2349_CR15","unstructured":"Esser, P., Kulal, S., Blattmann, A., et\u00a0al. (2024). Scaling rectified flow transformers for high-resolution image synthesis. arXiv."},{"key":"2349_CR16","unstructured":"Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A. C., & Bengio, Y. (2014). Generative adversarial nets. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR17","doi-asserted-by":"crossref","unstructured":"Gu, B., Fan, H., & Zhang, L. (2023). Two birds, one stone: A unified framework for joint learning of image and video style transfers. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV51070.2023.02152"},{"key":"2349_CR18","unstructured":"Guo, Y., Yang, C., Rao, A., Liang, Z., Wang, Y., Qiao, Y., Agrawala, M., Lin, D., & Dai, B. (2024). Animatediff: Animate your personalized text-to-image diffusion models without specific tuning. International Conference on Learning Representations."},{"key":"2349_CR19","doi-asserted-by":"crossref","unstructured":"Habibian, A., van Rozendaal, T., Tomczak, J. M., & Cohen, T. (2019). Video compression with rate-distortion autoencoders.","DOI":"10.1109\/ICCV.2019.00713"},{"key":"2349_CR20","unstructured":"He, Y., Yang, T., Zhang, Y., Shan, Y., & Chen, Q. (2022a). Latent video diffusion models for high-fidelity long video generation. arXiv."},{"key":"2349_CR21","unstructured":"He, Y., Yang, T., Zhang, Y., Shan, Y., & Chen, Q. (2022b). Latent video diffusion models for high-fidelity video generation with arbitrary lengths. arXiv."},{"key":"2349_CR22","doi-asserted-by":"crossref","unstructured":"Heilbron, F. C., Escorcia, V., Ghanem, B., & Niebles, J. C. (2015). Activitynet: A large-scale video benchmark for human activity understanding. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"2349_CR23","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR24","unstructured":"Ho, J., Chan, W., Saharia, C., Whang, J., Gao, R., Gritsenko, A. A., Kingma, D. P., Poole, B., Norouzi, M., Fleet, D. J., & Salimans, T. (2022a). Imagen Video: High definition video generation with diffusion models. arXiv."},{"key":"2349_CR25","unstructured":"Ho, J., Salimans, T., Gritsenko, A. A., Chan, W., Norouzi, M., & Fleet, D. J. (2022b). Video diffusion models. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR26","unstructured":"Hong, W., Ding, M., Zheng, W., Liu, X., & Tang, J. (2022). CogVideo: Large-scale pretraining for text-to-video generation via transformers. arXiv."},{"key":"2349_CR27","doi-asserted-by":"crossref","unstructured":"Joshi, B. J., Stewart, K., & Shapiro, D. (2017). Bringing impressionism to life with neural style transfer in Come Swim. In ACM SIGGRAPH Digital Production Symposium.","DOI":"10.1145\/3105692.3105697"},{"key":"2349_CR28","doi-asserted-by":"crossref","unstructured":"Khachatryan, L., Movsisyan, A., Tadevosyan, V., Henschel, R., Wang, Z., Navasardyan, S., & Shi. H. (2023a). Text2video-zero: Text-to-image diffusion models are zero-shot video generators. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"2349_CR29","doi-asserted-by":"crossref","unstructured":"Khachatryan, L., Movsisyan, A., Tadevosyan, V., Henschel, R., Wang, Z., Navasardyan, S., & Shi. H. (2023b). Text2Video-Zero: Text-to-image diffusion models are zero-shot video generators. arXiv.","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"2349_CR30","unstructured":"Kondratyuk, D., Yu, L., Gu, X., Lezama, J., Huang, J., Hornung, R., Adam, H., Akbari, H., Alon, Y., Birodkar, V., Cheng, Y., Chiu, M., Dillon, J., Essa, I., Gupta, A., Hahn, M., Hauth, A., Hendon, D., Martinez, A., Minnen, D., Ross, D. A., Schindler, G., Sirotenko, M., Sohn, K., Somandepalli, K., Wang, H., Yan. J., Yang, M., Yang, X., Seybold, B., & Jiang, L. (2023). Videopoet: A large language model for zero-shot video generation. arXiv."},{"key":"2349_CR31","doi-asserted-by":"crossref","unstructured":"Lee, S., Chung, J., Yu, Y., Kim, G., Breuel, T. M., Chechik, G., & Song. Y. (2021). ACAV100M: automatic curation of large-scale datasets for audio-visual video representation learning.","DOI":"10.1109\/ICCV48922.2021.01011"},{"key":"2349_CR32","unstructured":"Li, J., Li, D., Savarese, S., & Hoi, S. (2023). BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. arXiv."},{"key":"2349_CR33","doi-asserted-by":"crossref","unstructured":"Li,Y., Min, M. R., Shen, D., Carlson, D. E., & Carin, L. (2018). Video generation from text. In AAAI Conference on Artificial Intelligence.","DOI":"10.1609\/aaai.v32i1.12233"},{"key":"2349_CR34","unstructured":"Li, Y., Zhang, K., Cao, J., Timofte, R., & Gool, L. V. (2021). Localvit: Bringing locality to vision transformers. arXiv."},{"key":"2349_CR35","doi-asserted-by":"crossref","unstructured":"Li, Z., Lu, C., Qin, J., Guo, C., & Cheng, M. (2022). Towards an end-to-end framework for flow-guided video inpainting. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52688.2022.01704"},{"key":"2349_CR36","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"2349_CR37","doi-asserted-by":"crossref","unstructured":"Liu, Z., Ning, J., Cao, Y., Wei, Y., Zhang, Z., Lin, S., & Hu, H. (2022). Video swin transformer. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"2349_CR38","unstructured":"Luo, T., Rockwell, C., Lee, H., & Johnson, J. (2023a). Scalable 3d captioning with pretrained models. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR39","doi-asserted-by":"crossref","unstructured":"Luo, Z., Chen, D., Zhang, Y., Huang, Y., Wang, L., Shen, Y., Zhao, D., Zhou, J., & Tan. T. (2023b). VideoFusion: Decomposed diffusion models for high-quality video generation. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52729.2023.10308948"},{"key":"2349_CR40","doi-asserted-by":"crossref","unstructured":"Luo, T., Johnson, J., & Lee, H. (2024). View selection for 3d captioning via diffusion ranking. In European Conference on Computer Vision.","DOI":"10.1007\/978-3-031-72751-1_11"},{"key":"2349_CR41","doi-asserted-by":"crossref","unstructured":"Ma, Y., He, Y., Cun, X., Wang, X., Shan, Y., Li, X., & Chen, Q. (2023). Follow your pose: Pose-guided text-to-video generation using pose-free videos. arXiv.","DOI":"10.1609\/aaai.v38i5.28206"},{"key":"2349_CR42","unstructured":"Mansimov, E., Parisotto, E., Ba, L. J., & Salakhutdinov, R. (2016). Generating images from captions with attention. In International Conference on Learning Representations."},{"key":"2349_CR43","unstructured":"Mathieu, M., Couprie, C., & LeCun, Y. (2016). Deep multi-scale video prediction beyond mean square error. In International Conference on Learning Representations."},{"key":"2349_CR44","doi-asserted-by":"crossref","unstructured":"Menapace, W., Lathuiliere, S., Tulyakov, S., Siarohin, A., & Ricci, E. (2021). Playable video generation. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR46437.2021.00993"},{"key":"2349_CR45","doi-asserted-by":"crossref","unstructured":"Miech, A., Zhukov, D., Alayrac, J. B., Tapaswi, M., Laptev, I., & Sivic, J. (2019). HowTo100M: Learning a text-video embedding by watching hundred million narrated video clips. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV.2019.00272"},{"key":"2349_CR46","unstructured":"Nichol, A., Dhariwal, P., Ramesh, A., Shyam, P., Mishkin, P., McGrew, B., Sutskever, I., & Chen. M. (2021). GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models. arXiv."},{"key":"2349_CR47","doi-asserted-by":"crossref","unstructured":"Pan, Y., Qiu, Z., Yao, T., Li, H., & Mei, T. (2017). To create what you tell: Generating videos from captions. In ACM International Conference on Multimedia.","DOI":"10.1145\/3123266.3127905"},{"key":"2349_CR48","doi-asserted-by":"crossref","unstructured":"Pessoa, J., Aidos, H., Tomas, P., & Figueiredo, M. A. T. (2020). End-to-end learning of video compression using spatio-temporal autoencoders. In IEEE Workshop on Signal Processing Systems.","DOI":"10.1109\/SiPS50750.2020.9195249"},{"key":"2349_CR49","unstructured":"Podell, D., English, Z., Lacey, K., Blattmann, A., Dockhorn, T., Muller, J., Penna, J., & Rombach, R. (2024). SDXL: improving latent diffusion models for high-resolution image synthesis. In International Conference on Learning Representations."},{"key":"2349_CR50","unstructured":"Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision."},{"key":"2349_CR51","unstructured":"Ramesh, A., Pavlov, M., Goh, G., Gray, S., Voss. C., Radford, A., Chen, M., & Sutskever. I. (2021). Zero-shot text-to-image generation."},{"key":"2349_CR52","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen. M. (2022). Hierarchical text-conditional image generation with CLIP latents. arXiv."},{"key":"2349_CR53","unstructured":"Reed, S. E., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., & Lee, H. (2016). Generative adversarial text to image synthesis."},{"key":"2349_CR54","doi-asserted-by":"crossref","unstructured":"Rohrbach, A., Rohrbach, M., Tandon, N., & Schiele, B. (2015). A dataset for movie description. In Conference on Computer Vision and Pattern Recognition, pp. 3202\u20133212.","DOI":"10.1109\/CVPR.2015.7298940"},{"key":"2349_CR55","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2349_CR56","doi-asserted-by":"crossref","unstructured":"Ruan, L., Ma, Y., Yang, H., He, H., Liu, B., Fu, J., Yuan, N. J., Jin, Q., & Guo, B. (2023). MM-Diffusion: Learning multi-modal diffusion models for joint audio and video generation. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52729.2023.00985"},{"key":"2349_CR57","doi-asserted-by":"crossref","unstructured":"Ruiz, N., Li, Y., Jampani, V., Pritch, Y., Rubinstein, M., Aberman, K. et\u00a0al. (2023). DreamBooth: Fine tuning text-to-image diffusion models for subject-driven generation. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"2349_CR58","doi-asserted-by":"crossref","unstructured":"Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E. L., Ghasemipour, S. K. S., Lopes, R. G., Ayan, B. K., Salimans, T., Ho, J., Fleet, D. J., & Norouzi, M. S., et\u00a0al. (2022). Photorealistic text-to-image diffusion models with deep language understanding. In Conference and Workshop on Neural Information Processing Systems.","DOI":"10.1145\/3528233.3530757"},{"key":"2349_CR59","doi-asserted-by":"crossref","unstructured":"Saito, M., Matsumoto, E., & Saito, S. (2017). Temporal generative adversarial nets with singular value clipping.","DOI":"10.1109\/ICCV.2017.308"},{"key":"2349_CR60","unstructured":"Singer, U., Polyak, A., Hayes, T., Yin, X., An, J., Zhang, S., Hu, Q., Yang, H., Ashual, O., Gafni, O., Parikh, D., Gupta, S., Taigman, Y. Skorokhodov, I., Tulyakov, S., & Elhoseiny, M. (2022). Make-A-Video: Text-to-video generation without text-video data. arXiv."},{"key":"2349_CR61","doi-asserted-by":"crossref","unstructured":"Skorokhodov, I., Tulyakov, S., & Elhoseiny, M. (2022). StyleGAN-V: A continuous video generator with the price, image quality and perks of stylegan2. In Conference on Computer Vision and Pattern Recognition, pp 3626\u20133636.","DOI":"10.1109\/CVPR52688.2022.00361"},{"key":"2349_CR62","unstructured":"Soomro, K., Zamir, A. R., & Shah, M. (2012). UCF101: A dataset of 101 human actions classes from videos in the wild. arXiv."},{"key":"2349_CR63","doi-asserted-by":"crossref","unstructured":"Sun, D., Yang, X., Liu, M. Y., & Kautz, J. (2018). PWC-Net: CNNs for optical flow using pyramid, warping, and cost volume. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2018.00931"},{"key":"2349_CR64","unstructured":"Tian, Y., Ren, J., Chai, M., Olszewski, K., Peng, X., Metaxas, D. N., & Tulyakov, S. (2021). A good image generator is what you need for high-resolution video synthesis. arXiv."},{"key":"2349_CR65","doi-asserted-by":"crossref","unstructured":"Tulyakov, S., Liu, M., Yang, X., & Kautz,. J. (2018). MoCoGAN: Decomposing motion and content for video generation. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2018.00165"},{"key":"2349_CR66","unstructured":"Unterthiner, T., van Steenkiste, S., Kurach, K., Marinier, R., Michalski, M., & Gelly, S. (2018). Towards accurate generative models of video: A new metric and challenges. arXiv."},{"key":"2349_CR67","unstructured":"Villegas, R., Babaeizadeh, M., Kindermans, P., Moraldo, H., Zhang, H., Saffar, M. T., Castro, S., Kunze, J., & Erhan. D. (2022). Phenaki: Variable length video generation from open domain textual description. arXiv."},{"key":"2349_CR68","unstructured":"Vondrick, C., Pirsiavash, H., & Torralba, A. (2016). Generating videos with scene dynamics. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR69","unstructured":"Wah, C., Branson, S., Welinder, P., Perona, P., & Belongie. S. (2011). The Caltech-UCSD birds-200-2011 dataset."},{"key":"2349_CR70","doi-asserted-by":"crossref","unstructured":"Wang, P., Wang, X., Wang, F., Lin, M., Chang, S., Li, H., & Jin, R. (2022). KVT: k-nn attention for boosting vision transformers. In European Conference on Computer Vision.","DOI":"10.1007\/978-3-031-20053-3_17"},{"key":"2349_CR71","unstructured":"Wang, T. C., Liu, M. Y., Zhu, J. Y., Liu, G., Tao, A., Kautz, J., & Catanzaro, B. (2018). Video-to-video synthesis. arXiv."},{"key":"2349_CR72","doi-asserted-by":"crossref","unstructured":"Wang, X., Wu, J., Chen, J., Li, L., Wang, Y., & Wang, W. Y. (2019). Vatex: A large-scale, high-quality multilingual dataset for video-and-language research.","DOI":"10.1109\/ICCV.2019.00468"},{"key":"2349_CR73","doi-asserted-by":"crossref","unstructured":"Wang, X., Xie, L., Dong, C., & Shan, Y. (2021). Real-ESRGAN: Training real-world blind super-resolution with pure synthetic data. In International Conference on Computer Vision Workshops, pp. 1905\u20131914.","DOI":"10.1109\/ICCVW54120.2021.00217"},{"key":"2349_CR74","doi-asserted-by":"crossref","unstructured":"Wang, Y., Chen, X., Ma, X., Zhou, S., Huang, Z., Wang, Y., Yang, C., He, Y., Yu, J., Yang, P., Guo, Y., Wu, T., Si, C., Jiang, Y., Chen, C., Loy, C. C., Dai, B., Lin, D., Qiao, Y., & Liu, Z. (2023). LAVIE: high-quality video generation with cascaded latent diffusion models. arXiv.","DOI":"10.1007\/s11263-024-02295-1"},{"key":"2349_CR75","unstructured":"Wu, C., Huang, L., Zhang, Q., Li, B., Ji, L., Yang, F., Sapiro, G., & Duan, N. (2021). GODIVA: Generating open-domain videos from natural descriptions. arXiv."},{"key":"2349_CR76","unstructured":"Wu, C., Liang, J., Ji, L., Yang, F., Fang, Y., Jiang, D., & Duan, N. N\u00fcwa: Visual synthesis pre-training for neural visual world creation. In European Conference on Computer Vision."},{"key":"2349_CR77","doi-asserted-by":"crossref","unstructured":"Wu, J. Z., Ge, Y., Wang, X., Lei, S. W., Gu, Y., Hsu, W., Shan, Y., Qie, X., & Shou. M. Z. (2023). Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV51070.2023.00701"},{"key":"2349_CR78","unstructured":"Xu, H., Ye, Q., Yan, M., Shi, Y., Ye, J., Xu, Y., Li, C., Bi, B., Qian, Q., Wang, W., Xu, G., Zhang, J., Huang, S., Huang, F., & Zhou J. mplug-2: A modularized multi-modal foundation model across text, image and video."},{"key":"2349_CR79","unstructured":"Xu, J., Mei, T., Yao, T., & Rui, Y. MSR-VTT: A large video description dataset for bridging video and language. In Conference on Computer Vision and Pattern Recognition."},{"key":"2349_CR80","doi-asserted-by":"crossref","unstructured":"Xu, T., Zhang, P., Huang, Q., Zhang, H., Gan, Z., Huang, X., & He, X. (2018). AttnGAN: Fine-grained text to image generation with attentional generative adversarial networks. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2018.00143"},{"key":"2349_CR81","doi-asserted-by":"crossref","unstructured":"Xue, H., Hang, T., Zeng, Y., Sun, Y., Liu, B., Yang, H., Fu, J., & Guo, B. (2022). Advancing high-resolution video-language representation with large-scale video transcriptions. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52688.2022.00498"},{"key":"2349_CR82","unstructured":"Yan, W., Zhang, Y., Abbeel, P., & Srinivas, A. (2021). Videogpt: Video generation using vq-vae and transformers. arXiv."},{"key":"2349_CR83","doi-asserted-by":"crossref","unstructured":"Yang, B., Gu, S., Zhang, B., Zhang, T., Chen, X., Sun, X., Chen, & D., Wen, F. (2023). Paint by example: Exemplar-based image editing with diffusion models. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52729.2023.01763"},{"key":"2349_CR84","doi-asserted-by":"crossref","unstructured":"Yu, L., Cheng, Y., Sohn, K., Lezama, J., Zhang, H., Chang, H., Hauptmann, A. G., Yang, M., Hao, Y., Essa, I., & Jiang, L. (2022a) MAGVIT: masked generative video transformer. arXiv.","DOI":"10.1109\/CVPR52729.2023.01008"},{"key":"2349_CR85","unstructured":"Yu, S., Tack, J., Mo, S., Kim, H., Kim, J., Ha, J. W., & Shin. J. (2022b). Generating videos with dynamics-aware implicit generative adversarial networks. arXiv."},{"key":"2349_CR86","doi-asserted-by":"crossref","unstructured":"Yu, S., Sohn, K., Kim, S., & Shin, J. (2023). Video probabilistic diffusion models in projected latent space. In Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR52729.2023.01770"},{"key":"2349_CR87","unstructured":"Zellers, R., Lu, X., Hessel, J., Yu, Y., Park, J. S., Cao, J., Farhadi, A., & Choi, Y. (2021). MERLOT: multimodal neural script knowledge models. In Conference and Workshop on Neural Information Processing Systems."},{"key":"2349_CR88","doi-asserted-by":"crossref","unstructured":"Zeng, Y., Fu, J., & Chao, H. (2020). Learning joint spatial-temporal transformations for video inpainting. In European Conference on Computer Vision.","DOI":"10.1007\/978-3-030-58517-4_31"},{"key":"2349_CR89","doi-asserted-by":"crossref","unstructured":"Zhang, D. J., Wu, J. Z., Liu, J., Zhao, R., Ran, L., Gu, Y., Gao, D., & Shou, M. Z. (2023). Show-1: Marrying pixel and latent diffusion models for text-to-video generation. arXiv.","DOI":"10.1007\/s11263-024-02271-9"},{"key":"2349_CR90","doi-asserted-by":"crossref","unstructured":"Zhang, H., Xu, T., & Li, H. (2017). StackGAN: Text to photo-realistic image synthesis with stacked generative adversarial networks. In International Conference on Computer Vision.","DOI":"10.1109\/ICCV.2017.629"},{"key":"2349_CR91","doi-asserted-by":"crossref","unstructured":"Zhang, L., & Agrawala, M. (2023). Adding conditional control to text-to-image diffusion models. arXiv.","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"2349_CR92","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Li, K., Li, K., Wang, L., Zhong, B., & Fu, Y. (2018). Image super-resolution using very deep residual channel attention networks. In European Conference on Computer Vision, pp. 286\u2013301.","DOI":"10.1007\/978-3-030-01234-2_18"},{"key":"2349_CR93","unstructured":"Zhou, D., Wang, W., Yan, H., Lv, W., Zhu, Y., & Feng, J. (2022). MagicVideo: Efficient video generation with latent diffusion models. arXiv."},{"key":"2349_CR94","doi-asserted-by":"crossref","unstructured":"Zhou, L., Xu, C., & Corso, J. J. (2018). Towards automatic learning of procedures from web instructional videos. In AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v32i1.12342"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02349-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02349-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02349-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,7]],"date-time":"2025-06-07T06:03:39Z","timestamp":1749276219000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02349-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,2,24]]},"references-count":94,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["2349"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02349-y","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,2,24]]},"assertion":[{"value":"1 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 January 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 February 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}