{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,10]],"date-time":"2026-06-10T16:51:35Z","timestamp":1781110295922,"version":"3.54.1"},"reference-count":57,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2025,1,13]],"date-time":"2025-01-13T00:00:00Z","timestamp":1736726400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,13]],"date-time":"2025-01-13T00:00:00Z","timestamp":1736726400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,6]]},"DOI":"10.1007\/s11263-024-02329-8","type":"journal-article","created":{"date-parts":[[2025,1,13]],"date-time":"2025-01-13T10:42:51Z","timestamp":1736764971000},"page":"3437-3455","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["RIGID: Recurrent GAN Inversion and Editing of Real Face Videos and Beyond"],"prefix":"10.1007","volume":"133","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3383-4349","authenticated-orcid":false,"given":"Yangyang","family":"Xu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shengfeng","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kwan-Yee K.","family":"Wong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ping","family":"Luo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,1,13]]},"reference":[{"key":"2329_CR1","doi-asserted-by":"crossref","unstructured":"Abdal, R., Qin, Y. & Wonka, P. (2019). Image2stylegan: How to embed images into the stylegan latent space? In: CVPR, pp. 4432\u20134441.","DOI":"10.1109\/ICCV.2019.00453"},{"key":"2329_CR2","doi-asserted-by":"crossref","unstructured":"Abdal, R., Qin, Y. & Wonka, P. (2020). Image2stylegan++: How to edit the embedded images? In: CVPR, pp. 8296\u20138305.","DOI":"10.1109\/CVPR42600.2020.00832"},{"key":"2329_CR3","doi-asserted-by":"crossref","unstructured":"Alaluf, Y., Patashnik, O., Wu, Z., Zamir, A., Shechtman, E., Lischinski, D. & Cohen-Or, D. (2023). Third time\u2019s the charm? Image and video editing with stylegan3. In: ECCV WorkShop, pp. 204\u2013220.","DOI":"10.1007\/978-3-031-25063-7_13"},{"key":"2329_CR4","doi-asserted-by":"crossref","unstructured":"Alaluf, Y., Tov, O., Mokady, R., Gal, R. & Bermano, A. (2022). Hyperstyle: Stylegan inversion with hypernetworks for real image editing. In: CVPR, pp. 18511\u201318521.","DOI":"10.1109\/CVPR52688.2022.01796"},{"key":"2329_CR5","doi-asserted-by":"crossref","unstructured":"Carreira, J. & Zisserman, A. (2017). Quo Vadis, action recognition? A new model and the kinetics dataset. In: CVPR, pp. 6299\u20136308.","DOI":"10.1109\/CVPR.2017.502"},{"issue":"7","key":"2329_CR6","first-page":"1967","volume":"30","author":"A Creswell","year":"2018","unstructured":"Creswell, A., & Bharath, A. A. (2018). Inverting the generator of a generative adversarial network. IEEE TNNLS, 30(7), 1967\u20131974.","journal-title":"IEEE TNNLS"},{"key":"2329_CR7","unstructured":"Fox, G., Tewari, A., Elgharib, M. & Theobalt, C. (2021). Stylevideogan: A temporal generative model using a pretrained stylegan. In: BMVC."},{"issue":"4","key":"2329_CR8","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3528223.3530164","volume":"41","author":"R Gal","year":"2022","unstructured":"Gal, R., Patashnik, O., Maron, H., Bermano, A. H., Chechik, G., & Cohen-Or, D. (2022). Stylegan-nada: Clip-guided domain adaptation of image generators. ACM TOG, 41(4), 1\u201313.","journal-title":"ACM TOG"},{"key":"2329_CR9","first-page":"9841","volume":"33","author":"E H\u00e4rk\u00f6nen","year":"2020","unstructured":"H\u00e4rk\u00f6nen, E., Hertzmann, A., Lehtinen, J., & Paris, S. (2020). Ganspace: Discovering interpretable gan controls. Advances in Neural Information Processing Systems, 33, 9841\u20139850.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2329_CR10","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. Advances in Neural Information Processing Systems, 33, 6840\u20136851.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2329_CR11","doi-asserted-by":"crossref","unstructured":"Hyun, S., Kim, J. & Heo, J.P. (2021). Self-supervised video gans: Learning for appearance consistency and motion coherency. In: CVPR, pp. 10826\u201310835.","DOI":"10.1109\/CVPR46437.2021.01068"},{"key":"2329_CR12","doi-asserted-by":"crossref","unstructured":"Ilg, E., Mayer, N., Saikia, T., Keuper, M., Dosovitskiy, A. & Brox, T. (2017). Flownet 2.0: Evolution of optical flow estimation with deep networks. In: CVPR, pp. 2462\u20132470.","DOI":"10.1109\/CVPR.2017.179"},{"key":"2329_CR13","doi-asserted-by":"crossref","unstructured":"Jiang, H., Sun, D., Jampani, V., Yang, M.H., Learned-Miller, E. & Kautz, J. (2018). Super slomo: High quality estimation of multiple intermediate frames for video interpolation. In: CVPR, pp. 9000\u20139008.","DOI":"10.1109\/CVPR.2018.00938"},{"key":"2329_CR14","first-page":"852","volume":"34","author":"T Karras","year":"2021","unstructured":"Karras, T., Aittala, M., Laine, S., H\u00e4rk\u00f6nen, E., Hellsten, J., Lehtinen, J., & Aila, T. (2021). Alias-free generative adversarial networks. Advances in Neural Information Processing Systems, 34, 852\u2013863.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2329_CR15","doi-asserted-by":"crossref","unstructured":"Karras, T., Laine, S. & Aila, T. (2019). A style-based generator architecture for generative adversarial networks. In: CVPR, pp. 4401\u20134410.","DOI":"10.1109\/CVPR.2019.00453"},{"key":"2329_CR16","doi-asserted-by":"crossref","unstructured":"Karras, T., Laine, S., Aittala, M., Hellsten, J., Lehtinen, J. & Aila, T. (2020). Analyzing and improving the image quality of stylegan. In: CVPR, pp. 8110\u20138119.","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"2329_CR17","doi-asserted-by":"crossref","unstructured":"Kim, G., Shim, H., Kim, H., Choi, Y., Kim, J. & Yang, E. (2023). Diffusion video autoencoders: Toward temporally consistent face video editing via disentangled video encoding. In: CVPR, pp. 6091\u20136100.","DOI":"10.1109\/CVPR52729.2023.00590"},{"key":"2329_CR18","doi-asserted-by":"crossref","unstructured":"Kim, H., Choi, Y., Kim, J., Yoo, S. & Uh, Y. (2021). Exploiting spatial dimensions of latent in gan for real-time image editing. In: CVPR, pp. 852\u2013861.","DOI":"10.1109\/CVPR46437.2021.00091"},{"key":"2329_CR19","unstructured":"Kingma, D.P. & Ba, J. (2015). Adam: A method for stochastic optimization. In: ICLR."},{"key":"2329_CR20","doi-asserted-by":"crossref","unstructured":"Lai, W.S., Huang, J.B., Wang, O., Shechtman, E., Yumer, E. & Yang, M.H. (2018). Learning blind video temporal consistency. In: ECCV, pp. 170\u2013185.","DOI":"10.1007\/978-3-030-01267-0_11"},{"issue":"5","key":"2329_CR21","doi-asserted-by":"publisher","first-page":"e0196391","DOI":"10.1371\/journal.pone.0196391","volume":"13","author":"SR Livingstone","year":"2018","unstructured":"Livingstone, S. R., & Russo, F. A. (2018). The Ryerson audio-visual database of emotional speech and song (RAVDESS): A dynamic, multimodal set of facial and vocal expressions in North American english. PloS One, 13(5), e0196391.","journal-title":"PloS One"},{"key":"2329_CR22","doi-asserted-by":"crossref","unstructured":"Logacheva, E., Suvorov, R., Khomenko, O., Mashikhin, A. & Lempitsky, V. (2020). Deeplandscape: Adversarial modeling of landscape videos. In: ECCV, pp. 256\u2013272.","DOI":"10.1007\/978-3-030-58592-1_16"},{"key":"2329_CR23","doi-asserted-by":"crossref","unstructured":"Park, T., Liu, M.Y., Wang, T.C. & Zhu, J.Y. (2019). Semantic image synthesis with spatially-adaptive normalization. In: CVPR, pp. 2337\u20132346.","DOI":"10.1109\/CVPR.2019.00244"},{"key":"2329_CR24","doi-asserted-by":"crossref","unstructured":"Patashnik, O., Wu, Z., Shechtman, E., Cohen-Or, D. & Lischinski, D. (2021). Styleclip: Text-driven manipulation of stylegan imagery. In: ICCV, pp. 2085\u20132094.","DOI":"10.1109\/ICCV48922.2021.00209"},{"key":"2329_CR25","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P. & Clark, J., et\u00a0al. (2021). Learning transferable visual models from natural language supervision. In: ICML, pp. 8748\u20138763."},{"key":"2329_CR26","doi-asserted-by":"crossref","unstructured":"Reda, F.A., Sun, D., Dundar, A., Shoeybi, M., Liu, G., Shih, K.J., Tao, A., Kautz, J. & Catanzaro, B. (2019). Unsupervised video interpolation using cycle consistency. In: ICCV, pp. 892\u2013900.","DOI":"10.1109\/ICCV.2019.00098"},{"key":"2329_CR27","doi-asserted-by":"crossref","unstructured":"Richardson, E., Alaluf, Y., Patashnik, O., Nitzan, Y., Azar, Y., Shapiro, S. & Cohen-Or, D. (2021). Encoding in style: A stylegan encoder for image-to-image translation. In: CVPR, pp. 2287\u20132296.","DOI":"10.1109\/CVPR46437.2021.00232"},{"key":"2329_CR28","doi-asserted-by":"crossref","unstructured":"Roich, D., Mokady, R., Bermano, A.H. & Cohen-Or, D. (2021). Pivotal tuning for latent-based editing of real images. arXiv preprint arXiv:2106.05744.","DOI":"10.1145\/3544777"},{"key":"2329_CR29","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P. & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In: CVPR, pp. 10684\u201310695.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2329_CR30","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P. & Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In: MICCAI, pp. 234\u2013241.","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"2329_CR31","doi-asserted-by":"publisher","first-page":"2004","DOI":"10.1109\/TPAMI.2020.3034267","volume":"44","author":"Y Shen","year":"2020","unstructured":"Shen, Y., Yang, C., Tang, X., & Zhou, B. (2020). Interfacegan: Interpreting the disentangled face representation learned by gans. IEEE TPAMI, 44, 2004.","journal-title":"IEEE TPAMI"},{"key":"2329_CR32","doi-asserted-by":"crossref","unstructured":"Shen, Y. & Zhou, B. (2021). Closed-form factorization of latent semantics in gans. In: CVPR, pp. 1532\u20131540.","DOI":"10.1109\/CVPR46437.2021.00158"},{"key":"2329_CR33","unstructured":"Shi, X., Chen, Z., Wang, H., Yeung, D.Y., Wong, W.K. & Woo, W.c. (2015). Convolutional lstm network: A machine learning approach for precipitation nowcasting. NeurIPS, vol. 28."},{"key":"2329_CR34","doi-asserted-by":"crossref","unstructured":"Skorokhodov, I., Tulyakov, S. & Elhoseiny, M. (2021). Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2. In: CVPR, pp. 3626\u20133636.","DOI":"10.1109\/CVPR52688.2022.00361"},{"key":"2329_CR35","unstructured":"Song, J., Meng, C. & Ermon, S. (2021). Denoising diffusion implicit models. In: ICLR."},{"key":"2329_CR36","unstructured":"Tian, Y., Ren, J., Chai, M., Olszewski, K., Peng, X., Metaxas, D.N. & Tulyakov, S. (2021). A good image generator is what you need for high-resolution video synthesis. In: ICLR."},{"key":"2329_CR37","unstructured":"Tian, Y., Ren, J., Chai, M., Olszewski, K., Peng, X., Metaxas, D.N. & Tulyakov, S. (2021). A good image generator is what you need for high-resolution video synthesis. In: ICLR."},{"issue":"4","key":"2329_CR38","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3450626.3459838","volume":"40","author":"O Tov","year":"2021","unstructured":"Tov, O., Alaluf, Y., Nitzan, Y., Patashnik, O., & Cohen-Or, D. (2021). Designing an encoder for stylegan image manipulation. ACM TOG, 40(4), 1\u201314.","journal-title":"ACM TOG"},{"key":"2329_CR39","doi-asserted-by":"crossref","unstructured":"Tzaban, R., Mokady, R., Gal, R., Bermano, A. & Cohen-Or, D. (2022). Stitch it in time: Gan-based facial editing of real videos. In: SIGGRAPH Asia, pp. 1\u20139.","DOI":"10.1145\/3550469.3555382"},{"key":"2329_CR40","unstructured":"Unterthiner, T., van Steenkiste, S., Kurach, K., Marinier, R., Michalski, M. & Gelly, S. (2019). Fvd: A new metric for video generation. In: ICLR WorkShop."},{"key":"2329_CR41","unstructured":"Voynov, A. & Babenko, A. (2020). Unsupervised discovery of interpretable directions in the gan latent space. In: ICML, pp. 9786\u20139796."},{"key":"2329_CR42","doi-asserted-by":"crossref","unstructured":"Wang, T., Li, L., Lin, K., Lin, C.C., Yang, Z., Zhang, H., Liu, Z. & Wang, L. (2023). Disco: Disentangled control for referring human dance generation in real world. arXiv preprint arXiv:2307.00040","DOI":"10.1109\/CVPR52733.2024.00891"},{"key":"2329_CR43","doi-asserted-by":"crossref","unstructured":"Wang, T., Zhang, Y., Fan, Y., Wang, J. & Chen, Q. (2022). High-fidelity gan inversion for image attribute editing. In: CVPR, pp. 11379\u201311388.","DOI":"10.1109\/CVPR52688.2022.01109"},{"key":"2329_CR44","unstructured":"Wang, T.C., Liu, M.Y., Zhu, J.Y., Liu, G., Tao, A., Kautz, J. & Catanzaro, B. (2018). Video-to-video synthesis. In: NeurIPS, vol.\u00a031."},{"issue":"3","key":"2329_CR45","doi-asserted-by":"publisher","first-page":"3121","DOI":"10.1109\/TPAMI.2022.3181070","volume":"45","author":"W Xia","year":"2023","unstructured":"Xia, W., Zhang, Y., Yang, Y., Xue, J. H., Zhou, B., & Yang, M. H. (2023). Gan inversion: A survey. IEEE TPAMI, 45(3), 3121\u20133138.","journal-title":"IEEE TPAMI"},{"key":"2329_CR46","unstructured":"Xu X, Siyao L, Sun W, Yin Q, Yang MH. (2019). Quadratic video interpolation. NeurIPS, pp. 32."},{"key":"2329_CR47","doi-asserted-by":"crossref","unstructured":"Xu, Y., AlBahar, B. & Huang, J.B. (2022). Temporally consistent semantic video editing. In: ECCV, pp. 357\u2013374.","DOI":"10.1007\/978-3-031-19784-0_21"},{"key":"2329_CR48","doi-asserted-by":"crossref","unstructured":"Xu, Y., Du, Y., Xiao, W., Xu, X. & He, S. (2021). From continuity to editability: Inverting gans with consecutive images. In: ICCV, pp. 13910\u201313918.","DOI":"10.1109\/ICCV48922.2021.01365"},{"key":"2329_CR49","doi-asserted-by":"crossref","unstructured":"Xu, Y., He, S., Wong, K.Y.K. & Luo, P. (2023). Rigid: Recurrent gan inversion and editing of real face videos. In: ICCV, pp. 13691\u201313701.","DOI":"10.1109\/ICCV51070.2023.01259"},{"key":"2329_CR50","doi-asserted-by":"crossref","unstructured":"Yang, H., Chai, L., Wen, Q., Zhao, S., Sun, Z. & He, S. (2021). Discovering interpretable latent space directions of gans beyond binary attributes. In: CVPR, pp. 12177\u201312185.","DOI":"10.1109\/CVPR46437.2021.01200"},{"key":"2329_CR51","doi-asserted-by":"crossref","unstructured":"Yang, S., Jiang, L., Liu, Z. & Loy, C.C. (2023). Styleganex: Stylegan-based manipulation beyond cropped aligned faces. In: ICCV, pp. 21000\u201321010.","DOI":"10.1109\/ICCV51070.2023.01920"},{"key":"2329_CR52","doi-asserted-by":"crossref","unstructured":"Yao, X., Newson, A., Gousseau, Y. & Hellier, P. (2021). A latent transformer for disentangled face editing in images and videos. In: ICCV, pp. 13789\u201313798.","DOI":"10.1109\/ICCV48922.2021.01353"},{"key":"2329_CR53","doi-asserted-by":"crossref","unstructured":"Yin, F., Zhang, Y., Cun, X., Cao, M., Fan, Y., Wang, X., Bai, Q., Wu, B., Wang, J. & Yang, Y. (2022). Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan. In: ECCV, pp. 85\u2013101.","DOI":"10.1007\/978-3-031-19790-1_6"},{"key":"2329_CR54","doi-asserted-by":"crossref","unstructured":"Yu, C., Wang, J., Peng, C., Gao, C., Yu, G. & Sang, N. (2018). Bisenet: Bilateral segmentation network for real-time semantic segmentation. In: ECCV, pp. 325\u2013341.","DOI":"10.1007\/978-3-030-01261-8_20"},{"key":"2329_CR55","doi-asserted-by":"crossref","unstructured":"Y\u00fcksel, O.K., Simsar, E., Er, E.G. & Yanardag, P. (2021). Latentclr: A contrastive learning approach for unsupervised discovery of interpretable directions. In: ICCV, pp. 14263\u201314272.","DOI":"10.1109\/ICCV48922.2021.01400"},{"key":"2329_CR56","doi-asserted-by":"crossref","unstructured":"Zhang, R., Isola, P., Efros, A.A., Shechtman, E. & Wang, O. (2018). The unreasonable effectiveness of deep features as a perceptual metric. In: CVPR, pp. 586\u2013595.","DOI":"10.1109\/CVPR.2018.00068"},{"key":"2329_CR57","doi-asserted-by":"crossref","unstructured":"Zhu, H., Wu, W., Zhu, W., Jiang, L., Tang, S., Zhang, L., Liu, Z. & Loy, C.C. (2022) CelebV-HQ: A large-scale video facial attributes dataset. In: ECCV, pp. 650\u2013667.","DOI":"10.1007\/978-3-031-20071-7_38"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02329-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02329-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02329-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,10]],"date-time":"2025-05-10T06:54:24Z","timestamp":1746860064000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02329-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,13]]},"references-count":57,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2025,6]]}},"alternative-id":["2329"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02329-8","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,13]]},"assertion":[{"value":"22 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 December 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 January 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}