{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T16:26:52Z","timestamp":1783787212258,"version":"3.55.0"},"reference-count":91,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2025,1,24]],"date-time":"2025-01-24T00:00:00Z","timestamp":1737676800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,24]],"date-time":"2025-01-24T00:00:00Z","timestamp":1737676800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,6]]},"DOI":"10.1007\/s11263-024-02274-6","type":"journal-article","created":{"date-parts":[[2025,1,24]],"date-time":"2025-01-24T10:56:48Z","timestamp":1737716208000},"page":"3613-3628","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":47,"title":["DeepFake-Adapter: Dual-Level Adapter for DeepFake Detection"],"prefix":"10.1007","volume":"133","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0090-9604","authenticated-orcid":false,"given":"Rui","family":"Shao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tianxing","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liqiang","family":"Nie","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziwei","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,1,24]]},"reference":[{"key":"2274_CR1","unstructured":"Agarap, A.F. (2018). Deep learning using rectified linear units (relu). arXiv preprint arXiv:1803.08375."},{"key":"2274_CR2","unstructured":"Ba, J.L., Kiros, J.R., & Hinton, G.E. (2016). Layer normalization. arXiv preprint arXiv:1607.06450."},{"key":"2274_CR3","doi-asserted-by":"crossref","unstructured":"Cao, J., Ma, C., Yao, T., Chen, S., Ding, S., & Yang, X. (2022). End-to-end reconstruction-classification learning for face forgery detection. In: CVPR, pp. 4113\u20134122.","DOI":"10.1109\/CVPR52688.2022.00408"},{"key":"2274_CR4","doi-asserted-by":"crossref","unstructured":"Carreira, J., & Zisserman, A. (2017). Quo vadis, action recognition? a new model and the kinetics dataset. In: CVPR, pp. 6299\u20136308.","DOI":"10.1109\/CVPR.2017.502"},{"key":"2274_CR5","doi-asserted-by":"crossref","unstructured":"Chai, L., Bau, D., Lim, S.N., & Isola, P. (2020). What makes fake images detectable? understanding properties that generalize. In: ECCV, pp. 103\u2013120.","DOI":"10.1007\/978-3-030-58574-7_7"},{"key":"2274_CR6","doi-asserted-by":"crossref","unstructured":"Chen, G., Shen, L., Shao, R., Deng, X., & Nie, L. (2024). Lion: Empowering multimodal large language model with dual-level visual knowledge. In: CVPR, pp. 26540\u201326550.","DOI":"10.1109\/CVPR52733.2024.02506"},{"key":"2274_CR7","doi-asserted-by":"crossref","unstructured":"Chen, L., Zhang, Y., Song, Y., Liu, L., & Wang, J. (2022). Self-supervised learning of adversarial example: Towards good generalizations for deepfake detection. In: CVPR, pp. 18710\u201318719.","DOI":"10.1109\/CVPR52688.2022.01815"},{"key":"2274_CR8","first-page":"16664","volume":"35","author":"S Chen","year":"2022","unstructured":"Chen, S., Ge, C., Tong, Z., Wang, J., Song, Y., Wang, J., & Luo, P. (2022). Adaptformer: Adapting vision transformers for scalable visual recognition. NeurIPS, 35, 16664\u201316678.","journal-title":"NeurIPS"},{"key":"2274_CR9","doi-asserted-by":"publisher","first-page":"1081","DOI":"10.1609\/aaai.v35i2.16193","volume":"35","author":"S Chen","year":"2021","unstructured":"Chen, S., Yao, T., Chen, Y., Ding, S., Li, J., & Ji, R. (2021). Local relation learning for face forgery detection. AAAI, 35, 1081\u20131088.","journal-title":"AAAI"},{"key":"2274_CR10","unstructured":"Chen, Z., Duan, Y., Wang, W., He, J., Lu, T., Dai, J., & Qiao, Y. (2023). Vision transformer adapter for dense predictions. In: ICLR."},{"key":"2274_CR11","unstructured":"Chen, Z., Duan, Y., Wang, W., He, J., Lu, T., Dai, J., & Qiao, Y. (2023). Vision transformer adapter for dense predictions. In: ICLR."},{"key":"2274_CR12","doi-asserted-by":"crossref","unstructured":"Chollet, F. (2017). Xception: Deep learning with depthwise separable convolutions. In: ICCV, pp. 1251\u20131258.","DOI":"10.1109\/CVPR.2017.195"},{"key":"2274_CR13","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., & Fei-Fei, L. (2009). Imagenet: A large-scale hierarchical image database. In: CVPR, pp. 248\u2013255.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"2274_CR14","first-page":"8780","volume":"34","author":"P Dhariwal","year":"2021","unstructured":"Dhariwal, P., & Nichol, A. (2021). Diffusion models beat gans on image synthesis. NeurIPS, 34, 8780\u20138794.","journal-title":"NeurIPS"},{"key":"2274_CR15","first-page":"8780","volume":"34","author":"P Dhariwal","year":"2021","unstructured":"Dhariwal, P., & Nichol, A. (2021). Diffusion models beat gans on image synthesis. NeurIPS, 34, 8780\u20138794.","journal-title":"NeurIPS"},{"key":"2274_CR16","unstructured":"Dolhansky, B., Bitton, J., Pflaum, B., Lu, J., Howes, R., Wang, M., & Ferrer, C.C. (2020). The deepfake detection challenge (dfdc) dataset. arXiv preprint arXiv:2006.07397."},{"key":"2274_CR17","doi-asserted-by":"crossref","unstructured":"Dong, X., Bao, J., Chen, D., Zhang, T., Zhang, W., Yu, N., Chen, D., Wen, F., & Guo, B. (2022). Protecting celebrities from deepfake with identity consistency transformer. In: CVPR, pp. 9468\u20139478.","DOI":"10.1109\/CVPR52688.2022.00925"},{"key":"2274_CR18","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., et\u00a0al. (2020). An image is worth 16x16 words: Transformers for image recognition at scale. In: ICLR."},{"key":"2274_CR19","unstructured":"Durall, R., Keuper, M., Pfreundt, F.J., & Keuper, J. (2019). Unmasking deepfakes with simple features. arXiv preprint arXiv:1911.00686."},{"key":"2274_CR20","first-page":"3022","volume":"33","author":"T Dzanic","year":"2020","unstructured":"Dzanic, T., Shah, K., & Witherden, F. (2020). Fourier spectrum discrepancies in deep network generated images. NeurIPS, 33, 3022\u20133032.","journal-title":"NeurIPS"},{"key":"2274_CR21","doi-asserted-by":"publisher","first-page":"735","DOI":"10.1609\/aaai.v36i1.19954","volume":"36","author":"Q Gu","year":"2022","unstructured":"Gu, Q., Chen, S., Yao, T., Chen, Y., Ding, S., & Yi, R. (2022). Exploiting fine-grained face forgery clues via progressive enhancement learning. AAAI, 36, 735\u2013743.","journal-title":"AAAI"},{"key":"2274_CR22","doi-asserted-by":"crossref","unstructured":"Gu, Z., Chen, Y., Yao, T., Ding, S., Li, J., Huang, F., & Ma, L. (2021). Spatiotemporal inconsistency learning for deepfake video detection. In: ACM MM, pp. 3473\u20133481.","DOI":"10.1145\/3474085.3475508"},{"key":"2274_CR23","doi-asserted-by":"publisher","first-page":"744","DOI":"10.1609\/aaai.v36i1.19955","volume":"36","author":"Z Gu","year":"2022","unstructured":"Gu, Z., Chen, Y., Yao, T., Ding, S., Li, J., & Ma, L. (2022). Delving into the local: Dynamic inconsistency learning for deepfake video detection. AAAI, 36, 744\u2013752.","journal-title":"AAAI"},{"key":"2274_CR24","doi-asserted-by":"crossref","unstructured":"Haliassos, A., Mira, R., Petridis, S., & Pantic, M. (2022). Leveraging real talking faces via self-supervision for robust forgery detection. In: CVPR, pp. 14950\u201314962.","DOI":"10.1109\/CVPR52688.2022.01453"},{"key":"2274_CR25","doi-asserted-by":"crossref","unstructured":"Haliassos, A., Vougioukas, K., Petridis, S., & Pantic, M. (2021). Lips don\u2019t lie: A generalisable and robust approach to face forgery detection. In: CVPR, pp. 5039\u20135049.","DOI":"10.1109\/CVPR46437.2021.00500"},{"key":"2274_CR26","unstructured":"He, J., Zhou, C., Ma, X., Berg-Kirkpatrick, T., & Neubig, G. (2022). Towards a unified view of parameter-efficient transfer learning. In: ICLR."},{"key":"2274_CR27","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P., & Girshick, R. (2022). Masked autoencoders are scalable vision learners. In: CVPR, pp. 16000\u201316009.","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"2274_CR28","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In: CVPR, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"2274_CR29","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. NeurIPS, 33, 6840\u20136851.","journal-title":"Denoising diffusion probabilistic models. NeurIPS"},{"key":"2274_CR30","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. In: NeurIPS, 33, 6840\u20136851.","journal-title":"Denoising diffusion probabilistic models. In: NeurIPS"},{"key":"2274_CR31","doi-asserted-by":"crossref","unstructured":"Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Supervised sequence labelling with recurrent neural networks pp. 37\u201345.","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"2274_CR32","unstructured":"Houlsby, N., Giurgiu, A., Jastrzebski, S., Morrone, B., De\u00a0Laroussilhe, Q., Gesmundo, A., Attariyan, M., & Gelly, S. (2019). Parameter-efficient transfer learning for nlp. In: ICML, pp. 2790\u20132799."},{"key":"2274_CR33","unstructured":"Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., & Chen, W. (2022). Lora: Low-rank adaptation of large language models. In: ICLR."},{"key":"2274_CR34","doi-asserted-by":"crossref","unstructured":"Jia, M., Tang, L., Chen, B.C., Cardie, C., Belongie, S., Hariharan, B., & Lim, S.N. (2022). Visual prompt tuning. In: ECCV, pp. 709\u2013727.","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"2274_CR35","doi-asserted-by":"crossref","unstructured":"Jiang, L., Li, R., Wu, W., Qian, C., & Loy, C.C. (2020). Deeperforensics-1.0: A large-scale dataset for real-world face forgery detection. In: CVPR, pp. 2889\u20132898.","DOI":"10.1109\/CVPR42600.2020.00296"},{"key":"2274_CR36","unstructured":"Kumar, A., Raghunathan, A., Jones, R., Ma, T., & Liang, P. (2022). Fine-tuning can distort pretrained features and underperform out-of-distribution. In: ICLR."},{"key":"2274_CR37","doi-asserted-by":"crossref","unstructured":"Lester, B., Al-Rfou, R., & Constant, N. (2021). The power of scale for parameter-efficient prompt tuning. In: EMNLP, pp. 3045\u20133059.","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"2274_CR38","doi-asserted-by":"crossref","unstructured":"Li, J., Xie, H., Li, J., Wang, Z., & Zhang, Y. (2021). Frequency-aware discriminative feature learning supervised by single-center loss for face forgery detection. In: CVPR, pp. 6458\u20136467.","DOI":"10.1109\/CVPR46437.2021.00639"},{"key":"2274_CR39","doi-asserted-by":"crossref","unstructured":"Li, L., Bao, J., Zhang, T., Yang, H., Chen, D., Wen, F., & Guo, B. (2020). Face x-ray for more general face forgery detection. In: CVPR, pp. 5001\u20135010.","DOI":"10.1109\/CVPR42600.2020.00505"},{"key":"2274_CR40","doi-asserted-by":"crossref","unstructured":"Li, X., Lang, Y., Chen, Y., Mao, X., He, Y., Wang, S., Xue, H., & Lu, Q. (2020). Sharp multiple instance learning for deepfake video detection. In: ACM MM, pp. 1864\u20131872.","DOI":"10.1145\/3394171.3414034"},{"key":"2274_CR41","unstructured":"Li, Y., Yang, X., Sun, P., Qi, H., & Lyu, S. (2020). Celeb-df: A new dataset for deepfake forensics. In: CVPR, pp. 3207\u20133216."},{"key":"2274_CR42","unstructured":"Li, Z., Xie, Y., Shao, R., Chen, G., Jiang, D., & Nie, L. (2024). Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks. In: NeurIPS."},{"key":"2274_CR43","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, X., Zhou, W., Chen, Y., He, Y., Xue, H., Zhang, W., & Yu, N. (2021). Spatial-phase shallow learning: rethinking face forgery detection in frequency domain. In: CVPR, pp. 772\u2013781.","DOI":"10.1109\/CVPR46437.2021.00083"},{"key":"2274_CR44","unstructured":"Liu, L., Ren, Y., Lin, Z., & Zhao, Z. (2022). Pseudo numerical methods for diffusion models on manifolds. In: ICLR."},{"key":"2274_CR45","unstructured":"Liu, L., Ren, Y., Lin, Z., & Zhao, Z. (2022). Pseudo numerical methods for diffusion models on manifolds. In: ICLR."},{"issue":"9","key":"2274_CR46","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3560815","volume":"55","author":"P Liu","year":"2023","unstructured":"Liu, P., Yuan, W., Fu, J., Jiang, Z., Hayashi, H., & Neubig, G. (2023). Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing. ACM Computing Surveys, 55(9), 1\u201335.","journal-title":"ACM Computing Surveys"},{"key":"2274_CR47","doi-asserted-by":"publisher","first-page":"11669","DOI":"10.1609\/aaai.v34i07.6836","volume":"34","author":"Z Liu","year":"2020","unstructured":"Liu, Z., Luo, D., Wang, Y., Wang, L., Tai, Y., Wang, C., Li, J., Huang, F., & Lu, T. (2020). Teinet: Towards an efficient architecture for video recognition. AAAI, 34, 11669\u201311676.","journal-title":"AAAI"},{"key":"2274_CR48","doi-asserted-by":"crossref","unstructured":"Liu, Z., Qi, X., & Torr, P.H. (2020). Global texture enhancement for fake face detection in the wild. In: CVPR, pp. 8060\u20138069.","DOI":"10.1109\/CVPR42600.2020.00808"},{"key":"2274_CR49","doi-asserted-by":"crossref","unstructured":"Luo, Y., Zhang, Y., Yan, J., & Liu, W. (2021). Generalizing face forgery detection with high-frequency features. In: CVPR, pp. 16317\u201316326.","DOI":"10.1109\/CVPR46437.2021.01605"},{"key":"2274_CR50","unstructured":"Van\u00a0der Maaten, L., & Hinton, G. (2008). Visualizing data using t-sne. Journal of machine learning research 9(11)."},{"key":"2274_CR51","unstructured":"Paszke, A., Gross, S., Chintala, S., Chanan, G., Yang, E., DeVito, Z., Lin, Z., Desmaison, A., Antiga, L., & Lerer, A. (2017). Automatic differentiation in pytorch."},{"key":"2274_CR52","doi-asserted-by":"crossref","unstructured":"Qi, H., Guo, Q., Juefei-Xu, F., Xie, X., Ma, L., Feng, W., Liu, Y., & Zhao, J. (2020). Deeprhythm: Exposing deepfakes with attentional visual heartbeat rhythms. In: ACM MM, pp. 4318\u20134327.","DOI":"10.1145\/3394171.3413707"},{"key":"2274_CR53","doi-asserted-by":"crossref","unstructured":"Qian, Y., Yin, G., Sheng, L., Chen, Z., & Shao, J. (2020). Thinking in frequency: Face forgery detection by mining frequency-aware clues. In: ECCV, pp. 86\u2013103.","DOI":"10.1007\/978-3-030-58610-2_6"},{"key":"2274_CR54","unstructured":"Quinn, N.A., & Dhariwal, P. (2021). Improved denoising diffusion probabilistic models. In: ICML, pp. 8162\u20138171."},{"key":"2274_CR55","unstructured":"Quinn, N.A., & Dhariwal, P. (2021). Improved denoising diffusion probabilistic models. In: ICML, pp. 8162\u20138171."},{"key":"2274_CR56","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et\u00a0al. (2021). Learning transferable visual models from natural language supervision. In: ICML, pp. 8748\u20138763."},{"key":"2274_CR57","doi-asserted-by":"crossref","unstructured":"Ricker, J., Damm, S., Holz, T., & Fischer, A. (2024). Towards the detection of diffusion model deepfakes. In: VISAPP, pp. 446\u2013457.","DOI":"10.5220\/0012422000003660"},{"key":"2274_CR58","unstructured":"Robin, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In: CVPR, pp. 10684\u201310695."},{"key":"2274_CR59","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In: CVPR, pp. 10684\u201310695.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2274_CR60","doi-asserted-by":"crossref","unstructured":"Rossler, A., Cozzolino, D., Verdoliva, L., Riess, C., Thies, J., & Nie\u00dfner, M. (2019). Faceforensics++: Learning to detect manipulated facial images. In: ICCV, pp. 1\u201311.","DOI":"10.1109\/ICCV.2019.00009"},{"issue":"1","key":"2274_CR61","first-page":"80","volume":"3","author":"E Sabir","year":"2019","unstructured":"Sabir, E., Cheng, J., Jaiswal, A., AbdAlmageed, W., Masi, I., & Natarajan, P. (2019). Recurrent convolutional strategies for face manipulation detection in videos. Interfaces (GUI), 3(1), 80\u201387.","journal-title":"Interfaces (GUI)"},{"key":"2274_CR62","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., & Batra, D. (2017). Grad-cam: Visual explanations from deep networks via gradient-based localization. In: CVPR, pp. 618\u2013626.","DOI":"10.1109\/ICCV.2017.74"},{"key":"2274_CR63","doi-asserted-by":"crossref","unstructured":"Shao, R., Lan, X., Li, J., & Yuen, P.C. (2019). Multi-adversarial discriminative deep domain generalization for face presentation attack detection. In: CVPR, pp. 10023\u201310031.","DOI":"10.1109\/CVPR.2019.01026"},{"issue":"4","key":"2274_CR64","doi-asserted-by":"publisher","first-page":"923","DOI":"10.1109\/TIFS.2018.2868230","volume":"14","author":"R Shao","year":"2018","unstructured":"Shao, R., Lan, X., & Yuen, P. C. (2018). Joint discriminative learning of deep dynamic textures for 3d mask face anti-spoofing. IEEE Transactions on Information Forensics and Security, 14(4), 923\u2013938.","journal-title":"IEEE Transactions on Information Forensics and Security"},{"key":"2274_CR65","doi-asserted-by":"publisher","first-page":"11974","DOI":"10.1609\/aaai.v34i07.6873","volume":"34","author":"R Shao","year":"2020","unstructured":"Shao, R., Lan, X., & Yuen, P. C. (2020). Regularized fine-grained meta face anti-spoofing. AAAI, 34, 11974\u201311981.","journal-title":"AAAI"},{"issue":"1","key":"2274_CR66","doi-asserted-by":"publisher","first-page":"103","DOI":"10.1109\/TNNLS.2022.3172316","volume":"35","author":"R Shao","year":"2022","unstructured":"Shao, R., Perera, P., Yuen, P. C., & Patel, V. M. (2022). Federated generalized face presentation attack detection. IEEE Transactions on Neural Networks and Learning Systems, 35(1), 103\u2013116.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"4","key":"2274_CR67","doi-asserted-by":"publisher","first-page":"1070","DOI":"10.1007\/s11263-022-01581-0","volume":"130","author":"R Shao","year":"2022","unstructured":"Shao, R., Perera, P., Yuen, P. C., & Patel, V. M. (2022). Open-set adversarial defense with clean-adversarial mutual learning. International Journal of Computer Vision, 130(4), 1070\u20131087.","journal-title":"International Journal of Computer Vision"},{"key":"2274_CR68","doi-asserted-by":"crossref","unstructured":"Shao, R., Wu, T., & Liu, Z. (2022). Detecting and recovering sequential deepfake manipulation. In: ECCV, pp. 712\u2013728.","DOI":"10.1007\/978-3-031-19778-9_41"},{"key":"2274_CR69","doi-asserted-by":"crossref","unstructured":"Shao, R., Wu, T., & Liu, Z. (2023). Detecting and grounding multi-modal media manipulation. In: CVPR, pp. 6904\u20136913.","DOI":"10.1109\/CVPR52729.2023.00667"},{"key":"2274_CR70","unstructured":"Shao, R., Wu, T., & Liu, Z. (2023). Robust sequential deepfake detection. arXiv preprint arXiv:2309.14991."},{"issue":"8","key":"2274_CR71","doi-asserted-by":"publisher","first-page":"5556","DOI":"10.1109\/TPAMI.2024.3367749","volume":"46","author":"R Shao","year":"2024","unstructured":"Shao, R., Wu, T., Wu, J., Nie, L., & Liu, Z. (2024). Detecting and grounding multi-modal media manipulation and beyond. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(8), 5556\u20135574.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2274_CR72","unstructured":"Shen, L., Chen, G., Shao, R., Guan, W., & Nie, L. (2024). Mome: Mixture of multimodal experts for generalist multimodal large language models. In: NeurIPS."},{"key":"2274_CR73","doi-asserted-by":"crossref","unstructured":"Sohrawardi, S.J., Chintha, A., Thai, B., Seng, S., Hickerson, A., Ptucha, R., & Wright, M. (2019). Poster: Towards robust open-world detection of deepfakes. In: ACM CCS, pp. 2613\u20132615.","DOI":"10.1145\/3319535.3363269"},{"issue":"4","key":"2274_CR74","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3306346.3323035","volume":"38","author":"J Thies","year":"2019","unstructured":"Thies, J., Zollh\u00f6fer, M., & Nie\u00dfner, M. (2019). Deferred neural rendering: Image synthesis using neural textures. Acm Transactions on Graphics, 38(4), 1\u201312.","journal-title":"Acm Transactions on Graphics"},{"key":"2274_CR75","doi-asserted-by":"crossref","unstructured":"Thies, J., Zollhofer, M., Stamminger, M., Theobalt, C., & Nie\u00dfner, M. (2016). Face2face: Real-time face capture and reenactment of rgb videos. In: CVPR, pp. 2387\u20132395.","DOI":"10.1109\/CVPR.2016.262"},{"key":"2274_CR76","unstructured":"Tran, D., Bourdev, L.D., Fergus, R., Torresani, L., & Paluri, M. (2014). C3d: generic features for video analysis. CoRR, abs\/1412.0767."},{"key":"2274_CR77","doi-asserted-by":"crossref","unstructured":"Wang, C., & Deng, W. (2021). Representative forgery mining for fake face detection. In: CVPR, pp. 14923\u201314932.","DOI":"10.1109\/CVPR46437.2021.01468"},{"key":"2274_CR78","unstructured":"Wang, G., Zhou, J., & Wu, Y. (2020). Exposing deep-faked videos by anomalous co-motion pattern detection. arXiv preprint arXiv:2008.04848."},{"key":"2274_CR79","doi-asserted-by":"crossref","unstructured":"Wang, S.Y., Wang, O., Zhang, R., Owens, A., & Efros, A.A. (2020). Cnn-generated images are surprisingly easy to spot... for now. In: CVPR, pp. 8695\u20138704.","DOI":"10.1109\/CVPR42600.2020.00872"},{"key":"2274_CR80","doi-asserted-by":"crossref","unstructured":"Wu, H., Xiao, B., Codella, N., Liu, M., Dai, X., Yuan, L., & Zhang, L. (2021). Cvt: Introducing convolutions to vision transformers. In: ICCV, pp. 22\u201331.","DOI":"10.1109\/ICCV48922.2021.00009"},{"key":"2274_CR81","doi-asserted-by":"crossref","unstructured":"Wu, W., Zhao, Y., Xu, Y., Tan, X., He, D., Zou, Z., Ye, J., Li, Y., Yao, M., Dong, Z., et\u00a0al. (2021). Dsanet: Dynamic segment aggregation network for video-level representation learning. In: ACM MM, pp. 1903\u20131911.","DOI":"10.1145\/3474085.3475344"},{"key":"2274_CR82","doi-asserted-by":"crossref","unstructured":"Ye, Q., Yu, Z., Shao, R., Xie, X., Torr, P., & Cao, X. (2024). Cat: Enhancing multimodal large language model to answer questions in dynamic audio-visual scenarios. In: ECCV.","DOI":"10.1007\/978-3-031-72684-2_9"},{"key":"2274_CR83","doi-asserted-by":"crossref","unstructured":"Yuan, K., Guo, S., Liu, Z., Zhou, A., Yu, F., & Wu, W. (2021). Incorporating convolution designs into visual transformers. In: CVPR, pp. 579\u2013588.","DOI":"10.1109\/ICCV48922.2021.00062"},{"key":"2274_CR84","doi-asserted-by":"publisher","first-page":"3243","DOI":"10.1609\/aaai.v36i3.20233","volume":"36","author":"B Zhang","year":"2022","unstructured":"Zhang, B., Li, S., Feng, G., Qian, Z., & Zhang, X. (2022). Patch diffusion: A general module for face manipulation detection. AAAI, 36, 3243\u20133251.","journal-title":"AAAI"},{"key":"2274_CR85","unstructured":"Zhang, S., Guo, S., Huang, W., Scott, M.R., & Wang, L. (2020). V4d: 4d convolutional neural networks for video-level representation learning. In: ICLR."},{"key":"2274_CR86","doi-asserted-by":"crossref","unstructured":"Zhao, H., Zhou, W., Chen, D., Wei, T., Zhang, W., & Yu, N. (2021). Multi-attentional deepfake detection. In: CVPR, pp. 2185\u20132194.","DOI":"10.1109\/CVPR46437.2021.00222"},{"key":"2274_CR87","doi-asserted-by":"crossref","unstructured":"Zhao, T., Xu, X., Xu, M., Ding, H., Xiong, Y., & Xia, W. (2021). Learning self-consistency for deepfake detection. In: ICCV, pp. 15023\u201315033.","DOI":"10.1109\/ICCV48922.2021.01475"},{"key":"2274_CR88","doi-asserted-by":"crossref","unstructured":"Zhou, P., Han, X., Morariu, V.I., & Davis, L.S. (2017). Two-stream neural networks for tampered face detection. In: CVPRW, pp. 1831\u20131839.","DOI":"10.1109\/CVPRW.2017.229"},{"key":"2274_CR89","doi-asserted-by":"crossref","unstructured":"Zhu, X., Wang, H., Fei, H., Lei, Z., & Li, S.Z. (2021). Face forgery detection by 3d decomposition. In: CVPR.","DOI":"10.1109\/CVPR46437.2021.00295"},{"issue":"1","key":"2274_CR90","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1109\/JPROC.2020.3004555","volume":"109","author":"F Zhuang","year":"2020","unstructured":"Zhuang, F., Qi, Z., Duan, K., Xi, D., Zhu, Y., Zhu, H., Xiong, H., & He, Q. (2020). A comprehensive survey on transfer learning. Proceedings of the IEEE, 109(1), 43\u201376.","journal-title":"Proceedings of the IEEE"},{"key":"2274_CR91","doi-asserted-by":"crossref","unstructured":"Zi, B., Chang, M., Chen, J., Ma, X., & Jiang, Y.G. (2020). Wilddeepfake: A challenging real-world dataset for deepfake detection. In: ACM MM, pp. 2382\u20132390.","DOI":"10.1145\/3394171.3413769"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02274-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02274-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02274-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,10]],"date-time":"2025-05-10T06:57:50Z","timestamp":1746860270000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02274-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,24]]},"references-count":91,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2025,6]]}},"alternative-id":["2274"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02274-6","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,24]]},"assertion":[{"value":"24 May 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 September 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 January 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}