{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T15:15:08Z","timestamp":1784214908835,"version":"3.55.0"},"reference-count":39,"publisher":"MDPI AG","issue":"2","license":[{"start":{"date-parts":[[2026,2,16]],"date-time":"2026-02-16T00:00:00Z","timestamp":1771200000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"name":"Secretaria de Ciencia, Humanidades, Tecnologia e Innovacion","award":["161591"],"award-info":[{"award-number":["161591"]}]},{"name":"Secretaria de Ciencia, Humanidades, Tecnologia e Innovacion","award":["205834"],"award-info":[{"award-number":["205834"]}]},{"name":"Secretaria de Investigaci\u00f3n y Posgrado del Instituto Polit\u00e9cnico Nacional","award":["SIP-IPN-20250064"],"award-info":[{"award-number":["SIP-IPN-20250064"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Future Internet"],"abstract":"<jats:p>This paper introduces a deep learning-based framework for video watermarking that achieves robust, imperceptible, and fast embedding under a wide range of visual and temporal conditions. The proposed method is organized into seven modules that collaboratively perform frame encoding, semantic region analysis, block selection, watermark transformation, and spatiotemporal injection, followed by decoding and multi-objective optimization. A key component of the framework is its ability to learn a visual importance map, which guides a saliency-based block selection strategy. This allows the model to embed the watermark in perceptually redundant regions while minimizing distortion. To enhance resilience, the watermark is distributed across multiple frames, leveraging temporal redundancy to improve recovery under frame loss, insertion, and reordering. Experimental evaluations conducted on a large-scale video dataset demonstrate that the proposed method achieves high fidelity, while preserving low decoding error rates under compression, noise, and temporal distortions. The proposed method operates processing 38 video frames per second on a standard GPU. Additional ablation studies confirm the contribution of each module to the system\u2019s robustness. This framework offers a promising solution for watermarking in streaming, surveillance, and content verification applications.<\/jats:p>","DOI":"10.3390\/fi18020104","type":"journal-article","created":{"date-parts":[[2026,2,16]],"date-time":"2026-02-16T08:38:39Z","timestamp":1771231119000},"page":"104","update-policy":"https:\/\/doi.org\/10.3390\/mdpi_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Deep Learning-Based Video Watermarking: A Robust Framework for Spatial\u2013Temporal Embedding and Retrieval"],"prefix":"10.3390","volume":"18","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3420-6851","authenticated-orcid":false,"given":"Antonio","family":"Cedillo-Hernandez","sequence":"first","affiliation":[{"name":"Tecnologico de Monterrey, Escuela de Ingenieria y Ciencias, Av. Eugenio Garza Sada 2501, Colonia Tecnologico, Monterrey, Nuevo Leon CP 64700, Mexico"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lydia","family":"Velazquez-Garcia","sequence":"additional","affiliation":[{"name":"Instituto Politecnico Nacional, Centro de Investigaciones, Economicas, Administrativas y Sociales, Lauro Aguirre 120, Colonia Agricultura, Ciudad de Mexico CP 11360, Mexico"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1140-2190","authenticated-orcid":false,"given":"Francisco Javier","family":"Garcia-Ugalde","sequence":"additional","affiliation":[{"name":"Facultad de Ingenieria, Universidad Nacional Autonoma de Mexico, Av. Universidad 3000, Ciudad Universitaria, Coyoacan, Ciudad de Mexico CP 04510, Mexico"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9149-9841","authenticated-orcid":false,"given":"Manuel","family":"Cedillo-Hernandez","sequence":"additional","affiliation":[{"name":"Instituto Politecnico Nacional, Escuela Superior de Ingenieria Mecanica y Electrica, Unidad Culhuacan, Av. Santa Ana 1000, Colonia Culhuacan CTM V, Coyoacan, Ciudad de Mexico CP 04440, Mexico"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1968","published-online":{"date-parts":[[2026,2,16]]},"reference":[{"key":"ref_1","doi-asserted-by":"crossref","first-page":"4339","DOI":"10.1007\/s00034-024-02651-z","article-title":"Deep learning-based watermarking techniques challenges: A review of current and future trends","volume":"43","author":"Saoussen","year":"2024","journal-title":"Circuits Syst. Signal Process."},{"key":"ref_2","first-page":"031804","article-title":"Comprehensive review of watermarking techniques in deep-learning environments","volume":"32","author":"Singh","year":"2023","journal-title":"J. Electron. Imaging"},{"key":"ref_3","doi-asserted-by":"crossref","unstructured":"Zhong, X., Das, A., Alrasheedi, F., and Tanvir, A. (2023). A brief, in-depth survey of deep learning-based image watermarking. App. Sci., 13.","DOI":"10.3390\/app132111852"},{"key":"ref_4","doi-asserted-by":"crossref","first-page":"5531","DOI":"10.1007\/s11042-023-15806-y","article-title":"Digital image and video watermarking: Methodologies, attacks, applications, and future directions","volume":"83","author":"Aberna","year":"2024","journal-title":"Multimed. Tools Appl."},{"key":"ref_5","doi-asserted-by":"crossref","first-page":"104438","DOI":"10.1016\/j.jvcir.2025.104438","article-title":"RBMark: Robust and blind video watermark in DT CWT domain","volume":"109","author":"Huang","year":"2025","journal-title":"J. Vis. Commun. Image Represent."},{"key":"ref_6","doi-asserted-by":"crossref","first-page":"15475","DOI":"10.1007\/s11042-022-13928-3","article-title":"A blind CT and DCT based robust color image watermarking method","volume":"82","author":"Saritas","year":"2023","journal-title":"Multimed. Tools Appl."},{"key":"ref_7","doi-asserted-by":"crossref","unstructured":"Alkanhel, R., and Abdallah, H.A. (2022). Securing color video when transmitting through communication channels using DT-CWT-Based watermarking. Electronics, 11.","DOI":"10.3390\/electronics11121849"},{"key":"ref_8","doi-asserted-by":"crossref","unstructured":"Hou, J.U. (2021). MPEG and DA-AD resilient DCT-based video watermarking using adaptive frame selection. Electronics, 10.","DOI":"10.3390\/electronics10202467"},{"key":"ref_9","doi-asserted-by":"crossref","first-page":"31829","DOI":"10.1007\/s11042-023-16843-3","article-title":"A review of image watermarking for identity protection and verification","volume":"83","author":"Sharma","year":"2024","journal-title":"Multimed. Tools Appl."},{"key":"ref_10","doi-asserted-by":"crossref","first-page":"1955","DOI":"10.1109\/TCSVT.2021.3092004","article-title":"Exploring stable coefficients on joint sub-bands for robust video watermarking in DT CWT domain","volume":"32","author":"Huan","year":"2021","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"ref_11","doi-asserted-by":"crossref","first-page":"436","DOI":"10.1038\/nature14539","article-title":"Deep learning","volume":"521","author":"LeCun","year":"2015","journal-title":"Nature"},{"key":"ref_12","doi-asserted-by":"crossref","first-page":"76056","DOI":"10.1109\/ACCESS.2021.3082697","article-title":"Exploiting motion perception in depth estimation through a lightweight convolutional neural network","volume":"9","author":"Leite","year":"2021","journal-title":"IEEE Access"},{"key":"ref_13","doi-asserted-by":"crossref","first-page":"279","DOI":"10.1007\/s13748-022-00290-6","article-title":"Robust appearance modeling for object detection and tracking: A survey of deep learning approaches","volume":"11","author":"Mumuni","year":"2022","journal-title":"Prog. Artif. Intell."},{"key":"ref_14","doi-asserted-by":"crossref","first-page":"100662","DOI":"10.1016\/j.cosrev.2024.100662","article-title":"Digital image watermarking using deep learning: A survey","volume":"53","author":"Hosny","year":"2024","journal-title":"Comput. Sci. Rev."},{"key":"ref_15","doi-asserted-by":"crossref","first-page":"103830","DOI":"10.1016\/j.csi.2023.103830","article-title":"When deep learning meets watermarking: A survey of application, attacks and defenses","volume":"89","author":"Chen","year":"2024","journal-title":"Comput. Stand. Interfaces"},{"key":"ref_16","doi-asserted-by":"crossref","first-page":"1951","DOI":"10.1109\/TMM.2020.3006415","article-title":"An automated and robust image watermarking scheme based on deep neural networks","volume":"23","author":"Zhong","year":"2020","journal-title":"IEEE Trans. Multimed."},{"key":"ref_17","doi-asserted-by":"crossref","unstructured":"Kaczy\u0144ski, M., Piotrowski, Z., and Pietrow, D. (2022). High-quality video watermarking based on deep neural networks for video with HEVC compression. Sensors, 22.","DOI":"10.3390\/s22197552"},{"key":"ref_18","doi-asserted-by":"crossref","first-page":"1548","DOI":"10.1109\/TCSVT.2024.3471891","article-title":"Robust and compatible video watermarking via spatio-temporal enhancement and multiscale pyramid attention","volume":"35","author":"Chen","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"ref_19","doi-asserted-by":"crossref","unstructured":"Ye, G., Gao, J., Wang, Y., Song, L., and Wie, X. (2023, January 11\u201314). ItoV: Efficiently adapting deep learning-based image watermarking to video watermarking. Proceedings of the 2023 International Conference on Culture-Oriented Science and Technology (CoST), Xi\u2019an, China.","DOI":"10.1109\/CoST60524.2023.00047"},{"key":"ref_20","doi-asserted-by":"crossref","first-page":"4371","DOI":"10.1109\/TIP.2023.3251737","article-title":"Dvmark: A deep multiscale framework for video watermarking","volume":"34","author":"Luo","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"ref_21","doi-asserted-by":"crossref","unstructured":"Mansour, S., Jabra, S.B., and Zagrouba, E. (2023, January 19\u201321). A Robust Deep Learning-Based Video Watermarking Using Mosaic Generation. Proceedings of the 18th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISAPP), Lisbon, Portugal.","DOI":"10.5220\/0011691700003417"},{"key":"ref_22","first-page":"103868","article-title":"A DNN robust video watermarking method in dual-tree complex wavelet transform domain","volume":"85","author":"Chang","year":"2024","journal-title":"J. Inf. Secur. Appl."},{"key":"ref_23","unstructured":"Jang, M., Jang, Y., Lee, J., Yang, F., Oh, G., Jeong, J., and Kim, S. (2024). LVMark: Robust Watermark for latent video diffusion models. arXiv."},{"key":"ref_24","doi-asserted-by":"crossref","first-page":"600","DOI":"10.1109\/TIP.2003.819861","article-title":"Image quality assessment: From error visibility to structural similarity","volume":"13","author":"Wang","year":"2004","journal-title":"IEEE Trans. Image Process."},{"key":"ref_25","unstructured":"Carreira, J., Noland, E., Banki-Horvath, A., Hillier, C., and Zisserman, A. (2018). A short note about kinetics-600. arXiv."},{"key":"ref_26","doi-asserted-by":"crossref","unstructured":"Lee, J.E., Seo, Y.H., and Kim, D.W. (2020). Convolutional neural network-based digital image watermarking adaptive to the resolution of image and watermark. Appl. Sci., 10.","DOI":"10.3390\/app10196854"},{"key":"ref_27","doi-asserted-by":"crossref","unstructured":"Zhu, J., Kaplan, R., Johnson, J., and Li, F.-F. (2018, January 8\u201314). Hiding data with deep networks. Proceedings of the European Conference on Computer Vision (ECCV), Munich, Germany.","DOI":"10.1007\/978-3-030-01267-0_40"},{"key":"ref_28","doi-asserted-by":"crossref","unstructured":"Abdelnabi, S., and Fritz, M. (2021, January 24\u201327). Adversarial watermarking transformer: Towards tracing text provenance with data hiding. Proceedings of the 2021 IEEE Symposium on Security and Privacy (SP), San Francisco, CA, USA.","DOI":"10.1109\/SP40001.2021.00083"},{"key":"ref_29","first-page":"133","article-title":"Robust Deep Image Watermarking: A Survey","volume":"81","author":"Luo","year":"2024","journal-title":"Comput. Mater. Contin."},{"key":"ref_30","doi-asserted-by":"crossref","first-page":"28013","DOI":"10.1007\/s11042-024-20258-z","article-title":"A comprehensive overview of deep learning-based video watermarking: Current works, challenges and future trends","volume":"84","author":"Mansour","year":"2024","journal-title":"Multimed. Tools Appl."},{"key":"ref_31","unstructured":"Fernandez, P., Elsahar, H., Yalniz, I.Z., and Mourachko, A. (2024). Video seal: Open and efficient video watermarking. arXiv."},{"key":"ref_32","doi-asserted-by":"crossref","unstructured":"Mansour, S., Jabra, S.B., and Zagrouba, E. (2023, January 3\u20135). A comprehensive review of video watermarking technique in deep learning environments. Proceedings of the 2023 International Conference on Cyberworlds (CW), Sousse, Tunisia.","DOI":"10.1109\/CW58918.2023.00020"},{"key":"ref_33","doi-asserted-by":"crossref","first-page":"251","DOI":"10.1109\/TIP.2022.3227503","article-title":"Adapool: Exponential adaptive pooling for information-retaining downsampling","volume":"32","author":"Stergiou","year":"2022","journal-title":"IEEE Trans. Image Process."},{"key":"ref_34","first-page":"234","article-title":"U-net: Convolutional networks for biomedical image segmentation","volume":"Volume 9351","author":"Ronneberger","year":"2015","journal-title":"Proceedings of the International Conference on Medical Image Computing and Computer-Assisted Intervention"},{"key":"ref_35","doi-asserted-by":"crossref","first-page":"5861","DOI":"10.1109\/TDSC.2025.3576223","article-title":"Light-Field Image Multiple Reversible Robust Watermarking Against Geometric Attacks","volume":"22","author":"Wang","year":"2025","journal-title":"IEEE Trans. Dependable Secur. Comput."},{"key":"ref_36","doi-asserted-by":"crossref","unstructured":"Cheng, X., Wang, H., Luo, X., Guan, Q., Ma, B., and Wang, J. (2025). Re-cropping Framework: A Grid Recovery Method for Quantization Step Estimation in Non-aligned Recompressed Images. IEEE Trans. Circuits Syst. Video Technol.","DOI":"10.1109\/TCSVT.2025.3635150"},{"key":"ref_37","doi-asserted-by":"crossref","first-page":"8011","DOI":"10.1109\/TDSC.2025.3603570","article-title":"Encrypt a Story: A Video Segment Encryption Method Based on the Discrete Sinusoidal Memristive Rulkov Neuron","volume":"22","author":"Gao","year":"2025","journal-title":"IEEE Trans. Dependable Secur. Comput."},{"key":"ref_38","doi-asserted-by":"crossref","first-page":"130808","DOI":"10.1016\/j.eswa.2025.130808","article-title":"Multi-layer and multi-directional image encryption algorithm based on hyperchaotic 3D Xin-She Yang map","volume":"304","author":"Erkan","year":"2026","journal-title":"Expert Syst. Appl."},{"key":"ref_39","first-page":"106","article-title":"Image Steganography in Color Conversion","volume":"71","author":"Li","year":"2023","journal-title":"IEEE Trans. Circuits Syst. II Express Briefs"}],"container-title":["Future Internet"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.mdpi.com\/1999-5903\/18\/2\/104\/pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,16]],"date-time":"2026-02-16T08:46:59Z","timestamp":1771231619000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.mdpi.com\/1999-5903\/18\/2\/104"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,2,16]]},"references-count":39,"journal-issue":{"issue":"2","published-online":{"date-parts":[[2026,2]]}},"alternative-id":["fi18020104"],"URL":"https:\/\/doi.org\/10.3390\/fi18020104","relation":{},"ISSN":["1999-5903"],"issn-type":[{"value":"1999-5903","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,2,16]]}}}