{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T23:19:20Z","timestamp":1783207160931,"version":"3.54.6"},"reference-count":50,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100012906","name":"Shandong Provincial Education Department","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100012906","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100010029","name":"Taishan Scholar Foundation of Shandong Province","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100010029","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Displays"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.displa.2026.103603","type":"journal-article","created":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T15:40:12Z","timestamp":1783006812000},"page":"103603","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["WARRIOR: Multi-view cross-modal interaction for video-text retrieval"],"prefix":"10.1016","volume":"95","author":[{"given":"Shenghua","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Di","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yishan","family":"Zou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Da","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiahui","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Meng","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.displa.2026.103603_b1","series-title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss","first-page":"1","author":"Cheng","year":"2021"},{"key":"10.1016\/j.displa.2026.103603_b2","doi-asserted-by":"crossref","unstructured":"V. Gabeur, C. Sun, K. Alahari, C. Schmid, Multi-modal transformer for video retrieval, in: European Conference on Computer Vision, 2020, pp. 214\u2013229.","DOI":"10.1007\/978-3-030-58548-8_13"},{"key":"10.1016\/j.displa.2026.103603_b3","unstructured":"C. Jia, Y. Yang, Y. Xia, Y.-T. Chen, Z. Parekh, H. Pham, Q. Le, Y.-H. Sung, Z. Li, T. Duerig, Scaling up visual and vision-language representation learning with noisy text supervision, in: International Conference on Machine Learning, 2021, pp. 4904\u20134916."},{"key":"10.1016\/j.displa.2026.103603_b4","doi-asserted-by":"crossref","unstructured":"R. Deng, Y. Li, DeCMG: Denoise with Cross-modality Guidance Makes Better Text-Video Retrieval, in: IEEE International Conference on Multimedia and Expo, 2024, pp. 1\u20136.","DOI":"10.1109\/ICME57554.2024.10687750"},{"key":"10.1016\/j.displa.2026.103603_b5","doi-asserted-by":"crossref","DOI":"10.1016\/j.displa.2024.102801","article-title":"CLIP2TF: Multimodal video\u2013text retrieval for adolescent education","volume":"84","author":"Sun","year":"2024","journal-title":"Displays"},{"key":"10.1016\/j.displa.2026.103603_b6","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1016\/j.neucom.2022.07.028","article-title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","volume":"508","author":"Luo","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.displa.2026.103603_b7","unstructured":"A. Radford, J.W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark, et al., Learning transferable visual models from natural language supervision, in: International Conference on Machine Learning, 2021, pp. 8748\u20138763."},{"key":"10.1016\/j.displa.2026.103603_b8","first-page":"1","article-title":"Building an open-vocabulary video CLIP model with better architectures, optimization and data","author":"Wu","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.displa.2026.103603_b9","series-title":"Tg-vqa: Ternary game of video question answering","first-page":"1","author":"Li","year":"2023"},{"key":"10.1016\/j.displa.2026.103603_b10","doi-asserted-by":"crossref","unstructured":"M. Bain, A. Nagrani, G. Varol, A. Zisserman, Frozen in time: A joint video and image encoder for end-to-end retrieval, in: IEEE International Conference on Computer Vision, 2021, pp. 1728\u20131738.","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"10.1016\/j.displa.2026.103603_b11","doi-asserted-by":"crossref","first-page":"38655","DOI":"10.52202\/068431-2801","article-title":"Text-adaptive multiple visual prototype matching for video-text retrieval","volume":"35","author":"Lin","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.displa.2026.103603_b12","series-title":"Disentangled representation learning for text-video retrieval","first-page":"1","author":"Wang","year":"2022"},{"key":"10.1016\/j.displa.2026.103603_b13","series-title":"ProTA: Probabilistic token aggregation for text-video retrieval","first-page":"1","author":"Fang","year":"2024"},{"key":"10.1016\/j.displa.2026.103603_b14","doi-asserted-by":"crossref","unstructured":"B. Fang, W. Wu, C. Liu, Y. Zhou, Y. Song, W. Wang, X. Shu, X. Ji, J. Wang, Uatvr: Uncertainty-adaptive text-video retrieval, in: IEEE International Conference on Computer Vision, 2023, pp. 13723\u201313733.","DOI":"10.1109\/ICCV51070.2023.01262"},{"key":"10.1016\/j.displa.2026.103603_b15","doi-asserted-by":"crossref","unstructured":"L. Anne Hendricks, O. Wang, E. Shechtman, J. Sivic, T. Darrell, B. Russell, Localizing moments in video with natural language, in: IEEE International Conference on Computer Vision, 2017, pp. 5803\u20135812.","DOI":"10.1109\/ICCV.2017.618"},{"key":"10.1016\/j.displa.2026.103603_b16","doi-asserted-by":"crossref","unstructured":"J. Xu, T. Mei, T. Yao, Y. Rui, Msr-vtt: A large video description dataset for bridging video and language, in: IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 5288\u20135296.","DOI":"10.1109\/CVPR.2016.571"},{"key":"10.1016\/j.displa.2026.103603_b17","doi-asserted-by":"crossref","first-page":"94","DOI":"10.1007\/s11263-016-0987-1","article-title":"Movie description","volume":"123","author":"Rohrbach","year":"2017","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.displa.2026.103603_b18","series-title":"Learning a text-video embedding from incomplete and heterogeneous data","first-page":"1","author":"Miech","year":"2018"},{"key":"10.1016\/j.displa.2026.103603_b19","doi-asserted-by":"crossref","unstructured":"J. Hu, L. Shen, G. Sun, Squeeze-and-excitation networks, in: IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 7132\u20137141.","DOI":"10.1109\/CVPR.2018.00745"},{"key":"10.1016\/j.displa.2026.103603_b20","doi-asserted-by":"crossref","unstructured":"J. Devlin, M.-W. Chang, K. Lee, K. Toutanova, Bert: Pre-training of deep bidirectional transformers for language understanding, in: Conference of the North American Chapter of the Association for Computational Linguistics, 2019, pp. 4171\u20134186.","DOI":"10.18653\/v1\/N19-1423"},{"key":"10.1016\/j.displa.2026.103603_b21","doi-asserted-by":"crossref","DOI":"10.1016\/j.displa.2025.103126","article-title":"Multimodal learning with feature fusion transformer for image captioning","author":"Zhu","year":"2025","journal-title":"Displays"},{"key":"10.1016\/j.displa.2026.103603_b22","series-title":"Clip2video: Mastering video-text retrieval via image clip","first-page":"1","author":"Fang","year":"2021"},{"key":"10.1016\/j.displa.2026.103603_b23","doi-asserted-by":"crossref","unstructured":"X. Song, F. Feng, X. Han, X. Yang, W. Liu, L. Nie, Neural compatibility modeling with attentive knowledge distillation, in: ACM SIGIR Conference on Research and Development in Information Retrieval, 2018, pp. 5\u201314.","DOI":"10.1145\/3209978.3209996"},{"key":"10.1016\/j.displa.2026.103603_b24","unstructured":"S.K. Gorti, N. Vouitsis, J. Ma, K. Golestan, M. Volkovs, A. Garg, G. Yu, X-pool: Cross-modal language-video attention for text-video retrieval, in: IEEE Conference on Computer Vision and Pattern Recognition, 2022, pp. 5006\u20135015."},{"key":"10.1016\/j.displa.2026.103603_b25","doi-asserted-by":"crossref","unstructured":"S. Huang, B. Gong, Y. Pan, J. Jiang, Y. Lv, Y. Li, D. Wang, Vop: Text-video co-operative prompt tuning for cross-modal retrieval, in: IEEE Conference on Computer Vision and Pattern Recognition, 2023, pp. 6565\u20136574.","DOI":"10.1109\/CVPR52729.2023.00635"},{"key":"10.1016\/j.displa.2026.103603_b26","doi-asserted-by":"crossref","unstructured":"L. Huang, L. Wang, H. Li, Weakly supervised temporal action localization via representative snippet knowledge propagation, in: IEEE Conference on Computer Vision and Pattern Recognition, 2022, pp. 3272\u20133281.","DOI":"10.1109\/CVPR52688.2022.00327"},{"key":"10.1016\/j.displa.2026.103603_b27","doi-asserted-by":"crossref","unstructured":"X. Li, Z. Zhong, J. Wu, Y. Yang, Z. Lin, H. Liu, Expectation-maximization attention networks for semantic segmentation, in: IEEE International Conference on Computer Vision, 2019, pp. 9167\u20139176.","DOI":"10.1109\/ICCV.2019.00926"},{"key":"10.1016\/j.displa.2026.103603_b28","doi-asserted-by":"crossref","unstructured":"J. Dong, X. Li, C. Xu, S. Ji, Y. He, G. Yang, X. Wang, Dual encoding for zero-example video retrieval, in: IEEE Conference on Computer Vision and Pattern Recognition, 2019, pp. 9346\u20139355.","DOI":"10.1109\/CVPR.2019.00957"},{"key":"10.1016\/j.displa.2026.103603_b29","doi-asserted-by":"crossref","unstructured":"N.C. Mithun, J. Li, F. Metze, A.K. Roy-Chowdhury, Learning joint embedding with multimodal cues for cross-modal video-text retrieval, in: ACM International Conference on Multimedia Retrieval, 2018, pp. 19\u201327.","DOI":"10.1145\/3206025.3206064"},{"key":"10.1016\/j.displa.2026.103603_b30","doi-asserted-by":"crossref","unstructured":"M. Liu, X. Wang, L. Nie, Q. Tian, B. Chen, T.-S. Chua, Cross-modal moment localization in videos, in: ACM International Conference on Multimedia, 2018, pp. 843\u2013851.","DOI":"10.1145\/3240508.3240549"},{"key":"10.1016\/j.displa.2026.103603_b31","doi-asserted-by":"crossref","unstructured":"M. Liu, X. Wang, L. Nie, X. He, B. Chen, T.-S. Chua, Attentive moment retrieval in videos, in: ACM SIGIR Conference on Research and Development in Information Retrieval, 2018, pp. 15\u201324.","DOI":"10.1145\/3209978.3210003"},{"key":"10.1016\/j.displa.2026.103603_b32","doi-asserted-by":"crossref","unstructured":"Z. Wang, Y.-L. Sung, F. Cheng, G. Bertasius, M. Bansal, Unified coarse-to-fine alignment for video-text retrieval, in: IEEE International Conference on Computer Vision, 2023, pp. 2816\u20132827.","DOI":"10.1109\/ICCV51070.2023.00264"},{"key":"10.1016\/j.displa.2026.103603_b33","doi-asserted-by":"crossref","unstructured":"S.-V. Bogolin, I. Croitoru, H. Jin, Y. Liu, S. Albanie, Cross modal retrieval with querybank normalisation, in: IEEE Conference on Computer Vision and Pattern Recognition, 2022, pp. 5194\u20135205.","DOI":"10.1109\/CVPR52688.2022.00513"},{"key":"10.1016\/j.displa.2026.103603_b34","doi-asserted-by":"crossref","unstructured":"Y. Liu, P. Xiong, L. Xu, S. Cao, Q. Jin, Ts2-net: Token shift and selection transformer for text-video retrieval, in: European Conference on Computer Vision, 2022, pp. 319\u2013335.","DOI":"10.1007\/978-3-031-19781-9_19"},{"key":"10.1016\/j.displa.2026.103603_b35","doi-asserted-by":"crossref","unstructured":"P. Jin, J. Huang, P. Xiong, S. Tian, C. Liu, X. Ji, L. Yuan, J. Chen, Video-text as game players: Hierarchical banzhaf interaction for cross-modal representation learning, in: IEEE Conference on Computer Vision and Pattern Recognition, 2023, pp. 2472\u20132482.","DOI":"10.1109\/CVPR52729.2023.00244"},{"key":"10.1016\/j.displa.2026.103603_b36","doi-asserted-by":"crossref","unstructured":"R. Liu, J. Huang, G. Li, J. Feng, X. Wu, T.H. Li, Revisiting temporal modeling for clip-based image-to-video knowledge transferring, in: IEEE Conference on Computer Vision and Pattern Recognition, 2023, pp. 6555\u20136564.","DOI":"10.1109\/CVPR52729.2023.00634"},{"key":"10.1016\/j.displa.2026.103603_b37","doi-asserted-by":"crossref","unstructured":"K. Tian, R. Zhao, Z. Xin, B. Lan, X. Li, Holistic Features are almost Sufficient for Text-to-Video Retrieval, in: IEEE Conference on Computer Vision and Pattern Recognition, 2024, pp. 17138\u201317147.","DOI":"10.1109\/CVPR52733.2024.01622"},{"key":"10.1016\/j.displa.2026.103603_b38","doi-asserted-by":"crossref","unstructured":"X. Dong, Z. Feng, C. Zhou, X. Yu, M. Yang, Q. Guo, M2-RAAP: A Multi-Modal Recipe for Advancing Adaptation-based Pre-training towards Effective and Efficient Zero-shot Video-text Retrieval, in: ACM SIGIR Conference on Research and Development in Information Retrieval, 2024, pp. 2156\u20132166.","DOI":"10.1145\/3626772.3657833"},{"key":"10.1016\/j.displa.2026.103603_b39","doi-asserted-by":"crossref","unstructured":"Q. Li, L. Su, J. Zhao, L. Xia, H. Cai, S. Cheng, H. Tang, J. Wang, D. Yin, Text-Video Retrieval via Multi-Modal Hypergraph Networks, in: ACM International Conference on Web Search and Data Mining, 2024, pp. 369\u2013377.","DOI":"10.1145\/3616855.3635757"},{"key":"10.1016\/j.displa.2026.103603_b40","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.inffus.2025.103151","article-title":"TC-MGC: Text-conditioned multi-grained contrastive learning for text\u2013video retrieval","volume":"121","author":"Jing","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.displa.2026.103603_b41","doi-asserted-by":"crossref","unstructured":"L. Shen, G. Gong, T. Hao, T. He, Y. Zhang, P. Liu, S. Zhao, J. Han, G. Ding, DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval, in: IEEE Conference on Computer Vision and Pattern Recognition, 2025, pp. 19702\u201319712.","DOI":"10.1109\/CVPR52734.2025.01835"},{"issue":"6","key":"10.1016\/j.displa.2026.103603_b42","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1007\/s00530-024-01525-3","article-title":"Hierarchical bi-directional conceptual interaction for text-video retrieval","volume":"30","author":"Han","year":"2024","journal-title":"Multimedia Syst."},{"key":"10.1016\/j.displa.2026.103603_b43","doi-asserted-by":"crossref","unstructured":"B. Jeong, J. Park, S. Kim, S. Kwak, Learning audio-guided video representation with gated attention for video-text retrieval, in: Proceedings of the Computer Vision and Pattern Recognition Conference, 2025, pp. 26202\u201326211.","DOI":"10.1109\/CVPR52734.2025.02440"},{"key":"10.1016\/j.displa.2026.103603_b44","series-title":"HVD: Human vision-driven video representation learning for text-video retrieval","author":"Xie","year":"2026"},{"key":"10.1016\/j.displa.2026.103603_b45","series-title":"Video-language alignment pre-training via spatio-temporal graph transformer","first-page":"1","author":"Zhang","year":"2024"},{"key":"10.1016\/j.displa.2026.103603_b46","doi-asserted-by":"crossref","unstructured":"J. Huang, Y. Li, J. Feng, X. Wu, X. Sun, R. Ji, Clover: Towards a unified video-language alignment and fusion model, in: IEEE Conference on Computer Vision and Pattern Recognition, 2023, pp. 14856\u201314866.","DOI":"10.1109\/CVPR52729.2023.01427"},{"key":"10.1016\/j.displa.2026.103603_b47","doi-asserted-by":"crossref","unstructured":"S. Zhao, L. Zhu, X. Wang, Y. Yang, Centerclip: Token clustering for efficient text-video retrieval, in: ACM SIGIR Conference on Research and Development in Information Retrieval, 2022, pp. 970\u2013981.","DOI":"10.1145\/3477495.3531950"},{"key":"10.1016\/j.displa.2026.103603_b48","doi-asserted-by":"crossref","unstructured":"Y. Ma, G. Xu, X. Sun, M. Yan, J. Zhang, R. Ji, X-clip: End-to-end multi-grained contrastive learning for video-text retrieval, in: ACM International Conference on Multimedia, 2022, pp. 638\u2013647.","DOI":"10.1145\/3503161.3547910"},{"key":"10.1016\/j.displa.2026.103603_b49","doi-asserted-by":"crossref","unstructured":"J. Lei, L. Li, L. Zhou, Z. Gan, T.L. Berg, M. Bansal, J. Liu, Less is more: Clipbert for video-and-language learning via sparse sampling, in: IEEE Conference on Computer Vision and Pattern Recognition, 2021, pp. 7331\u20137341.","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"10.1016\/j.displa.2026.103603_b50","doi-asserted-by":"crossref","unstructured":"I. Croitoru, S.-V. Bogolin, M. Leordeanu, H. Jin, A. Zisserman, S. Albanie, Y. Liu, Teachtext: Crossmodal generalized distillation for text-video retrieval, in: IEEE International Conference on Computer Vision, 2021, pp. 11583\u201311593.","DOI":"10.1109\/ICCV48922.2021.01138"}],"container-title":["Displays"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0141938226002660?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0141938226002660?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T23:03:53Z","timestamp":1783206233000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0141938226002660"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":50,"alternative-id":["S0141938226002660"],"URL":"https:\/\/doi.org\/10.1016\/j.displa.2026.103603","relation":{},"ISSN":["0141-9382"],"issn-type":[{"value":"0141-9382","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"WARRIOR: Multi-view cross-modal interaction for video-text retrieval","name":"articletitle","label":"Article Title"},{"value":"Displays","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.displa.2026.103603","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"103603"}}