{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T15:55:14Z","timestamp":1784217314412,"version":"3.55.0"},"reference-count":63,"publisher":"Tsinghua University Press","issue":"2","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62102418,62172415"],"award-info":[{"award-number":["62102418,62172415"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012401","name":"Beijing Science and Technology Plan Project","doi-asserted-by":"publisher","award":["Z231100005923033"],"award-info":[{"award-number":["Z231100005923033"]}],"id":[{"id":"10.13039\/501100012401","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Comp. Visual. Med."],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.26599\/cvm.2025.9450444","type":"journal-article","created":{"date-parts":[[2026,2,13]],"date-time":"2026-02-13T20:48:55Z","timestamp":1771015735000},"page":"449-471","source":"Crossref","is-referenced-by-count":2,"title":["M2HF: Multi-Branch Multi-Modal Hybrid Fusion for Text-Video Retrieval"],"prefix":"10.26599","volume":"12","author":[{"given":"Shuo","family":"Liu","sequence":"first","affiliation":[{"name":"MAIS, Institute of Automation, Chinese Academy of Sciences,Beijing,China,100190"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weize","family":"Quan","sequence":"additional","affiliation":[{"name":"MAIS, Institute of Automation, Chinese Academy of Sciences,Beijing,China,100190"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ming","family":"Zhou","sequence":"additional","affiliation":[{"name":"School of Information Science and Technology, Donghua University,Shanghai,China,200051"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sihong","family":"Chen","sequence":"additional","affiliation":[{"name":"Tencent,Shenzhen,China,518057"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Kang","sequence":"additional","affiliation":[{"name":"Tencent,Shenzhen,China,518057"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhe","family":"Zhao","sequence":"additional","affiliation":[{"name":"Tencent,Shenzhen,China,518057"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kimmo","family":"Yan","sequence":"additional","affiliation":[{"name":"Tencent,Shenzhen,China,518057"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen","family":"Chen","sequence":"additional","affiliation":[{"name":"Tencent,Shenzhen,China,518057"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dong-Ming","family":"Yan","sequence":"additional","affiliation":[{"name":"MAIS, Institute of Automation, Chinese Academy of Sciences,Beijing,China,100190"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"11138","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3011288"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3090595"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3149716"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3239183"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58548-8_13"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00374"},{"key":"ref7","article-title":"CLIP4Clip: An empirical study of CLIP for end to end video clip retrieval","author":"Luo","year":"2021","journal-title":"arXiv preprint"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i1.19891"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3227416"},{"key":"ref10","article-title":"HunYuan_tvr for text-video retrivial","author":"Min","year":"2022","journal-title":"arXiv preprint"},{"key":"ref11","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proceedings of the 38th International Conference on Machine Learning","author":"Radford","year":"2021"},{"key":"ref12","first-page":"247","article-title":"Hadamard product for low-rank bilinear pooling","volume-title":"Proceedings of the International Conference on Learning Representations","author":"Kim","year":"2017"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.202"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00745"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00813"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413581"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3355089.3356520"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.14415"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-023-0345-5"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/1101149.1101236"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/36.942557"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICIA.2004.1373380"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/1126004.1126007"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2537340"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3347320.3357690"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3475957.3484457"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/3551876.3554802"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/11608288_66"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-013-1391-2"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-006-0063-8"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-71496-5_44"},{"key":"ref33","first-page":"2211","article-title":"Multiple kernel learning algorithms","volume":"12","author":"G\u00f6nen","year":"2011","journal-title":"The Journal of Machine Learning Research"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-0602"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/FG.2015.7163113"},{"key":"ref36","article-title":"Depression status estimation by deep learning based hybrid multimodal fusion model","author":"Shalu","year":"2020","journal-title":"arXiv preprint"},{"key":"ref37","article-title":"MDMMT-2: Multidomain multimodal transformer for video retrieval, one more step towards generalization","author":"Kunitsyn","year":"2022","journal-title":"arXiv preprint"},{"key":"ref38","article-title":"CLIP2Video: Mastering video-text retrieval via image CLIP","author":"Fang","year":"2021","journal-title":"arXiv preprint"},{"key":"ref39","article-title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss","author":"Cheng","year":"2021","journal-title":"arXiv preprint"},{"key":"ref40","article-title":"Disentangled representation learning for text-video retrieval","author":"Wang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00495"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_26"},{"key":"ref43","article-title":"Text-adaptive multiple visual prototype matching for video-text retrieval","volume-title":"Proceedings of the 36th Conference on Neural Information Processing Systems","author":"Lin","year":"2022"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"ref45","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021","journal-title":"arXiv preprint"},{"key":"ref46","first-page":"4171","article-title":"Bert: Pretraining of deep bidirectional transformers for language understanding","volume-title":"Proceedings of the Annual Conference of the North American Chapter of the Association for Computational Linguistics","author":"Devlin","year":"2019"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_19"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1111\/j.1469-8137.1912.tb05611.x"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref52","first-page":"190","article-title":"Collecting highly parallel data for paraphrase evaluation","volume-title":"Proceedings of the Annual Meeting of the Association for Computational Linguistics: Human Language Technologies","author":"Chen","year":"2011"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24947-6_17"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.618"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01234-2_29"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01261-8_23"},{"key":"ref58","article-title":"Use what you have: Video retrieval using representations from collaborative experts","author":"Liu","year":"2019","journal-title":"arXiv preprint"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-3015"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-1965"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00504"}],"container-title":["Computational Visual Media"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10750449\/11435620\/11396451.pdf?arnumber=11396451","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,17]],"date-time":"2026-03-17T20:23:19Z","timestamp":1773778999000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11396451\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4]]},"references-count":63,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.26599\/cvm.2025.9450444","relation":{},"ISSN":["2096-0662","2096-0433"],"issn-type":[{"value":"2096-0662","type":"electronic"},{"value":"2096-0433","type":"print"}],"subject":[],"published":{"date-parts":[[2026,4]]}}}