{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T12:05:03Z","timestamp":1784203503841,"version":"3.55.0"},"reference-count":51,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100002367","name":"Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["104GJHZ2023053FN"],"award-info":[{"award-number":["104GJHZ2023053FN"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neural Networks"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.neunet.2026.109092","type":"journal-article","created":{"date-parts":[[2026,5,11]],"date-time":"2026-05-11T06:30:48Z","timestamp":1778481048000},"page":"109092","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["ProPy : Building interactive and efficient prompt pyramids upon CLIP for partially relevant video retrieval"],"prefix":"10.1016","volume":"202","author":[{"given":"Yi","family":"Pan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2335-7657","authenticated-orcid":false,"given":"Yujia","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7699-0405","authenticated-orcid":false,"given":"Michael","family":"Kampffmeyer","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoguang","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neunet.2026.109092_bib0001","series-title":"Proceedings of the IEEE\/CVF Conference on computer vision and pattern recognition","first-page":"7558","article-title":"Audio visual scene-aware dialog","author":"Alamri","year":"2019"},{"key":"10.1016\/j.neunet.2026.109092_bib0002","doi-asserted-by":"crossref","unstructured":"Cao, M., Tang, H., Huang, J., Jin, P., Zhang, C., Liu, R., Chen, L., Liang, X., Yuan, L., & Li, G. (2024). Rap: Efficient text-video retrieval with sparse-and-correlated adapter. arXiv preprint arXiv: 2405.19465.","DOI":"10.18653\/v1\/2024.findings-acl.427"},{"key":"10.1016\/j.neunet.2026.109092_bib0003","series-title":"Proceedings of the IEEE Conference on computer vision and pattern recognition","first-page":"6299","article-title":"Quo vadis, action recognition? a new model and the kinetics dataset","author":"Carreira","year":"2017"},{"key":"10.1016\/j.neunet.2026.109092_bib0004","series-title":"International conference on machine learning","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"Chen","year":"2020"},{"key":"10.1016\/j.neunet.2026.109092_bib0005","series-title":"Proceedings of the 31st ACM International conference on multimedia","first-page":"975","article-title":"Joint searching and grounding: Multi-granularity video content retrieval","author":"Chen","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0006","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2024.105168","article-title":"Transferable dual multi-granularity semantic excavating for partially relevant video retrieval","volume":"149","author":"Cheng","year":"2024","journal-title":"Image and Vision Computing"},{"key":"10.1016\/j.neunet.2026.109092_bib0007","series-title":"Proceedings of the AAAI Conference on artificial intelligence","first-page":"2500","article-title":"Ambiguity-restrained text-video representation learning for partially relevant video retrieval","volume":"vol. 39","author":"Cho","year":"2025"},{"key":"10.1016\/j.neunet.2026.109092_bib0008","series-title":"Proceedings of the IEEE\/CVF International conference on computer vision","first-page":"15648","article-title":"Prompt switch: Efficient clip adaptation for text-video retrieval","author":"Deng","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0009","series-title":"Proceedings of the 30th ACM International conference on multimedia","first-page":"246","article-title":"Partially relevant video retrieval","author":"Dong","year":"2022"},{"issue":"8","key":"10.1016\/j.neunet.2026.109092_bib0010","first-page":"4065","article-title":"Dual encoding for video retrieval by text","volume":"44","author":"Dong","year":"2021","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"10.1016\/j.neunet.2026.109092_bib0011","series-title":"Proceedings of the IEEE\/CVF International conference on computer vision","first-page":"11302","article-title":"Dual learning with dynamic knowledge distillation for partially relevant video retrieval","author":"Dong","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0012","unstructured":"Fei, H., Wu, S., Ji, W., Zhang, H., Zhang, M., Lee, M.-L., & Hsu, W. (2024). Video-of-thought: Step-by-step video reasoning from perception to cognition. arXiv preprint arXiv: 2501.03230."},{"key":"10.1016\/j.neunet.2026.109092_bib0013","series-title":"European conference on computer vision","first-page":"214","article-title":"Multi-modal transformer for video retrieval","author":"Gabeur","year":"2020"},{"key":"10.1016\/j.neunet.2026.109092_bib0014","series-title":"Proceedings of the IEEE International conference on computer vision","first-page":"5267","article-title":"Tall: Temporal activity localization via language query","author":"Gao","year":"2017"},{"key":"10.1016\/j.neunet.2026.109092_bib0015","series-title":"Proceedings of the IEEE Conference on computer vision and pattern recognition","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.neunet.2026.109092_bib0016","series-title":"International conference on machine learning","first-page":"2790","article-title":"Parameter-efficient transfer learning for NLP","author":"Houlsby","year":"2019"},{"key":"10.1016\/j.neunet.2026.109092_bib0017","series-title":"Proceedings of the IEEE\/CVF Conference on computer vision and pattern recognition","first-page":"6565","article-title":"Vop: Text-video co-operative prompt tuning for cross-modal retrieval","author":"Huang","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0018","series-title":"European conference on computer vision","first-page":"709","article-title":"Visual prompt tuning","author":"Jia","year":"2022"},{"key":"10.1016\/j.neunet.2026.109092_bib0019","series-title":"2023\u202fIEEE International conference on multimedia and expo (ICME)","first-page":"1973","article-title":"Progressive event alignment network for partial relevant video retrieval","author":"Jiang","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0020","doi-asserted-by":"crossref","first-page":"9657","DOI":"10.1109\/TMM.2024.3396272","article-title":"Zero-shot video moment retrieval with angular reconstructive text embeddings","volume":"26","author":"Jiang","year":"2024","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.neunet.2026.109092_bib0021","series-title":"Proceedings of the AAAI Conference on artificial intelligence","first-page":"4166","article-title":"Bridging the semantic granularity gap between text and frame representations for partially relevant video retrieval","volume":"vol. 39","author":"Jun","year":"2025"},{"key":"10.1016\/j.neunet.2026.109092_bib0022","series-title":"Proceedings of the IEEE International conference on computer vision","first-page":"706","article-title":"Dense-captioning events in videos","author":"Krishna","year":"2017"},{"key":"10.1016\/j.neunet.2026.109092_bib0023","first-page":"11846","article-title":"Detecting moments and highlights in videos via natural language queries","volume":"34","author":"Lei","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109092_bib0024","series-title":"Computer vision\u2013ECCV 2020: 16th European conference, glasgow, UK, august 23\u201328, 2020, proceedings, part XXI 16","first-page":"447","article-title":"TVR: A large-scale dataset for video-subtitle moment retrieval","author":"Lei","year":"2020"},{"key":"10.1016\/j.neunet.2026.109092_bib0025","doi-asserted-by":"crossref","unstructured":"Lester, B., Al-Rfou, R., & Constant, N. (2021). The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv: 2104.08691.","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"10.1016\/j.neunet.2026.109092_bib0026","unstructured":"Li, J., Fang, J., Gao, T., Zhang, X., Liu, Z., Liu, C., Liu, P., & Jiang, Q. (2025a). FANoise: Singular value-adaptive noise modulation for robust multimodal representation learning. arXiv preprint arXiv: 2511.20997."},{"key":"10.1016\/j.neunet.2026.109092_bib0027","series-title":"International conference on machine learning","first-page":"19730","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0028","series-title":"International conference on machine learning","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","author":"Li","year":"2022"},{"key":"10.1016\/j.neunet.2026.109092_bib0029","series-title":"Proceedings of the thirty-fourth international joint conference on artificial intelligence","first-page":"8168","article-title":"Multimodal knowledge retrieval-augmented iterative alignment for satellite commonsense conversation","author":"Li","year":"2025"},{"key":"10.1016\/j.neunet.2026.109092_bib0030","unstructured":"Li, X. L., & Liang, P. (2021). Prefix-tuning: Optimizing continuous prompts for generation. arXiv preprint arXiv: 2101.00190."},{"key":"10.1016\/j.neunet.2026.109092_bib0031","unstructured":"Liu, Y., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., Levy, O., Lewis, M., Zettlemoyer, L., & Stoyanov, V. (2019). Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv: 1907.11692."},{"key":"10.1016\/j.neunet.2026.109092_bib0032","doi-asserted-by":"crossref","unstructured":"Liu, Z., Xu, K., Su, B., Zou, X., Peng, Y., & Zhou, J. (2025). Stop: Integrated spatial-temporal dynamic prompting for video understanding. arXiv preprint arXiv: 2503.15973.","DOI":"10.1109\/CVPR52734.2025.01286"},{"key":"10.1016\/j.neunet.2026.109092_bib0033","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1016\/j.neucom.2022.07.028","article-title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval and captioning","volume":"508","author":"Luo","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neunet.2026.109092_bib0034","doi-asserted-by":"crossref","unstructured":"Moon, W., Cho, C.-H., Jun, W., Shim, M., Kim, T., Lee, I., Wee, D., & Heo, J.-P. (2025). Prototypes are balanced units for efficient and effective partially relevant video retrieval. arXiv preprint arXiv: 2504.13035.","DOI":"10.1109\/ICCV51701.2025.02023"},{"key":"10.1016\/j.neunet.2026.109092_bib0035","article-title":"Vision-language models learn super images for efficient partially relevant video retrieval","author":"Nishimura","year":"2023","journal-title":"ACM Transactions on Multimedia Computing, Communications and Applications"},{"key":"10.1016\/j.neunet.2026.109092_bib0036","doi-asserted-by":"crossref","first-page":"26462","DOI":"10.52202\/068431-1919","article-title":"ST-adapter: Parameter-efficient image-to-video transfer learning","volume":"35","author":"Pan","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109092_bib0037","series-title":"Findings of the association for computational linguistics: EMNLP 2025","first-page":"519","article-title":"Propy: Building interactive prompt pyramids upon CLIP for partially relevant video retrieval","author":"Pan","year":"2025"},{"key":"10.1016\/j.neunet.2026.109092_bib0038","series-title":"International conference on machine learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.neunet.2026.109092_bib0039","unstructured":"Ren, J., Zhang, G., Hu, Y., Shu, J., & Wang, H. (2025). Exploiting inter-sample correlation and intra-sample redundancy for partially relevant video retrieval. arXiv preprint arXiv: 2504.19637."},{"key":"10.1016\/j.neunet.2026.109092_bib0040","series-title":"Proceedings of the IEEE\/CVF Conference on computer vision and pattern recognition","first-page":"20020","article-title":"Everything at once-multi-modal fusion transformer for video retrieval","author":"Shvetsova","year":"2022"},{"key":"10.1016\/j.neunet.2026.109092_bib0041","doi-asserted-by":"crossref","unstructured":"Song, P., Zhang, L., Lan, L., Chen, W., Guo, D., Yang, X., & Wang, M. (2025). Towards efficient partially relevant video retrieval with active moment discovering. arXiv preprint arXiv: 2504.10920.","DOI":"10.1109\/TMM.2025.3590937"},{"key":"10.1016\/j.neunet.2026.109092_bib0042","series-title":"Proceedings of the IEEE\/CVF Conference on computer vision and pattern recognition","first-page":"5079","article-title":"T2VLAD: Global-local sequence alignment for text-video retrieval","author":"Wang","year":"2021"},{"key":"10.1016\/j.neunet.2026.109092_bib0043","unstructured":"Wang, Y., Wang, J., Chen, B., Dai, T., Luo, R., & Xia, S.-T. (2024a). GMMFormer v2: An uncertainty-aware framework for partially relevant video retrieval. arXiv preprint arXiv: 2405.13824."},{"key":"10.1016\/j.neunet.2026.109092_bib0044","series-title":"Proceedings of the AAAI Conference on artificial intelligence","first-page":"5767","article-title":"GMMFormer: Gaussian-mixture-model based transformer for efficient partially relevant video retrieval","volume":"vol. 38","author":"Wang","year":"2024"},{"key":"10.1016\/j.neunet.2026.109092_bib0045","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.123893","article-title":"Exploring multiple instance learning (MIL): A brief survey","author":"Waqas","year":"2024","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.neunet.2026.109092_bib0046","series-title":"Proceedings of the AAAI Conference on artificial intelligence","first-page":"6540","article-title":"DGL: Dynamic global-local prompt tuning for text-video retrieval","volume":"vol. 38","author":"Yang","year":"2024"},{"key":"10.1016\/j.neunet.2026.109092_bib0047","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"3206","article-title":"Towards global video scene segmentation with context-aware transformer","volume":"vol. 37","author":"Yang","year":"2023"},{"key":"10.1016\/j.neunet.2026.109092_bib0048","unstructured":"Zang, Y., Li, W., Zhou, K., Huang, C., & Loy, C. C. (2022). Unified vision and language prompt learning. arXiv preprint arXiv: 2210.07225."},{"key":"10.1016\/j.neunet.2026.109092_bib0049","series-title":"Proceedings of the 32nd ACM International conference on multimedia","first-page":"1206","article-title":"MPT: Multi-grained prompt tuning for text-video retrieval","author":"Zhang","year":"2024"},{"key":"10.1016\/j.neunet.2026.109092_bib0050","first-page":"1","article-title":"Multi-grained alignment with knowledge distillation for partially relevant video retrieval","volume":"21","author":"Zhang","year":"2025","journal-title":"ACM Transactions on Multimedia Computing, Communications and Applications"},{"key":"10.1016\/j.neunet.2026.109092_bib0051","doi-asserted-by":"crossref","first-page":"12870","DOI":"10.1609\/aaai.v34i07.6984","article-title":"Learning 2D temporal adjacent networks for moment localization with natural language","volume":"34","author":"Zhang","year":"2020","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"}],"container-title":["Neural Networks"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026005526?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026005526?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T11:21:35Z","timestamp":1784200895000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0893608026005526"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":51,"alternative-id":["S0893608026005526"],"URL":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109092","relation":{},"ISSN":["0893-6080"],"issn-type":[{"value":"0893-6080","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"ProPy : Building interactive and efficient prompt pyramids upon CLIP for partially relevant video retrieval","name":"articletitle","label":"Article Title"},{"value":"Neural Networks","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109092","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"109092"}}