{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T16:58:51Z","timestamp":1780937931072,"version":"3.54.1"},"reference-count":40,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100007129","name":"Shandong Province Natural Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100007129","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No.U25A20444"],"award-info":[{"award-number":["No.U25A20444"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62502344"],"award-info":[{"award-number":["62502344"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62402255"],"award-info":[{"award-number":["62402255"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62372325"],"award-info":[{"award-number":["62372325"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U25A20444"],"award-info":[{"award-number":["U25A20444"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011160","name":"State Key Laboratory of Virtual Reality Technology and Systems","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100011160","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006606","name":"Natural Science Foundation of Tianjin Municipality","doi-asserted-by":"publisher","award":["23JCZDJC00280"],"award-info":[{"award-number":["23JCZDJC00280"]}],"id":[{"id":"10.13039\/501100006606","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Expert Systems with Applications"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1016\/j.eswa.2026.132346","type":"journal-article","created":{"date-parts":[[2026,4,5]],"date-time":"2026-04-05T11:20:16Z","timestamp":1775388016000},"page":"132346","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Understanding complex queries: Multi-query comprehension network for temporal sentence grounding"],"prefix":"10.1016","volume":"321","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2182-5741","authenticated-orcid":false,"given":"Zan","family":"Gao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-6561-0686","authenticated-orcid":false,"given":"Shengbo","family":"Xiong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4187-1980","authenticated-orcid":false,"given":"Yibo","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6348-671X","authenticated-orcid":false,"given":"Chunjie","family":"Ma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3197-5698","authenticated-orcid":false,"given":"Tian","family":"Gan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-5303-0265","authenticated-orcid":false,"given":"Riwei","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.eswa.2026.132346_bib0001","article-title":"Layer normalization","author":"Ba","year":"2016","journal-title":"CoRR"},{"key":"10.1016\/j.eswa.2026.132346_bib0002","series-title":"IEEE Conference on computer vision and pattern recognition","first-page":"4724","article-title":"Quo vadis, action recognition? A new model and the kinetics dataset","author":"Carreira","year":"2017"},{"key":"10.1016\/j.eswa.2026.132346_bib0003","doi-asserted-by":"crossref","first-page":"20","DOI":"10.1007\/s11263-025-02597-y","article-title":"Video mamba suite: State space model as a versatile alternative for video understanding","volume":"134","author":"Chen","year":"2026","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.eswa.2026.132346_bib0004","series-title":"ACM international conference on multimedia","first-page":"28","article-title":"Not all inputs are valid: Towards open-set video moment retrieval using language","author":"Fang","year":"2024"},{"key":"10.1016\/j.eswa.2026.132346_bib0005","series-title":"International conference on computer vision","first-page":"5277","article-title":"TALL: Temporal activity localization via language query","author":"Gao","year":"2017"},{"key":"10.1016\/j.eswa.2026.132346_bib0006","series-title":"Conference on empirical methods in natural language processing","first-page":"3978","article-title":"Relation-aware video reading comprehension for temporal language grounding","author":"Gao","year":"2021"},{"key":"10.1016\/j.eswa.2026.132346_bib0007","series-title":"International conference on computer vision","first-page":"1503","article-title":"Fast video moment retrieval","author":"Gao","year":"2021"},{"key":"10.1016\/j.eswa.2026.132346_bib0008","doi-asserted-by":"crossref","first-page":"7402","DOI":"10.1109\/TMM.2022.3222664","article-title":"Language-guided multi-granularity context aggregation for temporal sentence grounding","volume":"25","author":"Gong","year":"2023","journal-title":"IEEE Trans. Multim."},{"key":"10.1016\/j.eswa.2026.132346_bib0009","article-title":"Mamba: Linear-time sequence modeling with selective state spaces","author":"Gu","year":"2023","journal-title":"CoRR"},{"key":"10.1016\/j.eswa.2026.132346_bib0010","series-title":"International conference on computer vision","first-page":"5804","article-title":"Localizing moments in video with natural language","author":"Hendricks","year":"2017"},{"key":"10.1016\/j.eswa.2026.132346_bib0011","series-title":"ACM international conference on multimedia","first-page":"1476","article-title":"Maskable retentive network for video moment retrieval","author":"Hu","year":"2024"},{"key":"10.1016\/j.eswa.2026.132346_bib0012","series-title":"International conference on machine learning","first-page":"448","article-title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","author":"Ioffe","year":"2015"},{"key":"10.1016\/j.eswa.2026.132346_bib0013","series-title":"European conference on computer vision","first-page":"220","article-title":"BAM-DETR: Boundary-aligned moment detection transformer for temporal sentence grounding in videos","author":"Lee","year":"2024"},{"key":"10.1016\/j.eswa.2026.132346_bib0014","series-title":"AAAI conference on artificial intelligence","first-page":"1902","article-title":"Proposal-free video grounding with contextual pyramid network","author":"Li","year":"2021"},{"key":"10.1016\/j.eswa.2026.132346_bib0015","series-title":"International conference on computer vision","first-page":"2782","article-title":"UniVTG: Towards unified video-language temporal grounding","author":"Lin","year":"2023"},{"key":"10.1016\/j.eswa.2026.132346_bib0016","series-title":"ACM international conference on multimedia","first-page":"4190","article-title":"Filling the information gap between video and query for language-driven moment retrieval","author":"Liu","year":"2023"},{"key":"10.1016\/j.eswa.2026.132346_bib0017","series-title":"AAAI conference on artificial intelligence","doi-asserted-by":"crossref","first-page":"3855","DOI":"10.5772\/intechopen.111293","article-title":"Towards balanced alignment: Modal-enhanced semantic modeling for video moment retrieval","author":"Liu","year":"2024"},{"key":"10.1016\/j.eswa.2026.132346_bib0018","series-title":"Conference on empirical methods in natural language processing","first-page":"5143","article-title":"DEBUG: A dense bottom-up grounding approach for natural language video localization","author":"Lu","year":"2019"},{"key":"10.1016\/j.eswa.2026.132346_bib0019","series-title":"AAAI-25, sponsored by the association for the advancement of artificial intelligence, february 25 - march 4, 2025, Philadelphia, PA, USA","first-page":"5847","article-title":"Generative video diffusion for unseen novel semantic video moment retrieval","author":"Luo","year":"2025"},{"key":"10.1016\/j.eswa.2026.132346_bib0020","article-title":"Disentangle and denoise: Tackling context misalignment for video moment retrieval","author":"Ma","year":"2024","journal-title":"CoRR"},{"key":"10.1016\/j.eswa.2026.132346_bib0021","series-title":"European conference on computer vision","first-page":"122","article-title":"Shufflenet V2: Practical guidelines for efficient CNN architecture design","author":"Ma","year":"2018"},{"key":"10.1016\/j.eswa.2026.132346_bib0022","series-title":"AAAI-25, sponsored by the association for the advancement of artificial intelligence, february 25 - march 4, 2025, Philadelphia, PA, USA","first-page":"6684","article-title":"CDTR: Semantic alignment for video moment retrieval using concept decomposition transformer","author":"Ran","year":"2025"},{"key":"10.1016\/j.eswa.2026.132346_bib0023","article-title":"DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter","author":"Sanh","year":"2019","journal-title":"CoRR"},{"issue":"1","key":"10.1016\/j.eswa.2026.132346_bib0024","first-page":"1929","article-title":"Dropout: A simple way to prevent neural networks from overfitting","volume":"15","author":"Srivastava","year":"2014","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.eswa.2026.132346_bib0025","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.127063","article-title":"RoFormer: Enhanced transformer with rotary position embedding","volume":"568","author":"Su","year":"2024","journal-title":"Neurocomputing"},{"key":"10.1016\/j.eswa.2026.132346_bib0026","doi-asserted-by":"crossref","first-page":"5281","DOI":"10.1109\/TCSVT.2023.3250518","article-title":"Video moment retrieval via comprehensive relation-aware network","volume":"33","author":"Sun","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.eswa.2026.132346_bib0027","series-title":"International conference on research on development in information retrieval","first-page":"1022","article-title":"You need to read again: Multi-granularity perception network for moment retrieval in videos","author":"Sun","year":"2022"},{"key":"10.1016\/j.eswa.2026.132346_bib0028","series-title":"Annual meeting of the association for computational linguistics","first-page":"14590","article-title":"A length-extrapolatable transformer","author":"Sun","year":"2023"},{"key":"10.1016\/j.eswa.2026.132346_bib0029","series-title":"International conference on computer vision","first-page":"4489","article-title":"Learning spatiotemporal features with 3D convolutional networks","author":"Tran","year":"2015"},{"key":"10.1016\/j.eswa.2026.132346_bib0030","series-title":"Annual conference on neural information processing systems","first-page":"5998","article-title":"Attention is all you need","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.eswa.2026.132346_bib0031","series-title":"ACM international conference on multimedia","first-page":"4450","article-title":"Mixup-augmented temporally debiased video grounding with content-location disentanglement","author":"Wang","year":"2023"},{"key":"10.1016\/j.eswa.2026.132346_bib0032","series-title":"AAAI conference on artificial intelligence","first-page":"2613","article-title":"Negative sample matters: A renaissance of metric learning for temporal grounding","author":"Wang","year":"2022"},{"key":"10.1016\/j.eswa.2026.132346_bib0033","series-title":"AAAI conference on artificial intelligence","first-page":"2986","article-title":"Boundary proposal network for two-stage natural language video localization","author":"Xiao","year":"2021"},{"key":"10.1016\/j.eswa.2026.132346_bib0034","article-title":"Differential transformer","author":"Ye","year":"2024","journal-title":"CoRR"},{"key":"10.1016\/j.eswa.2026.132346_bib0035","series-title":"IEEE conference on computer vision and pattern recognition","first-page":"10284","article-title":"Dense regression network for video grounding","author":"Zeng","year":"2020"},{"key":"10.1016\/j.eswa.2026.132346_bib0036","series-title":"Annual meeting of the association for computational linguistics","first-page":"6543","article-title":"Span-based localizing network for natural language video localization","author":"Zhang","year":"2020"},{"key":"10.1016\/j.eswa.2026.132346_bib0037","doi-asserted-by":"crossref","first-page":"9073","DOI":"10.1109\/TPAMI.2021.3120745","article-title":"Multi-scale 2D temporal adjacency networks for moment localization with natural language","author":"Zhang","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.eswa.2026.132346_bib0038","series-title":"AAAI conference on artificial intelligence","first-page":"12870","article-title":"Learning 2D temporal adjacent networks for moment localization with natural language","author":"Zhang","year":"2020"},{"key":"10.1016\/j.eswa.2026.132346_bib0039","series-title":"AAAI conference on artificial intelligence","first-page":"3669","article-title":"Phrase-level temporal relationship mining for temporal sentence localization","author":"Zheng","year":"2023"},{"key":"10.1016\/j.eswa.2026.132346_bib0040","doi-asserted-by":"crossref","first-page":"55:1","DOI":"10.1145\/3543857","article-title":"Progressive localization networks for language-based moment localization","volume":"19","author":"Zheng","year":"2023","journal-title":"ACM Trans. Multim. Comput. Commun. Appl."}],"container-title":["Expert Systems with Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426012595?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426012595?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T16:08:13Z","timestamp":1780934893000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0957417426012595"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":40,"alternative-id":["S0957417426012595"],"URL":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132346","relation":{},"ISSN":["0957-4174"],"issn-type":[{"value":"0957-4174","type":"print"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Understanding complex queries: Multi-query comprehension network for temporal sentence grounding","name":"articletitle","label":"Article Title"},{"value":"Expert Systems with Applications","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132346","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"132346"}}