{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T13:25:31Z","timestamp":1784294731228,"version":"3.55.0"},"reference-count":266,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2023,8,1]],"date-time":"2023-08-01T00:00:00Z","timestamp":1690848000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,8,1]],"date-time":"2023-08-01T00:00:00Z","timestamp":1690848000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,8,1]],"date-time":"2023-08-01T00:00:00Z","timestamp":1690848000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"RIE2020 Industry Alignment Fund Industry Collaboration Projects"},{"name":"SERC Science and Engineering Research Council Central Research Fund"},{"name":"Singapore Government&#x2019;s Research"},{"name":"Innovation and Enterprise 2020 Plan Advanced Manufacturing and Engineering Domain","award":["A18A1b0045"],"award-info":[{"award-number":["A18A1b0045"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2023,8]]},"DOI":"10.1109\/tpami.2023.3258628","type":"journal-article","created":{"date-parts":[[2023,3,17]],"date-time":"2023-03-17T17:21:44Z","timestamp":1679073704000},"page":"10443-10465","source":"Crossref","is-referenced-by-count":57,"title":["Temporal Sentence Grounding in Videos: A Survey and Future Directions"],"prefix":"10.1109","volume":"45","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2725-6458","authenticated-orcid":false,"given":"Hao","family":"Zhang","sequence":"first","affiliation":[{"name":"School of Computer Science and Engineering, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0764-4258","authenticated-orcid":false,"given":"Aixin","family":"Sun","sequence":"additional","affiliation":[{"name":"S-Lab, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3286-5925","authenticated-orcid":false,"given":"Wei","family":"Jing","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4675-7055","authenticated-orcid":false,"given":"Joey Tianyi","family":"Zhou","sequence":"additional","affiliation":[{"name":"Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.327"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1145\/3477495.3532078"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.732"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1145\/3331184.3331235"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_33"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3073867"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3205404"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33019062"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3075470"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.617"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20060"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i4.16406"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3228167"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018199"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00150"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00207"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00497"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3052086"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00225"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2018\/143"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3179314"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1168"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.1145\/3565573"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3323873.3325019"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350879"},{"key":"ref217","first-page":"1","article-title":"Uncovering hidden challenges in query-based video moment retrieval","author":"otani","year":"0","journal-title":"Proc Brit Mach Vis Conf"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1410"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.493"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D17-1070"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1145\/3475723.3484247"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"ref43","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2014"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2858826"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2957854"},{"key":"ref8","first-page":"1","article-title":"FusionNet: Fusing via fully-aware attention with application to machine comprehension","author":"huang","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref7","first-page":"1","article-title":"Fast and accurate reading comprehension by combining self-attention and convolution","author":"yu","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.563"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01017"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"ref6","first-page":"1","article-title":"Bidirectional attention flow for machine comprehension","author":"seo","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-1018"},{"key":"ref100","first-page":"4252","article-title":"Natural language video localization: A revisit in span-based question answering framework","volume":"44","author":"zhang","year":"2022","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"ref221","article-title":"Towards debiasing temporal sentence grounding in video","author":"zhang","year":"2021"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.findings-acl.69"},{"key":"ref222","first-page":"11846","article-title":"Qvhighlights: Detecting moments and highlights in videos via natural language queries","author":"lei","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref40","first-page":"1","article-title":"Skip-thought vectors","volume":"28","author":"kiros","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3462823"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3556537"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/3532626"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1162"},{"key":"ref36","article-title":"Efficient estimation of word representations in vector space","author":"mikolov","year":"2013"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00832"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6820"},{"key":"ref33","article-title":"A survey on natural language video localization","author":"liu","year":"2021"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICCST50977.2020.00123"},{"key":"ref39","article-title":"Roberta: A robustly optimized bert pretraining approach","author":"liu","year":"2019"},{"key":"ref38","first-page":"4171","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"0","journal-title":"Proc Conf North Amer Chapter Assoc Comput Linguistics Hum Lang Technol"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018393"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.585"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6924"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00042"},{"key":"ref20","first-page":"1984","article-title":"ExCL: Extractive clip localization using natural language descriptions","author":"ghosh","year":"0","journal-title":"Proc Conf North Amer Chapter Assoc Comput Linguistics Hum Lang Technol"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1518"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018175"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1157"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01186"},{"key":"ref29","first-page":"1","article-title":"Weakly supervised dense event captioning in videos","volume":"31","author":"duan","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413967"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3187288"},{"key":"ref249","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6941"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3142420"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00713"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1145\/3512527.3531403"},{"key":"ref247","first-page":"1","article-title":"Asymmetric spatio-temporal embeddings for large-scale image-to-video retrieval","author":"garcia","year":"0","journal-title":"Proc Brit Mach Vis Conf"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1145\/3441577"},{"key":"ref127","article-title":"Team PKU-WICT-MIPL PIC makeup temporal video grounding challenge 2022 technical report","author":"zheng","year":"2022"},{"key":"ref248","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/610"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58548-8_20"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2022.103375"},{"key":"ref245","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3106814"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58565-5_36"},{"key":"ref125","article-title":"Contrastive language-action pre-training for temporal localization","author":"xu","year":"2022"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3127029"},{"key":"ref93","first-page":"28442","article-title":"End-to-end multi-modal video temporal grounding","volume":"34","author":"chen","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref133","article-title":"Hierarchical local-global transformer for temporal sentence grounding","author":"fang","year":"2022"},{"key":"ref254","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475301"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00834"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3191841"},{"key":"ref255","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2889052"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6627"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1145\/3477495.3532083"},{"key":"ref252","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00138"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.773"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00304"},{"key":"ref253","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6763"},{"key":"ref250","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16312"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1016\/j.compeleceng.2022.108137"},{"key":"ref251","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_4"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16285"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01082"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01030"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20059"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i2.16175"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3087001"},{"key":"ref258","article-title":"Temporal localization of moments in video collections with natural language","author":"escorcia","year":"2019"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413975"},{"key":"ref138","first-page":"1","article-title":"Attention is all you need","volume":"30","author":"vaswani","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref259","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58589-1_27"},{"key":"ref88","article-title":"A simple yet effective method for video temporal grounding with cross-modality attention","author":"zhang","year":"2020"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20058"},{"key":"ref256","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1915768117"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01137"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1145\/3512527.3531382"},{"key":"ref257","first-page":"4531","article-title":"Deep graph random process for relational-thinking-based speech recognition","volume":"119","author":"huang","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.11.019"},{"key":"ref144","first-page":"1552","article-title":"Entity-aware and motion-aware transformers for language-driven action localization in videos","author":"yang","year":"0","journal-title":"Proc Int Joint Conf Artif Intell"},{"key":"ref265","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3120038"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20163"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1145\/3512527.3531396"},{"key":"ref266","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475281"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01108"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_8"},{"key":"ref263","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3462874"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01240-3_13"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3095229"},{"key":"ref264","article-title":"Video moment retrieval with text query considering many-to-many correspondence using potentially relevant pair","author":"maeoki","year":"2021"},{"key":"ref140","first-page":"892","article-title":"Soundnet: Learning sound representations from unlabeled video","volume":"29","author":"aytar","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref261","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.161"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1078"},{"key":"ref262","article-title":"A hierarchical multi-modal encoder for moment localization in video corpus","author":"zhang","year":"2020"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/ICME51207.2021.9428369"},{"key":"ref260","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-short.92"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00155"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00258"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01069"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.642"},{"key":"ref109","article-title":"Sneak: Synonymous sentences-aware adversarial attack on natural language video localization","author":"gou","year":"2021"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3023339"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.544"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/WCSP52459.2021.9613549"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00623"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00361"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2021.3110713"},{"key":"ref225","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00877"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3090521"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3063631"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01248"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00279"},{"key":"ref223","first-page":"1","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"dosovitskiy","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.324"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3463021"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01432"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3120745"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00418"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01043"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01219-9_34"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1145\/3460426.3463616"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01068"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00695"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1183"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1145\/3543857"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/WACV45572.2020.9093328"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413614"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.733"},{"key":"ref119","article-title":"Simple bert models for relation extraction and semantic role labeling","author":"shi","year":"2019"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3113791"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414047"},{"key":"ref238","first-page":"14476","article-title":"Look at what i&#x2019;m doing: Self-supervised spatial grounding of narrations in instructional videos","volume":"34","author":"tan","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2021.104183"},{"key":"ref118","article-title":"Exploring optical-flow-guided motion and detection-based appearance for temporal sentence grounding","author":"liu","year":"2022"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00156"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414026"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3174136"},{"key":"ref236","article-title":"Decoupled spatial temporal graphs for generic visual grounding","author":"feng","year":"2021"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414053"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547782"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3085907"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1145\/3469877.3490595"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00112"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/149"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.coling-main.167"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.2139\/ssrn.4176359"},{"key":"ref235","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/131"},{"key":"ref60","first-page":"2725","article-title":"Semantic conditioned dynamic modulation for temporal sentence grounding in videos","volume":"44","author":"yuan","year":"2022","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"ref122","first-page":"460","article-title":"Fast and robust earth mover&#x2019;s distances","author":"pele","year":"0","journal-title":"Proc IEEE 12th Int Conf Comput Vis"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i01.5361"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1145\/3512527.3531394"},{"key":"ref244","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00406"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6897"},{"key":"ref120","article-title":"Learning commonsense-aware moment-text alignment for fast video temporal grounding","author":"wu","year":"2022"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00639"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.2965987"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859675"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413581"},{"key":"ref240","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01216-8_16"},{"key":"ref168","first-page":"1","article-title":"Support-set bottlenecks for video-text representation learning","author":"patrick","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref169","article-title":"End-to-end dense video grounding via parallel regression","author":"shi","year":"2021"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859847"},{"key":"ref177","article-title":"Explore-and-match: Bridging proposal-based and proposal-free with transformer for sentence grounding in videos","author":"woo","year":"2022"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00305"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1109\/ICDMW58026.2022.00124"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_3"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3162650"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00250"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3140611"},{"key":"ref179","article-title":"Look closer to ground better: Weakly-supervised temporal grounding of sentence in video","author":"chen","year":"2020"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58604-1_10"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413862"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3120545"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3096087"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00711"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3058614"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475278"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.findings-emnlp.9"},{"key":"ref182","first-page":"18123","article-title":"Counterfactual contrastive learning for weakly-supervised vision-language grounding","volume":"33","author":"zhang","year":"0","journal-title":"Proc Int Adv Conf Neural Inf Process Syst"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3481539"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1145\/3477495.3531795"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.01.085"},{"key":"ref146","article-title":"Locformer: Enabling transformers to perform temporal moment localization on long untrimmed videos with a feature sampling approach","author":"rodriguez-opazo","year":"2021"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2022.02.016"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1336"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.577"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19830-4_41"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P16-1101"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859855"},{"key":"ref152","article-title":"Towards visual-prompt temporal answering grounding in medical instructional video","author":"li","year":"0"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547969"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1016\/S0927-0507(03)10006-0"},{"key":"ref157","first-page":"1","author":"pearl","year":"2016","journal-title":"Causal Inference in Statistics A Primer"},{"key":"ref158","first-page":"1","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.317"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01590"},{"key":"ref164","first-page":"1","article-title":"Tripping through time: Efficient localization of activities in videos","author":"hahn","year":"0","journal-title":"Proc Brit Mach Vis Conf"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3086591"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1145\/3478025"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413840"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00855"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413841"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2019.00032"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3209978.3210003"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1015"},{"key":"ref14","article-title":"Text-to-clip video retrieval with early fusion and re-captioning","author":"xu","year":"2018"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240549"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.618"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3038993"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00134"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33019159"},{"key":"ref18","first-page":"12870-12877","article-title":"Learning 2D temporal adjacent networks formoment localization with natural language","volume":"34","author":"zhang","year":"0","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.213"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i1.19902"},{"key":"ref192","article-title":"Multi-scale self-contrastive learning with hard negative mining for weakly-supervised query-based video grounding","author":"mo","year":"2022"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00213"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20263"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3481032"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01511"},{"key":"ref195","article-title":"Weakly-supervised multi-level attentional reconstruction network for grounding textual queries in videos","author":"song","year":"2020"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00399"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3168424"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2022.104532"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/10169863\/10075491.pdf?arnumber=10075491","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,17]],"date-time":"2023-07-17T17:44:09Z","timestamp":1689615849000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10075491\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,8]]},"references-count":266,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2023.3258628","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,8]]}}}