{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,24]],"date-time":"2026-01-24T03:12:53Z","timestamp":1769224373607,"version":"3.49.0"},"reference-count":76,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"name":"IITP","award":["IITP-2023-2020-0-01741"],"award-info":[{"award-number":["IITP-2023-2020-0-01741"]}]},{"DOI":"10.13039\/501100003725","name":"National Research Foundation of Korea","doi-asserted-by":"publisher","award":["NRF-2022R1A2C1008743"],"award-info":[{"award-number":["NRF-2022R1A2C1008743"]}],"id":[{"id":"10.13039\/501100003725","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/access.2023.3331756","type":"journal-article","created":{"date-parts":[[2023,11,9]],"date-time":"2023-11-09T19:02:42Z","timestamp":1699556562000},"page":"128162-128174","source":"Crossref","is-referenced-by-count":3,"title":["PWS-DVC: Enhancing Weakly Supervised Dense Video Captioning With Pretraining Approach"],"prefix":"10.1109","volume":"11","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9010-6460","authenticated-orcid":false,"given":"Wangyu","family":"Choi","sequence":"first","affiliation":[{"name":"Department of Computer Science and Engineering, Hanyang University, Ansan, South Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiasi","family":"Chen","sequence":"additional","affiliation":[{"name":"Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, MI, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9052-243X","authenticated-orcid":false,"given":"Jongwon","family":"Yoon","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, Hanyang University, Ansan, South Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"ref2","first-page":"38032","article-title":"Long-form video-language pre-training with multimodal temporal contrastive learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Sun"},{"key":"ref3","first-page":"23634","article-title":"MERLOT: Multimodal neural script knowledge models","volume-title":"Advances in Neural Information Processing Systems","volume":"34","author":"Zellers","year":"2021"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"ref5","first-page":"23716","article-title":"Flamingo: A visual language model for few-shot learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Alayrac"},{"key":"ref6","first-page":"24206","article-title":"VATT: Transformers for multimodal self-supervised learning from raw video, audio and text","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Akbari"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2729019"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00795"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.61"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01742"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01743"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.223"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01589"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00272"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12342"},{"key":"ref16","first-page":"470","article-title":"Multimodal pretraining for dense video captioning","volume-title":"Proc. 1st Conf. Asia\u2013Pacific Chapter Assoc. Comput. Linguistics 10th Int. Joint Conf. Natural Lang. Process.","author":"Huang"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref18","first-page":"9913","article-title":"Nondeterminism and instability in neural network optimization","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","volume":"139","author":"Summers"},{"key":"ref19","article-title":"Learning grounded vision-language representation for versatile understanding in untrimmed videos","author":"Wang","year":"2023","journal-title":"arXiv:2303.06378"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3146005"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_21"},{"key":"ref22","first-page":"5651","article-title":"End-to-end dense video captioning as sequence generation","volume-title":"Proc. Int. Conf. Comput. Linguistics","author":"Zhu"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01032"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2022.3228821"},{"key":"ref25","article-title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","volume-title":"Proc. Brit. Mach. Vis. Conf. (BMVC)","author":"Iashin"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2020.3014606"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6881"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00911"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00751"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00675"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00782"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00030"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00677"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2023.3279816"},{"key":"ref35","first-page":"3063","article-title":"Weakly supervised dense event captioning in videos","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"31","author":"Duan"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00900"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00832"},{"key":"ref38","article-title":"Improving language models by retrieving from trillions of tokens","author":"Borgeaud","year":"2021","journal-title":"arXiv:2112.04426"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00468"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58589-1_27"},{"key":"ref41","first-page":"190","article-title":"Collecting highly parallel data for paraphrase evaluation","volume-title":"Proc. 49th Ann. Meeting Assoc. Comput. Linguistics","author":"Chen"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.117"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.497"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.111"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.515"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00784"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.496"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01252-6_29"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.233"},{"issue":"140","key":"ref51","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref52","article-title":"WikiHow: A large scale text summarization dataset","author":"Koupaee","year":"2018","journal-title":"arXiv:1810.09305"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.563"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33019159"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6984"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414053"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1157"},{"key":"ref60","article-title":"Look closer to ground better: Weakly-supervised temporal grounding of sentence in video","author":"Chen","year":"2020","journal-title":"arXiv:2001.09308"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2018.2879642"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00852"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018191"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00273"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00901"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.3389\/frobt.2020.475767"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01329"},{"key":"ref68","first-page":"1","article-title":"Delving deeper into the decoder for video captioning","volume-title":"Proc. Eur. Conf. Artif. Intell. (ECAI)","author":"Chen"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i4.16421"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2022.3160451"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2022.3202526"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.3115\/1626355.1626389"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_31"},{"key":"ref76","first-page":"1","article-title":"Decoupled weight decay regularization","volume-title":"Proc. Int. Conf. Learn. Represent. (ICLR)","author":"Loshchilov"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/10005208\/10314490.pdf?arnumber=10314490","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,13]],"date-time":"2024-03-13T21:07:20Z","timestamp":1710364040000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10314490\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":76,"URL":"https:\/\/doi.org\/10.1109\/access.2023.3331756","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}