{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,30]],"date-time":"2026-03-30T06:35:09Z","timestamp":1774852509138,"version":"3.50.1"},"reference-count":128,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100003725","name":"Basic Science Research Program through the National Research Foundation of Korea","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003725","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100009950","name":"Ministry of Education","doi-asserted-by":"publisher","award":["NRF-2019R1A2C1006159"],"award-info":[{"award-number":["NRF-2019R1A2C1006159"]}],"id":[{"id":"10.13039\/100009950","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100009950","name":"Ministry of Education","doi-asserted-by":"publisher","award":["NRF-2021R1A6A1A03039493"],"award-info":[{"award-number":["NRF-2021R1A6A1A03039493"]}],"id":[{"id":"10.13039\/100009950","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2021]]},"DOI":"10.1109\/access.2021.3108565","type":"journal-article","created":{"date-parts":[[2021,8,27]],"date-time":"2021-08-27T20:04:50Z","timestamp":1630094690000},"page":"121665-121685","source":"Crossref","is-referenced-by-count":15,"title":["Video Description: Datasets &amp; Evaluation Metrics"],"prefix":"10.1109","volume":"9","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6713-8766","authenticated-orcid":false,"given":"Muhammad","family":"Rafiq","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1045-8715","authenticated-orcid":false,"given":"Ghazala","family":"Rafiq","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0854-768X","authenticated-orcid":false,"given":"Gyu Sang","family":"Choi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/s12652-018-0797-0"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICTer48817.2019.9023769"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00911"},{"key":"ref32","first-page":"5998","article-title":"Attention is all you need","author":"vaswani","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref31","first-page":"958","article-title":"Multi-modal dense video captioning","author":"iashin","year":"2020","journal-title":"Proc IEEE\/CVF Conf Comput Vis Pattern Recognit Workshops"},{"key":"ref30","article-title":"Video2Commonsense: Generating commonsense descriptions to enrich video captioning","author":"fang","year":"2020","journal-title":"arXiv 2003 05162"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICACC.2015.34"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.494"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.3390\/s20061702"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2019.00042"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2019.00185"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018393"},{"key":"ref20","article-title":"Human-like controllable image captioning with verb-specific semantic roles","author":"chen","year":"2021","journal-title":"arXiv 2103 12204"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.161"},{"key":"ref21","article-title":"Towards accurate text-based image captioning with content diversity exploration","author":"xu","year":"2021","journal-title":"arXiv 2105 03236"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01277"},{"key":"ref23","article-title":"COOT: Cooperative hierarchical transformer for video-text representation learning","author":"ging","year":"2020","journal-title":"arXiv 2011 00597"},{"key":"ref101","first-page":"5767","article-title":"Attentive visual semantic specialized network for video captioning","author":"perez-martin","year":"2021","journal-title":"Proc Int Conf Pattern Recognit (ICPR)"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018167"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2927476"},{"key":"ref25","article-title":"Delving deeper into the decoder for video captioning","author":"chen","year":"2020","journal-title":"arXiv 2001 05614"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-11752-2_15"},{"key":"ref51","first-page":"7590","article-title":"Towards automatic learning of procedures from web instructional videos","author":"zhou","year":"2016","journal-title":"Proc 32nd AAAI Conf Artif Intell"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00468"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_38"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46448-0_31"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1117"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00674"},{"key":"ref53","article-title":"Using descriptive video services to create a large data source for video annotation research","author":"torabi","year":"2015","journal-title":"arXiv 1503 01070"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298940"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/SITIS.2012.100"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.337"},{"key":"ref3","first-page":"102","article-title":"Video in sentences out","author":"barbu","year":"2012","journal-title":"Proc 28th Conf Uncertainty Artif Intell"},{"key":"ref6","first-page":"541","article-title":"Generating natural-language video descriptions using text-mined knowledge","author":"krishnamoorthy","year":"2013","journal-title":"Proc 27th AAAI Conf Artif Intell"},{"key":"ref5","first-page":"27","article-title":"Describing video contents in natural language","author":"khan","year":"2012","journal-title":"Proc Workshop Innov Hybrid"},{"key":"ref8","author":"su","year":"2018","journal-title":"Study of video captioning problem"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00207"},{"key":"ref7","first-page":"1218","article-title":"Integrating language and vision to generate natural language descriptions of videos in the wild","author":"thomason","year":"2014","journal-title":"Proc 25th Int Conf Comput Linguistics"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLC.2006.258552"},{"key":"ref46","first-page":"190","article-title":"Collecting highly parallel data for paraphrase evaluation","volume":"1","author":"chen","year":"2011","journal-title":"Proc 49th Annu Meeting Assoc Comput Linguistics Hum Lang Technol"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1145\/3122865.3122867"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.340"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6247801"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/3355390"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1155\/2020\/3062706"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICCSP.2019.8698097"},{"key":"ref43","first-page":"172","article-title":"A study of evaluation metrics and datasets for video captioning","author":"park","year":"2018","journal-title":"Proc 2nd Int Conf Intell Inform Biomed Sci"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00782"},{"key":"ref126","article-title":"Attention is all you need for videos: Self-attention based video summarization using universal transformers","author":"bilkhu","year":"2019","journal-title":"arXiv 1906 02792"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.233"},{"key":"ref124","first-page":"980","article-title":"Video captioning of future frames","author":"hosseinzadeh","year":"2021","journal-title":"Proc IEEE Winter Conf Appl Comput Vis (WACV)"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.3115\/1118162.1118168"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1002\/andp.19223712302"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1007\/s10590-010-9073-6"},{"key":"ref128","article-title":"Vatex video captioning challenge 2020: Multi-view features and hybrid reward strategies for video captioning","author":"zhu","year":"2019","journal-title":"arXiv 1910 11102"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-3003"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/E17-1019"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_31"},{"key":"ref74","first-page":"3","article-title":"Automatic text summarization: Past, present and future","author":"saggion","year":"2016","journal-title":"Multi-source, Multilingual Information Extraction and Summarization"},{"key":"ref75","first-page":"526","article-title":"From word embeddings to document distances matt","volume":"44","author":"kusner","year":"2017","journal-title":"Ironmaking Steelmaking"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1108\/00220410410560582"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.3115\/1289189.1289273"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413880"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58589-1_27"},{"key":"ref61","article-title":"Multimodal pretraining for dense video captioning","author":"huang","year":"2020","journal-title":"arXiv 2011 11760"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33718-5_11"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"ref65","article-title":"The kinetics human action video dataset","author":"kay","year":"2017","journal-title":"arXiv 1705 06950"},{"key":"ref66","article-title":"YouTube-8M: A large-scale video classification benchmark","author":"abu-el haija","year":"2016","journal-title":"arXiv 1609 08675"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.3115\/1626355.1626389"},{"key":"ref68","article-title":"CIDEr: Consensus-based image description evaluation","author":"tech","year":"2014","journal-title":"arXiv 1411 5726"},{"key":"ref2","year":"2021","journal-title":"10 Youtube Statistics That You Need to Know in 2021"},{"key":"ref69","first-page":"382","article-title":"SPICE: Semantic propositional image caption evaluation","volume":"9909","author":"anderson","year":"2016","journal-title":"Proc 14th Eur Conf"},{"key":"ref1","year":"2021","journal-title":"Cisco Annual Internet Report&#x2014;Cisco Annual Internet Report (2018-2023) White Paper&#x2014;Cisco"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00852"},{"key":"ref95","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"kenton","year":"1953","journal-title":"arXiv 1810 04805"},{"key":"ref108","article-title":"A semantics-assisted video captioning model trained with scheduled sampling","author":"chen","year":"2019","journal-title":"arXiv 1909 00121"},{"key":"ref94","article-title":"Learning video representations using contrastive bidirectional transformer","author":"sun","year":"2019","journal-title":"arXiv 1906 05743"},{"key":"ref107","article-title":"Meaning guided video captioning","author":"babariya","year":"2019","journal-title":"arXiv 1912 05730"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00756"},{"key":"ref106","article-title":"Diverse video captioning through latent variable expansion","author":"xiao","year":"2019","journal-title":"arXiv 1910 12019"},{"key":"ref92","article-title":"Auto-captions on GIF: A large-scale video-sentence dataset for vision-language pre-training","author":"pan","year":"2020","journal-title":"arXiv 2007 02375"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00273"},{"key":"ref91","first-page":"8743","article-title":"ActBERT: Learning global-local video-text representations","author":"zhu","year":"2020","journal-title":"Proc IEEE\/CVF Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00901"},{"key":"ref90","article-title":"UniVL: A unified video and language pre-training model for multimodal understanding and generation","author":"luo","year":"2020","journal-title":"arXiv 2002 06353"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01311"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/88"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240667"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2018\/164"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2019.8803143"},{"key":"ref98","first-page":"10384","article-title":"MASS: Masked sequence to sequence pre-training for language generation","author":"song","year":"2019","journal-title":"Proc 36th Int Conf Mach Learn"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00272"},{"key":"ref96","article-title":"ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","author":"lu","year":"2019","journal-title":"arXiv 1908 02265"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.703"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICDMW.2009.79"},{"key":"ref11","author":"li","year":"2020","journal-title":"Comparing Attention-based Neural Architectures for Video Captioning"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3078295"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58571-6_37"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.377"},{"key":"ref15","article-title":"Efficient CNN-LSTM based image captioning using neural network compression","author":"rampal","year":"2020","journal-title":"arXiv 2012 09708"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.497"},{"key":"ref16","article-title":"Connecting what to say with where to look by modeling human attention traces","author":"meng","year":"2021","journal-title":"arXiv 2105 05964"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-3348"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/ICBK.2017.26"},{"key":"ref17","article-title":"Dual-level collaborative transformer for image captioning","author":"luo","year":"2021","journal-title":"arXiv 2101 06462"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1002\/9781405198431.wbeal1285"},{"key":"ref18","article-title":"The role of syntactic planning in compositional image captioning","author":"bugliarello","year":"2021","journal-title":"arXiv 2101 11911"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.3115\/1073445.1073465"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.515"},{"key":"ref19","article-title":"VisualGPT: Data-efficient adaptation of pretrained language models for image captioning","author":"chen","year":"2021","journal-title":"arXiv 2102 10407"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/P14-2074"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00795"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1155\/2018\/3125879"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.111"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-30194-3_16"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.662"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/N15-1173"},{"key":"ref89","article-title":"VLM: Task-agnostic video-language model pre-training for video understanding","author":"xu","year":"2021","journal-title":"arXiv 2105 09996"},{"key":"ref121","article-title":"WikiHow: A large scale text summarization dataset","author":"koupaee","year":"2018","journal-title":"arXiv 1810 09305"},{"key":"ref122","article-title":"Characterizing the impact of using features extracted from pre-trained models on the quality of video captioning sequence-to-sequence models","author":"hammad","year":"2019","journal-title":"arXiv 1911 09989"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.548"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1146"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.387"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.3115\/1626355.1626393"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W15-2806"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/9312710\/09524610.pdf?arnumber=9524610","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,12,17]],"date-time":"2021-12-17T19:57:42Z","timestamp":1639771062000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9524610\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"references-count":128,"URL":"https:\/\/doi.org\/10.1109\/access.2021.3108565","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]}}}