{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,31]],"date-time":"2025-10-31T07:26:43Z","timestamp":1761895603317,"version":"build-2065373602"},"reference-count":33,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,6,30]],"date-time":"2025-06-30T00:00:00Z","timestamp":1751241600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,6,30]],"date-time":"2025-06-30T00:00:00Z","timestamp":1751241600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003819","name":"Natural Science Foundation of Hubei Province","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003819","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006190","name":"Research and Development","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100006190","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008044","name":"Hubei University of Education","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100008044","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,6,30]]},"DOI":"10.1109\/icme59968.2025.11210112","type":"proceedings-article","created":{"date-parts":[[2025,10,30]],"date-time":"2025-10-30T17:57:42Z","timestamp":1761847062000},"page":"1-6","source":"Crossref","is-referenced-by-count":0,"title":["Bridging the One-to-Many Gap: Multi-label Semantic Learning and Relay for Video Captioning"],"prefix":"10.1109","author":[{"given":"Shuqin","family":"Chen","sequence":"first","affiliation":[{"name":"Hubei University of Education,School of Computer"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yikang","family":"Hu","sequence":"additional","affiliation":[{"name":"Hubei Normal University,College of Computer and Information Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Yang","sequence":"additional","affiliation":[{"name":"Hubei University of Education,School of Computer"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhixin","family":"Sun","sequence":"additional","affiliation":[{"name":"PowerChina Zhongnan Engineering Corporation Limited"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liangjun","family":"Yu","sequence":"additional","affiliation":[{"name":"Hubei University of Education,School of Computer"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xian","family":"Zhong","sequence":"additional","affiliation":[{"name":"Wuhan University of Technology,Hubei Key Laboratory of Transportation Internet of Things"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3158546"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3063423"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095662"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859882"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/icme52920.2022.9859743"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/s11063-020-10352-2"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109906"},{"key":"ref8","first-page":"3063","article-title":"Weakly supervised dense event captioning in videos","author":"Duan","year":"2018","journal-title":"Adv. Neural Inf. Process. Syst"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00971"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/3539225"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3546828"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01816"},{"key":"ref13","article-title":"VAST: A vision-audio-subtitle-text omni-modality foundation model and dataset","author":"Chen","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst"},{"key":"ref14","first-page":"38728","article-title":"mplug-2: A modularized multi-modal foundation model across text, image and video","volume-title":"Proc. Int. Conf. Mach. Learn","author":"Xu"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICME55011.2023.00010"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3327677"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10094571"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i3.25484"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3295098"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/3679203"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.110744"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00468"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref25","first-page":"65","article-title":"METEOR: an automatic metric for MT evaluation with improved correlation with human judgments","volume-title":"Proc. Annu. Meet. Assoc. Comput. Linguist. Workshop","author":"Banerjee"},{"key":"ref26","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004","journal-title":"Text Summar. Branches Out"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","volume-title":"Proc. Int. Conf. Learn. Represent","author":"Dosovitskiy","key":"ref28"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00685"},{"article-title":"The kinetics human action video dataset","year":"2017","author":"Kay","key":"ref30"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1410"}],"event":{"name":"2025 IEEE International Conference on Multimedia and Expo (ICME)","start":{"date-parts":[[2025,6,30]]},"location":"Nantes, France","end":{"date-parts":[[2025,7,4]]}},"container-title":["2025 IEEE International Conference on Multimedia and Expo (ICME)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11208895\/11208897\/11210112.pdf?arnumber=11210112","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,31]],"date-time":"2025-10-31T05:54:06Z","timestamp":1761890046000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11210112\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,30]]},"references-count":33,"URL":"https:\/\/doi.org\/10.1109\/icme59968.2025.11210112","relation":{},"subject":[],"published":{"date-parts":[[2025,6,30]]}}}