{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T01:07:18Z","timestamp":1740100038731,"version":"3.37.3"},"reference-count":23,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,7,5]],"date-time":"2021-07-05T00:00:00Z","timestamp":1625443200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,7,5]],"date-time":"2021-07-05T00:00:00Z","timestamp":1625443200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,7,5]]},"DOI":"10.1109\/icme51207.2021.9428252","type":"proceedings-article","created":{"date-parts":[[2021,6,9]],"date-time":"2021-06-09T21:14:21Z","timestamp":1623273261000},"page":"1-6","source":"Crossref","is-referenced-by-count":2,"title":["Detecting Highlighted Video Clips Through Emotion-Enhanced Audio-Visual Cues"],"prefix":"10.1109","author":[{"given":"Linkang","family":"Hu","sequence":"first","affiliation":[{"name":"University of Science and Technology of China,School of Computer Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weidong","family":"He","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China,School of Computer Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Le","family":"Zhang","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China,School of Computer Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tong","family":"Xu","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China,School of Computer Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hui","family":"Xiong","sequence":"additional","affiliation":[{"name":"Rutgers University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Enhong","family":"Chen","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China,School of Computer Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.10383","article-title":"Reading the videos: Temporal labeling for crowdsourced time-sync videos based on semantic embedding","author":"lv","year":"2016","journal-title":"AAAI"},{"doi-asserted-by":"publisher","key":"ref11","DOI":"10.1109\/CVPR.2017.318"},{"doi-asserted-by":"publisher","key":"ref12","DOI":"10.1109\/ICCVW.2019.00193"},{"doi-asserted-by":"publisher","key":"ref13","DOI":"10.1109\/TASLP.2017.2759338"},{"key":"ref14","first-page":"4489","article-title":"Learning spatiotemporal features with 3d convolutional networks","author":"tran","year":"2015","journal-title":"Proceedings of the IEEE International Conference on Computer Vision"},{"doi-asserted-by":"publisher","key":"ref15","DOI":"10.1109\/CVPR.2014.223"},{"doi-asserted-by":"publisher","key":"ref16","DOI":"10.1109\/TMM.2019.2918739"},{"key":"ref17","article-title":"The inter-speech 2009 emotion challenge","author":"schuller","year":"2009","journal-title":"Tenth Annual Conference of the International Speech Communication Association"},{"key":"ref18","first-page":"1459","article-title":"Opens-mile: the munich versatile and fast open-source audio feature extractor","author":"eyben","year":"2010","journal-title":"Proceedings of the 18th ACM Multimedia"},{"key":"ref19","article-title":"Dynamic coattention networks for question answering","author":"xiong","year":"2016","journal-title":"arXiv preprint arXiv 1611 01604"},{"key":"ref4","first-page":"5179","article-title":"Tvsum: Summarizing web videos using titles","author":"song","year":"2015","journal-title":"Proceedings of the IEEE CVPR"},{"doi-asserted-by":"publisher","key":"ref3","DOI":"10.1109\/CVPR.2019.00135"},{"doi-asserted-by":"publisher","key":"ref6","DOI":"10.1109\/CVPR.2016.114"},{"doi-asserted-by":"publisher","key":"ref5","DOI":"10.1109\/TMM.2018.2806224"},{"key":"ref8","doi-asserted-by":"crossref","first-page":"862","DOI":"10.1360\/SSI-2019-0292","article-title":"Cross-modal video moment retrieval based on visual-textual relationship alignment","volume":"50","author":"chen","year":"2020","journal-title":"Scientia Sinica Informationis"},{"key":"ref7","article-title":"Character-oriented video summarization with visual and textual cues","author":"zhou","year":"2019","journal-title":"IEEE Transactions on Multimedia"},{"key":"ref2","first-page":"766","article-title":"Video summarization with long short-term memory","author":"zhang","year":"2016","journal-title":"ECCV"},{"doi-asserted-by":"publisher","key":"ref1","DOI":"10.1109\/CVPR.2016.112"},{"doi-asserted-by":"publisher","key":"ref9","DOI":"10.1109\/TMM.2018.2876046"},{"key":"ref20","article-title":"Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos","author":"zadeh","year":"2016","journal-title":"arXiv preprint arXiv 1606 06259"},{"key":"ref22","article-title":"Video summarization with attention-based encoder-decoder networks","author":"ji","year":"2019","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"doi-asserted-by":"publisher","key":"ref21","DOI":"10.1109\/ICCV.2015.170"},{"key":"ref23","first-page":"892","article-title":"Sound-net: Learning sound representations from unlabeled video","author":"aytar","year":"2016","journal-title":"Advances in Neural IInformation Processing Systems"}],"event":{"name":"2021 IEEE International Conference on Multimedia and Expo (ICME)","start":{"date-parts":[[2021,7,5]]},"location":"Shenzhen, China","end":{"date-parts":[[2021,7,9]]}},"container-title":["2021 IEEE International Conference on Multimedia and Expo (ICME)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9428049\/9428068\/09428252.pdf?arnumber=9428252","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,30]],"date-time":"2022-12-30T13:58:19Z","timestamp":1672408699000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9428252\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,7,5]]},"references-count":23,"URL":"https:\/\/doi.org\/10.1109\/icme51207.2021.9428252","relation":{},"subject":[],"published":{"date-parts":[[2021,7,5]]}}}