{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,2]],"date-time":"2026-05-02T22:32:06Z","timestamp":1777761126881,"version":"3.51.4"},"reference-count":96,"publisher":"Emerald","issue":"4","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,10,12]]},"abstract":"<jats:p>With the broad growth of video capturing devices and applications on the web, it is more demanding to provide desired video content for users efficiently. Video summarization facilitates quickly grasping video content by creating a compact summary of videos. Much effort has been devoted to automatic video summarization, and various problem settings and approaches have been proposed. Our goal is to provide an overview of this field. This survey covers early studies as well as recent approaches which take advantage of deep learning techniques. We describe video summarization approaches and their underlying concepts. We also discuss benchmarks and evaluations. We overview how prior work addressed evaluation and detail the pros and cons of the evaluation protocols. Last but not least, we discuss open challenges in this field.<\/jats:p>","DOI":"10.1561\/0600000099","type":"journal-article","created":{"date-parts":[[2022,10,12]],"date-time":"2022-10-12T09:06:52Z","timestamp":1665565612000},"page":"284-335","source":"Crossref","is-referenced-by-count":12,"title":["Video Summarization Overview"],"prefix":"10.1108","volume":"13","author":[{"given":"Mayu","family":"Otani","sequence":"first","affiliation":[{"name":"CyberAgent, Inc.","place":["Japan"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yale","family":"Song","sequence":"additional","affiliation":[{"name":"Microsoft Research","place":["USA"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yang","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Manitoba","place":["Canada"]}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"140","published-online":{"date-parts":[[2022,10,12]]},"reference":[{"key":"2026032615164784300_ref001","doi-asserted-by":"crossref","DOI":"10.1145\/1101826.1101841","article-title":"Framework for personalized multimedia summarization","volume-title":"ACM SIGMM International Workshop on Multimedia Information Retrieval","author":"Agnihotri","year":"2005"},{"key":"2026032615164784300_ref002","first-page":"398","article-title":"Summarizing wearable video","volume-title":"Proc. International Conference on Image Processing (ICIP)","author":"Aizawa","year":"2001"},{"key":"2026032615164784300_ref003","first-page":"1056","article-title":"Performance over random: a robust evaluation protocol for video summarization methods","volume-title":"ACM International Conference on Multimedia","author":"Apostolidis","year":"2020"},{"issue":"11","key":"2026032615164784300_ref004","doi-asserted-by":"crossref","first-page":"1838","DOI":"10.1109\/JPROC.2021.3117472","article-title":"Video summarization using deep neural networks: a survey","volume":"109","author":"Apostolidis","year":"2021","journal-title":"Proceedings of the IEEE"},{"issue":"4","key":"2026032615164784300_ref005","doi-asserted-by":"crossref","DOI":"10.1145\/2601097.2601198","article-title":"Automatic editing of footage from multiple social cameras","volume":"33","author":"Arev","year":"2014","journal-title":"ACM Transactions on Graphics"},{"issue":"1","key":"2026032615164784300_ref006","doi-asserted-by":"crossref","first-page":"56","DOI":"10.1016\/j.patrec.2010.08.004","article-title":"VSUMM: a mechanism designed to produce static video summaries and a novel evaluation method","volume":"32","author":"Avila","year":"2011","journal-title":"Pattern Recognition Letters"},{"key":"2026032615164784300_ref007","article-title":"TRECVID 2020: comprehensive campaign for evaluating video retrieval tasks across multiple application domains","volume-title":"TRECVID 2020","author":"Awad","year":"2020"},{"issue":"4","key":"2026032615164784300_ref008","doi-asserted-by":"crossref","first-page":"575","DOI":"10.1109\/TMM.2004.830811","article-title":"Personalized abstraction of broadcasted American football video by highlight selection","volume":"6","author":"Babaguchi","year":"2004","journal-title":"IEEE Transactions on Multimedia"},{"key":"2026032615164784300_ref009","doi-asserted-by":"crossref","DOI":"10.1109\/TMM.2007.898890","article-title":"Learning personal preference from viewer\u2019s operations for browsing and its application to baseball video retrieval and summarization","volume-title":"IEEE Transactions on Multimedia","author":"Babaguchi","year":"2007"},{"key":"2026032615164784300_ref010","first-page":"2982","article-title":"Unsupervised video summarization with adversarial LSTM networks","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Behrooz","year":"2017"},{"key":"2026032615164784300_ref011","first-page":"9922","article-title":"SpeedNet: learning the speediness in videos","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Benaim","year":"2020"},{"key":"2026032615164784300_ref012","first-page":"29","article-title":"Narrative bytes: data-driven content production in esports","volume-title":"ACM International Conference on Interactive Experiences for TV and Online Video","author":"Block","year":"2018"},{"key":"2026032615164784300_ref013","article-title":"Video highlight prediction using audience chat reactions","volume-title":"Conference on Empirical Methods in Natural Language Processing","author":"Cheng-Yang Fu Joon Lee","year":"2017"},{"key":"2026032615164784300_ref014","first-page":"93","article-title":"MixT: automatic generation of step-by-step mixed media tutorials","volume-title":"Annual ACM Symposium on User Interface Software and Technology","author":"Chi","year":"2012"},{"key":"2026032615164784300_ref015","first-page":"3584","article-title":"Video co-summarization: video summarization by visual co-occurrence","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Chu","year":"2015"},{"key":"2026032615164784300_ref016","doi-asserted-by":"crossref","DOI":"10.1145\/3240508.3240599","article-title":"PHD-GIFs: personalized highlight detection for automatic GIF creation","volume-title":"ACM International Conference on Multimedia","author":"del Molino","year":"2018"},{"key":"2026032615164784300_ref017","first-page":"211","article-title":"Video summarization by curve simplification","volume-title":"ACM International Conference on Multimedia","author":"DeMenthon","year":"1998"},{"key":"2026032615164784300_ref018","first-page":"52","article-title":"Does object recognition work for everyone?","volume-title":"CVPR Workshop on Computer Vision for Global Challenges","author":"DeVries","year":"2019"},{"issue":"7","key":"2026032615164784300_ref019","doi-asserted-by":"crossref","first-page":"1553","DOI":"10.1109\/TMM.2013.2267205","article-title":"Multimodal saliency and fusion for movie summarization based on aural, visual, and textual attention","volume":"15","author":"Evangelopoulos","year":"2013","journal-title":"IEEE Transactions on Multimedia"},{"key":"2026032615164784300_ref020","article-title":"Summarizing videos with attention","volume-title":"ACCV Workshop on Attention\/Intention Understanding","author":"Fajtl","year":"2018"},{"key":"2026032615164784300_ref021","doi-asserted-by":"crossref","first-page":"976","DOI":"10.1145\/3240508.3240651","article-title":"Extractive video summarizer with memory augmented neural networks","volume-title":"ACM International Conference on Multimedia","author":"Feng","year":"2018"},{"key":"2026032615164784300_ref022","doi-asserted-by":"crossref","first-page":"258","DOI":"10.1145\/336597.336693","article-title":"The open video project: research-oriented digital video repository","volume-title":"ACM Conference on Digital Libraries","author":"Geisler","year":"2000"},{"issue":"3","key":"2026032615164784300_ref023","doi-asserted-by":"crossref","first-page":"862","DOI":"10.1145\/1141911.1141967","article-title":"Schematic storyboarding for video visualization and editing","volume":"25","author":"Goldman","year":"2006","journal-title":"ACM Transactions on Graphics"},{"key":"2026032615164784300_ref024","first-page":"174","article-title":"Video summarization using singular value decomposition","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Gong","year":"2000"},{"key":"2026032615164784300_ref025","first-page":"27","article-title":"Generative adversarial nets","volume-title":"Advances in Neural Information Processing Systems","author":"Goodfellow","year":"2014"},{"key":"2026032615164784300_ref026","first-page":"505","article-title":"Creating summaries from user videos","volume":"8695","author":"Gygli","year":"2014","journal-title":"European Conference on Computer Vision"},{"key":"2026032615164784300_ref027","first-page":"1001","article-title":"Video2GIF: automatic generation of animated GIFs from video","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Gygli","year":"2016"},{"key":"2026032615164784300_ref028","article-title":"HyperNetworks","volume-title":"International Conference on Learning Representations","author":"Ha","year":"2017"},{"key":"2026032615164784300_ref029","first-page":"75","article-title":"A deep learning model for extracting live streaming video highlights using audience messages","volume-title":"Artificial Intelligence and Cloud Computing Conference","author":"Han","year":"2019"},{"key":"2026032615164784300_ref030","first-page":"489","article-title":"Auto-summarization of audio-video presentations","volume-title":"ACM International Conference on Multimedia","author":"He","year":"1999"},{"key":"2026032615164784300_ref031","doi-asserted-by":"crossref","DOI":"10.1109\/ICIP.2002.1037977","article-title":"Learning personalized video highlights from detailed MPEG-7 metadata","volume-title":"IEEE International Conference on Image Processing","author":"Jaimes","year":"2002"},{"key":"2026032615164784300_ref032","doi-asserted-by":"crossref","first-page":"1164","DOI":"10.1145\/3123266.3123393","article-title":"Elasticplay: interactive video summarization with dynamic time budgets","volume-title":"ACM International Conference on Multimedia","author":"Jin","year":"2017"},{"key":"2026032615164784300_ref033","volume-title":"How good is a video summary? A new benchmarking dataset and evaluation framework towards realistic video summarization","author":"Kaushal","year":"2021"},{"key":"2026032615164784300_ref034","first-page":"2698","article-title":"Large-scale video summarization using web-image priors","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Khosla","year":"2013"},{"key":"2026032615164784300_ref035","first-page":"3241","article-title":"Fast unsupervised ego-action learning for first-person sports videos","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Kitani","year":"2011"},{"key":"2026032615164784300_ref036","doi-asserted-by":"crossref","first-page":"144","DOI":"10.1145\/1463563.1463590","article-title":"Video summarization from spatio-temporal features","volume-title":"ACM TRECVid Video Summarization Workshop","author":"Lagani\u00e8re","year":"2008"},{"key":"2026032615164784300_ref037","first-page":"1346","article-title":"Discovering important people and objects for egocentric video summarization","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Lee","year":"2012"},{"key":"2026032615164784300_ref038","article-title":"QVHightlights: detecting moments and highlights in videos via natural language queries","volume-title":"Advances in Neural Information Processing Systems","author":"Lei","year":"2021"},{"key":"2026032615164784300_ref039","first-page":"III","article-title":"A general framework for sports video summarization with its application to soccer","volume":"3","author":"Li","year":"2003","journal-title":"IEEE International Conference on Acoustics, Speech, and Signal Processing"},{"key":"2026032615164784300_ref040","first-page":"38","article-title":"Cross community news event summary generation based on collaborative ranking","volume-title":"International Conference on Internet Multimedia Computing and Service","author":"Liu","year":"2012"},{"key":"2026032615164784300_ref041","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR.2015.7298994","article-title":"Multi-task deep visual-semantic embedding for video thumbnail selection","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition","author":"Liu","year":"2015"},{"key":"2026032615164784300_ref042","article-title":"Transforming multiconcept attention into video summarization","volume-title":"Asian Conference on Computer Vision","author":"Liu","year":"2020"},{"key":"2026032615164784300_ref043","first-page":"2714","article-title":"Story-driven summarization for egocentric video","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Lu","year":"2013"},{"key":"2026032615164784300_ref044","article-title":"MediaPipe: a framework for perceiving and processing reality","volume-title":"CVPR Workshop","author":"Lugaresi","year":"2019"},{"key":"2026032615164784300_ref045","first-page":"533","article-title":"A user attention model for video summarization","volume-title":"ACM International Conference on Multimedia","author":"Ma","year":"2002"},{"key":"2026032615164784300_ref046","first-page":"303","article-title":"Unsupervised video summarization via dynamic modeling-based hierarchical clustering","volume":"2","author":"Mahmoud","year":"2013","journal-title":"International Conference on Machine Learning and Applications"},{"issue":"6","key":"2026032615164784300_ref047","doi-asserted-by":"crossref","DOI":"10.1145\/3457607","article-title":"A survey on bias and fairness in machine learning","volume":"54","author":"Mehrabi","year":"2021","journal-title":"ACM Computing Surveys"},{"key":"2026032615164784300_ref048","article-title":"Active video summarization: customized summaries via on-line interaction with the user","volume-title":"Association for the Advancement of Artificial Intelligence Conference","author":"Molino","year":"2017"},{"key":"2026032615164784300_ref049","article-title":"CLIP-It! language-guided video summarization","volume-title":"Advances in Neural Information Processing Systems","author":"Narasimhan","year":"2021"},{"issue":"2","key":"2026032615164784300_ref050","doi-asserted-by":"crossref","first-page":"296","DOI":"10.1109\/TCSVT.2004.841694","article-title":"Video summarization and scene detection by graph modeling","volume":"15","author":"Ngo","year":"2005","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"2","key":"2026032615164784300_ref051","first-page":"3","article-title":"Video summagator: an interface for video summarization and navigation","volume":"19","author":"Nguyen","year":"2012","journal-title":"SIGCHI Conference on Human Factors in Computing Systems"},{"key":"2026032615164784300_ref052","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR.2019.00778","article-title":"Rethinking the evaluation of video summaries","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Otani","year":"2019"},{"issue":"9","key":"2026032615164784300_ref053","doi-asserted-by":"crossref","first-page":"2010","DOI":"10.1109\/TMM.2017.2708981","article-title":"Multi-view surveillance video summarization via joint embedding and sparse optimization","volume":"19","author":"Panda","year":"2017","journal-title":"IEEE Transactions on Multimedia"},{"key":"2026032615164784300_ref054","first-page":"4274","article-title":"Collaborative summarization of topic-related videos","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Panda","year":"2017"},{"key":"2026032615164784300_ref055","first-page":"647","article-title":"SumGraph: video summarization via recursive graph modeling","volume-title":"European Conference on Computer Vision","author":"Park","year":"2020"},{"key":"2026032615164784300_ref056","first-page":"181","article-title":"SceneSkim: searching and browsing movies using synchronized captions, scripts and plot summaries","author":"Pavel","year":"2015"},{"key":"2026032615164784300_ref057","first-page":"573","article-title":"Video digests: a browsable, skimmable format for informational lecture videos","volume-title":"Annual ACM Symposium on User Interface Software and Technology","author":"Pavel","year":"2014"},{"key":"2026032615164784300_ref058","article-title":"Editing by viewing: automatic home video summarization by viewing behavior analysis","volume-title":"IEEE Transactions on Multimediaa","author":"Peng","year":"2011"},{"issue":"4","key":"2026032615164784300_ref059","doi-asserted-by":"crossref","first-page":"345","DOI":"10.1006\/jvci.1996.0030","article-title":"Abstracting digital movies automatically","volume":"7","author":"Pfeiffer","year":"1996","journal-title":"Journal of Visual Communication and Image Representation"},{"issue":"4","key":"2026032615164784300_ref060","doi-asserted-by":"crossref","first-page":"138:1","DOI":"10.1145\/3197517.3201394","article-title":"Scanner: efficient video analysis at scale","volume":"37","author":"Poms","year":"2018","journal-title":"ACM Transactions on Graphics"},{"key":"2026032615164784300_ref061","first-page":"540","article-title":"Category-specific video summarization","volume-title":"European Conference on Computer Vision","author":"Potapov","year":"2014"},{"key":"2026032615164784300_ref062","doi-asserted-by":"crossref","DOI":"10.5244\/C.34.107","article-title":"Sentence guided temporal modulation for dynamic video thumbnail generation","volume-title":"British Machine Vision Conference","author":"Rochan","year":"2020"},{"key":"2026032615164784300_ref063","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-030-58589-1_16","article-title":"Adaptive video highlight detection by learning from user history","volume-title":"European Conference on Computer Vision","author":"Rochan","year":"2020"},{"key":"2026032615164784300_ref064","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR.2019.00809","article-title":"Video summarization by learning from unpaired data","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Rochan","year":"2019"},{"key":"2026032615164784300_ref065","first-page":"358","article-title":"Video summarization using fully convolutional sequence networks","volume-title":"European Conference on Computer Vision","author":"Rochan","year":"2018"},{"key":"2026032615164784300_ref066","first-page":"855","article-title":"Character-based movie summarization","volume-title":"ACM International Conference on Multimedia","author":"Sang","year":"2010"},{"key":"2026032615164784300_ref067","first-page":"1718","article-title":"Multiple pairwise ranking networks for personalized video summarization","volume-title":"IEEE International Conference on Computer Vision","author":"Saquil","year":"2021"},{"key":"2026032615164784300_ref068","first-page":"45","article-title":"Wearable imaging system for summarizing personal experiences","volume":"1","author":"Sawahata","year":"2003","journal-title":"International Conference on Multimedia and Expo"},{"key":"2026032615164784300_ref069","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-319-46484-8_1","article-title":"Query-focused extractive video summarization","volume-title":"European Conference on Computer Vision","author":"Sharghi","year":"2016"},{"key":"2026032615164784300_ref070","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR.2017.229","article-title":"Query-focused video summarization: dataset, evaluation, and a memory network based approach","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition","author":"Sharghi","year":"2017"},{"key":"2026032615164784300_ref071","article-title":"Noisy submodular maximization via adaptive samplingwith applications to crowdsourced image collection summarization","volume-title":"Association for the Advancement of Artificial Intelligence Conference","author":"Singla","year":"2016"},{"key":"2026032615164784300_ref072","first-page":"775","article-title":"Video skimming and characterization through the combination of image and language understanding techniques","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Smith","year":"1997"},{"key":"2026032615164784300_ref073","first-page":"5","article-title":"Real-time video highlights for Yahoo Esports","volume-title":"Advances in Neural Information Processing Systems","author":"Song","year":"2016"},{"key":"2026032615164784300_ref074","first-page":"659","article-title":"To click or not to click: automatic selection of beautiful thumbnails from videos","volume-title":"ACM International on Conference on Information and Knowledge Management","author":"Song","year":"2016"},{"key":"2026032615164784300_ref075","first-page":"5179","article-title":"TVSum: summarizing web videos using titles","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Song","year":"2015"},{"key":"2026032615164784300_ref076","first-page":"1368","article-title":"Making 360\u00b0 video watchable in 2D: learning videography for click free viewing","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Su","year":"2017"},{"key":"2026032615164784300_ref077","first-page":"154","article-title":"Pano2Vid: automatic cinematography for watching 360\u00b0 videos","volume-title":"Asian Conference on Computer Vision","author":"Su","year":"2017"},{"issue":"4","key":"2026032615164784300_ref078","doi-asserted-by":"crossref","first-page":"775","DOI":"10.1109\/TMM.2006.876282","article-title":"Automated video program summarization using speech transcripts","volume":"8","author":"Taskiran","year":"2006","journal-title":"IEEE Transactions on Multimedia"},{"key":"2026032615164784300_ref079","article-title":"A survey of recent work on video summarization: approaches and techniques","volume-title":"Multimedia Tools and Applications","author":"Tiwari","year":"2021"},{"key":"2026032615164784300_ref080","first-page":"383","article-title":"Video manga: generating semantically meaningful video summaries","volume-title":"ACM International Conference on Multimedia","author":"Uchihashi","year":"1999"},{"key":"2026032615164784300_ref081","doi-asserted-by":"crossref","DOI":"10.1145\/2733373.2806367","article-title":"Egocentric video summarization of cultural tour based on user preferences","volume-title":"ACM International Conference on Multimedia","author":"Varini","year":"2015"},{"key":"2026032615164784300_ref082","doi-asserted-by":"crossref","DOI":"10.1145\/3123266.3123297","article-title":"Query-adaptive video summarization via quality-aware relevance estimation","volume-title":"ACM International Conference on Multimedia","author":"Vasudevan","year":"2017"},{"key":"2026032615164784300_ref083","first-page":"836","article-title":"Stacked memory network for video summarization","volume-title":"ACM International Conference on Multimedia","author":"Wang","year":"2019"},{"key":"2026032615164784300_ref084","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR.2019.00135","article-title":"Less is more: learning highlight detection from video duration","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Xiong","year":"2019"},{"key":"2026032615164784300_ref085","first-page":"4525","article-title":"Storyline representation of eocentric videos with an applications to story-based search","volume-title":"IEEE International Conference on Computer Vision","author":"Xiong","year":"2015"},{"key":"2026032615164784300_ref086","first-page":"2235","article-title":"Gaze-enabled egocentric video summarization via constrained submodular maximization","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Xu","year":"2015"},{"key":"2026032615164784300_ref087","doi-asserted-by":"crossref","DOI":"10.1145\/957013.957146","article-title":"VideoQA: question answering on news video","volume-title":"ACM Multimedia","author":"Yang","year":"2003"},{"key":"2026032615164784300_ref088","doi-asserted-by":"crossref","DOI":"10.1145\/3491102.3517461","article-title":"CatchLive: real-time summarization of live streams with stream content and interaction data","volume-title":"CHI Conference on Human Factors in Computing Systems","author":"Yang","year":"2022"},{"key":"2026032615164784300_ref089","first-page":"982","article-title":"Highlight detection with pairwise deep ranking for first-person video summarization","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Yao","year":"2016"},{"key":"2026032615164784300_ref090","first-page":"15","article-title":"VideoSET: video summary evaluation through text","volume-title":"CVPR Workshop on Egocentric (Firstperson) Vision","author":"Yeung","year":"2014"},{"key":"2026032615164784300_ref091","doi-asserted-by":"crossref","DOI":"10.1145\/3343031.3350985","article-title":"Sentence specified dynamic video thumbnail generation","volume-title":"ACM International Conference on Multimedia","author":"Yuan","year":"2019"},{"key":"2026032615164784300_ref092","first-page":"47","article-title":"Mouse activity as an indicator of interestingness in video","volume-title":"ACM on International Conference on Multimedia Retrieval","author":"Zen","year":"2016"},{"key":"2026032615164784300_ref093","first-page":"766","article-title":"Video summarization with long short-term memory","volume-title":"European Conference on Computer Vision","author":"Zhang","year":"2016"},{"key":"2026032615164784300_ref094","first-page":"383","article-title":"Retrospective encoders for video summarization","volume-title":"European Conference on Computer Vision","author":"Zhang","year":"2018"},{"key":"2026032615164784300_ref095","doi-asserted-by":"crossref","first-page":"863","DOI":"10.1145\/3123266.3123328","article-title":"Hierarchical recurrent neural network for video summarization","volume-title":"ACM International Conference on Multimedia","author":"Zhao","year":"2017"},{"key":"2026032615164784300_ref096","first-page":"2513","article-title":"Quasi real-time summarization for consumer videos","volume-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Zhao","year":"2014"}],"container-title":["Foundations and Trends\u00ae in Computer Graphics and Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.emerald.com\/ftcgv\/article-pdf\/13\/4\/284\/10864577\/0600000099en.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/www.emerald.com\/ftcgv\/article-pdf\/13\/4\/284\/10864577\/0600000099en.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T14:09:11Z","timestamp":1777471751000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.emerald.com\/ftcgv\/article\/13\/4\/284\/1319327\/Video-Summarization-Overview"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,12]]},"references-count":96,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2022,10,12]]}},"URL":"https:\/\/doi.org\/10.1561\/0600000099","relation":{},"ISSN":["1572-2740","1572-2759"],"issn-type":[{"value":"1572-2740","type":"print"},{"value":"1572-2759","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,10,12]]}}}