{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T15:04:54Z","timestamp":1778857494997,"version":"3.51.4"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"12","license":[{"start":{"date-parts":[[2022,3,7]],"date-time":"2022-03-07T00:00:00Z","timestamp":1646611200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,3,7]],"date-time":"2022-03-07T00:00:00Z","timestamp":1646611200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100004412","name":"T\u00fcrkiye Bilimler Akademisi","doi-asserted-by":"publisher","award":["GEBIP 2018"],"award-info":[{"award-number":["GEBIP 2018"]}],"id":[{"id":"10.13039\/501100004412","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008967","name":"Bilim Akademisi","doi-asserted-by":"publisher","award":["BAGEP 2021"],"award-info":[{"award-number":["BAGEP 2021"]}],"id":[{"id":"10.13039\/501100008967","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,5]]},"DOI":"10.1007\/s11042-022-12442-w","type":"journal-article","created":{"date-parts":[[2022,3,7]],"date-time":"2022-03-07T12:10:04Z","timestamp":1646655004000},"page":"17457-17482","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":20,"title":["Leveraging semantic saliency maps for query-specific video summarization"],"prefix":"10.1007","volume":"81","author":[{"given":"Kemal","family":"Cizmeciler","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6744-8614","authenticated-orcid":false,"given":"Erkut","family":"Erdem","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Aykut","family":"Erdem","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,3,7]]},"reference":[{"key":"12442_CR1","doi-asserted-by":"publisher","first-page":"14459","DOI":"10.1007\/s11042-020-10460-0","volume":"80","author":"M Basavarajaiah","year":"2021","unstructured":"Basavarajaiah M, Sharma P (2021) GVSUM: Generic Video summarization using deep visual features. Multimed Tools Appl 80:14459\u201314476","journal-title":"Multimed Tools Appl"},{"issue":"1","key":"12442_CR2","doi-asserted-by":"publisher","first-page":"56","DOI":"10.1016\/j.patrec.2010.08.004","volume":"32","author":"SEF de Avila","year":"2011","unstructured":"de Avila SEF, Lopes APB, da Luz A, de Albuquerque Ara\u00fajo A (2011) Vsumm: a mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recogn Lett 32(1):56\u201368","journal-title":"Pattern Recogn Lett"},{"key":"12442_CR3","doi-asserted-by":"crossref","unstructured":"Dosovitskiy A, Fischer P, Ilg E, Hausser P, Hazirbas C, Golkov V, Van Der Smagt P, Cremers D, Brox T (2015) Flownet: Learning optical flow with convolutional networks. In: Proceedings IEEE international conference on computer vision (ICCV), pp 2758\u20132766","DOI":"10.1109\/ICCV.2015.316"},{"key":"12442_CR4","doi-asserted-by":"crossref","unstructured":"Goldman DB, Curless B, Salesin D, Seitz SM (2006) Schematic storyboarding for video visualization and editing. In: ACM Transactions on graphics (TOG), vol 25. ACM, pp 862\u2013871","DOI":"10.1145\/1141911.1141967"},{"key":"12442_CR5","unstructured":"Gong B, Chao W-L, Grauman K, Sha F (2014) Diverse sequential subset selection for supervised video summarization. In: Proceedings advances in neural information processing systems (neurIPS), pp 2069\u20132077"},{"key":"12442_CR6","doi-asserted-by":"crossref","unstructured":"Gygli M, Grabner H, Riemenschneider H, Van Gool L (2014) Creating summaries from user videos. In: Proceeding sEuropean conference on computer vision (ECCV). Springer, pp 505\u2013520","DOI":"10.1007\/978-3-319-10584-0_33"},{"key":"12442_CR7","doi-asserted-by":"crossref","unstructured":"Gygli M, Grabner H, Van Gool L (2015) Video summarization by learning submodular mixtures of objectives. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 3090\u20133098","DOI":"10.1109\/CVPR.2015.7298928"},{"key":"12442_CR8","unstructured":"Iyer R, Dubal P, Dargan K, Kothawade S, Mahadev R, Kaushal V (2018) Vis-dss: An open-source toolkit for visual data selection and summarization. arXiv:1809.08846"},{"key":"12442_CR9","unstructured":"Jiang P, Han Y (2019) Query-conditioned three-player adversarial network for video summarization. In: Proceeding international conference on multimedia retrieval (ICMR)"},{"key":"12442_CR10","unstructured":"Kaushal V, Kothawade S, Tomar A, Iyer20218 R, Ramakrishnan G (2021) How good is a video summary? a new benchmarking dataset and evaluation framework towards realistic video summarization. arXiv:2101.10514"},{"key":"12442_CR11","doi-asserted-by":"crossref","unstructured":"Khosla A, Hamid R, Lin C-J, Sundaresan N (2013) Large-scale video summarization using web-image priors. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 2698\u20132705","DOI":"10.1109\/CVPR.2013.348"},{"key":"12442_CR12","doi-asserted-by":"crossref","unstructured":"Kim G, Sigal L, Xing EP (2014) Joint summarization of large-scale collections of web images and videos for storyline reconstruction. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 4225\u20134232","DOI":"10.1109\/CVPR.2014.538"},{"key":"12442_CR13","doi-asserted-by":"crossref","unstructured":"Lagani\u00e8re R, Bacco R, Hocevar A, Lambert P, Pa\u00efs G, Ionescu BE (2008) Video summarization from spatio-temporal features. In: Proc. ACM TRECVid video summarization workshop. ACM, pp 144\u2013148","DOI":"10.1145\/1463563.1463590"},{"key":"12442_CR14","unstructured":"Lee YJ, Ghosh J, Grauman K (2012) Discovering important people and objects for egocentric video summarization. In: Proceedings IEEE computer vision and pattern recognition (CVPR). IEEE, pp 1346\u20131353"},{"issue":"1","key":"12442_CR15","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1007\/s11263-014-0794-5","volume":"114","author":"YJ Lee","year":"2015","unstructured":"Lee YJ, Grauman K (2015) Predicting important objects for egocentric video summarization. Int J Comput Vis 114(1):38\u201355","journal-title":"Int J Comput Vis"},{"key":"12442_CR16","doi-asserted-by":"crossref","unstructured":"Li Y, Merialdo B (2010) VERT: Automatic evaluation of video summaries. In: Proceedings ACM Multimedia. ACM, pp 851\u2013854","DOI":"10.1145\/1873951.1874095"},{"key":"12442_CR17","unstructured":"Lin H, Bilmes J (2011) A class of submodular functions for document summarization. In: Proceedings of the 49th annual meeting of the association for computational linguistics: Human language technologies, vol 1. Association for Computational Linguistics, pp 510\u2013520"},{"key":"12442_CR18","doi-asserted-by":"crossref","unstructured":"Liu W, Mei T, Zhang Y, Che C, Luo J (2015) Multi-task deep visual-semantic embedding for video thumbnail selection. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 3707\u20133715","DOI":"10.1109\/CVPR.2015.7298994"},{"key":"12442_CR19","doi-asserted-by":"crossref","unstructured":"Lu Z, Grauman K (2013) Story-driven summarization for egocentric video. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 2714\u20132721","DOI":"10.1109\/CVPR.2013.350"},{"issue":"3","key":"12442_CR20","doi-asserted-by":"publisher","first-page":"790","DOI":"10.1016\/j.compeleceng.2012.11.020","volume":"39","author":"E Mendi","year":"2013","unstructured":"Mendi E, Clemente HB, Bayrak C (2013) Sports video summarization based on motion analysis. Comput Electr Eng 39(3):790\u2013796","journal-title":"Comput Electr Eng"},{"key":"12442_CR21","unstructured":"Monfort M, Andonian A, Zhou B, Ramakrishnan K, Bargal SA, Yan T, Brown L, Fan Q, Gutfruend D, Vondrick C et al (2019) Moments in time dataset: one million videos for event understanding. IEEE Trans Pattern Anal Mach Intell, 1\u20138"},{"key":"12442_CR22","doi-asserted-by":"crossref","unstructured":"Mundnich K, Fenster A, Khare A, Sundaram S (2021) Audiovisual highlight detection in videos. In: Proceedings IEEE ICASSP","DOI":"10.1109\/ICASSP39728.2021.9413394"},{"issue":"2","key":"12442_CR23","doi-asserted-by":"publisher","first-page":"296","DOI":"10.1109\/TCSVT.2004.841694","volume":"15","author":"C-W Ngo","year":"2005","unstructured":"Ngo C-W, Ma Y-F, Zhang H-J (2005) Video summarization and scene detection by graph modeling. IEEE Trans Circuits Syst Video Technol 15 (2):296\u2013305","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"12442_CR24","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1023\/A:1011139631724","volume":"42","author":"A Oliva","year":"2001","unstructured":"Oliva A, Torralba A (2001) Modeling the shape of the scene: a holistic representation of the spatial envelope. Int J Comput Vis 42:145\u2013175","journal-title":"Int J Comput Vis"},{"key":"12442_CR25","doi-asserted-by":"crossref","unstructured":"Otani M, Nakashima Y, Rahtu E, Heikkil\u00e4 J (2019) Rethinking the evaluation of video summaries. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2019.00778"},{"key":"12442_CR26","doi-asserted-by":"crossref","unstructured":"Otani M, Nakashima Y, Rahtu E, Heikkil\u00e4 J, Yokoya N (2016) Video summarization using deep semantic features. In: Asian conference on computer vision","DOI":"10.1007\/978-3-319-54193-8_23"},{"key":"12442_CR27","doi-asserted-by":"crossref","unstructured":"Panda R, Das A, Wu Z, Ernst J, Roy-Chowdhury AK (2017) Weakly supervised summarization of web videos. In: Proceedings IEEE international conference on computer vision (ICCV), pp 3657\u20133666","DOI":"10.1109\/ICCV.2017.395"},{"key":"12442_CR28","unstructured":"Pantazis G, Dimas G, Iakovidis, Salsum DK (2020) Saliency-based video summarization using generative adversarial networks. arXiv:2011.10432"},{"key":"12442_CR29","doi-asserted-by":"crossref","unstructured":"Potapov D, Douze M, Harchaoui Z, Schmid C (2014) Category-specific video summarization. In: Proceedings European conference on computer vision (ECCV)","DOI":"10.1007\/978-3-319-10599-4_35"},{"key":"12442_CR30","doi-asserted-by":"crossref","unstructured":"Rapantzikos K, Evangelopoulos G, Maragos P, Avrithis Y (2007) An audio-visual saliency model for movie summarization. In: Multimedia signal processing, 2007. MMSP 2007. IEEE 9th workshop on. IEEE, pp 320\u2013323","DOI":"10.1109\/MMSP.2007.4412882"},{"key":"12442_CR31","doi-asserted-by":"crossref","unstructured":"Selvaraju RR, Cogswell M, Das A, Vedantam R, Parikh D, Batra D (2017) Grad-cam: Visual explanations from deep networks via gradient-based localization. In: Proceedings IEEE international conference on computer vision (ICCV), pp 618\u2013626","DOI":"10.1109\/ICCV.2017.74"},{"key":"12442_CR32","doi-asserted-by":"crossref","unstructured":"Shao J, Kang K, Loy CC, Wang X (2015) Deeply learned attributes for crowded scene understanding. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 4657\u20134666","DOI":"10.1109\/CVPR.2015.7299097"},{"key":"12442_CR33","doi-asserted-by":"crossref","unstructured":"Sharghi A, Borji A, Li C, Yang T (2018) Improving sequential determinantal point processes for supervised video summarization. In: Proceedings European conference on computer vision (ECCV). Springer","DOI":"10.1007\/978-3-030-01219-9_32"},{"key":"12442_CR34","doi-asserted-by":"crossref","unstructured":"Sharghi A, Gong B, Shah M (2016) Query-focused extractive video summarization. In: Proceedings European conference on computer vision (ECCV). Springer, pp 3\u201319","DOI":"10.1007\/978-3-319-46484-8_1"},{"key":"12442_CR35","doi-asserted-by":"crossref","unstructured":"Sharghi A, Laurel JS, Gong B (2017) Query-focused video summarization: dataset, evaluation, and a memory network based approach. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2017.229"},{"key":"12442_CR36","unstructured":"Shrikumar A, Greenside P, Kundaje A (2017) Learning important features through propagating activation differences. In: Proceedings International conference on machine learning (ICML)"},{"key":"12442_CR37","unstructured":"Simonyan K, Vedaldi A, Zisserman A (2014) Deep inside convolutional networks: Visualising image classification models and saliency maps. In: Proceedings International conference on learning representations (ICLR)"},{"key":"12442_CR38","unstructured":"Springenberg JT, Dosovitskiy A, Brox T, Riedmiller M (2015) Striving for simplicity: The all convolutional net. In: Proceedings International conference on learning representations (ICLR). Workshop Track"},{"key":"12442_CR39","doi-asserted-by":"crossref","unstructured":"Sun K, Zhu J, Lei Z, Hou X, Zhang Q, Duan J, Qiu G (2017) Learning deep semantic attributes for user video summarization. In: Proceedings IEEE international conference on multimedia and expo (ICME). IEEE, pp 643\u2013648","DOI":"10.1109\/ICME.2017.8019411"},{"key":"12442_CR40","doi-asserted-by":"crossref","unstructured":"Tiwari V, Bhatnagar C (2021) A survey of recent work on video summarization: Approaches and techniques. Multimedia Tools and Applications","DOI":"10.1007\/s11042-021-10977-y"},{"key":"12442_CR41","doi-asserted-by":"crossref","unstructured":"Vasudevan AB, Gygli M, Volokitin A, Van Gool L (2017) Query-adaptive video summarization via quality-aware relevance estimation. In: Proceedings ACM multimedia. ACM, pp 582\u2013590","DOI":"10.1145\/3123266.3123297"},{"key":"12442_CR42","doi-asserted-by":"crossref","unstructured":"Wolf W (1996) Key frame selection by motion analysis. In: Proc. IEEE international conference on acoustics, speech, and signal processing, vol 2. IEEE, pp 1228\u20131231","DOI":"10.1109\/ICASSP.1996.543588"},{"key":"12442_CR43","doi-asserted-by":"crossref","unstructured":"Xiong B, Grauman K (2014) Detecting snap points in egocentric video with a web photo prior. In: Proceedings european conference on computer vision (ECCV). Springer, pp 282\u2013298","DOI":"10.1007\/978-3-319-10602-1_19"},{"key":"12442_CR44","doi-asserted-by":"crossref","unstructured":"Xu J, Mukherjee L, Li Y, Warner J, Rehg JM, Singh V (2015) Gaze-enabled egocentric video summarization via constrained submodular maximization. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 2235\u20132244","DOI":"10.1109\/CVPR.2015.7298836"},{"key":"12442_CR45","unstructured":"Yeung S, Fathi A, Fei-Fei L (2014) Videoset: Video summary evaluation through text. arXiv:1406.5824"},{"key":"12442_CR46","first-page":"818","volume-title":"Visualizing and Understanding Convolutional Networks","author":"MD Zeiler","year":"2014","unstructured":"Zeiler MD, Fergus R (2014) Visualizing and Understanding Convolutional Networks. Springer International Publishing, Cham, pp 818\u2013833"},{"key":"12442_CR47","doi-asserted-by":"crossref","unstructured":"Zhang J, Zhe L, Brandt J, Shen X, Stan S (2016) Top-down neural attention by excitation backprop. In: Proceedings European conference on computer vision(ECCV)","DOI":"10.1007\/978-3-319-46493-0_33"},{"key":"12442_CR48","unstructured":"Zhang Y, Kampffmeyer M, Liang X, Tan M, Xing EP (2018) Hierarchical variational network for user-diversified i& query-focused video summarization. In: Proceedings British machine vision conference (BMVC). BMVA"},{"key":"12442_CR49","doi-asserted-by":"crossref","unstructured":"Zhou B, Khosla A, Lapedriza A, Oliva A, Torralba A (2016) Learning deep features for discriminative localization. In: Proceedings IEEE conference on computer vision and pattern recognition (CVPR), pp 2921\u20132929","DOI":"10.1109\/CVPR.2016.319"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-022-12442-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-022-12442-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-022-12442-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,19]],"date-time":"2024-09-19T21:33:14Z","timestamp":1726781594000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-022-12442-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,3,7]]},"references-count":49,"journal-issue":{"issue":"12","published-print":{"date-parts":[[2022,5]]}},"alternative-id":["12442"],"URL":"https:\/\/doi.org\/10.1007\/s11042-022-12442-w","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,3,7]]},"assertion":[{"value":"20 April 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 July 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 January 2022","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 March 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}