{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T19:46:15Z","timestamp":1775245575650,"version":"3.50.1"},"publisher-location":"Cham","reference-count":47,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012182","type":"print"},{"value":"9783030012199","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01219-9_32","type":"book-chapter","created":{"date-parts":[[2018,10,6]],"date-time":"2018-10-06T10:23:51Z","timestamp":1538821431000},"page":"533-550","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":27,"title":["Improving Sequential Determinantal Point Processes for Supervised Video Summarization"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2005-1334","authenticated-orcid":false,"given":"Aidean","family":"Sharghi","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ali","family":"Borji","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2346-2753","authenticated-orcid":false,"given":"Chengtao","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7858-5438","authenticated-orcid":false,"given":"Tianbao","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3915-5977","authenticated-orcid":false,"given":"Boqing","family":"Gong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,10,7]]},"reference":[{"key":"32_CR1","unstructured":"Bahdanau, D., Cho, K., Bengio, Y.: Neural machine translation by jointly learning to align and translate. arXiv preprint arXiv:1409.0473 (2014)"},{"issue":"3","key":"32_CR2","doi-asserted-by":"publisher","first-page":"291","DOI":"10.1007\/s10955-005-7583-z","volume":"121","author":"A Borodin","year":"2005","unstructured":"Borodin, A., Rains, E.M.: Eynard-Mehta theorem, Schur process, and their pfaffian analogs. J. Stat. Phys. 121(3), 291\u2013317 (2005)","journal-title":"J. Stat. Phys."},{"key":"32_CR3","doi-asserted-by":"crossref","unstructured":"Borth, D., Ji, R., Chen, T., Breuel, T., Chang, S.F.: Large-scale visual sentiment ontology and detectors using adjective noun pairs. In: Proceedings of the 21st ACM International Conference on Multimedia, pp. 223\u2013232. ACM (2013)","DOI":"10.1145\/2502081.2502282"},{"key":"32_CR4","doi-asserted-by":"crossref","unstructured":"Chu, W.S., Song, Y., Jaimes, A.: Video co-summarization: video summarization by visual co-occurrence. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3584\u20133592 (2015)","DOI":"10.1109\/CVPR.2015.7298981"},{"key":"32_CR5","doi-asserted-by":"crossref","unstructured":"Collins, M., Roark, B.: Incremental parsing with the perceptron algorithm. In: Proceedings of the 42nd Annual Meeting on Association for Computational Linguistics, p. 111. Association for Computational Linguistics (2004)","DOI":"10.3115\/1218955.1218970"},{"issue":"3","key":"32_CR6","doi-asserted-by":"publisher","first-page":"297","DOI":"10.1007\/s10994-009-5106-x","volume":"75","author":"H Daum\u00e9","year":"2009","unstructured":"Daum\u00e9, H., Langford, J., Marcu, D.: Search-based structured prediction. Mach. Learn. 75(3), 297\u2013325 (2009)","journal-title":"Mach. Learn."},{"issue":"1","key":"32_CR7","doi-asserted-by":"publisher","first-page":"56","DOI":"10.1016\/j.patrec.2010.08.004","volume":"32","author":"SEF De Avila","year":"2011","unstructured":"De Avila, S.E.F., Lopes, A.P.B., da Luz Jr., A., de Albuquerque Ara\u00fajo, A.: VSUMM: a mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recog. Lett. 32(1), 56\u201368 (2011)","journal-title":"Pattern Recog. Lett."},{"key":"32_CR8","doi-asserted-by":"crossref","unstructured":"Fathi, A., Hodgins, J.K., Rehg, J.M.: Social interactions: a first-person perspective. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1226\u20131233. IEEE (2012)","DOI":"10.1109\/CVPR.2012.6247805"},{"key":"32_CR9","unstructured":"Gong, B., Chao, W.L., Grauman, K., Sha, F.: Diverse sequential subset selection for supervised video summarization. In: Advances in Neural Information Processing Systems, pp. 2069\u20132077 (2014)"},{"key":"32_CR10","unstructured":"Gong, B., Chao, W., Grauman, K., Sha, F.: Diverse sequential subset selection for supervised video summarization. In: Advances in Neural Information Processing Systems (NIPS), pp. 2069\u20132077 (2014)"},{"key":"32_CR11","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"505","DOI":"10.1007\/978-3-319-10584-0_33","volume-title":"Computer Vision \u2013 ECCV 2014","author":"M Gygli","year":"2014","unstructured":"Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L.: Creating summaries from user videos. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8695, pp. 505\u2013520. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10584-0_33"},{"key":"32_CR12","doi-asserted-by":"crossref","unstructured":"Gygli, M., Grabner, H., Van Gool, L.: Video summarization by learning submodular mixtures of objectives. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3090\u20133098 (2015)","DOI":"10.1109\/CVPR.2015.7298928"},{"key":"32_CR13","doi-asserted-by":"crossref","DOI":"10.4324\/9781315671994","volume-title":"Seizing the Light: A Social and Aesthetic History of Photography","author":"R Hirsch","year":"2017","unstructured":"Hirsch, R.: Seizing the Light: A Social and Aesthetic History of Photography. Taylor & Francis, Routledge (2017)"},{"key":"32_CR14","doi-asserted-by":"publisher","first-page":"206","DOI":"10.1214\/154957806000000078","volume":"3","author":"JB Hough","year":"2006","unstructured":"Hough, J.B., Krishnapur, M., Peres, Y., Vir\u00e1g, B.: Determinantal processes and independence. Probab. Surv. 3, 206\u2013229 (2006)","journal-title":"Probab. Surv."},{"key":"32_CR15","doi-asserted-by":"crossref","unstructured":"Khosla, A., Hamid, R., Lin, C.J., Sundaresan, N.: Large-scale video summarization using web-image priors. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2698\u20132705 (2013)","DOI":"10.1109\/CVPR.2013.348"},{"key":"32_CR16","doi-asserted-by":"crossref","unstructured":"Kim, G., Sigal, L., Xing, E.P.: Joint summarization of large-scale collections of web images and videos for storyline reconstruction. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4225\u20134232 (2014)","DOI":"10.1109\/CVPR.2014.538"},{"key":"32_CR17","doi-asserted-by":"crossref","unstructured":"Kulesza, A., Taskar, B.: k-DPPs: fixed-size determinantal point processes. In: Proceedings of the 28th International Conference on Machine Learning (ICML), pp. 1193\u20131200 (2011)","DOI":"10.1561\/9781601986290"},{"issue":"2\u20133","key":"32_CR18","doi-asserted-by":"publisher","first-page":"123","DOI":"10.1561\/2200000044","volume":"5","author":"A Kulesza","year":"2012","unstructured":"Kulesza, A., Taskar, B.: Determinantal point processes for machine learning. Found. Trends\u00ae Mach. Learn. 5(2\u20133), 123\u2013286 (2012)","journal-title":"Found. Trends\u00ae Mach. Learn."},{"key":"32_CR19","doi-asserted-by":"crossref","unstructured":"Lee, Y.J., Ghosh, J., Grauman, K.: Discovering important people and objects for egocentric video summarization. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1346\u20131353. IEEE (2012)","DOI":"10.1109\/CVPR.2012.6247820"},{"issue":"1","key":"32_CR20","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1007\/s11263-014-0794-5","volume":"114","author":"YJ Lee","year":"2015","unstructured":"Lee, Y.J., Grauman, K.: Predicting important objects for egocentric video summarization. Int. J. Comput. Vis. 114(1), 38\u201355 (2015)","journal-title":"Int. J. Comput. Vis."},{"key":"32_CR21","unstructured":"Lin, C.Y.: Rouge: a package for automatic evaluation of summaries. In: Text Summarization Branches Out: Proceedings of the ACL 2004 Workshop, Barcelona, Spain, vol. 8 (2004)"},{"key":"32_CR22","doi-asserted-by":"crossref","unstructured":"Liu, W., Mei, T., Zhang, Y., Che, C., Luo, J.: Multi-task deep visual-semantic embedding for video thumbnail selection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3707\u20133715 (2015)","DOI":"10.1109\/CVPR.2015.7298994"},{"key":"32_CR23","doi-asserted-by":"crossref","unstructured":"Lu, Z., Grauman, K.: Story-driven summarization for egocentric video. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2714\u20132721 (2013)","DOI":"10.1109\/CVPR.2013.350"},{"key":"32_CR24","doi-asserted-by":"crossref","unstructured":"Obile, W.: Ericsson mobility report (2016)","DOI":"10.17016\/2573-2129.17"},{"key":"32_CR25","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.J.: Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th Annual Meeting on Association for Computational Linguistics, pp. 311\u2013318. Association for Computational Linguistics (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"32_CR26","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"540","DOI":"10.1007\/978-3-319-10599-4_35","volume-title":"Computer Vision \u2013 ECCV 2014","author":"D Potapov","year":"2014","unstructured":"Potapov, D., Douze, M., Harchaoui, Z., Schmid, C.: Category-specific video summarization. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8694, pp. 540\u2013555. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10599-4_35"},{"key":"32_CR27","unstructured":"Ranzato, M., Chopra, S., Auli, M., Zaremba, W.: Sequence level training with recurrent neural networks. arXiv preprint arXiv:1511.06732 (2015)"},{"key":"32_CR28","unstructured":"Ross, S., Gordon, G.J., Bagnell, D.: A reduction of imitation learning and structured prediction to no-regret online learning. In: International Conference on Artificial Intelligence and Statistics, pp. 627\u2013635 (2011)"},{"key":"32_CR29","doi-asserted-by":"crossref","unstructured":"Serban, I.V., Sordoni, A., Bengio, Y., Courville, A.C., Pineau, J.: Building end-to-end dialogue systems using generative hierarchical neural network models. In: AAAI, pp. 3776\u20133784 (2016)","DOI":"10.1609\/aaai.v30i1.9883"},{"key":"32_CR30","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/978-3-319-46484-8_1","volume-title":"Computer Vision \u2013 ECCV 2016","author":"A Sharghi","year":"2016","unstructured":"Sharghi, A., Gong, B., Shah, M.: Query-focused extractive video summarization. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 3\u201319. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_1"},{"key":"32_CR31","doi-asserted-by":"crossref","unstructured":"Sharghi, A., Laurel, J.S., Gong, B.: Query-focused video summarization: dataset, evaluation, and a memory network based approach. arXiv preprint arXiv:1707.04960 (2017)","DOI":"10.1109\/CVPR.2017.229"},{"key":"32_CR32","unstructured":"Shen, S., et al.: Minimum risk training for neural machine translation. arXiv preprint arXiv:1512.02433 (2015)"},{"key":"32_CR33","doi-asserted-by":"crossref","unstructured":"Song, Y., Vallmitjana, J., Stent, A., Jaimes, A.: TVSum: summarizing web videos using titles. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5179\u20135187 (2015)","DOI":"10.1109\/CVPR.2015.7299154"},{"key":"32_CR34","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"787","DOI":"10.1007\/978-3-319-10590-1_51","volume-title":"Computer Vision \u2013 ECCV 2014","author":"M Sun","year":"2014","unstructured":"Sun, M., Farhadi, A., Seitz, S.: Ranking domain-specific highlights by analyzing edited videos. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8689, pp. 787\u2013802. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10590-1_51"},{"key":"32_CR35","unstructured":"Sutskever, I., Martens, J., Hinton, G.E.: Generating text with recurrent neural networks. In: Proceedings of the 28th International Conference on Machine Learning (ICML 2011), pp. 1017\u20131024 (2011)"},{"key":"32_CR36","unstructured":"Sutskever, I., Vinyals, O., Le, Q.V.: Sequence to sequence learning with neural networks. In: Advances in Neural Information Processing Systems, pp. 3104\u20133112 (2014)"},{"key":"32_CR37","doi-asserted-by":"crossref","unstructured":"Szegedy, C., et al.: Going deeper with convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"32_CR38","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Rohrbach, M., Donahue, J., Mooney, R., Darrell, T., Saenko, K.: Sequence to sequence-video to text. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4534\u20134542 (2015)","DOI":"10.1109\/ICCV.2015.515"},{"key":"32_CR39","unstructured":"Vinyals, O., Kaiser, \u0141., Koo, T., Petrov, S., Sutskever, I., Hinton, G.: Grammar as a foreign language. In: Advances in Neural Information Processing Systems, pp. 2773\u20132781 (2015)"},{"key":"32_CR40","doi-asserted-by":"crossref","unstructured":"Wiseman, S., Rush, A.M.: Sequence-to-sequence learning as beam-search optimization. arXiv preprint arXiv:1606.02960 (2016)","DOI":"10.18653\/v1\/D16-1137"},{"key":"32_CR41","doi-asserted-by":"crossref","unstructured":"Wolf, W.: Key frame selection by motion analysis. In: 1996 IEEE International Conference on Acoustics, Speech, and Signal Processing, ICASSP 1996, vol. 2, pp. 1228\u20131231. IEEE (1996)","DOI":"10.1109\/ICASSP.1996.543588"},{"key":"32_CR42","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"282","DOI":"10.1007\/978-3-319-10602-1_19","volume-title":"Computer Vision \u2013 ECCV 2014","author":"B Xiong","year":"2014","unstructured":"Xiong, B., Grauman, K.: Detecting snap points in egocentric video with a web photo prior. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8693, pp. 282\u2013298. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10602-1_19"},{"key":"32_CR43","unstructured":"Xu, K., et al.: Show, attend and tell: neural image caption generation with visual attention. In: International Conference on Machine Learning, pp. 2048\u20132057 (2015)"},{"key":"32_CR44","unstructured":"Yeung, S., Fathi, A., Fei-Fei, L.: VideoSET: video summary evaluation through text. arXiv preprint arXiv:1406.5824 (2014)"},{"key":"32_CR45","doi-asserted-by":"crossref","unstructured":"Zhang, K., Chao, W.L., Sha, F., Grauman, K.: Summary transfer: exemplar-based subset selection for video summarization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1059\u20131067 (2016)","DOI":"10.1109\/CVPR.2016.120"},{"key":"32_CR46","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"766","DOI":"10.1007\/978-3-319-46478-7_47","volume-title":"Computer Vision \u2013 ECCV 2016","author":"K Zhang","year":"2016","unstructured":"Zhang, K., Chao, W.-L., Sha, F., Grauman, K.: Video summarization with long short-term memory. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9911, pp. 766\u2013782. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46478-7_47"},{"key":"32_CR47","doi-asserted-by":"crossref","unstructured":"Zhao, B., Xing, E.P.: Quasi real-time summarization for consumer videos. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2513\u20132520 (2014)","DOI":"10.1109\/CVPR.2014.322"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01219-9_32","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T18:47:31Z","timestamp":1775242051000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01219-9_32"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012182","9783030012199"],"references-count":47,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01219-9_32","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"7 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}