{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T19:16:35Z","timestamp":1775243795197,"version":"3.50.1"},"publisher-location":"Cham","reference-count":44,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012397","type":"print"},{"value":"9783030012403","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01240-3_13","type":"book-chapter","created":{"date-parts":[[2018,10,6]],"date-time":"2018-10-06T00:36:08Z","timestamp":1538786168000},"page":"202-218","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":48,"title":["Find and Focus: Retrieve and Localize Video Events with Natural Language Queries"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0862-9941","authenticated-orcid":false,"given":"Dian","family":"Shao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2582-3663","authenticated-orcid":false,"given":"Yu","family":"Xiong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2753-5921","authenticated-orcid":false,"given":"Yue","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6467-1634","authenticated-orcid":false,"given":"Qingqiu","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1889-2567","authenticated-orcid":false,"given":"Yu","family":"Qiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8865-7896","authenticated-orcid":false,"given":"Dahua","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,10,5]]},"reference":[{"key":"13_CR1","doi-asserted-by":"crossref","unstructured":"Apostolidis, E., Mezaris, V.: Fast shot segmentation combining global and local visual descriptors. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6583\u20136587. IEEE (2014)","DOI":"10.1109\/ICASSP.2014.6854873"},{"key":"13_CR2","doi-asserted-by":"crossref","unstructured":"Aytar, Y., Shah, M., Luo, J.: Utilizing semantic word similarity measures for video retrieval. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1\u20138. IEEE (2008)","DOI":"10.1109\/CVPR.2008.4587822"},{"key":"13_CR3","doi-asserted-by":"crossref","unstructured":"Bojanowski, P., et al.: Weakly-supervised alignment of video with text. In: IEEE International Conference on Computer Vision (ICCV), pp. 4462\u20134470 (2015)","DOI":"10.1109\/ICCV.2015.507"},{"key":"13_CR4","doi-asserted-by":"crossref","unstructured":"Chen, K., Song, H., Loy, C.C., Lin, D.: Discover and learn new objects from documentaries. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1111\u20131120. IEEE (2017)","DOI":"10.1109\/CVPR.2017.124"},{"key":"13_CR5","doi-asserted-by":"crossref","unstructured":"Dalton, J., Allan, J., Mirajkar, P.: Zero-shot video retrieval using content and concepts. In: the 22nd ACM International Conference on Information and Knowledge Management (CIKM), pp. 1857\u20131860. ACM (2013)","DOI":"10.1145\/2505515.2507880"},{"key":"13_CR6","unstructured":"Faghri, F., Fleet, D.J., Kiros, J.R., Fidler, S.: VSE++: improved visual-semantic embeddings. arXiv preprint arXiv:1707.05612 (2017)"},{"key":"13_CR7","unstructured":"Frome, A., Corrado, G.S., Shlens, J., Bengio, S., Dean, J., Mikolov, T., et al.: Devise: a deep visual-semantic embedding model. In: Advances in Neural Information Processing Systems (NIPS), pp. 2121\u20132129 (2013)"},{"issue":"11","key":"13_CR8","doi-asserted-by":"publisher","first-page":"2782","DOI":"10.1109\/TPAMI.2013.65","volume":"35","author":"A Gaidon","year":"2013","unstructured":"Gaidon, A., Harchaoui, Z., Schmid, C.: Temporal localization of actions with actoms. IEEE Trans. Pattern Anal. Mach. Intell. 35(11), 2782\u20132795 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"13_CR9","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"13_CR10","doi-asserted-by":"crossref","unstructured":"Jain, M., Van Gemert, J., J\u00e9gou, H., Bouthemy, P., Snoek, C.: Action localization with tubelets from motion. In: IEEE International Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.100"},{"key":"13_CR11","doi-asserted-by":"crossref","unstructured":"Johnson, J., et al.: Image retrieval using scene graphs. In: IEEE Conference on Computer vision and Pattern Recognition (CVPR), pp. 3668\u20133678 (2015)","DOI":"10.1109\/CVPR.2015.7298990"},{"issue":"11","key":"13_CR12","doi-asserted-by":"publisher","first-page":"4054","DOI":"10.1016\/j.patcog.2012.04.016","volume":"45","author":"S Jouili","year":"2012","unstructured":"Jouili, S., Tabbone, S.: Hypergraph-based image retrieval for graph-based representation. Pattern Recognit. 45(11), 4054\u20134068 (2012)","journal-title":"Pattern Recognit."},{"key":"13_CR13","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Fei-Fei, L.: Deep visual-semantic alignments for generating image descriptions. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3128\u20133137 (2015)","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"13_CR14","unstructured":"Karpathy, A., Joulin, A., Fei-Fei, L.: Deep fragment embeddings for bidirectional image sentence mapping. In: Advances in Neural Information Processing Systems (NIPS), pp. 1889\u20131897 (2014)"},{"key":"13_CR15","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)"},{"key":"13_CR16","unstructured":"Kiros, R., Salakhutdinov, R., Zemel, R.S.: Unifying visual-semantic embeddings with multimodal neural language models. arXiv preprint arXiv:1411.2539 (2014)"},{"key":"13_CR17","doi-asserted-by":"crossref","unstructured":"Krishna, R., Hata, K., Ren, F., Fei-Fei, L., Niebles, J.C.: Dense-captioning events in videos. In: IEEE International Conference on Computer Vision (ICCV) (2017)","DOI":"10.1109\/ICCV.2017.83"},{"key":"13_CR18","doi-asserted-by":"crossref","unstructured":"Lin, D., Fidler, S., Kong, C., Urtasun, R.: Visual semantic search: retrieving videos via complex textual queries. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2657\u20132664 (2014)","DOI":"10.1109\/CVPR.2014.340"},{"key":"13_CR19","doi-asserted-by":"crossref","unstructured":"Liu, W., Mei, T., Zhang, Y., Che, C., Luo, J.: Multi-task deep visual-semantic embedding for video thumbnail selection. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3707\u20133715 (2015)","DOI":"10.1109\/CVPR.2015.7298994"},{"key":"13_CR20","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"651","DOI":"10.1007\/978-3-319-46604-0_46","volume-title":"Computer Vision \u2013 ECCV 2016 Workshops","author":"M Otani","year":"2016","unstructured":"Otani, M., Nakashima, Y., Rahtu, E., Heikkil\u00e4, J., Yokoya, N.: Learning joint representations of videos and sentences with web image search. In: Hua, G., J\u00e9gou, H. (eds.) ECCV 2016. LNCS, vol. 9913, pp. 651\u2013667. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46604-0_46"},{"key":"13_CR21","doi-asserted-by":"crossref","unstructured":"Plummer, B.A., Brown, M., Lazebnik, S.: Enhancing video summarization via vision-language embedding. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.118"},{"issue":"2","key":"13_CR22","first-page":"5","volume":"1","author":"M Ren","year":"2015","unstructured":"Ren, M., Kiros, R., Zemel, R.: Image question answering: a visual semantic embedding model and a new dataset. Adv. Neural Inf. Process. Systems (NIPS) 1(2), 5 (2015)","journal-title":"Adv. Neural Inf. Process. Systems (NIPS)"},{"issue":"1","key":"13_CR23","doi-asserted-by":"publisher","first-page":"94","DOI":"10.1007\/s11263-016-0987-1","volume":"123","author":"A Rohrbach","year":"2017","unstructured":"Rohrbach, A., et al.: Movie description. Int. J. Comput. Vis. 123(1), 94\u2013120 (2017)","journal-title":"Int. J. Comput. Vis."},{"key":"13_CR24","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/978-3-319-46484-8_1","volume-title":"Computer Vision \u2013 ECCV 2016","author":"A Sharghi","year":"2016","unstructured":"Sharghi, A., Gong, B., Shah, M.: Query-focused extractive video summarization. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 3\u201319. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_1"},{"key":"13_CR25","doi-asserted-by":"crossref","unstructured":"Shou, Z., Wang, D., Chang, S.F.: Temporal action localization in untrimmed videos via multi-stage CNNs. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1049\u20131058 (2016)","DOI":"10.1109\/CVPR.2016.119"},{"issue":"2","key":"13_CR26","doi-asserted-by":"publisher","first-page":"62","DOI":"10.1109\/93.311653","volume":"1","author":"SW Smoliar","year":"1994","unstructured":"Smoliar, S.W., Zhang, H.: Content based video indexing and retrieval. IEEE Multimed. 1(2), 62\u201372 (1994)","journal-title":"IEEE Multimed."},{"issue":"4","key":"13_CR27","doi-asserted-by":"publisher","first-page":"215","DOI":"10.1561\/1500000014","volume":"2","author":"CG Snoek","year":"2008","unstructured":"Snoek, C.G., Worring, M.: Concept-based video retrieval. Found. Trends Inf. Retrieval 2(4), 215\u2013322 (2008)","journal-title":"Found. Trends Inf. Retrieval"},{"key":"13_CR28","doi-asserted-by":"crossref","unstructured":"Tang, K., Yao, B., Fei-Fei, L., Koller, D.: Combining the right features for complex event recognition. In: IEEE International Conference on Computer Vision (ICCV), pp. 2696\u20132703. IEEE (2013)","DOI":"10.1109\/ICCV.2013.335"},{"issue":"1","key":"13_CR29","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/s13735-014-0065-9","volume":"4","author":"M Tapaswi","year":"2015","unstructured":"Tapaswi, M., B\u00e4uml, M., Stiefelhagen, R.: Aligning plot synopses to videos for story-based retrieval. Int. J. Multimed. Inf. Retrieval 4(1), 3\u201316 (2015)","journal-title":"Int. J. Multimed. Inf. Retrieval"},{"key":"13_CR30","unstructured":"Torabi, A., Tandon, N., Sigal, L.: Learning language-visual embedding for movie understanding with natural-language. arXiv preprint arXiv:1609.08124 (2016)"},{"key":"13_CR31","unstructured":"Vendrov, I., Kiros, R., Fidler, S., Urtasun, R.: Order-embeddings of images and language. In: International Conference on Representation Learning (ICLR) (2016)"},{"key":"13_CR32","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Rohrbach, M., Donahue, J., Mooney, R., Darrell, T., Saenko, K.: Sequence to sequence-video to text. In: IEEE International Conference on Computer Vision (ICCV), pp. 4534\u20134542 (2015)","DOI":"10.1109\/ICCV.2015.515"},{"key":"13_CR33","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Xu, H., Donahue, J., Rohrbach, M., Mooney, R., Saenko, K.: Translating videos to natural language using deep recurrent neural networks. arXiv preprint arXiv:1412.4729 (2014)","DOI":"10.3115\/v1\/N15-1173"},{"key":"13_CR34","doi-asserted-by":"crossref","unstructured":"Wang, D., Li, X., Li, J., Zhang, B.: The importance of query-concept-mapping for automatic video retrieval. In: the 15th ACM International Conference on Multimedia, pp. 285\u2013288. ACM (2007)","DOI":"10.1145\/1291233.1291293"},{"key":"13_CR35","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1007\/978-3-319-46484-8_2","volume-title":"Computer Vision \u2013 ECCV 2016","author":"L Wang","year":"2016","unstructured":"Wang, L., et al.: Temporal segment networks: towards good practices for deep action recognition. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 20\u201336. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_2"},{"key":"13_CR36","doi-asserted-by":"crossref","unstructured":"Wang, L., Li, Y., Lazebnik, S.: Learning deep structure-preserving image-text embeddings. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5005\u20135013 (2016)","DOI":"10.1109\/CVPR.2016.541"},{"key":"13_CR37","doi-asserted-by":"crossref","unstructured":"Wu, B., Lang, B., Liu, Y.: GKSH: graph based image retrieval using supervised kernel hashing. In: International Conference on Internet Multimedia Computing and Service, pp. 88\u201393. ACM (2016)","DOI":"10.1145\/3007669.3007722"},{"key":"13_CR38","doi-asserted-by":"crossref","unstructured":"Xu, R., Xiong, C., Chen, W., Corso, J.J.: Jointly modeling deep video and compositional text to bridge vision and language in a unified framework. In: AAAI Conference on Artificial Intelligence (AAAI), vol. 5, p. 6 (2015)","DOI":"10.1609\/aaai.v29i1.9512"},{"key":"13_CR39","doi-asserted-by":"crossref","unstructured":"Yao, L., et al.: Describing videos by exploiting temporal structure. In: IEEE International Conference on Computer Vision (ICCV), pp. 4507\u20134515 (2015)","DOI":"10.1109\/ICCV.2015.512"},{"key":"13_CR40","doi-asserted-by":"crossref","unstructured":"Yeung, S., Russakovsky, O., Mori, G., Fei-Fei, L.: End-to-end learning of action detection from frame glimpses in videos. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2678\u20132687 (2016)","DOI":"10.1109\/CVPR.2016.293"},{"key":"13_CR41","doi-asserted-by":"crossref","unstructured":"Yu, Y., Ko, H., Choi, J., Kim, G.: End-to-end concept word detection for video captioning, retrieval, and question answering. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.347"},{"issue":"4","key":"13_CR42","doi-asserted-by":"publisher","first-page":"643","DOI":"10.1016\/S0031-3203(96)00109-4","volume":"30","author":"HJ Zhang","year":"1997","unstructured":"Zhang, H.J., Wu, J., Zhong, D., Smoliar, S.W.: An integrated system for content-based video retrieval and browsing. Pattern Recognit. 30(4), 643\u2013658 (1997)","journal-title":"Pattern Recognit."},{"key":"13_CR43","doi-asserted-by":"crossref","unstructured":"Zhao, Y., Xiong, Y., Wang, L., Wu, Z., Tang, X., Lin, D.: Temporal action detection with structured segment networks. In: IEEE International Conference on Computer Vision (ICCV), vol. 8 (2017)","DOI":"10.1109\/ICCV.2017.317"},{"key":"13_CR44","doi-asserted-by":"crossref","unstructured":"Zhu, Y., et al.: Aligning books and movies: towards story-like visual explanations by watching movies and reading books. In: IEEE International Conference on Computer Vision (ICCV), pp. 19\u201327 (2015)","DOI":"10.1109\/ICCV.2015.11"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01240-3_13","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T18:42:36Z","timestamp":1775241756000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01240-3_13"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012397","9783030012403"],"references-count":44,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01240-3_13","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"5 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}