{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,6]],"date-time":"2026-06-06T16:03:06Z","timestamp":1780761786836,"version":"3.54.1"},"publisher-location":"Cham","reference-count":84,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012694","type":"print"},{"value":"9783030012700","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01270-0_10","type":"book-chapter","created":{"date-parts":[[2018,10,5]],"date-time":"2018-10-05T18:07:51Z","timestamp":1538762871000},"page":"162-179","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":185,"title":["AutoLoc: Weakly-Supervised Temporal Action Localization in Untrimmed Videos"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7681-2166","authenticated-orcid":false,"given":"Zheng","family":"Shou","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hang","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kazuyuki","family":"Miyazawa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shih-Fu","family":"Chang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2018,10,6]]},"reference":[{"key":"10_CR1","unstructured":"Activitynet challenge 2016 (2016). http:\/\/activity-net.org\/challenges\/2016\/"},{"issue":"3","key":"10_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/1922649.1922653","volume":"43","author":"J.K. Aggarwal","year":"2011","unstructured":"Aggarwal, J.K., Ryoo, M.S.: Human activity analysis: a review. In: ACM Computing Surveys (2011)","journal-title":"ACM Computing Surveys"},{"key":"10_CR3","doi-asserted-by":"crossref","unstructured":"Asadi-Aghbolaghi, M., Clap\u00e9s, A., Bellantonio, M., Escalante, H.J., Ponce-L\u00f3pez, V., Bar\u00f3, X., Guyon, I., Kasaei, S., Escalera, S.: A survey on deep learning based approaches for action and gesture recognition in image sequences. In: FG (2017)","DOI":"10.1007\/978-3-319-57021-1_19"},{"key":"10_CR4","doi-asserted-by":"crossref","unstructured":"Bearman, A., Russakovsky, O., Ferrari, V., Fei-Fei, L.: Whats the point: Semantic segmentation with point supervision. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46478-7_34"},{"key":"10_CR5","doi-asserted-by":"crossref","unstructured":"Bilen, H., Vedaldi, A.: Weakly supervised deep detection networks. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.311"},{"key":"10_CR6","doi-asserted-by":"crossref","unstructured":"Buch, S., Escorcia, V., Ghanem, B., Fei-Fei, L., Niebles, J.C.: End-to-end, single-stream temporal action detection in untrimmed videos. In: BMVC (2017)","DOI":"10.5244\/C.31.93"},{"key":"10_CR7","doi-asserted-by":"crossref","unstructured":"Buch, S., Escorcia, V., Shen, C., Ghanem, B., Niebles, J.C.: Sst: single-stream temporal action proposals. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.675"},{"key":"10_CR8","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? a new model and the kinetics dataset. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"10_CR9","doi-asserted-by":"crossref","unstructured":"Chen, Y., Jin, X., Feng, J., Yan, S.: Training group orthogonal neural networks with privileged information. In: IJCAI (2017)","DOI":"10.24963\/ijcai.2017\/212"},{"key":"10_CR10","doi-asserted-by":"crossref","unstructured":"Chen, Y., Jin, X., Kang, B., Feng, J., Yan, S.: Sharing residual units through collective tensor factorization in deep neural networks. In: IJCAI (2018)","DOI":"10.24963\/ijcai.2018\/88"},{"key":"10_CR11","doi-asserted-by":"crossref","unstructured":"Chen, Y., Kalantidis, Y., Li, J., Yan, S., Feng, J.: Multi-fiber networks for video recognition. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01246-5_22"},{"key":"10_CR12","unstructured":"Chen, Y., Li, J., Xiao, H., Jin, X., Yan, S., Feng, J.: Dual path networks. In: NIPS (2017)"},{"key":"10_CR13","unstructured":"Cheng, G., Wan, Y., Saudagar, A.N., Namuduri, K., Buckles, B.P.: Advances in human action recognition: a survey (2015). arXiv:1501.05964"},{"key":"10_CR14","doi-asserted-by":"crossref","unstructured":"Dai, X., Singh, B., Zhang, G., Davis, L.S., Chen, Y.Q.: Temporal context network for activity localization in videos. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.610"},{"key":"10_CR15","doi-asserted-by":"crossref","unstructured":"Dave, A., Russakovsky, O., Ramanan, D.: Predictive-corrective networks for action detection. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.223"},{"issue":"1-2","key":"10_CR16","doi-asserted-by":"publisher","first-page":"31","DOI":"10.1016\/S0004-3702(96)00034-3","volume":"89","author":"Thomas G. Dietterich","year":"1997","unstructured":"Dietterich, T.G., Lathrop, R.H., Lozano-P\u00e9rez, T.: Solving the multiple instance problem with axis-parallel rectangles (1997)","journal-title":"Artificial Intelligence"},{"key":"10_CR17","doi-asserted-by":"crossref","unstructured":"Donahue, J., Hendricks, L.A., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., Darrell, T.: Long-term recurrent convolutional networks for visual recognition and description. In: CVPR (2015)","DOI":"10.21236\/ADA623249"},{"key":"10_CR18","doi-asserted-by":"crossref","unstructured":"Durand, T., Mordan, T., Thome, N., Cord, M.: Wildcat: weakly supervised learning of deep convnets for image classification, pointwise localization and segmentation. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.631"},{"key":"10_CR19","doi-asserted-by":"crossref","unstructured":"Escorcia, V., Heilbron, F.C., Niebles, J.C., Ghanem, B.: Daps: deep action proposals for action understanding. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46487-9_47"},{"key":"10_CR20","doi-asserted-by":"publisher","first-page":"70","DOI":"10.1007\/978-3-030-01216-8_5","volume-title":"Computer Vision \u2013 ECCV 2018","author":"Jiyang Gao","year":"2018","unstructured":"Gao, J., Chen, K., Nevatia, R.: Ctap: complementary temporal action proposal generation. In: ECCV (2018)"},{"key":"10_CR21","doi-asserted-by":"crossref","unstructured":"Gao, J., Yang, Z., Nevatia, R.: Cascaded boundary regression for temporal action detection. In: BMVC (2017)","DOI":"10.5244\/C.31.52"},{"key":"10_CR22","doi-asserted-by":"crossref","unstructured":"Gao, J., Yang, Z., Sun, C., Chen, K., Nevatia, R.: Turn tap: temporal unit regression network for temporal action proposals. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.392"},{"key":"10_CR23","doi-asserted-by":"crossref","unstructured":"Girshick, R.: Fast r-cnn. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.169"},{"key":"10_CR24","unstructured":"Gorban, A., Idrees, H., Jiang, Y.G., Zamir, A.R., Laptev, I., Shah, M., Sukthankar, R.: THUMOS challenge: action recognition with a large number of classes (2015). http:\/\/www.thumos.info\/"},{"key":"10_CR25","doi-asserted-by":"crossref","unstructured":"Gudi, A., van Rosmalen, N., Loog, M., van Gemert, J.: Object-extent pooling for weakly supervised single-shot localization. In: BMVC (2017)","DOI":"10.5244\/C.31.36"},{"key":"10_CR26","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Spatial pyramid pooling in deep convolutional networks for visual recognition. In: TPMAI (2015)","DOI":"10.1109\/TPAMI.2015.2389824"},{"key":"10_CR27","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"10_CR28","doi-asserted-by":"crossref","unstructured":"Heilbron, F.C., Escorcia, V., Ghanem, B., Niebles, J.C.: Activitynet: a large-scale video benchmark for human activity understanding. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"10_CR29","doi-asserted-by":"crossref","unstructured":"Heilbron, F.C., Barrios, W., Escorcia, V., Ghanem, B.: Scc: semantic context cascade for efficient action detection. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.338"},{"key":"10_CR30","doi-asserted-by":"crossref","unstructured":"Heilbron, F.C., Niebles, J.C., Ghanem, B.: Fast temporal activity proposals for efficient detection of human actions in untrimmed videos. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.211"},{"key":"10_CR31","doi-asserted-by":"crossref","unstructured":"Hong, S., Yeo, D., Kwak, S., Lee, H., Han, B.: Weakly supervised semantic segmentation using web-crawled videos. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.239"},{"key":"10_CR32","doi-asserted-by":"crossref","unstructured":"Huang, D.A., Fei-Fei, L., Niebles, J.C.: Connectionist temporal modeling for weakly supervised action labeling. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46493-0_9"},{"key":"10_CR33","doi-asserted-by":"crossref","unstructured":"Huang, G., Liu, Z., Van Der Maaten, L., Weinberger, K.Q.: Densely connected convolutional networks. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.243"},{"key":"10_CR34","unstructured":"Ioffe, S., Szegedy, C.: Batch normalization: accelerating deep network training by reducing internal covariate shift. In: ICML (2015)"},{"key":"10_CR35","doi-asserted-by":"crossref","unstructured":"Ji, S., Xu, W., Yang, M., Yu, K.: 3d convolutional neural networks for human action recognition. In: TPMAI (2013)","DOI":"10.1109\/TPAMI.2012.59"},{"key":"10_CR36","doi-asserted-by":"crossref","unstructured":"Jia, Y., et al.: Caffe: convolutional architecture for fast feature embedding. In: ACM MM (2014)","DOI":"10.1145\/2647868.2654889"},{"key":"10_CR37","unstructured":"Jiang, Y.G., Liu, J., Zamir, A.R., Toderici, G., Laptev, I., Shah, M., Sukthankar, R.: THUMOS challenge: action recognition with a large number of classes (2014). http:\/\/crcv.ucf.edu\/THUMOS14\/"},{"key":"10_CR38","doi-asserted-by":"crossref","unstructured":"Jie, Z., Wei, Y., Jin, X., Feng, J., Liu, W.: Deep self-taught learning for weakly supervised object localization. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.457"},{"key":"10_CR39","unstructured":"Kang, S.M., Wildes, R.P.: Review of action recognition and detection methods (2016). arXiv preprint arXiv:1610.06906"},{"key":"10_CR40","doi-asserted-by":"crossref","unstructured":"Kantorov, V., Oquab, M., Cho, M., Laptev, I.: Contextlocnet: context-aware deep network models for weakly supervised localization. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46454-1_22"},{"key":"10_CR41","unstructured":"Karaman, S., Seidenari, L., Bimbo, A.D.: Fast saliency based pooling of fisher encoded dense trajectories. In: ECCV THUMOS Workshop (2014)"},{"key":"10_CR42","doi-asserted-by":"crossref","unstructured":"Khoreva, A., Benenson, R., Hosang, J., Hein, M., Schiele, B.: Simple does it: weakly supervised instance and semantic segmentation. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.181"},{"key":"10_CR43","doi-asserted-by":"crossref","unstructured":"Kim, D., Yoo, D., Kweon, I.S., et al.: Two-phase learning for weakly supervised object localization. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.382"},{"key":"10_CR44","doi-asserted-by":"crossref","unstructured":"Lin, T., Zhao, X., Shou, Z.: Single shot temporal action detection. In: ACM MM (2017)","DOI":"10.1145\/3123266.3123343"},{"key":"10_CR45","doi-asserted-by":"crossref","unstructured":"Lindeberg, T.: Feature detection with automatic scale selection. In: IJCV (1998)","DOI":"10.1023\/A:1008045108935"},{"key":"10_CR46","doi-asserted-by":"crossref","unstructured":"Liu, W., et al.: Ssd: single shot multibox detector. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"10_CR47","doi-asserted-by":"crossref","unstructured":"Mettes, P., van Gemert, J.C., Snoek, C.G.: Spot on: action localization from pointly-supervised proposals. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46454-1_27"},{"key":"10_CR48","unstructured":"Oneata, D., Verbeek, J., Schmid, C.: The lear submission at thumos 2014. In: ECCV THUMOS Workshop (2014)"},{"key":"10_CR49","doi-asserted-by":"crossref","unstructured":"Papandreou, G., Chen, L.C., Murphy, K.P., Yuille, A.L.: Weakly-and semi-supervised learning of a deep convolutional network for semantic image segmentation. In: CVPR (2015)","DOI":"10.1109\/ICCV.2015.203"},{"issue":"6","key":"10_CR50","doi-asserted-by":"publisher","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"Ronald Poppe","year":"2010","unstructured":"Poppe, R.: A survey on vision-based human action recognition. In: Image and Vision Computing (2010)","journal-title":"Image and Vision Computing"},{"key":"10_CR51","doi-asserted-by":"crossref","unstructured":"Redmon, J., Divvala, S., Girshick, R., Farhadi, A.: You only look once: unified, real-time object detection. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.91"},{"key":"10_CR52","doi-asserted-by":"crossref","unstructured":"Redmon, J., Farhadi, A.: Yolo9000: better, faster, stronger. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.690"},{"key":"10_CR53","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster r-cnn: towards real-time object detection with region proposal networks. In: NIPS (2015)"},{"key":"10_CR54","doi-asserted-by":"crossref","unstructured":"Richard, A., Gall, J.: Temporal action detection using a statistical language model. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.341"},{"key":"10_CR55","doi-asserted-by":"crossref","unstructured":"Richard, A., Kuehne, H., Gall, J.: Weakly supervised action learning with rnn based fine-to-coarse modeling. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.140"},{"key":"10_CR56","doi-asserted-by":"crossref","unstructured":"Shen, Z., Li, J., Su, Z., Li, M., Chen, Y., Jiang, Y.G., Xue, X.: Weakly supervised dense video captioning. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.548"},{"key":"10_CR57","doi-asserted-by":"crossref","unstructured":"Shi, M., Caesar, H., Ferrari, V.: Weakly supervised object localization using things and stuff transfer. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.366"},{"key":"10_CR58","doi-asserted-by":"crossref","unstructured":"Shou, Z., Chan, J., Zareian, A., Miyazawa, K., Chang, S.F.: Cdc: convolutional-de-convolutional networks for precise temporal action localization in untrimmed videos. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.155"},{"key":"10_CR59","doi-asserted-by":"crossref","unstructured":"Shou, Z., Gao, H., Zhang, L., Miyazawa, K., Chang, S.F.: Autoloc: weakly-supervised temporal action localization (2018). arXiv preprint arXiv:1807.08333","DOI":"10.1007\/978-3-030-01270-0_10"},{"key":"10_CR60","doi-asserted-by":"crossref","unstructured":"Shou, Z., Wang, D., Chang, S.F.: Temporal action localization in untrimmed videos via multi-stage cnns. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.119"},{"key":"10_CR61","doi-asserted-by":"crossref","unstructured":"Sigurdsson, G.A., Divvala, S., Farhadi, A., Gupta, A.: Asynchronous temporal fields for action recognition. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.599"},{"key":"10_CR62","doi-asserted-by":"crossref","unstructured":"Sigurdsson, G.A., Russakovsky, O., Farhadi, A., Laptev, I., Gupta, A.: Much ado about time: exhaustive annotation of temporal data. In: HCOMP (2016)","DOI":"10.1609\/hcomp.v4i1.13290"},{"key":"10_CR63","doi-asserted-by":"crossref","unstructured":"Sigurdsson, G.A., Varol, G., Wang, X., Farhadi, A., Laptev, I., Gupta, A.: Hollywood in homes: crowdsourcing data collection for activity understanding. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46448-0_31"},{"key":"10_CR64","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: NIPS (2014)"},{"key":"10_CR65","doi-asserted-by":"crossref","unstructured":"Singh, K.K., Lee, Y.J.: Hide-and-seek: Forcing a network to be meticulous for weakly-supervised object and action localization. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.381"},{"key":"10_CR66","doi-asserted-by":"crossref","unstructured":"Sun, C., Paluri, M., Collobert, R., Nevatia, R., Bourdev, L.: Pronet: Learning to propose object-specific boxes for cascaded neural networks. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.379"},{"key":"10_CR67","doi-asserted-by":"crossref","unstructured":"Sun, C., Shetty, S., Sukthankar, R., Nevatia, R.: Temporal localization of fine-grained actions in videos by domain transfer from web images. In: ACM MM (2015)","DOI":"10.1145\/2733373.2806226"},{"key":"10_CR68","doi-asserted-by":"crossref","unstructured":"Tang, P., Wang, X., Bai, X., Liu, W.: Multiple instance detection network with online instance classifier refinement. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.326"},{"key":"10_CR69","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3d convolutional networks. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"10_CR70","unstructured":"Tran, D., Ray, J., Shou, Z., Chang, S.F., Paluri, M.: Convnet architecture search for spatiotemporal feature learning (2017). arXiv preprint arXiv:1708.05038"},{"key":"10_CR71","unstructured":"Wang, L., Qiao, Y., Tang, X.: Action recognition and detection by combining motion and appearance features. In: ECCV THUMOS Workshop (2014)"},{"key":"10_CR72","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., Gool, L.V.: Temporal segment networks: towards good practices for deep action recognition. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"10_CR73","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Lin, D., Van Gool, L.: Untrimmednets for weakly supervised action recognition and detection. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.678"},{"issue":"2","key":"10_CR74","doi-asserted-by":"publisher","first-page":"224","DOI":"10.1016\/j.cviu.2010.10.002","volume":"115","author":"Daniel Weinland","year":"2011","unstructured":"Weinland, D., Ronfard, R., Boyer, E.: A survey of vision-based methods for action representation, segmentation and recognition. In: Computer Vision and Image Understanding (2011)","journal-title":"Computer Vision and Image Understanding"},{"key":"10_CR75","doi-asserted-by":"crossref","unstructured":"Xu, H., Das, A., Saenko, K.: R-c3d: Region convolutional 3d network for temporal activity detection. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.617"},{"key":"10_CR76","doi-asserted-by":"crossref","unstructured":"Yeung, S., Russakovsky, O., Mori, G., Fei-Fei, L.: End-to-end learning of action detection from frame glimpses in videos. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.293"},{"key":"10_CR77","doi-asserted-by":"crossref","unstructured":"Yuan, J., Ni, B., Yang, X., Kassim, A.: Temporal action localization with pyramid of score distribution features. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.337"},{"key":"10_CR78","doi-asserted-by":"crossref","unstructured":"Yuan, Z., Stroud, J.C., Lu, T., Deng, J.: Temporal action localization by structured maximal sums. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.342"},{"key":"10_CR79","doi-asserted-by":"crossref","unstructured":"Zhang, H., Kyaw, Z., Yu, J., Chang, S.F.: Ppr-fcn: weakly supervised visual relation detection via parallel pairwise r-fcn. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.454"},{"key":"10_CR80","doi-asserted-by":"crossref","unstructured":"Zhang, J., Lin, Z., Brandt, J., Shen, X., Sclaroff, S.: Top-down neural attention by excitation backprop. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46493-0_33"},{"key":"10_CR81","unstructured":"Zhao, H., Yan, Z., Wang, H., Torresani, L., Torralba, A.: Slac: A sparsely labeled dataset for action classification and localization (2017). arXiv preprint arXiv:1712.09374"},{"key":"10_CR82","doi-asserted-by":"crossref","unstructured":"Zhao, Y., Xiong, Y., Wang, L., Wu, Z., Tang, X., Lin, D.: Temporal action detection with structured segment networks. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.317"},{"key":"10_CR83","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.319"},{"key":"10_CR84","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Zhou, Y., Ye, Q., Qiu, Q., Jiao, J.: Soft proposal networks for weakly supervised object localization. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.204"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01270-0_10","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T18:38:51Z","timestamp":1775241531000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01270-0_10"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012694","9783030012700"],"references-count":84,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01270-0_10","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"6 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}