{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,2]],"date-time":"2026-01-02T07:33:28Z","timestamp":1767339208584,"version":"3.37.3"},"reference-count":88,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2019,8,28]],"date-time":"2019-08-28T00:00:00Z","timestamp":1566950400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2019,8,28]],"date-time":"2019-08-28T00:00:00Z","timestamp":1566950400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2020,1]]},"DOI":"10.1007\/s11263-019-01211-2","type":"journal-article","created":{"date-parts":[[2019,8,28]],"date-time":"2019-08-28T06:02:36Z","timestamp":1566972156000},"page":"74-95","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":43,"title":["Temporal Action Detection with Structured Segment Networks"],"prefix":"10.1007","volume":"128","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2753-5921","authenticated-orcid":false,"given":"Yue","family":"Zhao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuanjun","family":"Xiong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Limin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhirong","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoou","family":"Tang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dahua","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,8,28]]},"reference":[{"key":"1211_CR1","doi-asserted-by":"crossref","unstructured":"Andriluka, M., Roth, S., & Schiele, B. (2009). Pictorial structures revisited: People detection and articulated pose estimation. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1014\u20131021). IEEE.","DOI":"10.1109\/CVPR.2009.5206754"},{"key":"1211_CR2","doi-asserted-by":"crossref","unstructured":"Buch, S., Escorcia, V., Ghanem, B., Fei-Fei, L., & Niebles, J. C. (2017a). End-to-end, single-stream temporal action detection in untrimmed videos. In The British machine vision conference (BMVC) (Vol.\u00a02, p. 7).","DOI":"10.5244\/C.31.93"},{"key":"1211_CR3","doi-asserted-by":"crossref","unstructured":"Buch, S., Escorcia, V., Shen, C., Ghanem, B., & Niebles, J. C. (2017b). SST: Single-stream temporal action proposals. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 6373\u20136382). IEEE.","DOI":"10.1109\/CVPR.2017.675"},{"key":"1211_CR4","unstructured":"Caba\u00a0Heilbron, F., Escorcia, V., Ghanem, B., & Niebles, J. C. (2015). Activitynet: A large-scale video benchmark for human activity understanding. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 961\u2013970)."},{"key":"1211_CR5","unstructured":"Caba\u00a0Heilbron, F., Niebles, J. C., & Ghanem, B. (2016). Fast temporal activity proposals for efficient detection of human actions in untrimmed videos. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1914\u20131923)."},{"key":"1211_CR6","doi-asserted-by":"crossref","unstructured":"Carreira, J., & Zisserman, A. (2017). Quo vadis, action recognition? A new model and the kinetics dataset. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 4724\u20134733). IEEE.","DOI":"10.1109\/CVPR.2017.502"},{"key":"1211_CR7","doi-asserted-by":"crossref","unstructured":"Chao, Y. W., Vijayanarasimhan, S., Seybold, B., Ross, D. A., Deng, J., & Sukthankar, R. (2018). Rethinking the faster R-CNN architecture for temporal action localization. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1130\u20131139).","DOI":"10.1109\/CVPR.2018.00124"},{"key":"1211_CR8","doi-asserted-by":"crossref","unstructured":"Dai, X., Singh, B., Zhang, G., Davis, L. S., & Chen, Y. Q. (2017). Temporal context network for activity localization in videos. In The IEEE international conference on computer vision (ICCV) (pp. 5727\u20135736).","DOI":"10.1109\/ICCV.2017.610"},{"key":"1211_CR9","doi-asserted-by":"crossref","unstructured":"De\u00a0Geest, R., Gavves, E., Ghodrati, A., Li, Z., Snoek, C., & Tuytelaars, T. (2016). Online action detection. In European conference on computer vision (ECCV) (pp. 269\u2013284). Springer.","DOI":"10.1007\/978-3-319-46454-1_17"},{"key":"1211_CR10","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L., Li, K., & Li, F. (2009). ImageNet: A large-scale hierarchical image database. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 248\u2013255).","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1211_CR11","doi-asserted-by":"crossref","unstructured":"Donahue, J., Anne\u00a0Hendricks, L., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., & Darrell, T. (2015). Long-term recurrent convolutional networks for visual recognition and description. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2625\u20132634).","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"1211_CR12","doi-asserted-by":"crossref","unstructured":"Escorcia, V., Caba\u00a0Heilbron, F., Niebles, J. C., & Ghanem, B. (2016). Daps: Deep action proposals for action understanding\u201d. In European conference on computer vision (ECCV) (pp. 768\u2013784).","DOI":"10.1007\/978-3-319-46487-9_47"},{"issue":"1","key":"1211_CR13","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1007\/s11263-014-0733-5","volume":"111","author":"M Everingham","year":"2015","unstructured":"Everingham, M., Eslami, S. A., Van Gool, L., Williams, C. K., Winn, J., & Zisserman, A. (2015). The pascal visual object classes challenge: A retrospective. International Journal of Computer Vision (IJCV), 111(1), 98\u2013136.","journal-title":"International Journal of Computer Vision (IJCV)"},{"issue":"9","key":"1211_CR14","doi-asserted-by":"publisher","first-page":"1627","DOI":"10.1109\/TPAMI.2009.167","volume":"32","author":"PF Felzenszwalb","year":"2010","unstructured":"Felzenszwalb, P. F., Girshick, R. B., McAllester, D., & Ramanan, D. (2010). Object detection with discriminatively trained part-based models. IEEE Transactions on Pattern Analysis and Machine Intelligence, 32(9), 1627\u20131645.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1211_CR15","doi-asserted-by":"crossref","unstructured":"Fernando, B., Gavves, E., Jo, M., Ghodrati, A., & Tuytelaars, T. (2015). Modeling video evolution for action recognition. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 5378\u20135387).","DOI":"10.1109\/CVPR.2015.7299176"},{"issue":"11","key":"1211_CR16","doi-asserted-by":"publisher","first-page":"2782","DOI":"10.1109\/TPAMI.2013.65","volume":"35","author":"A Gaidon","year":"2013","unstructured":"Gaidon, A., Harchaoui, Z., & Schmid, C. (2013). Temporal localization of actions with actoms. IEEE Transactions on Pattern Analysis and Machine Intelligence, 35(11), 2782\u20132795.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1211_CR17","doi-asserted-by":"crossref","unstructured":"Gao, J., Chen, K., & Nevatia, R. (2018). Ctap: Complementary temporal action proposal generation. In The European conference on computer vision (ECCV) (pp. 68\u201383).","DOI":"10.1007\/978-3-030-01216-8_5"},{"key":"1211_CR18","doi-asserted-by":"crossref","unstructured":"Gao, J., Yang, Z., & Nevatia, R. (2017). Cascaded boundary regression for temporal action detection. In The British machine vision conference (BMVC).","DOI":"10.5244\/C.31.52"},{"key":"1211_CR19","doi-asserted-by":"crossref","unstructured":"Girshick, R. (2015). Fast R-CNN. In The IEEE international conference on computer vision (ICCV) (pp. 1440\u20131448).","DOI":"10.1109\/ICCV.2015.169"},{"key":"1211_CR20","doi-asserted-by":"crossref","unstructured":"Girshick, R., Donahue, J., Darrell, T., & Malik, J. (2014). Rich feature hierarchies for accurate object detection and semantic segmentation. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 580\u2013587).","DOI":"10.1109\/CVPR.2014.81"},{"key":"1211_CR21","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., & Malik, J. (2015). Finding action tubes. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 759\u2013768).","DOI":"10.1109\/CVPR.2015.7298676"},{"key":"1211_CR22","doi-asserted-by":"crossref","unstructured":"Gu, C., Sun, C., Vijayanarasimhan, S., Pantofaru, C., Ross, D. A., Toderici, G., Li, Y., Ricco, S., Sukthankar, R., Schmid, C., et\u00a0al. (2018). AVA: A video dataset of spatio-temporally localized atomic visual actions. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00633"},{"key":"1211_CR23","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2014), Spatial pyramid pooling in deep convolutional networks for visual recognition. In European conference on computer vision (ECCV) (pp. 346\u2013361). Springer.","DOI":"10.1007\/978-3-319-10578-9_23"},{"key":"1211_CR24","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 770\u2013778).","DOI":"10.1109\/CVPR.2016.90"},{"key":"1211_CR25","doi-asserted-by":"crossref","unstructured":"Hoai, M., Lan, Z. Z., & De\u00a0la Torre, F. (2011). Joint segmentation and classification of human actions in video. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3265\u20133272). IEEE.","DOI":"10.1109\/CVPR.2011.5995470"},{"issue":"1","key":"1211_CR26","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/s11263-008-0137-5","volume":"80","author":"D Hoiem","year":"2008","unstructured":"Hoiem, D., Efros, A. A., & Hebert, M. (2008). Putting objects in perspective. International Journal of Computer Vision (IJCV), 80(1), 3\u201315.","journal-title":"International Journal of Computer Vision (IJCV)"},{"issue":"4","key":"1211_CR27","doi-asserted-by":"publisher","first-page":"814","DOI":"10.1109\/TPAMI.2015.2465908","volume":"38","author":"J Hosang","year":"2016","unstructured":"Hosang, J., Benenson, R., Doll\u00e1r, P., & Schiele, B. (2016). What makes for effective detection proposals? IEEE Transactions on Pattern Analysis and Machine Intelligence, 38(4), 814\u2013830.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1211_CR28","unstructured":"Ioffe, S., & Szegedy, C. (2015). Batch normalization: Accelerating deep network training by reducing internal covariate shift. In International conference on machine learning (ICML) (pp. 448\u2013456)."},{"key":"1211_CR29","doi-asserted-by":"crossref","unstructured":"Jain, M., van Gemert, J. C., J\u00e9gou, H., Bouthemy, P., & Snoek, C. G. M. (2014). Action localization by tubelets from motion. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2014.100"},{"key":"1211_CR30","unstructured":"Jiang, Y. G., Liu, J., Roshan\u00a0Zamir, A., Toderici, G., Laptev, I., Shah, M., & Sukthankar, R. (2014). THUMOS challenge: Action recognition with a large number of classes. Retrieved April 7, 2019 from \nhttp:\/\/crcv.ucf.edu\/THUMOS14\/\n\n."},{"key":"1211_CR31","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., & Fei-Fei, L. (2014). Large-scale video classification with convolutional neural networks. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1725\u20131732).","DOI":"10.1109\/CVPR.2014.223"},{"key":"1211_CR32","first-page":"282","volume":"1","author":"J Lafferty","year":"2001","unstructured":"Lafferty, J., McCallum, A., Pereira, F., et al. (2001). Conditional random fields: Probabilistic models for segmenting and labeling sequence data. International Conference on Machine Learning (ICML), 1, 282\u2013289.","journal-title":"International Conference on Machine Learning (ICML)"},{"issue":"2\u20133","key":"1211_CR33","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev, I. (2005). On space-time interest points. International Journal of Computer Vision (IJCV), 64(2\u20133), 107\u2013123.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"1211_CR34","doi-asserted-by":"crossref","unstructured":"Lazebnik, S., Schmid, C., & Ponce, J. (2006). Beyond bags of features: Spatial pyramid matching for recognizing natural scene categories. In The IEEE conference on computer vision and pattern recognition (CVPR) (Vol. 2, pp. 2169\u20132178). IEEE.","DOI":"10.1109\/CVPR.2006.68"},{"key":"1211_CR35","doi-asserted-by":"crossref","unstructured":"Li, X., & Loy, C. C. (2018). Video object segmentation with joint re-identification and attention-aware mask propagation. In The European conference on computer vision (ECCV) (pp. 90\u2013105).","DOI":"10.1007\/978-3-030-01219-9_6"},{"key":"1211_CR36","unstructured":"Li, Y., He, K., Sun, J., et\u00a0al. (2016). R-FCN: Object detection via region-based fully convolutional networks. In Neural information processing systems (NIPS) (pp. 379\u2013387)."},{"key":"1211_CR37","doi-asserted-by":"crossref","unstructured":"Lin, T., Zhao, X., & Shou, Z. (2017). Single shot temporal action detection. In Proceedings of the 25th ACM international conference on Multimedia (pp. 988\u2013996). ACM.","DOI":"10.1145\/3123266.3123343"},{"key":"1211_CR38","doi-asserted-by":"crossref","unstructured":"Lin, T., Zhao, X., Su, H., Wang, C., & Yang, M. (2018). BSN: Boundary sensitive network for temporal action proposal generation. In The European conference on computer vision (ECCV) (pp. 3\u201319).","DOI":"10.1007\/978-3-030-01225-0_1"},{"key":"1211_CR39","doi-asserted-by":"crossref","unstructured":"Liu, W., Anguelov, D., Erhan, D., Szegedy, C., Reed, S., Fu, C. Y., & Berg, A. C. (2016). SSD: Single shot multibox detector. In European conference on computer vision (ECCV) (pp. 21\u201337). Springer.","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"1211_CR40","doi-asserted-by":"crossref","unstructured":"Mettes, P., van Gemert, J. C., & Snoek, C. G. (2016). Spot on: Action localization from pointly-supervised proposals. In European conference on computer vision (ECCV) (pp. 437\u2013453). Springer.","DOI":"10.1007\/978-3-319-46454-1_27"},{"key":"1211_CR41","doi-asserted-by":"crossref","unstructured":"Mettes, P., van Gemert, J. C., Cappallo, S., Mensink, T., & Snoek, C. G. (2015). Bag-of-fragments: Selecting and encoding video fragments for event detection and recounting. In ACM international conference on multimedia retrieval (ICMR) (pp. 427\u2013434).","DOI":"10.1145\/2671188.2749404"},{"key":"1211_CR42","unstructured":"Montes, A., Salvador, A., Pascual, S., & Giro-i Nieto, X. (2016). Temporal activity detection in untrimmed videos with recurrent neural networks. In NIPS workshop on large scale computer vision systems."},{"key":"1211_CR43","unstructured":"Ng, J. Y. H., Hausknecht, M., Vijayanarasimhan, S., Vinyals, O., Monga, R., & Toderici, G. (2015). Beyond short snippets: Deep networks for video classification. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 4694\u20134702)."},{"key":"1211_CR44","doi-asserted-by":"crossref","unstructured":"Nguyen, P., Liu, T., Prasad, G., & Han, B. (2018) Weakly supervised action localization by sparse temporal pooling network. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 6752\u20136761).","DOI":"10.1109\/CVPR.2018.00706"},{"key":"1211_CR45","doi-asserted-by":"crossref","unstructured":"Niebles, J. C., Chen, C. W., & Fei-Fei, L. (2010). Modeling temporal structure of decomposable motion segments for activity classification. In European conference on computer vision (ECCV) (pp. 392\u2013405). Springer.","DOI":"10.1007\/978-3-642-15552-9_29"},{"key":"1211_CR46","doi-asserted-by":"crossref","unstructured":"Oneata, D., Verbeek, J., & Schmid, C. (2013). Action and event recognition with fisher vectors on a compact feature set. In The IEEE international conference on computer vision (ICCV) (pp. 1817\u20131824).","DOI":"10.1109\/ICCV.2013.228"},{"key":"1211_CR47","unstructured":"Oneata, D., Verbeek, J., & Schmid, C. (2014). The lear submission at thumos 2014. In THUMOS action recognition challenge."},{"key":"1211_CR48","first-page":"2825","volume":"12","author":"F Pedregosa","year":"2011","unstructured":"Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., et al. (2011). Scikit-learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825\u20132830.","journal-title":"Journal of Machine Learning Research"},{"key":"1211_CR49","doi-asserted-by":"crossref","unstructured":"Peng, X., & Schmid, C. (2016). Multi-region two-stream R-CNN for action detection. In European conference on computer vision (ECCV). Springer.","DOI":"10.1007\/978-3-319-46493-0_45"},{"key":"1211_CR50","doi-asserted-by":"crossref","unstructured":"Pirsiavash, H., & Ramanan, D. (2014). Parsing videos of actions with segmental grammars. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 612\u2013619).","DOI":"10.1109\/CVPR.2014.85"},{"issue":"1","key":"1211_CR51","doi-asserted-by":"publisher","first-page":"128","DOI":"10.1109\/TPAMI.2016.2537320","volume":"39","author":"J Pont-Tuset","year":"2017","unstructured":"Pont-Tuset, J., Arbelaez, P., Barron, J. T., Marques, F., & Malik, J. (2017). Multiscale combinatorial grouping for image segmentation and object proposal generation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 39(1), 128\u2013140.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1211_CR52","unstructured":"Ren, S., He, K., Girshick, R., & Sun, J. (2015). Faster R-CNN: Towards real-time object detection with region proposal networks. In Neural information processing systems (NIPS) (pp. 91\u201399)."},{"key":"1211_CR53","doi-asserted-by":"crossref","unstructured":"Richard, A., & Gall, J. (2016). Temporal action detection using a statistical language model. In The IEEE conference on computer vision and pattern recognition (CVPR)( pp. 3131\u20133140).","DOI":"10.1109\/CVPR.2016.341"},{"issue":"1,2","key":"1211_CR54","doi-asserted-by":"publisher","first-page":"187","DOI":"10.3233\/FI-2000-411207","volume":"41","author":"JB Roerdink","year":"2000","unstructured":"Roerdink, J. B., & Meijster, A. (2000). The watershed transform: Definitions, algorithms and parallelization strategies. Fundamenta Informaticae, 41(1,2), 187\u2013228.","journal-title":"Fundamenta Informaticae"},{"key":"1211_CR55","unstructured":"Schindler, K., & Van\u00a0Gool, L. (2008). Action snippets: How many frames does human action recognition require? In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1\u20138). IEEE."},{"key":"1211_CR56","doi-asserted-by":"crossref","unstructured":"Shou, Z., Chan, J., Zareian, A., Miyazawa, K., & Chang, S. F. (2017). CDC: convolutional-de-convolutional networks for precise temporal action localization in untrimmed videos. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1417\u20131426).","DOI":"10.1109\/CVPR.2017.155"},{"key":"1211_CR57","doi-asserted-by":"crossref","unstructured":"Shou, Z., Gao, H., Zhang, L., Miyazawa, K., & Chang, S. F. (2018). AutoLoc: Weakly-supervised temporal action localization in untrimmed videos. In European conference on computer vision (ECCV) (pp. 154\u2013171).","DOI":"10.1007\/978-3-030-01270-0_10"},{"key":"1211_CR58","doi-asserted-by":"crossref","unstructured":"Shou, Z., Wang, D., & Chang, S. F. (2016). Temporal action localization in untrimmed videos via multi-stage CNNs. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1049\u20131058).","DOI":"10.1109\/CVPR.2016.119"},{"key":"1211_CR59","doi-asserted-by":"crossref","unstructured":"Shrivastava, A., Gupta, A., & Girshick, R. (2016). Training region-based object detectors with online hard example mining. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 761\u2013769).","DOI":"10.1109\/CVPR.2016.89"},{"key":"1211_CR60","unstructured":"Simonyan, K., & Zisserman, A. (2014). Two-stream convolutional networks for action recognition in videos. In Neural information processing systems (NIPS) (pp. 568\u2013576)."},{"key":"1211_CR61","unstructured":"Singh, G., & Cuzzolin, F. (2016). Untrimmed video classification for activity detection: Submission to activitynet challenge. CoRR abs\/1607.01979"},{"key":"1211_CR62","doi-asserted-by":"crossref","unstructured":"Singh, B., Marks, T. K., Jones, M., Tuzel, O., & Shao, M. (2016). A multi-stream bi-directional recurrent neural network for fine-grained action detection. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1961\u20131970).","DOI":"10.1109\/CVPR.2016.216"},{"key":"1211_CR63","unstructured":"Soomro, K., Zamir, A. R., & Shah, M. (2012) UCF101: A dataset of 101 human actions classes from videos in the wild. \narXiv:1212.0402"},{"key":"1211_CR64","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Vanhoucke, V., Ioffe, S., Shlens, J., & Wojna, Z. (2016). Rethinking the inception architecture for computer vision. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2818\u20132826).","DOI":"10.1109\/CVPR.2016.308"},{"key":"1211_CR65","doi-asserted-by":"crossref","unstructured":"Tang, K., Yao, B., Fei-Fei, L., & Koller, D. (2013). Combining the right features for complex event recognition. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2696\u20132703).","DOI":"10.1109\/ICCV.2013.335"},{"key":"1211_CR66","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L. D., Fergus, R., Torresani, L., & Paluri, M. (2015). Learning spatiotemporal features with 3D convolutional networks. In The IEEE international conference on computer vision (ICCV) (pp. 4489\u20134497).","DOI":"10.1109\/ICCV.2015.510"},{"key":"1211_CR67","doi-asserted-by":"crossref","unstructured":"Van\u00a0de Sande, K. E., Uijlings, J. R., Gevers, T., & Smeulders, A. W. (2011). Segmentation as selective search for object recognition. In The IEEE international conference on computer vision (ICCV) (pp. 1879\u20131886).","DOI":"10.1109\/ICCV.2011.6126456"},{"key":"1211_CR68","unstructured":"Van\u00a0Gemert, J. C., Jain, M., Gati, E., Snoek, C. G., et\u00a0al. (2015). APT: Action localization proposals from dense trajectories. In The British machine vision conference (BMVC) (Vol. 2, p. 4)."},{"key":"1211_CR69","doi-asserted-by":"crossref","unstructured":"Wang, H., & Schmid, C. (2013). Action recognition with improved trajectories. In The IEEE international conference on computer vision (ICCV) (pp. 3551\u20133558).","DOI":"10.1109\/ICCV.2013.441"},{"key":"1211_CR70","unstructured":"Wang, R., & Tao, D. (2016). UTS at activitynet 2016. In AcitivityNet large scale activity recognition challenge 2016."},{"key":"1211_CR71","unstructured":"Wang, L., Qiao, Y., & Tang, X. (2014a). Action recognition and detection by combining motion and appearance features. In THUMOS action recognition challenge."},{"issue":"2","key":"1211_CR72","doi-asserted-by":"publisher","first-page":"810","DOI":"10.1109\/TIP.2013.2295753","volume":"23","author":"L Wang","year":"2014","unstructured":"Wang, L., Qiao, Y., & Tang, X. (2014b). Latent hierarchical model of temporal structure for complex activity classification. IEEE Transactions on Image Processing, 23(2), 810\u2013822.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1211_CR73","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., & Tang, X. (2015). Action recognition with trajectory-pooled deep-convolutional descriptors. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 4305\u20134314).","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"1211_CR74","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., Tang, X., & Van\u00a0Gool, L. (2016a). Actionness estimation using hybrid fully convolutional networks. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2708\u20132717).","DOI":"10.1109\/CVPR.2016.296"},{"key":"1211_CR75","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Lin, D., & Van\u00a0Gool, L. (2017). Untrimmednets for weakly supervised action recognition and detection. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.678"},{"key":"1211_CR76","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., & Van\u00a0Gool, L. (2016b). Temporal segment networks: Towards good practices for deep action recognition. In European conference on computer vision (ECCV) (pp. 20\u201336).","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"1211_CR77","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., et al. (2018). Temporal segment networks for action recognition in videos. IEEE Transactions on Pattern Analysis and Machine Intelligence."},{"key":"1211_CR78","doi-asserted-by":"publisher","first-page":"2613","DOI":"10.1109\/TCSVT.2016.2576761","volume":"27","author":"P Wang","year":"2016","unstructured":"Wang, P., Cao, Y., Shen, C., Liu, L., & Shen, H. T. (2016c). Temporal pyramid pooling based convolutional neural network for action recognition. IEEE Transactions on Circuits and Systems for Video Technology, 27, 2613\u20132622.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"1211_CR79","doi-asserted-by":"crossref","unstructured":"Weinzaepfel, P., Harchaoui, Z., & Schmid, C. (2015). Learning to track for spatio-temporal action localization. In The IEEE international conference on computer vision (ICCV) (pp. 3164\u20133172).","DOI":"10.1109\/ICCV.2015.362"},{"key":"1211_CR80","doi-asserted-by":"crossref","unstructured":"Xu, H., Das, A., & Saenko, K. (2017). R-C3D: Region convolutional 3D network for temporal activity detection. In The IEEE international conference on computer vision (ICCV) (Vol. 6, p. 8).","DOI":"10.1109\/ICCV.2017.617"},{"key":"1211_CR81","doi-asserted-by":"crossref","unstructured":"Yeung, S., Russakovsky, O., Mori, G., & Fei-Fei, L. (2016). End-to-end learning of action detection from frame glimpses in videos. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2678\u20132687).","DOI":"10.1109\/CVPR.2016.293"},{"key":"1211_CR82","doi-asserted-by":"crossref","unstructured":"Yuan, J., Ni, B., Yang, X., & Kassim, A. A. (2016). Temporal action localization with pyramid of score distribution features. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3093\u20133102).","DOI":"10.1109\/CVPR.2016.337"},{"key":"1211_CR83","doi-asserted-by":"crossref","unstructured":"Zach, C., Pock, T., & Bischof, H. (2007). A duality based approach for realtime tv-$$L^1$$ optical flow. In 29th DAGM symposium on pattern recognition (pp. 214\u2013223).","DOI":"10.1007\/978-3-540-74936-3_22"},{"key":"1211_CR84","unstructured":"Zhang, D., Dai, X., Wang, X., & Wang, Y. F. (2018). $$\\rm S^3D$$: Single shot multi-span detector via fully 3d convolutional network. In The British machine vision conference (BMVC)."},{"key":"1211_CR85","doi-asserted-by":"crossref","unstructured":"Zhang, B., Wang, L., Wang, Z., Qiao, Y., & Wang, H. (2016). Real-time action recognition with enhanced motion vector CNNs. In The IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2718\u20132726).","DOI":"10.1109\/CVPR.2016.297"},{"key":"1211_CR86","first-page":"2914","volume":"8","author":"Y Zhao","year":"2017","unstructured":"Zhao, Y., Xiong, Y., Wang, L., Wu, Z., Tang, X., & Lin, D. (2017a). Temporal action detection with structured segment networks. The IEEE International Conference on Computer Vision (ICCV), 8, 2914\u20132923.","journal-title":"The IEEE International Conference on Computer Vision (ICCV)"},{"key":"1211_CR87","unstructured":"Zhao, Y., Zhang, B., Wu, Z., Yang, S., Zhou, L., Yan, S., Wang, L., Xiong, Y., Lin, D., & Qiao, Y. (2017b). CUHK & ETHZ & SIAT submission to Activitynet Challenge 2017. \narXiv:1710.08011"},{"key":"1211_CR88","doi-asserted-by":"crossref","unstructured":"Zitnick, C. L., & Doll\u00e1r, P. (2014). Edge boxes: Locating object proposals from edges. In European conference on computer vision (ECCV) (pp. 391\u2013405).","DOI":"10.1007\/978-3-319-10602-1_26"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01211-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-019-01211-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01211-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,26]],"date-time":"2020-08-26T23:32:59Z","timestamp":1598484779000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-019-01211-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,8,28]]},"references-count":88,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2020,1]]}},"alternative-id":["1211"],"URL":"https:\/\/doi.org\/10.1007\/s11263-019-01211-2","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"type":"print","value":"0920-5691"},{"type":"electronic","value":"1573-1405"}],"subject":[],"published":{"date-parts":[[2019,8,28]]},"assertion":[{"value":"7 April 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 August 2019","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 August 2019","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}