{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T23:29:20Z","timestamp":1783034960756,"version":"3.54.6"},"reference-count":91,"publisher":"Springer Science and Business Media LLC","issue":"8","license":[{"start":{"date-parts":[[2021,5,31]],"date-time":"2021-05-31T00:00:00Z","timestamp":1622419200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,5,31]],"date-time":"2021-05-31T00:00:00Z","timestamp":1622419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2021,8]]},"DOI":"10.1007\/s11263-021-01473-9","type":"journal-article","created":{"date-parts":[[2021,5,31]],"date-time":"2021-05-31T08:02:46Z","timestamp":1622448166000},"page":"2474-2498","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":37,"title":["SODA: Weakly Supervised Temporal Action Localization Based on Astute Background Response and Self-Distillation Learning"],"prefix":"10.1007","volume":"129","author":[{"given":"Tao","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junwei","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Le","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Binglu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8369-8886","authenticated-orcid":false,"given":"Dingwen","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,5,31]]},"reference":[{"key":"1473_CR1","doi-asserted-by":"crossref","unstructured":"Bearman, A., Russakovsky, O., Ferrari, V., & Fei-Fei, L. (2016). What\u2019s the point: Semantic segmentation with point supervision. In European conference on computer vision, (pp. 549\u2013565). Springer","DOI":"10.1007\/978-3-319-46478-7_34"},{"key":"1473_CR2","doi-asserted-by":"crossref","unstructured":"Bucilu\u01ce, C., Caruana, R., & Niculescu-Mizil, A. (2006). Model compression. In Proceedings of the 12th ACM SIGKDD international conference on Knowledge discovery and data mining, (pp. 535\u2013541).","DOI":"10.1145\/1150402.1150464"},{"key":"1473_CR3","doi-asserted-by":"crossref","unstructured":"Carreira, J., & Zisserman, A. (2017). Quo vadis, action recognition? a new model and the kinetics dataset. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 6299\u20136308).","DOI":"10.1109\/CVPR.2017.502"},{"key":"1473_CR4","doi-asserted-by":"crossref","unstructured":"Chan, L., Hosseini, M. S., & Plataniotis, KN. (2020). A comprehensive analysis of weakly-supervised semantic segmentation in different image domains. International Journal of Computer Vision, 129(2), 1\u201324","DOI":"10.1007\/s11263-020-01373-4"},{"key":"1473_CR5","doi-asserted-by":"crossref","unstructured":"Chao, Y. W., Vijayanarasimhan, S., Seybold, B., Ross, D. A., Deng, J., & Sukthankar, R. (2018). Rethinking the faster r-cnn architecture for temporal action localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 1130\u20131139).","DOI":"10.1109\/CVPR.2018.00124"},{"key":"1473_CR6","doi-asserted-by":"crossref","unstructured":"Choe, J., & Shim, H. (2019). Attention-based dropout layer for weakly supervised object localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 2219\u20132228).","DOI":"10.1109\/CVPR.2019.00232"},{"key":"1473_CR7","doi-asserted-by":"crossref","unstructured":"Choe, J., Oh, S. J., Lee, S., Chun, S., Akata, Z., & Shim, H. (2020). Evaluating weakly supervised object localization methods right. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 3133\u20133142).","DOI":"10.1109\/CVPR42600.2020.00320"},{"key":"1473_CR8","unstructured":"Crowley, E. J., Gray, G., & Storkey, A. J. (2018). Moonshine: Distilling with cheap convolutions. In NeurIPS, (pp. 2893\u20132903)."},{"key":"1473_CR9","doi-asserted-by":"crossref","unstructured":"Caba\u00a0Heilbron, F., Victor\u00a0Escorcia, B. G., & Niebles, J. C. (2015). Activitynet: A large-scale video benchmark for human activity understanding. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 961\u2013970).","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"1473_CR10","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Malik, J., & He, K. (2019). Slowfast networks for video recognition. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 6202\u20136211).","DOI":"10.1109\/ICCV.2019.00630"},{"key":"1473_CR11","doi-asserted-by":"crossref","unstructured":"Gao, J., Chen, K., & Nevatia, R. (2018a). Ctap: Complementary temporal action proposal generation. In European conference on computer vision, (pp. 70\u201385). Springer","DOI":"10.1007\/978-3-030-01216-8_5"},{"issue":"12","key":"1473_CR12","doi-asserted-by":"publisher","first-page":"3086","DOI":"10.1109\/TPAMI.2018.2866114","volume":"41","author":"Z Gao","year":"2018","unstructured":"Gao, Z., Wang, L., Jojic, N., Niu, Z., Zheng, N., & Hua, G. (2018b). Video imprint. IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(12), 3086\u20133099.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"6","key":"1473_CR13","doi-asserted-by":"publisher","first-page":"1452","DOI":"10.1109\/TNNLS.2016.2514360","volume":"28","author":"C Gong","year":"2017","unstructured":"Gong, C., Tao, D., Liu, W., Liu, L., & Yang, J. (2017). Label propagation via teaching-to-learn and learning-to-teach. IEEE Transactions on Neural Networks and Learning Systems, 28(6), 1452\u20131465.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"1473_CR14","doi-asserted-by":"crossref","unstructured":"Gong, C., Chang, X., Fang, M., & Yang, J. (2018). Teaching semi-supervised classifier via generalized distillation. In IJCAI, (pp 2156\u20132162).","DOI":"10.24963\/ijcai.2018\/298"},{"key":"1473_CR15","doi-asserted-by":"crossref","unstructured":"Gong, C., Yang, J., You, J. J., & Sugiyama, M. (2020a). Centroid estimation with guaranteed efficiency: A general framework for weakly supervised learning. IEEE Transactions on Pattern Analysis and Machine Intelligence. https:\/\/doi.org\/10.1109\/TPAMI.2020.3044997","DOI":"10.1109\/TPAMI.2020.3044997"},{"key":"1473_CR16","doi-asserted-by":"crossref","unstructured":"Gong, G., Wang, X., Mu, Y., & Tian, Q. (2020b). Learning temporal co-attention models for unsupervised video action localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 9819\u20139828).","DOI":"10.1109\/CVPR42600.2020.00984"},{"key":"1473_CR17","doi-asserted-by":"crossref","unstructured":"Han, J., Yang, L., Zhang, D., Chang, X., & Liang, X. (2018a). Reinforcement cutting-agent learning for video object segmentation. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, (pp. 9080\u20139089).","DOI":"10.1109\/CVPR.2018.00946"},{"issue":"1","key":"1473_CR18","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1109\/MSP.2017.2749125","volume":"35","author":"J Han","year":"2018","unstructured":"Han, J., Zhang, D., Cheng, G., Liu, N., & Xu, D. (2018b). Advanced deep-learning techniques for salient and category-specific object detection: a survey. IEEE Signal Processing Magazine, 35(1), 84\u2013100.","journal-title":"IEEE Signal Processing Magazine"},{"issue":"9","key":"1473_CR19","doi-asserted-by":"publisher","first-page":"1027","DOI":"10.1007\/s11263-018-1077-3","volume":"126","author":"H Hattori","year":"2018","unstructured":"Hattori, H., Lee, N., Boddeti, V. N., Beainy, F., Kitani, K. M., & Kanade, T. (2018). Synthesizing a scene-specific pedestrian detector and pose estimator for static video surveillance. International Journal of Computer Vision, 126(9), 1027\u20131044.","journal-title":"International Journal of Computer Vision"},{"key":"1473_CR20","unstructured":"Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531"},{"key":"1473_CR21","doi-asserted-by":"crossref","unstructured":"Hoeffding, W. (1994). Probability inequalities for sums of bounded random variables. In The Collected Works of Wassily Hoeffding, (pp. 409\u2013426). Springer","DOI":"10.1007\/978-1-4612-0865-5_26"},{"key":"1473_CR22","doi-asserted-by":"crossref","unstructured":"Hou, Y., Ma, Z., Liu, C., & Loy, C. C. (2019). Learning lightweight lane detection cnns by self attention distillation. In Proceedings of the IEEE\/CVF international conference on computer vision, (pp. 1013\u20131021).","DOI":"10.1109\/ICCV.2019.00110"},{"key":"1473_CR23","doi-asserted-by":"crossref","unstructured":"Jain, M., Ghodrati, A., & Snoek, C. G. (2020). Actionbytes: Learning from trimmed videos to localize actions. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 1171\u20131180).","DOI":"10.1109\/CVPR42600.2020.00125"},{"key":"1473_CR24","unstructured":"Jiang, Y. G., Liu, J., Roshan\u00a0Zamir, A., Toderici, G., Laptev, I., Shah, M., & Sukthankar, R. (2014). THUMOS challenge: Action recognition with a large number of classes. http:\/\/crcv.ucf.edu\/THUMOS14\/"},{"key":"1473_CR25","unstructured":"Kingma, D. P., & Ba, J. (2015). Adam: A method for stochastic optimization. In International conference on learning representations (ICLR)."},{"key":"1473_CR26","unstructured":"Kipf, T. N., & Welling, M. (2016). Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907"},{"key":"1473_CR27","doi-asserted-by":"crossref","unstructured":"Lee, P., Uh, Y., & Byun, H. (2020). Background suppression network for weakly-supervised temporal action localization. In Proceedings of the AAAI conference on artificial intelligence.","DOI":"10.1609\/aaai.v34i07.6793"},{"key":"1473_CR28","doi-asserted-by":"crossref","unstructured":"Lin, T., Zhao, X., Su, H., Wang, C., & Yang, M. (2018). Bsn: Boundary sensitive network for temporal action proposal generation. In European conference on computer vision, (pp. 3\u201321). Springer","DOI":"10.1007\/978-3-030-01225-0_1"},{"key":"1473_CR29","doi-asserted-by":"crossref","unstructured":"Lin, T., Liu, X., Li, X., Ding, E., & Wen, S. (2019). Bmn: Boundary-matching network for temporal action proposal generation. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 3889\u20133898).","DOI":"10.1109\/ICCV.2019.00399"},{"key":"1473_CR30","doi-asserted-by":"crossref","unstructured":"Liu, D., Jiang, T., & Wang, Y. (2019a). Completeness modeling and context separation for weakly supervised temporal action localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 1298\u20131307).","DOI":"10.1109\/CVPR.2019.00139"},{"issue":"2","key":"1473_CR31","doi-asserted-by":"publisher","first-page":"261","DOI":"10.1007\/s11263-019-01247-4","volume":"128","author":"L Liu","year":"2020","unstructured":"Liu, L., Ouyang, W., Wang, X., Fieguth, P., Chen, J., Liu, X., et al. (2020). Deep learning for generic object detection: A survey. International journal of computer vision, 128(2), 261\u2013318.","journal-title":"International journal of computer vision"},{"key":"1473_CR32","doi-asserted-by":"crossref","unstructured":"Liu, Z., Wang, L., Zhang, Q., Gao, Z., Niu, Z., Zheng, N., & Hua, G. (2019b). Weakly supervised temporal action localization through contrast based evaluation networks. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 3899\u20133908).","DOI":"10.1109\/ICCV.2019.00400"},{"key":"1473_CR33","doi-asserted-by":"crossref","unstructured":"Long, F., Yao, T., Qiu, Z., Tian, X., Luo, J., & Mei, T. (2019). Gaussian temporal awareness networks for action localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 344\u2013353).","DOI":"10.1109\/CVPR.2019.00043"},{"issue":"8","key":"1473_CR34","doi-asserted-by":"publisher","first-page":"993","DOI":"10.1007\/s11263-018-1129-8","volume":"127","author":"C Lu","year":"2019","unstructured":"Lu, C., Shi, J., Wang, W., & Jia, J. (2019). Fast abnormal event detection. International Journal of Computer Vision, 127(8), 993\u20131011.","journal-title":"International Journal of Computer Vision"},{"key":"1473_CR35","doi-asserted-by":"crossref","unstructured":"Lu, X., Wang, W., Shen, J., Tai, Y. W., Crandall, D. J., & Hoi, S. C. (2020). Learning video object segmentation from unlabeled videos. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, (pp. 8960\u20138970).","DOI":"10.1109\/CVPR42600.2020.00898"},{"key":"1473_CR36","doi-asserted-by":"crossref","unstructured":"Luo, Z., Guillory, D., Shi, B., Ke, W., Wan, F., Darrell, T., & Xu, H. (2020). Weakly-supervised action localization with expectation-maximization multi-instance learning. In European conference on computer vision.","DOI":"10.1007\/978-3-030-58526-6_43"},{"key":"1473_CR37","doi-asserted-by":"crossref","unstructured":"Ma, F., Zhu, L., Yang, Y., Zha, S., Kundu, G., Feiszli, M., & Shou, Z. (2020). Sf-net: Single-frame supervision for temporal action localization. In European conference on computer vision.","DOI":"10.1007\/978-3-030-58548-8_25"},{"key":"1473_CR38","doi-asserted-by":"crossref","unstructured":"Mettes, P., Van\u00a0Gemert, J. C., & Snoek, C. G. (2016). Spot on: Action localization from pointly-supervised proposals. In European conference on computer vision, (pp. 437\u2013453). Springer","DOI":"10.1007\/978-3-319-46454-1_27"},{"key":"1473_CR39","doi-asserted-by":"crossref","unstructured":"Min, K., & Corso, J. J. (2020). Adversarial background-aware loss for weakly-supervised temporal activity localization. In European conference on computer vision, (pp. 283\u2013299). Springer","DOI":"10.1007\/978-3-030-58568-6_17"},{"key":"1473_CR40","doi-asserted-by":"crossref","unstructured":"Narayan, S., Cholakkal, H., Khan, F. S., & Shao, L. (2019). 3c-net: Category count and center loss for weakly-supervised action localization. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 8679\u20138687).","DOI":"10.1109\/ICCV.2019.00877"},{"key":"1473_CR41","doi-asserted-by":"crossref","unstructured":"Nguyen, P., Liu, T., Prasad, G., & Han, B. (2018). Weakly supervised action localization by sparse temporal pooling network. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 6752\u20136761).","DOI":"10.1109\/CVPR.2018.00706"},{"key":"1473_CR42","doi-asserted-by":"crossref","unstructured":"Nguyen, P. X., Ramanan, D., & Fowlkes, C. C. (2019). Weakly-supervised action localization with background modeling. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 5502\u20135511).","DOI":"10.1109\/ICCV.2019.00560"},{"key":"1473_CR43","doi-asserted-by":"crossref","unstructured":"Pang, Y., Zhao, X., Zhang, L., & Lu, H. (2020). Multi-scale interactive network for salient object detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 9413\u20139422).","DOI":"10.1109\/CVPR42600.2020.00943"},{"key":"1473_CR44","unstructured":"Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., & Antiga, L., et\u00a0al. (2019). Pytorch: An imperative style, high-performance deep learning library. In Advances in neural information processing systems (NeurIPS), (pp. 8024\u20138035)."},{"key":"1473_CR45","doi-asserted-by":"crossref","unstructured":"Paul, S., Roy, S., & Roy-Chowdhury, A. K. (2018). W-talc: Weakly-supervised temporal activity localization and classification. In European conference on computer vision, (pp. 588\u2013607). Springer","DOI":"10.1007\/978-3-030-01225-0_35"},{"key":"1473_CR46","doi-asserted-by":"crossref","unstructured":"Qiu, Z., Yao, T., & Mei, T. (2017). Learning spatio-temporal representation with pseudo-3d residual networks. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 5533\u20135541).","DOI":"10.1109\/ICCV.2017.590"},{"key":"1473_CR47","doi-asserted-by":"crossref","unstructured":"Ramanathan, V., Wang, R., & Mahajan, D. (2020). Dlwl: Improving detection for lowshot classes with weakly labelled data. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, (pp. 9342\u20139352).","DOI":"10.1109\/CVPR42600.2020.00936"},{"key":"1473_CR48","unstructured":"Ren, S., He, K., Girshick, R., & Sun, J. (2015). Faster r-cnn: Towards real-time object detection with region proposal networks. In Advances in neural information processing systems (NeurIPS), (pp. 91\u201399)."},{"key":"1473_CR49","doi-asserted-by":"crossref","unstructured":"Shi, B., Dai, Q., Mu, Y., & Wang, J. (2020). Weakly-supervised action localization by generative attention modeling. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 1009\u20131019).","DOI":"10.1109\/CVPR42600.2020.00109"},{"key":"1473_CR50","doi-asserted-by":"crossref","unstructured":"Shou, Z., Wang, D., & Chang, S. F. (2016). Temporal action localization in untrimmed videos via multi-stage cnns. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 1049\u20131058).","DOI":"10.1109\/CVPR.2016.119"},{"key":"1473_CR51","doi-asserted-by":"crossref","unstructured":"Shou, Z., Gao, H., Zhang, L., Miyazawa, K., & Chang, SF. (2018). Autoloc: Weakly-supervised temporal action localization in untrimmed videos. In European conference on computer vision, (pp. 162\u2013179). Springer","DOI":"10.1007\/978-3-030-01270-0_10"},{"key":"1473_CR52","unstructured":"Simonyan, K., & Zisserman, A. (2014). Two-stream convolutional networks for action recognition in videos. In Advances in neural information processing systems (NeurIPS), (pp. 568\u2013576)."},{"key":"1473_CR53","doi-asserted-by":"crossref","unstructured":"Singh, K. K., & Lee, Y. J. (2017). Hide-and-seek: Forcing a network to be meticulous for weakly-supervised object and action localization. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 3544\u20133553). IEEE","DOI":"10.1109\/ICCV.2017.381"},{"key":"1473_CR54","doi-asserted-by":"crossref","unstructured":"Song, L., Liu, J., Sun, M., & Shang, X. (2020). Weakly supervised group mask network for object detection. International Journal of Computer Vision, 129(3), 1\u201322.","DOI":"10.1007\/s11263-020-01397-w"},{"key":"1473_CR55","doi-asserted-by":"crossref","unstructured":"Sun, G., Wang, W., Dai, J., & Van\u00a0Gool, L. (2020). Mining cross-image semantics for weakly supervised semantic segmentation. In European conference on computer vision, (pp. 347\u2013365). Springer","DOI":"10.1007\/978-3-030-58536-5_21"},{"key":"1473_CR56","unstructured":"Toolkit, CPTG. (2019). v10. 1 documentation. URL: https:\/\/docs.nvidia.com\/cuda\/archive\/101\/pascal-tuning-guide\/index.html"},{"key":"1473_CR57","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., & Paluri, M. (2015). Learning spatiotemporal features with 3d convolutional networks. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 4489\u20134497).","DOI":"10.1109\/ICCV.2015.510"},{"key":"1473_CR58","doi-asserted-by":"crossref","unstructured":"Wang, H., & Schmid, C. (2013). Action recognition with improved trajectories. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 3551\u20133558).","DOI":"10.1109\/ICCV.2013.441"},{"issue":"1","key":"1473_CR59","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., & Liu, C. L. (2013). Dense trajectories and motion boundary descriptors for action recognition. International journal of computer vision, 103(1), 60\u201379.","journal-title":"International journal of computer vision"},{"key":"1473_CR60","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., & Van\u00a0Gool, L. (2016). Temporal segment networks: Towards good practices for deep action recognition. In European conference on computer vision, (pp. 20\u201336). Springer","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"1473_CR61","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Lin, D., & Van\u00a0Gool, L. (2017). Untrimmednets for weakly supervised action recognition and detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 4325\u20134334).","DOI":"10.1109\/CVPR.2017.678"},{"key":"1473_CR62","doi-asserted-by":"crossref","unstructured":"Wei, H., Feng, L., Chen, X., & An, B. (2020). Combating noisy labels by agreement: A joint training method with co-regularization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 13726\u201313735).","DOI":"10.1109\/CVPR42600.2020.01374"},{"key":"1473_CR63","doi-asserted-by":"crossref","unstructured":"Wu, R., Feng, M., Guan, W., Wang, D., Lu, H., & Ding, E. (2019a). A mutual learning method for salient object detection with intertwined multi-supervision. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 8150\u20138159).","DOI":"10.1109\/CVPR.2019.00834"},{"key":"1473_CR64","doi-asserted-by":"crossref","unstructured":"Wu, Y., Zhu, L., Yan, Y., & Yang, Y. (2019b). Dual attention matching for audio-visual event localization. In Proceedings of the IEEE\/CVF international conference on computer vision, (pp. 6292\u20136300).","DOI":"10.1109\/ICCV.2019.00639"},{"key":"1473_CR65","doi-asserted-by":"crossref","unstructured":"Xu, H., Das, A., & Saenko, K. (2017). R-c3d: Region convolutional 3d network for temporal activity detection. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 5783\u20135792).","DOI":"10.1109\/ICCV.2017.617"},{"key":"1473_CR66","doi-asserted-by":"crossref","unstructured":"Xu, M., Zhao, C., Rojas, D. S., Thabet, A., & Ghanem, B. (2020). G-tad: Sub-graph localization for temporal action detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 10156\u201310165).","DOI":"10.1109\/CVPR42600.2020.01017"},{"key":"1473_CR67","doi-asserted-by":"crossref","unstructured":"Xu, Y., Zhang, C., Cheng, Z., Xie, J., Niu, Y., Pu, S., & Wu, F. (2019). Segregated temporal assembly recurrent networks for weakly supervised multiple action detection. In Proceedings of the AAAI conference on artificial intelligence, (vol. 33, pp. 9070\u20139078).","DOI":"10.1609\/aaai.v33i01.33019070"},{"issue":"5","key":"1473_CR68","doi-asserted-by":"publisher","first-page":"1414","DOI":"10.1007\/s11263-019-01244-7","volume":"128","author":"Y Yan","year":"2020","unstructured":"Yan, Y., Xu, C., Cai, D., & Corso, J. J. (2020). A weakly supervised multi-task ranking framework for actor-action semantic segmentation. International Journal of Computer Vision, 128(5), 1414\u20131432.","journal-title":"International Journal of Computer Vision"},{"issue":"8","key":"1473_CR69","doi-asserted-by":"publisher","first-page":"4025","DOI":"10.1109\/TIP.2018.2834221","volume":"27","author":"L Yang","year":"2018","unstructured":"Yang, L., Han, J., Zhang, D., Liu, N., & Zhang, D. (2018). Segmentation in weakly labeled videos via a semantic ranking and optical warping network. IEEE Transactions on Image Processing, 27(8), 4025\u20134037.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1473_CR70","doi-asserted-by":"publisher","first-page":"8535","DOI":"10.1109\/TIP.2020.3016486","volume":"29","author":"L Yang","year":"2020","unstructured":"Yang, L., Peng, H., Zhang, D., Fu, J., & Han, J. (2020a). Revisiting anchor mechanisms for temporal action localization. IEEE Transactions on Image Processing, 29, 8535\u20138548.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1473_CR71","doi-asserted-by":"crossref","unstructured":"Yang, T., Zhu, S., Chen, C., Yan, S., Zhang, M., & Willis, A. (2020b). Mutualnet: Adaptive convnet via mutual learning from network width and resolution. In European conference on computer vision, (pp. 299\u2013315). Springer","DOI":"10.1007\/978-3-030-58452-8_18"},{"key":"1473_CR72","doi-asserted-by":"crossref","unstructured":"Yu, T., Ren, Z., Li, Y., Yan, E., Xu, N., & Yuan, J. (2019). Temporal structure mining for weakly supervised action detection. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 5522\u20135531).","DOI":"10.1109\/ICCV.2019.00562"},{"key":"1473_CR73","doi-asserted-by":"crossref","unstructured":"Yuan, L., Tay, F. E., Li, G., Wang, T., & Feng, J. (2020). Revisiting knowledge distillation via label smoothing regularization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 3903\u20133911).","DOI":"10.1109\/CVPR42600.2020.00396"},{"key":"1473_CR74","unstructured":"Yuan, Y., Lyu, Y., Shen, X., Tsang, I. W., & Yeung, D. Y. (2019). Marginalized average attentional network for weakly-supervised learning. In International conference on learning representations (ICLR)."},{"key":"1473_CR75","doi-asserted-by":"crossref","unstructured":"Yun, S., Park, J., Lee, K., & Shin, J. (2020). Regularizing class-wise predictions via self-knowledge distillation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, (pp. 13876\u201313885).","DOI":"10.1109\/CVPR42600.2020.01389"},{"key":"1473_CR76","doi-asserted-by":"crossref","unstructured":"Zach, C., Pock, T., & Bischof, H. (2007). A duality based approach for realtime tv-l 1 optical flow. In Joint pattern recognition symposium, Springer, (pp. 214\u2013223).","DOI":"10.1007\/978-3-540-74936-3_22"},{"key":"1473_CR77","doi-asserted-by":"crossref","unstructured":"Zeng, R., Huang, W., Tan, M., Rong, Y., Zhao, P., Huang, J., & Gan, C. (2019). Graph convolutional networks for temporal action localization. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 7094\u20137103).","DOI":"10.1109\/ICCV.2019.00719"},{"key":"1473_CR78","doi-asserted-by":"crossref","unstructured":"Zhai, Y., Wang, L., Tang, W., Zhang, Q., Yuan, J., & Hua, G. (2020). Two-stream consensus network for weakly-supervised temporal action localization. In European conference on computer vision, (pp. 37\u201354). Springer","DOI":"10.1007\/978-3-030-58539-6_3"},{"key":"1473_CR79","doi-asserted-by":"crossref","unstructured":"Zhang, C., Xu, Y., Cheng, Z., Niu, Y., Pu, S., Wu, F., & Zou, F. (2019a). Adversarial seeded sequence growing for weakly-supervised temporal action localization. In Proceedings of the 27th ACM international conference on multimedia, (pp. 738\u2013746).","DOI":"10.1145\/3343031.3351044"},{"key":"1473_CR80","doi-asserted-by":"crossref","unstructured":"Zhang, D., Han, J., Yang, L., & Xu, D. (2018a). Spftn: A joint learning framework for localizing and segmenting objects in weakly labeled videos. IEEE transactions on pattern analysis and machine intelligence, 42(2), 475\u2013489.","DOI":"10.1109\/TPAMI.2018.2881114"},{"issue":"4","key":"1473_CR81","doi-asserted-by":"publisher","first-page":"363","DOI":"10.1007\/s11263-018-1112-4","volume":"127","author":"D Zhang","year":"2019","unstructured":"Zhang, D., Han, J., Zhao, L., & Meng, D. (2019b). Leveraging prior-knowledge for weakly supervised object detection under a collaborative self-paced curriculum learning framework. International Journal of Computer Vision, 127(4), 363\u2013380.","journal-title":"International Journal of Computer Vision"},{"issue":"12","key":"1473_CR82","doi-asserted-by":"publisher","first-page":"5549","DOI":"10.1109\/TNNLS.2020.2969483","volume":"31","author":"D Zhang","year":"2020","unstructured":"Zhang, D., Han, J., Zhao, L., & Zhao, T. (2020a). From discriminant to complete: Reinforcement searching-agent learning for weakly supervised object detection. IEEE Transactions on Neural Networks and Learning Systems, 31(12), 5549\u20135560.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"1473_CR83","doi-asserted-by":"crossref","unstructured":"Zhang, L., Song, J., Gao, A., Chen, J., Bao, C., & Ma, K. (2019c). Be your own teacher: Improve the performance of convolutional neural networks via self distillation. In Proceedings of the IEEE international conference on computer vision (ICCV), (pp. 3713\u20133722).","DOI":"10.1109\/ICCV.2019.00381"},{"key":"1473_CR84","doi-asserted-by":"crossref","unstructured":"Zhang, X., Wei, Y., Feng, J., Yang, Y., & Huang, T. S. (2018b). Adversarial complementary learning for weakly supervised object localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 1325\u20131334).","DOI":"10.1109\/CVPR.2018.00144"},{"key":"1473_CR85","doi-asserted-by":"crossref","unstructured":"Zhang, X. Y., Shi, H., Li, C., Zheng, K., Zhu, X., & Duan, L. (2019d). Learning transferable self-attentive representations for action recognition in untrimmed videos with weak supervision. In Proceedings of the AAAI conference on artificial intelligence, (vol. 33, pp. 9227\u20139234).","DOI":"10.1609\/aaai.v33i01.33019227"},{"key":"1473_CR86","doi-asserted-by":"crossref","unstructured":"Zhang, X. Y., Shi, H., Li, C., & Li, P. (2020b). Multi-instance multi-label action recognition and localization based on spatio-temporal pre-trimming for untrimmed videos. In AAAI, (pp. 12886\u201312893).","DOI":"10.1609\/aaai.v34i07.6986"},{"key":"1473_CR87","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Xiang, T., Hospedales, T. M., & Lu, H. (2018c). Deep mutual learning. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 4320\u20134328).","DOI":"10.1109\/CVPR.2018.00454"},{"key":"1473_CR88","doi-asserted-by":"crossref","unstructured":"Zhao, P., Xie, L., Ju, C., Zhang, Y., Wang, Y., & Tian, Q. (2020). Bottom-up temporal action localization with mutual regularization. In European Conference on Computer Vision, (pp. 539\u2013555). Springer","DOI":"10.1007\/978-3-030-58598-3_32"},{"key":"1473_CR89","doi-asserted-by":"crossref","unstructured":"Zhong, J. X., Li, N., Kong, W., Zhang, T., Li, T. H., & Li, G. (2018). Step-by-step erasion, one-by-one collection: a weakly supervised temporal action detector. In: Proceedings of the 26th ACM international conference on Multimedia, (pp. 35\u201344).","DOI":"10.1145\/3240508.3240511"},{"key":"1473_CR90","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., & Torralba, A. (2016). Learning deep features for discriminative localization. In Proceedings of the IEEE conference on computer vision and pattern recognition (CVPR), (pp. 2921\u20132929).","DOI":"10.1109\/CVPR.2016.319"},{"key":"1473_CR91","doi-asserted-by":"crossref","unstructured":"Zhu, L., & Yang, Y. (2020). Label independent memory for semi-supervised few-shot video classification. IEEE Transactions on Pattern Analysis and Machine Intelligence.https:\/\/doi.org\/10.1109\/TPAMI.2020.3007511.","DOI":"10.1109\/TPAMI.2020.3007511"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-021-01473-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-021-01473-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-021-01473-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,7,24]],"date-time":"2021-07-24T06:16:48Z","timestamp":1627107408000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-021-01473-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,5,31]]},"references-count":91,"journal-issue":{"issue":"8","published-print":{"date-parts":[[2021,8]]}},"alternative-id":["1473"],"URL":"https:\/\/doi.org\/10.1007\/s11263-021-01473-9","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,5,31]]},"assertion":[{"value":"14 December 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 April 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 May 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}