{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T17:51:32Z","timestamp":1740160292891,"version":"3.37.3"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2022,6,11]],"date-time":"2022-06-11T00:00:00Z","timestamp":1654905600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,6,11]],"date-time":"2022-06-11T00:00:00Z","timestamp":1654905600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61971016"],"award-info":[{"award-number":["61971016"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Beijing Municipal Education Commission Cooperation Beijing Natural Science Foundation","award":["KZ201910005007"],"award-info":[{"award-number":["KZ201910005007"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int. J. Mach. Learn. &amp; Cyber."],"published-print":{"date-parts":[[2022,10]]},"DOI":"10.1007\/s13042-022-01581-z","type":"journal-article","created":{"date-parts":[[2022,6,11]],"date-time":"2022-06-11T12:03:31Z","timestamp":1654949011000},"page":"3071-3088","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Streamer temporal action detection in live video by co-attention boundary matching"],"prefix":"10.1007","volume":"13","author":[{"given":"Chenhao","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chen","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hui","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiacheng","family":"Yao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jing","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Zhuo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,6,11]]},"reference":[{"key":"1581_CR1","unstructured":"Video streaming market size, share & trends analysis report. https:\/\/www.grandviewresearch.com\/industry-analysis\/video-streaming-market"},{"key":"1581_CR2","unstructured":"Must-know live video streaming statistics. https:\/\/livestream.com\/blog\/62-must-know-stats-live-video-streaming"},{"key":"1581_CR3","unstructured":"Glance D. As live streaming murder becomes the new normal online, can social media be saved? https:\/\/phys.org\/news\/2017\u201304-streaming-online-social-media.html"},{"key":"1581_CR4","doi-asserted-by":"crossref","unstructured":"Chao Y, Vijayanarasimhan S, Seybold B, Ross DA, Deng J, Sukthankar R (2018) Rethinking the faster R-CNN architecture for temporal action localization. In Proceeding IEEE Conference on Computer Vision and Pattern Recognition. Salt Lake City, pp 1130\u20131139","DOI":"10.1109\/CVPR.2018.00124"},{"key":"1581_CR5","first-page":"2204","volume-title":"Recurrent models of visual attention","author":"V Mnih","year":"2014","unstructured":"Mnih V, Heess N, Graves A (2014) Recurrent models of visual attention. In Proceeding Advances in Neural Information Processing Systems. Cambridge, pp 2204\u20132212"},{"key":"1581_CR6","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: Neural image caption generation with visual attention. In: International conference on machine learning. Guangzhou, pp 2048\u20132057"},{"key":"1581_CR7","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Fan J, Tao D (2017) Multi-modal factorized bilinear pooling with co-attention learning for visual question answering. In: Proceeding IEEE international conference on computer vision. Venice, pp 1839\u20131848","DOI":"10.1109\/ICCV.2017.202"},{"key":"1581_CR8","doi-asserted-by":"crossref","unstructured":"Wang H and Schmid C (2013) Action recognition with improved trajectories. In: Proceeding IEEE international conference on computer vision. Sydney, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"1581_CR9","doi-asserted-by":"crossref","unstructured":"Lin T, Liu X, Li X, Ding E, Wen S (2019) BMN: boundary-matching network for temporal action proposal generation. In: Proceeding IEEE international conference on computer vision. Seoul, pp 3888\u20133897","DOI":"10.1109\/ICCV.2019.00399"},{"key":"1581_CR10","doi-asserted-by":"crossref","unstructured":"Liu Y, Ma L, Zhang Y, Liu W, Chang SF (2019) Multi-granularity generator for temporal action proposal. In Proceeding IEEE conference on computer vision and pattern recognition. Long Beach, pp 3604\u20133613","DOI":"10.1109\/CVPR.2019.00372"},{"key":"1581_CR11","doi-asserted-by":"crossref","unstructured":"Lin C, Li J, Wang Y (2020) Fast learning of temporal action proposal via dense boundary generator. In: AAAI conference on artificial intelligence. New York, pp 11499\u201311506","DOI":"10.1609\/aaai.v34i07.6815"},{"key":"1581_CR12","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. Advances in Neural Information Processing Systems, Montreal, pp 568\u2013576"},{"key":"1581_CR13","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman A (2016) Convolutional two-stream network fusion for video action recognition. In: Proceeding IEEE conference on computer vision and pattern recognition. Las Vegas, pp 1933\u20131941","DOI":"10.1109\/CVPR.2016.213"},{"key":"1581_CR14","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1016\/j.patcog.2018.01.020","volume":"79","author":"Z Tu","year":"2018","unstructured":"Tu Z, Xie W, Qin Q, Poppe R, Veltkamp R, Li B, Yuan J (2018) Multi-stream CNN: Learning representations based on human-related regions for action recognition. Pattern Recogn 79:32\u201343","journal-title":"Pattern Recogn"},{"issue":"3","key":"1581_CR15","doi-asserted-by":"publisher","first-page":"773","DOI":"10.1109\/TCSVT.2018.2808685","volume":"29","author":"Y Peng","year":"2019","unstructured":"Peng Y, Zhao Y, Zhang J (2019) Two-stream collaborative learning with spatial-temporal attention for video classification. IEEE Trans Circuits Syst Video Technol 29(3):773\u2013786","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"1581_CR16","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3D convolutional networks. In: Proceeding IEEE international conference on computer vision. Santiago, pp 4489\u20134497","DOI":"10.1109\/ICCV.2015.510"},{"key":"1581_CR17","doi-asserted-by":"crossref","unstructured":"He D, Zhou Z, Gan C, Li F, Liu X, Li Y, Wang L, Wen S (2019) StNet: Local and global spatial-temporal modeling for action recognition. In:  AAAI conference on artificial intelligence. Virtual, pp 8401\u20138408","DOI":"10.1609\/aaai.v33i01.33018401"},{"key":"1581_CR18","doi-asserted-by":"publisher","first-page":"383","DOI":"10.1016\/j.neucom.2020.07.148","volume":"453","author":"C Li","year":"2021","unstructured":"Li C, Zhang J, Yao J (2021) Streamer action recognition in live video with spatial-temporal attention and deep dictionary learning. Neurocomputing 453:383\u2013392","journal-title":"Neurocomputing"},{"key":"1581_CR19","doi-asserted-by":"crossref","unstructured":"Shou Z, Wang D and Chang S (2016) Temporal action localization in untrimmed videos via multistage CNNs. In: Proceeding IEEE conference on computer vision and pattern recognition. Las Vegas, pp 1049\u20131058","DOI":"10.1109\/CVPR.2016.119"},{"key":"1581_CR20","doi-asserted-by":"crossref","unstructured":"Heilbron FC, Niebles JC, Ghanem B (2016) Fast temporal activity proposals for efficient detection of human actions in untrimmed videos. In: Proceeding IEEE conference on computer vision and pattern recognition. Las Vegas, pp 1914\u20131923","DOI":"10.1109\/CVPR.2016.211"},{"key":"1581_CR21","doi-asserted-by":"crossref","unstructured":"Gao J, Yang Z, Sun C, Chen K, and Nevatia R (2017) TURN TAP: Temporal unit regression network for temporal action proposals. In: Proceeding IEEE international cnference on computer vision. Venice, pp 3648\u20133656","DOI":"10.1109\/ICCV.2017.392"},{"key":"1581_CR22","doi-asserted-by":"crossref","unstructured":"Lin T, Zhao X, Su H, Wang C, and Yang M (2018) BSN: Boundary sensitive network for temporal action proposal generation. In: Proceeding European conference on computer vision. Munich, pp 3\u201321","DOI":"10.1007\/978-3-030-01225-0_1"},{"key":"1581_CR23","doi-asserted-by":"publisher","first-page":"2199","DOI":"10.1007\/s13042-021-01301-z","volume":"12","author":"F Wang","year":"2021","unstructured":"Wang F, Wang GR, Du YX, He ZQ, Jiang Y (2021) A two-stage temporal proposal network for precise action localization in untrimmed video. Int J Mach Learn & Cyber 12:2199\u20132211","journal-title":"Int J Mach Learn & Cyber"},{"key":"1581_CR24","doi-asserted-by":"publisher","first-page":"2329","DOI":"10.1007\/s13042-018-0870-1","volume":"10","author":"H Naveed","year":"2019","unstructured":"Naveed H, Khan G, Khan AU, Siddiqi A, Khan MUG (2019) Human activity recognition using mixture of heterogeneous features and sequential minimal optimization. Int J Mach Learn Cyber 10:2329\u20132340","journal-title":"Int J Mach Learn Cyber"},{"key":"1581_CR25","doi-asserted-by":"publisher","first-page":"823","DOI":"10.1007\/s13042-020-01204-5","volume":"12","author":"DF Zhuang","year":"2021","unstructured":"Zhuang DF, Jiang M, Kong J, Liu TS (2021) Spatiotemporal attention enhanced features fusion network for action recognition. Int J Mach Learn Cyber 12:823\u2013841","journal-title":"Int J Mach Learn Cyber"},{"issue":"2","key":"1581_CR26","doi-asserted-by":"publisher","first-page":"416","DOI":"10.1109\/TMM.2018.2862341","volume":"21","author":"D Li","year":"2019","unstructured":"Li D, Yao T, Duan L, Mei T, Rui Y (2019) Unified spatio-temporal attention networks for action recognition in videos. IEEE Trans Multimedia 21(2):416\u2013428","journal-title":"IEEE Trans Multimedia"},{"issue":"6","key":"1581_CR27","doi-asserted-by":"publisher","first-page":"2799","DOI":"10.1109\/TIP.2018.2890749","volume":"28","author":"Z Tu","year":"2019","unstructured":"Tu Z, Li H, Zhang D, Dauwels J, Li B, Yuan J (2019) Action-stage emphasized spatio-temporal VLAD for video action recognition. IEEE Trans Image Process 28(6):2799\u20132812","journal-title":"IEEE Trans Image Process"},{"key":"1581_CR28","doi-asserted-by":"crossref","unstructured":"Gong G, Wang X, Mu Y, Tian Q (2020) Learning temporal co-attention models for unsupervised video action localization. In: Proceeding IEEE conference on computer vision and pattern recognition. Seattle, pp 9816\u20139825","DOI":"10.1109\/CVPR42600.2020.00984"},{"key":"1581_CR29","doi-asserted-by":"crossref","unstructured":"Zeng R, Huang W, Gan C, Tan M, Huang J (2019) Graph convolutional networks for temporal action localization. In: Proceeding IEEE international conference on computer vision. Seoul, pp 7093\u20137102","DOI":"10.1109\/ICCV.2019.00719"},{"key":"1581_CR30","doi-asserted-by":"crossref","unstructured":"Xu M, Zhao C, Rojas DS, Thabet A, Ghanem B (2020) G-TAD: Sub-graph localization for temporal action detection. In: Proceeding IEEE conference on computer vision and pattern recognition. Seattle, pp 10153\u201310162","DOI":"10.1109\/CVPR42600.2020.01017"},{"key":"1581_CR31","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2021.104144","volume":"109","author":"Y Chen","year":"2021","unstructured":"Chen Y, Guo B, Shen Y, Wang W, Lu W, Suo X (2021) Boundary graph convolutional network for temporal action detection. Image Vis Comput 109:104144","journal-title":"Image Vis Comput"},{"key":"1581_CR32","unstructured":"Sharma S, Kiros R, Salakhutdinov R (2015) Action recognition using visual attention. arXiv:1511.04119"},{"key":"1581_CR33","doi-asserted-by":"crossref","unstructured":"Song S, Lan C, Xing J, Zeng W, Liu J (2017) An end-to-end spatio-temporal attention model for human action recognition from skeleton data. In: Proceeding advances in neural information processing systems. Long Beach, pp 4263\u20134270","DOI":"10.1609\/aaai.v31i1.11212"},{"key":"1581_CR34","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Lin D, Gool LV (2017) UntrimmedNets for weakly supervised action recognition and detection. In: Proceeding IEEE conference on computer vision and pattern recognition. Honolulu, pp 4325\u20134334","DOI":"10.1109\/CVPR.2017.678"},{"key":"1581_CR35","doi-asserted-by":"crossref","unstructured":"Woo S, Park J, Lee JY (2018) CBAM: convolutional block attention module. In: Proceeding European conference on computer vision. Munich, pp 3\u201319","DOI":"10.1007\/978-3-030-01234-2_1"},{"issue":"12","key":"1581_CR36","doi-asserted-by":"publisher","first-page":"4876","DOI":"10.1109\/TCSVT.2019.2958871","volume":"32","author":"L Wang","year":"2020","unstructured":"Wang L, Zhang J, Tian Q, Li C, Zhuo L (2020) Porn streamer recognition in live video streaming via attention-gated multimodal deep features. IEEE Trans Circuits Syst Video Technol 32(12):4876\u20134886","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"issue":"11","key":"1581_CR37","doi-asserted-by":"publisher","first-page":"5552","DOI":"10.1109\/TIP.2019.2916757","volume":"28","author":"B Zhao","year":"2019","unstructured":"Zhao B, Li X, Lu X (2019) CAM-RNN: Co-attention model based RNN for video captioning. IEEE Trans Image Process 28(11):5552\u20135565","journal-title":"IEEE Trans Image Process"},{"key":"1581_CR38","unstructured":"Hsieh T, Lo Y, Chen H, Liu T (2019) One-shot object detection with co-attention and co-excitation. In: Proceedings of international conference on neural information processing systems. Vancouver, pp 2725\u20132734"},{"key":"1581_CR39","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: Accelerating deep network training by reducing internal covariate shift. In: Proceeding international conference on machine learning. Lille, pp 448\u2013456"},{"key":"1581_CR40","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van LG (2016) Temporal segment networks: Towards good practices for deep action recognition. In: Proceeding European conference on computer vision. Amsterdam, pp 20\u201336","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"1581_CR41","doi-asserted-by":"crossref","unstructured":"Fu J, Liu J, Tian H, Li Y, Bao Y, Fang Z, Lu H (2019) Dual attention network for scene segmentation. In: Proceeding IEEE conference on computer vision and pattern recognition. Long Beach, pp 3141\u20133149","DOI":"10.1109\/CVPR.2019.00326"},{"key":"1581_CR42","unstructured":"Zhang H, Goodfellow IJ, Metaxas DN, Odena A (2019) Self-attention generative adversarial networks. In: Proceedings of international conference on machine learning. Long Beach, pp 7354\u20137363"},{"key":"1581_CR43","doi-asserted-by":"crossref","unstructured":"Wang X, Girshick R, Gupta A, He K (2018) Non-local neural networks. In: Proceeding IEEE conference on computer vision and pattern recognition. Salt Lake City, pp 7794\u20137803","DOI":"10.1109\/CVPR.2018.00813"},{"key":"1581_CR44","doi-asserted-by":"crossref","unstructured":"Bodla N, Singh B, Chellappa R, Davis LS (2017) Soft-NMS improving object detection with one line of code. In: Proceeding IEEE international conference on computer vision. Venice, pp 5562\u20135570","DOI":"10.1109\/ICCV.2017.593"},{"key":"1581_CR45","unstructured":"Jiang YG, Liu J, Zamir AR, Toderici G, Laptev I, Shah M, Sukthankar R (2014) THUMOS challenge: action recognition with a large number of classes. In: Proceeding European conference on computer vision workshop. Zurich, pp 1\u20136"},{"key":"1581_CR46","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li LJ, Li K, L. FF (2009) ImageNet: A large-scale hierarchical image database. In: Proceeding IEEE conference on computer vision and pattern recognition. Miami, pp 248\u2013255","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1581_CR47","doi-asserted-by":"crossref","unstructured":"Buch S, Escorcia V, Shen C, Ghanem B, Niebles JC (2017) SST: Single-stream temporal action proposals. In Proceeding IEEE conference on computer vision and pattern recognition. Honolulu, pp 6373\u20136382","DOI":"10.1109\/CVPR.2017.675"},{"key":"1581_CR48","doi-asserted-by":"crossref","unstructured":"Zhao Y, Xiong Y, Wang L, Wu Z, Tang X, Lin D (2017) Temporal action detection with structured segment networks. In: Proceeding IEEE international conference on computer vision. Venice, pp 2933\u20132942","DOI":"10.1109\/ICCV.2017.317"},{"key":"1581_CR49","doi-asserted-by":"crossref","unstructured":"Gao J, Chen K, Nevatia R (2018) CTAP: complementary temporal action proposal generation. In: Proceeding European conference on computer vision. Munich, pp 68\u201383","DOI":"10.1007\/978-3-030-01216-8_5"}],"container-title":["International Journal of Machine Learning and Cybernetics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s13042-022-01581-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s13042-022-01581-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s13042-022-01581-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,27]],"date-time":"2022-08-27T05:06:41Z","timestamp":1661576801000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s13042-022-01581-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,6,11]]},"references-count":49,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2022,10]]}},"alternative-id":["1581"],"URL":"https:\/\/doi.org\/10.1007\/s13042-022-01581-z","relation":{},"ISSN":["1868-8071","1868-808X"],"issn-type":[{"type":"print","value":"1868-8071"},{"type":"electronic","value":"1868-808X"}],"subject":[],"published":{"date-parts":[[2022,6,11]]},"assertion":[{"value":"2 June 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 May 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 June 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"All authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}