{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,28]],"date-time":"2025-10-28T10:48:20Z","timestamp":1761648500936},"publisher-location":"Cham","reference-count":26,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319683447"},{"type":"electronic","value":"9783319683454"}],"license":[{"start":{"date-parts":[[2017,1,1]],"date-time":"2017-01-01T00:00:00Z","timestamp":1483228800000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017]]},"DOI":"10.1007\/978-3-319-68345-4_39","type":"book-chapter","created":{"date-parts":[[2017,10,10]],"date-time":"2017-10-10T01:32:35Z","timestamp":1507599155000},"page":"437-447","source":"Crossref","is-referenced-by-count":31,"title":["Trajectory-Pooled Deep Convolutional Networks for Violence Detection in Videos"],"prefix":"10.1007","author":[{"given":"Zihan","family":"Meng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiabin","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhen","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,10,11]]},"reference":[{"issue":"4","key":"39_CR1","first-page":"568","volume":"1","author":"D Annane","year":"2014","unstructured":"Annane, D., Chevrolet, J.C., Chevret, S., Raphael, J.C.: Two-stream convolutional networks for action recognition in videos. Adv. Neural Inf. Process. Syst. 1(4), 568\u2013576 (2014)","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"1","key":"39_CR2","first-page":"150","volume":"39","author":"MY Chen","year":"2009","unstructured":"Chen, M.Y., Hauptmann, A.: Mosift: recognizing human actions in surveillance videos. Ann. Pharmacother. 39(1), 150\u2013152 (2009)","journal-title":"Ann. Pharmacother."},{"key":"39_CR3","doi-asserted-by":"crossref","unstructured":"Cheng, W.H., Chu, W.T., Wu, J.L.: Semantic context detection based on hierarchical audio models. In: Proceedings of ACM SIGMM International Workshop on Multimedia Information Retrieval, pp. 109\u2013115 (2003)","DOI":"10.1145\/973264.973282"},{"key":"39_CR4","doi-asserted-by":"crossref","unstructured":"Datta, A., Shah, M., Lobo, N.D.V.: Person-on-person violence detection in video data. In: Proceedings of International Conference on Pattern Recognition, vol. 1, pp. 433\u2013438 (2002)","DOI":"10.1109\/ICPR.2002.1044748"},{"key":"39_CR5","unstructured":"Deniz, O., Serrano, I., Bueno, G., Kim, T.K.: Fast violence detection in video. In: The International Conference on Computer Vision Theory and Applications, pp. 478\u2013485 (2014)"},{"key":"39_CR6","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"551","DOI":"10.1007\/978-3-319-14364-4_53","volume-title":"Advances in Visual Computing","author":"C Ding","year":"2014","unstructured":"Ding, C., Fan, S., Zhu, M., Feng, W., Jia, B.: Violence detection in video by using 3D convolutional neural networks. In: Bebis, G., et al. (eds.) ISVC 2014. LNCS, vol. 8888, pp. 551\u2013558. Springer, Cham (2014). doi: 10.1007\/978-3-319-14364-4_53"},{"key":"39_CR7","series-title":"Communications in Computer and Information Science","doi-asserted-by":"publisher","first-page":"517","DOI":"10.1007\/978-981-10-3002-4_43","volume-title":"Pattern Recognition","author":"Z Dong","year":"2016","unstructured":"Dong, Z., Qin, J., Wang, Y.: Multi-stream deep networks for person to person violence detection in videos. In: Tan, T., Li, X., Chen, X., Zhou, J., Yang, J., Cheng, H. (eds.) CCPR 2016. CCIS, vol. 662, pp. 517\u2013531. Springer, Singapore (2016). doi: 10.1007\/978-981-10-3002-4_43"},{"key":"39_CR8","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"363","DOI":"10.1007\/3-540-45103-X_50","volume-title":"Image Analysis","author":"G Farneb\u00e4ck","year":"2003","unstructured":"Farneb\u00e4ck, G.: Two-frame motion estimation based on polynomial expansion. In: Bigun, J., Gustavsson, T. (eds.) SCIA 2003. LNCS, vol. 2749, pp. 363\u2013370. Springer, Heidelberg (2003). doi: 10.1007\/3-540-45103-X_50"},{"key":"39_CR9","doi-asserted-by":"crossref","unstructured":"Garcia-Garcia, A., Gomez-Donoso, F., Garcia-Rodriguez, J., Orts-Escolano, S., Cazorla, M., Azorin-Lopez, J.: PointNet: a 3D convolutional neural network for real-time object class recognition. In: International Joint Conference on Neural Networks, pp. 1578\u20131584 (2016)","DOI":"10.1109\/IJCNN.2016.7727386"},{"key":"39_CR10","doi-asserted-by":"crossref","unstructured":"Girshick, R., Donahue, J., Darrell, T., Malik, J.: Rich feature hierarchies for accurate object detection and semantic segmentation. In: Computer Vision and Pattern Recognition, pp. 580\u2013587 (2014)","DOI":"10.1109\/CVPR.2014.81"},{"key":"39_CR11","doi-asserted-by":"crossref","unstructured":"Hassner, T., Itcher, Y., Kliper-Gross, O.: Violent flows: real-time detection of violent crowd behavior. In: Computer Vision and Pattern Recognition Workshops, pp. 1\u20136 (2012)","DOI":"10.1109\/CVPRW.2012.6239348"},{"key":"39_CR12","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: International Conference on Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"39_CR13","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"833","DOI":"10.1007\/978-3-319-46466-4_50","volume-title":"Computer Vision \u2013 ECCV 2016","author":"G Lev","year":"2016","unstructured":"Lev, G., Sadeh, G., Klein, B., Wolf, L.: RNN fisher vectors for action recognition and image annotation. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9910, pp. 833\u2013850. Springer, Cham (2016). doi: 10.1007\/978-3-319-46466-4_50"},{"key":"39_CR14","doi-asserted-by":"crossref","unstructured":"Li, W., Li, X., Qiu, J.: Human action recognition based on dense of spatio-temporal interest points and HOG-3D descriptor. In: International Conference on Internet Multimedia Computing and Service, p. 44 (2015)","DOI":"10.1145\/2808492.2808536"},{"key":"39_CR15","doi-asserted-by":"crossref","unstructured":"Liu, P., Wang, J., She, M., Liu, H.: Human action recognition based on 3D SIFT and LDA model. In: Robotic Intelligence in Informationally Structured Space, pp. 12\u201317 (2011)","DOI":"10.1109\/RIISS.2011.5945790"},{"key":"39_CR16","doi-asserted-by":"crossref","unstructured":"Nam, J., Alghoniemy, M., Tewfik, A.H.: Audio-visual content-based violent scene characterization. In: Proceedings of International Conference on Image Processing, ICIP 1998, pp. 353\u2013357 (1998)","DOI":"10.1109\/ICIP.1998.723496"},{"issue":"3","key":"39_CR17","doi-asserted-by":"crossref","first-page":"222","DOI":"10.1007\/s11263-013-0636-x","volume":"105","author":"J Nchez","year":"2013","unstructured":"Nchez, J., Perronnin, F., Mensink, T., Verbeek, J.: Image classification with the fisher vector: theory and practice. Int. J. Comput. Vis. 105(3), 222\u2013245 (2013)","journal-title":"Int. J. Comput. Vis."},{"key":"39_CR18","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"332","DOI":"10.1007\/978-3-642-23678-5_39","volume-title":"Computer Analysis of Images and Patterns","author":"EB Nievas","year":"2011","unstructured":"Nievas, E.B., Suarez, O.D., Garc\u00eda, G.B., Sukthankar, R.: Violence detection in video using computer vision techniques. In: Real, P., Diaz-Pernil, D., Molina-Abril, H., Berciano, A., Kropatsch, W. (eds.) CAIP 2011. LNCS, vol. 6855, pp. 332\u2013339. Springer, Heidelberg (2011). doi: 10.1007\/978-3-642-23678-5_39"},{"issue":"10","key":"39_CR19","doi-asserted-by":"crossref","first-page":"1225","DOI":"10.1109\/TCSVT.2005.854237","volume":"15","author":"DA Sadlier","year":"2005","unstructured":"Sadlier, D.A., O\u2019Connor, N.E.: Event detection in field sports video using audio-visual features and a support vector machine. IEEE Trans. Circ. Syst. Video Technol. 15(10), 1225\u20131233 (2005)","journal-title":"IEEE Trans. Circ. Syst. Video Technol."},{"key":"39_CR20","doi-asserted-by":"crossref","unstructured":"Samanta, S., Chanda, B.: FaSTIP: a new method for detection and description of space-time interest points for human activity classification. In: Eighth Indian Conference on Computer Vision, Graphics and Image Processing, p. 8 (2012)","DOI":"10.1145\/2425333.2425341"},{"key":"39_CR21","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C.: Action recognition with improved trajectories. In: IEEE International Conference on Computer Vision, pp. 3551\u20133558 (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"39_CR22","unstructured":"Wang, L., Guo, S., Huang, W., Qiao, Y.: Places205-vggnet models for scene recognition. Comput. Sci. (2015). arXiv preprint arXiv:1508.01667"},{"key":"39_CR23","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., Tang, X.: Action recognition with trajectory-pooled deep-convolutional descriptors. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 4305\u20134314 (2015)","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"39_CR24","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1007\/978-3-319-46484-8_2","volume-title":"Computer Vision \u2013 ECCV 2016","author":"L Wang","year":"2016","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., Gool, L.: Temporal segment networks: towards good practices for deep action recognition. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 20\u201336. Springer, Cham (2016). doi: 10.1007\/978-3-319-46484-8_2"},{"issue":"1","key":"39_CR25","doi-asserted-by":"crossref","first-page":"015022","DOI":"10.1117\/1.JRS.10.015022","volume":"10","author":"H Yue","year":"2016","unstructured":"Yue, H., Chen, W., Wu, X., Wang, J.: Visualizing bag-of-words for high-resolution remote sensing image classification. J. Appl. Remote Sens. 10(1), 015022 (2016)","journal-title":"J. Appl. Remote Sens."},{"issue":"12","key":"39_CR26","doi-asserted-by":"crossref","first-page":"7327","DOI":"10.1007\/s11042-015-2648-8","volume":"75","author":"T Zhang","year":"2016","unstructured":"Zhang, T., Yang, Z., Jia, W., Yang, B., Yang, J., He, X.: A new method for violence detection in surveillance scenes. Multimedia Tools Appl. 75(12), 7327\u20137349 (2016)","journal-title":"Multimedia Tools Appl."}],"container-title":["Lecture Notes in Computer Science","Computer Vision Systems"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-68345-4_39","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,10,4]],"date-time":"2019-10-04T11:27:23Z","timestamp":1570188443000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-68345-4_39"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017]]},"ISBN":["9783319683447","9783319683454"],"references-count":26,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-68345-4_39","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2017]]}}}