{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,12]],"date-time":"2025-09-12T18:33:07Z","timestamp":1757701987804},"reference-count":51,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2021,7,14]],"date-time":"2021-07-14T00:00:00Z","timestamp":1626220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,7,14]],"date-time":"2021-07-14T00:00:00Z","timestamp":1626220800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"name":"The Scientific Research Fund of Hunan Provincial Education Department of China","award":["17A007"],"award-info":[{"award-number":["17A007"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2022,12]]},"DOI":"10.1007\/s00530-021-00831-4","type":"journal-article","created":{"date-parts":[[2021,7,14]],"date-time":"2021-07-14T18:09:50Z","timestamp":1626286190000},"page":"2123-2131","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Improved SSD using deep multi-scale attention spatial\u2013temporal features for action recognition"],"prefix":"10.1007","volume":"28","author":[{"given":"Shuren","family":"Zhou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jia","family":"Qiu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Arun","family":"Solanki","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,7,14]]},"reference":[{"issue":"3\u20134","key":"831_CR1","doi-asserted-by":"publisher","first-page":"167","DOI":"10.1007\/s00138-006-0054-y","volume":"18","author":"F Fusier","year":"2007","unstructured":"Fusier, F., Valentin, V., Bremond, F.: Video understanding for complex activity recognition[J]. Mach. Vis. Appl. 18(3\u20134), 167\u2013188 (2007)","journal-title":"Mach. Vis. Appl."},{"issue":"1","key":"831_CR2","doi-asserted-by":"publisher","first-page":"24626","DOI":"10.1109\/ACCESS.2019.2894673","volume":"7","author":"J Qin","year":"2019","unstructured":"Qin, J., Li, H., Xiang, X., Tan, Y., Pan, W., Ma, W., Xiong, N.N.: An encrypted image retrieval method based on Harris corner optimization and LSH in cloud computing. IEEE Access 7(1), 24626\u201324633 (2019)","journal-title":"IEEE Access"},{"key":"831_CR3","doi-asserted-by":"publisher","first-page":"521","DOI":"10.1007\/s00236-016-0270-5","volume":"54","author":"K Gu","year":"2017","unstructured":"Gu, K., Jia, W., Wang, G., et al.: Efficient and secure attribute-based signature for monotone predicates. Acta Inform. 54, 521\u2013541 (2017)","journal-title":"Acta Inform."},{"key":"831_CR4","doi-asserted-by":"publisher","DOI":"10.1155\/2018\/9472075","author":"J Wang","year":"2018","unstructured":"Wang J, Gao Y, Yin X, Li F, Kim H (2018) An enhanced PEGASIS algorithm with mobile sink support for wireless sensor networks. Wirel. Commun. Mob. Comput. (2018). https:\/\/doi.org\/10.1155\/2018\/9472075","journal-title":"Wirel. Commun. Mob. Comput."},{"issue":"12","key":"831_CR5","doi-asserted-by":"publisher","first-page":"2247","DOI":"10.1109\/TPAMI.2007.70711","volume":"29","author":"L Gorelick","year":"2007","unstructured":"Gorelick, L., Blank, M., Shechtman, E., Irani, M., Basri, R.: Actions as space\u2013time shapes. TPAMI 29(12), 2247\u20132253 (2007)","journal-title":"TPAMI"},{"key":"831_CR6","unstructured":"Jia, K., Yeung, D.-Y.: Human action recognition using local spatio-temporal discriminant embedding. In CVPR, p. 1 (2008)"},{"key":"831_CR7","doi-asserted-by":"crossref","unstructured":"Klaeser, A., Marszalek, M., Schmid, C.: A spatio-temporal descriptor based on 3d-gradients. In: BMVC, p. 1 (2008)","DOI":"10.5244\/C.22.99"},{"issue":"5","key":"831_CR8","first-page":"8","volume":"1","author":"H Wang","year":"2013","unstructured":"Wang, H., Schmid, C.: Action recognition with improved trajectories. ICCV 1(5), 8 (2013)","journal-title":"ICCV"},{"issue":"2\u20133","key":"831_CR9","first-page":"5","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev, I.: On space\u2013-time interest points. IJCV 64(2\u20133), 5 (2005)","journal-title":"IJCV"},{"key":"831_CR10","doi-asserted-by":"publisher","first-page":"4651","DOI":"10.1007\/s11277-017-4743-9","volume":"97","author":"Z Xia","year":"2017","unstructured":"Xia, Z., Hu, Z., Luo, J.: UPTP vehicle trajectory prediction based on user preference under complexity environment. Wirel. Pers. Commun. 97, 4651\u20134665 (2017). https:\/\/doi.org\/10.1007\/s11277-017-4743-9","journal-title":"Wirel. Pers. Commun."},{"issue":"1","key":"831_CR11","doi-asserted-by":"publisher","first-page":"321","DOI":"10.32604\/cmc.2020.06130","volume":"62","author":"S He","year":"2020","unstructured":"He, S., Li, Z., Tang, Y., Liao, Z., Li, F., Lim, S-J.: Parameters compressing in deep learning. CMC 62(1), 321\u2013336 (2020)","journal-title":"CMC"},{"key":"831_CR12","doi-asserted-by":"publisher","first-page":"1722","DOI":"10.1007\/s11036-018-1049-4","volume":"24","author":"Q Tang","year":"2019","unstructured":"Tang, Q., Xie, M.Z., Yang, K., Yuansheng, L. Dongdai, Z. Yun, S.: A decision function based smart charging and discharging strategy for electric vehicle in smart grid. Mob. Netw. Appl. 24, 1722\u20131731 (2019)","journal-title":"Mob. Netw. Appl."},{"issue":"1","key":"831_CR13","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"X Ji","year":"2013","unstructured":"Ji, X., Xu, W., Yang, M., Yu, K.: 3d convolutional neural networks for human action recognition. IEEE Trans. Pattern Anal. Mach. Intell. 35(1), 221\u2013231 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"831_CR14","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: NPIS, pp. 1097\u20131105 (2012)"},{"key":"831_CR15","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T.; Sukthankar, R.: Largescale video classification with convolutional neural networks. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 1725\u20131732 (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"831_CR16","doi-asserted-by":"publisher","first-page":"171","DOI":"10.1007\/s11554-017-0727-y","volume":"14","author":"M Long","year":"2018","unstructured":"Long, M., Peng, F., Li, H.: Separable reversible data hiding and encryption for HEVC video. J. Real Time Image Proc. 14, 171\u2013182 (2018)","journal-title":"J. Real Time Image Proc."},{"key":"831_CR17","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., FeiFei, L.: ImageNet: a large-scale hierarchical image database. In: CVPR, pp. 248\u2013255 (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"831_CR18","doi-asserted-by":"crossref","unstructured":"Zhang, J., Jin, X., Sun, J., Wang, J., Arun, K.S.: Spatial and semantic convolutional features for robust visual object tracking. In: Multimedia Tools and Applications, pp. 15095\u201315115 (2020)","DOI":"10.1007\/s11042-018-6562-8"},{"key":"831_CR19","doi-asserted-by":"crossref","unstructured":"Gui, Y., Zeng, G.: Joint learning of visual and spatial features for edit propagation from a single image. In: The Visual Computer, pp. 36:469\u2013482 (2019)","DOI":"10.1007\/s00371-019-01633-6"},{"key":"831_CR20","unstructured":"Simonyan, K.; Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in Neural Information Processing Systems, pp. 568\u2013576 (2014)"},{"key":"831_CR21","doi-asserted-by":"crossref","unstructured":"Wang, L.M., Xiong, Y.J., Wang, Z., Qiao, Y., Lin, D.H.O., et al.: Temporal segment networks: towards good practices for deep action recognition. In: European Conference on Computer Vision, pp. 20\u201336 (2016)","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"831_CR22","doi-asserted-by":"crossref","unstructured":"Liu, W., Anguelov, D., Erhan, D., Christian, S., Scott R., Cheng-Yang F., Alexander C.: SSD: Single Shot MultiBox Detector. In: European Conference on Computer Vision, pp. 21\u201337 (2016)","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"831_CR23","doi-asserted-by":"crossref","unstructured":"Dalal, N.F., Triggs, B.S.: Histograms of oriented gradients for human detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition 2005. USA: IEEE, pp. 886\u2013893 (2005)","DOI":"10.1109\/CVPR.2005.177"},{"key":"831_CR24","doi-asserted-by":"crossref","unstructured":"Laptev, I., Marszalek, M., Schmid, C., Rozenfeld, B.: Learning realistic human actions from movies. In: IEEE Conference on Computer Vision and Pattern Recognition, Anchorage, AK, pp. 1\u20138 (2008)","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"831_CR25","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Palur, M.: Learning spatiotemporal features with 3D convolutional networks. In: 2015 IEEE International Conference on Computer Vision (ICCV), Santiago, pp. 4489\u20134497 (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"831_CR26","doi-asserted-by":"crossref","unstructured":"Tran, D., Wang, H., Torresani, L., Ray, J., LeCun, Y., Paluri, M.: A closer look at spatiotemporal convolutions for action recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 6450\u20136459 (2018)","DOI":"10.1109\/CVPR.2018.00675"},{"key":"831_CR27","doi-asserted-by":"crossref","unstructured":"Qiu, Z., Yao, T., Mei, T.: Learning spatio-temporal representation with pseudo-3D residual networks (2017). arXiv:1711.10305","DOI":"10.1109\/ICCV.2017.590"},{"key":"831_CR28","doi-asserted-by":"crossref","unstructured":"Li, C., Zhong, Q., Xie, D, et al.: Collaborative spatio-temporal feature learning for video action recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE (2019)","DOI":"10.1109\/CVPR.2019.00806"},{"key":"831_CR29","doi-asserted-by":"crossref","unstructured":"Peng, Y.X., Zhao, Y.Z., Zhang, J.C.: Two-stream collaborative learning with spatial-temporal attention for video classification. In: IEEE Transactions on Circuits and Systems for Video Technology, vol. 29, no. 3, pp. 773\u2013786 (2018)","DOI":"10.1109\/TCSVT.2018.2808685"},{"issue":"4","key":"831_CR30","first-page":"5","volume":"2","author":"J Carreira","year":"2017","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition?a new model and the kinetics dataset. CVPR 2(4), 5 (2017)","journal-title":"CVPR"},{"key":"831_CR31","doi-asserted-by":"crossref","unstructured":"Sun, S., Kuang, Z, Ouyang, W., Sheng, L., Zhang, W: Optical flow guided feature: a fast and robust motion representation for video action recognition (2017). arXiv:1711.11152","DOI":"10.1109\/CVPR.2018.00151"},{"key":"831_CR32","doi-asserted-by":"crossref","unstructured":"Fischer, P., Dosovitskiy, A., Ilg, E., Husser, P., Hazrba, C., Golkov, V., van der Smagt, P., Cremers, D., Brox, T.: FlowNet: learning optical flow with convolutional networks. In: International Conference on Computer Vision (ICCV) (2015)","DOI":"10.1109\/ICCV.2015.316"},{"key":"831_CR33","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Lan, Z.Z., Newsam, S., XHauptmann, S: Hidden two-stream convolutional networks for action recognition. In: Asian Conference on Computer Vision, pp. 363\u2013378 (2018)","DOI":"10.1007\/978-3-030-20893-6_23"},{"key":"831_CR34","doi-asserted-by":"crossref","unstructured":"Piergiovanni, A., Ryoo, M.S: Representation flow for action recognition (2018). arXiv:1810.01455","DOI":"10.1109\/CVPR.2019.01018"},{"key":"831_CR35","unstructured":"Mnih, V.F., Heess, N.S.: Recurrent models of visual attention. In: Advances in Neural Information Processing Systems, NIPS (2014)"},{"issue":"2","key":"831_CR36","first-page":"575","volume":"59","author":"ZW Qu","year":"2019","unstructured":"Qu, Z.W., Cao, B.Y., Wang, X.R., Li, F., Xu, P.R., et al.: Feedback lstm network based on attention for image description generator. Comput. Mater. Contin. 59(2), 575\u2013589 (2019)","journal-title":"Comput. Mater. Contin."},{"key":"831_CR37","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L., Polosukhin, I.: Attention is all you need. In: Neural Information Processing Systems (NIPS) (2017)"},{"key":"831_CR38","doi-asserted-by":"crossref","unstructured":"Zhao, Z., Elgammal, A.M.: Information theoretic key frame selection for action recognition. In: British Machine Vision Conference (BMVC), pp. 1\u201310 (2008)","DOI":"10.5244\/C.22.109"},{"issue":"7","key":"831_CR39","doi-asserted-by":"publisher","first-page":"1810","DOI":"10.1016\/j.patcog.2012.10.004","volume":"46","author":"L Liu","year":"2013","unstructured":"Liu, L., Shao, L., Rockett, P.: Boosted key-frame selection and correlated pyramidal motion-feature representation for human action recognition. Pattern Recogn. 46(7), 1810\u20131818 (2013)","journal-title":"Pattern Recogn."},{"key":"831_CR40","unstructured":"Santoro, A., Raposo, D., Barrett, D.G., Malinowski, M., Pascanu, R., Battaglia,P., Lillicrap, T.: A simple neural network module for relational reasoning (2017). arXiv:1706.01427"},{"key":"831_CR41","doi-asserted-by":"crossref","unstructured":"Zhou, B., Andonian, A., Oliva, A., Torralba, A.: Temporal relational reasoning in videos (2017). arXiv:1711.08496","DOI":"10.1007\/978-3-030-01246-5_49"},{"key":"831_CR42","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition[J] (2014). arXiv:1409.1556"},{"key":"831_CR43","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., et al.: Deep residual learning for image recognition[J] (2015). arXiv:1512.03385","DOI":"10.1109\/CVPR.2016.90"},{"key":"831_CR44","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., He, K.: Non-local neural networks. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00813"},{"key":"831_CR45","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: UCF101: a dataset of 101 human actions classes from videos in the wild[J] (2012). arXiv:1212.0402"},{"key":"831_CR46","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: Hmdb: a large video database for human motion recognition. International Conference on Computer Vision, pp. 2556\u20132563 (2011)","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"831_CR47","doi-asserted-by":"crossref","unstructured":"Cai, Z.W., Wang, L.M., Peng, X.J.: Qiao, Y.: Multi-view super vector for action recognition. IEEE Conference on Computer Vision and Pattern Recognition, pp. 596\u2013603 (2014)","DOI":"10.1109\/CVPR.2014.83"},{"key":"831_CR48","doi-asserted-by":"crossref","unstructured":"Kantorov, V., Laptev, I.: Efficient feature extraction, encoding and classification for action recognition. IEEE Conference on Computer Vision and Pattern Recognition, pp. 2593\u20132600 (2014)","DOI":"10.1109\/CVPR.2014.332"},{"key":"831_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, B.W., Wang, L.M, Wang, Z., Qiao, Y., Wang, H.L.: Real-time action recognition with enhanced motion vector CNNs. IEEE Conference on Computer Vision and Pattern Recognition, pp. 2718\u20132726 (2016)","DOI":"10.1109\/CVPR.2016.297"},{"key":"831_CR50","doi-asserted-by":"crossref","unstructured":"Diba, A. et al.: Spatio-temporal channel correlation networks for action classification. In: Computer Vision\u2014ECCV 2018, vol. 11208, pp. 299\u2013315 (2018)","DOI":"10.1007\/978-3-030-01225-0_18"},{"key":"831_CR51","doi-asserted-by":"crossref","unstructured":"Jiang, B., Wang, M., Gan, W., Wu, W.: STM: spatio-temporal and motion encoding for action recognition. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00209"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-021-00831-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-021-00831-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-021-00831-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,4]],"date-time":"2024-09-04T04:39:36Z","timestamp":1725424776000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-021-00831-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,7,14]]},"references-count":51,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2022,12]]}},"alternative-id":["831"],"URL":"https:\/\/doi.org\/10.1007\/s00530-021-00831-4","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"type":"print","value":"0942-4962"},{"type":"electronic","value":"1432-1882"}],"subject":[],"published":{"date-parts":[[2021,7,14]]},"assertion":[{"value":"19 January 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 July 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 July 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}