{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,7]],"date-time":"2026-04-07T07:40:31Z","timestamp":1775547631551,"version":"3.50.1"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2023,12,19]],"date-time":"2023-12-19T00:00:00Z","timestamp":1702944000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,12,19]],"date-time":"2023-12-19T00:00:00Z","timestamp":1702944000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key R&D Program of China","doi-asserted-by":"crossref","award":["2022YFB2602203"],"award-info":[{"award-number":["2022YFB2602203"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2024,11]]},"DOI":"10.1007\/s00371-023-03205-1","type":"journal-article","created":{"date-parts":[[2023,12,19]],"date-time":"2023-12-19T12:02:29Z","timestamp":1702987349000},"page":"7747-7759","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Local motion feature extraction and spatiotemporal attention mechanism for action recognition"],"prefix":"10.1007","volume":"40","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9841-9624","authenticated-orcid":false,"given":"Xiaogang","family":"Song","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongdong","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Liang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Min","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinhong","family":"Hei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,12,19]]},"reference":[{"key":"3205_CR1","volume":"32","author":"J Imen","year":"2020","unstructured":"Imen, J., Anouar, B.K., Ihsen, A., Mohamed, A.M.: Vision-based human action recognition: an overview and real world challenges. Forens. Sci. Int. Digit. Investig. 32, 200901 (2020)","journal-title":"Forens. Sci. Int. Digit. Investig."},{"key":"3205_CR2","doi-asserted-by":"crossref","unstructured":"Piergiovanni, A., Ryoo, M.S.: Representation flow for action recognition. In: 2019 IEEE Conference on Computer Vision and Pattern Recognition, pp. 9937\u20139945. IEEE (2019)","DOI":"10.1109\/CVPR.2019.01018"},{"issue":"3","key":"3205_CR3","doi-asserted-by":"publisher","first-page":"257","DOI":"10.1109\/34.910878","volume":"23","author":"A Bobick","year":"2001","unstructured":"Bobick, A., Davis, J.: The recognition of human movement using temporal templates. IEEE Trans. Pattern Anal. Mach. Intell. 23(3), 257\u2013267 (2001)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3205_CR4","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev, I.: On space-time interest points. Int. J. Comput. Vision 64, 107\u2013123 (2005)","journal-title":"Int. J. Comput. Vision"},{"key":"3205_CR5","doi-asserted-by":"crossref","unstructured":"Fujiyoshi, H., Lipton, A.: Real-time human motion analysis by image skeletonization. In: Fourth IEEE Workshop on Applications of Computer Vision, pp. 15\u201321. IEEE (1998)","DOI":"10.1109\/ACV.1998.732852"},{"issue":"5","key":"3205_CR6","doi-asserted-by":"publisher","first-page":"2191","DOI":"10.1007\/s00371-022-02473-7","volume":"39","author":"ZX Qiu","year":"2022","unstructured":"Qiu, Z.X., Zhang, H.B., Deng, W.M., Du, J.X., Lei, Q., Zhang, G.L.: Effective skeleton topology and semantics-guided adaptive graph convolution network for action recognition. Vis. Comput. 39(5), 2191\u20132203 (2022)","journal-title":"Vis. Comput."},{"key":"3205_CR7","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: The 27th International Conference on Neural Information Processing Systems, pp. 568\u2013576. MIT Press (2014)"},{"key":"3205_CR8","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: 2015 IEEE International Conference on Computer Vision, pp. 4489\u20134497. IEEE (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"3205_CR9","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., Van Gool, L.: Temporal segment networks: towards good practices for deep action recognition. In: 2016 European Conference on Computer Vision, pp. 20\u201336. Springer (2016)","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"3205_CR10","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? A new model and the kinetics dataset. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, pp. 4724\u20134733. IEEE (2017)","DOI":"10.1109\/CVPR.2017.502"},{"issue":"7","key":"3205_CR11","doi-asserted-by":"publisher","first-page":"1821","DOI":"10.1007\/s00371-020-01940-3","volume":"37","author":"A Abdelbaky","year":"2021","unstructured":"Abdelbaky, A., Aly, S.: Two-stream spatiotemporal feature fusion for human action recognition. Vis. Comput. 37(7), 1821\u20131835 (2021)","journal-title":"Vis. Comput."},{"key":"3205_CR12","first-page":"1","volume":"2022","author":"K Fei","year":"2022","unstructured":"Fei, K., Wang, C., Zhang, J., Liu, Y., Xie, X., Tu, Z.: Flow-pose Net: an effective two-stream network for fall detection. Vis. Comput. 2022, 1\u201316 (2022)","journal-title":"Vis. Comput."},{"issue":"1","key":"3205_CR13","doi-asserted-by":"publisher","first-page":"185","DOI":"10.1016\/0004-3702(81)90024-2","volume":"17","author":"BK Horn","year":"1981","unstructured":"Horn, B.K., Schunck, B.G.: Determining optical flow. Artif. Intell. 17(1), 185\u2013203 (1981)","journal-title":"Artif. Intell."},{"key":"3205_CR14","doi-asserted-by":"crossref","unstructured":"Sun, D., Roth, S., Black, M.J.: Secrets of optical flow estimation and their principles. In: 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp. 2432\u20132439. IEEE (2010)","DOI":"10.1109\/CVPR.2010.5539939"},{"key":"3205_CR15","doi-asserted-by":"crossref","unstructured":"Dosovitskiy, A., Fischer, P., Ilg, E., H\u00e4usser, P., Hazirbas, C., Golkov, V., Smagt, P.v.d., Cremers, D., Brox, T.: Flownet: Learning optical flow with convolutional networks. In: 2015 IEEE International Conference on Computer Vision, pp. 2758\u20132766. IEEE (2015)","DOI":"10.1109\/ICCV.2015.316"},{"key":"3205_CR16","doi-asserted-by":"crossref","unstructured":"Ilg, E., Mayer, N., Saikia, T., Keuper, M., Dosovitskiy, A., Brox, T.: Flownet 2.0: Evolution of optical flow estimation with deep networks. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, pp. 1647\u20131655. IEEE (2017)","DOI":"10.1109\/CVPR.2017.179"},{"key":"3205_CR17","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Lan, Z., Newsam, S., Hauptmann, A.: Hidden two-stream convolutional networks for action recognition. In: 2018 Asian Conference on Computer Vision, pp. 363\u2013378. Springer (2019)","DOI":"10.1007\/978-3-030-20893-6_23"},{"key":"3205_CR18","doi-asserted-by":"crossref","unstructured":"Crasto, N., Weinzaepfel, P., Alahari, K., Schmid, C.: Mars: Motion-augmented rgb stream for action recognition. In: 2019 IEEE Conference on Computer Vision and Pattern Recognition, pp. 7874\u20137883. IEEE (2019)","DOI":"10.1109\/CVPR.2019.00807"},{"key":"3205_CR19","doi-asserted-by":"crossref","unstructured":"Lu, Y., Wang, Q., Ma, S., Geng, T., Chen, Y.V., Chen, H., Liu, D.: Transflow: Transformer as flow learner. In: 2023 IEEE Conference on Computer Vision and Pattern Recognition. pp. 18063\u201318073. IEEE (2023)","DOI":"10.1109\/CVPR52729.2023.01732"},{"key":"3205_CR20","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., He, K.: Non-local neural networks. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, pp. 7794\u20137803. IEEE (2018)","DOI":"10.1109\/CVPR.2018.00813"},{"key":"3205_CR21","doi-asserted-by":"crossref","unstructured":"Liu, Z., Luo, D., Wang, Y., Wang, L., Tai, Y., Wang, C., Li, J., Huang, F., Lu, T.: TEINet: Towards an efficient architecture for video recognition. In: The AAAI Conference on Artificial Intelligence, vol. 34(07), pp. 11669\u201311676 (2020)","DOI":"10.1609\/aaai.v34i07.6836"},{"key":"3205_CR22","doi-asserted-by":"crossref","unstructured":"Li, Y., Ji, B., Shi, X., Zhang, J., Kang, B., Wang, L.: Tea: Temporal excitation and aggregation for action recognition. In: 2020 IEEE Conference on Computer Vision and Pattern Recognition, pp. 906\u2013915. IEEE (2020)","DOI":"10.1109\/CVPR42600.2020.00099"},{"key":"3205_CR23","doi-asserted-by":"crossref","unstructured":"Wang, L., Tong, Z., Ji, B., Wu, G.: Tdn: Temporal difference networks for efficient action recognition. In: 2021 IEEE Conference on Computer Vision and Pattern Recognition, pp. 1895\u20131904. IEEE (2021)","DOI":"10.1109\/CVPR46437.2021.00193"},{"key":"3205_CR24","doi-asserted-by":"publisher","first-page":"5484","DOI":"10.1109\/TIP.2022.3196175","volume":"31","author":"T Geng","year":"2022","unstructured":"Geng, T., Zheng, F., Hou, X., Lu, K., Qi, G.-J., Shao, L.: Spatial-temporal pyramid graph reasoning for action recognition. IEEE Trans. Image Process. 31, 5484\u20135497 (2022)","journal-title":"IEEE Trans. Image Process."},{"key":"3205_CR25","doi-asserted-by":"publisher","first-page":"118388","DOI":"10.1109\/ACCESS.2019.2936628","volume":"7","author":"H Sang","year":"2019","unstructured":"Sang, H., Zhao, Z., He, D.: Two-level attention model based video action recognition network. IEEE Access. 7, 118388\u2013118401 (2019)","journal-title":"IEEE Access."},{"issue":"9","key":"3205_CR26","doi-asserted-by":"publisher","first-page":"1771","DOI":"10.1007\/s00371-019-01770-y","volume":"36","author":"Y Zhu","year":"2020","unstructured":"Zhu, Y., Liu, G.: Fine-grained action recognition using multi-view attentions. Vis. Comput. 36(9), 1771\u20131781 (2020)","journal-title":"Vis. Comput."},{"key":"3205_CR27","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.108797","volume":"130","author":"W Dong","year":"2022","unstructured":"Dong, W., Zhang, Z., Song, C., Tan, T.: Identifying the key frames: an attention-aware sampling method for action recognition. Pattern Recognit. 130, 108797 (2022)","journal-title":"Pattern Recognit."},{"key":"3205_CR28","doi-asserted-by":"publisher","first-page":"338","DOI":"10.1016\/j.neucom.2021.06.088","volume":"459","author":"J Li","year":"2021","unstructured":"Li, J., Wei, P., Zheng, N.: Nesting spatiotemporal attention networks for action recognition. Neurocomputing 459, 338\u2013348 (2021)","journal-title":"Neurocomputing"},{"key":"3205_CR29","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2021.108068","volume":"119","author":"J Kim","year":"2021","unstructured":"Kim, J., Li, G., Yun, I., Jung, C., Kim, J.: Weakly-supervised temporal attention 3d network for human action recognition. Pattern Recognit. 119, 108068 (2021)","journal-title":"Pattern Recognit."},{"key":"3205_CR30","doi-asserted-by":"crossref","unstructured":"Yan, L., Wang, Q., Cui, Y., Feng, F., Quan, X., Zhang, X., Liu, D.: GL-RG: global-local representation granularity for video captioning. In: 2022 International Joint Conference on Artificial Intelligence. (2022).","DOI":"10.24963\/ijcai.2022\/384"},{"key":"3205_CR31","doi-asserted-by":"crossref","unstructured":"Cui, Y., Yan, L., Cao, Z., Liu, D.: Tf-blender: Temporal feature blender for video object detection. In: 2021 IEEE International Conference on Computer Vision. pp. 8138\u20138147. IEEE (2021)","DOI":"10.1109\/ICCV48922.2021.00803"},{"key":"3205_CR32","doi-asserted-by":"crossref","unstructured":"Lin, J., Gan, C., Han, S.: Tsm: Temporal shift module for efficient video understanding. In: 2019 IEEE International Conference on Computer Vision, pp. 7082\u20137092. IEEE (2019)","DOI":"10.1109\/ICCV.2019.00718"},{"key":"3205_CR33","doi-asserted-by":"crossref","unstructured":"Dai, J., Qi, H., Xiong, Y., Li, Y., Zhang, G., Hu, H., Wei, Y.: Deformable convolutional networks. In: 2017 IEEE International Conference on Computer Vision, pp. 764\u2013773. IEEE (2017)","DOI":"10.1109\/ICCV.2017.89"},{"key":"3205_CR34","unstructured":"Geng, Z., Guo, M.-H., Chen, H., Li, X., Wei, K., Lin, Z.: Is attention better than matrix decomposition? In: 2021 International Conference on Learning Representations (2021)"},{"key":"3205_CR35","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132\u20137141. IEEE (2018)","DOI":"10.1109\/CVPR.2018.00745"},{"key":"3205_CR36","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: UCF101: A dataset of 101 human actions classes from videos in the wild. CoRR arXiv:1212.0402 (2012)"},{"key":"3205_CR37","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: Hmdb: A large video database for human motion recognition. In: 2011 IEEE International Conference on Computer Vision, pp. 2556\u20132563. IEEE (2011)","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"3205_CR38","doi-asserted-by":"crossref","unstructured":"Goyal, R., Kahou, S. E., Michalski, V., Materzynska, J., Westphal, S., Kim, H., Haenel, V., Fruend, I., Yianilos, P., Mueller-Freitag, M., Hoppe, F., Thurau, C., Bax, I., Memisevic, R.: The \u201csomething something\u201d video database for learning and evaluating visual common sense. In: 2017 IEEE International Conference on Computer Vision, pp. 5843\u20135851. IEEE (2017)","DOI":"10.1109\/ICCV.2017.622"},{"key":"3205_CR39","unstructured":"Xie, Z., Sato, I., Sugiyama, M.: A diffusion theory for deep learning dynamics: stochastic gradient descent exponentially favors flat minima. In: International Conference on Learning Representations (2021)"},{"key":"3205_CR40","doi-asserted-by":"crossref","unstructured":"Diba, A., Fayyaz, M., Sharma, V., Arzani, M. M., Yousefzadeh, R., Gall, J., Van Gool, L.: Spatio-temporal channel correlation networks for action classification. In: 2018 European Conference on Computer Vision, pp. 299\u2013315. Springer (2018)","DOI":"10.1007\/978-3-030-01225-0_18"},{"key":"3205_CR41","doi-asserted-by":"crossref","unstructured":"Zolfaghari, M., Singh, K., Brox, T.: Eco: Efficient convolutional network for online video understanding. In: 2018 European Conference on Computer Vision, pp. 713\u2013730. Springer (2018)","DOI":"10.1007\/978-3-030-01216-8_43"},{"key":"3205_CR42","doi-asserted-by":"crossref","unstructured":"Wang, L., Li, W., Li, W., Van Gool, L.: Appearance-and-relation networks for video classification. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, pp. 1430\u20131439. IEEE (2018)","DOI":"10.1109\/CVPR.2018.00155"},{"issue":"2","key":"3205_CR43","doi-asserted-by":"publisher","first-page":"539","DOI":"10.1007\/s00371-021-02355-4","volume":"39","author":"G Zhang","year":"2023","unstructured":"Zhang, G., Huang, G., Chen, H., Pun, C.-M., Yu, Z., Ling, W.-K.: Video action recognition with key-detail motion capturing based on motion spectrum analysis and multiscale feature fusion. Vis. Comput. 39(2), 539\u2013556 (2023)","journal-title":"Vis. Comput."},{"key":"3205_CR44","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, pp. 2921\u20132929. IEEE (2016)","DOI":"10.1109\/CVPR.2016.319"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-023-03205-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-023-03205-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-023-03205-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,6]],"date-time":"2024-11-06T16:10:17Z","timestamp":1730909417000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-023-03205-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,19]]},"references-count":44,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2024,11]]}},"alternative-id":["3205"],"URL":"https:\/\/doi.org\/10.1007\/s00371-023-03205-1","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,12,19]]},"assertion":[{"value":"17 November 2023","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 December 2023","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}